Датасеты для казахского языка

Открыть в Telegram
Датасеты для казахского языка
Асель Ермекова собрала Awesome Kazakh Datasets - большую и аккуратно структурированную подборку открытых датасетов с казахским языком. В одном месте собраны данные для:
- NLP и LLM: QA, RAG, instruction tuning, NER, машинный перевод и другие задачи
- speech: ASR, TTS, speech translation, emotion recognition
- computer vision, OCR и multimodal-задач

Для каждого из датасетов указаны размер, масштаб, задача, год релиза и ссылка на скачивание, а отдельно отмечены ресурсы, которые были анонсированы, но пока не удалось независимо проверить.

Такие репозитории сильно упрощают жизнь: вместо нескольких часов поиска можно быстро понять, какие данные по казахскому уже существуют и что можно использовать для своего исследования или продукта.

Если знаете датасет, которого в списке пока нет, репозиторий открыт для contributions:
🔗 https://github.com/Allessyer/awesome-kaz-datasets

Спасибо Асель за эту работу, а также Alen Issayev за вклад в его развитие!

Обсудить · 02

Комментарии

Обсуждение этой новости или вакансии для участников DSML.kz.

Проверяем вход...