Датасеты для казахского языка

Асель Ермекова собрала Awesome Kazakh Datasets - большую и аккуратно структурированную подборку открытых датасетов с казахским языком. В одном месте собраны данные для:
- NLP и LLM: QA, RAG, instruction tuning, NER, машинный перевод и другие задачи
- speech: ASR, TTS, speech translation, emotion recognition
- computer vision, OCR и multimodal-задач
- NLP и LLM: QA, RAG, instruction tuning, NER, машинный перевод и другие задачи
- speech: ASR, TTS, speech translation, emotion recognition
- computer vision, OCR и multimodal-задач
Для каждого из датасетов указаны размер, масштаб, задача, год релиза и ссылка на скачивание, а отдельно отмечены ресурсы, которые были анонсированы, но пока не удалось независимо проверить.
Такие репозитории сильно упрощают жизнь: вместо нескольких часов поиска можно быстро понять, какие данные по казахскому уже существуют и что можно использовать для своего исследования или продукта.
Если знаете датасет, которого в списке пока нет, репозиторий открыт для contributions:
🔗 https://github.com/Allessyer/awesome-kaz-datasets
Спасибо Асель за эту работу, а также Alen Issayev за вклад в его развитие!
Комментарии
Обсуждение этой новости или вакансии для участников DSML.kz.