Early language and speech models tracing the organization’s release history. Ранние языковые и речевые модели для истории публикаций организации.
AI & ML interests
None defined yet.
Recent Activity
Models and annotated data for morphology, segmentation and POS tagging. Модели и разметка для морфологии, сегментации и частеречной разметки.
Web text, crawls and archived sources for pretraining corpora. Веб-тексты, обходы сайтов и архивные источники для корпусов предобучения.
Tokenizer artifacts and vocabulary data for Kazakh model training. Tokenizer и словарные данные для обучения моделей казахского языка.
Kazakh correction models and training data for GEC comparison. Модели коррекции казахского текста и данные для сравнения GEC.
Kazakh-only base, instruct and GEC models for researchers and developers. Базовые, instruct- и GEC-модели только для казахского языка.
Terminology extraction models, datasets and evaluations for Kazakh NLP. Модели, датасеты и оценки для извлечения казахской терминологии.
Audio data, ASR models and OCR tools for speech and document pipelines. Аудиоданные, ASR-модели и OCR-инструменты для речи и документов.
Instruction data for QA, summarization, classification and generation. Данные инструкций для вопросов, суммаризации, классификации и генерации.
Linked pretraining, SFT and GEC artifacts for the exp080–exp085 sequence. Связанные артефакты предобучения, SFT и GEC для цепочки exp080–exp085.
Kazakh-first multilingual models for text generation and correction. Многоязычные модели с приоритетом казахского для генерации и коррекции.
Core datasets for pretraining, instruction tuning, speech and language tasks. Основные датасеты для предобучения, инструкций, речи и языковых задач.
Early language and speech models tracing the organization’s release history. Ранние языковые и речевые модели для истории публикаций организации.
Terminology extraction models, datasets and evaluations for Kazakh NLP. Модели, датасеты и оценки для извлечения казахской терминологии.
Models and annotated data for morphology, segmentation and POS tagging. Модели и разметка для морфологии, сегментации и частеречной разметки.
Audio data, ASR models and OCR tools for speech and document pipelines. Аудиоданные, ASR-модели и OCR-инструменты для речи и документов.
Web text, crawls and archived sources for pretraining corpora. Веб-тексты, обходы сайтов и архивные источники для корпусов предобучения.
Instruction data for QA, summarization, classification and generation. Данные инструкций для вопросов, суммаризации, классификации и генерации.
Tokenizer artifacts and vocabulary data for Kazakh model training. Tokenizer и словарные данные для обучения моделей казахского языка.
Linked pretraining, SFT and GEC artifacts for the exp080–exp085 sequence. Связанные артефакты предобучения, SFT и GEC для цепочки exp080–exp085.
Kazakh correction models and training data for GEC comparison. Модели коррекции казахского текста и данные для сравнения GEC.
Kazakh-first multilingual models for text generation and correction. Многоязычные модели с приоритетом казахского для генерации и коррекции.
Kazakh-only base, instruct and GEC models for researchers and developers. Базовые, instruct- и GEC-модели только для казахского языка.
Core datasets for pretraining, instruction tuning, speech and language tasks. Основные датасеты для предобучения, инструкций, речи и языковых задач.