Diona v1 M
VK Diona
Модели и данные
35B; bf16
Базовая модель
В работе используется языковая модель на основе архитектуры трансформера со смешанными экспертами (MoE). Модель оптимизирована для диалоговых сценариев на русском языке. Архитектурно модель нативно поддерживает длинный контекст до 262K токенов, при этом стабильное тестирование и запуск базовых инференс-сценариев (включая автоматическую конфигурацию vLLM на валидационном железе) выполнялись в пределах 40K токенов.
Датасет
Обучение проводится на миксе закрытых и открытых датасетов, который содержит диалоговые примеры в формате сообщений (messages) и Ground Truth, а также preference-пары chosen/rejected ответ для этапа выравнивания.
Метод
SFT, DPO Post-training организован в два этапа. Сначала проводится полный supervised fine-tuning базовой модели на инструктивных данных. Затем выполняется выравнивание методом DPO (Direct Preference Optimization): оптимизация напрямую по preference-парам без отдельной reward-модели, sigmoid-лосс с дополнительным NLL-членом (RPO), что позволяет улучшить качество ответов, не просаживая способности, приобретенные на SFT-этапе.
Архитектура обучения
Обучение организовано в распределённом режиме:
- Training ноды: Megatron-LM, 8×A100 80GB на ноду
- SFT: full unfreeze
- DPO поверх SFT-чекпоинта
- Инференс и оценка: vLLM
Авторы: VK R&D