Diona v2 L

VK Diona

Модели и данные

122B; bf16

Базовая модель

В работе используется языковая модель на основе архитектуры трансформера со смешанными экспертами (MoE). Модель оптимизирована для диалоговых сценариев на русском языке. Архитектурно модель поддерживает длинный контекст до 128K токенов, при этом стабильное тестирование и запуск базовых инференс-сценариев (включая автоматическую конфигурацию vLLM на валидационном железе) выполнялись в пределах 40K токенов

Датасет

Обучение проводится на миксе закрытых и открытых датасетов, который содержит диалоговые примеры в формате сообщений (messages) и Ground Truth, а также preference-пары chosen/rejected ответ для этапа выравнивания.

Метод

SFT, DPO Post-training организован в два этапа. Сначала проводится полный supervised fine-tuning базовой модели на инструктивных данных. Затем выполняется выравнивание методом DPO (Direct Preference Optimization): оптимизация напрямую по preference-парам без отдельной reward-модели, sigmoid-лосс с дополнительным NLL-членом (RPO), что позволяет улучшить качество ответов, не просаживая способности, приобретенные на SFT-этапе.

Архитектура обучения

Обучение организовано в распределённом режиме:

  • Training ноды: Megatron-LM, 8×A100 80GB на ноду
  • SFT: full unfreeze
  • DPO поверх SFT-чекпоинта
  • Инференс и оценка: vLLM

Авторы: VK R&D

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support