RuIntona SER
Collection
Russian Speech Emotion Recognition: RuBERT (text), CNN / CNN-BiLSTM / openSMILE+XGBoost / SVM (audio), HuBERT+RuBERT late fusion (Dusha+RESD). • 6 items • Updated
Четырёхклассовый классификатор эмоций по аудио:
angry, sad, neutral, positive (маппинг angry=0, sad=1, neutral=2, positive=3).
EmotionCNN — CNN (каналы 16/32/64) → классификатор (dropout 0.2).combine_balanced_train (Dusha, mel-спектрограммы).ruintona/data_processing/.Метрики получены оценкой обученного чекпоинта на dusha_resd_test (6616 записей)
в model_analise/audio_models_analise.ipynb.
| Split | Corpus | Accuracy | F1-macro |
|---|---|---|---|
| test | dusha_resd (перекрёстная оценка) | 0.571 | 0.564 |
import torch
from huggingface_hub import hf_hub_download
path = hf_hub_download(
"Natlis/cnn-emotion-classification-ru",
"CNN_combine_balanced_train_model.pt",
)
# Чекпоинт — единый формат dict (utils/model_io.py проекта):
ckpt = torch.load(path, map_location="cpu")
print(ckpt["model_class"], ckpt["model_params"])
Вход — готовые mel-спектрограммы (1, 64, T) из пайплайна проекта.
Архитектура и загрузка — audio_models/CNN/CNN.py.
Полные гиперпараметры — в configs/audio/cnn.json
(epochs 5, batch 16, lr 1e-3, weight_decay 1e-5, seed 42).
Веса лицензированы CC BY-SA 4.0 (модель обучена с нуля на корпусе Dusha).
Полные условия — LICENSE, атрибуция и данные обучения — NOTICE.
Dusha — Kondratenko et al., arXiv:2212.12266. Подробности — DUSHA.md кодового репозитория.