Модели GigaNotes
GigaNotes — приложение для macOS на Apple Silicon: расшифровка встреч с разметкой голосов прямо на Mac. Звук никуда не отправляется; из сети приложение один раз берёт этот набор моделей.
Вручную здесь ничего качать не нужно. Приложение скачивает набор при первом запуске, продолжает с места обрыва и сверяет каждый файл с SHA-256 из своего списка, потом готовит модели под этот Mac.
English: model bundle for GigaNotes, an on-device meeting transcription app for Apple Silicon Macs (Russian speech recognition with speaker labels). The app downloads and verifies it automatically; nothing to fetch by hand.
Состав — версия 1, 1,07 ГБ
| Модель | Зачем | Размер | Авторы | Лицензия |
|---|---|---|---|---|
| GigaAM v3 e2e RNNT | распознавание русской речи | 449 МБ | SaluteDevices — ai-sage/GigaAM-v3, salute-developers/GigaAM | MIT |
| Nemotron 3 Diarization | кто когда говорит | 398 МБ | NVIDIA — nvidia/Nemotron-3-Diarization | OpenMDW |
| TitaNet Large | векторы голосов: имена между записями | 220 МБ | NVIDIA — nvidia/speakerverification_en_titanet_large | CC-BY-4.0 |
| pyannote segmentation-3.0 | границы речи | 6 МБ | pyannote — pyannote/segmentation-3.0; ONNX — k2-fsa/sherpa-onnx | MIT |
Что изменено против оригиналов
- GigaAM v3 — энкодер переведён в CoreML (fp16, статическая форма 22 с с маской паддинга, считается на нейромодуле); декодер и joint выгружены в плоские fp32-веса для Accelerate; токенизатор и словарь — как у оригинала.
- Nemotron 3 Diarization — сеть одного шага потоковой разметки переведена в CoreML fp32 (видеокарта); мел и кэш голосов считает само приложение, рядом — веса фронтенда.
- TitaNet Large — CoreML fp16 в четырёх формах: 2, 4, 8 и 16 с.
- pyannote segmentation-3.0 — ONNX без изменений, из сборки sherpa-onnx.
Каталоги .mlpackage лежат zip-архивами. Веса не дообучались: это те же модели, только в формате для Mac.
Происхождение и сверка с оригиналами
| Модель | Откуда | Сверка |
|---|---|---|
| GigaAM v3 e2e RNNT | код salute-developers/GigaAM @ 7447938, веса v3_e2e_rnnt |
ONNX fp32 совпадает с torch дословно; энкодер CoreML fp16 с маской паддинга на кусках с паддингом даёт то же, что без него; на вычитанном эталоне созвона (3 716 слов, русская речь) WER fp16 на нейромодуле 7,5% против 7,6% у fp32 на процессоре |
| Nemotron 3 Diarization | веса NeMo из nvidia/Nemotron-3-Diarization | сеть шага CoreML fp32 — до 5·10⁻⁴ от NeMo по вероятностям голосов |
| TitaNet Large | ONNX из NeMo | CoreML fp16 даёт то же разбиение голосов, что ONNX, и держит его во всех 20 проверках с шумом на входе |
| pyannote segmentation-3.0 | ONNX из sherpa-onnx | без изменений |
Целостность
models.json — версия набора, пути, размеры и SHA-256 каждого файла; у архивов ещё и хеш распакованного
дерева, им приложение проверяет уже поставленные модели. Приложение берёт файлы по номеру коммита этого
репозитория, а не по main, так что новая выкладка не меняет того, что качают уже собранные копии.
Лицензии
Каждая модель — под лицензией своих авторов, см. таблицу выше и LICENSE.md. TitaNet Large распространяется под CC-BY-4.0 и требует указания авторства: © NVIDIA Corporation.
Model tree for kirillcustom/giganotes-models
Base model
ai-sage/GigaAM-v3