Модели GigaNotes

GigaNotes — приложение для macOS на Apple Silicon: расшифровка встреч с разметкой голосов прямо на Mac. Звук никуда не отправляется; из сети приложение один раз берёт этот набор моделей.

Вручную здесь ничего качать не нужно. Приложение скачивает набор при первом запуске, продолжает с места обрыва и сверяет каждый файл с SHA-256 из своего списка, потом готовит модели под этот Mac.

English: model bundle for GigaNotes, an on-device meeting transcription app for Apple Silicon Macs (Russian speech recognition with speaker labels). The app downloads and verifies it automatically; nothing to fetch by hand.

Состав — версия 1, 1,07 ГБ

Модель Зачем Размер Авторы Лицензия
GigaAM v3 e2e RNNT распознавание русской речи 449 МБ SaluteDevices — ai-sage/GigaAM-v3, salute-developers/GigaAM MIT
Nemotron 3 Diarization кто когда говорит 398 МБ NVIDIA — nvidia/Nemotron-3-Diarization OpenMDW
TitaNet Large векторы голосов: имена между записями 220 МБ NVIDIA — nvidia/speakerverification_en_titanet_large CC-BY-4.0
pyannote segmentation-3.0 границы речи 6 МБ pyannote — pyannote/segmentation-3.0; ONNX — k2-fsa/sherpa-onnx MIT

Что изменено против оригиналов

  • GigaAM v3 — энкодер переведён в CoreML (fp16, статическая форма 22 с с маской паддинга, считается на нейромодуле); декодер и joint выгружены в плоские fp32-веса для Accelerate; токенизатор и словарь — как у оригинала.
  • Nemotron 3 Diarization — сеть одного шага потоковой разметки переведена в CoreML fp32 (видеокарта); мел и кэш голосов считает само приложение, рядом — веса фронтенда.
  • TitaNet Large — CoreML fp16 в четырёх формах: 2, 4, 8 и 16 с.
  • pyannote segmentation-3.0 — ONNX без изменений, из сборки sherpa-onnx.

Каталоги .mlpackage лежат zip-архивами. Веса не дообучались: это те же модели, только в формате для Mac.

Происхождение и сверка с оригиналами

Модель Откуда Сверка
GigaAM v3 e2e RNNT код salute-developers/GigaAM @ 7447938, веса v3_e2e_rnnt ONNX fp32 совпадает с torch дословно; энкодер CoreML fp16 с маской паддинга на кусках с паддингом даёт то же, что без него; на вычитанном эталоне созвона (3 716 слов, русская речь) WER fp16 на нейромодуле 7,5% против 7,6% у fp32 на процессоре
Nemotron 3 Diarization веса NeMo из nvidia/Nemotron-3-Diarization сеть шага CoreML fp32 — до 5·10⁻⁴ от NeMo по вероятностям голосов
TitaNet Large ONNX из NeMo CoreML fp16 даёт то же разбиение голосов, что ONNX, и держит его во всех 20 проверках с шумом на входе
pyannote segmentation-3.0 ONNX из sherpa-onnx без изменений

Целостность

models.json — версия набора, пути, размеры и SHA-256 каждого файла; у архивов ещё и хеш распакованного дерева, им приложение проверяет уже поставленные модели. Приложение берёт файлы по номеру коммита этого репозитория, а не по main, так что новая выкладка не меняет того, что качают уже собранные копии.

Лицензии

Каждая модель — под лицензией своих авторов, см. таблицу выше и LICENSE.md. TitaNet Large распространяется под CC-BY-4.0 и требует указания авторства: © NVIDIA Corporation.

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for kirillcustom/giganotes-models

Quantized
(29)
this model