lyr-asr-pt-streaming
ポルトガル語 streaming ASR の ONNX モデル。LYR アプリ専用。
| file | size |
|---|---|
encoder.int8.onnx |
155 MB |
decoder.onnx |
3.1 MB |
joiner.int8.onnx |
0.52 MB |
tokens.txt |
10 KB |
icefall egs/yodas_pt/ASR の streaming zipformer (transducer)。
20 epoch 学習し、ep16–20 の平均 (avg5) を採用。
トークナイザは BPE 1000 (韓国語版の char とは異なる。ラテン文字では
1 文字あたりの情報量が小さく、char だとラベル長がフレーム数を超えて
整列が存在しなくなるため)。
精度
held-out の test 211 発話 (91.7 分、学習から除外した 400 動画由来)。 比較対象は同一発話・同一 int8・同一設定で測り直した値。
| model | WER (micro) | CER (micro) | size | RTF p50 |
|---|---|---|---|---|
| これ (avg5) | 0.1318 | 0.0607 | 159 MB | 0.075 |
| nvidia nemotron-3.5-asr-streaming-0.6b (560ms int8) | 0.2068 | 0.1055 | 682 MB | 0.189 |
動画単位 paired bootstrap 10,000 回で差 −0.0749、95% CI [−0.0844, −0.0657] (有意)。数字を含む発話でも WER 0.1319 と全体 (0.1318) から劣化しない (nemotron は 0.1954 → 0.2316 と 18% 悪化する)。
★留保: test は YODAS (YouTube の手動字幕) = 当モデルの学習ドメイン。 「この領域で置換できるか」に答えるものであって、一般のポルトガル語 ASR の 優劣を示すものではない。
★同じ ONNX でも CPU が変われば出力は変わる (int8 カーネルの経路差)。 AMD EPYC 7742 と Intel Core Ultra 9 185H で 211 発話中 119 件が相違し WER は 0.1318 / 0.1364 とずれた。上表は前者の値。
学習データと帰属表示 (Attribution)
This model was trained on the YODAS2 dataset (pt000 = manual-caption subset,
1,556.6 hours after filtering), by Xinjian Li et al., distributed under
CC BY 3.0.
- Dataset: espnet/yodas2
- Paper: YODAS: Youtube-Oriented Dataset for Audio and Speech
雑音重畳に MUSAN の noise を使用
(D. Snyder, G. Chen, D. Povey, MUSAN: A Music, Speech, and Noise Corpus, 2015)。
ライセンス
ライセンス未設定(全権利留保)。 配布は LYR アプリへの提供を目的としたもので、 第三者による利用を許諾するものではありません。利用を希望する場合はご連絡ください。 (上記の YODAS への帰属表示は CC BY 3.0 の義務履行であり、本モデルの重みを CC BY で提供するものではありません。)
連絡先: hello@lyr.jp