lyr-asr-pt-streaming

ポルトガル語 streaming ASR の ONNX モデル。LYR アプリ専用。

file size
encoder.int8.onnx 155 MB
decoder.onnx 3.1 MB
joiner.int8.onnx 0.52 MB
tokens.txt 10 KB

icefall egs/yodas_pt/ASR の streaming zipformer (transducer)。 20 epoch 学習し、ep16–20 の平均 (avg5) を採用。 トークナイザは BPE 1000 (韓国語版の char とは異なる。ラテン文字では 1 文字あたりの情報量が小さく、char だとラベル長がフレーム数を超えて 整列が存在しなくなるため)。

精度

held-out の test 211 発話 (91.7 分、学習から除外した 400 動画由来)。 比較対象は同一発話・同一 int8・同一設定で測り直した値。

model WER (micro) CER (micro) size RTF p50
これ (avg5) 0.1318 0.0607 159 MB 0.075
nvidia nemotron-3.5-asr-streaming-0.6b (560ms int8) 0.2068 0.1055 682 MB 0.189

動画単位 paired bootstrap 10,000 回で差 −0.0749、95% CI [−0.0844, −0.0657] (有意)。数字を含む発話でも WER 0.1319 と全体 (0.1318) から劣化しない (nemotron は 0.1954 → 0.2316 と 18% 悪化する)。

★留保: test は YODAS (YouTube の手動字幕) = 当モデルの学習ドメイン。 「この領域で置換できるか」に答えるものであって、一般のポルトガル語 ASR の 優劣を示すものではない。

★同じ ONNX でも CPU が変われば出力は変わる (int8 カーネルの経路差)。 AMD EPYC 7742 と Intel Core Ultra 9 185H で 211 発話中 119 件が相違し WER は 0.1318 / 0.1364 とずれた。上表は前者の値。

学習データと帰属表示 (Attribution)

This model was trained on the YODAS2 dataset (pt000 = manual-caption subset, 1,556.6 hours after filtering), by Xinjian Li et al., distributed under CC BY 3.0.

雑音重畳に MUSANnoise を使用 (D. Snyder, G. Chen, D. Povey, MUSAN: A Music, Speech, and Noise Corpus, 2015)。

ライセンス

ライセンス未設定(全権利留保)。 配布は LYR アプリへの提供を目的としたもので、 第三者による利用を許諾するものではありません。利用を希望する場合はご連絡ください。 (上記の YODAS への帰属表示は CC BY 3.0 の義務履行であり、本モデルの重みを CC BY で提供するものではありません。)

連絡先: hello@lyr.jp

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Paper for ken4869/lyr-asr-pt-streaming