whisper-wesol-ko

whisper-wesol-ko๋Š” ํ•œ๊ตญ์–ด ํšŒ์˜ยท์ƒ๋‹ดยท์ „ํ™”ยท๊ฐ•์˜ ์ „์‚ฌ๋ฅผ ๋ชฉํ‘œ๋กœ seastar105/whisper-medium-komixv2๋ฅผ ์ถ”๊ฐ€ ํ•™์Šตํ•œ Whisper Medium ํฌ๊ธฐ์˜ ํ•œ๊ตญ์–ด ์Œ์„ฑ์ธ์‹ ๋ชจ๋ธ์ž…๋‹ˆ๋‹ค.

๋™์ผํ•œ ๋กœ์ปฌ ํ‰๊ฐ€ ํŒŒ์ดํ”„๋ผ์ธ์—์„œ ์ง์ ‘ ๊ธฐ๋ฐ˜ ๋ชจ๋ธ์˜ 8๊ฐœ ํ‰๊ฐ€์…‹ ํ‰๊ท  CER์„ 7.03%์—์„œ 6.45%๋กœ ๋‚ฎ์ท„์Šต๋‹ˆ๋‹ค. ๋‹ค๋งŒ FLEURS Korean์—์„œ๋Š” ๊ธฐ๋ฐ˜ ๋ชจ๋ธ์ด ๋” ์ข‹์•˜๊ณ , ์™ธ๋ถ€ ๋ชจ๋ธ ๋ฐ ์ƒ์šฉ API์˜ ๊ณต๊ฐœ ์ ์ˆ˜์™€๋Š” ์‹คํ–‰ ํ™˜๊ฒฝ์ด ๋‹ค๋ฅด๋ฏ€๋กœ ์ด ๋ชจ๋ธ์ด ๊ทธ ๋ชจ๋ธ๋“ค๋ณด๋‹ค ์šฐ์ˆ˜ํ•˜๋‹ค๊ณ  ๋‹จ์ •ํ•˜์ง€ ์•Š์Šต๋‹ˆ๋‹ค.

CER์€ ๋‚ฎ์„์ˆ˜๋ก ์ข‹์Šต๋‹ˆ๋‹ค.

Model details

ํ•ญ๋ชฉ ๋‚ด์šฉ
Task Korean automatic speech recognition
Architecture Whisper encoder-decoder Transformer
Parameters ์•ฝ 769M
Direct base model seastar105/whisper-medium-komixv2
Original ancestor openai/whisper-medium
Fine-tuning ์ „์ฒด ํŒŒ๋ผ๋ฏธํ„ฐ ํŒŒ์ธํŠœ๋‹(full fine-tuning), LoRA ์•„๋‹˜
Training compute dtype BF16
Distributed weights dtype FP16
Input 16 kHz mono audio, Whisper ๊ธฐ๋ณธ ์ž…๋ ฅ ๊ธธ์ด ์ตœ๋Œ€ 30์ดˆ
Output ํ•œ๊ตญ์–ด ์ „์‚ฌ๋ฌธ

๋ชจ๋ธ ๊ณ„๋ณด๋Š” ๋‹ค์Œ๊ณผ ๊ฐ™์Šต๋‹ˆ๋‹ค.

openai/whisper-medium โ†’ seastar105/whisper-medium-komixv2 โ†’ whisper-wesol-ko

์ง์ ‘ ๊ธฐ๋ฐ˜ ๋ชจ๋ธ์€ OpenAI Whisper Medium์„ ์—ฌ๋Ÿฌ ํ•œ๊ตญ์–ด ๋ฐ์ดํ„ฐ์…‹์œผ๋กœ ๋จผ์ € ํŒŒ์ธํŠœ๋‹ํ•œ ๋ชจ๋ธ์ž…๋‹ˆ๋‹ค. ๋”ฐ๋ผ์„œ ๋ณธ ๋ชจ๋ธ์€ ์•„๋ž˜์˜ ์ถ”๊ฐ€ ํ•™์Šต ๋ฐ์ดํ„ฐ๋ฟ ์•„๋‹ˆ๋ผ ๊ธฐ๋ฐ˜ ๋ชจ๋ธ๊ณผ ์›๋ณธ Whisper์˜ ํ•™์Šต ๋ฐ์ดํ„ฐ ๋ฐ ํ•œ๊ณ„๋„ ํ•จ๊ป˜ ์ƒ์†ํ•ฉ๋‹ˆ๋‹ค.

Intended use

๊ถŒ์žฅ ์šฉ๋„:

  • ํ•œ๊ตญ์–ด ํšŒ์˜, ์ƒ๋‹ด, ์ฝœ์„ผํ„ฐ, ์ „ํ™”๋ง, ๊ฐ•์˜ ์Œ์„ฑ ์ „์‚ฌ
  • ํ•œ๊ตญ์–ด ๋Œ€ํ™”์ฒด ๋ฐ ์ผ๋ฐ˜ ์Œ์„ฑ์˜ ๋ฐฐ์น˜ ์ „์‚ฌ
  • ํ•œ๊ตญ์–ด ASR ์—ฐ๊ตฌ ๋ฐ ์ถ”๊ฐ€ ํŒŒ์ธํŠœ๋‹์˜ ์‹œ์ž‘์ 

๊ฒ€์ฆ๋˜์ง€ ์•Š์•˜๊ฑฐ๋‚˜ ๊ถŒ์žฅํ•˜์ง€ ์•Š๋Š” ์šฉ๋„:

  • ์˜๋ฃŒยท๋ฒ•๋ฅ ยท์ฑ„์šฉ ๋“ฑ ์˜ค์ธ์‹์ด ์‚ฌ๋žŒ์—๊ฒŒ ์ค‘๋Œ€ํ•œ ์˜ํ–ฅ์„ ์ฃผ๋Š” ์˜์‚ฌ๊ฒฐ์ •
  • ํ™”์ž ์‹๋ณ„, ๊ฐ์ •ยท์„ฑ๊ฒฉยท๋ฏผ๊ฐ ์†์„ฑ ์ถ”๋ก 
  • ๋™์˜ ์—†์ด ์ˆ˜์ง‘ํ•œ ์Œ์„ฑ์˜ ๊ฐ์‹œ ๋˜๋Š” ๋Œ€๊ทœ๋ชจ ์ „์‚ฌ
  • ๋ณ„๋„ VAD/ํ™”์ž ๋ถ„๋ฆฌ ์—†์ด ๊ธด ๋‹คํ™”์ž ๋…น์Œ์„ ๊ทธ๋Œ€๋กœ ์ฒ˜๋ฆฌํ•˜๋Š” ์šฉ๋„
  • ํ•œ๊ตญ์–ด ์ด์™ธ ์–ธ์–ด์˜ ํ’ˆ์งˆ์ด ์ค‘์š”ํ•œ ์„œ๋น„์Šค

Additional training data

๋ณธ ์ถ”๊ฐ€ ํ•™์Šต ๋‹จ๊ณ„์—์„œ๋Š” ๋‹ค์Œ ๋ฐ์ดํ„ฐ๋ฅผ ์‚ฌ์šฉํ–ˆ์Šต๋‹ˆ๋‹ค.

๋ฐ์ดํ„ฐ ์‚ฌ์šฉ ๋ชฉ์  ์‚ฌ์šฉ๋Ÿ‰
Zeroth Korean train ํ•œ๊ตญ์–ด ๋‚ญ๋…์ฒด 51.7์‹œ๊ฐ„ / 22,263๋ฐœํ™”
AIHub ์ €์Œ์งˆ ์ „ํ™”๋ง ์Œ์„ฑ์ธ์‹ ๋ฐ์ดํ„ฐ ์ „ํ™” ์Œ์„ฑ 99.4์‹œ๊ฐ„ / 46,944๋ฐœํ™”
AIHub ์ƒ๋‹ด ์Œ์„ฑ ๋ฐ์ดํ„ฐ ์ƒ๋‹ด ๋Œ€ํ™” 99.4์‹œ๊ฐ„ / 47,425๋ฐœํ™”
AIHub ํšŒ์˜ ์Œ์„ฑ ๋ฐ์ดํ„ฐ ํšŒ์˜ ์Œ์„ฑ 99.6์‹œ๊ฐ„ / 62,476๋ฐœํ™”
AIHub ํ•œ๊ตญ์–ด ๊ฐ•์˜ ์Œ์„ฑ ๋ฐ์ดํ„ฐ ๊ฐ•์˜ ์Œ์„ฑ 99.5์‹œ๊ฐ„ / 50,766๋ฐœํ™”
ํ•ฉ๊ณ„ ์ถ”๊ฐ€ ํ•™์Šต ์Œ์„ฑ ์•ฝ 449.6์‹œ๊ฐ„ / 229,874๋ฐœํ™”
AIHub ์ƒํ™œํ™˜๊ฒฝ์†Œ์Œ ๋ฐ์ดํ„ฐ ์†Œ์Œ ์ฆ๊ฐ• ๊ณต์‚ฌ์žฅ ์†Œ์Œ 4,699๊ฐœ ํด๋ฆฝ

์‹œ๊ฐ„์€ ์†Œ์ˆ˜์  ์ฒซ์งธ ์ž๋ฆฌ๋กœ ๋ฐ˜์˜ฌ๋ฆผํ–ˆ์Šต๋‹ˆ๋‹ค. ํ•™์Šต ๋ฐ์ดํ„ฐ๋Š” ํ‰๊ฐ€ ๋ฐ ๊ฐœ๋ฐœ ๋ฐ์ดํ„ฐ์™€ IDยท์„ธ์…˜ ๋‹จ์œ„๋กœ ๋ถ„๋ฆฌํ–ˆ์Šต๋‹ˆ๋‹ค. Zeroth test๋Š” Zeroth train์˜ ๋ณ„๋„ split์ž…๋‹ˆ๋‹ค.

Training procedure

์„ค์ • ๊ฐ’
Objective ์ผ๋ฐ˜ ๋ฐฐ์น˜: teacher-forced cross entropy
Noise-consistency step ์„ค์ •์ƒ ์ „์ฒด iteration์˜ 15%
Noise SNR 0โ€“20 dB์—์„œ ๊ฒฐ์ •์ ์œผ๋กœ ์„ ํƒ
Noise loss noisy CE + 0.5 ร— KL(detached clean distribution โ€– noisy distribution)
Optimizer AdamW, weight decay 0.01
Maximum learning rate 2e-5
LR schedule 300 iteration linear warm-up ํ›„ ReduceLROnPlateau(factor 0.5, patience 2, min LR 1e-6)
Micro batch / accumulation 6 / 3
Effective batch 18๊ฐœ ๋ฐœํ™”/optimizer update
Gradient clipping global norm 1.0
Seed 42
Precision BF16, SDPA
SpecAugment ์‚ฌ์šฉํ•˜์ง€ ์•Š์Œ
Checkpoint evaluation 1,000 iteration๋งˆ๋‹ค
Selected checkpoint 6,000 iteration(์•ฝ 2,000 optimizer updates)
Early stop 11,000 iteration, patience 5

์ „์ฒด ๋„๋ฉ”์ธ์˜ ๋ฐœํ™”๋ฅผ ํ•˜๋‚˜์˜ pool๋กœ ํ•ฉ์ณ ๋น„๋ณต์› ์…”ํ”Œํ–ˆ์Šต๋‹ˆ๋‹ค. ์ผ๋ฐ˜ iteration์€ ์ •๋‹ต ์ „์‚ฌ์— ๋Œ€ํ•œ CE๋ฅผ ์‚ฌ์šฉํ–ˆ์Šต๋‹ˆ๋‹ค. ์†Œ์Œ-consistency iteration์—์„œ๋Š” ๊ฐ™์€ ์Œ์„ฑ์˜ clean/noisy ๋‘ view๋ฅผ ํ•จ๊ป˜ ๊ณ„์‚ฐํ•˜๋˜, noisy view์˜ ์ •๋‹ต CE์™€ clean view๋ฅผ ๊ธฐ์ค€์œผ๋กœ ํ•œ KL loss๋ฅผ ์‚ฌ์šฉํ–ˆ์Šต๋‹ˆ๋‹ค. ์ง€์‹์ฆ๋ฅ˜ ๊ต์‚ฌ ๋ชจ๋ธ์€ ์‚ฌ์šฉํ•˜์ง€ ์•Š์•˜์Šต๋‹ˆ๋‹ค.

Evaluation

ํ‰๊ฐ€๋Š” 2026-07-28์— ์ˆ˜ํ–‰ํ–ˆ์Šต๋‹ˆ๋‹ค.

Protocol

  • decoding: greedy(do_sample=False), language=ko, task=transcribe
  • Transformers ์ถ”๋ก  dtype: BF16
  • ์ž…๋ ฅ: 16 kHz, ์ตœ๋Œ€ 30์ดˆ
  • ์ •๊ทœํ™”: Whisper BasicTextNormalizer ์ ์šฉ ํ›„ ๋ชจ๋“  ๊ณต๋ฐฑ ์ œ๊ฑฐ
  • ์„ธํŠธ ์ ์ˆ˜: ๋ฐœํ™”๋ณ„ CER์˜ ์‚ฐ์ˆ ํ‰๊ท (macro CER)
  • ์ „์ฒด ํ‰๊ท : ๊ฐ ํ‰๊ฐ€์…‹ CER์˜ ๋™์ผ ๊ฐ€์ค‘ ์‚ฐ์ˆ ํ‰๊ท 
  • ์ด ๋ฐœํ™” ์ˆ˜: 18,610๊ฐœ

์ „์ฒด ํ‰๊ท ์€ 18,610๊ฐœ ๋ฌธ์ž๋ฅผ ํ•œ๊บผ๋ฒˆ์— ํ•ฉ์‚ฐํ•œ corpus CER๊ฐ€ ์•„๋‹™๋‹ˆ๋‹ค. 228๊ฐœ์ธ CV15๋„ 3,000๊ฐœ์ธ AIHub ์„ธํŠธ์™€ ํ‰๊ท ์—์„œ ๊ฐ™์€ ๊ฐ€์ค‘์น˜๋ฅผ ๋ฐ›์Šต๋‹ˆ๋‹ค.

ํ‰๊ฐ€์…‹ ๋ฐœํ™” ์ˆ˜
Common Voice 15 Korean test 228
FLEURS Korean test 382
AIHub ์ €์Œ์งˆ ์ „ํ™”๋ง test 3,000
AIHub ํšŒ์˜ test 3,000
AIHub ์ƒ๋‹ด test 3,000
AIHub ํ•œ๊ตญ์–ด ๊ฐ•์˜ test 3,000
KsponSpeech eval clean 3,000
KsponSpeech eval other 3,000

Controlled local comparison

์•„๋ž˜ ์„ธ ๋ชจ๋ธ์€ ๊ฐ™์€ ์˜ค๋””์˜ค, ์ „์‚ฌ, ์ •๊ทœํ™”, decoding ์กฐ๊ฑด์—์„œ ์ง์ ‘ ์ธก์ •ํ–ˆ์Šต๋‹ˆ๋‹ค.

Model 8-set Avg. CV15 FLEURS ์ „ํ™” ํšŒ์˜ ์ƒ๋‹ด ๊ฐ•์˜ Kspon clean Kspon other
seastar105/whisper-medium-komixv2 (direct base) 7.03 6.75 4.49 5.82 9.45 5.54 8.42 8.08 7.66
whisper-wesol-ko 6.45 5.86 4.73 5.20 8.90 4.21 7.88 7.74 7.07
whisper-wesol-ko-int8 6.46 5.87 4.71 5.25 8.83 4.26 7.91 7.63 7.24

๋™์ผ ์‹คํ–‰์—์„œ ๋ณธ ๋ชจ๋ธ์€ ๊ธฐ๋ฐ˜ ๋ชจ๋ธ๋ณด๋‹ค 8-set ํ‰๊ท  CER์ด 0.58%p ๋‚ฎ์•˜์Šต๋‹ˆ๋‹ค. 8๊ฐœ ์ค‘ 7๊ฐœ ์„ธํŠธ์—์„œ ๊ฐœ์„ ๋์ง€๋งŒ FLEURS๋Š” 4.49 โ†’ 4.73์œผ๋กœ ์•…ํ™”๋์Šต๋‹ˆ๋‹ค.

CT2 int8 ๋ฐฐํฌ๋ณธ์€ 8-set ํ‰๊ท ์ด 6.46%๋กœ FP16 ์›๋ณธ๊ณผ +0.02%p ์ฐจ์ด์˜€์Šต๋‹ˆ๋‹ค. ๋‹จ, ์„ธํŠธ๋ณ„๋กœ๋Š” ์ตœ๋Œ€ 0.17%p ์ฐจ์ด๊ฐ€ ์žˆ์œผ๋ฏ€๋กœ ๋ชจ๋“  ๋ฐ์ดํ„ฐ์—์„œ ๋ฌด์†์‹ค์ด๋ผ๊ณ  ๋ณด์žฅํ•  ์ˆ˜๋Š” ์—†์Šต๋‹ˆ๋‹ค.

Additional evaluations

Model KOpenAudioBench (2,835) Zeroth Korean test (457)
seastar105/whisper-medium-komixv2 3.94 6.24
whisper-wesol-ko 3.53 2.78

KOpenAudioBench๋Š” ๋ณธ ์ถ”๊ฐ€ ํ•™์Šต ๋‹จ๊ณ„์—์„œ ์‚ฌ์šฉํ•˜์ง€ ์•Š์•˜์Šต๋‹ˆ๋‹ค. Zeroth test๋Š” ํ•™์Šต์— ์‚ฌ์šฉํ•œ Zeroth train์˜ held-out split์ž…๋‹ˆ๋‹ค.

Published reference values

์•„๋ž˜ ๊ฐ’์€ ๋น„๊ต๋ฅผ ์œ„ํ•ด seastar105/whisper-medium-komixv2 ๋ชจ๋ธ ์นด๋“œ์—์„œ ๊ฐ€์ ธ์˜จ ๊ณต๊ฐœ ์ˆ˜์น˜์ž…๋‹ˆ๋‹ค. ์™ธ๋ถ€ ๋ชจ๋ธ์€ ๊ฐ™์€ ํ™˜๊ฒฝ์—์„œ ์žฌ์ธก์ •ํ•˜์ง€ ์•Š์•˜์œผ๋ฉฐ, ์šฐ๋ฆฌ ๋ชจ๋ธ ํ–‰๋งŒ ์œ„ ๋กœ์ปฌ ์‹คํ–‰ ๊ฒฐ๊ณผ์ž…๋‹ˆ๋‹ค.

Model Average CV15 FLEURS ์ „ํ™” ํšŒ์˜ ์ƒ๋‹ด ๊ฐ•์˜ Kspon clean Kspon other
whisper-small-komixv2 (published) 7.36 7.07 4.19 5.60 9.67 5.50 8.55 9.26 9.07
whisper-medium-komixv2 (published) 7.30 6.62 4.52 5.85 9.42 5.47 8.38 9.19 8.97
whisper-large-v3 (published) 7.99 5.11 3.72 5.45 9.35 3.83 8.46 15.08 12.89
whisper-large-v3-turbo (published) 10.75 5.38 3.99 10.93 10.27 4.21 9.42 26.66 15.16
whisper-wesol-ko (local) 6.45 5.86 4.73 5.20 8.90 4.21 7.88 7.74 7.07

๊ณต๊ฐœ ์ˆ˜์น˜์™€ ๋กœ์ปฌ ์ˆ˜์น˜๋Š” ๋™์ผ ์‹คํ–‰ ๊ฒฐ๊ณผ๊ฐ€ ์•„๋‹ˆ๋ฏ€๋กœ ์ง์ ‘์ ์ธ ์ˆœ์œ„๋กœ ํ•ด์„ํ•˜๋ฉด ์•ˆ ๋ฉ๋‹ˆ๋‹ค.

Commercial/API reference

rtzr/Awesome-Korean-Speech-Recognition์˜ ๊ณต๊ฐœํ‘œ์™€ ๊ฒน์น˜๋Š” 6๊ฐœ ์—ด(ํšŒ์˜ยท์ƒ๋‹ดยท์ „ํ™”ยท๊ฐ•์˜ยทKspon clean/other)๋งŒ ๋‹ค์‹œ ํ‰๊ท ํ•˜๋ฉด ๋‹ค์Œ๊ณผ ๊ฐ™์Šต๋‹ˆ๋‹ค.

System Common 6-set Avg. CER
๋ฆฌํ„ด์ œ๋กœ 5.90
๋ฆฌํ„ด์ œ๋กœ Whisper 6.55
whisper-wesol-ko 6.83
Naver ClovaSpeech 7.02

์ƒ์šฉ/API ๊ฐ’์€ ๋ชจ๋ธ ๋ฒ„์ „, ํ›„์ฒ˜๋ฆฌ, ์‹คํ–‰ ์‹œ์ ์ด ๋‹ฌ๋ผ ํ†ต์ œ๋œ ์ˆœ์œ„๋กœ ๋ณผ ์ˆ˜ ์—†์Šต๋‹ˆ๋‹ค. ๋ณธ ๋ชจ๋ธ์€ ํ•ด๋‹น ๋ฒค์น˜๋งˆํฌ์˜ ์ฃผ์š” ์˜์—ญ๋ณ„ ํšŒ์˜ ์„ธํŠธ๋ฅผ ํ‰๊ฐ€ํ•˜์ง€ ์•Š์•˜์Šต๋‹ˆ๋‹ค.

Usage

์•„๋ž˜ MODEL_ID๋ฅผ ์‹ค์ œ Hugging Face ์ €์žฅ์†Œ ์ด๋ฆ„์œผ๋กœ ๋ฐ”๊พธ์‹ญ์‹œ์˜ค.

import torch
from transformers import AutoProcessor, WhisperForConditionalGeneration

MODEL_ID = "tlstjdwns/whisper-wesol-ko"

processor = AutoProcessor.from_pretrained(MODEL_ID)
processor.tokenizer.set_prefix_tokens(language="ko", task="transcribe")

model = WhisperForConditionalGeneration.from_pretrained(
    MODEL_ID,
    dtype=torch.float16,
    low_cpu_mem_usage=True,
).to("cuda")
model.eval()
model.generation_config.language = "ko"
model.generation_config.task = "transcribe"
model.generation_config.forced_decoder_ids = None

# audio: 16 kHz mono float array
inputs = processor.feature_extractor(
    audio,
    sampling_rate=16_000,
    return_tensors="pt",
)
input_features = inputs.input_features.to("cuda", dtype=torch.float16)

with torch.inference_mode():
    token_ids = model.generate(
        input_features,
        max_new_tokens=256,
        do_sample=False,
    )

text = processor.batch_decode(token_ids, skip_special_tokens=True)[0]
print(text.strip())

30์ดˆ๋ณด๋‹ค ๊ธด ํŒŒ์ผ์€ chunking, VAD ๋˜๋Š” faster-whisper์™€ ๊ฐ™์€ ๋ณ„๋„ long-form ์ฒ˜๋ฆฌ ๋ฐฉ์‹์„ ์‚ฌ์šฉํ•˜์‹ญ์‹œ์˜ค. ํ•œ ๋ฒˆ์— ์ฒ˜์Œ 30์ดˆ๋งŒ ๋„ฃ๋Š” ์ฝ”๋“œ๋Š” ์ „์ฒด ํŒŒ์ผ ์ „์‚ฌ๋ฅผ ๋ณด์žฅํ•˜์ง€ ์•Š์Šต๋‹ˆ๋‹ค.

Limitations

  • FLEURS Korean์—์„œ๋Š” ์ง์ ‘ ๊ธฐ๋ฐ˜ ๋ชจ๋ธ๋ณด๋‹ค CER์ด 0.24%p ๋†’์•˜์Šต๋‹ˆ๋‹ค.
  • ํ•™์Šต ๋„๋ฉ”์ธ๊ณผ ๊ฐ€๊นŒ์šด ํšŒ์˜ยท์ƒ๋‹ดยท์ „ํ™”ยท๊ฐ•์˜์— ์œ ๋ฆฌํ•œ in-domain ๋ชจ๋ธ์ž…๋‹ˆ๋‹ค. ๋‚ฏ์„  ๋ฐฉ์†ก, ๋ฐฉ์–ธ, ์•„๋™, ๋…ธ์ธ, ์˜๋ฃŒยท๋ฒ•๋ฅ  ์ „๋ฌธ์šฉ์–ด, ์ฝ”๋“œ ์Šค์œ„์นญ์— ๊ฐ™์€ ์„ฑ๋Šฅ์„ ๊ธฐ๋Œ€ํ•˜๋ฉด ์•ˆ ๋ฉ๋‹ˆ๋‹ค.
  • ๋ณ„๋„์˜ ํ™”์ž ๋ถ„๋ฆฌ, VAD, ์‹ค์‹œ๊ฐ„ streaming ๊ธฐ๋Šฅ์„ ํฌํ•จํ•˜์ง€ ์•Š์Šต๋‹ˆ๋‹ค.
  • Whisper ๊ณ„์—ด ํŠน์„ฑ์ƒ ๋ฌด์Œ, ๋งค์šฐ ์งง์€ ์™ธ์นจ, ์‹ฌํ•œ ์†Œ์Œ ๋˜๋Š” ๋„๋ฉ”์ธ ๋ฐ– ์Œ์„ฑ์—์„œ ์‹ค์ œ๋กœ ๋งํ•˜์ง€ ์•Š์€ ๋ฌธ์žฅ์„ ์ƒ์„ฑํ•˜๊ฑฐ๋‚˜ ๊ฐ™์€ ๋ฌธ์žฅ์„ ๋ฐ˜๋ณตํ•  ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.
  • ๊ณต์‚ฌ์žฅ ์†Œ์Œ ํ•ฉ์„ฑ์„ ์‚ฌ์šฉํ–ˆ์ง€๋งŒ, ๋ชจ๋“  ์‹ค์ œ ๊ฑด์„ค ํ˜„์žฅ ํ™˜๊ฒฝ์— ๋Œ€ํ•œ ๊ฐ•๊ฑด์„ฑ์„ ๋ณด์žฅํ•˜์ง€ ์•Š์Šต๋‹ˆ๋‹ค.
  • ์„ฑ๋ณ„, ์—ฐ๋ น, ์ง€์—ญ, ์–ต์–‘ ๋“ฑ ์ธ๊ตฌํ†ต๊ณ„ ํ•˜์œ„์ง‘๋‹จ๋ณ„ ํŽธํ–ฅ ํ‰๊ฐ€๋Š” ์ˆ˜ํ–‰ํ•˜์ง€ ์•Š์•˜์Šต๋‹ˆ๋‹ค.
  • ๋…๋ฆฝ์ ์ธ ์ œ3์ž ํ‰๊ฐ€๋Š” ์ˆ˜ํ–‰ํ•˜์ง€ ์•Š์•˜์Šต๋‹ˆ๋‹ค.

License and data notice

์ด ์ €์žฅ์†Œ์˜ ๋ผ์ด์„ ์Šค ํ‘œ์‹œ๋Š” other์ž…๋‹ˆ๋‹ค.

  • ์›๋ณธ openai/whisper-medium์€ Apache-2.0์œผ๋กœ ๊ณต๊ฐœ๋์Šต๋‹ˆ๋‹ค.
  • ์ง์ ‘ ๊ธฐ๋ฐ˜ ๋ชจ๋ธ seastar105/whisper-medium-komixv2์˜ ํ˜„์žฌ ๋ชจ๋ธ ์นด๋“œ์—๋Š” ๋ณ„๋„์˜ ๋ผ์ด์„ ์Šค๊ฐ€ ๋ช…์‹œ๋ผ ์žˆ์ง€ ์•Š์Šต๋‹ˆ๋‹ค.
  • ์ถ”๊ฐ€ ํ•™์Šต์—๋Š” AIHub ๋ฐ์ดํ„ฐ๊ฐ€ ์‚ฌ์šฉ๋์œผ๋ฉฐ ๋ฐ์ดํ„ฐ์…‹๋ณ„ ์ด์šฉ์กฐ๊ฑด์ด ์ ์šฉ๋  ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.

๊ณต๊ฐœ ๋˜๋Š” ์ƒ์—… ์ด์šฉ ์ „์— ์ง์ ‘ ๊ธฐ๋ฐ˜ ๋ชจ๋ธ๊ณผ ๊ฐ AIHub ๋ฐ์ดํ„ฐ์…‹์˜ ์ตœ์‹  ์ด์šฉ์กฐ๊ฑด์„ ํ™•์ธํ•ด์•ผ ํ•ฉ๋‹ˆ๋‹ค.

Acknowledgements

Citation

์ด ๋ชจ๋ธ ์ž์ฒด์— ๋Œ€ํ•œ ๋…ผ๋ฌธ์€ ์—†์Šต๋‹ˆ๋‹ค. Whisper๋ฅผ ์ธ์šฉํ•  ๋•Œ๋Š” ๋‹ค์Œ ๋…ผ๋ฌธ์„ ์‚ฌ์šฉํ•˜์‹ญ์‹œ์˜ค.

@article{radford2022whisper,
  title={Robust Speech Recognition via Large-Scale Weak Supervision},
  author={Radford, Alec and Kim, Jong Wook and Xu, Tao and Brockman, Greg and McLeavey, Christine and Sutskever, Ilya},
  journal={arXiv preprint arXiv:2212.04356},
  year={2022}
}
Downloads last month
-
Safetensors
Model size
0.8B params
Tensor type
F16
ยท
Inference Providers NEW
This model isn't deployed by any Inference Provider. ๐Ÿ™‹ Ask for provider support

Model tree for TLSJ/whisper-wesol-ko

Finetuned
(2)
this model
Quantizations
1 model

Dataset used to train TLSJ/whisper-wesol-ko

Paper for TLSJ/whisper-wesol-ko