whisper-wesol-ko-int8

whisper-wesol-ko-int8์€ whisper-wesol-ko๋ฅผ CTranslate2 ํ˜•์‹์˜ int8_float16์œผ๋กœ ๋ณ€ํ™˜ํ•œ ํ•œ๊ตญ์–ด ์Œ์„ฑ์ธ์‹ ๋ฐฐํฌ ๋ชจ๋ธ์ž…๋‹ˆ๋‹ค. ๋ณ„๋„๋กœ ๋‹ค์‹œ ํ•™์Šตํ•œ ๋ชจ๋ธ์ด ์•„๋‹™๋‹ˆ๋‹ค.

  • ์›๋ณธ: whisper-wesol-ko Transformers FP16
  • ํ˜•์‹: CTranslate2
  • ๊ถŒ์žฅ GPU compute type: int8_float16
  • ๋ชจ๋ธ ํŒŒ์ผ ํฌ๊ธฐ: ์•ฝ 739MB
  • ์šฉ๋„: faster-whisper ๊ธฐ๋ฐ˜ GPU ์ถ”๋ก 

ํ•™์Šต ๋ฐ์ดํ„ฐ, ํ•™์Šต ๋ฐฉ๋ฒ•, ์šฉ๋„, ๋ผ์ด์„ ์Šค ์ฃผ์˜์‚ฌํ•ญ์€ ์›๋ณธ whisper-wesol-ko ๋ชจ๋ธ ์นด๋“œ์™€ ๊ฐ™์Šต๋‹ˆ๋‹ค.

Evaluation

2026-07-28์— FP16 ์›๋ณธ๊ณผ int8 ๋ชจ๋ธ์„ ๊ฐ™์€ 18,610๊ฐœ ํ•œ๊ตญ์–ด ๋ฐœํ™”์—์„œ ์ง์ ‘ ํ‰๊ฐ€ํ–ˆ์Šต๋‹ˆ๋‹ค.

  • decoding: greedy, language=ko, task=transcribe
  • ์ •๊ทœํ™”: Whisper BasicTextNormalizer ์ ์šฉ ํ›„ ๊ณต๋ฐฑ ์ œ๊ฑฐ
  • ์„ธํŠธ ์ ์ˆ˜: ๋ฐœํ™”๋ณ„ CER์˜ ์‚ฐ์ˆ ํ‰๊ท 
  • ์ „์ฒด ํ‰๊ท : 8๊ฐœ ์„ธํŠธ CER์˜ ๋™์ผ ๊ฐ€์ค‘ ํ‰๊ท 
  • CER์€ ๋‚ฎ์„์ˆ˜๋ก ์ข‹์Œ
Model 8-set Avg. CV15 FLEURS ์ „ํ™” ํšŒ์˜ ์ƒ๋‹ด ๊ฐ•์˜ Kspon clean Kspon other
Transformers FP16 ์›๋ณธ 6.45 5.86 4.73 5.20 8.90 4.21 7.88 7.74 7.07
CTranslate2 int8 6.46 5.87 4.71 5.25 8.83 4.26 7.91 7.63 7.24

8-set ํ‰๊ท  ์ฐจ์ด๋Š” +0.02%p์˜€์Šต๋‹ˆ๋‹ค. ๋‹ค๋งŒ ์„ธํŠธ๋ณ„ ์ฐจ์ด๋Š” -0.11%p์—์„œ +0.17%p๊นŒ์ง€ ์žˆ์œผ๋ฏ€๋กœ ๋ชจ๋“  ์ž…๋ ฅ์—์„œ ์™„์ „ํžˆ ๋™์ผํ•˜๊ฑฐ๋‚˜ ๋ฌด์†์‹ค์ด๋ผ๊ณ  ๋ณด์žฅํ•˜์ง€ ์•Š์Šต๋‹ˆ๋‹ค.

๊ณต๊ฐœ Whisper ๋ชจ๋ธ ๋ฐ ์ƒ์šฉ/API์™€์˜ ๋น„๊ต๋Š” ์›๋ณธ ๋ชจ๋ธ ์นด๋“œ์— ์ •๋ฆฌ๋ผ ์žˆ์Šต๋‹ˆ๋‹ค. ์™ธ๋ถ€ ๊ณต๊ฐœ ์ˆ˜์น˜๋Š” ๋™์ผ ์‹คํ–‰ ํ™˜๊ฒฝ์—์„œ ์žฌ์ธก์ •ํ•œ ๊ฒฐ๊ณผ๊ฐ€ ์•„๋‹ˆ๋ฏ€๋กœ ํ†ต์ œ๋œ ์ˆœ์œ„๋กœ ํ•ด์„ํ•˜๋ฉด ์•ˆ ๋ฉ๋‹ˆ๋‹ค.

Usage

์•„๋ž˜ MODEL_ID๋ฅผ ์‹ค์ œ Hugging Face ์ €์žฅ์†Œ ์ด๋ฆ„์œผ๋กœ ๋ฐ”๊พธ์‹ญ์‹œ์˜ค.

from faster_whisper import WhisperModel

MODEL_ID = "tlstjdwns/whisper-wesol-ko-int8"

model = WhisperModel(
    MODEL_ID,
    device="cuda",
    compute_type="int8_float16",
)

segments, info = model.transcribe(
    "audio.wav",
    language="ko",
    task="transcribe",
    beam_size=1,
    vad_filter=True,
)

print("".join(segment.text for segment in segments).strip())

๋ฒค์น˜๋งˆํฌ๋Š” beam_size=1๋กœ ์ˆ˜ํ–‰ํ–ˆ์Šต๋‹ˆ๋‹ค. ์œ„ ๊ฐ’์„ ๋ฐ”๊พธ๊ฑฐ๋‚˜ VAD, chunking, temperature, ํ›„์ฒ˜๋ฆฌ ์„ค์ •์„ ๋ณ€๊ฒฝํ•˜๋ฉด ์นด๋“œ์˜ CER๊ณผ ๊ฒฐ๊ณผ๊ฐ€ ๋‹ฌ๋ผ์งˆ ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.

์ด ๋ชจ๋ธ์€ GPU์šฉ int8_float16์œผ๋กœ ๊ฒ€์ฆํ–ˆ์Šต๋‹ˆ๋‹ค. CPU์—์„œ์˜ ์†๋„์™€ ์ •ํ™•๋„๋Š” ์ด ์นด๋“œ์—์„œ ๊ฒ€์ฆํ•˜์ง€ ์•Š์•˜์œผ๋ฉฐ, CPU ๋ฐฐํฌ์—๋Š” CPU์šฉ์œผ๋กœ ๋ณ€ํ™˜ยท๊ฒ€์ฆํ•œ ๋ณ„๋„ ๋ชจ๋ธ์„ ์‚ฌ์šฉํ•˜๋Š” ๊ฒƒ์ด ์•ˆ์ „ํ•ฉ๋‹ˆ๋‹ค.

Training summary

์›๋ณธ ๋ชจ๋ธ์€ seastar105/whisper-medium-komixv2๋ฅผ ๋‹ค์Œ ๋ฐ์ดํ„ฐ๋กœ ์ „์ฒด ํŒŒ์ธํŠœ๋‹ํ•œ ๋ชจ๋ธ์ž…๋‹ˆ๋‹ค.

  • Zeroth Korean train 51.7์‹œ๊ฐ„ / 22,263๋ฐœํ™”
  • AIHub ์ €์Œ์งˆ ์ „ํ™”๋ง 99.4์‹œ๊ฐ„ / 46,944๋ฐœํ™”
  • AIHub ์ƒ๋‹ด 99.4์‹œ๊ฐ„ / 47,425๋ฐœํ™”
  • AIHub ํšŒ์˜ 99.6์‹œ๊ฐ„ / 62,476๋ฐœํ™”
  • AIHub ํ•œ๊ตญ์–ด ๊ฐ•์˜ 99.5์‹œ๊ฐ„ / 50,766๋ฐœํ™”
  • AIHub ๊ณต์‚ฌ์žฅ ์ƒํ™œํ™˜๊ฒฝ์†Œ์Œ 4,699๊ฐœ ํด๋ฆฝ์„ ์ด์šฉํ•œ 0โ€“20dB ์†Œ์Œ ์ฆ๊ฐ•

์ถ”๊ฐ€ ํ•™์Šต ์Œ์„ฑ ํ•ฉ๊ณ„๋Š” ์•ฝ 449.6์‹œ๊ฐ„ / 229,874๋ฐœํ™”์ž…๋‹ˆ๋‹ค.

์ „์ฒด ๋„๋ฉ”์ธ shuffle CE์™€ ์„ค์ •์ƒ 15%์˜ clean/noisy consistency iteration์„ ์‚ฌ์šฉํ–ˆ์Šต๋‹ˆ๋‹ค. ์ƒ์„ธํ•œ ํ•™์Šตยทํ‰๊ฐ€ ํ•œ๊ณ„๋Š” ์›๋ณธ ์นด๋“œ์—์„œ ํ™•์ธํ•ด์•ผ ํ•ฉ๋‹ˆ๋‹ค.

Limitations

  • ์–‘์žํ™”๋Š” ์›๋ณธ ๋ชจ๋ธ์˜ ํŽธํ–ฅ, ํ™˜๊ฐ, ๋„๋ฉ”์ธ ํŽธ์ค‘์„ ํ•ด๊ฒฐํ•˜์ง€ ์•Š์Šต๋‹ˆ๋‹ค.
  • ํ•œ๊ตญ์–ด ์ด์™ธ ์–ธ์–ด, ํ™”์ž ๋ถ„๋ฆฌ, ์ธ๊ตฌํ†ต๊ณ„ ํ•˜์œ„์ง‘๋‹จ๋ณ„ ํŽธํ–ฅ์€ ๊ฒ€์ฆํ•˜์ง€ ์•Š์•˜์Šต๋‹ˆ๋‹ค.
  • ๋ฌด์Œ, ๋งค์šฐ ์งง์€ ์™ธ์นจ, ๊ฐ•ํ•œ ์†Œ์Œ์—์„œ ๋งํ•˜์ง€ ์•Š์€ ๋ฌธ์žฅ์ด๋‚˜ ๋ฐ˜๋ณต๋ฌธ์„ ์ƒ์„ฑํ•  ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.
  • ์ž๋™ VAD์™€ ๊ธด ์Œ์„ฑ ๋ถ„ํ•  ๋ฐฉ์‹์— ๋”ฐ๋ผ ๊ฒฐ๊ณผ๊ฐ€ ๋‹ฌ๋ผ์งˆ ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.
  • ์˜๋ฃŒยท๋ฒ•๋ฅ ยท์ฑ„์šฉ ๋“ฑ ๊ณ ์œ„ํ—˜ ์˜์‚ฌ๊ฒฐ์ •์—๋Š” ์‚ฌ๋žŒ์˜ ๊ฒ€์ˆ˜ ์—†์ด ์‚ฌ์šฉํ•˜์ง€ ๋งˆ์‹ญ์‹œ์˜ค.

License and data notice

๋ผ์ด์„ ์Šค ํ‘œ์‹œ๋Š” other์ž…๋‹ˆ๋‹ค.

  • ์›๋ณธ OpenAI Whisper Medium์€ Apache-2.0์œผ๋กœ ๊ณต๊ฐœ๋์Šต๋‹ˆ๋‹ค.
  • ์ง์ ‘ ๊ธฐ๋ฐ˜ ๋ชจ๋ธ seastar105/whisper-medium-komixv2์˜ ํ˜„์žฌ ๋ชจ๋ธ ์นด๋“œ์—๋Š” ๋ณ„๋„์˜ ๋ผ์ด์„ ์Šค๊ฐ€ ๋ช…์‹œ๋ผ ์žˆ์ง€ ์•Š์Šต๋‹ˆ๋‹ค.
  • ์ถ”๊ฐ€ ํ•™์Šต์—๋Š” AIHub ๋ฐ์ดํ„ฐ๊ฐ€ ์‚ฌ์šฉ๋์œผ๋ฉฐ ๋ฐ์ดํ„ฐ์…‹๋ณ„ ์ด์šฉ์กฐ๊ฑด์ด ์ ์šฉ๋  ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.

์ด ์นด๋“œ๋Š” ๊ฐ€์ค‘์น˜์˜ ์žฌ๋ฐฐํฌยท์ƒ์—… ์ด์šฉ ๊ถŒํ•œ์„ ์ƒˆ๋กœ ๋ถ€์—ฌํ•˜์ง€ ์•Š์Šต๋‹ˆ๋‹ค. ๊ณต๊ฐœ ๋˜๋Š” ์ƒ์—… ์ด์šฉ ์ „ ๊ธฐ๋ฐ˜ ๋ชจ๋ธ๊ณผ AIHub ๋ฐ์ดํ„ฐ์…‹์˜ ์ตœ์‹  ์ด์šฉ์กฐ๊ฑด์„ ํ™•์ธํ•˜์‹ญ์‹œ์˜ค.

Acknowledgements

Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. ๐Ÿ™‹ Ask for provider support

Model tree for TLSJ/whisper-wesol-ko-int8

Quantized
(1)
this model