WideCodec β 44.1 kHz decoder (scaled NeuCodec depth-20 finetune)
A SOTA 0.8 kbps, 44.1 kHz audio tokenizer.
WideCodec is a 44.1 kHz decoder finetune of neuphonic/neucodec.
Only the decoder (Vocos backbone + ISTFT head, transformer depth 20) is trained to
reconstruct 44.1 kHz audio. The 16 kHz acoustic/semantic encoders and the ResidualFSQ
codebook are frozen and completely unchanged β the discrete codes are identical to base
NeuCodec, so this model is a drop-in higher-fidelity decoder.
- Sample rate: 44 100 Hz Β· hop: 882 Β· 50 tokens/sec
- Trainable: decoder only (GAN: multi-period + spec discriminators; losses: multi-res mel + STFT + feature-matching + adversarial)
- Frozen: w2v-BERT semantic encoder, acoustic
CodecEnc,fc_prior/fc_post_a, FSQ codebook
Inference (self-contained)
Everything needed to run inference is in this repo β the neucodec/ package and
infer_widecodec.py. No other source code required.
pip install torch transformers huggingface_hub local-attention einops librosa soundfile
huggingface-cli login # if this repo is private (or export HF_TOKEN=hf_...)
huggingface-cli download Scicom-intl/WideCodec --local-dir WideCodec
cd WideCodec
python infer_widecodec.py --input my.wav --out-dir out # one file
python infer_widecodec.py --input folder/ --out-dir out # a directory
Or load it directly in Python:
import sys; sys.path.insert(0, "WideCodec") # the downloaded repo dir
import torch, librosa
from neucodec import NeuCodec
model = NeuCodec._from_pretrained(model_id="Scicom-intl/WideCodec", decoder_depth=20).eval().cuda()
wav16, _ = librosa.load("my.wav", sr=16000, mono=True) # encoder ingests 16 kHz mono
x = torch.from_numpy(wav16).float().view(1, 1, -1).cuda()
with torch.no_grad():
codes = model.encode_code(x) # frozen FSQ codes β 0.8 kbps, 50 tok/s
wav44 = model.decode_code(codes) # 44.1 kHz reconstruction
Files
| file | what |
|---|---|
pytorch_model.bin |
decoder weights for inference (load with NeuCodec._from_pretrained(..., decoder_depth=20)) |
last.ckpt |
full PyTorch-Lightning checkpoint with optimizer states + LR schedulers for resuming training |
How WideCodec compares (44 kHz-class, by bitrate)
Offline benchmark on a heavily multilingual 9,291-clip wideband set (50 clips Γ 188 clean β₯44.1 kHz datasets, 400+ language/dialect tags),
faster-UTMOSv2 + spectral vs ground truth. Read this by bitrate, not raw MOS β these
codecs span a 30Γ bitrate range. DAC/NeMo/EnCodec are high-bitrate multi-codebook RVQ
acoustic codecs; WideCodec is a single-codebook, 50-tokens/s code at **0.8 kbps** β
the only one here whose token stream an autoregressive LLM/TTS model can practically predict.
| codec | native SR | tokens/s | codebooks | ~bitrate | UTMOSv2 | mel-L1 β | HFβ₯11k | rolloff |
|---|---|---|---|---|---|---|---|---|
| ground truth | β | β | β | β | 2.822 | β | 0.00244 | 8263 |
| nvidia nemo44k | 44.1k | ~86 | RVQ (many) | ~6β9 kbps | 2.903 | 0.379 | 0.00196 | 8372 |
| WideCodec (ours, gs-2.0M) | 44.1k | 50 | 1 | ~0.8 kbps | 2.788 | 0.571 | 0.00223 | 9011 |
| dac | 44.1k | 86 | 9 | ~8 kbps | 2.672 | 0.341 | 0.00156 | 8185 |
| snac44k | 44.1k | multi-scale | 3β4 | ~2.6 kbps | 2.340 | 0.493 | 0.00158 | 8402 |
| encodec48k | 48k | 150 | RVQ | 24 kbps | 2.042 | 0.458 | 0.00169 | 8800 |
Bitrate = frame-rate Γ Ξ£ logβ(codebook size). WideCodec's FSQ is levels=[4]Γ8, num_quantizers=1 β 8Β·logβ4 = 16 bits/frame Γ 50 frames/s = 800 bps = 0.8 kbps
(vs DAC's 9 codebooks Γ 10 bits Γ 86 fps β 8 kbps).
The WideCodec row is the final gs-2.0M checkpoint (9,291-clip set). At ~0.8 kbps / 1 codebook it beats DAC on naturalness (UTMOSv2 2.79 vs 2.67) using ~10x fewer bits, and lands within ~0.12 of NeMo's ~6-9 kbps RVQ. It carries genuine high-band content (rolloff 9.0 kHz; HF energy ~91% of ground truth), and genuine high-band content (reference-based LSD-HF 0.96, on par with the 8-kbps RVQ codecs), trading in-band fidelity for a ~10x bitrate advantage. (PESQ/SI-SDR are excluded β they structurally penalize a low-bitrate generative decoder regardless of naturalness.) Full report: evaluation/REPORT_44k_class_codecs.md.
Training stages / which revision to pull
This model is trained in two stages. main always points at the latest stage.
| stage | data | how to load |
|---|---|---|
Stage 1 β noisy mix (steps 0β1.58M, epoch=9-step=1580000) |
8 base corpora + scale44k (~6,500 h, mostly noisy crowdsourced/podcast) |
pin revision d2c612f4319c1c1e0c65a9431a7d6db1b7955ce0 |
| Stage 2 β clean finetune (from 1.58M, clean β₯44.1 kHz only; in progress) | TTS-Clean44k + Clean-Podcast + clean-teacher pool + EARS/Expresso | main (default) |
# the `neucodec/` package is bundled in this repo (see 'Inference (self-contained)')
from neucodec import NeuCodec
# Stage 1 (first-stage noisy training) β pin the exact revision:
model = NeuCodec._from_pretrained(
model_id="Scicom-intl/WideCodec",
decoder_depth=20,
revision="d2c612f4319c1c1e0c65a9431a7d6db1b7955ce0",
)
Training data
Diverse, predominantly high-sample-rate human speech (no synthetic TTS). The scale-up group is SR-verified β₯ 44 kHz (probed before inclusion); the base corpora are long-form conversational, expressive and anechoic speech. Two groups:
Base corpora (Malaysia-AI + expressive/anechoic speech)
| dataset | content |
|---|---|
malaysia-ai/malaysian-podcast-youtube |
Malay long-form conversational podcasts (~2,234 h) |
malaysia-ai/singaporean-podcast-youtube |
Singaporean English podcasts (~1,255 h) |
malaysia-ai/Multilingual-TTS |
CommonVoice-sidon multilingual short clips |
malaysia-ai/malaysian-cartoons-youtube |
48 kHz cartoon dialogue (subset) |
malaysia-ai/malaysian-movie-youtube |
48 kHz Malay movie dialogue |
ylacombe/expresso |
48 kHz expressive read speech |
nytopop/expresso-conversational |
48 kHz improvised dialogue |
| EARS | 48 kHz anechoic fullband (emotional / conversational / reading) |
Scale-up: 336 verified β₯ 44 kHz datasets
To maximise acoustic diversity for the decoder (language-agnostic β the codebook is frozen),
training is scaled with 336 additional datasets (162 at 48 kHz, 174 at 44.1 kHz), mirrored as
<name>*audio.zip in malaysia-ai/Multilingual-TTS
and SR-verified β₯ 44 kHz. Original sources:
Full list of 336 β₯ 44 kHz source datasets
1rsh/gujarati-f-openslrβ 48000 HzAashish17405/audio-datasetβ 48000 HzAashish17405/audio-dataset-300β 48000 HzAashish17405/audio-dataset-shuffled-300β 48000 HzAbdullah500/IndicTTS-Bengaliβ 48000 HzAbdullah500/IndicTTS_BengaliOLDβ 48000 Hzadalat-ai/in22-legalβ 48000 Hzahmadafaneh/common-voice-18-arabicβ 48000 HzAIDC-AI/CSEMOTIONSβ 48000 HzAJosh/audio-datasetβ 48000 Hzalexantonov/chuvash_voiceβ 48000 Hzaliyzd95/common_voice_21_0_faβ 48000 Hzaliyzd95/common_voice_22_0_faβ 48000 Hzanian0707/hindi-tts-datasetβ 48000 Hzatlithor/talromur3_with_promptsβ 48000 Hzatlithor/talromur3_without_emotionsβ 48000 Hzbilguun/cv-mn-24.0β 48000 Hzbookbot/slr72_datasetβ 48000 HzChingkheinganba/IndicTTS_Manipuriβ 48000 Hzchuuhtetnaing/myanmar-speech-dataset-openslr-80β 48000 HzCnam-LMSSC/vibravox_enhanced_by_EBENβ 48000 HzCraneAILabs/waxal-lug-cleanβ 48000 Hzdatahiveai/arabic-multidialect-emotional-speech-demoβ 48000 HzDatarrX/burmese-synthetic-speech-corpusβ 48000 HzDDD-Cambodia/khm-asr-culturalβ 48000 Hzdeepdml/igbo-dictβ 48000 Hzdeepdml/igbo-dict-16khzβ 48000 Hzdeepdml/igbo-dict-expansionβ 48000 Hzdeepdml/igbo-dict-expansion-16khzβ 48000 Hzdeepdml/openslr-32-hq-SA-languagesβ 48000 Hzdeepdml/openslr42-khmer-ttsβ 48000 Hzdeepdml/openslr65-tamilβ 48000 Hzdeepdml/openslr80-burmeseβ 48000 Hzdoof-ferb/fpt_fosdβ 48000 Hzdoof-ferb/infore1_25hoursβ 48000 Hzespnet/ace-kising-segmentsβ 48000 Hzespnet/ace-opencpop-segmentsβ 48000 HzFatimahEmadEldin/alsanaa-emirati-arabic-asrβ 48000 Hzfluffypotatoes/f1-team-radioβ 48000 Hzfosters/lagodny-tsmok-iury-zhygamont-output_originalβ 48000 Hzfosters/lagodny-tsmok-iury-zhygamont_allβ 48000 Hzgauravparajuli/slr43β 48000 Hzggfox00000/stt-summre-fr-testβ 48000 Hzggfox00000/stt-vibravox-fr-testβ 48000 Hzhanamizuki-ai/genshin-voice-v3.3-mandarinβ 48000 Hzhanamizuki-ai/genshin-voice-v3.4-mandarinβ 48000 Hzhanamizuki-ai/genshin-voice-v3.5-mandarinβ 48000 HzHeshamHaroon/arabic-msa-25k-saudi-male-tashkeelβ 48000 HzHeshamHaroon/Dahee7β 48000 Hzhezarai/common-voice-13-faβ 48000 Hzhosein-m/french_homophone_asrβ 48000 Hzhumyn-labs/Asian-High-Fidelity-ASR-Datasetβ 48000 Hzhumyn-labs/LATAM-High-Fidelity-ASRβ 48000 Hzhypaai/Hypa-Speech-10kβ 48000 Hzhypaai/Hypa_Fleursβ 48000 Hzigidn/wuwa-voice-ENβ 48000 Hzimpriyanshu-garg00/IndicVoices-R_Hindiβ 48000 HzJacobLinCool/jl-speechβ 48000 HzJeanKouss/ewe_bible_v2_ttsβ 48000 Hzjspaulsen/vctkβ 48000 Hzjuanjucm/OpenHQ-SpeechT-GL-ENβ 48000 Hzjzsues/genshin-voice-zhβ 48000 HzKishor798/text_to_speech_datasetβ 48000 HzKppwdfgu1/Hypa-Speech-10kβ 48000 HzKrorngAI/fleurs_openslr42_mpwtβ 48000 HzKukedlc/openslr61-es-ar-fullβ 48000 Hzleduckhai/MultiMedβ 48000 Hzleduckhai/MultiMed-STβ 48000 HzLeVy4/speech-to-textβ 48000 Hzlilgoose777/nepali_speech_english_translation_shuffle_datasetβ 48000 HzLindarychwalski/pony-speechβ 48000 Hzlonghim99/khm-asr-culturalβ 48000 Hzlyhourt-FSA/khm-asr-culturalβ 48000 Hzmaikezu/dowisβ 48000 Hzmanassehzw/sna-manasseh-150-rawβ 48000 Hzmasuidrive/cv-corpus-17.0-zh-TW-client_id-groupedβ 48000 HzMatrixStudio/TTS-CCabNavMSCβ 48000 HzMatrixStudio/TTS-CFCabNavSCβ 48000 HzMatrixStudio/TTS-SCCusSerFSCβ 48000 HzMatrixStudio/TTS-SCDuFSCβ 48000 HzMax5ive/openslr-32-hq-SA-languages-Sesothoβ 48000 Hzmazesmazes/jenny-mimiβ 48000 HzMikCil/f1-team-radioβ 48000 Hzmohamedmou/DATASET-darija-ASR-cleanβ 48000 HzMohamedRashad/arabic-english-code-switchingβ 48000 HzMohamedRashad/common-voice-18-arabicβ 48000 Hzngia/ASR_pulaarβ 48000 Hzntaquan0125/steinsgate-voiceβ 48000 Hzntt123/VietBibleVox-alignedβ 48000 HzOmarAhmedSobhy/egyption-with-emotion-datasetβ 48000 HzOmarAhmedSobhy/tts-egyption-datasetβ 48000 Hzomersaidd/tts_ahmet_deniz_turβ 48000 Hzrahafvii/EGY2Kβ 48000 Hzranbirchabungbam/meiteimayek-audio-parallel-corpusβ 48000 Hzreapzor/neurologySTTβ 48000 HzRikkaBotan/nyan-jenny-formatβ 48000 HzRobotsMali/transcription-scorerβ 48000 HzSachinTelecmi/tts-hindi-stts2β 48000 Hzsartifyllc/Sukuma-Voicesβ 48000 Hzscriptaudio/f1-team-radioβ 48000 Hzsdcsdccdsd/CSEMOTIONSβ 48000 Hzshoron08/irodori-refs-10kβ 48000 Hzshreeshacharya/Dhravaniβ 48000 Hzsiddiqiya/ar-eg-datasetβ 48000 Hzslprl/StressTestβ 48000 Hzsmcproject/MSCβ 48000 Hzsomu9/iisc_mono_hindi_femaleβ 48000 Hzsomu9/iitm_mono_hindi_femaleβ 48000 Hzspeech-uk/opentts-katerynaβ 48000 Hzspeech-uk/opentts-oleksaβ 48000 Hzspeech-uk/opentts-tetianaβ 48000 Hzspeech-uk/tts-crh-abibullahβ 48000 Hzspeech-uk/tts-crh-arslanβ 48000 Hzspeech-uk/tts-crh-sevilβ 48000 HzSPRINGLab/IndicTTS-Hindiβ 48000 HzSPRINGLab/IndicTTS_Assameseβ 48000 HzSPRINGLab/IndicTTS_Bengaliβ 48000 HzSPRINGLab/IndicTTS_Kannadaβ 48000 HzSPRINGLab/IndicTTS_Malayalamβ 48000 HzSPRINGLab/IndicTTS_Manipuriβ 48000 HzSPRINGLab/IndicTTS_Marathiβ 48000 HzSPRINGLab/IndicTTS_Odiaβ 48000 HzSPRINGLab/IndicTTS_Punjabiβ 48000 HzSPRINGLab/IndicTTS_Rajasthaniβ 48000 HzSPRINGLab/IndicTTS_Tamilβ 48000 HzSPRINGLab/IndicVoices-R_Hindiβ 48000 Hzsrezas/farsi_voice_datasetβ 48000 HzSynDataLab-JA-Refs/Irodori-Ja-Spk1-10kβ 48000 HzSynDataLab-JA-Refs/Irodori-Ja-Spk2-10kβ 48000 HzSynDataLab-JA-Refs/Irodori-Ja-Spk3-10kβ 48000 HzSynDataLab-JA-Refs/Irodori-Ja-Spk4-10kβ 48000 HzSynDataLab-JA-Refs/irodori-refs-10kβ 48000 HzSynDataLab-JA-Refs/irodori-refs-10k-v2β 48000 HzSynDataLab-JA-Refs/irodori-tts-refs-12kβ 48000 HzSynDataLab-JA/Irodori-Ja-500M-v2-vs-600M-v3-compare-20β 48000 Hzsynthbot/pony-singingβ 48000 Hzsynthbot/pony-speechβ 48000 HzTamazight-NLP/TOSDβ 48000 Hzthennal/GMaSCβ 48000 Hzthennal/indic_tts_mlβ 48000 Hzthennal/mscβ 48000 HzTrelis/multimed-hardβ 48000 Hztrysem/indicvoices_r-MLβ 48000 Hzttthe/MultiMedβ 48000 Hztunis-ai/arabic_speech_corpusβ 48000 Hzvinaybabu/voice_tech_for_all_challenge_samples_outputβ 48000 Hzvoice-biomarkers/openslr-32-hq-SA-languages-Afrikaansβ 48000 Hzvoice-biomarkers/openslr-32-hq-SA-languages-isiXhosaβ 48000 Hzvoice-biomarkers/openslr-32-hq-SA-languages-Sesothoβ 48000 Hzvoice-biomarkers/openslr-32-hq-SA-languages-Setswanaβ 48000 Hzvrclc/openslr63β 48000 Hzwanasash/enwaucymraegβ 48000 Hzworldboss/ewe_bible_v2_ttsβ 48000 Hzworldboss/twi_bible_v2_ttsβ 48000 Hzyasalma/tat_hackathon_asrβ 48000 HzYehor/qirimtatar-ttsβ 48000 Hzylacombe/english_dialectsβ 48000 Hzylacombe/google-chilean-spanishβ 48000 Hzylacombe/google-tamilβ 48000 Hzymoslem/CoVoST2-EN-ARβ 48000 Hzymoslem/Living-Audio-Irishβ 48000 Hzzinc75/Vibravox_dummyβ 48000 Hz8Opt/clotho-dev-sampleβ 44100 Hzaangelakis/STOMAβ 44100 Hzadiren7/darija_speech_to_textβ 44100 Hzahmed220v/SCC22β 44100 HzAigizK/bashkort_tts_datasetβ 44100 Hzaipanjab/speech-mendeley-paβ 44100 HzALEKAS/ToneBooksPlus-Grigoriiβ 44100 Hzalimetin/turkish-parliament-speechβ 44100 Hzamine-khelif/DuBLaB-en-fr-0.7β 44100 Hzamine-khelif/DuBLaB-en-fr-0.7-f-0.2β 44100 Hzamine-khelif/DuBLaB-en-fr-0.7-f-0.5β 44100 Hzamine-khelif/DuBLaB-en-fr-0.8β 44100 HzAnilosan15/YouTube_Video_Transkriptleri_TRβ 44100 HzAnonXx/Pidgin_ASR_Dataset_Combinedβ 44100 Hzanzorq/kbd_speechβ 44100 Hzarchivartaunik/Jevanhielle_Zyhamont_outCheckedβ 44100 Hzarchivartaunik/output4Checkedβ 44100 HzBateesa/rw-tts-datasetβ 44100 Hzberatcmn/jessica-076β 44100 Hzbezzam/coraalβ 44100 HzBretagne/Lingua_Libre_brβ 44100 HzBrunoHays/Bangor-Miami-Spanish-English-Corpusβ 44100 Hzcagataydev/vlm-voice-audioβ 44100 HzCentificAIResearch/DialectalSpeech-ICLβ 44100 Hzchangelinglab/speechaccentarchive-prβ 44100 Hzchris-t-jansen/erasmian_greek_ntβ 44100 HzCodyfederer/fttrtestβ 44100 HzCodyfederer/test3434234β 44100 HzCodyfederer/tretret34543β 44100 HzCoRal-project/coral-ttsβ 44100 Hzcorti/med-termβ 44100 Hzctaguchi/killkanβ 44100 Hzczyzi0/pwr-azon-speech-datasetβ 44100 Hzczyzi0/the-mc-speech-datasetβ 44100 HzD00Movenok/russian-glados-portal2β 44100 Hzdaanbrugmans/ovb-huissen-1β 44100 Hzdata-lab-voice/echo-tts-en-benchmarks-v1β 44100 HzDataStudio/Vietnamese_ASR_TestingData_Oldβ 44100 HzEMINES/Tamazight-Speech-to-Arabic-Textβ 44100 Hzfablevi/one_voice_FACEBOOK_PARQUETβ 44100 Hzfarbodbij/persian-wordsβ 44100 Hzfiifinketia/twi-trigrams-speech-text-parallelβ 44100 Hzfosters/ales-krautsevich-karotkaia-gistoryia-belarusi-uladzimir-lisouski-output_originalβ 44100 Hzfosters/ales-krautsevich-karotkaia-gistoryia-belarusi-uladzimir-lisouski_allβ 44100 Hzfosters/ales_razanau_allβ 44100 Hzfosters/ales_razanau_output_originalβ 44100 Hzfosters/ales_zhuk_praklytaya_lyubow_allβ 44100 Hzfosters/ales_zhuk_praklytaya_lyubow_output_originalβ 44100 Hzfosters/anatol_vyartsinski_pesnya_pra_hleb_allβ 44100 Hzfosters/anatol_vyartsinski_pesnya_pra_hleb_output_originalβ 44100 Hzfosters/andre_marua_pakaranne_zolatam_allβ 44100 Hzfosters/andre_marua_pakaranne_zolatam_output_originalβ 44100 Hzfosters/Antuan_de_Sent-Ekziupiery_Planieta_ludziei_allβ 44100 Hzfosters/Antuan_de_Sent-Ekziupiery_Planieta_ludziei_output_originalβ 44100 Hzfosters/astryd_lindgren_braty_lvinae_sertsa_allβ 44100 Hzfosters/astryd_lindgren_braty_lvinae_sertsa_output_originalβ 44100 Hzfosters/bely_klyck_allβ 44100 Hzfosters/dzhozef_redzyard_kipling_allβ 44100 Hzfosters/dzhozef_redzyard_kipling_output_originalβ 44100 Hzfosters/dzintra_shultse_robertsik_allβ 44100 Hzfosters/dzintra_shultse_robertsik_output_originalβ 44100 Hzfosters/ernest_heminguei_stary_chalavek_i_mora_allβ 44100 Hzfosters/ernest_heminguei_stary_chalavek_i_mora_output_originalβ 44100 Hzfosters/eryh_maryya_remark_allβ 44100 Hzfosters/eryh_maryya_remark_output_originalβ 44100 Hzfosters/eryh_raspe_prygody_barona_myunhau_zena_allβ 44100 Hzfosters/eryh_raspe_prygody_barona_myunhau_zena_output_originalβ 44100 Hzfosters/genadz_pashkou_allβ 44100 Hzfosters/genadz_pashkou_output_originalβ 44100 Hzfosters/iagan_frydryh_shyler_kubak_allβ 44100 Hzfosters/iagan_frydryh_shyler_kubak_output_originalβ 44100 Hzfosters/iakub-kolas-kazki-zhytstsia-output_originalβ 44100 Hzfosters/iakub-kolas-kazki-zhytstsia_allβ 44100 Hzfosters/ivan-melezh-podykh-navalnitsy-valer-budzevich-output_originalβ 44100 Hzfosters/ivan-melezh-podykh-navalnitsy-valer-budzevich_allβ 44100 Hzfosters/ivan-melezh-zavei-snezhan-valer-budzevich-output_originalβ 44100 Hzfosters/ivan-melezh-zavei-snezhan-valer-budzevich_allβ 44100 Hzfosters/ivan-navumenka-zhul-vern-output_originalβ 44100 Hzfosters/ivan-navumenka-zhul-vern_allβ 44100 Hzfosters/ivan-ptashnikau-lvy-output_originalβ 44100 Hzfosters/ivan-ptashnikau-lvy_allβ 44100 Hzfosters/ivan_navumenka_sasna_pry_daroze_allβ 44100 Hzfosters/ivan_navumenka_sasna_pry_daroze_output_originalβ 44100 Hzfosters/ivan_ptashnikau_allβ 44100 Hzfosters/ivan_ptashnikau_output_originalβ 44100 Hzfosters/ivan_shamyakin_sertsa_na_daloni_allβ 44100 Hzfosters/ivan_shamyakin_sertsa_na_daloni_output_originalβ 44100 Hzfosters/ivan_shamyakin_tryvozhnae_shchastse_allβ 44100 Hzfosters/ivan_shamyakin_tryvozhnae_shchastse_output_originalβ 44100 Hzfosters/knihi-be-arlou_tancy_nad_horadam_allβ 44100 Hzfosters/knihi-be-arlou_tancy_nad_horadam_output_originalβ 44100 Hzfosters/kuzma_chorny_makarkavyh_volka_allβ 44100 Hzfosters/kuzma_chorny_makarkavyh_volka_output_originalβ 44100 Hzfosters/kuzma_chorny_poshuki_buduchyni_allβ 44100 Hzfosters/kuzma_chorny_poshuki_buduchyni_output_originalβ 44100 Hzfosters/kuzma_chorny_zyamlya_allβ 44100 Hzfosters/kuzma_chorny_zyamlya_output_originalβ 44100 Hzfosters/legendy-i-padanni_allβ 44100 Hzfosters/legendy-i-padanni_originalβ 44100 Hzfosters/maksim_tank_allβ 44100 Hzfosters/maksim_tank_output_originalβ 44100 Hzfosters/mar_yan_duksa_allβ 44100 Hzfosters/mar_yan_duksa_output_originalβ 44100 Hzfosters/raisa_baravikova_vasmiradkou_i_allβ 44100 Hzfosters/raisa_baravikova_vasmiradkou_i_output_originalβ 44100 Hzfosters/raisa_baravikova_vershy_pra_kahanne_allβ 44100 Hzfosters/raisa_baravikova_vershy_pra_kahanne_output_originalβ 44100 Hzfosters/shata_rustaveli_vitsyaz_u_tygravai_shkury_allβ 44100 Hzfosters/shata_rustaveli_vitsyaz_u_tygravai_shkury_output_originalβ 44100 Hzfosters/stefan_tsvei_g_nyabachnaya_kalektsyya_allβ 44100 Hzfosters/stefan_tsvei_g_nyabachnaya_kalektsyya_output_originalβ 44100 Hzfosters/taras_shau_chenka_vershy_paemy_allβ 44100 Hzfosters/taras_shau_chenka_vershy_paemy_output_originalβ 44100 Hzfosters/uilyam_folkner_pah_verbeny_allβ 44100 Hzfosters/uilyam_folkner_pah_verbeny_output_originalβ 44100 Hzfosters/uladzimir-karatkevich-dzikae-paliavanne-karalia-stakha-aleg-garbuz-output_originalβ 44100 Hzfosters/uladzimir-karatkevich-dzikae-paliavanne-karalia-stakha-aleg-garbuz_allβ 44100 Hzfosters/vasil_bykau_allβ 44100 Hzfosters/vasil_bykau_output_originalβ 44100 Hzfosters/vasil_zue_nok_syaliba_allβ 44100 Hzfosters/vasil_zue_nok_syaliba_output_originalβ 44100 Hzfosters/viktar_prau_dzin_allβ 44100 Hzfosters/viktar_prau_dzin_output_originalβ 44100 Hzfosters/yakub_kolas_novaya_zyamlya_allβ 44100 Hzfosters/yakub_kolas_novaya_zyamlya_output_originalβ 44100 Hzfosters/yanka_bryl_ptushki_i_gne_zdy_allβ 44100 Hzfosters/yanka_bryl_ptushki_i_gne_zdy_output_originalβ 44100 Hzfosters/yanka_sipakou_odzium_allβ 44100 Hzfosters/yanka_sipakou_odzium_output_originalβ 44100 HzfutureDoctor/turkic_tts_datasetβ 44100 Hzghananlpcommunity/asante-twi-bible-speech-phonemesβ 44100 Hzghananlpcommunity/twi-trigrams-speech-text-parallelβ 44100 Hzgrandhigh/sample-idβ 44100 Hzgrider-transwithai/nekopara-speechβ 44100 Hzhananeek2/STT-algerian-dialectβ 44100 Hzhhim8826/japanese-anime-speech-v2-splitβ 44100 Hzhumairawan/AnimeSpeechβ 44100 Hzjdapaah/asante-twi-bibleβ 44100 Hzjoujiboi/kuroyukihime-speechβ 44100 Hzkizuna-intelligence/AItuber-Persona-Voices-JAβ 44100 Hzlangswap/dialogs-ru-emotional-conversationsβ 44100 HzMatrixStudio/TTS-SCFChilSCβ 44100 Hzmetricv/tl-whisperβ 44100 HzMichel21/rick-sanchezβ 44100 HzMikhailT/hifi-ttsβ 44100 HzMohamedRashad/SCC22β 44100 HzMothersTongue/mother_tongue_datasetβ 44100 Hzmsnowchanj/pvariant-EQβ 44100 HzPragmaticl/Trys2β 44100 HzPragmaticl/TuyenVanHoa2β 44100 HzPragmaticl/TuyenVanHoa4β 44100 HzProfessor/kinyarwanda-tts-dataset-kinβ 44100 Hzray0rf1re/GLaDOS-audio-v2β 44100 Hzsachin6624/malayalam-tts-pro-voiceβ 44100 Hzshannonnonshan/ViMedCSS-Copβ 44100 HzShoukanLabs/AniSpeechβ 44100 HzSoufianeDahimi/Tamazight-ASR-Dataset-v2β 44100 Hzsudoping01/bam-asr-benchmarkβ 44100 HzSynDataLab-EN-Refs/echo-ref-speakers-4k-enβ 44100 HzSynDataLab-EN-Refs/tts-pretrain-refs-3k-mosβ 44100 HzSynDataLab-EN/EchoTTS-OmniVoice-Enβ 44100 Hztensorxt/ViMedCSSβ 44100 HzThorsten-Voice/TV-44kHz-Fullβ 44100 Hztimniel/Pidgin_ASR_Dataset_Combinedβ 44100 Hztrysem/malayalam-tts-pro-voiceβ 44100 HzTutlaytAI/kabyle_asrβ 44100 HzTutlaytAI/Kabyle_ASR-En_Translationβ 44100 HzTutlaytAI/Kabyle_ASR-Fr_Translationβ 44100 Hzvsisik/voice-dataset-liliβ 44100 Hzwcwxyz/test-audioβ 44100 HzWhissleAI/Meta_STT_ZH_AIShell3β 44100 Hzyasalma/audiobooksβ 44100 Hzymoslem/BitesizeIrish-GA-ENβ 44100 Hzyuriilaba/toronto-tv-ukrainianβ 44100 Hz
Usage
See the canonical
Load from Hugging Face
section in the source repo. decoder_depth=20 is required β the weights are a
depth-20 decoder, so loading with any other depth mismatches the architecture.
import soundfile as sf
# the `neucodec/` package is bundled in this repo (see 'Inference (self-contained)')
from neucodec import NeuCodec
# decoder_depth=20 MUST match this repo; pass token=... (or hf login) for access
model = NeuCodec._from_pretrained(model_id="Scicom-intl/WideCodec", decoder_depth=20)
model = model.eval().cuda()
# encode (16 kHz path, frozen) -> codes -> decode (44.1 kHz, this finetune)
codes = model.encode_code("input.wav") # [1, 1, T], identical to base NeuCodec
recon_44k = model.decode_code(codes).squeeze().cpu().numpy()
sf.write("recon.wav", recon_44k, model.sample_rate) # 44100
The discrete codes are identical to base neuphonic/neucodec β only the reconstruction
sample rate and fidelity differ.
