Instructions to use espnet/meld_cls_wavlm_base_plus with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- ESPnet
How to use espnet/meld_cls_wavlm_base_plus with ESPnet:
unknown model type (must be text-to-speech or automatic-speech-recognition)
- Notebooks
- Google Colab
- Kaggle
ESPnet3 cls model
Packed model bundle generated from egs3/meld/cls.
Model
- Repository:
espnet/meld_cls_wavlm_base_plus - Recipe:
egs3/meld/cls - Corpus:
meld - System:
cls - Creator:
ito - Created:
2026-09-11T12:23:20 - Branch:
recipe/meld-cls-espnet3 - Git:
322d199a02(dirty) - Origin: https://github.com/itoten/espnet.git
Model summary
- Class:
ESPnetClassificationModel - Total parameters:
95,801,220 - Learnable parameters:
95,801,220(100.0%) - Non-trainable parameters:
0 - Parameter size:
383.2 MB - Buffers:
0(0 bytes) - Modules:
308total,250leaf - DType composition:
torch.float32(100.0%)
Usage
from espnet3.publication import InferenceModel
model = InferenceModel.from_pretrained("espnet/meld_cls_wavlm_base_plus", trust_user_code=True)
result = model(sample)
Packaging
- Bundle:
model_pack - Exp dir:
./exp/train_cls_wavlm_transformer - Strategy:
copy experiment outputs; include extra recipe assets; apply exclude filters
Results
| dataset | AUC | MacroF1 | UA | WA | mAP |
|---|---|---|---|---|---|
| test | 70.05 | 26.17 | 25.44 | 52.72 | 28.3 |
| valid | 69.57 | 26.07 | 26.07 | 48.55 | 30.45 |
Training config
expand
num_device: 1
num_nodes: 1
task: espnet2.tasks.cls.CLSTask
recipe_dir: .
data_dir: /mnt/ssd1tb/meld_espnet3/
exp_tag: train_cls_wavlm_transformer
exp_dir: ./exp/train_cls_wavlm_transformer
stats_dir: ./exp/stats
create_dataset:
recipe_dir: .
dataset:
_target_: espnet3.components.data.data_organizer.DataOrganizer
_recursive_: false
recipe_dir: .
train:
- data_src_args:
split: train
valid:
- data_src_args:
split: valid
test: null
preprocessor:
_target_: espnet2.train.preprocessor.CommonPreprocessor
fs: 16000
text_name: label
token_type: word
token_list: /mnt/ssd1tb/meld_espnet3//token_list
_convert_: all
_convert_: all
remove_long_short:
min_wav_duration: 0.1
max_wav_duration: 20
splits:
- train
- valid
save_path: /mnt/ssd1tb/meld_espnet3//manifest_filtered
manifest_paths:
train: /mnt/ssd1tb/meld_espnet3//manifest/train.tsv
valid: /mnt/ssd1tb/meld_espnet3//manifest/valid.tsv
prepare_labels:
save_path: /mnt/ssd1tb/meld_espnet3/
filename: token_list
manifest_path: /mnt/ssd1tb/meld_espnet3//manifest_filtered/train.tsv
add_symbol:
- <unk>:-1
model:
token_list: /mnt/ssd1tb/meld_espnet3//token_list
frontend: s3prl
frontend_conf:
frontend_conf:
upstream: wavlm_base_plus
multilayer_feature: true
freeze_param:
- frontend.upstream
normalize: utterance_mvn
normalize_conf: {}
encoder: transformer
encoder_conf:
output_size: 128
attention_heads: 4
linear_units: 1024
num_blocks: 4
dropout_rate: 0.4
input_layer: linear
decoder: linear
model_conf:
classification_type: multi-class
optimizer:
_target_: torch.optim.Adam
lr: 0.001
weight_decay: 0
_convert_: all
scheduler:
_target_: espnet2.schedulers.warmup_lr.WarmupLR
warmup_steps: 3180
_convert_: all
scheduler_interval: step
scheduler_monitor: null
best_model_criterion:
- - valid/acc
- 1
- max
seed: 0
init: null
parallel:
env: local
n_workers: 1
dataloader:
collate_fn:
_target_: espnet2.train.collate_fn.CommonCollateFn
int_pad_value: -1
_convert_: all
train:
total_shards: 1
dist_world_size: 1
iter_factory:
_target_: espnet2.iterators.sequence_iter_factory.SequenceIterFactory
shuffle: true
collate_fn:
_target_: espnet2.train.collate_fn.CommonCollateFn
int_pad_value: -1
_convert_: all
batches:
type: folded
shape_files:
- ./exp/stats/train/feats_shape
batch_size: 32
batch_bins: 4000000
fold_lengths:
- 500
sort_in_batch: descending
sort_batch: descending
_convert_: all
valid:
total_shards: 1
dist_world_size: 1
iter_factory:
_target_: espnet2.iterators.sequence_iter_factory.SequenceIterFactory
shuffle: false
collate_fn:
_target_: espnet2.train.collate_fn.CommonCollateFn
int_pad_value: -1
_convert_: all
batches:
type: folded
shape_files:
- ./exp/stats/valid/feats_shape
batch_size: 32
batch_bins: 4000000
fold_lengths:
- 500
sort_in_batch: descending
sort_batch: descending
_convert_: all
trainer:
accelerator: auto
devices: 1
num_nodes: 1
accumulate_grad_batches: 1
check_val_every_n_epoch: 1
gradient_clip_val: 5.0
log_every_n_steps: 100
max_epochs: 30
logger:
- _target_: lightning.pytorch.loggers.TensorBoardLogger
save_dir: ./exp/train_cls_wavlm_transformer/tensorboard
name: tb_logger
_convert_: all
strategy: auto
callbacks:
- _target_: lightning.pytorch.callbacks.EarlyStopping
monitor: valid/acc
mode: max
patience: 5
_convert_: all
fit: {}
Citing ESPnet
@inproceedings{watanabe2018espnet,
author={Shinji Watanabe and Takaaki Hori and Shigeki Karita and Tomoki Hayashi and
Jiro Nishitoba and Yuya Unno and Nelson Yalta and Jahn Heymann and Matthew Wiesner
and Nanxin Chen and Adithya Renduchintala and Tsubasa Ochiai},
title={{ESPnet}: End-to-End Speech Processing Toolkit},
year={2018},
booktitle={Proceedings of Interspeech},
pages={2207--2211},
doi={10.21437/Interspeech.2018-1456}
}
- Downloads last month
- 15
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support