ESPnet3 cls model

Packed model bundle generated from egs3/meld/cls.

Model

  • Repository: espnet/meld_cls_wavlm_base_plus
  • Recipe: egs3/meld/cls
  • Corpus: meld
  • System: cls
  • Creator: ito
  • Created: 2026-09-11T12:23:20
  • Branch: recipe/meld-cls-espnet3
  • Git: 322d199a02 (dirty)
  • Origin: https://github.com/itoten/espnet.git

Model summary

  • Class: ESPnetClassificationModel
  • Total parameters: 95,801,220
  • Learnable parameters: 95,801,220 (100.0%)
  • Non-trainable parameters: 0
  • Parameter size: 383.2 MB
  • Buffers: 0 (0 bytes)
  • Modules: 308 total, 250 leaf
  • DType composition: torch.float32(100.0%)

Usage

from espnet3.publication import InferenceModel

model = InferenceModel.from_pretrained("espnet/meld_cls_wavlm_base_plus", trust_user_code=True)
result = model(sample)

Packaging

  • Bundle: model_pack
  • Exp dir: ./exp/train_cls_wavlm_transformer
  • Strategy: copy experiment outputs; include extra recipe assets; apply exclude filters

Results

dataset AUC MacroF1 UA WA mAP
test 70.05 26.17 25.44 52.72 28.3
valid 69.57 26.07 26.07 48.55 30.45

Training config

expand
num_device: 1
num_nodes: 1
task: espnet2.tasks.cls.CLSTask
recipe_dir: .
data_dir: /mnt/ssd1tb/meld_espnet3/
exp_tag: train_cls_wavlm_transformer
exp_dir: ./exp/train_cls_wavlm_transformer
stats_dir: ./exp/stats
create_dataset:
  recipe_dir: .
dataset:
  _target_: espnet3.components.data.data_organizer.DataOrganizer
  _recursive_: false
  recipe_dir: .
  train:
  - data_src_args:
      split: train
  valid:
  - data_src_args:
      split: valid
  test: null
  preprocessor:
    _target_: espnet2.train.preprocessor.CommonPreprocessor
    fs: 16000
    text_name: label
    token_type: word
    token_list: /mnt/ssd1tb/meld_espnet3//token_list
    _convert_: all
  _convert_: all
remove_long_short:
  min_wav_duration: 0.1
  max_wav_duration: 20
  splits:
  - train
  - valid
  save_path: /mnt/ssd1tb/meld_espnet3//manifest_filtered
  manifest_paths:
    train: /mnt/ssd1tb/meld_espnet3//manifest/train.tsv
    valid: /mnt/ssd1tb/meld_espnet3//manifest/valid.tsv
prepare_labels:
  save_path: /mnt/ssd1tb/meld_espnet3/
  filename: token_list
  manifest_path: /mnt/ssd1tb/meld_espnet3//manifest_filtered/train.tsv
  add_symbol:
  - <unk>:-1
model:
  token_list: /mnt/ssd1tb/meld_espnet3//token_list
  frontend: s3prl
  frontend_conf:
    frontend_conf:
      upstream: wavlm_base_plus
    multilayer_feature: true
  freeze_param:
  - frontend.upstream
  normalize: utterance_mvn
  normalize_conf: {}
  encoder: transformer
  encoder_conf:
    output_size: 128
    attention_heads: 4
    linear_units: 1024
    num_blocks: 4
    dropout_rate: 0.4
    input_layer: linear
  decoder: linear
  model_conf:
    classification_type: multi-class
optimizer:
  _target_: torch.optim.Adam
  lr: 0.001
  weight_decay: 0
  _convert_: all
scheduler:
  _target_: espnet2.schedulers.warmup_lr.WarmupLR
  warmup_steps: 3180
  _convert_: all
scheduler_interval: step
scheduler_monitor: null
best_model_criterion:
- - valid/acc
  - 1
  - max
seed: 0
init: null
parallel:
  env: local
  n_workers: 1
dataloader:
  collate_fn:
    _target_: espnet2.train.collate_fn.CommonCollateFn
    int_pad_value: -1
    _convert_: all
  train:
    total_shards: 1
    dist_world_size: 1
    iter_factory:
      _target_: espnet2.iterators.sequence_iter_factory.SequenceIterFactory
      shuffle: true
      collate_fn:
        _target_: espnet2.train.collate_fn.CommonCollateFn
        int_pad_value: -1
        _convert_: all
      batches:
        type: folded
        shape_files:
        - ./exp/stats/train/feats_shape
        batch_size: 32
        batch_bins: 4000000
        fold_lengths:
        - 500
        sort_in_batch: descending
        sort_batch: descending
      _convert_: all
  valid:
    total_shards: 1
    dist_world_size: 1
    iter_factory:
      _target_: espnet2.iterators.sequence_iter_factory.SequenceIterFactory
      shuffle: false
      collate_fn:
        _target_: espnet2.train.collate_fn.CommonCollateFn
        int_pad_value: -1
        _convert_: all
      batches:
        type: folded
        shape_files:
        - ./exp/stats/valid/feats_shape
        batch_size: 32
        batch_bins: 4000000
        fold_lengths:
        - 500
        sort_in_batch: descending
        sort_batch: descending
      _convert_: all
trainer:
  accelerator: auto
  devices: 1
  num_nodes: 1
  accumulate_grad_batches: 1
  check_val_every_n_epoch: 1
  gradient_clip_val: 5.0
  log_every_n_steps: 100
  max_epochs: 30
  logger:
  - _target_: lightning.pytorch.loggers.TensorBoardLogger
    save_dir: ./exp/train_cls_wavlm_transformer/tensorboard
    name: tb_logger
    _convert_: all
  strategy: auto
  callbacks:
  - _target_: lightning.pytorch.callbacks.EarlyStopping
    monitor: valid/acc
    mode: max
    patience: 5
    _convert_: all
fit: {}

Citing ESPnet

@inproceedings{watanabe2018espnet,
  author={Shinji Watanabe and Takaaki Hori and Shigeki Karita and Tomoki Hayashi and
    Jiro Nishitoba and Yuya Unno and Nelson Yalta and Jahn Heymann and Matthew Wiesner
    and Nanxin Chen and Adithya Renduchintala and Tsubasa Ochiai},
  title={{ESPnet}: End-to-End Speech Processing Toolkit},
  year={2018},
  booktitle={Proceedings of Interspeech},
  pages={2207--2211},
  doi={10.21437/Interspeech.2018-1456}
}
Downloads last month
15
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support