EnViT5-base Fine-Tune

Mô hình này được fine-tune từ checkpoint VietAI/envit5-base cho bài toán dịch máy y tế Anh–Việt. Kết quả đạt được trên tập đánh giá:

  • Loss: 0.6410
  • Bleu: 49.5803
  • Meteor: 0.7222
  • Ter: 42.8713

Mô tả mô hình

Mô hình được xây dựng dựa trên kiến trúc T5 (Text-to-Text Transfer Transformer), cụ thể là checkpoint VietAI/envit5-base đã được pre-train trên dữ liệu song ngữ Anh–Việt.

Mô hình được fine-tune cho bài toán dịch máy sequence-to-sequence, sử dụng tiền tố en-vi: theo chuẩn của T5. Do sự không tương thích giữa file tokenizer.json gốc (được serialize từ phiên bản cũ) với các phiên bản mới của thư viện transformers/tokenizers, mô hình sử dụng T5Tokenizer (slow) dựa trực tiếp trên spiece.model thay vì FastTokenizer.

Mục đích sử dụng & hạn chế

Mục đích sử dụng:

  • Dịch văn bản y tế/lâm sàng từ tiếng Anh sang tiếng Việt
  • Phù hợp với các câu hoặc đoạn văn ngắn trong lĩnh vực y tế (≤ 128 token)

Hạn chế:

  • Độ dài input/output tối đa là 128 token — các chuỗi dài hơn sẽ bị cắt bớt
  • Hiệu quả có thể giảm khi áp dụng cho văn bản ngoài lĩnh vực y tế
  • Tốc độ tokenization chậm hơn một chút so với FastTokenizer do sử dụng T5Tokenizer (slow)

Dữ liệu huấn luyện và đánh giá

Mô hình được huấn luyện trên nhuvo/MedEV, một bộ ngữ liệu song ngữ Anh–Việt trong lĩnh vực y tế.

Tập dữ liệu File tiếng Anh File tiếng Việt
Huấn luyện train.en.txt train.vi.txt
Kiểm định val.en.new.txt val.vi.new.txt
Kiểm tra test.en.new.txt test.vi.new.txt

Quy trình huấn luyện

Tiền xử lý dữ liệu

  • Tiền tố "en-vi: " được thêm vào đầu mỗi câu nguồn (tiếng Anh)
  • Độ dài input tối đa: 128 token; độ dài output tối đa: 128 token
  • Tokenizer: T5Tokenizer (slow) sử dụng spiece.model, được load sau khi xóa file tokenizer.json không tương thích
  • DataCollatorForSeq2Seq với label_pad_token_id=-100pad_to_multiple_of=8

Các độ đo đánh giá

  • BLEU (sacrebleu): đo độ trùng khớp n-gram giữa bản dịch và tham chiếu
  • METEOR: đo độ tương đồng ngữ nghĩa có tính đến synonym matching
  • TER (Translation Edit Rate): đo khoảng cách chỉnh sửa so với tham chiếu — giá trị càng thấp càng tốt

Trong quá trình suy luận (inference), mô hình sử dụng beam search với num_beams=4early_stopping=True.

Siêu tham số huấn luyện

Các siêu tham số được sử dụng trong quá trình huấn luyện:

  • learning_rate: 0.0002
  • train_batch_size: 16
  • eval_batch_size: 16
  • seed: 42
  • gradient_accumulation_steps: 2
  • total_train_batch_size: 32
  • optimizer: OptimizerNames.ADAMW_TORCH_FUSED với betas=(0.9,0.999) và epsilon=1e-08, không có tham số bổ sung
  • lr_scheduler_type: linear
  • num_epochs: 5
  • mixed_precision_training: Native AMP

Kết quả huấn luyện

Training Loss Epoch Step Bleu Validation Loss Meteor Ter
3.4538 1.0 10654 43.0984 0.8263 0.6720 48.4650
2.8809 2.0 21308 46.3935 0.7085 0.6992 45.2675
2.4845 3.0 31962 47.9926 0.6644 0.7112 44.0943
2.2034 4.0 42616 49.1429 0.6421 0.7198 43.1380
1.9834 5.0 53270 49.5803 0.6410 0.7222 42.8713

Phiên bản thư viện

  • Transformers 5.0.0
  • Pytorch 2.10.0+cu128
  • Datasets 4.8.3
  • Tokenizers 0.22.2
Downloads last month
5
Safetensors
Model size
0.4B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support