Instructions to use ndhieu1101/kaggle_train_final with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use ndhieu1101/kaggle_train_final with Transformers:
# Load model directly from transformers import AutoTokenizer, AutoModelForSeq2SeqLM tokenizer = AutoTokenizer.from_pretrained("ndhieu1101/kaggle_train_final") model = AutoModelForSeq2SeqLM.from_pretrained("ndhieu1101/kaggle_train_final", device_map="auto") - Notebooks
- Google Colab
- Kaggle
EnViT5-base Fine-Tune
Mô hình này được fine-tune từ checkpoint VietAI/envit5-base cho bài toán dịch máy y tế Anh–Việt.
Kết quả đạt được trên tập đánh giá:
- Loss: 0.6410
- Bleu: 49.5803
- Meteor: 0.7222
- Ter: 42.8713
Mô tả mô hình
Mô hình được xây dựng dựa trên kiến trúc T5 (Text-to-Text Transfer Transformer), cụ thể là checkpoint VietAI/envit5-base đã được pre-train trên dữ liệu song ngữ Anh–Việt.
Mô hình được fine-tune cho bài toán dịch máy sequence-to-sequence, sử dụng tiền tố en-vi: theo chuẩn của T5. Do sự không tương thích giữa file tokenizer.json gốc (được serialize từ phiên bản cũ) với các phiên bản mới của thư viện transformers/tokenizers, mô hình sử dụng T5Tokenizer (slow) dựa trực tiếp trên spiece.model thay vì FastTokenizer.
Mục đích sử dụng & hạn chế
Mục đích sử dụng:
- Dịch văn bản y tế/lâm sàng từ tiếng Anh sang tiếng Việt
- Phù hợp với các câu hoặc đoạn văn ngắn trong lĩnh vực y tế (≤ 128 token)
Hạn chế:
- Độ dài input/output tối đa là 128 token — các chuỗi dài hơn sẽ bị cắt bớt
- Hiệu quả có thể giảm khi áp dụng cho văn bản ngoài lĩnh vực y tế
- Tốc độ tokenization chậm hơn một chút so với FastTokenizer do sử dụng
T5Tokenizer(slow)
Dữ liệu huấn luyện và đánh giá
Mô hình được huấn luyện trên nhuvo/MedEV, một bộ ngữ liệu song ngữ Anh–Việt trong lĩnh vực y tế.
| Tập dữ liệu | File tiếng Anh | File tiếng Việt |
|---|---|---|
| Huấn luyện | train.en.txt |
train.vi.txt |
| Kiểm định | val.en.new.txt |
val.vi.new.txt |
| Kiểm tra | test.en.new.txt |
test.vi.new.txt |
Quy trình huấn luyện
Tiền xử lý dữ liệu
- Tiền tố
"en-vi: "được thêm vào đầu mỗi câu nguồn (tiếng Anh) - Độ dài input tối đa: 128 token; độ dài output tối đa: 128 token
- Tokenizer:
T5Tokenizer(slow) sử dụngspiece.model, được load sau khi xóa filetokenizer.jsonkhông tương thích DataCollatorForSeq2Seqvớilabel_pad_token_id=-100vàpad_to_multiple_of=8
Các độ đo đánh giá
- BLEU (sacrebleu): đo độ trùng khớp n-gram giữa bản dịch và tham chiếu
- METEOR: đo độ tương đồng ngữ nghĩa có tính đến synonym matching
- TER (Translation Edit Rate): đo khoảng cách chỉnh sửa so với tham chiếu — giá trị càng thấp càng tốt
Trong quá trình suy luận (inference), mô hình sử dụng beam search với num_beams=4 và early_stopping=True.
Siêu tham số huấn luyện
Các siêu tham số được sử dụng trong quá trình huấn luyện:
- learning_rate: 0.0002
- train_batch_size: 16
- eval_batch_size: 16
- seed: 42
- gradient_accumulation_steps: 2
- total_train_batch_size: 32
- optimizer: OptimizerNames.ADAMW_TORCH_FUSED với betas=(0.9,0.999) và epsilon=1e-08, không có tham số bổ sung
- lr_scheduler_type: linear
- num_epochs: 5
- mixed_precision_training: Native AMP
Kết quả huấn luyện
| Training Loss | Epoch | Step | Bleu | Validation Loss | Meteor | Ter |
|---|---|---|---|---|---|---|
| 3.4538 | 1.0 | 10654 | 43.0984 | 0.8263 | 0.6720 | 48.4650 |
| 2.8809 | 2.0 | 21308 | 46.3935 | 0.7085 | 0.6992 | 45.2675 |
| 2.4845 | 3.0 | 31962 | 47.9926 | 0.6644 | 0.7112 | 44.0943 |
| 2.2034 | 4.0 | 42616 | 49.1429 | 0.6421 | 0.7198 | 43.1380 |
| 1.9834 | 5.0 | 53270 | 49.5803 | 0.6410 | 0.7222 | 42.8713 |
Phiên bản thư viện
- Transformers 5.0.0
- Pytorch 2.10.0+cu128
- Datasets 4.8.3
- Tokenizers 0.22.2
- Downloads last month
- 5