Tokenizer efficiency hakkindaki kafa karisikligim

#11
by ocg2347 - opened

Merhabalar,

Cok guzel bir calisma, ellerinize saglik! Tarihe gectiniz, gurur verici olmali :)

Soyle bir kafa karsikligim var. Train data icin
It is pre-trained on a cleaned, deduplicated corpora of 500 GB for 300B tokens, and supervised fine-tuned on 1M examples.

demissiniz burdan en iyi ihtimalle 500B char'lik bir veri uzerinde, 300B token ile calistiginizi anliyorum. yani token basina 1.66 char gibi, bu gpt tokenizerina gore cok cok dusuk bir rakam. Ama plotlariniz tam tersi yonde.

Acaba neyi kaciriyorum diye danismak istedim.

Merhaba. 500GB verisetleri Huggingface Dataset formatında diske yazıldığındaki toplam boyut. Dolayısıyla 500GB sayısının token sayısı ile doğrudan bir ilişkisi yok.
Bu veri, Kumru tokenizer ile tokenize edildiğinde de toplam 100B token ediyor. Dolayısıyla 300B token'lık eğitim, 3 epoch'a tekabül ediyor.

Sign up or log in to comment