Tokens indicate unbalanced subsets, that do not represent general English
#8 opened about 7 hours ago
by
foss22
Capitalization not normalized
#6 opened about 9 hours ago
by
foss22
When capital letter matters?
#5 opened about 9 hours ago
by
foss22
Page numbers dominate 645 num tokens
#4 opened about 10 hours ago
by
foss22
Remove ---- .... === ### dupes from datasets and tokenizer
👍 1
3
#3 opened 4 days ago
by
foss22
F16 NaN in 10 steps workaround
1
#2 opened 5 days ago
by
foss22
Extrapolation of 760 achievable steps/hour findins to 75k-steps based on what?
2
#1 opened 5 days ago
by
foss22