SEA-CLIP-Tiny (ACCV 2026)
Collection
Weights, ablations and training data for SEA-CLIP-Tiny: a 46M-parameter multilingual text-vision embedding model for Southeast Asian languages. โข 15 items โข Updated
How to use fassabilf/sea-clip-tiny-init with OpenCLIP:
import open_clip
model, preprocess_train, preprocess_val = open_clip.create_model_and_transforms('hf-hub:fassabilf/sea-clip-tiny-init')
tokenizer = open_clip.get_tokenizer('hf-hub:fassabilf/sea-clip-tiny-init')The English CLIP-KD student checkpoint used to initialise every SEA-CLIP-Tiny run in SEA-CLIP-Tiny (ACCV 2026). It is the starting point, not a trained SEA model: no Southeast Asian data has been seen at this point.
import open_clip
model, _, preprocess = open_clip.create_model_and_transforms('hf-hub:fassabilf/sea-clip-tiny-init')
tokenizer = open_clip.get_tokenizer('hf-hub:fassabilf/sea-clip-tiny-init')
| Architecture | ViT-T/16 vision tower + 12-layer / 384-wide text tower, embed dim 512 |
| Tokenizer | CLIP BPE, vocab 49408, context length 77 |
| Parameters | 46.11M (5.62M vision + 40.49M text) |
| Training data | English CLIP-KD pretraining (no SEA data) |
| Teacher | โ |
Training and evaluation code: https://github.com/fassabilf/sea-clip-tiny.
The exact training configuration of this checkpoint is in params.txt in this repo.
@inproceedings{seacliptiny2026,
title = {SEA-CLIP-Tiny: Efficient Multilingual Text-Vision Embedding for Southeast Asian Languages},
booktitle = {Asian Conference on Computer Vision (ACCV)},
year = {2026}
}