Sentence Similarity
Adapters
Safetensors
sentence-transformers
English
Chinese
qwen3
mteb
retriever
text-embeddings-inference
custom_code
Instructions to use infgrad/Jasper-Token-Compression-600M with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Adapters
How to use infgrad/Jasper-Token-Compression-600M with Adapters:
from adapters import AutoAdapterModel model = AutoAdapterModel.from_pretrained("fill-in-model-name") model.load_adapter("infgrad/Jasper-Token-Compression-600M", set_active=True) - sentence-transformers
How to use infgrad/Jasper-Token-Compression-600M with sentence-transformers:
from sentence_transformers import SentenceTransformer model = SentenceTransformer("infgrad/Jasper-Token-Compression-600M", trust_remote_code=True) sentences = [ "That is a happy person", "That is a happy dog", "That is a very happy person", "Today is a sunny day" ] embeddings = model.encode(sentences) similarities = model.similarity(embeddings, embeddings) print(similarities.shape) # [4, 4] - Notebooks
- Google Colab
- Kaggle
Unsupervised training data inquiry
#3
by majfu - opened
Hello,
I was wondering if there's any more detail available on the datasets used in stages 1-3 training, the report paper mentions "12-million bilingual unsupervised paragraph dataset, with a roughly 1:1 ratio between Chinese and English texts". Is there any information on which specific datasets were used? If not, then maybe some general information about domain coverage, where the texts were sourced or how long the paragraphs were?
I would be very grateful for any help π