Text-JEPA Streaming Embeddings

Семантические эмбеддинги, обученные с помощью Text-JEPA (Joint Embedding Predictive Architecture) на датасете FineWeb-Edu через Streaming Pipeline.

🚀 Особенности

  • Базовая модель: BGE-Small-EN-v1.5 (ONNX)
  • Архитектура: 2-layer Transformer Encoder + VICReg Loss
  • Output dimension: 128
  • Поддержка: NVIDIA GPU (CUDA) и CPU (AVX2/FMA) с автоопределением
  • Обучение: 50K+ шагов на 500K примерах (Streaming)

📦 Быстрый старт

from huggingface_hub import snapshot_download

# Скачать все веса и код
snapshot_download("vasil646/jepa_text", local_dir="./jepa_text")
Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for vasil646/jepa_text

Finetuned
(372)
this model

Dataset used to train vasil646/jepa_text