YAML Metadata Warning:empty or missing yaml metadata in repo card

Check out the documentation for more information.

Reinforcement Learning Domain Adaptation (ADRL)

Repositorio centralizado de modelos adaptados para el dominio biom茅dico.

Estructura de Modelos

SFT (Supervised Fine-Tuning)

  • SFT/SFT-70/: Modelo adaptado con 70% del dataset combinado (HealthCareMagic + iCliniq). Base para GRPO.
  • SFT/SFT-80/: Modelo adaptado con 80% del dataset.
  • SFT/SFT-90/: Modelo adaptado con 90% del dataset.
  • SFT/SFT-100/: Modelo adaptado con 100% del dataset (en progreso).

GRPO (Group Relative Policy Optimization)

  • GRPO/Scaffold-Fade-ckpt5712/: Modelo entrenado con scaffold-fade y r煤bricas at贸micas.
  • GRPO/V19/: Modelo con judge por c贸digo (checkpoint-2450).
  • GRPO/V20/: Modelo con reward h铆brido y desvanecimiento de entidades (checkpoint-2500).
  • GRPO/V22/: Modelo con razonamiento cl铆nico y reward asim茅trico (checkpoint-2000).
  • GRPO/V23/: Modelo con base SFT-90 y fade suave (checkpoint-2000).
  • GRPO/V24/: Modelo con pensamiento cl铆nico aut贸nomo (activo).
  • GRPO/V25/: Modelo con consulta directa aut贸noma (activo).
Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 馃檵 Ask for provider support