Lexsi Labs AgentTune

agenttune-testrun-PPO

Built using AgentTune — agentic workflows, then train / evaluate / distill / self-heal through one trajectory schema.

Finetuned from HuggingFaceTB/SmolLM2-360M-Instruct
Algorithm ppo
Backend trl
Artifact adapter
Published 2026-09-08 09:05 UTC

Usage

from peft import AutoPeftModelForCausalLM
from transformers import AutoTokenizer

model = AutoPeftModelForCausalLM.from_pretrained("ram-lexsi/agenttune-testrun-PPO")
tokenizer = AutoTokenizer.from_pretrained("ram-lexsi/agenttune-testrun-PPO")

This repo is a LoRA adapter. Load it on top of HuggingFaceTB/SmolLM2-360M-Instruct (PEFT does that from adapter_config.json).

Community: Lexsi Discord

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for ram-lexsi/agenttune-testrun-PPO

Finetuned
(173)
this model