arxiv:2609.11682
Jerry smith
Lpc206
AI & ML interests
Agent, Online learning, Post-training
Recent Activity
authored a paper about 16 hours ago
COBRA-Skills: Contextual Bandit-Guided Evolution for Agent Skill Optimization upvoted a paper about 20 hours ago
SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation upvoted a paper about 23 hours ago
COBRA-Skills: Contextual Bandit-Guided Evolution for Agent Skill OptimizationOrganizations
None yet