Qwen3-4B Calendar Agent SFT

이 모델은 Calendar 일정 관리, 다중 참석자 생성, 읽기 전용 대조군의 성공 궤적에서 assistant 생성 토큰만 학습한 LoRA SFT 병합 모델입니다. 도구 호출은 Asia/Seoul 시간대의 메모리 Calendar 환경을 대상으로 합니다. 학습 데이터는 NotoriousH2/calendar-agent-benchmark revision fb8ed4b3735eda3b06f10a7b634d84d38665c016를 사용했습니다.

1. 사용

from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "NotoriousH2/Qwen3-4B-Calendar-Agent-SFT"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id, device_map="auto")

LoRA 파일과 토크나이저는 adapter/에 있습니다. 학습 설정은 training_config.json, 전체 학습 기록은 history.json에서 확인할 수 있습니다. 공개 병합 모델은 정해진 SFT 학습의 종료 체크포인트를 사용합니다. 이 저장소는 checkpoint-60(학습 step 60)을 포함합니다. 선택 근거: 60 step으로 설정한 SFT 학습의 최종 체크포인트 데이터 해시, dev 지표, 모델 해시는 selected_checkpoint.json에 있습니다.

2. 평가

모든 모델은 같은 final 시나리오에서 실제 도구 루프로 평가했습니다.

모델 Valid Tool Call Policy Compliance Task Success Average Tool Calls
Base 100.00% 80.00% 20.00% 0.80
SFT 100.00% 89.00% 89.00% 2.48

시나리오별 궤적과 판정 근거는 base_evaluation.jsonsft_evaluation.json에 있습니다.

3. 제한

이 모델은 합성 시나리오와 메모리 Calendar 환경에서 학습했습니다. 실제 일정 서비스의 인증, 권한, 개인정보, 장애 복구를 처리하지 않습니다.

Downloads last month
28
Safetensors
Model size
4B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for NotoriousH2/Qwen3-4B-Calendar-Agent-SFT

Finetuned
Qwen/Qwen3-4B
Finetuned
(1069)
this model
Finetunes
1 model
Quantizations
1 model

Dataset used to train NotoriousH2/Qwen3-4B-Calendar-Agent-SFT

Collection including NotoriousH2/Qwen3-4B-Calendar-Agent-SFT