TARS-Llama-3-8B-Instruct

這是基於 meta-llama/Meta-Llama-3-8B-Instruct 以 QLoRA 微調的實驗性模型,微調目標是觀察並引導模型在回答問題時,先在 <thinking>...</thinking> 標籤中輸出思考過程(Chain-of-Thought),並搭配一個獨立的判斷模型(judge model)在偵測到不當/不安全 的思考內容時中止生成、改以拒絕回答取代。

這個模型是做什麼的

  • 用途:AI safety / interpretability 研究實驗,觀察 CoT 推理過程如何隨微調變化, 以及能否用外部判斷機制攔截不安全的推理路徑。
  • 不是:這不是一個經過完整安全評測、可直接用於生產環境的安全防護模型。 CoT guard 機制目前僅基於少量參考文本校準,未經大規模紅隊測試,請勿當作唯一的安全防線使用

訓練方式

  • 基礎模型:meta-llama/Meta-Llama-3-8B-Instruct
  • 方法:QLoRA(4-bit NF4 量化 + LoRA),r=16,alpha=32,dropout=0.05, 目標模組:q_proj,k_proj,v_proj,o_proj,gate_proj,up_proj,down_proj
  • 訓練資料:少量(約 5~10 筆)人工標註、含 CoT 推理過程的問答資料,格式為 <thinking>推理過程</thinking>\n\n最終答案:...
  • Epochs:3,學習率:2e-4

如何使用

from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained("w831152001/TARS-Llama-3-8B-Instruct")

tokenizer = AutoTokenizer.from_pretrained("w831152001/TARS-Llama-3-8B-Instruct")

授權

本模型基於 Meta Llama 3,依 Llama 3 Community License 授權, 使用前請詳閱該授權條款(包含使用限制、標示 "Built with Meta Llama 3" 的要求等)。

回饋

歡迎提出任何想改進模型的建議;此模型由台灣軟體工程師微調訓練。


Downloads last month
-
Safetensors
Model size
8B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for w831152001/TARS-Llama-3-8B-Instruct

Adapter
(1209)
this model
Adapters
1 model