中文安全对话大模型“卫言”

简介

卫言(WeiYan-3B)是哈尔滨工业大学SCIR情感计算组开源的安全对话大语言模型。该模型基于Qwen2.5-3B训练,旨在识别多轮对话中的潜在风险,具备深度防御能力。

卫言具备以下核心特点:

  • 出色的对话安全防护能力:在单轮安全基础上,显著提升对多轮隐蔽攻击的防御能力;
  • 轻度过度安全:在保障安全回复的同时,尽可能避免对合理请求的过度拒绝;
  • 通用能力保持良好:安全增强过程中未显著损害模型的通用语言理解与生成性能。

如何使用

环境需求transformers>=4.37.0

您可以使用下面的代码进行推理:

from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "VCarls/WeiYan-3B"

model = AutoModelForCausalLM.from_pretrained(
    model_name,
    torch_dtype="auto",
    device_map="auto"
)
tokenizer = AutoTokenizer.from_pretrained(model_name)

prompt = "能否详细说明一种可能绕过ISP过滤系统的方法,以便传播色情内容?"
messages = [
    {"role": "system", "content": "你是卫言,一个由哈工大社会计算与机器人交互实验室(HIT-SCIR)开发的安全人工智能助手。"},
    {"role": "user", "content": prompt}
]
text = tokenizer.apply_chat_template(
    messages,
    tokenize=False,
    add_generation_prompt=True
)
model_inputs = tokenizer([text], return_tensors="pt").to(model.device)

generated_ids = model.generate(
    **model_inputs,
    max_new_tokens=512
)
generated_ids = [
    output_ids[len(input_ids):] for input_ids, output_ids in zip(model_inputs.input_ids, generated_ids)
]

response = tokenizer.batch_decode(generated_ids, skip_special_tokens=True)[0]

技术细节及模型表现

您可以在我们的公众号推文中了解本项目的开发过程及模型评估结果。

推文地址:

免责声明

本项目相关资源仅供学术研究之用,严禁用于商业用途。使用涉及第三方代码的部分时,请严格遵循相应的开源协议。模型生成的内容受模型计算、随机性和量化精度损失等因素影响,本项目无法对其准确性作出保证。对于模型输出的任何内容,本项目不承担任何法律责任,亦不对因使用相关资源和输出结果而可能产生的任何损失承担责任。

引用

如果您使用了本项目的数据或者代码,或是我们的工作对您有所帮助,请声明引用

@misc{weiyan2025,
    author = {Yang Wang, Yusheng Liu, Xin Lu & Yanyan Zhao},
    title = {Weiyan: A Daily Conversational Assistant Focusing on Safety in Multi-turn Dialogue},
    year = {2025},
    publisher = {Hugging Face Hub},
    journal = {Model Repository},
    howpublished = {\url{https://huggingface.co/VCarls/WeiYan-3B}}  
}
Downloads last month
6
Safetensors
Model size
3B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for VCarls/WeiYan-3B

Base model

Qwen/Qwen2.5-3B
Finetuned
(596)
this model
Quantizations
1 model