Luqwen2-4B

Luqwen2-4B — русскоязычная текстовая модель, полученная дообучением Qwen3.5-4B-Base методом LoRA (QLoRA) на смешанном датасете из реальных диалогов с LLM и креативных текстов. Модель сочетает в себе способность следовать инструкциям, работать с инструментами и кодом, а также генерировать выразительные литературные тексты.

Базовая модель Qwen3.5-4B-Base использует гибридную архитектуру (Gated DeltaNet + Full Attention) с контекстом до 262k токенов, что обеспечивает эффективный инференс при сохранении качества генерации.

Base model

Свойство Значение
Архитектура Qwen3.5 For Causal LM (гибрид Linear/Full Attention)
Параметров 4B
Скрытая размерность 1024
Слоёв 24
Контекст до 262 144 токенов
Вокабуляр 248 320 (padding)
MTP 1 слой

Подробнее: Qwen3.5-4B-Base

Training data

Датасет для обучения состоит из двух независимых частей:

30% — Реальные диалоги пользователя с LLM

Диалоги включают:

  • Задачи с использованием инструментов (tool usage) — вызов API, работа с файлами, команды
  • Логические и рассуждающие задачи
  • Кодинг — написание, отладка и объяснение кода
  • Общие инструкции и вопросы

70% — Креативное письмо

Тексты, сгенерированные моделью Gemma-4-12B-StyleTune — модели с уникальным авторским стилем, прошедшей style-tune дообучение (только lm_head), ориентированной на ролевые игры и повествовательную прозу.

Pipeline подготовки данных

  1. Сбор диалогов с LLM (tool-calling, код, логика) — анонимизация, форматирование в ChatML
  2. Генерация креативных текстов через Gemma-4-12B-StyleTune
  3. Фильтрация и дедупликация
  4. Конвертация в ChatML-формат

Training procedure

Параметры LoRA

Параметр Значение
rank (r) 16
lora_alpha 32
lora_dropout 0
bias none
Целевые модули q_proj, k_proj, v_proj, o_proj, gate_proj, up_proj, down_proj, in_proj_qkv, in_proj_z, out_proj, in_proj_a, in_proj_b

Гиперпараметры обучения

Параметр Значение
Оптимизатор AdamW 8-bit
Precision BF16 (mixed)
Batch size 1 (8 gradient accumulation steps)
Learning rate 2e-4
Эпохи 3
Warmup steps 20
Max seq length 4096 токенов
Обёртка unsloth (4-bit QLoRA)

Слияние весов

После обучения LoRA-адаптер был слит с базовой моделью в 16-bit точность (метод merged_16bit через unsloth) для удобного использования без дополнительных зависимостей PEFT.

Usage

from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "LLiserginov/Luqwen2-4B"

tokenizer = AutoTokenizer.from_pretrained(model_name, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
    model_name,
    torch_dtype="auto",
    device_map="auto",
    trust_remote_code=True,
)

messages = [
    {"role": "user", "content": "Напиши рассказ о одиноком фонаре в осеннем парке."},
]

text = tokenizer.apply_chat_template(
    messages,
    tokenize=False,
    add_generation_prompt=True,
)

inputs = tokenizer(text, return_tensors="pt").to(model.device)

outputs = model.generate(
    **inputs,
    max_new_tokens=1024,
    temperature=0.7,
    top_p=0.9,
    do_sample=True,
)

response = tokenizer.decode(outputs[0][inputs.input_ids.shape[1]:], skip_special_tokens=True)
print(response)

Использование с vLLM

from vllm import LLM, SamplingParams

llm = LLM(model="LLiserginov/Luqwen2-4B", trust_remote_code=True)

messages = [
    {"role": "user", "content": "Объясни разницу между supervised и unsupervised learning."},
]

outputs = llm.chat(messages, sampling_params=SamplingParams(temperature=0.7, max_tokens=1024))
print(outputs[0].outputs[0].text)

GGUF (llama.cpp)

GGUF-версию модели можно найти в релизах или сконвертировать самостоятельно:

git clone https://github.com/ggml-ai/llama.cpp
cd llama.cpp
python convert_hf_to_gguf.py /path/to/Luqwen2-4B --outfile Luqwen2-4B.Q4_K_M.gguf --outtype q4_K_M

Limitations

  • Датасет креативных текстов сгенерирован моделью Gemma-4-12B-StyleTune — возможны стилистические шаблоны и повторения
  • Диалоги анонимизированы и могут не покрывать все edge-cases реального использования
  • Модель не проходила RLHF/DPO-калибровку и может генерировать нежелательный или фактически неверный контент
  • Не предназначена для использования в медицинских, юридических или других критических областях
  • Это текстовая версия — мультимодальные возможности Qwen3.5 (изображения, видео) не используются

License

Модель распространяется под лицензией Apache 2.0.

Базовая модель: Qwen3.5-4B-Base — Apache 2.0. Креативные тексты: Gemma-4-12B-StyleTune — Apache 2.0.

Downloads last month
72
GGUF
Model size
4B params
Architecture
qwen35
Hardware compatibility
Log In to add your hardware

4-bit

6-bit

8-bit

16-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for LLiserginov/Luqwen2-4B

Adapter
(10)
this model