Instructions to use AGmind/qmd-query-expansion-ru with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- llama-cpp-python
How to use AGmind/qmd-query-expansion-ru with llama-cpp-python:
# !pip install llama-cpp-python from llama_cpp import Llama llm = Llama.from_pretrained( repo_id="AGmind/qmd-query-expansion-ru", filename="qmd-query-expansion-ru-q4_k_m.gguf", )
llm.create_chat_completion( messages = [ { "role": "user", "content": "What is the capital of France?" } ] ) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- llama.cpp
How to use AGmind/qmd-query-expansion-ru with llama.cpp:
Install (macOS, Linux)
curl -LsSf https://llama.app/install.sh | sh # Start a local OpenAI-compatible server with a web UI: llama serve -hf AGmind/qmd-query-expansion-ru:Q4_K_M # Run inference directly in the terminal: llama cli -hf AGmind/qmd-query-expansion-ru:Q4_K_M
Install from WinGet (Windows)
winget install llama.cpp # Start a local OpenAI-compatible server with a web UI: llama serve -hf AGmind/qmd-query-expansion-ru:Q4_K_M # Run inference directly in the terminal: llama cli -hf AGmind/qmd-query-expansion-ru:Q4_K_M
Use pre-built binary
# Download pre-built binary from: # https://github.com/ggerganov/llama.cpp/releases # Start a local OpenAI-compatible server with a web UI: ./llama-server -hf AGmind/qmd-query-expansion-ru:Q4_K_M # Run inference directly in the terminal: ./llama-cli -hf AGmind/qmd-query-expansion-ru:Q4_K_M
Build from source code
git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp cmake -B build cmake --build build -j --target llama-server llama-cli # Start a local OpenAI-compatible server with a web UI: ./build/bin/llama-server -hf AGmind/qmd-query-expansion-ru:Q4_K_M # Run inference directly in the terminal: ./build/bin/llama-cli -hf AGmind/qmd-query-expansion-ru:Q4_K_M
Use Docker
docker model run hf.co/AGmind/qmd-query-expansion-ru:Q4_K_M
- LM Studio
- Jan
- vLLM
How to use AGmind/qmd-query-expansion-ru with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "AGmind/qmd-query-expansion-ru" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "AGmind/qmd-query-expansion-ru", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/AGmind/qmd-query-expansion-ru:Q4_K_M
- Ollama
How to use AGmind/qmd-query-expansion-ru with Ollama:
ollama run hf.co/AGmind/qmd-query-expansion-ru:Q4_K_M
- Unsloth Studio
How to use AGmind/qmd-query-expansion-ru with Unsloth Studio:
Install Unsloth Studio (macOS, Linux, WSL)
curl -fsSL https://unsloth.ai/install.sh | sh # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for AGmind/qmd-query-expansion-ru to start chatting
Install Unsloth Studio (Windows)
irm https://unsloth.ai/install.ps1 | iex # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for AGmind/qmd-query-expansion-ru to start chatting
Using HuggingFace Spaces for Unsloth
# No setup required # Open https://huggingface.co/spaces/unsloth/studio in your browser # Search for AGmind/qmd-query-expansion-ru to start chatting
- Pi
How to use AGmind/qmd-query-expansion-ru with Pi:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf AGmind/qmd-query-expansion-ru:Q4_K_M
Configure the model in Pi
# Install Pi: npm install -g @mariozechner/pi-coding-agent # Add to ~/.pi/agent/models.json: { "providers": { "llama-cpp": { "baseUrl": "http://localhost:8080/v1", "api": "openai-completions", "apiKey": "none", "models": [ { "id": "AGmind/qmd-query-expansion-ru:Q4_K_M" } ] } } }Run Pi
# Start Pi in your project directory: pi
- Hermes Agent new
How to use AGmind/qmd-query-expansion-ru with Hermes Agent:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf AGmind/qmd-query-expansion-ru:Q4_K_M
Configure Hermes
# Install Hermes: curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash hermes setup # Point Hermes at the local server: hermes config set model.provider custom hermes config set model.base_url http://127.0.0.1:8080/v1 hermes config set model.default AGmind/qmd-query-expansion-ru:Q4_K_M
Run Hermes
hermes
- Atomic Chat new
- OpenClaw new
How to use AGmind/qmd-query-expansion-ru with OpenClaw:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf AGmind/qmd-query-expansion-ru:Q4_K_M
Configure OpenClaw
# Install OpenClaw: npm install -g openclaw@latest # Register the local server and set it as the default model: openclaw onboard --non-interactive --mode local \ --auth-choice custom-api-key \ --custom-base-url http://127.0.0.1:8080/v1 \ --custom-model-id "AGmind/qmd-query-expansion-ru:Q4_K_M" \ --custom-provider-id llama-cpp \ --custom-compatibility openai \ --custom-text-input \ --accept-risk \ --skip-health
Run OpenClaw
openclaw agent --local --agent main --message "Hello from Hugging Face"
- Docker Model Runner
How to use AGmind/qmd-query-expansion-ru with Docker Model Runner:
docker model run hf.co/AGmind/qmd-query-expansion-ru:Q4_K_M
- Lemonade
How to use AGmind/qmd-query-expansion-ru with Lemonade:
Pull the model
# Download Lemonade from https://lemonade-server.ai/ lemonade pull AGmind/qmd-query-expansion-ru:Q4_K_M
Run and chat with the model
lemonade run user.qmd-query-expansion-ru-Q4_K_M
List all available models
lemonade list
qmd-query-expansion-ru
Русская модель расширения поисковых запросов для qmd — локального поискового движка Тоби Лютке. Drop-in замена стоковой tobil/qmd-query-expansion-1.7B, которая на русских запросах не работает.
EN TL;DR: Russian query-expansion model for qmd. The stock model is English-only and fails on Russian queries (#774, #454); this is a drop-in fix trained with the upstream finetune/ recipe. Benchmark below.
Зачем
Стоковая модель qmd обучена на 100% английских данных. Русский запрос она «переводит» в английский шаблон-галлюцинацию («…is an important concept… in software development» — про борщ), а формат вывода разваливается (issue #774). Вдобавок BM25-поиск qmd использует Porter-стеммер, который не понимает русскую морфологию — поэтому лексические расширения обязаны сами покрывать словоформы и синонимы («получить получение вернуть возврат»). Эта модель обучена делать и то, и другое.
Подключение (одна строка)
В ~/.config/qmd/index.yml (или проектном .qmd/index.yml):
models:
generate: "hf:AGmind/qmd-query-expansion-ru/qmd-query-expansion-ru-q4_k_m.gguf"
Переиндексация не нужна. Контракт тот же, что у стока: /no_think Expand this search query: {запрос} → построчный вывод hyde: / lex: / vec:.
Бенчмарк: 450 отложенных русских запросов, наша vs сток
Механические метрики (без LLM-судей), сэмплинг как в рантайме qmd (temp 0.7, top-k 20, top-p 0.8). Скрипт: bench_qmd.py в репозитории.
| метрика | наша | сток tobil/…-1.7B |
|---|---|---|
валидный контракт qmd (ровно 1 hyde: + 3 lex: + 2 vec:, без мусора) |
99.8% | 0.0% |
| вывод на русском (≥70% кириллицы) | 99.3% | 26.2% |
| английский шаблон-боилерплейт («…is an important concept…») | 0.0% | 22.9% |
hyde в размерном контракте (50–250 симв.) |
96.0% | 19.8% |
| дословное эхо запроса вместо расширения | 0.4% | 1.3% |
Сток не выдал валидный контракт ни на одном из 450 русских запросов и в ~23% ответов галлюцинирует английский шаблон. Наша держит контракт на 99.8%, оставаясь русской.
Пример
Запрос: «как оформить налоговый вычет за лечение»
hyde: Для оформления налогового вычета за лечение необходимо подтвердить расходы на медицинские услуги...
lex: налоговый вычет лечение оформление декларация
lex: расходы медицинские услуги справки врачей
lex: вычет налога подача декларация
vec: Как получить налоговый вычет за медицинские расходы
vec: Подача заявки на налоговый вычет за лечение и справки
Сток на тот же запрос: hyde: Как оформить налоговый вычет за лечение is an important concept that relates to... It provides functionality for various use cases in software development.
Обучение
- База: Qwen/Qwen3-1.7B (та же, что у стока), LoRA r16/α32 all-proj, 5 эпох — точный SFT-рецепт апстрима (
tobi/qmd/finetune). - Данные: 5 075 русских запросов (MIRACL-ru apache-2.0, Mr.TyDi-ru apache-2.0, Яндекс.Кью CC0) → дистилляция учителем (DeepSeek, n=2 сэмпла + rule-based reward-фильтр ≥70, средний скор 94.8).
- Формат идентичен трейн-схеме апстрима (
{"query", "output": [["hyde",…],["lex",…],["vec",…]]}, hyde первой).
Ограничения
- Модель 1.7B:
hyde:-пассажи могут фантазировать детали (номера деклараций, ингредиенты). Для расширения поиска это терпимо — термины остаются в теме, — но не считайте hyde фактами. - Обучена для русского; для английских запросов используйте сток.
Файлы
qmd-query-expansion-ru-q4_k_m.gguf— для qmd / llama.cpp (рекомендуется)- safetensors — merged fp16 для transformers
Код, генератор датасета, трейн- и бенч-скрипты: github.com/botAGI/AGmind-ML → qmd-query-expansion-ru. Родственная модель: AGmind/agmind-rag-splitter-ru.
- Downloads last month
- 803