Image-Text-to-Text
Transformers
Safetensors
French
English
qwen3_5
conversational

Ornith-9B Custom

A fine-tuned version of Ornith-1.0-9B by Damien FLETY.


Model Details

  • Base Model: Ornith-1.0-9B
  • Fine-tuned by: damfle
  • License: Inherits the license of the base model (check Ornith-1.0-9B for details).
  • Quantization: Optimized for 4-bit quantization (QAT) and FP8 training. (soon)

Intended Use

This model is designed for:

  • Efficient inference in quantized (4-bit) form. (soon)
  • Integration into RAG (Retrieval-Augmented Generation) pipelines.

Training Configuration

  • Dataset: Custom dataset (details not specified).
  • Training Approach:
    • Quantization-Aware Training (QAT) for 4-bit inference.
  • Optimizer: Muon optimizer (preferred for efficiency).

Performance

  • Inference: Optimized for low-latency, high-throughput inference in quantized form. (dspark soon)

How to Use

Inference (4-bit Quantized)

from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "damfle/ornith-9b-custom"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
    model_name,
    device_map="auto",
    load_in_4bit=True,
    bnb_4bit_compute_dtype=torch.float16
)

input_text = "Your prompt here"
inputs = tokenizer(input_text, return_tensors="pt").to("cuda")
outputs = model.generate(**inputs, max_new_tokens=100)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))

Notes

  • This model is part of an iterative process to merge embeddings for a transformers architecture while keeping embedding models separate for RAG.
  • Future plans include scaling to a 16B QAT 4-bit model.

Acknowledgments

Downloads last month
127
Safetensors
Model size
9B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for damfle/ornith-9b-custom

Finetuned
(35)
this model

Dataset used to train damfle/ornith-9b-custom