Qwen3.8-Max

This repository contains the open-weight version of Qwen3.8-Max, officially released as Qwen3.8-2.4T-A95B.

Model Overview

  • Architecture: Sparse Mixture-of-Experts (MoE)
  • Total Parameters: 2.4 Trillion
  • Active Parameters: 95 Billion per token
  • Experts: 512 total (10 routed + 1 shared activated per token)
  • Context Length: 262,144 tokens natively (extensible up to ~1M tokens)
  • Type: Causal Language Model
  • Modalities: Text → Text (open weights version)
  • License: Qwen3.8-Max License

Note: The official hosted version of Qwen3.8-Max (available via Qwen Cloud / Alibaba Cloud) includes additional features such as native vision/video input, non-thinking mode, and built-in tools. The open-weight version focuses on text generation with strong reasoning capabilities.

Model Details

Property Value
Model Type Causal LM (MoE)
Total Parameters 2.4T
Activated Parameters 95B
Hidden Size 8192
Number of Layers 92
Vocabulary Size 248,320
Native Context Length 262,144
Max Context (with scaling) ~1,010,000

Usage

With Transformers

from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "Vili-Elvis01/Qwen3.8-Max"

tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
    model_name,
    torch_dtype="auto",
    device_map="auto"
)

prompt = "Explain quantum computing in simple terms."
messages = [
    {"role": "user", "content": prompt}
]

text = tokenizer.apply_chat_template(
    messages,
    tokenize=False,
    add_generation_prompt=True
)

model_inputs = tokenizer([text], return_tensors="pt").to(model.device)

generated_ids = model.generate(
    **model_inputs,
    max_new_tokens=512
)

response = tokenizer.batch_decode(generated_ids, skip_special_tokens=True)[0]
print(response)
Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Vili-Elvis01/Qwen3.8-Max

Finetuned
(4)
this model