LFM2-8B-A1B for onw — Intel NPU だけで動く
日本語 | English
LiquidAI/LFM2-8B-A1B を **onw**(俺のNPUがこんなに動くわけない)用に変換したモデルです。onw は LLM を Intel NPU だけで動かすエンジンで、このリポジトリにはモデルだけが入っています(エンジンは別にダウンロードします)。
総パラメータ 8.3B、1 トークンあたり約 1.5B が動く MoE(32 エキスパートから 4 個を選択)。16 GB の PC でも動く、onw で一番速いモデルです。Ubuntu では NPU ドライバー(linux-npu-driver)1.38 以降が必要です(古いドライバーでは回答が途中から空になります)。
私たちの知る限り、MoE のエキスパート計算を NPU で行う公開実装は onw が初めてです(2026 年 9 月、Fable 5.1 調べ。OpenVINO 公式は LFM2-8B-A1B を CPU・GPU のみ対応としています)。
| NPU 3720(Core Ultra 9 285HX) | |
|---|---|
| 入力 | テキスト |
| 生成速度 | 16〜17 tok/s(コード修正・要約など元の文章を再利用する回答は先読み検証で 29〜43 tok/s) |
| プロンプト処理 | 113 トークンで約 1.7 秒 |
| ダウンロード | 4.0 GB |
| 使用メモリ(読み込み後の作業セット) | 約 5 GB |
| 初回起動(NPU 向けコンパイル)/2 回目以降 | 約 1.5 分/約 20 秒 |
使い方
onw(エンジン)を入れます。 まだの場合は、onw の「はじめに」 のとおり 1 行貼るだけです。Windows はスタートメニューで「PowerShell」を開き、次の 1 行を貼って Enter(Ubuntu は onw の README の
curl ... | bash)。irm https://huggingface.co/ryugyosoft/onw/resolve/main/install.ps1 | iexタスクトレイの onw アイコンから開く onw ウィンドウ の「モデル」タブで LFM2-8B-A1B を選び、「ダウンロード」を押します(4.0 GB)。
「サーバー」タブで「起動」を押します。初回だけ NPU 向けの準備に約 1.5 分かかります。
「チャットを開く」ですぐ試せます。他のアプリからは OpenAI 互換 API として使えます(base URL は
http://localhost:8000/v1)。
from openai import OpenAI
c = OpenAI(base_url="http://localhost:8000/v1", api_key="none")
r = c.chat.completions.create(model="LFM2-8B-A1B-onw", messages=[{"role": "user", "content": "こんにちは"}])
print(r.choices[0].message.content)
上級者向け:hf download ryugyosoft/LFM2-8B-A1B-onw で取得したフォルダを onw serve フォルダ で起動することもできます。Git LFS なしの git clone では重みが入らないので使わないでください(onw が検出して止めます)。
バージョン
- v2(現在):セグメントの重みを 1 トークン用と 16 トークン用で共有(4.2 → 4.0 GB)。モデルの 86% を占めるエキスパートはチャネル単位 INT4 のまま。半分に刈り込むとパープレキシティが +35% 悪化するため、このモデルは刈り込んでいません。 onw 0.3 以降が必要です。
- v1:
hf download ryugyosoft/LFM2-8B-A1B-onw --revision v1 --local-dir ...で取り出せます。
ダウンロード量の削減の大半は同じ重みを 1 つにまとめたことによるもので、実行時は NPU がブロックサイズごとにコンパイル済みの重みを持つため、使用メモリの減り方は小さめです。
仕組み
- 23 区間+出力層の区間。各ルーターの直後で区切り、ホストが上位 4 個のエキスパートの重みバッファを次の区間に結び付けます(コピーなし。704 個のエキスパートはすべて NPU から見えるメモリ上)。
- エキスパートは 1 エキスパート 1 テンソルに詰めたチャネル単位 INT4。実行時に渡す重みを NPU が全速で扱える唯一の形です。
- 詳しくは onw の README。
ファイル
| ファイル | 内容 |
|---|---|
seg*_S1.xml, seg*_S16.xml + seg*.bin |
23 区間+出力層(1 トークン用・16 トークン用のグラフ、重みは区間ごとに 1 ファイル) |
experts.bin (+ .json) |
22 層 × 32 エキスパート、チャネル単位 INT4 |
shared.bin (+ .json) |
INT8 の埋め込み(出力層と共有) |
engine.json、トークナイザー/設定ファイル |
onw 用のメタデータ、元のリポジトリの設定 |
品質
エキスパートなどはチャネル単位・グループ単位の INT4(四捨五入量子化)です。確認した範囲では最初のトークンの予測は bf16 と一致し、回答は自然ですが、数トークン先から言い回しが元のモデルと分かれることがあります。
ライセンス
LFM Open License v1.0(元モデルと同じ。商用利用の売上上限に注意)。変更点:重みの再量子化(INT4/INT8)と OpenVINO グラフへの再構成。学習はしていません。
- Downloads last month
- 1,315
Model tree for ryugyosoft/LFM2-8B-A1B-onw
Base model
LiquidAI/LFM2-8B-A1B