FunctionGemma PlantGame DE — On-Device-Artefakte (LiteRT / TFLite / NPU)

Dieses Repo enthält das für Google AI Edge Gallery aufbereitete Fine-Tune functiongemma-plantgame-de (Basis: google/functiongemma-270m-it, Architektur: Gemma 3 270M) für die lokale Ausführung auf Android (z. B. Samsung Galaxy S26 Ultra, Snapdragon 8 Elite Gen 5 / SM8850).

Artefakte (Ordner litertlm/)

Datei Format Ziel-Hardware Quantisierung Kontext
functiongemma-plantgame-de-wi8emb4-ekv1280.litertlm LiteRT-LM (.litertlm) CPU + GPU 8-bit Gewichte, 4-bit Embeddings (per-channel) Prefill-Chunks 128, KV-Cache 1280
functiongemma-plantgame-de-int8-ekv1280.task MediaPipe Task (.task) CPU + GPU 8-bit dynamisch + 4-bit Embeddings Prefill-Chunks 128, KV-Cache 1280
functiongemma-plantgame-de-qnn-sm8850.litertlm LiteRT-LM, QNN-AOT-kompiliert NPU (Hexagon) — nur Snapdragon SM8850 w8a16 (a16w8) via LiteRT NPU-Compiler Prefill-Chunks 128, KV-Cache 1280

Verwendung in Google AI Edge Gallery

  1. AI Edge Gallery installieren (Standard-APK für CPU/GPU; NPU-Preview-APK für Snapdragon-NPU).
  2. In der App: Add model → URL auf die .litertlm- bzw. .task-Datei in diesem Repo eingeben (oder Datei über den Dateimanager importieren).
  3. CPU/GPU-Artefakt: normal starten; in den Einstellungen lässt sich GPU-Beschleunigung aktivieren.
  4. NPU-Artefakt: nur in der NPU-fähigen Gallery-Build auf einem Gerät mit Snapdragon SM8850 (Galaxy S26 Ultra) starten — die QNN-Kompilierung ist SoC-spezifisch und läuft auf anderen Chips nicht.

Technik

  • Konvertierung: litert-torch export_hf (LiteRT-Torch Generative Pipeline)
  • NPU: compile_litertlm mit Backend qualcomm, SoC SM8850, O3-Optimierung
  • Signatur-Konventionen: prefill_128, Decode mit transponiertem KV-Cache
  • Tokenizer: SentencePiece (tokenizer.model), Start-Token <bos>, Stop-Token <eos> / <end_of_turn>

Trainingsquelle

Fein-Tuning auf Kaggle (LoRA-frei, Full-FT, 2 Epochen, 3825 Trainings-/675 Eval-Samples): Exact-Match 148/150 = 98,7 % auf dem deutschen PlantGame-Function-Calling-Eval.

Downloads last month
-
Safetensors
Model size
0.3B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support