Apyra v2 — Fast Attention Decision Engine

Engine determinística de decisão e classificação em tempo real projetada para agentes de IA, guardrails e pipelines de baixa latência.

Ao invés de processar tokens autorregressivamente via lm_head, o Apyra acopla Heads de Atenção Rápida 1D ($O(L)$) diretamente sobre a última camada de representação latente do backbone congelado Qwen/Qwen2.5-0.5B.

Destaques de Arquitetura

  • Zero LM Head: Elimina a projeção final de vocabulário e a geração token por token.
  • Fast Attentive Pooling 1D: Agregação de sequência linear $O(L)$ parametrizada por vetor de consulta ($q \in \mathbb{R}^{d}$).
  • Explicabilidade Nativa: Distribuição de pesos de atenção sobre a sequência fornece pontuação direta de saliência por token/termo sem a necessidade de aproximações externas (como SHAP ou LIME).
  • Sub-15ms Latency: Inferência direta em GPU Nvidia via framework Candle (BF16 backbone / F32 heads).

Benchmarks de Latência

Hardware Precisão Latência Média
NVIDIA GPU (CUDA) BF16 / F32 12 – 15 ms
CPU x86 (AVX-512) F32 80 – 100 ms

Tarefas & Outputs

  1. Urgência: Classificação binária (is_urgent, urgency_score).
  2. Categorização: Roteamento multi-classe (Financeiro, Suporte Tecnico, Comercial, Seguranca).
  3. Risco: Score escalar contínuo $[0, 1]$.
  4. Evidência: Top-$k$ termos ordenados por atribuição de atenção na sentença.

Como carregar em Rust (Candle)

use candle_core::{DType, Device};
use candle_nn::VarBuilder;
use hf_hub::api::sync::Api;

let api = Api::new().unwrap();
let repo = api.model("mfourts/apyra-v2-qwen0.5b".to_string());
let heads_path = repo.get("apyra_heads.safetensors").unwrap();

let device = Device::new_cuda(0).unwrap_or(Device::Cpu);
let heads_vb = unsafe {
    VarBuilder::from_mmaped_safetensors(&[&heads_path], DType::F32, &device).unwrap()
};
Downloads last month
31
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support