Apyra v2 — Fast Attention Decision Engine
Engine determinística de decisão e classificação em tempo real projetada para agentes de IA, guardrails e pipelines de baixa latência.
Ao invés de processar tokens autorregressivamente via lm_head, o Apyra acopla Heads de Atenção Rápida 1D ($O(L)$) diretamente sobre a última camada de representação latente do backbone congelado Qwen/Qwen2.5-0.5B.
Destaques de Arquitetura
- Zero LM Head: Elimina a projeção final de vocabulário e a geração token por token.
- Fast Attentive Pooling 1D: Agregação de sequência linear $O(L)$ parametrizada por vetor de consulta ($q \in \mathbb{R}^{d}$).
- Explicabilidade Nativa: Distribuição de pesos de atenção sobre a sequência fornece pontuação direta de saliência por token/termo sem a necessidade de aproximações externas (como SHAP ou LIME).
- Sub-15ms Latency: Inferência direta em GPU Nvidia via framework Candle (
BF16backbone /F32heads).
Benchmarks de Latência
| Hardware | Precisão | Latência Média |
|---|---|---|
| NVIDIA GPU (CUDA) | BF16 / F32 | 12 – 15 ms |
| CPU x86 (AVX-512) | F32 | 80 – 100 ms |
Tarefas & Outputs
- Urgência: Classificação binária (
is_urgent,urgency_score). - Categorização: Roteamento multi-classe (
Financeiro,Suporte Tecnico,Comercial,Seguranca). - Risco: Score escalar contínuo $[0, 1]$.
- Evidência: Top-$k$ termos ordenados por atribuição de atenção na sentença.
Como carregar em Rust (Candle)
use candle_core::{DType, Device};
use candle_nn::VarBuilder;
use hf_hub::api::sync::Api;
let api = Api::new().unwrap();
let repo = api.model("mfourts/apyra-v2-qwen0.5b".to_string());
let heads_path = repo.get("apyra_heads.safetensors").unwrap();
let device = Device::new_cuda(0).unwrap_or(Device::Cpu);
let heads_vb = unsafe {
VarBuilder::from_mmaped_safetensors(&[&heads_path], DType::F32, &device).unwrap()
};
- Downloads last month
- 31