A LiquidAI anunciou nesta quarta-feira (19) a liberação dos checkpoints QAD Q4_0 para a família LFM2.5, voltados ao uso eficiente de modelos de linguagem em dispositivos edge e mobile. Os modelos já estão disponíveis no Hugging Face, com foco em aplicações locais que exigem footprint reduzido e alta velocidade de inferência.
O que é QAD e por que importa
A sigla QAD refere-se a Quantization-Aware Distillation, processo em que um modelo professor de alta precisão é destilado para um aluno já quantizado, minimizando perdas de acurácia que normalmente acompanham quantizações agressivas como a 4-bit. O objetivo é aproximar o desempenho do modelo quantizado ao do original, mantendo as vantagens de memória e velocidade.
Segundo a LiquidAI, os checkpoints QAD Q4_0 para os modelos LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct e LFM2.5-2.6B conseguem recuperar de 96,5% a 97,4% da performance média do baseline BF16 em benchmarks de raciocínio, instrução, uso de ferramentas e tarefas agenticas. Os testes incluíram suites como GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF, BFCLv4, além de GSM8K e AIME25 para matemática.
Velocidade e footprint: edge na prática
A LiquidAI avaliou os modelos QAD Q4_0 em quatro tipos de hardware: MacBook Pro (GPU), NucBox EVO-X2 (GPU), Samsung Galaxy S26 Ultra (Arm CPU) e Raspberry Pi 5 (Arm CPU). O QAD Q4_0 manteve throughput igual ou superior aos checkpoints Q4_0 tradicionais: os modelos menores (230M e 350M) igualaram a qualidade do Q5_K_M com ganho de 4–33% em velocidade de decodificação; os maiores (1.2B, 2.6B) igualaram Q4_K_M com 3–14% mais throughput.
Em comparação com checkpoints externos, como o Unsloth UD-Q4_K_XL (para 230M e 1.2B), o QAD Q4_0 manteve equivalência de qualidade — mas com a vantagem de já estar otimizado para distillation-aware quantization.
Integração e uso
Os arquivos QAD Q4_0 estão disponíveis em formato GGUF e podem ser utilizados diretamente em runtimes compatíveis, como o llama.cpp. O comando sugerido para uso local é:
llama-cli -hf LiquidAI/LFM2.5-350M \
--hf-file LFM2.5-350M-QAD-Q4_0.gguf \
-p "What is C. elegans?"
A disponibilidade open source e a facilidade de integração tornam os modelos especialmente relevantes para desenvolvedores que buscam IA local em dispositivos de baixo custo ou restrição energética, como smartphones e SBCs (single board computers).
Por que isso importa
A chegada dos checkpoints QAD Q4_0 expande o leque de modelos realmente utilizáveis no edge, sem exigir hardware dedicado ou sacrificar precisão de tarefas complexas. O resultado são aplicações embarcadas mais robustas, com menos dependência de nuvem e custos operacionais menores — um movimento alinhado com a demanda crescente por privacidade e autonomia em IA local.