A LiquidAI anunciou nesta quarta-feira (19) a liberação dos checkpoints QAD Q4_0 para a família LFM2.5, voltados ao uso eficiente de modelos de linguagem em dispositivos edge e mobile. Os modelos já estão disponíveis no Hugging Face, com foco em aplicações locais que exigem footprint reduzido e alta velocidade de inferência.

O que é QAD e por que importa

A sigla QAD refere-se a Quantization-Aware Distillation, processo em que um modelo professor de alta precisão é destilado para um aluno já quantizado, minimizando perdas de acurácia que normalmente acompanham quantizações agressivas como a 4-bit. O objetivo é aproximar o desempenho do modelo quantizado ao do original, mantendo as vantagens de memória e velocidade.

Segundo a LiquidAI, os checkpoints QAD Q4_0 para os modelos LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct e LFM2.5-2.6B conseguem recuperar de 96,5% a 97,4% da performance média do baseline BF16 em benchmarks de raciocínio, instrução, uso de ferramentas e tarefas agenticas. Os testes incluíram suites como GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF, BFCLv4, além de GSM8K e AIME25 para matemática.

Velocidade e footprint: edge na prática

A LiquidAI avaliou os modelos QAD Q4_0 em quatro tipos de hardware: MacBook Pro (GPU), NucBox EVO-X2 (GPU), Samsung Galaxy S26 Ultra (Arm CPU) e Raspberry Pi 5 (Arm CPU). O QAD Q4_0 manteve throughput igual ou superior aos checkpoints Q4_0 tradicionais: os modelos menores (230M e 350M) igualaram a qualidade do Q5_K_M com ganho de 4–33% em velocidade de decodificação; os maiores (1.2B, 2.6B) igualaram Q4_K_M com 3–14% mais throughput.

Em comparação com checkpoints externos, como o Unsloth UD-Q4_K_XL (para 230M e 1.2B), o QAD Q4_0 manteve equivalência de qualidade — mas com a vantagem de já estar otimizado para distillation-aware quantization.

Integração e uso

Os arquivos QAD Q4_0 estão disponíveis em formato GGUF e podem ser utilizados diretamente em runtimes compatíveis, como o llama.cpp. O comando sugerido para uso local é:

llama-cli -hf LiquidAI/LFM2.5-350M \
  --hf-file LFM2.5-350M-QAD-Q4_0.gguf \
  -p "What is C. elegans?"

A disponibilidade open source e a facilidade de integração tornam os modelos especialmente relevantes para desenvolvedores que buscam IA local em dispositivos de baixo custo ou restrição energética, como smartphones e SBCs (single board computers).

Por que isso importa

A chegada dos checkpoints QAD Q4_0 expande o leque de modelos realmente utilizáveis no edge, sem exigir hardware dedicado ou sacrificar precisão de tarefas complexas. O resultado são aplicações embarcadas mais robustas, com menos dependência de nuvem e custos operacionais menores — um movimento alinhado com a demanda crescente por privacidade e autonomia em IA local.

Tags
  • #liquidai
  • #lfm2.5
  • #quantization
  • #edge
  • #distillation