A LiquidAI lançou o LFM2.5-2.6B, modelo open source projetado para rodar agentes de IA completos diretamente em dispositivos locais. O modelo chega com 2,6 bilhões de parâmetros e foca em eficiência, privacidade e compatibilidade com agentes autônomos, como OpenClaw e Hermes Agent. O anúncio foi publicado em 4 de agosto de 2026 na Hugging Face.
Modelo compacto, foco em edge
O LFM2.5-2.6B foi treinado em aproximadamente 34 trilhões de tokens e passou por uma fase intermediária que expande a janela de contexto para 128.000 tokens. O objetivo é viabilizar agentes com workflows multi-etapa, uso de ferramentas (tool use) e instrução, mantendo performance suficiente para rodar em laptops, desktops comuns e até celulares — sem depender de nuvem.
O modelo consome menos de 2,5 GB de memória RAM para inferência local e atinge velocidades de 220 tokens por segundo em um Apple M5 Max e 113 tokens/s em um AMD Ryzen, segundo a LiquidAI. Em celulares, a performance prometida é de 30 tokens/s, suficiente para aplicações interativas.
Pipeline de treinamento e compatibilidade com agentes
O LFM2.5-2.6B utiliza um pipeline de quatro etapas pós-treinamento para especialização em tarefas de agente:
- Supervised fine-tuning (SFT): duas rodadas com ênfase em dados de tool use, busca na web e trajetórias em harnesses de agentes.
- Teacher specialization: especialistas por domínio (matemática, código, ferramentas).
- Multi-domain on-policy distillation: destilação dos especialistas em um único estudante.
- Agentic Reinforcement Learning (RL): aprendizado por reforço multi-turn, treinando o modelo dentro de ambientes reais de agentes, sem modificar os harnesses.
A arquitetura separa otimização, inferência e execução dos ambientes, facilitando integração com frameworks como OpenClaw, Hermes Agent e Pi.
Benchmarks: pequeno, mas competitivo
Nos testes apresentados, o LFM2.5-2.6B superou modelos de até quatro vezes seu tamanho em tarefas de instrução e uso de ferramentas, e ficou próximo ou empatado em tarefas de agente. Entre os benchmarks destacados:
- AIME25: LFM2.5-2.6B: 51,87; Qwen3.5-9B: 56,07; gemma-4-E4B-it (8B): 34,27
- ToolSandbox: LFM2.5-2.6B: 77,83; Qwen3.5-9B: 76,44; gemma-4-E4B-it (8B): 65,00
- Multi-IF: LFM2.5-2.6B: 80,07; Qwen3.5-9B: 62,55
- Claw-Eval average (EN): LFM2.5-2.6B: 62,85; Qwen3.5-9B: 66,53
O modelo ficou atrás apenas em benchmarks de código, onde os modelos maiores mantêm vantagem clara.
Integração e uso imediato
O LFM2.5-2.6B já está disponível na Hugging Face, com suporte imediato a llama.cpp, MLX, vLLM, SGLang e ONNX. O modelo pode ser executado localmente com poucas linhas de código usando a biblioteca transformers (>=5.0.0), e há demo web via WebGPU. A LiquidAI também oferece um guia para integração com ambientes de agentes locais.
Por que importa
O lançamento do LFM2.5-2.6B reforça a tendência de modelos cada vez mais compactos e capazes, voltados para privacidade e custo zero em nuvem. Para desenvolvedores brasileiros, abre espaço para aplicações autônomas em edge e dispositivos móveis, sem depender de infraestrutura internacional. Na prática, viabiliza agentes privados e reutilizáveis para automação local, análise de dados sensíveis e workflows offline.