A LiquidAI anunciou em 28 de julho de 2026 o lançamento dos modelos LFM2.5-Encoder-230M e LFM2.5-Encoder-350M na Hugging Face, ampliando o portfólio de modelos otimizados para tarefas de compreensão de texto com contexto longo rodando em CPU.
O que são os LFM2.5-Encoders
Os novos encoders foram projetados para tarefas como classificação, roteamento de intents, detecção de PII e linting de políticas, com foco em alto desempenho para entradas extensas e custo operacional baixo. Segundo a LiquidAI, ambos suportam contexto de até 8.192 tokens com latência que cresce lentamente conforme o tamanho da entrada aumenta. O objetivo é permitir aplicações de NLP em escala de documentos inteiros, mesmo em hardware modesto.
Os modelos utilizam arquitetura baseada em LFM2, com inicialização a partir dos decoders LFM2.5-230M e LFM2.5-350M, convertidos para encoders bidirecionais. As principais adaptações incluem máscara de atenção bidirecional, convoluções curtas não causais e pré-treinamento com masked language modeling em 30% dos tokens.
O treinamento ocorre em duas fases: primeiro, uma etapa de competência linguística geral em contexto curto (1.024 tokens), seguida de adaptação para longos contextos (8.192 tokens) em um corpus diversificado, com reforço em tarefas factuais, jurídicas e multilíngues.
Desempenho: qualidade e velocidade
Nos benchmarks, os LFM2.5-Encoders se destacam pelo equilíbrio entre tamanho e performance. O modelo de 350M de parâmetros ficou em quarto lugar entre 14 modelos avaliados em 17 tarefas (GLUE, SuperGLUE e classificações multilíngues), sendo superado apenas por modelos significativamente maiores — incluindo um de 3,5B parâmetros. Já o encoder de 230M superou o ModernBERT-base e todos os modelos EuroBERT testados, além de obter resultados superiores aos próprios LFM2.5-Retrievers da LiquidAI.
No quesito velocidade, o destaque é a performance em CPU. Em tarefas com entradas de até 8.192 tokens, o LFM2.5-Encoder-230M executa um forward pass em cerca de 28 segundos, contra mais de 1,5 minuto do ModernBERT-base — aproximadamente 3,7 vezes mais rápido. Isso viabiliza, por exemplo, a análise de contratos completos ou longos históricos de suporte em tempo aceitável, mesmo sem GPU.
Em GPU, a vantagem é menor: ModernBERT-base lidera em inputs curtos (<1.000 tokens), mas os encoders da LiquidAI assumem a dianteira acima de 2.000 tokens.
Casos de uso e demonstrações
A LiquidAI destaca aplicações práticas já disponíveis em espaços Hugging Face rodando apenas em CPU:
- Prompt routing zero-shot: roteamento de prompts para múltiplas “lanes” definidas em texto livre.
- Policy linting zero-shot: verificação de textos contra regras corporativas, também em texto livre.
- Correção ortográfica: detecção e correção token a token.
- Detecção de PII: identificação de 40 tipos de informações pessoais em 16 idiomas.
- Masked-diffusion text generation: geração iterativa de texto via unmasking, alternativa ao fluxo causal tradicional.
A recomendação da LiquidAI é optar pelo modelo de 350M quando precisão máxima for requisito, e pelo de 230M quando throughput ou restrições de hardware forem prioridade. Ambos são open-source e podem ser fine-tunados para tarefas específicas com o framework transformers, facilitando a adoção em pipelines existentes.
Por que importa
A chegada dos LFM2.5-Encoders reforça a tendência de especialização em modelos para tarefas de compreensão, fugindo da abordagem “one-size-fits-all” dos LLMs generativos. Para empresas e equipes que precisam rodar classificação, extração ou roteamento em alto volume e baixo custo — especialmente em ambientes sem GPU — a diferença de performance e custo operacional pode ser decisiva. O modelo de 230M, por exemplo, já supera concorrentes maiores e se encaixa em stacks de produção sem upgrade de hardware.
Para o mercado brasileiro, onde a infraestrutura de GPU segue limitada e cara, encoders eficientes para contexto longo são uma peça importante para democratizar NLP em escala empresarial.