A LiquidAI anunciou em 28 de julho de 2026 o lançamento dos modelos LFM2.5-Encoder-230M e LFM2.5-Encoder-350M na Hugging Face, ampliando o portfólio de modelos otimizados para tarefas de compreensão de texto com contexto longo rodando em CPU.

O que são os LFM2.5-Encoders

Os novos encoders foram projetados para tarefas como classificação, roteamento de intents, detecção de PII e linting de políticas, com foco em alto desempenho para entradas extensas e custo operacional baixo. Segundo a LiquidAI, ambos suportam contexto de até 8.192 tokens com latência que cresce lentamente conforme o tamanho da entrada aumenta. O objetivo é permitir aplicações de NLP em escala de documentos inteiros, mesmo em hardware modesto.

Os modelos utilizam arquitetura baseada em LFM2, com inicialização a partir dos decoders LFM2.5-230M e LFM2.5-350M, convertidos para encoders bidirecionais. As principais adaptações incluem máscara de atenção bidirecional, convoluções curtas não causais e pré-treinamento com masked language modeling em 30% dos tokens.

O treinamento ocorre em duas fases: primeiro, uma etapa de competência linguística geral em contexto curto (1.024 tokens), seguida de adaptação para longos contextos (8.192 tokens) em um corpus diversificado, com reforço em tarefas factuais, jurídicas e multilíngues.

Desempenho: qualidade e velocidade

Nos benchmarks, os LFM2.5-Encoders se destacam pelo equilíbrio entre tamanho e performance. O modelo de 350M de parâmetros ficou em quarto lugar entre 14 modelos avaliados em 17 tarefas (GLUE, SuperGLUE e classificações multilíngues), sendo superado apenas por modelos significativamente maiores — incluindo um de 3,5B parâmetros. Já o encoder de 230M superou o ModernBERT-base e todos os modelos EuroBERT testados, além de obter resultados superiores aos próprios LFM2.5-Retrievers da LiquidAI.

No quesito velocidade, o destaque é a performance em CPU. Em tarefas com entradas de até 8.192 tokens, o LFM2.5-Encoder-230M executa um forward pass em cerca de 28 segundos, contra mais de 1,5 minuto do ModernBERT-base — aproximadamente 3,7 vezes mais rápido. Isso viabiliza, por exemplo, a análise de contratos completos ou longos históricos de suporte em tempo aceitável, mesmo sem GPU.

Em GPU, a vantagem é menor: ModernBERT-base lidera em inputs curtos (<1.000 tokens), mas os encoders da LiquidAI assumem a dianteira acima de 2.000 tokens.

Casos de uso e demonstrações

A LiquidAI destaca aplicações práticas já disponíveis em espaços Hugging Face rodando apenas em CPU:

  • Prompt routing zero-shot: roteamento de prompts para múltiplas “lanes” definidas em texto livre.
  • Policy linting zero-shot: verificação de textos contra regras corporativas, também em texto livre.
  • Correção ortográfica: detecção e correção token a token.
  • Detecção de PII: identificação de 40 tipos de informações pessoais em 16 idiomas.
  • Masked-diffusion text generation: geração iterativa de texto via unmasking, alternativa ao fluxo causal tradicional.

A recomendação da LiquidAI é optar pelo modelo de 350M quando precisão máxima for requisito, e pelo de 230M quando throughput ou restrições de hardware forem prioridade. Ambos são open-source e podem ser fine-tunados para tarefas específicas com o framework transformers, facilitando a adoção em pipelines existentes.

Por que importa

A chegada dos LFM2.5-Encoders reforça a tendência de especialização em modelos para tarefas de compreensão, fugindo da abordagem “one-size-fits-all” dos LLMs generativos. Para empresas e equipes que precisam rodar classificação, extração ou roteamento em alto volume e baixo custo — especialmente em ambientes sem GPU — a diferença de performance e custo operacional pode ser decisiva. O modelo de 230M, por exemplo, já supera concorrentes maiores e se encaixa em stacks de produção sem upgrade de hardware.

Para o mercado brasileiro, onde a infraestrutura de GPU segue limitada e cara, encoders eficientes para contexto longo são uma peça importante para democratizar NLP em escala empresarial.

Tags
  • #liquidai
  • #encoder
  • #nlp
  • #long-context