O time da LiquidAI publicou um passo a passo de fine-tuning para o modelo LFM2.5-350M, focando em melhorar a geração de outputs estruturados — um gargalo comum para LLMs menores em tarefas reais. Usando o método Group Relative Policy Optimization (GRPO) com a biblioteca TRL, o experimento mostra que mesmo pequenos ajustes, feitos com dados abertos e infraestrutura acessível, já rendem ganhos práticos na métrica de schema compliance.

Por dentro do experimento

O pipeline apresentado no blog da Hugging Face é público e pode ser rodado em GPUs gratuitas do Colab ou Kaggle. O modelo de base, LFM2.5-350M, foi ajustado com apenas 500 exemplos, treinando por 100 passos. O objetivo: aumentar a taxa de outputs válidos no benchmark IFStruct, que avalia se respostas seguem formatos como JSON ou YAML e aderem a schemas esperados.

A linha de base local, usando llama.cpp em um MacBook com 36 GB de RAM, chegou a 22,6% de compliance no IFStruct (452 de 2000 exemplos). Após o fine-tuning, o score subiu para 29,7% — um salto de 7 pontos percentuais. O benchmark detalha os principais problemas enfrentados antes do ajuste: campos obrigatórios ausentes, contagem errada de itens e tipos inconsistentes.

Como o ajuste foi feito

A equipe utilizou o dataset Nemotron-RL-instruction_following-structured_outputs, que traz prompts alinhados com schemas JSON e contagem de campos esperada. O treinamento, curto e barato, é suficiente para rodar em uma GPU gratuita sem ajustes finos de hardware. O código do pipeline está aberto no GitHub, junto com instruções para servir o modelo via llama.cpp.

A avaliação também roda localmente: basta expor o modelo via endpoint OpenAI-compatível e executar o script do IFStruct. A abordagem é pragmática: não busca superar modelos muito maiores, mas mostrar que até LLMs pequenos ganham valor com ajustes específicos para outputs estruturados.

Para quem serve

A receita é especialmente útil para quem precisa de modelos pequenos, baratos e controláveis, mas não abre mão de outputs previsíveis e integráveis (por exemplo, APIs, sistemas de extração, pipelines ETL). O ganho absoluto não é revolucionário, mas a facilidade de reprodução e o baixo custo tornam o método atraente para times de IA aplicada, especialmente no Brasil, onde infra premium é cara.

Limitações e próximos passos

O incremento de performance é modesto: 29,7% ainda está longe dos scores de modelos maiores, e o dataset de ajuste cobre só parte dos formatos possíveis. A equipe reconhece que a distribuição do Nemotron difere da do IFStruct, sugerindo que mais dados (ou dados mais alinhados) podem ampliar o ganho. O pipeline, entretanto, já é um ponto de partida sólido.

Nota Daily AI

O método ganha 4 estrelas: solução honesta, barata e aberta para um problema prático de LLMs menores. Não faz milagre, mas entrega o que promete — e o código está todo disponível.

Tags
  • #fine-tuning
  • #grpo
  • #ifstruct
  • #lfm2.5
  • #structured-output