O time da LiquidAI publicou um passo a passo de fine-tuning para o modelo LFM2.5-350M, focando em melhorar a geração de outputs estruturados — um gargalo comum para LLMs menores em tarefas reais. Usando o método Group Relative Policy Optimization (GRPO) com a biblioteca TRL, o experimento mostra que mesmo pequenos ajustes, feitos com dados abertos e infraestrutura acessível, já rendem ganhos práticos na métrica de schema compliance.
Por dentro do experimento
O pipeline apresentado no blog da Hugging Face é público e pode ser rodado em GPUs gratuitas do Colab ou Kaggle. O modelo de base, LFM2.5-350M, foi ajustado com apenas 500 exemplos, treinando por 100 passos. O objetivo: aumentar a taxa de outputs válidos no benchmark IFStruct, que avalia se respostas seguem formatos como JSON ou YAML e aderem a schemas esperados.
A linha de base local, usando llama.cpp em um MacBook com 36 GB de RAM, chegou a 22,6% de compliance no IFStruct (452 de 2000 exemplos). Após o fine-tuning, o score subiu para 29,7% — um salto de 7 pontos percentuais. O benchmark detalha os principais problemas enfrentados antes do ajuste: campos obrigatórios ausentes, contagem errada de itens e tipos inconsistentes.
Como o ajuste foi feito
A equipe utilizou o dataset Nemotron-RL-instruction_following-structured_outputs, que traz prompts alinhados com schemas JSON e contagem de campos esperada. O treinamento, curto e barato, é suficiente para rodar em uma GPU gratuita sem ajustes finos de hardware. O código do pipeline está aberto no GitHub, junto com instruções para servir o modelo via llama.cpp.
A avaliação também roda localmente: basta expor o modelo via endpoint OpenAI-compatível e executar o script do IFStruct. A abordagem é pragmática: não busca superar modelos muito maiores, mas mostrar que até LLMs pequenos ganham valor com ajustes específicos para outputs estruturados.
Para quem serve
A receita é especialmente útil para quem precisa de modelos pequenos, baratos e controláveis, mas não abre mão de outputs previsíveis e integráveis (por exemplo, APIs, sistemas de extração, pipelines ETL). O ganho absoluto não é revolucionário, mas a facilidade de reprodução e o baixo custo tornam o método atraente para times de IA aplicada, especialmente no Brasil, onde infra premium é cara.
Limitações e próximos passos
O incremento de performance é modesto: 29,7% ainda está longe dos scores de modelos maiores, e o dataset de ajuste cobre só parte dos formatos possíveis. A equipe reconhece que a distribuição do Nemotron difere da do IFStruct, sugerindo que mais dados (ou dados mais alinhados) podem ampliar o ganho. O pipeline, entretanto, já é um ponto de partida sólido.
Nota Daily AI
O método ganha 4 estrelas: solução honesta, barata e aberta para um problema prático de LLMs menores. Não faz milagre, mas entrega o que promete — e o código está todo disponível.