LKvaluesBench
Métrica: conformidade com valores sociais do Sri Lanka (cenários de instrução)
22 de julho de 2026
| # | Modelo | Score | Δ | |
|---|---|---|---|---|
| 01 | Qwen3.5-4B-Base (fine-tuned) após fine-tuning com LKValues | melhoria na redução de saídas inválidas e disparidade entre línguas | — | |
| 02 | Qwen3.5-9B-Base (fine-tuned) ganhos variam conforme o modelo | melhoria model-family dependente | — | |
| 03 | Aya-Expanse-8B-Base (fine-tuned) ganhos variam conforme o modelo | melhoria model-family dependente | — |
O estudo LKValues propõe um novo benchmark — LKvaluesBench — para avaliar o alinhamento de grandes modelos de linguagem (LLMs) a valores sociais do Sri Lanka, respondendo a lacunas em benchmarks globais, frequentemente enviesados por padrões ocidentais fonte.
O que é LKValues
LKValues é um conjunto de recursos criado a partir de uma pesquisa trilingue com 205 participantes no Sri Lanka. O trabalho identificou 40 valores sociais amplamente reconhecidos no país, combinando frameworks globais adaptados e conceitos locais extraídos via LLMs. A partir desses valores, foram criados dois recursos principais:
- LKvaluesIT: corpus de instruções em inglês e cingalês, derivado de notícias, com 150 mil instâncias de cenários.
- LKvaluesBench: benchmark de 1.000 instâncias para avaliação de alinhamento cultural.
Os dados estão disponíveis publicamente, permitindo replicação e adaptação para outros contextos multiculturais.
Avaliação: LLMs ainda falham em pluralismo cultural
Modelos proprietários e open-weight foram avaliados no LKvaluesBench. Os pesquisadores também realizaram fine-tuning em três modelos open-weight — Qwen3.5-4B-Base, Qwen3.5-9B-Base e Aya-Expanse-8B-Base — utilizando o corpus LKvaluesIT. Os resultados mostram que, mesmo em LLMs recentes e de grande porte, persistem falhas no alinhamento a valores culturais em cenários de baixo recurso linguístico. O fine-tuning com LKValues melhorou a conformidade a valores e reduziu saídas inválidas, mas os ganhos variam conforme a arquitetura, sendo mais consistentes na família Qwen. Persistem disparidades cross-lingual e limitações no alinhamento pleno.
Por que importa
Benchmarks como LKvaluesBench expõem o viés e a limitação dos LLMs globais em contextos culturais específicos, tema central para adoção responsável de IA em sociedades multilíngues. O pipeline proposto é replicável para outros países e pode orientar iniciativas brasileiras que buscam pluralidade de valores em IA, especialmente para línguas e contextos sub-representados. O acesso público ao dataset facilita experimentação, avaliação e ajuste fino por equipes locais.
Limitações e próximos passos
Os autores destacam que, apesar dos avanços, o alinhamento efetivo ainda depende de fatores como arquitetura do modelo e riqueza de dados. O estudo sugere que abordagens semelhantes podem ser aplicadas para outras línguas e valores nacionais, mas resultados não são garantidos sem adaptação contextual e validação social.