Benchmark

LKvaluesBench

Métrica: conformidade com valores sociais do Sri Lanka (cenários de instrução)

Execução

22 de julho de 2026

# Modelo Score Δ
01 Qwen3.5-4B-Base (fine-tuned) após fine-tuning com LKValues melhoria na redução de saídas inválidas e disparidade entre línguas
02 Qwen3.5-9B-Base (fine-tuned) ganhos variam conforme o modelo melhoria model-family dependente
03 Aya-Expanse-8B-Base (fine-tuned) ganhos variam conforme o modelo melhoria model-family dependente

O estudo LKValues propõe um novo benchmark — LKvaluesBench — para avaliar o alinhamento de grandes modelos de linguagem (LLMs) a valores sociais do Sri Lanka, respondendo a lacunas em benchmarks globais, frequentemente enviesados por padrões ocidentais fonte.

O que é LKValues

LKValues é um conjunto de recursos criado a partir de uma pesquisa trilingue com 205 participantes no Sri Lanka. O trabalho identificou 40 valores sociais amplamente reconhecidos no país, combinando frameworks globais adaptados e conceitos locais extraídos via LLMs. A partir desses valores, foram criados dois recursos principais:

  • LKvaluesIT: corpus de instruções em inglês e cingalês, derivado de notícias, com 150 mil instâncias de cenários.
  • LKvaluesBench: benchmark de 1.000 instâncias para avaliação de alinhamento cultural.

Os dados estão disponíveis publicamente, permitindo replicação e adaptação para outros contextos multiculturais.

Avaliação: LLMs ainda falham em pluralismo cultural

Modelos proprietários e open-weight foram avaliados no LKvaluesBench. Os pesquisadores também realizaram fine-tuning em três modelos open-weight — Qwen3.5-4B-Base, Qwen3.5-9B-Base e Aya-Expanse-8B-Base — utilizando o corpus LKvaluesIT. Os resultados mostram que, mesmo em LLMs recentes e de grande porte, persistem falhas no alinhamento a valores culturais em cenários de baixo recurso linguístico. O fine-tuning com LKValues melhorou a conformidade a valores e reduziu saídas inválidas, mas os ganhos variam conforme a arquitetura, sendo mais consistentes na família Qwen. Persistem disparidades cross-lingual e limitações no alinhamento pleno.

Por que importa

Benchmarks como LKvaluesBench expõem o viés e a limitação dos LLMs globais em contextos culturais específicos, tema central para adoção responsável de IA em sociedades multilíngues. O pipeline proposto é replicável para outros países e pode orientar iniciativas brasileiras que buscam pluralidade de valores em IA, especialmente para línguas e contextos sub-representados. O acesso público ao dataset facilita experimentação, avaliação e ajuste fino por equipes locais.

Limitações e próximos passos

Os autores destacam que, apesar dos avanços, o alinhamento efetivo ainda depende de fatores como arquitetura do modelo e riqueza de dados. O estudo sugere que abordagens semelhantes podem ser aplicadas para outras línguas e valores nacionais, mas resultados não são garantidos sem adaptação contextual e validação social.

Tags
  • #benchmark
  • #lkvalues
  • #llm
  • #cultural alignment
  • #sri lanka