O Open ASR Leaderboard, benchmark aberto de reconhecimento automático de fala (ASR) mantido pela Hugging Face em parceria com a VoiceArena, passou a incluir pela primeira vez idiomas do Sul Global. Em 28 de agosto de 2026, foram lançados dois conjuntos de avaliação para Hindi e Indian English — ampliando o escopo de um ranking que até então cobria apenas línguas europeias.
Ampliando diversidade: Hindi e Indian English
O benchmark incorpora agora o Hindi, idioma falado por mais de meio bilhão de pessoas, e o Indian English, ambos sob o codinome Monsoon. Cada idioma conta com uma divisão pública e outra privada, totalizando quatro splits e 4.888 falantes distintos. O objetivo declarado é capturar a diversidade de sotaques, idades, gêneros, regiões e condições acústicas presentes nesses idiomas, algo raramente contemplado em benchmarks internacionais de ASR.
Os dados foram coletados em centenas de distritos indianos, com participantes usando seus próprios celulares e gravando em ambientes variados, de interiores a espaços abertos. Os prompts buscaram situações do cotidiano, estimulando respostas espontâneas, opiniões, narração e até discordância, para forçar a aparição de nomes próprios, números e frases não roteirizadas.
Desenho do benchmark e cobertura
Os conjuntos Monsoon foram desenhados para variar ao longo de nove eixos: geografia, idade, gênero, vocabulário, dispositivos, ambientes acústicos, tipo de fala, velocidade da fala e existência de múltiplas transcrições corretas para o mesmo áudio. Isso permite expor falhas de modelos que, tradicionalmente, aparecem apenas em recortes populacionais específicos.
No total, o Monsoon cobre:
- Hindi: 2 splits (1 público, 1 privado), com 2.039 falantes e mais de 5,8 horas de áudio.
- Indian English: 2 splits (1 público, 1 privado), com 2.849 falantes e mais de 11 horas de áudio.
Cada amostra traz metadados detalhados: ocupação, escolaridade, status marital, faixa de renda, marca do celular, cidade atual e tempo no distrito. O equilíbrio de gênero é próximo de 50/50 em todos os splits, e há representação de centenas de cidades e dezenas de fabricantes de dispositivos.
Inovação no tratamento de variantes ortográficas
O Hindi, ao contrário do inglês, apresenta grande variação ortográfica. Por isso, o conjunto adota um formato de referência em “lattice”: para cada trecho, há uma lista de grafias consideradas corretas, evitando penalizar variantes legítimas — algo que normalizadores tradicionais de ASR não conseguem resolver. Já o Indian English segue o modelo de referência padrão, com normalização de variantes ortográficas comuns por regra.
Por que importa
O lançamento do Monsoon representa um avanço relevante para benchmarks de ASR, tradicionalmente enviesados para sotaques e realidades europeias ou norte-americanas. Modelos avaliados nesses novos conjuntos terão de demonstrar robustez em condições muito mais próximas do uso real em países populosos do Sul Global. Para desenvolvedores de sistemas de voz e pesquisadores brasileiros, o movimento reforça a necessidade de benchmarks abertos e localmente relevantes — inclusive para português brasileiro e línguas indígenas, ainda ausentes.
A abertura dos splits públicos e a riqueza de metadados tornam o Monsoon uma referência para quem busca avaliar desempenho em cenários mais diversos, indo além da métrica única de WER (Word Error Rate) e considerando, de fato, o impacto social dos sistemas de ASR.