Open ASR Leaderboard inclui Hindi e Indian English em benchmark inédito
Hugging Face e VoiceArena lançam novo benchmark de ASR para Hindi e Indian English, cobrindo 4.888 falantes e ampliando diversidade de sotaques e condições.
Hugging Face e VoiceArena lançam novo benchmark de ASR para Hindi e Indian English, cobrindo 4.888 falantes e ampliando diversidade de sotaques e condições.
Hugging Face e VoiceArena lançam novo benchmark de ASR para Hindi e Indian English, cobrindo 4.888 falantes e ampliando diversidade de sotaques e condições.
Programa de oito semanas oferece mentoria, créditos em API e acesso a modelos avançados para dez startups tailandesas, com foco em saúde e educação.
Experimento com mais de 1.000 estudantes da Bocconi mostra que acesso ao ChatGPT melhora a qualidade das respostas, enquanto exercícios de pensamento causal ampliam a originalidade.
Novo estudo mostra que sistemas de reconhecimento de voz tendem a repetir erros dos benchmarks públicos em vez de seguir o áudio real. Efeitos de 'benchmaxxing' em 11 modelos open-source.
Benchmark ConceptGuard propõe avaliar a capacidade de LLMs esquecerem conceitos de uso duplo sem perder utilidade, revelando limitações das técnicas atuais.
Novo MLLM focado em visão médica lidera em 20 de 24 benchmarks abertos, com desempenho superior a modelos como Hulu-Med, Lingshu, GPT-5.2 e Gemini-3-Flash em tarefas clínicas.
Novo recurso do Gradio permite criar, testar e expor pipelines de IA como APIs REST, tudo via canvas visual. Review, pontos fortes e limitações.
Novo scheduler da Dharma-AI substitui FIFO clássico e aumenta a utilização da GPU em até 33 pontos percentuais. Review dos ganhos e limites do approach.
TutorMoments permite medir se LLMs sabem quando ajudar ou desafiar estudantes, usando replays baseados em sessões reais de tutoria em matemática.
O uso intensivo de assistentes de código com IA ameaça o desenvolvimento de expertise real: novatos ganham confiança, mas perdem compreensão profunda.
Em 40 mil sessões de jogo, humanos deixaram passar 1 a cada 3 ameaças ao aprovar comandos de agentes IA. Teste revela limites do human-in-the-loop e riscos do cansaço de permissão.
Abertura dos pesos de modelos avançados acelera inovação coletiva e desafia o domínio de fornecedores fechados. A disputa agora é por plataformas, não só por benchmarks.