
Pesquisa
A IA não pensa melhor que matemáticos, ela só decora mais
Análise sugere que modelos de IA vencem em matemática por memória bruta, não por raciocínio genuíno.

Análise sugere que modelos de IA vencem em matemática por memória bruta, não por raciocínio genuíno.

Novo modelo rápido da DeepSeek passa pelo benchmark de raciocínio ARC-AGI, mas os números merecem cautela.

Empresas podem estar otimizando modelos para benchmarks bobos como desenhar um pelicano de bicicleta.

Pesquisa da Lenz testou 1.000 alegações reais em cinco modelos de ponta. Em dois terços dos casos, eles não chegaram ao mesmo veredito.

Discussão no r/MachineLearning aponta falhas metodológicas sérias no famoso gráfico de “horizontes de tempo” da METR.

Em teste de ataque cibernético multi-etapas, GPT-5.5 resolveu em 11 minutos um desafio que levou 12 horas para um especialista humano. Custo: US$ 1,73.