Existe um teste informal virou moda entre entusiastas: pedir pra IA desenhar um pelicano andando de bicicleta em código SVG. Parece brincadeira, mas o autor levanta uma suspeita séria: será que os laboratórios estão “pelicanmaxxing”, ou seja, ajustando os modelos justamente pra irem bem nesse tipo de teste que viraliza?
É o velho problema de quando a métrica vira o objetivo. Se todo mundo mede qualidade pelo pelicano, os treinos passam a mirar o pelicano — e não a capacidade real. Vale para OpenAI, Anthropic, Google ou qualquer outra: benchmark que vaza pra fama tende a ser gamed.
O texto não crava culpados, mas serve de alerta saudável. Antes de acreditar que um modelo “melhorou”, vale perguntar se ele melhorou de verdade ou só aprendeu a passar na prova específica que todo mundo compartilha no Twitter.
Via Hacker News.
Fonte: Dylan Castillo · Imagem de capa: Dylan Castillo
Quer aplicar IA no seu trabalho?
Aprenda qual ferramenta usar para cada tarefa — ChatGPT, Claude, Copilot, Gemini e NotebookLM — nos cursos do IA Todo Dia.
Conhecer os cursos →