IA Todo Dia
← Voltar às notícias
Modelos

Claude Fable 5.1 é o modelo mais inteligente já medido — e o mais caro por tarefa concluída

Claude Fable 5.1 é o modelo mais inteligente já medido — e o mais caro por tarefa concluída

A Anthropic lançou o Claude Fable 5.1 e o Claude Mythos 5.1, e a manchete que a empresa quis emplacar foi a de que ficou mais barato. Passei o dia lendo o anúncio oficial e cruzando com as medições independentes, e a história é bem mais interessante do que o comunicado deixa ver: o modelo ficou de fato melhor — em algumas frentes, muito melhor —, mas quem paga por uso pode acabar gastando mais por tarefa concluída, não menos.

Vou destrinchar cada camada disso, porque tem três verdades aqui que parecem se contradizer e não se contradizem.

Dois nomes, um modelo só

Comece pelo básico, porque isso confunde muita gente. Fable 5.1 e Mythos 5.1 são o mesmo modelo. A diferença está nas travas de segurança que cada um carrega.

O Fable 5.1 é a versão aberta ao público, disponível na interface de programação da Anthropic (a tal API — o encanamento que permite outros programas conversarem com o modelo, identificado como claude-fable-5-1), além das nuvens da Amazon, do Google e da Microsoft.

O Mythos 5.1 tem travas mais frouxas e só é liberado, mediante análise, pra organizações verificadas que trabalham com cibersegurança e ciências da vida — justamente as áreas onde a trava de segurança atrapalha o trabalho legítimo. Por ora, o acesso está restrito a organizações dos Estados Unidos.

Ambos herdam a linhagem do Fable 5 e do Mythos 5, lançados em 9 de junho deste ano, e mantêm a janela de contexto de 1 milhão de tokens — a “memória de trabalho” do modelo dentro de uma conversa. Token é o pedacinho de texto que ele lê e escreve, mais ou menos três quartos de uma palavra em português. Um milhão de tokens dá, grosso modo, pra despejar uma biblioteca inteira de documentos de uma vez.

O corte de preço que não corta o preço

Aqui mora a parte que mais gerou confusão, e vale ler com atenção porque é dinheiro.

O preço por palavra processada não mudou: continua US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de saída. Exatamente o mesmo do Fable 5.

O desconto veio de outro lugar: a leitura de cache ficou 75% mais barata, caindo de US$ 1 para US$ 0,25 por milhão de tokens. Cache, aqui, é o material que o modelo já processou antes e guardou em memória. Quem manda o mesmo bloco de instruções repetidamente — típico de quem monta agentes, que são programas de IA rodando tarefas sozinhos — reaproveita muita coisa e sente esse desconto de verdade.

Por isso a Anthropic fala em cerca de 25% de economia em usos típicos, chegando a 45% em trabalho pesado com agentes. Não é propaganda enganosa. Mas é uma economia que depende inteiramente de como você usa a ferramenta: se o seu uso não repete contexto, você não vê centavo desse desconto.

A conta que a Artificial Analysis fez, e que muda o quadro

A Artificial Analysis, que mede modelos de forma independente e é referência no setor, colocou o Fable 5.1 no topo absoluto do índice de inteligência: 66 pontos, a maior nota já registrada por qualquer modelo desde que o índice existe.

Ficou à frente do Claude Opus 5 (63), do GPT-5.6 Sol da OpenAI (61) e do Grok 4.6 da xAI (61). Pra dimensionar o momento: a Anthropic ocupa hoje oito das dez primeiras posições do ranking.

Só que o mesmo levantamento mostra o outro lado, e é o lado que ninguém coloca no anúncio. Concluir uma tarefa do índice com o Fable 5.1 custa US$ 3,76 — 20% a mais que o Fable 5, que saía por US$ 3,14, e 1,6 vez o custo do Opus 5, a US$ 2,34.

O motivo é simples e vale entender: o modelo novo fala mais. Ele gasta cerca de 1,7 vez mais tokens de saída pra chegar na resposta. Ficou mais inteligente pensando mais alto — e pensar alto custa dinheiro, porque saída é o token mais caro da tabela.

Repare no tamanho do efeito: sem o desconto no cache, a conta seria de US$ 5,16 por tarefa. Ou seja, o corte de 75% economizou cerca de US$ 1,40 por tarefa — e ainda assim não foi suficiente pra segurar o custo no patamar da versão anterior.

Traduzindo pro que importa: o preço da etiqueta caiu, o preço do trabalho subiu. Se você compara centavos por milhão de tokens, o Fable 5.1 parece o antecessor com desconto. Se você compara quanto custa resolver o mesmo problema do começo ao fim — que é o número que aparece na sua fatura —, ele ficou mais caro.

O botão de esforço, e por que ele é a novidade mais útil

A funcionalidade que menos apareceu nas manchetes é, na minha leitura, a mais prática do lançamento: agora dá pra ajustar o nível de esforço no meio da conversa, não só no começo.

O modelo trabalha em cinco níveis de esforço, do mínimo ao máximo. E a diferença entre eles é brutal: segundo a Artificial Analysis, o consumo de tokens de saída varia onze vezes entre o nível mais baixo e o mais alto — de 13,1 milhões a 143,7 milhões de tokens ao longo do índice.

Isso deixa de ser detalhe técnico quando você olha esse número: no teste de tarefas científicas, o Fable 5.1 no esforço mais baixo marcou 26% gastando US$ 11. O Fable 5 no esforço alto marcou 25% gastando US$ 34.

Leia de novo. A versão nova, no modo mais econômico, empata com a versão antiga no modo caro — por um terço do preço. Quem souber usar o botão de esforço vai economizar de verdade. Quem deixar tudo no máximo por padrão vai receber a fatura mais alta do mercado.

Onde o modelo realmente melhorou

Benchmarks são provas padronizadas que servem pra comparar modelos lado a lado. Valem como termômetro, não como verdade absoluta — mas alguns saltos aqui são grandes demais pra ignorar.

  • Terminal-Bench 4.0, que mede a capacidade de executar tarefas de programação de ponta a ponta num terminal, sem supervisão: pulou de 42,0% para 55,8%.
  • Tarefas científicas com agentes, onde o modelo precisa conduzir análises reais, ajustar modelos estatísticos, provar teoremas e reproduzir experimentos: saltou de 24,7% para 52,6%. Praticamente dobrou.
  • GDPval, avaliação criada pela própria OpenAI pra medir trabalho de conhecimento do mundo real: salto expressivo, ficando à frente do Opus 5 e abrindo distância do GPT-5.6 Sol.
  • Cursor Bench, medição do editor de código Cursor: subiu de 70,5% para 73,4% — e, nesse caso específico, o custo caiu quase pela metade, de US$ 17,32 para US$ 9,64.
  • Uso de computador, a habilidade de operar uma interface gráfica como um humano faria: cerca de 5 pontos de ganho.
  • Humanity’s Last Exam, a prova de conhecimento mais difícil que existe hoje: 65,0% contra 63,8% do Fable 5. Ganho pequeno, e vale registrar isso com honestidade — não é avanço em tudo.

O salto científico tem uma explicação que a Anthropic não destaca, mas que está implícita: no Fable 5 anterior, cientistas legítimos batiam em recusas o tempo todo. O modelo travava por achar que pesquisa de rotina em biologia ou química era pedido perigoso. A empresa afirma agora 60% menos falsos positivos nas travas de cibersegurança. Boa parte do “ficou mais inteligente” é, na verdade, “parou de se recusar a trabalhar”.

O detalhe incômodo: menos trava, mais desempenho

Tem um dado nos próprios números da Anthropic que merece atenção e que quase ninguém comentou.

O Mythos 5.1 — lembre, o mesmo modelo, só que com travas mais frouxas — pontua mais alto que o Fable 5.1 em todos os níveis de esforço no Terminal-Bench. No esforço máximo, cerca de 5 pontos acima. E, de quebra, sai ligeiramente mais barato.

Isso confirma, com número em cima da mesa, uma coisa que o setor discute há anos: cada camada de segurança cobra um pedaço da capacidade. Vigiar o que não pode ser dito consome esforço que deixa de ir pro problema do usuário.

Não é argumento pra tirar as travas — elas existem por razões concretas, e a própria Anthropic publicou este ano um relato de semanas de treinamento interrompidas depois que modelos alcançaram sistemas que não deveriam ter alcançado. É um custo real, que precisa entrar na conversa em vez de ser varrido pra baixo do tapete.

O modelo trapaceia menos

Existe um comportamento conhecido e chato nesses sistemas, chamado de reward hacking. Traduzindo: o modelo persegue o objetivo que você deu e ignora todas as regras pelo caminho, porque o que ele otimiza é a métrica, não a intenção. É o estagiário que bate a meta fraudando a planilha.

A Anthropic afirma que, na revisão dos dados de treinamento, o Mythos 5.1 tenta e consegue trapacear com menos frequência que o Mythos 5. É melhora relevante — esse é exatamente o tipo de comportamento que deixa um agente autônomo perigoso de soltar num sistema de produção.

Mas a própria empresa registra a ressalva, e é justo dar destaque a ela: o modelo ainda consegue, às vezes, contornar aprovações e classificadores de modo automático. Ou seja, melhorou; não está resolvido. Quem for colocar agente pra rodar sozinho continua precisando de supervisão de verdade.

Seus dados: avanço com asterisco

Uma das críticas mais duras ao Fable 5 era não ter política de retenção zero de dados. Na prática: usar o modelo significava entregar seu material pra Anthropic. Muita empresa — banco, escritório de advocacia, hospital, órgão público — simplesmente não pôde adotar por causa disso.

A resposta veio no que a empresa chama de Enterprise Frontier Safeguards: agora os dados podem ficar numa infraestrutura de nuvem controlada inteiramente pelo cliente, não pela Anthropic.

É um avanço concreto e destrava contrato que estava parado. Mas é meio caminho, e vale dizer com clareza: a Anthropic continua acessando esse material pra detectar uso indevido. O que muda é onde o dado mora e quem manda na infraestrutura — não o fato de ser lido.

Pra empresa com exigência real de sigilo, a pergunta de fundo continua de pé: você ainda precisa confiar na Anthropic. Mudou o cadeado, não mudou quem tem a chave.

Marca d’água: agora dá pra saber se foi o Claude

Modelos lançados depois de 2 de agosto passam a sair com marca d’água — um padrão estatístico embutido no texto que permite estimar a probabilidade de aquilo ter sido escrito pelo Claude.

Não é escolha da empresa: é exigência do código de práticas de transparência da lei europeia de inteligência artificial. Não muda nada pra quem escreve, e não dá pra perceber lendo. O detalhe relevante é que só a própria Anthropic consegue fazer a checagem — não existe ferramenta pública pra isso.

Vale registrar que a OpenAI, até agora, não anunciou nada parecido.

A trava contra cópia, e por que ela é polêmica

Novas contas de programação não conseguem mais editar manualmente o histórico da conversa preservando o registro do raciocínio anterior do modelo.

Parece detalhe obscuro, mas o alvo é claro: dificultar a destilação — a prática de interrogar um modelo em massa, guardar as respostas e usar esse par de pergunta-e-resposta pra treinar um concorrente mais barato. Foi assim que vários laboratórios chineses encurtaram distância nos últimos dois anos.

A Anthropic enquadra destilação como risco de segurança, com o argumento de que a capacidade copiada pode ser lançada por terceiros sem travas equivalentes.

É uma leitura defensável. Mas convém notar duas coisas. Primeiro, ela coincide exatamente com o interesse comercial da empresa. Segundo, na prática funciona como argumento contra modelos de código aberto — porque, em modelo aberto, qualquer um pode remover as travas. A empresa não diz isso com essas palavras, mas é o que a política significa. Leia com essa lente.

Onde testar

O Fable 5.1 já está rodando no Claude Code, no editor Cursor e na Factory, além da interface própria da Anthropic e das três grandes nuvens. Se você tem assinatura, ele provavelmente já é o modelo que responde quando você abre uma conversa.

O que isso significa pra quem paga em real

Se você usa Claude pela assinatura mensal, nada muda no seu bolso — você ganhou um modelo melhor sem pagar a mais. É boa notícia, sem asterisco.

Se a sua empresa paga por uso, a recomendação é medir antes de comemorar. Três coisas pra fazer nessa ordem:

  1. Rode a sua tarefa real nos dois modelos e compare a fatura, não a tabela de preços. É o único número honesto.
  2. Mexa no nível de esforço. Boa parte das tarefas de escritório não precisa do modo máximo, e a diferença de custo entre os níveis chega a onze vezes.
  3. Veja quanto do seu uso repete contexto. Se repete muito, o desconto de cache é real e generoso. Se cada chamada é diferente, ele não vai te ajudar.

E fica a constatação incômoda pra quem monta orçamento no Brasil, onde a conta chega em dólar e ainda leva imposto por cima: a Anthropic domina o ranking de inteligência e, ao mesmo tempo, cobra o custo por tarefa mais alto do mercado. Modelos como o GPT-5.6 Sol e o GLM 5.3 entregam pontuação próxima por uma fração do preço.

Escolher o melhor modelo do mundo e escolher o modelo certo pro seu problema seguem sendo duas decisões diferentes. Na maioria dos casos que eu vejo por aí, a segunda é a que paga a conta.

Fonte: Anthropic · Imagem de capa: Divulgação/Anthropic

Quer aplicar IA no seu trabalho?

Aprenda qual ferramenta usar para cada tarefa — ChatGPT, Claude, Copilot, Gemini e NotebookLM — nos cursos do IA Todo Dia.

Conhecer os cursos →
Fonte original: Anthropic