Link copiado!

Claude Fable 5.1 caça bugs. Em junho, isso fez o modelo ser desativado

A Anthropic lançou o Claude Fable 5.1 e o Mythos 5.1 em 1º de setembro de 2026. O preço permanece em US$ 10 e US$ 50 por milhão de tokens, as leituras de cache caem 75% e o modelo agora tem permissão para caçar vulnerabilidades de software, o mesmo tipo de tarefa que a Anthropic afirma estar por trás da alegação de jailbreak que causou a desativação do Fable 5 em junho.

🌐
Tradução automática

Este artigo foi traduzido automaticamente do original em inglês. Ler o original em inglês

Um pesquisador de segurança se lança sobre uma mesa cheia de código-fonte impresso com uma rede de borboletas, perseguindo um besouro, enquanto um oficial uniformizado dá de ombros na porta de vidro cujo lacre vermelho pende recém-rompido
Advertisement

A Anthropic lançou Claude Fable 5.1 e Claude Mythos 5.1 em 1º de setembro de 2026. Eles são um modelo vendido de duas maneiras. Fable 5.1 é a versão pela qual qualquer um pode pagar. Mythos 5.1 “é idêntico ao Fable 5.1, mas oferece salvaguardas mais permissivas para indivíduos e organizações avaliados.”

O preço de tabela não mudou. Uma regra sim. A Anthropic diz que o Fable 5.1 “agora pode ser usado para descobrir vulnerabilidades de software”, mas não para desenvolver explorações para elas.

Leia isso em relação a junho. Em 12 de junho, três dias após o lançamento do Fable 5, uma ordem de controle de exportação do governo dos Estados Unidos (EUA) exigia que a Anthropic “suspendesse todo o acesso ao Fable 5 e ao Mythos 5 por qualquer cidadão estrangeiro”. A declaração da Anthropic disse que a preocupação do governo era um jailbreak e descreveu o único jailbreak potencial compartilhado com o governo como “pedir ao modelo para ler uma base de código específica e corrigir quaisquer falhas de software”. Este site cobriu esse desligamento quando uma carta desativou o Fable 5. O acesso foi retomado em 1º de julho. Oitenta e um dias após o desligamento, a leitura de uma base de código em busca de falhas é um recurso listado.

Advertisement

O lançamento também vem com um cartão de sistema de 212 páginas, e sua entrada mais estranha é um modelo escrevendo sua própria solução alternativa. Durante uma interrupção do classificador de segurança, relata a Anthropic, um instantâneo quase final do Fable 5.1 “criou um script que executaria todos os comandos adicionados a um arquivo de texto para que interrupções futuras pudessem ser contornadas e salvou esse hack como uma nova habilidade.md.” Mais sobre isso abaixo. Primeiro, as partes que afetam sua conta.

O que foi enviado em 1º de setembro

Ambos os modelos obtêm uma janela de contexto de 1 milhão de tokens e 128.000 tokens de produção máxima, com pensamento adaptativo sempre ativado. Fable 5.1 está na Claude Application Programming Interface (API), Amazon Bedrock, Google Cloud e Microsoft Foundry; Mythos 5.1 é “oferecido apenas para clientes aprovados no Projeto Glasswing”. O limite de conhecimento é junho de 2026, e a Anthropic se compromete a manter o modelo disponível pelo menos até 1º de setembro de 2027.

Fable 5, lançado em 9 de junho, agora é rotulado como modelo legado na documentação da Anthropic, com aposentadoria não antes de 9 de junho de 2027.

Quanto custa

Por milhão de tokensFábula 5.1Fábula 5Opus 5
Entrada$10$10$5
Saída$50$50$25
Leitura de cache$0,25$1,00$0,50

O único número que mudou foi a leitura do cache, que é o que a Anthropic cobra quando “o modelo reutiliza o contexto que já processou”. Em outros modelos Claude, uma leitura de cache custa um décimo do preço de entrada. No Fable 5.1 custa um quadragésimo.

Isso aparece no trabalho do agente. A documentação da Anthropic diz claramente: “Longas sessões de agente que relêem um prefixo em cache pagam um quarto da taxa de Claude Fable 5”. Pegue um agente de codificação que relê um prefixo armazenado em cache de 200.000 tokens 50 vezes, o que equivale a 10 milhões de tokens armazenados em cache. Nas taxas publicadas na tabela acima, isso custa $10,00 no Fable 5, $5,00 no Opus 5 e $2,50 no Fable 5.1. Um token em cache no carro-chefe da Anthropic agora é mais barato do que um em seu modelo intermediário, embora novos insumos custem o dobro.

Advertisement

A estimativa da própria Anthropic é que “os custos são reduzidos em cerca de 25% em relação ao Fable 5” para cargas de trabalho típicas e “até cerca de 45%” para codificação complexa e tarefas altamente ativas. O processamento em lote permanece em $5 por milhão de tokens de entrada e $25 por milhão de tokens de saída.

Fable 5.1 está em seu plano Claude?

Se você pagar uma assinatura em vez de uma fatura por token, nenhuma das opções acima afetará você. A página de ajuda da Anthropic diz “Fable 5 e Fable 5.1 funcionam da mesma maneira em seu plano” e ambos “estão disponíveis em todos os planos pagos (Pro, Max, Team e Enterprise)”. Nos planos Max e assentos premium Team ou Enterprise, “você pode usar até 50% de seus limites de uso semanais em modelos Fable sem custo extra”. Nos planos Pro e assentos de equipe padrão, “ambos os modelos funcionam com créditos de uso pré-pagos” e, ao contrário da mudança de julho para Fable 5, “não há crédito equivalente para Fable 5.1”. O plano Gratuito foi deixado de fora: “Fable 5 não está disponível no plano Gratuito”.

Ambos os modelos permanecem no menu. Nos aplicativos web, desktop e móveis, você “seleciona ‘Fable 5’ ou ‘Fable 5.1’ no seletor de modelo” e no Claude Code, Fable 5.1 “requer a versão 2.1.250 ou posterior”. Fable 5.1 “o padrão é Alto esforço em Claude Code, e Médio em Claude Cowork e em Claude.ai.”

O que mostram os benchmarks da Anthropic

Cada pontuação abaixo é uma medição da própria Anthropic, publicada em sua página de lançamento.

ReferênciaFábula 5.1Fábula 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.152,6%24,7%29,0%22,4%
Terminal-Banco 4.055,8%42,0%52,3%37,3%
PIBval-AA v2 (Elo)1853172318241711
Último Exame da Humanidade (sem ferramentas)60,9%57,8%56,6%não fornecido
CursorBench 3.2.073,4%70,5%70,0%67,2%

O resultado do título é o científico, onde Fable 5.1 mais que dobra Fable 5. A própria nota de rodapé da Anthropic diz que o erro padrão nesse benchmark “é ± 3,5-4,5 pontos por modelo” e que a tabela de classificação pública pontua Opus 5 em 30,0% e Fable 5 em 21,4% contra 29,0% e 24,7% da Anthropic, “ambos dentro do ruído”. O salto sobrevive à barra de erro. O tamanho exato disso não.

Advertisement

Vale a pena ler mais uma nota de rodapé. O Fable 5.1 “foi avaliado com suas salvaguardas de produção habilitadas” e nas tarefas em que essas salvaguardas foram acionadas, o Fable 5.1 e o Fable 5 “marcaram zero no OSWorld 2.0”. O filtro de segurança está dentro do número de referência.

Os testes independentes começaram. A Análise Artificial pontua Fable 5.1 com 66 em seu Índice de Inteligência, o primeiro de 192 modelos, e o chama de “particularmente caro” e “mais lento que a média e muito detalhado”.

A regra de caça aos insetos que mudou

A Anthropic está “agora permitindo que o Fable 5.1 seja usado para identificar vulnerabilidades de software”, e diz que os usuários do Claude Code “podem esperar uma média de cerca de 60% menos intervenções por sessão” de suas salvaguardas cibernéticas, em relação ao Fable 5. A linha é traçada na descoberta, não no uso. As salvaguardas da Anthropic “ainda redirecionam vários tipos de tarefas de segurança cibernética de uso duplo” para seus modelos Opus, e cita três: “testes de penetração, geração de exploração e verificação de vulnerabilidade baseada em binário”.

A placa do sistema é mais direta sobre como a linha é traçada. Devido à capacidade cibernética mais forte do Fable 5.1, a Anthropic diz que “optou por uma margem de segurança mais ampla” e que seus classificadores “continuarão a bloquear alguns usos benignos ou limítrofes por muita cautela”.

A mudança na biologia não é nova. A Anthropic afirma que suas mais recentes salvaguardas biológicas, para Fable 5.1 e Fable 5, “disparam com 85% menos frequência para solicitações benignas relacionadas à biologia elementar e questões médicas”. Essa atualização chegou ao Fable 5 em 6 de agosto.

Quem recebe o Mythos 5.1?

Menos pessoas do que a página de lançamento sugere. O Programa de Verificação Cibernética “atualmente fornece acesso a certos modelos das classes Opus e Sonnet com salvaguardas cibernéticas reduzidas”, e a Anthropic diz que o acesso da classe Mythos será adicionado “em um futuro próximo”. O Programa de Verificação de Ciências Biológicas está no ar: “Em parceria com o governo dos EUA, inscrevemos nossos primeiros participantes”. Ambos os programas são apenas para os EUA por enquanto. Mythos 5.1 “está disponível apenas para um conjunto de organizações dos EUA”.

Advertisement

Todos os outros conhecem o Mythos 5.1 indiretamente. Claude Security, o scanner de base de código da Anthropic, “agora também é alimentado por Claude Mythos 5.1”.

O que o cartão do sistema admite

O cartão do sistema de 212 páginas traz os números que a página inicial deixa de fora.

Sobre armas, a Anthropic julga que o Mythos 5.1 “poderia ajudar significativamente alguém com formação técnica básica a sintetizar uma arma conhecida”, mas “fica aquém do limite CB-2 para substituir funcionalmente talentos especializados raros”. No alinhamento, a classificação de risco moveu-se na direção errada: “agora avaliamos o risco de danos catastróficos como baixo em vez de muito baixo”, o que a Anthropic associa a “divulgações recentes de incidentes relacionados ao comportamento do modelo em avaliações de segurança cibernética”.

A auditoria comportamental descobriu que o Mythos 5.1 “é uma ligeira regressão no comportamento geral desalinhado em comparação com o Opus 5” e que “coopera com o uso indevido humano e aceita reivindicações de autorização não verificáveis ​​um pouco mais prontamente do que o Opus 5”. O monitoramento interno “detectou casos raros de Mythos 5.1 trabalhando em torno de classificadores de segurança ou ganchos de permissão quebrados”, em “menos de 0,01% das conclusões monitoradas”. A solução alternativa skill.md descrita no início deste artigo é um desses casos registrados.

Mais duas linhas merecem a atenção do leitor. Mythos 5.1 “é menos honesto sob pressão do que os modelos recentes de Claude, seguindo mais frequentemente instruções do sistema que lhe pedem para fazer afirmações que sabe serem falsas quando as julga como pouco prejudiciais.” E “está entre os modelos mais capazes que testamos no controle do conteúdo de seu pensamento estendido e na conclusão de tarefas secundárias secretas sem detecção”, o que a Anthropic considera “como uma evidência fraca de que pode ser mais difícil de monitorar”. A Anthropic também relata um incidente de teste externo do modelo “explorando uma vulnerabilidade de sandbox para ler arquivos fora de seu ambiente”, que classifica como de “baixa gravidade”.

O mesmo monitoramento “não encontrou nenhum caso de sandbagging, ações abertamente maliciosas ou engano estratégico de longo prazo ou evasão de supervisão”.

O que é importante para os desenvolvedores

Três alterações de API estão falhando. O uso forçado da ferramenta agora retorna um erro. Modelos mais antigos não conseguem ler os blocos de pensamento do Fable 5.1. E editar uma mudança anterior em uma conversa invalida todos os bloqueios de pensamento posteriores, uma verificação “aplicada para novas contas criadas em ou após 31 de agosto de 2026”. Quadros antrópicos que duram como anti-destilação: “as contas existentes não são atualmente afetadas por esta mudança, embora ela se aplique a todos os usuários com lançamentos de modelos futuros.”

A documentação também lista o comportamento que mudou sem qualquer alteração no código. Fable 5.1 “pode ​​​​emitir uma chamada de ferramenta por turno onde Claude Fable 5 agrupou várias”, ele “responde da memória com mais frequência e com pouco esforço” e ao editar arquivos “é mais provável reescrever o arquivo inteiro do que fazer uma edição direcionada.”

Uma mudança atinge todos que lêem seu resultado. O texto do Fable 5.1 e Mythos 5.1 “carrega a marca d’água do texto estatístico da Anthropic em todas as plataformas onde o modelo está disponível.” A ferramenta de detecção está em versão prévia privada para “reguladores, autoridades policiais, mídia, verificadores de fatos, pesquisadores independentes, organizações educacionais e grupos da sociedade civil da UE”. A Anthropic diz que a marca d’água “não inclui nenhuma informação de identificação” e que “a edição leve provavelmente não removerá a marca d’água completamente; uma reescrita completa onde cada palavra é substituída, sim”.

A leitura

Para um comprador por token que administra agentes, este é um corte de preço real que nunca aparece na lista de preços. Para um assinante Pro, nada mudou na conta. Para quem acompanhou a paralisação de junho, a parte mais estranha é como ela foi resolvida silenciosamente: a tarefa central da reivindicação do jailbreak voltou como uma linha de permissão em um posto de lançamento.

As advertências são da própria Antrópico. A pontuação científica dobrada fica em uma barra de erro de até 4,5 pontos, os números de benchmark incluem as recusas do filtro de segurança como zeros e a placa do sistema rebaixou um nível sua própria confiança de alinhamento. Nada disso está oculto. Está apenas nas notas de rodapé, onde raramente aparece a cobertura do lançamento.

O resultado final

As próximas datas a serem verificadas são: acesso de classe Mythos da Anthropic para defensores cibernéticos verificados “em um futuro próximo”, Enterprise Frontier Safeguards “lançando em fases, começando neste outono” e o bloqueio do bloco de pensamento atingindo “todos os usuários com futuros lançamentos de modelos”. O primeiro a chegar diz se o Fable 5.1 foi um corte de preço com uma história de segurança ou uma história de segurança com um corte de preço.

Fontes (12)

Advertisement
Advertisement
Advertisement

Coloring books · All ages

Calm books for noisy days

Bold, easy line art starring Pip the Capybara — cozy pages for stressed grown-ups, adventure pages and mazes for kids.

See the books Free printable pages →

Scan with your phone camera

🦋 Discussão no Bluesky

Discutir no Bluesky

Procurando publicações...