{"content_id":"fj8mfh7xaj","slug":"claude-fable-5-1-claims-verification","locale":"pt","schema_type":"TechArticle","category":"ai_data","category_name":"Dados de IA","title":"O que mudou no Claude Fable 5.1: verificação das alegações de custo, desempenho e segurança","summary":"A principal alegação sobre a atualização apresentada como Claude Fable 5.1 não é uma redução do preço geral dos tokens, mas a diminuição do custo de leitura do cache para contextos repetidos. No entanto, como o material fornecido não inclui uma URL do anúncio oficial nem um cartão do modelo, o nome, as especificações, os benchmarks e os números de segurança do modelo devem ser verificados separadamente na documentação oficial da Anthropic.","sponsorship_disclosure":null,"affiliate_disclosure":null,"commerce_disclosure":null,"author":{"name":"injoys","url":"https://injoys.com/ko/about"},"key_points":["O material fornecido alega que o preço da leitura do cache do Claude Fable 5.1 foi reduzido em 75%, mas isso não deve ser citado como um preço confirmado antes da verificação na tabela oficial de preços.","O desconto de cache é vantajoso para agentes que leem repetidamente o mesmo contexto, mas não reduz na mesma proporção o custo de tarefas com muitas saídas.","Segundo o material fornecido, o aumento nos benchmarks é grande em pesquisas científicas e tarefas de automação, mas relativamente pequeno em tarefas de programação.","A redução das intervenções dos mecanismos de segurança deve ser interpretada não como a eliminação de restrições, mas como a diminuição de falsos positivos e fallbacks desnecessários em atividades normais de segurança e ciência.","A decisão sobre a adoção efetiva deve ser tomada após verificar o ID oficial do modelo, a tabela de preços, a região de nuvem e as condições de retenção de dados, além de reavaliá-lo com uma amostra das próprias tarefas."],"content_markdown":"A atualização apresentada como Claude Fable 5.1 é descrita como focada, mais do que em alcançar as maiores pontuações de benchmark, nos custos operacionais dos agentes, na forma de responder e na redução de falsos positivos das salvaguardas. Em especial, para agentes de programação e trabalho que leem repetidamente o mesmo prompt de sistema e o histórico de tarefas, o preço do cache de prompts pode ter grande impacto sobre o custo real.\n\nNo entanto, os materiais fornecidos não incluem URLs para o anúncio oficial, a tabela de preços ou o cartão do modelo da Anthropic. Portanto, abaixo, os números descritos nos materiais são claramente classificados como **alegações dos materiais fornecidos**, juntamente com uma explicação sobre os itens que devem ser verificados na documentação oficial e sobre como avaliar os custos reais.\n\n## Conclusões que devem ser verificadas primeiro\n\n- Os materiais fornecidos descrevem o nome do modelo como `Claude Fable 5.1` e o ID do modelo da API como `claude-fable-5-1`.\n- A data de lançamento, o tamanho do contexto, o limite de saída, a data de corte do conhecimento, os preços e os números dos benchmarks devem ser verificados novamente no cartão oficial do modelo.\n- A maior mudança alegada pelos materiais não está nos preços gerais de entrada e saída, mas na redução do preço de leitura do cache.\n- A taxa de redução de custos varia conforme a frequência com que o cache é lido repetidamente. O efeito pode ser pequeno em consultas pontuais ou tarefas centradas na saída.\n- A alegação de que houve menos intervenções das salvaguardas não significa que todas as restrições de segurança tenham sido removidas.\n\n## Especificações básicas apresentadas pelos materiais fornecidos\n\nA tabela a seguir não é uma ficha de especificações oficialmente confirmada, mas uma organização das informações contidas nos materiais fornecidos. Antes de escolher a API, é necessário verificar na visão geral dos modelos e na página de preços da Anthropic se existe um modelo com o mesmo ID.\n\n| Item | Alegação dos materiais fornecidos | O que verificar |\n|---|---:|---|\n| Nome do modelo | Claude Fable 5.1 | Se consta na lista oficial de modelos da Anthropic |\n| ID do modelo | `claude-fable-5-1` | String exata no console da API e na documentação do modelo |\n| Data de lançamento | 1º de setembro de 2026 | Data do anúncio oficial e momento da disponibilidade geral |\n| Janela de contexto | 1 milhão de tokens | Se é oferecida por padrão, em versão beta ou sob condições separadas |\n| Saída máxima | 128 mil tokens | Limite por solicitação e diferenças entre plataformas |\n| Data de corte do conhecimento | junho de 2026 | Data de corte do conhecimento no cartão oficial do modelo |\n| Preço de entrada | 10 dólares por 1 milhão de tokens | Tarifas específicas para lotes, contextos longos etc. |\n| Preço de saída | 50 dólares por 1 milhão de tokens | Se inclui tokens de raciocínio |\n| Preço de leitura do cache | 0,25 dólar por 1 milhão de tokens | Preço de criação do cache e prazo de validade |\n| `effort` de raciocínio | de `low` a `max`, com `high` como padrão | Nome do parâmetro da API e faixa compatível |\n| Ambientes disponíveis | Claude API e principais serviços de nuvem | Região, nível da conta e fase de lançamento |\n\nSe qualquer um desses itens diferir da documentação oficial, os cálculos de custos e o projeto do sistema deverão ser corrigidos com base nessa documentação. Não se devem aplicar as especificações de modelos Claude existentes apenas porque os nomes dos modelos são semelhantes.\n\n## Por que o preço de leitura do cache é importante para o custo dos agentes\n\nUma conversa comum pode terminar após um único prompt e uma única resposta. Por outro lado, um agente repete várias vezes o processo abaixo até concluir a tarefa.\n\n1. Lê as instruções do sistema e a conversa anterior.\n2. Chama ferramentas de busca de arquivos ou consulta de dados.\n3. Reavalia os resultados das ferramentas junto com o contexto existente.\n4. Modifica o código ou decide a próxima ação.\n5. Lê os resultados dos testes e, se houver falha, repete o processo.\n\nNesse processo, tokens que não mudam, como o prompt de sistema, as instruções do repositório, o histórico da conversa e as definições das ferramentas, podem ser enviados novamente a cada etapa. Quando essas partes resultam em um acerto no cache, pode ser aplicado o preço de leitura do cache em vez do preço normal de entrada.\n\nSupondo que os preços dos materiais fornecidos estejam corretos, o preço da leitura do cache cai de 1 dólar para 0,25 dólar por 1 milhão de tokens. A redução do preço unitário é a seguinte.\n\n`(1.00 - 0.25) ÷ 1.00 × 100 = 75%`\n\nIsso, porém, não significa que a fatura total cairá 75%. Os custos com novas entradas, criação do cache, saídas, execução de ferramentas e infraestrutura externa permanecem separados.\n\n### Exemplo hipotético de cálculo de custos\n\nSuponha que um conjunto de tarefas utilize 1 milhão de tokens de novas entradas, 20 milhões de tokens de leitura do cache e 200 mil tokens de saída. Os custos de criação do cache e de ferramentas externas são excluídos.\n\n| Componente do custo | Suposição com o preço anterior do cache | Suposição com o novo preço |\n|---|---:|---:|\n| Nova entrada | 10 dólares | 10 dólares |\n| Leitura do cache | 20 dólares | 5 dólares |\n| Saída | 10 dólares | 10 dólares |\n| Total | 40 dólares | 25 dólares |\n\nNesse exemplo, o custo total cai 37,5%. Por outro lado, se quase não houver leitura do cache ou se a proporção da saída for alta, a redução será muito menor.\n\n### Variáveis que determinam a taxa de redução de custos\n\n- Tamanho dos prompts e históricos de tarefas que se repetem\n- Taxa de acerto e prazo de validade do cache\n- Quantidade de resultados de ferramentas adicionados em cada etapa\n- Extensão das respostas e preço de saída\n- Número de novas tentativas após falhas\n- Custo da criação inicial do cache\n- Tarifas específicas da plataforma de nuvem e condições regionais\n\nOs materiais fornecidos afirmam que foi medida uma redução de custos de aproximadamente 25% em tarefas gerais e de aproximadamente 45% em agentes com muitas chamadas de ferramentas. Como esses números podem ser resultados obtidos em padrões específicos de uso, eles não devem ser tratados como taxas de economia garantidas para todas as cargas de trabalho.\n\n## Limites de assinatura e custos da API não são o mesmo conceito\n\nEm geral, a API calcula os custos de acordo com os tokens efetivos de entrada, saída e cache. Já os produtos Claude com preço fixo podem operar limites de uso considerando vários fatores, como número de mensagens, duração da sessão, carga do modelo e uso de ferramentas.\n\nPortanto, não se pode concluir que uma redução de 30% no custo por tarefa na API aumentará exatamente em 30% o tempo disponível nos planos de preço fixo. Os assinantes devem consultar as informações sobre limites dentro do produto e a documentação oficial de suporte da Anthropic.\n\n## Como se alega que os números dos benchmarks mudaram\n\nOs valores comparativos e as variações descritos nos materiais fornecidos são os seguintes. Para pontuações percentuais, é mais preciso considerar também a diferença em pontos percentuais, em vez de apenas a taxa relativa de aumento.\n\n| Item de avaliação | Valor alegado do Fable 5 | Valor alegado do Fable 5.1 | Variação |\n|---|---:|---:|---:|\n| Terminal-Bench-Science | 24.7% | 52.6% | +27.9%p |\n| Terminal-Bench 4.0 | 42.0% | 55.8% | +13.8%p |\n| GDPval-AA v2 | 1,723 | 1,853 | +130 |\n| AutomationBench | 17.1% | 31.4% | +14.3%p |\n| CursorBench 3.2 | 70.5% | 73.4% | +2.9%p |\n| Configuração 1 do HLE | 57.8% | 60.9% | +3.1%p |\n| Configuração 2 do HLE | 63.8% | 65.0% | +1.2%p |\n\nConsiderando apenas os materiais, a melhoria é grande nas tarefas de terminal para pesquisa científica e nas avaliações de automação, enquanto algumas avaliações de programação e conhecimento apresentam melhorias graduais. É difícil interpretar isso como uma mudança completa de geração.\n\nAo comparar benchmarks, as seguintes condições devem ser iguais.\n\n- Mesmos dados e versão da avaliação\n- Mesmo acesso a ferramentas e à internet\n- Mesmo `effort` ou configuração de raciocínio\n- Mesmo número de novas tentativas e mesmas condições de amostragem\n- Uso ou não de um modelo de fallback\n- Custo e tempo de processamento por avaliação\n\nMesmo que a pontuação seja alta, não se pode concluir que o modelo seja mais eficiente no trabalho real caso o custo ou a latência aumentem significativamente.\n\n## As melhorias no estilo de escrita devem ser avaliadas separadamente\n\nÉ difícil resumir a qualidade da escrita em uma única pontuação de benchmark. Em trabalhos reais com documentos, é melhor fazer uma comparação cega com o modelo anterior de acordo com os seguintes critérios.\n\n- Se segue desde o início o estilo e o formato solicitados\n- Se reduziu introduções desnecessárias e expressões repetitivas\n- Se não inventa detalhes sem fundamento\n- Se mantém consistência nos termos e nas conclusões, mesmo em documentos longos\n- Se corrige precisamente apenas as partes necessárias quando uma revisão é solicitada\n- Se as frases em coreano soam naturais, sem parecer tradução\n- Se não altera arbitrariamente o significado das citações e do texto original\n\nExecutar o mesmo prompt várias vezes reduz a possibilidade de confundir diferenças ocasionais entre respostas com melhorias do modelo.\n\n## Significado exato da redução das intervenções das salvaguardas\n\nOs materiais fornecidos alegam que as intervenções das salvaguardas relacionadas à cibersegurança no Claude Code diminuíram, em média, aproximadamente 60% por sessão, enquanto os fallbacks em tarefas de biologia básica e medicina geral caíram aproximadamente 85%. Se não houver um relatório oficial de avaliação, é necessário verificar a amostra, o período de medição, a definição de sessão e o denominador dessas proporções.\n\nEssas mudanças podem significar que houve uma redução na frequência com que trabalhos legítimos para fins defensivos são classificados incorretamente como solicitações perigosas. Por exemplo, podem reduzir as interrupções desnecessárias de verificações de vulnerabilidades em códigos autorizados, sugestões de patches e análises de configurações seguras.\n\nNo entanto, a redução de falsos positivos é diferente da revogação das políticas de segurança. Solicitações que ajudem de maneira substancial em invasões reais, roubo de credenciais, distribuição de malware ou automação de ataques ainda podem ser restringidas. As organizações não devem considerar o simples fato de o modelo ter respondido como uma autorização legal ou aprovação para o trabalho.\n\n## As alegações sobre proteção de dados empresariais também exigem a verificação dos termos contratuais\n\nOs materiais fornecidos explicam que uma estrutura chamada `Enterprise Frontier Safeguard` foi projetada para manter os dados dos clientes em seus ambientes de nuvem e para que as análises humanas necessárias também sejam realizadas pela organização do cliente. Eles também alegam que ela foi desenvolvida com clientes de áreas que incluem finanças, saúde, direito e setor público, bem como com grandes provedores de nuvem.\n\nPara processar dados sensíveis, não se deve considerar apenas o nome ou o texto de apresentação. É necessário verificar os seguintes pontos nos contratos e na documentação técnica.\n\n| Área de verificação | Pergunta específica |\n|---|---|\n| Local de armazenamento | Em qual região são armazenados os prompts, as saídas, os logs e os sinais de segurança |\n| Prazo de retenção | Qual é o prazo padrão de retenção e quais são as opções de exclusão imediata |\n| Acesso humano | Sob quais condições e de qual organização um responsável pode ver o conteúdo original |\n| Uso para treinamento | Se os dados dos clientes são usados no treinamento do modelo ou na melhoria do produto |\n| Criptografia | Se há suporte à criptografia em trânsito e em repouso, além de chaves gerenciadas pelo cliente |\n| Subprocessadores | Quais provedores de nuvem e serviços podem acessar os dados |\n| Recursos de auditoria | Se são fornecidos registros de acesso, logs administrativos e exportações |\n| Resposta a incidentes | Como são definidos o prazo para notificação de violações e o escopo das responsabilidades |\n\nA explicação de que os dados permanecem na nuvem do cliente não significa que os requisitos regulatórios ou de confidencialidade sejam automaticamente atendidos.\n\n## Procedimentos de verificação antes da adoção real\n\nÉ mais importante realizar verificações usando as próprias cargas de trabalho do que benchmarks públicos. Testes na sequência abaixo permitem comparar custos e qualidade em conjunto.\n\n1. Verificar o nome e o ID do modelo na lista oficial de modelos da Anthropic.\n2. Registrar separadamente na tabela de preços os valores de entrada, saída, criação do cache e leitura do cache.\n3. Preparar, sem informações pessoais ou confidenciais, uma amostra representativa de trabalhos executados com o modelo anterior e definir o tamanho da amostra conforme os critérios internos de avaliação.\n4. Configurar igualmente entre os modelos o `effort`, as permissões das ferramentas, o número de novas tentativas e a saída máxima.\n5. Medir a taxa de sucesso, o total de tokens, a quantidade de acertos no cache, a latência e o tempo de correção humana.\n6. Em tarefas nas quais as salvaguardas são importantes, como segurança e medicina, testar separadamente os falsos positivos em solicitações normais e o bloqueio de solicitações perigosas.\n7. Calcular o custo mensal estimado considerando apenas os trabalhos que atingiram o nível de qualidade exigido.\n\n### Principais métricas a registrar\n\n- Taxa de conclusão das tarefas e taxa de sucesso na primeira tentativa\n- Tokens de nova entrada, leitura do cache e saída por tarefa\n- Taxa de acerto do cache\n- Número de chamadas de ferramentas e de falhas\n- Latência média e do percentil 95\n- Tempo necessário para correções humanas\n- Número de intervenções das salvaguardas e de fallbacks do modelo\n- Custo total da API por tarefa\n\nEssas métricas são necessárias para determinar se a redução do preço unitário resultou em uma melhoria real de produtividade. Se o baixo custo dos tokens aumentar o tempo dedicado à análise de erros, o custo total do trabalho poderá, na verdade, aumentar.\n\n## Cuidados ao comparar com modelos concorrentes\n\nOs materiais fornecidos também mencionam preços de modelos de outras empresas, mas não apresentam URLs oficiais para verificar os nomes desses modelos e as condições promocionais. Portanto, não é apropriado citar novamente preços não verificados da concorrência como valores confirmados.\n\nAo comparar modelos, além do preço nominal por 1 milhão de tokens, também é necessário equiparar os seguintes itens.\n\n- Tamanho do contexto e limite de saída efetivamente disponível\n- Preços de criação e leitura do cache, além do prazo de validade\n- Forma de cobrança dos tokens de raciocínio\n- Taxa de sucesso das chamadas de ferramentas\n- Número de novas tentativas necessário para atingir a mesma qualidade\n- Condições de retenção dos dados e de uso para treinamento\n- Restrições de região e capacidade de processamento\n- Comportamento do fallback em caso de falha\n\nMesmo um modelo com saída cara pode ter um custo total menor se concluir o trabalho de uma só vez, enquanto um modelo com preço unitário baixo pode ser mais caro caso falhe repetidamente.\n\n## Avaliação geral\n\nPartindo do pressuposto de que as descrições dos materiais fornecidos sejam confirmadas pela documentação oficial, o principal diferencial do Claude Fable 5.1 não é uma redução geral dos preços, mas a **melhoria da eficiência operacional de agentes que leem repetidamente grandes volumes de contexto**. Também são apresentadas como mudanças importantes as maiores pontuações em benchmarks de ciência e automação, a melhoria na forma de escrever e a redução dos falsos positivos das salvaguardas em trabalhos legítimos.\n\nNo entanto, apenas com as evidências fornecidas atualmente, é difícil citar como fatos confirmados o nome do modelo, a data de lançamento, os preços, os benchmarks e a estrutura de proteção empresarial. Para uma adoção real, deve-se primeiro verificar a documentação oficial dos modelos e a tabela de preços da Anthropic e, em seguida, medir a taxa de acerto do cache, a taxa de conclusão e o custo total nas próprias tarefas.","content_html":"\u003cp\u003eA atualização apresentada como Claude Fable 5.1 é descrita como focada, mais do que em alcançar as maiores pontuações de benchmark, nos custos operacionais dos agentes, na forma de responder e na redução de falsos positivos das salvaguardas. Em especial, para agentes de programação e trabalho que leem repetidamente o mesmo prompt de sistema e o histórico de tarefas, o preço do cache de prompts pode ter grande impacto sobre o custo real.\u003c/p\u003e\n\u003cp\u003eNo entanto, os materiais fornecidos não incluem URLs para o anúncio oficial, a tabela de preços ou o cartão do modelo da Anthropic. Portanto, abaixo, os números descritos nos materiais são claramente classificados como \u003cstrong\u003ealegações dos materiais fornecidos\u003c/strong\u003e, juntamente com uma explicação sobre os itens que devem ser verificados na documentação oficial e sobre como avaliar os custos reais.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#conclus%C3%B5es-que-devem-ser-verificadas-primeiro\" class=\"anchor\" id=\"conclusões-que-devem-ser-verificadas-primeiro\"\u003e\u003c/a\u003eConclusões que devem ser verificadas primeiro\u003c/h2\u003e\n\u003cul\u003e\n\u003cli\u003eOs materiais fornecidos descrevem o nome do modelo como \u003ccode\u003eClaude Fable 5.1\u003c/code\u003e e o ID do modelo da API como \u003ccode\u003eclaude-fable-5-1\u003c/code\u003e.\u003c/li\u003e\n\u003cli\u003eA data de lançamento, o tamanho do contexto, o limite de saída, a data de corte do conhecimento, os preços e os números dos benchmarks devem ser verificados novamente no cartão oficial do modelo.\u003c/li\u003e\n\u003cli\u003eA maior mudança alegada pelos materiais não está nos preços gerais de entrada e saída, mas na redução do preço de leitura do cache.\u003c/li\u003e\n\u003cli\u003eA taxa de redução de custos varia conforme a frequência com que o cache é lido repetidamente. O efeito pode ser pequeno em consultas pontuais ou tarefas centradas na saída.\u003c/li\u003e\n\u003cli\u003eA alegação de que houve menos intervenções das salvaguardas não significa que todas as restrições de segurança tenham sido removidas.\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch2\u003e\n\u003ca href=\"#especifica%C3%A7%C3%B5es-b%C3%A1sicas-apresentadas-pelos-materiais-fornecidos\" class=\"anchor\" id=\"especificações-básicas-apresentadas-pelos-materiais-fornecidos\"\u003e\u003c/a\u003eEspecificações básicas apresentadas pelos materiais fornecidos\u003c/h2\u003e\n\u003cp\u003eA tabela a seguir não é uma ficha de especificações oficialmente confirmada, mas uma organização das informações contidas nos materiais fornecidos. Antes de escolher a API, é necessário verificar na visão geral dos modelos e na página de preços da Anthropic se existe um modelo com o mesmo ID.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eItem\u003c/th\u003e\n\u003cth\u003eAlegação dos materiais fornecidos\u003c/th\u003e\n\u003cth\u003eO que verificar\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item\"\u003eNome do modelo\u003c/td\u003e\n\u003ctd data-label=\"Alegação dos materiais fornecidos\"\u003eClaude Fable 5.1\u003c/td\u003e\n\u003ctd data-label=\"O que verificar\"\u003eSe consta na lista oficial de modelos da Anthropic\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item\"\u003eID do modelo\u003c/td\u003e\n\u003ctd data-label=\"Alegação dos materiais fornecidos\"\u003e\u003ccode\u003eclaude-fable-5-1\u003c/code\u003e\u003c/td\u003e\n\u003ctd data-label=\"O que verificar\"\u003eString exata no console da API e na documentação do modelo\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item\"\u003eData de lançamento\u003c/td\u003e\n\u003ctd data-label=\"Alegação dos materiais fornecidos\"\u003e1º de setembro de 2026\u003c/td\u003e\n\u003ctd data-label=\"O que verificar\"\u003eData do anúncio oficial e momento da disponibilidade geral\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item\"\u003eJanela de contexto\u003c/td\u003e\n\u003ctd data-label=\"Alegação dos materiais fornecidos\"\u003e1 milhão de tokens\u003c/td\u003e\n\u003ctd data-label=\"O que verificar\"\u003eSe é oferecida por padrão, em versão beta ou sob condições separadas\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item\"\u003eSaída máxima\u003c/td\u003e\n\u003ctd data-label=\"Alegação dos materiais fornecidos\"\u003e128 mil tokens\u003c/td\u003e\n\u003ctd data-label=\"O que verificar\"\u003eLimite por solicitação e diferenças entre plataformas\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item\"\u003eData de corte do conhecimento\u003c/td\u003e\n\u003ctd data-label=\"Alegação dos materiais fornecidos\"\u003ejunho de 2026\u003c/td\u003e\n\u003ctd data-label=\"O que verificar\"\u003eData de corte do conhecimento no cartão oficial do modelo\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item\"\u003ePreço de entrada\u003c/td\u003e\n\u003ctd data-label=\"Alegação dos materiais fornecidos\"\u003e10 dólares por 1 milhão de tokens\u003c/td\u003e\n\u003ctd data-label=\"O que verificar\"\u003eTarifas específicas para lotes, contextos longos etc.\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item\"\u003ePreço de saída\u003c/td\u003e\n\u003ctd data-label=\"Alegação dos materiais fornecidos\"\u003e50 dólares por 1 milhão de tokens\u003c/td\u003e\n\u003ctd data-label=\"O que verificar\"\u003eSe inclui tokens de raciocínio\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item\"\u003ePreço de leitura do cache\u003c/td\u003e\n\u003ctd data-label=\"Alegação dos materiais fornecidos\"\u003e0,25 dólar por 1 milhão de tokens\u003c/td\u003e\n\u003ctd data-label=\"O que verificar\"\u003ePreço de criação do cache e prazo de validade\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item\"\u003e\n\u003ccode\u003eeffort\u003c/code\u003e de raciocínio\u003c/td\u003e\n\u003ctd data-label=\"Alegação dos materiais fornecidos\"\u003ede \u003ccode\u003elow\u003c/code\u003e a \u003ccode\u003emax\u003c/code\u003e, com \u003ccode\u003ehigh\u003c/code\u003e como padrão\u003c/td\u003e\n\u003ctd data-label=\"O que verificar\"\u003eNome do parâmetro da API e faixa compatível\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item\"\u003eAmbientes disponíveis\u003c/td\u003e\n\u003ctd data-label=\"Alegação dos materiais fornecidos\"\u003eClaude API e principais serviços de nuvem\u003c/td\u003e\n\u003ctd data-label=\"O que verificar\"\u003eRegião, nível da conta e fase de lançamento\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eSe qualquer um desses itens diferir da documentação oficial, os cálculos de custos e o projeto do sistema deverão ser corrigidos com base nessa documentação. Não se devem aplicar as especificações de modelos Claude existentes apenas porque os nomes dos modelos são semelhantes.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#por-que-o-pre%C3%A7o-de-leitura-do-cache-%C3%A9-importante-para-o-custo-dos-agentes\" class=\"anchor\" id=\"por-que-o-preço-de-leitura-do-cache-é-importante-para-o-custo-dos-agentes\"\u003e\u003c/a\u003ePor que o preço de leitura do cache é importante para o custo dos agentes\u003c/h2\u003e\n\u003cp\u003eUma conversa comum pode terminar após um único prompt e uma única resposta. Por outro lado, um agente repete várias vezes o processo abaixo até concluir a tarefa.\u003c/p\u003e\n\u003col\u003e\n\u003cli\u003eLê as instruções do sistema e a conversa anterior.\u003c/li\u003e\n\u003cli\u003eChama ferramentas de busca de arquivos ou consulta de dados.\u003c/li\u003e\n\u003cli\u003eReavalia os resultados das ferramentas junto com o contexto existente.\u003c/li\u003e\n\u003cli\u003eModifica o código ou decide a próxima ação.\u003c/li\u003e\n\u003cli\u003eLê os resultados dos testes e, se houver falha, repete o processo.\u003c/li\u003e\n\u003c/ol\u003e\n\u003cp\u003eNesse processo, tokens que não mudam, como o prompt de sistema, as instruções do repositório, o histórico da conversa e as definições das ferramentas, podem ser enviados novamente a cada etapa. Quando essas partes resultam em um acerto no cache, pode ser aplicado o preço de leitura do cache em vez do preço normal de entrada.\u003c/p\u003e\n\u003cp\u003eSupondo que os preços dos materiais fornecidos estejam corretos, o preço da leitura do cache cai de 1 dólar para 0,25 dólar por 1 milhão de tokens. A redução do preço unitário é a seguinte.\u003c/p\u003e\n\u003cp\u003e\u003ccode\u003e(1.00 - 0.25) ÷ 1.00 × 100 = 75%\u003c/code\u003e\u003c/p\u003e\n\u003cp\u003eIsso, porém, não significa que a fatura total cairá 75%. Os custos com novas entradas, criação do cache, saídas, execução de ferramentas e infraestrutura externa permanecem separados.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#exemplo-hipot%C3%A9tico-de-c%C3%A1lculo-de-custos\" class=\"anchor\" id=\"exemplo-hipotético-de-cálculo-de-custos\"\u003e\u003c/a\u003eExemplo hipotético de cálculo de custos\u003c/h3\u003e\n\u003cp\u003eSuponha que um conjunto de tarefas utilize 1 milhão de tokens de novas entradas, 20 milhões de tokens de leitura do cache e 200 mil tokens de saída. Os custos de criação do cache e de ferramentas externas são excluídos.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eComponente do custo\u003c/th\u003e\n\u003cth\u003eSuposição com o preço anterior do cache\u003c/th\u003e\n\u003cth\u003eSuposição com o novo preço\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Componente do custo\"\u003eNova entrada\u003c/td\u003e\n\u003ctd data-label=\"Suposição com o preço anterior do cache\"\u003e10 dólares\u003c/td\u003e\n\u003ctd data-label=\"Suposição com o novo preço\"\u003e10 dólares\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Componente do custo\"\u003eLeitura do cache\u003c/td\u003e\n\u003ctd data-label=\"Suposição com o preço anterior do cache\"\u003e20 dólares\u003c/td\u003e\n\u003ctd data-label=\"Suposição com o novo preço\"\u003e5 dólares\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Componente do custo\"\u003eSaída\u003c/td\u003e\n\u003ctd data-label=\"Suposição com o preço anterior do cache\"\u003e10 dólares\u003c/td\u003e\n\u003ctd data-label=\"Suposição com o novo preço\"\u003e10 dólares\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Componente do custo\"\u003eTotal\u003c/td\u003e\n\u003ctd data-label=\"Suposição com o preço anterior do cache\"\u003e40 dólares\u003c/td\u003e\n\u003ctd data-label=\"Suposição com o novo preço\"\u003e25 dólares\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eNesse exemplo, o custo total cai 37,5%. Por outro lado, se quase não houver leitura do cache ou se a proporção da saída for alta, a redução será muito menor.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#vari%C3%A1veis-que-determinam-a-taxa-de-redu%C3%A7%C3%A3o-de-custos\" class=\"anchor\" id=\"variáveis-que-determinam-a-taxa-de-redução-de-custos\"\u003e\u003c/a\u003eVariáveis que determinam a taxa de redução de custos\u003c/h3\u003e\n\u003cul\u003e\n\u003cli\u003eTamanho dos prompts e históricos de tarefas que se repetem\u003c/li\u003e\n\u003cli\u003eTaxa de acerto e prazo de validade do cache\u003c/li\u003e\n\u003cli\u003eQuantidade de resultados de ferramentas adicionados em cada etapa\u003c/li\u003e\n\u003cli\u003eExtensão das respostas e preço de saída\u003c/li\u003e\n\u003cli\u003eNúmero de novas tentativas após falhas\u003c/li\u003e\n\u003cli\u003eCusto da criação inicial do cache\u003c/li\u003e\n\u003cli\u003eTarifas específicas da plataforma de nuvem e condições regionais\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eOs materiais fornecidos afirmam que foi medida uma redução de custos de aproximadamente 25% em tarefas gerais e de aproximadamente 45% em agentes com muitas chamadas de ferramentas. Como esses números podem ser resultados obtidos em padrões específicos de uso, eles não devem ser tratados como taxas de economia garantidas para todas as cargas de trabalho.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#limites-de-assinatura-e-custos-da-api-n%C3%A3o-s%C3%A3o-o-mesmo-conceito\" class=\"anchor\" id=\"limites-de-assinatura-e-custos-da-api-não-são-o-mesmo-conceito\"\u003e\u003c/a\u003eLimites de assinatura e custos da API não são o mesmo conceito\u003c/h2\u003e\n\u003cp\u003eEm geral, a API calcula os custos de acordo com os tokens efetivos de entrada, saída e cache. Já os produtos Claude com preço fixo podem operar limites de uso considerando vários fatores, como número de mensagens, duração da sessão, carga do modelo e uso de ferramentas.\u003c/p\u003e\n\u003cp\u003ePortanto, não se pode concluir que uma redução de 30% no custo por tarefa na API aumentará exatamente em 30% o tempo disponível nos planos de preço fixo. Os assinantes devem consultar as informações sobre limites dentro do produto e a documentação oficial de suporte da Anthropic.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#como-se-alega-que-os-n%C3%BAmeros-dos-benchmarks-mudaram\" class=\"anchor\" id=\"como-se-alega-que-os-números-dos-benchmarks-mudaram\"\u003e\u003c/a\u003eComo se alega que os números dos benchmarks mudaram\u003c/h2\u003e\n\u003cp\u003eOs valores comparativos e as variações descritos nos materiais fornecidos são os seguintes. Para pontuações percentuais, é mais preciso considerar também a diferença em pontos percentuais, em vez de apenas a taxa relativa de aumento.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eItem de avaliação\u003c/th\u003e\n\u003cth\u003eValor alegado do Fable 5\u003c/th\u003e\n\u003cth\u003eValor alegado do Fable 5.1\u003c/th\u003e\n\u003cth\u003eVariação\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item de avaliação\"\u003eTerminal-Bench-Science\u003c/td\u003e\n\u003ctd data-label=\"Valor alegado do Fable 5\"\u003e24.7%\u003c/td\u003e\n\u003ctd data-label=\"Valor alegado do Fable 5.1\"\u003e52.6%\u003c/td\u003e\n\u003ctd data-label=\"Variação\"\u003e+27.9%p\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item de avaliação\"\u003eTerminal-Bench 4.0\u003c/td\u003e\n\u003ctd data-label=\"Valor alegado do Fable 5\"\u003e42.0%\u003c/td\u003e\n\u003ctd data-label=\"Valor alegado do Fable 5.1\"\u003e55.8%\u003c/td\u003e\n\u003ctd data-label=\"Variação\"\u003e+13.8%p\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item de avaliação\"\u003eGDPval-AA v2\u003c/td\u003e\n\u003ctd data-label=\"Valor alegado do Fable 5\"\u003e1,723\u003c/td\u003e\n\u003ctd data-label=\"Valor alegado do Fable 5.1\"\u003e1,853\u003c/td\u003e\n\u003ctd data-label=\"Variação\"\u003e+130\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item de avaliação\"\u003eAutomationBench\u003c/td\u003e\n\u003ctd data-label=\"Valor alegado do Fable 5\"\u003e17.1%\u003c/td\u003e\n\u003ctd data-label=\"Valor alegado do Fable 5.1\"\u003e31.4%\u003c/td\u003e\n\u003ctd data-label=\"Variação\"\u003e+14.3%p\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item de avaliação\"\u003eCursorBench 3.2\u003c/td\u003e\n\u003ctd data-label=\"Valor alegado do Fable 5\"\u003e70.5%\u003c/td\u003e\n\u003ctd data-label=\"Valor alegado do Fable 5.1\"\u003e73.4%\u003c/td\u003e\n\u003ctd data-label=\"Variação\"\u003e+2.9%p\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item de avaliação\"\u003eConfiguração 1 do HLE\u003c/td\u003e\n\u003ctd data-label=\"Valor alegado do Fable 5\"\u003e57.8%\u003c/td\u003e\n\u003ctd data-label=\"Valor alegado do Fable 5.1\"\u003e60.9%\u003c/td\u003e\n\u003ctd data-label=\"Variação\"\u003e+3.1%p\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item de avaliação\"\u003eConfiguração 2 do HLE\u003c/td\u003e\n\u003ctd data-label=\"Valor alegado do Fable 5\"\u003e63.8%\u003c/td\u003e\n\u003ctd data-label=\"Valor alegado do Fable 5.1\"\u003e65.0%\u003c/td\u003e\n\u003ctd data-label=\"Variação\"\u003e+1.2%p\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eConsiderando apenas os materiais, a melhoria é grande nas tarefas de terminal para pesquisa científica e nas avaliações de automação, enquanto algumas avaliações de programação e conhecimento apresentam melhorias graduais. É difícil interpretar isso como uma mudança completa de geração.\u003c/p\u003e\n\u003cp\u003eAo comparar benchmarks, as seguintes condições devem ser iguais.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eMesmos dados e versão da avaliação\u003c/li\u003e\n\u003cli\u003eMesmo acesso a ferramentas e à internet\u003c/li\u003e\n\u003cli\u003eMesmo \u003ccode\u003eeffort\u003c/code\u003e ou configuração de raciocínio\u003c/li\u003e\n\u003cli\u003eMesmo número de novas tentativas e mesmas condições de amostragem\u003c/li\u003e\n\u003cli\u003eUso ou não de um modelo de fallback\u003c/li\u003e\n\u003cli\u003eCusto e tempo de processamento por avaliação\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eMesmo que a pontuação seja alta, não se pode concluir que o modelo seja mais eficiente no trabalho real caso o custo ou a latência aumentem significativamente.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#as-melhorias-no-estilo-de-escrita-devem-ser-avaliadas-separadamente\" class=\"anchor\" id=\"as-melhorias-no-estilo-de-escrita-devem-ser-avaliadas-separadamente\"\u003e\u003c/a\u003eAs melhorias no estilo de escrita devem ser avaliadas separadamente\u003c/h2\u003e\n\u003cp\u003eÉ difícil resumir a qualidade da escrita em uma única pontuação de benchmark. Em trabalhos reais com documentos, é melhor fazer uma comparação cega com o modelo anterior de acordo com os seguintes critérios.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eSe segue desde o início o estilo e o formato solicitados\u003c/li\u003e\n\u003cli\u003eSe reduziu introduções desnecessárias e expressões repetitivas\u003c/li\u003e\n\u003cli\u003eSe não inventa detalhes sem fundamento\u003c/li\u003e\n\u003cli\u003eSe mantém consistência nos termos e nas conclusões, mesmo em documentos longos\u003c/li\u003e\n\u003cli\u003eSe corrige precisamente apenas as partes necessárias quando uma revisão é solicitada\u003c/li\u003e\n\u003cli\u003eSe as frases em coreano soam naturais, sem parecer tradução\u003c/li\u003e\n\u003cli\u003eSe não altera arbitrariamente o significado das citações e do texto original\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eExecutar o mesmo prompt várias vezes reduz a possibilidade de confundir diferenças ocasionais entre respostas com melhorias do modelo.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#significado-exato-da-redu%C3%A7%C3%A3o-das-interven%C3%A7%C3%B5es-das-salvaguardas\" class=\"anchor\" id=\"significado-exato-da-redução-das-intervenções-das-salvaguardas\"\u003e\u003c/a\u003eSignificado exato da redução das intervenções das salvaguardas\u003c/h2\u003e\n\u003cp\u003eOs materiais fornecidos alegam que as intervenções das salvaguardas relacionadas à cibersegurança no Claude Code diminuíram, em média, aproximadamente 60% por sessão, enquanto os fallbacks em tarefas de biologia básica e medicina geral caíram aproximadamente 85%. Se não houver um relatório oficial de avaliação, é necessário verificar a amostra, o período de medição, a definição de sessão e o denominador dessas proporções.\u003c/p\u003e\n\u003cp\u003eEssas mudanças podem significar que houve uma redução na frequência com que trabalhos legítimos para fins defensivos são classificados incorretamente como solicitações perigosas. Por exemplo, podem reduzir as interrupções desnecessárias de verificações de vulnerabilidades em códigos autorizados, sugestões de patches e análises de configurações seguras.\u003c/p\u003e\n\u003cp\u003eNo entanto, a redução de falsos positivos é diferente da revogação das políticas de segurança. Solicitações que ajudem de maneira substancial em invasões reais, roubo de credenciais, distribuição de malware ou automação de ataques ainda podem ser restringidas. As organizações não devem considerar o simples fato de o modelo ter respondido como uma autorização legal ou aprovação para o trabalho.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#as-alega%C3%A7%C3%B5es-sobre-prote%C3%A7%C3%A3o-de-dados-empresariais-tamb%C3%A9m-exigem-a-verifica%C3%A7%C3%A3o-dos-termos-contratuais\" class=\"anchor\" id=\"as-alegações-sobre-proteção-de-dados-empresariais-também-exigem-a-verificação-dos-termos-contratuais\"\u003e\u003c/a\u003eAs alegações sobre proteção de dados empresariais também exigem a verificação dos termos contratuais\u003c/h2\u003e\n\u003cp\u003eOs materiais fornecidos explicam que uma estrutura chamada \u003ccode\u003eEnterprise Frontier Safeguard\u003c/code\u003e foi projetada para manter os dados dos clientes em seus ambientes de nuvem e para que as análises humanas necessárias também sejam realizadas pela organização do cliente. Eles também alegam que ela foi desenvolvida com clientes de áreas que incluem finanças, saúde, direito e setor público, bem como com grandes provedores de nuvem.\u003c/p\u003e\n\u003cp\u003ePara processar dados sensíveis, não se deve considerar apenas o nome ou o texto de apresentação. É necessário verificar os seguintes pontos nos contratos e na documentação técnica.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eÁrea de verificação\u003c/th\u003e\n\u003cth\u003ePergunta específica\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Área de verificação\"\u003eLocal de armazenamento\u003c/td\u003e\n\u003ctd data-label=\"Pergunta específica\"\u003eEm qual região são armazenados os prompts, as saídas, os logs e os sinais de segurança\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Área de verificação\"\u003ePrazo de retenção\u003c/td\u003e\n\u003ctd data-label=\"Pergunta específica\"\u003eQual é o prazo padrão de retenção e quais são as opções de exclusão imediata\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Área de verificação\"\u003eAcesso humano\u003c/td\u003e\n\u003ctd data-label=\"Pergunta específica\"\u003eSob quais condições e de qual organização um responsável pode ver o conteúdo original\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Área de verificação\"\u003eUso para treinamento\u003c/td\u003e\n\u003ctd data-label=\"Pergunta específica\"\u003eSe os dados dos clientes são usados no treinamento do modelo ou na melhoria do produto\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Área de verificação\"\u003eCriptografia\u003c/td\u003e\n\u003ctd data-label=\"Pergunta específica\"\u003eSe há suporte à criptografia em trânsito e em repouso, além de chaves gerenciadas pelo cliente\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Área de verificação\"\u003eSubprocessadores\u003c/td\u003e\n\u003ctd data-label=\"Pergunta específica\"\u003eQuais provedores de nuvem e serviços podem acessar os dados\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Área de verificação\"\u003eRecursos de auditoria\u003c/td\u003e\n\u003ctd data-label=\"Pergunta específica\"\u003eSe são fornecidos registros de acesso, logs administrativos e exportações\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Área de verificação\"\u003eResposta a incidentes\u003c/td\u003e\n\u003ctd data-label=\"Pergunta específica\"\u003eComo são definidos o prazo para notificação de violações e o escopo das responsabilidades\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eA explicação de que os dados permanecem na nuvem do cliente não significa que os requisitos regulatórios ou de confidencialidade sejam automaticamente atendidos.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#procedimentos-de-verifica%C3%A7%C3%A3o-antes-da-ado%C3%A7%C3%A3o-real\" class=\"anchor\" id=\"procedimentos-de-verificação-antes-da-adoção-real\"\u003e\u003c/a\u003eProcedimentos de verificação antes da adoção real\u003c/h2\u003e\n\u003cp\u003eÉ mais importante realizar verificações usando as próprias cargas de trabalho do que benchmarks públicos. Testes na sequência abaixo permitem comparar custos e qualidade em conjunto.\u003c/p\u003e\n\u003col\u003e\n\u003cli\u003eVerificar o nome e o ID do modelo na lista oficial de modelos da Anthropic.\u003c/li\u003e\n\u003cli\u003eRegistrar separadamente na tabela de preços os valores de entrada, saída, criação do cache e leitura do cache.\u003c/li\u003e\n\u003cli\u003ePreparar, sem informações pessoais ou confidenciais, uma amostra representativa de trabalhos executados com o modelo anterior e definir o tamanho da amostra conforme os critérios internos de avaliação.\u003c/li\u003e\n\u003cli\u003eConfigurar igualmente entre os modelos o \u003ccode\u003eeffort\u003c/code\u003e, as permissões das ferramentas, o número de novas tentativas e a saída máxima.\u003c/li\u003e\n\u003cli\u003eMedir a taxa de sucesso, o total de tokens, a quantidade de acertos no cache, a latência e o tempo de correção humana.\u003c/li\u003e\n\u003cli\u003eEm tarefas nas quais as salvaguardas são importantes, como segurança e medicina, testar separadamente os falsos positivos em solicitações normais e o bloqueio de solicitações perigosas.\u003c/li\u003e\n\u003cli\u003eCalcular o custo mensal estimado considerando apenas os trabalhos que atingiram o nível de qualidade exigido.\u003c/li\u003e\n\u003c/ol\u003e\n\u003ch3\u003e\n\u003ca href=\"#principais-m%C3%A9tricas-a-registrar\" class=\"anchor\" id=\"principais-métricas-a-registrar\"\u003e\u003c/a\u003ePrincipais métricas a registrar\u003c/h3\u003e\n\u003cul\u003e\n\u003cli\u003eTaxa de conclusão das tarefas e taxa de sucesso na primeira tentativa\u003c/li\u003e\n\u003cli\u003eTokens de nova entrada, leitura do cache e saída por tarefa\u003c/li\u003e\n\u003cli\u003eTaxa de acerto do cache\u003c/li\u003e\n\u003cli\u003eNúmero de chamadas de ferramentas e de falhas\u003c/li\u003e\n\u003cli\u003eLatência média e do percentil 95\u003c/li\u003e\n\u003cli\u003eTempo necessário para correções humanas\u003c/li\u003e\n\u003cli\u003eNúmero de intervenções das salvaguardas e de fallbacks do modelo\u003c/li\u003e\n\u003cli\u003eCusto total da API por tarefa\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eEssas métricas são necessárias para determinar se a redução do preço unitário resultou em uma melhoria real de produtividade. Se o baixo custo dos tokens aumentar o tempo dedicado à análise de erros, o custo total do trabalho poderá, na verdade, aumentar.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#cuidados-ao-comparar-com-modelos-concorrentes\" class=\"anchor\" id=\"cuidados-ao-comparar-com-modelos-concorrentes\"\u003e\u003c/a\u003eCuidados ao comparar com modelos concorrentes\u003c/h2\u003e\n\u003cp\u003eOs materiais fornecidos também mencionam preços de modelos de outras empresas, mas não apresentam URLs oficiais para verificar os nomes desses modelos e as condições promocionais. Portanto, não é apropriado citar novamente preços não verificados da concorrência como valores confirmados.\u003c/p\u003e\n\u003cp\u003eAo comparar modelos, além do preço nominal por 1 milhão de tokens, também é necessário equiparar os seguintes itens.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eTamanho do contexto e limite de saída efetivamente disponível\u003c/li\u003e\n\u003cli\u003ePreços de criação e leitura do cache, além do prazo de validade\u003c/li\u003e\n\u003cli\u003eForma de cobrança dos tokens de raciocínio\u003c/li\u003e\n\u003cli\u003eTaxa de sucesso das chamadas de ferramentas\u003c/li\u003e\n\u003cli\u003eNúmero de novas tentativas necessário para atingir a mesma qualidade\u003c/li\u003e\n\u003cli\u003eCondições de retenção dos dados e de uso para treinamento\u003c/li\u003e\n\u003cli\u003eRestrições de região e capacidade de processamento\u003c/li\u003e\n\u003cli\u003eComportamento do fallback em caso de falha\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eMesmo um modelo com saída cara pode ter um custo total menor se concluir o trabalho de uma só vez, enquanto um modelo com preço unitário baixo pode ser mais caro caso falhe repetidamente.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#avalia%C3%A7%C3%A3o-geral\" class=\"anchor\" id=\"avaliação-geral\"\u003e\u003c/a\u003eAvaliação geral\u003c/h2\u003e\n\u003cp\u003ePartindo do pressuposto de que as descrições dos materiais fornecidos sejam confirmadas pela documentação oficial, o principal diferencial do Claude Fable 5.1 não é uma redução geral dos preços, mas a \u003cstrong\u003emelhoria da eficiência operacional de agentes que leem repetidamente grandes volumes de contexto\u003c/strong\u003e. Também são apresentadas como mudanças importantes as maiores pontuações em benchmarks de ciência e automação, a melhoria na forma de escrever e a redução dos falsos positivos das salvaguardas em trabalhos legítimos.\u003c/p\u003e\n\u003cp\u003eNo entanto, apenas com as evidências fornecidas atualmente, é difícil citar como fatos confirmados o nome do modelo, a data de lançamento, os preços, os benchmarks e a estrutura de proteção empresarial. Para uma adoção real, deve-se primeiro verificar a documentação oficial dos modelos e a tabela de preços da Anthropic e, em seguida, medir a taxa de acerto do cache, a taxa de conclusão e o custo total nas próprias tarefas.\u003c/p\u003e\n","tags":["IA generativa","Proteção de dados","Agentes de IA","Anthropic","Desenvolvimento de IA","Claude"],"faqs":[{"question":"Claude Fable 5.1 é um modelo anunciado oficialmente pela Anthropic?","answer":"Embora isso esteja indicado no material fornecido, ele não inclui um anúncio oficial nem a URL do cartão do modelo. Até que o ID exato do modelo `claude-fable-5-1` seja confirmado na visão geral dos modelos da Anthropic e no console da API, é mais seguro não afirmar que se trata de um modelo lançado oficialmente."},{"question":"Se o preço da leitura de cache cair 75%, o custo total da API também cairá 75%?","answer":"Não. Os 75% correspondem à redução do preço unitário da própria leitura de cache. Como os custos de novas entradas, criação de cache, saídas e ferramentas externas permanecem, a economia total varia de acordo com a proporção que a leitura de cache representa no custo total."},{"question":"Quais tarefas se beneficiam mais do desconto do cache de prompts?","answer":"Agentes de programação e automações de trabalho que leem repetidamente, em várias etapas, instruções longas do sistema, informações do repositório, histórico de conversas ou definições de ferramentas são favorecidos. O efeito é limitado em perguntas pontuais ou tarefas cujo contexto muda muito a cada vez."},{"question":"Se o custo da API diminuir, o limite da assinatura do Claude também aumentará na mesma proporção?","answer":"Não é possível afirmar isso. A cobrança por tokens da API e os limites de uso dos planos de preço fixo podem ser administrados por políticas diferentes. Qualquer mudança efetiva nos limites dos produtos por assinatura deve ser verificada separadamente nas informações oficiais de produtos da Anthropic."},{"question":"Se a pontuação em benchmarks aumentar, os resultados serão melhores em todas as tarefas?","answer":"Não. Os benchmarks são resultados medidos com dados, ferramentas e condições de avaliação específicos. É necessário medir novamente a taxa de conclusão e o custo com amostras das tarefas que serão realmente utilizadas, como redação de documentos em coreano, alterações em código interno ou tarefas prolongadas de agentes."},{"question":"A redução das intervenções dos mecanismos de segurança significa que todas as solicitações relacionadas à segurança serão permitidas?","answer":"Não. Deve ser interpretada como uma redução de falsos positivos e fallbacks desnecessários em atividades defensivas legítimas. Solicitações com alto potencial de causar danos, como invasões reais, distribuição de malware e roubo de credenciais, ainda podem ser restringidas."},{"question":"Se os dados corporativos forem armazenados na própria nuvem da empresa, a conformidade regulatória estará garantida?","answer":"Não. Além do local de armazenamento dos dados, é necessário verificar, no contrato e na documentação técnica, o período de retenção, o acesso humano, se os dados são usados para treinamento, os subprocessadores, a criptografia, os logs de auditoria e as condições para notificação de incidentes."},{"question":"Qual é o indicador mais importante para decidir se o Fable 5.1 deve ser adotado?","answer":"É necessário medir em conjunto a taxa de conclusão das próprias tarefas, a quantidade de acertos de cache, o total de tokens por tarefa, o número de novas tentativas, a latência, o tempo de correção humana e o custo total da API. A decisão de adoção não deve se basear em apenas um benchmark público."}],"sources":[{"url":"https://docs.anthropic.com/en/docs/about-claude/models/overview","title":"Anthropic Docs — Visão geral dos modelos","type":"source"},{"url":"https://docs.anthropic.com/en/docs/about-claude/pricing","title":"Anthropic Docs — Preços","type":"data_point"},{"url":"https://www.anthropic.com/news","title":"Notícias da Anthropic","type":"source"}],"images":[{"id":1037,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6MTQ1MjUsInB1ciI6ImJsb2JfaWQifX0=--88627a9169f91e2f5d1d6aba13072e24e1e4bd22/ai-a85979fa.webp","is_representative":true,"generation_method":"ai_photo","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"서버실에서 터치스크린으로 시스템 상태를 확인하는 기술자","caption":"기술자가 서버 랙 옆에서 시스템 모니터링 화면을 점검하고 있다.","description":null},"en":{"alt":"Technician checking system status on a touchscreen in a server room","caption":"A technician reviews monitoring data beside rows of server racks.","description":null},"ja":{"alt":"サーバールームでタッチスクリーンのシステム状態を確認する技術者","caption":"技術者がサーバーラックの横で監視データを点検している。","description":null},"es":{"alt":"Técnica revisando el estado del sistema en una pantalla táctil de una sala de servidores","caption":"Una técnica examina datos de monitoreo junto a varios racks de servidores.","description":null},"id":{"alt":"Teknisi memeriksa status sistem pada layar sentuh di ruang server","caption":"Seorang teknisi meninjau data pemantauan di samping deretan rak server.","description":null},"pt":{"alt":"Técnica verificando o status do sistema em uma tela sensível ao toque na sala de servidores","caption":"Uma técnica analisa dados de monitoramento ao lado de racks de servidores.","description":null},"zh-hant":{"alt":"技術人員在伺服器機房透過觸控螢幕查看系統狀態","caption":"技術人員在成排伺服器機櫃旁檢查監控資料。","description":null},"de":{"alt":"Technikerin prüft den Systemstatus auf einem Touchscreen in einem Serverraum","caption":"Eine Technikerin kontrolliert Überwachungsdaten neben mehreren Serverracks.","description":null}}},{"id":1038,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6MTQ1MzEsInB1ciI6ImJsb2JfaWQifX0=--5857ba722b25c8c08da7fe4bb6c910dec3cbcabb/ai-50a0ff25.webp","is_representative":false,"generation_method":"ai_image","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"AI 칩을 중심으로 비용 감소, 성능 지표, 보안 점검을 나타낸 인포그래픽","caption":"AI 시스템의 비용·성능·안전성 검증 과정을 시각화한 개념도다.","description":null},"en":{"alt":"Infographic of an AI chip with falling costs, performance charts, and security checks","caption":"The illustration visualizes the evaluation of an AI system’s cost, performance, and safety.","description":null},"ja":{"alt":"AIチップを中心にコスト低下、性能指標、セキュリティ確認を示す図","caption":"AIシステムのコスト、性能、安全性を検証する流れを可視化している。","description":null},"es":{"alt":"Infografía de un chip de IA con costes a la baja, métricas de rendimiento y controles de seguridad","caption":"La ilustración representa la evaluación del coste, el rendimiento y la seguridad de un sistema de IA.","description":null},"id":{"alt":"Infografik cip AI dengan biaya menurun, grafik kinerja, dan pemeriksaan keamanan","caption":"Ilustrasi ini memvisualkan evaluasi biaya, kinerja, dan keamanan sistem AI.","description":null},"pt":{"alt":"Infográfico de chip de IA com custos em queda, métricas de desempenho e verificações de segurança","caption":"A ilustração representa a avaliação de custo, desempenho e segurança de um sistema de IA.","description":null},"zh-hant":{"alt":"以AI晶片為中心，呈現成本下降、效能指標與安全檢查的資訊圖","caption":"此圖呈現評估AI系統成本、效能與安全性的流程。","description":null},"de":{"alt":"Infografik eines KI-Chips mit sinkenden Kosten, Leistungsdiagrammen und Sicherheitsprüfungen","caption":"Die Grafik veranschaulicht die Bewertung von Kosten, Leistung und Sicherheit eines KI-Systems.","description":null}}}],"published_at":"2026-09-03T19:59:42+09:00","updated_at":"2026-09-03T19:59:42+09:00","license":"cc_by","translation_status":"reviewed","available_locales":["ko","en","ja","es"],"data_locales":["ko","en","ja","es","id","pt","zh-hant","de"],"url":"https://injoys.com/en/articles/claude-fable-5-1-claims-verification"}