{"content_id":"ardq66qm2e","slug":"claude-opus-5-verification-and-migration-guide","locale":"pt","schema_type":"TechArticle","category":"how_to","category_name":"Como Fazer","title":"Como revisar prompts e harness antes de migrar para Claude Opus 5","summary":"Distingue as características do Claude Opus 5 alegadas no material fornecido das informações verificáveis e explica como reformular prompts, harnesses e sistemas de avaliação ao adotar uma nova geração de modelos. A disponibilidade, os preços e os nomes dos modelos devem ser confirmados na lista oficial de modelos e na tabela de preços da Anthropic.","author":{"name":"injoys","url":"https://injoys.com/ko/about"},"key_points":["As datas de lançamento, os preços e o desempenho de Claude Opus 5, Fable 5 e Sonnet 5 apresentados no material fornecido devem ser confirmados de forma independente em fontes oficiais antes do uso.","Em vez de simplesmente copiar os prompts existentes para um novo modelo, é preciso medir novamente a qualidade, o custo e a latência com dados de trabalho reais.","Instruções redundantes de verificação e chamadas ilimitadas de subagentes podem aumentar o custo e o tempo de execução sem melhorar os resultados.","Separar instruções do sistema, regras do projeto, Skills carregadas quando necessário e referências técnicas facilita o gerenciamento do contexto.","Mais do que a posição em benchmarks, avaliações próprias que reflitam as tarefas reais e o custo das falhas da organização oferecem uma base mais direta para escolher o modelo."],"content_markdown":"O material fornecido apresenta Claude Opus 5 como um modelo voltado para tarefas cotidianas de agentes e ambientes empresariais e afirma que, na nova geração de Claude, é necessário reformular os prompts e harnesses existentes. No entanto, **as datas de lançamento, os preços e o desempenho de Claude Opus 5, Fable 5 e Sonnet 5, bem como as declarações de parceiros mencionadas no material, não puderam ser verificados de forma independente apenas com as informações fornecidas neste texto.** Em particular, é necessário primeiro confirmar na lista oficial de modelos se `Fable` é um nome oficial de modelo da Anthropic.\n\nPortanto, em vez de repetir essas informações de lançamento como fatos confirmados, este documento distingue e organiza os itens que precisam ser verificados na documentação oficial e os procedimentos de validação que podem ser aplicados a uma migração real de modelo.\n\n## Informações de lançamento que devem ser verificadas primeiro\n\nAntes de aplicar um novo modelo à API, ao aplicativo Claude ou ao Claude Code, é necessário comparar os itens a seguir com a documentação oficial da Anthropic e com a tela de seleção de modelos do serviço utilizado.\n\n| Item a verificar | Alegação do material fornecido | Verificação necessária |\n|---|---|---|\n| Nome dos modelos | Claude Opus 5, Fable 5, Sonnet 5 | Nomes exatos dos produtos e IDs dos modelos na lista oficial |\n| Datas de lançamento | 9 de junho, 30 de junho e 24 de julho, respectivamente | Ano e datas no anúncio oficial e no histórico de alterações |\n| Preço do Opus 5 | 5 dólares para entrada, 25 dólares para saída/1 milhão de tokens | Tabela oficial de preços da API e cobranças separadas por lote, cache e contexto longo |\n| Modelo padrão no produto | Novo modelo padrão do Claude Max | Aplicabilidade por região, plano e cliente |\n| Função de cada modelo | Divisão entre tarefas autônomas de longa duração, tarefas cotidianas e tarefas leves | Descrições oficiais dos modelos e resultados de avaliações em trabalhos reais |\n| Melhoria de desempenho | Melhoria em uma proporção específica em relação ao modelo anterior | Tarefas de avaliação, tamanho da amostra, critérios de medição e texto original do parceiro |\n\nSe o nome ou o preço de um modelo não constar na documentação oficial, ele não deve ser usado nas configurações da API nem nos cálculos de orçamento. Caso sejam utilizados provedores de nuvem ou serviços de revenda, o ID do modelo, o preço e a data de disponibilização também podem ser diferentes dos oferecidos diretamente pela API da Anthropic.\n\n## Critérios de decisão que devem mudar na migração de modelo\n\n### 1. Medir a eficiência por tarefa, não apenas o desempenho máximo\n\nProcessar todas as solicitações com o modelo mais caro pode aumentar rapidamente os custos quando um agente chama repetidamente diversas ferramentas e subagentes. O modelo deve ser escolhido não pelo nome ou pela categoria, mas pela análise conjunta dos seguintes indicadores.\n\n- **Taxa de sucesso:** proporção de resultados que atendem aos requisitos sem correções humanas\n- **Custo total:** custo que inclui não apenas a solicitação inicial, mas também novas tentativas, chamadas de ferramentas e chamadas de subagentes\n- **Tempo de conclusão:** tempo que inclui a espera e o período de revisão e correção humana\n- **Custo da falha:** impacto causado pela falha, como vulnerabilidades de segurança, implantações incorretas ou análises incompletas\n- **Consistência:** grau de variação dos resultados ao repetir o mesmo tipo de tarefa\n\nO custo por tarefa não deve ser avaliado apenas pelo preço unitário dos tokens. Conceitualmente, ele pode ser calculado da seguinte forma.\n\n`Custo total por tarefa = custo do modelo principal + custo dos subagentes + custo das ferramentas + custo das novas tentativas + custo da revisão humana`\n\n### 2. Separar benchmarks públicos de avaliações próprias\n\nBenchmarks públicos são um ponto de partida para comparar as características gerais dos modelos, mas não garantem o sucesso em uma base de código, formato de documento ou regra de negócio específicos. A organização deve criar seu próprio conjunto de avaliação com tarefas reais anonimizadas.\n\nUm bom conjunto de avaliação inclui os seguintes casos.\n\n- Tarefas representativas que devem ser concluídas normalmente\n- Casos-limite em que o modelo costuma errar\n- Tarefas com requisitos ambíguos que exigem perguntas adicionais\n- Tarefas que exigem chamadas de ferramentas ou verificação de materiais externos\n- Tarefas de alto risco que devem ser interrompidas ou submetidas à aprovação humana\n- Tarefas que exigem salvar e restaurar o estado durante execuções prolongadas\n\nPara possibilitar a comparação, devem ser aplicados a cada modelo as mesmas entradas, ferramentas, limites de tempo e critérios de sucesso. É mais seguro registrar a taxa de sucesso e a distribuição de custos de várias execuções repetidas do que se basear em um ou dois resultados impressionantes.\n\n### 3. Avaliar o modelo e o harness como um único sistema\n\n**Harness** é o ambiente de execução que envolve o modelo. Ele inclui o prompt de sistema, as instruções do projeto, a busca, a memória, as ferramentas, as Skills, os subagentes, o gerenciamento de permissões e a lógica de validação e novas tentativas.\n\nMesmo o mesmo modelo pode gerar resultados diferentes dependendo do harness. Por exemplo, se o próprio modelo escreve e executa testes e o harness também impõe a mesma validação, o trabalho pode ser duplicado. Por outro lado, é arriscado deixar sob o julgamento autônomo do modelo até mesmo etapas que exigem controles determinísticos, como aprovação de implantação ou verificação de segurança.\n\nO princípio central é **distinguir o raciocínio que o modelo executa bem dos controles que o sistema deve obrigatoriamente garantir**.\n\n## 6 pontos a verificar nos prompts e no harness\n\n### 1. Remover experimentalmente instruções duplicadas de validação e nova verificação\n\nExcluir incondicionalmente frases como `após concluir, verifique tudo novamente` não é necessariamente a resposta correta. Primeiro, acompanhe se as validações executadas espontaneamente pelo novo modelo se sobrepõem às etapas de validação do harness.\n\n- Se a revisão do próprio modelo apenas se repetir sem melhorar a qualidade, reduza o prompt.\n- Mantenha no harness verificações que possam ser automatizadas, como testes, validação de esquema e análise estática.\n- Não substitua pela autovalidação do modelo a aprovação de tarefas de alto risco, como pagamentos, implantações e exclusão de dados.\n\n### 2. Definir condições e limites para chamadas de subagentes\n\nSubagentes são úteis para pesquisas paralelas ou para separar áreas especializadas, mas delegar até mesmo tarefas pequenas aumenta os custos e a latência. É possível especificar políticas como estas.\n\n- Usar subagentes apenas em tarefas que possam ser divididas de forma independente.\n- Limitar a quantidade que pode ser executada simultaneamente em uma solicitação.\n- Fornecer a cada subagente um resultado esperado e uma condição de encerramento claros.\n- Impedir que vários agentes pesquisem o mesmo material de forma duplicada.\n- Obter aprovação humana se o custo ou o tempo estimado ultrapassar o limite.\n\n### 3. Converter regras de proibição detalhadas em critérios de decisão\n\nListas longas de proibições podem entrar em conflito entre si ou não contemplar situações novas. Em áreas de baixo risco, como estilo, pode-se permitir que o modelo leia o contexto ao redor e faça seu próprio julgamento.\n\n- Prescritivo: `Nunca escreva docstrings com vários parágrafos.`\n- Delegação de julgamento: `Siga a densidade de comentários, o formato das docstrings, a nomenclatura e os padrões idiomáticos do código existente.`\n\nNo entanto, regras com alto custo de violação, como as relacionadas ao tratamento de dados pessoais, à segurança e às obrigações legais, devem ser mantidas por meio de restrições explícitas e verificações programáticas.\n\n### 4. Especificar diretamente o tamanho da resposta e o formato de saída\n\nOs recursos usados no raciocínio e o tamanho da resposta exibida ao usuário não são o mesmo conceito. Mesmo que o cliente ofereça `effort` ou uma opção semelhante de intensidade de raciocínio, quando uma resposta curta for necessária, as condições de saída devem ser definidas separadamente.\n\nAlguns exemplos:\n\n- `Apresente primeiro a conclusão e organize os fundamentos em no máximo três itens.`\n- `Escreva a resposta final em no máximo 500 caracteres.`\n- `Retorne apenas um objeto JSON válido, sem explicações.`\n- `Informe apenas os arquivos alterados, os principais motivos e os riscos restantes.`\n\n### 5. Recalibrar a intensidade de raciocínio com tarefas reais\n\nNão aplique diretamente ao novo modelo a intensidade de raciocínio ou o valor padrão de effort usado no modelo anterior. Meça a curva de custos começando por uma configuração baixa e aumentando-a apenas quando a qualidade for insuficiente.\n\n| Tipo de tarefa | Direção da configuração inicial | Condição para aumentar |\n|---|---|---|\n| Classificação e conversão de formato | Começar em nível baixo | Quando erros de esquema ou omissões se repetirem |\n| Documentação geral e alterações de código | Comparar níveis intermediários | Quando dependências entre vários arquivos forem ignoradas |\n| Depuração complexa | Testar nível intermediário ou superior | Quando a taxa de sucesso da análise de causa e da validação for insuficiente |\n| Tarefas prolongadas de agentes | Medir por etapa | Em trechos de alta dificuldade que exijam replanejamento e recuperação |\n\nComo os nomes exatos das opções e o escopo de suporte podem variar conforme a versão da API e o produto, é necessário consultar a documentação oficial.\n\n### 6. Dividir o contexto por função e revelá-lo progressivamente\n\nSe todas as instruções forem colocadas em um único prompt de sistema ou arquivo `CLAUDE.md`, até mesmo informações irrelevantes poderão ser incluídas em todas as solicitações. A seguinte estrutura hierárquica é prática.\n\n1. **Instruções do sistema e do produto:** regras sempre necessárias, como função, limites de segurança e contrato de saída\n2. **Instruções leves do projeto:** comandos de compilação, estrutura de diretórios e métodos de trabalho comuns\n3. **Skills carregadas quando necessário:** procedimentos condicionais, como implantação, alterações no banco de dados e frameworks específicos\n4. **Referências técnicas:** esquemas de API, exemplos de código, documentos de design e especificações testáveis\n\nIsso pode ser chamado de **divulgação progressiva**. O modelo deve pesquisar ou carregar os materiais necessários para a etapa atual, mas é preciso registrar quais materiais foram utilizados para garantir a reprodutibilidade e a auditabilidade.\n\n## Procedimento de migração recomendado\n\n### Etapa 1: Fixar o estado atual\n\nSalve os prompts, as versões das ferramentas, a taxa de sucesso, o uso de tokens, a latência e os casos de falha do modelo existente. Sem uma linha de base, é difícil determinar se o novo modelo realmente apresentou melhorias.\n\n### Etapa 2: Validar as informações e permissões do modelo\n\nVerifique o ID oficial do modelo, o preço, o limite de contexto, o suporte a ferramentas e a política de retenção de dados. No ambiente de testes, restrinja as permissões de gravação, exclusão e implantação.\n\n### Etapa 3: Testar o harness existente sem alterações\n\nNo início, não altere tudo de uma só vez. Substituir apenas o modelo e compará-lo com a linha de base permite isolar o impacto da mudança de modelo.\n\n### Etapa 4: Remover instruções duplicadas uma por uma\n\nRemova um tipo de cada vez: instruções de validação, regras de estilo excessivamente detalhadas, exemplos desnecessários e referências sempre injetadas. A cada alteração, meça novamente a qualidade e o custo.\n\n### Etapa 5: Criar uma política de roteamento\n\nEscolha o modelo com base na dificuldade da tarefa, no risco, no contexto esperado e no limite de tempo. As funções de cada modelo sugeridas pelo material fornecido devem ser testadas como hipóteses após a confirmação dos nomes oficiais e do desempenho, e não devem ser adotadas diretamente como política operacional.\n\n### Etapa 6: Implantar primeiro para um tráfego limitado\n\nAplique inicialmente a alguns usuários ou a tarefas sem risco. Amplie o escopo após observar a taxa de falhas, as novas tentativas, a quantidade de subagentes, os erros de ferramentas e o tempo gasto em correções humanas.\n\n## Checklist operacional\n\n- [ ] Confirmei os nomes oficiais dos modelos e seus IDs na API.\n- [ ] Confirmei as tarifas realmente aplicáveis a entrada, saída, cache, lote e outros itens.\n- [ ] Há um conjunto próprio de avaliação composto por tarefas reais.\n- [ ] As etapas de validação do modelo e do harness não são duplicadas.\n- [ ] Há critérios para chamadas de subagentes, limite de execuções simultâneas e teto de orçamento.\n- [ ] O tamanho da resposta e o esquema de saída foram especificados.\n- [ ] Comparei qualidade, custo e latência em cada nível de intensidade de raciocínio.\n- [ ] Tarefas de alto risco ainda contam com verificações determinísticas e aprovação humana.\n- [ ] O contexto está separado entre instruções permanentes, Skills e referências.\n- [ ] O modelo e as configurações anteriores estão preparados para rollback.\n\n## Conclusão\n\nO ponto central da migração para um novo modelo não é tornar os prompts incondicionalmente mais curtos nem ampliar incondicionalmente a autonomia. O essencial é **primeiro confirmar as informações oficiais do produto e, por meio de avaliações com tarefas reais, redefinir as funções do modelo e do harness**.\n\nOs números e nomes relacionados ao Claude Opus 5 no material fornecido devem ser tratados como informações provisórias até que suas fontes oficiais sejam confirmadas. Ainda assim, a remoção de validações duplicadas, a limitação de subagentes, contratos de saída claros, a divulgação progressiva do contexto e o roteamento baseado em avaliações próprias são princípios de migração aplicáveis independentemente da geração do modelo.","content_html":"\u003cp\u003eO material fornecido apresenta Claude Opus 5 como um modelo voltado para tarefas cotidianas de agentes e ambientes empresariais e afirma que, na nova geração de Claude, é necessário reformular os prompts e harnesses existentes. No entanto, \u003cstrong\u003eas datas de lançamento, os preços e o desempenho de Claude Opus 5, Fable 5 e Sonnet 5, bem como as declarações de parceiros mencionadas no material, não puderam ser verificados de forma independente apenas com as informações fornecidas neste texto.\u003c/strong\u003e Em particular, é necessário primeiro confirmar na lista oficial de modelos se \u003ccode\u003eFable\u003c/code\u003e é um nome oficial de modelo da Anthropic.\u003c/p\u003e\n\u003cp\u003ePortanto, em vez de repetir essas informações de lançamento como fatos confirmados, este documento distingue e organiza os itens que precisam ser verificados na documentação oficial e os procedimentos de validação que podem ser aplicados a uma migração real de modelo.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#informa%C3%A7%C3%B5es-de-lan%C3%A7amento-que-devem-ser-verificadas-primeiro\" class=\"anchor\" id=\"informações-de-lançamento-que-devem-ser-verificadas-primeiro\"\u003e\u003c/a\u003eInformações de lançamento que devem ser verificadas primeiro\u003c/h2\u003e\n\u003cp\u003eAntes de aplicar um novo modelo à API, ao aplicativo Claude ou ao Claude Code, é necessário comparar os itens a seguir com a documentação oficial da Anthropic e com a tela de seleção de modelos do serviço utilizado.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eItem a verificar\u003c/th\u003e\n\u003cth\u003eAlegação do material fornecido\u003c/th\u003e\n\u003cth\u003eVerificação necessária\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item a verificar\"\u003eNome dos modelos\u003c/td\u003e\n\u003ctd data-label=\"Alegação do material fornecido\"\u003eClaude Opus 5, Fable 5, Sonnet 5\u003c/td\u003e\n\u003ctd data-label=\"Verificação necessária\"\u003eNomes exatos dos produtos e IDs dos modelos na lista oficial\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item a verificar\"\u003eDatas de lançamento\u003c/td\u003e\n\u003ctd data-label=\"Alegação do material fornecido\"\u003e9 de junho, 30 de junho e 24 de julho, respectivamente\u003c/td\u003e\n\u003ctd data-label=\"Verificação necessária\"\u003eAno e datas no anúncio oficial e no histórico de alterações\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item a verificar\"\u003ePreço do Opus 5\u003c/td\u003e\n\u003ctd data-label=\"Alegação do material fornecido\"\u003e5 dólares para entrada, 25 dólares para saída/1 milhão de tokens\u003c/td\u003e\n\u003ctd data-label=\"Verificação necessária\"\u003eTabela oficial de preços da API e cobranças separadas por lote, cache e contexto longo\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item a verificar\"\u003eModelo padrão no produto\u003c/td\u003e\n\u003ctd data-label=\"Alegação do material fornecido\"\u003eNovo modelo padrão do Claude Max\u003c/td\u003e\n\u003ctd data-label=\"Verificação necessária\"\u003eAplicabilidade por região, plano e cliente\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item a verificar\"\u003eFunção de cada modelo\u003c/td\u003e\n\u003ctd data-label=\"Alegação do material fornecido\"\u003eDivisão entre tarefas autônomas de longa duração, tarefas cotidianas e tarefas leves\u003c/td\u003e\n\u003ctd data-label=\"Verificação necessária\"\u003eDescrições oficiais dos modelos e resultados de avaliações em trabalhos reais\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item a verificar\"\u003eMelhoria de desempenho\u003c/td\u003e\n\u003ctd data-label=\"Alegação do material fornecido\"\u003eMelhoria em uma proporção específica em relação ao modelo anterior\u003c/td\u003e\n\u003ctd data-label=\"Verificação necessária\"\u003eTarefas de avaliação, tamanho da amostra, critérios de medição e texto original do parceiro\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eSe o nome ou o preço de um modelo não constar na documentação oficial, ele não deve ser usado nas configurações da API nem nos cálculos de orçamento. Caso sejam utilizados provedores de nuvem ou serviços de revenda, o ID do modelo, o preço e a data de disponibilização também podem ser diferentes dos oferecidos diretamente pela API da Anthropic.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#crit%C3%A9rios-de-decis%C3%A3o-que-devem-mudar-na-migra%C3%A7%C3%A3o-de-modelo\" class=\"anchor\" id=\"critérios-de-decisão-que-devem-mudar-na-migração-de-modelo\"\u003e\u003c/a\u003eCritérios de decisão que devem mudar na migração de modelo\u003c/h2\u003e\n\u003ch3\u003e\n\u003ca href=\"#1-medir-a-efici%C3%AAncia-por-tarefa-n%C3%A3o-apenas-o-desempenho-m%C3%A1ximo\" class=\"anchor\" id=\"1-medir-a-eficiência-por-tarefa-não-apenas-o-desempenho-máximo\"\u003e\u003c/a\u003e1. Medir a eficiência por tarefa, não apenas o desempenho máximo\u003c/h3\u003e\n\u003cp\u003eProcessar todas as solicitações com o modelo mais caro pode aumentar rapidamente os custos quando um agente chama repetidamente diversas ferramentas e subagentes. O modelo deve ser escolhido não pelo nome ou pela categoria, mas pela análise conjunta dos seguintes indicadores.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e\n\u003cstrong\u003eTaxa de sucesso:\u003c/strong\u003e proporção de resultados que atendem aos requisitos sem correções humanas\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eCusto total:\u003c/strong\u003e custo que inclui não apenas a solicitação inicial, mas também novas tentativas, chamadas de ferramentas e chamadas de subagentes\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eTempo de conclusão:\u003c/strong\u003e tempo que inclui a espera e o período de revisão e correção humana\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eCusto da falha:\u003c/strong\u003e impacto causado pela falha, como vulnerabilidades de segurança, implantações incorretas ou análises incompletas\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eConsistência:\u003c/strong\u003e grau de variação dos resultados ao repetir o mesmo tipo de tarefa\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eO custo por tarefa não deve ser avaliado apenas pelo preço unitário dos tokens. Conceitualmente, ele pode ser calculado da seguinte forma.\u003c/p\u003e\n\u003cp\u003e\u003ccode\u003eCusto total por tarefa = custo do modelo principal + custo dos subagentes + custo das ferramentas + custo das novas tentativas + custo da revisão humana\u003c/code\u003e\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#2-separar-benchmarks-p%C3%BAblicos-de-avalia%C3%A7%C3%B5es-pr%C3%B3prias\" class=\"anchor\" id=\"2-separar-benchmarks-públicos-de-avaliações-próprias\"\u003e\u003c/a\u003e2. Separar benchmarks públicos de avaliações próprias\u003c/h3\u003e\n\u003cp\u003eBenchmarks públicos são um ponto de partida para comparar as características gerais dos modelos, mas não garantem o sucesso em uma base de código, formato de documento ou regra de negócio específicos. A organização deve criar seu próprio conjunto de avaliação com tarefas reais anonimizadas.\u003c/p\u003e\n\u003cp\u003eUm bom conjunto de avaliação inclui os seguintes casos.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eTarefas representativas que devem ser concluídas normalmente\u003c/li\u003e\n\u003cli\u003eCasos-limite em que o modelo costuma errar\u003c/li\u003e\n\u003cli\u003eTarefas com requisitos ambíguos que exigem perguntas adicionais\u003c/li\u003e\n\u003cli\u003eTarefas que exigem chamadas de ferramentas ou verificação de materiais externos\u003c/li\u003e\n\u003cli\u003eTarefas de alto risco que devem ser interrompidas ou submetidas à aprovação humana\u003c/li\u003e\n\u003cli\u003eTarefas que exigem salvar e restaurar o estado durante execuções prolongadas\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003ePara possibilitar a comparação, devem ser aplicados a cada modelo as mesmas entradas, ferramentas, limites de tempo e critérios de sucesso. É mais seguro registrar a taxa de sucesso e a distribuição de custos de várias execuções repetidas do que se basear em um ou dois resultados impressionantes.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#3-avaliar-o-modelo-e-o-harness-como-um-%C3%BAnico-sistema\" class=\"anchor\" id=\"3-avaliar-o-modelo-e-o-harness-como-um-único-sistema\"\u003e\u003c/a\u003e3. Avaliar o modelo e o harness como um único sistema\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003eHarness\u003c/strong\u003e é o ambiente de execução que envolve o modelo. Ele inclui o prompt de sistema, as instruções do projeto, a busca, a memória, as ferramentas, as Skills, os subagentes, o gerenciamento de permissões e a lógica de validação e novas tentativas.\u003c/p\u003e\n\u003cp\u003eMesmo o mesmo modelo pode gerar resultados diferentes dependendo do harness. Por exemplo, se o próprio modelo escreve e executa testes e o harness também impõe a mesma validação, o trabalho pode ser duplicado. Por outro lado, é arriscado deixar sob o julgamento autônomo do modelo até mesmo etapas que exigem controles determinísticos, como aprovação de implantação ou verificação de segurança.\u003c/p\u003e\n\u003cp\u003eO princípio central é \u003cstrong\u003edistinguir o raciocínio que o modelo executa bem dos controles que o sistema deve obrigatoriamente garantir\u003c/strong\u003e.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#6-pontos-a-verificar-nos-prompts-e-no-harness\" class=\"anchor\" id=\"6-pontos-a-verificar-nos-prompts-e-no-harness\"\u003e\u003c/a\u003e6 pontos a verificar nos prompts e no harness\u003c/h2\u003e\n\u003ch3\u003e\n\u003ca href=\"#1-remover-experimentalmente-instru%C3%A7%C3%B5es-duplicadas-de-valida%C3%A7%C3%A3o-e-nova-verifica%C3%A7%C3%A3o\" class=\"anchor\" id=\"1-remover-experimentalmente-instruções-duplicadas-de-validação-e-nova-verificação\"\u003e\u003c/a\u003e1. Remover experimentalmente instruções duplicadas de validação e nova verificação\u003c/h3\u003e\n\u003cp\u003eExcluir incondicionalmente frases como \u003ccode\u003eapós concluir, verifique tudo novamente\u003c/code\u003e não é necessariamente a resposta correta. Primeiro, acompanhe se as validações executadas espontaneamente pelo novo modelo se sobrepõem às etapas de validação do harness.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eSe a revisão do próprio modelo apenas se repetir sem melhorar a qualidade, reduza o prompt.\u003c/li\u003e\n\u003cli\u003eMantenha no harness verificações que possam ser automatizadas, como testes, validação de esquema e análise estática.\u003c/li\u003e\n\u003cli\u003eNão substitua pela autovalidação do modelo a aprovação de tarefas de alto risco, como pagamentos, implantações e exclusão de dados.\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch3\u003e\n\u003ca href=\"#2-definir-condi%C3%A7%C3%B5es-e-limites-para-chamadas-de-subagentes\" class=\"anchor\" id=\"2-definir-condições-e-limites-para-chamadas-de-subagentes\"\u003e\u003c/a\u003e2. Definir condições e limites para chamadas de subagentes\u003c/h3\u003e\n\u003cp\u003eSubagentes são úteis para pesquisas paralelas ou para separar áreas especializadas, mas delegar até mesmo tarefas pequenas aumenta os custos e a latência. É possível especificar políticas como estas.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eUsar subagentes apenas em tarefas que possam ser divididas de forma independente.\u003c/li\u003e\n\u003cli\u003eLimitar a quantidade que pode ser executada simultaneamente em uma solicitação.\u003c/li\u003e\n\u003cli\u003eFornecer a cada subagente um resultado esperado e uma condição de encerramento claros.\u003c/li\u003e\n\u003cli\u003eImpedir que vários agentes pesquisem o mesmo material de forma duplicada.\u003c/li\u003e\n\u003cli\u003eObter aprovação humana se o custo ou o tempo estimado ultrapassar o limite.\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch3\u003e\n\u003ca href=\"#3-converter-regras-de-proibi%C3%A7%C3%A3o-detalhadas-em-crit%C3%A9rios-de-decis%C3%A3o\" class=\"anchor\" id=\"3-converter-regras-de-proibição-detalhadas-em-critérios-de-decisão\"\u003e\u003c/a\u003e3. Converter regras de proibição detalhadas em critérios de decisão\u003c/h3\u003e\n\u003cp\u003eListas longas de proibições podem entrar em conflito entre si ou não contemplar situações novas. Em áreas de baixo risco, como estilo, pode-se permitir que o modelo leia o contexto ao redor e faça seu próprio julgamento.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003ePrescritivo: \u003ccode\u003eNunca escreva docstrings com vários parágrafos.\u003c/code\u003e\n\u003c/li\u003e\n\u003cli\u003eDelegação de julgamento: \u003ccode\u003eSiga a densidade de comentários, o formato das docstrings, a nomenclatura e os padrões idiomáticos do código existente.\u003c/code\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eNo entanto, regras com alto custo de violação, como as relacionadas ao tratamento de dados pessoais, à segurança e às obrigações legais, devem ser mantidas por meio de restrições explícitas e verificações programáticas.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#4-especificar-diretamente-o-tamanho-da-resposta-e-o-formato-de-sa%C3%ADda\" class=\"anchor\" id=\"4-especificar-diretamente-o-tamanho-da-resposta-e-o-formato-de-saída\"\u003e\u003c/a\u003e4. Especificar diretamente o tamanho da resposta e o formato de saída\u003c/h3\u003e\n\u003cp\u003eOs recursos usados no raciocínio e o tamanho da resposta exibida ao usuário não são o mesmo conceito. Mesmo que o cliente ofereça \u003ccode\u003eeffort\u003c/code\u003e ou uma opção semelhante de intensidade de raciocínio, quando uma resposta curta for necessária, as condições de saída devem ser definidas separadamente.\u003c/p\u003e\n\u003cp\u003eAlguns exemplos:\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e\u003ccode\u003eApresente primeiro a conclusão e organize os fundamentos em no máximo três itens.\u003c/code\u003e\u003c/li\u003e\n\u003cli\u003e\u003ccode\u003eEscreva a resposta final em no máximo 500 caracteres.\u003c/code\u003e\u003c/li\u003e\n\u003cli\u003e\u003ccode\u003eRetorne apenas um objeto JSON válido, sem explicações.\u003c/code\u003e\u003c/li\u003e\n\u003cli\u003e\u003ccode\u003eInforme apenas os arquivos alterados, os principais motivos e os riscos restantes.\u003c/code\u003e\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch3\u003e\n\u003ca href=\"#5-recalibrar-a-intensidade-de-racioc%C3%ADnio-com-tarefas-reais\" class=\"anchor\" id=\"5-recalibrar-a-intensidade-de-raciocínio-com-tarefas-reais\"\u003e\u003c/a\u003e5. Recalibrar a intensidade de raciocínio com tarefas reais\u003c/h3\u003e\n\u003cp\u003eNão aplique diretamente ao novo modelo a intensidade de raciocínio ou o valor padrão de effort usado no modelo anterior. Meça a curva de custos começando por uma configuração baixa e aumentando-a apenas quando a qualidade for insuficiente.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eTipo de tarefa\u003c/th\u003e\n\u003cth\u003eDireção da configuração inicial\u003c/th\u003e\n\u003cth\u003eCondição para aumentar\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Tipo de tarefa\"\u003eClassificação e conversão de formato\u003c/td\u003e\n\u003ctd data-label=\"Direção da configuração inicial\"\u003eComeçar em nível baixo\u003c/td\u003e\n\u003ctd data-label=\"Condição para aumentar\"\u003eQuando erros de esquema ou omissões se repetirem\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Tipo de tarefa\"\u003eDocumentação geral e alterações de código\u003c/td\u003e\n\u003ctd data-label=\"Direção da configuração inicial\"\u003eComparar níveis intermediários\u003c/td\u003e\n\u003ctd data-label=\"Condição para aumentar\"\u003eQuando dependências entre vários arquivos forem ignoradas\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Tipo de tarefa\"\u003eDepuração complexa\u003c/td\u003e\n\u003ctd data-label=\"Direção da configuração inicial\"\u003eTestar nível intermediário ou superior\u003c/td\u003e\n\u003ctd data-label=\"Condição para aumentar\"\u003eQuando a taxa de sucesso da análise de causa e da validação for insuficiente\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Tipo de tarefa\"\u003eTarefas prolongadas de agentes\u003c/td\u003e\n\u003ctd data-label=\"Direção da configuração inicial\"\u003eMedir por etapa\u003c/td\u003e\n\u003ctd data-label=\"Condição para aumentar\"\u003eEm trechos de alta dificuldade que exijam replanejamento e recuperação\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eComo os nomes exatos das opções e o escopo de suporte podem variar conforme a versão da API e o produto, é necessário consultar a documentação oficial.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#6-dividir-o-contexto-por-fun%C3%A7%C3%A3o-e-revel%C3%A1-lo-progressivamente\" class=\"anchor\" id=\"6-dividir-o-contexto-por-função-e-revelá-lo-progressivamente\"\u003e\u003c/a\u003e6. Dividir o contexto por função e revelá-lo progressivamente\u003c/h3\u003e\n\u003cp\u003eSe todas as instruções forem colocadas em um único prompt de sistema ou arquivo \u003ccode\u003eCLAUDE.md\u003c/code\u003e, até mesmo informações irrelevantes poderão ser incluídas em todas as solicitações. A seguinte estrutura hierárquica é prática.\u003c/p\u003e\n\u003col\u003e\n\u003cli\u003e\n\u003cstrong\u003eInstruções do sistema e do produto:\u003c/strong\u003e regras sempre necessárias, como função, limites de segurança e contrato de saída\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eInstruções leves do projeto:\u003c/strong\u003e comandos de compilação, estrutura de diretórios e métodos de trabalho comuns\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eSkills carregadas quando necessário:\u003c/strong\u003e procedimentos condicionais, como implantação, alterações no banco de dados e frameworks específicos\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eReferências técnicas:\u003c/strong\u003e esquemas de API, exemplos de código, documentos de design e especificações testáveis\u003c/li\u003e\n\u003c/ol\u003e\n\u003cp\u003eIsso pode ser chamado de \u003cstrong\u003edivulgação progressiva\u003c/strong\u003e. O modelo deve pesquisar ou carregar os materiais necessários para a etapa atual, mas é preciso registrar quais materiais foram utilizados para garantir a reprodutibilidade e a auditabilidade.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#procedimento-de-migra%C3%A7%C3%A3o-recomendado\" class=\"anchor\" id=\"procedimento-de-migração-recomendado\"\u003e\u003c/a\u003eProcedimento de migração recomendado\u003c/h2\u003e\n\u003ch3\u003e\n\u003ca href=\"#etapa-1-fixar-o-estado-atual\" class=\"anchor\" id=\"etapa-1-fixar-o-estado-atual\"\u003e\u003c/a\u003eEtapa 1: Fixar o estado atual\u003c/h3\u003e\n\u003cp\u003eSalve os prompts, as versões das ferramentas, a taxa de sucesso, o uso de tokens, a latência e os casos de falha do modelo existente. Sem uma linha de base, é difícil determinar se o novo modelo realmente apresentou melhorias.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#etapa-2-validar-as-informa%C3%A7%C3%B5es-e-permiss%C3%B5es-do-modelo\" class=\"anchor\" id=\"etapa-2-validar-as-informações-e-permissões-do-modelo\"\u003e\u003c/a\u003eEtapa 2: Validar as informações e permissões do modelo\u003c/h3\u003e\n\u003cp\u003eVerifique o ID oficial do modelo, o preço, o limite de contexto, o suporte a ferramentas e a política de retenção de dados. No ambiente de testes, restrinja as permissões de gravação, exclusão e implantação.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#etapa-3-testar-o-harness-existente-sem-altera%C3%A7%C3%B5es\" class=\"anchor\" id=\"etapa-3-testar-o-harness-existente-sem-alterações\"\u003e\u003c/a\u003eEtapa 3: Testar o harness existente sem alterações\u003c/h3\u003e\n\u003cp\u003eNo início, não altere tudo de uma só vez. Substituir apenas o modelo e compará-lo com a linha de base permite isolar o impacto da mudança de modelo.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#etapa-4-remover-instru%C3%A7%C3%B5es-duplicadas-uma-por-uma\" class=\"anchor\" id=\"etapa-4-remover-instruções-duplicadas-uma-por-uma\"\u003e\u003c/a\u003eEtapa 4: Remover instruções duplicadas uma por uma\u003c/h3\u003e\n\u003cp\u003eRemova um tipo de cada vez: instruções de validação, regras de estilo excessivamente detalhadas, exemplos desnecessários e referências sempre injetadas. A cada alteração, meça novamente a qualidade e o custo.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#etapa-5-criar-uma-pol%C3%ADtica-de-roteamento\" class=\"anchor\" id=\"etapa-5-criar-uma-política-de-roteamento\"\u003e\u003c/a\u003eEtapa 5: Criar uma política de roteamento\u003c/h3\u003e\n\u003cp\u003eEscolha o modelo com base na dificuldade da tarefa, no risco, no contexto esperado e no limite de tempo. As funções de cada modelo sugeridas pelo material fornecido devem ser testadas como hipóteses após a confirmação dos nomes oficiais e do desempenho, e não devem ser adotadas diretamente como política operacional.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#etapa-6-implantar-primeiro-para-um-tr%C3%A1fego-limitado\" class=\"anchor\" id=\"etapa-6-implantar-primeiro-para-um-tráfego-limitado\"\u003e\u003c/a\u003eEtapa 6: Implantar primeiro para um tráfego limitado\u003c/h3\u003e\n\u003cp\u003eAplique inicialmente a alguns usuários ou a tarefas sem risco. Amplie o escopo após observar a taxa de falhas, as novas tentativas, a quantidade de subagentes, os erros de ferramentas e o tempo gasto em correções humanas.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#checklist-operacional\" class=\"anchor\" id=\"checklist-operacional\"\u003e\u003c/a\u003eChecklist operacional\u003c/h2\u003e\n\u003cul\u003e\n\u003cli\u003e Confirmei os nomes oficiais dos modelos e seus IDs na API.\u003c/li\u003e\n\u003cli\u003e Confirmei as tarifas realmente aplicáveis a entrada, saída, cache, lote e outros itens.\u003c/li\u003e\n\u003cli\u003e Há um conjunto próprio de avaliação composto por tarefas reais.\u003c/li\u003e\n\u003cli\u003e As etapas de validação do modelo e do harness não são duplicadas.\u003c/li\u003e\n\u003cli\u003e Há critérios para chamadas de subagentes, limite de execuções simultâneas e teto de orçamento.\u003c/li\u003e\n\u003cli\u003e O tamanho da resposta e o esquema de saída foram especificados.\u003c/li\u003e\n\u003cli\u003e Comparei qualidade, custo e latência em cada nível de intensidade de raciocínio.\u003c/li\u003e\n\u003cli\u003e Tarefas de alto risco ainda contam com verificações determinísticas e aprovação humana.\u003c/li\u003e\n\u003cli\u003e O contexto está separado entre instruções permanentes, Skills e referências.\u003c/li\u003e\n\u003cli\u003e O modelo e as configurações anteriores estão preparados para rollback.\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch2\u003e\n\u003ca href=\"#conclus%C3%A3o\" class=\"anchor\" id=\"conclusão\"\u003e\u003c/a\u003eConclusão\u003c/h2\u003e\n\u003cp\u003eO ponto central da migração para um novo modelo não é tornar os prompts incondicionalmente mais curtos nem ampliar incondicionalmente a autonomia. O essencial é \u003cstrong\u003eprimeiro confirmar as informações oficiais do produto e, por meio de avaliações com tarefas reais, redefinir as funções do modelo e do harness\u003c/strong\u003e.\u003c/p\u003e\n\u003cp\u003eOs números e nomes relacionados ao Claude Opus 5 no material fornecido devem ser tratados como informações provisórias até que suas fontes oficiais sejam confirmadas. Ainda assim, a remoção de validações duplicadas, a limitação de subagentes, contratos de saída claros, a divulgação progressiva do contexto e o roteamento baseado em avaliações próprias são princípios de migração aplicáveis independentemente da geração do modelo.\u003c/p\u003e\n","tags":["Engenharia de prompts","Agentes de IA","Anthropic","Claude","Avaliação de modelos"],"faqs":[{"question":"O Claude Opus 5 é um modelo lançado oficialmente?","answer":"Os materiais fornecidos apresentam a data de lançamento e o preço, mas essas informações não foram verificadas de forma independente apenas com base no conteúdo deste texto. Até que o nome exato do modelo e o ID do modelo sejam confirmados na lista oficial de modelos da Anthropic, no anúncio e no console da API, é mais seguro não tratá-las como informações definitivas sobre o produto."},{"question":"Fable 5 é um nome de modelo oficial da Anthropic?","answer":"Não é possível confirmar apenas com os materiais fornecidos. Como a Anthropic pode usar IDs de modelo da API ou nomenclaturas diferentes conforme o serviço, mesmo quando os nomes dos produtos são semelhantes, é necessário verificar na lista oficial de modelos se a denominação `Fable 5` realmente existe."},{"question":"Ao mudar para um novo modelo Claude, é preciso excluir todos os prompts existentes?","answer":"Não. Primeiro, deve-se realizar uma avaliação de referência com as configurações existentes e, depois, remover uma a uma as instruções de verificação duplicadas ou as regras de estilo desnecessárias, comparando a qualidade e o custo. Os controles que o sistema deve garantir, como verificações de segurança, validação do esquema de saída e aprovação da implantação, devem ser mantidos."},{"question":"O que é um harness?","answer":"Um harness é o sistema que envolve o modelo de AI para executá-lo no trabalho real. Ele inclui prompt de sistema, instruções do projeto, ferramentas, busca, memória, Skill, subagent, novas tentativas, gerenciamento de permissões e procedimentos de validação automática."},{"question":"Como o uso de subagent deve ser limitado?","answer":"Deve ser usado apenas em tarefas que possam ser divididas de forma independente, estabelecendo-se limites máximos para o número de execuções simultâneas e o total de chamadas. É possível especificar os resultados e as condições de encerramento de cada subagent e projetar o sistema para exigir aprovação humana caso o custo ou o tempo estimado ultrapasse um valor-limite."},{"question":"Por que a avaliação própria é mais importante do que benchmarks públicos?","answer":"Benchmarks públicos não refletem exatamente a base de código, o formato dos documentos, o ambiente de ferramentas nem o custo das falhas de uma organização. É preciso medir a taxa de sucesso, o custo total, o tempo de conclusão e a consistência dos resultados em casos reais de trabalho para determinar qual modelo é adequado ao ambiente operacional."},{"question":"Se o modelo tiver verificação própria, os testes podem ser eliminados?","answer":"Não. A revisão feita pelo próprio modelo é um recurso auxiliar e não substitui testes, verificações de esquema, análise estática nem políticas de segurança. Especialmente em tarefas de alto risco, como implantação, pagamentos e exclusão de dados, são necessárias verificações determinísticas e aprovação humana."},{"question":"Reduzir o effort também torna a resposta automaticamente mais curta?","answer":"Não necessariamente. A intensidade do raciocínio e o tamanho da saída final podem ser objetos de controle distintos. Se for necessária uma resposta concisa, deve-se especificar diretamente no prompt o formato da resposta, como o número de caracteres, a quantidade de itens e o esquema de saída."}],"sources":[{"url":"https://docs.anthropic.com/en/docs/about-claude/models/overview","title":"Documentação da Anthropic: visão geral dos modelos","type":"source"},{"url":"https://www.anthropic.com/pricing","title":"Preços da Anthropic","type":"data_point"},{"url":"https://docs.anthropic.com/en/docs/build-with-claude/prompt-engineering/overview","title":"Documentação da Anthropic: visão geral da engenharia de prompts","type":"source"},{"url":"https://docs.anthropic.com/en/docs/claude-code/memory","title":"Documentação da Anthropic: memória do Claude Code","type":"source"}],"images":[{"id":324,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6MzY5MCwicHVyIjoiYmxvYl9pZCJ9fQ==--f44d725b558668593419631e29f28834deb66ecc/ai-95ae89bc.webp","is_representative":true,"generation_method":"ai_image","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"체크 항목과 경고 장벽 사이에서 AI 큐브를 돋보기로 점검하는 일러스트","caption":"모델 전환 전 프롬프트와 하네스의 성능, 보안, 비용을 점검하는 과정을 나타낸다.","description":null},"en":{"alt":"Illustration of AI cubes being inspected beside a warning barrier and checklist icons","caption":"The scene represents checking prompts, harnesses, performance, security, and cost before a model switch.","description":null},"ja":{"alt":"警告バリケードと確認項目のそばでAIキューブを虫眼鏡で点検するイラスト","caption":"モデル移行前にプロンプトやハーネスの性能、安全性、コストを確認する工程を表している。","description":null},"es":{"alt":"Ilustración de cubos de IA inspeccionados junto a una barrera de alerta e iconos de control","caption":"La escena representa la revisión de prompts, arneses, rendimiento, seguridad y costes antes de cambiar de modelo.","description":null},"id":{"alt":"Ilustrasi kubus AI yang diperiksa di dekat penghalang peringatan dan ikon daftar cek","caption":"Adegan ini menggambarkan pemeriksaan prompt, harness, kinerja, keamanan, dan biaya sebelum beralih model.","description":null},"pt":{"alt":"Ilustração de cubos de IA inspecionados junto a uma barreira de alerta e ícones de verificação","caption":"A cena representa a revisão de prompts, harnesses, desempenho, segurança e custos antes da troca de modelo.","description":null},"zh-hant":{"alt":"在警示柵欄與檢查圖示旁以放大鏡檢視 AI 方塊的插圖","caption":"此圖呈現模型切換前檢查提示詞、工具框架、效能、安全性與成本的流程。","description":null}}},{"id":325,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6MzY5NiwicHVyIjoiYmxvYl9pZCJ9fQ==--5ddddd2dfbbbcedb1849fbdfe606aca94f9a98af/ai-b298a672.webp","is_representative":false,"generation_method":"ai_image","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"중앙 AI 모델에 보안, 문서, 사용자, 도구와 에이전트 차단 장치가 연결된 점검 구성도","caption":"모델 전환 전 프롬프트와 에이전트 하네스의 연결, 안전장치, 평가 항목을 점검하는 흐름을 나타낸다.","description":null},"en":{"alt":"AI model linked to security, documents, users, tools, agent controls, and evaluation indicators","caption":"The diagram contextualizes checks for prompts, agent harnesses, safeguards, and evaluations before a model switch.","description":null},"ja":{"alt":"中央のAIモデルにセキュリティ、文書、ユーザー、ツール、エージェント制御が接続された構成図","caption":"モデル移行前にプロンプトやエージェントハーネス、安全策、評価項目を確認する流れを示している。","description":null},"es":{"alt":"Modelo de IA conectado con seguridad, documentos, usuarios, herramientas, controles de agentes e indicadores","caption":"El diagrama representa la revisión de prompts, arneses de agentes, salvaguardas y evaluaciones antes de cambiar de modelo.","description":null},"id":{"alt":"Model AI terhubung ke keamanan, dokumen, pengguna, alat, kontrol agen, dan indikator evaluasi","caption":"Diagram ini menggambarkan pemeriksaan prompt, harness agen, pengaman, dan evaluasi sebelum pergantian model.","description":null},"pt":{"alt":"Modelo de IA ligado a segurança, documentos, usuários, ferramentas, controles de agentes e indicadores","caption":"O diagrama representa a verificação de prompts, harnesses de agentes, proteções e avaliações antes da troca de modelo.","description":null},"zh-hant":{"alt":"中央 AI 模型連接安全、文件、使用者、工具、代理控制與評估指標的架構圖","caption":"此圖呈現模型切換前對提示詞、代理框架、安全機制與評估項目的檢查流程。","description":null}}}],"published_at":"2026-07-28T11:42:11+09:00","updated_at":"2026-07-28T11:42:11+09:00","license":"cc_by","translation_status":"reviewed","available_locales":["ko","en","ja","es"],"data_locales":["ko","en","ja","es","id","pt","zh-hant"],"url":"https://injoys.com/en/articles/claude-opus-5-verification-and-migration-guide"}