{"content_id":"ardq66qm2e","slug":"claude-opus-5-verification-and-migration-guide","locale":"de","schema_type":"TechArticle","category":"how_to","category_name":"Anleitungen","title":"Prüfung von Prompts und Harness vor dem Wechsel zu Claude Opus 5","summary":"Hier wird erläutert, wie sich die in den bereitgestellten Unterlagen behaupteten Eigenschaften von Claude Opus 5 von überprüfbaren Informationen unterscheiden lassen und wie Prompts, Harness und Evaluationssysteme bei der Einführung einer neuen Modellgeneration neu gestaltet werden sollten. Verfügbarkeit, Preise und Modellbezeichnungen müssen stets anhand der offiziellen Modellliste und Preistabelle von Anthropic geprüft werden.","sponsorship_disclosure":null,"author":{"name":"injoys","url":"https://injoys.com/ko/about"},"key_points":["Die in den bereitgestellten Unterlagen genannten Veröffentlichungstermine, Preise und Leistungswerte von Claude Opus 5, Fable 5 und Sonnet 5 sollten vor der Nutzung unabhängig anhand offizieller Quellen geprüft werden.","Bei einem neuen Modell sollten bestehende Prompts nicht einfach kopiert werden; Qualität, Kosten und Latenz müssen mit realen Arbeitsdaten neu gemessen werden.","Redundante Prüfanweisungen und unbegrenzte Aufrufe von subagents können Kosten und Ausführungszeit erhöhen, ohne die Ergebnisse zu verbessern.","Wenn Systemanweisungen, Projektregeln, bei Bedarf geladene Skills und technische Referenzen getrennt werden, lässt sich der Kontext leichter verwalten.","Eigene Evaluationen, die die tatsächlichen Aufgaben und Fehlerkosten der Organisation berücksichtigen, bieten eine direktere Grundlage für die Modellauswahl als Benchmark-Ranglisten."],"content_markdown":"Die bereitgestellten Unterlagen stellen Claude Opus 5 als ein auf alltägliche Enterprise- und Agentenaufgaben zugeschnittenes Modell vor und vertreten die Auffassung, dass bestehende Prompts und Harnesses für die neue Claude-Generation neu gestaltet werden müssen. Allerdings konnten die in den Unterlagen genannten **Veröffentlichungstermine, Preise und Leistungsdaten von Claude Opus 5, Fable 5 und Sonnet 5 sowie die Aussagen von Partnern anhand der in diesem Artikel bereitgestellten Informationen nicht unabhängig verifiziert werden.** Insbesondere sollte zunächst in der offiziellen Modellliste geprüft werden, ob `Fable` tatsächlich eine offizielle Modellbezeichnung von Anthropic ist.\n\nDaher wiederholt dieses Dokument diese Veröffentlichungsinformationen nicht als bestätigte Tatsachen, sondern unterscheidet zwischen Punkten, die anhand offizieller Dokumente überprüft werden müssen, und Prüfverfahren, die sich auf einen tatsächlichen Modellwechsel anwenden lassen.\n\n## Zunächst zu prüfende Veröffentlichungsinformationen\n\nBevor ein neues Modell in die API, die Claude-App oder Claude Code integriert wird, sollten die folgenden Punkte mit der offiziellen Dokumentation von Anthropic und der Modellauswahl des verwendeten Dienstes abgeglichen werden.\n\n| Prüfpunkt | Behauptung der bereitgestellten Unterlagen | Erforderliche Prüfung |\n|---|---|---|\n| Modellbezeichnungen | Claude Opus 5, Fable 5, Sonnet 5 | Genaue Produktnamen und Modell-IDs in der offiziellen Modellliste |\n| Veröffentlichungstermine | Jeweils 9. Juni, 30. Juni und 24. Juli | Jahr und Datum in der offiziellen Ankündigung und im Änderungsverlauf |\n| Preis von Opus 5 | 5 Dollar für Eingaben, 25 Dollar für Ausgaben/1 Million Token | Offizielle API-Preisliste sowie separate Gebühren für Batch-Verarbeitung, Caching und lange Kontexte |\n| Standardmodell im Produkt | Neues Standardmodell von Claude Max | Verfügbarkeit nach Region, Tarif und Client |\n| Rollen der Modelle | Unterteilung in langfristige autonome Aufgaben, alltägliche Aufgaben und ressourcenschonende Aufgaben | Offizielle Modellbeschreibungen und Ergebnisse aus der Bewertung realer Arbeitsaufgaben |\n| Leistungsverbesserungen | Verbesserungen um bestimmte Prozentsätze gegenüber früheren Modellen | Bewertungsaufgaben, Stichprobengröße, Messkriterien und Originalaussagen der Partner |\n\nWenn Modellbezeichnungen oder Preise nicht in der offiziellen Dokumentation zu finden sind, dürfen sie nicht für API-Konfigurationen oder Budgetberechnungen verwendet werden. Bei der Nutzung eines Cloud-Anbieters oder Wiederverkäufers können sich Modell-ID, Preis und Bereitstellungszeitpunkt zudem von der direkten API von Anthropic unterscheiden.\n\n## Entscheidungskriterien, die sich beim Modellwechsel ändern müssen\n\n### 1. Effizienz pro Aufgabe statt Spitzenleistung messen\n\nWenn jede Anfrage mit dem teuersten Modell bearbeitet wird, können die Kosten schnell steigen, sobald ein Agent wiederholt mehrere Tools und subagent aufruft. Ein Modell sollte nicht anhand seines Namens oder seiner Kategorie ausgewählt werden, sondern anhand der folgenden Kennzahlen in ihrer Gesamtheit.\n\n- **Erfolgsquote:** Anteil der Fälle, in denen die Anforderungen ohne menschliche Korrekturen erfüllt wurden\n- **Gesamtkosten:** Kosten einschließlich erneuter Versuche sowie Tool- und subagent-Aufrufe, nicht nur der ersten Anfrage\n- **Bearbeitungszeit:** Zeit einschließlich Wartezeiten sowie menschlicher Prüf- und Korrekturzeit\n- **Fehlerkosten:** Auswirkungen eines Fehlers, etwa Sicherheitslücken, fehlerhafte Bereitstellungen oder unvollständige Analysen\n- **Konsistenz:** Ausmaß, in dem die Ergebnisse bei wiederholter Bearbeitung derselben Aufgabenart schwanken\n\nDie Kosten pro Aufgabe dürfen nicht allein anhand des Tokenpreises beurteilt werden. Konzeptionell lassen sie sich wie folgt berechnen.\n\n`Gesamtkosten pro Aufgabe = Kosten des Hauptmodells + subagent-Kosten + Toolkosten + Kosten erneuter Versuche + menschliche Prüfkosten`\n\n### 2. Öffentliche Benchmarks und eigene Bewertungen trennen\n\nÖffentliche Benchmarks sind ein Ausgangspunkt für den Vergleich allgemeiner Modelleigenschaften, garantieren aber keinen Erfolg bei einer bestimmten Codebasis, Dokumentvorlage oder Geschäftsregel. Organisationen sollten aus anonymisierten realen Aufgaben eigene Bewertungssets erstellen.\n\nEin gutes Bewertungsset umfasst gemeinsam die folgenden Fälle.\n\n- Repräsentative Aufgaben, die regulär abgeschlossen werden müssen\n- Grenzfälle, bei denen das Modell häufig Fehler macht\n- Aufgaben mit unklaren Anforderungen, bei denen Rückfragen erforderlich sind\n- Aufgaben, die Toolaufrufe oder die Prüfung externer Quellen erfordern\n- Hochriskante Aufgaben, bei denen die Ausführung abgebrochen oder eine menschliche Genehmigung eingeholt werden muss\n- Aufgaben, bei denen während einer langen Ausführung der Zustand gespeichert und wiederhergestellt werden muss\n\nEin Vergleich ist nur möglich, wenn auf jedes Modell dieselben Eingaben, Tools, Zeitlimits und Erfolgskriterien angewandt werden. Statt ein oder zwei beeindruckender Ergebnisse ist es sicherer, die Erfolgsquote und Kostenverteilung über mehrere Wiederholungen hinweg zu erfassen.\n\n### 3. Modell und Harness als ein System bewerten\n\nEin **Harness** bezeichnet die Ausführungsumgebung rund um das Modell. Dazu gehören System-Prompts, Projektanweisungen, Suche, Speicher, Tools, Skill, subagent, Berechtigungsverwaltung sowie Prüf- und Wiederholungslogik.\n\nAuch dasselbe Modell kann je nach Harness unterschiedliche Ergebnisse liefern. Wenn das Modell beispielsweise selbst Tests erstellt und ausführt und der Harness dieselbe Prüfung ebenfalls erzwingt, kann dieselbe Arbeit doppelt ausgeführt werden. Umgekehrt ist es riskant, auch Schritte, die deterministische Kontrollen erfordern, etwa Bereitstellungsfreigaben oder Sicherheitsprüfungen, dem autonomen Urteil des Modells zu überlassen.\n\nDas zentrale Prinzip besteht darin, **zwischen Schlussfolgerungen, die das Modell gut beherrscht, und Kontrollen, die das System zwingend gewährleisten muss, zu unterscheiden**.\n\n## 6 Punkte zur Prüfung von Prompts und Harnesses\n\n### 1. Doppelte Prüf- und Kontrollanweisungen versuchsweise entfernen\n\nEs ist nicht grundsätzlich richtig, Sätze wie `Nach Abschluss unbedingt erneut prüfen` ausnahmslos zu löschen. Zunächst muss nachvollzogen werden, ob sich die Prüfungen, die das neue Modell eigenständig ausführt, mit den Prüfschritten des Harness überschneiden.\n\n- Wenn sich die Selbstprüfung des Modells lediglich wiederholt, ohne die Qualität zu verbessern, sollte der Prompt gekürzt werden.\n- Automatisierbare Prüfungen wie Tests, Schemavalidierung und statische Analyse sollten im Harness verbleiben.\n- Genehmigungen für Hochrisikoaufgaben wie Zahlungen, Bereitstellungen und Datenlöschungen dürfen nicht durch die Selbstprüfung des Modells ersetzt werden.\n\n### 2. Aufrufbedingungen und Obergrenzen für subagent festlegen\n\nsubagent sind für parallele Recherchen oder die Aufteilung nach Fachgebieten nützlich. Werden jedoch selbst kleine Aufgaben delegiert, steigen Kosten und Latenz. Dafür können Richtlinien wie die folgenden festgelegt werden.\n\n- subagent nur für Aufgaben verwenden, die sich unabhängig voneinander aufteilen lassen.\n- Die Anzahl gleichzeitig ausführbarer subagent pro Anfrage begrenzen.\n- Jedem subagent ein klares Arbeitsergebnis und eindeutige Abbruchbedingungen vorgeben.\n- Verhindern, dass mehrere Agenten dieselben Quellen redundant durchsuchen.\n- Eine menschliche Genehmigung einholen, wenn die erwarteten Kosten oder der erwartete Zeitaufwand einen Schwellenwert überschreiten.\n\n### 3. Detaillierte Verbote durch Entscheidungskriterien ersetzen\n\nLange Verbotslisten können sich widersprechen oder neue Situationen nicht abdecken. In Bereichen mit geringem Risiko, etwa beim Stil, kann dem Modell überlassen werden, den umgebenden Kontext zu lesen und selbst zu entscheiden.\n\n- Regelbasiert: `Schreibe niemals docstrings mit mehreren Absätzen.`\n- Delegierte Entscheidung: `Halte dich an die Kommentardichte, das docstring-Format, die Benennung und die Konventionen des vorhandenen Codes.`\n\nRegeln mit hohen Verstoßkosten, etwa zum Umgang mit personenbezogenen Daten, zur Sicherheit oder zu gesetzlichen Pflichten, müssen jedoch als explizite Einschränkungen und programmatische Prüfungen beibehalten werden.\n\n### 4. Antwortlänge und Ausgabeformat direkt vorgeben\n\nDie für Schlussfolgerungen eingesetzten Ressourcen und die Länge der für den Benutzer sichtbaren Antwort sind nicht dasselbe. Selbst wenn der Client `effort` oder eine ähnliche Option für die Schlussfolgerungsintensität anbietet, müssen für kurze Antworten separate Ausgabevorgaben formuliert werden.\n\nBeispiele:\n\n- `Nenne zuerst die Schlussfolgerung und fasse die Begründung in höchstens drei Punkten zusammen.`\n- `Die endgültige Antwort darf höchstens 500 Zeichen umfassen.`\n- `Gib ohne Erläuterung ausschließlich ein gültiges JSON-Objekt zurück.`\n- `Berichte nur über geänderte Dateien, die wichtigsten Gründe und verbleibende Risiken.`\n\n### 5. Schlussfolgerungsintensität anhand realer Aufgaben neu kalibrieren\n\nDie beim vorherigen Modell verwendete Schlussfolgerungsintensität oder der Standardwert für effort darf nicht unverändert auf das neue Modell übertragen werden. Die Kostenkurve sollte gemessen werden, indem mit einer niedrigen Einstellung begonnen und diese nur bei unzureichender Qualität erhöht wird.\n\n| Aufgabentyp | Richtung der Anfangseinstellung | Bedingung für eine Erhöhung |\n|---|---|---|\n| Klassifizierung und Formatkonvertierung | Niedrig beginnen | Wenn Schemafehler oder Auslassungen wiederholt auftreten |\n| Allgemeine Dokument- und Codeänderungen | Mittleren Bereich vergleichen | Wenn Abhängigkeiten zwischen mehreren Dateien übersehen werden |\n| Komplexes Debugging | Mittlere oder höhere Einstellung testen | Wenn Ursachenanalyse und Prüfungserfolgsquote unzureichend sind |\n| Langfristige Agentenaufgaben | Schrittweise messen | In schwierigen Abschnitten, die Neuplanung oder Wiederherstellung erfordern |\n\nDa die genaue Bezeichnung der Optionen und ihr Unterstützungsumfang je nach API-Version und Produkt variieren können, muss die offizielle Dokumentation geprüft werden.\n\n### 6. Kontext nach Rollen aufteilen und schrittweise offenlegen\n\nWenn sämtliche Anweisungen in einem einzigen System-Prompt oder einer einzigen `CLAUDE.md` untergebracht werden, können bei jeder Anfrage auch irrelevante Informationen übermittelt werden. Praktisch ist eine Hierarchie wie die folgende.\n\n1. **System- und Produktanweisungen:** Stets erforderliche Regeln wie Rolle, Sicherheitsgrenzen und Ausgabevertrag\n2. **Kompakte Projektanweisungen:** Build-Befehle, Verzeichnisstruktur und gemeinsame Arbeitsweisen\n3. **Bei Bedarf geladener Skill:** Bedingte Verfahren für Bereitstellungen, Datenbankänderungen, bestimmte Frameworks und Ähnliches\n4. **Technische Referenzen:** API-Schemata, Codebeispiele, Designdokumente und prüfbare Spezifikationen\n\nDies kann als **schrittweise Offenlegung** bezeichnet werden. Das Modell soll die in der jeweiligen Phase benötigten Unterlagen suchen oder laden. Um Reproduzierbarkeit und Auditierbarkeit sicherzustellen, muss jedoch protokolliert werden, welche Unterlagen verwendet wurden.\n\n## Empfohlenes Migrationsverfahren\n\n### Schritt 1: Aktuellen Zustand fixieren\n\nPrompts, Toolversionen, Erfolgsquoten, Tokenverbrauch, Latenzen und Fehlerfälle des bisherigen Modells werden gespeichert. Ohne Ausgangsbasis lässt sich nur schwer beurteilen, ob das neue Modell tatsächlich eine Verbesserung darstellt.\n\n### Schritt 2: Modellinformationen und Berechtigungen prüfen\n\nDie offizielle Modell-ID, den Preis, das Kontextlimit, die Toolunterstützung und die Richtlinie zur Datenspeicherung prüfen. In der Testumgebung werden Berechtigungen zum Schreiben, Löschen und Bereitstellen eingeschränkt.\n\n### Schritt 3: Bestehenden Harness unverändert testen\n\nZu Beginn sollte nicht alles auf einmal geändert werden. Wird nur das Modell ausgetauscht und mit der Ausgangsbasis verglichen, lässt sich die Auswirkung der Modelländerung isolieren.\n\n### Schritt 4: Doppelte Anweisungen einzeln entfernen\n\nPrüfanweisungen, ausführliche Stilregeln, unnötige Beispiele und stets eingebundene Referenzen werden jeweils nach Art entfernt. Nach jeder Änderung werden Qualität und Kosten erneut gemessen.\n\n### Schritt 5: Routing-Richtlinie erstellen\n\nDas Modell wird anhand von Aufgabenschwierigkeit, Risiko, erwartetem Kontext und Zeitlimit ausgewählt. Die in den bereitgestellten Unterlagen vorgeschlagenen Rollen der einzelnen Modelle dürfen erst nach Bestätigung der offiziellen Bezeichnungen und Leistungsdaten als Hypothesen getestet werden und dürfen nicht unverändert als Betriebsrichtlinie übernommen werden.\n\n### Schritt 6: Zunächst mit begrenztem Datenverkehr bereitstellen\n\nDie Umstellung wird zunächst auf einige Benutzer oder nicht riskante Aufgaben angewandt. Nach Beobachtung von Fehlerquote, Wiederholungsversuchen, Anzahl der subagent, Toolfehlern und menschlicher Korrekturzeit wird der Umfang erweitert.\n\n## Checkliste für den Betrieb\n\n- [ ] Die offizielle Modellbezeichnung und API-Modell-ID wurden geprüft.\n- [ ] Die tatsächlich geltenden Preise für Ein- und Ausgabe, Caching, Batch-Verarbeitung und weitere Komponenten wurden geprüft.\n- [ ] Es gibt ein eigenes Bewertungsset aus realen Arbeitsaufgaben.\n- [ ] Die Prüfschritte von Modell und Harness überschneiden sich nicht.\n- [ ] Es gibt Kriterien für subagent-Aufrufe, eine Obergrenze für parallele Ausführungen und ein Budgetlimit.\n- [ ] Antwortlänge und Ausgabeschema wurden festgelegt.\n- [ ] Qualität, Kosten und Latenz wurden für verschiedene Schlussfolgerungsintensitäten verglichen.\n- [ ] Für Hochrisikoaufgaben bleiben deterministische Prüfungen und menschliche Genehmigungen bestehen.\n- [ ] Der Kontext ist in dauerhaft geltende Anweisungen, Skill und Referenzen unterteilt.\n- [ ] Das bisherige Modell und seine Konfiguration stehen für ein Rollback bereit.\n\n## Fazit\n\nDer Kern eines Wechsels zu einem neuen Modell besteht weder darin, Prompts bedingungslos zu verkürzen, noch darin, die Autonomie bedingungslos auszuweiten. Entscheidend ist, **zunächst die offiziellen Produktinformationen zu prüfen und anschließend anhand realer Arbeitsbewertungen die Rollen von Modell und Harness neu aufzuteilen**.\n\nDie in den bereitgestellten Unterlagen genannten Zahlen und Bezeichnungen zu Claude Opus 5 müssen bis zur Bestätigung durch offizielle Quellen als vorläufige Informationen behandelt werden. Die Beseitigung doppelter Prüfungen, die Begrenzung von subagent, klare Ausgabeverträge, die schrittweise Offenlegung von Kontext und ein auf eigenen Bewertungen basierendes Routing sind jedoch unabhängig von der Modellgeneration anwendbare Grundsätze für einen Wechsel.","content_html":"\u003cp\u003eDie bereitgestellten Unterlagen stellen Claude Opus 5 als ein auf alltägliche Enterprise- und Agentenaufgaben zugeschnittenes Modell vor und vertreten die Auffassung, dass bestehende Prompts und Harnesses für die neue Claude-Generation neu gestaltet werden müssen. Allerdings konnten die in den Unterlagen genannten \u003cstrong\u003eVeröffentlichungstermine, Preise und Leistungsdaten von Claude Opus 5, Fable 5 und Sonnet 5 sowie die Aussagen von Partnern anhand der in diesem Artikel bereitgestellten Informationen nicht unabhängig verifiziert werden.\u003c/strong\u003e Insbesondere sollte zunächst in der offiziellen Modellliste geprüft werden, ob \u003ccode\u003eFable\u003c/code\u003e tatsächlich eine offizielle Modellbezeichnung von Anthropic ist.\u003c/p\u003e\n\u003cp\u003eDaher wiederholt dieses Dokument diese Veröffentlichungsinformationen nicht als bestätigte Tatsachen, sondern unterscheidet zwischen Punkten, die anhand offizieller Dokumente überprüft werden müssen, und Prüfverfahren, die sich auf einen tatsächlichen Modellwechsel anwenden lassen.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#zun%C3%A4chst-zu-pr%C3%BCfende-ver%C3%B6ffentlichungsinformationen\" class=\"anchor\" id=\"zunächst-zu-prüfende-veröffentlichungsinformationen\"\u003e\u003c/a\u003eZunächst zu prüfende Veröffentlichungsinformationen\u003c/h2\u003e\n\u003cp\u003eBevor ein neues Modell in die API, die Claude-App oder Claude Code integriert wird, sollten die folgenden Punkte mit der offiziellen Dokumentation von Anthropic und der Modellauswahl des verwendeten Dienstes abgeglichen werden.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003ePrüfpunkt\u003c/th\u003e\n\u003cth\u003eBehauptung der bereitgestellten Unterlagen\u003c/th\u003e\n\u003cth\u003eErforderliche Prüfung\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Prüfpunkt\"\u003eModellbezeichnungen\u003c/td\u003e\n\u003ctd data-label=\"Behauptung der bereitgestellten Unterlagen\"\u003eClaude Opus 5, Fable 5, Sonnet 5\u003c/td\u003e\n\u003ctd data-label=\"Erforderliche Prüfung\"\u003eGenaue Produktnamen und Modell-IDs in der offiziellen Modellliste\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Prüfpunkt\"\u003eVeröffentlichungstermine\u003c/td\u003e\n\u003ctd data-label=\"Behauptung der bereitgestellten Unterlagen\"\u003eJeweils 9. Juni, 30. Juni und 24. Juli\u003c/td\u003e\n\u003ctd data-label=\"Erforderliche Prüfung\"\u003eJahr und Datum in der offiziellen Ankündigung und im Änderungsverlauf\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Prüfpunkt\"\u003ePreis von Opus 5\u003c/td\u003e\n\u003ctd data-label=\"Behauptung der bereitgestellten Unterlagen\"\u003e5 Dollar für Eingaben, 25 Dollar für Ausgaben/1 Million Token\u003c/td\u003e\n\u003ctd data-label=\"Erforderliche Prüfung\"\u003eOffizielle API-Preisliste sowie separate Gebühren für Batch-Verarbeitung, Caching und lange Kontexte\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Prüfpunkt\"\u003eStandardmodell im Produkt\u003c/td\u003e\n\u003ctd data-label=\"Behauptung der bereitgestellten Unterlagen\"\u003eNeues Standardmodell von Claude Max\u003c/td\u003e\n\u003ctd data-label=\"Erforderliche Prüfung\"\u003eVerfügbarkeit nach Region, Tarif und Client\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Prüfpunkt\"\u003eRollen der Modelle\u003c/td\u003e\n\u003ctd data-label=\"Behauptung der bereitgestellten Unterlagen\"\u003eUnterteilung in langfristige autonome Aufgaben, alltägliche Aufgaben und ressourcenschonende Aufgaben\u003c/td\u003e\n\u003ctd data-label=\"Erforderliche Prüfung\"\u003eOffizielle Modellbeschreibungen und Ergebnisse aus der Bewertung realer Arbeitsaufgaben\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Prüfpunkt\"\u003eLeistungsverbesserungen\u003c/td\u003e\n\u003ctd data-label=\"Behauptung der bereitgestellten Unterlagen\"\u003eVerbesserungen um bestimmte Prozentsätze gegenüber früheren Modellen\u003c/td\u003e\n\u003ctd data-label=\"Erforderliche Prüfung\"\u003eBewertungsaufgaben, Stichprobengröße, Messkriterien und Originalaussagen der Partner\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eWenn Modellbezeichnungen oder Preise nicht in der offiziellen Dokumentation zu finden sind, dürfen sie nicht für API-Konfigurationen oder Budgetberechnungen verwendet werden. Bei der Nutzung eines Cloud-Anbieters oder Wiederverkäufers können sich Modell-ID, Preis und Bereitstellungszeitpunkt zudem von der direkten API von Anthropic unterscheiden.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#entscheidungskriterien-die-sich-beim-modellwechsel-%C3%A4ndern-m%C3%BCssen\" class=\"anchor\" id=\"entscheidungskriterien-die-sich-beim-modellwechsel-ändern-müssen\"\u003e\u003c/a\u003eEntscheidungskriterien, die sich beim Modellwechsel ändern müssen\u003c/h2\u003e\n\u003ch3\u003e\n\u003ca href=\"#1-effizienz-pro-aufgabe-statt-spitzenleistung-messen\" class=\"anchor\" id=\"1-effizienz-pro-aufgabe-statt-spitzenleistung-messen\"\u003e\u003c/a\u003e1. Effizienz pro Aufgabe statt Spitzenleistung messen\u003c/h3\u003e\n\u003cp\u003eWenn jede Anfrage mit dem teuersten Modell bearbeitet wird, können die Kosten schnell steigen, sobald ein Agent wiederholt mehrere Tools und subagent aufruft. Ein Modell sollte nicht anhand seines Namens oder seiner Kategorie ausgewählt werden, sondern anhand der folgenden Kennzahlen in ihrer Gesamtheit.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e\n\u003cstrong\u003eErfolgsquote:\u003c/strong\u003e Anteil der Fälle, in denen die Anforderungen ohne menschliche Korrekturen erfüllt wurden\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eGesamtkosten:\u003c/strong\u003e Kosten einschließlich erneuter Versuche sowie Tool- und subagent-Aufrufe, nicht nur der ersten Anfrage\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eBearbeitungszeit:\u003c/strong\u003e Zeit einschließlich Wartezeiten sowie menschlicher Prüf- und Korrekturzeit\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eFehlerkosten:\u003c/strong\u003e Auswirkungen eines Fehlers, etwa Sicherheitslücken, fehlerhafte Bereitstellungen oder unvollständige Analysen\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eKonsistenz:\u003c/strong\u003e Ausmaß, in dem die Ergebnisse bei wiederholter Bearbeitung derselben Aufgabenart schwanken\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eDie Kosten pro Aufgabe dürfen nicht allein anhand des Tokenpreises beurteilt werden. Konzeptionell lassen sie sich wie folgt berechnen.\u003c/p\u003e\n\u003cp\u003e\u003ccode\u003eGesamtkosten pro Aufgabe = Kosten des Hauptmodells + subagent-Kosten + Toolkosten + Kosten erneuter Versuche + menschliche Prüfkosten\u003c/code\u003e\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#2-%C3%B6ffentliche-benchmarks-und-eigene-bewertungen-trennen\" class=\"anchor\" id=\"2-öffentliche-benchmarks-und-eigene-bewertungen-trennen\"\u003e\u003c/a\u003e2. Öffentliche Benchmarks und eigene Bewertungen trennen\u003c/h3\u003e\n\u003cp\u003eÖffentliche Benchmarks sind ein Ausgangspunkt für den Vergleich allgemeiner Modelleigenschaften, garantieren aber keinen Erfolg bei einer bestimmten Codebasis, Dokumentvorlage oder Geschäftsregel. Organisationen sollten aus anonymisierten realen Aufgaben eigene Bewertungssets erstellen.\u003c/p\u003e\n\u003cp\u003eEin gutes Bewertungsset umfasst gemeinsam die folgenden Fälle.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eRepräsentative Aufgaben, die regulär abgeschlossen werden müssen\u003c/li\u003e\n\u003cli\u003eGrenzfälle, bei denen das Modell häufig Fehler macht\u003c/li\u003e\n\u003cli\u003eAufgaben mit unklaren Anforderungen, bei denen Rückfragen erforderlich sind\u003c/li\u003e\n\u003cli\u003eAufgaben, die Toolaufrufe oder die Prüfung externer Quellen erfordern\u003c/li\u003e\n\u003cli\u003eHochriskante Aufgaben, bei denen die Ausführung abgebrochen oder eine menschliche Genehmigung eingeholt werden muss\u003c/li\u003e\n\u003cli\u003eAufgaben, bei denen während einer langen Ausführung der Zustand gespeichert und wiederhergestellt werden muss\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eEin Vergleich ist nur möglich, wenn auf jedes Modell dieselben Eingaben, Tools, Zeitlimits und Erfolgskriterien angewandt werden. Statt ein oder zwei beeindruckender Ergebnisse ist es sicherer, die Erfolgsquote und Kostenverteilung über mehrere Wiederholungen hinweg zu erfassen.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#3-modell-und-harness-als-ein-system-bewerten\" class=\"anchor\" id=\"3-modell-und-harness-als-ein-system-bewerten\"\u003e\u003c/a\u003e3. Modell und Harness als ein System bewerten\u003c/h3\u003e\n\u003cp\u003eEin \u003cstrong\u003eHarness\u003c/strong\u003e bezeichnet die Ausführungsumgebung rund um das Modell. Dazu gehören System-Prompts, Projektanweisungen, Suche, Speicher, Tools, Skill, subagent, Berechtigungsverwaltung sowie Prüf- und Wiederholungslogik.\u003c/p\u003e\n\u003cp\u003eAuch dasselbe Modell kann je nach Harness unterschiedliche Ergebnisse liefern. Wenn das Modell beispielsweise selbst Tests erstellt und ausführt und der Harness dieselbe Prüfung ebenfalls erzwingt, kann dieselbe Arbeit doppelt ausgeführt werden. Umgekehrt ist es riskant, auch Schritte, die deterministische Kontrollen erfordern, etwa Bereitstellungsfreigaben oder Sicherheitsprüfungen, dem autonomen Urteil des Modells zu überlassen.\u003c/p\u003e\n\u003cp\u003eDas zentrale Prinzip besteht darin, \u003cstrong\u003ezwischen Schlussfolgerungen, die das Modell gut beherrscht, und Kontrollen, die das System zwingend gewährleisten muss, zu unterscheiden\u003c/strong\u003e.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#6-punkte-zur-pr%C3%BCfung-von-prompts-und-harnesses\" class=\"anchor\" id=\"6-punkte-zur-prüfung-von-prompts-und-harnesses\"\u003e\u003c/a\u003e6 Punkte zur Prüfung von Prompts und Harnesses\u003c/h2\u003e\n\u003ch3\u003e\n\u003ca href=\"#1-doppelte-pr%C3%BCf--und-kontrollanweisungen-versuchsweise-entfernen\" class=\"anchor\" id=\"1-doppelte-prüf--und-kontrollanweisungen-versuchsweise-entfernen\"\u003e\u003c/a\u003e1. Doppelte Prüf- und Kontrollanweisungen versuchsweise entfernen\u003c/h3\u003e\n\u003cp\u003eEs ist nicht grundsätzlich richtig, Sätze wie \u003ccode\u003eNach Abschluss unbedingt erneut prüfen\u003c/code\u003e ausnahmslos zu löschen. Zunächst muss nachvollzogen werden, ob sich die Prüfungen, die das neue Modell eigenständig ausführt, mit den Prüfschritten des Harness überschneiden.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eWenn sich die Selbstprüfung des Modells lediglich wiederholt, ohne die Qualität zu verbessern, sollte der Prompt gekürzt werden.\u003c/li\u003e\n\u003cli\u003eAutomatisierbare Prüfungen wie Tests, Schemavalidierung und statische Analyse sollten im Harness verbleiben.\u003c/li\u003e\n\u003cli\u003eGenehmigungen für Hochrisikoaufgaben wie Zahlungen, Bereitstellungen und Datenlöschungen dürfen nicht durch die Selbstprüfung des Modells ersetzt werden.\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch3\u003e\n\u003ca href=\"#2-aufrufbedingungen-und-obergrenzen-f%C3%BCr-subagent-festlegen\" class=\"anchor\" id=\"2-aufrufbedingungen-und-obergrenzen-für-subagent-festlegen\"\u003e\u003c/a\u003e2. Aufrufbedingungen und Obergrenzen für subagent festlegen\u003c/h3\u003e\n\u003cp\u003esubagent sind für parallele Recherchen oder die Aufteilung nach Fachgebieten nützlich. Werden jedoch selbst kleine Aufgaben delegiert, steigen Kosten und Latenz. Dafür können Richtlinien wie die folgenden festgelegt werden.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003esubagent nur für Aufgaben verwenden, die sich unabhängig voneinander aufteilen lassen.\u003c/li\u003e\n\u003cli\u003eDie Anzahl gleichzeitig ausführbarer subagent pro Anfrage begrenzen.\u003c/li\u003e\n\u003cli\u003eJedem subagent ein klares Arbeitsergebnis und eindeutige Abbruchbedingungen vorgeben.\u003c/li\u003e\n\u003cli\u003eVerhindern, dass mehrere Agenten dieselben Quellen redundant durchsuchen.\u003c/li\u003e\n\u003cli\u003eEine menschliche Genehmigung einholen, wenn die erwarteten Kosten oder der erwartete Zeitaufwand einen Schwellenwert überschreiten.\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch3\u003e\n\u003ca href=\"#3-detaillierte-verbote-durch-entscheidungskriterien-ersetzen\" class=\"anchor\" id=\"3-detaillierte-verbote-durch-entscheidungskriterien-ersetzen\"\u003e\u003c/a\u003e3. Detaillierte Verbote durch Entscheidungskriterien ersetzen\u003c/h3\u003e\n\u003cp\u003eLange Verbotslisten können sich widersprechen oder neue Situationen nicht abdecken. In Bereichen mit geringem Risiko, etwa beim Stil, kann dem Modell überlassen werden, den umgebenden Kontext zu lesen und selbst zu entscheiden.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eRegelbasiert: \u003ccode\u003eSchreibe niemals docstrings mit mehreren Absätzen.\u003c/code\u003e\n\u003c/li\u003e\n\u003cli\u003eDelegierte Entscheidung: \u003ccode\u003eHalte dich an die Kommentardichte, das docstring-Format, die Benennung und die Konventionen des vorhandenen Codes.\u003c/code\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eRegeln mit hohen Verstoßkosten, etwa zum Umgang mit personenbezogenen Daten, zur Sicherheit oder zu gesetzlichen Pflichten, müssen jedoch als explizite Einschränkungen und programmatische Prüfungen beibehalten werden.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#4-antwortl%C3%A4nge-und-ausgabeformat-direkt-vorgeben\" class=\"anchor\" id=\"4-antwortlänge-und-ausgabeformat-direkt-vorgeben\"\u003e\u003c/a\u003e4. Antwortlänge und Ausgabeformat direkt vorgeben\u003c/h3\u003e\n\u003cp\u003eDie für Schlussfolgerungen eingesetzten Ressourcen und die Länge der für den Benutzer sichtbaren Antwort sind nicht dasselbe. Selbst wenn der Client \u003ccode\u003eeffort\u003c/code\u003e oder eine ähnliche Option für die Schlussfolgerungsintensität anbietet, müssen für kurze Antworten separate Ausgabevorgaben formuliert werden.\u003c/p\u003e\n\u003cp\u003eBeispiele:\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e\u003ccode\u003eNenne zuerst die Schlussfolgerung und fasse die Begründung in höchstens drei Punkten zusammen.\u003c/code\u003e\u003c/li\u003e\n\u003cli\u003e\u003ccode\u003eDie endgültige Antwort darf höchstens 500 Zeichen umfassen.\u003c/code\u003e\u003c/li\u003e\n\u003cli\u003e\u003ccode\u003eGib ohne Erläuterung ausschließlich ein gültiges JSON-Objekt zurück.\u003c/code\u003e\u003c/li\u003e\n\u003cli\u003e\u003ccode\u003eBerichte nur über geänderte Dateien, die wichtigsten Gründe und verbleibende Risiken.\u003c/code\u003e\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch3\u003e\n\u003ca href=\"#5-schlussfolgerungsintensit%C3%A4t-anhand-realer-aufgaben-neu-kalibrieren\" class=\"anchor\" id=\"5-schlussfolgerungsintensität-anhand-realer-aufgaben-neu-kalibrieren\"\u003e\u003c/a\u003e5. Schlussfolgerungsintensität anhand realer Aufgaben neu kalibrieren\u003c/h3\u003e\n\u003cp\u003eDie beim vorherigen Modell verwendete Schlussfolgerungsintensität oder der Standardwert für effort darf nicht unverändert auf das neue Modell übertragen werden. Die Kostenkurve sollte gemessen werden, indem mit einer niedrigen Einstellung begonnen und diese nur bei unzureichender Qualität erhöht wird.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eAufgabentyp\u003c/th\u003e\n\u003cth\u003eRichtung der Anfangseinstellung\u003c/th\u003e\n\u003cth\u003eBedingung für eine Erhöhung\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Aufgabentyp\"\u003eKlassifizierung und Formatkonvertierung\u003c/td\u003e\n\u003ctd data-label=\"Richtung der Anfangseinstellung\"\u003eNiedrig beginnen\u003c/td\u003e\n\u003ctd data-label=\"Bedingung für eine Erhöhung\"\u003eWenn Schemafehler oder Auslassungen wiederholt auftreten\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Aufgabentyp\"\u003eAllgemeine Dokument- und Codeänderungen\u003c/td\u003e\n\u003ctd data-label=\"Richtung der Anfangseinstellung\"\u003eMittleren Bereich vergleichen\u003c/td\u003e\n\u003ctd data-label=\"Bedingung für eine Erhöhung\"\u003eWenn Abhängigkeiten zwischen mehreren Dateien übersehen werden\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Aufgabentyp\"\u003eKomplexes Debugging\u003c/td\u003e\n\u003ctd data-label=\"Richtung der Anfangseinstellung\"\u003eMittlere oder höhere Einstellung testen\u003c/td\u003e\n\u003ctd data-label=\"Bedingung für eine Erhöhung\"\u003eWenn Ursachenanalyse und Prüfungserfolgsquote unzureichend sind\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Aufgabentyp\"\u003eLangfristige Agentenaufgaben\u003c/td\u003e\n\u003ctd data-label=\"Richtung der Anfangseinstellung\"\u003eSchrittweise messen\u003c/td\u003e\n\u003ctd data-label=\"Bedingung für eine Erhöhung\"\u003eIn schwierigen Abschnitten, die Neuplanung oder Wiederherstellung erfordern\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eDa die genaue Bezeichnung der Optionen und ihr Unterstützungsumfang je nach API-Version und Produkt variieren können, muss die offizielle Dokumentation geprüft werden.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#6-kontext-nach-rollen-aufteilen-und-schrittweise-offenlegen\" class=\"anchor\" id=\"6-kontext-nach-rollen-aufteilen-und-schrittweise-offenlegen\"\u003e\u003c/a\u003e6. Kontext nach Rollen aufteilen und schrittweise offenlegen\u003c/h3\u003e\n\u003cp\u003eWenn sämtliche Anweisungen in einem einzigen System-Prompt oder einer einzigen \u003ccode\u003eCLAUDE.md\u003c/code\u003e untergebracht werden, können bei jeder Anfrage auch irrelevante Informationen übermittelt werden. Praktisch ist eine Hierarchie wie die folgende.\u003c/p\u003e\n\u003col\u003e\n\u003cli\u003e\n\u003cstrong\u003eSystem- und Produktanweisungen:\u003c/strong\u003e Stets erforderliche Regeln wie Rolle, Sicherheitsgrenzen und Ausgabevertrag\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eKompakte Projektanweisungen:\u003c/strong\u003e Build-Befehle, Verzeichnisstruktur und gemeinsame Arbeitsweisen\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eBei Bedarf geladener Skill:\u003c/strong\u003e Bedingte Verfahren für Bereitstellungen, Datenbankänderungen, bestimmte Frameworks und Ähnliches\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eTechnische Referenzen:\u003c/strong\u003e API-Schemata, Codebeispiele, Designdokumente und prüfbare Spezifikationen\u003c/li\u003e\n\u003c/ol\u003e\n\u003cp\u003eDies kann als \u003cstrong\u003eschrittweise Offenlegung\u003c/strong\u003e bezeichnet werden. Das Modell soll die in der jeweiligen Phase benötigten Unterlagen suchen oder laden. Um Reproduzierbarkeit und Auditierbarkeit sicherzustellen, muss jedoch protokolliert werden, welche Unterlagen verwendet wurden.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#empfohlenes-migrationsverfahren\" class=\"anchor\" id=\"empfohlenes-migrationsverfahren\"\u003e\u003c/a\u003eEmpfohlenes Migrationsverfahren\u003c/h2\u003e\n\u003ch3\u003e\n\u003ca href=\"#schritt-1-aktuellen-zustand-fixieren\" class=\"anchor\" id=\"schritt-1-aktuellen-zustand-fixieren\"\u003e\u003c/a\u003eSchritt 1: Aktuellen Zustand fixieren\u003c/h3\u003e\n\u003cp\u003ePrompts, Toolversionen, Erfolgsquoten, Tokenverbrauch, Latenzen und Fehlerfälle des bisherigen Modells werden gespeichert. Ohne Ausgangsbasis lässt sich nur schwer beurteilen, ob das neue Modell tatsächlich eine Verbesserung darstellt.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#schritt-2-modellinformationen-und-berechtigungen-pr%C3%BCfen\" class=\"anchor\" id=\"schritt-2-modellinformationen-und-berechtigungen-prüfen\"\u003e\u003c/a\u003eSchritt 2: Modellinformationen und Berechtigungen prüfen\u003c/h3\u003e\n\u003cp\u003eDie offizielle Modell-ID, den Preis, das Kontextlimit, die Toolunterstützung und die Richtlinie zur Datenspeicherung prüfen. In der Testumgebung werden Berechtigungen zum Schreiben, Löschen und Bereitstellen eingeschränkt.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#schritt-3-bestehenden-harness-unver%C3%A4ndert-testen\" class=\"anchor\" id=\"schritt-3-bestehenden-harness-unverändert-testen\"\u003e\u003c/a\u003eSchritt 3: Bestehenden Harness unverändert testen\u003c/h3\u003e\n\u003cp\u003eZu Beginn sollte nicht alles auf einmal geändert werden. Wird nur das Modell ausgetauscht und mit der Ausgangsbasis verglichen, lässt sich die Auswirkung der Modelländerung isolieren.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#schritt-4-doppelte-anweisungen-einzeln-entfernen\" class=\"anchor\" id=\"schritt-4-doppelte-anweisungen-einzeln-entfernen\"\u003e\u003c/a\u003eSchritt 4: Doppelte Anweisungen einzeln entfernen\u003c/h3\u003e\n\u003cp\u003ePrüfanweisungen, ausführliche Stilregeln, unnötige Beispiele und stets eingebundene Referenzen werden jeweils nach Art entfernt. Nach jeder Änderung werden Qualität und Kosten erneut gemessen.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#schritt-5-routing-richtlinie-erstellen\" class=\"anchor\" id=\"schritt-5-routing-richtlinie-erstellen\"\u003e\u003c/a\u003eSchritt 5: Routing-Richtlinie erstellen\u003c/h3\u003e\n\u003cp\u003eDas Modell wird anhand von Aufgabenschwierigkeit, Risiko, erwartetem Kontext und Zeitlimit ausgewählt. Die in den bereitgestellten Unterlagen vorgeschlagenen Rollen der einzelnen Modelle dürfen erst nach Bestätigung der offiziellen Bezeichnungen und Leistungsdaten als Hypothesen getestet werden und dürfen nicht unverändert als Betriebsrichtlinie übernommen werden.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#schritt-6-zun%C3%A4chst-mit-begrenztem-datenverkehr-bereitstellen\" class=\"anchor\" id=\"schritt-6-zunächst-mit-begrenztem-datenverkehr-bereitstellen\"\u003e\u003c/a\u003eSchritt 6: Zunächst mit begrenztem Datenverkehr bereitstellen\u003c/h3\u003e\n\u003cp\u003eDie Umstellung wird zunächst auf einige Benutzer oder nicht riskante Aufgaben angewandt. Nach Beobachtung von Fehlerquote, Wiederholungsversuchen, Anzahl der subagent, Toolfehlern und menschlicher Korrekturzeit wird der Umfang erweitert.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#checkliste-f%C3%BCr-den-betrieb\" class=\"anchor\" id=\"checkliste-für-den-betrieb\"\u003e\u003c/a\u003eCheckliste für den Betrieb\u003c/h2\u003e\n\u003cul\u003e\n\u003cli\u003e Die offizielle Modellbezeichnung und API-Modell-ID wurden geprüft.\u003c/li\u003e\n\u003cli\u003e Die tatsächlich geltenden Preise für Ein- und Ausgabe, Caching, Batch-Verarbeitung und weitere Komponenten wurden geprüft.\u003c/li\u003e\n\u003cli\u003e Es gibt ein eigenes Bewertungsset aus realen Arbeitsaufgaben.\u003c/li\u003e\n\u003cli\u003e Die Prüfschritte von Modell und Harness überschneiden sich nicht.\u003c/li\u003e\n\u003cli\u003e Es gibt Kriterien für subagent-Aufrufe, eine Obergrenze für parallele Ausführungen und ein Budgetlimit.\u003c/li\u003e\n\u003cli\u003e Antwortlänge und Ausgabeschema wurden festgelegt.\u003c/li\u003e\n\u003cli\u003e Qualität, Kosten und Latenz wurden für verschiedene Schlussfolgerungsintensitäten verglichen.\u003c/li\u003e\n\u003cli\u003e Für Hochrisikoaufgaben bleiben deterministische Prüfungen und menschliche Genehmigungen bestehen.\u003c/li\u003e\n\u003cli\u003e Der Kontext ist in dauerhaft geltende Anweisungen, Skill und Referenzen unterteilt.\u003c/li\u003e\n\u003cli\u003e Das bisherige Modell und seine Konfiguration stehen für ein Rollback bereit.\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch2\u003e\n\u003ca href=\"#fazit\" class=\"anchor\" id=\"fazit\"\u003e\u003c/a\u003eFazit\u003c/h2\u003e\n\u003cp\u003eDer Kern eines Wechsels zu einem neuen Modell besteht weder darin, Prompts bedingungslos zu verkürzen, noch darin, die Autonomie bedingungslos auszuweiten. Entscheidend ist, \u003cstrong\u003ezunächst die offiziellen Produktinformationen zu prüfen und anschließend anhand realer Arbeitsbewertungen die Rollen von Modell und Harness neu aufzuteilen\u003c/strong\u003e.\u003c/p\u003e\n\u003cp\u003eDie in den bereitgestellten Unterlagen genannten Zahlen und Bezeichnungen zu Claude Opus 5 müssen bis zur Bestätigung durch offizielle Quellen als vorläufige Informationen behandelt werden. Die Beseitigung doppelter Prüfungen, die Begrenzung von subagent, klare Ausgabeverträge, die schrittweise Offenlegung von Kontext und ein auf eigenen Bewertungen basierendes Routing sind jedoch unabhängig von der Modellgeneration anwendbare Grundsätze für einen Wechsel.\u003c/p\u003e\n","tags":["Prompt Engineering","KI-Agent","Anthropic","Claude","Model Evaluation"],"faqs":[{"question":"Ist Claude Opus 5 ein offiziell veröffentlichtes Modell?","answer":"In den bereitgestellten Materialien werden zwar ein Veröffentlichungsdatum und Preise genannt, doch anhand der in diesem Artikel enthaltenen Informationen allein lässt sich dies nicht unabhängig bestätigen. Bis der genaue Modellname und die Modell-ID in der offiziellen Modellliste von Anthropic, in einer Ankündigung und in der API-Konsole bestätigt wurden, ist es ratsam, diese Angaben nicht als gesicherte Produktinformationen zu betrachten."},{"question":"Ist Fable 5 eine offizielle Modellbezeichnung von Anthropic?","answer":"Anhand der bereitgestellten Materialien lässt sich dies nicht bestätigen. Da bei Anthropic selbst bei ähnlichen Produktnamen die API-Modell-ID oder die Bezeichnung je nach Dienst unterschiedlich sein kann, muss in der offiziellen Modellliste überprüft werden, ob die Bezeichnung `Fable 5` tatsächlich existiert."},{"question":"Muss ich beim Wechsel zu einem neuen Claude-Modell alle bestehenden Prompts löschen?","answer":"Nein. Zunächst sollte mit den bestehenden Einstellungen eine Referenzbewertung durchgeführt werden. Anschließend sollten redundante Validierungsanweisungen oder unnötige Stilregeln einzeln entfernt und dabei Qualität und Kosten verglichen werden. Kontrollen, die das System gewährleisten muss, wie Sicherheitsprüfungen, die Validierung des Ausgabeschemas und die Freigabe der Bereitstellung, sollten beibehalten werden."},{"question":"Was ist ein Harness?","answer":"Ein Harness ist ein System, das ein AI-Modell umgibt, damit es in der tatsächlichen Arbeit eingesetzt werden kann. Es umfasst System-Prompts, Projektanweisungen, Tools, Suche, Speicher, Skills, Subagents, Wiederholungsversuche, Berechtigungsverwaltung und automatisierte Verifizierungsverfahren."},{"question":"Wie sollte die Nutzung von Subagenten begrenzt werden?","answer":"Sie sollten nur für Aufgaben eingesetzt werden, die sich unabhängig voneinander aufteilen lassen, und sowohl die Anzahl gleichzeitiger Ausführungen als auch die Gesamtzahl der Aufrufe sollte nach oben begrenzt werden. Die Ergebnisse und Abbruchbedingungen jedes Subagenten sollten klar festgelegt werden; zudem kann das System so gestaltet werden, dass die Zustimmung eines Menschen erforderlich ist, wenn die erwarteten Kosten oder der Zeitaufwand einen Schwellenwert überschreiten."},{"question":"Warum sind eigene Evaluierungen wichtiger als öffentliche Benchmarks?","answer":"Öffentliche Benchmarks spiegeln die Codebasis, Dokumentformate, Tool-Umgebung und Fehlerkosten einer Organisation nicht unverändert wider. Um beurteilen zu können, welches Modell für die Betriebsumgebung geeignet ist, müssen Erfolgsquote, Gesamtkosten, Bearbeitungszeit und Ergebniskonsistenz anhand realer Anwendungsfälle gemessen werden."},{"question":"Kann man auf Tests verzichten, wenn das Modell eine Selbstvalidierung durchführt?","answer":"Nein. Die Selbstüberprüfung des Modells ist ein Hilfsmittel und ersetzt weder Tests, Schemaüberprüfungen und statische Analysen noch Sicherheitsrichtlinien. Insbesondere bei risikoreichen Vorgängen wie Bereitstellungen, Zahlungen und Datenlöschungen sind deterministische Prüfungen und die Zustimmung eines Menschen erforderlich."},{"question":"Werden die Antworten automatisch kürzer, wenn man effort reduziert?","answer":"Das ist nicht unbedingt der Fall. Die Intensität des Schlussfolgerns und die Länge der endgültigen Ausgabe können separat gesteuert werden. Wenn eine knappe Antwort benötigt wird, sollte das Antwortformat, etwa die Zeichenanzahl, die Anzahl der Punkte oder das Ausgabeschema, direkt im Prompt vorgegeben werden."}],"sources":[{"url":"https://docs.anthropic.com/en/docs/about-claude/models/overview","title":"Anthropic Docs: Modellübersicht","type":"source"},{"url":"https://www.anthropic.com/pricing","title":"Anthropic-Preise","type":"data_point"},{"url":"https://docs.anthropic.com/en/docs/build-with-claude/prompt-engineering/overview","title":"Anthropic Docs: Überblick über Prompt Engineering","type":"source"},{"url":"https://docs.anthropic.com/en/docs/claude-code/memory","title":"Anthropic-Dokumentation: Claude Code-Speicher","type":"source"}],"images":[{"id":324,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6MzY5MCwicHVyIjoiYmxvYl9pZCJ9fQ==--f44d725b558668593419631e29f28834deb66ecc/ai-95ae89bc.webp","is_representative":true,"generation_method":"ai_image","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"체크 항목과 경고 장벽 사이에서 AI 큐브를 돋보기로 점검하는 일러스트","caption":"모델 전환 전 프롬프트와 하네스의 성능, 보안, 비용을 점검하는 과정을 나타낸다.","description":null},"en":{"alt":"Illustration of AI cubes being inspected beside a warning barrier and checklist icons","caption":"The scene represents checking prompts, harnesses, performance, security, and cost before a model switch.","description":null},"ja":{"alt":"警告バリケードと確認項目のそばでAIキューブを虫眼鏡で点検するイラスト","caption":"モデル移行前にプロンプトやハーネスの性能、安全性、コストを確認する工程を表している。","description":null},"es":{"alt":"Ilustración de cubos de IA inspeccionados junto a una barrera de alerta e iconos de control","caption":"La escena representa la revisión de prompts, arneses, rendimiento, seguridad y costes antes de cambiar de modelo.","description":null},"id":{"alt":"Ilustrasi kubus AI yang diperiksa di dekat penghalang peringatan dan ikon daftar cek","caption":"Adegan ini menggambarkan pemeriksaan prompt, harness, kinerja, keamanan, dan biaya sebelum beralih model.","description":null},"pt":{"alt":"Ilustração de cubos de IA inspecionados junto a uma barreira de alerta e ícones de verificação","caption":"A cena representa a revisão de prompts, harnesses, desempenho, segurança e custos antes da troca de modelo.","description":null},"zh-hant":{"alt":"在警示柵欄與檢查圖示旁以放大鏡檢視 AI 方塊的插圖","caption":"此圖呈現模型切換前檢查提示詞、工具框架、效能、安全性與成本的流程。","description":null}}},{"id":325,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6MzY5NiwicHVyIjoiYmxvYl9pZCJ9fQ==--5ddddd2dfbbbcedb1849fbdfe606aca94f9a98af/ai-b298a672.webp","is_representative":false,"generation_method":"ai_image","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"중앙 AI 모델에 보안, 문서, 사용자, 도구와 에이전트 차단 장치가 연결된 점검 구성도","caption":"모델 전환 전 프롬프트와 에이전트 하네스의 연결, 안전장치, 평가 항목을 점검하는 흐름을 나타낸다.","description":null},"en":{"alt":"AI model linked to security, documents, users, tools, agent controls, and evaluation indicators","caption":"The diagram contextualizes checks for prompts, agent harnesses, safeguards, and evaluations before a model switch.","description":null},"ja":{"alt":"中央のAIモデルにセキュリティ、文書、ユーザー、ツール、エージェント制御が接続された構成図","caption":"モデル移行前にプロンプトやエージェントハーネス、安全策、評価項目を確認する流れを示している。","description":null},"es":{"alt":"Modelo de IA conectado con seguridad, documentos, usuarios, herramientas, controles de agentes e indicadores","caption":"El diagrama representa la revisión de prompts, arneses de agentes, salvaguardas y evaluaciones antes de cambiar de modelo.","description":null},"id":{"alt":"Model AI terhubung ke keamanan, dokumen, pengguna, alat, kontrol agen, dan indikator evaluasi","caption":"Diagram ini menggambarkan pemeriksaan prompt, harness agen, pengaman, dan evaluasi sebelum pergantian model.","description":null},"pt":{"alt":"Modelo de IA ligado a segurança, documentos, usuários, ferramentas, controles de agentes e indicadores","caption":"O diagrama representa a verificação de prompts, harnesses de agentes, proteções e avaliações antes da troca de modelo.","description":null},"zh-hant":{"alt":"中央 AI 模型連接安全、文件、使用者、工具、代理控制與評估指標的架構圖","caption":"此圖呈現模型切換前對提示詞、代理框架、安全機制與評估項目的檢查流程。","description":null}}}],"published_at":"2026-07-28T11:42:11+09:00","updated_at":"2026-07-28T11:42:11+09:00","license":"cc_by","translation_status":"reviewed","available_locales":["ko","en","ja","es"],"data_locales":["ko","en","ja","es","id","pt","zh-hant","de"],"url":"https://injoys.com/en/articles/claude-opus-5-verification-and-migration-guide"}