{"content_id":"uxrumphsyw","slug":"prompt-context-harness-agentic-loop-engineering","locale":"de","schema_type":"TechArticle","category":"comparison","category_name":"Vergleich","title":"Unterschiede und Gestaltung von Prompt-, Kontext-, Harness-, agentischem und Loop Engineering","summary":"Prompt-, Kontext-, Harness-, agentisches und Loop Engineering befassen sich jeweils mit Anweisungen, Informationen, der Arbeitsumgebung, autonomer Ausführung und iterativer Verbesserung. Dieser Artikel erläutert aus praktischer Sicht die Abgrenzung und das Zusammenspiel der fünf Ansätze, ihre Einsatzreihenfolge, Prüfkennzahlen und Methoden zur Fehlervermeidung.","sponsorship_disclosure":null,"author":{"name":"naikeu","url":"https://injoys.com/ko/about"},"key_points":["Prompt Engineering dient dazu, Ziele, Einschränkungen, Beispiele, den Ausgabevertrag und Erfolgskriterien klar zu definieren.","Kontext Engineering steuert Relevanz, Aktualität und Quellen der Informationen, die AI für die aktuelle Entscheidung verwendet, sowie die Token-Effizienz.","Harness Engineering schafft mithilfe von Werkzeugen, Berechtigungen, Sandboxes, Dokumentstrukturen, Prüfsystemen und Protokollen eine Umgebung, in der AI zuverlässig arbeiten kann.","Agentisches Engineering überträgt AI in begrenztem Umfang die Auswahl der nächsten Handlung und der Werkzeuge zur Zielerreichung.","Loop Engineering verbindet Generierung, Prüfung, Ursachenanalyse, Korrektur, erneute Ausführung und Abbruchbedingungen, damit das Ergebnis konvergiert."],"content_markdown":"Wenn alle Maßnahmen zur Verbesserung der Qualität generativer KI unter „gute Prompts schreiben“ zusammengefasst werden, lassen sich die Ursachen von Fehlern nur schwer präzise diagnostizieren. Prompt-, Kontext-, Harness-, agentische und Loop-Engineering sind keine austauschbaren Modebegriffe, sondern ergänzende Entwurfsansätze, die unterschiedliche Steuerungsebenen behandeln: **Formulierung von Anfragen, Auswahl von Informationen, Ausführungsumgebung, autonome Entscheidungsfindung und iterative Verbesserung**.\n\n## Kerndefinitionen der fünf Konzepte\n\n| Kategorie | Kernfrage | Zentrale Entwurfsobjekte | Typische Ergebnisse | Typische Erfolgskriterien |\n|---|---|---|---|---|\n| Prompt-Engineering | Wie soll die KI angewiesen werden, eine Aufgabe auszuführen? | Anweisungen, Einschränkungen, Beispiele, Ausgabeformat | Prompt-Vorlagen, Beispieleingaben und -ausgaben | Befolgungsquote von Anweisungen, Formatgenauigkeit, Qualität des ersten Ergebnisses |\n| Kontext-Engineering | Was soll der KI jetzt gezeigt werden? | Systemanweisungen, abgerufene Dokumente, Gesprächsstatus, Speicher, Werkzeugergebnisse | Regeln für die Kontextzusammenstellung, Abruf- und Zusammenfassungsrichtlinien | Relevanz, Aktualität, Nachweisbarkeit, Token-Effizienz |\n| Harness-Engineering | Welche Arbeitsumgebung erschwert es der KI, Fehler zu machen? | Werkzeuge, Berechtigungen, Sandbox, Repository-Struktur, Prüfer, Protokolle | Arbeitsregeln, Werkzeugschnittstellen, Tests und CI, Runbooks | Reproduzierbarkeit, Sicherheit, Prüfbarkeit, Wiederherstellbarkeit |\n| Agentisches Engineering | Wer entscheidet in welchem Umfang über die nächste Aktion? | Ziele, Pläne, Werkzeugauswahl, Zustandsübergänge, Delegation | Agentenschleifen, Orchestrierung, Genehmigungspunkte | Aufgabenerfüllungsquote, angemessene Werkzeugauswahl, Quote menschlicher Eingriffe |\n| Loop-Engineering | Wie lässt sich konvergieren, wenn das erste Ergebnis falsch ist? | Generierung, Bewertung, Ursachenklassifizierung, Korrektur, erneute Ausführung, Abbruchbedingungen | Prüfer, Regressionstests, Wiederholungsrichtlinien, Fehlerklassifizierung | Erfolgsquote im ersten Durchlauf, Wiederherstellungsquote, Anzahl der Iterationen, endgültige Erfolgsquote |\n\nDie fünf Konzepte lassen sich in einem Satz wie folgt verbinden.\n\n**Eine Anfrage formulieren → die erforderlichen Informationen zeigen → eine sichere Arbeitsumgebung bereitstellen → die KI die nächste Aktion auswählen lassen → das Ergebnis prüfen und verbessern, bis es die Kriterien erfüllt.**\n\n### Hinweise zur Interpretation der Begriffe\n\nPrompt-Engineering und Agenten sind relativ weit verbreitete Begriffe, während der Anwendungsbereich von Harness-Engineering je nach Kontext noch variiert. Manche Beiträge bezeichnen nahezu alle Ausführungsebenen außer dem Modell als Harness, andere grenzen den Begriff auf die Regeln, Prüfungen und Feedbackstrukturen ein, die Nutzer von Coding-Agenten außerhalb eines Repositorys erstellen. Auch „Loop-Engineering“ sollte nicht als formale, durch einen einheitlichen Standard festgelegte Klassifizierung verstanden werden, sondern vielmehr als praxisorientierte Bezeichnung für die Gestaltung von Generierung und Prüfung als geschlossenen Feedbackprozess.\n\n## 1. Prompt-Engineering: Die Qualität von Anweisungen gestalten\n\nPrompt-Engineering ist die Arbeit, Anweisungen an ein Modell klar und überprüfbar zu machen. Seine sichtbarste Wirkung zeigt sich häufig bei einer einzelnen Anfrage und Antwort, es lässt sich jedoch auch auf Systemnachrichten oder Regeln für mehrstufige Gespräche anwenden.\n\nEin guter Prompt trennt in der Regel die folgenden Elemente:\n\n- **Ziel:** Was muss abgeschlossen werden?\n- **Eingabe:** Was soll analysiert werden, und wo liegen die Grenzen der Eingabe?\n- **Einschränkungen:** Was darf nicht getan werden, was ist zulässig, und welche Länge und welches Format gelten?\n- **Ausgabevertrag:** Struktur des Ergebnisses, etwa JSON, Tabelle oder Code-Patch\n- **Erfolgskriterien:** Welche Bedingungen müssen erfüllt sein, damit das Ergebnis als korrekt gilt?\n- **Umgang mit Unsicherheit:** Was ist zu tun, wenn Informationen fehlen oder miteinander im Konflikt stehen?\n- **Beispiele:** Repräsentative Ein- und Ausgaben, die das erwartete Verhalten zeigen\n\nEine Vorlage für die Praxis kann so einfach beginnen:\n\n```text\nZiel:\nEingabe:\nEinschränkungen:\nAusgabeformat:\nErfolgskriterien:\nPrüfmethode:\nUmgang mit Unsicherheit:\nRepräsentatives Beispiel:\n```\n\nWichtig ist, vor der Überarbeitung des Prompts zunächst Erfolgskriterien und empirische Testmethoden zu definieren. Nicht jeder Fehler lässt sich durch eine Änderung des Prompts beheben. Kosten, Latenz, Werkzeugfehler oder die Auswahl falscher Materialien können Probleme anderer Ebenen sein.\n\n### Probleme, die Prompt-Engineering gut lösen kann\n\n- Häufige Fehler im Ausgabeformat\n- Unklare Prioritäten von Anweisungen\n- Aufgaben wie Klassifizierung, Extraktion, Transformation oder Zusammenfassung mit relativ klaren Ein- und Ausgaben\n- Probleme, deren Leistung sich durch repräsentative Beispiele stabilisiert\n\n### Probleme, die sich nur schwer allein mit Prompts lösen lassen\n\n- Erforderliche Fakten oder Dateien fehlen in der Eingabe\n- Veraltete oder widersprüchliche Dokumente sind vermischt\n- Externe Systeme müssen sicher abgefragt oder geändert werden\n- Mehrstufige Ausführungszustände und Fehlerbehebungen sind erforderlich\n- Es gibt keine Möglichkeit, die Korrektheit eines Ergebnisses objektiv zu prüfen\n\n## 2. Kontext-Engineering: Die Informationen gestalten, die die KI sieht\n\nKontext-Engineering bezeichnet die Auswahl, Anordnung, Komprimierung und Aktualisierung sämtlicher Informationen, die einem Modell zum Zeitpunkt der Antwortgenerierung zur Verfügung stehen. Der Kontext kann neben dem Prompt auch Systemanweisungen, Nutzeranfragen, den Gesprächsverlauf, abgerufene Dokumente, Speicher, Werkzeugbeschreibungen, Ergebnisse von Werkzeugausführungen, die aktuelle Uhrzeit, den Berechtigungsstatus und den Arbeitsfortschritt umfassen.\n\nDa das Kontextfenster begrenzt ist, geht es nicht darum, „möglichst viel einzufügen“, sondern darum, **die erforderlichen Informationen zum richtigen Zeitpunkt bereitzustellen**. Anthropic beschreibt Kontext als wichtige, aber begrenzte Ressource eines Agenten und empfiehlt für längere Interaktionen Strategien wie einen minimalen Werkzeugsatz, repräsentative Beispiele, Laufzeitabruf, Komprimierung und Speicher.\n\n### Zentrale Entwurfsprinzipien\n\n1. **Relevanz zuerst:** Nur Informationen einfügen, die für den aktuellen Schritt erforderlich sind.\n2. **Quelle und Aktualität:** Erstellungszeitpunkt, Version, Eigentümer und Vertrauenswürdigkeit eines Dokuments gemeinsam verwalten.\n3. **Abruf bei Bedarf:** Nicht alle Materialien vorab einspeisen, sondern bei Bedarf aus Dateien, DBs oder Suchsystemen abrufen.\n4. **Informationshierarchie:** Feste Regeln, aktuelle Aufgabe, Referenzmaterialien und Werkzeugergebnisse voneinander trennen.\n5. **Konfliktbehandlung:** Wenn Materialien voneinander abweichen, Prioritäten und maßgebliche Originalquelle angeben.\n6. **Komprimierung und Zustandserhalt:** Ältere Gespräche zusammenfassen, ohne Entscheidungen, ungelöste Fragen und Beleglinks zu verlieren.\n7. **Trennung von Anweisungen und Daten:** Grenzen festlegen, damit Sätze auf Webseiten oder in Dokumenten nicht wie Systembefehle behandelt werden.\n\n### Beispiel\n\nWenn eine KI im Kundensupport Fragen zu Rückerstattungsrichtlinien beantwortet, reicht es nicht aus, lediglich den Prompt „Antworte präzise“ zu verstärken. Richtiges Kontext-Engineering ruft das Land des Kunden, das Kaufdatum, den Produkttyp, die aktuelle Version der Richtlinie, Ausnahmeregelungen und den Bestellstatus zum erforderlichen Zeitpunkt ab, stellt diese Informationen gemeinsam bereit und macht die für die Antwort verwendeten Richtlinienklauseln nachvollziehbar.\n\n## 3. Harness-Engineering: Die Arbeitsumgebung der KI gestalten\n\nEin Harness ist das Ausführungsgerüst, das die Intelligenz eines Modells mit realer Arbeit verbindet. Harness-Engineering gestaltet die Arbeitsumgebung so, dass häufige Fehler der KI durch Dokumente, Werkzeuge, Berechtigungen, Strukturen, automatische Prüfungen und Feedback verhindert oder frühzeitig erkannt werden.\n\n### Hauptkomponenten eines Harness\n\n| Komponente | Funktion | Beispiel |\n|---|---|---|\n| Arbeitsanweisungen | Verfahren und Verbote für wiederkehrende Aufgaben festlegen | `AGENTS.md`, Runbooks, Checklisten |\n| Wissensstruktur | Der KI das einfache Auffinden erforderlicher Materialien ermöglichen | Repository-Übersicht, ADR, Glossar, Beispielsammlung |\n| Werkzeugschnittstelle | Ein- und Ausgaben von Aktionen eindeutig begrenzen | Dateisuche, DB-Abfrage, Codeausführung, Deployment-API |\n| Ausführungsumgebung | Fehler isolieren und Reproduzierbarkeit erhöhen | Sandbox, Container, festgelegte Abhängigkeiten |\n| Prüfer | Automatisch kontrollieren, ob Ergebnisse die Kriterien erfüllen | Schemaprüfung, Unit-Tests, Linter, Richtlinienprüfung |\n| Berechtigungen und Genehmigungen | Riskante Aktionen begrenzen | Minimale Berechtigungen, Trennung von Lese- und Schreibzugriff, menschliche Genehmigung |\n| Beobachtbarkeit | Aufzeichnen, was betrachtet und welche Aktion ausgeführt wurde | Traces, Protokolle, Aufzeichnungen von Werkzeugaufrufen, Kosten |\n| Wiederherstellungsstruktur | Nach einem Fehler sicher zurücksetzen und fortfahren | Checkpoints, Rollback, Budget für Wiederholungsversuche |\n\nDas Beispiel von OpenAI zum Harness-Engineering beschreibt die Rolle von Entwicklern nicht als bloßes Schreiben von Code, sondern als Gestaltung von Umgebung, Absicht, Repository-Wissen sowie Test-, Prüf-, Review- und Wiederherstellungsschleifen. Entscheidend ist nicht, die KI erneut aufzufordern, „sich mehr anzustrengen“, sondern fehlende Fähigkeiten und Signale ausdrücklich in die Umgebung einzubauen.\n\n### Beispiel für eine Materialstruktur\n\n```text\n/ai\n  /instructions   # Gemeinsame Regeln und rollenspezifische Anweisungen\n  /skills         # Verfahren für wiederkehrende Aufgaben\n  /examples       # Gute und schlechte Ergebnisse\n  /evals          # Bewertungsdaten und Bewertungsregeln\n  /policies       # Berechtigungs-, Sicherheits- und Genehmigungsrichtlinien\n  /runbooks       # Umgang mit Störungen und Ausnahmen\n```\n\nDiese Struktur ist nicht an sich die richtige Antwort. Entscheidend ist, ob die Materialien aktuell gehalten werden, wenige Duplikate und Konflikte enthalten, von der KI zum erforderlichen Zeitpunkt gefunden werden können und die Regeln in automatische Prüfungen münden.\n\n## 4. Agentisches Engineering: Ziele und Werkzeuge bereitstellen und die nächste Aktion delegieren\n\nAgentisches Engineering ist ein Entwurfsansatz, bei dem eine KI Ziele, Werkzeuge, Arbeitszustände und Randbedingungen erhält und innerhalb eines bestimmten Rahmens selbst die nächsten Schritte zur Zielerreichung auswählt.\n\nAnthropic unterscheidet **Workflows** als Systeme, die LLMs und Werkzeuge über vorab festgelegte Codepfade koordinieren, von **Agenten** als Systemen, in denen das Modell seinen eigenen Prozess und den Einsatz von Werkzeugen dynamisch bestimmt. Auch OpenAI beschreibt Agenten als Systeme, in denen ein LLM die Ausführung eines Workflows verwaltet und Werkzeuge zur Interaktion mit externen Systemen dynamisch auswählt.\n\n### Grundlegende Agentenschleife\n\n1. Aktuelles Ziel und aktuellen Zustand beobachten.\n2. Das nächste Teilziel oder die nächste Aktion planen.\n3. Ein Werkzeug auswählen und ausführen.\n4. Ergebnis und Veränderungen der Umgebung überprüfen.\n5. Zwischen Abschluss, Korrektur, Wiederholung und Übergabe an einen Menschen entscheiden.\n\n### Fälle, in denen Agenten geeignet sind\n\n- Die Reihenfolge der Arbeitsschritte variiert je nach Eingabe\n- Unstrukturierte Informationen wie natürliche Sprache, Dokumente oder Code müssen interpretiert werden\n- Mehrere Werkzeuge müssen selektiv eingesetzt werden\n- Der Plan muss anhand von Zwischenergebnissen geändert werden\n- Die Fehlerursachen sind vielfältig und eine Wiederherstellung ist bis zu einem gewissen Grad möglich\n\n### Fälle, in denen Agenten überdimensioniert sind\n\n- Einfache Automatisierung mit festen Regeln und fester Reihenfolge\n- Aufgaben, die sich zuverlässig mit einem einzelnen API-Aufruf oder SQL lösen lassen\n- Aufgaben ohne Prüfmechanismus und mit sehr hohen Fehlerkosten\n- Strukturen, die schwer rückgängig zu machende Aktionen wie Zahlungen, Löschungen oder Deployments ohne Genehmigung ausführen\n- Multi-Agenten-Strukturen, die lediglich Rollen vermehren, obwohl ein einzelner Agent ausreicht\n\nAutonomie ist keine binäre Entscheidung. Sie kann in unterstützende Systeme, die nur Empfehlungen geben, ausführende Systeme mit begrenzten Lese- und Schreibrechten, überwachte Systeme mit Genehmigungen bei wichtigen Schritten und hochautonome Systeme unterteilt werden, die über längere Zeit in Bereichen mit geringem Risiko arbeiten. Sie sollte entsprechend dem Geschäftsrisiko und der Prüffähigkeit schrittweise erweitert werden.\n\n## 5. Loop-Engineering: Einen überprüfbaren Verbesserungsprozess gestalten\n\nLoop-Engineering ist nicht bloß ein erneuter Versuch. Es gestaltet **Generierung → Prüfung → Analyse der Fehlerursache → Auswahl einer Korrekturstrategie → erneute Ausführung → Entscheidung über den Abbruch** als explizites geschlossenes Feedbacksystem.\n\n### Bestandteile einer ordnungsgemäßen Schleife\n\n1. **Kandidatengenerierung:** Einen Entwurf, Code, Plan oder das Ergebnis einer Datentransformation erstellen.\n2. **Prüfung:** Tests, Schemas, Referenzdaten, Richtlinien und Nachweise prüfen.\n3. **Ursachenklassifizierung:** Zwischen Anweisungsfehlern, fehlendem Kontext, Werkzeugfehlern, Implementierungsfehlern und Fehlern des Prüfers unterscheiden.\n4. **Korrektur:** Die kleinste zur Fehlerursache passende Änderung anwenden.\n5. **Erneute Ausführung:** Nicht alles von Anfang an wiederholen, sondern beim erforderlichen Schritt neu beginnen.\n6. **Abbruch:** Bei erfolgreicher Prüfung, maximaler Iterationszahl, Kostenlimit, Zeitlimit oder Unsicherheitsschwelle stoppen.\n7. **Regressionsschutz:** Prüfen, ob eine neue Änderung bestehende Erfolgsfälle beschädigt hat.\n\nDie Bewertung von Agenten ist komplexer als eine Bewertung einzelner Interaktionen, die nur Ein- und Ausgabe betrachtet. Da Agenten Werkzeuge mehrfach aufrufen und den Zustand der Umgebung verändern, müssen neben dem Endergebnis auch der Prozess und die Veränderungen der Umgebung geprüft werden. Der Kern automatischer Bewertungen besteht darin, eine Eingabe bereitzustellen und eine Bewertungslogik auf die Ausgabe oder den veränderten Zustand anzuwenden.\n\n### Prioritäten bei Prüfern\n\n- **Deterministische Prüfung:** Kompilierung, Unit-Tests, Schemas, mathematische Einschränkungen, Berechtigungsprüfung\n- **Referenzbasierte Prüfung:** Referenzdaten, Zitate aus Originalquellen, Datenbankabgleich\n- **Regelbasierte Prüfung:** Verbotene Wörter, Pflichtfelder, Richtlinienbedingungen\n- **Modellbasierte Bewertung:** Schwer zu formalisierende Kriterien wie Stil, Bedeutungserhalt und Gesamtqualität\n- **Menschliche Bewertung:** Hochriskante Entscheidungen, Angemessenheit des Ziels selbst, Genehmigung von Ausnahmen\n\nWenn möglich, sollten zuerst deterministische Prüfungen verwendet werden. Ein Modell sollte seine eigenen Ergebnisse nicht ausschließlich durch eine Modellbewertung selbst benoten. Bei Modellbewertungen sollten zugleich Bewertungskriterien, Beispiele, Prüfungen auf Verzerrungen und stichprobenartige menschliche Kontrollen eingesetzt werden.\n\n## Die fünf Ansätze sind Ebenen und keine Ersatzlösungen\n\nIn realen Systemen wirken alle fünf Ansätze zusammen.\n\n- Der Prompt erstellt den **Vertrag für die aktuelle Aktion**.\n- Der Kontext liefert **den für die Entscheidung erforderlichen Zustand und die Nachweise**.\n- Der Harness stellt **eine handlungsfähige Umgebung und Sicherheitsmechanismen** bereit.\n- Das agentische Design verteilt **die Entscheidungsbefugnis über die nächste Aktion**.\n- Das Loop-Design **erkennt Fehler und lässt die Qualität konvergieren**.\n\nDaher sind Auffassungen wie „Kontext-Engineering hat Prompt-Engineering ersetzt“ oder „Mit Agenten sind keine Workflows mehr nötig“ unzutreffend. Eine breitere Ebene schließt eine engere lediglich ein oder nutzt sie, und bei einfachen Problemen kann ein einfaches Design stabiler sein.\n\n## Praxisbeispiel: Ein KI-Coding-System zur Fehlerbehebung\n\nNehmen wir an, eine KI soll den Fehler „Nach der Anmeldung tritt nur bei bestimmten Nutzern ein 500-Fehler auf“ beheben.\n\n### Prompt-Engineering\n\n- Überprüfe die Bedingungen zur Reproduktion des Fehlers.\n- Ändere die öffentliche API nicht.\n- Löse das Problem mit einer minimalen Änderung.\n- Berichte nach der Korrektur über die Testergebnisse und verbleibende Risiken.\n\n### Kontext-Engineering\n\n- Problembeschreibung und Fehlerprotokolle\n- Zugehörige Request-Trace-ID\n- Dateien zur Authentifizierung und zum Nutzermodell\n- Kürzlich vorgenommene Änderungen\n- Architekturregeln und Coding-Standards\n- Fehlgeschlagene Tests und Informationen zur Ausführungsumgebung\n\n### Harness-Engineering\n\n- Werkzeuge für Repository-Suche, Lesen und Bearbeiten von Dateien sowie Testausführung\n- Isolierter Branch und Sandbox\n- Formatter, Linter, Unit- und Integrationstests\n- Bereiche mit Änderungsverbot und Berechtigungsrichtlinien\n- Protokolle aller Befehle und Dateiänderungen\n- Rollback und Checkpoints bei Fehlern\n\n### Agentisches Engineering\n\nDie KI wählt je nach Situation die Reihenfolge von Reproduktion, Hypothesenbildung, Suche im relevanten Code, Patch, Tests und Zusammenfassung der Ergebnisse. Deployments oder Datenänderungen erfordern jedoch eine menschliche Genehmigung.\n\n### Loop-Engineering\n\nWenn ein Test fehlschlägt, wird nicht derselbe Befehl wiederholt, sondern der Fehlertyp klassifiziert. Bei fehlgeschlagener Reproduktion wird die Kontexterfassung ergänzt, bei einer Regression der Patch verkleinert und bei einem Umgebungsfehler werden Abhängigkeiten und Konfiguration wiederhergestellt. Der Vorgang endet, wenn alle erforderlichen Tests bestanden sind und die Begründung der Änderungen dokumentiert ist.\n\n## Anhand von Problemsymptomen den erforderlichen Engineering-Ansatz ermitteln\n\n| Symptom | Vorrangig zu prüfender Bereich |\n|---|---|\n| Ausgabeformat oder Schreibstil weichen häufig ab | Prompt |\n| Für die Antwort erforderliche Fakten oder Dateien fehlen | Kontext |\n| Es werden falsche Werkzeuge ausgewählt oder gefährliche Befehle ausgeführt | Harness- und Berechtigungsdesign |\n| Es gibt viele Varianten, die sich schwer in einer festen Reihenfolge verarbeiten lassen | Agentisches Design |\n| Das erste Ergebnis ist häufig falsch, lässt sich aber automatisch beurteilen | Schleife und Prüfer |\n| Die Fehlerursache ist unbekannt und schwer reproduzierbar | Beobachtbarkeit des Harness |\n| Mit jeder Wiederholung steigen nur die Kosten, ohne dass die Qualität besser wird | Ursachenklassifizierung, Prüfsignale, Abbruchbedingungen |\n| Je mehr Materialien vorliegen, desto schlechter wird die Antwort | Kontextbereinigung und Abrufrichtlinien |\n\n## Empfohlene Implementierungsreihenfolge\n\n### Schritt 1: Zuerst Erfolgskriterien und ein Bewertungsset erstellen\n\nRepräsentative Aufgaben, schwierige Fälle und verbotene Fälle sammeln und definieren, wie Ergebnisse beurteilt werden. Wenn keine Referenzdaten vorhanden sind, zumindest Schemas, erforderliche Nachweise, Richtlinieneinhaltung und Kriterien für menschliche Bewertungen festlegen.\n\n### Schritt 2: Eine Baseline für einen einzelnen Aufruf erstellen\n\nMit dem einfachsten Prompt und dem minimal erforderlichen Kontext Leistung, Kosten und Latenz messen. Werden Agenten ohne Baseline eingeführt, lässt sich die Wirkung der zusätzlichen Komplexität nur schwer bestimmen.\n\n### Schritt 3: Die Kontextbereitstellung instrumentieren\n\nAufzeichnen, welche Dokumente und Werkzeugergebnisse einbezogen wurden, wie alt sie sind und ob sie tatsächlich in der Antwort verwendet wurden. Zwischen fehlgeschlagenem Abruf und übermäßigem Kontext unterscheiden.\n\n### Schritt 4: Einen minimalen Harness erstellen\n\nDie Anzahl der Werkzeuge reduzieren und ihre Namen und Eingaben eindeutig gestalten. Sandbox, minimale Berechtigungen, automatische Tests, Protokolle und Checkpoints priorisieren.\n\n### Schritt 5: Begrenzte Autonomie gewähren\n\nEinen einzelnen Agenten zunächst risikoarme, überwiegend lesende Aufgaben ausführen lassen. Abbruch- und Übergabebedingungen für Menschen ausdrücklich festlegen und Schreib-, Lösch-, Zahlungs- und Deployment-Berechtigungen separat genehmigen.\n\n### Schritt 6: Die Prüf- und Wiederherstellungsschleife schließen\n\nFehlerklassifizierung, Korrekturstrategie, maximale Iterationszahl, Kostenlimit und Regressionstests miteinander verbinden. Werkzeuge und Autonomiebereich erst erweitern, nachdem sich die Erfolgsquote stabilisiert hat.\n\n## Betriebskennzahlen\n\nDa es keine universellen Zielwerte gibt, müssen die Kriterien entsprechend dem Geschäftsrisiko und den Kosten festgelegt werden.\n\n| Kennzahl | Bedeutung |\n|---|---|\n| Aufgabenerfüllungsquote | Anteil der Aufgaben, die die endgültigen Erfolgskriterien erfüllen |\n| Erfolgsquote im ersten Durchlauf | Anteil der Aufgaben, die ohne iterative Korrekturen sofort erfolgreich sind |\n| Wiederherstellungsquote | Anteil der Aufgaben, die nach dem ersten Fehler durch die Schleife erfolgreich werden |\n| Durchschnittliche Iterationszahl | Anzahl der bis zum Erfolg oder Abbruch erforderlichen Zyklen |\n| Fehlerquote bei der Werkzeugauswahl | Anteil unangemessener oder unnötiger Werkzeugaufrufe |\n| Vollständigkeit der Nachweise | Anteil zentraler Aussagen mit nachvollziehbaren Quellen |\n| Quote menschlicher Eingriffe | Anteil der Fälle, die Genehmigung, Korrektur oder erneute Anweisung erforderten |\n| Kosten und Latenz pro erfolgreicher Einheit | Ressourcen, die zum Abschluss einer erfolgreichen Aufgabe erforderlich waren |\n| Anzahl der Sicherheitsvorfälle | Anzahl von Berechtigungsverstößen, fehlerhaften Schreibvorgängen und irreversiblen Aktionen |\n| Regressionsfehlerquote | Anteil neuer Änderungen, die bestehende Erfolgsfälle beschädigen |\n\n## Häufige Entwurfsfehler\n\n| Bereich | Fehler | Verbesserungsmethode |\n|---|---|---|\n| Prompt | Alle Ausnahmen werden in einem Satz angehäuft | Regeln strukturieren und repräsentative Beispiele von der Bewertung trennen |\n| Prompt | Ohne Erfolgskriterien wird angewiesen, etwas „gut zu verfassen“ | Format, Pflichtinhalte, Verbote und Beurteilungskriterien angeben |\n| Kontext | Alle irrelevanten Dokumente werden einbezogen | Laufzeitabruf und schrittweisen Kontext verwenden |\n| Kontext | Veraltete und aktuelle Richtlinien werden gemeinsam bereitgestellt | Version, Gültigkeitsdatum und maßgebliche Originalquelle verwalten |\n| Harness | Viele Werkzeuge mit sich überschneidenden Funktionen werden bereitgestellt | Einen minimalen Werkzeugsatz und eindeutige Parameter gestalten |\n| Harness | Es fehlen Schreibberechtigungen und Möglichkeiten zum Rückgängigmachen | Minimale Berechtigungen, Sandbox und Checkpoints einrichten |\n| Agentisch | Von Anfang an wird ein Multi-Agenten-System erstellt | Zunächst einen einzelnen Agenten und deterministische Workflows validieren |\n| Agentisch | Die Ausführung wird ohne Abschlussbedingung fortgesetzt | Explizite Abbruch-, Budget- und Übergabebedingungen festlegen |\n| Schleife | Dieselbe Anfrage wird unverändert wiederholt | Fehlerursache klassifizieren und Korrekturpunkt ändern |\n| Schleife | Ein einziges generatives Modell bewertet alle Ergebnisse selbst | Deterministische Prüfungen, Referenzabgleiche und menschliche Stichprobenkontrollen kombinieren |\n\n## Implementierungscheckliste\n\n- [ ] Lassen sich die Erfolgskriterien, soweit möglich, nicht nur sprachlich, sondern auch maschinell prüfen?\n- [ ] Sind die Prioritäten von Prompt, Referenzmaterialien und Werkzeugergebnissen getrennt?\n- [ ] Lassen sich Quelle, Version, Gültigkeitsdatum und Eigentümer von Dokumenten nachverfolgen?\n- [ ] Sind Werkzeugnamen und Parameter eindeutig und überschneiden sich nicht?\n- [ ] Sind Berechtigungen für Lesen, Schreiben, Löschen, Bezahlen und Deployment nach Risikostufe getrennt?\n- [ ] Gibt es eine Sandbox zur Isolierung von Fehlern und Mittel zum Rückgängigmachen?\n- [ ] Werden alle wichtigen Aktionen und Werkzeugaufrufe in reproduzierbarer Form aufgezeichnet?\n- [ ] Gibt es externe Prüfer wie Tests, Schemas und Richtlinienprüfungen?\n- [ ] Sind maximale Iterationszahl, Kosten, Zeit und Bedingungen für die Übergabe an Menschen definiert?\n- [ ] Gibt es eine Regressionsbewertung, die sicherstellt, dass neue Verbesserungen bestehende Fälle nicht beschädigen?\n\n## Fazit\n\nEin gutes KI-System ist nicht das System mit dem längsten Prompt. Es ist ein System, das unterscheidet, ob ein Fehler bei **Anweisung**, **Information**, **Umgebung**, **Entscheidungsfindung** oder **Prüfung und Wiederherstellung** aufgetreten ist, und auf der jeweiligen Ebene die einfachste Lösung einsetzt. Ein stabiler Ansatz besteht darin, zunächst Erfolgskriterien und eine Baseline für einzelne Aufrufe zu schaffen, Kontext und Harness nur im erforderlichen Umfang zu ergänzen und anschließend Autonomie und iterative Schleifen innerhalb eines überprüfbaren Rahmens zu erweitern.","content_html":"\u003cp\u003eWenn alle Maßnahmen zur Verbesserung der Qualität generativer KI unter „gute Prompts schreiben“ zusammengefasst werden, lassen sich die Ursachen von Fehlern nur schwer präzise diagnostizieren. Prompt-, Kontext-, Harness-, agentische und Loop-Engineering sind keine austauschbaren Modebegriffe, sondern ergänzende Entwurfsansätze, die unterschiedliche Steuerungsebenen behandeln: \u003cstrong\u003eFormulierung von Anfragen, Auswahl von Informationen, Ausführungsumgebung, autonome Entscheidungsfindung und iterative Verbesserung\u003c/strong\u003e.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#kerndefinitionen-der-f%C3%BCnf-konzepte\" class=\"anchor\" id=\"kerndefinitionen-der-fünf-konzepte\"\u003e\u003c/a\u003eKerndefinitionen der fünf Konzepte\u003c/h2\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eKategorie\u003c/th\u003e\n\u003cth\u003eKernfrage\u003c/th\u003e\n\u003cth\u003eZentrale Entwurfsobjekte\u003c/th\u003e\n\u003cth\u003eTypische Ergebnisse\u003c/th\u003e\n\u003cth\u003eTypische Erfolgskriterien\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Kategorie\"\u003ePrompt-Engineering\u003c/td\u003e\n\u003ctd data-label=\"Kernfrage\"\u003eWie soll die KI angewiesen werden, eine Aufgabe auszuführen?\u003c/td\u003e\n\u003ctd data-label=\"Zentrale Entwurfsobjekte\"\u003eAnweisungen, Einschränkungen, Beispiele, Ausgabeformat\u003c/td\u003e\n\u003ctd data-label=\"Typische Ergebnisse\"\u003ePrompt-Vorlagen, Beispieleingaben und -ausgaben\u003c/td\u003e\n\u003ctd data-label=\"Typische Erfolgskriterien\"\u003eBefolgungsquote von Anweisungen, Formatgenauigkeit, Qualität des ersten Ergebnisses\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Kategorie\"\u003eKontext-Engineering\u003c/td\u003e\n\u003ctd data-label=\"Kernfrage\"\u003eWas soll der KI jetzt gezeigt werden?\u003c/td\u003e\n\u003ctd data-label=\"Zentrale Entwurfsobjekte\"\u003eSystemanweisungen, abgerufene Dokumente, Gesprächsstatus, Speicher, Werkzeugergebnisse\u003c/td\u003e\n\u003ctd data-label=\"Typische Ergebnisse\"\u003eRegeln für die Kontextzusammenstellung, Abruf- und Zusammenfassungsrichtlinien\u003c/td\u003e\n\u003ctd data-label=\"Typische Erfolgskriterien\"\u003eRelevanz, Aktualität, Nachweisbarkeit, Token-Effizienz\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Kategorie\"\u003eHarness-Engineering\u003c/td\u003e\n\u003ctd data-label=\"Kernfrage\"\u003eWelche Arbeitsumgebung erschwert es der KI, Fehler zu machen?\u003c/td\u003e\n\u003ctd data-label=\"Zentrale Entwurfsobjekte\"\u003eWerkzeuge, Berechtigungen, Sandbox, Repository-Struktur, Prüfer, Protokolle\u003c/td\u003e\n\u003ctd data-label=\"Typische Ergebnisse\"\u003eArbeitsregeln, Werkzeugschnittstellen, Tests und CI, Runbooks\u003c/td\u003e\n\u003ctd data-label=\"Typische Erfolgskriterien\"\u003eReproduzierbarkeit, Sicherheit, Prüfbarkeit, Wiederherstellbarkeit\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Kategorie\"\u003eAgentisches Engineering\u003c/td\u003e\n\u003ctd data-label=\"Kernfrage\"\u003eWer entscheidet in welchem Umfang über die nächste Aktion?\u003c/td\u003e\n\u003ctd data-label=\"Zentrale Entwurfsobjekte\"\u003eZiele, Pläne, Werkzeugauswahl, Zustandsübergänge, Delegation\u003c/td\u003e\n\u003ctd data-label=\"Typische Ergebnisse\"\u003eAgentenschleifen, Orchestrierung, Genehmigungspunkte\u003c/td\u003e\n\u003ctd data-label=\"Typische Erfolgskriterien\"\u003eAufgabenerfüllungsquote, angemessene Werkzeugauswahl, Quote menschlicher Eingriffe\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Kategorie\"\u003eLoop-Engineering\u003c/td\u003e\n\u003ctd data-label=\"Kernfrage\"\u003eWie lässt sich konvergieren, wenn das erste Ergebnis falsch ist?\u003c/td\u003e\n\u003ctd data-label=\"Zentrale Entwurfsobjekte\"\u003eGenerierung, Bewertung, Ursachenklassifizierung, Korrektur, erneute Ausführung, Abbruchbedingungen\u003c/td\u003e\n\u003ctd data-label=\"Typische Ergebnisse\"\u003ePrüfer, Regressionstests, Wiederholungsrichtlinien, Fehlerklassifizierung\u003c/td\u003e\n\u003ctd data-label=\"Typische Erfolgskriterien\"\u003eErfolgsquote im ersten Durchlauf, Wiederherstellungsquote, Anzahl der Iterationen, endgültige Erfolgsquote\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eDie fünf Konzepte lassen sich in einem Satz wie folgt verbinden.\u003c/p\u003e\n\u003cp\u003e\u003cstrong\u003eEine Anfrage formulieren → die erforderlichen Informationen zeigen → eine sichere Arbeitsumgebung bereitstellen → die KI die nächste Aktion auswählen lassen → das Ergebnis prüfen und verbessern, bis es die Kriterien erfüllt.\u003c/strong\u003e\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#hinweise-zur-interpretation-der-begriffe\" class=\"anchor\" id=\"hinweise-zur-interpretation-der-begriffe\"\u003e\u003c/a\u003eHinweise zur Interpretation der Begriffe\u003c/h3\u003e\n\u003cp\u003ePrompt-Engineering und Agenten sind relativ weit verbreitete Begriffe, während der Anwendungsbereich von Harness-Engineering je nach Kontext noch variiert. Manche Beiträge bezeichnen nahezu alle Ausführungsebenen außer dem Modell als Harness, andere grenzen den Begriff auf die Regeln, Prüfungen und Feedbackstrukturen ein, die Nutzer von Coding-Agenten außerhalb eines Repositorys erstellen. Auch „Loop-Engineering“ sollte nicht als formale, durch einen einheitlichen Standard festgelegte Klassifizierung verstanden werden, sondern vielmehr als praxisorientierte Bezeichnung für die Gestaltung von Generierung und Prüfung als geschlossenen Feedbackprozess.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#1-prompt-engineering-die-qualit%C3%A4t-von-anweisungen-gestalten\" class=\"anchor\" id=\"1-prompt-engineering-die-qualität-von-anweisungen-gestalten\"\u003e\u003c/a\u003e1. Prompt-Engineering: Die Qualität von Anweisungen gestalten\u003c/h2\u003e\n\u003cp\u003ePrompt-Engineering ist die Arbeit, Anweisungen an ein Modell klar und überprüfbar zu machen. Seine sichtbarste Wirkung zeigt sich häufig bei einer einzelnen Anfrage und Antwort, es lässt sich jedoch auch auf Systemnachrichten oder Regeln für mehrstufige Gespräche anwenden.\u003c/p\u003e\n\u003cp\u003eEin guter Prompt trennt in der Regel die folgenden Elemente:\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e\n\u003cstrong\u003eZiel:\u003c/strong\u003e Was muss abgeschlossen werden?\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eEingabe:\u003c/strong\u003e Was soll analysiert werden, und wo liegen die Grenzen der Eingabe?\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eEinschränkungen:\u003c/strong\u003e Was darf nicht getan werden, was ist zulässig, und welche Länge und welches Format gelten?\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eAusgabevertrag:\u003c/strong\u003e Struktur des Ergebnisses, etwa JSON, Tabelle oder Code-Patch\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eErfolgskriterien:\u003c/strong\u003e Welche Bedingungen müssen erfüllt sein, damit das Ergebnis als korrekt gilt?\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eUmgang mit Unsicherheit:\u003c/strong\u003e Was ist zu tun, wenn Informationen fehlen oder miteinander im Konflikt stehen?\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eBeispiele:\u003c/strong\u003e Repräsentative Ein- und Ausgaben, die das erwartete Verhalten zeigen\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eEine Vorlage für die Praxis kann so einfach beginnen:\u003c/p\u003e\n\u003cpre\u003e\u003ccode\u003e\u003cspan\u003eZiel:\n\u003c/span\u003e\u003cspan\u003eEingabe:\n\u003c/span\u003e\u003cspan\u003eEinschränkungen:\n\u003c/span\u003e\u003cspan\u003eAusgabeformat:\n\u003c/span\u003e\u003cspan\u003eErfolgskriterien:\n\u003c/span\u003e\u003cspan\u003ePrüfmethode:\n\u003c/span\u003e\u003cspan\u003eUmgang mit Unsicherheit:\n\u003c/span\u003e\u003cspan\u003eRepräsentatives Beispiel:\n\u003c/span\u003e\u003c/code\u003e\u003c/pre\u003e\n\u003cp\u003eWichtig ist, vor der Überarbeitung des Prompts zunächst Erfolgskriterien und empirische Testmethoden zu definieren. Nicht jeder Fehler lässt sich durch eine Änderung des Prompts beheben. Kosten, Latenz, Werkzeugfehler oder die Auswahl falscher Materialien können Probleme anderer Ebenen sein.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#probleme-die-prompt-engineering-gut-l%C3%B6sen-kann\" class=\"anchor\" id=\"probleme-die-prompt-engineering-gut-lösen-kann\"\u003e\u003c/a\u003eProbleme, die Prompt-Engineering gut lösen kann\u003c/h3\u003e\n\u003cul\u003e\n\u003cli\u003eHäufige Fehler im Ausgabeformat\u003c/li\u003e\n\u003cli\u003eUnklare Prioritäten von Anweisungen\u003c/li\u003e\n\u003cli\u003eAufgaben wie Klassifizierung, Extraktion, Transformation oder Zusammenfassung mit relativ klaren Ein- und Ausgaben\u003c/li\u003e\n\u003cli\u003eProbleme, deren Leistung sich durch repräsentative Beispiele stabilisiert\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch3\u003e\n\u003ca href=\"#probleme-die-sich-nur-schwer-allein-mit-prompts-l%C3%B6sen-lassen\" class=\"anchor\" id=\"probleme-die-sich-nur-schwer-allein-mit-prompts-lösen-lassen\"\u003e\u003c/a\u003eProbleme, die sich nur schwer allein mit Prompts lösen lassen\u003c/h3\u003e\n\u003cul\u003e\n\u003cli\u003eErforderliche Fakten oder Dateien fehlen in der Eingabe\u003c/li\u003e\n\u003cli\u003eVeraltete oder widersprüchliche Dokumente sind vermischt\u003c/li\u003e\n\u003cli\u003eExterne Systeme müssen sicher abgefragt oder geändert werden\u003c/li\u003e\n\u003cli\u003eMehrstufige Ausführungszustände und Fehlerbehebungen sind erforderlich\u003c/li\u003e\n\u003cli\u003eEs gibt keine Möglichkeit, die Korrektheit eines Ergebnisses objektiv zu prüfen\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch2\u003e\n\u003ca href=\"#2-kontext-engineering-die-informationen-gestalten-die-die-ki-sieht\" class=\"anchor\" id=\"2-kontext-engineering-die-informationen-gestalten-die-die-ki-sieht\"\u003e\u003c/a\u003e2. Kontext-Engineering: Die Informationen gestalten, die die KI sieht\u003c/h2\u003e\n\u003cp\u003eKontext-Engineering bezeichnet die Auswahl, Anordnung, Komprimierung und Aktualisierung sämtlicher Informationen, die einem Modell zum Zeitpunkt der Antwortgenerierung zur Verfügung stehen. Der Kontext kann neben dem Prompt auch Systemanweisungen, Nutzeranfragen, den Gesprächsverlauf, abgerufene Dokumente, Speicher, Werkzeugbeschreibungen, Ergebnisse von Werkzeugausführungen, die aktuelle Uhrzeit, den Berechtigungsstatus und den Arbeitsfortschritt umfassen.\u003c/p\u003e\n\u003cp\u003eDa das Kontextfenster begrenzt ist, geht es nicht darum, „möglichst viel einzufügen“, sondern darum, \u003cstrong\u003edie erforderlichen Informationen zum richtigen Zeitpunkt bereitzustellen\u003c/strong\u003e. Anthropic beschreibt Kontext als wichtige, aber begrenzte Ressource eines Agenten und empfiehlt für längere Interaktionen Strategien wie einen minimalen Werkzeugsatz, repräsentative Beispiele, Laufzeitabruf, Komprimierung und Speicher.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#zentrale-entwurfsprinzipien\" class=\"anchor\" id=\"zentrale-entwurfsprinzipien\"\u003e\u003c/a\u003eZentrale Entwurfsprinzipien\u003c/h3\u003e\n\u003col\u003e\n\u003cli\u003e\n\u003cstrong\u003eRelevanz zuerst:\u003c/strong\u003e Nur Informationen einfügen, die für den aktuellen Schritt erforderlich sind.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eQuelle und Aktualität:\u003c/strong\u003e Erstellungszeitpunkt, Version, Eigentümer und Vertrauenswürdigkeit eines Dokuments gemeinsam verwalten.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eAbruf bei Bedarf:\u003c/strong\u003e Nicht alle Materialien vorab einspeisen, sondern bei Bedarf aus Dateien, DBs oder Suchsystemen abrufen.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eInformationshierarchie:\u003c/strong\u003e Feste Regeln, aktuelle Aufgabe, Referenzmaterialien und Werkzeugergebnisse voneinander trennen.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eKonfliktbehandlung:\u003c/strong\u003e Wenn Materialien voneinander abweichen, Prioritäten und maßgebliche Originalquelle angeben.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eKomprimierung und Zustandserhalt:\u003c/strong\u003e Ältere Gespräche zusammenfassen, ohne Entscheidungen, ungelöste Fragen und Beleglinks zu verlieren.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eTrennung von Anweisungen und Daten:\u003c/strong\u003e Grenzen festlegen, damit Sätze auf Webseiten oder in Dokumenten nicht wie Systembefehle behandelt werden.\u003c/li\u003e\n\u003c/ol\u003e\n\u003ch3\u003e\n\u003ca href=\"#beispiel\" class=\"anchor\" id=\"beispiel\"\u003e\u003c/a\u003eBeispiel\u003c/h3\u003e\n\u003cp\u003eWenn eine KI im Kundensupport Fragen zu Rückerstattungsrichtlinien beantwortet, reicht es nicht aus, lediglich den Prompt „Antworte präzise“ zu verstärken. Richtiges Kontext-Engineering ruft das Land des Kunden, das Kaufdatum, den Produkttyp, die aktuelle Version der Richtlinie, Ausnahmeregelungen und den Bestellstatus zum erforderlichen Zeitpunkt ab, stellt diese Informationen gemeinsam bereit und macht die für die Antwort verwendeten Richtlinienklauseln nachvollziehbar.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#3-harness-engineering-die-arbeitsumgebung-der-ki-gestalten\" class=\"anchor\" id=\"3-harness-engineering-die-arbeitsumgebung-der-ki-gestalten\"\u003e\u003c/a\u003e3. Harness-Engineering: Die Arbeitsumgebung der KI gestalten\u003c/h2\u003e\n\u003cp\u003eEin Harness ist das Ausführungsgerüst, das die Intelligenz eines Modells mit realer Arbeit verbindet. Harness-Engineering gestaltet die Arbeitsumgebung so, dass häufige Fehler der KI durch Dokumente, Werkzeuge, Berechtigungen, Strukturen, automatische Prüfungen und Feedback verhindert oder frühzeitig erkannt werden.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#hauptkomponenten-eines-harness\" class=\"anchor\" id=\"hauptkomponenten-eines-harness\"\u003e\u003c/a\u003eHauptkomponenten eines Harness\u003c/h3\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eKomponente\u003c/th\u003e\n\u003cth\u003eFunktion\u003c/th\u003e\n\u003cth\u003eBeispiel\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Komponente\"\u003eArbeitsanweisungen\u003c/td\u003e\n\u003ctd data-label=\"Funktion\"\u003eVerfahren und Verbote für wiederkehrende Aufgaben festlegen\u003c/td\u003e\n\u003ctd data-label=\"Beispiel\"\u003e\n\u003ccode\u003eAGENTS.md\u003c/code\u003e, Runbooks, Checklisten\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Komponente\"\u003eWissensstruktur\u003c/td\u003e\n\u003ctd data-label=\"Funktion\"\u003eDer KI das einfache Auffinden erforderlicher Materialien ermöglichen\u003c/td\u003e\n\u003ctd data-label=\"Beispiel\"\u003eRepository-Übersicht, ADR, Glossar, Beispielsammlung\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Komponente\"\u003eWerkzeugschnittstelle\u003c/td\u003e\n\u003ctd data-label=\"Funktion\"\u003eEin- und Ausgaben von Aktionen eindeutig begrenzen\u003c/td\u003e\n\u003ctd data-label=\"Beispiel\"\u003eDateisuche, DB-Abfrage, Codeausführung, Deployment-API\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Komponente\"\u003eAusführungsumgebung\u003c/td\u003e\n\u003ctd data-label=\"Funktion\"\u003eFehler isolieren und Reproduzierbarkeit erhöhen\u003c/td\u003e\n\u003ctd data-label=\"Beispiel\"\u003eSandbox, Container, festgelegte Abhängigkeiten\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Komponente\"\u003ePrüfer\u003c/td\u003e\n\u003ctd data-label=\"Funktion\"\u003eAutomatisch kontrollieren, ob Ergebnisse die Kriterien erfüllen\u003c/td\u003e\n\u003ctd data-label=\"Beispiel\"\u003eSchemaprüfung, Unit-Tests, Linter, Richtlinienprüfung\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Komponente\"\u003eBerechtigungen und Genehmigungen\u003c/td\u003e\n\u003ctd data-label=\"Funktion\"\u003eRiskante Aktionen begrenzen\u003c/td\u003e\n\u003ctd data-label=\"Beispiel\"\u003eMinimale Berechtigungen, Trennung von Lese- und Schreibzugriff, menschliche Genehmigung\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Komponente\"\u003eBeobachtbarkeit\u003c/td\u003e\n\u003ctd data-label=\"Funktion\"\u003eAufzeichnen, was betrachtet und welche Aktion ausgeführt wurde\u003c/td\u003e\n\u003ctd data-label=\"Beispiel\"\u003eTraces, Protokolle, Aufzeichnungen von Werkzeugaufrufen, Kosten\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Komponente\"\u003eWiederherstellungsstruktur\u003c/td\u003e\n\u003ctd data-label=\"Funktion\"\u003eNach einem Fehler sicher zurücksetzen und fortfahren\u003c/td\u003e\n\u003ctd data-label=\"Beispiel\"\u003eCheckpoints, Rollback, Budget für Wiederholungsversuche\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eDas Beispiel von OpenAI zum Harness-Engineering beschreibt die Rolle von Entwicklern nicht als bloßes Schreiben von Code, sondern als Gestaltung von Umgebung, Absicht, Repository-Wissen sowie Test-, Prüf-, Review- und Wiederherstellungsschleifen. Entscheidend ist nicht, die KI erneut aufzufordern, „sich mehr anzustrengen“, sondern fehlende Fähigkeiten und Signale ausdrücklich in die Umgebung einzubauen.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#beispiel-f%C3%BCr-eine-materialstruktur\" class=\"anchor\" id=\"beispiel-für-eine-materialstruktur\"\u003e\u003c/a\u003eBeispiel für eine Materialstruktur\u003c/h3\u003e\n\u003cpre\u003e\u003ccode\u003e\u003cspan\u003e/ai\n\u003c/span\u003e\u003cspan\u003e  /instructions   # Gemeinsame Regeln und rollenspezifische Anweisungen\n\u003c/span\u003e\u003cspan\u003e  /skills         # Verfahren für wiederkehrende Aufgaben\n\u003c/span\u003e\u003cspan\u003e  /examples       # Gute und schlechte Ergebnisse\n\u003c/span\u003e\u003cspan\u003e  /evals          # Bewertungsdaten und Bewertungsregeln\n\u003c/span\u003e\u003cspan\u003e  /policies       # Berechtigungs-, Sicherheits- und Genehmigungsrichtlinien\n\u003c/span\u003e\u003cspan\u003e  /runbooks       # Umgang mit Störungen und Ausnahmen\n\u003c/span\u003e\u003c/code\u003e\u003c/pre\u003e\n\u003cp\u003eDiese Struktur ist nicht an sich die richtige Antwort. Entscheidend ist, ob die Materialien aktuell gehalten werden, wenige Duplikate und Konflikte enthalten, von der KI zum erforderlichen Zeitpunkt gefunden werden können und die Regeln in automatische Prüfungen münden.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#4-agentisches-engineering-ziele-und-werkzeuge-bereitstellen-und-die-n%C3%A4chste-aktion-delegieren\" class=\"anchor\" id=\"4-agentisches-engineering-ziele-und-werkzeuge-bereitstellen-und-die-nächste-aktion-delegieren\"\u003e\u003c/a\u003e4. Agentisches Engineering: Ziele und Werkzeuge bereitstellen und die nächste Aktion delegieren\u003c/h2\u003e\n\u003cp\u003eAgentisches Engineering ist ein Entwurfsansatz, bei dem eine KI Ziele, Werkzeuge, Arbeitszustände und Randbedingungen erhält und innerhalb eines bestimmten Rahmens selbst die nächsten Schritte zur Zielerreichung auswählt.\u003c/p\u003e\n\u003cp\u003eAnthropic unterscheidet \u003cstrong\u003eWorkflows\u003c/strong\u003e als Systeme, die LLMs und Werkzeuge über vorab festgelegte Codepfade koordinieren, von \u003cstrong\u003eAgenten\u003c/strong\u003e als Systemen, in denen das Modell seinen eigenen Prozess und den Einsatz von Werkzeugen dynamisch bestimmt. Auch OpenAI beschreibt Agenten als Systeme, in denen ein LLM die Ausführung eines Workflows verwaltet und Werkzeuge zur Interaktion mit externen Systemen dynamisch auswählt.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#grundlegende-agentenschleife\" class=\"anchor\" id=\"grundlegende-agentenschleife\"\u003e\u003c/a\u003eGrundlegende Agentenschleife\u003c/h3\u003e\n\u003col\u003e\n\u003cli\u003eAktuelles Ziel und aktuellen Zustand beobachten.\u003c/li\u003e\n\u003cli\u003eDas nächste Teilziel oder die nächste Aktion planen.\u003c/li\u003e\n\u003cli\u003eEin Werkzeug auswählen und ausführen.\u003c/li\u003e\n\u003cli\u003eErgebnis und Veränderungen der Umgebung überprüfen.\u003c/li\u003e\n\u003cli\u003eZwischen Abschluss, Korrektur, Wiederholung und Übergabe an einen Menschen entscheiden.\u003c/li\u003e\n\u003c/ol\u003e\n\u003ch3\u003e\n\u003ca href=\"#f%C3%A4lle-in-denen-agenten-geeignet-sind\" class=\"anchor\" id=\"fälle-in-denen-agenten-geeignet-sind\"\u003e\u003c/a\u003eFälle, in denen Agenten geeignet sind\u003c/h3\u003e\n\u003cul\u003e\n\u003cli\u003eDie Reihenfolge der Arbeitsschritte variiert je nach Eingabe\u003c/li\u003e\n\u003cli\u003eUnstrukturierte Informationen wie natürliche Sprache, Dokumente oder Code müssen interpretiert werden\u003c/li\u003e\n\u003cli\u003eMehrere Werkzeuge müssen selektiv eingesetzt werden\u003c/li\u003e\n\u003cli\u003eDer Plan muss anhand von Zwischenergebnissen geändert werden\u003c/li\u003e\n\u003cli\u003eDie Fehlerursachen sind vielfältig und eine Wiederherstellung ist bis zu einem gewissen Grad möglich\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch3\u003e\n\u003ca href=\"#f%C3%A4lle-in-denen-agenten-%C3%BCberdimensioniert-sind\" class=\"anchor\" id=\"fälle-in-denen-agenten-überdimensioniert-sind\"\u003e\u003c/a\u003eFälle, in denen Agenten überdimensioniert sind\u003c/h3\u003e\n\u003cul\u003e\n\u003cli\u003eEinfache Automatisierung mit festen Regeln und fester Reihenfolge\u003c/li\u003e\n\u003cli\u003eAufgaben, die sich zuverlässig mit einem einzelnen API-Aufruf oder SQL lösen lassen\u003c/li\u003e\n\u003cli\u003eAufgaben ohne Prüfmechanismus und mit sehr hohen Fehlerkosten\u003c/li\u003e\n\u003cli\u003eStrukturen, die schwer rückgängig zu machende Aktionen wie Zahlungen, Löschungen oder Deployments ohne Genehmigung ausführen\u003c/li\u003e\n\u003cli\u003eMulti-Agenten-Strukturen, die lediglich Rollen vermehren, obwohl ein einzelner Agent ausreicht\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eAutonomie ist keine binäre Entscheidung. Sie kann in unterstützende Systeme, die nur Empfehlungen geben, ausführende Systeme mit begrenzten Lese- und Schreibrechten, überwachte Systeme mit Genehmigungen bei wichtigen Schritten und hochautonome Systeme unterteilt werden, die über längere Zeit in Bereichen mit geringem Risiko arbeiten. Sie sollte entsprechend dem Geschäftsrisiko und der Prüffähigkeit schrittweise erweitert werden.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#5-loop-engineering-einen-%C3%BCberpr%C3%BCfbaren-verbesserungsprozess-gestalten\" class=\"anchor\" id=\"5-loop-engineering-einen-überprüfbaren-verbesserungsprozess-gestalten\"\u003e\u003c/a\u003e5. Loop-Engineering: Einen überprüfbaren Verbesserungsprozess gestalten\u003c/h2\u003e\n\u003cp\u003eLoop-Engineering ist nicht bloß ein erneuter Versuch. Es gestaltet \u003cstrong\u003eGenerierung → Prüfung → Analyse der Fehlerursache → Auswahl einer Korrekturstrategie → erneute Ausführung → Entscheidung über den Abbruch\u003c/strong\u003e als explizites geschlossenes Feedbacksystem.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#bestandteile-einer-ordnungsgem%C3%A4%C3%9Fen-schleife\" class=\"anchor\" id=\"bestandteile-einer-ordnungsgemäßen-schleife\"\u003e\u003c/a\u003eBestandteile einer ordnungsgemäßen Schleife\u003c/h3\u003e\n\u003col\u003e\n\u003cli\u003e\n\u003cstrong\u003eKandidatengenerierung:\u003c/strong\u003e Einen Entwurf, Code, Plan oder das Ergebnis einer Datentransformation erstellen.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003ePrüfung:\u003c/strong\u003e Tests, Schemas, Referenzdaten, Richtlinien und Nachweise prüfen.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eUrsachenklassifizierung:\u003c/strong\u003e Zwischen Anweisungsfehlern, fehlendem Kontext, Werkzeugfehlern, Implementierungsfehlern und Fehlern des Prüfers unterscheiden.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eKorrektur:\u003c/strong\u003e Die kleinste zur Fehlerursache passende Änderung anwenden.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eErneute Ausführung:\u003c/strong\u003e Nicht alles von Anfang an wiederholen, sondern beim erforderlichen Schritt neu beginnen.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eAbbruch:\u003c/strong\u003e Bei erfolgreicher Prüfung, maximaler Iterationszahl, Kostenlimit, Zeitlimit oder Unsicherheitsschwelle stoppen.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eRegressionsschutz:\u003c/strong\u003e Prüfen, ob eine neue Änderung bestehende Erfolgsfälle beschädigt hat.\u003c/li\u003e\n\u003c/ol\u003e\n\u003cp\u003eDie Bewertung von Agenten ist komplexer als eine Bewertung einzelner Interaktionen, die nur Ein- und Ausgabe betrachtet. Da Agenten Werkzeuge mehrfach aufrufen und den Zustand der Umgebung verändern, müssen neben dem Endergebnis auch der Prozess und die Veränderungen der Umgebung geprüft werden. Der Kern automatischer Bewertungen besteht darin, eine Eingabe bereitzustellen und eine Bewertungslogik auf die Ausgabe oder den veränderten Zustand anzuwenden.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#priorit%C3%A4ten-bei-pr%C3%BCfern\" class=\"anchor\" id=\"prioritäten-bei-prüfern\"\u003e\u003c/a\u003ePrioritäten bei Prüfern\u003c/h3\u003e\n\u003cul\u003e\n\u003cli\u003e\n\u003cstrong\u003eDeterministische Prüfung:\u003c/strong\u003e Kompilierung, Unit-Tests, Schemas, mathematische Einschränkungen, Berechtigungsprüfung\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eReferenzbasierte Prüfung:\u003c/strong\u003e Referenzdaten, Zitate aus Originalquellen, Datenbankabgleich\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eRegelbasierte Prüfung:\u003c/strong\u003e Verbotene Wörter, Pflichtfelder, Richtlinienbedingungen\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eModellbasierte Bewertung:\u003c/strong\u003e Schwer zu formalisierende Kriterien wie Stil, Bedeutungserhalt und Gesamtqualität\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eMenschliche Bewertung:\u003c/strong\u003e Hochriskante Entscheidungen, Angemessenheit des Ziels selbst, Genehmigung von Ausnahmen\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eWenn möglich, sollten zuerst deterministische Prüfungen verwendet werden. Ein Modell sollte seine eigenen Ergebnisse nicht ausschließlich durch eine Modellbewertung selbst benoten. Bei Modellbewertungen sollten zugleich Bewertungskriterien, Beispiele, Prüfungen auf Verzerrungen und stichprobenartige menschliche Kontrollen eingesetzt werden.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#die-f%C3%BCnf-ans%C3%A4tze-sind-ebenen-und-keine-ersatzl%C3%B6sungen\" class=\"anchor\" id=\"die-fünf-ansätze-sind-ebenen-und-keine-ersatzlösungen\"\u003e\u003c/a\u003eDie fünf Ansätze sind Ebenen und keine Ersatzlösungen\u003c/h2\u003e\n\u003cp\u003eIn realen Systemen wirken alle fünf Ansätze zusammen.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eDer Prompt erstellt den \u003cstrong\u003eVertrag für die aktuelle Aktion\u003c/strong\u003e.\u003c/li\u003e\n\u003cli\u003eDer Kontext liefert \u003cstrong\u003eden für die Entscheidung erforderlichen Zustand und die Nachweise\u003c/strong\u003e.\u003c/li\u003e\n\u003cli\u003eDer Harness stellt \u003cstrong\u003eeine handlungsfähige Umgebung und Sicherheitsmechanismen\u003c/strong\u003e bereit.\u003c/li\u003e\n\u003cli\u003eDas agentische Design verteilt \u003cstrong\u003edie Entscheidungsbefugnis über die nächste Aktion\u003c/strong\u003e.\u003c/li\u003e\n\u003cli\u003eDas Loop-Design \u003cstrong\u003eerkennt Fehler und lässt die Qualität konvergieren\u003c/strong\u003e.\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eDaher sind Auffassungen wie „Kontext-Engineering hat Prompt-Engineering ersetzt“ oder „Mit Agenten sind keine Workflows mehr nötig“ unzutreffend. Eine breitere Ebene schließt eine engere lediglich ein oder nutzt sie, und bei einfachen Problemen kann ein einfaches Design stabiler sein.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#praxisbeispiel-ein-ki-coding-system-zur-fehlerbehebung\" class=\"anchor\" id=\"praxisbeispiel-ein-ki-coding-system-zur-fehlerbehebung\"\u003e\u003c/a\u003ePraxisbeispiel: Ein KI-Coding-System zur Fehlerbehebung\u003c/h2\u003e\n\u003cp\u003eNehmen wir an, eine KI soll den Fehler „Nach der Anmeldung tritt nur bei bestimmten Nutzern ein 500-Fehler auf“ beheben.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#prompt-engineering\" class=\"anchor\" id=\"prompt-engineering\"\u003e\u003c/a\u003ePrompt-Engineering\u003c/h3\u003e\n\u003cul\u003e\n\u003cli\u003eÜberprüfe die Bedingungen zur Reproduktion des Fehlers.\u003c/li\u003e\n\u003cli\u003eÄndere die öffentliche API nicht.\u003c/li\u003e\n\u003cli\u003eLöse das Problem mit einer minimalen Änderung.\u003c/li\u003e\n\u003cli\u003eBerichte nach der Korrektur über die Testergebnisse und verbleibende Risiken.\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch3\u003e\n\u003ca href=\"#kontext-engineering\" class=\"anchor\" id=\"kontext-engineering\"\u003e\u003c/a\u003eKontext-Engineering\u003c/h3\u003e\n\u003cul\u003e\n\u003cli\u003eProblembeschreibung und Fehlerprotokolle\u003c/li\u003e\n\u003cli\u003eZugehörige Request-Trace-ID\u003c/li\u003e\n\u003cli\u003eDateien zur Authentifizierung und zum Nutzermodell\u003c/li\u003e\n\u003cli\u003eKürzlich vorgenommene Änderungen\u003c/li\u003e\n\u003cli\u003eArchitekturregeln und Coding-Standards\u003c/li\u003e\n\u003cli\u003eFehlgeschlagene Tests und Informationen zur Ausführungsumgebung\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch3\u003e\n\u003ca href=\"#harness-engineering\" class=\"anchor\" id=\"harness-engineering\"\u003e\u003c/a\u003eHarness-Engineering\u003c/h3\u003e\n\u003cul\u003e\n\u003cli\u003eWerkzeuge für Repository-Suche, Lesen und Bearbeiten von Dateien sowie Testausführung\u003c/li\u003e\n\u003cli\u003eIsolierter Branch und Sandbox\u003c/li\u003e\n\u003cli\u003eFormatter, Linter, Unit- und Integrationstests\u003c/li\u003e\n\u003cli\u003eBereiche mit Änderungsverbot und Berechtigungsrichtlinien\u003c/li\u003e\n\u003cli\u003eProtokolle aller Befehle und Dateiänderungen\u003c/li\u003e\n\u003cli\u003eRollback und Checkpoints bei Fehlern\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch3\u003e\n\u003ca href=\"#agentisches-engineering\" class=\"anchor\" id=\"agentisches-engineering\"\u003e\u003c/a\u003eAgentisches Engineering\u003c/h3\u003e\n\u003cp\u003eDie KI wählt je nach Situation die Reihenfolge von Reproduktion, Hypothesenbildung, Suche im relevanten Code, Patch, Tests und Zusammenfassung der Ergebnisse. Deployments oder Datenänderungen erfordern jedoch eine menschliche Genehmigung.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#loop-engineering\" class=\"anchor\" id=\"loop-engineering\"\u003e\u003c/a\u003eLoop-Engineering\u003c/h3\u003e\n\u003cp\u003eWenn ein Test fehlschlägt, wird nicht derselbe Befehl wiederholt, sondern der Fehlertyp klassifiziert. Bei fehlgeschlagener Reproduktion wird die Kontexterfassung ergänzt, bei einer Regression der Patch verkleinert und bei einem Umgebungsfehler werden Abhängigkeiten und Konfiguration wiederhergestellt. Der Vorgang endet, wenn alle erforderlichen Tests bestanden sind und die Begründung der Änderungen dokumentiert ist.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#anhand-von-problemsymptomen-den-erforderlichen-engineering-ansatz-ermitteln\" class=\"anchor\" id=\"anhand-von-problemsymptomen-den-erforderlichen-engineering-ansatz-ermitteln\"\u003e\u003c/a\u003eAnhand von Problemsymptomen den erforderlichen Engineering-Ansatz ermitteln\u003c/h2\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eSymptom\u003c/th\u003e\n\u003cth\u003eVorrangig zu prüfender Bereich\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Symptom\"\u003eAusgabeformat oder Schreibstil weichen häufig ab\u003c/td\u003e\n\u003ctd data-label=\"Vorrangig zu prüfender Bereich\"\u003ePrompt\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Symptom\"\u003eFür die Antwort erforderliche Fakten oder Dateien fehlen\u003c/td\u003e\n\u003ctd data-label=\"Vorrangig zu prüfender Bereich\"\u003eKontext\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Symptom\"\u003eEs werden falsche Werkzeuge ausgewählt oder gefährliche Befehle ausgeführt\u003c/td\u003e\n\u003ctd data-label=\"Vorrangig zu prüfender Bereich\"\u003eHarness- und Berechtigungsdesign\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Symptom\"\u003eEs gibt viele Varianten, die sich schwer in einer festen Reihenfolge verarbeiten lassen\u003c/td\u003e\n\u003ctd data-label=\"Vorrangig zu prüfender Bereich\"\u003eAgentisches Design\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Symptom\"\u003eDas erste Ergebnis ist häufig falsch, lässt sich aber automatisch beurteilen\u003c/td\u003e\n\u003ctd data-label=\"Vorrangig zu prüfender Bereich\"\u003eSchleife und Prüfer\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Symptom\"\u003eDie Fehlerursache ist unbekannt und schwer reproduzierbar\u003c/td\u003e\n\u003ctd data-label=\"Vorrangig zu prüfender Bereich\"\u003eBeobachtbarkeit des Harness\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Symptom\"\u003eMit jeder Wiederholung steigen nur die Kosten, ohne dass die Qualität besser wird\u003c/td\u003e\n\u003ctd data-label=\"Vorrangig zu prüfender Bereich\"\u003eUrsachenklassifizierung, Prüfsignale, Abbruchbedingungen\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Symptom\"\u003eJe mehr Materialien vorliegen, desto schlechter wird die Antwort\u003c/td\u003e\n\u003ctd data-label=\"Vorrangig zu prüfender Bereich\"\u003eKontextbereinigung und Abrufrichtlinien\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003ch2\u003e\n\u003ca href=\"#empfohlene-implementierungsreihenfolge\" class=\"anchor\" id=\"empfohlene-implementierungsreihenfolge\"\u003e\u003c/a\u003eEmpfohlene Implementierungsreihenfolge\u003c/h2\u003e\n\u003ch3\u003e\n\u003ca href=\"#schritt-1-zuerst-erfolgskriterien-und-ein-bewertungsset-erstellen\" class=\"anchor\" id=\"schritt-1-zuerst-erfolgskriterien-und-ein-bewertungsset-erstellen\"\u003e\u003c/a\u003eSchritt 1: Zuerst Erfolgskriterien und ein Bewertungsset erstellen\u003c/h3\u003e\n\u003cp\u003eRepräsentative Aufgaben, schwierige Fälle und verbotene Fälle sammeln und definieren, wie Ergebnisse beurteilt werden. Wenn keine Referenzdaten vorhanden sind, zumindest Schemas, erforderliche Nachweise, Richtlinieneinhaltung und Kriterien für menschliche Bewertungen festlegen.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#schritt-2-eine-baseline-f%C3%BCr-einen-einzelnen-aufruf-erstellen\" class=\"anchor\" id=\"schritt-2-eine-baseline-für-einen-einzelnen-aufruf-erstellen\"\u003e\u003c/a\u003eSchritt 2: Eine Baseline für einen einzelnen Aufruf erstellen\u003c/h3\u003e\n\u003cp\u003eMit dem einfachsten Prompt und dem minimal erforderlichen Kontext Leistung, Kosten und Latenz messen. Werden Agenten ohne Baseline eingeführt, lässt sich die Wirkung der zusätzlichen Komplexität nur schwer bestimmen.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#schritt-3-die-kontextbereitstellung-instrumentieren\" class=\"anchor\" id=\"schritt-3-die-kontextbereitstellung-instrumentieren\"\u003e\u003c/a\u003eSchritt 3: Die Kontextbereitstellung instrumentieren\u003c/h3\u003e\n\u003cp\u003eAufzeichnen, welche Dokumente und Werkzeugergebnisse einbezogen wurden, wie alt sie sind und ob sie tatsächlich in der Antwort verwendet wurden. Zwischen fehlgeschlagenem Abruf und übermäßigem Kontext unterscheiden.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#schritt-4-einen-minimalen-harness-erstellen\" class=\"anchor\" id=\"schritt-4-einen-minimalen-harness-erstellen\"\u003e\u003c/a\u003eSchritt 4: Einen minimalen Harness erstellen\u003c/h3\u003e\n\u003cp\u003eDie Anzahl der Werkzeuge reduzieren und ihre Namen und Eingaben eindeutig gestalten. Sandbox, minimale Berechtigungen, automatische Tests, Protokolle und Checkpoints priorisieren.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#schritt-5-begrenzte-autonomie-gew%C3%A4hren\" class=\"anchor\" id=\"schritt-5-begrenzte-autonomie-gewähren\"\u003e\u003c/a\u003eSchritt 5: Begrenzte Autonomie gewähren\u003c/h3\u003e\n\u003cp\u003eEinen einzelnen Agenten zunächst risikoarme, überwiegend lesende Aufgaben ausführen lassen. Abbruch- und Übergabebedingungen für Menschen ausdrücklich festlegen und Schreib-, Lösch-, Zahlungs- und Deployment-Berechtigungen separat genehmigen.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#schritt-6-die-pr%C3%BCf--und-wiederherstellungsschleife-schlie%C3%9Fen\" class=\"anchor\" id=\"schritt-6-die-prüf--und-wiederherstellungsschleife-schließen\"\u003e\u003c/a\u003eSchritt 6: Die Prüf- und Wiederherstellungsschleife schließen\u003c/h3\u003e\n\u003cp\u003eFehlerklassifizierung, Korrekturstrategie, maximale Iterationszahl, Kostenlimit und Regressionstests miteinander verbinden. Werkzeuge und Autonomiebereich erst erweitern, nachdem sich die Erfolgsquote stabilisiert hat.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#betriebskennzahlen\" class=\"anchor\" id=\"betriebskennzahlen\"\u003e\u003c/a\u003eBetriebskennzahlen\u003c/h2\u003e\n\u003cp\u003eDa es keine universellen Zielwerte gibt, müssen die Kriterien entsprechend dem Geschäftsrisiko und den Kosten festgelegt werden.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eKennzahl\u003c/th\u003e\n\u003cth\u003eBedeutung\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Kennzahl\"\u003eAufgabenerfüllungsquote\u003c/td\u003e\n\u003ctd data-label=\"Bedeutung\"\u003eAnteil der Aufgaben, die die endgültigen Erfolgskriterien erfüllen\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Kennzahl\"\u003eErfolgsquote im ersten Durchlauf\u003c/td\u003e\n\u003ctd data-label=\"Bedeutung\"\u003eAnteil der Aufgaben, die ohne iterative Korrekturen sofort erfolgreich sind\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Kennzahl\"\u003eWiederherstellungsquote\u003c/td\u003e\n\u003ctd data-label=\"Bedeutung\"\u003eAnteil der Aufgaben, die nach dem ersten Fehler durch die Schleife erfolgreich werden\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Kennzahl\"\u003eDurchschnittliche Iterationszahl\u003c/td\u003e\n\u003ctd data-label=\"Bedeutung\"\u003eAnzahl der bis zum Erfolg oder Abbruch erforderlichen Zyklen\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Kennzahl\"\u003eFehlerquote bei der Werkzeugauswahl\u003c/td\u003e\n\u003ctd data-label=\"Bedeutung\"\u003eAnteil unangemessener oder unnötiger Werkzeugaufrufe\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Kennzahl\"\u003eVollständigkeit der Nachweise\u003c/td\u003e\n\u003ctd data-label=\"Bedeutung\"\u003eAnteil zentraler Aussagen mit nachvollziehbaren Quellen\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Kennzahl\"\u003eQuote menschlicher Eingriffe\u003c/td\u003e\n\u003ctd data-label=\"Bedeutung\"\u003eAnteil der Fälle, die Genehmigung, Korrektur oder erneute Anweisung erforderten\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Kennzahl\"\u003eKosten und Latenz pro erfolgreicher Einheit\u003c/td\u003e\n\u003ctd data-label=\"Bedeutung\"\u003eRessourcen, die zum Abschluss einer erfolgreichen Aufgabe erforderlich waren\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Kennzahl\"\u003eAnzahl der Sicherheitsvorfälle\u003c/td\u003e\n\u003ctd data-label=\"Bedeutung\"\u003eAnzahl von Berechtigungsverstößen, fehlerhaften Schreibvorgängen und irreversiblen Aktionen\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Kennzahl\"\u003eRegressionsfehlerquote\u003c/td\u003e\n\u003ctd data-label=\"Bedeutung\"\u003eAnteil neuer Änderungen, die bestehende Erfolgsfälle beschädigen\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003ch2\u003e\n\u003ca href=\"#h%C3%A4ufige-entwurfsfehler\" class=\"anchor\" id=\"häufige-entwurfsfehler\"\u003e\u003c/a\u003eHäufige Entwurfsfehler\u003c/h2\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eBereich\u003c/th\u003e\n\u003cth\u003eFehler\u003c/th\u003e\n\u003cth\u003eVerbesserungsmethode\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Bereich\"\u003ePrompt\u003c/td\u003e\n\u003ctd data-label=\"Fehler\"\u003eAlle Ausnahmen werden in einem Satz angehäuft\u003c/td\u003e\n\u003ctd data-label=\"Verbesserungsmethode\"\u003eRegeln strukturieren und repräsentative Beispiele von der Bewertung trennen\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Bereich\"\u003ePrompt\u003c/td\u003e\n\u003ctd data-label=\"Fehler\"\u003eOhne Erfolgskriterien wird angewiesen, etwas „gut zu verfassen“\u003c/td\u003e\n\u003ctd data-label=\"Verbesserungsmethode\"\u003eFormat, Pflichtinhalte, Verbote und Beurteilungskriterien angeben\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Bereich\"\u003eKontext\u003c/td\u003e\n\u003ctd data-label=\"Fehler\"\u003eAlle irrelevanten Dokumente werden einbezogen\u003c/td\u003e\n\u003ctd data-label=\"Verbesserungsmethode\"\u003eLaufzeitabruf und schrittweisen Kontext verwenden\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Bereich\"\u003eKontext\u003c/td\u003e\n\u003ctd data-label=\"Fehler\"\u003eVeraltete und aktuelle Richtlinien werden gemeinsam bereitgestellt\u003c/td\u003e\n\u003ctd data-label=\"Verbesserungsmethode\"\u003eVersion, Gültigkeitsdatum und maßgebliche Originalquelle verwalten\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Bereich\"\u003eHarness\u003c/td\u003e\n\u003ctd data-label=\"Fehler\"\u003eViele Werkzeuge mit sich überschneidenden Funktionen werden bereitgestellt\u003c/td\u003e\n\u003ctd data-label=\"Verbesserungsmethode\"\u003eEinen minimalen Werkzeugsatz und eindeutige Parameter gestalten\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Bereich\"\u003eHarness\u003c/td\u003e\n\u003ctd data-label=\"Fehler\"\u003eEs fehlen Schreibberechtigungen und Möglichkeiten zum Rückgängigmachen\u003c/td\u003e\n\u003ctd data-label=\"Verbesserungsmethode\"\u003eMinimale Berechtigungen, Sandbox und Checkpoints einrichten\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Bereich\"\u003eAgentisch\u003c/td\u003e\n\u003ctd data-label=\"Fehler\"\u003eVon Anfang an wird ein Multi-Agenten-System erstellt\u003c/td\u003e\n\u003ctd data-label=\"Verbesserungsmethode\"\u003eZunächst einen einzelnen Agenten und deterministische Workflows validieren\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Bereich\"\u003eAgentisch\u003c/td\u003e\n\u003ctd data-label=\"Fehler\"\u003eDie Ausführung wird ohne Abschlussbedingung fortgesetzt\u003c/td\u003e\n\u003ctd data-label=\"Verbesserungsmethode\"\u003eExplizite Abbruch-, Budget- und Übergabebedingungen festlegen\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Bereich\"\u003eSchleife\u003c/td\u003e\n\u003ctd data-label=\"Fehler\"\u003eDieselbe Anfrage wird unverändert wiederholt\u003c/td\u003e\n\u003ctd data-label=\"Verbesserungsmethode\"\u003eFehlerursache klassifizieren und Korrekturpunkt ändern\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Bereich\"\u003eSchleife\u003c/td\u003e\n\u003ctd data-label=\"Fehler\"\u003eEin einziges generatives Modell bewertet alle Ergebnisse selbst\u003c/td\u003e\n\u003ctd data-label=\"Verbesserungsmethode\"\u003eDeterministische Prüfungen, Referenzabgleiche und menschliche Stichprobenkontrollen kombinieren\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003ch2\u003e\n\u003ca href=\"#implementierungscheckliste\" class=\"anchor\" id=\"implementierungscheckliste\"\u003e\u003c/a\u003eImplementierungscheckliste\u003c/h2\u003e\n\u003cul\u003e\n\u003cli\u003e Lassen sich die Erfolgskriterien, soweit möglich, nicht nur sprachlich, sondern auch maschinell prüfen?\u003c/li\u003e\n\u003cli\u003e Sind die Prioritäten von Prompt, Referenzmaterialien und Werkzeugergebnissen getrennt?\u003c/li\u003e\n\u003cli\u003e Lassen sich Quelle, Version, Gültigkeitsdatum und Eigentümer von Dokumenten nachverfolgen?\u003c/li\u003e\n\u003cli\u003e Sind Werkzeugnamen und Parameter eindeutig und überschneiden sich nicht?\u003c/li\u003e\n\u003cli\u003e Sind Berechtigungen für Lesen, Schreiben, Löschen, Bezahlen und Deployment nach Risikostufe getrennt?\u003c/li\u003e\n\u003cli\u003e Gibt es eine Sandbox zur Isolierung von Fehlern und Mittel zum Rückgängigmachen?\u003c/li\u003e\n\u003cli\u003e Werden alle wichtigen Aktionen und Werkzeugaufrufe in reproduzierbarer Form aufgezeichnet?\u003c/li\u003e\n\u003cli\u003e Gibt es externe Prüfer wie Tests, Schemas und Richtlinienprüfungen?\u003c/li\u003e\n\u003cli\u003e Sind maximale Iterationszahl, Kosten, Zeit und Bedingungen für die Übergabe an Menschen definiert?\u003c/li\u003e\n\u003cli\u003e Gibt es eine Regressionsbewertung, die sicherstellt, dass neue Verbesserungen bestehende Fälle nicht beschädigen?\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch2\u003e\n\u003ca href=\"#fazit\" class=\"anchor\" id=\"fazit\"\u003e\u003c/a\u003eFazit\u003c/h2\u003e\n\u003cp\u003eEin gutes KI-System ist nicht das System mit dem längsten Prompt. Es ist ein System, das unterscheidet, ob ein Fehler bei \u003cstrong\u003eAnweisung\u003c/strong\u003e, \u003cstrong\u003eInformation\u003c/strong\u003e, \u003cstrong\u003eUmgebung\u003c/strong\u003e, \u003cstrong\u003eEntscheidungsfindung\u003c/strong\u003e oder \u003cstrong\u003ePrüfung und Wiederherstellung\u003c/strong\u003e aufgetreten ist, und auf der jeweiligen Ebene die einfachste Lösung einsetzt. Ein stabiler Ansatz besteht darin, zunächst Erfolgskriterien und eine Baseline für einzelne Aufrufe zu schaffen, Kontext und Harness nur im erforderlichen Umfang zu ergänzen und anschließend Autonomie und iterative Schleifen innerhalb eines überprüfbaren Rahmens zu erweitern.\u003c/p\u003e\n","tags":["Prompt Engineering","Kontext Engineering","Harness Engineering","KI-Agent","AI Evaluation"],"faqs":[{"question":"Müssen die fünf Engineering-Ansätze zwingend in einer bestimmten Reihenfolge eingeführt werden?","answer":"Es handelt sich nicht um festgelegte Reifegradstufen. Wenn man jedoch zunächst Erfolgskriterien und eine Baseline für einen einzelnen Aufruf festlegt, anschließend Prompt und Kontext strukturiert und bei Bedarf Harnesses, Autonomie und iterative Schleifen hinzufügt, lässt sich die Wirkung der Komplexität leichter messen."},{"question":"Ersetzt Context Engineering das Prompt Engineering?","answer":"Nein. Der Prompt definiert das auszuführende Verhalten und den Ausgabevertrag, während der Kontext die für dieses Verhalten erforderlichen Fakten, Zustände und Belege bereitstellt. Gute Systeme konzipieren beides gemeinsam."},{"question":"Was ist der Unterschied zwischen Context Engineering und Harness Engineering?","answer":"Context Engineering konzentriert sich auf die Informationen, die das Modell zu einem bestimmten Zeitpunkt sieht. Harness Engineering umfasst darüber hinaus die Werkzeuge, Berechtigungen, Ausführungsumgebung, Dokumentstruktur, Protokolle und Wiederherstellungsmechanismen, mit denen diese Informationen gefunden, Aktionen ausgeführt und Ergebnisse überprüft werden."},{"question":"Wie unterscheiden sich Agenten von herkömmlicher Workflow-Automatisierung?","answer":"Während herkömmliche Workflows vordefinierten Abläufen und Verzweigungen folgen, interpretiert ein Agent den aktuellen Zustand und wählt die nächste Aktion sowie die dafür benötigten Werkzeuge dynamisch aus. Für Aufgaben mit stabilen Regeln können deterministische Workflows kostengünstiger und vorhersehbarer sein."},{"question":"Wie unterscheidet sich Loop Engineering von einer einfachen Wiederholung?","answer":"Bei einer einfachen Wiederholung wird lediglich unter denselben Bedingungen erneut eine Ausgabe erzeugt. Beim Loop Engineering werden Fehler anhand externer Validierungssignale erkannt und ihre Ursachen klassifiziert. Anschließend werden die erforderlichen Teile des Prompts, des Kontexts, der Werkzeuge oder der Implementierung angepasst sowie Abbruchbedingungen und Regressionstests angewendet."},{"question":"Wann sollte man mehrere Agenten einsetzen?","answer":"Dies sollte in Betracht gezogen werden, wenn sich Werkzeuge und Berechtigungen je nach Rolle deutlich unterscheiden oder wenn der Kontext beziehungsweise die Werkzeugauswahl eines einzelnen Agenten übermäßig groß wird und dadurch Leistung und Evaluierung beeinträchtigt werden. Werden mehrere Agenten lediglich zur einfachen Aufgabenteilung erstellt, können Kosten, Verzögerungen, Fehlerfortpflanzung und der Debugging-Aufwand zunehmen."},{"question":"Darf eine AI ihre eigenen Ergebnisse bewerten?","answer":"Sie kann als ergänzendes Signal verwendet werden, doch es ist riskant, sie als einzigen Prüfer einzusetzen. Wenn möglich, sollten zunächst Tests, Schemata, Referenzdaten und Richtlinienregeln angewendet werden. Die Modellbewertung sollte durch ein explizites Bewertungsraster und die menschliche Prüfung von Stichproben ergänzt werden."},{"question":"Was sollte die Harness-Dokumentation enthalten?","answer":"Sie sollte wiederkehrende Arbeitsabläufe, die Struktur von Repository und System, erlaubte und verbotene Aktionen, Anleitungen zur Werkzeugnutzung, gute und schlechte Beispiele, Testbefehle, Störungsmaßnahmen, Genehmigungsrichtlinien und Abschlusskriterien enthalten. Die Dokumentation sollte kurz, durchsuchbar und versionsverwaltet sein."},{"question":"Was ist der wichtigste Sicherheitsgrundsatz beim Einfügen externer Dokumente in den Kontext?","answer":"Externe Dokumente müssen als nicht vertrauenswürdige Daten behandelt und von den Systemanweisungen getrennt werden. Die Werkzeugberechtigungen sollten minimiert werden, damit in Dokumenten enthaltene Anweisungen nicht ausgeführt werden. Für wichtige Schreib-, Lösch-, Zahlungs- und Bereitstellungsaktionen sollten gesonderte Richtlinienprüfungen und menschliche Genehmigungen vorgesehen werden."},{"question":"Womit sollte ein kleines Team am besten beginnen?","answer":"Es sollte ein kleiner, repräsentativer Evaluierungssatz einschließlich Fehlerbeispielen zusammengestellt und damit die Baseline eines einzelnen Modellaufrufs gemessen werden. Anschließend ist es effizient, zu ermitteln, ob die größte Fehlerursache bei den Anweisungen, Informationen, der Werkzeugumgebung, der Planung oder der Validierung liegt, und jeweils eine Ebene nach der anderen zu verbessern."}],"sources":[{"url":"https://platform.claude.com/docs/ko/build-with-claude/prompt-engineering/overview","title":"Überblick über Prompt Engineering – Claude Platform Docs","type":"source"},{"url":"https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents","title":"Effektives Context Engineering für KI-Agenten","type":"source"},{"url":"https://openai.com/index/harness-engineering/","title":"Harness Engineering: Codex in einer agentenorientierten Welt nutzen","type":"source"},{"url":"https://www.anthropic.com/engineering/building-effective-agents","title":"Effektive Agenten entwickeln","type":"source"},{"url":"https://openai.com/business/guides-and-resources/a-practical-guide-to-building-ai-agents/","title":"Ein praxisorientierter Leitfaden zur Entwicklung von Agenten","type":"source"},{"url":"https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents","title":"Evaluationen für KI-Agenten verständlich erklärt","type":"source"},{"url":"https://martinfowler.com/articles/harness-engineering.html","title":"Harness Engineering für Nutzer von Coding-Agenten","type":"source"}],"images":[{"id":192,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6MTg0NywicHVyIjoiYmxvYl9pZCJ9fQ==--9f1b84d1d297642915a0d27477d3800017987668/ChatGPT%20Image%202026%E1%84%82%E1%85%A7%E1%86%AB%207%E1%84%8B%E1%85%AF%E1%86%AF%2016%E1%84%8B%E1%85%B5%E1%86%AF%20%E1%84%8B%E1%85%A9%E1%84%92%E1%85%AE%2004_12_32.webp","is_representative":true,"generation_method":"upload","mime_type":"image/webp","original_filename":"ChatGPT Image 2026년 7월 16일 오후 04_12_32.png","translations":{"ko":{"alt":"중앙 AI 허브와 지시, 정보, 도구, 자율 실행, 검증 루프 모듈이 연결된 시스템 구조","caption":"다섯 가지 AI 엔지니어링 방식이 하나의 시스템에서 연결되고 반복 개선되는 구조를 보여준다.","description":null},"en":{"alt":"Central AI hub connected to instruction, context, tools, autonomous action, and validation loop modules","caption":"The illustration shows five AI engineering approaches working together in a connected improvement cycle.","description":null},"ja":{"alt":"中央のAIハブに指示、情報、ツール、自律実行、検証ループの各モジュールが接続された構成","caption":"5つのAIエンジニアリング手法が連携し、反復的に改善される仕組みを表している。","description":null},"es":{"alt":"Núcleo central de IA conectado con módulos de instrucciones, contexto, herramientas, acción autónoma y validación","caption":"La ilustración muestra cinco enfoques de ingeniería de IA integrados en un ciclo de mejora continua.","description":null},"id":{"alt":"Pusat AI terhubung ke modul instruksi, konteks, alat, tindakan otonom, dan siklus validasi","caption":"Ilustrasi ini menunjukkan lima pendekatan rekayasa AI yang bekerja bersama dalam siklus perbaikan.","description":null},"pt":{"alt":"Núcleo central de IA ligado a módulos de instruções, contexto, ferramentas, ação autônoma e validação","caption":"A ilustração mostra cinco abordagens de engenharia de IA integradas em um ciclo contínuo de melhoria.","description":null},"zh-hant":{"alt":"中央 AI 核心連接指令、情境、工具、自主執行與驗證迴圈模組的系統架構","caption":"圖中呈現五種 AI 工程方法如何協同運作並形成持續改進的循環。","description":null},"de":{"alt":"Systemarchitektur, in der ein zentraler AI-Hub mit Modulen für Anweisungen, Informationen, Werkzeuge, autonome Ausführung und Validierungsschleifen verbunden ist","caption":"Zeigt eine Struktur, in der fünf AI-Engineering-Methoden in einem System miteinander verbunden sind und iterativ verbessert werden.","description":null}}},{"id":193,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6MTg1NCwicHVyIjoiYmxvYl9pZCJ9fQ==--47acd549387f7a60f4c18de6ac673ca1b551dd36/ChatGPT%20Image%202026%E1%84%82%E1%85%A7%E1%86%AB%207%E1%84%8B%E1%85%AF%E1%86%AF%2016%E1%84%8B%E1%85%B5%E1%86%AF%20%E1%84%8B%E1%85%A9%E1%84%92%E1%85%AE%2004_36_26.webp","is_representative":false,"generation_method":"upload","mime_type":"image/webp","original_filename":"ChatGPT Image 2026년 7월 16일 오후 04_36_26.png","translations":{"ko":{"alt":"지시 설정부터 정보 선별, 안전 환경, 자율 실행, 검증 반복까지 이어지는 AI 구축 파이프라인","caption":"AI 시스템을 단계적으로 설계하고 검증 결과를 앞 단계에 반영하는 실무 흐름을 보여준다.","description":null},"en":{"alt":"AI build pipeline from instruction setup and context filtering to safe execution, autonomous action, and validation loops","caption":"The illustration shows a step-by-step AI workflow with feedback loops returning results to earlier stages.","description":null},"ja":{"alt":"指示設定、情報選別、安全な実行環境、自律動作、検証ループへ続くAI構築パイプライン","caption":"AIシステムを段階的に設計し、検証結果を前の工程へ反映する流れを示している。","description":null},"es":{"alt":"Flujo de creación de IA con instrucciones, filtrado de contexto, entorno seguro, acción autónoma y validación iterativa","caption":"La ilustración muestra un proceso gradual de diseño de IA con ciclos de retroalimentación hacia etapas anteriores.","description":null},"id":{"alt":"Alur pembangunan AI dari pengaturan instruksi dan penyaringan konteks hingga eksekusi aman, tindakan otonom, dan validasi","caption":"Ilustrasi ini menunjukkan tahapan perancangan sistem AI dengan umpan balik ke proses sebelumnya.","description":null},"pt":{"alt":"Fluxo de construção de IA com instruções, filtragem de contexto, ambiente seguro, ação autônoma e validação iterativa","caption":"A ilustração mostra um processo gradual de projeto de IA com ciclos de retorno às etapas anteriores.","description":null},"zh-hant":{"alt":"從指令設定、情境篩選與安全環境，到自主執行和反覆驗證的 AI 建置流程","caption":"圖中呈現 AI 系統的分階段設計流程，以及驗證結果回饋至前序階段的機制。","description":null},"de":{"alt":"AI-Entwicklungspipeline, die von der Festlegung von Anweisungen über die Auswahl von Informationen und eine sichere Umgebung bis hin zur autonomen Ausführung und wiederholten Validierung reicht","caption":"Zeigt einen praktischen Arbeitsablauf, bei dem ein AI-System schrittweise konzipiert wird und die Validierungsergebnisse in vorherige Phasen einfließen.","description":null}}}],"published_at":"2026-07-16T17:00:54+09:00","updated_at":"2026-07-16T17:00:54+09:00","license":"cc_by","translation_status":"reviewed","available_locales":["ko","en","ja","es"],"data_locales":["ko","en","ja","es","id","pt","zh-hant","de"],"url":"https://injoys.com/en/articles/prompt-context-harness-agentic-loop-engineering"}