{"content_id":"aillofw1zj","slug":"openai-gpt-5-6-price-performance-model-routing","locale":"de","schema_type":"TechArticle","category":"ai_data","category_name":"KI-Daten","title":"OpenAI GPT-5.6: Neue Preise, mehr Tempo und Strategie zur Modellwahl","summary":"OpenAI senkte ab dem 30. Juli 2026 die API-Preise für GPT-5.6 Luna und Terra um 80% beziehungsweise 20% und führte für Sol den Fast mode ein. Die Neugestaltung konzentriert sich auf eine Strategie, bei der Modelle passend zu den Phasen Planung, Ausführung und Validierung eingesetzt werden, anstatt für alle Aufgaben das Spitzenmodell zu verwenden, um so die Kosten pro Ergebnis zu senken.","author":{"name":"injoys","url":"https://injoys.com/ko/about"},"key_points":["Der API-Preis von GPT-5.6 Luna wurde auf 0.20 Dollar je 1 Million Eingabe-Token und 1.20 Dollar je 1 Million Ausgabe-Token gesenkt.","Der API-Preis von GPT-5.6 Terra wurde auf 2 Dollar je 1 Million Eingabe-Token und 12 Dollar je 1 Million Ausgabe-Token gesenkt.","Der Fast mode von GPT-5.6 Sol ist laut Ankündigung bis zu 2.5-mal schneller als die Standardverarbeitung, kostet doppelt so viel und behält das Intelligenzniveau des Modells bei.","Unternehmen können eine gestufte Konfiguration einsetzen, bei der Sol komplexe Entscheidungen und Planungen übernimmt, während Luna oder Terra die wiederholte Ausführung und Validierung verarbeiten.","OpenAI erklärt, dass die gemeinsame Optimierung von Modell, Inferenzinfrastruktur und Agenten-Harness die Preissenkungen und die Verbesserung des Durchsatzes ermöglicht habe."],"content_markdown":"OpenAI hat die verbesserte Ausführungseffizienz der GPT-5.6-Produktfamilie mit niedrigeren API-Preisen und einer höheren Verarbeitungsgeschwindigkeit verknüpft. Entscheidend ist nicht, für alle Aufgaben ein einziges, besonders leistungsfähiges Modell einzusetzen, sondern Sol, Terra und Luna je nach Risiko, Komplexität, Latenz und Überprüfbarkeit der Aufgabe zu kombinieren, um die Kosten pro Ergebnis zu senken.\n\nDie Preis- und Leistungsangaben basieren auf der Ankündigung von OpenAI vom 30. Juli 2026. Die Kundenbenchmarks und Angaben zu Effizienzsteigerungen stammen aus Messungen von OpenAI oder den in der Ankündigung zitierten Unternehmen und können daher nicht als in jeder Umgebung identisch reproduzierbar angesehen werden.\n\n## API-Preisänderungen vom 30. Juli 2026\n\nDie geänderten API-Preise für GPT-5.6 Luna und Terra lauten wie folgt.\n\n| Modell | 1 Million Eingabetoken | 1 Million Ausgabetoken | Preissenkung | Hauptaufgabe |\n|---|---:|---:|---:|---|\n| GPT-5.6 Luna | 0.20 Dollar | 1.20 Dollar | 80% | Massenverarbeitung, wiederkehrende Aufgaben, klar definierte Ausführungsaufgaben |\n| GPT-5.6 Terra | 2 Dollar | 12 Dollar | 20% | Alltagsaufgaben, die ein Gleichgewicht zwischen Qualität, Kosten und Geschwindigkeit erfordern |\n| GPT-5.6 Sol | laut Ankündigung unverändert | laut Ankündigung unverändert | keine | komplexes Schlussfolgern, Planung, wichtige Entscheidungen |\n\nDie Preise für kostenpflichtige Abonnements von ChatGPT und Codex sowie das gesamte Kontingentbudget ändern sich durch diese Ankündigung nicht. Bei der Nutzung von Terra und Luna werden jedoch weniger Credits abgezogen. OpenAI teilte mit, dass die Preisänderungen über AWS ab dem späteren Verlauf des 30. Juli schrittweise umgesetzt werden.\n\n### Beispiel zur Berechnung der API-Kosten\n\nDie Tokenkosten lassen sich wie folgt berechnen.\n\n`Gesamtkosten = Anzahl der Eingabetoken ÷ 1,000,000 × Eingabepreis + Anzahl der Ausgabetoken ÷ 1,000,000 × Ausgabepreis`\n\nWerden beispielsweise 10 Millionen Eingabetoken und 2 Millionen Ausgabetoken verarbeitet, ergeben sich auf Grundlage der einfachen Tokenpreise folgende Kosten.\n\n| Modell | Eingabekosten | Ausgabekosten | Gesamt |\n|---|---:|---:|---:|\n| Luna | 2 Dollar | 2.40 Dollar | 4.40 Dollar |\n| Terra | 20 Dollar | 24 Dollar | 44 Dollar |\n\nDie tatsächliche Abrechnung kann durch dienstspezifische Bedingungen beeinflusst werden, etwa durch die Nutzung von Caching, die gewählte Verarbeitungsart oder die Struktur der Tool-Aufrufe.\n\n## Aufgaben der GPT-5.6-Produktfamilie\n\nGPT-5.6 ist kein einzelnes Modell, sondern eine gestufte Produktfamilie mit unterschiedlichen Kosten- und Leistungsniveaus.\n\n### GPT-5.6 Sol\n\nSol übernimmt Schlussfolgerungen auf höchstem Niveau und die Lösung komplexer Probleme. Es eignet sich für Entscheidungen mit unklaren Anforderungen oder hohen Fehlerkosten, für langfristige Planung und für die Überprüfung wichtiger Ergebnisse.\n\n### GPT-5.6 Terra\n\nTerra zielt auf ein Gleichgewicht zwischen Leistung, Kosten und Antwortgeschwindigkeit. Es eignet sich für Aufgaben wie interne Fragen und Antworten in Organisationen, klar abgegrenzte Agentenaufgaben sowie allgemeine Analysen und Programmierung, die mehr Urteilsvermögen als Luna erfordern, aber nicht immer den Einsatz von Sol notwendig machen.\n\n### GPT-5.6 Luna\n\nLuna ist die schnellste und günstigste Stufe. Da es nicht nur kurze, einfache Texte erzeugen, sondern auch Tool-Aufrufe und mehrstufige Workflows unterstützen kann, lässt es sich als Ausführungsmodell einsetzen, das klar definierte Aufgaben in großem Umfang wiederholt.\n\nTypische Einsatzgebiete sind:\n\n- Klassifizierung großer Mengen von Dokumenten und Kundenanfragen\n- Extraktion strukturierter Daten\n- Wiederkehrende Codeänderungen\n- Erstellung und Ausführung von Tests\n- Dokumentenerstellung nach klaren Regeln\n- Prüfung großer Mengen von Inhalten\n- Automatisierung von Hintergrundagenten\n- Unterstützung bei wiederkehrenden Recherchen\n\nOpenAI behauptet, Luna biete eine Leistung auf einem ähnlichen Niveau wie Modelle, die vor einem Jahr als Spitzenmodelle galten, und zwar zu etwa 6% der geschätzten Kosten pro Aufgabe sowie mit nahezu 9-facher Geschwindigkeit. Die 6% beziehen sich hierbei nicht auf einen direkten Vergleich der Tokenpreise, sondern auf einen Vergleich der geschätzten Kosten, die zum Erzielen desselben Arbeitsergebnisses anfallen.\n\n## Merkmale des Fast mode von Sol\n\nFür GPT-5.6 Sol wurde ein Fast mode für die API eingeführt. Dieser ersetzt das bisherige Priority Processing und entspricht konzeptionell der `/fast`-Funktion von Codex.\n\n| Punkt | Fast mode |\n|---|---|\n| Geschwindigkeit | bis zu 2.5-mal schneller als die Standardverarbeitung |\n| Modellintelligenz | laut OpenAI identisch mit Standard |\n| Preis | das 2-Fache des Preises der Standardverarbeitung |\n| Abwärtskompatibilität | Anfragen mit dem Tag `priority` werden automatisch im Fast mode verarbeitet |\n\nDie Formulierung „bis zu 2.5-mal schneller“ beim Fast mode garantiert nicht, dass sich die Latenz aller Anfragen exakt im gleichen Verhältnis verkürzt. Die tatsächlich wahrgenommene Geschwindigkeit kann je nach Länge des Prompts, Ausgabelänge, Dienstauslastung und Anzahl der Tool-Aufrufe variieren.\n\n### Wann sich der Fast mode eignet\n\n- Echtzeitdienste, bei denen Nutzer auf eine Antwort warten\n- Entwicklungsumgebungen mit schnellen Wiederholungen von Codeänderungen und Prüfungen\n- Aufgaben, bei denen Sol-Aufrufe die Gesamtlatenz des Agenten bestimmen\n- Situationen wie die Reaktion auf Vorfälle oder die Analyse von Störungen, in denen bereits Verzögerungen von wenigen Minuten wichtig sind\n- Aufgaben, bei denen die durch Verarbeitungsverzögerungen entstehenden Kosten höher sind als die zusätzlichen API-Kosten\n\nFür Aufgaben ohne dringenden Fertigstellungstermin, etwa Hintergrund-Batches, nächtliche Analysen oder asynchrone Verarbeitung, kann die Standardverarbeitung wirtschaftlicher sein.\n\n## Ergebnisorientierte Kriterien für die Modellauswahl\n\nBei der Modellauswahl geht es nicht darum, das in einer Rangliste höchstplatzierte Modell zu wählen. Für jede Aufgabe sollten die folgenden Fragen geprüft werden.\n\n| Beurteilungsfaktor | Zu prüfende Frage |\n|---|---|\n| Folgen eines Fehlers | Welche Auswirkungen hat ein Fehler auf Kunden, Umsatz, Sicherheit oder regulatorische Compliance? |\n| Fehlertoleranz | Können Menschen oder automatische Regeln Fehler erkennen? |\n| Latenz | Wartet der Nutzer in Echtzeit oder ist eine asynchrone Verarbeitung möglich? |\n| Durchsatz | Wie viele Vorgänge müssen pro Tag oder Monat verarbeitet werden? |\n| Klarheit des Problems | Sind Eingaben, Regeln und erwartete Ausgaben ausreichend definiert? |\n| Wert des Schlussfolgerns | Verbessert stärkeres Schlussfolgern die tatsächliche Ergebnisqualität in bedeutendem Maß? |\n| Überprüfbarkeit | Lässt sich das Ergebnis durch Tests, Schemata oder Gegenprüfungen beurteilen? |\n\nKlar definierte und automatisch überprüfbare Aufgaben eignen sich mit hoher Wahrscheinlichkeit für Luna. Ist ein bestimmtes Maß an Urteilsvermögen erforderlich, kann Terra in Betracht gezogen werden. Für die Klärung von Mehrdeutigkeiten, risikoreiche Entscheidungen oder die abschließende Prüfung folgenreicher Ergebnisse eignet sich Sol.\n\n## Mit Sol planen und mit Luna ausführen\n\nAuch innerhalb einer einzelnen Agentenaufgabe können für die verschiedenen Schritte unterschiedliche Modelle eingesetzt werden. Ein Programmieragent kann beispielsweise wie folgt aufgebaut sein.\n\n1. Sol identifiziert Unklarheiten in den Anforderungen und strukturiert die Fragen.\n2. Sol legt den Implementierungsplan, den Änderungsumfang und die Risikofaktoren fest.\n3. Luna implementiert die geklärten Änderungen als Code.\n4. Luna erstellt die Tests und führt sie aus.\n5. Luna oder Terra bewertet die Testergebnisse und die Codeunterschiede.\n6. Nur Schlussfolgerungen mit hoher Fehlerwahrscheinlichkeit oder besonderer Bedeutung werden erneut von Sol geprüft.\n\nDiese Struktur kann die Kosten gegenüber dem Einsatz von Sol in allen Schritten senken und gleichzeitig hohe Fähigkeiten zum Schlussfolgern auf wichtige Entscheidungen konzentrieren. Werden die Modelle aufgeteilt, müssen jedoch Routingregeln, Fehlerbehandlung, Logverfolgung und Evaluierungssysteme separat konzipiert werden.\n\n## Drei Effizienzebenen als Grundlage der Preissenkung\n\nOpenAI erklärt, dass die Kostensenkungen nicht nur auf einer Preispolitik, sondern auf technischen Verbesserungen auf drei Ebenen beruhen.\n\n1. Tokeneffizienz des Modells selbst\n2. Hardwareeffizienz des Inferenzsystems\n3. Effizienz des Agenten-Harness, das Modelle, Tools und Kontext miteinander verbindet\n\nDiese Erläuterung basiert auf den von OpenAI veröffentlichten technischen Materialien; die vollständige detaillierte Kostenstruktur wurde jedoch nicht öffentlich gemacht. Daher lässt sich von außen nicht abschließend bestimmen, welchen Anteil technische Effizienz und strategische Preispolitik jeweils an der Preissenkung hatten.\n\n## Optimierung von Modell und Inferenzsystem\n\n### Verbesserte Arbeitsleistung pro Token\n\nNach Angaben von OpenAI wurde GPT-5.6 so trainiert, dass nicht nur die Erfolgsquote bei Aufgaben, sondern auch die Verarbeitungseffizienz optimiert wird. Das bedeutet, dass unnötig lange Schlussfolgerungen und Wiederholungen reduziert werden und das Modell mit weniger Token zum erforderlichen Ergebnis gelangt, wodurch Intelligenz und Arbeitsleistung pro Token steigen.\n\n### Lastverteilung und Anfrage-Routing\n\nDas Inferenzsystem verteilt Anfragen anhand der Region, verfügbaren Kapazität und Art des Beschleunigers auf Rechenzentren und Cluster. Innerhalb eines Clusters wird die Modellinstanz unter Berücksichtigung der aktuellen Last, der Länge des Eingabekontexts, der möglichen Cache-Nutzung und der Merkmale der Anfrage ausgewählt.\n\nOpenAI erklärte, GPT-5.6 Sol und Codex für die Analyse des Produktionsverkehrs, die Suche nach Ursachen von Lastungleichgewichten, das Testen von Routingstrategien und die Anpassung von Heuristiken eingesetzt zu haben.\n\n### Optimierung von GPU-Kernels\n\nGPU-Kernels sind der zentrale Code, der die mathematischen Operationen eines Modells auf der Hardware ausführt. Je nach Speicherbewegungen, Synchronisierung, Datenanordnung und Parallelisierung können sich die Verarbeitungskosten selbst auf derselben GPU unterscheiden.\n\nLaut OpenAI war GPT-5.6 Sol in der Codex-Umgebung daran beteiligt, Produktions-Kernels mithilfe von Triton und Gluon zu erstellen und zu optimieren. Durch die Kombination aus Kernelverbesserungen und zugehörigen Optimierungen seien die End-to-End-Kosten der Modellbereitstellung um 20% gesunken, erklärte das Unternehmen.\n\nEnd-to-End-Kosten bezeichnen nicht nur die Kosten einer bestimmten Operation, sondern die Kosten der gesamten tatsächlichen Anfrageverarbeitung, einschließlich Routing, Datenübertragung, Modellausführung und Ausgabeerzeugung.\n\n### Überprüfung der Korrektheit von Kernels\n\nAuch schnelle Kernels sind unbrauchbar, wenn sie numerisch falsche Ergebnisse erzeugen. OpenAI erklärte, in Prüfwerkzeuge einschließlich FpSan investiert zu haben, um die Korrektheit von KI-generierten Kernels zu prüfen. FpSan ist die Abkürzung für Floating-Point Sanitizer und bezeichnet ein Open-Source-Werkzeug zur Erkennung von Fehlern bei Gleitkommaoperationen.\n\nDies zeigt, dass bei der Erzeugung von Produktionsinfrastruktur-Code durch KI neben Leistungsbenchmarks auch numerische Prüfungen, Regressionstests und Wiederherstellungsverfahren für Fehlerfälle erforderlich sind.\n\n## Spekulatives Decoding und KV-Cache\n\n### Spekulatives Decoding\n\nBeim spekulativen Decoding schlägt ein kleines Entwurfsmodell zunächst Token vor, die als Nächstes erzeugt werden sollen, und ein großes Hauptmodell prüft mehrere Kandidaten parallel. Werden die Vorschläge akzeptiert, lässt sich die Anzahl der teuren sequenziellen Berechnungen des Hauptmodells reduzieren.\n\nOpenAI erklärte, GPT-5.6 Sol habe Hunderte Experimente konzipiert und durchgeführt, bei denen Größe und Struktur des Entwurfsmodells verändert wurden, und das Training überwacht. Dadurch habe sich die Effizienz der Tokenerzeugung um mindestens 15% verbessert.\n\n### KV-Cache und arbeitslastspezifische Einstellungen\n\nBei der Verarbeitung einer Eingabe erstellt das Modell einen Key-Value-Cache, also einen KV-Cache. Die optimale Konfiguration hängt von Eingabe- und Ausgabelänge, Batchgröße, Cache-Trefferrate, Anzahl gleichzeitiger Anfragen, Speicherkapazität und Art des Modell-Shardings ab.\n\nOpenAI erklärt, mit Sol und Codex reale Arbeitslasten analysiert und Konfigurationskandidaten bewertet zu haben, um die Engine-Konfiguration für jeden Aufgabentyp präzise abzustimmen. Ziel ist es, mit derselben Hardware mehr Anfragen zu verarbeiten.\n\n## Agenten-Harness und Kontextkosten\n\nEin Agent ruft Modelle und Tools mehrfach auf, um eine einzelne Nutzeranfrage zu bearbeiten. Entsteht bei einer Aufgabe mit 30 erforderlichen Modellaufrufen bei jedem Aufruf eine unnötige Verzögerung von 1 Sekunde, kann sich die Gesamtlatenz um etwa 30 Sekunden erhöhen.\n\nOpenAI beschreibt die Rust-basierte Orchestrierungsebene, die Modelle, Tools und Nutzerumgebungen miteinander verbindet, als Agenten-Harness.\n\n### Verzögerte Bereitstellung nur benötigter Tools\n\nWerden Informationen zu Tools, Plug-ins, Skills und MCP-Integrationen von Beginn an vollständig in den Prompt aufgenommen, steigen die Anzahl der Eingabetoken und die Latenz. Das Harness nutzt einen Ansatz der verzögerten Erkundung, bei dem Informationen zu relevanten Tools erst dann bereitgestellt werden, wenn sie benötigt werden. Laut OpenAI sind Tool-Ausgaben standardmäßig auf 10.000 Token begrenzt, sofern das Modell kein separates Limit anfordert.\n\n### Exakte Präfixerhaltung und Prompt-Cache\n\nBeim Prompt-Caching wird der identische Anfang einer zuvor verarbeiteten Eingabe wiederverwendet, um redundante Berechnungen zu reduzieren. Für die Wiederverwendung des Cache muss das Prompt-Präfix exakt übereinstimmen.\n\nDas Harness von OpenAI verwaltet den Verlauf in einer Append-only-Struktur und fügt neue Nachrichten und Tool-Ergebnisse am Ende hinzu. Tools werden in einer deterministischen Reihenfolge präsentiert, während Ausführungseinstellungen wie Genehmigungsrichtlinien zur Laufzeit angewendet werden, ohne die Tool-Definition selbst zu verändern. Dieser Ansatz ist vorteilhaft, um die Cache-Trefferrate wiederkehrender Agentenschleifen zu erhöhen.\n\n## Wie Zahlen aus Unternehmensbeispielen zu lesen sind\n\nDie offizielle Ankündigung von OpenAI enthält Bewertungen von Replit, Notion, Ramp, Blitzy, Cognition und Dust.\n\n- Notion erklärte, dass Terra in der eigenen Bewertung eine mit GPT-5.5 vergleichbare Qualität zu den halben Kosten pro Aufgabe und in 60% kürzerer Zeit geliefert habe.\n- Blitzy erklärte, dass nach der Einführung von Luna die Wiederverwendungsrate des Prompt-Cache von 24% auf 90% gestiegen sei und die Kosten 87% niedriger als beim vorherigen Standardmodell gewesen seien.\n- Dust erklärte, Luna sei bei denselben Agentenaufgaben 40% schneller und 40% günstiger als das vorherige Standardmodell gewesen.\n- Ramp erklärte, Luna als Standardmodell für die Automatisierung von Hintergrundagenten zu verwenden.\n\nDiese Zahlen stammen aus Messungen mit den internen Aufgaben, Prompts, Bewertungskriterien und Systemstrukturen der jeweiligen Unternehmen. Da es sich nicht um einen unabhängigen gemeinsamen Benchmark handelt, sollten sie nicht unverändert auf die Aufgaben anderer Organisationen übertragen werden. Vor der Einführung ist eine eigene Evaluierung erforderlich, die reale Daten und Fehlerkosten berücksichtigt.\n\n## Checkliste für die Prüfung vor der Einführung\n\n1. Repräsentative Aufgabenstichproben sowie korrekte Antworten oder Bewertungskriterien vorbereiten.\n2. Erfolgs- und Wiederholungsraten von Luna, Terra und Sol unter identischen Bedingungen vergleichen.\n3. Nicht nur Tokenkosten, sondern auch Tool-Aufrufe, Prüfpersonal und Kosten der Fehlerbehebung einbeziehen.\n4. Neben der durchschnittlichen Latenz auch die Latenz der oberen 95% oder 99% messen.\n5. Schritte, die durch automatische Tests oder Schemaüberprüfungen validiert werden können, als Kandidaten für kostengünstige Modelle einstufen.\n6. Für Aufgaben mit Bezug zu personenbezogenen Daten, Sicherheit oder Regulierung separate Genehmigungs- und Protokollierungsrichtlinien anwenden.\n7. Routingkriterien festlegen, nach denen Ergebnisse mit geringer Vertrauenswürdigkeit auf Terra oder Sol hochgestuft werden.\n8. Mit realem Datenverkehr prüfen, ob der Wert der geringeren Latenz die zusätzlichen Kosten des Fast mode übersteigt.\n\n## Bedeutung und Grenzen\n\nDiese Neuausrichtung zeigt, dass sich der Maßstab im Wettbewerb der KI-Modelle von einem einzelnen Höchstwert hin zu den Kosten pro Ergebnis verschiebt. Werden Luna für umfangreiche wiederkehrende Aufgaben, Terra für alltägliche Wissensarbeit und Sol für mehrdeutige und wichtige Entscheidungen eingesetzt, lassen sich Intelligenz, Geschwindigkeit und Kosten je nach Aufgabe kombinieren.\n\nAllerdings lässt sich anhand der öffentlich verfügbaren Informationen nur schwer trennen, in welchem Umfang die Preissenkung um 80% jeweils auf technische Effizienzsteigerungen und Marktstrategien zurückzuführen ist. Auch die Wirtschaftlichkeit kostengünstiger Modelle wird nicht allein durch den Tokenpreis bestimmt. Führt eine höhere Fehlerquote zu mehr Wiederholungen und menschlichen Prüfungen, können die Gesamtkosten der Aufgabe steigen.\n\nDie entscheidende Kennzahl ist daher nicht der Preis eines einzelnen Modellaufrufs, sondern die Gesamtkosten für ein einzelnes Ergebnis, das die Überprüfung bestanden hat. Nur wenn Erfolgsquote, Anzahl der Wiederholungen, Latenz und Prüfungskosten für jedes Modell gemeinsam gemessen werden, lässt sich beurteilen, ob die Preissenkung von GPT-5.6 tatsächlich einen geschäftlichen Mehrwert schafft.","content_html":"\u003cp\u003eOpenAI hat die verbesserte Ausführungseffizienz der GPT-5.6-Produktfamilie mit niedrigeren API-Preisen und einer höheren Verarbeitungsgeschwindigkeit verknüpft. Entscheidend ist nicht, für alle Aufgaben ein einziges, besonders leistungsfähiges Modell einzusetzen, sondern Sol, Terra und Luna je nach Risiko, Komplexität, Latenz und Überprüfbarkeit der Aufgabe zu kombinieren, um die Kosten pro Ergebnis zu senken.\u003c/p\u003e\n\u003cp\u003eDie Preis- und Leistungsangaben basieren auf der Ankündigung von OpenAI vom 30. Juli 2026. Die Kundenbenchmarks und Angaben zu Effizienzsteigerungen stammen aus Messungen von OpenAI oder den in der Ankündigung zitierten Unternehmen und können daher nicht als in jeder Umgebung identisch reproduzierbar angesehen werden.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#api-preis%C3%A4nderungen-vom-30-juli-2026\" class=\"anchor\" id=\"api-preisänderungen-vom-30-juli-2026\"\u003e\u003c/a\u003eAPI-Preisänderungen vom 30. Juli 2026\u003c/h2\u003e\n\u003cp\u003eDie geänderten API-Preise für GPT-5.6 Luna und Terra lauten wie folgt.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eModell\u003c/th\u003e\n\u003cth\u003e1 Million Eingabetoken\u003c/th\u003e\n\u003cth\u003e1 Million Ausgabetoken\u003c/th\u003e\n\u003cth\u003ePreissenkung\u003c/th\u003e\n\u003cth\u003eHauptaufgabe\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Modell\"\u003eGPT-5.6 Luna\u003c/td\u003e\n\u003ctd data-label=\"1 Million Eingabetoken\"\u003e0.20 Dollar\u003c/td\u003e\n\u003ctd data-label=\"1 Million Ausgabetoken\"\u003e1.20 Dollar\u003c/td\u003e\n\u003ctd data-label=\"Preissenkung\"\u003e80%\u003c/td\u003e\n\u003ctd data-label=\"Hauptaufgabe\"\u003eMassenverarbeitung, wiederkehrende Aufgaben, klar definierte Ausführungsaufgaben\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Modell\"\u003eGPT-5.6 Terra\u003c/td\u003e\n\u003ctd data-label=\"1 Million Eingabetoken\"\u003e2 Dollar\u003c/td\u003e\n\u003ctd data-label=\"1 Million Ausgabetoken\"\u003e12 Dollar\u003c/td\u003e\n\u003ctd data-label=\"Preissenkung\"\u003e20%\u003c/td\u003e\n\u003ctd data-label=\"Hauptaufgabe\"\u003eAlltagsaufgaben, die ein Gleichgewicht zwischen Qualität, Kosten und Geschwindigkeit erfordern\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Modell\"\u003eGPT-5.6 Sol\u003c/td\u003e\n\u003ctd data-label=\"1 Million Eingabetoken\"\u003elaut Ankündigung unverändert\u003c/td\u003e\n\u003ctd data-label=\"1 Million Ausgabetoken\"\u003elaut Ankündigung unverändert\u003c/td\u003e\n\u003ctd data-label=\"Preissenkung\"\u003ekeine\u003c/td\u003e\n\u003ctd data-label=\"Hauptaufgabe\"\u003ekomplexes Schlussfolgern, Planung, wichtige Entscheidungen\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eDie Preise für kostenpflichtige Abonnements von ChatGPT und Codex sowie das gesamte Kontingentbudget ändern sich durch diese Ankündigung nicht. Bei der Nutzung von Terra und Luna werden jedoch weniger Credits abgezogen. OpenAI teilte mit, dass die Preisänderungen über AWS ab dem späteren Verlauf des 30. Juli schrittweise umgesetzt werden.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#beispiel-zur-berechnung-der-api-kosten\" class=\"anchor\" id=\"beispiel-zur-berechnung-der-api-kosten\"\u003e\u003c/a\u003eBeispiel zur Berechnung der API-Kosten\u003c/h3\u003e\n\u003cp\u003eDie Tokenkosten lassen sich wie folgt berechnen.\u003c/p\u003e\n\u003cp\u003e\u003ccode\u003eGesamtkosten = Anzahl der Eingabetoken ÷ 1,000,000 × Eingabepreis + Anzahl der Ausgabetoken ÷ 1,000,000 × Ausgabepreis\u003c/code\u003e\u003c/p\u003e\n\u003cp\u003eWerden beispielsweise 10 Millionen Eingabetoken und 2 Millionen Ausgabetoken verarbeitet, ergeben sich auf Grundlage der einfachen Tokenpreise folgende Kosten.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eModell\u003c/th\u003e\n\u003cth\u003eEingabekosten\u003c/th\u003e\n\u003cth\u003eAusgabekosten\u003c/th\u003e\n\u003cth\u003eGesamt\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Modell\"\u003eLuna\u003c/td\u003e\n\u003ctd data-label=\"Eingabekosten\"\u003e2 Dollar\u003c/td\u003e\n\u003ctd data-label=\"Ausgabekosten\"\u003e2.40 Dollar\u003c/td\u003e\n\u003ctd data-label=\"Gesamt\"\u003e4.40 Dollar\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Modell\"\u003eTerra\u003c/td\u003e\n\u003ctd data-label=\"Eingabekosten\"\u003e20 Dollar\u003c/td\u003e\n\u003ctd data-label=\"Ausgabekosten\"\u003e24 Dollar\u003c/td\u003e\n\u003ctd data-label=\"Gesamt\"\u003e44 Dollar\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eDie tatsächliche Abrechnung kann durch dienstspezifische Bedingungen beeinflusst werden, etwa durch die Nutzung von Caching, die gewählte Verarbeitungsart oder die Struktur der Tool-Aufrufe.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#aufgaben-der-gpt-56-produktfamilie\" class=\"anchor\" id=\"aufgaben-der-gpt-56-produktfamilie\"\u003e\u003c/a\u003eAufgaben der GPT-5.6-Produktfamilie\u003c/h2\u003e\n\u003cp\u003eGPT-5.6 ist kein einzelnes Modell, sondern eine gestufte Produktfamilie mit unterschiedlichen Kosten- und Leistungsniveaus.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#gpt-56-sol\" class=\"anchor\" id=\"gpt-56-sol\"\u003e\u003c/a\u003eGPT-5.6 Sol\u003c/h3\u003e\n\u003cp\u003eSol übernimmt Schlussfolgerungen auf höchstem Niveau und die Lösung komplexer Probleme. Es eignet sich für Entscheidungen mit unklaren Anforderungen oder hohen Fehlerkosten, für langfristige Planung und für die Überprüfung wichtiger Ergebnisse.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#gpt-56-terra\" class=\"anchor\" id=\"gpt-56-terra\"\u003e\u003c/a\u003eGPT-5.6 Terra\u003c/h3\u003e\n\u003cp\u003eTerra zielt auf ein Gleichgewicht zwischen Leistung, Kosten und Antwortgeschwindigkeit. Es eignet sich für Aufgaben wie interne Fragen und Antworten in Organisationen, klar abgegrenzte Agentenaufgaben sowie allgemeine Analysen und Programmierung, die mehr Urteilsvermögen als Luna erfordern, aber nicht immer den Einsatz von Sol notwendig machen.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#gpt-56-luna\" class=\"anchor\" id=\"gpt-56-luna\"\u003e\u003c/a\u003eGPT-5.6 Luna\u003c/h3\u003e\n\u003cp\u003eLuna ist die schnellste und günstigste Stufe. Da es nicht nur kurze, einfache Texte erzeugen, sondern auch Tool-Aufrufe und mehrstufige Workflows unterstützen kann, lässt es sich als Ausführungsmodell einsetzen, das klar definierte Aufgaben in großem Umfang wiederholt.\u003c/p\u003e\n\u003cp\u003eTypische Einsatzgebiete sind:\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eKlassifizierung großer Mengen von Dokumenten und Kundenanfragen\u003c/li\u003e\n\u003cli\u003eExtraktion strukturierter Daten\u003c/li\u003e\n\u003cli\u003eWiederkehrende Codeänderungen\u003c/li\u003e\n\u003cli\u003eErstellung und Ausführung von Tests\u003c/li\u003e\n\u003cli\u003eDokumentenerstellung nach klaren Regeln\u003c/li\u003e\n\u003cli\u003ePrüfung großer Mengen von Inhalten\u003c/li\u003e\n\u003cli\u003eAutomatisierung von Hintergrundagenten\u003c/li\u003e\n\u003cli\u003eUnterstützung bei wiederkehrenden Recherchen\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eOpenAI behauptet, Luna biete eine Leistung auf einem ähnlichen Niveau wie Modelle, die vor einem Jahr als Spitzenmodelle galten, und zwar zu etwa 6% der geschätzten Kosten pro Aufgabe sowie mit nahezu 9-facher Geschwindigkeit. Die 6% beziehen sich hierbei nicht auf einen direkten Vergleich der Tokenpreise, sondern auf einen Vergleich der geschätzten Kosten, die zum Erzielen desselben Arbeitsergebnisses anfallen.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#merkmale-des-fast-mode-von-sol\" class=\"anchor\" id=\"merkmale-des-fast-mode-von-sol\"\u003e\u003c/a\u003eMerkmale des Fast mode von Sol\u003c/h2\u003e\n\u003cp\u003eFür GPT-5.6 Sol wurde ein Fast mode für die API eingeführt. Dieser ersetzt das bisherige Priority Processing und entspricht konzeptionell der \u003ccode\u003e/fast\u003c/code\u003e-Funktion von Codex.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003ePunkt\u003c/th\u003e\n\u003cth\u003eFast mode\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Punkt\"\u003eGeschwindigkeit\u003c/td\u003e\n\u003ctd data-label=\"Fast mode\"\u003ebis zu 2.5-mal schneller als die Standardverarbeitung\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Punkt\"\u003eModellintelligenz\u003c/td\u003e\n\u003ctd data-label=\"Fast mode\"\u003elaut OpenAI identisch mit Standard\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Punkt\"\u003ePreis\u003c/td\u003e\n\u003ctd data-label=\"Fast mode\"\u003edas 2-Fache des Preises der Standardverarbeitung\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Punkt\"\u003eAbwärtskompatibilität\u003c/td\u003e\n\u003ctd data-label=\"Fast mode\"\u003eAnfragen mit dem Tag \u003ccode\u003epriority\u003c/code\u003e werden automatisch im Fast mode verarbeitet\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eDie Formulierung „bis zu 2.5-mal schneller“ beim Fast mode garantiert nicht, dass sich die Latenz aller Anfragen exakt im gleichen Verhältnis verkürzt. Die tatsächlich wahrgenommene Geschwindigkeit kann je nach Länge des Prompts, Ausgabelänge, Dienstauslastung und Anzahl der Tool-Aufrufe variieren.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#wann-sich-der-fast-mode-eignet\" class=\"anchor\" id=\"wann-sich-der-fast-mode-eignet\"\u003e\u003c/a\u003eWann sich der Fast mode eignet\u003c/h3\u003e\n\u003cul\u003e\n\u003cli\u003eEchtzeitdienste, bei denen Nutzer auf eine Antwort warten\u003c/li\u003e\n\u003cli\u003eEntwicklungsumgebungen mit schnellen Wiederholungen von Codeänderungen und Prüfungen\u003c/li\u003e\n\u003cli\u003eAufgaben, bei denen Sol-Aufrufe die Gesamtlatenz des Agenten bestimmen\u003c/li\u003e\n\u003cli\u003eSituationen wie die Reaktion auf Vorfälle oder die Analyse von Störungen, in denen bereits Verzögerungen von wenigen Minuten wichtig sind\u003c/li\u003e\n\u003cli\u003eAufgaben, bei denen die durch Verarbeitungsverzögerungen entstehenden Kosten höher sind als die zusätzlichen API-Kosten\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eFür Aufgaben ohne dringenden Fertigstellungstermin, etwa Hintergrund-Batches, nächtliche Analysen oder asynchrone Verarbeitung, kann die Standardverarbeitung wirtschaftlicher sein.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#ergebnisorientierte-kriterien-f%C3%BCr-die-modellauswahl\" class=\"anchor\" id=\"ergebnisorientierte-kriterien-für-die-modellauswahl\"\u003e\u003c/a\u003eErgebnisorientierte Kriterien für die Modellauswahl\u003c/h2\u003e\n\u003cp\u003eBei der Modellauswahl geht es nicht darum, das in einer Rangliste höchstplatzierte Modell zu wählen. Für jede Aufgabe sollten die folgenden Fragen geprüft werden.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eBeurteilungsfaktor\u003c/th\u003e\n\u003cth\u003eZu prüfende Frage\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Beurteilungsfaktor\"\u003eFolgen eines Fehlers\u003c/td\u003e\n\u003ctd data-label=\"Zu prüfende Frage\"\u003eWelche Auswirkungen hat ein Fehler auf Kunden, Umsatz, Sicherheit oder regulatorische Compliance?\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Beurteilungsfaktor\"\u003eFehlertoleranz\u003c/td\u003e\n\u003ctd data-label=\"Zu prüfende Frage\"\u003eKönnen Menschen oder automatische Regeln Fehler erkennen?\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Beurteilungsfaktor\"\u003eLatenz\u003c/td\u003e\n\u003ctd data-label=\"Zu prüfende Frage\"\u003eWartet der Nutzer in Echtzeit oder ist eine asynchrone Verarbeitung möglich?\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Beurteilungsfaktor\"\u003eDurchsatz\u003c/td\u003e\n\u003ctd data-label=\"Zu prüfende Frage\"\u003eWie viele Vorgänge müssen pro Tag oder Monat verarbeitet werden?\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Beurteilungsfaktor\"\u003eKlarheit des Problems\u003c/td\u003e\n\u003ctd data-label=\"Zu prüfende Frage\"\u003eSind Eingaben, Regeln und erwartete Ausgaben ausreichend definiert?\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Beurteilungsfaktor\"\u003eWert des Schlussfolgerns\u003c/td\u003e\n\u003ctd data-label=\"Zu prüfende Frage\"\u003eVerbessert stärkeres Schlussfolgern die tatsächliche Ergebnisqualität in bedeutendem Maß?\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Beurteilungsfaktor\"\u003eÜberprüfbarkeit\u003c/td\u003e\n\u003ctd data-label=\"Zu prüfende Frage\"\u003eLässt sich das Ergebnis durch Tests, Schemata oder Gegenprüfungen beurteilen?\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eKlar definierte und automatisch überprüfbare Aufgaben eignen sich mit hoher Wahrscheinlichkeit für Luna. Ist ein bestimmtes Maß an Urteilsvermögen erforderlich, kann Terra in Betracht gezogen werden. Für die Klärung von Mehrdeutigkeiten, risikoreiche Entscheidungen oder die abschließende Prüfung folgenreicher Ergebnisse eignet sich Sol.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#mit-sol-planen-und-mit-luna-ausf%C3%BChren\" class=\"anchor\" id=\"mit-sol-planen-und-mit-luna-ausführen\"\u003e\u003c/a\u003eMit Sol planen und mit Luna ausführen\u003c/h2\u003e\n\u003cp\u003eAuch innerhalb einer einzelnen Agentenaufgabe können für die verschiedenen Schritte unterschiedliche Modelle eingesetzt werden. Ein Programmieragent kann beispielsweise wie folgt aufgebaut sein.\u003c/p\u003e\n\u003col\u003e\n\u003cli\u003eSol identifiziert Unklarheiten in den Anforderungen und strukturiert die Fragen.\u003c/li\u003e\n\u003cli\u003eSol legt den Implementierungsplan, den Änderungsumfang und die Risikofaktoren fest.\u003c/li\u003e\n\u003cli\u003eLuna implementiert die geklärten Änderungen als Code.\u003c/li\u003e\n\u003cli\u003eLuna erstellt die Tests und führt sie aus.\u003c/li\u003e\n\u003cli\u003eLuna oder Terra bewertet die Testergebnisse und die Codeunterschiede.\u003c/li\u003e\n\u003cli\u003eNur Schlussfolgerungen mit hoher Fehlerwahrscheinlichkeit oder besonderer Bedeutung werden erneut von Sol geprüft.\u003c/li\u003e\n\u003c/ol\u003e\n\u003cp\u003eDiese Struktur kann die Kosten gegenüber dem Einsatz von Sol in allen Schritten senken und gleichzeitig hohe Fähigkeiten zum Schlussfolgern auf wichtige Entscheidungen konzentrieren. Werden die Modelle aufgeteilt, müssen jedoch Routingregeln, Fehlerbehandlung, Logverfolgung und Evaluierungssysteme separat konzipiert werden.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#drei-effizienzebenen-als-grundlage-der-preissenkung\" class=\"anchor\" id=\"drei-effizienzebenen-als-grundlage-der-preissenkung\"\u003e\u003c/a\u003eDrei Effizienzebenen als Grundlage der Preissenkung\u003c/h2\u003e\n\u003cp\u003eOpenAI erklärt, dass die Kostensenkungen nicht nur auf einer Preispolitik, sondern auf technischen Verbesserungen auf drei Ebenen beruhen.\u003c/p\u003e\n\u003col\u003e\n\u003cli\u003eTokeneffizienz des Modells selbst\u003c/li\u003e\n\u003cli\u003eHardwareeffizienz des Inferenzsystems\u003c/li\u003e\n\u003cli\u003eEffizienz des Agenten-Harness, das Modelle, Tools und Kontext miteinander verbindet\u003c/li\u003e\n\u003c/ol\u003e\n\u003cp\u003eDiese Erläuterung basiert auf den von OpenAI veröffentlichten technischen Materialien; die vollständige detaillierte Kostenstruktur wurde jedoch nicht öffentlich gemacht. Daher lässt sich von außen nicht abschließend bestimmen, welchen Anteil technische Effizienz und strategische Preispolitik jeweils an der Preissenkung hatten.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#optimierung-von-modell-und-inferenzsystem\" class=\"anchor\" id=\"optimierung-von-modell-und-inferenzsystem\"\u003e\u003c/a\u003eOptimierung von Modell und Inferenzsystem\u003c/h2\u003e\n\u003ch3\u003e\n\u003ca href=\"#verbesserte-arbeitsleistung-pro-token\" class=\"anchor\" id=\"verbesserte-arbeitsleistung-pro-token\"\u003e\u003c/a\u003eVerbesserte Arbeitsleistung pro Token\u003c/h3\u003e\n\u003cp\u003eNach Angaben von OpenAI wurde GPT-5.6 so trainiert, dass nicht nur die Erfolgsquote bei Aufgaben, sondern auch die Verarbeitungseffizienz optimiert wird. Das bedeutet, dass unnötig lange Schlussfolgerungen und Wiederholungen reduziert werden und das Modell mit weniger Token zum erforderlichen Ergebnis gelangt, wodurch Intelligenz und Arbeitsleistung pro Token steigen.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#lastverteilung-und-anfrage-routing\" class=\"anchor\" id=\"lastverteilung-und-anfrage-routing\"\u003e\u003c/a\u003eLastverteilung und Anfrage-Routing\u003c/h3\u003e\n\u003cp\u003eDas Inferenzsystem verteilt Anfragen anhand der Region, verfügbaren Kapazität und Art des Beschleunigers auf Rechenzentren und Cluster. Innerhalb eines Clusters wird die Modellinstanz unter Berücksichtigung der aktuellen Last, der Länge des Eingabekontexts, der möglichen Cache-Nutzung und der Merkmale der Anfrage ausgewählt.\u003c/p\u003e\n\u003cp\u003eOpenAI erklärte, GPT-5.6 Sol und Codex für die Analyse des Produktionsverkehrs, die Suche nach Ursachen von Lastungleichgewichten, das Testen von Routingstrategien und die Anpassung von Heuristiken eingesetzt zu haben.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#optimierung-von-gpu-kernels\" class=\"anchor\" id=\"optimierung-von-gpu-kernels\"\u003e\u003c/a\u003eOptimierung von GPU-Kernels\u003c/h3\u003e\n\u003cp\u003eGPU-Kernels sind der zentrale Code, der die mathematischen Operationen eines Modells auf der Hardware ausführt. Je nach Speicherbewegungen, Synchronisierung, Datenanordnung und Parallelisierung können sich die Verarbeitungskosten selbst auf derselben GPU unterscheiden.\u003c/p\u003e\n\u003cp\u003eLaut OpenAI war GPT-5.6 Sol in der Codex-Umgebung daran beteiligt, Produktions-Kernels mithilfe von Triton und Gluon zu erstellen und zu optimieren. Durch die Kombination aus Kernelverbesserungen und zugehörigen Optimierungen seien die End-to-End-Kosten der Modellbereitstellung um 20% gesunken, erklärte das Unternehmen.\u003c/p\u003e\n\u003cp\u003eEnd-to-End-Kosten bezeichnen nicht nur die Kosten einer bestimmten Operation, sondern die Kosten der gesamten tatsächlichen Anfrageverarbeitung, einschließlich Routing, Datenübertragung, Modellausführung und Ausgabeerzeugung.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#%C3%BCberpr%C3%BCfung-der-korrektheit-von-kernels\" class=\"anchor\" id=\"überprüfung-der-korrektheit-von-kernels\"\u003e\u003c/a\u003eÜberprüfung der Korrektheit von Kernels\u003c/h3\u003e\n\u003cp\u003eAuch schnelle Kernels sind unbrauchbar, wenn sie numerisch falsche Ergebnisse erzeugen. OpenAI erklärte, in Prüfwerkzeuge einschließlich FpSan investiert zu haben, um die Korrektheit von KI-generierten Kernels zu prüfen. FpSan ist die Abkürzung für Floating-Point Sanitizer und bezeichnet ein Open-Source-Werkzeug zur Erkennung von Fehlern bei Gleitkommaoperationen.\u003c/p\u003e\n\u003cp\u003eDies zeigt, dass bei der Erzeugung von Produktionsinfrastruktur-Code durch KI neben Leistungsbenchmarks auch numerische Prüfungen, Regressionstests und Wiederherstellungsverfahren für Fehlerfälle erforderlich sind.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#spekulatives-decoding-und-kv-cache\" class=\"anchor\" id=\"spekulatives-decoding-und-kv-cache\"\u003e\u003c/a\u003eSpekulatives Decoding und KV-Cache\u003c/h2\u003e\n\u003ch3\u003e\n\u003ca href=\"#spekulatives-decoding\" class=\"anchor\" id=\"spekulatives-decoding\"\u003e\u003c/a\u003eSpekulatives Decoding\u003c/h3\u003e\n\u003cp\u003eBeim spekulativen Decoding schlägt ein kleines Entwurfsmodell zunächst Token vor, die als Nächstes erzeugt werden sollen, und ein großes Hauptmodell prüft mehrere Kandidaten parallel. Werden die Vorschläge akzeptiert, lässt sich die Anzahl der teuren sequenziellen Berechnungen des Hauptmodells reduzieren.\u003c/p\u003e\n\u003cp\u003eOpenAI erklärte, GPT-5.6 Sol habe Hunderte Experimente konzipiert und durchgeführt, bei denen Größe und Struktur des Entwurfsmodells verändert wurden, und das Training überwacht. Dadurch habe sich die Effizienz der Tokenerzeugung um mindestens 15% verbessert.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#kv-cache-und-arbeitslastspezifische-einstellungen\" class=\"anchor\" id=\"kv-cache-und-arbeitslastspezifische-einstellungen\"\u003e\u003c/a\u003eKV-Cache und arbeitslastspezifische Einstellungen\u003c/h3\u003e\n\u003cp\u003eBei der Verarbeitung einer Eingabe erstellt das Modell einen Key-Value-Cache, also einen KV-Cache. Die optimale Konfiguration hängt von Eingabe- und Ausgabelänge, Batchgröße, Cache-Trefferrate, Anzahl gleichzeitiger Anfragen, Speicherkapazität und Art des Modell-Shardings ab.\u003c/p\u003e\n\u003cp\u003eOpenAI erklärt, mit Sol und Codex reale Arbeitslasten analysiert und Konfigurationskandidaten bewertet zu haben, um die Engine-Konfiguration für jeden Aufgabentyp präzise abzustimmen. Ziel ist es, mit derselben Hardware mehr Anfragen zu verarbeiten.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#agenten-harness-und-kontextkosten\" class=\"anchor\" id=\"agenten-harness-und-kontextkosten\"\u003e\u003c/a\u003eAgenten-Harness und Kontextkosten\u003c/h2\u003e\n\u003cp\u003eEin Agent ruft Modelle und Tools mehrfach auf, um eine einzelne Nutzeranfrage zu bearbeiten. Entsteht bei einer Aufgabe mit 30 erforderlichen Modellaufrufen bei jedem Aufruf eine unnötige Verzögerung von 1 Sekunde, kann sich die Gesamtlatenz um etwa 30 Sekunden erhöhen.\u003c/p\u003e\n\u003cp\u003eOpenAI beschreibt die Rust-basierte Orchestrierungsebene, die Modelle, Tools und Nutzerumgebungen miteinander verbindet, als Agenten-Harness.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#verz%C3%B6gerte-bereitstellung-nur-ben%C3%B6tigter-tools\" class=\"anchor\" id=\"verzögerte-bereitstellung-nur-benötigter-tools\"\u003e\u003c/a\u003eVerzögerte Bereitstellung nur benötigter Tools\u003c/h3\u003e\n\u003cp\u003eWerden Informationen zu Tools, Plug-ins, Skills und MCP-Integrationen von Beginn an vollständig in den Prompt aufgenommen, steigen die Anzahl der Eingabetoken und die Latenz. Das Harness nutzt einen Ansatz der verzögerten Erkundung, bei dem Informationen zu relevanten Tools erst dann bereitgestellt werden, wenn sie benötigt werden. Laut OpenAI sind Tool-Ausgaben standardmäßig auf 10.000 Token begrenzt, sofern das Modell kein separates Limit anfordert.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#exakte-pr%C3%A4fixerhaltung-und-prompt-cache\" class=\"anchor\" id=\"exakte-präfixerhaltung-und-prompt-cache\"\u003e\u003c/a\u003eExakte Präfixerhaltung und Prompt-Cache\u003c/h3\u003e\n\u003cp\u003eBeim Prompt-Caching wird der identische Anfang einer zuvor verarbeiteten Eingabe wiederverwendet, um redundante Berechnungen zu reduzieren. Für die Wiederverwendung des Cache muss das Prompt-Präfix exakt übereinstimmen.\u003c/p\u003e\n\u003cp\u003eDas Harness von OpenAI verwaltet den Verlauf in einer Append-only-Struktur und fügt neue Nachrichten und Tool-Ergebnisse am Ende hinzu. Tools werden in einer deterministischen Reihenfolge präsentiert, während Ausführungseinstellungen wie Genehmigungsrichtlinien zur Laufzeit angewendet werden, ohne die Tool-Definition selbst zu verändern. Dieser Ansatz ist vorteilhaft, um die Cache-Trefferrate wiederkehrender Agentenschleifen zu erhöhen.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#wie-zahlen-aus-unternehmensbeispielen-zu-lesen-sind\" class=\"anchor\" id=\"wie-zahlen-aus-unternehmensbeispielen-zu-lesen-sind\"\u003e\u003c/a\u003eWie Zahlen aus Unternehmensbeispielen zu lesen sind\u003c/h2\u003e\n\u003cp\u003eDie offizielle Ankündigung von OpenAI enthält Bewertungen von Replit, Notion, Ramp, Blitzy, Cognition und Dust.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eNotion erklärte, dass Terra in der eigenen Bewertung eine mit GPT-5.5 vergleichbare Qualität zu den halben Kosten pro Aufgabe und in 60% kürzerer Zeit geliefert habe.\u003c/li\u003e\n\u003cli\u003eBlitzy erklärte, dass nach der Einführung von Luna die Wiederverwendungsrate des Prompt-Cache von 24% auf 90% gestiegen sei und die Kosten 87% niedriger als beim vorherigen Standardmodell gewesen seien.\u003c/li\u003e\n\u003cli\u003eDust erklärte, Luna sei bei denselben Agentenaufgaben 40% schneller und 40% günstiger als das vorherige Standardmodell gewesen.\u003c/li\u003e\n\u003cli\u003eRamp erklärte, Luna als Standardmodell für die Automatisierung von Hintergrundagenten zu verwenden.\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eDiese Zahlen stammen aus Messungen mit den internen Aufgaben, Prompts, Bewertungskriterien und Systemstrukturen der jeweiligen Unternehmen. Da es sich nicht um einen unabhängigen gemeinsamen Benchmark handelt, sollten sie nicht unverändert auf die Aufgaben anderer Organisationen übertragen werden. Vor der Einführung ist eine eigene Evaluierung erforderlich, die reale Daten und Fehlerkosten berücksichtigt.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#checkliste-f%C3%BCr-die-pr%C3%BCfung-vor-der-einf%C3%BChrung\" class=\"anchor\" id=\"checkliste-für-die-prüfung-vor-der-einführung\"\u003e\u003c/a\u003eCheckliste für die Prüfung vor der Einführung\u003c/h2\u003e\n\u003col\u003e\n\u003cli\u003eRepräsentative Aufgabenstichproben sowie korrekte Antworten oder Bewertungskriterien vorbereiten.\u003c/li\u003e\n\u003cli\u003eErfolgs- und Wiederholungsraten von Luna, Terra und Sol unter identischen Bedingungen vergleichen.\u003c/li\u003e\n\u003cli\u003eNicht nur Tokenkosten, sondern auch Tool-Aufrufe, Prüfpersonal und Kosten der Fehlerbehebung einbeziehen.\u003c/li\u003e\n\u003cli\u003eNeben der durchschnittlichen Latenz auch die Latenz der oberen 95% oder 99% messen.\u003c/li\u003e\n\u003cli\u003eSchritte, die durch automatische Tests oder Schemaüberprüfungen validiert werden können, als Kandidaten für kostengünstige Modelle einstufen.\u003c/li\u003e\n\u003cli\u003eFür Aufgaben mit Bezug zu personenbezogenen Daten, Sicherheit oder Regulierung separate Genehmigungs- und Protokollierungsrichtlinien anwenden.\u003c/li\u003e\n\u003cli\u003eRoutingkriterien festlegen, nach denen Ergebnisse mit geringer Vertrauenswürdigkeit auf Terra oder Sol hochgestuft werden.\u003c/li\u003e\n\u003cli\u003eMit realem Datenverkehr prüfen, ob der Wert der geringeren Latenz die zusätzlichen Kosten des Fast mode übersteigt.\u003c/li\u003e\n\u003c/ol\u003e\n\u003ch2\u003e\n\u003ca href=\"#bedeutung-und-grenzen\" class=\"anchor\" id=\"bedeutung-und-grenzen\"\u003e\u003c/a\u003eBedeutung und Grenzen\u003c/h2\u003e\n\u003cp\u003eDiese Neuausrichtung zeigt, dass sich der Maßstab im Wettbewerb der KI-Modelle von einem einzelnen Höchstwert hin zu den Kosten pro Ergebnis verschiebt. Werden Luna für umfangreiche wiederkehrende Aufgaben, Terra für alltägliche Wissensarbeit und Sol für mehrdeutige und wichtige Entscheidungen eingesetzt, lassen sich Intelligenz, Geschwindigkeit und Kosten je nach Aufgabe kombinieren.\u003c/p\u003e\n\u003cp\u003eAllerdings lässt sich anhand der öffentlich verfügbaren Informationen nur schwer trennen, in welchem Umfang die Preissenkung um 80% jeweils auf technische Effizienzsteigerungen und Marktstrategien zurückzuführen ist. Auch die Wirtschaftlichkeit kostengünstiger Modelle wird nicht allein durch den Tokenpreis bestimmt. Führt eine höhere Fehlerquote zu mehr Wiederholungen und menschlichen Prüfungen, können die Gesamtkosten der Aufgabe steigen.\u003c/p\u003e\n\u003cp\u003eDie entscheidende Kennzahl ist daher nicht der Preis eines einzelnen Modellaufrufs, sondern die Gesamtkosten für ein einzelnes Ergebnis, das die Überprüfung bestanden hat. Nur wenn Erfolgsquote, Anzahl der Wiederholungen, Latenz und Prüfungskosten für jedes Modell gemeinsam gemessen werden, lässt sich beurteilen, ob die Preissenkung von GPT-5.6 tatsächlich einen geschäftlichen Mehrwert schafft.\u003c/p\u003e\n","tags":["OpenAI","GPT-5.6","API-Preise","Schlusseffizienz","Agent"],"faqs":[{"question":"Wie hoch sind die geänderten API-Preise für GPT-5.6 Luna?","answer":"Mit Stand vom 30. Juli 2026 kostet Luna 0,20 Dollar pro 1 Million Eingabe-Token und 1,20 Dollar pro 1 Million Ausgabe-Token. Die von OpenAI bekannt gegebene Preissenkung gegenüber den bisherigen Preisen beträgt 80 %."},{"question":"Wie hoch sind die geänderten API-Preise für GPT-5.6 Terra?","answer":"Terra kostet 2 Dollar pro 1 Million Eingabe-Token und 12 Dollar pro 1 Million Ausgabe-Token. Die von OpenAI bekannt gegebene Preissenkung beträgt 20 %."},{"question":"Wurde auch der Preis von GPT-5.6 Sol gesenkt?","answer":"Nein. In dieser Ankündigung von OpenAI blieb der Preis für die Standard-Verarbeitung von Sol unverändert. Stattdessen wurde der Fast mode hinzugefügt, der bis zu 2,5-mal schneller als Standard ist und doppelt so viel kostet."},{"question":"Sinkt die Qualität der Modellantworten bei der Nutzung des Fast mode?","answer":"OpenAI erklärt, dass der Fast mode die Verarbeitungsgeschwindigkeit erhöht, ohne das Intelligenzniveau von Sol zu senken. Die Angabe „bis zu 2,5-mal“ bezeichnet jedoch eine Obergrenze; die tatsächliche Latenz kann je nach Länge der Anfrage, Ausgabemenge, Tool-Aufrufen und Systemauslastung variieren."},{"question":"Müssen bestehende Priority-Processing-Anfragen geändert werden?","answer":"Laut der Ankündigung von OpenAI funktioniert das `priority`-Tag bestehender API-Anfragen weiterhin und wird automatisch mit der Verarbeitung im Fast mode verknüpft. In einer Produktionsumgebung ist es sicherer, den Zeitpunkt der Anwendung und die tatsächlich abgerechneten Beträge separat zu überprüfen."},{"question":"Für welche Aufgaben eignet sich Luna?","answer":"Es eignet sich für umfangreiche, repetitive Aufgaben, bei denen die Regeln und die erwartete Ausgabe klar definiert sind und eine automatische Überprüfung möglich ist. Typische Beispiele sind die Klassifizierung von Dokumenten, die Datenextraktion, wiederholte Codeänderungen, die Ausführung von Tests, die Überprüfung von Inhalten und die Hintergrundautomatisierung."},{"question":"Welches Modell sollte man wählen, Terra oder Luna?","answer":"Wenn niedrige Kosten und ein hoher Durchsatz Vorrang haben und die Aufgabe klar definiert ist, kann zunächst Luna evaluiert werden. Wenn ein besseres Kontextverständnis und mehr Urteilsvermögen erforderlich sind, aber keine fortgeschrittenen Schlussfolgerungen auf dem Niveau von Sol, kann Terra geeignet sein."},{"question":"Sollte Sol nicht für alle Schritte eines Agenten verwendet werden?","answer":"Das ist möglich, kann jedoch die Kosteneffizienz verringern. Wenn Sol die Planung und Entscheidungen mit hohem Risiko übernimmt, während Luna oder Terra klar definierte Ausführungs- und Testaufgaben bearbeiten, lassen sich möglicherweise die Gesamtkosten senken und zugleich die Qualität der wichtigen Schritte aufrechterhalten."},{"question":"Beziehen sich die Aufgabenkosten von 6 % bei Luna auf einen Vergleich der Token-Preise?","answer":"Nein. Die von OpenAI genannten etwa 6 % sind die geschätzten Kosten pro Aufgabe, die erforderlich sind, um ein mit dem Vergleichsmodell vergleichbares Arbeitsergebnis zu erzielen. Dieser Wert ergibt sich nicht aus einer einfachen direkten Division der Token-Preise und ist als Vergleich zu verstehen, der die Evaluierungsaufgaben und die Erfolgsquote einbezieht."},{"question":"Wie sollte die tatsächliche Wirtschaftlichkeit eines API-Modells bewertet werden?","answer":"Dabei sollten nicht nur die Token-Preise, sondern auch die Erfolgsquote, die Anzahl der Wiederholungsversuche, die Kosten für Tool-Aufrufe, die Antwortlatenz, der Zeitaufwand für die menschliche Überprüfung und die Kosten der Fehlerbehebung berücksichtigt werden. Die nützlichste Kennzahl sind die Gesamtkosten pro Ergebnis, das die Überprüfung bestanden hat."}],"sources":[{"url":"https://openai.com/index/advancing-the-price-performance-frontier-with-gpt-5-6/","title":"Die Grenzen des Preis-Leistungs-Verhältnisses mit GPT-5.6 verschieben | OpenAI","type":"source"},{"url":"https://openai.com/index/gpt-5-6-frontier-intelligence-efficiency/","title":"Wie GPT-5.6 führende Intelligenz mit führender Effizienz vereint | OpenAI","type":"source"}],"images":[{"id":395,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6NDY2OSwicHVyIjoiYmxvYl9pZCJ9fQ==--5c50f46b468b0057808eb3e6351730cbce2f4b78/ai-4f6037ef.webp","is_representative":true,"generation_method":"ai_image","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"퍼즐, AI 칩 계층, 작업 컨베이어, 감소하는 동전 더미로 표현한 모델 선택 흐름","caption":"AI 모델의 작업 분배와 비용 절감, 검증 과정을 시각화한 개념도다.","description":null},"en":{"alt":"Model selection flow with puzzles, layered AI chips, a task conveyor, and shrinking coin stacks","caption":"The diagram visualizes AI task routing, cost reduction, and output verification.","description":null},"ja":{"alt":"パズル、階層化AIチップ、タスク用コンベア、減っていくコインで示すモデル選択フロー","caption":"AIモデルのタスク振り分け、コスト削減、検証の流れを表した概念図。","description":null},"es":{"alt":"Flujo de selección de modelos con piezas, chips de IA, cinta de tareas y pilas de monedas decrecientes","caption":"El diagrama representa la asignación de tareas, la reducción de costes y la verificación con IA.","description":null},"id":{"alt":"Alur pemilihan model dengan puzzle, chip AI bertingkat, konveyor tugas, dan tumpukan koin yang menyusut","caption":"Diagram ini menggambarkan perutean tugas AI, penghematan biaya, dan verifikasi hasil.","description":null},"pt":{"alt":"Fluxo de seleção de modelos com peças, chips de IA, esteira de tarefas e pilhas de moedas decrescentes","caption":"O diagrama mostra o roteamento de tarefas, a redução de custos e a verificação por IA.","description":null},"zh-hant":{"alt":"以拼圖、分層 AI 晶片、任務輸送帶與遞減硬幣堆呈現模型選擇流程","caption":"此概念圖呈現 AI 任務分流、成本降低與結果驗證流程。","description":null},"de":{"alt":"Modellauswahl mit Puzzleteilen, gestaffelten KI-Chips, Aufgabenband und schrumpfenden Münzstapeln","caption":"Die Grafik veranschaulicht KI-Aufgabenverteilung, Kostensenkung und Ergebnisprüfung.","description":null}}},{"id":396,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6NDY3NSwicHVyIjoiYmxvYl9pZCJ9fQ==--920476799a53738205d619a3a057685b5af9d05d/ai-334533bc.webp","is_representative":false,"generation_method":"ai_image","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"AI 모델별 처리 흐름과 속도, 비용, 하드웨어 구성을 비교한 인포그래픽","caption":"세 가지 AI 처리 경로의 성능과 비용 차이 및 연결된 인프라를 시각화한다.","description":null},"en":{"alt":"Infographic comparing AI model processing flows, speed, cost, and hardware infrastructure","caption":"Three AI processing paths visualize differences in performance, cost, and connected infrastructure.","description":null},"ja":{"alt":"AIモデル別の処理フロー、速度、コスト、ハードウェア構成を比較する図","caption":"3つのAI処理経路について、性能とコスト、接続インフラの違いを可視化している。","description":null},"es":{"alt":"Infografía comparativa de flujos, velocidad, coste e infraestructura de modelos de IA","caption":"Tres rutas de procesamiento de IA muestran diferencias de rendimiento, coste e infraestructura conectada.","description":null},"id":{"alt":"Infografik perbandingan alur, kecepatan, biaya, dan infrastruktur perangkat keras model AI","caption":"Tiga jalur pemrosesan AI memperlihatkan perbedaan kinerja, biaya, dan infrastruktur yang terhubung.","description":null},"pt":{"alt":"Infográfico comparando fluxos, velocidade, custo e infraestrutura de modelos de IA","caption":"Três rotas de processamento de IA mostram diferenças de desempenho, custo e infraestrutura conectada.","description":null},"zh-hant":{"alt":"比較各種 AI 模型處理流程、速度、成本與硬體架構的資訊圖表","caption":"三條 AI 處理路徑呈現效能、成本與連接基礎設施的差異。","description":null},"de":{"alt":"Infografik zum Vergleich von KI-Modellabläufen, Geschwindigkeit, Kosten und Hardware","caption":"Drei KI-Verarbeitungspfade zeigen Unterschiede bei Leistung, Kosten und verbundener Infrastruktur.","description":null}}}],"published_at":"2026-08-01T07:15:42+09:00","updated_at":"2026-08-01T07:15:42+09:00","license":"cc_by","translation_status":"reviewed","available_locales":["ko","en","ja","es"],"data_locales":["ko","en","ja","es","id","pt","zh-hant","de"],"url":"https://injoys.com/en/articles/openai-gpt-5-6-price-performance-model-routing"}