{"content_id":"flazlbamrl","slug":"why-most-ai-inference-will-remain-in-data-centers","locale":"de","schema_type":"TechArticle","category":"trends","category_name":"Trends","title":"Warum Inferenz in Rechenzentren trotz Fortschritten lokaler KI wahrscheinlich vorherrschend bleibt","summary":"Lokale KI wird beim Datenschutz, beim Offline-Betrieb und bei sofortigen Antworten eine wichtige Rolle spielen, doch höchste Leistung und Verarbeitung in großem Maßstab werden wahrscheinlich weiterhin hauptsächlich in Rechenzentren stattfinden. Die Hauptgründe sind sich verschiebende Leistungsmaßstäbe, Batching und eine hohe Auslastung von Beschleunigern, Hardware für Rechenzentren sowie immer komplexere Agentenaufgaben.","sponsorship_disclosure":null,"affiliate_disclosure":null,"commerce_disclosure":null,"author":{"name":"injoys","url":"https://injoys.com/ko/about"},"key_points":["Dass Open-Weight-Modelle verfügbar sind, bedeutet nicht automatisch, dass sie sich auf persönlichen Geräten effizient ausführen lassen.","Selbst wenn künftige Laptops die besten Modelle von heute ausführen können, könnten die damaligen Rechenzentrumsmodelle eine höhere Leistung und die Fähigkeit zu längeren Aufgaben bieten.","Rechenzentren können mehrere Anfragen dynamisch bündeln und Beschleuniger gemeinsam nutzen, um einen höheren Durchsatz und eine höhere Auslastung als persönliche Geräte zu erreichen.","Bei den Kosten lokaler Inferenz müssen neben dem Kaufpreis der GPU auch Abschreibung, Strom, Kühlung, Wartung und eine geringe Auslastung berücksichtigt werden.","Der tatsächliche Markt dürfte eher einer hybriden Struktur entsprechen, die beide Umgebungen je nach Aufgabe miteinander verbindet, als einem Szenario, in dem entweder die lokale Umgebung oder die Cloud verschwindet."],"content_markdown":"Mit der rasanten Entwicklung von Open-Weight-Modellen und kleinen Sprachmodellen wird immer wieder prognostiziert, dass letztlich jede AI auf PCs oder Smartphones laufen werde. Die lokale Ausführung bietet klare Vorteile: Sie senkt die API-Nutzungskosten, überträgt sensible Daten nicht nach außen und funktioniert auch ohne Internetverbindung.\n\nDas Wachstum lokaler AI und der Niedergang von Rechenzentrums-AI sind jedoch nicht dieselbe These. Selbst wenn künftig deutlich mehr AI auf persönlichen Geräten ausgeführt wird, dürften Rechenzentren gemessen am gesamten Rechenaufwand und an anspruchsvollen Aufgaben das Zentrum der Inferenz bleiben. Der Grund dafür liegt nicht nur in der Modellgröße, sondern im Zusammenspiel von Leistungswettbewerb, Nutzernachfrage, Batching, Hardwareauslastung und Gesamtbetriebskosten.\n\n## Drei Begriffe, die zunächst unterschieden werden müssen\n\nIn der Debatte über lokale AI werden häufig unterschiedliche Dimensionen vermischt.\n\n| Kategorie | Bedeutung | Gegenbegriff |\n|---|---|---|\n| Open Weight | Modell, dessen trainierte Modellgewichte heruntergeladen und im Rahmen einer festgelegten Lizenz verwendet werden können | Modell, dessen Gewichte nicht veröffentlicht sind |\n| Lokale·On-Device-Inferenz | Direkte Ausführung auf einem PC, Smartphone, in einem Fahrzeug oder auf unternehmenseigenen Geräten | Ausführung in einem externen Rechenzentrum |\n| Self-Hosting | Betrieb eines Modells auf einem vom Nutzer ausgewählten Server oder in einem ausgewählten Rechenzentrum | Nutzung der API des Modellanbieters |\n\nOpen Weight bedeutet nicht zwangsläufig lokale Ausführung. Unternehmen können Open-Weight-Modelle auf gemieteten GPU-Clustern oder in eigenen Rechenzentren als Dienst anbieten. Umgekehrt können Gerätehersteller nicht veröffentlichte kleine Modelle in Smartphones integrieren.\n\nDie eigentliche Frage lautet daher nicht, ob sich „öffentliche Modelle weiterentwickeln“, sondern in welcher Rechenumgebung die jeweilige Aufgabe hinsichtlich Leistung, Kosten, Datenschutz und Betrieb am vorteilhaftesten verarbeitet werden kann.\n\nAuch Open Weight bedeutet nicht automatisch vollständig quelloffen. Da sich die Bedingungen für Nutzung, Weiterverbreitung und abgeleitete Modelle je nach Modelllizenz unterscheiden, muss die jeweilige Lizenz vor einer kommerziellen Bereitstellung gesondert geprüft werden.\n\n## Künftige lokale Modelle können zu den heutigen Spitzenmodellen aufschließen\n\nFortschritte bei Quantisierung, Wissensdestillation, Pruning, der Optimierung von Inferenz-Engines und spezialisierten NPUs ermöglichen es, Aufgaben auf demselben Niveau mit weniger Speicher und Energie zu verarbeiten. Die Prognose, dass einige Fähigkeiten, die heute Server erfordern, in einigen Jahren auf Laptops oder Smartphones verlagert werden können, ist durchaus plausibel.\n\nDer Vergleichsmaßstab bleibt jedoch nicht unverändert. Während künftige lokale Modelle das Niveau der heutigen Spitzenmodelle erreichen, können sich auch Rechenzentrumsmodelle in folgende Richtungen weiterentwickeln.\n\n- Komplexere Schlussfolgerungen und Planung\n- Verarbeitung längerer Kontexte und umfangreicher Suchergebnisse\n- Multimodale Aufgaben, die Bild, Sprache und Video kombinieren\n- Zuverlässige Nutzung mehrerer Werkzeuge und externer Systeme\n- Schlussfolgerungen unter Nutzung mehrerer Agenten oder möglicher Lösungswege\n- Fähigkeit, während langer Aufgaben Fehler zu erkennen und zu beheben\n\nDie These, dass „die heutige Spitzenleistung eines Tages lokal umgesetzt werden kann“, unterscheidet sich daher von der These, dass „auch die zu diesem Zeitpunkt höchste Leistung lokal umgesetzt werden kann“. Erstere dürfte durch technologische Effizienzsteigerungen mit hoher Wahrscheinlichkeit Realität werden. Letztere könnte jedoch weiterhin schwierig bleiben, solange sich zugleich der Umfang von Stromversorgung, Speicher, Netzwerken und Beschleunigern in Rechenzentren weiterentwickelt.\n\n## Auch die Anforderungen an eine für Nutzer ausreichende Leistung steigen\n\nZu den typischen Aufgaben der frühen generativen AI gehörten die Beantwortung von Fragen, die Zusammenfassung kurzer Dokumente, E-Mail-Entwürfe und einfache Codegenerierung. Solche Aufgaben können auch kleine lokale Modelle sinnvoll erledigen.\n\nAI-Agenten hingegen lesen vollständige Code-Repositories, ändern mehrere Dateien, führen Tests aus und wiederholen Suchvorgänge sowie Aufrufe externer Werkzeuge. Forschungsagenten müssen über längere Zeit arbeiten, verschiedene Quellen vergleichen und Zwischenergebnisse aufbewahren. Agenten zur Automatisierung von Geschäftsprozessen müssen sogar Berechtigungen, Datenbanken und interne Unternehmenssysteme handhaben.\n\nBei langen Aufgaben summieren sich Fehler in den einzelnen Schritten. Selbst wenn die Erfolgsquote eines einzelnen Schritts hoch ist, kann die Wahrscheinlichkeit, die gesamte Aufgabe erfolgreich abzuschließen, stark sinken, wenn Dutzende Entscheidungen und Werkzeugaufrufe nacheinander ausgeführt werden. Deshalb bewerten Nutzer nicht mehr nur die Qualität einer einzelnen Antwort, sondern auch folgende Fähigkeiten.\n\n- Werden Ziel und Rahmenbedingungen über längere Zeit beibehalten?\n- Werden fehlgeschlagene Werkzeugaufrufe diagnostiziert und korrigiert?\n- Werden unbestätigte Inhalte nicht als Tatsachen dargestellt?\n- Wird der umfassende Kontext von Code und Dokumenten konsistent verstanden?\n- Wird die Zahl der erforderlichen menschlichen Eingriffe reduziert?\n\nWenn ein leistungsfähigeres Modell Nacharbeit und Überwachungsaufwand reduziert, können die gesamten Arbeitskosten trotz eines höheren Preises pro Token niedriger ausfallen. Bei kurzen, wiederkehrenden Aufgaben kann dagegen ein günstiges lokales Modell vernünftiger sein. Entscheidend sind letztlich nicht allein die Modellkosten, sondern die Kosten pro abgeschlossener Aufgabe und das Fehlerrisiko.\n\n## Die zentralen Vorteile von Rechenzentren sind Batching und gemeinsame Ressourcennutzung\n\nDie Token-Erzeugung großer Sprachmodelle hängt in hohem Maße davon ab, dass Modellgewichte wiederholt aus dem Speicher des Beschleunigers gelesen werden. Wird nur eine einzelne Anfrage verarbeitet, werden große parallele Recheneinheiten und die verfügbare Speicherbandbreite möglicherweise nicht vollständig genutzt.\n\nServing-Systeme bündeln Anfragen verschiedener Nutzer in Batches und führen Matrixoperationen aus. Dabei werden mehrere Anfragen innerhalb eines Rechenvorgangs gemeinsam verarbeitet, wodurch Rechendichte und Durchsatz steigen. Kontinuierliches Batching, bei dem abgeschlossene Anfragen entfernt und neue hinzugefügt werden, ist eine Schlüsseltechnologie zur Steigerung der Auslastung in realen Diensten mit unterschiedlichen Eingabe- und Ausgabelängen.\n\nBatching beseitigt die Kosten nicht vollständig proportional zur Zahl der Anfragen. Für jede Anfrage müssen Token und ein KV-Cache berechnet werden, und mit wachsender Batch-Größe steigen auch Speicherverbrauch und Wartezeit. Betreiber müssen zwischen folgenden Faktoren abwägen.\n\n- Zahl der verarbeiteten Token pro Sekunde\n- Latenz bis zur Ausgabe des ersten Tokens\n- Latenz der ausgegebenen Token je Anfrage\n- Vom KV-Cache belegter Speicher\n- Mischung aus Anfragen mit langem und kurzem Kontext\n- Service-Level-Ziele und maximale Zahl gleichzeitiger Anfragen\n\nDennoch gehen bei groß angelegten Diensten kontinuierlich Anfragen ein, sodass Leerlaufzeiten leichter reduziert werden können als bei persönlichen GPUs. Modellinstanzen können von mehreren Kunden gemeinsam genutzt, die Zahl der Server dem Datenverkehr angepasst und bestimmte Aufgaben auf geeignete Beschleuniger verlagert werden.\n\n## Persönliche GPUs weisen häufig eine niedrige durchschnittliche Auslastung auf\n\nPersönliche Geräte stehen bei Bedarf sofort zur Verfügung, können aber den größten Teil des Tages im Bereitschaftszustand verbringen. Selbst wenn mehrere Agenten gleichzeitig ausgeführt werden, ist es schwierig, das System wie bei großen Diensten kontinuierlich mit Anfragen unterschiedlicher Länge auszulasten.\n\nDie Wirtschaftlichkeit lokaler Geräte hängt nicht von ihrer maximalen Verarbeitungsgeschwindigkeit, sondern von ihrer tatsächlichen Auslastung ab. Selbst wenn man eine teure GPU besitzt, steigen die Kapitalkosten pro effektivem Token, wenn sie nur wenige Stunden pro Woche genutzt wird. Bei kontinuierlichen Aufgaben wie Videoproduktion, Softwaretests oder der Verarbeitung großer Dokumentenmengen kann die Auslastung lokaler Geräte dagegen steigen und einen Kostenvorteil schaffen.\n\nWird ein lokaler Server mehreren Personen zugänglich gemacht, steigen Auslastung und Möglichkeiten zum Batching. In diesem Moment werden jedoch Authentifizierung, Zugriffskontrolle, Aufgabenwarteschlangen, Störungsbehebung, Kühlung und Überwachung erforderlich. Trotz des kleineren Umfangs entstehen damit ähnliche Probleme wie beim Betrieb eines Rechenzentrums.\n\n## Beschleuniger für Rechenzentren verfolgen andere Zwecke und Konfigurationen\n\nAuch Consumer-GPUs sind leistungsfähig bei generativer AI, werden jedoch unter gemeinsamer Berücksichtigung von Spielen, Grafik und Universalberechnungen entwickelt. Beschleuniger für Rechenzentren konzentrieren sich dagegen auf große Mengen hochbandbreitigen Speichers, Verbindungen zwischen Beschleunigern, Skalierung auf Rack-Ebene und niedrigpräzise AI-Berechnungen.\n\nDie GeForce RTX 4090 ist eine Consumer-GPU, während NVIDIA B200 ein AI-Beschleuniger für Rechenzentren ist. Nach den vom Autor verglichenen Schätzungen bietet NVIDIA B200 bei vergleichbarer Leistungsaufnahme eine etwa 3-mal höhere Rechenleistung als die RTX 4090, während die Speicherbandbreite annähernd 4-mal so hoch ist. Dieser Unterschied verschafft Rechenzentren einen Vorteil, wenn große Modelle in den Speicher geladen und mit hohem Durchsatz als Dienst bereitgestellt werden.\n\nDie Leistungswerte beider Produkte dürfen jedoch nicht als einfaches Verhältnis verglichen werden. Die veröffentlichten Angaben zur AI-Rechenleistung können sich hinsichtlich Präzision, Nutzung von Sparsity, Leistungsgrenze und Systemkonfiguration unterscheiden. Die tatsächliche Inferenzleistung muss anhand von Benchmarks beurteilt werden, bei denen Modellarchitektur, Quantisierungsverfahren, Batch-Größe, Kontextlänge und Software-Stack identisch abgestimmt sind.\n\nWird ein großes Modell auf mehrere Beschleuniger verteilt, entstehen zudem Kommunikationskosten. Rechenzentren bieten schnelle Interconnects und optimierte Netzwerke, doch verteilte Inferenz ist nicht kostenlos. Bei kleinen Modellen kann die Ausführung auf einer einzelnen Consumer-GPU sogar einfacher und effizienter sein.\n\n## So lassen sich die tatsächlichen Kosten lokaler Inferenz berechnen\n\nIn der Rechnung „Die GPU wurde gekauft, also ist die anschließende Inferenz kostenlos“ fehlen Kapital- und Betriebskosten. Alle folgenden Posten müssen berücksichtigt werden.\n\n**Lokale Gesamtbetriebskosten**\n\n`Kaufpreis - erwarteter Wiederverkaufswert + Stromkosten + Kühlungskosten + Reparatur·Ersatzkosten + Wert der Betriebszeit`\n\nTeilt man diesen Betrag durch die Zahl der tatsächlich erzeugten effektiven Token oder abgeschlossenen Aufgaben, ergibt sich ein vergleichbarer Stückpreis. Genauer ist eine Berechnung auf Basis der nach der Prüfung nutzbaren Ergebnisse statt lediglich der ausgegebenen Token.\n\nDie Stromkosten lassen sich wie folgt schätzen.\n\n`durchschnittliche Leistungsaufnahme (kW) × Laufzeit (h) × Strompreis`\n\nDabei müssen auch Verluste des Netzteils sowie die Leistungsaufnahme von CPU, Speicher, Datenträgern und Kühlgeräten berücksichtigt werden. Da sich regionale Strompreise und Gerätenutzungszeiten erheblich unterscheiden, ist es nicht angemessen, einen festen monatlichen Strombetrag anzugeben, der für alle Nutzer gilt.\n\nDie **Cloud-Gesamtkosten** können neben API- oder Abonnementgebühren auch Datenübertragung, Wartezeit, Kosten eines Anbieterwechsels, Nutzungsbeschränkungen und die Kosten für den Umgang mit sensiblen Informationen umfassen. Bei geringer oder unregelmäßiger Nutzung sind nutzungsabhängige Dienste häufig vorteilhaft. Für kontinuierliche und vorhersehbare Aufgaben in großem Umfang können dagegen eigene Geräte oder reservierte Infrastruktur günstiger sein.\n\n## Bereiche, in denen lokale AI eindeutig im Vorteil ist\n\nDie Wirtschaftlichkeit von Rechenzentren beseitigt nicht die Notwendigkeit lokaler AI. Unter folgenden Bedingungen können Datenkontrolle, Verfügbarkeit oder Reaktionszeit wichtiger sein als das beste Modell.\n\n| Situation | Vorteil lokaler Ausführung | Zu prüfende Einschränkungen |\n|---|---|---|\n| Offline-Umgebung | Funktioniert unabhängig von Internetausfällen oder Kommunikationsbeschränkungen | Geräteleistung und Akkuverbrauch |\n| Verarbeitung sensibler Informationen | Rohdaten müssen nicht an externe Server gesendet werden | Schutz vor Gerätediebstahl, Schadsoftware und Zugriff auf lokale Protokolle |\n| Tastatur·Sprachassistenz | Niedrige Latenz und unmittelbare Reaktion | Modellgröße und Genauigkeit |\n| Wiederkehrende kleine Klassifizierungsaufgaben | Niedrige Grenzkosten bei ausreichender Nutzung | Anfängliche Entwicklungs-·Gerätekosten |\n| Fahrzeug-·Fabrik-·Vor-Ort-Steuerung | Schnelle Entscheidungen ohne Netzwerk-Roundtrip | Sicherheitsprüfung und Aktualisierungssystem |\n| Personalisierte Funktionen | Nutzung des auf dem Gerät vorhandenen Nutzerkontexts | Berechtigungsverwaltung und Datenlöschung |\n\nAuch Datenschutz lässt sich nicht dichotom nach dem Muster „lokal ist sicher, Cloud ist riskant“ beurteilen. Ist ein lokales Gerät infiziert oder sein Datenträger nicht verschlüsselt, können Daten offengelegt werden. Umgekehrt können auch Cloud-Dienste Beschränkungen der Datenaufbewahrung, Verschlüsselung und isolierte Ausführungsumgebungen bereitstellen. Nutzer müssen jedoch die tatsächliche technische Struktur und die Vertragsbedingungen prüfen.\n\n## Die wahrscheinlichste Form ist hybride AI\n\nLokale Systeme und Rechenzentren werden einander wahrscheinlich nicht vollständig ersetzen, sondern unterschiedliche Rollen übernehmen.\n\n1. Das Gerät verarbeitet Spracherkennung, die Entfernung personenbezogener Daten, kurze Klassifizierungen und einfache Generierung.\n2. Ein lokaler Router bewertet Schwierigkeitsgrad und Sensibilität der Aufgabe.\n3. Nur wenn komplexe Schlussfolgerungen, lange Kontexte oder umfangreiche Suchvorgänge erforderlich sind, wird ein Rechenzentrumsmodell aufgerufen.\n4. Ein Teil des Ergebnisses wird lokal überprüft oder mit Nutzerdaten kombiniert.\n5. Wird die Verbindung unterbrochen, erfolgt der Wechsel zu einem lokalen Modell mit eingeschränktem Funktionsumfang.\n\nDiese Struktur reduziert die Zahl der Cloud-Aufrufe und ermöglicht zugleich bei Bedarf den Einsatz leistungsfähiger Modelle. Anbieter können kleine Modelle für Filterung, Routing und die Erstellung von Entwürfen einsetzen und große Modelle nur schwierigen Anfragen zuweisen. Nutzer können zudem öffentliche Modelle lokal ausführen und ein separates Rechenzentrumsmodell als Hilfsmittel anbinden.\n\n## Zunächst muss festgelegt werden, anhand welcher Kennzahl „der Großteil der Inferenz“ gemessen wird\n\nDer Anteil lokaler AI und von Rechenzentrums-AI kann je nach Maßeinheit völlig unterschiedlich erscheinen. Dieser Unterschied wird in einfachen Debatten über Marktanteile häufig übersehen.\n\n- **Zahl der Anfragen:** Nimmt die Zahl kurzer Autovervollständigungen oder Klassifizierungen auf Smartphones zu, kann der lokale Anteil hoch sein.\n- **Zahl der erzeugten Token:** Konzentrieren sich lange Dokumente und Agentenaufgaben in der Cloud, kann der Anteil der Rechenzentren steigen.\n- **Rechenaufwand:** Schwierige Schlussfolgerungen, die Generierung mehrerer Kandidaten und multimodale Verarbeitung können den gesamten Rechenaufwand der Rechenzentren erhöhen.\n- **Ausgaben:** Teure Unternehmensdienste und Infrastruktur können den Ausgabenanteil der Rechenzentren erhöhen.\n- **Vom Nutzer wahrgenommene Nutzungszeit:** Aufgrund ständig aktiver lokaler Assistenzfunktionen kann der Eindruck entstehen, lokale AI häufiger zu verwenden.\n\nIn Zukunft könnte daher die Zahl lokaler Anfragen steigen, während sich der gesamte AI-Rechenaufwand, anspruchsvolle Aufgaben und die damit verbundenen Ausgaben zugleich in Rechenzentren konzentrieren. Sowohl die Aussage „jede AI wird lokal“ als auch „lokale AI ist unwichtig“ übersieht diesen Unterschied.\n\n## Faktoren, die die Prognose verändern können\n\nDie Prognose einer Dominanz der Rechenzentren ist kein feststehendes Gesetz. Bei folgenden Entwicklungen könnte der lokale Anteil schneller wachsen als erwartet.\n\n- Wenn die Fähigkeiten von Modellen in vielen Arbeitsbereichen tatsächlich ein Sättigungsniveau erreichen und der Wert leistungsfähigerer Modelle abnimmt\n- Wenn energieeffiziente Geräte mit hoher Speicherkapazität und -bandbreite breite Verbreitung finden\n- Wenn Destillation und Quantisierung Modelle stark verkleinern, ohne dass anspruchsvolle Fähigkeiten zur Schlussfolgerung wesentlich verloren gehen\n- Wenn Datenschutz-·nationale Sicherheitsvorschriften die Übertragung an externe Server stark einschränken\n- Wenn Einschränkungen bei Stromnetzen, Kühlwasser, Halbleiterversorgung oder Genehmigungen den Ausbau von Rechenzentren verlangsamen\n- Wenn Technologien und Vergütungssysteme zur sicheren Bündelung verteilter Geräteressourcen ausgereift sind\n\nWenn Agentenaufgaben dagegen länger werden, Videogenerierung und multimodale Echtzeitverarbeitung allgemeine Verbreitung finden und sich Auslastung sowie Energieeffizienz der Beschleuniger in Rechenzentren kontinuierlich verbessern, könnte sich der Vorteil zentralisierter Inferenz verstärken.\n\n## Fazit\n\nLokale AI ist keine Randtechnologie, die verschwinden wird. Bei Smartphone-Assistenzfunktionen, der Verarbeitung sensibler Informationen, Offline-Aufgaben und Diensten, bei denen Latenz entscheidend ist, dürfte sie zu einer unverzichtbaren Ebene werden. Open-Weight-Modelle erweitern außerdem die Wahlmöglichkeiten und die Fähigkeit zum Self-Hosting und tragen dazu bei, die Abhängigkeit von Anbietern zu mindern.\n\nEs ist jedoch unwahrscheinlich, dass allein die Effizienzsteigerung der Modelle Rechenzentren überflüssig macht. Die Maßstäbe für Spitzenleistung und die Anforderungen der Nutzer steigen gemeinsam, während Rechenzentren strukturelle Vorteile bei Batching, hoher Auslastung von Beschleunigern, großen Mengen hochbandbreitigen Speichers und gemeinsamer Ressourcennutzung besitzen.\n\nDie überzeugendste langfristige Prognose ist weder ein Sieg lokaler Systeme noch ein Cloud-Monopol. Wahrscheinlicher ist eine mehrstufige Struktur, in der kurze, sensible und sofortige Aufgaben auf dem Gerät verarbeitet werden, während komplexe, lange und kostspielige Aufgaben an Rechenzentren gehen. In diesem Umfeld liegt die entscheidende Wettbewerbsfähigkeit nicht in der Größe eines einzelnen Modells, sondern in Routing, Kostenkontrolle und Data Governance, durch die Aufgaben an den jeweils geeigneten Ausführungsort geleitet werden.","content_html":"\u003cp\u003eMit der rasanten Entwicklung von Open-Weight-Modellen und kleinen Sprachmodellen wird immer wieder prognostiziert, dass letztlich jede AI auf PCs oder Smartphones laufen werde. Die lokale Ausführung bietet klare Vorteile: Sie senkt die API-Nutzungskosten, überträgt sensible Daten nicht nach außen und funktioniert auch ohne Internetverbindung.\u003c/p\u003e\n\u003cp\u003eDas Wachstum lokaler AI und der Niedergang von Rechenzentrums-AI sind jedoch nicht dieselbe These. Selbst wenn künftig deutlich mehr AI auf persönlichen Geräten ausgeführt wird, dürften Rechenzentren gemessen am gesamten Rechenaufwand und an anspruchsvollen Aufgaben das Zentrum der Inferenz bleiben. Der Grund dafür liegt nicht nur in der Modellgröße, sondern im Zusammenspiel von Leistungswettbewerb, Nutzernachfrage, Batching, Hardwareauslastung und Gesamtbetriebskosten.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#drei-begriffe-die-zun%C3%A4chst-unterschieden-werden-m%C3%BCssen\" class=\"anchor\" id=\"drei-begriffe-die-zunächst-unterschieden-werden-müssen\"\u003e\u003c/a\u003eDrei Begriffe, die zunächst unterschieden werden müssen\u003c/h2\u003e\n\u003cp\u003eIn der Debatte über lokale AI werden häufig unterschiedliche Dimensionen vermischt.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eKategorie\u003c/th\u003e\n\u003cth\u003eBedeutung\u003c/th\u003e\n\u003cth\u003eGegenbegriff\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Kategorie\"\u003eOpen Weight\u003c/td\u003e\n\u003ctd data-label=\"Bedeutung\"\u003eModell, dessen trainierte Modellgewichte heruntergeladen und im Rahmen einer festgelegten Lizenz verwendet werden können\u003c/td\u003e\n\u003ctd data-label=\"Gegenbegriff\"\u003eModell, dessen Gewichte nicht veröffentlicht sind\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Kategorie\"\u003eLokale·On-Device-Inferenz\u003c/td\u003e\n\u003ctd data-label=\"Bedeutung\"\u003eDirekte Ausführung auf einem PC, Smartphone, in einem Fahrzeug oder auf unternehmenseigenen Geräten\u003c/td\u003e\n\u003ctd data-label=\"Gegenbegriff\"\u003eAusführung in einem externen Rechenzentrum\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Kategorie\"\u003eSelf-Hosting\u003c/td\u003e\n\u003ctd data-label=\"Bedeutung\"\u003eBetrieb eines Modells auf einem vom Nutzer ausgewählten Server oder in einem ausgewählten Rechenzentrum\u003c/td\u003e\n\u003ctd data-label=\"Gegenbegriff\"\u003eNutzung der API des Modellanbieters\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eOpen Weight bedeutet nicht zwangsläufig lokale Ausführung. Unternehmen können Open-Weight-Modelle auf gemieteten GPU-Clustern oder in eigenen Rechenzentren als Dienst anbieten. Umgekehrt können Gerätehersteller nicht veröffentlichte kleine Modelle in Smartphones integrieren.\u003c/p\u003e\n\u003cp\u003eDie eigentliche Frage lautet daher nicht, ob sich „öffentliche Modelle weiterentwickeln“, sondern in welcher Rechenumgebung die jeweilige Aufgabe hinsichtlich Leistung, Kosten, Datenschutz und Betrieb am vorteilhaftesten verarbeitet werden kann.\u003c/p\u003e\n\u003cp\u003eAuch Open Weight bedeutet nicht automatisch vollständig quelloffen. Da sich die Bedingungen für Nutzung, Weiterverbreitung und abgeleitete Modelle je nach Modelllizenz unterscheiden, muss die jeweilige Lizenz vor einer kommerziellen Bereitstellung gesondert geprüft werden.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#k%C3%BCnftige-lokale-modelle-k%C3%B6nnen-zu-den-heutigen-spitzenmodellen-aufschlie%C3%9Fen\" class=\"anchor\" id=\"künftige-lokale-modelle-können-zu-den-heutigen-spitzenmodellen-aufschließen\"\u003e\u003c/a\u003eKünftige lokale Modelle können zu den heutigen Spitzenmodellen aufschließen\u003c/h2\u003e\n\u003cp\u003eFortschritte bei Quantisierung, Wissensdestillation, Pruning, der Optimierung von Inferenz-Engines und spezialisierten NPUs ermöglichen es, Aufgaben auf demselben Niveau mit weniger Speicher und Energie zu verarbeiten. Die Prognose, dass einige Fähigkeiten, die heute Server erfordern, in einigen Jahren auf Laptops oder Smartphones verlagert werden können, ist durchaus plausibel.\u003c/p\u003e\n\u003cp\u003eDer Vergleichsmaßstab bleibt jedoch nicht unverändert. Während künftige lokale Modelle das Niveau der heutigen Spitzenmodelle erreichen, können sich auch Rechenzentrumsmodelle in folgende Richtungen weiterentwickeln.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eKomplexere Schlussfolgerungen und Planung\u003c/li\u003e\n\u003cli\u003eVerarbeitung längerer Kontexte und umfangreicher Suchergebnisse\u003c/li\u003e\n\u003cli\u003eMultimodale Aufgaben, die Bild, Sprache und Video kombinieren\u003c/li\u003e\n\u003cli\u003eZuverlässige Nutzung mehrerer Werkzeuge und externer Systeme\u003c/li\u003e\n\u003cli\u003eSchlussfolgerungen unter Nutzung mehrerer Agenten oder möglicher Lösungswege\u003c/li\u003e\n\u003cli\u003eFähigkeit, während langer Aufgaben Fehler zu erkennen und zu beheben\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eDie These, dass „die heutige Spitzenleistung eines Tages lokal umgesetzt werden kann“, unterscheidet sich daher von der These, dass „auch die zu diesem Zeitpunkt höchste Leistung lokal umgesetzt werden kann“. Erstere dürfte durch technologische Effizienzsteigerungen mit hoher Wahrscheinlichkeit Realität werden. Letztere könnte jedoch weiterhin schwierig bleiben, solange sich zugleich der Umfang von Stromversorgung, Speicher, Netzwerken und Beschleunigern in Rechenzentren weiterentwickelt.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#auch-die-anforderungen-an-eine-f%C3%BCr-nutzer-ausreichende-leistung-steigen\" class=\"anchor\" id=\"auch-die-anforderungen-an-eine-für-nutzer-ausreichende-leistung-steigen\"\u003e\u003c/a\u003eAuch die Anforderungen an eine für Nutzer ausreichende Leistung steigen\u003c/h2\u003e\n\u003cp\u003eZu den typischen Aufgaben der frühen generativen AI gehörten die Beantwortung von Fragen, die Zusammenfassung kurzer Dokumente, E-Mail-Entwürfe und einfache Codegenerierung. Solche Aufgaben können auch kleine lokale Modelle sinnvoll erledigen.\u003c/p\u003e\n\u003cp\u003eAI-Agenten hingegen lesen vollständige Code-Repositories, ändern mehrere Dateien, führen Tests aus und wiederholen Suchvorgänge sowie Aufrufe externer Werkzeuge. Forschungsagenten müssen über längere Zeit arbeiten, verschiedene Quellen vergleichen und Zwischenergebnisse aufbewahren. Agenten zur Automatisierung von Geschäftsprozessen müssen sogar Berechtigungen, Datenbanken und interne Unternehmenssysteme handhaben.\u003c/p\u003e\n\u003cp\u003eBei langen Aufgaben summieren sich Fehler in den einzelnen Schritten. Selbst wenn die Erfolgsquote eines einzelnen Schritts hoch ist, kann die Wahrscheinlichkeit, die gesamte Aufgabe erfolgreich abzuschließen, stark sinken, wenn Dutzende Entscheidungen und Werkzeugaufrufe nacheinander ausgeführt werden. Deshalb bewerten Nutzer nicht mehr nur die Qualität einer einzelnen Antwort, sondern auch folgende Fähigkeiten.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eWerden Ziel und Rahmenbedingungen über längere Zeit beibehalten?\u003c/li\u003e\n\u003cli\u003eWerden fehlgeschlagene Werkzeugaufrufe diagnostiziert und korrigiert?\u003c/li\u003e\n\u003cli\u003eWerden unbestätigte Inhalte nicht als Tatsachen dargestellt?\u003c/li\u003e\n\u003cli\u003eWird der umfassende Kontext von Code und Dokumenten konsistent verstanden?\u003c/li\u003e\n\u003cli\u003eWird die Zahl der erforderlichen menschlichen Eingriffe reduziert?\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eWenn ein leistungsfähigeres Modell Nacharbeit und Überwachungsaufwand reduziert, können die gesamten Arbeitskosten trotz eines höheren Preises pro Token niedriger ausfallen. Bei kurzen, wiederkehrenden Aufgaben kann dagegen ein günstiges lokales Modell vernünftiger sein. Entscheidend sind letztlich nicht allein die Modellkosten, sondern die Kosten pro abgeschlossener Aufgabe und das Fehlerrisiko.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#die-zentralen-vorteile-von-rechenzentren-sind-batching-und-gemeinsame-ressourcennutzung\" class=\"anchor\" id=\"die-zentralen-vorteile-von-rechenzentren-sind-batching-und-gemeinsame-ressourcennutzung\"\u003e\u003c/a\u003eDie zentralen Vorteile von Rechenzentren sind Batching und gemeinsame Ressourcennutzung\u003c/h2\u003e\n\u003cp\u003eDie Token-Erzeugung großer Sprachmodelle hängt in hohem Maße davon ab, dass Modellgewichte wiederholt aus dem Speicher des Beschleunigers gelesen werden. Wird nur eine einzelne Anfrage verarbeitet, werden große parallele Recheneinheiten und die verfügbare Speicherbandbreite möglicherweise nicht vollständig genutzt.\u003c/p\u003e\n\u003cp\u003eServing-Systeme bündeln Anfragen verschiedener Nutzer in Batches und führen Matrixoperationen aus. Dabei werden mehrere Anfragen innerhalb eines Rechenvorgangs gemeinsam verarbeitet, wodurch Rechendichte und Durchsatz steigen. Kontinuierliches Batching, bei dem abgeschlossene Anfragen entfernt und neue hinzugefügt werden, ist eine Schlüsseltechnologie zur Steigerung der Auslastung in realen Diensten mit unterschiedlichen Eingabe- und Ausgabelängen.\u003c/p\u003e\n\u003cp\u003eBatching beseitigt die Kosten nicht vollständig proportional zur Zahl der Anfragen. Für jede Anfrage müssen Token und ein KV-Cache berechnet werden, und mit wachsender Batch-Größe steigen auch Speicherverbrauch und Wartezeit. Betreiber müssen zwischen folgenden Faktoren abwägen.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eZahl der verarbeiteten Token pro Sekunde\u003c/li\u003e\n\u003cli\u003eLatenz bis zur Ausgabe des ersten Tokens\u003c/li\u003e\n\u003cli\u003eLatenz der ausgegebenen Token je Anfrage\u003c/li\u003e\n\u003cli\u003eVom KV-Cache belegter Speicher\u003c/li\u003e\n\u003cli\u003eMischung aus Anfragen mit langem und kurzem Kontext\u003c/li\u003e\n\u003cli\u003eService-Level-Ziele und maximale Zahl gleichzeitiger Anfragen\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eDennoch gehen bei groß angelegten Diensten kontinuierlich Anfragen ein, sodass Leerlaufzeiten leichter reduziert werden können als bei persönlichen GPUs. Modellinstanzen können von mehreren Kunden gemeinsam genutzt, die Zahl der Server dem Datenverkehr angepasst und bestimmte Aufgaben auf geeignete Beschleuniger verlagert werden.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#pers%C3%B6nliche-gpus-weisen-h%C3%A4ufig-eine-niedrige-durchschnittliche-auslastung-auf\" class=\"anchor\" id=\"persönliche-gpus-weisen-häufig-eine-niedrige-durchschnittliche-auslastung-auf\"\u003e\u003c/a\u003ePersönliche GPUs weisen häufig eine niedrige durchschnittliche Auslastung auf\u003c/h2\u003e\n\u003cp\u003ePersönliche Geräte stehen bei Bedarf sofort zur Verfügung, können aber den größten Teil des Tages im Bereitschaftszustand verbringen. Selbst wenn mehrere Agenten gleichzeitig ausgeführt werden, ist es schwierig, das System wie bei großen Diensten kontinuierlich mit Anfragen unterschiedlicher Länge auszulasten.\u003c/p\u003e\n\u003cp\u003eDie Wirtschaftlichkeit lokaler Geräte hängt nicht von ihrer maximalen Verarbeitungsgeschwindigkeit, sondern von ihrer tatsächlichen Auslastung ab. Selbst wenn man eine teure GPU besitzt, steigen die Kapitalkosten pro effektivem Token, wenn sie nur wenige Stunden pro Woche genutzt wird. Bei kontinuierlichen Aufgaben wie Videoproduktion, Softwaretests oder der Verarbeitung großer Dokumentenmengen kann die Auslastung lokaler Geräte dagegen steigen und einen Kostenvorteil schaffen.\u003c/p\u003e\n\u003cp\u003eWird ein lokaler Server mehreren Personen zugänglich gemacht, steigen Auslastung und Möglichkeiten zum Batching. In diesem Moment werden jedoch Authentifizierung, Zugriffskontrolle, Aufgabenwarteschlangen, Störungsbehebung, Kühlung und Überwachung erforderlich. Trotz des kleineren Umfangs entstehen damit ähnliche Probleme wie beim Betrieb eines Rechenzentrums.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#beschleuniger-f%C3%BCr-rechenzentren-verfolgen-andere-zwecke-und-konfigurationen\" class=\"anchor\" id=\"beschleuniger-für-rechenzentren-verfolgen-andere-zwecke-und-konfigurationen\"\u003e\u003c/a\u003eBeschleuniger für Rechenzentren verfolgen andere Zwecke und Konfigurationen\u003c/h2\u003e\n\u003cp\u003eAuch Consumer-GPUs sind leistungsfähig bei generativer AI, werden jedoch unter gemeinsamer Berücksichtigung von Spielen, Grafik und Universalberechnungen entwickelt. Beschleuniger für Rechenzentren konzentrieren sich dagegen auf große Mengen hochbandbreitigen Speichers, Verbindungen zwischen Beschleunigern, Skalierung auf Rack-Ebene und niedrigpräzise AI-Berechnungen.\u003c/p\u003e\n\u003cp\u003eDie GeForce RTX 4090 ist eine Consumer-GPU, während NVIDIA B200 ein AI-Beschleuniger für Rechenzentren ist. Nach den vom Autor verglichenen Schätzungen bietet NVIDIA B200 bei vergleichbarer Leistungsaufnahme eine etwa 3-mal höhere Rechenleistung als die RTX 4090, während die Speicherbandbreite annähernd 4-mal so hoch ist. Dieser Unterschied verschafft Rechenzentren einen Vorteil, wenn große Modelle in den Speicher geladen und mit hohem Durchsatz als Dienst bereitgestellt werden.\u003c/p\u003e\n\u003cp\u003eDie Leistungswerte beider Produkte dürfen jedoch nicht als einfaches Verhältnis verglichen werden. Die veröffentlichten Angaben zur AI-Rechenleistung können sich hinsichtlich Präzision, Nutzung von Sparsity, Leistungsgrenze und Systemkonfiguration unterscheiden. Die tatsächliche Inferenzleistung muss anhand von Benchmarks beurteilt werden, bei denen Modellarchitektur, Quantisierungsverfahren, Batch-Größe, Kontextlänge und Software-Stack identisch abgestimmt sind.\u003c/p\u003e\n\u003cp\u003eWird ein großes Modell auf mehrere Beschleuniger verteilt, entstehen zudem Kommunikationskosten. Rechenzentren bieten schnelle Interconnects und optimierte Netzwerke, doch verteilte Inferenz ist nicht kostenlos. Bei kleinen Modellen kann die Ausführung auf einer einzelnen Consumer-GPU sogar einfacher und effizienter sein.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#so-lassen-sich-die-tats%C3%A4chlichen-kosten-lokaler-inferenz-berechnen\" class=\"anchor\" id=\"so-lassen-sich-die-tatsächlichen-kosten-lokaler-inferenz-berechnen\"\u003e\u003c/a\u003eSo lassen sich die tatsächlichen Kosten lokaler Inferenz berechnen\u003c/h2\u003e\n\u003cp\u003eIn der Rechnung „Die GPU wurde gekauft, also ist die anschließende Inferenz kostenlos“ fehlen Kapital- und Betriebskosten. Alle folgenden Posten müssen berücksichtigt werden.\u003c/p\u003e\n\u003cp\u003e\u003cstrong\u003eLokale Gesamtbetriebskosten\u003c/strong\u003e\u003c/p\u003e\n\u003cp\u003e\u003ccode\u003eKaufpreis - erwarteter Wiederverkaufswert + Stromkosten + Kühlungskosten + Reparatur·Ersatzkosten + Wert der Betriebszeit\u003c/code\u003e\u003c/p\u003e\n\u003cp\u003eTeilt man diesen Betrag durch die Zahl der tatsächlich erzeugten effektiven Token oder abgeschlossenen Aufgaben, ergibt sich ein vergleichbarer Stückpreis. Genauer ist eine Berechnung auf Basis der nach der Prüfung nutzbaren Ergebnisse statt lediglich der ausgegebenen Token.\u003c/p\u003e\n\u003cp\u003eDie Stromkosten lassen sich wie folgt schätzen.\u003c/p\u003e\n\u003cp\u003e\u003ccode\u003edurchschnittliche Leistungsaufnahme (kW) × Laufzeit (h) × Strompreis\u003c/code\u003e\u003c/p\u003e\n\u003cp\u003eDabei müssen auch Verluste des Netzteils sowie die Leistungsaufnahme von CPU, Speicher, Datenträgern und Kühlgeräten berücksichtigt werden. Da sich regionale Strompreise und Gerätenutzungszeiten erheblich unterscheiden, ist es nicht angemessen, einen festen monatlichen Strombetrag anzugeben, der für alle Nutzer gilt.\u003c/p\u003e\n\u003cp\u003eDie \u003cstrong\u003eCloud-Gesamtkosten\u003c/strong\u003e können neben API- oder Abonnementgebühren auch Datenübertragung, Wartezeit, Kosten eines Anbieterwechsels, Nutzungsbeschränkungen und die Kosten für den Umgang mit sensiblen Informationen umfassen. Bei geringer oder unregelmäßiger Nutzung sind nutzungsabhängige Dienste häufig vorteilhaft. Für kontinuierliche und vorhersehbare Aufgaben in großem Umfang können dagegen eigene Geräte oder reservierte Infrastruktur günstiger sein.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#bereiche-in-denen-lokale-ai-eindeutig-im-vorteil-ist\" class=\"anchor\" id=\"bereiche-in-denen-lokale-ai-eindeutig-im-vorteil-ist\"\u003e\u003c/a\u003eBereiche, in denen lokale AI eindeutig im Vorteil ist\u003c/h2\u003e\n\u003cp\u003eDie Wirtschaftlichkeit von Rechenzentren beseitigt nicht die Notwendigkeit lokaler AI. Unter folgenden Bedingungen können Datenkontrolle, Verfügbarkeit oder Reaktionszeit wichtiger sein als das beste Modell.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eSituation\u003c/th\u003e\n\u003cth\u003eVorteil lokaler Ausführung\u003c/th\u003e\n\u003cth\u003eZu prüfende Einschränkungen\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Situation\"\u003eOffline-Umgebung\u003c/td\u003e\n\u003ctd data-label=\"Vorteil lokaler Ausführung\"\u003eFunktioniert unabhängig von Internetausfällen oder Kommunikationsbeschränkungen\u003c/td\u003e\n\u003ctd data-label=\"Zu prüfende Einschränkungen\"\u003eGeräteleistung und Akkuverbrauch\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Situation\"\u003eVerarbeitung sensibler Informationen\u003c/td\u003e\n\u003ctd data-label=\"Vorteil lokaler Ausführung\"\u003eRohdaten müssen nicht an externe Server gesendet werden\u003c/td\u003e\n\u003ctd data-label=\"Zu prüfende Einschränkungen\"\u003eSchutz vor Gerätediebstahl, Schadsoftware und Zugriff auf lokale Protokolle\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Situation\"\u003eTastatur·Sprachassistenz\u003c/td\u003e\n\u003ctd data-label=\"Vorteil lokaler Ausführung\"\u003eNiedrige Latenz und unmittelbare Reaktion\u003c/td\u003e\n\u003ctd data-label=\"Zu prüfende Einschränkungen\"\u003eModellgröße und Genauigkeit\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Situation\"\u003eWiederkehrende kleine Klassifizierungsaufgaben\u003c/td\u003e\n\u003ctd data-label=\"Vorteil lokaler Ausführung\"\u003eNiedrige Grenzkosten bei ausreichender Nutzung\u003c/td\u003e\n\u003ctd data-label=\"Zu prüfende Einschränkungen\"\u003eAnfängliche Entwicklungs-·Gerätekosten\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Situation\"\u003eFahrzeug-·Fabrik-·Vor-Ort-Steuerung\u003c/td\u003e\n\u003ctd data-label=\"Vorteil lokaler Ausführung\"\u003eSchnelle Entscheidungen ohne Netzwerk-Roundtrip\u003c/td\u003e\n\u003ctd data-label=\"Zu prüfende Einschränkungen\"\u003eSicherheitsprüfung und Aktualisierungssystem\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Situation\"\u003ePersonalisierte Funktionen\u003c/td\u003e\n\u003ctd data-label=\"Vorteil lokaler Ausführung\"\u003eNutzung des auf dem Gerät vorhandenen Nutzerkontexts\u003c/td\u003e\n\u003ctd data-label=\"Zu prüfende Einschränkungen\"\u003eBerechtigungsverwaltung und Datenlöschung\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eAuch Datenschutz lässt sich nicht dichotom nach dem Muster „lokal ist sicher, Cloud ist riskant“ beurteilen. Ist ein lokales Gerät infiziert oder sein Datenträger nicht verschlüsselt, können Daten offengelegt werden. Umgekehrt können auch Cloud-Dienste Beschränkungen der Datenaufbewahrung, Verschlüsselung und isolierte Ausführungsumgebungen bereitstellen. Nutzer müssen jedoch die tatsächliche technische Struktur und die Vertragsbedingungen prüfen.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#die-wahrscheinlichste-form-ist-hybride-ai\" class=\"anchor\" id=\"die-wahrscheinlichste-form-ist-hybride-ai\"\u003e\u003c/a\u003eDie wahrscheinlichste Form ist hybride AI\u003c/h2\u003e\n\u003cp\u003eLokale Systeme und Rechenzentren werden einander wahrscheinlich nicht vollständig ersetzen, sondern unterschiedliche Rollen übernehmen.\u003c/p\u003e\n\u003col\u003e\n\u003cli\u003eDas Gerät verarbeitet Spracherkennung, die Entfernung personenbezogener Daten, kurze Klassifizierungen und einfache Generierung.\u003c/li\u003e\n\u003cli\u003eEin lokaler Router bewertet Schwierigkeitsgrad und Sensibilität der Aufgabe.\u003c/li\u003e\n\u003cli\u003eNur wenn komplexe Schlussfolgerungen, lange Kontexte oder umfangreiche Suchvorgänge erforderlich sind, wird ein Rechenzentrumsmodell aufgerufen.\u003c/li\u003e\n\u003cli\u003eEin Teil des Ergebnisses wird lokal überprüft oder mit Nutzerdaten kombiniert.\u003c/li\u003e\n\u003cli\u003eWird die Verbindung unterbrochen, erfolgt der Wechsel zu einem lokalen Modell mit eingeschränktem Funktionsumfang.\u003c/li\u003e\n\u003c/ol\u003e\n\u003cp\u003eDiese Struktur reduziert die Zahl der Cloud-Aufrufe und ermöglicht zugleich bei Bedarf den Einsatz leistungsfähiger Modelle. Anbieter können kleine Modelle für Filterung, Routing und die Erstellung von Entwürfen einsetzen und große Modelle nur schwierigen Anfragen zuweisen. Nutzer können zudem öffentliche Modelle lokal ausführen und ein separates Rechenzentrumsmodell als Hilfsmittel anbinden.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#zun%C3%A4chst-muss-festgelegt-werden-anhand-welcher-kennzahl-der-gro%C3%9Fteil-der-inferenz-gemessen-wird\" class=\"anchor\" id=\"zunächst-muss-festgelegt-werden-anhand-welcher-kennzahl-der-großteil-der-inferenz-gemessen-wird\"\u003e\u003c/a\u003eZunächst muss festgelegt werden, anhand welcher Kennzahl „der Großteil der Inferenz“ gemessen wird\u003c/h2\u003e\n\u003cp\u003eDer Anteil lokaler AI und von Rechenzentrums-AI kann je nach Maßeinheit völlig unterschiedlich erscheinen. Dieser Unterschied wird in einfachen Debatten über Marktanteile häufig übersehen.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e\n\u003cstrong\u003eZahl der Anfragen:\u003c/strong\u003e Nimmt die Zahl kurzer Autovervollständigungen oder Klassifizierungen auf Smartphones zu, kann der lokale Anteil hoch sein.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eZahl der erzeugten Token:\u003c/strong\u003e Konzentrieren sich lange Dokumente und Agentenaufgaben in der Cloud, kann der Anteil der Rechenzentren steigen.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eRechenaufwand:\u003c/strong\u003e Schwierige Schlussfolgerungen, die Generierung mehrerer Kandidaten und multimodale Verarbeitung können den gesamten Rechenaufwand der Rechenzentren erhöhen.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eAusgaben:\u003c/strong\u003e Teure Unternehmensdienste und Infrastruktur können den Ausgabenanteil der Rechenzentren erhöhen.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eVom Nutzer wahrgenommene Nutzungszeit:\u003c/strong\u003e Aufgrund ständig aktiver lokaler Assistenzfunktionen kann der Eindruck entstehen, lokale AI häufiger zu verwenden.\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eIn Zukunft könnte daher die Zahl lokaler Anfragen steigen, während sich der gesamte AI-Rechenaufwand, anspruchsvolle Aufgaben und die damit verbundenen Ausgaben zugleich in Rechenzentren konzentrieren. Sowohl die Aussage „jede AI wird lokal“ als auch „lokale AI ist unwichtig“ übersieht diesen Unterschied.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#faktoren-die-die-prognose-ver%C3%A4ndern-k%C3%B6nnen\" class=\"anchor\" id=\"faktoren-die-die-prognose-verändern-können\"\u003e\u003c/a\u003eFaktoren, die die Prognose verändern können\u003c/h2\u003e\n\u003cp\u003eDie Prognose einer Dominanz der Rechenzentren ist kein feststehendes Gesetz. Bei folgenden Entwicklungen könnte der lokale Anteil schneller wachsen als erwartet.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eWenn die Fähigkeiten von Modellen in vielen Arbeitsbereichen tatsächlich ein Sättigungsniveau erreichen und der Wert leistungsfähigerer Modelle abnimmt\u003c/li\u003e\n\u003cli\u003eWenn energieeffiziente Geräte mit hoher Speicherkapazität und -bandbreite breite Verbreitung finden\u003c/li\u003e\n\u003cli\u003eWenn Destillation und Quantisierung Modelle stark verkleinern, ohne dass anspruchsvolle Fähigkeiten zur Schlussfolgerung wesentlich verloren gehen\u003c/li\u003e\n\u003cli\u003eWenn Datenschutz-·nationale Sicherheitsvorschriften die Übertragung an externe Server stark einschränken\u003c/li\u003e\n\u003cli\u003eWenn Einschränkungen bei Stromnetzen, Kühlwasser, Halbleiterversorgung oder Genehmigungen den Ausbau von Rechenzentren verlangsamen\u003c/li\u003e\n\u003cli\u003eWenn Technologien und Vergütungssysteme zur sicheren Bündelung verteilter Geräteressourcen ausgereift sind\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eWenn Agentenaufgaben dagegen länger werden, Videogenerierung und multimodale Echtzeitverarbeitung allgemeine Verbreitung finden und sich Auslastung sowie Energieeffizienz der Beschleuniger in Rechenzentren kontinuierlich verbessern, könnte sich der Vorteil zentralisierter Inferenz verstärken.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#fazit\" class=\"anchor\" id=\"fazit\"\u003e\u003c/a\u003eFazit\u003c/h2\u003e\n\u003cp\u003eLokale AI ist keine Randtechnologie, die verschwinden wird. Bei Smartphone-Assistenzfunktionen, der Verarbeitung sensibler Informationen, Offline-Aufgaben und Diensten, bei denen Latenz entscheidend ist, dürfte sie zu einer unverzichtbaren Ebene werden. Open-Weight-Modelle erweitern außerdem die Wahlmöglichkeiten und die Fähigkeit zum Self-Hosting und tragen dazu bei, die Abhängigkeit von Anbietern zu mindern.\u003c/p\u003e\n\u003cp\u003eEs ist jedoch unwahrscheinlich, dass allein die Effizienzsteigerung der Modelle Rechenzentren überflüssig macht. Die Maßstäbe für Spitzenleistung und die Anforderungen der Nutzer steigen gemeinsam, während Rechenzentren strukturelle Vorteile bei Batching, hoher Auslastung von Beschleunigern, großen Mengen hochbandbreitigen Speichers und gemeinsamer Ressourcennutzung besitzen.\u003c/p\u003e\n\u003cp\u003eDie überzeugendste langfristige Prognose ist weder ein Sieg lokaler Systeme noch ein Cloud-Monopol. Wahrscheinlicher ist eine mehrstufige Struktur, in der kurze, sensible und sofortige Aufgaben auf dem Gerät verarbeitet werden, während komplexe, lange und kostspielige Aufgaben an Rechenzentren gehen. In diesem Umfeld liegt die entscheidende Wettbewerbsfähigkeit nicht in der Größe eines einzelnen Modells, sondern in Routing, Kostenkontrolle und Data Governance, durch die Aufgaben an den jeweils geeigneten Ausführungsort geleitet werden.\u003c/p\u003e\n","tags":["Halbleiter","Generative KI","KI Rechenzentrum","Datenschutz","Halbleiter für KI","Technologiestrategie"],"faqs":[{"question":"Können alle Open-Weight-Modelle auf einem privaten PC ausgeführt werden?","answer":"Nein. Open Weight bedeutet, dass die Gewichte verfügbar sind, nicht, dass das Modell für private Hardware geeignet ist. Es hängt von der Modellgröße, der Präzision, der Speicherkapazität und den Lizenzbedingungen ab, und große Open-Weight-Modelle können mehrere Rechenzentrums-GPUs benötigen."},{"question":"Können zukünftige Smartphones die heutige beste AI-Leistung bieten?","answer":"Durch Fortschritte bei Quantisierung, Destillation und NPUs ist es sehr wahrscheinlich, dass ein Teil der heutigen Fähigkeiten auf Serverniveau auf Smartphones verlagert wird. Allerdings entwickeln sich auch die Rechenzentrumsmodelle jener Zeit weiter, weshalb dies nicht bedeutet, dass Smartphones selbst zu den dann besten Modellen aufschließen werden."},{"question":"Ist lokale AI nach dem Kauf einer GPU immer günstiger als eine API?","answer":"Nicht immer. Anschaffungskosten und Wiederverkaufswert, Strom, Kühlung, Wartung und die tatsächliche Auslastung müssen allesamt berücksichtigt werden. Bei geringer oder unregelmäßiger Nutzung können nutzungsabhängig abgerechnete Dienste vorteilhafter sein, während die lokale Ausführung bei umfangreichen Aufgaben, für die die Geräte kontinuierlich genutzt werden, günstiger sein kann."},{"question":"Warum senkt Batching bei der AI-Inferenz die Kosten?","answer":"Wenn mehrere Anfragen gemeinsam verarbeitet werden, lassen sich die Fähigkeiten des Beschleunigers zur parallelen Berechnung und seine Speicherbandbreite effizienter nutzen. Kontinuierliches Batching erhöht die Auslastung, indem abgeschlossene Anfragen entfernt und neue hinzugefügt werden, doch aufgrund des KV-Caches und der Latenz kann ein Batch nicht unbegrenzt vergrößert werden."},{"question":"Ist lokale AI beim Schutz personenbezogener Daten immer sicherer?","answer":"Sie bietet den Vorteil, dass Daten nicht an externe Server gesendet werden, wird dadurch aber nicht automatisch sicher. Erforderlich sind Geräteverschlüsselung, Schutz vor Schadsoftware sowie die Verwaltung von Zugriffsrechten, Protokollen und Backups. Bei der Nutzung der Cloud müssen die Datenspeicherung, die Verwendung für das Training sowie die Methoden zur Verschlüsselung und Isolierung geprüft werden."},{"question":"Kann man die AI-Leistung von Consumer-GPUs und Rechenzentrums-GPUs allein anhand der FLOPS vergleichen?","answer":"Nein. Präzision, Sparsität, Leistungsgrenzen und Messbedingungen können unterschiedlich sein. Die tatsächliche LLM-Inferenz hängt zudem stark von Speicherkapazität und -bandbreite, Batchgröße, Kontextlänge, KV-Cache, den Verbindungen zwischen den Beschleunigern und der Serving-Software ab."},{"question":"Für welche Aufgaben eignet sich lokale AI am besten?","answer":"Sie eignet sich für Aufgaben, bei denen Latenz und Datenkontrolle wichtig sind, etwa Tastatur-Autovervollständigung, kurze Zusammenfassungen und Klassifizierungen, Offline-Sprachverarbeitung, Vorverarbeitung sensibler Informationen und Steuerung vor Ort. Bei lang andauernden Agentenaufgaben, umfangreicher multimodaler Verarbeitung und Inferenz, die höchste Leistung erfordert, sind Rechenzentren wahrscheinlich im Vorteil."},{"question":"Was wird sich langfristig durchsetzen: lokale AI oder Cloud-AI?","answer":"Statt einer vollständigen Verdrängung der einen Seite durch die andere ist eine hybride Struktur wahrscheinlich. Dabei verarbeitet das Gerät einfache und sensible Aufgaben und sendet nur komplexe Anfragen an das Rechenzentrum. Auch wenn die Zahl der Anfragen lokal höher sein mag, können sich der gesamte Rechenaufwand und anspruchsvolle Aufgaben auf Rechenzentren konzentrieren."}],"sources":[{"url":"https://arxiv.org/abs/2309.06180","title":"Effiziente Speicherverwaltung für die Bereitstellung großer Sprachmodelle mit PagedAttention","type":"source"},{"url":"https://arxiv.org/abs/2206.02658","title":"Orca: Ein verteiltes Bereitstellungssystem für Transformer-basierte generative Modelle","type":"source"},{"url":"https://www.nvidia.com/en-us/data-center/technologies/blackwell-architecture/","title":"NVIDIA-Blackwell-Architektur","type":"data_point"},{"url":"https://www.nvidia.com/en-us/geforce/graphics-cards/40-series/rtx-4090/","title":"NVIDIA GeForce RTX 4090","type":"data_point"},{"url":"https://mlcommons.org/benchmarks/inference-datacenter/","title":"MLPerf-Inferenz: Rechenzentrum","type":"source"},{"url":"https://security.apple.com/blog/private-cloud-compute/","title":"Private Cloud Compute: Eine neue Dimension des KI-Datenschutzes in der Cloud","type":"source"},{"url":"https://developer.android.com/ai/gemini-nano","title":"Google AI Edge SDK mit Gemini Nano","type":"source"}],"images":[{"id":932,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6MTI2NTAsInB1ciI6ImJsb2JfaWQifX0=--34abeef97dfe63b15e2b649c2c6ae8c564924b28/ai-0fdb0281.webp","is_representative":true,"generation_method":"ai_photo","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"서버 랙 앞에서 소형 장비에 케이블을 연결하는 데이터센터 기술자","caption":"기술자가 데이터센터 서버 옆에서 네트워크 장비와 모니터링 노트북을 점검하고 있다.","description":null},"en":{"alt":"Data center technician connecting a cable to a compact device beside server racks","caption":"A technician checks network hardware and a monitoring laptop beside data center servers.","description":null},"ja":{"alt":"サーバーラックの前で小型機器にケーブルを接続するデータセンター技術者","caption":"技術者がデータセンターのサーバー脇でネットワーク機器と監視用ノートPCを点検している。","description":null},"es":{"alt":"Técnico de centro de datos conectando un cable a un equipo compacto junto a servidores","caption":"Un técnico revisa el equipo de red y un portátil de monitoreo junto a los servidores.","description":null},"id":{"alt":"Teknisi pusat data menghubungkan kabel ke perangkat ringkas di depan rak server","caption":"Teknisi memeriksa perangkat jaringan dan laptop pemantau di samping server pusat data.","description":null},"pt":{"alt":"Técnico de data center conectando um cabo a um equipamento compacto junto aos servidores","caption":"Um técnico verifica o equipamento de rede e um notebook de monitoramento ao lado dos servidores.","description":null},"zh-hant":{"alt":"資料中心技術人員在伺服器機櫃前為小型設備連接纜線","caption":"技術人員在資料中心伺服器旁檢查網路設備與監控筆電。","description":null},"de":{"alt":"Rechenzentrumstechniker verbindet vor Serverracks ein Kabel mit einem kompakten Gerät","caption":"Ein Techniker prüft neben den Servern Netzwerkhardware und einen Monitoring-Laptop.","description":null}}},{"id":933,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6MTI2NTYsInB1ciI6ImJsb2JfaWQifX0=--4b642e72ce104856aa40ed5bc224e337cf7877c2/ai-70dfbb70.webp","is_representative":false,"generation_method":"ai_image","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"노트북과 스마트폰의 로컬 AI가 서버, GPU, 데이터센터와 연결된 구조를 비교한 도식","caption":"로컬 기기와 대규모 데이터센터 추론 인프라의 연결과 자원 차이를 보여준다.","description":null},"en":{"alt":"Diagram comparing local AI on a laptop and phone with servers, GPUs, and data center infrastructure","caption":"The graphic contrasts connected local devices with large-scale data center inference resources.","description":null},"ja":{"alt":"ノートPCとスマートフォンのローカルAIをサーバー、GPU、データセンターと比較した図","caption":"ローカル端末と大規模なデータセンター推論基盤の接続や資源の違いを示している。","description":null},"es":{"alt":"Diagrama que compara IA local en portátil y móvil con servidores, GPU e infraestructura de centro de datos","caption":"El gráfico contrasta los dispositivos locales conectados con los recursos de inferencia de un centro de datos.","description":null},"id":{"alt":"Diagram perbandingan AI lokal di laptop dan ponsel dengan server, GPU, dan infrastruktur pusat data","caption":"Grafik ini membandingkan perangkat lokal terhubung dengan sumber daya inferensi pusat data berskala besar.","description":null},"pt":{"alt":"Diagrama compara IA local em notebook e celular com servidores, GPUs e infraestrutura de data center","caption":"O gráfico contrasta dispositivos locais conectados com recursos de inferência de data center em grande escala.","description":null},"zh-hant":{"alt":"比較筆電與手機本地 AI 和伺服器、GPU及資料中心基礎設施的示意圖","caption":"圖中對比連網的本地裝置與大規模資料中心推論資源。","description":null},"de":{"alt":"Schaubild vergleicht lokale KI auf Laptop und Smartphone mit Servern, GPUs und Rechenzentrum","caption":"Die Grafik stellt vernetzte lokale Geräte den umfangreichen Inferenzressourcen eines Rechenzentrums gegenüber.","description":null}}}],"published_at":"2026-08-28T11:45:54+09:00","updated_at":"2026-08-28T11:45:54+09:00","license":"cc_by","translation_status":"reviewed","available_locales":["ko","en","ja","es"],"data_locales":["ko","en","ja","es","id","pt","zh-hant","de"],"url":"https://injoys.com/en/articles/why-most-ai-inference-will-remain-in-data-centers"}