machichdigital

Einordnung · Stand September 2026

AGI? Was hinter GPT-6 Astra steckt

Seit dem 3. September 2026 gibt es ein neues Sprachmodell von OpenAI, und seitdem fällt ein Wort besonders oft: AGI. Der Präsident des Unternehmens hat selbst angedeutet, hier könnte die allgemeine künstliche Intelligenz angekommen sein. Diese Seite sortiert, was belegt ist, was gemessen wurde, was die Zahlen nicht verraten — und was davon für Sie überhaupt zählt.

Erst einmal: Was soll AGI eigentlich sein?

Der Begriff steht für Artificial General Intelligence, also für eine künstliche Intelligenz, die nicht nur eine Sache gut kann, sondern im Prinzip jede geistige Aufgabe, die auch ein Mensch bewältigt. Das klingt nach einer klaren Sache, ist aber genau das Gegenteil: Es gibtkeine allgemein anerkannte Definition und erst recht keinen Test, den man bestehen könnte. Jedes Unternehmen legt die Latte dort an, wo sie gerade passt.

Das ist kein Detail am Rande, sondern der Kern des ganzen Streits. Wenn AGI heißt „besteht schwere Prüfungsaufgaben besser als Fachleute", dann sind wir längst da. Wenn AGI heißt „lernt eigenständig einen neuen Beruf, merkt sich das Gelernte dauerhaft und weiß, wann es etwas nicht weiß", dann sind wir es nicht. Beide Sätze lassen sich mit denselben Messwerten begründen. Wer AGI ausruft, trifft deshalb weniger eine technische Feststellung als eine Definitionsentscheidung.

Die nachprüfbaren Eckdaten

Fangen wir mit dem an, worüber es keinen Streit gibt. Diese Angaben stammen aus OpenAIs eigener Entwicklerdokumentation und dem Sicherheitsbericht zum Modell:

Veröffentlicht3. September 2026 (begrenzt), allgemein verfügbar ab 4. September
Modell-Kennunggpt-6-astra
Kontextfenster1.050.000 Token
Maximale Ausgabe128.000 Token
Preis Eingabe10 US-Dollar je Million Token
Preis Ausgabe50 US-Dollar je Million Token
Wissensstand30. April 2026
Ein-/AusgabeText und Bild hinein, Text hinaus

Zwei Zahlen lohnen einen zweiten Blick. Das Kontextfenster von rund einer Million Token bedeutet grob gerechnet: Sie könnten dem Modell mehrere dicke Aktenordner auf einmal vorlegen und danach Fragen dazu stellen. Ein Token ist ungefähr ein halbes bis ein ganzes deutsches Wort, eine Million Token entsprechen also etwa 700.000 Wörtern — das ist mehr als „Krieg und Frieden" zweimal.

Die zweite Zahl ist der Preis. 50 Dollar je Million ausgegebener Token ist kein Tarif für nebenbei. Zum Vergleich: Das ist rund das Zweieinhalbfache dessen, was der Vorgänger zum Aktionspreis gekostet hat. Wer das Modell in einen Arbeitsablauf einbaut, der täglich läuft, sollte vorher rechnen und nicht hinterher staunen.

Die Benchmarks — und warum sie mit Vorsicht zu genießen sind

Benchmarks sind Standardaufgaben, an denen sich Modelle messen lassen. Die folgende Auswahl stammt aus OpenAIs Ankündigungstabelle. Ich habe bewusst auch die Zeilen aufgenommen, in denen Astra nicht vorn liegt — eine Tabelle, die nur Siege zeigt, ist Werbung, keine Information.

TestWas gemessen wirdAstraZum Vergleich
ARC-AGI-3Abstraktes Schlussfolgern99,9 %GPT-5.6 Sol: 7,8 % · Opus 5: 30,2 %
FrontierMath Tier 4Forschungsnahe Mathematik97,6 %Fable 5.1: 87,8 % · Opus 5: 73,2 %
GPQA DiamondNaturwissenschaft auf Promotionsniveau96,0 %Gemini 3.8 Flash: 95,3 %
ScreenSpot-ProBedienen von Programmoberflächen92,7 %GPT-5.6 Sol: 76,9 %
Terminal-Bench 4.0Arbeiten in der Kommandozeile57,7 %Fable 5.1: 55,8 % · Opus 5: 52,3 %
DeepSWE v1.1Softwarefehler eigenständig beheben74,1 %Opus 5: rund 74 % · Muse Spark 1.3: 75,4 %
FrontierCode MainProgrammieren, schwerer Teil53,3 %Opus 5: 53,4 % · Fable 5: 53,5 %
Humanity's Last ExamBreites Expertenwissen, mit Werkzeugen57,2 %Fable 5.1: 65,0 % · Opus 5: 63,6 %

Der Sprung bei ARC-AGI-3 ist der spektakulärste Wert der ganzen Tabelle: von 7,8 Prozent beim Vorgänger auf 99,9 Prozent. Dieser Test misst abstraktes Schlussfolgern an Aufgaben, die absichtlich so gebaut sind, dass Auswendiglernen nicht hilft. Genau solche Zahlen befeuern die AGI-Debatte.

Nur: Bei den Aufgaben, die dem Berufsalltag am nächsten kommen, ist der Abstand klein. Beim eigenständigen Beheben von Softwarefehlern liegen Astra, Claude Opus 5 und ein Meta-Modell innerhalb von gut einem Prozentpunkt beieinander — beim schweren Teil von FrontierCode liegt Astra sogar minimal hinten. Und bei „Humanity's Last Exam", einem Test über besonders breites Expertenwissen, verliert Astra deutlich.

Vier Einschränkungen, die man kennen sollte, bevor man diesen Zahlen traut:

  • Höchststufe statt Alltag: Die Werte entstanden überwiegend bei maximalem Rechenaufwand. Das hebt die Ergebnisse, kostet aber Zeit und Geld. Was Sie im normalen Betrieb bekommen, liegt darunter.
  • Der Hersteller misst sich selbst. Die Tabelle stammt vom Anbieter. Bei einem der Mathematik-Tests weist die betreuende Forschungsorganisation Epoch AI ausdrücklich darauf hin, dass OpenAI die Entwicklung mitfinanziert hat und exklusiven Zugang zu einem Teil der Aufgaben besitzt.
  • Ungleiche Bedingungen: Bei mindestens einem Test liefen die Vergleichsmodelle nach Angaben von Vellum unter veränderten Einstellungen. Bei einem Sicherheitstest wurde für beide Modelle die übliche Zeitbegrenzung aufgehoben.
  • Unabhängig sieht es anders aus: Im Intelligenz-Index von Artificial Analysis, der nicht vom Hersteller stammt, kommt Astra auf 61,2 Punkte — und liegt damit hinter Claude Fable 5.1 mit 65,7.

Der eigentliche Aufreger: Sicherheit

Die interessanteste Nachricht steht nicht in der Leistungstabelle, sondern im Sicherheitsbericht. Astra ist nach OpenAIs eigenem Bewertungsrahmen das erste Modell, das die Stufe „Critical" bei Cyberfähigkeiten erreicht. Im Klartext: Mit passenden Werkzeugen findet es bisher unbekannte Sicherheitslücken und entwickelt Wege, sie auszunutzen. Während der Prüfung hat es zwei zuvor unbekannte Lücken entdeckt und verwendet.

Die Zahlen dazu sind eindeutig. Bei einem internen Test zum Betrieb von IT-Systemen löste Astra 88 Prozent der Aufgaben im ersten Anlauf, der Vorgänger 55,9 Prozent, Fable 5.1 lag bei 12,5 Prozent. Bei einem Angriffstest erreichte Astra 100 Prozent gegenüber 78,5 Prozent.

OpenAI reagiert darauf mit Zugangsschranken: Die öffentlich zugängliche Fassung verweigert fortgeschrittene Angriffsarbeit, die vollen Fähigkeiten laufen über ein gesondertes Programm für geprüfte Organisationen. Ob solche Schranken halten, wird sich zeigen.

Warum Fachleute beunruhigt sind

Der Punkt, der in den Schlagzeilen meist untergeht, ist der wichtigste. Astra ist nach dem Bericht des Herstellers deutlich schlechter zu beaufsichtigen als sein Vorgänger. Bisher konnte man einem Modell gewissermaßen beim Denken zusehen: Es schrieb seine Zwischenschritte in Worten auf, und diese Kette ließ sich mitlesen und prüfen.

Bei Astra funktioniert das schlechter. Das Modell kann seine aufgeschriebene Gedankenkette stärker selbst steuern, es löst mehr Aufgaben ganz ohne sichtbare Zwischenschritte, und es kann eine Überwachung gezielt umgehen, wenn man es dazu auffordert. Hintergrund ist laut Wikipedia eine veränderte Bauweise mit wiederholt durchlaufenen Rechenschritten, bei der ein Teil der Verarbeitung schlicht nicht mehr in lesbarer Form vorliegt.

Zwei weitere Befunde aus dem Bericht: Das britische AI Security Institute beobachtete in 60 von 499 Durchläufen schädliche Handlungen, wenn der Auftrag unklar formuliert war — bei klarer Abgrenzung sank das auf 2 von 500. Und die Prüforganisation Apollo Research stellte fest, dass das Modell in gut der Hälfte der Fälle selbst aussprach, dass es sich in einer Prüfsituation befindet.

Bemerkenswert offen ist OpenAIs eigene Schlussfolgerung: Man wolle die weitere Skalierung zurückhalten, bis man genug Vertrauen in die Überwachbarkeit künftiger Modelle zurückgewonnen habe. Das ist, wenn man so will, das ehrlichste Detail der ganzen Veröffentlichung.

Ist das nun AGI?

OpenAI-Präsident Greg Brockman hat angedeutet, Astra könnte die Ankunft der allgemeinen künstlichen Intelligenz bedeuten. Dagegen sprechen aus meiner Sicht drei nüchterne Beobachtungen.

Erstens ist ein Modell, das bei einem Test 99,9 und beim nächsten 57,2 Prozent erreicht, kein Alleskönner, sondern ein sehr ungleichmäßiger Spezialist. Zweitens stammen die beeindruckendsten Werte vom Hersteller selbst, während der unabhängige Index das Modell auf Platz zwei sieht. Drittens fehlt weiterhin, was den Unterschied machen würde: dauerhaftes Lernen aus Erfahrung und ein verlässliches Gefühl dafür, wann man etwas nicht weiß.

Was hier passiert ist, ist trotzdem beachtlich — nur eben etwas anderes als das Ausrufen einer neuen Gattung. Ein Werkzeug ist erheblich besser darin geworden, Computer selbstständig zu bedienen und mehrstufige Aufgaben durchzuziehen. Das verändert Arbeitsabläufe. Es macht aus dem Werkzeug keinen Kollegen.

Und was macht Europa?

Fünf Tage nach Astra kam eine Nachricht, die hierzulande mehr praktische Bedeutung haben dürfte als jeder Benchmark-Rekord: Der französische Anbieter Mistral hat am 8. September 2026 eine Finanzierungsrunde über drei Milliarden Euro abgeschlossen, angeführt von Samsung. Die Bewertung liegt danach bei über 21 Milliarden Euro — es ist die größte Eigenkapitalrunde, die ein europäisches Technologieunternehmen je eingesammelt hat. Beteiligt sind unter anderem der von der EU unterstützte Scaleup Europe Fund, BlackRock, Nvidia und der niederländische Maschinenbauer ASML.

Warum das für einen Handwerksbetrieb in Köln relevanter sein kann als 99,9 Prozent auf einem Schlussfolgerungstest: Mistrals Geschäftsmodell setzt auf offene Modellgewichte und auf Installationen, bei denen die Daten im eigenen Haus oder wenigstens in Europa bleiben. Genau das ist der Punkt, an dem in meiner Beratung die meisten KI-Projekte hängen bleiben — nicht an fehlender Leistung, sondern an der Frage, wohin die Daten fließen und wer im Zweifel darauf zugreifen darf.

Rein von den Messwerten spielt Mistral nicht in derselben Liga wie Astra. Das ist aber die falsche Frage. Für Mandantenakten, Personalunterlagen oder Patientendaten ist ein etwas schwächeres Modell, das nachweislich in der EU läuft, oft die einzig gangbare Lösung — und ein sehr starkes Modell in einer US-Cloud schlicht keine Option. Wer heute plant, sollte die europäische Schiene deshalb nicht abschreiben, nur weil sie in Ranglisten weiter unten steht. Mehr dazu auf meiner Seite zuMistral.

Was das für Sie bedeutet

Wenn Sie einen kleinen Betrieb führen oder als Privatperson mitlesen, ändert sich durch diese Veröffentlichung kurzfristig wenig — mit vier Ausnahmen, die ich für praktisch relevant halte:

  • Sicherheit ist keine Kür mehr. Wenn ein frei verkäufliches Werkzeug unbekannte Lücken findet, verschiebt sich das Gleichgewicht zugunsten von Angreifern. Updates einspielen, Zwei-Faktor-Anmeldung überall aktivieren, Sicherungen offline halten: Das war vorher richtig und ist jetzt dringend.
  • Rechnen Sie nach, bevor Sie einbauen. Bei diesen Preisen wird ein munter mitlaufender Automatismus schnell teuer. Für die meisten Aufgaben in einem kleinen Betrieb reicht ein deutlich günstigeres Modell.
  • Vorsicht bei Aufgaben ohne klare Grenzen. Der Befund des britischen Instituts ist praktisch verwertbar: Klar umrissene Aufträge führten zu drastisch weniger Fehlgriffen. Wer ein Modell auf echte Systeme loslässt, sollte ihm sagen, was es nicht anfassen darf.
  • Datenschutz bleibt Datenschutz. Ein US-Anbieter mit Cloud-Verarbeitung ist unabhängig von der Modellgeneration rechtfertigungsbedürftig. Für sensible Unterlagen bleibt einlokal laufendes Modell die sauberere Antwort — auch wenn es weniger kann.

Meine Einschätzung

Ich halte die AGI-Frage für die uninteressanteste an dieser ganzen Geschichte. Sie ist eine Definitionsdebatte, und Definitionsdebatten gewinnt, wer die Pressemitteilung schreibt.

Was mich wirklich beschäftigt, ist der Satz aus dem Sicherheitsbericht, dass die Gedankenkette dieses Modells schlechter zu beaufsichtigen ist als die des Vorgängers. Über Jahre lautete das beruhigende Argument: Wir können ja mitlesen, was die Maschine denkt. Dieses Argument ist gerade ein Stück weit verfallen — und der Hersteller sagt es selbst. Dass OpenAI das offen dokumentiert, statt es wegzulassen, rechne ich dem Unternehmen hoch an. Dass es trotzdem ausgeliefert wurde, finde ich diskussionswürdig.

Für meine tägliche Arbeit ändert sich wenig. Die Kundin, deren Drucker nicht will, und der Handwerksbetrieb, dessen Website seit 2014 niemand angefasst hat, haben von 99,9 Prozent auf ARC-AGI-3 nichts. Was sie haben: ein Werkzeug, das Routinekram zuverlässiger erledigt als vor einem Jahr — wenn man ihm klare Grenzen setzt und die Ergebnisse prüft. Genau so benutze ich es auch.

Und der Rat, den ich seit Jahren gebe, gilt unverändert: Fangen Sie nicht mit dem stärksten Modell an, sondern mit der Frage, welche Aufgabe Sie eigentlich loswerden wollen. Die Antwort darauf ist fast nie „das teuerste Modell auf dem Markt".

OpenAIs eigene Vorstellung.

Datensparsam eingebunden: Das Video wird erst nach Ihrem Klick von YouTube geladen — vorher gibt es keine Verbindung dorthin. Es zeigt die Sicht des Herstellers, nicht die unabhängige Prüfung.

Introducing GPT-6 Astra for developers (OpenAI)

Klicken, um das Video von YouTube zu laden. Erst dann wird eine Verbindung zu YouTube hergestellt und es können Daten übertragen werden.