OpenAI und Google haben binnen weniger Tage zwei Modellfamilien vorgestellt, die dasselbe Signal senden: Der nächste Leistungswettbewerb läuft nicht mehr primär über flüssigere Texte oder hübschere Bilder. Er läuft über Agenten, die Software bedienen, recherchieren, Code schreiben, Dokumente erstellen und mehrstufige Aufgaben eigenständig bearbeiten.
OpenAI positioniert GPT-6 Astra als besonders leistungsstarkes Modell für Computer-Nutzung, Recherche, Programmierung und professionelle Wissensarbeit. Google bringt mit Gemini 3.8 Flash ein kostengünstigeres Arbeitsmodell für langlaufende Coding- und Agentenaufgaben. Daneben steht Gemini 3.8 Flash Cyber, das ausschließlich vertrauenswürdigen Verteidigern für Sicherheitsprüfungen und automatisierte Fehlerbehebung zugänglich sein soll.
Die Ankündigungen sind Herstellerangaben. Ihre Benchmarkwerte zeigen eine Richtung, ersetzen aber keinen Praxistest im eigenen Prozess.

Das gemeinsame Muster: KI soll Arbeitsschritte ausführen, nicht nur Vorschläge machen
Bislang war der typische KI-Einsatz im Marketing oft recht überschaubar: Briefing eingeben, Ideen sammeln, Textentwurf prüfen, Bildvarianten erzeugen. Die neuen Modelle zielen auf eine andere Ebene. Sie sollen sich durch Webseiten und Software bewegen, Informationen zusammentragen, Zwischenergebnisse prüfen und ein verwertbares Resultat abliefern.
OpenAI nennt etwa CRM-Pflege, Formularbearbeitung, Kalenderorganisation, Recherche und die Erstellung von Dokumenten, Tabellen oder Präsentationen. Google betont langlaufende Programmieraufgaben, iterativen Tool-Einsatz und autonome Agenten. Das ist kein kleiner Versionssprung beim Chatbot. Es ist der Versuch, aus dem Chatfenster eine ausführende Arbeitsumgebung zu machen.
Für Teams ist das relevant, weil sich die Engstelle verlagert: weniger Zeit für den ersten Entwurf, mehr Verantwortung für Aufgabendefinition, Freigaben, Datenzugriffe und Qualitätskontrolle. Wer einem Agenten Zugriff auf Werbekonten, CRM, Shop oder Analytics gibt, delegiert nicht nur Formulierungen, sondern Handlungen mit Konsequenzen.
GPT-6 Astra: Computer-Nutzung als Kernkompetenz
Nach OpenAI soll GPT-6 Astra besonders stark darin sein, grafische Oberflächen und Browser zu bedienen. Das Modell kann Aufgaben in realer Software erledigen, etwa Daten analysieren, Frontends testen oder Dokumente formatieren. Für professionelle Aufgaben nennt OpenAI außerdem eine bessere Einhaltung von Vorlagen sowie eine gezieltere Auswahl relevanten Kontexts.
Die vom Unternehmen veröffentlichten Benchmarks sind eindrucksvoll: Auf Agents’ Last Exam erreicht Astra laut OpenAI 59,3 Prozent, auf OSWorld 2.0 72,6 Prozent. In einer Latenzsimulation soll es eine Aufgabe im Schnitt in etwa 40 statt 75 Minuten bei GPT-5.6 Sol erledigt haben. Solche Werte sind nützlich, aber sie beantworten nicht die betriebliche Kernfrage: Wie zuverlässig arbeitet das Modell mit den eigenen Daten, Regeln und Ausnahmen?
Interessant ist deshalb weniger der Superlativ als das Produktversprechen dahinter. Astra soll bei unvollständigen Briefings Routineannahmen treffen, bei folgenreichen Lücken gezielt nachfragen und den ursprünglichen Arbeitsauftrag trotz Zwischenfragen im Blick behalten. Genau an diesen Punkten scheitern Agenten im Alltag bisher häufig: Sie arbeiten schnell, aber an der falschen Teilaufgabe.
OpenAI kündigt eine schrittweise Verfügbarkeit für ChatGPT Plus, Pro, Business und Enterprise sowie über API, Azure und AWS Bedrock an. Aufgrund der deutlich erweiterten Cyber-Fähigkeiten setzt das Unternehmen zusätzlich auf Schutzmechanismen und Bestätigungen bei sensiblen Aktionen.
Gemini 3.8 Flash: Leistungsfähiger Agent zum Flash-Preis
Google verfolgt mit Gemini 3.8 Flash eine etwas andere Positionierung. Das Modell soll an die Leistung teurer Frontier-Modelle heranreichen, aber die Geschwindigkeit und den Preis der Flash-Reihe behalten. Google nennt als Einführungspreis 0,75 US-Dollar pro einer Million Input-Token und 3,75 US-Dollar pro einer Million Output-Token.
Der Haken steht offen im eigenen veröffentlichten Beitrag (siehe Link unten): Bei schwierigen Aufgaben arbeitet Gemini 3.8 Flash intensiver, führt mehr Denk- und Tool-Schritte aus und kann entsprechend mehr Token verbrauchen. Günstiger Preis pro Token bedeutet also nicht automatisch günstige Aufgabe. Wer Kosten steuern will, muss künftig nicht nur das Modell auswählen, sondern auch den erlaubten Aufwand, die Zahl der Iterationen und den Abbruchpunkt definieren.
Google berichtet Fortschritte bei langlaufender Softwareentwicklung und agentischen Aufgaben. Als Beispiele zeigt das Unternehmen Anwendungen, die aus einer Aufforderung ein spielbares 3D-Spiel, eine DOS-Variante von Google Maps oder interaktive Visualisierungen erzeugen. Solche Demos sind überzeugend, aber selektiv. Im Unternehmensalltag zählen vor allem Wiederholbarkeit, Rechtekonzept, Protokollierung und die Fähigkeit, mit unordentlichen Ausgangsdaten umzugehen. Das ist weniger spektakulär als eine 3D-Burg, aber erheblich wertvoller.
Die Cyber-Modelle markieren eine schärfere Grenze
Beide Ankündigungen machen Cybersecurity zum zentralen Thema. Google beschränkt Gemini 3.8 Flash Cyber auf das Fairwind-Programm für vertrauenswürdige Verteidiger. Das Modell soll Schwachstellen finden und Patches erzeugen, nicht offensive Ausnutzung priorisieren.
OpenAI bewertet GPT-6 Astra nach eigener Darstellung im Bereich Cybersecurity bereits oberhalb einer kritischen Fähigkeitsschwelle. Ohne Produktionsschutz habe das Modell in Tests bekannte und neue Schwachstellen bis hin zu funktionierenden Exploits nutzen können. In der regulären Bereitstellung sollen weitergehende offensive Anfragen abgelehnt werden.
Das ist keine Randnotiz für IT-Abteilungen. Sobald leistungsfähige Agenten Tools bedienen und auf Unternehmenssysteme zugreifen, werden Prompt Injection, Rechteverwaltung und Kontrollpunkte zu Designfragen jedes einzelnen KI-Workflows. Die bequemste Automatisierung ist oft die mit dem größten Schadensradius.
Was Marketing- und E-Commerce-Teams jetzt daraus ableiten sollten
Die sinnvolle Reaktion ist weder Modell-Euphorie noch demonstrative Skepsis. Unternehmen sollten agentische KI zunächst dort testen, wo der Nutzen klar und eine Fehlentscheidung reversibel ist: Wettbewerbsrecherchen mit Quellenprotokoll, die Vorbereitung von Content-Audits, das Zusammenführen von Reporting-Daten oder QA-Checks für Landingpages.
Für produktive Workflows braucht es vier Dinge:
- Eine präzise Aufgabenbeschreibung. Ziel, Datenquellen, zulässige Aktionen und Qualitätskriterien müssen ausdrücklich feststehen.
- Menschliche Freigaben an kritischen Stellen. Ein Agent darf einen Kampagnenentwurf vorbereiten. Budget, Live-Schaltung oder Datenexport sollten nicht stillschweigend passieren.
- Minimale Berechtigungen. Zugriff auf genau die Systeme und Daten, die für die Aufgabe nötig sind. Das gilt besonders für CRM, Analytics, Werbekonten und Kundendaten.
- Messung im echten Prozess. Nicht nur fragen, welches Modell auf einem Benchmark gewinnt. Messen, wie viel Zeit, Nacharbeit, Kosten und Fehlerrisiko ein konkreter Workflow verursacht.
Der operative Nutzen wird voraussichtlich nicht daraus entstehen, dass ein Modell eine Kampagne komplett allein steuert. Er entsteht dort, wo es repetitive Zwischenschritte zuverlässig übernimmt und Fachleute dadurch mehr Zeit für Urteil, Strategie und Verantwortung haben. Das klingt weniger nach autonomem Wunderwesen. Es ist aber das realistischere und wirtschaftlich interessantere Szenario.
Fazit
GPT-6 Astra und Gemini 3.8 Flash zeigen, wohin sich die Produktentwicklung bewegt: weg vom einzelnen Prompt, hin zum mehrstufig handelnden System. OpenAI setzt dabei auf maximale Leistungsfähigkeit und Computer-Nutzung. Google versucht, fortgeschrittene Agentenfähigkeit in ein schnelleres und zunächst günstigeres Modellformat zu bringen.
Für Marketing und E-Commerce lautet die entscheidende Frage deshalb nicht mehr nur: „Welches Modell schreibt den besseren Text?“ Sondern: „Welche Arbeit darf ein Modell unter welchen Regeln tatsächlich ausführen?“ Wer diese Regeln sauber definiert, gewinnt Tempo. Wer sie überspringt, automatisiert im Zweifel vor allem das Chaos.
Quellen
Welches Modell du wann brauchst und in welcher Reihenfolge du das lernst, klärt KI lernen.