KI-News · KW 32/2026
OpenAI bringt GPT-Live, Alibaba startet Qwen3.8-Max
· 10 Meldungen · 30 Quellen
KI-gestützt erstellt, Quellen je Meldung verlinkt
Alibaba startet Qwen3.8-Max per API und in QwenWork und will die Modellgewichte in der folgenden Woche veröffentlichen. OpenAI führt GPT-Live ein, damit ChatGPT Voice gleichzeitig zuhören und sprechen kann. Google verbindet Gemini Spark mit Chrome: Mit Zustimmung kann der Dienst angemeldete Konten für Webaufgaben nutzen. Meta testet mit Muse Code einen Agenten für große Code-Repositories, während Cloudflare eine offene Laufzeit für Agenten vorstellt.
Alibaba startet Qwen3.8-Max und kündigt offene Modellgewichte an
Das multimodale Modell ist per API und über QwenWork verfügbar. Alibaba will die Gewichte in der folgenden Woche veröffentlichen.
Alibaba hat am 2. August Qwen3.8-Max vorgestellt, nach eigenen Angaben sein bislang größtes und leistungsfähigstes Qwen-Modell.1 Das multimodale Modell nutzt eine Mixture-of-Experts-Architektur, bei der pro Anfrage nur ein Teil der Parameter aktiv ist.12 Es ist bereits über die APIs von Alibaba Cloud Model Studio und über QwenWork zugänglich, auch für Entwickler außerhalb Chinas.2 Alibaba plant, die Modellgewichte in der folgenden Woche auf Hugging Face und ModelScope zu veröffentlichen.1
Mit dem Modell will Alibaba insbesondere bei Programmier- und Arbeitsaufgaben mit anderen großen KI-Anbietern konkurrieren.13 Die API-Tarife machen es auch für Anwendungen mit vielen Ein- und Ausgabetokens interessant; die tatsächlichen Kosten hängen jedoch vom Nutzungsprofil ab.4 Veröffentlichte Leistungsvergleiche zur agentischen Computerbedienung beruhen auf Angaben des Unternehmens und sollten nicht als unabhängig bestätigte Ergebnisse gelten.4 Wer das Modell selbst betreiben möchte, muss die angekündigte Freigabe der Gewichte abwarten.1
Was das für Unternehmen bedeutet
Wenn du lange Dokumente oder Coding-Workflows per API verarbeitest, prüfe die Kosten anhand deiner typischen Ein- und Ausgabelängen. Teste das Modell mit eigenen Aufgaben und warte für einen selbst gehosteten Einsatz auf die tatsächliche Freigabe der Gewichte.
Quellen (4)
- 1 Qwen3.8-Max: A New Bar for Coding and Cowork qwen.ai
- 2 Alibaba unveils 'largest, most capable' AI model Qwen3.8-Max aa.com.tr
- 3 Alibaba unveils its largest AI model yet, DeepSeek's latest ... - Reuters reuters.com
- 4 Qwen3.8-Max arrives with a bold claim: it outperforms GPT-5.6 Sol Max and Fable 5 on agentic computer use venturebeat.com
Meta startet Terminal-Agent Muse Code als Beta
Muse Code soll Aufgaben in großen Code-Repositories bearbeiten. Der Terminal-Agent nutzt das ebenfalls aktualisierte Modell Muse Spark 1.2.
Meta stellte am 5. August 2026 Muse Code als Beta für das Terminal vor. Der Coding-Agent nutzt das zugleich veröffentlichte Modell Muse Spark 1.2 und soll Änderungen in großen Code-Repositories planen, umsetzen und prüfen. Für komplexe Aufgaben kann er dauerhafte Hintergrund-Agenten einsetzen, die asynchron arbeiten. Meta weitete zudem den weltweiten Zugang zu Muse Spark 1.2 über die Meta Model API aus.1
Damit bietet Meta ein Werkzeug für Softwareaufgaben an, die über einzelne Code-Vorschläge hinausgehen. Das Unternehmen berichtet von besserer Coding-Leistung bei Muse Spark 1.2 gegenüber der Vorgängerversion, veröffentlicht in der Ankündigung aber keine detaillierte Benchmark-Tabelle dazu. Teams sollten deshalb die Leistung an eigenen Repositories prüfen und bei der Tarifwahl beachten, ob ihre Eingaben und Ausgaben für das Training verwendet werden dürfen.12
Was das für Unternehmen bedeutet
Wenn du Coding-Agenten einsetzt, teste Muse Code an typischen Aufgaben in deinen Repositories und prüfe die Ergebnisse im Review. Kläre vor der Tarifwahl, ob Code und Eingaben für das Modelltraining verwendet werden dürfen.
OpenAI führt GPT-Live für ChatGPT Voice ein
ChatGPT Voice kann mit GPT-Live gleichzeitig zuhören und sprechen. Das soll Unterbrechungen und Sprecherwechsel natürlicher machen.
OpenAI hat am 3. August die Technik hinter GPT-Live für ChatGPT Voice vorgestellt.1 Das System kann gleichzeitig zuhören und sprechen; aufwendigere Überlegungen und Werkzeugaufrufe laufen weiterhin asynchron.12 Es verarbeitet Unterbrechungen während des Gesprächs, statt für jeden Sprecherwechsel auf einen Turn-Detektor zu warten.1 GPT-Live-1 wird als Standard für zahlende Nutzer eingeführt, GPT-Live-1 mini für kostenlose Konten. Der Rollout umfasst ChatGPT auf iOS, Android und im Web in unterstützten Regionen.2
Die Architektur ersetzt den bisherigen Wechsel zwischen Zuhören und Antworten im Advanced Voice Mode durch einen kontinuierlicheren Dialog.12 Gesprochene Antworten erscheinen dabei zusammen mit gestreamtem Text.12 Für Sprachassistenten könnte das besonders bei Rückfragen und Unterbrechungen einen Unterschied machen. Die neue Live-Erfahrung unterstützt zum Start weder Video noch Bildschirmfreigabe.2 Der Zugang zu Business-Arbeitsbereichen wurde am 7. August erweitert; dort ist die Nutzung über das enthaltene Kontingent hinaus kostenpflichtig.3
Was das für Unternehmen bedeutet
Wenn du Sprachfunktionen in Arbeitsabläufen nutzt, teste Unterbrechungen und Antwortzeiten mit echten Gesprächsszenarien. Prüfe vor einem Einsatz im Unternehmen die Kosten und ob benötigte Funktionen wie Bildschirmfreigabe verfügbar sind.
Gemini Spark nutzt Chrome-Sitzungen für Webaufgaben
Google erweitert Gemini Spark international und bindet den Dienst an Chrome an. Mit Zustimmung kann er angemeldete Konten für Webaufgaben nutzen; Zahlungen bleiben beim Nutzer.
Google hat Gemini Spark international ausgeweitet und bindet seine Webfunktionen an Chrome an. Mit Zustimmung des Nutzers kann Spark auf angemeldete Konten und gespeicherte Passwörter zugreifen, um Aufgaben im Web zu erledigen. Die Chrome-Funktion wird zunächst in den USA für Abonnenten von Google AI Pro und Ultra eingeführt; weitere Regionen sollen folgen.12
Damit kann der Assistent auch Aufgaben bearbeiten, für die eine Anmeldung nötig ist, etwa Wohnungsbesichtigungen vereinbaren oder Flugoptionen recherchieren. Besonders sensible Schritte wie Zahlungen gibt Google zur Bestätigung an den Nutzer zurück. Google nennt zudem Schutzmaßnahmen gegen Prompt Injection. Für Unternehmen ist die Freigabe von Kontozugriff damit eine wichtige Sicherheitsentscheidung: Die internationale Ausweitung von Spark bedeutet nicht, dass die Chrome-Funktion bereits überall verfügbar ist.13
Was das für Unternehmen bedeutet
Wenn du KI-Assistenten für Webaufgaben einsetzt, prüfe, welche Konten und gespeicherten Zugangsdaten sie verwenden dürfen. Lege fest, welche Schritte Mitarbeiter selbst bestätigen müssen, bevor du solche Funktionen freigibst.
Mistral veröffentlicht Shieldstral für lokale Inhaltsmoderation
Shieldstral prüft Texte und Bilder anhand frei formulierter Moderationsregeln. Das Modell mit 3 Milliarden Parametern soll auf einer einzelnen GPU mit 16 GB Speicher laufen.
Mistral AI hat am 4. August 2026 Shieldstral veröffentlicht, ein Open-Weights-Modell mit 3 Milliarden Parametern für die Moderation von Texten und Bildern.12 Laut Mistral läuft es auf einer einzelnen NVIDIA-GPU mit 16 GB Speicher.12 Nutzer können ihre Moderationsregeln bei der Anfrage in natürlicher Sprache vorgeben. Shieldstral bewertet Inhalte dann anhand dieser Regeln, ohne dass das Modell neu trainiert werden muss.2
Der Ansatz könnte Teams helfen, unterschiedliche Inhaltsregeln mit demselben lokal betriebenen Modell umzusetzen, statt für jede Regeländerung ein Modell anzupassen.2 Das ist besonders relevant, wenn sensible Inhalte nicht an einen externen Moderationsdienst gesendet werden sollen. Leistungsangaben sollten Unternehmen jedoch selbst prüfen: Die veröffentlichten Benchmark-Ergebnisse stammen von Mistral und belegen nicht automatisch die Qualität für jede eigene Richtlinie.32
Was das für Unternehmen bedeutet
Wenn du Inhalte nach eigenen Regeln prüfst, kannst du Shieldstral für einen lokalen Moderationsprozess testen. Miss dabei Fehlalarme und übersehene Verstöße anhand deiner eigenen Richtlinien, bevor du Entscheidungen automatisierst.
Cloudflare zeigt quelloffene Laufzeit für KI-Agenten
@cloudflare/computer gibt Agenten ein dauerhaftes Dateisystem und nutzt je nach Aufgabe Isolates oder Linux-Container. Die Software ist als frühe Vorschau verfügbar.
Cloudflare hat am 3. August 2026 eine frühe Vorschau von @cloudflare/computer veröffentlicht.1 Die quelloffene Laufzeit soll KI-Agenten eine eigene Arbeitsumgebung mit dauerhaftem Dateisystem geben.12 Für die Ausführung nutzt sie je nach Aufgabe schlanke Isolates oder vollständige Linux-Container.12 Agenten können mit bereitgestellten Werkzeugen Dateien lesen, schreiben und bearbeiten.12
Damit richtet sich Cloudflare an Anwendungen, in denen Agenten Dateien und ihren Arbeitsstand über einzelne Ausführungsschritte hinaus benötigen.12 Das Dateisystem verbindet die unterschiedlichen Ausführungsumgebungen.2 Die Software ist noch eine Vorschau; die Produktankündigung nennt weder Preise noch Leistungswerte.12 Der separat vorgestellte Browser-Arbeitsbereich Cloudflare OS ist ein anderes Projekt und nicht dieselbe Laufzeit.3
Was das für Unternehmen bedeutet
Wenn du Agenten für mehrstufige Aufgaben einsetzt, kann ein dauerhaftes Dateisystem die Verwaltung von Arbeitsdateien vereinfachen. Prüfe die Vorschau zunächst mit begrenzten Aufgaben, bevor du sie für produktive Abläufe einplanst.
MiniMax öffnet H3 für Videogenerierung mit Ton
H3 verbindet Text, Bild, Video und Audio. MiniMax kündigte die Öffnung des Modells an; die Bereitstellung der Gewichte erfolgte schrittweise.
MiniMax stellte H3 am 31. Juli 2026 als Modell vor, das Text, Bilder, Video und Audio gemeinsam verarbeitet und Videos mit nativem Stereoton erzeugt. Clips können bis zu 15 Sekunden lang sein; MiniMax nennt eine Auflösung von bis zu 2K.1 Am 3. August kündigte das Unternehmen die Öffnung des Modells an. Die Gewichte sollten laut der ersten Ankündigung erst in den folgenden Tagen bereitgestellt werden.12
Das offizielle Repository führt inzwischen zwei auf unterschiedliche Aufgaben ausgelegte Checkpoints und einen eigenen Pfad zur 2K-Regenerierung auf. Die maximale Auflösung sollte daher nicht als Zusage für jeden direkten Generierungslauf verstanden werden.3 Für Unternehmen ist H3 vor allem eine weitere Option, Video und Ton in einem Modell zu erzeugen. Vor einem lokalen Einsatz sollten sie prüfen, welche Gewichte verfügbar sind und welche Lizenzbedingungen gelten.
Was das für Unternehmen bedeutet
Wenn du Videogenerierung mit Ton einsetzt, teste Bildqualität, Ton und Laufzeit mit deinen eigenen Vorlagen. Prüfe vor lokaler Bereitstellung die tatsächlich verfügbaren Gewichte und die Lizenzbedingungen.
Liquid AI veröffentlicht Agentenmodell LFM2.5-2.6B für lokale Geräte
Das Modell mit 2,6 Milliarden Parametern soll Agenten direkt auf Geräten ausführen. Die Gewichte sind verfügbar, Leistungsangaben stammen vom Anbieter.
Liquid AI hat am 4. August 2026 LFM2.5-2.6B veröffentlicht. Das Modell mit 2,6 Milliarden Parametern ist für Agenten gedacht, die Aufgaben in mehreren Schritten bearbeiten und Werkzeuge aufrufen. Basisversion und nachtrainierte Version stehen mit offenen Gewichten auf Hugging Face bereit. Laut Liquid AI kann das Modell vollständig auf Smartphones, Laptops, PCs und Robotern laufen, ohne Anfragen an einen Cloud-Dienst zu senden.12
Damit setzt Liquid AI auf lokale Ausführung statt auf größere, cloudbasierte Modelle. Für Unternehmen könnte das interessant sein, wenn Daten das Gerät nicht verlassen sollen oder eine Anwendung auch ohne Netzverbindung funktionieren muss. Liquid AI nennt einen Speicherbedarf von weniger als 2,5 GB; die Leistungswerte sind Angaben des Unternehmens und keine Garantie für jede Hardware oder Aufgabe. Die Gewichte stehen unter der LFM Open License. Vor einem kommerziellen Einsatz sollten Teams deren Bedingungen prüfen.13
Was das für Unternehmen bedeutet
Wenn du lokale Agenten einsetzen willst, teste Werkzeugaufrufe und mehrstufige Abläufe auf deiner Zielhardware. Prüfe dabei Speicherbedarf, Geschwindigkeit und Lizenzbedingungen, bevor du das Modell produktiv nutzt.
nGPT benötigt im Test etwa halb so viele Trainings-Tokens
Ein 14-Milliarden-Parameter-Modell erreicht denselben Validierungsverlust wie eine AdamW-Baseline mit ungefähr halb so vielen Trainings-Tokens.
Die Studie „Training nGPT“ beschreibt ein Trainingsverfahren für nGPT. Bei einem Modell mit insgesamt 14 Milliarden Parametern erreichte es denselben Validierungsverlust mit ungefähr halb so vielen Trainings-Tokens wie eine nicht normalisierte, mit AdamW trainierte Baseline.1 Die Arbeit stellt ein Forschungsergebnis vor, keinen neuen Dienst oder ein verfügbares Produkt.1
Das Verfahren verändert unter anderem die Optimierung und die Steuerung der Parameter-Updates.2 Der Vergleich zeigt einen geringeren Tokenbedarf für das getestete Modell bei gleichem Validierungsverlust. Er belegt aber keine pauschale Halbierung für andere Architekturen oder Trainingsverfahren.1 Für Unternehmen, die große Modelle selbst trainieren, könnte das relevant sein. Ob das Verfahren auch die Gesamtkosten senkt oder die Leistung bei nachgelagerten Aufgaben verbessert, lässt sich aus dem berichteten Vergleich nicht ableiten.1
Was das für Unternehmen bedeutet
Wenn du eigene Modelle trainierst, teste das Verfahren zunächst gegen deine bestehende AdamW-Baseline. Vergleiche dabei Validierungsverlust, Tokenbedarf und gesamte Rechenkosten, bevor du deine Trainingsplanung änderst.
Cursor veröffentlicht MoE-Trainingskernel Mixture-of-Kittens
Cursor stellt den Trainingskernel Mixture-of-Kittens als Open Source bereit. In Schichttests meldet das Unternehmen bis zu 2,37-mal mehr Geschwindigkeit.
Cursor hat am 4. August 2026 den Quellcode von Mixture-of-Kittens (MoK) veröffentlicht, einem Trainingskernel für Mixture-of-Experts-Modelle auf NVIDIA-NVL72-Systemen.12 MoK bündelt laut Cursor Kommunikation und Berechnung in einem deterministischen Kernel.12 In Tests einzelner Modellschichten lief er im besten Fall 2,37-mal so schnell wie die stärksten öffentlich verfügbaren Vergleichslösungen. Für das eigene Training meldet Cursor einen 1,41-mal so hohen Durchsatz gegenüber seinem bisherigen DeepEP-basierten System.12
Der Code richtet sich vor allem an Teams, die große MoE-Modelle auf passender NVIDIA-Hardware trainieren.2 Für sie ist entscheidend, ob Kommunikation und Berechnung im eigenen Trainingsablauf ähnliche Engpässe bilden. Die 2,37-fache Beschleunigung ist ein Spitzenwert aus Schichttests, kein allgemeiner Wert für vollständige Trainingsläufe.12 Die veröffentlichten Leistungswerte stammen von Cursor; unabhängige Messungen sind damit nicht belegt.12
Was das für Unternehmen bedeutet
Wenn du MoE-Modelle auf NVL72-Systemen trainierst, prüfe, ob MoK zu deiner Hardware und deinem Trainingsablauf passt. Miss den Durchsatz im vollständigen Training, bevor du die Spitzenwerte aus Schichttests für deine Planung nutzt.
Welche dieser Entwicklungen ist für dein Unternehmen relevant?
Wir helfen dir, aus KI-News konkrete Use Cases zu machen, von der Bewertung bis zur Umsetzung.
Erstgespräch buchenWir werten jede Woche eine Vielzahl von Quellen zu KI aus, wählen die für Unternehmen relevantesten Meldungen aus und recherchieren jede davon nach. Die Texte entstehen KI-gestützt und verlinken die Originalquellen. So funktioniert unser News-Agent