KI-News · KW 35/2026
OpenAI zeigt Jalapeño-Benchmarks, Nvidia plant Poolside-Deal
· 10 Meldungen · 33 Quellen
KI-gestützt erstellt, Quellen je Meldung verlinkt
OpenAI legt erste Benchmarks für seinen mit Broadcom entwickelten Inferenzchip Jalapeño vor und meldet Vorteile gegenüber getesteten Nvidia-Systemen. Nvidia plant laut Berichten eine milliardenschwere Lizenzvereinbarung mit Poolside; gemeinsam bestätigt sind die Bedingungen nicht. Alibaba und Z.ai veröffentlichen Modellgewichte für Qwen3.8-Flash-Next und GLM-5.3-Flash. Anthropic setzt Mythos 5 für die Schwachstellensuche in Claude Security ein, während Google längere Videos mit Gemini Omni ermöglicht.
OpenAI veröffentlicht erste Benchmarks für Inferenzchip Jalapeño
OpenAI meldet für seinen mit Broadcom entwickelten Chip mehr KI-Arbeit pro Watt und geringere Latenz als bei den getesteten Nvidia-Systemen.
OpenAI hat am 25. August 2026 erste Benchmarks für Jalapeño veröffentlicht, einen gemeinsam mit Broadcom entwickelten Chip für KI-Inferenz.1 Im öffentlichen InferenceX-Benchmark von SemiAnalysis leistete Jalapeño bei maximalem Durchsatz laut OpenAI 1,5- bis 1,9-mal mehr KI-Arbeit pro Watt als die verglichenen Nvidia-Systeme.1 Die Ende-zu-Ende-Latenz war in den gemessenen Einstellungen laut OpenAI um den Faktor 1,7 bis 3,6 niedriger.1
Die Vergleiche betreffen Nvidia GB200 und GB300 sowie ausgewählte Modelle und Betriebspunkte; sie belegen keinen allgemeinen Vorsprung gegenüber Nvidia-Hardware.12 Für OpenAI könnte ein eigener Inferenzchip die Kosten der Modellausführung senken und Antworten in ChatGPT beschleunigen, sofern sich die Ergebnisse im Produktionsbetrieb bestätigen.21 Offen bleibt, wie sich Jalapeño bei anderen Lastprofilen und neueren Plattformen schlägt.23
Was das für Unternehmen bedeutet
Wenn du KI-Dienste betreibst, vergleiche Inferenzchips mit deinen eigenen Modellen und Lastprofilen statt nur anhand von Bestwerten. Prüfe Latenz, Strombedarf und Kosten im Produktionsbetrieb, bevor du Hardwareentscheidungen triffst.
Quellen (4)
- 1 Jalapeño's first results show industry-leading speed and ... openai.com
- 2 OpenAI Jalapeño AI chip challenges Nvidia in inference cnbc.com
- 3 OpenAI says its 1st custom AI chip surpasses Nvidia systems in key tests aa.com.tr
- 4 OpenAI's 700W Jalapeño ASIC outpaces 1400W Nvidia flagship GPU tomshardware.com
Z.ai enthüllt Ox Alpha als GLM-5.3-Flash und veröffentlicht Gewichte
Das zuvor anonyme Modell ist jetzt als GLM-5.3-Flash verfügbar. Z.ai hat die Gewichte freigegeben und API-Preise veröffentlicht.
Z.ai hat am 26. August 2026 das zuvor anonym getestete Modell Ox Alpha als GLM-5.3-Flash vorgestellt.1 Gleichzeitig veröffentlichte das Unternehmen die Gewichte unter der MIT-Lizenz und machte das Modell über API, Chat und seinen Coding-Tarif zugänglich.1 Nach Angaben von Z.ai verarbeitet es Text, Bilder und Videos und ist das erste nativ multimodale Modell der GLM-5-Reihe.1
Aus dem kostenlosen Testmodell wird damit ein offen verfügbares Modell mit veröffentlichten API-Preisen.21 Cloudflare bietet es ebenfalls über Workers AI an.3 Für Unternehmen erleichtern offene Gewichte und mehrere Zugangswege den Vergleich zwischen eigenem Betrieb und gehosteter Nutzung.31 Z.ai meldet bessere Ergebnisse als GLM-5.2 in seinem eigenen Code Bench; die vorliegenden Quellen bestätigen diese Vergleichswerte nicht unabhängig.1
Was das für Unternehmen bedeutet
Wenn du KI-Modelle für Text, Bilder oder Video einsetzt, kannst du GLM-5.3-Flash nun als gehostete und selbst betriebene Option prüfen. Vergleiche Kosten und Qualität mit eigenen Aufgaben, statt dich allein auf die Coding-Werte von Z.ai zu verlassen.
Alibaba veröffentlicht offene Gewichte für Qwen3.8-Flash-Next
Alibaba stellt die Gewichte eines multimodalen Modells bereit. Das Unternehmen beziffert die Trainingskosten auf etwa ein Neuntel der Kosten des Vorgängers.
Alibaba hat am 26. August 2026 die Gewichte von Qwen3.8-Flash-Next veröffentlicht, einem multimodalen Mixture-of-Experts-Modell.12 Die Gewichte stehen zum Download bereit; die Qwen-Dokumentation bezeichnet das Modell als Vorschau auf die Architektur von Qwen4.12 Das Hauptmodell umfasst 125 Milliarden Parameter, von denen pro Token 6 Milliarden aktiviert werden.3 Es handelt sich damit nicht um ein dichtes Modell, das bei jedem Token sämtliche Parameter des Hauptmodells nutzt.3
Alibaba beziffert die Trainingskosten laut Reuters auf etwa ein Neuntel der Kosten des Vorgängers Qwen3.7-Plus.4 Das Unternehmen beansprucht zudem bessere Leistungen bei Programmier- und Büroaufgaben.4 Der separat angebotene API-Dienst Qwen3.8-Flash ist nicht mit den herunterladbaren Gewichten von Qwen3.8-Flash-Next gleichzusetzen. Seine Preise sollten deshalb nicht als Kosten für den Betrieb der offenen Gewichte gelesen werden.42
Was das für Unternehmen bedeutet
Wenn du offene Modelle evaluierst, prüfe Speicherbedarf und Laufzeit anhand der vollständigen Architektur, nicht nur anhand der aktiven Parameter. Vergleiche die Kosten für eigenen Betrieb getrennt von den Preisen des angebotenen API-Dienstes.
Quellen (5)
- 1 Qwen/Qwen3.8-Flash-Next huggingface.co
- 2 README.md - Qwen3.8-Flash-Next github.com
- 3 QwenLM/Qwen3.8-Flash-Next github.com
- 4 Alibaba's Qwen launches Qwen3.8-Flash AI model with ... reuters.com
- 5 「Qwen3.8-Flash-Next」無償公開、Opus 4.6匹敵でQwen3.8-27B超え ~51B分はVRAMではなくRAMに置いて先読みする“Qwen4先取りの設計” pc.watch.impress.co.jp
Nvidia plant milliardenschwere Lizenzvereinbarung mit Poolside
Nvidia will laut Medienberichten Poolside-Technologie für Nemotron lizenzieren und in das Unternehmen investieren. Eine gemeinsame Bestätigung steht aus.
Medienberichten vom 20. bis 22. August 2026 zufolge will Nvidia 6 Mrd. US-Dollar für eine Lizenz an Poolsides Technologie zur Modellentwicklung zahlen.12 Daneben ist eine Investition von 1 Mrd. US-Dollar in das KI-Unternehmen geplant.13 Nvidia will die Technik für seine Nemotron-Modelle mit offenen Gewichten nutzen und Mitarbeitern von Poolside Stellen für das Projekt anbieten.13 Poolside soll unabhängig bleiben; eine Übernahme ist nicht vorgesehen.34
Poolside bezeichnet seine Entwicklungsplattform als „Model Factory“ und nutzt sie für Modelle, die auf Programmieraufgaben ausgerichtet sind.3 Die Vereinbarung würde Nvidias Arbeit an Modellen mit offenen Gewichten stärken, die mit anderen Anbietern konkurrieren sollen.2 Die Konditionen stammen aus Medienberichten, nicht aus einer gemeinsamen öffentlichen Mitteilung der Unternehmen.13 Für die daraus entstehenden Modelle sind weder Veröffentlichungstermine noch überprüfbare Leistungswerte bekannt.32
Was das für Unternehmen bedeutet
Wenn du offene Modelle für Programmieraufgaben prüfst, behalte Nemotron im Blick. Plane aber nicht mit einem neuen Modell aus dieser Zusammenarbeit, solange Termin und Leistung unbekannt sind.
Quellen (5)
- 1 Nvidia to Pay AI Startup Poolside a $6 Billion License ... bloomberg.com
- 2 Nvidia Is Spending $6 Billion to Build a Powerful U.S. ... wsj.com
- 3 Nvidia's $7 Billion Poolside Deal Reveals a Licensing ... finance.yahoo.com
- 4 Nvidia pays Poolside $6bn to license its model factory and ... thenextweb.com
- 5 Nvidia Pays Poolside $6 Billion To License Its Model ... forbes.com
Claude Security prüft Code mit Mythos 5 in öffentlicher Enterprise-Beta
Anthropic hat die Schwachstellensuche von Claude Security auf Mythos 5 umgestellt. Die öffentliche Beta ist für Claude Enterprise verfügbar.
Anthropic hat am 21. August 2026 eine öffentliche Beta der aktualisierten Schwachstellensuche in Claude Security für Kunden von Claude Enterprise angekündigt.12 Der Scanner untersucht Code-Repositories nun mit Claude Mythos 5 im Hintergrund. Nutzer erhalten die Ergebnisse, aber keinen direkten Zugang zum Modell.32
Claude Security liefert Hinweise auf mögliche Schwachstellen und Vorschläge zur Behebung.1 Die Ergebnisse sind für die Prüfung durch Menschen gedacht, nicht für die automatische Übernahme von Änderungen.12 Unternehmen können den Scanner damit für die Sicherheitsprüfung ihres Codes einsetzen, ohne ihren Teams direkten Modellzugriff zu geben.32 Die öffentliche Beta bleibt auf Enterprise-Kunden beschränkt. Die veröffentlichten Unterlagen nennen weder Vergleichswerte zur Erkennungsleistung noch technische Grenzen wie eine maximale Repository-Größe.12
Was das für Unternehmen bedeutet
Wenn du Code mit KI auf Schwachstellen prüfen willst, kannst du die Beta als zusätzlichen Schritt in deinem Sicherheitsprozess testen. Plane die Prüfung der Befunde durch Fachleute ein und kläre vorab die zu erwartenden Tokenkosten.
DeepSeek bringt V4-Flash-Vision-Exp in die API
Das experimentelle Modell verarbeitet Text, Bilder und Screenshots. DeepSeek berechnet dafür laut eigenen Angaben keinen Aufpreis gegenüber V4-Flash.
DeepSeek hat DeepSeek-V4-Flash-Vision-Exp am 21. August 2026 über seine API bereitgestellt.1 Das experimentelle Modell erweitert V4-Flash-0731 um die Verarbeitung von Bildern und Screenshots; Anfragen können Text und Bilder kombinieren.1 Das Verhalten bei Textaufgaben, darunter Reasoning und Agenten-Workflows, bleibt laut DeepSeek weitgehend unverändert.1
Damit lässt sich das Modell auch für Abläufe einsetzen, die visuelle Informationen zusammen mit Text auswerten. DeepSeek berechnet Bilder als Eingabe-Token und nennt dieselben Preise wie für V4-Flash.1 Der Anbieter sieht die Leistung bei multimodalen Agenten-Benchmarks nahe an Opus-4.8.1 Die veröffentlichte Vergleichstabelle zeigt jedoch je nach Aufgabe unterschiedliche Ergebnisse; eine unabhängige Bestätigung der Benchmark-Werte liegt in den vorliegenden Quellen nicht vor.2
Was das für Unternehmen bedeutet
Wenn du Bild- oder Screenshot-Verarbeitung in bestehende Text-Workflows einbauen willst, kannst du das Modell über die API testen. Prüfe Qualität und Token-Kosten mit eigenen Aufgaben, statt die Benchmark-Angaben direkt auf deinen Einsatzfall zu übertragen.
Gemini Omni verlängert Videos schrittweise auf bis zu 40 Sekunden
Google erweitert Gemini Omni 1.1 Flash um längere Videosequenzen und eine 4K-Ausgabeoption. Die 40 Sekunden entstehen durch mehrere Verlängerungen, nicht in einem Schritt.
Google hat am 27. August Gemini Omni 1.1 Flash vorgestellt. Das Videomodell verlängert bestehende Szenen in Schritten von jeweils zehn Sekunden auf eine Gesamtlänge von bis zu 40 Sekunden; es erzeugt die gesamte Sequenz nicht in einem Durchgang.1 Für die Ausgabe nennt Google 1080p und 4K.1 Laut einer technischen Beschreibung ist das Modell über Google AI Studio und die Gemini API zugänglich.2
Die Neuerung ermöglicht längere, schrittweise aufgebaute Sequenzen statt nur kurzer Einzelclips. Google zufolge verbessert das Modell beim Verlängern die visuelle Konsistenz und hält den erzählerischen Verlauf besser ein.1 Die 4K-Angabe bezeichnet eine Ausgabeoption, keine Zusage für eine durchgängig native Erzeugung in dieser Auflösung.12 Wer mehrere Schritte kombiniert, sollte Übergänge und inhaltliche Kontinuität prüfen.
Was das für Unternehmen bedeutet
Wenn du längere KI-Videos produzierst, plane mehrere Verlängerungsschritte ein und prüfe jeden Übergang. Teste die Ausgabeauflösung am fertigen Material, statt aus der 4K-Option auf native 4K-Erzeugung zu schließen.
SpaceX plant KI-Satelliten mit NVIDIA-Hardware für Ende 2027
Ein für den Weltraum angepasstes Vera Rubin-System soll auf einem KI-Satelliten eingesetzt werden. Der erste Start ist für Ende 2027 geplant.
NVIDIA hat am 24. August 2026 angekündigt, dass SpaceXAI einen KI-Satelliten mit einem für den Weltraum angepassten Vera Rubin NVL72-System plant.1 Elon Musk nannte das vierte Quartal 2027 als Ziel für den ersten Start.2 Die Ankündigung beschreibt ein geplantes System, keinen bereits gestarteten Satelliten oder verfügbaren Rechenzentrumsdienst.12
Damit würde SpaceX Rechenleistung für KI auch im Orbit erproben, statt sie ausschließlich in Rechenzentren auf der Erde zu betreiben.12 Musk stellte für 2028 einen Betrieb in größerem Maßstab in Aussicht; ob dieser Zeitplan hält, ist offen.2 Unabhängig vom Satellitenprojekt will SpaceXAI laut NVIDIA Vera-CPUs für agentische KI einsetzen.1 Für Unternehmen ist die orbitale Infrastruktur vorerst eine angekündigte Entwicklung, keine Kapazität, die sich bereits einplanen lässt.12
Was das für Unternehmen bedeutet
Wenn du KI-Rechenkapazität planst, behandle orbitale Systeme noch nicht als verfügbare Alternative. Prüfe bei künftigen Angeboten Verfügbarkeit, Kosten und Datenanbindung, bevor du sie in deine Architektur einbeziehst.
GEN-1.5 lernt neue Roboteraufgaben anhand einer Demonstration
Generalist AI meldet für sein Robotermodell 59 % Erfolg ohne Nachtraining. Mit zusätzlichen Aufgabendaten und kurzer Anpassung steigt der gemeldete Wert auf 83 %.
Generalist AI stellte im August 2026 GEN-1.5 vor, ein vortrainiertes Modell für Roboter-Manipulationsaufgaben.12 Beim „Physical Prompting“ erhält das Modell eine sensorimotorische Demonstration im Kontextfenster und kann die neue Aufgabe ohne erneutes Training versuchen.2 Laut Unternehmen erreichte GEN-1.5 bei zehn Aufgaben ohne weitere Anpassung eine durchschnittliche Erfolgsquote von 59 %; nach aufgabenspezifischer Anpassung waren es 83 %.32
Die beiden Werte beschreiben unterschiedliche Verfahren: Für den ersten Versuch genügt ein Beispiel im Kontext, während die höhere Quote zusätzliche Aufgabendaten und Gradientenupdates voraussetzt.32 Der Ansatz könnte es erleichtern, Roboter für neue Handgriffe einzurichten, ohne für jede Aufgabe große Datensammlungen anzulegen.12 Die Erfolgsquoten sind jedoch Angaben des Unternehmens für die untersuchten Aufgaben. Ob sie sich auf andere Roboter und wechselnde Umgebungen übertragen lassen, bleibt offen.32
Was das für Unternehmen bedeutet
Wenn du Roboter für wechselnde Aufgaben einsetzt, prüfe getrennt, was nach einer Demonstration funktioniert und was erst nach zusätzlichem Training. Plane für die höhere Erfolgsquote weiterhin Aufgabendaten und Tests unter deinen Einsatzbedingungen ein.
Quellen (4)
- 1 Physical AI Model Learns New Robot Tasks From Seconds of Demonstration assemblymag.com
- 2 Generalist AI Releases GEN-1.5: A Robot Foundation Model That Learns New Tasks From One 3–12 Second Demo marktechpost.com
- 3 Generalist AI GEN-1.5 Learns New Robot Tasks From Single Demo, No Retraining techtimes.com
- 4 Robot learns physical tasks from just 3–12 seconds of a demo interestingengineering.com
NVIDIA meldet 100 % für AVO im öffentlichen ARC-AGI-3-Testsatz
NVIDIAs Coding-Agent AVO löste nach Unternehmensangaben alle Aufgaben eines öffentlichen ARC-AGI-3-Testsatzes. Der Wert gilt nicht für die zurückgehaltenen Tests.
NVIDIA meldete am 21. August 2026, dass sein Coding-Agent AVO alle Aufgaben des öffentlichen ARC-AGI-3-Testsatzes gelöst und damit 100 % erreicht habe.12 Nach Angaben des Unternehmens arbeitete der Agent ohne auf die einzelnen Aufgaben zugeschnittene Anweisungen, vorgegebene Regeln oder ausdrücklich genannte Ziele.1 NVIDIA stellte damit ein Testergebnis für seinen Agenten vor, kein neues Basismodell.1
Der Wert gilt ausschließlich für den öffentlichen Testsatz. Er belegt keine entsprechende Leistung auf den zurückgehaltenen semi-privaten oder privaten Tests der offiziellen ARC-Prize-Auswertung.2 AVO nutzt ein Basismodell innerhalb einer Agentensteuerung. Das Ergebnis deutet darauf hin, dass diese Steuerung bei interaktiven Aufgaben einen erheblichen Unterschied machen kann.32 Wie gut sich die Leistung auf unbekannte Aufgaben übertragen lässt, bleibt anhand des öffentlichen Testsatzes offen.2
Was das für Unternehmen bedeutet
Wenn du Agenten für komplexe Abläufe testest, prüfe Basismodell und Steuerungslogik getrennt. Nutze unbekannte Testaufgaben, bevor du Benchmark-Ergebnisse auf eigene Prozesse überträgst.
Welche dieser Entwicklungen ist für dein Unternehmen relevant?
Wir helfen dir, aus KI-News konkrete Use Cases zu machen, von der Bewertung bis zur Umsetzung.
Erstgespräch buchenWir werten jede Woche eine Vielzahl von Quellen zu KI aus, wählen die für Unternehmen relevantesten Meldungen aus und recherchieren jede davon nach. Die Texte entstehen KI-gestützt und verlinken die Originalquellen. So funktioniert unser News-Agent