KI-News · KW 27/2026
Claude Sonnet 5 startet, Google bringt neue Bild- und Videomodelle
· 10 Meldungen · 29 Quellen
KI-gestützt erstellt, Quellen je Meldung verlinkt
Anthropic veröffentlicht Claude Sonnet 5 für Agenten und Code und macht Claude Fable 5 wieder weltweit verfügbar. Google erweitert sein Angebot für Entwickler mit Nano Banana 2 Lite und Gemini Omni Flash. Zhipu AI stellt mit GLM-5.2 ein selbst betreibbares Coding-Modell bereit, während DeepSeek mit DSpark die Textausgabe beschleunigen will. Meta arbeitet Berichten zufolge an einem Cloud-Angebot für KI-Rechenleistung; ein Start ist nicht angekündigt.
Anthropic veröffentlicht Claude Sonnet 5 mit Fokus auf Agenten und Code
Claude Sonnet 5 ist für Claude und die API verfügbar. Anthropic bewirbt das Modell für agentengestützte Aufgaben und bietet zunächst einen niedrigeren Eingabepreis.
Anthropic hat Claude Sonnet 5 am 30. Juni 2026 veröffentlicht. Das Modell ist nun die Standardeinstellung für Nutzer der kostenlosen Version und von Claude Pro; es ist auch über Claude Code und die Claude Platform verfügbar. Bis zum 31. August kostet es 2 US-Dollar pro Million Eingabe-Token. Anthropic positioniert Sonnet 5 als günstigere Alternative zur Opus-Reihe und hebt Verbesserungen beim Programmieren, Schlussfolgern und Einsatz von Werkzeugen hervor.12
Damit richtet sich das Modell auch an Unternehmen, die Agenten für mehrstufige Entwicklungsaufgaben einsetzen wollen, ohne für jede Anfrage ein Spitzenmodell zu wählen. Wie gut es solche Aufgaben im eigenen Arbeitsablauf löst, müssen Nutzer prüfen. OpenRouter gibt für Sonnet 5 ein Kontextfenster von bis zu einer Million Token an; diese Angabe stammt nicht aus einer Bestätigung von Anthropic.13
Was das für Unternehmen bedeutet
Wenn du KI-Agenten für Entwicklungsaufgaben einsetzt, vergleiche Sonnet 5 mit deinem bisherigen Modell anhand eigener Aufgaben. Berücksichtige dabei Eingabe- und Ausgabekosten sowie den angekündigten Preisanstieg.
Claude Fable 5 ist nach Aufhebung der Exportkontrollen wieder verfügbar
Anthropic stellt Claude Fable 5 und Mythos 5 wieder weltweit bereit. Für Unternehmen unterscheiden sich Zugangswege und Abrechnung je nach Tarif.
Anthropic hat Claude Fable 5 und Claude Mythos 5 ab dem 1. Juli 2026 wieder weltweit zugänglich gemacht, nachdem die US-Exportkontrollen für beide Modelle aufgehoben worden waren.1 Der Zugriff kehrt über Claude.ai, Claude Platform, Claude Code und Claude Cowork zurück.1 Fable 5 ist zudem über die Claude API und in Enterprise-Tarifen mit verbrauchsabhängiger Abrechnung verfügbar.2
Die Modelle waren seit der Einführung der Exportkontrollen am 12. Juni ausgesetzt.1 Anthropic bezeichnet Fable 5 als „Mythos-class“-Modell, das sich für die allgemeine Nutzung eigne.2 Medien berichten über strengere Beschränkungen für Cybersicherheitsanwendungen.34 Für Unternehmen ist deshalb nicht nur die Verfügbarkeit entscheidend: Sie müssen auch prüfen, welche Nutzungsregeln und Abrechnungsbedingungen für ihren Zugangsweg gelten.12
Was das für Unternehmen bedeutet
Wenn du Fable 5 in Unternehmensabläufe einplanst, prüfe zuerst die Verfügbarkeit auf deinem Zugangsweg. Kalkuliere die Kosten nach dem Übergang zu Credits und prüfe die Regeln für Cybersicherheitsanwendungen.
Quellen (4)
- 1 Redeploying Claude Fable 5 anthropic.com
- 2 Claude Fable 5 and Claude Mythos 5 \ Anthropic anthropic.com
- 3 Claude Fable 5 is making a dramatic return with 'extraordinarily strong' safeguards 9to5google.com
- 4 Anthropic is bringing back Claude Fable 5 globally after US lifts export control order — where can enterprises access it? venturebeat.com
Google stellt Nano Banana 2 Lite und Gemini Omni Flash vor
Ein günstigeres Bildmodell und ein Videomodell zur dialogbasierten Bearbeitung erweitern Googles Angebot für Entwickler.
Google hat am 30. Juni 2026 zwei Modelle für die Medienerstellung vorgestellt. Nano Banana 2 Lite ist laut Google das schnellste und kostengünstigste Modell der Nano-Banana-Familie für Bilderstellung und -bearbeitung. Gemini Omni Flash erzeugt Videos und kann sie anhand weiterer Anweisungen bearbeiten. Es verarbeitet dabei Text, Bilder und Videos als Eingaben. Das Videomodell steht Entwicklern als öffentliche Vorschau in Google AI Studio, über die Gemini API und auf der Gemini Enterprise Agent Platform zur Verfügung.12
Die Modelle zielen auf Anwendungen, die Bilder oder Videos in größerer Zahl erstellen und überarbeiten. Google positioniert Nano Banana 2 Lite als Ersatz für sein älteres Nano-Banana-Modell.23 Für Unternehmen ist vor allem die Trennung wichtig: Das Bildmodell soll Kosten und Wartezeit senken, während Gemini Omni Flash neue Videoworkflows ermöglicht, aber noch eine Vorschau ist.12
Was das für Unternehmen bedeutet
Wenn du viele Produktbilder oder Varianten erzeugst, teste Kosten und Laufzeit des Bildmodells mit eigenen Prompts. Prüfe beim Videomodell vor einem produktiven Einsatz, ob Vorschau-Status und Cliplänge zu deinem Workflow passen.
Quellen (4)
- 1 Nano Banana 2 Lite and Gemini Omni Flash available cloud.google.com
- 2 Start building with Nano Banana 2 Lite and Gemini Omni ... blog.google
- 3 Google introduces a faster, cheaper image generator with ... techcrunch.com
- 4 Edit Video by Talking: Google's Gemini Omni Flash and Nano Banana 2 Lite Are Here ndtvprofit.com
Zhipu AI veröffentlicht GLM-5.2 mit einer Million Tokens Kontext
Das offene Coding-Modell GLM-5.2 steht unter MIT-Lizenz und lässt sich selbst betreiben. Sein Kontextfenster umfasst laut Berichten eine Million Tokens.
Zhipu AI, auch als Z.ai bekannt, stellte GLM-5.2 Mitte Juni 2026 als Modell für Programmierung und länger laufende Agentenaufgaben vor.12 Das Open-Weight-Modell bietet laut Berichten ein Kontextfenster von einer Million Tokens und steht unter MIT-Lizenz.13 Unternehmen können die Gewichte herunterladen, das Modell selbst betreiben und für kommerzielle Anwendungen nutzen.3
Das große Kontextfenster ist für Aufgaben gedacht, bei denen ein Modell umfangreichen Code und längere Arbeitsverläufe berücksichtigen muss.1 Z.ai verweist auf starke Ergebnisse in Coding-Benchmarks und meldet bei zwei Tests für Agentenaufgaben geringe Abstände zu Claude Opus 4.8.1 Solche Messwerte allein zeigen jedoch nicht, wie zuverlässig das Modell in einer konkreten Entwicklungsumgebung arbeitet. Für Teams mit eigener Infrastruktur erweitert die Veröffentlichung die Auswahl kommerziell nutzbarer Modelle, die nicht nur per API zugänglich sind.3
Was das für Unternehmen bedeutet
Wenn du Entwicklungsaufgaben mit langen Codebeständen testest, prüfe die Ergebnisse mit eigenen Repositories und Aufgaben. Für einen selbst betriebenen Einsatz solltest du Speicherbedarf, Laufzeit und Lizenzanforderungen vorab klären.
Quellen (3)
- 1 Chinese AI steps onto global stage as GLM-5.2 narrows ... news.cgtn.com
- 2 What is GLM-5.2, China’s latest open-weight AI model turning heads in Silicon Valley? indianexpress.com
- 3 Chinese Z.ai's latest model tops AI ranking charts amid Anthropic Fable 5 ban — blacklisted China firm's popular open-weight GLM-5.2 AI model powered by Huawei silicon tomshardware.com
Claude Managed Agents erhalten Overrides und gezielte Zugangsdaten
Anthropic erweitert Claude Managed Agents: Teams können Agenten pro Sitzung anpassen und die Einbindung von Zugangsdaten aus einem Vault begrenzen.
Anthropic hat Claude Managed Agents am 30. Juni 2026 um fünf Funktionen erweitert.1 Eine Sitzung kann nun ausgewählte Einstellungen eines gespeicherten Agenten überschreiben, ohne dessen Definition dauerhaft zu ändern.12 Teams können außerdem eingrenzen, welche Zugangsdaten aus einem Vault in eine Sitzung eingebunden werden.12
Die Änderungen sind für Teams relevant, die denselben Agenten mit unterschiedlichen Vorgaben oder Berechtigungen einsetzen: Ausnahmen lassen sich pro Sitzung festlegen, statt dafür separate Agenten anzulegen.12 Die begrenzte Einbindung von Zugangsdaten soll vermeiden, dass jede Sitzung Zugriff auf einen gesamten Vault erhält.12 Es handelt sich um eine Erweiterung der bestehenden Plattform, nicht um den Start eines neuen Produkts.12 Unternehmen sollten dennoch prüfen, welche Berechtigungen ihre Agenten und angebundenen Werkzeuge tatsächlich erhalten.
Was das für Unternehmen bedeutet
Wenn du denselben Agenten für mehrere Abläufe nutzt, prüfe, welche Einstellungen du pro Sitzung variieren kannst. Begrenze eingebundene Zugangsdaten auf das Nötige und teste die Berechtigungen der angebundenen Werkzeuge.
Meta erwägt Cloud-Angebot für KI-Rechenleistung
Meta arbeitet Berichten zufolge an einem Cloud-Angebot für gehostete KI-Modelle und mietbare Rechenleistung. Einen öffentlichen Start hat das Unternehmen nicht angekündigt.
Meta arbeitet Berichten vom 1. Juli zufolge an einem Cloud-Geschäft namens Meta Compute. Externe Kunden sollen darüber Zugang zu Modellen erhalten, die auf Metas Infrastruktur laufen, oder GPU-Rechenleistung direkt mieten können.12 Ein öffentliches Angebot hat Meta nicht angekündigt; die Pläne beschreiben eine mögliche künftige Dienstleistung, keinen bereits verfügbaren Cloud-Service.12
Damit würde Meta Infrastruktur nicht mehr nur für eigene KI-Angebote nutzen, sondern Kapazität auch an andere Unternehmen verkaufen.12 Das könnte Meta neben etablierte Cloud-Anbieter und spezialisierte Vermieter von GPU-Kapazität stellen.1 Ob und wann aus den Plänen ein Produkt wird, bleibt offen.12 Für potenzielle Kunden fehlen damit noch die Angaben, die für einen belastbaren Vergleich von Kosten, Verfügbarkeit und Leistungsumfang nötig wären.12
Was das für Unternehmen bedeutet
Wenn du KI-Infrastruktur einkaufst, behandle Meta Compute vorerst nicht als verfügbare Option. Prüfe erst Preise, Regionen, Vertragsbedingungen und Modellzugang, falls Meta den Dienst offiziell vorstellt.
DeepSeek stellt DSpark für schnelleres Decoding vor
DSpark soll die Ausgabe von Sprachmodellen beschleunigen. Der gemeldete Durchsatzgewinn von bis zu 400 % gilt für bestimmte Szenarien, nicht für jede Anfrage.
DeepSeek hat Ende Juni 2026 DSpark vorgestellt, ein Verfahren für spekulatives Decoding bei DeepSeek-V4 Flash und DeepSeek-V4 Pro. Dabei erstellt ein kleinerer Entwurfsschritt mögliche nächste Token, bevor das Hauptmodell sie prüft. DSpark steuert diesen Schritt anhand der Konfidenz und der Hardwarelast. Das Ziel ist eine schnellere Ausgabe, ohne das zugrunde liegende Sprachmodell durch ein neues zu ersetzen.1
DeepSeek berichtet für bestimmte Betriebsszenarien einen Durchsatzgewinn von etwa 51 % bis 400 %. Dieser Wert beschreibt, wie viel ein System insgesamt verarbeitet; er bedeutet nicht, dass jede einzelne Antwort entsprechend schneller wird.12 Für Nutzer auf DeepSeeks Produktionssystemen fallen die angegebenen Beschleunigungen enger aus und wurden bei gleichem Durchsatz gemessen.1 Für Unternehmen ist deshalb wichtig, Antwortzeit und Kapazität unter paralleler Last getrennt zu prüfen. Die Ergebnisse lassen sich nicht ohne Weiteres auf andere Hardware und Arbeitslasten übertragen.12
Was das für Unternehmen bedeutet
Wenn du Sprachmodelle für viele gleichzeitige Anfragen betreibst, prüfe DSpark anhand deiner tatsächlichen Last. Miss Antwortzeit und Gesamtdurchsatz getrennt, bevor du zusätzliche Kapazität einplanst.
NVIDIA testet parallele Textgenerierung mit Nemotron-Labs-TwoTower
NVIDIAs Forschungsmodell erzeugt Text laut eigenen Tests 2,42-mal schneller und erreicht 98,7 % der Qualität des Ausgangsmodells.
NVIDIA hat am 1. Juli 2026 Nemotron-Labs-TwoTower als Forschungsansatz für schnellere Textgenerierung vorgestellt. Das System nutzt ein vortrainiertes Nemotron-Modell: Ein Teil hält den Kontext bereit, während ein anderer Tokens parallel erzeugt. NVIDIA meldet eine 2,42-mal schnellere Textgenerierung als beim autoregressiven Ausgangsmodell. Zugleich erreiche TwoTower 98,7 % von dessen gemessener Qualität.12
Die Diffusionsarchitektur baut auf einem eingefrorenen autoregressiven Modell auf, statt ein Sprachmodell vollständig neu zu trainieren. Damit untersucht NVIDIA einen Weg, die sonst sequenzielle Ausgabe von Tokens zu beschleunigen. Die Leistungs- und Qualitätswerte stammen aus NVIDIAs eigenen Tests und lassen sich nicht ohne Weiteres auf andere Anwendungen übertragen. Zudem steht die Qualitätszahl für eine zusammengefasste Bewertung, nicht für identische Antworten.12
Was das für Unternehmen bedeutet
Wenn du KI-Anwendungen mit hoher Textausgabe betreibst, vergleiche Latenz und Antwortqualität anhand deiner eigenen Aufgaben. Prüfe dabei auch den GPU-Bedarf, bevor du den gemeldeten Geschwindigkeitsgewinn für deine Infrastruktur einplanst.
JetSpec beschleunigt Qwen3-8B in einem Test um das 9,64-Fache
Das Hao AI Lab meldet mit JetSpec kürzere Generierungszeiten für Qwen3-8B. Der Spitzenwert stammt aus einem einzelnen Benchmark.
Das Hao AI Lab der UC San Diego hat JetSpec vorgestellt, ein Verfahren für spekulatives Decoding bei Sprachmodellen.1 In Tests mit Qwen3-8B auf H100-GPUs meldet das Team auf MATH-500 eine bis zu 9,64-fache Beschleunigung. Laut eigener Auswertung blieb die Ausgabequalität dabei erhalten.23 Die Arbeit ist als Paper öffentlich zugänglich.2
JetSpec nutzt „causal parallel tree drafting“: Mehrere mögliche Fortsetzungen werden entworfen und anschließend vom Zielmodell geprüft. Der Ansatz soll den Aufwand für die Entwürfe und deren Trefferquote gemeinsam verbessern.4 Die Leistungswerte stammen aus Tests des Forschungsteams. Ob ähnliche Gewinne mit anderen Modellen, Anfragen, Batchgrößen und Produktivsystemen erreichbar sind, ist damit nicht geklärt.24 Für Betreiber ist zudem entscheidend, ob die höhere Geschwindigkeit auch die Kosten pro Anfrage senkt.
Was das für Unternehmen bedeutet
Wenn du Sprachmodelle selbst betreibst, teste JetSpec mit deinen Anfragen und Batchgrößen statt mit dem Spitzenwert zu planen. Vergleiche dabei Ausgabequalität, Latenz und Kosten pro Anfrage.
Meta dekodiert getippte Sätze aus Hirnsignalen mit 61 % Wortgenauigkeit
Brain2Qwerty v2 rekonstruiert getippte Sätze aus Hirnsignalen ohne Implantat. Die Ergebnisse stammen aus kontrollierten MEG-Messungen.
Meta hat am 29. Juni 2026 Brain2Qwerty v2 vorgestellt. Das System rekonstruiert getippte Sätze aus Hirnsignalen, die mit Magnetoenzephalografie (MEG) aufgezeichnet werden, und benötigt kein Implantat.1 Ein durchgängig trainiertes Deep-Learning-Modell erreichte über alle Teilnehmer hinweg eine durchschnittliche Wortgenauigkeit von 61 %.12 Meta stellt den Trainingscode für Brain2Qwerty v1 und v2 bereit.1
Das System liest keine frei formulierten Gedanken: Die Messungen entstanden während einer Tippaufgabe.12 Brain2Qwerty v2 baut auf v1 auf, dessen Studie am selben Tag in „Nature“ erschien.1 Meta vergleicht das Ergebnis mit etwa 8 % Wortgenauigkeit bei früheren nicht-invasiven Verfahren.1 Die Tests fanden unter kontrollierten MEG-Bedingungen statt. Ob die Methode außerhalb des Labors ähnlich gut funktioniert, ist offen.13
Was das für Unternehmen bedeutet
Wenn du Anwendungen für barrierefreie Kommunikation prüfst, unterscheide diese Tippaufgabe klar vom Lesen freier Gedanken. Plane vor einem Einsatz Tests zur Übertragbarkeit und kläre, ob die nötige MEG-Infrastruktur überhaupt verfügbar ist.
Welche dieser Entwicklungen ist für dein Unternehmen relevant?
Wir helfen dir, aus KI-News konkrete Use Cases zu machen, von der Bewertung bis zur Umsetzung.
Erstgespräch buchenWir werten jede Woche eine Vielzahl von Quellen zu KI aus, wählen die für Unternehmen relevantesten Meldungen aus und recherchieren jede davon nach. Die Texte entstehen KI-gestützt und verlinken die Originalquellen. So funktioniert unser News-Agent