Zum Inhalt springen
Alle KI-News

KI-News · KW 29/2026

OpenAI bringt GPT-5.6 und ChatGPT Work, Moonshot AI stellt Kimi K3 vor

· 10 Meldungen · 34 Quellen

KI-gestützt erstellt, Quellen je Meldung verlinkt

OpenAI stellt GPT-5.6 und ChatGPT Work vor; auch Microsoft 365 Copilot übernimmt das Modell. Moonshot AI bietet Kimi K3 mit einem Kontextfenster von bis zu einer Million Tokens an. Thinking Machines veröffentlicht die Gewichte von Inkling, während PrismML, Unsloth und Colibrì an lokaler KI arbeiten. Ein von OpenAI beanspruchter mathematischer Beweis und Forschungsergebnisse von Ant Group sind noch nicht unabhängig bestätigt.

1 Produkte & Tools KI-AgentenKI im UnternehmenArbeit & Gesellschaft

OpenAI veröffentlicht GPT-5.6 und startet ChatGPT Work

OpenAI hat GPT-5.6 und den Agenten ChatGPT Work Anfang Juli vorgestellt. Auch Microsoft 365 Copilot setzt auf das neue Modell.

OpenAI hat GPT-5.6 Anfang Juli 2026 veröffentlicht und zugleich ChatGPT Work vorgestellt, einen Agenten für die Erstellung von Dokumenten, Präsentationen und Websites.12 ChatGPT Work nutzt laut Reuters GPT-5.6.2 Auf Web und Mobilgeräten begann die Einführung am 9. Juli zunächst für Pro, Enterprise und Edu; Plus und Business sollten in den folgenden Tagen Zugang erhalten.2

OpenAI stellte GPT-5.6 auch als bevorzugtes Modell für Microsoft 365 Copilot vor.3 Damit kommt das Modell sowohl in einem neuen Agentenprodukt als auch in bestehende Bürosoftware. ChatGPT Work ist jedoch nicht auf jeder Plattform und für jeden Tarif gleichzeitig verfügbar: Der Zugang wird schrittweise freigeschaltet.24 Für Unternehmen ist deshalb entscheidend, welche Funktionen in ihren bereits genutzten Produkten tatsächlich bereitstehen.

Was das für Unternehmen bedeutet

Wenn du ChatGPT Work testen willst, prüfe zuerst Tarif und Plattform. Vergleiche die Arbeit mit eigenen Dokumenten mit den verfügbaren Funktionen in Microsoft 365 Copilot.

Quellen (4)
  1. 1 OpenAI to publicly release GPT-5.6, rolls out conversational AI models cnbc.com
  2. 2 OpenAI unveils long-awaited "super app" as rivalry with Anthropic intensifies reuters.com
  3. 3 GPT-5.6 is now the preferred model in Microsoft 365 Copilot openai.com
  4. 4 OpenAI on X: "Introducing ChatGPT Work, a new agent in ... x.com
2 Modelle Open SourceBild, Video & AudioKI-Agenten

Moonshot AI stellt Kimi K3 mit 2,8 Billionen Parametern vor

Kimi K3 soll Kontexte von bis zu einer Million Tokens verarbeiten. Das Modell ist bereits über Kimi und die API nutzbar; die Gewichte sollen später folgen.

Moonshot AI hat Kimi K3 am 16. Juli vorgestellt. Das multimodale Modell hat laut Unternehmen 2,8 Billionen Parameter und unterstützt Kontexte von bis zu einer Million Tokens. Es ist für Programmierung, Wissensarbeit und agentische Aufgaben ausgelegt. K3 ist über die Kimi-Website, die App und die API nutzbar; die vollständigen Modellgewichte sollen am 27. Juli veröffentlicht werden.12

Bis zur angekündigten Freigabe lassen sich die Gewichte noch nicht selbst betreiben.1 Moonshot führt schnelleres Decoding bei langen Kontexten auf Kimi Delta Attention und Attention Residuals zurück.1 Das Unternehmen meldet zudem gute Ergebnisse gegenüber proprietären Modellen in ausgewählten Tests; eine unabhängige Bestätigung dieser Vergleiche steht aus.3 Für Unternehmen sind neben der Modellqualität vor allem Kosten und Latenz im eigenen Einsatz entscheidend.

Was das für Unternehmen bedeutet

Wenn du lange Dokumente oder agentische Abläufe verarbeitest, teste K3 mit eigenen Aufgaben auf Qualität, Latenz und Tokenkosten. Plane einen möglichen Eigenbetrieb erst, wenn die angekündigten Gewichte und ihre Nutzungsbedingungen vorliegen.

Quellen (4)
  1. 1 Introducing Kimi K3: Open Frontier Intelligence 🔹 2.8 ... x.com
  2. 2 Kimi K3: 2.8T Open Model for Coding & Knowledge Work kimi.ai
  3. 3 China's Moonshot unveils world's largest open AI model, closing in ... reuters.com
  4. 4 Kimi K3, and what we can still learn from the pelican ... simonwillison.net
3 Modelle Open SourceBild, Video & AudioKI im Unternehmen

Thinking Machines veröffentlicht Inkling mit offenen Gewichten

Inkling verarbeitet Text, Bilder und Audio. Thinking Machines stellt die Modellgewichte zum Download bereit und bietet Feinabstimmung über Tinker an.

Thinking Machines Lab hat am 15. Juli 2026 Inkling vorgestellt: sein erstes von Grund auf trainiertes Modell und seine erste Veröffentlichung mit offenen Gewichten.1 Die vollständigen Gewichte stehen zum Download bereit; zugleich kann Inkling auf Tinker feinabgestimmt werden.1 Das Mixture-of-Experts-Modell hat insgesamt 975 Milliarden Parameter, von denen 41 Milliarden aktiv sind, und verarbeitet Text, Bilder und Audio nativ.1 Laut Reuters ist Inkling auch auf anderen Entwicklerplattformen verfügbar.2

Das Unternehmen positioniert Inkling als Grundlage für Anpassungen statt als fertigen Chatbot.1 Damit richtet sich die Veröffentlichung an Teams, die ein Modell für eigene Anwendungen weitertrainieren wollen. Reuters zählt Inkling zu den wenigen US-amerikanischen Alternativen zu großen Modellen mit offenen Gewichten aus chinesischen KI-Laboren.2 Die konkreten Preise für Tinker stehen laut Thinking Machines in der Dokumentation; die Ankündigung nennt keine Preisliste.1

Was das für Unternehmen bedeutet

Wenn du ein multimodales Modell für eigene Aufgaben anpassen willst, kannst du Inkling als Ausgangspunkt prüfen. Vergleiche vor dem Einsatz die Tinker-Preise und den Aufwand für den Betrieb mit deinen Anforderungen.

Quellen (2)
  1. 1 Inkling: Our Open-Weights Model - Thinking Machines Lab thinkingmachines.ai
  2. 2 AI startup Thinking Machines launches an open-weight AI ... reuters.com
4 Modelle Open SourceBild, Video & Audio

PrismML veröffentlicht Bonsai 27B mit 3,9 GB für lokale KI

PrismML hat eine 1-Bit-Version von Bonsai 27B mit rund 3,9 GB veröffentlicht. Laut Firmenchef prüft auch Apple die Technik; Apple äußerte sich dazu nicht.

PrismML hat am 14. Juli 2026 Bonsai 27B veröffentlicht, eine komprimierte, multimodale Fassung von Qwen3.6-27B. Die binäre 1-Bit-Version ist laut Unternehmen rund 3,9 GB groß und soll lokal auf einem iPhone 15 oder neuer laufen. Daneben ist eine ternäre Version mit 1,58 Bit verfügbar.12 PrismML-Chef Babak Hassibi sagte gegenüber CNBC, Apple und weitere Unternehmen prüften die Technik. Apple äußerte sich dazu nicht.2

Bonsai 27B verdichtet ein bestehendes Modell; es ist kein neu vortrainiertes Basismodell mit 27 Milliarden Parametern.13 Das macht die Veröffentlichung für Unternehmen interessant, die KI direkt auf Geräten statt ausschließlich über Server betreiben wollen. Die Eignung für Smartphones und die gemeldeten Geschwindigkeiten sind Angaben von PrismML. Ob Leistung und Ausgabequalität für eine konkrete Anwendung ausreichen, muss sich auf der Zielhardware zeigen.14

Was das für Unternehmen bedeutet

Wenn du KI lokal einsetzen willst, prüfe Speicherbedarf, Geschwindigkeit und Ausgabequalität auf deinen Zielgeräten. Vergleiche beide Varianten mit deinem bisherigen Modell, bevor du eine Offline-Anwendung planst.

Quellen (4)
  1. 1 The First 27B Model to Run on a Phone prismml.com
  2. 2 Apple in talks with startup that shrinks AI models to run on ... cnbc.com
  3. 3 Announcing Bonsai 27B: The First 27B-Class Model to Run ... prismml.com
  4. 4 PrismML releases Bonsai 27B, claiming first major AI ... 9to5mac.com
5 Forschung KI-AgentenWissenschaft & Medizin

OpenAI beansprucht Beweis für Graphentheorie-Vermutung

OpenAI schreibt GPT-5.6 Sol Ultra einen Beweis der Cycle Double Cover Conjecture zu. Ob die Argumentation trägt, ist nicht bestätigt.

OpenAI hat im Juli 2026 einen Beweis der Cycle Double Cover Conjecture vorgestellt und schreibt ihn GPT-5.6 Sol Ultra zu. Ein Beweistext und der verwendete Prompt wurden öffentlich geteilt.12 Ein Manuskript zur behaupteten Lösung ist zudem auf arXiv abrufbar.3 Die Veröffentlichung belegt jedoch noch nicht, dass die Argumentation vollständig und korrekt ist.

Die Cycle Double Cover Conjecture ist eine seit Jahrzehnten offene Frage der Graphentheorie.4 Der Fall zeigt, wie KI-Systeme für anspruchsvolle Beweisaufgaben eingesetzt werden. Laut Berichten arbeiteten dabei mehrere Subagenten parallel.1 Entscheidend ist nun die Prüfung durch Fachleute: Ein öffentliches Manuskript ersetzt keine unabhängige Begutachtung. Bis dahin bleibt die Lösung ein Anspruch von OpenAI und kein bestätigter mathematischer Satz.34

Was das für Unternehmen bedeutet

Wenn du KI für Forschung einsetzt, trenne einen generierten Beweis von einem geprüften Ergebnis. Plane fachliche Prüfung ein, bevor du solche Resultate weiterverwendest.

Quellen (4)
  1. 1 OpenAI's GPT-5.6 Sol Ultra proves 50-year-old math conjecture in under an hour cryptobriefing.com
  2. 2 Ethan Knight on X: "Yesterday, we made GPT-5.6 Sol Ultra ... x.com
  3. 3 A proof of the cycle double cover conjecture by OpenAI arxiv.org
  4. 4 OpenAI’s GPT-5.6 Sol proves 50-year-old cycle double cover conjecture dongascience.com
6 Forschung Benchmarks & ReasoningWissenschaft & Medizin

Ant Group beschreibt Reasoning-Training ohne menschliche Annotationen

Ein Forschungsteam von Ant Group beschreibt das Training eines Reasoning-Modells mit einer Billion Parametern. Die Ergebnisse sind bislang nicht unabhängig bestätigt.

Das InclusionAI-Team von Ant Group beschreibt in einer im Juli vorgestellten Arbeit Ring-2.5-1T-Zero: ein Reasoning-Modell mit einer Billion Parametern auf Basis der Ling-Architektur. Laut dem Bericht trainierte das Team das Modell mit Reinforcement Learning und überprüfbaren Belohnungssignalen, ohne menschlich annotierte Trainingsdaten zu verwenden. Eine breite öffentliche Verfügbarkeit des Modells ist nicht belegt.1

Die Arbeit untersucht, ob sich Reasoning-Fähigkeiten in dieser Größenordnung ohne menschliche Annotationen entwickeln lassen. Das Team berichtet unter anderem von Selbstüberprüfung und parallelen Lösungswegen während des Trainings. Diese Beobachtungen und die genannten Ergebnisse bei Mathematikaufgaben sind jedoch nicht unabhängig bestätigt. Ant Group stellte im selben Zeitraum auch technische Informationen zur verwandten Modellgeneration Ring 2.6 vor; deren Veröffentlichung ist nicht mit einem öffentlichen Zugang zu Ring-2.5-1T-Zero gleichzusetzen.12

Was das für Unternehmen bedeutet

Wenn du Reasoning-Modelle für Fachaufgaben prüfst, teste sie mit eigenen, überprüfbaren Aufgaben statt allein mit veröffentlichten Benchmarks. Kläre vor einer Einsatzplanung, ob Modellgewichte oder ein verlässlicher Zugang tatsächlich verfügbar sind.

Quellen (2)
  1. 1 Trillion Parameters, No Human Labels: Ant Group Documents Five Emergent AI Behaviors techtimes.com
  2. 2 Ring 2.6: Trillion-Scale Foundation Models | Medium - Ling ant-ling.medium.com
7 Infrastruktur & Hardware Open SourceChips & RechenzentrenKI im Unternehmen

Colibrì bringt GLM-5.2 ohne GPU auf den PC

Ein unabhängiges Inferenzprojekt lädt Teile von GLM-5.2 bei Bedarf von einer SSD. So soll das große Modell auch auf einem Rechner ohne GPU laufen.

Das unabhängige Inferenzprojekt Colibrì ermöglicht es, Z.ais GLM-5.2 ohne GPU auf einem PC auszuführen. Dabei bleiben gemeinsam genutzte Modellteile im Arbeitsspeicher, während benötigte Experten von einer NVMe-SSD geladen werden.1 Z.ai hatte GLM-5.2 bereits im Juni als Open-Weight-Modell veröffentlicht; Colibrì ist keine neue Modellversion des Unternehmens.21

GLM-5.2 ist ein Mixture-of-Experts-Modell mit rund 744 Milliarden Parametern, von denen bei jeder Ausgabe nur ein Teil genutzt wird.1 Das Laden von der SSD macht den Betrieb mit weniger Arbeitsspeicher möglich, sagt aber noch nichts über die Geschwindigkeit bei konkreten Aufgaben aus.1 Für andere Einsatzszenarien wird GLM-5.2 weiterhin für GPU-basierte Systeme optimiert.3 Die CPU-Variante ist damit vor allem eine zusätzliche Möglichkeit, das Modell lokal zu erproben.

Was das für Unternehmen bedeutet

Wenn du große Modelle lokal testen willst, prüfe zuerst CPU-Anforderungen und freien SSD-Speicher. Miss die Antwortzeiten mit deinen eigenen Aufgaben, bevor du den Ansatz für produktive Anwendungen einplanst.

Quellen (3)
  1. 1 A new inference engine called 'Colibrì' has emerged that can run the massive AI 'GLM-5.2,' with 744 billion parameters, on a regular PC with 25GB of memory. gigazine.net
  2. 2 CAISI Assessment of Z.ai's GLM-5.2 nist.gov
  3. 3 Serving GLM5.2 NVFP4 Agentic Workload with SGLang lmsys.org
8 Modelle Open SourceChips & Rechenzentren

Unsloth veröffentlicht Qwen3.6-Quants; AMD bestätigt Radeon-Support

Unsloth bietet quantisierte Qwen3.6-Modelle für lokale Inferenz an. AMD bestätigt später Unterstützung für Radeon-Grafikkarten; die veröffentlichten Tempowerte stammen von NVIDIA-Hardware.

Unsloth hat im Juli quantisierte Varianten von Qwen3.6 veröffentlicht, darunter NVFP4-Versionen der Modelle 27B und 35B-A3B für lokale Inferenz.12 Die Modelle sind über Hugging Face verfügbar; Unsloth kündigte zudem Qwen3.6-Unterstützung für seinen Software-Stack an.23 Das Unternehmen bewirbt die neuen Quantisierungen mit höherer Inferenzgeschwindigkeit auf unterstützter Hardware.12

AMD bestätigte am 20. Juli offiziell Unsloth-Unterstützung für seine Hardware, darunter Radeon RX 7000 und 9000. Dazu gehören auch Inferenzwege über GGUF und llama.cpp; die native AMD-Inferenz für Qwen3.6 ist laut AMD standardmäßig aktiviert.4 Damit kommen AMD-Systeme für den lokalen Betrieb infrage. Die veröffentlichten Leistungsmessungen für Unsloths neue Quantisierungen stammen jedoch von NVIDIA-Hardware und belegen keinen entsprechenden Tempovorteil auf Radeon.52

Was das für Unternehmen bedeutet

Wenn du Qwen3.6 lokal einsetzen willst, prüfe zuerst, welches Modellformat und welcher Inferenzweg zu deiner Hardware passen. Plane Leistungstests auf deinen eigenen Radeon-Systemen ein, statt NVIDIA-Messwerte zu übernehmen.

Quellen (5)
  1. 1 New 2.5x Faster Qwen3.6 NVFP4 Unsloth quants - DGX Spark / GB10 forums.developer.nvidia.com
  2. 2 @danielhanchen on Hugging Face: "We're releasing new Qwen3.6 ... huggingface.co
  3. 3 unsloth/Qwen3.6-27B-NVFP4 · Hugging Face huggingface.co
  4. 4 Train & run models on AMD GPUs with Unsloth amd.com
  5. 5 2.5x faster NVFP4 Qwen3.6 27B + 35B-A3B quants ... x.com
9 Modelle Open SourceRobotik & GeräteBild, Video & Audio

LingBot-Map rekonstruiert 3D-Szenen aus gewöhnlichem Video

Robbyant hat LingBot-Map als quelloffenes Modell für die laufende 3D-Rekonstruktion veröffentlicht. Rund 20 Bilder pro Sekunde auf einer GPU sind gemeldet, aber nicht unabhängig belegt.

Robbyant, die Robotiksparte der Ant Group, hat LingBot-Map im April 2026 quelloffen veröffentlicht. Das Modell soll aus einem laufenden Videostream einer gewöhnlichen Kamera eine 3D-Szene rekonstruieren, ohne LiDAR oder Tiefensensoren zu benötigen. Es verarbeitet die Bilder direkt und liefert unter anderem Schätzungen der Kameraposition, Tiefendaten und Punktwolken. Laut den verfügbaren Beschreibungen erreicht es auf einer GPU etwa 20 Bilder pro Sekunde.12

Für Robotik und räumliche Anwendungen wäre das interessant, weil die Rekonstruktion während der Aufnahme statt erst nach einer aufwendigen Offline-Verarbeitung erfolgen könnte. Die genannte Geschwindigkeit ist allerdings nur aus Sekundärquellen bekannt. Welche GPU dafür verwendet wurde und ob die Zahl allein die Modellinferenz oder die gesamte Verarbeitung umfasst, bleibt anhand dieser Angaben offen. Unternehmen sollten den Durchsatz deshalb mit ihren eigenen Kameras und Szenen prüfen, bevor sie Echtzeitanforderungen darauf stützen.1

Was das für Unternehmen bedeutet

Wenn du 3D-Rekonstruktion für Robotik oder Inspektion einsetzt, teste LingBot-Map mit deinen Kameradaten und auf deiner Zielhardware. Prüfe dabei Latenz und Genauigkeit über längere Aufnahmen, statt die gemeldete Bildrate zu übernehmen.

Quellen (2)
  1. 1 LingBot-Map singularitybyte.com
  2. 2 今日开源[第25期]LingBot-Map - zhang-yd cnblogs.com
10 Infrastruktur & Hardware Open SourceChips & Rechenzentren

Colibrì demonstriert 744-Milliarden-Parameter-Modell auf 25 GB RAM ohne GPU

Eine Open-Source-Inferenz-Engine soll GLM-5.2 mit wenig Arbeitsspeicher lokal ausführen. Dafür liest sie Modellteile von einer SSD – bei sehr geringer Geschwindigkeit.

Das Open-Source-Projekt Colibrì soll Z.ais GLM-5.2 mit 744 Milliarden Parametern auf einem Rechner mit rund 25 GB RAM und ohne GPU ausführen können.12 Der im Juli 2026 öffentlich gewordene Proof of Concept ist keine neue Modellveröffentlichung, sondern eine Inferenz-Engine für CPUs.12 Sie hält einen Teil des Mixture-of-Experts-Modells im Arbeitsspeicher und liest benötigte Experten bei Bedarf von einer NVMe-SSD.13

Der Ansatz senkt den RAM-Bedarf, benötigt aber viel lokalen Speicherplatz und häufige Zugriffe auf das Laufwerk.13 Auf dem Referenzrechner des Entwicklers mit zwölf CPU-Kernen soll die Generierung nur etwa 0,05 bis 0,1 Token pro Sekunde erreichen.4 Colibrì zeigt damit eine Möglichkeit für lokale Experimente mit großen Modellen. Als Proof of Concept ist das Projekt jedoch keine ausgewiesene produktionsreife Lösung.2

Was das für Unternehmen bedeutet

Wenn du große Modelle lokal testen willst, prüfe neben dem RAM auch SSD-Kapazität und Antwortzeit. Für Anwendungen mit kurzen Reaktionszeiten ist dieser Proof of Concept keine belastbare Grundlage.

Quellen (4)
  1. 1 GLM-5.2, a 744-Billion-Parameter Model on 25 GB of RAM pasqualepillitteri.it
  2. 2 Colibrì proof-of-concept gains frontier-level 1.5-TB AI model — novel approach runs on only 25GB of RAM and shows promise for local AI setups tomshardware.com
  3. 3 colibri: GLM 5.2 (744B) on 25 GB of RAM, streaming ... - noze noze.it
  4. 4 Self hosting a 744B param LLM with only 25 GB RAM pinggy.io

Welche dieser Entwicklungen ist für dein Unternehmen relevant?

Wir helfen dir, aus KI-News konkrete Use Cases zu machen, von der Bewertung bis zur Umsetzung.

Erstgespräch buchen

Wir werten jede Woche eine Vielzahl von Quellen zu KI aus, wählen die für Unternehmen relevantesten Meldungen aus und recherchieren jede davon nach. Die Texte entstehen KI-gestützt und verlinken die Originalquellen. So funktioniert unser News-Agent