Zum Inhalt springen
Alle KI-News

KI-News · KW 39/2026

OpenAI senkt GPT-6-Preise, Anthropic bringt Claude Opus 5.5

· 10 Meldungen · 31 Quellen

KI-gestützt erstellt, Quellen je Meldung verlinkt

OpenAI senkt die API-Preise für GPT-6 Sol und Luna. Anthropic stellt Claude Opus 5.5 mit geringeren Nutzungskosten vor. In ChatGPT Work lassen sich Dokumente, Präsentationen und Tabellen nun per Sprache erstellen. Grok 4.7 und Step 5 Preview bieten große Kontextfenster, während neue GGUF-Versionen von Qwen-Modellen für die lokale Nutzung erscheinen.

1 Modelle Preise & KostenCoding & EntwicklungSicherheit & Alignment

Anthropic stellt Claude Opus 5.5 mit geringeren Nutzungskosten vor

Claude Opus 5.5 soll bei vielen Aufgaben das Niveau von Fable 5.1 erreichen. Laut Anthropic kosten typische Aufgaben rund 40 % weniger als mit Opus 5.

Anthropic hat Claude Opus 5.5 am 22. September 2026 vorgestellt. Es ist das erste Modell der Claude-5.5-Familie und über Anthropics Plattform sowie über AWS, Google Cloud und Microsoft Azure verfügbar.12 Laut Anthropic erreicht es bei vielen Aufgaben das Niveau von Claude Fable 5.1. Typische Aufgaben sollen rund 40 % weniger kosten als mit Opus 5; Reuters zufolge erzeugt das Modell Ausgaben mehr als 30 % schneller.31

Die geringeren Gesamtkosten beruhen nicht allein auf niedrigeren Token-Preisen: Laut Anthropic benötigt das Modell auch weniger Tokens, um Aufgaben abzuschließen.31 Für Unternehmen ist deshalb der Preis pro erledigter Aufgabe aussagekräftiger als der Listenpreis allein. Gemeldete Stärken betreffen unter anderem Softwareentwicklung und Diagrammerkennung; einen generellen Vorsprung bei visuellem Design belegen die vorliegenden Ergebnisse nicht.31 METR hält eine leichte Beschleunigung der KI-Forschung durch das Modell für möglich, eine vollständige Automatisierung aber für unwahrscheinlich.4

Was das für Unternehmen bedeutet

Wenn du Modelle für wiederkehrende Aufgaben vergleichst, miss die Kosten und Laufzeit pro abgeschlossenem Vorgang statt nur den Token-Preis. Prüfe die Qualität bei deinen eigenen Coding- und Analyseaufgaben, bevor du bestehende Abläufe umstellst.

Quellen (4)
  1. 1 Introducing Claude Opus 5.5 anthropic.com
  2. 2 Claude Opus 5.5 - Claude Platform Docs platform.claude.com
  3. 3 Anthropic unveils Claude Opus 5.5 reuters.com
  4. 4 Summary of METR's predeployment evaluation of Claude ... metr.org
2 Modelle Preise & KostenCoding & EntwicklungKI im Unternehmen

OpenAI bringt GPT-6 Sol und Luna zu niedrigeren API-Preisen

GPT-6 Sol kostet über die API halb so viel wie sein Vorgänger zu dessen Aktionspreisen. Auch GPT-6 Luna wird günstiger angeboten.

OpenAI hat am 22. September GPT-6 Sol und GPT-6 Luna als günstigere Modelle der GPT-6-Reihe vorgestellt.12 Sie sind in ChatGPT Work und Codex für Plus-, Pro-, Business-, Enterprise- und Edu-Nutzer sowie über die API verfügbar.12 Die API-Preise für Sol liegen bei der Hälfte der Aktionspreise von GPT-5.6 Sol. Luna kostet ebenfalls weniger als GPT-5.6 Luna.1

Sol ist für komplexere Aufgaben wie Programmierung und Automatisierung gedacht, Luna für einfachere Arbeiten mit hohem Volumen.34 Am selben Tag stellte Anthropic Claude Opus 5.5 vor – ein weiteres Angebot für anspruchsvolle Softwareentwicklung.5 OpenAI meldet für Sol zudem etwa halb so viele Fehler wie beim Vorgänger. Dieser Wert stammt aus einer internen Bewertung zur Faktentreue und ist kein unabhängiger Vergleich.4

Was das für Unternehmen bedeutet

Wenn du Modelle für Programmierung oder wiederkehrende Aufgaben einsetzt, prüfe die neuen API-Preise gegen deine bisherigen Kosten. Teste Sol und Luna mit eigenen Aufgaben, bevor du bestehende Abläufe umstellst.

Quellen (5)
  1. 1 Introducing GPT-6 Sol and Luna - OpenAI openai.com
  2. 2 Announcing GPT-6 Sol and GPT-6 Luna in the API, Codex and ChatGPT community.openai.com
  3. 3 OpenAI expands GPT-6 lineup with cheaper Sol and Luna models reuters.com
  4. 4 OpenAI launches GPT-6 Sol and Luna, boasting lower cost and fewer mistakes | TechCrunch techcrunch.com
  5. 5 Anthropic unveils Claude Opus 5.5 reuters.com
3 Produkte & Tools KI-AgentenChatbots & AssistentenArbeit & Gesellschaft

ChatGPT Voice kann Aufgaben in Work übernehmen

Per Sprache lassen sich in ChatGPT Work Dokumente, Präsentationen und Tabellen erstellen. Unfertige Aufgaben können nach dem Anruf im Textchat weiterlaufen.

OpenAI hat ChatGPT Voice am 23. September für ChatGPT Work erweitert. Nutzer können per Sprache Aufgaben anstoßen, Dokumente, Präsentationen und Tabellen erstellen lassen sowie verbundene Apps oder einen Browser nutzen. Voice ist in Work im Web und auf Mobilgeräten verfügbar. Endet ein Sprachanruf, kann eine unfertige Aufgabe im Textchat weiterlaufen.12

Die Änderung verbindet Sprachsteuerung mit längeren Arbeitsabläufen: Nutzer können Aufgaben starten, den Fortschritt erfragen und die Arbeit während der Ausführung umlenken. OpenAI beschreibt solche Funktionen auch für Codex.13 Für Unternehmen ist vor allem der Wechsel zwischen Gespräch und Text relevant, wenn eine Aufgabe mehr Zeit braucht als der Anruf. Welche Tarife und Nutzungsgrenzen für alle Funktionen gelten, geht aus den veröffentlichten Hinweisen nicht vollständig hervor.13

Was das für Unternehmen bedeutet

Wenn du Arbeitsabläufe per Sprache startest, prüfe, ob Aufgaben nach dem Anruf im Textchat wie erwartet weiterlaufen. Kläre vor einer breiten Einführung, welche Funktionen für deinen Tarif und deine Geräte verfügbar sind.

Quellen (4)
  1. 1 ChatGPT Business - Release Notes | OpenAI Help Center help.openai.com
  2. 2 ChatGPT — Release Notes - OpenAI Help Center help.openai.com
  3. 3 ChatGPT Enterprise & Edu - Release Notes | OpenAI Help Center help.openai.com
  4. 4 OpenAI on X: "We heard you loud and clear. ChatGPT ... x.com
4 Produkte & Tools KI im UnternehmenArbeit & GesellschaftChatbots & Assistenten

OpenAI stellt Astra for Law für ausgewählte US-Kanzleien vor

Die juristische Konfiguration von GPT-6 Astra verbindet Recherche und Textarbeit mit einem täglich aktualisierten US-Rechtsindex. Der Zugang ist zunächst beschränkt.

OpenAI hat Astra for Law am 17. September 2026 vorgestellt. Das Angebot kombiniert GPT-6 Astra mit Anweisungen für juristische Recherche und Textarbeit sowie einem täglich aktualisierten Suchindex für US-Rechtsquellen.12 Zunächst erhalten ausgewählte US-Kanzleien über Trusted Access in ChatGPT und Codex Zugang; eine API soll folgen.2

Der Index umfasst unter anderem Rechtsprechung, Gesetze und Verordnungen.1 OpenAI tritt damit stärker in den Markt für juristische KI-Software ein, in dem bereits spezialisierte Anbieter Kanzleien bedienen.3 Astra for Law ist keine eigenständige neue Modellfamilie, sondern eine auf juristische Aufgaben zugeschnittene Konfiguration von GPT-6 Astra.12 Wegen des begrenzten Zugangs können Kanzleien außerhalb des Programms das Angebot vorerst nicht regulär nutzen.2

Was das für Unternehmen bedeutet

Wenn du KI für juristische Arbeit prüfst, achte darauf, welche Quellen die Suche abdeckt und ob Ergebnisse überprüfbar sind. Plane eine Einführung erst, wenn Zugang und Anforderungen an den Umgang mit Mandantendaten geklärt sind.

Quellen (3)
  1. 1 Introducing Astra for Law openai.com
  2. 2 Astra for Law help.openai.com
  3. 3 OpenAI launches legal-focused AI platform, escalating race ... reuters.com
5 Modelle Coding & EntwicklungBild, Video & AudioOpen Source

StepFun stellt Step 5 Preview mit einer Million Tokens Kontext vor

StepFun bietet sein neues Modell als Vorschau per API an. Das Kontextfenster soll eine Million Tokens umfassen.

Das chinesische Unternehmen StepFun hat im September 2026 Step 5 Preview vorgestellt. Das Modell ist als Vorschau über StepFuns API und Studio verfügbar. Sein Kontextfenster soll eine Million Tokens umfassen. StepFun richtet es unter anderem auf Softwareentwicklung und wissensintensive Aufgaben aus.12

Das große Kontextfenster könnte es erleichtern, umfangreiche Dokumente oder Codebestände in einer Anfrage bereitzustellen. Es sagt aber für sich genommen nichts darüber aus, wie zuverlässig das Modell Informationen darin findet oder nutzt. Damit sind praktische Tests wichtiger als die maximale Eingabelänge. Für Unternehmen zählen dabei neben der Antwortqualität auch Latenz und Kosten bei langen Anfragen. Die verfügbaren Berichte belegen keinen belastbaren Leistungsvergleich mit anderen Modellen.32

Was das für Unternehmen bedeutet

Wenn du lange Dokumente oder große Codebestände verarbeitest, teste die Qualität der Antworten mit eigenen Aufgaben. Prüfe dabei auch Latenz und Kosten, bevor du das Modell in einen Arbeitsablauf einbaust.

Quellen (3)
  1. 1 SHSLab/Step-5-Preview-BF16 - Hugging Face huggingface.co
  2. 2 中国ステップファンが旗艦AI「Step 5 Preview」発表、10月15日 ... sbbit.jp
  3. 3 Step 5 Preview: 600B Sparse MoE Only Activates 27B ... - AIBase aibase.com
6 Modelle Open SourceBild, Video & Audio

Unsloth veröffentlicht GGUF-Version von Qwen-Image-2.1

Unsloth stellt eine quantisierte Version von Qwen-Image-2.1 für den lokalen Einsatz bereit. Die kleinste Datei ist 3,91 GB groß; das belegt noch keinen Betrieb mit 4 GB Arbeitsspeicher.

Unsloth hat am 22. September eine GGUF-quantisierte Version von Qwen-Image-2.1 auf Hugging Face veröffentlicht und Unterstützung für den lokalen Betrieb in seinen Werkzeugen angekündigt. Die bereitgestellten Dateien enthalten mehrere Quantisierungen des Modells für Bilderzeugung und Bildbearbeitung. Unsloth nennt in seiner Ankündigung 12 GB Grafikspeicher als Voraussetzung für den lokalen Einsatz.123

Die Veröffentlichung bietet eine weitere Möglichkeit, das Bildmodell statt über einen gehosteten Dienst auf eigener Hardware zu nutzen. Dabei ist die Dateigröße nicht mit dem Speicherbedarf während der Bilderzeugung gleichzusetzen: Eine GGUF-Datei bleibt zwar unter 4 GB, doch die verfügbaren Angaben bestätigen keinen vollständigen Betrieb mit nur 4 GB Arbeitsspeicher. Wer das Modell einsetzen will, sollte den tatsächlichen Speicherbedarf seiner gewählten Konfiguration prüfen.13

Was das für Unternehmen bedeutet

Wenn du Bilder lokal erzeugen oder bearbeiten willst, kannst du die GGUF-Version auf deiner Zielhardware testen. Plane Grafikspeicher und Laufzeit anhand des gesamten Workflows ein, nicht allein anhand der Dateigröße.

Quellen (3)
  1. 1 unsloth/Qwen-Image-2.1-GGUF - Hugging Face huggingface.co
  2. 2 Unsloth Updates unsloth.ai
  3. 3 Unsloth AI on X: "Qwen-Image-2.1 can now run locally on 12GB ... x.com
7 Modelle Coding & EntwicklungKI im UnternehmenPreise & Kosten

xAI veröffentlicht Grok 4.7 mit 500.000 Tokens Kontext

Grok 4.7 soll Programmierung und Wissensarbeit unterstützen. xAI bietet das Modell mit einem Kontextfenster von 500.000 Tokens über die Grok API und weitere Plattformen an.

xAI hat am 21. September 2026 Grok 4.7 vorgestellt. Das Unternehmen bezeichnet es als sein leistungsfähigstes Modell für Programmierung und Wissensarbeit und nennt verbesserte Selbstprüfung beim Schlussfolgern sowie stärkere Schutzmaßnahmen. Das Kontextfenster umfasst 500.000 Tokens. Grok 4.7 ist laut xAI ab sofort in Cursor und Grok Build sowie über die Grok API, weitere Coding-Werkzeuge, Modellrouter und Cloud-Plattformen verfügbar.1

Mit dem breiten Zugang richtet sich die Veröffentlichung sowohl an Entwickler, die ein Modell in ihre bestehenden Werkzeuge einbinden, als auch an Unternehmen mit eigenen Anwendungen. xAI nennt getrennte Preise für Eingabe und Ausgabe und bietet eine schnellere, teurere Variante an.1 GitHub führt Grok 4.7 außerdem schrittweise in GitHub Copilot ein.2 Wie gut sich die angekündigten Verbesserungen im jeweiligen Arbeitsablauf auswirken, müssen Anwender selbst prüfen.

Was das für Unternehmen bedeutet

Wenn du KI für Code oder Wissensarbeit einsetzt, teste Grok 4.7 mit Aufgaben aus deinem eigenen Arbeitsablauf. Prüfe dabei Antwortqualität, Kosten für Ausgabetokens und den Nutzen des großen Kontextfensters.

Mehr zu: xAI Grok
Quellen (2)
  1. 1 Introducing Grok 4.7 x.ai
  2. 2 Grok 4.7 is now available in GitHub Copilot github.blog
8 Infrastruktur & Hardware Open SourceKI im Unternehmen

White Circle stellt Halo für verteiltes Hugging-Face-Training vor

Das quelloffene Framework soll bestehende Modelle ohne Umbau für verteiltes Training nutzbar machen. White Circle meldet in eigenen Tests einen höheren Durchsatz als mit TRL.

White Circle hat am 21. September 2026 Halo vorgestellt, ein quelloffenes Framework für das Post-Training und verteilte Training von Hugging-Face-Modellen.1 Es soll sich an bestehende Modelle und TRL-Workflows anbinden lassen, ohne Modelldefinitionen oder Checkpoint-Formate umzuschreiben.1 In eigenen Tests erzielte White Circle nach eigenen Angaben den 2,3- bis 2,8-fachen Durchsatz gegenüber unverändertem TRL. Zugleich sei der maximale Speicherbedarf gesunken.1

Halo richtet sich damit an Teams, die vorhandene Modelle für verteiltes Training nutzen wollen, ohne sie für ein anderes Framework neu zu implementieren.1 Es unterstützt die Parallelisierung über Experten, Kontext und Tensoren sowie eine Kombination aus Experten- und Tensorparallelisierung.1 Die Leistungswerte sind bislang Ergebnisse des Anbieters. Sie zeigen nicht, ob der gleiche Vorteil auch bei anderen Modellen, Trainingsaufgaben oder Hardwarekonfigurationen entsteht.1

Was das für Unternehmen bedeutet

Wenn du Hugging-Face-Modelle nachtrainierst, teste Halo mit deinem Modell und deiner Hardware gegen deinen bisherigen TRL-Workflow. Prüfe dabei Durchsatz, maximalen GPU-Speicherbedarf und die Weiterverwendung vorhandener Checkpoints.

Quellen (2)
  1. 1 Halo: Frontier-Lab Training for Everyone - White Circle whitecircle.com
  2. 2 White Circle、AIモデルの追加学習向けフレームワーク「Halo」を発表 ——Hugging Faceの既存モデルに分散学習を追加 | gihyo.jp gihyo.jp
9 Modelle Open SourceBenchmarks & Reasoning

PrismML veröffentlicht komprimiertes Modell Bonsai 2 27B

Bonsai 2 27B soll bei deutlich geringerem Speicherbedarf 98,2 % der Benchmark-Leistung seines Ausgangsmodells erreichen. Die Gewichte sind frei verfügbar.

PrismML hat am 17. September 2026 Ternary Bonsai 2 27B veröffentlicht. Das Modell basiert auf Qwen3.8 27B und nutzt ternäre Gewichte; laut Unternehmen ist es mehr als neunmal kleiner als die FP16-Version des Ausgangsmodells. In PrismMLs Auswertung über 20 Benchmarks erreicht es 98,2 % von dessen durchschnittlicher Leistung. Die Modellgewichte sind kostenlos verfügbar.12

Die geringere Größe macht das Modell vor allem für lokale Anwendungen interessant, bei denen Speicherplatz begrenzt ist.2 Bonsai 2 baut auf PrismMLs früherem Bonsai 27B auf und soll bei ähnlicher Komprimierung eine höhere Qualität bieten.12 Die Leistungsangaben beruhen jedoch auf den Tests des Unternehmens. Wer das Modell einsetzen will, sollte prüfen, ob die Ergebnisse auch für die eigenen Aufgaben gelten.2

Was das für Unternehmen bedeutet

Wenn du Modelle lokal betreiben willst, könnte der geringere Speicherbedarf neue Geräteoptionen eröffnen. Teste vor einem Einsatz Qualität, Geschwindigkeit und Speicherverbrauch mit deinen eigenen Aufgaben.

Quellen (2)
  1. 1 PrismML Launches Bonsai 2 27B, Its Most Capable Model ... prismml.com
  2. 2 Introducing Bonsai 2 27B: Near-Lossless Compression ... - PrismML prismml.com
10 Modelle Open SourceCoding & Entwicklung

Empero veröffentlicht Qwen-Distillat mit GGUF-Dateien für llama.cpp

Das Modell hat 35 Milliarden Parameter, nutzt aber nur etwa 3 Milliarden pro Token. Quantisierte Dateien ermöglichen lokale Inferenz mit llama.cpp.

Empero hat am 16. September Qwen3.8-35B-A3B-Distill und quantisierte GGUF-Dateien für die lokale Inferenz veröffentlicht. Das Mixture-of-Experts-Modell hat insgesamt 35 Milliarden Parameter; pro Token sind etwa 3 Milliarden aktiv. Laut Modellbeschreibung wurde es aus Ausgaben eines Qwen3.8-Lehrmodells in die Qwen3.6-35B-A3B-Architektur destilliert und ist für Aufgaben wie Schlussfolgern, Mathematik, Programmieren und Werkzeugnutzung vorgesehen. Die GGUF-Version ist für llama.cpp ausgelegt.123

Die geringe Zahl aktiver Parameter kann den Rechenaufwand pro Token senken. Sie bedeutet aber nicht, dass das Modell so wenig Speicher wie ein Modell mit insgesamt 3 Milliarden Parametern benötigt: Die gesamte gewählte Gewichtsdatei muss in RAM oder VRAM passen. Für Unternehmen ist damit neben der Rechenleistung auch die Größe der jeweiligen Quantisierung entscheidend. Die veröffentlichten Modellkarten nennen keine Benchmark-Ergebnisse, die eine Leistungsbewertung erlauben würden.23

Was das für Unternehmen bedeutet

Wenn du lokale Inferenz planst, prüfe zuerst, ob die gewählte Gewichtsdatei vollständig in RAM oder VRAM passt. Teste Qualität und Geschwindigkeit mit deinen eigenen Aufgaben, bevor du das Modell produktiv einsetzt.

Quellen (3)
  1. 1 Post - X x.com
  2. 2 empero-ai/Qwen3.8-35B-A3B-Distill-GGUF · Hugging Face huggingface.co
  3. 3 empero-ai/Qwen3.8-35B-A3B-Distill · Hugging Face huggingface.co

Welche dieser Entwicklungen ist für dein Unternehmen relevant?

Wir helfen dir, aus KI-News konkrete Use Cases zu machen, von der Bewertung bis zur Umsetzung.

Erstgespräch buchen

Wir werten jede Woche eine Vielzahl von Quellen zu KI aus, wählen die für Unternehmen relevantesten Meldungen aus und recherchieren jede davon nach. Die Texte entstehen KI-gestützt und verlinken die Originalquellen. So funktioniert unser News-Agent