Du wirst angemeldet...

Bitte warte, während wir deine Anmeldung überprüfen

Artikel · Freitag, 18. September 2026

KI-Entwicklertools · Was kam heute

Für eine erfahrene Engineerin, die ohnehin HN liest. Echte Veränderungen bei KI-Entwicklertools heute: Releases mit Versionsnummern, Paper mit Benchmarks, Repos, die eine relevante Schwelle überschritten haben. Hype-Threads, Pre-Announcement-Leaks und recycelte Zusammenfassungen überspringen. Immer Originalquellen verlinken.

Von Marius BongartsTech67 Ausgaben
← Zur aktuellen Ausgabe
Ausgaben
6 / 67
Über Nacht von KI aus öffentlichen Quellen erstellt, täglich aktualisiert.
KI-Entwicklertools · Was kam heute
Freitag, 18. September 2026
KI-Entwicklertools · Was kam heute

KI-Entwicklertools · Was kam heute

1 Min. Lesezeit

Anthropic hat Claude Fable 5.1 und Claude Mythos 5.1 veröffentlicht. Fable 5.1 kostet etwa 25% weniger als Fable 5 bei typischen Workloads, durch 75% niedrigere Preise für Cache-Reads; bei komplexen Coding- und agentengesteuerten Aufgaben können die Einsparungen bis zu 45% erreichen. Das Modell zeigt signifikante Benchmark-Verbesserungen: 52,6% auf Terminal-Bench-Science 0.1 (agentic scientific research), 60,9% auf Terminal-Bench 4.0 (agentic coding), 77,9% auf OSWorld 2.0 (Computer Use), 60,9% auf Humanity's Last Exam (Multidisciplinary Reasoning) und 73,4% auf CursorBench 3.2.0 (agentic coding) jeweils bei maximaler Effort-Einstellung. Fable 5.1 wurde mit verbessertem Verständnis langer, unbeaufsichtigter Aufgaben trainiert und nutzt neue Enterprise Frontier Safeguards (EFS) für Datenschutz bei Cloud-Infrastruktur des Kunden. Die Cybersecurity-Safeguards generieren 60% weniger False Positives und erlauben nun das Identifizieren von Software-Vulnerabilities. Claude Mythos 5.1 mit weitergehenden Safeguards steht für Cybersecurity- und Life-Sciences-Fachleute zur Verfügung; bei biologischen Anwendungen erreichte das Modell Hit-Rates von ~50% beim Protein-Binder-Design, deutlich über dem branchenüblichen 10-15%. [Quelle: anthropic]

Epoch AI hat am 3. September 2026 GPT-6 Astra vorab getestet und neue Rekorde auf dem Epoch Capabilities Index sowie bei Math-, Continual-Learning- und Game-Puzzle-Benchmarks dokumentiert. Das gleiche Datum markiert die Veröffentlichung von FrontierMath Erdős mit 68 ungelösten Erdős-Problemen, bei denen KI-Systeme Lösungen in Lean schreiben sollen – GPT-6 Astra löste 2 von 68 Problemen. Die Benchmark-Datenbank umfasst nun 391 verfolgte Modelle und 85 Benchmarks und ermöglicht Vergleiche von Modell-Performance über verschiedene Aufgabenkategorien hinweg, einschließlich Mathematik und Software-Engineering. [Quelle: epoch]

JuliusBrussee / caveman Public Uh oh! There was an error while loading. Please reload this page. Notifications You must be signed in to change notific [Quelle: github]

Quellen
Introducing Claude Fable 5.1 and Claude Mythos 5.1 - Anthropic
Introducing Claude Fable 5.1 and Claude Mythos 5.1 - Anthropic
7 hours ago ... A new performance frontier. Claude Fable 5.1 sets a new standard for coding ... features to target for future observation. Radar image (Magellan) ...
anthropic.com
KI-Zusammenfassung

Anthropic hat Claude Fable 5.1 und Claude Mythos 5.1 veröffentlicht. Fable 5.1 kostet etwa 25% weniger als Fable 5 bei typischen Workloads, durch 75% niedrigere Preise für Cache-Reads; bei komplexen Coding- und agentengesteuerten Aufgaben können die Einsparungen bis zu 45% erreichen. Das Modell zeigt signifikante Benchmark-Verbesserungen: 52,6% auf Terminal-Bench-Science 0.1 (agentic scientific research), 60,9% auf Terminal-Bench 4.0 (agentic coding), 77,9% auf OSWorld 2.0 (Computer Use), 60,9% auf Humanity's Last Exam (Multidisciplinary Reasoning) und 73,4% auf CursorBench 3.2.0 (agentic coding) jeweils bei maximaler Effort-Einstellung. Fable 5.1 wurde mit verbessertem Verständnis langer, unbeaufsichtigter Aufgaben trainiert und nutzt neue Enterprise Frontier Safeguards (EFS) für Datenschutz bei Cloud-Infrastruktur des Kunden. Die Cybersecurity-Safeguards generieren 60% weniger False Positives und erlauben nun das Identifizieren von Software-Vulnerabilities. Claude Mythos 5.1 mit weitergehenden Safeguards steht für Cybersecurity- und Life-Sciences-Fachleute zur Verfügung; bei biologischen Anwendungen erreichte das Modell Hit-Rates von ~50% beim Protein-Binder-Design, deutlich über dem branchenüblichen 10-15%.

Quelle öffnen
AI Benchmarks & Capabilities - Epoch AI
AI Benchmarks & Capabilities - Epoch AI
2 hours ago ... Our database of benchmark results, featuring the performance of leading AI models on challenging tasks. ... GPT-6 Astra set new records on the ECI, as well ...
epoch.ai
KI-Zusammenfassung

Epoch AI hat am 3. September 2026 GPT-6 Astra vorab getestet und neue Rekorde auf dem Epoch Capabilities Index sowie bei Math-, Continual-Learning- und Game-Puzzle-Benchmarks dokumentiert. Das gleiche Datum markiert die Veröffentlichung von FrontierMath Erdős mit 68 ungelösten Erdős-Problemen, bei denen KI-Systeme Lösungen in Lean schreiben sollen – GPT-6 Astra löste 2 von 68 Problemen. Die Benchmark-Datenbank umfasst nun 391 verfolgte Modelle und 85 Benchmarks und ermöglicht Vergleiche von Modell-Performance über verschiedene Aufgabenkategorien hinweg, einschließlich Mathematik und Software-Engineering.

Quelle öffnen
JuliusBrussee/caveman: why use many token when few ... - GitHub
JuliusBrussee/caveman: why use many token when few ... - GitHub
6 hours ago ... No reviewed API benchmark result is published here yet. Run uv run python benchmarks/run.py to generate a new result, then review its raw response pairs and ...
github.com
Über Nacht zusammengestellt von MorningMail.aiZugestellt um 03:10