Signing you in...

Please wait while we verify your authentication

Article · Friday, September 18, 2026

KI-Entwicklertools · Was kam heute

Für eine erfahrene Engineerin, die ohnehin HN liest. Echte Veränderungen bei KI-Entwicklertools heute: Releases mit Versionsnummern, Paper mit Benchmarks, Repos, die eine relevante Schwelle überschritten haben. Hype-Threads, Pre-Announcement-Leaks und recycelte Zusammenfassungen überspringen. Immer Originalquellen verlinken.

By Marius BongartsTech67 editions
← See today's latest
Editions
6 / 67
Generated by AI overnight from public sources, refreshed daily.
KI-Entwicklertools · Was kam heute
Friday, September 18, 2026
KI-Entwicklertools · Was kam heute

KI-Entwicklertools · Was kam heute

1 min read

Anthropic hat Claude Fable 5.1 und Claude Mythos 5.1 veröffentlicht. Fable 5.1 kostet etwa 25% weniger als Fable 5 bei typischen Workloads, durch 75% niedrigere Preise für Cache-Reads; bei komplexen Coding- und agentengesteuerten Aufgaben können die Einsparungen bis zu 45% erreichen. Das Modell zeigt signifikante Benchmark-Verbesserungen: 52,6% auf Terminal-Bench-Science 0.1 (agentic scientific research), 60,9% auf Terminal-Bench 4.0 (agentic coding), 77,9% auf OSWorld 2.0 (Computer Use), 60,9% auf Humanity's Last Exam (Multidisciplinary Reasoning) und 73,4% auf CursorBench 3.2.0 (agentic coding) jeweils bei maximaler Effort-Einstellung. Fable 5.1 wurde mit verbessertem Verständnis langer, unbeaufsichtigter Aufgaben trainiert und nutzt neue Enterprise Frontier Safeguards (EFS) für Datenschutz bei Cloud-Infrastruktur des Kunden. Die Cybersecurity-Safeguards generieren 60% weniger False Positives und erlauben nun das Identifizieren von Software-Vulnerabilities. Claude Mythos 5.1 mit weitergehenden Safeguards steht für Cybersecurity- und Life-Sciences-Fachleute zur Verfügung; bei biologischen Anwendungen erreichte das Modell Hit-Rates von ~50% beim Protein-Binder-Design, deutlich über dem branchenüblichen 10-15%. [Quelle: anthropic]

Epoch AI hat am 3. September 2026 GPT-6 Astra vorab getestet und neue Rekorde auf dem Epoch Capabilities Index sowie bei Math-, Continual-Learning- und Game-Puzzle-Benchmarks dokumentiert. Das gleiche Datum markiert die Veröffentlichung von FrontierMath Erdős mit 68 ungelösten Erdős-Problemen, bei denen KI-Systeme Lösungen in Lean schreiben sollen – GPT-6 Astra löste 2 von 68 Problemen. Die Benchmark-Datenbank umfasst nun 391 verfolgte Modelle und 85 Benchmarks und ermöglicht Vergleiche von Modell-Performance über verschiedene Aufgabenkategorien hinweg, einschließlich Mathematik und Software-Engineering. [Quelle: epoch]

JuliusBrussee / caveman Public Uh oh! There was an error while loading. Please reload this page. Notifications You must be signed in to change notific [Quelle: github]

Sources
Introducing Claude Fable 5.1 and Claude Mythos 5.1 - Anthropic
Introducing Claude Fable 5.1 and Claude Mythos 5.1 - Anthropic
7 hours ago ... A new performance frontier. Claude Fable 5.1 sets a new standard for coding ... features to target for future observation. Radar image (Magellan) ...
anthropic.com
AI Summary

Anthropic hat Claude Fable 5.1 und Claude Mythos 5.1 veröffentlicht. Fable 5.1 kostet etwa 25% weniger als Fable 5 bei typischen Workloads, durch 75% niedrigere Preise für Cache-Reads; bei komplexen Coding- und agentengesteuerten Aufgaben können die Einsparungen bis zu 45% erreichen. Das Modell zeigt signifikante Benchmark-Verbesserungen: 52,6% auf Terminal-Bench-Science 0.1 (agentic scientific research), 60,9% auf Terminal-Bench 4.0 (agentic coding), 77,9% auf OSWorld 2.0 (Computer Use), 60,9% auf Humanity's Last Exam (Multidisciplinary Reasoning) und 73,4% auf CursorBench 3.2.0 (agentic coding) jeweils bei maximaler Effort-Einstellung. Fable 5.1 wurde mit verbessertem Verständnis langer, unbeaufsichtigter Aufgaben trainiert und nutzt neue Enterprise Frontier Safeguards (EFS) für Datenschutz bei Cloud-Infrastruktur des Kunden. Die Cybersecurity-Safeguards generieren 60% weniger False Positives und erlauben nun das Identifizieren von Software-Vulnerabilities. Claude Mythos 5.1 mit weitergehenden Safeguards steht für Cybersecurity- und Life-Sciences-Fachleute zur Verfügung; bei biologischen Anwendungen erreichte das Modell Hit-Rates von ~50% beim Protein-Binder-Design, deutlich über dem branchenüblichen 10-15%.

Visit source
AI Benchmarks & Capabilities - Epoch AI
AI Benchmarks & Capabilities - Epoch AI
2 hours ago ... Our database of benchmark results, featuring the performance of leading AI models on challenging tasks. ... GPT-6 Astra set new records on the ECI, as well ...
epoch.ai
AI Summary

Epoch AI hat am 3. September 2026 GPT-6 Astra vorab getestet und neue Rekorde auf dem Epoch Capabilities Index sowie bei Math-, Continual-Learning- und Game-Puzzle-Benchmarks dokumentiert. Das gleiche Datum markiert die Veröffentlichung von FrontierMath Erdős mit 68 ungelösten Erdős-Problemen, bei denen KI-Systeme Lösungen in Lean schreiben sollen – GPT-6 Astra löste 2 von 68 Problemen. Die Benchmark-Datenbank umfasst nun 391 verfolgte Modelle und 85 Benchmarks und ermöglicht Vergleiche von Modell-Performance über verschiedene Aufgabenkategorien hinweg, einschließlich Mathematik und Software-Engineering.

Visit source
JuliusBrussee/caveman: why use many token when few ... - GitHub
JuliusBrussee/caveman: why use many token when few ... - GitHub
6 hours ago ... No reviewed API benchmark result is published here yet. Run uv run python benchmarks/run.py to generate a new result, then review its raw response pairs and ...
github.com
Compiled overnight by MorningMail.aiDelivered at 03:10 AM