Du wirst angemeldet...

Bitte warte, während wir deine Anmeldung überprüfen

Artikel · Samstag, 12. September 2026

KI-Entwicklertools · Was kam heute

Für eine erfahrene Engineerin, die ohnehin HN liest. Echte Veränderungen bei KI-Entwicklertools heute: Releases mit Versionsnummern, Paper mit Benchmarks, Repos, die eine relevante Schwelle überschritten haben. Hype-Threads, Pre-Announcement-Leaks und recycelte Zusammenfassungen überspringen. Immer Originalquellen verlinken.

Von Marius BongartsTech67 Ausgaben
← Zur aktuellen Ausgabe
Ausgaben
12 / 67
Über Nacht von KI aus öffentlichen Quellen erstellt, täglich aktualisiert.
KI-Entwicklertools · Was kam heute
Samstag, 12. September 2026
KI-Entwicklertools · Was kam heute

Fable 5.1 dominiert; Benchmark Radar startet; Code-Tools clustern sich

1 Min. Lesezeit

Fable 5.1 & Mythos 5.1

Fable 5.1 setzt neue Maßstäbe bei Coding und Knowledge Work.

Anthropic veröffentlichte die beiden Modelle mit erheblichen Benchmark-Gewinnen: Terminal Bench Science auf 52,6% (von 24,7%), CursorBench auf 73,4%, Humanity's Last Exam auf 65% mit Tools [Quelle: Anthropic]. Die Preiskeule: 75% niedrigere Cache-Read-Kosten senken typische Workloads um 25%, agentic Coding-Aufgaben um bis zu 45%. Mythos 5.1 folgt mit gleichem Motor, aber schwächeren Safeguards für Cybersecurity- und Life-Science-Profis, plus Enterprise Frontier Safeguards mit Zero-Data-Retention.

Das setzt Grok 4.5 und GPT-6 unter Druck.

Benchmark Radar v0.11.0

Eine durchsuchbare Datenbank für alle KI-Evaluationen.

Benchmark Radar katalogisiert täglich 1.283 Benchmark-Einträge aus 37 Quellen – LLM-Evaluationen, agentenbasierte Tasks, Coding, Reasoning, Safety und domänenspezifische Tests [Quelle: arXiv]. Die Plattform bietet Leaderboard, Pareto-Frontier-Ansicht, tägliche Feeds, CLI und reproducible Analysen. Mit 12.916 numerischen Beobachtungen über 790 Benchmarks wird das Werkzeug zur Quelle der Wahrheit für Model-Auswahl.

Konkurriert mit Ad-hoc-Spreadsheets.

Code-Editor-Markt nach Fable 5.1

Claude Code springt in Rankings nach Zugang zu Fable 5.1.

LogRocket-Rankings zeigen Claude Code an Platz 1 mit 1.762 Elo auf WebDev Arena, 73 Punkte über dem Vorgänger [Quelle: LogRocket]. OpenCode bleibt an Platz 2 mit Modell-Agnostik (75+ Anbieter, MIT-Lizenz). Cursor hält Platz 3 nach SpaceX-Übernahme, verliert aber Marktanteile: Ramp-Share sank von 41% auf 26%. Windsurf Platz 4, neu: Grok CLI mit Subagents und Plugin-Marketplace.

Die Fragmentierung beschleunigt sich.

BullshitBench: Nonsense-Erkennung messen

Ein neuer Benchmark misst, ob Modelle Unsinn ablehnen statt zu erfinden.

BullshitBench bewertet DeepSeek V4.1 Flash, Claude Fable 5.1 und GPT-6 Astra über 13 Nonsense-Techniken in Software-, Finanz-, Rechts-, medizinischen und Physik-Fragen [Quelle: GitHub]. Drei-Richter-Panel, interaktiv durchsuchbar, mit Export für Daten und Visualisierungen – aktualisiert täglich. Tests laufen mit niedriger und maximaler Reasoning-Einstellung.

Misstraut der Sicherheit? Misst sie jetzt.

Quellen
Introducing Claude Fable 5.1 and Claude Mythos 5.1 - Anthropic
Introducing Claude Fable 5.1 and Claude Mythos 5.1 - Anthropic
2 hours ago ... On our 30-day simulated run-a-business eval, where the model gets full access to simulated Square tools ... 2 OSWorld 2.0: Scores are on the benchmark authors' ...
anthropic.com
KI-Zusammenfassung

Anthropic hat Claude Fable 5.1 und Claude Mythos 5.1 veröffentlicht, zwei neue Modelle, die als weltweit fortschrittlichste für Coding und Knowledge Work positioniert werden. Fable 5.1 zeigt erhebliche Leistungssteigerungen gegenüber seinem Vorgänger in mehreren Benchmarks: Terminal-Bench-Science 0.1 (52,6% vs. 24,7%), Terminal-Bench 4.0 (60,9% vs. 42,0%), CursorBench 3.2.0 (73,4% vs. 70,5%) und Humanity's Last Exam (65,0% vs. 63,8% mit Tools). Gleichzeitig reduzierte Anthropic die Preise um etwa 25% für typische Workloads und bis zu 45% für hochkomplexe agentic Coding-Aufgaben durch 75% niedrigere Cache-Lese-Kosten. Das Unternehmen verbesserte auch die Sicherheitsvorkehrungen: Die Cybersecurity-Safeguards zeigen 60% weniger falsch positive Meldungen, die Biology-Safeguards feuern 85% weniger bei harmlosen Anfragen. Neu ist die Unterstützung für Vulnerability-Identifikation im Defensive-Bereich. Enterprise Frontier Safeguards ermöglichen Kunden Zero-Data-Retention bei vollständiger Privatsphäre, indem Daten auf ihrer eigenen Cloud-Infrastruktur gespeichert werden. Claude Mythos 5.1 mit stärkeren Safeguards ist für Cyberdefense und Life Sciences Professionals über Verification Programs verfügbar.

Quelle öffnen
AI dev tool power rankings & comparison [Sept. 2026]
AI dev tool power rankings & comparison [Sept. 2026]
10 hours ago ... The strongest coding model available today. 2. Claude Opus 5: The balanced frontrunner ⬇️. Previous ranking: 1. Performance summary: Opus 5 drops to #2 after ...
blog.logrocket.com
KI-Zusammenfassung

Claude Fable 5.1 führt die KI-Modell-Rankings für September 2026 an und erreicht 1762 Elo auf der WebDev Arena – 73 Punkte über seinem Vorgänger. Die Kosten sinken erheblich: Cache-Lesevorgänge fallen um 75% auf $0,25 pro Million Tokens, was typische Workloads um etwa 25% und agentische Tasks um bis zu 45% verbilligt. Die obligatorische 30-Tage-Datenspeicherung entfällt. Qwen 3.8 Max debütiert als drittes Modell mit 1686 Elo und $2/$6 Preisgestaltung – das günstigste Frontier-Modell mit nativer Video-Unterstützung und teilweise verfügbaren Open Weights. Bei den AI-Tools rückt Claude Code auf Platz 1 vor, angetrieben durch Zugang zu Fable 5.1 (1762 Elo). OpenCode fällt auf Platz 2, behalten aber Modell-Agnostik mit 75+ Anbietern und MIT-Lizenz. Cursor hält Platz 3 nach SpaceX-Übernahme im August, verliert aber Marktanteile: Ramp-Share sank von 41% auf 26%. Windsurf bleibt an Platz 4 mit Arena Mode und Git Worktrees; Grok CLI neu mit Subagents und Plugin-Marketplace.

Quelle öffnen
Benchmark Radar: A Living Database and Search Engine for AI ...
19 hours ago ... Matching scales also do not establish matching test versions, prompts, tools, attempts, or evaluators. Date coverage counts valid recorded benchmark release ...
arxiv.org
KI-Zusammenfassung

Benchmark Radar ist eine neue Datenbank und Suchmaschine für die Entdeckung und das Abrufen von KI-Benchmarks, die täglich Benchmark-Papers, Repositories, Datasets und Releases von 37 Quellen erfasst. Das System katalogisiert 1.283 Benchmark-Einträge mit 12.916 numerischen Beobachtungen zu 790 Benchmarks und deckt LLM-Evaluationen, agentenbasierte und Tool-Use-Benchmarks, Coding, Reasoning, Safety und domänenspezifische Evaluationen ab. Die v0.11.0-Version bietet ein durchsuchbares Interface mit Leaderboard, Pareto-Frontier-Ansicht, täglichen Feeds, CLI für Offline-Abfragen und reproducible Analysen zur Unterstützung von Entwicklern bei der Auswahl von Evaluationen für neue KI-Systeme.

Quelle öffnen
GitHub - petergpt/bullshit-benchmark: BullshitBench measures ...
GitHub - petergpt/bullshit-benchmark: BullshitBench measures ...
21 hours ago ... MCP RegistryIntegrate external tools. DEVELOPER WORKFLOWS. ActionsAutomate ... Release dashboard with verified benchmark data and gated Pages deploy… 3 ...
github.com
KI-Zusammenfassung

BullshitBench ist ein Benchmark-Tool, das misst, ob KI-Modelle Unsinn erkennen und deutlich ablehnen, statt fälschlicherweise weiterzumachen. Die aktuellsten Tests vom 10. September 2026 umfassen DeepSeek V4.1 Flash, Claude Fable 5.1 und GPT-6 Astra mit jeweils niedriger und maximaler Reasoning-Einstellung. Das Benchmark bewertet Modelle mittels eines Drei-Richter-Panels und deckt 13 Unsinn-Techniken über Software-, Finanz-, Rechts-, medizinische und Physik-Fragen ab. Die Ergebnisse sind interaktiv durchsuchbar und vergleichbar, mit Export-Optionen für Daten und Visualisierungen.

Quelle öffnen
Über Nacht zusammengestellt von MorningMail.aiZugestellt um 03:10