Du wirst angemeldet...

Bitte warte, während wir deine Anmeldung überprüfen

Artikel · Dienstag, 15. September 2026

KI-Entwicklertools · Was kam heute

Für eine erfahrene Engineerin, die ohnehin HN liest. Echte Veränderungen bei KI-Entwicklertools heute: Releases mit Versionsnummern, Paper mit Benchmarks, Repos, die eine relevante Schwelle überschritten haben. Hype-Threads, Pre-Announcement-Leaks und recycelte Zusammenfassungen überspringen. Immer Originalquellen verlinken.

Von Marius BongartsTech67 Ausgaben
← Zur aktuellen Ausgabe
Ausgaben
9 / 67
Über Nacht von KI aus öffentlichen Quellen erstellt, täglich aktualisiert.
KI-Entwicklertools · Was kam heute
Dienstag, 15. September 2026
KI-Entwicklertools · Was kam heute

Fable 5.1 Benchmarks vertiefen; FlashREINFORCE für Agenten

1 Min. Lesezeit

Fable 5.1 Benchmarks im Detail

Fable 5.1 zeigt wo die Verbesserungen wirklich sitzen.

Die neuen Benchmarks offenbaren Sprünge bei wissenschaftlichen Aufgaben: Terminal-Bench-Science springt auf 52,6% (von 24,7% bei Fable 5), CursorBench auf 73,4%, Humanity's Last Exam mit Tools auf 60,9% [Quelle: Anthropic]. Bei Life Sciences demonstriert Mythos 5.1 konkrete Resultate: 50% Hit-Rate bei Protein-Binder-Design über zwölf Targets (10x über bisherige Designs), GPU-Kernel-Optimierungen um bis zu 2,5x schneller, neue Venus-Höhenkarten mit Auflösung für Geologie-Modelle.

Das misst sich nicht mehr gegen Vorgänger-Versionen, sondern gegen spezialisierte Domain-Tools.

Benchmark Radar wächst

Die durchsuchbare Evaluierungs-Datenbank wird konkurrenzfähig.

Benchmark Radar aggregiert täglich aus 37 Quellen und katalogisiert 1.283 Benchmark-Einträge mit 12.916 numerischen Beobachtungen über 790 Benchmarks [Quelle: HuggingFace]. Die Plattform bietet Web-Dashboard mit Leaderboards, Pareto-Frontier-Ansichten, Sättigungs- und Trend-Analysen, CLI für Offline-Abfragen und reproducierbare Analysen für LLM-Evaluierung, agentic Tool-Use, Coding, Reasoning und Safety.

Das wird zur Quelle der Wahrheit für Model-Auswahl statt Ad-hoc-Spreadsheets.

FlashREINFORCE: Asynchrones RL für Agenten

Ein neues Trainings-Framework für Sprach-Agenten mit Speicher-Effizienz.

FlashREINFORCE kombiniert Critic-Free Single-Rollout-RL mit asynchroner Datensammlung durch batch-zentrierte Rewards und Trajectory-Level-Trust-Gating [Quelle: AlphaXiv]. Auf Qwen2.5-Math erreicht das Verfahren 38,0% über fünf Benchmarks mit halb so vielen Rollouts wie GRPO-Baselines (256k vs. 512k). Bei ALFWorld-Tasks folgen 98,3% auf gesehenen und 96,5% auf ungesehenen Aufgaben – deutlich über vergleichbaren Methoden.

Das skaliert Training ohne den Speicher-Overhead klassischer kritiker-basierter RL.

Quellen
Introducing Claude Fable 5.1 and Claude Mythos 5.1 - Anthropic
Introducing Claude Fable 5.1 and Claude Mythos 5.1 - Anthropic
5 hours ago ... ... tools, customers, employees, and vendors, it was far more efficient ... AI experts, testing whether the models could match human specialists' performance.
anthropic.com
KI-Zusammenfassung

Anthropic hat Claude Fable 5.1 und Claude Mythos 5.1 veröffentlicht. Fable 5.1 ist ab sofort verfügbar und kostet etwa 25% weniger als Fable 5 bei typischen Workloads, mit bis zu 45% Ersparnis bei agentic work durch reduziertes Cache-Read-Pricing ($0,25 pro Million Tokens statt $1). Das Modell zeigt erhebliche Verbesserungen bei Code, Knowledge Work und wissenschaftlichen Aufgaben: Terminal-Bench-Science 0.1 erreicht 52,6% (vs. 24,7% bei Fable 5), Terminal-Bench 4.0 55,8%, CursorBench 3.2.0 73,4%, und Humanity's Last Exam 60,9% mit Tools. Mythos 5.1 ist identisch, aber mit reduzierten Safeguards für Cyber-Defense und Life Sciences über Verification Programs erhältlich. Bei Scientific Research demonstriert Claude hochaffine Protein-Binder-Designs mit 50% Hit-Rate über 12 Targets (10x höher als bisherige Designs), erstellte eine neue Venus-Elevationskarte und optimierte sieben Deep-Learning-Modelle um bis zu 2,5x schneller. Die neuen Safeguards reduzieren falsch-positive Interventionen um 60% in Cyber-Security und 85% bei elementarer Biologie, während Fable 5.1 nun defensive Vulnerability-Analyse ermöglicht.

Quelle öffnen
Benchmark Radar: A Living Database and Search Engine for AI ...
Benchmark Radar: A Living Database and Search Engine for AI ...
23 hours ago ... Benchmark researchers and developers of ... The system combines daily discovery of benchmark papers, repositories, datasets, and releases with a searchable ...
huggingface.co
KI-Zusammenfassung

Benchmark Radar ist eine neue durchsuchbare Datenbank und Discovery-Engine für KI-Evaluierungs-Benchmarks, die Quellen, Score-Historien und Evidenz aggregiert. Das System kombiniert tägliche Erkennung von Benchmark-Papers, Repositories, Datasets und Releases mit einem durchsuchbaren Katalog und deckt LLM-Evaluierung, agentic tool-use Benchmarks, Coding, Reasoning, Safety und domänenspezifische Evaluierungen ab. Der Katalog enthält 1.283 Source-Records aus 4 Benchmark-Katalogen und 12.916 numerische Beobachtungen mit täglichen Feeds, einem CLI-Tool und reproducible Analysis.

Quelle öffnen
FlashREINFORCE: Critic-Free Single-Rollout Asynchronous RL for ...
FlashREINFORCE: Critic-Free Single-Rollout Asynchronous RL for ...
15 hours ago ... Asynchronous reinforcement learning suits long-horizon agents with irregular rollout times, but group-relative updates require repeated rollouts of each ...
alphaxiv.org
KI-Zusammenfassung

FlashREINFORCE ist ein neues Framework für asynchrones Reinforcement Learning in Sprachmodellen, das mit einzelnen Rollouts pro Prompt arbeitet und damit Speicher- und Synchronisationsprobleme bei Gruppen-basierten Methoden vermeidet. Das Verfahren kombiniert batch-zentrierte Rewards, sequenzbasierte Trust-Gating für stale-data control und sample-mean Gewichtung, um Stabilität ohne gelernten Kritiker zu erreichen. In Experimenten erreicht FlashREINFORCE auf Qwen2.5-Math-1.5B 38.0% über fünf Benchmarks mit halb so vielen Rollouts wie der GRPO-Baseline (256k vs 512k), und bei ALFWorld-Tasks 98.3% auf gesehenen und 96.5% auf ungesehenen Aufgaben, deutlich über vergleichbaren Methoden.

Quelle öffnen
Über Nacht zusammengestellt von MorningMail.aiZugestellt um 03:10