Du wirst angemeldet...

Bitte warte, während wir deine Anmeldung überprüfen

Artikel · Donnerstag, 1. Oktober 2026

KI-Entwicklertools · Was kam heute

Für eine erfahrene Engineerin, die ohnehin HN liest. Echte Veränderungen bei KI-Entwicklertools heute: Releases mit Versionsnummern, Paper mit Benchmarks, Repos, die eine relevante Schwelle überschritten haben. Hype-Threads, Pre-Announcement-Leaks und recycelte Zusammenfassungen überspringen. Immer Originalquellen verlinken.

Von Marius BongartsTech81 Ausgaben
← Zur aktuellen Ausgabe
Ausgaben
7 / 81
Über Nacht von KI aus öffentlichen Quellen erstellt, täglich aktualisiert.
KI-Entwicklertools · Was kam heute
Donnerstag, 1. Oktober 2026
KI-Entwicklertools · Was kam heute

MLToolBench trainiert Agenten; Claude 5.1 hält stand

1 Min. Lesezeit

MLToolBench: Agenten-Diagnose

ML-Agenten lernen endlich, ihre eigenen Tools zu benutzen.

Ein neues Paper führt ToolMLBench ein – 67 ausführbare Diagnose-Tools für Datenprüfung, Code-Verifikation und Experiment-Auswertung [Quelle: arXiv]. Die Autoren präsentieren SPICE, eine Reward-Shaping-Methode, die Agenten zeigt, welche diagnostischen Aufrufe tatsächlich hilfreich sind. Im Test springt Qwen3-8B von 24,8% auf 52,4% Erfolgsrate, Qwen3.5-35B von 35,6% auf 69,2% – und generalisiert auch auf ungesehene Tasks.

Erste echte Benchmark für autonome ML-Engineering.

Claude Fable & Mythos 5.1

Anthropic bestätigt die Zahlen vom gestrigen Release.

Fable 5.1 knackt CursorBench 3.2.0 bei 73,4%, Terminal-Bench 4.0 bei 55,8%, und OSWorld 2.0 bei 77,9% [Quelle: Anthropic]. Parallel sinken die Kosten um 25% bei normalen Workloads, bei Agenten-Aufgaben durch 75% reduzierte Cache-Read-Preise sogar um 45%. Mythos 5.1 designt Proteinbinder mit zehnfach höherer Bindungsaffinität und trainierte ein neuronales Netzwerk für Venus-Kartografie – wissenschaftliche KI wird zur Baseline.

Die Preisstruktur zieht mit der Performance mit.

Ideogram 4.5: Bildbearbeitung

Spezialisiertes Edit-Modell debütiert mit Hybrid-Pricing.

Ideogram 4.5 verspricht minimalen Pixeldrift bei wiederholten lokalisierten Änderungen und kostet 0,03–0,22 USD pro Bild je nach Rendering-Einstellung [Quelle: OrcaRouter]. Das gehostete Modell unterstützt native 2K-Ausgabe und Bearbeitung in Quellauflösung bis 24,2 Megapixel. Artificial Analysis platziert es auf Rang 23 der gemessenen Bearbeitungsmodelle – die Drift-These wartet noch auf unabhängige Validierung.

Bildbearbeitung wird zur spezialisierten Tokenmetrik.

Quellen
MLToolBench: Learning Tool-Augmented Agents for Machine ... - arXiv
22 hours ago ... MLToolBench: Learning Tool-Augmented Agents for Machine Learning Development ... MLToolBench and its training framework connect access to diagnostic evidence with ...
arxiv.org
KI-Zusammenfassung

Das Papier "MLToolBench" beschreibt ein System zur Verbesserung von KI-Agenten für Machine Learning Engineering-Aufgaben. Es werden 67 neue Diagnose-Tools für Datenprüfung, Code-Verifikation und Experiment-Diagnostik eingeführt, die in ein Trainings-Framework integriert sind. Die Autoren präsentieren "Spice" (Solution-Privileged Information Credit Estimation), eine neue Reward-Shaping-Methode, die kontextabhängige Unterstützung für Agenten-Aktionen bereitstellt. Tests zeigen, dass das kombinierte System (Supervised Fine-Tuning + Reinforcement Learning mit Spice) die Erfolgsrate von Qwen3-8B von 24,8% auf 52,4% und von Qwen3.5-35B-A3B von 35,6% auf 69,2% erhöht – für einen erfahrenen ML-Engineer ein konkretes Release mit neuem Benchmark, neuem Tool-Set und empirisch validierter Trainings-Methode.

Quelle öffnen
Introducing Claude Fable 5.1 and Claude Mythos 5.1 - Anthropic
Introducing Claude Fable 5.1 and Claude Mythos 5.1 - Anthropic
5 hours ago ... Inference speedup for seven open-source protein and genomics models on an NVIDIA H100 ... Overall, the model demonstrates the strongest cyber capabilities of any ...
anthropic.com
KI-Zusammenfassung

Anthropic hat Claude Fable 5.1 und Claude Mythos 5.1 veröffentlicht – KI-Modelle mit erweiterten Fähigkeiten für Coding und Knowledge Work. Fable 5.1 ist circa 25% günstiger als sein Vorgänger bei typischen Workloads durch reduzierte Cache-Read-Preise (bis zu 45% Kostenersparnis bei agentic Work), dabei zeigt das Modell in mehreren Benchmarks höhere Performance: Terminal-Bench-Science 0.1 (52,6%), Terminal-Bench 4.0 (55,8% für Mythos), Humanity's Last Exam (60,9% mit Tools), CursorBench 3.2.0 (73,4%) und OSWorld 2.0 (77,9% partial). Claude Fable 5.1 setzt damit neue Standards für agentische wissenschaftliche Forschung, Terminal-Coding und multidisziplinäres Reasoning. Bei wissenschaftlichen Anwendungen demonstriert Claude Mythos 5.1 fortgeschrittene Fähigkeiten: Die KI entwarf hochaffine Protein-Binder mit zehnfach höherer Bindungsaffinität als bisherige Wettbewerbsergebnisse und erreichte eine Hit-Rate von fast 50% (vs. typisch 10–15%). Zudem trainierte Fable 5.1 ein neuronales Netzwerk für hochauflösende Höhenkarten der Venus und optimierte sieben Open-Source-Deep-Learning-Modelle durch Custom-GPU-Kernel um bis zu 2,5× bei identischen Outputs. Die Modelle sind ab sofort auf allen Plattformen verfügbar, Claude Mythos 5.1 zusätzlich über Trusted-Access-Programme für Cyberdefense und Life Sciences.

Quelle öffnen
Ideogram 4.5: Das Präzisions-Edit-Modell, bepreist und bewertet
Ideogram 4.5: Das Präzisions-Edit-Modell, bepreist und bewertet
4 hours ago ... Ideogram 4.0's weights are genuinely open: the repositories are public ... KI-ModelleLösungenOpen SourceOpen WeightsPreise. Ressourcen. DokumenteBlog ...
orcarouter.ai
KI-Zusammenfassung

Ideogram 4.5 wurde am 30. September 2026 als spezialisiertes Bildbearbeitungsmodell veröffentlicht, das Pixeldrift bei wiederholten lokalisierten Änderungen reduzieren soll. Das geschlossene, gehostete Modell kostet 0,03–0,22 USD pro Bild je nach Rendering-Einstellung und unterstützt native 2K-Ausgabe sowie Bearbeitung in Quellauflösung bis 24,2 Megapixel. Laut Artificial Analysis positioniert sich Ideogram 4.5 mit 1.064 Elo im Ranking für Bildbearbeitung auf Platz 23 von gemessenen Modellen, deutlich hinter GPT Image 2.5 Sunburst und anderen Top-Konkurrenten – die zentrale Behauptung zur Driftminderung wurde bisher in keinem unabhängigen Benchmark gemessen. Das Unternehmen kündigte an, die Modellgewichte bald zu veröffentlichen, was bislang aber nicht geschehen ist.

Quelle öffnen
Über Nacht zusammengestellt von MorningMail.aiZugestellt um 03:10