Du wirst angemeldet...

Bitte warte, während wir deine Anmeldung überprüfen

Artikel · Dienstag, 29. September 2026

KI-Entwicklertools · Was kam heute

Für eine erfahrene Engineerin, die ohnehin HN liest. Echte Veränderungen bei KI-Entwicklertools heute: Releases mit Versionsnummern, Paper mit Benchmarks, Repos, die eine relevante Schwelle überschritten haben. Hype-Threads, Pre-Announcement-Leaks und recycelte Zusammenfassungen überspringen. Immer Originalquellen verlinken.

Von Marius BongartsTech81 Ausgaben
← Zur aktuellen Ausgabe
Ausgaben
9 / 81
Über Nacht von KI aus öffentlichen Quellen erstellt, täglich aktualisiert.
KI-Entwicklertools · Was kam heute
Dienstag, 29. September 2026
KI-Entwicklertools · Was kam heute

Claude Fable 5.1 schärft nach; Hermes Agent lernt selbst

1 Min. Lesezeit

Claude Fable & Mythos 5.1

Fable 5.1 knackt neue Benchmarks und kostet weniger.

Anthropic hat die Modelle gestern aktualisiert mit deutlich höheren Scores: Terminal-Bench 4.0 springt auf 55,8% (von 42,0%), CursorBench 3.2.0 auf 73,4%, Humanity's Last Exam auf 60,9% [Quelle: Anthropic]. Gleichzeitig fallen die Preise um 25% bei typischen Workloads, bei Agenten-Aufgaben durch 75% reduzierte Cache-Read-Kosten sogar um 45%. Mythos 5.1 ist baugleich, senkt aber Guardrails für Cybersecurity- und Life-Sciences-Profis.

Im Labor designt das Modell Proteinbinder mit 10× höherer Bindungsaffinität als bisherige Einträge.

Hermes Agent: selbstverbessernder KI-Rahmen

Nous Research baut Agenten, die aus Erfahrung lernen.

Hermes Agent ist ein Open-Source-Framework mit integrierter Lernschleife, das Fähigkeiten aus eigenem Handeln generiert und live verfeinert [Quelle: GitHub]. Das Tool läuft modell-agnostisch auf günstigen VPS oder serverlos, mit Terminals, Telegram, Discord, Slack, WhatsApp und Signal als Interfaces. Autonome Skill-Erstellung, FTS5-Sitzungssuche und Cron-Scheduler für Automationen sind eingebaut; Sub-Agenten ermöglichen Parallelisierung.

Batch-Trajektoriengenerierung trainiert Tool-Calling-Modelle ohne Lock-in.

MedVidBench: medizinische Video-KI

Strukturiertes Benchmark für Video-Verstehen in der Medizin startet.

United Imaging Intelligence veröffentlichte uAI NEXUS MedVLM, ein Open-Source-Modell mit 531.850 annotierten Video-Instruction-Pairs aus acht öffentlichen medizinischen Datensätzen [Quelle: PRNewswire]. Parallel läuft MedVidBench mit 12.515 Test-Samples und zehn Bewertungsmetriken (Next-Action Prediction, Skill Assessment, Spatiotemporal Grounding) – die Plattform überschritt bereits 30.000 Downloads. 75 Teams aus 18 Ländern traten der MedVidU Challenge bei, zwei finale Teams präsentierten akzeptierte Papers beim ECCV 2026 Workshop.

Reproduzierbare Evaluierung skaliert medizinische Video-KI.

Quellen
Introducing Claude Fable 5.1 and Claude Mythos 5.1 - Anthropic
Introducing Claude Fable 5.1 and Claude Mythos 5.1 - Anthropic
2 hours ago ... Inference speedup for seven open-source protein and genomics models on an NVIDIA H100 ... Overall, the model demonstrates the strongest cyber capabilities of any ...
anthropic.com
KI-Zusammenfassung

Anthropic hat Claude Fable 5.1 und Claude Mythos 5.1 veröffentlicht. Fable 5.1 ist ein neues KI-Modell für Coding und Knowledge Work mit erheblichen Leistungsverbesserungen gegenüber dem Vorgänger: Es schneidet bei Terminal-Bench 4.0 mit 55,8% ab (gegenüber 42,0% bei Fable 5), bei CursorBench 3.2.0 mit 73,4% und bei Humanity's Last Exam mit 60,9%. Das Modell kostet etwa 25% weniger als Fable 5 bei typischen Workloads, bei agentic work sogar bis zu 45% weniger durch 75% reduzierte Cache-Read-Preise ($0,25 pro Million Tokens statt $1). Claude Mythos 5.1 ist identisch, hat aber weniger strikte Safeguards für verifizierte Cybersecurity- und Life-Sciences-Profis. Neben den Benchmark-Verbesserungen zeigt Claude Fable 5.1 neue Fähigkeiten: Im wissenschaftlichen Bereich designte das Modell hochaffine Protein-Binder mit 10-fach höheren Bindungsaffinitäten als bisherige Wettbewerbe und einer Hit-Rate von 50%, erstellte eine hochauflösende Karte der Venus-Oberfläche und optimierte sieben Open-Source-Deep-Learning-Modelle um bis zu 2,5x, was GPU-Kosten um 30–60% senkt.

Quelle öffnen
NousResearch/hermes-agent: The agent that grows with you - GitHub
NousResearch/hermes-agent: The agent that grows with you - GitHub
14 hours ago ... GitHub SponsorsFund open source developers. PROGRAMS. Security Lab · Maintainer Community · GitHub Stars · Archive Program. REPOSITORIES ... /model [provider: ...
github.com
KI-Zusammenfassung

Hermes Agent ist ein selbstverbesserndes KI-Agenten-Framework von Nous Research mit integrierter Lernschleife, das Fähigkeiten aus Erfahrungen erstellt und diese während der Nutzung verbessert. Das Tool unterstützt flexible Modellauswahl (Nous Portal, OpenRouter, OpenAI, benutzerdefinierte Endpunkte) ohne Lock-in, läuft auf verschiedenen Infrastrukturen von günstigen VPS bis serverlos, und bietet Terminal-, Telegram-, Discord-, Slack-, WhatsApp- und Signal-Interfaces aus einem Gateway-Prozess. Die Plattform ermöglicht autonome Skill-Erstellung, FTS5-Sitzungssuche mit LLM-Zusammenfassung, geplante Automationen via Cron-Scheduler, Parallelisierung durch Sub-Agenten und Batch-Trajektoriengenerierung für das Training von Tool-Calling-Modellen.

Quelle öffnen
Open-Source Model Accelerates Global Progress in Medical Video AI
14 hours ago ... PRNewswire/ -- Through an open-source model, a public dataset and benchmark, and the MedVidU Challenge, a global research competition, researchers worldwide ...
prnewswire.com
KI-Zusammenfassung

United Imaging Intelligence (UII) hat ein Open-Source-Modell namens uAI NEXUS MedVLM für medizinische Video-KI veröffentlicht und dabei 531.850 Video-Instruction-Pairs aus acht öffentlichen medizinischen Videodatensätzen annotiert. Parallel dazu wurde MedVidBench mit zwei Batches von insgesamt 12.515 Test-Samples als öffentlicher Benchmark mit zehn Bewertungsmetriken (Next-Action Prediction, Skill Assessment, Spatiotemporal Grounding) gelauncht – die Plattform überschritt bereits 30.000 Downloads. Die Ressourcen bilden die Grundlage für die MedVidU Challenge, an der 75 Teams aus 18 Ländern teilnahmen und vier Teams es ins Finale schafften, zwei davon präsentierten akzeptierte Papers beim ECCV 2026 Workshop in Malmö.

Quelle öffnen
Über Nacht zusammengestellt von MorningMail.aiZugestellt um 03:10