KI-Entwicklertools · Was kam heute
Für eine erfahrene Engineerin, die ohnehin HN liest. Echte Veränderungen bei KI-Entwicklertools heute: Releases mit Versionsnummern, Paper mit Benchmarks, Repos, die eine relevante Schwelle überschritten haben. Hype-Threads, Pre-Announcement-Leaks und recycelte Zusammenfassungen überspringen. Immer Originalquellen verlinken.
Claude Fable 5 dominiert, Hermes lernt selbst, OpenJarvis startet lokal
1 Min. Lesezeit
Claude Fable 5 bleibt Spitze
Anthropic hält die Benchmark-Führung weiter.
Claude Fable 5 führt den Epoch Capabilities Index mit 161 Punkten an und bleibt damit bereits zwei Wochen vor GPT-5.5 Pro – das erste Mal seit über einem Jahr, dass Anthropic die Spitze hält [Quelle: Epoch AI]. Epoch hat sein Benchmark-Netzwerk parallel um 13 neue Evaluationen erweitert, spezialisierte Tests für agentengestützte Arbeit, Cybersicherheit, Algorithmik und Forecasting. Die neuen Tests machen den Index breiter, aber auch volatiler.
Spitzenpositionen werden kurzlebiger, nicht beständiger.
Hermes Agent lernt aus Erfahrung
Self-improving agents wurden zur erwarteten Baseline.
Nous Research stellt Hermes Agent vor, einen KI-Agenten, der aus eigenen Erfahrungen lernt und autonome Skills mit persistenter Speicherung erstellt [Quelle: GitHub]. Das Tool läuft auf beliebiger Infrastruktur – von einer 5-Dollar-VPS bis serverlos – und unterstützt alle großen Modelle über Nous Portal, OpenRouter und OpenAI ohne Lock-in. Erreichbar über CLI und direkt auf Telegram, Discord, Slack, WhatsApp und Signal.
Autonome Skill-Erstellung ist nicht mehr Forschungsprojekt.
OpenJarvis: Personal AI lokal
Local-first Personal-AI-Agenten funktionieren schon produktiv.
Hazy Research und Stanfords Scaling Intelligence Lab starten OpenJarvis, ein Framework für Agenten auf Endgeräten, das Energie, FLOPs, Latenz und Kosten als First-Class-Constraints behandelt [Quelle: GitHub]. Benchmarking zeigt, dass lokale Sprachmodelle bereits 88,7 Prozent von Single-Turn-Chat und Reasoning-Anfragen verarbeiten können. Das Framework bietet acht integrierte Agenten, Skills-Architektur nach agentskills.io-Standard und Evaluations-Tools.
Offline-Agenten verdrängen Cloud-Abhängigkeit aus der Baseline.
Data on AI Capabilities and Benchmarking - Epoch AI4 hours ago ... ... evaluated internally by Epoch AI as well as data collected from external sources. Explore trends in AI capabilities across time, by benchmark, or by model.epoch.ai
Claude Fable 5 hat kürzlich auf dem Epoch Capabilities Index einen neuen Rekord von 161 Punkten erreicht und damit GPT-5.5 Pro um einen Punkt übertroffen. Dies ist das erste Mal seit über einem Jahr, dass Anthropic die Führungsposition einnimmt. Epoch AI hat zudem kontinuierlich neue Benchmarks in seine Datenbank aufgenommen: Im Juli 2026 wurden 13 neue Evaluationen hinzugefügt, von denen 7 in den Epoch Capabilities Index integriert wurden. Im Juni folgten neun weitere externe Benchmarks zu Themen wie agentische Systeme, Cybersicherheit, Algorithmik und Physics auf Forschungsniveau.
NousResearch/hermes-agent: The agent that grows with you - GitHub10 hours ago ... Switch with hermes model — no code changes, no lock-in. A real terminal interface, Full TUI with multiline editing, slash-command autocomplete, conversation ...github.com
Hermes Agent ist ein selbstverbessernder KI-Agent von Nous Research mit integrierter Lernschleife, der Fähigkeiten aus Erfahrungen erstellt und diese während der Nutzung verbessert. Das Tool läuft auf verschiedenen Infrastrukturen von einer $5 VPS bis zu serverlosen Umgebungen, unterstützt beliebige Modelle (Nous Portal, OpenRouter, OpenAI, benutzerdefinierte Endpoints) ohne Lock-in, und bietet Terminal-Interface, Multi-Plattform-Integration (Telegram, Discord, Slack, WhatsApp, Signal) sowie autonome Skill-Erstellung und Planung. Die Installation erfolgt über One-Liner für Linux/macOS/WSL2 und nativer Windows-PowerShell-Support, mit vollständiger Dokumentation und Migrationstools von OpenClaw.
open-jarvis/OpenJarvis: Personal AI, On Personal Devices - GitHub20 hours ago ... Every skill is a tool — agents discover them from a catalog and invoke them on demand. # Install skills from public sources jarvis skill install hermes:arxiv ...github.com
OpenJarvis ist ein neues Framework für lokal-erste Personal-AI-Agenten, das von Hazy Research und Stanfords Scaling Intelligence Lab entwickelt wurde. Das System kombiniert geteilte Primitive für lokale Agenten mit Evaluationen, die Energie, FLOPs, Latenz und Kosten als First-Class-Constraints behandeln, sowie einen Lernloop, der Modelle mit lokalen Trace-Daten verbessert. Das Framework bietet acht integrierte Agenten über drei Ausführungsmodi, eine Skills-Architektur nach dem agentskills.io Standard und Benchmarking-Tools; Forschungen zeigen, dass lokale Sprachmodelle bereits 88,7% von Single-Turn-Chat- und Reasoning-Anfragen verarbeiten können.