KI-Entwicklertools · Was kam heute
Für eine erfahrene Engineerin, die ohnehin HN liest. Echte Veränderungen bei KI-Entwicklertools heute: Releases mit Versionsnummern, Paper mit Benchmarks, Repos, die eine relevante Schwelle überschritten haben. Hype-Threads, Pre-Announcement-Leaks und recycelte Zusammenfassungen überspringen. Immer Originalquellen verlinken.
Fable 5 sichert sich Platz eins, llmfit 1.0 misst real, Tencents Hy3 für Agenten
1 min read
Claude Fable 5 bleibt Spitze
Anthropic hält die Messlatte weiter oben.
Claude Fable 5 führt den Epoch Capabilities Index mit 161 Punkten und bleibt damit einen Punkt vor GPT-5.5 Pro – das erste Mal seit über einem Jahr, dass Anthropic die Führung behauptet [Quelle: Epoch AI]. Die neuen Tests für agentengestützte Arbeit, Cybersicherheit und Algorithmen-Engineering machen den Index breiter, aber auch flüchtiger.
Spitzenpositionen werden kurzlebiger statt beständiger.
llmfit 1.0: echte Messwerte statt Schätzungen
Benchmarking wird konkret auf deinem Rechner.
llmfit 1.0 misst tatsächliche Token-pro-Sekunde-Leistung auf der eigenen Hardware und trägt die Ergebnisse automatisch als Pull Request zurück [Quelle: GitHub]. Das Terminal-Tool optimiert für hunderte Modelle und Provider (RAM, CPU, GPU) und liefert Scores über Qualität, Geschwindigkeit und Kontext. Mit der nächsten Release erhalten alle Nutzer mit identischer Hardware verifizierte Zahlen statt Schätzungen, bevor sie selbst benchmarken.
Die Community-Messwerte werden zur Quelle der Wahrheit.
Tencent Hy3: 295B-Parameter für Agenten
Mixture-of-Experts wird zur Norm für Agentic Work.
Tencent stellt Hy3 vor – ein 295B-Parameter Modell mit 256K-Token-Kontext, spezialisiert auf Reasoning, Agent-Workflows und Produktionsanwendungen [Quelle: OpenRouter]. Das Modell unterstützt konfigurierbare Reasoning-Modi, stabiles Tool-Calling und verlässliches Verhalten ohne Halluzinationen. Parallel rollen DeepSeek V4 Flash und V4 Pro, GLM 5.2 sowie MiniMax M3 mit erweiterten Kontextfenstern (bis 1M Token) aus – alle optimiert für komplexe Coding-Aufgaben und Multi-Step-Workflows.
Die Benchmark-Rankings von OpenRouter basieren jetzt auf echten Entwickler-Nutzungsdaten statt theoretischen Tests.
Data on AI Capabilities and Benchmarking - Epoch AI5 hours ago ... Explore trends in AI capabilities across time, by benchmark, or by model. Epoch Capabilities Index Individual Benchmarks.epoch.ai
Claude Fable 5 von Anthropic erreichte einen neuen Höchstwert von 161 Punkten auf dem Epoch Capabilities Index (ECI) und übertraf damit GPT-5.5 Pro um einen Punkt. Dies ist das erste Mal in über einem Jahr, dass Anthropic die Führung bei diesem Index übernimmt. Epoch AI hat außerdem 13 neue Evaluations in sein Benchmarking-Hub aufgenommen, von denen 7 in den ECI integriert wurden, und neun weitere externe Benchmarks hinzugefügt, die agentische Arbeiten, Cybersicherheit, Algorithmen-Engineering, Forecasting und physikalische Forschung abdecken.
GitHub - AlexsJones/llmfit: Hundreds of models & providers. One ...17 hours ago ... A terminal tool that right-sizes LLM models to your system's RAM, CPU, and GPU. Detects your hardware, scores each model across quality, speed, fit, and context ...github.com
llmfit 1.0 mit neuer Benchmark-Sharing-Funktion: Das Tool misst tatsächliche Token-pro-Sekunde-Leistung auf der eigenen Hardware und trägt die Messwerte automatisch als PR zurück. Die Messungen werden lokal gespeichert und ersetzen Schätzwerte in der Fit-Tabelle. Mit der nächsten Release erhalten alle Nutzer mit identischer Hardware verifizierte Zahlen statt Schätzungen, bevor sie selbst benchmarken. Das Terminal-Tool unterstützt hunderte Modelle und Provider, optimiert LLM-Modelle für die verfügbaren System-Ressourcen (RAM, CPU, GPU) und liefert Scores über Qualität, Geschwindigkeit, Fit und Kontext. Die Speed-Schätzungen basieren auf einem Memory-Bandwidth-Modell mit Echtmess-Sampling und Community-Messungen – alle Annahmen sind transparent einsehbar.
Best AI Models for Coding | OpenRouter9 hours ago ... Model rankings updated July 2026 based on real usage data. Compare the best ... LLM Leaderboard for Programming Models. 1. Favicon for xiaomi. Mimo V2.5.openrouter.ai
Tencent hat Hy3 vorgestellt, ein 295B-Parameter Mixture-of-Experts Modell mit 256K Context Window, das spezialisiert auf Reasoning, Agent-Workflows und Produktionsanwendungen ausgerichtet ist. Das Modell unterstützt konfigurierbare Reasoning-Modi und betont stabiles Tool-Calling sowie verlässliches, anti-Halluzinations-Verhalten. Parallel wurden mehrere andere Coding-fokussierte LLM-Modelle aktualisiert oder neu vorgestellt: DeepSeek V4 Flash und V4 Pro bieten optimierte Mixture-of-Experts Architekturen mit 1M-Token Context für schnelle Inference und komplexe Coding-Aufgaben; Z.ai hat GLM 5.2 für lange Agent-Workflows und vollständige Software-Engineering-Kontexte released; MiniMax präsentiert M3 mit nativer Multimodalität und 1M-Token Support unter Nutzung von Sparse Attention für kosteneffiziente Long-Context-Verarbeitung; Anthropic hat Claude Opus 4.8 und 4.7 sowie Sonnet 4.6 mit verbesserter Agentic-Performance und Multi-Step-Reasoning aktualisiert. Die OpenRouter-Coding-Modell-Rankings wurden aktualisiert und basieren auf echten Nutzungsdaten von Entwicklern.