Du wirst angemeldet...

Bitte warte, während wir deine Anmeldung überprüfen

Artikel · Sonntag, 12. Juli 2026

KI-Entwicklertools · Was kam heute

Für eine erfahrene Engineerin, die ohnehin HN liest. Echte Veränderungen bei KI-Entwicklertools heute: Releases mit Versionsnummern, Paper mit Benchmarks, Repos, die eine relevante Schwelle überschritten haben. Hype-Threads, Pre-Announcement-Leaks und recycelte Zusammenfassungen überspringen. Immer Originalquellen verlinken.

Von Marius BongartsTech35 Ausgaben
← Zur aktuellen Ausgabe
Ausgaben
28 / 35
Über Nacht von KI aus öffentlichen Quellen erstellt, täglich aktualisiert.
KI-Entwicklertools · Was kam heute
Sonntag, 12. Juli 2026
KI-Entwicklertools · Was kam heute

Claude Opus 4.8 führt, DeepSeek Flash skaliert, Google baut Agentic-Stack

1 Min. Lesezeit

Claude Opus 4.8

Anthropic bringt das stärkste Modell seiner Opus-Familie.

Claude Opus 4.8 unterstützt jetzt 1 Million Tokens Kontextfenster und ist auf Google Cloud verfügbar, speziell für hochautonome Multi-Stage-Agenten und End-to-End-Projekt-Orchestrierung in Codebases optimiert [Quelle: Google Cloud]. Daneben landet auch Claude Sonnet 5 als Drop-in-Ersatz für Sonnet 4.6 mit verbessertem Reasoning und Code-Generierung. Mit 1M-Token-Fenster wird die Grenze zwischen Basis- und Spitzenmodellen flüssig.

Agentic Reasoning wird zur Mindestanforderung statt Premium-Feature.

DeepSeek V4 Flash dominiert

Effizienzoptimierte Mixture-of-Experts schleichen sich in Production ein.

DeepSeek V4 Flash mit 284B Parametern und 13B aktiven zeigt über OpenRouter reale Nutzungsdaten (Juli 2026): Das Modell führt im OpenClaw-Agenten-Ranking an, unterstützt 1M-Token-Kontext und ist für schnelle Inferenz bei hohem Durchsatz ausgelegt [Quelle: OpenRouter]. MiniMax M3 mit Sparse Attention kostet etwa 1/20 der vorherigen Generation. Beide verdrängen größere Dense-Modelle aus praktischen Workloads.

Die Kostengrenze für Agentic Production rutscht rapide nach unten.

Gemini 3.1 Pro startet Preview

Google rollt sein intelligenteres Flagship-Modell aus.

Gemini 3.1 Pro landet im Preview als Baseline für komplexe Problem-Solving über Vertex AI, Gemini Enterprise und API; Gemini 3.1 Flash-Lite folgt als schnellstes und kosteneffizientestes Modell der Serie für High-Volume-Developer-Workloads [Quelle: Google Cloud]. Parallel startet Google Cloud Run Worker Pools allgemein verfügbar für Pull-basierte, Non-HTTP-Workloads mit AI-Inference-Skalierung. Cloud Run External Metrics Autoscaler (CREMA) wird Open-Source für Queue-aware Autoscaling.

Google rüstet seinen Agentic-Stack für Enterprise Production auf.

Epoch: 13 neue Benchmarks

Claude Fable 5 hält die Spitze, aber der Maßstab wächst.

Epoch AI integrierte 7 der 13 neuen Evaluationen in seinen Capabilities Index mit Fokus auf Agentic Work, Cybersecurity, Algorithm Engineering, Forecasting und Physics [Quelle: Epoch AI]. Fable 5 führt weiterhin mit 161 Punkten, ein Punkt vor GPT-5.5 Pro – doch die neuen spezialistischen Tests machen den Index volatiler. Benchmark-Gaming wird schwieriger, wenn sich die Anforderungen ständig verschieben.

Spitzenpositionen werden kurzlebiger, nicht beständiger.

Quellen
Data on AI Capabilities and Benchmarking - Epoch AI
Data on AI Capabilities and Benchmarking - Epoch AI
6 hours ago ... Our database of benchmark results, featuring the performance of leading AI models on challenging tasks. It includes results from benchmarks evaluated ...
epoch.ai
KI-Zusammenfassung

Claude Fable 5 erreichte einen neuen Höchstwert von 161 Punkten auf dem Epoch Capabilities Index und überholte damit GPT-5.5 Pro um einen Punkt – es ist das erste Mal seit über einem Jahr, dass Anthropic die Führung übernimmt. Epoch AI hat kürzlich 13 neue Evaluations in seine Benchmark-Hub aufgenommen, davon 7 in den Epoch Capabilities Index integriert, mit Fokus auf agentic work, Cybersecurity, Algorithm Engineering, Forecasting und Physics.

Quelle öffnen
Best AI Models for Coding - OpenRouter
Best AI Models for Coding - OpenRouter
9 hours ago ... ... frameworks. This collection features top coding models from ... agent frameworks where strong reasoning, rich perception, and cost efficiency all matter.
openrouter.ai
KI-Zusammenfassung

DeepSeek V4 Flash ist ein effizienzoptimiertes Mixture-of-Experts-Modell mit 284B Gesamtparametern und 13B aktivierten Parametern, das 1M-Token-Kontextfenster unterstützt und für schnelle Inferenz und hohen Durchsatz bei starker Kodierungs- und Reasoning-Performance ausgelegt ist. MiniMax M3 bietet Sparse Attention mit ungefähr 1/20 der Kosten der vorherigen Generation bei 1M-Token-Kontextfenster und unterstützt Text-, Bild- und Video-Eingaben. Claude Opus 4.8 von Anthropic ist das leistungsfähigste Modell der Opus-Familie mit 1M-Token-Kontextfenster und eignet sich besonders für hochautonome Agenten, mehrstufige Reasoning-Aufgaben und End-to-End-Projekt-Orchestrierung in Codebases. DeepSeek V4 Pro unterstützt ebenfalls 1M-Token-Kontext mit 1.6T Gesamtparametern und 49B aktivierten Parametern für erweiterte Reasoning- und Kodierungsaufgaben mit Hybrid-Attention-System.

Quelle öffnen
Google Cloud latest news and announcements
Google Cloud latest news and announcements
18 hours ago ... ... AI Gateway to govern, secure, and scale high-performance architectures. ... This update allows developers to transform APIs into AI-ready tools using ...
cloud.google.com
KI-Zusammenfassung

Mehrere relevante Updates zu KI-Entwicklertools und Agenten-Frameworks: Claude Sonnet 5 von Anthropic ist jetzt auf der Google Cloud Agent Platform verfügbar und dient als Drop-in-Ersatz für Sonnet 4.6 mit verbessertem Reasoning und Code-Generierung. Claude Opus 4.8 wurde ebenfalls hinzugefügt für komplexe Multi-Stage-Enterprise-Workflows mit starken Fähigkeiten im Agentic Coding. Gemini 3.1 Pro wurde in Preview eingeführt als deutlich intelligenteres und fähigeres Baseline-Modell für komplexe Problemlösung, verfügbar in Vertex AI, Gemini Enterprise und über die Gemini API. Gemini 3.1 Flash-Lite rollte als schnellstes und kosteneffizienziestes Modell der Serie für High-Volume-Developer-Workloads aus. Der TPU-Benchmark zeigt in vLLM 0.18.0 über 2x schnelleres Laden eines 480B-Parameter-Modells bei halbiertem Peak-Host-Memory-Usage. Cloud Run Worker Pools sind nun allgemein verfügbar für Pull-basierte, Non-HTTP-Workloads mit AI-Inference-Skalierung. Die Cloud Run External Metrics Autoscaler (CREMA) wurde Open-Source freigegeben für Queue-aware Autoscaling. Apigee Model Context Protocol (MCP) ist allgemein verfügbar zur Umwandlung von APIs in AI-ready Tools mit OpenAPI Specifications. Das Google AI Edge Portal für On-Device LLM-Deployment ermöglicht Benchmarking auf über 120 Android-Geräten.

Quelle öffnen
Über Nacht zusammengestellt von MorningMail.aiZugestellt um 03:10