Du wirst angemeldet...

Bitte warte, während wir deine Anmeldung überprüfen

Artikel · Sonntag, 13. September 2026

KI-Entwicklertools · Was kam heute

Für eine erfahrene Engineerin, die ohnehin HN liest. Echte Veränderungen bei KI-Entwicklertools heute: Releases mit Versionsnummern, Paper mit Benchmarks, Repos, die eine relevante Schwelle überschritten haben. Hype-Threads, Pre-Announcement-Leaks und recycelte Zusammenfassungen überspringen. Immer Originalquellen verlinken.

Von Marius BongartsTech67 Ausgaben
← Zur aktuellen Ausgabe
Ausgaben
11 / 67
Über Nacht von KI aus öffentlichen Quellen erstellt, täglich aktualisiert.
KI-Entwicklertools · Was kam heute
Sonntag, 13. September 2026
KI-Entwicklertools · Was kam heute

Benchmark Radar live; Qwen Flash auf DGX; CUDA ARM-Support

1 Min. Lesezeit

Benchmark Radar startet

Eine durchsuchbare Datenbank für alle KI-Evaluationen.

Benchmark Radar katalogisiert täglich über 11.900 Benchmark-, Eval- und Dataset-Einträge aus 37 öffentlichen Quellen [Quelle: GitHub]. Die Plattform bietet Web-Dashboard mit Leaderboards, Trend-Ansichten, CLI für lokale Abfragen und downloadbare Daten für LLM-Bewertung, agentenbasierte Systeme, Coding, Reasoning und Safety. Tägliche Updates zeigen neue Benchmark-Paper, Repos und Releases.

Das wird zum Standard für Model-Auswahl.

Qwen 3.8 Flash Next auf DGX

Quantisierte Variante schlägt Benchmark-Scores aus dem Stand.

Qwen 3.8 Flash Next NVFP4 erreicht 94/100 auf tool-eval-bench mit 79 bestandenen Tests und durchsatzkonstante 47–131 Token/s über Concurrency-Ebenen [Quelle: NVIDIA Forums]. INT4-AutoRound-Quantisierung zeigt 88–90/100, mit Trade-off in Responsiveness. vllm-Rezepte auf DGX Spark dokumentieren alle Scores.

Quantisierung wird jetzt zum First-Class-Eval.

CUDA 13.4: ARM & Rubin GPU

Nvidia öffnet CUDA für neue Hardware-Grenzen.

CUDA Toolkit 13.4 erweitert Windows-ARM-Unterstützung und Rubins GPU-Architektur mit erweiterten GPU-Management-Funktionen [Quelle: Heise]. Updates für Nsight Developer Tools und mathematische Kernbibliotheken folgen. Parallel rollt GPT-6 Astra in GitHub Copilot für Pro+, Max und Enterprise aus.

ARM-native Workflows verlassen das Bastlerterritorium.

Quellen
ktwu01/benchmark-radar - GitHub
ktwu01/benchmark-radar - GitHub
24 hours ago ... MCP RegistryIntegrate external tools. DEVELOPER WORKFLOWS. Actions ... Benchmark researchers and developers of large language models (LLMs) and other AI ...
github.com
KI-Zusammenfassung

Benchmark Radar ist ein neues Tool, das täglich Benchmark-Signale aus 37 öffentlichen Quellen sammelt und eine durchsuchbare Datenbank mit KI-Benchmarks aufbaut. Das Projekt bietet ein Web-Dashboard mit Leaderboards, Trend-Ansichten, eine Kommandozeilen-Schnittstelle für lokale Abfragen und downloadbare Daten für LLM-Evaluierung, agentic systems, Coding, Reasoning, Safety und domänenspezifische Bewertungen. Die technische Dokumentation beschreibt Benchmark-Sättigung, Adoption Trends und Limitierungen von Score-Vergleichen, mit täglichen Updates über neue Benchmark-Paper, Repositories und Releases.

Quelle öffnen
Developer-Häppchen – CUDA für ARM, Node-Sicherheit und Rust ...
Developer-Häppchen – CUDA für ARM, Node-Sicherheit und Rust ...
21 hours ago ... OpenAIs neues KI-Modell GPT-6 Astra ist jetzt auch in GitHub Copilot verfügbar. ... Auch für Nsight-Entwicklertools und die mathematischen Kernbibliotheken gibt ...
heise.de
KI-Zusammenfassung

OpenAIs neues KI-Modell GPT-6 Astra ist jetzt in GitHub Copilot verfügbar und wird schrittweise für Nutzer der Tarife Pro+, Max, Business und Enterprise ausgerollt. Das CUDA Toolkit 13.4 erweitert seine Unterstützung auf Windows für ARM und die Rubin-GPU-Architektur von Nvidia mit erweiterten GPU-Management-Funktionen und Updates für Nsight-Entwicklertools sowie mathematische Kernbibliotheken.

Quelle öffnen
Qwen 3.8 Flash Next on two SPARKs - NVIDIA Developer Forums
Qwen 3.8 Flash Next on two SPARKs - NVIDIA Developer Forums
17 hours ago ... tool-eval-bench --hardmode --seed 42 --parallel 1 --max-turns 32 ... benchmarks, and four errors that stopped the engine · DGX Spark / GB10 Projects · agentic-ai.
forums.developer.nvidia.com
KI-Zusammenfassung

Ein Benutzer mit vllm-Rezepten auf DGX Spark hat Benchmark-Ergebnisse für Qwen 3.8 Flash Next NVFP4 veröffentlicht: tool-eval-bench erzielte einen Score von 94/100 (Excellent) mit 79 bestandenen Tests und 165 von 176 Punkten bei mittlerer Reasoning-Einstellung. Die llama-benchy-Ergebnisse zeigen Durchsätze von 47 Token/s (Concurrency 1) bis 131 Token/s (Concurrency 8) bei 2048 Prompt- und 512 Token-Generierung. Ein weiterer Benutzer dokumentierte INT4-AutoRound-Quantisierung mit tool-eval-bench v2.6.1 Scores von 88–90/100, wobei die Responsiveness bei dieser Variante nur 16/100 erreichte (9,1s Median Turn).

Quelle öffnen
Über Nacht zusammengestellt von MorningMail.aiZugestellt um 03:10