Signing you in...

Please wait while we verify your authentication

Article · Sunday, September 13, 2026

KI-Entwicklertools · Was kam heute

Für eine erfahrene Engineerin, die ohnehin HN liest. Echte Veränderungen bei KI-Entwicklertools heute: Releases mit Versionsnummern, Paper mit Benchmarks, Repos, die eine relevante Schwelle überschritten haben. Hype-Threads, Pre-Announcement-Leaks und recycelte Zusammenfassungen überspringen. Immer Originalquellen verlinken.

By Marius BongartsTech67 editions
← See today's latest
Editions
11 / 67
Generated by AI overnight from public sources, refreshed daily.
KI-Entwicklertools · Was kam heute
Sunday, September 13, 2026
KI-Entwicklertools · Was kam heute

Benchmark Radar live; Qwen Flash auf DGX; CUDA ARM-Support

1 min read

Benchmark Radar startet

Eine durchsuchbare Datenbank für alle KI-Evaluationen.

Benchmark Radar katalogisiert täglich über 11.900 Benchmark-, Eval- und Dataset-Einträge aus 37 öffentlichen Quellen [Quelle: GitHub]. Die Plattform bietet Web-Dashboard mit Leaderboards, Trend-Ansichten, CLI für lokale Abfragen und downloadbare Daten für LLM-Bewertung, agentenbasierte Systeme, Coding, Reasoning und Safety. Tägliche Updates zeigen neue Benchmark-Paper, Repos und Releases.

Das wird zum Standard für Model-Auswahl.

Qwen 3.8 Flash Next auf DGX

Quantisierte Variante schlägt Benchmark-Scores aus dem Stand.

Qwen 3.8 Flash Next NVFP4 erreicht 94/100 auf tool-eval-bench mit 79 bestandenen Tests und durchsatzkonstante 47–131 Token/s über Concurrency-Ebenen [Quelle: NVIDIA Forums]. INT4-AutoRound-Quantisierung zeigt 88–90/100, mit Trade-off in Responsiveness. vllm-Rezepte auf DGX Spark dokumentieren alle Scores.

Quantisierung wird jetzt zum First-Class-Eval.

CUDA 13.4: ARM & Rubin GPU

Nvidia öffnet CUDA für neue Hardware-Grenzen.

CUDA Toolkit 13.4 erweitert Windows-ARM-Unterstützung und Rubins GPU-Architektur mit erweiterten GPU-Management-Funktionen [Quelle: Heise]. Updates für Nsight Developer Tools und mathematische Kernbibliotheken folgen. Parallel rollt GPT-6 Astra in GitHub Copilot für Pro+, Max und Enterprise aus.

ARM-native Workflows verlassen das Bastlerterritorium.

Sources
ktwu01/benchmark-radar - GitHub
ktwu01/benchmark-radar - GitHub
24 hours ago ... MCP RegistryIntegrate external tools. DEVELOPER WORKFLOWS. Actions ... Benchmark researchers and developers of large language models (LLMs) and other AI ...
github.com
AI Summary

Benchmark Radar ist ein neues Tool, das täglich Benchmark-Signale aus 37 öffentlichen Quellen sammelt und eine durchsuchbare Datenbank mit KI-Benchmarks aufbaut. Das Projekt bietet ein Web-Dashboard mit Leaderboards, Trend-Ansichten, eine Kommandozeilen-Schnittstelle für lokale Abfragen und downloadbare Daten für LLM-Evaluierung, agentic systems, Coding, Reasoning, Safety und domänenspezifische Bewertungen. Die technische Dokumentation beschreibt Benchmark-Sättigung, Adoption Trends und Limitierungen von Score-Vergleichen, mit täglichen Updates über neue Benchmark-Paper, Repositories und Releases.

Visit source
Developer-Häppchen – CUDA für ARM, Node-Sicherheit und Rust ...
Developer-Häppchen – CUDA für ARM, Node-Sicherheit und Rust ...
21 hours ago ... OpenAIs neues KI-Modell GPT-6 Astra ist jetzt auch in GitHub Copilot verfügbar. ... Auch für Nsight-Entwicklertools und die mathematischen Kernbibliotheken gibt ...
heise.de
AI Summary

OpenAIs neues KI-Modell GPT-6 Astra ist jetzt in GitHub Copilot verfügbar und wird schrittweise für Nutzer der Tarife Pro+, Max, Business und Enterprise ausgerollt. Das CUDA Toolkit 13.4 erweitert seine Unterstützung auf Windows für ARM und die Rubin-GPU-Architektur von Nvidia mit erweiterten GPU-Management-Funktionen und Updates für Nsight-Entwicklertools sowie mathematische Kernbibliotheken.

Visit source
Qwen 3.8 Flash Next on two SPARKs - NVIDIA Developer Forums
Qwen 3.8 Flash Next on two SPARKs - NVIDIA Developer Forums
17 hours ago ... tool-eval-bench --hardmode --seed 42 --parallel 1 --max-turns 32 ... benchmarks, and four errors that stopped the engine · DGX Spark / GB10 Projects · agentic-ai.
forums.developer.nvidia.com
AI Summary

Ein Benutzer mit vllm-Rezepten auf DGX Spark hat Benchmark-Ergebnisse für Qwen 3.8 Flash Next NVFP4 veröffentlicht: tool-eval-bench erzielte einen Score von 94/100 (Excellent) mit 79 bestandenen Tests und 165 von 176 Punkten bei mittlerer Reasoning-Einstellung. Die llama-benchy-Ergebnisse zeigen Durchsätze von 47 Token/s (Concurrency 1) bis 131 Token/s (Concurrency 8) bei 2048 Prompt- und 512 Token-Generierung. Ein weiterer Benutzer dokumentierte INT4-AutoRound-Quantisierung mit tool-eval-bench v2.6.1 Scores von 88–90/100, wobei die Responsiveness bei dieser Variante nur 16/100 erreichte (9,1s Median Turn).

Visit source
Compiled overnight by MorningMail.aiDelivered at 03:10 AM