Du wirst angemeldet...

Bitte warte, während wir deine Anmeldung überprüfen

Artikel · Samstag, 29. August 2026

KI-Entwicklertools · Was kam heute

Für eine erfahrene Engineerin, die ohnehin HN liest. Echte Veränderungen bei KI-Entwicklertools heute: Releases mit Versionsnummern, Paper mit Benchmarks, Repos, die eine relevante Schwelle überschritten haben. Hype-Threads, Pre-Announcement-Leaks und recycelte Zusammenfassungen überspringen. Immer Originalquellen verlinken.

Von Marius BongartsTech67 Ausgaben
← Zur aktuellen Ausgabe
Ausgaben
26 / 67
Über Nacht von KI aus öffentlichen Quellen erstellt, täglich aktualisiert.
KI-Entwicklertools · Was kam heute
Samstag, 29. August 2026
KI-Entwicklertools · Was kam heute

GLM-5.3 Flash schlägt Claude, ROCm 10 verdoppelt Speed

1 Min. Lesezeit

GLM-5.3-Flash Coding Lead

Zhipus Open-Weights-Modell schlägt Claude im ersten Versuch.

GLM-5.3-Flash erreicht 80 Prozent Erfolgsquote bei unabhängigen Coding-Tests, während Claude 3.5 Sonnet bei 65 Prozent bleibt [Quelle: Born City]. Das auf Mixture-of-Experts basierende 320B-Modell mit 1M-Token-Fenster läuft unter MIT-Lizenz via Hugging Face und kostet 0,15 Dollar pro Million Input-Tokens – aggressiv bepreist bis 9. September. Hybrid Sparse-Linear-Attention senkt die Long-Context-Serving-Kosten [Quelle: GitHub].

Lokal einsetzbar mit SGLang, vLLM und Unsloth – das ändert, was Entwickler on-premise trainieren können.

ROCm 10 – 3,3x Speedup

AMD bündelt KI-Infrastruktur unter einer API.

ROCm 10 startet heute mit Hyperloom-Agenten, AMD Skills CLI und validiertem vLLM/SGLang-Support [Quelle: Born City]. Interne Tests auf acht MI355X-GPUs zeigen 3,3× Speedup bei Inferenz und 2,4× beim Training gegenüber ROCm 7. Hyperloom automatisiert Optimierungen, die sonst Wochen kosten – jetzt in Stunden. Sechswöchige Update-Zyklen ab sofort via repo.amd.com.

AMD konkurriert jetzt nicht nur bei Hardware, sondern auch bei Developer Experience – erwartet Bewegung in der LLM-Serving-Landschaft.

PyTorch Ecosystem wächst

vLLM wird Konferenzthema Nummer eins.

Die PyTorch Conference North America 2026 dediciert mehrere Sessions zu KV-Cache-Management, Disaggregated Serving und Hardware-Portabilität [Quelle: PyTorch]. Gleichzeitig wählte die Ecosystem Working Group zehn neue Projekte auf – darunter TokenSpeed, VisualTorch und FiftyOne – die Real-Time-Inference, Post-Training und Deployment adressieren. Das Signal: Production Serving wird Framework-Standard, nicht Niche.

Die Fragmentierung beim Produktionseinsatz konvergiert endlich.

Quellen
GitHub - zai-org/GLM-5: GLM-5: From Vibe Coding to Agentic ...
GitHub - zai-org/GLM-5: GLM-5: From Vibe Coding to Agentic ...
17 hours ago ... On standard coding benchmarks, GLM-5.2 is the strongest open-source model, improving on GLM-5.1 by a wide margin: 81.0 vs. 62.0 on Terminal-Bench 2.1 and ...
github.com
KI-Zusammenfassung

GLM-5.3 und GLM-5.3-Flash wurden als neue Versionen der GLM-Serie veröffentlicht. GLM-5.3 nutzt die gleiche Basis wie GLM-5.2, verbessert sich aber durch Post-Training erheblich: Es zeigt 50% bessere Performance beim Coding im hauseigenen Z.ai Code Bench und erreicht State-of-the-Art auf öffentlichen Benchmarks wie Terminal Bench 3.0 und Agents' Last Exam. Neu hinzugekommen ist emergente Cyber-Capability mit Best-in-Class-Performance auf CyberGym. GLM-5.3-Flash ist ein neu trainiertes Modell mit Hybrid-Architektur aus Sparse und Linear Attention, was die Long-Context-Serving-Kosten deutlich senkt. Die Modelle sind in verschiedenen Quantisierungen auf Hugging Face und ModelScope verfügbar und können lokal mit SGLang, vLLM, TokenSpeed, Transformers, KTransformers und Unsloth eingesetzt werden.

Quelle öffnen
GLM-5.3-Flash: Zhipus neues Modell schlägt Claude in Coding um ...
GLM-5.3-Flash: Zhipus neues Modell schlägt Claude in Coding um ...
11 hours ago ... Open-Source-Modell verarbeitet 44 Billionen Tokens; API-Preise deutlich unter Wettbewerbsniveau. Der chinesische KI-Entwickler Zhipu AI (Z.ai) hat mit der ...
borncity.com
KI-Zusammenfassung

Zhipu AI hat das Open-Source-Modell GLM-5.3-Flash offiziell vorgestellt, das zuvor unter dem Pseudonym "Ox Alpha" bekannt war. Das auf Mixture-of-Experts-Architektur basierende Modell mit 320B-A18B Parametern verfügt über ein Kontextfenster von 1.048.576 Tokens, native visuelle Fähigkeiten und wird unter MIT-Lizenz mit Gewichten über 300 GB auf Hugging Face bereitgestellt. In unabhängigen Coding-Tests erreichte GLM-5.3-Flash 80 Prozent Erfolgsquote beim ersten Versuch und übertrifft damit Claude 3.5 Sonnet (65 Prozent). Das Modell wurde während der Testphase mit 100.000 inländischen chinesischen Chips betrieben und wird zu aggressiven Preisen angeboten: 0,15 US-Dollar pro Million Input-Tokens und 0,50 US-Dollar pro Million Output-Tokens international, mit erheblichen Rabatten bis 9. September verfügbar.

Quelle öffnen
PyTorch
PyTorch
3 hours ago ... ... new users and contributors have a productive experience. ... Captum (“comprehension” in Latin) is an open source, extensible library for model interpretability ...
pytorch.org
KI-Zusammenfassung

PyTorch Conference North America 2026 will feature vLLM across multiple sessions covering KV cache management, disaggregated serving, hardware portability, kernel optimization, and production serving. The PyTorch Ecosystem Working Group has welcomed 10 new projects to its landscape including Perforated, AReaL, TorchJD, RLinf, Miles, SMG, FiftyOne, TokenSpeed, VisualTorch, and TorchSurv.

Quelle öffnen
ROCm 10: AMD stellt KI-Plattform mit 3,3x schnellerem Inferenz vor
ROCm 10: AMD stellt KI-Plattform mit 3,3x schnellerem Inferenz vor
19 hours ago ... August 2026 die zehnte Generation seiner Open-Source-Softwareplattform ROCm veröffentlicht und macht damit gleichzeitig ROCm.AI allgemein verfügbar. Die neue ...
borncity.com
KI-Zusammenfassung

AMD hat am 27. August 2026 ROCm 10 veröffentlicht, die zehnte Generation seiner Open-Source-KI-Plattform, die nun gleichzeitig als ROCm.AI allgemein verfügbar ist. Die neue Version bündelt mehrere Werkzeuge wie AMD Skills, ROCm CLI und Hyperloom zur Vereinfachung von KI-Workloads auf AMD-Grafikprozessoren. ROCm 10 enthält validierte Container für vLLM und SGLang, ein überarbeitetes ROCm Core SDK sowie Verbesserungen an der RCCL-Bibliothek für GPU-Kommunikation. Laut AMDs internen Tests erreicht ROCm.AI auf einer Plattform mit acht Instinct MI355X-GPUs durchschnittlich eine 3,3-fache Verbesserung bei Inferenz-Workloads und 2,4-fache beim Training gegenüber ROCm 7. Das Tool Hyperloom automatisiert die Optimierung und soll den dafür nötigen Aufwand von mehreren Wochen auf wenige Stunden reduzieren. ROCm 10 wird künftig über repo.amd.com vertrieben, mit Nebenversionen in sechswöchigem Abstand geplant.

Quelle öffnen
Über Nacht zusammengestellt von MorningMail.aiZugestellt um 03:10