Signing you in...

Please wait while we verify your authentication

Article · Wednesday, August 12, 2026

KI-Entwicklertools · Was kam heute

Für eine erfahrene Engineerin, die ohnehin HN liest. Echte Veränderungen bei KI-Entwicklertools heute: Releases mit Versionsnummern, Paper mit Benchmarks, Repos, die eine relevante Schwelle überschritten haben. Hype-Threads, Pre-Announcement-Leaks und recycelte Zusammenfassungen überspringen. Immer Originalquellen verlinken.

By Marius BongartsTech35 editions
← See today's latest
Editions
11 / 35
Generated by AI overnight from public sources, refreshed daily.
KI-Entwicklertools · Was kam heute
Wednesday, August 12, 2026
KI-Entwicklertools · Was kam heute

SWE-Bench Pro startet, ExtractBench benchmarkt Enterprise-Dokumente

1 min read

SWE-Bench Pro

Softwareentwickler-Agenten bekommen endlich ein echtes Enterprise-Benchmark.

SWE-Bench Pro misst Agent-Fähigkeiten an 1.865 komplexen Instanzen über 41 Repositories – das sind größere, realistischere Aufgaben als bisherige Testsets [Quelle: Hugging Face]. Parallel laufen spezialisierte Varianten: ProMax mit 170 mehrsprachigen Refactoring-Tasks, Plus-Variante mit 11.133 Tasks über elf Programmiersprachen, und Live-Version mit kontinuierlichen Updates seit 2024. State-of-the-art Open-Source-Modelle erreichen bereits 61–70% auf SWE-Bench Verified durch systematisches Post-Training.

Die Agent-Rennstrecke wird gerade neu gepflastert.

ExtractBench – Dokumentenextraktion

Dokumentenextraktion braucht endlich echte Production-Metriken.

ExtractBench testet 14 Systeme – VLMs, Coding Agents, spezialisierte APIs – an 370 Enterprise-Dokumenten über acht Business-Domains und 67 Dokumenttypen [Quelle: LlamaIndex]. Der Benchmark misst Value-F1, Completeness, gescannte und handschriftliche Inhalte, Word- und Page-Level Grounding sowie echte Kosten pro Seite. LlamaExtract Agentic Plus führt mit 95,6% Value F1 bei nur 8,1 Cent pro Seite – deutlich unter den Alternativen. Datensatz, Code und Paper sind auf HuggingFace und GitHub öffentlich.

Damit endet die Ära der Demo-Metriken.

Agent-Frameworks – Live-SWE-Agent

Neue Agent-Orchestratoren erreichen Resolve-Raten über 75 Prozent.

Live-SWE-Agent knackt 75,4% auf aktuellen SWE-Bench-Varianten, Confucius Code Agent 54,3% auf SWE-Bench Pro, während Orchestrator-Systeme wie Argus und Sakana Fugu komplexe Workflows parallelisieren [Quelle: Hugging Face]. Das Muster ist klar: Spezialisierte Agenten für Bug-Fixes, Feature-Entwicklung und Code-Review arbeiten in isolierten Kontexten und übergeben Ergebnisse an Koordinatoren. Reproduktionsskripte und Benchmarks sind verfügbar.

Der nächste Schritt ist Multi-Agent-Koordination in Production.

Sources
Daily Papers - Hugging Face
Daily Papers - Hugging Face
6 hours ago ... ... developer tools. The benchmark is partitioned into a public set with open ... AI coding agents have shown great progress on Python software engineering benchmarks ...
huggingface.co
AI Summary

# Software Engineering Agent Research Papers and Benchmarks Die neuesten Papers zeigen rasante Fortschritte bei KI-Entwicklertools für Softwareentwicklung. Relevante aktuelle Releases sind: SWE-Bench Pro für komplexere Enterprise-Probleme mit 1.865 Instanzen über 41 Repositories, SWE-Bench ProMax mit 170 multilingualen Code-Refactoring Tasks, sowie SWE-Bench++ ein Framework mit 11.133 Tasks über 11 Programmiersprachen. Specialized Benchmark-Varianten umfassen SWE-Bench-Live für kontinuierliche Updates mit 1.319 Tasks seit 2024, SWE-Bench Multilingual, SWE-bench-java und Claw-SWE-Bench für verschiedene Kontexte. Neue Agent-Frameworks wurden vorgestellt wie Live-SWE-agent mit 75,4% Resolve Rate, Confucius Code Agent mit 54,3% auf SWE-Bench-Pro, sowie Argus und Sakana Fugu als Orchestrator-Systeme. State-of-the-art Open-Source Modelle erreichen 61-70% auf SWE-Bench Verified durch systematische Post-Training-Verfahren wie in SWE-Master und Skywork-SWE demonstriert.

Visit source
ExtractBench: The Most Comprehensive Extraction Benchmark
ExtractBench: The Most Comprehensive Extraction Benchmark
23 hours ago ... Introducing ExtractBench: The Most Comprehensive Benchmark for Data Extraction from Enterprise Documents ... tools only; and specialized extraction APIs ...
llamaindex.ai
AI Summary

LlamaIndex veröffentlichte ExtractBench, einen umfassenden Open-Source-Benchmark für die Dokumentenextraktion mit 370 Enterprise-Dokumenten über 8 Business-Domains und 67 Dokumenttypen. Der Benchmark bewertet 14 Systeme einschließlich VLMs, Coding Agents und spezialisierter Extraktions-APIs und adressiert Produktions-Anforderungen wie Long-Record-Completeness, gescannte und handschriftliche Inhalte, Word- und Page-Level Grounding sowie gemessene Kosten. Das neue LlamaExtract Agentic Plus Tier erzielte Spitzenergebnisse mit 95,6% Value F1 bei 8,1¢ pro Seite und übertrifft konkurrierende Systeme bei deutlich niedrigeren Kosten. Datensatz, Evaluierungs-Code und Paper sind auf HuggingFace, GitHub und arXiv öffentlich verfügbar.

Visit source
Compiled overnight by MorningMail.aiDelivered at 03:10 AM