Senior AI Engineering
Lass alles weg, was nach Pressemitteilung oder Marketing klingt. Gehe auf die neuesten Entwicklungen ein, die als Senior Software Engineer wichtig sind: Bspw. neue LLM Modelle, wirklich neue Tools und Frameworks zur AI Entwicklung und Best Practices.
Gemini-Tuning live, Modellauswahl spart Zehntausende, Benchmarks reifen endlich
2 Min. Lesezeit
Gemini Supervised Tuning
Google macht Supervised Fine-Tuning für Gemini produktionsreif.
Die Enterprise Agent Platform unterstützt jetzt Gemini 3.5 Flash, 2.5 Pro und 2.5 Flash mit konfigurierbaren Hyperparametern — Epochs, Adapter Size und Learning Rate Multiplier [Quelle: Google Cloud]. Google empfiehlt, zunächst mit den Standardwerten zu starten, weil die auf Benchmark-Ergebnissen basieren. Automatische Metriken wie Training Loss und Token Accuracy plus optionale Validierungs-Metriken geben dir kontinuierliches Feedback während des Trainings.
Für dediziertes Deployment stehen skalierbare Endpoints bereit — Zeit, den eigenen Datensatz vorzubereiten.
Modellauswahl nach Kosten
60.000 Dollar Ersparnis pro Jahr — durch gezieltes Benchmarking.
Viele Teams defaulten auf das teuerste Modell, obwohl günstigere für einfache Tasks wie Ticket-Klassifikation oder File-Reading genauso gut funktionieren [Quelle: Comet]. Der Ansatz: Performance-Schwellen definieren, denselben Prompt über mehrere Modell-Tiers laufen lassen, Outputs konsistent scoren und das günstigste Modell nehmen, das die Qualität hält. Pattern hat genau so ihre Kosten drastisch gesenkt. Bei Agent-Pipelines wird das mehrstufig — leichte Modelle für Routing, stärkere für komplexes Reasoning.
Dein nächster Schritt: Task-Level-Spend analysieren und Defaults pro Workspace setzen.
Fine-Tuning Entscheidung
Wann lohnt sich Fine-Tuning gegenüber Prompt Engineering und RAG?
Die Antwort hängt vom Use Case ab: Fine-Tuning schlägt Prompt Engineering bei konsistentem Verhalten über tausende Anfragen, bei domain-spezifischen Fachbegriffen und bei gleichbleibender Tonalität [Quelle: Logix Built]. Ein NVIDIA-Test zeigt 18 Prozent bessere Task-Genauigkeit nach Llama 3 8B Fine-Tuning. Aber: Overfitting bei kleinen Datensätzen, Catastrophic Forgetting und Modeldrift über Zeit sind reale Risiken. Parameter-effiziente Methoden wie LoRA und QLoRA reduzieren Rechenkosten deutlich.
Hochwertige Daten und kontinuierliches Monitoring entscheiden über den Erfolg — nicht das Modell.
Benchmarks werden erwachsen
Von Vibes zu Daten — der Evaluations-Markt professionalisiert sich.
Vals entwickelt Benchmarks, die echte Profi-Tasks testen statt Multiple-Choice-Fragen: Coding, Legal, Cybersecurity [Quelle: a16z Policy]. Neu sind CyberBench für offensive und defensive Security-Evaluierung plus geplante Benchmarks für rekursive Self-Improvement und Mental-Health-Auswirkungen bei Minderjährigen. Statische Benchmarks veralten schnell — deshalb setzt Vals auf Infrastruktur, die Modelle innerhalb von Stunden nach Release evaluieren kann. Regierungen fordern zunehmend unabhängig verifizierte Ergebnisse statt Vendor-Self-Attestation.
Für Enterprise-ROI und Government-Procurement wird Third-Party-Evaluation zum Standard.
Fine-Tuning Best Practices
Sieben Schritte, die den Unterschied machen.
Der praktische Workflow: Datensatz vorbereiten, Basismodell wählen, Trainingsparameter setzen, trainieren, validieren, deployen, monitoren [Quelle: Logix Built]. Konservative Trainingseinstellungen und parametereffiziente Methoden wie QLoRA minimieren Ressourcenverbrauch. Trainingsdaten gründlich auf Bias prüfen — das Modell lernt jeden Fehler mit. Reale Szenarien vor Deployment testen, nicht nur Benchmark-Metriken optimieren. Catastrophic Forgetting passiert, wenn du nicht aufpasst.
Das Modell ist nur so gut wie dein Datensatz und dein Monitoring danach.
DeepSeek Harness Update
Das Plugin-Konzept wächst weiter — und passt zu den neuen Fine-Tuning-Workflows.
Wie in den vorherigen Ausgaben beschrieben, setzt DeepSeek Harness auf austauschbare Module für Modelle, Tools, Skills und Sandboxes unter MIT-Lizenz. Die vier Runtime-Modi mit vollständigem Event-Logging bleiben der Hauptgrund für die Evaluierung. Kombiniert mit dem Bounded-Hybrid-Ansatz — Code kontrolliert, Modell interpretiert — passt das Framework gut zu Teams, die Fine-Tuned Models in kontrollierte Agent-Pipelines integrieren wollen.
Breaking Changes sind weiterhin angekündigt, aber die Richtung stimmt für produktionsnahe Setups.
Tune Gemini models with supervised fine-tuning4 hours ago ... Hex-LLM · Comprehensive guide to vLLM for Text and Multimodal LLM Serving ... For a discussion of best practices for supervised fine-tuning, see the blog ...docs.cloud.google.com
Google Cloud's Gemini Enterprise Agent Platform unterstützt supervised fine-tuning für mehrere Gemini-Modelle, darunter Gemini 3.5 Flash, 2.5 Pro und 2.5 Flash. Bei der Erstellung eines Tuning-Jobs empfiehlt Google, zunächst ohne Änderungen an den Hyperparametern zu starten, da die Standardwerte auf Basis von Benchmarking-Ergebnissen optimiert sind. Die wichtigsten konfigurierbaren Parameter sind: Epochs (automatisch basierend auf Trainings-Datensatzgröße angepasst), Adapter Size (beeinflusst die Anzahl trainierbarer Parameter) und Learning Rate Multiplier (für schnellere oder stabilere Konvergenz). Das System sammelt automatisch Tuning-Metriken wie Training Loss, Token Accuracy und Anzahl Predictions, wobei optionale Validierungs-Metriken für separate Evaluierung verfügbar sind. Für die Produktionsbereitstellung können tuned models über dedizierte Endpoints deployed und mit verschiedenen Ressourcen-Optionen skaliert werden. Google dokumentiert auch Best Practices für supervised fine-tuning in einem separaten Blog-Post.
LLM Model Selection: How to Pick the Right Model for Every Agentic ...7 hours ago ... Running the Comparison in Opik · Run the dataset against multiple models. · See performance scores and cost data side by side. · Find your threshold for the ...comet.com

LLM Model Selection: Matching Models to Tasks by Minimum Required Capability The article addresses a critical best practice for AI engineering production deployment: deliberate LLM model selection based on task requirements rather than defaulting to the most expensive flagship model. Teams often accidentally default to premium models for simple tasks like ticket classification or file reading that cheaper models could handle equally well, inflating costs without quality gains. The core approach involves defining performance thresholds through systematic evaluation—running the same prompt and context across multiple models from different capability tiers, scoring outputs consistently using metrics or assertions, and selecting the cheapest model that meets the quality bar. For agent-based systems, model selection becomes multi-step: different pipeline stages require different capability levels, such as lightweight models for routing decisions versus more capable models for complex reasoning. The article includes a practical case study where Pattern reduced annual costs by $60,000 using benchmarking to confirm a smaller model matched their baseline quality across diverse production data. For teams managing coding agents like Claude Code or Codex, the challenge is identifying when expensive model defaults are unnecessary—Cost Intelligence tools can surface task-level spend patterns showing which sessions triggered premium models for routine work, enabling better workspace-level defaults.
Fine-Tuning LLM: The Complete Guide for Businesses - Logix Built19 hours ago ... What Are the Different Methods for LLM Fine-Tuning? How to Fine-Tune an LLM Model: Step-by-Step Process; What Are the Best Practices for LLM Fine-Tuning? What ...logixbuilt.com

Llama 3 8B fine-tuning erreichte in einem NVIDIA-Test eine 18% Verbesserung der Aufgabengenauigkeit gegenüber dem ungestimmten Basismodell. Der Leitfaden behandelt umfassend LLM-Fine-Tuning-Methoden einschließlich Full Fine-Tuning, Parameter-Efficient Fine-Tuning (PEFT), LoRA/QLoRA und Supervised Fine-Tuning. Wichtige Best Practices sind: hochwertige Datensätze nutzen, das richtige Basismodell wählen, konservative Trainingseinstellungen verwenden, parametereffiziente Methoden bevorzugen, das Modell während des Trainings evaluieren, Trainingsdaten gründlich überprüfen und reale Szenarien vor dem Deployment testen. Ein kritischer Punkt ist die Entscheidung, wann Fine-Tuning sinnvoll ist: Es funktioniert besser als Prompt Engineering und RAG für konsistentes Verhalten über tausende Anfragen, domain-spezifische Fachbegriffe und konsistente Tonalität. Häufige Herausforderungen sind Overfitting bei kleinen Datensätzen, Catastrophic Forgetting, Bias in Trainingsdaten, hohe Rechenkosten bei Full Fine-Tuning und Modelldrift über Zeit. Die praktische Implementierung umfasst sieben Schritte: Datensatzvorbereitung, Wahl des Basismodells, Trainingsparameter-Setting, Modelltraining, Validierung der Performance, Deployment und kontinuierliches Monitoring.
Measuring AI: What Policymakers Can Learn from Benchmarks15 hours ago ... ... differences in capabilities between closed source and open source models ... You have more foundation model labs and new labs getting funded to develop new models ...a16zpolicy.substack.com

The podcast discusses AI benchmarking and evaluation as critical infrastructure for both industry and government. Vals, an independent evaluation company, has developed methodologies to create realistic, challenging benchmarks that go beyond traditional multiple-choice tests to assess whether models can perform actual professional tasks like coding, legal work, or cybersecurity. Key developments include CyberBench for evaluating offensive and defensive AI capabilities in security contexts, and plans for benchmarks measuring recursive self-improvement, mental health impacts on minors, and military applications. The conversation highlights how static benchmarks quickly become obsolete and emphasizes the importance of third-party independent evaluation rather than companies self-reporting results. Vals has demonstrated the ability to evaluate models within hours of release by scaling infrastructure efficiently. The marketplace for AI evaluation is rapidly professionalized, with government agencies increasingly demanding rigorous, independently-verified benchmarks to inform policy decisions rather than relying on vendor self-attestation. This shift from "evaluations by vibes" to data-driven evidence represents a maturing of AI evaluation practices critical for enterprise ROI decisions and government procurement.