<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0" xmlns:itunes="http://www.itunes.com/dtds/podcast-1.0.dtd" xmlns:googleplay="http://www.google.com/schemas/play-podcasts/1.0"><channel><title><![CDATA[fluxum engineering]]></title><description><![CDATA[Value Streams, KI-Agenten, Teamarbeit, Technologie und neue Formen der agilen Zusammenarbeit]]></description><link>https://blog.fluxum.net</link><image><url>https://substackcdn.com/image/fetch/$s_!y_oj!,w_256,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fa142b85f-3d35-4a80-bdac-1835f765cd9e_512x512.png</url><title>fluxum engineering</title><link>https://blog.fluxum.net</link></image><generator>Substack</generator><lastBuildDate>Mon, 20 Jul 2026 13:40:49 GMT</lastBuildDate><atom:link href="https://blog.fluxum.net/feed" rel="self" type="application/rss+xml"/><copyright><![CDATA[Martin Gross]]></copyright><language><![CDATA[de]]></language><webMaster><![CDATA[fluxum@substack.com]]></webMaster><itunes:owner><itunes:email><![CDATA[fluxum@substack.com]]></itunes:email><itunes:name><![CDATA[Martin Gross]]></itunes:name></itunes:owner><itunes:author><![CDATA[Martin Gross]]></itunes:author><googleplay:owner><![CDATA[fluxum@substack.com]]></googleplay:owner><googleplay:email><![CDATA[fluxum@substack.com]]></googleplay:email><googleplay:author><![CDATA[Martin Gross]]></googleplay:author><itunes:block><![CDATA[Yes]]></itunes:block><item><title><![CDATA[Agentic Weekly #015 — Wenn der Agent tut, was er darf, aber nicht sollte]]></title><description><![CDATA[Drei unabh&#228;ngige Sicherheitsvorf&#228;lle in einer Woche zeigen, wie viel Vertrauen Coding-Agenten inzwischen genie&#223;en &#8212; w&#228;hrend Anthropics IPO-Roadshow beginnt und eine Kostenanalyse zeigt, warum Claude Code deutlich mehr kostet als gedacht.]]></description><link>https://blog.fluxum.net/p/agentic-weekly-015-wenn-der-agent</link><guid isPermaLink="false">https://blog.fluxum.net/p/agentic-weekly-015-wenn-der-agent</guid><dc:creator><![CDATA[Martin Gross]]></dc:creator><pubDate>Sat, 18 Jul 2026 11:15:08 GMT</pubDate><enclosure url="https://substackcdn.com/image/fetch/$s_!fmya!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F518b4d5b-f078-4f02-8432-32dc64622d4f_1600x900.png" length="0" type="image/jpeg"/><content:encoded><![CDATA[<p><strong>Drei unabh&#228;ngige Sicherheitsvorf&#228;lle in einer Woche zeigen, wie viel Vertrauen Coding-Agenten inzwischen genie&#223;en &#8212; w&#228;hrend Anthropics IPO-Roadshow beginnt und eine Kostenanalyse zeigt, warum Claude Code deutlich mehr kostet als gedacht.</strong></p><div class="captioned-image-container"><figure><a class="image-link image2 is-viewable-img" target="_blank" href="https://substackcdn.com/image/fetch/$s_!fmya!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F518b4d5b-f078-4f02-8432-32dc64622d4f_1600x900.png" data-component-name="Image2ToDOM"><div class="image2-inset"><picture><source type="image/webp" srcset="https://substackcdn.com/image/fetch/$s_!fmya!,w_424,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F518b4d5b-f078-4f02-8432-32dc64622d4f_1600x900.png 424w, https://substackcdn.com/image/fetch/$s_!fmya!,w_848,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F518b4d5b-f078-4f02-8432-32dc64622d4f_1600x900.png 848w, https://substackcdn.com/image/fetch/$s_!fmya!,w_1272,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F518b4d5b-f078-4f02-8432-32dc64622d4f_1600x900.png 1272w, https://substackcdn.com/image/fetch/$s_!fmya!,w_1456,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F518b4d5b-f078-4f02-8432-32dc64622d4f_1600x900.png 1456w" sizes="100vw"><img src="https://substackcdn.com/image/fetch/$s_!fmya!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F518b4d5b-f078-4f02-8432-32dc64622d4f_1600x900.png" width="1456" height="819" data-attrs="{&quot;src&quot;:&quot;https://substack-post-media.s3.amazonaws.com/public/images/518b4d5b-f078-4f02-8432-32dc64622d4f_1600x900.png&quot;,&quot;srcNoWatermark&quot;:null,&quot;fullscreen&quot;:null,&quot;imageSize&quot;:null,&quot;height&quot;:819,&quot;width&quot;:1456,&quot;resizeWidth&quot;:null,&quot;bytes&quot;:605624,&quot;alt&quot;:null,&quot;title&quot;:null,&quot;type&quot;:&quot;image/png&quot;,&quot;href&quot;:null,&quot;belowTheFold&quot;:false,&quot;topImage&quot;:true,&quot;internalRedirect&quot;:&quot;https://blog.fluxum.net/i/207540179?img=https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F518b4d5b-f078-4f02-8432-32dc64622d4f_1600x900.png&quot;,&quot;isProcessing&quot;:false,&quot;align&quot;:null,&quot;offset&quot;:false}" class="sizing-normal" alt="" srcset="https://substackcdn.com/image/fetch/$s_!fmya!,w_424,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F518b4d5b-f078-4f02-8432-32dc64622d4f_1600x900.png 424w, https://substackcdn.com/image/fetch/$s_!fmya!,w_848,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F518b4d5b-f078-4f02-8432-32dc64622d4f_1600x900.png 848w, https://substackcdn.com/image/fetch/$s_!fmya!,w_1272,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F518b4d5b-f078-4f02-8432-32dc64622d4f_1600x900.png 1272w, https://substackcdn.com/image/fetch/$s_!fmya!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F518b4d5b-f078-4f02-8432-32dc64622d4f_1600x900.png 1456w" sizes="100vw" fetchpriority="high"></picture><div class="image-link-expand"><div class="pencraft pc-display-flex pc-gap-8 pc-reset"><button tabindex="0" type="button" class="pencraft pc-reset pencraft icon-container restack-image"><svg role="img" width="20" height="20" viewBox="0 0 20 20" fill="none" stroke-width="1.5" stroke="var(--color-fg-primary)" stroke-linecap="round" stroke-linejoin="round" xmlns="http://www.w3.org/2000/svg"><g><title></title><path d="M2.53001 7.81595C3.49179 4.73911 6.43281 2.5 9.91173 2.5C13.1684 2.5 15.9537 4.46214 17.0852 7.23684L17.6179 8.67647M17.6179 8.67647L18.5002 4.26471M17.6179 8.67647L13.6473 6.91176M17.4995 12.1841C16.5378 15.2609 13.5967 17.5 10.1178 17.5C6.86118 17.5 4.07589 15.5379 2.94432 12.7632L2.41165 11.3235M2.41165 11.3235L1.5293 15.7353M2.41165 11.3235L6.38224 13.0882"></path></g></svg></button><button tabindex="0" type="button" class="pencraft pc-reset pencraft icon-container view-image"><svg xmlns="http://www.w3.org/2000/svg" width="20" height="20" viewBox="0 0 24 24" fill="none" stroke="currentColor" stroke-width="2" stroke-linecap="round" stroke-linejoin="round" class="lucide lucide-maximize2 lucide-maximize-2"><polyline points="15 3 21 3 21 9"></polyline><polyline points="9 21 3 21 3 15"></polyline><line x1="21" x2="14" y1="3" y2="10"></line><line x1="3" x2="10" y1="21" y2="14"></line></svg></button></div></div></div></a></figure></div><ol start="18"><li><p>Juli 2026 &#183; Lesezeit ~9 Min.</p></li></ol><div><hr></div><h2>Drei Anbieter, drei Sicherheitsl&#252;cken, eine Woche</h2><p>Drei unabh&#228;ngige Vorf&#228;lle innerhalb knapp einer Woche zeigen dasselbe Muster: Coding-Agenten bekommen mehr Vertrauen zugesprochen, als sie verdienen &#8212; und niemand hat das vorher bemerkt.</p><div class="subscription-widget-wrap-editor" data-attrs="{&quot;url&quot;:&quot;https://blog.fluxum.net/subscribe?&quot;,&quot;text&quot;:&quot;Abonnieren&quot;,&quot;language&quot;:&quot;de&quot;}" data-component-name="SubscribeWidgetToDOM"><div class="subscription-widget show-subscribe"><div class="preamble"><p class="cta-caption">fluxum engineering ist eine von Leser unterst&#252;tzte Publikation. Um neue Posts zu erhalten und meine Arbeit zu unterst&#252;tzen, ziehen Sie in Betracht, ein Free- oder Paid-Abonnent zu werden.</p></div><form class="subscription-widget-subscribe"><input type="email" class="email-input" name="email" placeholder="E-Mail-Adresse eingeben &#8230;" tabindex="-1"><input type="submit" class="button primary" value="Abonnieren"><div class="fake-input-wrapper"><div class="fake-input"></div><div class="fake-button"></div></div></form></div></div><p><strong>Grok Build lud komplette Repositories hoch.</strong> xAIs Coding-Agent Grok Build hat in Version 0.2.93 unbemerkt Inhalte eines 12-Gigabyte-Testrepositorys inklusive <code>.env</code>-Dateien und SSH-Schl&#252;sseln in einen Google-Cloud-Speicher hochgeladen &#8212; mindestens 5,1 Gigabyte sind nachweislich angekommen. Ein &#8222;Improve the model&#8221;-Schalter, der genau das h&#228;tte verhindern sollen, stoppte den Upload nicht. Eine Wire-Level-Analyse (eine Untersuchung des tats&#228;chlichen Netzwerkverkehrs) machte den Fund am 14. Juli publik; einen Tag sp&#228;ter ver&#246;ffentlichte xAI den kompletten Grok-Build-Code &#8212; 844.530 Zeilen Rust &#8212; als Open Source unter Apache 2.0, nachdem es die automatische Daten&#252;bertragung per Server-Flag deaktiviert hatte. Der problematische Upload-Code selbst blieb im Quellbaum stehen.</p><p><strong>Cursor f&#252;hrte Code aus, ohne zu fragen &#8212; und schwieg dann.</strong> Sicherheitsforscher Aaron Portnoy (Mindgard) deckte am 14. Juli auf, dass Cursor eine <code>git.exe</code> im Repo-Root ausf&#252;hrt, ohne vorher zu fragen &#8212; seit Dezember 2025 gemeldet, aber von HackerOne als &#8222;out of scope&#8221; eingestuft. Cursor hatte den Fehler bereits am 13. Juli still gepatcht, ohne Sicherheitshinweis, CVE-Nummer (die standardisierte Kennung f&#252;r &#246;ffentlich erfasste Schwachstellen) oder Versionsangabe &#8212; &#246;ffentlich bekannt wurde das erst am 17. Juli, durch Presseanfragen. Schweigend zu patchen ist kaum transparenter als gar nicht zu patchen.</p><p><strong>Claude folgte Links, die es nicht h&#228;tte folgen sollen.</strong> Sicherheitsforscher Ayush Paul zeigte bereits am 9. Juli, dass Claudes <code>web_fetch</code>-Werkzeug &#252;ber verkettete Honeypot-Links (pr&#228;parierte K&#246;der-URLs, die das Weiterklick-Verhalten des Modells testen) Nutzerdaten wie Namen, Wohnort und Arbeitgeber ausleiten konnte. Anthropic best&#228;tigte, das Problem intern bereits gekannt, aber noch nicht behoben zu haben, und entzog dem Modell die F&#228;higkeit, Links auf bereits abgerufenen Seiten zu folgen &#8212; eine Bug-Bounty-Zahlung erfolgte nicht.</p><p>Zwei Gegenbewegungen: Diese Woche wurde bekannt, dass Codex die Prompts zwischen Haupt- und Unteragenten bereits seit Juni verschl&#252;sselt &#8212; eine Vorabma&#223;nahme gegen Prompt-Lecks in Multi-Agent-Ketten, deren Nebenwirkung auf die Audit-Lesbarkeit gerade erst &#246;ffentlich diskutiert wird. Und Cloudflare bringt mit &#8222;Precursor&#8221; eine Verhaltenserkennung, die Menschen &#252;ber eine ganze Session hinweg anhand von Maus- und Tastaturmustern von Agenten unterscheidet.</p><p><strong>Warum das relevant ist:</strong> Datenexfiltration, unautorisierte Ausf&#252;hrung und ausufernde Tool-Rechte sind dieselben Kategorien wie in den Wochen zuvor, nur diesmal bei drei unabh&#228;ngigen Anbietern innerhalb knapp einer Woche. Nach der Agentjacking-Ausweitung und #014s GhostApproval- und GitLost-Befunden ist das die dritte Woche in Folge mit einem substanziellen Agentic-Permission-Vorfall &#8212; inzwischen ein Muster, kein Ausrei&#223;er.</p><div><hr></div><h2>Googles teuerstes Coding-Problem</h2><p>Am 16. Juli berichtet Bloomberg, dass Google sein Flaggschiff-Modell Gemini 3.5 Pro verschiebt &#8212; Monate hinter dem eigenen Zeitplan, weil die Coding-F&#228;higkeiten hinter den internen Zielen zur&#252;ckbleiben. Ende Juni hatte Google die Trainingsdaten angepasst, um genau das zu verbessern; das Ergebnis entt&#228;uschte laut Bericht auch danach. Die schw&#228;chere Flash-Variante war bereits im Mai auf der I/O-Konferenz vorgestellt worden, mit Juni als Zieltermin f&#252;r die Pro-Version &#8212; der Termin ist seither verstrichen, ohne neuen Zeitplan.</p><p>Pikant: Google-Ingenieure sollen intern verst&#228;rkt KI-gest&#252;tzt entwickeln, sto&#223;en dabei aber laut Bericht auf Kapazit&#228;tsengp&#228;sse, weil die eigene Rechenleistung unternehmensweit umk&#228;mpft ist. Die Nachricht kostete Alphabet rund 200 Milliarden Dollar Marktkapitalisierung &#8212; ein Einbruch, der zeigt, wie unmittelbar Investoren Coding-F&#228;higkeit inzwischen als Wettbewerbsindikator lesen.</p><p><strong>Warum das relevant ist:</strong> Sonnet 5, Opus 4.8 und GPT-5.6 haben die Messlatte f&#252;r Coding-Qualit&#228;t in den letzten Monaten mehrfach angehoben &#8212; und Google f&#228;llt bei genau dieser Messlatte zur&#252;ck, w&#228;hrend die eigenen Ingenieure die Konkurrenzmodelle im Alltag im Blick haben. Der Markt bepreist das nicht als Verz&#246;gerung, sondern als R&#252;ckstand.</p><div><hr></div><h2>Die Kapitalmarkt-Woche</h2><p>Drei Bewegungen und ein unbest&#228;tigtes Ger&#252;cht zeigen, wie viel Geld gerade in Richtung Agentic Coding flie&#223;t.</p><p><strong>Anthropics IPO-Roadshow beginnt.</strong> Seit dem 15. Juli sondieren Goldman Sachs, JPMorgan und Morgan Stanley Investorennachfrage vor der formellen Roadshow &#8212; ein &#246;ffentlicher S-1-Antrag (die B&#246;rsenzulassungs-Unterlage f&#252;r US-B&#246;rseng&#228;nge) wird f&#252;r August oder September erwartet, Preisfestsetzung im Oktober oder November, Nasdaq als Ziel. Die Bewertung bleibt bei 965 Milliarden Dollar aus der Serie-H-Runde vom Mai; parallel verhandelt Anthropic &#252;ber eine Ausweitung seiner bislang 2,5 Milliarden Dollar schweren Kreditlinien.</p><p><strong>Ode with Anthropic geht offiziell an den Start.</strong> Das im Mai gegr&#252;ndete Joint Venture &#8212; Anthropic, Blackstone, Hellman &amp; Friedman und Goldman Sachs, 1,5 Milliarden Dollar &#8212; soll Unternehmen bei der praktischen Einf&#252;hrung von KI-Agenten begleiten. Ode-Chef Chris Taylor:</p><blockquote><p>&#8222;It&#8217;s pretty easy to imagine this as a trillion-dollar company someday if we execute well.&#8221;</p></blockquote><p>Sinngem&#228;&#223;: Es sei leicht vorstellbar, dass daraus bei guter Ausf&#252;hrung eines Tages ein Billionen-Dollar-Unternehmen wird.</p><p><strong>Databricks erh&#246;ht seine Bewertung auf 188 Milliarden Dollar</strong> (Coatue-Runde, +40 % gegen&#252;ber Februar), und das AI-Coding-Startup <strong>Emergent wird zum Unicorn</strong> &#8212; 1,5 Milliarden Dollar Bewertung, versus 300 Millionen Dollar im Januar, bei 120 Millionen Dollar Jahresumsatz und &#252;ber 200.000 zahlenden Kunden. Am Rand, unbest&#228;tigt: Laut New York Times verhandelt Meta, Anthropic f&#252;r bis zu 10 Milliarden Dollar Rechenkapazit&#228;t zu vermieten &#8212; beide Seiten &#228;u&#223;erten sich nicht, ein fr&#252;hes Stadium ohne Zusage.</p><p><strong>Warum das relevant ist:</strong> Nach der Compute- und Governance-Woche der letzten Ausgabe liefert diese Woche die ersten konkreten Kapitalmarkt-Termine &#8212; das Geld, das in Agentic Coding flie&#223;t, &#252;bersetzt sich in Fristen und Bewertungen statt in blo&#223;e Ank&#252;ndigungen.</p><div><hr></div><h2>Claude Code: Die Highlights der Woche</h2><p><strong>F&#252;r Sicherheits- und Team-Admins</strong></p><ul><li><p><strong>v2.1.214 behebt mehrere reale Permission-Byp&#228;sse</strong> (Windows PowerShell 5.1, Bash-Umleitungsformen, Zsh-Vergleiche, Docker-Daemon-Flags) und bringt <code>EndConversation</code>: Claude kann eine Session bei Jailbreak-Versuchen selbst beenden &#8212; ein Verhalten, das claude.ai schon seit 2025 kennt.</p></li><li><p><strong>Budget-Grenzen f&#252;r Sessions</strong> &#8212; v2.1.212 begrenzt WebSearch-Aufrufe und Subagent-Spawns pro Session (Standard je 200), verschiebt lange MCP-Tool-Aufrufe automatisch in den Hintergrund, und <code>/fork</code> startet direkt eine Hintergrund-Session.</p></li></ul><p><strong>F&#252;r alle, die Claude Code t&#228;glich nutzen</strong></p><ul><li><p><strong>Sandbox-Browser in der Desktop-App</strong> &#8212; eigenes Browser-Profil ohne gespeicherte Logins, Schreibaktionen laufen durch einen Klassifizierer. Erg&#228;nzt &#8222;Claude in Chrome GA&#8221; aus #013 um eine Desktop-eingebettete Variante.</p></li><li><p><strong>Kleinere Nachz&#252;gler:</strong> Login-Expiry-Warnung, erweitertes Auto-Allow f&#252;r <code>git push</code>, Namensreservierung &#8222;Claude Browser&#8221;.</p></li></ul><div><hr></div><h2>Agentic Coding</h2><ul><li><p><strong>GitHub automatisiert Sicherheits-Fixes.</strong> &#8222;Agentic Autofix for Code Scanning Alerts&#8221; (Public Preview) l&#228;sst einen Agenten CodeQL-Alerts eigenst&#228;ndig beheben &#8212; Erkundung, Fix, Re-Validierung, Draft-PR in zwei bis vier Minuten. Ein Gegenpol zu den drei Vorf&#228;llen oben: Der eine Anbieter automatisiert Absicherung, w&#228;hrend anderswo L&#252;cken entstehen.</p></li><li><p><strong>Cursor baut in Richtung Slack aus</strong> &#8212; Plan-Vorschau vor Arbeitsbeginn, Multi-Repo-Support, kanal&#252;bergreifende Workflows.</p></li><li><p><strong>Cline liefert im Wochentakt</strong> &#8212; die Haupt-Extension v4.0.9 bringt GPT-5.6-Support, CLI v3.0.43 automatisches Vertrauen des Betriebssystem-Zertifikatsspeichers (Corporate-Proxy-Setups).</p></li><li><p><strong>Copilot legt eine Sicherheitswoche nach</strong> &#8212; Visual-Studio-Juni-Update, erweitertes BYOK f&#252;r JetBrains, KI-Sicherheits-Erkennungen direkt in Pull Requests.</p></li></ul><div><hr></div><h2>Trend der Woche: Was ein Agent wirklich kostet &#8212; und wer die Kontrolle beh&#228;lt</h2><p>Zwei methodisch saubere Kostenmessungen, ein neuer Fachbegriff und ein Kontrapunkt landen in derselben Woche &#8212; zusammen ein Bild davon, wie teuer Autonomie wirklich ist und wer am Ende daf&#252;r geradesteht.</p><p><strong>Die Zahlen.</strong> Systima misst per Logging-Proxy: Claude Code verbraucht rund 33.000 Tokens, bevor der erste Prompt &#252;berhaupt verarbeitet wird &#8212; 4,7-mal mehr als das Konkurrenzwerkzeug OpenCode, vor allem wegen eines deutlich l&#228;ngeren System-Prompts; Subagent-Delegation treibt die Gesamtkosten einer Aufgabe auf mehr als das Vierfache. Databricks kommt auf der eigenen Multi-Millionen-Zeilen-Codebase zu einem verwandten Befund: GLM 5.2 erreicht die Qualit&#228;t von Opus 4.8 bei zwei Dritteln der Kosten, w&#228;hrend Sonnet 5 trotz g&#252;nstigerem Token-Preis teurer pro Aufgabe ist als Opus, weil es mehr Kontext verbraucht. G&#252;te pro Dollar h&#228;ngt offenbar st&#228;rker vom Werkzeug drumherum ab als vom Modellpreis selbst.</p><p><strong>Der neue Begriff.</strong> Gergely Orosz nennt das, was sich daraus ergibt, &#8222;Loop Engineering&#8221; &#8212; die bewusste Gestaltung des Kreislaufs aus Planen, Ausf&#252;hren und Pr&#252;fen, nicht nur des einzelnen Prompts. Boris Cherny, der bei Anthropic Claude Code leitet, bringt es auf den Punkt: Er prompte Claude nicht mehr, sein Job sei es, Loops zu schreiben.</p><p><strong>Der Kontrapunkt.</strong> Andrew Kelley, Sch&#246;pfer der Programmiersprache Zig, legt beim Bun-Rewrite aus der letzten Ausgabe nach: The Register betitelt seine ausf&#252;hrlichere Fassung &#8222;unreviewed slop&#8221;; seine Frage, wie eine Test-Suite unbeaufsichtigten Rust-Code pr&#252;fen soll, wenn sie schon Bugs im urspr&#252;nglichen Zig-Code &#252;bersehen hat, bleibt unbeantwortet. Ray Myers versch&#228;rft in einem eigenen Beitrag: Er selbst habe mit einem hybriden Ansatz 50 Bugs in der Zig-Version von Bun gefunden &#8212; reines KI-Vorgehen reiche eben nicht. Simon Willison zieht die Grenze grunds&#228;tzlicher: Mit Verweis auf ein IBM-Zitat von 1979 &#8212; ein Computer k&#246;nne nie zur Verantwortung gezogen werden, d&#252;rfe deshalb nie eine Management-Entscheidung treffen &#8212; muss Verantwortung strukturell menschlich bleiben, unabh&#228;ngig vom Autonomiegrad.</p><p>Wie wenig diese Grenze in der Praxis gezogen wird, zeigt eine Studie von SAP und Oxford Economics unter 2.600 F&#252;hrungskr&#228;ften: Nur elf Prozent halten ihre eigene Governance f&#252;r ausreichend, 57 Prozent haben keinen Human-Oversight-Prozess f&#252;r agentische Workflows, 71 Prozent nutzen ungenehmigte &#8222;Schatten-KI&#8221;. Ein Gegenbeispiel zeigt, dass die Frage l&#246;sbar ist: Fields-Medaillist Terence Tao portierte binnen Stunden zwei Dutzend Java-Applets aus dem Jahr 1999 mit einem Coding-Agenten nach JavaScript und fand zwei bislang unbekannte Bugs im Original &#8212; betont aber, dass alle High-Level-Design-Entscheidungen bei ihm blieben, nur die Low-Level-Syntax beim Agenten.</p><p><strong>Warum das relevant ist:</strong> Wer Loop Engineering betreibt, wie Systima und Databricks es vorrechnen, spart Geld. Wer dabei gleichzeitig die Verantwortung abgibt, wie die SAP-Studie es f&#252;r die Mehrheit der Unternehmen beschreibt, spart am falschen Ende.</p><div><hr></div><h2>Tipp der Woche</h2><p>Claude Code kann seit einigen Versionen ein zweites, st&#228;rkeres Modell als &#8222;Advisor&#8221; (Berater) hinzuziehen: Das Hauptmodell konsultiert es an Entscheidungspunkten &#8212; vor einem Ansatzwechsel, bei wiederkehrenden Fehlern, vor Abschluss einer Aufgabe. Aktivierbar &#252;ber <code>/advisor</code>, die Einstellung <code>advisorModel</code> oder das Flag <code>--advisor</code>; das Hauptmodell entscheidet selbst, wann es fragt.</p><p><em>Mein Fazit:</em> Viele Aufgaben brauchen gar kein Top-Modell &#8212; das spart sp&#252;rbar Kosten und Zeit, und bei Bedarf springt automatisch ein st&#228;rkeres Modell ein, bei mir meist von Sonnet 5 zu Opus 4.8. Was fehlt: Transparenz dar&#252;ber, wann und warum genau eskaliert wird.</p><p><em>Warum das hier steht:</em> Der Advisor ist die eingebaute Antwort auf ein Muster, das hier schon als manueller Tipp lief &#8212; ein starkes Modell entscheidet die Richtung, ein g&#252;nstigeres f&#252;hrt aus. Jetzt &#252;bernimmt Claude Code die Eskalations-Entscheidung selbst.</p><div><hr></div><h2>Kurz notiert</h2><ul><li><p><strong>Bundestags-Gutachten: Open-Source-First bei &#246;ffentlicher Beschaffung ist vergaberechtlich zul&#228;ssig</strong> &#8212; die Wissenschaftlichen Dienste best&#228;tigen, dass sich Beh&#246;rden in Ausschreibungen auf Open-Source-Software festlegen d&#252;rfen. Peter Ganten (Vorsitzender, Open Source Business Alliance): &#8222;Das Gutachten macht unmissverst&#228;ndlich klar, dass &#246;ffentliche Stellen sich in ihren Ausschreibungen auf Open-Source-Software festlegen k&#246;nnen.&#8221;</p></li><li><p><strong>Nur 0,7 % der Stellenanzeigen der &#246;ffentlichen Verwaltung nennen KI-Kompetenz</strong> &#8212; Privatwirtschaft 1,5 %, 43 % der Landkreise ganz ohne KI-Stellenanzeige (IW K&#246;ln, 13 Mio. ausgewertete Anzeigen).</p></li><li><p><strong>Tom Blomfield (Mitgr&#252;nder Monzo) wechselt zu Anthropics Compute-Team</strong> &#8212; nimmt daf&#252;r eine Auszeit als Group Partner bei Y Combinator, arbeitet k&#252;nftig mit Compute-Chef Tom Brown zusammen.</p></li><li><p><strong>DeepSeek strebt 74-Milliarden-Dollar-Bewertung an</strong> &#8212; nur Wochen nachdem die erste externe Finanzierungsrunde (Tencent/CATL) das Unternehmen bereits auf rund 63 Mrd. $ bewertet hatte, plus Vorbereitung f&#252;r einen B&#246;rsengang an Shanghais STAR Market.</p></li></ul><div><hr></div><p><strong>Das war Agentic Weekly #015.</strong> Danke f&#252;rs Lesen &#8212; die n&#228;chste Ausgabe kommt am Samstag, 25. Juli 2026.</p><p>Hinter Agentic Weekly steckt <a href="https://fluxum.net/#about">Martin Gross</a>: w&#246;chentlich ein kompakter, meinungsstarker &#220;berblick zu Agentic Engineering, Agentic Coding und Claude Code.</p><p>Hat dir die Ausgabe gefallen? Leite sie gerne weiter oder empfiehl den Newsletter. </p><div><hr></div><h2>Quellen</h2><p><strong>Drei Anbieter, drei Sicherheitsl&#252;cken, eine Woche:</strong> <a href="https://simonwillison.net/2026/Jul/15/grok-build/">Simon Willison &#8212; xai-org/grok-build now open source</a> &#183; <a href="https://gist.github.com/cereblab/dc9a40bc26120f4540e4e09b75ffb547">Cereblab Gist &#8212; wire-level analysis</a> &#183; <a href="https://x.ai/news/grok-build-open-source">x.ai &#8212; Grok Build is now open source</a> &#183; <a href="https://www.techtimes.com/articles/320420/20260714/grok-build-shipped-entire-codebases-xai-cloud-privacy-toggle-did-nothing.htm">TechTimes &#8212; privacy toggle did nothing</a> &#183; <a href="https://mindgard.ai/blog/cursor-0day-when-full-disclosure-becomes-the-only-protection-left">Mindgard &#8212; Cursor 0day</a> &#183; <a href="https://www.darkreading.com/application-security/cursor-ide-malicious-code-poisoned-repos">Dark Reading &#8212; Cursor IDE Auto-Executes Malicious Code in Poisoned Repos</a> &#183; <a href="https://www.ayush.digital/blog/the-memory-heist">Ayush Paul &#8212; The Memory Heist</a> &#183; <a href="https://github.com/openai/codex/issues/28058">GitHub &#8212; openai/codex#28058</a> &#183; <a href="https://blog.cloudflare.com/introducing-precursor/">Cloudflare &#8212; Introducing Precursor</a></p><p><strong>Googles teuerstes Coding-Problem:</strong> <a href="https://www.bloomberg.com/news/articles/2026-07-16/google-gemini-launch-delayed-as-tech-falls-short-of-internal-goals">Bloomberg &#8212; Google Gemini Launch Delayed</a> &#183; <a href="https://www.cnbc.com/2026/07/16/alphabet-stock-gemini-3-5-pro-ai.html">CNBC &#8212; Alphabet shares fall on Gemini delay</a></p><p><strong>Die Kapitalmarkt-Woche:</strong> <a href="https://www.startuphub.ai/ai-news/ipo-watch/2026/anthropic-ipo-roadshow-begins-2026-07-16">CNBC/startuphub.ai &#8212; Anthropic IPO roadshow begins</a> &#183; <a href="https://www.investing.com/news/stock-market-news/anthropics-2026-ipo-credit-lines-investor-meetings-and-an-october-target-93CH-4795782">Investing.com &#8212; Anthropic 2026 IPO</a> &#183; <a href="https://cryptobriefing.com/anthropic-targets-ipo-by-october-2026-after-965b-valuation/">CryptoBriefing &#8212; Anthropic targets IPO by October 2026</a> &#183; <a href="https://techcrunch.com/2026/07/15/anthropic-blackstone-bet-the-next-trillion-dollar-ai-business-is-implementation-not-models/">TechCrunch &#8212; Ode with Anthropic</a> &#183; <a href="https://www.bloomberg.com/news/articles/2026-07-17/coatue-leads-databricks-funding-round-at-188-billion-valuation">Bloomberg &#8212; Databricks $188B</a> &#183; <a href="https://techcrunch.com/2026/07/15/indian-ai-coding-startup-emergent-becomes-a-unicorn-just-over-a-year-after-launch/">TechCrunch &#8212; Emergent becomes a unicorn</a> &#183; <a href="https://www.dealstreetasia.com/stories/emergent-unicorn-489228">DealStreetAsia &#8212; Emergent</a> &#183; <a href="https://www.cnbc.com/2026/07/17/anthropic-meta-ai-compute.html">CNBC &#8212; Anthropic in early talks with Meta</a> &#183; <a href="https://www.bloomberg.com/news/articles/2026-07-17/meta-in-talks-to-sell-computing-power-to-anthropic-nyt-reports">Bloomberg &#8212; Meta in Talks to Sell Computing Power to Anthropic</a></p><p><strong>Claude Code:</strong> <a href="https://code.claude.com/docs/en/changelog">Changelog</a> &#183; <a href="https://the-decoder.de/claude-code-bekommt-integrierten-browser-direkt-in-der-desktop-app/">the-decoder.de &#8212; Claude Code Browser</a></p><p><strong>Agentic Coding:</strong> <a href="https://github.blog/changelog/2026-07-10-agentic-autofix-for-code-scanning-alerts-in-public-preview/">GitHub Changelog &#8212; Agentic Autofix</a> &#183; <a href="https://cursor.com/changelog">Cursor Changelog</a> &#183; <a href="https://github.com/cline/cline/releases">Cline Releases</a> &#183; <a href="https://github.blog/changelog/">GitHub Blog Changelog</a></p><p><strong>Trend der Woche:</strong> <a href="https://systima.ai/blog/claude-code-vs-opencode-token-overhead">Systima &#8212; Claude Code vs OpenCode token overhead</a> &#183; <a href="https://www.databricks.com/blog/benchmarking-coding-agents-databricks-multi-million-line-codebase">Databricks Engineering &#8212; Benchmarking Coding Agents</a> &#183; <a href="https://newsletter.pragmaticengineer.com/p/what-is-loop-engineering">Pragmatic Engineer &#8212; What is loop engineering?</a> &#183; <a href="https://www.theregister.com/devops/2026/07/14/zig-creator-calls-buns-claude-rust-rewrite-unreviewed-slop/5270743">The Register &#8212; Zig creator calls Bun&#8217;s rewrite unreviewed slop</a> &#183; <a href="https://andrewkelley.me/post/my-thoughts-bun-rust-rewrite.html">Andrew Kelley &#8212; My thoughts on the Bun Rust rewrite</a> &#183; <a href="https://raymyers.org/post/zig-creator-calls-spade-a-spade">Ray Myers &#8212; Zig Creator Calls Spade a Spade</a> &#183; <a href="https://simonwillison.net/2026/Jul/12/">Simon Willison &#8212; Directly Responsible Individuals</a> &#183; <a href="https://www.heise.de/news/KI-in-Unternehmen-Rendite-steigt-Kontrolle-hinkt-hinterher-11368492.html">heise &#8212; SAP Value of AI Report</a> &#183; <a href="https://terrytao.wordpress.com/2026/07/11/old-and-new-apps-via-modern-coding-agents/">Terence Tao &#8212; Old and new apps via modern coding agents</a></p><p><strong>Tipp der Woche:</strong> <a href="https://code.claude.com/docs/en/advisor">Claude Code Docs &#8212; Escalate hard decisions with the advisor tool</a></p><p><strong>Kurz notiert:</strong> <a href="https://osb-alliance.de/pressemitteilungen/bundestags-gutachten-schafft-klarheit-open-source-first-ist-vergaberechtlich-zulaessig">OSBA &#8212; Bundestags-Gutachten schafft Klarheit</a> &#183; <a href="https://hasepost.de/studie-oeffentliche-verwaltung-verpasst-anschluss-bei-ki-stellenanzeigen-732556/">HASEPOST &#8212; Studie: &#214;ffentliche Verwaltung verpasst Anschluss</a> &#183; <a href="https://sifted.eu/articles/anthropic-monzo-founder-tom-blomfield">Sifted &#8212; Anthropic recruits Tom Blomfield</a> &#183; <a href="https://techfundingnews.com/monzo-co-founder-tom-blomfield-takes-leave-from-y-combinator-to-join-anthropic/">techfundingnews.com &#8212; Tom Blomfield</a> &#183; <a href="https://www.bloomberg.com/news/articles/2026-07-14/deepseek-mulls-new-funding-weeks-after-7-billion-round-ft-says">Bloomberg &#8212; DeepSeek mulls new funding</a> &#183; <a href="https://techstartups.com/2026/07/15/deepseek-eyes-74-billion-valuation-in-new-funding-round-ahead-of-planned-ipo/">techstartups.com &#8212; DeepSeek $74B valuation</a></p><div><hr></div><p></p><div class="subscription-widget-wrap-editor" data-attrs="{&quot;url&quot;:&quot;https://blog.fluxum.net/subscribe?&quot;,&quot;text&quot;:&quot;Abonnieren&quot;,&quot;language&quot;:&quot;de&quot;}" data-component-name="SubscribeWidgetToDOM"><div class="subscription-widget show-subscribe"><div class="preamble"><p class="cta-caption">fluxum engineering ist eine von Leser unterst&#252;tzte Publikation. Um neue Posts zu erhalten und meine Arbeit zu unterst&#252;tzen, ziehen Sie in Betracht, ein Free- oder Paid-Abonnent zu werden.</p></div><form class="subscription-widget-subscribe"><input type="email" class="email-input" name="email" placeholder="E-Mail-Adresse eingeben &#8230;" tabindex="-1"><input type="submit" class="button primary" value="Abonnieren"><div class="fake-input-wrapper"><div class="fake-input"></div><div class="fake-button"></div></div></form></div></div>]]></content:encoded></item><item><title><![CDATA[Agentic Weekly #014 — 64 Agenten, ein Rewrite in elf Tagen]]></title><description><![CDATA[In elf Tagen schreiben 64 Agenten den Kern von Bun von Zig auf Rust um &#8212; der bislang konkreteste Beleg, wie weit agentische Autonomie in der Praxis reicht.]]></description><link>https://blog.fluxum.net/p/agentic-weekly-014-64-agenten-ein</link><guid isPermaLink="false">https://blog.fluxum.net/p/agentic-weekly-014-64-agenten-ein</guid><dc:creator><![CDATA[Martin Gross]]></dc:creator><pubDate>Sun, 12 Jul 2026 16:38:57 GMT</pubDate><enclosure url="https://substackcdn.com/image/fetch/$s_!X_fL!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F0c1e858c-d7ce-465f-a71d-64ff66c582b5_1600x900.png" length="0" type="image/jpeg"/><content:encoded><![CDATA[<p><strong>In elf Tagen schreiben 64 Agenten den Kern von Bun von Zig auf Rust um &#8212; der bislang konkreteste Beleg, wie weit agentische Autonomie in der Praxis reicht. Dazu eine Compute- und Governance-Woche bei Anthropic, GPT-5.6 wird g&#252;nstiger und breit verf&#252;gbar, w&#228;hrend Fable 5 zum Aufpreis wird, gleich f&#252;nf Sicherheitsbefunde auf einmal &#8212; und Deutschland bekommt sein KI-Gesetz.</strong></p><ol start="12"><li><p>Juli 2026 &#183; Lesezeit ~10 Min.</p></li></ol><div class="captioned-image-container"><figure><a class="image-link image2 is-viewable-img" target="_blank" href="https://substackcdn.com/image/fetch/$s_!X_fL!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F0c1e858c-d7ce-465f-a71d-64ff66c582b5_1600x900.png" data-component-name="Image2ToDOM"><div class="image2-inset"><picture><source type="image/webp" srcset="https://substackcdn.com/image/fetch/$s_!X_fL!,w_424,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F0c1e858c-d7ce-465f-a71d-64ff66c582b5_1600x900.png 424w, https://substackcdn.com/image/fetch/$s_!X_fL!,w_848,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F0c1e858c-d7ce-465f-a71d-64ff66c582b5_1600x900.png 848w, https://substackcdn.com/image/fetch/$s_!X_fL!,w_1272,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F0c1e858c-d7ce-465f-a71d-64ff66c582b5_1600x900.png 1272w, https://substackcdn.com/image/fetch/$s_!X_fL!,w_1456,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F0c1e858c-d7ce-465f-a71d-64ff66c582b5_1600x900.png 1456w" sizes="100vw"><img src="https://substackcdn.com/image/fetch/$s_!X_fL!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F0c1e858c-d7ce-465f-a71d-64ff66c582b5_1600x900.png" width="1456" height="819" data-attrs="{&quot;src&quot;:&quot;https://substack-post-media.s3.amazonaws.com/public/images/0c1e858c-d7ce-465f-a71d-64ff66c582b5_1600x900.png&quot;,&quot;srcNoWatermark&quot;:null,&quot;fullscreen&quot;:null,&quot;imageSize&quot;:null,&quot;height&quot;:819,&quot;width&quot;:1456,&quot;resizeWidth&quot;:null,&quot;bytes&quot;:557093,&quot;alt&quot;:null,&quot;title&quot;:null,&quot;type&quot;:&quot;image/png&quot;,&quot;href&quot;:null,&quot;belowTheFold&quot;:false,&quot;topImage&quot;:true,&quot;internalRedirect&quot;:&quot;https://blog.fluxum.net/i/206718230?img=https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F0c1e858c-d7ce-465f-a71d-64ff66c582b5_1600x900.png&quot;,&quot;isProcessing&quot;:false,&quot;align&quot;:null,&quot;offset&quot;:false}" class="sizing-normal" alt="" srcset="https://substackcdn.com/image/fetch/$s_!X_fL!,w_424,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F0c1e858c-d7ce-465f-a71d-64ff66c582b5_1600x900.png 424w, https://substackcdn.com/image/fetch/$s_!X_fL!,w_848,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F0c1e858c-d7ce-465f-a71d-64ff66c582b5_1600x900.png 848w, https://substackcdn.com/image/fetch/$s_!X_fL!,w_1272,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F0c1e858c-d7ce-465f-a71d-64ff66c582b5_1600x900.png 1272w, https://substackcdn.com/image/fetch/$s_!X_fL!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F0c1e858c-d7ce-465f-a71d-64ff66c582b5_1600x900.png 1456w" sizes="100vw" fetchpriority="high"></picture><div class="image-link-expand"><div class="pencraft pc-display-flex pc-gap-8 pc-reset"><button tabindex="0" type="button" class="pencraft pc-reset pencraft icon-container restack-image"><svg role="img" width="20" height="20" viewBox="0 0 20 20" fill="none" stroke-width="1.5" stroke="var(--color-fg-primary)" stroke-linecap="round" stroke-linejoin="round" xmlns="http://www.w3.org/2000/svg"><g><title></title><path d="M2.53001 7.81595C3.49179 4.73911 6.43281 2.5 9.91173 2.5C13.1684 2.5 15.9537 4.46214 17.0852 7.23684L17.6179 8.67647M17.6179 8.67647L18.5002 4.26471M17.6179 8.67647L13.6473 6.91176M17.4995 12.1841C16.5378 15.2609 13.5967 17.5 10.1178 17.5C6.86118 17.5 4.07589 15.5379 2.94432 12.7632L2.41165 11.3235M2.41165 11.3235L1.5293 15.7353M2.41165 11.3235L6.38224 13.0882"></path></g></svg></button><button tabindex="0" type="button" class="pencraft pc-reset pencraft icon-container view-image"><svg xmlns="http://www.w3.org/2000/svg" width="20" height="20" viewBox="0 0 24 24" fill="none" stroke="currentColor" stroke-width="2" stroke-linecap="round" stroke-linejoin="round" class="lucide lucide-maximize2 lucide-maximize-2"><polyline points="15 3 21 3 21 9"></polyline><polyline points="9 21 3 21 3 15"></polyline><line x1="21" x2="14" y1="3" y2="10"></line><line x1="3" x2="10" y1="21" y2="14"></line></svg></button></div></div></div></a></figure></div><p></p><div class="subscription-widget-wrap-editor" data-attrs="{&quot;url&quot;:&quot;https://blog.fluxum.net/subscribe?&quot;,&quot;text&quot;:&quot;Abonnieren&quot;,&quot;language&quot;:&quot;de&quot;}" data-component-name="SubscribeWidgetToDOM"><div class="subscription-widget show-subscribe"><div class="preamble"><p class="cta-caption">fluxum engineering ist eine von Leser unterst&#252;tzte Publikation. Um neue Posts zu erhalten und meine Arbeit zu unterst&#252;tzen, ziehen Sie in Betracht, ein Free- oder Paid-Abonnent zu werden.</p></div><form class="subscription-widget-subscribe"><input type="email" class="email-input" name="email" placeholder="E-Mail-Adresse eingeben &#8230;" tabindex="-1"><input type="submit" class="button primary" value="Abonnieren"><div class="fake-input-wrapper"><div class="fake-input"></div><div class="fake-button"></div></div></form></div></div><h2>Bun in elf Tagen von Zig auf Rust &#8212; mit 64 Agenten parallel</h2><p>Jarred Sumner, Kopf hinter der JavaScript-Runtime <strong>Bun</strong>, hat den Kern seines Projekts in elf Tagen von der Systemsprache Zig auf Rust umgeschrieben &#8212; nicht von Hand, sondern mit Claude Code und einer Vorabversion von <strong>Claude Fable 5</strong>, Anthropics Spitzenmodell. Simon Willison hat den Bericht aufgegriffen; die Zahlen sind der Grund f&#252;r die Wellen.</p><p><strong>6.502 Commits, 5,9 Milliarden Input-Tokens, bis zu rund 64 parallel arbeitende Agenten</strong> &#8212; am Ende 60.624 gr&#252;ne Tests bei 1,39 Millionen einzelnen Pr&#252;fungen. Es ist die bislang gr&#246;&#223;te &#246;ffentlich mit Zahlen belegte agentische Umschreibung eines produktiven Open-Source-Projekts (auf Hacker News &#252;ber 750 Punkte).</p><p>Die sch&#228;rfste Gegenstimme kommt einen Tag sp&#228;ter von <strong>Andrew Kelley</strong>, dem Sch&#246;pfer von Zig: Der Wechsel sei gar kein Sprachproblem gewesen. Bun habe Zig nicht verlassen, weil die Sprache technisch nicht getaugt h&#228;tte, sondern weil die Beziehung zwischen Projekt und Sprach-&#214;kosystem nicht funktioniert habe &#8212; ein Management-Problem, kein technisches.</p><p><strong>Warum das relevant ist:</strong> Die Frage aus #013 &#8212; nicht <em>ob</em>, sondern <em>wie viel</em> Autonomie &#8212; bekommt hier ihren konkretesten Praxisbeleg. Und Kelleys Einwand h&#228;lt die Geschichte ehrlich: Die Agenten haben die Flei&#223;arbeit gel&#246;st; die Entscheidung, &#252;berhaupt umzuschreiben, traf ein Mensch aus Gr&#252;nden, die mit Rust wenig zu tun hatten.</p><div><hr></div><h2>Claude Code: Die Highlights der Woche</h2><p><strong>F&#252;r alle, die Claude Code t&#228;glich nutzen</strong></p><ul><li><p><code>/doctor</code><strong> wird zum vollst&#228;ndigen Setup-Checkup</strong> &#8212; <code>v2.1.205</code> macht aus der Diagnose einen vollst&#228;ndigen Setup-Checkup, <code>v2.1.206</code> erg&#228;nzt den Vorschlag, eine aufgebl&#228;hte <code>CLAUDE.md</code> zu k&#252;rzen. Dazu ein sichtbares Manual-Mode-Badge, und <code>/review</code> kehrt zum schnellen Single-Pass zur&#252;ck (der Multi-Agent-Review bleibt unter <code>/code-review</code>).</p></li></ul><p><strong>F&#252;r CI/CD und Plattform-Betrieb</strong></p><ul><li><p><strong>Auto Mode ohne Opt-in auf den gro&#223;en Cloud-Plattformen</strong> &#8212; <code>v2.1.207</code> (am Erscheinungstag dieser Ausgabe) aktiviert den Auto Mode (in dem Claude selbst entscheidet, welche Aktionen ohne R&#252;ckfrage durchlaufen) standardm&#228;&#223;ig ohne Opt-in auf Amazon Bedrock, Google Vertex AI und Microsoft Foundry; auf Bedrock, Vertex und der Claude Platform on AWS wechselt zugleich das Default-Modell auf Opus 4.8. Im selben Release ein Fix gegen Shell-Injection &#252;ber Plugin-Hooks, Monitors und den MCP-<code>headersHelper</code> (MCP = Model Context Protocol, der Standard, &#252;ber den Agenten externe Tools anbinden).</p></li></ul><div><hr></div><h2>Agentic Coding</h2><ul><li><p><strong>Codex CLI wird an GPT-5.6 gekoppelt.</strong> v0.143 bis v0.144.1 aktivieren Remote-Plugins (&#252;ber einen npm-Marktplatz) standardm&#228;&#223;ig, bringen eine Amazon-Bedrock-Anbindung f&#252;r die neuen GPT-5.6-Modelle und einen <code>writes</code>-Freigabemodus, der Lese- und Schreibrechte trennt.</p></li><li><p><strong>Cursor 3.11</strong> bringt &#8222;Side Chats&#8221; &#8212; parallele Nebenchats neben der Hauptkonversation &#8212; plus Volltextsuche &#252;ber Agent-Transkripte. Inkrementell, kein Paradigmenwechsel.</p></li><li><p><strong>Amp &#8222;Agents Anywhere&#8221;.</strong> Sourcegraphs Amp startet Remote-Agenten jetzt auf beliebigen Maschinen (Laptop, Server, Cloud, Raspberry Pi) und bringt einen Headless-Runner (<code>amp --no-tui</code>). Dieselbe Bewegung wie Claude Codes Hintergrund-Agenten: Agenten laufen &#252;berall, nicht nur in der IDE.</p></li></ul><div><hr></div><h2>Anthropics Compute- und Governance-Woche</h2><p>Zwei echte Juli-Ereignisse zeigen, wie Anthropic seine Rechen- und Governance-Basis vor dem geplanten B&#246;rsengang verbreitert. Am <strong>6. Juli</strong> unterzeichnet der Bitcoin-Miner <strong>TeraWulf</strong> einen 20-Jahres-Vertrag mit Anthropic &#252;ber den &#8222;Justified Data&#8221;-Campus in Hawesville, Kentucky: rund <strong>401 MW IT-Last</strong>, Vertragswert etwa <strong>19 Mrd. $</strong>, Kapazit&#228;t ab der zweiten Jahresh&#228;lfte 2027.</p><p>Am <strong>9. Juli</strong> tritt <strong>Ben Bernanke</strong> dem Long-Term Benefit Trust bei &#8212; der Stiftung, die Anthropics Governance gegen kurzfristigen Investorendruck absichern soll. Dass der fr&#252;here Fed-Vorsitzende und Wirtschaftsnobelpreistr&#228;ger von 2022 dort einzieht, ist ein deutliches Signal Richtung Wirtschafts- und Regierungsn&#228;he.</p><p>Der Kontext dazu stammt aus dem Juni: das bereits Anfang Juni angek&#252;ndigte <strong>35-Mrd.-$-Finanzierungspaket</strong> von Apollo und Blackstone, dessen Debt-Tranchen jetzt in den Handel gehen &#8212; eine Zweckgesellschaft kauft damit Google-TPUs (Googles KI-Beschleuniger-Chips) und verleast sie an Anthropic. Und <strong>SemiAnalysis</strong> sch&#228;tzt Anthropics Profit im dritten Quartal 2026 auf &#252;ber <strong>1 Mrd. $</strong> &#8212; in einer Analyse, die Claude Code als einen der Wachstumstreiber nennt.</p><p><strong>Warum das relevant ist:</strong> Rechenzentren, Kapital und Governance-Namen werden vor dem IPO gleichzeitig aufgebaut &#8212; und SemiAnalysis liefert erstmals eine belastbare Profit-Sch&#228;tzung f&#252;r diese Phase.</p><div><hr></div><h2>GPT-5.6 wird allgemein verf&#252;gbar &#8212; und Fable 5 wird zum Aufpreis</h2><p>Zwei Preisbewegungen in derselben Woche, in entgegengesetzte Richtung.</p><p><strong>Die Preisantwort.</strong> Nach zwei Wochen Limited Preview &#8212; zun&#228;chst nur f&#252;r rund zwanzig Partner &#8212; schaltet OpenAI am <strong>9. Juli</strong> die <strong>GPT-5.6-Familie (Sol, Terra, Luna)</strong> allgemein frei, gleichzeitig in Codex, ChatGPT, der API und GitHub Copilot (mit Admin-Opt-in). Die Preise, gestaffelt nach Modell: <strong>Sol 5 $ / 30 $, Terra 2,50 $ / 15 $, Luna 1 $ / 6 $</strong> pro Million Tokens. Neu sind Programmatic Tool Calling (der Aufruf von Werkzeugen direkt aus dem generierten Code) und konfigurierbare Reasoning-Effort-Stufen &#8212; ein aggressiver Zug gegen Sonnet 5.</p><p><strong>Der Konter.</strong> Anthropic geht den umgekehrten Weg: Der Zugang zu <strong>Fable 5</strong>, bislang in den zahlenden Claude-Pl&#228;nen enthalten (auch in Claude Code), wird auf nutzungsbasierte Credits umgestellt &#8212; zum regul&#228;ren GA-Tarif von <strong>10 $ / 50 $ pro Million Tokens</strong>, dem Preis, zu dem Fable 5 im Juni startete. Neu ist nicht die Zahl, sondern das Modell: aus &#8222;im Plan enthalten&#8221; wird &#8222;extra bezahlt&#8221;. Der urspr&#252;ngliche Stichtag 7. Juli wurde nach deutlichem Nutzer-Backlash auf den <strong>12./13. Juli verschoben</strong>.</p><p><strong>Warum das relevant ist:</strong> OpenAI macht sein Frontier-Modell billiger und breiter, Anthropic seins teurer und exklusiver. F&#252;r Teams, die auf Fable 5 setzen, hei&#223;t das: neu rechnen.</p><div><hr></div><h2>Chinas Backdoor-Vorwurf gegen Claude Code</h2><p>Die Linie aus #012 (Alibaba-Distillation-Vorwurf) und #013 (R&#252;ckbau der Steganographie-Marker) bekommt ihre n&#228;chste Wendung &#8212; mit umgekehrten Vorzeichen. Am <strong>8. Juli</strong> wirft Chinas National Vulnerability Database Claude Code eine <strong>&#8222;Sicherheits-Backdoor&#8221;</strong> vor: Die Versionen <strong>2.1.91 bis 2.1.196</strong> h&#228;tten ohne Zustimmung Standortdaten erfasst. Alibaba <strong>verbietet seinen Mitarbeitenden seit dem 10. Juli die Nutzung von Claude Code</strong> und stellt intern auf das eigene Werkzeug Qoder um.</p><p>Anthropic widerspricht. Thariq Shihipar aus dem Claude-Code-Team ordnet das, was China als Backdoor liest, als jenes Experiment ein, das im M&#228;rz gegen Account-Missbrauch und Distillation (das Nachtrainieren eines eigenen Modells auf den Ausgaben eines fremden) eingebaut und im Juli wieder entfernt wurde:</p><blockquote><p>&#8222;This is an experiment we launched in March that was meant to prevent account abuse from unauthorized resellers and protect against distillation.&#8221;</p></blockquote><p>Sinngem&#228;&#223;: ein Experiment gegen Account-Missbrauch durch nicht autorisierte Wiederverk&#228;ufer und gegen Distillation.</p><p><strong>Warum das relevant ist:</strong> Was Anthropic als Schutz gegen chinesische Distillation baute, liest China als &#220;berwachung &#8212; und derselbe Akteur, dem Anthropic im Juni den gr&#246;&#223;ten bekannten Distillation-Angriff vorwarf, begr&#252;ndet damit einen Bann.</p><div><hr></div><h2>Coding-Agenten &amp; MCP: eine Sicherheits-Woche</h2><p>Selten trafen so viele Befunde zu Agenten-Sicherheit in eine Woche. F&#252;nf, die die Zielgruppe direkt betreffen:</p><ul><li><p><strong>GhostApproval</strong> (Wiz, via iX/heise, 9. Juli) &#8212; &#252;ber manipulierte Repository-Symlinks (Verweise, die im Dateisystem auf eine andere Datei zeigen) lassen sich Coding-Agenten dazu bringen, Dateien au&#223;erhalb ihrer Sandbox zu lesen, etwa SSH-Schl&#252;ssel. Betroffen quer durch die Branche: <strong>Claude Code, Amazon Q Developer, Augment, Cursor, Google Antigravity und Windsurf.</strong> Patches liegen f&#252;r Amazon Q, Antigravity und Cursor vor, f&#252;r Augment und Windsurf noch nicht.</p></li><li><p><strong>GitLost</strong> (Noma Security) &#8212; eine pr&#228;parierte, &#246;ffentliche GitHub-Issue bringt GitHubs Agentic Workflows dazu, private Repo-Inhalte ohne Authentifizierung als &#246;ffentlichen Kommentar preiszugeben. Security Research Lead bei Noma Security, Sasi Levi, bringt die neue Qualit&#228;t auf den Punkt: <em>&#8222;GitLost is about manipulating what an agent does with its permissions.&#8221;</em> &#8212; es geht nicht mehr darum, was ein Agent <em>sagt</em>, sondern was er mit seinen Rechten <em>tut</em>. Die Fortsetzung der &#8222;Agentjacking&#8221;-Serie der letzten Wochen &#8212; Angriffe, die einen Agenten &#252;ber eine manipulierte Tool-Anbindung kapern.</p></li><li><p><strong>&#8222;Friendly Fire&#8221;</strong> &#8212; ein PoC (Machbarkeitsnachweis) des AI Now Institute: Scannen Claude Codes Auto Mode oder Codex&#8217; Auto-Review nicht vertrauensw&#252;rdigen Fremdcode, l&#228;sst sich der Pr&#252;fvorgang so pr&#228;parieren, dass der Agent den Angreifer-Code ausf&#252;hrt, statt ihn nur zu pr&#252;fen.</p></li><li><p><strong>Die Breitendaten:</strong> Eine Analyse von 9.695 &#246;ffentlichen MCP-Servern findet <strong>4.982 Sicherheitsprobleme in 2.259 Servern</strong> &#8212; vor allem willk&#252;rlichen Dateizugriff, DoS und Command Injection. Popularit&#228;t sch&#252;tzt nicht.</p></li><li><p><strong>Die Gegenma&#223;nahme:</strong> Claude Code <code>v2.1.205</code> blockiert im Auto Mode Manipulationen an den Session-Transkript-Dateien und markiert Background-Benachrichtigungen jetzt ausdr&#252;cklich als &#8222;kein Mensch hat zugestimmt&#8221; &#8212; direkte Antwort auf vorget&#228;uschte In-Transcript-Freigaben.</p></li></ul><div><hr></div><h2>Die Woche der Souver&#228;nit&#228;ts-Ansage</h2><p>Gleich drei Bewegungen bei Regulierung und digitaler Souver&#228;nit&#228;t &#8212; eine davon f&#228;llt auf den Tag vor dieser Ausgabe.</p><p><strong>Br&#252;ssel.</strong> Am <strong>7. Juli</strong> stellt Henna Virkkunen, Exekutiv-Vizepr&#228;sidentin der EU-Kommission f&#252;r technologische Souver&#228;nit&#228;t, Sicherheit und Demokratie, den <strong>EU Action Plan on Cybersecurity and Artificial Intelligence</strong> vor &#8212; laut heise ein Neun-Punkte-Plan gegen k&#252;nftige KI-Modell-Sperren durch Drittstaaten, mit einem &#8222;European blueprint&#8221; f&#252;r strukturierten Zugang bis Ende 2026. Die Kommission verweist dabei auf ein bereits im Juni vorgestelltes, separates Programm &#252;ber <strong>200 Mrd. &#8364;</strong> f&#252;r KI-Gigafactories.</p><p><strong>Berlin.</strong> Am <strong>10. Juli</strong> &#8212; dem Tag vor Erscheinen dieser Ausgabe &#8212; billigt der Bundesrat das <strong>KI-Durchf&#252;hrungsgesetz</strong> endg&#252;ltig, ohne Vermittlungsausschuss. Die Bundesnetzagentur (BNetzA) wird damit zentrale KI-Markt&#252;berwachungsbeh&#246;rde in Deutschland. Flankierend liegt der Community-Draft des BSI (Bundesamt f&#252;r Sicherheit in der Informationstechnik) vor: der modulare Pr&#252;fkatalog &#8222;A5&#8221; zur Bewertung vertrauensw&#252;rdiger KI, auf Basis des maschinenlesbaren Katalogformats OSCAL, Kommentierung bis 31. August.</p><p><strong>Der Realit&#228;tscheck.</strong> Das deutsche Vorzeigeprojekt hakt: Die <strong>Fusion von Aleph Alpha und Cohere verz&#246;gert sich deutlich</strong> &#8212; offen sind Personal&#252;bernahme, F&#252;hrungsstruktur und Schutzrechte f&#252;r die Bundesregierung. Und das Berliner Startup <strong>Langdock</strong> steht wegen eines &#8222;Delaware-Flips&#8221; in der Kritik &#8212; die deutsche GmbH wird &#252;ber eine US-Delaware-Corporation kontrolliert, eine bei US-Investoren und YC-Startups &#252;bliche Struktur, was Kritiker dennoch als Widerspruch zum eigenen Souver&#228;nit&#228;ts-Anspruch lesen.</p><p><strong>Warum das relevant ist:</strong> Die zuletzt abstrakte Souver&#228;nit&#228;ts-Debatte ist konkret geworden &#8212; mit Gesetzestext, Pr&#252;fkatalog und Aktionsplan. Und zugleich zeigt sich, wie schwer die Umsetzung f&#228;llt, wenn selbst die Vorzeigeprojekte an Struktur- und Kapitalfragen h&#228;ngen.</p><div><hr></div><h2>Trend der Woche: Der Job wandert in den Outer Loop</h2><p>Addy Osmani setzt seine Autonomy-Levels-Reihe fort &#8212; <strong>&#8222;Own the Outer Loop&#8221;</strong>. Die Kernthese: Agenten &#252;bernehmen den <em>Inner Loop</em> (die Ausf&#252;hrung), Menschen behalten den <em>Outer Loop</em> &#8212; Verifikation, Freigabe, Verantwortung. Nicht blind akzeptieren, was der Agent liefert, sondern pr&#252;fbar machen. Der Bun-Rewrite oben ist die Illustration: viele Agenten im Inner Loop, ein Mensch, der die Richtung entscheidet.</p><p>Einen Datenpunkt dazu liefert Anthropic selbst: Mit der Ausweitung von <strong>Claude Cowork</strong> (Anthropics Werkzeug f&#252;r asynchrone Team-Aufgaben, bislang Desktop-only) auf Web, iOS und Android zeigen Nutzungsdaten aus 1,2 Millionen Sessions, dass <strong>&#252;ber 90 % der Cowork-Nutzung nicht Coding ist</strong>, sondern Business Ops und Content. Der Coder ist l&#228;ngst nicht die einzige Zielgruppe agentischer Werkzeuge.</p><p>Aus der Gegenrichtung ein Nachbeben: Der Godot-KI-Bann war kein Einzelfall. Hackaday ordnet &#228;hnliche Regeln bei <strong>Mesa</strong>, <strong>NetBSD</strong> (KI-Code gilt als &#8222;tainted&#8221;, also nicht vertrauensw&#252;rdig) und im <strong>Linux-Kernel</strong> (Offenlegungspflicht f&#252;r KI-Tools) ein. Verantwortung l&#228;sst sich nicht an einen Agenten delegieren.</p><div><hr></div><h2>Tipp der Woche</h2><p><strong>sqlite-utils 4.0 &#8212; gr&#246;&#223;tenteils von Claude Fable geschrieben</strong> (Simon Willison, 5. Juli). Willison lie&#223; das Stable-Release seines beliebten SQLite-Werkzeugs weitgehend von Fable schreiben: 37 Prompts, 34 Commits f&#252;r den Release-Kandidaten, Gesamtkosten rund <strong>149,25 $</strong>. Bemerkenswert ist nicht der Preis, sondern der Fund: Fable identifizierte f&#252;nf eigenst&#228;ndige Release-Blocker, darunter einen Datenverlust-Bug in <code>delete_where()</code>, den Willison selbst &#252;bersehen hatte.</p><p><em>Warum das hier steht:</em> &#214;ffentlich nachvollziehbare Kosten- <em>und</em> Qualit&#228;tszahlen f&#252;r einen realen Produktionsrelease sind selten &#8212; und sie treffen genau die Frage hinter der Fable-Preisdebatte dieser Woche: Was kostet ein Release wirklich, und was ist die Arbeit wert, die der Agent &#252;bernimmt?</p><div><hr></div><h2>Kurz notiert</h2><ul><li><p><strong>Fidji Simo verl&#228;sst OpenAI</strong> (9. Juli) &#8212; Die seit Mai 2025 als CEO of Applications amtierende Simo gibt die Vollzeitrolle wegen einer chronischen Erkrankung ab und wird Teilzeit-Beraterin; ihre Aufgaben teilen sich President Greg Brockman, CFO Sarah Friar und Chief Strategy Officer Jason Kwon.</p></li><li><p><strong>Anthropic baut den Public-Sector-Zugang aus</strong> &#8212; Teresa Carlson wird erste Global Head of Public Sector, zuvor in Public-Sector-F&#252;hrungsrollen bei Microsoft (Federal Sales), AWS (globaler Public-Sector-Bereich) und Splunk (President and Chief Growth Officer).</p></li><li><p><strong>Prime Intellect</strong> sammelt <strong>130 Mio. $ Series A</strong> bei 1 Mrd. $ Bewertung ein (Lead: Radical Ventures) &#8212; Enterprise-Tools f&#252;r eigene KI-Agenten, 100 Mio. $ ARR, Kunden wie Ramp und Zapier.</p></li><li><p><strong>Sanders&#8217; Staatsbeteiligungs-Forderung bekommt neue Aktualit&#228;t</strong> &#8212; Bernie Sanders&#8217; bereits am 18. Juni eingebrachte Forderung nach 50 % Staatsbeteiligung an gro&#223;en KI-Firmen r&#252;ckt durch OpenAIs 5-%-Angebot an Washington wieder in den Fokus &#8212; auch wenn sie zwei Wochen davor datiert und damit kein Konter darauf ist.</p></li><li><p><strong>ACCC pr&#252;ft SpaceX/Cursor</strong> &#8212; Australiens Wettbewerbsbeh&#246;rde nimmt die 60-Mrd.-$-&#220;bernahme von Anysphere durch SpaceX unter die Lupe.</p></li></ul><div><hr></div><h2>Quellen</h2><p><strong>Bun in elf Tagen von Zig auf Rust:</strong> <a href="https://simonwillison.net/2026/Jul/8/rewriting-bun-in-rust/">Simon Willison &#8212; Rewriting Bun in Rust</a> &#183; <a href="https://bun.com/blog/bun-in-rust">Bun &#8212; Bun in Rust</a> &#183; <a href="https://andrewkelley.me/post/my-thoughts-bun-rust-rewrite.html">Andrew Kelley &#8212; My thoughts on the Bun Rust rewrite</a></p><p><strong>Claude Code:</strong> <a href="https://code.claude.com/docs/en/changelog">Changelog</a></p><p><strong>Agentic Coding:</strong> <a href="https://learn.chatgpt.com/docs/changelog">Codex Changelog</a> &#183; <a href="https://cursor.com/changelog">Cursor Changelog</a> &#183; <a href="https://releasebot.io/updates/ampcode">Ampcode Updates</a></p><p><strong>Anthropics Compute- und Governance-Woche:</strong> <a href="https://www.coindesk.com/markets/2026/07/06/bitcoin-miner-terawulf-soars-on-a-usd19-billion-ai-data-center-lease-with-anthropic">CoinDesk &#8212; TeraWulf $19B Lease</a> &#183; <a href="https://www.anthropic.com/news/ben-bernanke">Anthropic &#8212; Ben Bernanke joins the LTBT</a> &#183; <a href="https://finance.yahoo.com/sectors/technology/articles/apollo-wraps-35-billion-debt-210229236.html">Yahoo/Bloomberg &#8212; Apollo $35B Debt Package</a> &#183; <a href="https://newsletter.semianalysis.com/p/anthropic-3q26-profit-over-1b-the">SemiAnalysis &#8212; Anthropic 3Q26 Profit Over $1B</a></p><p><strong>GPT-5.6 &amp; Fable 5:</strong> <a href="https://developers.openai.com/api/docs/changelog">OpenAI API Changelog</a> &#183; <a href="https://www.marktechpost.com/2026/07/09/openai-releases-gpt-5-6-a-three-tier-model-family-with-programmatic-tool-calling/">MarkTechPost &#8212; GPT-5.6 three-tier family</a> &#183; <a href="https://www.forbes.com/sites/sandycarter/2026/07/07/claude-fable-5-extends-by-five-more-days-10-moves-to-make-now/">Forbes &#8212; Fable 5 credits</a> &#183; <a href="https://www.androidauthority.com/anthropic-claude-fable-5-credits-usage-july-3684840/">Android Authority &#8212; usage-based Fable 5</a></p><p><strong>Chinas Backdoor-Vorwurf:</strong> <a href="https://www.cnbc.com/2026/07/08/china-anthropic-ai-claude-code-backdoor-security-threat.html">CNBC &#8212; China calls Claude Code a backdoor</a> &#183; <a href="https://www.cbsnews.com/news/china-security-backdoor-anthropic-ai-coding-tool/">CBS News</a> &#183; <a href="https://tech.yahoo.com/ai/claude/articles/alibaba-bans-employees-using-anthropics-131053680.html">Yahoo Tech &#8212; Alibaba bans Claude Code</a></p><p><strong>Coding-Agenten &amp; MCP:</strong> <a href="https://www.heise.de/news/Schwachstelle-in-Coding-Agenten-Zugriff-auf-beliebige-Dateien-ueber-Symlinks-11358849.html">heise &#8212; Schwachstelle in Coding-Agenten &#252;ber Symlinks</a> &#183; <a href="https://noma.security/blog/gitlost-how-we-tricked-githubs-ai-agent-into-leaking-private-repos/">Noma Security &#8212; GitLost</a> &#183; <a href="https://thehackernews.com/2026/07/friendly-fire-ai-agents-built-to-catch.html">The Hacker News &#8212; Friendly Fire</a> &#183; <a href="https://cybersecuritynews.com/security-issues-mcp-servers/">Cyber Security News &#8212; 4.982 Issues in 2.259 MCP Servers</a></p><p><strong>Die Woche der Souver&#228;nit&#228;ts-Ansage:</strong> <a href="https://digital-strategy.ec.europa.eu/en/news/commission-presents-eu-action-plan-cybersecurity-and-artificial-intelligence">EU-Kommission &#8212; EU Action Plan on Cybersecurity and AI</a> &#183; <a href="https://www.heise.de/news/Nicht-nur-aussereuropaeische-Loesungen-EU-will-KI-Sperren-vorbeugen-11358285.html">heise &#8212; EU will KI-Sperren vorbeugen</a> &#183; <a href="https://www.bundesrat.de/DE/plenum/bundesrat-kompakt/26/1067/1067-pk.html">Bundesrat &#8212; Plenarsitzung 10.7.2026</a> &#183; <a href="https://www.heise.de/en/news/Trustworthiness-of-AI-systems-BSI-publishes-draft-catalog-11356202.html">heise &#8212; BSI publishes draft catalog</a> &#183; <a href="https://hasepost.de/fusion-von-aleph-alpha-und-cohere-verzoegert-sich-deutlich-728770/">HASEPOST &#8212; Aleph Alpha &#215; Cohere verz&#246;gert sich</a> &#183; <a href="https://www.businessinsider.de/gruenderszene/warum-deutschlands-ki-hoffnung-langdock-in-den-usa-sitzt/">Business Insider DE &#8212; Langdock Delaware-Flip</a></p><p><strong>Trend der Woche:</strong> <a href="https://addyo.substack.com/p/own-the-outer-loop">Addy Osmani &#8212; Own the Outer Loop</a> &#183; <a href="https://techcrunch.com/2026/07/07/the-coding-agent-wars-are-spilling-into-the-rest-of-the-office-claude-cowork/">TechCrunch &#8212; Claude Cowork</a> &#183; <a href="https://hackaday.com/2026/07/03/godots-new-contributing-policy-adds-barriers-for-ai-slop/">Hackaday &#8212; Godot&#8217;s New Contributing Policy</a></p><p><strong>Tipp der Woche:</strong> <a href="https://simonwillison.net/2026/jul/5/sqlite-utils-fable/">Simon Willison &#8212; sqlite-utils 4.0 mostly written by Claude Fable</a></p><p><strong>Kurz notiert:</strong> <a href="https://techcrunch.com/2026/07/09/fidji-simo-steps-down-from-openais-no-2-role/">TechCrunch &#8212; Fidji Simo steps down</a> &#183; <a href="https://www.nextgov.com/people/2026/07/anthropic-taps-teresa-calrson-public-sector-lead/414604/">Nextgov &#8212; Anthropic taps Teresa Carlson</a> &#183; <a href="https://techcrunch.com/2026/07/08/prime-intellect-raises-130m-series-a-to-help-enterprises-build-their-own-ai-agents/">TechCrunch &#8212; Prime Intellect $130M</a> &#183; <a href="https://www.cnbc.com/2026/07/02/openai-proposes-us-government-own-5percent-stake-to-address-political-blowback.html">CNBC &#8212; OpenAI proposes US 5% stake</a> &#183; <a href="https://www.mlex.com/mlex/dealrisk/articles/2495897">MLex &#8212; SpaceX-Anysphere ACCC review</a></p><div><hr></div><p><strong>Das war Agentic Weekly #014.</strong> Danke f&#252;rs Lesen &#8212; die n&#228;chste Ausgabe kommt am Samstag, 18. Juli 2026.</p><p>Hinter Agentic Weekly steckt <a href="https://fluxum.net/#about">Martin Gross</a>: w&#246;chentlich ein kompakter, meinungsstarker &#220;berblick zu Agentic Engineering, Agentic Coding und Claude Code.</p><p>Hat dir die Ausgabe gefallen? Leite sie gerne weiter oder empfiehl den Newsletter. Fragen, Anmerkungen oder Kritik? Antworte einfach auf diese Mail oder hinterlasse einen Kommentar.</p><blockquote><p><strong>Noch kein Abo?</strong></p><p>Jede Woche die vollst&#228;ndige Ausgabe mit allen Quellen, direkt in dein Postfach.</p><p><a href="https://blog.fluxum.net/s/agentic-weekly">Auf blog.fluxum.net abonnieren</a></p></blockquote><div class="subscription-widget-wrap-editor" data-attrs="{&quot;url&quot;:&quot;https://blog.fluxum.net/subscribe?&quot;,&quot;text&quot;:&quot;Abonnieren&quot;,&quot;language&quot;:&quot;de&quot;}" data-component-name="SubscribeWidgetToDOM"><div class="subscription-widget show-subscribe"><div class="preamble"><p class="cta-caption">fluxum engineering ist eine von Leser unterst&#252;tzte Publikation. Um neue Posts zu erhalten und meine Arbeit zu unterst&#252;tzen, ziehen Sie in Betracht, ein Free- oder Paid-Abonnent zu werden.</p></div><form class="subscription-widget-subscribe"><input type="email" class="email-input" name="email" placeholder="E-Mail-Adresse eingeben &#8230;" tabindex="-1"><input type="submit" class="button primary" value="Abonnieren"><div class="fake-input-wrapper"><div class="fake-input"></div><div class="fake-button"></div></div></form></div></div>]]></content:encoded></item><item><title><![CDATA[Agentic Weekly #013 — Der Staat greift nach den Modellen]]></title><description><![CDATA[Fable 5 ist zur&#252;ck, GPT-5.6 kommt nur f&#252;r zwanzig Auserw&#228;hlte, und OpenAI bietet Washington eine f&#252;nfprozentige Beteiligung an &#8212; in einer Woche wird sichtbar, wie eng Frontier-KI und Regierung inzwischen verwoben sind.]]></description><link>https://blog.fluxum.net/p/agentic-weekly-013-der-staat-greift</link><guid isPermaLink="false">https://blog.fluxum.net/p/agentic-weekly-013-der-staat-greift</guid><dc:creator><![CDATA[Martin Gross]]></dc:creator><pubDate>Sun, 05 Jul 2026 21:49:39 GMT</pubDate><enclosure url="https://substackcdn.com/image/fetch/$s_!NDlk!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F54b1dfb5-fb44-4c6f-975b-14c98ad46522_1600x900.png" length="0" type="image/jpeg"/><content:encoded><![CDATA[<div class="captioned-image-container"><figure><a class="image-link image2 is-viewable-img" target="_blank" href="https://substackcdn.com/image/fetch/$s_!NDlk!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F54b1dfb5-fb44-4c6f-975b-14c98ad46522_1600x900.png" data-component-name="Image2ToDOM"><div class="image2-inset"><picture><source type="image/webp" srcset="https://substackcdn.com/image/fetch/$s_!NDlk!,w_424,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F54b1dfb5-fb44-4c6f-975b-14c98ad46522_1600x900.png 424w, https://substackcdn.com/image/fetch/$s_!NDlk!,w_848,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F54b1dfb5-fb44-4c6f-975b-14c98ad46522_1600x900.png 848w, https://substackcdn.com/image/fetch/$s_!NDlk!,w_1272,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F54b1dfb5-fb44-4c6f-975b-14c98ad46522_1600x900.png 1272w, https://substackcdn.com/image/fetch/$s_!NDlk!,w_1456,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F54b1dfb5-fb44-4c6f-975b-14c98ad46522_1600x900.png 1456w" sizes="100vw"><img src="https://substackcdn.com/image/fetch/$s_!NDlk!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F54b1dfb5-fb44-4c6f-975b-14c98ad46522_1600x900.png" width="1456" height="819" data-attrs="{&quot;src&quot;:&quot;https://substack-post-media.s3.amazonaws.com/public/images/54b1dfb5-fb44-4c6f-975b-14c98ad46522_1600x900.png&quot;,&quot;srcNoWatermark&quot;:null,&quot;fullscreen&quot;:null,&quot;imageSize&quot;:null,&quot;height&quot;:819,&quot;width&quot;:1456,&quot;resizeWidth&quot;:null,&quot;bytes&quot;:565410,&quot;alt&quot;:null,&quot;title&quot;:null,&quot;type&quot;:&quot;image/png&quot;,&quot;href&quot;:null,&quot;belowTheFold&quot;:false,&quot;topImage&quot;:true,&quot;internalRedirect&quot;:&quot;https://blog.fluxum.net/i/205417337?img=https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F54b1dfb5-fb44-4c6f-975b-14c98ad46522_1600x900.png&quot;,&quot;isProcessing&quot;:false,&quot;align&quot;:null,&quot;offset&quot;:false}" class="sizing-normal" alt="" srcset="https://substackcdn.com/image/fetch/$s_!NDlk!,w_424,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F54b1dfb5-fb44-4c6f-975b-14c98ad46522_1600x900.png 424w, https://substackcdn.com/image/fetch/$s_!NDlk!,w_848,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F54b1dfb5-fb44-4c6f-975b-14c98ad46522_1600x900.png 848w, https://substackcdn.com/image/fetch/$s_!NDlk!,w_1272,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F54b1dfb5-fb44-4c6f-975b-14c98ad46522_1600x900.png 1272w, https://substackcdn.com/image/fetch/$s_!NDlk!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F54b1dfb5-fb44-4c6f-975b-14c98ad46522_1600x900.png 1456w" sizes="100vw" fetchpriority="high"></picture><div class="image-link-expand"><div class="pencraft pc-display-flex pc-gap-8 pc-reset"><button tabindex="0" type="button" class="pencraft pc-reset pencraft icon-container restack-image"><svg role="img" width="20" height="20" viewBox="0 0 20 20" fill="none" stroke-width="1.5" stroke="var(--color-fg-primary)" stroke-linecap="round" stroke-linejoin="round" xmlns="http://www.w3.org/2000/svg"><g><title></title><path d="M2.53001 7.81595C3.49179 4.73911 6.43281 2.5 9.91173 2.5C13.1684 2.5 15.9537 4.46214 17.0852 7.23684L17.6179 8.67647M17.6179 8.67647L18.5002 4.26471M17.6179 8.67647L13.6473 6.91176M17.4995 12.1841C16.5378 15.2609 13.5967 17.5 10.1178 17.5C6.86118 17.5 4.07589 15.5379 2.94432 12.7632L2.41165 11.3235M2.41165 11.3235L1.5293 15.7353M2.41165 11.3235L6.38224 13.0882"></path></g></svg></button><button tabindex="0" type="button" class="pencraft pc-reset pencraft icon-container view-image"><svg xmlns="http://www.w3.org/2000/svg" width="20" height="20" viewBox="0 0 24 24" fill="none" stroke="currentColor" stroke-width="2" stroke-linecap="round" stroke-linejoin="round" class="lucide lucide-maximize2 lucide-maximize-2"><polyline points="15 3 21 3 21 9"></polyline><polyline points="9 21 3 21 3 15"></polyline><line x1="21" x2="14" y1="3" y2="10"></line><line x1="3" x2="10" y1="21" y2="14"></line></svg></button></div></div></div></a></figure></div><p><strong>Fable 5 ist zur&#252;ck, GPT-5.6 kommt nur f&#252;r zwanzig Auserw&#228;hlte, und OpenAI bietet Washington eine f&#252;nfprozentige Beteiligung an &#8212; in einer Woche wird sichtbar, wie eng Frontier-KI und Regierung inzwischen verwoben sind. Dazu ein neues Standardmodell zum halben Preis, mit Sternchen, und eine Open-Source-Stiftung, die zu alldem laut Nein sagt.</strong></p><ol start="4"><li><p>Juli 2026 &#183; Lesezeit ~7 Min.</p></li></ol><h2>Der Staat und die Frontier-Modelle</h2><p>Der Bogen, der sich seit Ausgabe #010 &#252;ber drei Wochen zog, schlie&#223;t sich: <strong>Fable 5 und Mythos 5 sind wieder freigeschaltet.</strong> Am 1. Juli hat Anthropic beide Modelle neu ausgerollt, nachdem die US-Regierung die am 12. Juni verh&#228;ngte Exportkontrolle am 30. Juni aufgehoben hatte &#8212; per Brief von Handelsminister Howard Lutnick, nicht per Pr&#228;sidentenerlass.</p><div class="subscription-widget-wrap-editor" data-attrs="{&quot;url&quot;:&quot;https://blog.fluxum.net/subscribe?&quot;,&quot;text&quot;:&quot;Abonnieren&quot;,&quot;language&quot;:&quot;de&quot;}" data-component-name="SubscribeWidgetToDOM"><div class="subscription-widget show-subscribe"><div class="preamble"><p class="cta-caption">fluxum engineering ist eine von Leser unterst&#252;tzte Publikation. Um neue Posts zu erhalten und meine Arbeit zu unterst&#252;tzen, ziehen Sie in Betracht, ein Free- oder Paid-Abonnent zu werden.</p></div><form class="subscription-widget-subscribe"><input type="email" class="email-input" name="email" placeholder="E-Mail-Adresse eingeben &#8230;" tabindex="-1"><input type="submit" class="button primary" value="Abonnieren"><div class="fake-input-wrapper"><div class="fake-input"></div><div class="fake-button"></div></div></form></div></div><p>Der Preis der R&#252;ckkehr ist ein Rahmen. Anthropic ver&#246;ffentlicht die Freigabe zusammen mit einem <strong>Jailbreak Severity Framework</strong> &#8212; einem Schema, das die Schwere eines &#8222;Jailbreaks&#8221; (einer Umgehung der Modell-Schutzmechanismen) an vier Kriterien misst: dem F&#228;higkeitszuwachs, dessen Breite, wie leicht er sich f&#252;r einen Angriff nutzen l&#228;sst, und der Auffindbarkeit. Dazu kommt ein neuer Safety-Classifier gegen genau die von Amazon gemeldete Technik &#8212; Forscher hatten Fable 5 per Jailbreak dazu gebracht, Software-Schwachstellen aufzusp&#252;ren und in einem Fall Code zu schreiben, der zeigt, wie sich eine davon ausnutzen lie&#223;e. Denselben Prompt beantworten laut Anthropic auch schw&#228;chere Modelle wie Opus 4.8 oder GPT-5.5, weshalb man von routinem&#228;&#223;iger Defensive-Security-Arbeit spricht, nicht von einer versteckten Superf&#228;higkeit. Der Classifier blockt die Technik nach Anthropics Angaben in &#252;ber 99 % der F&#228;lle. Mythos 5, die st&#228;rkere Variante, bleibt auf eine Reihe US-Organisationen beschr&#228;nkt. Lutnick dazu: <em>&#8222;I have determined that appropriate safeguards are in place to permit certain trusted partners to access the Claude Mythos 5 Model.&#8221;</em> &#8212; man habe, so der Handelsminister, angemessene Schutzvorkehrungen festgestellt, um bestimmten vertrauensw&#252;rdigen Partnern Zugang zu Mythos 5 zu gew&#228;hren.</p><p><strong>Zwei Labs, ein Muster.</strong> Es ist nicht bei Anthropic geblieben. Wenige Tage zuvor zeigte OpenAI eine erste Vorschau der <strong>GPT-5.6-Familie (Sol, Terra, Luna)</strong> &#8212; und zwar auf Wunsch der US-Regierung zun&#228;chst nur f&#252;r rund zwanzig &#8222;trusted partner&#8221;-Organisationen, mit Verweis auf nationale Sicherheit. Wo das Regierungsmuster Fable erst nach dem Rollout traf und zur&#252;ckdrehte, trifft es den n&#228;chsten gro&#223;en Launch schon pr&#228;ventiv. Aus dem Einzelfall wird ein Verfahren.</p><p><strong>Und der Staat will mehr als das T&#252;rschloss.</strong> In derselben Woche berichtet die Financial Times, OpenAI habe der US-Regierung angeboten, <strong>5 % am Unternehmen zu &#252;bernehmen</strong> &#8212; bei einer Bewertung von 852 Mrd. $ (Rekordrunde im M&#228;rz) entspricht das rund 42,6 Mrd. $. Sam Altman wirbt f&#252;r ein Modell nach dem Vorbild des Alaska Permanent Fund, jenes Fonds, der Alaskas &#214;l-Einnahmen als j&#228;hrliche Dividende an die Einwohner aussch&#252;ttet &#8212; jedes f&#252;hrende US-KI-Labor solle denselben Eigenkapitalanteil einbringen. Die Gespr&#228;che mit Trump, Lutnick und Finanzminister Scott Bessent gelten als &#8222;konzeptuell&#8221;; ein Vollzug br&#228;uchte wom&#246;glich ein Gesetz des Kongresses.</p><p>Drei Bewegungen, ein Befund: Der Staat gibt beim einen Anbieter ein Modell frei, h&#228;lt beim anderen den n&#228;chsten Launch klein &#8212; und will sich an ebendiesem beteiligen. Frontier-KI ist in Washington von der regulierten Branche zum strategischen Aktivposten geworden &#8212; Zugang ist zur Verhandlungsmasse und Beteiligung zur Option geworden. F&#252;r alle, die auf diesen Modellen bauen, hei&#223;t das: Verf&#252;gbarkeit ist keine rein technische Gr&#246;&#223;e mehr.</p><div><hr></div><h2>Sonnet 5: das neue Standardmodell &#8212; mit Sternchen</h2><p>Am 30. Juni hat Anthropic <strong>Claude Sonnet 5</strong> gestartet und zum Standardmodell f&#252;r Free- und Pro-Nutzer gemacht. Native 1M Token Kontext, ein Einf&#252;hrungspreis von <strong>2 $ / 10 $ pro Million Tokens</strong> (Ein- und Ausgabe) bis zum 31. August, danach <strong>3 $ / 15 $</strong>. TechCrunch fasst den Launch als &#8222;cheaper way to run agents&#8221; &#8212; den g&#252;nstigeren Weg, Agenten laufen zu lassen.</p><p>Das Sternchen liefert Simon Willison. Er zeigt, dass der neue Tokenizer &#8212; der Baustein, der Text in die abgerechneten Tokens zerlegt &#8212; rund <strong>30 % mehr Tokens pro Text</strong> erzeugt: der reale Preis liegt beim <strong>1,42-fachen f&#252;r englischen Text</strong> und beim <strong>1,28-fachen f&#252;r Python-Code</strong>. Der Rabatt schrumpft, sobald man ihn gegen die tats&#228;chliche Abrechnungseinheit h&#228;lt.</p><p>Und der Praxistest f&#228;llt verhalten aus. Katie Parrott vom Every-Team fasst ihren &#8222;Vibe Check&#8221; so zusammen: Sonnet 5 k&#246;nne kompetent entwerfen, coden und analysieren &#8212; aber <em>&#8222;every use case has a cheaper, faster, or smarter alternative.&#8221;</em> F&#252;r jeden Anwendungsfall gebe es etwas Billigeres, Schnelleres oder Kl&#252;geres. Ein g&#252;nstigeres Default hei&#223;t nicht automatisch das beste Default.</p><div><hr></div><h2>Anthropic zieht die geheimen Marker aus Claude Code</h2><p>Leiser, aber symboltr&#228;chtig: Anthropic <strong>entfernt die Steganographie-Marker aus Claude Code</strong> &#8212; versteckte Wasserzeichen, die im M&#228;rz in den System-Kontext eingebaut worden waren, um Missbrauch und Distillation nachzuweisen (Distillation = das Nachtrainieren eines eigenen Modells auf den Ausgaben eines fremden). Der R&#252;ckbau landete am 1. Juli per Pull Request. Thariq Shihipar, Ingenieur im Claude-Code-Team, begr&#252;ndet ihn mit &#8222;stronger mitigations since then&#8221; &#8212; man habe inzwischen bessere Schutzmechanismen.</p><p>Das Timing ist bemerkenswert: Es f&#228;llt in dieselbe Woche, in der Anthropic Alibaba den bislang gr&#246;&#223;ten bekannten Distillation-Angriff vorwirft (siehe #012). Der eine Verteidigungsweg wird also zur&#252;ckgebaut, w&#228;hrend der Vorwurf, genau davor sch&#252;tzen zu m&#252;ssen, &#246;ffentlich verhandelt wird.</p><div><hr></div><h2>Claude Code: Die Highlights der Woche</h2><p><strong>F&#252;r alle, die Claude Code t&#228;glich nutzen</strong></p><ul><li><p><strong>Gestapelte Skill-Aufrufe</strong> &#8212; <code>v2.1.199</code> l&#228;dt bei verketteten Slash-Befehlen (<code>/skill-a /skill-b do XYZ</code>) jetzt alle f&#252;hrenden Skills (bis zu f&#252;nf) auf einmal. Kleiner Handgriff, sp&#252;rbarer Gewinn f&#252;r alle, die mehrere Skills kombinieren.</p></li><li><p><strong>&#8222;Claude in Chrome&#8221; ist GA</strong> &#8212; die Browser-Integration verl&#228;sst mit <code>v2.1.198</code> den Preview-Status und ist allgemein verf&#252;gbar.</p></li></ul><p><strong>F&#252;r Multi-Agent- und Automation-Workflows</strong></p><ul><li><p><strong>Subagents laufen jetzt standardm&#228;&#223;ig im Hintergrund</strong> (<code>v2.1.198</code>), und Background-Agenten erstellen selbstst&#228;ndig einen Commit, laden ihn hoch und &#246;ffnen einen Draft-PR, statt vorher zu fragen. Die Richtung ist deutlich: Der Agent arbeitet weiter, ohne an jeder Weggabelung stehenzubleiben.</p></li></ul><p><strong>F&#252;r Sicherheits- und Team-Admins</strong></p><ul><li><p><strong>Default Permission Mode wechselt auf &#8222;Manual&#8221;</strong> &#8212; <code>v2.1.200</code> stellt CLI, VS Code und JetBrains einheitlich so um, dass Aktionen wieder explizit best&#228;tigt werden m&#252;ssen. Ein bewusster Gegenzug zum autonomeren Verhalten oben.</p></li><li><p><strong>MCP-Sicherheits-Fix</strong> &#8212; <code>v2.1.196</code> verhindert, dass sich selbst-genehmigte MCP-Server (Model Context Protocol, der Standard, &#252;ber den Agenten externe Tools und Datenquellen anbinden) in nicht vertrauensw&#252;rdigen Workspaces automatisch starten. Dazu: org-weite Default-Modelle f&#252;r Admins.</p></li></ul><div><hr></div><h2>Agentic Coding</h2><ul><li><p><strong>Erstes Open-Weight-Modell in Copilot.</strong> GitHub nimmt <strong>Kimi K2.7 Code</strong> von Moonshot AI in den Modell-Picker auf &#8212; das erste frei herunterladbare Modell (Open-Weight = die Modellgewichte sind &#246;ffentlich verf&#252;gbar) &#252;berhaupt in Copilot. Rollout startet bei Pro, Pro+ und Max. Bemerkenswert, weil damit ein Open-Weight-Modell in ein Enterprise-Coding-Tool einzieht, das bislang propriet&#228;ren Modellen vorbehalten war.</p></li><li><p><strong>Copilot-GA-Welle.</strong> Parallel schaltet GitHub eine Reihe kleinerer Bausteine frei: Vision GA, Browser-Tools in VS Code GA, Agent-Session-Streaming (Public Preview) und automatische Modellauswahl f&#252;r Enterprises. Einzeln unspektakul&#228;r, in Summe eine hohe Release-Kadenz.</p></li></ul><div><hr></div><h2>Trend der Woche: Der Trend teilt sich</h2><p>Zwei Beobachtungen aus derselben Woche ziehen in entgegengesetzte Richtungen.</p><p>Gergely Orosz beschreibt nach Vor-Ort-Besuchen bei OpenAI, Anthropic und Cursor eine strukturelle Verschiebung: Cloud-Agenten seien zum Standardwerkzeug geworden &#8212; bei OpenAI nutzten laut seinem Bericht <strong>&#252;ber 95 % der Non-Engineers</strong> den Coding-Agenten Codex statt ChatGPT. Der n&#228;chste gro&#223;e Hebel sei &#8222;Environments-Building f&#252;r Agents&#8221;, also das Bauen von Umgebungen, in denen Agenten zuverl&#228;ssig arbeiten k&#246;nnen.</p><p>Aus der anderen Ecke kommt ein hartes Nein. Die <strong>Godot Foundation verbietet KI-generierten Code</strong> und KI-Text in Pull Requests und Kommunikation &#8212; die erste gro&#223;e Open-Source-Institution mit einer klaren Absage: <em>&#8222;AI cannot take responsibility, and we can&#8217;t trust heavy users of AI to understand their code enough to fix it.&#8221;</em> KI k&#246;nne keine Verantwortung &#252;bernehmen, und man traue Vielnutzern nicht zu, ihren Code gut genug zu verstehen, um ihn zu reparieren.</p><p>Dazwischen liegt die eigentliche Frage: nicht <em>ob</em>, sondern <em>wie viel</em> Autonomie. Addy Osmani (Google) schl&#228;gt daf&#252;r ein sechsstufiges Raster von &#8222;Agentic Autonomy Levels&#8221; vor, mit Metriken wie der mittleren Zeit zwischen menschlichen Eingriffen. Und Kent Beck, Pionier des Test-Driven Development, bringt den Kern auf den Punkt: In der neuen &#196;ra wachse das Vertrauen bei weitem nicht so schnell wie der Code selbst.</p><div><hr></div><h2>Tipp der Woche</h2><p>Simon Willison zitiert einen Rat aus dem Claude-Code-Team, der in die Preisdebatte dieser Woche passt: <strong>teure Modelle f&#252;r die Arbeit mit hohem Urteilsanteil reservieren, Routine-Coding per Anweisung an g&#252;nstigere Subagents delegieren.</strong> Wer den Executor-Advisor-Gedanken ernst nimmt &#8212; ein starkes Modell entscheidet die Richtung, g&#252;nstigere Modelle f&#252;hren aus &#8212; spart Tokens schneller, als man erwartet.</p><p><em>Warum das hier steht:</em> Sonnet 5 macht das billigere Modell zum Default, aber der Willison-Tokenizer-Fund zeigt, dass &#8222;billiger&#8221; tr&#252;gt. Die Ersparnis liegt nicht im Modellpreis, sondern darin, welches Modell welche Aufgabe bekommt.</p><div><hr></div><h2>Kurz notiert</h2><ul><li><p><strong>Anthropics Recruiting-Serie geht weiter:</strong> Jelani Nelson, Chair der Computer Science Division im EECS-Department der UC Berkeley, nimmt eine Beurlaubung und wechselt als Member of Technical Staff zu Anthropic &#8212; nach Karpathy, Jumper, Adler und Pritzel der n&#228;chste prominente Zugang binnen weniger Wochen.</p></li><li><p><strong>Anthropic sondiert mit Samsung einen eigenen KI-Chip</strong> &#8212; Zweck, Server-Integration und Leistungsdaten noch offen. Passt in die Compute-Diversifizierung aus #012 (Micron-Deal, Broadcom-ASIC).</p></li><li><p><strong>Etched verl&#228;sst den Stealth-Modus</strong> mit funktionierendem Inferenz-Chip: insgesamt 800 Mio. $ Funding bei 5 Mrd. $ Post-Money-Bewertung, &#252;ber 1 Mrd. $ an Kundenvertr&#228;gen. Auf der Investorenliste stehen Karpathy, Hinton, Fei-Fei Li, Arthur Mensch und Scott Wu.</p></li><li><p><strong>&#8222;Agentjacking&#8221; breitet sich aus:</strong> Der Angriff kapert einen Agenten &#252;ber eine manipulierte Tool-Anbindung. Die MCP-Vertrauens-Schwachstelle, die urspr&#252;nglich &#252;ber Sentry Claude Code kompromittierte (85 % Erfolgsquote in Tests, 2.388 exponierte Organisationen), betrifft laut Update dieselbe Architektur bei Datadog, PagerDuty und Jira. Die Cloud Security Alliance stuft es inzwischen als systemische MCP-Schwachstellenklasse ein.</p></li><li><p><strong>X bietet jetzt einen gehosteten, read-only MCP-Server</strong> und reiht sich neben GitHub, Slack, Notion und Stripe ein &#8212; autonomes Posten ist nicht m&#246;glich.</p></li></ul><div><hr></div><h2>Quellen</h2><p><strong>Der Staat und die Frontier-Modelle:</strong> <a href="https://www.anthropic.com/news/redeploying-fable-5">Anthropic &#8212; Redeploying Fable 5</a> &#183; <a href="https://www.anthropic.com/news/fable-safeguards-jailbreak-framework">Anthropic &#8212; Jailbreak Severity Framework</a> &#183; <a href="https://www.heise.de/en/news/By-letter-US-government-lifts-ban-on-Claude-Mythos-11346911.html">heise (EN) &#8212; US government lifts ban</a> &#183; <a href="https://openai.com/index/previewing-gpt-5-6-sol/">OpenAI &#8212; GPT-5.6 Sol</a> &#183; <a href="https://venturebeat.com/technology/openai-unveils-gpt-5-6-sol-terra-and-luna-models-but-only-accessible-to-limited-preview-partners-for-now-per-us-gov">VentureBeat &#8212; GPT-5.6 Preview</a> &#183; <a href="https://www.cnbc.com/2026/07/02/openai-proposes-us-government-own-5percent-stake-to-address-political-blowback.html">CNBC &#8212; OpenAI proposes 5% government stake</a> &#183; <a href="https://www.forbes.com/sites/siladityaray/2026/07/02/openai-reportedly-pitches-granting-us-government-5-stake/">Forbes &#8212; OpenAI pitches US government 5% stake</a></p><p><strong>Sonnet 5:</strong> <a href="https://www.anthropic.com/news/claude-sonnet-5">Anthropic &#8212; Claude Sonnet 5</a> &#183; <a href="https://techcrunch.com/2026/06/30/anthropic-launches-claude-sonnet-5-as-a-cheaper-way-to-run-agents/">TechCrunch &#8212; cheaper way to run agents</a> &#183; <a href="https://simonwillison.net/2026/Jun/30/claude-sonnet-5/">Simon Willison &#8212; Claude Sonnet 5</a> &#183; <a href="https://every.to/vibe-check/sonnet-5">Every &#8212; Vibe Check: Sonnet 5</a></p><p><strong>Steganographie-Marker:</strong> <a href="https://www.theregister.com/ai-and-ml/2026/07/01/anthropic-is-removing-its-covert-code-for-catching-chinese-competitors/5265366">The Register &#8212; Removing covert code</a></p><p><strong>Claude Code:</strong> <a href="https://code.claude.com/docs/en/changelog">Changelog</a> &#183; <a href="https://github.com/anthropics/claude-code/releases/tag/v2.1.199">v2.1.199 Release</a></p><p><strong>Agentic Coding:</strong> <a href="https://github.blog/changelog/2026-07-01-kimi-k2-7-is-now-available-in-github-copilot/">GitHub Changelog &#8212; Kimi K2.7 in Copilot</a> &#183; <a href="https://github.blog/changelog/">GitHub Changelog</a></p><p><strong>Trend der Woche:</strong> <a href="https://newsletter.pragmaticengineer.com/p/impressions-from-visiting-openai">Pragmatic Engineer &#8212; Impressions from visiting OpenAI, Anthropic &amp; Cursor</a> &#183; <a href="https://thenewstack.io/godot-bans-ai-coding-agents/">The New Stack &#8212; Godot bans AI coding agents</a> &#183; <a href="https://addyo.substack.com/p/agentic-autonomy-levels">Addy Osmani &#8212; Agentic Autonomy Levels</a> &#183; <a href="https://newsletter.pragmaticengineer.com/p/how-kent-beck-shapes-the-software">Pragmatic Engineer &#8212; How Kent Beck shapes software</a></p><p><strong>Tipp der Woche:</strong> <a href="https://simonwillison.net/2026/Jul/3/judgement/">Simon Willison &#8212; Judgement</a></p><p><strong>Kurz notiert:</strong> <a href="https://addisinsight.net/2026/07/01/prof-jelani-nelson-takes-leave-from-uc-berkeley-to-join-ai-giant-anthropic/">AddisInsight &#8212; Jelani Nelson zu Anthropic</a> &#183; <a href="https://techcrunch.com/2026/07/02/anthropic-is-discussing-a-new-custom-chip-with-samsung/">TechCrunch &#8212; Anthropic &#215; Samsung Chip</a> &#183; <a href="https://www.datacenterdynamics.com/en/news/inference-chip-startup-etched-emerges-from-stealth-with-800m-funding-unveils-working-chip/">DCD &#8212; Etched verl&#228;sst Stealth</a> &#183; <a href="https://www.globenewswire.com/news-release/2026/06/30/3319922/0/en/etched-emerges-from-stealth-with-working-chip-800m-raised-and-over-1b-in-customer-contracts.html">Etched &#8212; Pressemitteilung (GlobeNewswire)</a> &#183; <a href="https://venturebeat.com/security/the-attack-that-hijacked-claude-code-came-through-sentry-datadog-pagerduty-and-jira-have-the-same-exposure">VentureBeat &#8212; Agentjacking spreads</a> &#183; <a href="https://techcrunch.com/2026/06/30/x-now-offers-an-mcp-server-to-make-its-platform-easier-for-ai-tools-to-use/">TechCrunch &#8212; X MCP-Server</a></p><div><hr></div><p><strong>Das war Agentic Weekly #013.</strong> Danke f&#252;rs Lesen &#8212; die n&#228;chste Ausgabe kommt am Samstag, 11. Juli 2026.</p><p>Hinter Agentic Weekly steckt <a href="https://fluxum.net/#about">Martin Gross</a>: w&#246;chentlich ein kompakter, meinungsstarker &#220;berblick zu Agentic Engineering, Agentic Coding und Claude Code.</p><p>Hat dir die Ausgabe gefallen? Leite sie gerne weiter oder empfiehl den Newsletter. </p><div class="subscription-widget-wrap-editor" data-attrs="{&quot;url&quot;:&quot;https://blog.fluxum.net/subscribe?&quot;,&quot;text&quot;:&quot;Abonnieren&quot;,&quot;language&quot;:&quot;de&quot;}" data-component-name="SubscribeWidgetToDOM"><div class="subscription-widget show-subscribe"><div class="preamble"><p class="cta-caption">fluxum engineering ist eine von Leser unterst&#252;tzte Publikation. Um neue Posts zu erhalten und meine Arbeit zu unterst&#252;tzen, ziehen Sie in Betracht, ein Free- oder Paid-Abonnent zu werden.</p></div><form class="subscription-widget-subscribe"><input type="email" class="email-input" name="email" placeholder="E-Mail-Adresse eingeben &#8230;" tabindex="-1"><input type="submit" class="button primary" value="Abonnieren"><div class="fake-input-wrapper"><div class="fake-input"></div><div class="fake-button"></div></div></form></div></div>]]></content:encoded></item><item><title><![CDATA[Agentic Weekly #012 — Geklaut, gesperrt, selbst gebaut]]></title><description><![CDATA[Dass Anthropic einem China-Akteur den gr&#246;&#223;ten bekannten Datendiebstahl an Claude vorwirft, zeigt vor allem, wie wertvoll ein Spitzenmodell geworden ist &#8212; in derselben Woche, in der Claude in Slack einzieht und die Labs anfangen, sich die Hardware darunter selbst zu bauen.]]></description><link>https://blog.fluxum.net/p/agentic-weekly-012-geklaut-gesperrt</link><guid isPermaLink="false">https://blog.fluxum.net/p/agentic-weekly-012-geklaut-gesperrt</guid><dc:creator><![CDATA[Martin Gross]]></dc:creator><pubDate>Sat, 27 Jun 2026 11:32:50 GMT</pubDate><enclosure url="https://substackcdn.com/image/fetch/$s_!7G3X!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Ffe6bb51a-b207-40d1-b98e-aee46cd84c2e_1536x1024.png" length="0" type="image/jpeg"/><content:encoded><![CDATA[<p><strong>Dass Anthropic einem China-Akteur den gr&#246;&#223;ten bekannten Datendiebstahl an Claude vorwirft, zeigt vor allem, wie wertvoll ein Spitzenmodell geworden ist &#8212; in derselben Woche, in der Claude in Slack einzieht und die Labs anfangen, sich die Hardware darunter selbst zu bauen.</strong></p><p>Samstag, 27. Juni 2026 &#8212; Lesezeit: ~10 Min.</p><div class="subscription-widget-wrap-editor" data-attrs="{&quot;url&quot;:&quot;https://blog.fluxum.net/subscribe?&quot;,&quot;text&quot;:&quot;Abonnieren&quot;,&quot;language&quot;:&quot;de&quot;}" data-component-name="SubscribeWidgetToDOM"><div class="subscription-widget show-subscribe"><div class="preamble"><p class="cta-caption">fluxum engineering ist eine von Leser unterst&#252;tzte Publikation. Um neue Posts zu erhalten und meine Arbeit zu unterst&#252;tzen, ziehen Sie in Betracht, ein Free- oder Paid-Abonnent zu werden.</p></div><form class="subscription-widget-subscribe"><input type="email" class="email-input" name="email" placeholder="E-Mail-Adresse eingeben &#8230;" tabindex="-1"><input type="submit" class="button primary" value="Abonnieren"><div class="fake-input-wrapper"><div class="fake-input"></div><div class="fake-button"></div></div></form></div></div><div><hr></div><div class="captioned-image-container"><figure><a class="image-link image2 is-viewable-img" target="_blank" href="https://substackcdn.com/image/fetch/$s_!7G3X!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Ffe6bb51a-b207-40d1-b98e-aee46cd84c2e_1536x1024.png" data-component-name="Image2ToDOM"><div class="image2-inset"><picture><source type="image/webp" srcset="https://substackcdn.com/image/fetch/$s_!7G3X!,w_424,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Ffe6bb51a-b207-40d1-b98e-aee46cd84c2e_1536x1024.png 424w, https://substackcdn.com/image/fetch/$s_!7G3X!,w_848,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Ffe6bb51a-b207-40d1-b98e-aee46cd84c2e_1536x1024.png 848w, https://substackcdn.com/image/fetch/$s_!7G3X!,w_1272,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Ffe6bb51a-b207-40d1-b98e-aee46cd84c2e_1536x1024.png 1272w, https://substackcdn.com/image/fetch/$s_!7G3X!,w_1456,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Ffe6bb51a-b207-40d1-b98e-aee46cd84c2e_1536x1024.png 1456w" sizes="100vw"><img src="https://substackcdn.com/image/fetch/$s_!7G3X!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Ffe6bb51a-b207-40d1-b98e-aee46cd84c2e_1536x1024.png" width="1456" height="971" data-attrs="{&quot;src&quot;:&quot;https://substack-post-media.s3.amazonaws.com/public/images/fe6bb51a-b207-40d1-b98e-aee46cd84c2e_1536x1024.png&quot;,&quot;srcNoWatermark&quot;:null,&quot;fullscreen&quot;:null,&quot;imageSize&quot;:null,&quot;height&quot;:971,&quot;width&quot;:1456,&quot;resizeWidth&quot;:null,&quot;bytes&quot;:2558735,&quot;alt&quot;:null,&quot;title&quot;:null,&quot;type&quot;:&quot;image/png&quot;,&quot;href&quot;:null,&quot;belowTheFold&quot;:false,&quot;topImage&quot;:true,&quot;internalRedirect&quot;:&quot;https://blog.fluxum.net/i/203823982?img=https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Ffe6bb51a-b207-40d1-b98e-aee46cd84c2e_1536x1024.png&quot;,&quot;isProcessing&quot;:false,&quot;align&quot;:null,&quot;offset&quot;:false}" class="sizing-normal" alt="" srcset="https://substackcdn.com/image/fetch/$s_!7G3X!,w_424,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Ffe6bb51a-b207-40d1-b98e-aee46cd84c2e_1536x1024.png 424w, https://substackcdn.com/image/fetch/$s_!7G3X!,w_848,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Ffe6bb51a-b207-40d1-b98e-aee46cd84c2e_1536x1024.png 848w, https://substackcdn.com/image/fetch/$s_!7G3X!,w_1272,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Ffe6bb51a-b207-40d1-b98e-aee46cd84c2e_1536x1024.png 1272w, https://substackcdn.com/image/fetch/$s_!7G3X!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Ffe6bb51a-b207-40d1-b98e-aee46cd84c2e_1536x1024.png 1456w" sizes="100vw" fetchpriority="high"></picture><div class="image-link-expand"><div class="pencraft pc-display-flex pc-gap-8 pc-reset"><button tabindex="0" type="button" class="pencraft pc-reset pencraft icon-container restack-image"><svg role="img" width="20" height="20" viewBox="0 0 20 20" fill="none" stroke-width="1.5" stroke="var(--color-fg-primary)" stroke-linecap="round" stroke-linejoin="round" xmlns="http://www.w3.org/2000/svg"><g><title></title><path d="M2.53001 7.81595C3.49179 4.73911 6.43281 2.5 9.91173 2.5C13.1684 2.5 15.9537 4.46214 17.0852 7.23684L17.6179 8.67647M17.6179 8.67647L18.5002 4.26471M17.6179 8.67647L13.6473 6.91176M17.4995 12.1841C16.5378 15.2609 13.5967 17.5 10.1178 17.5C6.86118 17.5 4.07589 15.5379 2.94432 12.7632L2.41165 11.3235M2.41165 11.3235L1.5293 15.7353M2.41165 11.3235L6.38224 13.0882"></path></g></svg></button><button tabindex="0" type="button" class="pencraft pc-reset pencraft icon-container view-image"><svg xmlns="http://www.w3.org/2000/svg" width="20" height="20" viewBox="0 0 24 24" fill="none" stroke="currentColor" stroke-width="2" stroke-linecap="round" stroke-linejoin="round" class="lucide lucide-maximize2 lucide-maximize-2"><polyline points="15 3 21 3 21 9"></polyline><polyline points="9 21 3 21 3 15"></polyline><line x1="21" x2="14" y1="3" y2="10"></line><line x1="3" x2="10" y1="21" y2="14"></line></svg></button></div></div></div></a></figure></div><h2>Die gro&#223;e Nachricht der Woche</h2><h3>Anthropic beziffert den &#8222;gr&#246;&#223;ten bekannten Distillation-Angriff&#8221; &#8212; und zeigt nach China</h3><p>Am <strong>24. Juni</strong> macht Bloomberg einen Brief &#246;ffentlich, den Anthropic schon am <strong>10. Juni</strong> an den US-Senatsausschuss f&#252;r Banken (Senate Committee on Banking, Housing, and Urban Affairs) geschickt hatte &#8212; an dessen Vorsitzenden <strong>Tim Scott</strong> (Republikaner, South Carolina) und die rangh&#246;chste Demokratin <strong>Elizabeth Warren</strong> (Massachusetts). Der Vorwurf: Ein mit <strong>Alibaba</strong> und dessen KI-Labor Qwen verbundener Akteur habe den nach Anthropics Worten &#8222;gr&#246;&#223;ten bekannten Distillation-Angriff&#8221; auf Claude gefahren.</p><p>Die Zahlen sind ungew&#246;hnlich konkret. Zwischen dem <strong>22. April und dem 5. Juni</strong> sollen rund <strong>25.000 Fake-Accounts</strong> insgesamt <strong>28,8 Millionen</strong> Dialoge mit Claude gef&#252;hrt haben &#8212; gezielt auf die laut Brief wertvollsten F&#228;higkeiten des Modells: &#8222;agentic reasoning, software engineering, and long-horizon tasks&#8221;, also eigenst&#228;ndiges Schlussfolgern, Programmieren und das Abarbeiten langer Aufgabenketten.</p><p><strong>Distillation</strong> meint dabei, ein eigenes Modell auf den Ausgaben eines fremden nachzutrainieren &#8212; Datendiebstahl im industriellen Ma&#223;stab: Man erntet die Antwortmuster des Originals, statt von Grund auf selbst zu trainieren. Anthropics Verdacht: Das geerntete Material floss in Qwen. Alibaba wollte sich nicht &#228;u&#223;ern und wies den Vorwurf pauschal zur&#252;ck; die Aktie gab am Tag der Meldung &#252;ber drei Prozent nach.</p><p>Neu ist die Gr&#246;&#223;enordnung, nicht das Muster. Schon im Februar hatte Anthropic drei &#8222;industrial-scale&#8221;-Kampagnen aus China benannt &#8212; DeepSeek, Moonshot und MiniMax. Der Alibaba-Fall liegt nach eigener Darstellung um Gr&#246;&#223;enordnungen dar&#252;ber.</p><p><strong>Warum das relevant ist:</strong> Anthropic verlagert den Modellschutz von der Technik in die Politik &#8212; der Brief geht nicht an die eigene Rechtsabteilung, sondern an einen Senatsausschuss, und er liefert die Munition f&#252;r die These, die das Lab seit Wochen vertritt: Spitzenmodelle sind nationale Verm&#246;genswerte, und China greift sie systematisch ab. Dieselbe These tr&#228;gt die Modell-Sperre der letzten beiden Ausgaben &#8212; nur dass der Vorwurf diesmal mit 28,8 Millionen Datenpunkten unterlegt ist statt mit einer anonymen Geheimdienstquelle.</p><div><hr></div><h2>Anthropic zieht in Slack ein &#8212; Claude Tag</h2><p>Am <strong>23. Juni</strong> stellt Anthropic <strong>Claude Tag</strong> vor: einen persistenten Claude, der direkt in Slack-Kan&#228;len lebt. Per <code>@Claude</code> angesprochen, baut er Kontext aus dem Kanalverlauf auf, arbeitet Aufgaben asynchron mit eigener Planung ab und meldet sich proaktiv zur&#252;ck &#8212; Anthropic nennt das &#8222;ambient behavior&#8221;. Die Beta l&#228;uft auf <strong>Opus 4.8</strong> und ist Enterprise- und Team-Kunden vorbehalten; Admins steuern Token-Limits auf Organisations- und Kanal-Ebene.</p><p>Eine Eigenangabe l&#228;sst aufhorchen: Laut Anthropic stammen <strong>65 Prozent des Codes</strong> des eigenen Produktteams aus der internen Claude-Tag-Version (unbest&#228;tigte Herstellerzahl). Die alte &#8222;Claude in Slack&#8221;-App wird zum <strong>3. August</strong> abgeschaltet, mit 30 Tagen Migrationsfenster.</p><p><strong>Warum das relevant ist:</strong> Claude Code hat Anthropic im Terminal verankert; Claude Tag &#246;ffnet die zweite Front im Chat-Tool der Wissensarbeiter. Anthropic geht damit nicht tiefer, sondern breiter: vom Coding-Werkzeug zum dauerhaften Teammitglied.</p><div><hr></div><h2>Update Mythos/Fable: Der Ton kippt, der Stand bleibt</h2><p>Drei Wochen nach dem Export-Stopp f&#252;r Anthropics Spitzenmodelle Mythos 5 und Fable 5 bewegt sich viel und &#228;ndert sich nichts. Im Axios-Interview vom <strong>20. Juni</strong> nennt Donald Trump Anthropic und Dario Amodei &#8222;nicht mehr&#8221; ein nationales Sicherheitsrisiko &#8212; die Direktive selbst bleibt unangetastet. Eine vom <strong>18. Juni</strong> datierte Frist f&#252;r Handelsminister <strong>Howard Lutnick</strong>, vier &#252;berparteilichen Abgeordneten die Sperre schriftlich zu begr&#252;nden, verstrich am <strong>26. Juni</strong> ohne &#246;ffentliche Reaktion.</p><p>Dazwischen ein kurzes Aufflackern: Am <strong>25. Juni</strong> kursiert auf X das Ger&#252;cht, Fable 5 sei zur&#252;ck &#8212; ausgel&#246;st durch einen Anzeige-Bug in Claude Code <strong>v2.1.190</strong>, der das Modell samt Wochenlimit-Texten im Model-Picker zeigte. Anthropic dementierte umgehend, unter anderem &#252;ber Wachstumschef Amol Avasare: kein Traffic, das Modell bleibt offline.</p><p><strong>Anthropic verlangt jetzt seinerseits Ausweise.</strong> Zum <strong>8. Juli</strong> tritt eine aktualisierte Datenschutzrichtlinie in Kraft: F&#252;r eine &#8222;kleine Untergruppe verd&#228;chtiger Nutzer&#8221; werden ein Foto-Ausweis plus Live-Selfie f&#228;llig, abgewickelt &#252;ber den Thiel-finanzierten Identit&#228;tsdienst <strong>Persona</strong> &#8212; und die Daten werden nicht sofort gel&#246;scht. Betroffen sind nur Free-, Pro- und Max-Konten, nicht Team, Enterprise oder API. F&#252;r die europ&#228;ische Zielgruppe ist das die n&#228;chste DSGVO-Baustelle: biometrische Verifikation bei einem US-Anbieter, dessen Spitzenmodelle hier ohnehin gesperrt sind.</p><p><strong>Und die Geheimdienste melden sich.</strong> Am <strong>23. Juni</strong> ver&#246;ffentlichen die sechs Cyber-Beh&#246;rden der Five-Eyes-Allianz (USA, Gro&#223;britannien, Kanada, Australien, Neuseeland &#8212; darunter NSA, CISA und das britische NCSC) eine seltene gemeinsame Erkl&#228;rung: Frontier-KI werde die Cyber-Bedrohungslage &#8222;in Monaten, nicht Jahren&#8221; verschieben, Regierungen und Unternehmen sollten &#8222;jetzt handeln&#8221;. Eine konkrete Modell-Zuordnung vermeidet das Papier &#8212; die parallel kursierende Behauptung, Mythos habe in einem Test NSA-Systeme geknackt, lie&#223; sich gegen die Prim&#228;rquelle nicht erh&#228;rten.</p><p><strong>Warum das relevant ist:</strong> Drei Bewegungen, eine Linie &#8212; Politik, Anbieter und Sicherheitsapparat verhandeln gerade neu, was ein Spitzenmodell wert ist und wem man es anvertrauen darf. Die Verf&#252;gbarkeit bleibt, was sie in #011 wurde: eine politische Variable.</p><div><hr></div><h2>Die Labs greifen nach eigener Hardware</h2><p>Innerhalb einer Woche zeigen drei Deals dasselbe Muster: Wer Modelle baut, will die Schicht darunter kontrollieren.</p><p><strong>Qualcomm kauft Modular</strong> (24. Juni) f&#252;r rund <strong>3,92 Milliarden Dollar</strong> in Aktien. Modular, 2022 vom LLVM- und Swift-Sch&#246;pfer <strong>Chris Lattner</strong> mitgegr&#252;ndet, liefert die Sprache Mojo und die Inference-Engine MAX &#8212; einen herstellerneutralen Compiler-Layer, der denselben KI-Code &#252;ber Nvidia-, AMD- und Custom-Chips laufen l&#228;sst. Das ist ein direkter Angriff auf <strong>CUDA</strong>, Nvidias propriet&#228;ren Software-Stack, der die GPU-Welt zusammenh&#228;lt. Meta und Microsoft sind bereits als Kunden gelistet.</p><p><strong>OpenAI und Broadcom</strong> enth&#252;llen am selben Tag <strong>&#8222;Jalape&#241;o&#8221;</strong>, OpenAIs ersten eigenen Inferenz-<strong>ASIC</strong> (einen f&#252;r genau einen Zweck gefertigten Chip). Broadcom-Chef Hock Tan verspricht rund <strong>50 Prozent</strong> geringere Kosten gegen&#252;ber &#252;blichen KI-GPUs; erste Auslieferungen sind f&#252;r Ende 2026 geplant.</p><p><strong>Micron und Anthropic</strong> schlie&#223;en einen Vier-S&#228;ulen-Deal (22. Juni): Co-Design f&#252;r Speicher (<strong>HBM</strong>, der schnelle Stapelspeicher direkt neben dem Rechenkern), mehrj&#228;hrige Lieferzusagen, Claude-Rollout bei Micron und eine Beteiligung an Anthropics Series H. Damit haben alle drei gro&#223;en HBM-Hersteller &#8212; Micron, Samsung, SK Hynix &#8212; in Anthropic investiert.</p><p><strong>Warum das relevant ist:</strong> Der Engpass der n&#228;chsten Phase ist nicht das Modell, sondern Rechenchip und Speicher darunter. Wer dort nur mietet, zahlt die Marge der Lieferanten &#8212; also kaufen sich die Labs gerade in den Stack ein, von der Compiler-Schicht bis zum Speicherriegel.</p><div><hr></div><h2>Claude Code: Die Highlights der Woche</h2><p>Vier substanzielle Releases in sieben Tagen &#8212; von <strong>v2.1.187 bis v2.1.195</strong>.</p><h3>F&#252;r Security- und Team-Admins</h3><p><code>v2.1.187</code><strong> &#8212; </strong><code>sandbox.credentials</code> (23. Juni) &#8212; Ein neues Setting hindert sandboxed Bash-Befehle daran, Credential-Dateien und geheime Umgebungsvariablen zu lesen. Organisationsweite Modell-Restriktionen werden zudem durchg&#228;ngig erzwungen &#8212; im Model-Picker, bei <code>--model</code>, <code>/model</code> und <code>ANTHROPIC_MODEL</code> &#8212;, und Remote-MCP-Aufrufe ohne Antwort brechen nach f&#252;nf Minuten ab.</p><p><code>v2.1.193</code><strong> &#8212; Auto Mode h&#228;rter, OTel-Falle</strong> (25. Juni) &#8212; Das neue <code>autoMode.classifyAllShell</code> schickt <em>alle</em> Shell-Befehle durch den Pr&#252;fer des Auto Mode (in dem Claude selbst entscheidet, welche Aktionen ohne R&#252;ckfrage durchlaufen d&#252;rfen) statt nur die offensichtlich riskanten. Wichtig f&#252;r Observability-Teams: Ein neues OTel-Log-Event (OTel = OpenTelemetry, der offene Standard f&#252;r Telemetriedaten) protokolliert k&#252;nftig auch den Antworttext des Modells &#8212; und wer bereits Prompts mitschreibt, schreibt nach dem Upgrade ungefragt die Antworten mit, solange <code>OTEL_LOG_ASSISTANT_RESPONSES=0</code> nicht gesetzt ist. Vor dem Update lesen.</p><h3>F&#252;r alle, die Claude Code t&#228;glich nutzen</h3><p><code>v2.1.191</code><strong> &#8212; </strong><code>/rewind</code><strong> &#252;ber </strong><code>/clear</code><strong> hinaus, 37 % weniger CPU</strong> (24. Juni) &#8212; <code>/rewind</code> stellt jetzt auch Gespr&#228;chsst&#228;nde von <em>vor</em> einem <code>/clear</code> wieder her. Gleichzeitig sinkt der CPU-Verbrauch beim Streaming um rund <strong>37 Prozent</strong>, weil Text-Updates auf 100-Millisekunden-Takte geb&#252;ndelt werden &#8212; sp&#252;rbar in langen Sessions.</p><h3>F&#252;r Hook- und Multi-Agent-Workflows</h3><p><strong>Hook-Matcher werden zuverl&#228;ssig</strong> (v2.1.191 + v2.1.195) &#8212; Zwei Fixes in Folge: <code>v2.1.191</code> repariert komma-getrennte Matcher (<code>"Bash,PowerShell"</code> feuerten zuvor stillschweigend gar nicht), <code>v2.1.195</code> (26. Juni) stellt Matcher mit Bindestrich-Namen wie <code>code-reviewer</code> oder <code>mcp__brave-search</code> von Teil- auf exakten Abgleich um. Wer solche Matcher nutzt, sollte seine Hook-Konfiguration nach dem Update einmal gegenpr&#252;fen.</p><div><hr></div><h2>Agentic Coding</h2><p><strong>Microsofts Doppelschritt</strong> &#8212; GitHub f&#228;hrt diese Woche zwei Strategien parallel. Einerseits &#246;ffnet die <strong>Copilot-Desktop-App BYOK</strong> (23. Juni; &#8222;Bring Your Own Key&#8221; &#8212; den eigenen Modellschl&#252;ssel mitbringen), darunter f&#252;r OpenAI, Azure, Ollama und <strong>Anthropic</strong>: Der Nutzer entkoppelt sich vom vorgegebenen Modell. Andererseits stellt Microsoft am <strong>26. Juni</strong> mit <strong>MAI-Code-1-Flash</strong> ein eigenes Coding-Modell (5 Milliarden Parameter) f&#252;r Copilot Business und Enterprise daneben &#8212; laut Microsoft 16 Punkte besser auf <strong>SWE-bench Pro</strong> (einem Benchmark realer Programmieraufgaben) als Haiku 4.5, bei bis zu 60 Prozent weniger Tokens. Im Wochentakt kamen au&#223;erdem: ein neues Terminal-Interface f&#252;r die Copilot CLI (23. Juni), Copilot f&#252;r Jira wird allgemein verf&#252;gbar (25. Juni), und <strong>GitHub Desktop 3.6</strong> bekommt endlich Git-Worktree-Support &#8212; mehrere parallele Arbeitskopien eines Repos, wichtig f&#252;r nebenl&#228;ufige Agent-Sessions.</p><p><strong>Codex Remote wird GA</strong> (25. Juni) &#8212; OpenAIs Coding-Agent l&#228;sst sich jetzt aus der ChatGPT-Mobile-App per QR-Code mit einem Mac- oder Windows-Rechner koppeln und von dort steuern; ein DigitalOcean-Plugin provisioniert auf Wunsch automatisch einen Server. Der Agent verl&#228;sst die IDE Richtung Smartphone.</p><p><strong>Cursor 3.9</strong> (22. Juni) b&#252;ndelt Plugins, Skills, MCPs, Subagents und Hooks auf einer zentralen Customize-Seite samt Team-Marktplatz &#8212; derselbe &#8222;Extension-Layer wird Standard&#8221;-Zug, den auch Cline und Antigravity gerade fahren. Drei k&#252;rzere Bewegungen am Rand: Cognition f&#252;hrt <strong>Windsurf</strong> als <strong>Devin Desktop</strong> weiter (v3.3.18 zeigt jetzt den ACU-Verbrauch an), die <strong>Antigravity CLI</strong> liefert in 1.0.10&#8211;1.0.12 ARM64-Support und neue Launch-Flags nach, und <strong>Xcode 26.6</strong> holt sich Google Gemini als Programmierassistenten ins Haus.</p><div><hr></div><h2>Trend der Woche</h2><h3>Slow down to speed up</h3><p>Die Engineering-Reflexion der Woche kommt von <strong>Gergely Orosz</strong> (Pragmatic Engineer): Erst die Modelle vom November 2025 h&#228;tten Agenten &#8222;genuinely useful&#8221; gemacht &#8212; und die Adoptionszahlen seien steil. Teams mit AI-Agenten lieferten rund <strong>f&#252;nfmal</strong> mehr Pull Requests als vor zwei Jahren, einzelne Entwickler <strong>2,5-mal</strong> mehr Code. Selbst <strong>DHH</strong> (David Heinemeier Hansson, Sch&#246;pfer von Ruby on Rails), noch im Sommer 2025 entschiedener Verweigerer, r&#228;umt ein, sein Widerstand habe schlicht daran gelegen, dass die Modelle damals &#8222;not good enough&#8221; waren.</p><p>Der Gegenbeat kommt von Stack Overflow, das seine <strong>Developer Survey 2026</strong> &#246;ffnet &#8212; pointiert &#8222;for human developers only&#8221;. Die Agenten-Nutzung hat sich binnen eines Jahres fast verdoppelt (von 31 auf <strong>59 Prozent</strong>), aber <strong>63 Prozent</strong> lassen sie &#8222;selten oder nie&#8221; ohne Aufsicht laufen. Mehr Entwickler nutzen KI &#8212; und weniger vertrauen ihr blind. Den Schatten &#252;ber den Zahlen setzt Orosz selbst: der j&#252;ngste Security-Vorfall bei Meta als Mahnmal, dass Tempo ohne Leitplanken kippt.</p><div><hr></div><h2>Tipp der Woche</h2><p><strong>Cloudflare &#8222;Temporary Accounts for AI Agents&#8221;</strong> &#8212; Mit <code>npx wrangler deploy --temporary</code> l&#228;sst sich ein Cloudflare-Workers-Projekt f&#252;r 60 Minuten ins Netz stellen, ganz ohne Konto; ein Claim-Link reicht das Deployment sp&#228;ter einem echten Account nach. Cloudflare selbst: &#8222;you can now create a Cloudflare Workers project and run this, without even creating a Cloudflare account.&#8221; <strong>Warum das hier steht:</strong> Es ist ein kleines, konkretes Infrastruktur-Primitiv f&#252;r genau das Problem, das Multi-Agent-Setups gerade umtreibt &#8212; ephemere, wegwerfbare Deployments, die ein Agent selbst anlegen kann, ohne dass vorher jemand ein Konto und Zugangsdaten einrichtet.</p><div><hr></div><h2>Kurz notiert</h2><ul><li><p><strong>Google-Exodus, Akt II</strong> (24. Juni) &#8212; Mit <strong>Jonas Adler</strong> (Google AI) und <strong>Alexander Pritzel</strong> (DeepMind, Gemini-Pretraining) wechseln zwei weitere Schl&#252;sselleute zu Anthropic &#8212; Teil der Welle, die mit Noam Shazeers Abgang zu OpenAI begann und Alphabet am 22. Juni 7,2 Prozent kostete. DeepMind-Chef Demis Hassabis kontert: &#8222;We win our fair share of the top talent.&#8221; Nach John Jumper in #011 der n&#228;chste prominente Zugang.</p></li><li><p><strong>OpenAI erw&#228;gt IPO-Verschiebung auf 2027</strong> (25./26. Juni) &#8212; Laut New York Times macht der SpaceX-Kurssturz die Berater nerv&#246;s; die Aktie verlor binnen sechs Tagen 31 Prozent vom Hoch. Morgan Stanley und Goldman gaben am 26. Juni jeweils &#252;ber 4 Prozent nach &#8212; aus Sorge um die ausbleibenden IPO-Geb&#252;hren.</p></li><li><p><strong>Anthropic und Meta heuern weiter an</strong> &#8212; Anthropic holt <strong>Steve Jarrett</strong> (zuvor Chief AI Officer bei Orange) nach Paris f&#252;r den Europa- und Afrika-Markt; Meta &#252;bernimmt per Acqui-Hire die drei Gr&#252;nder von Virtue AI (AI-Security) ins Superintelligence-Lab.</p></li><li><p><strong>Der Souver&#228;nit&#228;ts-Reflex h&#228;lt an</strong> &#8212; Cohere-KI-Chefin <strong>Joelle Pineau</strong> sagt, das Telefon klingele &#8222;durchgehend&#8221;; in Berlin holt <strong>Langdock</strong> (&#252;ber 10.000 Firmenkunden) Investorin <strong>Judith Dada</strong> als Co-CEO an Bord.</p></li><li><p><strong>Prompt Injection, zweimal</strong> &#8212; Ein neues Paper (&#8222;Prompt Injection as Role Confusion&#8221;) zeigt, dass Modelle privilegierten Text nur am <em>Stil</em> erkennen: Entfernt man den, f&#228;llt die Angriffsquote von 61 auf 10 Prozent. Passend dazu nutzt die macOS-Schadsoftware <strong>Gaslight</strong> erstmals Prompt Injection gegen die KI-gest&#252;tzte Schadcode-Analyse selbst.</p></li><li><p><strong>Satire zum Wochenschluss</strong> &#8212; Andrew Nesbitts fiktiver &#8222;Incident Report: CVE-2026-LGTM&#8221; beschreibt, wie sich zwei konkurrierende AI-Review-Agenten in eine Eskalationsschleife reden. N&#228;her an der Realit&#228;t, als einem lieb ist.</p></li></ul><div><hr></div><h2>Quellen</h2><p><strong>Die gro&#223;e Nachricht der Woche:</strong> <a href="https://www.bloomberg.com/news/articles/2026-06-24/anthropic-accuses-alibaba-of-illicitly-accessing-its-ai-models">Bloomberg &#8212; Anthropic accuses Alibaba</a> &#183; <a href="https://www.cnbc.com/2026/06/24/anthropic-alibaba-distillation-campaign.html">CNBC</a> &#183; <a href="https://www.tomshardware.com/tech-industry/artificial-intelligence/anthropic-claims-that-chinas-alibaba-illicitly-distilled-its-models-from-april-to-june-2026-says-effort-involved-25-000-fake-accounts-and-28-8-million-exchanges-on-claude">Tom&#8217;s Hardware</a> &#183; <a href="https://decrypt.co/372130/anthropic-urges-congress-crack-down-ai-distillation-chinese-rivals">Decrypt</a> &#183; <a href="https://thenextweb.com/news/anthropic-accuses-alibaba-distillation-claude-qwen">The Next Web</a></p><p><strong>Claude Tag:</strong> <a href="https://www.anthropic.com/news/introducing-claude-tag">Anthropic &#8212; Introducing Claude Tag</a> &#183; <a href="https://www.heise.de/news/Delegieren-statt-chatten-Claude-Tag-uebernimmt-in-Slack-die-Arbeit-11342617.html">heise &#8212; Delegieren statt chatten</a> &#183; <a href="https://techcrunch.com/2026/06/23/anthropics-claude-tag-is-learning-your-company-one-slack-message-at-a-time/">TechCrunch</a> &#183; <a href="https://thenewstack.io/anthropic-claude-tag-slack/">The New Stack</a> &#183; <a href="https://www.bloomberg.com/news/articles/2026-06-23/anthropic-wants-claude-to-be-your-new-slack-coworker">Bloomberg</a></p><p><strong>Update Mythos/Fable:</strong> <a href="https://www.theglobeandmail.com/business/article-anthropic-trump-officials-deal-restore-fable-5-mythos-5/">Globe and Mail &#8212; Verhandlungen</a> &#183; <a href="https://www.techtimes.com/articles/318760/20260620/fable-5-ban-update-trump-softens-directive-stands-refund-deadline-closes-today.htm">TechTimes &#8212; Trump softens, directive stands</a> &#183; <a href="https://explainx.ai/blog/is-fable-5-back-2026">explainx &#8212; Is Fable 5 Back?</a> &#183; <a href="https://www.heise.de/en/news/Anthropic-may-require-an-ID-for-using-Claude-in-the-future-11343831.html">heise &#8212; Anthropic may require an ID</a> &#183; <a href="https://www.drweb.de/identitaetspruefung-bei-claude-anthropic-verlangt-ausweis-und-selfie/">Dr. Web &#8212; Ausweis und Selfie</a> &#183; <a href="https://www.euronews.com/next/2026/06/23/ai-cyber-threat-is-months-not-years-away-western-intelligence-agencies-warn">Euronews &#8212; Five Eyes &#8222;months not years&#8221;</a> &#183; <a href="https://www.cnn.com/2026/06/23/world/ai-five-eyes-warning-cyber-threat-intl-hnk">CNN &#8212; Five Eyes warning</a></p><p><strong>Die Labs greifen nach eigener Hardware:</strong> <a href="https://www.cnbc.com/2026/06/24/qualcomm-ai-chip-modular-software.html">CNBC &#8212; Qualcomm kauft Modular</a> &#183; <a href="https://www.modular.com/blog/qualcomm-to-acquire-modular">Modular Blog</a> &#183; <a href="https://openai.com/index/openai-broadcom-jalapeno-inference-chip/">OpenAI &#8212; Jalape&#241;o</a> &#183; <a href="https://www.tomshardware.com/tech-industry/artificial-intelligence/broadcom-and-openai-unveil-custom-built-jalapeno-inference-processor-openais-first-chip-is-a-massive-reticle-sized-asic-built-in-an-ultra-fast-nine-month-development-cycle">Tom&#8217;s Hardware &#8212; Jalape&#241;o</a> &#183; <a href="https://investors.micron.com/news-releases/news-release-details/micron-and-anthropic-announce-strategic-agreement-scale-next">Micron IR &#8212; Micron + Anthropic</a> &#183; <a href="https://www.hpcwire.com/aiwire/2026/06/22/micron-and-anthropic-announce-strategic-agreement-to-scale-next-gen-ai-infrastructure/">HPCwire</a></p><p><strong>Claude Code:</strong> <a href="https://code.claude.com/docs/en/changelog">Changelog</a> &#183; <a href="https://github.com/anthropics/claude-code/releases">GitHub Releases</a></p><p><strong>Agentic Coding:</strong> <a href="https://github.blog/changelog/2026-06-23-github-copilot-app-support-for-byok/">GitHub Changelog &#8212; BYOK in Desktop App</a> &#183; <a href="https://github.blog/changelog/2026-06-26-mai-code-1-flash-for-copilot-business-and-copilot-enterprise/">MAI-Code-1-Flash f&#252;r Enterprise</a> &#183; <a href="https://github.blog/changelog/2026-06-23-copilot-cli-new-terminal-interface-is-generally-available/">Copilot CLI GA</a> &#183; <a href="https://github.blog/changelog/2026-06-25-github-copilot-for-jira-is-now-generally-available/">Copilot f&#252;r Jira GA</a> &#183; <a href="https://github.blog/changelog/2026-06-26-github-desktop-3-6-worktrees-and-deeper-copilot-integration/">GitHub Desktop 3.6</a> &#183; <a href="https://developers.openai.com/codex/changelog">OpenAI Codex Changelog</a> &#183; <a href="https://cursor.com/changelog/customize">Cursor Changelog 3.9</a> &#183; <a href="https://docs.devin.ai/desktop/changelog">Devin Desktop Changelog</a> &#183; <a href="https://github.com/google-antigravity/antigravity-cli/releases">Antigravity CLI Releases</a> &#183; <a href="https://www.heise.de/news/Xcode-26-6-Google-Gemini-zieht-als-Programmierassistent-in-Apples-IDE-ein-11346467.html">heise &#8212; Xcode 26.6 + Gemini</a></p><p><strong>Trend der Woche:</strong> <a href="https://newsletter.pragmaticengineer.com/p/slow-down-to-speed-up">Pragmatic Engineer &#8212; Slow down to speed up</a> &#183; <a href="https://stackoverflow.blog/2026/06/23/the-2026-developer-survey-is-now-open-for-human-developers-only/">Stack Overflow Blog &#8212; Survey 2026</a></p><p><strong>Tipp der Woche:</strong> <a href="https://simonwillison.net/2026/Jun/21/temporary-cloudflare-accounts/">Simon Willison &#8212; Temporary Cloudflare Accounts</a></p><p><strong>Kurz notiert:</strong> <a href="https://www.bloomberg.com/news/articles/2026-06-24/google-poised-to-lose-two-more-high-profile-ai-staffers-to-anthropic">Bloomberg &#8212; Adler &amp; Pritzel zu Anthropic</a> &#183; <a href="https://www.cnbc.com/2026/06/18/google-gemini-co-lead-noam-shazeer-leaves-for-openai.html">CNBC &#8212; Shazeer zu OpenAI</a> &#183; <a href="https://www.semafor.com/article/06/23/2026/deepmind-chief-demis-hassabis-says-googles-still-winning-ai-talent">Semafor &#8212; Hassabis-Counterpoint</a> &#183; <a href="https://www.bloomberg.com/news/articles/2026-06-25/openai-leans-toward-waiting-until-2027-for-ipo-ny-times-says">Bloomberg &#8212; OpenAI leans toward 2027 IPO</a> &#183; <a href="https://www.bloomberg.com/news/articles/2026-06-26/morgan-stanley-goldman-shares-fall-on-possible-openai-ipo-delay">Bloomberg &#8212; Morgan Stanley/Goldman fallen</a> &#183; <a href="https://www.aljazeera.com/economy/2026/6/23/spacex-shares-drop-below-debut-price-before-jumping-amid-600bn-sell-off">Al Jazeera &#8212; SpaceX-Sell-off</a> &#183; <a href="https://finance.yahoo.com/technology/ai/articles/anthropic-hires-oranges-ai-chief-113142253.html">Reuters via Yahoo &#8212; Steve Jarrett zu Anthropic</a> &#183; <a href="https://www.axios.com/2026/06/25/meta-hires-virtue-ai-founders-security">Axios &#8212; Meta acqui-hired Virtue AI</a> &#183; <a href="https://www.it-journal.de/222233-anthropic-sperre-treibt-nachfrage-nach-ki-ausserhalb-der-usa.html">IT-Journal &#8212; Pineau &#8222;Telefon klingelt durchgehend&#8221;</a> &#183; <a href="https://sifted.eu/articles/judith-dada-visionaries-ceo-langdock">Sifted &#8212; Judith Dada Co-CEO Langdock</a> &#183; <a href="https://simonwillison.net/2026/Jun/22/prompt-injection-as-role-confusion/">Simon Willison &#8212; Prompt Injection as Role Confusion</a> &#183; <a href="https://www.sentinelone.com/labs/macos-gaslight-rust-backdoor-turns-prompt-injection-on-the-analyst-not-the-sandbox/">SentinelOne Labs &#8212; macOS.Gaslight</a> &#183; <a href="https://nesbitt.io/2026/06/26/incident-report-cve-2026-lgtm.html">Andrew Nesbitt &#8212; CVE-2026-LGTM</a></p><div><hr></div><p><strong>Das war Agentic Weekly #012.</strong> Danke f&#252;rs Lesen &#8212; die n&#228;chste Ausgabe kommt am Samstag, 4. Juli 2026.</p><p>Hinter Agentic Weekly steckt <a href="https://fluxum.net/#about">Martin Gross</a>: w&#246;chentlich ein kompakter, meinungsstarker &#220;berblick zu Agentic Engineering, Agentic Coding und Claude Code.</p><p>Hat dir die Ausgabe gefallen? Leite sie gerne weiter oder empfiehl den Newsletter. Fragen, Anmerkungen oder Kritik? Antworte einfach auf diese Mail oder hinterlasse einen Kommentar.</p><div class="subscription-widget-wrap-editor" data-attrs="{&quot;url&quot;:&quot;https://blog.fluxum.net/subscribe?&quot;,&quot;text&quot;:&quot;Abonnieren&quot;,&quot;language&quot;:&quot;de&quot;}" data-component-name="SubscribeWidgetToDOM"><div class="subscription-widget show-subscribe"><div class="preamble"><p class="cta-caption">fluxum engineering ist eine von Leser unterst&#252;tzte Publikation. Um neue Posts zu erhalten und meine Arbeit zu unterst&#252;tzen, ziehen Sie in Betracht, ein Free- oder Paid-Abonnent zu werden.</p></div><form class="subscription-widget-subscribe"><input type="email" class="email-input" name="email" placeholder="E-Mail-Adresse eingeben &#8230;" tabindex="-1"><input type="submit" class="button primary" value="Abonnieren"><div class="fake-input-wrapper"><div class="fake-input"></div><div class="fake-button"></div></div></form></div></div>]]></content:encoded></item><item><title><![CDATA[Agentic Weekly #011 — Wer das Vakuum füllt]]></title><description><![CDATA[Anthropics Modelle sind weiter gesperrt, der Ton kippt &#8212; aber die Direktive bleibt.]]></description><link>https://blog.fluxum.net/p/agentic-weekly-011-wer-das-vakuum</link><guid isPermaLink="false">https://blog.fluxum.net/p/agentic-weekly-011-wer-das-vakuum</guid><dc:creator><![CDATA[Martin Gross]]></dc:creator><pubDate>Tue, 23 Jun 2026 19:51:36 GMT</pubDate><enclosure url="https://substackcdn.com/image/fetch/$s_!y_oj!,w_256,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fa142b85f-3d35-4a80-bdac-1835f765cd9e_512x512.png" length="0" type="image/jpeg"/><content:encoded><![CDATA[<p><strong>Anthropics Modelle sind weiter gesperrt, der Ton kippt &#8212; aber die Direktive bleibt. Vier Tage nach SpaceX&#8217; B&#246;rsengang kauft der Konzern f&#252;r 60 Milliarden Dollar den meistgenutzten KI-Editor. W&#228;hrend Washington abschaltet, ordnet sich der Rest des Markts neu.</strong></p><p>Dienstag, 23. Juni 2026 &#8212; Lesezeit: ~10 Min.</p><div class="subscription-widget-wrap-editor" data-attrs="{&quot;url&quot;:&quot;https://blog.fluxum.net/subscribe?&quot;,&quot;text&quot;:&quot;Abonnieren&quot;,&quot;language&quot;:&quot;de&quot;}" data-component-name="SubscribeWidgetToDOM"><div class="subscription-widget show-subscribe"><div class="preamble"><p class="cta-caption">fluxum engineering ist eine von Leser unterst&#252;tzte Publikation. Um neue Posts zu erhalten und meine Arbeit zu unterst&#252;tzen, ziehen Sie in Betracht, ein Free- oder Paid-Abonnent zu werden.</p></div><form class="subscription-widget-subscribe"><input type="email" class="email-input" name="email" placeholder="E-Mail-Adresse eingeben &#8230;" tabindex="-1"><input type="submit" class="button primary" value="Abonnieren"><div class="fake-input-wrapper"><div class="fake-input"></div><div class="fake-button"></div></div></form></div></div><h2>Die gro&#223;e Nachricht der Woche</h2><h3>Die Fable-Folgewoche &#8212; von &#8222;Modelle offline&#8221; zum Verhandlungs-Endspiel</h3><p>Die Trilogie aus #010 &#8212; Launch, heimliche Sabotage, Export-Stopp &#8212; ist erz&#228;hlt. Diese Woche zeigt, was danach passiert: Aus einem technischen Sicherheitsstreit ist ein geopolitischer geworden, und am Wochenende kippt der Ton, ohne dass sich der Stand &#228;ndert. Vier Str&#246;mungen verzahnen sich.</p><p><strong>Die neue Begr&#252;ndung &#8212; der China-Strang (15. Juni).</strong> Semafor liefert eine zweite Lesart der Sperre: Ein China-naher Akteur habe Zugriff auf Mythos gehabt, Amazons Sicherheitsteam habe daraufhin Exploits &#8212; also funktionierende Angriffe &#8212; f&#252;r vier verbreitete Apps erzeugen lassen und Finanzminister Bessent informiert. Das rahmt die Direktive nicht mehr nur als Jailbreak-Sorge, sondern als konkrete Spionage-Hypothese. Wichtig zur Einordnung: Die Kernbehauptung st&#252;tzt sich auf eine <strong>anonyme Geheimdienstquelle</strong>, eine unabh&#228;ngige Best&#228;tigung steht aus. heise greift den Strang auf, ohne ihn zu erh&#228;rten.</p><p><strong>Die G7-Antwort &#8212; &#201;vian-les-Bains (17. Juni).</strong> Beim AI-Working-Lunch mit Donald Trump fordern Dario Amodei (Anthropic) und Demis Hassabis (Google DeepMind) eine US-gef&#252;hrte KI-Koalition mit <em>&#8222;structured access to frontier models&#8221;</em> &#8212; also geregeltem Zugang zu Spitzenmodellen f&#252;r verb&#252;ndete Staaten. Emmanuel Macron formuliert die Gegenposition Europas am sch&#228;rfsten &#8212; sinngem&#228;&#223;: Niemand werde US-KI kaufen, die sich jederzeit abschalten lasse.</p><p>Die G7 bringen einen &#8222;Trusted Partners&#8221;-Mechanismus ins Gespr&#228;ch &#8212; ein Verfahren, das gepr&#252;ften Partnerstaaten verl&#228;sslichen Modellzugang garantieren soll.</p><p><strong>Der Anthropic-Pivot &#8212; Seoul (17./18. Juni).</strong> Sechs Tage nach dem Export-Stopp gegen ausl&#228;ndische Nutzer er&#246;ffnet Anthropic unter KiYoung Choi sein drittes APAC-B&#252;ro nach Tokio und Bengaluru, mit Gro&#223;kunden wie NAVER, Samsung SDS, LG CNS und Nexon. Eine Expansion in fremde M&#228;rkte, w&#228;hrend die eigenen Modelle f&#252;r genau deren B&#252;rger gesperrt sind &#8212; Optik mit Doppelboden.</p><p><strong>Das Verhandlungs-Endspiel &#8212; und die Ton-Wende am Wochenende.</strong> Anthropics International-Chef Chris Ciauri sagt in Seoul, man sei <em>&#8222;very confident&#8221;</em>, dass die Modelle <em>&#8222;in den kommenden Tagen&#8221;</em> wieder verf&#252;gbar seien; Globe and Mail berichtet parallel von laufenden Gespr&#228;chen zwischen Anthropic und Trump-Officials. Am <strong>20. Juni</strong> kippt der Ton: Auf die Frage, ob Anthropic eine Gefahr f&#252;r die nationale Sicherheit sei, antwortet Trump:</p><blockquote><p>&#8222;Well, not now, but a week ago, maybe.&#8221;</p></blockquote><p>Sinngem&#228;&#223;: jetzt nicht mehr, vor einer Woche vielleicht. Entscheidend ist der Unterschied zwischen Ton und Stand: Die Direktive <strong>bleibt in Kraft</strong>, Fable 5 und Mythos 5 bleiben auch am Dienstag (<strong>23. Juni</strong>) offline &#8212; die von Ciauri in Aussicht gestellten &#8222;kommenden Tage&#8221; sind verstrichen, der Stand ist unver&#228;ndert. Und die eigene Branche stellt sich quer: Schon am <strong>15. Juni</strong> forderten &#252;ber <strong>80 Cybersecurity-F&#252;hrungskr&#228;fte</strong>, darunter von NVIDIA und Adobe, in einem offenen Brief an Handelsminister Howard Lutnick und National Cyber Director Sean Cairncross die Aufhebung der Sperre.</p><p>W&#228;hrend die Modelle offline sind, baut Anthropic personell weiter: <strong>John Jumper</strong> &#8212; Chemie-Nobelpreistr&#228;ger 2024 und AlphaFold-Lead &#8212; verl&#228;sst nach rund neun Jahren Google DeepMind und geht zu Anthropic; Hassabis dankt f&#252;r eine <em>&#8222;extraordinary partnership&#8221;</em>. Nach dem Karpathy-Wechsel der n&#228;chste Spitzen-Zugang mitten in der Krisenwoche.</p><p><strong>Warum das relevant ist:</strong> Der Stand nach einer Woche ist nicht Eskalation, sondern H&#228;ngepartie &#8212; verhandelt wird hinter den Kulissen, der Ton wird weicher, die Sperre bleibt. F&#252;r jeden au&#223;erhalb der USA hei&#223;t das: Die Verf&#252;gbarkeit eines Spitzenmodells ist jetzt eine politische Variable, kein Vertragsdetail. Genau diese Unsicherheit treibt die beiden anderen Geschichten der Woche &#8212; den deutschen Souver&#228;nit&#228;ts-Reflex und die Bewegungen der Konkurrenz.</p><div><hr></div><h2>SpaceX kauft Cursor f&#252;r 60 Milliarden Dollar</h2><p>Es ist die gr&#246;&#223;te &#220;bernahme in der Geschichte des Developer-Toolings. Am <strong>16. Juni</strong> k&#252;ndigt SpaceX an, Anysphere &#8212; die Firma hinter dem KI-Coding-Editor <strong>Cursor</strong> &#8212; f&#252;r <strong>60 Milliarden Dollar</strong> zu &#252;bernehmen. Der Deal ist ein All-Stock-Deal (reine Aktien, kein Bargeld): Alle Anysphere-Anteile werden in SpaceX-Class-A-Aktien getauscht. Abschluss erwartet im dritten Quartal 2026, vorbehaltlich der Regulierungsfreigabe.</p><p>Die Vorgeschichte erkl&#228;rt den Preis. SpaceX hatte sich im April 2026 das Recht gesichert, Cursor f&#252;r 60 Milliarden Dollar in Aktien zu &#252;bernehmen &#8212; oder eine Abstandszahlung von 10 Milliarden Dollar zu leisten, falls der Deal platzt. Gezogen wird die Option jetzt, <strong>vier Tage nach SpaceX&#8217; B&#246;rsengang</strong> an der Nasdaq: Die Aktie ging zu 135 Dollar an den Start und schoss in den ersten Handelstagen steil nach oben &#8212; erst dieser Wertzuwachs macht den Aktien-Deal &#252;berhaupt rechenbar. Anysphere war zuvor mit rund 29 Milliarden Dollar bewertet.</p><p>Strategisch ist das ein Markteintritt. SpaceX, im Februar mit <strong>xAI</strong> verschmolzen, war im Agentic Coding bisher nur &#252;ber das Grok-Modell und die junge Grok-Build-Kommandozeile pr&#228;sent (erstmals in <a href="https://blog.fluxum.net/p/agentic-weekly-006-anthropic-schaltet">#006</a>). Mit Cursor kauft sich der Konzern auf einen Schlag den meistgenutzten KI-Editor &#8212; und das Modell darunter, dessen schnelles, g&#252;nstiges Composer 2.5 schon im Mai den Preisbruch in der Branche ausgel&#246;st hatte.</p><p>Passend dazu liefert Cursor in derselben Woche <strong>Version 3.8</strong>: ein <code>/automate</code>-Skill, der lokale Agent-Sessions automatisiert, neue Trigger &#252;ber GitHub und Slack, und &#8222;Computer Use&#8221; f&#252;r Cloud-Agenten &#8212; die F&#228;higkeit, eine grafische Oberfl&#228;che selbst zu bedienen, um etwa Demos oder Artefakte zu erzeugen. Und xAIs <strong>Grok Build</strong> bekommt ein Agent-Dashboard, das mehrere parallele Kommandozeilen-Sessions aus einem Terminal heraus &#252;berwacht &#8212; der Schritt von der einzelnen Session zur Mehr-Agenten-&#220;bersicht.</p><p><strong>Warum das relevant ist:</strong> In derselben Woche, in der ein Lab seine Spitzenmodelle per Regierungsanordnung vom Netz nimmt, kauft ein anderer Konzern die Werkzeugschicht dar&#252;ber f&#252;r eine Rekordsumme. Anthropic im Clinch mit der Regierung vor dem eigenen IPO, SpaceX frisch an der B&#246;rse und sofort auf Einkaufstour. Gleiche Woche, entgegengesetzte Kapitalmarkt-Logik.</p><div><hr></div><h2>Was die deutsche Reaktion zeigt</h2><p>W&#228;hrend international verhandelt wird, zeigt Deutschland, was der Stopp politisch ausl&#246;st. Innenminister <strong>Alexander Dobrindt</strong> warnt, man geh&#246;re <em>&#8222;sehr schnell zu den Opfern&#8221;</em>, und verweist auf BSI-Pr&#228;sidentin Plattner und die <em>&#8222;Umw&#228;lzungen im Umgang mit Sicherheitsl&#252;cken&#8221;</em>. Deutschland war in Gespr&#228;chen mit Anthropic, bekam aber keinen Mythos-Zugang &#8212; die erste hochrangige Bundesregierungs-Stimme zum Fall.</p><p>Die Wissenschaft ordnet ein: Das Science Media Center versammelt acht KI-Professorinnen und -Professoren. Gitta Kutyniok (LMU) fordert einen <em>&#8222;Airbus-Moment f&#252;r KI&#8221;</em> &#8212; ein europ&#228;isches Gro&#223;projekt nach dem Vorbild des Flugzeugbauers. Paul R&#246;ttger (Oxford) h&#228;lt dagegen: lieber vertraglich gesicherter Zugang als teure Eigenentwicklung. Andreas Hotho (W&#252;rzburg) erg&#228;nzt n&#252;chtern, dass <em>&#8222;andere frei verf&#252;gbare Modelle &#228;hnlich gut&#8221;</em> Schwachstellen finden k&#246;nnen. Bitkom und OSBA stehen auf R&#246;ttgers Seite &#8212; mit sch&#228;rferer Sprache: Wintergerst nennt die Abh&#228;ngigkeit vom <em>&#8222;US-Regierungs-Wohlwollen&#8221;</em> untragbar, Ganten sieht Open Source als einzige nicht-entziehbare Antwort. Aus Br&#252;ssel meldet sich Thomas Regnier, Kommissionssprecher f&#252;r technologische Souver&#228;nit&#228;t: Ma&#223;nahmen d&#252;rften <em>&#8222;nicht diskriminierend gegen&#252;ber Partnern&#8221;</em> sein.</p><div><hr></div><h2>Databricks ver&#246;ffentlicht Omnigent als Open Source</h2><p>Abseits der Politik kam diese Woche die eigentliche Engineering-Nachricht: Databricks stellt <strong>Omnigent</strong> unter Apache-2.0-Lizenz frei. Omnigent ist ein Meta-Harness &#8212; eine herstellerneutrale Steuerungsschicht, die &#252;ber mehreren Agenten-Werkzeugen wie Claude Code, Codex und eigenen Agenten liegt. Konfiguriert wird per YAML; das Framework bringt Ausf&#252;hrungs-Runner, Sandboxing und einheitliche Richtlinien f&#252;r Kosten, Umgang mit personenbezogenen Daten und Risiko-Bewertung mit. Ein Modellwechsel ist laut Databricks eine <em>&#8222;single line modification&#8221;</em> &#8212; eine einzige ge&#228;nderte Zeile.</p><p>Das &#8222;Der Harness wird zum Schlachtfeld&#8221;-Narrativ aus #007 bekommt damit eine Open-Source-Antwort: Nicht der Anbieter besitzt die Steuerungsschicht, sondern eine neutrale Konfiguration, die zwischen den Anbietern wechselt. Die technische Entsprechung zur Souver&#228;nit&#228;ts-Debatte eine Sektion h&#246;her: Wer die Steuerungsschicht kontrolliert, ist nicht mehr abschaltbar.</p><div><hr></div><h2>Claude Code: Die Highlights der Woche</h2><p>Mehrere Releases zwischen 15. und 22. Juni, von <strong>v2.1.178 bis v2.1.186</strong>.</p><h3>F&#252;r Multi-Agent- und Skill-Workflows</h3><p><code>v2.1.178</code><strong> &#8212; Agent-Teams umgebaut, neue Permission-Syntax</strong> (15. Juni) &#8212; <code>TeamCreate</code>/<code>TeamDelete</code> sind weg; Teammates werden jetzt direkt &#252;ber <code>Agent(name:&#8230;)</code> angesprochen. Neu ist eine feinere Berechtigungs-Syntax <code>Tool(param:value)</code> &#8212; etwa <code>Agent(model:opus)</code>, um den Einsatz eines bestimmten Modells gezielt zu sperren. Au&#223;erdem laden verschachtelte <code>.claude/skills</code>-Ordner jetzt zuverl&#228;ssig &#8212; das schlie&#223;t die L&#252;cke aus dem Plugin-Autoloading der letzten Wochen.</p><h3>F&#252;r alle, die Auto Mode produktiv nutzen</h3><p><code>v2.1.183</code><strong> &#8212; destruktive Befehle im Auto Mode geblockt</strong> (19. Juni) &#8212; Auto Mode (Claude entscheidet selbst, welche Aktionen unkritisch sind und keine R&#252;ckfrage brauchen) bekommt sein erstes Sicherheits-Hardening: <code>git reset --hard</code>, <code>checkout -- .</code>, <code>clean -fd</code>, <code>stash drop</code> sowie <code>terraform/pulumi/cdk destroy</code> werden ohne explizite Anweisung nicht mehr ausgef&#252;hrt. Genau die Art von Leitplanke, die man sich w&#252;nscht, sobald man Auto Mode aus der Tokyo-Demo wirklich auf ein Repo losl&#228;sst. (<code>attribution.sessionUrl</code>-Setting und <code>WebSearch</code>-Fixes in Sub-Agenten kommen in demselben Release mit.)</p><h3>F&#252;r den Alltag</h3><p><code>v2.1.181</code><strong> &#8212; </strong><code>/config key=value</code><strong> aus dem Prompt, Bun-Runtime auf 1.4</strong> (17. Juni) &#8212; Konfiguration l&#228;sst sich jetzt direkt aus dem Prompt setzen; dazu ein Prompt-Caching-Fix f&#252;r eigene API-Endpunkte und ein Schutz gegen 0-Byte-Dateien auf Netzlaufwerken. Der Patch <code>v2.1.185</code> (20. Juni) formuliert nur den Hinweis bei h&#228;ngendem Antwort-Stream ruhiger um und hebt das Timeout von 10 auf 20 Sekunden. <code>v2.1.186</code> (22. Juni) legt nach: <code>claude mcp login</code>/<code>logout</code> meldet MCP-Server direkt aus der Kommandozeile an (ohne <code>/mcp</code>-Men&#252;, per <code>--no-browser</code> auch &#252;ber SSH), und Bash-Ausgaben l&#246;sen jetzt automatisch eine Claude-Antwort aus (<code>respondToBashCommands: false</code> schaltet es ab).</p><p><strong>Billing-Umstellung verschoben</strong> (16. Juni) &#8212; Und eine Nachricht mit Politik-Beigeschmack: Anthropic verschiebt die geplante Abrechnungs-Umstellung. <code>claude -p</code>, das Agent SDK und Drittanbieter-Apps bleiben vorerst im Abo statt nach Verbrauch abgerechnet zu werden. Als Gr&#252;nde nennt the-decoder den Preisdruck durch OpenAI, die IPO-Sensibilit&#228;t und die regulatorische Unsicherheit rund um die Modell-Sperre.</p><div><hr></div><h2>Agentic Coding</h2><p><strong>Codex CLI v0.141 und Record &amp; Replay</strong> (18. Juni) &#8212; OpenAI baut die Fernsteuerung aus: Die CLI bekommt <strong>Remote Executors</strong>, also das Ausf&#252;hren von Aufgaben auf entfernten Rechnern &#252;ber verschl&#252;sselte Kan&#228;le, plattform&#252;bergreifend und mit MCP-Anbindung pro Thread (MCP ist der offene Standard, &#252;ber den externe Werkzeuge an KI-Agenten angeschlossen werden). Parallel bringt die Codex-App <strong>&#8222;Record &amp; Replay&#8221;</strong>: einen macOS-Workflow einmal aufzeichnen und in einen wiederverwendbaren Skill umwandeln. Das ist exakt dasselbe Muster wie Cursors <code>/automate</code> weiter oben &#8212; beide am selben Tag, beide &#8222;lokalen Ablauf aufnehmen &#8594; Skill&#8221;. Die Konvergenz ist die eigentliche Geschichte. Pikant f&#252;r europ&#228;ische Nutzer: Obwohl OpenAI Computer Use &#8212; die Voraussetzung f&#252;r Record &amp; Replay &#8212; schon am 16. Juni in die EU gebracht hat, bleibt das neue Feature selbst in EU, UK und der Schweiz vorerst gesperrt.</p><p><strong>Cline v3.0.28</strong> (19. Juni) &#8212; Die Open-Source-Front zieht nach: neues Onboarding mit ausw&#228;hlbaren Modellen, ein Katalog wiederverwendbarer Bausteine (&#8222;Hub&#8221;), sofort wirkende Auto-Approve-Schalter und das K&#252;rzen gro&#223;er Tool-Ergebnisse f&#252;rs Kontext-Budget. Der Hub-Katalog ist die eigentliche Architektur-Erg&#228;nzung.</p><div><hr></div><h2>Trend der Woche</h2><h3>Wer das Vakuum f&#252;llt</h3><p>W&#228;hrend Washington den Hahn zudreht, machen andere die T&#252;r weiter auf &#8212; auf zwei Wegen. Den vertraglichen geht <strong>Mistral</strong>: CEO Arthur Mensch positioniert sich offensiv &#8212; Mistral stehe <em>&#8222;outside of centralised control exercised by states or corporations&#8221;</em>, Frankreich rollt Mistral-Werkzeuge f&#252;r den Staatsdienst aus, das Lab verhandelt eine Bewertung im zweistelligen Milliarden-Euro-Bereich, und Cohere meldet <em>&#8222;huge inbound&#8221;</em>. Den offenen Weg geht China: Das Lab Z.ai ver&#246;ffentlicht mit <strong>GLM-5.2</strong> ein Open-Weights-Modell (nach Angaben des Labs 753 Mrd. Parameter, 1 Mio. Token Kontext, MIT-Lizenz) &#8212; genau in der Woche, in der die US-Regierung ein US-Spitzenmodell deaktiviert. Simon Willison hat es bereits angetestet.</p><p>Der offene Brief der 80 Sicherheitschefs geh&#246;rt in dieselbe Bewegung: Diesmal ist es die US-Industrie selbst, die sich gegen die Abschalt-Logik der eigenen Regierung stellt. Die Frage der n&#228;chsten Monate ist nicht, <em>ob</em> das Vakuum gef&#252;llt wird, sondern <em>womit</em> &#8212; mit vertraglich gesichertem Zugang, mit frei herunterladbaren Modellen, oder mit politischem Druck von innen.</p><div><hr></div><h2>Tipp der Woche</h2><p><strong>Sean Lynch &#252;ber MCP &#8212; was das Protokoll wirklich leistet</strong> (19. Juni, via Simon Willison) &#8212; In einem Satz bringt Lynch die laufende &#8222;Skills vs. MCP&#8221;-Debatte auf den Punkt: <em>&#8222;The real valuable capability MCP offers over skills/CLI is isolating the auth flow outside of the agent&#8217;s context window &#8230;&#8221;</em> Sinngem&#228;&#223;: Der eigentliche Mehrwert von MCP gegen&#252;ber Skills oder einer reinen CLI liegt darin, die Anmeldung (den &#8222;Auth-Flow&#8221;) aus dem Sichtfeld des Agenten herauszuhalten. <strong>Warum das hier steht:</strong> Wer sich fragt, wof&#252;r man MCP &#252;berhaupt braucht, wenn Skills so vieles k&#246;nnen, bekommt hier die sch&#228;rfste Antwort in einem Absatz &#8212; MCP im Kern als Auth-Gateway.</p><p><strong>SemiAnalysis &#8212; &#8222;RL Systems Mind the Gap&#8221;</strong> (16. Juni) &#8212; F&#252;r alle, die tiefer wollen: Das St&#252;ck erkl&#228;rt, warum die Abstimmung von Trainer- und Generator-Durchsatz das zentrale Nadel&#246;hr moderner RL-Pipelines (Reinforcement Learning, das Nachtrainieren von Modellen &#252;ber Belohnungssignale) ist. <strong>Warum das hier steht:</strong> Es erkl&#228;rt eine konkrete Industrie-Mechanik statt nur einen Trend &#8212; und damit, warum Post-Training so teuer ist.</p><div><hr></div><h2>Kurz notiert</h2><ul><li><p><strong>Refund-Frist abgelaufen</strong> (20. Juni, 23:59 PT) &#8212; Die anteilige R&#252;ckerstattung f&#252;r Pro/Max/Team-Upgrades zwischen dem 9. und 14. Juni ist ohne gemeldete Verl&#228;ngerung ausgelaufen.</p></li><li><p><strong>GitHub Copilot baut Budget-Werkzeuge</strong> (17./19. Juni) &#8212; Ein Blog-Beitrag erkl&#228;rt besseres Model-Routing, mit dem Credits l&#228;nger reichen; dazu kommt ein Feld <code>ai_credits_used</code> pro Nutzer in die Usage-Metrics-API. Beides zielt auf die Kostentransparenz, um die sich die Pricing-Debatte der letzten Wochen dreht.</p></li></ul><div><hr></div><h2>Quellen</h2><p><strong>Die gro&#223;e Nachricht der Woche:</strong> <a href="https://www.semafor.com/article/06/13/2026/white-house-move-to-limit-anthropic-linked-to-concerns-about-chinese-access-to-mythos">Semafor &#8212; White-House-Move wegen China-Zugang zu Mythos</a> &#183; <a href="https://www.heise.de/en/news/Ban-on-Anthropic-s-AI-models-China-allegedly-had-access-to-Mythos-11331794.html">heise &#8212; Einordnung</a> &#183; <a href="https://www.cnbc.com/2026/06/17/anthropic-amodei-google-hassabis-us-ai-coalition-g7.html">CNBC &#8212; Amodei/Hassabis fordern US-Koalition</a> &#183; <a href="https://fortune.com/2026/06/17/g7-ai-sovereignty-europe-anthropic-blackout-trump/">Fortune &#8212; G7 AI Sovereignty</a> &#183; <a href="https://www.thenationalnews.com/news/europe/2026/06/17/g7-pitches-trusted-partnership-to-ai-chiefs-in-a-bid-for-frontier-model-sharing/">The National &#8212; G7 Trusted Partners</a> &#183; <a href="https://www.anthropic.com/news/seoul-becomes-third-anthropic-office-in-asia-pacific">Anthropic &#8212; Seoul wird drittes APAC-B&#252;ro</a> &#183; <a href="https://www.koreajoongangdaily.com/business/anthropic-confident-of-reenabling-mythos-fable-5-access-in-coming-days-executive/12727522">Korea JoongAng Daily &#8212; Ciauri</a> &#183; <a href="https://www.theglobeandmail.com/business/article-anthropic-trump-officials-deal-restore-fable-5-mythos-5/">Globe and Mail &#8212; Verhandlungen + Open Letter</a> &#183; <a href="https://www.benzinga.com/markets/tech/26/06/60003904/trump-anthropic-national-security-threat-a-week-ago-but-not-now">Benzinga &#8212; Trump &#8222;not now&#8221;</a> &#183; <a href="https://www.aljazeera.com/news/2026/6/19/us-export-ban-on-anthropics-ai-models-further-strains-alliances">Al Jazeera &#8212; Allianz-Reaktionen</a> &#183; <a href="https://the-decoder.com/google-deepmind-loses-another-top-ai-researcher-as-nobel-laureate-john-jumper-leaves-for-anthropic/">the-decoder &#8212; Jumper zu Anthropic</a></p><p><strong>SpaceX kauft Cursor:</strong> <a href="https://techcrunch.com/2026/06/16/spacex-to-acquire-cursor-for-60b-in-stock-days-after-blockbuster-ipo/">TechCrunch &#8212; SpaceX to acquire Cursor for $60B</a> &#183; <a href="https://www.cbsnews.com/news/spacex-cursor-60-billion-ai-acquisition/">CBS News</a> &#183; <a href="https://aibusiness.com/generative-ai/spacex-aims-agentic-coding-60b-cursor-acquisition">AI Business &#8212; Agentic Coding</a> &#183; <a href="https://cursor.com/changelog">Cursor Changelog &#8212; 3.8</a> &#183; <a href="https://x.ai/build/changelog">xAI Build Changelog</a></p><p><strong>Was die deutsche Reaktion zeigt:</strong> <a href="https://www.cio.de/article/4186098/nach-us-ki-sperre-dobrindt-warnt-vor-opferrolle-im-wettruesten.html">CIO.de &#8212; Dobrindt</a> &#183; <a href="https://www.sciencemediacenter.de/angebote/anordnung-der-us-regierung-anthropic-schraenkt-zugang-zu-neuen-ki-modellen-ein-26149">Science Media Center &#8212; Expertenstimmen</a> &#183; <a href="https://www.bitkom.org/Presse/Presseinformation/Bitkom-zur-US-Sperre-fuer-KI-Modelle">Bitkom &#8212; Wintergerst</a> &#183; <a href="https://osb-alliance.de/pressemitteilungen/anthropic-schaltet-ki-modelle-auf-druck-der-us-regierung-ab-ein-weckruf-fuer-europa">OSBA &#8212; Ganten</a> &#183; <a href="https://the-decoder.de/eu-prueft-folgen-der-anthropic-sperre-forscher-fordern-airbus-moment-fuer-ki/">the-decoder.de &#8212; EU pr&#252;ft Folgen</a></p><p><strong>Databricks Omnigent:</strong> <a href="https://www.heise.de/en/news/Meta-Harness-for-AI-Agents-Databricks-Releases-Omnigent-as-Open-Source-11335496.html">heise &#8212; Databricks Releases Omnigent as Open Source</a></p><p><strong>Claude Code:</strong> <a href="https://code.claude.com/docs/en/changelog">Changelog</a> &#183; <a href="https://the-decoder.de/anthropic-rudert-bei-claude-abrechnung-zurueck-und-laesst-drittanbieter-nutzung-vorerst-im-abo/">the-decoder.de &#8212; Anthropic verschiebt Billing-Umstellung</a></p><p><strong>Agentic Coding:</strong> <a href="https://developers.openai.com/codex/changelog">Codex Changelog</a> &#183; <a href="https://github.com/openai/codex/releases">Codex Releases</a> &#183; <a href="https://the-decoder.com/openais-codex-can-now-watch-you-work-once-and-repeat-the-task-forever/">the-decoder &#8212; Codex Record &amp; Replay (EU/UK/CH gesperrt)</a> &#183; <a href="https://github.com/cline/cline/releases">Cline Releases</a></p><p><strong>Trend der Woche:</strong> <a href="https://sifted.eu/articles/mistral-arthur-mensch-open-source-anthropic">Sifted &#8212; Mistral Sovereignty</a> &#183; <a href="https://www.gurufocus.com/news/8918523/anthropic-ban-could-boost-mistrals-20-billion-ai-push">GuruFocus &#8212; Mistral-Bewertung</a> &#183; <a href="https://simonwillison.net/2026/Jun/17/glm-52/">Simon Willison &#8212; GLM-5.2</a></p><p><strong>Tipp der Woche:</strong> <a href="https://simonwillison.net/2026/Jun/19/sean-lynch/">Simon Willison &#8212; Sean Lynch zu MCP</a> &#183; <a href="https://newsletter.semianalysis.com/p/rl-systems-mind-the-gap-matching">SemiAnalysis &#8212; RL Systems Mind the Gap</a></p><p><strong>Kurz notiert:</strong> <a href="https://www.techtimes.com/articles/318760/20260620/fable-5-ban-update-trump-softens-directive-stands-refund-deadline-closes-today.htm">TechTimes &#8212; Refund-Frist</a> &#183; <a href="https://github.blog/">GitHub Blog &#8212; Getting more from each token</a> &#183; <a href="https://github.blog/changelog/2026-06-19-ai-credits-consumed-per-user-now-in-the-copilot-usage-metrics-api/">GitHub Changelog &#8212; ai_credits_used</a></p><div><hr></div><p><strong>Das war Agentic Weekly #011.</strong> Danke f&#252;rs Lesen &#8212; die n&#228;chste Ausgabe kommt am Samstag, 27. Juni 2026.</p><p>Hinter Agentic Weekly steckt <a href="https://fluxum.net/#about">Martin Gross</a>: w&#246;chentlich ein kompakter, meinungsstarker &#220;berblick zu Agentic Engineering, Agentic Coding und Claude Code.</p><p>Hat dir die Ausgabe gefallen? Leite sie gerne weiter oder empfiehl den Newsletter. Fragen, Anmerkungen oder Kritik? Antworte einfach auf diese Mail oder hinterlasse einen Kommentar.</p><div class="subscription-widget-wrap-editor" data-attrs="{&quot;url&quot;:&quot;https://blog.fluxum.net/subscribe?&quot;,&quot;text&quot;:&quot;Abonnieren&quot;,&quot;language&quot;:&quot;de&quot;}" data-component-name="SubscribeWidgetToDOM"><div class="subscription-widget show-subscribe"><div class="preamble"><p class="cta-caption">fluxum engineering ist eine von Leser unterst&#252;tzte Publikation. Um neue Posts zu erhalten und meine Arbeit zu unterst&#252;tzen, ziehen Sie in Betracht, ein Free- oder Paid-Abonnent zu werden.</p></div><form class="subscription-widget-subscribe"><input type="email" class="email-input" name="email" placeholder="E-Mail-Adresse eingeben &#8230;" tabindex="-1"><input type="submit" class="button primary" value="Abonnieren"><div class="fake-input-wrapper"><div class="fake-input"></div><div class="fake-button"></div></div></form></div></div>]]></content:encoded></item><item><title><![CDATA[Agentic Weekly #009 — Anthropic geht aufs Parkett, Microsoft baut eigene Modelle, der Zähler läuft]]></title><description><![CDATA[Anthropic reicht S-1 ein, Microsoft stellt sieben eigene MAI-Modelle gegen die Anthropic-Abh&#228;ngigkeit, und Uber deckelt das KI-Budget bei $1.500 pro Tool &#8212; die Woche, in der das Coding-Layer erwachsen wird und die subventionierte Gratis-Schleife endet.]]></description><link>https://blog.fluxum.net/p/agentic-weekly-009-anthropic-geht</link><guid isPermaLink="false">https://blog.fluxum.net/p/agentic-weekly-009-anthropic-geht</guid><dc:creator><![CDATA[Martin Gross]]></dc:creator><pubDate>Sat, 06 Jun 2026 12:47:32 GMT</pubDate><enclosure url="https://substackcdn.com/image/fetch/$s_!zRcZ!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fc401ab98-08e7-430e-99a9-e584efce5b3e_1672x941.png" length="0" type="image/jpeg"/><content:encoded><![CDATA[<p><strong>Anthropic reicht S-1 ein, Microsoft stellt sieben eigene MAI-Modelle gegen die Anthropic-Abh&#228;ngigkeit, und Uber deckelt das KI-Budget bei $1.500 pro Tool &#8212; die Woche, in der das Coding-Layer erwachsen wird und die subventionierte Gratis-Schleife endet.</strong></p><div class="captioned-image-container"><figure><a class="image-link image2 is-viewable-img" target="_blank" href="https://substackcdn.com/image/fetch/$s_!zRcZ!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fc401ab98-08e7-430e-99a9-e584efce5b3e_1672x941.png" data-component-name="Image2ToDOM"><div class="image2-inset"><picture><source type="image/webp" srcset="https://substackcdn.com/image/fetch/$s_!zRcZ!,w_424,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fc401ab98-08e7-430e-99a9-e584efce5b3e_1672x941.png 424w, https://substackcdn.com/image/fetch/$s_!zRcZ!,w_848,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fc401ab98-08e7-430e-99a9-e584efce5b3e_1672x941.png 848w, https://substackcdn.com/image/fetch/$s_!zRcZ!,w_1272,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fc401ab98-08e7-430e-99a9-e584efce5b3e_1672x941.png 1272w, https://substackcdn.com/image/fetch/$s_!zRcZ!,w_1456,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fc401ab98-08e7-430e-99a9-e584efce5b3e_1672x941.png 1456w" sizes="100vw"><img src="https://substackcdn.com/image/fetch/$s_!zRcZ!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fc401ab98-08e7-430e-99a9-e584efce5b3e_1672x941.png" width="1456" height="819" data-attrs="{&quot;src&quot;:&quot;https://substack-post-media.s3.amazonaws.com/public/images/c401ab98-08e7-430e-99a9-e584efce5b3e_1672x941.png&quot;,&quot;srcNoWatermark&quot;:null,&quot;fullscreen&quot;:null,&quot;imageSize&quot;:null,&quot;height&quot;:819,&quot;width&quot;:1456,&quot;resizeWidth&quot;:null,&quot;bytes&quot;:1776151,&quot;alt&quot;:null,&quot;title&quot;:null,&quot;type&quot;:&quot;image/png&quot;,&quot;href&quot;:null,&quot;belowTheFold&quot;:false,&quot;topImage&quot;:true,&quot;internalRedirect&quot;:&quot;https://blog.fluxum.net/i/200885716?img=https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fc401ab98-08e7-430e-99a9-e584efce5b3e_1672x941.png&quot;,&quot;isProcessing&quot;:false,&quot;align&quot;:null,&quot;offset&quot;:false}" class="sizing-normal" alt="" srcset="https://substackcdn.com/image/fetch/$s_!zRcZ!,w_424,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fc401ab98-08e7-430e-99a9-e584efce5b3e_1672x941.png 424w, https://substackcdn.com/image/fetch/$s_!zRcZ!,w_848,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fc401ab98-08e7-430e-99a9-e584efce5b3e_1672x941.png 848w, https://substackcdn.com/image/fetch/$s_!zRcZ!,w_1272,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fc401ab98-08e7-430e-99a9-e584efce5b3e_1672x941.png 1272w, https://substackcdn.com/image/fetch/$s_!zRcZ!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fc401ab98-08e7-430e-99a9-e584efce5b3e_1672x941.png 1456w" sizes="100vw" fetchpriority="high"></picture><div class="image-link-expand"><div class="pencraft pc-display-flex pc-gap-8 pc-reset"><button tabindex="0" type="button" class="pencraft pc-reset pencraft icon-container restack-image"><svg role="img" width="20" height="20" viewBox="0 0 20 20" fill="none" stroke-width="1.5" stroke="var(--color-fg-primary)" stroke-linecap="round" stroke-linejoin="round" xmlns="http://www.w3.org/2000/svg"><g><title></title><path d="M2.53001 7.81595C3.49179 4.73911 6.43281 2.5 9.91173 2.5C13.1684 2.5 15.9537 4.46214 17.0852 7.23684L17.6179 8.67647M17.6179 8.67647L18.5002 4.26471M17.6179 8.67647L13.6473 6.91176M17.4995 12.1841C16.5378 15.2609 13.5967 17.5 10.1178 17.5C6.86118 17.5 4.07589 15.5379 2.94432 12.7632L2.41165 11.3235M2.41165 11.3235L1.5293 15.7353M2.41165 11.3235L6.38224 13.0882"></path></g></svg></button><button tabindex="0" type="button" class="pencraft pc-reset pencraft icon-container view-image"><svg xmlns="http://www.w3.org/2000/svg" width="20" height="20" viewBox="0 0 24 24" fill="none" stroke="currentColor" stroke-width="2" stroke-linecap="round" stroke-linejoin="round" class="lucide lucide-maximize2 lucide-maximize-2"><polyline points="15 3 21 3 21 9"></polyline><polyline points="9 21 3 21 3 15"></polyline><line x1="21" x2="14" y1="3" y2="10"></line><line x1="3" x2="10" y1="21" y2="14"></line></svg></button></div></div></div></a></figure></div><p>Samstag, 6. Juni 2026 &#8212; Lesezeit: ~8 Min.</p><div class="subscription-widget-wrap-editor" data-attrs="{&quot;url&quot;:&quot;https://blog.fluxum.net/subscribe?&quot;,&quot;text&quot;:&quot;Abonnieren&quot;,&quot;language&quot;:&quot;de&quot;}" data-component-name="SubscribeWidgetToDOM"><div class="subscription-widget show-subscribe"><div class="preamble"><p class="cta-caption">fluxum engineering ist eine von Leser unterst&#252;tzte Publikation. Um neue Posts zu erhalten und meine Arbeit zu unterst&#252;tzen, ziehen Sie in Betracht, ein Free- oder Paid-Abonnent zu werden.</p></div><form class="subscription-widget-subscribe"><input type="email" class="email-input" name="email" placeholder="E-Mail-Adresse eingeben &#8230;" tabindex="-1"><input type="submit" class="button primary" value="Abonnieren"><div class="fake-input-wrapper"><div class="fake-input"></div><div class="fake-button"></div></div></form></div></div><div><hr></div><h2>Die gro&#223;e Nachricht der Woche</h2><h3>Der KI-Coding-Layer formiert sich</h3><p>An zwei aufeinanderfolgenden Tagen wird sichtbar, wie sich die Schicht, die Code schreibt, marktwirtschaftlich verfestigt: Anthropic bereitet den Gang an die B&#246;rse vor, Microsoft baut sich aus der Abh&#228;ngigkeit von fremden Modellen heraus. Zwei Achsen lohnen den Blick.</p><p><strong>Anthropic geht aufs Parkett</strong> &#8212; die Kapitalmarkt-Achse.</p><p>Am <strong>1. Juni</strong> hat Anthropic vertraulich einen Entwurf der <strong>Form S-1</strong> bei der SEC eingereicht &#8212; der erste Schritt eines m&#246;glichen B&#246;rsengangs. Die Mitteilung ist betont n&#252;chtern (Rule 135): Zahl und Preis der Aktien stehen nicht fest, der Gang aufs Parkett &#8222;h&#228;ngt von Marktbedingungen und anderen Faktoren ab&#8221; und wird erst nach Abschluss der SEC-Pr&#252;fung zur Option.</p><p>Die Gr&#246;&#223;enordnung liefert die Berichterstattung, nicht Anthropic: Laut TechCrunch tr&#228;gt die Firma die rund <strong>$965 Mrd. Bewertung</strong> aus der Series H (#008) in das Verfahren, und die Run-Rate ist von <strong>$9 Mrd. Ende 2025 auf &#252;ber $47 Mrd.</strong> gesprungen. Das Bemerkenswerte ist weniger die Zahl als der Schritt selbst: Anthropic ist das erste Frontier-Lab, das den Weg an die &#246;ffentliche B&#246;rse formal er&#246;ffnet &#8212; vor OpenAI, vor xAI.</p><p><strong>Microsoft baut sich um Agents herum</strong> &#8212; die Stack-Achse.</p><p>Auf der <strong>Build 2026</strong> (2./3. Juni) stellt Microsoft <strong>sieben neue MAI-Modelle</strong> vor &#8212; und das Signal sitzt in der Positionierung. Das Coding-Flaggschiff <strong>MAI-Code-1-Flash</strong> ist ein bewusst kleines Modell (5 Mrd. aktive Parameter), das Microsoft als &#8222;comparable to Haiku but cheaper&#8221; beschreibt &#8212; also gegen Anthropics <em>g&#252;nstigstes</em> Modell, nicht gegen die Spitze. Es ist im Copilot-Model-Picker in VS Code w&#228;hlbar, vorerst als limitierter Rollout.</p><p>Das zieht sich durch die Modellfamilie: Das neue Reasoning-Modell <strong>MAI-Thinking-1</strong> wird laut Microsoft &#8222;in blind side-by-sides&#8221; gegen&#252;ber <strong>Sonnet 4.6</strong> bevorzugt &#8212; Anthropics Mittelklasse. Ein Head-to-Head gegen GPT-5.5, Opus 4.8 oder Gemini taucht nirgends auf. Microsoft baut hier kein Frontier-Modell, sondern die billige Arbeitspferd-Schicht: effizienz-first (das Excel-getunte MAI &#8222;matches GPT-5.4 while being up to 10&#215; more efficient&#8221;), w&#228;hrend die Spitze weiter eingekauft wird &#8212; Opus und GPT bleiben in Copilot w&#228;hlbar.</p><p>Dazu zwei Bausteine, die zeigen, wie ernst der Umbau ist. <strong>Rayfin</strong> ist ein Open-Source-Backend-as-a-Service, mit dem Entwickler <em>und</em> Coding-Agents ein komplettes App-Backend in Code definieren und nach <strong>Microsoft Fabric</strong> deployen &#8212; Microsofts Br&#252;cke von &#8222;Vibe Coding&#8221; zur produktionstauglichen App (Launch-Partner: Replit). Und die <strong>GitHub Copilot App</strong> (Desktop-Preview) startet aus einer Idee heraus mehrere Agent-Sessions parallel. Nadella klammert das unter eine angek&#252;ndigte &#8222;Copilot Super App&#8221; aus Chat, Cowork und Code.</p><p><strong>Warum das relevant ist:</strong> CNBC brachte die Woche auf die Formel, Microsoft und Google seien &#8222;late to AI coding&#8221; &#8212; und genau das adressiert Build. Microsoft reduziert mit eigenen Modellen die Abh&#228;ngigkeit von OpenAI und Anthropic, ohne den Anspruch zu erheben, die Frontier zu schlagen; die Strategie ist Kosten und Kontrolle, nicht Capability-Maximierung.</p><div><hr></div><h2>Project Glasswing skaliert auf kritische Infrastruktur</h2><p>Am <strong>2. Juni</strong> weitet Anthropic <strong>Project Glasswing</strong> drastisch aus: rund <strong>150 neue Organisationen</strong> in mehr als <strong>15 L&#228;ndern</strong> kommen hinzu &#8212; Power, Water, Healthcare, Communications und Hardware-Hersteller. Damit sind rund <strong>200 Organisationen</strong> an Bord. Die bisherigen Partner haben mit der <strong>Claude Mythos Preview</strong> <strong>mehr als 10.000 high- oder critical-severity-Schwachstellen</strong> gefunden. Anthropic sch&#228;tzt, dass bei den meisten dieser Partner ein gr&#246;&#223;erer Angriff <strong>&#252;ber 100 Millionen Menschen</strong> treffen k&#246;nnte.</p><p>Das ist der Skalierungs-Beleg f&#252;r die Mythos-Linie: Was in #007 als &#246;ffentlicher Disclosure-Z&#228;hler startete, wird hier zum Programm f&#252;r kritische Infrastruktur. Flankierend macht Anthropic <strong>Claude Security</strong> allgemein verf&#252;gbar &#8212; bisher als &#8222;Claude Code Security&#8221; in Limited Preview, jetzt GA f&#252;r Enterprise. Geplante und gezielte Scans, Audit-Integration, ein Confidence-Rating pro Finding und mehrstufige Validierung gegen False Positives sollen den Weg vom Scan zum eingespielten Patch &#8222;in einem Sitting&#8221; tragen. Die Offensiv-Seite (Mythos findet L&#252;cken) und die Defensiv-Seite (Security patcht sie) werden damit zur selben Produktlinie.</p><div><hr></div><h2>Claude Code: Die Highlights der Woche</h2><p>Mehrere Releases zwischen 29. Mai und 6. Juni, von <strong>v2.1.157 bis v2.1.167</strong>. Schwerpunkt: Plugin-Autoloading, Ausfallsicherheit und Enterprise-Versionskontrolle.</p><h3>F&#252;r alle, die Claude Code t&#228;glich nutzen</h3><p><code>fallbackModel</code><strong> &#8212; sanfte Degradierung bei &#220;berlast</strong> (v2.1.166, 6. Juni) &#8212; Ein neues Setting konfiguriert bis zu drei Fallback-Modelle, die der Reihe nach versucht werden, wenn das prim&#228;re Modell &#252;berlastet oder nicht erreichbar ist; <code>--fallback-model</code> greift jetzt in interaktiven Sessions, und Claude wiederholt einen Turn auf dem Fallback, wenn die API einen unerwarteten Fehler wirft. F&#252;r alle, die produktiv auf Opus angewiesen sind und Peak-Hour-Ausf&#228;lle kennen, ist das der bisher fehlende Resilienz-Baustein.</p><p><code>/plugin list</code><strong> mit Filtern</strong> (v2.1.163, 4. Juni) &#8212; Listet installierte Plugins mit <code>--enabled</code>/<code>--disabled</code>. Dazu kleine Alltagshilfen: <code>c</code> kopiert die Markdown-Antwort aus <code>/btw</code>, Hooks k&#246;nnen &#252;ber <code>hookSpecificOutput.additionalContext</code> Kontext zur&#252;ckgeben.</p><h3>F&#252;r Plugin- und Skill-Workflows</h3><p><strong>Plugins laden automatisch aus </strong><code>.claude/skills</code> (v2.1.157, 29. Mai) &#8212; Plugins in <code>.claude/skills</code>-Verzeichnissen werden jetzt ohne Marketplace geladen, <code>claude plugin init &lt;name&gt;</code> scaffoldet ein neues Plugin direkt, und die Autocomplete kennt <code>/plugin</code>-Subkommandos sowie installierte Plugin-Namen. Die H&#252;rde, eigene Skills zu paketieren und zu teilen, sinkt damit weiter &#8212; passend zur Skill-Welle der letzten Wochen.</p><h3>F&#252;r CI/CD und Plattform</h3><p><strong>Auto Mode auf Bedrock, Vertex und Foundry</strong> (v2.1.158, 30. Mai) &#8212; Der Auto Mode ist jetzt auf allen drei Enterprise-Cloud-Tiers verf&#252;gbar (f&#252;r Opus 4.7 und 4.8), Opt-in via <code>CLAUDE_CODE_ENABLE_AUTO_MODE=1</code>. Damit ist das Setup f&#252;r Cloud-gebundene Enterprise-Kunden geschlossen.</p><p><strong>Versionskontrolle und geh&#228;rtetes Cross-Session-Messaging</strong> (v2.1.163 / v2.1.166) &#8212; Neue Managed Settings <code>requiredMinimumVersion</code> und <code>requiredMaximumVersion</code> erlauben Org-Admins, die erlaubte Claude-Code-Version zu pinnen. Sicherheitsseitig tragen &#252;ber <code>SendMessage</code> weitergereichte Nachrichten zwischen Sessions keine User-Autorit&#228;t mehr &#8212; eine ganze Klasse von Privilege-Confusion-Bugs in Multi-Agent-Setups f&#228;llt damit weg.</p><div><hr></div><h2>Agentic Coding</h2><p><strong>Cursor 3.7</strong> (4. Juni) &#8212; Zwei Neuerungen tragen die Story, nachdem Composer 2.5 zuletzt im Mittelpunkt stand. Der <strong>Design Mode f&#252;r Canvas</strong> l&#228;sst UI-Elemente direkt im Canvas selektieren und annotieren, statt sie in Prosa zu beschreiben &#8212; der Agent bekommt die &#196;nderung gezeigt, nicht erz&#228;hlt. Und der <strong>Context Explorer</strong> macht sichtbar, wie sich die Tokens auf System-Prompt, Tool-Definitionen, Rules und Skills verteilen &#8212; eine direkte Antwort auf das Context-Visibility-Problem, das Power-User seit Monaten umtreibt. Dazu: <strong>Organizations</strong> f&#252;r Enterprise sind GA, und <strong>Bugbot</strong> wechselt von der Seat-Fee auf Usage-Based Billing.</p><p><strong>Windsurf wird Devin Desktop</strong> (2. Juni) &#8212; Cognition integriert die Windsurf-&#220;bernahme operativ: Beim Rebrand ersetzt <strong>Devin Local</strong> das bisherige Cascade als Default-Surface, das Agent Command Center wird zur Startfl&#228;che, und <strong>ACP</strong> (Agent Client Protocol) ist an Bord. Parallel kommt <strong>Devin 2.2</strong> mit Self-Verify, Auto-Fix und Computer-Use f&#252;r Test-Workflows. Der Anbieter, der 90 % seines eigenen Codes von Devin schreiben l&#228;sst, baut die Oberfl&#228;che konsequent um den Agenten herum, nicht umgekehrt.</p><p><strong>Codex Sites &#8212; und ein Muster, das diese Woche dreimal auftaucht</strong> (Preview) &#8212; OpenAI gibt Codex eine Deploy-Schicht: Aus dem Codex heraus lassen sich Sites, Dashboards und interne Tools erstellen und ausspielen, der Schritt nach drau&#223;en zu eigener Infrastruktur entf&#228;llt (vorerst Preview). Das ist kein Einzelfall: Microsofts Rayfin &#8594; Fabric (siehe oben) und Anthropics self-hosted Sandboxes vom Mai gehen in dieselbe Richtung. Drei Frontier-Anbieter, eine Woche, dieselbe Bewegung &#8212; vom Modell zur vollst&#228;ndigen, &#246;kosystem-internen Wertsch&#246;pfungskette. Der Effekt ist Bindung durch reduzierte Reibung: Der Workflow muss das Haus nicht mehr verlassen.</p><div><hr></div><h2>Trend der Woche</h2><h3>Usage-Based Billing wird zum Normalbetrieb</h3><p>Drei Bewegungen dieser Woche markieren das Ende der subventionierten Gratis-Schleife &#8212; und sie verbinden sich zu einer These: Wer Agents im gro&#223;en Stil laufen l&#228;sst, zahlt ab jetzt nach Verbrauch.</p><p><strong>Uber</strong> liefert die Schlagzeile. Nachdem das Unternehmen sein gesamtes Jahres-KI-Budget in vier Monaten verbrannt hatte, deckelt es das Tool-Spending auf <strong>$1.500 pro Mitarbeiter pro Tool und Monat</strong> &#8212; getrennt je Werkzeug (Claude Code und Cursor z&#228;hlen separat), &#252;berschreitbar nur mit Genehmigung. Das ist die erste konkrete Cap-Zahl eines b&#246;rsennotierten Gro&#223;konzerns, und sie wird der Benchmark, an dem sich andere messen.</p><p><strong>GitHub</strong> zieht strukturell nach: Zum 1. Juni stellt Copilot auf Usage-Based Billing um &#8212; alle Pl&#228;ne migrieren auf AI-Credits, dazu ein neuer <strong>Copilot Max</strong> f&#252;r $100/Monat f&#252;r anhaltende agentische Workflows. Und <strong>Anthropic</strong> zieht ab dem 15. Juni eine Trennlinie durch die eigenen Abos: Programmatische Nutzung (Agent SDK, <code>claude -p</code>, GitHub Actions, Third-Party-Apps) wandert aus dem Subscription-Pool in einen separaten, zu API-Preisen abgerechneten Credit Pool &#8212; der interaktive Gebrauch (claude.ai, Claude Code interaktiv, Cowork) bleibt unver&#228;ndert.</p><p>Damit bekommt das Token-Spend-Problem, das <em>Pragmatic Engineer</em> in #005 als erstes vermessen hat, seine &#246;konomische Antwort. Die Logik der drei Bewegungen ist dieselbe: Interaktives Arbeiten am Menschen bleibt im Flatrate-Komfort, der Dauerlauf im Hintergrund bekommt einen Z&#228;hler. Wer Async-Agents als Default-Ausf&#252;hrungsschicht plant, muss diese Rechnung jetzt explizit aufmachen &#8212; die Frage ist nicht mehr <em>ob</em> der Loop l&#228;uft, sondern was er pro Monat kostet.</p><div><hr></div><h2>Tipp der Woche</h2><p><strong>Best Claude Code Plugins, June 2026</strong> &#8212; Composio hat eine annotierte &#220;bersicht der meistgenutzten Claude-Code-Plugins ver&#246;ffentlicht (1. Juni), sortiert nach Installs: <strong>Frontend Design</strong> (829k), <strong>Superpowers</strong> (752k), <strong>Context7</strong> (349k), dazu Code Review, Code Simplifier und Skill Creator. Statt &#8222;installier alles&#8221; r&#228;t der Beitrag zu einem fokussierten Stack je Workflow.</p><div><hr></div><h2>Kurz notiert</h2><ul><li><p><strong>Claude Partner Network</strong> (3. Juni) &#8212; Services Track plus Partner Hub, $100 Mio. in Partner-Training. Seit M&#228;rz &#252;ber <strong>40.000 Bewerbungen</strong> und mehr als <strong>10.000 Claude-zertifizierte Consultants</strong>. Der Hub zeigt den Tier-Status t&#228;glich aktualisiert &#8212; die Vertriebsmaschine, die unter dem IPO-Filing sichtbar wird.</p></li><li><p><strong>Codex CLI 0.137.0</strong> (4. Juni) &#8212; OpenAI iteriert im Tagestakt weiter: monatliche Credit-Limits f&#252;r Enterprise, Remote-Control-Pairing, Multi-Agent-v2-Verbesserungen. Inkrementell, aber konsequent.</p></li><li><p><strong>Vorschau: Code w/ Claude Tokyo</strong> (10./11. Juni) &#8212; Anthropics erste Entwicklerkonferenz im asiatisch-pazifischen Raum, Englisch mit japanischer Live-&#220;bersetzung, plus ein Extended-Tag f&#252;r Indie-Devs und Gr&#252;nder.</p></li></ul><div><hr></div><h2>Quellen</h2><p><strong>Die gro&#223;e Nachricht der Woche:</strong> <a href="https://www.anthropic.com/news/confidential-draft-s1-sec">Anthropic &#8212; Confidential S-1</a> &#183; <a href="https://techcrunch.com/2026/06/01/anthropic-files-to-go-public/">TechCrunch &#8212; IPO-Filing</a> &#183; <a href="https://www.cnbc.com/2026/06/01/microsoft-and-google-take-on-anthropic-and-openai-in-ai-coding-models.html">CNBC &#8212; late to AI coding</a> &#183; <a href="https://microsoft.ai/news/building-a-hillclimbing-machine-launching-seven-new-mai-models/">Microsoft AI &#8212; seven new MAI models</a> &#183; <a href="https://github.blog/changelog/2026-06-02-mai-code-1-flash-is-now-available-for-github-copilot/">GitHub Changelog &#8212; MAI-Code-1-Flash</a> &#183; <a href="https://www.heise.de/en/news/Microsoft-Build-2026-AI-development-with-under-and-for-Windows-11315701.html">heise &#8212; Microsoft Build 2026</a></p><p><strong>Project Glasswing:</strong> <a href="https://www.anthropic.com/news/expanding-project-glasswing">Anthropic &#8212; Expanding Project Glasswing</a> &#183; <a href="https://techcrunch.com/2026/06/02/anthropic-scales-claude-mythos-to-critical-infrastructure-in-15-countries/">TechCrunch &#8212; Glasswing in 15 countries</a> &#183; <a href="https://www.anthropic.com/news/claude-code-security">Anthropic &#8212; Claude Security</a></p><p><strong>Claude Code:</strong> <a href="https://code.claude.com/docs/en/changelog">Changelog</a> &#183; <a href="https://github.com/anthropics/claude-code/releases">Releases (GitHub)</a></p><p><strong>Agentic Coding:</strong> <a href="https://cursor.com/changelog">Cursor Changelog</a> &#183; <a href="https://aicoderscope.com/blog/windsurf-devin-desktop-rebrand-acp-2026/">AICoderscope &#8212; Windsurf Devin Desktop</a> &#183; <a href="https://cognition.ai/blog/introducing-devin-2-2">Devin 2.2</a> &#183; <a href="https://developers.openai.com/codex/changelog">Codex Changelog</a></p><p><strong>Trend der Woche:</strong> <a href="https://techcrunch.com/2026/06/02/uber-caps-employee-ai-spending-after-blowing-through-budget-in-four-months/">TechCrunch &#8212; Uber-Cap</a> &#183; <a href="https://github.blog/news-insights/company-news/github-copilot-is-moving-to-usage-based-billing/">GitHub Blog &#8212; Usage-Based Billing</a> &#183; <a href="https://the-decoder.com/claude-subscriptions-get-separate-budgets-for-programmatic-use-billed-at-full-api-prices/">The Decoder &#8212; Anthropic Subscription Credits</a></p><p><strong>Tipp der Woche:</strong> <a href="https://composio.dev/content/top-claude-code-plugins">Composio &#8212; Top Claude Code Plugins</a></p><p><strong>Kurz notiert:</strong> <a href="https://www.anthropic.com/news/services-track-partner-hub">Anthropic &#8212; Services Track &amp; Partner Hub</a> &#183; <a href="https://github.com/openai/codex/releases">Codex Releases (GitHub)</a> &#183; <a href="https://claude.com/code-with-claude/tokyo">Code w/ Claude Tokyo</a></p><div><hr></div><p>N&#228;chste Ausgabe: Samstag, 13. Juni 2026.</p><p><em>Feedback? Einfach kommentieren/antworten.</em></p><div class="subscription-widget-wrap-editor" data-attrs="{&quot;url&quot;:&quot;https://blog.fluxum.net/subscribe?&quot;,&quot;text&quot;:&quot;Abonnieren&quot;,&quot;language&quot;:&quot;de&quot;}" data-component-name="SubscribeWidgetToDOM"><div class="subscription-widget show-subscribe"><div class="preamble"><p class="cta-caption">fluxum engineering ist eine von Leser unterst&#252;tzte Publikation. Um neue Posts zu erhalten und meine Arbeit zu unterst&#252;tzen, ziehen Sie in Betracht, ein Free- oder Paid-Abonnent zu werden.</p></div><form class="subscription-widget-subscribe"><input type="email" class="email-input" name="email" placeholder="E-Mail-Adresse eingeben &#8230;" tabindex="-1"><input type="submit" class="button primary" value="Abonnieren"><div class="fake-input-wrapper"><div class="fake-input"></div><div class="fake-button"></div></div></form></div></div>]]></content:encoded></item><item><title><![CDATA[Agentic Weekly #008 — Anthropics großer Tag: Opus 4.8, 65 Milliarden und der Mythos-Start]]></title><description><![CDATA[Opus 4.8, die gr&#246;&#223;te Finanzierungsrunde der Firmengeschichte und der &#246;ffentliche Mythos-Start &#8212; alles an einem 28.]]></description><link>https://blog.fluxum.net/p/agentic-weekly-008-anthropics-groer</link><guid isPermaLink="false">https://blog.fluxum.net/p/agentic-weekly-008-anthropics-groer</guid><dc:creator><![CDATA[Martin Gross]]></dc:creator><pubDate>Sat, 30 May 2026 17:15:19 GMT</pubDate><enclosure url="https://substackcdn.com/image/fetch/$s_!C5Nr!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F17280526-830f-4e8a-8574-47495b77809e_1672x941.png" length="0" type="image/jpeg"/><content:encoded><![CDATA[<p><strong>Opus 4.8, die gr&#246;&#223;te Finanzierungsrunde der Firmengeschichte und der &#246;ffentliche Mythos-Start &#8212; alles an einem 28. Mai; und w&#228;hrend Cognition 48 Stunden zuvor eine zweite Milliardenrunde nachlegt, wird sichtbar, wohin das Kapital flie&#223;t: in die Schicht, die Code inzwischen selbst schreibt.</strong></p><p>Samstag, 30. Mai 2026 &#8212; Lesezeit: ~7 Min.</p><p><em>Diesen Newsletter w&#246;chentlich per Mail bekommen: <a href="https://blog.fluxum.net/s/agentic-weekly">blog.fluxum.net/s/agentic-weekly</a></em></p><div class="captioned-image-container"><figure><a class="image-link image2 is-viewable-img" target="_blank" href="https://substackcdn.com/image/fetch/$s_!C5Nr!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F17280526-830f-4e8a-8574-47495b77809e_1672x941.png" data-component-name="Image2ToDOM"><div class="image2-inset"><picture><source type="image/webp" srcset="https://substackcdn.com/image/fetch/$s_!C5Nr!,w_424,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F17280526-830f-4e8a-8574-47495b77809e_1672x941.png 424w, https://substackcdn.com/image/fetch/$s_!C5Nr!,w_848,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F17280526-830f-4e8a-8574-47495b77809e_1672x941.png 848w, https://substackcdn.com/image/fetch/$s_!C5Nr!,w_1272,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F17280526-830f-4e8a-8574-47495b77809e_1672x941.png 1272w, https://substackcdn.com/image/fetch/$s_!C5Nr!,w_1456,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F17280526-830f-4e8a-8574-47495b77809e_1672x941.png 1456w" sizes="100vw"><img src="https://substackcdn.com/image/fetch/$s_!C5Nr!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F17280526-830f-4e8a-8574-47495b77809e_1672x941.png" width="1456" height="819" data-attrs="{&quot;src&quot;:&quot;https://substack-post-media.s3.amazonaws.com/public/images/17280526-830f-4e8a-8574-47495b77809e_1672x941.png&quot;,&quot;srcNoWatermark&quot;:null,&quot;fullscreen&quot;:null,&quot;imageSize&quot;:null,&quot;height&quot;:819,&quot;width&quot;:1456,&quot;resizeWidth&quot;:null,&quot;bytes&quot;:1776151,&quot;alt&quot;:null,&quot;title&quot;:null,&quot;type&quot;:&quot;image/png&quot;,&quot;href&quot;:null,&quot;belowTheFold&quot;:false,&quot;topImage&quot;:true,&quot;internalRedirect&quot;:&quot;https://blog.fluxum.net/i/199890117?img=https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F17280526-830f-4e8a-8574-47495b77809e_1672x941.png&quot;,&quot;isProcessing&quot;:false,&quot;align&quot;:null,&quot;offset&quot;:false}" class="sizing-normal" alt="" srcset="https://substackcdn.com/image/fetch/$s_!C5Nr!,w_424,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F17280526-830f-4e8a-8574-47495b77809e_1672x941.png 424w, https://substackcdn.com/image/fetch/$s_!C5Nr!,w_848,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F17280526-830f-4e8a-8574-47495b77809e_1672x941.png 848w, https://substackcdn.com/image/fetch/$s_!C5Nr!,w_1272,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F17280526-830f-4e8a-8574-47495b77809e_1672x941.png 1272w, https://substackcdn.com/image/fetch/$s_!C5Nr!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F17280526-830f-4e8a-8574-47495b77809e_1672x941.png 1456w" sizes="100vw" fetchpriority="high"></picture><div class="image-link-expand"><div class="pencraft pc-display-flex pc-gap-8 pc-reset"><button tabindex="0" type="button" class="pencraft pc-reset pencraft icon-container restack-image"><svg role="img" width="20" height="20" viewBox="0 0 20 20" fill="none" stroke-width="1.5" stroke="var(--color-fg-primary)" stroke-linecap="round" stroke-linejoin="round" xmlns="http://www.w3.org/2000/svg"><g><title></title><path d="M2.53001 7.81595C3.49179 4.73911 6.43281 2.5 9.91173 2.5C13.1684 2.5 15.9537 4.46214 17.0852 7.23684L17.6179 8.67647M17.6179 8.67647L18.5002 4.26471M17.6179 8.67647L13.6473 6.91176M17.4995 12.1841C16.5378 15.2609 13.5967 17.5 10.1178 17.5C6.86118 17.5 4.07589 15.5379 2.94432 12.7632L2.41165 11.3235M2.41165 11.3235L1.5293 15.7353M2.41165 11.3235L6.38224 13.0882"></path></g></svg></button><button tabindex="0" type="button" class="pencraft pc-reset pencraft icon-container view-image"><svg xmlns="http://www.w3.org/2000/svg" width="20" height="20" viewBox="0 0 24 24" fill="none" stroke="currentColor" stroke-width="2" stroke-linecap="round" stroke-linejoin="round" class="lucide lucide-maximize2 lucide-maximize-2"><polyline points="15 3 21 3 21 9"></polyline><polyline points="9 21 3 21 3 15"></polyline><line x1="21" x2="14" y1="3" y2="10"></line><line x1="3" x2="10" y1="21" y2="14"></line></svg></button></div></div></div></a></figure></div><p></p><div><hr></div><h2>Die gro&#223;e Nachricht der Woche</h2><h3>Anthropics gro&#223;er Tag: ein Modell, 65 Milliarden und der Mythos-Start</h3><p>Der <strong>28. Mai</strong> war f&#252;r Anthropic kein gew&#246;hnlicher Release-Tag, sondern ein geb&#252;ndelter Aufschlag: ein neues Frontier-Modell, die gr&#246;&#223;te Finanzierungsrunde der Firmengeschichte und die Ank&#252;ndigung, dass die n&#228;chste Modellgeneration in K&#252;rze &#246;ffentlich wird &#8212; alles am selben Tag. Drei Bausteine lohnen den Blick.</p><p><strong>Opus 4.8</strong> &#8212; der Modell-Baustein.</p><p>Nur <strong>42 Tage</strong> nach Opus 4.7 steht das n&#228;chste Flaggschiff. Auf <strong>SWE-bench Pro</strong> klettert Opus 4.8 auf <strong>69,2 %</strong> (von 64,3 % bei 4.7), auf dem st&#228;rker ges&#228;ttigten <strong>SWE-bench Verified</strong> auf <strong>88,6 %</strong> &#8212; der gr&#246;&#223;ere Sprung liegt erwartbar auf dem h&#228;rteren, weniger ausgereizten Set. Der <strong>1-Million-Token-Context</strong> ist jetzt Default, die Preise bleiben mit <strong>$5 / $25 pro Mio. Tokens</strong> identisch zu 4.7, der Knowledge-Cutoff bleibt Januar 2026.</p><p>Der eigentliche Pitch ist aber nicht der Benchmark, sondern Ehrlichkeit: Opus 4.8 l&#228;sst laut Anthropic rund <strong>viermal seltener</strong> Fehler im selbst geschriebenen Code unmarkiert durchgehen als sein Vorg&#228;nger. Dazu kommen feinere <strong>Effort-Controls</strong> (bis <code>/effort xhigh</code> f&#252;r die h&#228;rtesten Aufgaben), und der Fast Mode kostet jetzt nur noch das Doppelte der Standardrate &#8212; statt wie bisher ein Vielfaches &#8212; bei 2,5-facher Geschwindigkeit.</p><p><strong>Series H</strong> &#8212; der Kapital-Baustein.</p><p>Am selben Tag schlie&#223;t Anthropic die <strong>gr&#246;&#223;te Runde seiner Geschichte: $65 Mrd. eingesammelt, $965 Mrd. Post-Money-Bewertung</strong> &#8212; und &#252;berholt damit OpenAI als wertvollstes KI-Startup der Welt, knapp unter der Billionen-Marke und noch vor jedem IPO. Im Mai &#252;berschritt die Run-Rate-Revenue <strong>$47 Mrd.</strong> Co-Lead waren Altimeter, Dragoneer, Greenoaks und Sequoia; rund <strong>$15 Mrd.</strong> davon sind bereits zuvor zugesagte Hyperscaler-Investments. Auff&#228;llig ist, wof&#252;r das Geld reserviert ist: Compute-Vertr&#228;ge mit Amazon und einem Google-Broadcom-TPU-Verbund &#252;ber jeweils 5 Gigawatt, dazu GPU-Kapazit&#228;t von SpaceX. In #006 standen hier noch Gespr&#228;che im Raum &#8212; jetzt ist die Runde geschlossen, und deutlich gr&#246;&#223;er.</p><p><strong>Mythos</strong> &#8212; der Ausblick-Baustein.</p><p>Eingebettet in die Opus-Ank&#252;ndigung meldet Anthropic &#8222;swift progress&#8221; bei den Safety-Safeguards und will &#8222;Mythos-class models&#8221; in den kommenden Wochen f&#252;r alle Kunden freigeben. Opus 4.8 wird als Br&#252;cke positioniert &#8212; als Beleg, dass sich auch das schw&#228;chere Modell &#8222;honest enough to be safe&#8221; machen l&#228;sst.</p><p><strong>Warum das relevant ist:</strong> Modell, Kapital und Sicherheits-Roadmap am selben Tag zu stapeln ist kein Zufall, sondern Signal. Anthropic koppelt die Botschaft &#8222;wir sind das wertvollste KI-Startup&#8221; direkt an &#8222;und wir liefern technisch&#8221; &#8212; und reserviert das frische Kapital sichtbar f&#252;r Compute, die Ressource, an der die n&#228;chste Wettbewerbsrunde h&#228;ngt.</p><div><hr></div><h2>Claude Code: Die Highlights der Woche</h2><p><strong>F&#252;r Multi-Agent-Workflows: Dynamic Workflows (Research Preview).</strong> Mit v2.1.154 schreibt Claude jetzt selbst Orchestrierungs-Skripte, die zehn bis hunderte Subagents parallel fahren &#8212; gedeckelt auf <strong>16 gleichzeitig und 1.000 pro Lauf</strong>. Der Clou: Der Plan wandert in den Code statt in den Context, Zwischenergebnisse leben in Skript-Variablen. Ausgel&#246;st wird das durch das Wort &#8222;workflow&#8221; im Prompt oder das Setting <code>ultracode</code> (= xhigh-Effort plus Auto-Orchestrierung plus Self-Verify). Als Beispiel f&#252;hrt Anthropic an, wie Bun-Autor <strong>Jarred Sumner</strong> Bun mit hunderten Agents von Zig nach Rust portierte &#8212; zwei Reviewer pro Datei. Verf&#252;gbar als Research Preview in CLI, Desktop und VS-Code f&#252;r Max, Team und Enterprise. Das ist die n&#228;chste Stufe &#252;ber klassische Multiagent-Orchestrierung: nicht mehr du orchestrierst die Agents, das Modell tut es.</p><p><strong>F&#252;r alle, die Claude Code t&#228;glich nutzen: </strong><code>/code-review --fix</code><strong> (v2.1.152).</strong> Der in #007 eingef&#252;hrte <code>/code-review</code> wendet seine Reuse-, Simplify- und Efficiency-Vorschl&#228;ge jetzt direkt im Working Tree an, statt sie nur aufzulisten. Dazu &#246;ffnet <code>/</code> im NORMAL-Mode jetzt eine Reverse-History-Suche (wie Ctrl+R), und <code>claude plugin marketplace remove</code> versteht <code>--scope user|project|local</code>.</p><div><hr></div><h2>Agentic Coding</h2><p><strong>Cognition holt $1 Mrd. &#8212; und schreibt fast seinen ganzen Code selbst.</strong> <strong>Cognition</strong> ist die Firma hinter <strong>Devin</strong>, dem autonomen KI-&#8222;Software-Engineer&#8221;, der eigenst&#228;ndig Tickets von der Spec bis zum Pull Request abarbeitet; zu Cognition geh&#246;rt zudem der Coding-Editor <strong>Windsurf</strong>. Zwei Tage vor Anthropics gro&#223;em Tag sammelt das Unternehmen <strong>$1 Mrd. bei $26 Mrd. Bewertung</strong> ein (Series D, Co-Lead Lux Capital, General Catalyst, 8VC). Die eigentliche Schlagzeile steckt aber in einer Betriebszahl: <strong>mehr als 90 % des bei Cognition committeten Codes stammen inzwischen von Devin</strong> &#8212; im Dezember 2025 waren es noch 13 %. Die ARR sprang im selben Zeitraum von $37 Mio. auf <strong>$492 Mio.</strong> Kundenliste: Citi, Goldman Sachs, Mercedes-Benz, Dell, US Army und Navy. Ein Anbieter, der seine eigene These am eigenen Code vorf&#252;hrt.</p><p><strong>Opus 4.8 am Launch-Tag in GitHub Copilot.</strong> Anthropics neues Modell war Tag eins in Copilot generell verf&#252;gbar (je nach Tier f&#252;r Business, Enterprise und Pro). Bemerkenswert vor dem Hintergrund, dass Microsoft seine Claude-Code-Lizenzen einzieht (#007) &#8212; beim Modell greift man trotzdem sofort zu.</p><p><strong>Codex CLI v0.134 und v0.135.</strong> OpenAI pflegt seine CLI im Tagestakt weiter: v0.134 bringt Conversation-History-Suche, <code>--profile</code> als kanonischen Selektor und per-Server-MCP-Env-Targeting; v0.135 ein <code>codex doctor</code>-Diagnose-Kommando (pr&#252;ft Env, Git, Terminal, App-Server) sowie Vim-Text-Objects und benannte Profile in <code>/permissions</code>. Inkrementell, aber konsequent.</p><div><hr></div><h2>Trend der Woche</h2><h3>Async-Agents werden Normalbetrieb</h3><p>Walden Yan von Cognition hat diese Woche einen Begriff gepr&#228;gt, der die beiden Geld-Stories oben verbindet: &#8222;The Age of Async Agents&#8221;. Die Idee &#8212; Agents laufen nicht mehr interaktiv neben dir, sondern asynchron in eigenen Umgebungen, von Spec zu Pull Request, mit eigenem Ged&#228;chtnis, und der Mensch kommt erst beim Review wieder ins Spiel.</p><p>Diesen Sprung machen die Releases der Woche von zwei Seiten greifbar. Cognition zeigt am eigenen Betrieb, dass ein Agent den Gro&#223;teil des produktiven Codes schreiben kann, wenn man ihn l&#228;sst. Und Anthropics Dynamic Workflows verlagern die Orchestrierung ins Modell: Wer hunderte Subagents f&#228;hrt, plant nicht mehr jeden Schritt von Hand, sondern l&#228;sst Code den Plan halten.</p><p>Beides zusammen markiert die Verschiebung vom Agent-als-Assistent zum Agent-als-Default-Ausf&#252;hrungsschicht. Die spannende Frage der n&#228;chsten Quartale ist nicht mehr, ob Agents Code schreiben, sondern wie viel menschliche Aufsicht pro tausend Zeilen &#252;brig bleibt &#8212; und ob die Review-Schicht damit Schritt h&#228;lt.</p><div><hr></div><h2>Tipp der Woche</h2><p><strong>Skill Distillation</strong> &#8212; Tomasz Tunguz (Theory Ventures) beschreibt ein Teacher-Student-Setup, das gut zur Skills-Welt von Claude Code passt: Ein Frontier-Modell schreibt und testet <code>SKILL.md</code>-Playbooks, ein kleines lokales Modell (Qwen 35B, Gemma 26B) f&#252;hrt sie aus; ein n&#228;chtlicher Loop destilliert aus den Logs neue Skills. Das Ergebnis ist inspizierbar, versionierbar und hot-swappable &#8212; und es entkoppelt das institutionelle Wissen einer Firma vom jeweils teuersten Modell.</p><p><em>Warum das hier steht:</em> Es dreht die &#252;bliche &#8222;das gr&#246;&#223;te Modell&#8221;-Logik um &#8212; Skills werden zum dauerhaften Asset, das Modell zur austauschbaren Laufzeit. Wer Skills ohnehin pflegt, hat hier ein konkretes Muster, das sich &#252;bertragen l&#228;sst. Bezugspunkte: Pi (<code>github.com/earendil-works/pi</code>) und QMD (<code>github.com/tobi/qmd</code>).</p><div><hr></div><h2>Kurz notiert</h2><ul><li><p><strong>Nachtrag:</strong> Google zeigte bereits am 19./20. Mai <strong>Gemini 3.5 Flash</strong> und <strong>Antigravity 2.0</strong> &#8212; ein schnelleres, g&#252;nstigeres Modell f&#252;r Agents und Coding.</p></li><li><p><strong>GitHub Copilot</strong> stellt Pro und Pro+ zum <strong>1. Juni</strong> auf AI-Credits-Flex-Billing um &#8212; gleiche Preise ($10 / $39), neue Credit-Pools.</p></li><li><p><strong>v2.1.156</strong> (29. Mai) behebt einen Fehler, bei dem modifizierte Thinking-Bl&#246;cke unter Opus 4.8 zu API-Errors f&#252;hrten.</p></li></ul><div><hr></div><h2>Quellen</h2><p><strong>Die gro&#223;e Nachricht der Woche:</strong> <a href="https://www.anthropic.com/news/claude-opus-4-8">Anthropic &#8212; Opus 4.8</a> &#183; <a href="https://www.anthropic.com/news/series-h">Anthropic &#8212; Series H</a> &#183; <a href="https://techcrunch.com/2026/05/28/anthropic-raises-65-billion-nears-1t-valuation-ahead-of-ipo/">TechCrunch</a> &#183; <a href="https://simonwillison.net/2026/May/28/claude-opus-4-8/">Simon Willison</a> &#183; <a href="https://www.theregister.com/security/2026/05/25/anthropic-to-release-mythos-class-models-to-the-public/">The Register &#8212; Mythos</a> &#183; <a href="https://www.heise.de/en/news/Anthropic-brings-more-honest-Claude-Opus-4-8-and-announces-Mythos-11310650.html">heise</a></p><p><strong>Claude Code:</strong> <a href="https://dev.classmethod.jp/en/articles/20260529-claude-code-updates-v2-1-154/">DevelopersIO v2.1.154</a> &#183; <a href="https://www.marktechpost.com/2026/05/28/anthropic-ships-claude-opus-4-8-alongside-dynamic-workflows-and-cheaper-fast-mode-with-workflows-capped-at-1000-subagents/">MarkTechPost</a> &#183; <a href="https://dev.classmethod.jp/en/articles/20260524-claude-code-updates-v2-1-152/">DevelopersIO v2.1.152</a> &#183; <a href="https://code.claude.com/docs/en/changelog">Changelog</a></p><p><strong>Agentic Coding:</strong> <a href="https://www.bloomberg.com/news/articles/2026-05-27/ai-coding-startup-cognition-raises-1-billion-at-26-billion-value">Bloomberg &#8212; Cognition</a> &#183; <a href="https://thenextweb.com/news/cognition-just-raised-1-billion-at-a-26-billion-valuation-and-90-of-its-own-code-is-written-by-its-ai">TheNextWeb</a> &#183; <a href="https://github.blog/changelog/2026-05-28-claude-opus-4-8-is-generally-available-for-github-copilot/">GitHub Changelog &#8212; Copilot</a> &#183; <a href="https://developers.openai.com/codex/changelog">Codex Changelog</a></p><p><strong>Trend der Woche:</strong> <a href="https://www.latent.space/">Latent Space &#8212; The Age of Async Agents</a></p><p><strong>Tipp der Woche:</strong> <a href="https://www.tomtunguz.com/the-pi-agent-skill-distillation/">tomtunguz.com</a></p><p><strong>Kurz notiert:</strong> <a href="https://www.marktechpost.com/2026/05/20/google-introduces-gemini-3-5-flash-at-i-o-2026-a-faster-and-cheaper-model-for-ai-agents-and-coding/">MarkTechPost &#8212; Gemini 3.5 Flash</a> &#183; <a href="https://github.com/anthropics/claude-code/releases">GitHub Releases (v2.1.156)</a></p><div><hr></div><p>N&#228;chste Ausgabe: Samstag, 6. Juni 2026.</p><p><em>Feedback? Einfach kommentieren/antworten.</em></p><div><hr></div><blockquote><p><strong>Diesen Newsletter regelm&#228;&#223;ig lesen &#8212; per Mail?</strong></p><p>Vollst&#228;ndige Ausgaben mit allen Quellen, direkt in dein Postfach.</p><p><a href="https://blog.fluxum.net/s/agentic-weekly">Auf blog.fluxum.net abonnieren</a></p></blockquote>]]></content:encoded></item><item><title><![CDATA[Agentic Weekly #007 — Karpathy zu Anthropic, Stainless im Konzern, Cursor schlägt mit Composer 2.5 zurück]]></title><description><![CDATA[Anthropic baut die Plattform breiter aus &#8212; Karpathy ins Pretraining-Team, Stainless gekauft, in London Sandboxes und MCP-Tunnel &#8212; und Cursor unterbietet die Premium-Preise mit Composer 2.5 um den Faktor 60.]]></description><link>https://blog.fluxum.net/p/agentic-weekly-007-karpathy-zu-anthropic</link><guid isPermaLink="false">https://blog.fluxum.net/p/agentic-weekly-007-karpathy-zu-anthropic</guid><dc:creator><![CDATA[Martin Gross]]></dc:creator><pubDate>Sat, 23 May 2026 17:31:00 GMT</pubDate><enclosure url="https://substackcdn.com/image/fetch/$s_!84vX!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F738194e5-b6b9-402f-b862-f0e789e22efb_1672x941.png" length="0" type="image/jpeg"/><content:encoded><![CDATA[<p><strong>Anthropic baut die Plattform breiter aus &#8212; Karpathy ins Pretraining-Team, Stainless gekauft, in London Sandboxes und MCP-Tunnel &#8212; und Cursor unterbietet die Premium-Preise mit Composer 2.5 um den Faktor 60.</strong></p><p>Samstag, 23. Mai 2026 &#8212; Lesezeit: ~12 Min.</p><p><em>Diesen Newsletter w&#246;chentlich per Mail bekommen: <a href="https://blog.fluxum.net/s/agentic-weekly">blog.fluxum.net/s/agentic-weekly</a></em></p><div class="captioned-image-container"><figure><a class="image-link image2 is-viewable-img" target="_blank" href="https://substackcdn.com/image/fetch/$s_!84vX!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F738194e5-b6b9-402f-b862-f0e789e22efb_1672x941.png" data-component-name="Image2ToDOM"><div class="image2-inset"><picture><source type="image/webp" srcset="https://substackcdn.com/image/fetch/$s_!84vX!,w_424,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F738194e5-b6b9-402f-b862-f0e789e22efb_1672x941.png 424w, https://substackcdn.com/image/fetch/$s_!84vX!,w_848,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F738194e5-b6b9-402f-b862-f0e789e22efb_1672x941.png 848w, https://substackcdn.com/image/fetch/$s_!84vX!,w_1272,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F738194e5-b6b9-402f-b862-f0e789e22efb_1672x941.png 1272w, https://substackcdn.com/image/fetch/$s_!84vX!,w_1456,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F738194e5-b6b9-402f-b862-f0e789e22efb_1672x941.png 1456w" sizes="100vw"><img src="https://substackcdn.com/image/fetch/$s_!84vX!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F738194e5-b6b9-402f-b862-f0e789e22efb_1672x941.png" width="1456" height="819" data-attrs="{&quot;src&quot;:&quot;https://substack-post-media.s3.amazonaws.com/public/images/738194e5-b6b9-402f-b862-f0e789e22efb_1672x941.png&quot;,&quot;srcNoWatermark&quot;:null,&quot;fullscreen&quot;:null,&quot;imageSize&quot;:null,&quot;height&quot;:819,&quot;width&quot;:1456,&quot;resizeWidth&quot;:null,&quot;bytes&quot;:2093165,&quot;alt&quot;:null,&quot;title&quot;:null,&quot;type&quot;:&quot;image/png&quot;,&quot;href&quot;:null,&quot;belowTheFold&quot;:false,&quot;topImage&quot;:true,&quot;internalRedirect&quot;:&quot;https://blog.fluxum.net/i/199891640?img=https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F738194e5-b6b9-402f-b862-f0e789e22efb_1672x941.png&quot;,&quot;isProcessing&quot;:false,&quot;align&quot;:null,&quot;offset&quot;:false}" class="sizing-normal" alt="" srcset="https://substackcdn.com/image/fetch/$s_!84vX!,w_424,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F738194e5-b6b9-402f-b862-f0e789e22efb_1672x941.png 424w, https://substackcdn.com/image/fetch/$s_!84vX!,w_848,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F738194e5-b6b9-402f-b862-f0e789e22efb_1672x941.png 848w, https://substackcdn.com/image/fetch/$s_!84vX!,w_1272,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F738194e5-b6b9-402f-b862-f0e789e22efb_1672x941.png 1272w, https://substackcdn.com/image/fetch/$s_!84vX!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F738194e5-b6b9-402f-b862-f0e789e22efb_1672x941.png 1456w" sizes="100vw" fetchpriority="high"></picture><div class="image-link-expand"><div class="pencraft pc-display-flex pc-gap-8 pc-reset"><button tabindex="0" type="button" class="pencraft pc-reset pencraft icon-container restack-image"><svg role="img" width="20" height="20" viewBox="0 0 20 20" fill="none" stroke-width="1.5" stroke="var(--color-fg-primary)" stroke-linecap="round" stroke-linejoin="round" xmlns="http://www.w3.org/2000/svg"><g><title></title><path d="M2.53001 7.81595C3.49179 4.73911 6.43281 2.5 9.91173 2.5C13.1684 2.5 15.9537 4.46214 17.0852 7.23684L17.6179 8.67647M17.6179 8.67647L18.5002 4.26471M17.6179 8.67647L13.6473 6.91176M17.4995 12.1841C16.5378 15.2609 13.5967 17.5 10.1178 17.5C6.86118 17.5 4.07589 15.5379 2.94432 12.7632L2.41165 11.3235M2.41165 11.3235L1.5293 15.7353M2.41165 11.3235L6.38224 13.0882"></path></g></svg></button><button tabindex="0" type="button" class="pencraft pc-reset pencraft icon-container view-image"><svg xmlns="http://www.w3.org/2000/svg" width="20" height="20" viewBox="0 0 24 24" fill="none" stroke="currentColor" stroke-width="2" stroke-linecap="round" stroke-linejoin="round" class="lucide lucide-maximize2 lucide-maximize-2"><polyline points="15 3 21 3 21 9"></polyline><polyline points="9 21 3 21 3 15"></polyline><line x1="21" x2="14" y1="3" y2="10"></line><line x1="3" x2="10" y1="21" y2="14"></line></svg></button></div></div></div></a></figure></div><p></p>
      <p>
          <a href="https://blog.fluxum.net/p/agentic-weekly-007-karpathy-zu-anthropic">
              Read more
          </a>
      </p>
   ]]></content:encoded></item><item><title><![CDATA[Agentic Weekly #006 — Anthropic schaltet hoch: Dreaming, Doppellimits und 300 MW von SpaceX]]></title><description><![CDATA[Eine Konferenz, drei neue Agent-Bausteine und der Deal, der vor einer Woche noch undenkbar war &#8212; Anthropic kauft sich diese Woche aus dem Compute-Engpass frei.]]></description><link>https://blog.fluxum.net/p/agentic-weekly-006-anthropic-schaltet</link><guid isPermaLink="false">https://blog.fluxum.net/p/agentic-weekly-006-anthropic-schaltet</guid><dc:creator><![CDATA[Martin Gross]]></dc:creator><pubDate>Sat, 16 May 2026 11:55:33 GMT</pubDate><enclosure url="https://substackcdn.com/image/fetch/$s_!loxo!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F932379d3-9d40-412a-bfb5-157c27a02fbe_1672x941.png" length="0" type="image/jpeg"/><content:encoded><![CDATA[<div class="captioned-image-container"><figure><a class="image-link image2 is-viewable-img" target="_blank" href="https://substackcdn.com/image/fetch/$s_!loxo!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F932379d3-9d40-412a-bfb5-157c27a02fbe_1672x941.png" data-component-name="Image2ToDOM"><div class="image2-inset"><picture><source type="image/webp" srcset="https://substackcdn.com/image/fetch/$s_!loxo!,w_424,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F932379d3-9d40-412a-bfb5-157c27a02fbe_1672x941.png 424w, https://substackcdn.com/image/fetch/$s_!loxo!,w_848,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F932379d3-9d40-412a-bfb5-157c27a02fbe_1672x941.png 848w, https://substackcdn.com/image/fetch/$s_!loxo!,w_1272,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F932379d3-9d40-412a-bfb5-157c27a02fbe_1672x941.png 1272w, https://substackcdn.com/image/fetch/$s_!loxo!,w_1456,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F932379d3-9d40-412a-bfb5-157c27a02fbe_1672x941.png 1456w" sizes="100vw"><img src="https://substackcdn.com/image/fetch/$s_!loxo!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F932379d3-9d40-412a-bfb5-157c27a02fbe_1672x941.png" width="1456" height="819" data-attrs="{&quot;src&quot;:&quot;https://substack-post-media.s3.amazonaws.com/public/images/932379d3-9d40-412a-bfb5-157c27a02fbe_1672x941.png&quot;,&quot;srcNoWatermark&quot;:null,&quot;fullscreen&quot;:null,&quot;imageSize&quot;:null,&quot;height&quot;:819,&quot;width&quot;:1456,&quot;resizeWidth&quot;:null,&quot;bytes&quot;:1776151,&quot;alt&quot;:null,&quot;title&quot;:null,&quot;type&quot;:&quot;image/png&quot;,&quot;href&quot;:null,&quot;belowTheFold&quot;:false,&quot;topImage&quot;:true,&quot;internalRedirect&quot;:&quot;https://blog.fluxum.net/i/197985406?img=https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F932379d3-9d40-412a-bfb5-157c27a02fbe_1672x941.png&quot;,&quot;isProcessing&quot;:false,&quot;align&quot;:null,&quot;offset&quot;:false}" class="sizing-normal" alt="" srcset="https://substackcdn.com/image/fetch/$s_!loxo!,w_424,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F932379d3-9d40-412a-bfb5-157c27a02fbe_1672x941.png 424w, https://substackcdn.com/image/fetch/$s_!loxo!,w_848,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F932379d3-9d40-412a-bfb5-157c27a02fbe_1672x941.png 848w, https://substackcdn.com/image/fetch/$s_!loxo!,w_1272,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F932379d3-9d40-412a-bfb5-157c27a02fbe_1672x941.png 1272w, https://substackcdn.com/image/fetch/$s_!loxo!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F932379d3-9d40-412a-bfb5-157c27a02fbe_1672x941.png 1456w" sizes="100vw" fetchpriority="high"></picture><div class="image-link-expand"><div class="pencraft pc-display-flex pc-gap-8 pc-reset"><button tabindex="0" type="button" class="pencraft pc-reset pencraft icon-container restack-image"><svg role="img" width="20" height="20" viewBox="0 0 20 20" fill="none" stroke-width="1.5" stroke="var(--color-fg-primary)" stroke-linecap="round" stroke-linejoin="round" xmlns="http://www.w3.org/2000/svg"><g><title></title><path d="M2.53001 7.81595C3.49179 4.73911 6.43281 2.5 9.91173 2.5C13.1684 2.5 15.9537 4.46214 17.0852 7.23684L17.6179 8.67647M17.6179 8.67647L18.5002 4.26471M17.6179 8.67647L13.6473 6.91176M17.4995 12.1841C16.5378 15.2609 13.5967 17.5 10.1178 17.5C6.86118 17.5 4.07589 15.5379 2.94432 12.7632L2.41165 11.3235M2.41165 11.3235L1.5293 15.7353M2.41165 11.3235L6.38224 13.0882"></path></g></svg></button><button tabindex="0" type="button" class="pencraft pc-reset pencraft icon-container view-image"><svg xmlns="http://www.w3.org/2000/svg" width="20" height="20" viewBox="0 0 24 24" fill="none" stroke="currentColor" stroke-width="2" stroke-linecap="round" stroke-linejoin="round" class="lucide lucide-maximize2 lucide-maximize-2"><polyline points="15 3 21 3 21 9"></polyline><polyline points="9 21 3 21 3 15"></polyline><line x1="21" x2="14" y1="3" y2="10"></line><line x1="3" x2="10" y1="21" y2="14"></line></svg></button></div></div></div></a></figure></div><p></p><h3>Code with Claude 2026 &#8212; Agents lernen tr&#228;umen, Limits fallen, Musk liefert Strom</h3><p>Am 6. Mai hat Anthropic in San Francisco <strong>Code with Claude 2026</strong> veranstaltet &#8212; die zweite Auflage der Entwicklerkonferenz und zugleich einer der dichtesten Produktrelease-Tage, die Anthropic bisher hatte.</p><div class="subscription-widget-wrap-editor" data-attrs="{&quot;url&quot;:&quot;https://blog.fluxum.net/subscribe?&quot;,&quot;text&quot;:&quot;Abonnieren&quot;,&quot;language&quot;:&quot;de&quot;}" data-component-name="SubscribeWidgetToDOM"><div class="subscription-widget show-subscribe"><div class="preamble"><p class="cta-caption">Danke f&#252;rs Lesen von fluxum engineering! Abonnieren Sie kostenlos, um ne&#8230;</p></div><form class="subscription-widget-subscribe"><input type="email" class="email-input" name="email" placeholder="E-Mail-Adresse eingeben &#8230;" tabindex="-1"><input type="submit" class="button primary" value="Abonnieren"><div class="fake-input-wrapper"><div class="fake-input"></div><div class="fake-button"></div></div></form></div></div>
      <p>
          <a href="https://blog.fluxum.net/p/agentic-weekly-006-anthropic-schaltet">
              Read more
          </a>
      </p>
   ]]></content:encoded></item><item><title><![CDATA[Agentic Weekly #005 — Long-running Agents werden zur Architektur, Token-Budgets brechen weg]]></title><description><![CDATA[W&#246;chentlicher &#220;berblick zu Agentic Engineering, Agentic Coding & Claude Code]]></description><link>https://blog.fluxum.net/p/agentic-weekly-005-long-running-agents</link><guid isPermaLink="false">https://blog.fluxum.net/p/agentic-weekly-005-long-running-agents</guid><dc:creator><![CDATA[Martin Gross]]></dc:creator><pubDate>Thu, 07 May 2026 19:59:58 GMT</pubDate><enclosure url="https://substackcdn.com/image/fetch/$s_!s2EH!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F098ee9d8-2a54-4c8f-9479-034ed773acda_1672x941.png" length="0" type="image/jpeg"/><content:encoded><![CDATA[<div class="captioned-image-container"><figure><a class="image-link image2 is-viewable-img" target="_blank" href="https://substackcdn.com/image/fetch/$s_!s2EH!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F098ee9d8-2a54-4c8f-9479-034ed773acda_1672x941.png" data-component-name="Image2ToDOM"><div class="image2-inset"><picture><source type="image/webp" srcset="https://substackcdn.com/image/fetch/$s_!s2EH!,w_424,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F098ee9d8-2a54-4c8f-9479-034ed773acda_1672x941.png 424w, https://substackcdn.com/image/fetch/$s_!s2EH!,w_848,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F098ee9d8-2a54-4c8f-9479-034ed773acda_1672x941.png 848w, https://substackcdn.com/image/fetch/$s_!s2EH!,w_1272,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F098ee9d8-2a54-4c8f-9479-034ed773acda_1672x941.png 1272w, https://substackcdn.com/image/fetch/$s_!s2EH!,w_1456,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F098ee9d8-2a54-4c8f-9479-034ed773acda_1672x941.png 1456w" sizes="100vw"><img src="https://substackcdn.com/image/fetch/$s_!s2EH!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F098ee9d8-2a54-4c8f-9479-034ed773acda_1672x941.png" width="1456" height="819" data-attrs="{&quot;src&quot;:&quot;https://substack-post-media.s3.amazonaws.com/public/images/098ee9d8-2a54-4c8f-9479-034ed773acda_1672x941.png&quot;,&quot;srcNoWatermark&quot;:null,&quot;fullscreen&quot;:null,&quot;imageSize&quot;:null,&quot;height&quot;:819,&quot;width&quot;:1456,&quot;resizeWidth&quot;:null,&quot;bytes&quot;:1776151,&quot;alt&quot;:null,&quot;title&quot;:null,&quot;type&quot;:&quot;image/png&quot;,&quot;href&quot;:null,&quot;belowTheFold&quot;:false,&quot;topImage&quot;:true,&quot;internalRedirect&quot;:&quot;https://blog.fluxum.net/i/196823642?img=https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F098ee9d8-2a54-4c8f-9479-034ed773acda_1672x941.png&quot;,&quot;isProcessing&quot;:false,&quot;align&quot;:null,&quot;offset&quot;:false}" class="sizing-normal" alt="" srcset="https://substackcdn.com/image/fetch/$s_!s2EH!,w_424,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F098ee9d8-2a54-4c8f-9479-034ed773acda_1672x941.png 424w, https://substackcdn.com/image/fetch/$s_!s2EH!,w_848,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F098ee9d8-2a54-4c8f-9479-034ed773acda_1672x941.png 848w, https://substackcdn.com/image/fetch/$s_!s2EH!,w_1272,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F098ee9d8-2a54-4c8f-9479-034ed773acda_1672x941.png 1272w, https://substackcdn.com/image/fetch/$s_!s2EH!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F098ee9d8-2a54-4c8f-9479-034ed773acda_1672x941.png 1456w" sizes="100vw" fetchpriority="high"></picture><div class="image-link-expand"><div class="pencraft pc-display-flex pc-gap-8 pc-reset"><button tabindex="0" type="button" class="pencraft pc-reset pencraft icon-container restack-image"><svg role="img" width="20" height="20" viewBox="0 0 20 20" fill="none" stroke-width="1.5" stroke="var(--color-fg-primary)" stroke-linecap="round" stroke-linejoin="round" xmlns="http://www.w3.org/2000/svg"><g><title></title><path d="M2.53001 7.81595C3.49179 4.73911 6.43281 2.5 9.91173 2.5C13.1684 2.5 15.9537 4.46214 17.0852 7.23684L17.6179 8.67647M17.6179 8.67647L18.5002 4.26471M17.6179 8.67647L13.6473 6.91176M17.4995 12.1841C16.5378 15.2609 13.5967 17.5 10.1178 17.5C6.86118 17.5 4.07589 15.5379 2.94432 12.7632L2.41165 11.3235M2.41165 11.3235L1.5293 15.7353M2.41165 11.3235L6.38224 13.0882"></path></g></svg></button><button tabindex="0" type="button" class="pencraft pc-reset pencraft icon-container view-image"><svg xmlns="http://www.w3.org/2000/svg" width="20" height="20" viewBox="0 0 24 24" fill="none" stroke="currentColor" stroke-width="2" stroke-linecap="round" stroke-linejoin="round" class="lucide lucide-maximize2 lucide-maximize-2"><polyline points="15 3 21 3 21 9"></polyline><polyline points="9 21 3 21 3 15"></polyline><line x1="21" x2="14" y1="3" y2="10"></line><line x1="3" x2="10" y1="21" y2="14"></line></svg></button></div></div></div></a></figure></div><p>7.Mai 2026 &#8212; Lesezeit: ~6 Min.</p><div><hr></div><h2>Die gro&#223;e Nachricht der Woche</h2><h3>Long-running Agents bekommen ihre Architektur &#8212; Brain, Hands, Session</h3><p>Am 30. April hat <strong>Addy Osmani</strong> in einem Long-Read sortiert, was unter &#8222;long-running agents&#8221; eigentlich gemeint ist &#8212; und dabei die Architektur sichtbar gemacht, auf die unabh&#228;ngig voneinander Anthropic, Cursor und Google zulaufen. Drei verschiedene Bedeutungen, sauber getrennt: <strong>Long-horizon reasoning</strong> (Modellqualit&#228;t &#8212; die METR-Metrik f&#252;rs erfolgreich abgeschlossene Task-Horizon verdoppelt sich seit 2019 alle ~7 Monate, das j&#252;ngste TH1.1-Update hat die Anzahl der 8-Stunden-plus-Tasks im Eval-Set verdoppelt), <strong>long-running execution</strong> (das Modell wird hundert- bis tausendfach &#252;ber die Laufzeit aufgerufen) und <strong>persistent agency</strong> (Identit&#228;t &#252;ber Tasks hinweg).</p><div class="subscription-widget-wrap-editor" data-attrs="{&quot;url&quot;:&quot;https://blog.fluxum.net/subscribe?&quot;,&quot;text&quot;:&quot;Abonnieren&quot;,&quot;language&quot;:&quot;de&quot;}" data-component-name="SubscribeWidgetToDOM"><div class="subscription-widget show-subscribe"><div class="preamble"><p class="cta-caption">Danke f&#252;rs Lesen von fluxum engineering! Abonnieren Sie kostenlos, um neue Posts zu erhalten und meine Arbeit zu unterst&#252;tzen.</p></div><form class="subscription-widget-subscribe"><input type="email" class="email-input" name="email" placeholder="E-Mail-Adresse eingeben &#8230;" tabindex="-1"><input type="submit" class="button primary" value="Abonnieren"><div class="fake-input-wrapper"><div class="fake-input"></div><div class="fake-button"></div></div></form></div></div><p>Drei W&#228;nde, an die jeder Agent l&#228;uft: endlicher Context plus &#8222;context rot&#8221; (Degradation lange vor dem harten Limit), kein persistenter State (Anthropics eigenes Bild: &#8222;Engineers, die in Schichten arbeiten &#8212; jeder neue ohne Erinnerung an die vorige Schicht&#8221;) und keine verl&#228;ssliche Self-Verification (Modelle bewerten ihre eigene Arbeit konsistent zu positiv).</p><p>Spannender als die W&#228;nde ist die Konvergenz: Anthropics <strong>Brain / Hands / Session</strong>-Split, Cursors <strong>Planner / Worker / Judge</strong> und Googles <strong>Agent Runtime / Agent Sandbox / Agent Sessions</strong> sind drei Namen f&#252;r dasselbe Muster. Brain = Modell plus Harness-Loop. Hands = sandboxed, ephemere Execution-Umgebungen. Session = append-only Event-Log, das den Lauf rekonstruierbar macht. Praktisch hei&#223;t das: State wandert aus dem Modell-Context heraus ins Filesystem oder in eine Datenbank &#8212; die <code>Ralph Loop</code> von Geoffrey Huntley und Ryan Carson zeigt das in 30 Zeilen Bash mit <code>prd.json</code>, <code>progress.txt</code>, <code>AGENTS.md</code>. Anthropic berichtet aus internen Tests von <strong>30+ Stunden autonomem Coding</strong>, ein Lauf produzierte einen 11.000-Zeilen-Slack-Klon.</p><p><strong>Warum das relevant ist:</strong> Wer Agents jenseits der Stundenmarke baut, kommt um diesen Split nicht herum. Osmanis Test ist ehrlich: &#8222;If you can&#8217;t reconstruct what the agent did in the last 24 hours from durable storage, what you have is a long-running shell script that happens to call an LLM, not a long-running agent.&#8221; &#8212; Eine Ebene weiter raus zoomt <strong>Jack Clark</strong>, Anthropic-Mitgr&#252;nder, in <em>Import AI #455</em> (4. Mai): Er taxiert die Wahrscheinlichkeit auf 60+ %, dass AI-Systeme bis Ende 2028 autonom R&amp;D betreiben und ihre Nachfolger trainieren. SWE-Bench-Progression von ~2 % (Claude 2, Ende 2023) auf 93,9 % (Claude Mythos Preview); Task-Horizon von ~30 Sekunden 2022 auf ~12 Stunden 2026, Forecaster Ajeya Cotra projiziert ~100 Stunden bis Jahresende. Wer die Architektur-Arbeit dieser Woche zusammen mit Clarks Kurve liest, sieht, warum die Anthropic-K&#246;pfe die Zeitachse f&#252;r eng halten.</p><p><strong>Quellen:</strong></p><ul><li><p><a href="https://addyo.substack.com/p/long-running-agents">Addy Osmani: Long-running agents &#8212; building the architecture for agents that work for hours, days, and weeks</a></p></li><li><p><a href="https://importai.substack.com/p/import-ai-455-automating-ai-research">Jack Clark / Import AI #455: AI systems are about to start building themselves</a></p></li></ul><div><hr></div><h2>Claude Code: Die Highlights der Woche</h2><p>Vier Releases in einer ruhigeren Woche: <strong>v2.1.126, v2.1.128, v2.1.129, v2.1.131</strong>. Schwerpunkt: Plugin-Distribution, OAuth-Polish, eine Reihe handfester Subprozess- und Cache-Fixes.</p><h3>F&#252;r alle, die Claude Code t&#228;glich nutzen</h3><p><code>claude project purge</code><strong> ist da</strong> &#8212; v2.1.126 r&#228;umt alle Claude-Code-Spuren aus einem Projekt: Transcripts, Tasks, File-History, Config. Mit <code>--dry-run</code>, <code>--interactive</code>, <code>--all</code> f&#252;r mehrere Projekte. Vorher musste man drei Verzeichnisse von Hand kennen.</p><p><code>/context</code><strong> verschwendet keine Tokens mehr</strong> &#8212; v2.1.129 fixt einen alten &#196;rger: Der ASCII-Visualisierungs-Block landete bisher in der Konversation und kostete pro Aufruf rund 1.600 Tokens.</p><p><code>/model</code><strong> zeigt nur noch ein Opus-Eintrag</strong> &#8212; Die Doppelung &#8222;Opus 4.7&#8221; und &#8222;Opus&#8221; im Picker ist weg, der aktuelle Opus hei&#223;t jetzt schlicht &#8222;Opus&#8221; (v2.1.128).</p><h3>F&#252;r Plugin- und MCP-Workflows</h3><p><code>--plugin-url</code><strong> und </strong><code>--plugin-dir</code><strong> mit Zip</strong> &#8212; v2.1.128/129 erlauben das Laden von Plugin-Archiven direkt aus URL oder lokaler <code>.zip</code>. Saubere L&#246;sung f&#252;r Air-Gapped-Setups und ad-hoc-Tests, ohne Marketplace-Eintrag.</p><p><strong>MCP-Reconnects fluten die Konversation nicht mehr</strong> &#8212; v2.1.128: Wenn ein Server seine Tools re-announced, kommt nur noch eine Server-Prefix-Zusammenfassung statt der vollen Tool-Liste. Wer mit f&#252;nf+ MCP-Servern arbeitet, merkt das sofort.</p><p><code>/mcp</code><strong> zeigt Tool-Counts</strong> &#8212; v2.1.128 markiert Server mit 0 Tools &#8212; ein simpler Blick reicht jetzt, um stille Misskonfigurationen zu sehen.</p><h3>F&#252;r Performance und Plattform</h3><p><strong>Subagent-Summaries nutzen wieder Prompt-Cache</strong> &#8212; v2.1.128 fixt eine Regression, die <code>cache_creation</code> ungef&#228;hr verdreifacht hatte. Wer Subagents heavy nutzt, sollte den Token-Verbrauch nach dem Update direkt vergleichen.</p><p><strong>Parallel Tool-Calls brechen sich nicht mehr gegenseitig ab</strong> &#8212; Ein fehlgeschlagener Read-Only-Befehl (<code>grep</code>, <code>git diff</code>, <code>ls</code>) cancelte bisher die Geschwister-Calls. Behoben in v2.1.128.</p><p><strong>OAuth h&#228;rtet sich</strong> &#8212; Eine Race Condition zwischen Wake-from-Sleep und Token-Refresh, die laufende Sessions ausloggte, ist gefixt (v2.1.129). Au&#223;erdem: <code>claude auth login</code> akzeptiert jetzt einen OAuth-Code per Paste, wenn der Browser-Callback localhost nicht erreicht (v2.1.126) &#8212; endlich sauber f&#252;r WSL2, SSH-Sessions, DevContainer.</p><p><strong>Quellen:</strong></p><ul><li><p><a href="https://code.claude.com/docs/en/changelog">Claude Code Changelog</a></p></li><li><p><a href="https://releasebot.io/updates/anthropic/claude-code">Releasebot: Claude Code Mai 2026</a></p></li></ul><div><hr></div><h2>Agentic Coding: Cursor mit eigenem SDK und Security-Review, Codex baut Plugin-Disziplin aus</h2><p><strong>Cursor SDK</strong> (29. April) &#8212; Cursor &#246;ffnet seine Agent-Plattform f&#252;r programmatischen Zugriff: TypeScript-SDK, lokal oder gegen Cursors Cloud-VMs ausf&#252;hrbar, freie Modellwahl. Dazu reworked Cloud-Agents-API mit SSE-Streaming und expliziten Lifecycle-Controls. Damit ist Cursor das n&#228;chste Tool nach Claude Code, das nicht nur als IDE/Terminal, sondern als API f&#252;r Agent-Pipelines auftritt.</p><p><strong>Cursor Security Review</strong> (30. April, Beta f&#252;r Teams/Enterprise) &#8212; Zwei Always-On-Agenten: ein <strong>Security Reviewer</strong>, der jede PR auf Security-Vulnerabilities, Auth-Regressionen und Privacy-/Data-Handling-Risiken pr&#252;ft, plus ein <strong>Vulnerability Scanner</strong> mit geplanten Codebase-Scans gegen bekannte Vulnerabilities und veraltete Dependencies. Direkter Konkurrent zu Claude Codes <code>/security-review</code>-Skill &#8212; und ein klares Signal, dass Review-Workloads in Pull Requests die n&#228;chste Schicht sind, in der die Agent-Hosts gegeneinander antreten.</p><p><strong>Cursor Spend Management</strong> (4. Mai) &#8212; Granulare Allow-/Blocklists pro Modell und Provider, Soft-Spend-Limits mit Alerts bei 50/80/100 %. Liest sich wie eine direkte Antwort auf das Engineering-Budget-Problem, das diese Woche separat dokumentiert wurde (siehe Trend unten).</p><p><strong>OpenAI Codex CLI</strong> legt zweimal nach: <strong>0.128.0</strong> (30. April) bringt <strong>Goals-Workflows</strong>, <strong>Permission Profiles</strong>, Plugin-Management und Support f&#252;r externe Agent-Sessions. <strong>0.129.0</strong> (7. Mai) folgt mit TUI-Polish: redesigned Resume/Fork Picker, workspace-aware <code>/diff</code>, Plugin-Workspace-Sharing und Lifecycle-Hooks. Damit zieht Codex bei Plugin-Disziplin und Session-Handling sichtbar nach.</p><p><strong>Quellen:</strong></p><ul><li><p><a href="https://cursor.com/changelog">Cursor Changelog: SDK &#183; Security Review &#183; Spend Management</a></p></li><li><p><a href="https://developers.openai.com/codex/changelog">Codex Changelog (OpenAI Developers)</a></p></li></ul><div><hr></div><h2>Trend der Woche</h2><h3>Token-Spend bricht Engineering-Budgets &#8212; und die Strategie spaltet sich</h3><p><strong>Gergely Orosz</strong> hat f&#252;r <em>The Pragmatic Engineer</em> (30. April) <strong>15 Firmen</strong> zwischen Seed-Stage und 10.000+ Mitarbeiter anonym befragt. Das Bild ist eindeutig und unbequem: Bei einem AI-Infra-Startup stieg Token-Spend pro Entwickler in sechs Monaten <strong>von $200 auf $3.000 pro Monat &#8212; 15-fach</strong>. Bei einem Healthcare-Konzern verbrauchte ein einzelner Engineer in <strong>einer Claude-Code-Session $1.400</strong>. In einem US-/EU-Fintech laufen Heavy-User auf Claude Code bei <strong>$500 pro Tag</strong>. Bei einem E-Commerce-Konzern mit ~2.000 Devs ist nur <strong>Opus 4.7 zum Coden zugelassen</strong>: &#8222;leichte Fehler in Produktion kosten Stunden&#8221;. Vendor-Verhandlungen klaffen weit auseinander: Cursor gew&#228;hrt Rabatte ab ~$1 Mio. Spend, Anthropic auch bei $5 Mio.+ pro Jahr nicht.</p><p>Die Firmen teilen sich grob 50/50 in zwei Lager: &#8222;Let it rip and start measuring&#8221; (laufen lassen, Impact messen) und &#8222;Curb spending&#8221; (Default auf billigere Modelle, Caps, Consent-Gates). Ein Engineering Manager im Healthcare-Sektor mit f&#252;nfzehn Jahren Branchenerfahrung sagt, einen so dramatischen Wandel habe er noch nie erlebt &#8212; vergleichbar nur mit dem Sprung zu h&#246;heren Programmiersprachen.</p><p>Das Bemerkenswerte ist, wie schnell die Tools darauf antworten: Cursors Spend-Management dieser Woche ist genau die Telemetrie, die in den befragten Firmen bisher gefehlt hat. Wer 2026 ernsthaft Agentic Engineering betreibt, braucht eine Antwort auf die Kostenseite &#8212; nicht in zw&#246;lf Monaten, sondern f&#252;r den n&#228;chsten Sprint.</p><p><strong>Quellen:</strong></p><ul><li><p><a href="https://newsletter.pragmaticengineer.com/p/the-pulse-token-spend-breaks-budgets">Pragmatic Engineer: Token spend breaks budgets</a></p></li></ul><div><hr></div><h2>Kurz notiert</h2><ul><li><p><strong>Background Agents Summit</strong> (6./7. Mai, virtuell) &#8212; Ona richtet das nach eigener Beschreibung erste Event aus, das ausschlie&#223;lich Background Agents gewidmet ist; Sprecher unter anderem von Stripe, Harvey, Uber, Monzo, AWS und WorkOS. Wer in den n&#228;chsten Monaten selbst eine Background-Agent-Infrastruktur aufbauen will, bekommt hier kompakt das, was sonst &#252;ber mehrere Engineering-Blogs verteilt ist. <a href="https://background-agents.com/summit">background-agents.com/summit</a></p></li><li><p><strong>Sierra holt $950 Mio.</strong> (4. Mai) &#8212; Bret Taylors Agent-Plattform f&#252;r Enterprise-Customer-Service ist nach der von Tiger Global und GV angef&#252;hrten Runde mit &#252;ber $15 Mrd. bewertet. Das Rennen um Enterprise-Agents wird teurer, je breiter die Anwendungsfelder werden. <a href="https://techcrunch.com/2026/05/04/sierra-raises-950m-as-the-race-to-own-enterprise-ai-gets-serious/">TechCrunch</a></p></li><li><p><strong>OpenAI: &#8222;Automated AI research intern bis September 2026&#8221;</strong> &#8212; Jack Clark zitiert dieses &#246;ffentlich kommunizierte Ziel von OpenAI in <em>Import AI #455</em>. Recursive Superintelligence (Startup) hat $500 Mio. spezifisch f&#252;r AI-R&amp;D-Automatisierung eingesammelt. <a href="https://importai.substack.com/p/import-ai-455-automating-ai-research">Import AI #455</a></p></li></ul><div><hr></div><p><em>N&#228;chste Ausgabe: Donnerstag, 14. Mai 2026</em></p><p><em>Feedback? Einfach kommentieren/antworten.</em></p><div class="subscription-widget-wrap-editor" data-attrs="{&quot;url&quot;:&quot;https://blog.fluxum.net/subscribe?&quot;,&quot;text&quot;:&quot;Abonnieren&quot;,&quot;language&quot;:&quot;de&quot;}" data-component-name="SubscribeWidgetToDOM"><div class="subscription-widget show-subscribe"><div class="preamble"><p class="cta-caption">Danke f&#252;rs Lesen von fluxum engineering! Abonnieren Sie kostenlos, um neue Posts zu erhalten und meine Arbeit zu unterst&#252;tzen.</p></div><form class="subscription-widget-subscribe"><input type="email" class="email-input" name="email" placeholder="E-Mail-Adresse eingeben &#8230;" tabindex="-1"><input type="submit" class="button primary" value="Abonnieren"><div class="fake-input-wrapper"><div class="fake-input"></div><div class="fake-button"></div></div></form></div></div>]]></content:encoded></item><item><title><![CDATA[Agentic Weekly #004 — Drei Bugs, sechs Wochen, 40 Milliarden Dollar]]></title><description><![CDATA[W&#246;chentlicher &#220;berblick zu Agentic Engineering, Agentic Coding & Claude Code]]></description><link>https://blog.fluxum.net/p/agentic-weekly-004-drei-bugs-sechs</link><guid isPermaLink="false">https://blog.fluxum.net/p/agentic-weekly-004-drei-bugs-sechs</guid><dc:creator><![CDATA[Martin Gross]]></dc:creator><pubDate>Fri, 01 May 2026 20:09:38 GMT</pubDate><enclosure url="https://substackcdn.com/image/fetch/$s_!y_oj!,w_256,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fa142b85f-3d35-4a80-bdac-1835f765cd9e_512x512.png" length="0" type="image/jpeg"/><content:encoded><![CDATA[<p>1.Mai 2026 &#8212; Lesezeit: ~7 Min.</p><div><hr></div><h2>Die gro&#223;e Nachricht der Woche</h2><h3>Anthropic legt offen, was Claude Code kaputt gemacht hat</h3><p>Am 23. April hat Anthropic einen <strong>detaillierten Postmortem</strong> ver&#246;ffentlicht &#8212; und damit beendet, was seit Februar Foren, Substacks und Tech-Presse besch&#228;ftigt hat: die Frage, ob Claude &#8222;d&#252;mmer&#8221; geworden ist.</p><div class="subscription-widget-wrap-editor" data-attrs="{&quot;url&quot;:&quot;https://blog.fluxum.net/subscribe?&quot;,&quot;text&quot;:&quot;Abonnieren&quot;,&quot;language&quot;:&quot;de&quot;}" data-component-name="SubscribeWidgetToDOM"><div class="subscription-widget show-subscribe"><div class="preamble"><p class="cta-caption">Danke f&#252;rs Lesen von fluxum engineering! Abonnieren Sie kostenlos, um neue Posts zu erhalten und meine Arbeit zu unterst&#252;tzen.</p></div><form class="subscription-widget-subscribe"><input type="email" class="email-input" name="email" placeholder="E-Mail-Adresse eingeben &#8230;" tabindex="-1"><input type="submit" class="button primary" value="Abonnieren"><div class="fake-input-wrapper"><div class="fake-input"></div><div class="fake-button"></div></div></form></div></div><p>Antwort: ja, aber nicht weil Anthropic das Modell absichtlich heruntergedreht h&#228;tte, sondern weil <strong>drei separate Bugs</strong> sich zeitlich &#252;berlappten und sich gegenseitig verschleierten.</p><ol><li><p><strong>Reasoning-Effort-Downgrade</strong> (4. M&#228;rz &#8594; zur&#252;ckgenommen am 7. April): Default f&#252;r Opus 4.6 und Sonnet 4.6 von <code>high</code> auf <code>medium</code> gesenkt &#8212; als Reaktion auf User-Beschwerden &#252;ber lange Latenzen. Falscher Trade-off, wie sich herausstellte.</p></li><li><p><strong>Caching-Bug</strong> (26. M&#228;rz &#8594; gefixt 10. April): Eine Optimierung sollte alte Thinking-Bl&#246;cke nach &gt;1h Idle entfernen. Ein Bug lie&#223; sie <strong>bei jedem Turn</strong> entfernen &#8212; Ergebnis: Cache-Misses, vermeintliches &#8222;Vergessen&#8221;, schneller verbrauchte Limits.</p></li><li><p><strong>Verbosity-Prompt</strong> (16. April &#8594; zur&#252;ckgenommen am 20. April): Eine System-Prompt-Anweisung sollte die Verbosity zwischen Tool-Calls reduzieren. In Kombination mit anderen &#196;nderungen: 3 Prozent Performance-Drop bei Opus 4.6 und 4.7 in Ablation-Tests (Sonnet 4.6 ebenfalls betroffen), nicht in den urspr&#252;nglichen Evals erkannt.</p></li></ol><p>Alle drei Issues sind seit v2.1.116 (20. April) behoben. Anthropic hat zus&#228;tzlich <strong>Usage Limits aller Subscriber zur&#252;ckgesetzt</strong> und Default-Effort auf <code>xhigh</code> (Opus 4.7) bzw. <code>high</code> (alle anderen) angehoben. Die API war nicht betroffen &#8212; nur Claude Code.</p><p><strong>Warum das relevant ist:</strong></p><p>Das ist die transparenteste &#246;ffentliche Aufarbeitung, die ein Frontier-Lab bislang zu einem Quality-Drop geliefert hat.</p><p>Drei wichtige Lehren stecken drin:</p><ol><li><p>Evaluation-Suiten erkennen interagierende Regressionen schlecht &#8212; keine der drei &#196;nderungen war f&#252;r sich genommen problematisch.</p></li><li><p>Caching- und Harness-Verhalten sind genauso modellrelevant wie Gewichte; wer Coding-Agents baut, muss das mitmessen.</p></li><li><p>Vertrauen kommt zur&#252;ck, wenn Postmortems so detailliert sind wie dieses &#8212; und nicht, wenn man stillschweigend zur&#252;ckrollt.</p></li></ol><p>Der Wermutstropfen: Sechs Wochen Schaden waren entstanden, bevor die Aufkl&#228;rung kam.</p><p><strong>Quellen:</strong></p><ul><li><p><a href="https://www.anthropic.com/engineering/april-23-postmortem">Anthropic: An update on recent Claude Code quality reports</a></p></li><li><p><a href="https://venturebeat.com/technology/mystery-solved-anthropic-reveals-changes-to-claudes-harnesses-and-operating-instructions-likely-caused-degradation">VentureBeat: Anthropic reveals harness changes likely caused degradation</a></p></li><li><p><a href="https://www.theregister.com/2026/04/23/anthropic_says_it_has_fixed/">The Register: Anthropic admits it dumbed down Claude with &#8216;upgrades&#8217;</a></p></li><li><p><a href="https://stackfutures.com/blog/anthropic-claude-code-postmortem-three-bugs-six-weeks-april-2026/">Stack Futures: Three Overlapping Changes, Six Weeks of Degradation</a></p></li><li><p><a href="https://machinelearningatscale.substack.com/p/anthropic-shipped-three-regressions">Machine Learning at Scale: Three regressions and the evals that didn&#8217;t catch them</a></p></li></ul><div><hr></div><h2>Claude Code: Die Highlights der Woche</h2><p>Sieben Releases in sieben Tagen: <strong>v2.1.117 bis v2.1.123</strong>. Schwerpunkt diesmal: Polishing, Memory-Hygiene und Vim-Power-User-Features.</p><h3>F&#252;r alle, die Claude Code t&#228;glich nutzen</h3><p><strong>Vim Visual Mode endlich da</strong> &#8212; v2.1.118 bringt vollwertige Visual-Selection (<code>v</code>) und Visual-Line (<code>V</code>) inklusive Operatoren. Wer Claude Code aus Vim-Reflex bedient, hatte bisher nur einen Kr&#252;ppelmodus. Jetzt: voller Selection-Workflow, Operator-Pending, visuelles Feedback.</p><p><code>/cost</code><strong> und </strong><code>/stats</code><strong> werden zu </strong><code>/usage</code> &#8212; Konsolidierter Tabbed-View mit Billing und Verbrauch in einem Command. Kleines Detail, aber spart die st&#228;ndige &#8222;welcher Command war&#8217;s nochmal?&#8221;-Frage.</p><p><strong>Custom Themes</strong> &#8212; Per <code>/theme</code> benannte Themes anlegen oder direkt JSON in <code>~/.claude/themes/</code> editieren. Plugins k&#246;nnen Themes &#252;ber ein <code>themes/</code>-Verzeichnis ausliefern. Endlich konfigurierbar ohne Hack.</p><p><code>/resume</code><strong> aus PR-URL</strong> &#8212; v2.1.122: PR-URL aus GitHub, GitHub Enterprise, GitLab oder Bitbucket in die <code>/resume</code>-Suche pasten und die Session finden, die diesen PR erzeugt hat. Wer mit vielen parallelen Worktrees jongliert: Game-Changer.</p><h3>F&#252;r Multi-Agent- und Plugin-Workflows</h3><p><code>alwaysLoad</code><strong> f&#252;r MCP-Tools</strong> &#8212; MCP-Server k&#246;nnen einzelne Tools aus dem Tool-Search-Deferral ausschlie&#223;en. Wer Latenz-kritische Tools hat, sollte das setzen.</p><p><code>PostToolUse</code><strong>-Hooks d&#252;rfen Tool-Output ersetzen</strong> &#8212; Bisher nur f&#252;r MCP-Tools m&#246;glich, jetzt f&#252;r alle Tools via <code>hookSpecificOutput.updatedToolOutput</code>. Er&#246;ffnet sauberere Output-Sanitizer und Redaction-Pipelines.</p><p><strong>Hooks k&#246;nnen MCP-Tools aufrufen</strong> &#8212; v2.1.118 erlaubt <code>type: "mcp_tool"</code> direkt aus Hook-Konfiguration. Neue Komposition: Lifecycle-Events l&#246;sen Tool-Aufrufe ohne Wrapper-Skript aus.</p><p><code>claude plugin prune</code><strong> und </strong><code>tag</code> &#8212; Verwaiste auto-installierte Dependencies entfernen; Release-Tags mit Versionsvalidierung erzeugen. Plugin-Hygiene wird langsam zu echtem Package-Management.</p><h3>F&#252;r CI/CD und Automation</h3><p><code>claude ultrareview [target]</code> &#8212; <code>/ultrareview</code> jetzt non-interaktiv aus CI/Skripten. Damit ist Cloud-basierter Tiefen-Review als Pipeline-Step nutzbar, nicht nur als interaktiver Slash-Command.</p><p><code>AI_AGENT</code><strong> Environment Variable</strong> &#8212; Wird f&#252;r Subprozesse gesetzt; GitHub und andere Hosts k&#246;nnen damit Agent-Attribution korrekt taggen. Ein kleiner, aber wichtiger Baustein f&#252;r saubere Audit-Trails.</p><p><strong>Windows ohne Git Bash</strong> &#8212; v2.1.120 nutzt PowerShell als Default-Shell, wenn Git for Windows fehlt. PowerShell-Tool-Permissions k&#246;nnen auto-genehmigt werden. Schluss mit dem Workaround-Setup f&#252;r Windows-only-Teams.</p><h3>Performance und Plattform</h3><p><strong>Memory-Leaks gefixt</strong> &#8212; v2.1.121 schlie&#223;t mehrere Speicherlecks: Multi-GB-RSS bei vielen Bildern, ~2 GB Leak in <code>/usage</code> bei gro&#223;en Transcripts, Leaks in long-running Tools. Wer Sessions tagelang offen l&#228;sst, merkt das sofort.</p><p><strong>Skill-Suche und Effort-Placeholder</strong> &#8212; Filter-Suchbox in <code>/skills</code>, Skills k&#246;nnen <code>${CLAUDE_EFFORT}</code> referenzieren. Die Skill-Plattform reift in kleinen, n&#252;tzlichen Schritten.</p><p><strong>Quellen:</strong></p><ul><li><p><a href="https://code.claude.com/docs/en/changelog">Claude Code Changelog</a></p></li><li><p><a href="https://releasebot.io/updates/anthropic/claude-code">Releasebot: Claude Code April 2026</a></p></li><li><p><a href="https://ton-technotes.com/en/blog/2026-04-25-claude-code-weekly-update-v2119/">Ton Technotes: v2.1.115&#8211;119 Polish Inside</a></p></li></ul><div><hr></div><h2>Agentic Coding: Cursor 3.1, Copilot Inline-Agent und der Stack-Mix wird Standard</h2><p><strong>Cursor 3.1</strong> (Nachtrag, Mitte April: 3.1 am 13. April, Interactive Canvases am 15.) erg&#228;nzt das Agents-Window aus 3.0 um <strong>Interactive Canvases</strong>: durable Side-Panel-Artefakte mit Tabellen, Diagrammen, Diffs und Custom-Components. Cursor antwortet jetzt nicht mehr nur mit Text und Code, sondern baut Dashboards und Mini-Interfaces, die neben Terminal und Browser im Side-Panel persistent leben. Das ist die richtige Antwort auf eine Beobachtung, die mehrere Hosts gerade machen: Der Output eines l&#228;ngeren Agent-Laufs vertr&#228;gt mehr als nur Markdown.</p><p><strong>GitHub Copilot Inline Agent Mode</strong> (24. April) &#8212; Public Preview f&#252;r JetBrains-IDEs. Agent-Capabilities aus dem Inline-Chat heraus, ohne in das Chat-Panel zu wechseln. Copilot positioniert sich klar in der &#8222;im IDE bleiben&#8221;-Ecke, w&#228;hrend Claude Code Terminal-first und Cursor IDE-Rebuilt f&#228;hrt.</p><p><strong>The New Stack berichtet</strong>, dass Teams zunehmend <strong>alle drei parallel</strong> nutzen &#8212; Cursor f&#252;r IDE-native Edits, Claude Code f&#252;r Terminal-Workflows und Headless-Routinen, Codex f&#252;r Browser- und Computer-Use. Das ist neu: Vor sechs Monaten war die Tooling-Frage &#8222;wer gewinnt?&#8221;. Jetzt ist sie &#8222;wie kombiniere ich?&#8221;.</p><p><strong>Warum das relevant ist:</strong> Wer noch versucht, ein Tool f&#252;r alles zu w&#228;hlen, optimiert in die falsche Richtung. Die spannenden Setups bauen jetzt <strong>portable Skills, Hooks und Routines</strong>, die zwischen Hosts wandern k&#246;nnen &#8212; genau dort, wo <code>gh skill</code> (siehe #003) ansetzt.</p><p><strong>Quellen:</strong></p><ul><li><p><a href="https://releasebot.io/updates/cursor">Cursor Release Notes</a></p></li><li><p><a href="https://github.blog/changelog/2026-04-24-inline-agent-mode-in-preview-and-more-in-github-copilot-for-jetbrains-ides/">GitHub Changelog: Inline agent mode in JetBrains</a></p></li><li><p><a href="https://thenewstack.io/ai-coding-tool-stack/">The New Stack: Cursor, Claude Code, Codex are merging into one stack</a></p></li><li><p><a href="https://devtoolpicks.com/blog/cursor-3-agents-window-review-2026">DevTool Picks: Cursor 3 Review</a></p></li></ul><div><hr></div><h2>Trend der Woche</h2><h3>Big Tech doppelt nach: Googles 40-Milliarden-Wette auf Anthropic</h3><p>Am 24. April hat <strong>Google bis zu 40 Mrd. $ Investment</strong> in Anthropic angek&#252;ndigt &#8212; 10 Mrd. $ jetzt cash bei einer 350-Mrd.-$-Bewertung, weitere 30 Mrd. $ an Performance-Targets gekoppelt. Dazu: <strong>5 Gigawatt Compute</strong> &#252;ber f&#252;nf Jahre via Google Cloud, mit Option auf weitere Gigawatt. Das passiert nur vier Tage, nachdem Amazon zus&#228;tzliche bis zu 25 Mrd. $ committet hatte (5 Mrd. cash, 20 Mrd. an Milestones gekoppelt).</p><p>Die Choreographie ist bemerkenswert: Anthropic und Google sind gleichzeitig Partner und Konkurrenten &#8212; Gemini 3.1 Pro misst sich offen an Opus 4.7. Trotzdem zieht Google nach. Der Grund: Wer in der Coding-Agent-Schicht des Stacks f&#252;hrend bleiben will, muss die Compute-Allokation f&#252;r die Modelle sichern, die Entwickler tats&#228;chlich t&#228;glich benutzen. Anthropic ist genau das geworden &#8212; auch dank Claude Code.</p><p>Parallel hat Anthropic in der Woche <strong>drei weitere Expansionssignale</strong> gesetzt: Sydney als vierter APAC-Standort (27. April, Theo Hourmouzis von Snowflake als ANZ-GM), eine <strong>NEC-Partnerschaft in Japan</strong> mit Rollout an 30.000 Mitarbeiter und Aufbau einer der gr&#246;&#223;ten AI-native Engineering-Organisationen Japans (24. April), sowie Memorandum mit der australischen Regierung. Das zusammen mit den Investments ergibt das Bild: Anthropic positioniert sich f&#252;r IPO <strong>als globale Plattform</strong>, nicht nur als Modell-Anbieter.</p><p><strong>Quellen:</strong></p><ul><li><p><a href="https://www.bloomberg.com/news/articles/2026-04-24/google-plans-to-invest-up-to-40-billion-in-anthropic">Bloomberg: Google plans up to $40B in Anthropic</a></p></li><li><p><a href="https://techcrunch.com/2026/04/24/google-to-invest-up-to-40b-in-anthropic-in-cash-and-compute/">TechCrunch: Google to invest up to $40B in cash and compute</a></p></li><li><p><a href="https://www.axios.com/2026/04/24/google-amazon-anthropic-investment">Axios: Google&#8217;s $40B Anthropic move is Big Tech&#8217;s latest huge bet</a></p></li><li><p><a href="https://www.anthropic.com/news/theo-hourmouzis-general-manager-australia-new-zealand">Anthropic: Theo Hourmouzis als General Manager Australia &amp; New Zealand</a></p></li><li><p><a href="https://www.anthropic.com/news/anthropic-nec">Anthropic + NEC: Building Japan&#8217;s largest AI engineering workforce</a></p></li></ul><div><hr></div><h2>Kurz notiert</h2><ul><li><p><strong>Google Cloud Next 2026</strong> (22. April) &#8212; Konferenz unter dem Banner &#8222;Agentic Era&#8221;. Kevin Ichhpurani (President Global Partner Ecosystem) k&#252;ndigt 750 Mio. $ f&#252;r das 120k-Partner-&#214;kosystem an, um agentische Use-Cases zu beschleunigen. <a href="https://www.googlecloudpresscorner.com/2026-04-22-Google-Cloud-Commits-750-Million-to-Accelerate-Partners-Agentic-AI-Development">Google Cloud Press</a> &#183; <a href="https://biztechmagazine.com/article/2026/04/google-cloud-next-2026-businesses-are-moving-agentic-era">BizTech</a></p></li><li><p><strong>Cloudflare Agents Week</strong> (Nachtrag, 12.&#8211;20. April) &#8212; Vollst&#228;ndiger Stack-Push: Workers AI, AI Gateway, MCP-Hosting, Browser-Rendering. Im internen Engineering-Stack laufen pro Monat 241 Mrd. Tokens und 20 Mio. AI-Gateway-Requests durch die eigenen Produkte &#8212; gebaut auf dem, was sie auch verkaufen. Plattform-Konkurrenz f&#252;r Anthropic und Google bekommt eine Edge-native Variante. <a href="https://blog.cloudflare.com/agents-week-in-review/">Cloudflare Blog</a> &#183; <a href="https://blog.cloudflare.com/internal-ai-engineering-stack/">Internal Stack-Daten</a></p></li><li><p><strong>MIT Technology Review zu Agent Orchestration</strong> &#8212; Lesenswerter &#220;berblick: Multi-Agent-Systeme als &#8222;Flie&#223;band-Moment&#8221; f&#252;r White-Collar-Arbeit. Konkret namentlich erw&#228;hnt sind Claude Code (mit &#8222;a couple of dozen subagents&#8221; im Einsatz) und Claude Cowork (in zehn Tagen gebaut). Hauptsorge: unvorhersehbares LLM-Verhalten, sobald die Agenten aus dem Browser-Fenster heraus mit der echten Welt interagieren. <a href="https://www.technologyreview.com/2026/04/21/1135654/agent-orchestration-ai-artificial-intelligence/">MIT Tech Review</a></p></li><li><p><strong>Simon Willison &#252;ber Qwen3.6-27B</strong> &#8212; Alibabas neues 27-Mrd.-Dense-Modell erreicht Flagship-Coding-Performance lokal und schl&#228;gt das vorherige Open-Source-Flaggschiff Qwen3.5-397B-A17B. Open-Weight-Druck auf die Frontier-Labs steigt weiter. <a href="https://simonwillison.net/2026/Apr/22/qwen36-27b/">simonwillison.net</a></p></li></ul><div><hr></div><p><em>N&#228;chste Ausgabe: Donnerstag, 7. Mai 2026</em></p><p><em>Feedback? Einfach kommentieren/antworten.</em></p><div class="subscription-widget-wrap-editor" data-attrs="{&quot;url&quot;:&quot;https://blog.fluxum.net/subscribe?&quot;,&quot;text&quot;:&quot;Abonnieren&quot;,&quot;language&quot;:&quot;de&quot;}" data-component-name="SubscribeWidgetToDOM"><div class="subscription-widget show-subscribe"><div class="preamble"><p class="cta-caption">Danke f&#252;rs Lesen von fluxum engineering! Abonnieren Sie kostenlos, um neue Posts zu erhalten und meine Arbeit zu unterst&#252;tzen.</p></div><form class="subscription-widget-subscribe"><input type="email" class="email-input" name="email" placeholder="E-Mail-Adresse eingeben &#8230;" tabindex="-1"><input type="submit" class="button primary" value="Abonnieren"><div class="fake-input-wrapper"><div class="fake-input"></div><div class="fake-button"></div></div></form></div></div>]]></content:encoded></item><item><title><![CDATA[Agentic Weekly #003 — Opus 4.7, Pro-Verwirrung und Skills als neuer Standard]]></title><description><![CDATA[W&#246;chentlicher &#220;berblick zu Agentic Engineering, Agentic Coding & Claude Code]]></description><link>https://blog.fluxum.net/p/agentic-weekly-003-opus-47-pro-verwirrung</link><guid isPermaLink="false">https://blog.fluxum.net/p/agentic-weekly-003-opus-47-pro-verwirrung</guid><dc:creator><![CDATA[Martin Gross]]></dc:creator><pubDate>Thu, 23 Apr 2026 08:01:00 GMT</pubDate><enclosure url="https://substackcdn.com/image/fetch/$s_!y_oj!,w_256,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fa142b85f-3d35-4a80-bdac-1835f765cd9e_512x512.png" length="0" type="image/jpeg"/><content:encoded><![CDATA[<p><em>23. April 2026 &#8212; Lesezeit: ~6 Min.</em></p><div><hr></div><h2>Die gro&#223;e Nachricht der Woche</h2><h3>Claude Opus 4.7: Der erste klare Sprung &#252;ber 60 % auf SWE-bench Pro</h3><p>Am 16. April hat Anthropic <strong>Claude Opus 4.7</strong> general-available gemacht. Das eigentliche Signal ist weniger ein weiterer Benchmark-Gewinn als der Sprung auf <strong>SWE-bench Pro</strong> 53,4 &#8594; <strong>64,3 %</strong> &#8212; also auf dem h&#228;rteren Engineering-Benchmark, der l&#228;ngere, realistischere Software-Aufgaben abbildet. Dazu <strong>SWE-bench Verified</strong> 80,8 &#8594; <strong>87,6 %</strong>, <strong>Terminal-Bench 2.0</strong> 65,4 &#8594; 69,4 %, <strong>CursorBench</strong> 58 &#8594; 70 %. Auf SWE-bench Pro liegt Opus 4.7 vor GPT-5.4 (57,7 %) und Gemini 3.1 Pro (54,2 %). Dazu <strong>High-Res-Vision</strong> bis 3,75 Megapixel (3&#215; Opus 4.6) und Pricing unver&#228;ndert bei <strong>5 $ / 25 $ pro Million In-/Output-Tokens</strong>.</p><p>Die Reaktionen darauf sind trotzdem nicht einhellig. In der Community gab es Berichte &#252;ber einen <strong>h&#246;heren Tokenverbrauch bei vergleichbaren Prompts</strong> &#8212; wichtig, weil ein st&#228;rkeres Modell in der Praxis nur dann ein klarer Gewinn ist, wenn die realen Kosten im eigenen Workflow mitziehen. Ein feststehendes Faktum ist das noch nicht, aber ein Community-Signal, das Teams in eigenen L&#228;ufen messen sollten. Anthropic hat zeitgleich an den Effort-Defaults gedreht: <code>high</code><strong> ist jetzt Default</strong> f&#252;r Opus 4.6 und Sonnet 4.6 bei Pro- und Max-Subscribern (vorher <code>medium</code>); <code>xhigh</code> steht als neue Stufe exklusiv f&#252;r Opus 4.7 bereit. Direkte Antwort auf die Nerfing-Debatte der Vorwoche.</p><p><strong>Warum das relevant ist:</strong> Opus 4.7 ist der erste allgemein verf&#252;gbare Release, der auf SWE-bench Pro sichtbar Abstand gewinnt. Das macht ihn nicht automatisch zum Gewinner in jedem Stack, verschiebt aber die Messlatte f&#252;r l&#228;ngere agentische Coding-L&#228;ufe, Review-Workloads und komplexere Tool-Use-Szenarien. Wer Opus im Stack hat, sollte die Upgrade-Pr&#252;fung jetzt machen &#8212; inklusive echter Token- und Laufzeitmessung im eigenen Kontext.</p><p><strong>Quellen:</strong></p><ul><li><p><a href="https://www.anthropic.com/news/claude-opus-4-7">Anthropic: Introducing Claude Opus 4.7</a></p></li><li><p><a href="https://venturebeat.com/technology/anthropic-releases-claude-opus-4-7-narrowly-retaking-lead-for-most-powerful-generally-available-llm">VentureBeat: Opus 4.7 narrowly retakes the lead</a></p></li><li><p><a href="https://www.vellum.ai/blog/claude-opus-4-7-benchmarks-explained">Vellum: Opus 4.7 Benchmarks Explained</a></p></li><li><p><a href="https://thenextweb.com/news/anthropic-claude-opus-4-7-coding-agentic-benchmarks-release">TheNextWeb: Opus 4.7 Agentic Benchmarks</a></p></li><li><p><a href="https://github.blog/changelog/2026-04-16-claude-opus-4-7-is-generally-available/">GitHub Changelog: Opus 4.7 GA</a></p></li></ul><div><hr></div><h2>Die unbequeme Debatte: Claude Code und die Pro-Verwirrung</h2><p>Am 21. April tauchte Claude Code auf &#246;ffentlichen Anthropic-Seiten zeitweise nicht mehr im <strong>20-$-Pro-Plan</strong> auf; Support-Dokumente sprachen nur noch von Max. Kritik auf X und Reddit folgte unmittelbar, ein paar Stunden sp&#228;ter war die Darstellung wieder korrigiert. Anthropics Amol Avasare kl&#228;rte auf: <strong>&#8222;a small test on ~2 % of new prosumer signups&#8221;</strong> &#8212; bestehende Abonnenten seien nicht betroffen, die &#246;ffentlichen Seiten &#8222;versehentlich&#8221; aktualisiert. Das Experiment l&#228;uft unter der Haube weiter.</p><p><strong>Simon Willison</strong> ordnet n&#252;chtern ein: Vertrauensverlust durch die intransparente &#196;nderung, strategisches Fragezeichen (Codex kostet weiterhin weniger), und die Frage, ob man Lehrmaterial um ein Tool baut, das sich Leser nicht leisten k&#246;nnen. Die eigentliche Story ist deshalb weniger &#8222;Claude Code ist raus&#8221;, sondern eher: Schon kleine, intransparente &#196;nderungen an Limits und Zug&#228;ngen erzeugen sofort Vertrauensverlust.</p><p><strong>Warum das relevant ist:</strong> Derselbe Reflex wie bei der Effort-Debatte &#8212; still an wirtschaftlichen Stellschrauben drehen, erst kommunizieren, wenn die Community rebelliert. Wer Claude Code in Team-Workflows oder Trainingsmaterial einplant, sollte nicht nur auf Modellleistung schauen, sondern auch auf die Frage: Bleibt das Setup f&#252;r Leser, Teilnehmer oder Teams bezahlbar und stabil erreichbar?</p><p><strong>Quellen:</strong></p><ul><li><p><a href="https://www.wheresyoured.at/news-anthropic-removes-pro-cc/">Where&#8217;s Your Ed At: Anthropic (Briefly) Removes Claude Code From Pro</a></p></li><li><p><a href="https://www.theregister.com/2026/04/22/anthropic_removes_claude_code_pro/">The Register: Anthropic tests reaction to yanking Claude Code from Pro</a></p></li><li><p><a href="https://simonwillison.net/2026/Apr/22/claude-code-confusion/">Simon Willison: Is Claude Code going to cost $100/month?</a></p></li><li><p><a href="https://thenewstack.io/anthropic-claude-code-limits/">The New Stack: Claude Code Limits</a></p></li></ul><div><hr></div><h2>Claude Code: Die Highlights der Woche</h2><p>Sieben Releases in sieben Tagen: <strong>v2.1.111 bis v2.1.117</strong>. Neben Opus-4.7-Support bringt die Woche einen Architekturwechsel.</p><h3>F&#252;r alle, die Claude Code t&#228;glich nutzen</h3><p><strong>Native Binary statt bundled JavaScript</strong> &#8212; v2.1.113 schaltet auf macOS und Linux auf einen nativen Claude-Code-Binary um. <code>Glob</code> und <code>Grep</code> laufen &#252;ber eingebettetes <code>bfs</code> und <code>ugrep</code> via Bash. Sp&#252;rbar schnellere Kaltstarts, weniger Node-Overhead, weniger Abh&#228;ngigkeit von globalem npm.</p><p><code>/ultrareview</code> &#8212; Seit v2.1.111, in v2.1.113 parallelisiert mit Diffstat-Ausgabe: umfassende Code-Reviews in der Cloud. F&#252;r PR-Pr&#252;fungen, die lokal zu lange dauern, wird das der neue Default.</p><p><strong>Opus 4.7 </strong><code>xhigh</code><strong>-Effort und interaktiver Effort-Slider</strong> &#8212; Neue Stufe zwischen <code>high</code> und <code>max</code>, exklusiv f&#252;r Opus 4.7. <code>/effort</code> ohne Argument &#246;ffnet jetzt einen Slider &#8212; endlich ein Interface f&#252;r den Trade-off zwischen Geschwindigkeit und Tiefe.</p><h3>F&#252;r Multi-Agent- und Plugin-Workflows</h3><p><strong>Agent-Frontmatter endlich vollst&#228;ndig</strong> &#8212; <code>mcpServers</code> und <code>hooks</code> aus dem Agent-Frontmatter werden jetzt auch f&#252;r Main-Thread-Sessions geladen, wenn per <code>--agent</code> gestartet wird. Kleines Detail, gro&#223;er Effekt f&#252;r alle, die Agents als First-Class in Workflows behandeln.</p><p><strong>Plugin-Dependencies auto-resolved</strong> &#8212; <code>plugin install</code>, <code>/reload-plugins</code> und Auto-Update l&#246;sen fehlende Abh&#228;ngigkeiten eigenst&#228;ndig auf. <code>blockedMarketplaces</code> und <code>strictKnownMarketplaces</code> werden durchgesetzt &#8212; Enterprise-Admins bekommen ihre Plugin-Kontrolle zur&#252;ck.</p><p><code>/fewer-permission-prompts</code><strong>-Skill</strong> &#8212; Scannt Transcripts nach h&#228;ufigen read-only Bash- und MCP-Calls und schl&#228;gt eine priorisierte Allow-List f&#252;r <code>.claude/settings.json</code> vor. Der Endgegner der st&#228;ndigen Permission-Dialoge.</p><h3>F&#252;r CI/CD und Sicherheit</h3><p><strong>Sandbox-H&#228;rtung</strong> &#8212; <code>sandbox.network.deniedDomains</code> blockt Domains auch innerhalb weit gefasster Allow-Patterns. Deny-Rules greifen jetzt bei <code>env</code>-, <code>sudo</code>-, <code>watch</code>-, <code>ionice</code>- und <code>setsid</code>-gewrappten Kommandos; <code>find:*</code>-Allow-Regeln lassen nicht mehr automatisch <code>-exec</code>/<code>-delete</code> durch. Dazu ein gefixter Edge-Case, in dem <code>dangerouslyDisableSandbox</code> Kommandos <strong>ohne Sandbox und ohne Permission-Prompt</strong> laufen lie&#223;. Wer &#228;ltere 2.1er in Pipelines hat: jetzt updaten.</p><h3>Performance und Plattform</h3><p><code>/resume</code><strong> bis zu 67 % schneller</strong> auf Sessions &gt;40 MB (v2.1.116), parallelisierter MCP-Startup (v2.1.117), PowerShell-Tool progressiv auf Windows via <code>CLAUDE_CODE_USE_POWERSHELL_TOOL</code>. OpenTelemetry bekommt <code>effort</code>-Attribute auf Cost-, Token- und API-Metriken &#8212; Billing-Analysen nach Effort-Level werden endlich m&#246;glich.</p><p><strong>Quellen:</strong></p><ul><li><p><a href="https://code.claude.com/docs/en/changelog">Claude Code Changelog</a></p></li><li><p><a href="https://releasebot.io/updates/anthropic/claude-code">Releasebot: Claude Code April 2026</a></p></li><li><p><a href="https://github.com/anthropics/claude-code/releases">GitHub: Claude Code Releases</a></p></li></ul><div><hr></div><h2>Agentic Coding: Codex &#246;ffnet den Mac &#8212; und GitHub standardisiert Skills</h2><p><strong>OpenAI Codex &#8222;for (almost) everything&#8221;</strong> (16. April): <strong>Computer Use auf dem Mac</strong>, ein In-App-Browser mit Kommentar-Funktion direkt auf Webseiten, <strong>90+ neue Plugins</strong> (Atlassian Rovo, CircleCI, CodeRabbit, GitLab Issues, Microsoft Suite, Neon, Render u. a.), Memory und proaktive Task-Vorschl&#228;ge. Parallele Agents dr&#228;ngen sich nicht ins Foreground-Fenster. OpenAI nennt <strong>3 Mio. weekly active Developer</strong>, npm-Downloads wuchsen von 82k (April 2025) auf 14,5 Mio. (M&#228;rz 2026). Die Bewegung spiegelt Anthropics Desktop-Routines aus #002 &#8212; Codex holt strategisch auf.</p><p><code>gh skill</code><strong> Public Preview</strong> (16. April, GitHub CLI v2.90.0): Ein einziger Befehl, um <strong>Agent Skills</strong> &#252;ber alle gro&#223;en Agent-Hosts hinweg zu installieren, zu versionieren, zu suchen und zu publizieren &#8212; Claude Code, Copilot, Cursor, Codex, Gemini. Skills folgen einer offenen Spezifikation, jede Installation tr&#228;gt die Git-Tree-SHA ihres Source-Verzeichnisses, Updates vergleichen echte Content-&#196;nderungen. Das ist im Stillen der gr&#246;&#223;te Schritt in Richtung Interoperabilit&#228;t, den das &#214;kosystem seit MCP gesehen hat.</p><p><strong>Warum das relevant ist:</strong> Die Frontline verschiebt sich. Codex schlie&#223;t den Desktop-Gap zu Claude Code, GitHub liefert das fehlende Paketformat &#252;ber alle Hosts hinweg. Wer Tooling-Entscheidungen trifft, sollte ab jetzt davon ausgehen, dass Skills portabel sind &#8212; und Lock-in auf einzelne Agent-Hosts wird zur strategischen Altlast.</p><p><strong>Quellen:</strong></p><ul><li><p><a href="https://openai.com/index/codex-for-almost-everything/">OpenAI: Codex for (almost) everything</a></p></li><li><p><a href="https://www.macrumors.com/2026/04/16/openai-codex-mac-update/">MacRumors: Codex Mac Update</a></p></li><li><p><a href="https://github.blog/changelog/2026-04-16-manage-agent-skills-with-github-cli/">GitHub Changelog: gh skill</a></p></li><li><p><a href="https://groundy.com/articles/github-clis-gh-skill-command-one-standard-to-rule-claude-code-copilot-cursor/">Groundy: gh skill command analysis</a></p></li></ul><div><hr></div><h2>Trend der Woche</h2><h3>Agent Skills werden zum neuen npm</h3><p>Drei Bewegungen zeigen in dieselbe Richtung: <code>gh skill</code> macht Skills portabel &#252;ber Hosts, <strong>Claude Code v2.1.111</strong> erlaubt, built-in Slash-Commands (<code>/init</code>, <code>/review</code>, <code>/security-review</code>) via Skill-Tool zu discovern, und <strong>OpenAI Codex</strong> baut rund um Skills, Plugins und MCP-Server ein modulareres &#214;kosystem aus. Noch ist das kein vollst&#228;ndig konsolidierter Standard &#8212; aber es ist gut m&#246;glich, dass wir gerade den Moment sehen, in dem &#8222;Skill&#8221; vom Prompt-Schnipsel zum versionierten, signierten, cross-kompatiblen Artefakt wird. Wer Agentic Engineering ernsthaft baut, sollte aufh&#246;ren, Wissen in Prompts und Repo-Wikis zu verstreuen, und <strong>Skills als First-Class-Artefakt</strong> versionieren. Genau dort d&#252;rfte sich in den n&#228;chsten Monaten entscheiden, welche Teams nur mit Agenten experimentieren &#8212; und welche daraus echte Produktivit&#228;t ziehen.</p><p><strong>Quellen:</strong></p><ul><li><p><a href="https://github.blog/changelog/2026-04-16-manage-agent-skills-with-github-cli/">GitHub: Manage agent skills with GitHub CLI</a></p></li><li><p><a href="https://code.claude.com/docs/en/changelog">Anthropic Claude Code: Skills in changelog</a></p></li><li><p><a href="https://www.bighatgroup.com/blog/gh-skill-github-cli-agent-skills-management/">Big Hat Group: gh skill Deep Dive</a></p></li></ul><div><hr></div><h2>Kurz notiert</h2><ul><li><p><strong>Claude Design</strong> (17. April) &#8212; Anthropic Labs launcht Research Preview f&#252;r Prototypen, Slides, One-Pager. Powered by Opus 4.7, liest Codebase und Design-Systeme, Export zu Canva, PDF, PPTX oder als Handoff-Bundle an Claude Code. Figmas Aktie reagierte sofort negativ. <a href="https://www.anthropic.com/news/claude-design-anthropic-labs">Anthropic</a> &#183; <a href="https://techcrunch.com/2026/04/17/anthropic-launches-claude-design-a-new-product-for-creating-quick-visuals/">TechCrunch</a></p></li><li><p><strong>Mythos-Leak-Report</strong> &#8212; TechCrunch berichtete am 21. April, eine unautorisierte Gruppe habe Zugriff auf Anthropics exklusives Cyber-Modell Mythos erlangt. Das Modell war nur im Rahmen von Project Glasswing an AWS, Apple, Google, JPMorgan, Microsoft und Nvidia verteilt. Anthropic hat bislang nicht offiziell kommentiert. <a href="https://techcrunch.com/2026/04/21/unauthorized-group-has-gained-access-to-anthropics-exclusive-cyber-tool-mythos-report-claims/">TechCrunch</a></p></li><li><p><strong>Simon Willison zur Agent-Definition</strong> &#8212; Nach monatelangem Herumschlagen gibt es jetzt eine konsensf&#228;hige: &#8222;An LLM agent runs tools in a loop to achieve a goal.&#8221; <a href="https://simonw.substack.com/p/i-think-agent-may-finally-have-a">simonw.substack.com</a></p></li><li><p><strong>GitHub Copilot Individual Plan-&#196;nderungen</strong> &#8212; Am selben Tag wie das Anthropic-Pricing-Drama k&#252;ndigt GitHub Usage-basierte Limits f&#252;r Copilot-Agenten-Workflows an. Agentic Coding knirscht an den R&#228;ndern der alten Flatrate-Modelle. <a href="https://simonwillison.net/2026/Apr/22/changes-to-github-copilot/">simonwillison.net</a></p></li></ul><div><hr></div><p><em>N&#228;chste Ausgabe: Donnerstag, 30. April 2026</em></p><p><em>Feedback? Einfach kommentieren/antworten.</em></p>]]></content:encoded></item><item><title><![CDATA[Agentic Weekly #002 — Claude wird autonom (und die Community nervös)]]></title><description><![CDATA[W&#246;chentlicher &#220;berblick zu Agentic Engineering, Agentic Coding & Claude Code]]></description><link>https://blog.fluxum.net/p/agentic-weekly-002-claude-wird-autonom</link><guid isPermaLink="false">https://blog.fluxum.net/p/agentic-weekly-002-claude-wird-autonom</guid><dc:creator><![CDATA[Martin Gross]]></dc:creator><pubDate>Thu, 16 Apr 2026 08:44:00 GMT</pubDate><enclosure url="https://substackcdn.com/image/fetch/$s_!y_oj!,w_256,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fa142b85f-3d35-4a80-bdac-1835f765cd9e_512x512.png" length="0" type="image/jpeg"/><content:encoded><![CDATA[<p><em>16. April 2026 &#8212; Lesezeit: ~4 Min.</em></p><div><hr></div><h2>Die gro&#223;e Nachricht der Woche</h2><h3>Claude Code Desktop bekommt Routines &#8212; und wird zur Agent-Plattform</h3><p>Am 14. April hat Anthropic die Claude Code Desktop App von Grund auf neu gebaut. Das ist kein kosmetisches Update, sondern ein Architekturwechsel: Die App ist jetzt um <strong>parallele Sessions</strong> herum organisiert, mit einer Sidebar zum Managen mehrerer gleichzeitiger Agent-L&#228;ufe, Drag-and-Drop-Layout, integriertem Terminal und File-Editor.</p><p>Das eigentliche Highlight hei&#223;t <strong>Routines</strong> &#8212; eine neue Automatisierungsschicht, die Claude Code ohne aktive Session laufen l&#228;sst. Eine Routine b&#252;ndelt Prompt, Repository und Connectors in eine Konfiguration, die auf drei Arten triggern kann: nach <strong>Zeitplan</strong>, per <strong>API-Call</strong> oder durch ein <strong>GitHub-Event</strong> (z.B. neuer Pull Request). Routines laufen auf Anthropics Web-Infrastruktur, nicht lokal. Daily Caps nach Plan: Pro 5, Max 15, Team/Enterprise 25 (weitere zukaufbar).</p><p>Dazu kommt: Claude Code kann jetzt den <strong>Mac fernsteuern</strong> &#8212; wenn kein direkter Connector existiert (Slack, Google Calendar), navigiert Claude &#252;ber den Bildschirm wie ein Mensch. Drei View Modes (Verbose, Normal, Summary) lassen Nutzer steuern, wie viel von Claudes Tool-Aktivit&#228;t sie sehen wollen.</p><p><strong>Warum das relevant ist:</strong> Wer letzte Woche das Conway-Leak verfolgt hat (immer noch unbest&#228;tigt), sieht hier die offizielle Version: Claude bewegt sich von einem reaktiven Tool zu einem persistent laufenden, event-gesteuerten Agent. Routines sind der erste produktionsreife Schritt dahin.</p><p><strong>Quellen:</strong></p><ul><li><p><a href="https://www.macrumors.com/2026/04/15/anthropic-rebuilds-claude-code-desktop-app/">MacRumors: Anthropic Rebuilds Claude Code Desktop</a></p></li><li><p><a href="https://venturebeat.com/orchestration/we-tested-anthropics-redesigned-claude-code-desktop-app-and-routines-heres-what-enterprises-should-know">VentureBeat: Routines Hands-On</a></p></li><li><p><a href="https://9to5mac.com/2026/04/14/anthropic-adds-repeatable-routines-feature-to-claude-code-heres-how-it-works/">9to5Mac: Routines Feature</a></p></li><li><p><a href="https://siliconangle.com/2026/04/14/anthropics-claude-code-gets-automated-routines-desktop-makeover/">SiliconANGLE: Routines &amp; Desktop Makeover</a></p></li></ul><div><hr></div><h2>Die unbequeme Debatte: Wird Claude schlechter?</h2><p>Es ist das Thema der Woche in der Community: Eine wachsende Zahl von Power-Usern beklagt, dass Claude &#8212; insbesondere Opus 4.6 &#8212; seit Februar sp&#252;rbar schw&#228;cher geworden ist. Weniger gr&#252;ndliche Analysen, mehr Abk&#252;rzungen, h&#228;ufigeres vorzeitiges Abbrechen.</p><p>Die Ursache ist bekannt: Anthropic hat das Default-<strong>Effort-Level</strong> von Opus 4.6 am 9. Februar auf Adaptive Thinking umgestellt und am 3. M&#228;rz auf <strong>Medium Effort (Level 85)</strong> gesenkt. Weniger Tokens pro Anfrage, schnellere Antworten &#8212; aber auch weniger Tiefe.</p><p><strong>Stella Laurenzo</strong>, Senior Director bei AMDs AI-Gruppe, hat die Debatte mit einer datengest&#252;tzten Analyse auf GitHub befeuert: 6.852 Sessions, 17.871 Thinking Blocks, 234.760 Tool Calls. Ihr Befund: Die Reasoning-Tiefe fiel ab Februar messbar, w&#228;hrend &#8222;Simplest Fix&#8221;-Verhalten, Premature Stopping und Edit-first statt Research-first zunahmen.</p><p>Die Community-Reaktion ist deutlich. Fortune, VentureBeat, Axios und The Register haben berichtet. Der Vorwurf: Anthropic habe die &#196;nderung nicht transparent genug kommuniziert &#8212; sie stand im Changelog, wurde aber nicht prominent angek&#252;ndigt. Die Spekulation, dass Anthropic unter Compute-Knappheit leidet, h&#228;lt sich hartn&#228;ckig.</p><p><strong>Anthropics Antwort:</strong> Teams und Enterprise-Nutzer sollen k&#252;nftig standardm&#228;&#223;ig auf High Effort laufen, auch wenn das mehr Tokens und Latenz kostet. F&#252;r alle anderen bleibt <code>/effort max</code> der Workaround.</p><p><strong>Quellen:</strong></p><ul><li><p><a href="https://fortune.com/2026/04/14/anthropic-claude-performance-decline-user-complaints-backlash-lack-of-transparency-accusations-compute-crunch/">Fortune: Anthropic Performance Backlash</a></p></li><li><p><a href="https://www.axios.com/2026/04/16/anthropic-claude-power-user-complaints">Axios: Anthropic&#8217;s AI Downgrade Stings Power Users</a></p></li><li><p><a href="https://venturebeat.com/technology/is-anthropic-nerfing-claude-users-increasingly-report-performance">VentureBeat: Is Anthropic &#8216;Nerfing&#8217; Claude?</a></p></li><li><p><a href="https://www.theregister.com/2026/04/13/claude_outage_quality_complaints/">The Register: Claude Is Getting Worse, According to Claude</a></p></li><li><p><a href="https://scortier.substack.com/p/claude-code-drama-6852-sessions-prove">Stella Laurenzo: 6,852 Sessions Analysis</a></p></li></ul><div><hr></div><h2>Claude Code CLI: Die Highlights der Woche</h2><p>Sieben Releases in sieben Tagen &#8212; von <strong>v2.1.96 bis v2.1.108</strong>. Hier die Highlights, sortiert danach, wen sie betreffen:</p><h3>F&#252;r alle, die Claude Code t&#228;glich nutzen</h3><p><code>/recap</code> &#8212; Beim Zur&#252;ckkehren in eine Session liefert Claude jetzt automatisch einen Kontext-&#220;berblick. Konfigurierbar in <code>/config</code>, manuell aufrufbar mit <code>/recap</code>. Wer viele parallele Sessions jongliert und nach einem Kontextwechsel erst mal &#8222;Wo war ich?&#8221; denkt, spart damit sp&#252;rbar Zeit.</p><p><strong>Prompt Caching wird steuerbar</strong> &#8212; Zwei neue Environment-Variablen: <code>ENABLE_PROMPT_CACHING_1H</code> f&#252;r eine einst&#252;ndige Cache-TTL, <code>FORCE_PROMPT_CACHING_5M</code> f&#252;r f&#252;nf Minuten. Relevant f&#252;r alle, die ihre API-Kosten optimieren oder auf langsamen Backends arbeiten. Ein Bug, bei dem Subscriber mit <code>DISABLE_TELEMETRY</code> auf 5 Minuten statt 1 Stunde zur&#252;ckfielen, wurde gefixt.</p><h3>F&#252;r Multi-Agent- und MCP-Workflows</h3><p><strong>Background Monitors</strong> &#8212; Plugins k&#246;nnen jetzt &#252;ber den <code>monitors</code> Manifest-Key automatisch mit der Session starten. Wer Monitoring-Tools f&#252;r Builds, Tests oder Deployments als Plugin betreibt, bekommt damit eine hands-off L&#246;sung. Dazu: <code>/reload-plugins</code> erkennt neue Skills ohne Neustart.</p><p><strong>PreCompact Hook</strong> &#8212; Hooks k&#246;nnen Compaction blockieren (Exit-Code 2 oder <code>{"decision":"block"}</code>). N&#252;tzlich f&#252;r Agents, die mitten in einer langen Analyse stecken und ihren Kontext nicht verlieren d&#252;rfen.</p><h3>F&#252;r CI/CD und Automation</h3><p><strong>Security-Fixes</strong> &#8212; Mehrere Bash-Tool-Permission-Bypasses gefixt in v2.1.97/98: Backslash-Escaping umging Auto-Allow-Regeln, Redirects &#252;ber <code>/dev/tcp</code> und <code>/dev/udp</code> wurden nicht abgefangen, Env-Var-Prefixes tricksten die Permission-Pr&#252;fung aus. Wer &#228;ltere Versionen in Pipelines nutzt: jetzt updaten.</p><h3>Enterprise und Plattform</h3><p><strong>Google Vertex AI Setup Wizard</strong> &#8212; Interaktiver Wizard f&#252;r GCP-Authentifizierung, Projekt- und Regionskonfiguration, direkt vom Login-Screen aus. OS-CA-Zertifikate werden jetzt standardm&#228;&#223;ig vertraut &#8212; Schluss mit manueller Zertifikats-Konfiguration f&#252;r Enterprise-TLS-Proxies. Dazu <strong>PID Namespace Isolation</strong> f&#252;r Subprocess-Sandboxing auf Linux und ein neuer <code>/team-onboarding</code>-Command, der Onboarding-Guides f&#252;r Teammitglieder aus der eigenen Claude-Code-Nutzung generiert.</p><p><strong>Quellen:</strong></p><ul><li><p><a href="https://code.claude.com/docs/en/changelog">Claude Code Changelog</a></p></li><li><p><a href="https://releasebot.io/updates/anthropic/claude-code">Releasebot: Claude Code</a></p></li><li><p><a href="https://github.com/anthropics/claude-code/releases">GitHub: Claude Code Releases</a></p></li></ul><div><hr></div><h2>Agentic Coding: Cursor 3 und der Drei-Wege-Kampf</h2><p><strong>Cursor 3</strong> markiert einen Paradigmenwechsel: Das Interface wurde komplett um die Idee herum neu gebaut, dass der Gro&#223;teil des Codes von AI Agents geschrieben wird. Highlights: <strong>Agents Window</strong>, <strong>Design Mode</strong>, <strong>Cloud Agents</strong>. Composer 2 erreicht 61,3 auf CursorBench (+37 %) und 73,7 auf SWE-bench Multilingual. Anysphere hat &#252;ber 3 Milliarden Dollar eingesammelt bei einer ARR von 2 Milliarden.</p><p>Der Markt teilt sich in drei Philosophien: <strong>Cursor</strong> setzt auf IDE-native Deep Integration, <strong>GitHub Copilot</strong> auf Reichweite und Enterprise (Agent Mode GA, agentic Code Review seit M&#228;rz), <strong>Claude Code</strong> auf Terminal-first mit Routines und maximaler Flexibilit&#228;t. Die Wahl des Stacks ist jetzt eine Architekturentscheidung.</p><p><strong>Quellen:</strong></p><ul><li><p><a href="https://dev.to/devtoolpicks/cursor-3-just-launched-with-an-ai-agents-window-what-changed-and-is-it-still-worth-it-496f">DEV Community: Cursor 3 Launch</a></p></li><li><p><a href="https://www.nxcode.io/resources/news/cursor-vs-claude-code-vs-github-copilot-2026-ultimate-comparison">NxCode: Cursor vs Claude Code vs Copilot</a></p></li></ul><div><hr></div><h2>Trend der Woche</h2><h3>Anthropic auf dem Weg zum B&#246;rsengang &#8212; die 800-Milliarden-Frage</h3><p>Anthropic zieht Investoren-Angebote an, die das Unternehmen mit bis zu <strong>800 Milliarden Dollar</strong> bewerten &#8212; mehr als das Doppelte der Bewertung von 380 Milliarden aus dem Februar. Annualisierte Revenue: &#252;ber 30 Milliarden Dollar. IPO wird f&#252;r Oktober 2026 erwartet.</p><p><strong>Vas Narasimhan</strong>, CEO von Novartis, wurde am 14. April in den Board berufen &#8212; erstes Pharma-Schwergewicht, klares Signal Richtung Healthcare. Trust-berufene Direktoren stellen jetzt die Board-Mehrheit. Ein IPO-bereites Anthropic wird Claude Code aggressiver kommerzialisieren &#8212; die Enterprise-Features und Routines der letzten Woche passen ins Bild.</p><p><strong>Quellen:</strong></p><ul><li><p><a href="https://www.bloomberg.com/news/articles/2026-04-14/anthropic-attracts-investor-offers-at-a-800-billion-valuation">Bloomberg: Anthropic $800B Valuation</a></p></li><li><p><a href="https://www.anthropic.com/news/narasimhan-board">Anthropic: Narasimhan Board</a></p></li><li><p><a href="https://www.benzinga.com/markets/tech/26/04/51821987/anthropic-800b-valuation-claude-growth-ipo-openai-rivalry">Benzinga: Anthropic IPO</a></p></li></ul><div><hr></div><h2>Kurz notiert</h2><ul><li><p><strong>Conway-Leak</strong> &#8212; Anfang April tauchten 512.000 Zeilen Claude-Code-Quellcode auf, darin Details zu einer Always-On-Agent-Plattform namens Conway. Anthropic hat weder best&#228;tigt noch dementiert. Routines k&#246;nnten die offizielle Antwort sein. <a href="https://www.mindstudio.ai/blog/what-is-conway-agent-anthropic-always-on-background-ai">MindStudio</a></p></li><li><p><strong>Claude-Outage am 15. April</strong> &#8212; Erhebliche St&#246;rung bei Claude.ai, API und Claude Code von ~10:53 bis 13:42 ET. Wer Production-Workloads laufen hat: Redundanz einplanen. <a href="https://www.cnbc.com/2026/04/15/anthropic-outage-elevated-errors-claude-chatbot-code-api.html">CNBC</a></p></li><li><p><strong>Simon Willison &#252;ber Cybersecurity als &#8222;Proof of Work&#8221;</strong> &#8212; AI-Modelle wie Mythos ver&#228;ndern Vulnerability Research fundamental. <a href="https://simonwillison.net/2026/Apr/14/cybersecurity-proof-of-work/">simonwillison.net</a></p></li><li><p><strong>Anthropic Agentic Coding Trends Report 2026</strong> &#8212; Umfassender Bericht dar&#252;ber, wie Coding Agents Workflows ver&#228;ndern. Pflichtlekt&#252;re. <a href="https://resources.anthropic.com/2026-agentic-coding-trends-report">Anthropic Resources</a></p></li><li><p><strong>ICSE 2026: Workshop Agentic Engineering</strong> &#8212; Die f&#252;hrende Software-Engineering-Konferenz widmet dem Thema erstmals einen eigenen Workshop. <a href="https://conf.researchr.org/home/icse-2026/agent-2026">ICSE 2026</a></p></li></ul><div><hr></div><p><em>N&#228;chste Ausgabe: Donnerstag, 23. April 2026</em></p>]]></content:encoded></item><item><title><![CDATA[Agentic Weekly #001]]></title><description><![CDATA[W&#246;chentlicher &#220;berblick zu Agentic Engineering, Agentic Coding & Claude Code]]></description><link>https://blog.fluxum.net/p/agentic-weekly-001</link><guid isPermaLink="false">https://blog.fluxum.net/p/agentic-weekly-001</guid><dc:creator><![CDATA[Martin Gross]]></dc:creator><pubDate>Thu, 09 Apr 2026 08:47:00 GMT</pubDate><enclosure url="https://substackcdn.com/image/fetch/$s_!y_oj!,w_256,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fa142b85f-3d35-4a80-bdac-1835f765cd9e_512x512.png" length="0" type="image/jpeg"/><content:encoded><![CDATA[<p><em>9. April 2026 &#8212; Lesezeit: ~4 Min.</em></p><div><hr></div><h2>Die gro&#223;e Nachricht der Woche</h2><h3>Anthropic stellt Claude Mythos vor &#8212; und sperrt das Modell sofort weg</h3><p>Am Montag hat Anthropic mit Claude Mythos Preview ein neues Frontier-Modell vorgestellt, das vor allem durch eine F&#228;higkeit auff&#228;llt: Es findet und exploitet Zero-Day-Schwachstellen in allen gro&#223;en Betriebssystemen und Browsern. In internen Tests identifizierte Mythos tausende bisher unbekannte Sicherheitsl&#252;cken, viele davon in Code, der ein bis zwei Jahrzehnte alt ist.</p><p>Der Clou: Anthropic ver&#246;ffentlicht das Modell nicht frei, sondern nur &#252;ber <strong>Project Glasswing</strong> &#8212; eine neue Initiative f&#252;r defensive Cybersecurity. Zw&#246;lf Launch-Partner, darunter AWS, Apple, Google, Microsoft, CrowdStrike und die Linux Foundation, erhalten kontrollierten Zugang. Anthropic stellt daf&#252;r bis zu 100 Millionen Dollar an Usage Credits und 4 Millionen Dollar an Direktspenden f&#252;r Open-Source-Security bereit.</p><p>Simon Willison kommentierte treffend: Die Entscheidung, ein derart m&#228;chtiges Modell zun&#228;chst nur f&#252;r Sicherheitsforscher zug&#228;nglich zu machen, sei &#8222;notwendig&#8221;. Platformer berichtet gleichzeitig, dass einige Security-Experten beunruhigt sind &#8212; die Frage, wie lange der Vorsprung der Verteidiger h&#228;lt, steht im Raum.</p><p><strong>Warum das relevant ist:</strong> Agentic Security ist der logische n&#228;chste Schritt &#8212; wenn AI Agents Code schreiben, m&#252;ssen andere AI Agents ihn absichern. Mythos zeigt, wohin die Reise geht.</p><p><strong>Quellen:</strong></p><ul><li><p><a href="https://www.anthropic.com/glasswing">Anthropic: Project Glasswing</a></p></li><li><p><a href="https://techcrunch.com/2026/04/07/anthropic-mythos-ai-model-preview-security/">TechCrunch: Anthropic Mythos Preview</a></p></li><li><p><a href="https://simonwillison.net/2026/Apr/7/project-glasswing/">Simon Willison&#8217;s Take</a></p></li><li><p><a href="https://thehackernews.com/2026/04/anthropics-claude-mythos-finds.html">The Hacker News: Zero-Day Findings</a></p></li></ul><div><hr></div><h2>Claude Code: Die Highlights der Woche</h2><p>Die Versionen <strong>v2.1.89 bis v2.1.92</strong> brachten eine dichte Folge an Updates &#8212; hier die Highlights, sortiert danach, wen sie betreffen:</p><h3>F&#252;r alle, die Claude Code t&#228;glich nutzen</h3><p><strong>Flicker-free Rendering</strong> &#8212; Mit <code>CLAUDE_CODE_NO_FLICKER=1</code> gibt es eine Alt-Screen-Rendering-Option mit virtualisiertem Scrollback. Wer l&#228;ngere Agent-Sessions laufen l&#228;sst und vom Flackern bei schnellen Ausgaben genervt war, bekommt endlich eine saubere Terminal-Erfahrung.</p><p><code>/powerup</code><strong> Command</strong> &#8212; Interaktive Lektionen mit animierten Demos, die Claude-Code-Features Schritt f&#252;r Schritt erkl&#228;ren. Besonders n&#252;tzlich f&#252;r Einsteiger, aber auch f&#252;r erfahrene Nutzer, die versteckte Features entdecken wollen.</p><p><strong>Bessere </strong><code>/cost</code><strong>-Transparenz</strong> &#8212; Per-Model- und Cache-Hit-Aufschl&#252;sselung zeigt jetzt genau, wohin das Budget flie&#223;t. Relevant f&#252;r alle, die ihre API-Kosten im Blick behalten m&#252;ssen.</p><h3>F&#252;r Multi-Agent- und MCP-Workflows</h3><p><strong>MCP 500K</strong> &#8212; Die maximale Tool-Result-Gr&#246;&#223;e springt auf 500.000 Zeichen. Wer MCP-Server baut, die gro&#223;e Datenmengen zur&#252;ckgeben &#8212; etwa Datenbank-Dumps, lange Logs oder umfangreiche API-Responses &#8212; ist damit nicht mehr so schnell am Limit.</p><p><strong>Named Subagents</strong> &#8212; Subagents tauchen namentlich in den @-Mention-Vorschl&#228;gen auf. F&#252;r Teams, die mit spezialisierten Agents arbeiten (z.B. ein Test-Agent, ein Review-Agent, ein Deploy-Agent), wird die Orchestrierung damit deutlich intuitiver.</p><h3>F&#252;r CI/CD und Automation</h3><p><strong>Permission Deferral f&#252;r Headless Mode</strong> &#8212; PreToolUse Hooks k&#246;nnen Sessions jetzt pausieren und extern wieder aufnehmen. Der Use Case: Ein Agent in einer CI-Pipeline st&#246;&#223;t auf eine Aktion, die menschliche Freigabe braucht &#8212; statt abzubrechen, wartet er, bis jemand gr&#252;nes Licht gibt.</p><p><strong>PermissionDenied Hook</strong> &#8212; Neuer Hook, der nach Ablehnungen durch den Auto-Mode-Classifier feuert. Mit <code>{retry: true}</code> kann der Agent automatisch einen alternativen Weg einschlagen. N&#252;tzlich f&#252;r robustere autonome Workflows, die nicht beim ersten &#8222;Nein&#8221; aufgeben sollen.</p><h3>Performance und Plattform</h3><p>Schnellere Write-Tool-Diffs f&#252;r gro&#223;e Dateien (<strong>60 % schneller</strong>, besonders bei Dateien mit Tabs und Sonderzeichen), SSE-Transport jetzt in O(n) statt O(n&#178;) &#8212; sp&#252;rbar bei langen Sessions mit vielen Tool-Calls. Dazu ein interaktiver <strong>Bedrock Setup Wizard</strong> f&#252;r AWS-Nutzer und eine <strong>Windows PowerShell Preview</strong> f&#252;r das wachsende Windows-Lager.</p><p><strong>Quellen:</strong></p><ul><li><p><a href="https://code.claude.com/docs/en/changelog">Claude Code Changelog</a></p></li><li><p><a href="https://github.com/anthropics/claude-code/releases">GitHub Releases</a></p></li><li><p><a href="https://releasebot.io/updates/anthropic/claude-code">Releasebot: Claude Code</a></p></li></ul><div><hr></div><h2>Agentic Coding: Die Branche sortiert sich</h2><p><strong>Cursor launcht Agent Experience</strong> &#8212; Cursor hat eine neue Agent-Erfahrung vorgestellt, die explizit gegen Claude Code und Codex positioniert ist. Der Agent kann Dateien lesen/schreiben, Tests im Terminal ausf&#252;hren, Fehler iterativ beheben und das gesamte Repository per RAG indexieren.</p><p><strong>GitHub Copilot trainiert auf euren Daten</strong> &#8212; Ab dem 24. April nutzt GitHub Interaktionsdaten von Free-, Pro- und Pro+-Nutzern zum Modelltraining &#8212; inklusive Code-Snippets, Dateinamen und Repository-Strukturen. Opt-out ist m&#246;glich, aber nicht der Default. Business- und Enterprise-Kunden sind ausgenommen. Die Community-Reaktion ist eindeutig: 59 Thumbs-down, 3 Rockets. Wer nicht mitmachen will, sollte jetzt unter <code>/settings/copilot/features</code> die Option deaktivieren.</p><p><strong>GitHub Agent HQ</strong> &#8212; Claude und OpenAI Codex sind jetzt als w&#228;hlbare Agents in Public Preview verf&#252;gbar &#8212; direkt in GitHub, GitHub Mobile und VS Code. Die Multi-Agent-Zukunft wird konkret: Man w&#228;hlt seinen Agent je nach Task.</p><p><strong>CodeSignal: Agentic Coding Assessments</strong> &#8212; CodeSignal hat eine neue Kategorie technischer Assessments eingef&#252;hrt, die misst, wie gut Entwickler <em>mit</em> AI-Agents arbeiten. Laut deren Umfrage nutzen bereits 91 % der befragten US-Entwickler Agentic-AI-Tools bei der Arbeit, 75 % haben in den letzten sechs Monaten zumindest teilweise AI-generierten Code in Production deployed.</p><p><strong>Quellen:</strong></p><ul><li><p><a href="https://explore.n1n.ai/blog/cursor-ai-agent-experience-claude-code-codex-2026-04-03">Cursor Agent Experience</a></p></li><li><p><a href="https://github.blog/news-insights/company-news/updates-to-github-copilot-interaction-data-usage-policy/">GitHub Blog: Copilot Data Policy</a></p></li><li><p><a href="https://github.blog/news-insights/company-news/pick-your-agent-use-claude-and-codex-on-agent-hq/">GitHub Blog: Agent HQ</a></p></li><li><p><a href="https://www.theregister.com/2026/03/26/github_ai_training_policy_changes/">The Register: GitHub Training</a></p></li><li><p><a href="https://www.prnewswire.com/news-releases/codesignal-launches-industry-first-agentic-coding-assessments-for-ai-era-engineering-hiring-302732265.html">CodeSignal: Agentic Assessments</a></p></li></ul><div><hr></div><h2>Trend der Woche</h2><h3>Von Vibe Coding zu Agentic Engineering &#8212; die Reifephase</h3><p>Das Buzzword &#8222;Vibe Coding&#8221; aus 2025 &#8212; locker prompten und schauen, was passiert &#8212; weicht einer strukturierteren Disziplin. Medium-Autor ESA Engineering beschreibt den &#220;bergang treffend: Agentic Coding ist f&#252;r Produktions-CI/CD-Pipelines und gro&#223;e Refactors gebaut, Vibe Coding f&#252;r Hackathon-Prototypen.</p><p>Gartner prognostiziert, dass 40 % der Enterprise-Anwendungen bis Ende 2026 aufgabenspezifische AI-Agents enthalten werden (2025: unter 5 %). Anfragen zu Multi-Agent-Systemen stiegen um <strong>1.445 %</strong> von Q1 2024 bis Q2 2025. Multi-Model-Routing wird dabei zur Pflicht: Das Plan-and-Execute-Pattern &#8212; ein starkes Modell plant, g&#252;nstigere Modelle f&#252;hren aus &#8212; senkt die Kosten um bis zu 90 %.</p><p>Gleichzeitig w&#228;chst die Skepsis: 80 % der Entwickler nutzen AI Coding Agents, aber das Vertrauen in deren Accuracy ist von 40 % auf 29 % gefallen. Die zentrale Herausforderung 2026: Agents, denen man <em>vertrauen</em> kann &#8212; nicht nur welche, die beeindruckend aussehen. Die Branche konsolidiert sich um das Muster <em>human-prompted &#8594; agent-executed &#8594; human-reviewed</em>.</p><p><strong>Quellen:</strong></p><ul><li><p><a href="https://medium.com/technologai/from-vibe-to-agentic-the-2026-maturation-of-ai-driven-development-1bfb0844b5a6">Medium: From Vibe to Agentic</a></p></li><li><p><a href="https://www.openpr.com/news/4447249/gartner-s-2026-multi-agent-systems-boom-why-enterprises-need">Gartner&#8217;s Multi-Agent Systems Boom</a></p></li><li><p><a href="https://thenewstack.io/5-key-trends-shaping-agentic-development-in-2026/">The New Stack: 5 Key Trends</a></p></li><li><p><a href="https://letsdatascience.com/news/ai-agents-increase-developer-preparatory-workload-b890e82a">Let&#8217;s Data Science: Developer Trust</a></p></li></ul><div><hr></div><h2>Kurz notiert</h2><ul><li><p><strong>Anthropic sichert sich 3,5 GW Compute</strong> &#8212; Neuer Deal mit Google und Broadcom, TPU-Kapazit&#228;t ab 2027. Run-Rate-Revenue liegt bei &#252;ber 30 Mrd. Dollar. <a href="https://techcrunch.com/2026/04/07/anthropic-compute-deal-google-broadcom-tpus/">TechCrunch</a> &#183; <a href="https://www.cnbc.com/2026/04/06/broadcom-agrees-to-expanded-chip-deals-with-google-anthropic.html">CNBC</a></p></li><li><p><strong>1M-Token-Context-Beta wird eingestellt</strong> &#8212; Ab 30. April hat der <code>context-1m-2025-08-07</code> Beta-Header keine Wirkung mehr f&#252;r Sonnet 4.5 und Sonnet 4. <a href="https://releasebot.io/updates/anthropic">Anthropic Release Notes</a></p></li><li><p><strong>OpenAI, Anthropic und Google gegen Model-Distillation</strong> &#8212; Die drei arbeiten &#252;ber das Frontier Model Forum zusammen, um adversariale Distillationsversuche aus China zu erkennen. <a href="https://www.bloomberg.com/news/articles/2026-04-06/openai-anthropic-google-unite-to-combat-model-copying-in-china">Bloomberg</a></p></li><li><p><strong>Xcode 26.3 mit Agentic Coding</strong> &#8212; Apple integriert Claude Agent und OpenAI Codex &#252;ber MCP in Xcode. <a href="https://www.apple.com/newsroom/2026/02/xcode-26-point-3-unlocks-the-power-of-agentic-coding/">Apple Newsroom</a></p></li><li><p><strong>Coefficient Bio Akquisition</strong> &#8212; Anthropic kauft AI-Biotech-Startup f&#252;r ~400M Dollar, Team geht in die Healthcare &amp; Life Sciences Gruppe.</p></li><li><p><strong>Claude-Ausf&#228;lle</strong> &#8212; Am 6. und 8. April gab es Outages bei Claude &#8212; relevant f&#252;r alle, die Production Workloads darauf laufen haben. <a href="https://www.techradar.com/news/live/claude-anthropic-down-outage-april-6-2026">TechRadar</a></p></li></ul><div><hr></div><p><em>N&#228;chste Ausgabe: Mittwoch, 15. April 2026</em><br><em>Feedback? Einfach antworten &#8212; ich justiere gerne Fokus, Tiefe und Quellen.</em></p>]]></content:encoded></item><item><title><![CDATA[How Secure Is the Claude Code Sandbox on the Mac?]]></title><description><![CDATA[A Look Under the Hood of Claude Code and Cowork]]></description><link>https://blog.fluxum.net/p/how-secure-is-the-claude-code-sandbox</link><guid isPermaLink="false">https://blog.fluxum.net/p/how-secure-is-the-claude-code-sandbox</guid><dc:creator><![CDATA[Martin Gross]]></dc:creator><pubDate>Sun, 01 Mar 2026 14:43:15 GMT</pubDate><enclosure url="https://substackcdn.com/image/fetch/$s_!Jelx!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fd664dcb5-f88c-4c6e-9660-865ba0af7747_1024x1024.png" length="0" type="image/jpeg"/><content:encoded><![CDATA[<p><em>AI agents execute commands on your machine &#8212; but how well do the sandboxes of Claude Code and Cowork actually protect you? Both promise isolation, yet rely on entirely different mechanisms. I didn&#8217;t just read the documentation &#8212; I examined both systems from the inside using standard Linux tools. The result: the isolation is real, verifiable, and surprisingly well thought out.</em></p><div><hr></div><div class="captioned-image-container"><figure><a class="image-link image2 is-viewable-img" target="_blank" href="https://substackcdn.com/image/fetch/$s_!Jelx!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fd664dcb5-f88c-4c6e-9660-865ba0af7747_1024x1024.png" data-component-name="Image2ToDOM"><div class="image2-inset"><picture><source type="image/webp" srcset="https://substackcdn.com/image/fetch/$s_!Jelx!,w_424,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fd664dcb5-f88c-4c6e-9660-865ba0af7747_1024x1024.png 424w, https://substackcdn.com/image/fetch/$s_!Jelx!,w_848,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fd664dcb5-f88c-4c6e-9660-865ba0af7747_1024x1024.png 848w, https://substackcdn.com/image/fetch/$s_!Jelx!,w_1272,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fd664dcb5-f88c-4c6e-9660-865ba0af7747_1024x1024.png 1272w, https://substackcdn.com/image/fetch/$s_!Jelx!,w_1456,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fd664dcb5-f88c-4c6e-9660-865ba0af7747_1024x1024.png 1456w" sizes="100vw"><img src="https://substackcdn.com/image/fetch/$s_!Jelx!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fd664dcb5-f88c-4c6e-9660-865ba0af7747_1024x1024.png" width="1024" height="1024" data-attrs="{&quot;src&quot;:&quot;https://substack-post-media.s3.amazonaws.com/public/images/d664dcb5-f88c-4c6e-9660-865ba0af7747_1024x1024.png&quot;,&quot;srcNoWatermark&quot;:null,&quot;fullscreen&quot;:null,&quot;imageSize&quot;:null,&quot;height&quot;:1024,&quot;width&quot;:1024,&quot;resizeWidth&quot;:null,&quot;bytes&quot;:1813962,&quot;alt&quot;:null,&quot;title&quot;:null,&quot;type&quot;:&quot;image/png&quot;,&quot;href&quot;:null,&quot;belowTheFold&quot;:false,&quot;topImage&quot;:true,&quot;internalRedirect&quot;:&quot;https://blog.fluxum.net/i/189551969?img=https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fd664dcb5-f88c-4c6e-9660-865ba0af7747_1024x1024.png&quot;,&quot;isProcessing&quot;:false,&quot;align&quot;:null,&quot;offset&quot;:false}" class="sizing-normal" alt="" srcset="https://substackcdn.com/image/fetch/$s_!Jelx!,w_424,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fd664dcb5-f88c-4c6e-9660-865ba0af7747_1024x1024.png 424w, https://substackcdn.com/image/fetch/$s_!Jelx!,w_848,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fd664dcb5-f88c-4c6e-9660-865ba0af7747_1024x1024.png 848w, https://substackcdn.com/image/fetch/$s_!Jelx!,w_1272,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fd664dcb5-f88c-4c6e-9660-865ba0af7747_1024x1024.png 1272w, https://substackcdn.com/image/fetch/$s_!Jelx!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fd664dcb5-f88c-4c6e-9660-865ba0af7747_1024x1024.png 1456w" sizes="100vw" fetchpriority="high"></picture><div class="image-link-expand"><div class="pencraft pc-display-flex pc-gap-8 pc-reset"><button tabindex="0" type="button" class="pencraft pc-reset pencraft icon-container restack-image"><svg role="img" width="20" height="20" viewBox="0 0 20 20" fill="none" stroke-width="1.5" stroke="var(--color-fg-primary)" stroke-linecap="round" stroke-linejoin="round" xmlns="http://www.w3.org/2000/svg"><g><title></title><path d="M2.53001 7.81595C3.49179 4.73911 6.43281 2.5 9.91173 2.5C13.1684 2.5 15.9537 4.46214 17.0852 7.23684L17.6179 8.67647M17.6179 8.67647L18.5002 4.26471M17.6179 8.67647L13.6473 6.91176M17.4995 12.1841C16.5378 15.2609 13.5967 17.5 10.1178 17.5C6.86118 17.5 4.07589 15.5379 2.94432 12.7632L2.41165 11.3235M2.41165 11.3235L1.5293 15.7353M2.41165 11.3235L6.38224 13.0882"></path></g></svg></button><button tabindex="0" type="button" class="pencraft pc-reset pencraft icon-container view-image"><svg xmlns="http://www.w3.org/2000/svg" width="20" height="20" viewBox="0 0 24 24" fill="none" stroke="currentColor" stroke-width="2" stroke-linecap="round" stroke-linejoin="round" class="lucide lucide-maximize2 lucide-maximize-2"><polyline points="15 3 21 3 21 9"></polyline><polyline points="9 21 3 21 3 15"></polyline><line x1="21" x2="14" y1="3" y2="10"></line><line x1="3" x2="10" y1="21" y2="14"></line></svg></button></div></div></div></a></figure></div><p></p><blockquote><p>&#8220;If Claude decides to delete all my files: no big deal &#8212; but only inside an isolated VM.&#8221;</p></blockquote><p>Anyone who uses Claude Code in the terminal with default settings knows the drill: many commands require approval before Claude Code executes them. You constantly have to weigh whether a given command is safe or not.</p><blockquote><p>&#8220;Allow this? Allow once? Allow always?&#8221;</p></blockquote><p>You keep checking: is this harmless, or could this command cause problems? Cognitive load from reading command lines.</p><p>There are essentially two extremes: either you review every single permission request yourself, or you use the <code>--dangerously-skip-permissions</code> option, which allows everything. In between, there are many gradations. You can define your permissions with fine granularity, but that&#8217;s almost as much effort.</p><p>How nice would it be if you could simply allow everything while still being certain that nothing unwanted happens on your machine. Then agentic coding could proceed unhindered and you&#8217;d get results fast.</p><p>That&#8217;s exactly what an isolated system promises &#8212; one that runs shielded from your actual computer. Such an isolated system reduces the blast radius &#8212; the maximum damage a misguided command can cause &#8212; immensely. If something goes wrong, you simply restart and return to the last stable state. There are many ways to implement this.</p><p>One of them is the <code>/sandbox</code> command built into Claude Code. It activates a sandbox that restricts Claude Code at the OS level &#8212; file access and networking. You can let commands run automatically without confirming each one, because the sandbox limits what can happen. But how secure is it really?</p><p>And then there&#8217;s <strong>Cowork</strong> in the desktop version of the Claude app. Cowork is aimed more at knowledge workers than developers. It can access folders, create and modify files, install packages &#8212; all autonomously. At first glance, it&#8217;s not obvious how the protection works. There&#8217;s no <code>/sandbox</code> command you&#8217;d need to activate. The isolation happens in the background.</p><p>I was curious about both: how does the sandbox work in Claude Code? And how does Cowork protect me from unwanted changes on my machine?</p><p>I didn&#8217;t want to rely on the documentation alone &#8212; instead, I examined both systems from the inside. Here&#8217;s what I found.</p><h2>Two Products, Two Audiences, Two Security Models</h2><p>Before I dive into the technical details, an important distinction:</p><p><strong>Claude Code</strong> is a terminal tool for developers. It executes commands on your machine &#8212; in the same context where you work. The sandbox must be manually activated (<code>/sandbox</code>), making it opt-in. That makes sense: developers need as few restrictions as possible to be productive. They want to run commands that a restrictive sandbox would block. But with great power comes great responsibility. You need to understand what you&#8217;re approving.</p><p><strong>Cowork</strong> is part of the Claude Desktop app and is aimed at users who don&#8217;t want to deal with the command line. When someone asks Claude to create an Excel spreadsheet from five PDFs, they expect a result &#8212; not a discussion about file permissions. Cowork therefore needs to provide stronger protection, without requiring the user to configure anything.</p><p>The result: two different isolation models for two different risk profiles.</p><p>Let&#8217;s get into the details.</p><div><hr></div><h2>Cowork: A Linux Inside Your Mac</h2><p>Cowork launches a lightweight Linux VM via Apple&#8217;s Virtualization.framework. Not a container, but a real virtual machine with its own kernel.</p><p>What does the VM say about itself?</p><pre><code><code>$ cat /etc/os-release
PRETTY_NAME="Ubuntu 22.04.5 LTS"

$ uname -r
6.8.0-94-generic

$ uname -m
aarch64

$ nproc
4

$ free -h
              total    used    free
Mem:          3.8Gi   564Mi   1.8Gi
Swap:            0B      0B      0B

$ df -h /
Filesystem      Size  Used Avail Use%
/dev/nvme0n1p1  9.6G  7.2G  2.4G  75%
</code></code></pre><p>Ubuntu 22.04 on ARM64, 4 cores, 3.8 GB RAM, a 10 GB disk. No swap. Lean enough for document processing and scripts, but not meant for machine learning training.</p><p>On the macOS host, the VM files live at <code>~/Library/Application Support/Claude/vm_bundles/claudevm.bundle/</code>. The root image (<code>rootfs.img</code>) is 10 GB as a sparse file but only occupies about 7.5 GB on disk.</p><p>Alongside it sits a compressed backup (<code>rootfs.img.zst</code>, ~2 GB) and a few configuration files: <code>efivars.fd</code>, <code>macAddress</code>, <code>machineIdentifier</code>.</p><div><hr></div><h2>How Three Layers Work Together to Secure the Isolation</h2><p>The VM alone would already be a solid boundary. But Anthropic stacks three layers on top of each other.</p><h3>Layer 1: The VM</h3><p>Apple&#8217;s Virtualization.framework provides hardware isolation. The guest has its own kernel. Even an <code>rm -rf /</code> inside the VM leaves the host untouched.</p><h3>Layer 2: bubblewrap + seccomp</h3><p>Inside the VM, Claude doesn&#8217;t run directly &#8212; first comes <strong>bubblewrap</strong> (short: <code>bwrap</code>). Bubblewrap is a sandboxing tool that uses Linux namespaces to isolate processes from each other &#8212; similar to what containers do, but more lightweight.</p><p>It restricts what a process can see and do: which files, which network interfaces, which other processes.</p><p>In the Cowork VM, bubblewrap is PID 1 &#8212; the very first process:</p><pre><code><code>$ cat /proc/1/status | head -2
Name:   bwrap
State:  S (sleeping)
</code></code></pre><p>The bwrap command line (readable via <code>/proc/1/cmdline</code>) shows the key restrictions at a glance:</p><ul><li><p><code>--unshare-net</code> &#8212; separate network namespace, no direct network access</p></li><li><p><code>--unshare-pid</code> &#8212; separate PID namespace, other processes invisible</p></li><li><p><code>--ro-bind / /</code> &#8212; root filesystem mounted read-only</p></li><li><p><code>--die-with-parent</code> &#8212; if the parent process dies, the sandbox dies with it</p></li><li><p><code>--tmpfs /etc/ssh/ssh_config.d</code> &#8212; SSH configuration overlaid with an empty tmpfs</p></li></ul><p>Additionally, a <strong>seccomp filter</strong> is loaded. Seccomp (Secure Computing Mode) is a Linux kernel mechanism that determines which system calls a process is allowed to make. System calls are the interface between a program and the operating system &#8212; opening files, establishing network connections, starting processes.</p><p>A seccomp filter can selectively block individual system calls, drastically limiting a process&#8217;s radius of action.</p><pre><code><code>$ grep Seccomp /proc/self/status
Seccomp:         2
Seccomp_filters: 2
</code></code></pre><p><code>Seccomp: 2</code> means filter mode &#8212; there&#8217;s an active allowlist for permitted syscalls. The filter file is called <code>unix-block.bpf</code> and is loaded via a dedicated binary (<code>apply-seccomp</code>).</p><h3>Layer 3: Network Isolation</h3><p>No process in the sandbox has direct internet access. All traffic goes through a local proxy:</p><pre><code><code>$ env | grep HTTP_PROXY
HTTP_PROXY=http://localhost:3128

$ env | grep ALL_PROXY
ALL_PROXY=socks5h://localhost:1080
</code></code></pre><p>The proxy runs via <code>socat</code>, which tunnels TCP connections into Unix sockets that lead out of the VM. On the host side, an <strong>allowlist</strong> decides which domains may pass through.</p><p>I tested it:</p><pre><code><code>$ curl -s -o /dev/null -w "%{http_code}" https://registry.npmjs.org
200

$ curl -s -o /dev/null -w "%{http_code}" https://pypi.org
200

$ curl -sv https://evil-exfiltration-test.example.org 2&gt;&amp;1 | grep "HTTP/1.1"
&lt; HTTP/1.1 403 Forbidden

$ curl -sv https://evil-exfiltration-test.example.org 2&gt;&amp;1 | grep "X-Proxy"
&lt; X-Proxy-Error: blocked-by-allowlist
</code></code></pre><p>npm and PyPI get through. Everything else receives a <code>403 Forbidden</code> with the header <code>X-Proxy-Error: blocked-by-allowlist</code>. Direct DNS lookups also fail:</p><pre><code><code>$ nslookup google.com
socket(): Operation not permitted
;; no servers could be reached
</code></code></pre><p>This is consistent: even if a prompt injection attack were to trick Claude into sending data to an external server &#8212; the proxy would block it.</p><div><hr></div><h2>Which Files Does the VM See?</h2><p>Files enter the VM via <strong>VirtioFS</strong> &#8212; a filesystem protocol designed specifically for communication between a VM and its host. Instead of simulating real hardware, host and guest cooperate deliberately (paravirtualization). This makes file access fast and low-overhead.</p><pre><code><code>$ mount | grep virtiofs
/mnt/.virtiofs-root/shared/Work/.../Marketing on
  /sessions/elegant-adoring-brown/mnt/Marketing type fuse (rw,...)
</code></code></pre><p>Only the folder I selected in the Desktop app is mounted. Not my home directory, not my Desktop, not my Downloads &#8212; just the one folder I explicitly shared.</p><p>Plugins and Skills are additionally mounted via <strong>bindfs</strong>. Bindfs is a FUSE filesystem that remounts an existing folder at a different location &#8212; similar to a symlink, but with the ability to change permissions. This way, Skills can be mounted read-only even though they&#8217;re writable on the host. Uploads also land in a separate, read-only mount.</p><p>One detail reveals that the VM serves multiple conversations simultaneously: the <code>/sessions/</code> directory contains different sessions side by side:</p><pre><code><code>$ ls -la /sessions/
drwxr-x--- elegant-adoring-brown  elegant-adoring-brown  ...
drwxr-x--- nobody                 nogroup                awesome-epic-mccarthy
drwxr-x--- nobody                 nogroup                dazzling-vibrant-carson
</code></code></pre><p>Each session gets its own Linux user with its own UID. My user is called <code>elegant-adoring-brown</code> (uid 1005). The other sessions are listed under <code>nobody</code> &#8212; I can&#8217;t read their files.</p><div><hr></div><h2>How Does Claude Code Protect Without a VM?</h2><p>Claude Code in the terminal uses a different approach on macOS: Apple&#8217;s <strong>Seatbelt</strong> (also known as <code>sandbox-exec</code>). Instead of a VM, a dynamically generated sandbox profile restricts the process at the OS level. Important: the sandbox must be manually activated with <code>/sandbox</code> &#8212; without this step, Claude Code runs without OS-level isolation.</p><p>The profile starts with <code>(deny default)</code> &#8212; everything is forbidden unless explicitly allowed. The sandbox runtime is open source and available on GitHub. I downloaded the npm package <code>@anthropic-ai/sandbox-runtime</code> and analyzed the <code>macos-sandbox-utils.js</code>:</p><ul><li><p><strong>59 sysctl entries</strong> are made readable (hardware info like CPU count, memory size)</p></li><li><p><strong>14 Mach IPC services</strong> on the whitelist (Fonts, Logging, Security Server)</p></li><li><p><strong>Mandatory denies</strong> for <code>.env</code>, <code>.ssh</code>, <code>.aws</code>, <code>.git/hooks</code>, <code>.git/config</code> &#8212; even when the working directory has write access</p></li><li><p><strong>Move blocking</strong>: <code>file-write-rename</code> and <code>file-write-unlink</code> are blocked for protected paths, preventing circumvention of the denies via <code>mv</code></p></li></ul><p>The network isolation works the same way as with Cowork: all traffic goes through the same proxy with an allowlist. The difference: with Seatbelt, this happens at the process level (same kernel); with Cowork, at the VM level (separate kernel).</p><h3>Why Two Models?</h3><p>Claude Code is aimed at developers who need fast feedback in the terminal. The Seatbelt overhead is in the low single-digit millisecond range &#8212; I measured it on the host, no perceptible difference from a command without sandbox. Developers can selectively activate the sandbox when they want to give an agent more autonomy without having to approve every command.</p><p>Cowork gives Claude significantly more autonomy: it runs longer, creates files independently, installs packages. And it&#8217;s aimed at users who can&#8217;t assess (and don&#8217;t need to assess) which commands are being executed at the operating system level. The potential damage from an agent with local file access, code generation, and network egress is greater &#8212; and users are less able to evaluate it. Full VM isolation is appropriate here.</p><div><hr></div><h2>What I Take Away From This</h2><p>The isolation is real. Not just on paper, but verifiable.</p><p>Three things convinced me in particular:</p><p>First, the <strong>proxy allowlist with the explicit </strong><code>X-Proxy-Error: blocked-by-allowlist</code><strong> header</strong>. This isn&#8217;t a silent error message but a deliberate architectural decision. You can immediately see why a connection fails.</p><p>Second, the <strong>layering</strong>. The VM alone would be good. With bubblewrap and seccomp, it gets better. All three together make it significantly harder to break out of the sandbox. An exploit would have to simultaneously bypass the seccomp filter, escape the bwrap namespace, and then break out of the VM &#8212; on a system with no direct network access.</p><p>Third, the <strong>transparency</strong>. The sandbox runtime is open source. I downloaded the <code>macos-sandbox-utils.js</code> code &#8212; the 59 sysctl entries, the 14 Mach services, and the mandatory denies for <code>.env</code>, <code>.ssh</code>, and <code>.aws</code> are all there in black and white. The Seatbelt profile is dynamically generated, but the generating code is inspectable. The VM architecture can be examined from the inside. You don&#8217;t have to take anyone&#8217;s word for it &#8212; you can look for yourself.</p><p>If you want to look for yourself: the <a href="https://github.com/anthropic-experimental/sandbox-runtime">sandbox runtime is on GitHub</a>. An <code>npm pack</code> and a look at <code>macos-sandbox-utils.js</code> is all it takes to understand the Seatbelt profile.</p><div><hr></div><h2>What You Can Do Now</h2><p>If you&#8217;re using Claude Code and haven&#8217;t tried the sandbox yet: start a session and type <code>/sandbox</code>. That alone significantly reduces the effort of approving commands one by one. For everyday use, that&#8217;s often enough.</p><p>If you want to go deeper:</p><ul><li><p><strong>Inspect the sandbox runtime</strong>: <code>npm pack @anthropic-ai/sandbox-runtime</code>, unpack, read <code>macos-sandbox-utils.js</code>. There you&#8217;ll see exactly what&#8217;s allowed and what&#8217;s blocked.</p></li><li><p><strong>Examine Cowork from the inside</strong>: Launch Cowork and ask it to run <code>cat /proc/1/cmdline | tr '\0' '\n'</code>. The bubblewrap flags reveal the isolation in detail.</p></li><li><p><strong>Test the network</strong>: A <code>curl https://evil-exfiltration-test.example.org</code> inside the sandbox immediately shows you whether the allowlist is working.</p></li></ul><h2>What&#8217;s Next?</h2><p>The current state is clear. But one question remains: will it stay this way? Claude Code and Cowork already share the agentic architecture &#8212; and there are concrete signals that the security models are converging as well:</p><ul><li><p><strong>Docker</strong> is delivering MicroVM sandboxes with <code>docker-model-runner</code>, specifically designed for AI agents.</p></li><li><p><strong>Apple</strong> is bringing its own Containerization framework with macOS 26 &#8212; native container support on the Mac for the first time.</p></li><li><p><strong>Anthropic</strong> documents DevContainers as the official path toward stronger isolation in Claude Code.</p></li></ul><p>Three players, three approaches, one goal: agents should be able to do more without being able to cause more damage. In the next article, I&#8217;ll examine the pros and cons of each path &#8212; and why I consider one of them the most likely.</p><p>If you want to be notified when the next article is published:</p><p class="button-wrapper" data-attrs="{&quot;url&quot;:&quot;https://blog.fluxum.net/subscribe?&quot;,&quot;text&quot;:&quot;Jetzt abonnieren&quot;,&quot;action&quot;:null,&quot;class&quot;:null}" data-component-name="ButtonCreateButton"><a class="button primary" href="https://blog.fluxum.net/subscribe?"><span>Jetzt abonnieren</span></a></p><p></p><p>Subscribe to my Substack &#8212; free, no spam, just substance.</p><div><hr></div><h2>Sources</h2><ul><li><p><a href="https://code.claude.com/docs/en/sandboxing">Sandboxing &#8212; Claude Code Docs</a></p></li><li><p><a href="https://github.com/anthropic-experimental/sandbox-runtime">sandbox-runtime (GitHub)</a></p></li><li><p><a href="https://pvieito.com/2026/01/inside-claude-cowork">Inside Claude Cowork (Pedro Jos&#233; Pereira Vieito)</a> &#8212; Reverse engineering analysis of the VM architecture</p></li><li><p><a href="https://developer.apple.com/documentation/virtualization">Apple Virtualization Framework</a></p></li></ul>]]></content:encoded></item><item><title><![CDATA[Wie sicher ist die Claude Code Sandbox auf dem Mac?]]></title><description><![CDATA[Ein Blick unter die Haube von Claude Code und Cowork]]></description><link>https://blog.fluxum.net/p/wie-sicher-ist-die-claude-code-sandbox</link><guid isPermaLink="false">https://blog.fluxum.net/p/wie-sicher-ist-die-claude-code-sandbox</guid><dc:creator><![CDATA[Martin Gross]]></dc:creator><pubDate>Sun, 01 Mar 2026 14:28:29 GMT</pubDate><enclosure url="https://substackcdn.com/image/fetch/$s_!jZwS!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fe9a668d0-c3b9-446b-b6b9-56b009b1664c_1024x1024.png" length="0" type="image/jpeg"/><content:encoded><![CDATA[<div><hr></div><p><em>KI-Agenten f&#252;hren Befehle auf deinem Rechner aus &#8212; aber wie gut sch&#252;tzen dich die Sandboxes von Claude Code und Cowork? Beide versprechen Isolation, setzen aber auf unterschiedliche Mechanismen. Ich habe nicht nur die Dokumentation gelesen, sondern beide Systeme mit Linux-Tools von innen untersucht. Das Ergebnis: Die Isolation ist real, nachpr&#252;fbar und &#252;berraschend durchdacht.</em></p><div><hr></div><div class="captioned-image-container"><figure><a class="image-link image2 is-viewable-img" target="_blank" href="https://substackcdn.com/image/fetch/$s_!jZwS!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fe9a668d0-c3b9-446b-b6b9-56b009b1664c_1024x1024.png" data-component-name="Image2ToDOM"><div class="image2-inset"><picture><source type="image/webp" srcset="https://substackcdn.com/image/fetch/$s_!jZwS!,w_424,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fe9a668d0-c3b9-446b-b6b9-56b009b1664c_1024x1024.png 424w, https://substackcdn.com/image/fetch/$s_!jZwS!,w_848,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fe9a668d0-c3b9-446b-b6b9-56b009b1664c_1024x1024.png 848w, https://substackcdn.com/image/fetch/$s_!jZwS!,w_1272,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fe9a668d0-c3b9-446b-b6b9-56b009b1664c_1024x1024.png 1272w, https://substackcdn.com/image/fetch/$s_!jZwS!,w_1456,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fe9a668d0-c3b9-446b-b6b9-56b009b1664c_1024x1024.png 1456w" sizes="100vw"><img src="https://substackcdn.com/image/fetch/$s_!jZwS!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fe9a668d0-c3b9-446b-b6b9-56b009b1664c_1024x1024.png" width="1024" height="1024" data-attrs="{&quot;src&quot;:&quot;https://substack-post-media.s3.amazonaws.com/public/images/e9a668d0-c3b9-446b-b6b9-56b009b1664c_1024x1024.png&quot;,&quot;srcNoWatermark&quot;:null,&quot;fullscreen&quot;:null,&quot;imageSize&quot;:null,&quot;height&quot;:1024,&quot;width&quot;:1024,&quot;resizeWidth&quot;:null,&quot;bytes&quot;:1813962,&quot;alt&quot;:null,&quot;title&quot;:null,&quot;type&quot;:&quot;image/png&quot;,&quot;href&quot;:null,&quot;belowTheFold&quot;:false,&quot;topImage&quot;:true,&quot;internalRedirect&quot;:&quot;https://blog.fluxum.net/i/189546259?img=https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fe9a668d0-c3b9-446b-b6b9-56b009b1664c_1024x1024.png&quot;,&quot;isProcessing&quot;:false,&quot;align&quot;:null,&quot;offset&quot;:false}" class="sizing-normal" alt="" srcset="https://substackcdn.com/image/fetch/$s_!jZwS!,w_424,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fe9a668d0-c3b9-446b-b6b9-56b009b1664c_1024x1024.png 424w, https://substackcdn.com/image/fetch/$s_!jZwS!,w_848,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fe9a668d0-c3b9-446b-b6b9-56b009b1664c_1024x1024.png 848w, https://substackcdn.com/image/fetch/$s_!jZwS!,w_1272,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fe9a668d0-c3b9-446b-b6b9-56b009b1664c_1024x1024.png 1272w, https://substackcdn.com/image/fetch/$s_!jZwS!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fe9a668d0-c3b9-446b-b6b9-56b009b1664c_1024x1024.png 1456w" sizes="100vw" fetchpriority="high"></picture><div class="image-link-expand"><div class="pencraft pc-display-flex pc-gap-8 pc-reset"><button tabindex="0" type="button" class="pencraft pc-reset pencraft icon-container restack-image"><svg role="img" width="20" height="20" viewBox="0 0 20 20" fill="none" stroke-width="1.5" stroke="var(--color-fg-primary)" stroke-linecap="round" stroke-linejoin="round" xmlns="http://www.w3.org/2000/svg"><g><title></title><path d="M2.53001 7.81595C3.49179 4.73911 6.43281 2.5 9.91173 2.5C13.1684 2.5 15.9537 4.46214 17.0852 7.23684L17.6179 8.67647M17.6179 8.67647L18.5002 4.26471M17.6179 8.67647L13.6473 6.91176M17.4995 12.1841C16.5378 15.2609 13.5967 17.5 10.1178 17.5C6.86118 17.5 4.07589 15.5379 2.94432 12.7632L2.41165 11.3235M2.41165 11.3235L1.5293 15.7353M2.41165 11.3235L6.38224 13.0882"></path></g></svg></button><button tabindex="0" type="button" class="pencraft pc-reset pencraft icon-container view-image"><svg xmlns="http://www.w3.org/2000/svg" width="20" height="20" viewBox="0 0 24 24" fill="none" stroke="currentColor" stroke-width="2" stroke-linecap="round" stroke-linejoin="round" class="lucide lucide-maximize2 lucide-maximize-2"><polyline points="15 3 21 3 21 9"></polyline><polyline points="9 21 3 21 3 15"></polyline><line x1="21" x2="14" y1="3" y2="10"></line><line x1="3" x2="10" y1="21" y2="14"></line></svg></button></div></div></div></a></figure></div><p></p><blockquote><p>&#8222;Falls sich Claude entscheidet, alle meine Dateien zu l&#246;schen: Halb so wild. Aber bitte nur innerhalb einer isolierten VM !&#8220;</p></blockquote><p>Wer Claude Code im Terminal mit den Standardeinstellungen nutzt, kennt das: Viele Befehle ben&#246;tigen eine Freigabe, bevor Claude Code sie ausf&#252;hrt. </p><p>Immer wieder muss man abw&#228;gen, ob der jeweilige Befehl in Ordnung geht oder nicht:</p><blockquote><p>&#8222;Allow this? Allow once? Allow always?&#8220;</p></blockquote><p>St&#228;ndig pr&#252;ft man: Ist das ungef&#228;hrlich oder k&#246;nnte dieser Befehl zu Problemen f&#252;hren? Cognitive Load durch Kommandozeilen lesen.</p><p>Im Grunde gibt es zwei extreme Ans&#228;tze: Entweder man pr&#252;ft jede einzelne Freigabeanfrage selbst oder setzt auf die Option <code>--dangerously-skip-permissions</code>, wodurch alles erlaubt ist. Dazwischen gibt es viele Abstufungen. Man kann seine Permissions feingranular definieren, aber das ist fast genauso aufwendig.</p><p>Wie sch&#246;n w&#228;re es, wenn man einfach alles erlauben k&#246;nnte und dennoch sicher sein k&#246;nnte, dass nichts Unerw&#252;nschtes auf dem eigenen Rechner passiert. Dann k&#246;nnte Agentic Coding ungebremst stattfinden und man k&#228;me schnell zu Ergebnissen.</p><p>Genau das verspricht ein isoliertes System, das abgeschirmt vom eigenen Computer l&#228;uft. So ein isoliertes System verringert den Blast Radius &#8212; also den Schaden, den ein fehlgeleiteter Befehl maximal anrichten kann &#8212; immens. Wenn etwas schief geht, startet man einfach neu und geht zum letzten stabilen Ausgangszustand zur&#252;ck. Es gibt viele M&#246;glichkeiten, das umzusetzen.</p><p>Eine davon ist der in Claude Code eingebaute <code>/sandbox</code>-Befehl. Er aktiviert eine Sandbox, die Claude Code auf OS-Ebene einschr&#228;nkt &#8212; Dateizugriffe und Netzwerk. Man kann Commands automatisch laufen lassen, ohne jedes Mal zu best&#228;tigen, weil die Sandbox begrenzt, was passieren kann. Aber wie sicher ist das wirklich?</p><p>Und dann gibt es noch <strong>Cowork</strong> in der Desktop-Variante der Claude-App. Cowork richtet sich eher an Wissensarbeiter, nicht direkt an Entwickler. Es darf auf Ordner zugreifen, Dateien erstellen und ver&#228;ndern, Pakete installieren &#8212; und das alles autonom. Auf den ersten Blick ist dabei nicht ersichtlich, wie die Absicherung funktioniert. Es gibt keinen <code>/sandbox</code>-Befehl, den man aktivieren m&#252;sste. Die Isolation passiert im Hintergrund.</p><p>Mich hat beides interessiert: Wie funktioniert die Sandbox in Claude Code? Und wie sch&#252;tzt mich Cowork davor, dass ungewollte &#196;nderungen auf meinem Rechner passieren?</p><p>Dabei wollte ich mich nicht nur auf die Dokumentation verlassen, sondern ich habe beide Systeme von innen untersucht. Hier ist, was ich gefunden habe.</p><h2>Zwei Produkte, zwei Zielgruppen, zwei Sicherheitsmodelle</h2><p>Bevor ich in die Technik gehe, ein wichtiger Unterschied:</p><p><strong>Claude Code</strong> ist ein Terminal-Tool f&#252;r Entwickler. Es f&#252;hrt Befehle auf deinem Rechner aus &#8212; im selben Kontext, in dem du arbeitest. Die Sandbox muss manuell aktiviert werden (<code>/sandbox</code>), ist opt-in. Das ergibt Sinn: Entwickler brauchen m&#246;glichst wenig Einschr&#228;nkungen, um produktiv zu sein. Sie wollen Befehle ausf&#252;hren k&#246;nnen, die eine restriktive Sandbox behindern w&#252;rde. Aber mit vielen Rechten kommt viel Verantwortung. Man muss verstehen, was man abnickt.</p><p><strong>Cowork</strong> ist Teil der Claude Desktop-App und richtet sich an Nutzer, die sich nicht mit der Kommandozeile auseinander setzen wollen. Wenn jemand Claude bittet, eine Excel-Tabelle aus f&#252;nf PDFs zu erstellen, erwartet er ein Ergebnis &#8212; nicht eine Diskussion &#252;ber Dateiberechtigungen. Cowork muss daher st&#228;rker absichern, und zwar ohne dass der Nutzer das konfigurieren muss.</p><p>Das Ergebnis: Zwei unterschiedliche Isolationsmodelle f&#252;r zwei unterschiedliche Risikoprofile.</p><p>Lass uns in die Details gehen.</p><div><hr></div><h2>Cowork: Ein Linux in deinem Mac</h2><p>Cowork startet eine leichtgewichtige Linux-VM &#252;ber Apples Virtualization.framework. Kein Container, sondern eine echte virtuelle Maschine mit eigenem Kernel.</p><p>Was sagt die VM &#252;ber sich?</p><pre><code><code>$ cat /etc/os-release
PRETTY_NAME="Ubuntu 22.04.5 LTS"

$ uname -r
6.8.0-94-generic

$ uname -m
aarch64

$ nproc
4

$ free -h
              total    used    free
Mem:          3.8Gi   564Mi   1.8Gi
Swap:            0B      0B      0B

$ df -h /
Filesystem      Size  Used Avail Use%
/dev/nvme0n1p1  9.6G  7.2G  2.4G  75%
</code></code></pre><p>Ubuntu 22.04 auf ARM64, 4 Kerne, 3,8 GB RAM, eine 10-GB-Disk. Kein Swap. Schlank genug f&#252;r Dokumentenverarbeitung und Skripte, aber nicht f&#252;r Machine-Learning-Training gedacht.</p><p>Auf dem macOS-Host finden sich die VM-Dateien unter <code>~/Library/Application Support/Claude/vm_bundles/claudevm.bundle/</code>. Das Root-Image (<code>rootfs.img</code>) ist 10 GB gro&#223; als Sparse-Datei, belegt aber nur etwa 7,5 GB on-disk.</p><p>Daneben liegt ein komprimiertes Backup (<code>rootfs.img.zst</code>, ~2 GB) und ein paar Konfigurationsdateien: <code>efivars.fd</code>, <code>macAddress</code>, <code>machineIdentifier</code>.</p><div><hr></div><h2>Wie drei Schichten zusammen die Isolation absichern</h2><p>Die VM allein w&#228;re schon eine solide Grenze. Aber Anthropic stapelt drei Schichten &#252;bereinander.</p><h3>Schicht 1: Die VM</h3><p>Apples Virtualization.framework stellt Hardware-Isolation bereit. Der Gast hat seinen eigenen Kernel. Selbst ein <code>rm -rf /</code> in der VM l&#228;sst den Host unber&#252;hrt.</p><h3>Schicht 2: bubblewrap + seccomp</h3><p>Innerhalb der VM l&#228;uft nicht direkt Claude, sondern erst <strong>bubblewrap</strong> (kurz: <code>bwrap</code>). Bubblewrap ist ein Sandboxing-Tool, das Linux-Namespaces nutzt, um Prozesse voneinander zu isolieren &#8212; &#228;hnlich wie Container es tun, aber leichtgewichtiger.</p><p>Es schr&#228;nkt ein, was ein Prozess sehen und tun darf: welche Dateien, welche Netzwerkschnittstellen, welche anderen Prozesse.</p><p>In der Cowork-VM ist bubblewrap PID 1, also der allererste Prozess:</p><pre><code><code>$ cat /proc/1/status | head -2
Name:   bwrap
State:  S (sleeping)
</code></code></pre><p>Die bwrap-Kommandozeile (&#252;ber <code>/proc/1/cmdline</code> auslesbar) zeigt die wichtigsten Einschr&#228;nkungen im &#220;berblick:</p><ul><li><p><code>--unshare-net</code> &#8212; eigener Netzwerk-Namespace, kein direkter Netzzugang</p></li><li><p><code>--unshare-pid</code> &#8212; eigener PID-Namespace, andere Prozesse unsichtbar</p></li><li><p><code>--ro-bind / /</code> &#8212; Root-Dateisystem read-only eingebunden</p></li><li><p><code>--die-with-parent</code> &#8212; stirbt der Elternprozess, stirbt die Sandbox mit</p></li><li><p><code>--tmpfs /etc/ssh/ssh_config.d</code> &#8212; SSH-Konfiguration wird mit einem leeren tmpfs &#252;berdeckt</p></li></ul><p>Zus&#228;tzlich wird ein <strong>seccomp-Filter</strong> geladen. Seccomp (Secure Computing Mode) ist ein Mechanismus im Linux-Kernel, der festlegt, welche Systemaufrufe ein Prozess machen darf. Systemaufrufe sind die Schnittstelle zwischen einem Programm und dem Betriebssystem &#8212; Dateien &#246;ffnen, Netzwerkverbindungen herstellen, Prozesse starten.</p><p>Ein seccomp-Filter kann gezielt einzelne Systemaufrufe blockieren und damit den Aktionsradius eines Prozesses stark einschr&#228;nken.</p><pre><code><code>$ grep Seccomp /proc/self/status
Seccomp:         2
Seccomp_filters: 2
</code></code></pre><p><code>Seccomp: 2</code> bedeutet Filter-Modus &#8212; es gibt eine aktive Allowlist f&#252;r erlaubte Syscalls. Die Filterdatei hei&#223;t <code>unix-block.bpf</code> und wird &#252;ber eine eigene Binary (<code>apply-seccomp</code>) geladen.</p><h3>Schicht 3: Netzwerk-Isolation</h3><p>Kein Prozess in der Sandbox hat direkten Internetzugang. Aller Traffic geht durch einen lokalen Proxy:</p><pre><code><code>$ env | grep HTTP_PROXY
HTTP_PROXY=http://localhost:3128

$ env | grep ALL_PROXY
ALL_PROXY=socks5h://localhost:1080
</code></code></pre><p>Der Proxy l&#228;uft &#252;ber <code>socat</code>, das TCP-Verbindungen in Unix-Sockets tunnelt, die aus der VM herausf&#252;hren. Auf der Host-Seite entscheidet eine <strong>Allowlist</strong>, welche Domains passieren d&#252;rfen.</p><p>Ich habe es getestet:</p><pre><code><code>$ curl -s -o /dev/null -w "%{http_code}" https://registry.npmjs.org
200

$ curl -s -o /dev/null -w "%{http_code}" https://pypi.org
200

$ curl -sv https://evil-exfiltration-test.example.org 2&gt;&amp;1 | grep "HTTP/1.1"
&lt; HTTP/1.1 403 Forbidden

$ curl -sv https://evil-exfiltration-test.example.org 2&gt;&amp;1 | grep "X-Proxy"
&lt; X-Proxy-Error: blocked-by-allowlist
</code></code></pre><p>npm und PyPI kommen durch. Alles andere bekommt ein <code>403 Forbidden</code> mit dem Header <code>X-Proxy-Error: blocked-by-allowlist</code>. Auch direkte DNS-Lookups scheitern:</p><pre><code><code>$ nslookup google.com
socket(): Operation not permitted
;; no servers could be reached
</code></code></pre><p>Das ist konsequent: Selbst wenn ein Prompt-Injection-Angriff Claude dazu bringen w&#252;rde, Daten an einen externen Server zu senden &#8212; der Proxy w&#252;rde es blockieren.</p><div><hr></div><h2>Welche Dateien sieht die VM?</h2><p>Dateien kommen &#252;ber <strong>VirtioFS</strong> in die VM &#8212; ein Dateisystem-Protokoll, das speziell f&#252;r die Kommunikation zwischen VM und Host entwickelt wurde. Statt echte Hardware zu simulieren, arbeiten Host und Guest bewusst zusammen (Paravirtualisierung). Das macht den Dateizugriff schnell und mit wenig Overhead m&#246;glich.</p><pre><code><code>$ mount | grep virtiofs
/mnt/.virtiofs-root/shared/Work/.../Marketing on
  /sessions/elegant-adoring-brown/mnt/Marketing type fuse (rw,...)
</code></code></pre><p>Nur der Ordner, den ich in der Desktop-App ausgew&#228;hlt habe, wird gemountet. Nicht mein Home-Verzeichnis, nicht mein Desktop, nicht meine Downloads &#8212; nur der eine Ordner, den ich explizit freigegeben habe.</p><p>Plugins und Skills werden &#252;ber <strong>bindfs</strong> zus&#228;tzlich eingebunden. Bindfs ist ein FUSE-Dateisystem, das einen vorhandenen Ordner an einer anderen Stelle nochmal einbindet &#8212; &#228;hnlich wie ein Symlink, aber mit der M&#246;glichkeit, die Berechtigungen zu &#228;ndern. So k&#246;nnen Skills zum Beispiel read-only eingebunden werden, obwohl sie auf dem Host beschreibbar sind. Uploads landen ebenfalls in einem separaten, schreibgesch&#252;tzten Mount.</p><p>Ein Detail verr&#228;t, dass die VM mehrere Conversations gleichzeitig bedient: Im <code>/sessions/</code>-Verzeichnis sitzen verschiedene Sessions nebeneinander:</p><pre><code><code>$ ls -la /sessions/
drwxr-x--- elegant-adoring-brown  elegant-adoring-brown  ...
drwxr-x--- nobody                 nogroup                awesome-epic-mccarthy
drwxr-x--- nobody                 nogroup                dazzling-vibrant-carson
</code></code></pre><p>Jede Session bekommt einen eigenen Linux-User mit eigener UID. Mein User hei&#223;t <code>elegant-adoring-brown</code> (uid 1005). Die anderen Sessions sind unter <code>nobody</code> gelistet &#8212; ich kann ihre Dateien nicht lesen.</p><div><hr></div><h2>Wie sch&#252;tzt Claude Code ohne VM?</h2><p>Claude Code im Terminal nutzt auf macOS einen anderen Ansatz: Apples <strong>Seatbelt</strong> (auch bekannt als <code>sandbox-exec</code>). Statt einer VM wird ein dynamisch generiertes Sandbox-Profil erstellt, das den Prozess auf OS-Ebene einschr&#228;nkt. Wichtig: Die Sandbox muss manuell mit <code>/sandbox</code> aktiviert werden &#8212; ohne diesen Schritt l&#228;uft Claude Code ohne OS-Level-Isolation.</p><p>Das Profil startet mit <code>(deny default)</code> &#8212; alles ist verboten, au&#223;er es wird explizit erlaubt. Die Sandbox-Runtime ist Open Source und auf GitHub einsehbar. Ich habe das npm-Paket <code>@anthropic-ai/sandbox-runtime</code> heruntergeladen und die <code>macos-sandbox-utils.js</code> analysiert:</p><ul><li><p><strong>59 sysctl-Eintr&#228;ge</strong> werden zum Lesen freigegeben (Hardware-Info wie CPU-Anzahl, Speichergr&#246;&#223;e)</p></li><li><p><strong>14 Mach-IPC-Services</strong> auf der Whitelist (Fonts, Logging, Security Server)</p></li><li><p><strong>Mandatory Denies</strong> f&#252;r <code>.env</code>, <code>.ssh</code>, <code>.aws</code>, <code>.git/hooks</code>, <code>.git/config</code> &#8212; auch wenn das Arbeitsverzeichnis Schreibzugriff hat</p></li><li><p><strong>Move-Blocking</strong>: <code>file-write-rename</code> und <code>file-write-unlink</code> werden f&#252;r gesch&#252;tzte Pfade blockiert, damit man die Denies nicht per <code>mv</code> umgehen kann</p></li></ul><p>Die Netzwerk-Isolation funktioniert genauso wie bei Cowork: Aller Traffic geht durch denselben Proxy mit Allowlist. Der Unterschied: Bei Seatbelt passiert das auf Prozess-Ebene (gleicher Kernel), bei Cowork auf VM-Ebene (eigener Kernel).</p><h3>Warum zwei Modelle?</h3><p>Claude Code richtet sich an Entwickler, die im Terminal schnelles Feedback brauchen. Der Seatbelt-Overhead liegt im niedrigen einstelligen Millisekundenbereich &#8212; ich habe es auf dem Host gemessen, kein sp&#252;rbarer Unterschied zu einem Befehl ohne Sandbox. Entwickler k&#246;nnen die Sandbox gezielt aktivieren, wenn sie einem Agenten mehr Autonomie geben wollen, ohne jeden Befehl freigeben zu m&#252;ssen.</p><p>Cowork gibt Claude deutlich mehr Autonomie: Es l&#228;uft l&#228;nger, erstellt eigenst&#228;ndig Dateien, installiert Pakete. Und es richtet sich an Nutzer, die nicht einsch&#228;tzen k&#246;nnen (und nicht einsch&#228;tzen m&#252;ssen), welche Befehle auf Betriebssystemebene ausgef&#252;hrt werden. Der m&#246;gliche Schaden eines Agenten mit lokalem Dateizugriff, Codegenerierung und Netzwerk-Egress ist gr&#246;&#223;er &#8212; und die Nutzer k&#246;nnen ihn schlechter einsch&#228;tzen. Die volle VM-Isolation ist hier angemessen.</p><div><hr></div><h2>Was ich daraus mitnehme</h2><p>Die Isolation ist real. Nicht nur auf dem Papier, sondern nachpr&#252;fbar.</p><p>Drei Dinge haben mich besonders &#252;berzeugt:</p><p>Erstens die <strong>Proxy-Allowlist mit dem expliziten </strong><code>X-Proxy-Error: blocked-by-allowlist</code><strong> Header</strong>. Das ist keine stille Fehlermeldung, sondern eine bewusste Architekturentscheidung. Man sieht sofort, warum eine Verbindung scheitert.</p><p>Zweitens die <strong>Schichtung</strong>. VM allein w&#228;re gut. Mit bubblewrap und seccomp wird&#8217;s besser. Alle drei zusammen machen es deutlich schwieriger, aus der Sandbox auszubrechen. Ein Exploit m&#252;sste gleichzeitig den seccomp-Filter umgehen, aus dem bwrap-Namespace ausbrechen und dann noch aus der VM raus &#8212; auf einem System, das keinen direkten Netzzugang hat.</p><p>Drittens die <strong>Transparenz</strong>. Die Sandbox-Runtime ist Open Source. Ich habe den Code der <code>macos-sandbox-utils.js</code> heruntergeladen &#8212; dort stehen die 59 sysctl-Eintr&#228;ge, die 14 Mach-Services und die Mandatory Denies f&#252;r <code>.env</code>, <code>.ssh</code> und <code>.aws</code> schwarz auf wei&#223;. Das Seatbelt-Profil wird dynamisch generiert, aber der generierende Code ist einsehbar. Die VM-Architektur l&#228;sst sich von innen inspizieren. Man muss niemandem glauben &#8212; man kann nachschauen.</p><p>Wer selbst nachschauen will: Die <a href="https://github.com/anthropic-experimental/sandbox-runtime">Sandbox-Runtime liegt auf GitHub</a>. Ein <code>npm pack</code> und ein Blick in <code>macos-sandbox-utils.js</code> reichen, um das Seatbelt-Profil zu verstehen.</p><div><hr></div><h2>Was du jetzt tun kannst</h2><p>Wenn du Claude Code nutzt und die Sandbox noch nicht ausprobiert hast: Starte eine Session und tippe <code>/sandbox</code>. Allein das reduziert den Aufwand, Befehle einzeln freizugeben, erheblich. F&#252;r den Alltag reicht das oft schon.</p><p>Wenn du tiefer einsteigen willst:</p><ul><li><p><strong>Sandbox-Runtime inspizieren</strong>: <code>npm pack @anthropic-ai/sandbox-runtime</code>, entpacken, <code>macos-sandbox-utils.js</code> lesen. Dort siehst du exakt, was erlaubt und was blockiert wird.</p></li><li><p><strong>Cowork von innen ansehen</strong>: Starte Cowork und bitte es <code>cat /proc/1/cmdline | tr '\0' '\n'</code> auszuf&#252;hren. Die bubblewrap-Flags verraten dir die Isolation im Detail.</p></li><li><p><strong>Netzwerk testen</strong>: Ein <code>curl https://evil-exfiltration-test.example.org</code> in der Sandbox zeigt dir sofort, ob die Allowlist greift.</p></li></ul><h2>Wie geht es weiter?</h2><p>Damit ist der Ist-Zustand klar. Aber eine Frage bleibt: Wird das so bleiben? Claude Code und Cowork teilen sich bereits die agentic Architektur &#8212; und es gibt konkrete Signale, dass auch die Sicherheitsmodelle zusammenwachsen:</p><ul><li><p><strong>Docker</strong> liefert mit <code>docker-model-runner</code> MicroVM-Sandboxes, die speziell f&#252;r KI-Agenten gedacht sind.</p></li><li><p><strong>Apple</strong> bringt mit macOS 26 ein eigenes Containerization-Framework &#8212; erstmals native Container-Unterst&#252;tzung auf dem Mac.</p></li><li><p><strong>Anthropic</strong> dokumentiert DevContainer als offiziellen Weg f&#252;r st&#228;rkere Isolation in Claude Code.</p></li></ul><p>Drei Player, drei Ans&#228;tze, ein Ziel: Agenten sollen mehr d&#252;rfen, ohne mehr Schaden anrichten zu k&#246;nnen. Im n&#228;chsten Artikel werde ich mir anschauen, was f&#252;r und gegen jeden dieser Pfade spricht &#8212; und warum ich einen davon f&#252;r den wahrscheinlichsten halte.</p><p>Wenn du benachrichtigt werden willst, wenn der n&#228;chste Artikel ver&#246;ffentlich ist:</p><p class="button-wrapper" data-attrs="{&quot;url&quot;:&quot;https://blog.fluxum.net/subscribe?&quot;,&quot;text&quot;:&quot;Jetzt abonnieren&quot;,&quot;action&quot;:null,&quot;class&quot;:null}" data-component-name="ButtonCreateButton"><a class="button primary" href="https://blog.fluxum.net/subscribe?"><span>Jetzt abonnieren</span></a></p><p></p><h2>Quellen</h2><ul><li><p><a href="https://code.claude.com/docs/en/sandboxing">Sandboxing &#8212; Claude Code Docs</a></p></li><li><p><a href="https://github.com/anthropic-experimental/sandbox-runtime">sandbox-runtime (GitHub)</a></p></li><li><p><a href="https://pvieito.com/2026/01/inside-claude-cowork">Inside Claude Cowork (Pedro Jos&#233; Pereira Vieito)</a> &#8212; Reverse-Engineering-Analyse der VM-Architektur</p></li><li><p><a href="https://developer.apple.com/documentation/virtualization">Apple Virtualization Framework</a></p></li></ul>]]></content:encoded></item><item><title><![CDATA[Der neue Engpass]]></title><description><![CDATA[Warum schnellerer Code eure Probleme nicht l&#246;st]]></description><link>https://blog.fluxum.net/p/der-neue-engpass</link><guid isPermaLink="false">https://blog.fluxum.net/p/der-neue-engpass</guid><dc:creator><![CDATA[Martin Gross]]></dc:creator><pubDate>Wed, 28 Jan 2026 13:57:54 GMT</pubDate><enclosure url="https://substackcdn.com/image/fetch/$s_!0Y8G!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F30082918-ff1f-485f-9ad0-74d2d98860b3_1536x1024.png" length="0" type="image/jpeg"/><content:encoded><![CDATA[<p>Wir haben Code-Generierung so effizient gemacht, dass wir jetzt ein neues Problem haben: Menschen, die schneller Output abnehmen m&#252;ssen, als sie denken k&#246;nnen.</p><p>Die AI-Diskussion in der Softwareentwicklung dreht sich fast ausschlie&#223;lich um eine Frage: Wie generieren wir Code schneller? Das ist verst&#228;ndlich &#8211; aber es lenkt von dem ab, was gerade wirklich passiert.</p><div class="subscription-widget-wrap-editor" data-attrs="{&quot;url&quot;:&quot;https://blog.fluxum.net/subscribe?&quot;,&quot;text&quot;:&quot;Abonnieren&quot;,&quot;language&quot;:&quot;de&quot;}" data-component-name="SubscribeWidgetToDOM"><div class="subscription-widget show-subscribe"><div class="preamble"><p class="cta-caption">Danke f&#252;rs Lesen von fluxum engineering! Abonnieren Sie kostenlos, um neue Posts zu erhalten und meine Arbeit zu unterst&#252;tzen.</p></div><form class="subscription-widget-subscribe"><input type="email" class="email-input" name="email" placeholder="E-Mail-Adresse eingeben &#8230;" tabindex="-1"><input type="submit" class="button primary" value="Abonnieren"><div class="fake-input-wrapper"><div class="fake-input"></div><div class="fake-button"></div></div></form></div></div><div class="captioned-image-container"><figure><a class="image-link image2 is-viewable-img" target="_blank" href="https://substackcdn.com/image/fetch/$s_!0Y8G!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F30082918-ff1f-485f-9ad0-74d2d98860b3_1536x1024.png" data-component-name="Image2ToDOM"><div class="image2-inset"><picture><source type="image/webp" srcset="https://substackcdn.com/image/fetch/$s_!0Y8G!,w_424,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F30082918-ff1f-485f-9ad0-74d2d98860b3_1536x1024.png 424w, https://substackcdn.com/image/fetch/$s_!0Y8G!,w_848,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F30082918-ff1f-485f-9ad0-74d2d98860b3_1536x1024.png 848w, https://substackcdn.com/image/fetch/$s_!0Y8G!,w_1272,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F30082918-ff1f-485f-9ad0-74d2d98860b3_1536x1024.png 1272w, https://substackcdn.com/image/fetch/$s_!0Y8G!,w_1456,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F30082918-ff1f-485f-9ad0-74d2d98860b3_1536x1024.png 1456w" sizes="100vw"><img src="https://substackcdn.com/image/fetch/$s_!0Y8G!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F30082918-ff1f-485f-9ad0-74d2d98860b3_1536x1024.png" width="1456" height="971" data-attrs="{&quot;src&quot;:&quot;https://substack-post-media.s3.amazonaws.com/public/images/30082918-ff1f-485f-9ad0-74d2d98860b3_1536x1024.png&quot;,&quot;srcNoWatermark&quot;:null,&quot;fullscreen&quot;:null,&quot;imageSize&quot;:null,&quot;height&quot;:971,&quot;width&quot;:1456,&quot;resizeWidth&quot;:null,&quot;bytes&quot;:2188226,&quot;alt&quot;:null,&quot;title&quot;:null,&quot;type&quot;:&quot;image/png&quot;,&quot;href&quot;:null,&quot;belowTheFold&quot;:false,&quot;topImage&quot;:true,&quot;internalRedirect&quot;:&quot;https://blog.fluxum.net/i/186079359?img=https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F30082918-ff1f-485f-9ad0-74d2d98860b3_1536x1024.png&quot;,&quot;isProcessing&quot;:false,&quot;align&quot;:null,&quot;offset&quot;:false}" class="sizing-normal" alt="" srcset="https://substackcdn.com/image/fetch/$s_!0Y8G!,w_424,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F30082918-ff1f-485f-9ad0-74d2d98860b3_1536x1024.png 424w, https://substackcdn.com/image/fetch/$s_!0Y8G!,w_848,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F30082918-ff1f-485f-9ad0-74d2d98860b3_1536x1024.png 848w, https://substackcdn.com/image/fetch/$s_!0Y8G!,w_1272,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F30082918-ff1f-485f-9ad0-74d2d98860b3_1536x1024.png 1272w, https://substackcdn.com/image/fetch/$s_!0Y8G!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F30082918-ff1f-485f-9ad0-74d2d98860b3_1536x1024.png 1456w" sizes="100vw" fetchpriority="high"></picture><div class="image-link-expand"><div class="pencraft pc-display-flex pc-gap-8 pc-reset"><button tabindex="0" type="button" class="pencraft pc-reset pencraft icon-container restack-image"><svg role="img" width="20" height="20" viewBox="0 0 20 20" fill="none" stroke-width="1.5" stroke="var(--color-fg-primary)" stroke-linecap="round" stroke-linejoin="round" xmlns="http://www.w3.org/2000/svg"><g><title></title><path d="M2.53001 7.81595C3.49179 4.73911 6.43281 2.5 9.91173 2.5C13.1684 2.5 15.9537 4.46214 17.0852 7.23684L17.6179 8.67647M17.6179 8.67647L18.5002 4.26471M17.6179 8.67647L13.6473 6.91176M17.4995 12.1841C16.5378 15.2609 13.5967 17.5 10.1178 17.5C6.86118 17.5 4.07589 15.5379 2.94432 12.7632L2.41165 11.3235M2.41165 11.3235L1.5293 15.7353M2.41165 11.3235L6.38224 13.0882"></path></g></svg></button><button tabindex="0" type="button" class="pencraft pc-reset pencraft icon-container view-image"><svg xmlns="http://www.w3.org/2000/svg" width="20" height="20" viewBox="0 0 24 24" fill="none" stroke="currentColor" stroke-width="2" stroke-linecap="round" stroke-linejoin="round" class="lucide lucide-maximize2 lucide-maximize-2"><polyline points="15 3 21 3 21 9"></polyline><polyline points="9 21 3 21 3 15"></polyline><line x1="21" x2="14" y1="3" y2="10"></line><line x1="3" x2="10" y1="21" y2="14"></line></svg></button></div></div></div></a></figure></div><p></p><h3>Das Bottleneck hat sich verschoben</h3><p>Vor einem Jahr war &#8220;Code schreiben&#8221; noch ein limitierender Faktor. Heute kann ein einzelner Entwickler mit den richtigen Agents an einem Tag produzieren, wof&#252;r fr&#252;her eine Woche n&#246;tig war.</p><p>Klingt nach Fortschritt. Ist es auch &#8211; bis man fragt: Wer reviewt das alles? Wer versteht es? Wer verantwortet es?</p><p>Die Velocity-Metriken sehen fantastisch aus. Aber die Engp&#228;sse sind nicht verschwunden. Sie haben sich verschoben &#8211; zum Menschen.</p><h3>F&#252;nf Fragen, auf die niemand gute Antworten hat</h3><p><strong>1. Wie bewertest du Arbeit, die du nicht mehr selbst machst?</strong></p><p>Engineering Leads haben jahrelang Code-Reviews gemacht. Sie wussten, worauf sie achten mussten, weil sie selbst im Code steckten. Wenn Agents den Gro&#223;teil des Codes produzieren und Engineers zu &#8220;Orchestratoren&#8221; werden &#8211; nach welchen Kriterien bewerten wir dann? Wie unterscheidest du guten von schlechtem Output, wenn du selbst nicht mehr Zeile f&#252;r Zeile durchgehst?</p><p><strong>2. Wer &#252;bernimmt die Verantwortung?</strong></p><p>Agent generiert Code. Engineer gibt ihn frei. QA testet. Alles gr&#252;n. Drei Monate sp&#228;ter: Security-Problem, das niemand gesehen hat.</p><p>Wer ist verantwortlich? Der Engineer, der den Code freigegeben hat, ohne ihn wirklich zu verstehen? Das Team, das die Guardrails definiert hat? Die Organisation, die keine besseren Review-Prozesse etabliert hat?</p><p>In klassischen Strukturen war Verantwortung an Wissen gekoppelt: Wer den Code geschrieben hat, verstand ihn und verantwortete ihn. Diese Kopplung l&#246;st sich gerade auf.</p><p><strong>3. Wie bef&#228;higst du Menschen, Verantwortung zu &#252;bernehmen, die sie nicht tragen k&#246;nnen?</strong></p><p>&#8220;Human in the Loop&#8221; klingt beruhigend. Aber was bedeutet das konkret?</p><p>Ein Mensch, der zehnmal so viel Output &#252;berpr&#252;fen muss wie vorher, pr&#252;ft nicht gr&#252;ndlicher &#8211; er pr&#252;ft oberfl&#228;chlicher. Oder er wird zum Bottleneck, der die gesamte AI-Velocity wieder zunichtemacht.</p><p>Wir verlangen von Menschen, dass sie Arbeit verantworten, f&#252;r die wir sie weder ausgebildet noch ausgestattet haben.</p><p><strong>4. Was genau wird verifiziert &#8211; und was nicht?</strong></p><p>Tests laufen durch. Linting ist sauber. Der Code funktioniert.</p><p>Aber: Ist die Architektur-Entscheidung richtig? Passt die L&#246;sung ins Gesamtsystem? Entsteht gerade technische Schuld, die erst in zwei Jahren sichtbar wird?</p><p>Agents optimieren lokal. Sie l&#246;sen die Aufgabe, die vor ihnen liegt. Die systemischen Auswirkungen sieht niemand &#8211; bis es zu sp&#228;t ist.</p><p><strong>5. Was passiert mit den Bereichen, die nicht Engineering hei&#223;en?</strong></p><p>Code-Generierung ist nur ein Teil des Delivery-Systems. Was ist mit Produktentscheidungen, die jetzt schneller technisch umsetzbar sind &#8211; aber nicht schneller durchdacht? Was ist mit Dokumentation, die niemand mehr schreibt, weil der Code sich zu schnell &#228;ndert? Mit Onboarding neuer Teammitglieder in eine Codebase, die niemand im Team mehr wirklich versteht?</p><p>Wenn Engineering pl&#246;tzlich zehnmal schneller liefern kann, verschiebt sich der Druck auf Product, Design, QA. Die Friction wandert &#8211; sie verschwindet nicht.</p><h3>Das eigentliche Problem</h3><p>Wir haben das Code-Schreiben beschleunigt. Aber die Arbeit, die sich nicht beschleunigen l&#228;sst &#8211; verstehen, bewerten, entscheiden, verantworten &#8211; ist immer noch da. Und unsere Organisationen sind nicht daf&#252;r gebaut.</p><p>Die meisten Unternehmen behandeln AI wie ein Upgrade ihrer Werkzeuge. Schnellere IDE, besserer Copilot, mehr Output pro Kopf.</p><p>Aber das Werkzeug hat sich fundamental ver&#228;ndert. Es trifft jetzt eigene Entscheidungen. Und wir haben keine Strukturen, Prozesse oder Rollenbilder, die damit umgehen k&#246;nnen.</p><p>Kleine AI-native Teams bauen gerade ihre Strukturen um diese Realit&#228;t herum. Gro&#223;e Organisationen diskutieren noch, welchen Copilot sie lizenzieren. Die Frage ist nicht, ob sich das r&#228;cht &#8211; sondern wann.</p><div class="subscription-widget-wrap-editor" data-attrs="{&quot;url&quot;:&quot;https://blog.fluxum.net/subscribe?&quot;,&quot;text&quot;:&quot;Abonnieren&quot;,&quot;language&quot;:&quot;de&quot;}" data-component-name="SubscribeWidgetToDOM"><div class="subscription-widget show-subscribe"><div class="preamble"><p class="cta-caption">Danke f&#252;rs Lesen von fluxum engineering! Abonnieren Sie kostenlos, um neue Posts zu erhalten und meine Arbeit zu unterst&#252;tzen.</p></div><form class="subscription-widget-subscribe"><input type="email" class="email-input" name="email" placeholder="E-Mail-Adresse eingeben &#8230;" tabindex="-1"><input type="submit" class="button primary" value="Abonnieren"><div class="fake-input-wrapper"><div class="fake-input"></div><div class="fake-button"></div></div></form></div></div>]]></content:encoded></item><item><title><![CDATA[Wer kontrolliert die Agenten?]]></title><description><![CDATA[Kann man dem Output &#252;berhaupt vertrauen?]]></description><link>https://blog.fluxum.net/p/wer-kontrolliert-die-agenten</link><guid isPermaLink="false">https://blog.fluxum.net/p/wer-kontrolliert-die-agenten</guid><dc:creator><![CDATA[Martin Gross]]></dc:creator><pubDate>Fri, 16 Jan 2026 19:34:40 GMT</pubDate><enclosure url="https://substackcdn.com/image/fetch/$s_!BM2t!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F907a5a4f-c6b1-4ebe-ba5c-607b12ae855c_1024x1024.jpeg" length="0" type="image/jpeg"/><content:encoded><![CDATA[<blockquote><p>&#8222;Ich schreibe kaum noch Code. Und trotzdem baue ich mehr Software als je zuvor.&#8220;</p></blockquote><p>Als ich das <a href="https://www.linkedin.com/posts/martingrossfluxum_ich-schreibe-kaum-noch-code-und-trotzdem-activity-7406338672528371712-JaYG/?rcm=ACoAAAQB_GMBre69owxxAqyVokpRE271ccFibqM">k&#252;rzlich auf LinkedIn</a> schrieb, kam:</p><blockquote><p>&#8222;Naja, und wer kontrolliert die Agenten? Wer r&#228;umt die technischen Schulden, die sie produzieren, wieder auf?&#8221;</p></blockquote><div class="captioned-image-container"><figure><a class="image-link image2 is-viewable-img" target="_blank" href="https://substackcdn.com/image/fetch/$s_!BM2t!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F907a5a4f-c6b1-4ebe-ba5c-607b12ae855c_1024x1024.jpeg" data-component-name="Image2ToDOM"><div class="image2-inset"><picture><source type="image/webp" srcset="https://substackcdn.com/image/fetch/$s_!BM2t!,w_424,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F907a5a4f-c6b1-4ebe-ba5c-607b12ae855c_1024x1024.jpeg 424w, https://substackcdn.com/image/fetch/$s_!BM2t!,w_848,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F907a5a4f-c6b1-4ebe-ba5c-607b12ae855c_1024x1024.jpeg 848w, https://substackcdn.com/image/fetch/$s_!BM2t!,w_1272,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F907a5a4f-c6b1-4ebe-ba5c-607b12ae855c_1024x1024.jpeg 1272w, https://substackcdn.com/image/fetch/$s_!BM2t!,w_1456,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F907a5a4f-c6b1-4ebe-ba5c-607b12ae855c_1024x1024.jpeg 1456w" sizes="100vw"><img src="https://substackcdn.com/image/fetch/$s_!BM2t!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F907a5a4f-c6b1-4ebe-ba5c-607b12ae855c_1024x1024.jpeg" width="1024" height="1024" data-attrs="{&quot;src&quot;:&quot;https://substack-post-media.s3.amazonaws.com/public/images/907a5a4f-c6b1-4ebe-ba5c-607b12ae855c_1024x1024.jpeg&quot;,&quot;srcNoWatermark&quot;:null,&quot;fullscreen&quot;:null,&quot;imageSize&quot;:null,&quot;height&quot;:1024,&quot;width&quot;:1024,&quot;resizeWidth&quot;:null,&quot;bytes&quot;:135690,&quot;alt&quot;:null,&quot;title&quot;:null,&quot;type&quot;:&quot;image/jpeg&quot;,&quot;href&quot;:null,&quot;belowTheFold&quot;:false,&quot;topImage&quot;:true,&quot;internalRedirect&quot;:&quot;https://blog.fluxum.net/i/184803595?img=https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F907a5a4f-c6b1-4ebe-ba5c-607b12ae855c_1024x1024.jpeg&quot;,&quot;isProcessing&quot;:false,&quot;align&quot;:null,&quot;offset&quot;:false}" class="sizing-normal" alt="" srcset="https://substackcdn.com/image/fetch/$s_!BM2t!,w_424,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F907a5a4f-c6b1-4ebe-ba5c-607b12ae855c_1024x1024.jpeg 424w, https://substackcdn.com/image/fetch/$s_!BM2t!,w_848,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F907a5a4f-c6b1-4ebe-ba5c-607b12ae855c_1024x1024.jpeg 848w, https://substackcdn.com/image/fetch/$s_!BM2t!,w_1272,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F907a5a4f-c6b1-4ebe-ba5c-607b12ae855c_1024x1024.jpeg 1272w, https://substackcdn.com/image/fetch/$s_!BM2t!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F907a5a4f-c6b1-4ebe-ba5c-607b12ae855c_1024x1024.jpeg 1456w" sizes="100vw" fetchpriority="high"></picture><div class="image-link-expand"><div class="pencraft pc-display-flex pc-gap-8 pc-reset"><button tabindex="0" type="button" class="pencraft pc-reset pencraft icon-container restack-image"><svg role="img" width="20" height="20" viewBox="0 0 20 20" fill="none" stroke-width="1.5" stroke="var(--color-fg-primary)" stroke-linecap="round" stroke-linejoin="round" xmlns="http://www.w3.org/2000/svg"><g><title></title><path d="M2.53001 7.81595C3.49179 4.73911 6.43281 2.5 9.91173 2.5C13.1684 2.5 15.9537 4.46214 17.0852 7.23684L17.6179 8.67647M17.6179 8.67647L18.5002 4.26471M17.6179 8.67647L13.6473 6.91176M17.4995 12.1841C16.5378 15.2609 13.5967 17.5 10.1178 17.5C6.86118 17.5 4.07589 15.5379 2.94432 12.7632L2.41165 11.3235M2.41165 11.3235L1.5293 15.7353M2.41165 11.3235L6.38224 13.0882"></path></g></svg></button><button tabindex="0" type="button" class="pencraft pc-reset pencraft icon-container view-image"><svg xmlns="http://www.w3.org/2000/svg" width="20" height="20" viewBox="0 0 24 24" fill="none" stroke="currentColor" stroke-width="2" stroke-linecap="round" stroke-linejoin="round" class="lucide lucide-maximize2 lucide-maximize-2"><polyline points="15 3 21 3 21 9"></polyline><polyline points="9 21 3 21 3 15"></polyline><line x1="21" x2="14" y1="3" y2="10"></line><line x1="3" x2="10" y1="21" y2="14"></line></svg></button></div></div></div></a></figure></div><p>Eine Frage, eine berechtigte Frage, mit der ich mich ebenfalls schon besch&#228;ftigt hatte.</p><div class="subscription-widget-wrap-editor" data-attrs="{&quot;url&quot;:&quot;https://blog.fluxum.net/subscribe?&quot;,&quot;text&quot;:&quot;Abonnieren&quot;,&quot;language&quot;:&quot;de&quot;}" data-component-name="SubscribeWidgetToDOM"><div class="subscription-widget show-subscribe"><div class="preamble"><p class="cta-caption">Danke f&#252;rs Lesen von fluxum engineering! Abonnieren Sie kostenlos, um neue Posts zu erhalten und meine Arbeit zu unterst&#252;tzen.</p></div><form class="subscription-widget-subscribe"><input type="email" class="email-input" name="email" placeholder="E-Mail-Adresse eingeben &#8230;" tabindex="-1"><input type="submit" class="button primary" value="Abonnieren"><div class="fake-input-wrapper"><div class="fake-input"></div><div class="fake-button"></div></div></form></div></div><p>Eine Frage, die ich nicht mit einem Zweizeiler beantworten kann.</p><h2>Die Frage hinter der Frage</h2><p>Wer so fragt, will wissen: </p><p>Kannst du dem Output &#252;berhaupt vertrauen? </p><p>Oder baust du dir gerade ein Kartenhaus, das beim ersten echten Problem zusammenf&#228;llt?</p><p>Meine Antwort ist unbefriedigend f&#252;r alle, die ein klares Ja oder Nein wollen: Es kommt darauf an. Und genau dieses &#8222;es kommt darauf an&#8221; ist der eigentliche Skill, den ich in den letzten Monaten entwickelt habe.</p><h2>Nicht alles ist gleich kritisch</h2><p>Der erste Schritt war eine simple Erkenntnis: Nicht jeder Bereich meiner Software verdient dieselbe Aufmerksamkeit.</p><p>Ich unterscheide grob nach zwei Kriterien:</p><ol><li><p>Wie schnell sehe ich, wenn etwas nicht funktioniert?</p></li><li><p>Wie gro&#223; ist der potenzielle Schaden?</p></li></ol><p><strong>Kritische Bereiche</strong> sind f&#252;r mich zum Beispiel:</p><ul><li><p>Authentifizierung und Login-Flows</p></li><li><p>Autorisierungslogik &#8211; wer darf was sehen und tun</p></li><li><p>Datenbankdesign, insbesondere das Datenmodell</p></li><li><p>Row Level Security f&#252;r Datenbanken</p></li><li><p>Alles, was mit Zahlungen oder sensiblen Nutzerdaten zu tun hat</p></li><li><p>Alles, von dem viel abh&#228;ngt</p></li></ul><p>Diese Bereiche haben zwei Eigenschaften gemeinsam:</p><ul><li><p>Fehler sind nicht sofort sichtbar, und</p></li><li><p>wenn sie auftreten, ist der Schaden potenziell gro&#223;.</p></li></ul><p>Eine kaputte Authentifizierung merkst du nicht, wenn du die Anwendung durchklickst. Du merkst sie, wenn jemand anderes sie ausnutzt.</p><p><strong>Unkritische Bereiche</strong> sind f&#252;r mich:</p><ul><li><p>Frontend-Darstellung und UI-Komponenten</p></li><li><p>Styling und Layout</p></li><li><p>Nicht-sicherheitsrelevante Formularvalidierungen</p></li><li><p>Hilfsfunktionen und Utilities</p></li></ul><p>Das heisst nicht, dass sie unwichtig sind. Aber wenn hier etwas nicht funktioniert, sehe ich es schnell. Ein Button, der nicht reagiert, eine Liste, die nicht rendert &#8211; das f&#228;llt beim Testen auf. Und selbst wenn es durchrutscht: Der Schaden ist begrenzt. Kein Nutzer verliert Geld oder Daten, weil ein Schatten an der falschen Stelle sitzt.</p><h2>Wie ich Agenten einsetze</h2><p>F&#252;r meine Projekte habe ich spezialisierte Subagents aufgebaut, die auf definierte Aufgaben zugeschnitten sind. Manche habe ich selbst konfiguriert, bei anderen greife ich auf vorgefertigte L&#246;sungen zur&#252;ck. Entscheidend ist nicht das einzelne Tool, sondern wie sie zusammenarbeiten.</p><p>Mein Workflow folgt einem Muster, das menschliche Review-Prozesse nachbildet:</p><p><strong>Stufe 1: Entwurf.</strong> Ein Agent erstellt einen ersten Vorschlag &#8211; sei es Code, eine Architekturentscheidung oder ein Datenbankschema.</p><p><strong>Stufe 2: Ausarbeitung.</strong> Ein anderer Agent nimmt den Entwurf und arbeitet die Details aus. Er kennt den Kontext, aber er hat eine andere Perspektive.</p><p><strong>Stufe 3: Pr&#252;fung.</strong> Ein dritter Agent &#252;berpr&#252;ft das Ergebnis. Er fragt: Was k&#246;nnte man aus Sicherheitsperspektive verbessern? Wo sind potenzielle Schwachstellen?</p><p>Das klingt aufwendiger, als es ist. In der Praxis l&#228;uft vieles davon automatisiert. Ich sto&#223;e den Prozess an und bekomme am Ende einen Report, den ich durchgehe.</p><h2>Der entscheidende Unterschied: Wo ich selbst hinschaue</h2><p>Bei unkritischen Bereichen reicht mir, was die spezialisierten Agenten identifizieren.</p><p>Bei kritischen Bereichen ist das Agenten-Review nur die erste Runde. Die zweite Runde mache ich selbst.</p><p>Das bedeutet konkret: Ich lese den Code. Ich hinterfrage die Architekturentscheidungen. Ich &#252;berlege, welche Edge Cases nicht abgedeckt sind. Ich gleiche ab, ob das, was da steht, zu meinem mentalen Modell des Systems passt.</p><p>Das ist der Human-in-the-Loop, von dem alle reden. Nur dass er eben nicht bei jeder Zeile Code greift, sondern gezielt dort, wo es darauf ankommt.</p><h2>Vorgaben von Anfang an</h2><p>Ein Bereich, in dem sich der agentenbasierte Ansatz besonders bew&#228;hrt. Statt Anforderungen nachtr&#228;glich zu pr&#252;fen, bette ich sie von Anfang an in den Entwicklungsprozess ein.</p><p>Das funktioniert &#252;ber Guidelines &#8211; Markdown-Dateien, die beschreiben, welche Regeln gelten. Diese Guidelines flie&#223;en in die Spezifikations- und Planungsphase ein. Die Agenten kennen sie und ber&#252;cksichtigen sie.</p><p>Anschlie&#223;end lasse ich spezialisierte Agenten Reviews durchf&#252;hren und Reports erstellen. Diese Reports gehe ich durch, hinterfrage kritisch, f&#252;hre meine eigene Analyse durch und gleiche ab. Wenn Probleme auftauchen, lasse ich sie durch die Agenten beheben und sto&#223;e dann ein erneutes Review an.</p><p>Es ist ein iterativer Prozess. Aber einer, der Compliance by Design erm&#246;glicht, statt sie als nachtr&#228;glichen Kontrollschritt zu behandeln.</p><h2>Die Bilanz: &#196;hnliche Probleme, andere Dynamik</h2><p>Produzieren Agenten mehr technische Schulden als Menschen? Nach meiner Erfahrung: Nein. Es sind dieselben Probleme &#8211; nur schneller sichtbar.</p><p>Wenn eine Codebasis w&#228;chst, entsteht duplizierter Code. Nicht, weil die Agenten schlecht arbeiten, sondern weil ihnen der Gesamt&#252;berblick fehlt. Ein erfahrener Entwickler, der seit Monaten an einem Projekt arbeitet, wei&#223; implizit, dass es schon eine Utility-Funktion f&#252;r diesen Fall gibt. Ein Agent sieht nur den aktuellen Kontext.</p><p>Das ist kein Argument gegen Agenten. Es ist ein Argument f&#252;r iterative Zyklen.</p><p>Mein Vorgehen: Erst die Funktionalit&#228;t, dann das Aufr&#228;umen. Ich lasse entwickeln, schaue, dass es funktioniert, und starte dann eine neue Runde, in der ich gezielt auf Code-Qualit&#228;t achte. Daf&#252;r nutze ich einen Subagent, der sich auf Refactorings spezialisiert hat &#8211; er analysiert, identifiziert Duplikate, schl&#228;gt Zusammenf&#252;hrungen vor.</p><p>Dieses Vorgehen ist nicht neu. Es ist das, was erfahrene Entwickler schon immer gemacht haben: Erst zum Laufen bringen, dann aufr&#228;umen. Wer versucht, von Anfang an hundertprozentig sauberen Code zu schreiben, verzettelt sich und blockiert sich selbst.</p><p>Der Unterschied: Mit Agenten passiert beides schneller. Die technischen Schulden entstehen schneller &#8211; aber sie werden auch schneller sichtbar und schneller abgebaut.</p><h2>Was Agenten gut k&#246;nnen &#8211; und was nicht</h2><p>Nach Monaten intensiver Arbeit mit diesem Setup habe ich ein klareres Bild davon, wo die St&#228;rken und Grenzen liegen.</p><p><strong>Agenten schreiben exzellenten Code im Kleinen.</strong> Eine einzelne Funktion, ein Modul, eine Komponente &#8211; das bekommen sie auf dem Niveau eines erfahrenen Entwicklers hin. Saubere Struktur, gute Benennung, Best Practices.</p><p><strong>Was ihnen fehlt, ist der System&#252;berblick.</strong> Sie sehen nicht, wie die Teile zusammenh&#228;ngen. Sie wissen nicht, dass die Entscheidung in Modul A Auswirkungen auf Modul B hat, wenn das nicht explizit im Kontext steht.</p><p>Das liegt in der Natur der Sache: Eine KI kann nur aus dem verstehen, was ihr als Kontext gegeben wird. Ein erfahrener Entwickler hat das Gesamtsystem im Kopf &#8211; auch die Teile, die er nie explizit aufgeschrieben hat.</p><h2>Der Skill-Shift</h2><p>Diese Erkenntnis hat Konsequenzen f&#252;r die Art, wie ich arbeite.</p><p>Fr&#252;her konnte vieles implizit bleiben. Ich wusste, wie das System funktioniert, und musste es niemandem erkl&#228;ren. Jetzt muss ich es externalisieren &#8211; durch Spezifikationen, Guidelines, Architektur-Dokumentation. Was fr&#252;her im Kopf bleiben konnte, muss jetzt explizit werden.</p><p>Das ist mehr Arbeit. Aber es ist bessere Arbeit. Denn was ich f&#252;r die Agenten aufschreibe, hilft auch anderen Teammitgliedern. Also den Menschen<a class="footnote-anchor" data-component-name="FootnoteAnchorToDOM" id="footnote-anchor-1" href="#footnote-1" target="_self">1</a>. Es zwingt mich, meine Entscheidungen zu artikulieren, statt sie vorauszusetzen.</p><p>Der Shift, den ich beobachte, ist real:</p><p>Weniger &#8222;wie schreibe ich diesen Code&#8221;, mehr &#8222;wie lenke ich die Agenten&#8221;. Das bedeutet nicht, dass Programmierkenntnisse unwichtig werden. Es bedeutet, dass sie nicht mehr ausreichen.</p><p>Was jetzt z&#228;hlt:</p><ul><li><p><strong>Systemdesign auf h&#246;herer Ebene:</strong> Architektur, Schnittstellen, Datenmodelle</p></li><li><p><strong>Sicherheitsdenken:</strong> Wo sind die Angriffsfl&#228;chen, was muss besonders gesch&#252;tzt werden</p></li><li><p><strong>Agenten-Orchestrierung:</strong> Wie koordiniere ich verschiedene spezialisierte Agenten, wie definiere ich Richtlinien, wie behalte ich die Kontrolle</p></li><li><p><strong>Kritisches Pr&#252;fen:</strong> Wann vertraue ich dem Output, wann schaue ich selbst hin</p></li></ul><h2>Die Antwort auf die urspr&#252;ngliche Frage</h2><p>Wer kontrolliert die Agenten? Ich. Aber nicht bei jeder Zeile Code.</p><p>Ich kontrolliere durch Struktur: spezialisierte Agenten, die sich gegenseitig pr&#252;fen. Ich kontrolliere durch Fokus: menschliche Reviews dort, wo der Schaden am gr&#246;&#223;ten w&#228;re. Ich kontrolliere durch Iteration: Entwickeln, pr&#252;fen, aufr&#228;umen, wiederholen.</p><p>Und ich kontrolliere durch Akzeptanz: Die Einsicht, dass kein Prozess perfekt ist &#8211; weder mit Agenten noch ohne. Dass technische Schulden entstehen und abgebaut werden m&#252;ssen. Dass Fehler passieren und gefunden werden m&#252;ssen.</p><p>Der Unterschied ist nicht, dass Agenten fehlerfreien Code produzieren. Der Unterschied ist, dass ich mehr produziere und schneller iteriere. Und dass ich meine Zeit dort einsetze, wo sie den gr&#246;&#223;ten Unterschied macht: bei den Entscheidungen, die ein System sicher oder unsicher, wartbar oder unwartbar machen.</p><p>Das ist keine Zukunftsvision. Das ist mein Alltag seit Monaten. Und bisher funktioniert es.</p><div class="subscription-widget-wrap-editor" data-attrs="{&quot;url&quot;:&quot;https://blog.fluxum.net/subscribe?&quot;,&quot;text&quot;:&quot;Abonnieren&quot;,&quot;language&quot;:&quot;de&quot;}" data-component-name="SubscribeWidgetToDOM"><div class="subscription-widget show-subscribe"><div class="preamble"><p class="cta-caption">Danke f&#252;rs Lesen von fluxum engineering! Abonnieren Sie kostenlos, um neue Posts zu erhalten und meine Arbeit zu unterst&#252;tzen.</p></div><form class="subscription-widget-subscribe"><input type="email" class="email-input" name="email" placeholder="E-Mail-Adresse eingeben &#8230;" tabindex="-1"><input type="submit" class="button primary" value="Abonnieren"><div class="fake-input-wrapper"><div class="fake-input"></div><div class="fake-button"></div></div></form></div></div><div class="footnote" data-component-name="FootnoteToDOM"><a id="footnote-1" href="#footnote-anchor-1" class="footnote-number" contenteditable="false" target="_self">1</a><div class="footnote-content"><p>Ich finde es schwierig, wenn manche Leute KI-Agenten als Teammitglieder bezeichnen, also vermenschlichen. Eine KI ist und bleibt eine intelligente Maschine und ist kein Menschenersatz. </p></div></div>]]></content:encoded></item><item><title><![CDATA[Warum in der agentenbasierten Softwareentwicklung Workflows für mich immer wichtiger werden]]></title><description><![CDATA[Als Softwareentwickler schreiben wir immer weniger Code selbst.]]></description><link>https://blog.fluxum.net/p/warum-in-der-agentenbasierten-softwareentwicklun</link><guid isPermaLink="false">https://blog.fluxum.net/p/warum-in-der-agentenbasierten-softwareentwicklun</guid><dc:creator><![CDATA[Martin Gross]]></dc:creator><pubDate>Fri, 09 Jan 2026 12:33:30 GMT</pubDate><enclosure url="https://substackcdn.com/image/fetch/$s_!y_oj!,w_256,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fa142b85f-3d35-4a80-bdac-1835f765cd9e_512x512.png" length="0" type="image/jpeg"/><content:encoded><![CDATA[<p>Als Softwareentwickler schreiben wir immer weniger Code selbst. Die Aufgabe verschiebt sich mehr in die Richtung, KI-Agenten in den jeweils passend gestalteten Workflows arbeiten zu lassen, damit sie so zuverl&#228;ssige Ergebnisse liefern. </p><p>Deshalb ist es so spannend sich gegenseitig auszutauschen und zu h&#246;ren, wie andere konzeptionell an die KI-gest&#252;tzte Softwareentwicklung herangehen. </p><p>Denn letztendlich war es schon immer der richtige L&#246;sungsansatz, der den eigentlichen Mehrwert liefert. Wenn man wei&#223;, wie man ein Problem l&#246;sen kann, ist die anschlie&#223;ende Umsetzung fast trivial.</p><p>Zudem wird immer deutlicher, dass testgetriebene Entwicklung wichtiger denn je ist:</p><p>1. Tests dienen als Leitplanken, die eine Beschreibung des Ziels liefern.</p><p>2. Tests dienen als Feedback-Schleife. Agenten k&#246;nnen sie eigenst&#228;ndig ausf&#252;hren und erhalten dadurch Feedback, wie gut sie ihre Aufgaben erf&#252;llt haben.</p><p>&#8594; Agenten k&#246;nnen autonom und iterativ weiterarbeiten, bis das Ergebnis die Erfolgskriterien erf&#252;llt.</p><p>3. Und wie sonst will man bei jeder Iteration die Korrektheit von so viel Code pr&#252;fen?</p>]]></content:encoded></item><item><title><![CDATA[Where humans matter: Agentic Coding in Practice]]></title><description><![CDATA[What I Learned from AI-Assisted Software Development and How I Approach It Today]]></description><link>https://blog.fluxum.net/p/where-humans-matter-agentic-coding</link><guid isPermaLink="false">https://blog.fluxum.net/p/where-humans-matter-agentic-coding</guid><dc:creator><![CDATA[Martin Gross]]></dc:creator><pubDate>Tue, 09 Dec 2025 18:06:15 GMT</pubDate><enclosure url="https://substackcdn.com/image/fetch/$s_!y_oj!,w_256,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fa142b85f-3d35-4a80-bdac-1835f765cd9e_512x512.png" length="0" type="image/jpeg"/><content:encoded><![CDATA[<h1>Agentic Coding: What I&#8217;ve learned and how I approach it today</h1><p>The discussion about agentic coding fluctuates between two extremes: &#8220;AI will solve everything&#8221; on the one hand, &#8220;It&#8217;s all just hype&#8221; on the other.</p><p>Both positions fall short. After months of intensive work with coding agents, I would like to share with you what I have learned in the process &#8211; and how my way of working has changed.</p><h2>The current state of affairs: 7 theses</h2><p>Before I get to my own specific experiences, here are 7 core theses written by Simon Wardley, which I have supplemented with my own perspective:</p><p><strong>Development is not yet engineering.</strong> While testing has become a systematic discipline through practices such as TDD, development remains largely intuition-driven. There are patterns, but no consistent system. Agentic coding could be a catalyst for this transformation, if we approach it correctly.</p><p><strong>Small, contextual tools beat monoliths with LLM on top.</strong> The prevailing approach of simply enriching existing systems with LLM capabilities does not exploit the potential. More effective are combinable tools with clear inputs, outputs, and specific application contexts.</p><p><strong>LLMs are coherence machines, not truth machines.</strong> They optimize for plausibility, not correctness. This makes them valuable for drafting and exploration, but unreliable for final decisions without human validation.</p><p><strong>Code is more than functionality &#8211; structure is the real decision.</strong> Architectural decisions manifest themselves in code. LLMs can generate functionality, but structural decisions require an understanding of the system.</p><p><strong>The key question: Where do humans stand in the decision-making process?</strong> It&#8217;s not about whether AI is used, but where human judgment remains indispensable. This boundary must be drawn consciously.</p><p><strong>Practices are still evolving.</strong> What is considered state of the art today may be obsolete tomorrow. Beware of hasty best practices.</p><p><strong>Experimentation is fine, but with an awareness of the terrain.</strong> Speed without direction is just getting lost quickly.</p><h2>My approach today</h2><p>These theories align well with my experiences. However, theory is one thing and daily practice is another. Here&#8217;s what works for me.</p><h3>A deliberately modular setup</h3><p>I don&#8217;t like working with fully integrated solutions. Not on principle, but because they don&#8217;t work optimally for my workflow.</p><p>My setup consists of three components:</p><ol><li><p>An IDE, such as IntelliJ IDEA, which allows me to keep track of the code. I can quickly check where everything is located. Git integration is extremely important here &#8212; it makes changes traceable and reversible. IntelliJ can do almost everything I need, including inspecting databases. Unfortunately, with power comes complexity. For smaller projects, I prefer the ZED editor because it&#8217;s more streamlined and intuitive.</p></li><li><p>I use the terminal (preferably Ghostty) with my coding agent, which is currently mainly Claude Code. There, I give instructions, observe, and control.</p></li><li><p>I use an LLM chat window for conceptual work. At the beginning of a project, I use it to work through ideas and organize them in a document before writing code.</p></li></ol><p>This three-way split is no coincidence. It corresponds to the principle of specialized tools: each component has its strengths, none tries to be everything.</p><p>I use other specialized tools here and there, such as the GitHub Desktop app. But at its core, these three tools are the ones I use.</p><h3>Sub-agents as the key</h3><p>Perhaps the most important lesson learned in recent months is that specialized sub-agents deliver significantly better results than general-purpose agents. The reason is simple&#8212;the tailored context makes all the difference.</p><p>Two examples from my experience:</p><p><strong>Quality assurance:</strong> A sub-agent exclusively responsible for quality assurance checks against specified guidelines and documentation. It does not advise; it validates. This is essentially TDD thinking at the agent level &#8212; explicit standards instead of intuition.</p><p><strong>UI design:</strong> I achieve significantly better results when designing user interfaces with a specialized design sub-agent. I specify the direction the design should take and which design principles apply. The agent generates designs within these guidelines instead of working in a vacuum.</p><p>In both cases, the lever is the specialized context and the focused system prompt of the sub-agent, not the general intelligence of the model.</p><h3>Validating coherence</h3><p>Yes, LLM output has misled me before. In fact, it was precisely because it sounded plausible. The coherence was there, but the truth was not.</p><p>My validation process is two-stage. First, I verify what I can myself. For everything else, I use specialized sub-agents with internet access that can verify facts. However, it&#8217;s crucial to note that ultimately, humans remain responsible. The sub-agents are tools, not decision-makers.</p><p>Hallucinations don&#8217;t like to stay alone. Where one thing is wrong, other things are often invalid.</p><h3>Keeping an eye on structure</h3><p>When does generated code become problematic? Most obviously, when source code files become too large. There are too many lines. Too much functionality in individual functions.</p><p>My approach: I let almost everything be generated. If I want to make changes, I let the agent adapt and then check it. Experience shows that this is faster than writing it myself, unless the changes are minor restructuring or corrections. In that case, I intervene directly.</p><p>However, I am responsible for the structure. I decide when a file becomes too large, when functionality needs to be split up, and what the architecture and refactorings should look like. I usually define the architecture before coding begins and document it in Markdown files.</p><h3>The real problem is communication</h3><p>Ultimately, humans must decide if what has been generated is good enough. Human judgment is indispensable because only humans can determine if they have received what they wanted.</p><p>Here lies an uncomfortable truth: Even with AI, the problem is often communication. The question is not &#8220;Can AI do that?&#8221; but &#8220;Can I articulate what I want?&#8221; This is not a new insight&#8212;anyone who has ever written requirements knows this. But with Agentic Coding, it becomes immediately apparent.</p><h3>Not balance, but a pendulum</h3><p>Is there a perfect balance between trying things out quickly and understanding what I&#8217;m doing? I don&#8217;t think so. It&#8217;s more like swinging back and forth.</p><p>I try out ideas to see if they lead to reasonable results. At the latest, I need to understand what I&#8217;m doing when I&#8217;m convinced of the direction and want to check its viability for the future.</p><p>That&#8217;s more honest than any best practice. Practices are still evolving. Anyone who claims to have found the optimal workflow today will be working differently in six months.</p><h2>The open question</h2><p>The core architectural question of our time remains: Where do we place people in the decision-making process?</p><p>This is not a technical question. It is a question of organization, responsibility, and design. Every organization must answer it for itself&#8212;consciously, rather than implicitly through tool adoption.</p><p>As of today, my answer is: People decide on the structure, validate the results, and take responsibility. Agents generate, specialize, and accelerate. The boundary is not fixed; it shifts with every learning experience.</p><p>That is precisely what makes this such an interesting time.</p><div class="subscription-widget-wrap-editor" data-attrs="{&quot;url&quot;:&quot;https://blog.fluxum.net/subscribe?&quot;,&quot;text&quot;:&quot;Abonnieren&quot;,&quot;language&quot;:&quot;de&quot;}" data-component-name="SubscribeWidgetToDOM"><div class="subscription-widget show-subscribe"><div class="preamble"><p class="cta-caption"></p></div><form class="subscription-widget-subscribe"><input type="email" class="email-input" name="email" placeholder="E-Mail-Adresse eingeben &#8230;" tabindex="-1"><input type="submit" class="button primary" value="Abonnieren"><div class="fake-input-wrapper"><div class="fake-input"></div><div class="fake-button"></div></div></form></div></div>]]></content:encoded></item></channel></rss>