Agentic Coding mit LLMs: Der Einstieg in die Entwickler-Matrix
Claude, DeepSeek, GPT-4o, Llama und Mistral im Praxisvergleich — plus die Datenschutzfrage, die bei gehosteten Coding-Agents immer mitklingt. Ein Erfahrungsbericht.
Agentic Coding hat meinen Entwicklungsalltag grundlegend verändert. Das hier ist mein Log dazu: von den ersten Experimenten mit lokalen Modellen bis zu den Workflows, die Tools wie Windsurf heute ermöglichen — einer Zusammenarbeit zwischen Entwickler und KI, die noch vor wenigen Jahren nach Science-Fiction klang.
Die rote Pille der Entwicklung
Der Moment, in dem Neo in The Matrix die rote Pille wählt — genau so hat es sich angefühlt, als ich anfing, LLMs in meinen Entwicklungsworkflow zu integrieren. Gestartet bin ich mit einfachen Projekten, um die Fähigkeiten verschiedener Modelle zu testen, darunter Claude Sonnet, Mistral und GPT.
Als CTO musste ich dabei ein Gleichgewicht zwischen Innovation und Risikomanagement finden. Agentic Coding hat sich in dieser Hinsicht als unschätzbar wertvoll erwiesen, weil es mir ermöglicht:
- schnelle Prototypen für neue Funktionen zu erstellen
- Compliance-Anforderungen wie die DSGVO im Griff zu behalten
- Entwicklungs-Workflows zu optimieren
- Code-Qualität über alle Projekte hinweg sicherzustellen
Meine ersten Schritte in der Code-Matrix
Meine ersten Experimente konzentrierten sich auf die Entwicklung von Themes für Ghost CMS und die Integration eines 3D-Viewers auf Basis der pmndrs-Repos mit Three.js. Dieses Projekt wurde mein Testfeld, um die Stärken und Grenzen der verschiedenen LLMs zu verstehen. Ein zentraler Faktor dabei: Wie gut ein Modell den Kontext aufnimmt und versteht, entscheidet maßgeblich über die Qualität der Ergebnisse.

Navigation durch die Entwickler-Matrix
1. Modellexploration
Beim Testen und Vergleichen verschiedener LLMs (Stand 2024/2025) zeigten sich deutliche Unterschiede in Eigenschaften und Fähigkeiten:
- Claude Sonnet (Anthropic): Stabil und stark im Reasoning, allerdings eine der teureren Optionen
- DeepSeek (CN): Die Modelle R1 und V3 überzeugten durch Geschwindigkeit und Zuverlässigkeit bei gutem Preis-Leistungs-Verhältnis
- GPT-4o (OpenAI): Schnelle Antwortzeiten und gutes Code-Verständnis, aber ebenfalls kostspielig
- Llama 3.3 (Meta): Stark bei Code-Erklärung und Debugging; der Open-Source-Charakter macht es zum Favoriten für Anpassungen
- Mistral (FRA/EU): Herausragende Code-Vervollständigung und lokale Einsatzmöglichkeiten
- Gemini (Google): Enge Integration in Googles Entwickler-Tools und Cloud-Dienste
Mein Fazit aus dieser Phase — die Wahl hängt stark von den konkreten Anforderungen ab:
- Für schnelles Prototyping: GPT-4o und Llama 3.3
- Für Kosteneffizienz: DeepSeek und Mistral
- Für Unternehmenssicherheit: Claude Sonnet
- Für Open-Source-Flexibilität: Llama 3.3 und Mistral
Dieses Verständnis hilft bei der Auswahl des richtigen Werkzeugs für die jeweilige Aufgabe — ob Rapid Prototyping, Debugging oder die Pflege von Legacy-Code.
2. Lokale Entwicklung
Lokale Modelle mit Ollama waren vielversprechend, hatten aber mit der Kontextlänge zu kämpfen. Die Konsistenz bei der Fortsetzung früherer Arbeiten war überraschend gut — die Verwaltung und Aktualisierung lokaler LLMs erwies sich jedoch als zeitaufwändig.
3. Vergleichende Analyse
DeepSeek und seine Reasoning-Modelle haben meine Herangehensweise an vergleichende Arbeit verändert — besonders in Kombination mit Tools wie Cline und Windsurf. Die Möglichkeit, die Gedankengänge des Modells nachzuvollziehen, wurde vor allem bei großen, bestehenden Codebases wertvoll: Zu verstehen, wie das Modell an einen Input herangeht, ist entscheidend für die Qualität der Zusammenarbeit.
4. Workflow-Integration
Mein Workflow hat sich auf Effizienz und Präzision ausgerichtet. Ob Merge Requests, entwirrter Legacy-Code oder polierte UI-Elemente — die Werkzeuge passen sich der Aufgabe an.
Die Modernisierung des Ghost-CMS-Themes etwa fühlte sich an wie eine Zeitmaschine: Das Modell verstand Vergangenheit und Gegenwart der Codebasis gleichermaßen. Auch die Implementierung einer komplexen Funktion für meine Website lief nahtlos — vom ersten Commit bis zur finalen Freigabe hielt mich das Kontextbewusstsein des Agents fokussiert. Das gab genug Rückenwind, um meinen Agentic-Coding-Workflow weiter auszubauen.
Der Schlüssel ist Flexibilität. Werkzeuge sollten Kreativität fördern statt einzuschränken, damit der Fokus auf dem bleibt, was zählt: ein wertvolles Ergebnis.
Die Evolution von Agentic Coding
Die Landschaft hat sich seit meinen ersten Experimenten dramatisch weiterentwickelt. Heute nutze ich hauptsächlich Windsurf, dessen diff- und flow-basierter Ansatz sich gegenüber Cursor als überlegen erwiesen hat. Ein wichtiges Unterscheidungsmerkmal war Windsurfs DeepSeek-Integration, die Cursor fehlte. Diese Entwicklung spiegelt Neos Weg in The Matrix wider — von der Entdeckung der digitalen Welt bis zu ihrer Beherrschung. Ich greife hier bewusst meine Matrix-Analogie wieder auf, weil es sich tatsächlich genau so angefühlt hat.
Windsurf vs. Cursor
- Analyse: Cascade zeigt nachvollziehbar, was und wie es die vorhandene Codebasis untersucht
- Flow-basierter Workflow: Ermöglicht einen natürlicheren Entwicklungsfortschritt
- Diff-basierter Ansatz: Klarere Nachverfolgung von Änderungen und Iterationen
- Integration: Nahtlose Verbindung mit bestehenden Entwicklungswerkzeugen
- Performance: Effizienter Umgang mit komplexen Projekten
- DeepSeek-Integration: Überlegene Reasoning-Möglichkeiten direkt im Editor
Datenschutz in der Code-Matrix
Ein entscheidender Aspekt von Agentic Coding ist der Datenschutz: Wer mit gehosteten LLMs arbeitet, legt Daten auf den Servern des Anbieters ab — potenziell auch sensible Informationen. Die SOC-2-Type-II-Konformität von Codeium (Windsurf) adressiert genau das:
- Datenverschlüsselung: Alle Daten werden bei der Übertragung und im Ruhezustand verschlüsselt
- Zugriffskontrollen: Strenge Richtlinien regeln, wer auf Code zugreifen darf
- Regelmäßige Audits: Unabhängige Überprüfung der Sicherheitspraktiken
- Incident Response: Bewährte Prozesse für den Umgang mit möglichen Vorfällen
Das gibt Sicherheit bei der Arbeit an sensiblen Projekten. Trotzdem bleibt die Verantwortung am Ende selbst getragen: Auch verschlüsselte Daten werden in Drittländern verarbeitet — ein Widerspruch, der bei der Wahl der Werkzeuge bewusst mitbedacht werden sollte.
Die Zukunft der Zusammenarbeit zwischen Entwickler und KI
Meine Überzeugung: Agentic Coding wird zur neuen Realität der Softwareentwicklung — ähnlich wie die Matrix selbst. Wichtig bleibt dabei die Einordnung: Diese Werkzeuge sind Assistenten, kein Ersatz. Die menschliche Komponente — Kreativität, Problemlösung, Vision — bleibt die eigentliche rote Pille.
Praxis-Tipps für die Code-Matrix
- Mit klaren, spezifischen Zielen starten — auch bei Experimenten
- Ergebnisse und Prompts dokumentieren
- Vergleichende Tools nutzen, um die Leistung zu messen
- Mehrere Modelle kombinieren für die besten Ergebnisse
- Den Überblick behalten — menschliche Kontrolle ist Pflicht
- Hand anlegen statt überhypter Tutorials
- Die eigene Zeit tracken, um echte Produktivitätsgewinne zu messen
- Datenschutz und Compliance von Anfang an priorisieren
- Werkzeuge wählen, die zur eigenen Entwicklungsphilosophie passen
- Den Workflow kontinuierlich prüfen und anpassen
Die Matrix-Frage bleibt: Wie tief geht die Reise in den Kaninchenbau? Viele YouTuber präsentieren eine polierte, überhypte Perspektive, die den Umstieg mühelos aussehen lässt. Die Realität: Agentic Coding ist heute großartig — als ich anfing, war es echte Pionierarbeit. Inmitten des Hypes gab es aber schon damals einen Blick in die Zukunft. Mein Rat? Rein in die Kaninchenbau-Tiefen — aber die eigene Zeit dabei im Blick behalten.
Ein digitales Vorhaben, bei dem Erfahrung mit Agentic Coding oder ein zweites Paar Augen hilft? Dann lohnt ein Gespräch → ingmar@konnow.de · LinkedIn