Die Forschung hinter der Architektur.
MadeForPrivacy ist aus der Praxis entstanden – aber die Prinzipien dahinter sind kein Bauchgefühl. Hier steht, welche Untersuchungen erklären, woran KI im Unternehmen wirtschaftlich scheitert, welche Arbeiten die Architektur begründen und welcher Mechanismus in MFP darauf aufbaut.
Wie diese Seite zu lesen ist. Die genannten Arbeiten untersuchen allgemeine Verfahren mit eigenen Modellen und Benchmarks. Ihre Ergebnisse sind die der jeweiligen Studie oder Befragung – keine gemessenen Kennzahlen von MadeForPrivacy und keine Zusage über Einsparungen oder Umsätze. Wir nennen sie, weil sie erklären, warum die Architektur so gebaut ist. Wo MFP ein Prinzip nur teilweise oder anders umsetzt, steht das dabei.
Wirtschaftlicher Nutzen
Viele setzen KI ein, wenige sehen einen Ertrag – und die Gründe sind bekannt.
Drei große Untersuchungen kommen zu einem ähnlichen Befund: KI ist in den Unternehmen angekommen, ein messbarer wirtschaftlicher Effekt bei den meisten noch nicht. Die Ursachen liegen selten im Modell, sondern in Integration, Prozessen, Betrieb – und darin, dass kaum jemand weiß, was ein Vorgang mit KI kostet und was er einspart. Die Zahlen beschreiben den Markt, sie sind keine Prognose für MadeForPrivacy.
The GenAI Divide: State of AI in Business 2025
Challapally, Pease, Raskar, Chari · MIT NANDA, Juli 2025 · vorläufiger Bericht, nicht begutachtet
Grundlage sind über 300 öffentlich dokumentierte KI-Initiativen, Interviews mit 52 Organisationen und eine Befragung von 153 Führungskräften (Januar bis Juni 2025). Die Autoren berichten, dass 95 % der untersuchten Organisationen aus ihren GenAI-Initiativen bislang keinen messbaren finanziellen Ertrag erzielen – betrachtet rund sechs Monate nach dem Pilot. Das ist kein technisches Scheitern: Viele Werkzeuge laufen, verändern aber nichts, was sich in der Ergebnisrechnung zeigt. Als Hauptursache nennen sie eine Lernlücke – Systeme, die sich nicht in bestehende Abläufe einfügen, keinen Kontext behalten und nicht besser werden. Erfolgreiche Unternehmen verlangen prozessspezifische Anpassung und messen an Geschäftsergebnissen statt an Benchmarks; die deutlichsten Erträge sehen die Autoren im Backoffice. Einordnung: Der Bericht ist vorläufig, nach eigener Angabe nicht repräsentativ und betrachtet einen kurzen Zeitraum. Die verbreitete Aussage „95 % aller KI-Projekte scheitern“ gibt er so nicht her; einzelne Quoten im Bericht beziehen sich auf andere Grundgesamtheiten.
- Ein Agent ist ein Prozess, kein Chatfenster. Rechnungseingang, Posteingang, Vertragsprüfung: Der Agent liest aus Postfach oder Ablage, und seine Tools schreiben das Ergebnis per API, SQL, Mail oder Microsoft 365 dorthin, wo der Prozess weiterläuft. Das ist die Einbindung in den Ablauf, die der Bericht bei den meisten Werkzeugen vermisst.
- Messbar statt gefühlt. Der Bericht bemängelt fehlenden messbaren Ertrag. MFP macht zumindest die Kostenseite exakt: Jeder Lauf steht mit Schritten, Tokens und Kosten auf den Cent im Tracker – pro Vorgang, pro Agent, im Zeitverlauf. Was ein bearbeiteter Beleg oder eine beantwortete Mail gekostet hat, ist eine Zahl, kein Gefühl. Den Vergleich mit den bisherigen Bearbeitungskosten stellt der Kunde an, MFP liefert die Zahlen dafür.
- Kontext aus dem Unternehmen. Knowledge liefert Wissen aus Ablagen und Handbüchern mit Quellenangabe, der Aktenkoffer trägt Ergebnisse von Schritt zu Schritt, Neva merkt sich pro Person, was wichtig ist. Ehrlich eingeordnet: Agenten lernen nicht selbstständig aus Rückmeldungen. Besser werden sie durch Anpassung von Prompts, Tools und Regeln – im Client, ohne Code, und mit dem Tracker als Beleg, ob die Änderung etwas gebracht hat.
- Backoffice zuerst. Die fertigen Module setzen genau dort an, wo der Bericht die klarsten Erträge sieht: Bestell- und Rechnungserfassung, Posteingang, Dokumentenprüfung – viele gleichartige Vorgänge, klare Regeln, messbarer Aufwand.
29th Global CEO Survey: Leading through uncertainty in the age of AI
PwC · 2026 · Befragung von 4.454 CEOs in 95 Ländern und Gebieten, September bis November 2025
56 % der befragten CEOs geben an, dass KI ihrem Unternehmen bislang weder niedrigere Kosten noch höhere Umsätze gebracht hat. 30 % berichten höhere Umsätze, 26 % niedrigere Kosten – nur 12 % beides. Laut PwC setzen sich Unternehmen ab, die KI auf soliden Grundlagen in die Breite gebracht haben. Die Studie liefert damit eine neuere und deutlich größere Datenbasis für die Frage, warum KI-Investitionen häufig noch keinen messbaren Vorteil bringen. Einordnung: Es sind Selbstauskünfte der CEOs, keine gemessenen Finanzkennzahlen.
- Die Kostenseite ist bei MFP von Anfang an klein. Der Betrieb ist ein wartungsarmer Docker-Stack auf eigener Infrastruktur oder in der eigenen Cloud, die Lizenz eine planbare Monatspauschale pro Server und Nutzer, Grundbetreuung inklusive Updates auf Wunsch dazu. Kein Projekt mit sechsstelligem Vorlauf, sondern ein Prozess nach dem anderen.
- KI-Kosten bleiben niedrig, weil die Pipeline den Ablauf steuert. Das Modell wird nur für den Schritt gerufen, der es braucht, bekommt nur den dafür nötigen Kontext, und einfache Schritte laufen auf kleinen oder lokalen Modellen. Token-Kosten fallen direkt beim KI-Anbieter an, ohne Aufschlag durch MFP. Viele Werkzeuge lassen dagegen ein großes Modell in Schleifen entscheiden – jeder Umweg kostet Tokens.
- Wenn 56 % keine Kostenvorteile sehen, fehlt meist die Rechnung. Bei MFP hat jeder Prozess seinen Preis: Kosten pro Lauf auf den Cent, summiert pro Agent und Monat. Damit lässt sich für jeden einzelnen Prozess sagen, was er kostet und ob er sich gegenüber der manuellen Bearbeitung rechnet – bevor er auf weitere Abteilungen ausgeweitet wird.
- Grundlagen für die Breite. Rechte über AD-Gruppen, Datenzonen pro Agent, Tool und KI-Dienst, neue Agenten im Client ohne Code: Der zweite und zehnte Prozess brauchen keine neue Infrastruktur. Das ist der Unterschied zwischen Pilot und Betrieb, den PwC bei den Vorreitern sieht. Auf die Umsatzseite wirkt MFP nur indirekt, über schnellere Antworten und kürzere Durchlaufzeiten – das behaupten wir nicht als Effekt, das misst der Kunde selbst.
Where’s the Value in AI?
Boston Consulting Group · Oktober 2024 · Befragung von 1.000 Führungskräften aus über 20 Branchen und 59 Ländern
74 % der Unternehmen haben laut BCG noch keine ausreichenden Fähigkeiten entwickelt, um KI in der Breite einzusetzen und greifbaren Nutzen zu erzielen; nur 26 % kommen über Proof-of-Concepts hinaus, 4 % gelten als Vorreiter. Die Hürden liegen nach BCG zu rund 70 % bei Menschen und Prozessen, zu 20 % bei der Technik und nur zu etwa 10 % bei den Algorithmen. Vorreiter setzen KI in Kernprozessen ein statt nur in unterstützenden Funktionen und konzentrieren sich auf weniger Anwendungsfälle, die sie dafür konsequent skalieren. Einordnung: Befragung von Führungskräften, keine Messung einzelner Projekte.
- Weniger Anwendungsfälle, dafür durchgängig. Ein Modul ist ein Kernprozess mit Einrichtung, Anbindung an ERP, Buchhaltung oder Ticketsystem und Betreuung – nicht ein weiterer Pilot neben drei anderen. Ausgeweitet wird, was im Tracker nachweislich läuft und sich rechnet.
- 70 % Menschen und Prozesse: Diese Arbeit nimmt keine Plattform ab. Datenflüsse, Zuständigkeiten und Freigaben klären wir vor dem ersten Agenten, ein fester Ansprechpartner begleitet Einführung und Betrieb. MFP macht diese Arbeit planbar: Der Ablauf steht als Pipeline in der Konfiguration, jede Freigabe ist ein eigener Schritt, jede Änderung im Tracker nachvollziehbar.
- 10 % Algorithmen: kein Modell-Wettrüsten. Modelle sind in MFP austauschbare Dienste pro Datenzone – Azure, lokale Modelle, andere Anbieter. Ein besseres oder günstigeres Modell wird pro Schritt eingetragen, der Prozess bleibt derselbe. Die Investition steckt im Prozess, nicht im Modell.
- Skalieren ohne neue Kosten pro Kopf im Betrieb. Derselbe Agent läuft für jede freigegebene Gruppe; was das im Monat kostet, steht pro Agent im Zeitverlauf. Kernprozess statt Nebenfunktion heißt bei MFP: Der Agent bearbeitet den Vorgang, er berät nicht nur dazu.
Pipelines statt Prompt
Komplexe Aufgaben in kleine, prüfbare Schritte zerlegen.
Ein MFP-Agent ist keine lange Anweisung an ein Modell, sondern eine Kette aus Werkzeugen: Dokument lesen, Felder extrahieren, prüfen, weitergeben. Dass diese Zerlegung besser funktioniert als ein einziger großer Prompt, ist in der Forschung mehrfach gezeigt worden.
Decomposed Prompting
Khot, Trivedi, Finlayson, Fu, Richardson, Clark, Sabharwal · ICLR 2023
Die Arbeit führt einen „Decomposer“ ein, der eine Aufgabe in Teilaufgaben zerlegt, die jeweils von spezialisierten Handlern gelöst werden – eigene Prompts, andere Modelle oder ganz normale Programmfunktionen. Weil jeder Handler für sich steht, lässt er sich einzeln verbessern, austauschen oder rekursiv wiederverwenden. Auf mehrstufigen Aufgaben (u. a. symbolische Manipulation, Multi-Hop-Fragen) schlug der Ansatz in der Studie das klassische Chain-of-Thought-Prompting deutlich.
- Jeder Agent ist eine Pipeline aus Tools (
document-processor,llm-extract,llm-classify,transformer,pdf-generator…), jeder Schritt mit eigenem Prompt, eigenem Modell und eigener Datenzone. - Deterministische Schritte (Regex, Filter, Datenbank, API) übernehmen, was kein Modell braucht – genau die „symbolischen Handler“ der Arbeit.
- Sub-Agenten über das
agent-Tool: ein Schritt kann einen anderen Agenten aufrufen und dessen Ergebnis weiterverarbeiten.
Least-to-Most Prompting
Zhou, Schärli, Hou, Wei, Scales, Wang, Schuurmans, Cui, Bousquet, Le, Chi · ICLR 2023
Schwere Probleme werden zuerst in einfachere Teilprobleme zerlegt und dann der Reihe nach gelöst, wobei jede Antwort in den nächsten Schritt einfließt. In der Studie generalisierten Modelle so von leichten Beispielen auf deutlich schwerere Aufgaben, bei denen Chain-of-Thought-Prompting scheiterte.
- Pipeline-Schritte bauen aufeinander auf: Der Aktenkoffer trägt die Ergebnisse jedes Schritts (als typisierte Items) in den nächsten.
- Reihenfolge und Abhängigkeiten sind konfiguriert, nicht dem Modell überlassen – dadurch reproduzierbar und im Tracker sichtbar.
Plan-and-Solve Prompting
Wang, Wei, Li, Zhang, Chen, Chen, Xu, Wang · ACL 2023
Statt sofort loszulegen, soll das Modell erst einen Plan aus Teilaufgaben aufstellen und diesen dann abarbeiten. Die Autoren zeigen, dass diese Trennung von Planung und Ausführung typische Fehler von Zero-Shot-Chain-of-Thought reduziert – vor allem ausgelassene Schritte und Rechen- bzw. Verständnisfehler.
- Bei MFP liegt der Plan in der Konfiguration: Was ein Agent tut, ist vorab als Schrittfolge festgelegt und dokumentiert – kein Modell muss ihn jedes Mal neu erfinden.
- Neva plant nur auf einer Ebene: Sie wählt den passenden Agenten für eine Aufgabe (
llm-classify), die Ausführung bleibt die feste Pipeline.
Toolformer: Language Models Can Teach Themselves to Use Tools
Schick, Dwivedi-Yu, Dessì, Raileanu, Lomeli, Hambro, Zettlemoyer, Cancedda, Scialom · NeurIPS 2023
Die Arbeit zeigt, dass Sprachmodelle lernen können, an den richtigen Stellen externe Werkzeuge aufzurufen – Taschenrechner, Suche, Kalender, Übersetzung – und deren Ergebnis in die Antwort einzubauen. Ein so trainiertes, vergleichsweise kleines Modell erreichte in der Studie bei Aufgaben, die Fakten oder Rechnen verlangen, die Leistung deutlich größerer Modelle. Kernaussage: Werkzeuge kompensieren, was ein Modell nicht sicher aus dem Gedächtnis kann.
- Werkzeuge sind in MFP erstklassige Bausteine: API-, SQL-, Datei-, Mail- und Knowledge-Tools liefern Fakten, das Modell formuliert oder klassifiziert – es soll nichts „wissen“, was ein Werkzeug nachschlagen kann.
- Anders als bei Toolformer wählt nicht das Modell, wann es ein Werkzeug ruft, sondern die Pipeline legt es fest. Der Effekt ist derselbe (Fakten aus Systemen statt aus dem Modell), der Ablauf bleibt deterministisch und nachvollziehbar.
Kontext gezielt
Nicht „alles in den Prompt“, sondern das Relevante.
Große Kontextfenster verleiten dazu, ganze Dokumente und Verläufe mitzuschicken. Das kostet nicht nur Tokens – es macht Antworten nachweislich schlechter.
Lost in the Middle: How Language Models Use Long Contexts
Liu, Lin, Hewitt, Paranjape, Bevilacqua, Petroni, Liang · Transactions of the ACL 2024
Die Autoren variieren systematisch, an welcher Stelle im Kontext die relevante Information steht. Ergebnis: Modelle nutzen Informationen am Anfang und am Ende zuverlässig, in der Mitte fällt die Genauigkeit deutlich ab – eine U-förmige Kurve, die auch bei Modellen mit ausdrücklich langen Kontextfenstern auftritt. Mehr Kontext ist also nicht automatisch besser; entscheidend ist, dass das Relevante überhaupt und möglichst prominent ankommt.
llm-extractliefert neben dem Ergebnis die IDs der genutzten Items zurück;item-filterreicht nur diese Items in den nächsten Schritt – der Prompt enthält, was der Schritt braucht, nicht den ganzen Aktenkoffer.- Knowledge liefert die Top-k Textstellen mit Quellenangabe statt ganzer Dokumente; der Gesprächsverlauf wird pro Agent auf eine feste Zahl Runden begrenzt.
- Sichtbar im Tracker: Tokens pro Schritt zeigen, was tatsächlich an das Modell ging.
Unternehmenswissen anbinden
Wissen aus deinen Dokumenten – ohne die Modelle zu verändern.
Firmenwissen gehört nicht ins Modell, sondern in eine durchsuchbare Ablage, aus der der passende Ausschnitt zur Anfrage geholt wird. Das ist wissenschaftlich gut untersucht – und der Grund, warum MFP kein Modell auf deinen Daten trainiert.
Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
Lewis, Perez, Piktus, Petroni, Karpukhin, Goyal, Küttler, Lewis, Yih, Rocktäschel, Riedel, Kiela · NeurIPS 2020
Die Arbeit kombiniert ein Sprachmodell mit einem Retriever über einer externen Dokumentsammlung: Zur Anfrage werden passende Passagen geholt und dem Modell mitgegeben. Die Antworten wurden in der Studie spezifischer und faktentreuer als bei rein parametrischem Wissen – und das Wissen lässt sich aktualisieren, indem man den Index austauscht statt das Modell neu zu trainieren.
- Knowledge in MFP ist genau dieses Muster: Ablagen, Handbücher und Postfächer werden in Datasets indexiert;
knowledge-retrievalholt zur Frage die passenden Stellen und gibt sie mit Quellenangabe in den Schritt. - Aktualisierung = neue Dokumente ingestieren (
knowledge-ingestion), kein Training, keine Modelländerung.
REPLUG: Retrieval-Augmented Black-Box Language Models
Shi, Min, Yasunaga, Seo, James, Lewis, Zettlemoyer, Yih · NAACL 2024
REPLUG behandelt das Sprachmodell als Blackbox: Der Retriever hängt die gefundenen Dokumente einfach vor die Eingabe, das Modell selbst bleibt unangetastet. Die Autoren zeigen, dass so auch große, nicht veränderbare Modelle von externem Wissen profitieren – und dass sich der Retriever mit Rückmeldung des Modells verbessern lässt, ohne dessen Gewichte anzufassen.
- MFP nutzt Modelle austauschbar als Blackbox – Azure, lokale Modelle, andere Anbieter – und setzt das Retrieval (RAGFlow) als eigenen Dienst davor. Derselbe Wissensbestand funktioniert mit jedem Modell in der jeweiligen Datenzone.
- Zugriff auf Datasets hängt an AD-Gruppen: Wer ein Dokument nicht lesen dürfte, bekommt es auch über die KI nicht.
Das passende Modell pro Schritt
Kleine Modelle für einfache Schritte, große nur wo sie Mehrwert liefern.
Nicht jeder Schritt braucht das stärkste Modell. Die Forschung zu Modellauswahl und Kaskaden zeigt, wie viel Kosten in undifferenzierten Aufrufen stecken – MFP setzt das Prinzip konfiguriert um, nicht als gelernten Router.
Hybrid LLM: Cost-Efficient and Quality-Aware Query Routing
Ding, Mazumder, Fu, Zhao, Zhu, Zeng, Rühle, Menache · ICLR 2024
Ein Router schätzt vorab, wie schwer eine Anfrage ist, und schickt einfache Anfragen an ein kleines, schwere an ein großes Modell. In den Experimenten der Autoren ließ sich so ein erheblicher Teil der Aufrufe an das große Modell einsparen, ohne dass die Antwortqualität messbar litt – die Grenze ist über einen Qualitätsparameter einstellbar.
- In MFP ist die Zuordnung pro Pipeline-Schritt konfiguriert: Jeder Schritt hat seine Liste erlaubter KI-Dienste (
ai_service_ids). Klassifizieren und Filtern laufen mit kleinen Modellen, komplexe Extraktion mit großen. - Innerhalb eines Schritts verteilt MFP nach Priorität und Lastverteilung auf gleichwertige Dienste. Einen gelernten Router nach Anfrageschwierigkeit gibt es nicht – die Entscheidung trifft der Betreiber, nachvollziehbar im Tracker.
FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance
Chen, Zaharia, Zou · Transactions on Machine Learning Research 2024 (arXiv 2023)
Die Arbeit systematisiert drei Hebel gegen LLM-Kosten: Prompts kürzen und bündeln, Antworten cachen bzw. kleinere Modelle einsetzen, und Kaskaden, bei denen erst ein günstiges Modell antwortet und nur bei geringer Zuverlässigkeit eskaliert wird. Auf ihren Benchmarks erreichten die Autoren mit solchen Kombinationen die Qualität des teuersten Modells bei einem Bruchteil der Kosten.
- MFP setzt die ersten beiden Hebel um: knappe, schrittspezifische Prompts mit nur den benötigten Items und kleinere Modelle für einfache Schritte. Kaskaden mit automatischer Eskalation gibt es nicht.
- Kosten sind kein Blindflug: Jeder Aufruf wird mit Tokens und den hinterlegten Sätzen erfasst (Kosten pro Lauf im Tracker), damit du siehst, welcher Schritt sich lohnt.
Prüfen statt vertrauen
Ein zweiter Schritt kontrolliert, was der erste geliefert hat.
Modelle machen Fehler – und sie finden eigene Fehler eher, wenn die Prüfung ein getrennter Schritt mit eigener Frage ist. Das ist der Grund, warum MFP Verifikation als eigenes Werkzeug hat.
Chain-of-Verification Reduces Hallucination in Large Language Models
Dhuliawala, Komeili, Xu, Raileanu, Li, Celikyilmaz, Weston · Findings of ACL 2024
Das Modell schreibt zuerst einen Entwurf, plant dann Prüffragen zu den enthaltenen Behauptungen, beantwortet diese unabhängig vom Entwurf und erstellt daraus die endgültige Antwort. Entscheidend ist die Trennung: Werden die Prüffragen ohne Blick auf den Entwurf beantwortet, übernimmt das Modell dessen Fehler seltener. In der Studie sank die Zahl erfundener Angaben in mehreren Aufgabentypen deutlich.
extraction-verificationist ein eigener, deterministischer Pipeline-Schritt: Jeder extrahierte Wert wird gegen den Text des Ausgangsdokuments abgeglichen (Fuzzy-Match) und bekommt eine Konfidenz – unabhängig von dem Modell, das extrahiert hat. Was im Dokument nicht steht, fällt auf.- Die Konfidenzen hängen als Werte an den Items; nachgelagerte Schritte (z. B.
item-filter) steuern unsichere Fälle zur manuellen Freigabe aus, statt sie durchzuwinken.
Self-Refine: Iterative Refinement with Self-Feedback
Madaan, Tandon, Gupta, Hallinan, Gao, Wiegreffe, Alon, Dziri, Prabhumoye, Yang, Gupta, Majumder, Hermann, Welleck, Yazdanbakhsh, Clark · NeurIPS 2023
Dasselbe Modell erzeugt eine Antwort, formuliert in einem zweiten Aufruf Kritik daran und überarbeitet sie in einem dritten – ohne Training, nur durch getrennte Rollen in getrennten Aufrufen. Über sieben Aufgaben hinweg bevorzugten Menschen und automatische Metriken die überarbeiteten Ergebnisse klar gegenüber dem ersten Wurf.
- Erzeugen und Bewerten sind in MFP verschiedene Schritte: Ein
llm-classify- oderllm-extract-Schritt kann das Ergebnis eines vorherigen Schritts mit eigenem Prompt beurteilen und überexecution_conditionsentscheiden, ob nachgearbeitet oder weitergereicht wird. - Iterationen sind Konfiguration, keine Endlosschleife: Wie oft nachgebessert wird, legt die Pipeline fest – jeder Durchlauf steht mit Tokens und Kosten im Tracker.
Warum Datenzonen und feste Werkzeuge
Die Risiken sind untersucht – die Architektur zieht die Konsequenzen.
Zwei Befunde der Sicherheitsforschung prägen MFP: Modelle geben Trainingsdaten preis, und Agenten mit Werkzeugen lassen sich über fremde Inhalte fernsteuern. Beides motiviert technische Schutzmaßnahmen – es ist kein Nachweis, dass MFP gegen diese Angriffe immun wäre.
Extracting Training Data from Large Language Models
Carlini, Tramèr, Wallace, Jagielski, Herbert-Voss, Lee, Roberts, Brown, Song, Erlingsson, Oprea, Raffel · USENIX Security 2021
Die Autoren extrahierten aus GPT-2 hunderte wörtlich memorierte Trainingssequenzen – darunter Namen, Adressen und Kontaktdaten realer Personen –, obwohl jede davon nur ein einziges Mal im Training vorkam. Größere Modelle waren anfälliger. Die Folgearbeit von Nasr et al. (ICLR 2025) zeigt, dass auch produktive, abgestimmte Chat-Modelle sich zur Ausgabe von Trainingsdaten bringen lassen.
- Deshalb trainiert MFP kein Modell auf deinen Daten – Wissen kommt per Retrieval (siehe oben), nicht ins Modell.
- Datenzonen legen technisch fest, welche Daten überhaupt an welchen Dienst gehen dürfen: Nur lokal · DSGVO-konform · Ungeschützt. Agent, Tool und KI-Dienst tragen eine Zone, MFP prüft bei jedem Schritt. In der Zone „DSGVO-konform“ stehen nur Dienste, die Eingaben nicht zum Training verwenden.
Not What You've Signed Up For: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection
Greshake, Abdelnabi, Mishra, Endres, Holz, Fritz · AISec @ CCS 2023
Die Arbeit beschreibt indirekte Prompt-Injection: Ein Angreifer versteckt Anweisungen in Daten, die das System später liest – Webseiten, E-Mails, Dokumente. Sobald ein LLM diese Inhalte verarbeitet, kann es zu Datenabfluss, Manipulation von Antworten oder unerwünschten Aktionen gebracht werden. InjecAgent (Zhan et al., Findings of ACL 2024) misst das für Agenten mit Werkzeugen: In dem Benchmark ließen sich selbst starke Modelle in einem relevanten Anteil der Fälle über manipulierte Werkzeugausgaben zu schädlichen Aktionen verleiten.
- MFP-Agenten wählen ihre Werkzeuge nicht selbst: Welche Tools ein Schritt nutzen darf, steht in der Pipeline. Eine Anweisung in einer eingehenden Mail kann keinen zusätzlichen Datenbank- oder API-Aufruf auslösen, weil es diesen Schritt nicht gibt.
- Externe Inhalte sind Daten im Aktenkoffer, keine Instruktionen: Sie werden als typisierte Items verarbeitet, Ausgaben gegen Schemas validiert, Aktionen mit Außenwirkung (Mail senden, API schreiben) sind eigene, freigabepflichtige Schritte.
- Rechte hängen an Gruppen und Zonen, nicht am Modell: Ein Agent kann nur erreichen, was seiner Gruppe und Zone erlaubt ist – jeder Lauf ist im Tracker nachvollziehbar.
Was hier bewusst fehlt
Was wir nicht behaupten.
Kein gelernter Router
Modelle werden pro Schritt vom Betreiber zugeordnet. Ansätze wie RouteLLM oder LLM-Kaskaden (FrugalGPT) sind Forschungsstand, nicht MFP-Funktion.
Keine freien Agentenschleifen
ReAct-artige Denken-Handeln-Schleifen, in denen das Modell Werkzeuge selbst auswählt, setzt MFP bewusst nicht ein – wegen Nachvollziehbarkeit und Angriffsfläche.
Kein Constrained Decoding
Strukturierte Ausgaben entstehen über Schema-Prompts und Validierung, nicht durch Eingriff in die Token-Erzeugung des Modells.
Kein Schutznachweis
Datenzonen und feste Werkzeuge sind Produktkontrollen. Sie ersetzen weder Datenschutzprüfung noch Sicherheitsaudit deiner Installation.
Keine Ertragsgarantie
MIT, PwC und BCG beschreiben, woran KI-Vorhaben wirtschaftlich scheitern. Wie viel ein Agent bei dir einspart, sagen diese Zahlen nicht – das zeigt erst dein Prozess im Tracker.
Kein selbstlernendes System
Agenten lernen nicht automatisch aus Rückmeldungen. Verbesserung ist Konfigurationsarbeit an Prompts, Tools und Regeln – nachvollziehbar statt schleichend.
Live-Demo
Lieber im Betrieb sehen als nachlesen?
In der Live-Demo zeigen wir dir Pipelines, Tracker und Datenzonen an deinem Anwendungsfall.