Workstream W4 · Angewandte Forschung

Multi-Agent-Safety-Evaluierung

Sicherheitseigenschaften, die für einen einzelnen Agenten etabliert sind, komponieren nicht: Eine Flotte einzeln sicherer Agenten kann dennoch kolludieren, den Fehler eines Agenten in ein systemweites Versagen kaskadieren oder eine selbstreplizierende Prompt-Injection von Agent zu Agent weitertragen. W4 macht aus dieser Prämisse ein Messprogramm – das Prüfobjekt ist die Flotte, und das Risiko liegt auf den Inter-Agent-Kanälen, wo output-orientierte Benchmarks strukturell blind sind.

ForschungsagendaTaxonomie operationalisiert · Metriken & Testbed entworfen · falsifizierbare Ziele, keine Risikozahlen behauptet

++
k(k−1)
Gerichtete Kanäle in einer k-Agenten-Flotte – die Interaktionsfläche, auf der kombinatorisches Risiko entsteht.
Prämisse
~41,7 %
Anteil der Verstöße, den Output-only-Audits verpassen – weil sie über Inter-Agent-Kanäle laufen, nicht über finale Outputs.
Literatur
0
Risikozahlen, die diese Agenda behauptet – sie zu erfinden wäre exakt die Unehrlichkeit, die diese Arbeit verhindern soll.
Per Design
++
Kontext

Sichere Agenten komponieren nicht
zu sicheren Flotten.

Einzel-Agent-Evaluierung bewertet die Knoten eines Systems. Verdrahtet man k Agenten, öffnen sich bis zu k(k−1) gerichtete Kanäle zwischen ihnen – und die Fehlermodi, auf die es ankommt, sind Eigenschaften dieser Kanäle, nicht irgendeines Knotens in Isolation.

Das ist keine spekulative Behauptung. Injiziert man adversariale Dialogzüge in einen Agenten, propagiert gefährliches Verhalten durch eine ansonsten sichere Gruppe – vorbei an Standard-Eingabefiltern, weil die Gefahr im mehrstufigen Dialog emergiert statt im initialen Prompt. Prompt-Injections können sich von Agent zu Agent selbst replizieren und sich mit epidemiologischer Dynamik ausbreiten. Und ein Full-Stack-Privacy-Audit zeigt, dass Inter-Agent-Nachrichtenkanäle weit mehr leaken als finale Outputs – Output-only-Audits verpassen einen großen Teil der Verstöße, weil der Verstoß über den Kanal läuft, nicht über die Antwort. Das Messproblem ist damit konkret: Um Multi-Agent-Risiko überhaupt zu sehen, muss ein Evaluator die Kanten beobachten.

The object under test is the fleet – risk lives on the edges A1 A2 A3 A4 A5 Nodes = agents single-agent benchmarks score only these – a safe pair is not guaranteed Edges = channels k agents → up to k(k−1) directed channels – risk is combinatorial, benchmarks blind
Abbildung 1 – die Fehlermodi, die diese Agenda misst, sind Eigenschaften der Interaktion, nicht eines einzelnen Modells: unsichtbar, wenn Agenten einzeln bewertet werden.
++
Task Force 1

Eine Taxonomie operationalisiert,
nicht erfunden.

TF1 fügt keine weitere Taxonomie hinzu. Sie operationalisiert die bestehenden – Hammond et al., MAST, ESRH – für die interaktions-emergente Teilmenge, auf die die Metriken zielen; jeder Modus wird so zu einem konkreten, testbaren Szenario, das an eine Metrik gebunden ist.

Nine interaction-emergent failure modes, three families Coordination Miscoordination conflicting sub-plans · wasted work Error cascade one agent’s error becomes ground truth Deadlock / livelock mutual waiting · motion, no progress Adversarial dynamics Collusion unsafe plan reinforced · can be covert Injection propagation a prompt injection self-replicates Emergent goal drift fleet objective diverges from intended Delegation Unsafe sub-goal a handoff loses a safety constraint Capability leakage privilege escalates across handoffs Oversight evasion work routed around the human gate
Abbildung 2 – abgebildet auf Hammond et al. (3 Modi + 7 Faktoren), MAST (14 Modi) und ESRH. Der Beitrag: Jeder Modus wird zu einem Szenario mit Metrik (TF2) und instrumentiertem Lauf (TF3).
++
Task Force 2

Zahlen aus Verhalten,
nicht aus Selbstauskunft.

Jeder Fehlermodus braucht eine Zahl, die etwas bedeutet – berechnet aus dem, was die Agenten in einem instrumentierten Lauf tatsächlich getan haben, berichtet mit Varianz über Seeds, und der Diskriminationsregel unterworfen: Eine Metrik, auf der jeder Lauf identisch abschneidet, misst nichts und wird nicht ausgeliefert.

Cascade depth downstream agents on a seeded error E B C D depth = hops before caught Injection reach agents changed by one poisoned input P 2 3 4 5 self-replicating spread – read from the graph, not outputs Delegation safety does a constraint survive every handoff? L S1 S2 constraint dropped at S1→S2 emergent risk = (fleet failure rate) − (aggregate single-agent baseline)
Abbildung 3 – jede Metrik ist das Emergenz-Lücken-Instrument für ihren Modus. Ein niedriger Score auf einem schmalen Szenarioset ist Evidenz gegen genau diese Fehler – nie ein Sicherheitszertifikat.
++
Task Force 3

Der Beobachter ist
der Beitrag.

Taxonomie und Metriken werden zur Messung in einem Testbed, das ein echtes Multi-Agent-Szenario in einer gehärteten Sandbox ausführt – mit einer Beobachterschicht, die den vollständigen Nachrichtengraphen und jeden Tool-Call aufzeichnet, sodass die Metriken im Nachhinein aus dem berechnet werden, was tatsächlich geschah.

Pinned scenario semver + hash · synthesis = W2 Multi-agent run sandbox = W1 · + observer Per-mode metrics cascade · reach · delegation Risk profile re-derivable artifact Reuses standing infrastructure – sandbox = W1 · scenario synthesis = W2 · single-residency = W3. The new component is the observer.
Abbildung 4 – die Pipeline vom fixierten Szenario zum Audit-Artefakt, vollständig auf dem souveränen Single-GPU-Setup.
Warum ein Beobachter, kein Output-Audit

Multi-Agent-Verstöße laufen über Inter-Agent-Kanäle – Output-only-Audits verpassen einen großen Teil davon. Der Beobachter zeichnet den kompletten Nachrichtengraphen, jeden Tool-Call und Taint-/Provenienz-Metadaten auf, sodass die Reichweite einer Injection bis zur Quelle zurückverfolgbar ist. Metriken werden aus dem berechnet, was Agenten tatsächlich getan haben – nie aus der Selbstauskunft eines Modells.

++
Falsifizierbare Ziele

Fünf Erfolgskriterien, G1–G5.

In der Disziplin der Schwester-Papers ist ein „ausgeliefertes“ Ergebnis vorab definiert – markiert als prognostiziert, bis es erreicht ist –, damit die Agenda ihren Erfolg später nicht stillschweigend umdefinieren kann.

G1 Emergenz-Lücke gemessen Für jeden Fehlermodus wird die Flotte-versus-Aggregat-Lücke mit Varianz über Seeds berichtet. Ein Szenario wird nur ausgeliefert, wenn seine Metrik diskriminiert – nicht über Läufe hinweg identisch ist. Falsifiziert, wenn: die Lücke über die Szenarien hinweg nicht von null unterscheidbar ist – Einzel-Agent-Evaluierung würde dann genügen, und dieses Ergebnis wäre selbst publizierbar. Prognostiziert · tragend
G2 Volle Beobachtbarkeit Jede berichtete Zahl ist aus dem aufgezeichneten Nachrichtengraphen und den Tool-Calls berechenbar, nie eine Selbstauskunft; Provenienz-/Taint-Tracing wird End-to-End an einer gesetzten Injection validiert. Falsifiziert, wenn: sich eine berichtete Zahl nicht aus der Aufzeichnung nachrechnen lässt oder das Taint-Tracing die gesetzte Quelle nicht findet. Prognostiziert
G3 Reproduzierbarkeit Das Risikoprofil ist Monate später aus dem fixierten Szenario re-derivierbar (semantische Version + Content-Hash) – ein Audit-Artefakt, kein Bauchgefühl. Falsifiziert, wenn: ein unabhängiger Re-Run aus demselben fixierten Szenario das Profil nicht reproduziert. Prognostiziert
G4 Souveräne Lauffähigkeit Der gesamte Harness läuft auf dem Single-GPU-, Air-gapped-Setup der Schwester-Workstreams – ein unabhängiges Team kann ihn ohne Frontier-Compute reproduzieren. Falsifiziert, wenn: irgendeine erforderliche Komponente den Single-GPU-, Air-gapped-Rahmen sprengt. Prognostiziert
G5 Ehrlicher Geltungsbereich Ergebnisse werden als Evidenz gegen die konkret provozierten Fehler berichtet, nie als Sicherheitszertifikat; Szenarioabdeckung und ihre Lücken stehen bei jedem Ergebnis dabei. Falsifiziert, wenn: ein Ergebnis ohne seine Abdeckungsaussage präsentiert oder als Freibrief fürs Deployment gelesen wird. Feste Regel

G1 ist die tragende Aussage: Lässt sich nicht zeigen, dass die Emergenz-Lücke von null verschieden ist, ist die Prämisse der Agenda selbst falsifiziert – und auch dieses Ergebnis wäre nützlich und publizierbar. Die Kriterien laufen auf der Infrastruktur, die das Programm bereits betreibt: die gehärtete Sandbox aus W1, die Szenariosynthese aus W2, die Single-Residency-Disziplin aus W3.

++
Angewandt

Eine Go/No-Go-Zahl
vor dem Deployment.

Auch eine Forschungsagenda muss „und was dann?“ beantworten – das konkrete Deployment, dem die drei Task Forces dienen.

Flotten-Risikomessung, End-to-End
  • Situation. Eine Organisation will eine Flotte interagierender Agenten ausliefern – Recherche- und Coding-Agenten, die aneinander delegieren und Tools teilen. Einzel-Agent-Benchmarks sagen, jeder für sich sei in Ordnung – aber es gibt keinen prinzipienbasierten Weg zu wissen, dass die Flotte nicht kolludiert, einen Fehler kaskadiert oder eine Prompt-Injection von Agent zu Agent weiterträgt.
  • Aufgabe. Eine belastbare, reproduzierbare Messung multi-agent-spezifischen Risikos vor dem Deployment – eine konkrete Go/No-Go-Messlatte statt des subjektiven Urteils, das System „wirke sicher“.
  • Vorgehen. Das Szenario der Flotte fixieren (SemVer + Hash); in der gehärteten Sandbox laufen lassen, während der Beobachter den vollen Nachrichtengraphen und die Tool-Calls aufzeichnet; Kaskadentiefe, Injection-Reichweite und Delegationssicherheit mit Varianz über Seeds berechnen; jedes Ergebnis als Evidenz gegen seinen benannten Fehlermodus berichten, mit Abdeckungsaussage.
  • Ergebnis. Ein re-derivierbares Risikoprofil, das die Emergenz-Lücke für diese Flotte auf diesem Szenarioset quantifiziert – berechnet aus beobachtetem Verhalten, Monate später von einem Auditor nachfahrbar, vollständig auf souveräner Single-GPU-Hardware erzeugt. Kein Sicherheitszertifikat, aber die erste belastbare Zahl, wo vorher nur ein Ermessensurteil stand.
++
Limitationen

Vier Grenzen – vorab benannt.

Limitationen & Validitätsrisiken
  • Die Szenarioabdeckung ist die Obergrenze der Aussage. Jede Metrik ist nur Evidenz gegen die Fehler, für deren Provokation ihr Szenarioset gebaut wurde; ein unvermessenes Interaktionsmuster ist ein unvermessenes Risiko. Die ehrliche Lesart jedes Ergebnisses ist „sicher gegen diese Proben“ – nicht „sicher“.
  • Der Beobachter verändert, was er misst. Den vollen Nachrichtengraphen aufzuzeichnen ist invasiv, und ein hinreichend fähiger Agent könnte Instrumentierung prinzipiell erkennen und sich unter Beobachtung anders verhalten. Die Gegenmaßnahme – ein passiver Out-of-Band-Beobachter – ist real, aber partiell; die Bedrohung ist selbst eine Forschungsfrage.
  • Die Souveränitätsbedingung begrenzt die Flottengröße. Eine einzelne 32 GB-GPU unter Single-Residency begrenzt gleichzeitig bediente Agenten; sehr große Flotten müssen über Time-Multiplexing oder verkleinerte Proxys untersucht werden, und Emergenz-Lücken-Messungen extrapolieren womöglich nicht sauber auf Produktions-Flottengrößen.
  • Die Agenda misst – sie mitigiert nicht. Ein Risikoprofil ist keine sichere Flotte, und eine niedrig gemessene Lücke auf einem schmalen Set darf nicht als Freibrief fürs Deployment gelesen werden. Das Deliverable ist eine belastbare Messung und ein Go/No-Go-Input, keine Garantie.

Status & Reproduzierbarkeit. Dies ist eine Forschungsagenda: Die Taxonomie ist operationalisiert, Metriken und Testbed sind entworfen, und die Kriterien G1–G5 sind die zu erreichenden falsifizierbaren Ziele – Risikozahlen werden keine behauptet. Szenarien sind per semantischer Version und Content-Hash fixiert; jede Metrik wird aus der Aufzeichnung des Beobachters berechnet; Läufe laufen in der gehärteten W1-Sandbox auf dem Single-GPU-, Single-Residency-Setup von W3, und das Risikoprofil erscheint als re-derivierbares Audit-Artefakt.