Workstream W5 · Angewandte Forschung

Souveräner persönlicher KI-Assistent

Cloud-Assistenten sind poliert, legen aber jeden Prompt, jede Antwort und den Verlauf auf fremde Server; lokale Assistenten halten Daten auf eigener Hardware, waren aber an den Desktop gefesselt. W5 schließt die Lücke: der Komfort einer modernen Chat-App – Verlauf, Projekte, Artefakte, Tools – erreichbar vom Telefon, während das Modell und jede Konversation auf Hardware bleiben, die der Eigentümer kontrolliert.

Design- & BauplanConsumer-Stufe heute baubar · Enterprise ein Hardware-Schritt, kein Rewrite · Aussagen als Abnahmekriterien formuliert

++
0 Bytes
Content-Egress im Normalbetrieb – kein Prompt, keine Antwort, kein Verlauf verlässt die eigene Hardware. C1 macht aus diesem Versprechen einen Packet-Capture-Test.
C1 · prognostiziert
~13–24 GB
Echte Modelle, die mit Reserve auf die Consumer-Karte passen – gpt-oss-20b, Gemma4-31B, Qwen3.6-35B-A3B auf einer 32 GB-GPU.
Checkpoint-Größen
+1 Karte
Der Consumer→Enterprise-Schritt: Hardware für Compute plus eine Governance-Schicht für Isolation – kein Rewrite.
Per Design
++
Kontext

Cloud-Komfort. Lokale Hoheit.
Beides zugleich.

Bewusst zuerst ein Consumer-Produkt – keine Evaluierungs-Infrastruktur, keine Operator-Workstation. Das Design, das zu Hause funktioniert, ist dasselbe, das zum Team skaliert; Compute ist eine Hardware-Variable, Governance eine Software-Schicht.

Zwei Kräfte machen 2026 zum richtigen Zeitpunkt. Die erste ist Privatsphäre per Konstruktion: Die einzige Architektur, die eine echte „Daten verlassen das Gerät nie“-Garantie geben kann, ist eine, in der Inferenz und Speicherung beide lokal sind – eine Eigenschaft, die Cloud-Anbieter nicht bieten können. Die zweite ist Ökonomie: Steht die Hardware einmal, läuft selbst gehostete Inferenz zu Grenzkosten, die vom Strom dominiert werden – und bei anhaltender Nutzung unterschreitet sie die kommerziellen API-Ausgaben. Souveränität ist kein Tausch von Komfort oder Geld gegen Privatsphäre mehr – zunehmend ist sie günstiger und privater zugleich, vorausgesetzt, das Modell passt auf die Karte.

++
Architektur

Eigene Hardware erreichen.
Keine Ports öffnen.

Der Host stellt ein Open-Weight-Modell hinter einem OpenAI-kompatiblen Endpoint; das Telefon ist ein Thin Client; verbunden werden beide durch ein Ende-zu-Ende-verschlüsseltes Mesh, das nichts ins öffentliche Internet exponiert.

vendor backend · device-discovery only Phone Thin client Locally · iPhone / iPad history on device Home host RTX 5090 · 32 GB LM Studio · open weights localhost:1234 LM Link · end-to-end encrypted Tailscale mesh (WireGuard) no open ports · nothing exposed agentic tools – Codex · Claude Code · OpenCode → same :1234 endpoint
Abbildung 1 – Inferenz auf dem Host, Verlauf auf den Geräten; das Einzige, was ein Vendor-Backend erreicht, ist die Device-Discovery-Liste zum Pairing der Maschinen.

Das bildet direkt auf ein ausgeliefertes Consumer-Produkt ab: LM Studios Locally (First-Party-iPhone/iPad-Client) mit LM Link (dem verschlüsselten Transport) – getrennte Schichten, und die Sicherheitseigenschaft ist der Punkt. Ehrliche aktuelle Grenzen dieses First-Party-Pfads: nur iPhone/iPad, beide Enden laufen mit derselben App, Account-gebundenes Pairing, kürzerer Default-Kontext am Telefon. Das sind Komfortschicht-Beschränkungen, keine architektonischen – Open-Source-Alternativen (Off Grid, 3sparks, Open-WebUI) lockern mehrere davon.

Die Invariante ist die Architektur, nicht die App

Leistungsfähige eigene Hardware erreichen, von überall, über einen verschlüsselten Tunnel, den niemand sonst lesen kann. Weil der Host einen gewöhnlichen OpenAI-kompatiblen Endpoint bereitstellt, funktioniert jedes Tool, das auf ihn zielt, weiter – lokal wie remote, ohne Rekonfiguration.

++
Hardware-Envelope

Souveränität ist nur real,
wenn das Modell passt.

Footprints, exakt nach den ausgelieferten Gewichten – und eine ehrliche Linie zwischen dem, was die Consumer-Karte mit Reserve betreibt, und dem, was die Enterprise-Stufe hinzufügt.

Checkpoint footprints vs. the consumer boundary 32 GB · consumer 64–80 GB · enterprise gpt-oss-20b ~13 GB · MXFP4 · daily driver Gemma4-31B ~19 GB · dense reasoning Qwen3.6-35B-A3B ~24 GB · MoE ~3B active gpt-oss-120b ~60 GB · enterprise On 32 GB the 120B offloads ~half its weights to system RAM and hits the bandwidth cliff – ~1.8 TB/s GDDR7 vs. tens of GB/s DDR5.
Abbildung 2 – „passt in den VRAM“ ist die bindende Beschränkung, nicht die rohe Modellgröße. MoE spart Compute pro Token, nicht residenten Speicher: Alle Experten bleiben geladen.

Ein Qualitätsvorbehalt, konsistent mit der Evaluierungsarbeit: 4-Bit-Formate halten sich auf den meisten Aufgaben innerhalb von grob 2–4 Prozentpunkten, verlieren aber am ehesten bei komplexem mehrschrittigem Reasoning – die Wahl des Quants ist also eine Qualitätsentscheidung, nicht nur eine Speicherfrage. Dieser Vorbehalt wird als Abnahmekriterium C5 testbar gemacht.

++
Der Stack

Ein Endpoint entkoppelt
alles.

Weil der Server OpenAI-kompatibel ist, ist der Assistent modellagnostisch und tool-kompatibel – und alles oberhalb der API überlebt den Schritt von einem Nutzer zu vielen.

Remote layer encrypted mesh · phone ↔ host UX layer chat history · projects · artifacts · tools OpenAI-compatible API localhost:1234 – one endpoint Model backend Ollama / vLLM / LM Studio · any open-weight model Existing agentic tools Codex · Claude Code · OpenCode → same :1234 · no reconfiguration
Abbildung 3 – der Tausch des Backends gegen eine Continuous-Batching-Engine (vLLM) macht aus einem Nutzer viele, für den Durchsatz. Multi-Tenancy – wer was sehen darf – ist ein eigenes Thema: entworfen statt angenommen.
++
Abnahmekriterien

Fünf Kriterien, C1–C5.

Ein Design- & Bauplan, kein vermessenes Deployment – die zentralen Aussagen sind deshalb als falsifizierbare Abnahmekriterien formuliert, jede mit Instrument und Schwelle, markiert als prognostiziert, bis sie gemessen ist. Mit [vorgeschlagen] markierte Schwellen sind Defaults zur Bestätigung.

C1 Der Content-Egress ist null Instrument: Packet Capture an der Host-NIC und am Netzwerk-Gateway während einer definierten Session (Chat, Tool-Nutzung, Dokument-Anhang), Traffic klassifiziert nach Ziel und Payload. Bestanden: Der einzige Traffic, der das eigene Netz verlässt, sind Device-Discovery-/Mesh-Koordinations-Metadaten. Falsifiziert, wenn: irgendein content-tragender Egress – Prompt-, Antwort- oder Verlaufs-Bytes – ein fremdes Ziel erreicht. Prognostiziert · definierende Aussage
C2 Nutzbare Latenz über das Mesh Metrik: Time-to-First-Token und dauerhaft gehaltene Tokens/s, lokale Baseline versus Mesh über Heim-WLAN, Mobilfunk und einen CGNAT-/Hotel-WLAN-Pfad. Bestanden [vorgeschlagen]: TTFT ≤ 2 s, ≥ 15 tok/s bei 8k Kontext, Mesh-Overhead ≤ 20 % gegenüber lokal. Falsifiziert, wenn: der Durchsatz auf irgendeinem getesteten Netz unter Lesegeschwindigkeit fällt oder TTFT die Schwelle überschreitet. Prognostiziert
C3 Eine Architektur, Compute skaliert nur über Hardware Instrument: identischer Client und Endpoint gegen einen 32 GB-Single-User-Host und einen 64–80 GB-Multi-User-Host, plus eine Concurrency-Kurve (tok/s pro Nutzer unter Continuous Batching). Bestanden: keine Client- oder Endpoint-Änderung, Durchsatz pro Nutzer über der C2-Untergrenze bis zur angestrebten Seat-Zahl. Falsifiziert, wenn: für den Stufenwechsel irgendeine Code- oder Endpoint-Änderung nötig ist – oder der Durchsatz pro Nutzer bei Ziel-Concurrency kollabiert. Prognostiziert
C4 Break-even gegen die Cloud Metrik: Total Cost of Ownership (Hardware-Abschreibung + Strom) versus äquivalente Cloud-Token-Ausgaben bei der gemessenen Nutzung des Eigentümers, mit explizitem Crossover-Monat – die eigenen Zahlen, keine generische Studie. Falsifiziert, wenn: innerhalb der Nutzungsdauer der Hardware bei realistischer Nutzung kein Crossover eintritt. Prognostiziert
C5 Urteilsqualität unter Quantisierung Instrument: das MXFP4-Assistenzmodell gegen eine Vollgewichts- oder Cloud-Referenz auf einem kleinen, fixierten Aufgabenset bewerten – mit dem Frozen-Rubric-Judge aus W1; der Kreis zwischen den beiden Workstreams schließt sich. Bestanden [vorgeschlagen]: innerhalb ≤ 3 pp der Referenz auf dem Set. Falsifiziert, wenn: die Degradation die Marge überschreitet, besonders auf reasoning-lastigen Aufgaben. Prognostiziert

Nichts davon verlangt Frontier-Compute; alles ist auf dem Consumer-Build lauffähig – mit einem Router, einem Laptop und der Evaluierungs-Pipeline, die das Programm bereits enthält. Genau das ist der Punkt: Insbesondere C1 verwandelt das Kernversprechen des Papers aus einer Behauptung in einen Test.

++
Bedrohungsmodell

„Souverän“ als präzise Aussage,
kein Slogan.

Im Normalbetrieb läuft die Inferenz auf dem eigenen Host, der Verlauf bleibt auf eigenen Geräten, und das Mesh öffnet keine eingehenden Ports. Die Garantie ist begrenzt – und ihre ehrliche Formulierung zählt auf, was sie abdeckt und was nicht.

Die Souveränitätsgrenze – fünf Vektoren
  • Kompromittierter Host. Ist der Host kompromittiert, liegen lokale Inferenz und Verlauf offen. Souveränität verteidigt gegen Third-Party-Cloud-Exposition, nicht gegen Endpoint-Kompromittierung. Gegenmaßnahme: Host-Härtung, Full-Disk-Encryption, die Hardened-Sandbox-Disziplin des Evaluierungs-Stacks für nicht vertrauenswürdige Tool-Ausführung.
  • Kompromittierter oder bösartiger Client. Das Telefon hält den Chat-Verlauf; eine bösartige App oder ein gestohlenes, entsperrtes Gerät legt ihn offen. Gegenmaßnahme: Geräteverschlüsselung, vertrauenswürdige Quellen, biometrische Sperre, minimale On-Device-Retention.
  • Device-Discovery / Account-Vertrauen. Das Pairing wird über das Account-System des Anbieters vermittelt – der einzige verbleibende Third-Party-Berührungspunkt. Was das eigene Netz verlässt, ist die Geräteliste, nicht die Konversation. Gegenmaßnahme: starke Authentifizierung mit 2FA oder Self-Hosting der Koordinationsebene.
  • Backend / Supply Chain. Backend, Gewichte und Mesh-Client sind Drittsoftware; eine vergiftete Gewichtsdatei ist ein echter Vektor. Gegenmaßnahme: fixierte Versionen, Checksummen-/Signaturprüfung, Präferenz für auditierbare Open-Source-Komponenten.
  • On-Path-Netzwerkangreifer. Ein feindseliges Netz (Hotel-WLAN, CGNAT) sieht nur Ciphertext – der Fall, den die Architektur am besten beherrscht.

Die belastbare Aussage ist damit präzise: Inhalte verlassen die eigene Hardware im Normalbetrieb nie – begrenzt durch Host- und Client-Integrität und die kleine Device-Discovery-Abhängigkeit – nicht: „es ist nie Drittsoftware beteiligt“. C1 verifiziert die Content-Egress-Hälfte dieser Aussage empirisch.

++
Enterprise-Pfad

Compute skaliert per Hardware.
Governance wird gebaut.

„Derselbe Stack bedient das Team“ ist wahr für Compute und irreführend für Governance. Continuous Batching lässt ein geteiltes Modell viele Nutzer bedienen, und lokales Hosting erfüllt Datenresidenz per Konstruktion – aber eine Governance-Schicht muss oberhalb der API gebaut werden.

Owned hardware – data residency by construction (DSGVO / GDPR) User A User B User C Auth gateway the new layer ▸ per-user API keys ▸ RBAC · revocation ▸ audit logging ▸ per-tenant routing Serving engine – vLLM continuous batching · shared 120B-class model (64–80 GB) Per-tenant storage history · projects · documents – partitioned & access-controlled
Abbildung 4 – Client und Endpoint bleiben unverändert (C3), aber Multi-Tenant-Governance ist nicht nichts: Es ist exakt die Secure-by-Design-Fläche, die CTC Advisory für den DACH-Mittelstand adressiert.
++
Angewandt

Vom einzelnen Schreibtisch
zum ganzen Team.

Das konkrete Deployment, dem das Design dient – und der Status, den es ehrlich trägt.

Souveräner Assistent, End-to-End
  • Situation. Ein datenschutzbewusster Profi – und später die eigene kleine Firma – will einen leistungsfähigen Assistenten mit dem Komfort einer modernen Chat-Oberfläche inklusive Telefon-Zugriff; vertrauliches Material darf aber nicht in eine Third-Party-Cloud, und desktop-gebundene lokale Setups sind unterwegs nutzlos.
  • Aufgabe. Einen souveränen Assistenten aufsetzen, der im Alltag wirklich nutzbar ist, vom Telefon aus überall erreichbar, mit einem Modell, das tatsächlich auf die Hardware passt – und mit einem sauberen Pfad zum Team, der keinen Neubau des Kerns verlangt.
  • Vorgehen. Ein 32 GB-taugliches Modell über den OpenAI-kompatiblen Endpoint auf der heimischen RTX 5090 bereitstellen; in eine polierte Chat-UX einbetten; vom Telefon über das verschlüsselte Mesh erreichen – keine offenen Ports, Inferenz und Verlauf auf eigener Hardware.
  • Ergebnis. Ein persönlicher Assistent, genutzt vom Telefon, bei dem nichts die Kontrolle des Eigentümers verlässt – verifiziert durch C1 – und ein dokumentierter Enterprise-Pfad: Hardware für Compute und die Governance-Schicht für Isolation ergänzen, und derselbe Client und Endpoint bedienen das ganze Team mit einem Modell der 120B-Klasse – weiterhin ohne öffentliche Exposition.

Status. Heute baubar auf der Consumer-Stufe mit echten, passenden Modellen; die Enterprise-Stufe ist ein Hardware-Schritt für Compute und ein definierter Software-Schritt für Governance, keine Re-Architektur. Die Kerneigenschaft gilt auf jeder Skala – Inferenz und Verlauf bleiben auf eigener Hardware – und die Abnahmekriterien machen sie testbar statt bloß behauptet.