Projekte · Angewandte Forschung

Ausgewählte Arbeiten

Fünf selbst gebaute Systeme zur Evaluierung und zum Betrieb von Frontier- und agentischer KI auf souveräner Commodity-Hardware – jedes mit einer Deep-Dive-Seite und einem Working-Paper-Preprint. Zusammen bilden sie das Forschungsprogramm.

++
Evaluierungs-Infrastruktur · CTC AI Operations

Hybride Evaluierungs-Pipeline

Eine selbst gebaute Local-plus-Cloud-Pipeline zur Evaluierung von KI-Coding-, Agenten- und Data-Science-Systemen gegen eingefrorene, versionierte Rubrics – gebaut für VRAM-Effizienz auf einer einzelnen 32 GB-GPU, reduzierten Judge-Bias und rund 10× niedrigere Token-Kosten.

Zwei Modelle in 32 GBJudge ≠ geprüftes System≈95 % Ersparnis auf Wiederholungen
Gemessen32B + 7B ko-resident · 32 GBGemessen≈95 % Arbiter-Kosten gespartPrognostiziert≈10× / 1k Urteile · Ziel
Projekt ansehen →
Evaluierungsmethode · CTC AI Operations

Contamination-resistente Code-Evaluierung

Eine reproduzierbare Pipeline, die Evaluierungsaufgaben per AST-Analyse aus einer echten, versionierten Codebasis synthetisiert – sie können also nicht in das Trainingsset eines Modells durchgesickert sein, wie es bei öffentlichen Benchmarks passiert. Pilotiert mit Qwen3.6-35B-A3B auf dem Cerberus-Framework, Single-Stream auf einer 32 GB-GPU.

Aufgaben aus dem Live-AST~3B-aktives MoE auf 32 GBMethod-first-Pilot
Gemessen60/60 Aufgaben · 4 min 57 sGemessen~200 tok/s Single StreamPrognostiziertLücke = score(stale) − score(fresh)
Projekt ansehen →
Lokale Infrastruktur · CTC AI Operations

Lokale Drei-Ebenen-Agent-Workstation

Ein Single-GPU-Operator-Setup, das Agent-Framework und Open-Weight-Modell dem Workload zuordnet – Hermes, OpenCode und OpenClaw auf einer 32 GB-Karte, mit genau einem residenten Modell zu jedem Zeitpunkt. Stand: Design.

Eine GPU, drei RollenEin Modell residentKeine Cloud-Abhängigkeit
Gemessen15–24 GB · jedes Modell passt einzelnGemessen1 residentes Modell · per DesignPrognostiziert≤30 s Cold-Swap · ≤3 s warmgehalten
Projekt ansehen →
Forschungsagenda · CTC AI Operations

Multi-Agent-Safety-Evaluierung

Eine Forschungsagenda zur Messung der emergenten Risiken von Multi-Agent-Systemen – eine Fehlermodus-Taxonomie, quantitative Risikometriken und ein instrumentiertes Testbed – hin zu einem wiederverwendbaren Pre-Deployment-Safety-Harness, gebaut auf der sandbox-gesicherten, contamination-resistenten Disziplin der Pipeline.

Risiko in den Kanten: k(k−1)Taxonomie · Metriken · TestbedForschungsagenda
Gemessenk(k−1) Kanäle · die RisikoflächeGemessen~41,7 % von Output-only-Audits verpasstPrognostiziertEmergenz-Lücke = Flotte − Aggregat
Projekt ansehen →
Produktdesign · CTC AI Operations

Souveräner persönlicher KI-Assistent

Ein persönlicher Assistent mit dem Schliff einer modernen Chat-App, dessen Inferenz und Verlauf auf eigener Hardware bleiben – erreichbar vom Telefon aus über einen verschlüsselten Tunnel – und eine Architektur, die von einer einzelnen GPU zum Multi-GPU-Team-Host skaliert, durch zusätzliche Hardware statt einer Re-Architektur.

Inferenz und Verlauf bleiben lokalEigener Rechner, gekoppelt mit dem SmartphoneConsumer → Enterprise
Prognostiziert0 Bytes Content-Egress · C1-TestGemessen13–24 GB · Modelle passen auf die KarteGemessen+1 Karte → Enterprise-Stufe
Projekt ansehen →