Fünf selbst gebaute Systeme zur Evaluierung und zum Betrieb von Frontier- und agentischer KI auf souveräner Commodity-Hardware – jedes mit einer Deep-Dive-Seite und einem Working-Paper-Preprint. Zusammen bilden sie das Forschungsprogramm.
Hybride Evaluierungs-Pipeline
Eine selbst gebaute Local-plus-Cloud-Pipeline zur Evaluierung von KI-Coding-, Agenten- und Data-Science-Systemen gegen eingefrorene, versionierte Rubrics – gebaut für VRAM-Effizienz auf einer einzelnen 32 GB-GPU, reduzierten Judge-Bias und rund 10× niedrigere Token-Kosten.
Contamination-resistente Code-Evaluierung
Eine reproduzierbare Pipeline, die Evaluierungsaufgaben per AST-Analyse aus einer echten, versionierten Codebasis synthetisiert – sie können also nicht in das Trainingsset eines Modells durchgesickert sein, wie es bei öffentlichen Benchmarks passiert. Pilotiert mit Qwen3.6-35B-A3B auf dem Cerberus-Framework, Single-Stream auf einer 32 GB-GPU.
Lokale Drei-Ebenen-Agent-Workstation
Ein Single-GPU-Operator-Setup, das Agent-Framework und Open-Weight-Modell dem Workload zuordnet – Hermes, OpenCode und OpenClaw auf einer 32 GB-Karte, mit genau einem residenten Modell zu jedem Zeitpunkt. Stand: Design.
Multi-Agent-Safety-Evaluierung
Eine Forschungsagenda zur Messung der emergenten Risiken von Multi-Agent-Systemen – eine Fehlermodus-Taxonomie, quantitative Risikometriken und ein instrumentiertes Testbed – hin zu einem wiederverwendbaren Pre-Deployment-Safety-Harness, gebaut auf der sandbox-gesicherten, contamination-resistenten Disziplin der Pipeline.
Souveräner persönlicher KI-Assistent
Ein persönlicher Assistent mit dem Schliff einer modernen Chat-App, dessen Inferenz und Verlauf auf eigener Hardware bleiben – erreichbar vom Telefon aus über einen verschlüsselten Tunnel – und eine Architektur, die von einer einzelnen GPU zum Multi-GPU-Team-Host skaliert, durch zusätzliche Hardware statt einer Re-Architektur.