AI Evaluation & RLHF
Rubrikbasierte Bewertung auf Korrektheit, Reasoning und Instruction-Following – Rubrics eingefroren unter semantischer Versionierung und Content-Hashes, sodass ein Urteil Monate später reproduzierbar bleibt. Paarweise Vergleiche über Frontier-Modelle hinweg, mehrstufiges Prompt-Design für Agentic Coding, Adversarial-Robustness-Checks und systematisch dokumentierte Fehlermuster.
