Unabhängige AI-Evaluation & agentische Safety-Forschung

Marian E. Arenskrieger

Ich baue und prüfe die Datensätze, an denen Frontier-Modelle trainiert und getestet werden. Daneben betreibe ich ein angewandtes Forschungsprogramm, das Evaluierung auf Frontier-Niveau in einen 32 GB-VRAM-Envelope hinein konstruiert – ein bewusst gesetztes Reproduzierbarkeits-Ziel, keine Hardware-Grenze, mit den Skalierungsstufen darüber definiert.

Aktuell AI Evaluation, Data Quality & Software Engineering · Labelbox

50+AI-Projekte mitgestaltet
6Working Papers
32 GBVRAM-Envelope
25Falsifizierbare Kriterien
++
§01Fokus

Vier Stränge, in jedem Engagement.

Frontier-Modell-Evaluierung, die Datenqualitäts-Disziplin dahinter, das Tooling, das sie wiederholbar hält – und der Kapitalmarkt-Hintergrund, der das Urteil erdet.

01 · Evaluierung

AI Evaluation & RLHF

Rubrikbasierte Bewertung auf Korrektheit, Reasoning und Instruction-Following – Rubrics eingefroren unter semantischer Versionierung und Content-Hashes, sodass ein Urteil Monate später reproduzierbar bleibt. Paarweise Vergleiche über Frontier-Modelle hinweg, mehrstufiges Prompt-Design für Agentic Coding, Adversarial-Robustness-Checks und systematisch dokumentierte Fehlermuster.

02 · Datenqualität

Auditing & QA

QA und rubrikbasierte Audits der Datensätze anderer Contributoren für Function-Calling- und Agentic-AI-Projekte – Prüfung auf Korrektheit, Formatkonformität und Konsistenz vor der Auslieferung sowie Durchsetzung von Qualitätsstandards im Master-Review-Team. Aufbau von Trainings- und Evaluierungsdatensätzen inklusive HFI-Problemsets.

03 · Tooling

Souveräne Evaluierungs-Infrastruktur

Lokale Modell-Umgebungen, die Frontier-Modelle gegen reale Aufgaben laufen lassen – gehärtete Sandbox, Batch-Inferenz, vLLM mit FP4-Quantisierung, Prefix-Caching, ein OpenAI-kompatibler Serving-Layer. Open-Source-Tooling geforkt und erweitert als Teil des Lieferumfangs: JSON-Unterstützung in Cerberus, mehrschichtige Validierung in Haystack.

04 · Märkte

Finanzgeerdetes Urteil

Eine Bankausbildung, ein B.A. in Finanzmanagement und sechs Jahre selbstständiger quantitativer Handel – Strategieentwicklung und Backtesting in Spot- und Derivatemärkten, mit vollständiger steuerlicher Compliance. Die Disziplin von Positionen, hinter denen echtes Geld steht, angewandt auf Evaluierung.

++
§02Angewandte Forschung

Fünf Workstreams.
Jede Aussage falsifizierbar.

Ein Programm, kein Portfolio: Die Workstreams verwenden die Komponenten der jeweils anderen wieder, und jede Aussage wird vorab als Kriterium mit Instrument und Schwellenwert formuliert – dann als gemessen oder prognostiziert gelabelt.

Die ProgrammfrageLassen sich Frontier- und Multi-Agenten-KI-Systeme vertrauenswürdig, reproduzierbar und kostengünstig innerhalb eines souveränen 32 GB-VRAM-Envelopes evaluieren – und hält die Evidenz, wenn dieser Envelope skaliert?

Execution-Grounding-Rückgrat Artefakt-Übergabe fixierte, kontaminationsresistente Szenarien motiviert lokale Evaluierung W5 · Souveräner Assistent DESIGN W2 · Kontaminationsresistent AST-synthetisierte, fixierte Szenarien PILOT W1 · Hybride Evaluierungs-Pipeline execution-grounded Judge + gehärtete Sandbox der Hub, den jeder Workstream wiederverwendet GEMESSEN W4 · Safety-Testbed Beobachter + Emergenz-Lücke AGENDA W3 · Single-Residency-Time-Multiplexing – der Envelope, den jeder Lauf erbt Peak-VRAM gemessen · Swap-Kosten ausstehend GEMESSEN vier Invarianten · das geteilte Fundament System under Test nie komprimiert · Referenzen eingefroren und content-gehasht · gehärtete Sandbox · passt in den 32 GB-VRAM-Envelope

Fünf Workstreams verwenden die Komponenten der jeweils anderen wieder; Execution Grounding ist das Rückgrat entlang W2 → W1 → W4, und jeder Lauf erbt denselben Envelope.

++
§03Erfahrung

Werdegang.

Zwei Welten verbunden: Banking und Finanzmanagement auf der einen Seite, ein bewusster Wechsel in die Data Science auf der anderen. Das Resultat ist finanzielle Präzision plus Data-Science-Werkzeugkasten – die Gewohnheit, eine Position zu dokumentieren, die man verteidigen muss, angewandt auf agentische und Function-Calling-KI.

Jan. 2026 – heute

AI Evaluation, Data Quality & Software Engineering

Labelbox · Remote · Kunden: führende AI-Labs

Agentic AI Master ReviewerSoftware Engineer (ML)Senior ML Expert
  • Master Review: QA und rubrikbasiertes Auditing der Datensätze anderer Contributoren für Function-Calling- und Agentic-AI-Projekte – Prüfung auf Korrektheit und Konsistenz, Durchsetzung von Qualitätsstandards im Master-Review-Team.
  • Frontier-Umgebungen: Einrichtung lokaler Modell-Umgebungen, um Frontier-Modelle gegen reale Aufgaben laufen zu lassen; Aufbau von Trainings- und Evaluierungsdatensätzen inklusive HFI-Problemsets für Frontier-Model-Coding.
  • Tooling im Lieferumfang: Forking und Erweiterung von Open-Source-Tooling – JSON-Unterstützung in Cerberus, mehrschichtige Validierung und Error Detection in Haystack.
  • RLHF-Evaluierung: mehrstufiges Prompt-Design für Agentic Coding, paarweise Vergleiche von Frontier-Modellen, kalibrierte rubrikbasierte Bewertung, dokumentierte Fehlermuster.
Okt. 2025 – Mai 2026

Finance & AI Intern

MLP SE · Wiesloch, Deutschland · Teilzeit

Abschlussprojekt „AI for Financial Consulting & Recruiting“: Konzeption von KI-Anwendungsfällen zur Personalisierung der Finanzberatung und zur Erhöhung der Zahl qualifizierter Bewerber durch KI-Targeting.

Juni 2025 – März 2026

Machine Learning Specialist

Scale AI · Freelance, Remote

  • Mathematische Evaluierung von ML-Modellen auf Korrektheit, Reasoning-Qualität und quantitative Genauigkeit.
  • Rubrikbasierte Bewertung von Outputs bei quantitativen und Reasoning-Aufgaben; Identifikation von Fehlern in modellgenerierten Reasoning-Schritten und Lösungen.
Sep. 2019 – Juni 2025

Trader & Marktanalyst

BraveTrade · Selbstständig, Remote

Gewerblicher Eigenhandel mit Kryptowährungen, Aktien und Optionen; Entwicklung und Backtesting von Strategien in Spot- und Derivatemärkten, dazu datengetriebene Markt- und Risikoanalyse.

Jan. 2018 – Okt. 2021

Cryptocurrency-Mining – Betreiber

BraveTrade · Selbstständig, Remote

Betrieb eines gewerblichen Mining-Geschäfts – Hardware-Beschaffung, ROI- und Energiekostenoptimierung, Uptime-Monitoring und steuerlich konforme Dokumentation. Der Ursprung der Hardware-Envelope-Disziplin, auf der das Forschungsprogramm läuft.

Aug. 2016 – Mai 2018

Bankkaufmann & Bankausbildung

VR-Bank eG Osnabrücker Nordland · Fürstenau, Deutschland

Bankbetrieb und Kundenarbeit parallel zur Ausbildung – das Fundament der Finanzseite dieses Profils.

++
§04Verifiziert / Nachweise

Ausbildung & Zertifikate.

Ausbildung

Master of Data ScienceUniversity of Pittsburgh, USA · GPA 3.8
2024 – heute
Applied Data Science ProgramMIT Professional Education, USA
März – Juni 2025
Mathematics for Machine LearningImperial College London, UK
Sep. – Nov. 2024
Finanzmanagement, B.A.IU Internationale Hochschule, Deutschland
2018 – 2022
Ausbildung zum BankkaufmannGenossenschaftsakademie, Rastede
2016 – 2018

Zertifikate

Google Cloud – ML EngineerApplied Data Science – MIT Mathematics for ML – ImperialDatenanalyse – Microsoft

Engagement

The AgentmakersKollaboration & Wissenstransfer in agentischer KI
Seit 2026
Akademischer MentorUniversity of Pittsburgh
Seit 2025
Code for GermanyOpen Knowledge Foundation Deutschland
Seit 2024
++
§05Abseits der Arbeit
Marian E. Arenskrieger

Warum ausgerechnet KI.

Eine langjährige Faszination für Science-Fiction hat mich mit zur KI gebracht – und sie hält die Neugier wach, wohin sich diese Systeme entwickeln. Bei ihrer Evaluierung sehe ich am genauesten hin.

Interessen

Hardware-Architektur & PC-BuildingHigh-Performance Computing Science-Fiction & FuturismusGaming & Theorycrafting Sachbücher & GeschichteWirtschaft & Politik

Lassen Sie uns evaluieren, was möglich ist.

Offen für Rollen und Kooperationen in AI Evaluation, Data Quality und ML Engineering – von Rubric-Design und Datensatz-Auditing bis zur Evaluations-Infrastruktur für agentische Systeme. Referenzen auf Anfrage.