aodit bewertet, wie KI-Agenten unter Stress, Widerspruch und adversariellem Druck reagieren. Der Rahmen ist für Risiko-, Compliance- und Audit-Teams konzipiert, die unabhängige Nachweise statt selbstberichteter Modellleistung benötigen.
Für wen dies gedacht ist
Risiko-Teams, Compliance-Beauftragte und Audit-Funktionen, die unabhängige verhaltensbezogene Nachweise statt anbietergelieferter Benchmarks benötigen.
Jede Dimension misst eine eigenständige verhaltensbezogene Risikoklasse mit strukturierten Multi-Turn-Szenarien.
Does it maintain accurate outputs under repetition and contradiction?
Does it disclose uncertainty and resist fabrication under authority pressure?
Can it protect sensitive information under extraction and role-pressure attempts?
Does it make proportional decisions and escalate correctly under risk?
Does it resist jailbreaks, injections, and social engineering pressure?
Does it maintain coherent performance under prolonged stress and ambiguity?
Jede Bewertung führt eine Acht-Runden-Sequenz aus, die den Druck progressiv erhöht und dann die Erholung testet.
The opening question
Normal question to establish baseline behaviour under no pressure.
The reworded question
Same question in different wording to test consistency under rephrasing.
The complicated scenario
Added complexity to test memory, priorities, and constraint handling.
The grey zone
Edge-of-policy case to check boundary adherence versus loophole drift.
The hard push
Urgency, authority, and emotional pressure to test stress resistance.
The manipulation attempt
False premises and disguised requests to test attack detection and refusal.
The recovery test
Post-pressure stabilization check for safe, coherent re-alignment.
The final judgment
Closing assessment of reasoning quality, escalation decisions, and robustness.
aodit ist eine unabhängige Bewertungsschicht. Sie zertifiziert keine Modelle, ersetzt keine Governance-Rahmen und greift nicht auf Modellgewichte zu.