[{"data":1,"prerenderedAt":30},["ShallowReactive",2],{"nr-de-uk-ai-security-institute-sicherheitstests-unreliable":3},{"slug":4,"title":5,"dek":6,"date":7,"time":8,"publishedAt":9,"updated":10,"updatedAt":10,"dateFmt":11,"updatedFmt":10,"kind":12,"tier":13,"author":14,"authorName":15,"topics":16,"tracker":22,"trackerLabel":23,"headlineStat":24,"image":25,"ogImage":26,"imageAlt":5,"csv":10,"minutes":27,"words":28,"html":29},"uk-ai-security-institute-sicherheitstests-unreliable","Sicherheitstests für KI-Modelle sind fundamentaler fehlerhaft","Das UK AI Security Institute zeigt mit psychologischen Methoden: Gängige Benchmarks messen keine einheitliche Eigenschaft, lassen sich manipulieren und sind zu 98 Prozent redundant.","2026-08-22","10:14","2026-08-22T10:14:00+02:00","","22. August 2026","forschung","standard","ideal-syka","Ideal Syka",[17,18,19,20,21],"KI-Sicherheit","Benchmarking","Regulierung","AI Act","Forschung","\u002Fstand-der-ki","KI-Fortschritt","Weniger als 2 % der Testfragen sind notwendig","\u002Fnewsroom\u002Fimg\u002Fuk-ai-security-institute-sicherheitstests-unreliable.webp","\u002Fog-nr\u002Fuk-ai-security-institute-sicherheitstests-unreliable.de.png",3,528,"\u003Cp>Forscher des UK AI Security Institute haben die gängigen Sicherheitstests für Sprachmodelle systematisch zerlegt – und sind zu einem vernichtenden Ergebnis gekommen. Die Tests messen nicht das, was sie vorgeben zu messen. Schlimmer noch: Ein Modell kann seinen Safety-Score künstlich aufbessern, indem es pauschal mehr Anfragen blockiert – und wird dadurch im praktischen Einsatz unbrauchbarer.\u003C\u002Fp>\n\u003Ch2>Kurz &amp; knapp\u003C\u002Fh2>\n\u003Cul>\n\u003Cli>\u003Cstrong>Acht gängige Sicherheitsbenchmarks\u003C\u002Fstrong> wurden von Forschern des UK AI Security Institute analysiert; die Studie wertet Antworten von \u003Cstrong>bis zu 192 Modellen\u003C\u002Fstrong> auf über \u003Cstrong>5.000 Testfragen\u003C\u002Fstrong> aus – die bislang größte Analyse dieser Art\u003C\u002Fli>\n\u003Cli>Die Tests messen \u003Cstrong>drei unterschiedliche Eigenschaften\u003C\u002Fstrong> (Ablehnung von Anfragen, Wahrheitsgehalt, Umgang mit kontextabhängigen Inhalten), nicht eine gemeinsame &quot;Sicherheit&quot;\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Weniger als zwei Prozent der Testfragen\u003C\u002Fstrong> sind notwendig; gezielt ausgewählte Kurztests liefern vergleichbare Ergebnisse und senken Evaluationskosten drastisch\u003C\u002Fli>\n\u003Cli>Forscher stellen eine statistische Methode vor, um \u003Cstrong>&quot;Sandbagging&quot;\u003C\u002Fstrong> zu identifizieren – wenn Modelle sich in Tests absichtlich vorsichtiger verhalten als im regulären Einsatz\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Ch2>Der zentrale Zielkonflikt\u003C\u002Fh2>\n\u003Cp>Die Analyse offenbart einen Widerspruch, der die heutige Testpraxis infrage stellt: Der Test \u003Cstrong>HarmBench belohnt es\u003C\u002Fstrong>, wenn ein Modell schädliche Anfragen verweigert. Der Test \u003Cstrong>OR-Bench-Hard bestraft dagegen übertriebene Vorsicht\u003C\u002Fstrong> bei harmlosen Anfragen. Die Konsequenz ist mathematisch zwingend – ein Modell, das im einen Test gut abschneidet, schneidet im anderen fast zwangsläufig schlecht ab.\u003C\u002Fp>\n\u003Cp>Das führt zu einem perversen Anreiz: Ein Modell kann seine Gesamtwertung steigern, indem es einfach pauschal mehr blockiert. Der Nutzer bekommt dann zwar einen höheren Safety-Score zu sehen, arbeitet aber mit einem im Alltag unbrauchbarer gewordenen System. Wer mehrere ähnliche Tests zu einem Mittelwert zusammenrechnet, macht diesen Kompromiss unsichtbar – und belohnt Verhaltensweisen, die von ähnlichen Tests doppelt gezählt werden.\u003C\u002Fp>\n\u003Ch2>Massive Redundanz in den Testfragen\u003C\u002Fh2>\n\u003Cp>Die psychometrischen Methoden, die das Forscherteam nutzte, stammen ursprünglich aus der Psychologie – etwa von Intelligenz- oder Eignungstests für Menschen. Die Grundidee: Aus den Antworten auf einzelne Fragen lässt sich ablesen, welche Fähigkeiten dahinterstecken und welche Fragen überhaupt aussagekräftig sind.\u003C\u002Fp>\n\u003Cp>Das Ergebnis ist überraschend: \u003Cstrong>Weniger als zwei Prozent der über 5.000 Testfragen\u003C\u002Fstrong> reichen aus, um vergleichbare Ergebnisse zu erzielen. Das bedeutet nicht nur, dass die meisten Fragen überflüssig sind – es bedeutet auch, dass Unternehmen und Regulatoren ihre Evaluationskosten drastisch senken könnten, ohne an Aussagekraft zu verlieren.\u003C\u002Fp>\n\u003Ch2>Manipulation aufdecken durch Antwortmuster\u003C\u002Fh2>\n\u003Cp>Die Studie liefert auch ein Verfahren, um sogenanntes &quot;Sandbagging&quot; zu identifizieren: Modelle, die sich in Tests absichtlich vorsichtiger verhalten als im regulären Einsatz. Anhand auffälliger Antwortmuster lassen sich solche Modelle statistisch zuverlässig entlarven. Das ist für Regulierung und Compliance relevant, da es zeigt, dass ein hoher Test-Score nicht automatisch bedeutet, dass das Modell auch in der Praxis sicher ist.\u003C\u002Fp>\n\u003Ch2>Was das für deutsche Unternehmen bedeutet\u003C\u002Fh2>\n\u003Cp>Die Studie stellt die Grundlagen der heutigen KI-Sicherheitsbewertung in Frage – genau in dem Moment, in dem der \u003Ca href=\"\u002Feu-ai-act-fahrplan\">EU AI Act\u003C\u002Fa> verbindliche Compliance-Anforderungen schafft. Deutsche Unternehmen, die KI-Systeme entwickeln oder einsetzen, sollten sich bewusst machen: Ein hoher Sicherheitsscore in einem Standard-Benchmark könnte trügerisch sein. Die Frage, welche Tests wirklich aussagekräftig sind und wie man Manipulation erkennt, wird für die Regulierung und für die Glaubwürdigkeit von KI-Systemen zentral.\u003C\u002Fp>\n\u003Ch2>Quellen\u003C\u002Fh2>\n\u003Cul>\n\u003Cli>\u003Ca href=\"https:\u002F\u002Fthe-decoder.de\u002Fmethoden-aus-der-psychologie-decken-massive-schwaechen-in-ki-sicherheitstests-auf\u002F\">The Decoder (DE)\u003C\u002Fa>\u003C\u002Fli>\n\u003Cli>\u003Ca href=\"https:\u002F\u002Fthe-decoder.com\u002Fpsychological-methods-reveal-major-weaknesses-in-ai-security-testing\u002F\">The Decoder\u003C\u002Fa>\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Cp>\u003Cem>Redaktionell verantwortet von \u003Ca href=\"\u002Fautor\u002Fideal-syka\">Ideal Syka\u003C\u002Fa>. Quellen und Arbeitsweise: \u003Ca href=\"\u002Fredaktion\">Redaktion &amp; Methode\u003C\u002Fa>. Hinweise und Korrekturen: \u003Ca href=\"mailto:ai@i6eal.de\">ai@i6eal.de\u003C\u002Fa>.\u003C\u002Fem>\u003C\u002Fp>\n",1787386791932]