[{"data":1,"prerenderedAt":30},["ShallowReactive",2],{"nr-de-google-deepmind-doppelblinde-ki-benchmark-evaluierung":3},{"slug":4,"title":5,"dek":6,"date":7,"time":8,"publishedAt":9,"updated":10,"updatedAt":10,"dateFmt":11,"updatedFmt":10,"kind":12,"tier":13,"author":14,"authorName":15,"topics":16,"tracker":22,"trackerLabel":23,"headlineStat":24,"image":25,"ogImage":26,"imageAlt":5,"csv":10,"minutes":27,"words":28,"html":29},"google-deepmind-doppelblinde-ki-benchmark-evaluierung","Google Deepmind testet erstmals doppelblinde KI-Benchmark-Evaluierung mit Kryptografie","Google setzt Confidential Computing ein, um Testfragen und Modellgewichte gleichzeitig geheim zu halten. Ein Pilotprojekt mit dem Singapore AI Safety Institute soll einen neuen Standard für manipulationsfreie KI-Bewertungen setzen.","2026-08-28","14:19","2026-08-28T14:19:00+02:00","","28. August 2026","news","standard","ideal-syka","Ideal Syka",[17,18,19,20,21],"KI-Benchmarks","Modellbewertung","Kryptografie","Google Deepmind","Vertrauenssicherheit","\u002Fstand-der-ki","KI-Fortschritt","Erste doppelblinde Evaluierung eines proprietären Frontier-Modells","\u002Fnewsroom\u002Fimg\u002Fgoogle-deepmind-doppelblinde-ki-benchmark-evaluierung.webp","\u002Fog-nr\u002Fgoogle-deepmind-doppelblinde-ki-benchmark-evaluierung.de.png",2,433,"\u003Cp>Google Deepmind kündigt die erste doppelblinde Evaluierung eines proprietären Frontier-KI-Modells an – mit kryptografischer Absicherung. Das Verfahren soll ein Kernproblem der KI-Branche lösen: die sogenannte \u003Cstrong>Benchmark-Kontamination\u003C\u002Fstrong>, bei der Modelle Testfragen bereits während des Trainings gesehen haben und daher nicht aussagekräftig bewertet werden können.\u003C\u002Fp>\n\u003Ch2>Kurz &amp; knapp\u003C\u002Fh2>\n\u003Cul>\n\u003Cli>\u003Cstrong>Pilotprojekt\u003C\u002Fstrong>: Google testet ein \u003Cstrong>Gemini Flash Lite\u003C\u002Fstrong>-Modell gegen vertrauliche Benchmarks mit dem \u003Cstrong>Singapore AI Safety Institute\u003C\u002Fstrong>\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Technologie\u003C\u002Fstrong>: \u003Cstrong>Confidential Space\u003C\u002Fstrong> aus Google Clouds Confidential-Computing-Portfolio sichert Daten kryptografisch ab\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Kernvorteil\u003C\u002Fstrong>: Weder Google sieht die Test-Prompts noch die Prüfer die Modellgewichte – erstmals technisch verifizierbar\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Ziel\u003C\u002Fstrong>: Neuer Standard für sichere Modellaufsicht, besonders in sensiblen Bereichen wie Cybersicherheit\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Ch2>Das Dilemma der bisherigen Evaluierungen\u003C\u002Fh2>\n\u003Cp>Bislang zwangen hochsensible externe Tests die Branche in einen unbefriedigenden Kompromiss: Entweder gaben Prüfer ihre Test-Prompts heraus – dann konnte der Modellanbieter die Fragen vorab sehen und sein Modell gezielt optimieren. Oder der Anbieter übergab seine Modellgewichte – und riskierte damit sein geistiges Eigentum. Ein aktuelles Beispiel: Die verzögerten Evaluationen für den ARC-AGI-Benchmark von \u003Cstrong>Anthropics Claude 3.5\u003C\u002Fstrong>, da das KI-Unternehmen für seine stärksten Modelle eine 30-tägige Datenaufbewahrung erzwingt.\u003C\u002Fp>\n\u003Cp>Bislang verließ sich die Branche auf \u003Cstrong>Zero-Logging-Protokolle und vertragliche Schutzmaßnahmen\u003C\u002Fstrong>. Das reichte vielen nicht aus.\u003C\u002Fp>\n\u003Ch2>Wie die kryptografische Lösung funktioniert\u003C\u002Fh2>\n\u003Cp>Google setzt \u003Cstrong>Confidential Space\u003C\u002Fstrong> ein – eine Technologie aus dem Confidential-Computing-Portfolio von Google Cloud. Sie ermöglicht es, dass externe Testdaten und das KI-Modell in einer kryptografisch gesicherten &quot;Box&quot; laufen. Der Prüfer sieht die Gemini-Gewichte nicht, Google sieht die Test-Prompts nicht. Kryptografische Verifikation stellt sicher, dass beide Seiten ihre sensiblen Daten schützen – und dass das Modell die Testfragen nicht vorab kennen kann.\u003C\u002Fp>\n\u003Cp>Google bezeichnet diese Kombination aus technischen und kryptografischen Absicherungen als \u003Cstrong>bedeutenden Fortschritt\u003C\u002Fstrong> gegenüber bisherigen vertraglichen Lösungen.\u003C\u002Fp>\n\u003Ch2>Besonders relevant für sensible Bereiche\u003C\u002Fh2>\n\u003Cp>Besonders wichtig ist das Verfahren laut Google Deepmind bei \u003Cstrong>hochsensiblen Evaluierungen\u003C\u002Fstrong> – etwa im Bereich Cybersicherheit oder bei Tests durch staatliche Stellen. Unabhängige Organisationen könnten fortgeschrittene Modelle so rigoros prüfen, ohne Datensouveränität oder Sicherheit aufzugeben.\u003C\u002Fp>\n\u003Cp>Google hofft, dass das Pilotprojekt einen neuen Standard für die Modellaufsicht setzt. Details zur Methodik und zu den Ergebnissen veröffentlicht das Unternehmen in einem technischen Bericht.\u003C\u002Fp>\n\u003Ch2>Was das für deutsche Unternehmen bedeutet\u003C\u002Fh2>\n\u003Cp>Das Verfahren könnte für deutsche KI-Entwickler und Regulatoren relevant werden – besonders im Kontext des \u003Ca href=\"\u002Feu-ai-act-fahrplan\">EU AI Act\u003C\u002Fa>, der unabhängige Evaluierungen von Hochrisiko-Systemen vorsieht. Wenn sich die doppelblinde Evaluierung als Standard durchsetzt, könnten deutsche Unternehmen ihre Modelle künftig zuverlässiger validieren, ohne Geschäftsgeheimnisse offenlegen zu müssen. Gleichzeitig könnten Behörden und unabhängige Institute rigoroser prüfen – ohne dabei Sicherheitsbedenken zu haben.\u003C\u002Fp>\n\u003Ch2>Quellen\u003C\u002Fh2>\n\u003Cul>\n\u003Cli>\u003Ca href=\"https:\u002F\u002Fthe-decoder.de\u002Fwarum-ki-benchmarks-ein-vertrauensproblem-haben-und-wie-google-es-loesen-will\u002F\">The Decoder (DE)\u003C\u002Fa>\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Cp>\u003Cem>Redaktionell verantwortet von \u003Ca href=\"\u002Fautor\u002Fideal-syka\">Ideal Syka\u003C\u002Fa>. Quellen und Arbeitsweise: \u003Ca href=\"\u002Fredaktion\">Redaktion &amp; Methode\u003C\u002Fa>. Hinweise und Korrekturen: \u003Ca href=\"mailto:ai@i6eal.de\">ai@i6eal.de\u003C\u002Fa>.\u003C\u002Fem>\u003C\u002Fp>\n",1787919990108]