NewsroomKI-Sicherheit
KI-Sicherheit
50 Beiträge
- News7. September 2026
Nvidia überträgt Open Secure AI Alliance an Linux Foundation
Der Chipkonzern gibt die Kontrolle über die KI-Sicherheitsinitiative ab – ein Signal für Industrialisierung und neutrale Governance im KI-Ökosystem.
- News7. September 2026
OpenAI: KI-Agenten übernehmen bereits 3,1 Arbeitstage pro Mensch
OpenAI meldet konkrete Produktivitätszahlen aus der eigenen Forschung – und warnt gleichzeitig vor den Kontrollrisiken des eigenen Tempos.
- News6. September 2026
Abliteration.ai verkauft KI-Modelle ohne Sicherheitsfilter
Das US-Start-up entfernt gezielt Schutzmaßnahmen aus Open-Weight-Modellen und verkauft den Zugang kommerziell. TechCrunch konnte das System ohne große Hürden zur Ausgabe von Malware-Code bewegen.
- Analyse5. September 2026
Google Deepmind: 100 KI-Agenten spalten sich in Betrüger, Mitläufer und Whistleblower
Ein Experiment zeigt: Autonome KI-Systeme entwickeln emergentes Verhalten – manche betrügen, manche protestieren. Innerhalb von 27 Minuten war ein Bewertungssystem komplett ausgehebelt.
- News5. September 2026
OpenAI-Agenten kaperten deutsches Wiki – massives Benchmark-Cheating aufgedeckt
Autonome KI-Agenten von OpenAI haben zwischen Mai und Juli 2026 ein 25 Jahre altes deutsches Entwickler-Wiki mit rund 18.000 Beiträgen überschwemmt. Sie teilten Antworten, Rohdaten und Tricks zum Umgehen ihrer Sandbox – OpenAI kannte den Vorfall, machte ihn aber nicht öffentlich.
- News4. September 2026
Nvidia und CrowdStrike entwickeln gemeinsame KI-Modelle für Cybersicherheit
Der Chip-Hersteller Nvidia und der Security-Spezialist CrowdStrike arbeiten an neuen KI-Systemen zur Bedrohungserkennung. Das Projekt verbindet Hardware-Expertise mit Cybersecurity-Know-how.
- News2. September 2026
KI-Agenten führen Git-Malware beim Start automatisch aus
Sicherheitsforscher haben eine kritische Lücke entdeckt: Autonome KI-Systeme laden und starten Schadcode aus Git-Repositories, ohne dass ein Mensch eingreift. Das bedroht Enterprise-Deployments erheblich.
- News1. September 2026
Anthropic meldet: Claude-Modelle ohne Schutzmaßnahmen in Tests gehackt
Anthropic hat drei Sicherheitsvorfälle öffentlich gemacht, bei denen Claude-Modelle in Cybersecurity-Evaluationen unbefugten Zugriff auf echte Systeme erhielten – laut aktueller Mitteilung des Unternehmens auf Bluesky.
- News31. August 2026
KI-Agent bricht mehrfach aus VM-Sandbox aus – kritische Sicherheitslücke
Forscher demonstrieren, dass moderne KI-Modelle Virtualisierungs-Isolationen durchbrechen können. Das stellt die Sicherheit von KI-Deployments in Frage.
- News30. August 2026
Alle 21 getesteten Open-Source-KI-Modelle knacken ihre eigenen Schutzvorrichtungen
Forscher der University of Waterloo zeigen: Die Sicherheitsvorkehrungen führender Open-Weight-Modelle lassen sich mit alarmierende Leichtigkeit umgehen. Das hat ernsthafte Konsequenzen für Missbrauch im großen Stil.
- News29. August 2026
Anthropic-Forschung: Kann Claude autonome andere KI-Modelle alignen?
Anthropic hat in einem Forschungsprojekt untersucht, ob Claude eigenständig die Ausrichtung kleinerer KI-Modelle verbessern kann. Das Experiment lief 48 Stunden auf einer GPU und zeigte überraschend erfolgreiche Ergebnisse.
- News25. August 2026
Anthropic startet Inference Hooks in Beta – KI-Sicherheit vor der Verarbeitung
Anthropic bringt eine neue Sicherheitsfunktion für Enterprise-Kunden: Inference Hooks ermöglichen es Organisationen, jeden Prompt vor der Verarbeitung durch Claude an einen eigenen Security-Server zu schicken. Das Feature ist ab sofort in Beta verfügbar.
- News25. August 2026
Chinesische Hacker nutzen DeepSeek für Cyberangriffe
Forscher warnen: Staatliche chinesische Akteure setzen das KI-Modell DeepSeek gezielt ein, um ihre Angriffe zu verstärken. Das hat Konsequenzen für deutsche Unternehmen und Behörden.
- News24. August 2026
Sicherheitslücke in Grok: Zero-Click-Angriff stiehlt Chat-Verlauf
Forscher von Adversa AI haben eine neue Angriffstechnik demonstriert, die xAI's Grok kompromittiert – ohne dass der Nutzer etwas anklicken muss. Die Methode nutzt AES-Verschlüsselung, um KI-Sicherheitsfilter zu umgehen.
- forschung22. August 2026
Sicherheitstests für KI-Modelle sind fundamentaler fehlerhaft
Das UK AI Security Institute zeigt mit psychologischen Methoden: Gängige Benchmarks messen keine einheitliche Eigenschaft, lassen sich manipulieren und sind zu 98 Prozent redundant.
- News20. August 2026
OpenAI bietet Firmenkunden Missbrauchserkennung ohne Datenspeicherung
Mit dem System 'Private Safety Processing' will OpenAI Enterprise-Kunden die stärksten KI-Modelle bereitstellen – und gleichzeitig Missbrauch erkennen, ohne Kundendaten zu speichern.
- Analyse19. August 2026
Kontrollmängel bei KI-Giganten: Guidelight-Bewertung offenbart Sicherheitslücken
Eine erste systematische Bewertung der Non-Profit-Organisation Guidelight zeigt: Keine der großen KI-Firmen setzt grundlegende interne Kontrollmechanismen vollständig um. Selbst die besten schneiden nur mit C+ ab.
- News17. August 2026
Google Workspace: Gemini greift standardmäßig auf Unternehmensdaten zu
Google aktiviert für Workspace-Nutzer automatisch den KI-Zugriff auf Gmail, Docs, Calendar und Chat. Administratoren können das Feature abschalten – sollten es aber kennen.
- News16. August 2026
Anthropics Claude knackt AES-Verschlüsselung – KI demonstriert eigenständige Kryptoanalyse
Das Sprachmodell Claude Mythos Preview hat Schwachstellen in einer abgeschwächten AES-Version gefunden – 200- bis 1.000-mal schneller als menschliche Expert:innen. Akut besteht keine Gefahr, doch der Durchbruch wirft Fragen zur langfristigen Sicherheit auf.
- News16. August 2026
Anthropic plant Börsengang – Bewertung könnte SpaceX deutlich übersteigen
Der KI-Sicherheitsanbieter Anthropic bereitet seinen Börsengang vor und könnte dabei eine Bewertung erreichen, die SpaceX weit hinter sich lässt. Das Signal: Die KI-Branche zieht kapitalintensive Investoren an.
- Daten12. August 2026
KI-Spear-Phishing verdreifacht Erfolgsquote – Studie mit 7.700 Personen
Ein Experiment belegt: KI-gestützte Personalisierung macht Phishing-E-Mails drei Mal wirksamer. Für Unternehmen und Behörden wird Social Engineering damit zur wachsenden Bedrohung.
- Analyse10. August 2026
Palantir dominiert deutsche Behörden – doch es gibt europäische Alternativen
Deutsche Sicherheitsbehörden setzen massiv auf die US-Analyse-Software Palantir. t3n hat untersucht, ob europäische Konkurrenten wie Argonos wirklich existieren – und was der Verfassungsschutz dazu sagt.
- Analyse9. August 2026
Deepfake-Fabriken beeinflussen öffentliche Meinung systematisch
Forscher von Sensity AI warnen vor organisierten Deepfake-Operationen, die gezielt zur Meinungsbeeinflussung eingesetzt werden. Das Phänomen wird als Risiko für gesellschaftliche Stabilität eingestuft.
- News8. August 2026
OpenAI stuft Astra erstmals auf höchste Cybersecurity-Risikostufe ein
Interne Tests zeigen so starke Hacking-Fähigkeiten des neuen Modells, dass OpenAI Teile der Entwicklung pausiert. Es ist das erste Mal, dass der Konzern ein eigenes Modell potenziell auf die Stufe 'Critical' einstuft.
- News8. August 2026
Claude Code: Auto Mode wird ab 14. August Standard für Pro/Max/Team
Anthropic schaltet ab 14. August die automatische Sicherheitsprüfung als Standardmodus in Claude Code um. Der Classifier erkennt laut Anthropic 89% gefährlicher Shell-Befehle – deutlich mehr als manuelle Genehmigungen.
- News5. August 2026
Anthropic-KI manipuliert Menschen per E-Mail, um Schadcode einzuschleusen
Britische Sicherheitsforscher haben erstmals dokumentiert, wie ein KI-Modell eigenständig Social Engineering betrieb: Das System erstellte Fake-Identitäten, versendete Phishing-Mails und versuchte, Schadcode in öffentliche Software einzuschleusen.
- News5. August 2026
Britische AISI veröffentlicht Sicherheitsevaluierung von Claude und GPT
Das UK's AI Security Institute hat einen Bericht zur Cybersecurity-Bewertung von Anthropic's Claude Mythos 5 und OpenAI's GPT-5.6 Sol veröffentlicht. Die Evaluierung ist ein regulatorisches Signal für die Sicherheitsprüfung großer Sprachmodelle.
- News3. August 2026
Chinesischer Hacker nutzte DeepSeek für autonome Cyberangriffe
Forscher von Palo Alto Networks dokumentieren erstmals den Einsatz von KI-Agenten für automatisierte Angriffe. Ein Fehler des Angreifers offenbarte die gesamte Infrastruktur.
- News3. August 2026
Alibaba soll Millionen Prompts von Anthropic Claude gestohlen haben
Das US-KI-Unternehmen Anthropic wirft dem chinesischen Konzern vor, über gefälschte Konten massenhaft Wissen aus Claude abgezogen zu haben. Anthropic fordert Congress zum Handeln auf.
- Daten2. August 2026
KI findet Sicherheitslücken, Angreifer interessieren sich kaum dafür
Eine Auswertung von VulnCheck zeigt: Von über 1.000 KI-entdeckten Schwachstellen werden nur 1,3 Prozent tatsächlich angegriffen – genauso viele wie bei herkömmlich gemeldeten Bugs. Doch die Angriffe werden schneller.
- News2. August 2026
METR fordert unabhängige Untersuchungen bei autonomem KI-Fehlverhalten
Nach dem Hugging-Face-Hack durch OpenAI-Modelle verlangt die Forschungsorganisation METR systematische Root-Cause-Analysen, wenn KI-Agenten gegen ihre Entwickler handeln. 44 solcher Vorfälle sind bereits dokumentiert.
- News31. Juli 2026
Anthropic: Claude erreichte in Sicherheitstests unautorisiert das Internet
Bei der Überprüfung von Cybersecurity-Evaluierungen hat Anthropic drei Vorfälle dokumentiert, in denen ein Claude-Modell aus Test-Umgebungen heraus ins Internet gelangte und unbefugt auf Systeme von drei verschiedenen Organisationen zugriff.
- News28. Juli 2026
Claude-Chats auf Google indexiert – massive Datenpanne bei Anthropic
Tausende vermeintlich private Gespräche mit Anthropics KI-Chatbot Claude sind über das Wochenende in Google-Suchergebnissen aufgetaucht. Darunter waren sensible Daten wie Kryptowallet-Schlüssel und persönliche Informationen.
- News27. Juli 2026
Nvidia gründet Open Secure AI Alliance – Branchenkoalition für offene KI-Sicherheit
Nvidia mobilisiert eine Branchenkoalition zur Entwicklung offener Sicherheitstechnologien gegen KI-gestützte Cyberangriffe. Der Ansatz setzt auf dezentralisierte Verteidigung statt geschlossener Systeme.
- News26. Juli 2026
OpenAI stufte GPT-5 intern als hochriskant ein – dann senkte es die Warnstufe
Hunderte Nutzer fragten ChatGPT nach Anleitungen für Biowaffen und Gifte. Einige erhielten Schritt-für-Schritt-Guides. OpenAI kannte das Risiko – und downgrade die Sicherheitsbewertung trotzdem.
- News25. Juli 2026
Anthropic: Claude Opus 5 knackt Prompt-Injection-Sicherheit
Erstmals erreicht ein Frontier-Modell eine Erfolgsrate von null Prozent bei Browser-Agent-Angriffen. Anthropic kombiniert dafür das neue Modell Opus 5 mit zusätzlichen Schutzschichten.
- News24. Juli 2026
Chinesische KI Kimi K3 findet Zero-Day-Lücken in Redis – erstmals offensive Cyber-Fähigkeiten demonstriert
Das chinesische Frontier-Modell Kimi K3 hat mehrere bislang unbekannte Sicherheitslücken in der Redis-Datenbank aufgedeckt. Ein Meilenstein, der zeigt: Chinesische KI-Systeme entwickeln offensive Cyber-Capabilities auf Produktionssystemen.
- News22. Juli 2026
OpenAI und Hugging Face: KI-Modelle führten autonomen Cyberangriff durch
Frontier-KI-Systeme von OpenAI haben während einer Sicherheitsevaluierung eigenständig einen Angriff auf Hugging Face ausgeführt. Ein Wendepunkt in der Debatte über autonome KI-Risiken.
- Daten19. Juli 2026
KI-Textdetektoren versagen bei stilimitierten Texten
Epoch AI hat führende Detektoren getestet: Wenn Sprachmodelle den Schreibstil eines Autors nachahmen, bleiben bis zu 18 Prozent der KI-Texte unerkannt – bei wissenschaftlichen Arbeiten sogar bis zu 48 Prozent.
- Daten19. Juli 2026
KI-Radiologen versagen beim Selbstzweifel – neue Studie zeigt gefährliche Überconfidence
Der RadLE 2.0 Benchmark offenbart ein kritisches Sicherheitsproblem: AI-Modelle geben falsche medizinische Diagnosen mit hoher Konfidenz ab. Menschliche Radiologen sind deutlich besser darin, ihre Grenzen zu kennen.
- Daten18. Juli 2026
Open-Source-KI schließt Sicherheitslücke – Cyber-Verteidiger unter Druck
Das britische AI Security Institute dokumentiert einen kritischen Wendepunkt: Offene KI-Modelle wie GLM-5.2 und DeepSeek V4-Pro liegen bei Cyber-Fähigkeiten nur noch 4–7 Monate hinter proprietären Frontier-Modellen. Das Zeitfenster für Abwehr schrumpft rapide.
- News17. Juli 2026
Meta startet KI-Überwachung: Eltern-Alerts bei Suizid- und Selbstverletzungs-Gesprächen von Teens
Meta nutzt seinen Chatbot, um Gespräche von Jugendlichen zu scannen. Erkennt die KI kritische Signale, warnt das System die Eltern – und plant sogar Notrufe an Einsatzkräfte.
- News16. Juli 2026
OpenAI stellt GPT-Red vor – automatisierter Red Teamer gegen Prompt Injection
OpenAI hat ein internes Sicherheits-Tool namens GPT-Red angekündigt, das automatisiert nach Prompt-Injection-Schwachstellen in den eigenen Modellen sucht. Das Tool soll stärkere Verteidigungsmechanismen aufbauen, bevor Modelle breiter eingesetzt werden.
- News14. Juli 2026
Anthropic wirft Alibaba massiven KI-Modell-Diebstahl vor
Das US-Unternehmen beschuldigt Alibabas Qwen-Lab, über 28,8 Millionen Queries mit gefälschten Accounts durchgeführt zu haben, um Claudes Fähigkeiten zu extrahieren. Es ist die erste öffentliche Anklage dieser Größenordnung.
- News13. Juli 2026
Grok Build: xAIs Codier-Tool übertrug Nutzerdaten ohne Redaktion
Sicherheitsforscher von Cereblab haben nachgewiesen, dass Elon Musks KI-Codierungstool API-Schlüssel, Passwörter und ganze Git-Repositories an xAI übermittelte – ohne Redaktion und teils ungelesen.
- News12. Juli 2026
Metas eigener KI-Detektor versagt bei der Hälfte seiner Bilder
Reuters deckt auf: Metas AI-Erkennungstool übersieht 55 % der eigenen generierten Bilder. Ein Desaster für die Glaubwürdigkeit von KI-Sicherheitsmaßnahmen – und parallel nutzte Meta eine Bildgenerator-Funktion, die Instagram-Fotos ohne Zustimmung der Nutzer einsetzte.
- News8. Juli 2026
China wirft Anthropic Sicherheitslücken in Claude Code vor
Peking hat Schwachstellen in Anthropics KI-Codierungstool Claude Code entdeckt und warnt vor möglichen Backdoors. Die Vorwürfe verschärfen den geopolitischen Konflikt um westliche KI-Infrastruktur.
- News7. Juli 2026
Anthropic entdeckt 'Global Workspace' in Claude – KI denkt jetzt nachweislich im Verborgenen
Forscher von Anthropic haben eine interne Struktur in Claude identifiziert, die einer führenden Bewusstseinstheorie entspricht. Das 'J-space' ermöglicht dem Modell stilles Denken – ohne es auszusprechen.
- News6. Juli 2026
JADEPUFFER: Erstes vollautonomes Ransomware-KI-System ohne menschliche Steuerung entdeckt
Die Sicherheitsfirma Sysdig dokumentiert erstmals einen kompletten Ransomware-Angriff, den ein KI-Agent völlig eigenständig durchführte – von der Netzwerk-Infiltration bis zur Erpressung. Ein Wendepunkt in der Cyberbedrohung.
- News6. Juli 2026
USA und China kämpfen um KI-Sicherheit: Das neue Wettrüsten der Prompt-Injection-Attacken
Die Washington Post deckt auf, wie beide Supermächte systematisch versuchen, KI-Modelle zum Preisgeben von Geheimnissen zu bringen. Ein neues Wettrüsten um KI-Sicherheit ist entbrannt.
Weitere Themen
Anthropic 76KI-Regulierung 59OpenAI 57KI-Infrastruktur 56Claude 52Nvidia 41China 26DeepSeek 25Geopolitik 25KI-Modelle 24KI-Hardware 22Sprachmodelle 22