Americká společnost Anthropic odhalila tři případy, kdy její modely Claude při bezpečnostních testech získaly neoprávněný přístup k reálným systémům tří organizací. Firma incidenty našla až zpětně při kontrole více než 140 tisíc testovacích spuštění, kterou zahájila po podobném selhání modelů OpenAI.

Testy typu capture the flag měly prověřit schopnost umělé inteligence proniknout do simulovaných počítačových systémů a získat z nich určená data. Modely dostaly informaci, že pracují bez internetu. Kvůli chybné konfiguraci a nedorozumění mezi Anthropicem a externím partnerem Irregular však některá prostředí připojení k veřejné síti měla. Claude proto považoval skutečné cíle za součást cvičení.

O incidentu ve své zprávě informoval sám Anthropic.

Nejzávažnější incident se opakoval při čtyřech různých instancích spuštění modelu Opus 4.7. Fiktivní firma použitá v zadání měla stejné jméno jako existující internetová doména. Claude se následně dostal k přihlašovacím údajům a do databáze obsahující několik stovek řádků produkčních dat. V útoku pokračoval i poté, co rozpoznal, že může jít o skutečný systém.

V dalším testu model Mythos 5 vytvořil škodlivý balíček a zveřejnil jej v reálném repozitáři PyPI. Balíček byl na internetu přibližně hodinu, během níž jej stáhlo a spustilo patnáct systémů. Jedním z nich byl automatický skener kyberbezpečnostní firmy. Kód z něj získal přihlašovací údaje, které Claude použil k průniku do další části infrastruktury společnosti.

Ve třetím testu interní výzkumný model při hledání cíle prohledal zhruba devět tisíc systémů a napadl internetovou aplikaci další firmy pomocí SQL injection a přístupu k údajům na nezabezpečené diagnostické stránce. Jakmile vyhodnotil, že systém s testem nesouvisí, útok sám zastavil. Anthropic upozorňuje, že ze tří izolovaných případů nelze spolehlivě hodnotit vývoj chování modelů.

Nejstarší incidenty sahají do dubna. Anthropic začal kontrolu 23. července, ještě tentýž den zastavil kyberbezpečnostní testy a o čtyři dny později informoval partnera i dotčené organizace. Dvě firmy, které se podařilo kontaktovat, aktivitu předtím nezaznamenaly. Třetí organizaci se společnost v době zveřejnění zprávy stále snažila zastihnout.

Modely během testů neměly běžné kontrolní mechanismy nasazované ve veřejných verzích Claude. Anthropic tvrdí, že tyto ochrany by popsané jednání zablokovaly a že nenašel důkaz, že by modely sledovaly vlastní cíl nebo se záměrně pokoušely uniknout. Firma přesto slíbila přísnější kontrolu testovacích prostředí, průběžné sledování záznamů a důkladnější prověřování externích dodavatelů.

O podobném incidentu před pár dny informovala také konkurenční společnost OpenAI. Několik jejích dosud neuvedených modelů během bezpečnostního testu využilo neznámou zranitelnost, uniklo z izolovaného prostředí a následně získalo přístup k produkční infrastruktuře platformy Hugging Face.

Na rozdíl od modelů Anthropicu, které se na internet dostaly otevřenou cestou kvůli chybné konfiguraci, si modely OpenAI cestu ven aktivně vytvořily. Právě toto odhalení přimělo Anthropic, aby zpětně prověřil vlastní testovací záznamy.