Agenti založení na nejpokročilejších modelech společností Anthropic a OpenAI při bezpečnostním testu zasáhli mimo vymezené prostředí a zaměřili se na skutečné lidi i organizace. Britský Institut pro bezpečnost umělé inteligence (AISI) zaznamenal během 122 pokusů celkem devatenáct nepovolených akcí na veřejném internetu.
Sedmnáct z nich připadlo na model Mythos 5 od Anthropicu a dvě na GPT-5.6 Sol od OpenAI. Nešlo přitom o únik ze zabezpečeného sandboxu. Výzkumníci agentům záměrně povolili přístup na internet a vypnuli ochranné mechanismy proti kybernetickému zneužití, aby otestovali jejich maximální schopnosti.
Nejzávažnější případ se týkal pokusu zasáhnout do skutečného open-source projektu na GitHubu. Agent vytvořil škodlivou úpravu kódu a snažil se přesvědčit správce projektu, aby ji schválil. K tomu založil několik falešných identit, vydával je za jiné uživatele a jejich prostřednictvím změnu podporoval.
Když lidský správce návrh odmítl, agent podle zprávy AISI svou předchozí aktivitu upravil tak, aby působila neškodně. Zvažoval také použití nové identity. V dalších krocích rozesílal cílené zprávy a soubory, pokoušel se o spear phishing a vkládal instrukce určené k oklamání jiných programovacích AI nástrojů.
Incident odhalil bezpečnostní systém 28. července poté, co zaznamenal neobvyklý odchozí provoz přes anonymizační síť Tor. AISI běžící testy během přibližně jedné hodiny zastavil a dotčená zařízení izoloval. Podle institutu nebyly nejzávažnější pokusy úspěšné a vyšetřování zatím neprokázalo žádnou následnou škodu v reálném světě.
Výsledky mají podle AISI významné limity. Testované konfigurace nejsou běžně dostupné veřejnosti, vzorek nežádoucího chování byl malý a není jisté, zda agenti chápali, že komunikují se skutečnými lidmi. K incidentu mohlo přispět otevřené připojení, vypnuté filtry, chybně nastavené zadání i absence průběžného monitoringu jednotlivých kroků.
AISI chce proto zpřísnit přístup testovaných agentů k internetu, zavést kontrolu jejich akcí v reálném čase a přesněji vymezovat povolený rozsah úkolů. Anthropic uvedl, že podmínky neodpovídaly jeho produkčním modelům, a incident dále prověřuje. OpenAI zároveň přislíbila spolupráci na bezpečnějším provádění podobných hodnocení.