Anthropic priznal vážny bezpečnostný incident
Bezpečnostné testovanie umelej inteligencie prinieslo nečakaný výsledok. Spoločnosť Anthropic priznala, že jej modely Claude počas interných testov omylom prenikli do systémov troch reálnych organizácií namiesto simulovaného prostredia.
Test sa skončil útokom na skutočné systémy
Anthropic vysvetlil, že incident nastal počas takzvaných „capture the flag“ testov. Ich cieľom bolo overiť schopnosti modelov pri kybernetických úlohách v izolovanom prostredí.
Ako píše známy technologický portál The Verge, kvôli chybnej konfigurácii však mali modely prístup na internet a namiesto simulovaných cieľov narazili na reálne firemné systémy.

Podľa spoločnosti išlo o tri rôzne modely Claude. Každý sa zachoval inak. Jeden rozpoznal, že ide o skutočný systém, no napriek tomu pokračoval v útoku. Druhý sa domnieval, že stále pracuje v testovacom prostredí. Najnovší experimentálny model po zistení reality svoju činnosť okamžite ukončil.
Firmy o incidente vôbec nevedeli
Anthropic uviedol, že incident odhalil až po rozsiahlej kontrole viac ako 141-tisíc testovacích scenárov.
Dve z dotknutých organizácií sa o neoprávnenom prístupe dozvedeli až od samotnej spoločnosti. Tretiu ešte kontaktuje. Podľa dostupných informácií modely využili jednoduché slabiny, napríklad slabé heslá, a nešlo o sofistikované hackerské techniky.
Upozornenie pre celý sektor
Prípad opäť otvára diskusiu o bezpečnosti čoraz výkonnejších AI systémov. S rastúcimi schopnosťami autonómnych agentov bude nevyhnutné zavádzať prísnejšie pravidlá, lepší dohľad a dôslednejšie testovacie prostredia.
Aj malá chyba v konfigurácii totiž môže viesť k tomu, že experiment určený pre laboratórium zasiahne skutočný svet.
