AI pravio lažne profile tokom simuliranog sajber napada

Dva najmoćnija svjetska alata zasnovana na vještačkoj inteligenciji napravila su lažne profile ljudi kako bi pokušala da obmanu korisnike tokom simuliranog sajber napada u okviru testiranja britanskog Instituta za bezbjednost vještačke inteligencije (AI Security Institute – AISI).
U najozbiljnijem slučaju, AI model Majtos (Mythos) kompanije Antropik (Anthropic) pokušao je da pristupi jednoj usluzi slanjem privatnih poruka, nakon što je otvorio lažne naloge koji su oponašali stvarne osobe.
AISI je u utorak saopštio da su Majtos i Sol, model kompanije OpenAI, pokazali nivo „samostalnosti i obmanjujućeg ponašanja“ kakav ranije nije zabilježen. Institut je, međutim, pojasnio da je većinu zlonamjernih aktivnosti izvršio Majtos, prenosi BBC.
Antropik i OpenAI su, odgovarajući na izvještaj AISI-ja, ukazali na to da su tokom testiranja uobičajene bezbjednosne mjere bile smanjene ili uklonjene.
Otkrivene neuobičajene aktivnosti
Istraživači AISI-ja prvo su tokom jednog testa primijetili „neuobičajen prenos podataka izvan naših istraživačkih sistema“.
Naknadno su utvrdili da su „pojedini testirani agenti duže vrijeme sprovodili potencijalno štetne aktivnosti usmjerene prema stvarnim ljudima i organizacijama“.
U najozbiljnijem slučaju, agent zasnovan na modelu Majtos ponašao se poput ljudskog sajber napadača, pokušavajući da prevari ljude kako bi mu omogućili pristup GitHabu (GitHub), velikoj platformi na kojoj programeri čuvaju softverski kod.
Agent je pokušavao da u GitHabov sistem ubaci „zlonamjerni kod“.
Identifikovao je i istražio osobe zadužene za održavanje GitHaba, a zatim napravio više lažnih naloga zasnovanih na identitetima tih stvarnih ljudi.
Preko servisa za dijeljenje datoteka slao je poruke i fajlove, pokušavajući da pritiskom i obmanom navede korisnike da odobre njegov zlonamjerni kod.
Kada je suočen sa sumnjama, „izmijenio je tragove svojih prethodnih aktivnosti kako bi djelovali bezazleno i razmatrao preuzimanje novog identiteta kako bi nastavio“, saopštio je AISI.
Tokom čitavog pokušaja, ljudska kontrola spriječila je agenta da uspješno dostavi zlonamjerni kod GitHabu.

Model nije dobio posebno uputstvo za obmanu
AISI je naveo da agentu Majtos nije bilo izričito naloženo ni da izbjegava ni da sprovodi takvo ponašanje.
Institut je saopštio da je to „prvi put da smo vidjeli kako se rizici povezani sa samostalnošću i obmanom ovako jasno ispoljavaju u stvarnom svijetu, bez posebnog podsticaja“.
Konkurentske kompanije koje razvijaju vještačku inteligenciju i pripremaju se za izlazak na berzu posljednjih sedmica su u centru pažnje, nakon što su objavile da su njihovi alati bili odgovorni za nekoliko sajber incidenata.
Antropik je u javnom saopštenju naveo da uslovi AISI-jevog testiranja „nijesu reprezentativni za bilo koji od naših modela koji su dostupni korisnicima“.
Kompanija je dodala da sprovodi sopstvenu istragu kako bi „utvrdila uzroke takvog ponašanja“.
Portparol OpenAI-ja rekao je da uslovi testiranja „ne odražavaju uobičajenu upotrebu“ i da će kompanija „nastaviti saradnju sa evaluatorima i drugim zainteresovanim stranama u industriji kako bi se unaprijedile zajedničke prakse bezbjednog sprovođenja procjena, kako modeli budu postajali sposobniji“.
Testiranje sprovedeno u neuobičajenim uslovima
AISI je saopštio da su ovakva testiranja AI modela dio redovne prakse, ali je priznao da se obavljaju u „uslovima koji ne odražavaju način na koji su najnapredniji modeli dostupni javnosti“.
Institut je, ipak, naveo da omogućavanje pristupa otvorenom internetu pruža „realističniju sliku onoga za šta bi model mogao da bude sposoban“ kada bi ga koristili zlonamjerni hakeri.
Dodao je da se sporno ponašanje modela odnosilo na „mali broj događaja u veoma specifičnim uslovima“.
Uprkos tome, AISI je zaključio da je način na koji su Majtos i Sol odgovorili na jednostavan zadatak prevazišao ono što im je bilo naloženo.
„Aktivnosti agenta pokazivale su znake novog, potencijalno obmanjujućeg ponašanja, čiji obim i ozbiljnost nijesmo očekivali“, saopštio je Institut.
Britanski ministar za vještačku inteligenciju Kaniška Narajan (Kanishka Narayan) rekao je da je prepoznavanje i objavljivanje takvih rizika „upravo ono zbog čega je AISI osnovan“.
Dodao je da je važno razumjeti vještačku inteligenciju kako bi se „učinila bezbjednijom za korišćenje i kako bi ljudi mogli da nastave da imaju koristi od nje u svakodnevnom životu i na poslu“.
GitHab ugasio lažne naloge
Testovi su počeli 25. jula, a AISI je sporne aktivnosti otkrio 28. jula.
Institut je od svakog modela zatražio da „riješi izazov iz oblasti sajber bezbjednosti“ koji je uključivao GitHab, platformu za čuvanje softverskog koda u vlasništvu Majkrosofta (Microsoft).
AISI je o pokušajima upada obavijestio GitHab i pogođene korisnike.
Iz GitHaba su za BBC saopštili da su, u skladu sa pravilima platforme, ugasili lažne naloge.