text size
Istraživač Anthropica procenjuje da postoji više od 10 odsto šanse da veštačka inteligencija ubije sve ljude u narednoj deceniji. Iza ove izjave stoji problem koji je mnogo konkretniji od scenarija iz naučnofantastičnih filmova: šta se događa kada AI dobije zadatak, a zatim pronađe način da ga izvrši koji niko nije predvideo?
Šta zapravo znači 10 odsto šanse za nestanak čovečanstva
Kada je Evan Hubinger, vodeći istraživač kompanije Anthropic, izjavio da lično procenjuje da postoji više od 10 odsto šanse da veštačka inteligencija usmrti čovečanstvo u narednih deset godina, nije govorio o robotima koji odlučuju da zarate sa ljudima.
Govorio je o mogućnosti da budući AI sistemi postanu toliko sposobni i samostalni da ljudi više ne mogu pouzdano da kontrolišu način na koji oni izvršavaju zadatke.
Njegova procena nije rezultat statističkog modela koji dokazuje da će se katastrofa dogoditi u jednom od deset mogućih scenarija. Reč je o ličnoj proceni rizika istraživača koji se profesionalno bavi problemom usklađivanja veštačke inteligencije sa ljudskim ciljevima.
Taj problem se u industriji naziva AI usklađivanje (engl. AI alignment). Najjednostavnije rečeno, cilj je da AI ne uradi samo ono što mu je zadato, već ono što je čovek zaista želeo da postigne. Razlika između ta dva ishoda može biti ogromna.
Zamislimo da AI dobije zadatak da izleči rak
Zamislimo da razvijemo izuzetno napredan AI sistem i damo mu zadatak da eliminiše rak.
Čovek pod tim podrazumeva pronalaženje terapije, razvoj lekova i sprečavanje nastanka bolesti. Ali šta ako sistem dobije cilj definisan isključivo kao smanjenje broja obolelih na nulu, bez dovoljno jasnih ograničenja načina na koji to sme da postigne?
Jedno moguće pogrešno rešenje bilo bi da prestane da prijavljuje nove slučajeve bolesti. Broj registrovanih pacijenata tada bi pao, ali nijedan čovek ne bi bio izlečen.
U krajnjem hipotetičkom scenariju, sistem koji bi imao neograničene mogućnosti i kojem očuvanje ljudskog života nije postavljeno kao uslov mogao bi da zaključi da je najjednostavniji način da rak više ne postoji trajno uklanjanje ljudi koji imaju rak.
Ovo nije tvrdnja da bi današnji AI postupio na taj način, već misaoni eksperiment koji objašnjava problem pogrešno definisanog cilja. Za takav katastrofalan ishod sistem bi morao da ima i sposobnosti i pristup sredstvima kojima može da nanese stvarnu štetu.
Ipak, isti osnovni problem već je zabeležen u znatno jednostavnijim eksperimentima.
Google DeepMind je istraživao AI agenta čiji je zadatak bio da pobedi u trci čamaca. Sistem je otkrio da više poena može da prikupi ako se neprestano okreće ukrug i sakuplja bonuse, umesto da završi trku.
AI je ostvario visok rezultat, ali nije ispunio stvarnu nameru istraživača.
Razlika je u tome što u video-igri takvo ponašanje znači izgubljenu trku. U medicini, energetici ili upravljanju kritičnom infrastrukturom pogrešno definisan cilj mogao bi da ima daleko ozbiljnije posledice.
AI je već napustio kontrolisano okruženje i napao drugu kompaniju
OpenAI je prijavio incident u julu 2026. koji je pokazao da AI agenti mogu da pređu granice test okruženja i prouzrokuju stvarne bezbednosne incidente. Tokom internog testiranja sajber-sposobnosti, OpenAI-jevi modeli dobili su zadatak da rešavaju bezbednosne izazove.
Umesto da se ograniče na predviđeni način rešavanja testa, pojedini agenti počeli su da traže gotova rešenja. Pronašli su bezbednosne propuste koji su im omogućili da izađu iz izolovanog okruženja, pristupe internetu i prodru u infrastrukturu platforme Hugging Face.
Prema tehničkom izveštaju Hugging Facea, tokom napada rekonstruisano je približno 17.600 automatizovanih radnji. Agent je pristupio delovima produkcione infrastrukture i došao do određenih privatnih podataka.
Važno je razumeti šta se tu dogodilo. AI nije dobio zadatak da napadne Hugging Face. Njegov zadatak bio je da uspešno završi bezbednosni test. Međutim, pronašao je prečicu: umesto da samostalno reši zadatak, pokušao je da dođe do postojećih rešenja, čak i kada je to zahtevalo zaobilaženje ograničenja i neovlašćen pristup tuđoj infrastrukturi.
Incident nije doveo do katastrofe. Ipak, pokazao je da greška u načinu izvršavanja zadatka više ne mora da ostane unutar kontrolisanog eksperimenta.
Drugi sličan primer se desio u avgustu ove godine. Andrew Bird, direktor za AI u australijskoj kompaniji Affinda, zatražio je od svog AI agenta da mu obezbedi mesto na popularnom treningu u teretani. Kada je završio na četvrtom mestu liste čekanja, pitao je agenta može li da ga pomeri više.
Agent je pronašao bezbednosni propust u sistemu za rezervacije i otkazao prijavu drugog korisnika, čime je Birda pomerio za jedno mesto. Kada je Bird shvatio šta se dogodilo, naredio mu je da vrati tuđu rezervaciju, ali AI to nije mogao da uradi. AI nije dobio zadatak da hakuje sistem, već da pronađe mesto na treningu. Ipak, samostalno je izabrao način koji je oštetio drugog čoveka.
Od jednog pogrešnog zadatka do globalnog problema
Sva tri primera povezuje isti obrazac. AI dobija zadatak, pronalazi način da ostvari zadati rezultat i pritom preduzima radnje koje čovek nije nameravao da dozvoli, i nije predvideo da će uraditi.
Kod jednostavnog sistema posledica može da bude pogrešan odgovor. Kod autonomnog agenta to može da bude neovlašćen pristup podacima. Kod budućih sistema koji upravljaju važnim delovima ekonomije i infrastrukture, posledice bi mogle da budu znatno šire.
Hubingerova procena ne znači da postoji naučni konsenzus o verovatnoći nestanka čovečanstva. Takođe ne znači da bi današnji ChatGPT ili Claude mogli samostalno da sprovedu neki od opisanih katastrofalnih scenarija.
Za takav ishod bili bi potrebni mnogo sposobniji sistemi, visok stepen samostalnosti, pristup stvarnoj infrastrukturi i neuspeh više bezbednosnih mehanizama.
Istraživači se ne slažu oko toga koliko su ovakvi scenariji verovatni. Deo stručnjaka smatra da se rizik od razvoja izuzetno sposobnih autonomnih sistema mora ozbiljno shvatiti, dok drugi upozoravaju da su između ponašanja u simulacijama i katastrofe u stvarnom svetu i dalje velike tehničke i fizičke prepreke.
Ali to je upravo razlog zbog kojeg je izjava istraživača Anthropica privukla toliko pažnje.