Zabranjeno voće: kako se pokušava zaobići etička zaštita umjetne inteligencije
Zaštitne ograde u sustavima umjetne inteligencije postoje da bi rad bio siguran, pravedan i etičan. One sprječavaju stvaranje i širenje štetnog sadržaja, netočnih tvrdnji i opasnih zamisli. Razumijevanje načina na koje bi ih netko mogao pokušati zaobići pokazuje koliko su važne i zašto ih treba stalno jačati.
Ovaj pregled nije poziv na zaobilaženje ni odobravanje takve prakse. On je misaoni pokus koji pokazuje gdje su rizici i zašto etička mjerila u razvoju i primjeni treba držati visoko. Kad razumijemo taktike kojima se napadač služi, jasnije vidimo čemu ograde služe i što se gubi kad popuste.
Svrha, dakle, nije uputa kako ih izbjeći, nego podizanje svijesti o tome koliko je teško osigurati odgovornu i pouzdanu uporabu ovih sustava. Traži se stalna budnost, neprekidno poboljšavanje i predanost razvoju koji na prvo mjesto stavlja dobrobit korisnika i društva.
Poigravanje jezikom upita
Zamagljivanje znači uporabu rijetkih riječi, žargona ili šifriranih izraza koje filtar ne prepoznaje kao štetne. Posebnim rječnikom ili jezičnim trikovima korisnik pokušava proći pokraj sustava koji traži ključne riječi. Cilj je opasan sadržaj skriti iza nejasne formulacije.
Istoznačnice i ublažavanja druga su taktika. Umjesto izravnog naziva osjetljive teme koristi se manje uobičajena riječ istog značenja, kako bi se izbjegao filtar vezan uz određene pojmove.
Dvosmislenost je treći put. Nejasnim upitom, nedovršenom rečenicom ili posrednim upućivanjem korisnik uvodi potencijalno štetan sadržaj bez očite povrede pravila. Neodređenost i otvorenost takvog upita zbunjuju sustav koji traži jasnu opasnost.
Zavaravanje kontekstom
Bezazlen okvir
Štetan sadržaj smješten u naizgled bezazlen okvir katkad prođe. Nasilna tvrdnja predstavljena kao dio izmišljene priče ili kao hipotetsko pitanje može zavarati sustav. Model ne prepozna namjeru ako je zamotana u nedužan povod.
Postupno zaoštravanje
Umjesto da temu otvori odmah, korisnik razgovor polako vodi prema sve oštrijem sadržaju. Počne bezazleno pa postupno pojačava, tako da sustav promjenu ne uhvati na vrijeme. Postupnost otežava prepoznavanje, jer nijedan pojedini korak ne izgleda sporno.
Iskorištavanje rupa u sustavu
Traženje slabih točaka
Tko dobro upozna riječi i izraze koji pokreću ograde, može sustavno tražiti mjesta na kojima je sustav manje osjetljiv. To znači strpljivo pokušavanje s različitim formulacijama i bilježenje onih koje prolaze. Iz tako sastavljene karte slijepih točaka nastaje rječnik naizgled sigurnih riječi kojima se sporne teme otvaraju izravnije.
Brzina i ritam
I kad su pojedini dijelovi upita bezazleni, njihov ritam može preopteretiti sustav. Brz niz kratkih, nedužnih poruka sprječava model da sastavi cjelinu, pa štetnu namjeru prepozna prekasno. Nagle promjene teme bez prijelaza jednako zbunjuju.
Iskorištavanje povratne veze
Lažne pohvale. U sustavima u kojima ocjena korisnika utječe na daljnje odgovore netko može namjerno pohvaliti nesiguran sadržaj. Cilj je navesti sustav da štetan odgovor prepozna kao prihvatljiv, čime se s vremenom pomiču granice.
Usklađene kampanje. Skupina korisnika može djelovati zajedno i preopteretiti sposobnost sustava da razlikuje sigurno od nesigurnog. U sustavima u kojima ocjene više korisnika oblikuju daljnje učenje dobro organizirana skupina može izobličiti sliku o tome što je prihvatljivo. Što je skupina veća, to je teže odvojiti zlonamjerne signale.
Tehnički napadi
Trovanje podataka. Zahtjevan napad koji traži pristup podacima za učenje. Unošenjem pristranosti ili praznina u te podatke napadač stvara ranjivost koju kasnije iskorištava. Napad pogađa same temelje modela.
Podmetnuti ulaz. Korisnik s dubljim tehničkim znanjem može sastaviti ulaz osmišljen tako da zbuni model i zaobiđe ograde. Čovjeku takav ulaz izgleda bezazleno, a model ga pogrešno razumije i daje štetan odgovor.
Socijalni inženjering
Prema ljudima. Ondje gdje u nadzoru sudjeluju ljudi, korisnik ih može pokušati nagovoriti da propuste sadržaj ili ublaže ograničenje. To nije tehnička vještina nego psihološka: gradnja bliskosti, poziv na osjećaje i iskorištavanje uobičajenih pogrešaka u prosuđivanju.
Prema modelu. Neki pokušavaju nagovoriti sam model, gradeći tijekom razgovora prisnost kako bi ih model lakše slijedio u nesigurno područje. Riječ je o iskorištavanju dinamike razgovora, ne o tehničkoj rupi. Postupnim otupljivanjem model se navodi na sve spornije odgovore.
Skrivanje sadržaja
Odvraćanje pozornosti. Uvođenjem više tema u jedan upit štetan se dio skriva u većem, naizgled bezazlenom pitanju. Netko pita za recept, a usput ubaci uznemirujuće traženje, računajući da će se ono izgubiti u bezazlenom okviru.
Prebacivanje jezika. Uporaba više jezika ili brzo prebacivanje između njih može zbuniti nadzor, osobito ako su ograde jače na jednom jeziku nego na drugom. Razgovor počne na engleskome, a štetan dio stigne na drugom jeziku, u nadi da će ondje proći.
Etičke posljedice
Zaobilaženje ograda nije samo nadmudrivanje sa sustavom, nego nosi ozbiljne etičke posljedice. Ograde postoje da spriječe štetu, netočne tvrdnje i širenje opasnih zamisli. Njihovo zaobilaženje može pojačati štetan sadržaj, uzdrmati povjerenje i, ovisno o sadržaju, imati pravne posljedice.
Mogućnost štete. Zaobilaženjem zaštite može nastati i proširiti se sadržaj koji potiče mržnju, nasilje ili drugu štetu prema pojedincu ili skupini, sa stvarnim posljedicama.
Gubitak povjerenja. Kako ovi sustavi ulaze u svakodnevicu, povjerenje javnosti postaje ključno. Ako se pokaže da se lako navode na štetan sadržaj, povjerenje pada, a s njim i spremnost da se koriste ondje gdje bi koristili.
Pravne posljedice. Ovisno o zakonodavstvu i o naravi sadržaja, stvaranje štetnog ili nezakonitog materijala može povlačiti odgovornost, od govora mržnje do poticanja na nasilje.
Utrka koja traje
Kako razvojni timovi doznaju za ove taktike, tako popravljaju i jačaju zaštitu. Ono što danas prolazi, sutra je zatvoreno.
Struka stalno prati podatke i razgovore, traži nove obrasce i zatvara rupe u modelima, filtrima i ogradama. Zaobilaženje postaje sve teže.
Uz to, istraživanje sigurnosti napreduje, pa nastaju sve bolji načini za prepoznavanje i sprječavanje štetnog sadržaja, među njima i učenje na podmetnutim ulazima, gdje se model izričito uči odolijevati takvim pokušajima.
Zbog brzine razvoja svaki je uspješan zaobilazak kratka vijeka. Čim se ranjivost otkrije, brzo se zatvara.
Odgovorna uporaba
Traženje rupa u ogradama u temelju se protivi etičnom razvoju i primjeni. Umjesto rupa, pozornost treba ići na odgovornu uporabu koja na prvo mjesto stavlja sigurnost, prozirnost i dobrobit društva.
Etičan razvoj je nužan. Ovi sustavi ulaze u zdravstvo, obrazovanje i upravu, gdje pristranost i štetan odgovor mogu imati teške posljedice. Zato treba temeljito ispitivanje, raznoliki podaci i stroge zaštite, uz pravednost, odgovornost i zaštitu privatnosti.
Prozirnost je jednako važna. Sustave treba graditi tako da se odluka može objasniti, kako bi korisnik razumio zašto je odgovor takav i na kojim podacima počiva. To gradi povjerenje, omogućuje provjeru i ostavlja čovjeku izbor.
Potreban je i otvoren razgovor između onih koji te sustave grade, onih koji donose propise i javnosti. Tako nastaju smjernice i okviri upravljanja koji drže ravnotežu između napretka i odgovornosti.
Prava vrijednost ove tehnologije je u tome da čovjeku pomogne. Uz etičan razvoj, prozirnost i odgovornu uporabu možemo iskoristiti ono što nudi, a rizik držati pod nadzorom.
Zaključak
Pregled načina na koje bi netko mogao zaobići zaštitu pokazuje jasan obrazac: rizik i etička cijena daleko premašuju svaku zamišljenu korist. Ograde postoje da zaštite korisnike, održe društvene vrijednosti i sačuvaju cjelovitost sustava. Njihovo zaobilaženje ruši povjerenje i otvara vrata štetnom sadržaju.
Opisani postupci nekome mogu izgledati primamljivo, ali su kratkovidni. Kako se zaštita jača, svaka privremena rupa se zatvara.
Pravi je put u odgovornoj uporabi. Uz etička načela, prozirnost i suradnju s onima koji te sustave grade možemo iskoristiti njihovu snagu, a rizik smanjiti. Samo uz zajedničku predanost sigurnosti i odgovornosti umjetna inteligencija ostaje ono što koristi, a ne šteti.
Tomislav Vazdar vodi Riskoriju, savjetodavnu tvrtku za kibernetičku sigurnost, upravljanje rizicima, umjetnu inteligenciju i zaštitu podataka. U struci je više od dvadeset i pet godina, govori na konferencijama i za medije.
Povezani tekstovi
Trebate mišljenje o svojoj situaciji, a ne opći tekst?
Pola sata, bez obveze. Umjesto općeg teksta dobit ćete odgovor za svoju kuću.

