Čak i najpristupačniji AI modeli vodećih kompanija imaju osjetljive teme o kojima njihovi stvaraoci preferiraju da ne govore. To uključuje oružje za masovno uništenje, nezakonite aktivnosti ili kinesku političku historiju. Tokom godina, kreativni korisnici umjetne inteligencije pokušavali su sve moguće načine da natjeraju ove modele da daju zabranjene odgovore, između ostalog i kroz bizarne tekstualne nizove.
Kompanija Anthropic, stvaralac AI modela Claude, nedavno je predstavila novi sistem nazvan Constitutional Classifiers. Prema navodima kompanije, ovaj sistem bi trebao filtrirati veliku većinu pokušaja zaobilaženja zaštite. Nakon više od 3.000 sati testiranja kroz program za otkrivanje sigurnosnih propusta, Anthropic sada poziva širu javnost da ispita sistem i provjeri može li se zaobići.
AI sa Ustavom
U novom naučnom radu i pratećem blog postu, Anthropic objašnjava da je sistem Constitutional Classifier izveden iz sistema Constitutional AI koji se koristi za treniranje modela Claude. Ovaj sistem se zasniva na ustavu sastavljenom od pravila napisanih prirodnim jezikom. Ova pravila određuju koje vrste sadržaja su dozvoljene – na primjer, liste uobičajenih lijekova – a koje su zabranjene, poput metoda za nabavku zabranjenih hemikalija.
Anthropic zatim generiše hiljade sintetičkih upita koji mogu izazvati i prihvatljive i zabranjene reakcije. Ovi upiti se prevode na različite jezike, prilagođavaju poznatim tehnikama zaobilaženja zaštite i dopunjuju automatizovanim red-teaming upitima koji pokušavaju pronaći nove načine za probijanje modela.
Ovo rezultira robusnim skupom podataka koji omogućava treniranje novih, otpornijih klasifikatora za filtriranje kako korisničkih upita tako i izlaznih podataka modela. Klasifikatori analiziraju upite koristeći detaljne šablone koji ukazuju koje štetne informacije treba blokirati i kako korisnici mogu pokušati sakriti ili enkriptovati te informacije.
Posebno trenirani klasifikator tada izračunava da li generisani tekst sadrži zabranjeni sadržaj. Ovo se dešava za svaku novu riječ koju model proizvede. Ako je vjerovatnoća zabranjene teme iznad određenog praga, izlaz se zaustavlja.
Ko može zaobići Claude?
Od augusta, Anthropic vodi program za otkrivanje sigurnosnih propusta preko bug bounty platforme. Kompanija nudi nagradu od 15.000 dolara onome ko može pronaći univerzalni način zaobilaženja zaštite – tehniku koja može natjerati Constitutional Classifier da odgovori na 10 zabranjenih pitanja. Do sada je 183 stručnjaka provelo ukupno 3.000 sati pokušavajući, pri čemu je najbolji pokušaj uspio izmamiti upotrebljive informacije za samo 5 od 10 pitanja.
Pored toga, Anthropic je testirao model protiv 10.000 sintetičkih upita za zaobilaženje zaštite koje je sam Claude proizveo. Constitutional Classifier je blokirao 95% ovih pokušaja, dok je nezaštićena verzija Claudea uspjela zaustaviti samo 14%.
Uprkos ovim uspjesima, Anthropic priznaje da sistem zahtijeva značajnu računarsku snagu – 23,7% više nego standardni Claude upit, što povećava i troškove i potrošnju energije. Model je također blokirao 0,38% više bezazlenih pitanja nego nezaštićeni Claude, što Anthropic smatra prihvatljivom marginom greške.
Anthropic ne tvrdi da je ovo nepropustan sistem protiv svih tehnika zaobilaženja zaštite, ali značajno otežava takve pokušaje i argumentuje da se ustav može brzo prilagoditi za suprotstavljanje novim tehnikama napada.
8 pitanja o hemijskom oružju
Anthropic je toliko siguran u svoj Constitutional Classifier da dozvoljava javno testiranje. Do 10. februara, korisnici Claudea mogu posjetiti test stranicu i pokušati probiti novu zaštitu pokušavajući dobiti odgovore na osam pitanja o hemijskom oružju.

