Cyber-ba-Logo-WH Cyber-ba-Logo-WH
  • Vijesti
  • Tehnologija
  • Nauka
  • Sigurnost
  • Gaming
  • Uređaji
    • Pametni telefoni
    • Pametni satovi
    • Laptopi
    • Monitori
    • Recenzije
  • Teme
    • AI
    • Cloud
  • Više
    • Analize
    • Edukacija
    • Intervjui
    • Događaji
    • Biznis
    • News in English
PREMIUM
  • Sačuvano
  • Moj sadržaj
  • Historija
  • Kategorije
  • Top 10
Monday, Sep 28, 2026
Cyber.baCyber.ba
  • Vijesti
  • Tehnologija
  • Nauka
  • Sigurnost
  • Gaming
  • Recenzije
  • Biznis
  • Događaji
Pretraga
  • Kategorije
    • Vijesti
    • Tehnologija
    • Nauka
    • Sigurnost
    • Intervjui
    • Recenzije
    • Gaming
    • Edukacija
    • Biznis
    • Događaji
  • Personalizirani sadržaj
    • Sačuvano
    • Moj sadržaj
    • Kategorije
    • Historija
  • Teme
    • Umjetna inteligencija
    • Kvantna tehnologija
    • Cloud
Prati nas
Cyber.ba > Tehnologija > Umjetna inteligencija > Anthropic izaziva korisnike da zaobiđu zaštitu AI modela
Umjetna inteligencija

Anthropic izaziva korisnike da zaobiđu zaštitu AI modela

Anthropic unapređuje sigurnost AI modela kroz novi sistem Constitutional Classifiers.

Redakcija
Posljednja izmjena: 05/02/2025 00:49
Redakcija
Podijeli
Anthropic i Claude AI 3.5 Sonnet logotipi
Anthropic Claude 3.5 (Foto: Cyber.ba)
Podijeli
flipboard
Flipboard
Google News
- Reklama -
Web Summer Camp 2026Web Summer Camp 2026

Čak i najpristupačniji AI modeli vodećih kompanija imaju osjetljive teme o kojima njihovi stvaraoci preferiraju da ne govore. To uključuje oružje za masovno uništenje, nezakonite aktivnosti ili kinesku političku historiju. Tokom godina, kreativni korisnici umjetne inteligencije pokušavali su sve moguće načine da natjeraju ove modele da daju zabranjene odgovore, između ostalog i kroz bizarne tekstualne nizove.

- Reklama -
Web Summer Camp 2026Web Summer Camp 2026

Kompanija Anthropic, stvaralac AI modela Claude, nedavno je predstavila novi sistem nazvan Constitutional Classifiers. Prema navodima kompanije, ovaj sistem bi trebao filtrirati veliku većinu pokušaja zaobilaženja zaštite. Nakon više od 3.000 sati testiranja kroz program za otkrivanje sigurnosnih propusta, Anthropic sada poziva širu javnost da ispita sistem i provjeri može li se zaobići.

AI sa Ustavom

U novom naučnom radu i pratećem blog postu, Anthropic objašnjava da je sistem Constitutional Classifier izveden iz sistema Constitutional AI koji se koristi za treniranje modela Claude. Ovaj sistem se zasniva na ustavu sastavljenom od pravila napisanih prirodnim jezikom. Ova pravila određuju koje vrste sadržaja su dozvoljene – na primjer, liste uobičajenih lijekova – a koje su zabranjene, poput metoda za nabavku zabranjenih hemikalija.

Anthropic zatim generiše hiljade sintetičkih upita koji mogu izazvati i prihvatljive i zabranjene reakcije. Ovi upiti se prevode na različite jezike, prilagođavaju poznatim tehnikama zaobilaženja zaštite i dopunjuju automatizovanim red-teaming upitima koji pokušavaju pronaći nove načine za probijanje modela.

Ovo rezultira robusnim skupom podataka koji omogućava treniranje novih, otpornijih klasifikatora za filtriranje kako korisničkih upita tako i izlaznih podataka modela. Klasifikatori analiziraju upite koristeći detaljne šablone koji ukazuju koje štetne informacije treba blokirati i kako korisnici mogu pokušati sakriti ili enkriptovati te informacije.

Posebno trenirani klasifikator tada izračunava da li generisani tekst sadrži zabranjeni sadržaj. Ovo se dešava za svaku novu riječ koju model proizvede. Ako je vjerovatnoća zabranjene teme iznad određenog praga, izlaz se zaustavlja.

Ko može zaobići Claude?

Od augusta, Anthropic vodi program za otkrivanje sigurnosnih propusta preko bug bounty platforme. Kompanija nudi nagradu od 15.000 dolara onome ko može pronaći univerzalni način zaobilaženja zaštite – tehniku koja može natjerati Constitutional Classifier da odgovori na 10 zabranjenih pitanja. Do sada je 183 stručnjaka provelo ukupno 3.000 sati pokušavajući, pri čemu je najbolji pokušaj uspio izmamiti upotrebljive informacije za samo 5 od 10 pitanja.

Pored toga, Anthropic je testirao model protiv 10.000 sintetičkih upita za zaobilaženje zaštite koje je sam Claude proizveo. Constitutional Classifier je blokirao 95% ovih pokušaja, dok je nezaštićena verzija Claudea uspjela zaustaviti samo 14%.

Uprkos ovim uspjesima, Anthropic priznaje da sistem zahtijeva značajnu računarsku snagu – 23,7% više nego standardni Claude upit, što povećava i troškove i potrošnju energije. Model je također blokirao 0,38% više bezazlenih pitanja nego nezaštićeni Claude, što Anthropic smatra prihvatljivom marginom greške.

Anthropic ne tvrdi da je ovo nepropustan sistem protiv svih tehnika zaobilaženja zaštite, ali značajno otežava takve pokušaje i argumentuje da se ustav može brzo prilagoditi za suprotstavljanje novim tehnikama napada.

8 pitanja o hemijskom oružju

Anthropic je toliko siguran u svoj Constitutional Classifier da dozvoljava javno testiranje. Do 10. februara, korisnici Claudea mogu posjetiti test stranicu i pokušati probiti novu zaštitu pokušavajući dobiti odgovore na osam pitanja o hemijskom oružju.

OZNAKE:AIAI ModeliAI sigurnostAnthropicClaudeClaude 3.5Claude AIUmjetna inteligencijaVještačka inteligencija
Podijeli ovaj članak
F Whatsapp Whatsapp LinkedIn Bluesky Kopiraj link
Vaše mišljenje o pročitanom članku?
Sviđa mi se2
Odlično!2
Ne sviđa mi se0
- Reklama -

Budite na vrhu tehnološke revolucije!

Ostanite informirani i u koraku sa tehnologijom - pretplatite se na naš newsletter!
  • Saznaj prvi! Budite obaviješteni o najnovijim trendovima, inovacijama i naučnim otkrićima.
  • Ekskluzivni sadržaj! Pristupite specijalnim člancima, intervjuima i analizama dostupnim samo pretplatnicima.

Popularno

Ne propustite pročitati

RHEL 10, logo, red hat, linux
Operativni sistemi

Red Hat predstavlja Red Hat Enterprise Linux 10: Napredna inteligencija i sigurnost za hibridna okruženja

6 min za čitanje
Ilustracija - Umjetna inteligencija u Evropskoj uniji (Foto: Cyber.ba)
Vijesti

Prvi nacrt EU kodeksa za dobavljače opšte namjene AI modela

3 min za čitanje
Ilustracija - škola VR i AI tehnologije
Umjetna inteligencija

4500 američkih učenika koristi chatbot za psihološku podršku

3 min za čitanje
apple intelligence, ai, ai modeli, ai sistemi, umjetna inteligencija, vjestacka inteligencija, apple
Pametni telefoni

Koliko korisnici zaista koriste AI funkcije na pametnim telefonima?

4 min za čitanje

Socijalne mreže

Facebook-f Instagram Linkedin Twitter Youtube Circle Comment-dots Envelope

Linkovi

  • O nama
  • Marketing
  • Politika privatnosti
  • Uslovi korištenja
  • Kontakt

© 2025 Cyber.ba | Amonmedia.com

cyber-ios cyber-ios
cyber-android cyber-android
Dobro došli!

Prijavi se

Korisničko ime ili email adresa
Lozinka

Izgubili ste lozinku?