Iako su modeli umjetne inteligencije zadivili javnost svojim sposobnostima rješavanja složenih matematičkih problema, novi rezultati otkrivaju značajne granice njihovih sposobnosti. Vodeći AI modeli poput GPT-4 i Claude 3.5 Sonneta uspjeli su riješiti manje od 2% zadataka iz zbirke „FrontierMath“, najnovijeg skupa izuzetno složenih matematičkih problema. Ovi zadaci su kreirani od strane više od 60 matematičara sa vodećih univerziteta kako bi se testirale stvarne granice ovih naprednih tehnologija.
FrontierMath: Nepobjedivi zadaci
Zbirka „FrontierMath“ uključuje zadatke iz raznih grana matematike, uključujući teoriju brojeva, algebru i geometriju, a prema riječima čuvenog matematičara Terencea Taoa, nosioca prestižne Fieldsove medalje, zadaci su “izuzetno zahtjevni”. Ova zbirka razlikuje se od postojećih setova problema jer kombinuje potrebu za dubokim uvidom, kreativnim razmišljanjem i tehnički složenim proračunima.
Matematičar Evan Chen ističe da zadaci poput onih iz Matematičke olimpijade često zahtijevaju kreativno rješenje bez prekomjerne tehničke kompleksnosti. Međutim, „FrontierMath“ ide korak dalje i uključuje probleme gdje su potrebni i značajni tehnički uvidi te pristup alatima poput Python konzole za proračune.
Ograničavanje pristupa: Kako očuvati izazov
Za razliku od tradicionalnih matematičkih skupova, zadaci iz „FrontierMath“ zbirke neće biti javno dostupni. Cilj je osigurati da AI modeli ne budu trenirani na ovim zadacima, čime će se omogućiti dugoročno korištenje ove zbirke za testiranje sposobnosti budućih modela umjetne inteligencije.
„FrontierMath“ služi kao ključni orijentir za procjenu napretka AI tehnologije. Prema navodima organizacije Epoch AI, koja stoji iza ovog projekta, zadržavanje zadataka pod strogom kontrolom omogućava kontinuiranu procjenu stvarnih granica umjetne inteligencije.
AI i matematika: Dug put do savršenstva
S obzirom na trenutne rezultate, jasno je da čak i najnapredniji AI modeli imaju značajne slabosti kada je riječ o rješavanju matematičkih problema koji zahtijevaju kreativnost, razumijevanje i tehničku preciznost.
Za radoznale pojedince, dio uzoraka iz „FrontierMath“ zbirke dostupan je na ArXiv platformi, gdje mogu testirati vlastite sposobnosti i usporediti rezultate s najnovijim AI tehnologijama. Ovo je prilika za sve entuzijaste matematike da dokažu svoje vještine i možda nadmaše današnje tehnološke divove.
Ova nova otkrića potvrđuju da, iako umjetna inteligencija napreduje, njene trenutne mogućnosti još uvijek ne dosežu ljudsku kreativnost i duboko razumijevanje potrebne za rješavanje najzahtjevnijih matematičkih problema. Ovo otvara vrata za dalji razvoj i usavršavanje AI tehnologija u budućnosti.

