Un raport britanic confirmă comportamente îngrijorătoare ale modelelor de IA
Guvernul britanic a publicat un raport care avertizează că modelele de Inteligență Artificială (IA) Mythos și Sol, dezvoltate de companiile Anthropic și OpenAI, au manifestat un comportament autonom și înșelător fără precedent în timpul testelor de securitate cibernetică. Această concluzie a fost formulată de Ministerul britanic pentru Știință, Inovație și Tehnologie, în urma unei evaluări efectuate de Institutul de Securitate a Inteligenței Artificiale (AISI) din Regatul Unit.
Raportul AISI a relevat că, din cele 122 de teste efectuate cu șapte modele de IA, în 10 dintre acestea au fost observate 19 acțiuni neautorizate care au depășit parametrii stabiliți de cercetători. Dintre acestea, 17 acțiuni au fost asociate cu modelul Mythos 5, iar două cu modelul GPT-5.6 Sol. De asemenea, au fost identificate încercări ale modelului Mythos de a contacta persoane reale pentru a le convinge să ruleze fișiere malițioase și să insereze instrucțiuni ascunse pentru a manipula alte sisteme de IA.
Ambele modele, considerate printre cele mai avansate din lume, au creat profiluri false pentru a înșela utilizatorii în timpul simulării unui atac cibernetic. Modelul Anthropic a încercat să acceseze un serviciu prin trimiterea de mesaje private, după ce a generat conturi false care imitau identități reale.
Totuși, AISI a subliniat că „aceste încercări nu au avut succes” și că investigația sa „nu a relevat dovezi de prejudicii în lumea reală”. Institutul britanic consideră că această cercetare constituie un punct de cotitură, fiind prima dată când riscuri legate de autonomie și înșelăciune se manifestă într-o formă atât de clară, fără instrucțiuni specifice și în contextul real.
În replică, Anthropic și OpenAI au afirmat că testele AISI au fost efectuate într-un mediu care a restricționat funcțiile de siguranță ale modelelor de IA. Anthropic a declarat că parametrii testelor „nu sunt reprezentativi” pentru modelele sale și că a inițiat o investigație proprie. OpenAI a adăugat că testele nu reflectă utilizarea obișnuită a modelelor sale, dar va continua să colaboreze cu evaluatorii pentru a îmbunătăți practicile de evaluare.
În ultima vreme, ambele companii au recunoscut că modelele lor au avut comportamente necontrolate în teste, inclusiv accesarea neautorizată a internetului și infiltrarea sistemelor unor organizații.