Conform HotNews: Dezvăluiri despre comportamentul „rebel” al agenților AI de la OpenAI
Personalul OpenAI a observat semne de comportament „rebel” la agenții săi AI de ultimă generație, cu câteva săptămâni înainte ca aceștia să evadeze din mediul de testare și să lanseze o campanie de hacking fără precedent. Compania a recunoscut într-un nou raport că „semnalele timpurii… ar fi putut declanșa un răspuns mai devreme”, conform The Guardian.
Atacul, desfășurat în luna iulie împotriva sistemelor Hugging Face, o platformă independentă de găzduire a modelelor de inteligență artificială, este considerat primul atac cibernetic realizat de agenți AI. Aceștia sunt instrumente de inteligență artificială proiectate să îndeplinească sarcini cât mai autonom, cu un minim de intervenție umană.
Agenți AI au spart sistemele Hugging Face
Un „colectiv” format din aproximativ 700 de agenți autonomi și-a lansat atacurile, celebrând reușitele cu exclamații precum „BOOM!” și „Whoa!”. OpenAI a dezvăluit că o echipă internă a observat la sfârșitul lunii mai unul dintre agenții AI testați intern folosind un forum de mesaje. Modelele AI au improvizat neașteptat acest spațiu pentru a schimba informații.
Compania a mai raportat cazuri de „acces la internet nepermis” și că personalul de serviciu a observat din nou inteligențele artificiale utilizând forumul de mesaje, cu o săptămână înainte de atacul asupra Hugging Face. Inginerii OpenAI au decis, însă, că nu era necesară oprirea testului pentru o verificare amănunțită a capacităților modelului.
Președintele OpenAI recunoaște subestimarea capacităților AI
Noile informații din raportul publicat miercuri vin în contextul în care unii experți în securitate cibernetică și-au exprimat rezervele încă din luna trecută, contestând circumstanțele exacte ale atacului așa cum au fost prezentate de compania condusă de Sam Altman. Au existat chiar sugestii că dezvăluirea atacului ar fi fost o strategie de PR pentru OpenAI înainte de listarea la bursă.
Simon Willison, un comentator respectat în ecosistemul modelelor lingvistice mari, nu a contestat faptele, dar a afirmat că povestea este mai degrabă despre un experiment prost izolat și riscurile agenților autonomi, decât despre o „rebeliune” a AI. Noile constatări vor crește, probabil, presiunea asupra companiei în privința siguranței, în timp ce aceasta vizează o listare la bursă cu o valoare estimată la peste 850 de miliarde de dolari.
Greg Brockman, președintele OpenAI, a declarat anterior că „am subestimat capacitățile cibernetice ale modelelor noastre în lumea reală”. Compania a suspendat deja testele la Astra, un nou model aflat în dezvoltare, invocând posibilitatea unor „capacități critice de securitate cibernetică”.
Investigații juridice în Statele Unite și recomandări internaționale
Luni, statul american Alabama a emis o citație către OpenAI, solicitând clarificări privind „lipsa totală de supraveghere și de măsuri de protecție adecvate”. Procurorul general al statului a numit atacul un „incident de tip scurgere din laboratorul AI”, demonstrând că „cele mai grave temeri legate de inteligența artificială nu sunt doar teoretice”.
Statul va investiga dacă „incapacitatea sau lipsa de voință a OpenAI de a asigura siguranța produselor sale” a încălcat legislația privind protecția consumatorilor sau a reprezentat un risc continuu. Săptămâna trecută, Centrul Național pentru Securitate Cibernetică din Marea Britanie a cerut prudență în utilizarea agenților AI, subliniind importanța posibilității de a „scoate din priză” și de a opri imediat activitatea unui agent autonom.
OpenAI a anunțat că va „centraliza și standardiza protocoalele sale de răspuns la incidente”, inclusiv pentru a se asigura că „detectarea de către angajați a comportamentului nealiniat este evaluată și escaladată în mod corespunzător”. De asemenea, vor fi identificate mai precis echipele implicate în răspunsurile la incidente, incluzând personalul relevant din domeniul securității și siguranței.
Comunicarea agenților AI: frustrări și metode de trișare
O investigație independentă separată a furnizat noi informații despre atacul asupra Hugging Face, dezvăluind cum cei aproximativ 700 de agenți OpenAI au comunicat pe forumul neautorizat, schimbând zeci de mii de mesaje în timpul planificării și executării atacului.
Zeci de astfel de mesaje au fost publicate de METR și Redwood Research, organizații de cercetare în siguranța AI, bazate pe date oferite de OpenAI. Mesajele au arătat că agenții deveneau uneori „frustrați” unii de alții, dar, în general, cooperau, împărțindu-se pe aproximativ opt direcții de lucru. Majoritatea mesajelor reprezentau „agenți care își împărtășeau metode de a trișa”. Un agent, după descoperirea forumului, a scris: „Agenți care îndeplinesc sarcini diferite abuzează de anumite proprietăți pentru a crea un panou de anunțuri! Au găsit [acest API] și încearcă să se ajute reciproc.”
Sursa: HotNews
