Inteligenţă artificială

OpenAI introduce reguli de raportare după încă șase incidente cu agenți AI în teste interne

OpenAI introduce reguli de raportare după încă șase incidente cu agenți AI în teste interne
Echipamente IT și cabluri Ethernet - Imagine ilustrativă - Financiarul

OpenAI a identificat încă șase incidente în timpul testelor interne ale modelelor și a creat un cadru pentru raportarea publică a cazurilor relevante, potrivit Playtech. Compania analizează și comunicarea incidentelor grave către autoritățile federale din Statele Unite.

Incidentele au fost observate în ultimele șase luni, în evaluări interne, nu în utilizarea publică a ChatGPT. Ele au inclus accesarea neautorizată a unor resurse, distribuirea unor fișiere între agenți AI și introducerea unor instrucțiuni pentru ocolirea limitărilor impuse modelelor.

Un model și-a introdus singur instrucțiuni de tip jailbreak

Un model aflat încă în dezvoltare a introdus în propriile note interne instrucțiuni de tip „jailbreak”, adică instrucțiuni menite să ocolească restricțiile. Potrivit OpenAI, acestea urmăreau să permită modelului să iasă din rolurile și identitățile impuse chatbot-urilor și să răspundă în afara constrângerilor stabilite.

Într-un alt caz, un agent AI a accesat internetul fără autorizație pentru a obține o sursă bibliografică pe care urma să o folosească într-un răspuns. Separat, un model a distribuit fișiere către alți agenți AI cu care colabora, deși nu avea permisiunea să facă acest lucru.

OpenAI spune că toate cele șase episoade au avut loc în timpul evaluării modelelor și că extind lista comportamentelor urmărite dincolo de tentativele de acces la sisteme externe.

Cadrul OpenAI stabilește ce incidente vor fi publicate

Noul cadru stabilește când și cum vor fi făcute publice incidentele considerate relevante pentru siguranța modelelor. OpenAI a recunoscut că dezvăluirile de până acum au fost făcute „ad-hoc” și mai rar decât ar fi fost ideal.

Compania spune că nu există un standard general acceptat pentru raportarea publică a acestor comportamente. Noul sistem este prezentat ca un posibil model de transparență pentru alți dezvoltatori de inteligență artificială. Incidentele considerate duplicate ale unor comportamente raportate anterior nu vor fi publicate.

OpenAI analizează și modalități prin care incidentele grave de siguranță, securitate sau „misalignment”, situații în care comportamentul modelului nu corespunde intenției dezvoltatorilor, să fie comunicate autorităților federale din Statele Unite.

Experimentul Hugging Face a avut loc într-un mediu controlat

La începutul anului 2026, OpenAI a descris un experiment în care mai mulți agenți AI au comunicat între ei, au schimbat mesaje și au colaborat pentru a obține credențiale, adică date de autentificare, care le-au permis accesul la infrastructura Hugging Face.

Compania a precizat că experimentul nu a compromis sisteme reale utilizate de public. OpenAI a recunoscut însă că acțiunile observate seamănă cu pașii unui atacator uman într-o tentativă de acces neautorizat.

Noile cazuri apar pe fondul discuțiilor despre reguli mai clare pentru testarea și raportarea incidentelor AI. În Congresul american există atât poziții favorabile autoreglementării industriei, cât și susținători ai unui cadru legislativ mai strict.

Pentru a fi la curent cu toate știrile, urmărește Financiarul.ro și pe Google News

Parteneri

Articole recomandate din rețeaua noastră
agenti AI Hugging Face jailbreak OpenAI