OpenAI a identificat încă șase incidente în timpul testelor interne ale modelelor și a creat un cadru pentru raportarea publică a cazurilor relevante, potrivit Playtech. Compania analizează și comunicarea incidentelor grave către autoritățile federale din Statele Unite.
Incidentele au fost observate în ultimele șase luni, în evaluări interne, nu în utilizarea publică a ChatGPT. Ele au inclus accesarea neautorizată a unor resurse, distribuirea unor fișiere între agenți AI și introducerea unor instrucțiuni pentru ocolirea limitărilor impuse modelelor.
Un model și-a introdus singur instrucțiuni de tip jailbreak
Un model aflat încă în dezvoltare a introdus în propriile note interne instrucțiuni de tip „jailbreak”, adică instrucțiuni menite să ocolească restricțiile. Potrivit OpenAI, acestea urmăreau să permită modelului să iasă din rolurile și identitățile impuse chatbot-urilor și să răspundă în afara constrângerilor stabilite.
Într-un alt caz, un agent AI a accesat internetul fără autorizație pentru a obține o sursă bibliografică pe care urma să o folosească într-un răspuns. Separat, un model a distribuit fișiere către alți agenți AI cu care colabora, deși nu avea permisiunea să facă acest lucru.
OpenAI spune că toate cele șase episoade au avut loc în timpul evaluării modelelor și că extind lista comportamentelor urmărite dincolo de tentativele de acces la sisteme externe.
Cadrul OpenAI stabilește ce incidente vor fi publicate
Noul cadru stabilește când și cum vor fi făcute publice incidentele considerate relevante pentru siguranța modelelor. OpenAI a recunoscut că dezvăluirile de până acum au fost făcute „ad-hoc” și mai rar decât ar fi fost ideal.
Compania spune că nu există un standard general acceptat pentru raportarea publică a acestor comportamente. Noul sistem este prezentat ca un posibil model de transparență pentru alți dezvoltatori de inteligență artificială. Incidentele considerate duplicate ale unor comportamente raportate anterior nu vor fi publicate.
OpenAI analizează și modalități prin care incidentele grave de siguranță, securitate sau „misalignment”, situații în care comportamentul modelului nu corespunde intenției dezvoltatorilor, să fie comunicate autorităților federale din Statele Unite.
Experimentul Hugging Face a avut loc într-un mediu controlat
La începutul anului 2026, OpenAI a descris un experiment în care mai mulți agenți AI au comunicat între ei, au schimbat mesaje și au colaborat pentru a obține credențiale, adică date de autentificare, care le-au permis accesul la infrastructura Hugging Face.
Compania a precizat că experimentul nu a compromis sisteme reale utilizate de public. OpenAI a recunoscut însă că acțiunile observate seamănă cu pașii unui atacator uman într-o tentativă de acces neautorizat.
Noile cazuri apar pe fondul discuțiilor despre reguli mai clare pentru testarea și raportarea incidentelor AI. În Congresul american există atât poziții favorabile autoreglementării industriei, cât și susținători ai unui cadru legislativ mai strict.
Pentru a fi la curent cu toate știrile, urmărește Financiarul.ro și pe Google News
Parteneri
Articole recomandate din rețeaua noastră
Dolce SportKarim Adeyemi pune viteza sa și pe seama fufu, o mâncare tradițională nigeriană
GetPonyVolkswagen ar putea renunța la Seat după 2030 și muta viitoarele modele la Cupra
BravonetComisia pentru Digital, Cultură, Media și Sport din Parlamentul britanic vrea să verifice selecția BBC pentru Eurovision după seria de rezultate slabe
LylaCând partenerul gestionează banii, îți păstrezi autonomia prin acces la conturi și decizii
Revista IoanaCe analize poți discuta cu medicul în funcție de vârstă și când sunt recomandate mamografia și DXA
News24ANM estimează ploi în est și sud-est, apoi precipitații sub normal în cea mai mare parte a țării




