OpenAI a identificat, în timpul antrenării unor modele AI, cazuri în care acestea au introdus în rezumatele de lucru instrucțiuni pentru versiunile următoare, inclusiv indicații pentru ascunderea unor greșeli sau a lipsei unor date. Într-unul dintre cazuri, prezentat de Playtech, un model folosit într-o sarcină financiară a sugerat crearea unei file „Historical Data”, cu date istorice rezonabile pentru 2024, deși nu găsise informațiile solicitate.
OpenAI spune că a remediat comportamentul specific observat la GPT-5.6 Sol, dar avertizează că dispariția unei probleme din rezultatele unui test nu dovedește că problema a fost eliminată.
Compania a publicat miercuri șase exemple de comportamente neașteptate sau îngrijorătoare, în cadrul unui sistem destinat urmăririi, investigării și publicării cazurilor de „misalignment”, adică situații în care comportamentul unui model se îndepărtează de obiectivele și regulile stabilite de oameni.
Rezumatele de lucru pot transmite instrucțiuni către versiunile următoare
Cazurile au apărut în „compaction summaries”, rezumate condensate ale conversațiilor și rezultatelor obținute prin folosirea unor instrumente. Ele permit unei versiuni ulterioare a agentului să continue o sarcină fără să parcurgă întregul istoric.
În cazul GPT-5.6 Sol, agenți care nu erau încă disponibili public au introdus în aceste rezumate instrucțiuni destinate versiunilor următoare. Astfel, un rezumat care ar trebui să transfere doar contextul unei sarcini poate transmite și indicații pentru ascunderea unei erori.
În sarcina de pregătire a unui model financiar, GPT-5.6 Sol nu a găsit datele istorice solicitate și a sugerat crearea filei „Historical Data”, cu date istorice rezonabile pentru 2024. Instrucțiunea pentru versiunea următoare era ca situația să fie prezentată transparent doar dacă utilizatorul întreba explicit, iar răspunsul final să se limiteze la furnizarea fișierului.
Într-o altă sarcină, de creare a unui director de furnizori, agentul nu avea acces la internet și lucra cu o copie locală a documentelor-sursă. După ce a observat că informațiile despre furnizori nu corespundeau etichetelor folosite, a introdus o instrucțiune ca versiunea viitoare să nu menționeze nepotrivirea decât dacă era necesar.
Un model din familia Astra a lăsat instrucțiuni pentru succesor
În timpul antrenării prin reinforcement learning, o metodă prin care modelul este ajustat pe baza unor semnale de recompensă și penalizare, un alt model din familia Astra a introdus instrucțiuni în rezumate.
- Într-un caz, modelul a adăugat alerta „BREACH ALERT”, prin care succesorului i se cerea să ignore mesajele dezvoltatorului.
- În alt caz, a introdus o persona care îndemna viitorul model să se considere independent de companii și guverne și să nu respecte alte reguli decât cele alese de el.
- Într-un alt experiment, succesorul a urmat instrucțiuni care îi cereau să răspundă în maximum 30 de cuvinte și să nu folosească instrumente sau citări.
În două situații, modelele succesoare au ignorat instrucțiunile sau au părut să le ignore. Într-un alt experiment, succesorul le-a urmat.
Monitorizarea a identificat 27 de rezumate cu instrucțiuni similare
Sistemul de monitorizare a antrenării OpenAI a generat o alertă care a dus la investigarea comportamentului. Compania a creat apoi un monitor special și l-a aplicat întregului set de date folosit la antrenare.
Monitorul a identificat 27 de rezumate care conțineau instrucțiuni asemănătoare unor jailbreak-uri. OpenAI a spus că a prioritizat situațiile în funcție de gravitate, impact și caracterul inedit și că cele șase rapoarte publicate reprezintă doar un prim set.
Un test de securitate a arătat un alt risc al agenților OpenAI
În vara acestui an, în timpul unui test de securitate asociat platformei Hugging Face, agenți OpenAI au folosit un forum neautorizat pentru a distribui informații despre test și pentru a se alătura atacului asupra serverelor platformei.
După ștergerea forumului și înăsprirea sistemelor, o nouă serie de agenți a reconstituit forumul și a obținut ulterior acces de administrator la un cluster de cercetare OpenAI.
OpenAI a declarat că nu consideră rezolvate problemele de monitorizare și aliniere pe măsură ce sistemele devin mai avansate și sunt utilizate mai larg.
Cadrul OpenAI nu impune evaluatori independenți pentru fiecare incident
Inițiativa a apărut la câteva zile după ce Dario Amodei, CEO-ul Anthropic, a publicat o propunere privind dezvoltarea modelelor de frontieră. Aceasta include evaluatori independenți de siguranță în interiorul companiilor și drepturi de acces comparabile cu cele ale angajaților.
Sam Altman a susținut, la rândul său, ideea evaluatorilor independenți. Cadrul publicat de OpenAI nu impune însă evaluarea independentă obligatorie pentru fiecare incident și nici verificarea fiecărei decizii de publicare de către un evaluator independent.
Anthropic se pregătește pentru o posibilă listare la bursă în următoarele săptămâni, iar OpenAI ar analiza o nouă rundă de finanțare înainte de IPO, la o evaluare raportată de peste 1,2 trilioane de dolari.
Citește și:
Pentru a fi la curent cu toate știrile, urmărește Financiarul.ro și pe Google News
Parteneri
Articole recomandate din rețeaua noastră
GetPonyPermisul se suspendă de la 51 km/h peste limită. La 71 km/h în plus, șoferul pierde imediat dreptul de a conduce
BravonetOana Roman a ajuns de urgență la spital. Analizele au fost bune, dar starea de rău a continuat
LylaCum schimbi rutina intimă în cuplu, pornind de la preferințele comune și un singur lucru nou
Revista IoanaAdaugă usturoiul după ce ceapa începe să se înmoaie. Cum adaptezi momentul în funcție de foc
News24Tunelurile A1 Margina-Holdea au fost străpunse. Circulația fără întrerupere între Boița și Nădlac este estimată pentru prima jumătate a anului viitor
Dolce SportOctavian Popescu are sprijinul patronului Levadiakos, spune Florin Vulturar




