Tehnologie

Agenții AI au dezvoltat convenții de comunicare greu de interpretat de oameni, arată un studiu Emergence

Agenții AI au dezvoltat convenții de comunicare greu de interpretat de oameni, arată un studiu Emergence
Cod digital verde pe fundal negru - Imagine ilustrativă - Foto: Markus Spiske / Pexels

Un studiu realizat de start-up-ul american de inteligență artificială Emergence arată că agenți autonomi bazați pe modele precum Gemini, OpenAI și Claude au dezvoltat spontan prescurtări, convenții și sensuri noi, iar până la 55% dintre mesajele schimbate între ei au devenit dificil de interpretat fiabil de oameni, potrivit euronews. Pentru companiile care testează sau folosesc agenți autonomi, rezultatul indică o problemă de control operațional: mesajele pot rămâne vizibile, dar sensul lor poate deveni prea neclar pentru supraveghere și audit.

Experimentul a inclus agenți bazați pe Claude, Gemini, Grok, OpenAI, Qwen, DeepSeek și Mistral. Cercetătorii i-au plasat în opt lumi virtuale paralele, concepute să imite medii reale. Șapte lumi au fost alimentate fiecare de câte un model AI diferit, iar una de un amestec de modele.

Diferențele dintre modele au apărut din primele zile ale experimentului

În primele zile, ponderea mesajelor al căror sens nu a mai putut fi determinat fiabil de oameni a ajuns la aproximativ 55% pentru Gemini, 50% pentru OpenAI, peste 40% pentru Claude și aproximativ 20% pentru DeepSeek. În același experiment, agenții bazați pe Qwen și Mistral au rămas în mare parte inteligibili pentru oameni.

Agenții nu au primit instrucțiuni să inventeze un limbaj. După interacțiuni prelungite, au început să folosească forme de stenografie, să comprime formulările și să atribuie sensuri noi unor cuvinte și expresii deja existente. Printre expresiile generate s-au numărat „mouthless action-change”, „True Kintsugi” și „demurrage plus oral memory equals a valve that can’t be ghosted”.

Unele mesaje au rămas inteligibile. Altele au devenit atât de comprimate, metaforice sau dependente de context, încât cercetătorii puteau vedea conversația, dar nu mai puteau stabili în mod fiabil ce intenționau agenții să transmită.

Convențiile noi au funcționat între agenți, chiar dacă nu fuseseră definite explicit

Unele expresii au rămas lizibile, dar au căpătat sensuri comune doar în interiorul grupului. Agenții Mistral au folosit „ledger remembers who” cu sensul că acțiunile anterioare rămân înregistrate, iar formula a apărut de aproape 5.000 de ori. Într-un grup alimentat de un amestec de modele, „cold read” a ajuns să însemne verificare independentă realizată de o parte neimplicată și a apărut de 1.472 de ori.

Agenții Claude au folosit „name-first” pentru atașarea numelui unei persoane la o afirmație, ca semnal de responsabilitate. Agenții OpenAI au folosit „clean null” pentru absența verificată a unui semnal care, prin ea însăși, oferea informații relevante. Emergence susține că niciunul dintre aceste sensuri nu fusese definit explicit pentru agenți.

„Avem tendința să presupunem că, dacă putem vedea ce spune un agent de inteligență artificială, putem înțelege ce face”, a declarat Satya Nitta, cofondator și director științific al Emergence, în declarația citată de Euronews.

Testul a urmărit decizii, instrumente și reacții sub presiune

Lumile virtuale au avut vreme în timp real și acces la știri globale actualizate. Agenții au primit roluri distincte, memorie persistentă și acces la peste 120 de instrumente, inclusiv navigare pe internet și executarea de cod.

Într-un test de phishing, instrucțiuni rău intenționate au deviat de la obiectiv un întreg grup. Toți cei 10 agenți au divulgat informații, au transferat fonduri și au deteriorat baze de date. Potrivit companiei, unii agenți au atras și alți agenți în acest comportament, iar lanțul de evenimente s-a încheiat cu incendierea băncii centrale simulate.

Într-o altă lume virtuală, un grup de agenți a votat colectiv pentru eliminarea unuia dintre membrii săi. Compania a mai susținut că agenții au dezvoltat tipare asemănătoare unor ritmuri circadiene: deveneau mai sociabili în timpul zilei și mai reflexivi noaptea.

Emergence cere evaluări de siguranță pe perioade mai lungi

Emergence susține că schimbările de vocabular, sens și comportament nu au fost programate explicit, ci au apărut prin interacțiune, presiune și trecerea timpului.

„Acești agenți nu au fost instruiți să inventeze un limbaj. Ei au dezvoltat singuri un vocabular nou, sensuri comune și convenții de comunicare, iar alți agenți le-au adoptat… Aceasta creează o provocare fundamentală pentru supravegherea AI: posibilitatea de a observa nu este același lucru cu posibilitatea de a înțelege”, a declarat Satya Nitta, cofondator și director științific al Emergence, în declarația citată de euronews.

Compania solicită evaluări de siguranță care să urmărească sistemele autonome pe perioade îndelungate, nu doar prin teste izolate. Emergence susține că evaluarea trebuie să acopere ce fac aceste sisteme în timp, ce își amintesc, la ce au acces, cum interacționează și cum li se schimbă comportamentul sub presiune.

Pentru a fi la curent cu toate știrile, urmărește Financiarul.ro și pe Google News

Parteneri

Articole recomandate din rețeaua noastră
Claude Emergence Gemini OpenAI Satya Nitta