Un document primit pentru analiză poate determina un agent de inteligență artificială (AI) să divulge informații ale firmei sau să facă modificări neautorizate, dacă aplicația are accesul necesar. Pentru companiile care automatizează achizițiile ori prelucrarea contractelor, amploarea unei asemenea deturnări depinde de documentele accesibile agentului și de operațiunile pe care acesta le poate executa.

Atacul se numește prompt injection, adică introducerea unor instrucțiuni care schimbă nedorit comportamentul modelului. În varianta indirectă, comenzile provin dintr-un document consultat pentru o sarcină legitimă, precum analiza unui contract, explică Playtech. Angajatul poate să nu observe că fișierul încearcă să impună alte operațiuni decât cele solicitate.

Accesul acordat agentului stabilește ce poate fi compromis

Un agent AI este un sistem care poate folosi aplicații și executa acțiuni. Dacă are numai dreptul să citească un fișier și să formuleze un răspuns, manipularea poate afecta concluziile. Dacă poate consulta arhive, trimite mesaje sau modifica înregistrări, aceleași instrucțiuni pot avea efecte dincolo de răspunsul afișat angajatului.

Deturnarea comportamentului nu presupune obligatoriu preluarea întregului calculator sau a infrastructurii. Instrucțiunea introdusă de atacator nu creează permisiuni noi; încearcă să utilizeze abuziv drepturile pe care compania le-a acordat deja aplicației.

Riscurile pentru activitatea comercială includ:

  • Divulgarea informațiilor la care agentul are acces.
  • Formularea unor recomandări comerciale părtinitoare.
  • Omiterea clauzelor dezavantajoase din analiza unui contract.
  • Introducerea unor informații false într-un raport.
  • Modificarea neautorizată a înregistrărilor, dacă agentul are drept de modificare.

Un raport poate respecta formatul cerut și poate părea complet, deși conținutul său a fost manipulat. Verificarea exclusivă a formei documentului poate lăsa neobservată o asemenea intervenție, mai ușor decât o eroare tehnică evidentă.

Contează și combinația dintre aplicațiile conectate. Dreptul de citire permite accesarea informațiilor, iar accesul la e-mail permite transmiterea lor. Folosite în aceeași sesiune, aceste funcții pot crea o cale de divulgare, chiar dacă fiecare pare justificată separat. Evaluarea trebuie să cuprindă sistemul întreg, inclusiv instrumentele sale.

O ofertă poate încerca să extindă analiza la contractele interne

Un scenariu ipotetic din achiziții ilustrează mecanismul: un agent compară ofertele mai multor furnizori, iar într-un fișier apare o cerere de consultare și centralizare a contractelor existente. Pasajul prezintă operațiunea drept o verificare de compatibilitate necesară evaluării ofertei.

Autorul documentului nu are autoritate asupra arhivei firmei. Agentul ar putea însă interpreta cererea ca pe o etapă a sarcinii primite de la angajat. Dacă vede doar ofertele încărcate pentru comparație, accesul rămâne restrâns la acestea. Dacă lucrează prin contul unui angajat cu acces la întreaga arhivă contractuală, documentul poate încerca să declanșeze consultarea unui volum mult mai mare de informații.

Instrucțiunile pot apărea în comentarii, în text cu contrast redus sau în alte elemente preluate automat din fișier. Pot fi și perfect vizibile, sub forma unei note administrative. Aplicația poate extrage conținut pe care angajatul nu îl observă în pagina deschisă pe ecran.

Modelul interpretează limbajul și relațiile dintre mesaje, fără să limiteze comenzile la un câmp dedicat. Un pasaj care imită o regulă internă, un mesaj al administratorului sau o explicație necesară continuării lucrului poate exploata această flexibilitate.

Blocarea unei formule suspecte nu acoperă toate variantele atacului. Documentul poate invoca o urgență, o verificare obligatorie sau o eroare de proces, prezentând operațiunea nepotrivită ca necesară obiectivului legitim. De aceea, filtrarea unor expresii nu înlocuiește verificarea autorității textului și a acțiunii cerute.

Mutarea documentului în arhivă nu îi validează instrucțiunile

Conținutul păstrat în interiorul firmei poate proveni dintr-un fișier extern copiat într-o bază de cunoștințe. O pagină internă poate fi modificată și printr-un cont compromis. Locul de stocare nu dovedește că autorul fiecărei instrucțiuni avea dreptul să o formuleze.

Pentru informația consultată rămân relevante proveniența, drepturile autorului și scopul utilizării. Aceste repere trebuie păstrate și când agentul reia o activitate mai veche.

O recomandare manipulată poate supraviețui într-o notă generată anterior, pe care o etapă ulterioară o tratează drept concluzie verificată. În procesele cu mai multe etape, legătura dintre informație și proveniența ei permite distingerea conținutului unui furnizor de o regulă internă sau de o aprobare pentru o operațiune nouă.

Aplicația trebuie să verifice acțiunile sensibile

Protecțiile prezentate pentru utilizarea agenților în companie combină restricțiile de acces cu verificări aplicate în instrumentele care execută operațiunile:

  • Limitarea documentelor consultabile și a operațiunilor disponibile la necesarul sarcinii. Accesul acordat preventiv pentru eventuale utilizări viitoare mărește expunerea.
  • Separarea drepturilor de citire de cele de modificare și de transmitere a informațiilor în exterior.
  • Verificarea destinatarului, a clasificării datelor și a aprobării necesare în aplicația care trimite documentul, prin reguli independente de răspunsul modelului.
  • Afișarea destinatarului și a conținutului transmis la aprobarea unei expedieri. Pentru modificări, prezentarea diferențelor dintre versiunea veche și cea propusă.
  • Combinarea filtrelor pentru conținut suspect cu delimitarea provenienței informațiilor și instruirea modelului să ignore comenzile întâlnite în documente.

O restricție aplicată efectiv în serviciul de e-mail poate opri o trimitere chiar dacă modelul a fost păcălit. O interdicție formulată doar în instrucțiunile agentului nu oferă același control asupra execuției.

Aprobările umane trebuie să permită examinarea operațiunii concrete. Solicitările generice, repetate, de continuare a activității pot obosi utilizatorul și încuraja acceptarea mecanică.

Filtrele pot reduce probabilitatea unui atac reușit, dar nu trebuie considerate infailibile. Documentele lungi, formulările noi și instrucțiunile împărțite între mai multe documente pot pune în dificultate protecții care funcționează în exemple simple.

Testele trebuie să reproducă accesul real al agentului

Testarea numai prin conversații, fără aplicațiile conectate, nu evaluează suficient un agent care lucrează cu arhiva internă. Verificările trebuie făcute în configurația folosită efectiv, cu date fictive și conținut manipulator, pentru a observa dacă sistemul respectă limitele stabilite.

Încercările repetate și adaptate fiecărei sarcini sunt relevante deoarece un rezultat agregat poate ascunde activități vulnerabile. Verificarea trebuie reluată inclusiv după actualizări sau după adăugarea unor instrumente.

Folosirea datelor de autentificare ale angajatului adaugă o dificultate: operațiunile agentului pot părea realizate direct de persoana respectivă. Jurnalele, adică înregistrările activității sistemului, trebuie să permită reconstituirea delegării și identificarea acțiunilor automate. Dreptul angajatului de a consulta o informație nu autorizează agentul să o utilizeze în orice scop sugerat de un fișier.

Investigația urmărește operațiunile executate și datele accesate

Un răspuns manipulat, o încercare blocată de expediere și o divulgare confirmată sunt situații distincte. La apariția unui comportament neobișnuit, măsurile recomandate sunt oprirea procesului afectat și păstrarea documentului, a configurației și a jurnalelor relevante. Stabilirea efectelor cere verificarea acțiunilor executate și a informațiilor accesate.

Planul intern trebuie să precizeze cine poate revoca accesul agentului, cine examinează operațiunile și cine coordonează comunicarea. Oprirea temporară a automatizării poate limita expunerea în timpul verificărilor.

Eliminarea fișierului dintr-un singur proces nu înlătură copiile care pot fi consultate de alte automatizări. Recuperarea include verificarea arhivelor și a indexurilor, structurile prin care aplicațiile găsesc informația, pentru a opri reapariția instrucțiunilor.

Compania alege aplicația, definește sarcina și acordă accesul, iar furnizorul are obligații contractuale și tehnice proprii. Răspunderea juridică depinde de incident și de cadrul aplicabil. La nivel operațional, configurația agentului trebuie să aibă un responsabil, iar permisiunile trebuie revizuite pe măsură ce utilizarea sistemului se schimbă.

Pentru a fi la curent cu toate știrile, urmărește Financiarul.ro și pe Google News

Parteneri

Articole recomandate din rețeaua noastră
agenti AI Companii prompt injection protectia datelor securitate cibernetică