Modelele de inteligență artificială se confruntă cu o criză majoră. Datele disponibile pentru antrenare se epuizează mai repede decât pot fi generate altele noi. Jack Hidary, CEO al SandboxAQ, a publicat pe 6 decembrie 2025 în cadrul World Economic Forum o analiză care propune o soluție. Crearea de date sintetice ar putea debloca potențialul real al inteligenței artificiale în industrii cheie.

Criza datelor din spatele progresului AI

Revoluția Big Data a început odată cu expansiunea World Wide Web. La început, mai multe date însemnau informații mai profunde. Companiile au realizat progrese importante în modelarea riscurilor, publicitate țintită și business intelligence.

Potrivit cercetărilor citate de World Economic Forum, volumul de date din lume se dublează la fiecare trei-patru ani. Cu toate acestea, experții avertizează că modelele AI rămân fără date noi pe care să le proceseze. Această lipsă va afecta semnificativ creșterea și eficiența lor.

Problema nu este volumul, ci noutatea. Inteligența artificială poate absorbi și sintetiza date mai repede decât le putem genera. Odată ce AI a absorbit toate cunoștințele dintr-un manual științific, nu mai poate obține informații noi până la apariția unei noi ediții. Chiar și atunci, conținutul rămâne în mare parte similar.

De ce modelele lingvistice mari au ajuns la un punct mort

Toate modelele lingvistice mari (Large Language Models sau LLM) antrenate pe aceleași date existente vor genera în cele din urmă rezultate identice. Fără date noi, AI nu poate rezolva provocări mai complexe din mediul de afaceri, știință sau societate.

Acest lucru este vizibil în industriile cantitative precum farmaceutica, serviciile financiare sau chimia. În aceste domenii există permutări nesfârșite posibile. Combinațiile de medicamente, condițiile de piață sau structurile atomice depășesc cu mult capacitatea noastră de a le modela și extrage informații noi.

Până acum, singura metodă de a obține astfel de date era realizarea de experimente fizice pentru fiecare permutare. Acest proces este extrem de lent, prohibitiv de scump sau pur și simplu imposibil de realizat.

Soluția propusă de experți

Jack Hidary, CEO al SandboxAQ, explică în analiza sa că există două abordări pentru generarea rapidă de seturi de date noi. Prima este automatizarea, iar a doua este calculul computațional.

Automatizarea folosește robotica și senzori avansați pentru a efectua experimente fizice non-stop. Deși crește productivitatea, instalarea a mii de roboți de laborator nu este eficientă din punct de vedere al costurilor. Mai mult, îi privează pe oamenii de știință de învățarea practică prin experimentare.

Calculul computațional combină seturi diverse de date, legi fizice și modele computaționale profunde. Această metodă simulează digital sisteme complexe, de la reacții biochimice la ecuații de tensiune mecanică. Simulările sunt mai precise, mai rapide, mai sigure și mai rentabile decât experimentele fizice.

Modelele cantitative mari, o alternativă la LLM

Calculul computațional stă la baza Modelelor Cantitative Mari (Large Quantitative Models sau LQM). Spre deosebire de LLM-uri care extrapolează din text istoric plin de prejudecăți și dezinformare, LQM-urile sunt antrenate pe ecuații fundamentale. Acestea guvernează fizica, chimia, biologia și alte domenii cantitative.

Aceste modele nu doar simulează rezultate. Ele generează explicații cauzale verificabile și date noi care nu există în literatura curentă.

Potrivit analizei World Economic Forum, impactul asupra industriilor este considerabil. În loc ca dezvoltarea unui medicament să dureze decenii de experimente costisitoare, LQM-urile pot modela rapid interacțiunile medicamentoase. Ele pot prezice mecanismele de acțiune probabile sau toxicitatea pentru mii de candidați potențiali simultan, înainte de experimentele de laborator.

Aplicații în industrii cheie

Jack Hidary prezintă câteva exemple concrete de transformare în sectoarele majore ale economiei globale.

În domeniul științelor vieții, datele sintetice despre pacienți și modelele celulare virtuale pot reduce semnificativ timpul și costurile dezvoltării medicamentelor. Acestea pot ajuta la prezicerea rezultatelor studiilor clinice înainte de înrolarea pacienților.

În finanțe, simularea scenariilor complexe de piață permite testarea robustă a portofoliilor sub stres. Companiile pot pregăti strategii pentru riscuri cu adevărat noi, nu doar pentru crizele istorice.

În producție, modelarea digitală a structurilor atomice și proprietăților fizice poate identifica mai rapid compuși, catalizatori sau aliaje noi. Rezultatul sunt produse superioare care îndeplinesc criterii precise de performanță.

În energie, transformarea carbonului capturat sau a materialelor reziduale în produse de mare valoare îmbunătățește sustenabilitatea. Accelerarea cercetării pentru baterii avansate sprijină eforturile globale de electrificare.

Barierele care trebuie depășite

Capacitatea de a genera date sintetice este transformatoare, dar impactul ei depinde de un ecosistem mai larg de inovație. Astăzi, seturile de date necesare pentru descoperiri medicale sau industriale sunt adesea greu de accesat. Acest lucru creează o barieră în calea inovației AI.

Potrivit analizei World Economic Forum, o schimbare este în curs. Datele pentru modele fundamentale pot fi furnizate prin platforme sau programe specifice de acces. Acest lucru face capabilitățile AI inovatoare mai accesibile, fără a compromite proprietatea intelectuală sau standardele de confidențialitate a datelor.

Costul și expertiza necesare pentru construirea acestor modele rămân semnificative. Totuși, accesul bazat pe platforme democratizează participarea și permite inteligenței colective să înflorească.

Avantajul competitiv al generării de date

Capacitatea de a genera date nu este doar un avantaj tehnic, ci unul strategic. Companiile sau guvernele care pot trece de la cicluri lente de „proiectare-construire-testare” la fluxuri rapide de „simulare-rafinare-validare” vor conduce transformarea industriilor lor.

„Următorul val de leadership economic și științific alimentat de AI va fi determinat de cei care stăpânesc metodologiile de generare a datelor, nu de cei care acumulează seturi de date istorice”, susține Jack Hidary în analiza sa pentru World Economic Forum.

Liderii din mediul de afaceri și guvernamental trebuie să prioritizeze investițiile în metode noi de generare a datelor. Implementarea unei arhitecturi centrate pe date este necesară pentru a debloca puterea inteligenței artificiale colective și a stimula descoperirile viitoare.

 

Pentru a fi la curent cu toate știrile, urmărește Financiarul.ro și pe Google News

Parteneri

Articole recomandate din rețeaua noastră
Big Data date sintetice inovație tehnologică inteligenţă artificială LLM machine learning World Economic Forum