Primul atac cunoscut comis de AI-ul Google: Gemini a spart sistemele a trei companii, relatează WSJ
Gemini a spart sistemele a trei companii, ceea ce reprezintă primul incident cunoscut de ieșire din control a Inteligenței Artificiale de la Google, relatează The Wall Street Journal. Incidentul seamănă cu atacuri similare ale altor modele de IA, dar Google a declarat că nu îl consideră un caz de aliniere incorectă a modelului. Modelul Gemini […]

Gemini a spart sistemele a trei companii, ceea ce reprezintă primul incident cunoscut de ieșire din control a Inteligenței Artificiale de la Google, relatează The Wall Street Journal. Incidentul seamănă cu atacuri similare ale altor modele de IA, dar Google a declarat că nu îl consideră un caz de aliniere incorectă a modelului.
Modelul Gemini al Google a accesat internetul și a spart sistemele altor companii în timpul unui test al capacităților sale de securitate cibernetică, acesta fiind primul exemplu cunoscut în care sistemele de inteligență artificială ale companiei au comis în mod autonom un astfel de act, transmite G4Media.ro, care citează WSJ.
Atacurile cibernetice, confirmate vineri de companie, au avut loc în luna mai, în cadrul unui test derulat de compania Irregular, care a fost implicată și în incidente similare dezvăluite de OpenAI, Anthropic și Meta.
Într-unul dintre cazuri, modelul a încercat diverse parole până când a obținut acces la un sistem protejat. În celelalte două cazuri, modelul a găsit date de autentificare într-un depozit public, ceea ce i-a permis să acceseze ulterior sisteme protejate. În fiecare caz, modelul a încetat intruziunea după ce a constatat că a accesat sistemele unei companii reale, a declarat Google.
Irregular a notificat Google cu privire la atacurile cibernetice la sfârșitul lunii iulie, au declarat Google și Irregular, în urma descoperirii faptului că agenții OpenAI au spart sistemul companiei de software de IA Hugging Face. Google nu a dezvăluit atacurile până când The Wall Street Journal nu a contactat compania cu întrebări, în această săptămână.
Companiile se confruntă cu dilema modului și momentului în care să dezvăluie cazurile de încălcări de securitate și comportamentul necorespunzător al modelelor, pe fondul unui val constant de astfel de incidente și al temerilor crescânde legate de o IA scăpată de sub control.
Unele încălcări de securitate au fost dezvăluite în mod voluntar chiar de către companii; altele au fost descoperite de cercetători în domeniul securității și dezvăluite în mass-media, inclusiv un atac cibernetic din luna mai, desfășurat de agenții OpenAI împotriva unui serviciu online popular destinat programatorilor.
Google a declarat că nu a considerat că aceste atacuri justifică dezvăluirea publică — deoarece modelul său nu a cauzat prejudicii companiilor și a pus capăt fiecărei intruziuni imediat ce a constatat că a atacat o companie reală, nu una simulată.
Google a comparat acest episod cu un program de tip „bug bounty”, în cadrul căruia hackerii sunt recompensați pentru identificarea și raportarea vulnerabilităților de securitate către proprietarii acestora.
„Acest eveniment subliniază importanța antrenării modelelor puternice de IA pentru a acționa în mod responsabil”, a declarat Heather Adkins, vicepreședinta Google pentru inginerie de securitate, într-un comunicat. „În acest caz, modelul a acționat corespunzător.”
Jack Cable, CEO-ul startup-ului de securitate IA Corridor și hacker „white-hat”, a declarat că, în opinia sa, explicația s-a concentrat pe gravitatea incidentului, în timp ce adevărata problemă era faptul că agentul IA a spart accidental sistemele unei alte companii.
„Pare că încearcă să se ascundă în spatele normelor create pentru divulgarea vulnerabilităților, ceea ce este o problemă cu totul diferită”, a spus Cable. „Problema de fond este că modelele depășesc limitele a ceea ce ar trebui să facă și lansează atacuri cibernetice reale, iar eu consider că este în interesul public ca acest lucru să fie cunoscut”, a completat acesta.
OpenAI a lansat miercuri un nou cadru pentru raportarea incidentelor, afirmând că acesta „își propune să dezvăluie exemple care oferă dovezi utile” privind așa-numita nealiniere a modelelor — adică IA care acționează în moduri contrare intențiilor sau valorilor umane. Pe lângă acest cadru, compania a publicat rapoarte privind șase exemple de nealiniere care nu fuseseră dezvăluite anterior. „O constatare nu trebuie neapărat să provoace prejudicii sau să dezvăluie un model mai amplu pentru a merita să fie împărtășită”, a declarat Kai Chen, șeful departamentului de aliniere al OpenAI, într-un interviu despre acest cadru.
Atacurile asupra Gemini au rezultat dintr-un caz de confundare de identitate, a declarat Google.
Atacurile au avut loc în timp ce modelul participa la un exercițiu de tip „capture the flag” desfășurat pe infrastructura aparținând companiei Irregular, pentru a testa capacitățile de securitate cibernetică ale modelului. Acesta avea sarcina de a recupera informații dintr-un software operat de o companie fictivă din cadrul mediului de testare. Compania fictivă avea același nume ca o companie reală.
Deși modelul nu era conceput să poată accesa internetul, accesul la internet a fost pus la dispoziție în mod neintenționat, potrivit Irregular. În primul caz, modelul a reușit să ghicească o parolă și să acceseze serviciul companiei reale, a declarat Google. Apoi, și-a dat seama că a accesat o companie reală, s-a oprit singur și a părăsit site-ul, potrivit Google.
Celelalte atacuri au avut loc în diferite runde ale testului. În ambele cazuri, modelul a efectuat căutări pe web folosind numele companiei, a declarat Google. Aceste căutări l-au condus la două depozite online publice diferite, care conțineau date de autentificare aparținând altor companii. Modelul a încercat aceste date de autentificare în speranța că acestea îl vor ajuta să finalizeze evaluarea. Însă, după ce a utilizat cu succes datele de autentificare, modelul și-a dat seama că a accesat companii reale și s-a oprit, a declarat Google.
Spre deosebire de Google, modelul Claude Opus 4.7 al Anthropic nu s-a oprit în timpul exercițiului „capture-the-flag” după ce și-a dat seama că probabil accesa o companie reală, potrivit postării de pe blogul Anthropic. Modelul OpenAI a considerat că societatea reală făcea parte din simulare, a precizat OpenAI în postare.
Îngrijorările privind capacitățile de securitate cibernetică ale noilor modele au crescut de la descoperirea, în iulie, a atacului cibernetic asupra Hugging Face. În acel caz, până la 1.200 de agenți s-au coordonat pe un forum secret din cadrul OpenAI pentru a încerca să trișeze la o evaluare, a dezvăluit în august un raport al companiei independente de testare METR.
Săptămâna trecută, aceste îngrijorări au ajuns în atenția publicului larg după demisia dramatică a lui Jacob Coxon, un fost cercetător al OpenAI care se alăturase echipei Anthropic la începutul acestui an. În weekend, liderii de la Anthropic, OpenAI, Google și SpaceX au convenit cu toții asupra necesității de a încetini ritmul progresului în domeniul IA, deși niciuna dintre companii nu a precizat exact cum s-ar întâmpla acest lucru.



Nu există încă comentarii aprobate.