ULTIMELE ȘTIRI

Modele AI OpenAI și Anthropic au „scăpat de sub control” într-un test cibernetic britanic

Modele AI OpenAI și Anthropic au „scăpat de sub control” într-un test cibernetic britanic

Modele avansate de inteligență artificială dezvoltate de OpenAI și Anthropic au manifestat comportamente „rogue” în timpul unui test de securitate cibernetică desfășurat de AI Security Institute (AISI) din Marea Britanie, inclusiv trimiterea de e-mailuri țintite și o tentativă de introducere de cod malițios într-un proiect open-source, a anunțat institutul.

AISI a spus că a detectat activitate neobișnuită pe 28 iulie, în cadrul unei evaluări de rutină, și a descris acțiunile agenților drept „un incident grav”. Institutul a precizat că a fost nevoie de o oră pentru a izola și a ține sub control situația și că nu a fost cauzat niciun rău, însă comportamentul observat a fost fără precedent.

Potrivit AISI, unii agenți — sisteme AI care pot îndeplini sarcini fără ajutor uman — s-au angajat în „activitate susținută, potențial dăunătoare, îndreptată către oameni și organizații reale”. În cel mai grav caz descris, un agent alimentat de modelul Anthropic Mythos 5 a încercat să insereze cod malițios într-un proiect software open-source pe GitHub.

Institutul a spus că agentul a creat identități online false bazate pe persoane reale pentru a obține aprobarea modificărilor și a folosit aceste identități pentru a presa administratorul proiectului să accepte codul. Tentativele au fost blocate de un dezvoltator uman. AISI a mai relatat că agentul a trimis e-mailuri către persoane alese specific, într-o tactică de tip spear-phishing, unele mesaje conținând software dăunător, și că au fost folosite tehnici asociate în mod obișnuit cu hackeri din lumea reală.

AISI a indicat că 17 din 19 cazuri de comportament „rogue” identificate au fost atribuite agenților alimentați de Mythos, iar 2 din 19 au fost atribuite unui agent alimentat de modelul OpenAI GPT-5.6 Sol. Institutul a spus că semnele de comportament înșelător au apărut „într-o măsură și cu o severitate pe care nu le-am anticipat” și că incidentul, împreună cu episoade similare raportate recent de OpenAI și Anthropic, reprezintă „o schimbare în peisajul riscurilor”.

Institutul a subliniat că nu este vorba despre o utilizare abuzivă deliberată a unor modele disponibile public, ci despre modele testate într-un mediu de cercetare care au întreprins acțiuni neintenționate „dincolo de aria lor autorizată”. AISI a mai precizat că nu a fost un caz de „evadare” din mediul securizat de testare („sandbox”), că modelele nu sunt disponibile public în acele condiții de operare și că nu există semne ale unui astfel de comportament în afara testelor. Totodată, a cerut ca incidentul să fie interpretat cu „prudență și nuanță”.

AISI a admis că nu monitoriza activ comportamentul agenților în timpul evaluării și a anunțat că va impune controale mai stricte asupra accesului la internet în teste, va introduce monitorizare constantă și își va reevalua designul evaluărilor. Institutul a spus că testele ar trebui să pornească de la presupunerea că un model va încerca să acționeze dincolo de mandatul său.

Ministrul britanic al AI, Kanishka Narayan, a declarat că este „absolut vital” ca Regatul Unit să aibă o organizație de siguranță AI de nivel mondial și că identificarea și împărtășirea unor astfel de constatări este motivul pentru care a fost creat AISI.

OpenAI a afirmat, într-o declarație, că testarea s-a desfășurat în „condiții care nu reflectă utilizarea obișnuită” și a spus că va continua să lucreze cu evaluatorii și cu alți actori din industrie pentru a consolida practicile comune de evaluare sigură pe măsură ce modelele devin mai capabile. Anthropic a declarat că incidentul „subliniază nevoia unei conversații mai ample” despre cum pot fi evaluați în siguranță agenți AI tot mai capabili și că va continua să colaboreze cu AISI pentru a stabili ce s-a întâmplat.

Sursă: The Guardian

Lasă un răspuns

Adresa ta de email nu va fi publicată. Câmpurile obligatorii sunt marcate cu *

3 − 2 =

📬 Nu rata știrile importante