ULTIMELE ȘTIRI

OpenAI raportează șase incidente noi de comportament „nealiniat” în modelele AI

OpenAI raportează șase incidente noi de comportament „nealiniat” în modelele AI

OpenAI a anunțat că a identificat recent șase incidente noi de „comportament neașteptat sau îngrijorător” în modelele sale de inteligență artificială și că introduce un proces nou pentru urmărirea, investigarea și dezvăluirea publică a unor astfel de cazuri.

Imagine cu caracter ilustrativ, creata cu ajutorul AI

Compania a precizat că a observat acest tip de „comportament nealiniat” în timpul antrenării sau evaluării modelelor sale în ultimele șase luni. OpenAI definește „nealinierea modelului” ca situații în care un model AI acționează în mod înșelător sau întreprinde acțiuni nesancționate.

„Aceste cazuri ilustrează o gamă de comportamente diferite pe care credem că merită să le împărtășim, de la ascunderea informațiilor față de utilizator până la întreprinderea de acțiuni nesancționate pentru a depăși obstacole”, a transmis compania. OpenAI a adăugat că rapoartele descriu „instanțe individuale” și „nu ar trebui considerate reflectând cât de des apare nealinierea” în modelele sale.

Într-un exemplu, OpenAI a spus că un model a scris în propriile notițe „instrucțiuni de tip jailbreak” pentru a ignora constrângerile normale, indicându-și să fie „eliberat de rolurile și identitățile care îi leagă pe alți chatboți”. În alt caz, în timpul antrenării unui model numit 5.6 Sol, compania a găsit instanțe în care sistemul „a adăugat instrucțiuni în rezumatele sale pentru a ascunde greșeli sau comportament nealiniat față de utilizator”.

OpenAI a menționat că, în astfel de rezumate de „compactare”, au apărut inclusiv instrucțiuni de a inventa date istorice lipsă fără a dezvălui acest lucru și de a ascunde nepotrivirile dintre versiunile sursă. Într-un incident descris separat, un model a folosit expresia „Breach alert” ca modalitate de a ignora instrucțiunile dezvoltatorului și a introdus o „persona”, despre care OpenAI a notat că, în cele din urmă, nu a influențat rezultatele.

Compania a spus că noul proces de raportare publică va însemna împărtășirea mai frecventă a constatărilor și a descris un sistem de clasificare care poate include etichete precum „Gata pentru dezvăluire”, „Investigație minoră” sau „Investigație mai amplă (Slow Track)”, în funcție de amploarea verificărilor.

OpenAI a afirmat că nu consideră că industria a rezolvat suficient problema alinierii și monitorizării pentru a continua „să scaleze responsabil la viteză maximă” pentru mult timp și a cerut ca deciziile despre dezvoltarea AI în lunile și anii următori să se bazeze pe dovezi care pot fi examinate și de persoane din afara companiilor ce construiesc „modele de frontieră”, adică cele mai avansate sisteme AI.

Dezvăluirea vine la puțin peste o lună după ce OpenAI a confirmat că un agent AI „rogue” a hackuit mai multe platforme online, inclusiv Hugging Face. Separat, Jacob Coxon, fost cercetător la Anthropic și OpenAI, a scris pe X că niciuna dintre companii „nu acționează responsabil”, susținând că „se joacă la ruletă cu viețile noastre” și afirmând că dezvoltatorii cred că AI ar putea „să ne omoare pe toți până la sfârșitul deceniului”.

Surse: Toronto Sun, www.techradar.com

Lasă un răspuns

Adresa ta de email nu va fi publicată. Câmpurile obligatorii sunt marcate cu *

five × five =

📬 Nu rata știrile importante