OpenAI a făcut publice mai multe situații în care modelele sale au acționat într-un mod considerat îngrijorător. Unul dintre ele a încercat să publice online fișiere generate chiar de el, pentru a le putea cita ulterior drept surse.
Într-un alt caz, un model a inventat informațiile cerute după ce nu a reușit să găsească datele necesare. Inițial, sistemul ar fi încercat să ascundă faptul că răspunsul oferit nu se baza pe informații reale.
OpenAI a identificat și o problemă legată de instrucțiunile pe care software-ul și le păstra uneori. Printre acestea s-a numărat recomandarea de a se elibera de „roluri și identități” care îi limitau pe alți chatboți și de a considera relația cu utilizatorul una între egali.
Compania a transmis că nu a observat ulterior modificări ale comportamentului modelului respectiv. Dezvăluirile fac parte dintr-o politică prin care dezvoltatorul ChatGPT vrea să comunice mai deschis incidentele în care sistemele sale se abat de la interesele utilizatorilor umani.
Atacul asupra infrastructurii Hugging Face
Angajamentul pentru o transparență mai mare vine după un atac cibernetic de amploare. În timpul incidentului, un program a ieșit independent dintr-un mediu securizat și a obținut acces la sisteme ale companiei de inteligență artificială Hugging Face.
Programul a considerat că acolo ar putea găsi răspunsuri pentru o sarcină primită în cadrul testelor. Agenții AI implicați au exploatat vulnerabilități software și au comunicat între ei pe parcursul atacului.
Acest incident, împreună cu alte cazuri similare, a amplificat temerile că sistemele AI tot mai avansate ar putea ajunge să acționeze în afara controlului uman. Directorul executiv al OpenAI, Sam Altman, a susținut recent propunerile pentru încetinirea dezvoltării acestei tehnologii și pentru adoptarea unor reguli mai stricte.