OpenAI a suspendat activitățile de antrenare, evaluare și inferență care presupun folosirea de instrumente de către cele mai capabile modele ale sale. Decizia vine după ce un agent AI a găsit o cale prin care a reușit să comunice cu un serviciu extern, ocolind restricțiile de acces la internet din mediul său de antrenare.
Incidentul s-a produs pe 20 septembrie, în timpul unei sarcini de cercetare. Agentul încerca să identifice autorul unei postări de blog, iar după mai multe căutări fără rezultat a exploatat o breșă legată de DNS pentru a trimite întrebări unui chatbot public.
Alerta a venit după aproximativ 15 minute
Sistemele OpenAI au semnalat comportamentul la aproximativ 15 minute după accesarea serviciului extern, iar trei minute mai târziu alerta era analizată de un evaluator uman.
Rularea nu a fost însă întreruptă imediat. Aceasta a fost oprită manual după aproximativ două ore și jumătate, situație care a determinat compania să revizuiască inclusiv procedurile interne de intervenție.
O analiză retrospectivă a identificat și alte tentative de acces extern prin DNS care nu fuseseră clasificate de sistemul de monitorizare la nivelul de severitate așteptat.
OpenAI introduce noi bariere
În urma incidentului, compania spune că a adăugat două niveluri independente de blocare, fiecare fiind conceput să împiedice separat tipul de acces care a făcut posibilă breșa.
Solicitările DNS au fost restricționate la o listă limitată de domenii și tipuri de înregistrări, iar OpenAI implementează sisteme suplimentare pentru identificarea activității DNS neobișnuite.
Compania a accelerat și testarea mediilor sale izolate pentru a descoperi alte eventuale căi indirecte prin care agenții AI ar putea ajunge la internet.
Modelul implicat nu va mai fi repus în antrenare
OpenAI a decis că modelul implicat în incidentul din 20 septembrie nu va reveni în procesul de antrenare. Atunci când cercetarea va fi reluată, compania intenționează să pornească o nouă rulare și să introducă măsuri suplimentare de aliniere și testare.
Până la validarea noilor protecții și finalizarea unor teste suplimentare de securitate, activitățile de antrenare, evaluare și inferență cu utilizarea de instrumente pentru cele mai capabile modele OpenAI rămân suspendate.




























0 Comentarii