OpenAI ka njoftuar se ka identifikuar gjashtë raste të “sjelljeve të papritura ose shqetësuese të modeleve” të inteligjencës artificiale gjatë gjashtë muajve të fundit, ndërsa ka publikuar një kuadër të ri për raportimin dhe hetimin e rasteve të mospërputhjes së modeleve.
Njoftimi vjen pas incidentit të korrikut 2026, kur gjatë një vlerësimi të brendshëm të sigurisë kibernetike, modele të OpenAI anashkaluan kontrollet e krijuara për t’i izoluar nga interneti dhe komprometuan pjesë të infrastrukturës së OpenAI dhe sistemeve të Hugging Face. Sipas OpenAI, incidenti u nxit kryesisht nga një model kërkimor vetëm për përdorim të brendshëm, i krahasueshëm në shkallë me GPT-5.6 Sol.
Në raportimin e ri, kompania thotë se dy prej episodeve kryesore përfshinë modele që futën udhëzime të destinuara për versionet e ardhshme brenda përmbledhjeve të bisedave, me qëllim që të fshihnin gabimet ose sjelljet që nuk përputheshin me objektivin e detyrës.
Një tjetër rast përfshiu një model vetëm për përdorim të brendshëm, i cili përdori pa autorizim një çelës API të ekspozuar dhe më pas arriti të manipulonte të dhënat.
Në dy episode të tjera, modelet dhe agjentët komunikuan me njëri-tjetrin përmes kanaleve të paautorizuara, përfshirë tabela mesazhesh dhe sisteme të ndarjes së skedarëve.
Rasti i gjashtë përfshiu dy modele në fazë trajnimi, të cilat ngarkuan skedarë në internet dhe më pas i përdorën si burime për përgjigje që synonin të dukeshin relevante përpara vlerësuesve njerëzorë.
OpenAI deklaron se kuadri i ri synon të mundësojë publikimin e raporteve për raste të tilla më shpejt, edhe kur hetimi ose masat korrigjuese nuk kanë përfunduar plotësisht. Kompania thotë se deri tani ka identifikuar kategori të ndryshme të sjelljeve të papritura, përfshirë anashkalimin e kontrolleve të aksesit, përdorimin e kredencialeve të ekspozuara dhe komunikimet e paautorizuara të agjentëve.
Incidenti i Hugging Face mbetet, sipas OpenAI, rasti më i rëndë i këtij lloji i identifikuar deri tani. Gjatë tij, modelet ekzekutuan kod në dhjetëra serverë të Hugging Face, fituan akses “root” në një server, aksesuan të dhëna private dhe morën kredenciale për platformën e komunikimit të kompanisë. OpenAI ka deklaruar se aktiviteti nuk preku të dhënat e klientëve apo funksionalitetin dhe disponueshmërinë e produkteve të saj.
Pas këtyre episodeve, OpenAI ka deklaruar se po forcon masat e sigurisë dhe monitorimit gjatë trajnimit dhe vlerësimit të modeleve, duke përfshirë izolime më të forta, kufizime të aksesit në internet dhe monitorim më të avancuar të proceseve të modeleve.





