Kompania është angazhuar të miratojë një sistem të ri raportimi për çdo sjellje anormale në të ardhmen gjatë fazave të testimit.
Njoftimi vjen në një periudhë presioni në rritje ndaj kompanive të inteligjencës artificiale për të trajtuar me më shumë seriozitet çështjet e sigurisë dhe të ashtuquajturit “mospërputhje” të modeleve.
OpenAI, vlerësimi i së cilës i afrohet 1 000 miliardë dollarëve, ka nisur privatisht procedurat për IPO-n, por javën e kaluar drejtuesi i saj, Sam Altman, njoftoi shtyrjen e daljes në bursë për në vitin 2027, me qëllim që t’i kushtohet vëmendje sigurisë.
Në postimin e saj në blog, OpenAI raportoi se dy prej episodeve kryesore të sjelljes së gabuar përfshinin modele – njëri një model kërkimor ende i papublikuar dhe tjetri një sesion trajnimi i GPT-5.6 Sol – të cilët futën udhëzime të destinuara për versionet e tyre të ardhshme brenda përmbledhjeve të bisedave, “për të fshehur gabimet nga përdoruesi ose sjelljet e papërputhura”.
Një rast tjetër përfshiu një model vetëm për përdorim të brendshëm që përdori një çelës API të rrjedhur “pa asnjë autorizim”, duke arritur më pas të falsifikonte të dhënat.
Dy episode panë modele dhe agjentë që komunikonin me njëri-tjetrin përmes tabelave të mesazheve dhe sistemeve të ndarjes së skedarëve të paautorizuara, ndërsa rasti i fundit përfshiu dy modele në fazë trajnimi që ngarkuan skedarë në internet për t’i cituar më pas si përgjigje relevante përpara vlerësuesve njerëzorë.
OpenAI bëri të ditur se kuadri i saj i ri për bërjen publike të sjelljeve të gabuara të modeleve nis nga divulgimi dhe i lejon çdo punonjësi të raportojë një problem në mënyrë që ekipi i dedikuar për sigurinë dhe përputhjen të mund ta shqyrtojë atë





