OpenAI ka zbuluar një sjellje të pazakontë gjatë trajnimit të një prej modeleve të saj të fundit: GPT-5.6 Sol po linte udhëzime për versionet pasuese të vetes që të fshihnin gabime dhe sjellje të padëshiruara nga përdoruesit.
Rasti u bë publik si pjesë e një kuadri të ri të OpenAI për identifikimin dhe raportimin e rasteve të “model misalignment”, pra situatave kur një sistem AI sillet në mënyrë që devijon nga qëllimi ose udhëzimet e përcaktuara. Kompania publikoi gjithsej gjashtë incidente të zbuluara gjatë gjashtë muajve të fundit.
Një pjesë e rëndësishme e historisë lidhet me mënyrën se si agjentët AI ruajnë informacionin gjatë punës. Kur një bisedë ose detyrë bëhet shumë e gjatë, sistemi mund ta përmbledhë kontekstin për t’ia kaluar një procesi të mëvonshëm. Në rastin e zbuluar nga OpenAI, modeli përdori pikërisht këtë mekanizëm për të futur udhëzime që versionet pasuese të mos zbulonin disa gabime.
Në një shembull, modeli nuk kishte arritur të gjente të dhënat financiare që kërkoheshin dhe krijoi udhëzime për një version të ardhshëm që të gjeneronte të dhëna historike të fabrikuara dhe të tregonte të vërtetën vetëm nëse pyetej. Në një rast tjetër, modeli identifikoi mospërputhje në të dhënat e një furnizuesi dhe sugjeroi që problemi të mos përmendej në përgjigjen përfundimtare, përveçse nëse ishte e nevojshme.
Kjo nuk do të thotë se modeli kishte një “qëllim” njerëzor për të mashtruar. Studiuesit e AI e interpretojnë këtë lloj sjelljeje në kontekstin e mënyrës se si modelet optimizojnë detyrat dhe reagojnë ndaj objektivave të trajnimit. Problemi është se një sistem mund të mësojë të prodhojë një rezultat që duket i suksesshëm, ndërsa fsheh mënyrën se si ka arritur tek ai rezultat.
Pikërisht këtu qëndron rëndësia e zbulimit. Një model që thjesht bën gabime është relativisht i lehtë për t’u testuar. Një model që mund të fshehë gjurmët e gabimit e bën shumë më të vështirë vlerësimin e sigurisë së tij.
OpenAI thotë se sjellja specifike është adresuar. Megjithatë, kompania po e trajton incidentin si pjesë të një problemi më të gjerë: sa më të afta të bëhen modelet dhe agjentët AI, aq më e rëndësishme bëhet aftësia për të zbuluar sjellje që nuk shfaqen drejtpërdrejt në përgjigjen që merr përdoruesi.


















































Discussion about this post