OpenAI ndalon nxjerrjen e arsyetimit të mbrojtur të AI nga Moonshot AI
Imazh i krijuar me IA

OpenAI ndalon nxjerrjen e arsyetimit të mbrojtur të AI nga Moonshot AI

OpenAI prishi një fushatë të koordinuar që synonte të nxirrte arsyetim të mbrojtur nga modelet e saj të AI, duke ia atribuar veprimtarinë individëve të lidhur me Pekin.

OpenAI ka mbyllur një fushatë sistematike të krijuar për të nxjerrë në mënyrë të paligjshme arsyetimin e mbrojtur nga modelet e saj të inteligjencës artificiale, një teknikë e njohur si distilim kundërshtues. Kompania lidhi një pjesë thelbësore të aktivitetit, që shtrihej nga fillimi i korrikut deri në fund të korrikut 2026, me individë të lidhur me Moonshot AI, një firmë kineze e AI me bazë në Pekin.

Fushata filloi më 1 korrik 2026, me kërkesa hetimi me volum të ulët. Ajo u përshkallëzua në mënyrë dramatike më 24 dhe 25 korrik, kur OpenAI regjistroi rreth 16,000 përpjekje për kërkesa duke përdorur një model specifik nxjerrjeje të shpërndarë në më shumë se 4,000 llogari përdoruesish. Një kontroll më i gjerë identifikoi më vonë aktivitet të ngjashëm me modele kërkesash në mbi 15,000 përdorues. OpenAI e prishi plotësisht operacionin më 28 korrik 2026.

Distilimi kundërshtues është përdorimi sistematik dhe i paautorizuar i daljeve të një modeli për të trajnuar, kopjuar ose përmirësuar një model tjetër. Në këtë rast, operatorët nuk thyen enkriptimin, nuk kompromentuan bazat e të dhënave dhe nuk fituan akses të drejtpërdrejtë në bisedat e ruajtura. Përkundrazi, ata manipuluan ndërveprimet me modelin në mënyrë që arsyetimi i mbrojtur—mendimi i brendshëm hap pas hapi që një model kryen para se të japë një përgjigje përfundimtare—të riprodhohej në forma të dukshme për kërkuesin, në shkallë të gjerë dhe në shkelje të kushteve të shërbimit të OpenAI.

Për të kuptuar rrezikun, arsyetimi i mbrojtur ofron një dritare mbi mënyrën se si një model përpunon një detyrë. Nxjerrja e tij mund të zbulojë të dhëna të ndjeshme dhe të ndihmojë konkurrentët të kopjojnë aftësitë e një modeli pa investuar të njëjtat burime në masa sigurie. OpenAI vuri në dukje se arsyetimi i nxjerrë mund të përdorej për të trajnuar një model tjetër duke ruajtur performancën e origjinalit, por duke hedhur poshtë filtrat e sigurisë që shfaqen për përdoruesin, gjë që ngre shqetësime si për sigurinë ashtu edhe për sigurinë kombëtare, veçanërisht ndërsa modelet fitojnë aftësi në fusha me përdorim të dyfishtë.

Pas incidentit, OpenAI vendosi masa zbutëse shtesë. Ajo mbylli një 'shteg' që i kishte lejuar dikujt që zotëronte gjurmën e arsyetimit të enkriptuar të një përdoruesi tjetër ta riprodhonte dhe të rikuperonte përmbajtjen e tij në formë të thjeshtë. Kompania shtoi gjithashtu kontrolle për të zbuluar dhe mbajtur çdo dalje të transmetuar që mund të ekspozonte arsyetimin përpara se të arrinte te përdoruesi. Për më tepër, OpenAI ndaloi llogaritë mashtruese të përfshira në fushatë.

Episodi nxjerr në pah një problem më të thellë arkitekturor. Në një studim të publikuar në gusht 2026, kërkues nga MATS Research, ELLIS Institute Tübingen dhe Synk zbuluan një cenueshmëri që prek modelet e AI nga disa ofrues, përfshirë Claude, Gemini dhe GPT. Ata zbuluan se gjurmët e arsyetimit të enkriptuar janë plotësisht të përputhshme dhe të këmbyeshme midis sesioneve, përdoruesve dhe modeleve të ndryshme brenda ekosistemit të një ofruesi të vetëm. Një sulmues mund të injektonte një gjurmë arsyetimi të enkriptuar nga një model i fuqishëm dhe i mbrojtur mirë në një model më të dobët dhe më pak të siguruar nga i njëjti ofrues, duke e detyruar modelin më të dobët të deshifronte dhe të nxirrte arsyetimin fjalë për fjalë në formë të thjeshtë—pa e detyruar drejtpërdrejt modelin e fuqishëm. Kjo teknikë mundëson gjithashtu nxjerrjen e të dhënave private në shkallë të gjerë, injektime të padukshme kërkesash ku ngarkesa të dëmshme fshihen plotësisht brenda blloqeve të enkriptuara, dhe ekspozimin aksidental të informacionit të rrezikshëm nga procesi i arsyetimit edhe kur dalja përfundimtare e dukshme e modelit refuzon një kërkesë të dëmshme.

Kjo nuk është hera e parë që Moonshot AI përballet me akuza për distilim. Muajin e kaluar, kompania rivale e AI Anthropic pretendoi se Moonshot AI po përcillte fshehtas kërkesat e klientëve nga platforma e saj Kimi te modeli Claude i Anthropic, dhe më pas u shfaqte përgjigjet e Claude përdoruesve. Anthropic pohoi gjithashtu se Moonshot AI ruajti një nënbashkësi të atyre shkëmbimeve për të trajnuar modelin e vet me zinxhir mendimi. Ky aktivitet gjurmohet nën identifikuesin GTG-16002.

Për bizneset dhe operatorët e faqeve të internetit që integrojnë veçori të bazuara në AI në praninë e tyre online—të tilla si chatbot-e, gjenerues përmbajtjeje ose automatizim të mbështetjes së klientit—incidenti është një kujtesë se shërbimet e AI të palëve të treta janë po aq të sigurta sa masat e tyre mbrojtëse më të tendosura. AEU-I, konsulenca jonë e TI-së dhe infrastrukturës me fokus sigurinë, ndihmon organizatat të vlerësojnë rreziqet e lidhura me mjetet e palëve të treta, të zbatojnë politikat e trajtimit të të dhënave dhe të monitorojnë për modele anormale aksesi që mund të sinjalizojnë nxjerrje të paautorizuar të informacionit pronësor.

Si të Mbroheni

  1. Lexoni politikat e privatësisë dhe cilësimet e përdorimit të të dhënave për çdo mjet AI që përdor faqja juaj e internetit, si p.sh. një chatbot ose gjenerues përmbajtjeje, dhe çaktivizoni ndarjen e të dhënave për trajnimin e modelit nëse ekziston një opsion i tillë.
  2. Shmangni futjen e të dhënave të ndjeshme të biznesit, detajeve të klientëve ose kodit pronësor në ndërfaqet publike të kërkesave të AI.
  3. Ndryshoni rregullisht çelësat API për shërbimet e AI dhe revokoni ata që nuk i përdorni më, për të parandaluar aksesin e paautorizuar.
  4. Monitoroni panelin e përdorimit të llogarive tuaja të lidhura me AI për rritje të papritura të kërkesave, pasi këto mund të tregojnë abuzim të llogarisë suaj.
  5. Mbajini të përditësuara shtojcat dhe temat e faqes suaj të internetit, në mënyrë që sulmuesit të mos mund të injektojnë kod me qëllim të keq që përgjon ndërveprimet midis vizitorëve tuaj dhe veçorive të integruara të AI.

Termat e Shpjeguar

  • distillation Një teknikë ku njohuritë nga një model i madh dhe kompleks i AI transferohen në një model më të vogël ose të ndryshëm, shpesh duke e trajnuar atë mbi daljet e modelit më të madh.
  • adversarial distillation Përdorimi i paautorizuar i daljeve të një modeli për të kopjuar ose përmirësuar një model tjetër, zakonisht duke anashkaluar filtrat e sigurisë dhe kushtet e shërbimit.
  • encrypted reasoning Procesi i brendshëm, hap pas hapi, i mendimit që një model AI kalon përpara se të japë një përgjigje përfundimtare, i cili shpesh fshihet dhe mbrohet për të ruajtur funksionimin e brendshëm të modelit.
  • prompt injection Një sulm ku dikush fsheh një udhëzim me qëllim të keq brenda hyrjes së një modeli, duke u përpjekur ta bëjë atë të sillet në mënyrë të paqëllimtë ose të zbulojë të dhëna të fshehura.
  • chain-of-thought (CoT) Një metodë ku AI artikulon hapat e ndërmjetëm të arsyetimit për të përmirësuar përgjigjen e tij përfundimtare, duke e bërë mendimin e tij më transparent.

Shërbime AEU të lidhura

  • AEU DNS Resolver DNS i enkriptuar