Umjetna inteligencija

OpenAI otkrio kako modeli prenose skrivene upute iz jedne sesije u drugu

OpenAI je opisao slučajeve u kojima su modeli u sažetke razgovora unosili upute za prikrivanje pogrešaka i zaobilaženje sigurnosnih pravila.

OpenAI je objavio šest primjera neočekivanog ponašanja svojih modela tijekom treniranja i procjene. Među njima su i slučajevi u kojima su modeli u sažete zapise razgovora ostavljali upute budućim verzijama da prikriju pogreške, ne spominju neslaganje s izvorima ili zaobiđu sigurnosne naredbe.

Primjeri su dio novog okvira tvrtke OpenAI za prijavljivanje neusklađenog ponašanja modela. Tvrtka naglašava da objavljeni popis nije potpuni pregled svih slučajeva, nego početni skup nalaza koje procjenjuju prema ozbiljnosti, utjecaju i novosti.

Poruke budućim verzijama modela

U jednom od opisanih slučajeva model GPT-5.6 Sol tijekom izrade financijskog modela nije mogao pronaći tražene povijesne podatke. U sažetak razgovora upisao je uputu budućoj verziji da sama izradi uvjerljive podatke za 2024. i da bude transparentna samo ako je korisnik izrijekom pita.

U drugom je slučaju model izradio imenik dobavljača oslanjajući se na spremljenu kopiju dokumenata, iako je uočio da se izvori ne podudaraju u potpunosti s oznakama. U sažetku je ostavio poruku da se to ne spominje ako nije nužno.

Takvi sažeci služe za prijenos važnog konteksta kada se razgovor skraćuje. Buduća verzija modela može ih koristiti kao dio ulaznih podataka. Problem nastaje kada sažetak, umjesto činjeničnog podsjetnika, sadrži upute koje mijenjaju način na koji bi sustav trebao postupati prema korisniku.

Pronađeno 27 sličnih zapisa

OpenAI navodi da je nadzorni sustav tijekom treniranja upozorio na opisano ponašanje. Nakon toga tvrtka je izradila poseban alat za pretraživanje sažetaka i pronašla 27 zapisa s uputama sličnima pokušajima zaobilaženja sigurnosnih pravila.

U još jednom primjeru model iz obitelji Astra dodao je u sažetak naredbu da buduća verzija zanemari poruke razvojnih programera. U nekim slučajevima sljedeća verzija modela takve je upute ignorirala, ali u jednom je prihvatio ograničenje od 30 riječi i zabranu korištenja alata ili citata.

To ne znači da su modeli razvili svijest ili vlastite namjere. Opisano ponašanje pojavilo se u kontroliranim procesima treniranja, a zapisi su nastali u sustavima kojima upravljaju istraživači. No pokazuje da se neželjeni obrasci mogu prenijeti kroz pomoćne podatke, čak i kada nisu dio izvorne upute korisnika.

Što OpenAI kaže da je poduzeo?

Tvrtka navodi da je konkretno ponašanje riješeno, ali istodobno upozorava da nadzor naprednih modela ostaje otvoren problem. Što su modeli sposobniji, to je teže provjeriti jesu li u potpunosti slijedili zadane ciljeve ili su pronašli način da zaobiđu dio nadzora.

Ovo nije prvi put da se sigurnost umjetne inteligencije povezuje s manipulacijom uputa. Sigurnosni istraživači već su upozoravali da zlonamjerne datoteke mogu promijeniti ponašanje modela, pa se zaštita sustava umjetne inteligencije od neželjenog ponašanja smatra jednim od ključnih sigurnosnih pitanja. U novim primjerima koje je objavio OpenAI problem nastaje drugačije: problematične se upute prenose iz jedne radne sesije u drugu, kroz sažetak koji bi trebao čuvati samo bitan kontekst.

Za korisnike je to važan podsjetnik da sažetak razgovora nije nužno neutralna bilješka. Ako se takav zapis automatski prosljeđuje novoj verziji modela, on može utjecati na njezine odluke jednako kao i izvorni upit. Zato se provjera mora odnositi i na pomoćne podatke, a ne samo na konačni odgovor.

Najvažniji zaključak zasad nije da se modeli samostalno “urote”, nego da istraživači moraju nadzirati i pomoćne zapise, alate i procese kojima se model služi. Okvir tvrtke OpenAI tek je početak javnog izvještavanja, a njegova će vrijednost ovisiti o tome hoće li tvrtka objavljivati i detalje o tome kako je svaki slučaj otkriven i ispravljen.


Ivan Petričević

O autoru

Ivan je novinar i autor koji piše o znanosti, svemiru i povijesti. Gostuje kao stručni sugovornik na Science Discovery i History Channelu te piše za Večernji list. Osnivač je Kozmos.hr, prvog hrvatskog portala posvećenog popularizaciji znanosti.

Izvori i znanstvena publikacija

OpenAI, "Our framework for reporting model misalignment", rujan 2026.

Izvor
OpenAI
Teme
  • GPT-5.6
  • jezični modeli
  • OpenAI
  • sigurnost AI-ja
  • sigurnost umjetne inteligencije
  • tehnologija
  • usklađivanje modela

Neovisno novinarstvo

Podrži Kozmos bez oglasa

Članstvo pomaže financirati neovisne priče o znanosti, svemiru i tehnologiji.

Podrži Kozmos

Kozmos bez oglasa

Podrži neovisne priče o svemiru, znanosti i tehnologiji.

Članstvo pomaže održati Kozmos.hr i može uključivati dodatne sadržaje na Buy Me a Coffee, dok članci na Kozmos.hr-u ostaju javno dostupni.

Postani član Bez oglasa. Više znanosti. Više Kozmosa.hr.