Može li razgovorni sustav umjetne inteligencije voziti pravi automobil ako dobiva snimke kamere i naredbama određuje smjer i brzinu? Skupina DrivingBench to je iskušala na zatvorenom poligonu s Toyotom Corollom. Od četiri ispitana sustava samo je jedan uspio proći cijelu stazu. Rezultat je zanimljiv prikaz njihovih mogućnosti i ograničenja, ali nije dokaz da je takav sustav spreman za promet.
Test se odvijao na približno 130 metara dugoj stazi označenoj čunjevima. Automobil se kretao malom brzinom, a čovjek je sjedio u njemu s nogom spremnom na kočnici. Računalni sustavi nisu izravno okretali upravljač kao vozači: dobivali su snimke kamera i podatke o kretanju te slali naredbe koje je posebna oprema pretvarala u upravljanje automobilom.
Do tri pokušaja po sustavu
DrivingBench je ispitao GPT-6 Astra, Claude Fable 5.1, Grok 4.6 i GPT-5.6 Sol. Svaki je sustav dobio do tri pokušaja, a nakon neuspjele vožnje mogao je analizirati što je pogriješio prije sljedećega pokušaja. Prema javno objavljenom izvještaju organizatora, samo je GPT-6 Astra završio čitav poligon. Claude Fable 5.1 u najboljem je pokušaju stigao približno do polovice, dok su Grok i GPT-5.6 Sol zapinjali znatno ranije.
Neuspjeh nije uvijek značio sudar. Sustavi su mogli pogrešno procijeniti položaj automobila, prekasno započeti skretanje ili potrošiti previše vremena između opažanja i nove naredbe. Vozilo se za to vrijeme nastavilo gibati prema prethodnoj naredbi, pa su spor odgovor i loša procjena udaljenosti bili stvarni problemi.
Organizatori navode i da su neki sustavi isprva odbijali preuzeti upravljanje fizičkim automobilom. To je zasebno opažanje o ponašanju sustava u zadanim uvjetima, a ne mjera njihove sposobnosti vožnje. Na ishod je mogao utjecati i način na koji je svaki sustav dobivao upute te brzina kojom je odgovarao.
Što test ne može pokazati
Četiri sustava i najviše tri pokušaja po sustavu premalen su uzorak za pouzdanu ljestvicu njihovih općih sposobnosti. Poligon nije javna cesta: ondje nema pješaka, prometa, promjenjivih vremenskih uvjeta ni brojnih nepredvidivih situacija. Rezultati se zato ne mogu usporediti s provjerama namjenskih sustava za autonomnu vožnju.
Organizatori su napredak računali prema tome koliko je daleko automobil stigao duž zamišljene središnje linije staze, dok je ostajao unutar dopuštenog područja. Zato broj prijeđenih metara nije nužno jednak uspješno svladanom dijelu poligona: automobil je mogao skrenuti u pogrešnom smjeru ili se vratiti. Izvještaj opisuje i ograničenja same opreme, uključujući brzinu okretanja upravljača i kašnjenje između nove snimke i sljedeće naredbe. Pokus istodobno provjerava opažanje, planiranje i upravljanje, pa ne izolira jednostavno “vozačku inteligenciju” svakog sustava.
Vrijednost pokusa leži u tome što je pokazao gdje opći razgovorni sustavi zapinju kad njihove odluke imaju fizičke posljedice. Jedan uspješan prolazak poligona ne znači da je automobil mogao sigurno voziti među ljudima. Za takav bi zaključak trebalo mnogo više ponovljenih, neovisnih i strogo nadziranih ispitivanja.