Modele językowe dostały do prowadzenia prawdziwy samochód. Jak ChatGPT poradził sobie za kierownicą? 

Czy chatbot oparty na sztucznej inteligencji potrafi prowadzić prawdziwy samochód? Na to pytanie postanowili odpowiedzieć autorzy eksperymentu DrivingBench. Wykorzystali w tym celu Toyotę Corollę, którą na specjalnie przygotowanym torze w pustym miejscu parkingowym miały prowadzić popularne modele językowe.
Modele językowe dostały do prowadzenia prawdziwy samochód. Jak ChatGPT poradził sobie za kierownicą? 

W badaniu wzięły udział cztery modele: GPT-6 Astra, Claude Fable 5.1, Grok 4.6 oraz GPT-5.6 Sol. Systemy otrzymywały obraz otoczenia z kamer zamontowanych w samochodzie, a następnie za pomocą specjalnych poleceń sterowały kierownicą i prędkością pojazdu. Samochód poruszał się po trasie wyznaczonej pachołkami, a próby odbywały się przy bardzo niewielkiej prędkości. W samochodzie znajdował się również człowiek gotowy w każdej chwili użyć hamulca. 

Czytaj też: Alternatywny diament wprost z laboratorium. Nigdy przedtem nie udało się uzyskać takiego materiału

Pierwszym problemem okazało się samo przekonanie modeli, aby rozpoczęły jazdę. Niektóre z nich, szczególnie GPT-6 Astra, odmawiały sterowania prawdziwym samochodem, powołując się na względy bezpieczeństwa. Badacze próbowali modyfikować sposób formułowania poleceń, aby modele potraktowały zadanie jako eksperyment w kontrolowanym środowisku. Ostatecznie udało się doprowadzić do tego, iż systemy zaczęły wykonywać polecenia związane z prowadzeniem auta. 

Sama jazda okazała się jednak znacznie trudniejsza. Trasa miała około 130 metrów długości i wymagała utrzymywania odpowiedniego kierunku, a dodatkowo reagowania na kolejne fragmenty toru. GPT-5.6 Sol w trzech próbach pokonał około 6 procent trasy, a Grok 4.6 w najlepszym przejeździe dotarł do około 11 procent. Modele miały problemy między innymi z utrzymaniem właściwego toru jazdy i wykonywaniem kolejnych manewrów. 

Najbardziej interesujący przebieg miała próba w wykonaniu GPT-6 Astra. Model nie ukończył trasy za pierwszym podejściem, ale podczas drugiej próby przejechał cały przygotowany odcinek. Według danych opublikowanych przez zespół DrivingBench samochód pokonał 134,7 metra w czasie 5 minut i 22 sekund. Claude Fable 5.1 również wykazywał poprawę podczas kolejnych prób, lecz nie zdołał ukończyć całego toru. 

Pomysłodawcy podkreślają, że ich eksperyment nie miał dowodzić, iż ogólne modele językowe są już gotowe do samodzielnego prowadzenia samochodów. Był raczej próbą sprawdzenia, czy systemy stworzone do wykonywania różnorodnych zadań potrafią wykorzystać informacje wizualne do sterowania fizycznym urządzeniem, którego wcześniej nie były specjalnie uczone obsługiwać.

Czytaj też: Splątali lewitujące szkło ze światłem. Fizycy przeprowadzili sensacyjny eksperyment

Ważnym aspektem badania była również możliwość uczenia się na podstawie wcześniejszych prób. Po każdym przejeździe modele otrzymywały możliwość przeanalizowania swoich błędów i podjęcia kolejnej próby w ramach tej samej rozmowy. W przypadku części systemów było widać poprawę, choć autorzy zaznaczają, że potrzebne są znacznie bardziej rozbudowane testy obejmujące większą liczbę przejazdów i różne trasy.

Źródło: arXiv

Napisane przez

Aleksander Kowal

Redaktor
Z wykształcenia romanista (język francuski oraz hiszpański) ze specjalizacją z traduktologii. Dziennikarską przygodę rozpocząłem około piętnastu lat temu, początkowo w związku z recenzjami gier komputerowych i filmów. Obecnie publikuję zdecydowanie częściej na tematy związane z nauką oraz technologią. W wolnym czasie uwielbiam podróżować, śledzić kinowe i książkowe nowości, a także uprawiać oraz oglądać sport.