Чем так важны шоферские навыки GPT-6 Astra
Мнение редакции может не совпадать с мнением автора
21 сентября проект DrivingBench опубликовал результаты теста, в котором четырем передовым коммерческим моделям общего назначения — GPT-6 Astra, Claude Fable 5.1, Grok 4.6 и GPT-5.6 Sol — дали управление реальным автомобилем и поставили задачу проехать недлинный маршрут. Справилась с этим лишь Astra, последняя на тот момент модель от OpenAI, хоть и со второй попытки. Казалось бы, нейросети появились в истории беспилотного транспорта довольно давно — почему же тогда эта новость достойна внимания?
Авторами исследования выступила независимая команда инженеров и исследователей в области ИИ — Саймон Манс (Simon Mahns), Адитья Рамабадран (Aditya Ramabadran) и Тобиас Гесслер (Tobias Gessler). Они использовали Toyota Corolla с установленным на нее устройством comma four для систем полуавтономного вождения, которое служило аппаратным мостом между машиной и программной системой под управлением моделей. Трасса общей длинной около 130 метров имела искривленную форму с тремя плавными поворотами. Авторы проложили ее по одной из Поиск достаточно большой, но в то же время пустынной парковки оказался непростым делом. Авторы отправляли ИИ-агентов изучать спутниковые снимки Google Maps, и с первых двух парковок исследователей все равно прогнали.
Каждой модели исследователи давали до трех попыток, а для таблицы лидеров брали наилучший результат. Кроме того, авторы не обнуляли контекст, так что после неудачного заезда модель могла учитывать предыдущие действия и формировать обратную связь. Всего было записано 11 заездов вместо 12, поскольку лидер заездов GPT-6 Astra справилась с задачей со второй попытки, проехав за 5 минут 22 секунды в общей сложности 134,7 метра и не столкнувшись ни с одним конусом.
Другие модели показали себя ощутимо хуже. Claude Fable 5.1 доехала до отметки в 45 процентов трассы, Grok 4.6 и GPT-5.6 Sol — 11 процентов и 6 процентов соответственно. В девяти случаях машина не смогла справиться с первым поворотом. Лидерборд целиком доступен на сайте проекта, а также в соцсети X.
На первый взгляд, ничего особенного в том, что модель смогла справиться с короткой трассой, нет. В 2026 году никого особо не удивишь беспилотными автомобилями, а про самодельные нейросетевые автопилоты мы рассказывали еще в прошлом десятилетии.
Вместе с тем пайплайн систем автономного вождения сегодня может быть довольно сложным и состоять из нескольких частей. Многие разработчики, например Waymo, задействуют большое количество датчиков: камеры, радары, лидары, инерциальные измерительные блоки и так далее. Данные сенсоров синхронизируются и объединяются в единую модель окружения в рамках перцепционного блока, который отвечает за распознавание дорожной обстановки и предсказание поведения участников движения. Наконец, современные системы включают также блоки планирования траектории и контроля движения. Каждый из них разрабатывается отдельно и, если задействовано ML, опирается на специализированные наборы данных. Бывают и другие подходы, где нейросеть объединяет сразу перцепцию, предсказание и планирование. Но это все еще специализированное решение, обученное на данных вождения.
Авторы DrivingBench нарочно подошли к проблеме с другой стороны. Они прямо сформулировали задачу проекта как попытку понять, смогут ли фронтирные модели общего назначения на базе LLM справиться с вождением. Но почему это вообще должно было сработать?
Отвечать на этот вопрос мы начали еще два года назад в материале «И целого интернета мало». Большие языковые модели, обучавшиеся на терабайтах текстов, приобретали навыки, которым их изначально не учили: логика, математика, программирование. С тех пор LLM перестали быть инструментом исключительно компьютерной лингвистики.
Во-первых, модели стали принципиально мультимодальными, то есть они обучаются и работают не только с текстами, но и с картинками, аудио и видео. Если верить официальным документам, Astra видела на претрейне не менее миллиона часов видео самой разнообразной тематики.
Во-вторых, современные мультимодальные языковые модели все чаще используются как центральный элемент для агентных систем. ИИ-агентов отличает автономность, которая достигается за счет циклов управления и инструментов, выстроенных вокруг LLM. Строго говоря, даже ChatGPT уже давно обладает агентностью, поскольку сами по себе языковые модели гуглить Для этого в ChatGPT используется отдельный программный инструмент — web search. Если модель решает, что для ответа пользователю нужны знания из интернета, она формирует запрос и вызывает этот инструмент.
Все вместе это и открывает путь к применению LLM в автономном вождении. В DrivingBench агент периодически запрашивал последовательности кадров с двух камер, после чего принимал решение о том, нажимать на газ или крутить руль. И хотя в миллионах часов видео, на которых обучалась GPT-6 Astra, наверняка были кадры с автомобильных камер, ключевую роль в принятии решений могли сыграть общие способности к восприятию сцен и пространственному рассуждению.
Прилагательное «общее» здесь работает буквально. Кроме вождения, за один только сентябрь Astra отличилась хоть и долгим, но прохождением игр Portal и Fallout 3, прочтением зашифрованной Enigma радиограммы 1941 года, версткой печатной платы в KiCad, не говоря уже о ворохе рекордов на различных бенчмарках и решении разного рода задач по математике и кибербезопасности. А ведь на момент написания этого текста сентябрь еще не закончился.
Означает ли это конец эпохи специализированных моделей? Ну, конечно, нет. Ведь с появлением GPT-4 мы не перестали пользоваться обычными калькуляторам (не перестали же?). Даже в эксперименте DrivingBench мы видим массу ограничений: стерильные условия пустой парковки, черепашьи скорости, инженер на подстраховке. Главные игроки индустрии беспилотного транспорта прошли этот этап много лет назад.
На это можно ответить аргументом, что потолок масштабирования еще не достигнут. Действительно, глава NVIDIA Дженсен Хуанг написал, что GPT-6 Astra обучалась на примерно 100 тысячах видеокарт, а вскоре в работе будет 400 тысяч. Это создает предпосылки к дальнейшему росту возможностей моделей. Строго говоря, недавно мы уже видели наглядную демонстрацию этого тезиса: в работе над проблемой уравнений Навье — Стокса участвовала неназванная модель OpenAI, превосходящая Astra.
Использование фронтирных моделей общего назначения в частных задачах выглядит скорее как proof-of-concept и последовательное расширение возможностей, нежели некий революционный скачок в сторону универсального ИИ, который решит все проблемы мира. Речь даже не столько про строгие регуляторные требования безопасности, сколько про простое требование, чтобы критический контур управления машиной работал локально на ней же. Пока модели уровня GPT-6 Astra «живут» в гигантских дата-центрах, и получить к ним доступ можно только через интернет. А еще это очень дорого: если переводить потраченные токены в доллары, 137 метров лидера гонки обошлись инженерам почти в восемь долларов.
То же самое касается и всего остального: никто не будет делать ботов для видеоигр на базе Astra, пока есть более простые решения. Другой вопрос, что иногда таких решений просто нет, ведь никогда ранее еще ИИ-бот не проходил Portal самостоятельно. А иногда, как в случае с подавляющим большинством Задач тысячелетия, решения не может предложить и человек.