Следующий большой скачок искусственного интеллекта — в реальный мир

Инженеры и инвесторы устремились к «моделям мира», также известным как «большие модели действий», в надежде совершить в робототехнике ту же революцию, которую ChatGPT произвел в письме и программировании.

GlobesАвтор: The Wall Street Journal
Источник
Следующий большой скачок искусственного интеллекта — в реальный мир
Фото: Globes / בינה מלאכותית מוטמעת ברובוט כלב / צילום: ap, Joan Mateu Parra

Большие языковые модели искусственного интеллекта сегодня, возможно, преуспевают в офисной работе, но, по мнению специалистов в этой области, для выполнения задач в физическом мире необходимы большие модели действий (large action models), также называемые «моделями мира» (world models).

Согласно методу, предназначенному для обучения искусственного интеллекта управлению роботами, модели обучаются с помощью видеоигр и симуляций, а не на литературе, коде и изображениях. Недавно технология достигла точки, когда модели способны ориентироваться в трехмерном пространстве и даже управлять объектами самостоятельно с помощью простой серии инструкций.

Технология все еще находится в зачаточном состоянии, по словам Морица Байер-Ленца, который инвестирует в несколько компаний в этой сфере. «Если сравнивать это с большими языковыми моделями, мы находимся примерно на стадии GPT-2», — сказал он (модель, которую OpenAI выпустила в 2019 году).

Хотя модели мира все еще находятся на относительно ранней стадии, некоторые из самых известных имен в технологической индустрии уже устремились в эту область. Ставка делается на то, что принципиально новая архитектура сможет привести искусственный интеллект туда, куда системы, основанные на современных больших языковых моделях, добраться не способны. И пионеры этой области надеются, что однажды можно будет объединить оба подхода.

Как работают «модели мира»

Цель

Внедрить искусственный интеллект в роботов, действующих в реальном мире, при сокращении ошибок и возможности причинения вреда людям.

Обучение

С помощью видеоигр. Модель фиксирует каждый кадр в игре наряду с действиями, которые совершают пользователи. Таким образом, искусственный интеллект может связать действия с их результатами.

Ограничение

Робот должен быть четырехногим, колесным транспортным средством или дроном, и им можно управлять с помощью игрового контроллера, мыши или клавиатуры.


От слов к мирам

На протяжении около полумиллиарда лет животные постепенно развивали мозг, способный создавать модель окружающего мира и использовать эту ментальную карту для планирования своих дальнейших действий. Язык, напротив, существует всего около ста тысяч лет, и он является своего рода сокращенным путем, который люди создали для обработки и передачи идей, больших и малых.

«Текст — это всего лишь частичное представление реального мира, в котором информация теряется», — сказал Кент Роллинс, главный директор по продукту General Intuition и бывший менеджер экосистемы Fortnite в Epic Games. «Мир существовал задолго до того, как у нас появился текст, поэтому, когда мы используем текст для его описания, мы неизбежно упускаем его существенные аспекты».

Исследователи робототехники знают это уже давно. Системы управления более сложных роботов сегодня полагаются на симуляции, основанные на законах физики, чтобы имитировать физический мир. Это тоже модели мира, но они тщательно прописываются в коде и адаптируются под очень конкретные цели. Система, которая работает для одного типа робота, не обязательно подходит для другого.

Стартапы, разрабатывающие сегодня модели мира, стремятся создать систему управления, которая будет столь же универсальной в управлении роботами, как современные большие языковые модели универсальны в создании текста, от сонетов до программного обеспечения.

Обучение на основе видеоигр

Нью-йоркский стартап под названием General Intuition, разрабатывающий модели мира, завершает в эти дни раунд финансирования с оценкой более 6 миллиардов долларов, что сделает его самой дорогой лабораторией искусственного интеллекта в своем роде. Основа для обучения его модели — видеоигры: модель фиксирует каждый кадр в игре наряду с действиями, которые совершают пользователи, от каждого нажатия кнопки до движения джойстика. В отличие от роботов, обученных только с помощью видео, в этом методе искусственный интеллект может связать действия пользователей с их результатами в виртуальных мирах, и так создается большая модель действия.

После небольшой адаптации модель может управлять роботом в реальном мире, как если бы он был персонажем видеоигры. Тем не менее, есть ограничение: робот должен быть четырехногим, колесным транспортным средством или дроном, того типа, который обычно транслирует пользователю видео в реальном времени и которым можно управлять с помощью игрового контроллера, мыши или клавиатуры. Эти характеристики довольно распространены среди широко используемых роботов, но не подходят для большинства человекоподобных роботов, которые ходят на двух ногах.

Модель General Intuition обучается на миллионах часов, в течение которых люди играли в видеоигры. Данные были собраны с Medal.tv, дочернего сервиса компании и платформы для записи и обмена игровыми клипами.

В офисах General Intuition в Нью-Йорке, Женеве и их окрестностях компания демонстрирует робота-собаку. В то время как обычному искусственному интеллекту для управления таким роботом может потребоваться обучение в огромном объеме, этой модели достаточно нескольких минут адаптации. Система должна знать, где она находится, в каком типе тела она работает и какова ее цель, и оттуда она уже начинает действовать, по словам Байер-Ленца, который инвестирует в General Intuition.

Предыдущие демонстрации моделей мира, такие как модели Genie, представленные Google DeepMind, были сосредоточены на создании новых миров, в которых можно обучать роботов. Новое поколение уже способно воспринимать окружающий мир и решать, что делать дальше. Джек Паркер-Холдер, ранее возглавлявший деятельность Google в области моделей мира, стал одним из соучредителей лондонской Emulate. Молодая лаборатория ведет переговоры о привлечении более 500 миллионов долларов от инвесторов, и в ее техническую команду входят также шесть бывших сотрудников Google, согласно документам, изученным The Wall Street Journal.

Язык + действие = ?

Другие компании, разрабатывающие модели мира, редко раскрывают подробности о системах искусственного интеллекта, которые они строят, но их приобретения и публикации их инженеров дают некоторые подсказки.

Во главе стартапа World Labs стоит профессор Фэй-Фэй Ли из Стэнфордского университета, которая ранее работала в Google и которую называют «крестной матерью искусственного интеллекта». Компания недавно приобрела робототехническую компанию Sanix. Во главе AMI Labs стоит Ян Лекун, бывший главный научный сотрудник по искусственному интеллекту в Meta. Похоже, что компания движется в более широком направлении и изучает несколько архитектур, которые выходят за рамки традиционных больших языковых моделей.

В то время как General Intuition и другие стартапы подчеркивают свои возможности в области робототехники, инвесторы и потенциальные деловые партнеры задают еще один вопрос: как модели мира могут улучшить возможности существующих языковых моделей?

Чтобы большие языковые модели могли обрабатывать изображения и звук, их нужно обучать непосредственно на этом контенте и преобразовывать входные данные в токены, как они делают это со словами. Попытка обрабатывать таким образом трехмерную среду оказалась крайне неэффективной, и результатом являются модели, слишком медленные для управления роботом в большинстве ситуаций.

В реальном мире «нельзя просто пропустить что-то примерно»

Но и у моделей мира есть свои проблемы. Было относительно легко продвигать ChatGPT от одного поколения к другому именно потому, что в начале своего пути он имел дело только с текстом. По мере того как большие языковые модели растут и получают все больше данных, они становятся больше и умнее, но продолжают ошибаться, по словам Джорджа Конидриса, профессора робототехники в Брауновском университете и соучредителя Realtime Robotics, разрабатывающей системы для промышленных роботов.

Когда дело доходит до роботов, существует гораздо меньше ситуаций, в которых мы будем готовы принять галлюцинации и другие ошибки.

«Реальный мир очень сложен, и в нем много исключительных случаев и жестких границ, и нельзя просто пропустить что-то примерно», — сказал Конидрис. «Если ваш робот врезается во что-то во время движения, все меняется».

Некоторые полагают, что повышения эффективности больших языковых моделей может быть достаточно, чтобы превратить их в искусственный интеллект, который будет управлять роботами и другими трехмерными приложениями. Но существует также возможность объединить оба подхода: большие языковые модели смогут использовать модели мира, как они сегодня используют другие программы для выполнения задач.

Тем временем легко заметить, что ни General Intuition, ни Emulate не расположены в районе залива Сан-Франциско, который был очарован возможностью того, что искусственный интеллект, основанный на больших языковых моделях, приведет к «сверхразуму».

Когда я спросил генерального директора General Intuition Пима де Вита, является ли сверхразум целью его компании, он выразил сомнение. «Я в Нью-Йорке, потому что хочу держаться подальше от всего этого сектантского поведения и просто сосредоточиться на научной оценке возможностей моделей в роботах», — сказал он. «Нет необходимости превращать это в нечто большее, чем оно есть».

Читайте также