Развитие ИИ движется вперёд, но практически весь видимый прогресс происходит в сфере работы со знаниями, то есть действий, происходящих внутри компьютера. В среде разработчиков ИИ Сан-Франциско широко распространено мнение, что к этой сфере скоро присоединятся и роботы. Параллельно с гонкой разработки ИИ широкого спектра применений идёт столь же агрессивная гонка разработки роботов широкого спектра применений — гуманоидных машин с физическим интеллектом. Искусственных работников, способных готовить пищу и убираться, быть грузчиками и делать всё остальное, в том числе и производить себе подобных, приводя по многим прогнозам к экономическому росту, который носит характеристику «взрывного».

Иными словами, распространено мнение, что ИИ в дата-центрах вскоре заместит весь интеллектуальный труд, а ИИ в человекоподобных телах скоро заменит весь физический труд. Однако здесь есть важная разница: мы уже видим прогресс в сфере интеллектуального труда, но физический ИИ пока в основном остаётся ограниченным испытательными полигонами и демонстрационными видео. Пока не существует робота, эквивалентного ChatGPT, которого могли бы приобрести мы с вами.

Поэтому приходится ограничиваться видеодемонстрациями. К сожалению, этот инструмент плохо подходит для оценки прогресса. Возможно, мы видим в них одну успешную попытку на сотню неудачных. Сценарий демонстрации может быть тщательно выстроен так, чтобы избегать сложностей, к которым робот пока не готов. Видео может быть смонтировано так, как будто робот действует быстрее и чётче, чем на самом деле. Есть пример очень впечатляющей демонстрации с подозрительно большим количеством смены ракурсов.

Человеческая рука имеет ~20 степеней свободы и 17 тысяч тактильных датчиков, что недостижимо для роботов.

Пока я ещё не видел практически ни одного видео с последних World Humanoid Robot Games. Они ценны тем, что на публичной платформе меньше возможностей для выборочного представления фактов. В паре просмотренных мной видео можно заметить впечатляющие возможности, но они не затрагивают многие сложности, которые я перечислил ниже. К тому же в этих видео есть множество громких провалов.

Демонстрации привлекают внимание к тем действиям, которые роботы уже умеют делать. Возникает вопрос: а чего они не могут? В этом посте я составлю список технических сложностей, которые нам предстоит преодолеть на пути к реализации искусственных работников с широкой функциональностью. Когда в следующий раз вы увидите робота, делающего нечто впечатляющее, задайтесь вопросом: какие из перечисленных в статье возможностей продемонстрировал робот и какие сложности попытался обойти сценарий видео?

Стоит отметить, что некоторые задачи становятся проще, если использовать роботов на колёсах, а не строго гуманоидных. Колёсный робот может перевозить больший вес, поэтому сила, выносливость и мощность электроники для него не так критичны. Ниже для него и вероятность упасть. Однако такие роботы не могут взбираться по лестницам, перешагивать через завалы или наклоняться, чтобы взять что-то из шкафа.

Руки, ловкость и координация. Человеческая рука — это инженерное чудо. У неё есть примерно два десятка «степеней свободы» (соединений и/или направлений, в котором может изгибаться каждое соединение) и приблизительно 17 тысяч тактильных датчиков. Наш мозг способен управлять руками с невероятным изяществом, используя тактильные, визуальные и даже аудиальные сигналы для точного и чёткого исполнения всевозможных изощрённых задач.

Современные «манипуляторы» роботов остаются лишь жалким их подобием. Руки некоторых роботов могут дотянуться до человеческого стандарта по тому или иному физическому атрибуту. Например, какие-то имеют до 27 степеней свободы. Однако ни один не сравнится по гибкости, чувствительности, силе, надёжности и другим физическим атрибутам. Именно сочетания факторов так особенно сложно достичь, несмотря на то, что демонстрации становятся всё более впечатляющими. Например, некоторым компаниям удалось уместить на кончиках пальцев роботов тысячи тактильных датчиков, но ни у одной не получилось пока обеспечить работоспособность этих крошечных датчиков под тяжёлой нагрузкой.

Вероятно, по уровню сложности с проблемой физического производства сравнима и проблема управления. Робот должен уметь подобрать нужное сочетание позиций соединений для ухватывания сложного предмета, планировать последовательность движений для складывания одежды, переворачивания омлета или затягивания болта в ограниченном пространстве; он должен уметь обращаться с мягкими и гибкими материалами (для чего может понадобиться мгновенная реакция на внезапное изменение формы).

Визуальное понимание. За последние десять-двадцать лет произошёл большой прогресс в сфере машинного зрения (computer vision, CV); он и привёл к буму глубокого обучения, ставшего началом развития LLM. Но ориентирование в сложных визуальных сценах — выбор предмета в куче других, понимание, как его нужно ухватить, определение, куда поставить ногу и как не уронить что-то другое — всё ещё нерешённая задача.

Планирование и реагирование. Робот общего назначения должен уметь разбивать сложные задачи на подзадачи, планировать последовательность действий и адаптироваться к изменениям окружающей среды. Это требует интеграции множества алгоритмов, от распознавания объектов до прогнозирования движения, и остаётся открытой проблемой.