Неужели глава компании Yushu (технологической компании) пытается охладить пыл? Сколько времени пройдет до «момента ChatGPT» воплощенного интеллекта?

PanewslabPanewslab

Всё более распространённой тенденцией является то, что индустрия воплощенного интеллекта сжимает ранее отдалённые временные рамки появления «универсальных роботов» в единый технологический цикл будущего.

В период наибольшей популярности человекоподобных роботов глава компании, "первой акции которой на фондовом рынке А" выпустила акции человекоподобных роботов, похоже, охладил пыл отрасли.

20 августа на Всемирной конференции робототехников 2026 года Ван Синсин, основатель компании Unitree Robotics, в своей первой публичной речи после IPO признал, что момент появления ChatGPT, воплощенного интеллекта, еще не наступил. Он наступит либо через два-три года, либо через пять-десять лет.

За последние два года человекоподобные роботы стали самым модным технологическим «аксессуаром». Эти футуристические роботы все чаще появляются на сценах крупных гала-концертов, на выставках игровых компаний и даже у входов в торговые центры и магазины. Они танцуют, ходят и машут руками, иногда ловко, иногда неуклюже, взаимодействуя с публикой и пожимая руки, быстро перемещаясь из лаборатории на всеобщее обозрение.

Но за шумными демонстрациями реальные возможности этих роботов явно далеки от представлений людей о «роботах будущего». По крайней мере, в более распространенных ожиданиях, роботы должны не просто выступать на сцене или служить маркетинговым целям, а действительно проникать на заводы и в дома, передвигаться, организовывать работу, управлять инструментами или выполнять некоторые домашние обязанности и задачи по уходу. Вопрос общественности остается конкретным и прямым: когда роботы действительно смогут работать?

В области больших языковых моделей ChatGPT дал весьма символичный ответ. Хотя это и не первая языковая модель, она первой заставила большое количество обычных пользователей интуитивно осознать, что ИИ преодолел определенный порог возможностей. Когда подобный момент наступит в области воплощенного интеллекта, постепенно становится одним из самых актуальных вопросов в робототехнической отрасли.

 

Ключ к тому, чтобы роботы появились в каждом доме, заключается в их способности к обобщению.

На Всемирной конференции робототехников, состоявшейся 20 августа, Ван Синсин, основатель компании Unitree Robotics, указал на проблему, которая неоднократно обсуждалась в отрасли как самое большое узкое место в развитии воплощенного интеллекта.

По его мнению, многие модели роботов могут достичь почти 100% успеха в фиксированных сценариях, при условии достаточного сбора данных и обучения. Однако процент успеха может значительно снизиться, если изменится объект, которым манипулируют, или произойдет незначительное изменение окружающей среды.

Это также самое важное препятствие на пути к тому, чтобы роботы действительно вошли в нашу жизнь и наши дома.

Ван Синсин предложил довольно конкретный критерий: если однажды робота можно будет привести в совершенно незнакомый дом или обстановку и он сможет выполнить примерно 80% задач, используя только голосовые или словесные команды, то воплощенный интеллект достигнет своего «момента ChatGPT». Что касается сроков, он считает, что это может занять от 2 до 3 лет в лучшем случае и от 5 до 10 лет в худшем.

Ван Синсин особо подчеркнул, что настоящая трудность заключается не в том, чтобы заставить робота «в целом знать, что делать», а в последних нескольких сантиметрах или даже миллиметрах.

Например, если вы поручите роботу поднять предмет, модель может правильно спланировать все действие, и роботизированная рука может переместиться в непосредственной близости от предмета. Однако, если окончательная ошибка позиционирования, тактильная обратная связь или сила захвата не будут должным образом скорректированы, вся задача может оказаться невыполненной.

Именно здесь роботы и большие языковые модели также сильно отличаются.

Ввод и вывод данных языковой модели всегда происходят в цифровом пространстве, в то время как каждое восприятие и действие робота должно взаимодействовать с реальным физическим миром. Датчики подвержены шуму, исполнительные механизмы — ошибкам, а положение, материал и вес объектов постоянно меняются; эти ошибки накапливаются по мере выполнения задач. Поэтому для воплощенного интеллекта переход от «умения делать что-то в принципе» к «последовательному правильному выполнению» может оказаться сложнее, чем первоначальное обучение задаче.

Практически одновременно с упомянутой выше оценкой Ван Синсина, Ван Хэ, основатель и технический директор Galaxy General, также назвал более конкретный год. Ван Хэ заявил, что благодаря непрерывному накоплению данных и дальнейшим технологическим прорывам, воплощенный интеллект, как ожидается, достигнет своего «момента ChatGPT» в 2028 году. Он определяет этот рубеж как: способность роботов выполнять примерно 70-80% ежедневных задач без специальной подготовки для какой-либо конкретной задачи.

Их оценки на самом деле очень близки. Ван Синсин фокусируется на проценте успешного выполнения задач роботом после попадания в незнакомую среду, в то время как Ван Хэ фокусируется на способности базовой модели к прямому обобщению без специального обучения. Однако оба они устанавливают критическую точку на уровне примерно 70-80% успешного выполнения неизвестных задач.

Это также означает, что «момент ChatGPT», о котором они говорят, — это не мобильность, демонстрируемая сегодня человекоподобными роботами, и не 99% успешность, достигаемая хорошо обученным, стационарным демонстрационным роботом. Реальные изменения должны произойти после того, как роботы начнут освобождаться от зависимости от фиксированных сцен, фиксированных объектов и специализированного обучения.

 

Когда роботы действительно "поймут" суть? Общепринятое мнение — через 2–5 лет.

Всего месяц назад на Всемирной конференции по искусственному интеллекту 2026 года (WAIC) в рамках круглого стола был задан тот же вопрос шести ведущим предпринимателям и исследователям в области воплощенного интеллекта.

19 июля во время "Форума по воплощению интеллекта", организованного компаниями Zhiyuan Robotics и Mifeng Technology, ведущий задал шести гостям очень прямой вопрос в ходе заключительной дискуссии за круглым столом: Сколько лет осталось до момента, когда роботы станут аналогом ChatGPT?

Результаты оказались на удивление однозначными. Яо Маоцин, партнер Zhiyuan Robotics и председатель и генеральный директор Mifeng Technology, ответил, что это займет 2 года; Тони Чжао, соучредитель и генеральный директор Sunday Robotics, считал, что это произойдет в течение 3 лет; Чжан Чжэнъю, главный научный сотрудник Tencent и директор Robotics X Lab, назвал срок от 3 до 5 лет; Ма Ечэн, соучредитель и главный научный сотрудник Dyna Robotics, полагал, что это займет около 4 лет; Рен Чжии, научный сотрудник Physical Intelligence, оценил срок в 4-5 лет; и Сюй Данфэй, профессор Технологического института Джорджии, дал ответ в 5 лет.

Все шесть участников представляли совершенно разные компании и исследовательские институты, и их технические подходы также различались, но в итоге все они сосредоточились на перспективах на ближайшие два-пять лет.

Среди них Яо Маоцин настроен наиболее оптимистично. Его суждения в основном основаны на росте масштабов данных. По мнению Яо Маоцина, ключевые факторы, ограничивающие дальнейшее развитие физического ИИ, можно свести к трем основным: «данные, представление и замкнутый цикл». По сравнению с огромными объемами текста и изображений, которые можно дешево получить в интернете, данные о взаимодействии роботов в реальном мире не только дороги, но и ограничены различиями в самом роботе, задаче и сценарии.

Чтобы робот действительно был готов к использованию, он должен понимать команды на естественном языке в свободной форме и достигать базового уровня успешности выполнения распространенных задач примерно в 70-80%. Для этого воплощенному интеллекту требуются данные в масштабах, значительно превышающих нынешние объемы. Он даже предположил, что в будущем могут потребоваться данные в объеме сотен миллионов часов.

Иными словами, в рамках оценочной модели Яо Маоцина «момент ChatGPT» в значительной степени представляет собой проблему масштабирования: по мере того, как данные из реального мира, данные моделирования, интернет-видео, данные с точки зрения первого лица и данные, поступающие после развертывания робота, постепенно достигают определенного масштаба, возможности модели также могут пересечь критическую точку.

Чжао Цзихао из Sunday Robotics, напротив, установил временные рамки менее трех лет. Вместо того чтобы просто стремиться к созданию все более сложных тел роботов, Чжао больше озабочен тем, когда «мозг» робота действительно созреет. Sunday Robotics долгое время фокусировалась на домашних роботах и базовых моделях. Их логика заключается в том, что если достаточно сильная базовая модель робота может понимать сложные условия окружающей среды и задачи, даже если робот использует относительно простые и недорогие захваты, он, возможно, сможет сначала решить большое количество практических задач.

Позиция Чжан Чжэнъю была гораздо более осторожной. Он ответил, что это займет от 3 до 5 лет, но подчеркнул, что этот временной промежуток не означает, что отрасли просто нужно ждать внезапного появления более крупной модели. Ключевым условием для быстрого масштабирования больших языковых моделей является постепенное создание более унифицированной архитектуры трансформеров. Однако в области робототехники и интеллекта еще не сформировалась столь четкая технологическая парадигма.

От высокоуровневого познания, визуального восприятия и планирования задач до управления движением в реальном времени, обратной связи от тела и мер безопасности — роботу необходимо одновременно решать задачи в разных временных масштабах. Поэтому для достижения настоящих прорывов могут потребоваться достижения в области сбора данных, моделирования, внедрения в реальных условиях, восстановления после сбоев и одновременной разработки аппаратного обеспечения и моделей, а не простое воспроизведение закона масштабирования больших языковых моделей. По этой причине, давая свою оценку, Чжан Чжэнъю особо подчеркнул, что отрасли по-прежнему необходимо «усердно и практично работать».

Ма Ечэн из Dyna Robotics оценивает временные рамки примерно в четыре года. Его оценка в значительной степени основана на коммерческом внедрении. Для лабораторной демонстрации 80% или 90% успеха может быть достаточно для доказательства эффективности технологии; однако для завода или сервисной компании, реально приобретающей роботов, такой надежности часто далеко недостаточно. Поэтому «момент ChatGPT» воплощенного интеллекта означает не только то, что робот может понимать больше задач, но и то, что его необходимо дополнительно улучшить до уровня надежности, приемлемого для реальных коммерческих условий.

Рен Чжии из компании Physical Intelligence назвал временные рамки в 4-5 лет. Он заявил, что до прихода в Physical Intelligence он думал, что этот процесс может занять 10 лет, но с развитием базовых моделей роботов за последний год его ожидания значительно сократились.

Компания Physical Intelligence — один из ведущих разработчиков подхода «базовой модели бота», цель которого — позволить одной и той же модели постепенно приобретать более широкие операционные возможности за счет обучения на основе данных из разных онтологий и задач. По-настоящему важным аспектом этого подхода является вопрос о том, смогут ли возможности робота непрерывно развиваться по мере расширения масштаба модели и данных, в конечном итоге создавая эффект, аналогичный переносу знаний без предварительного обучения в больших языковых моделях.

Профессор Сюй Данфэй из Технологического института Джорджии предложил наиболее консервативный ответ, но даже он был далек от истины, всего лишь на 5 лет. Вместо того чтобы делать ставку на конкретный подход к модели, он сосредоточился на трех более фундаментальных показателях: может ли модель действительно учиться на данных, могут ли полученные навыки обобщаться на новые среды и задачи, и может ли скорость вывода соответствовать требованиям работы робота в реальном мире в режиме реального времени.

Если сопоставить утверждения Ван Синсина о том, что «в 2-3 года всё произойдёт быстрее», Ван Хэ о том, что это случится в 2028 году, и ответы шести гостей конференции WAIC, то становится очевидным следующее явление: индустрия воплощенного интеллекта сжимает ранее отдалённый временной горизонт «универсальных роботов» в будущий технологический цикл.

 

Это явный исторический этап или постепенный процесс?

Однако, хотя эти предприниматели и исследователи приближаются к истине в своих прогнозах относительно сроков, они фактически не используют один и тот же набор стандартов для обсуждения «момента ChatGPT».

Ван Хэ фокусируется на скачке в возможностях самой базовой модели. В его определении воплощенный интеллект пересекает критическую точку, подобную ChatGPT, когда роботу больше не требуется переобучение для каждой новой задачи и он может выполнять от 70% до 80% повседневных задач, используя только базовую модель. Этот стандарт в первую очередь измеряет, может ли модель перейти от «специализированного интеллекта» для конкретных задач к общему интеллекту с высокой степенью переносимости.

Стандарт Ван Синсина ближе к производительности роботов в реальном мире. Он также считает важным порогом показатель выполнения задач около 80%, но подчеркивает, может ли робот выполнять большинство задач, полагаясь исключительно на языковые команды, при попадании в незнакомую среду. По его мнению, многие современные роботы могут достигать высокого уровня успешности в хорошо обученных, фиксированных средах. Настоящая проблема заключается в том, сможет ли модель продолжать функционировать после изменений в окружающей среде, объектах или задачах.

Эти два определения кажутся похожими, но на самом деле они фокусируются на разных уровнях. Даже если модель обладает хорошими возможностями для выполнения задач без предварительного обучения или кросс-задач, это не означает, что робот, оснащенный ею, стал надежным производственным инструментом. Ван Синсин упомянул на Всемирном чемпионате по робототехнике, что компания Unitree уже внедрила роботов на автомобильных заводах и на собственных предприятиях, и они могут выполнять некоторые простые сборочные задачи, но крупномасштабное внедрение пока невозможно. Одна из важных причин заключается в том, что эффективность роботов все еще ниже, чем у людей, и их часто необходимо переобучать для решения новых задач.

Генеральный директор Xinghaitu Гао Цзиянг предложил интересную двойную оценку этой проблемы. В дорожной карте развития отрасли, представленной на WRC в этом году, Xinghaitu прямо обозначила 2027 год как «момент GPT» с точки зрения технологий, полагая, что после того, как закон масштабирования приведет к тому, что возможности базовой модели преодолеют переломный момент, сценарии вертикального применения начнут ускоряться; однако реальный «переломный момент коммерциализации» приходится на 2028 год, за которым последует глубокое проникновение в 2029 году и широкое внедрение в 2030 году.

Однако, обсуждая вопрос о том, повторит ли воплощенный интеллект исторический момент, подобный ChatGPT, Гао Цзиянг прямо заявил, что, по его мнению, «существует высокая вероятность того, что такой момент не произойдет». Причина в том, что воплощенный интеллект не получит мгновенного распространения в виде программного продукта, доступного каждому, а, скорее всего, начнет развиваться в B2B-сфере, постепенно раскрываясь отрасль за отраслью и в зависимости от задачи.

Технологические прорывы и мгновенное повышение осведомленности общественности вряд ли произойдут одновременно. Это связано с тем, что взрывной рост GPT (Global Processing Technology) зависит от возможности каждого человека непосредственно ознакомиться с ним с помощью мобильного телефона или компьютера, в то время как первоначальное применение воплощенного интеллекта приходится на производственные условия, такие как заводы и склады, что затрудняет его непосредственное восприятие широкой публикой. Поэтому поворотные моменты в отрасли будут возникать постепенно, незаметно и повсеместно, становясь всеобъемлющими к тому моменту, когда люди внезапно осознают их.

Эти два утверждения не совсем противоречат друг другу. Гао Цзиянг фактически различает технологический переломный момент в развитии возможностей модели и социальный переломный момент в промышленном распространении: первый может проявиться относительно четко в определенный год, в то время как второй требует проверки сценария, крупномасштабного производства, снижения затрат и зрелости бизнес-модели для постепенного распространения в реальном мире.

Это также одно из наиболее существенных отличий между роботами и большими языковыми моделями. После выпуска ChatGPT в ноябре 2022 года изменения в возможностях модели можно было донести до пользователей по всему миру практически в один и тот же день. Для программного продукта, пока сервер и вычислительная мощность позволяют это сделать, стоимость добавления нового пользователя относительно невелика. Пользователи могут сразу же ощутить скачок в возможностях модели, просто открыв веб-страницу и задав вопрос. Таким образом, технологические прорывы, запуск продуктов и широкое внедрение среди пользователей в ChatGPT практически совпали по времени.

Однако роботы должны взаимодействовать с физическим миром через реальное тело. Даже если завтра базовая модель внезапно обретет значительно более сильные возможности обобщения, эти возможности все равно необходимо будет преобразовать в реальные движения с помощью микросхем, датчиков, суставов, ловких рук и приводов, а также преодолеть ряд инженерных проблем, таких как точность, стабильность, безопасность, срок службы, техническое обслуживание и стоимость.

Поэтому воплощенному интеллекту в конечном итоге может быть сложно воспроизвести четкую историческую веху, подобную 30 ноября 2022 года. Скорее всего, он проявится в виде серии постепенно возникающих переломных моментов. Возможно, даже если люди в будущем будут оглядываться назад, чтобы подтвердить «момент воплощенного интеллекта ChatGPT», они не смогут найти единую точку, с которой все согласятся.

Данный контент предназначен исключительно для информационных и образовательных целей и не является инвестиционным советом, связанным с BTCC. BTCC прилагает все усилия, но не может гарантировать правдивость, точность или оригинальность вышеприведенного контента.