人形機器人什麼時候才能真正走出展廳、變成解決現實問題的工具,這是2026世界人工智能大會現場最被反覆追問的問題。7月19日,逐際動力創始人、南方科技大學長聘教授張巍站上演講臺,給出了一組相當反共識的判斷:當前以人形機器人爲代表的具身智能,正處在一條指數增長曲線上,而整個機器人大腦系統,已經走到了GPT-3左右的階段。

逐際動力成立於2022年,張巍給公司的定位很乾脆:一家產品型、有大腦能力的主機廠。過去幾年,這家公司的融資節奏清晰勾勒出資本對其路線的認可。2023年10月,它完成近2億元天使輪與Pre-A輪融資,投資方包括峯瑞資本、綠洲資本、聯想創投、明勢創投等;2024年7月,阿里巴巴戰略領投其A輪融資,這也是阿里首次下注具身智能領域; 

image.png

2025年,逐際動力半年內累計完成5億元A輪系列融資,拿到阿里、蔚來資本等頭部機構支持,後續又獲京東戰略領投,雙方計劃圍繞零售、物流與服務場景展開協同;2026年1月,公司完成2億美元B輪融資,引入阿聯酋磊石資本、東方富海、基石資本等,老股東繼續跟投;就在今年7月,逐際動力又完成近2億美元Pre-IPO融資,投資方包括磊石資本、意大利財團、上市公司藍思科技、IDG資本、合肥濱湖產發集團等。張巍表示,公司已經形成覆蓋戰略產業方與國內外財務投資機構的綜合股東背景,產業化、國際化與市場化能力進一步增強。

在張巍看來,很多人看到機器人現在還笨笨的、幹不了什麼,就習慣用線性方式去預判它的未來,但行業正在經歷的是指數變革,不能等看到結果再響應,那樣就晚了。他用一個例子說明線性推演的失靈:比爾·蓋茨曾花幾十年、投入巨資想解決語言交互問題卻始終未竟,若在大模型出現前問他何時能解決,他可能會說還要十年二十年,而技術範式一變,半年時間一大堆問題就被解決了。

一個可能讓很多人意外的看法是,張巍認爲機器人比較好造,人形機器人也比較好造,它比光刻機、飛機都好造,甚至比汽車還好造,零部件數量大約只有汽車的十分之一。那麼爲什麼飛機天天在天上飛、汽車滿街跑,人形機器人卻大多還停在展廳裏?他給出的答案是:缺的不是會製造本體的人,而是今天大會主題指向的核心能力——AI,尤其是來自物理世界數據的物理AI。物理AI的特點是數據不來自互聯網,而來自真實物理生活,這讓它成爲AI最具挑戰的一類應用,其終極形態人形物理AI,本質就是在模仿人的大腦。張巍補充,人的大腦從概念上看沒那麼難,它的任務只是接收指令、理解意圖、觀察環境、計算自己該怎麼動,本質上是一個映射;真正卡住行業的問題是缺數據。他認爲技術範式已經相對收斂到純數據驅動,剩下更多是工程和細節問題,而所有探索的本質,都是在降低完成一個任務所需的數據成本。

圍繞大腦系統,張巍劃出了三層結構,與Figure的架構有相似處但細節差異很大。最上層類似人的前額葉,是一個以大語言模型、視覺語言模型乃至未來世界模型爲引擎的思考引擎,屬於agentic system,負責記憶管理、收集指令、信息理解、任務規劃與決策,只負責想,他稱之爲System2;中間層是視覺運動皮層,接收上層決策、觀察環境並做運動規劃;最下層是小腦和運動控制系統,只負責把動作真正完成,只動不想。張巍強調,行業真正的挑戰不是把某一層單獨摳到極致,而是把這三層在毫秒級實時系統裏協同起來,並與硬件聯合優化,逐際動力把這一方向叫做大小腦融合技術,也是公司最重要的投入方向之一。

如果一定要用GPT時刻來類比,張巍判斷整個機器人大腦系統已經到了GPT-3左右的初級階段,這與很多人認爲還非常早的判斷截然不同。但他提醒,機器人大腦不是一個單一模型,而是由大語言模型、視覺語言模型、世界模型、記憶管理、任務規劃、運動控制共同構成的agentic system,逐際動力這套系統叫COSA。模型代表能力,大腦則是多模型加上記憶管理、情感管理、任務規劃等構成的一整套系統。他打了個比方:如果System2由LLM驅動,就像一個躺在病牀上不能動但能思考的殘疾人;由VLM驅動,就是一個有眼睛、能看見世界的殘疾人;若再加上世界模型,則相當於學了物理的霍金,能理解和預測物理世界。具身智能要做的,就是讓這個聰明的System2指引行動,像讓殘疾人做康復訓練一樣,通過數據和練習長出下面的技能。張巍也提醒,GPT-3到GPT-3.5之間經歷了兩年多時間,而機器人大腦是系統、不由單一模型決定,這是他和許多人的不同思考。

在技能學習上,張巍同樣拋出了反共識觀點:技能不需要非常通用,才叫有腦。一個人不會擰螺絲、不會開車,依然是個正常有腦的人,技能的泛化性並不代表智能水平,技能構建取決於想先學什麼、後學什麼,以及對應的數據成本。不同技能難度差異很大,像跳舞這種不需要實時和環境交互的技能相對簡單,而上樓梯這類需要實時交互的就難得多,逐際動力的機器人Ollie上樓梯,就是一個實時大小腦融合技術的例子,因爲樓梯可以在很大程度上於仿真環境裏完成;收拾桌子則必須依賴真機數據。張巍介紹,公司從去年研究、今年發佈的COSA系統能夠接收人的指令,通過System2做任務規劃,再調度導航定位、執行具體任務,比如讓機器人送快遞,它會先做任務規劃、先把水拿給客戶再去送件,動作實時生成;最近COSA完成了一項重要升級——全自主、實時推理的長程任務,沒有遙操作、沒有遙控器,在家庭環境裏靠一個模型、一個技能直接推理完成全身移動與操作,且整個模型純數據驅動、不需要專家規則。他表示,除了Figure以外,能完成這種長程移動操作通用任務的公司非常少,而把全身移動和操作聯合起來的系統尤爲稀缺。

談到商業化,張巍把人形機器人的底層邏輯概括爲通用本體加APP。單一技能比如跳舞可能價值有限,但不改變機器人構型、持續疊加不同技能與應用,最終會出現一個吸星大法拐點,足夠多的應用都會開始向通用本體聚集。他認爲在產業鏈裏,主機廠最關鍵,因爲它承上啓下,逐際動力定位爲產品型、有大腦能力的主機廠,技術上全面對標Figure,產業化上更激進,口號是serve people, not process,即兩條腿的人形機器人應服務於人而非生產流程,所以並不優先在工業場景嘗試,而是更適合在人類環境裏做接待、公共服務。他總結商業化的關鍵是:構建一個技能的數據成本,要小於這個技能所創造的價值,只有這樣技能才值得做。

張巍特別提醒,具身智能不應復刻大模型行業先做通用模型、再尋找落地場景的方式。由於物理世界數據天然稀缺且昂貴,不同技能之間數據差異也很大,比如開車和包雞蛋放在一起訓練,相互可借鑑的地方不多,沒必要等機器人會開車了再去學別的。更合理的路徑是具備一定通用能力後儘早進入具體場景,通過專業數據反哺模型,形成場景與模型的數據飛輪。他也判斷行業未來不會一枝獨秀,而是百花齊放,因此需要推動開源生態與產業生態兩大建設,逐際動力已提供開源訓練架構,開發者可以用自然語言訓練一個VLA模型,也能使用其機器人和開源設備。張巍最後判斷,2026年會是具身智能PoC驗證的元年,到明年希望看到一些規模化發展,人形機器人正在進入從會動到能用的關鍵節點。