視覺大模型長期被一個隱形門檻卡着:想拿到頂尖效果,就得先囤夠天量數據和算力,這讓先進視覺能力成了少數頭部團隊的專屬玩具。7月21日,小鵬集團發佈TuringViT高效視覺編碼器,宣稱從架構、數據範式到訓練流程系統性重構了視覺編碼器,爲行業提供了一條可復現、低成本的SOTA級視覺Transformer訓練路徑,把先進視覺大模型從頭部專屬推向行業普惠。
TuringViT的定位很清晰:面向VLM與VLA時代,全面支撐智能駕駛、智能座艙和IRON人形機器人三大業務場景。它從架構、數據、訓練三個維度同步突破,搭起一套線性注意力主導、高質量數據治理、原生動態分辨率三位一體的技術體系,在效果、效率與落地性上做三重提升。

在架構上,TuringViT推出兩個規格版本。TuringViT-18L包含3組Turing Block,合計15層TLA加3層MHA,主打動態分辨率下的高效部署;TuringViT-24L包含4組Turing Block,合計20層TLA加4層MHA,在保持線性計算主導的前提下進一步拉昇表徵能力。實測數據顯示,隨着輸入分辨率升高,TuringViT的延遲增長曲線遠比標準softmax ViT平緩,高分辨率下的效率優勢愈發突出。在1536乘1536分辨率下,TuringViT-18L的推理吞吐量達到Seed1.5-ViT的3.04倍,相比SigLIP2-ViT-L提升2.16倍,這爲高分辨率感知、多攝像頭輸入和長時序視頻處理的端側部署掃清了核心障礙。
與行業堆數據規模的粗放路線不同,TuringViT真正鋒利的地方是數據治理。它打造了VISTA-Curation多模態數據治理流水線,不再追求用更多數據,而是通過提升單樣本的監督價值實現數據效率的量級躍升。針對圖文數據,流水線分三步精細篩選:先過濾掉低分辨率、模糊、低紋理的劣質圖片;再用多模型、多提示詞生成多樣化候選字幕並交叉驗證視覺一致性;最後在統一對比池裏,按相對圖文對齊度、文本信息量與歧義度綜合打分,篩出視覺貼合度高、語義密度高的優質標註,淘汰模糊、泛化和弱對齊樣本。針對視頻數據,流水線先把長視頻切分成連續短片段並均勻採樣代表幀,再用語義一致性與運動一致性雙重過濾保留有效片段,最後融合局部幀級細節字幕與全局時序語義字幕,生成具備變換感知能力的視頻標註,讓模型從連續畫面裏學到更魯棒的視覺表徵。

數據效率的提升直接反映在了成績上。TuringViT僅用了0.85B圖文對,大約是SigLIP2-L訓練數據規模的十分之一,卻在ImageNet-1K等六項零樣本分類基準上取得83.6%的平均準確率,超越那些用10B數據訓練的主流開源基線;在COCO與Flickr30K圖文檢索任務上同樣優勢明顯,真正實現了用十分之一數據換來更優效果的突破。

訓練流程上,TuringViT採用四階段漸進式原生動態分辨率訓練範式,從預訓練第一天起就適配下游VLM與VLA的輸入特性,徹底告別了固定分辨率預訓練再加事後適配的傳統模式。
這套編碼器在小鵬的技術體系裏已經有了明確落點。在智能駕駛領域,它是第二代VLA模型的核心視覺編碼器,負責處理多路環視攝像頭的高分辨率、多幀動態道路場景輸入,爲預測式世界模型提供視覺token;面向智能座艙與駕泊一體化,TuringViT的VLM原生特性讓視覺特徵與語言模型實現更高效對齊,可支撐不同畫幅和比例的視覺輸入,爲更豐富的座艙交互功能打底;在小鵬IRON人形機器人體系裏,它則扮演着視覺視網膜的核心角色,提供物體細粒度識別、空間關係理解、可操作區域檢測和動態環境追蹤等基礎感知能力。項目主頁已上線 https://turingvit.github.io/。
