剛剛落幕的美加墨世界盃,騰訊雲撐起了全球 17 個國家和地區的官方賽事直播,覆蓋亞太及國內三分之二的官方授權平臺。騰訊雲副總裁、國際產品技術負責人李鬱韜在近期採訪中透露,這屆世界盃 AI 第一次大規模進入直播生產,畫質增強、智能導播、自動剪輯、智能橫轉豎、質檢溯源在內的大部分環節,已經由 AI 全自動完成。一場世界盃的賽事支持,不過是 AIGC 開始邁入大規模生產應用的一個切面。
李鬱韜把騰訊雲要做的那層,稱作多模態領域的 Harness(駕馭工程)——關注的不是模型怎麼生成,而是從生成到穩定交付給用戶之間,包括預處理、質檢、拼接、轉碼、分發、格式適配在內的整條產業鏈路。
他觀察到,在生成式 AI 的浪潮下,多媒體應用正面對多重挑戰,尤其是直播、點播、媒體創作、多媒體互動這些場景,受限於網絡傳輸、視頻畫質、用戶體驗以及各類特性的疊加,單一模型往往只能解決一部分問題。很多廠商看到新的多模態大模型,第一反應就是把它們全部對接一遍,今天接這家、明天出了新的再接那家;對接完一定會撞上這樣那樣的問題。如果每一家遇到的都差不多,從客戶反饋裏就能提煉出一個共性訴求:應該有人幫他們把底層全部做好,讓他們更專注於業務創新和上層應用。如何識別用戶需求、找到能解決需求的模型、修補模型天然的一些缺陷,再把最終的服務遞給用戶,這恰恰是作爲音視頻 PaaS 雲服務廠商必須啃下的挑戰。
早在 6 月 5 日的騰訊雲 AI 產業應用大會上,騰訊雲音視頻就發佈了 AI 品牌 Tencent Cloud WAND,構建起 6 大自研媒體專用模型與 60 餘項 AI 能力,覆蓋內容生成、理解、處理、編碼全鏈路,專門爲電商、短漫劇、教育、賽事直播等垂直場景訓練。李鬱韜說,團隊會把所有模型串起來,不只大語言模型,也包括多模態模型,甚至那些小參數量的畫質提升模型、小參數量的應用模型——他們去年就已經動手做多模態領域的 Harness,恰好今年生成式視頻模型開始變多,行業內外對 Harness 的概念和理解也愈發趨同。
值得留意的是,視頻生成被業內看作繼 AI Coding 之後,第二個跑通商業閉環的 AI 變現場景。今年以來音視頻大模型賽道競爭驟然加速,格局劇烈洗牌。國內廠商商業化進程兇猛,字節旗下 Seedance、快手可靈 AI 形成了 AI 視頻生成賽道的"雙寡頭"。公開數據顯示,今年 3 月可靈 AI 的 ARR 已逼近 5 億美元,一年內增長 4 倍;另有媒體報道稱,截至上半年 Seedance 2.0 的 ARR 已達 20 億美元,字節方面雖闢謠稱這一收入數據"偏高、與實際不符",但也明確提及 Seedance 2.0 已跨過"生產力質變點"門檻。而海外,今年 3 月 OpenAI 宣佈停止 Sora 的獨立 App、API 接口及 ChatGPT 內置視頻功能,退出了消費級 AI 視頻生成市場。
做 To B 的產品和解決方案,生態合作被李鬱韜擺在戰略首位。他也坦言,團隊內部一直在討論一個問題:當從生成到交互之間的鏈路被不斷壓縮,Harness 這個生態位會不會被忽略甚至繞過?他的判斷是,至少過去半年的觀察下來不會,甚至 Harness 的重要性還會加強。如果把大模型當成後端的生產力,生產力的提升會顯著刺激前端應用需求的增長,而且需求增長的廣度會一直強於生產力的提升——大模型永遠滿足不了最終用戶的極致需求,中間始終存在一個"供給關係差",這正是 Harness 存在的必要性。
在他看來,騰訊雲卡位多模態 Harness,最大的機會在於:很多音視頻場景的體驗都值得重新做一遍。第二個機會點則是,未來會有更多、更強、更全面的模型出來,怎麼快速把這些模型應用到企業級的生產服務裏,讓最終用戶感受到最新的大模型體驗,正是多模態 Harness 要解決的問題,而不斷把最新模型應用到客戶最前端,整套生產流程和工具鏈條就顯得格外重要。
自去年開始,整個 AI 算力已經開始從訓練向推理傾斜,很多廠商構建推理算力的開銷已經超過訓練投入,這也意味着大量 AIGC 應用開始進入大規模生產應用。國內,短劇、漫劇製作是典型場景,目前已大量使用多模態技術做生產。在亞太地區,音視頻解決方案是騰訊雲出海的"排頭兵",在收入、市場份額、行業心智方面都居行業第一;最近五年,騰訊雲把國際化作爲重要戰略方向,投入大量業務資源和基礎設施在海外佈局,公司披露近三年海外業務保持兩位數增長。
騰訊雲音視頻總經理李志成則提到,無論是短劇、漫劇還是電商、工具類場景出海,最大的共性在於:前期客戶可能關注效果、關注影響力,但中後期都很關注 ROI,也就是到底能不能盈利、能產生多少價值。現在被問得最多的,就是短劇、電商工具的使用,未來 1 到 2 年估計會慢慢普及,很多用戶、企業都會用起來,就跟以前的大語言模型一樣——兩三年前更多是垂直行業在用,現在基本全普及了,成了大家工作中的一部分。
隨着 Agent 時代到來,騰訊雲前述能力還將與音視頻智能體、AI 硬件、具身機器人、雲手機結合,依託全球基建與邊緣推理,支撐 AI 應用快速跑向全球、就近上線。李鬱韜介紹,團隊目前已與逐際等多傢俱身智能企業、無人清掃車企業開展合作,孵化出 TRRO 遠程實時操控(遠程數智人解決方案),用來解決弱網情況下機器人在人工介入時的低延時穩定通信、音視頻數據回傳等核心問題。
面向未來,李鬱韜把雲廠商在多模態領域的競爭歸納爲三個方向。第一是多模態的訓練和算力,不同於語言模型訓練,多模態領域很大比例還投在理解和生成上,未來會有大量端到端的語音交互、端到端的視頻生成,對算力的要求、對雲廠商本身基建的投入都很大。第二是存儲和數據積累,多媒體相對文字存儲量要求更高,對存儲穩定性、數據清洗和獲取的要求也不一樣,大量視頻需要在預訓練之前做數據清洗和處理,不同模態的數據要放在一起,訓練前要做的處理都與文字類迥異。第三是應用生產端,雲服務商提供更面向最終客戶的推理服務、綜合處理的應用能力,是影響客戶選擇的重要因素——創新趨勢中產生的需求,怎麼在運營端用很好的方式幫客戶滿足,這一點對騰訊雲同樣關鍵。
