國產大模型參數量正在從萬億級別繼續上探。Qwen3.8Max、Kimi K3已經把規模頂到2.4萬億和2.8萬億,再往下一站就是5萬億。這一次,率先行動的可能是字節。晚點 LatePost 報道稱,字節正在討論訓練一個超過5萬億參數量的大模型,將成爲國內已知規模最大的模型。不過計劃還在早期階段,最終不一定會發布。

image.png

5萬億參數是什麼量級?它被視爲 GPT-5.6或 Opus5級別。參數量越大,大模型性能通常越強,OpenAI 與 Anthropic 正是靠着更高參數量維持領先——消息稱這兩家內部已在訓練甚至完成10萬億參數大模型的準備。但超高參數也意味着超高算力投入。以 H100爲基準算賬,訓練5萬億參數大模型需要10萬顆 H100跑347天,或者100萬張顯卡跑35天。百萬卡已經跨進 GW 級算力規模,門檻極高。字節不可能一次梭哈投入這麼多算力,更合理的姿勢是用20到30萬張顯卡訓練3到4個月,再疊加準備和後訓練等環節,至少要半年,甚至一年之後纔可能成型。

算力儲備上,目前最充裕的仍是 OpenAI,SemiAnalysis 測算其握有約200萬張顯卡;Anthropic 約62萬張;DeepSeek 只有約6萬張,且不少還是相對落後的 H20、H800。以字節的財力,餵飽一個5萬億參數大模型不在話下。有了它,豆包的能力做到 GPT-5.6或 Opus5級別沒什麼懸念,智商能真正拉滿,不用再被網友調侃。現在唯一的懸念只剩商業回報——這筆天文數字的投入,能不能在落地端換來對等的收益。