智譜今天端出了新模型 GLM-5.3-FlashX,官方標出的最高速度衝到了每秒200個 token,給企業開發者的體驗按下了加速鍵。

這款提速型號的底子,是那款此前以"Ox Alpha"之名先和全球開發者見面的 GLM-5.3-Flash——它靠着同尺寸裏最能打的智能水平,在海外內圈了一波口碑,調用量一路往上爬。需求漲得太快,智譜索性在10萬張國產芯片撐起的推理算力之上,繼續往 Infra 基建和推理優化裏砸資源。於是 FlashX 不只是快,而是把智能、價格、速度這三張牌第一次同時攥在了手裏。

目前 GLM-5.3-FlashX 的 API 已經上線,開發者調用時認準 Model Key:GLM-5.3-FlashX 即可。對苦於大模型"想得慢、等得久"的生產場景來說,每秒200token 這條線,意味着它能在不犧牲聰明程度的前提下,把響應延遲壓到一個相當輕快的檔位。
VIP會員