中国製の計算力が初めてテラパラメータ級のモデルを安定して支えることができました。ハイクワンインフォメーションは、Kimi K3をそのDCUプラットフォーム上でフルスタックに適合させ、性能検証を完了したと発表しました。これは、このような巨大なモデルを動かすのは海外のエリートチップに限られていた時代が終わったことを意味しています。

ハイクワンのDCUは、下位の演算子から推論エンジンまで一貫して最適化されており、モデルコードを一切変更することなく直接実行できるため、移行コストはほぼゼロに近づいています。開発者は計算力を得た瞬間に即座に本番環境に展開でき、互換性も非常にスムーズです。KDAアテンションと896個のエキスパートで構成されるMoEアーキテクチャに対して、ハイクワンは演算子レベルでのカスタム調整を行いました。896個のエキスパートが同時に並列処理されても、数百万の文脈を持つ重負荷シーンにおいても推論は効率的かつ安定しており、フリーズすることはありません。

image.png

実際のシナリオでは、K3はハイクワンのDCU上で長距離のスマートエージェントプロジェクトやビジュアルループクリエーション、さらには独自チップ設計といった最先端の運用を可能にします。中国製の計算力ユーザーはついに、テラパラメータ級のオープンソースモデルを自ら走らせることができるようになりました。補足しておくと、月之暗面はK3のリリース前にすでにハイクワンと中科曙光と連携して完全な互換性のチューニングを完了していました。スカイフォーはハイクワンのDCUハードウェアスタックを基盤として、Kimi MoEアーキテクチャの分散トレーニングとマルチGPU並列推論のストリームをつなぎました。一方、ハイクワンのDCUは、ハードウェアとソフトウェアスタックの協調最適化により、スカイフォー8000クラスター上で長文の推論を安定して動作させることができました。