7月24日、アリババの百靈(Bailian)は新世代のネイティブ混合推論モデル「Ling-3.0-Flash」を正式に発表しました。このモデルのパラメータ総数は124Bで、一度の計算におけるアクティベーションは5.1Bです。パッケージサイズを大幅に縮小し、計算コストを低減しながらも、Ling-3.0-Flashは基礎的な推論、指示の遵守および長文処理などの主要な指標において、その2〜3倍のパラメータを持つ業界リーダークラスのモデルと同等またはそれを上回る性能を示しており、より高い「知能効率」と実装のコストパフォーマンスを実現しています。現在、このモデルはOpenRouterにアップロードされており、一週間無料で利用可能で、その後は正式にオープンソースになります。

このバージョンの重要な点として、Ling-3.0-Flashはエージェントの実際の運用シナリオに基づいて深く最適化されています。モデルは10,000以上のリアルな相互作用トレーニング環境を拡張し、複雑なタスクでの自己修正および長期計画機能を最適化しました。コード作成、複雑なタスクの分解、複数の情報源の深い調査などさまざまなシナリオにおいて、Ling-3.0-Flashはより強力な自律的な完了能力を示しており、従来のモデルが大規模なタスクで「方向を誤る」ことや中断することがある問題を解決しています。
据説、この「小規模で高知能」の実現の鍵は、モデルの下部計算構造の再設計にあります。Ling-3.0-Flashは単純にパラメータを積み重ねるという考え方を放棄し、事前トレーニング段階から混合アテンション構造を採用しています。KDA線形アテンション層とMLA層を5:1の比率で交互に積み重ねることにより、モデルは長文の効率とモデルの能力の間に更なる最適なバランスを実現しています。
さらに、Ling-3.0-Flashは前世代のLightning AttentionをKDA(Kimi Delta Attention)にアップグレードしました。Delta Ruleの状態更新において細粒度の対角ゲートを導入し、モデルが長文やコードベースを処理する際にキーポイント情報をより正確に記憶できるようにしました。また、Ling-3.0-Flashは単一トークンあたりのエキスパートアクティベーションの割合をさらに圧縮し、前のバージョンでは1/32だったものが1/64までに減少し、これにより高い「効率の杠杆効果」が得られます。

AIエージェントをより高速かつ安定して動作させるために、百靈はそれに応じたエンジニアリングおよび協働アーキテクチャを提供しています。レスポンス速度においては、クラスタレベルの階層キャッシュを導入することで、長期間の会話やマルチラウンドのインタラクションにおける繰り返し計算を回避し、長入力時の最初の文字のレスポンス遅延を60〜80%以上削減しています。タスクの安定性においては、アップグレードされた多エージェント協働アーキテクチャにより、異なるエージェントが分担して協力し、お互いに検証できるようになり、単一モデルの誤判定リスクを効果的に減少させています。これにより、高頻度のオンラインサービスや本物のビジネスの実装が支えられることになります。
