最近、騰訊の混元チームは最新の技術成果を発表し、自社のエッジ側向けモデルである1.8B翻訳モデルを数百メガバイトにまで圧縮することに成功しました。翻訳品質はほぼ損なわれず、すでに哔哩哔哩(B站)のライブストリーミングのチャットコメントリアルタイム翻訳に導入され、研究室でのデモから高并发の実際的な業務シナリオへの飛躍を果たしました。
Hy-MT2-1.8Bモデルはもともと騰訊の混元翻訳モデルシリーズに属しており、33の言語間の相互翻訳をサポートしています。同サイズでは、FLORES-200一般的な翻訳評価で他の多くの商用翻訳APIよりも優れた全体的な翻訳品質を持っています。しかし、1.8Bモデルは従来のFP16精度で3.3GBものメモリを必要とし、4ビットの量子化にも1GB以上かかるため、エッジ側の複数タスク並行処理のメモリ管理要件を満たせませんでした。このため、騰訊は2つの極めて低いビットの量子化方案を提供しました。

第1段階は中高端デバイス向けの2ビットモデルです。この方針では、伸縮性のある量子化(SEQ)技術を使用し、パラメータを特定の離散値に量子化し、量子化感知蒸留(QAD)手段を組み合わせて、モデル容量を574MBに圧縮しつつ、ほぼ損なわれない翻訳品質を実現しました。
第2段階は全機種対応の1.25ビットの極めて低いビット数方案です。この方案は、騰訊が独自開発したSherry稀疏効率的三値量子化技術に基づいており、この技術は先ごろ頂級学術会議ACL2026にoralとして採択されました。そのコア戦略は、細粒度の疎性メカニズムを通じて、4つのパラメータのうち最も重要な3つを特定の値で保存し、残りはゼロに設定し、平均して各パラメータが1.25ビットを占めるようにすることです。CPU専用のSTQコアと併せて、元の3.3GBモデルを極限まで440MBに圧縮しました。
極めて低いビット数モデルが特定のモバイルARM構造に依存することを避けるために、インテルチームはx86エコシステムに対して深いベース調整を行いました。量子化行列演算におけるベクトル化、重みの再配置およびVNNI命令の統合のプロセスを最適化することで、Hy-MT2の低ビット量子化形式はインテルの主流マシン(最新の第3世代Core UltraおよびCoreプロセッサを含む)上でトークンの実行速度が顕著に向上し、極めて低いビット数方案をモバイル端末からPCおよびエッジデバイスへと拡張することができました。
実際の業務検証において、哔哩哔哩はこの極めて低いビット数モデルを正式にライブストリーミングチャットコメントリアルタイム翻訳に導入しました。すべてのリソースのダウンロードサイズは約600MBで、実行中のメモリ使用量は500〜700MBの間で保たれ、1つのチャットコメントの翻訳時間は500〜800ミリ秒程度で、通常のチャットコメントの頻度において滑らかなリアルタイム翻訳が可能であり、ネットワークで流行する表現を正確に扱うことができます。このようなデバイス内で独立して動作する方式は、クラウドサーバーの呼び出しコストと帯域幅の支出を下げるとともに、全プロセスにおいてデータのアップロードを回避し、ユーザーのプライバシー保護を実際に確保しています。
VIP会員