アリババ・クアンは今日、リアルタイム通訳モデル「Qwen3.8-LiveTranslate」をリリースしました。このモデルは、一連のInterleave構造によってリアルタイム通訳を完全に再構築し、正確性、スムーズさ、簡潔さが向上しました。単語あたり遅延(LAAL)は2.8秒から2.3秒に低下した——通訳では「1秒遅れると話者のペースについていけない」という状況において、0.5秒の短縮は聞こえの自然さに直接的な影響を与えます。
すでに60言語をサポートしている上で、新モデルは通訳を本格的に実用化するための3つの重要なパズルを追加しました。第一はリアルタイムの話者分離で、各セリフが正しい人に割り当てられ、声の特徴を再現する精度も安定し、これまでのような「AとBが混ざる」「声が重なる」問題は解消されました。第二は元の文章と翻訳文を同時に表示すること、つまり両方の言語を画面に並べて表示し、聴く人が同時に聞きながら確認できるようにすることです。第三は長文の曖昧さの解消で、モデルは前文との関連を考慮して現在の内容を理解し、人名や専門用語など間違いやすい場所の精度が大幅に向上しています。

ベースとなる設計は、Hybrid MoEに基づいたThinker–Talkerという二つのモジュール構造です。Interleaveにより、ストリームでの理解、テキスト出力、音声生成を1本の線に結びつけます。Thinkerはビデオ、音声、原文、翻訳文を1つの因果シーケンスに編成し、時系列に交互に並べ、エンドツーエンドで出力することで、「理解」および「翻訳」を同じシーケンス内で行います。Talkerは翻訳文とソース音声を受け取り、翻訳文を元の話者の声色を保持した音声として合成します——つまり、翻訳された音声はもとの話者の声そのものです。

Omnilingua-MSpeakerという、14の言語方向をカバーする多話者長音声評価データセットで、このモデルは翻訳の忠実度、流暢さ、簡潔さ、および話者分離誤り率(DER)の4つの指標で、業界の主流となるリアルタイム通訳システムを上回りました。公開されているFLEURSテストデータセットにおいて70言語方向を走らせてみた結果、翻訳品質、単語あたり遅延、音声認識の正確性、音声合成品質の4つの項目で、前世代モデルおよび主流システムを上回っています。現在、体験版へのアクセスとモデルAPIがすべてオープンされています。通訳という長期間にわたり専門翻訳者が独占してきた高難度な分野が、大規模モデルによって次々と誰でも使えるインフラへと変貌しています。
VIP会員