Metaは、初のリアルタイム音声認識モデルであるMuse Voice Transcribeをリリースしました。開発者はMeta Model APIを通じてこの機能を呼び出すことができ、料金は1000分の音声に対して3ドル(約20.2元人民元)で、これは1時間あたり0.18ドルに相当します。

話しながら文字が出てくる、20人以上の話者を自動的に分離
このモデルは、ストリーム型の自動音声認識、話者分離、およびエンドポイント検出を一度の処理で統合しています。「ストリーム型」とは、話しながら文字起こしを行うことを意味します。モデルは、すべての音声が終わるのを待たずに、少しずつ継続的にテキストを出力するため、遅延が少なく、リアルタイムの筆記、会議録、通話字幕などのシナリオに適しています。ユーザーが話し始めると、システムは同期してテキストを出力し、完全な録音が終了した後に別途処理する必要はありません。
Muse Voice Transcribeは、20人以上の話者が含まれる録音から異なる発言者を分離でき、発言が終了したかどうかを識別し、入力の境界を自動的に決定できます。言語サポートにおいて、モデルの訓練は70以上の言語をカバーしており、そのうち25言語はリリース時に検証が完了しています。1時間以上の音声をサポートし、文内や文間での自然な言語の切り替えも可能です。開発者は言語、キーワード、文脈のバイアスを通じて、特定の言語、用語またはシナリオにおける認識効果を向上させることができます。

自己調整遅延メカニズムで速度と精度をバランス
リアルタイム応答と認識精度の両方を考慮するために、Metaは「自己調整遅延(adaptive delay)」という動的な意思決定メカニズムを導入しました。システムはすべての単語に対して固定されたスピードと精度のトレードオフを使用するのではなく、各単語についてどのくらいの追加の音声を受信した後に認識結果を出力するかを判断します。比較的識別しやすい音声の場合、システムはより速く文字起こし結果を提出します。一方、発音が不明瞭で専門用語が多く、文脈が複雑な単語の場合、正確性を高めるためにさらに多くの前後の音声情報を使用します。
VIP会員