アマゾン、100以上の言語に対応する新しいASRシステムを発表


アリババは千問AIプラットフォームでQwen-Audio-3.0シリーズの音声モデルを全面的にリリースし、音声認識、音声合成およびリアルタイム音声インタラクションの3種類をカバーしています。公式によると、このシリーズは今年7月に行われた権威ある評価プラットフォームArtificial Analysisの音声ランキングで優れた成績を収め、音声認識、リアルタイムインタラクション、音声合成の3つの部門ですべて1位を獲得しました。
テンセント混元が音声認識モデルHy ASR3.0 Previewを発表。大規模言語モデルHy3基盤で高精度認識と深い意味理解を融合。逐語転写から文脈理解へ質的変化を実現。10大方言圏をカバーし長尺音声に強く、標準語非依存でAIが文字を聴くだけでなく言葉の真意を理解可能に。....
テンセント混元が音声認識モデルHy ASR3.0previewを発表。大規模言語モデルHy3の意味理解を初統合し、逐次文字起こしから「文脈理解・ワンクリック出力」へ進化。中国語標準語、英語、広東語の単語誤り率は各3.34%、2.62%、3.12%、全体約3%と高性能。....
xAIが新世代音声モデルGrok Voice Think Fast 2.0をリリース、開発者に完全開放。知能、書き起こし精度、対話インタラクション、ツール呼び出し効率が大幅向上。価格は1分あたり0.08ドル。Artificial Analysisベンチマークで総合スコア82.9%を獲得し、旧モデルやGPT-Realtime-2.1、Gemini 3.1 Flashを上回る。....
OpenRouterは音声転記エンドポイントをリリースし、統一されたAPIキーを提供します。開発者はBase64形式の音声を送信するだけで、直接文字起こしテキストを得ることができます。従来のWhisperやサードパーティのSDKを別途統合する必要がなくなり、チャットと転記の間に存在していた断絶感が完全に解消されました。