9月16日、科大訊飛は音声基盤大モデル「Spark-Audio-1.0-Preview」を発表しました。最も目を引くラベルは「国内産業化」です――このモデルは国内産業化された計算力で訓練されており、下部からサプライチェーンリスクを排除しています。
機能面では、Spark-Audio-1.0-Previewはテキストと音声の2つのモードの入力をサポートし、テキストモードで出力を行います。扱える業務は非常に多岐にわたります。音声変換、多言語翻訳、複数の地方言の認識は基本的なスキルですが、環境音の認識、話者認識、感情分析および複雑な音声質問も含まれています。一度に99言語と202種類の方言認識をカバーしており、科大訊飛はこれを「聞くことから理解することへのスマート音声の飛躍」とまとめています――過去には機械が音波を正確に文字に変換することを目指していましたが、現在では誰が話しているのか、そのトーンに隠された感情、背景に何があるのかを区別する必要があります。
現在、Spark-Audio-1.0-Previewは正式に体験が公開されており、APIは後ほど科大訊飛オープンプラットフォームに追加される予定です。
VIP会員