最近、グーグルは世界の言語インテリジェンスに関する最新の技術成果を発表し、自社のAI技術と製品が300種類以上の言語をサポートし、世界の71億人の人口の86%をカバーしていることを明らかにしました。グーグルは、真の言語大規模モデルは単なるテキスト翻訳だけでなく、現実世界におけるトーン、感情、文化的な微細な差異があるコミュニケーションの理解も必要であると述べました。

技術的な構造において、従来の音声認識は通常、音声をテキストに変換し、テキストを処理して再び音声に戻す多段階で硬直なパイプラインを使用していました。これは、人間の会話において重要なトーン、リズム、感情、文脈を取り除くことになります。現実的なコミュニケーションの質を再現するために、グーグルはオーディオに直接対応するナティブなオーディオインテリジェンスへの移行を推進し、Geminiなどのモデルがオーディオそのものを処理・理解できるようにしています。

image.png

その中で、Gemini3.5Live Translateは70種類の言語、2000以上の言語対でのリアルタイムの口頭翻訳を実現し、言語コードの切り替えや感情の手がかりを自然に捉えています。Gemini3.5Transcribeは高精度の音声からテキストへの変換モデルであり、騒音のある環境や複雑な専門用語でも整ったテキストを出力します。また、AndroidキーボードのGboardにあるRambler機能を支え、口語的な冗語を除去し、文法を修正し、音声指令により直接再作成や多言語間のスムーズな切り替えを可能にしています。

AIの能力をより多くの低資源言語に広げるために、グーグルは「1,000言語計画」を正式に推進しており、世界で最も使用されている1,000言語をサポートすることを目指しています。この背景のもと、1,200万時間の音声データで訓練された汎用音声モデル(USM)は、跨言語転移学習技術を活用し、高資源言語で学んだパターンをトレーニングデータが少ない言語に適用しています。これらの研究は、過去25年のオープンな研究と400を超える査読付き音声論文に基づいています。

言語データの収集において、インターネット上のコンテンツは少数の主要言語に偏っているため、グーグルは従来の単一のクロール方式を放棄し、地元の基層のオープンソースデータとの協力を通じて、本物の文化的文脈を取得しています。

それは、27種類のサハラ以南アフリカ語をカバーするWAXALという大規模なオープンソース音声データセットを複数の機関と共同で構築したことであり、インド科学研究所とBhashiniと協力して、地域に焦点を当てた方法で109種類の言語の3万時間を超える音声を収集した「ヴァニープロジェクト」(Project Vaani)であり、4つの大陸にまたがる1,600人以上の地元の専門家と20大学が多モダルデータポイントを共同で提供した「アマプリファイ・イニシアチブ」(Amplify Initiative)です。

さらに、グーグルはインタラクティブな言語探索ツール「Language Explorer」をリリースし、7,000種類以上の言語を含むLinguaMetaデータベースを継続的に視覚化してマッピングしています。これらの技術成果は、デジタル言語包含センターなどの公益プロジェクトを通じて、世界中の農民、医療従事者、教師を支援しています。

世界ではまだ30億人以上が安定したインターネット接続にアクセスできない現実的な課題があります。グーグルは、TranslateGemmaという軽量でオープンソースの翻訳モデルシリーズを開発しました。このシリーズは55種類の言語に対してエッジデバイス上で効率よく動作し、クラウドに接続せずに高品質な翻訳が可能です。また、低資源地域で広く使用されている機能電話のユーザー向けに、ルワンダでViamoなどの機関と提携して「Viamoにどんなことでも尋ねてみよう(AVA)」という音声人工知能アシスタントを試験的に展開し、Geminiモデルを活用して機能電話ユーザーに200万問以上の質問に答えることに成功しました。

アクセシビリティ設計と文化的ランドマークの発音の詳細な調整において、従来のツールは非標準的な発音を持つ人々を技術に合わせなければならないことがありました。グーグルは、アクセシビリティに特化したインターフェースを最初から設計し、50以上の手話で訓練された「手話からテキストへ(SL2T)」技術を導入し、アメリカ式手話から英語への変換をサポートしています。この技術は、GboardとPixel11のリアルタイム録音を可能にしています。また、ニュージーランドとマオリ語の専門家と協力し、地図上の地名と通り名のローカライズされた発音を最適化し、実際に使われる文化的文脈と正確な読み方をテキストから音声への変換モデルに内蔵させました。

20年にわたるAI言語の研究開発の結果、グーグルの言語技術は検索、Android、Chrome、YouTube、Google Playなどの9つの主要プラットフォームに深く統合されています。グーグルは、技術の核心的な意味は人間の表現の多様性を減らすことではなく、表現の境界を広げることであると強調しています。地方文化と現実的な文脈を尊重しながら、もっと多くの人が自分のやり方で参加し、表現し、世界から理解される助けになることを目指しています。