中国には既に238もの大規模言語モデルが存在しますが、李彦宏氏は、無計画な開発を避けるべきだと強調しています。AIネイティブアプリへの注目を促し、大規模言語モデルはAIネイティブアプリの基礎となる基盤であるべきだと訴えています。百度は、マルチモーダルな回答サービスを提供するなど、AIネイティブアプリの推進に力を入れています。李彦宏氏は、AI時代の到来は、より多くのAIネイティブアプリの誕生によって示されると考えています。
関連推奨
Claudeの音声モードがついにOpusを採用しました:気軽な質問からツール調整や言語変更ができるリアルタイムなアドバイザーへと進化
AnthropicがClaudeの音声モードを大幅強化。Opus、Sonnet、Haikuの3モデルに対応し、GmailやSlackなどの接続ツールと連携。言語サポートも拡大。ハンズフリー会話の追加後、ユーザーは複雑な長会話を音声で処理し、タイピングの課題を解消している。....
アリババがオープンソースの0.8Bドキュメント解析モデルOvisOCR2を発表、エンドツーエンドソリューションがOmniDocBenchで首位に
7月24日、アリババは0.8Bパラメータの文書解析モデルOvisOCR2をオープンソース化。OmniDocBenchで96.58点を獲得しトップに立ち、従来のパイプラインを初めて全面的に上回り、文書インテリジェンスのパラダイムシフトを推進。....
ドイツ・ブラックフォレスト・ラボがFlux3マルチモーダルモデルを発表:ネイティブな音声生成 20秒の音声と映像の同期出力
独Black Forest Labsがマルチモーダル基盤モデルFlux3を発表。Self-Flowアーキテクチャと専用コーデックで物理・デジタル環境の統合理解・生成を実現。LumaやRunwayを上回り、初のネイティブ音声生成で20秒の同期動画を出力可能。テキスト/画像/動画からの変換、キーフレーム遷移、多言語対話にも対応。....
テンセントが WorkBuddy Bench を発表:コード、ウェブページ、オフィス作業、セキュリティをすべてワンパッケージにしたコードインテリジェントテストケース
テンセントが WorkBuddy Bench 多分野評価キットを発表しました。論文は arXiv に掲載されています。これはコードインテリジェントの評価においてそれぞれの分野が独立していること、および生成基準が透明ではないという状況を打ち破り、コードエンジニアリングのリポジトリレベル、フロントエンド製品、オフィス自動化などの4つの業務シーンを統合したものです。最大の特徴は問題数ではなく、問題の根源的な設計によって答えを覚えることを排除し、インテリジェントが異なる分野で汎用性と移行能力を実際の評価で反映できることを確保しています。
ChatGPTのデスクトップ版に人間らしい口調が搭載:GPT-Liveの音声機能がリリース。話すとバックエンドで処理される
OpenAIはChatGPTデスクトップ版を大幅更新し、Codex統合とGPT-LiveモデルによるVoiceモードを導入。チャット、オフィス、プログラミングの3領域で音声によるタスク開始・確認・調整が可能に。2024年の音声認識追加以来、音声技術を強化している。....
