Cloudflare は最近、新しいオープンなウェイトの決定モデルである Clef-omni を正式にリリースしました。このモデルは、従来の Clef シリーズを大幅にアップグレードしており、テキストと画像をネイティブにサポートするだけでなく、初めて音声と完全な動画入力を直接処理できる機能を追加しています。現在、そのモデルウェイトは Hugging Face プラットフォームで全面的にオープンソースとなっています。
技術的実装と機能特性において、Clef-omni は従来の処理フローを完全に変革しています。以前のバージョンの Clef では、動画入力に対応する際には、まず動画を時間軸に沿って連続した静止画像に分解してから処理していましたが、新しく登場した Clef-omni は wav、mp3、mp4、webm などの主要な音声・動画形式を直接サポートします。これにより、開発者は別途複雑な音声変換や音声・動画の分割パイプラインを構築する必要がなくなり、単一の API 呼び出しでテキスト、画像、音声、動画の統合処理が可能になります。

パフォーマンスおよびベンチマーキングの結果を見てみると、このモデルは Qwen3-Omni-30B-A3B-Instruct ベースアーキテクチャに基づいて構築されており、その核心的な理解能力を完全に保持しています。構造化された意思決定タスクに特化した専用モデルとして、通常の長大なテキストを出力しません。公式に公表された実測データによると、純粋なテキスト要求の中央値応答時間は約130ミリ秒で、画像要求は約150ミリ秒です。また、音声を含み、長さが21秒の動画を処理するにも、約1.5秒で効率的に評価できます。
新たなモデルの登場に伴い、Cloudflare は他製品ラインナップの価格調整と最適化も行いました。特に、Clef-flash の入力価格は約58% 下降し、元々の100万トークンあたり0.09ドルから0.038ドルに変更されました。ホスティング版のコンテキスト窓サイズも64k から24k に調整されました。全体的に見ると、Clef-omni のオープンソース化とマルチモーダル処理機能の補完により、世界中の開発者に対して複雑なスマートワークフローや自動化された意思決定システムをより効率的でコストパフォーマンスの高い基盤で構築するための支援が提供されています。
VIP会員