アリババのinclusionAIは、HuggingFaceに「AI-Transparency」というレポジトリを開設し、自社が開発したLing、Ring、Mingシリーズモデルのトレーニング内容の要約を一括公開しました。これはまた一つのモデルウェイトの公開ではなく、「モデルがどのデータで学習したのか」についての積極的な説明です。レポジトリにはドキュメントのみが掲載されており、ウェイトやトレーニングデータセットは含まれていませんが、Ling-2.0からLing-3.0、Ring-2.0からRing-2.6、そしてMing-Omniおよび2種類の16B-A3Bマルチモーダルモデルのトレーニングデータの詳細をそれぞれ明記しています。

この要約の枠組みそのものに規制の意味が込められています。それは、EUの「人工知能法」第2024/1689号 Regulation (EU) 2024/1689第53条第1項d項に関連する「公開トレーニング内容の要約テンプレート」に厳密に従っています。言い換えれば、これは自主的に書かれた技術ブログではなく、EUが一般的なAIモデル提供者に対して求めているコンプライアンス要件に基づき、トレーニング内容の開示を標準的なフォーマットにまとめたものです。各ドキュメントの適用範囲は自分たちが指定したモデルとバージョンに限定されています。ドキュメントにLing-2.0と記載されている場合、それにはLing1T、Ling-flash2.0、Ling-mini-2.0も含まれますが、同じシリーズであったり、量化後のサフィックスを含んでいるからといって自動的に適用範囲を拡大することはできません。

リストを広げてみると、カバー範囲は非常に広いです。Lingシリーズは2.0、2.5、2.6から3.0まであり、そのうち3.0はLLM(flash、tiny、flash-finを含む)とVL(視覚言語版:Ling-3.0-flash-VL)に分かれています。Ringは2.0、2.5-1Tから2.6-1Tまであります。MingシリーズではOmni全モーダル(flash-omni-previewとflash-omni-2.0を含む)およびUniAudio-16B-A3B、UniVision-16B-A3Bという2つの統合音声・視覚モデルが登場します。それぞれの要約にはバージョン番号と更新日が明記されており、対応するドキュメントの規定されたレベルにおけるトレーニング内容を記述しています。下位のトレーニングデータを配布することも、第三者にコンテンツの権利を与えることもありません。公式にはこれらのドキュメントが権威的な認証や背書を意味するものではないこと、またinclusionAIのすべてのモデルがカバーされているわけではないことを特に強調しています。

連絡先ページはアリババのLingの公式開発者サイトにリンクしており、バージョン履歴ではPDF内の日付がドキュメントのバージョン日付であり、初出のインターネット上での公開日を示すものではないことを読者に注意喚起しています。実際の変更内容はレポジトリのコミット記録に基づいています。世界中の規制が「トレーニングの透明性」をオプションから必須条件に変えた今、アリババが全シリーズモデルのトレーニング要約を整然と整理して公開したことは、海外でのコンプライアンスを準備するためのものであり、同時に「私のモデルはどのように作られたのか」というドアを外部に向けて少し開いたのです。