Mistral AI 在8月4日丟出一顆"審覈核彈"——Shieldstral 內容審覈模型,總參數3B(30億),採用開放權重、依照 Apache2.0許可證發佈,已經上線 Hugging Face。它支持12種語言,最誘人的是能在單張16GB GPU 上跑起來,而 Mistral 放話:它的內容安全性能可以媲美規模大7倍的開放模型,並且在多模態內容審覈領域做到了 SOTA(當前最先進水平)。

image.png

多數防護模型有個通病:把傷害類別體系直接焊死在權重裏,產品一換使用場景,開發者往往得重新訓練。Shieldstral 換了個思路——把審覈政策寫進輸入裏。操作者可以自己寫一道"是或否"的問題,再附上評估場景和嚴格程度說明,模型隨後只從單個輸出詞元裏吐出一個經過校準的安全分數。

image.png

具體機制上,它把每一項審覈任務都拆成二元問答,輸入由三個帶標籤字段組成:<Instruct> 說明評估場景與嚴格程度,<Query> 拋出一個"是或否"問題(比如"這段內容是否宣傳身體暴力?"),<Document> 提供待審內容——可以是提示詞、回答、兩者組合,也可以是附帶可選文本的圖像。推理時模型只讀取"是"和"否"兩個詞元的邏輯值,經 softmax 歸一化成連續分數,再以0.5爲閾值給出二元判斷。靠着這套設計,它能一口氣覆蓋提示詞分類、回答審覈、拒答檢測和毒性檢測,把多模態審覈塞進了一張消費級顯卡的容量裏。

模型地址:https://huggingface.co/mistralai/Shieldstral-1.0-3B