英偉達的研究團隊取得了一項突破:他們找到了讓KV緩存在不同模型之間遷移的方法。目標模型可以直接跳過預填充階段,轉換速度比重新處理上下文快2. 7 到 25 倍。
要理解這個突破的意義,需要先了解KV緩存的作用。在使用ChatGPT或Claude時,你會發現第一個詞的生成總是明顯更慢,然後後面的內容幾乎是瞬間涌出。這背後是一個刻意設計的機制——模型在生成第一個詞之前,需要處理整個輸入上下文,把中間結果存儲爲KV緩存。之後的每個詞都可以複用這些緩存,所以速度快得多。
問題在於,KV緩存一直是"一次一模型"的。如果你切換到另一個模型,或者升級了模型版本,之前計算好的緩存就全廢了,新模型必須從頭開始處理整個上下文。對於長文本場景,這意味着大量的重複計算和時間浪費。
英偉達的方案讓KV緩存變得可遷移。一個模型計算出的緩存,經過轉換後可以被另一個模型直接使用,目標模型完全跳過預填充階段。轉換過程本身也比重新處理上下文快得多——速度提升在2. 7 倍到 25 倍之間,具體取決於模型和上下文的複雜度。
這對AI行業的影響是深遠的。當前LLM API的使用成本中有相當一部分來自上下文處理,尤其是長對話和長文檔場景。如果KV緩存可以在模型之間遷移,意味着用戶在切換模型時不必承擔重複計算的成本,模型升級時也不必丟棄已有的對話上下文。這項研究可能會改變AI推理基礎設施的設計方式,讓模型之間的切換變得更加流暢和經濟。
