LOW-BIT LLMS / ARXIV:2609.09867

同一次量化改動,為何會改變好壞?

Contextual Utility of Quantization Moves in Extreme Low-Bit LLMs

沿離散改動自身的路徑評估收益,並在持續變化的模型狀態中組合決策,研究極低位元大型語言模型的量化改動效用。

一次改動的效用,取決於自身路徑與先前改動留下的模型狀態。

重構更準確,模型未必更好

訓練後量化調整有限編碼,以降低權重或啟動值的重構誤差;模型最終卻以預測損失和任務表現來評估。論文研究如何在位元數固定時,判斷一次允許的編碼改動是否真正有用。

收益取決於改動的位移。只看起點梯度會遺漏路徑曲率;在改動中點計算梯度,能更準確地判斷終點損失的變化方向。Llama-3.2 的低位元實驗檢驗了這項差異。

量化改動會彼此影響

窮舉允許的量化狀態顯示,組合效用可用近似二次結構描述。小幅兩兩交互作用仍可能改變多目標下的最佳取捨,同一改動也可能在不同狀態下由有益變成有害。

中點評估能修正局部選擇。面對較大的組合,方法從實際到達的狀態重新評估並檢查精確終點;以終點評估的束搜尋找到了優於大規模一次性更新的稀疏改動。

從靜態分數,走向隨狀態更新的最佳化

研究將量化最佳化推進到個別編碼改動的層次:明確定義目標,沿各自路徑評估改動,並隨狀態重新組合。實驗將這些選擇連結到任務準確率及留出資料的困惑度。

閱讀與引用

繼續閱讀論文原文。

完整推導、實驗設定與結果,請參閱公開論文。

摘要與版本紀錄 ↗
PDF 全文 ↗