重構更準確,模型未必更好
訓練後量化調整有限編碼,以降低權重或啟動值的重構誤差;模型最終卻以預測損失和任務表現來評估。論文研究如何在位元數固定時,判斷一次允許的編碼改動是否真正有用。
收益取決於改動的位移。只看起點梯度會遺漏路徑曲率;在改動中點計算梯度,能更準確地判斷終點損失的變化方向。Llama-3.2 的低位元實驗檢驗了這項差異。
量化改動會彼此影響
窮舉允許的量化狀態顯示,組合效用可用近似二次結構描述。小幅兩兩交互作用仍可能改變多目標下的最佳取捨,同一改動也可能在不同狀態下由有益變成有害。
中點評估能修正局部選擇。面對較大的組合,方法從實際到達的狀態重新評估並檢查精確終點;以終點評估的束搜尋找到了優於大規模一次性更新的稀疏改動。
從靜態分數,走向隨狀態更新的最佳化
研究將量化最佳化推進到個別編碼改動的層次:明確定義目標,沿各自路徑評估改動,並隨狀態重新組合。實驗將這些選擇連結到任務準確率及留出資料的困惑度。
閱讀與引用
繼續閱讀論文原文。
完整推導、實驗設定與結果,請參閱公開論文。