再構成がよくても、モデルがよいとは限らない
学習後量子化では有限のコードを変えて重みや活性値の再構成誤差を減らしますが、モデルは最終的には予測損失とタスク性能で評価されます。本論文は、ビット幅を固定したとき、許容されるコード変更が実際に有益かを判断する方法を探ります。
効用は変更の変位に依存します。始点の勾配だけでは経路の曲率を捉えられず、変更の中点で勾配を評価すると終点損失の変化方向をより正確に推定できます。低ビットの Llama-3.2 実験でこの違いを検証します。
量子化の変更は相互作用する
許容される量子化状態を列挙すると、組み合わせた効用は近似的に二次構造で表されます。小さな二者間相互作用でも多目的の最適な取捨選択を変え、同じ変更が別の状態では有益から有害へ転じる場合があります。
中点評価は局所的な選択を修正します。組み合わせを広げる場合には、実際に到達した状態で再評価し、厳密な終点を確かめます。終点評価によるビーム探索は、大きな一括更新を上回る疎な変更を見つけました。
固定スコアから、状態に応じた最適化へ
量子化最適化を個々のコード変更の粒度へ進め、目的を定め、各経路に沿って効用を評価し、状態の変化に合わせて再構成します。実験ではタスク正解率とホールドアウトのパープレキシティに結びつけて検証します。
原文と引用
論文の原文へ。
導出の詳細、実験設定、結果は公開論文をご覧ください。