重构更接近,模型未必更好
后训练量化会调整有限的编码,让权重或激活的重构误差降低。但模型最终面对的是预测损失与任务表现。论文研究的是:在位数不变的前提下,如何判断一次合法的离散编码改动是否真正有益。
收益首先取决于改动本身的位移。只在起点计算梯度会遗漏沿途的曲率;在这次改动自己的中点计算梯度,能更准确地判断终点损失的变化方向。Llama-3.2 的低比特实验检验了这一差异。
改动之间,也会相互影响
对合法量化状态的穷举显示,多个改动的组合收益可由近似二次结构描述。即使两两交互项很小,也可能改变多目标下的最优取舍;同一次改动在不同状态中,甚至会从有益变为有害。
逐个读取改动的中点,可以修复局部选择。组合范围扩大后,则需要从实际到达的状态重新评估,并检查真实终点。论文中的终点评估束搜索找到了优于更大规模一次性更新的稀疏改动。
从静态打分,走向随状态更新的优化
这项工作把量化优化推进到“几次改动”的粒度:明确优化目标,沿各自路径判断收益,再随着状态变化重新组合。实验同时考察任务准确率和留出数据上的困惑度,连接局部选择与模型实际表现。
阅读与引用
完整推导、实验设置和结果见论文原文。
Wenxuan Xiao, Xu Cao. Contextual Utility of Quantization Moves in Extreme Low-Bit LLMs. arXiv:2609.09867, 2026.