距離の誤差から、具体的な判断へ
ベクトル検索は、どの候補が近いか、どの辺を残すかを繰り返し選びます。平均誤差や全体の順位相関だけでは局所判断の失敗を説明できないため、本研究はアルゴリズムが実行する比較そのものを分析します。
重要なのは候補間の元のマージンと、量子化誤差がそれを越えるかです。境界付近のリスクと校正残差の裾の振る舞いを分け、同じクエリやグラフノードから生じる相関も考慮します。
局所判断をグラフの実行軌跡につなぐ
候補順序を固定した Vamana の近傍選択について、凍結した厳密状態における個々の枝刈り判断の一致と、最終的な近傍リストの一致を結びつけます。
分布の仮定が頼れない場合、独立したホールドアウトのデータブロックから、固定済みの量子化規則のリスクを推定できます。二値コード、RaBitQ、Lucene BBQ、積量子化を共通の判断インターフェースで扱います。
検索過程に合う量子化を選ぶ
学習された表現、古典的な表現、合成表現を通じて、正規化比較マージンは全体の順位相関よりも順位や枝刈りの反転をよく予測しました。対象は固定候補集合と凍結軌跡であり、検索全体の再現率は候補のカバー範囲にも依存します。
原文と引用
論文の原文へ。
導出の詳細、実験設定、結果は公開論文をご覧ください。