REPRESENTATION GEOMETRY / ARXIV:2605.17524

少到一兩個位元,什麼資訊仍被保留?

Covariance Structure and Coordinate Heterogeneity Govern Binary Quantization of Contrastive Embeddings

透過共變異數結構與座標異質性解釋低位元排序行為,分析額外幅度位元與隨機旋轉為何對不同表示有不同效果。

座標尺度與跨座標結構,共同決定壓縮後保留的排序資訊。

相反的設計,為何都可能奏效?

有些二值量化系統先隨機旋轉向量,另一些保留原始座標軸;相同位元數下,不同表示的檢索品質也相差甚遠。論文從對比學習嵌入的統計性質研究這些現象。

區分共變異數與座標異質性

在高斯模型下,完整共變異數結構影響排序保真度;只看邊際變異數,會遺漏跨座標累積的訊號。不均勻的座標變異數,決定幅度位元能補充多少資訊,以及隨機旋轉會帶來幫助還是消除有用結構。

旋轉能使變異數更均勻,有利於各向同性距離校正,也可能抹除另一種編碼所利用的異質性。論文推導近似保真度公式,並提出跨模型與維度的經驗縮放關係。

把表示結構化為設計依據

涵蓋 9 個嵌入家族與 18 個資料集的實驗,檢驗共變異數、幅度位元及旋轉的作用。在明確的高斯模型及近似條件下,結果為編碼與前處理的選擇提供統計依據。

閱讀與引用

繼續閱讀論文原文。

完整推導、實驗設定與結果,請參閱公開論文。

摘要與版本紀錄 ↗
PDF 全文 ↗