Expanding SPHERE-JEPA如何实现
#JEPA#数学#高维几何
共 5,200 字
约 17 分钟
SPHERE-JEPA就不看了,应该是和SIGreg的方法差不太多的,用蒙特卡洛投影到一维去处理的。Expanding SPHERE-JEPA继承了SPHERE-JEPA的理念,就是让特征在单位超球面上均匀分布(SIGreg径向上还存在概率分布)。
它首先把编码得到的向量归一化,让所有向量在单位超球面 Sd−1 上了。
概念:核函数、谱展开
核函数用于测量两个样本在高维(通常是无限维)特征空间中相似度,而无需显式计算该空间中的坐标。这里是定义在球面上的核函数,也就是这个核函数的输入全在球面上:
k(x,y),x∈Sd−1, y∈Sd−1
应用紧致流形谱定理
对球面配备Laplace-Beltrami算子,高维球谐{Yl,α}是Sd−1上完备正交本征基底。任意平方可积二元球面函数都可以做双重谱展开:
k(x,y)=l,α∑l′,β∑Clαl′βYl,α(x)Yl′,β(y)
此时没有化简,两套球谐分别对应 x 和 y ,项数极多。
只要输入在球面,一定能这么拆;这由紧致流形谱定理保证,和旋转不变无关。
旋转不变性
我们需要这个核函数具备旋转不变性,也就是对任意正交旋转矩阵R(旋转操作),满足 k(Rx,Ry)=k(x,y) 。几何含义:整体转动坐标系,相似度完全不变。
线性代数可证明:满足该条件的函数,必然只依赖向量内积:
k(x,y)=φ(x⊤y)
原本二元函数坍缩为一元函数 φ(c),c=x⊤y∈[−1,1]。仔细想这个 c 就代表超球面上两个向量之间夹角的余弦。
Schoenberg定理
Sd−1上正定、旋转不变的核,一定可以按Gegenbauer多项式C~l(α)正交级数展开:
k(x,y)=φ(c)=l=0∑∞wl(λl)C~lα(c)(1)
其中α=(d−2)/2,λl=l(l+d−2)是拉普拉斯本征值。
三维特例验证
Gegenbauer退化为勒让德多项式Pl,展开式变为:
k(cosθ)=l∑wlPl(cosθ)
超球面上的谱核设计
(RKHS平滑度)对(1)归一化:
k(x,y)=φ(c)=Z1l=0∑∞wl(λl)C~lα(c)(2)
归一化常数Z=∑l=0∞wl(λl)C~lα(1),强制 φ(1)=1。
每个本征值 λl 等于其相应特征函数的狄利克雷能量。由于这些核严重惩罚高能量(不光滑)函数,因此从这一通用展开中导出的统计检验在统计学文献中广泛被称为“Sobolev 检验”。
谱权重
- 带限核:wl(λl)=1l≤L;
- 热核:wl(λl)=e−λlt,t>0;
谱权重 wl(λl) 充当频率滤波器。较低的 l 值对应平滑的全局几何变化,而较高的值则捕捉日益振荡的空间模式。
统计检验的显式形式
这部分的理论会用尽可能好理解的方式写推导,完整过程看论文附录。
MMD
MMD(Maximum Mean Discrepancy),即最大均值差异,对比两组分布的核均值嵌入距离,衡量整体分布差距。
DMMD=Cnorm/MMD1(Ex,y∼p^[φ(c)]−Cbias/MMD),(3)
Ex,y∼p^[φ(c)] 是目前所有的超球面上的点俩俩求 φ(c) 得到的均值,在所有点都在一起时(c=1)取到最大值1。
Cbias/MMD 含义是球面连续(无穷多个点)均匀分布时俩俩求 φ(c) 得到的均值。Cbias/MMD=∫−11φ(v)ρd(v)dv 通过利用超球面边缘密度 ρd(v)∝(1−v2)2d−3 的高效高斯-雅可比求积法进行数值计算。
Cnorm/MMD=1−Cbias/MMD 归一化使得损失 DMMD 最大为1,优化目标是使它尽可能小,趋近于0。
KL
KL(Kullback–Leibler Divergence),即KL-散度/相对熵,衡量两个概率分布的信息差,本文用核密度估计近似球面分布的均匀程度。
DKL=Cnorm/KL1(Ex∼p^[logEy∼p^−x[φ(c)]]−Cbias/KL)(4)
Ex∼p^[logEy∼p^−x[φ(c)]] 的含义就是我选一个点,然后拿其他所有点和这个点求 φ(c) (留一法)的均值,所有点均值的 log 再求均值。当所有点都在一起时(c=1)取到最大值0。它用来描述点的密度。
因为这里KL散度的定义是球面均匀KL散度 KL(p∥q)=∫p(x)logq(x)p(x)dx ,所以我们还需要一个真实密度 q(x) 作为基准。
在球面连续均匀分布时,这个密度 q(x)=∣Sd−1∣1。那么真实的KL散度表达式为:
KL=E[logp^(x)]+logSd−1
论文中的(3)的优化方向和-KL散度一致,因为它令
Cbias/KL=log∣Sd−1∣
分子的取值范围即 [−∞,−Cbias/KL]。( ∣Sd−1∣ 必然大于1)
Cnorm/KL=−Cbias/KL 归一化使得DKL 最小为1,优化目标是使它尽可能大。
KSD
KSD(Kernel Stein Discrepancy),即核斯坦因差异/核斯坦散度,利用斯坦算子检验分布是否匹配目标均匀流形。
KSD的理解更困难一点,一步一步来。
在任何维度下描述旋转都是确定旋转平面。因为圆周运动天然被约束在二维平面内,任何旋转本质都是某二维平面内的圆周转动。d 维空间的旋转自由度就是 Cd2 。
我们希望球面上所有点均匀分布,等价于 φ(x⊤y) 沿任意旋转切向挪动一点点 x 或 y ,φ 不变。用数学公式刻画就是:
kq=i<j∑AijxAijyφ,(5)
其中i,j代表选取的两个维度,能确定旋转平面。kq 的含义就是我先沿 (i,k) 旋转切向对 y 求一阶偏导,再沿同一个切向对 x 再求一个偏导。然后把全部方向上的这个“联合二阶偏导”求和。
某一个旋转平面下 x 处切向量可以利用反对称基础矩阵写出 Eijx。
反对称基础矩阵
Eij 是 d×d 反对称基础矩阵,满足 Eij⊤=−Eij。
第 i 行第 j 列 = 1;第 j 行第 i 列 = −1;其余全部为 0。
那么切向导数算子(Stein算子,球面黎曼斯坦微分算子) Aijx=(Eijx)⊤∇x ,代入(5)有:
AijxAijyφ=φ′′(c)⋅[(Eijx)⊤y][x⊤Eijy]+φ′(c)⋅(Eijx)⊤(Eijy)
[(Eijx)⊤y][x⊤Eijy]=y⊤(Eijx)(Eijy)⊤x
(Eijx)⊤Eijy=tr((Eijx)(Eijy)⊤)
内积等于外积的迹
对任意两个列向量 u,v∈Rd:u⊤v=tr(uv⊤)
令 M=∑i<j(Eijx)(Eijy)⊤=21(cI−yx⊤),(5)可以写成:
kq=φ′′(c)⋅y⊤Mx+φ′(c)⋅tr(M)
可以对 M 简化得到:
M=21(cI−yx⊤),c=x⊤y
- 计算二次型 y⊤Mx
y⊤Mx=21y⊤(cI−yx⊤)x=21(cy⊤x−y⊤yx⊤x)
x,y为单位向量:x⊤x=y⊤y=1,y⊤x=c
y⊤Mx=21(c2−1)
- 计算迹 tr(M)
tr(M)=21tr(cI−yx⊤)=21(cd−tr(yx⊤))=2c(d−1)
回代合并得到最终公式
kq=21[(c2−1)φ′′(c)+c(d−1)φ′(c)]
再来看论文公式就很好理解了。
DKSD=Cnorm/KSD1Ex,y∼p^[21((c2−1)φ′′(c)+c(d−1)φ′(c))],(6)
很显然均匀状况下二阶偏导都为0,最小值是0;当所有点都在一起时(c=1)取到最大值 2d−1φ′(1)。
自然归一化常数 Cnorm/KSD=2d−1φ′(1) 。DKSD 优化目标是使它尽可能小,趋近于0。
概念补充
- 闭式:能用有限次基础初等运算写出的显式表达式。
- 海森矩阵:二阶偏导矩阵
- ∇x∇y⊤k(x,y)=φ′′(c)yx⊤+φ′(c)I。
- KSD的推导中我们用斯坦算子通过给海森矩阵左右乘旋转切向量,过滤掉所有无关的非旋转分量。
最后一步
以上三种 D 放入JEPA中就是:
Lreg=Va1v=1∑VaD(p^v,q)
这就没什么好说了,优化方向和选择的 D 完全一致。Va是数据增广后的全部示图总数量。