零基础理解SIGreg
#数学#概率#JEPA
共 3,605 字
约 12 分钟
SIGReg 是一种正则化损失函数,核心目标:让模型输出的高维嵌入向量Z的整体分布对齐各向同性高斯分布N(0,I)(均值0、协方差为单位阵)。
高维分布直接匹配难度极大,它借助Cramér-Wold定理+Epps-Pulley(EP)单变量检验统计量把高维匹配降解为大量一维分布匹配,下面分层拆解。
步骤1:随机采样球面单位方向
在D维单位超球面SD−1上均匀随机采样M个单位向量u(1),u(2),...,u(M)。
对每个方向做嵌入投影:
h(m)≜Zu(m)
h(m)是把D维嵌入压缩得到的一维投影变量。
理想情况下,所有h(m)都应当服从一维标准正态N(0,1)。
D维的球面为何是D−1维?
简单理解就是D维度下球面增加了一个约束条件,减少了一个自由度,所以是D−1维。
一维高斯分布的概率密度函数
一维高斯分布概率密度函数推导
高斯分布
以上从高斯假设开始推导。从信息论角度理解这句话就是高斯分布熵最大(在给定的均值和方差下)。因此也可以从熵角度推出前半部分的通式f(x)=Ae−Bx2。
标准正态(高斯)分布N(0,1),对应就是f(x)=2π1e−2x2。
独立条件下的联合概率
根据定义得到的独立事件概率公式为p(y∣x)=p(y),带入条件概率公式p(x,y)=p(x)p(y∣x),得到
p(x,y)=p(x)p(y)(1)
怎么理解连续情况?
在连续变量中,我们不讨论某一个孤立的点,而是一个极小的范围 [x,x+dx],只要这个范围 dx 足够小:
- 在这个区间内,概率密度 p(x) 可以看作是常数。
- 这个微小区间内的真实概率就是 p(x)dx。
因为 X 和 Y 独立,“两事件同时发生的概率等于各自概率之积” 这个基本性质,在每一个微小区间上都成立:
联合微小概率p(x,y)dxdy=X 的微小概率[p(x)dx]×Y 的微小概率[p(y)dy]两边都有因子 dxdy,且 dx=0,dy=0,所以在代数上可以直接约去,从而得到密度函数之间的关系(常用的f就是这里的p):
p(x,y)=p(x)p(y)=f(x)f(y)
如果向量x各分量独立同分布且服从上述(1)一维标准高斯,那么有:
p(x)=i=1∏df(xi)=i=1∏d(2π1e−xi2/2)
p(x)=(2π)d/21exp(−21∥x∥2)(2)
p(x)就是D维标准高斯分布的联合概率密度函数,描述向量x在D维空间某点出现的概率密度。
证明方向在球面上均匀随机
明确我们要证明的是u=∣∣x∣∣x方向在球面上均匀随机。x是每个分向量都满足独立高斯分布的一个向量。
一个n维几何图形,整体尺寸放大k倍,它的n维测度(长度/面积/体积)放大kn。
- r=∣∣x∣∣:超球面半径
- du:超球面上的微小面积元
- dx:d维空间的体积微元
所以半径为r的超球面上的面积元放大为rD−1⋅du,那么可以得到:dx=rD−1dudr。
要证明方向在超球面上均匀随机,就是要证明p(u)和u无关,很明显需要求p(r,u)dr的积分,我们依据上述(2)式和前面的r=∣∣x∣∣、dx=rD−1dudr可以得到:
p(x)dx=(2π)d/21exp(−21∥x∥2)dx=(2π)d/21e−r2/2⋅rd−1drdu=p(r,u)drdu
p(r,u)=(2π)d/21⋅rd−1e−r2/2(3)
(3)式已经不包含u,因此p(r,u)dr的积分也显然与u无关,只与r有关,是常值。也就是方向在超球面上是均匀随机的,但是位置和r=∣∣x∣∣相关,大致集中在d−1附近(±21)。
步骤2:Epps-Pulley(EP)统计量:衡量一维分布差异
公式:
T(m)=∫−∞∞w(t)ϕN(t;h(m))−ϕ0(t)2dt
作用:量化「投影数据h(m)的经验分布」和「标准正态分布」的差距。
分项说明:
- 经验特征函数ECF ϕN(t;h)
特征函数是分布的等价表征,用来刻画分布形态:
ϕN(t;h)=N1Σn=1Neithn
N是样本总数;hn是第n个样本的一维投影值;i为虚数单位。它是从真实数据统计得到的特征函数。
-
目标特征函数ϕ0(t)
目标是标准正态N(0,1),其理论特征函数为ϕ0(t)=e−t2/2。
-
加权函数w(t)
示例:w(t)=e−2λ2t2,给不同频率t赋予权重,避免积分在t→∞发散,控制高频部分的权重。
-
整体含义
对所有频率t,加权累加「数据特征函数和高斯特征函数的平方差」。
T(m)越大,代表当前方向投影的分布离标准正态越远;T(m)→0代表一维投影完美符合标准正态。
-
工程上选取一定范围内的离散点的值相加替代积分运算。
步骤3:SIGReg总损失:多方向平均
SIGReg(Z)≜M1Σm=1MT(m)
对M个随机方向的EP损失取平均,作为最终正则损失。
步骤4:收敛保证(Cramér-Wold收敛关系)
Cramér-Wold 克拉默-沃尔德定理:
两个D维随机分布完全相同 ⟺ 这两个分布往任意一维方向投影得到的一维分布全部相同。
SIGReg(Z)→0⟺PZ→N(0,I)
当采样方向数M趋向无穷、SIGReg损失趋近0时,嵌入Z的整体分布弱收敛到各向同性高斯;
训练最小化SIGReg,等价于逼迫高维嵌入趋近球形高斯分布。