VISreg的核心理念是将表征分布的尺度与几何形状完全解耦,它不用单一的式子来评判表征分布的好坏。
LReg=λscaleLscale+λshapeLshape+λcenterLcenter
前置说明
- z∈RN×D:一批N样本、D维投影表征;
- Z^=z−μ:中心化表征,μ=N1∑i=1Nzi为批次均值;
- K:随机投影切片数量;
- Lscale,Lshape,Lcenter:分别是尺度损失、几何形状损失和中心化损失
- λ:正则项整体权重。
中心化损失
强制表征批次均值趋近原点,稳定分布偏移,加速收敛:
Lcenter=∥μ∥22=N1i=1∑Nzi22
消除表征整体偏移,降低尺度/形状优化压力,消融实验证明可小幅提升精度、大幅加快收敛。
尺度损失
对中心化表征Z^逐维约束标准差σj→1:
Lscale=D1j=1∑D(1−σj(Z^))2
σj(Z^)=N1∑i=1N(Z^i,j)2为第j维无偏标准差。
核心优势:当表征坍塌(所有维度σj→0),梯度趋近常数,持续提供修正信号;对比SIGReg坍塌梯度归零,能稳定把模型拉出坍缩区域。
形状损失
- 归一化解耦尺度:Z~=sg(σ)+ϵZ^,ϵ=10−8 防止除零;
- 生成K个随机单位投影方向矩阵W∈RD×K (列向量每个位置高斯随机采样后整体归一化),投影得到K组一维样本:P=Z~W∈RN×K
Cramér-Wold定理:高维分布等价,当且仅当沿所有随机一维方向的投影分布完全一致。
前面几步和 SIGreg 基本一致,因为都利用 Cramér-Wold定理。但是注意这里第一步截断了梯度,这是为了让形状损失仅优化分布几何,完全不影响各维度标准差(尺度)。这是VISReg区别于SIGReg的关键设计。
但是VISreg让分布等价的方式有点不同,先理解这个 P 的每个列向量,它表示N组D维表征在一个方向上的N个投影值。
- 逐列升序排序sort(P,dim=0);
- 构造标准高斯目标分位数:u=N+11,2,…,N,qN=Normal(0,1).icdf(u);
icdf是逆累积分布函数,输入概率,输出标准正态下对应数值(分位数)。下图中的p和x。

- 计算所有切片的平均W22:
Lshape=K1k=1∑Ksort(Z~wk)−qN22
W2叫二阶Wasserstein距离,听起来高级,其含义就是从一个分布到另一个分布的最小运输方案(距离)。这里的W22其实就是算MSE。
这4-6步其实就是希望N组表征在所有投影上都满足正态分布,强制分布趋近各向同性高斯。
VISreg、SIGreg和Expanding SHERE-JEPA的对比说明
SIGreg和VISreg都包含一步就是投影到一维向量上,让损失去推动N组表征在K个方向上都正态分布。因为超球面均匀分布就是正态分布的,见SIGreg当中的推导。
而Expanding SPHERE-JEPA是直接把表征按到单位球上,让损失去推动它们符合均球面均匀分布的各种数学特征。