像素中有光照、纹理、相机运动等干扰。模型不重建像素,而是预测 V-JEPA2 的 latent state。只有当目标编码器对某些外观变化具有不变性时,这种训练才会相应弱化这些变化的影响;JEPA 本身不自动保证“所有 embedding 都是语义”。
VLA-JEPA 方法详解
未经允许不得转载:小狮博客 » VLA-JEPA 方法详解
像素中有光照、纹理、相机运动等干扰。模型不重建像素,而是预测 V-JEPA2 的 latent state。只有当目标编码器对某些外观变化具有不变性时,这种训练才会相应弱化这些变化的影响;JEPA 本身不自动保证“所有 embedding 都是语义”。