从两篇论文聊聊多模态世界模型

#WM#JEPA 共 458 字 约 2 分钟

第一篇是FeelWorld,提出了一套方法把不同模态的编码器融合到一起,如图所示:

FeelWorld架构设计

比较有人工“先验”的设计(这类设计往往有利于提升模型效果、加快收敛)包括:

  1. 三种对于接触的描述:接触状态、3D触觉隐变量、滑动状态
  2. 视觉和触觉隐变量的关系:触觉始终吸收视觉特征(没接触时不那么轻易被异常值干扰),视觉特征仅在预测到接触时融合触觉特征

第二篇是UniJEPA

这篇比较缝,几乎就是LeWM加了V-JEPA,整合一下视频数据和图像数据,让encoder和predictor同时训练。这样encoder和predictor网络也具备光照的处理能力。(论文里面的图不直观,像是刻意避嫌)

整体上多模态融合的JEPA相关工作并不多,加上之前的PSG-JEPA。也有Le Mumo JEPA这样更改encoder网络来容纳多种模态的计算机方向工作。每一篇思路都独一无二,没有出现特定的趋势。

个人认为FeelWorld这篇门控的思路是非常好的,多模态的信息一定存在互补,但是也要注意到多模态信息可能存在的冗余,利用这些冗余或许可以做一些交叉验证。