What do VLM-Based Vision-Language Navigation Models Rely on: Interpreting and Steering Policy Behavior
研究通过干预度量方法探讨基于VLM的视觉-语言导航模型如何利用视觉观察、指令和视觉记忆进行决策,并展示这些模型能够编码导航进度并保留语义结构。
0 citationsRead paper
研究通过干预度量方法探讨基于VLM的视觉-语言导航模型如何利用视觉观察、指令和视觉记忆进行决策,并展示这些模型能够编码导航进度并保留语义结构。
该研究解决了3D场景图中不确定性表示和传播问题,通过引入概率场景图(PSG)及高斯层次图(HGG),实现了实时感知与精确定位。
本文提出了一种具有自适应世界记忆机制的3D基础模型,用于解决大规模3D建图、定位和渲染问题,通过结合门控更新与时空调节来提高模型的持久性和可扩展性。
研究通过结合大语言模型和规则基础设计创建了带有幻灯片的语音维基百科语料库,以提高多模态自动语音识别性能。
为解决7-DoF末端执行器控制中细粒度动作预测不准确问题,提出DUET-DINO模型,通过同时从侧视和腕部相机视角学习动作条件预测,提高机器人操作中的潜在规划性能。
研究通过干预度量方法探讨基于VLM的视觉-语言导航模型如何利用视觉观察、指令和视觉记忆进行决策,并展示这些模型能够编码导航进度并保留语义结构。
该研究解决了3D场景图中不确定性表示和传播问题,通过引入概率场景图(PSG)及高斯层次图(HGG),实现了实时感知与精确定位。
本文提出了一种具有自适应世界记忆机制的3D基础模型,用于解决大规模3D建图、定位和渲染问题,通过结合门控更新与时空调节来提高模型的持久性和可扩展性。
研究通过结合大语言模型和规则基础设计创建了带有幻灯片的语音维基百科语料库,以提高多模态自动语音识别性能。
为解决7-DoF末端执行器控制中细粒度动作预测不准确问题,提出DUET-DINO模型,通过同时从侧视和腕部相机视角学习动作条件预测,提高机器人操作中的潜在规划性能。