arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-04 至 2026-08-04 共收录 159 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 4 篇

2606.20389 2026-08-04 cs.RO 版本更新 83%

CoLI: A Reproducible Platform for Continuum Robot Learning via Monolithic 3D Printing and Isomorphic Teleoperation

CoLI: 通过整体3D打印和同构遥操作实现连续体机器人学习的可复现平台

Ziyuan Tang, Chenxi Xiao

机构 * School of Information Science and Technology at ShanghaiTech University(上海科技大学信息科学与技术学院)

专题命中 机器人学习 :robot learning(title);robotics(abstract);manipulation(abstract);分类 cs.RO

AI总结 提出一种基于多材料3D打印和同构遥操作的连续体机器人平台,简化制造流程并实现无奇异映射控制,支持模仿学习自主控制,通过硬件表征和操作任务验证其可复现性和学习就绪性。

Comments 8 pages, 7 figures, 1 table, accepted by IROS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00725 2026-08-04 cs.RO 新提交 70%

SelfWAM: A Self-Grounded Unified World Action Model for Fast Robot Control

SelfWAM:一种用于快速机器人控制的自 grounded 统一世界动作模型

Bikang Pan, Fan Liu, Haotao Lu, Jingya Wang, Ye Shi

专题命中 机器人学习 :manipulation(abstract);robot policy(abstract);分类 cs.RO

AI总结 SelfWAM是一种基于MoT架构的统一自 grounded WAM,通过联合预测动作等改进机器人控制,在RoboTwin 2.0等实验中提升了策略性能与推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01851 2026-08-04 cs.RO cs.AI 新提交 62%

Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills

权重还是技能?机器人学习技术综述:从动作预测权重到自主编写技能的机器人

Gaytri Jena, Kapil Wanaskar, Vinija Jain, Aman Chadha, Vasu Sharma, Amitava Das

专题命中 机器人学习 :robot learning(abstract);分类 cs.RO、cs.AI

AI总结 本综述围绕机器人学习的“权重vs技能”轴,梳理两类技术的分类、自我提升机制与开放问题,考察77个代表性系统,为机器人学习领域提供分析框架。

Comments 40 pages, 11 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28394 2026-08-04 cs.CV 版本更新 57%

Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer

大基础模型时代的手物交互:重建、生成与具身迁移

Weiquan Lin, Yu Deng, Shiyang Liu, Luping Xiao, Xu Tang, Junzhi Yu, Jiaolong Yang, Lei Zhang, Xingyu Chen

专题命中 机器人学习 :robot learning(abstract);分类 cs.CV

AI总结 本综述系统梳理大基础模型在手物交互(HOI)领域的应用,建立基础模型子先验分类,分析其在HOI任务与机器人学习中的作用,总结数据集与评估协议并展望未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 57 篇

2604.19522 2026-08-04 cs.RO 版本更新 91%

GenerativeMPC: VLM-RAG-guided Whole-Body MPC with Virtual Impedance for Bimanual Mobile Manipulation

GenerativeMPC:基于VLM-RAG的全身体姿MPC与虚拟阻抗的双臂移动 manipulation

Marcelino Julio Fernando, Miguel Altamirano Cabrera, Jeffrin Sam, Yara Mahmoud, Konstantin Gubernatorov, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory(智能空间机器人实验室) Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所)

专题命中 机器人操作 :manipulation(title,title_cn);navigation(abstract);分类 cs.RO

AI总结 本文提出GenerativeMPC框架,通过VLM-RAG将语义理解与物理控制参数结合,实现双臂移动 manipulation的高效安全控制,实验表明在近人区域速度降低60%并实现安全社交导航。

Comments 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32027 2026-08-04 cs.RO cs.AI cs.LG 版本更新 89%

Freeform Preference Learning for Robotic Manipulation

自由形式偏好学习用于机器人操作

Marcel Torne, Anubha Mahajan, Abhijnya Bhat, Chelsea Finn

机构 * Stanford University(斯坦福大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title);robot policy(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出自由形式偏好学习(FPL),通过自然语言定义偏好轴并学习语言条件奖励模型,在长时域操作任务中比稀疏奖励和二元偏好方法提升38个百分点,支持行为组合与测试时策略引导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01381 2026-08-04 cs.RO 新提交 88%

DreamTrajectory: Trajectory-Guided Action Generation with World Model Alignment for Mobile Manipulation

DreamTrajectory:面向移动操作的、结合世界模型对齐的轨迹引导动作生成方法

Zheng Yang, Wenjie Zhang, Xiangyu Chen, Wenxuan Song, Xianpeng Wang, Yihang Kang, Wen Chen, Lujia Wang, Renjing Xu, Xiaowen Chu

专题命中 机器人操作 :manipulation(title,abstract);world model(title,abstract);分类 cs.RO

AI总结 DreamTrajectory是面向移动操作的轨迹引导框架,通过联合预测末端执行器轨迹与全身动作块、结合轨迹世界模型的测试时细化,在MS-HAB及真实任务中大幅提升操作成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02104 2026-08-04 cs.RO 版本更新 88%

ACDC: Adaptive Curriculum Planning with Dynamic Contrastive Control for Goal-Conditioned Reinforcement Learning in Robotic Manipulation

ACDC:基于动态对比控制的自适应课程规划用于机器人操控的面向目标强化学习

Xuerui Wang, Guangyu Ren, Tianhong Dai, Bintao Hu, Shuangyao Huang, Wenzhang Zhang, Hengyan Liu

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO

AI总结 本文提出ACDC方法,结合自适应课程规划与动态对比控制,提升机器人操控任务中的样本效率和任务成功率。

Comments Withdrawn by the authors after identifying inconsistencies between the described adaptive curriculum and the implementation used to generate the reported experiments, particularly in the success-rate feedback mechanism and replay-weight schedule. These issues require the experiments and conclusions to be reevaluated

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18494 2026-08-04 cs.RO 版本更新 88%

MemoAct: Atkinson-Shiffrin-Inspired Hierarchical Memory-Augmented Policy for Robotic Manipulation

MemoAct:受Atkinson-Shiffrin启发的内存增强视觉-运动策略用于机器人操作

Liufan Tan, Jiale Li, Gangshan Jing

机构 * Chongqing University(重庆大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO

AI总结 本文提出MemoAct,一种基于层次内存的策略,通过不同内存层级解决任务状态跟踪和长周期记忆保留的问题,并通过MemoryRTBench验证其在模拟和现实场景中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01083 2026-08-04 cs.RO 新提交 86%

Sparse Meets Dense: Correspondence Guided Robotic Manipulation with Rigid-Deformable Interactions

稀疏与稠密结合:基于对应关系的刚-柔交互机器人操纵方法

Ziyu Zhu, Yue Chen, Xirui Liang, Hojin Bae, Yuran Wang, Zhen Yuan, Ruihai Wu, Hao Dong

机构 * School of Computer Science, PKU(北京大学计算机学院) School of EECS, PKU(北京大学电子工程与计算机科学学院) CFCS(计算与数字科学中心)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title);分类 cs.RO

AI总结 针对刚-柔交互操纵任务,提出混合对应关系表征方法,结合稀疏关键点与稠密对应关系,实现少量演示下的新任务一次性迁移,实验验证其有效性与适用性。

Comments ICRA 2026 conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01733 2026-08-04 cs.RO 新提交 85%

TWINS: A Tactile Wearable Isomorphic Arm Networked System for Contact-Rich Manipulation Learning

TWINS:用于接触丰富操作学习的触觉可穿戴同构臂联网系统

Takahide Kitamura, Masaki Murooka, Natsuki Yamanobe, Yukiyasu Domae

机构 * National Institute of Advanced Industrial Science and Technology (AIST)(独立行政法人产业技术综合研究所(AIST))

专题命中 机器人操作 :manipulation(title,abstract);robot learning(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出TWINS触觉可穿戴同构臂联网系统,用于解决现有机器人难以完成身体表面接触操作的问题,通过采集演示数据训练模仿学习策略,实现了身体表面触觉引导的接触丰富操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15257 2026-08-04 cs.RO 版本更新 83%

HapticVLA: Contact-Rich Manipulation via Vision-Language-Action Model without Inference-Time Tactile Sensing

HapticVLA:通过视觉-语言-动作模型实现接触丰富的操作,无需推理时触觉感知

Konstantin Gubernatorov, Mikhail Sannikov, Ilya Mikhalchuk, Egor Kuznetsov, Makar Artemov, Ogunwoye Faith Oluwatobi, Marcelino Fernando, Artem Asanov, Ziang Guo, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Skolkovo Institute of Science and Technology(智能空间机器人实验室,斯克洛夫科学与技术研究所)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 HapticVLA通过视觉-语言-动作模型实现接触丰富的操作,无需触觉传感器,在现实实验中成功率达到86.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11655 2026-08-04 cs.RO 版本更新 83%

Concurrent Prehensile and Nonprehensile Manipulation: A Practical Approach to Multi-Stage Dexterous Tasks

并行抓取与非抓取操作:多阶段灵巧任务的实用方法

Hao Jiang, Yue Wu, Yue Wang, Gaurav S. Sukhatme, Daniel Seita

专题命中 机器人操作 :manipulation(title,abstract);robotics(abstract);分类 cs.RO

AI总结 本文提出DexMulti方法,通过分解示范为以物体为中心的技能,实现高效多阶段灵巧任务操作,在实际测试中达到66%的成功率,优于基线方法。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01452 2026-08-04 cs.RO cs.CV cs.LG 新提交 82%

DynamicManip: Enabling Dynamic Manipulation from a Single Static Demonstration

DynamicManip:基于单个静态演示实现动态操作

Haoran Liao, Pengyue Wang, Shuoyu Chen, Kehan Cheng, Xuhang Chen, Yuhao Lin, Mu Lin, Zhizhao Liang, Xiaoyi Fan, Chengyi Xing, Dan Niu, Yi-Lin Wei, Wei-Shi Zheng

机构 * Sun Yat-sen University(中山大学) Stanford University(斯坦福大学) Southeast University(东南大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出DynamicManip,通过静态转动态数据增强流水线、动态感知自适应策略及动态操作基准,解决机器人动态操作的数据效率与实时性问题,实验显示其性能显著优于现有方法。

Comments Project page: https://liaohr9.github.io/DynamicManip/ Code: https://github.com/liaohr9/DynamicManip

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00568 2026-08-04 cs.LG cs.AI 新提交 81%

Fairness Auditing: Lower Bounds on Company Manipulation

公平性审计:公司操纵的下界

Rachit Verma, Padala Manisha, Sujit Gujar

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究将公平性审计建模为公司与审计员的极小极大优化,推导了两种审计机制下审计后人口统计 parity 偏差的下界,实证显示增加审计资源无法消除审计后操纵。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18557 2026-08-04 cs.CV cs.GR cs.RO 版本更新 81%

SynAgent: Generalizable Cooperative Humanoid Manipulation via Solo-to-Cooperative Agent Synergy

SynAgent:通过独狼到协作代理协同实现通用化的人形机器人操作

Wei Yao, Haohan Ma, Hongwen Zhang, Liangjun Xing, Zhile Yang, Yuanjun Guo, Yunlian Sun, Yebin Liu

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Department of Automation, Tsinghua University(清华大学自动化系) College of Artificial Intelligence, Nanjing Forestry University(南京林业大学人工智能学院)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出SynAgent框架,通过独狼到协作代理协同转移单agent人-物体交互技能,实现可扩展且物理合理的协作操作,实验显示其在协作模仿和轨迹条件控制方面优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01824 2026-08-04 cs.RO 新提交 79%

ReTouch: Empowering Contact-Rich Dexterous Manipulation with Online-Refined Tactile Prediction

ReTouch:利用在线优化的触觉预测实现接触丰富的灵巧操作

Shiqi Zhang, Xin Zhang, Yedong Shen, Jiajun Deng, Yuxuan Gao, Sha Zhang, Yuan Zhang, Kaixue Long, Jiajia Wu, Jia Pan, Yao Li, Yanyong Zhang

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 本研究提出视觉-语言-动作模型ReTouch,通过在线优化触觉预测实现接触丰富的灵巧操作,在真实机器人实验中,其平均成功率较最强基线提升18.4至23.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01102 2026-08-04 cs.RO 新提交 79%

CAAT: Contact-Aware Attention Scaling and Tactile Masking for Data-Efficient Contact-Rich Manipulation

CAAT:用于数据高效接触丰富型操作的接触感知注意力缩放与触觉掩码方法

Jiaming Jiang, Yuzhe Huang, Hao Liang, Pei Lin, Shengcheng Luo, Fanrong Dong, Jiaping Wu, Chenxi Xiao, Wanlin Li, Ziyuan Jiao

机构 * ShanghaiTech University(上海科技大学) Beihang University(北京航空航天大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Zhejiang University(浙江大学) BUPT(北京邮电大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 该研究针对接触丰富型操作中视觉-触觉策略缺乏接触感知先验的问题,提出CAAT框架,通过注意力缩放和动态触觉掩码提升策略性能,在仿真和真实实验中均显著优于现有方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00208 2026-08-04 cs.RO 新提交 79%

Developing Combined Manipulation and Locomotion Skills with Interaction Representation and Skill Composition

基于交互表征与技能组合开发操作与运动技能

Fanxing Meng, Jing Xiao

机构 * Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 本文提出方法使人形机器人基于发育原理学习抓取、起身等策略,通过手-物交互得分组合策略,实现抓取未见过物体零样本成功率93%、持物起身成功率96%-100%。

Comments 8 pages, 5 figures. Submitted to Humanoids 2026. Video available at https://youtu.be/x-7x89fSJWY

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29517 2026-08-04 cs.RO 版本更新 79%

CORE: Common Outcome Regularities from Action-Free Visual Demonstrations for Robot Manipulation

CORE: 从无动作视觉演示中提取机器人操作的共同结果规律

Juyi Sheng, Mingxin Tan, Jincheng Li, Mengyuan Liu

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 提出CORE框架,从无动作视觉演示中提取共同结果规律作为视觉目标原型,注入机器人策略提升操作成功率,在多个基准上平均提升3.9至17.0个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14606 2026-08-04 cs.RO cs.SY eess.SY 版本更新 79%

Interaction Dynamics for Dexterous Manipulation

用于灵巧手控制的阻抗MPC与扰动估计

Yongyan Cao

机构 * Voryx Robotic LLC(Voryx机器人有限公司)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 提出一种执行器无关的阻抗模型预测控制框架,通过代数前馈将肌腱传动简化为常系数双积分器,结合编码器增强卡尔曼扰动估计,实现高精度轨迹跟踪与安全接触力控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09246 2026-08-04 cs.CR 版本更新 78%

Practical Spoofing Attacks against Galileo OSNMA with Time-Synchronization Manipulation

通过时间同步操纵对伽利略OSNMA实施的实用欺骗攻击

Haiyang Wang, Yuanyu Zhang, Yangke Tan, Ji He, Shuangtrui Zhao, Ning Xi, Yulong Shen

专题命中 机器人操作 :manipulation(title);navigation(abstract)

AI总结 该研究针对启用OSNMA的伽利略接收机,提出三种符合时间同步要求的欺骗攻击,通过操纵本地参考时间迫使接收机满足时间同步,结合重放或伪造信号实现欺骗,实验验证攻击可成功通过OSNMA认证。

Comments 10 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21429 2026-08-04 cs.LG cs.AI cs.SY eess.SY math.OC 版本更新 73%

Provably Safe Generative Sampling with Constricting Barrier Functions

具有约束屏障函数的可证明安全生成采样

Darshan Gadginmath, Ahmed Allibhoy, Fabio Pasqualetti

机构 * Mechanical Engineering University of California, Riverside(机械工程 加州大学河滨分校) Electrical Engineering and Computer Science University of California, Irvine(电气工程与计算机科学 加州大学伊尔弗分校)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.LG

AI总结 通过约束屏障函数实现安全生成采样,确保生成样本满足硬约束并保持语义保真度。

Comments 26 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03270 2026-08-04 cs.RO cs.AI 版本更新 73%

Grounded Vision-Language Interpreter for Long-Horizon Bimanual Task and Motion Planning

用于长 horizon 双臂任务与运动规划的接地视觉语言解释器

Jeremy Siburian, Keisuke Shirai, Cristian C. Beltran-Hernandez, Masashi Hamaya, Michael Görner, Atsushi Hashimoto

机构 * OMRON SINIC X Corporation(OMRON SINIC X公司) The University of Tokyo(东京大学) University of Hamburg(汉堡大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对现有视觉语言机器人规划框架的黑箱缺陷与双臂任务探索不足问题,提出混合规划框架 ViLaIn-TAMP,经烹饪领域任务及实际双臂机器人系统验证,其性能优于基准方法。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02242 2026-08-04 cs.NI 新提交 71%

When Discovery Becomes a Storm: A ROS 2 Discovery Model for Wireless Robotic Networks

当发现成为风暴:面向无线机器人网络的ROS 2发现模型

Yeonwoo Choi, Sanghoon Lee, Kyung-Joon Park

专题命中 机器人操作 :robotic(title)

AI总结 针对无线机器人网络中ROS 2的发现风暴问题,提出闭环分析模型并验证,设计响应感知策略将平均发现完成时间降低25.3%至39.7%。

Comments 10 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00618 2026-08-04 physics.optics 新提交 71%

Generation and manipulation of multipole and vortex events in (1+1)-dimensional spacetime

(1+1)维时空中多极与涡旋事件的产生与操控

Yiming Pan, Guowei Chen

专题命中 机器人操作 :manipulation(title)

AI总结 该研究在非线性光子时空晶体中,通过能量-动量隙与克尔自陷效应,产生并操控出具有可控内部自由度的多极与涡旋事件,为非线性介质的波操控提供了新途径。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02197 2026-08-04 cs.RO 新提交 70%

Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models

关注关键区域:面向视觉-语言-动作模型的自适应视觉细化

Jin Cui, Yanbin Hu, Xinyue Long, Linkai Li, Boran Zhao, Pengju Ren

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 针对VLA模型视觉表示不可靠的问题,提出AtVLA框架,结合注意力校正与不确定性门控局部细化,在多基准测试中显著提升机器人操作成功率且计算开销可控。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00554 2026-08-04 cs.RO cs.AI cs.CV 新提交 67%

DexMani: Human-Derived Manipulability Guidance for Dexterous Rotation

DexMani:用于灵巧旋转的人类衍生可操作度引导

Xiaoyang Chen, Shengcheng Luo, Haoran Guo, Jiaming Jiang, Wanlin Li, Ziyuan Jiao, Chenxi Xiao

专题命中 机器人操作 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 DexMani框架通过迁移人类演示的接触条件可操作度演化引导强化学习,在多款机器人手上实现了更高的物体旋转成功率与更平稳的运动,且可跨本体迁移技能。

Comments 16 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16478 2026-08-04 cs.GR 版本更新 67%

Fast and Reliable Gradients for Deformables Across Frictional Contact Regimes

快速且可靠的变形体梯度在摩擦接触范围内

Ziqiu Zeng, Gang Yang, Zhenhao Huang, Bingyang Zhou, Yulin Li, Jason Pho, Siyuan Luo, Fan Shi

专题命中 机器人操作 :robotics(abstract);manipulation(abstract)

AI总结 本文提出了一种统一的全GPU加速可微模拟器,通过长期一致性、统一接触稳定性以及鲁棒材料识别方法,解决了摩擦接触问题中的梯度不稳定性问题,提升了物理系统识别和控制的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01899 2026-08-04 cs.CV cs.CL cs.LG 新提交 62%

SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models

SpatioLM:面向视觉-语言模型的通用物理空间智能

Jing Wu, Jianhua Wu, Jiayi Guan, Jiahong Chen, Jinghui Lu, Hangjun Ye, Bingzhao Gao, Long Chen

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV、cs.LG

AI总结 SpatioLM是一种参数高效的视觉-语言模型,通过内置空间视觉模块和伪深度、相机监督提升空间智能,在VSI-Bench获71.6分,还可迁移至具身操纵任务,同时保留通用能力。

Comments 27 pages,13 figures,16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏