arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-23 至 2026-07-23 共收录 4 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 4 篇

2607.19876 2026-07-23 cs.RO cs.CV 新提交 84%

KineBench: Benchmarking Embodied World Models via IDM-Free Kinematic Grounding

KineBench:通过无逆动力学模型的运动学基础对具身世界模型进行基准测试

Zeyu Liu, Zhangzhe Zhu, Yang Zhang, Chenyou Fan, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Tsinghua University(清华大学) Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 研究旨在评估具身世界模型物理一致性,提出无逆动力学模型的KineBench基准测试。利用级联视觉基础模型提取姿态,在物理模拟器中闭环验证,纳入运动学指标,基于ManiSkill3的任务评估EWMs,揭示任务复杂度受限的非线性缩放,为数据缩放策略提供指导。

Comments Accept to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02473 2026-07-23 cs.CV cs.LG 版本更新 84%

WorldPack: Dynamic Frame Compression for Long-context Video World Modeling

WorldPack:用于长上下文视频世界建模的动态帧压缩

Yuta Oshima, Yusuke Iwasawa, Masahiro Suzuki, Yutaka Matsuo, Hiroki Furuta

机构 * The University of Tokyo(东京大学) Google DeepMind(谷歌DeepMind)

专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.CV、cs.LG

AI总结 研究针对长上下文视频世界建模中时空一致生成的挑战,提出WorldPack视频世界模型,通过轨迹打包和几何选择机制,基于3D空间相关性动态分配压缩率,扩展有效上下文,在相关数据集上优于基线,提升空间推理任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19809 2026-07-23 cs.MA cs.LG 新提交 79%

Dreamer-CPC: Message Learning with World Models for Decentralized Multi-agent Reinforcement Learning

Dreamer-CPC:用于去中心化多智能体强化学习的基于世界模型的消息学习

Taisuke Takayama, Naoto Yoshida, Tadahiro Taniguchi

机构 * Graduate School of Informatics, Kyoto University, Kyoto, Japan(京都大学信息学研究生院) Research Organization of Science and Technology, Ritsumeikan University, Shiga, Japan(立命馆大学科学技术研究机构)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 研究针对多智能体强化学习中通信问题,提出Dreamer-CPC方法,将基于CPC的消息学习集成到DreamerV3世界模型,各智能体据此独立维护模型与模块并交换消息,实验表明该方法在多种环境下优于现有方法,能有效支持去中心化决策。

Comments 15 pages, 6 figures. Under review at ICONIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19889 2026-07-23 cs.CV 新提交 70%

LAVIFT: Latent-Action-Guided Vision Fine-Tuning for Surgical Interaction Recognition

LAVIFT:用于手术交互识别的潜在动作引导视觉微调

Jiajun Cheng, Subarna Tripathi, Sainan Liu, Xiaofan Yu, Shan Lin

机构 * Arizona State University(亚利桑那州立大学) University of California, Merced(加州大学默塞德分校) Intel Corporation(英特尔公司)

专题命中 具身推理 :world model(abstract);robotic(abstract);分类 cs.CV

AI总结 研究针对手术交互识别中预训练模型适应细粒度交互的挑战,提出LAViFiT框架,通过逆动力学模型、前向世界模型及补丁级SIG正则化器,实现视觉语言微调,提升了识别率和图像-文本对齐,增强了特征基础和空间连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏