arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-29 至 2026-06-29 共收录 70 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 11 篇

2606.27656 2026-06-29 eess.SY cs.RO cs.SY 新提交 57%

Characterizing Driver Interactions with Autonomous Vehicles via Response Maps

通过响应图刻画驾驶员与自动驾驶车辆的交互

Dave Broaddus, Rachel DiPirro, Chishang, Yang, Dan Calderone, Wendy Ju, Meeko Oishi

机构 * University of New Mexico(新墨西哥大学) Cornell Tech(康奈尔科技)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文基于博弈论中的响应图概念,利用驾驶模拟器数据线性表示驾驶员行为,发现驾驶员加速行为可被响应图捕获,且对自动驾驶车辆的让行、不让行和响应行为有显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23959 2026-06-29 cs.CL cs.LG 新提交 57%

Does My Embedding Reflect That $A = B$? Evaluating Mathematical Equivalence in Embedding Models

我的嵌入是否反映了 $A = B$?评估嵌入模型中的数学等价性

Jiaying Ye, Samarth Rao, Leo Carlin, Kedar Chintalapati, Saharsh Bhargava, Rachit Jaiswal, Michael Zhou, Jared Darlington, Jiahe Lu, Jarod Alper, Vasily Ilin, Henry Kvinge

机构 * University of Washington(华盛顿大学) Axiom Math Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 具身导航 :navigation(abstract);分类 cs.LG

AI总结 针对当前嵌入模型无法识别数学等价陈述的问题,提出MELD数据集和对比学习方法,使嵌入能对齐不同形式化的数学表述。

Comments 18 pages, comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27865 2026-06-29 cs.IR 新提交 50%

From Bootstrapping to Sequence Modeling: A Unified Generative Framework for Personalized Landing-Page Modeling

从引导到序列建模:个性化落地页建模的统一生成框架

Fan Li, Chang Meng, Jiaqi Fu, Shuchang Liu, Tianke Zhang, Xueliang Wang, Xiaoqiang Feng, Yongqi Liu, Kaiqiao Zhan

专题命中 具身导航 :navigation(abstract)

AI总结 针对现有强化学习方法在个性化落地页建模中的马尔可夫假设局限和时序差分学习误差累积问题,提出基于决策变换器的统一生成框架GLAN,通过全局-局部视角建模用户跨日消费动态和会话级细粒度信号,在快手平台上线后DAU和用户生命周期分别提升0.158%和0.108%。

Comments arXiv admin note: text overlap with arXiv:2507.23459

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 7 篇

2510.16732 2026-06-29 cs.CV 版本更新 89%

A Comprehensive Survey on World Models for Embodied AI

具身AI世界模型综述

Xinqing Li, Xin He, Le Zhang, Min Wu, Xiaoli Li, Yun Liu

机构 * College of Computer Science and the Academy for Advanced Interdisciplinary Studies, Nankai University(南开大学计算机科学学院与前沿交叉学科研究院) School of Computer Science and Engineering, Tianjin University of Technology(天津理工大学计算机科学与工程学院) School of Information and Communication Engineering, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院) Institute for Infocomm Research (I2R), Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局资讯通信研究院) Information Systems Technology and Design (ISTD) Pillar, Singapore University of Technology and Design (SUTD)(新加坡科技设计大学信息系统科技与设计系)

专题命中 具身推理 :embodied AI(title,abstract);world model(title,abstract);robotics(abstract);分类 cs.CV

AI总结 本文系统综述了具身AI中的世界模型,提出了功能、时间建模和空间表示的三轴分类法,并总结了数据资源、评估指标及开放挑战。

Comments https://github.com/Li-Zn-H/AwesomeWorldModels

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27575 2026-06-29 cs.CV 新提交 85%

Perceptual 3D Simulation With Physical World Modeling

基于物理世界建模的感知3D仿真

Wanhee Lee, Klemen Kotar, Rahul Mysore Venkatesh, Jared Watrous, Daniel L. K. Yamins

机构 * Stanford University(斯坦福大学)

专题命中 具身推理 :world model(title,abstract);robotics(abstract);manipulation(abstract);分类 cs.CV

AI总结 提出P3Sim系统,结合学习型物理世界模型、几何条件模块和持久场景记忆,在部分观测和不完整3D变换信号下模拟未来场景状态,实现多任务泛化。

Comments Published as a conference paper at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05092 2026-06-29 cs.RO cs.AI cs.CV 版本更新 82%

Driver-WM: A Driver-Centric Traffic-Conditioned Latent World Model for In-Cabin Dynamics Rollout

Driver-WM:以驾驶员为中心的交通条件潜在世界模型用于车内动态展开

Haozhuang Chi, Daosheng Qiu, Hao Su, Haochen Liu, Zirui Li, Haoruo Zhang, Chen Lv

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Hubei University, Wuhan, China(湖北大学,武汉,中国) Osaka University, Osaka, Japan(大阪大学,大阪,日本)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出Driver-WM,一种以驾驶员为中心的潜在世界模型,通过门控因果注入机制在紧凑潜在空间中联合预测驾驶员物理运动、行为和情感,实现外部交通到内部动态的因果展开。

Comments Accepted to the 19th European Conference on Computer Vision (ECCV 2026). This version includes the supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28127 2026-06-29 cs.CL cs.AI cs.LG 新提交 81%

From Tokens to States: LLMs as a Special Case of World Models and the Continuous Path Beyond

从令牌到状态:LLM作为世界模型的特例及其连续路径

Paul Dubois

机构 * Paul Dubois(保罗·杜博伊斯)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文论证LLM是世界模型的退化特例,并提出从NTP到JEPA的连续谱系,逐步放松LLM约束,同时探讨其可扩展性挑战。

Comments 10 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27681 2026-06-29 cs.LG cs.CL 新提交 79%

Textual Belief States for World Models: Identifiable Representation Learning Under Strict Mediation

用于世界模型的文本信念状态:严格中介下的可识别表示学习

Xiang Gao, Kaiwen Dong, Yuguang Yao, Padmaja Jonnalagedda, Kamalika Das

机构 * Intuit AI Research(Intuit AI研究)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 提出严格中介原则解决LLM中历史旁路导致的潜在状态不可识别问题,引入离散文本潜在状态和因子化GRPO方法,在TextWorld和ScienceWorld上实现表示质量和滚动性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27644 2026-06-29 cs.CV 新提交 79%

CascadeOcc: Rethinking 3D Occupancy World Models with Cascaded VQ Representations

CascadeOcc: 用级联VQ表示重新思考3D占用世界模型

Kyumin Hwang, Wonhyeok Choi, Jaeyeul Kim, Jihun Park, Daehee Park, Sunghoon Im

机构 * Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出CascadeOcc,一种通过级联向量量化机制在自回归框架中利用占用表示内在结构层次,实现从粗到细的3D场景预测和运动规划,在4D占用预测和运动规划基准上取得优越性能。

Comments Accepted to IEEE Signal Processing Letters (SPL), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26964 2026-06-29 cs.AI cs.CV 新提交 73%

Look-Before-Move: Narrative-Grounded World Visual Attention in Dynamic 3D Story Worlds

Look-Before-Move:动态3D故事世界中的叙事驱动世界视觉注意力

Jiaming Bian, Bingliang Li, Yuehao Wu, Pichao Wang, Zhi Wang, Hailan Ma, Huadong Mo, Zhenhong Sun

专题命中 具身推理 :embodied AI(abstract);world model(abstract);分类 cs.AI、cs.CV

AI总结 提出Look-Before-Move框架,通过语义观察合约、蒙特卡洛视点搜索和语义轨迹接地,在动态3D故事世界中实现叙事驱动的视觉注意力规划,提升主体感知、意图一致性和轨迹质量。

Comments 25 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 7 篇

2606.27872 2026-06-29 cs.RO cs.AI 新提交 84%

S$^2$-VLA: State-Space Guided Vision-Language-Action Models for Long-Horizon Manipulation

S$^2$-VLA:面向长时程操作的基于状态空间的视觉-语言-动作模型

Zhipeng Xie, Zongyi Han, Xiangyi Wei, Shiliang Sun, Yang Li, Jing Zhao

机构 * School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) State Key Laboratory of Submarine Geoscience, School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院海底科学国家重点实验室)

专题命中 机器人基础模型 :manipulation(title,abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对长时程操作任务中累积误差导致性能下降的问题,提出S$^2$-VLA框架,通过状态空间引导的自适应注意力机制动态融合视觉、语言和动作信息,在LIBERO等基准上超越7B模型。

Comments Accepted to IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18610 2026-06-29 cs.RO cs.CV 新提交 84%

SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation

SC3-Eval: 通过自洽视频生成评估机器人基础模型

Wei-Cheng Tseng, Gashon Hussein, Yuzhu Dong, Allen Z. Ren, Lucy X. Shi, XuDong Wang, Sergey Levine, Zhaoshuo Li, Jinwei Gu, Florian Shkurti, Ming-Yu Liu, Quan Vuong

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) NVIDIA(英伟达) Physical Intelligence Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) Allen Institute for AI(艾伦人工智能研究所)

专题命中 机器人基础模型 :robot foundation model(title);manipulation(abstract);world model(abstract);分类 cs.RO、cs.CV

AI总结 提出SC3-Eval方法,利用前向-反向动力学一致性、跨视角一致性和测试时一致性,将预训练视频基础模型转化为准确的策略评估器,在7个真实世界策略上达到0.929的皮尔逊相关系数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27755 2026-06-29 cs.RO cs.AI 新提交 73%

Drop-Then-Recovery: How Redundant Are Vision-Language-Action Models?

丢弃-再恢复:视觉-语言-动作模型有多冗余?

Guoheng Sun, Kaixi Feng, Shwai He, Xiaochuan Gong, Yexiao He, Ziyao Wang, Zheyu Shen, Wanghao Ye, Ramana Rao Kompella, Gaowen Liu, Ang Li

机构 * University of Maryland, College Park(马里兰大学帕克分校) Cisco Research(思科研究院)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 通过提出Drop-Then-Recovery分析协议和GateProbe敏感性指标,发现VLA模型中语言骨干高度冗余,而视觉和动作路径对移除更敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27807 2026-06-29 cs.RO 新提交 70%

SpikeVLA: Vision-Language-Action Models with Spiking Neural Networks

SpikeVLA:基于脉冲神经网络的视觉-语言-动作模型

Ruiqi Song, Dujun Nie, Siyu Teng, Baiyong Ding, Xiaotong Zhang, Dong Li, Chenming Zhang, Yuchen Li, Hangbin Wu, Long Chen

专题命中 机器人基础模型 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出SpikeVLA,一种脉冲VLA架构,通过事件驱动稀疏计算降低能耗,在导航和机器人控制任务中保持竞争力,适用于低功耗实时具身智能。

Comments Accepted by ICML 2026. 16 pages, 9 figures

Journal ref Proceedings of the 43rd International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27663 2026-06-29 cs.RO 新提交 57%

Direct Action-Head Injection of A Grounded 3D Point Unlocks Spatial and Task Generalization

直接动作头注入接地3D点实现空间与任务泛化

Shiang-Feng Tsai, Jin-Cheng Jhang, Yen-Ling Tai, Jia-Hong Lai, Shih-Yun Wong, KangTung-Hsu, Yi-Ting Chen

机构 * National Tsing Hua University(国立清华大学) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 提出轻量级模块,将3D点表示的接地信号通过自适应层归一化直接注入VLA模型的动作头,在LIBERO-PRO上显著提升空间和任务泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27295 2026-06-29 cs.RO 新提交 57%

LA4VLA: Learning to Act without Seeing via Language-Action Pretraining

LA4VLA:通过语言-动作预训练实现无视觉行动学习

Tao Lin, Yuxin Du, Yiran Mao, Zewei Ye, Yilei Zhong, Bing Cheng, Yiming Wang, Jiting Liu, Yang Tian, Junchi Yan, Feiran Wu, Zenan Meng, Hu Wei, Yuqian Fu, Gen Li, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学) KAUST(阿卜杜拉国王科技大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 提出LA4VLA框架,通过语言-动作预训练学习动作先验,减少对视觉线索的依赖,提升VLA策略的鲁棒性,在仿真和真实任务中成功率显著提升。

Comments Github: https://github.com/MINT-SJTU/LA4VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21970 2026-06-29 cs.RO 版本更新 57%

StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision

StereoVLA:利用立体视觉增强视觉-语言-动作模型

Shengliang Deng, Mi Yan, Yixin Zheng, Jiayi Su, Wenhao Zhang, Yitao Zeng, Xiaoguang Zhao, Heming Cui, Zhizheng Zhang, He Wang

机构 * Galbot CFCS, School of CS, Peking University(北京大学计算机学院CFCS) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) The University of Hong Kong(香港大学) Xiamen University Malaysia(厦门大学马来西亚分校) Southern University of Science and Technology(南方科技大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 提出StereoVLA,首个利用大规模合成立体数据引入丰富几何线索的VLA模型,通过几何与语义联合编码和协同训练目标,在真实实验中成功率绝对提升33.4%,并展现出对近半球视角的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 11 篇

2606.27861 2026-06-29 cs.RO 新提交 79%

PPO-EAL: Exact Augmented Lagrangian Proximal Policy Optimization for Safe Robotic Control

PPO-EAL:用于安全机器人控制的精确增广拉格朗日近端策略优化

Jiatao Ding, Songqun Gao, Andrea Del Prete, Matteo Saveriano

机构 * University of Trento(特伦托大学)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 提出PPO-EAL框架,将精确增广拉格朗日优化与近端策略优化结合,通过裁剪策略更新和精确二次惩罚项实现安全约束,在多种机器人任务中优于现有方法。

Comments 11 pages, 8 figures and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27483 2026-06-29 cs.AI 新提交 79%

Internalizing the Future: A Unified Agentic Training Paradigm for World Model Planning

内化未来:一种统一的世界模型规划智能体训练范式

Xuan Zhang, Zhijian Zhou, Lingfeng Qiao, Yulei Qin, Ke Li, Xing Sun, Xiaoyu Tan, Chao Qu, Yuan Qi

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Tencent Youtu Lab(腾讯优图实验室)

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.AI

AI总结 提出一种三阶段训练范式(WM-AMT、FE-SFT、FC-RL),使LLM智能体内化世界模型以进行前瞻性规划,在搜索和数学推理任务上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26048 2026-06-29 cs.RO cs.SY eess.SY 新提交 79%

Deep Reinforcement Learning-Enhanced Event-Triggered Data-Driven Predictive Control for a 3D Cable-Driven Soft Robotic Arm

深度强化学习增强的事件触发数据驱动预测控制用于三维缆索驱动软体机械臂

Cheng Ouyang, Moeen Ul Islam, Kaixiang Zhang, Zhaojian Li, Xiaobo Tan, Dong Chen

机构 * Mississippi State University(密西西比州立大学) Michigan State University(密歇根州立大学)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 提出一种强化学习自适应事件触发DeePC框架,通过训练RL策略决定何时调用优化器,在保持跟踪精度的同时减少计算开销,实验显示优化频率降低66%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28152 2026-06-29 cs.LG cs.RO 新提交 73%

Regularized Reward-Punishment Reinforcement Learning

正则化奖惩强化学习

Jiexin Wang, Eiji Uchibe

机构 * Dept. of Brain Robot Interface, ATR Computational Neuroscience Laboratories(ATR计算神经科学实验室脑机接口系)

专题命中 模仿学习与强化学习 :navigation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 提出KL耦合策略正则化(KCPR)框架,通过策略间动态先验交互实现奖惩强化学习中的策略协调,并衍生出KL耦合软最优性(KCSO)及深度实现klDMP,在网格世界和Gazebo机器人导航任务中提升了安全性和学习稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27475 2026-06-29 cs.RO cs.LG 新提交 73%

Support-Constrained RL Enables Real-World Policy Improvement without Real-World Experience

支持约束强化学习实现无需真实世界经验的真实世界策略改进

Raymond Yu, William Huey, Mustafa Mukadam, Anusha Nagabandi, Abhishek Gupta

机构 * University of Washington(华盛顿大学) Amazon FAR(亚马逊FAR)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 提出SCORE框架,通过流导向约束模拟中的强化学习到真实数据预训练生成策略的支持集,实现无需真实世界经验即可改进真实世界操作策略,在八项灵巧操作任务中成功率从37.8%提升至89.9%。

Comments 35 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03065 2026-06-29 cs.LG cs.RO 版本更新 73%

OGPO: Sample Efficient Full-Finetuning of Generative Control Policies

OGPO:生成控制策略的样本高效全微调

Sarvesh Patil, Mitsuhiko Nakamoto, Manan Agarwal, Shashwat Saxena, Jesse Zhang, Giri Anantharaman, Cleah Winston, Chaoyi Pan, Douglas Chen, Nai-Chieh Huang, Zeynep Temel, Oliver Kroemer, Sergey Levine, Abhishek Gupta, Hongkai Dai, Paarth Shah, Max Simchowitz

机构 * University of California, Berkeley(加州大学伯克利分校) UC Berkeley(加州大学伯克利分校)

专题命中 模仿学习与强化学习 :robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.LG

AI总结 提出OGPO算法,通过离策略评论网络和修改的PPO目标,实现生成控制策略的样本高效微调,在多种操作任务上达到最优性能,并能在无专家数据下微调不良初始化的行为克隆策略。

Comments Website: https://simchowitzlabpublic.github.io/ogpo-site/ Code: https://github.com/simchowitzlabpublic/OGPO_public

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11103 2026-06-29 cs.RO cs.AI 版本更新 73%

A Primer on SO(3) Action Representations in Deep Reinforcement Learning

深度强化学习中SO(3)动作表示入门

Martin Schuck, Sherif Samy, Angela P. Schoellig

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对SO(3)动作表示在强化学习中的选择问题,系统评估了多种表示在PPO、SAC、TD3算法下的效果,发现切向量表示最可靠。

Comments Published at The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27766 2026-06-29 cs.LG cs.AI cs.RO 新提交 67%

RS-Diffuser: Risk-Sensitive Diffusion Planning with Distributional Value Guidance

RS-Diffuser: 基于分布价值引导的风险敏感扩散规划

Shiqiang Gong

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出RS-Diffuser,一种结合扩散轨迹生成与分布价值评论家的风险敏感离线规划框架,通过尾部感知目标引导去噪过程,实现灵活的风险偏好行为,在风险敏感D4RL和机器人导航基准上达到最优性能。

Comments ICIC 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30719 2026-06-29 cs.LG cs.AI 版本更新 62%

When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?

何时LLMs足以作为序列RL任务的策略优化器?

Stephane Hatgis-Kessell, Emma Brunskill

机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 提出PromptPO方法,利用LLM通过Python描述状态空间、动作空间和奖励函数,基于rollout反馈迭代生成和优化可执行策略,在多种环境中匹配或超越标准RL基线,但在细粒度连续控制任务中表现不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27603 2026-06-29 cs.RO 新提交 57%

Learning to Throw: Agile and Accurate Cable-Suspended Payload Delivery with a Quadrotor

学习投掷:四旋翼飞行器实现灵活精确的缆绳悬挂载荷投送

Yifan Zhai, Elia Raimondi, Yunfan Ren, Ismail Geles, Yannick Armati, Jiaxu Xing, Davide Scaramuzza

机构 * Robotics and Perception Group, Department of Informatics, University of Zurich(苏黎世大学信息学系机器人感知组)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 提出一种混合仿真框架,结合高保真四旋翼模型和物理求解器模拟缆绳-载荷系统,通过深度强化学习训练策略,实现零样本部署下投掷误差降低50%、时间缩短30%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27504 2026-06-29 cs.CV 新提交 57%

ReWorld: Learning Better Representations for World Action Models

ReWorld:为世界动作模型学习更好的表示

Tianze Xia, Lijun Zhou, Kaixin Xiong, Jingfeng Yao, Yu Zhu, Zhenxin Zhu, Bing Wang, Guang Chen, Hangjun Ye, Wenyu Liu, Haiyang Sun, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米汽车)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.CV

AI总结 提出ReWorld框架,通过优化中间表示(未来预测监督、跨模态对齐、难负样本监督)提升自动驾驶世界动作模型的规划性能,在nuScenes和NAVSIM上取得显著提升。

Comments 19 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 人机交互与遥操作 2 篇

2606.28215 2026-06-29 cs.CV cs.AI cs.GR 新提交 62%

HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration

HAT-4D: 通过人机协作从单目视频提升4D多物体交互

Jiaxin Li, Yuxiang Wu, Zhenkai Zhang, Xinrui Shi, Haoyuan Wang, Yichen Zhao, Su Linxiang, Chenyang Yu, Mingyu Zhang, Yifan Ding, Boran Wen, Li Zhang, Ruiyang Liu, Yong-Lu Li

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) University of Science and Technology of China(中国科学技术大学) Math Magic

专题命中 人机交互与遥操作 :embodied AI(abstract);分类 cs.AI、cs.CV

AI总结 提出HAT-4D框架,结合视觉大模型与多级人工反馈,从单目视频重建多物体的3D几何、时序动态和物理交互,解决遮挡和深度歧义,无需多相机系统。

Comments Accepted to ECCV 2026. 15 pages of main text and 39 pages of appendices. Project page: https://lijiaxin0111.github.io/HAT4D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28049 2026-06-29 cs.CV 新提交 57%

AirGroundBench: Probing Spatial Intelligence in Multimodal Large Models under Heterogeneous Multi-View Embodied Collaboration

AirGroundBench: 异构多视角具身协作下多模态大模型的空间智能探测

Haotian Li, Yida Wang, Leyuan Wang, Jinshan Lai, Keyang Wang, Zonghao Guo, Qiang Ma, Liuyu Xiang, Jianwei Hu, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) QiYuanLab(启元实验室) Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 人机交互与遥操作 :navigation(abstract);分类 cs.CV

AI总结 提出AirGroundBench基准,通过异构无人机-无人车协作的多视角任务(10类、约6.2万道视觉问答和115个导航任务),系统评估多模态大模型在空间感知、跨视角对齐、空间变换推理和具身决策中的几何一致性,发现模型在跨视角对齐和变换推理上存在瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏