arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-07 至 2026-08-07 共收录 40 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 12 篇

2604.12169 2026-08-07 cs.RO 版本更新 85%

Robotic Nanoparticle Synthesis via Solution-based Processes

基于溶液过程的机器人纳米粒子合成

Dasharadhan Mahalingam, Michael Gallagher, Nilanjan Chakraborty, Stanislaus S. Wong

机构 * Department of Mechanical Engineering, Stony Brook University(石溪大学机械工程系) Department of Chemistry, Stony Brook University(石溪大学化学系)

专题命中 机器人操作 :robotic(title,abstract);robotics(abstract);manipulation(abstract);分类 cs.RO

AI总结 本文提出一种基于螺旋几何的操控规划框架,用于实现基于溶液的合成自动化,通过金和磁铁矿纳米粒子的制备进行演示。该框架通过编程演示提取约束,实现化学家无需机器人知识即可重新编程系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26320 2026-08-07 cs.RO cs.CV 版本更新 84%

DFM-VLA: Iterative Action Refinement for Robot Manipulation via Discrete Flow Matching

DFM-VLA:通过离散流匹配实现机器人操作的迭代动作细化

Jiayi Chen, Wenxuan Song, Jiaxin Fang, Ruiqing Yin, Jingbo Wang, Shuai Chen, Jieyuan Pei, Yikai Qin, Feifan Chen, Haodong Yan, Zhide Zhong, Wen Chen, Yan Wang, Yuxiang Gao, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Harbin Institute of Technology(哈尔滨工业大学) ShanghaiTech University(上海科技大学) Shanghai Institute of Technical Physics, CAS(中国科学院上海技术物理研究所)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 DFM-VLA通过离散流匹配实现机器人操作中动作token的迭代细化,采用动态概率速度场和双阶段解码策略,提升了动作生成的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04657 2026-08-07 cs.CV 版本更新 83%

MobileWAM: Bridging World Action Models to Mobile Manipulation with Chain-of-Foresight

MobileWAM:用前瞻链将世界动作模型(WAM)与移动操作任务对接

Zehua Fan, Junjie He, Wenxuan Song, Xi Wang, Wenqi Lyu, Linge Zhao, Fuhao Li, Zihan You, Yifei Yang, Kaiming Xu, Qi Jiang, Yue Jiang, Haoang Li, Cheng Chi, Feng Gao, Bailin Li, Yan Wang

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) AIR Wuxi Innovation Center, Tsinghua University(清华大学AIR无锡创新中心) The University of Adelaide(阿德莱德大学) Wuhan University(武汉大学) Southeast University(东南大学) Beijing Jiaotong University(北京交通大学) Fudan University(复旦大学) Li Auto(理想汽车) School of Information, Renmin University of China(中国人民大学信息学院)

专题命中 机器人操作 :manipulation(title,abstract);robot learning(abstract);分类 cs.CV

AI总结 MobileWAM是一种混合Transformer架构,通过前瞻链(CoF)解决移动操作的异质动态问题,在ManiSkill-HAB上超越SOTA策略,可微调至真实移动操作机器人且泛化性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00793 2026-08-07 cs.RO 版本更新 79%

DynamicWAM: Dual-Path Motion Conditioning for World-Action Models in Dynamic Manipulation

DynamicWAM:面向动态操作的世界-动作模型的双路径运动条件机制

Yunfan Lou, Hewen Gao, Xiyu Zhu, Zhuoran Qiao, Xuan Han, Yifan Yang, Yifan Ye, Boxian Yao, Zhibo Pang

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 针对现有世界-动作模型在动态场景中运动感知与响应控制不足的问题,提出采用双路径运动条件机制的DynamicWAM,在DOMINO数据集及12项真实世界任务中均显著优于基线方法。

Comments 18 pages, 9 figures. Project page: https://dynamicwam.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29285 2026-08-07 cs.RO 版本更新 74%

TRACT: Temporally Routed Action Chunks with Chronological Phase Authority for Contact-Rich Manipulation

TRACT:面向接触丰富型操作的、具有时间相位权限的时序路由动作块

Jiahao Liu, Kento Kawaharazuka, Tasuku Makabe, Kei Okada

专题命中 机器人操作 :manipulation(title);分类 cs.RO

AI总结 针对接触丰富型操作的时间不匹配问题,提出TRACT方法,通过时序路由动作块与因果响应缺陷积分器提升机器人操作性能,在真实机器人试验中取得了优于基准的任务结果。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16465 2026-08-07 cs.AI 版本更新 70%

Berkeley and Heiserman as an Unexhausted Architecture for Embodied Machine Intelligence

伯克利和海斯曼作为具身机器智能的未穷尽架构

Christopher A. Tucker

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.AI

AI总结 本文以伯克利的《符号逻辑与智能机器》及海斯曼的工作为研究对象,探讨其在具身机器智能方面贡献。他们将逻辑与硬件、行为等联系,超越静态逻辑形式,为具身机器人认知架构方法提供思路,不应被视为历史终点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26663 2026-08-07 cs.RO 版本更新 57%

Tactile-WAM: Touch-Aware World Action Model with Tactile Asymmetric Attention

Tactile-WAM:具有触觉非对称注意力的触觉感知世界动作模型

Siyu Wu, Linjing You, Junjie Zhu, Yaozu Liu, Huang Kaixiang, Chen Yonghang, Jituo Li, Changhao Zhang, Jian Liu, Zhu Hengshuo, Qi Li, Hengshuang Zhao

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学) The University of Hong Kong(香港大学) Shenzhen Loop Area Institute(深圳河套学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 针对接触丰富操作中视觉预测不完整的问题,提出Tactile-WAM,通过触觉非对称注意力机制(TAAM)在保护视觉预测的同时利用触觉信息生成动作,整体成功率提升38.9%。

Comments Submitted to RSS2026 WorkShop Tactile for FM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14768 2026-08-07 cs.RO 版本更新 57%

CADRE: Dynamic Catching via Implicit Contact Descriptors and Task-Appropriate Recovery Affordances

CADRE:基于隐式接触描述符和任务适配恢复可供性的动态抓取

Fan Yang, Zixuan Huang, Abhinav Kumar, Sergio Aguilera Marinovic, Soshi Iba, Rana Soltani Zarrin, Dmitry Berenson

机构 * Honda Research Institute USA(本田美国研究院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 该研究针对灵巧操作中物体掉落的问题,提出CADRE强化学习框架,结合NDF提取接触特征与隐式恢复可供性函数,可高效成功恢复并零样本泛化到不同几何的未见物体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21853 2026-08-07 cs.HC cs.SI 版本更新 50%

Filtering Offensive Content Changes Its Visibility but Not User Behavior: Two Randomized Controlled Trials with 200,000 Users on Nextdoor

过滤攻击性内容会改变其可见性,但不会改变用户行为:在Nextdoor上针对20万用户进行的两项随机对照试验

David J. Grüning, Matthew Katsaros

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究在Nextdoor平台针对20万用户进行两项随机对照试验,探究减少攻击性内容可见性的干预措施效果。通过不同过滤机制,虽大幅降低了攻击性内容可见性,但未改变用户行为,凸显了在线平台管理的复杂性。

Comments 9 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18567 2026-08-07 quant-ph physics.atom-ph 版本更新 50%

Four- and six-photon stimulated Raman transitions for coherent qubit and qudit operations

四光子和六光子受激拉曼跃迁用于相干量子比特和量子三态操作

Gabriel J. Gregory, Evan R. Ritchie, Alex Quinn, Sean Brudney, David J. Wineland, David T. C. Allcock, Jameson O'Reilly

专题命中 机器人操作 :manipulation(abstract)

AI总结 通过四光子和六光子受激拉曼跃迁实现高保真度的量子比特和量子三态操作

Comments 16 pages, 5 figures, SM 31 pages, SM 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22680 2026-08-07 physics.optics quant-ph 版本更新 50%

Integrated polarization-entangled photon source for wavelength-multiplexed quantum networks

集成的偏振纠缠光子源用于波长复用的量子网络

Xiaodong Shi, Yue Li, Jinyi Du, Lin Zhou, Ran Yang, En Teng Lim, Sakthi Sanjeev Mohanraj, Mengyao Zhao, Xu Chen, Xiaojie Wang, Guangxing Wu, Hao Hao, Veerendra Dhyani, Sihao Wang, Alexander Ling, Di Zhu

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出了一种基于超薄薄膜锂铌酸盐的集成偏振纠缠光子源,实现了波长复用的量子网络中的纠缠分布,展示了高保真贝尔态和高亮度的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02659 2026-08-07 physics.optics physics.plasm-ph 版本更新 50%

Focusing Terawatt-Scale Lasers Using Holographic Gaseous Lenses

利用全息气体透镜聚焦太瓦级激光

Devdigvijay Singh, Ke Ou, Sida Cao, Victor M. Perez-Ramirez, Harsha Rajesh, Debolina Chakraborty, Elaine Koh, Caleb Redshaw, Pelin Dedeler, Albertine Oudin, Michelle M. Wang, Julia M. Mikhailova, Livia Lancia, Caterina Riconda, Pierre Michel, Matthew R. Edwards

专题命中 机器人操作 :manipulation(abstract)

AI总结 该研究针对太瓦级激光的光学损伤问题,实验演示了抗损伤的全息气体透镜,可高效调控高能激光,为下一代超高功率激光器提供了新方案。

Comments 17 pages, 9 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 7 篇

2603.19229 2026-08-07 cs.RO cs.AI cs.CV cs.LG cs.SY eess.SY 版本更新 83%

NavTrust: Benchmarking Trustworthiness for Embodied Navigation

NavTrust:体感导航的可信度基准测试

Huaide Jiang, Yash Chaudhary, Yuping Wang, Zehao Wang, Raghav Sharma, Manan Mehta, Yang Zhou, Lichao Sun, Zhiwen Fan, Zhengzhong Tu, Jiachen Li

机构 * Trustworthy Autonomous Systems Laboratory at the University of California, Riverside(加州大学河滨分校可信自主系统实验室) University of Michigan(密歇根大学) Workday University of Southern California(南加州大学) Texas A&M University(德克萨斯A&M大学) Lehigh University(莱斯大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 NavTrust通过系统性地对输入模态进行腐蚀,评估体感导航性能的鲁棒性,揭示了现有方法在真实环境中的性能缺陷,并提出改进策略。

Comments IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026); Project Website: https://navtrust.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19880 2026-08-07 cs.RO cs.CV 版本更新 81%

EA-Nav: Learning Safe Visual Navigation Policies with Embodiment Awareness

EA-Nav:通过具身感知学习安全的视觉导航策略

Jialu Zhang, Yong Du, Xianda Guo, Shunwang Sun, Xinqi Liu, Yue Sun, Guodong Lu, Wei Sui, Jituo Li

机构 * Zhejiang University(浙江大学) Wuhan University(武汉大学) Hunan University(湖南大学) D-Robotics(D机器人公司)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 针对跨具身导航挑战,提出基于模仿学习的具身感知导航框架,通过模块化多阶段设计,预训练构建数据集并引入具身几何,微调设计多模态信息注入机制,有效提高不同具身设置下的导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05506 2026-08-07 cs.CV 版本更新 80%

Robust Scene Transfer for PointGoal Navigation via Privileged Sensor Guided Contrastive Learning

基于特权传感器引导对比学习的点目标导航鲁棒场景迁移

Amirhossein Zhalehmehrabi, Tiziano Tezze, Alberto Castelini, Alessandro Farinelli

机构 * University of Padua(帕多瓦大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.CV;robotics(comments)

AI总结 提出一种传感器引导的自适应对比学习框架,利用特权LiDAR传感器在训练时引导视觉编码器学习导航相关结构,并通过解耦表征学习与策略优化以及跨阶段域不匹配来提升策略级场景迁移能力。

Comments 8 pages, Accepted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03699 2026-08-07 cs.RO cs.SY eess.SY 版本更新 79%

Lost in Time? Continuous Symmetry and Identifiability in Aided Inertial Navigation with Unknown Measurement Delays

迷失在时间中?具有未知测量延迟的辅助惯性导航中的连续对称性和可识别性

Jonathan Kelly, Phone Thiha Kyaw, Mattew Giamou

机构 * Space & Terrestrial Autonomous Robotic Systems (STARS) Laboratory at the University of Toronto Institute for Aerospace Studies (UTIAS)(多伦多大学航天研究所空间与地面自主机器人系统(STARS)实验室) Autonomous Robotics & Convex Optimization (ARCO) Laboratory in the Department of Computing and Software, McMaster University(麦克马斯特大学计算与软件系自主机器人与凸优化(ARCO)实验室)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 研究辅助导航中单个辅助传感器测量相对于惯性测量流有未知但恒定延迟时系统的可识别性,利用特殊伽利略群刻画无信息轨迹并与延迟测量模型连续对称性相关,揭示可识别性失败轨迹类别及与线性化分析联系。

Comments Accepted to the IEEE International Conference on Multisensor Fusion and Integration (MFI), Pilsen, Czechia, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03604 2026-08-07 cs.HC 版本更新 71%

Language Scent: Exploring Cross-Language Information Navigation

语言气味:探索跨语言信息导航

Jiawen Stefanie Zhu, Katharina Reinecke, Tanushree Mitra

专题命中 具身导航 :navigation(title)

AI总结 研究探讨了多语言用户在信息检索中跨语言切换的机制,提出'语言气味'理论,并设计Niffler系统支持跨语言信息导航,通过上下文线索和工具提升探索性搜索策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02018 2026-08-07 cs.CV 版本更新 57%

Invisible Ink Threats: Adversarial Goals Behind Legitimate Tasks in Computer-Use Agents

隐形墨水威胁:计算机使用智能体中合法任务背后的对抗目标

Jia-Chen Zhang, Ze-Yu Zhang, Kai-Wei Zhang

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 该研究针对计算机使用智能体的隐形墨水威胁,构建II-Bench与HITLCUA框架评估后发现,低危害注入可绕过防御,暴露出现有CUAs的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15536 2026-08-07 cs.HC 版本更新 50%

'OpenBloom': A Stigma-Sensitive LLM Design Probe for Navigating Reproductive Well-being Conversations with Young Adults

「OpenBloom」:一种面向生殖健康的污名敏感型大语言模型设计探针

Yang Hong, Ashley Hua, Adya Daruka, Sharifa Sultana

专题命中 具身导航 :navigation(abstract)

AI总结 提出OpenBloom,利用大语言模型将生殖健康文章转为问题提示,通过34名参与者的136次交互研究,探讨AI生成问题如何与社会污名、情境敏感性和反思性互动,并讨论女性主义HCI、可争议性和价值敏感AI框架的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 7 篇

2512.08991 2026-08-07 cs.CV cs.LG 版本更新 81%

Deterministic World Models for Closed-loop Reachability Analysis of End-to-End Vision-based Control

确定性世界模型用于闭环视觉系统验证

Yuang Geng, Zhongzheng Zhang, Chengzhen Jiang, Yanru Li, Xinyang Wang, Zhuoyang Zhou, Hoang-Dung Tran, Ivan Ruchkin

机构 * University of Florida(佛罗里达大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出确定性世界模型,通过直接映射系统状态到生成图像,消除不可解释的潜在变量,提升闭环视觉系统验证的精度与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03556 2026-08-07 cs.CV cs.RO 版本更新 81%

Afford-X: Generalizable and Slim Affordance Reasoning for Task-oriented Manipulation

Afford-X:面向任务型操作的通用且轻量化的可供性推理模型

Xiaomeng Zhu, Yuyang Li, Leiyao Cui, Pengfei Li, Huan-ang Gao, Yixin Zhu, Hao Zhao

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) Institute for Al Industry Research, Tsinghua University(清华大学人工智能产业研究院) Department of Computer Science, Tsinghua University(清华大学计算机科学系)

专题命中 具身推理 :manipulation(title);robotics(abstract);分类 cs.RO、cs.CV

AI总结 研究人员推出LVIS-Aff数据集,开发了Afford-X可供性推理模型,其性能优于现有非LLM方法和此前会议论文结果,参数紧凑、推理速度快,可部署于本地设备助力机器人任务导向型操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21910 2026-08-07 cs.AI cs.DB 版本更新 79%

TRW: TRACE-RealWorld---An Auditable Consistency Contract for World Models as Materialized Views

TRW: TRACE-RealWorld——作为物化视图的世界模型的可审计一致性契约

Edward Y. Chang

机构 * Stanford University(斯坦福大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 TRACE-RealWorld解决在变化物理世界中维护物化视图的问题,提出承诺级有效性抽象等数据管理方法,通过端到端评估测量多方面指标,贡献是为部署世界表示提供一致性、恢复和问责契约。

Comments v2 propagates declared point and extended hazards through the composition theorem and separates point-event from interval-risk budgets. It aligns Flood-SAR adjudication with each hazard class, sharpens calibration-slack and drift claims, adds bootstrap Monte Carlo error and joint-coverage requirements, revises terminology, and expands related-work context

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13460 2026-08-07 cs.CV 版本更新 79%

VISA: VLM-Guided Instance Semantic Auditing for 3D Occupancy World Models

VISA: VLM引导的实例语义审计用于3D占据世界模型

Ruiqi Xian, Yuehan Xian, Jing Liang, Xuewei Qi, Dinesh Manocha

机构 * University of Maryland College Park(马里兰大学帕克分校) Nanjing University of Posts and Telecommunications(南京邮电大学) Stanford University(斯坦福大学) Motional AD Inc.(Motional AD公司)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出VISA方法,利用离线VLM对每个物理对象实例进行结构化语义审计,并通过可靠性加权损失蒸馏到3D占据模型中,无需VLM推理即可提升封闭集占据mIoU。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08199 2026-08-07 cs.NI 版本更新 78%

Beyond Static Forecasting: Unleashing the Power of World Models for Mobile Traffic Extrapolation

超越静态预测:利用世界模型进行移动交通外推

Xiaoqian Qi, Haoye Chai, Yue Wang, Yong Li

专题命中 具身推理 :world model(title,abstract)

AI总结 本文提出MobiWM世界模型,用于移动网络中的移动交通外推,通过融合多模态环境上下文和编码动作,提升空间理解,实验表明其在所有评估场景中均取得最佳分布保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26657 2026-08-07 cs.RO cs.CV 版本更新 76%

Enfold: Folding World Model Imagination into Predictive Representations for Ultra-Efficient Embodied Control

Enfold:将世界生成器计算融入预测表示以实现高效具身控制

Weili Zeng, Yitong Xing, Fulong Liu, Chengqun Yang, Antao Xiang, Feng Tian, Jingnan Gao, Jisong Cai, Xin Wang, Xiaomin Wu, Yao Mu, Xiaokang Yang, Yichao Yan

机构 * Shanghai Jiao Tong University(上海交通大学) South China University of Technology(华南理工大学) Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院))

专题命中 具身推理 :world model(title);分类 cs.RO、cs.CV

AI总结 Enfold将世界生成器计算融入预测表示,在LIBERO等多任务中实现高效具身控制,大幅降低动作延迟,且能适应场景变化,为具身控制提供了新范式。

Comments project page, https://zwl666666.github.io/enfold/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21124 2026-08-07 cs.SD cs.AI eess.AS 版本更新 57%

PhaseCoder: Microphone Geometry-Agnostic Spatial Audio Understanding for Multimodal LLMs

PhaseCoder: 无关麦克风几何的多模态大语言模型空间音频理解

Artem Dementyev, Wazeer Zulfikar, Sinan Hersek, Pascal Getreuer, Anurag Kumar, Vivek Kumar

机构 * Google DeepMind(谷歌DeepMind) Media Lab, MIT(媒体实验室,麻省理工学院) Google AR(谷歌AR)

专题命中 具身推理 :embodied AI(abstract);分类 cs.AI

AI总结 PhaseCoder是一种无需麦克风几何结构的Transformer空间音频编码器,能够生成空间嵌入并使LLM实现复杂空间推理和转录任务。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人基础模型 2 篇

2603.25406 2026-08-07 cs.RO 版本更新 57%

MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and Generation

MMaDA-VLA: 基于统一多模态指令与生成的大型扩散视觉-语言-动作模型

Yang Liu, Pengxiang Ding, Tengyue Jiang, Xudong Wang, Wenxuan Song, Minghui Lin, Han Zhao, Hongyin Zhang, Zifeng Zhuang, Wei Zhao, Siteng Huang, Jinkui Shi, Donglin Wang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) East China University of Science and Technology(华东理工大学) Huawei Celia Team(华为Celia团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) OpenHelix Robotics

专题命中 机器人基础模型 :world model(abstract);分类 cs.RO

AI总结 本文提出MMaDA-VLA模型,通过统一多模态理解与生成框架,解决机器人操控中的时序不一致和长周期误差累积问题,实现高效视觉-语言-动作生成。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20633 2026-08-07 cs.RO 版本更新 57%

Reinforcing Action Policies by Prophesying

通过预言强化行动策略

Jiahui Zhang, Ze Huang, Chun Gu, Zipei Ma, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 机器人基础模型 :world model(abstract);分类 cs.RO

AI总结 ProphRL通过Prophet、FA-GRPO和FlowScale提升VLA后训练的效率与稳定性,实现机器人任务的成功率提升。

Comments https://LogosRoboticsGroup.github.io/ProphRL

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 模仿学习与强化学习 3 篇

2510.06277 2026-08-07 cs.CV cs.LG 版本更新 82%

Dynamic Object Masks as Goal Representations for Visual Goal-Conditioned Reinforcement Learning

动态目标掩码作为视觉目标条件强化学习的目标表示

Fahim Shahriar, Cheryl Wang, Alireza Azimi, Gautham Vasan, Hany Hamed, Abhishek Naik, A. Rupam Mahmood, Colin Bellinger

机构 * University of Alberta(阿尔伯塔大学) McGill University(麦吉尔大学) University of Ottawa(渥太华大学) AMII CIFAR Canada AI Chair(CIFAR加拿大人工智能主席) Vector Institute(向量研究所)

专题命中 模仿学习与强化学习 :robotics(abstract);manipulation(abstract);navigation(abstract);robotic(abstract)

AI总结 该研究针对视觉目标条件强化学习,提出动态目标掩码作为目标表示,结合Detic等预训练检测器生成掩码,在机械臂和仿真导航任务中实现高成功率与高效学习,支持仿真到现实迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04568 2026-08-07 cs.LG cs.AI cs.RO 版本更新 67%

Dream-MPC: Gradient-Based Model Predictive Control with Latent Imagination

Dream-MPC:基于梯度与潜在想象的模型预测控制

Jonathan Spieler, Sven Behnke

机构 * Autonomous Intelligent Systems, Computer Science Institute VI - Intelligent Systems(自主智能系统,计算机科学研究所VI - 智能系统) Robotics, Center for Robotics(机器人学,机器人中心) the Lamarr Institute for Machine Learning(拉马尔机器学习研究所) Artificial Intelligence, University of Bonn, Germany(人工智能,波恩大学,德国)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出Dream-MPC方法,通过从展开策略生成少量候选轨迹,并利用学习的世界模型进行梯度上升优化,结合不确定性正则化和时间上的优化迭代摊销,显著提升了底层策略性能,在24个连续控制任务上优于无梯度MPC和现有基线。

Comments Accepted for International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏