arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-03 至 2026-08-03 共收录 36 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 2 篇

2607.29302 2026-08-03 cs.RO cs.CV 新提交 88%

BWM: A Low-Cost High-Fidelity World Simulator for Robot Learning

BWM:面向机器人学习的低成本高保真世界模拟器

BWM Team

专题命中 机器人学习 :robot learning(title,abstract);world model(abstract,abstract_cn);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 本文提出面向机器人操纵的开源世界模拟器BWM,通过动作条件化自回归预测实现高保真,兼具数据引擎与策略评估器功能,在WorldArena挑战赛中表现最优并开源相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29482 2026-08-03 cs.RO 新提交 79%

Temporal Policy: History-Initialized Action Generation for Robotic Learning from Demonstration

时间策略:用于机器人演示学习的历史初始化动作生成

Dylan Miller, Martin Jagersand

机构 * University of Alberta(阿尔伯塔大学)

专题命中 机器人学习 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出Temporal Policy生成框架,将动作生成为时间耦合传输问题,在降低近一个数量级传输成本的同时匹配基线成功率,实现高频闭环控制。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 14 篇

2607.29567 2026-08-03 cs.RO 新提交 83%

TransGraspNet: Physically and Geometrically Consistent Manipulation of Transparent Labware

TransGraspNet:透明实验器皿的物理与几何一致性操纵

Hailing Hu, Mingyi Zhu, Yiquan An, Yifei Tian, Tianyou Zuo, Lifeng Zhou

机构 * Peking University(北京大学) School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) Shanghai Jiao Tong University(上海交通大学) Southern University of Science and Technology(南方科技大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 TransGraspNet是实现透明实验器皿物理与几何一致性操纵的框架,通过三个耦合原则解决跨阶段不一致问题,在真实机器人平台上实现了高抓取成功率与零液体泼洒的可靠操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28993 2026-08-03 cs.RO cs.CV 新提交 81%

ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts

ST-WAM:面向视觉分布偏移下鲁棒操作的语义-时间世界动作模型

Mingxin Wang, Bin Hu, Bin Qian, Kaitao Jiang, Haoning Wu, Feng Yan, Bowen Jing, Ruiyang Hao, Enyi Wang, Kangning Niu, Yandan Yang, Mu Xu, Yan Wang, Houde Liu, Tianlun Li

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.CV

AI总结 该研究针对视觉分布偏移下机器人操作的鲁棒性问题,提出ST-WAM模型,采用DINOv3等技术,在多个基准测试中取得优异性能,大幅提升了偏移场景下的零样本操作表现。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29569 2026-08-03 cs.RO cs.SY eess.SY 新提交 77%

Safe Vision Language Action Models via Barrier Enhanced Flow Matching

基于障碍增强流匹配的安全视觉语言动作模型

Kasra Sinaei, Hung-Chieh Wu, Donald Ebeigbe

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 机器人操作 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 该研究提出将流匹配生成模型与控制障碍函数安全保证结合的模块化推理框架,通过修改流匹配去噪过程实现本质安全,在不降低模型成功率的前提下完成安全验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29687 2026-08-03 cs.RO 新提交 57%

Diagnosing Compositional Generalization in Sequential Robot Tasks

诊断序列机器人任务中的组合泛化问题

Yixiao Wang, Cheng-En Wu, Lingfeng Sun, Pengcheng Wang, Xiang Ji, Boyuan Liang, Guojian Zhan, Masayoshi Tomizuka

机构 * University of California, Berkeley(加州大学伯克利分校) Tsinghua University(清华大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 本文针对序列机器人操作的组合泛化问题,将泛化差距分解为三类偏移,发现结构化子集覆盖动作相关依赖即可实现高分布外性能,微调单演示可大幅提升OOD成功率,提出数据收集应优先依赖覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29625 2026-08-03 cs.RO 新提交 57%

Balancing of Humanoid with Object Mass: Trade-off Analyses and Lifting Control

带物体质量的人形机器人平衡:权衡分析与举升控制

Hyunjong Song, William Z. Peng, Joo H. Kim

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 该研究分析物体质量对人形机器人平衡的动态影响,构建平衡状态盆地/边界,定义临界与过渡质量,将其应用于轨迹优化,实现人形机器人稳定举升物体控制并完成相关任务。

Comments 22 pages, 13 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29484 2026-08-03 cs.CL cs.LG 新提交 57%

Evidence-Type Competition: When Can Interventional Data Teach Language Models Causal Direction?

证据类型竞争:干预数据何时能教会语言模型因果方向?

Xining Xun

机构 * Tsingjiao Information Science (Beijing) Co., Ltd(北京清教信息科技有限公司)

专题命中 机器人操作 :manipulation(abstract);分类 cs.LG

AI总结 该研究发现干预数据训练语言模型因果推理的金标准假设存在局限,观测上下文会抑制模型的因果方向判断能力,提出证据平均方案可降低符号错误率。

Comments 13 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29156 2026-08-03 cs.CV 新提交 57%

Progressive Decision-Making for Localizing Open-Ended AI-Generated Image Forgeries

面向开放式AI生成图像伪造定位的渐进式决策方法

Jingyi Hou, Xiaoxia Chen, Leyu Zhou, Zhichuang Wang, Zhijie Liu

机构 * School of Artificial Intelligence, University of Science and Technology Beijing(北京科技大学人工智能学院) Institute of Artificial Intelligence, University of Science and Technology Beijing(北京科技大学人工智能研究院) Key Laboratory of Intelligent Bionic Unmanned Systems, Ministry of Education, University of Science and Technology Beijing(北京科技大学智能仿生无人系统教育部重点实验室)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 该研究针对AI生成图像伪造定位难题,提出基于EG-Mamba的渐进式决策更新方法,通过自适应序列决策提升定位性能,在未见AI生成伪造上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29106 2026-08-03 cs.CV 新提交 57%

Forwardrobe: Garment-Aware Gaussian Avatars from a Single Image

Forwardrobe:基于单张图像的衣物感知高斯化身

Daisheng Jin, Shuyun Wang, Ying He

机构 * Nanyang Technological University(南洋理工大学) The University of Queensland(昆士兰大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 该研究提出Forwardrobe框架,通过在高斯空间分离衣物与身体,实现单张图像的衣物感知高斯化身重建,提升了衣物重建质量与操作灵活性,支持衣物编辑等应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28834 2026-08-03 cs.CV 新提交 57%

FocusGS: Spatial Delta Layers for Local Repair and Deterministic Editing of Trained 3D Gaussian Assets

FocusGS:用于训练后3D高斯资产的局部修复与确定性编辑的空间增量层

Yiqun Pan, Yukun Shi

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 FocusGS将局部修复与确定性编辑统一为复合空间增量,解决3D高斯资产的局部维护问题,提升目标区域PSNR,优于文本驱动基线,提供轻量可验证的3DGS维护算子。

Comments 8 pages, 6 figures, 5 tables. Ancillary demonstration video included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29133 2026-08-03 cs.GR 新提交 50%

Interactive Generative Motion Editing via Scheduled Inpainting

基于调度补全的交互式生成运动编辑

Dhruv Agrawal, Dominik Borer, Luca Vögeli, Robert Sumner, Martin Guay, Jakob Buhmann

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究提出调度补全方法,实现交互式生成运动编辑,结合运动合成与编辑,可优化现有动画并支持多类编辑应用,经多组实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29532 2026-08-03 econ.EM math.ST stat.TH 新提交 50%

Robust Instrumental Variables: Sharp Rates and Inference under Adversarial Contamination

稳健工具变量:对抗污染下的精确速率与推断

Anders Bredahl Kock, David Preinerstorfer

专题命中 机器人操作 :manipulation(abstract)

AI总结 针对2SLS易受少量观测值不当影响的问题,本文提出W-2SLS方法,在对抗污染下达到极小极大精确速率,构建了稳健推断与检验,且无污染时也有更好的有限样本偏差保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28791 2026-08-03 math.HO 新提交 50%

What Remains Human in Mathematics in the Age of AI

AI时代数学中何为人类性

Amir Moradifam

专题命中 机器人操作 :manipulation(abstract)

AI总结 该文探讨AI对数学教育、研究及思考学习的影响,指出常规数学任务自动化后,数学中概念洞见等人类性方面更显重要且具价值。

Comments Accepted for publication in European Mathematical Society Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29046 2026-08-03 quant-ph 新提交 50%

Nuclear Spin Squeezing Based on Spin-Exchange Collisions

基于自旋交换碰撞的核自旋压缩

He-bin Zhang, Yuanjiang Tang, Yong-Chun Liu

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究基于碱金属与惰性气体系综的相干自旋交换相互作用,提出一种可高效制备操控超长寿命核自旋压缩的方案,该方案易实现且适配性高,将推动核自旋非经典态的相关研究与应用。

Comments 11 pages, 7 figures

Journal ref Phys.Rev.A 114,013725 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28783 2026-08-03 quant-ph physics.comp-ph 新提交 50%

Quantum Optimal Control at Intermediate Times: Controlling Revivals in Spin Chains

中间时间的量子最优控制:控制自旋链中的复兴现象

Juan J. Omiste, Ignacio R. Solá

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究将量子最优控制扩展为可同时优化任意中间时间的可观测量,应用于Heisenberg XXX自旋链实现Dicke态激发的传播与复兴操控,为量子态动态跟踪及主动操控提供了新框架。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身导航 5 篇

2607.29600 2026-08-03 cs.RO 新提交 79%

HAM-VLN: Harnessing Hierarchical Agentic Memory for Zero-Shot Vision-and-Language Navigation

HAM-VLN:利用分层智能体记忆实现零样本视觉与语言导航

An Liu, Bingxi Liu, Hongyu Ding, Yixuan Jiang, Yaran Chen, Fulin Tang, Cong Leng, Hong Zhang, Jian Cheng

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本研究提出HAM-VLN零样本VLN方法,通过分层智能体记忆缓解长程导航的记忆与推理瓶颈,提升导航指标并缩短上下文长度,在多个基准数据集上取得优异零样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29450 2026-08-03 cond-mat.stat-mech 新提交 78%

Optimal Navigation on Simplicial Complexes

单纯复形上的最优导航

Diego Febbe, Duccio Fanelli, Gianluca Peri, Timoteo Carletti

专题命中 具身导航 :navigation(title,abstract)

AI总结 本研究将二分图的导航与搜索策略扩展至含高阶相互作用的单纯复形,通过引入长程随机传送项并提出微扰近似方案,分析其可探索性与最优导航相关拓扑测度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29513 2026-08-03 cs.RO 新提交 61%

Homotopy-Aware Corridor Generation without Predefined Reference Paths

无预定义参考路径的同伦感知走廊生成

Haoze Dong, Minghan Li, Meng Guo, Zhongkui Li

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院)

专题命中 具身导航 :robotic(abstract);分类 cs.RO;robotics(comments)

AI总结 该研究提出一种无预定义参考路径的自适应多尺度凸集图框架,用于生成同伦感知安全走廊,经数值与硬件实验验证,其图构造高效、轨迹性能稳定,同伦感知轨迹更短且能应对未知障碍物。

Comments 8 pages, 8 figures. Accepted for publication in IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29638 2026-08-03 cs.CV 新提交 57%

HierDoc: Hierarchical Page-to-Region Evidence Routing for Long-Document Visual Question Answering

HierDoc:用于长文档视觉问答的分层页到区域证据路由

Rongjian Gu, Wengang Zhou, Junyu Xiong, Yonghui Wang, Bing Yin, Bei Wang, Houqiang Li

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 HierDoc是分层证据路由框架,将长文档视觉问答的页与区域选择整合为连续两阶段,在开放权重系统中达SOTA,使LongDocURL提升16.87%,区域证据可显著提升单页系统性能。

Comments 15 pages, 4 figures; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28947 2026-08-03 cs.LG 新提交 57%

Overcoming the Weakest-Link Effect in LLM-Driven Program Optimization via Heterogeneous Edit Recombination

通过异构编辑重组克服大语言模型驱动的程序优化中的最弱链效应

Jingwen Fu, Zhen Liu, Yuhan Liu, He Zhang, Nanning Zheng

专题命中 具身导航 :robotic(abstract);分类 cs.LG

AI总结 本研究针对LLM程序优化的最弱链效应,提出HERO异构编辑重组优化器,可生成多样非重叠原子编辑并结合评估器分数组合改进,在多领域实现更高分数、更快收敛与更少token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 具身推理 2 篇

2607.29031 2026-08-03 cs.RO cs.AI 新提交 84%

Auto-JEPA: A Latent World Model of Continuous Intent for End-to-End Autonomous Driving

Auto-JEPA:面向端到端自动驾驶的连续意图隐式世界模型

Jiwei Yang, Zhengxian Chen, Chaosheng Huang, Jun Li

专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.RO、cs.AI

AI总结 Auto-JEPA是面向端到端自动驾驶的连续意图隐式世界模型,通过联合嵌入预测学习未来驾驶意图,无需密集未来世界建模,在NAVSIM数据集上取得优异规划性能,可聚焦规划相关视觉特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29491 2026-08-03 cs.LG cs.AI 新提交 76%

DreamQAS: Learning a Decision-Useful World Model for VQE-Efficient Quantum Architecture Search

DreamQAS:面向VQE高效量子架构搜索的决策有用世界模型学习

Jiayang Niu, Yan Wang, Jie Li, Ke Deng, Azadeh Alavi, Muhammad Usman, Yongli Ren

机构 * School of Computing Technologies, RMIT University(RMIT大学计算技术学院) Quantum Systems, Data61, CSIRO(澳大利亚联邦科学与工业研究组织数据61分部量子系统部)

专题命中 具身推理 :world model(title);分类 cs.AI、cs.LG

AI总结 该研究提出DreamQAS模型,以基于模型的强化学习框架实现VQE高效量子架构搜索,在多个分子任务上降低了真实VQE调用次数并提升了反事实动作排名效用。

Comments 26 pages, 4 figures, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人基础模型 2 篇

2607.29172 2026-08-03 cs.RO cs.AI 新提交 86%

CLIFT: Turning Gemini Robotics On-Device into Humanoid Specialists via Non-Invasive Closed-Loop Iterative Fine-Tuning

CLIFT:通过非侵入式闭环迭代微调将Gemini机器人端侧模型转化为人形机器人专家

Yuxin Chen, Hari Srikanth, Nathan Jew, Menglin Wu, Pengcheng Wang, Junli Ren, Masayoshi Tomizuka, Peng Xu, Jinyu Xie, Thomas Tian

机构 * University of California, Berkeley(加州大学伯克利分校) Google DeepMind(谷歌DeepMind) NVIDIA Research(英伟达研究院)

专题命中 机器人基础模型 :robotics(title,abstract);manipulation(abstract);robot foundation model(abstract);分类 cs.RO、cs.AI

AI总结 本研究针对闭源机器人模型的托管式SFT API范式,提出CLIFT方法,在不访问模型内部机制的情况下,将Gemini机器人端侧模型经两次飞轮循环提升至接近完美的敏捷接触任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29169 2026-08-03 cs.RO cs.AI 新提交 73%

ActFovea: Runtime Safeguarding for VLA Policies via Spatiotemporal Visual-Action Consistency

ActFovea:基于时空视觉-动作一致性的VLA策略运行时安全保障

Wenda Yu, Tianshi Wang, Fengling Li, Xin Li, Jingjing Li, Lei Zhu

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 ActFovea是一种即插即用的VLA策略运行时安全保障框架,通过构建动作条件化凹形区域、检测时空一致性及触发安全故障,提升了机器人操纵在各类干扰下的成功率与安全性。

Comments 8 pages, 4 figures, 4 tables. Code: https://github.com/SunnyYWD/ActFovea.git

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 模仿学习与强化学习 4 篇

2607.29613 2026-08-03 cs.RO cs.CL cs.CV 新提交 79%

WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning

WCM:用于视觉-语言-动作强化学习的世界评论者模型

Senyu Fei, Xiaopeng Yu, Siyin Wang, Xianzhong Zhao, Jingjing Gong, Xipeng Qiu

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);world model(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 该研究针对视觉-语言-动作强化学习中评论者与机器人部分可观测性不匹配的问题,提出WCM模型,联合预测未来潜态与值估计,在149个仿真任务和7个真实任务上均实现最优性能与泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28737 2026-08-03 cs.LG cs.CV cs.RO 新提交 67%

Mirror Learning

镜像学习

Yunpeng Liu, Matthew Niedoba, Oluwanifemi A. Adekanye, Jason Yoo, Yingchen He, Berend Zwartsenberg, Frank Wood

机构 * University of British Columbia(不列颠哥伦比亚大学) Inverted AI Amii

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 该研究提出镜像学习框架,通过视频扩散模型的视角变换与逆动力学模型合成镜像数据,用其增强行为克隆训练可提升策略性能,为数据收集提供替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29617 2026-08-03 cs.LG cs.AI stat.ML 新提交 62%

When Does On-Policy Interaction Help? Representational Tradeoffs in Value-Based Imitation Learning

基于值函数的模仿学习中,何时在线交互是有帮助的?表示权衡研究

Luca Viano, Antoine Moulin, Audrey Huang, Volkan Cevher, Philip Amortila, Dylan J. Foster

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文针对基于值函数的模仿学习,提出交互式在线算法OVI,发现专家交互可降低学习者的表示要求,且OVI在多数场景下性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28663 2026-08-03 cs.NE cs.LG 新提交 57%

NeuroSynth: A Biologically Inspired Continual Reinforcement Learning Architecture for Mitigating Catastrophic Forgetting

NeuroSynth:一种受生物启发的持续强化学习架构,用于缓解灾难性遗忘

Yash Kini

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本研究提出受生物启发的持续强化学习架构NeuroSynth,通过双路径巩固机制缓解灾难性遗忘,实验显示其在多个顺序导航任务中相比PPO、EWC保留更多早期任务知识,改善了持续学习的稳定性-可塑性平衡。

Comments Disclaimer. This manuscript is provided as an arXiv preprint to establish a public record of the NeuroSynth continual reinforcement learning architecture and its evaluation on the NeuroMaze-CL benchmark. This full manuscript has been submitted to the Journal of High School Science for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 机器人数据与评测 6 篇

2607.29640 2026-08-03 cs.RO 新提交 79%

Bootstrapping Self-Supervised Learning of Binary Classification Using Error Bounds: A Case Study on a Robotic Insertion Task

基于误差边界引导二分类自监督学习:机器人插入任务案例研究

Zebin Duan, Norbert Krüger, Juan Heredia, Thorbjørn Mosekjær Iversen, Frederik Hagelskjær

机构 * Mærsk Mc-Kinney Møller Institute(马士基麦金尼姆勒研究所) University of Southern Denmark(南丹麦大学) Danish Institute for Advanced Study (DIAS)(丹麦高等研究院)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO

AI总结 本研究针对机器人插入任务,提出结合UMAP降维与Wilson Score置信边界的二分类自监督学习数据引擎,可随任务执行减少昂贵验证需求并控制误差水平。

Comments 8 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏