arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-30 至 2026-07-30 共收录 46 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 1 篇

2607.26985 2026-07-30 cs.RO cs.AI cs.LG 新提交 85%

SymmGrid: Super-Scaling On-Robot Learning with Parallelized Symmetries and Egocentric-Exocentric Visual Perception

SymmGrid:基于并行对称性与自我-外部视觉感知的超规模机器人上学习框架

Gabe Everett, Brice Gunter, Ryan Vander Stelt, Cleiver Ruiz-Martinez, Blake Hull, Juan Rojas

机构 * Lipscomb University(利普斯科姆大学)

专题命中 机器人学习 :robot learning(title,abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 SymmGrid是一种并行对称性轨迹级增强框架,通过自我-外部视觉感知加速机器人上学习,在真实机器人操作任务上实现训练速度、成功率及nAUC比率提升,最快收敛时间低至10.9分钟。

Comments 9 pages, 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 11 篇

2607.26789 2026-07-30 cs.RO 新提交 88%

CheckVLA: Execution-Time Verification with Action-Conditioned World Model for Long-Horizon Mobile Manipulation

CheckVLA:面向长 horizon 移动操作的基于动作条件世界模型的执行时验证

Yushan Liu, Peibo Sun, Xintao Chao, Zhenyang Yang, Yifan Xie, Lingfeng Zhang, Shoujie Li, Chenyu Tang, Fang Chen, Xiao-Ping Zhang, Wenbo Ding

专题命中 机器人操作 :manipulation(title,abstract);world model(title,abstract);分类 cs.RO

AI总结 CheckVLA 是基于动作条件世界模型的长 horizon 移动操作执行时验证方法,在 RoboCasa365 上其平均成功率比定期重规划提升 8.5 个百分点,且及时召回率显著优于仅观测及动作打乱的对照方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26809 2026-07-30 cs.RO 新提交 85%

Practice Makes Policies: Bootstrapping and Consolidating Robotic Capabilities from Zero Human Demonstrations

熟能生巧:从零人类演示中引导与整合机器人能力

Jialiang Li, Yuhan Wang, Haojun Li, Gaojing Zhang, Yangtian Ye, Qipeng Liu, Haotian Liang, Wenzhao Lian

专题命中 机器人操作 :robotic(title,abstract);embodied agent(abstract);manipulation(abstract);分类 cs.RO

AI总结 本研究提出HERO自改进层级具身智能体,通过整合启发式推理等技术,实现机器人从零人类演示自主演进操作能力,减少数据收集人工干预并提升多样化任务操作稳健性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26460 2026-07-30 cs.RO 新提交 79%

RLMM-Flow: A Flow-based Mobile Manipulation Framework with Latent-Space Reinforcement Learning

RLMM-Flow:一种基于流的隐空间强化学习移动操作框架

Shuhang Wang, Ziming Li, Hui Cheng

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 该研究提出RLMM-Flow框架,结合流策略预训练与隐空间强化学习,在移动操作基准上提升任务成功率等指标,同时保留流的快速推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26315 2026-07-30 cs.RO 新提交 79%

MoMo: Dial Motion Mode in Robot Manipulation with Spatiotemporal Action Tokenization

MoMo:机器人操作中基于时空动作标记化的拨号运动模式

Yuhan Hu, Hugues Thomas, Peide Huang, Mouli Sivapurapu, Benoit Landry, Arto Kivila

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 MoMo是两阶段模仿学习框架,可学习跨任务复用的运动模式,能生成不同模式的操作行为并迁移未见过的模式,保持任务成功率,实现组合泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26716 2026-07-30 quant-ph 新提交 78%

Coherent electric field manipulation of nuclear spin qudit

核自旋量子位的相干电场操控

Sumin Lim, Mikhail V. Vaganov, Niccolo Fontana, Junjie Liu, Arzhang Ardavan

专题命中 机器人操作 :manipulation(title,abstract)

AI总结 该研究以高极化率氧化物ZnO为基质,通过超精细耦合电子自旋放大电场调制,实现了Mn²⁺掺杂ZnO中I=5/2核自旋量子位的高效相干操控,为可扩展量子技术提供了新的材料设计思路。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26337 2026-07-30 cs.RO eess.IV 新提交 74%

Reeling It In: Flexible Needle Pick Up via Thread Manipulation for Autonomous Suturing

收线:通过线操作实现自主缝合的柔性缝针拾取

Emma Huang, Zih-Yun Chiu, Neelay Joglekar, Shanglei Liu, Michael C. Yip

机构 * University of California San Diego(加利福尼亚大学圣迭戈分校) Johns Hopkins University(约翰斯·霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学) UC San Diego Health(加州大学圣迭戈分校健康中心)

专题命中 机器人操作 :manipulation(title);分类 cs.RO

AI总结 本研究提出一种基于缝合线辅助的自主缝针拾取框架,通过线操作实现间接拾取,可应对缝针被遮挡或不可接近等场景,提升了自主缝合的鲁棒性。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26935 2026-07-30 cs.AI cs.CR 新提交 57%

What Does It Take to Detect an AI Agent? Minimal Feature Sets for Behavioral Detection under Browser Automation

检测AI智能体需要什么?浏览器自动化下行为检测的最小特征集

Vishisht Choudhary, Lukas Schmidt, Anne Zoë Kenntner, Feras Skhab, Michel Osswald, Jens Ernstberger

机构 * Technical University of Munich(慕尼黑工业大学) Kontext

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 该研究提出三类检测框架区分人类、机器人与AI智能体,发现最小特征集可实现AI智能体的稳健检测,且基于浏览器自动化的缺失特征构建判别信号,抗规避能力优异。

Comments 17 pages (11 main + appendices), 7 figures. Accepted at the North East AI Agents Day 2026 workshop, Jane Street, New York City. Workshop: https://ne-agents-day.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26307 2026-07-30 cs.AI cs.SE 新提交 57%

TraceCoder: Explainable and Auditable Code Generation with Position-Key Snippet Versioning

TraceCoder:基于位置键代码片段版本控制的可解释可审计代码生成

Rwaida Alssadi, Muntaser Syed, Balaji Kasula, Lamine Deen, Majed Alotaibi, Mohammed Alghamdi, Tyler Ton, Ali Alqarni, Marius Silaghi

机构 * Florida Institute of Technology(佛罗里达理工学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 TraceCoder通过三种机制实现可解释可审计代码生成,在30项算法编程任务上Mean Chg%达30%,使自动代码生成的内部叙事可审计复现,保障生产部署的信任与问责。

Comments Submitted Version (version submitted on May deadline to AGENTICS 2026). Version of Record to appear in AGENTICS proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27195 2026-07-30 quant-ph 新提交 50%

Very Strong Irreversibility of Quantum Entanglement

量子纠缠的极强不可逆性

Tulja Varun Kondra, Raphael Brinster, Hermann Kampermann, Dagmar Bruß, Nikolai Wyderka

专题命中 机器人操作 :manipulation(abstract)

AI总结 该研究证明量子纠缠的不可逆性在指数强逆层面依然存在,解决了Lami与Regula的猜想,还推导了非纠缠操作下指数强逆成本的半定规划下界,并构造了展现该特性的反对称态族。

Comments 6+16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26400 2026-07-30 physics.optics 新提交 50%

Self-similar rigid rotation in anisotropic squeezed Laguerre--Gaussian beams

各向异性压缩拉盖尔-高斯光束中的自相似刚性旋转

D. Aguirre-Olivas, G. Mellado-Villaseñor, B. M. Rodriguez-Lara

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出具有古伊相位控制刚性旋转的各向异性压缩拉盖尔-高斯光束,经实验证实其自相似刚性旋转特性,该光束可作为结构化光平台,有望应用于轴向定位等领域。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26689 2026-07-30 cond-mat.mes-hall cond-mat.supr-con 新提交 50%

Scanning Gate Microscopy Modulation of Supercurrent in Graphene Josephson Junctions

石墨烯约瑟夫森结中超导电流的扫描门显微镜调制

Ivan Villani, Samuele Fracassi, Niccolò Traverso Ziani, Maura Sassetti, Matteo Carrega, Vaidotas Miseikis, Camilla Coletti, Fabio Beltram, Kenji Watanabe, Takashi Taniguchi, Sergio Pezzini, Stefan Heun

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究采用扫描门显微镜探究hBN封装的铌接触石墨烯约瑟夫森结的超导电流调制,实验与数值模拟吻合,为超导现象局域操控奠定基础。

Comments 25 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身导航 7 篇

2607.26914 2026-07-30 cs.RO cs.AI 新提交 81%

BioVLN: A Simulation Platform for Visual Language Navigation in Biomedical Laboratories

BioVLN:生物医学实验室视觉语言导航的仿真平台

Zhe Liu, Quan Lu, Zhaohui Du, Zhe Wang, Huanbo Jin, Jiaming Gu, Qi Wang, Ting Xiao, Minting Pan, Dongzhan Zhou

机构 * East China University of Science and Technology(华东理工大学) Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 该研究针对现有导航平台不适用于实验室仪器的问题,提出BioVLN仿真平台,通过分区域建模仪器实现更精准导航,实验验证其提升成功率并降低安全风险。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26295 2026-07-30 physics.bio-ph cond-mat.stat-mech q-bio.NC 新提交 78%

A behavior-environment information loop drives sensory navigation

行为-环境信息回路驱动感官导航

Kevin S. Chen, Matthew P. Leighton, Damon A. Clark, Thierry Emonet

专题命中 具身导航 :navigation(title,abstract)

AI总结 该研究提出基于传递熵的信息论框架,量化感官与行为的双向信息流,可预测生物与人工系统的导航效率,揭示了驱动导航的通用行为-环境反馈回路。

Comments 14 pages, 6 figures; supplementary information included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26165 2026-07-30 cs.CV 新提交 70%

DVPSFormer: Efficient Online Depth-aware Video Panoptic Segmentation for Autonomous Driving

DVPSFormer:面向自动驾驶的高效在线深度感知视频全景分割

Yung-Hsu Yang, Luigi Piccinelli, Siyuan Li, Mattia Segu, Lei Ke, Martin Danelljan, Yuqian Fu, Zuria Bauer, Fisher Yu, Hermann Blum, Marc Pollefeys

机构 * ETH Zürich(苏黎世联邦理工学院) INSAIT, Sofia University(保加利亚索菲亚大学INSAIT研究所) University of Bonn(波恩大学) Microsoft(微软公司)

专题命中 具身导航 :navigation(abstract);robotic(abstract);分类 cs.CV

AI总结 DVPSFormer是一种统一在线架构,通过ESD和OMV机制实现高效4D场景理解,在两个DVPS基准上达SOTA,为自动驾驶提供在线机器人感知的精简方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27194 2026-07-30 cs.CV cs.RO 新提交 62%

VidMap: Exploiting Temporal Structure for Video-Based Structure-from-Motion

VidMap:利用时序结构实现基于视频的运动恢复结构

Zador Pataki, Paul-Edouard Sarlin, Marc Pollefeys

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌) Microsoft(微软)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 VidMap结合SLAM序列约束与SfM全局优化,利用宽基线匹配和深度先验,在多样挑战性数据集上,较最新SLAM和SfM更鲁棒准确,可实现任意长未标定视频的度量重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26770 2026-07-30 cs.RO 新提交 57%

Vision-TL-Action: Neuro-Symbolic Trajectory Generation from Visual Observations and Temporal Logic

Vision-TL-Action:基于视觉观测和时序逻辑的神经符号轨迹生成

Zezhi Liu, Zhiwei Zheng, Hanqian Luo, Deyun Qin, Shizhen Wu, Yongchun Fang

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 本文提出Vision-TL-Action模型,通过融合视觉与TL节点标记生成动作轨迹,在Panda、AntMaze任务中优于或接近基线,实现无需物体几何信息的视觉到TL目标的轨迹生成。

Comments 17 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26846 2026-07-30 eess.SY cs.SY 新提交 50%

Network Verified NTN Positioning for 6G A Standards Oriented Survey of Hybrid TN NTN Localization

面向6G标准的网络验证NTN定位:混合TN NTN定位综述

Donglin Wang, Zexing Fang, Qiuheng Zhou, Hans D. Schotten

专题命中 具身导航 :navigation(abstract)

AI总结 该综述针对6G标准,梳理了无线定位从传统方案到混合TN NTN 3D网络可验证定位的演进,分析了3GPP标准、方法权衡等,为相关设计提供参考。

Comments 7 pages, 2 figures, IEEE CSCN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26604 2026-07-30 cs.CL 新提交 50%

WikiLoop: Jointly Learning to Build and Navigate Agent-Native Wikis with Downstream Feedback

WikiLoop:基于下游反馈联合学习构建与智能体原生Wiki导航

Haoliang Ming, Feifei Li, Wenhui Que

专题命中 具身导航 :navigation(abstract)

AI总结 WikiLoop是反馈耦合框架,以Qwen3.5-9B为主干,联合学习构建与导航智能体原生Wiki,在AuthTrace等数据集上提升答案正确性,整合两种角色能力且无需特定数据集训练。

Comments 13 pages, 2 figures, 12 tables. Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 具身推理 8 篇

2607.26336 2026-07-30 cs.LG cs.MA cs.RO 新提交 86%

Learning Implicit Causal World Models from Multi-Agent Demonstrations

从多智能体演示中学习隐式因果世界模型

Jasorsi Ghosh

专题命中 具身推理 :world model(title,abstract);navigation(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 该研究针对多智能体系统中世界模型因相关性与因果机制混淆导致分布偏移下失效的问题,提出隐式因果世界模型,经评估在协调任务上表现出可解释因果表示且精度随干预强度提升。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27201 2026-07-30 cs.CL 新提交 82%

Mental World Modeling

心理世界建模

Hao Fei, Yiran Zhao

专题命中 具身推理 :world model(title,abstract)

AI总结 该研究提出将心理变量作为核心组件的MWM框架,实例化为MENTIS基线,实验证明显式建模心理状态对预测人类决策至关重要,推动世界建模从物理场景模拟转向心智模拟。

Comments project website: https://mental-world.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26754 2026-07-30 cs.CV 新提交 79%

StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation

StatePlay:用于机制一致性生成的状态感知游戏世界模型

Zijun Lin, Zeqing Wang, Cheston Tan, Bihan Wen, Yeying Jin

机构 * Tencent(腾讯)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本文提出StatePlay,一种状态感知游戏世界模型,采用混合Transformer架构联合预测视觉内容与游戏状态,经实验验证可提升游戏生成的机制保真度。

Comments Project Page: https://jimntu.github.io/stateplay_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26752 2026-07-30 cs.LG 新提交 79%

CalTwin: Towards Calibrated, Shift-Robust Medical World Models via Fisher-Information Regularisation

CalTwin:基于Fisher信息正则化的校准、分布偏移鲁棒医学世界模型研究

Behraj Khan, Shabir Ahmad, Syed Ahmad Chan Bukhari, Tahir Qasim Syed

机构 * Institute of Business Administration Karachi(卡拉奇商业管理学院) Gachon University(嘉泉大学) St. John’s University(圣约翰大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 本研究提出CalTwin方法,结合Fisher信息偏移惩罚与置信度失配惩罚,应用于GRU医学世界模型,在PhysioNet脓毒症挑战赛上显著降低了分布外隐状态预测误差,同时改善了置信度校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26712 2026-07-30 cs.RO 新提交 79%

ActSWM: Action-Sensitive World Models for Long-Horizon Planning in Open-World Games

ActSWM:面向开放世界游戏长视界规划的动作敏感型世界模型

Zhenfeng Gan, ZiTong Zeng, Jiajun Cheng, Yeke Song, Yongyi Tang, Xueqian Wang

专题命中 具身推理 :world model(title,abstract);分类 cs.RO

AI总结 针对开放世界游戏长视界规划的上下文崩塌问题,提出动作敏感型世界模型ActSWM,通过约束隐式回滚保留动作依赖差异,提升了任务成功率与动作恢复能力。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27036 2026-07-30 cs.CV cs.LG 新提交 73%

Mitigating Compounding Error via Video Representation Regularization

通过视频表示正则化缓解复合误差

Taiye Chen, Qi Zhang, Yisen Wang

机构 * Peking University(北京大学)

专题命中 具身推理 :robotics(abstract);world model(abstract);分类 cs.CV、cs.LG

AI总结 针对视频扩散世界模型自回归生成的复合误差问题,研究发现其与表示维度崩溃相关,提出视频表示正则化方法,在VBench指标上显著优于Diffusion Forcing,提升了长视频生成的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26903 2026-07-30 cs.AI cs.RO 新提交 73%

From Passive Video to Editable Experience: Physically Grounded Experience Synthesis for Embodied Intelligence

从被动视频到可编辑体验:具身智能的物理基础体验合成

Jia Luo

专题命中 具身推理 :embodied AI(abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 针对具身AI的数据瓶颈,提出Pegasus低资源框架,通过结构化知识传递将人类操作视频转化为机器人可学习数据,经多基准与机器人评估验证其跨具身翻译及数据生成的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27145 2026-07-30 cs.CV 新提交 70%

Explainable and Resource-Efficient Spatial Reasoning in Multimodal LLMs for Decision-Critical Applications

面向决策关键型应用的多模态大语言模型中可解释且资源高效的空间推理

Piyush Jain, Kousik Dasgupta, Rajarshi Roy, Subarna Tripathi

机构 * Heritage Institute of Technology(遗产技术学院) Kalyani Government Engineering College(卡利亚尼政府工程学院) IAIRO Intel Corporation(英特尔公司)

专题命中 具身推理 :robotics(abstract);embodied AI(abstract);分类 cs.CV

AI总结 针对多模态大语言模型空间判断不透明及细粒度空间理解不足的问题,提出无需训练的ByDeWay-V2框架,结合YOLO-World-L注入空间谓词,在多个基准上显著提升空间推理性能,适配资源受限场景。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人基础模型 4 篇

2607.27205 2026-07-30 cs.CV cs.RO 新提交 73%

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

TurboVLA:在RTX 4090上以32 Hz运行、显存占用<1 GB的实时视觉-语言-动作模型

Hengyi Xie, Chenfei Yao, Xianjin Wu, Xuanyang Xi, Yiping Tang, Di Xu, Yingying Zhu, Dingkang Liang, Xiang Bai, Han Ding

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Technologies Co. Ltd(华为技术有限公司)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本研究提出TurboVLA,将传统VLA模型的LLM中心路径重构为视觉语言直接映射,仅0.2B参数即可在RTX 4090上实现97.7%LIBERO任务成功率,性能优于更大模型且显存占用极低。

Comments Code is available at https://github.com/H-EmbodVis/TurboVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27138 2026-07-30 cs.RO cs.AI cs.CV 新提交 67%

DLAM: Distributional Latent Actions with Temporal Constraints

DLAM:带时间约束的分布隐式动作模型

Zuojin Tang, Feifan Luo, Haoyun Liu, Botai Yuan, Dekang Qi, Ronghan Chen, Yandan Yang, Tong Lin, Xinyuan Chang, Mu Xu, Bin Liu, De Ma, Zhiheng Ma

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 该研究针对VLA模型数据稀缺问题,提出带时间约束的分布隐式动作模型DLAM,通过特定约束优化隐式动力学,提升了视频重建效果及机器人操作任务的策略性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26807 2026-07-30 cs.RO 新提交 57%

Route by Kinematics, Act by Observation: Kinematics-Supervised Expert Routing in MoE-Augmented VLA

基于运动学的路由、基于观测的执行:MoE增强视觉-语言智能体(VLA)中的运动学监督专家路由

Tianhang Yang, Yanze Zheng, Junjie Wang, Wei-Bin Kou, Ruotong Li, Yujiu Yang

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 本研究针对MoE增强VLA的专家路由问题,提出KinRT方法,通过运动学聚类监督路由器训练,在两个平台上验证其性能优于现有模型,相关代码与平台将开源。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏