arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-27 至 2026-07-27 共收录 20 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 8 篇

2607.14021 2026-07-27 cs.RO 版本更新 85%

Industrial Dexterity Benchmark: A Hardware-Software Benchmarking Platform for Industrial Dexterous Manipulation

工业灵巧性基准测试:一个用于工业灵巧操作的硬件-软件基准测试平台

Honglu He, Jacob Laufer, Zhiwu Zheng, David Elkan-gonzalez, Raman Goyal, Xinyi Li, Su Lu, Mishek Musa, Berke Saat, Nicolas Tan, Colm Prendergast

机构 * Analog Devices, Inc.(亚德诺半导体技术有限公司)

专题命中 机器人操作 :manipulation(title,abstract);robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 针对工业灵巧操作瓶颈,提出从经典流程到端到端多模态模仿学习框架的转变,介绍了IDB板、DAG-ROS框架和AG-iDP3策略框架,通过数据中心电缆操作实验表明新策略在多方面优于传统方法,推动向可扩展机器人自动化发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25672 2026-07-27 cs.RO 版本更新 83%

Compliant Non-Prehensile Pushing Manipulation

顺应性非抓取推动操作

Francesco Cufino, Mario Selvaggio, Fabio Amadio, Fabio Ruggiero

机构 * PRISMA Lab, department of Electrical Engineering and Information Technology of the University of Naples Federico II(PRISMA实验室,那不勒斯费德里科二世大学电气工程与信息科技系) Inria, CNRS, Université de Lorraine(Inria、CNRS、洛林大学) ABB Corporate Research Center(ABB企业研究中心)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 针对顺应性机器人系统中的非抓取推动操作,提出基于阻抗控制与模型预测控制的框架,通过优化位置/速度设定点实现顺应性推动,并集成能量罐无源性滤波器保证安全交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29662 2026-07-27 cs.CV cs.RO 版本更新 81%

SAFE-Pruner: Semantic Attention-Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation

SAFE-Pruner: 语义注意力引导的未来感知令牌剪枝用于高效视觉-语言-动作操控

Shilin Ma, Chubin Zhang, Changyuan Wang, Yuji Wang, Yue Wu, Zixuan Wang, Jingqi Tian, Zheng Zhu, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

专题命中 机器人操作 :manipulation(title);robotic(abstract);分类 cs.RO、cs.CV

AI总结 针对视觉-语言-动作模型推理加速中现有剪枝方法忽略深层视觉信息的问题,提出SAFE-Pruner框架,通过引入未来层注意力线索和语义注意力一致性实现前瞻性令牌剪枝,在仿真和真实实验中取得最高1.89倍加速且成功率下降小于1.7%。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21049 2026-07-27 cs.RO 版本更新 79%

GuidedAttention: Interpretable and Correctable Visual Attention for OOD-Robust Robot Manipulation via Imitation Learning

引导注意力:通过模仿学习实现面向OOD鲁棒机器人操纵的可解释和可校正视觉注意力

Masaki Murooka, Ryoichi Nakajo, Keisuke Shirai, Tomohiro Motoda, Hanbit Oh, Ryo Hanai, Yukiyasu Domae

机构 * Artificial Intelligence Research Center, National Institute of Advanced Industrial Science and Technology (AIST)(日本产业技术综合研究所人工智能研究中心)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 研究针对端到端视觉运动策略中人类难以理解和校正视觉注意力的问题,提出引导注意力框架,通过预测任务相关注意力关键点并结合扩散动作策略,经用户校正后由跟踪模块传播,提升了机器人在OOD条件下的操纵性能。

Comments Project page added

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02024 2026-07-27 cs.AI 版本更新 57%

From Mind to Machine: The Rise of Manus AI as a Fully Autonomous Digital Agent

从心智到机器:Manus AI作为完全自主数字代理的崛起

Minjie Shen, Yanshu Li, Lulu Chen, Zhichao Fan, Yanhang Li, Qikai Yang, Haochen Yang

机构 * Department of Electrical and Computer Engineering, Virginia Tech(弗吉尼亚理工学院电气与计算机工程系) Department of Computer Science, Brown University(布朗大学计算机科学系) Department of Computer Science, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系) Khoury College of Computer Sciences, Northeastern University(东北大学科里尔计算机科学学院)

专题命中 机器人操作 :robotics(abstract);分类 cs.AI

AI总结 Manus AI是一款通用人工智能代理,结合大语言模型的推理与规划能力,执行复杂任务并产生实际成果,本文全面介绍了其技术架构、跨行业应用及未来潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10058 2026-07-27 cs.CV 版本更新 57%

Color Me Correctly: Bridging Perceptual Color Spaces and Text Embeddings for Improved Diffusion Generation

正确为我上色:弥合感知颜色空间与文本嵌入以改进扩散生成

Sung-Lin Tsai, Bo-Lun Huang, Yu Ting Shen, Cheng Yu Yeo, Chiang Tseng, Bo-Kai Ruan, Wen-Sheng Lien, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 研究文本到图像生成中颜色对齐问题,提出利用大语言模型消除颜色提示歧义、在文本嵌入空间指导颜色混合操作的无需训练框架,提高了颜色准确性且不影响图像质量,弥合文本语义与视觉生成差距。

Comments Accepted to ACM Multimedia 2025 (MM '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08797 2026-07-27 cs.CV 版本更新 57%

HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation

混元视频-HOMA:多模态驱动人体动画中的通用人机交互

Ziyao Huang, Zixiang Zhou, Juan Cao, Yifeng Ma, Yi Chen, Zejing Rao, Zhiyong Xu, Hongmei Wang, Qin Lin, Yuan Zhou, Qinglin Lu, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯混元)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 针对人体-物体交互视频生成的局限,提出混元视频-HOMA弱条件多模态驱动框架,通过稀疏解耦运动引导等方法,将外观和运动信号编码融合,经优化训练,在弱监督下性能达先进水平,还具文本生成和物体操纵通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21144 2026-07-27 cond-mat.quant-gas quant-ph 版本更新 50%

Generating persistent-current superpositions in Bose-Einstein condensates using dynamic optical potentials

利用动态光学势在玻色-爱因斯坦凝聚体中生成持久电流叠加

Renzo Testa, Donatella Cassettari

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出利用动态光学势在玻色-爱因斯坦凝聚体中生成高保真度的持久电流叠加,并分析了其稳定性。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 7 篇

2607.14514 2026-07-27 cs.CV cs.AI 版本更新 81%

VTM-Nav: Harnessing Cross-Episode Experience for Object-Goal Navigation with Hierarchical Visual-Topological Memory

VTM-Nav:用于跨情节对象目标导航的分层视觉拓扑记忆

Xiaoran Xu, Yupeng Wu, Tianyu Xue, Yifan Xu, Xuanran Dong, Xiaoshan Yang, Changsheng Xu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学交叉科学学院) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.AI、cs.CV

AI总结 研究跨情节对象目标导航问题,提出无训练的VLM导航框架\method,其带有分层视觉拓扑记忆,通过粗到细匹配检索经验,在三个基准测试中性能最佳,证明跨数据集结构化视觉拓扑经验复用有效且鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12291 2026-07-27 cs.RO cs.CV 版本更新 81%

OpenNavMap: Multi-Session Appearance-Based Topometric Mapping for Scalable Visual Navigation

OpenNavMap: 无需结构的拓扑制图通过大规模协作定位

Jianhao Jiao, Changkun Liu, Jingwen Yu, Boyi Liu, Qianyi Zhang, Yue Wang, Dimitrios Kanoulas

机构 * Robot Perception and Learning Lab, Intelligent Robotics, Department of Computer Science, University College London(机器人感知与学习实验室,智能机器人,计算机科学系,伦敦大学学院) Department of Computer Science and Engineering, Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) Department of Electronic and Computer Engineering, Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学) Institute of Robotics and Automatic Information System, Nankai University(机器人与自动信息系统研究所,南开大学) College of control science and engineering, Zhejiang University(控制科学与工程学院,浙江大学) AI Centre, Department of Computer Science, University College London(人工智能中心,计算机科学系,伦敦大学学院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 OpenNavMap通过大规模协作定位实现无需结构的拓扑制图,利用3D几何模型进行按需重建,实现高精度的子图对齐和全局一致性。

Comments 21 pages, 20 figures, https://rpl-cs-ucl.github.io/OpenNavMap_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11204 2026-07-27 cs.RO 版本更新 79%

Stop to Decide: Latency-Aware Proprioceptive Navigation Primitives for Mapping-Free Quadruped Inspection

停止并决策:用于无地图四足机器人巡检的延迟感知本体导航原语

Hanting Suo, Haonan Yan, Liang Wang, Aiguo Song

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 研究计算能力受限的四足机器人导航延迟问题,提出基于逻辑剂量 - 反应模型的方法,探测器位于机载无地图无学习堆栈中,能在多种任务中良好表现,完成巡检路线,给出了如临界循环速率等部署规则。

Comments 29 pages, 10 figures, 8 tables. Hanting Suo and Haonan Yan contributed equally. Revised framing, presentation, and discussion; experimental results are unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20679 2026-07-27 cs.RO 版本更新 74%

Towards Capability-Aware Traversability Navigation for Unstructured Environments

面向非结构化环境的能力感知可通行性导航

Gianluca Capezzuto, Felipe Tommaselli, Matheus P. Angarola, Ricardo V. Godoy, Marcelo Becker

机构 * University of São Paulo(圣保罗大学)

专题命中 具身导航 :navigation(title);分类 cs.RO

AI总结 研究非结构化环境中可通行性估计,提出能力感知可通行性(CAT)框架,将物理限制嵌入空间特征空间,通过交互式标注和SPADE块改进可通行性预测,在多数据集上领先,实现实例感知避障。

Comments 8 pages, 7 figures. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). Project page: https://capability-aware-traversability.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20517 2026-07-27 math.DS math.OC stat.CO 版本更新 50%

Transient Stability of Nonlinear Stochastic Dynamics: A Finite-Amplitude Logarithmic Measure Framework

传感器数据注入非线性随机飞行动力学中的暂态不稳定性边界

Surya Ratna Prakash D, Soumyendu Raha

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出基于对数范数的框架,用于分析非线性Ito随机微分方程的有限时间暂态稳定性,揭示均值与路径行为的区别,并展示数据约束动态中的稳定性与鲁棒性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01844 2026-07-27 quant-ph cond-mat.mtrl-sci 版本更新 50%

Mapping g-factors and complex intervalley coupling in Si/SiGe by conveyor-mode shuttling

在Si/SiGe中通过传送模式穿梭映射g因子和复杂谷间耦合

Mats Volmer, Tom Struck, Arnau Sala, Jhih-Sian Tu, Stefan Trellenkamp, Davide Degli Esposti, Giordano Scappucci, Hendrik Bluhm, Łukasz Cywiński, Lars R. Schreiber

专题命中 具身导航 :manipulation(abstract)

AI总结 本研究通过传送模式穿梭技术实现了Si/SiGe中量子点g因子和谷间耦合的高精度映射,为量子芯片研发提供关键数据。

Comments 21 pages, 10 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19345 2026-07-27 cs.HC 版本更新 50%

Navigating the Last Mile: Evaluating Head- and Cane-Mounted Cameras for Egocentric Spatial Awareness

解决最后一公里问题:评估用于自我中心空间感知的头戴式和手杖式摄像头

Apurv Varshney, Lucas Nadolskis, Tobias Höllerer, Michael Beyeler

专题命中 具身导航 :navigation(abstract)

AI总结 研究盲人行人“最后一公里”导航问题,通过混合方法,调查盲人使用者习惯并进行案例研究,用SLAM和NeRFs比较头戴与手杖式摄像头,发现核心权衡,为混合XR系统架构提供考量。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 2 篇

2607.19190 2026-07-27 cs.RO cs.AI 版本更新 88%

Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents

智能体真实到模拟:使用视觉语言智能体进行基于物理的世界建模

Guanxiong Chen, Qianjun Xia, Jiawei Peng, Heng Zhang, Bole Ma, Justin Qian, Ziyi Jiao, Bingyang Zhou, Luoxin Ye, Kaifeng Zhang, Kunyi Wang, Weijia Zeng, Yunuo Chen, Pengzhi Yang, Ziqiu Zeng, Siyuan Luo, Huamin Wang, Chao Liu, Alan Yuille, Fan Shi, Changxi Zheng, Yunzhu Li, Chenfanfu Jiang, Peter Yichen Chen

机构 * University of British Columbia(英属哥伦比亚大学) Johns Hopkins University(约翰·霍普金斯大学) National University of Singapore(新加坡国立大学) Columbia University(哥伦比亚大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Style3D(无合适对应中文名)

专题命中 具身推理 :world model(title,abstract);robotics(abstract);manipulation(abstract);robotic(abstract)

AI总结 研究针对机器人与物体交互的真实到模拟转换难题,提出智能体真实到模拟框架,利用视觉语言智能体进行广义物理世界建模,能转换真实记录为可模拟孪生体,在多场景评估效果良好,成本低,可用于下游机器人任务。

Comments Authorship change

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10135 2026-07-27 cs.CV cs.AI 版本更新 81%

BiWM: Advancing Open-Source Interactive Video World Models with Bidirectional Autoregression

BiWM:利用双向自回归推进开源交互式视频世界模型

Shaohao Rui, Xiaofeng Mao, Zhanyu Zhang, Peijia Lin, Yansong Zhu, Yibo Zhang, Haibin Wan, Zhangrui Zhao, Weijie Ma

机构 * LynnReal AI Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 提出BiWM框架,通过双向自回归范式将预训练视频骨干转化为交互式世界模型,仅需两阶段训练(微调+分布匹配蒸馏),支持多尺度模型和长程生成,优于现有因果流水线。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人数据与评测 3 篇

2604.26577 2026-07-27 cs.AI cs.CY cs.RO 版本更新 84%

Benchmarking the Safety of Large Language Models for Robotic Health Attendant Control

对大型语言模型在机器人健康护理员控制中的安全性的基准测试

Mahiro Nakao, Kazuhiro Takemoto

机构 * Kyushu Institute of Technology(九州工业技术大学)

专题命中 机器人数据与评测 :robotic(title,abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文通过270条有害指令评估72个LLM,在模拟环境中测试其安全性,发现模型大小和发布日期影响安全性能,专有模型更安全,但医疗领域微调和提示防御策略效果有限,需将安全性作为首要考量。

Comments 20 pages, 9 figures, 3 tables, 8 pages supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03159 2026-07-27 cs.CV cs.AI cs.RO 版本更新 82%

NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation

NVIDIA OmniDreams:用于闭环自动驾驶仿真的实时生成式世界模型

NVIDIA, :, Aarti Basant, Amlan Kar, Despoina Paschalidou, Fangyin Wei, Francesco Ferroni, Guillermo Garcia Cobo, Haithem Turki, Huan Ling, Jaewoo Seo, James Lucas, Jay Zhangjie Wu, Jialiang Wang, Jonathan Lorraine, Jun Gao, Kai He, Katarina Tothova, Kevin Xie, Michał Tyszkiewicz, Qi Wu, Riccardo de Lutio, Ruilong Li, Sanja Fidler, Seung Wook Kim, Tianchang Shen, Tianshi Cao, Tobias Pfaff, William Lew, Xindi Wu, Xuanchi Ren, Yifan Lu, Yuxuan Zhang, Zan Gojcic, Zian Wang

专题命中 机器人数据与评测 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出OmniDreams,一个基于Cosmos扩散模型训练的基础生成式世界模型,通过自回归生成动作条件视频,实现闭环仿真中复杂长尾场景的实时合成,并验证其在策略模型训练中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00713 2026-07-27 cs.CV 版本更新 79%

RAD: A Dataset and Benchmark for Real-Life Anomaly Detection with Robotic Observations

RAD:面向机器人观测的真实异常检测数据集与基准

Kaichen Zhou, Xinhai Chang, Taewhan Kim, Jiadong Zhang, Yang Cao, Chufei Peng, Fangneng Zhan, Hao Zhao, Hao Dong, Kai Ming Ting, Ye Zhu

机构 * Massachusetts Institute of Technology(麻省理工学院) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Great Bay University(大湾大学) Harvard University(哈佛大学) Tsinghua University(清华大学) Nanjing University(南京大学) Deakin University(德克萨斯大学)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.CV

AI总结 提出RAD数据集,包含13类日常物体和4种缺陷,从60多个机器人视角在非受控光照下采集,用于评估2D特征、3D重建和视觉语言模型在姿态无关的异常检测中的表现,发现2D方法优于3D和VLM方法。

详情

展开后加载摘要…

URL PDF HTML 收藏