arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-10 至 2026-07-10 共收录 24 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 1 篇

2511.08583 2026-07-10 cs.RO cs.LG 版本更新 73%

SeFA-Policy: Fast and Accurate Visuomotor Policy Learning with Selective Flow Alignment

SeFA策略:基于选择性流对齐的快速准确视觉运动策略学习

Rong Xue, Jiageng Mao, Mingtong Zhang, Yue Wang

专题命中 机器人学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 针对机器人模仿学习中视觉运动策略学习难题,提出SeFA框架,用选择性流对齐策略,借助专家示范纠正动作,统一整流流效率与观测一致动作生成,实验显示其超越现有策略,准确性、鲁棒性高且推理延迟大幅降低。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 10 篇

2509.21256 2026-07-10 cs.RO 版本更新 79%

BiNoMaP: Learning Category-Level Bimanual Non-Prehensile Manipulation Primitives

BiNoMaP: 学习类别级双臂非抓取操作原语

Huayi Zhou, Kui Jia

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳))

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 BiNoMaP提出了一种无强化学习的双臂非抓取操作原语学习框架,通过几何感知优化和参数化方法实现类别级泛化和跨平台迁移。

Comments Under review. The project link is https://hnuzhy.github.io/projects/BiNoMaP

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15567 2026-07-10 physics.plasm-ph physics.optics 版本更新 71%

Plasma-state metasurfaces for ultra-intensive field manipulation

用于超高强度场操纵的等离子体态超表面

Zi-Yu Chen, Hao Xu, Jiao Jia, Yanjie Chen, Siyu Chen, Yan Zhang, Mingxuan Wei, Minghao Ma, Runze Li, Fan Yang, Mo Li, Guangwei Lu, Weijun Zhou, Hanmi Mou, Zhuofan Zhang, Zhida Yang, Jian Gao, Feng liu, Boyuan Li, Min Chen, Liming Chen, Yongtian Wang, Lingling Huang, Wenchao Yan, Shuang Zhang, Jie Zhang

专题命中 机器人操作 :manipulation(title)

AI总结 研究旨在将超表面从固体拓展到等离子体领域,通过光子自旋霍尔效应等实验证明了等离子体态超表面,其功能可持续数皮秒,能用于控制高功率激光,有望革新高功率激光操纵能力并推动激光 - 等离子体相互作用创新应用。

Comments 37 pages, 5 figures

Journal ref Light: Science & Applications 15, 307 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20805 2026-07-10 cs.RO cs.CV 版本更新 62%

FunHOI: Annotation-Free 3D Hand-Object Interaction Generation via Functional Text Guidance

FunHOI:通过功能文本引导实现无注释的3D手-物体交互生成

Yongqi Tian, Xueyu Sun, Haoyuan He, jianlei Wang, Caigui Jiang

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) Xi’an Jiaotong University(西安交通大学)

专题命中 机器人操作 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 研究针对手-物体交互中功能抓取语义捕捉难的问题,提出两阶段框架FGS-Net,通过文本引导3D模型生成器FGG和姿态优化策略FGR,无需额外3D注释数据即可实现精确高质量的3D手-物体交互生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30308 2026-07-10 cs.CV 版本更新 57%

The Surprising Effectiveness of Video Diffusion Models for Hand Motion Reconstruction

视频扩散模型在手部运动重建中的惊人有效性

Yuxi Wang, Chengkai Jin, Yufei Liu, Wenqi Ouyang, Tianyi Wei, Zhiwei Zeng, Siyuan Huang, Zhiqi Shen, Xingang Pan

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人操作 :embodied AI(abstract);分类 cs.CV

AI总结 提出ViDiHand,利用预训练视频扩散模型重建4D双手姿态,无需检测器或优化,在多个基准上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12138 2026-07-10 cs.AI cs.CL cs.IR 版本更新 57%

Retrieval-Augmented Generation Must Move Beyond Factual Grounding to Represent Diverse Opinions

检索增强生成必须超越事实基础以代表多样化观点

Aditya Agrawal, Alwarappan Nakkiran, Darshan Fofadiya, Alex Karlsson, Harsha Aduri, Aman Singh Thakur

机构 * Amazon.com(亚马逊公司)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本文指出检索增强生成系统存在系统性事实偏差,并提出需要在检索系统设计上进行范式转变,通过不确定性量化方法提出统一目标,并展示Opinion-Aware RAG架构在两个领域中的实验结果,证明其在多样性、公平性和准确性方面的提升。

Comments 18 pages, Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05459 2026-07-10 cs.LG 版本更新 57%

Beyond Success Rates: Trainability and Extractability for Offline GCRL

超越成功率:离线目标条件强化学习的可训练性和可提取性

Jan Malte Töpperwien, Aditya Mohan, Marius Lindauer

专题命中 机器人操作 :manipulation(abstract);分类 cs.LG

AI总结 研究离线目标条件强化学习中各方法的可训练性和可提取性差距,通过构建可训练性景观及配对提取诊断,发现仅成功率不能确立广泛可提取行为,可训练性景观揭示差距,提取诊断提供低成本视角观察信号成策略的过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23804 2026-07-10 cs.HC eess.SP 版本更新 50%

Perceptually Lossless Tactile Texture Synthesis with Compact Spectral Envelope Models

基于紧凑频谱包络模型的感知无损触觉纹理合成

Jagan K. Balasubramanian, Yasemin Vardar

专题命中 机器人操作 :manipulation(abstract)

AI总结 提出两种紧凑频谱表示(频谱β和频谱斜率)来捕获手指-表面摩擦信号的时间频谱结构,通过感知实验验证其能实现与高保真再现相当的感知真实感,为触觉压缩、通信和合成纹理生成提供高效框架。

Comments 16 pages and 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15612 2026-07-10 cs.CE cs.CR q-fin.TR 版本更新 50%

SoK: Market Microstructure for Decentralized Prediction Markets (DePMs)

SoK:去中心化预测市场(DePMs)的市场微观结构

Nahid Rahman, Joseph Al-Chami, Jeremy Clark

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文通过回顾去中心化预测市场(DePMs)的历史和设计,分析了其模块化工作流程及各模块的设计变体,探讨了去中心化、表达性和抗操纵之间的权衡,并指出了研究中的开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20421 2026-07-10 physics.optics 版本更新 50%

Active control of the peak value of the Hanbury Brown-Twiss effect using coherent light by lensless holographic projection

利用无透镜全息投影的相干光对汉伯里·布朗-特威斯效应峰值进行主动控制

Liming Li, Yuhan Guo, Chunguang Meng, Wenfei Zhang, Gongxiang Wei, Huiqiang Liu, Wei Li

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究利用无透镜全息投影相干光主动控制汉伯里·布朗-特威斯效应峰值\(g^{(2)}(0)\),推导其解析表达式,经实验和模拟验证,通过操纵可控参数建立定制策略,为相关领域高级应用铺路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18061 2026-07-10 quant-ph 版本更新 50%

Planar fault-tolerant logical measurements with low qubit overhead

具有低量子比特开销的平面容错逻辑测量

Yingli Yang, Guo Zhang, Ying Li

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究在平面硬件约束下,利用代码工艺框架设计平面BB码容错逻辑操作,通过局部修改变形代码,经数值优化建立容错,实现多种逻辑操作,结合qLDPC码效率与局部性,为容错量子计算提供实用高效途径。

Comments Published in npj Quantum Information

Journal ref npj Quantum Inf. (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身导航 7 篇

2606.28746 2026-07-10 cs.RO 版本更新 84%

He3-Seeker: Robotic Information Planning for Lunar Helium-3 Distribution Mapping

He3-Seeker:用于月球氦-3分布测绘的机器人信息规划

Dong Li, Yujie Zheng, Chengdeng Cao, Siyu Teng, Yuchen Li, Yang Gao, Long Chen

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Macau University of Science and Technology(澳门科学技术大学) China University of Petroleum-Beijing(中国石油大学(北京)) Wuhan University(武汉大学) Shenzhen University(深圳大学) Technical University of Munich(慕尼黑技术大学) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 具身导航 :robotic(title,abstract);navigation(abstract);分类 cs.RO;robotics(comments)

AI总结 提出He3-Seeker框架,利用机器人信息规划引导自主导航与主动感知,实现基于多点钻探采样和原位分析的月球氦-3分布快速高保真测绘。

Comments Submitted to the International Conference on Space Robotics (iSpaRo) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23571 2026-07-10 cs.LG cs.AI 版本更新 81%

StateLinFormer: Stateful Training Enhancing Long-term Memory in Navigation

StateLinFormer:基于状态训练增强导航中的长期记忆

Zhiyuan Chen, Yuxuan Zhong, Fan Wang, Bo Yu, Pengtao Shao, Shaoshan Liu, Ning Ding

机构 * Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳人工智能与机器人社会研究院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.AI、cs.LG

AI总结 StateLinFormer通过状态化训练机制提升导航任务的长期记忆能力,实验显示其在MAZE和ProcTHOR环境中优于传统模型。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05240 2026-07-10 cs.RO cs.CV 版本更新 81%

StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling

StreamVLN:通过快慢上下文建模实现流式视觉与语言导航

Meng Wei, Chenyang Wan, Xiqian Yu, Tai Wang, Yuqiang Yang, Xiaohan Mao, Chenming Zhu, Wenzhe Cai, Hanqing Wang, Yilun Chen, Xihui Liu, Jiangmiao Pang

机构 * Shanghai AI Lab(上海人工智能实验室) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 研究现实世界中视觉与语言导航问题,提出StreamVLN框架,采用混合快慢上下文建模策略,通过快速流式对话上下文与缓慢更新内存上下文配合,实现实时对话,在VLN-CE基准实验中展现低延迟最优性能。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09016 2026-07-10 cs.RO 版本更新 79%

Open-Vocabulary Object-Goal Navigation by Generalizing Semantic Mapping with Dense CLIP

通过用密集CLIP泛化语义映射实现开放词汇目标导航

Meng Wei, Chenyang Wan, Tai Wang, Yuqiang Yang, Wenzhe Cai, Yilun Chen, Hanqing Wang, Jiangmiao Pang, Xihui Liu

机构 * Shanghai AI Lab(上海人工智能实验室) The University of Hong Kong(香港大学) Zhejiang University(浙江大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 研究面向对象的实体导航任务,提出OVExp框架,利用密集CLIP模型展示基于语义地图的目标预测网络泛化能力,设计跨模态转移策略解决训练成本高问题,在ObjectNav基准上对未知目标有强大泛化能力。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18999 2026-07-10 cs.RO cs.AI cs.CV 版本更新 67%

OREN: Octree Residual Network for Real-Time Euclidean Signed Distance Mapping

OREN:八叉树残差网络用于实时欧几里得符号距离映射

Zhirui Dai, Qihao Qian, Tianxing Fan, Nikolay Atanasov

机构 * Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电子与计算机工程系)

专题命中 具身导航 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 OREN结合八叉树插值的显式先验和神经网络回归的隐式残差,实现高效且可微的非截断SDF重建,优于现有方法的准确性和效率。

Comments Accepted to IEEE/RSJ International Conference Intelligent Robots & Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06820 2026-07-10 cond-mat.mtrl-sci 版本更新 50%

Bgolearn: a Unified Bayesian Optimization Framework for Accelerating Materials Discovery

Bgolearn:用于加速材料发现的统一贝叶斯优化框架

Bin Cao, Jie Xiong, Jiaxuan Ma, Yuan Tian, Yirui Hu, Mengwei He, Longhan Zhang, Jiayu Wang, Jian Hui, Li Liu, Dezhen Xue, Turab Lookman, Jun Wang, Tong-Yi Zhang

专题命中 具身导航 :navigation(abstract)

AI总结 研究针对加速材料发现中探索成分和加工空间的挑战,提出Bgolearn框架,通过直观接口等将贝叶斯优化引入材料研究,支持多种优化策略,经基准研究和案例验证,减少实验量且提升效果,建立了实用的贝叶斯优化平台。

Journal ref npj computational materials 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16216 2026-07-10 q-bio.NC math.AT 版本更新 50%

Topological decoding of grid cell activity via path lifting to covering spaces

通过将路径提升到覆盖空间对网格细胞活动进行拓扑解码

Yuxing Jared Yao, Iris H. R. Yoon

专题命中 具身导航 :navigation(abstract)

AI总结 研究大脑如何利用环形流形理解空间环境的问题,提出用拓扑数据分析和路径提升从网格细胞活动解码空间信息的方法,经模拟和实验验证,能从单个网格细胞模块重建轨迹,为空间导航提供潜在机制。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人基础模型 1 篇

2601.00969 2026-07-10 cs.RO cs.AI 版本更新 73%

V-VLAPS: Value-Guided Planning for Vision-Language-Action Models

V-VLAPS:面向视觉-语言-动作模型的价值引导规划

Ke Ren, Ali Salamatian, Kieran Pattison, Cyrus Neary

机构 * The University of British Columbia(不列颠哥伦比亚大学)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出V-VLAPS方法,通过在VLA模型上增加轻量级价值头预测蒙特卡洛回报,引导蒙特卡洛树搜索选择高价值分支,从而提升长时域任务下的规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 模仿学习与强化学习 1 篇

2603.15136 2026-07-10 cs.LG cs.AI 版本更新 62%

Safe Flow Q-Learning: Offline Safe Reinforcement Learning with Reachability-Based Flow Policies

安全流Q学习:基于可达性的安全离线强化学习流策略

Mumuksh Tayal, Manan Tayal, Ravi Prakash

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Safe Flow Q-Learning,结合达性启发的安全价值函数和高效的一步流策略,通过自一致性Bellman递归学习安全价值,行为克隆训练流策略并转化为奖励最大化安全动作选择器,减少部署时的拒绝采样,提升实时安全应用性能。

Comments 21 pages, 6 figures, 3 tables; First 2 authors have contributed equally; Paper accepted at Reinforcement Learning Conference (RLC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 人机交互与遥操作 1 篇

2511.03075 2026-07-10 cs.RO 版本更新 79%

A Collaborative Reasoning Framework for Anomaly Diagnostics in Underwater Robotics

水下机器人异常诊断的协作推理框架

Markus Buchholz, Niamh Ellis, Rahaf Abu Hara, Ignacio Carlucho, Yvan R. Petillot

机构 * School of Engineering & Physical Sciences, Heriot-Watt University(工程与物理科学学院,赫瑞斯泰大学)

专题命中 人机交互与遥操作 :robotics(title,abstract);分类 cs.RO

AI总结 研究水下机器人异常诊断,提出AURA协作框架,集成大语言模型、数字孪生和人在回路交互,通过两个代理进行异常检测与诊断,经人类验证的诊断转化为训练示例完善模型,建立可信赖、不断改进的人机团队模式。

Comments Paper was submitted for ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 机器人数据与评测 2 篇

2510.04100 2026-07-10 cs.CV cs.AI 版本更新 62%

TOPO-Bench: An Open-Source Topological Mapping Evaluation Framework with Quantifiable Perceptual Aliasing

TOPO-Bench:一个具有可量化感知混叠的开源拓扑映射评估框架

Jiaming Wang, Jizhuo Chen, Diwen Liu, Harold Soh

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 针对拓扑映射缺乏标准评估体系及感知混叠量化不足的问题,提出将拓扑一致性形式化并以定位精度为替代指标,还给出数据集模糊度定量度量,开源相关数据集、基线及工具,推动拓扑映射研究的一致性与可重复性。

Comments Jiaming Wang, Diwen Liu, and Jizhuo Chen contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18235 2026-07-10 cs.CV cs.RO 版本更新 62%

BiasBench: A reproducible benchmark for tuning the biases of event cameras

BiasBench:用于调整事件相机偏差的可重现基准测试

Andreas Ziegler, David Joseph, Thomas Gossard, Emil Moldovan, Andreas Zell

机构 * Cognitive Systems Group, University of Tübingen(图宾根大学认知系统组)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 研究针对事件相机偏差调整工具少的问题,提出BiasBench这一包含多场景的可重现事件数据集,并展示三个场景及下游应用质量指标,还提出基于强化学习的方法促进在线偏差调整。

Comments Accepted to CVPR 2025 Workshop on Event-based Vision

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他机器人 1 篇

2303.04203 2026-07-10 cs.LG cs.CV 版本更新 62%

Computation, Condensation, and the Incompleteness Between Them: A Coupled Foundation of Intelligence

计算、凝聚及其之间的不完备性:智能的耦合基础

Xin Li

机构 * Department of Computer Science, University at Albany, SUNY(计算机科学系,阿尔巴尼大学,SUNY)

专题命中 其他机器人 :embodied agent(abstract);分类 cs.CV、cs.LG

AI总结 该研究探讨计算理论与智能所回答问题的差异,指出智能需计算与记忆两个算子耦合,证明单独算子不完备,确定耦合代价是关键操作不可判定且有误差下限,认为耦合是普遍法则并给出其可证伪核心与范围。

详情

展开后加载摘要…

URL PDF HTML 收藏