arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-26 至 2026-06-26 共收录 17 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 7 篇

2601.20381 2026-06-26 cs.RO 版本更新 89%

STORM: Slot-based Task-aware Object-centric Representation for robotic Manipulation

STORM:基于槽的任务感知面向对象的机器人操作表示

Alexandre Chapin, Emmanuel Dellandréa, Liming Chen

机构 * Ecole Centrale de Lyon, LIRIS(里尔森中央理工大学,LIRIS实验室)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);robotics(abstract);分类 cs.RO

AI总结 提出STORM模块,通过多阶段训练策略将冻结的视觉基础模型与语义感知槽结合,生成面向对象的任务感知表示,提升机器人操作在视觉干扰下的泛化性和控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04949 2026-06-26 cs.RO 版本更新 83%

Monte Carlo Tree Search with Tensor Factorization for Optimization Problems in Robotics

基于张量分解的蒙特卡洛树搜索用于机器人优化问题

Teng Xue, Yan Zhang, Amirreza Razmjoo, Sylvain Calinon

机构 * Idiap Research Institute(Idiap研究机构) École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院洛桑分校)

专题命中 机器人操作 :robotics(title);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出TTTS算法,利用张量分解压缩决策树分支间的隐式相关性,以线性复杂度降低MCTS的计算和存储开销,在逆运动学、运动规划、多阶段操作等任务中实现高效全局优化。

Comments 25 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00827 2026-06-26 cs.LG cs.AI 版本更新 81%

Beyond Independent Manipulation: Individual Fairness-aware Strategic Classification with Peer Imitation

超越独立操纵:具有同伴模仿的个体公平感知策略分类

Xinpeng Lv, Chunyuan Zheng, Yunxin Mao, Renzhe Xu, Jinxuan Yang, Yuanlong Chen, Wangrong Huang, Shaowu Yang, Wenjing Yang, Xinwang Liu, Peng Cui, Haotian Wang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) School of Mathematical Sciences, Peking University(北京大学数学学院) Institute for Theoretical Computer Science, Shanghai University of Finance and Economics(上海财经大学理论计算机科学研究所) Information Technology Development, Aetos Capital Group, Sydney(悉尼Aetos资本集团信息技术部) Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.AI、cs.LG

AI总结 提出个体公平感知策略分类(IFSC)框架,通过建模基于个体公平的同伴驱动操纵(模仿邻近被接受同伴),并采用鲁棒学习过程处理同伴可观测性不确定性,以改善个体公平一致性并减轻模仿引起的扭曲。

Comments Accepted by SIGKDD2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11755 2026-06-26 cs.CV 版本更新 70%

Controllable Egocentric Video Generation via Occlusion-Aware Sparse 3D Hand Joints

可控的第一人称视角视频生成:基于遮挡感知的稀疏3D手部关节点

Chenyangguang Zhang, Botao Ye, Boqi Chen, Alexandros Delitzas, Fangjinhua Wang, Marc Pollefeys, Xi Wang

机构 * ETH Zurich(苏黎世联邦理工学院) MPI for Informatics(信息研究所) Microsoft(微软)

专题命中 机器人操作 :world model(abstract);robotic(abstract);分类 cs.CV

AI总结 提出利用稀疏3D手部关节点作为显式控制信号,通过遮挡感知特征提取和3D加权机制,实现高保真、3D一致的第一人称手物交互视频生成。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11906 2026-06-26 cs.RO 版本更新 70%

Visual-Language-Guided Task Planning for Horticultural Robots

面向园艺机器人的视觉-语言引导任务规划

Jose Cuaran, Kendall Koe, Aditya Potnis, Naveen Kumar Uppalapati, Girish Chowdhary

机构 * the Siebel School of Computing and Data Science(塞比尔计算与数据科学学院) the Department of Agricultural and Biological Engineering(农业与生物工程系) National Center for Supercomputing Applications(国家超级计算中心)

专题命中 机器人操作 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 提出一种模块化框架,利用视觉语言模型(VLM)主动查询异构数据源来引导机器人任务规划,在单作和混作环境中进行短期和长期作物监测任务基准测试,发现零样本VLM在短期任务中表现稳健(成功率87%),但长期多目标任务成功率低于10%,且依赖噪声语义地图时性能下降。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09241 2026-06-26 cs.RO 版本更新 57%

Real-Time Safety Evaluation of Human Arm Operations Using a Wrist-Mounted IMU with PSM System

基于腕戴式IMU与PSM系统的人体手臂操作实时安全评估

Musab Zubair Inamdar, Alhusain Al Hadrami, Seyed Amir Tafrishi

机构 * Geometric Mechanics and Mechatronics in Robotics (gm 2 R) Lab, School of Engineering, Cardiff University(几何力学与机电一体化机器人实验室,工程学院,卡迪夫大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 提出一种集成腕戴式惯性测量单元(IMU)与预测安全模型(PSM)的实时安全监测方法,通过弹簧-阻尼-质量模型优化手腕运动,采用基于阻抗的概率安全评估,在三种制造任务中验证了有效性。

Comments 6 pages, Accepted to TAROS2026, Manchester

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24150 2026-06-26 eess.SP 版本更新 50%

Channel Estimation for Beyond Diagonal RIS Exploiting Core Tensor Sparsity

利用核心张量稀疏性的超对角可重构智能表面信道估计

Daniel Costa Araújo, André L. F. de Almeida

专题命中 机器人操作 :manipulation(abstract)

AI总结 针对超对角可重构智能表面(BD-RIS)的信道估计难题,提出利用测量张量的稀疏Tucker分解和信道分量的Kronecker秩一结构的压缩感知框架,开发了STORM和STAR两种算法,实现联合稀疏支撑识别和Kronecker秩一分解,显著降低测量开销。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 6 篇

2603.06480 2026-06-26 cs.RO 版本更新 83%

History-Conditioned Spatio-Temporal Visual Token Pruning for Efficient Vision-Language Navigation

基于历史条件的时空视觉令牌剪枝用于高效视觉-语言导航

Qitong Wang, Yijun Liang, Ming Li, Tianyi Zhou, Christopher Rasmussen

机构 * Department of Computer and Information Sciences at the University of Delaware(德克萨斯大学达勒姆分校计算机与信息科学系) University of Maryland’s Department of Computer Science(马里兰大学计算机科学系) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 提出一种无需训练的时空视觉令牌剪枝框架,通过空间令牌选择和时空压缩减少冗余计算,在保持导航精度的同时显著提升推理效率,并在真实机器人上验证了低延迟指令跟随导航。

Comments International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16932 2026-06-26 cs.RO 版本更新 79%

BAT-Nav: Budget-Aware Arbitration and Termination for Long-Horizon Semantic Navigation

MORN: 为资源理性长周期导航的元认知目标-目标调节

Xi Lin, Kangyi Wu, Jiayi Li, Jiaqiao Tang, Qingrong He, Lin Zhao

机构 * LCSR Lab, Johns Hopkins University(约翰霍普金斯大学LCSR实验室) Xi’an Jiaotong University(西安交通大学) JD Explore Academy, Beijing, China(京东探索研究院,北京,中国)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出MORN,一种基于双过程理论的元认知导航架构,通过引入资源理性机制,解决传统导航系统在长周期任务中因缺乏全局资源意识导致的资源浪费问题,提升了目标完成率和任务效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01461 2026-06-26 cs.CV 版本更新 79%

UltraStar: Semantic-Aware Star Graph Modeling for Echocardiography Navigation

UltraStar: 面向超声心动图导航的语义感知星图建模

Teng Wang, Haojun Jiang, Chenxi Li, Diwen Wang, Yihang Tang, Zhenguo Sun, Yujiao Deng, Shiji Song, Gao Huang

机构 * Department of Automation, BNRist, Tsinghua University, Beijing, China(自动化系、BNRist、清华大学、北京、中国) School of Automation, Beijing Institute of Technology, Beijing, China(自动化学院、北京理工大学、北京、中国) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院、北京、中国) Chinese PLA General Hospital, Beijing, China(中国人民解放军总医院、北京、中国)

专题命中 具身导航 :navigation(title,abstract);分类 cs.CV

AI总结 提出UltraStar方法,通过星图将探头导航从路径回归重构为基于锚点的全局定位,并采用语义感知采样策略选择代表性关键帧,有效处理噪声轨迹,在131万样本数据集上优于基线方法。

Comments Accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08639 2026-06-26 cs.CY cs.AI cs.DL 版本更新 57%

The Journal of Prompt-Engineered (Moral) Philosophy Or: Why AI-Assisted Ethics Research Requires Process Transparency

提示工程(道德)哲学杂志或:为何AI辅助伦理研究需要过程透明

Michele Loi

机构 * University of Milan(米兰大学)

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 本文探讨了AI辅助伦理研究中过程透明的必要性,提出透明义务应基于主体完整性,通过五个透明元素构建文档充分性框架,以实现未来规范性判断的可能。

Comments 21 pages Transparency material documenting LLM usage available at: https://github.com/MicheleLoi/JPEP.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06080 2026-06-26 cs.CV cs.CY cs.HC 版本更新 57%

AIDEN: Design and Pilot Study of an AI Assistant for the Visually Impaired

AIDEN:面向视障人士的AI助手设计与初步研究

Luis Marquez-Carpintero, Francisco Gomez-Donoso, Zuria Bauer, Bessie Dominguez-Dager, Alvaro Belmonte-Baeza, Mónica Pina-Navarro, Francisco Morillas-Espejo, Felix Escalona, Miguel Cazorla

机构 * Institute for Computer Research, University of Alicante(计算机研究所,阿利坎特大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 提出AIDEN系统,结合YOLO实时目标检测、LLaVA场景描述与OCR,以及基于盖革计数器隐喻的连续触觉引导,避免听觉过载并保护隐私,实验表明用户满意度高。

Journal ref IEEE Access 14 (2026) 80406-80420

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17916 2026-06-26 cs.CV 版本更新 57%

EndoUFM: Utilizing Foundation Models for Monocular depth estimation of endoscopic images

EndoUFM:利用基础模型进行内窥镜图像的单目深度估计

Xinning Yao, Bo Liu, Bojian Li, Jingjing Wang, Jinghua Yue, Fugen Zhou

机构 * Image Processing Center, Beihang University(北京航空航天大学图像处理中心) State Key Laboratory of High-Efficiency Reusable Aerospace Transportation Technology(高效可重复航天运输技术国家重点实验室)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 提出EndoUFM框架,通过双基础模型和自适应微调策略(RVLoRA和Res-DSC)提升内窥镜图像单目深度估计性能,在多个数据集上达到最优。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 1 篇

2606.03371 2026-06-26 cs.CL 版本更新 78%

See, Infer, Intervene: Proactive World Modeling for Goal-Oriented Social Intelligence

观察、推断、干预:面向目标导向社交智能的主动世界建模

Honghui Zhang, Chenmeinian Guo, Yichen Yu, Guanyu Liu, Yujia Zhang, Yongming Qin, Chongguo Song, Mengyue Yang, Lei Yu, Tianyu Shi

机构 * Mita Technology(Mita技术公司) University of Bristol(布里斯托大学) University of Toronto(多伦多大学) McGill University(麦吉尔大学)

专题命中 具身推理 :world model(title,abstract)

AI总结 提出 See-Infer-Intervene (SII) 框架和主动意图世界模型 (PIWM),通过观察顾客行为、推断潜在意图并选择干预动作,实现零售场景中的主动辅助,在 GuidanceSalesBench 基准上达到 0.641 macro F1。

Comments 16 pages, 3 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 1 篇

2604.01849 2026-06-26 cs.CL 版本更新 50%

From Guessing to Placeholding: A Cost-Theoretic Framework for Uncertainty-Aware Code Completion

从猜测到占位:一种基于代价理论的不确定性感知代码补全框架

Liang Zhu, Haolin Chen, Lidong Zhao, Xian Wu

机构 * Tencent, Shenzhen, China(腾讯深圳公司)

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 针对硬补全范式在不确定上下文中生成错误代码的问题,提出自适应占位补全框架,在高熵位置输出占位符,理论证明其期望代价低于硬补全,实验显示编辑代价降低19%-50%。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人数据与评测 2 篇

2501.19274 2026-06-26 cs.RO 版本更新 57%

GO: The Great Outdoors Multimodal Dataset

GO: 大户外多模态数据集

Peng Jiang, Kasi Viswanath, Akhil Nagariya, George Chustz, Maggie Wigness, Philip Osteen, Timothy Overbye, Christian Ellis, Long Quang, Jia Huang, Srikanth Saripalli

机构 * Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University, College Station, TX, USA(迈克·沃克66机械工程系,德克萨斯A&M大学,学院站,德克萨斯州,美国) DEVCOM Army Research Laboratory, Adelphi, MD, USA(陆军研究实验室,阿德菲,马里兰州,美国) University of Texas at Austin Center for Autonomy, Austin, TX, USA(德克萨斯大学奥斯汀分校自主性中心,奥斯汀,德克萨斯州,美国)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 针对非结构化环境中地面机器人研究,提出包含六种互补传感器模态的大规模多模态越野数据集,支持语义分割、目标检测和SLAM等任务,以提升退化条件下的鲁棒性。

Comments 7 pages, 7 figures, accepted at IV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13300 2026-06-26 cs.CL 版本更新 50%

OI-Bench: An Option Injection Benchmark for Evaluating LLM Susceptibility to Directive Interference

OI-Bench:用于评估大语言模型对指令干扰敏感性的选项注入基准

Yow-Fu Liou, Yu-Chien Tang, Yu-Hsiang Liu, An-Zi Yen

机构 * Department of Computer Science, National Yang Ming Chiao Tung University(国家阳明交通大学计算机科学系)

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 提出选项注入基准OI-Bench,通过在多选题界面中嵌入误导性指令,系统评估12个LLM对16种指令干扰的脆弱性,揭示模型存在显著漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏