arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-23 至 2026-04-23 共收录 50 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 4 篇

2601.00911 2026-04-23 cs.CR cs.AI cs.ET cs.HC cs.LG 62%

Device-Native Autonomous Agents for Privacy-Preserving Negotiations

设备本机自主代理用于隐私保护的谈判

Joyjit Roy, Samaresh Kumar Singh

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于设备的自主代理系统,通过零知识证明和本地推理实现隐私保护的谈判,实验显示在保险和B2B采购场景中成功率高,隐私保护效果显著。

Comments 9 pages, 6 figures, 9 tables. This version updates metadata after publication in IEEE Xplore

Journal ref 2026 IEEE SoutheastCon, Huntsville, AL, USA, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人基础模型 2 篇

2604.20472 2026-04-23 cs.RO cs.LG 62%

Temporal Difference Calibration in Sequential Tasks: Application to Vision-Language-Action Models

时间差校准在连续任务中的应用:用于视觉-语言-动作模型

Shelly Francis-Meretzki, Mirco Mutti, Yaniv Romano, Aviv Tamar

机构 * Technion - Israel Institute of Technology(技术ion-以色列理工学院)

专题命中 机器人基础模型 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 本文提出了一种用于连续任务的时间差校准方法,通过将Brier分数扩展到序列任务,将不确定性校准与强化学习结合,提高了视觉-语言-动作模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20347 2026-04-23 cs.RO cs.AI 62%

A Vision-Language-Action Model for Adaptive Ultrasound-Guided Needle Insertion and Needle Tracking

面向自适应超声引导针插入与针跟踪的视觉-语言-动作模型

Yuelin Zhang, Qingpeng Ding, Longxiang Tang, Chengyu Fang, Shing Shin Cheng

机构 * Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(香港中文大学机械与自动化工程系) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学计算机科学与工程系) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Mechanical and Automation Engineering, T Stone Robotics Institute, Shun Hing Institute of Advanced Engineering, Multi-Scale Medical Robotics Center, and Institute of Medical Intelligence and XR, The Chinese University of Hong Kong(香港中文大学机械与自动化工程系、T Stone机器人研究所、Shun Hing先进工程研究所、多尺度医疗机器人中心以及医学智能与XR研究所)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出视觉-语言-动作模型,用于实现自适应超声引导针插入与跟踪,通过跨深度融合和跟踪条件化注册提升跟踪精度与插入成功率。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 模仿学习与强化学习 5 篇

2604.19839 2026-04-23 cs.CV cs.AI 81%

Environmental Understanding Vision-Language Model for Embodied Agent

面向具身智能体的环境理解视觉-语言模型

Jinsik Bang, Jaeyeon Bae, Donggyu Lee, Siyeol Jung, Taehwan Kim

机构 * UNIST(全南国立大学)

专题命中 模仿学习与强化学习 :embodied agent(title,abstract);分类 cs.AI、cs.CV

AI总结 本文提出EUEA框架,通过细调四项核心技能提升具身智能体的环境理解能力,结合恢复步骤和GRPO阶段提升任务执行效果,实验显示在ALFRED任务中性能显著优于行为克隆基线。

Comments CVPR Findings 2026, Project Page: https://eu-ea.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19980 2026-04-23 cs.RO cs.SY eess.SY 79%

Efficient Reinforcement Learning using Linear Koopman Dynamics for Nonlinear Robotic Systems

利用线性Koopman动力学实现非线性机器人系统的高效强化学习

Wenjian Hao, Yuxuan Fang, Zehui Lu, Shaoshuai Mou

机构 * School of Aeronautics and Astronautics, Purdue University(航空航天学院,普渡大学)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出基于模型的强化学习框架,通过Koopman算子理论学习非线性机器人系统的线性提升动力学,并将其整合到actor-critic架构中以优化策略,实验显示在模拟和现实平台中样本效率和控制性能均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20627 2026-04-23 cs.LG cs.RO 73%

Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning

占用奖励塑造:改进离线目标导向强化学习中的信用分配

Aravind Venugopal, Jiayu Chen, Xudong Wu, Chongyi Zheng, Benjamin Eysenbach, Jeff Schneider

机构 * Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学) INFIFORCE Intelligent Technology(INFIFORCE智能技术) Princeton University(普林斯顿大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);world model(abstract);分类 cs.RO、cs.LG

AI总结 本文提出占用奖励塑造方法,通过提取世界模型中的时间信息,改进稀疏奖励下的信用分配问题,在13种长周期运动和操作任务中提升了2.2倍性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20712 2026-04-23 cs.RO 72%

Visual-Tactile Peg-in-Hole Assembly Learning from Peg-out-of-Hole Disassembly

基于视觉-触觉的 peg-in-hole 组装学习:从 peg-out-of-hole 解组装中学习

Yongqiang Zhao, Xuyang Zhang, Zhuo Chen, Matteo Leonetti, Emmanouil Spyrakos-Papastavridis, Shan Luo

机构 * Department of Engineering, King’s College London(工程系,伦敦国王学院) Department of Informatics, King’s College London(信息学院,伦敦国王学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO;robotics(journal_ref)

AI总结 本文提出一种基于视觉-触觉的 peg-in-hole 组装学习框架,利用其逆过程 peg-out-of-hole 解组装来促进组装学习。通过将两者统一为部分可观测马尔可夫决策过程,利用解组装策略的轨迹反向和随机化提供专家数据,从而提升组装任务的成功率。

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 6, pp. 6712-6719, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02644 2026-04-23 cs.AI 70%

D2PPO: Diffusion Policy Policy Optimization with Dispersive Loss

D2PPO:带有分散损失的扩散策略策略优化

Guowei Zou, Weibing Li, Hejun Wu, Yukun Qian, Yuhang Wang, Haitao Wang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.AI

AI总结 本文提出D2PPO,通过引入分散损失正则化来解决扩散策略中表示崩溃问题,提升复杂机器人操控任务的性能,实验表明其在预训练和微调中均取得显著改进。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(22): 18891-18899, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 人机交互与遥操作 1 篇

2604.20193 2026-04-23 cs.RO 83%

LLM-Guided Safety Agent for Edge Robotics with an ISO-Compliant Perception-Compute-Control Architecture

基于ISO合规感知-计算-控制架构的LLM引导安全代理用于边缘机器人

Xu Huang, Ruofan Zhang, Lu Cheng, Yuefeng Song, Xu Huang, Huayu Zhang, Sheng Yin, Anyang Liang, Chen Qian, Yin Zhou, Xiaoyun Yuan, Yuan Cheng

机构 * Shanghai Jiao Tong University(上海交通大学) SIMMIR Tech(SIMMIR科技)

专题命中 人机交互与遥操作 :robotics(title,abstract);embodied AI(abstract);分类 cs.RO

AI总结 本文提出一种基于ISO合规架构的LLM引导安全代理,通过将安全规范转化为可执行谓词,实现边缘机器人中的功能安全,支持ISO 13849 Category 3和PL d的实用部署。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人数据与评测 9 篇

2604.20246 2026-04-23 cs.RO cs.AI 84%

Cortex 2.0: Grounding World Models in Real-World Industrial Deployment

Cortex 2.0:在真实工业部署中将世界模型接地

Adriana Aida, Walida Amer, Katarina Bankovic, Dhruv Behl, Fabian Busch, Annie Bhalla, Minh Duong, Florian Gienger, Rohan Godse, Denis Grachev, Ralf Gulde, Elisa Hagensieker, Junpeng Hu, Shivam Joshi, Tobias Knoblauch, Likith Kumar, Damien LaRocque, Keerthana Lokesh, Omar Moured, Khiem Nguyen, Christian Preyss, Ranjith Sriganesan, Vikram Singh, Carsten Sponner, Anh Tong, Dominik Tuscher, Marc Tuscher, Pavan Upputuri

机构 * Sereact GmbH(Sereact公司)

专题命中 机器人数据与评测 :world model(title);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 Cortex 2.0通过在视觉潜在空间中生成候选未来轨迹并评分,实现了从反应式控制到计划与行动的转变,展示了在复杂工业环境中可靠的世界模型规划。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20349 2026-04-23 eess.SP 67%

Descriptor: A Hybrid Indoor and Indoor-Outdoor Positioning Multi-Technology Dataset (HYMN)

描述:一种混合室内外定位多技术数据集(HYMN)

Muhammad Ammad, Albrecht Michler, Paul Schwarzbach, Jonas Ninnemann, Hagen Ußler, Oliver Michler

专题命中 机器人数据与评测 :navigation(abstract,abstract_cn)

AI总结 HYMN数据集结合五种定位技术,涵盖室内外过渡场景,支持多传感器融合和无缝定位研究,克服单一技术限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07295 2026-04-23 cs.RO cs.AI 62%

Learning Multi-Modal Whole-Body Control for Real-World Humanoid Robots

多模态全身控制学习用于现实世界的人形机器人

Pranay Dugar, Aayam Shrestha, Fangzhou Yu, Bart van Marum, Alan Fern

机构 * Collaborative Robotics and Intelligent Systems Institute (CoRIS)(协同机器人与智能系统研究所)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种多模态全身控制器,通过统一接口实现多样化的人形机器人行为控制,展示了在仿真和真实世界中的有效性。

Comments Website: https://masked-humanoid.github.io/mhc/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19787 2026-04-23 cs.CL cs.AI cs.CY 57%

LLM Agents Predict Social Media Reactions but Do Not Outperform Text Classifiers: Benchmarking Simulation Accuracy Using 120K+ Personas of 1511 Humans

LLM代理预测社交媒体反应但不优于文本分类器:使用120,000多个1511人的人设进行基准测试

Ljubisa Bojic, Alexander Felfernig, Bojana Dinic, Velibor Ilic, Achim Rettinger, Vera Mevorah, Damian Trilling

机构 * Institute for Artificial Intelligence Research and Development of Serbia(塞尔维亚人工智能研究与开发研究所) University of Belgrade, Institute for Philosophy and Social Theory, Digital Society Lab(贝尔格莱德大学,哲学与社会理论研究所,数字社会实验室) Complexity Science Hub, Vienna, Austria(维也纳复杂科学中心) Graz University of Technology, Graz, Austria(技术大学格拉茨,格拉茨,奥地利) University of Novi Sad, Faculty of Philosophy, Novi Sad, Serbia(诺维萨德大学,哲学学院,诺维萨德,塞尔维亚) University of Trier, Trier, Germany(特里尔大学,特里尔,德国) Vrije University Amsterdam, Amsterdam, Netherlands(阿姆斯特丹自由大学,阿姆斯特丹,荷兰)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 本文研究LLM代理预测人类社交媒体反应的准确性,发现其表现不如传统文本分类器,揭示了零样本代理在模拟极化动态中的潜力及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14311 2026-04-23 eess.SY cs.RO cs.SY 57%

Multi-Timescale Model Predictive Control for Slow-Fast Systems

多时间尺度模型预测控制用于慢-快系统

Lukas Schroth, Daniel Morton, Amon Lahr, Daniele Gammelli, Andrea Carron, Marco Pavone

机构 * Institute for Dynamic Systems and Control(动态系统与控制研究所) Department of Aeronautics and Astronautics(航空与航天系) Department of Mechanical Engineering(机械工程系) NVIDIA Research(NVIDIA研究)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出多时间尺度MPC方法,通过切换简化模型和增加积分步长来提升计算效率,应用于机器人控制问题,实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18823 2026-04-23 cs.CV 57%

MSLAU-Net: A Hybrid CNN-Transformer Network for Medical Image Segmentation

MSLAU-Net:一种用于医学图像分割的混合CNN-Transformer网络

Libin Lan, Yanxin Li, Xiaojuan Liu, Juan Zhou, Jianxun Zhang, Nannan Huang, Yudong Zhang

机构 * College of Computer Science and Engineering(计算机科学与工程学院) College of Artificial Intelligence(人工智能学院) Department of Pharmacy(药学部) Department of Prosthodontics(修复学部) Chongqing Key Laboratory of Oral Diseases(重庆口腔疾病重点实验室) Chongqing Municipal Key Laboratory of Oral Biomedical Engineering of Higher Education(重庆市口腔生物医学工程高等教育重点实验室) School of Computer Science and Engineering(计算机科学与工程学院) Southeast University(东南大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 本文提出MSLAU-Net,结合CNN和Transformer的优势,通过多尺度线性注意力和自上而下特征聚合机制,提升医学图像分割的精度与效率。

Comments 15 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20795 2026-04-23 cs.AI 57%

Automatic Ontology Construction Using LLMs as an External Layer of Memory, Verification, and Planning for Hybrid Intelligent Systems

利用LLMs构建自动本体:作为混合智能系统记忆、验证和规划的外部层

Pavel Salovskii, Iuliia Gorshkova

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI

AI总结 本文提出了一种混合架构,通过扩展LLMs的外部本体记忆层,实现结构化知识图谱的构建与维护,提升多步推理性能并支持生成-验证-修正流程。

Comments Artificial Intelligence; Knowledge Representation and Reasoning; Information Retrieval; Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20760 2026-04-23 cs.CV 57%

Exploring High-Order Self-Similarity for Video Understanding

探索高阶自相似性用于视频理解

Manjin Kim, Heeseung Kwon, Karteek Alahari, Minsu Cho

机构 * POSTECH RLWRLD Inc.(RLWRLD公司) INRIA Grenoble Rhône-Alpes(INRIA格勒诺布尔罗纳-阿尔卑斯研究院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文提出多阶自相似模块MOSS,通过学习和整合多阶时空自相似特征,提升视频任务中的运动建模能力,实验表明在动作识别、视频VQA和机器人任务中均取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19901 2026-04-23 physics.ao-ph 50%

Geometric Correction of Side-Scan Sonar Images with Image-Consistent Attitude Refinement

侧扫声呐图像的几何校正与图像一致姿态细化

Can Lei, Valerio Franchi, Hayat Rajani, Nuno Gracias, Rafael Garcia, Huigang Wang

专题命中 机器人数据与评测 :navigation(abstract)

AI总结 本文提出一种侧扫声呐图像几何校正方法,通过图像一致的姿态细化减少图像条带畸变,提升几何一致性与局部结构连续性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他机器人 2 篇

2511.17265 2026-04-23 cs.AR cs.AI cs.ET cs.PF 57%

DISCA: A Digital In-memory Stochastic Computing Architecture Using A Compressed Bent-Pyramid Format

DISCA:一种基于压缩弯金字塔格式的数字存内随机计算架构

Shady Agwa, Yikang Shen, Shiwei Wang, Themis Prodromakis

机构 * 1 Centre for Electronics Frontiers, Institute for Integrated Micro Nano Systems, School of Engineering, The University of Edinburgh, UK. 2 Electrical \& Electronics Engineering, Queen's University Belfast, UK.

专题命中 其他机器人 :robotics(abstract);分类 cs.AI

AI总结 本文提出DISCA,一种基于压缩弯金字塔格式的数字存内随机计算架构,旨在提升大规模AI模型矩阵乘法任务的能量效率。

Comments This work has been accepted for publication in the 2025 37th International Conference on Microelectronics (ICM)

Journal ref 2025 37th International Conference on Microelectronics (ICM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20437 2026-04-23 cond-mat.soft 50%

Programming strain-stiffening in soft composites via structural memory near jamming

通过接近阻塞相边界的结构记忆编程软复合材料的应变刚性

Yiqiu Zhao, Deng Pan, Yiming Pang, Jonathan Barés, Chang Xu, Che Liu, Haitao Hu, Yuliang Jin, Qin Xu

专题命中 其他机器人 :robotic(abstract)

AI总结 研究通过接近阻塞相边界的机械训练协议,揭示结构记忆驱动软复合材料从颗粒状到生物聚合物状应变刚性的转变,提出非平衡记忆效应驱动的可编程应变刚性设计策略。

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏