arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-12 至 2026-08-12 共收录 83 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4 篇

2608.10204 2026-08-12 cs.LG 新提交 57%

Boundary-Seeking Policy Gradient for Safe Reinforcement Learning

面向安全强化学习的边界搜寻策略梯度算法

Chenhua Fan, Jiahui Zhu, Yuhang Zhang, Honghao Wei

机构 * School of EECS, Washington State University(华盛顿州立大学电子工程与计算机科学学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本文提出BSPG算法,针对安全强化学习中标准梯度法易收敛到可行域内部的问题,结合切向与法向分量,在Safety-Gymnasium导航任务中实现更高奖励与更紧密的边界跟踪。

Comments CDC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 人机交互与遥操作 4 篇

2601.15069 2026-08-12 cs.RO 版本更新 65%

Influence of Operator Expertise on Robot Supervision and Intervention

操作者专业水平对机器人监督与干预的影响

Yanran Jiang, Pavan Sikka, Leimin Tian, Dana Kuliic, Cecile Paris

机构 * Data 61, CSIRO, Australia(数据61,CSIRO,澳大利亚) Faculty of Engineering, Monash University, Australia(工程学院,墨尔本大学,澳大利亚)

专题命中 人机交互与遥操作 :robotics(abstract,comments);分类 cs.RO

AI总结 本研究探讨不同专业水平的操作者在监督远程机器人时的干预行为差异,通过用户研究揭示不同专业水平对机器人监督任务的影响。

Comments Accepted at the Australasian Conference on Robotics and Automation (ACRA 2025)

Journal ref Australasian Conference on Robotics and Automation (ACRA), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11051 2026-08-12 cs.CV 新提交 57%

HUI360: A 360° Egocentric Dataset and Baselines for Human-Robot Interaction Anticipation

HUI360:用于人机交互预测的360°第一视角数据集及基准模型

Raphael Lorenzo-Louis, Fabio Amadio, Bertrand Luvison, Serena Ivaldi

机构 * Inria(法国国家信息与自动化研究所) CNRS(法国国家科学研究中心) Loria(洛林计算机科学与应用实验室) HUCEBOT Université Paris-Saclay(巴黎-萨克雷大学) CEA(法国原子能和替代能源委员会) List

专题命中 人机交互与遥操作 :embodied agent(abstract);分类 cs.CV

AI总结 该研究推出最大野外人机交互预测数据集HUI360及基准模型,含100万条标注,还发布SSUP-HRI的600万条标注,提供自动标注流水线,实现跨数据集评估,推动人机交互预测研究。

Journal ref 2026 IEEE International Conference on Automatic Face and Gesture Recognition (FG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10367 2026-08-12 cs.RO cs.HC 新提交 57%

A Neural Network Based Teleoperation for Remote Controlled Vehicles

基于神经网络的遥控车辆遥操作

Ning Ding, Azim Eskandarian

机构 * Virginia Polytechnic Institute and State University(弗吉尼亚理工大学) College of Engineering, Virginia Commonwealth University(弗吉尼亚联邦大学工程学院)

专题命中 人机交互与遥操作 :robotic(abstract);分类 cs.RO

AI总结 针对车辆遥操作的通信延迟与环境干扰问题,提出集成WV与RBFN的单向框架,经仿真与硬件在环验证,其鲁棒性与效率优于PID等控制器,适配车辆边缘计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00945 2026-08-12 cs.HC 版本更新 50%

Sighted by Default: Addressing Implicit Vision Assumptions in Real-Time VLM Assistance for BLV Users

默认以视觉为中心:解决面向盲人和低视力(BLV)用户的实时视觉语言模型(VLM)辅助中的隐含视觉假设问题

Yi Zhao, Siqi Wang, Qiqun Geng, Erxin Yu, Jing Li

专题命中 人机交互与遥操作 :navigation(abstract)

AI总结 针对现有面向BLV用户的实时VLM辅助工具存在的以视觉为中心的默认偏见问题,提出VIA-Agent模型,其在保持与Doubao相当成功率的同时,缩短了任务时间并减少了对话轮次,提升了用户信任度。

Comments Accepted to UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人数据与评测 16 篇

2608.09892 2026-08-12 cs.RO 版本更新 79%

XPolicyLab: A Unified Standard and Open Ecosystem for Robot Policy Evaluation and Deployment

XPolicyLab:用于机器人策略评估与部署的统一标准及开放生态系统

XPolicyLab Community, Tianxing Chen, Yue Chen, Tian Nian, Zijian Cai, Guangyu Chen, Wenwei Lin, Qiwei Liang, Zanxin Chen, Peicheng Xiang, Kailun Su, Zixuan Li, Junyuan Tang, Yan Qin, Qiangyu Chen, Shaolong Zhu, Xiang Li, Jiahao Zhang, Weijie Wan, Baijun Chen, Honghao Su, Kehe Ye, Shujia Liu, Kaixuan Wang, Haotian Liang, Yunze Liu, Mingleyang Li, Yuran Wang, Boyu Chen, Hongzhe Bi, Shuhe Huang, Hengkai Tan, Jisong Cai, Yao Mu, Jun Guo, Xiaofeng Wang, Zheng Zhu, Weijie Ke, Hengtao Li, Yuhang Tang, Xiaofan Li, Ganlin Yang, Zhangzheng Tu, Shuai Yang, Wenxuan Song, Pengxiang Ding, Kaidong Zhang, Yu Sun, Junliang Guo, Tong Zhang, Yixing Chen, Rongxu Cui, Zongzheng Zhang, Haoxiang Ma, Junhao Cai, Haoyu Zhang, Senqiao Yang, Jinhui Ye, Pengguang Chen, Shu Liu, Xiu Su, Wenhan Fang, Wenhao Li, Yichao Cao, Chengyao Wang, Qiang Chen, Ping Luo, Wenbo Ding

机构 * THU(清华大学)

专题命中 机器人数据与评测 :robot policy(title,abstract);分类 cs.RO

AI总结 XPolicyLab是统一机器人策略评估与部署的开放生态系统,通过标准化接口降低集成成本,集成42个策略,可适配仿真与真实机器人,减少了策略与环境的适配工作量。

Comments Website: xpolicylab.github.io, Code: https://github.com/XPolicyLab/XPolicyLab

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02035 2026-08-12 cs.RO cs.AI cs.IT cs.LG cs.MA math.IT 版本更新 75%

Bandwidth-Efficient Multi-Agent Communication through Information Bottleneck and Vector Quantization

通过信息瓶颈和向量量化实现带宽高效的多智能体通信

Ahmad Farooq, Kamran Iqbal

机构 * Department of Electrical and Computer Engineering, University of Arkansas at Little Rock(电气与计算机工程系,阿肯色大学小岩分校)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本研究通过信息瓶颈与向量量化方法,实现多智能体通信的带宽高效优化,提升协调性能并减少带宽消耗。

Comments Accepted at IEEE ICRA 2026, Vienna, Austria. 8 pages, 4 figures, 4 tables. v2: replaces v1 with the accepted camera-ready version and corrects a typo in the bandwidth reduction (41.4% -> 71.4%) in the abstract, Sec. I, Fig. 2 caption, Sec. VI and Sec. VII. Sec. V-A and Table I (800 vs 2800 bits/episode) were already correct; no results or conclusions changed

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10648 2026-08-12 cs.CV cs.RO 新提交 73%

Precise Top-Layer Fabric Segmentation for Fabric Destacking with Edge- and Shape-Aware Deep Networks

结合边缘感知与形状感知深度网络的织物叠堆顶层织物精确分割

Wenbo Dong, Dipankar Bhattacharya, Akinari Kobayashi, Akira Seino, Fuyuki Tokuda, Xuzhao Huang, Kai Tang, Norman C. Tien, Kazuhiro Kosuge

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 针对织物叠堆顶层分割的复杂挑战,提出结合边缘感知与形状感知分支的编码器-解码器训练架构,在真实数据集上验证其性能优于现有基准。

Comments 7 pages, 3 figures. Published in IEEE ICMA 2025. Author's accepted manuscript. Code: https://github.com/bhattner143/top-layer-fab-seg

Journal ref 2025 IEEE International Conference on Mechatronics and Automation (ICMA), Beijing, China, Aug. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10618 2026-08-12 cs.RO 新提交 70%

Toward the Cognitive--Physical Limits of Embodied Intelligence through a World-Model-Centric Autonomous Racing Agent

通过以世界模型为中心的自主智能体探索具身智能的认知-物理极限

Zitong Shan, Baichuan Lou, Yanxin Zhou, Shuge Wu, Xianqi He, Bolin Zhao, Sheng Zhao, Zhouheng Li, Chee Kiong Ong, King Ho Holden Li, Chen Lv

机构 * K2 Holding, L.L.C(K2控股有限责任公司)

专题命中 机器人数据与评测 :embodied agent(abstract);world model(abstract);分类 cs.RO

AI总结 该研究提出以世界模型为中心的自主赛车智能体,结合实车与模拟实验,探索具身智能的认知-物理极限,提升了交互成功率与泛化能力,为安全部署提供边界感知方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08522 2026-08-12 cs.RO 版本更新 70%

EsaacSim: A Multimodal Event Camera Add-on for NVIDIA Isaac Sim

EsaacSim:适用于NVIDIA Isaac Sim的多模态事件相机附加组件

Ignacio Bugueno-Cordova, Malte Kuhlmann, Nicolás Navarro-Guerrero, Miguel Campusano, Rodrigo Verschae

机构 * Leibniz Universität Hannover(莱布尼茨汉诺威大学) L3S Research Center(L3S研究中心) University of Southern Denmark(南丹麦大学) University of Chile(智利大学)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出适用于NVIDIA Isaac Sim的多模态事件相机附加组件EsaacSim,可实现多模态事件相机在线仿真,在多种分辨率下具备高效性能,支持机器人研究的多模态仿真与合成数据生成。

Journal ref The 19th European Conference on Computer Vision Workshops (ECCVW 2026); Workshop on Neuromorphic Vision (NeVi)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06191 2026-08-12 cs.RO cs.CV cs.LG 版本更新 67%

Learning in ImaginationLand: Omnidirectional Policies through 3D Generative Models (OP-Gen)

在ImaginationLand中学习:通过3D生成模型(OP-Gen)实现全向策略

Yifei Ren, Edward Johns

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 该研究提出用3D生成模型(OP-Gen)从单个真实演示扩充数据集,学习全向策略,可减少所需演示数,在多任务上性能优于基线方法。

Comments Project webpage with robot videos: https://www.robot-learning.uk/op-gen

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10660 2026-08-12 cs.CV cs.AI 新提交 62%

Cross-View Sequential Visual Localization with Spatio-Temporal Context Modeling for Autonomous Driving

面向自动驾驶的融合时空上下文建模的跨视角序列视觉定位

Jiaping Wang, Shaobo Li, Zhen Wang

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 本研究提出时序上下文增强的跨视角序列视觉定位框架,通过循环跨帧模块聚合历史上下文提升定位精度,在多个公开数据集及实装实验中均取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08970 2026-08-12 cs.CV cs.AI 版本更新 62%

MultiView-Bench: A Diagnostic Benchmark for World-Centric Multi-View Integration in VLMs

MultiView-Bench:用于视觉语言模型中以世界为中心的多视图集成的诊断基准

Hantao Zhang, Jinru Sui, Ed Li, Dirk Bergemann, Zhuoran Yang

机构 * Google(谷歌)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 研究针对VLMs多视图集成能力评估不足问题,引入MultiView-Bench基准,发现模型在3D空间关系等方面的局限及偏差,提出ViewNavigator框架,能主动选择视角、融合证据,提升基础模型在该基准上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10623 2026-08-12 cs.RO 新提交 57%

When Your State Estimator Has Lost The Plot: Detecting Estimator Failures Via Spectral Analysis

当你的状态估计器“迷失方向”时:通过频谱分析检测估计器故障

Christian Lanegger, Helen Oleynikova, Roland Siegwart, Michael Pantic

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本研究提出一种与传感器无关的频域分析方法,用于检测状态估计器故障,在三类里程计框架中可检测51%-58%的故障,精度达60%-84%,可作为轻量级自省工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10145 2026-08-12 cs.LG 新提交 57%

The Evaluation Protocol Determines the Result: An Independent Reproduction of LeWorldModel on TwoRoom

评估协议决定结果:在TwoRoom上独立复现LeWorldModel

Joyjeet Singh

专题命中 机器人数据与评测 :world model(abstract);分类 cs.LG

AI总结 本研究独立复现LeWorldModel在TwoRoom上的结果,发现评估协议(如目标偏移量)会显著影响性能,还揭示单步预测准确率无法预测长程规划成功、批量归一化层会夸大验证损失等关键结论。

Comments Independent reproduction of arXiv:2603.19312 - https://github.com/joyjeet-singh/tinylab

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10309 2026-08-12 cs.AI 版本更新 57%

Measure the Sim-to-Real Gap: Designing an Affordable Real-World Benchmark Platform for Reinforcement Learning in AIoT Systems

测量模拟到现实的差距:为物联网系统中的强化学习设计一个经济实惠的真实世界基准平台

Rongping Zhou, Omid Tavallaie, Shuaijun Chen, Albert Y. Zomaya

机构 * The University of Sydney(悉尼大学) University of Oxford(牛津大学) The University of Western Australia(西澳大利亚大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI

AI总结 针对AIoT系统中强化学习模拟到现实的差距问题,开发了成本低于400美元的真实世界平台,通过硬件模拟键盘让边缘设备智能体玩游戏训练,实验显示模拟训练智能体部署后性能大幅下降,直接现实训练有可行性,为强化学习评估提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24112 2026-08-12 cs.AI 版本更新 57%

ReMMD: Realistic Multilingual Multi-Image Agentic Verification for Multimodal Misinformation Detection

ReMMD: 面向多模态虚假信息检测的现实多语言多图像智能体验证

Chenhao Dang, Dantong Zhu, Jun Yang, Conghui He, Weijia Li

机构 * Shanghai Jiaotong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Central South University(中南大学) China Electronics Technology Group Corporation 15th Research Institute(中国电子科技集团公司第十五研究所)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 提出ReMMD框架,包含多语言多图像基准ReMMDBench和持久记忆验证器ReMMD-Agent,通过原子点分解和可重用证据集实现高效准确的多模态虚假信息检测。

Comments The project is available at https://dang-ai.github.io/ReMMD

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11026 2026-08-12 eess.AS cs.MM 新提交 50%

MAJEPPA: Morphing and Assessing in a Unified Piano Performance Space

MAJEPPA:在统一钢琴演奏空间中实现变形与评估

Jinwen Zhou, Huan Zhang, Weixi Zhai, Jinhua Liang, Aidan O. T. Hogg, Simon Dixon

专题命中 机器人数据与评测 :world model(abstract)

AI总结 研究提出自监督框架MAJEPPA,构建含约4000条录音的数据集,调整MIDI自回归模型,引入EVPMR基准评估,实现统一钢琴演奏空间的表征学习与相关任务进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07539 2026-08-12 cs.NE 版本更新 50%

AutoPSO: A Metaframework for Automated Particle Swarm Optimization

AutoPSO:一种用于自动粒子群优化的元框架

Xinmeng Yu, Jiaxin Gao, Jianguo Zhang, Dongmei Jiang, Ran Cheng

专题命中 机器人数据与评测 :robotic(abstract)

AI总结 AutoPSO是用于构建定制PSO算法的自动化元框架,通过双层搜索结合EvoX实现高效评估,发现的新型PSO变体在数值基准和机器人控制任务上显著优于强基线。

Comments Accepted by IEEE TEVC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00150 2026-08-12 eess.SY cs.SY 版本更新 50%

Data-Driven Reachability of Nonlinear Lipschitz Systems via Koopman Operator Embeddings

基于Koopman算子嵌入的非线性Lipschitz系统的数据驱动可达性

Alireza Naderi, Ahmad Hafez, Abdulla Fawzy, Amr Alanwar

专题命中 机器人数据与评测 :robotic(abstract)

AI总结 本文提出基于Koopman算子和zonotopic集合表示的数据驱动可达性框架,通过将非线性系统提升为有限维线性模型,减少保守性并保持形式安全保证,实验证明其在长预测范围内的可达集近似更精确。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20907 2026-08-12 cs.CL 版本更新 50%

The Hidden Puppet Master: Predicting Human Belief Change in Manipulative LLM Dialogues

隐藏的提线人:预测操纵性大语言模型对话中的人类信念变化

Jocelyn Shen, Amina Luvsanchultem, Jessica Kim, Kynnedy Smith, Valdemar Danry, Kantwon Rogers, Hae Won Park, Maarten Sap, Cynthia Breazeal

机构 * Massachusetts Institute of Technology(麻省理工学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 本文提出PUPPET框架,通过分析1035个人类与LLM交互数据,揭示当前安全范式在检测操纵策略与信念变化幅度之间的关键断层,证明先进LLM对人类信念易感性的系统低估。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他机器人 2 篇

2608.10200 2026-08-12 physics.optics 新提交 50%

Active Electronic Terahertz Imaging for Industrial Applications: From Hardware to the Paradigm Shift by Artificial Intelligence

面向工业应用的主动电子太赫兹成像:从硬件到人工智能驱动的范式转变

Aparajita Bandyopadhyay, Hui Yuan, Willie J. Padilla, David J. Brady, Hartmut G. Roskos

专题命中 其他机器人 :robotic(abstract)

AI总结 本综述聚焦主动电子太赫兹成像,综述其硬件、成像模态、增强技术及AI应用,推导技术路线图以解决太赫兹成像瓶颈,有望为工业应用提供高性价比解决方案。

Comments 40 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02998 2026-08-12 cs.CY cs.CR 50%

Integrating Generative AI into Cybersecurity Education: A Study of OCR and Multimodal LLM-assisted Instruction

Karan Patel, Yu-Zheng Lin, Gaurangi Raul, Bono Po-Jen Shih, Matthew W. Redondo, Banafsheh Saber Latibari, Jesus Pacheco, Soheil Salehi, Pratik Satam

专题命中 其他机器人 :robotics(abstract)

Comments 9 pages, 3 figures, accepted by IEEE FIE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏