arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-04 至 2026-05-04 共收录 49 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人基础模型 2 篇

2605.00078 2026-05-04 cs.RO cs.CV cs.LG 67%

Being-H0.7: A Latent World-Action Model from Egocentric Videos

Being-H0.7: 一种从第一人称视频中学习的潜在世界-动作模型

Hao Luo, Wanpeng Zhang, Yicheng Feng, Sipeng Zheng, Haiweng Xu, Chaoyi Xu, Ziheng Xi, Yuhui Fu, Zongqing Lu

机构 * BeingBeyond Team(BeingBeyond团队)

专题命中 机器人基础模型 :world model(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出Being-H0.7,通过在感知与动作之间插入可学习的潜在查询,实现未来感知的VLA策略,无需生成未来帧,提升预测效率与部署性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 模仿学习与强化学习 5 篇

2605.00347 2026-05-04 cs.LG cs.AI cs.CL 62%

Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning

Odysseus:通过强化学习扩展VLMs以实现游戏中的100+回合决策

Chengshuai Shi, Wenzhe Li, Xinran Liang, Yizhou Lu, Wenjia Yang, Ruirong Feng, Seth Karten, Ziran Yang, Zihan Ding, Gabriel Sarch, Danqi Chen, Karthik Narasimhan, Chi Jin

机构 * Princeton Language and Intelligence(普林斯顿语言与智能实验室) Princeton University(普林斯顿大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了通过强化学习训练VLMs进行长回合决策,提出轻量级回合级批评机改进训练稳定性,利用预训练VLMs提升样本效率,引入Odysseus框架在多个游戏层级取得显著进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23073 2026-05-04 cs.LG cs.RO 62%

RL Token: Bootstrapping Online RL with Vision-Language-Action Models

RL Token: 通过视觉-语言-动作模型实现在线强化学习的启动

Charles Xu, Jost Tobias Springenberg, Michael Equi, Ali Amin, Adnan Esmail, Sergey Levine, Liyiming Ke

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出RL Token方法,通过轻量级在线强化学习微调预训练的视觉-语言-动作模型,提升真实任务的精度与速度,实验证明在四个真实机器人任务中显著提高任务效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00384 2026-05-04 cs.RO 57%

PrefMoE: Robust Preference Modeling with Mixture-of-Experts Reward Learning

PrefMoE:基于专家混合的鲁棒偏好建模

Ziqin Yuan, Ruiqi Wang, Dezhong Zhao, Baijian Yang, Byung-Cheol Min

机构 * Purdue University(普渡大学) Beijing University of Chemical Technology(北京化工大学) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 PrefMoE通过混合专家框架提升偏好建模鲁棒性,采用轨迹级软路由结合多个专用奖励专家,有效处理异质且部分冲突的偏好监督,提升下游策略学习可靠性。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00012 2026-05-04 cs.IR cs.AI cs.CL 57%

Exploring LLM biases to manipulate AI search overview

探索LLM偏见以操控AI搜索概述

Roman Smirnov

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI

AI总结 研究探索LLM偏见在AI搜索概述系统中的影响,通过强化学习优化搜索片段内容以操控结果,并发现偏见驱动相对优势而非绝对优势。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04341 2026-05-04 cs.LG 57%

Long-Horizon Model-Based Offline Reinforcement Learning Without Explicit Conservatism

长周期基于模型的离线强化学习无需显式保守性

Tianwei Ni, Esther Derman, Vineet Jain, Vincent Taboga, Siamak Ravanbakhsh, Pierre-Luc Bacon

机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) McGill University(麦吉尔大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 本文提出NEUBAY算法,通过贝叶斯方法解决长周期rollout中的价值过估计问题,在D4RL和NeoRL基准上取得新进展。

Comments ICML 2026. 50 pages, 15 figures. Code is available at https://github.com/twni2016/neubay

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 人机交互与遥操作 1 篇

2404.07409 2026-05-04 cs.HC 56%

Too good to be true: People reject free gifts from robots because they infer bad intentions

过于美好而不真实:人们因推断机器人有不良意图而拒绝免费礼物

Benjamin Lebrun, Andrew Vonasch, Christoph Bartneck

专题命中 人机交互与遥操作 :embodied agent(abstract);robotics(journal_ref)

AI总结 研究探讨人们在与机器人互动时是否能推断隐藏的' phantom costs',发现机器人提供的更多金钱会降低接受率,但机器人与人类的接受率差异受具身影响。

Comments 35 pages, 6 figures

Journal ref International Journal of Social Robotics, Volume 18, article number 58, (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人数据与评测 12 篇

2605.00397 2026-05-04 cs.RO 79%

MiniVLA-Nav v1: A Multi-Scene Simulation Dataset for Language-Conditioned Robot Navigation

MiniVLA-Nav v1:一种多场景模拟数据集用于语言条件的机器人导航

Ali Al-Bustami, Jaerock Kwon

机构 * Department of Electrical and Computer Engineering, University of Michigan-Dearborn(密歇根大学迪尔伯恩分校电气与计算机工程系)

专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出MiniVLA-Nav v1数据集,用于语言引导的物体接近导航任务,包含四个逼真环境,提供同步图像、深度图和分割掩码,支持多种评估分割。

Comments 9 pages, 12 figures, 7 tables. Dataset paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15516 2026-05-04 eess.SY cs.SY 78%

''It Is Much Safer to Be Sparse than Connected'': Safe Control of Robotic Swarm Density Dynamics with PDE-Optimization with State Constraints

稀疏性比连接性更安全:基于PDE优化的机器人群体密度动态安全控制

Longchen Niu, Gennaro Notomista

专题命中 机器人数据与评测 :robotic(title,abstract)

AI总结 本文提出基于优化的闭环安全控制策略,利用控制Lyapunov函数和控制屏障函数引导由福克-普朗克方程描述的机器人群体空间密度向目标分布演化,通过Voronoi变种实现分布式部署,并通过理论分析和实验验证稀疏群体更易满足安全规范。

Journal ref Advanced Intelligent Systems2026, 0, e202501223

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00146 2026-05-04 cs.CV 70%

Real-Time Frame- and Event-based Object Detection with Spiking Neural Networks on Edge Neuromorphic Hardware: Design, Deployment and Benchmark

基于边缘神经形态硬件的实时帧级和事件级目标检测:设计、部署与基准测试

Udayanga G. W. K. N. Gamage, Yan Zeng, Cesar Cadena, Matteo Fumagalli, Silvia Tolu

机构 * Department of Electrical and Photonics Engineering, Technical University of Denmark(电气与光子工程系,丹麦技术大学) Autonomous Systems Lab, ETH zürich(自主系统实验室,苏黎世联邦理工学院)

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.CV

AI总结 本文提出了一种针对神经形态平台的通用SNN检测架构设计方法,并在Intel Loihi 2上进行部署与基准测试,展示了SNN在低功耗实时目标检测中的优势。

Comments 11 figures, 7 tables, 53 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00362 2026-05-04 cs.CV 57%

Time-series Meets Complex Motion Modeling: Robust and Computational-effective Motion Predictor for Multi-object Tracking

时间序列与复杂运动建模的交汇:多目标跟踪的鲁棒且计算高效的运动预测器

Nhat-Tan Do, Le-Huy Tu, Nhi Ngoc-Yen Nguyen, Dieu-Phuong Nguyen, Trong-Hop Do

机构 * Faculty of Information Science and Engineering, University of Information Technology, Ho Chi Minh City, Vietnam(1* 信息科学与工程学院,信息技术大学,胡志明市,越南) Vietnam National University, Ho Chi Minh City, Vietnam(2 越南国家大学,胡志明市,越南)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出TCMP框架,通过改进的TCN网络实现高效多目标跟踪,实验显示其在HOTA、IDF1和AssA等指标上均优于现有方法,且计算效率高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00121 2026-05-04 cs.RO 57%

Predictive Spatio-Temporal Scene Graphs for Semi-Static Scenes

用于半静态场景的预测时空场景图

Miguel Saavedra-Ruiz, Charlie Gauthier, Kumaraditya Gupta, Shima Shahfar, Kirsty Ellis, Steven Parkison, Liam Paull

机构 * Department of Computer Science and Operations Research, Université de Montréal(蒙特利尔大学计算机科学与运筹学系) Mila - Quebec AI Institute(魁北克人工智能研究所) Hydro-Québec Research Institute (IREQ)(魁北克水电研究院(IREQ))

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 本文提出预测图结构,结合贝叶斯推理滤波器Perpetua,实现对半静态环境的时空语义推理,验证了其在动态导航任务中的预测性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27209 2026-05-04 cs.SE cs.AI 57%

Theory Under Construction: Orchestrating Language Models for Research Software Where the Specification Evolves

构建中的理论:协调语言模型用于研究软件,其中规范在演变

Halley Young, Nikolaj Björner

机构 * Microsoft Research(微软研究院)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI

AI总结 本文提出Comet-H框架,通过迭代提示自动机协调语言模型在研究软件中的应用,解决规范演变中的 hallucination accumulation 和 desynchronization 问题,并通过实验证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00545 2026-05-04 cs.RO 57%

Variable Elimination in Hybrid Factor Graphs for Discrete-Continuous Inference & Estimation

混合因子图中变量消除用于离散-连续推断与估计

Varun Agrawal, Frank Dellaert

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本文提出了一种新的混合因子图框架和变量消除算法,用于生成精确的混合贝叶斯网络,实现最大后验估计和变量边缘化。通过混合高斯因子和条件表示,结合树结构和剪枝方案,解决了大规模SLAM和姿态图优化中的模糊测量问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03928 2026-05-04 cs.LG 57%

SynQuE: Estimating Synthetic Dataset Quality Without Annotations

SynQuE:无需标注即可估计合成数据集质量

Arthur Chen, Victor Zhong

机构 * David R. Cheriton School of Computer Science(戴维·R·切里顿计算机科学学院) University of Waterloo(滑铁卢大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.LG

AI总结 本文提出SynQuE问题,通过有限未标注真实数据对合成数据集进行排序,以提升实际任务性能。引入首个综合基准,提出LENS等代理指标,显著提升复杂任务性能。

Comments Our code and dataset are available here: https://github.com/r2llab/SynQuE

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01948 2026-05-04 cs.CV 57%

ClustViT: Clustering-based Token Merging for Semantic Segmentation

ClustViT:基于聚类的令牌合并用于语义分割

Fabio Montello, Ronja Güldenring, Lazaros Nalpantidis

机构 * Department of Electrical and Photonics Engineering, DTU - Technical University of Denmark(电气与光子工程系,丹麦技术大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 ClustViT通过聚类模块和再生模块优化视觉Transformer,减少计算量并提升分割性能,实现更高效的语义分割。

Comments Submitted to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00706 2026-05-04 cs.CL 50%

FinSafetyBench: Evaluating LLM Safety in Real-World Financial Scenarios

FinSafetyBench:评估LLM在现实金融场景中的安全性

Yutao Hou, Yihan Jiang, Yuhan Xie, Jian Yang, Liwen Zhang, Hailiang Huang, Guanhua Chen, Yun Chen

机构 * Shanghai University of Finance and Economics(上海财经大学) Beihang University(北航) Southern University of Science and Technology(南方科技大学) MoE Key Laboratory of Interdisciplinary Research of Computation and Economics(计算与经济学交叉学科研究重点实验室)

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 本文提出FinSafetyBench,一个双语红队基准,用于测试LLM对违反金融合规请求的拒绝能力,揭示了对抗性提示绕过合规保障的关键漏洞及中文环境下更严重的易受攻击性。

Comments Accepted by Findings of ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00620 2026-05-04 cs.CL 50%

SC-Taxo: Hierarchical Taxonomy Generation under Semantic Consistency Constraints using Large Language Models

SC-Taxo:基于语义一致性约束的层次化分类生成方法

Shiqiang Cai, Nianhong Niu, Shizhu He, Kang Liu, Jun Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Science and Technology Beijing(北京科技大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 机器人数据与评测 :navigation(abstract)

AI总结 本文提出SC-Taxo框架,利用大语言模型和层次化优化机制,解决现有分类生成方法在结构一致性和语义对齐上的不足,提升分类体系的层次性和准确性。

Comments 12 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24444 2026-05-04 cs.CR cs.DC 50%

BugMagnifier: TON Transaction Simulator for Revealing Smart Contract Vulnerabilities

BugMagnifier: TON交易模拟器用于揭示智能合约漏洞

Yury Yanovich, Victoria Kovalevskaya, Maksim Egorov, Elizaveta Smirnova, Matvey Mishuris, Yash Madhwal, Kirill Ziborov, Vladimir Gorgadze, Subodh Sharma

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 本文提出基于受控消息编排的动态评估方法,通过精确消息队列操作与差分状态分析结合,构建BugMagnifier框架,系统暴露异步智能合约中的执行缺陷,验证其在异步区块链环境中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏