arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-09 至 2026-07-09 共收录 24 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 1 篇

2511.06667 2026-07-09 cs.RO cs.AI 版本更新 82%

Rapidly Learning Soft Robot Control via Implicit Time-Stepping

通过隐式时间步长快速学习软机器人控制

Andrew Choi, Dezhong Tong, Xiaonan Huang

机构 * Horizon Robotics University of Michigan(密歇根大学)

专题命中 机器人学习 :robotics(abstract);robot learning(abstract);robot policy(abstract);robotic(abstract)

AI总结 研究针对软机器人模拟框架稀缺及策略学习难的问题,采用隐式时间步长,以DisMech模拟器及增量自然曲率控制方法,经与Elastica对比实验,证明该方法能在不牺牲准确性的情况下显著加速软机器人策略学习。

Comments Accepted to IROS 2026. Code: https://github.com/QuantuMope/dismech-rl

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 9 篇

2605.21133 2026-07-09 cs.RO 版本更新 90%

Humanoid Whole-Body Manipulation via Active Spatial Brain and Generalizable Action Cerebellum

通过主动空间大脑和可泛化动作小脑的人形全身 manipulation

Zhizhao Liang, Yi-Lin Wei, Xuhang Chen, Mu Lin, Yi-Xiang He, Zhexi Luo, Jun-Hui Liu, Kun-Yu Lin, Wei-Shi Zheng

机构 * School of Computer Science(计算机科学学院) Engineering, Sun Yat-sen University(工程学院,中山大学)

专题命中 机器人操作 :manipulation(title,title_cn);分类 cs.RO

AI总结 本文提出了一种通用的人形 locomotion-manipulation 框架,通过主动空间大脑和可泛化动作小脑来解决复杂3D环境中空间理解困难和动作生成泛化困难的问题,展示了在多种任务和环境中的强性能。

Comments Project page: https://leungchaos.github.io/Humanoid-Whole-Body-Manipulation-via-Active-Spatial-Brain-and-Generalizable-Action-Cerebellum/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04249 2026-07-09 cs.RO 版本更新 88%

RoboLight: A Dataset with Linearly Composable Illumination for Robotic Manipulation

RoboLight: 一个具有线性可组合照明的机器人操作数据集

Shutong Jin, Jin Yang, Muhammad Zahid, Florian T. Pokorny

机构 * School of Electrical Engineering and Computer Science, KTH Royal Institute of Technology(电气工程与计算机科学学院,皇家理工学院)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO

AI总结 RoboLight数据集通过线性可组合照明技术,为机器人操作提供真实世界和合成数据,支持感知挑战和任务多样性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16943 2026-07-09 cs.RO cs.AI 版本更新 84%

LHM-Humanoid: Long-Horizon Human Motion Control for Continuous Object Transport in Cluttered Scenes

LHM-Humanoid:学习一种统一的政策以在多样化的混乱环境中实现长视距人形全身体术操作

Haozhuo Zhang, Jingkai Sun, Michele Caprio, Angelo Cangelosi, Jian Tang, Shanghang Zhang, Qiang Zhang, Wei Pan

机构 * The University of Manchester(曼彻斯特大学) X-Humanoid Peking University(北京大学) University of Hong Kong(香港大学)

专题命中 机器人操作 :manipulation(title,abstract);navigation(abstract);分类 cs.RO、cs.AI

AI总结 LHM-Humanoid通过统一政策实现人形在复杂环境中长视距全身体术操作,结合强化学习与知识蒸馏,提升跨场景泛化与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03452 2026-07-09 cs.RO 版本更新 79%

BifrostUMI: Bridging Robot-Free Demonstrations and Humanoid Whole-Body Manipulation

BifrostUMI:连接无机器人演示与人形机器人全身操作

Hongwu Wang, Chenhao Yu, Youhao Hu, Jiachen Zhang, Yuanyuan Li, Shaqi Luo

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 研究针对人形机器人全身技能学习数据收集难题,提出无机器人框架BifrostUMI,利用轻量级VR设备和特制夹具收集数据,训练高级策略预测关键点,经实验验证其对可转移人形机器人全身技能学习的有效性。

Comments 8 pages; Previously this version appeared as arXiv:2606.27239 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29358 2026-07-09 cs.RO 版本更新 79%

LAMP: Long-Horizon Adaptive Manipulation Planning for Multi-Robot Collaboration in Cluttered Space

LAMP: 杂乱空间中多机器人协作的长时域自适应操作规划

Shuai Zhou, Yorai Shaoul, Jiaoyang Li

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 提出LAMP框架,结合学习生成的操作模型与两种规划器(LAMPA*和LAMP-Lazy),实现多机器人在密集杂乱环境中的长时域协作操作规划,解决现有方法无法处理的复杂任务。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.03388 2026-07-09 cs.LG cs.CR 版本更新 57%

InferNet: Exploiting Aggregate GPU Profiles as Side-Channel for DNN Architecture Inference

InferNet:利用聚合GPU配置文件作为旁道进行DNN架构推理

Raja Hasnain Anwar, Jonah O'Brien Weiss, Tiago Alves, Sandip Kundu

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Rio de Janeiro State University(里约热内卢州立大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.LG

AI总结 研究针对DNN面临的安全威胁,提出InferNet方法,利用简单系统级信息,通过分析GPU相关内容推断DNN架构,在多框架、类型和平台上验证其有效性,能以高准确率提取模型架构。

Comments 27 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00879 2026-07-09 math.GT math.MG 版本更新 50%

Expansion joints in hyperbolic manifolds

双曲流形中的伸缩节

Alex Elzenaar

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究双曲流形通过特定度量变形,将奇异2 - 柄胶合到秩1尖点,通过操纵基本多面体改变锥角实现插值,应用于算术流形锥变形,证明可钻出2 - 桥链上解结隧道,且结构自然出现在完全增强链中。

Comments 28 pages, 20 figures. v2: in Dehn filling results, the resulting cone manifolds there are only (pinched) negative curvature not hyperbolic; main theorems unaffected. Other misc improvements

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12974 2026-07-09 quant-ph 版本更新 50%

Countermeasure against detector-blinding attack with estimation of secret-key leakage

通过估计密钥泄漏来对抗探测器致盲攻击

Dmitry M. Melkonian, Daniil S. Bulavkin, Kirill E. Bugai, Kirill A. Balygin, Dmitriy A. Dvoretskiy

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究针对探测器致盲攻击的对策,利用量子密钥分发会话中积累事件的统计分析,基于先前对连续波DBA无效的工作,扩展评估其对脉冲DBA的性能,发现能增加触发脉冲能量差,重新评估对策可行性并估计对手窃取比特比例。

Journal ref Phys. Rev. Applied 26, 014068 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24218 2026-07-09 physics.optics physics.ins-det 版本更新 50%

Visible optical vortices measured with bulk lateral shearing interferometry

用体横向剪切干涉测量法测量可见光学涡旋

Miguel López-Ripa, Íñigo Sola, Benjamín Alonso

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究利用结构化波片、二次谐波产生晶体等,通过体横向剪切干涉测量法产生并表征可见光学涡旋,验证了可见范围内脉冲产生,证明同一装置可用于不同光谱区域脉冲光束,对技术未来应用有重要意义。

Comments 12 pages, 7 figures

Journal ref Optics Express 33(9), 20180-20191 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身导航 2 篇

2604.01577 2026-07-09 cs.LG cs.AI 版本更新 62%

Exploration of Fast-Slow Latent Recurrence for Train-Short, Test-Long Generalization

倾听时思考:用于长时间序列建模的快慢复发

Shota Takashiro, Masanori Koyama, Takeru Miyato, Yusuke Iwasawa, Yutaka Matsuo, Kohei Hayashi

机构 * The University of Tokyo(东京大学) University of Tübingen(图宾根大学)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出快慢复发机制,通过结合快速递归潜在更新与慢速观测更新,提升长周期序列建模的稳定性与泛化能力,优于LSTM等基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17588 2026-07-09 cs.CL cs.HC 版本更新 50%

Modeling Distinct Human Interaction in Web Agents

建模网络代理中不同的人类交互

Faria Huq, Zora Zhiruo Wang, Zhanqiu Guo, Venu Arvind Arangarajan, Tianyue Ou, Frank Xu, Shuyan Zhou, Graham Neubig, Jeffrey P. Bigham

机构 * Carnegie Mellon University(卡内基梅隆大学) Duke University(杜克大学)

专题命中 具身导航 :navigation(abstract)

AI总结 本文通过收集400条真实用户网络导航轨迹,识别四种人机交互模式,并训练语言模型预测用户干预时机,将干预预测准确率提升61.4%-63.4%,用户评价的代理有用性提高36.8%。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 具身推理 2 篇

2604.07392 2026-07-09 cs.LG cs.IR cs.RO 版本更新 81%

Event-Centric World Modeling with Memory-Augmented Retrieval for Embodied Decision-Making

基于记忆增强检索的事件中心世界建模用于具身决策

Zhaowen Fan, Rongchao Zhang, Yunxiang Han

机构 * Zhaowen Fan(Fan 研究院) Rongchao Zhang(Zhang 实验室)

专题命中 具身推理 :world model(title);navigation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出一种事件中心世界建模框架,通过记忆增强检索实现具身决策,结合语义事件和先前经验进行决策,提升动态环境的结构抽象与可解释性。

Comments 12 pages, 9 figures, 4 tables, currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18735 2026-07-09 cs.CV cs.AI 版本更新 81%

Thinking Ahead: Foresight Intelligence in MLLMs and World Model

提前思考:多模态语言模型和世界模型中的预见智能

Zhantao Gong, Liaoyuan Fan, Qing Guo, Xun Xu, Xulei Yang, Shijie Li

机构 * College of Software, Nankai University, China(南开大学软件学院) The University of Hong Kong, China(香港大学) NKIARI, Shenzhen Futian, China(NKIARI,深圳福田,中国) AAIS & VCIP, Nankai University, China(AAIS与VCIP,南开大学,中国) A*STAR Institute of Advanced Intelligence and Computing, Singapore(新加坡A*STAR先进智能与计算研究所)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 研究定义预见智能,引入FSU-QA数据集,对视觉语言模型在预见任务中全面研究,发现当前模型不足。该数据集可评估世界模型,增强预见推理,微调小模型能超大型先进模型,为开发下一代模型提供基础,还验证了评估协议。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人基础模型 3 篇

2605.24892 2026-07-09 cs.CV 版本更新 79%

X-Foresight: A Joint Vision-Action Causal Forecasting Network via Predictive World Modeling

X-Foresight:一种通过预测世界建模的联合视觉-动作因果预测网络

Baolu Li, Jingyu Qian, Rui Guo, Yilun Chen, Hanpeng Liu, Yuan Lin, Junhong Zhou, Ruixin Liu, Liu Yang, Yutong Zheng, Zhenli Zhang, Sean Li, Chaoda Zheng, Boyang Wang, Tenglong, Gu, Zhuangzhuang Ding, Pengkun Zheng, Yu Zhang, Xianming Liu

机构 * PWM Team(PWM团队) XPeng Inc.(XPeng公司)

专题命中 机器人基础模型 :world model(title,abstract);分类 cs.CV

AI总结 提出X-Foresight,一种将预测世界模型直接集成到VLA架构中的方法,通过长程分块自回归策略和课程学习,联合学习世界建模与实时动作控制,以解决视频预测中的低熵冗余和长程因果建模难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05116 2026-07-09 cs.CV cs.AI cs.RO 版本更新 75%

VOTE: Vision-Language-Action Optimization with Trajectory Ensemble Voting

VOTE:基于轨迹集成投票的视觉-语言-动作优化

Juyi Lin, Amir Taherin, Arash Akbari, Arman Akbari, Lei Lu, Guangyu Chen, Taskin Padir, Xiaomeng Yang, Weiwei Chen, Yiqian Li, Xue Lin, David Kaeli, Pu Zhao, Yanzhi Wang

机构 * Northeastern University(东北大学) Cisco(思科) EmbodyX

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 针对VLA模型生成令牌多、动作利用不足的问题,开发训练框架微调模型减少令牌生成,引入基于投票的集成策略优化推理,相比现有模型性能更优,推理更快,证明了实际可部署性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05693 2026-07-09 cs.RO cs.AI 版本更新 62%

HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies

HiMoE-VLA:用于通用视觉-语言-动作策略的分层专家混合模型

Zhiying Du, Bei Liu, Yaobo Liang, Yichao Shen, Haidong Cao, Xiangyu Zheng, Zhiyuan Feng, Zuxuan Wu, Jiaolong Yang, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院) Xi’an Jiaotong University(西安交通大学) Tsinghua University(清华大学)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 研究通用视觉-语言-动作策略训练中异构性引发的负迁移问题,提出HiMoE-VLA框架,通过分层专家混合动作模块及两个辅助目标来解决,在多项任务上取得较好结果,还能将负迁移转化为正迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 模仿学习与强化学习 2 篇

2603.05296 2026-07-09 cs.RO cs.LG 版本更新 62%

Latent Policy Steering through One-Step Flow Policies

通过一步流策略实现潜在策略引导

Hokyun Im, Andrey Kolobov, Jianlong Fu, Youngwoon Lee

机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学) Microsoft Research(微软研究院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出Latent Policy Steering (LPS),通过一步流策略实现高保真的潜在策略改进,解决了离线强化学习中回报最大化与行为约束之间的权衡问题,实现了无需复杂超参数调整的鲁棒性能。

Comments Accepted to RSS 2026, Project Webpage : https://jellyho.github.io/LPS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13879 2026-07-09 cs.LG 版本更新 57%

Lipschitz-Regularized Critics Lead to Policy Robustness Against Transition Dynamics Uncertainty

李普希茨正则化评论家导致策略对转移动态不确定性具有鲁棒性

Xulin Chen, Ruipeng Liu, Zhenyu Gan, Garrett E. Katz

机构 * College of Engineering & Computer Science, Syracuse University(工程与计算机科学学院,苏利文大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 研究针对强化学习中转移动态不确定性致策略性能下降问题,提出基于近端策略优化的PPO-PGDLC算法,集成投影梯度下降与李普希茨正则化评论家,实验表明该算法在环境扰动下性能更好且动作更平滑。

Journal ref Vol. 39 No. 1 (2026): Proceedings of FLAIRS-39

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 机器人数据与评测 5 篇

2602.18164 2026-07-09 cs.RO 版本更新 86%

GrandTour: A Legged Robotics Dataset in the Wild for Multi-Modal Perception and State Estimation

GrandTour: 一种用于多模态感知与状态估计的野外腿式机器人数据集

Turcan Tuna, Jonas Frey, Frank Fu, Katharine Patterson, Tianao Xu, Maurice Fallon, Cesar Cadena, Marco Hutter

机构 * ETH Zurich(苏黎世联邦理工学院) Stanford University(斯坦福大学) UC Berkeley(伯克利大学) Oxford University(牛津大学)

专题命中 机器人数据与评测 :robotics(title,abstract);navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 GrandTour数据集为多模态感知与状态估计提供了大规模野外腿式机器人数据,支持SLAM和高精度状态估计的研究与开发。

Comments Turcan Tuna, and Jonas Frey contributed equally. Submitted to Sage The International Journal of Robotics Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06445 2026-07-09 cs.CV 版本更新 79%

What if? Emulative Simulation with World Models for Situated Reasoning

如果呢?基于世界模型的仿真模拟用于情境推理

Ruiping Liu, Yufan Chen, Yuheng Zhang, Junwei Zheng, Kunyu Peng, Chengzhi Wu, Chenguang Huang, Di Wen, Jiaming Zhang, Kailun Yang, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Hunan University(湖南大学) ETH Zürich(苏黎世联邦理工学院) INSAIT, Sofia University ``St. Kliment Ohridski''(INSAIT,索菲亚大学『圣克莱门特·奥赫里迪斯』) RAI Institute(RAI研究所)

专题命中 机器人数据与评测 :world model(title,abstract);分类 cs.CV

AI总结 提出WanderDream数据集,利用世界模型进行心理探索的仿真模拟,使代理无需主动探索即可回答空间假设问题,实验证明心理探索对情境推理至关重要。

Comments Accepted at ECCV 2026. The data and code are available at: https://github.com/RuipingL/WanderDream

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03834 2026-07-09 cs.RO 版本更新 57%

Let the Dynamics Flow: Stable Flow Matching Dynamical Systems

让动力学流动:稳定的流匹配动力系统

Rodrigo Pérez-Dattari, Francisco Leiva, Andrea Testa, Leonel Rozo, Javier Ruiz del Solar, Noémie Jaquier

机构 * Department of Robotics, Perception, and Learning, KTH Royal Institute of Technology(机器人、感知与学习系,皇家理工学院) Advanced Mining Technology Center (AMTC) and Department of Electrical Engineering, Universidad de Chile(先进采矿技术中心(AMTC)和电气工程系,智利大学) Bosch Center for Artificial Intelligence, Renningen, Germany(博世人工智能中心,德国Renningen) Italian Institute of Artificial Intelligence (AI4I), Turin, Italy(意大利人工智能研究所(AI4I),意大利都灵)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 提出稳定流匹配动力系统(SFMDS)框架,通过流匹配参数化动力系统并施加李雅普诺夫稳定性约束,实现稳定、可扩展、多模态的机器人运动生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19887 2026-07-09 cs.DC cs.MA cs.RO cs.SY eess.SY 版本更新 57%

DAG-Based QoS-Aware Dynamic Task Placement for Networked Multi-Stage Control Pipelines

基于DAG的QoS感知动态任务放置用于网络化多阶段控制流水线

Thien Tran, Jonathan Kua, Thuong Hoang, Minh Tran, Yuemin Ding, Jiong Jin

机构 * Deakin University, Australia(德坎大学,澳大利亚) RMIT University, Vietnam(皇家墨尔本理工大学,越南) University of Navarra, Spain(纳瓦拉大学,西班牙) Swinburne University of Technology, Australia(斯威本科技大学,澳大利亚)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本文提出一种基于DAG的QoS感知动态任务放置框架,用于网络化机器人中的感知-感知-规划-控制流水线,通过动态任务放置优化计算、通信延迟和任务放置集,解决传统静态边缘卸载和单阶段模型的不足。

Comments 5 pages, 1 figure, 1 table, 1 algorithm, accepted paper on the 24th IEEE International Conference on Industrial Informatics (INDIN), 26-29 July, 2026, Melbourne, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13817 2026-07-09 cs.LG cs.NI 版本更新 57%

What's on My Network? Using Large Language Models to Identify Real-World IoT Devices at Scale

我的网络上有什么?使用大语言模型大规模识别现实世界中的物联网设备

Rameen Mahmood, Tousif Ahmed, Sai Teja Peddinti, Danny Yuxing Huang

机构 * New York University(纽约大学) Google(谷歌)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 研究共享环境中物联网设备识别难题,引入语义推理管道,用大语言模型构建高保真标签并指令微调模型,在众多供应商中取得高准确率,对多种问题保持稳健,为大规模可信设备识别提供基础。

Comments 18 pages, 3 figures

Journal ref Proc. ACM Netw. 4, CoNEXT2, Article 26 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏