arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-20 至 2026-08-20 共收录 27 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 27 篇

2608.18787 2026-08-20 cs.RO 新提交 89%

Dream2Reward: Transition-Alignment Reward Models from Positive Demonstrations for Robotic Manipulation

Dream2Reward:基于正演示的机器人操纵转换对齐奖励模型

Haoyu Zhang, Zecui Zeng, Bin Wang, Lusong Li, Liang Lin, Long Cheng

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) JD Explore Academy(京东探索学院)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);robot learning(abstract);分类 cs.RO

AI总结 Dream2Reward从正演示学习成功潜在转换场,通过转换级比较生成密集因果奖励,可提升机器人操纵的成功-失败区分度与下游策略性能。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18227 2026-08-20 cs.RO 新提交 88%

Revisiting the "Push-T" Robot Manipulation Task with Agentic Robotics

用智能体机器人技术重新审视“Push-T”机器人操作任务

Shuangyu Xie, Kaiyuan Chen, Ken Goldberg

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 机器人操作 :robotics(title,abstract);manipulation(title,abstract);分类 cs.RO

AI总结 该研究在智能体机器人技术背景下,借助带Fable 5的Claude Code编码智能体,无需演示数据解决Push-T等机器人操作任务,其策略成功率达100%,步骤比基准扩散策略少46%,还支持多字母操作及跨实体机械臂仿真。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18669 2026-08-20 cs.LG 新提交 87%

Reinforced Planning with Latent World Models

基于潜世界模型的强化规划

Armin Sommer, Jannik Schilling

机构 * Pantheon Industries(万神殿工业公司)

专题命中 机器人操作 :world model(title,abstract);manipulation(abstract);navigation(abstract);robotic(abstract)

AI总结 该研究提出RP1方法,将良好搜索规则强化到神经规划器中,可改进多步计划,在多个机器人任务中性能优于手工搜索算法,且效率更高。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18618 2026-08-20 cs.RO 新提交 85%

LabDex: A Hierarchical Benchmark for Dexterous Manipulation in Laboratories

LabDex:面向实验室灵巧操作的分层基准

Zhipeng Tang, Sihang Chen, Sha Zhang, Peihao Yang, Yan Liu, Wentao Zhao, Xinrui Liu, Rui Huang, Wensheng Du, Yuting Huang, Jiajun Deng, Lidian Wang, Yuan Zhang, Yanyong Zhang

专题命中 机器人操作 :manipulation(title,abstract);robot learning(abstract);robotic(abstract);分类 cs.RO

AI总结 LabDex是面向化学实验室灵巧操作的分层基准,整合真实与仿真平台,覆盖原子技能、组合任务及长周期实验,可用于机器人学习方法的跨层级评估,为自主实验室机器人研发提供支撑。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04546 2026-08-20 cs.RO cs.AI cs.CV cs.LG 版本更新 85%

Mask2Real-WM: Segmentation Masks as a Sim-to-Real Bridge for Controllable Dexterous World Models

Mask2Real-WM:作为可控灵巧世界模型的模拟到现实桥梁的分割掩码

Riccardo O. Feingold, Davide Liconti, Chenyu Yang, Robert K. Katzschmann

机构 * Soft Robotic Lab, Department of Mechanical and Process Engineering ETH Zurich, Switzerland(苏黎世联邦理工学院机械与过程工程系软机器人实验室)

专题命中 机器人操作 :world model(title,abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出Mask2Real-WM,一种用于灵巧操纵的两阶段动作条件世界模型,将像素预测解耦为动力学和渲染模型,利用分割空间较小的模拟到现实差距,通过合成数据预训练和真实演示微调实现各自由度动作可控。

Comments 23 pages, 24 figures, 4 tables. Preprint. Project page: this https URL (https://srl-ethz.github.io/Mask2Real-WM/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18948 2026-08-20 cs.RO 新提交 83%

RoboEdit: Turning Human Manipulation Videos into Scalable Robot Experience

RoboEdit:将人类操作视频转化为可扩展的机器人体验

Yaowei Guo, Zeng Tao, Yuxin Jiang, Yunuo Chen, Zhiyang Dou, Yuxiang Ma, Yin Yang, Demetri Terzopoulos, Ying Jiang, Chenfanfu Jiang

专题命中 机器人操作 :manipulation(title,abstract);robot learning(abstract);分类 cs.RO

AI总结 研究人员开发RoboEdit工具套件,通过RoboEdit-ADC自动流程构建含17.4万对齐视频的数据集,利用RoboEdit-Trans引擎实现人类操作视频到机器人视频的高质量转化,为机器人学习提供可扩展监督。

Comments 14 pages, 13 figures. Supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16806 2026-08-20 cs.RO cs.AI 版本更新 81%

Breaking Planner Integrity Boundary: Enviroment State-Text Injection Attack on LLM-Driven Embodied Agents

当状态成为攻击面:大语言模型驱动的具身智能体中的状态语义注入

Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang, Jinlin Fan, Bowen Xiao, Chi Guo, Keyan Guo, Hongxin Hu

机构 * Wuhan University(武汉大学) University at Buffalo(布法罗大学)

专题命中 机器人操作 :embodied agent(title,abstract);分类 cs.RO、cs.AI

AI总结 该文聚焦LLM驱动的具身智能体,梳理其技术演进与现有模型,指出其需结合多类信息完成任务落地后执行,为后续状态语义注入攻击研究奠定基础。

Comments submitted to USENIX Security 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18736 2026-08-20 cs.LG cs.CR cs.DC 新提交 79%

FedLNS: Leverage LayerNorm Signature Modeling to Mitigate Adversarial Manipulation in Federated LLMs

FedLNS:利用层归一化签名建模缓解联邦大语言模型中的对抗性操纵

Kai Li, Jong-Ik Park, Carlee Joe-Wong, Wei Ni, Falko Dressler

机构 * Interdisciplinary Centre for Security, Reliability and Trust (SnT), University of Luxembourg(卢森堡大学安全、可靠性与跨学科研究中心(SnT)) Carnegie Mellon University(卡内基梅隆大学) Edith Cowan University(埃迪斯科文大学) TU Berlin(柏林工业大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.LG

AI总结 FedLNS是一种服务器端联邦学习框架,通过层归一化签名筛选恶意更新,在200个客户端、40%目标操纵下,对三类模型均实现优于基线的测试困惑度。

Comments 13 pages (main body), 36 pages (appendix), 3 figures, 98 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18701 2026-08-20 cs.RO 新提交 79%

SoftVTBench: A Deformation-Aware Visuo-Tactile Dataset and Benchmark for Deformable-Object Manipulation

SoftVTBench:面向可变形物体操作的形变感知视觉-触觉数据集与基准

Bowen Jing, Mingxin Wang, Ruiyang Hao, Chenchen Ge, Hanwen Shen, Junjie He, Yang Cui, Yiming Hou, Weitao Zhou, Jiawei Wang, Minglei Li, Dandan Zhang, Ding Zhao, Houde Liu, Xiaofan Li, Si Liu, Ping Luo, Haibao Yu

机构 * Tuojing Intelligence(拓境智能) Tsinghua University(清华大学) Southeast University(东南大学) Stevens Institute of Technology(斯蒂文斯理工学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Manchester(曼彻斯特大学) Simple AI Imperial College London(帝国理工学院) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 本研究推出SoftVTBench视觉-触觉数据集与基准,定义形变感知成功率(DSR),发现触觉信息本身未必提升多模态融合,为可变形物体操作的物理交互研究提供资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18671 2026-08-20 cs.CV 新提交 79%

Vision-Language Models for Egocentric Video: From Hand-Object Interaction to Embodied AI

用于第一人称视角视频的视觉-语言模型:从手-物交互到具身智能

Mohammad Zamani, Fatemeh Ziaeetabar

机构 * University of Tehran(德黑兰大学)

专题命中 机器人操作 :embodied AI(title,abstract);分类 cs.CV

AI总结 本综述梳理了用于第一人称视角视频理解的视觉-语言模型的发展,分析其挑战、研究方向与局限,明确了可部署具身智能的关键优先方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18454 2026-08-20 cs.RO 新提交 79%

Backward Layout Search for Sequence-Constrained Robotic Assembly

面向序列约束机器人装配的反向布局搜索

Xi Zhang, Jiancong Dai, Hao Chen, Zhengtao Hu, Changcai Yang, Weiwei Wan

机构 * College of Computer and Information Sciences, Fujian Agriculture and Forestry University(福建农林大学计算机与信息学院) School of Mechatronic Engineering and Automation, Shanghai University(上海大学机电工程与自动化学院) Department of System Innovation, Graduate School of Engineering Science, Osaka University(大阪大学工程科学研究生院系统创新系)

专题命中 机器人操作 :robotic(title,abstract);分类 cs.RO

AI总结 针对序列约束机器人装配布局规划的挑战,提出反向布局搜索(BLS)算法,通过反向分配零件初始位姿并结合多维度检查与波束选择,在5个装配模型上实现了更优的无碰撞布局规划,减少了评估次数与搜索时间。

Comments Submit to ROBIO2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18739 2026-08-20 econ.TH 新提交 78%

Coalitional Manipulation of Set-Valued Median Voting

集值中位数投票的联盟操纵

Toshiya Yoshimura

专题命中 机器人操作 :manipulation(title,abstract)

AI总结 该论文针对单峰域上区间值中位数对应关系的联盟操纵问题,证明了不同扩展下群体策略防卫性的表现,且最多两名选民的联盟即可支撑相关结果,明确了联盟稳健性对集值灵活性的限制作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18446 2026-08-20 cs.RO 新提交 74%

HarvestPoint-ACT: Explicit Target Selection and Harvest-Point Conditioning for Robotic Fruit Harvesting under Occlusion

HarvestPoint-ACT:遮挡环境下机器人水果采摘的显式目标选择与采摘点条件设置

Hanying Hu, Weipeng Li, Yikun Huang, Hao Chen, Zhengtao Hu, Changcai Yang, Weiwei Wan

机构 * College of Computer and Information Sciences, Fujian Agriculture and Forestry University(福建农林大学计算机与信息学院) School of Mechatronic Engineering and Automation, Shanghai University(上海大学机电工程与自动化学院) Graduate School of Engineering Science, The University of Osaka(大阪大学工程科学研究生院)

专题命中 机器人操作 :robotic(title);分类 cs.RO

AI总结 HarvestPoint-ACT通过显式感知目标与采摘点,结合调度器选择目标,在树冠模型上实现88%采摘成功率,重度遮挡下达75%,解决机器人水果采摘的遮挡与闭合点推断问题。

Comments Submit to IEEE ROBIO 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18938 2026-08-20 cs.AI cs.LG 新提交 62%

Breaking the weakest link to evade vision language models

打破最弱环节以规避视觉语言模型

Ilan Zini, Boussad Addad, Katarzyna Kapusta

机构 * ESILV(ESILV高等工程师学院) Thales(泰雷兹集团)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对视觉语言模型(VLMs)提出仅优化视觉编码器的梯度攻击方法,在Qwen2.5-VL等模型上验证微小扰动可规避模型,凸显其对抗操纵的脆弱性并呼吁强化安全机制。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18507 2026-08-20 cs.RO 新提交 61%

An Experimental Study of Downwash Effects on a Continuum Manipulator Integrated with a Multirotor UAV

多旋翼无人机集成的连续体机械臂下洗效应的实验研究

Anuraj Uthayasooriyan, Krishna Manaswi Digumarti, ernando Vanegas, Felipe Gonzalez

机构 * Queensland University of Technology (QUT)(昆士兰科技大学) QUT Centre for Robotics(昆士兰科技大学机器人中心) Research Engineering Facility (REF)(研究工程设施) School of Electrical Engineering and Robotics(电气工程与机器人学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO;robotics(comments)

AI总结 本文针对多旋翼无人机集成的连续体机械臂,通过实验研究了螺旋桨下洗对其位姿的影响,提出CC引导的GPR残差模型可显著提升位姿预测精度,为相关系统的下洗补偿建模提供了方法。

Comments Accepted to publish in Robotics and Automation Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19188 2026-08-20 cs.RO 新提交 57%

PartialBiGrasp: Inferring Hidden Local Geometry for Bimanual Grasping from Partial Views

PartialBiGrasp:从部分视角推断隐藏局部几何以实现双臂抓取

Ayush Kaura, Vignesh Vembar, Md Faizal Karim, Keshab Patra, K Madhava Krishna

机构 * Robotics Research Center IIIT Hyderabad(印度信息技术研究所海得拉巴分校机器人研究中心)

专题命中 机器人操作 :robotic(abstract);分类 cs.RO

AI总结 PartialBiGrasp是基于部分点云的双臂抓取生成框架,通过卷积占用网络学习几何特征生成抓取对并优化,经实验验证可实现鲁棒稳定的抓取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18230 2026-08-20 cs.LG 新提交 57%

Allocating Recurrent Compute in Looped Language Models

在循环语言模型中分配循环计算

Ruhai Lin, Yiyang Guo, Rui-Jie Zhu, Hao Ye, Jason K. Eshraghian

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 机器人操作 :manipulation(abstract);分类 cs.LG

AI总结 该研究针对循环语言模型,提出仅重复混合器、单次执行密集FFN的MixerLoop,在不同参数规模下验证其性能,可保留循环深度优势并降低计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16153 2026-08-20 cs.RO 版本更新 57%

Unified Condition-Action Modeling for Accurate One-Step Action Generation

用于精准单步动作生成的统一条件-动作建模

Xinyu Zhou, Zikun Cai, Kuangji Zuo, Gen Li, Boyu Ma, Yanshuo Lu, Yutong Song, Mingqi Yuan, Jiayu Chen, Jianfei Yang

机构 * NTU(南洋理工大学) HKU(香港大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 该研究提出UCA-Flow统一条件-动作建模框架,通过共享令牌空间与改进双路监督方案,提升机器人单步动作生成的成功率与推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29940 2026-08-20 cs.RO 版本更新 57%

WARP: Whole-Body Retargeting for Learning from Offline Human Demonstrations

WARP: 从离线人类演示中学习的全身重定向

Zhenyang Chen, Chuizheng Kong, Chuye Zhang, Yuanshao Yang, Lawrence Y. Zhu, Shreyas Kousik, Danfei Xu

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 提出WARP离线管线,通过闭式肩-肘-腕几何求解器精确跟踪末端执行器并保持全身结构意图,实现从人类演示到机器人动作的零样本全身移动操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03079 2026-08-20 cs.CV 版本更新 57%

ORV: 4D Occupancy-centric Robot Video Generation

ORV:基于占用的4D机器人视频生成

Xiuyu Yang, Bohan Li, Shaocong Xu, Nan Wang, Chongjie Ye, Zhaoxi Chen, Minghan Qin, Yikang Ding, Zheng Zhu, Xin Jin, Hang Zhao, Hao Zhao

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) IIIS, Tsinghua University(清华大学人工智能研究院) Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology, Ningbo(宁波工程技术院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) S-Lab, Nanyang Technological University(南洋理工大学S实验室) ByteDance(字节跳动) Kling, Kuaishou Technology(Kling,快手科技) GigaAI AIR, Tsinghua University(清华大学人工智能研究院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 ORV提出一种基于占用的4D机器人视频生成框架,通过结合动作先验与占用视觉先验,提升视频生成质量与可控性,实现多视角一致合成和仿真到现实的迁移。

Comments CVPR 2026. Project page: this https URL (https://orangesodahub.github.io/ORV/) Code: this https URL (https://github.com/OrangeSodahub/ORV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02891 2026-08-20 cs.GR cs.CV 版本更新 57%

Interactive Stroke-based Neural SDF Sculpting

基于交互式笔画的神经SDF雕刻

Fizza Rubab, Yiying Tong

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 本文提出一种交互式笔画神经SDF雕刻框架,解决传统网格工具无法高效雕刻神经SDF的问题,实现直观、高性能的三维形状编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19148 2026-08-20 cs.HC 新提交 50%

Trade-offs in Data Color Palette Design Tools

数据调色板设计工具中的权衡

Shiyi He, Andrew M McNutt

专题命中 机器人操作 :manipulation(abstract)

AI总结 该研究通过40名设计师使用4种不同交互模态的调色板工具完成任务的实验,发现工具差异在可访问性约束任务中更显著,部分工具可引导设计师关注可访问性,揭示了调色板设计工具的权衡及其对设计结果的影响。

Comments 2 pages, IEEE VIS 2026 POSTER

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19016 2026-08-20 physics.optics physics.atom-ph quant-ph 新提交 50%

3D trapping of a meta-atom in an intensity minimum

超原子在强度极小值中的三维捕获

Bin Lu, Adeel Afridi, Nadine Meyer, Romain Quidant

专题命中 机器人操作 :manipulation(abstract)

AI总结 该研究实验探究光学驻波中硅粒子的捕获,发现硅粒子可在强度极小值处稳定三维捕获,类比蓝失谐原子捕获,为拓展光操控工具箱提供了新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16895 2026-08-20 cs.CY physics.soc-ph 版本更新 50%

Orphan risks at the frontier of artificial intelligence: What diverging safety and compliance frameworks reveal about how AI companies choose the risks they prioritize

人工智能前沿的孤儿风险:不同的安全与合规框架揭示了AI公司如何选择其优先处理的风险

Andrew D. Maynard

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文对比四家前沿AI公司2023-2026年的安全合规文件,识别出其风险选择的四个筛选标准,提出“安全差异”概念,揭示了孤儿风险的成因及轻量应对工具。

Comments 21 pages, 40 references. Also available on SSRN: this https URL (https://dx.doi.org/10.2139/ssrn.7068898)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17816 2026-08-20 physics.optics 版本更新 50%

Robust Orbital Angular Momentum Transfer Using Low-Cost Diffractive Optics

利用低成本衍射光学元件实现稳健的轨道角动量传递

Beatriz Morales-Cruzado, Benjamin Perez-Garcia, Francisco G. Peérez Gutiérrez, Carmelo Rosales-Guzmán

专题命中 机器人操作 :manipulation(abstract)

AI总结 该研究利用印刷在醋酸基底上的低成本静态二元全息图,实现了光镊中稳健的轨道角动量传递,构建了适用于多领域的结构化光操控平台。

Comments 4 pages, 5 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24712 2026-08-20 quant-ph cs.IT math-ph 版本更新 50%

Sample complexity of quantum resource testing via one-shot quantum blurring

通过一次性量子模糊进行量子资源测试的样本复杂度

Dmitry Grinko, Ludovico Lami

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究量子资源测试的样本复杂度,通过建立严格有限\(n\)界,给出达到规定性能所需副本数估计,解决了正则化Rényi相对熵收敛问题,得到非对称资源测试样本复杂度界。

Comments 10+27 pages; v2: typos fixed

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08540 2026-08-20 cond-mat.mtrl-sci 版本更新 50%

Asymmetric defect distribution generates bulk Dzyaloshinskii-Moriya interaction in Pt/Co/Pt

非对称缺陷分布在Pt/Co/Pt中产生体Dzyaloshinskii-Moriya相互作用

Ayaka P. Ohki, Tatsuro Karino, Daigo Shimizu, Takeshi Kato, Daiki Oshima, Masahiro Nagao

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究揭示名义对称Pt/Co/Pt多层膜中体DMI源于非对称分布的位错,建立了缺陷工程调控DMI的策略,为自旋电子器件提供新设计原理。

详情

展开后加载摘要…

URL PDF HTML 收藏