arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-25 至 2026-05-25 共收录 20 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 20 篇

2506.14135 2026-05-25 cs.RO cs.CV 91%

GAF: Gaussian Action Field as a 4D Representation for Dynamic World Modeling in Robotic Manipulation

GAF: 高斯动作场作为机器人操作中动态世界建模的4D表示

Ying Chai, Litao Deng, Ruizhi Shao, Jiajun Zhang, Kangchen Lv, Liangjun Xing, Xiang Li, Hongwen Zhang, Yebin Liu

机构 * Tsinghua University(清华大学) Beijing Normal University(北京师范大学) Shadow AI

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);world model(title);分类 cs.RO、cs.CV

AI总结 提出GAF,通过扩展3D高斯溅射引入可学习运动属性,实现动态场景的4D建模,并利用动作-视觉对齐去噪框架提升机器人操作成功率。

Comments https://ChaiYing1.github.io/projects/GAF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02239 2026-05-25 cs.RO cs.AI 88%

LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation

LACY: 基于视觉-语言模型的语言-动作循环用于自我改进的机器人操作

Youngjin Hong, Houjian Yu, Mingen Li, Changhyun Choi

机构 * Department of Electrical and Computer Engineering, Univ. of Minnesota(电气与计算机工程系,明尼苏达大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 提出LACY框架,通过联合学习语言到动作、动作到语言和语言一致性验证三个任务,实现机器人操作的自我改进,平均任务成功率提升56.46%。

Comments Accepted to ICRA 2026. Project page: https://vla2026.github.io/LACY/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23477 2026-05-25 cs.RO 88%

Semantically Structured Mixture-of-Experts for Compositional Robotic Manipulation

语义结构化混合专家用于组合机器人操作

Chengyu Deng, Guanqi Chen, Yizhou Chen, Zejia Liu, Zhiwen Ruan, Guanhua Chen, Jia Pan

机构 * The University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO;robotics(comments)

AI总结 提出语义结构化混合专家扩散策略(SMoDP),通过视觉语言模型标注的技能语义指导专家专业化,实现参数高效的多任务组合操作。

Comments Accepted to Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23263 2026-05-25 cs.RO cs.AI cs.SY eess.SP eess.SY 84%

6G Communication Networks Enabling Embodied Agents: Architecture and Prototype

6G通信网络赋能具身智能体:架构与原型

Lipeng Dai, Luping Xiang, Kun Yang

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Institute of Intelligent Networks and Communications (NINE), Nanjing University (Suzhou Campus)(南京大学智能网络与通信研究所(苏州校区))

专题命中 机器人操作 :embodied agent(title,abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种分层通信架构(包括人类意图感知层、基于O-RAN的传输层、智能中间层和具身层),并通过集成触觉设备、工业机械臂、中间平台和5G O-RAN测试床的原型验证了毫秒级延迟和稳定闭环操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23203 2026-05-25 cs.CV cs.AI cs.LG cs.RO 77%

Lipschitz Optimization for Formal Verification of Homographies

单应性矩阵形式化验证的Lipschitz优化

Jean-Guillaume Durand, Panagiotis Kouvaros, Maxime Gariel, Alessio Lomuscio

机构 * Joby Aviation(Joby航空) Safe Intelligence

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出一种利用Lipschitz优化和分段连续性对单应性矩阵进行形式化验证的方法,首次实现对投影几何变换的鲁棒性验证,在基准测试中取得最高89%加速和7%更紧的边界。

Comments 18 pages, 13 figures, 6 tables, to be published at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04929 2026-05-25 cs.RO cs.LG cs.SY eess.SY 76%

Neural Configuration-Space Barriers for Manipulation Planning and Control

用于操作规划与控制的神经构型空间障碍

Kehan Long, Ki Myung Brian Lee, Nikola Raicevic, Niyas Attasseri, Melvin Leok, Nikolay Atanasov

机构 * Contextual Robotics Institute, University of California San Diego(情境机器人研究所,加州大学圣地亚哥分校)

专题命中 机器人操作 :manipulation(title);分类 cs.RO、cs.LG

AI总结 提出一种基于神经构型空间距离函数障碍的统一方法,用于高维机器人操作规划与控制,通过分布鲁棒优化处理模型误差和传感器噪声,在杂乱动态环境中实现高效规划与鲁棒安全控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23523 2026-05-25 cs.CV 70%

ComPose: When to Trust Hands for Object Pose Tracking

ComPose:何时信任手部进行物体姿态跟踪

Jisu Shin, Junoh Lee, JunGyu Lee, Inhwan Bae, Dohyeon Lee, Hokyun Im, Youngwoon Lee, Hae-Gon Jeon

机构 * GIST(韩国信息科学与技术学院) Yonsei Univ.(延世大学) DGIST(国立地面空间技术研究所)

专题命中 机器人操作 :embodied AI(abstract);manipulation(abstract);分类 cs.CV

AI总结 提出ComPose框架,利用手部作为补充线索,结合基础模型中的物体和手部线索,在RGB视频中实现6DoF物体姿态跟踪,有效应对严重手部遮挡和几何模糊。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22986 2026-05-25 cs.RO cs.AI cs.HC cs.LG 67%

Robots That Know What to Ask: Recovering Misaligned Rewards through Targeted Explanations

知道该问什么的机器人:通过有针对性的解释恢复未对齐的奖励

Helena Merker, Nick Walker, Andreea Bobu

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出一种框架,通过检测演示中未充分指定的特征,并主动请求有针对性的纠正演示,从而从有缺陷的演示中恢复奖励函数,减少歧义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23411 2026-05-25 cs.LG cs.CR cs.CV 62%

Sample-wise Targeted Adversarial Attacks on Test-time Adaptation

面向测试时自适应的样本级定向对抗攻击

Phuc Duc Nguyen, Quang Duc Nguyen

机构 * College of Computing and Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV、cs.LG

AI总结 提出一种基于元学习的样本级定向攻击方法,通过优先感知梯度对齐策略解决攻击成功与分布隐蔽性之间的冲突,实现高成功率且难以检测。

Comments 32 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22871 2026-05-25 cs.LG cs.AI stat.ML 62%

Approximate Machine Unlearning through Manifold Representation Forgetting Guided by Self Mode Connectivity

通过自模式连通性引导的流形表示遗忘实现近似机器遗忘

Weiqi Wang, Zhiyi Tian, Chenhan Zhang, Luoyu Chen, Shui Yu

机构 * Xi'an Jiaotong University(西安交通大学) Southeast University(东南大学) University of Technology Sydney(悉尼大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 提出ManiF-SMC方法,通过将遗忘样本从其原始流形表示质心推向保留数据中最近的语义邻居,并利用自模式连通性模块自适应生成边界,在表示空间内实现近似遗忘,无需依赖标签和任务梯度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18214 2026-05-25 cs.CV 57%

EgoInteract: Synthetic Egocentric Videos Generation for Interaction Understanding and Anticipation

EgoInteract: 用于交互理解和预测的合成自我中心视频生成

Rosario Leonardi, Francesco Ragusa, Daniele Materia, Alessandro Passanisi, James Fort, Jakob Engel, Giovanni Maria Farinella

机构 * Department of Mathematics and Computer Science, University of Catania(卡塔尼亚大学数学与计算机科学系) Next Vision s.r.l.(Next Vision公司) Reality Labs Research, Meta(Meta现实实验室)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 提出EgoInteract可控模拟器,生成带密集时空标注的合成自我中心视频,用于动作分割、下一活动物体检测、交互预测和手物交互检测,在多个真实基准上提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23098 2026-05-25 cs.RO 57%

UfM*: Uncertainty from Motion* for DNN Depth Estimation Using Gaussians

UfM*:基于高斯分布的运动不确定性用于DNN深度估计

Soumya Sudhakar, Sertac Karaman, Vivienne Sze

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 机器人操作 :robotic(abstract);分类 cs.RO

AI总结 提出UfM*算法,利用紧凑高斯混合模型高效计算多视图不一致性,实现单次推理的不确定性估计,在资源受限机器人上达到实时性能。

Comments 18 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12316 2026-05-25 cs.AI cs.CL cs.CY cs.GT cs.MA 57%

GT-HarmBench: Benchmarking AI Safety Risks Through the Lens of Game Theory

GT-HarmBench:通过博弈论视角评估AI安全风险

Pepijn Cobben, Xuanqiang Angelo Huang, Thao Amelia Pham, Isabel Dahlgren, Terry Jingchen Zhang, Zhijing Jin

机构 * ETH Zürich(苏黎世联邦理工学院) Berea College(贝雷学院) University of Toronto(多伦多大学) Vector Institute(向量研究所) Max Planck Institute for Intelligent Systems, Tübingen, Germany(图宾根德国智能系统马克斯·普朗克研究所)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 提出GT-HarmBench基准,包含1535个高风险场景,基于博弈论结构(如囚徒困境、猎鹿博弈、斗鸡博弈)评估前沿AI模型在多智能体环境中的安全风险,发现模型在38%的高风险案例中未能选择对社会有益的行为,并验证了博弈论干预可提升18%的社会有益结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00979 2026-05-25 cs.CR cs.AI cs.CL 57%

GradingAttack: Exposing Security Vulnerabilities in LLM Based Educational Grading Agents

GradingAttack: 揭示基于LLM的教育评分代理中的安全漏洞

Xueyi Li, Zhuoneng Zhou, Zitao Liu, Yongdong Wu

机构 * Guangdong Institute of Smart Education(广东智能教育研究院) Jinan University(济南大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 提出GradingAttack框架,通过token级和prompt级对抗攻击策略,系统评估基于LLM的教育评分代理的安全漏洞,发现其缺乏鲁棒防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22826 2026-05-25 cs.CL cs.AI cs.GT cs.MA 57%

Evaluating Large Language Models in a Complex Hidden Role Game

评估大型语言模型在复杂隐藏角色游戏中的表现

Niklas Bauer

机构 * University of Göttingen(哥廷根大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本研究通过社交推理游戏《秘密希特勒》评估大型语言模型的推理、说服和欺骗能力,引入新指标并发现当前模型在复杂多轮操纵中效果不佳。

Comments Master's thesis, University of Göttingen

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23677 2026-05-25 cs.DC 50%

AMP: Arc Multi-Proposer Protocol with Bounded Inclusion Guarantees

AMP:具有有界包含保证的弧多提议者协议

Daniel Cason, Gordon Liao, Sergio Mena, Nenad Milošević, Adi Seredinschi, Alessandro Sforzin, João Sousa, Preston Vander Vos

专题命中 机器人操作 :manipulation(abstract)

AI总结 针对区块链系统中单一验证者对交易包含和排序的垄断权力问题,提出基于Tendermint共识的多提议者协议AMP,通过分离传播与共识设计,实现有界包含保证和批量终结,限制验证者权力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23361 2026-05-25 physics.optics 50%

Approaching physical limits of latent dimensionality in optical computing

接近光学计算中潜在维度的物理极限

Zhenyu Zhao, Zijun Qiu, Xuan Hu, Yao Zhou, Jinlong Xiang, Youlve Chen, Chaojun Xu, Yuchen Yin, Tao Lin, Yikai Su, Xuhan Guo

专题命中 机器人操作 :manipulation(abstract)

AI总结 通过探索有界光学域潜在维度的物理极限,设计并实现了超紧凑多模光子处理器,在实验上逼近这些极限,为光学计算架构提供了缺失的理论参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23205 2026-05-25 cond-mat.mtrl-sci cond-mat.str-el physics.app-ph 50%

Pulsed thermal annealing enables switching of chiral antiferromagnetic order with a sub-millitesla field in Mn$_3$Sn

脉冲热退火实现亚毫特斯拉磁场下Mn$_3$Sn手性反铁磁序的切换

Xiaokang Li, Jing Zhang, Xiaodong Guo, Zengwei Zhu

专题命中 机器人操作 :manipulation(abstract)

AI总结 通过脉冲热退火结合亚毫特斯拉磁场,在Weyl反铁磁体Mn$_3$Sn中实现了手性反铁磁态的可靠切换,并揭示了热软化降低能量势垒的关键作用。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17629 2026-05-25 math.AT 50%

On the complexity of parametrized motion planning algorithms

参数化运动规划算法的复杂性

Navnath Daundkar, Ekansh Jauhari

专题命中 机器人操作 :robotics(abstract)

AI总结 研究第r个顺序参数化拓扑复杂度的概率变体,该变体从下界度量经典不变量,并衡量构建允许参数化运动规划算法的难度。

Comments Minor changes made based on the referee report. To appear in the SIAM Journal on Applied Algebra and Geometry. May differ slightly from the published version

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20660 2026-05-25 quant-ph cond-mat.quant-gas physics.atom-ph 50%

Continuous operation of a coherent 3,000-qubit system

3000量子比特相干系统的连续运行

Neng-Chun Chiu, Elias C. Trapp, Jinen Guo, Mohamed H. Abobeih, Luke M. Stewart, Simon Hollerith, Pavel Stroganov, Marcin Kalinowski, Alexandra A. Geim, Simon J. Evered, Sophie H. Li, Xingjian Lyu, Lisa M. Peters, Dolev Bluvstein, Tout T. Wang, Markus Greiner, Vladan Vuletić, Mikhail D. Lukin

专题命中 机器人操作 :manipulation(abstract)

AI总结 通过光学晶格传送带和光镊实现高重载率,在保持量子相干性的同时连续组装并维持超过3000个原子量子比特阵列超过2小时,为大规模连续运行原子钟、传感器和容错量子计算机奠定基础。

Comments Main text: 8 pages, 4 figures. Methods: 7 pages, 10 figures. Ancillary files: one supplementary movie and caption

Journal ref Nature 646, pages 1075-1080 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏