arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-21 至 2026-07-21 共收录 23 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 23 篇

2607.16920 2026-07-21 cs.RO cs.SE 新提交 83%

A BIM-enabled, Agent-based Discrete-event Simulation Platform for Robotic Studies: A Method based on Graph Theory

一种用于机器人研究的基于BIM和智能体的离散事件模拟平台:一种基于图论的方法

Ping Xu, Xinghua Gao

专题命中 机器人数据与评测 :robotic(title,abstract);navigation(abstract);分类 cs.RO

AI总结 研究针对室内机器人复杂任务中建筑信息利用不足问题,提出基于BIM和智能体的模拟平台,将室内环境映射为图,用图论算法规划导航路径,经模拟验证其有效性,为BIM智能机器人系统奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16921 2026-07-21 cs.RO cs.AI 新提交 81%

PREFAIL: Identifying Precursors to Failures in Robotic Lift-and-Place Tasks to Improve Task Execution Performance

PREFAIL:识别机器人提升和放置任务中故障的先兆以提高任务执行性能

Zeyu Shangguan, Rajas Chitale, Rutvik Patel, Satyandra K. Gupta, Daniel Seita

机构 * University of Southern California(南加州大学)

专题命中 机器人数据与评测 :robotic(title);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 研究非prehensile物料搬运的提升和放置任务,提出PREFAIL方法通过分析目标物体与载体相对运动预测故障先兆,引入精确标识最新干预时间的数据集,经实验验证该方法显著提升故障先兆响应的准确性与及时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17767 2026-07-21 cs.RO 新提交 79%

VLN-AVP: Zero-Shot Vision-Language Navigation with Hybrid Long-Short-Term Memory for Autonomous Valet Parking

VLN-AVP:用于自动代客泊车的基于混合长短时记忆的零样本视觉语言导航

Yijian Li, Xiangru Mu, Changze Li, Hantian Shi, Jiyuan Cai, Jia Cai, Xiaoxue Liu, Yajing Sun, Ming Yang, Tong Qin

机构 * Shanghai Jiao Tong University(上海交通大学) Yinwang Intelligent Technology Co., Ltd.(银望智能科技有限公司)

专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.RO

AI总结 研究针对自主代客泊车依赖预建地图限制可扩展性问题,提出VLN-AVP零样本导航框架,结合BEV模型与VLM,引入混合记忆系统,构建数据集和基准,实验证明该方法在模拟和实际车辆实验中均有良好效果,提升了成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17778 2026-07-21 cs.CV cs.AI 新提交 79%

CDIS: Cross-Dimensional Class-Agnostic 3D Instance Segmentation via 2D Mask Tracking and 3D-2D Projection Merging

CDIS:通过2D掩码跟踪和3D-2D投影合并实现跨维度类别无关的3D实例分割

Juno Kim, Hye-Jung Yoon, Yesol Park, Byoung-Tak Zhang

机构 * Interdisciplinary Program in AI, Seoul National University(首尔国立大学人工智能跨学科项目)

专题命中 机器人数据与评测 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 研究针对未知环境中机器人系统的类别无关3D实例分割问题,提出CDIS零样本框架,通过跨帧跟踪2D实例掩码并与3D超点关联,在2D和3D间创建反馈循环,实验证明其比现有方法更准确、一致且高效可扩展。

Comments 6 pages, 5 figures. Published in the proceedings of the 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), pp. 4269-4274

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17250 2026-07-21 cs.CL 新提交 78%

EvolvingWorld: An Open-Schema Framework for Co-Evolving Role-Play Agents and World Model in Interactive Literary World

EvolvingWorld:用于交互式文学世界中角色与世界模型协同进化的开放架构框架

Qing Zong, Yue Guo, Mengxin Yang, Yiwen Guo, Yangqiu Song

机构 * Hong Kong University of Science and Technology(香港科技大学) LIGHTSPEED(光速) Huazhong University of Science and Technology(华中科技大学)

专题命中 机器人数据与评测 :world model(title,abstract)

AI总结 研究交互式文学世界中角色与世界协同进化问题,提出EvolvingWorld框架,含角色智能体和世界模型两个耦合模块,制定7个可训练任务,构建数据集并引入评估协议,实验证明其能有效改进长期模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17754 2026-07-21 cs.CV cs.AI 新提交 76%

DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation

DA-Fusion:基于可变形注意力的RGB-D融合Transformer用于未见物体实例分割

Yesol Park, Hye-Jung Yoon, Juno Kim, Byoung-Tak Zhang

机构 * Interdisciplinary Program in AI, Seoul National University(首尔国立大学人工智能跨学科项目) Artificial Intelligence Institute, Seoul National University(首尔国立大学人工智能研究所) Department of Computer Science, Seoul National University(首尔国立大学计算机科学系)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);robotics(comments,journal_ref);分类 cs.AI、cs.CV

AI总结 针对物流自动化中未见物体分割难题,提出基于可变形注意力的RGB-D融合Transformer(DA-Fusion),结合RGB与深度数据优势提升分割精度,引入OCBD数据集,实验证明其性能优于现有方法,适用于现实物流任务。

Comments 7 pages, 5 figures. Published in the Proceedings of the 2025 IEEE International Conference on Robotics and Automation (ICRA 2025)

Journal ref 2025 IEEE International Conference on Robotics and Automation (ICRA), 2025, pp. 7490-7496

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13586 2026-07-21 cs.CV 版本更新 70%

UniPhysGen: Unified Physical Grounding for Simulation-Ready 3D Assets

UniPhysGen:用于可模拟3D资产的统一物理基础

Xian Li, Rong Wei, Lujie Yang, Haolin Huang, Junyuan Fang, Siliang Tang, Jun Xiao, Rui Tang, Juncheng Li

机构 * Zhejiang University(浙江大学) Manycore Tech Inc.(众核科技公司) University of Electronic Science and Technology of China(电子科技大学)

专题命中 机器人数据与评测 :embodied AI(abstract);robotic(abstract);分类 cs.CV

AI总结 研究针对现有3D资产缺乏统一物理语义问题,提出UniPhys框架及UniPhysGen模型,通过联合推理关节语义和固有物理属性,减轻几何捷径偏差,经实验验证其性能先进,生成资产可用于机器人模拟环境。

Comments 39 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06787 2026-07-21 cs.RO cs.SY eess.SY 版本更新 70%

Digital-physical testbed for ship autonomy studies in the Marine Cybernetics Laboratory basin

海洋控制实验室流域船舶自主研究的数字物理试验台

Emir Cem Gezer, Mael Korentin Ivan Moreau, Anders Sandneseng Høgden, Dong Trong Nguyen, Roger Skjetne, Asgeir Sørensen

机构 * Department of Marine Technology, Norwegian University of Science and Technology - NTNU(海洋技术系,挪威科学技术大学 - NTNU)

专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 针对MASS算法测试难题,开发数字物理试验台,含小型模型船等设施,建立从低保真到高保真的设计验证流程,能实现不同尺度验证,展示了其在船舶自主GNC算法测试上的进展与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17699 2026-07-21 cs.RO cs.CV 新提交 66%

SLAM in Low-Light Environments: Project Report

低光照环境下的同步定位与地图构建:项目报告

Oleh Basystyi, Anna Stasyshyn, Oleksandr Kosovan, Yaroslav Prytula

机构 * Applied Sciences Faculty, Ukrainian Catholic University(乌克兰天主教大学应用科学学院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV;navigation(comments)

AI总结 研究低光照环境下RGB相机的SLAM问题,对六种不同范式的系统在五个序列上进行基准测试,发现仅RGB的SLAM需惯性融合和全局优化才能稳定跟踪,为后续改进提供方向。

Comments Conducted as part of the certification program "Off-Road Visual Navigation: Development and Evaluation of Systems in Challenging Environments'' at the Faculty of Applied Sciences, Ukrainian Catholic University, in collaboration with the UCU UGV Club

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16862 2026-07-21 cs.CV cs.RO 新提交 66%

InLiER: Learning-Free Heterogeneous LiDAR Place Recognition via Intermediate Mixed-Radix Structural Keypoint Tokenization

InLiER:通过中间混合基数结构关键点令牌化实现无学习的异构激光雷达地点识别

Nikolaos Stathoulopoulos, George Nikolakopoulos

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV;robotics(comments)

AI总结 研究针对机器人平台结合多种激光雷达致现有描述符性能下降的问题,提出无学习管道InLiER,通过混合基数令牌ID编码关键点信息,经三个检索阶段处理,在相关数据集和实验中表现出色,优于基于学习的基线。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L). 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18230 2026-07-21 cs.CV cs.AI 新提交 62%

Simple Domain Generalization for Strong Pixel-Level Image Tampering Detection in Modern VLMs

现代视觉语言模型中用于强像素级图像篡改检测的简单域泛化

Yi Tang, Xinyi Shang, Jiacheng Cui, Sondos Mahmoud Bsharat, Jiacheng Liu, Xiaohan Zhao, Tran Dinh Tien, Ahmed Elhagry, Salwa K. Al Khatib, Tianjun Yao, Yonina C. Eldar, Jing-Hao Xue, Hao Li, Salman Khan, Zhiqiang Shen

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University College London(伦敦大学学院) Weizmann Institute of Science(魏茨曼科学研究所)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 研究现代视觉语言模型中像素级图像篡改检测的域泛化,提出基于平衡小批量采样和后期注入策略的简单训练框架,大幅提升平均gIoU和cIoU,增强了篡改定位和分布外鲁棒性。

Comments Our code is available at https://github.com/VILA-Lab/PIXAR-DG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18063 2026-07-21 cs.CR cs.AI cs.LG 新提交 62%

Adaptive Adversaries: A Multi-Turn, Multi-LLM Benchmark for LLM Agent Security

自适应对手:用于大语言模型智能体安全的多轮、多大语言模型基准测试

Devina Jain, David Hartmann, Chuan Li

机构 * Lambda

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出针对无记忆大语言模型防御者的自适应多轮攻击的21场景基准测试,通过观察防御者响应灵活调整攻击。介绍了不同攻击轮次成功率,汇集多个前沿攻击者大语言模型的情况,还指出不同防御者弱点差异及场景排名不一致性,并发布了相关基准测试及数据集。

Comments Second Workshop on Agents in the Wild: Safety, Security, and Beyond

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16015 2026-07-21 cs.CV cs.RO 版本更新 62%

PIXIE: A Zero-Shot texture-invariant 6D pose estimation framework for unseen objects with assembly defects

PIXIE:用于具有装配缺陷的未见物体的零样本纹理不变6D姿态估计框架

Leon Jungemeyer, Alejandro Magaña, Gautham Mohan, Matthias Karl, Daniel Werdehausen

机构 * Carl Zeiss AG(卡尔蔡司股份公司) Carl Zeiss Digital Innovation(卡尔蔡司数字创新公司)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 PIXIE是用于有装配缺陷的未见物体的零样本纹理不变6D姿态估计框架,仅用无纹理3D模型从RGB图像估计姿态,通过合成深度和法线图匹配关键点,基于PnP估计姿态,对光照和纹理变化鲁棒,在基准测试中取得好结果并引入新数据集。

Comments This work has been accepted for publication in IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026. The final published version will be available via IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10879 2026-07-21 cs.RO cs.CV 版本更新 62%

3D Scene Graph Prediction: Generating Hierarchical Models from Partially Observed Environments

3D场景图预测:从部分观测环境生成层次模型

Siyi Hu, Jared Strader, Hyungtae Lim, Luca Carlone

机构 * Laboratory for Information & Decision Systems (LIDS), Massachusetts Institute of Technology(信息与决策系统实验室(LIDS),麻省理工学院) Department of Electrical and Computer Engineering, Oakland University(奥克兰大学电气与计算机工程系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 针对机器人部分观测环境的场景预测问题,提出自上而下框架合成含房间层和物体层的3D场景图,用混合域图扩散模型等方法,相比其他方法对分布外部分平面图泛化性更好,能在真实场景预测。

Comments Accepted at IROS 2026. Main paper: 8 pages, 3 figures, 3 tables. Includes a supplementary appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18210 2026-07-21 cs.RO 新提交 57%

Optimization of sim-to-real transfer in the humanoid robot NICO

人形机器人NICO中模拟到现实转换的优化

Juraj Gavura, Igor Farkaš

机构 * Comenius University Bratislava(布拉迪斯拉发夸美纽斯大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 研究针对人形机器人模拟到现实转换中因定位误差妨碍抓取的问题,通过添加多种检测和定位方法及校正,形成基于校准的抓取管道,并实现视觉反馈模型,提高了抓取成功率。

Comments 12 pages, 8 figures, accepted to International Conference on Artificial Neural Networks 2026, Neurorobotics workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18154 2026-07-21 cs.RO 新提交 57%

World Translation: Minimizing Sim-to-Real Gap with Backward Dynamics Extraction and Unpaired Domain Translation

世界翻译:通过反向动力学提取和非配对域翻译最小化模拟与现实之间的差距

Xinchen Yao, Leixin Chang, Hua Chen

机构 * Zhejiang University(浙江大学) LimX Dynamics(LimX动力学公司)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 研究模拟与现实差距问题,提出“世界翻译”方法,利用模拟器和学习动力学互补优势,反向提取动力学信息并跨域转换,实验表明该方法能更准确建模,在特定情况下优势明显,还证实可改进策略转移。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17701 2026-07-21 cs.AI 新提交 57%

ProEvent: An Event-centric Benchmark for Proactive Agents

ProEvent:面向主动智能体的以事件为中心的基准测试

Guanzhen Li, Liangming Pan, Leye Wang

机构 * School of Computing, Peking University(北京大学计算机学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 针对主动智能体研究忽视事件中心协助及评估难的问题,引入ProEvent基准测试,基于即时通讯聊天评估智能体维护用户时间表能力,实验发现当前智能体存在过度反应和事件取消处理难等问题,揭示了大语言模型的根本局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16630 2026-07-21 cs.RO 新提交 57%

AI-Augmented Model Predictive Control for Safe and Adaptive Rendezvous and Proximity Operations

用于安全和自适应交会及接近操作的人工智能增强模型预测控制

Luca Sportelli, Tyler Barr, Cagri Kilic, Di Wu

机构 * Embry–Riddle Aeronautical University(安柏瑞德航空航天大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 研究多智能体对抗场景下航天器自主交会及接近操作问题,提出结合约束滚动时域MPC与数据驱动监督调整层的框架,经蒙特卡罗模拟评估,该框架相比固定参数MPC有更好性能,为自适应航天器RPO提供模块化、可解释基础。

Comments 34 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16401 2026-07-21 cs.CV 新提交 57%

Apple-$π$: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence

Apple-$π$:基于视频对基于法律的物理智能进行思维基准测试

Runmao Yao, Kairui Hu, Yukang Cao, Ruisi Wang, Shulin Tian, Ziang Cao, Weichen Fan, Ziqi Huang, Yuhao Dong, Hao Li, Zhaoxi Chen, Zhongang Cai, Lei Yang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab) The Chinese University of Hong Kong(香港中文大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 研究针对视频模型评估仅看输出层面的不足,提出Apple-PI基准,含数据集、协议和评估套件三部分,通过对11个模型测试发现其距可靠世界模拟器差距大,并揭示了一些瓶颈与差距,为指导视频模型发展提供诊断基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04384 2026-07-21 cs.RO cs.SY eess.SY 版本更新 57%

Rapid and Safe Trajectory Planning over Diverse Scenes through Diffusion Composition

通过扩散合成在多样场景中进行快速且安全的轨迹规划

Wule Mao, Zhouheng Li, Yunhao Luo, Fangguo Zhao, Lei Xie

机构 * College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) University of Michigan(密歇根大学) MIT(麻省理工学院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 针对动态环境规划难题,提出能量参数化扩散规划框架,结合轻量级安全过滤器和场景无关的数据生成管道,实现多样场景下快速安全规划,仿真与真实实验验证了其有效性、鲁棒性和适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00446 2026-07-21 cs.AI 版本更新 57%

Benchmarking Agentic Newswriting via Journalistic Workflows

通过新闻工作流程对智能新闻写作进行基准测试

Yen-Che Chien, Kuang-Da Wang, Wei-Yao Wang, Wen-Chih Peng

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Sony Group Corporation(索尼集团)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 研究智能体在新闻写作工作流程中的表现,引入NEWSAGENT基准,给定写作指令和部分材料,评估智能体搜索、选信息及改草稿能力,发现其检索事实尚可,但规划和叙事整合有困难,为评估智能体能力提供现实测试平台。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16876 2026-07-21 cs.NE 新提交 50%

Hybrid Augmented Lagrangian Method for General Constrained Optimization via Evolutionary Algorithms

基于进化算法的一般约束优化混合增广拉格朗日方法

Lampros Printzios, Konstantinos Chatzilygeroudis

专题命中 机器人数据与评测 :robotics(abstract)

AI总结 研究一般约束优化问题,提出混合增广拉格朗日(HyAL)方法,结合增广拉格朗日框架与进化算法优势,解决迭代子问题。实验表明该方法在基准测试中表现出色,优于纯进化方法和先进数值算法,能有效处理高维约束问题。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17933 2026-07-21 math.OC cs.DC 新提交 50%

A Curvature-Aware Rank-Adaptive Distributed Augmented-Lagrangian Solver for Large-Scale SDPs

一种用于大规模半定规划的曲率感知秩自适应分布式增广拉格朗日求解器

Hongpei Li, Huikang Liu, Dongdong Ge, Yinyu Ye

专题命中 机器人数据与评测 :robotics(abstract)

AI总结 研究针对大规模半定规划提出CARDAL求解器,基于秩自适应分解和增广拉格朗日方法,通过特定操作和问题选择实现优化,分析了全局最优性,在基准测试和多领域实验中展现强鲁棒性与加速效果。

Comments 25 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏