arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-27 至 2026-03-27 共收录 13 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 13 篇

2603.16861 2026-03-27 cs.RO 87%

MolmoB0T: Large-Scale Simulation Enables Zero-Shot Manipulation

MolmoB0T:大规模模拟实现零样本操控

Abhay Deshpande, Maya Guru, Rose Hendrix, Snehal Jauhri, Ainaz Eftekhar, Rohun Tripathi, Max Argus, Jordi Salvador, Haoquan Fang, Matthew Wallingford, Wilbert Pumacay, Yejin Kim, Quinn Pfeifer, Ying-Chun Lee, Piper Wolters, Omar Rayyan, Mingtong Zhang, Jiafei Duan, Karen Farley, Winson Han, Eli Vanderbilt, Dieter Fox, Ali Farhadi, Georgia Chalvatzaki, Dhruv Shah, Ranjay Krishna

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学) University of California, Los Angeles(加州大学洛杉矶分校) Princeton University(普林斯顿大学)

专题命中 机器人数据与评测 :manipulation(title,abstract);robotics(abstract);robot learning(abstract);robotic(abstract)

AI总结 本文提出MolmoB0T,通过大规模模拟数据实现零样本操控,展示了在静态和移动操控任务中,无需真实世界微调即可有效迁移的成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02787 2026-03-27 cs.RO cs.CV 84%

Diagnose, Correct, and Learn from Manipulation Failures via Visual Symbols

通过视觉符号诊断、纠正并学习操纵失败

Xianchao Zeng, Xinyu Zhou, Youcheng Li, Jiayou Shi, Tianle Li, Liangming Chen, Lei Ren, Yong-Lu Li

机构 * Beihang University(北京航空航天大学) Shanghai Innovation Institute(上海创新研究院) Southern University of Science and Technology(南方科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人数据与评测 :manipulation(title,abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出ViFailback框架,通过视觉符号提升标注效率,并释放大规模数据集和基准测试,验证了框架在故障诊断和纠正中的有效性。

Comments Accepted by CVPR 2026. Project Website: https://x1nyuzhou.github.io/vifailback.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25583 2026-03-27 cs.RO 79%

Towards Generalizable Robotic Data Flywheel: High-Dimensional Factorization and Composition

迈向通用性机器人数据飞轮:高维分解与组合

Yuyang Xiao, Yifei Zhou, Haoran Wang, Wenxuan Ou, Yuxiao Liu

机构 * ByteDance Seed(字节跳动Seed)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出F-ACIL框架,通过高维因子分解与组合提升机器人数据的通用性,实验表明其在演示数据减少45%的情况下性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24941 2026-03-27 cs.CV cs.CL 70%

Beyond Attention Magnitude: Leveraging Inter-layer Rank Consistency for Efficient Vision-Language-Action Models

超越注意力幅度:利用层间排名一致性提升高效视觉-语言-动作模型

Peiju Liu, Jinming Liu, Xipeng Qiu, Xuanjing Huang

机构 * Fudan University(复旦大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.CV

AI总结 本文提出TIES框架,通过层间排名一致性动态平衡注意力幅度,提升视觉-语言-动作模型的效率,实现在CogACT+SIMPLER基准上成功率提升6%并减少78%的token使用。

Comments 10 pages, 7 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22666 2026-03-27 cs.CV 70%

ArtPro: Self-Supervised Articulated Object Reconstruction with Adaptive Integration of Mobility Proposals

ArtPro: 基于自监督的可动物体重建与移动提案的自适应整合

Xuelu Li, Zhaonan Wang, Xiaogang Wang, Lei Wu, Manyi Li, Changhe Tu

机构 * Shandong University(山东大学) Southwest University(西南大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.CV

AI总结 ArtPro提出了一种自监督框架,通过自适应整合移动提案来解决传统方法在复杂多部件物体重建中的精度和稳定性问题,实验表明其在合成和真实物体上均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07237 2026-03-27 cs.CV 70%

Unified Camera Positional Encoding for Controlled Video Generation

统一的相机位置编码用于受控视频生成

Cheng Zhang, Boying Li, Meng Wei, Yan-Pei Cao, Camilo Cruz Gambardella, Dinh Phung, Jianfei Cai

机构 * Monash University(莫纳什大学) Building 4.0 CRC(4.0建筑CRC) VAST(VAST研究院)

专题命中 机器人数据与评测 :embodied AI(abstract);world model(abstract);分类 cs.CV

AI总结 本文提出UCPE,通过统一相机信息实现视频生成中的高可控性与视觉真实性,结合轻量级注意力适配器提升模型性能。

Comments Camera Ready of CVPR2026. Project Page: https://chengzhag.github.io/publication/ucpe/ Code: https://github.com/chengzhag/UCPE

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14612 2026-03-27 cs.RO 61%

Proprioceptive Image: An Image Representation of Proprioceptive Data from Quadruped Robots for Contact Estimation Learning

本体图像:四足机器人的本体数据图像表示用于接触估计学习

Gabriel Fischer Abati, João Carlos Virgolino Soares, Giulio Turrisi, Victor Barasuol, Claudio Semini

机构 * Dynamic Legged Systems (DLS) lab, Istituto Italiano di Tecnologia (IIT)(动态腿足系统实验室,意大利理工学院) University of Genoa(热那亚大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO;robotics(comments)

AI总结 本文提出将四足机器人本体时间序列数据转换为结构化二维图像的方法,利用卷积神经网络学习运动相关任务。通过编码多信号的时序动态,保留机器人形态结构,提升特征空间丰富性。在接触估计任务中,实验表明图像表示优于传统序列模型,接触状态准确率提升16.8个百分点。

Comments Accepted to the IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25689 2026-03-27 cs.CV 57%

LEMMA: Laplacian pyramids for Efficient Marine SeMAntic Segmentation

LEMMA:用于高效海洋语义分割的拉普拉斯金字塔

Ishaan Gakhar, Laven Srivastava, Sankarshanaa Sagaram, Aditya Kasliwal, Ujjwal Verma

机构 * Manipal Institute of Technology, Manipal Academy of Higher Education(马尼帕尔理工学院,马尼帕尔高等教育学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 LEMMA通过拉普拉斯金字塔提升边缘识别,降低计算成本,实现高效海洋遥感分割,展现优异性能。

Comments Accepted at the MaCVi Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25412 2026-03-27 cs.AI cs.CR 57%

Beyond Content Safety: Real-Time Monitoring for Reasoning Vulnerabilities in Large Language Models

超越内容安全:大型语言模型推理漏洞的实时监控

Xunguang Wang, Yuguang Zhou, Qingyue Wang, Zongjie Li, Ruixuan Huang, Zhenlan Ji, Pingchuan Ma, Shuai Wang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zhejiang University of Technology(浙江工业大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 本文提出实时监控方法,识别大型语言模型推理过程中的安全漏洞,定义九类不安全推理行为,并通过实验验证其有效性,展示了推理安全的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03345 2026-03-27 cs.AI cs.CL 57%

Do Language Models Follow Occam's Razor? An Evaluation of Parsimony in Inductive and Abductive Reasoning

语言模型遵循奥卡姆剃刀吗?对归纳和反向推理中简约性的评估

Yunxin Sun, Abulhair Saparov

机构 * Purdue University(普渡大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI

AI总结 本文评估大型语言模型在归纳和反向推理中是否遵循奥卡姆剃刀原则,通过生成综合推理问题测试其在简单和复杂场景中的表现,发现模型在复杂世界模型中难以生成高质量假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12200 2026-03-27 cs.CV 57%

CompBench: Benchmarking Complex Instruction-guided Image Editing

CompBench:复杂指令引导图像编辑的基准测试

Bohan Jia, Wenxuan Huang, Yuntian Tang, Junbo Qiao, Jincheng Liao, Shaosheng Cao, Fei Zhao, Zhaopeng Feng, Zhouhong Gu, Zhenfei Yin, Lei Bai, Wanli Ouyang, Lin Chen, Fei Zhao, Yao Hu, Zihan Wang, Yuan Xie, Shaohui Lin

机构 * East China Normal University(华东师范大学) Xiaohongshu Inc.(小红书) KLATASDS, MOE, China(中国教育部统计与数据科学重点实验室) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Fudan University(复旦大学) University of Oxford(牛津大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 CompBench旨在解决现有图像编辑基准测试对任务复杂度简化的问题,通过引入复杂指令引导的图像编辑基准,评估模型在精细操控能力上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25089 2026-03-27 cs.CV 57%

THEMIS: Towards Holistic Evaluation of MLLMs for Scientific Paper Fraud Forensics

THEMIS:迈向多模态大语言模型在科学论文欺诈取证中的全面评估

Tzu-Yen Ma, Bo Zhang, Zichen Tang, Junpeng Ding, Haolin Tian, Yuanze Li, Zhuodi Hao, Zixin Ding, Zirui Wang, Xinyu Yu, Shiyao Peng, Yizhuo Zhao, Ruomeng Jiang, Yiling Huang, Peizhi Zhao, Jiayuan Chen, Weisheng Tan, Haocheng Gao, Yang Liu, Jiacheng Liu, Zhongjun Yang, Jiayu Huang, Haihong E

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 THEMIS通过真实场景和复杂图像评估多模态大语言模型在学术欺诈推理中的能力,引入了五种欺诈类型和16种细粒度操作,揭示模型在不同核心能力上的优劣。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24684 2026-03-27 cs.CV 57%

KitchenTwin: Semantically and Geometrically Grounded 3D Kitchen Digital Twins

KitchenTwin: 基于语义和几何的3D厨房数字孪生

Quanyun Wu, Kyle Gao, Daniel Long, David A. Clausi, Jonathan Li, Yuhao Chen

机构 * University of Waterloo(滑铁卢大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 本文提出一种基于语义和几何的3D厨房数字孪生框架,通过融合视觉引导的对象网格与Transformer预测的全局点云,实现几何一致的数字孪生构建。

详情

展开后加载摘要…

URL PDF HTML 收藏