arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 196 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 数据集与评测 196 篇

2506.18088 2025-08-28 cs.RO cs.AI cs.CL cs.CV cs.MA 67%

RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation

Tianxing Chen, Zanxin Chen, Baijun Chen, Zijian Cai, Yibin Liu, Zixuan Li, Qiwei Liang, Xianliang Lin, Yiheng Ge, Zhenyu Gu, Weiliang Deng, Yubin Guo, Tian Nian, Xuanbing Xie, Qiangyu Chen, Kailun Su, Tianling Xu, Guodong Liu, Mengkang Hu, Huan-ang Gao, Kaixuan Wang, Zhixuan Liang, Yusen Qin, Xiaokang Yang, Ping Luo, Yao Mu

机构 * MoE key Lab of Artificial Intelligence, AI Institute, SJTU(人工智能联合实验室、人工智能研究院、上海交通大学) HKU MMLab(香港大学多模态实验室) Shanghai AI Lab(上海人工智能实验室) D-Robotics(D-机器人) SZU(深圳大学) THU(清华大学) TeleAI FDU(福建大学) USTC(中国科学技术大学) SUSTech(南方科技大学) SYSU(深圳大学) CSU(中国科学技术大学) NEU(南京大学) HKU-SH ICRC(香港大学深圳研究院) NJU(南京大学) Lumina EAI

专题命中 数据集与评测 :VLA(abstract);分类 cs.RO、cs.CV、cs.AI

Comments Project Page: https://robotwin-platform.github.io/, Code: https://github.com/robotwin-Platform/robotwin, Doc: https://robotwin-platform.github.io/doc/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09839 2025-06-12 cs.CV cs.AI cs.RO 67%

OctoNav: Towards Generalist Embodied Navigation

Chen Gao, Liankai Jin, Xingyu Peng, Jiazhao Zhang, Yue Deng, Annan Li, He Wang, Si Liu

机构 * Beihang University(北航大学) National University of Singapore(新加坡国立大学) Peking University(北京大学) Zhongguancun Academy(中关村学院)

专题命中 数据集与评测 :VLA(abstract);分类 cs.RO、cs.CV、cs.AI

Comments 31 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15679 2025-02-24 cs.RO cs.AI cs.CV 67%

BOSS: Benchmark for Observation Space Shift in Long-Horizon Task

Yue Yang, Linfeng Zhao, Mingyu Ding, Gedas Bertasius, Daniel Szafir

专题命中 数据集与评测 :action model(abstract);分类 cs.RO、cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23704 2026-07-30 cs.RO cs.CV 版本更新 62%

LabRobFail: A Benchmark for Robotic Failure Analysis in Chemical Self-driving Laboratory

LabRobFail:化学自动驾驶实验室中机器人故障分析的基准

Haobo Wang, Baoli Sun, Anqi Zou, Dongsheng Huang, Zelin Lv, Ning Wang, Rui Li, Dongzhan Zhou, Weiyu Guo, Zhihui Wang, Wanli Ouyang

专题命中 数据集与评测 :VLA(abstract_cn);分类 cs.RO、cs.CV

AI总结 针对化学自动驾驶实验室中机器人可靠性受化学实验特性限制、故障数据稀缺及评估协议缺乏等问题,引入LabRobFail框架,通过注入故障构建数据集,开发专门模型,提升故障检测等能力及下游任务成功率。

Comments Under review. Haobo Wang and Baoli Sun contributed equally. Code and data: https://github.com/Su-ISE-2001/SciRobo

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28215 2026-06-29 cs.CV cs.AI cs.GR 新提交 62%

HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration

HAT-4D: 通过人机协作从单目视频提升4D多物体交互

Jiaxin Li, Yuxiang Wu, Zhenkai Zhang, Xinrui Shi, Haoyuan Wang, Yichen Zhao, Su Linxiang, Chenyang Yu, Mingyu Zhang, Yifan Ding, Boran Wen, Li Zhang, Ruiyang Liu, Yong-Lu Li

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) University of Science and Technology of China(中国科学技术大学) Math Magic

专题命中 数据集与评测 :VLA(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出HAT-4D框架,结合视觉大模型与多级人工反馈,从单目视频重建多物体的3D几何、时序动态和物理交互,解决遮挡和深度歧义,无需多相机系统。

Comments Accepted to ECCV 2026. 15 pages of main text and 39 pages of appendices. Project page: https://lijiaxin0111.github.io/HAT4D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11901 2026-06-11 cs.RO cs.AI 新提交 62%

DuoBench: A Reproducible Benchmark for Bimanual Manipulation in Simulation and the Real World

DuoBench: 一个可复现的双手操作基准,涵盖仿真与现实世界

Tobias Jülg, Seongjin Bien, Simon Hilber, Yannik Blei, Pierre Krack, Maximilian Li, Sven Parusel, Rudolf Lioutikov, Florian Walter, Wolfram Burgard

机构 * University of Technology Nuremberg(纽伦堡工业大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Franka Robotics Technical University of Munich(慕尼黑工业大学)

专题命中 数据集与评测 :vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 提出DuoBench,一个基于FR3 Duo平台的双手操作基准框架,包含11个任务和阶段式评估方案,用于诊断当前策略在双手协调、仿真到现实迁移等方面的失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23499 2026-06-10 cs.RO cs.AI 版本更新 62%

TaCarla: A comprehensive benchmarking dataset for end-to-end autonomous driving

TaCarla: 端到端自动驾驶的综合基准数据集

Tugrul Gorgulu, Atakan Dag, M. Esat Kalfaoglu, Halil Ibrahim Kuru, Baris Can Cam, Halil Ibrahim Ozturk, Ozsel Kilinc

机构 * Tuğrul Gorgülü *†(土耳其巴伊塞蒂大学) Atakan Dağ †(土耳其巴伊塞蒂大学) M. Esat Kalfaoğlu ‡(土耳其巴伊塞蒂大学) Halil İbrahim Kuru †(土耳其巴伊塞蒂大学) Barış Can Cam †(土耳其巴伊塞蒂大学) Halil İbrahim Öztürk †(土耳其巴伊塞蒂大学) Özsel Kılınç §(土耳其巴伊塞蒂大学)

专题命中 数据集与评测 :action model(abstract);分类 cs.RO、cs.AI

AI总结 针对现有自动驾驶数据集不完整、行为多样性不足及闭环评估缺失等问题,基于CARLA Leaderboard 2.0挑战场景收集超过285万帧的多任务数据集,支持规划、检测、预测及视觉语言动作模型,并提供数值稀有度评分。

Comments Accepted at the Third Workshop on Simulation for Autonomous Driving (SAD), CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11674 2026-05-12 cs.RO cs.AI 62%

AffordSim: A Scalable Data Generator and Benchmark for Affordance-Aware Robotic Manipulation

AffordSim:一种可扩展的数据生成器和基准,用于面向 affordance 的机器人操作

Mingyang Li, Haofan Xu, Haowen Sun, Xinzhe Chen, Sihua Ren, Liqi Huang, Xinyang Sui, Chenyang Miao, Jiawei Ye, Qiongjie Cui, Zeyang Liu, Xingyu Chen, Xuguang Lan

机构 * School of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院)

专题命中 数据集与评测 :vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 AffordSim 通过整合开放词汇 3D affordance 预测,解决了机器人操作中接触信息获取的挑战,实现了高成功率的轨迹生成和跨仿真到现实的迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07299 2026-05-11 cs.CV cs.AI 62%

EgoPro-Bench: Benchmarking Personalized Proactive Interaction in Egocentric Video Streams

EgoPro-Bench:基于眼动视频流的个性化主动交互基准测试

Dongchuan Ran, Linyu Ou, Xueheng Li, Wenwen Tong, Chenxu Guo, Hewei Guo, Kaibing Wang, Lewei Lu

机构 * Beijing Institute of Technology(北京理工大学) University of Science and Technology of China(中国科学技术大学)

专题命中 数据集与评测 :action model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出EgoPro-Bench,通过模拟用户画像生成多样化意图,构建高保真人机交互数据,评估主动交互能力,提升多模态大语言模型的意图理解与交互时机识别能力。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08620 2026-04-22 cs.AI cs.CV 62%

ViDoRe V3: A Comprehensive Evaluation of Retrieval Augmented Generation in Complex Real-World Scenarios

ViDoRe V3:对复杂现实场景中检索增强生成的综合评估

António Loison, Quentin Macé, Antoine Edy, Victor Xing, Tom Balough, Gabriel Moreira, Bo Liu, Manuel Faysse, Céline Hudelot, Gautier Viaud

机构 * Illuin Technology(Illuin技术公司) NVIDIA CentraleSupélec, Paris-Saclay(巴黎萨克雷中央理工学院)

专题命中 数据集与评测 :action model(abstract);分类 cs.CV、cs.AI

AI总结 ViDoRe V3是一个多模态检索增强生成基准,涵盖10个专业领域数据集,通过12000小时人工标注评估先进RAG管道,发现视觉检索优于文本检索,晚期交互模型和文本重排序显著提升性能,但模型在非文本元素、开放性查询和细粒度视觉定位上仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22950 2026-03-31 cs.CV cs.RO 62%

RobotSeg: A Model and Dataset for Segmenting Robots in Image and Video

RobotSeg: 一种用于图像和视频中分割机器人的模型和数据集

Haiyang Mei, Qiming Huang, Hai Ci, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show Lab)

专题命中 数据集与评测 :VLA(abstract);分类 cs.RO、cs.CV

AI总结 本文提出RobotSeg模型和数据集,解决机器人分割的挑战,通过结构增强的记忆关联器、机器人提示生成器和标签高效训练策略,实现结构感知、自动化的高效分割。

Comments CVPR 2026. Project page: https://github.com/showlab/RobotSeg

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26378 2026-03-30 cs.LG cs.AI 62%

Generative Modeling in Protein Design: Neural Representations, Conditional Generation, and Evaluation Standards

蛋白质设计中的生成建模:神经表示、条件生成与评估标准

Senura Hansaja Wanasekara, Minh-Duong Nguyen, Xiaochen Liu, Nguyen H. Tran, Ken-Tye Yong

机构 * The University of Sydney(悉尼大学) VinUniversity

专题命中 数据集与评测 :action model(abstract);分类 cs.AI、cs.LG

AI总结 本文系统综述了蛋白质研究中的生成AI,涵盖序列、几何和多模态表示,生成架构如SE(3)等价扩散、流匹配和混合预测生成系统,以及从结构预测到蛋白质-配体相互作用的任务设置,并提出评估最佳实践和开放挑战。

Comments 20 pages, 7 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13119 2026-03-26 cs.CV cs.AI 62%

Geometry-Guided Camera Motion Understanding in VideoLLMs

基于几何的视频LLMs中相机运动理解

Haoan Feng, Sri Harsha Musunuri, Guan-Ming Su

机构 * University of Maryland, College Park(马里兰大学College Park分校) Dolby Laboratories Inc.(杜比实验室)

专题命中 数据集与评测 :VLA(abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过基准测试、诊断和注入框架,解决视频LLMs中相机运动表示不足的问题,通过CameraMotionDataset和CameraMotionVQA基准,提升模型对相机运动的识别能力。

Comments 10 pages, 7 figures, supplementary included CVPR2026 PVUW

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15469 2026-03-17 cs.RO cs.AI 62%

RoCo Challenge at AAAI 2026: Benchmarking Robotic Collaborative Manipulation for Assembly Towards Industrial Automation

AAAI 2026机器人协作操作挑战赛:面向工业自动化的协作操作基准测试

Haichao Liu, Yuheng Zhou, Zhenyu Wu, Ziheng Ji, Ziyu Shan, Qianzhun Wang, Ruixuan Liu, Zhiyuan Yang, Yejun Gu, Shalman Khan, Shijun Yan, Jun Liu, Haiyue Zhu, Changliu Liu, Jianfei Yang, Jingbing Zhang, Ziwei Wang

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Beijing University of Posts and Telecommunications, Beijing, China(北京邮电大学,北京,中国) Carnegie Mellon University, Pittsburgh, USA(卡内基梅隆大学,匹兹堡,美国) Agency for Science, Technology and Research (A*STAR), Singapore(科技研究局(A*STAR),新加坡)

专题命中 数据集与评测 :VLA(abstract);分类 cs.RO、cs.AI

AI总结 本文提出RoCo挑战赛,通过模拟和真实世界装配任务,推动工业机器人协作操作能力的发展,展示了双模型框架和故障恢复数据在长周期多任务学习中的有效性。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12510 2026-02-16 cs.IR cs.CV cs.LG 62%

Visual RAG Toolkit: Scaling Multi-Vector Visual Retrieval with Training-Free Pooling and Multi-Stage Search

视觉RAG工具包:通过无训练池化和多阶段搜索扩展多向量视觉检索

Ara Yeroyan

机构 * Independent Researcher(独立研究者)

专题命中 数据集与评测 :action model(abstract);分类 cs.CV、cs.LG

AI总结 视觉RAG工具包通过无训练池化和多阶段搜索提升多向量视觉检索效率,减少向量存储并提高检索吞吐量。

Comments 4 pages, 3 figures. Submitted to SIGIR 2026 Demonstrations Track. Project website: https://github.com/Ara-Yeroyan/visual-rag-toolkit

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11421 2026-01-19 cs.RO cs.AI 62%

The Great March 100: 100 Detail-oriented Tasks for Evaluating Embodied AI Agents

伟大的百日行进100:100个注重细节的任务用于评估具身体验人工智能代理

Ziyu Wang, Chenyuan Liu, Yushun Xiang, Runhao Zhang, Qingbo Hao, Hongliang Lu, Houyu Chen, Zhizhong Feng, Kaiyue Zheng, Dehao Ye, Xianchao Zeng, Xinyu Zhou, Boran Wen, Jiaxin Li, Mingyu Zhang, Kecheng Zheng, Qian Zhu, Ran Cheng, Yong-Lu Li

机构 * SJTU(上海交通大学) SII(上海人工智能研究院) Robbyant

专题命中 数据集与评测 :VLA(abstract);分类 cs.RO、cs.AI

AI总结 GM-100通过100个精心设计的任务全面评估具身体验人工智能代理的能力,推动机器人数据集任务设计的多样性和复杂性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05895 2025-08-06 cs.CV cs.AI 62%

Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI

Benjamin Raphael Ernhofer, Daniil Prokhorov, Jannica Langner, Dominik Bollmann

机构 * SPARKS Solutions GmbH(SPARKS解决方案有限公司)

专题命中 数据集与评测 :action model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22274 2025-07-31 cs.CV cs.LG 62%

HOG-CNN: Integrating Histogram of Oriented Gradients with Convolutional Neural Networks for Retinal Image Classification

Faisal Ahmed

机构 * Department of Data Science(数据科学系) Mathematics, Embry-Riddle Aeronautical University(数学,埃默里-瑞利航空大学)

专题命中 数据集与评测 :action model(abstract);分类 cs.CV、cs.LG

Comments 13 pages; 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21125 2025-07-30 cs.IR cs.AI cs.LG cs.SY eess.SY 62%

RATE: An LLM-Powered Retrieval Augmented Generation Technology-Extraction Pipeline

Karan Mirhosseini, Arya Aftab, Alireza Sheikh

机构 * Dept. of Management, Science and Technology(管理、科学与技术系) Amirkabir University of Technology(阿姆尔卡比尔科技大学) Dept. of Electrical Engineering(电气工程系) Sharif University of Technology(沙里夫科技大学)

专题命中 数据集与评测 :action model(abstract);分类 cs.AI、cs.LG

Comments 9 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15725 2025-05-27 cs.RO cs.CV 62%

UAV-Flow Colosseo: A Real-World Benchmark for Flying-on-a-Word UAV Imitation Learning

Xiangyu Wang, Donglin Yang, Yue Liao, Wenhao Zheng, wenjun wu, Bin Dai, Hongsheng Li, Si Liu

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) National University of Singapore(新加坡国立大学) MMLab, CUHK(香港中文大学MMLab) Hangzhou International Innovation Institute of Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 数据集与评测 :VLA(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01345 2025-03-04 cs.RO cs.CV 62%

Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy

Ricardo Garcia, Shizhe Chen, Cordelia Schmid

专题命中 数据集与评测 :language-conditioned robot(abstract);分类 cs.RO、cs.CV

Comments ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12326 2025-01-22 cs.AI cs.CL cs.CV cs.HC 62%

UI-TARS: Pioneering Automated GUI Interaction with Native Agents

Yujia Qin, Yining Ye, Junjie Fang, Haoming Wang, Shihao Liang, Shizuo Tian, Junda Zhang, Jiahao Li, Yunxin Li, Shijue Huang, Wanjun Zhong, Kuanye Li, Jiale Yang, Yu Miao, Woyu Lin, Longxiang Liu, Xu Jiang, Qianli Ma, Jingyu Li, Xiaojun Xiao, Kai Cai, Chuang Li, Yaowei Zheng, Chaolin Jin, Chen Li, Xiao Zhou, Minchao Wang, Haoli Chen, Zhaojian Li, Haihua Yang, Haifeng Liu, Feng Lin, Tao Peng, Xin Liu, Guang Shi

专题命中 数据集与评测 :action model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01326 2024-01-17 cs.CL cs.AI cs.LG 62%

An Autoregressive Text-to-Graph Framework for Joint Entity and Relation Extraction

Urchade Zaratiana, Nadi Tomeh, Pierre Holat, Thierry Charnois

专题命中 数据集与评测 :action model(abstract);分类 cs.AI、cs.LG

Comments AAAI 2024 (camera ready version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07715 2023-11-15 cs.CL cs.AI cs.IR cs.LG 62%

PolyIE: A Dataset of Information Extraction from Polymer Material Scientific Literature

Jerry Junyang Cheung, Yuchen Zhuang, Yinghao Li, Pranav Shetty, Wantian Zhao, Sanjeev Grampurohit, Rampi Ramprasad, Chao Zhang

专题命中 数据集与评测 :action model(abstract);分类 cs.AI、cs.LG

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.01306 2023-01-26 cs.IR cs.AI cs.CL cs.DB cs.LG 62%

Long-tail Relation Extraction via Knowledge Graph Embeddings and Graph Convolution Networks

Ningyu Zhang, Shumin Deng, Zhanlin Sun, Guanying Wang, Xi Chen, Wei Zhang, Huajun Chen

专题命中 数据集与评测 :action model(abstract);分类 cs.AI、cs.LG

Comments To be published in NAACL 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.06841 2023-01-18 cs.CL cs.AI cs.LG 62%

Syntactically Robust Training on Partially-Observed Data for Open Information Extraction

Ji Qi, Yuxiang Chen, Lei Hou, Juanzi Li, Bin Xu

专题命中 数据集与评测 :action model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.13365 2021-11-02 cs.LG cs.AI stat.ML 62%

Bringing Light Into the Dark: A Large-scale Evaluation of Knowledge Graph Embedding Models Under a Unified Framework

Mehdi Ali, Max Berrendorf, Charles Tapley Hoyt, Laurent Vermue, Mikhail Galkin, Sahand Sharifzadeh, Asja Fischer, Volker Tresp, Jens Lehmann

专题命中 数据集与评测 :action model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.13807 2021-07-30 cs.CV cs.AI 62%

FREE: Feature Refinement for Generalized Zero-Shot Learning

Shiming Chen, Wenjie Wang, Beihao Xia, Qinmu Peng, Xinge You, Feng Zheng, Ling Shao

专题命中 数据集与评测 :action model(abstract);分类 cs.CV、cs.AI

Comments ICCV 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.06702 2020-10-21 cs.LG cs.AI 62%

Learning Generalized Relational Heuristic Networks for Model-Agnostic Planning

Rushang Karia, Siddharth Srivastava

专题命中 数据集与评测 :action model(abstract);分类 cs.AI、cs.LG

Comments Submitted to AAAI-21

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.11881 2020-09-16 cs.CV cs.RO eess.IV stat.ML 62%

Context Model for Pedestrian Intention Prediction using Factored Latent-Dynamic Conditional Random Fields

Satyajit Neogi, Michael Hoy, Kang Dang, Hang Yu, Justin Dauwels

专题命中 数据集与评测 :action model(abstract);分类 cs.RO、cs.CV

Comments Accepted by IEEE Transactions on Intelligent Transportation Systems

详情

展开后加载摘要…

URL PDF HTML 收藏