arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 196 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 数据集与评测 196 篇

2608.06165 2026-08-10 cs.SD cs.AI cs.MM 版本更新 57%

Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset

基于预训练特征、数据增强及新SheetSage-A2S数据集的音频转乐谱转录

Eoin Cummins, Zhongyi Huang, Alexandre D'Hooge, Zhuoru Mo, Yaolong Ju

机构 * University College Dublin(都柏林大学学院) Guangxi Normal University(广西师范大学) Great Bay University(大湾区大学) Shenzhen University(深圳大学)

专题命中 数据集与评测 :action model(abstract);分类 cs.AI

AI总结 该研究针对流行音乐音频转乐谱研究不足的问题,构建了SheetSage-A2S数据集,结合预训练模型MuQ与数据增强改进A2S方法,在古典与流行音乐基准上均取得优于现有技术的性能。

Comments Accepted at the 34th ACM International Conference on Multimedia (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28625 2026-07-31 cs.CV 新提交 57%

ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine

ACE-Data-0:以人为中心的环境捕获作为具身数据引擎

Yukang Cao, Haozhe Xie, Beichen Wen, Runmao Yao, Yinghao Liu, Yue Huang, Zhichao Liao, Yunxiang Wang, Haiheng Liu, Xingshun Tian, Dawei Su, Long Zhuo, Dacheng Tao, Xiaogang Wang, Liang Pan, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(新加坡南洋理工大学S-Lab) ACE Robotics(ACE机器人公司)

专题命中 数据集与评测 :vision-language-action(abstract);分类 cs.CV

AI总结 本研究提出以人为中心的具身数据引擎ACE,构建含150小时数据的ACE-Data-0数据集,引入分层基准,暴露现有方法缺陷,为具身AI等领域提供基础。

Comments Project Page: https://ace-data-engine.github.io/ACE-Data-0/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12894 2026-07-15 cs.CV 新提交 57%

Hy-Embodied-VLM-1.0: Efficient Physical-World Agents

Hy-Embodied-VLM-1.0:高效的物理世界智能体

Ziyi Wang, Xumin Yu, Yongming Rao, Yonggen Ling, Yunheng Li, Oran Wang, Mingqi Gao, Yuchen Zhou, Yves Liang, Zuyan Liu, Yani Zhang, Rui Huang, Xiaoran Xu, Bowen Yuan, Yifu Yuan, Xu Tan, He Zhang, Yufei Huang, Shenghao Zhang, Hongsheng Wu, Han Hu, Zhengyou Zhang

机构 * Tencent Robotics X(腾讯Robotics X团队) Hy Vision Team(腾讯混元视觉团队) Futian Laboratory(福田实验室)

专题命中 数据集与评测 :embodied foundation model(abstract);分类 cs.CV

AI总结 研究旨在构建物理世界具身智能体,介绍Hy-Embodied-VLM-1.0模型。定义以行动为中心的能力分类法,开发数据管道。基于特定主干和编码器构建模型,用专家混合架构提升效率。在多基准测试中性能出色,较上一代有显著提升,在具身智能任务中也表现强大。

Comments Tech Report. Code and models are open-sourced at https://github.com/Tencent-Hunyuan/HY-Embodied

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00726 2026-07-02 cs.CV cs.SD 新提交 57%

AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization

AV-SyncBench:音视频时间与语义同步的解耦基准测试

Tianhong Zhou, Mingyang Han, Boyu Li, Yuxuan Jiang, Jiaxin Ye, Dongxiao Wang, Haoxiang Shi, Kunpeng Wang, Jun Song, Cheng Yu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学) Fudan University(复旦大学)

专题命中 数据集与评测 :action model(abstract);分类 cs.CV

AI总结 提出AV-SyncBench,首个完全分离音视频时间与语义一致性评估的基准,涵盖语音、音乐和声音三大类10个场景5项挑战任务,基于野外视频构建并人工验证,用于量化特征提取模型的对齐质量。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31993 2026-07-01 cs.RO 新提交 57%

OopsieVerse: A Safety Benchmark with Damage-Aware Simulation for Robot Manipulation

OopsieVerse: 一个具有损伤感知仿真的机器人操作安全基准

Arnav Balaji, Arpit Bahety, Sriniket Ambatipudi, Daniel Lam, Junhong Xu, Roberto Martín-Martín

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 数据集与评测 :vision language action(abstract);分类 cs.RO

AI总结 提出OopsieVerse框架,通过DamageSim检测和量化接触力、温度等损伤信号,在OmniGibson和RoboCasa仿真器中实现损伤感知,用于安全策略学习与评估。

Comments Project website: https://robin-lab.cs.utexas.edu/oopsieverse/. The first two authors contributed equally; order decided by dice roll. Accepted to Robotics: Science and Systems (RSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18723 2026-06-30 cs.RO 57%

Eval-Actions: Fine-Grained Execution Quality Evaluation for Robotic Manipulation

Eval-Actions: 针对机器人操作的细粒度执行质量评估

Mengyuan Liu, Juyi Sheng, Peiming Li, Ziyi Wang, Tianming Xu, Tiantian Xu, Hong Liu

专题命中 数据集与评测 :VLA(abstract);分类 cs.RO

AI总结 本文提出Eval-Actions方法,通过专家评分、排名引导标签和思维链注释,对机器人操作策略的执行质量进行细粒度评估,包含13000+真实机器人片段,验证了其在任务完成中的有效性。

Comments Project Website at https://eval-actions.github.io/. Code is available at https://github.com/LogSSim/TERM-Bench.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19358 2026-06-23 cs.RO 新提交 57%

WorkBenchMark: A LEGO-Based Assembly Benchmark with an Assembly-by-Disassembly Baseline for the Smart Manufacturing League

WorkBenchMark:面向智能制造联盟的基于乐高积木的装配基准与通过拆卸进行装配的基线方法

Wenbo Ma, Daniel Swoboda, Matteo Tschesche, Till Hofmann

机构 * Chair of Machine Learning and Reasoning (i6), RWTH Aachen University(亚琛工业大学机器学习与推理教席(i6)) MASCOR Institute, FH Aachen University of Applied Science(亚琛应用技术大学MASCOR研究所)

专题命中 数据集与评测 :vision-language-action(abstract);分类 cs.RO

AI总结 提出一个基于乐高Duplo的机器人装配基准,包含400个任务和四个复杂度层级,并提供一个基于规划的基线方法,在所有层级上优于现代视觉-语言-动作方法。

Comments RoboCup Symposium 2026 accepted paper

Journal ref RoboCup 2026: Robot World Cup XXIX

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20521 2026-06-19 cs.CV 新提交 57%

HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining

HumanScale: 以自我为中心的人类视频在具身预训练中可超越真实机器人数据

Juncheng Ma, Jianxin Bi, Yufan Deng, Xuanran Zhai, Kewei Zhang, Ye Huang, Bo Liang, Shukai Gong, Jiankai Tu, Xiaotian Tang, Jiaxin Li, Kaiqi Chen, Duomin Wang, Yuqi Wang, Bingyi Kang, Eric Huang, Zhiyang Dou, Zhen Dong, Enze Xie, Wojciech Matusik, Tat-Seng Chua, Daquan Zhou

机构 * PKU(北京大学) NUS(新加坡国立大学) MIT(麻省理工学院) UCSB(加州大学圣塔芭芭拉分校) NVIDIA(英伟达)

专题命中 数据集与评测 :embodied foundation model(abstract);分类 cs.CV

AI总结 本文通过系统比较发现,经过精心设计的过滤和标注流程,以自我为中心的人类视频在具身基础模型预训练中不仅可行,而且性能优于遥操作真实机器人数据,验证了“预训练于人类视频+少量机器人数据适配”的可扩展范式。

Comments Github: https://github.com/DAGroup-PKU/HumanNet/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14192 2026-06-15 cs.LG 新提交 57%

DRIVE: Distributional and Retrieval-Augmented Bidding with Value Evaluation

DRIVE:基于分布与检索增强的价值评估竞价方法

Miduo Cui, Haochen Wang, Shangqin Mao, Xun Yang, Qianlong Xie, Xingxing Wang, Xuri Ge, Ying Zhou, Zhiwei Xu

机构 * Machine Learning, ICML(机器学习,ICML)

专题命中 数据集与评测 :action model(abstract);分类 cs.LG

AI总结 提出DRIVE框架,通过解耦候选动作生成与决策,结合分布建模、检索增强和价值评估,提升离线自动竞价性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12386 2026-06-11 cs.RO 版本更新 57%

SafeManip: A Property-Driven Benchmark for Temporal Safety Evaluation in Robotic Manipulation

SafeManip: 一种基于属性的基准,用于机器人操作中的时间安全评估

Chengyue Huang, Khang Vo Huynh, Sebastian Elbaum, Zsolt Kira, Lu Feng

机构 * Department of Machine Learning, Georgia Institute of Technology(佐治亚理工学院机器学习系) Department of Computer Science, University of Virginia(弗吉尼亚大学计算机科学系)

专题命中 数据集与评测 :vision-language-action(abstract);分类 cs.RO

AI总结 SafeManip通过定义可重用的安全模板,评估机器人操作中的时间安全属性,涵盖碰撞安全、抓取稳定性等八类安全类别,验证了现有方法在安全评估上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10106 2026-06-05 cs.RO 57%

EgoHumanoid: Unlocking In-the-Wild Loco-Manipulation with Robot-Free Egocentric Demonstration

EgoHumanoid: 通过无机器人眼示范解锁真实场景中的移动- manipulation

Modi Shi, Shijia Peng, Jin Chen, Haoran Jiang, Tianyu Li, Di Huang, Ping Luo, Hongyang Li, Li Chen

机构 * University of California, Berkeley(加州大学伯克利分校) Tsinghua University(清华大学)

专题命中 数据集与评测 :vision-language-action(abstract);分类 cs.RO

AI总结 本文提出EgoHumanoid框架,通过结合大量眼示范数据和少量机器人数据共同训练视觉-语言-动作策略,使机器人能够执行多样化的现实环境中的移动- manipulation任务,实验表明无机器人数据显著提升了性能,尤其在未见过的环境中表现更优。

Comments Project page: https://opendrivelab.com/EgoHumanoid

详情

展开后加载摘要…

URL PDF HTML 收藏
1702.00785 2026-06-04 cs.MA cs.RO cs.SY eess.SY 57%

Evaluation of Automated Vehicles Encountering Pedestrians at Unsignalized Crossings

自动驾驶车辆在无信号交叉口与行人互动的评估

Baiming Chen, Ding Zhao, Huei Peng

专题命中 数据集与评测 :action model(abstract);分类 cs.RO

AI总结 本文提出了一种评估自动驾驶车辆在无信号交叉口与行人互动安全性和可行性的新方法,通过分析数据和模拟行人反应,验证了自动驾驶策略的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01425 2026-06-02 cs.LG 57%

Learning-based Directed Graph Abstraction of Combinatorial Spaces for Order-Preserving Search in Mixed-Combinatorial Nonlinear Optimization

基于学习的组合空间有向图抽象用于混合组合非线性优化中的保序搜索

Gishnu Madhu, Feng Liu, Souma Chowdhury

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Department of Mechanical and Aerospace Engineering(机械与航空航天工程系)

专题命中 数据集与评测 :action model(abstract);分类 cs.LG

AI总结 提出一种基于图神经网络的有向图抽象方法,将组合空间映射为有向图,以改进混合组合非线性规划问题的搜索效率。

Comments Accepted for presentation at 2026, ASME IDETC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18326 2026-06-02 cs.CV 57%

OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation

OmniHuman:面向以人为中心的视频生成的大规模数据集与基准

Lei Zhu, Xing Cai, Yingjie Chen, Yiheng Li, Binxin Yang, Hao Liu, Jie Chen, Chen Li, Jing LYu

机构 * Peking University(北京大学) WeChat Lab(微信实验室) Chinese Academy of Sciences(中国科学院)

专题命中 数据集与评测 :action model(abstract);分类 cs.CV

AI总结 为解决现有数据集在场景多样性、交互建模和属性对齐方面的结构性缺陷,提出OmniHuman大规模多场景数据集及全自动标注流程,并建立OHBench三级评估体系,实现与人类感知高度一致的诊断。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05320 2026-04-24 cs.RO 57%

ExpressMM: Expressive Mobile Manipulation Behaviors in Human-Robot Interactions

ExpressMM: 人机交互中的表达性移动 manipulation 行为

Souren Pashangpour, Haitong Wang, Matthew Lisondra, Goldie Nejat

机构 * Autonomous Systems and Biomechatronics Laboratory(自主系统与生物机械实验室) Department of Mechanical and Engineering(机械与工程系) University of Toronto(多伦多大学)

专题命中 数据集与评测 :vision-language-action(abstract);分类 cs.RO

AI总结 本文提出ExpressMM框架,结合视觉语言模型和低层策略生成表达性机器人行为,支持中断交互,提升人机协作任务中的沟通效果与社会适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23607 2026-03-02 cs.RO cs.SY eess.SY 57%

MicroPush: A Simulator and Benchmark for Contact-Rich Cell Pushing and Assembly with a Magnetic Rolling Microrobot

MicroPush:一种用于接触密集细胞推动和组装的模拟器和基准测试平台,配备磁性滚动微机器人

Yanda Yang, Sambeeta Das

机构 * Department of Mechanical Engineering, University of Delaware(机械工程系,德雷克塞尔大学)

专题命中 数据集与评测 :action model(abstract);分类 cs.RO

AI总结 MicroPush提供了一个开源的模拟器和基准测试平台,用于评估磁性滚动微机器人在接触密集任务中的自主操作能力,包括细胞推动和多目标组装。

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02883 2026-02-11 q-bio.BM cs.LG 57%

DISPROTBENCH: Uncovering the Functional Limits of Protein Structure Prediction Models in Intrinsically Disordered Regions

DISPROTBENCH: 揭示蛋白质结构预测模型在内源性无序区域的功能限制

Xinyue Zeng, Tuo Wang, Adithya Kulkarni, Alexander Lu, Alexandra Ni, Phoebe Xing, Junhan Zhao, Siwei Chen, Dawei Zhou

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎-罗克琴堡研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒研究实验室)

专题命中 数据集与评测 :action model(abstract);分类 cs.LG

AI总结 DISPROTBENCH通过引入功能不确定性敏感度度量,揭示蛋白质结构预测模型在内源性无序区域的功能限制及预测不确定性对下游任务的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06273 2026-02-09 cs.RO cs.HC 57%

A High-Fidelity Robotic Manipulator Teleoperation Framework for Human-Centered Augmented Reality Evaluation

一种高保真机器人机械臂远程操作框架用于以人为中心的增强现实评估

Harsh Chhajed, Tian Guo

机构 * Worcester Polytechnic Institute(沃斯特理工学院)

专题命中 数据集与评测 :action model(abstract);分类 cs.RO

AI总结 ARBot是一种用于增强现实评估的高保真机器人机械臂远程操作框架,通过定制算法和安全控制器实现自然运动捕捉与回放,提供可控的AR评估数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19149 2026-02-03 cs.LG q-bio.QM 57%

GPCR-Filter: a deep learning framework for efficient and precise GPCR modulator discovery

GPCR-Filter: 一种用于高效且精确发现GPCR调节剂的深度学习框架

Jingjie Ning, Xiangzhen Shen, Li Hou, Shiyi Shen, Jiahao Yang, Junrui Li, Hong Shan, Sanan Wu, Sihan Gao, H. Eric Xu, Xinheng He

机构 * The State Key Laboratory of Drug Research, Shanghai Institute of Materia Medica, Chinese Academy of Sciences, Shanghai, China(中国科学院上海药物研究所国家药物研究重点实验室) School of Computer Science, Carnegie Mellon University, Pittsburgh, PA 15213, USA(卡内基梅隆大学计算机科学学院) College of Computer Science and Electronic Engineering, Hunan University, Changsha, Hunan(湖南大学计算机科学与电子工程学院) Lingang Laboratory, Shanghai, China(上海灵冈实验室) Research Center for Medicinal Structural Biology, National Research Center for Translational Medicine at Shanghai, State Key Laboratory of Medical Genomics, Ruijin Hospital, Shanghai Jiao Tong University School of Medicine, Shanghai, China(上海 translational 医学研究中心,国家医学基因组学重点实验室,瑞金医院,上海交通大学医学院,上海,中国) School of Pharmacy, Fudan University, Shanghai 201203, China(复旦大学药学院)

专题命中 数据集与评测 :action model(abstract);分类 cs.LG

AI总结 GPCR-Filter通过深度学习框架高效精准发现GPCR调节剂,结合蛋白质语言模型和图神经网络,实现对受体-配体功能关系的学习,提升药物开发效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02738 2025-12-08 cs.CV 57%

Open-PMC-18M: A High-Fidelity Large Scale Medical Dataset for Multimodal Representation Learning

Open-PMC-18M: 一种高保真大规模医学数据集用于多模态表示学习

Negin Baghbanzadeh, Mohammed Saidul Islam, Sajad Ashkezari, Elham Dolatabadi, Arash Afkanpour

机构 * Vector Institute(Vector研究所) York University(约克大学) University of Waterloo(滑铁卢大学)

专题命中 数据集与评测 :action model(abstract);分类 cs.CV

AI总结 Open-PMC-18M通过高保真医学数据集提升多模态表示学习性能,实现子图提取与上下文丰富化,支持多种视觉-语言任务。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03565 2025-11-12 cs.CV 57%

Bridged Semantic Alignment for Zero-shot 3D Medical Image Diagnosis

Haoran Lai, Zihang Jiang, Qingsong Yao, Rongsheng Wang, Zhiyang He, Xiaodong Tao, Weifu Lv, Wei Wei, S. Kevin Zhou

机构 * University of Science and Technology of China(中国科学技术大学) Suzhou Institute for Advanced Research(苏州先进研究所) Stanford University(斯坦福大学) iFlytek Co. Ltd.(iFlytek公司) The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine, USTC(中国科学技术大学第一附属医院)

专题命中 数据集与评测 :VLA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17950 2025-10-22 cs.RO 57%

RoboChallenge: Large-scale Real-robot Evaluation of Embodied Policies

Adina Yakefu, Bin Xie, Chongyang Xu, Enwen Zhang, Erjin Zhou, Fan Jia, Haitao Yang, Haoqiang Fan, Haowei Zhang, Hongyang Peng, Jing Tan, Junwen Huang, Kai Liu, Kaixin Liu, Kefan Gu, Qinglun Zhang, Ruitao Zhang, Saike Huang, Shen Cheng, Shuaicheng Liu, Tiancai Wang, Tiezhen Wang, Wei Sun, Wenbin Tang, Yajun Wei, Yang Chen, Youqiang Gui, Yucheng Zhao, Yunchao Ma, Yunfei Wei, Yunhuan Yang, Yutong Guo, Ze Chen, Zhengyuan Du, Ziheng Zhang, Ziming Liu, Ziwei Yan

机构 * Dexmal Hugging Face Project(Hugging Face项目)

专题命中 数据集与评测 :VLA(abstract);分类 cs.RO

Comments Authors are listed in alphabetical order. The official website is located at https://robochallenge.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13149 2025-10-16 cs.RO 57%

RoboHiMan: A Hierarchical Evaluation Paradigm for Compositional Generalization in Long-Horizon Manipulation

Yangtao Chen, Zixuan Chen, Nga Teng Chan, Junting Chen, Junhui Yin, Jieqi Shi, Yang Gao, Yong-Lu Li, Jing Huo

机构 * Nanjing University(南京大学) The Hong Kong University of Science and Technology(香港科技大学) National University of Singapore(新加坡国立大学) Shanghai Jiaotong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 数据集与评测 :VLA(abstract);分类 cs.RO

Comments Under review. These first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10414 2025-10-16 cs.CV 57%

HUMOTO: A 4D Dataset of Mocap Human Object Interactions

Jiaxin Lu, Chun-Hao Paul Huang, Uttaran Bhattacharya, Qixing Huang, Yi Zhou

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Adobe Research(Adobe研究院)

专题命中 数据集与评测 :action model(abstract);分类 cs.CV

Comments ICCV 2025, 19 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11509 2025-10-14 cs.CV 57%

Situat3DChange: Situated 3D Change Understanding Dataset for Multimodal Large Language Model

Ruiping Liu, Junwei Zheng, Yufan Chen, Zirui Wang, Kunyu Peng, Kailun Yang, Jiaming Zhang, Marc Pollefeys, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) Hunan University(湖南大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 数据集与评测 :action model(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025 Datasets and Benchmarks Track. Dataset and Code: https://github.com/RuipingL/Situat3DChange

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20036 2025-10-14 cs.SE cs.AI 57%

Agents in the Sandbox: End-to-End Crash Bug Reproduction for Minecraft

Eray Yapağcı, Yavuz Alp Sencer Öztürk, Eray Tüzün

机构 * Electronics Engineering Department Bilkent University Ankara, Turkey(电子工程系比尔肯特大学安卡拉土耳其) Computer Engineering Department Bilkent University Ankara, Turkey(计算机工程系比尔肯特大学安卡拉土耳其)

专题命中 数据集与评测 :action model(abstract);分类 cs.AI

Comments Accepted into ASE'25 (Automated Software Engineering). https://conf.researchr.org/details/ase-2025/ase-2025-papers/244/Agents-in-the-Sandbox-End-to-End-Crash-Bug-Reproduction-for-Minecraft

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00342 2025-08-11 cs.CV 57%

Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering

Zechuan Li, Hongshan Yu, Yihao Ding, Yan Li, Yong He, Naveed Akhtar

机构 * organization= College of Electrical Information Engineering,Hunan University , city= Changsha , postcode= 410082 , state= Hunan , country= China organization= School of Computing \& Information Systems ,The University of Melbourne , city= Melbourne , postcode= VIC 3053 , state= VIC , country= Australia organization= School of Computer Science,The University of Sydney , city= Sydney , postcode= NSW 2006 , state= NSW , country= Australia organization= School of Artificial Intelligence ,Anhui University , city= Hefei , postcode= 230601 , state= Anhui , country= China

专题命中 数据集与评测 :action model(abstract);分类 cs.CV

Comments This is a submitted version of a paper accepted by Information Fusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04009 2025-07-08 cs.CL cs.HC cs.LG 57%

Easy Dataset: A Unified and Extensible Framework for Synthesizing LLM Fine-Tuning Data from Unstructured Documents

Ziyang Miao, Qiyu Sun, Jingyuan Wang, Yuchen Gong, Yaowei Zheng, Shiqi Li, Richong Zhang

机构 * School of Computer Science and Engineering, Beihang University, China(北京航空航天大学计算机科学与工程学院)

专题命中 数据集与评测 :action model(abstract);分类 cs.LG

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14233 2025-06-18 cs.RO 57%

Narrate2Nav: Real-Time Visual Navigation with Implicit Language Reasoning in Human-Centric Environments

Amirreza Payandeh, Anuj Pokhrel, Daeun Song, Marcos Zampieri, Xuesu Xiao

机构 * Department of Computer Science, George Mason University(计算机科学系,乔治·马歇尔大学) Department of Information Sciences and Technology, George Mason University(信息科学与技术系,乔治·马歇尔大学)

专题命中 数据集与评测 :action model(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06733 2025-06-12 cs.CV 57%

RecipeGen: A Step-Aligned Multimodal Benchmark for Real-World Recipe Generation

Ruoxuan Zhang, Jidong Gao, Bin Wen, Hongxia Xie, Chenming Zhang, Hong-Han Shuai, Wen-Huang Cheng

机构 * Jilin University(吉林大学) Guangdong University of Technology(广东工业大学) National Chiao Tung University(交通大学) National Taiwan University(国立台湾大学)

专题命中 数据集与评测 :action model(abstract);分类 cs.CV

Comments This is an extended version of arXiv:2503.05228

详情

展开后加载摘要…

URL PDF HTML 收藏