arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-20 至 2026-03-20 共收录 16 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 16 篇

2603.18811 2026-03-20 cs.RO 83%

V-Dreamer: Automating Robotic Simulation and Trajectory Synthesis via Video Generation Priors

V-Dreamer:通过视频生成先验自动机器人仿真与轨迹合成

Songjia He, Zixuan Chen, Hongyu Ding, Dian Shao, Jieqi Shi, Chenxu Li, Jing Huo, Yang Gao

机构 * Nanjing University(南京大学) Northwestern Polytechnical University(西北工业大学)

专题命中 机器人数据与评测 :robotic(title,abstract);manipulation(abstract);分类 cs.RO

AI总结 V-Dreamer通过视频生成先验自动构建仿真环境和可执行轨迹,利用大语言模型和3D生成模型生成物理合理的3D场景,并通过Sim-to-Gen模块实现高效轨迹合成。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16344 2026-03-20 cs.RO cs.AI 81%

Manual2Skill++: Connector-Aware General Robotic Assembly from Instruction Manuals via Vision-Language Models

Manual2Skill++: 通过视觉语言模型实现连接器感知的指令手册驱动机器人装配

Chenrui Tie, Shengxiang Sun, Yudi Lin, Yanbo Wang, Zhongrui Li, Zhouhan Zhong, Jinxuan Zhu, Yiman Pang, Haonan Chen, Junting Chen, Ruihai Wu, Lin Shao

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) University of Toronto(多伦多大学) Zhejiang University(浙江大学) Peking University(北京大学)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出Manual2Skill++框架,通过视觉语言模型从指令手册中提取结构化连接信息,构建层次化图表示,实现连接器为核心的装配任务理解与执行。

Journal ref ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19166 2026-03-20 cs.RO cs.AI cs.CL cs.CV cs.LG 79%

Meanings and Measurements: Multi-Agent Probabilistic Grounding for Vision-Language Navigation

含义与测量:多智能体概率性视觉语言导航

Swagat Padhan, Lakshya Jain, Bhavya Minesh Shah, Omkar Patil, Thao Nguyen, Nakul Gopalan

机构 * Arizona State University(亚利桑那州立大学) Haverford College(哈弗福德学院)

专题命中 机器人数据与评测 :navigation(title);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出MAPG框架,通过分解语言查询并利用VLM进行语义 grounding,解决复杂度量-语义语言查询的难题,同时引入MAPG-Bench评估指标,展示在现实机器人中的应用效果。

Comments Equal contribution: Swagat Padhan and Lakshya Jain, 9 pages, 6 figures, paper website: https://lakshya-asu.github.io/Meanings-Measurements-Multi-Agent-Probabilistic-Grounding/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09109 2026-03-20 cs.RO cs.CV 73%

FoldNet: Learning Generalizable Closed-Loop Policy for Garment Folding via Keypoint-Driven Asset and Demonstration Synthesis

FoldNet:通过关键点驱动的资产和演示合成学习通用的闭环策略用于服装折叠

Yuxing Chen, Bowen Xiao, He Wang

机构 * CFCS, School of Computer Science, Peking University(计算机学院,北京大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出一种合成服装数据集,通过关键点驱动的资产和演示合成,学习通用的服装折叠闭环策略,提升现实世界成功率25%。

Comments Project: https://pku-epic.github.io/FoldNet/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19074 2026-03-20 cs.RO cs.AI 62%

CAMO: A Conditional Neural Solver for the Multi-objective Multiple Traveling Salesman Problem

CAMO:一种用于多目标多旅行商问题的条件神经求解器

Fengxiaoxiao Li, Xiao Mao, Mingfeng Fan, Yifeng Zhang, Yi Li, Tanishq Duhan, Guillaume Sartoretti

机构 * National University of Singapore(新加坡国立大学) China Unicom Shenzhen Branch(中国unicom深圳分公司) Central South University(中南大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 CAMO提出一种条件神经求解器,解决多目标多旅行商问题,通过融合偏好和协作解码器实现多目标权衡,实验显示其在求解帕累托前沿方面表现优异。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18892 2026-03-20 cs.CV cs.AI 62%

MultihopSpatial: Multi-hop Compositional Spatial Reasoning Benchmark for Vision-Language Model

MultihopSpatial: 用于视觉语言模型的多跳组合空间推理基准

Youngwan Lee, Soojin Jang, Yoorhim Cho, Seunghwan Lee, Yong-Ju Lee, Sung Ju Hwang

机构 * Electronics and Telecommunications Research Institute, South Korea(韩国电信研究院) Korea Advanced Institute of Science and Technology, South Korea(韩国科学技术院) Sungkyunkwan University, South Korea(成均馆大学) DeepAuto, South Korea(DeepAuto)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出MultihopSpatial基准,针对多跳组合空间推理问题,引入Acc@50IoU指标,并通过大规模训练集提升视觉语言模型的空间推理能力。

Comments Project page: https://youngwanlee.github.io/multihopspatial

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18623 2026-03-20 cs.CV cs.AI 62%

OpenT2M: No-frill Motion Generation with Open-source,Large-scale, High-quality Data

OpenT2M:无花车运动生成:开源、大规模、高质量数据

Bin Cao, Sipeng Zheng, Hao Luo, Boyuan Li, Jing Liu, Zongqing Lu

机构 * CASIA(中国科学院自动化研究所) UCAS(乌拉尔联邦大学) BAAI(北京人工智能研究院) RUC(哈尔滨工业大学) PKU(北京大学) BeingBeyond

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 OpenT2M通过大规模高质量开源数据提升文本到运动生成的泛化能力,引入2D-PRQ运动分词器实现高效运动生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18034 2026-03-20 cs.CR cs.AI cs.LG 62%

Semantic Chameleon: Corpus-Dependent Poisoning Attacks and Defenses in RAG Systems

语义变色龙:RAG系统中依赖语料库的污染攻击与防御

Scott Thornton

机构 * Independent Researcher(独立研究者)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 研究RAG系统中依赖语料库的污染攻击与防御,提出双文档污染攻击方法并评估混合检索防御效果,展示混合检索能有效降低攻击成功率。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02861 2026-03-20 cs.CV cs.AI cs.GR 62%

LiteReality: Graphics-Ready 3D Scene Reconstruction from RGB-D Scans

LiteReality:从RGB-D扫描生成图形-ready的3D场景重建

Zhening Huang, Xiaoyang Wu, Fangcheng Zhong, Hengshuang Zhao, Matthias Nießner, Joan Lasenby

机构 * University of Cambridge(剑桥大学) The University of Hong Kong(香港大学) Technical University of Munich(慕尼黑技术大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 LiteReality通过结构化场景图解析扫描数据,生成紧凑且逼真的3D虚拟场景,支持图形管线所需的关键特性,适用于AR/VR、游戏、机器人和数字孪生等应用。

Comments Project Page: https://litereality.github.io; Video: https://www.youtube.com/watch?v=ecK9m3LXg2c&feature=youtu.be Camera-Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10488 2026-03-20 cs.CV cs.AI cs.GR 62%

SVGBuilder: Component-Based Colored SVG Generation with Text-Guided Autoregressive Transformers

SVGBuilder:基于组件的带颜色SVG生成与文本引导自回归变换

Zehao Chen, Rong Pan

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 SVGBuilder基于组件的文本引导自回归变换生成高质量彩色SVG,显著降低计算开销,提升效率,引入ColorSVG-100K数据集提升模型多样性与颜色信息。

Comments Accepted by AAAI 2025. Project: https://svgbuilder.github.io

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 2025, 39(3), 2358-2366

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19204 2026-03-20 cs.LG 57%

Robustness, Cost, and Attack-Surface Concentration in Phishing Detection

在钓鱼检测中的鲁棒性、成本和攻击面集中

Julian Allagan, Mohamed Elbakary, Zohreh Safari, Weizheng Gao, Gabrielle Morgan, Essence Morgan, Vladimir Deriglazov

机构 * Department of Mathematics, Computer Science, and Engineering Technology(数学、计算机科学与工程技术系)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 研究通过成本感知逃避框架分析钓鱼检测中鲁棒性与攻击面集中问题,发现特征限制仅在移除主导低成本转换时提升鲁棒性,且攻击面集中于低成本特征。

Comments 14 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19134 2026-03-20 cs.RO cs.HC 57%

Introducing M: A Modular, Modifiable Social Robot

引入M:一个模块化、可修改的社会机器人

Victor Nikhil Antony, Zhili Gong, Yoonjae Kim, Chien-Ming Huang

机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Department of Mechanical Engineering, Rice University(里士满大学机械工程系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 M平台通过模块化设计和开源特性,降低社会机器人研究的摩擦,提供可重复、可修改的机器人解决方案,支持快速仿真到现实的迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00992 2026-03-20 cs.CV 57%

SuperDec: 3D Scene Decomposition with Superquadric Primitives

SuperDec:基于超二次体的3D场景分解

Elisabetta Fedele, Boyang Sun, Leonidas Guibas, Marc Pollefeys, Francis Engelmann

机构 * ETH Zurich(苏黎世联邦理工学院) Stanford University(斯坦福大学) Microsoft(微软公司)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 SuperDec通过将场景分解为超二次体基元,实现紧凑的3D表示。该方法利用实例分割技术扩展到完整3D场景,并在ShapeNet和ScanNet++上验证了其泛化能力,适用于机器人任务和可控视觉内容生成。

Comments Project page: https://super-dec.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09252 2026-03-20 cs.CL cs.AI cs.HC 57%

DAVIS: Planning Agent with Knowledge Graph-Powered Inner Monologue

DAVIS:基于知识图谱的规划代理

Minh Pham Dinh, Munira Syed, Michael G Yankoski, Trenton W. Ford

机构 * Davis Institute for Artificial Intelligence(戴维斯人工智能研究所) Colby College(科伯学院) University of Notre Dame(圣约翰大学) William & Mary(威廉与玛丽学院)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI

AI总结 本文提出DAVIS,一种基于知识图谱的规划代理,通过结构化和时间记忆实现模型驱动规划,并采用多轮检索系统提升科学任务处理能力,在ScienceWorld基准测试中表现优异。

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18496 2026-03-20 cs.CV 57%

NymeriaPlus: Enriching Nymeria Dataset with Additional Annotations and Data

NymeriaPlus:通过额外标注和数据丰富Nymeria数据集

Daniel DeTone, Federica Bogo, Eric-Tuan Le, Duncan Frost, Julian Straub, Yawar Siddiqui, Yuting Ye, Jakob Engel, Richard Newcombe, Lingni Ma

机构 * Meta Reality Labs Research(Meta现实实验室)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 本文通过改进人体动作标注、添加密集3D标注和多模态数据,提升Nymeria数据集的综合性能,为野外观测数据研究提供更强大的支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04714 2026-03-20 cs.CV 57%

Object-Centric Representation Learning for Enhanced 3D Semantic Scene Graph Prediction

面向增强三维语义场景图预测的对象感知表示学习

KunHo Heo, GiHyun Kim, SuYeon Kim, MyeongAh Cho

机构 * Kyung Hee University(庆熙大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出一种高判别性的对象特征编码器和对比预训练策略,提升三维语义场景图预测的准确性和关系预测能力,实验表明在3DSSG数据集上优于现有方法。

Comments Accepted by NeurIPS 2025. Code: https://github.com/VisualScienceLab-KHU/OCRL-3DSSG-Codes

详情

展开后加载摘要…

URL PDF HTML 收藏