arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-01 至 2026-06-01 共收录 17 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 17 篇

2605.30639 2026-06-01 cs.CV cs.AI cs.RO 81%

PInVerify: An Offline Embodied Benchmark for Active Instance Verification

PInVerify:面向主动实例验证的离线具身基准

Yuhang Jiang

机构 * University of Trento(特伦托大学)

专题命中 机器人数据与评测 :embodied agent(abstract,comments);embodied AI(abstract);navigation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出主动实例验证任务,构建离线具身基准PInVerify,通过多视角导航和细粒度属性匹配评估具身智能体,并基于多模态大语言模型建立基线。

Comments Accepted as a poster at the Foundation Models Meet Embodied Agents (FMEA) Workshop, CVPR 2026. 44 pages including appendix. Code: https://github.com/Avalon-S/PInVerify

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02220 2026-06-01 cs.CV cs.RO 81%

LangMap: A Human-Verified Benchmark for Hierarchical Open-Vocabulary Goal Navigation

LangMap:一个用于分层开放词汇目标导航的人工验证基准

Bo Miao, Weijia Liu, Jun Luo, Lachlan Shinnick, Jian Liu, Thomas Hamilton-Smith, Yuhe Yang, Zijie Wu, Vanja Videnovic, Feras Dayoub, Anton van den Hengel

机构 * AIML, Adelaide University(AIML,阿德莱德大学) East China Normal University(华东师范大学) NERC-RVC, Hunan University(NERC-RVC,湖南大学) The University of Western Australia(西澳大学) Breaker Industries

专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 针对现有基准在分层语义目标导航中的不足,提出LangMap基准,通过人工验证的语义标注和对比注释协议,支持场景、房间、区域和实例四个层级的目标导航任务,并引入PlaNaVid基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22639 2026-06-01 cs.RO 79%

Symmetries Here and There, Combined Everywhere: Cross-space Symmetry Compositions in Robotics

此处与彼处的对称性,无处不在的组合:机器人学中的跨空间对称性组合

Loizos Hadjiloizou, Rodrigo Pérez-Dattari, Noémie Jaquier

机构 * Department of Robotics, Perception and Learning, KTH Royal Institute of Technology(机器人、感知与学习系,皇家理工学院)

专题命中 机器人数据与评测 :robotics(title,abstract);分类 cs.RO

AI总结 提出跨空间对称性组合框架,通过前向运动学的微分几何结构实现配置空间与任务空间对称性的联合等变,并在双机械臂实验中验证了多对称性联合利用能提升泛化能力。

Comments 8 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30924 2026-06-01 cs.CL 78%

EMBGuard: Constructing Hazard-Aware Guardrails for Safe Planning in Embodied Agents

EMBGuard:为具身智能体安全规划构建危险感知护栏

Dongwook Choi, Taeyoon Kwon, Bogyung Jeong, Minju Kim, Yeonjun Hwang, Hyojun Kim, Byungchul Kim, Young Kyun Jang, Jinyoung Yeo

机构 * Independent Researcher(独立研究者) Department of Biomedical Engineering(生物医学工程系) the Department of Intelligent Precision Healthcare Convergence, Sungkyunkwan University(智能精准医疗融合系,全州大学) Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学)

专题命中 机器人数据与评测 :embodied agent(title,abstract)

AI总结 提出首个基于MLLM的具身安全护栏EMBGuard,通过解耦物理风险推理与智能体策略,评估(视觉观察,动作)对来识别危险配置并提供自然语言解释,同时构建训练数据集EMBHazard和基准测试EMBGuardTest,在紧凑模型尺寸下达到与专有MLLM竞争的性能并降低误报率。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21007 2026-06-01 cs.CV cs.RO 73%

LiteViLNet: Lightweight Vision-LiDAR Fusion Network for Efficient Road Segmentation

LiteViLNet: 轻量级视觉-激光雷达融合网络用于高效道路分割

Daojie Peng, Bingtao Wang, Fulong Ma, Liang Zhang, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Shandong University(山东大学)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出轻量级多模态网络LiteViLNet,通过双流编码器、深度可分离卷积和多尺度特征融合模块,在KITTI数据集上以14.04M参数达到96.36% MaxF,实现精度与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31558 2026-06-01 cs.LG cs.AI 62%

Positional versus Symbolic Attention Heads: Learning Dynamics, RoPE Geometry, and Length Generalization

位置注意力头与符号注意力头:学习动态、RoPE几何和长度泛化

Felipe Urrutia, Juan José Alegría, Cinthia Sanchez Macias, Jorge Salas, Cristian B. Calderon, Cristobal Rojas

机构 * CENIA & Faculty of Mathematics UC Santiago(CENIA与圣托里尼大学数学系) IMC UC & CENIA Santiago(UC IMC与圣托里尼CENIA)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI、cs.LG

AI总结 通过控制实验研究Transformer注意力头在位置推理和符号推理任务中的学习动态,发现位置和符号注意力头的不同机制及其对长度泛化的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30907 2026-06-01 cs.SE cs.AI cs.CL cs.LG 62%

BlueFin: Benchmarking LLM Agents on Financial Spreadsheets

BlueFin: 在金融电子表格上对LLM智能体进行基准测试

Srivatsa Kundurthy, Clara Na, Colton Moraine, Anoushka Mohta, Case Winter, George Fang, John Ling, Emma Strubell, Zach Kirshner

机构 * Longitude Labs Inc.(Longitude Labs公司) Cornell University(康奈尔大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 提出BlueFin基准,通过131个真实金融电子表格任务评估LLM智能体的合成、操作和理解能力,并验证了LM评判与人类专家的一致性。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20395 2026-06-01 cs.CV cs.RO 62%

SpaCeFormer: Fast Proposal-Free Open-Vocabulary 3D Instance Segmentation

SpaCeFormer: 快速无提议开放词汇3D实例分割

Chris Choy, Junha Lee, Chunghyun Park, Minsu Cho, Jan Kautz

机构 * NVIDIA

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 提出SpaCeFormer,一种基于空间曲线变换的无提议方法,在0.12-0.30秒内完成场景分割,比多阶段2D+3D流水线快2-3个数量级,并构建了最大开放词汇3D实例分割数据集SpaCeFormer-3M,在ScanNet200上零样本mAP达11.1,提升2.8倍。

Comments Project page: https://nvlabs.github.io/SpaCeFormer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20732 2026-06-01 cs.LG cs.AI cs.SE 62%

FEM-Bench: A Structured Scientific Reasoning Benchmark for Evaluating Code-Generating LLMs

FEM-Bench:评估代码生成大语言模型的结构化科学推理基准

Saeed Mohammadzadeh, Erfan Hamdi, Joel Shor, Emma Lejeune

机构 * Boston University(波士顿大学) Move37 Labs(Move37实验室) Department of Mechanical Engineering(机械工程系)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI、cs.LG

AI总结 提出FEM-Bench基准,通过有限元方法相关编程任务评估大语言模型在科学计算中的结构化推理能力,实验表明现有模型尚不能稳定解决所有任务。

Comments 45 pages, 5 figures, 9 tables, 7 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19830 2026-06-01 cs.CV cs.AI 62%

Target-Agnostic Calibration under Distribution Shift with Frequency-Aware Gradient Rectification

分布偏移下基于频率感知梯度修正的目标无关校准

Yilin Zhang, Cai Xu, You Wu, Ziyu Guan, Wei Zhao

机构 * School of Computer Science and Technology, Xidian University, Xi'an, China(西安电子科技大学计算机科学与技术学院)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI、cs.CV

AI总结 提出频率感知梯度修正(FGR)框架,通过对训练图像进行低通滤波减少虚假高频线索并学习域不变特征,同时利用几何投影确保分布内校准不退化,从而在无需目标域信息的情况下提升模型在分布偏移下的校准性能。

Comments 25 pages, Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31308 2026-06-01 cs.AI 57%

TraceGraph: Shared Decision Landscapes for Diagnosing and Improving Agent Trajectories

TraceGraph: 用于诊断和改进智能体轨迹的共享决策景观

Junjie Nian, Kang Chen, Ge Zhang, Yixin Cao, Yugang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 提出TraceGraph图框架,将多模型智能体轨迹构建为共享决策景观,通过事件摘要和陷阱感知恢复管线提升SWE-bench解决率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31294 2026-06-01 cs.CV 57%

TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens

TokTalk: 基于音频-大语言模型令牌的富有表现力的实时面部动画

Qingcheng Zhao, Yifang Pan, Karan Singh

机构 * University of Toronto(多伦多大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 提出TokTalk系统,利用音频-大语言模型产生的音频令牌直接实时生成富有表现力的3D面部动画,通过分块条件流匹配模型和轻量级适配策略实现低延迟和高品质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31217 2026-06-01 cs.CV 57%

TALON: Token-Aligned Lightweight Adapters for 6-DoF Spacecraft Pose Estimation

TALON: 用于六自由度航天器姿态估计的令牌对齐轻量适配器

Abid Ali, Arunkumar Rathinam, Djamila Aouada

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 提出TALON方法,通过在冻结的ViT注意力层前注入时空3D适配器并结合令牌对齐损失,实现轻量级六自由度航天器姿态估计,在SPADES和SwissCube数据集上显著降低姿态误差。

Comments 13 pages paper with 3 figures in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30863 2026-06-01 cs.CV cs.GR 57%

DSD-GS: Dynamic-Static Decomposition of Gaussian Splatting for Efficient and High-Fidelity Dynamic Scene Reconstruction

DSD-GS: 面向高效高保真动态场景重建的高斯泼溅动态-静态分解

Youngtae Han, Sung-hwan Han, Youngmin Yi

机构 * Department of Artificial Intelligence Engineering, Sogang University(人工智能工程系,首尔大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 提出基于前馈高斯泼溅编码器和光流模型的动态-静态分解框架,通过消除静态区域冗余计算,在渲染质量、训练/渲染速度和存储效率上达到最优。

Comments 23 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30583 2026-06-01 cs.RO cs.PF 57%

Caspar: CUDA Accelerator for Symbolic Programming with Adaptive Reordering

Caspar: 基于自适应重排序的符号编程CUDA加速器

Emil Martens, Aaron Miller, Matias Varnum, Annette Stahl

机构 * Norwegian University of Science and Technology(挪威科学与技术大学) Skydio

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 提出Caspar库,通过自动生成优化CUDA内核,实现从Python符号表达式到GPU高性能运行时的桥梁,并在大规模BA数据集上实现5-20倍加速。

Comments Accepted at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29417 2026-06-01 cs.CV 57%

ParCo-SDF: Learning Prior-Free Partial-to-Complete Signed Distance Fields of Deformable Objects

ParCo-SDF: 学习可变形物体的无先验部分到完整有符号距离场

Deokmin Hwang, Minseok Song, Daehyung Park

机构 * School of Computing, Korea Advanced Institute of Science and Technology, Korea(韩国科学技术院计算机学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 提出 ParCo-SDF 两阶段框架,通过时序几何编码和 FiLM 条件 SDF 预测,实现无需物体特定先验的可变形物体部分到完整几何重建。

Comments Accepted at the 23rd International Conference on Ubiquitous Robots (UR 2026), 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30366 2026-06-01 cs.CR cs.SD eess.AS 50%

Escaping the Linearity Trap: Manifold Detours for Black-Box Adversarial Attacks on Singing Audio Deepfake Detection

逃离线性陷阱:针对歌声音频深度伪造检测的黑盒对抗攻击的流形绕行策略

Yifan Liao, Yule Liu, Zhen Sun, Zongmin Zhang, Yupeng He, Jiaheng Wei, Xinhu Zheng, Xinlei He

机构 * Wuhan University(武汉大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 针对自监督学习(SSL)歌声深度伪造检测(SVDD)的对抗攻击失败源于线性陷阱,提出MARS框架通过双层优化逃离线性陷阱,显著提升黑盒迁移攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏