arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-27 至 2026-05-27 共收录 10 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 10 篇

2605.27134 2026-05-27 cs.AI 79%

Scaling, Benchmarking, and Reasoning of Vision-Language Agents for Mobile GUI Navigation

面向移动GUI导航的视觉语言模型:缩放、基准测试与推理

Heng Qu, Yike Liu, Renren Jin, Wenzong Zhang, Pengzhi Gao, Wei Liu, Jian Luan

机构 * Wuhan University(武汉大学)

专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.AI

AI总结 本文系统研究了视觉语言模型在移动GUI导航中的数据缩放、基准测试与推理,提出了大规模数据集HyperTrack和开源工具包GUIEvalKit,并发现基于强化学习的微调优于监督微调,尤其在域外场景中表现更佳。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26576 2026-05-27 cs.CV cs.LG 62%

TrackRef3D: Multi-View Consistent Track-then-Label for Open-World Referring Segmentation in 3D Gaussian Splatting

TrackRef3D: 面向开放世界3D高斯泼溅分割的多视角一致跟踪-标注方法

Yuyang Tan, Renhe Zhang, Hang Zhang, Ao Li, Xin Tan

机构 * East China Normal University, Shanghai, China(华东师范大学,上海,中国) Shanghai AI Laboratory(上海人工智能实验室) University of Electronic Science and Technology of China, Chengdu, China(电子科技大学,成都,中国)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV、cs.LG

AI总结 提出TrackRef3D全自动流水线,通过多视角一致跟踪-标注范式解耦目标发现与语义定位,无需人工标注实现开放世界3D高斯泼溅分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26629 2026-05-27 cs.CV 57%

DelowlightSplat: Feed-Forward Gaussian Splatting for Lowlight 3D Scene Reconstruction

DelowlightSplat: 面向低光照3D场景重建的前馈高斯泼溅

Fuzhen Jiang, Zengtian Xie, Zhuoran Li

机构 * Hangzhou Dianzi University(杭州电子科技大学) Zhuhai College of Science(珠海科技学院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 提出DelowlightSplat,一种低光照感知的前馈高斯泼溅框架,通过轻量级低光照适配器和成本体积多视图推理,从稀疏有噪声图像中直接预测干净3D高斯,实现高质量新视角合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26256 2026-05-27 cs.AI 57%

Personalizing Embodied Multimodal Large Language Model Agents over Long-term User Interactions

个性化具身多模态大语言模型代理在长期用户交互中的应用

Jeongeun Lee, Chanyoung Park, Dongha Lee

机构 * Yonsei University(延世大学) KAIST(韩国科学技术院)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI

AI总结 提出POLAR框架,通过多模态知识图谱记忆机制增强具身代理在长期交互中的个性化能力,显著提升多步推理和用户上下文跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19673 2026-05-27 cs.CV 57%

InHabit: Leveraging Image Foundation Models for Scalable 3D Human Placement

InHabit: 利用图像基础模型实现可扩展的3D人体放置

Nikita Kister, Pradyumna YM, István Sárándi, Jiayi Wang, Anna Khoreva, Gerard Pons-Moll

机构 * Bosch Center of Artificial Intelligence(博世人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息学院)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.CV

AI总结 提出InHabit方法,通过渲染-生成-提升流程利用2D基础模型知识自动生成3D场景中与几何一致的人体交互数据,并构建大规模数据集InHabitants,显著提升3D人体-场景重建和接触估计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14640 2026-05-27 cs.CL cs.AI 57%

Fact4ac at the Financial Misinformation Detection Challenge Task: Reference-Free Financial Misinformation Detection via Fine-Tuning and Few-Shot Prompting of Large Language Models

Fact4ac在金融虚假信息检测挑战赛中的方法:通过微调和少样本提示的大语言模型实现无参考金融虚假信息检测

Cuong Hoang, Le-Minh Nguyen

机构 * KaiNKaiho

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 本文提出一种结合零样本/少样本提示和LoRA参数高效微调的大语言模型框架,用于无外部证据的金融虚假信息检测,在公开和私有测试集上分别达到95.4%和96.3%的准确率,获得竞赛第一名。

Journal ref Proceedings of the 2nd Workshop on Misinformation Detection in the Era of LLMs (MisD 2026), 20th International AAAI Conference on Web and Social Media

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07284 2026-05-27 cs.RO 57%

AdaMorph: Unified Motion Retargeting via Embodiment-Aware Adaptive Transformers

AdaMorph: 通过具身感知自适应变换器实现统一运动重定向

Haoyu Zhang, Shibo Jin, Lusong Li, Jun Li, Liang Lin, Xiaodong He, Zecui Zeng

机构 * JD Explore Academy(京东探索学院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 提出AdaMorph统一框架,利用具身感知自适应变换器将人体运动重定向到多种机器人形态,实现零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09606 2026-05-27 cs.CV 57%

SpaceVista: All-Scale Visual Spatial Reasoning from mm to km

SpaceVista:从毫米到公里的全尺度视觉空间推理

Peiwen Sun, Shiqiang Lang, Dongming Wu, Yi Ding, Kaituo Feng, Huadai Liu, Zhen Ye, Rui Liu, Yun-Hui Liu, Jianan Wang, Xiangyu Yue

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Beijing University of Posts(北京邮电大学) Hong Kong University of Science(香港理工大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出全尺度空间推理解决方案,通过结构化知识系统、尺度感知建模和渐进训练范式,构建SpaceVista-1M数据集(38K视频场景、约1M空间QA对)和SpaceVista-7B模型,在5个基准上展现强泛化能力。

Comments Project Page: https://peiwensun2000.github.io/mm2km/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02974 2026-05-27 cs.LG 57%

PLAID: A Unified Data Model for Machine Learning on Heterogeneous Physics Simulations

PLAID:面向异构物理模拟的机器学习统一数据模型

Fabien Casenave, Xavier Roynard, Brian Staber, Alexandre Devaux-Rivière, William Piat, Michele Alessandro Bucci, Nissrine Akkari, Abbas Kabalan, Xuan Minh Vuong Nguyen, Luca Saverio, Raphaël Carpintero Perez, Anthony Kalaydjian, Samy Fouché, Thierry Gonon, Ghassan Najjar, Thomas Daniel, Emmanuel Menier, Matthieu Nastorg, Giovanni Catalani, Christian Rey

机构 * EPFL(苏黎世联邦理工学院) Inria(法国国家信息与自动化技术研究院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 提出PLAID统一数据层,通过标准化异构物理模拟数据并发布六个基准数据集,解决机器学习代理模型缺乏大规模多样化数据集的问题。

Comments Presented at EuRIPS 2025 and accepted at the AI4Physics Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08540 2026-05-27 cs.CV 57%

Datasets for Lane Detection in Autonomous Driving: A Comprehensive Review

自动驾驶中车道检测数据集:全面综述

Jörg Gamerdinger, Sven Teufel, Oliver Bringmann

机构 * University of Tübingen, Faculty of Science, Department of Computer Science, Embedded Systems Group(图宾根大学,科学学院,计算机科学系,嵌入式系统小组)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 本文全面综述了20个公开车道检测数据集,通过多维质量指标分析其特性、优势和局限,并指出未来改进方向以推动鲁棒车道检测创新。

详情

展开后加载摘要…

URL PDF HTML 收藏