arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-19 至 2026-03-19 共收录 13 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 13 篇

2603.09513 2026-03-19 cs.RO 83%

Beyond Short-Horizon: VQ-Memory for Robust Long-Horizon Manipulation in Non-Markovian Simulation Benchmarks

超越短时间 horizon:VQ-记忆用于非马尔可夫仿真基准中的鲁棒长时间 manipulation

Honghui Wang, Zhi Jing, Jicong Ao, Shiji Song, Xuelong Li, Gao Huang, Chenjia Bai

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究院(TeleAI))

专题命中 机器人数据与评测 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出 RuleSafe 基准,通过 LLM 辅助仿真框架构建非马尔可夫任务,引入 VQ-Memory 以提升长时间规划和泛化能力。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17969 2026-03-19 cs.RO cs.AI 81%

Specification-Aware Distribution Shaping for Robotics Foundation Models

面向规范的机器人基础模型分布塑形

Sadık Bera Yüksel, Derya Aksaray

专题命中 机器人数据与评测 :robotics(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种面向规范的机器人基础模型分布优化框架,通过在预训练模型执行中强制满足信号时序逻辑约束,提升机器人在复杂任务中的安全性和合规性。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18694 2026-03-19 cs.RO cs.AI cs.SY eess.SY 80%

AgriChrono: A Multi-modal Dataset Capturing Crop Growth and Lighting Variability with a Field Robot

AgriChrono:一种捕捉作物生长和光照变化的多模态数据集

Jaehwan Jeong, Tuan-Anh Vu, Mohammad Jony, Shahab Ahmad, Md. Mukhlesur Rahman, Sangpil Kim, M. Khalid Jawed

机构 * Korea University(韩国大学) University of California, Los Angeles(加州大学洛杉矶分校) North Dakota State University(北达科他州立大学)

专题命中 机器人数据与评测 :robotics(abstract,comments);navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出AgriChrono数据集,通过多传感器平台采集农田动态变化数据,验证了高精度动态非刚性场景重建的挑战,推动农业机器人研究。

Comments Keywords: Agricultural Robotics, In-the-wild Dataset, 3D Reconstruction

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17524 2026-03-19 cs.RO cs.AI 73%

KineVLA: Towards Kinematics-Aware Vision-Language-Action Models with Bi-Level Action Decomposition

KineVLA:面向运动学感知的视觉-语言-动作模型及双层动作分解

Gaoge Han, Zhengqing Gao, Ziwen Li, Jiaxin Huang, Shaoli Huang, Fakhri Karray, Mingming Gong, Tongliang Liu

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出KineVLA模型,通过双层动作分解实现运动学感知,提升动作执行的精度与可控性,实验表明其在运动学敏感基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16958 2026-03-19 cs.CV cs.AI 73%

PhysQuantAgent: An Inference Pipeline of Mass Estimation for Vision-Language Models

PhysQuantAgent: 一种用于视觉-语言模型的物体质量估计推断流水线

Hisayuki Yokomizo, Taiki Miyanishi, Yan Gang, Shuhei Kurita, Nakamasa Inoue, Yusuke Iwasawa

机构 * The University of Tokyo(东京大学) Institute of Science Tokyo(东京科学研究院) National Institute of Informatics(信息处理技术研究所)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 本文提出PhysQuantAgent框架和VisPhysQuant基准数据集,通过引入三种视觉提示方法提升视觉-语言模型对真实物体质量的估计精度。

Comments Code and dataset will be available at https://github.com/hisasnow/PhysQuantAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17850 2026-03-19 cs.RO 70%

ProbeFlow: Training-Free Adaptive Flow Matching for Vision-Language-Action Models

ProbeFlow: 无需训练的自适应流匹配用于视觉-语言-动作模型

Zhou Fang, Jiaqi Wang, Yi Zhou, Qiongfeng Shi

机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院,中国) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Ministry of Education, China(新一代人工智能技术及其交叉应用国家重点实验室,中华人民共和国教育部,中国) School of Electronic Science & Engineering, Southeast University, China(东南大学电子科学与工程学院,中国)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 ProbeFlow通过动态调度积分步骤减少冗余网络计算,提升动作解码效率和系统延迟,保持动作成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11279 2026-03-19 cs.RO cs.SY eess.SY 70%

Project-Based Learning for Robot Control Theory: A Robot Operating System (ROS) Based Approach

基于项目学习的机器人控制理论:基于机器人操作系统(ROS)的方法

Siavash Farzan

机构 * Robotics Engineering Department(机器人工程系) Worcester Polytechnic Institute(沃斯特理工学院)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出六个项目式任务,利用ROS和Gazebo模拟环境,帮助学生通过实践掌握控制理论和机器人技术,弥补理论与实践的差距。

Comments 24 pages, 15 figures, accepted for publication in the 2023 ASEE Annual Conference Proceedings, American Society for Engineering Education

Journal ref 2023 ASEE Annual Conference & Exposition, Baltimore, Maryland. https://strategy.asee.org/43968

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16882 2026-03-19 eess.SY cs.RO cs.SY math.DG 70%

The Port-Hamiltonian Structure of Vehicle Manipulator Systems

车辆机械臂系统的端哈密顿结构

Ramy Rashad

机构 * Control and Instrumentation Engineering department and Interdisciplinary Research Center for Smart Mobility and Logistics, King Fahd University of Petroleum and Minerals(控制与仪器工程系和智能交通与物流跨学科研究中心,国王法赫德石油与矿物大学) Instrumentation Engineering department(仪器工程系) Interdisciplinary Research Center for Smart Mobility(智能交通跨学科研究中心) Logistics, King Fahd University of Petroleum(物流,国王法赫德石油大学)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出车辆机械臂系统的端哈密顿描述,揭示了复杂机械系统的能量流动与守恒特性,通过哈密顿约简理论推导了端哈密顿动力学,并给出了标准形式和惯性解耦形式,适用于控制设计和数值模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17993 2026-03-19 cs.CV cs.RO 62%

GMT: Goal-Conditioned Multimodal Transformer for 6-DOF Object Trajectory Synthesis in 3D Scenes

GMT:用于3D场景中6自由度物体轨迹合成的目标条件多模态Transformer

Huajian Zeng, Abhishek Saroha, Daniel Cremers, Xi Wang

机构 * TU München(慕尼黑工业大学) MCML ETH Zürich(苏黎世联邦理工学院) MBZUAI(穆桑大学人工智能研究所)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 本文提出GMT,一种多模态Transformer框架,通过结合3D边界框几何、点云上下文、语义物体类别和目标末端姿态,生成真实且目标导向的物体轨迹,提升了空间精度和方向控制。

Comments Accpeted by 3DV 2026. Project Page: https://huajian-zeng.github.io/projects/gmt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12224 2026-03-19 cs.CV cs.AI 62%

Where It Moves, It Matters: Referring Surgical Instrument Segmentation via Motion

在何处移动,它就重要:通过运动进行指称手术器械分割

Meng Wei, Kun Yuan, Shi Li, Yue Zhou, Long Bai, Nassir Navab, Hongliang Ren, Hong Joo Lee, Tom Vercauteren, Nicolas Padoy

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 本文提出SurgRef框架,通过器械运动引导自由语言表达,实现手术视频中器械的鲁棒分割,克服遮挡和术语不熟悉问题。

Journal ref AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09565 2026-03-19 cs.RO 57%

ReTac-ACT: A State-Gated Vision-Tactile Fusion Transformer for Precision Assembly

ReTac-ACT:一种基于状态门控的视觉-触觉融合Transformer用于精密装配

Minchi Ruan, LiangQing Zhou, Hongtong Li, Zongtao Wang, ZhaoMing Lu, Jianwei Zhang, Bin Fang

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 本文提出ReTac-ACT,通过双向交叉注意力、体感条件门控网络和触觉重建目标,解决视觉反馈失效下的精密装配问题,实现90%的成功率,优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11031 2026-03-19 quant-ph cs.NI 50%

Simulation of Entanglement-Enabled Connectivity in QLANs using SeQUeNCe

使用SeQUeNCe模拟基于纠缠的QLAN连接性

Francesco Mazza, Caitao Zhan, Joaquin Chung, Rajkumar Kettimuthu, Marcello Caleffi, Angela Sara Cacciapuoti

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 本文探讨了在SeQUeNCe中实现QLAN模型,分析了量子操作与经典信号的交互,展示了通过测量和纠错协议模拟共享纠缠态的操控过程,从而实现基于纠缠的连接性。

Journal ref ICC 2025 - IEEE International Conference on Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03369 2026-03-19 cs.CL stat.ML 50%

Silenced Biases: The Dark Side LLMs Learned to Refuse

沉默的偏见:LLMs所学习到的拒绝的黑暗面

Rom Himelstein, Amit LeVi, Brit Youngmann, Yaniv Nemcovsky, Avi Mendelson

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 本文提出Silenced Bias Benchmark,通过激活引导减少问答中的拒绝,揭示模型潜在的公平性问题,挑战传统公平评估方法。

Comments Accepted to The 40th Annual AAAI Conference on Artificial Intelligence - AI Alignment Track (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏