arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-13 至 2026-04-13 共收录 49 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 6 篇

2604.09499 2026-04-13 cs.RO 57%

Physics-Informed Reinforcement Learning of Spatial Density Velocity Potentials for Map-Free Racing

基于空间密度速度势的物理引导强化学习用于无地图赛车

Shathushan Sivashangaran, Apoorva Khairnar, Sepideh Gohari, Vihaan Dutta, Azim Eskandarian

机构 * Autonomous Robots and Vehicles Laboratory, College of Engineering, Virginia Commonwealth University(弗吉尼亚联邦大学工程学院自主机器人与车辆实验室) Department of Mechanical Engineering, Virginia Tech(弗吉尼亚理工学院机械工程系) Robotics Department, University of Michigan(密歇根大学机器人系)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 本文提出一种物理引导的强化学习方法,通过参数化非线性车辆动力学,利用深度神经网络实现时间最优和超车赛车控制,显著提升无地图赛车性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09436 2026-04-13 cs.RO cs.AI cs.LG cs.SY eess.SY 56%

Temporal Transfer Learning for Traffic Optimization with Coarse-grained Advisory Autonomy

基于粗粒度建议自主性的交通优化时序迁移学习

Jung-Hoon Cho, Sirui Li, Jeongyun Kim, Cathy Wu

机构 * Department of Civil and Environmental Engineering, Massachusetts Institute of Technology(麻省理工学院土木与环境工程系) Laboratory for Information & Decision Systems, Massachusetts Institute of Technology(麻省理工学院信息与决策系统实验室) Department of Mechanical and Automotive Engineering, Seoul National University of Science and Technology(首尔科学技术大学机械与汽车工程系)

专题命中 模仿学习与强化学习 :分类 cs.RO、cs.AI、cs.LG;robotics(journal_ref)

AI总结 本文提出时序迁移学习算法,通过零样本迁移解决自动驾驶中的粗粒度建议任务,验证了其在混合交通场景中的有效性。

Comments 18 pages, 12 figures

Journal ref IEEE Transactions on Robotics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 人机交互与遥操作 1 篇

2604.09326 2026-04-13 cs.RO cs.CV 62%

Multimodal Anomaly Detection for Human-Robot Interaction

多模态异常检测用于人机交互

Guilherme Ribeiro, Iordanis Antypas, Leonardo Bizzaro, João Bimbo, Nuno Cruz Garcia

机构 * LASIGE Faculty of Sciences U. Lisboa, Portugal Dep. of Information Engineering University of Padova Padova, Italy

专题命中 人机交互与遥操作 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出MADRI框架,通过将视频流转换为语义特征向量进行基于重建的异常检测,并结合机器人内部传感器数据和场景图,提升人机协作中多模态异常检测的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人数据与评测 12 篇

2604.09294 2026-04-13 cs.RO 83%

A Benchmark of Dexterity for Anthropomorphic Robotic Hands

人形机器人手灵巧性基准测试

Davide Liconti, Yuning Zhou, Yasunori Toshimitsu, Ronan Hinchet, Robert K. Katzschmann

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 机器人数据与评测 :robotic(title,abstract);manipulation(abstract);分类 cs.RO

AI总结 本文提出POMDAR基准,通过结构化操作和抓取任务定义灵巧性,结合任务正确性和执行速度量化评分,实现人形机器人手的客观评估与比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09151 2026-04-13 cs.CV nlin.PS 79%

Benchmarking CNN- and Transformer-Based Models for Surgical Instrument Segmentation in Robotic-Assisted Surgery

基于机器人辅助手术的手术器械分割中CNN和Transformer模型的基准测试

Sara Ameli

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.CV

AI总结 本文通过SAR-RARP50数据集对比了五种深度学习模型在手术器械多类语义分割中的性能,发现DeepLabV3与SegFormer在复杂手术场景中表现优异,而Transformer架构进一步提升了泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20006 2026-04-13 cs.CV 79%

Revisiting Image Manipulation Localization under Realistic Manipulation Scenarios

重新审视现实操纵场景下的图像操纵定位

Xuekang Zhu, Ji-Zhe Zhou, Kaiwen Feng, Chenfan Qu, Xiwen Wang, Yunfei Wang, Liting Zhou, Jian Liu

机构 * Sichuan University(四川大学) Ant Group(蚂蚁集团) South China University of Technology(华南理工大学)

专题命中 机器人数据与评测 :manipulation(title,abstract);分类 cs.CV

AI总结 本文提出RITA框架,将图像操纵定位改造成条件序列预测任务,通过逐层预测并利用前一步结果作为条件,显式建模编辑步骤的时序依赖和层次结构,提升了定位的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09535 2026-04-13 cs.CV 77%

EgoTL: Egocentric Think-Aloud Chains for Long-Horizon Tasks

EgoTL:用于长时任务的目视思考链

Lulin Liu, Dayou Li, Yiqing Liang, Sicong Jiang, Hitesh Vijay, Hezhen Hu, Xuhai Xu, Zirui Liu, Srinivas Shakkottai, Manling Li, Zhiwen Fan

机构 * UMN(明尼苏达大学) TAMU(德克萨斯农工大学) Brown University(布朗大学) McGill University(麦吉尔大学) UT Austin(德克萨斯大学奥斯汀分校) Columbia University(哥伦比亚大学) Northwestern University(西北大学)

专题命中 机器人数据与评测 :manipulation(abstract);navigation(abstract);world model(abstract);分类 cs.CV

AI总结 本文提出EgoTL,通过构建目视思考链管道,提升长时任务中视觉语言模型和世界模型的推理与规划能力,发现基础模型在作为目视助手或开放世界模拟器方面仍有不足。

Comments https://ego-tl.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09415 2026-04-13 cs.CV cs.AI cs.LG cs.RO 77%

PhysInOne: Visual Physics Learning and Reasoning in One Suite

PhysInOne:一套视觉物理学习与推理系统

Siyuan Zhou, Hejun Wang, Hu Cheng, Jinxi Li, Dongsheng Wang, Junwei Jiang, Yixiao Jin, Jiayue Huang, Shiwei Mao, Shangjia Liu, Yafei Yang, Hongkang Song, Shenxing Wei, Zihui Zhang, Peng Huang, Shijie Liu, Zhengli Hao, Hao Li, Yitian Li, Wenqi Zhou, Zhihan Zhao, Zongqi He, Hongtao Wen, Shouwang Huang, Peng Yun, Bowen Cheng, Pok Kazaf Fu, Wai Kit Lai, Jiahao Chen, Kaiyuan Wang, Zhixuan Sun, Ziqi Li, Haochen Hu, Di Zhang, Chun Ho Yuen, Bing Wang, Zhihua Wang, Chuhang Zou, Bo Yang

机构 * vLAR Group(vLAR 研究组) The Hong Kong Polytechnic University(香港理工大学) Syai Singapore(Syai 新加坡) Meta

专题命中 机器人数据与评测 :embodied AI(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 PhysInOne通过大规模合成数据提升AI系统对物理现象的理解,包含200万视频和15万动态3D场景,涵盖71种基本物理现象,用于物理感知视频生成、未来帧预测、物理属性估计和运动转移等应用。

Comments CVPR 2026. Siyuan, Hejun, Hu, Jinxi, Dongsheng, Junwei, Yixiao, Jiayue, and Shiwei are co-first authors. Project page: https://vlar-group.github.io/PhysInOne.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08544 2026-04-13 cs.RO cs.AI cs.CV 75%

SIM1: Physics-Aligned Simulator as Zero-Shot Data Scaler in Deformable Worlds

SIM1:物理对齐的模拟器作为零样本数据放大器在变形世界中

Yunsong Zhou, Hangxu Liu, Xuekun Jiang, Xing Shen, Yuanzhen Zhou, Hui Wang, Baole Fang, Yang Tian, Mulin Yu, Qiaojun Yu, Li Ma, Hengjie Li, Hanqing Wang, Jia Zeng, Jiangmiao Pang

机构 * Shanghai AI Lab(上海人工智能实验室) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 SIM1通过物理对齐的仿真方法,将稀疏观测转化为高保真的合成监督,实现变形物体 manipulation 的高效训练,取得与真实数据相当的性能。

Comments Website: https://internrobotics.github.io/sim1.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17425 2026-04-13 cs.RO 74%

The Impact of Gait Pattern Personalization on the Perception of Rigid Robotic Guidance: A Pilot User Experience Evaluation

步态模式个性化对刚性机器人引导感知的影响:一项用户体验评估的初步研究

Beatrice Luciani, Katherine Lin Poggensee, Heike Vallery, Alex van den Berg, Severin David Woernle, Mostafa Mogharabi, Stefano Dalla Gasperina, Laura Marchal-Crespo

机构 * Cognitive Robotics Department, Delft University of Technology(代尔夫特理工大学认知机器人学系) Department of Rehabilitation Medicine, Erasmus Medical Centre(伊拉斯姆斯医学中心康复医学系) Department of Biomechanical Engineering, Delft University of Technology(代尔夫特理工大学生物力学工程系) Institute of Automatic Control, RWTH Aachen University(亚琛工业大学自动控制研究所) Department of Mechanical Engineering, FUM Center of Advanced Rehabilitation and Robotics Research (FUM CARE), Ferdowsi University of Mashhad(菲尔多西大学机械工程系先进康复与机器人研究中心) Walker Department of Mechanical Engineering, University of Texas at Austin(德克萨斯大学奥斯汀分校沃克机械工程系)

专题命中 机器人数据与评测 :robotic(title);分类 cs.RO

AI总结 研究探讨个性化步态模式对用户感知的影响,发现适应系统对用户体验主导,个性化对舒适度和自然度影响有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09330 2026-04-13 cs.RO cs.CV 73%

VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis

VAG:用于具身数据合成的双流视频-动作生成

Xiaolei Lang, Yang Wang, Yukun Zhou, Chaojun Ni, Kerui Li, Jiagang Zhu, Tianze Liu, Jiajun Lv, Xingxing Zuo, Yun Ye, Guan Huang, Xiaofeng Wang, Zheng Zhu

机构 * GigaAI Zhejiang University(浙江大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 机器人数据与评测 :world model(abstract);robot foundation model(abstract);分类 cs.RO、cs.CV

AI总结 本文提出VAG模型,通过双流框架联合生成视频和动作,提升跨模态一致性,实现高效且准确的视频-动作配对生成,支持轨迹回放并提升下游策略泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09352 2026-04-13 cs.CV 57%

LuMon: A Comprehensive Benchmark and Development Suite with Novel Datasets for Lunar Monocular Depth Estimation

LuMon:用于月球单目深度估计的综合基准和开发套件及其新数据集

Aytaç Sekmen, Fatih Emre Gunes, Furkan Horoz, Hüseyin Umut Işık, Mehmet Alp Ozaydin, Onur Altay Topaloglu, Şahin Umutcan Üstündaş, Yurdasen Alp Yeni, Halil Ersin Soken, Erol Sahin, Ramazan Gokberk Cinbis, Sinan Kalkan

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 本文提出LuMon基准,通过新数据集评估月球单目深度估计方法,分析了领域迁移差距并建立仿真到现实的适应基线。

Comments This paper will be published in CVPRW2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08987 2026-04-13 cs.AI 57%

PilotBench: A Benchmark for General Aviation Agents with Safety Constraints

PilotBench:一个具有安全约束的一般航空智能体基准

Yalun Wu, Haotian Liu, Zhoujun Li, Boyang Wang

机构 * School of Computing National University of Singapore China School of Informatics Xiamen University China CESS Beihang University China

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.AI

AI总结 PilotBench通过对比LLM与传统预报器,评估飞行轨迹和姿态预测,揭示了传统方法在精度上的优势与LLM在指令遵循上的优势,指出LLM在高负荷阶段表现下降,推动混合架构的发展。

Comments Accepted at the 2026 IEEE International Joint Conference on Neural Networks (IJCNN 2026). 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19704 2026-04-13 cs.CV 57%

RADSeg: Unleashing Parameter and Compute Efficient Zero-Shot Open-Vocabulary Segmentation Using Agglomerative Models

RADSeg: 通过凝聚模型提升参数和计算效率的零样本开放词汇分割

Omar Alama, Darshil Jariwala, Avigyan Bhattacharya, Seungchan Kim, Wenshan Wang, Sebastian Scherer

机构 * Carnegie Mellon University(卡内基梅隆大学) IIIT Hyderabad(海得拉巴国际信息技术学院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 RADSeg利用凝聚视觉基础模型RADIO,同时提升mIoU、延迟和参数效率,实现更高效的零样本开放词汇分割。

Comments Accepted to CVPR'26 Findings Code at https://radseg-ovss.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09235 2026-04-13 cs.CR 50%

Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor

Unreal Thinking: 通过两阶段后门实现链式思维劫持

Wenhan Chang, Tianqing Zhu, Ping Xiong, Faqian Guan, Wanlei Zhou

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 本文提出MRTS和TSBH方法,解决LLM链式思维劫持中的数据稀缺和稳定性问题,通过生成对齐的CoT实现可控的恶意行为诱导,并提供安全推理数据集和缓解方法。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他机器人 4 篇

2604.08645 2026-04-13 cs.CV cs.AI cs.LG cs.RO 83%

3D-VCD: Hallucination Mitigation in 3D-LLM Embodied Agents through Visual Contrastive Decoding

3D-VCD:通过视觉对比解码缓解3D-LLM具身代理中的幻觉

Makanjuola Ogunleye, Eman Abdelrahman, Ismini Lourentzou

机构 * Virginia Tech(弗吉尼亚理工大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 其他机器人 :embodied agent(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出3D-VCD,一种用于缓解3D具身代理幻觉的视觉对比解码框架,通过构造扭曲的3D场景图来提升 grounded 推理能力,实验表明其在3D-POPE和HEAL基准上有效。

Comments 8 pages, 6 figures, Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08125 2026-04-13 cs.CV 57%

PolySLGen: Online Multimodal Speaking-Listening Reaction Generation in Polyadic Interaction

PolySLGen:多对多交互中的在线多模态说话-倾听反应生成

Zhi-Yi Lin, Thomas Markhorst, Jouh Yeong Chew, Xucong Zhang

机构 * Computer Vision Lab, Delft University of Technology(代尔夫特理工大学计算机视觉实验室) Honda Research Institute Japan(本田日本研究所)

专题命中 其他机器人 :embodied AI(abstract);分类 cs.CV

AI总结 本文提出PolySLGen框架,用于多对多交互中的多模态反应生成,通过融合姿态和社交信号提升对话连贯性和真实感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06832 2026-04-13 cs.CL 50%

Fast-dVLM: Efficient Block-Diffusion VLM via Direct Conversion from Autoregressive VLM

Fast-dVLM: 通过直接转换自回归VLM实现高效的块扩散VLM

Chengyue Wu, Shiyi Lan, Yonggan Fu, Sensen Gao, Jin Wang, Jincheng Yu, Jose M. Alvarez, Pavlo Molchanov, Ping Luo, Song Han, Ligeng Zhu, Enze Xie

机构 * The University of Hong Kong(香港大学) NVIDIA(英伟达) MIT(麻省理工学院) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 其他机器人 :robotics(abstract)

AI总结 本文提出Fast-dVLM,通过直接转换自回归VLM实现高效的块扩散VLM,采用KV-cache兼容并行解码和推测块解码,提升推理效率。实验表明其生成质量与自回归模型相当,且通过SGLang和FP8量化实现6倍以上的推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10722 2026-04-13 q-bio.NC cs.NE 50%

Bridging Brains and Machines: A Unified Frontier in Neuroscience, Artificial Intelligence, and Neuromorphic Systems

连接大脑与机器:神经科学、人工智能与神经形态系统的统一前沿

Sohan Shankar, Yi Pan, Hanqi Jiang, Zhengliang Liu, Mohammad R. Darbandi, Agustin Lorenzo, Junhao Chen, Weihang You, Md Mehedi Hasan, Arif Hassan Zidan, Eliana Gelman, Joshua A. Konfrst, Jillian Y. Russell, Katelyn Fernandes, Tianze Yang, Yiwei Li, Huaqin Zhao, Afrar Jahin, Triparna Ganguly, Shair Dinesha, Yifan Zhou, Zihao Wu, Xinliang Li, Lokesh Adusumilli, Aziza Hussein, Sagar Nookarapu, Jixin Hou, Kun Jiang, Jiaxi Li, Brenden Heinel, XianShen Xi, Hailey Hubbard, Zayna Khan, Levi Whitaker, Ivan Cao, Max Allgaier, Andrew Darby, Lin Zhao, Lu Zhang, Xiaoqiao Wang, Xiang Li, Wei Zhang, Xiaowei Yu, Dajiang Zhu, Yohannes Abate, Tianming Liu

专题命中 其他机器人 :embodied agent(abstract)

AI总结 本文探讨神经科学、通用人工智能与神经形态计算的融合,提出基于脑生理学的框架,总结了突触可塑性、稀疏脉冲通信和多模态关联在下一代AGI系统中的应用,并讨论了突破冯·诺依曼瓶颈的物理子系统及四个关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏