arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-30 至 2026-03-30 共收录 13 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 13 篇

2603.23376 2026-03-30 cs.CV cs.RO 88%

ABot-PhysWorld: Interactive World Foundation Model for Robotic Manipulation with Physics Alignment

ABot-PhysWorld:用于机器人操作的交互世界基础模型,具有物理对齐

Yuzhi Chen, Ronghan Chen, Dongjie Huo, Yandan Yang, Dekang Qi, Haoyun Liu, Tong Lin, Shuang Zeng, Junjin Xiao, Xinyuan Chang, Feng Xiong, Xing Wei, Zhiheng Ma, Mu Xu

专题命中 机器人数据与评测 :manipulation(title,abstract);robotic(title);world model(abstract);分类 cs.RO、cs.CV

AI总结 ABot-PhysWorld通过物理对齐的交互世界模型,生成物理合理且可控的视频,解决了传统方法在物理仿真中的不足,通过新框架和基准测试提升了性能。

Comments Code: https://github.com/amap-cvlab/ABot-PhysWorld.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15219 2026-03-30 cs.CV cs.LG cs.MA cs.MM cs.RO 85%

Out-of-Sight Embodied Agents: Multimodal Tracking, Sensor Fusion, and Trajectory Forecasting

视线外的具身智能体:多模态跟踪、传感器融合与轨迹预测

Haichao Zhang, Yi Xu, Yun Fu

机构 * Department of Electrical and Computer Engineering, Northeastern University(东北大学电气与计算机工程系) Khoury College of Computer Sciences, Northeastern University(东北大学库里计算机科学学院)

专题命中 机器人数据与评测 :embodied agent(title);robotics(abstract);world model(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出改进的视线外轨迹预测方法,通过视觉定位去噪模块提升轨迹预测性能,实验表明在Vi-Fi和JRDB数据集上达到最优效果,为自动驾驶、机器人和监控提供新方向。

Comments Published in IEEE Transactions on Pattern Analysis and Machine Intelligence (Early Access), pp. 1-14, March 23, 2026

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20620 2026-03-30 cs.CV cs.RO 84%

Wanderland: Geometrically Grounded Simulation for Open-World Embodied AI

Wanderland: 为开放世界具身AI提供几何学基础的模拟

Xinhao Liu, Jiaqi Li, Youming Deng, Ruxin Chen, Yingjia Zhang, Yifei Ma, Li Guo, Yiming Li, Jing Zhang, Chen Feng

机构 * New York University(纽约大学) Cornell University(康奈尔大学)

专题命中 机器人数据与评测 :embodied AI(title,abstract);navigation(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Wanderland框架,通过多传感器采集和高精度几何重建,解决开放世界具身AI中模拟与现实差距大的问题,并展示其在导航政策学习中的应用。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26543 2026-03-30 cs.HC cs.RO 79%

User Involvement in Robotic Wheelchair Development: A Decade of Limited Progress

机器人轮椅开发中的用户参与:十年有限进展

Mario Andres Chavarria, Santiago Price Torrendell, Aude Billard, Samia Hurst, Sébastien Kessler, Michael Stein, Kenji Suzuki, Sophie Weerts, Diego Paez-Granados, Minerva Rivas Velarde

机构 * Geneva School of Health Science, University of Applied Sciences and Arts Western Switzerland(日内瓦健康科学学院,瑞士西部应用科学与艺术大学) Institute of Systems and Information Engineering, University of Tsukuba(系统与信息工程研究所,筑波大学) Learning Algorithms and Systems Laboratory, Ecole Polytechnique Fédérale de Lausanne(学习算法与系统实验室,洛桑联邦理工学院) Institute of Ethics, History, and Humanities, University of Geneva(伦理、历史与人文学研究所,日内瓦大学) Grand Conseil, État de Vaud(沃州大议会) id-Geo Sàrl(id-Geo有限责任公司) Harvard Law School Project on Disability, Harvard University(哈佛法学院残疾项目,哈佛大学) Swiss Graduate School of Public Administration, University of Lausanne(瑞士公共管理研究生院,洛桑大学) SCAI-Lab, Department of Health Sciences and Technology (D-HEST), ETH Zurich(SCAI实验室,健康科学与技术系,苏黎世联邦理工学院) Swiss Paraplegic Research (SPF)(瑞士截瘫研究)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO

AI总结 本文回顾了过去十年中机器人轮椅设计开发中用户参与的现状,发现用户参与有限,多集中在后期评估而非早期需求定义和迭代共设计,且研究多依赖小样本和非标准化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26174 2026-03-30 cs.CV 79%

CREval: An Automated Interpretable Evaluation for Creative Image Manipulation under Complex Instructions

CREval: 一种自动化可解释的评估方法用于复杂指令下的创意图像操纵

Chonghuinan Wang, Zihan Chen, Yuxiang Wei, Tianyi Jiang, Xiaohe Wu, Fan Li, Wangmeng Zuo, Hongxun Yao

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) Pengcheng Lab, Guangzhou(广州鹏城实验室)

专题命中 机器人数据与评测 :manipulation(title,abstract);分类 cs.CV

AI总结 本文提出CREval,一种基于问答的自动化评估框架,用于评估复杂指令下的创意图像编辑任务,通过CREval-Bench基准测试揭示模型在复杂创意任务中的表现及挑战。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18746 2026-03-30 cs.CV cs.AI 73%

Any4D: Open-Prompt 4D Generation from Natural Language and Images

Any4D: 从自然语言和图像生成开放提示的4D生成

Hao Li, Qiao Sun

专题命中 机器人数据与评测 :world model(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 本文提出Primitive Embodied World Models,通过限制视频生成时间范围,实现语言与视觉表示的细粒度对齐,降低学习复杂度,提升数据效率,并减少推理延迟,支持复杂任务的组合泛化。

Comments The authors identified issues in the 4D generation pipeline and evaluation that affect result validity. To ensure scientific accuracy, we will revise the methodology and experiments thoroughly before resubmitting. This version should not be cited or relied upon

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14375 2026-03-30 cs.CV cs.AI 62%

The Pulse of Motion: Measuring Physical Frame Rate from Visual Dynamics

运动的脉搏:从视觉动态测量物理帧率

Xiangbo Gao, Mingyang Wu, Siyuan Yang, Jiongze Yu, Pardis Taghavi, Fangzhou Lin, Zhengzhong Tu

机构 * Texas A\&M University

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI、cs.CV

AI总结 本文提出Visual Chronometer,通过视觉动态直接恢复物理帧率,解决视频生成中因训练数据帧率不一致导致的物理运动速度模糊问题,提升生成视频的自然度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26036 2026-03-30 cs.CV 57%

Face2Parts: Exploring Coarse-to-Fine Inter-Regional Facial Dependencies for Generalized Deepfake Detection

Face2Parts: 探索粗到细的区域间面部依赖关系以实现通用深度伪造检测

Kutub Uddin, Nusrat Tasnim, Byung Tae Oh

机构 * School of Electronics and Information Engineering, Korea Aerospace University(韩国航空大学电子与信息工程学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出Face2Parts方法,通过粗到细的区域间依赖关系提升深度伪造检测性能,采用层次特征表示和通道注意力机制,在多个数据集上取得高AUC成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23866 2026-03-30 cs.CR cs.LG 57%

A Channel-Triggered Backdoor Attack on Wireless Semantic Image Reconstruction

面向无线语义图像重建的通道触发后门攻击

Jialin Wan, Jinglong Shen, Nan Cheng, Zhisheng Yin, Yiliang Liu, Wenchao Xu, Xuemin, Shen

机构 * School of Telecommunications Engineering, Xidian University(西安电子科技大学通信工程学院) Department of Computing, Hong Kong Polytechnic University(香港理工大学计算学系) Department of Electrical and Computer Engineering, University of Waterloo(滑铁卢大学电气与计算机工程系)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 本文提出一种利用无线信道特性作为激活触发器的后门攻击框架,解决传统输入级触发器在严格输入约束下的局限性,通过信道统计参数提升隐蔽性与灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25887 2026-03-30 cs.CV 57%

World Reasoning Arena

世界推理竞技场

PAN Team, Qiyue Gao, Kun Zhou, Jiannan Xiang, Zihan Liu, Dequan Yang, Junrong Chen, Arif Ahmad, Cong Zeng, Ganesh Bannur, Xinqi Huang, Zheqi Liu, Yi Gu, Yichi Yang, Guangyi Liu, Zhiting Hu, Zhengzhong Liu, Eric Xing

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 本文提出WR-Arena基准,评估世界模型在动作模拟、长期预测和推理规划三方面的能力,揭示当前模型与人类水平推理的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25867 2026-03-30 cs.CV 57%

Seeing Through Smoke: Surgical Desmoking for Improved Visual Perception

穿透烟雾:改进视觉感知的手术去烟技术

Jingpei Lu, Fengyi Jiang, Xiaorui Zhang, Lingbo Jin, Omid Mohareri

机构 * Intuitive Surgical(直觉外科)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文提出基于变压器的手术去烟模型,通过物理启发的去烟头联合预测无烟图像和对应的烟雾图。通过合成数据生成管道解决配对烟雾到无烟训练数据不足的问题,构建了最大的手术烟雾数据集,实验表明在图像重建上优于现有去雾和去烟方法。

Comments 8 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08055 2026-03-30 cs.CV 57%

Beyond Deepfake vs Real: Facial Deepfake Detection in the Open-Set Paradigm

超越深度伪造与真实:在开集范式下的人脸深度伪造检测

Nadarasar Bahavan, Sachith Seneviratne, Sanjay Saha, Ken Chen, Sanka Rasnayaka, Saman Halgamuge

机构 * The University of Melbourne(墨尔本大学) National University of Singapore(新加坡国立大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出基于监督对比学习的开集深度伪造分类算法,旨在提升对新兴深度伪造技术的检测能力,通过FaceForensics++数据集验证,实现领先性能。

Comments IEEE/CVF Conference on Computer Vision and Pattern Recognition - Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26387 2026-03-30 eess.IV 50%

Rethinking Feature Conditioning for Robust Forged Media Detection in Edge AI Sensing Systems

重新思考特征条件化以在边缘AI传感系统中实现稳健的伪造媒体检测

Izaldein Al-Zyoud, Abdulmotaleb El Saddik

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 本文研究了在边缘AI传感系统中,通过特征条件化提升伪造媒体检测鲁棒性的问题,提出了一种基于DINOv3 ConvNeXt的可控探针研究,发现无需任务特定微调,仅使用线性探针即可获得竞争性性能,表明ViT-7B自监督蒸馏可适应边缘兼容的推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏