arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-07 至 2026-04-07 共收录 16 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 16 篇

2604.03890 2026-04-07 cs.RO 85%

From Prompt to Physical Action: Structured Backdoor Attacks on LLM-Mediated Robotic Control Systems

从提示到物理行动:针对LLM介导机器人控制系统结构后门攻击

Mingyang Xie, Jin Wei-Kocsis

机构 * School of Applied and Creative Computing, Purdue University(普渡大学应用与创意计算学院)

专题命中 机器人数据与评测 :robotic(title,abstract);robotics(abstract);embodied AI(abstract);分类 cs.RO

AI总结 研究探讨了LLM介导的机器人控制系统中结构后门攻击的影响,通过LoRA技术验证了后门在不同命令生成阶段的传播效果,并提出基于二次LLM的验证防御方法,揭示了实时机器人系统中的安全与响应权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03322 2026-04-07 cs.CV cs.AI cs.RO 82%

VitaTouch: Property-Aware Vision-Tactile-Language Model for Robotic Quality Inspection in Manufacturing

VitaTouch:面向制造领域机器人质量检测的属性感知视觉-触觉-语言模型

Junyi Zong, Qingxuan Jia, Meixian Shi, Tong Li, Jiayuan Li, Zihang Lv, Gang Chen, Fang Deng

机构 * School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications(北京邮电大学智能工程与自动化学院) Zhongguancun Academy(中关村学院) School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) School of AI, Beijing Institute of Technology(北京理工大学人工智能学院) Beijing Key Laboratory of Lightweight Intelligent System, Beijing Institute of Technology(北京理工大学北京市轻量化智能系统重点实验室)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 VitaTouch通过融合视觉、触觉与语言信息,提升机器人在制造中对材料属性的识别能力,实现了高精度的质量检测与自然语言描述。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04811 2026-04-07 cs.RO cs.CV cs.HC 66%

AnyUser: Translating Sketched User Intent into Domestic Robots

AnyUser: 将草图用户意图翻译成家用机器人

Songyuan Yang, Huibin Tan, Kailun Yang, Wenjing Yang, Shaowu Yang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(湖南大学国家机器人视觉感知与控制技术工程研究中心)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV;robotics(comments)

AI总结 AnyUser通过相机图像上的自由形式草图(可选语言)实现直观的家庭任务指令,利用多模态输入生成无需先验地图或模型的可执行机器人动作,通过大量评估验证其在不同模拟家庭场景中的高准确性和真实环境中的可靠性。

Comments Accepted to IEEE Transactions on Robotics (T-RO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04843 2026-04-07 cs.CV cs.AI 62%

InfBaGel: Human-Object-Scene Interaction Generation with Dynamic Perception and Iterative Refinement

InfBaGel: 基于动态感知和迭代细化的人-物体-场景交互生成

Yude Zou, Junji Gong, Xing Gao, Zixuan Li, Tianxing Chen, Guanjie Zheng

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Sichuan University(四川大学) Shenzhen University(深圳大学) The University of Hong Kong(香港大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.AI、cs.CV

AI总结 本文提出一种粗到细的指令条件交互生成框架,结合一致性模型的迭代去噪过程,通过动态感知策略和 bump-aware 指导减少物理伪影,提升 HOSI 和 HOI 生成性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03328 2026-04-07 cs.CV cs.RO 62%

Review and Evaluation of Point-Cloud based Leaf Surface Reconstruction Methods for Agricultural Applications

点云基叶面重建方法在农业应用中的综述与评估

Arif Ahmed, Parikshit Maini

机构 * University of Nevada, Reno(内华达大学里诺分校)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文综述并评估了九种叶面重建方法,通过三个公开数据集分析不同方法在精度、平滑度、噪声鲁棒性和计算成本方面的权衡,为农业机器人提供选择指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12510 2026-04-07 cs.RO cs.AI cs.CL 62%

Red-Teaming Vision-Language-Action Models via Quality Diversity Prompt Generation for Robust Robot Policies

通过质量多样性提示生成实现视觉-语言-动作模型的红队测试以获得鲁棒的机器人策略

Siddharth Srikanth, Freddie Liang, Ya-Chuan Hsu, Varun Bhatt, Shihan Zhao, Henry Chen, Bryon Tjanaka, Minjune Hwang, Akanksha Saran, Daniel Seita, Aaquib Tabrez, Stefanos Nikolaidis

机构 * Thomas Lord Department of Computer Science, University of Southern California(南加州大学托马斯·洛德计算机科学系) Sony AI(索尼AI) Sibley School of Mechanical and Aerospace Engineering, Cornell University(康奈尔大学西布利机械与航空航天工程学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出Q-DIG方法,通过生成多样化且相关的语言指令来发现VLA模型的漏洞,提升机器人策略的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03666 2026-04-07 cs.CV cs.AI 62%

ToG-Bench: Task-Oriented Spatio-Temporal Grounding in Egocentric Videos

ToG-Bench:面向任务的时空接地在第一人称视频中

Qi'ao Xu, Tianwen Qian, Yuqian Fu, Kailing Li, Yang Jiao, Jiacheng Zhang, Xiaoling Wang, Liang He

机构 * East China Normal University(华东师范大学) Fudan University(复旦大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI、cs.CV

AI总结 本文提出ToG-Bench,首个面向任务的时空视频接地基准,通过任务导向的接地、显式-隐式双接地和一对一多接地特性,评估多对象和显式-隐式对象接地性能,揭示任务导向时空视频接地的挑战与性能差距。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22560 2026-04-07 cs.RO 57%

Allometric Scaling Laws for Bipedal Robots

双足机器人的等比定律

Naomi Oke, Aja M. Carter, Ben Gu, Steven Man, Cordelia Pride, Sarah Bergbreiter, Aaron M. Johnson

机构 * Department of Mechanical Engineering, Carnegie Mellon University(卡内基梅隆大学机械工程系) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文研究双足机器人腿部长度与质量、速度等参数的等比关系,发现机器人质量与腿部长度平方成正比,与生物等比定律不同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03766 2026-04-07 cs.RO cs.SY eess.SY 57%

A Novel Hybrid PID-LQR Controller for Sit-To-Stand Assistance Using a CAD-Integrated Simscape Multibody Lower Limb Exoskeleton

一种用于坐-立转换辅助的新型混合PID-LQR控制器:基于CAD集成的Simscape Multibody下肢外骨骼

Ranjeet Kumbhar, Rajmeet Singh, Appaso M Gadade, Ashish Singla, Irfan Hussain

机构 * Thapar Institute of Engineering and Technology(塔帕尔工程技术学院) Khalifa University Center for Autonomous Robotic Systems (KUCARS)(哈利法大学自主机器人系统中心) Khalifa University(哈利法大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本文提出一种混合PID-LQR控制器,用于下肢外骨骼坐-立转换辅助,通过CAD集成Simscape Multibody建立高保真动态模型,并通过仿真验证其在关节轨迹跟踪中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03558 2026-04-07 cs.CV 57%

LOGER: Local--Global Ensemble for Robust Deepfake Detection in the Wild

LOGER:用于野外鲁棒深度伪造检测的局部-全局集成

Fei Wu, Dagong Lu, Mufeng Yao, Xinlei Xu, Fengjun Guo

机构 * Shanghai Jiao Tong University(上海交通大学) INTSIG Information(INTSIG信息)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 LOGER通过局部-全局集成框架提升深度伪造检测鲁棒性,利用多尺度视觉基础模型捕捉全局异常,结合多实例学习策略提取局部伪造痕迹,有效应对真实世界退化。

Comments 2nd place (out of 94 teams) in the NTIRE 2026 Robust Deepfake Detection Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03377 2026-04-07 cs.CV 57%

ViBA: Implicit Bundle Adjustment with Geometric and Temporal Consistency for Robust Visual Matching

ViBA: 基于几何和时间一致性的隐式捆绑调整用于鲁棒视觉匹配

Xiaoji Niu, Yuqing Wang, Yan Wang, Hailiang Tang, Tisheng Zhang

机构 * GNSS Research Center, Wuhan University(武汉大学卫星导航定位技术研究中心) Electronic Information School, Wuhan University(武汉大学电子信息学院) Hubei Technology Innovation Center for Spatiotemporal Information and Positioning Navigation(湖北省时空信息与定位导航技术创新中心) Hubei Luojia Laboratory(湖北珞珈实验室)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 ViBA结合几何优化与特征学习,实现连续在线训练,通过隐式可微的几何残差框架提升视觉匹配的鲁棒性和精度,实测在EuRoC和UMA数据集上显著降低位移和旋转误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03944 2026-04-07 cs.CV 57%

SCP: Spatial Causal Prediction in Video

SCP:视频中的空间因果预测

Yanguang Zhao, Jie Yang, Shengqiong Wu, Shutong Hu, Hongbo Qiu, Yu Wang, Guijia Zhang, Tan Kai Ze, Hao Fei, Chia-Wen Lin, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) Shenzhen University(深圳大学) Sichuan University(四川大学) National Tsing Hua University(国立清华大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出SCP任务,挑战模型超越观察预测空间因果结果,并构建SCP-Bench基准测试,揭示人类与模型性能差距及因果推理局限。

Comments 30 pages, 21 figures, 17 tables, CVPR findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03530 2026-04-07 cs.LG 57%

A Multi-Level Causal Intervention Framework for Mechanistic Interpretability in Variational Autoencoders

一种多级因果干预框架用于变分自编码器的机制可解释性

Dip Roy, Rajiv Misra, Sanjay Kumar Singh, Anisha Roy

机构 * Indian Institute of Technology, Patna(印度理工学院巴特那分校) Rajarshi School of Management Technology, Varanasi(拉贾尔希管理技术学院瓦拉纳西分校) Jaypee Institute of Information Technology, Noida(杰皮信息技术学院诺伊达分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 本文提出多级因果干预框架,用于分析变分自编码器的机制可解释性,定义了三个新指标,并通过大规模实验揭示了VAE因果机制的特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04077 2026-04-07 cs.ET 50%

ADAPT: AI-Driven Decentralized Adaptive Publishing Testbed

ADAPT:人工智能驱动的去中心化自适应出版测试床

Md Motaleb Hossen Manik, Ge Wang

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 本文提出ADAPT测试床,通过去中心化代理模型改进学术出版流程,实现系统自适应与可审计性,验证了在不同运营模式下对出版积压、评审压力等的应对能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03411 2026-04-07 cs.CE cond-mat.soft 50%

A Differentiable Framework for Gradient Enhanced Damage with Physics-Augmented Neural Networks in JAX-FEM

一种基于物理增强神经网络的可微框架用于梯度增强损伤(JAX-FEM)

Mark Wilkinson, Amirhossein Amiri-Hezaveh, Adrian Buganza Tepole

专题命中 机器人数据与评测 :robotics(abstract)

AI总结 本文提出一种可微框架,结合物理增强神经网络和梯度增强损伤模型,实现软材料损伤模拟,解决传统方法在构造热力学一致本构模型和网格依赖性方面的难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01501 2026-04-07 cs.CG cs.GR 50%

A Unified Architecture for N-Dimensional Visualization and Simulation: 4D Implementation and Evaluation including Boolean Operations

一种用于N维可视化和模拟的统一架构:4D实现与评估,包括布尔运算

Hirohito Arai

专题命中 机器人数据与评测 :navigation(abstract)

AI总结 本文提出了一种基于N维空间设计的统一可视化与模拟软件架构,整合了凸包网格生成、布尔运算、高维探索坐标变换和超平面切片等核心方法,定义了Plex文件格式,并通过4D实现验证了架构的维度独立性。

Comments 18 pages, 9 figures, 5 tables v4: Clarified scope (4D evaluation) and fixed some expression. Under review at IEEE Access

详情

展开后加载摘要…

URL PDF HTML 收藏