arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-16 至 2026-06-16 共收录 34 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 34 篇

2606.16826 2026-06-16 cs.RO cs.AI 新提交 84%

ATOM-Bench: A Real-World Benchmark for Atomic Skills and Compositional Generalization in Manipulation Policies

ATOM-Bench:用于操作策略中原子技能与组合泛化的真实世界基准

Zenan Wu, Bingqing Wei, Lu Liu, Zheqi He, Xi Wang, Jiakang Liu, Zehui Li, Guocai Yao, Jing-Shu Zheng, Xi Yang, Yongtao Wang

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Peking University(北京大学)

专题命中 机器人数据与评测 :manipulation(title,abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出ATOM-Bench基准,通过分解桌面操作为原子任务和组合任务,评估操作策略的原子技能获取与组合泛化能力,发现当前策略在细粒度原子技能和组合重用上存在不足。

Comments Homepage: https://flageval-baai.github.io/AtomBenchPage

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16605 2026-06-16 cs.AI 新提交 83%

ARB4WM: An Adversarial Robustness Benchmark for World Models in Continuous Control

ARB4WM:连续控制中世界模型的对抗鲁棒性基准

Junjian Zhang, Hao Tan, Ruonan Li, Dong Zhu, Aiping Li, Zhaoquan Gu

机构 * College of Computer Science, National University of Defense Technology(国防科技大学计算机学院) College of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) Department of New Networks, Peng Cheng Laboratory(鹏城实验室新型网络部) National Key Laboratory of Advanced Communication Networks(先进通信网络全国重点实验室)

专题命中 机器人数据与评测 :world model(title,abstract);robotic(abstract);分类 cs.AI

AI总结 提出ARB4WM统一基准,从策略、价值和潜在动力学三个层面评估世界模型在视觉扰动下的对抗鲁棒性,发现多目标攻击和时序暴露模式对安全评估至关重要。

Comments 24 pages, 10 figures, 5 tables. Source code available at https://github.com/zaoanguai/ARB4WM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15898 2026-06-16 cs.RO 新提交 83%

VL2Spike: Spike-driven Distillation from VLMs for Low-Power Visual Perception in Embodied AI

VL2Spike:面向具身AI低功耗视觉感知的VLM脉冲驱动蒸馏

Zinan Liu, Eric Zheng, Soumyaratna Debnath, Hao Shi, Ling Xiao, Lin Wang

机构 * School of EEE, Nanyang Technological University (NTU)(南洋理工大学电气与电子工程学院) Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Advanced Micro Devices, Inc.(超威半导体公司) State Key Laboratory of Extreme Photonics and Instrumentation, Zhejiang University(浙江大学极端光子学与仪器国家重点实验室) Faculty of Information Science and Technology, Hokkaido University(北海道大学信息科学与技术学院)

专题命中 机器人数据与评测 :embodied AI(title,abstract);robotic(abstract);分类 cs.RO

AI总结 提出VL2Spike框架,通过时空视觉脉冲蒸馏和脉冲原型引导语言蒸馏,将VLM多模态知识迁移至Spikformer,在静态数据集上提升6.81%性能且能耗仅15.7%,并显著增强机器人视觉地点识别能力。

Comments 9 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15647 2026-06-16 cs.AI cs.CV cs.RO 新提交 82%

Towards Next-Generation Healthcare: A Survey of Medical Embodied AI for Perception, Decision-Making, and Action

迈向下一代医疗:医疗具身AI在感知、决策与行动中的综述

Cheng Zhang, Qing Cai, Xingzheng Wu, Xun Yang, Xiaojun Chang, Bingkun Bao, Liqiang Nie, Xinwang Liu, Yi Yang

机构 * School of Information Science and Engineering, Ocean University of China(中国海洋大学信息科学与工程学院) Innovation School of Artificial Intelligence, Hefei University of Technology(合肥工业大学人工智能创新学院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院) School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) ReLER Laboratory, CCAI, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

专题命中 机器人数据与评测 :embodied AI(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文系统综述医疗具身AI的核心组件,强调感知、决策与行动的协调集成,并分析临床实践中的挑战与未来方向。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17040 2026-06-16 cs.RO cs.CV 新提交 81%

R2RDreamer: 3D-aware Data Augmentation for Spatially-generalized 2D Manipulation Policies

R2RDreamer: 面向空间泛化的2D操作策略的3D感知数据增强

Xiuwei Xu, Haowen Sun, Angyuan Ma, Yiwei Zhang, Zhenyu Wu, Xiaofeng Wang, Bingyao Yu, Zheng Zhu, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学) BUPT(北京邮电大学) GigaAI

专题命中 机器人数据与评测 :manipulation(title,abstract);分类 cs.RO、cs.CV

AI总结 提出R2RDreamer框架,通过轻量级3D编辑和2D视频补全,从少量真实演示生成几何一致的增强数据,提升2D操作策略的空间泛化能力。

Comments Project page: https://r2rdreamer.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16564 2026-06-16 cs.RO cs.LG 新提交 81%

Elastic ODYN: Differentiable Optimization for Infeasible Control and Learning in Robotics

Elastic ODYN:面向机器人中不可行控制与学习的可微优化

Aristotelis Papatheodorou, Jose Rojas, Ioannis Havoutis, Carlos Mastalli

机构 * University of Oxford(牛津大学) Heriot-Watt University(赫瑞瓦特大学)

专题命中 机器人数据与评测 :robotics(title);robotic(abstract);分类 cs.RO、cs.LG

AI总结 提出Elastic ODYN,一种通过平滑平方ℓ2弹性松弛处理不可行二次规划(QP)的原始-对偶非内点求解器,支持热启动,在无可行点时收敛到最接近可行解,并基于此开发可微QP层和不可行感知SQP方法,在基准QP、奇异接触力学、可微参数辨识及四足/人形机器人轨迹优化中优于现有方法。

Comments 8 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16953 2026-06-16 cs.RO 新提交 79%

SidewalkBench: Benchmarking Visual Navigation on Urban Sidewalks

SidewalkBench: 城市人行道视觉导航基准

Zhizheng Liu, Honglin He, Vivek Alumootil, Akshat Pandya, Brad Squicciarini, Wayne Wu, Bolei Zhou

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Coco Robotics

专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.RO

AI总结 针对城市人行道视觉导航缺乏统一基准的问题,提出SidewalkBench,基于NVIDIA Isaac Sim构建高保真仿真环境,评估9种模型,发现行人交互和长距离鲁棒性是关键瓶颈。

Comments Project Page: https://vail-ucla.github.io/SidewalkBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15469 2026-06-16 cs.RO 新提交 79%

Learning Context-Aware Neural ODE Dynamics for Adaptive Robotic Control

学习上下文感知的神经ODE动力学用于自适应机器人控制

Shao-Yi Yu, Jen-Wei Wang, Maya Horii, Masayoshi Tomizuka, Vikas Garg

机构 * University of California, Berkeley(加州大学伯克利分校) Aalto University(阿尔托大学) YaiYai Ltd(YaiYai有限公司)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO

AI总结 提出基于神经ODE的上下文感知动力学模型,通过两阶段训练从状态-动作历史推断环境因素,实现模型预测控制下的自适应,在四旋翼、Sphero BOLT和Fanuc机械臂上验证了时空变化环境下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11381 2026-06-16 cs.CV 新提交 79%

From Simulation to the Real-World: An In-Field 6D Pose Dataset and Baseline for Robotic Strawberry Harvesting

从仿真到现实:面向机器人草莓采摘的实地6D位姿数据集与基线

Woojung Son, Won Suk Lee, Zijing Huang, Daeun Choi, Catia Silva, Yu She, Yan Gu

机构 * Department of Agricultural and Biological Engineering, University of Florida(佛罗里达大学农业与生物工程系) Department of Electrical and Computer Engineering, University of Florida(佛罗里达大学电气与计算机工程系) Edwardson School of Industrial Engineering, Purdue University(普渡大学爱德华森工业工程学院) School of Mechanical Engineering, Purdue University(普渡大学机械工程学院)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.CV

AI总结 针对机器人草莓采摘中6D位姿估计的仿真到现实差距问题,首次构建了实地草莓6D位姿真值数据集(12,040张图像),并基于NVIDIA Isaac Sim生成具有场景级真实感的合成数据集,通过基线实验量化了差距。

Comments 7 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27284 2026-06-16 cs.RO cs.AI 版本更新 79%

FineVLA: Fine-Grained Instruction Alignment for Steerable Vision-Language-Action Policies

FineVLA:面向可操控视觉-语言-动作策略的细粒度指令对齐

Xintong Hu, Xuhong Huang, Jinyu Zhang, Yutong Yao, Yuchong Sun, Qiuyue Wang, Mingsheng Li, Sicheng Xie, Yitao Liu, Junhao Chen, Yixuan Chen, Yingming Zheng, Shuai Bai, Tao Yu

机构 * XLANG Lab, The University of Hong Kong(XLANG实验室,香港大学) Qwen Team, Alibaba Inc.(通义团队,阿里巴巴公司)

专题命中 机器人数据与评测 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出FineVLA框架,通过构建细粒度数据集和训练策略,在保持任务成功率的同时实现机器人动作的细粒度可控性。

Comments 26 pages, 7 figures, 25 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16202 2026-06-16 cs.CV cs.AI cs.RO 新提交 75%

EgoPhys: Learning Generalizable Physics Models of Deformable Objects from Egocentric Video

EgoPhys: 从第一人称视频学习可变形物体的通用物理模型

Hyunjin Kim, Ri-Zhao Qiu, Guangqi Jiang, Xiaolong Wang

机构 * UC San Diego(加州大学圣地亚哥分校)

专题命中 机器人数据与评测 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出EgoPhys框架,从第一人称RGB视频中通过可泛化先验构建可变形物体的物理数字孪生,无需测试时优化即可预测弹簧刚度场,在重建、未来预测和零样本泛化上优于基线。

Comments Project Page: https://hjhyunjinkim.github.io/EgoPhys

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16910 2026-06-16 cs.CL cs.AI 新提交 74%

IMPACTeen: Intentions, Manipulation, Persuasion, Annotations, and Consequences in Teen Communication Dataset

IMPACTeen:青少年沟通数据集中的意图、操纵、说服、标注与后果

Aleksander Szczęsny, Wiktoria Mieleszczenko-Kowszewicz, Maciej Markiewicz, Beata Bajcar, Tomasz Adamczyk, Jolanta Babiak, Grzegorz Chodak, Przemysław Kazienko

机构 * Wrocław University of Science and Technology(弗罗茨瓦夫理工大学)

专题命中 机器人数据与评测 :manipulation(title);分类 cs.AI

AI总结 构建IMPACTeen数据集,包含1021个青少年社交影响场景文本,从五个视角标注,支持社交影响检测、标注者分歧及跨语言建模研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16898 2026-06-16 cs.CV cs.AI 新提交 73%

Semantic Flip: Synthetic OOD Generation for Robust Refusal in Embodied Question Answering and Spatial Localization

Semantic Flip: 用于具身问答和空间定位中鲁棒拒绝的合成OOD生成

Dongbin Na, Chanwoo Kim, Giyun Choi, Dooyoung Hong

机构 * RGA Inc.(RGA公司)

专题命中 机器人数据与评测 :embodied agent(abstract);navigation(abstract);分类 cs.AI、cs.CV

AI总结 提出Semantic Flip框架,通过合成辅助OOD样本训练轻量拒绝模块,使冻结的视觉语言模型在无外部OOD标注下实现鲁棒拒绝,在具身问答和空间定位基准上优于强提示基线。

Comments 18 pages, 3 figures. Code and data: https://github.com/ndb796/SemanticFlip ; project page: https://ndb796.github.io/SemanticFlip

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16788 2026-06-16 cs.RO 新提交 70%

SoK: Security and Privacy of Foundation-Model-Powered Robots

SoK: 基础模型驱动机器人的安全与隐私

Xueluan Gong, Chen Chen, Jinxin Liu, Qian Wang, Kwok-Yan Lam

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Cyber Science and Engineering, Wuhan University(武汉大学网络空间安全学院)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出F-E-S-G结构边界框架,系统分析基础模型驱动机器人的安全与隐私风险,并基于96篇论文揭示威胁模式、防御不匹配和评估差距。

Comments 21 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16996 2026-06-16 cs.CV cs.AI cs.LG 新提交 67%

ActiveSAM: Image-Conditional Class Pruning for Fast and Accurate Open-Vocabulary Segmentation

ActiveSAM: 图像条件类别剪枝实现快速准确的开放词汇分割

Tran Dinh Tien, Zhiqiang Shen

机构 * VILA Lab, Mohamed bin Zayed University of Artificial Intelligence(VILA实验室,穆罕默德·本·扎耶德人工智能大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 提出ActiveSAM,一种无需训练、零样本的推理框架,通过图像条件类别剪枝和低分辨率预览,将SAM 3转化为主动词汇分割器,在8个基准上平均提升1.4 mIoU,速度提升最高5.5倍。

Comments Preprint. Code is available at https://github.com/VILA-Lab/ActiveSAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15251 2026-06-16 cs.RO cs.AI cs.LG 新提交 67%

Driving, Fast or Slow? Neuro-Symbolic Guidance for Motion Prediction in Multi-Modal Ground Mobility

驾驶,快或慢?多模态地面移动中运动预测的神经符号引导

Simon Kohaut, Felix Divo, Julius Hahnewald, Benedict Flade, Julian Eggert, Kristian Kersting, Devendra Singh Dhami

机构 * Artificial Intelligence and Machine Learning Lab, TU Darmstadt(达姆施塔特工业大学人工智能与机器学习实验室) Honda Research Institute(本田研究所) Hessian Center for AI (hessian.AI)(黑森州人工智能中心) Centre for Cognitive Science(认知科学中心) German Center for AI (DFKI)(德国人工智能研究中心) Uncertainty in Artificial Intelligence Lab, TU Eindhoven(埃因霍温理工大学人工智能不确定性实验室)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出TraCS框架,通过神经符号方法将交通规则编码为概率一阶逻辑,增强黑盒运动预测模型的可解释性和合规性,在Argoverse 2上持续提升SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15117 2026-06-16 cs.MM cs.AI cs.CV cs.LG cs.SD 新提交 67%

Teacher-Student Structure for Domain Adaptation in Ensemble Audio-Visual Video Deepfake Detection

用于集成视听视频深度伪造检测中领域适应的师生结构

Elham Abolhasani, Maryam Ramezani, Hamid R. Rabiee

机构 * Department of Computer Engineering, Sharif University of Technology(谢里夫理工学院计算机工程系)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 提出EAV-DFD方法,结合师生框架的领域适应机制,提升模型在未见领域上的泛化能力,在三个数据集上AUC分别提升4.09%、17.94%和0.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18714 2026-06-16 cs.RO cs.AI cs.LG 版本更新 67%

Explainable deep learning improves human mental models of self-driving cars

可解释深度学习提升人类对自动驾驶汽车的心理模型

Eoin M. Kenny, Akshay Dharmavaram, Sang Uk Lee, Tung Phan-Minh, Shreyas Rajesh, Yunqing Hu, Laura Major, Momchil S. Tomov, Julie A. Shah

机构 * Computer Science & Artificial Intelligence Laboratory (CSAIL), Massachusetts Institute of Technology(计算机科学与人工智能实验室(CSAIL),麻省理工学院) Motional AD Inc.(Motional AD公司) Department of Psychology and Center for Brain Science, Harvard University(心理学系和大脑科学中心,哈佛大学) Department of Aeronautics and Astronautics, Massachusetts Institute of Technology(航空与宇航系,麻省理工学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出概念包装网络(CW-Net),在真实自动驾驶车上实现可解释规划,通过因果性概念解释提升驾驶员对车辆行为的预测能力,尤其在意外场景中。

Comments MST & JAS contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14766 2026-06-16 cs.CV cs.AI cs.MA 新提交 66%

XMedFusion: A Knowledge-Guided Multimodal Perception and Reasoning Framework for Autonomous Medical Systems

XMedFusion:面向自主医疗系统的知识引导多模态感知与推理框架

Hamza Riaz, Arham Haroon, Maha Baig, Muhammad Dawood Rizwan, Muhammad Naseer Bajwa, Muhammad Moazam Fraz

机构 * National University of Sciences and Technology (NUST)(巴基斯坦国立科技大学) University of Oxford(牛津大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV;robotics(comments)

AI总结 提出XMedFusion模块化AI框架,通过视觉感知、知识图谱构建和检索引导生成等智能体协同,增强放射学报告生成的视觉基础与临床发现捕捉能力,在公共数据集上显著优于基线模型。

Comments Accepted at the 2026 International Conference on Robotics and Automation in Industry (ICRAI)

Journal ref 2026 International Conference on Robotics and Automation in Industry (ICRAI), pp. 1-6, May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14824 2026-06-16 cs.AR cs.AI cs.LG 新提交 62%

Running hardware-aware neural architecture search on embedded devices under 512MB of RAM

在512MB内存下的嵌入式设备上运行硬件感知的神经架构搜索

Andrea Mattia Garavagno, Edoardo Ragusa, Paolo Gastaldo, Antonio Frisoli

机构 * University of Bologna(博洛尼亚大学) Politecnico di Milano(米兰理工学院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 提出一种在资源受限的嵌入式设备上直接运行的硬件感知神经架构搜索方法,生成针对低端MCU的微型CNN,在Visual Wake Word数据集上达到最先进水平。

Journal ref 2024 IEEE International Conference on Consumer Electronics (ICCE), Las Vegas, NV, USA, 2024, pp. 1-2

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05876 2026-06-16 cs.CV cs.RO 版本更新 62%

Systematic Evaluation of Novel View Synthesis for Video Place Recognition

面向视频地点识别的合成新视角系统性评估

Muhammad Zawad Mahmud, Samiha Islam, Damian Lyons

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 系统评估合成新视角对视频地点识别的影响,发现少量合成视角可提升识别性能,且视角变化幅度不如添加数量和图像类型重要。

Comments Submitted to IEEE IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16767 2026-06-16 cs.CV 新提交 57%

Text-Vision Co-Instructed Image Editing

文本-视觉协同指导的图像编辑

Chenxi Xie, Yuhui Wu, Qiaosi Yi, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 提出TV-Edit框架,联合文本指令的语义表达与稀疏视觉指令的空间引导,实现精确且忠实于意图的图像编辑,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16101 2026-06-16 cs.MM cs.CV 新提交 57%

Effective and Low-cost Lane-based Map Localization for Vehicle-Centric Route Generation

基于车道的地图定位实现以车辆为中心的路线生成:一种有效且低成本的方法

Hong-Shiang Lin, Jung-Hsin Chen, Yu-Luen Tzeng, Wei-Hao Chen, Yi-Chen Lee, Li-Jhe Chen, Peng-Yuan Chen

机构 * National Taipei University(台北国立大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 提出OLRA框架,通过匹配导航路线与摄像头检测的车道线,以低成本地图定位生成驾驶员视角路线,提升定位精度和路线一致性,在nuScenes数据集上优于OpenPilot。

Comments 14 pages, 18 figures. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15550 2026-06-16 cs.RO 新提交 57%

Robots as Tokens: Unified Diffusion Transformer for Coordinated Multi-Robot Trajectory Generation

机器人作为令牌:面向协调多机器人轨迹生成的统一扩散Transformer

Ruofei Bai, Jie Chen, Yuxin Cai, Jun Li, Wei-Yun Yau, Lihua Xie

机构 * Nanyang Technological University(南洋理工大学) Agency for Science, Technology and Research(新加坡科技研究局) National University of Singapore(新加坡国立大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 提出Roken框架,将每个机器人表示为离散令牌,通过扩散Transformer直接生成满足安全和连通性约束的多机器人轨迹,无需迭代后处理。

Comments 23 pages, 13 figures; \textbf{Project page:} \href{https://bairuofei.github.io/roken-project-page/}{\texttt{bairuofei.github.io/roken-project-page}}

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15287 2026-06-16 cs.CV 新提交 57%

G2IA: Geometry-Guided Instance-Aware Retrieval and Refinement for Cross-Modal Place Recognition

G2IA: 几何引导的实例感知跨模态地点识别检索与精炼

Xianyun Jiao, Jingyi Xu, Zhongmiao Yan, Xieyuanli Chen, Ling Pei

机构 * Shanghai Jiao Tong University(上海交通大学) National University of Defense Technology(国防科技大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 提出G2IA框架,通过几何引导的实例感知检索和跨模态局部形状与空间布局验证,解决图像到点云地点识别中的模态差异和感知混淆问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15255 2026-06-16 cs.RO 新提交 57%

OSDAG: Online Scheduling for Efficient Multi-Robot Collaboration

OSDAG: 面向高效多机器人协作的在线调度

Thanh Nguyen Canh, Thang Tran Viet, Phuc Van Dinh, Xiem HoangVan, Nak Young Chong

机构 * Japan Advanced Institute of Science and Technology(日本北陆先端科学技术大学院大学) University of Engineering and Technology, Vietnam National University(越南国立大学工程技术大学) Hanyang University(汉阳大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 提出OSDAG框架,结合LLM任务推理与DAG在线调度,通过一次性分解指令为依赖图并实时分配任务,相比对话式方法推理速度提升5-15倍,调度时间缩短38%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15077 2026-06-16 cs.AI cs.CL 新提交 57%

Risk-Aware LLM Agents for Geospatial Data Retrieval: Design and Preliminary Adversarial Evaluation

风险感知的LLM智能体用于地理空间数据检索:设计与初步对抗性评估

Kyle Gao, Joel Cumming, Jonathan Li, Linlin Xu, David A. Clausi

机构 * Dept. of Systems Design Engineering, University of Waterloo(滑铁卢大学系统设计工程系) SkyWatch Dept. of Geography and Environmental Management, University of Waterloo(滑铁卢大学地理与环境管理系) Dept. of Geomatics Engineering, University of Calgary(卡尔加里大学测绘工程系)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 提出一种基于LLM的框架,通过自然语言查询从云地理空间目录检索遥感数据,集成三个智能体实现安全、意图解析和API调用生成,初步对抗实验表明提示级安全指令提升鲁棒性但需系统级防御。

Comments Accepted for publication in the International Archives of the Photogrammetry, Remote Sensing and Spatial Information Sciences (ISPRS Archives), ISPRS Congress 2026

Journal ref Int. Arch. Photogramm. Remote Sens. Spatial Inf. Sci., XLIX-B3-2026, 1419-1426, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14862 2026-06-16 cs.RO 新提交 57%

TacStyle: Personalizing Tactile Robot Policies using Structured Behavior Representations

TacStyle: 使用结构化行为表示个性化触觉机器人策略

Kevin Robledo, Matías I. Torres Galaz, Kumar Dixhant Rai, Shelly Sara Ulman, Tasmia Tasrin, Heramb Nemlekar

机构 * Department of Computer Science, California State University, Northridge(加州州立大学北岭分校计算机科学系) Department of Mechanical Engineering, California State University, Northridge(加州州立大学北岭分校机械工程系)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 提出通过结构化潜在表示组织用户偏好,结合基础模型解释语言指令,实现机器人行为精细调整,减少偏好标签需求。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14739 2026-06-16 cs.ET cs.LG cs.SY eess.SY 新提交 57%

An RRAM-based Hardware Implementation of a Radial Basis Function Neuron for Edge Classifiers

基于RRAM的径向基函数神经元硬件实现用于边缘分类器

Georgios Papandroulidakis, Shady Agwa, Themis Prodromakis

机构 * Centre for Electronics Frontiers, Institute of Micro and Nano Systems(电子前沿中心,微纳系统研究所)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.LG

AI总结 提出一种基于金属氧化物RRAM的模拟内容可寻址存储器(ACAM)硬件设计,通过可配置感受野神经元实现边缘设备上的度量分类和在线自适应,在MNIST上达到89.1%准确率,每单元每操作能耗185fJ。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14720 2026-06-16 cs.CV 新提交 57%

AI for Maritime Security: Comparative Evaluation of CNN and Vision Transformer Architectures for Maritime Object Detection

AI用于海上安全:CNN与Vision Transformer架构在海上目标检测中的比较评估

Ismet Gocer, Zakirul Bhuiayn, Shakeel Ahmad, Raza Hasan

机构 * Southampton Solent University School of Technology and Maritime Industries(索马顿桑德兰大学技术与海洋工业学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 研究利用CNN和Vision Transformer等六种深度学习模型,在多种天气条件下检测海面船只,ViT达到100%准确率且处理速度最快,展示了AI视觉系统在海上监视中的潜力。

Comments 24 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏