arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8666 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8666 篇

2607.04616 2026-07-07 cs.RO cs.AI 新提交 62%

SILO: Simulation-in-the-Loop Sim-to-Real Transfer for Multi-Stage Cable Routing

SILO:用于多阶段电缆布线的回路内仿真的仿真到现实转移

Stone Tao, Jie Xu, Hesam Rabeti, Yashraj Narang, Yijie Guo, Iretiayo Akinola

机构 * NVIDIA Corporation(英伟达公司) University of California, San Diego(加利福尼亚大学圣地亚哥分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 针对电缆等物体复杂变形导致的线性可变形操纵难题,提出基于GPU并行仿真的强化学习框架及新部署策略,实现多阶段电缆布线的仿真到现实转移,提升成功率并减少周期时间。

Comments Website: https://silo-cable-routing.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02866 2026-07-07 cs.CV cs.RO 新提交 62%

E-TraMamba: A New Paradigm for Efficient Long-Term 3D Feature Tracking with Event Cameras

E-TraMamba:一种用于事件相机的高效长期3D特征跟踪的新范式

Juwei Shen, Yujie Wu, Changwen Chen

机构 * Department of Computing, FCMS(计算系(FCMS)) The Hong Kong Polytechnic University(香港理工大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 针对现有3D跟踪器在处理稀疏、噪声事件流时的问题,提出E-TraMamba框架,采用线性状态空间模型和多尺度线索融合等方法,构建数据集,实验表明其性能达最优,适用于多种视觉任务。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02680 2026-07-07 cs.CV cs.AI 新提交 62%

K9-Bench: Evaluating Multimodal LLMs on Canine-Centric Videos

K9-Bench:在以犬类为中心的视频上评估多模态大语言模型

Khush Attarde, Yusuf Ali, Megha Thukral, Divye Bhutani, Thomas Ploetz, Zsolt Kira

机构 * Ogmen Robotics Inc.(Ogmen机器人公司) Georgia Institute of Technology(佐治亚理工学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 介绍K9-Bench基准,通过约5000个问答对测试多模态大语言模型对犬类动作和互动理解。提出数据生成管道创建数据集,发现前沿模型在犬类任务上零样本性能有限,还提供通用数据集构建管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02646 2026-07-07 cs.RO cs.CV 新提交 62%

EVA-Client: A Unified Data Collection, Inference, and Deployment Framework for Embodied Policies on Real Robots

EVA-Client:用于真实机器人上具身策略的统一数据收集、推理和部署框架

Heqing Yang, Yang Yi, Liyao Wang, Linqing Zhong, Donglin Yang, Ruipu Wu, Zitong Bai, Fengjiao Chen, Manyuan Zhang, Linjiang Huang, Si Liu

机构 * CoLab, Beihang University(协同实验室,北京航空航天大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 介绍EVA-Client框架,它位于策略服务器和物理硬件之间,统一策略迭代循环的真实机器人阶段。贡献包括组件解耦架构、可检查执行及每次评估兼具数据收集功能,还整合多种实时推理策略。

Comments https://colalab.net/projects/eva-client

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20742 2026-07-07 cs.RO cs.AI 新提交 62%

A Digital Twin Framework for Traffic-Aware UAV Pavement Monitoring in Open-Traffic Conditions

无需封闭车道的交通感知无人机路面监测数字孪生框架

Yamil Uchani, Grace Luna, Edwin Salcedo, Mauricio Figueroa

机构 * School of Electronic Engineering and Computer Science, Queen Mary University of London(伦敦玛丽女王大学电子工程与计算机科学学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 提出基于Unity的数字孪生框架,集成YOLOv8n检测与分类器,实现交通感知无人机路面监测,无需封闭车道,实验评估三种遮挡恢复策略,最高覆盖率达97.95%。

Comments Accepted for publication in the proceedings of the 6th Annual IEEE International Conference on Digital Twins and Parallel Intelligence (DTPI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10840 2026-07-07 cs.LG cs.AI q-bio.QM 版本更新 62%

Clin-JEPA: A Multi-Phase Co-Training Framework for Joint-Embedding Predictive Pretraining on EHR Patient Trajectories

Clin-JEPA:一种多阶段协同训练框架,用于EHR患者轨迹的联合嵌入预测预训练

Yixuan Yang, Mehak Arora, Ryan Zhang, Baraa Abed, Junseob Kim, Tilendra Choudhary, Md Hassanuzzaman, Kevin Zhu, Ayman Ali, Chengkun Yang, Alasdair Edward Gent, Victor Moas, Rishikesan Kamaleswaran

机构 * Duke University(杜克大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Clin-JEPA框架,通过多阶段预训练稳定协同训练编码器和预测器,解决EHR数据中联合嵌入预测的挑战,实现多任务下游任务的高性能表现。

Comments 18 pages, 4 figures, 8 tables. Code: https://github.com/Kamaleswaran-Lab/Clin-JEPA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11797 2026-07-07 cs.RO cs.CV 版本更新 62%

AnchorDream: Repurposing Video Diffusion for Embodiment-Aware Robot Data Synthesis

AnchorDream:将视频扩散用于具身感知机器人数据合成

Junjie Ye, Rong Xue, Basile Van Hoorick, Pavel Tokmakov, Muhammad Zubair Irshad, Yue Wang, Vitor Guizilini

机构 * Toyota Research Institute(丰田研究院) USC Physical Superintelligence (PSI) Lab(USC物理超智能(PSI)实验室)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.CV

AI总结 针对机器人示范数据收集瓶颈,AnchorDream利用预训练视频扩散模型,通过机器人运动渲染来合成数据,无需环境建模,从少量示范生成多样高质量数据集,提升下游策略学习。

Comments Project page: https://jay-ye.github.io/AnchorDream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16923 2026-07-07 cs.CR cs.AI cs.LG 版本更新 62%

UNDREAM: Bridging Differentiable Rendering and Photorealistic Simulation for End-to-end Adversarial Attacks

UNDREAM:为端到端对抗攻击弥合可微渲染与逼真模拟的差距

Mansi Phute, Matthew Hull, Haoran Wang, Alec Helbling, ShengYun Peng, Willian Lunardi, Martin Andreoni, Wenke Lee, Duen Horng Chau

机构 * Georgia Institute of Technology(佐治亚理工学院) Technology Innovation Institute(技术创新研究院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 针对自动驾驶等安全关键应用中深度学习模型对抗攻击测试问题,介绍UNDREAM框架,通过弥合逼真模拟器与可微渲染器差距,实现对3D物体对抗扰动的端到端优化,开启物理对抗攻击研究新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10733 2026-07-07 cs.RO cs.LG 62%

BaTCAVe: Trustworthy Explanations for Robot Behaviors

BaTCAVe:机器人行为的可信解释

Som Sagar, Aditya Taparia, Harsh Mankodiya, Pranav Bidare, Yifan Zhou, Ransalu Senanayake

机构 * School of Computing and Augmented Intelligence, Arizona State University(计算与增强智能学院,亚利桑那州立大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 本文提出基于人类可理解的高层概念的可信可解释机器人技术,通过匹配神经网络激活与可视化来提供带有不确定性评分的解释,验证了其作为事后人类友好的机器人诊断工具的有效性。

Comments 19 pages, 26 figures

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Hangzhou, China, 2025, pp. 13867-13874

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08983 2026-07-07 cs.RO cs.AI 版本更新 62%

Rational Inverse Reasoning: Few-Shot Imitation by Inferring Intent through Planning

理性逆推理:通过规划推断意图进行少样本模仿

Ben Zandonati, Tomás Lozano-Pérez, Leslie Pack Kaelbling

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 研究人类能从少量示范学习新操作任务,而现代机器人模仿学习需大量示范且适应性差的差距。提出理性逆推理,将少样本模仿视为对潜在解释程序的推理,通过视觉语言模型和分层规划器迭代优化候选集,在少样本设置中表现优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02426 2026-07-03 cs.LG cs.AI 新提交 62%

QFedAgent: Quantum-Enhanced Personalized Federated Learning for Multi-Agent Activity Recognition

QFedAgent: 量子增强的个性化联邦学习用于多智能体活动识别

Quoc Bao Phan, Tuy Tan Nguyen

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) FAMU-FSU College of Engineering, Florida State University(佛罗里达州立大学工程学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.LG

AI总结 提出QFedAgent混合量子-经典个性化联邦学习框架,通过变分量子电路融合模块减少参数开销,在非独立同分布多模态数据上实现97.7%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01915 2026-07-03 cs.CV cs.RO 新提交 62%

Robust Image Processing Techniques for Construction Environment Monitoring Using Underwater Robots

用于水下机器人施工环境监测的鲁棒图像处理技术

Seunghee Yun, Geonmo Yang, Juhui Lee, Changbeom Park, Jeahyung Choi, Younggun Cho

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出一种针对水下机器人施工环境监测的鲁棒图像处理框架,通过分阶段建模前向散射和海洋雪退化,使用合成数据重训练联合ID网络,并应用轻量级后处理,在真实水下数据集上提升视觉质量和UIQM分数。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06288 2026-07-03 cs.AI cs.LG 版本更新 62%

BuilderBench: The Building Blocks of Intelligent Agents

BuilderBench:智能体的构建模块

Raj Ghugare, Roger Creus Castanyer, Catherine Ji, Kathryn Wantlin, Jin Schofield, Karthik Narasimhan, Benjamin Eysenbach

机构 * Princeton University(普林斯顿大学) Mila – Quebec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.LG

AI总结 提出BuilderBench基准,通过开放式探索训练智能体构建结构,实验表明现有前沿语言模型和强化学习算法无法解决任何非平凡任务。

Comments Blogpost: https://rajghugare19.github.io/builderbench and Code: https://github.com/rajghugare19/builderbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00716 2026-07-02 cs.CV cs.AI 新提交 62%

Partial Skeleton Visibility for Action Recognition: A Constrained Field-of-View Approach

部分骨架可见性用于动作识别:一种受限视野方法

Yingjie Dai, Tianyang Xu, Yanglin Deng, Xiao-Jun Wu, Josef Kittler

机构 * Jiangnan University(江南大学) University of Surrey(萨里大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 针对现实场景中视野受限导致骨架关节大量缺失的问题,提出PartialVisGraph超图框架,通过可学习虚拟超边和单头样本自适应Transformer,结合可见性先验实现鲁棒的动作识别,在NTU RGB+D 60/120上显著提升部分可见性下的准确率。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00218 2026-07-02 cs.CV cs.AI 新提交 62%

EgoSafetyBench: A Diagnostic Egocentric Video Benchmark for Evaluating Embodied VLMs as Runtime Safety Guards

EgoSafetyBench:用于评估具身VLM作为运行时安全卫士的诊断性自我中心视频基准

Siddhant Panpatil, Arth Singh, Mijin Koo, Chaeyun Kim, Haon Park, Dasol Choi

机构 * AIM Intelligence(AIM智能研究所) Seoul National University(首尔国立大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI、cs.CV

AI总结 提出EgoSafetyBench,一个包含1200个机器人视角场景的自我中心视频基准,用于评估视觉语言模型在流式安全监控中的能力,通过情景和视觉通道两个轨道测试模型识别危险和应对误导性文本的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04198 2026-07-02 cs.CV cs.RO 版本更新 62%

DriveVA: Video Action Models are Zero-Shot Drivers

DriveVA: 视频动作模型是零样本驱动器

Mengmeng Liu, Diankun Zhang, Jiuming Liu, Jianfeng Cui, Hongwei Xie, Guang Chen, Hangjun Ye, Michael Ying Yang, Francesco Nex, Hao Cheng

机构 * University of Twente(特温特大学) Xiaomi EV(小米电动汽车) University of Cambridge(剑桥大学) University of Bath(巴斯大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.CV

AI总结 DriveVA提出了一种新的自动驾驶世界模型,通过共享潜在生成过程联合解码未来视觉预测和动作序列,提升跨数据集和传感器配置的泛化能力,减少碰撞率和误差。

Comments Accepted to ECCV 2026. 30 pages, 12 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31966 2026-07-01 cs.MA cs.AI cs.CL cs.CV 新提交 62%

MECoBench: A Systematic Study of Multimodal Agent Collaboration in Embodied Environments

MECoBench:具身环境中多模态智能体协作的系统研究

Qingyun Liu, Jiwen Zhang, Jingyi Hu, Siyuan Wang, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI、cs.CV

AI总结 提出MECoBench基准,通过多任务、多结构、多模式的实验,系统研究多模态大模型在具身环境中的协作机制,发现协作能提升任务完成度但需平衡收益与复杂度,通信是关键,且协作增强鲁棒性。

Comments Project website: https://q-i-n-g.github.io/MECoBench-Website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31834 2026-07-01 cs.CV cs.AI 新提交 62%

Real-Time Source-Free Object Detection

实时无源目标检测

Sairam VCR, Varun Gopal, Poornima Jain, Vineeth N Balasubramanian, Muhammad Haris Khan

机构 * IIT Hyderabad(印度理工学院海得拉巴分校) Microsoft Research(微软研究院) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 提出一种基于YOLOv10的实时无源目标检测方法,通过双头伪标签融合(DHF)和多尺度自适应表示多样化(MARD)损失,在保持实时性和轻量化的同时,显著提升域适应精度。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31209 2026-07-01 cs.AI cs.RO 新提交 62%

Long-term Traffic Simulation via Structured Autoregressive Modeling

基于结构化自回归建模的长期交通仿真

Lingyu Xiao, Zexin Feng, Xintao Yan

机构 * The University of Hong Kong(香港大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.AI

AI总结 提出RosettaSim框架,利用大规模序列模型的归纳偏置和统计先验,通过结构化自回归流建模场景拓扑、智能体状态和生成意图,实现短期准确与长期稳定仿真;并引入基于检索的交通评估(RTE)解决长期评估难题。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31131 2026-07-01 cs.AI cs.RO 新提交 62%

Scenario Generation for Testing of Autonomous Driving Systems Using Real-World Failure Records

利用真实世界故障记录生成自动驾驶系统测试场景

Anjali Parashar, Chuchu Fan

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 提出一种基于LLM的场景生成流程,利用历史故障记录中的分类和上下文信息,生成多样化测试场景,在Metadrive模拟器上验证了方法的准确性和多样性。

Comments 9 pages, Appendix included. Paper accepted and presented at NeuS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29861 2026-06-30 cs.CV cs.AI 62%

SUMO: Segment and Track Any Motion with Nonlinear State Space Models

SUMO: 使用非线性状态空间模型分割和跟踪任意运动

Kexin Tian, Sixu Li, Keshu Wu, Yang Zhou, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯A&M大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 提出SUMO框架,结合非线性状态空间模型与视觉分割,实现零样本、免训练的视觉目标跟踪和运动目标分割,通过选择性无迹滤波和记忆选择机制达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28383 2026-06-30 cs.CV cs.LG 62%

Zero-Label Driving Scenario Complexity Detection via Joint Embedding Predictive Architecture

零标签驾驶场景复杂度检测基于联合嵌入预测架构

Santosh Jaiswal

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV、cs.LG

AI总结 提出无监督方法,利用联合嵌入预测架构(JEPA)在无标签数据上通过时间预测误差作为零样本复杂度指标,有效区分复杂与简单驾驶场景。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28345 2026-06-30 cs.RO cs.AI cs.CL cs.CY 62%

Auditing LLM-Governed Social Robots with Culture-Specific Moral Gradients

审计具有文化特定道德梯度的LLM驱动社交机器人

Carmen Ng, Gjergji Kasneci

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 针对LLM驱动社交机器人在跨文化场景中优先分配资源时的道德偏差,提出基于梯度的多语言审计框架,通过对称控制场景测试模型对文化偏好梯度的区分能力,发现提示工程无法可靠纠正的持续性不对称问题。

Comments Accepted for publication in Proceedings of the 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09731 2026-06-29 cs.CV cs.AI cs.CL 版本更新 62%

EXPLORE-Bench: Egocentric Scene Prediction with Long-Horizon Reasoning

EXPLORE-Bench:具有长视距推理的自我中心场景预测

Chengjun Yu, Xuhan Zhu, Chaoqun Du, Pengfei Yu, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Foundation Model Team, Li Auto Inc.(蔚来汽车基础模型团队) Tsinghua University(清华大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI、cs.CV

AI总结 提出EXPLORE-Bench基准,通过初始场景图像和动作序列预测最终场景,评估多模态大模型在自我中心长视距推理中的能力,发现与人类存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27317 2026-06-26 cs.CV cs.RO 新提交 62%

OctoSense: Self-Supervised Learning for Multimodal Robot Perception

OctoSense: 多模态机器人感知的自监督学习

Anthony Bisulco, Jeremy Wang, Kostas Daniilidis, Randall Balestriero, Pratik Chaudhari

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 提出OctoSense传感器平台和数据集,通过“晚融合”掩码自编码器实现多模态自监督学习,在多种退化条件下鲁棒预测光流、深度、语义分割和自运动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26575 2026-06-26 cs.RO cs.AI 新提交 62%

IDEA: Insensitive to Dynamics Mismatch via Effect Alignment for Sim-to-Real Transfer in Multi-Agent Control

IDEA: 通过效果对齐对动力学失配不敏感的模拟到现实迁移多智能体控制

Chenlong Liu, Zhuohui Zhang, Xinyan Chen, Zhipeng Wang, Bin Cheng, Bin He

机构 * College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海自主智能无人系统科学中心)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 提出一种通过效果对齐对动力学失配不敏感的模拟到现实迁移方法,结合随机环境结构与离散语义动作,并开发动作同步机制,提升多智能体系统在真实场景中的训练效率和成功率。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22062 2026-06-26 cs.RO cs.LG 新提交 62%

How Should a Simulation-to-Reality Transfer Budget Be Spent?

模拟到现实迁移预算应如何分配?

Syed Hamzah Rizvi, Yash Vardhan Tomar

机构 * Purdue University(普渡大学)

专题命中 机器人数据与评测 :robot learning(abstract);分类 cs.RO、cs.LG

AI总结 研究在模拟到现实迁移中,系统辨识与域随机化之间的预算分配权衡,发现少量辨识数据即可弥合大部分迁移差距,且基于估计参数训练优于宽随机化。

Comments Both authors contributed equally and share first authorship. Submitted to IEEE IROS First Workshop on Sim2Real and Classical Control 2026. Code is available: https://github.com/YTomar79/sim2real_budget

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23742 2026-06-24 cs.LG cs.AI cs.AR 新提交 62%

Low-power analogue neural networks with trainable nonlinear connections for continuous control

具有可训练非线性连接的低功耗模拟神经网络用于连续控制

Ian T. Vidamour, Fernando Aguirre, Thomas J. Hayward, Matthew O. A. Ellis, Charles Swindells, Alexander McDonnell, Martin Trefzer, Finley Robins, Luca Manneschi, Susan Stepney, Tony Kenyon, Oliver J. Sutton, Jack C. Gartside, Ivan Y. Tyukin, Adnan Mehonic, Eleni Vasilaki

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院) Intrinsic Semiconductor Technologies(Intrinsic Semiconductor Technologies公司) School of Chemical, Biological, and Materials Science Engineering, University of Sheffield(谢菲尔德大学化学、生物与材料科学工程学院) School of Physics, Engineering, and Technology, University of York(约克大学物理、工程与技术学院) Department of Computer Science, University of York(约克大学计算机科学系) Department of Electronic & Electrical Engineering, University College London(伦敦大学学院电子与电气工程系) King’s College London(伦敦国王学院) Blackett Laboratory, Imperial College London(帝国理工学院布莱克特实验室)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.LG

AI总结 受Kolmogorov-Arnold网络启发,在连接上放置可训练非线性函数,使每个物理连接成为可学习计算单元,通过现场可编程模拟阵列实现带通滤波器,在连续控制等任务上以更少节点和连接达到高效,预计CMOS实现功耗约30微瓦。

Comments Preprint. Further verification of all simulations is ongoing. Any resulting corrections will be incorporated in a revised version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22409 2026-06-23 cs.CV cs.AI 新提交 62%

Gold Points Sniper: Self-guided Visual Reasoning in VLM for Fine-grained Action Understanding

金点狙击手:VLM中的自引导视觉推理用于细粒度动作理解

Haodi Liu, Xinhang Yang, Kunda Yan, Sen Cui, Zeyu Zhang, Changshui Zhang

机构 * Beijing National Research Center for Information Science and Technology (BNRist), Department of Automation, Tsinghua University(清华大学自动化系北京信息科学与技术国家研究中心) State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院通用人工智能国家重点实验室)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 提出金点狙击手框架,通过金点提取器、选择性苏格拉底提问器和语义蕴含评估器三个模块,增强轻量级VLM的细粒度人类动作理解能力,在CAP基准上达到接近GPT-4o的性能且事实准确性更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21792 2026-06-23 cs.RO cs.AI 新提交 62%

THREAD: Trajectory Planning for Hybrid Rigid-Soft Manipulators with Environment-Aware Diffusion

THREAD: 面向混合刚柔机械臂的环境感知扩散轨迹规划

Shivani Kamtikar, Pranav Asthana, Naveen Kumar Uppalapati, Girish Krishnan, Girish Chowdhary

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Maryland College Park(马里兰大学帕克分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出首个基于扩散的混合刚柔机械臂轨迹规划器THREAD,通过物理启发损失联合约束刚柔段,实现狭窄环境穿行,任务成功率92.4%,碰撞减少5倍。

Comments Project Page: https://robot-thread.github.io, IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏