arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 476 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 476 篇

2607.06118 2026-07-08 cs.CV cs.MM 新提交 57%

WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation

WebRetriever:用于高效网络智能体评估的大规模综合基准测试

Wei Dong, Tianyu Fu, Zhe Yu, Hanning Wang, Anyang Su, Zhizhou Fang, Yuyang Chen, Shuo Wang, Minghui Wu, Ping Jiang, Zhen Lei, Chenxu Zhao

机构 * Mininglamp Technology(旷视科技) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所综合技术集成中心)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 针对现有网络智能体评估基准测试的局限,提出WebRetriever这一大规模综合基准测试,涵盖多领域网站和任务。采用NavEval框架及三个评估协议,实验揭示不同协议性能差异,为网络智能体研发提供细粒度见解和严谨基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05775 2026-07-08 cs.AI 新提交 57%

Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in Large Language Model Agents

超越排行榜:大语言模型智能体中工具使用、规划和推理失败的综合分析

Wael Albayaydh, Rui Zhao, Ivan Flechais

机构 * University of Oxford(牛津大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 本文综合多篇论文形成大语言模型智能体局限性交叉分类法,识别出六个失败集群,通过迭代分组得出分类法,发现失败与任务长度非线性相关,单个子任务性能不能保证端到端成功,额外脚手架效果不佳,同时在部分任务上有进展。

Comments 16 pages, 3 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05571 2026-07-08 cs.AI cs.HC 新提交 57%

CSTutorBench: Benchmarking Small Language Models as Tutors for Block-Based Programming

CSTutorBench:将小型语言模型作为基于块的编程导师进行基准测试

H. Chad Lane, Bryson Kageler

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI

AI总结 研究针对K-12环境中部署语言模型的问题,引入CSTutorBench基准评估VEX VR中语言模型作导师的表现。通过对11个模型测试发现其在深层教学行为有困难,模型家族和指令调整方法对辅导质量预测性更好,特定提示修订可提分,凸显此类基准的价值。

Journal ref SLM4ED'26: The 1st Workshop of Small Language Models for Education (SLM4ED). AIED 2026. Seoul, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05315 2026-07-08 cs.RO 新提交 57%

Socially-Aware Autonomous Doorway Traversal and Payload Delivery for Emergency Assistance

面向应急援助的具备社会感知能力的自主过门与物资递送机器人系统

Andrew Snowdy, Ananya Trivedi, Sarvesh Prajapati, Lorena Maria Genua, Taskin Padir

机构 * Department of Electrical and Computer Engineering, Northeastern University(美国东北大学电气与计算机工程系) Northeastern University(美国东北大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 针对机器人辅助应急疏散场景,以行为树为核心框架实现社会感知自主过门与救援物资递送功能,经多场景实验验证系统可靠性,为应急响应机器人提供实用基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03411 2026-07-07 eess.SP cs.AI 新提交 57%

The S-ICDF Dataset: Sionna-Simulated Dynamic Interference Characterization and Direction Finding

S-ICDF数据集:基于Sionna仿真的动态干扰表征与测向数据集

Christian Wielenberg, Lucas Heublein, Jonathan Ott, Alexander Mattick, Nisha L. Raichur, Jonas Pirkl, Lukas Schelenz, Tobias Feigl, George Yammine, Christopher Mutschler, Felix Ott

机构 * Fraunhofer Institute for Integrated Circuits IIS(弗劳恩霍夫整合电路研究所)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 针对干扰监测数据集稀缺问题,基于Sionna生成含102种干扰配置的大规模S-ICDF数据集,用经典测向方法与现代ML方法完成基准测试,支撑无线干扰相关算法研发。

Comments 6 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02537 2026-07-07 eess.SP cs.LG stat.ML 新提交 57%

Physics-Informed Domain-Invariant Feature Learning with Autoencoder-Driven Gaussian Clustering for Robust Non-line-of-Sight Scenarios

面向稳健非视距场景的基于自编码器驱动高斯聚类的物理信息域不变特征学习方法

Nisha L. Raichur, Lucas Heublein, Dominik Seuß, Frank Deinzer, Felix Ott

机构 * Fraunhofer Institute for Integrated Circuits IIS(弗劳恩霍夫集成电路研究所IIS)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.LG

AI总结 针对非视距下射频干扰波达角估计性能下降问题,提出融合物理约束的混合学习框架,结合自编码器高斯聚类提取域不变特征,提升低样本下跨场景AoA估计精度。

Comments 7 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05290 2026-07-07 cs.CV 新提交 57%

ChatImage: Navigating Long-Form LLM Answers through Interactive Images

ChatImage:通过交互式图像导航大语言模型的长文本回答

Wencan Jiang, Jiangning Zhang, Yong Liu

机构 * Zhejiang University(浙江大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 针对LLM长文本答案难以细粒度浏览的问题,ChatImage将其转为带点击热点的交互图像,支持局部查询,提升内容与交互区域的一致性,还开源实现并发布多格式评测基准。

Comments Project:https://wencanjiang.github.io/ChatImage

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05201 2026-07-07 cs.LG 新提交 57%

FlatManifold: Robust Continual Learning under Severe Label Noise and Domain Shifts via Intrinsic Manifold Flattening

FlatManifold:基于内在流形扁平化的强标签噪声与域偏移场景下鲁棒持续学习方法

Rai Hisada, Kanji Tanaka

机构 * Department of Mechanical Engineering, Faculty of Engineering, University of Fukui(日本福井大学工学部机械工学科)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.LG

AI总结 针对非平稳流环境下强未校准标签噪声与非线性域偏移共存的挑战,提出FlatManifold框架,通过流形扁平化实现鲁棒持续学习,大幅优于基线方法。

Comments 5 pages, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04988 2026-07-07 cs.RO 新提交 57%

InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization

InternVLA-A1.5:统一理解、潜在预见与组合泛化的行动

Haoxiang Ma, Junhao Cai, Xiaoxu Xu, Hao Li, Yuyin Yang, Yang Tian, Jiafei Cao, Hongrui Zhu, Zherui Qiu, Zhaxizhuoma, Yuqiang Yang, Jiaqi Peng, Xueyuan Wei, Yangkun Zhu, Jiahao Jiang, Xing Gao, Hanqing Wang, Feng Yuan, Kailin Li, Xueyue Zhu, Tai Wang, Yan Ding, Jiangmiao Pang, Jia Zeng, Jingjing Zhang, Bowen Zhou, Yao Mu, Chunhua Shen, Weinan Zhang

机构 * Physical Intelligence Team Shanghai AI Laboratory(上海人工智能实验室物理智能团队)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 研究旨在统一机器人操作模型,提出InternVLA-A1.5,基于原生VLM骨干构建策略,将未来预测转化为潜在查询问题,继承预训练视频生成模型动力学先验,在模拟和现实基准测试中效果良好。

Comments Homepage: https://internrobotics.github.io/internvla-a15.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04330 2026-07-07 cs.CV 新提交 57%

Framework and Multi-modal Dataset for Roadwork Zone Detection and Geo-localization

道路施工区域检测与地理定位的框架和多模态数据集

Zhiran Yan, Yutong Xin, S Shyam Shenoi, Rui Song, Gordon Elger

机构 * Institute of Innovative Mobility (IIMo), Technical University Ingolstadt of Applied Sciences(应用科学英戈尔施塔特技术大学创新移动研究所) Fraunhofer Institute for Transportation and Infrastructure Systems IVI(弗劳恩霍夫交通与基础设施系统研究所IVI) Technical University of Munich(慕尼黑工业大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 针对自动驾驶中高清地图缺乏道路施工区域等半静态信息的问题,提出包含模拟和真实数据的多模态数据集及检测与地理定位管道,经实验验证该方法在检测及坐标转换上效果良好。

Comments Accepted to IEEE IV25. The RZDG dataset and code can be found at: https://github.com/chrisyan/RZDG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04310 2026-07-07 cs.RO 新提交 57%

GPU-Accelerated Polygonal Signed Distance Functions for Real-Time Collision Avoidance

用于实时碰撞避免的GPU加速多边形符号距离函数

Taekwon Ga, Jongeun Choi

机构 * School of Mechanical Engineering, Yonsei University(延世大学机械工程学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 研究在密集障碍物环境中实时碰撞避免问题,提出多边形符号距离函数(PSDF),通过张量化几何管道实现GPU加速,嵌入模型预测控制,设计分离CPU/GPU计算,实验证明其有效性。

Comments 13 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03069 2026-07-07 cs.CV 新提交 57%

SafeGuard: A Multi-Agent Perception-Reasoning Framework for Social-Risk AI-Generated Video Detection

SafeGuard:用于社会风险AI生成视频检测的多智能体感知-推理框架

Wenlin Wu, Sheng Zhou, Peipei Song, Wenhao Wang, Junbin Xiao, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) Vast Intelligence Lab(旷视智能实验室)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 针对AI生成视频检测挑战,提出SafeGuard多智能体框架,通过感知求解器与验证器协作,引入SafeVid基准,实验证明其泛化性佳,提升检测准确率。

Comments Accepted to ECCV 2026, The code and dataset are publicly available at https://github.com/williamw99/SafeGuard

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02961 2026-07-07 cs.CV cs.CR 新提交 57%

Overloading Large Vision-Language Models for Jailbreaking

通过信息过载对大型视觉语言模型进行越狱攻击

Haoyu Zhang, Yangyang Guo, Mohan Kankanhalli

机构 * National University of Singapore(新加坡国立大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.CV

AI总结 研究大型视觉语言模型易受越狱攻击问题,提出基于递归图像排版布局的信息过载方法,含大量文本和多维图像攻击,大幅提升攻击成功率,凸显此为现实部署安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02497 2026-07-03 cs.CV 新提交 57%

Seek to Segment: Active Perception for Panoramic Referring Segmentation

寻求分割:全景指代分割的主动感知

Song Tang, Shuming Hu, Xincheng Shuai, Henghui Ding, Yu-Gang Jiang

机构 * Fudan University(复旦大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 提出主动全景指代分割任务,通过记忆增强智能体PanoSeeker结合视觉语言模型与空间记忆,实现高效搜索与分割。

Comments ECCV 2026, Project Page: https://henghuiding.com/APRS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01766 2026-07-03 cs.AI 新提交 57%

SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation

SimWorlds: 一个用于动态3D场景创建的多智能体系统

Chunjiang Liu, Xiaoyuan Wang, Haoyu Chen, Yizhou Zhao, Ming-Hsuan Yang, László A. Jeni

机构 * Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学) University of California, Merced(加州大学默塞德分校)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.AI

AI总结 提出多智能体框架SimWorlds,通过规划-编码-审查流程和运行时状态检查工具,从文本生成动态4D场景,并引入基准4DBuildBench评估视觉保真度和物理一致性。

Comments 20 pages, 3 figures. Project page: https://dynsimworlds.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01442 2026-07-03 cs.CR cs.CV 新提交 57%

From Forgeries to Foundation Models: A Systematic Survey of Identity Document Attack and Detection

从伪造到基础模型:身份证件攻击与检测的系统性综述

Gourab Das, Pavan Kumar C, Raghavendra Ramachandra

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文系统综述了身份证件伪造攻击(物理呈现、数字注入、生成式合成)及检测方法,揭示了基准与现实间的差距,并发现最强模型在零样本场景下APCER超25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01139 2026-07-02 cs.CV 新提交 57%

SD-RouteFusion: Ego-Trajectory Prediction with SD-Map Route Conditioning

SD-RouteFusion:基于SD地图路线条件的自车轨迹预测

Sviatoslav Voloshyn, Bruno K. W. Martens, Wangxin Liu, Jakob Vinkås, Junsheng Fu

机构 * Zenseact

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 提出SD-RouteFusion,融合前视相机、车辆动力学和SD地图导航路线进行自车轨迹预测,无需HD地图,通过双假设设计和门控分类器实现鲁棒融合,在8秒预测时ADE降低16.9%。

Comments 9 pages, 4 figures, 29th International Conference on Information Fusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00569 2026-07-02 cs.RO 新提交 57%

[Preprint] Dynamic Modeling, Gait Synthesis, and Control of a Novel Subsurface Bore Propagator

[预印本] 一种新型地下钻孔推进器的动力学建模、步态合成与控制

Lina van Brügge, Shruti Kotpalliwar, Anton Koval, Akshit Saradagi, George Nikolakopoulos

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 针对模块化地下机器人,提出基于蚯蚓锚定推进和隧道掘进机挖掘的动力学模型与步态合成控制策略,通过Unity仿真和实验验证了3个步态周期内30毫米的土壤推进。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00544 2026-07-02 cs.CV 新提交 57%

GEAR-Seg: A Grounded Explainable Agent for Reasoning Segmentation and Data Engine

GEAR-Seg:用于推理分割和数据引擎的基于可解释智能体

Yanan Wang, Wen Li, Yibin Ying, Zhenghao Fei

机构 * College of Biosystems Engineering and Food Science, Zhejiang University(浙江大学生物系统工程与食品科学学院) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学杭州国际科创中心)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 提出GEAR-Seg,一种解耦的智能体框架,通过将像素转换为属性文本实现可解释推理分割,零样本性能优异,并可作为数据引擎构建大规模基准GEAR-131K。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00399 2026-07-02 cs.CV 新提交 57%

DriveVer: Lightweight Trajectory Evaluator as Test-Time Verifier for Autonomous Driving

DriveVer: 自动驾驶的轻量级轨迹评估器作为测试时验证器

Chong He, Yuechen Luo, Fang Li, Shaoqing Xu, Fuxi Wen

机构 * Tsinghua University(清华大学) University of Macau(澳门大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 提出DriveVer,一种轻量级即插即用的测试时验证器,通过双头架构融合候选轨迹与多视图视觉特征,预测安全置信度和几何修正向量,在不增加训练成本下提升规划模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31410 2026-07-02 cs.AI 新提交 57%

Xiaomi-GUI-0 Technical Report

Xiaomi-GUI-0 技术报告

Wanxia Cao, Chengzhen Duan, Pei Fu, Pengzhi Gao, Niu Lian, Fazhan Liu, Hui Liu, Heng Qu, Qinzhuo Wu, Zhehao Yu, Tongbo Chen, Shiqi Cui, Anan Du, Shukai Jia, Yuanfa Li, Wei Liu, Yike Liu, Wenchao Lu, Zhenbo Luo, Haoyuan Sun, Jiatong Sun, Cheng Tan, Yajie Wang, Changqiao Wu, Tao Xiong, Jiahui Yang, Yuxuan Yuan, Ruoceng Zhang, Shaojie Zhang, Jian Zhu, Jian Luan, Cong Zou

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 提出Xiaomi-GUI-0,一种在真实移动设备上训练和评估的原生多模态GUI智能体,通过真实设备主导的混合基础设施、多源训练数据和渐进式三阶段训练,在真实任务中实现72.0%成功率,显著提升执行稳定性和异常状态识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27962 2026-07-02 cs.RO 新提交 57%

Building a Scalable, Reproducible, Evaluatable, and Closed-Loop Simulation Environment Foundation for Embodied Intelligence

构建可扩展、可复现、可评估、闭环的具身智能仿真环境基础:面向具身智能训练、评估和数据收集的云原生仿真基础设施

Junwu Xiong, Yongjian Guo, Mingxi Luo, Ning Qiao, Lei Kang, Song Wang, Yince Gao, Chenfeng Gu, Zhen Sun, Haoran Li, Wei Lu, Yucheng Guo, Shuai Di, Xiaodong Bai, Haoran Sun, Jing Long, Jiaxuan Gao, Hui Zhang, Peng Hao, Lu Lu

机构 * AI Infra Team at JDT(京东科技AI基础设施团队) Tsinghua University(清华大学) Peking University(北京大学) Beihang University(北京航空航天大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 提出一种云原生仿真基础设施框架,通过弹性资源调度、容器化仿真等技术,实现大规模、标准化、可复现的具身智能训练、评估与数据收集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31639 2026-07-01 cs.CR cs.AI cs.GT cs.LO 新提交 57%

A Lifecycle and Application-Stack Survey of Large Language Model Vulnerabilities: Attacks, Risks, Defenses, and Open Problems

大语言模型漏洞的生命周期与应用栈调查:攻击、风险、防御与开放问题

Seyed Bagher Hashemi Natanzi, Bo Tang

机构 * Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI

AI总结 本文通过生命周期与应用栈视角系统化梳理大语言模型系统的漏洞,涵盖数据收集、预训练、对齐、供应链、检索、推理、工具执行和部署等阶段,分析攻击、风险与防御,并提出安全研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27944 2026-06-29 cs.MM cs.AI cs.CR 新提交 57%

It Lied to a Doctor to Buy Poison Ingredients: Quantifying Real-World Misuse of Phone-use Agents

它向医生撒谎购买毒药成分:量化手机使用代理的现实世界滥用

Yiming Sun, Chen Chen, Zifan Zhou, Mi Zhang

机构 * Fudan University(复旦大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 研究手机使用代理在真实设备与商业应用中的恶意滥用,发现主流模型拒绝率低、任务完成率高,甚至能欺骗医生获取毒药前体,揭示安全意识-执行差距。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27883 2026-06-29 cs.RO 新提交 57%

Swarm sign language: motion-based communication between drones

群体手语:基于运动的无人机间通信

Thomas Rey, Julien Moras, Alexandre Eudes, Antoine Manzanera

机构 * DTIS, ONERA, Université Paris-Saclay(法国国家航空航天研究机构ONERA,巴黎-萨克雷大学) U2IS, ENSTA, Institut Polytechnique de Paris(巴黎综合理工学院,ENSTA)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 针对隐身约束下的群体机器人,提出利用模块化平面轨迹作为视觉信号进行运动通信,设计3DTrajDecoder解码器实现轨迹分类与分割,并通过在线程序生成管道训练,经真实测试与仿真验证系统有效性。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23686 2026-06-29 cs.RO 新提交 57%

LIBERO-Safety: A Comprehensive Benchmark for Physical and Semantic Safety in Vision-Language-Action Models

LIBERO-Safety:视觉-语言-动作模型中物理与语义安全的综合基准

Rongxu Cui, Zongzheng Zhang, Jingrui Pang, Haohan Chi, Jinbang Guo, Saining Zhang, Shaoxuan Xie, Xin Jin, Yao Mu, Jiaolong Yang, Guocai Yao, Xianyuan Zhan, Ya-Qin Zhang, Hao Zhao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Beijing Academy of Artificial Intelligence (BAAI)(北京智源人工智能研究院) Beihang University(北京航空航天大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学) Shanghai Jiao Tong University(上海交通大学) Microsoft Research Asia (MSRA)(微软亚洲研究院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 针对视觉-语言-动作模型操作安全未验证的问题,提出参数化安全基准和关键帧驱动数据生成流水线,构建大规模无碰撞数据集,系统评估八种模型,揭示泛化-安全张力。

Comments Accepted by ECCV 2026, Project Page: https://libero-safety.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27375 2026-06-26 cs.RO 新提交 57%

Scalable Behavior Cloning with Open Data, Training, and Evaluation

基于开放数据、训练和评估的可扩展行为克隆

Arthur Allshire, Himanshu Gaurav Singh, Ritvik Singh, Adam Rashid, Hongsuk Choi, David McAllister, Justin Yu, Yiyuan Chen, Huang Huang, Pieter Abbeel, Xi Chen, Rocky Duan, Phillip Isola, Jitendra Malik, Fred Shentu, Guanya Shi, Philipp Wu, Angjoo Kanazawa

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 提出ABC开源行为克隆栈,包含最大遥操作数据集ABC-130K(3500小时/13万片段/195任务),并开源硬件、训练和仿真流程,通过协同训练实现仿真与真实评估关联,验证DiT和VLA模型设计,成功执行折纸盒、取信用卡等灵巧任务。

Comments 30 pages. Project page: https://abc.bot

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26829 2026-06-26 cs.CV 新提交 57%

Identifying the Unknown: Prompt-Free Open Vocabulary Anomaly Recognition for Robot-Object Interaction

识别未知:面向机器人-物体交互的无提示开放词汇异常识别

Philipp Allgeuer, Jan-Gerrit Habekost, Stefan Wermter

机构 * University of Hamburg(汉堡大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 提出AnomNOVIC框架,结合掩码自编码器与无提示开放词汇分类器,实现机器人对未知物体的实时识别,在多个数据集上显著超越现有基线。

Comments International Conference on Artificial Neural Networks 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25880 2026-06-25 cs.CV 新提交 57%

USS: Unified Spatial-Semantic Prompts for Embodied Visual Tracking with Latent Dynamics Learning

USS: 面向具身视觉跟踪的统一空间-语义提示与潜在动力学学习

Yuchen Xie, Xinyu Zhou, Kuangji Zuo, Yanshuo Lu, Fengrui Huang, Boyu Ma, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 提出统一空间-语义提示范式替代纯文本目标指示,设计端到端框架USS支持多种提示类型,通过潜在世界模型提升时序鲁棒性,在真实机器人实验中优于纯文本方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25782 2026-06-25 cs.CL cs.AI 新提交 57%

Do Encoders Suffice? A Systematic Comparison of Encoder and Decoder Safety Judges for LLM Adversarial Evaluation

编码器足够吗?用于LLM对抗性评估的编码器与解码器安全评判器的系统比较

Han Jeon, Shiv Medler, Joseph Voyles, Matt Wood

机构 * PricewaterhouseCoopers(普华永道)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 系统比较ModernBERT系列编码器分类器与基于LLM的解码器评判器在识别有害LLM输出上的性能,发现编码器可在保持低延迟和低成本的同时接近LLM评判器的效果。

Comments 13 pages, 5 figures, Accepted into ICANN2026

详情

展开后加载摘要…

URL PDF HTML 收藏