arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-10 至 2026-04-10 共收录 68 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 17 篇

2604.07502 2026-04-10 cs.SE cs.AI 57%

Beyond Human-Readable: Rethinking Software Engineering Conventions for the Agentic Development Era

超越人类可读性:为代理开发时代重新思考软件工程惯例

Dmytro Ustynov

机构 * Military Institute of Telecommunications and Information Technologies (MITIT)(军事电信与信息技术研究所)

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 本文探讨代理开发时代软件工程惯例的变革,提出语义密度优化原则,通过实验验证压缩对开发成本的影响,并提出程序骨架概念和语义意图与可读性分离的主张。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13662 2026-04-10 cs.RO 57%

Iteratively Learning Muscle Memory for Legged Robots to Master Adaptive and High Precision Locomotion

迭代学习肌肉记忆:为四足机器人掌握适应性和高精度运动

Jing Cheng, Yasser G. Alqaham, Zhenyu Gan, Amit K. Sanyal

机构 * Department of Mechanical and Aerospace Engineering, Syracuse University(雪城大学机械与航空航天工程系)

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 本文提出了一种可扩展且适应性强的控制框架,结合迭代学习控制与生物启发的扭矩库,提升机器人在动态和外部干扰下的轨迹跟踪精度。通过存储学习的控制配置,实现快速适应速度、地形和重力变化,减少在线计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22258 2026-04-10 cs.LG cs.SY eess.IV eess.SY stat.ML 57%

LipKernel: Lipschitz-Bounded Convolutional Neural Networks via Dissipative Layers

LipKernel:通过耗散层实现具有Lipschitz界限制的卷积神经网络

Patricia Pauli, Ruigang Wang, Ian Manchester, Frank Allgöwer

机构 * Department of Mechanical Engineering, Eindhoven University of Technology(埃因霍温理工大学机械工程系) Institute for Systems Theory and Automatic Control, University of Stuttgart(斯图加特大学系统理论与自动控制研究所) Australian Centre for Robotics and School of Aerospace, Mechanical and Mechatronic Engineering, The University of Sydney(悉尼大学澳大利亚机器人中心及航空航天、机械与机电工程学院)

专题命中 具身导航 :robotics(abstract);分类 cs.LG

AI总结 本文提出了一种新的卷积神经网络参数化方法,通过强制设定Lipschitz界来确保鲁棒性。该方法利用线性矩阵不等式(LMI)保证耗散性,并在数值实验中展示出比傅里叶域参数化方法快多个数量级的运行速度。

Journal ref Automatica 188 (2026): 112959

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11724 2026-04-10 cs.SE 50%

WebTestPilot: Agentic End-to-End Web Testing against Natural Language Specification by Inferring Oracles with Symbolized GUI Elements

WebTestPilot: 通过符号化GUI元素推断或acles实现基于自然语言规范的端到端Web测试

Xiwen Teoh, Yun Lin, Duc-Minh Nguyen, Ruofei Ren, Wenjie Zhang, Jin Song Dong

专题命中 具身导航 :navigation(abstract)

AI总结 WebTestPilot通过符号化GUI元素推断隐式或acles,解决自然语言规范下的端到端Web测试中的隐式或acles推断和概率推理挑战,实现99%的任务完成率和高精度召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 5 篇

2509.01878 2026-04-10 cs.RO cs.CV cs.LG 82%

AI-Driven Marine Robotics: Emerging Trends in Underwater Perception and Ecosystem Monitoring

AI驱动的海洋机器人:水下感知与生态系统监测的新兴趋势

Scarlett Raine, Tobias Fischer

专题命中 具身推理 :robotics(title,abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文探讨了气候变暖背景下,AI在水下感知与生态系统监测中的应用发展,分析了环境需求、公民科学平台和研究人员迁移等因素推动的AI创新,展示了弱监督学习、开放集识别和鲁棒感知等技术的进展。

Comments 9 pages, 3 figures, Accepted for Oral Presentation at AAAI Conference on Artificial Intelligence 2026

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40 (2026), 40981-40989

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08226 2026-04-10 cs.AI cs.HC cs.SY eess.SY 79%

Grounding Clinical AI Competency in Human Cognition Through the Clinical World Model and Skill-Mix Framework

通过临床世界模型和技能混合框架在人类认知中奠定临床AI能力

Seyed Amir Ahmad Safavi-Naini, Elahe Meftah, Josh Mohess, Pooya Mohammadi Kazaj, Georgios Siontis, Zahra Atf, Peter R. Lewis, Mauricio Reyes, Girish Nadkarni, Roland Wiest, Stephan Windecker, Christoph Grani, Ali Soroush, Isaac Shiri

机构 * Department of Cardiology, Inselspital, Bern University Hospital, University of Bern(伯尔尼大学医院心脏病学系,伯尔尼大学) Department of Digital Medicine, Bern University Hospital, University of Bern(伯尔尼大学医院数字医学系,伯尔尼大学) Division of Data-Driven and Digital Medicine (D3M), Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院数据驱动与数字医学部) Clinical Research Development Center, Amir Oncology Teaching Hospital, Shiraz University of Medical Sciences(设拉子医科大学阿米尔肿瘤教学医院临床研究发展中心) Graduate School for Cellular and Biomedical Sciences, University of Bern(伯尔尼大学细胞与生物医学研究生院) Faculty of Business and Information Technology, Ontario Tech University(安大略理工大学商业与信息技术学院) Department of Radiation Oncology, Inselspital, Bern University Hospital and University of Bern(伯尔尼大学医院放射肿瘤学系,伯尔尼大学) ARTORG Center for Biomedical Engineering Research, University of Bern(伯尔尼大学ARTORG生物医学工程研究中心) The Charles Bronfman Institute of Personalised Medicine, Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院查尔斯·布朗夫曼个性化医学研究所) University Institute of Diagnostic and Interventional Neuroradiology, Inselspital, Bern University Hospital, University of Bern(伯尔尼大学医院诊断与介入神经放射学大学研究所,伯尔尼大学) Translational Imaging Center (TIC), Swiss Institute for Translational and Entrepreneurial Medicine(瑞士转化与创业医学研究所转化影像中心) Henry D. Janowitz Division of Gastroenterology, Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院亨利·D·雅诺维茨消化内科)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 本文提出临床世界模型和技能混合框架,通过八维定义临床能力空间,为AI在医疗场景中的能力评估和验证提供结构化方法。

Comments Code, data (Clinical AI Skill-Mix dimension specifications), and an exploratory dashboard are available at https://github.com/Sdamirsa/Clinical-World-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07712 2026-04-10 cs.LG 79%

CausalVAE as a Plug-in for World Models: Towards Reliable Counterfactual Dynamics

CausalVAE作为世界模型的插件:迈向可靠的反事实动力学

Ziyi Ding, Xianxin Lai, Weiyu Chen, Xiao-Ping Zhang, Jiayu Chen

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The University of Hong Kong(香港大学) INFIFORCE Intelligent Technology(INFIFORCE智能科技)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 本文提出CausalVAE作为潜在世界模型的插件模块,通过增强事实预测和反事实检索,提升模型在分布偏移和干预下的鲁棒性,尤其在物理基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07758 2026-04-10 cs.CV cs.AI 73%

DailyArt: Discovering Articulation from Single Static Images via Latent Dynamics

DailyArt: 从单张静态图像中通过潜在动态发现关节

Hang Zhang, Qijian Tian, Jingyu Gong, Daoguo Dong, Xuhong Wang, Yuan Xie, Xin Tan

专题命中 具身推理 :embodied AI(abstract);world model(abstract);分类 cs.AI、cs.CV

AI总结 DailyArt通过合成介导推理解决单张图像中关节估计问题,无需多视角输入或显式部分标注,实现关节参数同时恢复和部分级新状态合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10723 2026-04-10 cs.LG 57%

Generalized Spherical Neural Operators: Green's Function Formulation

广义球面神经算子:格林函数公式

Hao Tang, Hao Chen, Chao Li

机构 * University of Dundee, United Kingdom(英国邓迪大学) University of Cambridge, United Kingdom(英国剑桥大学)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 本文提出基于可设计球面格林函数及其谐波展开的广义算子设计框架,提出适应非等变系统的GSNO算子,结合多尺度谱模型与球面上下采样构建SHNet,实验证明其在扩散磁共振成像、浅水动力学和全球天气预测中优于现有方法。

Comments ICLR 2026 (International Conference on Learning Representations)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 3 篇

2512.09928 2026-04-10 cs.RO 77%

HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models

HiF-VLA:通过运动表示实现视觉-语言-动作模型的回顾、洞察与前瞻性

Minghui Lin, Pengxiang Ding, Shu Wang, Zifeng Zhuang, Yang Liu, Xinyang Tong, Wenxuan Song, Shangke Lyu, Siteng Huang, Donglin Wang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) HKUST(GZ)(香港科技大学(广州)) Nanjing University(南京大学) Westlake Robotics(西湖机器人)

专题命中 机器人基础模型 :manipulation(abstract);world model(abstract);robotic(abstract);分类 cs.RO

AI总结 HiF-VLA通过运动表示提升视觉-语言-动作模型的时序推理能力,采用回顾、洞察和前瞻性机制,在长时域任务中表现优异,且推理延迟低。

Comments CVPR 2026, Project page: https://hifvla.github.io, Github: https://github.com/OpenHelix-Team/HiF-VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07430 2026-04-10 cs.CV 57%

HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents

HY-Embodied-0.5:面向现实世界代理的具身基础模型

Tencent Robotics X, HY Vision Team, :, Xumin Yu, Zuyan Liu, Ziyi Wang, He Zhang, Yongming Rao, Fangfu Liu, Yani Zhang, Ruowen Zhao, Oran Wang, Yves Liang, Haitao Lin, Minghui Wang, Yubo Dong, Kevin Cheng, Bolin Ni, Rui Huang, Han Hu, Zhengyou Zhang, Linus, Shunyu Yao

机构 * Tencent Robotics X(腾讯机器人X实验室) HY Vision Team(HY视觉团队)

专题命中 机器人基础模型 :embodied agent(abstract);分类 cs.CV

AI总结 本文提出HY-Embodied-0.5,旨在提升现实世界代理的具身智能能力,通过混合Transformer架构和迭代自演化训练方法,实现高效和强大的模型变体,验证了其在多个基准测试中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12710 2026-04-10 cs.RO 57%

Reflection-Based Task Adaptation for Self-Improving VLA

基于反射的任务适应用于自我改进的VLA

Baicheng Li, Dong Wu, Zike Yan, Xinchen Liu, Lusong Li, Zecui Zeng, Hongbin Zha

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) JD Explore Academy(京东探索研究院) AIR, Tsinghua University(清华大学智能产业研究院)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 本文提出反射式自我适应框架,通过双路径架构实现快速自主任务适应,结合失败驱动的强化学习与成功驱动的质量引导微调,提升机器人在复杂任务中的适应效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 2 篇

2604.07426 2026-04-10 cs.LG cs.AI 66%

GIRL: Generative Imagination Reinforcement Learning via Information-Theoretic Hallucination Control

GIRL:通过信息论幻觉控制实现生成性想象强化学习

Prakul Sunil Hiremath

机构 * Department of Computer Science and Engineering, Visvesvaraya Technological University (VTU), Belagavi, India(维斯瓦拉亚科技大学计算机科学与工程系,贝拉加维,印度) Aliens on Earth (AoE) Autonomous Research Group, Belagavi, India(地球外星人自主研究组,贝拉加维,印度)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG;world model(comments)

AI总结 GIRL通过引入跨模态锚定信号和不确定性适应信任区域瓶颈,解决模型误差累积导致的轨迹漂移问题,提升长周期任务的样本效率和回报性能。

Comments 20 pages, 2 figures, 7 tables; reinforcement learning, world models

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21872 2026-04-10 cs.AI 57%

WebArbiter: A Principle-Guided Reasoning Process Reward Model for Web Agents

WebArbiter: 一种基于原则的推理过程奖励模型用于网络代理

Yao Zhang, Shijie Tang, Zeyu Li, Zhen Han, Volker Tresp

机构 * LMU Munich(慕尼黑大学) Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 本文提出WebArbiter,一种基于原则的推理过程奖励模型,用于网络导航任务。该模型通过文本生成产生结构化的解释,以指导任务完成。通过两阶段训练流程,提升模型的泛化能力,并在WebPRMBench基准测试中优于现有方法。

Comments Published as a conference paper at ICLR 2026. Extended version with additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 人机交互与遥操作 4 篇

2401.03398 2026-04-10 cs.CY cs.RO 83%

Amplifying robotics capacities with a human touch: An immersive low-latency panoramic remote system

用人类的温度放大机器人能力:一种沉浸式低延迟全景远程系统

Junjie Li, Kang Li, Dewei Han, Jian Xu, Zhaoyuan Ma

专题命中 人机交互与遥操作 :robotics(title,abstract);navigation(abstract);分类 cs.RO

AI总结 本文提出了一种沉浸式低延迟全景人机交互平台,通过边缘计算和全景视频设备实现远距离机器人控制,结合视觉SLAM技术提升自主导航能力,提升人机协作效率与体验。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29907 2026-04-10 cs.CR 82%

Security and Privacy in Virtual and Robotic Assistive Systems: A Comparative Framework

虚拟与机器人辅助系统中的安全与隐私:一种比较框架

Nelly Elsayed

专题命中 人机交互与遥操作 :robotic(title,abstract);manipulation(abstract)

AI总结 本文比较分析了虚拟和机器人辅助系统在安全与隐私方面的挑战,提出统一的威胁建模框架,并提供设计建议以开发安全、隐私保护和可信的辅助技术。

Comments The paper has been accepted in the 3rd International Conference on Intelligent Systems, Blockchain, and Communication Technologies (ISBCom) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25044 2026-04-10 cs.RO 74%

ThermoAct:Thermal-Aware Vision-Language-Action Models for Robotic Perception and Decision-Making

ThermoAct:面向机器人感知与决策的热感知视觉-语言-动作模型

Young-Chae Son, Dae-Kwan Ko, Yoon-Ji Choi, Soo-Chul Lim

机构 * Dongguk University(东国大学)

专题命中 人机交互与遥操作 :robotic(title);分类 cs.RO

AI总结 本文提出一种融合热信息的视觉-语言-动作框架,通过高阶规划器解析自然语言指令并分解为子任务,提升机器人复杂操作的执行效率与安全性。

Comments 2026 RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07751 2026-04-10 eess.SY cs.MA cs.SY 50%

Learning to Coordinate over Networks with Bounded Rationality

在有界理性下学习协调网络

Zhewei Wang, Emrah Akyol, Marcos M. Vasconcelos

专题命中 人机交互与遥操作 :robotics(abstract)

AI总结 研究有界理性代理在二元 stag hunt 游戏中的协调行为,证明在有界理性参数下,协调状态的平稳概率随连接度增加而增加,并发现最优网络结构为均匀连接的 K-正则网络。

Comments To be submitted to the IEEE Transactions on Automatic Control

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 机器人数据与评测 13 篇

2604.07991 2026-04-10 cs.CV cs.MM 83%

MotionScape: A Large-Scale Real-World Highly Dynamic UAV Video Dataset for World Models

MotionScape: 一个大规模真实世界高动态无人机视频数据集用于世界模型

Zile Guo, Zhan Chen, Enze Zhu, Kan Wei, Yongkang Zou, Xiaoxuan Liu, Lei Wang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) Jilin University(吉林大学)

专题命中 机器人数据与评测 :world model(title,abstract);navigation(abstract);分类 cs.CV

AI总结 MotionScape提供高动态无人机视频数据,用于提升世界模型对复杂3D动态的模拟能力,通过语义和几何对齐的标注提升无人机自主导航与决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07705 2026-04-10 cs.RO 79%

Vision-Language Navigation for Aerial Robots: Towards the Era of Large Language Models

面向大语言模型时代的空中机器人视觉-语言导航

Xingyu Xia, Lekai Zhou, Yujie Tang, Xiaozhou Zhu, Hai Zhu, Wen Yao

机构 * Defense Innovation Institute, Chinese Academy of Military Sciences(军事科学院国防创新研究院) Intelligent Game and Decision Laboratory(智能博弈与决策实验室) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院)

专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.RO

AI总结 本文综述了空中机器人视觉-语言导航领域,分析了大语言模型与视觉-语言模型的整合,归纳了五类架构方法,指出了评估体系的不足,并提出了七个开放性问题。

Comments 28 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08418 2026-04-10 cs.RO cs.AI 73%

Exploring Temporal Representation in Neural Processes for Multimodal Action Prediction

探索神经过程在多模态动作预测中的时间表示

Marco Gabriele Fedozzi, Yukie Nagai, Francesco Rea, Alessandra Sciutti

机构 * DIBRIS Department, University of Genoa(热那亚大学DIBRIS系) CONTACT Unit, Italian Institute of Technology(意大利理工学院CONTACT单元) International Research Center for Neurointelligence, The University of Tokyo(东京大学国际神经智能研究中心)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文研究了条件神经过程在机器人自监督多模态动作预测中的应用,提出改进的DMBN-PTE模型以提升时间信息表示的鲁棒性。

Comments Submitted to the AIC 2023 (9th International Workshop on Artificial Intelligence and Cognition)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08509 2026-04-10 cs.CV cs.RO 62%

Visually-grounded Humanoid Agents

基于视觉的人形代理

Hang Ye, Xiaoxuan Ma, Fan Lu, Wayne Wu, Kwan-Yee Lin, Yizhou Wang

机构 * Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Tongji University(同济大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of Michigan(密歇根大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 本文提出基于视觉的人形代理,通过两层架构实现自主行为,解决数字人主动行为在新环境中的问题,提升任务成功率和减少碰撞。

Comments Project page: https://alvinyh.github.io/VGHuman/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07728 2026-04-10 cs.CV cs.GR cs.RO 62%

GEAR: GEometry-motion Alternating Refinement for Articulated Object Modeling with Gaussian Splatting

GEAR: 基于高斯点划法的几何-运动交替优化用于关节物体建模

Jialin Li, Bin Fu, Ruiping Wang, Xilin Chen

机构 * Key Laboratory of AI Safety of Chinese Academy of Sciences (CAS), Institute of Computing Technology, CAS(中国科学院人工智能安全重点实验室,中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 GEAR通过交替优化几何与运动,提升关节物体重建的精度和泛化能力,尤其在复杂多关节物体上表现优异。

Comments Accepted to CVPRF2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20231 2026-04-10 cs.RO cs.CV 62%

UniLACT: Depth-Aware RGB Latent Action Learning for Vision-Language-Action Models

UniLACT:基于深度的RGB潜在动作学习用于视觉-语言-动作模型

Manish Kumar Govind, Dominick Reilly, Pu Wang, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 UniLACT通过引入深度感知的潜在预训练,提升视觉-语言-动作模型的空间先验能力,实验表明其在模拟和现实任务中优于基于RGB的潜在动作方法。

Comments https://manishgovind.github.io/unilact-vla/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07799 2026-04-10 cs.CV cs.RO 62%

Horticultural Temporal Fruit Monitoring via 3D Instance Segmentation and Re-Identification using Colored Point Clouds

通过彩色点云进行3D实例分割与重识别的园艺时间水果监测

Daniel Fusaro, Federico Magistri, Jens Behley, Alberto Pretto, Cyrill Stachniss

机构 * University of Padua(帕多瓦大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习和人工智能研究所)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出利用彩色点云进行3D水果实例分割与重识别的方法,通过学习模型和注意力匹配网络实现动态果园中水果的准确监测。

Journal ref Computers and Electronics in Agriculture, Volume 247, Pages 111723, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08455 2026-04-10 cs.AI 57%

KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation

KnowU-Bench: 向交互式、主动式和个性化移动代理评估迈进

Tongbo Chen, Zhengxi Lu, Zhan Xu, Guocheng Shao, Shaohan Zhao, Fei Tang, Yong Du, Kaitao Song, Yizhou Liu, Yuchen Yan, Wenqi Zhang, Xu Tan, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Apple(苹果公司) Tencent(腾讯)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 KnowU-Bench通过Android仿真环境评估个性化移动代理,涵盖42个通用GUI任务、86个个性化任务和64个主动任务,验证代理在交互中获取用户偏好和主动干预的能力,发现前沿模型在模糊指令下表现下降,揭示偏好获取和干预校准的关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08184 2026-04-10 cs.SD cs.AI 57%

AT-ADD: All-Type Audio Deepfake Detection Challenge Evaluation Plan

AT-ADD:所有类型音频深度伪造检测挑战评估计划

Yuankun Xie, Haonan Cheng, Jiayi Zhou, Xiaoxuan Guo, Tao Wang, Jian Liu, Weiqiang Wang, Ruibo Fu, Xiaopeng Wang, Hengyan Huang, Xiaoying Huang, Long Ye, Guangtao Zhai

机构 * Communication University of China(中国传媒大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Institute of Technology(北京理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 针对现有音频深度伪造检测方法在鲁棒性和泛化能力上的不足,AT-ADD挑战旨在通过标准化数据集和评估协议提升音频伪造检测的实用性和鲁棒性。

Comments Accepted to the ACM Multimedia 2026 Grand Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07901 2026-04-10 cs.CV 57%

PanoSAM2: Lightweight Distortion- and Memory-aware Adaptions of SAM2 for 360 Video Object Segmentation

PanoSAM2:轻量级的失真和内存感知的SAM2改进用于360视频对象分割

Dingwen Xiao, Weiming Zhang, Shiqi Wen, Lin Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 本文提出PanoSAM2,通过改进SAM2以应对360视频中的失真和内存问题,提升分割可靠性,同时保持用户友好的提示设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07882 2026-04-10 cs.CV 57%

ReconPhys: Reconstruct Appearance and Physical Attributes from Single Video

ReconPhys:从单个视频中重建外观和物理属性

Boyuan Wang, Xiaofeng Wang, Yongkang Li, Zheng Zhu, Yifan Chang, Angen Ye, Guosheng Zhao, Chaojun Ni, Guan Huang, Yijie Ren, Yueqi Duan, Xingang Wang

机构 * GigaAI Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出ReconPhys,首个能从单目视频联合学习物理属性估计和3D高斯点云重建的端到端框架,实现快速高效的目标检测与生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07759 2026-04-10 cs.CV 57%

WUTDet: A 100K-Scale Ship Detection Dataset and Benchmarks with Dense Small Objects

WUTDet: 一艘船检测数据集和基准测试,包含10万尺度的密集小物体

Junxiong Liang, Mengwei Bao, Tianxiang Wang, Xinggang Wang, An-An Liu, Ryan Wen Liu

机构 * School of Navigation, Wuhan University of Technology(武汉理工大学航运学院) Sanya Science and Education Innovation Park, Wuhan University of Technology(武汉理工大学三亚科教创新园) School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 本文提出WUTDet数据集,包含10万张图像和38万艘船实例,涵盖港口、锚地等多种场景,评估了20种基线模型,发现Transformer在复杂海上场景中表现更优,CNN在推理效率上更胜一筹,Mamba在准确性和效率之间取得良好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏