arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 1546 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 263 篇

2602.12691 2026-06-23 cs.RO cs.AI 版本更新 62%

ALOE: Action-Level Off-Policy Evaluation for Vision-Language-Action Model Post-Training

ALOE: 面向视觉-语言-动作模型后训练的动作级离策略评估

Rushuai Yang, Hecheng Wang, Zhichao Wu, Chiming Liu, Xiaohan Yan, Xuan Du, Shuoyu Yue, Chuheng Zhang, Yunlong Wang, Yongcheng Liu, Lizhe Qi, Yi Chen, Wei Shan, Maoqing Yao

机构 * AgiBot The Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学) Nanjing University(南京大学) Independent Researcher(独立研究者)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出ALOE框架,通过离策略评估直接估计当前策略的价值,结合分块时序差分和保守值聚合,改善稀疏奖励下的信用分配,在四项真实世界操作任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20002 2026-06-18 cs.CV cs.AI cs.CR 版本更新 62%

Semantic Router: On the Feasibility of Hijacking MLLMs via a Single Adversarial Perturbation

语义路由器:通过单一对抗扰动劫持多模态大语言模型的可行性研究

Changyue Li, Jiaying Li, Youliang Yuan, Jiaming He, Zhicong Huang, Pinjia He

机构 * The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) School of Data Science, School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(数据科学学院、人工智能学院、香港中文大学(深圳))

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 提出语义感知通用扰动(SAUP),作为语义路由器同时劫持多个无状态决策,通过理论分析和SORT优化策略实现,在Qwen上对五个目标达到66%攻击成功率。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25937 2026-06-17 cs.RO cs.LG 版本更新 62%

Can Vision Foundation Models Navigate? Zero-Shot Real-World Evaluation and Lessons Learned

视觉基础模型能否导航?零样本真实世界评估与经验教训

Maeva Guerrier, Karthik Soma, Jana Pavlasek, Giovanni Beltrame

机构 * Polytechnique Montreal(蒙特利尔理工学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.LG

AI总结 本文对五种视觉导航模型在真实环境中进行零样本评估,发现其存在几何理解不足、感知混淆和分布漂移等系统性问题,并公开评估代码与数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05876 2026-06-16 cs.CV cs.RO 版本更新 62%

Systematic Evaluation of Novel View Synthesis for Video Place Recognition

面向视频地点识别的合成新视角系统性评估

Muhammad Zawad Mahmud, Samiha Islam, Damian Lyons

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 系统评估合成新视角对视频地点识别的影响,发现少量合成视角可提升识别性能,且视角变化幅度不如添加数量和图像类型重要。

Comments Submitted to IEEE IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08102 2026-06-11 cs.RO cs.AI cs.MA 版本更新 62%

Continual Quadruped Robots Coordination via Semantic Skill Discovery

通过语义技能发现实现持续四足机器人协调

Daoqing Wang, Yuchen Xiao, Weixuan Huang, Zhilong Zhang, Shenghua Wan, Meng Li, Lei Yuan, Yang Yu

机构 * National Key Laboratory of Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家重点实验室,南京大学,南京,中国) School of Artificial Intelligence, Nanjing University, Nanjing, China(人工智能学院,南京大学,南京,中国) Polixir Technologies, Nanjing, China(南京极智科技有限公司)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出Conquer框架,通过语义技能库实现多四足机器人在持续学习任务中的协调,避免灾难性遗忘,最终平均成功率95.6%。

Comments 22 pages, 8 figures, 11 tables. Project page: https://conquer-project.pages.dev/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06997 2026-06-10 cs.RO cs.CV 版本更新 62%

ObjSplat: Geometry-Aware Gaussian Surfels for Active Object Reconstruction

ObjSplat: 几何感知的高斯面元用于主动物体重建

Yuetao Li, Zhizhou Jia, Yu Zhang, Qun Hao, Shaohui Zhang

机构 * School of Optics and Photonics, Beijing Institute of Technology(光学与光子学学院,北京理工大学) School of Optoelectronic Engineering, Changchun University of Science and Technology(光电工程学院,长春理工大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 提出ObjSplat框架,利用高斯面元统一表示,通过几何感知视点评估和下一最佳路径规划器,实现高效高保真的主动物体重建。

Comments Accepted to IEEE T-ASE. Code: https://github.com/Li-Yuetao/ObjSplat , Project Page: https://li-yuetao.github.io/ObjSplat-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01478 2026-06-09 cs.RO cs.AI cs.MA cs.SY eess.SY 版本更新 62%

Crazyflow: An Accurate, GPU-Accelerated, Differentiable Drone Simulator in JAX

Crazyflow: 基于JAX的精确、GPU加速、可微分的无人机模拟器

Martin Schuck, Marcel P. Rath, Yufei Hua, Abhishek Goudar, SiQi Zhou, Angela P. Schoellig

机构 * Technical University of Munich(慕尼黑技术大学) University of Toronto(多伦多大学) Simon Fraser University(西蒙弗雷泽大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 提出Crazyflow模拟器,通过GPU加速和可微分设计,实现单机超高速仿真、数千架无人机集群模拟,并支持基于解析梯度的策略学习与采样避障,甚至能在0.38秒内从零训练飞行恢复策略。

Comments Fix minor metadata mistakes

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04249 2026-07-30 cs.RO 版本更新 61%

Can Context Bridge the Reality Gap? Sim-to-Real Transfer of Context-Aware Policies

上下文能否弥合现实差距?情境感知策略的模拟到现实迁移

Marco Iannotta, Yuxuan Yang, Johannes A. Stork, Erik Schaffernicht, Todor Stoyanov

机构 * AASS Research Centre, Örebro University(奥雷布罗大学AASS研究中心) Technology Transfer Center Kitzingen, Technical University of Applied Sciences Würzburg-Schweinfurt(基廷根技术转移中心,沃尔夫斯堡-施维林应用技术大学)

专题命中 机器人数据与评测 :robotics(abstract,journal_ref);分类 cs.RO

AI总结 研究机器人强化学习中模拟到现实迁移难题,核心方法是将上下文估计模块集成到基于领域随机化的强化学习框架并比较监督策略,主要贡献是情境感知策略在多任务中优于无上下文基线。

Journal ref Robotics and Autonomous Systems, Volume 205, 2026, 105594

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07751 2026-07-13 cs.CV eess.IV 版本更新 61%

On Motion Blur and Deblurring in Visual Place Recognition

视觉场所识别中的运动模糊与去模糊

Timur Ismagilov, Bruno Ferrarini, Michael Milford, Tan Viet Tuyen Nguyen, SD Ramchurn, Shoaib Ehsan

机构 * School of Electronics and Computer Science, University of Southampton(苏塞克斯大学电子与计算机科学学院) MyWay srl(MyWay公司) QUT Centre for Robotics, School of Electrical Engineering and Robotics(昆士兰大学机器人中心,电气工程与机器人学院) School of Computer Science and Electronic Engineering, University of Essex(埃塞克斯大学计算机科学与电子工程学院)

专题命中 机器人数据与评测 :robotics(abstract,comments);分类 cs.CV

AI总结 研究视觉场所识别中运动模糊及去模糊影响,引入新基准评估,含三个数据集。通过多种方法实验,揭示运动模糊影响与去模糊效果,进而提出VPR自适应去模糊策略,为动态现实场景管理运动模糊提供新途径。

Comments Accepted to IEEE Robotics & Automation Letters

Journal ref Volume: 10, Issue: 5, May 2025, Pages 4746 - 4753

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14428 2026-06-18 cs.RO 版本更新 61%

Odyssey: An Automotive Lidar-Inertial Odometry Dataset with GNSS-denied situations

Odyssey:一种面向GNSS拒止场景的汽车激光雷达-惯性里程计数据集

Aaron Kurda, Simon Steuernagel, Lukas Jung, Marcus Baum

机构 * University of Göttingen(哥廷根大学) iMAR Navigation(iMAR导航)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO;robotics(comments)

AI总结 提出Odyssey数据集,采用导航级环形激光陀螺仪RTK/INS提供高精度真值,包含36个序列和长时间GNSS拒止环境(隧道、室内停车场),用于评估LIO/SLAM系统。

Comments 10 pages, 4 figures, 3 tables, submitted to International Journal of Robotics Research (IJRR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12313 2026-08-19 cs.CV cs.CL 版本更新 57%

AVA-Encoder: Towards Agent-Native Video Representation Learning

AVA-Encoder:面向智能体原生的视频表示学习

Chuyue Li, Jinpeng Yu, Haozhe Wang, Tian Xueyun, Zhijing Zhang, Bingnan Li, Shuqi Gu, Kan Ren, Jiaming Liu, Ruihua Huang

机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务部) ShanghaiTech University(上海科技大学) The Hong Kong University of Science and Technology(香港科技大学) Institute of Computing Technology(中国科学院计算技术研究所) Southeast University(东南大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 针对创意智能体缺乏从高质量电影学习的有效方式的问题,提出AVA-Encoder框架,其视频表示经重构优化后,在相关基准上性能优于现有方法,还发布了配套框架、基准及数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17013 2026-08-19 cs.CV 版本更新 57%

Toward Universal Skeleton-Based Action Recognition across Heterogeneous Skeletons and Open Vocabularies

迈向通用的基于骨骼的动作识别

Jidong Kuang, Hongsong Wang, Jie Gui, Yuan Yan Tang, James Tin-Yau Kwok

机构 * School of Cyber Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,南京,中国) School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,南京,中国)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出了一种基于Transformer的模型,通过统一骨骼表示、动作编码器和多粒度动作-文本对齐,解决异构骨骼动作识别的挑战,实验验证了方法的有效性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11534 2026-08-19 cs.CV 版本更新 57%

Risk-Controllable Multi-View Diffusion for Driving Scenario Generation

可控风险多视角扩散用于驾驶场景生成

Hongyi Lin, Wenxiu Shi, Heye Huang, Dingyi Zhuang, Song Zhang, Yang Liu, Xiaobo Qu, Jinhua Zhao

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 RiskMV-DPO通过整合风险水平与物理风险建模,实现可控风险的多视角驾驶场景生成,提升3D检测性能并减少FID,推动安全导向的具身智能发展。

Comments 10 pages, 4 figures; accepted at the CVPR 2026 Workshop on Video Generative Models: Benchmarks and Evaluation (VGBE). Updated to the complete camera-ready version

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20182 2026-08-19 cs.CL cs.AI 版本更新 57%

Beyond BFI: The CSI for Enhanced Reliability and Validity in Evaluating LLM Personality Traits

超越BFI:用于增强评估LLM人格特质可靠性与有效性的CSI

Huanhuan Ma, Haisong Gong, Xiaoyuan Yi, Xing Xie, Philip S. Yu, Dongkuan Xu

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI

AI总结 针对现有LLM人格特质评估工具BFI的可靠性与有效性局限,提出适配LLM的CSI,经实验验证其可靠性更高、与模型真实输出相关性超0.85,能有效评估LLM人格特质。

Comments Code available via https://github.com/dependentsign/CSI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11216 2026-08-18 cs.AI 版本更新 57%

AutoWorldModel-Bench: A State-Centric Benchmark for Automated World-Model Research

AutoWorldModel-Bench:面向自动化世界模型研究的以状态为中心的基准

Marjan Moodi, Xuankang Zhu, Fernando De Mesentier Silva, Harold Chaput, Mohammad Reza Taesiri

机构 * Electronic Arts(美国艺电公司) Simon Fraser University(西蒙菲莎大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI

AI总结 AutoWorldModel-Bench是面向AI编码智能体的闭环基准,涵盖8个游戏环境,采用结构化状态表征,64次会话中多数智能体通过研究式修改改进了世界模型,可评估智能体的开放式研究能力。

Comments Project page: https://electronicarts.github.io/AutoWorldModelBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08860 2026-08-18 eess.SY cs.HC cs.RO cs.SY physics.med-ph 版本更新 57%

Preview-Based Relative-Motion Control of an Insertion Tool for Neural-Thread Placement in Pulsating Tissue

搏动组织中神经线程放置的插入工具的基于预览的相对运动控制

Yongyan Cao, Xiaobo Li

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 该研究针对搏动组织的神经线程放置,开发基于预览的相对运动控制器,经仿真验证可降低放置误差与接触剪切,提升QP求解可行性,在一定质量失配下保证稳定性,为后续硬件部署提供仿真基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12453 2026-08-18 cs.LG 版本更新 57%

Time-Correlated Video Bridge Matching

时间相关视频桥匹配

Viacheslav Vasilev, Arseny Ivanov, Nikita Gushchin, Maria Kovaleva, Alexander Korotin

机构 * Kandinsky Lab(Kandinsky实验室) Applied AI Institute(应用人工智能研究所) HSE University(高等经济大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 本文提出时间相关视频桥匹配框架,解决视频生成中时间相关序列建模问题,通过建模序列间依赖性和时间相关性,提升视频生成质量与重建精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00600 2026-08-18 cs.RO 版本更新 57%

I-Perceive: A Foundation Model for Active Perception with Language Instructions

I-Perceive:一种基于语言指令的主动感知基础模型

Yongxi Huang, Zhuohang Wang, Wenjing Tang, Xinyu He, Cewu Lu, Panpan Cai

机构 * Shanghai Innovation Institute(上海创新研究院) Beihang University(北京航空航天大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 I-Perceive是一种基于自然语言指令的主动感知基础模型,通过融合视觉-语言模型与几何基础模型,实现了对开放意图场景的有效感知与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03444 2026-08-18 cs.RO cs.SY eess.SY 版本更新 57%

PerFACT: Motion Policy with LLM-Powered Dataset Synthesis and Fusion Action-Chunking Transformers

PerFACT: 基于LLM驱动的数据集合成与融合动作分块变换器的运动策略

Davood Soleymanzadeh, Xiao Liang, Minghui Zheng

机构 * J. Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University(J. Mike Walker ’66机械工程系,德克萨斯A&M大学) Zachry Department of Civil and Environmental Engineering, Texas A&M University(Zachry土木与环境工程系,德克萨斯A&M大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 PerFACT通过LLM驱动的数据集合成和融合动作分块变换器,提升机械臂运动规划的泛化能力和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18898 2026-08-18 cs.CV cs.GR 版本更新 57%

GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling

GestureLSM:基于隐式捷径的时空建模语音同步手势生成

Pinxin Liu, Luchuan Song, Junhua Huang, Haiyang Liu, Junfan Zhu, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) University of Tokyo(东京大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.CV

AI总结 GestureLSM通过时空建模与改进的流匹配方法,在BEAT2数据集上实现了最优语音同步手势生成,同时大幅缩短推理时间,可用于增强数字人和具身智能体。

Comments Accepted to ICCV 2025. Project Page: https://andypinxinliu.github.io/GestureLSM

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10155 2026-08-17 eess.IV cs.CV 版本更新 57%

Data-driven registration and modeling of brain deformation for image-guided neurosurgery

数据驱动的图像配准与变形建模在图像引导神经外科中的应用:系统综述

Tiago Assis, Colin P. Galvin, Joshua P. Castillo, Nazim Haouchine, Marta Kersten-Oertel, Zeyu Gao, Mireia Crispin-Ortuzar, Stephen J. Price, Thomas Santarius, Yangming Ou, Sarah Frisken, Nuno C. Garcia, Alexandra J. Golby, Reuben Dorent, Ines P. Machado

机构 * LASIGE, Faculty of Sciences, University of Lisbon(里斯本大学科学学院LASIGE) Department of Neurosurgery and Department of Radiology, Brigham and Women's Hospital, Harvard Medical School(哈佛医学院布里洛妇女医院神经外科与放射科) Gina Cody School of Engineering and Computer Science, Concordia University(康科迪亚大学工程与计算机科学学院) Cancer Research UK Cambridge Centre, University of Cambridge(剑桥大学癌症研究英国中心) Department of Oncology, University of Cambridge(剑桥大学肿瘤科) Department of Clinical Neurosciences, University of Cambridge(剑桥大学临床神经科学系) Computational Health Informatics Program (CHIP) and Department of Radiology, Boston Children's Hospital, Harvard Medical School(哈佛医学院波士顿儿童医院计算健康信息学计划与放射科) Sorbonne Université, Institut du Cerveau - Paris Brain Institute - ICM(索邦大学巴黎脑研究所-ICM)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 系统综述2020-2025年间基于学习的脑变形补偿方法,包括深度学习配准、变形场回归、多模态对齐、切除感知架构及混合模型,指出当前方法在鲁棒性、标准化基准、可解释性和临床部署方面的局限,并展望未来研究方向。

Comments 41 pages, 7 figures, 9 tables. Final postprint version available in Medical Image Analysis at https://doi.org/10.1016/j.media.2026.104217

Journal ref Assis, T., et al. (2026). Data-driven registration and modeling of brain deformation for image-guided neurosurgery. Medical Image Analysis, 114, 104217

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04491 2026-08-17 cs.RO 版本更新 57%

Estimating Dynamic Soft Continuum Robot States From Boundaries

从边界估计动态软体连续体机器人的状态

Tongjia Zheng, Jessica Burgner-Kahrs

机构 * The Continuum Robotics Laboratory(连续机器人实验室) the Robotics Institute at the University of Toronto(多伦多大学机器人研究所)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本研究提出一种基于基座力/力矩测量的对偶边界观测器,实现动态无穷维软体连续体机器人状态估计,兼具传感需求低、增益调参高效等优势,经仿真与实验验证了其性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14615 2026-08-13 cs.CV 版本更新 57%

CalibAnyView: Beyond Single-View Camera Calibration in the Wild

CalibAnyView:超越单视角相机校准的野外应用

Boying Li, Cheng Zhang, Weirong Chen, Guyuan Chen, Daniel Cremers, Jianfei Cai, Ian Reid, Hamid Rezatofighi

机构 * Monash University(蒙纳士大学) Technical University of Munich(慕尼黑技术大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 CalibAnyView通过多视角几何一致性建模,提升野外多视角相机校准的鲁棒性和精度,适用于复杂场景下的3D重建和机器人感知。

Comments 27 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10309 2026-08-12 cs.AI 版本更新 57%

Measure the Sim-to-Real Gap: Designing an Affordable Real-World Benchmark Platform for Reinforcement Learning in AIoT Systems

测量模拟到现实的差距:为物联网系统中的强化学习设计一个经济实惠的真实世界基准平台

Rongping Zhou, Omid Tavallaie, Shuaijun Chen, Albert Y. Zomaya

机构 * The University of Sydney(悉尼大学) University of Oxford(牛津大学) The University of Western Australia(西澳大利亚大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI

AI总结 针对AIoT系统中强化学习模拟到现实的差距问题,开发了成本低于400美元的真实世界平台,通过硬件模拟键盘让边缘设备智能体玩游戏训练,实验显示模拟训练智能体部署后性能大幅下降,直接现实训练有可行性,为强化学习评估提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24112 2026-08-12 cs.AI 版本更新 57%

ReMMD: Realistic Multilingual Multi-Image Agentic Verification for Multimodal Misinformation Detection

ReMMD: 面向多模态虚假信息检测的现实多语言多图像智能体验证

Chenhao Dang, Dantong Zhu, Jun Yang, Conghui He, Weijia Li

机构 * Shanghai Jiaotong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Central South University(中南大学) China Electronics Technology Group Corporation 15th Research Institute(中国电子科技集团公司第十五研究所)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 提出ReMMD框架,包含多语言多图像基准ReMMDBench和持久记忆验证器ReMMD-Agent,通过原子点分解和可重用证据集实现高效准确的多模态虚假信息检测。

Comments The project is available at https://dang-ai.github.io/ReMMD

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19341 2026-08-11 cs.CV 版本更新 57%

ExpertVerse: A General-Purpose Benchmark for Expert-Level Reasoning in Knowledge-Intensive Visual Synthesis

ExpertVerse:知识密集型视觉合成中专家级推理的通用基准

Yuan Wang, Yongchao Du, Mengting Chen, Jinsong Lan, Jiaxuan Luo, Xuetao Feng, Xiaoyong Zhu

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 研究针对多模态生成模型在知识密集型生成的不足,开发ExpertVerse基准,涵盖多种认知能力和专家学科,生成相关数据集,训练KnowThinker并提出BPPO优化方法,揭示模型推理缺陷,强调知识密集型基准对下一代视觉生成的重要性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26519 2026-08-11 cs.CV 版本更新 57%

GIFGuard: Proactive Forensics against Deepfakes in Facial GIFs via Spatiotemporal Watermarking

GIFGuard:通过时空水印实现面向面部GIF的主动取证对抗深度伪造

Shupeng Che, Zhiqing Guo, Changtao Miao, Dan Ma, Gaobo Yang

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出GIFGuard,首个针对GIF中深度伪造的时空水印框架,通过STARE和DIRD实现高鲁棒性取证,构建GIFfaces基准数据集以促进研究。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24084 2026-08-11 cs.AI 版本更新 57%

Bridging the Evaluation Gap: Standardized Benchmarks for Multi-Objective Search

弥合评估差距:多目标搜索的标准化基准

Hadar Peer, Carlos Hernandez, Sven Koenig, Ariel Felner, Oren Salzman

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI

AI总结 本文提出首个标准化多目标搜索基准,涵盖四个结构各异的领域,通过固定实例和标准查询确保评估的鲁棒性和全面性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17504 2026-08-11 cs.CV q-bio.QM 版本更新 57%

BMDS-Net:Deployment-aware multi-modal brain tumor segmentation with adaptive fusion,decoder regularization,and Bayesian calibration

BMDS-Net:一种用于鲁棒脑肿瘤分割的贝叶斯多模态深度监督网络

Yan Zhou, Suncheng Xiang, Zhen Huang, Yue Ouyang, Yingqiu Li, Zehua Wang

机构 * School of Mathematics and Statistics, Changsha University of Science and Technology(数学与统计学学院,长沙理工大学) School of Biomedical Engineering, Shanghai Jiao Tong University(生物医学工程学院,上海交通大学) Shanghai Chest Hospital, Shanghai Jiao Tong University School of Medicine(上海胸科医院,上海交通大学医学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 BMDS-Net通过贝叶斯方法提升多模态脑肿瘤分割的鲁棒性和可信度,实现更稳定的临床应用。

Comments 21 pages, 6 figures. Manuscript prepared for submission to ACM HEALTH

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24445 2026-08-07 cs.RO 版本更新 57%

Legible and Intuitive Multi-modal Robot State and Intent Communication Validated in Online and Real-world Studies

可读且直观的多模态机器人状态与意图通信:在线和真实世界研究验证

Tim Schreiter, Jens V. Rüppel, Andrey Rudenko, Martin Magnusson, Achim J. Lilienthal

机构 * Chair of Perception for Intelligent Systems, Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich (TUM)(慕尼黑工业大学慕尼黑机器人与机器智能研究所智能系统感知教席) Centre for Applied Autonomous Sensor Systems (AASS), Örebro University(厄勒布鲁大学应用自主传感器系统中心) Robotics Institute Germany (RIG)(德国机器人研究所)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 针对移动非人形机器人,通过在线和真实世界实验,系统比较了低表达单模态LED与高表达多模态(凝视、手势、语音)通信策略,发现多模态更可读直观,且真实环境中可读性和信心下降。

Comments Accepted for publication at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏