arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2773 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2773 篇

2605.21395 2026-05-21 cs.AI cs.LG 57%

Towards Resilient and Autonomous Networks: A BlueSky Vision on AI-Native 6G

迈向稳健和自主的网络:AI原生6G的BlueSky愿景

Liang Wu, Kelly Wan, Mayank Darbari, Liangjie Hong

机构 * Nokia(诺基亚)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本文提出了一种AI原生6G的BlueSky愿景,旨在将人工智能原生整合到6G中,从'为AI的网络'转向'为网络的AI',通过基础模型和协作多智能体系统,将网络管理转化为统一的多模态多任务优化问题,推动6G向智能自维持通信基础设施发展。

Comments Accepted at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20682 2026-05-21 cs.CV 57%

IndusAgent: Reinforcing Open-Vocabulary Industrial Anomaly Detection with Agentic Tools

IndusAgent: 通过智能工具增强开放词汇工业异常检测

Rongbin Tan, Fangfang Lin, Zhenlong Yuan, Min Qiu, Kejin Cui, Mengmeng Wang, Yi Wang, Zijian Song, Zhiyuan Wang, Jiyuan Wang, Yue Wang, Shuhan Song§, Huawei Cao

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) Santa Clara University(圣克拉拉大学) LongCat Team(LongCat团队) Independent Researcher(独立研究者) New York University(纽约大学) Sun Yat-sen University(孙中山大学) Nanyang Technological University(南洋理工大学) Stanford University(斯坦福大学) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出IndusAgent框架,通过整合视觉观测、高分辨率局部片段和专家正常性先验,提升开放词汇工业异常检测的零样本性能,验证了方法的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19528 2026-05-20 cs.CV 57%

Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs

面向相机鲁棒的3D定位:基于方程的工具使用用于MLLMs

Xueying Jiang, Wenhao Li, Quanhao Qian, Deli Zhao, Shijian Lu, Gongjie Zhang, Ran Xu

机构 * Nanyang Technological University(南洋理工大学) DAMO Academy, Alibaba Group(阿里集团大模型研究院) HuPan Lab(虎派实验室) Alibaba Group(阿里集团)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种基于方程的工具使用框架,通过将空间工具作为公式变量重新利用,以解决多模态大语言模型(MLLMs)中3D定位的相机固有模糊问题,从而在3D物体检测和3D视觉定位任务中取得了显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09872 2026-05-20 cs.LG cs.AI 57%

WARC-Bench: Web Archive Based Benchmark for GUI Subtask Executions

WARC-Bench:基于网络存档的GUI子任务执行基准

Sanjari Srivastava, Gang Li, Cheng Chang, Rishu Garg, Manpreet Kaur, Charlene Y. Lee, Yuezhang Li, Yining Mao, Ignacio Cases, Yanan Xie, Peng Qi

机构 * Uniphore

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出WARC-Bench,一个基于网络存档的GUI子任务执行基准,通过438个任务评估多模态AI代理在子任务上的能力,实验表明SFT和RLVR方法在提升子任务执行效果上取得显著成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18729 2026-05-19 cs.RO cs.CV 57%

Robo-Cortex: A Self-Evolving Embodied Agent via Dual-Grain Cognitive Memory and Autonomous Knowledge Induction

Robo-Cortex: 通过双粒认知记忆和自主知识诱导实现自我进化具身智能体

Nga Teng Chan, Yi Zhang, Yechi Liu, Renwen Cui, Fanhu Zeng, Zeyuan Ding, Xiancong Ren, Zhang Zhang, Qifeng Chen, Jian Liu, Yong Dai, Xiaozhu Ju

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) X-Humanoid Institute of Automation, CAS(中国科学院自动化研究所) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出Robo-Cortex框架,通过双粒认知记忆和自主知识诱导机制,使机器人能够自主诱导导航启发式方法并优化认知策略,从而在复杂环境中实现自主导航和探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18407 2026-05-19 cond-mat.mes-hall cond-mat.mtrl-sci cs.AI cs.RO 57%

Qumus: Realization of An Embodied AI Quantum Material Experimentalist

Qumus: 一种具身人工智能量子材料实验家的实现

Lihan Shi, Zhaoyi Joy Zheng, Xinzhe Juan, Yimin Wang, Ming Yin, Mayank Sengupta, Kristina Wolinski, Yanyu Jia, Jingzhi Shi, Derek Saucedo, Neill Saggi, Haosen Guan, Kenji Watanabe, Takashi Taniguchi, Ali Yazdani, Mengdi Wang, Sanfeng Wu

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出Qumus,首个能够进行真实世界科学发现的具身人工智能量子材料实验家,通过机器人微型实验室实现了原子薄二维材料和范德瓦耳斯结构的制备与纳米加工,首次实现了AI生成石墨烯和原子薄场效应晶体管的AI制造。

Comments 29 Pages in total. Supplementary Demo Videos are available at https://qumus.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21468 2026-05-19 cs.AI 57%

MemOCR: Layout-Aware Visual Memory for Efficient Long-Horizon Reasoning

MemOCR: 一种面向布局的视觉记忆用于高效的长周期推理

Yaorui Shi, Shugui Liu, Yu Yang, Wenyu Mao, Yuxin Chen, Qi GU, Hui Su, Xunliang Cai, Xiang Wang, An Zhang

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) School of Computing(计算学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 MemOCR通过利用视觉布局进行自适应信息密度分配,提高了在有限上下文预算下的长周期推理效率,其核心方法是维护结构化的丰富文本记忆并将其渲染为图像,以实现对关键证据的视觉优先级分配和辅助细节的压缩,从而在各种基准测试中优于基于文本的基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14504 2026-05-19 cs.AI 57%

When Robots Do the Chores: A Benchmark and Agent for Long-Horizon Household Task Execution

当机器人做家务:一个基准和代理用于长期家庭任务执行

Zilin Zhu, Longteng Guo, Yanghong Mei, Bowen Pang, Zongxun Zhang, Xingjian He, Ruyi Ji, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出LongAct基准和HoloMind代理,用于评估长期家庭任务执行中的高层自主能力,实验显示HoloMind在减少模型规模依赖的同时提升了长期性能,但目标完成率仍较低,凸显了长期规划的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02759 2026-05-19 cs.RO cs.CV 57%

DynoSLAM: Dynamic SLAM with Generative Graph Neural Networks for Real-World Social Navigation

DynoSLAM:基于生成图神经网络的动态SLAM用于现实世界的社交导航

Danil Tokhchukov, Veronika Morozova, Gonzalo Ferrer

机构 * Applied AI Institute(应用人工智能研究所)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出DynoSLAM,通过整合社交感知图神经网络,解决动态环境中SLAM的不确定性问题,提升机器人在拥挤环境中的导航能力。

Comments Code & Project page at https://github.com/makriot/dynoslam

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16441 2026-05-19 cs.LG cs.AI 57%

DeepArrhythmia: Segment-Contextualized ECG Arrhythmia Classification via Selective Evidence Acquisition

DeepArrhythmia: 基于选择性证据获取的段落上下文化ECG心律失常分类

Jiahui Li, Ruili Fang, Zishuai Liu, WenZhan Song, Jin Lu, Fei Dou

机构 * University of Georgia(佐治亚大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 DeepArrhythmia通过选择性证据获取实现段落上下文化ECG心律失常分类,结合原始ECG信号和渲染波形图像,利用专门工具分离生理测量与证据整合,提升多beat节奏上下文下的心律失常检测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16402 2026-05-19 cs.CV 57%

WinDeskGround: A Benchmark for Robust GUI Grounding in Complex Multi-Window Desktop Environments

WinDeskGround:复杂多窗口桌面环境中的鲁棒GUI定位基准

Haoren Zhao, Tianyi Chen, Zhen Wang

机构 * School of Cyberspace, Hangzhou Dianzi University, Hangzhou, China(杭州电子科技大学信息学院) Microsoft(微软公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出WinDeskGround基准,通过参数生成复杂桌面场景,评估GUI定位鲁棒性。实验显示顶级模型在简单环境表现佳,但部分遮挡下准确率下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15963 2026-05-18 cs.AI 57%

PAGER: Bridging the Semantic-Execution Gap in Point-Precise Geometric GUI Control

PAGER:弥合点精确几何GUI控制中的语义-执行鸿沟

Jingxuan Wei, Xi Bai, Shan Liu, Caijun Jia, Zheng Sun, Xinglong Xu, Siyuan Li, Linzhuang Sun, Bihui Yu, Conghui He, Cheng Tan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) China University of Petroleum-Beijing(中国石油大学(北京))

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出PAGER,通过依赖结构规划与像素级执行,解决对点精确几何GUI任务的需求,提升任务成功率至62%以上,填补语义-执行鸿沟。

Comments 27 pages, 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15611 2026-05-18 cs.AI 57%

TopoEvo: A Topology-Aware Self-Evolving Multi-Agent Framework for Root Cause Analysis in Microservices

TopoEvo: 一种面向拓扑的自演化多智能体框架用于微服务中的根本原因分析

Junle Wang, Xingchuang Liao, Wenjun Wu

机构 * School of Artificial Intelligence, Beihang University Beijing, China(人工智能学院,北京航空航天大学,北京,中国)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 针对微服务中观测数据异质性、故障传播和拓扑漂移问题,TopoEvo通过多模态对齐、拓扑约束推理和自演化机制,提升根本原因分析的鲁棒性与准确性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14742 2026-05-15 cs.CV cs.RO 57%

EARL: Towards a Unified Analysis-Guided Reinforcement Learning Framework for Egocentric Interaction Reasoning and Pixel Grounding

EARL:一种统一的分析引导强化学习框架,用于第一人称交互推理与像素定位

Yuejiao Su, Xinshen Zhang, Zhen Ye, Lei Yao, Lap-Pui Chau, Yi Wang

机构 * Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University, Hong Kong SAR(香港理工大学电子与电气工程系) Division of Emerging Interdisciplinary Areas (EMIA), The Hong Kong University of Science and Technology, Hong Kong SAR(香港理工大学新兴跨学科领域研究中心)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出EARL框架,通过分析引导特征合成器提升第一人称交互推理与像素定位的准确性,实验显示在Ego-IRGBench上像素定位达到65.48% cIoU,优于现有方法。

Comments Accepted at ICML 2026. Project page: https://github.com/yuggiehk/EARL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14266 2026-05-15 cs.AI cs.CY 57%

Agentic AI Ecosystems in Higher Education: A Perspective on AI Agents to Emerging Inclusive, Agentic Multi-Agent AI Framework for Learning, Teaching and Institutional Intelligence

高等教育中的代理AI生态系统:对AI代理在新兴包容性、代理多代理AI框架中学习、教学和机构智能的视角

Vidya K Sudarshan, Anushka Sisodia, Reshma A Ramachandra, Sia Batra, Josephine Chong Leng Leng

机构 * College of Computing and Data Science, Nanyang Technological University, NTU, Singapore(南洋理工大学计算机与数据科学学院) DeepMed Ptd Ltd, India(印度DeepMed公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文探讨高等教育中代理多代理AI平台的整合,旨在解决教育机构复杂性中的碎片化问题,强调包容性和适应性决策的重要性。

Comments 50 pages, 14 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13276 2026-05-15 cs.AI cs.RO 57%

D-VLA: A High-Concurrency Distributed Asynchronous Reinforcement Learning Framework for Vision-Language-Action Models

D-VLA:一种面向视觉-语言-动作模型的高并发分布式异步强化学习框架

Yucheng Guo, Yongjian Guo, Zhong Guan, Wen Huang, Haoran Sun, Haodong Yue, Xiaolong Xiang, Shuai Di, Zhen Sun, Luqiao Wang, Junwu Xiong, Yicheng Gong

机构 * Tsinghua University(清华大学) Peking University(北京大学) Tianjin University(天津大学) Beihang University(北航) JDT AI Infra(京东AI基础设施)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出D-VLA框架,通过平面解耦和四线异步流水线提升大规模视觉-语言-动作模型的并发性和效率,实验显示其在吞吐量和采样效率上优于主流框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01758 2026-05-15 cs.AI 57%

Catching the Infection Before It Spreads: Foresight-Guided Defense in Multi-Agent Systems

在感染蔓延前捕捉它:多智能体系统中的前瞻性引导防御

Yue Ma, Ziyuan Yang, Yi Zhang

机构 * Sichuan University(四川大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出Foresight-Guided Local Purification框架,通过智能体模拟未来交互行为,消除感染。实验表明,该方法将最大累积感染率从95%降至5.47%,有效保持交互多样性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13391 2026-05-14 cs.AI 57%

RS-Claw: Progressive Active Tool Exploration via Hierarchical Skill Trees for Remote Sensing Agents

RS-Claw:通过分层技能树实现渐进式主动工具探索的遥感代理

Liangtian Liu, Zeyuan Wang, Ziyu Li, Kai Ouyang, Zichao Tang, Chengfu Liu, Haifeng Li, Hanwen Yu, Wentao Yang, Cheng Yang, Dongyang Hou

机构 * School of Geosciences and Info-Physics, Central South University(地质科学与信息物理学院,中南大学) School of Resources and Environment, University of Electronic Science and Technology of China(资源与环境学院,电子科技大学) School of Earth Sciences and Spatial Information Engineering, Hunan University of Science and Technology(地球科学与空间信息工程学院,湖南科技大学) Sanya Institute of Hunan University of Science and Technology(海南科技大学三亚研究院)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本文提出RS-Claw,通过分层技能树实现主动探索,解决遥感代理工具选择中的被动机制问题,提升长周期推理中的工具命中率和上下文空间效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13296 2026-05-14 cs.AI cs.LG cs.MA 57%

Discrete Diffusion for Complex and Congested Multi-Agent Path Finding with Sparse Social Attention

离散扩散用于复杂且拥堵的多智能体路径寻找与稀疏社交注意

Yuanzhe Wang, Tian Zhi, Zihang Wei, Hongguang Wang, Jiaming Guo, Yang Zhao, Zisheng Liu, Shiyu Quan, Xing Hu, Zidong Du, Yunji Chen

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(中国科学院计算技术研究所处理器重点实验室) School of Advanced Interdisciplinary Sciences, CAS(中国科学院高等交叉学科学院) University of Chinese Academy of Sciences(中国科学院大学) Institute of Microelectronics, CAS(中国科学院微电子研究所)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出DiffLNS框架,结合离散去噪扩散概率模型与LNS2,通过稀疏社交注意学习多智能体轨迹先验,提升多智能体路径寻找的修复效率与成功率。

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26839 2026-05-14 cs.LG cs.CV 57%

From Pixels to BFS: High Maze Accuracy Does Not Imply Visual Planning

从像素到BFS:高迷宫精度并不意味着视觉规划

Alberto G. Rodriguez Salgado

机构 * Independent Researcher(独立研究者)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文通过MazeBench基准测试,揭示了多模态模型在视觉空间任务中依赖于文本网格转换和逐步路径枚举,而非真正的规划,高精度并不等同于人类空间理解。

Comments 15 pages, 10 figures. Code and mazes available at https://github.com/alrod97/LLMs_mazes

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11633 2026-05-13 cs.AI 57%

Can LLM Agents Respond to Disasters? Benchmarking Heterogeneous Geospatial Reasoning in Emergency Operations

大语言模型代理能否应对灾难?评估异构地理空间推理在紧急行动中的基准测试

Junjue Wang, Weihao Xuan, Heli Qi, Pengyu Dai, Kunyi Liu, Hongruixuan Chen, Zhuo Zheng, Junshi Xia, Stefano Ermon, Naoto Yokoya

机构 * The University of Tokyo(东京大学) RIKEN AIP(理化学研究所AIP) Waseda University(早稻田大学) Stanford University(斯坦福大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本文提出DORA基准测试,评估大语言模型在灾难响应中的端到端流程,揭示了灾难领域接地、工具选择瓶颈和组合脆弱性等挑战。

Comments DORA stress-tests LLM agents on real-world disaster operations that demand comprehensive orchestration of 108 specialized tools over heterogeneous geospatial data

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11321 2026-05-13 cs.CV 57%

KeyframeFace: Language-Driven Facial Animation via Semantic Keyframes

KeyframeFace: 通过语义关键帧实现语言驱动的面部动画

Jingchao Wu, Zejian Kang, Haibo Liu, Yuanchen Fei, Xiangru Huang

机构 * Westlake University(西湖大学) Nanjing University(南京大学) Zhejiang University(浙江大学) Hunan University(湖南大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出KeyframeFace框架,通过语义关键帧实现语言驱动的面部动画,提升面部表情的精确控制与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21232 2026-05-12 cs.AI 57%

ReCAPA: Hierarchical Predictive Correction to Mitigate Cascading Failures

ReCAPA:分层预测性修正以缓解级联故障

Xiyin Zeng, Yuyu Sun, Haoyang Li, Shouqiang Liu, Hao Wang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) South China Normal University(华南师范大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 ReCAPA通过分层预测修正和对齐架构,缓解多模态环境中多步骤任务执行中的级联故障问题,引入新的指标量化误差传播与恢复过程,实验表明其在多个代理基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09528 2026-05-12 cs.AI 57%

Cplus2ASP: Computing Action Language C+ in Answer Set Programming

Cplus2ASP:在答案集编程中计算动作语言C+

Joseph Babb, Joohyung Lee

机构 * School of Computing, Informatics, and Decision Systems Engineering(计算、信息与决策系统工程学院)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 Cplus2ASP 2.0实现了动作语言C+的确定性片段,通过现代答案集求解技术提升效率,结合多种理论成果,利用工具链实现C+到ICLingo的翻译,并支持扩展多模态翻译。

Journal ref In Proceedings of the 12th International Conference on Logic Programming and Nonmonotonic Reasoning (LPNMR 2013), 122-134, 2013

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11604 2026-05-12 cs.CL 57%

Talk to Your Slides: High-Efficiency Slide Editing via Language-Driven Structured Data Manipulation

与幻灯片对话:通过语言驱动的结构化数据操作实现高效幻灯片编辑

Kyudan Jung, Hojun Cho, Jooyeol Yun, Soyoung Yang, Jaehyeok Jang, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能研究所) Chung-Ang University(Chung-Ang 大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL

AI总结 本文提出Talk-to-Your-Slides,通过语言驱动的结构化数据操作实现高效幻灯片编辑,相较于基于图像的GUI方法,其在文本处理和格式任务中更快、更准确且成本更低。

Comments 30 pages, Accepted at ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05383 2026-05-12 cs.AI cs.MA 57%

AVA: Attentive VLM Agent for Mastering StarCraft II

AVA:面向星际2的注意力视觉语言代理

Weiyu Ma, Yuqian Fu, Zecheng Zhang, Bernard Ghanem, Guohao Li

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 AVA提出一个支持多智能体强化学习和视觉语言模型的星际2基准,通过RGB图像、自然语言观察和结构化状态信息,比较训练和零样本方法在21种场景中的表现,揭示训练效率、性能上限、可解释性和部署成本的权衡。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09005 2026-05-12 cs.RO cs.AI 57%

Towards Backdoor-Based Ownership Verification for Vision-Language-Action Models

面向视觉-语言-动作模型的后门基于所有权验证

Ming Sun, Rui Wang, Xingrui Yu, Lihua Jing, Hangyu Du, Zhenglin Wan, Xu Pan, Ivor Tsang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) A*STAR Institute of High Performance Computing (A*STAR IHPC)(新加坡A*STAR高性能计算研究所) A*STAR Centre for Frontier AI Research (A*STAR CFAR)(新加坡A*STAR前沿人工智能研究中心) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) College of Design and Engineering, Nanyang Technological University(南洋理工大学设计与工程学院) Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS), Wuhan University(武汉大学测绘遥感信息工程国家重点实验室(LIESMARS))

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本文提出GuardVLA,首个针对视觉-语言-动作模型的后门基于所有权验证框架,通过在训练中嵌入隐蔽无害的后门水印,实现可靠的模型所有权验证并保持正常任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06226 2026-05-12 cs.AI q-bio.GN 57%

A Versatile AI Agent for Rare Disease Diagnosis and Risk Gene Prioritization

一种多功能AI代理用于罕见病诊断和风险基因优先级排序

Tianyu Liu, Wangjie Zheng, Rui Yang, Benny Kai Guo Loo, Hui Zhang, Jeffries Lauran, Jianlei Gu, Botao Yu, Weihao Xuan, Kexin Huang, Nan Liu, James Zou, Yonghui Jiang, Hua Xu, Hongyu Zhao

机构 * Interdepartmental Program in Computational Biology and Bioinformatics, Yale University(耶鲁大学计算生物学与生物信息学联合计划) Department of Biostatistics, Yale University(耶鲁大学生物统计学系) Broad Institute of MIT and Harvard(哈佛大学与麻省理工学院联合Broad研究所) Center for Biomedical Data Science, Duke-NUS Medical School(杜克-新加坡医学学校生物医学数据科学中心) Sport and Exercise Medicine Service, KK Women’s and Children’s Hospital Training Program, Duke-NUS Medical School(杜克-新加坡医学学校KK妇女儿童医院运动与医学服务培训项目) Training Program, Duke-NUS Medical School(杜克-新加坡医学学校培训项目) Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系) Department of Complexity Science and Engineering, The University of Tokyo(东京大学复杂科学与工程系) Center for Advanced Intelligence Project, RIKEN(日本理化学研究所高级智能项目中心) NUS Artificial Intelligence Institute, National University of Singapore(新加坡国立大学人工智能研究所) Department of Biostatistics and Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系) Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) Department of Genetics, Yale University(耶鲁大学遗传学系) Wu Tsai Institute, Yale University(耶鲁大学吴天教授研究所) Department of Biomedical Informatics and Data Science, Yale University(耶鲁大学生物医学信息学与数据科学系)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本文提出Hygieia系统,通过整合多源数据提升罕见病诊断准确性与风险基因优先级排序能力,实验表明其在多个诊断基准上表现优异,有效减轻临床工作负担。

Comments 32 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05714 2026-05-08 cs.CV cs.RO 57%

TriRelVLA: Triadic Relational Structure for Generalizable Embodied Manipulation

TriRelVLA:三元关系结构用于可迁移的具身操作

Hanyu Zhou, Chuanhao Ma, Gim Hee Lee

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 TriRelVLA通过构建三元关系结构,解决视觉语言动作模型在未见场景和物体上的泛化问题,提升具身操作的迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01245 2026-05-05 cs.HC cs.AI 57%

The Garden of Forking Paths: Narrative Arc-Conditioned Gameplay Planning

分叉花园:叙事弧条件下的游戏玩法规划

Yunge Wen, Chenliang Huang, Hangyu Zhou, Zhuo Zeng, Chun Ming Louis Po, Julian Togelius, Timothy Merino, Sam Earle

机构 * New York University(纽约大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出Forking Garden框架,通过用户提供的故事情节生成分支游戏,采用弧引导约束算法构建 dungeon 图,实现游戏元素的多模态对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏