arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-15 至 2026-05-15 共收录 13 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 13 篇

2605.14771 2026-05-15 cs.AI 79%

MediaClaw: Multimodal Intelligent-Agent Platform Technical Report

MediaClaw:多模态智能体平台技术报告

Shaoan Zhao, Huanlin Gao, Qiang Hui, Ting Lu, Xueqiang Guo, Yantao Li, Xinpei Su, Fuyuan Shi, Chao Tan, Fang Zhao, Kai Wang, Shiguo Lian

机构 * China Unicom AI (Yuanjing) Team(中国unicom AI (元京)团队)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 MediaClaw基于OpenClaw生态系统构建多模态智能体平台,通过统一抽象、插件扩展和工作流编排三层架构解决AIGC应用中的碎片化能力、异构接口、生产流程断层和高质量流程复用不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14556 2026-05-15 cs.AI 79%

TeachAnything: A Multimodal Crowdsourcing Platform for Training Embodied AI Agents in Symmetrical Reality

教任何事物:一种多模态众包平台,用于在对称现实中的训练具身AI代理

Zidong Liu, Rongkai Liu, Yue Li, Zhenliang Zhang

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) BIGAI

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出TeachAnything平台,通过多模态示范信号整合三阶段示范范式,实现跨场景、任务和具身的多样化示范数据收集,为对称现实中的具身AI代理开发提供实用基础。

Comments 5 pages, 3 figures. Accepted as an IEEE VR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13213 2026-05-15 cs.AI 79%

Hierarchical Attacks for Multi-Modal Multi-Agent Reasoning

多模态多智能体推理的分层攻击

Hao Zhou, Tiru Wu, Yan Jiang, Wanqi Zhou, Junxing Hu, Ai Han

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出HAM³框架,通过感知、通信、推理三层分层攻击,评估多智能体系统在不同推理范式下的攻击成功率,揭示多模态多智能体系统的安全漏洞。

Comments Accepted to CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14747 2026-05-15 cs.CL cs.AI cs.CV cs.LG 67%

Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining

Video2GUI:合成大规模交互轨迹用于通用GUI代理预训练

Weimin Xiong, Shuhao Gu, Bowen Ye, Zihao Yue, Lei Li, Feifan Song, Sujian Li, Hao Tian

机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机科学学院,北京大学) The University of Hong Kong(香港大学) Renmin University of China(中国人民大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出Video2GUI框架,通过自动提取互联网视频中的GUI交互轨迹,生成大规模数据集WildGUI,提升了GUI代理的泛化能力。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14495 2026-05-15 cs.MM cs.AI 62%

Contestable Multi-Agent Debate with Arena-based Argumentative Computation for Multimedia Verification

可争议的多智能体辩论与基于竞技场的论证计算用于多媒体验证

Truong Thanh Hung Nguyen, Vo Thanh Khang Nguyen, Hoang-Loc Cao, Phuc Ho, Van Pham, Hung Cao

机构 * University of New Brunswick(新 Brunswick大学) University of Science, VNU-HCM(越南国家大学科学学院(VNU-HCM))

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI、cs.MM

AI总结 本文提出一种可争议的多智能体框架,结合多模态大语言模型、外部验证工具和基于竞技场的定量双极论证,以解决多媒体验证的透明性和可争议性问题。

Comments ACM ICMR 2026 Grand Challenge on Multimedia Verification

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16813 2026-05-15 cs.AI cs.CL cs.DB 62%

PersonalHomeBench: Evaluating Agents in Personalized Smart Homes

PersonalHomeBench:评估智能家庭中的代理系统

Manasa Bharadwaj, Yolanda Liu, InJung Yang, Sungil Kim, Nikhil Verma, KoKeun Kim, Kevin Ferreira, YoungJoon Kim

机构 * LG Toronto AI Lab(LG多伦多人工智能实验室)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PersonalHomeBench,用于评估代理在个性化智能家庭中的表现,通过迭代构建家庭状态生成任务,结合工具箱支持真实交互,揭示任务复杂度增加时代理能力下降的问题。

Comments Please use and cite the V3 version of this work, which includes updated correct author ordering and expanded error analysis in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14742 2026-05-15 cs.CV cs.RO 57%

EARL: Towards a Unified Analysis-Guided Reinforcement Learning Framework for Egocentric Interaction Reasoning and Pixel Grounding

EARL:一种统一的分析引导强化学习框架,用于第一人称交互推理与像素定位

Yuejiao Su, Xinshen Zhang, Zhen Ye, Lei Yao, Lap-Pui Chau, Yi Wang

机构 * Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University, Hong Kong SAR(香港理工大学电子与电气工程系) Division of Emerging Interdisciplinary Areas (EMIA), The Hong Kong University of Science and Technology, Hong Kong SAR(香港理工大学新兴跨学科领域研究中心)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出EARL框架,通过分析引导特征合成器提升第一人称交互推理与像素定位的准确性,实验显示在Ego-IRGBench上像素定位达到65.48% cIoU,优于现有方法。

Comments Accepted at ICML 2026. Project page: https://github.com/yuggiehk/EARL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14266 2026-05-15 cs.AI cs.CY 57%

Agentic AI Ecosystems in Higher Education: A Perspective on AI Agents to Emerging Inclusive, Agentic Multi-Agent AI Framework for Learning, Teaching and Institutional Intelligence

高等教育中的代理AI生态系统:对AI代理在新兴包容性、代理多代理AI框架中学习、教学和机构智能的视角

Vidya K Sudarshan, Anushka Sisodia, Reshma A Ramachandra, Sia Batra, Josephine Chong Leng Leng

机构 * College of Computing and Data Science, Nanyang Technological University, NTU, Singapore(南洋理工大学计算机与数据科学学院) DeepMed Ptd Ltd, India(印度DeepMed公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文探讨高等教育中代理多代理AI平台的整合,旨在解决教育机构复杂性中的碎片化问题,强调包容性和适应性决策的重要性。

Comments 50 pages, 14 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13276 2026-05-15 cs.AI cs.RO 57%

D-VLA: A High-Concurrency Distributed Asynchronous Reinforcement Learning Framework for Vision-Language-Action Models

D-VLA:一种面向视觉-语言-动作模型的高并发分布式异步强化学习框架

Yucheng Guo, Yongjian Guo, Zhong Guan, Wen Huang, Haoran Sun, Haodong Yue, Xiaolong Xiang, Shuai Di, Zhen Sun, Luqiao Wang, Junwu Xiong, Yicheng Gong

机构 * Tsinghua University(清华大学) Peking University(北京大学) Tianjin University(天津大学) Beihang University(北航) JDT AI Infra(京东AI基础设施)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出D-VLA框架,通过平面解耦和四线异步流水线提升大规模视觉-语言-动作模型的并发性和效率,实验显示其在吞吐量和采样效率上优于主流框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01758 2026-05-15 cs.AI 57%

Catching the Infection Before It Spreads: Foresight-Guided Defense in Multi-Agent Systems

在感染蔓延前捕捉它:多智能体系统中的前瞻性引导防御

Yue Ma, Ziyuan Yang, Yi Zhang

机构 * Sichuan University(四川大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出Foresight-Guided Local Purification框架,通过智能体模拟未来交互行为,消除感染。实验表明,该方法将最大累积感染率从95%降至5.47%,有效保持交互多样性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14628 2026-05-15 cs.HC 50%

SmartWalkCoach: An AI Companion for End-to-End Walking Guidance, Motivation, and Reflection

SmartWalkCoach: 一种面向全程步行引导、激励与反思的AI伴侣

Xianzhe Zhang, Mingxuan Hu, Bufan Xue, Erick Purwanto, Thomas J Selig, Daniel Yonto

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出SmartWalkCoach,通过整合地理、陪伴和总结三个轻量级代理,降低步行规划的认知负荷,提升步行过程中的参与度与动机,通过动态干预改善用户感受和体验。

Comments 15 pages, 2 figures, to be presented to ACM IUI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24316 2026-05-15 cs.GR 50%

Large-Scale Photogrammetric Documentation of St. John's Co-Cathedral: A Workflow for Cultural Heritage Preservation

大规模摄影测量记录圣约翰共祭坛:文化保护的流程

Matthew Kenely, Mark Bugeja, Andre Grima, Peter Pullicino, Matthew Pullicino, Dylan Seychell

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文介绍了一种用于大规模摄影测量记录马耳他瓦莱塔圣约翰共祭坛的完整流程,该建筑为世界遗产,具有复杂的巴洛克建筑和卡拉瓦乔作品。通过七晚的夜间拍摄,采集了99,000张照片,利用DSLR相机、无人机和激光雷达扫描,生成包含25-30十亿三角形的高精度3D重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14154 2026-05-15 physics.chem-ph 50%

TSAgent: An Agentic Workflow for Autonomous Transition State Search

TSAgent:一种用于自主过渡态搜索的智能工作流

Varun Madhavan, Ankit Mathanker, Dean M. Sweeney, Oluwatosin A. Ohiro, Yixin Wang, Bryan R. Goldsmith

专题命中 多模态Agent :multimodal(abstract)

AI总结 TSAgent通过持续的计划-执行-分析-重新计划循环,自动在密度泛函理论水平上搜索过渡态,实现了83%的准确率,并在对比实验中表现出优于人类专家的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏