arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-28 至 2026-04-28 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 7 篇

2510.17590 2026-04-28 cs.AI cs.CL cs.CV cs.CY cs.LG 85%

MERIT: Modular Framework for Multimodal Misinformation Detection with Web-Grounded Reasoning

MERIT:基于网络基础推理的多模态虚假信息检测模块化框架

Mir Nafis Sharear Shopnil, Sharad Duwal, Abhishek Tyagi, Adiba Mahbub Proma

机构 * University of Rochester(罗切斯特大学)

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 MERIT通过四个专用模块提升多模态虚假信息检测性能,采用GPT-4o-mini在MMFakeBench上取得81.65% F1得分,优于零样本基线,验证了其架构设计的有效性。

Comments 18 pages, 4 tables, 3 figures. Major revision with updated title, framing, methodology, experiments, and error analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24441 2026-04-28 cs.CV 74%

AutoGUI-v2: A Comprehensive Multi-Modal GUI Functionality Understanding Benchmark

AutoGUI-v2:一个全面的多模态GUI功能理解基准

Hongxin Li, Xiping Wang, Jingran Su, Zheng Ju, Yuntao Chen, Qing Li, Zhaoxiang Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) New Laboratory of Pattern Recognition(模式识别新实验室) State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) Hong Kong Institute of Science & Innovation(香港科学创新研究院) PolyU Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态Agent :multi-modal(title);分类 cs.CV

AI总结 AutoGUI-v2通过多平台截图递归解析生成多样化任务,评估深度GUI功能理解和交互预测能力,揭示VLMs在功能接地与描述上的差异及复杂交互逻辑的挑战。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23392 2026-04-28 cs.AI 70%

SoccerRef-Agents: Multi-Agent System for Automated Soccer Refereeing

SoccerRef-Agents: 多智能体系统用于自动足球裁判

Zi Meng, Wanli Song, Yi Hu, Jiayuan Rao, Gang Chen

机构 * University of Michigan(密歇根大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出SoccerRef-Agents多智能体系统,通过构建多模态基准和知识库,提升足球裁判决策的准确性和可解释性。

Comments 26 pages, 8 figures. Submitted to ISACE 2026. Github Repo: https://github.com/yjlog/SoccerRef-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10139 2026-04-28 cs.CR cs.AI 70%

Anonymization-Enhanced Privacy Protection for Mobile GUI Agents: Available but Invisible

增强隐私保护的移动GUI代理:可用但不可见

Lepeng Zhao, Zhenhua Zou, Shuo Li, Zhuotao Liu

机构 * Tsinghua University(清华大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract_cn);分类 cs.AI

AI总结 本文提出一种基于匿名化的隐私保护框架,通过检测敏感UI内容并替换为非识别性占位符,实现敏感信息在任务执行中可用但不可见,减少隐私泄露同时保持代理的无缝使用。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23775 2026-04-28 cs.RO 67%

Vision-Language-Action Safety: Threats, Challenges, Evaluations, and Mechanisms

视觉-语言-动作安全性:威胁、挑战、评估与机制

Qi Li, Bo Yin, Weiqi Huang, Ruhao Liu, Bojun Zou, Runpeng Yu, Jingwen Ye, Weihao Yu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Monash University(墨尔本大学) Peking University(北京大学)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract)

AI总结 本文探讨了视觉-语言-动作模型的安全性问题,分析了其在训练和推理阶段的威胁与防御机制,总结了评估方法及六个部署领域的安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17736 2026-04-28 cs.HC cs.AI 57%

From Static to Interactive: Authoring Interactive Visualizations via Natural Language

从静态到交互:通过自然语言实现交互式可视化

Can Liu, Jaeuk Lee, Tianhe Chen, Zhibang Jiang, Xiaolin Wen, Yong Wang

机构 * Nanyang Technological University(南洋理工大学) Ajou University(阿乔大学) Providence Health & Services(普罗维登斯健康与服务)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出Athanor方法,利用多模态大语言模型和自然语言指令将静态可视化转为交互式,通过三种创新设计提升用户交互体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23802 2026-04-28 cs.MA 50%

EndoGov: A knowledge-governed multi-agent expert system for endometrial cancer risk stratification

EndoGov:一种基于知识的多智能体专家系统用于子宫内膜癌风险分层

Weiye Dai, Liyun Shi, Zanxiang He, Yuling Ma, Mengyuan Lin, Dianxiang Sun, Liming Nie

专题命中 多模态Agent :multimodal(abstract)

AI总结 EndoGov通过多智能体系统结合规则治理,实现子宫内膜癌风险分层的指南合规性与高准确性,同时保持竞争性判别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏