arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-23 至 2026-04-23 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 4 篇

2604.20486 2026-04-23 cs.CV 79%

ProMMSearchAgent: A Generalizable Multimodal Search Agent Trained with Process-Oriented Rewards

ProMMSearchAgent:一种通过过程导向奖励训练的通用多模态搜索代理

Wentao Yan, Shengqin Wang, Huichi Zhou, Yihang Chen, Kun Shao, Yuan Xie, Zhizhong Zhang

机构 * East China Normal University(东中国师范大学) Shanghai Innovation Institute(上海创新研究院) Huawei Noah's Ark Lab(华为诺亚实验室) Independent Researcher(独立研究者) University College London(伦敦大学学院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出ProMMSearchAgent,通过过程导向奖励解决多模态代理在知识密集型视觉推理中的训练难题,实现零样本迁移至Google搜索API。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21394 2026-04-23 cs.CR 78%

MemoPhishAgent: Memory-Augmented Multi-Modal LLM Agent for Phishing URL Detection

MemoPhishAgent: 基于记忆的多模态大语言模型代理用于钓鱼URL检测

Xuan Chen, Hao Liu, Tao Yuan, Mehran Kafai, Piotr Habas, Xiangyu Zhang

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 本文提出MemoPhishAgent,通过整合多模态推理与记忆机制,提升钓鱼URL检测性能,实验显示其在召回率上优于现有方法,并在真实场景中实现高召回率。

Comments ACL 2026 Industry Track Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28032 2026-04-23 cs.RO cs.AI cs.CV cs.HC 62%

CARLA-Air: Fly Drones Inside a CARLA World -- A Unified Infrastructure for Air-Ground Embodied Intelligence

CARLA-Air:在CARLA世界中飞行无人机——一个统一的空地具身智能基础设施

Tianle Zeng, Yanci Wen, Hong Zhang

机构 * Hong Zhang 1,†(香港理工大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 CARLA-Air通过统一高保真城市驾驶与物理准确多旋翼飞行,解决了空地协同模拟中的同步与一致性问题,支持多种具身智能任务。

Comments Prebuilt binaries, project page, full source code, and community discussion group are all available at: https://github.com/louiszengCN/CarlaAir

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19945 2026-04-23 cs.CV 57%

Visual Reasoning through Tool-supervised Reinforcement Learning

通过工具监督强化学习进行视觉推理

Qihua Dong, Gozde Sahin, Pei Wang, Zhaowei Cai, Robik Shrestha, Hao Yang, Davide Modolo

机构 * Northeastern University(东北大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出工具监督强化学习框架,通过简单可解释的视觉工具提升多模态大语言模型的复杂视觉推理能力,实验表明其高效且具备强大工具使用能力。

Comments Accepted to CVPR 2026 Findings. 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏