arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2766 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2766 篇

2602.13723 2026-07-10 cs.SE 版本更新 78%

Compiling Large Multi-Modal Requirement Documents into Runnable Software Systems: From an Agentic Test-Driven Perspective

ARC:将大型多模态需求文档编译为可运行软件系统

Weiyu Kong, Yun Lin, Xiwen Teoh, Duc-Minh Nguyen, Ruofei Ren, Jiaxin Chang, Haoxu Hu, Haoyu Chen

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 提出Agentic需求编译(ARC)技术,通过双向测试驱动智能体循环,将多模态DSL文档直接编译为可运行Web系统,在GUI测试通过率上平均提升50.6%。

Comments This work is accepted at issta'26 (SIGSOFT International Symposium on Software Testing and Analysis)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04974 2026-07-07 cs.SE 新提交 78%

A Comprehensive Study of Implementation Bugs in Multi-modal Agents

多模态智能体中实现错误的综合研究

Suwan Li, Lei Bu, Shangqing Liu, Yile Wang, Guangdong Bai, Fuman Xie, Kai Chen, Chang Yue

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 针对多模态智能体实现错误缺乏系统研究的问题,收集34个智能体,从1268个问题报告中识别出158个错误,开发分类法,实现MATester工具,为多模态智能体错误分类、预防和修复提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29788 2026-06-30 cs.LG 78%

MemLeak: Diagnosing Information Leaks in Multimodal Agent Memory

MemLeak: 诊断多模态智能体记忆中的信息泄露

Kuan Wang, Chao Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 提出信息溯源图(IPG)分类法,通过MemLeak基准测试发现多模态记忆系统中删除事实后仍可从保留图像中恢复信息,图像泄露率达12.0%,47%的泄露无法通过文本恢复。

Comments 23 pages, 3 figures, includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26567 2026-06-26 eess.SP 新提交 78%

Multi-Modal Environment-Aware Beam Management for Massive MIMO: A Geometry-Driven Virtual Base Station Framework

大规模MIMO的多模态环境感知波束管理:一种几何驱动的虚拟基站框架

Yijie Bian, Wei Guo, Jie Yang, Shenghui Song, Jun Zhang, Shi Jin, Khaled B. Letaief

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 提出几何驱动框架,利用3D LiDAR点云和位置信息构建虚拟基站数据库,通过镜像对称建模主导反射路径,实现粗信道重建和低开销波束训练,并采用双智能体深度强化学习协调波束选择,提升波束管理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23543 2026-06-23 cs.AI cs.CL cs.CV cs.LG 新提交 78%

VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct

VeriEvol:通过可验证的进化指令扩展多模态数学推理

Haoling Li, Kai Zheng, Jie Wu, Can Xu, Qingfeng Sun, Han Hu, Yujiu Yang

机构 * Tsinghua University(清华大学) Tencent Hunyuan(腾讯混元)

专题命中 多模态Agent :multimodal(title);分类 cs.CV、cs.CL、cs.AI

AI总结 提出VeriEvol框架,通过类型感知进化模块生成更难的问题,并利用HTV-Agent验证器确保答案可靠性,从而在强化学习中扩展多模态数学推理数据,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11975 2026-06-23 cs.RO 版本更新 78%

M2HRI: An LLM-Driven Multimodal Multi-Agent Framework for Personalized Human-Robot Interaction

M2HRI:一种LLM驱动的多模态多智能体框架,用于个性化人机交互

Shaid Hasan, Breenice Lee, Sujan Sarker, Tariq Iqbal

机构 * University of Virginia(弗吉尼亚大学)

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 提出M2HRI框架,通过个性、长期记忆和情境化协调机制赋予每个机器人独特身份,实验表明该方法能提升交互自然性和协调性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14780 2026-06-16 cs.MA cs.CY cs.RO cs.SY eess.SY 版本更新 78%

ROSA: Roundabout Optimized Speed Advisory with Multi-Agent Trajectory Prediction in Multimodal Traffic

ROSA: 多模式交通中基于多智能体轨迹预测的环岛优化速度建议

Anna-Lena Schlamp, Jeremias Gerner, Klaus Bogenberger, Werner Huber, Stefanie Schmidtner

机构 * IEEE

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 提出ROSA系统,结合Transformer多智能体轨迹预测与协调速度引导,提升环岛多模式混合交通的效率与安全,预测精度优于前人工作。

Comments 8 pages, 1 figure, 4 tables. Copyright 2026 IEEE. This is the accepted manuscript for 2025 IEEE International Conference on Intelligent Transportation Systems (ITSC), not the final published version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14154 2026-06-15 cs.CR 新提交 78%

SkillMutator: Benchmarking and Defending Language-and-Code Cross-modal Attacks on LLM Agent Skills

SkillMutator: 基准测试与防御针对LLM代理技能的语言与代码跨模态攻击

Youngduk Kim, Minkyoo Song, Seungwon Shin

专题命中 多模态Agent :cross-modal(title,abstract)

AI总结 提出SkillMutator基准,模拟13类跨模态攻击,并设计四阶段推理轨迹蒸馏框架,将检测率从17.1%提升至88.2%,超越GPT-4o-mini。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11652 2026-06-11 cs.LG 新提交 78%

IAPO: Input Attribution-Aware Policy Optimization for Tool Use in Small Multimodal Agents

IAPO:面向小型多模态代理工具使用的输入归因感知策略优化

Yifan Yang, Zhen Zhang, Jiayi Tian, Liyan Tan, Zheng Zhang

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 提出输入归因感知策略优化(IAPO),通过强化学习对齐模型与教师模型的输入归因,提升多模态小语言模型的工具调用能力,在六个测试集上平均准确率提升3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06998 2026-06-11 cond-mat.other 版本更新 78%

Identifying Topological Invariants of Non-Hermitian Systems via Domain-Adaptive Multimodal Model for Mathematics

通过数学多模态模型识别非厄密系统拓扑不变量

Jiuchun Meng, Lichao Sun, Xiumei Wang, Dandan Zhu, Xingping Zhou

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 本文提出利用多模态模型识别非厄密系统拓扑不变量,通过输入哈密顿量的本征值和本征向量,结合数学大语言模型进行复杂计算和推理,有效提取拓扑信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
1709.08830 2026-06-04 eess.SY cs.CR cs.LG cs.SY 78%

Catching Anomalous Distributed Photovoltaics: An Edge-based Multi-modal Anomaly Detection

捕捉异常分布式光伏:基于边缘的多模态异常检测

Devu Manikantan Shilay, Kin Gwn Lorey, Tianshu Weiz, Teems Lovetty, Yu Cheng

机构 * University of California, Riverside, California, 92507(加州大学河滨分校) Illinois Institute of Technology, Chicago, Illinois 60616(伊利诺伊理工学院)

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 本文提出基于边缘的多模态异常检测方法,用于识别分布式光伏等设备的异常行为,通过融合多源时间序列数据,提升对电网安全的检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02977 2026-06-03 cs.HC cs.SE 78%

A Benchmarking Framework for Multimodal User Interface Toolkits: Comparing Modality Coverage, Developer Workflow, and Experimental Support

多模态用户界面工具包的基准测试框架:比较模态覆盖、开发者工作流和实验支持

Ariton Verush

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 本文提出一个基于文档分析、技术比较和未来开发者评估的结构化基准框架,从模态覆盖、开发者体验和实验支持三个维度比较多模态用户界面工具包。

Comments 13 pages, 3 tables, 1 figure. Benchmarking framework paper revised and expanded from an HCI seminar draft

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02382 2026-06-02 cs.CC cs.HC stat.CO 78%

Attention Dynamics and Adaptive Decision Support in C5ISR: A Recurrence Quantification Analysis of Visual and Multimodal Attention Guidance Effects on Mission Performance

C5ISR中的注意力动态与自适应决策支持:视觉与多模态注意力引导对任务绩效影响的递归量化分析

Hyun-Gee Jei, Caleb J. Armstrong, Farzan Sasangohar

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 本研究通过递归量化分析眼动数据,探讨了视觉与多模态自适应决策支持工具在C5ISR环境中的效果,发现多模态工具显著提升绩效,且递归度量与绩效存在线性和非线性关系。

Comments 11 Figures, 3 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02208 2026-06-02 cs.HC 78%

Context-Aware Workflow Decomposition for Automated Mobile UI Annotation Using Multimodal Large Language Models

基于多模态大语言模型的上下文感知工作流分解用于自动移动界面标注

Athar Parvez, Muhammad Jawad Mufti, Muqaddas Gull, Omar Hammad

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 提出一种将标注任务分解为多个上下文感知阶段的工作流方法,通过结构化提示、模式约束JSON输出和元素特定指令,在MUIAnno数据集上评估不同分解策略,发现两步工作流在精度上最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01801 2026-06-02 cs.MA 78%

MetaForge: A Self-Evolving Multimodal Agent that Retrieves, Adapts, and Forges Tools On Demand

MetaForge:一种自我进化的多模态智能体,可按需检索、适应和锻造工具

Shouang Wei, Houcheng Min, Xinpeng Dong, Xin Lin, Sen Cui, Bo Jiang, Zhongxiang Dai, Kun Kuang, Guandong Xu, Fei Wu, Min Zhang

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 提出MetaForge框架,通过决策-检索-适应-锻造-回收的闭环机制,使多模态智能体能够按需自我进化工具集,在12个基准测试中超越16个基线方法,提升了准确性、效率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26164 2026-05-27 cs.SE 78%

Gamified Requirement Elicitation for a Multi-Modal Decision Support System. The Case of SYNCHROMODE

多模态决策支持系统的游戏化需求获取:以SYNCHROMODE为例

Dimitris Tzanis, Alexandros Dolianitis, Viktoria Petkani, Areti Kotsi, Evangelos Mitsakis

专题命中 多模态Agent :multi-modal(title);multimodal(abstract)

AI总结 本文以SYNCHROMODE项目为案例,通过传统用例方法和游戏化方式获取多模态决策支持系统的需求,并对比分析两种方法产生的需求。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22600 2026-05-22 cs.RO 78%

Branch-Stochastic Model Predictive Control for Motion Planning under Multi-Modal Uncertainty with Scenario Clustering

基于分支随机优化的运动规划在多模态不确定性下的场景聚类

Zekun Xing, Ramkrishna Chaudhari, Marion Leibold, Dirk Wollherr, Martin Buss

机构 * Chair of Automatic Control Engineering(自动控制工程教授会)

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 本文提出一种结合随机模型预测控制与分支结构的方法,用于在多模态不确定性下进行运动规划,通过场景聚类提高实时计算性能并减少保守性。

Comments This work has been accepted for presentation at IFAC World Congress 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21923 2026-05-22 quant-ph 78%

Multi-Modal Spectroscopy Theory for Ultrafast Control of Rabi Oscillations

多模光谱理论用于超快控制Rabi振荡

J. W. Yu, H. B Wang, X. Q. Zhou, M. Tang, Z. B. Ni, X. T. Cheng, Y. Zhao, S. N Ding, J. Y. Yan, H. H. Zhu, C. H. Li, F. Liu, C. Y. Jin

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 本文提出了一种三腔方案,用于在腔量子电动力学(cQED)中实现发射器-腔耦合强度的完全控制。通过耦合振荡器引入了包含多个谱分量的瞬态动力学,显著增加了在时域中解析荧光光谱的数值成本。因此开发了一种通用传感器方法,以简化非稳态量子动力学的表征计算。多模光谱实时揭示了超模的出现、分裂和消失。基于零能超模的耗尽,证明了在时域多模光谱中实现超快的Rabi振荡切换。这些结果展示了从多个振子的谱控制到超快动力学的量子观测的一致图景,确立了传感器方法作为cQED系统超快光谱学的强大理论工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16149 2026-05-18 cs.DS 78%

Fast and Memory Efficient Multimodal Journey Planning with Delays

快速且内存高效的考虑延迟的多模式行程规划

Denys Katkalo, Andrii Rohovyi, Toby Walsh

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 本文提出一种更高效、快速且准确的多模式行程规划方法,适用于单目标和双目标场景,通过优化算法提升速度和精度。

Comments v4: revised manuscript incorporating reviewer feedback (Related Work restructure, temporal-planning baselines, Bez 2020 thesis acknowledgment, equation relocation); style switched to the AAAI 2026 format

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25563 2026-04-29 cs.RO 78%

Improving Sensing Coverage and Compliance of 3D-Printed Artificial Skins Through Multi-Modal Sensing and Soft Materials

通过多模感知和柔性材料提升3D打印人工皮肤的感知覆盖与合规性

Carson Kohlbrenner, Caleb Escobedo, Sayak Ray, Alexander Dickhans, Anna Soukhovei, Nickolaus Jackoski, Lyle Antieau, Alessandro Roncone

机构 * University of Colorado Boulder(科罗拉多大学波尔得分校)

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 本文提出结合时间飞行和自电容传感的柔性皮肤,实现多模感知、压力传感与电接口优化,提升3D打印人工皮肤的实用性和覆盖能力。

Comments This work was accepted at the "Towards Large-Area Tactile Sensing Skins: From Scalable Materials to Embodied Robotic Perception" workshop at the International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21394 2026-04-23 cs.CR 78%

MemoPhishAgent: Memory-Augmented Multi-Modal LLM Agent for Phishing URL Detection

MemoPhishAgent: 基于记忆的多模态大语言模型代理用于钓鱼URL检测

Xuan Chen, Hao Liu, Tao Yuan, Mehran Kafai, Piotr Habas, Xiangyu Zhang

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 本文提出MemoPhishAgent,通过整合多模态推理与记忆机制,提升钓鱼URL检测性能,实验显示其在召回率上优于现有方法,并在真实场景中实现高召回率。

Comments ACL 2026 Industry Track Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19081 2026-04-22 cs.SE 78%

Proactive Detection of GUI Defects in Multi-Window Scenarios via Multimodal Reasoning

通过多模态推理主动检测多窗口场景中的GUI缺陷

Xinyao Zhang, Rui Wang, Jinhao Cui, Haotian Huang, Wei Xue, Wenhua Hu, Jianwen Xiang, Rui Hao

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 本文提出一种端到端框架,通过主动触发多窗口状态,利用多模态大语言模型检测定位GUI缺陷,实验表明多窗口设置显著增加布局缺陷暴露,方法在应用和细粒度层面均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17459 2026-04-21 cs.IR 78%

Transparent and Controllable Recommendation Filtering via Multimodal Multi-Agent Collaboration

通过多模态多智能体协作实现透明且可控的推荐过滤

Chi Zhang, Zhipeng Xu, Jiahao Liu, Dongsheng Li, Hansu Gu, Peng Zhang, Ning Gu, Tun Lu

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 本文提出一种结合端到云协作、多模态感知和多智能体编排的框架,有效减少推荐系统中的过度关联和误报,提升用户控制和透明度。

Comments 14 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03509 2026-04-20 cs.RO 78%

Sampling-Based Multi-Modal Multi-Robot Multi-Goal Path Planning

基于采样的多模态多机器人多目标路径规划

Valentin N. Hartmann, Tirza Heinle, Yijiang Huang, Stelian Coros

机构 * Computational Robotics Lab ETH Zürich(机器人计算实验室ETH Zurich)

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 本文提出基于采样的多机器人多目标路径规划方法,解决多机器人协同任务中的路径规划问题,实现概率完备和渐进最优的规划算法。

Comments 25 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10501 2026-04-14 cs.CR 78%

MuSimA: A Tool with Multi-modal Input for Generating Bespoke ABAC Datasets

MuSimA:一种支持多模输入的生成定制ABAC数据集的工具

Saket Jha, Karthikeya S. M. Yelisetty, Singabattu Sathya, Shamik Sural

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 本文提出MuSimA工具,支持多模输入生成定制ABAC数据集,利用大语言模型自动提取分布参数,用于测试ABAC系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06914 2026-04-09 cs.LG 78%

Equivariant Multi-agent Reinforcement Learning for Multimodal Vehicle-to-Infrastructure Systems

等价多智能体强化学习用于多模态车-基础设施系统

Charbel Bou Chaaya, Mehdi Bennis

机构 * Centre for Wireless Communications, University of Oulu(奥卢大学无线通信中心)

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 本文研究了车-基础设施系统,通过分布式基站收集多模态数据,采用去中心化速率最大化方法,利用等价性对称性提出自监督学习框架,提升多模态感知和强化学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18836 2026-04-08 cs.RO 78%

Multimodal Classification Network Guided Trajectory Planning for Four-Wheel Independent Steering Autonomous Parking Considering Obstacle Attributes

四轮独立转向自主泊车的多模态分类网络引导轨迹规划考虑障碍属性

Jingjia Teng, Yang Li, Yougang Bian, Manjiang Hu, Yingbai Hu, Guofa Li, Jianqiang Wang

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 本文提出基于多模态感知网络和混合A*搜索的轨迹规划框架,通过考虑障碍属性提升四轮独立转向车辆在狭窄环境中的导航效率和安全性。

Comments The manuscript in this current form requires substantial revision. For this reason, I request the withdrawal of the submission to allow for comprehensive improvement before resubmission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29409 2026-04-01 cs.RO 78%

CLaD: Planning with Grounded Foresight via Cross-Modal Latent Dynamics

CLaD:通过跨模态潜在动力学实现具有基础前瞻性的规划

Andrew Jeong, Jaemin Kim, Sebin Lee, Sung-Eui Yoon

机构 * KAIST(韩国科学技术院)

专题命中 多模态Agent :cross-modal(title,abstract)

AI总结 CLaD通过不对称跨注意力机制联合建模本体和语义状态演化,利用自监督目标和EMA编码器防止表征崩溃,实现高成功率的长序列动作生成。

Comments Project page: https://andrewwwj.github.io/clad

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27202 2026-03-31 cs.PL cs.DC 78%

Sal: Multi-modal Verification of Replicated Data Types

Sal:多模态验证复制数据类型

Pranav Ramesh, Vimala Soundarapandian, KC Sivaramakrishnan

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 Sal通过结合内核可验证的自动化、SMT辅助自动化及AI辅助交互式定理证明,实现CRDT和MRDT的多模态验证,69%的验证条件由内核验证自动化解决,自动生成反例暴露隐秘错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21418 2026-03-31 cs.MA 78%

FUAS-Agents: Autonomous Multi-Modal LLM Agents for Treatment Planning in Focused Ultrasound Ablation Surgery

FUAS-代理:自主多模态大语言模型代理用于聚焦超声消融手术的治疗计划

Lina Zhao, Zihao Bian, Qingyue Chen, Yafang Li, Zhiyi Luo, Jiaxing Bai, Guangbo Li, Min He, Kezhi Li, Huaiyuan Yao, Zongjiu Zhang

专题命中 多模态Agent :multi-modal(title);multimodal(abstract)

AI总结 本文提出FUAS-代理,利用大语言模型的多模态理解和工具使用能力,通过整合患者资料和MRI数据,生成个性化治疗计划,提升临床决策效率和可靠性。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏