arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2759 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2759 篇

2505.14418 2026-06-16 cs.CL 版本更新 89%

Hidden Ghost Hand: Unveiling Backdoor Vulnerabilities in MLLM-Powered Mobile GUI Agents

隐藏的幽灵之手:揭示MLLM驱动的移动GUI代理中的后门漏洞

Pengzhou Cheng, Haowen Hu, Zheng Wu, Zongru Wu, Tianjie Ju, Zhuosheng Zhang, Gongshen Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Huawei Inc.(华为公司)

专题命中 多模态Agent :MLLM(title,title_cn);multimodal(abstract);分类 cs.CL

AI总结 本研究提出AgentGhost框架,通过组合目标和交互层触发器,利用监督对比学习和微调注入后门,在移动GUI代理中实现高成功率和隐蔽性,攻击准确率达99.7%。

Comments EMNLP-Findings 2025 (Correcting model settings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30931 2026-06-15 cs.CL 版本更新 89%

MineExplorer: Evaluating Open-World Exploration of MLLM Agents in Minecraft

MineExplorer: 评估MLLM智能体在Minecraft中的开放世界探索能力

Tianjie Ju, Yueqing Sun, Zheng Wu, Wei Zhang, Yaqi Huo, Xi Su, Qi Gu, Xunliang Cai, Gongshen Liu, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Meituan(美团)

专题命中 多模态Agent :MLLM(title,title_cn);multimodal(abstract);分类 cs.CL

AI总结 提出MineExplorer基准,通过多智能体合成工作流构建隐式多跳任务,评估多模态大语言模型在Minecraft中的开放世界探索能力,发现长轨迹协调仍是挑战。

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28629 2026-05-28 cs.CL 89%

Mobile-Aptus: Confidence-Driven Proactive and Robust Interaction in MLLM-based Mobile-Using Agents

Mobile-Aptus: 基于MLLM的手机使用代理中的置信度驱动的主动与鲁棒交互

Zheng Wu, Pengzhou Cheng, Zongru Wu, Yuan Guo, Tianjie Ju, Aston Zhang, Gongshen Liu, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) GenAI, Meta(Meta的GenAI)

专题命中 多模态Agent :MLLM(title,title_cn);multimodal(abstract);分类 cs.CL

AI总结 针对手机使用代理中的过度执行和过度请求问题,提出一种置信度驱动的主动与鲁棒交互框架,通过监督微调和置信度偏差校正实现最优性能。

Comments Accepted by TASLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01639 2025-04-18 cs.RO cs.AI cs.CV cs.LG 88%

Know Where You're Uncertain When Planning with Multimodal Foundation Models: A Formal Framework

Neel P. Bhatt, Yunhao Yang, Rohan Siva, Daniel Milan, Ufuk Topcu, Zhangyang Wang

专题命中 多模态Agent :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV、cs.AI

Comments Fine-tuned models, code, and datasets are available at https://uncertainty-in-planning.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17016 2023-12-29 cs.CV cs.AI 88%

On the Promises and Challenges of Multimodal Foundation Models for Geographical, Environmental, Agricultural, and Urban Planning Applications

Chenjiao Tan, Qian Cao, Yiwei Li, Jielu Zhang, Xiao Yang, Huaqin Zhao, Zihao Wu, Zhengliang Liu, Hao Yang, Nemin Wu, Tao Tang, Xinyue Ye, Lilong Chai, Ninghao Liu, Changying Li, Lan Mu, Tianming Liu, Gengchen Mai

专题命中 多模态Agent :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV、cs.AI

Comments 110 Pages; 61 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.07194 2021-09-16 cs.AI cs.CL 88%

Multiagent Multimodal Categorization for Symbol Emergence: Emergent Communication via Interpersonal Cross-modal Inference

Yoshinobu Hagiwara, Kazuma Furukawa, Akira Taniguchi, Tadahiro Taniguchi

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CL、cs.AI

Comments 27 pages, 5 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10727 2025-04-14 cs.CV 88%

MLLM-Tool: A Multimodal Large Language Model For Tool Agent Learning

Chenyu Wang, Weixin Luo, Sixun Dong, Xiaohua Xuan, Zhengxin Li, Lin Ma, Shenghua Gao

专题命中 多模态Agent :MLLM(title,abstract);multimodal(title);multi-modal(abstract);分类 cs.CV

Comments WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16136 2026-06-19 cs.SE 88%

Seeing is Fixing: Cross-Modal Reasoning with Multimodal LLMs for Visual Software Issue Fixing

视觉即修复:基于多模态大语言模型的视觉软件问题修复

Kai Huang, Jian Zhang, Xiaofei Xie, Chunyang Chen

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(title,abstract)

AI总结 本文提出GUIRepair方法,通过多模态推理解决视觉软件问题,结合图像到代码和代码到图像的组件提升故障理解和修复验证。

Journal ref 2025 40th IEEE/ACM International Conference on Automated Software Engineering (ASE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17277 2026-03-10 cs.CR 88%

PolyJailbreak: Cross-Modal Jailbreaking Attacks on Black-Box Multimodal LLMs

PolyJailbreak: 对黑盒多模态大语言模型的跨模态劫持攻击

Xinkai Wang, Beibei Li, Zerui Shao, Ao Liu, Guangquan Xu, Shouling Ji

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(title,abstract)

AI总结 PolyJailbreak通过多模态安全性不对称现象,提出结构化原子策略原语库,实现对黑盒多模态大语言模型的高效劫持攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11195 2026-02-10 cs.CR 88%

SoK: The Security-Safety Continuum of Multimodal Foundation Models through Information Flow and Global Game-Theoretic Analysis of Asymmetric Threats

SoK:通过信息流和不对称威胁的全局博弈论分析,多模态基础模型的安全-安全性连续体

Ruoxi Sun, Jiamin Chang, Hammond Pearce, Chaowei Xiao, Bo Li, Qi Wu, Surya Nepal, Minhui Xue

专题命中 多模态Agent :multimodal(title,abstract);multimodal foundation model(title,abstract)

AI总结 本文通过信息流和博弈论分析,探讨多模态基础模型的安全与安全性连续体,提出系统级防护优于模型级防护,并定义自我破坏阈值以触发终止机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21168 2026-06-23 cs.CL 新提交 87%

Dementia-Agents: A Multi-Modal Multi-Agent System for Dementia Staging and Phenotyping

Dementia-Agents:用于痴呆分期和表型分析的多模态多智能体系统

Yaling Shen, Maja Christensen, Yiwen Jiang, Jenna Dennison, David Darby, Amy Brodtmann, Zongyuan Ge

机构 * Monash University(莫纳什大学) Eastern Health(东部健康) Lived Experience Advisor(生活经验顾问)

专题命中 多模态Agent :multi-modal(title,abstract);MLLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 提出Dementia-Agents多智能体框架,通过数据翻译、专家预测和协调聚合三步流程,在真实临床队列中实现优于单一MLLM和先前多智能体系统的痴呆综合征级分期与表型分析。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12018 2026-06-11 cs.AI 新提交 87%

MODF-SIR: A Multi-agent Omni-modal Distilled Framework for Social Intelligence Reasoning

MODF-SIR:面向社交智能推理的多智能体全模态蒸馏框架

Shang Ma, Jisheng Dang, Wencan Zhang, Yifan Zhang, Bimei Wang, Hong Peng, Bin Hu, Qi Tian, Tat-Seng Chua

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) School of Medical Technology, Beijing Institute of Technology(北京理工大学医学技术学院) Cloud and AI BU, Huawei(华为云与AI业务部) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 多模态Agent :omni-modal(title);MLLM(abstract,abstract_cn);multimodal(abstract);multi-modal(abstract)

AI总结 提出基于轻量级多模态大语言模型的多智能体协作框架,通过知识蒸馏增强训练与推理,结合测试时适应、长尾事件提取和链式思维提示,在多个基准上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14951 2026-04-17 cs.CV cs.AI cs.CL cs.MM 87%

RaTA-Tool: Retrieval-based Tool Selection with Multimodal Large Language Models

RaTA-Tool: 基于检索的多模态大语言模型工具选择

Gabriele Mattioli, Evelyn Turri, Sara Sarto, Lorenzo Baraldi, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出RaTA-Tool框架,利用多模态大语言模型将多模态查询转化为结构化任务描述,并通过语义丰富的工具描述检索合适工具,支持开放世界场景下的工具扩展。

Comments ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04364 2026-03-05 cs.LG cs.AI cs.CL 87%

Dual-Modality Multi-Stage Adversarial Safety Training: Robustifying Multimodal Web Agents Against Cross-Modal Attacks

双模多阶段对抗安全训练:增强多模态网络代理对跨模态攻击的鲁棒性

Haoyu Liu, Dingcheng Li, Lukas Rutishauser, Zeyu Zheng

机构 * UC Berkeley, IEOR & BAIR(伯克利大学) Google(谷歌) Google Deepmind(谷歌DeepMind)

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(title);分类 cs.CL、cs.AI

AI总结 DMAST通过三阶段对抗训练提升多模态网络代理对跨模态攻击的鲁棒性,显著提高任务完成效率并优于现有防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00810 2026-07-01 cs.CV cs.AI cs.CL cs.HC cs.LG 版本更新 87%

GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding

GUI-AIMA: 对齐内在多模态注意力与上下文锚点以实现GUI定位

Shijie Zhou, Viet Dac Lai, Hao Tan, Jihyung Kil, Wanrong Zhu, Changyou Chen, Ruiyi Zhang

机构 * University at Buffalo(布法罗大学) Adobe Research(Adobe研究院)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL、cs.AI

AI总结 GUI-AIMA通过多模态注意力对齐与上下文锚点,实现高效的GUI定位,无需坐标生成,提升数据效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18740 2026-06-03 cs.CV cs.AI cs.CL cs.LG 87%

Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation

Vision-OPD:通过在线策略自蒸馏学习多模态大语言模型的精细细节

Qianhao Yuan, Jie Lou, Xing Yu, Hongyu Lin, Le Sun, Xianpei Han, Yaojie Lu

机构 * Tsinghua University(清华大学)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL、cs.AI

AI总结 提出Vision-OPD框架,通过在线策略自蒸馏将模型自身的局部区域感知能力迁移到全局图像策略,提升多模态大语言模型对细粒度视觉理解的准确性。

Comments Project page: https://github.com/VisionOPD/Vision-OPD

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26543 2026-05-27 cs.AI cs.LG 86%

PolyFusionAgent: A Multimodal Foundation Model and Autonomous AI Assistant for Polymer Property Prediction and Inverse Design

PolyFusionAgent: 用于聚合物性能预测和逆向设计的多模态基础模型与自主AI助手

Manpreet Kaur, Xingying Zhang, Qian Liu

机构 * Department of Applied Computer Science, The University of Winnipeg(应用计算机科学系,温尼伯大学) Department of Mechanical Engineering, University of Manitoba(机械工程系,曼尼托巴大学)

专题命中 多模态Agent :multimodal(title,abstract);multimodal foundation model(title);分类 cs.AI

AI总结 提出PolyFusionAgent框架,结合多模态聚合物基础模型PolyFusion和工具增强的设计代理PolyAgent,通过对齐序列、拓扑、3D几何和指纹等多模态视图学习共享潜在空间,实现热物理性能预测和化学有效、结构新颖的聚合物逆向设计,并利用文献证据检索闭环设计流程。

Comments 23 pages, 5 figures, 2 tables; Supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27173 2026-03-06 cs.CE cs.AI cs.LG math.DS 86%

FMint-SDE: A Multimodal Foundation Model for Accelerating Numerical Simulation of SDEs via Error Correction

FMint-SDE:一种多模态基础模型,通过误差校正加速微分方程的数值模拟

Jiaxin Yuan, Haizhao Yang, Maria Cameron

机构 * University of Maryland(马里兰大学)

专题命中 多模态Agent :multimodal(title);multimodal foundation model(title);multi-modal(abstract);分类 cs.AI

AI总结 FMint-SDE通过多模态学习实现误差校正,提升微分方程数值模拟的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17729 2026-02-05 cs.AI 86%

M^3-Bench: Multi-Modal, Multi-Hop, Multi-Threaded Tool-Using MLLM Agent Benchmark

M^3-Bench: 多模态、多跳、多线程工具使用 MLLM agent 评估基准

Yang Zhou, Mingyu Zhao, Zhenting Wang, Difei Gu, Bangwei Guo, Ruosong Ye, Ligong Han, Can Jin, Dimitris N. Metaxas

机构 * Rutgers University(新泽西罗格斯大学)

专题命中 多模态Agent :multi-modal(title);MLLM(title);multimodal(abstract);分类 cs.AI

AI总结 M^3-Bench是首个评估多模态工具使用下模型上下文协议的基准,通过多跳、多线程工作流和可追溯的一对一对应关系,揭示了多模态大语言模型在论点保真度和结构一致性方面的持续差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09532 2025-10-07 cs.RO cs.AI 86%

Humanoid Agent via Embodied Chain-of-Action Reasoning with Multimodal Foundation Models for Zero-Shot Loco-Manipulation

Congcong Wen, Geeta Chandra Raju Bethala, Yu Hao, Niraj Pudasaini, Hao Huang, Shuaihang Yuan, Baoru Huang, Anh Nguyen, Mengyu Wang, Anthony Tzes, Yi Fang

机构 * Embodied AI and Robotics (AIR) Lab, New York University, New York, USA and NYUAD Center for Artificial Intelligence and Robotics, New York University Abu Dhabi, Abu Dhabi, UAE(纽约大学Embodied AI和机器人实验室及纽约大学阿布扎赫尔人工智能与机器人中心) Harvard AI and Robotics Lab, Harvard University, Boston, USA(哈佛大学人工智能与机器人实验室) Department of Computer Science, University College London, London, UK(伦敦大学学院计算机科学系) Department of Computer Science, University of Liverpool, UK(利物浦大学计算机科学系) NYUAD Center for Artificial Intelligence and Robotics, New York University Abu Dhabi, Abu Dhabi, UAE(纽约大学阿布扎赫尔人工智能与机器人中心)

专题命中 多模态Agent :multimodal(title,abstract);multimodal foundation model(title);分类 cs.AI

Comments website link: https://humanoid-coa.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.01997 2019-08-07 eess.IV cs.CV 86%

Learning Cross-Modal Deep Representations for Multi-Modal MR Image Segmentation

Cheng Li, Hui Sun, Zaiyi Liu, Meiyun Wang, Hairong Zheng, Shanshan Wang

专题命中 多模态Agent :multi-modal(title,abstract);cross-modal(title);分类 cs.CV

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06699 2026-08-10 cs.AI cs.CV 新提交 86%

AgentPatch: Coarse-to-Fine Weak-Task Repair for Merging Agentic Multimodal Large Language Models

AgentPatch:用于合并智能体多模态大语言模型的由粗到细弱任务修复

Zibo Shao, Baochen Xiong, Chengdong Xu, Linhui Xiao, Kaichen Li, Haoran Gong, Yan Li, Yaguang Song, Xiaoshan Yang

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 针对智能体多模态大语言模型合并时的弱任务退化与关键行为遗忘问题,提出无需训练的AgentPatch框架,通过由粗到细修复实现能力平衡,提升合并模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23483 2026-07-07 cs.CV cs.CL 版本更新 86%

SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning

SpecEyes: 通过推测感知和规划加速代理多模态大语言模型

Haoyu Huang, Jinfa Huang, Zhongwei Wan, Xiawu Zheng, Rongrong Ji, Jiebo Luo

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL

AI总结 SpecEyes通过推测规划框架减少代理多模态大语言模型的序列开销,提升并发性能,实验显示在保持准确性的同时实现1.1-3.35倍的加速。

Comments ECCV 2026, Code: https://github.com/MAC-AutoML/SpecEyes

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12953 2026-05-14 cs.CV cs.AI 86%

Seg-Agent: Test-Time Multimodal Reasoning for Training-Free Language-Guided Segmentation

Seg-Agent: 无训练语言引导分割的测试时多模态推理

Chao Hao, Jun Xu, Ji Du, Shuo Ye, Ziyue Qiao, Xiaodong Cun, Guangcong Wang, Xubin Zheng, Zitong Yu

机构 * School of Computing and Information Technology(计算与信息科技学院) Great Bay University(大湾大学) Hangzhou International Innovation Institute(杭州国际创新研究院) Beihang University(北航大学) Department of Computing(计算系) The Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 Seg-Agent提出无训练的多模态推理框架,通过生成-选择-细化三阶段循环实现视觉区域分割,无需参数更新即可达到与训练方法相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09269 2026-05-12 cs.CL cs.CV 86%

DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification

DeltaRubric: 通过联合规划和验证实现生成式多模态奖励建模

Rui Liu, Dian Yu, Zhenwen Liang, Yucheng Shi, Tong Zheng, Runpeng Dai, Haitao Mi, Pratap Tokekar, Leoweiliang

机构 * Tencent Hunyuan(腾讯文元) University of Maryland, College Park(马里兰大学 College Park 分校) University of North Carolina, Chapel Hill(北卡罗来纳大学 Chapel Hill 分校)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL

AI总结 DeltaRubric通过联合规划和验证流程,提升多模态奖励建模的可靠性与泛化能力,实验表明其在多模态任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27419 2026-05-01 cs.AI cs.CL 86%

InteractWeb-Bench: Can Multimodal Agent Escape Blind Execution in Interactive Website Generation?

InteractWeb-Bench: 多模态代理能否在交互式网站生成中避免盲目执行?

Qiyao Wang, Haoran Hu, Longze Chen, Hongbo Wang, Hamid Alinejad-Rokny, Yuan Lin, Min Yang

机构 * Shenzhen Institute of Advanced Technology Chinese Academy of Sciences(深圳先进技术研究院中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Dalian University of Technology(大连理工大学) UNSW Sydney(悉尼大学) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出InteractWeb-Bench,首个针对非专家低代码用户的多模态交互基准,通过模拟用户行为中的模糊性、冗余性和矛盾性,揭示前沿多模态大语言模型在意图识别和适应性交互上的局限。

Comments 21 pages, 13 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14239 2025-04-22 cs.AI cs.CL 86%

InfiGUI-R1: Advancing Multimodal GUI Agents from Reactive Actors to Deliberative Reasoners

Yuhang Liu, Pengxiang Li, Congkai Xie, Xavier Hu, Xiaotian Han, Shengyu Zhang, Hongxia Yang, Fei Wu

机构 * Zhejiang University(浙江大学) Dalian University of Technology(大连理工大学) Reallm Labs(Reallm实验室) The Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

Comments 10 pages, 3 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16158 2024-04-19 cs.CL cs.CV 86%

Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception

Junyang Wang, Haiyang Xu, Jiabo Ye, Ming Yan, Weizhou Shen, Ji Zhang, Fei Huang, Jitao Sang

专题命中 多模态Agent :multi-modal(title,abstract);multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL

Comments Accepted by ICLR 2024 Workshop in Large Language Model (LLM) Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05729 2026-08-07 cs.AI cs.CL cs.CV cs.HC 新提交 86%

Unified Agent: Managing Interactions across Devices

统一智能体:管理跨设备交互

Xinshuang Liu, Runfa Blark Li, Shaoxiu Wei, Xin Lin, Truong Nguyen

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 多模态Agent :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文针对现有智能体跨设备交互场景的不足,提出带紧凑状态设计的统一智能体,构建对应基准数据集,其性能显著优于多种现有设计,且在不同MLLM设置下表现鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00962 2026-08-04 cs.AI 新提交 85%

PMMC: Prospective Multimodal Memory Compilation for Long-Term LVLM Agents

PMMC:面向长期LVLM智能体的前瞻性多模态记忆编译

Jingyu Sun, Yan Lin, Yuyang Xue, Yifan Wang, Zhengtao Yao, Rui Qian, Zefeng Xu, Jiachen Li, Xianyang Liu, Jiancheng Pan, Jingyuan Sun, Syed Murtuza Baker, Hongpeng Zhou

专题命中 多模态Agent :multimodal(title,abstract);image-text(abstract);分类 cs.AI

AI总结 针对现有LVLM智能体记忆系统的缺陷,提出PMMC框架,将部分记忆推理移至整合阶段,构建结构化问题库,提升答案质量与证据召回率,降低查询成本。

详情

展开后加载摘要…

URL PDF HTML 收藏