arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2766 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2766 篇

2603.15030 2026-03-20 cs.AI 79%

VTC-Bench: Evaluating Agentic Multimodal Models via Compositional Visual Tool Chaining

VTC-Bench:通过组合视觉工具链评估代理多模态模型

Xuanyu Zhu, Yuhao Dong, Rundong Wang, Yang Shi, Zhipeng Wu, Yinlun Peng, YiFan Zhang, Yihang Lou, Yuanxing Zhang, Ziwei Liu, Yan Bai, Yuan Zhou

机构 * PKU(北京大学) NTU(国立台湾大学) USTC(中国科学技术大学) CQU(重庆大学) NUDT(南京理工大学) CASIA(中国科学院自动化研究所) Meituan(美团)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 VTC-Bench通过组合视觉工具链评估多模态大语言模型的工具使用能力,揭示了当前模型在复杂任务中适应性和多工具组合方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09909 2026-03-20 cs.AI 79%

MedMASLab: A Unified Orchestration Framework for Benchmarking Multimodal Medical Multi-Agent Systems

MedMASLab:多模态医疗多智能体系统的统一协调框架

Yunhang Qian, Xiaobin Hu, Jiaquan Yu, Siyang Xin, Xiaokun Chen, Jiangning Zhang, Peng-Tao Jiang, Jiawei Liu, Hongwei Bran Li

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Zhejiang University(浙江大学) vivo Stanford University(斯坦福大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出MedMASLab框架,解决医疗多智能体系统中多模态整合碎片化问题,通过标准化通信协议、自动化评估器和大规模基准测试,揭示领域特定性能差距,为未来自主临床系统建立新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17826 2026-03-19 cs.SE cs.AI 79%

FailureMem: A Failure-Aware Multimodal Framework for Autonomous Software Repair

FailureMem: 一种面向故障的多模态框架用于自主软件修复

Ruize Ma, Yilei Jiang, Shilin Zhang, Zheng Ma, Yi Feng, Vincent Ng, Zhi Wang, Xiangyu Yue, Chuanyi Li, Lewei Lu

机构 * Nanjing University(南京大学) SenseTime(秒速) The Chinese University of Hong Kong(香港中文大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出FailureMem框架,通过融合工作流代理、主动感知工具和故障记忆库,提升多模态自动程序修复的效率与准确性,实验表明其在GUI修复任务中解决率提升3.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17191 2026-03-19 cs.CL cs.LG q-bio.QM 79%

Tabular LLMs for Interpretable Few-Shot Alzheimer's Disease Prediction with Multimodal Biomedical Data

用于多模态生物医学数据的可解释少样本阿尔茨海默病预测的表格LLMs

Sophie Kearney, Shu Yang, Zixuan Wen, Weimin Lyu, Bojian Hou, Duy Duong-Tran, Tianlong Chen, Jason H. Moore, Marylyn D. Ritchie, Chao Chen, Li Shen

机构 * University of Pennsylvania(宾夕法尼亚大学) Stony Brook University(石溪大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Medical University of South Carolina(南卡罗来纳医科大学) Cedars-Sinai Medical Center(西格拉姆山医疗中心)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出TAP-GPT框架,利用预训练的大语言模型进行少样本阿尔茨海默病分类,展示了其在多模态生物医学数据中的优越性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15797 2026-03-19 cs.LG cs.AI 79%

OMNIFLOW: A Physics-Grounded Multimodal Agent for Generalized Scientific Reasoning

OMNIFLOW:一种基于物理的多模态代理用于通用科学推理

Hao Wu, Yongheng Zhang, Yuan Gao, Fan Xu, Fan Zhang, Ruobing Xie, Ruijian Gou, Yuxuan Liang, Xiaomeng Huang, Xian Wu

机构 * Tsinghua University(清华大学) Tencent(腾讯) Shenzhen Loop Area Institute(深圳河套学院) Ocean University of China(海洋大学) HKUST (Guangzhou)(香港科技大学(广州))

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 OMNIFLOW通过引入语义-符号对齐机制和物理引导的推理流程,实现了多模态模型在物理定律下的科学推理,显著提升了零样本泛化和少样本适应能力,提供透明且物理一致的推理报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02458 2026-03-19 cs.CV 79%

Vision to Geometry: 3D Spatial Memory for Sequential Embodied MLLM Reasoning and Exploration

视觉到几何:用于连续具身MLLM推理和探索的3D空间记忆

Zhongyi Cai, Yi Du, Chen Wang, Yu Kong

机构 * ACTION Lab, Michigan State University(密歇根州立大学ACTION实验室) SAIR Lab, University at Buffalo(布法罗大学SAIR实验室)

专题命中 多模态Agent :MLLM(title);multi-modal(abstract);分类 cs.CV

AI总结 本文提出3DSPMR框架,利用视场覆盖作为几何先验,提升具身智能在连续任务中的记忆、推理与探索能力,并引入SEER-Bench基准测试连续具身探索与推理任务。

Comments Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19405 2026-03-19 cs.CV 79%

Multi-modal 3D Pose and Shape Estimation with Computed Tomography

基于计算机断层扫描的多模态3D姿态和形状估计

Mingxiao Tu, Hoijoon Jung, Alireza Moghadam, Jineel Raythatha, Lachlan Allan, Jeremy Hsu, Andre Kyme, Jinman Kim

机构 * School of Computer Science, The University of Sydney, Sydney, NSW 2006, Australia(悉尼大学计算机科学学院) School of Biomedical Engineering, The University of Sydney, Sydney, NSW 2006, Australia(悉尼大学生物医学工程学院) Trauma Service, Westmead Hospital, Australia(西墨迪医院创伤服务)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出一种多模态在床患者3D姿态和形状估计网络,融合CT扫描的几何特征和深度图,有效重建遮挡区域并提升估计精度,实验表明其在姿态和形状估计上分别优于现有方法23%和49.16%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16777 2026-03-18 cs.AI 79%

Anticipatory Planning for Multimodal AI Agents

多模态AI代理的前瞻性规划

Yongyuan Liang, Shijie Zhou, Yu Gu, Hao Tan, Gang Wu, Franck Dernoncourt, Jihyung Kil, Ryan A. Rossi, Ruiyi Zhang

机构 * University of Maryland, College Park(马里兰大学学院公园分校) The Ohio State University(俄亥俄州立大学) Adobe Research(Adobe研究) State University of New York at Buffalo(纽约州立大学布法罗分校)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出TraceR1框架,通过前瞻性轨迹推理提升多模态代理的规划能力,实现更稳定的执行和泛化性能。

Comments Published at CVPR 2026 Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10376 2026-03-18 cs.CV cs.RO 79%

MSGNav: Unleashing the Power of Multi-modal 3D Scene Graph for Zero-Shot Embodied Navigation

MSGNav: 释放多模态3D场景图在零样本具身导航中的潜力

Xun Huang, Shijia Zhao, Yunxiang Wang, Xin Lu, Wanfa Zhang, Rongsheng Qu, Weixin Li, Yunhong Wang, Chenglu Wen

机构 * Fujian Key Laboratory of Urban Intelligent Sensing and Computing(福建智能感知与计算重点实验室) Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China(多媒体可信感知与高效计算重点实验室) Beihang University(北航) Nanyang Technological University(南洋理工大学) University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Academy(中关村学院)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.CV

AI总结 MSGNav通过多模态3D场景图实现零样本具身导航,引入关键子图选择模块、自适应词汇更新模块和闭环推理模块,解决开放词汇和视觉证据保留问题,实验表明其在GOAT-Bench和HM3D-ObjNav基准上表现优异。

Comments 18 pages, Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15280 2026-03-17 cs.AI 79%

Advancing Multimodal Agent Reasoning with Long-Term Neuro-Symbolic Memory

通过长期神经符号记忆推进多模态代理推理

Rongjie Jiang, Jianwei Wang, Gengda Zhao, Chengyang Luo, Kai Wang, Wenjie Zhang

机构 * University of New South Wales(新南威尔士大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出NS-Mem框架,结合神经记忆与符号结构,提升多模态代理的推理能力,实验证明其在推理准确率上优于纯神经记忆系统。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01607 2026-03-12 cs.AI cs.LG 79%

CARE: Towards Clinical Accountability in Multi-Modal Medical Reasoning with an Evidence-Grounded Agentic Framework

CARE:迈向多模态医学推理中的临床问责的证据基础代理框架

Yuexi Du, Jinglu Wang, Shujie Liu, Nicha C. Dvornek, Yan Lu

机构 * Microsoft Research Asia(微软亚洲研究院) Department of Biomedical Engineering, Yale University(耶鲁大学生物医学工程系) Department of Radiology & Biomedical Imaging, Yale University(耶鲁大学放射学与生物医学成像系)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.AI

AI总结 CARE通过证据基础的代理框架提升多模态医学推理的准确性与问责性,结合解耦的专业模型和明确证据,实现更可靠的医学AI。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16410 2026-03-12 cs.CV 79%

REALM: An MLLM-Agent Framework for Open World 3D Reasoning Segmentation and Editing on Gaussian Splatting

REALM:一种用于高斯点划法上开放世界3D推理分割和编辑的MLLM-代理框架

Changyue Shi, Minghao Chen, Yiping Mao, Chuxiao Yang, Xinyuan Hu, Jiajun Ding, Zhou Yu

机构 * Hangzhou Dianzi University(杭州电子科技大学) Peking University(北京大学)

专题命中 多模态Agent :MLLM(title,abstract);分类 cs.CV

AI总结 REALM通过MLLM-代理框架实现开放世界3D推理分割和编辑,支持多种3D交互任务。

Comments CVPR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09415 2026-03-11 cs.RO cs.AI 79%

From Flow to One Step: Real-Time Multi-Modal Trajectory Policies via Implicit Maximum Likelihood Estimation-based Distribution Distillation

从流到一步:通过隐式最大似然估计基于的分布蒸馏实现实时多模轨迹策略

Ju Dong, Liding Zhang, Lei Zhang, Yu Fu, Kaixin Bai, Zoltan-Csaba Marton, Zhenshan Bing, Zhaopeng Chen, Alois Christian Knoll, Jianwei Zhang

机构 * TAMS (Technical Aspects of Multimodal Systems), Department of Informatics, University of Hamburg(汉堡大学信息学院TAMS(多模态系统技术方面)) Technical University of Munich(慕尼黑技术大学) Agile Robots SE(敏捷机器人公司)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.AI

AI总结 通过隐式最大似然估计基于的分布蒸馏,实现实时多模轨迹策略,提升机器人操作的高频闭环控制与鲁棒性。

Comments https://sites.google.com/view/flow2one, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09018 2026-03-11 cs.AI 79%

Meissa: Multi-modal Medical Agentic Intelligence

Meissa:多模态医疗代理智能

Yixiong Chen, Xinyi Bai, Yue Pan, Zongwei Zhou, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学) Cornell University(康奈尔大学)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.AI

AI总结 Meissa是一种轻量级多模态医疗代理智能模型,通过离线学习策略选择与执行,实现高效医疗决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08369 2026-03-10 cs.AI 79%

M$^3$-ACE: Rectifying Visual Perception in Multimodal Math Reasoning via Multi-Agentic Context Engineering

M$^3$-ACE: 通过多智能体上下文工程校正多模态数学推理中的视觉感知

Peijin Xie, Zhen Xu, Bingquan Liu, Baoxun Wang

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 M3-ACE 通过多智能体上下文工程校正多模态数学推理中的视觉感知问题,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02795 2026-03-09 cs.CV 79%

VSearcher: Long-Horizon Multimodal Search Agent via Reinforcement Learning

VSearcher:通过强化学习实现长周期多模态搜索代理

Ruiyang Zhang, Qianguo Sun, Chao Song, Yiyan Qi, Zhedong Zheng

机构 * University of Macau(澳门大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 VSearcher通过强化学习实现多模态搜索代理,提升长周期多轮工具使用能力,在多模态网络搜索任务中表现优异。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02888 2026-03-04 cs.CV 79%

LLandMark: A Multi-Agent Framework for Landmark-Aware Multimodal Interactive Video Retrieval

LLandMark:一种用于地标感知多模态交互视频检索的多智能体框架

Minh-Chi Phung, Thien-Bao Le, Cam-Tu Tran-Thi, Thu-Dieu Nguyen-Thi, Vu-Hung Dao

机构 * AI VIETNAM(AI越南)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 LLandMark通过多智能体框架实现地标感知的多模态视频检索,结合LLM和OCR技术提升文化场景下的检索能力与可解释性。

Comments Accepted by AAAI 2026 Workshop on New Frontiers in Information Retrieval

Journal ref AAAI 2026 Workshop on New Frontiers in Information Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02626 2026-03-04 cs.AI 79%

See and Remember: A Multimodal Agent for Web Traversal

见与忆:一种用于网页浏览的多模态代理

Xinjun Wang, Shengyao Wang, Aimin Zhou, Hao Hao

机构 * Shanghai Institute of AI for Education(上海人工智能教育研究院) East China Normal University(华东师范大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 V-GEMS通过视觉 grounding 和显式记忆系统实现精确稳健的网页浏览,实验显示其在导航任务中性能提升28.7%

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02519 2026-03-04 cs.MM cs.IR 79%

Agentic Mixed-Source Multi-Modal Misinformation Detection with Adaptive Test-Time Scaling

具有自适应测试时间缩放的代理混合源多模态虚假信息检测

Wei Jiang, Tong Chen, Wei Yuan, Quoc Viet Hung Nguyen, Hongzhi Yin

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.MM

AI总结 AgentM3D通过自适应测试时间缩放和多代理框架提升零样本多模态虚假信息检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20346 2026-03-04 cs.CR cs.AI cs.LG 79%

Multimodal Multi-Agent Ransomware Analysis Using AutoGen

基于AutoGen的多模态多智能体勒索软件分析

Asifullah Khan, Aimen Wadood, Mubashar Iqbal, Umme Zahoora

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出基于AutoGen的多模态多智能体框架,通过融合静态、动态和网络信息,提升勒索软件分类的准确性和稳定性。

Comments 46 pages, 11 figures and 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00324 2026-03-03 cs.CV 79%

Proof-of-Perception: Certified Tool-Using Multimodal Reasoning with Compositional Conformal Guarantees

证明-感知:具有组合性符合保证的认证工具使用多模态推理

Arya Fayyazi, Haleh Akrami

机构 * University of Southern California(南加州大学) Nuro

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 Proof-of-Perception通过组合性符合保证实现多模态推理的可信工具使用,提升性能和可靠性,同时更高效地利用计算资源。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02780 2026-02-27 cs.HC cs.AI cs.ET q-bio.TO 79%

Beyond the Monitor: Mixed Reality Visualization and Multimodal AI for Enhanced Digital Pathology Workflow

超越监视器:混合现实可视化与多模态AI用于增强的数字病理学工作流程

Jai Prakash Veerla, Partha Sai Guttikonda, Helen H. Shang, Mohammad Sadegh Nasr, Cesar Torres, Jacob M. Luber

机构 * Department of Computer Science and Engineering, University of Texas at Arlington(计算机科学与工程系,德克萨斯大学阿灵顿分校) Department of Medicine Division of Hematology-Oncology, UCLA(医学系血液肿瘤学分会,加州大学洛杉矶分校) Center for Innovation in Health Informatics, University of Texas at Arlington(健康信息创新中心,德克萨斯大学阿灵顿分校)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 PathVis通过混合现实和多模态AI优化数字病理学工作流程,提升诊断效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21517 2026-02-26 cs.CV 79%

Which Tool Response Should I Trust? Tool-Expertise-Aware Chest X-ray Agent with Multimodal Agentic Learning

我应该信任哪个工具响应?具有工具-专业知识意识的胸片代理与多模态代理学习

Zheang Huai, Honglong Yang, Xiaomeng Li

机构 * The Hong Kong University of Science(香港科学与技术大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出TEA-CXA,一种具有工具-专业知识意识的胸片代理,通过多模态代理学习解决医疗工具冲突问题,提升多轮工具调用的可靠性。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21087 2026-02-26 cs.CV 79%

MIRA: Multimodal Iterative Reasoning Agent for Image Editing

MIRA: 多模态迭代推理代理用于图像编辑

Ziyun Zeng, Hang Hua, Jiebo Luo

机构 * University of Rochester(罗切斯特大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 MIRA通过多模态迭代推理代理提升图像编辑的语义一致性和感知质量,结合自研数据集和训练流程,实现与专有系统相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19304 2026-02-24 cs.RO cs.AI cs.HC cs.MA 79%

Safe and Interpretable Multimodal Path Planning for Multi-Agent Cooperation

安全且可解释的多模态路径规划用于多智能体协作

Haojun Shi, Suyu Ye, Katherine M. Guerrerio, Jianzhi Shen, Yifan Yin, Daniel Khashabi, Chien-Ming Huang, Tianmin Shu

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 CaPE通过多模态路径规划实现安全且可解释的多智能体协作,利用视觉-语言模型和模型基于规划器确保路径调整的安全性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18731 2026-02-24 cs.AI 79%

Beyond Description: A Multimodal Agent Framework for Insightful Chart Summarization

超越描述:一种多模态代理框架用于深入的图表摘要

Yuhang Bai, Yujuan Ding, Shanru Lin, Wenqi Fan

机构 * The Hong Kong Polytechnic University(香港理工大学) City University of Hong Kong(香港城市大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出多模态代理框架Chart Insight Agent Flow,通过结合MLLMs的感知与推理能力,提升图表摘要的深度和多样性,并引入新数据集ChartSummInsights以支持研究。

Comments 5 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16493 2026-02-19 cs.CV 79%

MMA: Multimodal Memory Agent

MMA:多模态记忆代理

Yihao Lu, Wanru Cheng, Zeyu Zhang, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机学院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 MMA通过动态可靠性评分和冲突感知网络共识,提升多模态代理在长horizon任务中的记忆检索与决策能力,同时在多个基准测试中展现优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17812 2026-02-18 cs.CL cs.LG 79%

Can Multimodal LLMs Perform Time Series Anomaly Detection?

多模态大语言模型能否进行时间序列异常检测?

Xiongxiao Xu, Haoran Wang, Yueqing Liang, Philip S. Yu, Yue Zhao, Kai Shu

机构 * Illinois Institute of Technology(伊利诺伊理工学院) Emory University(埃默里大学) University of Illinois Chicago(伊利诺伊大学香槟分校) University of Southern California(南加州大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

AI总结 本研究提出基于多代理框架的TSAD-Agents,利用多模态大语言模型实现自动时间序列异常检测。

Comments ACM Web Conference 2026 (WWW'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10814 2026-02-12 cs.AI 79%

See, Plan, Snap: Evaluating Multimodal GUI Agents in Scratch

见、计划、快照:评估Scratch中的多模态GUI代理

Xingyi Zhang, Yulei Ye, Kaifeng Huang, Wenhao Li, Xiangfeng Wang

机构 * Tongji University(同济大学) East China Normal University(华东师范大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出ScratchWorld基准,用于评估多模态GUI代理在Scratch中的程序构建能力,揭示了推理与执行之间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07624 2026-02-10 cs.AI 79%

M2A: Multimodal Memory Agent with Dual-Layer Hybrid Memory for Long-Term Personalized Interactions

M2A:具有双层混合记忆的多模态记忆代理用于长期个性化交互

Junyu Feng, Binxiao Xu, Jiayi Chen, Mengyu Dai, Cenyang Wu, Haodong Li, Bohan Zeng, Yunliu Xie, Hao Liang, Ming Lu, Wentao Zhang

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 M2A通过双层混合记忆系统实现长期多模态交互中的个性化响应,利用在线更新机制提升用户偏好适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏