PaLM-E: An Embodied Multimodal Language Model
专题命中 多模态Agent :multimodal(title,abstract);multi-modal(abstract);分类 cs.AI
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态Agent :multimodal(title,abstract);multi-modal(abstract);分类 cs.AI
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments AAAI 2023
专题命中 多模态Agent :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV
Comments 14 pages, 9 figures, 1 table, accepted to PatReCH 2022 Workshop at ICPR 2022
ChartAgent: 一种用于复杂图表问答中视觉基础推理的多模态智能体
机构 * J.P. Morgan AI Research(摩根大通人工智能研究)
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 提出ChartAgent框架,通过迭代分解查询为视觉子任务并利用图表专用视觉工具(如绘制注释、裁剪区域)进行空间域推理,在ChartBench和ChartX上取得最先进性能,尤其对无标注图表提升显著。
Comments Accepted at ACL 2026 (Main Conference). Also presented as an oral paper at the NeurIPS 2025 Multimodal Algorithmic Reasoning Workshop (https://marworkshop.github.io/neurips25/)
DocOCR-Eval:一种无需真实标签的基于校正的OCR工具选择框架
专题命中 多模态Agent :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.CL、cs.AI
AI总结 针对文档解析中OCR工具选择难题,尤其是标签稀缺情况,提出无标注评估框架DocOCR-Eval。它采用三阶段校正和排序策略,通过跨多个MLLM聚合改善与基于标注排名的对齐,能在现实有限标签设置中实现可靠OCR工具选择并提供实用指导。
Comments Work in progress
LEDGERMIND:基于结构化证据账本的溯源约束多模态智能体推理
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The University of Hong Kong(香港大学) ; Tsinghua University(清华大学) ; University of Sussex(萨塞克斯大学)
专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract_cn)
AI总结 该研究提出LedgerMind,通过结构化证据账本及三层依据协议等组件,解决多模态智能体推理中最终答案准确率无法反映轨迹可信度的问题,在多模态基准上同时提升了答案准确率与轨迹可信度。
EdgeCoInfer:用于设备端多模态大模型的分层协作推理
专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract)
AI总结 针对边缘环境中多模态大模型面临的挑战,提出EdgeCoInfer框架,通过模型间功能模块共享和模型内细粒度划分实现粒度自适应部署,采用混合进化分层强化学习解决问题,实验表明该框架能提高任务完成率并降低系统成本和内存消耗。
多模式城市交通网络均衡包含换乘和共享出行服务
专题命中 多模态Agent :multimodal(title,abstract);multi-modal(abstract)
AI总结 本文研究多模式交通系统中共享出行服务对交通均衡的影响,提出包含多种出行方式的交通分配模型,通过混合整数双曲线性规划方法分析用户均衡与系统最优之间的差异。
Journal ref European Transport Research Review, 18, 41 (2026)
MIRAGE:用于全脑fMRI编码的自适应多模态门控
机构 * Qwen3-Omni-30B-A3B-Thinking(通义千问3- Omni-30B-A3B-Thinking)
专题命中 多模态Agent :multimodal(title,abstract);omni-modal(abstract)
AI总结 提出MIRAGE框架,通过原生多模态骨干网络和自适应特征门控,实现全脑fMRI对自然视听刺激的高精度编码,并证明原生多模态特征优于后期融合的单模态特征。
Comments Preprint. First two author contributed equally
CVSearch:赋予多模态大语言模型认知视觉搜索能力以感知高分辨率图像
机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) ; Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China(深圳先进技术研究院)
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 提出CVSearch,一种无需训练的自适应框架,通过评估-搜索工作流动态调度视觉搜索策略,解决高分辨率图像感知中覆盖与效率的权衡问题。
Comments Accepted by ICML 2026. 22 pages, 12 figures, 7 tables
Skill-CMIB: 多模态代理技能用于通过条件多模态信息瓶颈实现一致行动
机构 * UC San Diego(UC圣地亚哥大学) ; Adobe Research(Adobe研究院) ; UC Santa Barbara(UC圣芭芭拉大学) ; University of New South Wales(新南威尔士大学)
专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract)
AI总结 本文提出Skill-CMIB方法,通过条件多模态信息瓶颈构建多模态技能,解决多模态环境下代理执行不一致的问题,提升执行稳定性。
CUJBench:跨模态故障诊断的LLM-代理基准测试
专题命中 多模态Agent :cross-modal(title,abstract);multi-modal(abstract)
AI总结 CUJBench是首个结合浏览器可见故障证据与后端可观测性的跨模态故障诊断基准测试,通过LLM辅助生成管道降低标注成本,评估六种前沿模型发现跨模态综合是主要瓶颈。
Comments 10 pages, 1 figure; updated source code url
MM-WebAgent:一种用于网页生成的分层多模态网络代理
机构 * Shanghai Jiao Tong University(上海交通大学) ; Xi'an Jiaotong University(西安交通大学) ; Tongji University(同济大学) ; Microsoft Corporation(微软公司)
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出MM-WebAgent,一种分层多模态网页生成框架,通过分层规划和迭代自反思协调AIGC元素生成,提升网页全局布局与视觉一致性。
Q-Agent:通过鲁棒多模态大语言模型实现质量驱动的推理图像修复代理
专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract)
AI总结 本文提出Q-Agent,通过Chain-of-Thought方法提升图像修复性能,结合鲁棒多模态大语言模型和客观图像质量评估,实现更高效的多退化处理。
通过MLLM驱动的感知、通信与计算推进多机器人网络:综述
机构 * Seoul National University(首尔大学) ; Ajou University(亚洲大学) ; Sungkyunkwan University(成均馆大学) ; Korea University(高丽大学) ; POSTECH(浦项科技大学) ; Stony Brook University(石溪大学)
专题命中 多模态Agent :MLLM(title,abstract);multimodal(abstract)
AI总结 本文综述了MLLM指导下的多机器人协调,探讨了集成设计对多机器人协作的影响,展示了四种端到端演示,强调了系统级指标的重要性。
何时以及如何将多模态大语言模型整合到大学生心理治疗中:来自多利益相关者的视角
专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract)
AI总结 本研究探讨了多模态大语言模型在大学生心理治疗中的整合时机与方式,指出其作为辅助工具的作用,并揭示了用户接受度受社交身份和相对地位影响的关键因素。
MMedAgent-RL: 优化多智能体协作以实现多模态医疗推理
机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) ; Microsoft Research(微软研究院) ; CMU(卡内基梅隆大学) ; Rutgers University(罗格斯大学) ; Yale University(耶鲁大学)
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 MMedAgent-RL通过强化学习优化多智能体协作,提升多模态医疗推理性能,实现23.6%的性能提升。
Comments ICLR 2026
探索推荐系统评估:一种用于A/B测试的多模态用户代理框架
专题命中 多模态Agent :multi-modal(title,abstract);multimodal(abstract)
AI总结 本文提出一种多模态用户代理框架,用于替代传统A/B测试,通过模拟真实用户行为提升推荐系统性能。
E$^2$AT: 通过动态联合优化实现多模态对抗防御
机构 * School of Cyber Science and Engineering, Nanjing University of Science and Technology, China(南京理工大学信息科学与工程学院) ; HKUST(GZ) and INSAIT, Sofia University St. Kliment Ohridski(香港科技大学(广州)及INSAIT,索菲亚大学圣克莱门特·奥赫里迪斯学院) ; College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院)
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 E$^2$AT通过动态联合优化提升多模态大语言模型对对抗攻击的鲁棒性,实验显示其在文本和图像模态上性能优于现有方法34%。
基于长上下文Q-Former与多模态大语言模型的机器人确认生成与动作规划
机构 * Mitsubishi Electric Research Laboratories (MERL), Cambridge, MA, USA(三菱电机研究实验室(MERL),马萨诸塞州剑桥市)
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、eess.AS
AI总结 本文提出基于长上下文Q-former与多模态大语言模型的机器人确认生成与动作规划方法,通过整合视频上下文信息提升动作规划性能。
Comments Accepted to ASRU 2025
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI、cs.MM
Comments Accepted by AAAI 2026
专题命中 多模态Agent :multimodal(title,abstract);multi-modal(abstract)
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments We have come across a recent approach that has not been properly attributed at the time of submission and compared in a fair setting. Therefore, we would like to withdraw the paper to address these concerns
专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract)
专题命中 多模态Agent :MLLM(title,abstract);multi-modal(abstract)
机构 * Amazon(亚马逊公司) ; Alexa, Amazon(亚马逊Alexa部门) ; Virginia Tech(弗吉尼亚理工大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract)
Comments 17 pages, 9 figures, 14 tables, Findings of the Association for Computational Linguistics: EMNLP 2025
机构 * Zhejiang University(浙江大学) ; Fudan University(复旦大学) ; OPPO AI Center(OPPO AI中心) ; University of Chinese Academy of Sciences(中国科学院大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; The Chinese University of Hong Kong(香港中文大学) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 多模态Agent :MLLM(title);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments ACL 2025 (Oral)
机构 * School of Mathematical and Computational Sciences, Massey University, Auckland, New Zealand(梅西大学数学与计算科学学院) ; School of Computer Science and Informatics, Cardiff University, Cardiff, UK(卡迪夫大学计算机科学与信息学院)
专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS
机构 * Department of Bioengineering, Imperial College London(帝国理工学院伦敦分校生物工程系) ; School of Robotics, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学机器人学院)
专题命中 多模态Agent :multimodal(title,abstract);multi-modal(abstract)
Comments 19 pages, 24 figures