arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2766 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2766 篇

2509.15219 2026-03-30 cs.CV cs.LG cs.MA cs.MM cs.RO 76%

Out-of-Sight Embodied Agents: Multimodal Tracking, Sensor Fusion, and Trajectory Forecasting

视线外的具身智能体:多模态跟踪、传感器融合与轨迹预测

Haichao Zhang, Yi Xu, Yun Fu

机构 * Department of Electrical and Computer Engineering, Northeastern University(东北大学电气与计算机工程系) Khoury College of Computer Sciences, Northeastern University(东北大学库里计算机科学学院)

专题命中 多模态Agent :multimodal(title);分类 cs.CV、cs.MM

AI总结 本文提出改进的视线外轨迹预测方法,通过视觉定位去噪模块提升轨迹预测性能,实验表明在Vi-Fi和JRDB数据集上达到最优效果,为自动驾驶、机器人和监控提供新方向。

Comments Published in IEEE Transactions on Pattern Analysis and Machine Intelligence (Early Access), pp. 1-14, March 23, 2026

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14440 2026-03-18 cs.AI cs.CL cs.LG 76%

VisTIRA: Closing the Image-Text Modality Gap in Visual Math Reasoning via Structured Tool Integration

VisTIRA: 通过结构化工具集成缩小图像-文本模态差距以提升视觉数学推理

Saeed Khaki, Ashudeep Singh, Nima Safaei, Kamal Ginotra

机构 * Microsoft AI(微软人工智能)

专题命中 多模态Agent :image-text(title);分类 cs.CL、cs.AI

AI总结 VisTIRA通过结构化工具集成框架,解决图像形式数学问题的推理难题,改进视觉数学推理能力,实验表明工具监督和OCR定位能有效缩小模态差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07400 2025-12-18 cs.MA cs.AI cs.CV cs.LG 76%

MedChat: A Multi-Agent Framework for Multimodal Diagnosis with Large Language Models

MedChat: 一种基于大语言模型的多智能体多模态诊断框架

Philip R. Liu, Sparsh Bansal, Jimmy Dinh, Aditya Pawar, Ramani Satishkumar, Shail Desai, Neeraj Gupta, Xin Wang, Shu Hu

机构 * University at Albany, State University of New York(纽约州立大学阿布扎克分校)

专题命中 多模态Agent :multimodal(title);分类 cs.CV、cs.AI

AI总结 MedChat通过多智能体框架结合专用视觉模型和角色特定LLM代理,提升多模态诊断的可靠性与交互性。

Journal ref Proc. 2025 IEEE 8th International Conference on Multimedia Information Processing and Retrieval (MIPR), pp. 456-462, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14210 2025-11-21 cs.CV cs.AI cs.LG 76%

Orion: A Unified Visual Agent for Multimodal Perception, Advanced Visual Reasoning and Execution

Orion:一个多模态感知、高级视觉推理与执行的统一视觉代理

N Dinesh Reddy, Dylan Snyder, Lona Kiragu, Mirajul Mohin, Shahrear Bin Amin, Sudeep Pillai

机构 * VLM Run Research(VLM Run研究)

专题命中 多模态Agent :multimodal(title);分类 cs.CV、cs.AI

AI总结 Orion通过整合视觉推理与工具增强执行,实现了多模态感知、高级视觉推理与执行的统一,提升多步骤视觉智能性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23517 2025-09-30 cs.CV cs.AI 76%

Evaluating point-light biological motion in multimodal large language models

Akila Kadambi, Marco Iacoboni, Lisa Aziz-Zadeh, Srini Narayanan

机构 * Psychiatry and Biobehavioral Sciences, UCLA(乌尔拉克大学精神病学与生物行为科学系) Brain and Creativity Institute, USC(美国大学脑与创造力研究所) Google DeepMind, Zurich(谷歌深度Mind瑞士分公司)

专题命中 多模态Agent :multimodal(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13504 2025-07-02 cs.LG cs.AI cs.CV cs.RO 76%

CoCMT: Communication-Efficient Cross-Modal Transformer for Collaborative Perception

Rujia Wang, Xiangbo Gao, Hao Xiang, Runsheng Xu, Zhengzhong Tu

机构 * Computer Science and Engineering, Texas A&M University(计算机科学与工程,德克萨斯A&M大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 多模态Agent :cross-modal(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11702 2025-06-23 cs.AI cs.CL cs.LG 76%

LLM-Guided Indoor Navigation with Multimodal Map Understanding

Alberto Coffrini, Paolo Barsocchi, Francesco Furfari, Antonino Crivello, Alessio Ferrari

机构 * Institute of Information Science and Technologies (ISTI)(信息科学与技术研究所) National Research Council of Italy (CNR)(意大利国家研究理事会) Department of Computer Science(计算机科学系) University of Pisa(比萨大学) University College Dublin (UCD)(都柏林大学学院) School of Computer Science(计算机科学学院)

专题命中 多模态Agent :multimodal(title);分类 cs.CL、cs.AI

Comments 7 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13836 2024-10-28 cs.CV cs.AI 76%

PAM: A Propagation-Based Model for Segmenting Any 3D Objects across Multi-Modal Medical Images

Zifan Chen, Xinyu Nan, Jiazheng Li, Jie Zhao, Haifeng Li, Ziling Lin, Haoshen Li, Heyun Chen, Yiting Liu, Lei Tang, Li Zhang, Bin Dong

专题命中 多模态Agent :multi-modal(title);分类 cs.CV、cs.AI

Comments 28 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12015 2024-10-11 cs.RO cs.CL cs.CV 76%

GPT-4V(ision) for Robotics: Multimodal Task Planning from Human Demonstration

Naoki Wake, Atsushi Kanehira, Kazuhiro Sasabuchi, Jun Takamatsu, Katsushi Ikeuchi

专题命中 多模态Agent :multimodal(title);分类 cs.CV、cs.CL

Comments 8 pages, 10 figures, 3 tables. Published in IEEE Robotics and Automation Letters (RA-L) (in press). Last updated on September 26th, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10478 2024-06-24 cs.CL cs.AI cs.GR 76%

From Words to Worlds: Transforming One-line Prompt into Immersive Multi-modal Digital Stories with Communicative LLM Agent

Samuel S. Sohn, Danrui Li, Sen Zhang, Che-Jui Chang, Mubbasir Kapadia

专题命中 多模态Agent :multi-modal(title);分类 cs.CL、cs.AI

Comments 16 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.06552 2023-03-22 cs.CL cs.AI 76%

Collecting Interactive Multi-modal Datasets for Grounded Language Understanding

Shrestha Mohanty, Negar Arabzadeh, Milagro Teruel, Yuxuan Sun, Artem Zholus, Alexey Skrynnik, Mikhail Burtsev, Kavya Srinet, Aleksandr Panov, Arthur Szlam, Marc-Alexandre Côté, Julia Kiseleva

专题命中 多模态Agent :multi-modal(title);分类 cs.CL、cs.AI

Journal ref Interactive Learning for Natural Language Processing NeurIPS 2022 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.00150 2021-11-09 cs.CL cs.CV cs.IR 76%

Capturing Logical Structure of Visually Structured Documents with Multimodal Transition Parser

Yuta Koreeda, Christopher D. Manning

专题命中 多模态Agent :multimodal(title);分类 cs.CV、cs.CL

Comments 11 pages, 5 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.02636 2020-06-05 cs.CV cs.AI cs.LG cs.RO stat.ML 76%

The Importance of Prior Knowledge in Precise Multimodal Prediction

Sergio Casas, Cole Gulino, Simon Suo, Raquel Urtasun

专题命中 多模态Agent :multimodal(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18112 2026-08-10 cs.RO 版本更新 75%

EchoVLA: Robotic Vision-Language-Action Model with Synergistic Declarative Memory for Mobile Manipulation

EchoVLA:用于VLA驱动移动操作的协同声明记忆

Min Lin, Xiwen Liang, Bingqian Lin, Jingzhi Liu, Zijian Jiao, Kehan Li, Ziang Yan, Yu Sun, Weijia Liufu, Yuhan Ma, Jiarui Hu, Yuecheng Liu, Shen Zhao, Yuzheng Zhuang, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University, Shenzhen, China(中山大学深圳校区) Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Huawei Noah's Ark Lab, China(华为诺亚方舟实验室)

专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract)

AI总结 EchoVLA通过协同声明记忆提升移动操作性能,结合场景与事件记忆,利用注意力融合指导基臂策略,实现高效导航与操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27330 2026-06-26 cs.CL cs.AI cs.CV cs.LG 新提交 75%

Empowering GUI Agents via Autonomous Experience Exploration and Hindsight Experience Utilization for Task Planning

通过自主经验探索与事后经验利用赋能GUI智能体任务规划

Tianyi Men, Zhuoran Jin, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.CL、cs.AI

AI总结 提出PEEU方法,通过自主探索环境发现经验并利用事后经验合成严格对齐的高层训练数据,提升小型多模态大语言模型在GUI任务中的规划与跨网站泛化能力。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04875 2026-04-07 cs.CV cs.AI cs.MM 75%

DIRECT: Video Mashup Creation via Hierarchical Multi-Agent Planning and Intent-Guided Editing

DIRECT:通过分层多智能体规划和意图引导编辑实现视频混剪创作

Ke Li, Maoliang Li, Jialiang Chen, Jiayu Chen, Zihao Zheng, Shaoqi Wang, Xiang Chen

机构 * School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) School of Computer Science, Peking University(北京大学计算机科学学院) Huazhong University of Science and Technology(华中科技大学)

专题命中 多模态Agent :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出DIRECT框架,通过分层多智能体规划和意图引导编辑解决视频混剪中多模态协调问题,提出Mashup-Bench基准并验证了方法在客观和主观评估上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13653 2026-02-17 cs.AI cs.CL cs.CV cs.HC 75%

Building Autonomous GUI Navigation via Agentic-Q Estimation and Step-Wise Policy Optimization

通过代理-Q估计和分步策略优化构建自主GUI导航

Yibo Wang, Guangda Huzhang, Yuwei Hu, Yu Xia, Shiyin Lu, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Lijun Zhang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Ovis Team, Alibaba Group(阿里团队,阿里巴巴集团)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出基于代理-Q估计和分步策略优化的GUI自主导航框架,通过强化学习提升GUI交互能力,实验证明其在导航和基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09332 2026-01-29 cs.RO cs.AI cs.CL cs.CV 75%

OmniEVA: Embodied Versatile Planner via Task-Adaptive 3D-Grounded and Embodiment-aware Reasoning

OmniEVA:通过任务自适应3D grounded和 embodiment-aware推理实现具身 versatile规划

Yuecheng Liu, Dafeng Chi, Shiguang Wu, Zhanguang Zhang, Yuzheng Zhuang, Bowen Yang, He Zhu, Lingfeng Zhang, Pengwei Xie, David Gamaliel Arcos Bravo, Yingxue Zhang, Jianye Hao, Xingyue Quan

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 OmniEVA通过任务自适应3D grounding和具身aware推理,解决具身系统中几何适应性和具身约束的限制,实现先进的具身推理和任务规划。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26536 2025-11-26 cs.CL cs.AI cs.CV cs.LG cs.RO 75%

OceanGym: A Benchmark Environment for Underwater Embodied Agents

OceanGym: 一个用于水下具身智能体的基准环境

Yida Xue, Mingjun Mao, Xiangyuan Ru, Yuqi Zhu, Baochang Ren, Shuofei Qiao, Mengru Wang, Shumin Deng, Xinyu An, Ningyu Zhang, Ying Chen, Huajun Chen

专题命中 多模态Agent :multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 OceanGym通过多模态大语言模型构建首个水下具身智能体基准,揭示水下环境感知与规划的挑战,推动水下自主系统发展。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02444 2025-10-20 cs.AI cs.CL cs.CV cs.HC 75%

AppCopilot: Toward General, Accurate, Long-Horizon, and Efficient Mobile Agent

Jingru Fan, Yufan Dang, Jingyao Wu, Huatao Li, Runde Yang, Xiyuan Yang, Yuheng Wang, Chen Qian

专题命中 多模态Agent :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Project at https://github.com/OpenBMB/AppCopilot

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11717 2025-10-20 cs.LG cs.AI cs.CL cs.CV 75%

WebInject: Prompt Injection Attack to Web Agents

Xilong Wang, John Bloch, Zedian Shao, Yuepeng Hu, Shuyan Zhou, Neil Zhenqiang Gong

专题命中 多模态Agent :multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Appeared in EMNLP 2025 main conference. To better understand prompt injection attacks, see https://people.duke.edu/~zg70/code/PromptInjection.pdf

Journal ref The 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19433 2025-10-13 cs.CV cs.AI cs.CL 75%

Mem4Nav: Boosting Vision-and-Language Navigation in Urban Environments with a Hierarchical Spatial-Cognition Long-Short Memory System

Lixuan He, Haoyu Dong, Zhenxing Chen, Yangcheng Yu, Jie Feng, Yong Li

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

Comments The paper is currently under investigation regarding concerns of potential academic misconduct. While the investigation is ongoing, the authors have voluntarily requested to withdraw the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04908 2025-09-08 cs.AI cs.CL cs.CV cs.HC 75%

SparkUI-Parser: Enhancing GUI Perception with Robust Grounding and Parsing

Hongyi Jing, Jiafu Chen, Chen Rao, Ziqiang Dang, Jiajie Teng, Tianyi Chu, Juncheng Mo, Shuo Fang, Huaizhong Lin, Rui Lv, Chenguang Ma, Lei Zhao

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15132 2025-05-22 cond-mat.mtrl-sci 75%

Multicrossmodal Automated Agent for Integrating Diverse Materials Science Data

Adib Bazgir, Rama chandra Praneeth Madugula, Yuwen Zhang

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10127 2025-04-16 cs.AI cs.CL cs.CV 75%

Breaking the Data Barrier -- Building GUI Agents Through Task Generalization

Junlei Zhang, Zichen Ding, Chang Ma, Zijie Chen, Qiushi Sun, Zhenzhong Lan, Junxian He

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 24 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11623 2024-10-16 cs.CV cs.AI cs.CL 75%

VidEgoThink: Assessing Egocentric Video Understanding Capabilities for Embodied AI

Sijie Cheng, Kechen Fang, Yangyang Yu, Sicheng Zhou, Bohao Li, Ye Tian, Tingguang Li, Lei Han, Yang Liu

专题命中 多模态Agent :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03327 2026-08-07 cs.AI 版本更新 74%

Screenshots or Tools? Eliciting Tool Use and Managing Multimodal Context in Hybrid GUI-MCP Computer-Use Agents

截图还是工具?在混合GUI-MCP计算机使用智能体中引出工具使用并管理多模态上下文

Siqi Fan, Minghao Li, Xiaoqian Ma, Wenhui Tan, Xiusheng Huang, Juntong Wu, Liujie Zhang, Shuo Shang, Weihang Chen

专题命中 多模态Agent :multimodal(title);分类 cs.AI

AI总结 该研究针对混合GUI-MCP计算机使用智能体,发现工具使用存在采用缺口,通过调整工具奖励与上下文压缩优化,提升了智能体性能并降低输入成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26155 2026-07-30 cs.AI 新提交 74%

ClinLens: Towards Long-Horizon Coding Agents for Longitudinal Multimodal Clinical Data Science

ClinLens:面向纵向多模态临床数据科学的长周期编码智能体

Yuan Zhu, Ethan B. Liu, Frank Nie, Jindong Han

机构 * Shandong University(山东大学)

专题命中 多模态Agent :multimodal(title);分类 cs.AI

AI总结 该研究推出CLINLENS基准,包含200项基于5种MIMIC资源的临床可执行任务,实验显示现有编码智能体与生物医学系统在正确临床分析上存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19947 2026-07-23 cs.CV 新提交 74%

ETPDesigner: Multi-Agent Orchestration for Interactive Multimodal Electronic Theater Program

ETPDesigner:用于交互式多模态电子剧院节目的多智能体编排

Mengtian Li, Xinru Guo, Xiaoru Lin, Xiao Rong, Zhifeng Xie, Chaofeng Chen

机构 * Shanghai University(上海大学) Shanghai Engineering Research Center of Motion Picture Special Effects(上海电影特效工程技术研究中心) Institute for Math and AI, Wuhan School of Artificial Intelligence, Wuhan University(武汉大学数学与人工智能研究院武汉人工智能学院)

专题命中 多模态Agent :multimodal(title);分类 cs.CV

AI总结 研究针对电子剧院节目设计难题,提出ETPDesigner多智能体框架,能从戏剧脚本合成高质量ETP,通过全局风格锚定机制保证一致性,还实现交互功能,经ETP-Pro基准测试验证了方法在多方面的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16966 2026-07-13 cs.CR cs.AI 74%

Visual Inception: Compromising Long-term Planning in Agentic Recommenders via Multimodal Memory Poisoning

视觉 inception:通过多模态记忆污染在代理推荐系统中妥协长期规划

Jiachen Qian

机构 * City University of Hong Kong(香港城市大学)

专题命中 多模态Agent :multimodal(title);分类 cs.AI

AI总结 本文提出视觉 inception 攻击,通过污染用户上传的图片在代理推荐系统中影响长期规划,提出 CognitiveGuard 防御框架以降低攻击风险。

Comments 17 pages, 6 figures, 16 tables

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 20846-20862, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏