arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-07 至 2026-04-07 共收录 15 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 15 篇

2602.08392 2026-04-07 cs.RO cs.AI cs.CV 84%

ST-BiBench: Benchmarking Multi-Stream Multimodal Coordination in Bimanual Embodied Tasks for MLLMs

ST-BiBench:多流多模态协调在双臂具身任务中的基准测试

Xin Wu, Zhixuan Liang, Yue Ma, Mengkang Hu, Zhiyuan Qin, Xiu Li

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) HKUST(香港科技大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ST-BiBench框架,用于评估多流多模态协调,揭示MLLMs在高阶策略与精细物理执行间的协调悖论。

Comments 42 pages, 9 figures. Project page:https://stbibench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03586 2026-04-07 cs.CL 83%

MultiPress: A Multi-Agent Framework for Interpretable Multimodal News Classification

MultiPress:一种用于可解释多模态新闻分类的多智能体框架

Tailong Luo, Hao Li, Rong Fu, Xinyue Jiang, Huaxuan Ding, Yiduo Zhang, Zilin Zhao, Simon Fong, Guangyin Jin, Jianyuan Ni

机构 * New York Institute of Technology(纽约理工学院) University of Arizona(亚利桑那大学) University of Macau(澳门大学) Peking University(北京大学) Juniata College(朱尼亚塔学院)

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 本文提出MultiPress多智能体框架,通过多模块协作和检索增强推理提升多模态新闻分类的准确性和可解释性。

Comments Accepted in International Joint Conference on Neural Networks (IJCNN) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11109 2026-04-07 cs.CV cs.AI cs.GR 81%

Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning

通过交错多模态推理的视觉-反图形代理

Shaofeng Yin, Jiaxin Ge, Zora Zhiruo Wang, Chenyang Wang, Xiuyu Li, Michael J. Black, Trevor Darrell, Angjoo Kanazawa, Haiwen Feng

机构 * University of California, Berkeley(加州大学伯克利分校) Carnegie Mellon University(卡内基梅隆大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Impossible, Inc.(Impossible公司)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出VIGA框架,通过符号逻辑与视觉感知的交叉验证,解决视觉语言模型在单次设置中重建图像的挑战,支持2D文档生成、3D重建等任务。

Comments Project page: https://fugtemypt123.github.io/VIGA-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04078 2026-04-07 eess.IV cs.AI cs.CV 81%

BAAI Cardiac Agent: An intelligent multimodal agent for automated reasoning and diagnosis of cardiovascular diseases from cardiac magnetic resonance imaging

BAAI心脏代理:一种智能多模态代理,用于从心脏磁共振成像自动推理和诊断心血管疾病

Taiping Qu, Hongkai Zhang, Lantian Zhang, Can Zhao, Nan Zhang, Hui Wang, Zhen Zhou, Mingye Zou, Kairui Bo, Pengfei Zhao, Xingxing Jin, Zixian Su, Kun Jiang, Huan Liu, Yu Du, Maozhou Wang, Ruifang Yan, Zhongyuan Wang, Tiejun Huang, Lei Xu, Henggui Zhang

机构 * Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) Department of Radiology, Beijing Anzhen Hospital, Beijing Institute of Heart, Lung & Vascular Diseases, Capital Medical University(首都医科大学附属北京安贞医院放射科,北京市心肺血管疾病研究所) Department of MR, the First Affiliated Hospital, Henan Medical University(河南医科大学第一附属医院磁共振科) Department of Cardiology, Clinical Center for Coronary Heart Disease, Beijing Institute of Heart, Lung and Blood Vessel Disease, Beijing Anzhen Hospital, Capital Medical University(首都医科大学附属北京安贞医院心内科,冠心病临床中心,北京市心肺血管疾病研究所) Department of Cardiac Surgery, Beijing Anzhen Hospital, Institute of Heart, Lung and Vascular Diseases, Capital Medical University(首都医科大学附属北京安贞医院心脏外科,心肺血管疾病研究所)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出BAAI心脏代理,通过多模态智能系统实现心脏磁共振成像的端到端解读,实现了自动分割、功能量化、组织特征分析和疾病诊断,并在多个心血管疾病数据集上验证了其高准确率和高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18599 2026-04-07 cs.CV 79%

Restore-R1: Efficient Image Restoration Agents via Reinforcement Learning with Multimodal LLM Perceptual Feedback

Restore-R1: 通过多模态大语言模型感知反馈的强化学习图像修复代理

Jianglin Lu, Yuanwei Wu, Ziyi Zhao, Hongcheng Wang, Felix Jimenez, Abrar Majeedi, Yun Fu

机构 * Amazon(亚马逊) Northeastern University(东北大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出Restore-R1框架,利用强化学习和多模态大语言模型感知反馈,高效解决图像修复问题,无需标注数据即可实现高质量修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03697 2026-04-07 cs.CV 79%

SGTA: Scene-Graph Based Multi-Modal Traffic Agent for Video Understanding

基于场景图的多模态交通代理:视频理解的模块化框架

Xingcheng Zhou, Mingyu Liu, Walter Zimmer, Jiajie Zhang, Alois Knoll

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.CV

AI总结 SGTA结合结构化场景图与多模态推理,通过检测、跟踪和车道提取构建交通场景图,并利用ReAct处理大语言模型的推理轨迹,实现复杂视频问题的可解释决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03393 2026-04-07 cs.AI 79%

TABQAWORLD: Optimizing Multimodal Reasoning for Multi-Turn Table Question Answering

TABQAWORLD: 优化多模态推理以实现多轮表格问答

Tung Sum Thomas Kwok, Xinyu Wang, Xiaofeng Lin, Peng Lu, Chunhe Wang, Changlun Li, Hanwei Wu, Nan Tang, Elisa Kreiss, Guang Cheng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) SimpleWay

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 TABQAWORLD通过联合优化表格表示与估计,提升多轮表格问答的可靠性与效率,实现4.87%的准确率提升和33.35%的推理延迟降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04875 2026-04-07 cs.CV cs.AI cs.MM 75%

DIRECT: Video Mashup Creation via Hierarchical Multi-Agent Planning and Intent-Guided Editing

DIRECT:通过分层多智能体规划和意图引导编辑实现视频混剪创作

Ke Li, Maoliang Li, Jialiang Chen, Jiayu Chen, Zihao Zheng, Shaoqi Wang, Xiang Chen

机构 * School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) School of Computer Science, Peking University(北京大学计算机科学学院) Huazhong University of Science and Technology(华中科技大学)

专题命中 多模态Agent :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出DIRECT框架,通过分层多智能体规划和意图引导编辑解决视频混剪中多模态协调问题,提出Mashup-Bench基准并验证了方法在客观和主观评估上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04901 2026-04-07 cs.CV cs.AI 62%

FileGram: Grounding Agent Personalization in File-System Behavioral Traces

FileGram:基于文件系统行为轨迹的智能体个性化研究

Shuai Liu, Shulin Tian, Kairui Hu, Yuhao Dong, Zhe Yang, Bo Li, Jingkang Yang, Chen Change Loy, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FileGram框架,通过文件系统行为轨迹实现智能体记忆与个性化,包含数据引擎、基准测试和内存架构,解决数据限制和多模态轨迹收集难题。

Comments Project Page: https://filegram.choiszt.com, Code: https://github.com/synvo-ai/FileGram

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04108 2026-04-07 cs.CV 57%

Hypothesis Graph Refinement: Hypothesis-Driven Exploration with Cascade Error Correction for Embodied Navigation

假设图细化:基于假设的探索与级联错误校正的具身导航

Peixin Chen, Guoxi Zhang, Jianwei Ma, Qing Li

机构 * Harbin Institute of Technology(哈尔滨工业大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Peking University(北京大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出HGR框架,通过假设节点的可修改性实现具身导航中的定向探索,并通过级联校正系统性地纠正错误。实验显示HGR在GOAT-Bench和QA基准上均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03631 2026-04-07 cs.AI 57%

Single-agent vs. Multi-agents for Automated Video Analysis of On-Screen Collaborative Learning Behaviors

单 agent 与多 agent 在自动视频分析上的协作学习行为研究

Likai Peng, Shihui Feng

机构 * Faculty of Education, The University of Hong Kong(香港大学教育学院) Institute of Data Science, The University of Hong Kong(香港大学数据科学研究所)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文比较了单 agent 和多 agent 框架在自动编码协作学习场景视频中的性能,提出两种多 agent 方法,分别在场景检测和动作检测任务中表现优异。

Comments 15 pages, 4 figures. To be published in the 27th International Conference on Artificial Intelligence in Education (AIED2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01891 2026-04-07 cs.CV 57%

Agentic AI in Remote Sensing: Foundations, Taxonomy, and Emerging Systems

遥感中的代理AI:基础、分类与新兴系统

Niloufar Alipour Talemi, Julia Boone, Fatemeh Afghah

机构 * Clemson University(克莱姆森大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文探讨遥感中代理AI的基础、分类及新兴系统,提出统一的分类框架,分析规划机制、检索增强生成和记忆结构,并评估轨迹感知推理的准确性。

Comments Accepted to the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026, GeoCV Workshop

Journal ref Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) Workshops, 2026, pp. 786-799

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03327 2026-04-07 math.OC 50%

Approximation Algorithms for Line Planning with Heterogeneous Fleets and Multiple Resource Constraints

具有异质车队和多重资源约束的线路规划近似算法

Hongyi Jiang, Igor Averbakh, Samitha Samaranayake

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文研究了面临预算、劳动力和排放限制的公共交通巴士网络线路规划问题,提出了一种具有理论保证的近似算法,解决了异质车队和多重资源约束下的线路规划问题,实验表明其在大规模应用中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03509 2026-04-07 physics.med-ph 50%

Applications of Large Language Models in Radiation Oncology: From Workflow Automation to Clinical Intelligence

大型语言模型在放射肿瘤学中的应用:从工作流自动化到临床智能

Yuzhen Ding, Jason Holmes, Yuexing Hao, Zhengliang Liu, Peilong Wang, Junjie Cui, Meiyun Cao, Caiwen Jiang, Shuoyang Wei, Lin Zhao, Chenbin Liu, Lian Zhang, Yunze Yang, Tianming Liu, Wei Liu

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文探讨了大型语言模型在放射肿瘤学中的应用,包括工作流自动化、临床智能及决策支持,展示了其在标准化命名、注册管理及放疗计划评估中的核心贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03406 2026-04-07 cs.GR 50%

SASAV: Self-Directed Agent for Scientific Analysis and Visualization

SASAV:面向科学分析和可视化的自主代理

Jianxin Sun, David Lenz, Tom Peterka, Hongfeng Yu

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出SASAV,首个无需外部提示或人类在环反馈的自主AI代理,可自动执行科学数据分析并生成有洞察力的可视化,推动AI for Science加速大规模科学发现。

详情

展开后加载摘要…

URL PDF HTML 收藏