arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-13 至 2026-04-13 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 9 篇

2604.07956 2026-04-13 cs.AI 83%

MONETA: Multimodal Industry Classification through Geographic Information with Multi Agent Systems

MONETA:通过地理信息和多智能体系统进行多模态行业分类

Arda Yüksel, Gabriel Thiem, Susanne Walter, Patrick Felka, Gabriela Alves Werb, Ivan Habernal

机构 * Trustworthy Human Language Technologies(可信人类语言技术实验室) Technical University of Darmstadt, Germany(德国达姆施塔特工业大学) Deutsche Bundesbank(德国联邦银行) Frankfurt University of Applied Sciences, Germany(德国法兰克福应用技术大学) Research Center for Trustworthy Data Science and Security, Ruhr University Bochum, Germany(德国波鸿鲁尔大学可信数据科学与安全研究中心)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出MONETA,首个基于文本和地理空间数据的多模态行业分类基准,利用多智能体系统提升分类精度,实现62.10%和74.10%的分类性能。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09426 2026-04-13 cs.HC cs.AI cs.IR 79%

Three Modalities, Two Design Probes, One Prototype, and No Vision: Experience-Based Co-Design of a Multi-modal 3D Data Visualization Tool

三种模态、两种设计探针、一个原型和没有视觉:基于经验的多模态3D数据可视化工具共设计

Sanchita S. Kamath, Aziz N Zeidieh, Venkatesh Potluri, Sile O'Modhrain, Kenneth Perry, JooYoung Seo

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan(密歇根大学)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.AI

AI总结 本文通过基于经验的共设计方法,开发出多模态3D数据可视化工具,提升视障人士对3D数据的分析能力,提供可操作的设计指南和可扩展的无障碍3D可视化方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02241 2026-04-13 cs.CV cs.RO 70%

UAV-Track VLA: Embodied Aerial Tracking via Vision-Language-Action Models

UAV-Track VLA: 通过视觉-语言-动作模型实现具身空中跟踪

Qiyao Zhang, Shuhua Zheng, Jianli Sun, Chengxiang Li, Xianke Wu, Zihan Song, Zhiyong Cui, Yisheng Lv, Yonglin Tian

机构 * Beijing Institute of Technology(北京理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Sanya(三亚学院) Beijing University of Posts and Telecommunications(北京邮电大学) Hunan University(湖南大学) Beihang University(北京航空航天大学) Flying Intelligence Team (Virtual Research Community)(飞行智能团队(虚拟研究社区))

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出UAV-Track VLA模型,通过视觉-语言-动作融合解决动态城市场景中的具身跟踪问题,提升UAV的实时控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09197 2026-04-13 cs.CV cs.AI 62%

Vision Transformers for Preoperative CT-Based Prediction of Histopathologic Chemotherapy Response Score in High-Grade Serous Ovarian Carcinoma

用于高阶浆液性卵巢癌术前CT基预测组织病理学化疗反应评分的视觉变换器

Francesca Fati, Felipe Coutinho, Marika Reinius, Marina Rosanu, Gabriel Funingana, Luigi De Vitis, Gabriella Schivardi, Hannah Clayton, Alice Traversa, Zeyu Gao, Guilherme Penteado, Shangqi Gao, Francesco Pastori, Ramona Woitek, Maria Cristina Ghioni, Giovanni Damiano Aletti, Mercedes Jimenez-Linan, Sarah Burge, Nicoletta Colombo, Evis Sala, Maria Francesca Spadea, Timothy L. Kline, James D. Brenton, Jaime Cardoso, Francesco Multinu, Elena De Momi, Mireia Crispin-Ortuzar, Ines P. Machado

机构 * European Institute of Oncology, IEO, IRCCS(欧洲肿瘤研究所) Politecnico di Milano(米兰理工大学) INESC TEC, Faculty of Engineering, University of Porto(波尔图大学工程学院INESC TEC) University of Cambridge(剑桥大学) Cancer Research UK Cambridge Centre(英国癌症研究中心剑桥中心) Cancer Research UK Cambridge Institute(英国癌症研究中心剑桥研究所) Cambridge University Hospitals NHS Foundation Trust(剑桥大学医院NHS基金会信托) Mayo Clinic(梅奥诊所) Early Cancer Institute, University of Cambridge(剑桥大学早期癌症研究所) Danube Private University(多瑙私立大学) University of Milan(米兰大学) Università Cattolica del Sacro Cuore(圣心天主教大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究利用视觉变换器构建多模态模型,通过术前CT影像与临床数据预测高阶浆液性卵巢癌的化疗反应评分,初步验证了深度学习在术前预测治疗反应中的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09308 2026-04-13 cs.AI 57%

Constraint-Aware Corrective Memory for Language-Based Drug Discovery Agents

基于约束的纠正记忆:用于基于语言的药物发现代理

Maochen Sun, Youzhi Zhang, Gaofeng Meng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出CACM框架,通过精确的集合级诊断和简洁的记忆写回机制,提升语言基药物发现代理的可靠性,实验表明其在目标级成功率提升36.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09167 2026-04-13 cs.CV cs.MA 57%

MAG-3D: Multi-Agent Grounded Reasoning for 3D Understanding

MAG-3D:多智能体基础推理用于3D理解

Henry Zheng, Chenyue Fang, Rui Huang, Siyuan Wei, Xiao Liu, Gao Huang

机构 * Tsinghua University(清华大学) Pico, ByteDance(字节跳动Pico)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出MAG-3D,一种无需训练的多智能体框架,通过动态协调专家代理实现灵活的3D基础推理,解决复杂场景中的空间和几何关系推理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03512 2026-04-13 cs.AI 57%

ActionNex: A Virtual Outage Manager for Cloud Computing

ActionNex:云计算中的虚拟故障管理器

Zhenfeng Lin, Haoji Hu, Ming Hao, Xuchao Zhang, Ryan Zhang, Junhao Li, Ze Li, Oleg Kulygin, Chetan Bansal, Hatay Tuna, Murali Chintalapati, Sheila Jiang, Salman Zafar, Angie Anderson

机构 * Microsoft PRIMO(微软PRIMO) Microsoft Research(微软研究院) Microsoft Azure Core(微软Azure Core)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出ActionNex,一个生产级智能系统,通过多模态信号处理和分层记忆子系统,实现故障管理的端到端支持,包括实时更新、知识蒸馏和基于角色和阶段的最优行动推荐,实验表明其在真实Azure故障中达到71.4%的精度和52.8-54.8%的召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03370 2026-04-13 cs.CV 57%

ShelfGaussian: Shelf-Supervised Open-Vocabulary Gaussian-based 3D Scene Understanding

ShelfGaussian:基于货架的开放词汇高斯3D场景理解

Lingjun Zhao, Yandong Luo, James Hays, Lu Gan

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 本文提出ShelfGaussian框架,利用货架监督学习方法,结合多模态高斯变换,提升3D场景理解的开放词汇能力,实验显示其在零样本语义占用预测中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10722 2026-04-13 q-bio.NC cs.NE 50%

Bridging Brains and Machines: A Unified Frontier in Neuroscience, Artificial Intelligence, and Neuromorphic Systems

连接大脑与机器:神经科学、人工智能与神经形态系统的统一前沿

Sohan Shankar, Yi Pan, Hanqi Jiang, Zhengliang Liu, Mohammad R. Darbandi, Agustin Lorenzo, Junhao Chen, Weihang You, Md Mehedi Hasan, Arif Hassan Zidan, Eliana Gelman, Joshua A. Konfrst, Jillian Y. Russell, Katelyn Fernandes, Tianze Yang, Yiwei Li, Huaqin Zhao, Afrar Jahin, Triparna Ganguly, Shair Dinesha, Yifan Zhou, Zihao Wu, Xinliang Li, Lokesh Adusumilli, Aziza Hussein, Sagar Nookarapu, Jixin Hou, Kun Jiang, Jiaxi Li, Brenden Heinel, XianShen Xi, Hailey Hubbard, Zayna Khan, Levi Whitaker, Ivan Cao, Max Allgaier, Andrew Darby, Lin Zhao, Lu Zhang, Xiaoqiao Wang, Xiang Li, Wei Zhang, Xiaowei Yu, Dajiang Zhu, Yohannes Abate, Tianming Liu

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文探讨神经科学、通用人工智能与神经形态计算的融合,提出基于脑生理学的框架,总结了突触可塑性、稀疏脉冲通信和多模态关联在下一代AGI系统中的应用,并讨论了突破冯·诺依曼瓶颈的物理子系统及四个关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏