arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-13 至 2026-04-13 共收录 66 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 8 篇

2604.08922 2026-04-13 cs.CV 74%

Degradation-Robust Fusion: An Efficient Degradation-Aware Diffusion Framework for Multimodal Image Fusion in Arbitrary Degradation Scenarios

抗退化融合:一种高效的抗退化扩散框架,用于任意退化场景下的多模态图像融合

Yu Shi, Yu Liu, Zhong-Cheng Wu, Juan Cheng, Huafeng Li, Xun Chen

机构 * Department of Biomedical Engineering, Hefei University of Technology(合肥工业大学生物医学工程系) Faculty of Information Engineering and Automation, Kunming University of Science and Technology(昆明理工大学信息工程与自动化学院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院)

专题命中 多模态生成 :multimodal(title);分类 cs.CV

AI总结 本文提出一种高效的抗退化扩散框架,用于处理多模态图像融合中的复杂退化场景。该框架通过隐式去噪和联合观测模型校正机制,提升了在复杂退化下的融合性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08915 2026-04-13 cs.CV cs.AI 62%

Large-Scale Universal Defect Generation: Foundation Models and Datasets

大规模通用缺陷生成:基础模型与数据集

Yuanting Fan, Jun Liu, Bin-Bin Gao, Xiaochen Chen, Yuhuan Lin, Zhewei Dai, Jiawei Zhan, Chengjie Wang

机构 * Tencent Youtu Lab, Shenzhen, China(腾讯优图实验室,深圳,中国)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出UniDG模型和UDG数据集,通过参考基和文本指令生成缺陷,提升缺陷生成的多样性和真实性,实验表明其在异常检测和定位任务中表现优异。

Comments 25 pages, 13 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13450 2026-04-13 cs.CV cs.CL 62%

LADR: Locality-Aware Dynamic Rescue for Efficient Text-to-Image Generation with Diffusion Large Language Models

LADR:基于局部性的动态救援方法,用于高效文本到图像生成的扩散大语言模型

Chenglin Wang, Yucheng Zhou, Shawn Chen, Tao Wang, Kai Zhang

机构 * East China Normal University(华东师范大学) University of Macau(澳门大学) Zhejiang University(浙江大学) Nanjing University(南京大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出LADR方法,通过利用图像的空间马尔可夫性质加速推理,实现文本到图像生成的高效生成,同时保持生成质量。

Comments ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12242 2026-04-13 cs.CV cs.AI cs.LG 62%

OmniPrism: Learning Disentangled Visual Concept for Image Generation

OmniPrism: 学习解耦的视觉概念用于图像生成

Yangyang Li, Daqing Liu, Wu Liu, Allen He, Xinchen Liu, Yongdong Zhang, Guoqing Jin

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 OmniPrism通过自然语言引导学习解耦的视觉概念表示,结合扩散模型生成高质量图像,解决多方面概念混淆问题。

Comments WebPage available at https://tale17.github.io/omni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09425 2026-04-13 cs.CV 57%

Do Vision Language Models Need to Process Image Tokens?

视觉语言模型是否需要处理图像标记?

Sambit Ghosh, R. Venkatesh Babu, Chirag Agarwal

机构 * IBM Indian Institute of Science(印度科学研究所) University of Virginia(弗吉尼亚大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文研究了视觉语言模型中图像标记的功能,发现视觉表示快速收敛至有限复杂度,而文本表示持续重构。视觉表示在不同层间可互换,任务依赖性影响视觉处理的必要性。

Comments Accepted (Oral) at TRUE-V Workshop CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06832 2026-04-13 cs.CL 57%

Fast-dVLM: Efficient Block-Diffusion VLM via Direct Conversion from Autoregressive VLM

Fast-dVLM: 通过直接转换自回归VLM实现高效的块扩散VLM

Chengyue Wu, Shiyi Lan, Yonggan Fu, Sensen Gao, Jin Wang, Jincheng Yu, Jose M. Alvarez, Pavlo Molchanov, Ping Luo, Song Han, Ligeng Zhu, Enze Xie

机构 * The University of Hong Kong(香港大学) NVIDIA(英伟达) MIT(麻省理工学院) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 本文提出Fast-dVLM,通过直接转换自回归VLM实现高效的块扩散VLM,采用KV-cache兼容并行解码和推测块解码,提升推理效率。实验表明其生成质量与自回归模型相当,且通过SGLang和FP8量化实现6倍以上的推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08600 2026-04-13 q-bio.TO eess.IV 50%

Gaze2Report: Radiology Report Generation via Visual-Gaze Prompt Tuning of LLMs

Gaze2Report:通过视觉-凝视提示调优LLM实现放射学报告生成

Aishik Konwer, Moinak Bhattacharya, Prateek Prasanna

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出Gaze2Report框架,利用扫描路径预测模块和图神经网络生成视觉-凝视标记,结合指令和报告标记对LLM进行微调,提升报告生成质量并实现推理时无需凝视输入。

Comments Accepted at ISBI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 11 篇

2604.08846 2026-04-13 cs.LG cs.AI cs.CL cs.CV 85%

Dictionary-Aligned Concept Control for Safeguarding Multimodal LLMs

字典对齐的概念控制用于保护多模态大语言模型

Jinqi Luo, Jinyu Yang, Tal Neiman, Lei Fan, Bing Yin, Son Tran, Mubarak Shah, René Vidal

机构 * University of Pennsylvania(宾夕法尼亚大学) Amazon(亚马逊) University of Central Florida(中佛罗里达大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出字典对齐的概念控制框架,通过定制概念字典和稀疏自编码器实现对多模态大语言模型激活的精细控制,提升安全性的同时保持通用能力。

Comments Accepted in CVPR 2026. Project page: https://peterljq.github.io/project/daco

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16165 2026-04-13 cs.SE cs.AI cs.HC 83%

Investigating Multimodal Large Language Models to Support Usability Evaluation

探究多模态大语言模型以支持可用性评估

Sebastian Lubos, Alexander Felfernig, Damian Garber, Gerhard Leitner, Julian Schwazer, Manuel Henrich

机构 * Graz University of Technology(格拉茨技术大学) University of Klagenfurt(克拉根福大学) UNiQUARE Software Development GmbH(UNiQUARE软件开发有限公司)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 本文探讨了多模态大语言模型在可用性评估中的应用,通过优先级问题框架识别并排名可用性问题,比较了MLLM与专家评估结果,展示了交互可视化工具,并提出整合MLLM评估到实际开发流程的概念。

Comments To appear in the Proceedings of IEA/AIE 2026, Springer LNAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08884 2026-04-13 cs.CV cs.AI 81%

HM-Bench: A Comprehensive Benchmark for Multimodal Large Language Models in Hyperspectral Remote Sensing

HM-Bench:多模态大语言模型在高光谱遥感中的综合基准

Xinyu Zhang, Zurong Mai, Qingmei Li, Zjin Liao, Yibin Wen, Yuhang Chen, Xiaoya Fan, Chan Tsz Ho, Bi Tianyuan, Haoyuan Liang, Ruifeng Su, Zihao Qian, Juepeng Zheng, Jianxi Huang, Yutong Lu, Haohuan Fu

机构 * Sun Yat-sen University(中山大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) China Agricultural University(中国农业大学) Southwest Jiaotong University(西南交通大学) Southwest University(西南大学) National Supercomputing Center in Shenzhen(国家超级计算深圳中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出HM-Bench,首个用于评估多模态大语言模型在高光谱图像理解中的基准,通过构建19337对问题-答案对,探索模型在处理高维高光谱数据中的挑战,揭示视觉输入在空间-光谱推理中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08609 2026-04-13 cs.CV cs.AI cs.LG 81%

Detection of Hate and Threat in Digital Forensics: A Case-Driven Multimodal Approach

数字取证中的仇恨与威胁检测:基于案例的多模态方法

Ponkoj Chandra Shill

机构 * University of Nevada, Reno(内华达大学雷诺分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种基于案例的多模态方法,用于数字取证中的仇恨与威胁检测,通过区分文本证据、关联上下文文本和图像证据,提升取证的可追溯性和准确性。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08896 2026-04-13 cs.CV 79%

GeoMMBench and GeoMMAgent: Toward Expert-Level Multimodal Intelligence in Geoscience and Remote Sensing

GeoMMBench 和 GeoMMAgent:迈向地质科学和遥感领域的专家级多模态智能

Aoran Xiao, Shihao Cheng, Yonghao Xu, Yexian Ren, Hongruixuan Chen, Naoto Yokoya

机构 * RIKEN AIP(日本理化学研究所革新智能研究中心) Wuhan University(武汉大学) Linköping University(林雪平大学) University of Tokyo(东京大学) Nanjing University of Information Science and Technology(南京信息工程大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出 GeoMMBench 和 GeoMMAgent,通过综合多模态问答基准和多智能体框架,解决地质科学和遥感领域知识广、传感器异构、任务碎片化等挑战,提升专家级空间解释能力。

Comments CVPR 2026 Highlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05215 2026-04-13 cs.CL cs.LG 70%

BEDTime: A Unified Benchmark for Automatically Describing Time Series

BEDTime:一个统一的基准测试用于自动描述时间序列

Medhasweta Sen, Zachary Gottesman, Jiaxing Qiu, C. Bayan Bruss, Nam Nguyen, Tom Hartvigsen

机构 * University of Virginia(弗吉尼亚大学)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CL

AI总结 本文提出BEDTime基准测试,评估模型对时间序列结构属性的描述能力,发现专为时间序列语言设计的模型表现欠佳,而视觉语言模型表现优异,且所有方法在现实鲁棒性测试中均表现脆弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08562 2026-04-13 cs.CL cs.AI cs.SD eess.AS 67%

Neural networks for Text-to-Speech evaluation

用于文本到语音评估的神经网络

Ilya Trofimenko, David Kocharyan, Aleksandr Zaitsev, Pavel Repnikov, Mark Levin, Nikita Shevtsov

机构 * HSE University(高等经济学院) Institute for System Programming, Russian Academy of Sciences(俄罗斯科学院系统编程研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文提出NeuralSBS和改进的MOSNet及WhisperBert,通过神经网络模型在相对和绝对评估中实现高精度,优于人类评估基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08615 2026-04-13 cs.CV cs.AI 62%

MARINER: A 3E-Driven Benchmark for Fine-Grained Perception and Complex Reasoning in Open-Water Environments

MARINER:一种基于3E驱动的基准,用于开放水域环境中的细粒度感知与复杂推理

Xingming Liao, Ning Chen, Muying Shu, Yunpeng Yin, Peijian Zeng, Zhuowei Wang, Nankai Lin, Lianglun Cheng

机构 * Guangdong University of Technology(广东工业大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MARINER基准,通过3E框架评估开放水域环境中的细粒度感知与复杂推理,揭示先进模型在复杂海洋场景中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09511 2026-04-13 cs.CV 57%

RIRF: Reasoning Image Restoration Framework

RIRF:图像修复推理框架

Wending Yan, Rongkai Zhang, Kaihua Tang, Yu Cheng, Qiankun Liu

机构 * Southwest Jiaotong University(西南交通大学) Nanyang Technological University(南洋理工大学) Tongji University(同济大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出RIRF框架,通过整合结构化推理流程提升图像修复的可解释性与修复质量,结合推理与修复任务实现统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07720 2026-04-13 cs.AI 57%

Towards Knowledgeable Deep Research: Framework and Benchmark

走向知识导向的深度研究:框架与基准

Wenxuan Liu, Zixuan Li, Long Bai, Chunmao Zhang, Fenghui Zhang, Zhuo Chen, Wei Li, Yuxin Zuo, Fei Wang, Bingbing Xu, Xuhui Jiang, Jin Zhang, Xiaolong Jin, Jiafeng Guo, Tat-Seng Chua, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) National University of Singapore(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出知识导向深度研究(KDR)任务,设计混合知识分析框架(HKA)并构建KDR-Bench基准,通过结构化与非结构化知识生成多模态报告,实验表明HKA在通用和知识导向指标上优于现有方法,且在视觉增强指标上超越Gemini DR代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20185 2026-04-13 cs.CL 57%

SessionIntentBench: A Multi-task Inter-session Intention-shift Modeling Benchmark for E-commerce Customer Behavior Understanding

SessionIntentBench: 一个用于电子商务客户行为理解的多任务跨会话意图转移建模基准

Yuqi Yang, Weiqi Wang, Baixuan Xu, Wei Fan, Qing Zong, Chunkit Chan, Zheye Deng, Xin Liu, Yifan Gao, Changlong Yu, Chen Luo, Yang Li, Zheng Li, Qingyu Yin, Bing Yin, Yangqiu Song

机构 * Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程系) Amazon.com Inc(亚马逊公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出SessionIntentBench基准,通过意图树概念和数据集构建流程,评估大语言模型在跨会话意图转移中的能力,发现现有模型在复杂会话中难以捕捉意图,注入意图可提升性能。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 9 篇

2604.07956 2026-04-13 cs.AI 83%

MONETA: Multimodal Industry Classification through Geographic Information with Multi Agent Systems

MONETA:通过地理信息和多智能体系统进行多模态行业分类

Arda Yüksel, Gabriel Thiem, Susanne Walter, Patrick Felka, Gabriela Alves Werb, Ivan Habernal

机构 * Trustworthy Human Language Technologies(可信人类语言技术实验室) Technical University of Darmstadt, Germany(德国达姆施塔特工业大学) Deutsche Bundesbank(德国联邦银行) Frankfurt University of Applied Sciences, Germany(德国法兰克福应用技术大学) Research Center for Trustworthy Data Science and Security, Ruhr University Bochum, Germany(德国波鸿鲁尔大学可信数据科学与安全研究中心)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出MONETA,首个基于文本和地理空间数据的多模态行业分类基准,利用多智能体系统提升分类精度,实现62.10%和74.10%的分类性能。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09426 2026-04-13 cs.HC cs.AI cs.IR 79%

Three Modalities, Two Design Probes, One Prototype, and No Vision: Experience-Based Co-Design of a Multi-modal 3D Data Visualization Tool

三种模态、两种设计探针、一个原型和没有视觉:基于经验的多模态3D数据可视化工具共设计

Sanchita S. Kamath, Aziz N Zeidieh, Venkatesh Potluri, Sile O'Modhrain, Kenneth Perry, JooYoung Seo

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan(密歇根大学)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.AI

AI总结 本文通过基于经验的共设计方法,开发出多模态3D数据可视化工具,提升视障人士对3D数据的分析能力,提供可操作的设计指南和可扩展的无障碍3D可视化方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02241 2026-04-13 cs.CV cs.RO 70%

UAV-Track VLA: Embodied Aerial Tracking via Vision-Language-Action Models

UAV-Track VLA: 通过视觉-语言-动作模型实现具身空中跟踪

Qiyao Zhang, Shuhua Zheng, Jianli Sun, Chengxiang Li, Xianke Wu, Zihan Song, Zhiyong Cui, Yisheng Lv, Yonglin Tian

机构 * Beijing Institute of Technology(北京理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Sanya(三亚学院) Beijing University of Posts and Telecommunications(北京邮电大学) Hunan University(湖南大学) Beihang University(北京航空航天大学) Flying Intelligence Team (Virtual Research Community)(飞行智能团队(虚拟研究社区))

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出UAV-Track VLA模型,通过视觉-语言-动作融合解决动态城市场景中的具身跟踪问题,提升UAV的实时控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09197 2026-04-13 cs.CV cs.AI 62%

Vision Transformers for Preoperative CT-Based Prediction of Histopathologic Chemotherapy Response Score in High-Grade Serous Ovarian Carcinoma

用于高阶浆液性卵巢癌术前CT基预测组织病理学化疗反应评分的视觉变换器

Francesca Fati, Felipe Coutinho, Marika Reinius, Marina Rosanu, Gabriel Funingana, Luigi De Vitis, Gabriella Schivardi, Hannah Clayton, Alice Traversa, Zeyu Gao, Guilherme Penteado, Shangqi Gao, Francesco Pastori, Ramona Woitek, Maria Cristina Ghioni, Giovanni Damiano Aletti, Mercedes Jimenez-Linan, Sarah Burge, Nicoletta Colombo, Evis Sala, Maria Francesca Spadea, Timothy L. Kline, James D. Brenton, Jaime Cardoso, Francesco Multinu, Elena De Momi, Mireia Crispin-Ortuzar, Ines P. Machado

机构 * European Institute of Oncology, IEO, IRCCS(欧洲肿瘤研究所) Politecnico di Milano(米兰理工大学) INESC TEC, Faculty of Engineering, University of Porto(波尔图大学工程学院INESC TEC) University of Cambridge(剑桥大学) Cancer Research UK Cambridge Centre(英国癌症研究中心剑桥中心) Cancer Research UK Cambridge Institute(英国癌症研究中心剑桥研究所) Cambridge University Hospitals NHS Foundation Trust(剑桥大学医院NHS基金会信托) Mayo Clinic(梅奥诊所) Early Cancer Institute, University of Cambridge(剑桥大学早期癌症研究所) Danube Private University(多瑙私立大学) University of Milan(米兰大学) Università Cattolica del Sacro Cuore(圣心天主教大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究利用视觉变换器构建多模态模型,通过术前CT影像与临床数据预测高阶浆液性卵巢癌的化疗反应评分,初步验证了深度学习在术前预测治疗反应中的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09308 2026-04-13 cs.AI 57%

Constraint-Aware Corrective Memory for Language-Based Drug Discovery Agents

基于约束的纠正记忆:用于基于语言的药物发现代理

Maochen Sun, Youzhi Zhang, Gaofeng Meng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出CACM框架,通过精确的集合级诊断和简洁的记忆写回机制,提升语言基药物发现代理的可靠性,实验表明其在目标级成功率提升36.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09167 2026-04-13 cs.CV cs.MA 57%

MAG-3D: Multi-Agent Grounded Reasoning for 3D Understanding

MAG-3D:多智能体基础推理用于3D理解

Henry Zheng, Chenyue Fang, Rui Huang, Siyuan Wei, Xiao Liu, Gao Huang

机构 * Tsinghua University(清华大学) Pico, ByteDance(字节跳动Pico)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出MAG-3D,一种无需训练的多智能体框架,通过动态协调专家代理实现灵活的3D基础推理,解决复杂场景中的空间和几何关系推理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03512 2026-04-13 cs.AI 57%

ActionNex: A Virtual Outage Manager for Cloud Computing

ActionNex:云计算中的虚拟故障管理器

Zhenfeng Lin, Haoji Hu, Ming Hao, Xuchao Zhang, Ryan Zhang, Junhao Li, Ze Li, Oleg Kulygin, Chetan Bansal, Hatay Tuna, Murali Chintalapati, Sheila Jiang, Salman Zafar, Angie Anderson

机构 * Microsoft PRIMO(微软PRIMO) Microsoft Research(微软研究院) Microsoft Azure Core(微软Azure Core)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出ActionNex,一个生产级智能系统,通过多模态信号处理和分层记忆子系统,实现故障管理的端到端支持,包括实时更新、知识蒸馏和基于角色和阶段的最优行动推荐,实验表明其在真实Azure故障中达到71.4%的精度和52.8-54.8%的召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03370 2026-04-13 cs.CV 57%

ShelfGaussian: Shelf-Supervised Open-Vocabulary Gaussian-based 3D Scene Understanding

ShelfGaussian:基于货架的开放词汇高斯3D场景理解

Lingjun Zhao, Yandong Luo, James Hays, Lu Gan

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 本文提出ShelfGaussian框架,利用货架监督学习方法,结合多模态高斯变换,提升3D场景理解的开放词汇能力,实验显示其在零样本语义占用预测中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10722 2026-04-13 q-bio.NC cs.NE 50%

Bridging Brains and Machines: A Unified Frontier in Neuroscience, Artificial Intelligence, and Neuromorphic Systems

连接大脑与机器:神经科学、人工智能与神经形态系统的统一前沿

Sohan Shankar, Yi Pan, Hanqi Jiang, Zhengliang Liu, Mohammad R. Darbandi, Agustin Lorenzo, Junhao Chen, Weihang You, Md Mehedi Hasan, Arif Hassan Zidan, Eliana Gelman, Joshua A. Konfrst, Jillian Y. Russell, Katelyn Fernandes, Tianze Yang, Yiwei Li, Huaqin Zhao, Afrar Jahin, Triparna Ganguly, Shair Dinesha, Yifan Zhou, Zihao Wu, Xinliang Li, Lokesh Adusumilli, Aziza Hussein, Sagar Nookarapu, Jixin Hou, Kun Jiang, Jiaxi Li, Brenden Heinel, XianShen Xi, Hailey Hubbard, Zayna Khan, Levi Whitaker, Ivan Cao, Max Allgaier, Andrew Darby, Lin Zhao, Lu Zhang, Xiaoqiao Wang, Xiang Li, Wei Zhang, Xiaowei Yu, Dajiang Zhu, Yohannes Abate, Tianming Liu

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文探讨神经科学、通用人工智能与神经形态计算的融合,提出基于脑生理学的框架,总结了突触可塑性、稀疏脉冲通信和多模态关联在下一代AGI系统中的应用,并讨论了突破冯·诺依曼瓶颈的物理子系统及四个关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态训练与对齐 6 篇

2604.08579 2026-04-13 cs.LG cs.AI 88%

On the Spectral Geometry of Cross-Modal Representations: A Functional Map Diagnostic for Multimodal Alignment

关于跨模态表示的谱几何:一种用于多模态对齐的功能图诊断

Krisanu Sarkar

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.AI

AI总结 本文研究了基于功能图框架的跨模态对齐,发现尽管功能图在不同监督预算下表现不如Procrustes对齐,但揭示了多模态表示的结构特性,提出了三种诊断量以表征跨模态表示兼容性。

Comments Under review at ACMMM Brave New Ideas Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26641 2026-04-13 cs.CV 79%

All You Need for Object Detection: From Pixels, Points, and Prompts to Next-Gen Fusion and Multimodal LLMs/VLMs in Autonomous Vehicles

自动驾驶所需的所有内容:从像素、点和提示到下一代融合和多模态LLM/VLMs

Sayed Pedram Haeri Boroujeni, Niloufar Mehrabi, Hazim Alzorgan, Mahlagha Fazeli, Abolfazl Razi

机构 * Department One(第一部门) Department Two(第二部门)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文探讨自动驾驶中物体检测的最新进展,重点介绍多模态感知、视觉语言模型和大语言模型等新兴方法,分析传感器融合策略及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08971 2026-04-13 cs.LG 78%

Modality-Aware Zero-Shot Pruning and Sparse Attention for Efficient Multimodal Edge Inference

感知-aware零样本剪枝与稀疏注意力用于高效多模态边缘推断

Yueyuan Sui, Payal Mohapatra, Doğaç Eldenk, Haodong Yang, Yiting Zhang, Haoyan Zhang, Qi Zhu, Stephen Xia

机构 * Northwestern University(西北大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出SentryFuse框架,通过模态感知的剪枝和稀疏注意力机制,在无需微调的情况下提升多模态边缘推断的效率与准确性,实现12.7%的平均精度提升和28.2%的内存减少。

详情

展开后加载摘要…

URL PDF HTML 收藏