arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-23 至 2026-06-23 共收录 45 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4 篇

2605.29299 2026-06-23 cs.CV cs.AI 版本更新 81%

Pocket-Dentist: On-Device Dental Image Understanding via Efficient Multimodal Large Language Models

口袋牙医:通过高效多模态大语言模型实现设备端牙科图像理解

Kai Bian, Xucheng Guo, Bin Chen, Lingyan Ruan, Yiran Shen, Ting Dang, Hong Jia

机构 * The University of Auckland, New Zealand(奥克兰大学) Shandong University, China(山东大学) The University of Melbourne, Australia(墨尔本大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出Pocket-Dentist基准,通过评估14种视觉语言模型发现紧凑模型(2B参数)在牙科图像理解中精度更高且计算成本更低,并在iPhone 17 Pro上实现低延迟部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23729 2026-06-23 cs.CV cs.AI cs.LG eess.IV 版本更新 81%

LUQ: Layerwise Ultra-Low Bit Quantization for Multimodal Large Language Models

LUQ: 多模态大语言模型的逐层超低位量化

Shubhang Bhatnagar, Andy Xu, Kar-Han Tan, Narendra Ahuja

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Los Angeles(加州大学洛杉矶分校) HP Inc.(惠普公司)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出LUQ方法,通过逐层输出激活熵衡量功能复杂度,对简单层应用超低位量化,结合多模态校准,在LLaVA-1.5和Qwen-2.5-VL上实现低于4-bit量化,内存减少40%和31%,MME性能下降<10%。

Comments Published in Transactions on Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06190 2026-06-23 cs.CV 版本更新 79%

Category-Adaptive Cross-Modal Semantic Refinement and Transfer for Open-Vocabulary Multi-Label Recognition

类别自适应跨模态语义精炼与迁移用于开放词汇多标签识别

Haijing Liu, Tao Pu, Hefeng Wu, Keze Wang, Feng Gao, Fan Yang, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Peking University(北京大学) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 提出C²SRT框架,通过类别内语义精炼(ISR)和类别间语义迁移(IST)模块,自适应建模类别内和跨类别语义相关性,提升开放词汇多标签识别性能。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00918 2026-06-23 cs.AI 版本更新 57%

Sparse Neuron Ablation Triggers Catastrophic Collapse of the Language Core in Large Vision-Language Models

稀疏神经元消融引发大型视觉-语言模型中语言核心的灾难性崩溃

Cen Lu, Yung-Chen Tang, Andrea Cavallaro

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士洛桑联邦理工学院) Idiap Research Institute(日内瓦研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出渐进式神经元消融方法CAN,发现消融极少量(如LLaVA-1.5-7b中仅4个)位于语言模型下投影层的神经元即可导致LVLM灾难性崩溃,揭示功能依赖语言骨干中的稀疏神经元子集。

Comments Accepted to ICML 2026 Mechanistic Interpretability Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 5 篇

2512.10324 2026-06-23 cs.CV 版本更新 83%

EchoingPixels: Aliasing-Resistant Joint Token Reduction for Audio-Visual LLMs

EchoingPixels: 抗混叠的音频-视觉联合令牌缩减方法

Chao Gong, Depeng Wang, Zhipeng Wei, Ya Guo, Huijia Zhu, Jingjing Chen

机构 * Fudan University(复旦大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对音频-视觉大语言模型中令牌冗余和位置混叠问题,提出EchoingPixels框架,通过跨模态语义筛和Sync-RoPE实现抗混叠的联合令牌缩减,仅用5-20%令牌达到全模型性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21050 2026-06-23 cs.SD 版本更新 78%

ERM-MinMaxGAP: Benchmarking and Mitigating Gender Bias in Multilingual Multimodal Speech-LLM Emotion Recognition

ERM-MinMaxGAP:多语言多模态语音-LLM情感识别中的性别偏见基准测试与缓解

Zi Haur Pang, Xiaoxue Gao, Tatsuya Kawahara, Nancy F. Chen

机构 * Kyoto University, Japan(京都大学,日本) Agency for Science, Technology, and Research (A*STAR), Singapore(科技研究局(A*STAR),新加坡)

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 针对多语言语音大模型在情感识别中的性别偏见问题,提出基于MELD-ST的多语言多模态基准,并设计ERM-MinMaxGAP训练目标,通过自适应公平权重和MinMaxGAP正则化器,在英日德三种语言上提升性能并缩小性别差距。

Comments This paper has been accepted for presentation at INTERSPEECH 2026 and as non-archival paper at ICML 2026 Workshop on Machine Learning for Audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21478 2026-06-23 cs.CL cs.LG eess.AS 版本更新 73%

TaigiSpeech: A Low-Resource Real-World Speech Intent Dataset and Preliminary Results with Scalable Data Mining In-the-Wild

TaigiSpeech: 一个低资源真实世界语音意图数据集及基于可扩展野外数据挖掘的初步结果

Kai-Wei Chang, Yi-Cheng Lin, Huang-Cheng Chou, Wenze Ren, Yu-Han Huang, Yun-Shao Tsai, Chien-Cheng Chen, Yu Tsao, Yuan-Fu Liao, Shrikanth Narayanan, James Glass, Hung-yi Lee

机构 * Massachusetts Institute of Technology, USA(麻省理工学院) National Taiwan University, Taipei, Taiwan(国立台湾大学) National Taiwan University Artificial Intelligence Center of Research Excellence, Taipei, Taiwan(国立台湾大学人工智能研究中心) Academia Sinica, Taiwan(台湾“中央”研究院) National Yang Ming Chiao Tung University, Taiwan(阳明交通大学) Signal Analysis and Interpretation Laboratory (SAIL), University of Southern California, USA(信号分析与解释实验室(SAIL),南加州大学)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CL、eess.AS

AI总结 针对低资源台语,构建包含21位老年人3000条话语的语音意图数据集,并探索关键词匹配与LLM伪标注、音视频框架两种数据挖掘策略,以解决标注数据稀缺问题。

Comments Interspeech 2026 long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06191 2026-06-23 eess.AS cs.AI cs.CL cs.SD 版本更新 67%

Harf-Speech: A Clinically Aligned Framework for Arabic Phoneme-Level Speech Assessment

Harf-Speech:面向阿拉伯语音素级语音评估的临床对齐框架

Asif Azad, MD Sadik Hossain Shanto, Mohammad Sadat Hossain, Bdour Alwuqaysi, Sabri Boughorbel, Yahya Bokhari, Abdulrhman Aljouie, Ayah Othman Sindi, Ehsan Hoque

机构 * Ministry of Defense, Saudi Arabia(沙特阿拉伯国防部) Ability Center, Saudi Arabia(沙特阿拉伯能力中心) University of Rochester, USA(罗切斯特大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 提出Harf-Speech模块化系统,结合MSA音素化器、微调语音到音素模型、Levenshtein对齐及混合评分器,在阿拉伯语音素级发音评估中达到0.791 Pearson相关和0.659 ICC,优于现有端到端方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14343 2026-06-23 cs.LG 版本更新 50%

Localizing and Editing Knowledge in Large Audio-Language Models

定位与编辑大型音频-语言模型中的知识

Sung Kyun Chung, Jiaheng Dong, Qiuchi Hu, Gongping Huang, Hong Jia, Ting Dang

机构 * The University of Melbourne, Australia(墨尔本大学) University of Auckland, New Zealand(奥克兰大学) Wuhan University, China(武汉大学)

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 提出首个音频知识定位与编辑基准,通过语音感知因果追踪定位事实知识存储的层和模块,并应用编辑实现细粒度知识控制。

Comments Paper was accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 9 篇

2605.08945 2026-06-23 cs.CV 版本更新 83%

MLCR: Multi-Level Cue Refinement for Long-Term Multimodal Action Quality Assessment

PIDNet: 逐步隐式解耦网络用于多模态动作质量评估

Qiqi Li, Pengfei Wang, Hongyu Chen, Nenggan Zheng

机构 * Qiushi Academy for Advanced Studies (QAAS), Zhejiang University(浙江大学启斯特先进研究院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Software Technology, Zhejiang University(浙江大学软件学院) State Key Lab of Brain-Machine Intelligence(脑机智能国家重点实验室) Collaborative Innovation Center for Artificial Intelligence by MOE and Zhejiang Provincial Government (ZJU)(教育部-浙江省人工智能协同创新中心) Zhejiang Lab(浙江实验室)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出PIDNet,通过逐步整合多模态信息与全局质量语义,提升多模态动作质量评估的准确性。采用iMambaWave模块和三阶段融合网络,有效解耦模态特定信息并增强特征表示。

Comments 14 pages, 6 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04098 2026-06-23 cs.CV 版本更新 83%

A Physics-Informed, Behavior-Aware Digital Twin for Robust Multimodal Forecasting of Core Body Temperature in Precision Livestock Farming

一种物理知情、行为感知的数字孪生方法,用于精准畜牧业中核心体温的鲁棒多模态预测

Riasad Alvi, Mohaimenul Azam Khan Raiaan, Sadia Sultana Chowa, Arefin Ittesafun Abian, Reem E Mohamed, Md Rafiqul Islam, Yakub Sebastian, Sheikh Izzal Azid, Sami Azam

机构 * Applied Artificial Intelligence and Intelligent Systems (AAIINS) Laboratory(应用人工智能与智能系统实验室) Department of Computer Science and Engineering(计算机科学与工程系) Department of Data Science and Artificial Intelligence(数据科学与人工智能系) Department of Software Systems & Cybersecurity(软件系统与网络安全系) Energy and Resources Institute, Faculty of Science and Technology(能源与资源研究所,科学与技术学院) Faculty of Science and Technology(科学与技术学院) School of Engineering and Energy(工程与能源学院)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出物理知情数字孪生框架,结合不确定性感知的专家加权堆叠集成,利用ODE热调节模型、高斯过程、卡尔曼滤波和行为马尔可夫链,融合多模态数据实现奶牛核心体温的2小时提前预测,R²达0.783。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02561 2026-06-23 cs.CV cs.AI 版本更新 81%

Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback

Oracle-RLAIF:一种利用排名反馈强化学习改进多模态视频模型微调框架的方法

Derek Shi, Ruben Glatt, Christine Klymko, Shubham Mohole, Hongjun Choi, Shashank Kushwaha, Sam Sakla, Felipe Leno da Silva

机构 * Stanford University(斯坦福大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) Microsoft(微软公司)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出Oracle-RLAIF框架,用通用排序器替代奖励模型,结合基于GRPO的排名损失函数GRPO_rank,实现更高效的多模态视频模型微调,在多个基准上优于现有方法。

Comments Proceedings of the 39th Annual Conference on Neural Information Processing Systems, ARLET Workshop (Aligning Reinforcement Learning Experimentalists and Theorists)

Journal ref Transactions on Machine Learning Research, Vol. 2026, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17901 2026-06-23 cs.CV cs.MM cs.SD 版本更新 73%

Do Modern Video-LLMs Need to Listen? A Benchmark Audit and Scalable Remedy

现代视频大语言模型需要听觉吗?基准审计与可扩展补救措施

Geewook Kim, Minjoon Seo

机构 * NAVER Cloud AI(NAVER云AI) KAIST AI(韩国国立庆北大学AI)

专题命中 视频多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM

AI总结 通过审计10个视频基准发现多数任务仅凭视觉即可解决,音频未被充分利用;提出在LLaVA-OneVision上附加语音/音频编码器,采用25倍令牌压缩,实验证明音频在需要语音理解或跨模态对齐的任务上带来显著提升。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01602 2026-06-23 cs.LG cs.AI cs.IT math.IT 版本更新 70%

Estimating Mutual Information between Time Series and Temporal Event Sequences Across Diverse Analysis Tasks

估计时间序列与时间事件序列在不同分析任务中的互信息

Haoji Hu, Huaqing Mao, Yijun Lin, Xiaowei Jia, Jinwei Zhou, Minoh Jeong, Yao-Yi Chiang

机构 * University of Minnesota - Twin Cities(明尼苏达大学-双城分校) University of Pittsburgh(匹兹堡大学) Inha University(Inha大学)

专题命中 视频多模态 :multimodal(abstract,abstract_cn);分类 cs.AI

AI总结 提出一种非参数互信息估计器,直接度量连续时间序列与离散事件序列之间的依赖关系,无需数据转换或离散化,通过处理量化伪影和事件冗余实现鲁棒统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27259 2026-06-23 cs.CV 版本更新 57%

Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark

看到场景才重要:通过场景感知的长视频基准揭示视频理解模型中的遗忘现象

Seng Nam Chen, Hao Chen, Chenglam Ho, Xinyu Mao, Jinping Wang, Yu Zhang, Chao Li

机构 * CUHK (SZ)(香港中文大学(深圳)) University of Cambridge(剑桥大学) UESTC(电子科技大学) CUHK(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SceneBench基准,揭示视频理解模型在长场景上下文中的遗忘问题,并提出Scene-RAG方法提升性能2.50%。

Comments Accepted to CVPR 2026 (Highlight)

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07298 2026-06-23 cs.CV 版本更新 57%

Mimic Human Cognition, Master Multi-Image Reasoning: A Meta-Action Framework for Enhanced Visual Understanding

模仿人类认知,掌握多图像推理:增强视觉理解的元动作框架

Jianghao Yin, Qingbin Li, Kun Sun, Cheng Ding, Jie Wang, Qin Chen, Jie Zhou, Nan Wang, Changqing Li, Pei Wu, Jian Xu, Zheming Yang, Liang He

机构 * East China Normal University(华东师范大学) ByteDance(字节跳动)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出受人类认知启发的元动作框架CINEMA,将多图像推理分解为五个结构化元动作,结合检索树采样和两阶段强化学习,在多个基准上超越GPT-4o。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22126 2026-06-23 cs.RO 版本更新 50%

EasyUUV: An LLM-Enhanced Universal and Lightweight Sim-to-Real Reinforcement Learning Framework for UUV Attitude Control

EasyUUV:一种用于UUV姿态控制的LLM增强通用轻量级仿真到现实强化学习框架

Guanwen Xie, Jingzehua Xu, Jiwei Tang, Yubo Huang, Zixi Wang, Shuai Zhang, Dongfang Ma, Juntian Qu, Xiaofan Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Department of Mechanical Engineering, The University of Hong Kong(香港大学机械工程系) Department of Data and Systems Engineering, The University of Hong Kong(香港大学数据与系统工程系) School of Civil Engineering, Southwest Jiaotong University(西南交通大学土木工程学院) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) Department of Data Science, New Jersey Institute of Technology(新泽西理工学院数据科学系) Ocean College, Zhejiang University(浙江大学海洋学院)

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出EasyUUV框架,结合并行强化学习与混合控制架构,并集成多模态大语言模型自适应调整参数,实现UUV姿态控制的鲁棒性和泛化性,经仿真与实船验证。

Comments 12 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23340 2026-06-23 cs.SI cs.DC cs.LG 版本更新 50%

CrediBench: Building Web-Scale Network Datasets for Information Integrity

CrediBench: 构建用于信息完整性的网络规模数据集

Emma Kondrup, Sebastian Sabry, Hussein Abdallah, Zachary Yang, Jiaqi Xiong, Kellin Pelrine, James Zhou, Zhijin Guo, Michael M. Bronstein, Jean-François Godbout, Reihaneh Rabbany, Shenyang Huang

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) University of Oxford(牛津大学) University of California, Berkeley(加州大学伯克利分校) AITHYRA Research Institute(AITHYRA研究院) Université de Montréal(蒙特利尔大学)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 针对现有数据集忽略网络拓扑、时序和文本内容等关键模态的问题,提出包含八个月网络图数据的CrediBench数据集,支持回归和分类任务,多模态模型显著提升性能。

Comments 16 pages,4 figures

Journal ref KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 4 篇

2507.08262 2026-06-23 cs.RO cs.AI cs.CV 版本更新 62%

CLAR: Learning 3D Representations for Robotic Manipulation by Fusing Masked Reconstruction with Multi-Level Contrastive Alignment

CLAR: 通过融合掩码重建与多层级对比对齐学习用于机器人操作的3D表示

Wenbo Cui, Chengyang Zhao, Yuhui Chen, Haoran Li, Zhizheng Zhang, Dongbin Zhao, He Wang

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所SKL-MAIS) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Carnegie Mellon University(卡内基梅隆大学) Galbot CFCS, School of Computer Science, Peking University(北京大学计算机科学与技术学院CFCS)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出CLAR框架,融合掩码自编码与全局跨模态对比学习,并引入基于可变形注意力的局部自适应对齐机制,解决3D预训练中空间几何与语义细节的权衡问题,在视觉运动策略学习中达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08819 2026-06-23 cs.IR cs.AI 版本更新 57%

Beyond Relevance: On the Relationship Between Retrieval and RAG Information Coverage

超越相关性:检索与RAG信息覆盖之间的关系

Saron Samuel, Alexander Martin, Eugene Yang, Andrew Yates, Dawn Lawrie, Ian Soboroff, Laura Dietz, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学) National Institute of Standards and Technology(国家标准与技术研究院) University of New Hampshire(新罕布什尔大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 研究检索质量与生成响应信息覆盖的关系,发现基于覆盖的检索指标与生成响应中的要点覆盖强相关,支持用检索指标代理RAG性能。

Comments 12 pages, ICTIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22307 2026-06-23 cs.CV 版本更新 57%

Johnson-Lindenstrauss Lemma Guided Network for Efficient 3D Medical Segmentation

Johnson-Lindenstrauss引理引导的高效3D医学分割网络

Jinpeng Lu, Linghan Cai, Yinda Chen, Guo Tang, Songhan Jiang, Haoyuan Shi, Zhiwei Xiong

机构 * University of Science and Technology of China(中国科学技术大学) Dresden University of Technology(德累斯顿理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 提出VeloxSeg,通过双流CNN-Transformer架构(PWA和JLC)结合格拉姆矩阵空间解耦知识迁移,在低计算预算下实现多模态3D医学图像高效分割,Dice提升26%,GPU吞吐量提升11倍。

Comments 30 pages, 12 figures. Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16689 2026-06-23 eess.SP cs.NI 版本更新 50%

Against the Monolithic Wireless World Model: Why NextG Needs Composable and Agentic Intelligence

反对单一无线世界模型:为什么NextG需要可组合和代理智能

Aladin Djuhera, Farhan Ahmed, Vlad C. Andrei, Swanand Ravindra Kadhe, Alecio Binotto, Haris Gacanin, Holger Boche

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文指出无线领域缺乏等同于LLM的数据基础,主张采用可组合和代理智能架构以实现可部署的AI原生网络。

Journal ref ICML 2026 Workshop on AI and ML for NextG

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 5 篇

2606.06356 2026-06-23 cs.AI 版本更新 79%

Where Should Knowledge Enter? A Layered Framework for Knowledge Infusion in Multimodal Iterative Generative Model

知识应从哪里注入?多模态迭代生成模型中知识注入的分层框架

Renjith Prasad, Chathurangi Shyalika, Anushka Pawar, Aahan Rathod, Amit Sheth

机构 * University of South Carolina(南卡罗来纳大学) Indian AI Research Organization(印度人工智能研究组织)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 提出一个分层框架,将多模态迭代生成模型中的知识注入分为表面层、轨迹层、潜在层和参数层四个干预层,并通过扩散模型实验证明多层组合可互补地减少知识违规输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15098 2026-06-23 cs.CV 版本更新 79%

A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models

基于离散扩散的多模态大语言模型中视觉标记冗余的综合研究

Duo Li, Zuhao Yang, Xiaoqin Zhang, Ling Shao, Shijian Lu

机构 * CCDS, NTU, Singapore(南洋理工大学新加坡分校) CCST, ZJUT, China(浙江工业大学中国分校) Terminus AI Lab, UCAS, China(中国科学院大学人工智能实验室)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究系统分析了离散扩散多模态大语言模型中视觉标记冗余的演化规律,发现其仅出现在从头训练的模型处理长答案任务时,并验证了视觉标记剪枝会导致信息损失,而层跳过和渐进剪枝分别适用于不同架构的加速。

Comments Accepted by CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026, pp. 2823-2833

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02230 2026-06-23 cs.CV cs.LG 版本更新 57%

InfiltrNet: Dual-Branch CNN-Transformer Architecture for Brain Tumor Infiltration Risk Prediction

InfiltrNet: 用于脑肿瘤浸润风险预测的双分支CNN-Transformer架构

S M Asif Hossain, Shruti Kshirsagar

机构 * School of Computing, Wichita State University(维斯科萨大学计算学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出InfiltrNet,结合CNN和Swin Transformer编码器及交叉注意力融合模块,从多模态MRI预测三区浸润风险图,利用距离变换生成标签,在BraTS数据集上优于五个基线模型。

Comments This work will be extended for a future journal submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18457 2026-06-23 eess.SP 版本更新 50%

Sense Smarter, Think Better: A Survey on Edge Perception for Next-Generation Networks

智能感知,更优思考:面向下一代网络的边缘感知

Zhonghao Lyu, Xiaowen Cao, Xianxin Song, Yuchen Li, Jiacheng Wang, Shuoyao Wang, Yuanhao Cui, Weijie Yuan, Xianghao Yu, Guangxu Zhu, Hai Liu, Jie Xu, Derrick Wing Kwan Ng, Shuguang Cui

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文综述了边缘感知的核心方法与贡献,涵盖传感模态、边缘AI技术及其协同作用,分析了边缘AI如何增强感知能力,并探讨了任务驱动感知在边缘AI中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02581 2026-06-23 cs.LG 版本更新 50%

Training Diffusion Policies via Prior-Mapping Co-Evolution

通过先验映射协同进化训练扩散策略

Chubin Zhang, Zhenglin Wan, Feng Chen, Fuchao Yang, Lang Feng, Yaxin Zhou, Xingrui Yu, Yang You, Ivor Tsang, Bo An

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Carnegie Mellon University(卡内基梅隆大学) CFAR Agency for Science Technology and Research(科技研究局(CFAR)) IHPC Agency for Science Technology and Research(科技研究局(IHPC))

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出GoRL框架,通过将策略优化限制在易处理的潜空间,同时用条件生成解码器合成动作,解耦优化与生成,实现稳定优化与表达力提升,在连续控制任务上显著超越基线。

Comments Ver 3 (Accepted as a conference paper by ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 6 篇

2603.14837 2026-06-23 cs.CV 版本更新 79%

DamageArbiter: A Multimodal Arbitration Framework for Disaster Damage Assessment from Street-View Imagery

DamageArbiter:一种基于街景图像进行灾害损伤评估的多模态仲裁框架

Yifan Yang, Lei Zou, Wenjing Gong, Kani Fu, Zongrong Li, Siqin Wang, Bing Zhou, Heng Cai, Hao Tian

机构 * organization= Department of Geography, Texas A\&M University , city= College Station , country= USA organization= Department of Landscape Architecture \& Urban Planning, Texas A\&M University , city= College Station , country= USA organization= Department of Industrial Systems Engineering, University of Florida , city= Gainesville , country= USA organization= Spatial Sciences Institute, University of Southern California , city= Los Angeles , country= USA organization= Department of Geography Sustainability, University of Tennessee , city= Knoxville , country= USA

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 提出DamageArbiter多模态仲裁框架,通过轻量级逻辑回归元分类器仲裁单模态与多模态模型预测分歧,在2556张街景图像上将准确率提升至75.85%,MCC达0.6188,并将过度自信误差从70.58%降至16.45%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14145 2026-06-23 cs.CL cs.CV 版本更新 79%

MMOU: A Massive Multi-Task Omni Understanding and Reasoning Benchmark for Long and Complex Real-World Videos

MMOU:面向长且复杂真实世界视频的大规模多任务全模态理解与推理基准

Arushi Goel, Sreyan Ghosh, Vatsal Agarwal, Nishit Anand, Kaousheik Jayakumar, Lasha Koroshinadze, Yao Xu, Katie Lyons, James Case, Karan Sapra, Kevin J. Shih, Siddharth Gururani, Abhinav Shrivastava, Ramani Duraiswami, Dinesh Manocha, Andrew Tao, Bryan Catanzaro, Mohammad Shoeybi, Wei Ping

机构 * NVIDIA, USA(NVIDIA美国分公司) University of Maryland, College Park, USA(马里兰大学帕克分校)

专题命中 多模态评测 :multimodal(abstract);audio-visual(abstract);omni-modal(abstract);分类 cs.CV、cs.CL

AI总结 提出MMOU基准,包含2万个人工标注问题与11877个长视频,覆盖13项技能,评估多模态大模型在长视频中的全模态理解与推理能力,最佳闭源模型仅64.2%准确率,开源模型46.8%。

Comments Project Page: https://huggingface.co/datasets/nvidia/MMOU

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10757 2026-06-23 cs.CV 版本更新 77%

CodePercept: Code-Grounded Visual STEM Perception for MLLMs

CodePercept: 基于代码的MLLM视觉STEM感知

Tongkun Guan, Zhibo Yang, Jianqiang Wan, Mingkun Yang, Zhengtao Guo, Zijian Hu, Ruilin Luo, Ruize Chen, Songtao Jiang, Peng Wang, Wei Shen, Junyang Lin, Xiaokang Yang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(人工智能大模型重点实验室,人工智能学院,计算机科学学院,上海交通大学) Qwen Team(通义实验室) Beijing Institute of Technology(北京理工大学) Tsinghua University(清华大学) Zhejiang University(浙江大学)

专题命中 多模态评测 :MLLM(title_cn,abstract_cn);分类 cs.CV

AI总结 本文发现多模态大模型在STEM视觉推理中感知能力是瓶颈,提出通过代码作为感知媒介,构建ICC-1M数据集和STEM2Code-Eval基准来增强和评估感知能力。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏