arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-30 至 2026-06-30 共收录 151 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 24 篇

2606.01215 2026-06-30 cs.CV cs.AI cs.CL cs.MM 87%

Distilling Neuro-Symbolic Programs into 3D Multi-modal LLMs

将神经符号程序蒸馏到3D多模态大语言模型中

Wentao Mo, Yang Liu

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 图文多模态 :multi-modal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL、cs.AI

AI总结 提出APEIRIA,通过三阶段课程学习将符号推理模式蒸馏到3D多模态大语言模型中,实现透明推理与开放词汇空间推理的统一。

Comments To appear in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02804 2026-06-30 cs.CL 83%

Multimodal Mathematical Reasoning with Diverse Solving Perspective

多模态数学推理与多样化的解题视角

Wenhao Shi, Zhiqiang Hu, Yi Bin, Guoqing Wang, Xing Xu, Yang Yang, See-Kiong Ng

机构 * Tongji University(同济大学) National University of Singapore(新加坡国立大学) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) Tencent(腾讯) Center for Future Media, University of Electronic Science and Technology of China(电子科技大学未来媒体中心)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CL

AI总结 本文提出MathV-DP数据集和Qwen-VL-DP模型,通过多样化解题视角提升多模态数学推理的准确性和生成多样性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29667 2026-06-30 cs.CV cond-mat.mtrl-sci cs.AI 81%

Unlocking the Visual Record of Materials Science: A Large-Scale Multimodal Dataset from Scientific Literature

解锁材料科学的视觉记录:来自科学文献的大规模多模态数据集

Subham Ghosh, Shubham Tiwari, Mohammad Ibrahim, Abhishek Tewari

机构 * Mehta Family School of Data Science and Artificial Intelligence(梅塔家庭数据科学与人工智能学院) Indian Institute of Technology Roorkee(印度理工学院罗奥克学院) Department of Metallurgical and Materials Engineering(冶金与材料工程系)

专题命中 图文多模态 :multimodal(title);image-text(abstract);分类 cs.CV、cs.AI

AI总结 针对科学文献中复合图像导致图文配对困难的问题,提出MatMMExtract管道,通过分解复合图、利用大语言模型生成结构化标注,构建包含39万对面板级图文对的MatSciFig数据集,并引入MaterialScope检测数据集和微调YOLO12检测器,显著提升视觉语言检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02456 2026-06-30 cs.CV cs.CL 81%

See, Think, Learn: A Self-Taught Multimodal Reasoner

看见、思考、学习:一种自教的多模态推理器

Sourabh Sharma, Sonam Gupta, Sadbhawna

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出See-Think-Learn框架,通过自训练提升多模态推理能力,结合感知与推理生成结构化推理过程,增强模型区分正确与误导性回答的能力。

Comments Accepted at The Winter Conference on Applications of Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12784 2026-06-30 cs.CV cs.CL 81%

SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models

SRUM:细粒度自奖励用于统一多模态模型

Weiyang Jin, Yuwei Niu, Jiaqi Liao, Chengqi Duan, Aoxue Li, Shenghua Gao, Xihui Liu

机构 * HKU MMLab(香港大学多媒体实验室) The University of Hong Kong(香港大学) Peking University(北京大学) Noah’s Ark Lab, Huawei(华为诺亚方舟实验室) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 SRUM通过内部评估模块对生成模块进行自奖励,提升统一多模态模型的视觉生成能力,实验证明在T2I-CompBench和T2I-ReasonBench上性能显著提升。

Comments Accepted to ECCV 2026. 20 pages, 8 figures, webpage can be seen in https://waynejin0918.github.io/srum_web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28991 2026-06-30 cs.CV eess.IV 79%

Learning from Acquisition: Metadata-driven Multimodal Pre-training for Cardiac MRI

从采集信息中学习:基于元数据驱动的心脏MRI多模态预训练

Xueyi Fu, Liwei Hu, Zi Wang, Guang Yang

机构 * Department of Surgery & Cancer(外科与癌症系) Bioengineering Department and Imperial-X(生物工程系和Imperial-X) National Heart and Lung Institute(国家心脏和肺研究所) Cardiovascular Research Centre(心血管研究中心) School of Biomedical Engineering & Imaging Sciences(生物医学工程与成像科学学院)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出MetaCLIP-CMR框架,将采集元数据转化为文本监督进行对比学习,在分类和分割任务上优于ImageNet和掩码重建初始化,且仅需不到1%的预训练图像量即可达到与大规模模型相当的性能。

Comments 11 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28938 2026-06-30 cs.CL 79%

EVLA: An Electro-Aware Multimodal Assistant for Physically-Grounded Driving Reasoning and Control

EVLA:一种用于物理接地驾驶推理与控制的电感知多模态助手

Yuxin Liu, Zihan Chen, Haoyu Wang, Mingxuan Zhang, Ruijie Lin, Siyuan Zhao

机构 * College of Computer Science and Technology(计算机科学与技术学院)

专题命中 图文多模态 :multimodal(title);multi-modal(abstract);分类 cs.CL

AI总结 提出EVLA框架,融合视觉、文本与实时电动动力总成状态,通过统一共状态编码器和电感知结构化推理链,生成上下文感知且能量最优的驾驶决策,在驾驶问答基准上显著优于基线模型。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28724 2026-06-30 cs.CV cs.AI 79%

CCRC: A Change-Aware Captioning and Reasoning Chain for Image Change Captioning and Segmentation

CCRC:面向图像变化描述与分割的变化感知描述与推理链

Jinhong Hu, Xiaoping Wang, Shuyin Huang, Guojin Zhong, Kaitai Liu, Kai Lu

机构 * College of Computer Science and Electronic Engineering, Hunan University, China(湖南大学计算机科学与电子工程学院,中国) Guangxi Minzu University, China(广西民族大学,中国) National University of Defense Technology, China(国防科学技术大学,中国)

专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出变化感知描述与推理链(CCRC),通过双链框架解耦语义推理与空间分割,实现图像变化描述与分割(ICCS)任务,在合成和真实基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21815 2026-06-30 cs.CV cs.LG 74%

High-Entropy Tokens as Multimodal Failure Points in Vision-Language Models

高熵标记作为视觉-语言模型中的多模态失败点

Mengqi He, Xinyu Tian, Xin Shen, Jinhong Ni, Shu Zou, Zhaoyuan Yang, Jing Zhang

机构 * The Australia National University(澳大利亚国立大学) The University of Queensland(昆士兰大学) GE research(GE研究)

专题命中 图文多模态 :multimodal(title);分类 cs.CV

AI总结 本研究揭示视觉-语言模型中约20%的高熵标记集中了不成比例的对抗性影响,并提出基于熵引导的稀疏攻击方法(EGA),实现高攻击成功率与有害率。

Comments 19 Pages,11 figures,8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29586 2026-06-30 cs.CV cs.AI 73%

SonoCLIP: Mask-Guided Region-Aware Vision-Language Pretraining for Fetal Ultrasound Analysis

SonoCLIP: 面向胎儿超声分析的掩码引导区域感知视觉-语言预训练

Hang Su, Chao Sun, Zhaofan Li, Wei Hu, Juhua Liu, Bo Du

机构 * School of Computer Science, Wuhan University, Wuhan, China(武汉大学计算机学院,武汉,中国) Institute of Artificial Intelligence, Wuhan University, Wuhan, China(武汉大学人工智能研究院,武汉,中国) Department of Ultrasound, Renmin Hospital of Wuhan University, Wuhan, China(武汉大学仁民医院超声科,武汉,中国) National Engineering Research Center for Multimedia Software, Wuhan University, Wuhan, China(武汉大学多媒体软件国家工程研究中心,武汉,中国) Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University, Wuhan, China(湖北省多媒体与网络通信工程重点实验室,武汉大学,武汉,中国)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 提出SonoCLIP,首个百万级区域可控胎儿超声视觉-语言基础模型,通过掩码引导的全局-局部对比学习,提升对临床关键局部结构的敏感性,在零样本迁移中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28719 2026-06-30 cs.AI 70%

ComMem: Complementary Memory Systems for Test-Time Adaptation of Vision-Language Models

ComMem:视觉语言模型测试时自适应的互补记忆系统

Guanglong Sun, Shuang Cui, Bo Lei, Liyuan Wang, Zihan Zhai, Hongwei Yan, Hang Su, Jun Zhu, Yi Zhong

机构 * School of Life Sciences, IDG/McGovern Institute for Brain Research, Tsinghua University, Beijing, China(生命科学学院,IDG/麦克戈文脑科学研究院,清华大学,北京,中国) Institute of Software Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所,北京,中国) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国) Department of Psychological and Cognitive Sciences, Tsinghua University, Beijing, China(心理学与认知科学系,清华大学,北京,中国) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学-博世联合机器学习中心,THBI实验室,BNRist中心,清华大学,北京,中国)

专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出受生物互补记忆系统启发的ComMem方法,通过快速适应细节记忆和慢速整合抽象记忆协同工作,实现视觉语言模型在测试时的跨模态一致自适应,在15个基准数据集上显著优于现有方法。

Comments A brain-inspired complementary memory framework leveraging fast visual caching and slow textual refinement for VLM test-time adaptation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10310 2026-06-30 cs.CV 70%

Efficient-VLN: A Simple yet Strong Baseline for Efficient Vision-Language Navigation

Efficient-VLN: 一种高效且强大的视觉语言导航基线

Duo Zheng, Shijia Huang, Yanyang Li, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Weitu AI

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 Efficient-VLN通过三个简单有效机制解决视觉语言导航中的系统瓶颈,提升推理效率和训练稳定性,在R2R-CE和RxR-CE基准上取得新突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29357 2026-06-30 cs.CV cs.AI cs.LG 62%

Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking

利用视觉语言模型动态解析和更新自然语言规范以实现鲁棒的视觉语言跟踪

Xiao Wang, Liye Jin, Dan Xu, Yuehang Li, Lan Chen, Yaowei Wang, Yonghong Tian, Jin Tang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校) Peng Cheng Laboratory, Shenzhen(鹏城实验室深圳分部) Shenzhen Graduate School, Peking University(北京大学深圳研究生院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出语言依赖解析机制提取跟踪核心成分,并利用Qwen-VL进行成分感知的文本更新,在多个基准上取得一致优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28397 2026-06-30 cs.CV cs.AI 62%

CLOSER-VLN: Closed-Loop Self-Verified Retrieval-Augmented Reasoning for Aerial Vision-Language Navigation

CLOSER-VLN:面向空中视觉语言导航的闭环自验证检索增强推理

Shaoxuan Li, Xiangyu Dong, Xiaoguang Ma, Junfeng Chen, Haoran Zhao, Yaoming Zhou

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出CLOSER方法,通过闭环的推理、验证、检索和纠正机制,解决空中VLN中开放循环决策导致的误差累积问题,在CityNav基准上取得32.01% SR和21.28% SPL。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10764 2026-06-30 cs.CV cs.AI 62%

Break the Brake, Not the Wheel: Untargeted Jailbreak via Entropy Maximization

打破刹车,而非车轮:通过熵最大化实现无目标越狱

Mengqi He, Xinyu Tian, Xin Shen, Shu Zou, Jinhong Ni, Zhaoyuan Yang, Weikang Li, Xuesong Li, Jing Zhang

机构 * Australian National University(澳大利亚国立大学) The University Of Queensland(昆士兰大学) Peking University(北京大学) GE research(通用电气研究院) CSIRO(澳大利亚联邦科学与工业研究组织)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出UJEM-KL攻击方法,通过最大化决策令牌的熵来翻转视觉-语言模型的拒绝输出,实现高迁移性的无目标越狱。

Comments Preprint. 17 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02327 2026-06-30 cs.CV cs.AI 62%

Steerable Visual Representations

可操控的视觉表示

Jona Ruthardt, Manu Gaur, Deva Ramanan, Makarand Tapaswi, Yuki M. Asano

机构 * University of Technology Nuremberg(纽伦堡工业大学) Carnegie Mellon University(卡内基梅隆大学) International Institute of Information Technology, Hyderabad(海得拉巴国际信息技术学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出可操控的视觉表示,通过自然语言指导视觉特征,提升视觉任务的灵活性和泛化能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17117 2026-06-30 cs.CV cs.AI cs.LG 62%

PlantExpertVQA: A Visual Question Answering Dataset for Benchmarking Vision-Language Models in Plant Science

PlantExpertVQA: 一个用于植物科学中视觉语言模型基准测试的视觉问答数据集

Syed Nazmus Sakib, Nafiul Haque, Mohammad Zabed Hossain, Shifat E. Arman

机构 * Department of Robotics and Mechatronics Engineering, University of Dhaka(达卡大学机器人与机电工程系) Department of Botany, University of Dhaka(达卡大学植物学系)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 PlantExpertVQA数据集旨在提升视觉语言模型在农业决策中的应用,包含765,186个高质量问答对,涵盖38种作物和89种病害,通过多阶段流程生成并经专家审核,验证了参数高效微调的有效性。

Comments 36 pages, 9 figures, 14 tables and Submitted to Nature Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06631 2026-06-30 cs.CV cs.AI 62%

Conformal Predictions for Human Action Recognition with Vision-Language Models

基于视觉-语言模型的人类动作识别中的置信域预测

Bary Tim, Fuchs Clément, Macq Benoît

机构 * ICTEAM, UCLouvain(鲁汶大学(法语区)ICTEAM研究所)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨了如何利用置信域预测技术提升基于视觉-语言模型的人类动作识别系统可靠性,通过调整softmax温度参数减少候选类别数量,缓解长尾分布影响。

Comments 6 pages, 7 figures, Accepted to ICIP 2025 Workshops

Journal ref 2025 IEEE International Conference on Image Processing Workshops (ICIPW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08108 2026-06-30 cs.CV cs.CL cs.CR 62%

Exploiting Vision Encoder Vulnerabilities for Universal Adversarial Perturbations on Large Vision-Language Models

利用视觉编码器漏洞对大视觉-语言模型生成通用对抗扰动

Hee-Seon Kim, Minbeom Kim, Seokil Ham, Changick Kim

机构 * KAIST(韩国科学技术院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文研究了大视觉-语言模型在输入图像中对小对抗扰动的脆弱性,提出了一种针对视觉编码器内部组件的通用对抗扰动攻击框架,通过分析注意力机制识别关键脆弱组件,实现高效攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29984 2026-06-30 cs.AI 57%

Be Faithful When Response: Returning Fluent and Grounded Answers for Vision-Language Models Reinforcement Learning

回答时保持忠实:为视觉语言模型强化学习返回流畅且基于视觉依据的答案

Peng, Lee, Yin Zhang, Yanglin Zhang, Haonan Wu, Zishan Liu, Ruoxi Zang, Xin Zhu, Jiayin Zheng, Jian Yao, Zefeng Ji, Fei Ma

机构 * GMLab Hong Kong Polytechnic University(香港理工大学) XPENG Robotics(XPENG机器人)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出Faithful Warm-Start (FWS)策略,通过构建具有明确视觉-语言因果关系的FaithfulQA数据集并利用VLM裁判净化,在强化学习前预热模型,提升答案准确性、稳定训练并减少无视觉依据的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29847 2026-06-30 cs.CV 57%

See Only When Needed: Context-Aware Attention Intervention for Mitigating Hallucinations in LVLMs

仅在需要时看:用于缓解LVLM中幻觉的上下文感知注意力干预

Yuqing Lei, Wenbo Lyu, Yingjun Du, Xiantong Zhen, Cees G. M. Snoek, Ling Shao

机构 * University of Chinese Academy of Sciences(中国科学院大学) University of Amsterdam(阿姆斯特丹大学) United Imaging Healthcare Co., Ltd.(联合影像医疗科技股份有限公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出训练自由的上下文感知注意力干预(CAI),通过两轴选择性(看哪里和何时干预)在解码时针对性增强视觉 grounding,有效缓解物体幻觉并保持语言流畅性。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15632 2026-06-30 cs.CV 57%

A New Method to Capturing Compositional Knowledge in Linguistic Space

一种在语言空间中捕获组合知识的新方法

Jiahe Wan

机构 * School of Computer Science(计算机科学学院) South-Central Minzu University(西南民族大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出YUKINO方法,通过文本反转和“no”逻辑正则化,在无需硬负样本的情况下提升视觉语言模型的组合理解能力,在SugarCREPE基准上超越现有多模态SOTA模型8%以上。

Journal ref Neurocomputing, 2026: 133150

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12957 2026-06-30 cs.CV 57%

HSD: Training-Free Acceleration for Document Parsing Vision-Language Models with Hierarchical Speculative Decoding

HSD:基于分层推测解码的文档解析视觉语言模型训练免费加速

Wenhui Liao, Hongliang Li, Pengyu Xie, Xinyu Cai, Yufan Shen, Yi Xin, Qi Qin, Shenglong Ye, Tianbin Li, Ming Hu, Junjun He, Yihao Liu, Wenhai Wang, Min Dou, Bin Fu, Botian Shi, Yu Qiao, Lianwen Jin

机构 * South China University of Technology(华南理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shenzhen Institute of Advanced Technology, CAS(中国科学院深圳先进技术研究院) Nanjing University(南京大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出HSD分层推测解码框架,通过轻量级管道起草器预测区域划分并生成粗稿,分阶段验证以保持全文连贯性,实验证明在文档解析任务中实现显著加速。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16527 2026-06-30 cs.CV cs.LG 57%

Contrastive vision-language learning with paraphrasing and negation

基于改写与否定的对比视觉-语言学习

Kwun Ho Ngan, Saman Sadeghi Afgeh, Joe Townsend, Artur d'Avila Garcez

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出SemCLIP模型,通过结合改写与否定的对比损失函数,提升视觉-语言模型在处理语义变化时的鲁棒性,实验证明其在零样本下游任务中表现稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 8 篇

2603.01530 2026-06-30 cs.MM 86%

CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction

CueNet:通过跨模态线索挖掘与交互实现鲁棒的音频视觉说话人提取

Jiadong Wang, Ke Zhang, Xinyuan Qian, Ruijie Tao, Haizhou Li, Björn Schuller

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(title);分类 cs.MM

AI总结 本文提出CueNet,通过跨模态线索挖掘与交互提升音频视觉说话人提取的鲁棒性,验证了模型在不同视觉退化下的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20117 2026-06-30 cs.CV cs.SD eess.AS 84%

Delayed Bidirectional Alignment via Disentangled Audio Semantics for Audio-Visual Segmentation

通过解耦音频语义实现延迟双向对齐的音频视觉分割

Jingqi Tian, Yiheng Du, Haoji Zhang, Yuji Wang, Isaac Ning Lee, Xulong Bai, Tianrui Zhu, Jingxuan Niu, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Peking University(北京大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、eess.AS

AI总结 本文提出DDAVS方法,通过解耦音频语义和延迟双向对齐解决音频视觉分割中的多源纠缠和视听错位问题,实验表明其在多种场景下均取得最优性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29632 2026-06-30 eess.AS cs.CV cs.SD 81%

VIB-AVSR: Variational Information Bottleneck for Noise-Robust LLM-Based Audio-Visual Speech Recognition

VIB-AVSR:基于变分信息瓶颈的噪声鲁棒LLM视听语音识别

Piyush Arora, Navlika Singh, Umberto Cappellazzo, Stavros Petridis, Maja Pantic

机构 * Imperial College London(帝国理工学院伦敦分校) NatWest AI Research(NatWest人工智能研究)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS

AI总结 提出VIB-AVSR,通过在LLM骨干中插入变分信息瓶颈层来正则化表示,无需架构修改或额外数据,即可在多种噪声条件下提升AVSR鲁棒性。

Comments Accepted to INTERSPEECH 2026. Our code is available at https://github.com/PiyushArora1010/VIB-AVSR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29335 2026-06-30 cs.LG cs.AI cs.SD 79%

AMR: Adaptive Modality Routing for Multimodal Polyglot Speaker Identification

AMR: 面向多语言多模态说话人识别的自适应模态路由

Chuxiao Zuo, Yao Zhu, Minqiang Xu, Manhong Wang, Yunke Zhang, Fei Huang

机构 * Honor Device Co., Ltd(Honor设备有限公司)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态说话人识别中模态缺失和语言不匹配问题,提出自适应模态路由(AMR)模块,动态评估输入质量并融合音频和面部特征,在POLY-SIM 2026评测集上平均准确率达99.07%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08729 2026-06-30 cs.CV cs.GR cs.MM cs.SD 73%

Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation

Unison:和谐运动、语音和声音以实现以人为中心的音频视频生成

Shihao Cheng, Jiaxu Zhang, Quanyue Song, Shansong Liu, Zhizhi Guo, Xiaolei Zhang, Chi Zhang, Xuelong Li, Zhigang Tu

机构 * DeepMind OpenAI

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 Unison通过显式促进运动、语音和声音模态的协调,解决音频视频生成中模态不一致的问题,提升感知质量和跨模态同步性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05121 2026-06-30 cs.CL cs.SD eess.AS 73%

The NTNU System at the S&I Challenge 2025 SLA Open Track

NTNU系统在S&I挑战2025 SLA开放赛道中的表现

Hong-Yun Lin, Tien-Hong Lo, Yu-Hsuan Fang, Jhen-Ke Lin, Chung-Chun Wang, Hao-Chien Lu, Berlin Chen

机构 * National Taiwan Normal University(国立台湾师范大学) Department of Computer Science and Information Engineering(计算机科学与信息工程系) Institute of AI Interdisciplinary Applied Technology(人工智能跨学科应用技术研究所)

专题命中 音频语音多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CL、eess.AS

AI总结 本文提出整合W2V与Phi-4多模态大语言模型的系统,通过分数融合策略提升SLA评估性能,在Speak & Improve Challenge 2025中取得第二名,RMSE为0.375。

Comments submitted to the ISCA SLaTE-2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏