FATE: Frame-Level Audio-Visual Temporal Embedding
FATE:帧级视听时间嵌入
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM
AI总结 FATE是帧级视听时间嵌入模型,通过保留帧级序列与联合对比学习目标,在三项视听任务中优于基线,零样本事件定位性能接近全监督方法,与人类判断相关性最优。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
FATE:帧级视听时间嵌入
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM
AI总结 FATE是帧级视听时间嵌入模型,通过保留帧级序列与联合对比学习目标,在三项视听任务中优于基线,零样本事件定位性能接近全监督方法,与人类判断相关性最优。
InteracVid:基于直播聊天视频构建真实交互式视听响应数据集
机构 * College of AI, Tsinghua University(清华大学人工智能学院)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV
AI总结 该研究提出首个开源大规模交互式视听数据集InteracVid,解决现有生成模型监督信号缺失问题,实验证实其可提升多模态助手的交互规划与响应生成性能,为交互式多模态生成提供关键基础。
COSI-Lab:用于建模多视角多模态社会意图的会议生活实验室
专题命中 音频语音多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.AI
AI总结 COSI-Lab构建了含32名学者的会议多模态数据集,提出表观意图推理任务及相关标注、分析、基准等贡献,助力智能系统处理主观感知。
OmniMate:用于交互式虚拟化身的开放式实时流视听生成
机构 * China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能技术(北京)有限公司)
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 研究针对实时交互式流中生成范围未知和跨模态身份一致性退化的挑战,提出OmniMate框架,通过生成进度控制器和多参考条件模块,实现高质量、低延迟的开放式实时交互式视听虚拟化身生成及长期跨模态身份一致性。
智能体是否会梦到虚假记忆?对多模态人工智能智能体长期记忆的黑盒视觉攻击
机构 * University of California, Irvine(加州大学尔湾分校)
专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 研究针对多模态人工智能智能体长期记忆的黑盒视觉攻击,提出Lucid框架,通过制作扰动实现记忆中毒和注入两种攻击模式,在多种对话领域和架构上评估,揭示了多模态记忆管道的结构漏洞。
Comments 34 pages, 5 figures, 15 tables
携带证明的多模态时间线:用于视频-音频一致性的有限轨迹模态证书
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.MM
AI总结 研究视频-音频一致性问题,核心方法是将其作为有限轨迹模态监测,通过公式库规定多种一致性,证书记录关键信息,工件进行视频解码等操作,贡献是提供可重现见证及相关处理流程。
Comments 15 pages, 5 figures, 4 tables; ancillary files https://huggingface.co/datasets/Lightcap/pcmt-artifact
用于视听导航的混合曼巴
机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) ; Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学具身智能联合研究实验室) ; Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语言认知计算国际联合研究实验室)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.AI
AI总结 研究针对视听导航骨干网络多年未变的问题,提出Samba,用曼巴状态编码器取代传统GRU,构建音频曼巴编码器,实验表明其泛化性能出色,能提升导航成功率,以低成本解锁更强能力,为范式演进提供途径。
Comments Main paper (6 pages). Accepted for publication by IEEE International Conference on Systems and Man and Cybernetics 2026 (IEEE SMC 2026)
MAR3:多智能体识别、推理与反思用于参考音频视觉分割
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.MM
AI总结 本文提出MAR3框架,通过多智能体机制解决参考音频视觉分割中的表达难度识别、模态主导性分析及反思学习问题,提升分割精度。
Comments Accepted by ACM MM 2026
超越时间偏移:将全能语言模型(Omni-LLM)适配为生成式视听模型的无参考评估器
机构 * Zhejiang University(浙江大学) ; The Hong Kong Polytechnic University(香港理工大学) ; IROOTECH TECHNOLOGY(易路泰克科技)
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 研究针对视听生成模型跨模态同步评估难题,提出框架解决人类与自动化评估指标的矛盾。通过引入数据集、适配模型及提出优化方法,实现先进的人类偏好对齐,建立标准化基准推动评估从信号相关性到因果关系发展。
Comments Accepted to ECCV 2026
AV-Master:双路径综合感知实现更优的音频视觉问答
机构 * Great Bay University(大湾区大学) ; Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息科技重点实验室) ; Nankai University(南开大学) ; Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 AV-Master通过动态建模时序和模态维度,提升模型在复杂视听场景中提取关键信息的能力,有效解决现有方法在时间采样和模态偏好意识上的不足,从而在复杂场景中增强推理能力。
Comments Accepted by IEEE Transactions on Circuits and Systems for Video Technology (TCSVT'26)
VSRo-200:用于研究监督和多模态鲁棒性的罗马尼亚语视觉语音识别数据集
机构 * University of Bucharest(布加勒斯特大学)
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV
AI总结 本文介绍罗马尼亚语视觉语音识别数据集VSRo-200,通过伪标签和人工转录注释样本,建立低资源视觉语音识别基准。研究监督质量影响,评估域转移鲁棒性及噪声下视听语音识别,证明其表示可转移至其他基准,为相关研究提供新测试平台。
AV-SyncBench:音视频时间与语义同步的解耦基准测试
机构 * Alibaba Group(阿里巴巴集团) ; Tsinghua University(清华大学) ; Fudan University(复旦大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV
AI总结 提出AV-SyncBench,首个完全分离音视频时间与语义一致性评估的基准,涵盖语音、音乐和声音三大类10个场景5项挑战任务,基于野外视频构建并人工验证,用于量化特征提取模型的对齐质量。
Comments Accepted by Interspeech 2026
SocialOmni: 全模态模型中音视频社交互动性的基准测试
机构 * Media Analytics and Computing Lab, Xiamen University(厦门大学媒体分析与计算实验室) ; Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究所) ; School of Informatics, Xiamen University(厦门大学信息学院) ; Sichuan Agricultural University(四川农业大学) ; Department of Computer Science, University of Rochester(罗切斯特大学计算机科学系)
专题命中 音频语音多模态 :audio-visual(title,abstract);omni-modal(abstract);分类 cs.AI
AI总结 提出SocialOmni基准,从说话人分离、打断时机和自然打断生成三个维度评估全模态大模型的社交互动能力,发现感知准确性与上下文打断生成能力存在显著脱耦。
Comments Code is available at https://github.com/MAC-AutoML/SocialOmni and dataset is available at https://huggingface.co/datasets/alexisty/SocialOmni
MJEPA:一种简单且可扩展的音频-视觉联合嵌入预测架构
机构 * FAIR at Meta(Meta AI研究实验室) ; New York University(纽约大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出MJEPA,使用统一编码器和单一预测目标进行跨模态预测,在音频分类任务上超越先前方法,并减少视频数据需求。
基于扩散的视觉条件语音增强中的音视频对比对齐
机构 * Université de Lorraine, CNRS, Inria, Loria, Nancy, France(洛林大学、法国国家科学研究中心、法国国家信息与自动化研究所、Loria研究所、法国南希)
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.AI
AI总结 提出在扩散训练目标中加入对比音视频损失,增强视觉信息利用,提升语音增强性能,尤其在低信噪比下改善显著。
Journal ref INTERSPEECH, Sep 2026, Sydney, Australia
MuVAP: 面向野外对话轮次预测的多模态多方语音活动投影
机构 * Department of Speech Music and Hearing, KTH Stockholm, Sweden(瑞典皇家理工学院言语、音乐与听觉系)
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.AI
AI总结 提出MuVAP框架,通过将声学预测锚定到面部轨迹,实现从单声道音频和单摄像头视角进行说话人感知的轮次预测,并引入角色相对投影和AVCC数据集解决多方建模和因果跟踪问题。
EchoingPixels: 抗混叠的音频-视觉联合令牌缩减方法
机构 * Fudan University(复旦大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 针对音频-视觉大语言模型中令牌冗余和位置混叠问题,提出EchoingPixels框架,通过跨模态语义筛和Sync-RoPE实现抗混叠的联合令牌缩减,仅用5-20%令牌达到全模型性能。
Comments ICML 2026
MaineCoon: 追求实时音视频社交世界模型
机构 * Catnip AI Team(Catnip AI团队)
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出MaineCoon,首个22B参数的实时音视频自回归模型,支持单GPU上高达47.5 FPS的流式生成和亚秒级交互,专为社交互动应用优化,引入自重采样、跨模态对齐、领域偏好优化和强化在线策略蒸馏等技术。
Comments 32 pages, 13 figures, 3 tables
音频-视觉交换感知令牌剪枝用于高效音频-视觉字幕生成
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV
AI总结 提出基于强化学习的AVEX-Prune方法,通过跨模态令牌交换策略选择高置信度令牌,在40%保留率下保持全令牌质量。
用于音视频事件识别的稳定混合交叉注意力融合
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 eess.AS
AI总结 提出一种结合VideoMAE和AST的混合交叉注意力融合框架,通过FiLM音频条件、双向交叉注意力融合和多模态Transformer编码,在AVE数据集上达到91.74%的验证准确率和83.85%的测试准确率。
Comments 6 pages, 4 Figures
SVHalluc: 音频-视觉大语言模型中的语音-视觉幻觉基准测试
机构 * KAIST(韩国国立信息通信研究院)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 针对音频-视觉大语言模型中的语音-视觉幻觉问题,提出SVHalluc基准,从语义和时间两个维度评估模型将语音内容与视觉信号对齐的能力,发现现有模型存在跨模态理解局限。
Comments Accepted at CVPR 2026
你的多模态语音模型说我有张适合电台的脸
机构 * Language Technology Lab University of Amsterdam(语言技术实验室 阿姆斯特丹大学) ; Heidelberg Institute for Theoretical Studies(海德堡理论研究所)
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CL
AI总结 通过配对不同人脸与相同音频的视频,评估多模态语音识别模型在性别、种族及其交叉属性上的偏差,发现质量差异显著,提示多模态并非必然更好。
SpongeBob:同步感知的和谐视听生成式编辑
机构 * University of Science and Technology of China(科学技术大学) ; Tencent Hunyuan(腾讯文生)
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出首个端到端视听联合编辑框架SpongeBob,通过双向跨模态交互的同步感知机制和上下文感知模块,解决视频编辑中的音画不同步和语义冲突问题。
并非所有模态都平等:面向多模态视频的指令感知门控
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能学院) ; Tianjin University(天津大学) ; Chongqing University(重庆大学) ; Linköping University(林奈大学)
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出UniMVU框架,通过内模态和模态级指令感知动态门控实现多模态视频理解,在六个基准上优于静态融合方法。
Comments 19 pages, 8 figures, 7 tables, preprint
EMO-BOOST:情感增强的音频视觉特征用于深度伪造检测中的泛化改进
机构 * Technical University of Darmstadt(达姆施塔特技术大学) ; ELIZA
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.AI
AI总结 本文提出EMO-BOOST框架,通过融合传统RGB和声学聚焦检测器与基于情感的EmoForensics检测器,利用高阶语义线索提升深度伪造检测的泛化能力,实验显示在FakeAVCeleb数据集上平均跨操纵泛化AUC提升了2.1%。
Comments Accepted at SAFE@CVPRW 2026
基于语音引导的多模态学习用于实时MRI中的声道分割
机构 * Harvard Medical School / Massachusetts General Hospital(哈佛医学院/麻省总医院) ; Institute for Information Processing, Leibniz University Hannover(汉诺威莱布尼茨信息处理研究所) ; GITA Lab, Facultad de Ingeniería. Universidad de Antioquia UdeA(安提奥基亚大学工程学院GITA实验室)
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出了一种三阶段框架,利用语音和语音学监督进行训练,仅需实时MRI图像进行推理,通过将语音学表示转换为空间边界框先验进行发音器官定位,通过双级跨模态对比预训练对视觉和音频编码器对齐,并通过跨注意力解码器融合学习的表示,有效将多模态知识转移到单模态推理管道中,实验表明该方法在75-Speaker~Annot-16和USC-TIMIT数据集上优于现有单模态和多模态方法。
Comments under review
AuralSAM2:通过金字塔音频视觉特征提示实现SAM2的听觉能力
机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) ; Australian Institute for Machine Learning, Adelaide University(阿德莱德大学人工智能研究所) ; Stanford University(斯坦福大学) ; University of Central Florida(佛罗里达中央大学) ; University of Surrey(萨里大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 AuralSAM2通过金字塔音频视觉特征提示整合音频,保持SAM2的可提示分割能力,引入AuralFuser融合音频和视觉特征,并通过音频引导对比损失对齐模态,提升分割精度。
Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026
TB-AVA:文本作为语义桥梁用于音频-视觉参数高效微调
机构 * AI2 Lab, KAIST(AI2实验室,韩国科学技术院)
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出利用文本作为语义桥梁,通过冻结音频和视觉编码器构建参数高效微调框架,实现音频与视觉流的文本介导交互,实验表明其在多个基准上取得最佳性能。
Comments 12 pages, 6 figures
JUST-DUB-IT: 通过联合音频-视觉扩散进行视频配音
机构 * Tel Aviv University(特拉维夫大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV
AI总结 本文提出JUST-DUB-IT方法,利用轻量LoRA调整基础音频-视频扩散模型,实现视频到视频的高质量配音,提升视觉保真度和唇同步性能。
Comments Project webpage available at https://justdubit.github.io
通过认知双通路推理缓解多模态不一致:意图识别
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM
AI总结 本文提出认知双通路推理框架,通过构建稳定语义基础和缓解高层语义冲突,提升多模态意图识别的准确性和鲁棒性。
Comments Accepted by ICMR 2026 (Main Track, Long Paper)