arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-20 至 2026-07-20 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 5 篇

2607.16107 2026-07-20 eess.AS cs.CV 新提交 86%

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

视听火烈鸟:用于长而复杂视频的开放视听智能

Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Siddharth Gururani, Hanrong Ye, Pritam Biswas, Yuanhang Su, Ehsan Hosseini-Asl, Sang-gil Lee, Zhifeng Kong, Jaehyeon Kim, Sungwon Kim, S Sakshi, Ramani Duraiswami, Dinesh Manocha, Andrew Tao, Mohammad Shoeybi, Bryan Catanzaro, Ming-Yu Liu, Wei Ping

机构 * NVIDIA, USA(美国NVIDIA公司) University of Maryland, USA(美国马里兰大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);omni-modal(abstract);分类 cs.CV、eess.AS

AI总结 研究提出视听火烈鸟,用于长复杂视频的联合理解与推理。贡献包括构建大规模视频集、设计三阶段课程及推理框架。实验显示其在多基准测试中表现优异,超越同类开放模型,在长复杂视听理解推理任务中竞争力强,有现实应用价值和泛化能力。

Comments Project Page: https://avflamingo.pages.dev/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15295 2026-07-20 cs.MM cs.AI cs.LG cs.SD 新提交 86%

AV-JEPA: Extending LeJEPA to Audio-Visual Self-Supervised Learning

AV-JEPA:将LeJEPA扩展到视听自监督学习

Benjamin Robson, Santeri Mentu, Wenshuai Zhao, Arno Solin

机构 * ELLIS Institute Finland(芬兰ELLIS研究所) Department of Computer Science, Aalto University, Espoo, Finland(艾尔沃斯大学计算机科学系)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 研究将LeJEPA扩展到视听自监督学习,核心方法是用早期融合视觉Transformer和模态丢弃作掩码训练模型对齐视图嵌入,主要贡献是实现跨模态对齐,架构简洁,在分类任务中有竞争力且支持零样本音频-视频检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15657 2026-07-20 cs.CR cs.CV cs.LG 新提交 83%

Do Agents Dream of False Memories? Black-box Visual Attacks on Long-term Memory in Multimodal AI Agents

智能体是否会梦到虚假记忆?对多模态人工智能智能体长期记忆的黑盒视觉攻击

Halima Bouzidi, Mboutidem Ekemini Mkpong, Mohammad Abdullah Al Faruque

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 研究针对多模态人工智能智能体长期记忆的黑盒视觉攻击,提出Lucid框架,通过制作扰动实现记忆中毒和注入两种攻击模式,在多种对话领域和架构上评估,揭示了多模态记忆管道的结构漏洞。

Comments 34 pages, 5 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15285 2026-07-20 cs.MM 新提交 83%

Proof-Carrying Multimodal Timelines: Finite-Trace Modal Certificates for Video-Audio Consistency

携带证明的多模态时间线:用于视频-音频一致性的有限轨迹模态证书

Faruk Alpay, Hamdi Alakkad

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.MM

AI总结 研究视频-音频一致性问题,核心方法是将其作为有限轨迹模态监测,通过公式库规定多种一致性,证书记录关键信息,工件进行视频解码等操作,贡献是提供可重现见证及相关处理流程。

Comments 15 pages, 5 figures, 4 tables; ancillary files https://huggingface.co/datasets/Lightcap/pcmt-artifact

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05782 2026-07-20 cs.SE 版本更新 78%

When Models Meet Users: An Empirical Study of Perceptions of General LLMs and Multimodal LLMs on Hugging Face

对Hugging Face上通用大语言模型和多模态大语言模型感知的实证研究

Yujian Liu, Xiao Yu, Jacky Keung, Xing Hu, Xin Xia, Xiaoxue Ma

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 本文通过分析Hugging Face上662条讨论帖,揭示用户对LLM的主要关注点,包括访问障碍、生成质量及部署复杂性,并提出改进LLM生态系统的建议。

详情

展开后加载摘要…

URL PDF HTML 收藏