arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-13 至 2026-07-13 共收录 14 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 1 篇

2603.21309 2026-07-13 cs.CV 版本更新 57%

Test-Time Adaptation via Cache Personalization for Facial Expression Recognition in Videos

基于缓存个性化的时间测试适应用于视频面部表情识别

Masoumeh Sharafi, Muhammad Osama Zeeshan, Soufiane Belharbi, Alessandro Lameiras Koerich, Marco Pedersoli, Eric Granger

机构 * LIVIA, Dept. of Systems Engineering, ETS Montreal, Canada(LIVIA系统工程系,蒙特利尔工程学院,加拿大) LIVIA, Dept. of Software and IT Engineering, ETS Montreal, Canada(LIVIA软件与信息工程系,蒙特利尔工程学院,加拿大)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出TTA-CaP方法,通过缓存实现高效视频面部表情识别的模型个性化,减少计算开销并提升跨主体和环境变化的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 1 篇

2510.18346 2026-07-13 cs.CV 版本更新 83%

AV-Master: Dual-Path Comprehensive Perception Makes Better Audio-Visual Question Answering

AV-Master:双路径综合感知实现更优的音频视觉问答

Jiayu Zhang, Shuo Ye, Qilang Ye, Xun Lin, Zihan Song, Zitong Yu

机构 * Great Bay University(大湾区大学) Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息科技重点实验室) Nankai University(南开大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) The Chinese University of Hong Kong(香港中文大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 AV-Master通过动态建模时序和模态维度,提升模型在复杂视听场景中提取关键信息的能力,有效解决现有方法在时间采样和模态偏好意识上的不足,从而在复杂场景中增强推理能力。

Comments Accepted by IEEE Transactions on Circuits and Systems for Video Technology (TCSVT'26)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 2 篇

2408.12322 2026-07-13 cs.CV 版本更新 88%

Zero-shot 3D General Obstacle Detection via Multimodal Foundation Models and Geometry

通过多模态基础模型和几何进行零样本3D通用障碍物检测

Tamás Matuszka, Péter Hajas, Dávid Szeghy

机构 * aiMotive

专题命中 视频多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV

AI总结 针对自动驾驶中通用障碍物检测难题,提出结合多模态基础模型与几何推理的免训练零样本方法,能精准定位达100米,借基础模型先验提升召回率,还可实现可扩展自动标注。

Comments Accepted to CVPR 2026 AUTOPILOT Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29943 2026-07-13 cs.CV 版本更新 79%

Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting

EC-Bench:超长视频的枚举与计数基准

Fumihiko Tsuchiya, Taiki Miyanishi, Shunsuke Yasuki, Mahiro Ukai, Nakamasa Inoue, Shuhei Kurita, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo, Japan(东京大学) Institute of Science Tokyo, Japan(东京科学大学) National Institute of Informatics, Japan(国立信息学研究所)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 EC-Bench针对超长视频的枚举与计数问题,通过152部超过30分钟的视频和1699个查询,评估多模态大语言模型的性能,揭示模型在时间推理和计数任务中的局限性。

Comments The first two authors are equally contributed. The data and code are publicly available at: https://github.com/matsuolab/EC-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 1 篇

2403.14926 2026-07-13 stat.ML cs.LG 版本更新 78%

Contrastive Learning on Multimodal Analysis of Electronic Health Records

电子健康记录多模态分析中的对比学习

Tianxi Cai, Feiqing Huang, Ryumei Nakada, Linjun Zhang, Doudou Zhou

机构 * Harvard T.H. Chan School of Public Health(哈佛T.H. 柏林公共卫生学院) Harvard Medical School(哈佛医学院) Rutgers University(罗格斯大学) National University of Singapore(新加坡国立大学)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 研究针对电子健康记录多模态数据传统分析方法不足,提出多模态特征嵌入生成模型及对比损失来学习特征表示,经理论分析、模拟研究和真实数据验证,该方法有效且具隐私保护特性,展现了多模态学习优势。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 2 篇

2506.10915 2026-07-13 cs.CV cs.AI cs.LG 版本更新 81%

M4V: Multimodal Mamba for Efficient Text-to-Video Generation

M4V:用于高效文本到视频生成的多模态曼巴

Jiancheng Huang, Gengwei Zhang, Zequn Jie, Siyu Jiao, Yinlong Qian, Ling Chen, Yunchao Wei, Lin Ma

机构 * Meituan(美团) University of Technology Sydney(技术大学悉尼分校) Beijing Jiaotong University(北京交通大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究针对文本到视频生成计算量大的问题,引入多模态曼巴框架M4V。设计MM-DiM块,采用多模态令牌重新组合设计,增强时空一致性。实验表明,该框架能在降计算成本的同时生成高质量视频。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20730 2026-07-13 cs.CV 版本更新 70%

Render-in-the-Loop: Vector Graphics Generation via Visual Self-Feedback

循环渲染:通过视觉自反馈生成矢量图形

Guotao Liang, Zhangcheng Wang, Juncheng Hu, Haitao Zhou, Ziteng Xue, Jing Zhang, Dong Xu, Qian Yu

机构 * School of Software, Beihang University(北航软件学院) Department of Computer Science, The University of Hong Kong(香港大学计算机科学系) Paradigm(4Paradigm)

专题命中 多模态生成 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 本文提出Render-in-the-Loop方法,通过视觉上下文引导矢量图形生成,提升模型对视觉信息的利用效率,实现更高效的SVG生成。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 3 篇

2605.28215 2026-07-13 cs.AI cs.CL cs.LG cs.LO cs.MA 版本更新 82%

Explaining is Harder Than Predicting Alone: Evaluating Concept-based Explanations of MLLMs as ICL Visual Classifiers

解释比单独预测更难:评估基于概念的MLLM解释作为ICL视觉分类器

Carmen Quiles-Ramírez, Leticia L. Rodríguez, Nicolás Martorell, Natalia Díaz-Rodríguez

专题命中 多模态评测 :MLLM(title_cn,abstract_cn);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文通过五种形式化程度递增的条件,系统评估多模态大语言模型在少样本上下文学习中的基于概念的可解释性,发现解释比预测更难,且强制生成形式化解释会降低预测准确性。

Comments Accepted to the CompLearn Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17717 2026-07-13 cs.CR cs.AI stat.AP stat.ML 版本更新 57%

Machine Learning for Network Attacks Classification and Statistical Evaluation of Adversarial Learning Methodologies for Synthetic Data Generation

基于机器学习的网络攻击分类及对抗学习方法在合成数据生成中的统计评估

Iakovos-Christos Zarkadis, Christos Douligeris

机构 * University of Piraeus(希腊比雷埃乌斯大学) Dept. of Informatics(信息学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 本文通过统一多模态NIDS数据集,利用机器学习算法和对抗学习生成合成数据,评估其真实性、效用和隐私性,为入侵检测提供稳定模型。

Comments Accepted at IEEE ISCC 2026, Portugal

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13123 2026-07-13 cs.HC 版本更新 50%

From Adaptation to Intelligence: A Systematic Review of Data, Strategies, and Impact in Personalized VR

从适应性到智能性:个性化虚拟现实中数据、策略及影响的系统综述

Tangyao Li, Yitong Zhu, Hai-Ning Liang, Yuyang Wang

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文对VR个性化研究进行系统综述,聚焦沉浸时用户数据驱动的自适应策略,综合多领域研究成果总结五阶段框架,揭示新兴趋势,明确数据、建模和评估挑战,为更有效及以用户为中心的VR系统指明研究方向。

Comments 22 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态训练与对齐 2 篇

2602.18822 2026-07-13 cs.CV 版本更新 79%

Robust Self-Supervised Cross-Modal Super-Resolution against Real-World Misaligned Observations

鲁棒的自监督跨模态超分辨率对抗真实世界错位观测

Xiaoyu Dong, Jiahuan Li, Ziteng Cui, Naoto Yokoya

机构 * The Univsrsity of Tokyo(东京大学) RIKEN AIP(理化学研究所)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 RobSelf通过自监督方法实现鲁棒的跨模态超分辨率,通过误对齐感知的特征翻译和内容感知的参考滤波器提升性能和效率。

Comments ECCV 2026. Supp: https://drive.google.com/file/d/1fqTYuSY7Qp7PFHiHViZs7y6lz6Bws7ws/view?usp=sharing

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18043 2026-07-13 cs.CL cs.AI cs.CV 版本更新 67%

GrAInS: Gradient-based Attribution for Inference-Time Steering of LLMs and VLMs

GrAInS:基于梯度的大语言模型和视觉语言模型推理时引导方法

Duy Nguyen, Archiki Prasad, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究针对推理时引导LLMs和VLMs的方法局限,提出GrAInS。该方法基于梯度归因识别关键令牌构建引导向量,推理时调整激活。实验显示其性能优于微调及现有基线,能在保持模型流畅性和通用能力的同时提升多项指标。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他多模态 2 篇

2510.27048 2026-07-13 cs.RO 版本更新 78%

SpikeATac: A Multimodal Tactile Finger with Taxelized Dynamic Sensing for Dexterous Manipulation

SpikeATac: 一种多模态触觉指尖,具有像素化动态传感的灵活操作

Eric T. Chang, Peter Ballentine, Zhanpeng He, Do-Gon Kim, Kai Jiang, Hua-Hsuan Liang, Joaquin Palacios, William Wang, Pedro Piacenza, Ioannis Kymissis, Matei Ciocarlie

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 SpikeATac通过结合动态和静态触觉传感技术,实现对易碎物体的灵活操控,利用强化学习优化力调节能力。

Comments 8 pages, 8 figures, ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22784 2026-07-13 cs.CV cs.AI cs.RO 版本更新 76%

Single-Frame Point-Pixel Registration via Supervised Cross-Modal Feature Matching

基于监督跨模态特征匹配的单帧点像素配准

Yu Han, Zhiwei Huang, Yanting Zhang, Fangjun Ding, Shen Cai, Xiaoyu Tang, Yanchao Dong, Rui Fan

机构 * School of Information and Intelligent Science, Donghua University(信息与智能科学学院,东华大学)

专题命中 其他多模态 :cross-modal(title);分类 cs.CV、cs.AI

AI总结 研究激光雷达点云和相机图像的点像素配准难题,提出基于投影的无检测器框架及重复性评分机制,通过实验证明该方法在单帧激光雷达下能达先进性能,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏