arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-13 至 2026-08-13 共收录 21 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 2 篇

2603.17450 2026-08-13 cs.IR cs.AI 版本更新 83%

VLM2Rec: Resolving Modality Collapse in Vision-Language Model Embedders for Multimodal Sequential Recommendation

VLM2Rec: 解决视觉语言模型嵌入器在多模态序列推荐中的模态崩溃问题

Junyoung Kim, Woojoo Kim, Wonbin Kweon, Jaehyung Lim, Dongha Kim, Hwanjo Yu

机构 * Pohang University of Science

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出VLM2Rec框架,通过弱模态惩罚对比学习和跨模态关系拓扑正则化,解决多模态序列推荐中模态崩溃问题,提升推荐准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00237 2026-08-13 cs.CV cs.RO 版本更新 57%

Latent-Centroid Steering: Single-Pass Classifier-Free Guidance for Command-Aligned Autonomous Driving

隐式质心引导:用于指令对齐自动驾驶的单次无分类器引导

Meibo Hu, Jiamian Wang, Pichao Wang, Zhiqiang Tao

机构 * Rochester Institute of Technology(罗切斯特理工学院) NVIDIA(英伟达公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对视觉语言自动驾驶模型的指令跟随差距,提出单次引导机制LCS,降低推理延迟约50%,在Bench2Drive和nuScenes基准上提升指令遵循与驾驶性能。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 1 篇

2512.15124 2026-08-13 cs.SD 版本更新 82%

Synaspot: A Lightweight, Streaming Multi-modal Framework for Keyword Spotting with Audio-Text Synergy

Synaspot:一种轻量级、流式多模态框架,用于音频-文本协同的关键字检测

Kewei Li, Yinan Zhong, Xiaotao Liang, Tianchi Dai, Shaofei Xue

专题命中 音频语音多模态 :multi-modal(title,abstract);multimodal(abstract)

AI总结 Synaspot提出了一种轻量级流式多模态框架,通过减少说话人特定信息和有效融合语音文本特征,实现更高效的关键字检测。

Comments Accepted by IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 5 篇

2606.17598 2026-08-13 cs.RO cs.CV 版本更新 79%

MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation

MuseVLA: 一种用于机器人操作的自适应多模态感知视觉-语言-动作模型

Xingyuming Liu, Ruichun Ma, Heyu Guo, Qixiu Li, Qingwen Yang, Lin Luo, Shiqi Jiang, Chenren Xu, Jiaolong Yang, Baining Guo

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Microsoft Research Asia(微软亚洲研究院) Princeton University(普林斯顿大学) Tsinghua University(清华大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出MuseVLA模型,通过将传感器作为按需工具集成,实现自适应多模态感知;设计传感器图像统一表示,并引入数据合成流水线,在灵巧手操作任务中平均成功率80.6%,显著优于RGB-only和多模态基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11109 2026-08-13 cs.RO 版本更新 78%

FEWT: Frequency-Enhanced Wavelet-based Transformer for Multimodal Wheeled Bimanual Manipulation

FEWT:用于多模态轮式双臂操作的频率增强型小波Transformer

Jiaxin Huang, Hanyu Liu, Yunsheng Ma, Jian Shen, Yilin Zheng, Jiayi Wen, Zhigong Song

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本研究针对轮式双臂操作的空间视觉与物理动力学表示不匹配问题,提出FEWT框架,整合FE-EMA与TS-DWT模块并结合STF传感器,在模拟及真实操作任务中较基准取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10915 2026-08-13 cs.AI 版本更新 57%

ComBodied Agents: a New Paradigm of Human-Centric Agentic AI

具身融合智能体:以人为中心的智能体人工智能新范式

Qianggang Ding, Xingyao Wang, Rui Feng, Zhibin Wang, Feixiang Yao, Kelong Mao, Hao Sun, Zhiyao Luo, Jiankai Tang, Lei Li, Jiadong Guo, Minheng Ni, Weicong Lin, Chenxi Yang, Hongxiang Gao, Zhenghua Chen, Yang Bai, Min Wu, Jun Cheng, Huazhu Fu, Dacheng Tao, Bang Liu

机构 * Université de Montréal(蒙特利尔大学) Mila – Quebec Artificial Intelligence Institute(米拉-魁北克人工智能研究所) Institute of Advanced Intelligence and Computing (IAIC), A*STAR(新加坡科技研究局高级智能与计算研究所) Nanjing Medical University(南京医科大学) Nanjing University(南京大学) Renmin University of China(中国人民大学) University of Cambridge(剑桥大学) University of Oxford(牛津大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong Polytechnic University(香港理工大学) Southern University of Science and Technology(南方科技大学) Southeast University(东南大学) University of Glasgow(格拉斯哥大学) Nanyang Technological University(南洋理工大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 该研究提出以人为中心的 Combodied Agents 新范式,整合多类智能体能力形成闭环,聚焦人类状态轨迹建模,推动智能体 AI 从任务完成转向人类持续福祉。

Comments 38 pages, 6 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07037 2026-08-13 hep-ex cs.CV 版本更新 57%

Towards foundation-style models for energy-frontier heterogeneous neutrino detectors via self-supervised pre-training

迈向能量前沿异质中微子探测器的风格化模型:通过自监督预训练

Saúl Alonso-Monsalve, Fabio Cufino, Umut Kose, Anna Mascellani, André Rubbia

机构 * IPA, ETH Zürich(瑞士苏黎世联邦理工学院IPA研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种稀疏ViT框架,通过自监督预训练学习异质探测器数据的可重用表示,提升中微子风味和charm夸克识别、动量回归和顶点重建性能。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12908 2026-08-13 cs.RO 版本更新 50%

Robotic Manipulation is Vision-to-Geometry Mapping: Vision-Geometry Backbones over Language and Video Models

机器人操作是视觉到几何映射(f(v)→G):超越语言和视频模型的视觉-几何骨干

Zijian Song, Qichang Li, Jiawei Zhou, Zhenlong Yuan, Tianshui Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis(大数据分析与处理广东省重点实验室) X-Era AI Lab(X-Era人工智能实验室) AMAP, Alibaba(阿里妈妈实验室) Guangdong University of Technology(广东工业大学)

专题命中 视频多模态 :image-text(abstract)

AI总结 本文提出基于视觉-几何骨干的机器人操作方法,通过直接利用预训练的3D表示生成动作,优于传统语言或视频模型,在精确操作和零样本泛化中表现更优。

Comments Accepted at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态生成 2 篇

2608.02474 2026-08-13 cs.CV 版本更新 83%

EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation

EchoCache:面向高效音频驱动视频生成的能量引导跨模态缓存

Jiayu Chen, Xiaoyu Wu, Rongshan Gao, Maoliang Li, Zihao Zheng, Xinhao Sun, Hailong Zou, Guojie Luo, Xiang Chen

机构 * Peking University(北京大学) Taiyuan University of Technology(太原理工大学)

专题命中 多模态生成 :cross-modal(title,abstract);audio-visual(abstract);分类 cs.CV

AI总结 EchoCache是一种能量引导跨模态缓存框架,通过利用音频时频能量锚点与动态缓存机制,在保持音频驱动视频生成质量的同时,实现了2.46倍的推理加速,优化了延迟-质量权衡。

Comments EchoCache is honored to be accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17585 2026-08-13 cs.CV 版本更新 57%

Pixel-Space Diffusion Transformers

像素空间扩散变换器

Renye Yan, Jikang Cheng, You Wu, Ling Liang, Wei Peng, Athanasios V. Vasilakos, Qingyu Zhao, Yu Zhang, Yimao Cai, Kilian M. Pohl, Guoying Zhao

机构 * Peking University(北京大学) Nanjing University(南京大学) Stanford University(斯坦福大学) Cornell University(康奈尔大学) University of Oulu(奥卢大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文探讨像素空间扩散变换器,针对潜在扩散模型的局限,研究直接对原始像素建模的像素空间扩散方法,介绍其在高维建模中的挑战与多模态建模优势,从多方面回顾pDiTs,总结方法、识别挑战并展望未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态评测 7 篇

2606.09648 2026-08-13 cs.DB cs.AI 版本更新 83%

ArtiFact: A Large-Scale Multi-Modal Cultural Heritage Dataset

ArtiFact: 大规模多模态文化遗产数据集

Luciano Duarte, Olga Ovcharenko, Sebastian Schelter

机构 * BIFOLD & TU Berlin(BIFOLD与柏林技术大学)

专题命中 多模态评测 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出包含65万条博物馆记录的多模态文化遗产数据集ArtiFact,用于跨模态错误检测和语义查询处理,揭示现有系统在领域特定错误和文化语义查询上的挑战。

Comments NOVAS Workshop at VLDB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00056 2026-08-13 cs.CY cs.AI cs.CL 版本更新 81%

How effective are VLMs in assisting humans in inferring the quality of mental models from Multimodal short answers?

VLMs在帮助人类推断从多模态简答中获得的思维模型质量的有效性如何?

Pritam Sil, Durgaprasad Karnam, Vinay Reddy Venumuddala, Pushpak Bhattacharyya

机构 * Department of Computer Science and Engineering, IIT Bombay(印度理工学院班加罗尔分校计算机科学与工程系) Center for Educational Technology, IIT Bombay(印度理工学院班加罗尔分校教育技术中心) School of Management, Mahindra University(马恒达大学管理学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MMGrader方法,通过概念图框架从多模态回答推断学生思维模型质量,发现最佳模型在人类水平上表现不足,但能有效辅助教师改进教学。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17332 2026-08-13 cs.CV cs.AI 版本更新 81%

P2MFDS: A Privacy-Preserving Multimodal Fall Detection System for Elderly People in Bathroom Environments

P2MFDS:面向浴室环境老年人的隐私保护多模态跌倒检测系统

Haitian Wang, Yiren Wang, Xinyu Wang, Yumeng Miao, Yuliang Zhang, Yu Zhang, Atif Mansoor

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) Department of Computer Science and Software Engineering, The University of Western Australia(西澳大学计算机科学与软件工程系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对浴室环境老年人跌倒检测的单模态系统准确率受限问题,本文提出P2MFDS多模态系统,融合毫米波雷达与3D振动传感,构建大规模隐私保护数据集,双流网络结合多尺度特征,提升了跌倒检测的准确率与召回率。

Comments Accepted to appear in the 2025 IEEE International Workshop on AIoT and Smart Systems (AIoTSys'25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23733 2026-08-13 cs.CL 版本更新 79%

Multimodal QUD: Inquisitive Questions from Scientific Figures

多模态QUD:来自科学图表的探究性问题

Yating Wu, William Rudman, Venkata S Govindarajan, Alexandros G. Dimakis, Junyi Jessy Li

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Ithaca College(伊萨卡学院) UC Berkeley, BespokeLabs.ai(伯克利大学,BespokeLabs.ai)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出多模态QUD数据集,通过结合图表与文本上下文生成探究性问题,提升多模态推理能力,实现更高质量的视觉 grounding。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05356 2026-08-13 cs.CV cs.RO 版本更新 74%

LoDA: A Level of Detection Aware Method and a Multimodal Sensing Benchmark for Object Level Change Detection

LoDA:一种面向目标级变化检测的检测级别感知方法及多模态感知基准

Haitian Wang, Xinyu Wang, Sheldon Fung, Xian Zhang, Zichen Geng

机构 * Western Australia Machine Intelligence Group Pty Ltd(西澳大利亚机器智能集团有限公司) The University of Western Australia(西澳大利亚大学) Curtin University(科廷大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 该研究针对自动驾驶等领域的目标级变化检测问题,提出LoDA检测级别感知方法,构建LoDA基准,在Subiaco和Urb3DCD-V2基准上均超越现有最佳基线,提升了变化检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12310 2026-08-13 cs.CL cs.AI 版本更新 73%

LakeQuest: A Three-Domain Benchmark for Grounded Question Answering across Data Lakes

LakeQuest:用于跨数据湖的有基础问答的三领域基准测试

Michael Solodko, Steven Gong, Guangwei Yu, Satya Krishna Gorti, Jesse C. Cresswell, Victor Zhong

机构 * University of Waterloo(滑铁卢大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 介绍LakeQuest基准测试,用于评估跨数据湖的有基础问答。它跨越三个领域,含9846个QA对及证据指针,能暴露系统故障模式。通过基线评估发现高质量检索不能保证正确推理,凸显未来智能QA系统需强大发现和跨文件组合机制。

Comments 24 pages, 4 figures, 18 tables. Accepted at the Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09996 2026-08-13 cs.CV 版本更新 70%

Omni-Persona: Systematic Benchmarking and Improving Omnimodal Personalization

Omni-Persona:系统性基准测试与改进多模态个性化

Yeongtak Oh, Dongwook Lee, Sangkwon Park, Heeseung Kim, Sungroh Yoon

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电气与计算机工程系) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔国立大学人工智能跨学科项目) Department of Artificial Intelligence, University of Seoul(首尔大学人工智能系)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 Omni-Persona提出首个多模态个性化基准,通过Persona Modality Graph任务组和细粒度任务,系统分析多模态个性化中的接地行为,提出Calibrated Accuracy评估方法,揭示开源模型在音频与视觉接地上的差距及SFT与RLVR的局限性。

Comments Project Page: https://github.com/oyt9306/Omni-Persona

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态Agent 1 篇

2602.14098 2026-08-13 cs.CV 版本更新 77%

ForgeryVCR: Visual-Centric Reasoning via Efficient Forensic Tools in MLLMs for Image Forgery Detection and Localization

ForgeryVCR: 通过高效的取证工具在MLLMs中实现视觉中心推理用于图像伪造检测与定位

Youqi Wang, Shen Chen, Haowei Wang, Rongxuan Peng, Taiping Yao, Shunquan Tan, Changsheng Chen, Bin Li, Shouhong Ding

机构 * Shenzhen University(深圳大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 ForgeryVCR通过高效的取证工具实现视觉中心推理,提升图像伪造检测与定位的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态训练与对齐 3 篇

2607.26608 2026-08-13 cs.CV 版本更新 91%

Understanding Knowledge Transfer Mechanism in Heterogeneous MLLM Fusion: A Simple Linear Approach

理解异构多模态大语言模型(MLLM)融合中的知识迁移机制:一种简单线性方法

Yinghao Hou, Jiahe Fan, Yuanhao Pu, Zongyuan Chen, Hong Xie

专题命中 多模态训练与对齐 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV

AI总结 该研究针对异构MLLM跨规模知识迁移机制,提出CDPI线性探针,经多组模型与基准测试发现,融合增益集中于高层推理,且正向迁移多发生在小比率区间。

Comments 17 pages, 6 figures; includes supplementary material. Revised presentation and terminology; results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16409 2026-08-13 cs.CV cs.CL cs.LG 版本更新 84%

Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models

多语言OCR感知微调和提示引导的链式思维推理用于多模态大语言模型

Qinwu Xu, Yifan Jiang, Haoyu Ren

机构 * Meta AI UT Austin(德克萨斯大学奥斯汀分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 提出一种多语言OCR感知的多模态训练框架,通过合成数据生成、OCR感知微调和结构化视觉链式思维提示,提升多模态大语言模型在复杂视觉条件下的OCR完整性和多语言翻译准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15076 2026-08-13 eess.IV cs.CV q-bio.QM 版本更新 79%

RankByGene: Gene-Guided Histopathology Representation Learning Through Cross-Modal Ranking Consistency

RankByGene: 通过跨模态排序一致性实现基因引导的组织病理学表示学习

Wentao Huang, Meilong Xu, Xiaoling Hu, Shahira Abousamra, Aniruddha Ganguly, Saarthak Kapse, Alisa Yurovsky, Prateek Prasanna, Tahsin Kurc, Joel Saltz, Michael L. Miller, Chao Chen

机构 * Stony Brook University(石英溪大学) Athinoula A. Martinos Center for Biomedical Imaging, Massachusetts General Hospital and Harvard Medical School(阿提诺拉A.马丁努斯生物医学影像中心,麻省总医院和哈佛医学院) Department of Biomedical Data Science, Stanford University(生物医学数据科学系,斯坦福大学) Department of Pathology and Cell Biology, Columbia University(病理学与细胞生物学系,哥伦比亚大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 提出基于排序对齐损失的框架,利用教师-学生网络自监督知识蒸馏,解决空间转录组学与组织学图像的对齐问题,在基因表达预测、切片分类和生存分析任务中表现优异。

Comments 12 pages, 8 figures, accepted by TMI'26

详情

展开后加载摘要…

URL PDF HTML 收藏