arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-19 至 2026-05-19 共收录 177 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 9 篇

2605.17341 2026-05-19 cs.CV cs.AI 81%

Single-Sample Black-Box Membership Inference Attack against Vision-Language Models via Cross-modal Semantic Alignment

通过跨模态语义对齐实现面向视觉-语言模型的单样本黑盒成员推断攻击

Jiaqing Li, Yajuan Lu, Xiaochuan Shi, Gang Wu, ZhongYuan Wang, Chao Liang

机构 * Wuhan University(武汉大学) Tarim University(塔里木大学)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种基于跨模态语义对齐的新型成员推断攻击框架,针对视觉-语言模型在单样本和黑盒场景下的数据安全风险进行评估,通过量化联合嵌入空间中的对齐程度,显著提升了攻击性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17499 2026-05-19 cs.LG 75%

t-gems: text-guided exit modules for decreasing clip image encoder

t-gems: 基于文本引导的退出模块用于减少clip图像编码器

Alberto Presta, Grzegorz Stefanski, Michal Byra, Krzysztof Arendt

机构 * Samsung AI Center Warsaw(三星AI中心华沙) Institute of Fundamental Technological Research, PAS, Warsaw(基础技术研究所,波兰科学院,华沙)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract)

AI总结 本文提出t-gems文本引导退出模块,通过利用编码器中间层的语义内容分布,减少clip图像编码器的计算成本,同时保持跨模态理解性能。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18610 2026-05-19 cs.CV cs.AI cs.LG 62%

CATA: Continual Machine Unlearning via Conflict-Averse Task Arithmetic

CATA: 通过冲突厌恶任务算术实现持续机器去学习

Shen Lin, Junhao Dong, Rongjie Chen, Xiaoyu Zhang, Li Xu, Xiaofeng Chen

机构 * Fujian Normal University(福建师范大学) Nanyang Technological University(南洋理工大学) Xidian University(西安电子科技大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文首次研究了视觉语言模型的持续去学习问题,提出CATA方法,通过冲突厌恶任务算术有效解决去学习中的有效性、模型保真度和持续性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17436 2026-05-19 cs.CV cs.CL 62%

Medical Context Distorts Decisions in Clinical Vision Language Models

医学语境扭曲了临床视觉语言模型的决策

David Restrepo, Ira Ktena, Maria Vakalopoulou, Stergios Christodoulidis, Enzo Ferrante

机构 * MICS(医学信息学中心) CentraleSupélec - Université Paris-Saclay(中央超导学院 - 巴黎萨克雷大学) Cancer Data Science Unit(癌症数据科学单元) IHU PRISM National Institute in Precision Oncology(精准肿瘤学国家研究所) University Paris-Saclay(巴黎萨克雷大学) CentraleSupelec(中央超导学院) Gustave Roussy(儒勒-维维安-圣拉扎尔医院) INSERM(国家医学研究院) CONICET(阿根廷国家科研与技术创新委员会) Universidad de Buenos Aires(布宜诺斯艾利斯大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

AI总结 本文研究了医学语境对临床视觉语言模型决策的影响,发现模型在整合医学记录的视觉和文本信息时存在模态依赖、无关历史依赖和提示敏感性等问题,强调了在临床应用前需要建立明确的保障措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16439 2026-05-19 cs.CV cs.AI 62%

KVCapsule: Efficient Sequential KV Cache Compression for Vision-Language Models with Asymmetric Redundancy

KVCapsule: 用于视觉-语言模型的高效序列KV缓存压缩方法:不对称冗余

Yingbing Huang, Tharun Adithya Srikrishnan, Steven K. Reinhardt, Deming Chen

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) AMD

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出KVCapsule,一种针对视觉语言模型的KV缓存压缩框架,通过轻量压缩和重建组件实现内存节省,提升吞吐量并减少内存占用,同时保持精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16416 2026-05-19 cs.CV cs.AI 62%

CAVE: A Structured Credit Assignment Approach for Fragmented Visual Evidence Reasoning

CAVE:一种用于碎片化视觉证据推理的结构化信用分配方法

Tengda Guo, Jie Leng, Hanlei Li, Yaoyuan Liang, Qingyue Zhang, Dian Yang, Mingyu Zhang, Yuhua Fu, Shao-Lun Huang

机构 * Tsinghua University(清华大学) Peking University(北京大学) Zhejiang University of Technology(浙江工业大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 CAVE通过结构化过程-奖励机制提升碎片化视觉推理能力,引入三个互补信号优化推理步骤,提升模型可靠性与鲁棒性。

Comments 24 pages, 6 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06316 2026-05-19 cs.AI 57%

ALIGN: A Vision-Language Framework for High-Accuracy Accident Location Inference through Geo-Spatial Neural Reasoning

ALIGN:一种通过地理空间神经推理进行高精度事故位置推断的视觉-语言框架

MD Thamed Bin Zaman Chowdhury, Moazzem Hossain

机构 * Department of Civil Engineering, Bangladesh University of Engineering and Technology(孟加拉工程与技术大学土木工程系)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出ALIGN框架,通过视觉-语言模型整合文本和图像数据,以高精度推断事故位置,显著优于传统文本解析方法,实现了亚公里级的定位精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16410 2026-05-19 cs.CV 57%

Test-Time Hinting for Black-Box Vision-Language Models

测试时提示法用于黑盒视觉-语言模型

Kaihua Hou, Abhijith Varma Mudunuri, Jiaxing Qiu, Roxana Daneshjou, Thomas Hartvigsen, Ahmed Alaa

机构 * AlaaLab(Alaa实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出测试时提示法,通过单次VLM调用提升性能,无需开放权重模型访问,适用于前沿闭源模型。方法通过轻量提示生成器预测提示,引导VLM避开常见错误模式,提升自然图像VQA基准的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02171 2026-05-19 cs.DB 50%

QuIVer: Rethinking ANN Graph Topology via Training-Free Binary Quantization

QuIVer:通过无训练二进制量化重新思考ANN图拓扑

Wenxuan Xiao, Zhiyou Wang, Chengcheng Li

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文研究了二进制量化能否定义图拓扑本身,并提出了QuIVer,一个无需训练的ANN图索引,在2位Sign-Magnitude二进制量化度量空间中完成边选择、多样性剪枝和束搜索导航,揭示了二进制量化拓扑在不同数据集上的适用边界,提出了可验证的工业向量搜索系统在压缩、吞吐量和通用数据兼容性之间的不可能三角。

Comments 16 pages, 3 figures, 14 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 13 篇

2605.18194 2026-05-19 cs.AI cs.CV 88%

Beyond the Cartesian Illusion: Testing Two-Stage Multi-Modal Theory of Mind under Perceptual Bottlenecks

超越笛卡尔错觉:在感知瓶颈下测试双阶段多模态理论 of Mind

Yajing Zhou, Xiangyu Kong

机构 * College of Computer Science, Beijing Information Science and Technology University(北京信息科技大学计算机学院)

专题命中 音频语音多模态 :multi-modal(title,abstract);MLLM(abstract,abstract_cn);audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了多模态大语言模型在感知瓶颈下的双阶段空间推理能力,提出了一种基于锚点的具身体验空间分解链式推理方法,以解决空间对称性和视角模糊性问题,从而提升多模态理论 of Mind 的表现。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18466 2026-05-19 cs.CV 83%

Speech-Guided Multimodal Learning for Vocal Tract Segmentation in Real-Time MRI

基于语音引导的多模态学习用于实时MRI中的声道分割

Daiqi Liu, Lukas Mulzer, Md Hasan, Nyvenn de Castro, Fangxu Xing, Xingjian Kang, Chengze Ye, Siyuan Mei, Yipeng Sun, Tomás Arias-Vergara, Jana Hutter, Jonghye Woo, Andreas Maier, Paula Andrea Pérez-Toro

机构 * Harvard Medical School / Massachusetts General Hospital(哈佛医学院/麻省总医院) Institute for Information Processing, Leibniz University Hannover(汉诺威莱布尼茨信息处理研究所) GITA Lab, Facultad de Ingeniería. Universidad de Antioquia UdeA(安提奥基亚大学工程学院GITA实验室)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种三阶段框架,利用语音和语音学监督进行训练,仅需实时MRI图像进行推理,通过将语音学表示转换为空间边界框先验进行发音器官定位,通过双级跨模态对比预训练对视觉和音频编码器对齐,并通过跨注意力解码器融合学习的表示,有效将多模态知识转移到单模态推理管道中,实验表明该方法在75-Speaker~Annot-16和USC-TIMIT数据集上优于现有单模态和多模态方法。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17488 2026-05-19 cs.CV cs.MM cs.SD 81%

Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation

Omni-Customizer: 用于联合音频-视频生成的端到端多模态定制

Yuheng Chen, Qingdong He, Teng Hu, Yuji Wang, Yabiao Wang, Lizhuang Ma, Jiangning Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出Omni-Customizer,一种端到端多模态定制框架,旨在实现精确的多模态身份信息绑定和无缝融合,通过引入Omni-Context Fusion模块和Masked TTS Cross-Attention机制,提升多模态定制生成的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18296 2026-05-19 cs.HC 80%

MEEDAV: A Synchronous Web Viewer for EEG, Eye-Tracking and Speech Data

MEEDAV:一种用于EEG、眼动追踪和语音数据同步可视化的Web查看器

Jan Pijálek, Karel Vlk, Ondřej Bojar

专题命中 音频语音多模态 :multi-modal(abstract,abstract_cn);multimodal(abstract);cross-modal(abstract)

AI总结 本文提出MEEDAV,一种用于同步可视化EEG、眼动追踪和语音数据的开源Web应用,支持高密度EEG设置,并提供实时处理和交互式可视化功能,适用于心理语言学研究。

Comments Presented at ACAIN 2025 (Advanced Course & Symposium on Artificial Intelligence & Neuroscience), recipient of the Camillo Golgi Best Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12987 2026-05-19 cs.CL 79%

Leveraging Multimodal Self-Consistency Reasoning in Coding Motivational Interviewing for Alcohol Use Reduction

利用多模态自一致性推理进行编码动机访谈以减少酒精使用

Guangzeng Han, James G. Murphy, Benjamin O. Ladd, Xiaolei Huang, Brian Borsari

机构 * Department of Computer Science, University of Memphis(密苏里大学计算机科学系) Veterans Affairs Health Care System(退伍军人事务医疗系统) Department of Psychiatry and Behavioral Sciences, University of California San Francisco(旧金山大学精神病学与行为科学系) Department of Psychology, University of Memphis(密苏里大学心理学系) Department of Psychology, Washington State University Vancouver(华盛顿州立大学温哥华分校心理学系)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出基于音频语言模型的自动动机访谈编码方法,通过多模态自一致性推理提升编码鲁棒性,实验显示其在准确率、精确率和召回率上均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16492 2026-05-19 cs.HC cs.RO 78%

FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech

FAM-HRI: 基于基础模型的多模态人机交互框架,结合目光和语音

Yuzhi Lai, Shenghai Yuan, Peizheng Li, Boya Zhang, Benjamin Kiefer, Tianchen Deng, Andreas Zell

机构 * University of Tuebingen(图宾根大学) Nanyang Technological University(南洋理工大学) Mercedes-Benz(梅赛德斯-奔驰)

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract)

AI总结 本文提出FAM-HRI,一种结合目光和语音的多模态人机交互框架,利用基础模型融合语言和目光输入,以提高任务执行的成功率和交互效率,为肢体障碍者提供实用解决方案。

Comments This work has been accepted for publication in IEEE Transactions on Automation Science and Engineering @ 2026 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17684 2026-05-19 cs.AI cs.SE 74%

EGI: A Multimodal Emotional AI Framework for Enhancing Scrum Master Real-time Self-Awareness

EGI:一种多模态情感AI框架,用于增强Scrum Master的实时自我意识

Jingni Huang, Peter Bloodsworth

机构 * Department of Computer Science(计算机科学系) University of Oxford(牛津大学)

专题命中 音频语音多模态 :multimodal(title);分类 cs.AI

AI总结 本文提出一种多模态情感AI框架EGI,通过整合四个精选的AI模型,实时监测Scrum Master和会议组织者无意识表达的情绪,提升团队动态中的情绪感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18221 2026-05-19 cs.SD cs.CL cs.CV cs.LG physics.med-ph 73%

SIREM: Speech-Informed MRI Reconstruction with Learned Sampling

SIREM: 语音引导的MRI重建与学习采样

Md Hasan, Nyvenn Castro, Daiqi Liu, Lukas Mulzer, Jana Hutter, Jonghye Woo, Moritz Zaiss, Andreas Maier, Paula A. Perez-Toro

机构 * Pattern Recognition Lab, Friedrich-Alexander-Universität Erlangen-Nürnberg(埃森哲-埃尔朗根-纽伦堡大学模式识别实验室) Institute of Radiology, University Hospital Erlangen, Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根大学医院放射学研究所) Institut für Informationsverarbeitung, Leibniz Universität Hannover(汉诺威莱比锡大学信息处理研究所) Department of Radiology, Harvard Medical School and Massachusetts General Hospital(哈佛医学院放射科和麻省总医院)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出了一种语音引导的MRI重建框架SIREM,通过同步语音作为跨模态先验,利用语音与声音学之间的相关性预测图像内容,从而在更高的吞吐量下实现更合理的解剖结构重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13189 2026-05-19 cs.HC cs.RO 71%

Gesture First, LLM-Assisted Voice Complement: Exploring Multimodal Robot 'Puppeteer' Teleoperation Via Virtual Counterpart in Augmented Reality

先手势,LLM辅助语音补充:通过增强现实中的虚拟对应物探索多模态机器人'提线人'遥控

Yuchong Zhang, Bastian Orthmann, Shichen Ji, Michael Welle, Jonne Van Haastregt, Danica Kragic

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 音频语音多模态 :multimodal(title)

AI总结 本文探讨了通过增强现实中的虚拟对应物实现多模态机器人遥控的方法,比较了仅手势和结合语音与手势的交互方式在性能和用户体验上的差异,提出设计指南以平衡效率、鲁棒性和用户专业性。

Comments This work is under peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18749 2026-05-19 cs.SD cs.CV 57%

WavFlow: Audio Generation in Waveform Space

WavFlow:在波形空间中进行音频生成

Feiyan Zhou, Luyuan Wang, Shoufa Chen, Zhe Wang, Zhiheng Liu, Yuren Cong, Xiaohui Zhang, Fanny Yang, Belinda Zeng

机构 * Meta AI Northeastern University(东北大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出WavFlow框架,直接在原始波形空间生成高保真的音频,无需中间表示,通过波形分块和振幅提升实现稳定优化,通过自动化数据管道生成高质量视频-文本-音频三元组,实验结果显示在视频到音频和文本到音频基准测试中表现优异,证明了无需中间压缩即可实现高质量合成。

Comments Code: https://github.com/facebookresearch/WavFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23994 2026-05-19 cs.SD cs.AI 57%

PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation

PhyAVBench: 一个具有挑战性的音频物理敏感性基准,用于物理基础的文本到音频视频生成

Tianxin Xie, Wentao Lei, Kai Jiang, Guanjie Huang, Pengfei Zhang, Chunhui Zhang, Fengji Ma, Haoyu He, Han Zhang, Jiangshan He, Jinting Wang, Linghan Fang, Lufei Gao, Orkesh Ablet, Peihua Zhang, Ruolin Hu, Shengyu Li, Weilin Lin, Xiaoyang Feng, Xinyue Yang, Yan Rong, Yanyun Wang, Zihang Shao, Zelin Zhao, Chenxing Li, Shan Yang, Wenfu Wang, Meng Yu, Dong Yu, Li Liu

机构 * HKUST(GZ)(香港科技大学(广州)) Tencent(腾讯)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.AI

AI总结 本文提出PhyAVBench,一个用于评估文本到音频视频生成、图像到音频视频生成和视频到音频生成模型中音频-物理基础能力的基准,通过引入新的数据集和评估方法,揭示了当前模型在物理合理音频生成方面的不足。

Comments 6 major physical dimensions, 41 fine-grained test points, 337 groups of variable-controlled test samples, 11,605 newly recorded videos

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16403 2026-05-19 cs.CV cs.SD 57%

When Vision Speaks for Sound

当视觉为声音说话

Xiaofei Wen, Wenjie Jacky Mo, Xingyu Fu, Rui Cai, Tinghui Zhu, Wendi Li, Yanan Xie, Muhao Chen, Peng Qi

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 本文发现视频中MLLMs的音频理解依赖视觉线索而非实际音频流,提出Thud框架通过三种音频编辑干预研究此问题,并提出两阶段对齐方法提升模型性能。

Comments 24 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18168 2026-05-19 cs.CR cs.SD 50%

Acoustic Interference: A New Paradigm Weaponizing Acoustic Latent Semantic for Universal Jailbreak against Large Audio Language Models

声学干扰:利用声学潜在语义进行通用劫持的新范式,针对大型音频语言模型

Yanyun Wang, Yu Huang, Zi Liang, Xixin Wu, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong Polytechnic University(香港理工大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 本文提出了一种新的声学干扰方法,通过利用声学潜在语义对大型音频语言模型进行通用劫持,揭示了安全对齐的脆弱性。

Comments 43rd International Conference on Machine Learning (ICML'26)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 24 篇

2605.17133 2026-05-19 cs.CV cs.AI 84%

CAM-VFD: Cross-Attention Multimodal Video Forgery Detection

CAM-VFD: 跨注意力多模态视频伪造检测

Hoda Osama Elkhodary, Sherin Mostafa Youssef, Marwa Elshenawy, Dalia Sobhy

机构 * Computer Engineering Department, College of Engineering and Technology, Arab Academy for Science, Technology and Maritime Transport(计算机工程系,工程与技术学院,阿拉伯科学、技术与海运交通学院)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对深度伪造技术和视频编辑工具快速发展带来的挑战,本文提出CAM-VFD框架,通过跨模态矛盾建模实现多模态视频伪造检测,实验表明其在两个生成视频基准测试中表现出色,具有良好的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18188 2026-05-19 cs.LG 82%

UTOPYA: A Multimodal Deep Learning Framework for Physics-Informed Anomaly Detection and Time-Series Prediction

UTOPYA:一种用于物理信息异常检测和时间序列预测的多模态深度学习框架

Robson W. S. Pessoa, Julien Amblard, Alessandra Russo, Idelfonso B. R. Nogueira

机构 * Department of Chemical Engineering, Norwegian University of Science and Technology (NTNU)(化学工程系,挪威科学与技术大学) Department of Computing, Imperial College London(计算系,帝国理工学院伦敦分校)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出UTOPYA框架,通过融合八种数据模态,利用FiLM条件交叉模态注意力和门控融合,共同解决批次蒸馏中的异常检测、时间序列预测和相分类问题,并通过物理信息正则化方案和课程学习方法提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04727 2026-05-19 cs.CV cs.AI 81%

Are Multimodal LLMs Ready for Surveillance? A Reality Check on Zero-Shot Anomaly Detection in the Wild

多模态大语言模型是否准备好用于监控?对零样本异常检测在现实中的检验

Shanle Yao, Armin Danesh Pazho, Narges Rashvand, Hamed Tabkhi

机构 * Electrical and Computer Engineering Department(电气与计算机工程系)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究了多模态大语言模型在现实中的零样本异常检测性能,发现其存在保守偏差,通过特定指令可以提升F1分数,但召回率仍是关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09395 2026-05-19 cs.AI cs.LG cs.MA cs.MM 81%

Empowering VLMs for Few-Shot Multimodal Time Series Classification via Tailored Agentic Reasoning

通过定制代理推理增强VLMs在少样本多模态时间序列分类中的能力

Lin Li, Jiawei Huang, Qihao Quan, Dan Li, Boxin Li, Xiao Zhang, Erli Meng, Wenjie Feng, Jian Lou, See-Kiong Ng

机构 * Sun Yat-sen University(中山大学) Xiaomi Corporation(小米公司) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI、cs.MM

AI总结 本文提出MarsTSC框架,通过自演化知识库和代理推理提升少样本多模态时间序列分类性能,实验表明其在六个VLM基础上均优于传统和基础模型基线。

Comments 18 pages, 12 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18710 2026-05-19 cs.DC 78%

Mosaic: Towards Efficient Training of Multimodal Models with Spatial Resource Multiplexing

Mosaic:迈向多模态模型高效训练的时空资源复用

Yanbo Wang, Yuxuan Wang, Chen Chen, Chunyu Xue, Yu Feng, Anbang Wu, Quan Chen, Yin Chen, Qizhen Weng

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出Apollo系统,通过时空复用方法提升多模态模型训练效率,采用灵活的执行引擎和性能模型生成高质量部署计划,实测训练速度提升达1.31倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17065 2026-05-19 cs.MA 78%

PyraVid: Hierarchical Multimodal Memory for Long-Horizon Video Reasoning

PyraVid: 用于长时间视频推理的分层多模态记忆

Sikuan Yan, Sicheng Dong, Haotong Wang, Ercong Nie, Yilun Liu, Jinhe Bi, Yingjie Xu, Susanna Schwarzmann, Riccardo Trivisonno, Volker Tresp, Yunpu Ma

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出PyraVid,一种分层多模态记忆框架,通过事件分割理论启发,解决长视频中多模态信息整合、人本信息对齐和证据聚合等挑战,提升长时间视频推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11208 2026-05-19 cs.CV 77%

Hi-GaTA: Hierarchical Gated Temporal Aggregation Adapter for Surgical Video Report Generation

Hi-GaTA:用于外科视频报告生成的分层门控时间聚合适配器

Kedi Sun, Chaohui Dang, Yue Feng, James Glasbey, Theodoros N. Arvanitis, Le Zhang

机构 * School of Engineering, College of Engineering and Physical Sciences, University of Birmingham, Birmingham, UK(英国伯明翰大学工程学院) School of Computer Science, University of Birmingham, Birmingham, UK(英国伯明翰大学计算机科学学院) Department of Applied Health Sciences, University of Birmingham, Birmingham, UK(英国伯明翰大学应用健康科学系)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出Hi-GaTA框架,通过时间聚合压缩长视频序列生成LLM兼容的视觉前缀令牌,结合预训练的外科专用视频编码器和LoRA微调,实现高质量外科报告生成。

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21458 2026-05-19 cs.CV 74%

Mining Forgery Traces from Reconstruction Error: A Weakly Supervised Framework for Multimodal Deepfake Temporal Localization

从重建误差中挖掘伪造痕迹:一种用于多模态深度伪造时间定位的弱监督框架

Midou Guo, Qilin Yin, Wei Lu, Rui Yang

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Sun Yat-sen University(中山大学) Alibaba Group(阿里巴巴集团)

专题命中 视频多模态 :multimodal(title);分类 cs.CV

AI总结 本文提出RT-DeepLoc框架,通过重建误差识别深度伪造,利用MAE学习真实数据的时空模式,结合不对称视频对比损失提升定位精度,实验表明在大规模数据集上达到弱监督时间伪造定位的最新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏