arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-09 至 2026-06-09 共收录 127 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 13 篇

2606.08918 2026-06-09 cs.CV 新提交 83%

When Vision Misleads, Let Location Speak: A Worldwide Image Geo-Localization Method via Location Attention Mechanism and Large Multimodal Models

当视觉误导时,让位置说话:基于位置注意力机制和大多模态模型的全球图像地理定位方法

Junchao Cui, Wenqi Shi, Xuanzi Ma, Nan Wu, Shaoyong Du, Xiangyang Luo

机构 * Henan Key Laboratory of Cyberspace Situation Awareness(河南省网络空间态势感知重点实验室) Information Engineering University(信息工程大学)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 提出TransGeoCLIP框架,通过位置注意力机制和大多模态模型,解决视觉相似图像导致的地理定位错误问题,在多个基准上显著提升定位精度。

Comments Submitted to IEEE Transactions on Multimedia in March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07689 2026-06-09 cs.CV 新提交 79%

Struct-Searcher: Agentic Structural Thinking Advances Multimodal Deep Information Seeking

Struct-Searcher:代理式结构化思维推进多模态深度信息检索

Fan Zhang, Vireo Zhang, Shengju Qian, Haoxuan Li, Zheng Lian, Hao Wu, Yuan Gao, Xinyu Geng, Xin Wang, Pheng-Ann Heng

机构 * CUHK(香港中文大学) LIGHTSPEED PKU(北京大学) Tongji University(同济大学) THU(清华大学) HKUST(香港科技大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出基于信念修正理论的结构化代理工作流Struct-Searcher,通过维护多模态结构图实现冲突感知的深度信息检索,在多个基准上平均相对准确率提升17.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07651 2026-06-09 cs.LG cs.CV 新提交 77%

KITE: A Tri-Modal Transformer Integrating Text, Images, and Knowledge Graphs for Fake News Detection

KITE:一种融合文本、图像和知识图谱的三模态假新闻检测Transformer

Kevin Patel, Shashi Bhushan Jha

机构 * Department of Computer Science, University of West Florida(威斯福大学计算机科学系)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 提出三模态假新闻检测框架KITE,联合建模文本、视觉和知识表示,利用跨模态注意力整合特征,在基准数据集上显著优于单双模态基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09360 2026-06-09 cs.CV 新提交 74%

ExDet: Open-Domain Open-Vocabulary Detection with Cross-modal Extrapolation and Rectification

ExDet: 基于跨模态外推与校正的开放域开放词汇检测

Yupeng Zhang, Yuzhong Feng, Ruize Han, Zhiwei Chen, Wei Feng, Liang Wan

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部) Faculty of Computer Science and Artificial Intelligence, Shenzhen University of Advanced Technology(深圳理工大学计算机科学与人工智能学院) School of Artificial Intelligence, Nanchang University(南昌大学人工智能学院)

专题命中 图文多模态 :cross-modal(title);分类 cs.CV

AI总结 提出ExDet框架,通过文本引导外推(TGE)和检测器兼容校正(DCR)模块,无需额外训练即可增强开放域开放词汇检测的跨类别和跨域泛化能力,在多个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09167 2026-06-09 cs.CV 新提交 70%

Vision-Language Guided Hyperspectral Object Tracking via Semantics Fusion and Contextual Template Updating

视觉-语言引导的高光谱目标跟踪:语义融合与上下文模板更新

Rui Yao, Yuhong Zhang, Kunyang Sun, Hancheng Zhu, Jiaqi Zhao, Zhiwen Shao, Abdulmotaleb El Saddik

机构 * China University of Mining and Technology(中国矿业大学) University of Ottawa(渥太华大学)

专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出VLHTrack框架,通过语言引导波段选择模块缓解光谱冗余,利用多模态融合模块整合视觉与语言特征,并采用动态模板更新策略应对目标形变,在HOT2023/2024上超越现有方法。

Comments 14 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08970 2026-06-09 cs.AI 新提交 70%

An Effective Router for Vision-Language Model Selection

一种有效的视觉-语言模型选择路由器

Can Wang, Shengwei Wang, Bolin Zhang, Zhiying Tu, Dianhui Chu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shandong Key Laboratory of Digital Service Computing Technology and Systems(山东省数字服务计算技术与系统重点实验室)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.AI

AI总结 针对视觉-语言模型(VLM)选择中数据缺乏、特征表示无效和模型空间僵化的问题,提出ARMS路由器,通过增强输入信号和扩展训练策略,在分布内和分布外测试集上表现优异,仅800M参数即可超越GPT-4o。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08063 2026-06-09 cs.CV cs.AI cs.CL 新提交 67%

Robust-U1: Can MLLMs Self-Recover Corrupted Visual Content for Robust Understanding?

Robust-U1: MLLMs能否自我恢复受损视觉内容以实现鲁棒理解?

Jiaqi Tang, Jianmin Chen, Youyang Zhai, Wei Wei, Runtao Liu, Mengjie Zhao, Xiangyu Wu, Qingfa Xiao, Qifeng Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出Robust-U1框架,通过监督微调、强化学习和多模态推理,使多模态大模型具备显式视觉自恢复能力,在真实和对抗性损坏下达到最先进鲁棒性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08894 2026-06-09 cs.CV cs.CL 新提交 62%

Are Reasoning Vision-Language Models Robust to Semantic Visual Distractions?

推理视觉语言模型对语义视觉干扰具有鲁棒性吗?

Yizheng Sun, Mochuan Zhan, Yanan Ma, Jia Tong See, Yifan Wang, Ziyi Wang, Hao Li, Yang Cui, Wenhao Cai, Jingyu Sun, Chenghua Lin, Riza Batista-Navarro, Jingyuan Sun

机构 * University of Manchester(曼彻斯特大学) Marex Imperial College London(帝国理工学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 针对推理VLM在真实场景中易受语义视觉干扰的问题,提出Distract-Bench基准,发现推理VLM对语义干扰的鲁棒性低于感知退化,且干扰常被纳入推理过程导致错误答案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07861 2026-06-09 cs.CV cs.AI 新提交 62%

The Last Visible Pixel: Probing Fine-Scale Perception in Vision-Language Models

最后一个可见像素:探究视觉-语言模型中的精细尺度感知

Lujun Li, Lama Sleem, Niccolo Gentile, Yangjie Xu, Yewei Song, Wenbo Wu, Radu State

机构 * University of Luxembourg(卢森堡大学) Foyer S.A. Université Paris-Saclay(巴黎-萨克雷大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出FineSightBench基准,通过4-48像素尺度分离感知与推理任务,发现视觉-语言模型感知在12像素饱和,推理在更大尺度仍受限,揭示精细视觉推理的根本缺陷。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09393 2026-06-09 cs.CV 新提交 57%

CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning

CapRL++:基于可验证奖励的统一强化学习用于密集图像和视频描述生成

Penghui Yang, Long Xing, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Yibin Wang, Yujie Zhou, Jiazi Bu, Jianze Liang, Qidong Huang, Jiaqi Wang, Feng Wu, Dahua Lin

机构 * Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Microsoft(微软) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Alibaba Cloud(阿里云) The Chinese University of Hong Kong(香港中文大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出CapRL++框架,利用可验证奖励的强化学习(RLVR)优化多模态描述生成,通过非视觉语言模型回答问题的准确性作为奖励,提升密集描述质量,在20多个基准上超越传统监督微调。

Comments 26 pages, 10 figures. Project page: https://github.com/InternLM/CapRL. arXiv admin note: text overlap with arXiv:2509.22647

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09362 2026-06-09 cs.CV cs.LG 新提交 57%

Zero-Shot Semantic Re-Identification for Autonomous Driving: A VLM Baseline Study

零样本语义重识别用于自动驾驶:一项VLM基线研究

Eduardo Borges, Manuel Abreu, Luís Garrote, Urbano J. Nunes

机构 * Autonomous Mobile Robot(自主移动机器人) University of Minho(明德大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出使用视觉-语言模型生成语义描述进行零样本重识别,在自动驾驶场景中实现与监督CNN基线相当的检索性能,并增强可解释性。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09009 2026-06-09 cs.CV 新提交 57%

Scaling by Diversified Experience for Vision-Language-Action Models

通过多样化经验扩展视觉-语言-动作模型

Leiyu Wang, Zhaofengnian Wang, Xueqi Li, Luoyi Fan, Cewu Lu, Nanyang Ye

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出SyVLA模型,通过意图解耦算法和相似样本引导的强化学习管道,解决视觉-语言-动作模型在推理与控制耦合及策略优化不稳定问题,在真实机器人任务中取得更高成功率和泛化能力。

Comments ICML 2026, SyVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07706 2026-06-09 cs.CR cs.AI 新提交 57%

MLingualFC: Evaluating Jailbreak Vulnerabilities in Multilingual Vision-Language Models

MLingualFC: 评估多语言视觉语言模型中的越狱漏洞

Rishabh Makwana, Mamta, Deeksha Varshney, Oana Cocarascu

机构 * Dwarkadas Jivanlal Sanghvi College of Engineering(达沃拉斯·吉万拉尔·桑格维工程学院) King’s College London(伦敦国王学院) Indian Institute of Technology Jodhpur(印度理工学院朱罗普尔)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出多语言多模态基准MLingualFC,使用流程图编码有害指令评估多语言VLM的越狱漏洞,发现拉丁语系攻击成功率显著高于非拉丁语系,揭示安全机制跨语言泛化不足。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 13 篇

2606.07531 2026-06-09 cs.CL cs.AI 新提交 93%

mllm-shap: A Shapley Value Explainability Platform for Text-Audio Multimodal Large Language Models

mllm-shap:面向文本-音频多模态大语言模型的Shapley值可解释性平台

Jakub Muszyński, Paweł Pozorski, Maria Ganzha

机构 * Warsaw University of Technology(华沙理工大学)

专题命中 音频语音多模态 :MLLM(title,title_cn);multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 提出mllm-shap框架,通过模态感知掩码、多轮对话追踪和音素对齐分组技术,将Shapley值可解释性扩展到文本-音频多模态大语言模型,并实现10-50倍的计算加速。

Comments Submitted to ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08231 2026-06-09 cs.CV 新提交 88%

Test-Time Scaling in Multimodal Foundation Models: A Comprehensive Survey of Generation and Reasoning

多模态基础模型中的测试时扩展:生成与推理的综合调查

Cong Wan, Ying He, Zhongzhan Huang, Hefeng Wu

机构 * Sun Yat-sen University(中山大学)

专题命中 音频语音多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV

AI总结 本文首次系统综述多模态基础模型中的测试时扩展(TTS)方法,提出统一分类框架(采样、反馈、搜索三类),总结应用与基准,并讨论未来方向。

Comments Accepted by ACL 2026, Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07643 2026-06-09 cs.CV cs.AI cs.SD eess.AS 新提交 87%

AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs

AVI-Bench:迈向全模态大语言模型的人类级视听智能

Yaoting Wang, Ziyi Zhang, Wenming Tu, Shaoxuan Xu, Wenjie Du, Cheng Liang, Weijun Wang, Yuanchao Li, Guangyao Li, Hao Fei, Yuanchun Li, Henghui Ding, Yunxin Liu

机构 * Nanyang Technological University(南洋理工大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、eess.AS

AI总结 提出AVI-Bench基准,通过感知、理解、推理三阶段跨模态任务评估全模态大语言模型的视听智能,并引入AVI-Bench-PriSe测试原始视听感知,揭示当前模型局限,构建四级AVI分类体系。

Comments 31 pages, 8 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07577 2026-06-09 cs.AI cs.CV cs.SD eess.AS 新提交 82%

OmniMem: Perturbation-aware Memory Compression for Streaming Audio-Visual LLMs

OmniMem: 面向流式音视频大语言模型的扰动感知记忆压缩

Guangzhi Sun, Yixuan Li, Yudong Yang, Chao Zhang

机构 * Tsinghua University(清华大学) ByteDance(字节跳动) Department of Engineering, University of Cambridge(剑桥大学工程系)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI、eess.AS

AI总结 提出OmniMem,一种针对音视频LLM的流式记忆压缩框架,通过模态感知分配和扰动感知选择压缩KV缓存,在保持长视频理解的同时减少内存,在多个基准上提升2-4%准确率。

Comments Code: https://github.com/bytedance/SALMONN/tree/omni_mem

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09667 2026-06-09 eess.AS cs.CL cs.SD 新提交 81%

Cross-Modal Masking for Robust Silent Speech Synthesis Using sEMG and Lipreading

基于sEMG和唇读的鲁棒无声语音合成的跨模态掩蔽

Eder del Blanco, David Gimeno-Gómez, Eva Navas, Carlos-D. Martínez-Hinarejos, Inma Hernáez

机构 * Aholab research group within the HiTZ Center at University of the Basque Country (UPV/EHU)(巴斯克大学HiTZ中心内Aholab研究组) PRHLT research center, Universitat Politècnica de València (UPV)(瓦伦西亚理工大学PRHLT研究中心)

专题命中 音频语音多模态 :cross-modal(title);multimodal(abstract);分类 cs.CL、eess.AS

AI总结 提出掩蔽多模态语音合成框架,联合表面肌电图和唇读信号,通过训练时模态掩蔽提升鲁棒性,在多说话人设置下词错误率降低14个百分点。

Comments 12 pages, 7 figures and 6 tables. Submitted to Transactions on Audio, Speech and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07585 2026-06-09 cs.CV cs.AI 新提交 81%

Multimodal Group Emotion Recognition In-the-Wild Towards a Privacy-Safe Non-Individual Approach

面向隐私安全的非个体化方法的多模态群体情绪识别

Anderson Augusma

机构 * Université Grenoble Alpes(格勒诺布尔-阿尔卑斯大学) Univ. Grenoble Alpes(格勒诺布尔-阿尔卑斯大学) Univ. of Glasgow(格拉斯哥大学) Inria(法国国家信息与自动化研究所) Univ. Paris-Saclay(巴黎-萨克雷大学) TU Delft(代尔夫特理工大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出两种多模态框架(交叉注意力融合+帧注意力池化,以及变分编码器多解码器),利用集体音视频信号进行群体情绪识别,避免使用个体特征,在保护隐私的同时实现鲁棒性能。

Comments Doctoral thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09271 2026-06-09 cs.SD cs.LG 新提交 78%

Multi-View Speech Representation Learning for Parkinson's Disease Detection Using Context-guided Cross-modal Attention

基于上下文引导跨模态注意力的多视角语音表示学习用于帕金森病检测

George Theodosiou, Loukas Ilias, Dimitris Askounis

机构 * National Technical University of Athens(雅典国家技术大学)

专题命中 音频语音多模态 :cross-modal(title,abstract)

AI总结 提出多分支深度学习框架,融合Log-Mel谱图、MFCC和HuBERT嵌入三种互补语音模态,通过上下文引导跨模态注意力机制动态加权,在PC-GITA语料库上实现91.51%准确率和95.97% AUC,验证了异质语音建模对帕金森病检测的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08726 2026-06-09 cs.CR 新提交 78%

Evaluating Multimodal Steganalysis for Split-Payload Audiovisual Steganography

评估针对拆分载荷视听隐写的多模态隐写分析

Prateek Paudel, Nitin Jha, Abhishek Parakh

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 本文研究拆分载荷视听隐写能否逃避单模态和多模态隐写分析,实验表明跨模态拆分载荷可增加检测难度,但多模态检测器的优势主要来自视频流而非真正的音视频联合信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07608 2026-06-09 cs.CL cs.AI cs.LG cs.SD 新提交 73%

Subtitle-Aligned Fine-Tuning of Whisper for Swiss German ASR: Benchmark Contamination, Convention Mismatch, and an Honest Baseline at 25.6% WER (13.8% cWER)

针对瑞士德语音识别的Whisper字幕对齐微调:基准污染、惯例不匹配以及25.6% WER(13.8% cWER)的诚实基线

Felix Akeret

机构 * Independent Researcher, Zurich, Switzerland(独立研究员,瑞士苏黎世) ETH Zürich(苏黎世联邦理工学院) University of Bern(伯尔尼大学) FHNW(西北应用科学与艺术大学) CeTIM Leiden/Munich(CeTIM 莱顿/慕尼黑)

专题命中 音频语音多模态 :multimodal(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 通过1,367小时广播语音与标准德语字幕的弱监督,系统微调Whisper large-v3用于瑞士德语音识,发现公开结果因基准污染被高估,并发布两个诚实评估的模型。

Comments 15 pages, 21 tables. Models available at https://huggingface.co/Flix-AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09366 2026-06-09 cs.CL eess.AS 新提交 62%

Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs

文本就是一切?文本作为语音大语言模型的通用信息瓶颈

Ming-Hao Hsu, Yuxuan Hu, Shujie Liu, Jinyu Li, Yan Lu, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Microsoft Corporation(微软公司) Microsoft Research Asia(微软亚洲研究院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 提出Convex Gate(C-Gate)桥接语音与LLM,通过凸包约束将语音表示限制在LLM输入嵌入流形内,在ASR和情感识别上取得联合最优性能,并揭示几何结构而非离散性是关键设计因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08748 2026-06-09 cs.CL 新提交 57%

HydraQE: OSU's Submission for the IWSLT 2026 Speech Translation Metrics Shared Task

HydraQE: OSU 在 IWSLT 2026 语音翻译指标共享任务中的提交

Kevin Krahn, Eric Fosler-Lussier

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

AI总结 提出 HydraQE,一个基于 Qwen3-ASR 的端到端无参考语音翻译质量估计系统,通过可学习的稀疏标量混合和轻量双向 Transformer 实现跨模态交互,并在人类标注、MetricX-24 和 xCOMET 伪标签上训练三个预测头,优于级联文本基线。

Comments Accepted to IWSLT 2026; 9 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08486 2026-06-09 cs.CL 新提交 57%

TRADE: Transducer-Augmented Decoder for Speech LLM

TRADE: 换能器增强的语音大语言模型解码器

Yun Tang, Shanil Puri, Shinji Watanabe, Subhabrata Mukherjee

机构 * Hippocratic AI Carnegie Mellon University(卡内基梅隆大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 提出TRADE模型,通过换能器分支增强多模态大语言模型,实现帧同步对齐与语言推理结合,支持流式和非流式解码,在多个基准上取得低词错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09186 2026-06-09 cs.HC 新提交 50%

DuplexOmni: Real-Time Listening, Seeing, Thinking, and Speaking for Full-Duplex Interaction

DuplexOmni:用于全双工交互的实时听、看、思考和说话

Muye Huang, Lingling Zhang, Xingyu Yu, Lei Shi, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Jun Liu

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 提出DuplexOmni方法,通过异步协作的交互层(端到端实时处理流式音视频并生成响应)和思考层(复杂推理与工具使用)实现实时多模态全双工交互,并开发Writer-Director管道构建训练数据,在多个基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 15 篇

2606.07541 2026-06-09 cs.HC cs.AI cs.CV cs.CY cs.MM 新提交 87%

Multimodal Large Language Models as Synthetic Participants in Video-Based Studies: An Evaluation

多模态大语言模型作为视频研究中的合成参与者:一项评估

Prabal Shrestha, Bohan Jiang, Haoning Xue, Huan Liu, Xinyi Zhou

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.MM

AI总结 本研究评估多模态大语言模型在视频感知任务中模拟人类主观评分的表现,发现模型存在偏差且与人类一致性有限。

Comments Accepted to SocialLLM @ ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07765 2026-06-09 cs.HC 新提交 71%

TibetCPR: A Multimodal Tactile Feedback System to Enhance Cardiopulmonary Resuscitation Training in High-Altitude Regions of Tibet

TibetCPR:一种增强高海拔地区心肺复苏训练的多模态触觉反馈系统

Yibo Meng, Ruiqi Chen, Zhiming Liu, Xiaolan Ding

专题命中 视频多模态 :multimodal(title)

AI总结 针对西藏地区心肺复苏训练资源匮乏的问题,提出低成本自引导训练系统TibetCPR,结合深度电触觉与节奏视觉反馈,实验表明能显著稳定按压节奏与深度,并提炼出自引导训练的设计原则。

Comments Accept to MobileHCI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08572 2026-06-09 cs.CV 新提交 70%

OmniCap-IF: Benchmarking and Improving Instruction Following Abilities for Omni-Video Captioning

OmniCap-IF:全视频字幕遵循指令能力的基准测试与改进

Jiahao Wang, An Ping, Yanghai Wang, Yuanxing Zhang, Shihao Li, Hanyan Bian, Yichi Ren, Yize Zhang, Han Wang, Haowen Chen, Junze Li, Jiaqi Wang, Yiyang Hu, Zhuze Xu, Zijie Zhang, Jiaheng Liu

机构 * NJU-LINK Team, Nanjing University(南京大学 NJU-LINK 团队) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 视频多模态 :audio-visual(abstract);omni-modal(abstract);分类 cs.CV

AI总结 提出首个全模态字幕指令遵循基准OmniCap-IF,通过格式与内容正确性评估50种约束类型,揭示格式-内容权衡,并构建54K指令微调数据集OmniCap-IF-54K及模型OmniCaptioner-IF。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08393 2026-06-09 eess.AS 新提交 70%

SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation

SMC-ITA:面向视频到音频生成的序列蒙特卡洛推理时对齐

Haoyu Zhang, Yuta Oshima, Xingjian Du, Chunfeng Wang, Irene Li, Yusuke Iwasawa, Yutaka Matsuo

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 eess.AS

AI总结 提出SMC-ITA方法,通过前瞻奖励估计和序列蒙特卡洛重采样,在推理时优化流匹配V2A生成,显著降低不同步率并提升音频质量。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏