arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-09 至 2026-06-09 共收录 20 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 20 篇

2606.07541 2026-06-09 cs.HC cs.AI cs.CV cs.CY cs.MM 新提交 87%

Multimodal Large Language Models as Synthetic Participants in Video-Based Studies: An Evaluation

多模态大语言模型作为视频研究中的合成参与者:一项评估

Prabal Shrestha, Bohan Jiang, Haoning Xue, Huan Liu, Xinyi Zhou

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.MM

AI总结 本研究评估多模态大语言模型在视频感知任务中模拟人类主观评分的表现,发现模型存在偏差且与人类一致性有限。

Comments Accepted to SocialLLM @ ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09151 2026-06-09 cs.CV cs.AI cs.LG 版本更新 79%

Video Understanding by Design: How Datasets Shape Video Models

通过设计理解视频:数据集如何塑造视频模型

Lei Wang, Syuan-Hao Li, Piotr Koniusz, Yongsheng Gao

机构 * School of Engineering and Built Environment, Electrical and Electronic Engineering, Griffith University(工程与建筑环境学院,电气与电子工程学院,格里菲斯大学) School of Computer Science and Engineering, University of New South Wales(计算机科学与工程学院,新南威尔士大学)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI

AI总结 本文从数据集视角出发,提出统一框架连接数据集结构、归纳偏差与架构设计,分析数据集特性如何驱动视频理解架构创新,并讨论不同数据体制下的表征偏差。

Comments Research report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13679 2026-06-09 cs.HC cs.CV 版本更新 74%

Toward Scalable Co-located Practical Learning: Assisting with Computer Vision and Multimodal Analytics

迈向可扩展的协同实践学习:协助计算机视觉和多模态分析

Xinyu Li, Linxuan Zhao, Yueqiao Jin, Yuchen Liu, Jin Zhou, Roberto Martinez-Maldonado, Dragan Gasevic, Lixiang Yan

机构 * Centre for Learning Analytics at Monash(墨尔本大学学习分析中心) Monash University(墨尔本大学) Department of Civil and Environmental Engineering(土木与环境工程系) School of Education(教育学院) The University of Hong Kong(香港大学)

专题命中 视频多模态 :multimodal(title);分类 cs.CV

AI总结 本研究评估了固定摄像头管道在重复护理模拟中的效果,通过多阶段源到目标适应提升行为检测精度,并利用行为轨迹分析提升模拟 debriefing 的可检索性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07765 2026-06-09 cs.HC 新提交 71%

TibetCPR: A Multimodal Tactile Feedback System to Enhance Cardiopulmonary Resuscitation Training in High-Altitude Regions of Tibet

TibetCPR:一种增强高海拔地区心肺复苏训练的多模态触觉反馈系统

Yibo Meng, Ruiqi Chen, Zhiming Liu, Xiaolan Ding

专题命中 视频多模态 :multimodal(title)

AI总结 针对西藏地区心肺复苏训练资源匮乏的问题,提出低成本自引导训练系统TibetCPR,结合深度电触觉与节奏视觉反馈,实验表明能显著稳定按压节奏与深度,并提炼出自引导训练的设计原则。

Comments Accept to MobileHCI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08572 2026-06-09 cs.CV 新提交 70%

OmniCap-IF: Benchmarking and Improving Instruction Following Abilities for Omni-Video Captioning

OmniCap-IF:全视频字幕遵循指令能力的基准测试与改进

Jiahao Wang, An Ping, Yanghai Wang, Yuanxing Zhang, Shihao Li, Hanyan Bian, Yichi Ren, Yize Zhang, Han Wang, Haowen Chen, Junze Li, Jiaqi Wang, Yiyang Hu, Zhuze Xu, Zijie Zhang, Jiaheng Liu

机构 * NJU-LINK Team, Nanjing University(南京大学 NJU-LINK 团队) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 视频多模态 :audio-visual(abstract);omni-modal(abstract);分类 cs.CV

AI总结 提出首个全模态字幕指令遵循基准OmniCap-IF,通过格式与内容正确性评估50种约束类型,揭示格式-内容权衡,并构建54K指令微调数据集OmniCap-IF-54K及模型OmniCaptioner-IF。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08393 2026-06-09 eess.AS 新提交 70%

SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation

SMC-ITA:面向视频到音频生成的序列蒙特卡洛推理时对齐

Haoyu Zhang, Yuta Oshima, Xingjian Du, Chunfeng Wang, Irene Li, Yusuke Iwasawa, Yutaka Matsuo

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 eess.AS

AI总结 提出SMC-ITA方法,通过前瞻奖励估计和序列蒙特卡洛重采样,在推理时优化流匹配V2A生成,显著降低不同步率并提升音频质量。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07924 2026-06-09 cs.CV cs.AI cs.CL cs.LG cs.MM 新提交 70%

Decoupling Semantics and Logic: A Training-Free Coarse-to-Fine Pipeline for Video Retrieval-Augmented Generation

解耦语义与逻辑:一种无需训练的从粗到精的视频检索增强生成流水线

Jiaxin Dai, Zehang Wei, Jiamin Yan, Xiang Xiang

机构 * School of Computer Science & Tech, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) School of AI and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出一种无需训练的两阶段级联视频RAG流水线,通过解耦语义检索与逻辑推理,实现跨语言长视频理解、严格角色遵循和零幻觉时间定位。

Comments To be presented at ACL 2026 MAGMAR Workshop (Oral; Retrieval leaderboard No.1)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08239 2026-06-09 cs.AI cs.CL cs.CV 新提交 67%

When No Answer Is Correct: Diagnosing Absent Answer Detection for MLLMs in Video Understanding

当没有正确答案时:诊断视频理解中多模态大语言模型的缺失答案检测

Yiheng Wang, Yueqian Lin, Lichen Zhu, Yudong Liu, Hai "Helen" Li, Yiran Chen

机构 * Duke University(杜克大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究多模态大语言模型在视频理解中检测缺失答案的能力,发现模型倾向于选择干扰项而非识别无正确答案,时间推理任务中问题更严重,链式思维提示虽提升检测率但仍不理想。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08542 2026-06-09 cs.RO cs.AI cs.CV 新提交 62%

When Video Misreads: Closed-Loop Distillation of Reading Heuristics for Exploratory Manipulation Trace QA

当视频误读:面向探索性操作痕迹问答的阅读启发式闭环蒸馏

Haizhou Ge, Yufei Jia, Yue Li, Zhixing Chen, Lu Shi, Lei Han, Guyue Zhou, Ruqi Huang

机构 * Tsinghua University(清华大学) DISCOVER Robotics

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对探索性操作中机器人误读视频痕迹的问题,提出闭环痕迹蒸馏方法,通过任务编码代理提取单行自然语言启发式提示,使冻结VLM准确预测最小成功动作链,在模拟和真实机器人任务上提升准确率0.38-0.47。

Comments 16 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07639 2026-06-09 cs.CV cs.AI 新提交 62%

MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention

MOSS-Video-Preview: 通过交叉注意力实现实时视频理解

Pengyu Wang, Chenkun Tan, Shaojun Zhou, Wei Huang, Qirui Zhou, Zhan Huang, Zhen Ye, Jijun Cheng, Xiaomeng Qian, Yanxin Chen, Xingyang He, Huazheng Zeng, Chenghao Wang, Pengfei Wang, Hongkai Wang, Shanqing Gao, Yixian Tian, Chenghao Liu, Xinghao Wang, Botian Jiang, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出双通道交叉注意力架构MOSS-Video-Preview,通过非阻塞感知与生成实现实时视频理解,在单H200上实现5倍首词加速和2.7倍解码吞吐提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09532 2026-06-09 cs.CY cs.CL 新提交 57%

Interpretable Crisis Behavior Analysis Using Mobility and Social Media Data

基于移动性和社交媒体数据的可解释危机行为分析

Muhammad Hamza Arshad Majeed, Sidahmed Benabderrahmane, Talal Rahwan

机构 * New York University (NYUAD)(纽约大学(NYUAD))

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 提出统一可解释流水线,融合移动性和社交媒体数据,通过形式概念分析和关联规则挖掘,识别危机中跨域行为模式,并在洛杉矶山火和COVID-19案例中验证,生成可操作的政策简报。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09261 2026-06-09 cs.CV 新提交 57%

Self-supervised Learning Matters: A Simple Ensemble Solution for Micro-Gesture Recognition

自监督学习至关重要:一种用于微手势识别的简单集成方案

Tingyi Liu, Kun Li, Fei Wang, Junjie Chen, Zhiliang Wu, Jihao Gu, Haixu Liu, Dan Guo

机构 * Hefei University of Technology(合肥工业大学) United Arab Emirates University(阿拉伯联合酋长国大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) Anhui Evolution Technology Co., Ltd.(安徽进化科技有限公司) Nanyang Technological University(南洋理工大学) University College London(伦敦大学学院) The University of Sydney(悉尼大学) Beijing QBoson Quantum Technology Co., Ltd.(北京量子芯科技有限公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出一种集成自监督RGB模型与监督多流模型的框架,在MiGA挑战赛微手势分类赛道取得第一名,通过自监督预训练提升性能,在iMiGUE测试集上达到74.419%的top-1准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09248 2026-06-09 cs.CV 新提交 57%

Temporal-Aware Reasoning Optimization for Video Temporal Grounding

时间感知推理优化用于视频时间定位

Minghang Zheng, Zihao Yin, Yi Yang, Yuxin Peng, Yang Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出TaRO框架,通过构造性推理探索和时间敏感性奖励,增强多模态大模型在视频时间定位中的时间感知推理能力,实现最先进性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09181 2026-06-09 cs.CV cs.LG 新提交 57%

Counterfactual Reasoning for Fine-Grained Evidence Disentanglement in VideoQA

用于视频问答中细粒度证据分离的反事实推理

Zhou Du, Hamid Krim, Xiao Wu, Zhaoquan Yuan, Liangwei Li, Keisuke Fujii

机构 * School of OptoElectonic Science and Engineering, University of Electronic Science and Technology of China(电子科技大学光电科学与工程学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出反事实推理框架CREDiT,通过结构因果模型将视频问答中的跨模态表示分解为因果和非因果成分,在独立性约束下进行特征级因果干预,提升答案准确性和推理可靠性。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08566 2026-06-09 cs.CV 新提交 57%

Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction

通过细粒度情感-原因对提取实现精确的情感归因视频字幕生成

Weidong Chen, Cheng Ye, Zhendong Mao, Liping Wang, Xinyan Liu, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) Harbin Institute of Technology (Weihai)(哈尔滨工业大学(威海))

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出细粒度情感-原因对提取框架,通过概念感知视觉语义分解和视觉引导情感可解释学习,提升情感视频字幕的准确性和丰富性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08091 2026-06-09 cs.CV 新提交 57%

VideoWeaver: Evaluating and Evolving Skills for Agentic Long Video Generation

VideoWeaver: 评估与进化智能体长视频生成技能

Jianhui Wei, Jie Tan, Hengchuan Zhu, Xiaotian Zhang, Yan Zhang, Ziyi Chen, Daoan Zhang, Wei Xu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) ByteDance(字节跳动)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出VideoWeaver框架,让智能体自主组合基础技能生成视频,并设计智能体裁判评估过程与结果,通过技能进化算法提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07431 2026-06-09 cs.CV 版本更新 57%

OpenGlass: Ultra-Low-Power On-Device AI Eyewear with Event-based Vision

OpenGlass:用于设备上基于事件的手势识别的开源智能眼镜

Pietro Bonazzi, Julian Moosmann, Ahmet Celik, Philipp Mayer, Michele Magno

机构 * Department of Information Technology and Electrical Engineering, ETH Zürich(信息科技与电气工程系,瑞士联邦理工学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出开源智能眼镜平台OpenGlass,采用模块化设计、事件驱动电源管理和GAP9 RISC-V SoC,实现低功耗设备上ML,在LynX数据集上达到83.94%的跨主体手势识别准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02802 2026-06-09 cs.AI 版本更新 57%

ChatHealthAI: Aligning Electronic Health Record Representations with Large Language Models for Grounded Clinical Reasoning

ChatHealthAI: 将电子健康记录表示与大语言模型对齐以实现基于临床的推理

Bo-Hong Wang, Baicheng Peng, Ruilin Wang, Jun Bai, Ziyang Song, Yue Li

机构 * School of Computer Science, McGill University(麦吉尔大学计算机科学系) Mila - Quebec AI Institute(魁北克人工智能研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出ChatHealthAI框架,通过任务感知重采样器将预训练的EHR基础模型的结构化表示与冻结的大语言模型语义空间对齐,实现可解释的临床推理并保持预测性能。

Comments Main paper with appendix, 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17855 2026-06-09 cs.AI cs.RO 版本更新 57%

QuickLAP: Quick Language-Action Preference Learning for Semi-Autonomous Agents

QuickLAP: 为半自主代理快速语言-动作偏好学习

Jordan Abi Nader, David Lee, Nathaniel Dennler, Andreea Bobu

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本研究提出QuickLAP,一种融合物理和语言反馈的贝叶斯框架,用于实时推断奖励函数,通过大规模语言模型提取奖励特征注意力掩码和偏好偏移,从而在半自主驾驶模拟器中将奖励学习误差降低70%,并通过用户研究验证其可理解性和协作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08737 2026-06-09 cs.RO 新提交 50%

Dream-Tac: A Unified Tactile World Action Model for Contact-Rich Robot Manipulation

Dream-Tac: 用于接触丰富机器人操作任务的统一触觉世界动作模型

Yunfan Lou, Yifan Ye, Yankai Fu, Jun Cen, Xiaowei Chi, Yaoxu Lyu, Peidong Jia, Sirui Han, Zhihe Lu, Shanghang Zhang

机构 * Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) Nanjing University(南京大学) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室)

专题命中 视频多模态 :cross-modal(abstract)

AI总结 提出Dream-Tac统一触觉世界动作模型,通过接触门控视觉-触觉融合和接触感知注意力偏置,联合建模动作、未来视觉观察和触觉动态,在六项接触丰富操作任务中平均动作准确率提升31.7%。

Comments 16 pages,13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏