arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-04 至 2026-06-04 共收录 13 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 13 篇

1803.02099 2026-06-04 cs.LG cs.SY eess.SY 78%

A Hybrid Method for Traffic Flow Forecasting Using Multimodal Deep Learning

一种用于交通流预测的混合方法:使用多模态深度学习

Shengdong Du, Tianrui Li, Xun Gong, Shi-Jinn Horng

机构 * School of Information Science and Technology, National Engineering Laboratory of Integrated Transportation Big Data Application Technology(信息科学与技术学院,集成交通大数据应用技术国家工程实验室) Department of Computer Science and Information Engineering, National Taiwan University of Science and Technology(计算机科学与工程系,台湾大学科技学院)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出了一种混合多模态深度学习方法,用于短期交通流预测,通过注意力辅助多模态深度学习架构联合和自适应学习多模态交通数据的空间时间相关特征和长期时间依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05115 2026-06-04 cs.CV cs.AI cs.CL 75%

Continual Visual and Verbal Learning Through a Child's Egocentric Input

通过儿童自我中心输入进行持续的视觉与语言学习

Xiaoyang Jiang, Yanlai Yang, Kenneth A. Norman, Brenden Lake, Mengye Ren

机构 * Agentic Learning AI Lab, New York University(代理学习人工智能实验室,纽约大学) Department of Psychology, Princeton University(心理学系,普林斯顿大学)

专题命中 视频多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出BabyCL持续多模态学习框架,在单一时间顺序处理SAYCam数据集,通过流式视觉表示学习和图像-文本对比目标,在SAYCam Labeled-S 4AFC基准上优于流式学习基线,缩小了与离线训练上限的差距。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04588 2026-06-04 cs.CL 70%

VCIFBench: Evaluating Complex Instruction Following for Video Understanding

VCIFBench:评估视频理解中的复杂指令遵循能力

Huangchen Xu, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University(知识驱动人机智能工程研究中心,吉林大学) International Center of Future Science, Jilin University(未来科学国际中心,吉林大学)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CL

AI总结 提出VCIFBench基准,通过混合验证流水线评估多模态大模型在视频理解中遵循内容、格式、风格和结构约束的复杂指令能力,实验表明联合约束满足仍具挑战,DPO训练可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04806 2026-06-04 cs.CV cs.AI 62%

NoRA: Evaluating Grounded Reasonableness in Visual First-person Normative Action Reasoning

NoRA: 评估视觉第一人称规范性动作推理中的基于事实的合理性

Sichao Li, Sai Ma, Daniel Kilov, Secil Yanik Guyot, Zhuang Li, Seth Lazar

机构 * The University of Sydney(悉尼大学) Australian National University(澳大利亚国立大学) RMIT University(皇家墨尔本理工大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出NoRA基准,通过事实-理由-动作支持图评估多模态模型生成合理动作并基于可见事实进行推理的能力,发现当前VLM在构建完整动作空间和绑定正确支持方面存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03598 2026-06-04 cs.RO cs.AI cs.CV 62%

PHASER: Phase-Aware and Semantic Experience Replay for Vision-Language-Action Models

PHASER: 面向视觉-语言-动作模型的相位感知与语义经验回放

Ziyang Chen, Shaoguang Wang, Weiyu Guo, Qianyi Cai, He Zhang, Pengteng Li, Yiren Zhao, Yandong Guo

机构 * Thrust of AI, HKUST(Guangzhou)(人工智能 thrust,香港科技大学(广州)) AI 2 Robotics, Shenzhen, China(人工智能与机器人,深圳,中国)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出PHASER框架,通过相位感知容量分配和多模态干扰路由策略,结合自动相位提取管线Auto-PC,解决VLA模型在持续学习中的灾难性遗忘问题,在LIBERO基准上平均成功率提升高达31%。

Comments 20 pages, 8 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09686 2026-06-04 cs.AI cs.CV 62%

Belief-Aware VLM Model for Human-like Reasoning

信念感知的VLM模型用于类人推理

Anshul Nayak, Shahil Shaik, Yue Wang

机构 * Mechanical Engineering Department, Clemson University(克莱姆森大学机械工程系)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出一种信念感知的视觉语言模型框架,通过检索式记忆和强化学习近似信念,提升长时程意图推理能力,在HD-EPIC等数据集上优于零样本基线。

Comments Accepted for publication at the IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026). 6 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22121 2026-06-04 cs.CV cs.AI 62%

GenSpan: Generation-Calibrated Motion Span Priors for Multi-Verb Video Corpus Moment Retrieval

GenSpan: 用于多动词视频语料库时刻检索的生成校准运动跨度先验

Yunzhuo Sun, Xinyue Liu, Yanyang Li, Nanding Wu, Linlin Zong, Xianchao Zhang, Wenxin Liang

机构 * Dalian University of Technology(大连理工大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出GenSpan框架,利用LLM生成辅助视频作为时间先验,结合令牌选择器和双向状态空间模型,提升多动词查询下的视频语料库时刻检索与定位性能。

Comments Major revision with title change, updated method, and additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04836 2026-06-04 cs.CV 57%

3D Temporal Analysis for Autism Spectrum Disorder Screening During Attention Tasks

注意力任务期间自闭症谱系障碍筛查的3D时间分析

Inam Qadir, Elizabeth B Varghese, Dena Al-Thani, Marwa Qaraqe

机构 * College of Science and Engineering, Hamad Bin Khalifa University, Qatar Foundation, Doha, Qatar(科学与工程学院,哈马德·本·哈利法大学,卡塔尔基金会,多哈,卡塔尔)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出基于DECA的3D时间分析框架,提取头部姿态和面部表情特征,利用LSTM/GRU分类器在VR-CPT任务中实现ASD筛查,多模态融合达到84.6%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04596 2026-06-04 cs.CL 57%

A Systematic Evaluation of Positional Bias in Multi-Video Summarization with MLLMs

多视频摘要中位置偏差的系统评估:基于多模态大语言模型

Huangchen Xu, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University(知识驱动人机智能工程研究中心) International Center of Future Science, Jilin University(未来科学国际中心)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 本研究系统评估了多模态大语言模型在多视频摘要任务中的位置偏差,通过构建基准和三种互补指标揭示了领域与模型依赖的偏差特性,并分析了提示级缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04323 2026-06-04 cs.CV 57%

Answer Self-Consistency with Margin-Triggered Question Re-Arbitration for the CVPR 2026 VidLLMs Challenge

面向CVPR 2026 VidLLMs挑战赛的基于边际触发问题重新仲裁的答案自一致性方法

Tomoya Miyazawa, Hiroyasu Okuno

机构 * Data Analytics Labo Co.(数据分析师实验室公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出一种无需训练的测试时推理框架ASC-MQRA,通过答案自一致性聚合多轮视频问答结果,并利用边际触发机制对低置信度样本进行条件性重新仲裁,在CVPR 2026 VidLLMs挑战赛Track 2上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04098 2026-06-04 cs.CV 57%

When Seeing Is Not Believing -- A Benchmark for Search-Grounded Video Misinformation Detection

当眼见不再为实——面向搜索辅助的视频虚假信息检测基准

Tao Yu, Yujia Yang, Shenghua Chai, Zhang Jinshuai, Haopeng Jin, Hao Wang, Minghui Zhang, Zhongtian Luo, Yuchen Long, Xinlong Chen, Jiabing Yang, Zhaolu Kang, Yuxuan Zhou, Zhengyu Man, Xinming Wang, Hongzhu Yi, Zheqi He, Xi Yang, Yan Huang, Liang Wang

机构 * CASIA(中国科学院自动化研究所) UCAS(中国科学院大学) BAAI(百度人工智能研究院) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出EVID-Bench基准,通过跨视频对比和开放网络搜索检测视频虚假信息,涵盖9种操纵类型,评估前沿多模态模型发现准确率低且面临多种挑战。

Comments 52 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.09914 2026-06-04 eess.SY cs.PF cs.SY q-bio.MN 50%

Semi-Quantitative Abstraction and Analysis of Chemical Reaction Networks

化学反应网络的半定量抽象与分析

Milan Češka, Jan Křetínský

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出了一种新的方法,用于预测和解释化学反应网络的暂态和稳态行为,通过半定量的抽象和分析,实现对复杂动态系统的高效处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
1509.09104 2026-06-04 q-bio.QM cond-mat.stat-mech cs.NA math.NA q-bio.MN q-bio.SC 50%

Distribution approximations for the chemical master equation: comparison of the method of moments and the system size expansion

化学主方程的分布近似:矩法与系统规模展开法的比较

Alexander Andreychenko, Luca Bortolussi, Ramon Grima, Philipp Thomas, Verena Wolf

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文比较了矩法和系统规模展开法在近似化学主方程分布中的准确性,通过单峰和多峰蛋白质分布的基因表达网络验证了两种方法的优劣。

Comments 28 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏