arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-19 至 2026-08-19 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 9 篇

2608.17084 2026-08-19 cs.CL 新提交 87%

Uncertainty-Aware Decision Making in Multimodal Large Language Models

多模态大语言模型中的不确定性感知决策

Abderrahmene Boudiaf, Irfan Hussain, Sajid Javed

机构 * Khalifa University of Science and Technology(哈利法科技大学)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CL

AI总结 本调查围绕决策中心框架,综述多模态大语言模型(MLLMs)的不确定性感知决策相关研究,对比同类调查并指出源感知分解等开放问题,核心是不确定性需改善多模态证据下的系统行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17583 2026-08-19 cs.CL 新提交 85%

Auditing Exposure to Harmful Content on TikTok using Multimodal Language Models: A Cross-National, Age-Stratified Study

使用多模态语言模型对TikTok上的有害内容暴露情况进行审计:一项跨国、按年龄分层的研究

Hamidreza Saffari, Francesco Pierri

机构 * Politecnico di Milano(米兰理工大学)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL

AI总结 本研究使用多模态大语言模型Gemini 2.5 Flash,在法、意、瑞三国对TikTok开展跨国年龄分层审计,发现关键词搜索会大幅提升有害内容占比,意国各年龄组有害内容占比最高,平台安全过滤器低估了明确有害内容。

Comments 20 pages, 16 figures, 14 tables. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15455 2026-08-19 cs.MM cs.AI 版本更新 81%

M3TR: Temporal Retrieval Enhanced Multi-Modal Micro-video Popularity Prediction

M3TR: 增强型多模态微视频流行度预测框架

Jiacheng Lu, Weijian Wang, Mingyuan Xiao, Yang Hua, Tao Song, Bo Peng, Cheng Hua, Haibing Guan

机构 * Shanghai Jiao Tong University(上海交通大学) Queen's University Belfast(女王大学贝尔法斯特分校) Purdue University(普渡大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.AI、cs.MM

AI总结 M3TR通过结合精细时序建模与新颖的时序感知检索过程,提升微视频流行度预测的准确性与长期预测能力。

Comments Accepted by MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16972 2026-08-19 cs.LG 新提交 78%

MultiSigBERT: Beyond Survival Analysis through Multimodal and Sequential Modeling in Oncology

MultiSigBERT:肿瘤学中超越生存分析的多模态与序列建模

Paul Minchella, Stéphane Chrétien, Guillaume Metzler, Loïc Verlingue, Rémi Vaucher

机构 * Université Lumière Lyon 2(里昂第二大学) Léon Bérard Center(莱昂·贝拉尔中心) EPITA(EPITA(法国高等计算机与技术学院))

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本研究提出基于路径特征表示的多模态序列生存建模框架MultiSigBERT,结合电子健康记录的多模态数据与时间特性,在含2500余名患者的肿瘤队列上取得0.743的一致性指数,提升了生存预测性能。

Comments Accepted at ECML PKDD 2026, Applied Data Science Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12313 2026-08-19 cs.CV cs.CL 版本更新 62%

AVA-Encoder: Towards Agent-Native Video Representation Learning

AVA-Encoder:面向智能体原生的视频表示学习

Chuyue Li, Jinpeng Yu, Haozhe Wang, Tian Xueyun, Zhijing Zhang, Bingnan Li, Shuqi Gu, Kan Ren, Jiaming Liu, Ruihua Huang

机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务部) ShanghaiTech University(上海科技大学) The Hong Kong University of Science and Technology(香港科技大学) Institute of Computing Technology(中国科学院计算技术研究所) Southeast University(东南大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 针对创意智能体缺乏从高质量电影学习的有效方式的问题,提出AVA-Encoder框架,其视频表示经重构优化后,在相关基准上性能优于现有方法,还发布了配套框架、基准及数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17013 2026-08-19 cs.CV 版本更新 57%

Toward Universal Skeleton-Based Action Recognition across Heterogeneous Skeletons and Open Vocabularies

迈向通用的基于骨骼的动作识别

Jidong Kuang, Hongsong Wang, Jie Gui, Yuan Yan Tang, James Tin-Yau Kwok

机构 * School of Cyber Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,南京,中国) School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,南京,中国)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出了一种基于Transformer的模型,通过统一骨骼表示、动作编码器和多粒度动作-文本对齐,解决异构骨骼动作识别的挑战,实验验证了方法的有效性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01460 2026-08-19 cs.CV 版本更新 57%

Reinforcing Consistency in Video MLLMs with Structured Rewards

通过结构化奖励强化视频MLLMs的一致性

Yihao Quan, Zeru Shi, Jinman Zhao, Ruixiang Tang

机构 * Rutgers University(罗格斯大学) University of Toronto(多伦多大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究通过结构化奖励提升视频MLLMs的一致性,发现传统监督不足,提出结合事实和时间单元的奖励机制,提升视频理解准确性。

Comments Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17651 2026-08-19 astro-ph.HE 新提交 50%

Revisiting neutrino event epochs for the blazar PKS 0735+178 with TESS

利用TESS重新研究耀变体PKS 0735+178的中微子事件时期

Shubham Kishore, Alok C. Gupta, Debanjan Bose

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文利用TESS观测耀变体PKS 0735+178的周级耀发,分析其光学光变特性,探讨该源光学变异性与同期中微子事件的可能关联,为其光学流量行为提出物理场景。

Comments Accepted for publication in ApJ, 13 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23037 2026-08-19 cs.LG physics.flu-dyn 版本更新 50%

Open datasets and machine learning for two-phase heat transfer: a review following a spatial-temporal taxonomy

用于多相输运和热系统数据驱动建模的开放多模态数据集与开源软件

Christy Dunlap, Ridwan Olabiyi, Firas Al-Hindawi, Hari Pandey, Stephen Pierson, Daniel Curl, Braden Stevens, Mohammad Ishraq Hossain, Annapurna Parjuli, Chinmaya Joshi, Ashif Iquebal, Han Hu

机构 * Department of Mechanical Engineering, University of Arkansas(阿肯色大学机械工程系)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文介绍了一个由NED3实验室开发的开放多模态数据集和开源软件生态系统,提出了空间加时间维度(S+TD)分类框架,并重点描述了SeqReg序列回归库,以推动可复现的AI赋能热流体研究。

Comments Accepted manuscript replacing arXiv:2605.23037 (https://arxiv.org/abs/2605.23037) (v1). Substantially expanded from the original preprint and published in Transport Phenomena 2026, 1(3), 20260081. this https URL (https://doi.org/10.1515/tp-2026-0081)

详情

展开后加载摘要…

URL PDF HTML 收藏