arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-07 至 2026-04-07 共收录 17 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 17 篇

2604.04482 2026-04-07 cs.AI 83%

Scalable and Explainable Learner-Video Interaction Prediction using Multimodal Large Language Models

基于多模态大语言模型的可扩展且可解释的学习者-视频交互预测

Dominik Glandorf, Fares Fawzi, Tanja Käser

机构 * EPFL(瑞士联邦理工学院洛桑)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出利用多模态大语言模型预测学习者观看、暂停、跳过和回放行为,以评估视频内容的认知负荷,通过7700万次视频控制事件验证了模型的可扩展性和解释性。

Comments Accepted as long paper to the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03302 2026-04-07 cs.CV cs.AI 81%

Beyond Static Vision: Scene Dynamic Field Unlocks Intuitive Physics Understanding in Multi-modal Large Language Models

超越静态视觉:场景动态场解锁多模态大语言模型中的直观物理理解

Nanxi Li, Xiang Wang, Yuanjie Chen, Haode Zhang, Hong Li, Yong-Lu Li

机构 * Shanghai Jiao Tong University(上海交通大学) Tianjin University(天津大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究探讨多模态大语言模型在物理理解上的不足,提出Scene Dynamic Field方法提升对连续物体动态的理解能力,实现20.7%的改进并展现良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04239 2026-04-07 cs.LG cs.AI q-bio.QM 79%

Good Rankings, Wrong Probabilities: A Calibration Audit of Multimodal Cancer Survival Models

好的排名,错误的概率:多模态癌症生存模型的校准审计

Sajad Ghawami

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 研究评估了多模态癌症生存模型的校准性,发现其生存概率未经过校准,提出通过Post-hoc Platt缩放可减少误校准,但不改变区分能力。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03685 2026-04-07 cs.CV 79%

DSERT-RoLL: Robust Multi-Modal Perception for Diverse Driving Conditions with Stereo Event-RGB-Thermal Cameras, 4D Radar, and Dual-LiDAR

DSERT-RoLL:多模态感知用于多样驾驶条件的鲁棒性,结合立体事件-RGB-热成像相机、4D雷达和双光雷达

Hoonhee Cho, Jae-Young Kang, Yuhwan Jeong, Yunseo Yang, Wonyoung Lee, Youngho Kim, Kuk-Jin Yoon

机构 * Visual Intelligence Lab, KAIST(韩国科学技术院视觉智能实验室)

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出DSERT-RoLL数据集,结合立体事件、RGB和热成像相机以及4D雷达和双光雷达,涵盖多样的天气和光照条件,提供精确的2D和3D边界框及轨迹ID,支持跨传感器组合的公平比较,提升新型传感器的数据可用性,并建立统一的3D和2D基准,促进传感器性能的系统研究。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00318 2026-04-07 cs.CV 79%

Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning

链式帧:通过帧感知推理推进多模态大语言模型的视频理解

Sara Ghazanfari, Francesco Croce, Nicolas Flammarion, Prashanth Krishnamurthy, Farshad Khorrami, Siddharth Garg

机构 * New York University(纽约大学) EPFL(瑞士联邦理工学院洛桑分校)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种单阶段视频LLM,通过显式引用相关帧减少推理中的时间不一致性,利用COF-DATA数据集提升视频理解性能,发现合成数据显著提升模型准确率。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19010 2026-04-07 eess.SP cs.RO 78%

PalpAid: Multimodal Pneumatic Tactile Sensor for Tissue Palpation

PalpAid:多模态气压触觉传感器用于组织触诊

Devi Yuliarti, Ravi Prakash, Hiu Ching Cheung, Amy Strong, Patrick J. Codd, Shan Lin

机构 * Duke University(杜克大学) Arizona State University(亚利桑那州立大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 PalpAid通过气压和声音传感器恢复机器人手术中的触觉信息,能区分不同硬度的3D打印物体和离体组织。

Comments IEEE-RAS RoboSoft 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04029 2026-04-07 cs.CV 70%

ATSS: Detecting AI-Generated Videos via Anomalous Temporal Self-Similarity

ATSS:通过异常时间自相似性检测AI生成视频

Hang Wang, Chao Shen, Lei Zhang, Zhi-Qi Cheng

机构 * Xi’an Jiaotong University(西安交通大学) The Hong Kong Polytechnic University(香港理工大学) University of Washington(华盛顿大学)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出ATSS方法,通过三重相似性表示和跨注意融合机制,检测AI生成视频的异常时间自相似性,优于现有方法,在多个基准上表现更优。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24936 2026-04-07 cs.CV cs.AI 62%

TIGFlow-GRPO: Trajectory Forecasting via Interaction-Aware Flow Matching and Reward-Guided Optimization

TIGFlow-GRPO:通过交互感知的流匹配和奖励引导优化进行轨迹预测

Xuepeng Jing, Wenhuan Lu, Hao Meng, Zhizhi Yu, Jianguo Wei

机构 * Tianjin University(天津大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出TIGFlow-GRPO,通过交互感知的流匹配和奖励引导优化,提升复杂环境下的轨迹预测准确性与稳定性,生成更符合社会规范和物理可行的轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00408 2026-04-07 cs.CV cs.AI 62%

Low-Bitrate Video Compression through Semantic-Conditioned Diffusion

基于语义的低比特率视频压缩

Lingdong Wang, Guan-Ming Su, Divya Kothandaraman, Tsung-Wei Huang, Mohammad Hajiesmaili, Ramesh K. Sitaraman

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Dolby Laboratories(杜比实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DiSCo框架,通过语义条件扩散模型在低比特率下实现高质量视频压缩,采用文本描述、空间时间退化视频和可选草图等模态,提升感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03653 2026-04-07 cs.CV cs.IR cs.MM 62%

Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval

想象之前聚焦:扩散引导的寄存器增强部分相关视频检索

Jun Li, Xuhang Lou, Jinpeng Wang, Yuting Wang, Yaowei Wang, Shu-Tao Xia, Bin Chen

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Peng Cheng Laboratory(鹏城实验室)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出DreamPRVR,通过粗到细的表示学习范式,利用扩散模型生成全局语义寄存器,提升部分相关视频检索的准确性与鲁棒性。

Comments Accepted to CVPR 2026. 15 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03264 2026-04-07 cs.CV cs.AI cs.CR 62%

SafeScreen: A Safety-First Screening Framework for Personalized Video Retrieval for Vulnerable Users

SafeScreen: 一种以安全优先的个性化视频检索框架用于易受伤害用户的视频筛选

Wenzheng Zhao, Madhava Kalyan Gadiputi, Fengpei Yuan

机构 * Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 SafeScreen通过安全优先机制,在确保个性化视频检索的同时满足个体安全约束,采用自动化流程进行视频的连续审批或拒绝,结合个性化安全标准提取、证据驱动评估和LLM决策,实现实时可解释的视频筛选。

Comments 11 pages, 3 figures, 7 tables. Under review for ACM ICMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04811 2026-04-07 cs.RO cs.CV cs.HC 57%

AnyUser: Translating Sketched User Intent into Domestic Robots

AnyUser: 将草图用户意图翻译成家用机器人

Songyuan Yang, Huibin Tan, Kailun Yang, Wenjing Yang, Shaowu Yang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(湖南大学国家机器人视觉感知与控制技术工程研究中心)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 AnyUser通过相机图像上的自由形式草图(可选语言)实现直观的家庭任务指令,利用多模态输入生成无需先验地图或模型的可执行机器人动作,通过大量评估验证其在不同模拟家庭场景中的高准确性和真实环境中的可靠性。

Comments Accepted to IEEE Transactions on Robotics (T-RO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04379 2026-04-07 cs.CV 57%

Reinforce to Learn, Elect to Reason: A Dual Paradigm for Video Reasoning

强化以学习,选择以推理:视频推理的双范式

Songyuan Yang, Weijiang Yu, Jilin Ma, Ziyu Liu, Guijian Tang, Wenjing Yang, Huibin Tan, Nong Xiao

机构 * National University of Defense Technology(国防科技大学) Sun Yat-sen University(中山大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出RLER双范式,通过强化学习生成证据并验证推理一致性,提升视频推理的可靠性和可解释性,实验表明其在多个基准上均取得最佳性能。

Comments Accepted at CVPR 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04372 2026-04-07 cs.CV 57%

Graph-to-Frame RAG: Visual-Space Knowledge Fusion for Training-Free and Auditable Video Reasoning

图到帧RAG:面向无训练和可审计的视频推理的视觉空间知识融合

Songyuan Yang, Weijiang Yu, Ziyu Liu, Guijian Tang, Wenjing Yang, Huibin Tan, Nong Xiao

机构 * National University of Defense Technology(国防科技大学) Sun Yat-sen University(中山大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出G2F-RAG,通过视觉空间知识融合提升视频推理的可解释性和效率,减少认知负担并保留可追溯的证据轨迹。

Comments Accepted at CVPR 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03645 2026-04-07 eess.IV cs.CV 57%

UniSurgSAM: A Unified Promptable Model for Reliable Surgical Video Segmentation

UniSurgSAM: 一种用于可靠外科视频分割的统一提示模型

Haofeng Liu, Ziyue Wang, Alex Y. W. Kong, Guanyi Qin, Yunqiu Xu, Chang Han Low, Mingqi Gao, Lap Yan Lennon Chan, Yueming Jin

机构 * Department of Biomedical Engineering, National University of Singapore(新加坡国立大学生物医学工程系) Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系) School of Computer Science, The University of Sheffield(谢菲尔德大学计算机科学学院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出UniSurgSAM,通过视觉、文本或音频提示实现可靠的外科视频分割,采用解耦两阶段框架解决优化干扰问题,并引入三种关键设计提升可靠性。

Comments Extended version of MICCAI 2025 paper (ReSurgSAM2). 13 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20685 2026-04-07 cs.RO 50%

C-NAV: Towards Self-Evolving Continual Object Navigation in Open World

C-NAV:迈向开放世界中的自进化持续物体导航

Ming-Ming Yu, Fei Zhu, Wenzhuo Liu, Yirong Yang, Qunbo Wang, Wenjun Wu, Jing Liu

机构 * Beihang University(北京航空航天大学) Centre for Artificial Intelligence and Robotics, HKISI-CAS(香港智能科学与工业研究院人工智能与机器人中心) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) Beijing Jiaotong University(北京交通大学)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出C-Nav框架,通过双路径抗遗忘机制和自适应采样策略,解决持续物体导航中的灾难性遗忘问题,实验表明其在多个模型架构上均优于现有方法,且内存需求显著降低。

Comments Accepted at NeurIPS 2025

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03451 2026-04-07 cs.RO cs.CY cs.HC 50%

Do Robots Need Body Language? Comparing Communication Modalities for Legible Motion Intent in Human-Shared Spaces

机器人需要肢体语言吗?比较不同沟通方式以实现人类共享空间中运动意图的可理解性

Jonathan Albert Cohen, Kye Shimizu, Allen Song, Vishnu Bharath, Kent Larson, Pattie Maes

机构 * MIT Media Lab(麻省理工学院媒体实验室) New England Innovation Academy(新英格兰创新学院)

专题命中 视频多模态 :multimodal(abstract)

AI总结 研究探讨不同沟通方式对理解四足机器人导航意图的影响,评估表达性动作、灯光、文本和音频等模态对预测准确性、信心和信任度的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏