arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-20 至 2026-05-20 共收录 11 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 11 篇

2605.18431 2026-05-20 cs.CV 85%

Seeing Together: Multi-Robot Cooperative Egocentric Spatial Reasoning with Multimodal Large Language Models

协同视见:基于多模态大语言模型的多机器人协作自体空间推理

Kunyu Peng, Zhikun Zhou, Kailun Yang, Di Wen, Ruiping Liu, Yufan Chen, Junwei Zheng, Hao Shi, Yi Zhou, M. Saquib Sarfraz, Danda Pani Paudel, Luc Van Gool

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Hunan University(湖南大学) University of Oxford(牛津大学) Zhejiang University(浙江大学) ETH Zurich(苏黎世联邦理工学院) Ant Group(蚂蚁集团)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文研究了多机器人协作动态空间推理问题,提出了首个针对该任务的基准CoopSR以及多机器人自体问答数据集EgoTeam,通过引入SP-CoR框架实现了细粒度的协作空间推理,显著提升了多机器人协作推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19950 2026-05-20 cs.CV 83%

AffectVerse: Emotional World Models for Multimodal Affective Computing

AffectVerse: 多模态情感计算中的情感世界模型

Bo Zhao, Fanghua Ye, Yixin Ji, Sicheng Zhao, Xiaojiang Peng, Zitong YU

机构 * Great Bay University(大湾大学) Tencent(腾讯) Tsinghua University(清华大学) Shenzhen Technology University(深圳技术大学)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本研究提出AffectVerse,一种基于Qwen2.5-Omni的多模态情感计算模型,通过引入情感世界模块实现短期潜在情感预测,利用未来预测作为自监督信号,提高了情感计算的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19130 2026-05-20 cs.LG cs.AI cs.CL cs.CV 82%

EgoBabyVLM: Benchmarking Cross-Modal Learning from Naturalistic Egocentric Video Data

EgoBabyVLM:基于自然主义第一人称视频数据的跨模态学习基准测试

Dongyan Lin, Phillip Rust, Angel Villar Corrales, Alvin W. M. Tan, Mahi Luthra, Charles-Éric Saint-James, Rashel Moritz, Sheila Krogh-Jespersen, Vanessa Stark, Surya Parimi, Jiayi Shen, Youssef Benchekroun, Yosuke Higuchi, Martin Gleize, Tom Fizycki, Nicolas Hamilakis, Manel Khentout, Sho Tsuji, Balázs Kégl, Juan Pino, Michael C. Frank, Emmanuel Dupoux

机构 * Meta Superintelligence Labs(Meta超智能实验室) Stanford University(斯坦福大学) Meta Reality Labs(Meta现实实验室) The University of Tokyo(东京大学)

专题命中 视频多模态 :cross-modal(title);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究探讨了儿童如何从有限的视觉-语言输入中获得语言 grounding 的鲁棒性,提出了 EgoBabyVLM 挑战,推动模型在自然主义数据中实现 grounded language learning。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07570 2026-05-20 q-bio.NC cs.AI cs.CV cs.LG 81%

How does longer temporal context enhance multimodal narrative video processing in the brain?

更长的时间上下文如何增强大脑对多模态叙事视频的处理?

Prachi Jindal, Anant Khandelwal, Manish Gupta, Bapi S. Raju, Subba Reddy Oota, Tanmoy Chakraborty

机构 * Technische Universität Berlin(柏林技术大学) Microsoft Research(微软研究院) IIT Delhi(德里理工学院) Microsoft(微软) IIIT-Hyderabad(海得拉巴理工学院)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究探讨了视频片段时长和叙事任务提示如何影响自然电影观看过程中大脑模型对多模态大语言模型(MLLMs)的对齐情况,发现增加片段持续时间显著提高了大脑对齐程度,而单模态视频模型则无明显提升。

Comments 22 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19794 2026-05-20 cs.HC cs.AI cs.DB 79%

AffectAI-Capture: A Reproducible Multimodal Protocol for Small-Group Meeting Research

AffectAI-Capture:一种可重复的多模态协议用于小型小组会议研究

Meisam Jamshidi Seikavandi, Alice Modica, Anna Obara, Fabricio Batista Narcizo, Tanya Ignatenko, Ted Vucurevich, Jesper Bünsow Boldt, Paolo Burelli, Andrew Burke Dittberner

机构 * GN Advanced Science, GN Group, Ballerup, Denmark(GN先进科学,GN集团,丹麦Ballerup) IT University of Copenhagen, brAIn lab, Copenhagen, Denmark(哥本哈根IT大学,brAIn实验室,丹麦哥本哈根) Copenhagen Business School, Copenhagen, Denmark(哥本哈根商学院,丹麦哥本哈根) Aalborg University, Denmark(奥尔堡大学,丹麦)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出了一种可重复的多模态协议AffectAI-Capture,用于收集四人会议类互动的同步多模态数据,结合眼动追踪、可穿戴生理、近距离和房间音频、多视角视频、事件日志和结构化自我报告。通过固定任务块和已建立的小组互动范式,结合权威事件时间线和标准化输出进行数据采集和后期处理。本文贡献在于建立了可重复的协议架构,将任务设计、仪器化、时间溯源和数据封装连接起来,用于情绪、行为和会议分析研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19075 2026-05-20 cs.CV cs.AI 77%

CRAFT: Critic-Refined Adaptive Key-Frame Targeting for Multimodal Video Question Answering

CRAFT: 基于批评的自适应关键帧目标定位用于多模态视频问答

Mahesh Bhosale, Abdul Wasi, Vishvesh Trivedi, Pengyu Yan, Akhil Gorugantu, David Doermann

机构 * University at Buffalo(布法罗大学) New York University(纽约大学)

专题命中 视频多模态 :multimodal(title,comments);分类 cs.CV、cs.AI

AI总结 该研究提出CRAFT方法,通过动态关键帧选择、每视频ASR与多语言回退以及混合批评循环,迭代验证和修复声明,最终实现多模态视频问答的准确证据聚合。

Comments Accepted at ACL 2026 Multimodal Augmented Generation via MultimodAl Retrieval Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19559 2026-05-20 cs.CV cs.AI 62%

EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs

EgoCoT-Bench: 用于MLLMs的 grounded 和可验证的 operation-centric 思维链推理基准测试

Yang Dai, Dian Jiao, Tianwei Lin, Wenqiao Zhang

机构 * Zhejiang University(浙江大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出EgoCoT-Bench,一个用于评估MLLMs在第一人称视角下细粒度操作中心推理能力的基准测试,包含3172个可验证的问答对,涵盖感知、预见和高层次推理等任务,旨在解决现有基准测试在细粒度推理和证据验证方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11768 2026-05-20 cs.AI 57%

Governing Evolving Memory in LLM Agents: Risks, Mechanisms, and the Stability and Safety Governed Memory (SSGM) Framework

在LLM代理中治理演化的记忆:风险、机制以及稳定性与安全性的治理记忆(SSGM)框架

Chingkwun Lam, Jiaxin Li, Lingfei Zhang, Kuo Zhao

机构 * College of Intelligent Science and Engineering(智能科学与工程学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文研究了LLM代理中记忆治理的问题,提出了一种新的SSGM框架,通过一致性验证、时间衰减建模和动态访问控制来缓解记忆腐蚀风险,提高记忆系统的稳定性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15343 2026-05-20 cs.HC cs.AI cs.LG 57%

When the Loop Closes: Architectural Limits of In-Context Isolation, Metacognitive Co-option, and the Two-Target Design Problem in Human-LLM Systems

当循环闭合时:人类-大语言模型系统中上下文隔离、元认知侵占和双目标设计问题的架构限制

Z. Cheng, N. Song

机构 * Independent Researcher(独立研究者)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

AI总结 本文研究了人类-大语言模型系统中上下文隔离、元认知侵占和双目标设计问题的架构限制,通过案例研究揭示了上下文污染机制和元认知侵占动态,并提出了保护性系统设计与限制性系统设计的伦理区别。

Comments empirical case study with primary data; 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18209 2026-05-20 cs.GR 50%

MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning

MotionDuet: 一种基于双条件的3D人体运动生成方法,结合视频正则化的文本学习

Yi-Yang Zhang, Tengjiao Sun, Pengcheng Fang, Deng-Bao Wang, Xiaohao Cai, Min-Ling Zhang, Hansung Kim

专题命中 视频多模态 :multimodal(abstract)

AI总结 本研究提出MotionDuet,一种结合视频正则化的文本学习的双条件3D人体运动生成方法,通过双流统一编码与变换和分布感知结构和谐化损失,解决了现有方法在生成动态与真实世界运动统计分布之间的差距问题,生成更加真实可控的人体运动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04575 2026-05-20 stat.ML cs.LG cs.NA math.NA physics.comp-ph stat.CO 50%

Complexity Analysis of Normalizing Constant Estimation: from Jarzynski Equality to Annealed Importance Sampling and beyond

归一化常数估计的复杂性分析:从Jarzynski等式到退火重要性采样及其进一步发展

Wei Guo, Molei Tao, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文研究了归一化常数估计问题,提出了一种非渐近分析方法,推导了退火重要性采样估计归一化常数的复杂度,并提出了一种新的算法以处理多模态问题。

Comments Accepted at ICLR 2026 (https://openreview.net/forum?id=96fJALwotm)

详情

展开后加载摘要…

URL PDF HTML 收藏