arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-30 至 2026-06-30 共收录 12 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 12 篇

2606.29900 2026-06-30 cs.CV cs.AI 81%

LLM-based Multimodal Personality Recognition via Facial Action Unit-Text Semantic Fusion

基于面部动作单元-文本语义融合的LLM多模态人格识别

Tianyi Zhang, Wei Shan, Yuan Zong, Tianhua Qi, Wenming Zheng

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出一种基于大语言模型的面部动作单元与文本语义融合框架,通过将AU序列转化为可解释文本描述并与受访者文本回答融合,实现异步视频面试中的人格识别,在AVI-6基准上取得更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29023 2026-06-30 cs.CV cs.AI 81%

Efficient Spatio-Temporal Grounding with Multimodal Large Models via Second-Level Tracking and RL Verification

基于二级跟踪和强化学习验证的多模态大模型高效时空定位

Tianshu Zhang, Yan Wang, Ji Qi, Lijie Wen

机构 * Tsinghua University(清华大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出一种从帧级到秒级跟踪的流水线,结合跨秒平滑、链式思维轨迹合成和强化学习优化,在长视频中实现高效且准确的时空定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28514 2026-06-30 cs.AI cs.CL 81%

GPTNT: Benchmarking Real-Time Collaboration Between Multimodal Agents on Keep Talking And Nobody Explodes

GPTNT:在《保持通话,无人爆炸》中基准测试多模态智能体之间的实时协作

Amit Parekh, Sabrina McCallum, Kareem Al-Hasan, Malvina Nikandrou, Alessandro Suglia, Ioannis Konstas

机构 * Heriot-Watt University(赫瑞-沃德大学) University of Edinburgh(爱丁堡大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 提出GPTNT基准,基于合作游戏《保持通话,无人爆炸》测试多模态智能体在实时、信息不对称条件下的协作能力,发现当前最先进系统无法在实时中拆除任何炸弹。

Comments Project website and code at https://gptnt.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29504 2026-06-30 cs.CV cs.CR 79%

Empirical Evaluation of Multi-Modal Touch Detection in Over-the-Shoulder Video Surveillance

肩后视频监控中多模态触摸检测的实证评估

Mohammadreza Rashidi

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文评估了一种多模态触摸检测框架,用于从肩后视频中重建移动键盘按键事件,但实验表明在非受控场景下无法可靠重建击键。

Comments 9 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29136 2026-06-30 cs.CV cs.AI 79%

CMTFormer: Marrying Transformer with Hierarchical Information Interaction for RGB-Event Object Detection

CMTFormer:融合Transformer与层次化信息交互的RGB-事件目标检测

Yu Li, Yuenan Hou, Yingmei Wei, Jiangming Chen, Yanming Guo

专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出CMTFormer,通过浅层对齐、中层增强和深层可学习融合的层次化交互机制,有效融合RGB帧与事件流,在DSEC-Detection和PKU-DAVIS-SOD基准上超越现有方法。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10359 2026-06-30 cs.CV cs.AI 73%

Tool-Augmented Spatiotemporal Reasoning for Streamlining Video Question Answering Task

增强工具的时空推理用于视频问答任务的优化

Sunqi Fan, Jiashuo Cui, Meng-Hao Guo, Shuojin Yang

机构 * BNRist, Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系,北京信息科学与技术国家研究中心)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出STAR框架和视频工具包,提升多模态大语言模型的时空推理能力,在VideoMME和LongVideoBench上分别提升8.2%和4.6%。

Comments Accepted by NeurIPS 2025 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30292 2026-06-30 cs.LG cs.CV 57%

DreamForge-World 0.1 Preview: A Low-Compute Real-Time Controllable World Model

DreamForge-World 0.1 Preview:一种低计算量实时可控世界模型

Daniyel Ayupov, Artur Markov-Tsoy

机构 * DreamForge AI Lab(DreamForge AI实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出DreamForge-World 0.1 Preview,一种基于自回归视频堆栈和残差动作路径的低计算量实时交互世界模型,支持消费级GPU运行和多种交互功能。

Comments Project page: https://trydreamforge.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29820 2026-06-30 cs.LG cs.AI 57%

Dual-Flow Reinforcement Learning with State-Aware Exploration

双流强化学习与状态感知探索

Qijun Li, Zheng Fu, Qi Song, Yifei He, Weitao Zhou, Kun Jiang, Diange Yang

机构 * State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(智能绿色车辆与移动国家重点实验室,清华大学) Tsinghua University-Toyota Joint Center(清华大学-丰田联合中心) Tsinghua University–SAIC GM Wuling Joint Research Center(清华大学-上汽通用五菱联合研究中心)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出Dual-Flow RL框架,利用条件流匹配联合建模回报分布和多模态策略,并引入熵-协方差探索调节器实现状态感知探索,在连续控制任务中达到最优性能。

Comments 12 pages, 6 figures, 1 table. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29384 2026-06-30 cs.CV cs.RO 57%

Event-VLA: Action-Conditioned Event Fusion for Robust Vision-Language-Action Model

Event-VLA: 基于动作条件的事件融合用于鲁棒的视觉-语言-动作模型

Jiaxin Liu, Xun Xu, Zhenhao Zhang, Hanqing Wang, Ruiqi Chen, Shi Chang, Weiyu Guo, Laurent Kneip

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对现有VLA模型在光照变化下鲁棒性不足的问题,提出Event-VLA框架,通过事件流作为光照鲁棒的运动敏感互补观测,利用动作查询路由和门控交叉注意力融合事件信息,提升低光及近黑暗环境下的操作成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14483 2026-06-30 cs.CV 57%

Vivid-VR: Distilling Concepts from Text-to-Video Diffusion Transformer for Photorealistic Video Restoration

Vivid-VR:基于文本到视频扩散变换器的文本概念蒸馏用于逼真视频修复

Haoran Bai, Xiaoxu Chen, Canqian Yang, Zongyao He, Sibin Deng, Ying Chen

机构 * Alibaba Group - Taobao & Tmall Group(阿里巴巴集团 - 淘宝天猫集团)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Vivid-VR,通过文本到视频基础模型生成视频修复方法,利用ControlNet控制生成过程以保持内容一致性。为解决传统微调中的分布偏移问题,提出概念蒸馏策略,通过预训练T2V模型合成带文本概念的训练样本,提升纹理和时间一致性。

Comments Accepted by ICLR 2026; ICLR version of the paper: https://openreview.net/pdf?id=YV5Zgv8pdg

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30318 2026-06-30 cs.RO 50%

Chronos: A Physics-Informed Full-History Framework for Non-Markovian Long-Horizon Manipulation

Chronos: 一种基于物理信息的全历史框架用于非马尔可夫长时域操作

Yulin Zhou, Yimeng Wang, Nengyu Wang, Shaojia Xing, Shiyun Tu, Xiang Li, Jingkai Zhang, Ningbo Jiang, Yuankai Lin, Hua Yang, Xiangrui Zeng, Zhouping Yin

机构 * School of Mechanical Science and Engineering, Huazhong University of Science and Technology(华中科技大学机械科学与工程学院)

专题命中 视频多模态 :multimodal(abstract)

AI总结 针对现有策略依赖马尔可夫假设导致记忆依赖任务失败的问题,提出Chronos框架,将观测历史作为策略潜状态,通过选择性状态空间模型传播因果历史状态,并利用二阶薛定谔桥预测加速度场,在16个模拟和4个真实任务中显著超越基线。

Comments 20 pages, 10 figures. Submitted to IEEE Transactions on Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29028 2026-06-30 cs.RO 50%

Keypose Exploration: Efficient Automatic Trajectory Labelling and Cross-Embodiment Policy Transfer

关键姿态探索:高效的自动轨迹标注与跨实体策略迁移

Yupu Lu, Hang Xu, Yizhou Chen, Jia Pan

机构 * School of Computing and Data Science, The University of Hong Kong, HKSAR(计算与数据科学学院,香港大学,香港特别行政区)

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出结合视觉语言模型与经典轨迹分析的关键姿态自动标注流程,并利用关键姿态引导扩散策略实现零样本跨实体迁移。

Comments Accepted by IROS2026. Code available at: https://github.com/YupuLu/keypose_labelling

详情

展开后加载摘要…

URL PDF HTML 收藏