arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-13 至 2026-07-13 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 5 篇

2408.12322 2026-07-13 cs.CV 版本更新 88%

Zero-shot 3D General Obstacle Detection via Multimodal Foundation Models and Geometry

通过多模态基础模型和几何进行零样本3D通用障碍物检测

Tamás Matuszka, Péter Hajas, Dávid Szeghy

机构 * aiMotive

专题命中 视频多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV

AI总结 针对自动驾驶中通用障碍物检测难题,提出结合多模态基础模型与几何推理的免训练零样本方法,能精准定位达100米,借基础模型先验提升召回率,还可实现可扩展自动标注。

Comments Accepted to CVPR 2026 AUTOPILOT Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09417 2026-07-13 cs.CV cs.AI 新提交 81%

SVF-CR: Synchronized Visual-Facial Cross-Refinement for Multimodal Ambivalence and Hesitancy Recognition

SVF-CR:用于多模态矛盾心理和犹豫识别的同步视觉-面部交叉细化

Hyein Park, Namho Kim, Junhwa Kim

机构 * Konyang University(公州大学) Korean Broadcasting System (KBS)(韩国广播公司)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究多模态矛盾心理和犹豫识别,提出SVF-CR框架,通过提取视频和面部令牌,经多种注意力机制细化,构建视觉-面部证据并融合文本、声学特征,实验证明该框架提升了公共宏F1。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29943 2026-07-13 cs.CV 版本更新 79%

Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting

EC-Bench:超长视频的枚举与计数基准

Fumihiko Tsuchiya, Taiki Miyanishi, Shunsuke Yasuki, Mahiro Ukai, Nakamasa Inoue, Shuhei Kurita, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo, Japan(东京大学) Institute of Science Tokyo, Japan(东京科学大学) National Institute of Informatics, Japan(国立信息学研究所)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 EC-Bench针对超长视频的枚举与计数问题,通过152部超过30分钟的视频和1699个查询,评估多模态大语言模型的性能,揭示模型在时间推理和计数任务中的局限性。

Comments The first two authors are equally contributed. The data and code are publicly available at: https://github.com/matsuolab/EC-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09114 2026-07-13 cs.CV cs.AI cs.MM 新提交 78%

Event Stream based Multi-Modal Video Anomaly Detection: A Benchmark Dataset and Algorithms

基于事件流的多模态视频异常检测:一个基准数据集和算法

Peipei Zhu, Yueqing Niu, Lin Zhu, Guanchong Niu, Yang Yu, Zheng Li

机构 * College of Pharmaceutical Engineering of Traditional Chinese Medicine, Tianjin University of Traditional Chinese Medicine(天津中医药大学中药制药工程学院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Guangzhou Institute of Technology, Xidian University(西安电子科技大学广州研究院) State Key Laboratory of Component-based Chinese Medicine, Tianjin University of Traditional Chinese Medicine(天津中医药大学组分中药国家重点实验室)

专题命中 视频多模态 :multi-modal(title);分类 cs.CV、cs.AI、cs.MM

AI总结 该研究针对视频异常检测在复杂条件下的局限性,提出EVAD框架,利用事件相机与传统视频。构建大规模基准数据集,设计对比多模态预训练框架及自适应融合模块,实验验证了该方法在现实场景中检测VAD的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09234 2026-07-13 cs.RO 新提交 50%

Implicit-Behavior Coordination from Unlabeled Sub-Task Demonstrations for Rearrangement Tasks

基于未标记子任务演示的重排任务隐式行为协调

Ahmed Shokry, Usama Ahmed Siddiquie, Sicong Pan, Maren Bennewitz

机构 * Humanoid Robots Lab and Center for Robotics, University of Bonn(人形机器人实验室及机器人技术中心,波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 研究长期机器人重排任务,提出基于未标记子任务演示的隐式行为协调方法,通过价值引导动作选择学习类技能行为,实验表明该方法在复杂任务中表现优,能处理更大行为库,为显式技能管道提供替代。

详情

展开后加载摘要…

URL PDF HTML 收藏