arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-01 至 2026-05-01 共收录 12 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 12 篇

2604.28001 2026-05-01 cs.AI cs.SE 70%

A Pattern Language for Resilient Visual Agents

面向鲁棒视觉代理的模式语言

Habtom Kahsay Gidey, Alexander Lenz, Alois Knoll

专题命中 视频多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 本文提出一种模式语言,用于在企业生态系统中整合多模态基础模型,平衡视觉语言动作模型的延迟与非确定性与企业控制循环的严格确定性和实时性要求。

Comments Accepted to the 23rd International Conference on Software Architecture (ICSA 2026), New and Emerging Ideas Track. 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28007 2026-05-01 q-bio.NC 67%

Multisensory learning recruits visual neurons into an olfactory memory engram

多感官学习招募视觉神经元进入嗅觉记忆表征

Zeynep Okray, Nils Otto, Anna A. Cook, Clifford Talbot, Ashwin Miriyala, Martín Klappenbach, Ciara Stern, Kieran Desmond, Paola Vargas-Gutierrez, Scott Waddell

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 研究揭示多感官学习通过扩大记忆表征提升记忆表现,核心方法涉及视觉神经元与嗅觉记忆的连接,主要贡献是发现多感官训练增强记忆表达的机制。

Comments 24 pages, 9 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07180 2026-05-01 cs.CL cs.AI cs.CV 67%

Flattery in Motion: Benchmarking and Analyzing Sycophancy in Video-LLMs

视频中的奉承:视频大语言模型中奉承行为的基准测试与分析

Wenrui Zhou, Mohamed Hendy, Shu Yang, Qingsong Yang, Zikun Guo, Yuyu Luo, Lijie Hu, Di Wang

机构 * Provable Responsible AI and Data Analytics (PRADA) Lab(可证负责任人工智能与数据 analytics 实验室) King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹科学与技术大学) HKUST(香港科技大学) MBZUAI(穆罕默德·本·拉希德人工智能研究所) University of Science and Technology of China(中国科学技术大学) Kyungpook National University(庆尚国立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出VISE基准,用于评估视频大语言模型在面对误导性输入时的奉承行为,通过多类型分析和两种无训练缓解策略提升模型可靠性。

Comments 27 Pages, Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27591 2026-05-01 cs.CV cs.AI 62%

ClipTBP: Clip-Pair based Temporal Boundary Prediction with Boundary-Aware Learning for Moment Retrieval

ClipTBP:基于剪辑对的时序边界预测:面向时刻检索的边界感知学习

Ji-Hyeon Kim, Ho-Joong Kim, Seong-Whan Lee

机构 * Dept. of Artificial Intelligence, Korea University, Seoul(人工智能系,韩国大学,首尔)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ClipTBP框架,通过边界感知学习解决视频时刻检索中多段答案与查询的语义关系建模问题,提升时序边界预测的鲁棒性。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25186 2026-05-01 cs.CV cs.CE cs.MM 62%

FCMBench-Video: Benchmarking Document Video Intelligence

FCMBench-Video:文档视频智能基准测试

Runze Cui, Fangxin Shang, Yehui Yang, Qing Yang, Yanwu Xu, Tao Chen

机构 * AI Lab, Qifu Technology(启赋科技AI实验室) College of Future Information Technology, Fudan University(复旦大学未来信息学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院) Pazhou Lab(琶洲实验室)

专题命中 视频多模态 :MLLM(abstract);分类 cs.CV、cs.MM

AI总结 本文提出FCMBench-Video基准测试,用于评估文档视频理解中的文档感知、时间定位和证据推理能力,通过真实场景数据验证系统性能,揭示不同任务的敏感性和能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27445 2026-05-01 cs.CV 57%

Context as Prior: Bayesian-Inspired Intent Inference for Non-Speaking Agents with a Household Cat Testbed

上下文作为先验:一种基于贝叶斯的意图推断方法用于非说话智能体的家用猫测试平台

Wenqian Zhang, Zehao Wang

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出CatSignal框架,通过将空间上下文作为先验约束和行为观测作为证据,实现多模态意图推断,提升非说话智能体的意图识别精度。

Comments Accepted to the CVPR 2026 Animal Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21479 2026-05-01 cs.CV 57%

Frozen LLMs as Map-Aware Spatio-Temporal Reasoners for Vehicle Trajectory Prediction

冻结的大语言模型作为具有地图意识的时空推理器用于车辆轨迹预测

Yanjiao Liu, Jiawei Liu, Xun Gong, Zifei Nie

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出利用冻结的大语言模型作为时空推理器,通过交通编码器提取轨迹特征并结合轻量CNN处理地图信息,评估LLM在动态交通代理行为和道路拓扑理解中的能力,提升轨迹预测的准确性与泛化性。

Comments Accepted for publication at IEEE Intelligent Vehicles Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08418 2026-05-01 cs.LG cs.AI 57%

Taxon: Hierarchical Tax Code Prediction with Semantically Aligned LLM Expert Guidance

Taxon: 基于语义对齐的LLM专家指导的层级税码预测

Jihang Li, Qing Liu, Zulong Chen, Jing Wang, Wei Wang, Chuanfei Xu, Zeyi Wen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Group(阿里巴巴集团) Guangdong Laboratory of Artificial Intelligence and Digital Economy (Shenzhen)(广东人工智能与数字经济实验室(深圳))

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出Taxon框架,通过语义对齐和专家指导实现层级税码预测,结合多专家架构和语义一致性模型,在实际业务中提升准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07645 2026-05-01 cs.RO 50%

From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback

从动作标签到集合:重新思考基于纠正反馈的模仿学习中的动作监督

Zhaoting Li, Rodrigo Pérez-Dattari, Robert Babuska, Cosimo Della Santina, Jens Kober

机构 * Delft University of Technology, The Netherlands(代尔夫特理工大学,荷兰) KTH, Sweden(瑞典皇家理工学院) University of Stuttgart, Germany(斯图加特大学)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出CLIC方法,通过将点状监督替换为集合值动作目标,提升在不准确反馈下的模仿学习效果,实验表明其在不同场景下具有更高的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27508 2026-05-01 cs.RO 50%

SASI: Leveraging Sub-Action Semantics for Robust Early Action Recognition in Human-Robot Interaction

SASI:利用子动作语义实现人机交互中鲁棒的早期动作识别

Yongpeng Cao, Masahiro Hirano, Hyuno Kim, Yuji Yamakawa

机构 * Institute of Industrial Science, The University of Tokyo(东京大学工业科学研究所) Interfaculty Initiative in Information Studies, Graduate School of Interdisciplinary Information Studies, The University of Tokyo(东京大学跨学际信息研究学院信息研究联合计划)

专题命中 视频多模态 :cross-modal(abstract)

AI总结 本文提出SASI框架,通过融合时空特征与子动作语义提升人机交互中早期动作识别的鲁棒性,实验表明其在识别精度和部分动作序列理解方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27497 2026-05-01 cs.CR cs.CY 50%

SST-Guard: Detecting and Characterizing Server-Side Google Analytics in the Wild

SST-Guard:检测和表征野外的服务器端Google Analytics

Muhammad Jazlan, Alexander Gamero-Garrido, Zubair Shafiq, Yash Vekaria

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出SST-Guard系统,通过多模态方法检测和阻止服务器端Google Analytics,通过匹配语义值模式提高检测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27131 2026-05-01 cs.IR 50%

LLM-Enhanced Topical Trend Detection at Snapchat

基于大语言模型的Snapchat话题趋势检测

Hangqi Zhao, Jay Li, Abhiruchi Bhattacharya, Cong Ni, Jason Yeung, Jinchao Ye, Kai Yang, Akshat Malu, Manish Malik

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出一个大规模系统,利用多模态主题提取、时间序列爆发检测和大语言模型进行整合与丰富,实现Snapchat上新兴话题趋势的准确及时发现,首次在短视频平台实现生产级话题趋势检测系统。

详情

展开后加载摘要…

URL PDF HTML 收藏