arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-04 至 2026-03-04 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频数据与评测 2 篇

2602.23823 2026-03-04 cs.CV 79%

APPO: Attention-guided Perception Policy Optimization for Video Reasoning

APPO:基于注意力的视频推理感知策略优化

Henghui Du, Chang Zhou, Xi Chen, Di Hu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing(中国人民大学北京校区人工智能学院) AI Technology Center, Online Video Business Unit, Tencent PCG(腾讯PCG人工智能技术中心)

专题命中 视频数据与评测 :video reasoning(title,abstract);分类 cs.CV

AI总结 APPO通过基于注意力的感知策略优化,利用token级奖励提升视频推理中的细粒度感知能力,有效提高模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19892 2026-03-04 cs.AI 50%

OptMerge: Unifying Multimodal LLM Capabilities and Modalities via Model Merging

OptMerge: 通过模型融合统一多模态大语言模型的能力与模态

Yongxian Wei, Runxi Cheng, Weike Jin, Enneng Yang, Li Shen, Lu Hou, Sinan Du, Chun Yuan, Xiaochun Cao, Dacheng Tao

机构 * Tsinghua University(清华大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学)

专题命中 视频数据与评测 :video-language(abstract)

AI总结 OptMerge通过模型融合统一多模态大语言模型的能力与模态,提出基准和算法提升性能2.48%

详情

展开后加载摘要…

URL PDF HTML 收藏