arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

2026-06-08 至 2026-06-08 共收录 6
2606.07496 2026-06-08 cs.LG math.OC 新提交

Accelerated Decentralized Stochastic Gradient Descent for Strongly Convex Optimization

加速去中心化随机梯度下降用于强凸优化

Ming Sun, Kun Yuan

机构 * Center for Machine Learning Research Peking University(机器学习研究中心北京大学)

AI总结 提出MG-ADSGD算法,结合Nesterov型原始-对偶外推与多轮快速八卦平均,通过耦合八卦深度与小批量大小,同时实现加速收敛和通信高效,达到最优通信复杂度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07433 2026-06-08 cs.CV cs.AI cs.MM 新提交

Watch, Remember, Reason: Human-View Video Understanding with MLLMs

Watch, Remember, Reason: 基于多模态大语言模型的人类视角视频理解

Jiahao Meng, Yue Tan, Qi Xu, Kuan Gao, Weisong Liu, Yanwei Li, Jason Li, Lingdong Kong, Haochen Wang, Qianyu Zhou, Jiangning Zhang, Guangliang Cheng, Yunhai Tong, Lu Qi, Minghsuan Yang

机构 * School of Intelligence Science and Technology, Peking University(北京理工大学智能科学与技术学院) Wuhan University(武汉大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) CASIA(中国科学院自动化研究所) University of Tokyo(东京大学) University of Liverpool(利物浦大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) UC Merced(加州大学默塞德分校)

AI总结 提出人类视角下视频理解的三个功能能力(观看、记忆、推理),构建统一框架分析视频MLLM的感知、记忆、推理和预测,并总结挑战、方法、应用及未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06953 2026-06-08 cs.RO 新提交

LIMMT: Less is More for Motion Tracking

LIMMT:少即是多的运动追踪

Yu Guan, Zekun Qi, Chenghuai Lin, Xuchuan Chen, Dairu Liu, Wenyao Zhang, Jilong Wang, Xinqiang Yu, He Wang, Li Yi

机构 * Tsinghua University(清华大学) GalBot Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Shanghai Qi Zhi Institute(上海启智研究院)

AI总结 提出数据驱动的运动追踪框架LIMMT,通过物理可行性、多样性和复杂性三维度筛选高质量运动数据,仅用AMASS的3%数据即可超越全量训练效果。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06890 2026-06-08 cs.CV cs.LG 新提交

Diagnosing Visual Ignorance in Vision-Language Models

诊断视觉语言模型中的视觉忽视

Runyu Zhou, Qi Zhang, Qixun Wang, Yisen Wang

机构 * Peking University(北京大学)

AI总结 研究视觉语言模型依赖语言先验的内部机制,通过层替换和探针分析揭示多阶段瓶颈,并引入渐进视觉退化指标发现基准测试可能奖励视觉忽视。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06853 2026-06-08 cs.CV cs.AI 新提交

MotionEnhancer: Leveraging Video Diffusion for Motion-Enhanced Vision-Language Models

MotionEnhancer: 利用视频扩散模型增强运动感知的视觉-语言模型

Yifan Xu, Chao Zhang, Ruifei Ma, Fei Gao, Zhifei Yang, Jiaxing Qi, Zhipeng Chen

机构 * School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Beijing Digital Native Digital City Research Center(北京数字原生数字城研究中心) School of Computer Science, Peking University(北京大学计算机学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)

AI总结 提出MotionEnhancer,通过从视频扩散模型中提取运动先验并利用注意力对齐增强视觉-语言模型的运动理解能力,无需额外参数或架构修改,在运动级视频理解基准上取得一致提升。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06532 2026-06-08 cs.CV 新提交

GOPAgen: Motion-Aware and Efficient Agentic Long-Video Understanding with Structural Memory and Hierarchical Reasoning

GOPAgen: 基于结构记忆与层次推理的运动感知高效智能长视频理解

Haozhe Chi, Yang Jin, Yadong Mu

机构 * Peking University(北京大学)

AI总结 提出GOPAgen方法,通过视频编解码的GOP运动代理、GOP树推理算法和结构记忆机制,实现高效长视频理解,在多个VQA基准上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏