arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Beihang University(北京航空航天大学)

2026-05-25 至 2026-05-25 共收录 6
2605.23856 2026-05-25 cs.RO

Point Tracking Improves World Action Models

点跟踪改进了世界动作模型

Jiarui Guan, Wenshuai Zhao, Yue Pei, Ziliang Chen, Arno Solin, Juho Kannala

机构 * Aalto University(阿alto大学) ELLIS Institute Finland(ELLIS研究所芬兰) University of Oulu(奥卢大学) Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) Beihang University(北京航空航天大学)

AI总结 提出联合像素与跟踪的世界动作模型JOPAT,通过预测2D点跟踪和动作来提升机器人策略学习,在长时域、遮挡和离屏运动任务上优于纯像素方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20901 2026-05-25 cs.CV

Benchmarking and Enhancing VLM for Compressed Image Understanding

基准测试与增强VLM对压缩图像的理解

Zifu Zhang, Tongda Xu, Siqi Li, Shengxi Li, Yue Zhang, Mai Xu, Yan Wang

机构 * Institute for AI Industry Research, Tsinghua University, Beijing, China(清华人工智能产业研究院) Beihang University, Beijing, China(北京航空航天大学) Beijing University of Technology, Beijing, China(北京理工大学)

AI总结 本文提出首个全面基准测试评估VLM对压缩图像的理解能力,分析性能差距来源,并设计通用适配器提升模型性能10%-30%。

Comments The paper is accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23355 2026-05-25 cs.CV cs.LG cs.MM

Decoupling Spatio-Temporal Adapter for Fine-Grained Badminton Action Localization

解耦时空适配器用于细粒度羽毛球动作定位

Tianyu Wang, Junjie Wu, Jingquan Gao, Shishuo Li

机构 * School of Economics and Management, Beihang University(北京航空航天大学经济管理学院) Key Laboratory of Data Intelligence and Management, Beihang University, Ministry of Industry and Information Technology(信息产业部北京航空航天大学数据智能与管理重点实验室)

AI总结 针对细粒度羽毛球动作定位中复杂的时空动态,提出解耦时空适配器(DSTA),通过三个并行分支分别建模时间动态、垂直和水平空间变化,在Fine-Badminton数据集和ShuttleSet基准上实现最优性能且计算开销极小。

Comments 11 pages, 11figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13596 2026-05-25 cs.CV

VGGT-Segmentor: Geometry-Enhanced Cross-View Segmentation

VGGT-Segmentor: 几何增强的跨视角分割

Yulu Gao, Bohao Zhang, Zongheng Tang, Jitong Liao, Wenjun Wu, Si Liu

机构 * Hangzhou International Innovation Institute of Beihang University(北航杭州国际创新研究院) Beihang University(北京航空航天大学)

AI总结 针对不同视角下的实例分割难题,提出VGGT-Segmentor框架,结合VGGT的几何建模与新型Union分割头,通过掩码提示融合、点引导预测和迭代细化实现像素精确分割,并采用单图像自监督训练,在Ego-Exo4D基准上达到新最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18176 2026-05-25 cs.CL

Improving Sampling for Masked Diffusion Models via Information Gain

通过信息增益改进掩码扩散模型的采样

Kaisen Yang, Jayden Teoh, Kaicheng Yang, Yitong Zhang, Alex Lamb

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Massachusetts Institute of Technology(麻省理工学院) Shanghai Jiao Tong University(上海交通大学) Beihang University(北航) College of AI, Tsinghua University(清华大学人工智能学院)

AI总结 提出一种无需训练的Info-Gain采样器,利用掩码扩散模型的双向结构平衡即时不确定性与剩余掩码位置的信息增益,在推理、编码、创意写作和图像生成任务中优于现有采样器。

Comments https://github.com/yks23/Information-Gain-Sampler Accepted by ICML2026 Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07801 2026-05-25 cs.CV cs.AI

VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos

VideoTemp-o3:在智能视频思考中协调时间定位与视频理解

Wenqi Liu, Yunxiao Wang, Shijie Ma, Meng Liu, Qile Su, Tianke Zhang, Haonan Fan, Changyi Liu, Kaiyu Jiang, Jiankang Chen, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Yinwei Wei, Xuemeng Song

机构 * Shandong University(山东大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beihang University(北航) Southern University of Science and Technology(南方科技大学)

AI总结 提出VideoTemp-o3统一框架,通过联合建模视频定位与问答、设计统一掩码机制和专用奖励,解决长视频理解中采样效率低、定位弱和工作流僵化问题。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏