arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Zhejiang University(浙江大学)

2026-03-30 至 2026-03-30 共收录 8
2603.26586 2026-03-30 cs.CV

MA-Bench: Towards Fine-grained Micro-Action Understanding

MA-Bench:迈向细粒度微动作理解

Kun Li, Jihao Gu, Fei Wang, Zhiliang Wu, Hehe Fan, Dan Guo

机构 * CVLab, College of Information Technology, United Arab Emirates University(阿拉伯联合酋长国大学信息技术学院CVLab) University College London(伦敦大学学院) Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) CCAI, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

AI总结 本文提出MA-Bench基准,包含1000个视频和三级评估架构,系统评估微动作识别与解释,通过23个MLLM的实验发现微动作细粒度理解存在挑战,并构建MA-Bench-Train训练集提升模型性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26328 2026-03-30 cs.CV

Verify Claimed Text-to-Image Models via Boundary-Aware Prompt Optimization

通过边界感知提示优化验证声称的文本到图像模型

Zidong Zhao, Yihao Huang, Qing Guo, Tianlin Li, Anran Li, Kailong Wang, Jin Song Dong, Geguang Pu

机构 * Zhejiang University(浙江大学) East China Normal University(华东师范大学) Nankai University(南开大学) Beihang University(北京航空航天大学) University of Science and Technology of China(中国科学技术大学) Huazhong University of Science and Technology(华中科技大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出边界感知提示优化方法,通过识别模型特定的边界相邻提示来验证文本到图像模型的真实性,实验显示其验证准确率优越。

Comments Accepted to CVPR 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26192 2026-03-30 cs.CV

HAD: Heterogeneity-Aware Distillation for Lifelong Heterogeneous Learning

HAD:面向终身异质学习的异质性感知知识蒸馏

Xuerui Zhang, Xuehao Wang, Zhan Zhuang, Linglan Zhao, Ziyue Li, Xinmin Zhang, Zhihuan Song, Yu Zhang

机构 * Southern University of Science and Technology(南方科技大学) Zhejiang University(浙江大学) Technical University of Munich(慕尼黑工业大学) City University of Hong Kong(香港城市大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出HAD方法,用于解决终身异质学习中异质知识保留问题,通过两种互补损失函数提升预测分布平衡性和信息边缘像素学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20778 2026-03-30 cs.CV

PiLoT: Neural Pixel-to-3D Registration for UAV-based Ego and Target Geo-localization

PiLoT:基于无人机的自主与目标地理定位的神经像素到3D注册

Xiaoya Cheng, Long Wang, Yan Liu, Xinyi Liu, Hanlin Tan, Yu Liu, Maojun Zhang, Shen Yan

机构 * National University of Defense Technology(国防科技大学) Zhejiang University(浙江大学) Westlake University(西湖大学) Hangzhou Dianzi University(杭州电子科技大学)

AI总结 PiLoT提出一个统一框架,通过直接将实时视频流与地理参考3D地图进行注册,解决无人机自主与目标定位问题,采用双线程引擎、大规模合成数据集和联合神经引导随机梯度优化器,实现高精度实时性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09435 2026-03-30 cs.CV

UniPart: Part-Level 3D Generation with Unified 3D Geom-Seg Latents

UniPart: 部级3D生成与统一3D几何-分割潜在表示

Xufan He, Yushuang Wu, Xiaoyang Guo, Chongjie Ye, Jiaqing Zhou, Tianlei Hu, Xiaoguang Han, Dong Du

机构 * Nanjing University of Science and Technology(南京理工大学) ByteDance Games(字节跳动游戏) Zhejiang University(浙江大学) FNii-Shenzhen(深圳福田国家创新研究院) SSE, CUHKSZ(香港中文大学(深圳)理工学院) Guangdong Provincial Key Laboratory of Future Networks of Intelligence(广东省未来智能网络重点实验室)

AI总结 本文提出UniPart,一种基于统一3D几何-分割潜在表示的两阶段扩散框架,实现图像引导的部级3D生成,提升分割可控性和几何质量。

Comments Project page: https://xfanhe.github.io/projects/unipart/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11647 2026-03-30 cs.CV

IVEBench: Modern Benchmark Suite for Instruction-Guided Video Editing Assessment

IVEBench:现代指令引导视频编辑评估基准套件

Yinan Chen, Jiangning Zhang, Teng Hu, Yuxiang Zeng, Zhucun Xue, Qingdong He, Chengjie Wang, Yong Liu, Xiaobin Hu, Shuicheng Yan

机构 * Zhejiang University(浙江大学) Tencent Youtu Lab(腾讯优图实验室) Shanghai Jiao Tong University(上海交通大学) University of Auckland(奥克兰大学) National University of Singapore(新加坡国立大学)

AI总结 IVEBench通过引入多样化的视频数据库和多维评估协议,解决现有视频编辑基准在评估指令引导视频编辑方面的不足,提供全面的人类对齐评估结果。

Comments Accepted by ICLR 2026. Equal contributions from first two authors. Project page: https://ryanchenyn.github.io/projects/IVEBench Code: https://github.com/RyanChenYN/IVEBench Dataset: https://huggingface.co/datasets/Coraxor/IVEBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00181 2026-03-30 cs.CV cs.AI

Uncovering What, Why and How: A Comprehensive Benchmark for Causation Understanding of Video Anomaly

揭示是什么、为什么和如何:面向视频异常因果理解的全面基准

Hang Du, Sicheng Zhang, Binzhu Xie, Guoshun Nan, Jiayang Zhang, Junrui Xu, Hangyu Liu, Sicong Leng, Jiangming Liu, Hehe Fan, Dajiu Huang, Jing Feng, Linli Chen, Can Zhang, Xuhuan Li, Hao Zhang, Jianhang Chen, Qimei Cui, Xiaofeng Tao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Queen Mary University of London(伦敦玛丽女王大学) Nanyang Technological University(南洋理工大学) Yunnan University(云南大学) Zhejiang University(浙江大学) China Telecom Co., Ltd. Sichuan Branch(中国电信股份有限公司四川分公司)

AI总结 本文提出CUVA基准,通过三种人类标注解决视频异常的'what'、'why'和'how'问题,并引入MMEval评估指标和基于提示的方法,验证其在异常因果理解中的有效性。

Comments Accepted in CVPR2024, Codebase: https://github.com/fesvhtr/CUVA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25767 2026-03-30 cs.SD cs.AI eess.AS

Unlocking Strong Supervision: A Data-Centric Study of General-Purpose Audio Pre-Training Methods

解锁强监督:面向通用音频预训练方法的数据导向研究

Xuanru Zhou, Yiwen Shao, Wei-Cheng Tseng, Dong Yu

机构 * Zhejiang University(浙江大学) Tencent AI Lab(腾讯AI实验室) UT-Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出通过高质量数据构建强监督框架,对比不同预训练目标,发现数据质量和覆盖范围是性能关键因素,目标选择决定下游任务专精。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏