arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

University of Science and Technology of China(中国科学技术大学)

2026-03-13 至 2026-03-13 共收录 5
2603.12108 2026-03-13 cs.CV

EvoTok: A Unified Image Tokenizer via Residual Latent Evolution for Visual Understanding and Generation

EvoTok:通过残差潜在进化实现统一的图像分词器用于视觉理解和生成

Yan Li, Ning Liao, Xiangyu Zhao, Shaofeng Zhang, Xiaoxing Wang, Yifan Yang, Junchi Yan, Xue Yang

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Corporation(微软公司)

AI总结 EvoTok通过残差潜在进化统一图像理解和生成,实现高效视觉表征建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11607 2026-03-13 cs.CV

DyWeight: Dynamic Gradient Weighting for Few-Step Diffusion Sampling

DyWeight: 动态梯度加权用于少步扩散采样

Tong Zhao, Mingkun Lei, Liangyu Yuan, Yanming Yang, Chenxi Song, Yang Wang, Beier Zhu, Chi Zhang

机构 * Zhejiang University(浙江大学) AGI Lab, Westlake University(西湖大学AGI实验室) TongJi University(同济大学) University of Science and Technology of China(中国科学技术大学)

AI总结 DyWeight通过动态梯度加权方法,提高了扩散采样效率,实现更少的函数评估和更稳定的生成效果。

Comments Code Link: see AGI-Lab/DyWeight" target="_blank" rel="noopener">https://github.com/Westlake-AGI-Lab/DyWeight

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11306 2026-03-13 cs.CV

Hierarchical Granularity Alignment and State Space Modeling for Robust Multimodal AU Detection in the Wild

层次粒度对齐与状态空间建模用于野外多模态面部动作单元检测

Jun Yu, Yunxiang Zhang, Naixiang Zheng, Lingsi Zhu, Guoyuan Wang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出了一种基于层次粒度对齐和状态空间模型的多模态框架,通过强大的基础模型提取高保真视觉和音频表示,并引入视觉-马尔可夫模型和不对称交叉注意机制,实现对野外环境中面部动作单元的高效检测。

Comments 8 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18463 2026-03-13 cs.CV

Decoupling Perception from Reasoning for Hallucination-Resistant Video Understanding

解耦感知与推理以实现抗幻觉的视频理解

Bowei Pu, Chuanbin Liu, Yifan Ge, Peicheng Zhou, Yiwei Sun, Zhiying Lu, Zhangchi Hu, Hongtao Xie

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出DPL模型,通过解耦感知与推理以提升视频理解的抗幻觉能力,引入感知奖励和FAE评估器,有效提高训练后性能和数据效率。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19459 2026-03-13 cs.LG cs.AI

Your Classifier Can Do More: Towards Balancing the Gaps in Classification, Robustness, and Generation

你的分类器可以做更多:朝着平衡分类、鲁棒性和生成之间的差距

Kaichao Jiang, He Wang, Xiaoshuai Hao, Xiulong Yang, Ajian Liu, Qi Chu, Yunfeng Diao, Richang Hong

机构 * Hefei University of Technology, China(合肥工业大学,中国) Jianghuai Advance Technology Center, China(江淮先进科技中心,中国) Anhui Provincial Key Laboratory of Humanoid Robots, China(安徽省人形机器人重点实验室,中国) AI Centre, University College London, UK(伦敦大学学院人工智能中心,英国) Xiaomi EV, China(小米电动车,中国) Central China Normal University, China(中部师范大学,中国) Institute of Automation, Chinese Academy of Sciences, China(中国科学院自动化研究所,中国) University of Science and Technology of China, China(中国科学技术大学,中国)

AI总结 EB-JDAT通过统一生成、判别和鲁棒性,实现分类、鲁棒性和生成能力的平衡,达到新的权衡前沿。

Comments accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏