arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-03-20 至 2026-03-20 共收录 11
2603.19232 2026-03-20 cs.CV

Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens

三次离散扩散:高维表示上的离散视觉生成

Yuqing Wang, Chuofan Ma, Zhijie Lin, Yao Teng, Lijun Yu, Shuai Wang, Jiaming Han, Jiashi Feng, Yi Jiang, Xihui Liu

机构 * University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子) Carnegie Mellon University(卡内基梅隆大学) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出CubiD,首个高维表示离散生成模型,通过精细掩码实现高维离散表示的生成,具备固定步数的生成能力,且在ImageNet-256上达到SOTA性能,验证离散token保留原始表示能力。

Comments Accepted by CVPR 2026 main track; Code: https://github.com/YuqingWang1029/CubiD

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19227 2026-03-20 cs.CV

Bridging Semantic and Kinematic Conditions with Diffusion-based Discrete Motion Tokenizer

通过扩散基离散运动分词器弥合语义与运动条件

Chenyang Gu, Mingyuan Zhang, Haozhe Xie, Zhongang Cai, Lei Yang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出三阶段框架,结合连续扩散模型与离散分词生成器,通过MoTok分词器实现语义与运动控制的结合,提升运动生成的可控性与保真度。

Comments Project Page: https://rheallyc.github.io/projects/motok GitHub: https://github.com/rheallyc/MoTok

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19206 2026-03-20 cs.CV

RPiAE: A Representation-Pivoted Autoencoder Enhancing Both Image Generation and Editing

RPiAE:一种基于表示的自编码器,同时增强图像生成和编辑

Yue Gong, Hongyu Li, Shanyuan Liu, Bo Cheng, Yuhang Ma, Liebucha Wu, Xiaoyu Wu, Manyuan Zhang, Dawei Leng, Yuhui Yin, Lijun Zhang

机构 * Beihang University(北航大学) AI Research(360人工智能研究院) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出RPiAE,一种基于表示的自编码器,通过引入表示偏转正则化和变分桥梁,提升图像生成和编辑的性能,实验表明其在文本到图像生成和图像编辑中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19191 2026-03-20 cs.AI

OS-Themis: A Scalable Critic Framework for Generalist GUI Rewards

OS-Themis:一种可扩展的通用GUI奖励批评框架

Zehao Li, Zhenyu Wu, Yibo Zhao, Bowen Yang, Jingjing Xie, Zhaoyang Liu, Zhoumianze Liu, Kaiming Jin, Jianze Liang, Zonglin Li, Feng Wu, Bowen Zhou, Zun Wang, Zichen Ding

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) CUHK MMLab(香港中文大学多模态实验室) The Hong Kong University of Science and Technology(香港科学大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出OS-Themis框架,通过分解轨迹为可验证里程碑并采用审核机制,提升GUI奖励的可扩展性和准确性,实验表明其在AndroidWorld中提升了在线强化学习和轨迹验证的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18899 2026-03-20 cs.LG math.OC

Uniform a priori bounds and error analysis for the Adam stochastic gradient descent optimization method

Adam随机梯度下降优化方法的统一先验界和误差分析

Steffen Dereich, Thang Do, Arnulf Jentzen

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(数据科学学院,香港中文大学(深圳)) Department of Probability and Statistic, Institute of Mathematics, Vietnam Academy of Science and Technology(概率与统计系,数学研究所,越南科学与技术 academy) School of Data Science and School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(数据科学学院和人工智能学院,香港中文大学(深圳))

AI总结 本文首次为强凸随机优化问题建立Adam方法的统一先验界,提供无条件误差分析。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18764 2026-03-20 cs.CV

ProCal: Probability Calibration for Neighborhood-Guided Source-Free Domain Adaptation

ProCal:基于邻域的源无关领域适应的概率校准

Ying Zheng, Yiyi Zhang, Yi Wang, Lap-Pui Chau

机构 * The JC STEM Lab of Machine Learning and Computer Vision(机器学习与计算机视觉的JC STEM实验室) Department of Electrical and Electronic Engineering(电气与电子工程系) The Hong Kong Polytechnic University(香港理工大学) Department of Computer Science and Engineering(计算机科学与工程系) The Chinese University of Hong Kong(香港中文大学)

AI总结 ProCal通过双模型协作预测机制动态校准邻域预测,缓解局部噪声干扰并保留源模型判别信息,提升领域适应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18655 2026-03-20 cs.CV cs.AI

Multiscale Switch for Semi-Supervised and Contrastive Learning in Medical Ultrasound Image Segmentation

多尺度开关用于医学超声图像分割中的半监督和对比学习

Jingguo Qu, Xinyang Han, Yao Pu, Man-Lik Chui, Simon Takadiyi Gunda, Ziman Chen, Jing Qin, Ann Dorothy King, Winnie Chiu-Wing Chu, Jing Cai, Michael Tin-Cheung Ying

机构 * Department of Health Technology and Informatics, The Hong Kong Polytechnic University(健康科技与信息学系,香港理工大学) Centre for Smart Health and School of Nursing, The Hong Kong Polytechnic University(智能健康中心及护理学院,香港理工大学) Department of Imaging and Interventional Radiology, The Chinese University of Hong Kong(影像与介入放射科,香港中文大学)

AI总结 本文提出Switch框架,通过多尺度开关和频域开关提升医学超声图像分割的半监督和对比学习效果,在低标注率下取得显著Dice系数提升。

Comments This is the author-submitted LaTeX version with original typesetting. The final published version (with IEEE production formatting and layout changes) is available at http://doi.org/10.1109/TNNLS.2026.3669814 under CC BY 4.0 license

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19529 2026-03-20 cs.RO

RhoMorph: Rhombus-shaped Deformable Modular Robots for Stable, Medium-Independent Reconfiguration Motion

RhoMorph:菱形变形模块化机器人用于稳定、介质无关的重新配置运动

Jie Gu, Yirui Sun, Zhihao Xia, Tin Lun Lam, Chunxu Tian, Dan Zhang

机构 * Institute of AI and Robotics, Academy for Engineering & Technology, Fudan University(人工智能与机器人研究院,工程与技术学院,复旦大学) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(科学与工程学院,香港中文大学(深圳)) Shenzhen Institute of Artificial Intelligence and Robotics for Society(社会人工智能与机器人研究所) Department of Mechanical Engineering, The Hong Kong Polytechnic University(机械工程系,香港理工大学)

AI总结 本文提出RhoMorph,一种新型可变形平面晶格自重构机器人,通过菱形模块实现稳定、介质无关的重新配置运动,采用简单控制策略实现形态变换、对接和移动等功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26642 2026-03-20 cs.RO

MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation

MLA:一种多感官语言-动作模型,用于机器人操作中的多模态理解和预测

Zhuoyang Liu, Jiaming Liu, Jiadong Xu, Nuowei Han, Chenyang Gu, Hao Chen, Kaichen Zhou, Renrui Zhang, Kai Chin Hsieh, Kun Wu, Zhengping Che, Jian Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Beijing Innovation Center of Humanoid Robotics (X-Humanoid)(北京类人机器人创新中心(X-Humanoid)) The Chinese University of Hong Kong (CUHK)(香港中文大学(CUHK))

AI总结 本文提出MLA模型,通过多感官融合与未来目标预测,提升机器人在复杂接触任务中的操控能力,实验显示其在2D和3D任务中性能优于现有方法。

Comments Project page: https://robotic-mla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02460 2026-03-20 cs.CV

GenCompositor: Generative Video Compositing with Diffusion Transformer

GenCompositor:基于扩散变换器的生成视频合成

Shuzhou Yang, Xiaoyu Li, Xiaodong Cun, Guangzhi Wang, Lingen Li, Ying Shan, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省超高清沉浸媒体技术重点实验室) GVC Lab, Great Bay University(Great Bay大学GVC实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出GenCompositor,通过扩散变换器实现自动化视频合成,解决传统方法劳动强度大、成本高的问题,提出轻量背景保存分支、动态元素融合块和ERoPE位置嵌入等创新方法,构建VideoComp数据集并验证方法有效性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13387 2026-03-20 cs.CV

TR2M: Transferring Monocular Relative Depth to Metric Depth with Language Descriptions and Dual-Level Scale-Oriented Contrast

TR2M: 通过语言描述和双级尺度导向对比转移单目相对深度到度量深度

Beilei Cui, Yiming Huang, Long Bai, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出TR2M框架,通过语言描述和图像输入,利用双级尺度导向对比学习,解决相对深度到度量深度的转换问题,实现跨域的零样本性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏