arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-03-25 至 2026-03-25 共收录 15
2603.23500 2026-03-25 cs.CV

UniGRPO: Unified Policy Optimization for Reasoning-Driven Visual Generation

UniGRPO:用于推理驱动视觉生成的统一策略优化

Jie Liu, Zilyu Ye, Linxiao Yuan, Shenhan Zhu, Yu Gao, Jie Wu, Kunchang Li, Xionghui Wang, Xiaonan Nie, Weilin Huang, Wanli Ouyang

机构 * The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出UniGRPO框架,通过统一强化学习方法优化文本和图像生成策略,解决多轮交错生成问题,提升生成质量与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23414 2026-03-25 cs.LG cs.AI

SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling

SortedRL: 通过在线长度感知调度加速大语言模型的强化学习训练

Yiqi Zhang, Huiqiang Jiang, Xufang Luo, Zhihe Yang, Chengruidong Zhang, Yifei Shen, Dongsheng Li, Yuqing Yang, Lili Qiu, Yang You

机构 * National University of Singapore(新加坡国立大学) Microsoft Research Asia(微软亚洲研究院) The Chinese University of Hong Kong(香港中文大学)

AI总结 SortedRL通过在线长度感知调度策略提升大语言模型强化学习训练效率,减少训练气泡比例并提升性能,实验表明在不同任务中表现优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23390 2026-03-25 cs.CV eess.IV

Harnessing Lightweight Transformer with Contextual Synergic Enhancement for Efficient 3D Medical Image Segmentation

利用轻量级Transformer与上下文协同增强进行高效的3D医学图像分割

Xinyu Liu, Zhen Chen, Wuyang Li, Chenxin Li, Yixuan Yuan

机构 * Department of Electronic Engineering, The Chinese University of Hong Kong, Hong Kong SAR(电子工程系,香港中文大学(深圳)Hong Kong SAR) Centre for Artificial Intelligence and Robotics (CAIR), Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences, Hong Kong SAR(人工智能与机器人中心(CAIR),香港科学与创新研究院,中国科学院,Hong Kong SAR)

AI总结 本文提出Light-UNETR,通过轻量级维度缩减注意力模块和紧凑门控线性单元提升模型效率,结合上下文协同增强策略提高数据效率,在少量标注数据下实现高效3D医学图像分割。

Comments Accepted to IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23355 2026-03-25 cs.LG cs.CL

Off-Policy Value-Based Reinforcement Learning for Large Language Models

为大语言模型设计的非策略价值基于强化学习

Peng-Yuan Wang, Ziniu Li, Tian Xu, Bohan Yang, Tian-Shuo Liu, ChenYang Wang, Xiong-Hui Chen, Yi-Chen Li, Tianyun Yang, Congliang Chen, Yang Yu

机构 * National Key Laboratory for Novel Software Technology & School of Artificial Intelligence, Nanjing University(新型软件技术国家重点实验室 & 智能科学与技术学院,南京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Research Institute of Big Data(大数据研究院(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 本文提出ReVal方法,通过结合步级信号和轨迹级信号提升大语言模型的训练效率,实验表明其在数学推理任务中优于GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17808 2026-03-25 cs.RO cs.AI

EVA: Aligning Video World Models with Executable Robot Actions via Inverse Dynamics Rewards

EVA:通过逆动力学奖励对齐视频世界模型与可执行机器人动作

Ruixiang Wang, Qingming Liu, Yueci Deng, Guiliang Liu, Zhen Liu, Kui Jia

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) DexForce Technology Co., Ltd.(DexForce技术有限公司)

AI总结 本文提出EVA框架,通过逆动力学奖励对齐视频世界模型与可执行动作,减少生成动作中的体感约束违规,提升下游任务执行成功率。

Comments Project page: https://eva-project-page.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11167 2026-03-25 cs.CV cs.LG

Towards a general-purpose foundation model for fMRI analysis

面向fMRI分析的通用基础模型

Cheng Wang, Yu Jiang, Zhihao Peng, Chenxin Li, Changbae Bang, Lin Zhao, Wanyi Fu, Jinglei Lv, Jorge Sepulcre, Carl Yang, Lifang He, Tianming Liu, Xue-Jun Kong, Quanzheng Li, Daniel S. Barron, Anqi Qiu, Randy Hirschtick, Byung-Hoon Kim, Hongbin Han, Xiang Li, Yixuan Yuan

机构 * The Chinese University of Hong Kong, Hong Kong(香港中文大学) Yonsei University, Seoul, South Korea(延世大学) University of Georgia, Athens, GA(佐治亚大学) Peking University Health Science Center, Beijing, China(北京大学医学部) University of Sydney, Sydney, Australia(悉尼大学) Yale School of Medicine, New Haven, CT(耶鲁医学院) Emory University, Atlanta, GA(埃默里大学) Lehigh University, Bethlehem, PA(莱斯利大学) Boston Children’s Hospital, Boston, MA(波士顿儿童医院) Massachusetts General Hospital, Boston, MA(麻省总医院) Brigham and Women’s Hospital, Boston, MA(布里奇沃特医院) Hong Kong Polytechnic University, Hong Kong(香港理工大学) Kempner Institute for Natural and Artificial Intelligence, Cambridge, MA(Kempner自然与人工智能研究所)

AI总结 本文提出NeuroSTORM模型,通过直接学习4D fMRI数据的通用表示,实现跨任务高效迁移,优于现有方法在五类下游任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22991 2026-03-25 cs.CV

VLA-IAP: Training-Free Visual Token Pruning via Interaction Alignment for Vision-Language-Action Models

VLA-IAP: 通过交互对齐实现无训练视觉令牌剪枝用于视觉-语言-动作模型

Jintao Cheng, Haozhe Wang, Weibin Li, Gang Wang, Yipu Zhang, Xiaoyu Tang, Jin Wu, Xieyuanli Chen, Yunhui Liu, Wei Zhang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) South China Normal University(华南师范大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology Beijing(北京科技大学) National University of Defense Technology(国防科技大学)

AI总结 本文提出VLA-IAP方法,通过引入几何先验机制和动态调度策略,实现无训练的视觉令牌剪枝,提升VLA模型在资源受限平台上的推理效率和稳定性,实验显示在LIBERO基准上成功率达97.8%且速度提升1.25倍。

Comments 27 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22763 2026-03-25 cs.CV

ENC-Bench: A Benchmark for Evaluating Multimodal Large Language Models in Electronic Navigational Chart Understanding

ENC-Bench:用于评估多模态大语言模型在电子航海图理解中的基准

Ao Cheng, Xingming Li, Xuanyu Ji, Xixiang He, Qiyao Sun, Chunping Qiu, Runke Huang, Qingyong Hu

机构 * National University of Defense Technology(国防科技大学) Intelligent Game and Decision Lab(智能游戏与决策实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 ENC-Bench是首个专注于专业电子航海图理解的基准,包含20490个经过专家验证的样本,评估了10种先进多模态大语言模型在符号识别、空间推理和航海决策中的表现,揭示了模型在符号 grounding、空间计算和多约束推理方面的系统性挑战。

Comments Accepted to CVPR 2026, Project page: https://qingyonghu.github.io/ENC-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20644 2026-03-25 cs.CV

ScaleEdit-12M: Scaling Open-Source Image Editing Data Generation via Multi-Agent Framework

ScaleEdit-12M:通过多智能体框架实现开源图像编辑数据生成的规模化

Guanzhou Chen, Erfei Cui, Changyao Tian, Danni Yang, Ganlin Yang, Yu Qiao, Hongsheng Li, Gen Luo, Hongjie Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) CUHK MMLab(香港中文大学多模态实验室) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Xiamen University(厦门大学)

AI总结 本文提出ScaleEditor框架,通过多智能体方法构建大规模高质量图像编辑数据集,生成ScaleEdit-12M,涵盖23类任务,提升多种编辑模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19643 2026-03-25 cs.CV cs.AI

OmniDiT: Extending Diffusion Transformer to Omni-VTON Framework

OmniDiT:将扩散变换器扩展到Omni-VTON框架

Weixuan Zeng, Pengcheng Wei, Huaiqing Wang, Boheng Zhang, Jia Sun, Dewen Fan, Lin HE, Long Chen, Qianqian Gan, Fan Yang, Tingting Gao

机构 * The Chinese University of Hong Kong, ShenZhen(香港中文大学(深圳)) Beihang University(北京航空航天大学) KuaiShou(快手)

AI总结 本文提出OmniDiT框架,通过自进化数据采集管道构建大规模VTON数据集,结合多参考条件和Shifted Window Attention提升生成质量,在复杂场景中实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25066 2026-03-25 cs.CV

From Inpainting to Editing: Unlocking Robust Mask-Free Visual Dubbing via Generative Bootstrapping

从修复到编辑:通过生成性自举解锁鲁棒的无掩膜视觉配音

Xu He, Haoxian Zhang, Hejia Chen, Changyuan Zheng, Liyang Chen, Songlin Tang, Jiehui Huang, Xiaoqiang Liu, Pengfei Wan, Zhiyong Wu

机构 * Tsinghua University(清华大学) Hong Kong University of Science(香港科学大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出X-Dub框架,通过生成性自举实现无掩膜视觉配音,解决传统掩膜修复方法在时空上下文破坏和鲁棒性差的问题,提升唇形同步和视觉质量。

Comments Project Page: https://github.com/KlingAIResearch/X-Dub

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20565 2026-03-25 cs.CV

DINO-Tok: Adapting DINO for Visual Tokenizers

DINO-Tok:为视觉分词器适应DINO

Mingkai Jia, Mingxiao Li, Zhijian Shu, Anlin Zheng, Liaoyuan Fan, Jiaxin Guo, Tianxing Shi, Dongyue Lu, Zeming Li, Xiaoyang Guo, Xiaojuan Qi, Xiao-Xiao Long, Qian Zhang, Ping Tan, Wei Yin

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Horizon Robotics(Horizon机器人) Nanjing University(南京大学) Hong Kong University(香港大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出DINO-Tok,一种基于冻结DINO编码器的视觉分词器,结合连续自编码和离散向量量化方法,提升高维潜在空间中的语义一致性和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01415 2026-03-25 cs.RO cs.AI

RoboMemory: A Brain-inspired Multi-memory Agentic Framework for Interactive Environmental Learning in Physical Embodied Systems

RoboMemory:一种脑启发的多记忆代理框架,用于物理具身系统中的交互环境学习

Mingcong Lei, Honghao Cai, Yuyuan Yang, Yimou Wu, Jinke Ren, Zezhou Cui, Liangchen Tan, Junkun Hong, Gehan Hu, Shuangyu Zhu, Shaohan Jiang, Ge Wang, Junyuan Tan, Zhenglin Wan, Zheng Li, Zhen Li, Shuguang Cui, Yiming Zhao, Yatong Han

机构 * FNii-Shenzhen(FNii-深圳) SSE, CUHK-Shenzhen(SSE,CUHK-深圳) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Ising AI

AI总结 本文提出RoboMemory框架,通过整合空间、时间、事件和语义记忆,提升机器人在复杂环境中的长期规划与交互学习能力,实验表明其在EmbodiedBench上成功率提升26.5%,超越现有SOTA模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01356 2026-03-25 cs.CV

Quasi-Conformal Convolution : A Learnable Convolution for Deep Learning on Simply Connected Open Surfaces

准共形卷积:一种用于深度学习在单连通开放曲面上的可学习卷积

Han Zhang, Tsz Lok Ip, Lok Ming Lui

机构 * Department of Mathematics, City University of Hong Kong(香港城市大学数学系) Department of Mathematics, Chinese University of Hong Kong(香港中文大学数学系)

AI总结 本文提出准共形卷积(QCC),通过准共形理论在单连通开放曲面上定义卷积,结合可训练估计模块实现自适应卷积操作,用于几何数据的分类与医学应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22303 2026-03-25 cs.LG cs.AI

Sample Transform Cost-Based Training-Free Hallucination Detector for Large Language Models

基于样本转换成本的无训练hallucination检测器用于大型语言模型

Zeyang Ding, Xinglin Hu, Jicong Fan

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本文提出基于最优传输距离的hallucination检测方法,通过计算token嵌入之间的Wasserstein距离矩阵,得到AvgWD和EigenWD两个指标,用于无训练检测大型语言模型的hallucination问题。

Comments 24 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏