UniGRPO: Unified Policy Optimization for Reasoning-Driven Visual Generation
UniGRPO:用于推理驱动视觉生成的统一策略优化
机构 * The Chinese University of Hong Kong(香港中文大学)
AI总结 本文提出UniGRPO框架,通过统一强化学习方法优化文本和图像生成策略,解决多轮交错生成问题,提升生成质量与可扩展性。
高校专区
UniGRPO:用于推理驱动视觉生成的统一策略优化
机构 * The Chinese University of Hong Kong(香港中文大学)
AI总结 本文提出UniGRPO框架,通过统一强化学习方法优化文本和图像生成策略,解决多轮交错生成问题,提升生成质量与可扩展性。
SortedRL: 通过在线长度感知调度加速大语言模型的强化学习训练
机构 * National University of Singapore(新加坡国立大学) ; Microsoft Research Asia(微软亚洲研究院) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 SortedRL通过在线长度感知调度策略提升大语言模型强化学习训练效率,减少训练气泡比例并提升性能,实验表明在不同任务中表现优于基线。
利用轻量级Transformer与上下文协同增强进行高效的3D医学图像分割
机构 * Department of Electronic Engineering, The Chinese University of Hong Kong, Hong Kong SAR(电子工程系,香港中文大学(深圳)Hong Kong SAR) ; Centre for Artificial Intelligence and Robotics (CAIR), Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences, Hong Kong SAR(人工智能与机器人中心(CAIR),香港科学与创新研究院,中国科学院,Hong Kong SAR)
AI总结 本文提出Light-UNETR,通过轻量级维度缩减注意力模块和紧凑门控线性单元提升模型效率,结合上下文协同增强策略提高数据效率,在少量标注数据下实现高效3D医学图像分割。
Comments Accepted to IEEE TPAMI
为大语言模型设计的非策略价值基于强化学习
机构 * National Key Laboratory for Novel Software Technology & School of Artificial Intelligence, Nanjing University(新型软件技术国家重点实验室 & 智能科学与技术学院,南京大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shenzhen Research Institute of Big Data(大数据研究院(深圳)) ; Shenzhen Loop Area Institute(深圳河套学院)
AI总结 本文提出ReVal方法,通过结合步级信号和轨迹级信号提升大语言模型的训练效率,实验表明其在数学推理任务中优于GRPO。
EVA:通过逆动力学奖励对齐视频世界模型与可执行机器人动作
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; DexForce Technology Co., Ltd.(DexForce技术有限公司)
AI总结 本文提出EVA框架,通过逆动力学奖励对齐视频世界模型与可执行动作,减少生成动作中的体感约束违规,提升下游任务执行成功率。
Comments Project page: https://eva-project-page.github.io/
面向fMRI分析的通用基础模型
机构 * The Chinese University of Hong Kong, Hong Kong(香港中文大学) ; Yonsei University, Seoul, South Korea(延世大学) ; University of Georgia, Athens, GA(佐治亚大学) ; Peking University Health Science Center, Beijing, China(北京大学医学部) ; University of Sydney, Sydney, Australia(悉尼大学) ; Yale School of Medicine, New Haven, CT(耶鲁医学院) ; Emory University, Atlanta, GA(埃默里大学) ; Lehigh University, Bethlehem, PA(莱斯利大学) ; Boston Children’s Hospital, Boston, MA(波士顿儿童医院) ; Massachusetts General Hospital, Boston, MA(麻省总医院) ; Brigham and Women’s Hospital, Boston, MA(布里奇沃特医院) ; Hong Kong Polytechnic University, Hong Kong(香港理工大学) ; Kempner Institute for Natural and Artificial Intelligence, Cambridge, MA(Kempner自然与人工智能研究所)
AI总结 本文提出NeuroSTORM模型,通过直接学习4D fMRI数据的通用表示,实现跨任务高效迁移,优于现有方法在五类下游任务中的表现。
VLA-IAP: 通过交互对齐实现无训练视觉令牌剪枝用于视觉-语言-动作模型
机构 * Hong Kong University of Science and Technology(香港科学与技术大学) ; South China Normal University(华南师范大学) ; The Chinese University of Hong Kong(香港中文大学) ; University of Science and Technology Beijing(北京科技大学) ; National University of Defense Technology(国防科技大学)
AI总结 本文提出VLA-IAP方法,通过引入几何先验机制和动态调度策略,实现无训练的视觉令牌剪枝,提升VLA模型在资源受限平台上的推理效率和稳定性,实验显示在LIBERO基准上成功率达97.8%且速度提升1.25倍。
Comments 27 pages, 8 figures
ENC-Bench:用于评估多模态大语言模型在电子航海图理解中的基准
机构 * National University of Defense Technology(国防科技大学) ; Intelligent Game and Decision Lab(智能游戏与决策实验室) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
AI总结 ENC-Bench是首个专注于专业电子航海图理解的基准,包含20490个经过专家验证的样本,评估了10种先进多模态大语言模型在符号识别、空间推理和航海决策中的表现,揭示了模型在符号 grounding、空间计算和多约束推理方面的系统性挑战。
Comments Accepted to CVPR 2026, Project page: https://qingyonghu.github.io/ENC-Bench/
ScaleEdit-12M:通过多智能体框架实现开源图像编辑数据生成的规模化
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; CUHK MMLab(香港中文大学多模态实验室) ; Fudan University(复旦大学) ; University of Science and Technology of China(中国科学技术大学) ; Xiamen University(厦门大学)
AI总结 本文提出ScaleEditor框架,通过多智能体方法构建大规模高质量图像编辑数据集,生成ScaleEdit-12M,涵盖23类任务,提升多种编辑模型性能。
OmniDiT:将扩散变换器扩展到Omni-VTON框架
机构 * The Chinese University of Hong Kong, ShenZhen(香港中文大学(深圳)) ; Beihang University(北京航空航天大学) ; KuaiShou(快手)
AI总结 本文提出OmniDiT框架,通过自进化数据采集管道构建大规模VTON数据集,结合多参考条件和Shifted Window Attention提升生成质量,在复杂场景中实现最优性能。
从修复到编辑:通过生成性自举解锁鲁棒的无掩膜视觉配音
机构 * Tsinghua University(清华大学) ; Hong Kong University of Science(香港科学大学) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 本文提出X-Dub框架,通过生成性自举实现无掩膜视觉配音,解决传统掩膜修复方法在时空上下文破坏和鲁棒性差的问题,提升唇形同步和视觉质量。
Comments Project Page: https://github.com/KlingAIResearch/X-Dub
DINO-Tok:为视觉分词器适应DINO
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; Horizon Robotics(Horizon机器人) ; Nanjing University(南京大学) ; Hong Kong University(香港大学) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 本文提出DINO-Tok,一种基于冻结DINO编码器的视觉分词器,结合连续自编码和离散向量量化方法,提升高维潜在空间中的语义一致性和生成质量。
RoboMemory:一种脑启发的多记忆代理框架,用于物理具身系统中的交互环境学习
机构 * FNii-Shenzhen(FNii-深圳) ; SSE, CUHK-Shenzhen(SSE,CUHK-深圳) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; The University of Hong Kong(香港大学) ; National University of Singapore(新加坡国立大学) ; The Chinese University of Hong Kong(香港中文大学) ; Ising AI
AI总结 本文提出RoboMemory框架,通过整合空间、时间、事件和语义记忆,提升机器人在复杂环境中的长期规划与交互学习能力,实验表明其在EmbodiedBench上成功率提升26.5%,超越现有SOTA模型。
准共形卷积:一种用于深度学习在单连通开放曲面上的可学习卷积
机构 * Department of Mathematics, City University of Hong Kong(香港城市大学数学系) ; Department of Mathematics, Chinese University of Hong Kong(香港中文大学数学系)
AI总结 本文提出准共形卷积(QCC),通过准共形理论在单连通开放曲面上定义卷积,结合可训练估计模块实现自适应卷积操作,用于几何数据的分类与医学应用。
基于样本转换成本的无训练hallucination检测器用于大型语言模型
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
AI总结 本文提出基于最优传输距离的hallucination检测方法,通过计算token嵌入之间的Wasserstein距离矩阵,得到AvgWD和EigenWD两个指标,用于无训练检测大型语言模型的hallucination问题。
Comments 24 pages, 5 figures, 5 tables