DOPD: Dual On-policy Distillation
DOPD:双重在线策略蒸馏
机构 * NUS(新加坡国立大学) ; MMLab, CUHK(香港中文大学多媒体实验室) ; PKU(北京大学) ; Explore Academy, JD(京东探索研究院)
AI总结 提出DOPD方法,通过优势感知的双重蒸馏范式动态分配令牌级监督,缓解特权幻觉,在LLM和VLM上优于传统在线策略蒸馏。
高校专区
DOPD:双重在线策略蒸馏
机构 * NUS(新加坡国立大学) ; MMLab, CUHK(香港中文大学多媒体实验室) ; PKU(北京大学) ; Explore Academy, JD(京东探索研究院)
AI总结 提出DOPD方法,通过优势感知的双重蒸馏范式动态分配令牌级监督,缓解特权幻觉,在LLM和VLM上优于传统在线策略蒸馏。
变形为混合注意力模型
机构 * Fudan University(复旦大学) ; ByteDance Seed(字节跳动种子) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 提出FlashMorph方法,将层选择建模为预算约束子集优化问题,通过可变形模型和门控学习高效选择全注意力层,实现Transformer到混合注意力的转换,在保持性能的同时降低选择成本。
揭示消费者信心中的显著性驱动动态:基于生成式社会模拟
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 提出ConsumerSim框架,通过微观数据校准的合成人口、宏观经济信号和调查响应生成,重建消费者信心指数,在美欧日数据上优于基线模型,并揭示信心变化集中于显著性事件,且不同群体敏感性各异。
UniGP:驯服扩散Transformer以实现先验保留的统一生成与感知
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; DAMO Academy, Alibaba Group(阿里云达摩院) ; Hupan Lab(虎扑实验室) ; Zhejiang University(浙江大学) ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong(香港中文大学) ; Zeekr Automobile R&D Co., Ltd.(小鹏汽车研发有限公司)
AI总结 提出UniGP框架,基于MMDiT通过简单联合训练统一可控生成与密集预测,无需复杂任务设计,保留骨干先验,在多个任务上超越先前统一方法并与专用方法持平。
参数化技能
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; University of Science and Technology of China(中国科学技术大学) ; KTH Royal Institute of Technology(皇家理工学院) ; Fudan University(复旦大学) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 提出ParametricSkills框架,将文本技能在测试时转换为LoRA参数,解决长上下文下技能指令难以遵循的问题,在软件工程任务中平均提升6.44分。
Comments Preprint, Under Review
基于约束梯度投影的碰撞感知冗余机器人多轴增材制造轨迹优化
机构 * Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(香港中文大学机械与自动化工程系) ; Centre for Perceptual and Interactive Intelligence (CPII)(感知与交互智能中心) ; Department of Robotics at the School of Mechanical Engineering, Southeast University(东南大学机械工程学院机器人系)
AI总结 提出一种约束梯度投影框架,用于冗余机器人多轴增材制造的碰撞感知轨迹优化,通过相对雅可比和可微SDF碰撞模型实现硬约束,在8-DOF平台上平均位置误差<10μm,关节加加速度降低77.6%,速度提升10.2倍。
ReMAP-PET:超越视觉理解——从脑PET学习区域引导的代谢对齐语义
机构 * The Chinese University of Hong Kong, HKSAR(香港中文大学) ; TReNDS Center (Georgia State, Georgia Tech, Emory)(TReNDS中心(佐治亚州立大学、佐治亚理工学院、埃默里大学)) ; ShanghaiTech University, Shanghai, P.R.China(上海科技大学) ; University of California, Berkeley, USA(加州大学伯克利分校) ; University of Texas Health Science Center at Houston, USA(德克萨斯大学健康科学中心(休斯顿)) ; Nanyang Technological University, Singapore(南洋理工大学)
AI总结 提出ReMAP-PET框架,通过联合回归和对比学习监督3D ResNet-50学习脑PET的区域代谢语义,在SUVR预测和检索上显著优于基线,并实现与临床语言的对齐及报告生成。
LLM能公平招聘吗?简历筛选中的种族偏见
机构 * Department of Finance, CUHK Business School(财务系,CUHK商学院)
AI总结 使用配对简历方法审计14个主流大语言模型,发现2023年模型重现白人回调差距,而2024年后模型显示无差距或反向偏差,表明算法招聘偏见方向随模型代际反转。
SWE-MeM:面向长周期编码代理的自适应内存管理学习
机构 * The Chinese University of Hong Kong, China(香港中文大学) ; Shanghai Jiao Tong University, China(上海交通大学) ; Tsinghua University, China(清华大学) ; ByteDance, China(字节跳动)
AI总结 提出SWE-MeM训练框架,通过灵活的内存工具和Memory-aware GRPO优化,让代理在有限上下文预算下自主决定压缩时机、内容和方式,在SWE-Bench Verified上以4B和30B模型分别达到43.4%和60.2%的解决率,优于现有方法。
HMARS:用于长上下文推理的分层多智能体记忆系统
机构 * The Chinese University of Hong Kong(香港中文大学)
AI总结 提出HMARS分层多智能体记忆系统,通过子智能体、中层智能体和前沿模型的分层结构管理长上下文,在长文档和多轮记忆任务中优于检索、重排序、全上下文、基于图和智能体基线。
X-Stream: 探索多模态大语言模型作为多流理解的多路复用器
机构 * MMLab, Chinese University of Hong Kong(中大香港人工智能实验室) ; Huawei Inc.(华为公司)
AI总结 为解决多流视频理解评估缺失的问题,提出首个基准X-Stream,包含4220个QA对和932个视频,覆盖多窗口、多视角和多设备场景,并基于信号多路复用理论评估MLLM作为多路复用器的性能,发现现有模型在并发流上仅达约50%分数。
Comments Project Page: https://peiwensun2000.github.io/xstream/
无混叠神经音频合成
机构 * Aalto University School of Science(阿alto大学科学学院) ; Aalto University(阿alto大学) ; School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) ; Spellbrush, Akihabara, Tokyo(东京秋叶原Spellbrush)
AI总结 本文提出Pupu-Vocoder和Pupu-Codec,通过可微抗混叠技术提升音乐和歌声合成质量,实验显示其在歌声、音乐和音频上表现更优。
Comments Accepted by TASLP
Drift-AR:通过反向对称漂移实现单步视觉自回归生成
机构 * University of Science and Technology of China(中国科学技术大学) ; The Chinese University of Hong Kong, MMLAB(香港中文大学多媒体实验室) ; JD Explore Academy(京东探索研究院) ; Beihang University(北京航空航天大学)
AI总结 Drift-AR通过利用熵信号加速自回归和视觉解码阶段,实现单步生成,提升了生成速度并保持了高质量。
Adam的定律:大型语言模型中的文本频率定律
机构 * FaceMind Corporation(FaceMind公司) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 本文提出文本频率定律,通过优化文本频率提升LLM的提示和微调效果,并通过文本频率蒸馏和课程训练方法验证了其有效性。
Comments ACL 2026 Main Conference; The latest version
TUGS: 基于物理的紧凑表示法用于水下场景的张量高斯表示
机构 * Huazhong University of Science and Technology(华中科技大学) ; Zhongguancun Academy(中关村学院) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Zhengzhou University(郑州大学) ; Hainan University(海南大学) ; Shenzhen University(深圳大学)
AI总结 本文提出TUGS,一种基于物理模型的紧凑水下3D表示法,通过物理建模复杂水下光场,实现高效高质量的水下图像渲染,实验表明其在有限参数下能取得优越的重建质量。
在机器人操作中建立仿真到现实泛化:基于视觉-语言-动作模型的实证研究
机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) ; Shenzhen Loop Area Institute(深圳河套学院)
AI总结 本文通过四个维度探讨仿真到现实泛化的决定因素,提出评估协议并释放资源以建立标准化基准,提升机器人操作策略的泛化能力。
Efficient-VLN: 一种高效且强大的视觉语言导航基线
机构 * The Chinese University of Hong Kong(香港中文大学) ; Weitu AI
AI总结 Efficient-VLN通过三个简单有效机制解决视觉语言导航中的系统瓶颈,提升推理效率和训练稳定性,在R2R-CE和RxR-CE基准上取得新突破。
EfficientUICoder: 一种用于高效基于多模态大语言模型的UI代码生成的双向标记压缩框架
机构 * The Chinese University of Hong Kong(香港中文大学) ; Huazhong University of Science and Technology(华中科技大学) ; Singapore Management University(新加坡管理大学) ; Nanyang Technological University(南洋理工大学)
AI总结 本文提出EfficientUICoder,通过元素和布局感知标记压缩、区域感知标记精炼和自适应重复标记抑制,有效压缩UI代码生成的标记数量,提升生成效率和代码质量。
Comments Published in the Proceedings of the 2026 ACM International Conference on the Foundations of Software Engineering (FSE 2026)
StarDojo:基于Stardew Valley的多模态大语言模型在生产-生活模拟中的开放性行为基准测试
机构 * Nanyang Technological University(南洋理工大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; East China University of Science and Technology(华东理工大学) ; Singapore Management University(新加坡管理大学)
AI总结 StarDojo通过Stardew Valley模拟评估多模态大语言模型在生产与社交活动中的综合能力,包含1000个任务,发现GPT-4.1在视觉理解与多模态推理方面存在显著不足。
Comments Accepted by ECCV 2026. Project website: https://weihaotan.github.io/StarDojo