Multi-channel Uplift Policy Learning
多渠道提升策略学习
机构 * Peking University(北京大学) ; Alibaba Group(阿里巴巴集团) ; Beihang University(北京航空航天大学) ; CUHK-shenzhen(香港中文大学(深圳))
AI总结 针对电商多渠道营销预算分配的预测后优化范式失效问题,提出快慢因果框架ReAlloc,经淘宝模拟与A/B测试验证可同时提升支付订单量和收入。
高校专区
多渠道提升策略学习
机构 * Peking University(北京大学) ; Alibaba Group(阿里巴巴集团) ; Beihang University(北京航空航天大学) ; CUHK-shenzhen(香港中文大学(深圳))
AI总结 针对电商多渠道营销预算分配的预测后优化范式失效问题,提出快慢因果框架ReAlloc,经淘宝模拟与A/B测试验证可同时提升支付订单量和收入。
PanDent:面向牙科放射学中全面的牙级结构-语言一致性
机构 * Faculty of Dentistry, The University of Hong Kong(香港大学牙医学院) ; Imperial College London(帝国理工学院) ; University of Science and Technology of China(中国科学技术大学) ; Department of Data and Systems Engineering, The University of Hong Kong(香港大学数据与系统工程系) ; Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)
AI总结 本研究推出PanDent牙科OPG基准,经实验发现现有MLLM生成的牙科报告流畅但临床一致性差,在PanDent上微调可提升其结构-语言一致性,该基准可用于评估MLLM的牙级临床推理能力。
TREK:面向复杂行程规划的大语言模型智能体旅行推理与评估工具包
机构 * The Chinese University of Hong Kong(香港中文大学) ; Macao Polytechnic University(澳门理工大学)
AI总结 本研究推出TREK旅行基准测试,解决现有行程规划智能体基准的不足,实验显示最强LLM智能体仅在不足五成任务生成可行计划,满足旅行者未明确需求是普遍瓶颈。
Comments Code, data, and evaluator: https://github.com/TonyQJH/TREK-A-Travel-Reasoning-and-Evaluation-Kit-for-LLM-Agents-in-Complex-Trip-Planning
用于视觉生成的摊销矩匹配
机构 * MMLab, CUHK(香港中文大学MMLab) ; Kling Team, Kuaishou Technology(快手科技影幻团队)
AI总结 该研究提出摊销矩匹配方法,构建AMFD损失,用于视觉生成,在ImageNet、GenEval等基准上性能优于FD基线及FLUX.2 4B模型,实现高效高维数据生成。
Comments 30 pages, 11 figures
提炼时间搜索与推理:通过 harness 辅助的高效数据合成发展用于未来预测的大语言模型
机构 * The Chinese University of Hong Kong(香港中文大学) ; Meituan LongCat Team(美团龙猫团队)
AI总结 研究未来事件预测难题,提出时间截断 harness 方法,通过强制时间截断减少时间泄漏与对拒绝采样等的依赖,构建相关语料库和度量标准,经蒸馏实验验证该方法能提升模型表现,将高质量数据转化为模型参数提升。
医学中的智能体人工智能:临床转化的架构、应用、评估及挑战
机构 * School of Software Engineering, Dalian University(大连大学软件工程学院) ; Affiliated Zhongshan Hospital of Dalian University(大连大学附属中山医院) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; University of California, San Francisco(加州大学旧金山分校) ; Yale University(耶鲁大学) ; The Hong Kong Polytechnic University(香港理工大学)
AI总结 研究探讨医学中智能体人工智能的架构、应用等,通过范围审查筛选相关研究,指出其范围未定论且评估与临床需求不符,证据基础有限,临床转化需更清晰定义、可重复评估等。
Comments Review article, 6 figures, 2 tables. 42 pages
ANFI:重新思考行人重识别中的邻居特征交互
机构 * University of Science and Technology of China(中国科学技术大学) ; Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 该研究针对行人重识别中基于邻居方法仅依赖亲和关系、受噪声邻居影响的问题,提出ANFI方法,不仅建模亲和关系与差异关系,还用自适应加权,通过新邻域相似度导出差异关系,经噪声关系监督训练,实验证明其在多种设置下的优越性。
Comments accepted by ECCV2026
分解与重组:利用从示范中学到的原语和视觉运动策略进行规划
机构 * The University of Hong Kong(香港大学) ; JD.com (JingDong)(京东) ; Nanyang Technological University (NTU)(南洋理工大学) ; Southern University of Science and Technology (SUSTech)(南方科技大学) ; Huawei Technologies(华为技术有限公司) ; The Chinese University of Hong Kong (CUHK)(香港中文大学)
AI总结 研究如何使机器人灵巧、长视野操作自动化,提出DR-LfD框架,将视觉运动策略集成到TAMP决策系统,基于接触关系分解示范为原子技能,经实验验证该框架在多类任务中性能强大。
Comments 21 pages, 12 figures
CameraAnything:使用任意相机控制重新拍摄视频
机构 * The Chinese University of Hong Kong(香港中文大学) ; Ant Group(蚂蚁集团) ; Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; The Hong Kong University of Science and Technology(香港科技大学)
AI总结 CameraAnything是用于相机控制视频编辑的统一框架,采用逐像素普吕克光线注入等方法联合控制相机参数,开发合成管道克服数据稀缺,能在单过程中实现多种视频编辑操作,为视频制作提供实用价值。
Comments Project page: https://yixuanli98.github.io/cameraanything/
KAI:用于数据高效关节物体操纵的运动感知接口
机构 * The Chinese University of Hong Kong(香港中文大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 研究关节物体操纵中运动结构难学问题,提出运动感知关节接口KAI,通过嵌入先验提高样本效率,在多模拟任务中表现良好,能推广到复杂场景,视频共训练增强真实世界鲁棒性。
Comments Project page: https://li-yaping.github.io/KAI/
推理以规范:用于交通规则理解的思维链
机构 * CUHK-SZ, Shenzhen-FNii(香港中文大学(深圳),深圳高等金融研究院) ; HKUST(GZ)(香港科技大学(广州)) ; Tencent T Lab(腾讯T实验室)
AI总结 针对交通规则理解这一自动驾驶关键挑战,提出为视觉语言模型配备思维链能力的框架,设计整理管道,采用两阶段训练方案,显著提升了可解释性和准确性,建立首个基于推理的自动驾驶框架。
Comments Technical Report
LoTA-N2N:用于零样本自监督图像去噪的局部迹线自适应
机构 * Tsinghua University(清华大学) ; The Chinese University of Hong Kong(香港中文大学) ; University of Southern California(南加州大学) ; Peking University(北京大学)
AI总结 研究针对单图像自监督去噪问题,提出LoTA-N2N两阶段零样本自适应框架,通过估计局部相互作用和控制空间抵消,在多种噪声下实验效果优于仅基于MSE的方法,为无配对干净目标等情况的自监督去噪提供有效设计原则。
Comments 22pages, 9 tables, 11 figures
通过学习和搜索理解组合优化中类人解决方案
机构 * The University of Warwick(华威大学) ; The University of Hong Kong(香港大学) ; The Chinese University of Hong Kong(香港中文大学) ; South China Normal University(华南师范大学) ; The University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)
AI总结 研究欧几里得旅行商问题中人类如何找到接近最优解,通过大规模行为和计算研究,对比人类与基于指针网络的神经策略,发现类人解决方案或源于结构化监督学习、强化学习及测试时搜索的结合。
策略蒸馏中的结果混淆局部监督
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
AI总结 研究策略蒸馏中局部监督受轨迹结果混淆的问题,引入结果解析诊断方法区分不同情况,通过数学推理研究等实验得出相关比例及结果,指出局部化限制,贡献在于诊断而非新训练方法。
用于提示驱动手术概念分割的 SAM3 的参数高效适配
机构 * The Chinese University of Hong Kong(香港中文大学) ; XGEN Labs(XGEN实验室)
AI总结 针对手术数据与预训练数据的领域差距及现有方法计算消耗大效率低的问题,提出用低秩适配(LoRA)对 SAM3 进行参数高效适配用于手术概念分割,该方法在单个 GPU 上训练且性能优于主流基线,结果可支持下游手术场景重建和模拟。
Comments Accepted by The 2nd MICCAI Workshop on Efficient Medical AI
ObsDriveBench:具有可观测性意识的恶劣天气下多模态理解基准测试
机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) ; Institute of Medical Intelligence and XR, The Chinese University of Hong Kong(香港中文大学医学智能与扩展现实研究所)
AI总结 研究恶劣天气下视觉语言模型在多模态输入时的表现,引入ObsDriveBench基准测试,通过可观测性元标注等构建含多类问题的测试集,实验发现现有模型性能降,还引入ObsDrive模型提升其在多方面的鲁棒性。
MemVLN:用于视觉与语言导航的情景记忆和程序记忆
机构 * The Chinese University of Hong Kong(香港中文大学) ; LIGHTSPEED(光速) ; The University of Hong Kong(香港大学) ; The Hong Kong University of Science and Technology(香港科技大学)
AI总结 研究连续环境中视觉与语言导航问题,提出MemVLN框架,利用视觉编码器、大语言模型,通过情景记忆管理和程序记忆,实现实时推理,提升导航成功率并降低推理延迟。
有效参数、真实行为:机器人技术的重整化——从无限电子质量到模拟与现实差距
机构 * University of Maryland, College Park(马里兰大学帕克分校) ; Stanford University(斯坦福大学) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 研究机器人技术中弥合模拟与现实差距的问题,提出基于重整化的方法,通过有效参数吸收模拟器遗漏细节以重现真实行为,经分析论证及实例展示该方法,并给出实用程序,为跨越模拟与现实差距提供补充路径。
从零开始扩展原生多模态预训练
机构 * The Chinese University of Hong Kong(香港中文大学) ; LLM Department, Tencent(腾讯大语言模型部)
AI总结 研究在固定计算预算下训练基于Transformer的视觉语言模型的最优模型大小和token数量,发现语言和多模态目标扩展行为不同,推导效率前沿,还表明原生多模态预训练能促进跨模态转移,为扩展多模态基础模型奠定基础。
MoE$^2$-LoRA:当专家混合模型遇上专家混合风格的低秩自适应
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; KTH Royal Institute of Technology(瑞典皇家理工学院) ; University of Science and Technology of China(中国科学技术大学) ; Fudan University(复旦大学) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 研究探索MoE模型的参数高效微调方法,提出MoE$^2$-LoRA,通过双通道RCP模块耦合预训练专家专业化与任务适应性,引入全局专家池,在多MoE主干上评估,能保持通用能力并实现最优下游精度。
Comments Preprint, under review
关于随机低秩适应的收敛性
机构 * The Chinese University of Hong Kong(香港中文大学) ; Westlake University(西湖大学)
AI总结 本文研究了随机低秩适应的收敛性,提出LoRA-NSGDM和LoRA-STORM算法,分别在$\mathcal{O}(\epsilon^{-8})$和$\mathcal{O}(\epsilon^{-6})$的随机oracle复杂度下找到$\epsilon$-stationary点。
基于FDTD验证的1310nm PCSEL的可靠性感知贝叶斯优化
机构 * School of Science and Engineering (SSE), The Chinese University of Hong Kong, Shenzhen(科学与工程学院(SSE),香港中文大学(深圳)) ; Nick Holonyak Micro and Nanotechnology Laboratory, University of Illinois Urbana-Champaign(Nick Holonyak微纳技术实验室,伊利诺伊大学厄巴纳-香槟分校)
AI总结 研究1310nm PCSEL设计优化成本高的问题,采用将商业时域有限差分求解器与可靠性感知贝叶斯优化循环相结合的方法,经多次评估运行,产生高Q PCSEL候选方案,提高产量,还确定了相关控制,给出一组优质候选方案。
MedGame:由大语言模型赋能的用于医学教育的故事化游戏化
机构 * CUHK(香港中文大学) ; Southern Medical University(南方医科大学) ; Peking University(北京大学) ; Tencent(腾讯)
AI总结 研究旨在利用大语言模型助力医学教育,提出MedGame框架,通过双引擎设计将临床病例转化为故事化游戏,构建MedGame Bench进行评估,实验显示特定任务微调提升开源模型表现,学生研究表明其更具吸引力和实用性。
Comments Work in Progress; an explorational design and study on AI+Education+Game
PrefReward:学习用于个性化文本生成的用户偏好矩阵
机构 * University of Science and Technology of China(中国科学技术大学) ; The Chinese University of Hong Kong(香港中文大学) ; National University of Singapore(新加坡国立大学)
AI总结 研究针对大语言模型个性化生成中存在的问题,提出PrefReward框架,通过提取用户特定偏好矩阵并将其作为奖励信号指导生成,实验证明该框架在生成质量和个性化可解释性上优于基线。
WAT3R:前馈水下三维重建
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; The Chinese University of Hong Kong(香港中文大学) ; Peking University(北京大学)
AI总结 针对水下光衰减等导致三维重建难的问题,提出WAT3R前馈框架,利用退化适应及轻量级神经适应模块,单次前向传播直接输出三维点图和相机姿态,实验证明其在多类三维重建任务中优于现有方法。
RealVDeblur:用于通用真实世界视频去模糊的一步扩散法
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; CUHK MMLab(香港中文大学多媒体实验室) ; CPII under InnoHK(创新香港研究院下的CPII) ; Tsinghua University(清华大学)
AI总结 针对真实世界视频去模糊难题,提出RealVDeblur框架。构建模糊合成管道提供数据,利用视频扩散先验恢复,采用逐帧编码并简化采样为一步生成器,还有时间窗口掩码稳定推理,在多方面表现出色且提升3D重建鲁棒性。
Comments Project page with code: https://rbjin.github.io/RealVDeblur/
SimulS2ST-Omni:通过显式轨迹监督实现数据高效的流式语音到语音翻译
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
AI总结 研究长格式流式语音到语音翻译,提出仅用约2000小时配对数据的训练方法,核心是联合文本-代码轨迹监督,双流分解减轻干扰,在质量-延迟权衡上表现出色,与先进闭源系统相当。
Comments 29 pages, 19 figures, 16 tables
揪出搭便车者:基于夏普利值的强化学习并行推理奖励归因
机构 * ShanghaiTech University(上海科技大学) ; City University of Hong Kong(香港城市大学) ; Peking University(北京大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Zhejiang University(浙江大学)
AI总结 研究大型语言模型多步推理中并行推理路径贡献难区分问题,提出基于夏普利值的强化学习框架并行夏普利值方法,通过量化边际贡献等实现按比例分配奖励,实验证明其优于基线且能改进多路径推理。
Comments 19 pages, 4 figures, 8 Tables
打破反馈盲目性:用于序列决策的效用增强Transformer
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shenzhen Research Institute of Big Data(深圳大数据研究院) ; University of International Business and Economics(对外经济贸易大学)
AI总结 研究非平稳和部分可观测环境下序列决策问题,提出效用增强Transformer(UAT),通过紧凑效用状态调制注意力检索,解决现有模型反馈盲目性问题,在四个非平稳基准测试中性能优于其他基线。
Comments 25 pages, 6 figures
一劳永逸?用于文本到图像提示优化的类型感知修复分配
机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) ; XJTU-POLIMI Joint School, Xi’an Jiaotong University(西安交通大学-米兰理工大学联合学院) ; Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来智能网络研究院)
AI总结 研究文本到图像提示优化问题,提出将语义提示优化制定为原子修复分配的方法,在无需训练的TARA框架中实例化,实验表明该方法在多个基准生成器单元中语义准确性最佳,且运行快、图像质量好。