Reinforcement Learning from Denoising Feedback
基于去噪反馈的强化学习
机构 * Fudan University(复旦大学) ; Ant Group(蚂蚁集团) ; Hong Kong University of Science and Technology(香港科技大学)
AI总结 提出RLDF方法,利用去噪反馈进行策略损失估计,通过优化中间噪声状态到裁剪干净状态并结合加权时间步采样,在扩散语言模型上提升性能和泛化性。
高校专区
基于去噪反馈的强化学习
机构 * Fudan University(复旦大学) ; Ant Group(蚂蚁集团) ; Hong Kong University of Science and Technology(香港科技大学)
AI总结 提出RLDF方法,利用去噪反馈进行策略损失估计,通过优化中间噪声状态到裁剪干净状态并结合加权时间步采样,在扩散语言模型上提升性能和泛化性。
面向视觉原生多模态深度搜索智能体的在策略数据演化
机构 * Hong Kong University of Science and Technology(香港理工大学) ; Renmin University of China(中国人民大学) ; The Chinese University of Hong Kong(香港中文大学) ; Peking University(北京大学) ; Tsinghua University(清华大学) ; University of Edinburgh(爱丁堡大学)
AI总结 提出在策略数据演化(ODE)框架,通过图像库引用协议和闭环数据生成器,解决多模态深度搜索中视觉证据不可复用和训练数据静态问题,在8个基准上显著提升性能。
模态间隙驱动的子空间对齐训练范式用于多模态大语言模型
机构 * HKUST(GZ)(香港科技大学(广州)) ; NUS(新加坡国立大学) ; sh AILab ; SII ; Stanford(斯坦福大学) ; UCLA(加州大学洛杉矶分校) ; Yale(耶鲁大学) ; SJTU(上海交通大学) ; GBU(国防大学) ; PKU(北京大学)
AI总结 针对多模态对比学习中的模态间隙问题,提出固定帧模态间隙理论,并基于该理论设计无训练的对齐策略ReAlign和可扩展训练范式ReVision,利用无配对数据实现视觉与语言表示的高效对齐。
何时多智能体协作有助于?从熵的角度来看
机构 * Yantai Research Institute of Harbin Engineering University(哈尔滨工程大学烟台研究室) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
AI总结 本文从熵的角度探讨了多智能体协作的有效性,通过分析不同拓扑结构、六个推理基准和两个智能体任务中的熵转换,发现单个智能体在43.3%的情况下表现更优,并揭示了熵动态在第一轮交互中的决定性作用。研究提出了三个关键观察:确定性偏好、基础熵和任务意识,并引入了熵判别算法来提升智能体系统的性能。
Comments Project page: https://multiagent-entropy.github.io/
潜空间:基础、演化、机制、能力与展望
机构 * National University of Singapore(国立新加坡大学) ; Fudan University(复旦大学) ; Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Renmin University of China(中国人民大学) ; The Chinese University of Hong Kong(香港中文大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; DeepWisdom(深智科技) ; Nanjing University(南京大学) ; Shanghai Jiatong University(上海交通大学) ; Nanyang Technological University(南洋理工大学) ; Tencent Hunyuan(腾讯文深) ; QuantaAlpha(量子阿尔法) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Zhejiang Lab(浙江实验室) ; University of Chinese Academy of Sciences(中国科学院大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Sun Yat-sen University(中山大学)
AI总结 本文综述潜空间在语言模型中的基础、演化、机制与能力,指出其克服显式空间计算的结构性限制,并展望未来研究方向。
TOKI: 用于LLM智能体持久化记忆中矛盾消解的双时态算子代数
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)
AI总结 提出TOKI代数,将四种矛盾消解启发式统一为双时态算子,通过隔离性、模式与溯源三个正确性定理提供写时并发控制契约,并证明审计行防御在LoCoMo任务上的有效性。
Comments 43 pages including full appendices (proofs, protocols, and reproducibility ledger). Code, data, and reproducibility artifact: https://github.com/ZenAlexa/toki-bitemporal-memory
通过元学习从隐式成本-性能偏好中学习路由LLM
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Southern University of Science and Technology(南方科技大学)
AI总结 提出MetaRouter框架,利用元学习从少量交互中学习用户隐式成本-性能偏好,实现个性化LLM路由,在分布内外任务上优于基线方法。
AffordanceVLA:一种通过可供性感知理解赋能动作生成的视觉-语言-动作模型
机构 * Peking University(北京大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The Chinese University of Hong Kong(香港中文大学) ; Knowin AI
AI总结 提出AffordanceVLA框架,通过引入结构化可供性预测作为任务导向的中间表示,解决VLA模型中语义空间与具身控制策略的结构不匹配问题,实现精确的感知-动作映射。
Comments Preprint. Code and project page are available. Code: https://github.com/Skywalker-yqz/AffordanceVLA Project page: https://skywalker-yqz.github.io/AffordanceVLA/
PLAN-S:通过潜在风格动态桥接规划以实现自动驾驶世界模型
机构 * Intelligent Transportation Thrust, Systems Hub, and Center of Seamless Connectivity & Connected Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(智能交通 thrust、系统中心及无缝连接与智能连接研究院,香港科学与技术大学(广州))
AI总结 提出PLAN-S框架,通过从潜在表示解码风格条件语义成本图,解决自动驾驶中潜在世界模型规划的可控性问题,在nuScenes和NAVSIM上降低了碰撞率并提升了驾驶性能。
面向物流具身智能的数据飞轮
机构 * Peking University(北京大学) ; JD Logistics(京东物流) ; HKUST (Guangzhou)(香港科技大学(广州))
AI总结 提出一种数据驱动的物流具身智能框架,通过构建数据飞轮将日常操作转化为可复用数据资产,利用世界模型生成长尾包裹操作的可靠监督,并整合多模态数据实现策略持续改进。
CamFlow+: 用于二维相机运动估计的混合运动基及其稳定应用
机构 * School of Information and Communication Engineering, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院) ; University of Electronic Science and Technology of China(电子科技大学) ; School of Aeronautics and Astronautics, Sichuan University(四川大学航空宇航学院) ; YingCai Honors College, University of Electronic Science and Technology of China(电子科技大学 YingCai 优秀生学院) ; Lingnan University(岭南大学) ; Hong Kong University of Science and Technology and Shenzhen Loop Area Institute(香港科学与技术大学及深圳环宇研究院)
AI总结 提出CamFlow+混合基框架,通过结合单应性物理基、随机基和深度平移基在稠密光流空间中直接估计二维相机运动,并引入深度感知平滑项,有效处理平移、深度变化和局部视差,在相机运动估计和视频稳定任务中取得最优效果。
QCFuse: 通过压缩视图的查询感知缓存融合实现高效RAG服务
机构 * Zhejiang University(浙江大学) ; East China Normal University(华东师范大学) ; Ant Group(蚂蚁集团) ; The Hong Kong Polytechnic University(香港理工大学) ; Zhejiang Normal University(浙江师范大学) ; Tongji University(同济大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; The Hong Kong University of Science and Technology(香港科学与技术大学)
AI总结 提出QCFuse,一种基于压缩视图的查询感知选择器,通过块锚查询探测和关键层分析实现高效RAG缓存融合,在保持全预填充质量的同时平均加速1.7倍。
超越波形鲁棒性:针对自动语音识别的鲁棒特征-声码器对抗攻击
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Wuhan University(武汉大学)
AI总结 提出一种基于自监督学习表示和声码器的黑盒对抗攻击方法,通过扰动声学-语音特征而非波形,提高了攻击的可迁移性和对防御的绕过能力。
Comments 11 pages
更多智能体有帮助吗?LLM智能体工作流的受控与协议对齐评估
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Westlake University(西湖大学) ; Zhejiang University(浙江大学) ; Duke Kunshan University(杜克大学昆山分校) ; Hong Kong University of Science and Technology(香港科技大学) ; Zhejiang University of Technology(浙江工业大学)
AI总结 提出BenchAgent框架,在统一协议下比较单智能体、固定多智能体和演化多智能体工作流,发现大多数多智能体系统在准确率上未超越单智能体基线,但运行时生成的工作流在GAIA上表现优异。
Comments https://github.com/LINs-lab/MASArena/tree/BenchAgent
当新生成器到来:基于岭特征迁移的终身机器生成文本归因
机构 * Wuhan University(武汉大学) ; Ant Group(蚂蚁集团) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Institute of Deep Perception Technology, JITRI(感知技术研究院,JITRI)
AI总结 针对终身机器生成文本归因中持续适应新生成器与保留旧知识难以平衡的问题,提出轻量级分析更新框架RidgeFT,通过协方差校准和固定随机特征实现无需示例回放的闭式更新。
Comments 12 pages
跨时代自适应展开优化用于强化学习后训练
机构 * Department of Industrial Engineering & Decision Analytics, Hong Kong University of Science and Technology(工业工程与决策分析系,香港科学与技术大学)
AI总结 针对提示词训练信号差异大的问题,提出CERO方法,通过贝叶斯估计提示词成功概率并利用Fenchel对偶优化自适应分配展开预算,在固定总预算下提升样本效率。
先过滤,再重加权:重新思考在线策略蒸馏中的优化粒度
机构 * THU(清华大学) ; HKUST(香港科技大学) ; BIT(北京理工大学) ; Meituan(美团) ; ZJU(浙江大学)
AI总结 针对在线策略蒸馏,提出FiRe-OPD方法,通过轨迹级过滤和令牌级软重加权实现细粒度优化,在多种设置下优于现有方法。
SEDualVLN:一种空间增强的双系统用于视觉语言导航
机构 * Hong Kong Polytechnic University(香港理工大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
AI总结 本文提出SEDualVLN,一种空间增强的双系统框架,用于解决视觉语言导航中的长距离导航和动态推理问题,通过两个系统协同工作实现高效导航。
在d+1维度中重新表述神经算子以嵌入演化
机构 * HKUST (GZ)(香港科技大学(广州)) ; HKUST(香港科技大学) ; SWJTU(西南交通大学)
AI总结 本文提出在d+1维度中重新表述神经算子,通过引入辅助函数维度来建模嵌入演化,从而改进嵌入扩展的效率,通过傅里叶基算子在物理域和辅助域上联合作用,实现更高效的嵌入演化模块,实验表明该方法在多个基准测试中表现优异。
PC-Talk: 用于音频驱动说话面部生成的精确面部动画控制
机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Psyche AI.INC(Psyche AI公司) ; HKUST(香港科技大学) ; CAIR, HKISI, Chinese Academy of Sciences(中国科学院计算智能研究所) ; SCSE, FIE, M.U.S.T(M.U.S.T的SCSE、FIE部门)
AI总结 本文针对音频驱动说话面部生成中面部动画控制不足的问题,提出PC-Talk框架,通过改进唇音对齐和情感控制来提升生成视频的多样性和用户友好性。
Comments 10 Pages, 6 figures. Accepted in CVPR2026
在全同态加密下学习因果结构时保护数据隐私
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) ; Hong Kong University of Science and Technology(香港理工大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 针对分布式因果结构学习中的隐私泄露问题,提出基于全同态加密的方法,通过电路简化、除法和对数近似以及SIMD批处理技术,在加密数据上高效完成因果结构学习,并支持扩展到差分隐私。
Anchor3R: 基于瞬态锚点的流式3D重建用于长时程视觉映射
机构 * CASIA(中国科学院自动化研究所) ; UCAS(中国科学院自动化研究所) ; Horizon Robotics(Horizon机器人技术有限公司) ; HKUST(GZ)(香港科技大学(广州))
AI总结 提出Anchor3R框架,通过将前馈重建视为当前帧坐标系下的局部测量预测而非全局回归,结合窗口相对位姿预测、闭环插入和运动平均,实现长序列上的在线3D重建与位姿估计。
GARL:面向多智能体战略优先级排序的博弈论强化学习
机构 * Tsinghua University(清华大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
AI总结 提出GARL框架,将多智能体战略优先级排序形式化为两阶段博弈,通过博弈论效用转化为角色特定强化信号,优化交互策略,在争议问题排序任务中提升性能并使小型开源LLM与强闭源LLM竞争。
用于胃癌的病理基础模型及真实世界验证
机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology, Hong Kong SAR, China(计算机科学与工程系,香港科技大学,香港特别行政区,中国) ; Department of Pathology, Nanfang Hospital, Southern Medical University, Guangzhou, China(病理学系,南方医科大学南芳医院,广州,中国) ; Department of Pathology, School of Basic Medical Sciences, Southern Medical University, Guangzhou, China(病理学系,南方医科大学基础医学学院,广州,中国) ; Guangdong Province Key Laboratory of Molecular Tumor Pathology, Guangzhou, China(广东省分子肿瘤病理学重点实验室,广州,中国) ; Department of Anatomical and Cellular Pathology, The Chinese University of Hong Kong, Hong Kong SAR, China(解剖学与细胞病理学系,香港中文大学,香港特别行政区,中国) ; Pathology Artificial Intelligence Development and Assessment Laboratory, State Key Laboratory of Translational Oncology, The Chinese University of Hong Kong, Hong Kong SAR, China(病理人工智能发展与评估实验室,转化肿瘤学国家重点实验室,香港中文大学,香港特别行政区,中国)
AI总结 提出胃癌专用基础模型GRACE,基于多中心HE染色全切片图像,在28项临床任务中优于通用PFM,并通过前瞻性验证和读者研究证实其辅助诊断效能。
LifeSide: 将智能体作为终身数字伴侣的基准测试
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) ; Hong Kong University of Science and Technology(香港理工大学) ; Tencent(腾讯)
AI总结 针对现有评估无法捕捉终身数字伴侣所需的多会话记忆、用户理解和隐私适应能力的问题,提出LifeSide基准,通过多智能体模拟构建记忆-情感-环境循环,评估模型在记忆追踪、用户理解、隐私控制和情感陪伴方面的表现,发现即使当前记忆基准饱和的模型也无法在长期内维持准确的用户理解和真正的陪伴。
Comments 28 pages, 23 figures, 7 tables
先计划,后评判,更优运行:一种受DMAIC启发的工业异常检测智能体系统
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The Hong Kong University of Science and Technology(香港科技大学) ; Shanghai University of Finance and Economics(上海财经大学) ; Technische Universität München(慕尼黑技术大学) ; Southwestern University of Finance and Economics(西南财经大学)
AI总结 提出受DMAIC启发的多智能体系统DMAIC-IAD,通过先制定标准化操作程序(SOP)再生成策略,并引入预训练的无执行评判模型来排序候选策略,无需昂贵运行时试验,在四种模态上平均检测性能提升37.76%。
Echo-Infinity: 学习演化记忆用于实时无限视频生成
机构 * The Chinese University of Hong Kong(香港中文大学) ; Joy Future Academy, JD(京东探索研究院) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Tsinghua University(清华大学) ; The University of Hong Kong(香港大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 提出Echo-Infinity框架,通过可学习的演化记忆以恒定成本动态过滤、抽象和压缩任意长度历史,结合统一相对RoPE方案,首次实现24小时实时无限视频生成。
Comments Website: https://echo-team-joy-future-academy-jd.github.io/Echo-Infinity/
通过联合生成与评估实现自我进化的深度研究
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; ByteDance, China(字节跳动) ; University College London(伦敦大学学院)
AI总结 提出SCORE框架,通过共享参数的协同进化训练联合优化评估器与求解器,解决深度研究报告生成中奖励不可验证的问题,持续提升生成质量。
D^2SD: 使用双重扩散草稿模型加速推测解码
机构 * Peking University(北京大学) ; Tsinghua University(清华大学) ; HKUST(香港科技大学) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; Ant Group(蚂蚁集团)
AI总结 提出D^2SD框架,通过双重扩散草稿模型和置信度引导的前缀树,提升推测解码的接受率,优于现有扩散方法和自回归推测解码基线。
LoopMoE:统一迭代计算与混合专家模型用于语言建模
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Huawei Technologies Co.,Ltd.(华为技术有限公司)
AI总结 提出LoopMoE,通过迭代自适应层归一化和容量平衡策略,在相同参数和FLOPs下,循环MoE语言模型在多个基准上优于标准MoE。