Triplet-Block Diffusion RWKV
三元组块扩散RWKV
机构 * William & Mary(威廉玛丽学院) ; HKUST(香港科技大学) ; Cornell(康奈尔大学)
AI总结 提出B^3D-RWKV,通过三元组块布局方法将RWKV的线性推理效率与双向离散扩散结合,实现并行解码,在8任务套件上达到可比精度,解码吞吐量平均提升1.6倍。
高校专区
三元组块扩散RWKV
机构 * William & Mary(威廉玛丽学院) ; HKUST(香港科技大学) ; Cornell(康奈尔大学)
AI总结 提出B^3D-RWKV,通过三元组块布局方法将RWKV的线性推理效率与双向离散扩散结合,实现并行解码,在8任务套件上达到可比精度,解码吞吐量平均提升1.6倍。
EchoPilot: 通过尺度空间语义提示和可靠性门控记忆实现无训练超声视频分割
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Third Affiliated Hospital of Sun Yat-Sen University(中山大学第三附属医院) ; Hong Kong Metropolitan University(香港 Metropolitan 大学)
AI总结 提出EchoPilot,一种无需训练、仅需单点点击和类别名称的超声视频分割框架,通过尺度空间语义提示解决初始化歧义,并引入可靠性门控记忆减少传播漂移,在多个数据集上达到最优性能。
Comments Early accepted to MICCAI 2026. Project page: https://keeplearning-again.github.io/EchoPilot/
LLM 能时间旅行吗?通过强化学习增强法律智能搜索中的时间一致性
机构 * Department of Computer Science and Engineering, HKUST, Hong Kong SAR, China(香港科技大学计算机科学与工程系) ; School of Law, Tsinghua University, Beijing, China(清华大学法学院) ; Cheriton School of Computer Science, University of Waterloo, Waterloo, Canada(滑铁卢大学丘成桐计算机科学系)
AI总结 提出 LegalSearch-R1 框架,结合本地 statute RAG 和在线搜索,通过强化学习在跨修订期数据上训练,以解决法律 LLM 的时间偏差和搜索代理缺乏时间约束的问题,在13项法律任务上超越现有方法。
Comments Under Review
PixelWizard: 迈向高效高保真超大规模空间分辨率视频生成
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; MiLM Plus, Xiaomi Inc(小米公司MiLM Plus部门) ; The Hong Kong University of Science and Technology(香港科技大学)
AI总结 提出PixelWizard框架,通过分层解耦全局结构建模与细节合成,并引入噪声跨度对齐捷径训练,实现超大规模分辨率视频的高效高保真生成,加速超过10倍。
SplitAvatar: 基于自回归高斯分裂的单次头部化身
机构 * South China University of Technology(华南理工大学) ; University of Tokyo(东京大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学)
AI总结 提出一种基于自回归高斯分裂的单图像可动画头部化身重建方法,通过图分裂网络渐进生成高斯体,解决高斯数量不匹配和细粒度细节缺失问题。
RotMoLE:通过旋转门控机制增强混合低秩专家
机构 * Tsinghua University(清华大学) ; Beijing Information Science and Technology University(北京信息科技大学) ; National University of Singapore(新加坡国立大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Beijing University of Posts and Telecommunications(北京邮电大学)
AI总结 针对MoE-LoRA中传统门控仅标量加权限制表示能力的问题,提出RotMoLE框架,通过引入旋转门控机制对每个专家进行旋转操作,提升专家利用率和专业化程度,在多任务和多语言训练中验证有效性。
基于动作先验去噪的平滑实时分块
机构 * ROKAE (Shandong) Robot Group Co., Ltd.(ROKAE(山东)机器人集团有限公司) ; School of Mathematical Sciences, University of Chinese Academy of Sciences(中国科学院大学数学科学学院) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
AI总结 提出Soft RTC方法,通过动作先验去噪训练时模拟执行延迟,在保持近朴素运行时间的同时,降低高延迟动作变化并提升平滑性。
Comments 7 pages, 5 figures, 1 table
SAE-FD: 面向大语言模型持续学习的稀疏自编码器特征蒸馏
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; The 63rd Research Institute, National University of Defense Technology, Nanjing(国防科技大学第六十三研究所,南京)
AI总结 针对持续学习中的灾难性遗忘问题,提出基于稀疏自编码器特征蒸馏的方法,通过将模型表示锚定在稀疏特征空间以减少表征纠缠,实现更精准的正则化,在多个基准上优于现有方法。
基于轻量级置信感知语言模型的自动驾驶决策
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
AI总结 提出一种利用轻量级置信感知语言模型的决策框架,通过多智能体协作生成置信注释的决策演示并蒸馏到双头轻量模型,在nuPlan上实现SOTA成功率和低延迟。
Comments 8 Pages, 3 figures, ITSC 2026
CoSPlay: 测试时协作自我博弈与自生成代码和单元测试
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Institute of Deep Perception Technology, JITRI, Wuxi, China(深度感知技术研究院,无锡,中国)
AI总结 提出CoSPlay框架,通过代码与单元测试的协作自我博弈,在无真实单元测试的情况下迭代优化两者,显著提升代码生成性能。
Comments Code is available at: https://github.com/sanae-ai/CosPlay | Data & log is available at: https://huggingface.co/datasets/yomi017/CosPlay
FlowSteer: 条件化流场以实现一致图像恢复
机构 * Purdue University(普渡大学) ; HKUST(香港科技大学) ; Texas A&M University(德克萨斯农工大学)
AI总结 提出FlowSteer,一种算子感知的条件化方案,通过在采样路径中注入测量先验,将冻结流的隐式引导与显式测量约束耦合,在零样本设置下实现超分辨率、去模糊、去噪和着色等任务的一致图像恢复。
Comments Accepted by CVPRF 2026. Camera Ready version. Project page is \href{https://tharindu-nirmal.github.io/FlowSteer/}{in this link}
高效且可扩展的神经符号搜索用于知识图谱复杂查询回答
机构 * Department of Mathematical Sciences, Tsinghua University(清华大学数学科学系) ; Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港理工大学计算机科学与工程系) ; Department of Computer Sciences, University of Rochester(罗切斯特大学计算机科学系)
AI总结 提出一种结合约束策略和局部搜索的神经符号方法,以降低数据复杂度和近似解决NP难的循环查询,实现高效可扩展的复杂查询回答。
InvariantCloud:一种全局不变、唯一索引的点云框架,用于鲁棒的6自由度触觉姿态跟踪
机构 * Department of Mechanical and Aerospace Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学机械与航空航天工程系) ; Department of Mechanical Engineering, Massachusetts Institute of Technology(麻省理工学院机械工程系) ; Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(香港中文大学机械与自动化工程系)
AI总结 提出InvariantCloud框架,利用视觉触觉传感器上表面标记星座的全局不变性,通过一次性全局不变点云配准实现6自由度物体姿态估计,抑制累积漂移并准确估计偏航旋转,在长序列操作任务中展现出高精度和鲁棒性。
WorldCraft: 从相机导航到交互式视频世界模型中的物体操控
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; AI Technology Center, Tencent Video, Tencent(腾讯视频AI技术中心,腾讯) ; Wuhan University(武汉大学) ; Peking University(北京大学)
AI总结 提出WorldCraft框架,通过轨迹控制管道(NWT、SP-LoRA、TASP)将交互式视频世界模型从相机导航扩展到物体级轨迹操控,实现用户指定路径下的物体运动与相机导航共存。
Comments Project page: https://nevsdev.github.io/WorldCraft/
软体合成蛇在三维异质环境中的学习、运动与导航
机构 * Carl R. Woese Institute for Genomic Biology, University of Illinois Urbana–Champaign(卡尔·R·沃塞基因组生物学研究所,伊利诺伊大学厄巴纳-香槟分校) ; Department of Mechanical and Aerospace Engineering, Hong Kong University of Science and Technology(香港科学与技术大学机械与航空航天工程系) ; Department of Mechanical Science and Engineering, University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校机械科学与工程系)
AI总结 提出基于仿生驱动和感知模型的强化学习框架,使软体合成蛇能够自主导航非结构化三维地形,并通过高保真环境验证鲁棒性。
Comments 14 pages, 5 figures
RealBench: 在操作条件和极端事件挑战下对数据驱动数值天气预报的基准测试
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; Nanjing University(南京大学) ; Southern University of Science and Technology(南方科技大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai TechWind Technology Co., Ltd.(上海技风科技有限公司)
AI总结 提出RealBench基准,通过使用低延迟操作分析和全球10,000+站点观测数据,在严格分布外测试集上评估AI天气预报模型,揭示再分析指标与实际性能的显著差异,特别是极端事件方面。
Comments 35 pages, 22 figures
动态神经Koopman蒸馏:基于扩散模型的实时机器人控制
机构 * Department of Electrical and Computer Engineering, National University of Singapore(国立新加坡大学电子与计算机工程系) ; Department of Electrical and Computer Engineering, Carnegie Mellon University(卡内基梅隆大学电子与计算机工程系) ; Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology(香港科学与技术大学机器人与自主系统方向)
AI总结 提出动态神经Koopman蒸馏框架,将多步扩散推理蒸馏为单步前向传递,通过因子化动态Koopman层保留多模态表达能力,在D4RL MuJoCo和物理机器人上实现毫秒级延迟的闭环控制。
Comments 8 pages, 5 figures
CP-Agent: 一种用于反馈驱动竞赛编程的校准风险控制智能体
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
AI总结 提出CP-Agent,通过校准停止过程建模反馈驱动求解,结合双重粒度验证、测试增强和经验驱动自我进化机制,在不更新参数的情况下显著提升竞赛编程性能。
Comments Code: https://github.com/NineAbyss/CP-Agent
HiMed: 激励医疗大语言模型中的印地语推理
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Indian Institute of Technology (Banaras Hindu University) Varanasi(印度理工学院(班加罗尔 Hindu 大学)瓦拉纳西分校) ; Tongji University(同济大学) ; Shenzhen Research Institute of Big Data(深圳大数据研究院) ; Shenzhen Loop Area Institute(深圳河套学院) ; The Hong Kong University of Science and Technology(香港科技大学) ; Halmstad University(哈尔姆斯塔德大学)
AI总结 针对医疗大语言模型在印地语上表现不佳的问题,提出HiMed印地语医疗推理语料库与基准,并通过衰减支架奖励训练HiMed-8B模型,显著提升印地语医疗推理性能并缩小英印准确率差距。
ULF-Synth:用于儿科神经影像的物理引导超低场MRI增强
机构 * Kwame Nkrumah University of Science and Technology(科拉努姆大学科学与技术学院) ; University of Catania(卡塔尼亚大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Medical Artificial Intelligence Lab(医学人工智能实验室)
AI总结 提出ULF-Synth框架,通过从高场MRI合成逼真的超低场图像并采用空间-频率域目标,实现无需真实配对数据的超低场MRI增强,提升结构相似性和诊断可接受性。
Comments 10 pages, 2 figures, 3 tables
MOSS:自主智能体系统中通过源代码级重写的自我进化
机构 * University of Science and Technology of China(中国科学技术大学) ; Hong Kong Generative AI Research & Development Center(香港生成式AI研究与开发中心) ; The Hong Kong University of Science and Technology(香港理工大学) ; Hong Kong Baptist University(香港 Baptist大学)
AI总结 提出MOSS系统,通过源代码级重写实现自主智能体系统的自我进化,利用生产故障证据自动批处理和多阶段确定性流水线,在OpenClaw上单周期内将平均评分从0.25提升至0.61。
Comments 12 pages, 3 figures, 2 tables. Preprint. Code: https://github.com/hkgai-official/Moss
AnyMo:野外人体运动的几何感知与设置无关建模
机构 * The University of New South Wales(新南威尔士大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The Hong Kong University of Science and Technology(香港科技大学)
AI总结 提出AnyMo框架,通过物理模拟生成多样化IMU信号、图编码器预训练和LLM对齐,实现跨设备/数据集的零样本活动识别、跨模态检索和运动描述,性能显著提升。
Meta-Soft: 利用可组合元标记实现上下文保持的KV缓存压缩
机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) ; University of Macau(澳门大学) ; Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Hong Kong University of Science and Technology(香港科技大学)
AI总结 提出Meta-Soft动态压缩框架,通过可学习正交基矩阵和Gumbel-Softmax选择网络合成元标记,结合注意力流整合机制保留丢弃上下文信息,解决KV缓存压缩中的信息丢失和上下文断裂问题。
Comments 9 pages, 2 figures
OHP-RL:在线人类偏好作为机器人操作强化学习中的指导
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))
AI总结 提出OHP-RL框架,利用人类干预作为偏好信息,通过状态依赖偏好门自适应调节策略学习,在Franka机器人接触丰富的操作任务中实现高成功率、快速收敛和低人类干预。
通过静态-动态解耦实现高效长程视觉-语言-动作模型
机构 * Yale University(耶鲁大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
AI总结 提出DySta框架,通过将视觉输入解耦为多级静态和动态令牌,减少上下文长度并复用KV缓存,实现高效多帧集成和推理,在基准测试和真实任务中显著提升性能。
基于教师-学生扩散框架的实时无硬件HIFU干扰抑制
机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科学与技术大学计算机科学与工程系) ; State Key Laboratory of Ultrasound Engineering in Medicine, Chongqing Medical University, Chongqing 400016, China(重庆医科大学超声医学工程国家重点实验室) ; School of Microelectronics, Tianjin University, Tianjin 300072, China(天津大学微电子学院) ; Department of Chemical and Biological Engineering, The Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科学与技术大学化学与生物工程系) ; Division of Life Science, The Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科学与技术大学生命科学系) ; HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute, The Hong Kong University of Science and Technology, Futian, Shenzhen, China(香港科技大学深圳-香港协同创新研究院) ; State Key Laboratory of Nervous System Disorders, The Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科技大学神经系统疾病国家重点实验室)
AI总结 提出一种无需专用硬件同步的图像域扩散框架mHC-Diff,通过教师-学生蒸馏实现实时高保真HIFU干扰抑制,在临床数据集上达到26.65 dB PSNR和~20 FPS。
GDformer:超越子序列隔离的多变量时间序列异常检测
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; China Mobile (Jiangxi) Virtual Reality Technology Co., Ltd.(中国移动(江西)虚拟现实技术有限公司) ; Salesforce AI Research(Salesforce AI研究) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
AI总结 提出全局字典增强Transformer(GDformer),通过基于字典的交叉注意力机制学习整个序列中所有正常点的全局表示,并利用原型捕获正常点-全局相关权重分布,实现基于表示相似性的统一检测准则,在五个基准数据集上达到最先进性能。
RoboHitch: 从无序关键点学习视觉可供性用于系结
机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学)
AI总结 提出RoboHitch框架,利用无序3D关键点和RGB图像从人类演示中学习系结,通过动态图自编码器和卷积自编码器融合特征,预测抓取和放置可供性,实现遮挡下的系结。
移动众包中用于LLM微调的诚实在线偏好聚合
机构 * Singapore University of Technology and Design(新加坡科技设计大学) ; Hong Kong University of Science and Technology(香港科技大学)
AI总结 针对移动众包中工人可能策略性谎报偏好反馈的问题,提出一种动态贝叶斯博弈模型和在线加权聚合机制,确保工人诚实反馈并实现次线性遗憾。
PASA:一种针对语义不变攻击的LLM生成文本的原则性嵌入空间水印方法
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))
AI总结 提出PASA水印算法,在潜在嵌入空间的语义簇上嵌入和检测水印,通过理论框架实现检测精度、鲁棒性和失真的基本权衡,在强释义攻击下仍保持鲁棒性和文本质量。