CriPO: Enhancing Rubric-based RL via Self-Distillation
通过自蒸馏增强基于评分标准的强化学习
机构 * Zhejiang University(浙江大学) ; ByteDance(字节跳动)
AI总结 研究基于评分标准的强化学习中探索有限问题,提出标准蒸馏策略优化(CriPO),通过策略内自蒸馏同时解决未探索标准和被抑制标准问题,在医学和科学基准测试中表现出色,减少优化步骤并提升性能。
高校专区
通过自蒸馏增强基于评分标准的强化学习
机构 * Zhejiang University(浙江大学) ; ByteDance(字节跳动)
AI总结 研究基于评分标准的强化学习中探索有限问题,提出标准蒸馏策略优化(CriPO),通过策略内自蒸馏同时解决未探索标准和被抑制标准问题,在医学和科学基准测试中表现出色,减少优化步骤并提升性能。
DynImmune-BERT:基于神经常微分方程驱动的连续变换器的动态免疫组库建模
机构 * University of Macau(澳门大学) ; Hanyang University(汉阳大学) ; Zhejiang University(浙江大学) ; Wuhan University(武汉大学) ; Tsinghua University(清华大学) ; South China University of Technology(华南理工大学) ; University of Liverpool(利物浦大学)
AI总结 研究针对纵向T细胞受体组库建模问题,提出DynImmune-BERT模型,结合多种方法,能在有纵向组库结构时补充静态编码器,通过特定评估方式得出结果,对小外部队列和协议差异需谨慎解读。
Comments 13 pages, 6 figures
DAG-FM:异构因果机制下因果发现的基础模型
机构 * Zhejiang University(浙江大学) ; Tsinghua University(清华大学)
AI总结 针对观测表格数据因果发现难题,提出DAG-FM基础模型,通过自回归阶段、表格交互块及叶专家混合处理复杂情况,经迭代推理构建DAG,在合成及真实数据集上性能优于传统算法和其他模型。
Comments 33 pages, 9 figures, 12 tables, preprint
4DVGGT-D: 具有改进动态深度估计的4D视觉几何变换器
机构 * Peking University(北京大学) ; Zhejiang University(浙江大学) ; Huzhou University(湖州大学) ; Huawei(华为) ; Tongji University(同济大学)
AI总结 本文提出一种无需训练的渐进解耦框架,通过稳定相机姿态和几何细化,解决动态与静态的分离问题,提升4D场景重建性能。
弥合认知鸿沟:面向6G智能AI-RAN的统一记忆范式
机构 * Sun Yat-sen University, China(中山大学,中国) ; Zhejiang University, China(浙江大学,中国) ; University of Exeter, U.K.(埃克塞特大学,英国) ; Singapore University of Technology and Design, Singapore(新加坡科技设计大学,新加坡) ; Purple Mountain Laboratories, Nanjing, China(紫金山实验室,南京,中国)
AI总结 本文提出一种统一记忆范式,通过将生物记忆层次映射到异构计算架构,弥合感知与推理之间的鸿沟,实现6G网络中自主决策的跨时间尺度状态共享。
Comments This work has been submitted to the IEEE for possible publication
SOD:分步式在线蒸馏用于小型语言模型代理
机构 * Zhejiang University(浙江大学) ; Large Language Model Department, Tencent(腾讯大语言模型部门) ; University of Science and Technology of China(中国科学技术大学) ; National University of Singapore(新加坡国立大学)
AI总结 针对小型语言模型中工具集成推理的稳定性问题,提出SOD分步式在线蒸馏框架,通过动态调整蒸馏强度缓解教师信号误导,提升推理性能。
Chimera:用于可信数据平面智能的神经符号注意力原语
机构 * University of Macau(澳门大学) ; Zhejiang University(浙江大学) ; University of Southampton(南安普顿大学) ; University of Liverpool(利物浦大学) ; Fudan University(复旦大学) ; Renmin University of China(中国人民大学) ; New York Institute of Technology(纽约理工学院) ; University of Bologna(博洛尼亚大学) ; Minzu University of China(民族大学) ; Hanyang University(汉阳大学)
AI总结 Chimera提出了一种框架,将神经计算和符号约束映射到数据平面原语,实现可信推断,通过线性化注意力近似和层级键选择机制,在资源限制下实现高保真推理。
Comments 22 pages, 10 figures
GaiaFlow:基于语义的扩散调优用于碳节约搜索
机构 * University of Macau(澳门大学) ; Renmin University of China(中国人民大学) ; Fudan University(复旦大学) ; Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; University of Liverpool(利物浦大学) ; Peking University(北京大学) ; Northeast Normal University(东北师范大学) ; Minzu University of China(民族大学)
AI总结 GaiaFlow通过结合语义引导的扩散调优与硬件无关的性能建模策略,在保证检索精度的同时降低环境影响,实现了高效且可持续的神经搜索系统。
Comments 19 pages, 7 figures
缺失-by-设计:可撤销多模态情感分析的可验证模态删除
机构 * University of Macau(澳门大学) ; Zhejiang University(浙江大学) ; Fudan University(复旦大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Juntendo University(立命馆大学) ; Tsinghua University(清华大学) ; University of Chinese Academy of Sciences(中国科学院大学)
AI总结 本文提出MBD框架,通过结构化表示学习和可验证参数修改流程,实现可撤销多模态情感分析中的模态删除,实验表明其在不完整输入下具有强预测性能,并实现隐私与效用的平衡。
Comments 21 pages, 6 figures. In the previous version, Juntendo University was erroneously listed as the affiliation; we must clarify that this paper has absolutely no relation to Juntendo University. Therefore, we have replaced this affiliation in the new version
AST:自适应、无缝且无需训练的精确语音编辑
机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) ; Innovation and Management Center of the School of Software (Ningbo), Zhejiang University(浙江大学软件学院(宁波)创新与管理中心) ; Institute of Remote Sensing Satellite, China Academy of Space Technology(中国空间技术研究院遥感卫星研究所) ; Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字智能服务技术重点实验室)
AI总结 本文提出AST框架,通过预训练自回归TTS模型实现精确语音编辑,引入潜变量重组和自适应弱事实引导,提升编辑区域的时序一致性和语音质量,同时引入LibriSpeech-Edit数据集和WDTW指标。
面向缺失数据的多模态融合用于统一微服务故障管理
机构 * Zhejiang University(浙江大学)
AI总结 本文提出ARMOR框架,通过自监督学习解决微服务故障管理中多模态数据缺失问题,提升异常检测、故障分类和根本原因定位的性能。
Comments Accepted by the Proceedings of the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE '26), 2026. This is the authors' version of the work; the definitive Version of Record is forthcoming
SARe: 基于结构的大规模3D碎片重组
机构 * State Key Lab of CAD\&CG, Zhejiang University(浙江大学CAD与计算机图形学国家重点实验室) ; School of Software Technology, Zhejiang University(浙江大学软件学院) ; Laboratory of Art and Archaeology Image, Zhejiang University(浙江大学艺术与考古图像实验室)
AI总结 本文提出SARe框架,通过生成式方法解决大规模3D碎片重组问题,通过显式接触建模提高接触推理的稳定性与一致性,实验证明在碎片数量增加时具有更优的性能。
Comments 9 pages, 5 figures
LADY:用于自动驾驶效率的线性注意力,无需Transformer
机构 * Udeer AI ; Zhejiang University(浙江大学) ; Yuanshi Intelligence(元世智能)
AI总结 LADY是首个基于线性注意力的端到端自动驾驶生成模型,通过常数时间与内存复杂度实现高效长时序建模与跨模态交互。
Comments Accepted by IEEE RAL
WorldMirror:基于任意先验提示的通用三维世界重建
机构 * Zhejiang University(浙江大学) ; Chinese University of Hong Kong(香港中文大学) ; Tencent Hunyuan(腾讯混元)
AI总结 本研究提出WorldMirror这一统一前馈模型,可整合多种几何先验并生成多种三维表示,在多类三维几何任务的基准测试中达到最优性能且推理效率高。
Comments Accepted to ICML 2026. Code: https://github.com/Tencent-Hunyuan/HunyuanWorld-Mirror Project page: https://3d-models.hunyuan.tencent.com/world/
Mamba Policy:基于混合选择性状态模型的高效3D扩散策略
机构 * Microelectronics Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)微电子领域) ; Division of Emerging Interdisciplinary Areas, The Hong Kong University of Science and Technology(香港科技大学新兴交叉领域 division) ; Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) ; Center for X-Mechanics, Zhejiang University(浙江大学X力学中心)
AI总结 本研究提出Mamba Policy,以XMamba Block融合Mamba与注意力机制,参数量减超80%,在Adroit等数据集上性能优异且计算资源需求低,长 horizon 场景鲁棒性更强。
Comments Accepted to IROS 2025. Project Page: https://sagecao1125.github.io/mamba_policy/