R3D: Revisiting 3D Policy Learning
R3D:重新审视3D策略学习
机构 * Zhejiang University(浙江大学) ; ShanghaiTech University(上海科技大学)
AI总结 本文针对3D策略学习中的训练不稳定和过拟合问题,提出结合可扩展的Transformer3D编码器与扩散解码器的新架构,有效提升3D模仿学习的性能。
高校专区
R3D:重新审视3D策略学习
机构 * Zhejiang University(浙江大学) ; ShanghaiTech University(上海科技大学)
AI总结 本文针对3D策略学习中的训练不稳定和过拟合问题,提出结合可扩展的Transformer3D编码器与扩散解码器的新架构,有效提升3D模仿学习的性能。
WavAlign:通过自适应混合后训练增强口语对话模型的智能与表达性
机构 * Zhejiang University(浙江大学) ; Tongyi Fun Team, Alibaba Group(通义实验室,阿里巴巴集团) ; Beijing University of Technology(北京理工大学)
AI总结 本文提出WavAlign方法,通过自适应混合后训练提升口语对话模型的智能与表达性,通过语义通道约束和显式锚定改进语音生成,避免不可靠的偏好梯度。
双轴生成奖励模型:面向交互口语对话模型中语义和轮流鲁棒性的研究
机构 * Zhejiang University(浙江大学) ; Tongyi Fun Team, Alibaba Group(通义Fun团队,阿里巴巴集团) ; Beijing University of Technology(北京理工大学)
AI总结 本文提出双轴生成奖励模型,通过详细分类和标注数据集理解复杂交互动态,提供语义质量和交互时间的独立评估,提升口语对话模型的鲁棒性与性能。
KnowRL: 探索知识增强型强化学习以提升事实性
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团) ; Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(知识图谱联合实验室)
AI总结 KnowRL通过整合事实性奖励提升慢思考模型的事实准确性,实验表明其有效缓解了幻觉问题并保持推理能力。
Comments ACL 2026
通过上下文无关且不可察觉的音频提示注入劫持大型音频-语言模型
机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) ; Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院) ; Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学)
AI总结 本文提出AudioHijack框架,通过生成不可察觉的对抗性音频劫持LALMs,实验显示在6种恶意行为中平均成功率达79%-96%。
Comments Accepted by IEEE S&P 2026
基于扩散噪声的深度伪造检测泛化
机构 * Zhejiang University(浙江大学)
AI总结 本文提出利用扩散噪声特征提升深度伪造检测的泛化能力,通过引入注意力引导的噪声学习框架,增强模型对真实与合成图像差异的捕捉,实验表明在多个基准上取得最佳性能。
Comments 17 pages
CSRA:受控频域残差增强用于鲁棒脓毒症预测
机构 * Tianjin University(天津大学) ; Tianjin Medical University General Hospital(天津医科大学总医院) ; Department of Emergency Medicine, Sir Run Run Shaw Hospital, Zhejiang University School of Medicine(急诊医学科,邵氏医院,浙江大学医学院)
AI总结 本文提出CSRA框架,通过频域残差增强提升短期多系统ICU时间序列中脓毒症预测的鲁棒性,实验显示其在回归和分类任务中均优于基线方法。
通过因果分解实现大型语言模型的鲁棒奖励建模
机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Department of Statistics, University of Chicago(芝加哥大学统计系)
AI总结 本文提出通过因果分解学习解码器,以增强奖励模型对提示意图的建模,从而提升在数学、帮助性和安全性的基准测试中的表现。
基于转录组的免疫治疗反应预测模型显示跨队列泛化能力有限
机构 * UNSW BioMedical Machine Learning Lab (BML), School of Biomedical Engineering, UNSW Sydney(UNSW生物医学机器学习实验室(BML),生物医学工程学院,UNSW悉尼) ; School of Biomedical Engineering, UNSW(生物医学工程学院,UNSW) ; Department of Computer Science, Zhejiang University(浙江大学计算机科学系) ; Institute for Intelligent Systems Research and Innovation, Deakin University(智能系统研究与创新研究所,德金大学) ; School of Engineering & Technology, Duy Tan University(工程与技术学院,杜益大学) ; School of Computing, Macquarie University(计算学院,麦觉大学) ; Center of Excellence in Precision Medicine and Digital Health, Faculty of Dentistry, Chulalongkorn University(精准医学与数字健康中心,牙科学院,朱拉隆功大学)
AI总结 研究评估了九种先进的转录组免疫检查点抑制剂反应预测模型,发现基于bulk RNA-seq的模型在多数队列中表现接近随机,而基于scRNA-seq的模型仅略有提升,路径分析显示生物标志物信号稀疏且不一致。
MCP-Flow:帮助LLM代理掌握现实世界、多样且可扩展的MCP工具
机构 * TikTok ; Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学) ; University of Illinois at Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 MCP-Flow通过自动化流程提升LLM在现实世界MCP环境中的能力,通过大规模服务器发现、数据合成和模型训练,生成高质量指令-功能调用对和轨迹,推动代理任务性能提升。
Comments ACL 2026 Main, Camera Ready