VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching
VoxAudio:基于多奖励自回归流匹配的发声音频合成
机构 * Zhejiang University(浙江大学)
AI总结 VoxAudio是一种多奖励自回归流匹配模型,通过架构、偏好、数据层面的优化,解决现有T2A系统发声控制不足的问题,在多基准上验证了有效性与效率。
高校专区
VoxAudio:基于多奖励自回归流匹配的发声音频合成
机构 * Zhejiang University(浙江大学)
AI总结 VoxAudio是一种多奖励自回归流匹配模型,通过架构、偏好、数据层面的优化,解决现有T2A系统发声控制不足的问题,在多基准上验证了有效性与效率。
JAPE:多变量时间序列中的联合异常预测与内在解释
机构 * Zhejiang University(浙江大学) ; Aalborg University(奥尔堡大学) ; School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算技术学院)
AI总结 JAPE是首个联合异常预测与解释的多变量时间序列框架,通过解耦时空建模等技术提升预测性能与可解释性,在五个真实基准上实现F1、AUC-PR及MRR的显著提升。
SkillZip:通过发现可重用结构实现自进化智能体的免评估技能压缩
机构 * Alibaba Group(阿里巴巴集团) ; Zhejiang University(浙江大学) ; Duke University(杜克大学)
AI总结 SkillZip 是一种免评估的自进化智能体技能压缩方法,通过提炼重复规则与动作序列实现高效压缩,在性能、泛化性及成本上优于评估引导压缩。
时间序列预测器是否使用了正确的历史信息:时间延迟的可恢复性、恢复及功能使用
机构 * Supcon Technology(中控技术) ; College of Artificial Intelligence, Zhejiang University(浙江大学人工智能学院)
AI总结 该研究针对时间序列模型,分析了延迟可恢复性、报告与功能使用的问题,发现多数模型存在延迟报告正确但实际未使用对应历史的情况,提出的路由方法可实现预测与报告的对齐。
Retrofit: 二进制安全检测与分析中的受控遗忘持续学习
机构 * University College London(伦敦大学学院) ; Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
AI总结 Retrofit通过受控遗忘机制在持续学习中平衡知识保留与适应性,无需历史数据,在恶意软件检测和二进制摘要任务中提升了性能和泛化能力。
Comments Accepted by USENIX Security 2026. The artifact received all three badges
FusionBERT: 多视角图像-3D检索 via 跨注意力视觉融合与正常感知3D编码器
机构 * IROOTECH TECHNOLOGY ; Wolf 1069 b Lab, Sany Group(三一集团Wolf 1069 b实验室) ; Zhejiang University(浙江大学) ; School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) ; BPIT, Sany Group(三一集团BPIT)
AI总结 FusionBERT通过跨注意力视觉融合和正常感知3D编码器,实现多视角图像-3D多模态检索,提升跨模态检索性能。
Comments 9 pages, 5 figures, 3 tables
PRISM:基于关节潜在分解的流式人类动作生成
机构 * State Key Laboratory of CAD & CG(CAD与计算机图形学国家重点实验室) ; Zhejiang University(浙江大学) ; Zhejiang Lab(浙江实验室) ; Computer Animation & Perception Group(计算机动画与感知小组)
AI总结 PRISM通过关节潜在分解和无噪声条件注入,实现了流式人类动作生成,统一了文本到动作、姿态条件生成等多种任务,达到SOTA性能。
上下文源码与信道编码
机构 * College of Information Science and Electronic Engineering, Zhejiang University(信息科学与电子工程学院,浙江大学) ; Zhejiang Lab(浙江实验室) ; Macau University of Science and Technology, China(澳门科学理工学院,中国)
AI总结 本文提出一种接收端上下文解码框架,通过改进SSCC的鲁棒性,在不修改发射端的情况下提升低信噪比下的传输性能。
Comments Published in SCIENCE CHINA Information Sciences
基础模型时代中的具身机器人操作:规划与学习视角
机构 * Xi’an Jiaotong Univeristy(西安交通大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Chinese Academy of Sciences(中国科学院) ; Westlake University(西湖大学) ; Zhejiang University(浙江大学) ; University of Sydney(悉尼大学) ; BAAI(百度人工智能研究院) ; Peking University(北京大学)
AI总结 本文探讨了基础模型时代机器人操作的规划与学习方法,分析了高层推理与低层控制的统一框架,并提出了未来研究方向。
Comments This work is a re-architected core derived from the full survey ( arXiv:2510.10903 (https://arxiv.org/abs/2510.10903) ), refined to highlight the most central themes and representative studies
生成模型遗忘:基于目标事件、遗忘算子与评估协议的综述
机构 * Zhejiang University(浙江大学) ; Hangzhou Dianzi University(杭州电子科技大学)
AI总结 本文针对生成模型遗忘(GenMU)的碎片化问题,提出目标约束分布投影框架,综述其应用并指出未来方向,为该领域提供统一视角。