arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2026-05-12 至 2026-05-12 共收录 40
2605.05611 2026-05-12 cs.SD cs.AI eess.AS

X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning

X-Voice:通过零样本跨语言语音克隆让每个人都能说30种语言

Rixi Xu, Qingyu Liu, Haitao Li, Yushen Chen, Zhikang Niu, Yunting Yang, Jian Zhao, Ke Li, Berrak Sisman, Qinyuan Cheng, Xipeng Qiu, Kai Yu, Xie Chen

机构 * MoE Key Lab of Artificial Intelligence, X-LANCE Lab, Shanghai Jiao Tong University(摩埃人工智能重点实验室、X-LANCE实验室、上海交通大学) Shanghai Innovation Institute(上海创新研究院) Center for Language and Speech Processing, Johns Hopkins University(语言与语音处理中心、约翰霍普金斯大学) Geely(吉利) Dataocean AI(数据海洋人工智能) Zhejiang University(浙江大学) Fudan University(复旦大学)

AI总结 X-Voice通过双阶段训练和多语言语音合成架构,实现零样本跨语言语音克隆,优于现有多语言系统并在性能上接近大规模模型。

Comments 16 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22088 2026-05-12 cs.RO

Force Policy: Learning Hybrid Force-Position Control Policy under Interaction Frame for Contact-Rich Manipulation

力政策:在交互框架下学习混合力-位置控制策略以进行密集接触 manipulation

Hongjie Fang, Shirun Tang, Mingyu Mei, Haoxiang Qin, Zihao He, Jingjing Chen, Ying Feng, Chenxi Wang, Wanxi Liu, Zaixing He, Cewu Lu, Shiquan Wang

机构 * Noematrix Flexiv Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出力政策,通过视觉和力反馈实现全局-局部控制,提升接触稳定性和执行质量,适用于复杂接触任务。

Comments accepted by RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20012 2026-05-12 eess.SP cs.LG

Reliable LLM-Based Edge-Cloud-Expert Cascades for Telecom Knowledge Systems

可靠的基于大语言模型的边缘-云-专家级联系统用于电信知识系统

Qiushuo Hou, Sangwoo Park, Matteo Zecchin, Yunlong Cai, Guanding Yu, Osvaldo Simeone, Tommaso Melodia

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Centre for Intelligent Information Processing Systems (CIIPS), Department of Engineering, King’s College London(伦敦国王学院工程系智能信息处理系统中心) Intelligent Networked Systems Institute (INSI) at Northeastern University(东北大学智能网络化系统研究所)

AI总结 本文提出一种边缘-云-专家级联的LLM知识系统,通过问答流程实现决策,利用高效边缘模型处理常规查询,云模型处理复杂问题,必要时引入专家。通过统计严谨的阈值选择方法,保证在给定置信水平下可靠性。

Comments This paper has been submitted to a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18610 2026-05-12 cs.LG

The Procrustean Bed of Time Series: The Optimization Bias in Point-wise Loss Functions

时间序列的普鲁斯特床:点 wise 损失函数中的优化偏置

Rongyao Cai, Yuxi Wan, Kexin Zhang, Ming Jin, Zhiqiang Ge, Daoyi Dong, Hang Yu, Yong Liu, Qingsong Wen

机构 * Zhejiang University(浙江大学) Griffith University(格里菲斯大学) Southeast University(东南大学) University of Technology Sydney(悉尼科技大学) Ant Group(蚂蚁集团) Squirrel Ai Learning

AI总结 本文研究了点 wise 损失函数在时间序列预测中的优化偏置问题,提出通过序列长度缩减和结构正交化进行偏置消除,并通过实验验证了该方法的有效性。

Comments 54 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09158 2026-05-12 cs.CV

FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO

FaVChat: 基于数据高效GRPO的层次提示-查询引导的面部视频理解

Fufangchen Zhao, Songbai Tan, Xuerui Qiu, Linrui Xun, Wenhao Jiang, Jinkai Zheng, Hehe Fan, Jian Gao, Danfeng Yan, Ming Li

机构 * State Key Laboratory of Networking and Switching Technology, BUPT(北京邮电大学网络与交换技术国家重点实验室) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳)) Institute of automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院) Central South University(中南大学) Zhejiang University(浙江大学) College of communication Engineering, Hangzhou Dianzi University(杭州电子科技大学通信工程学院)

AI总结 FaVChat通过层次化提示引导框架提取面部动态细节信息,结合数据高效GRPO策略提升学习效率,实现在面部视频理解任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10433 2026-05-12 cs.CV cs.LG eess.SP

Implicit Neural Compression of Point Clouds

隐式神经网络点云压缩

Hongning Ruan, Yulin Shao, Qianqian Yang, Liang Zhao, Zhaoyang Zhang, Dusit Niyato

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电子与电气工程系) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院)

AI总结 本文提出NeRC³框架,利用隐式神经表示实现点云的高效压缩,通过坐标基神经网络编码几何与属性,并扩展至动态点云压缩,实验验证其在静态和动态点云压缩中的优越性能。

Journal ref IEEE Transactions on Image Processing, vol. 35, pp. 260-275, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08277 2026-05-12 cs.CR cs.AI

Mitigating Many-shot Jailbreak Attacks with One Single Demonstration

通过一个单个演示缓解多示例劫持攻击

Kejia Chen, Jiawen Zhang, Boheng Li, Pengcheng Li, Jian Lou, Zunlei Feng, Mingli Song, Ruoxi Jia, Tianwei Zhang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Sun Yat-sen University(中山大学) University of Science and Technology of China(中国科学技术大学) Virginia Tech(弗吉尼亚理工大学)

AI总结 本文研究多示例劫持攻击为何随着演示数量增加而增强,提出通过添加固定单个安全演示来对抗该攻击,从而提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08207 2026-05-12 cs.CV

A Breast Vision Pathology Foundation Model for Real-world Clinical Utility

乳腺病理科基础模型用于真实世界临床应用

Yingxue Xu, Zhengyu Zhang, Xiuming Zhang, Mengwei Xu, Fengtao Zhou, Yihui Wang, Jiabo Ma, Yi Xin, Danyi Li, Chengyu Lu, Zhijian Cen, Ying Tan, Qingbing Yao, Qi Wang, Zizhao Gao, Yong Zhang, Jingjing Chen, Feifei Liu, Qian Xu, Yi Dai, Hongxuan Tan, Cheng Jin, Huajun Zhou, Zhengrui Guo, Ling Liang, Hongyi Wang, Yingcong Chen, Xi Wang, Zhenhui Li, Ronald Cheong Kin Chan, Ning Mao, Muyan Cai, Zhe Wang, Li Liang, Hao Chen

机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科技大学计算机科学与工程系) Department of Pathology, Nanfang Hospital, School of Basic Medical Sciences, Southern Medical University, Guangzhou, China(南方医科大学基础医学学院病理学系,广州医院) Department of Pathology, The First Affiliated Hospital, School of Medicine, Zhejiang University, Hangzhou, China(浙江大学医学院第一附属医院病理学系,杭州) State Key Laboratory of Holistic Integrative Management of Gastrointestinal Cancers, Department of Pathology, School of Basic Medicine and Xijing Hospital, Fourth Military Medical University, Xi’an, China(胃肠癌整体整合管理国家重点实验室,第四军医大学基础医学学院病理学系,西京医院)

AI总结 本文提出BRAVE模型,通过101638张乳腺全切片图像评估其在乳腺癌诊断中的临床实用性,展示了在不同阶段的病理评估中提升诊断效率和准确性的能力。

Comments 60 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08181 2026-05-12 cs.CV cs.AI cs.LG

Text-Guided Multi-Scale Frequency Representation Adaptation

基于文本的多尺度频率表示适应

Weicai Yan, Xinhua Ma, Wang Lin, Tao Jin

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出FreqAdapter,通过在频域进行多尺度信号微调,结合文本信息减少信息冗余,提升多模态模型的性能与效率。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08129 2026-05-12 cs.LG

Towards Customized Multimodal Role-Play

迈向定制化的多模态角色扮演

Chao Tang, Jianzong Wu, Qingyu Shi, Ye Tian, Aixi Zhang, Hao Jiang, Jiangning Zhang, Yunhai Tong

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

AI总结 本文提出定制化多模态角色扮演任务,通过统一模型和两阶段训练框架实现角色个性化,实验表明方法在角色扮演任务中优于现有方法。

Comments Code available at https://github.com/Tangc03/UniCharacter Project page available at https://tangc03.github.io/UniCharacter.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏