arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-03-12 至 2026-03-12 共收录 8
2603.10701 2026-03-12 cs.SD cs.AI

AlphaFlowTSE: One-Step Generative Target Speaker Extraction via Conditional AlphaFlow

AlphaFlowTSE:通过条件AlphaFlow实现的一步生成目标说话人提取

Duojia Li, Shuhan Zhang, Zihan Qian, Wenxuan Wu, Shuai Wang, Qingyang Hong, Lin Li, Haizhou Li

机构 * School of Electronic Science and Engineering, Xiamen University, Xiamen, China(1 厦门大学电子科学与技术学院,厦门,中国) School of Informatics, Xiamen University, Xiamen, China(2 厦门大学信息学院,厦门,中国) School of Intelligence Science and Technology, Nanjing University, Suzhou, China(3 南京大学智能科学与技术学院,苏州,中国) Shenzhen Loop Area Institute, Shenzhen, China(4 深圳循环区研究所,深圳,中国) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, Shenzhen, China(5 香港中文大学人工智能学院,深圳,中国) The Chinese University of Hong Kong, Shatin, N.T., Hong Kong SAR, China(6 香港中文大学,沙田,香港特别行政区,中国)

AI总结 AlphaFlowTSE通过条件AlphaFlow实现一步生成目标说话人提取,提升目标语音保真度和真实混合泛化能力。

Comments Submitted to Interspeech 2026 for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10592 2026-03-12 cs.LG cs.AI

Gradient Flow Drifting: Generative Modeling via Wasserstein Gradient Flows of KDE-Approximated Divergences

梯度流漂移:基于KDE近似发散的梯度流的生成建模

Jiarui Cao, Zixuan Wei, Yuxin Liu

机构 * The Chinese University of Hong Kong(香港中文大学) Civil Aviation University of China(中国民航大学)

AI总结 本文提出梯度流漂移模型,通过Wasserstein梯度流生成模型,结合反向KL和χ²发散避免模式崩溃与模糊,扩展至黎曼流形以适应语义空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10059 2026-03-12 cs.RO

Model-Free Co-Optimization of Manufacturable Sensor Layouts and Deformation Proprioception

无模型的可制造传感器布局与变形本体感觉共优化

Yingjun Tian, Guoxin Fang, Aoran Lyu, Xilong Wang, Zikang Shi, Yuhu Guo, Weiming Wang, Charlie C. L. Wang

机构 * Department of Mechanical and Aerospace Engineering, The University of Manchester, United Kingdom(曼彻斯特大学机械与航空航天工程系) Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong, Shatin, Hong Kong(香港中文大学机械与自动化工程系)

AI总结 本文提出一种无模型的数据驱动方法,通过共同优化传感器布局和网络参数,提升软机器人和可穿戴设备中自由形变形的预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09488 2026-03-12 cs.CV

Streaming Autoregressive Video Generation via Diagonal Distillation

通过对角蒸馏实现流式自回归视频生成

Jinxiu Liu, Xuanming Liu, Kangfu Mei, Yandong Wen, Ming-Hsuan Yang, Weiyang Liu

机构 * South China University of Technology(南方科技大学) Westlake University(西湖大学) Johns Hopkins University(约翰霍普金斯大学) University of California, Merced(加州大学默塞德分校) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出对角蒸馏方法,通过不对称生成策略和隐式光学流建模,在减少计算步骤的同时提升视频生成的运动质量和效率。

Comments ICLR 2026 (31 pages, 10 figures, project page: https://spherelab.ai/diagdistill/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02816 2026-03-12 cs.CV cs.AI

BrandFusion: A Multi-Agent Framework for Seamless Brand Integration in Text-to-Video Generation

BrandFusion: 一种多智能体框架,用于文本到视频生成中的无缝品牌整合

Zihao Zhu, Ruotong Wang, Siwei Lyu, Min Zhang, Baoyuan Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) State University of New York at Buffalo(纽约州立大学布法罗分校) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 BrandFusion通过多智能体框架实现文本到视频生成中的无缝品牌整合,提升品牌辨识度和内容自然度,推动T2V的可持续商业化应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23162 2026-03-12 cs.RO cs.CV

Cosmos-H-Surgical: Learning Surgical Robot Policies from Videos via World Modeling

Cosmos-H-Surgical: 通过世界建模学习手术机器人策略

Yufan He, Pengfei Guo, Mengya Xu, Zhaoshuo Li, Andriy Myronenko, Dillan Imans, Bingjie Liu, Dongren Yang, Mingxue Gu, Yongnan Ji, Yueming Jin, Ren Zhao, Baiyong Shen, Daguang Xu

机构 * NVIDIA The Chinese University of Hong Kong(香港中文大学) Sung Kyun Kwan University(全州大学) Wenzhou Medical University(温州医学院) National University of Singapore(新加坡国立大学) Ruijin Hospital(瑞金医院)

AI总结 本文提出通过世界建模学习手术机器人策略,利用合成数据和逆动力学模型提升自主手术能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12583 2026-03-12 eess.AS cs.SD

Robust Audio-Visual Target Speaker Extraction with Emotion-Aware Multiple Enrollment Fusion

鲁棒的音频视觉目标说话人提取与情感感知多注册融合

Zhan Jin, Bang Zeng, Peijun Yang, Jiarong Du, Wei Ju, Yao Tian, Juan Liu, Ming Li

机构 * School of Computer Science, Wuhan University, Wuhan, China(1 武汉大学计算机学院,武汉,中国) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(2 香港中文大学(深圳)人工智能学院,中国) School of Artificial Intelligence, Wuhan University, Wuhan, China(3 武汉大学人工智能学院,武汉,中国) School of Cyber Science and Engineering, Wuhan University, Wuhan, China(4 武汉大学网络科学与工程学院,武汉,中国) Digital Innovation Research Center, Duke Kunshan University, Kunshan, China(5 香港中文大学(深圳)数字创新研究中心,中国) AI Center, OPPO, Beijing, China(6 OPPO人工智能中心,北京,中国)

AI总结 本文提出一种鲁棒的音频视觉目标说话人提取方法,通过情感感知的多注册融合技术,在模态缺失情况下提升提取性能和鲁棒性。

Comments submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12188 2026-03-12 cs.LG cs.AI

Boosting Cross-problem Generalization in Diffusion-Based Neural Combinatorial Solver via Inference Time Adaptation

通过推理时间适应提升基于扩散的神经组合求解器的跨问题泛化能力

Haoyu Lei, Kaiwen Zhou, Yinchuan Li, Zhitang Chen, Farzan Farnia

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Huawei Noah’s Ark Lab(华为诺亚实验室)

AI总结 本文提出DIFU-Ada框架,通过推理时间适应提升基于扩散的神经组合求解器在跨问题和跨尺度上的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏