arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-06-23 至 2026-06-23 共收录 18
2606.21888 2026-06-23 eess.AS cs.SD 新提交

ProsoCodec: Prosody-Oriented Speech Codec for Voice Conversion

ProsoCodec:面向韵律的语音编解码器用于语音转换

Jeongsoo Choi, Ji-Hoon Kim, Shujie Hu, Joon Son Chung

机构 * KAIST, South Korea(韩国科学技术院) Chung-Ang University, South Korea(Chung-Ang 大学) The Chinese University of Hong Kong, China(香港中文大学)

AI总结 提出ProsoCodec,通过将韵律建模为条件残差而非分离流,在语音转换中改善韵律保留并减少源音色泄漏。

Comments Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23685 2026-06-23 cs.RO 新提交

LaST-HD: Learning Latent Physical Reasoning from Scalable Human Data for Robot Manipulation

LaST-HD:从可扩展人类数据中学习潜在物理推理以进行机器人操作

Jiaming Liu, Yinxi Wang, Chenyang Gu, Siyuan Qian, Xiangju Mi, Hao Chen, Jiawei Chen, Qingpo Wuwu, Xiaoqi Li, Nuowei Han, Yiming Zhang, Xuheng Zhang, Yang Yue, Yeqing Yang, Lei Wang, Peng Jia, Hao Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) The Chinese University of Hong Kong(香港中文大学) Simplexity Robotics Aether Tech

AI总结 提出LaST-HD框架,通过将人手与机器人演示在共享潜在推理空间中对齐,利用未配对轨迹训练世界模型合成统一潜在目标,实现跨形态物理动力学内化,并开发低成本数据手套OOL Glove,结合混合训练策略,仅用少量人类数据即可达到高泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23589 2026-06-23 cs.RO 新提交

KEMO: Event-Driven Keyframe Memory for Long-Horizon Robot Manipulation with VLA Policies

KEMO: 面向长程机器人操作的VLA策略事件驱动关键帧记忆

Yihan Zeng, Minghao Ye, Yiyuan Chen, Yide Shentu, Philipp Wu, Zike Yan, Zhongyu Li

机构 * Hong Kong Embodied AI Lab(香港具身智能实验室) The Chinese University of Hong Kong(香港中文大学) University of Electronic Science and Technology of China(电子科技大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出KEMO,一种轻量级插件式记忆框架,通过事件驱动选择关键帧并编码为紧凑记忆令牌,结合交叉注意力和门控残差融合,提升VLA策略在长程操作中的任务成功率23.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23459 2026-06-23 cs.CL 新提交

TriggerBench: Investigating Prospective Memory for Large Language Models

TriggerBench: 探究大型语言模型的前瞻记忆

Tianhua Zhang, Xinjiang Wang, Qianxi Zhang, Qi Chen, Kun Li, Yaoqi Chen, Dingdong Wang, Helen Meng, Yan Lu

机构 * The Chinese University of Hong Kong(香港中文大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 提出TriggerBench基准,系统评估LLM的前瞻记忆能力,发现其存在精度-召回权衡、注意力脆弱性,且比回溯记忆更难,可作为推理能力的指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22977 2026-06-23 cs.CL cs.AI 新提交

StatABench: Dataset and Framework for Evaluating Statistical Analysis Capabilities of LLMs

StatABench:评估大语言模型统计分析能力的数据集与框架

Youxin Zhu, Yixuan Ding, Peng Lai, Longyue Wang, Bingyi Jing, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) Alibaba Group(阿里巴巴集团) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Hong Kong(香港大学)

AI总结 提出StatABench基准,包含404道封闭题和30道开放建模任务,评估LLM在统计分析上的能力,实验显示最佳模型仅达68.6%准确率,揭示工具推理和建模决策等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22870 2026-06-23 cs.CV cs.AI 新提交

VideoLatent: Video-Language Learning via Latent Self-Forcing

VideoLatent: 通过潜在自强制进行视频-语言学习

Zi-Yuan Hu, Zicong Tang, Shijia Huang, Yanyang Li, Michael R. Lyu, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Weitu AI(微图AI)

AI总结 提出VideoLatent,一种通过潜在自强制训练范式(包括潜在对齐和潜在多样性目标)进行视觉潜在推理的多模态大语言模型,仅依赖标准视频-问答三元组,在14个基准上优于现有模型,并大幅降低训练/推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22445 2026-06-23 cs.CV cs.AI 新提交

DreamUV: Unwrap Artist-like UV by End-to-End Flow Matching

DreamUV: 通过端到端流匹配实现艺术家级UV展开

Quanyuan Ruan, Jiabao Lei, Xingyi Du, Xifeng Gao

机构 * South China University of Technology(华南理工大学) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Lightspeed(光速)

AI总结 提出DreamUV,将UV展开建模为生成式流匹配问题,通过学习网格条件传输过程生成艺术家风格的UV布局,并引入边界感知训练和模型在环微调策略,在专业数据集上生成更直边界和更紧轴对齐岛屿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21982 2026-06-23 cs.CV 新提交

CoDMD: Copula-aware Distribution Matching Distillation for Fast Video Generation

CoDMD: 基于Copula感知的分布匹配蒸馏用于快速视频生成

Wenhu Zhang, Kun Cheng, Changyuan Wang, Shiyao Li, Yuechen Zhang, Wenbo Li, Jiajun Zha, Jingyi Zhang, Kang Zhao, Jiaya Jia

机构 * HKUST(香港科技大学) Wan Team, Alibaba Group(阿里巴巴集团万团队) THU(清华大学) CUHK(香港中文大学) XDU(西安电子科技大学)

AI总结 针对视频扩散模型少步蒸馏中分布匹配蒸馏(DMD)的结构缺陷,提出Copula感知的DMD(CoDMD),通过轻量关系正则化器利用分数估计构建样本间和帧间关系矩阵,实现4步生成,速度提升约25倍,VBench得分达84.87。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21963 2026-06-23 cs.AI cs.SE 新提交

Holmes: Multimodal Agentic Diagnosis for Mixed-Language Mobile Crashes at Industrial Scale

Holmes: 工业级混合语言移动崩溃的多模态智能诊断

Jia Li, Wenyuan Ma, Ting Peng, Haibin Zheng, Yuetang Deng

机构 * The Chinese University of Hong Kong(香港中文大学) Tencent Inc.(腾讯公司)

AI总结 提出多智能体系统Holmes,通过多模态运行时信号合成重构崩溃上下文,采用层次化检索-探索-推理架构,在70M行代码中实现87.6%函数级定位准确率,将平均排查时间降低98%至约77秒。

Comments Accepted at FSE'26 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21661 2026-06-23 cs.CV 新提交

UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating

UnityShots: 基于记忆的多镜头音视频生成与边界感知门控

Jiehui Huang, Yuechen Zhang, Bin Xia, Jiahao Wang, Xu He, Zhenchao Tang, Meng Chu, Xin Tao, Pengfei Wan, Jiaya Jia

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) Kling Team, Kuaishou Technology(Kling团队,快手科技) Tsinghua University(清华大学) Sun Yat-sen University(中山大学)

AI总结 提出UnityShots,一种基于记忆的多镜头音视频生成系统,通过固定大小的长期和短期记忆槽及边界条件门控实现跨镜头连贯性,在多种条件模式下超越开源基线。

Comments https://jackailab.github.io/Projects/UnityShots

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21525 2026-06-23 cs.LG cs.AI 新提交

Backpropagating Through Simulation: Analytic Policy Gradients for Sample and Learning Efficient Differentiable Continuous Control

通过仿真反向传播:用于样本高效和学习高效的可微连续控制的解析策略梯度

Yueci Deng

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院)

AI总结 提出解析策略梯度(APG)方法,利用可微环境动力学通过仿真反向传播计算精确梯度,在四个连续控制任务中与PPO对比,显著提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21086 2026-06-23 cs.RO 新提交

ReFPO: Reflow Regularization for Flow Matching Policy Gradients

ReFPO:用于流匹配策略梯度的回流正则化

Ge Wang, Yibo Peng, Fan Feng, Shenhao Yan, Chengsi Yao, Jiahao Yang, Honghao Cai, Yiming Zhao, Xi Li, Jinke Ren, Shuguang Cui, Yatong Han, Zhen Li

机构 * Ising AI CUHK-Shenzhen(香港中文大学(深圳)) FNii-Shenzhen(深圳市未来智能网络研究院)

AI总结 提出ReFPO,一种通过显式回流正则化改进流匹配策略梯度的在线强化学习方法,稳定训练并实现高保真一步推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21053 2026-06-23 cs.SD cs.AI 新提交

Imitation Learning for Elder-Facing Speech Synthesis

面向老年人的模仿学习语音合成

Dongrui Han, Weidong Chen, Jiawen Kang, Mingyu Cui, Helen Meng, Xixin Wu

机构 * The Chinese University of Hong Kong(香港中文大学) Tencent Hunyuan(腾讯混元)

AI总结 提出模仿学习框架,结合两阶段在线策略奖励学习改进GRPO,从专家演示中学习TTS模型,以解决老年人偏好数据获取困难的问题,在客观和主观指标上优于基线。

Comments accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20661 2026-06-23 cs.AI cs.CL cs.LG 新提交

From Knowing to Acting: Benchmarking Self-Awareness Capability of LLM Agents

从知道到行动:基准测试LLM代理的自我意识能力

Yifan Li, Shengbin Yue, Boyu Feng, Jinhu Qi, Bo Ke, Zixing Song, Hongru Wang, Zhongyu Wei, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) University of Edinburgh(爱丁堡大学) Tencent(腾讯) University of Bristol(布里斯托大学)

AI总结 提出KAPRO框架和KAware数据集,通过解耦元认知判断与自主执行,评估LLM代理的自我意识能力,发现其与任务成功强相关但在内部能力场景中下降,开源模型易过度使用工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20591 2026-06-23 cs.NI cs.AI 新提交

Delay-Adaptive Speculation Control for Low-Latency Edge-Cloud LLM Inference

面向低延迟边缘-云LLM推理的延迟自适应推测控制

Kangkang Sun, Jianhua Li, Xiuzhen Chen, Junyi He, Minyi Guo

机构 * Shanghai Key Laboratory of Integrated Administration Technologies for Information Security, School of Computer Science, Shanghai Jiao Tong University(上海信息安全集成管理技术重点实验室,上海交通大学计算机科学学院) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(深圳大学理学院,香港中文大学(深圳))

AI总结 针对分布式边缘-云推理中推测解码的草稿长度在线控制问题,提出延迟单调阈值最优策略,并设计在线算法UCB-SpecStop,在真实测试台上验证了相变预测,延迟降低达22.4%。

Comments 16 pages, 9 figures, submitted to an IEEE journal for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23627 2026-06-23 stat.ML cs.LG math.ST stat.TH 新提交

Diffusion Models Adapt to Low-Dimensional Structure Under Flexible Coefficient Choices

扩散模型在灵活系数选择下适应低维结构

Changxiao Cai, Yuchen Jiao, Gen Li

机构 * Department of Industrial and Operations Engineering, University of Michigan(工业与运营工程系,密歇根大学) Department of Statistics and Data Science, Chinese University of Hong Kong(统计与数据科学系,中国香港大学)

AI总结 本文证明扩散模型在广泛系数选择下,仅需O(k/ε)次迭代即可生成ε-精确样本,独立于环境维度,从而验证了其适应低维结构的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21153 2026-06-23 math.OC cs.LG 新提交

DUET: Decentralized Bilevel Optimization without Lower-Level Strong Convexity

DUET: 无需下层强凸性的去中心化双层优化

Zhen Qin, Zhuqing Liu, Songtao Lu, Yingbin Liang, Jia Liu

机构 * Department of Electrical and Computer Engineering, The Ohio State University(俄亥俄州立大学电气与计算机工程系) Department of Computer Science and Engineering, University of North Texas(北卡罗来纳州立大学计算机科学与工程系) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系)

AI总结 针对去中心化双层优化中下层强凸性限制,提出单循环算法DUET,通过引入递减二次正则化消除该假设,并利用梯度跟踪处理数据异质性,实现近似KKT稳定点收敛。

Comments Published as a conference paper at ICLR 2025

Journal ref Published as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09520 2026-06-23 physics.chem-ph cs.AI 新提交

Closing the Prior-Posterior Loop: Self-Reflective Molecular Design with Analysis-Driven LLM Iteration

闭合先验-后验循环:基于分析驱动LLM迭代的自反性分子设计

Junyi Gong, Zijie Qiu, Ben Zhong Tang

机构 * Faculty of Chemistry, Shenzhen MSU-BIT University(深圳MSU-BIT大学化学学院) School of Science and Engineering, Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)科学与工程学院) Department of Chemistry, Hong Kong University of Science and Technology(香港科技大学化学系)

AI总结 提出一种自反性分子设计框架,用第一性原理计算的完整物化理由替代标量反馈,使LLM从随机采样器转变为因果推理器,在HOMO-LUMO能隙任务中实现0.0003 eV偏差和100%成功率。

Comments 3 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏