arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-06-25 至 2026-06-25 共收录 8
2606.25713 2026-06-25 cs.SD 新提交

Frequency-Aware Self-Supervised Music Representation Learning

频率感知的自监督音乐表示学习

Yicheng Gu, Junan Zhang, Jerry Li, Zhizheng Wu, Lauri Juvela

机构 * Spellbrush Acoustic Lab, Department of Information and Communications Engineering (DICE), Aalto University(阿尔托大学信息与通信工程系声学实验室) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院)

AI总结 提出PupuJEPA,一种直接在2D频谱图上训练的视觉联合嵌入预测架构,通过预测掩码补丁的潜在嵌入学习鲁棒表示,在MARBLE基准上线性探测优于1D序列SSL模型。

Comments Submitted to TASLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25488 2026-06-25 cs.LG 新提交

Distill on a Diet: Efficient Knowledge Distillation via Learnable Data Pruning

精简蒸馏:通过可学习数据剪枝实现高效知识蒸馏

Yifan Wu, Yiqi Wang, Xichen Ye, Wenjing Yan, Xiaoqiang Li, Cheng Jin, Xiangyu Yue, Weizhong Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Faculty of Engineering, The Chinese University of Hong Kong(香港中文大学工程学院) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Computer Engineering and Science, Shanghai University(上海大学计算机工程与科学学院)

AI总结 提出IF-Beta框架,结合影响函数与可学习Beta分布采样策略,通过双层优化实现高效数据剪枝,在减少数据和计算量的同时提升蒸馏性能。

Comments Acceepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23049 2026-06-25 cs.CL cs.AI 新提交

PhoneBuddy: Training Open Models for Agentic Phone Use

训练用于代理电话使用的开放模型

Zhengyang Tang, Xin Lai, Pengyuan Lyu, Xinyuan Wang, Tianyi Bai, Chenxin Li, Yiduo Guo, Huawen Shen, Yuxuan Liu, Junyi Li, Zhengyao Fang, Yang Ding, Yi Zhang, Weinong Wang, Xingran Zhou, Liang Wu, Fei Tang, Sunqi Fan, Shangpin Peng, Zheng Ruan, Anran Zhang, Benyou Wang, Ji-Rong Wen, Rui Yan, Chengquan Zhang, Han Hu

机构 * Tencent Hunyuan(腾讯混元) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Wuhan University(武汉大学)

AI总结 提出PhoneBuddy训练方案,结合真实应用环境和模拟应用环境PhoneWorld,通过混合强化学习提升开放模型在电话使用任务上的成功率,在150项人类评估中达到45.33%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03723 2026-06-25 cs.CV 版本更新

SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation

SymphoMotion:相机运动与物体动态的联合控制以实现一致的视频生成

Guiyu Zhang, Yabo Chen, Xunzhi Xiang, Junchao Huang, Zhongyu Wang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiaotong University(上海交通大学) Nanjing University(南京大学) Beihang University(北京航空航天大学)

AI总结 SymphoMotion通过联合控制相机运动和物体动态,提高视频生成的一致性和表达性,其核心方法结合了相机轨迹控制与物体动态控制机制,并引入了RealCOD-25K数据集进行大规模训练和评估,显著提升了视觉保真度和物体运动准确性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19297 2026-06-25 cs.CV 版本更新

VolSplat: Rethinking Feed-Forward 3D Gaussian Splatting with Voxel-Aligned Prediction

VolSplat: 重新思考基于体素对齐预测的前馈式3D高斯泼溅

Weijie Wang, Yeqing Chen, Zeyu Zhang, Hengyu Liu, Haoxiao Wang, Zhiyuan Feng, Wenkang Qin, Feng Chen, Jia-Wang Bian, Zheng Zhu, Donny Y. Chen, Bohan Zhuang

机构 * Zhejiang University(浙江大学) GigaAI University of Electronic Science and Technology of China(电子科技大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) The University of Adelaide(阿德莱德大学) Nanyang Technological University(南洋理工大学) Monash University(莫纳什大学)

AI总结 针对前馈式3D高斯泼溅中像素对齐预测的局限性,提出体素对齐的VolSplat方法,通过从预测的3D体素网格直接预测高斯,实现鲁棒的多视图一致性和更优的几何与渲染质量。

Comments ECCV 2026, Project Page: https://lhmd.top/volsplat, Code: https://github.com/ziplab/VolSplat

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11606 2026-06-25 cs.CV 版本更新

Articulat3D: Reconstructing Articulated Digital Twins From Monocular Videos with Geometric and Motion Constraints

Articulat3D: 从单目视频中利用几何和运动约束重建关节式数字孪生

Lijun Guo, Haoyu Zhao, Xingyue Zhao, Rong Fu, Linghao Zhuang, Siteng Huang, Zhongyu Li, Hua Zou

机构 * Wuhan University(武汉大学) Hong Kong Embodied AI Lab(香港具身AI实验室) The Chinese University of Hong Kong(香港中文大学) Peking Union Medical College(北京协和医学院) University of Macau(澳门大学) Zhejiang University(浙江大学)

AI总结 提出Articulat3D框架,通过运动先验初始化和几何运动约束优化,从单目视频重建高保真关节式数字孪生,在合成和真实数据上达到最优性能。

Comments Accepted to ECCV 2026. 26 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17917 2026-06-25 cs.LG cs.AI cs.CL cs.CV 版本更新

Streaming-dLLM: Accelerating Diffusion LLMs via Suffix Pruning and Dynamic Decoding

Streaming-dLLM: 通过后缀剪枝和动态解码加速扩散大语言模型

Zhongyu Xiao, Zhiwei Hao, Jianyuan Guo, Yong Luo, Jia Liu, Jie Xu, Han Hu

机构 * School of information(信息学院) Electronics, Beijing Institute of Technology, Beijing(电子学院,北京理工大学,北京) Department of Computer Science, City University of Hong Kong, Hong Kong(计算机科学系,香港城市大学,香港) School of Computer Science, Wuhan University, Wuhan(计算机科学学院,武汉大学,武汉) School of Economics(经济学院) Management, Communication University of China, Beijing(管理学院,中国传媒大学,北京) School of Science(科学学院) Engineering, The Chinese University of Hong Kong (Shenzhen), Shenzhen(工程学院,香港中文大学(深圳),深圳)

AI总结 提出Streaming-dLLM,通过空间上的注意力引导后缀建模剪枝冗余掩码令牌和时间上的动态置信度感知早停策略,实现无需训练的扩散大语言模型推理加速,最高达68.2倍加速且保持生成质量。

Comments Tech report. Code is available at https://github.com/xiaoshideta/Streaming-dLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23866 2026-06-25 cs.LG cs.AI 版本更新

Towards Understanding The Calibration Benefits of Sharpness-Aware Minimization

理解锐度感知最小化的校准优势

Chengli Tan, Yubo Zhou, Haishan Ye, Guang Dai, Junmin Liu, Zengjie Song, Jiangshe Zhang, Zixiang Zhao, Yunda Hao, Yong Xu

机构 * Northwestern Polytechnical University(西北工业大学) SGIT AI Lab, State Grid Corporation of China(国网SGIT人工智能实验室) Xi’an Jiaotong University(西安交通大学) ETH Zürich(苏黎世联邦理工学院) Chinese University of Hong Kong(香港中文大学)

AI总结 本文通过理论分析揭示锐度感知最小化(SAM)通过隐式最大化预测分布熵来改善模型校准,并提出变体CSAM进一步降低校准误差。

Comments ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏