arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-03-06 至 2026-03-06 共收录 12
2603.05312 2026-03-06 cs.RO

UltraDexGrasp: Learning Universal Dexterous Grasping for Bimanual Robots with Synthetic Data

UltraDexGrasp: 为双臂机器人学习通用灵巧抓取

Sizhe Yang, Yiman Xie, Zhixuan Liang, Yang Tian, Jia Zeng, Dahua Lin, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) The University of Hong Kong(香港大学) Peking University(北京大学)

AI总结 UltraDexGrasp通过合成数据训练出高效抓取策略,实现双臂机器人在多种物体上的高成功率抓取。

Comments Published at International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16786 2026-03-06 cs.LG cs.AI cs.CV

Revisiting Multimodal KV Cache Compression: A Frequency-Domain-Guided Outlier-KV-Aware Approach

重新审视多模态KV缓存压缩:一种基于频域的异常KV感知方法

Yaoxin Yang, Peng Ye, Xudong Tan, Chongjun Tu, Maosen Zhao, Jia Hao, Tao Chen

机构 * College of Future Information Technology, Fudan University(未来信息科技学院,复旦大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhangjiang Laboratory(张江实验室)

AI总结 本文提出FlashCache,一种基于频域的异常KV感知KV缓存压缩框架,通过保留关键KV对提升解码效率并降低内存使用。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04799 2026-03-06 cs.DB cs.AI cs.CL

Beyond Linear LLM Invocation: An Efficient and Effective Semantic Filter Paradigm

超越线性LLM调用:一种高效且有效的语义过滤范式

Nan Hou, Kangfei Zhao, Jiadong Xie, Jeffrey Xu Yu

机构 * The Chinese University of Hong Kong(香港中文大学) Beijing Institute of Technology(北京理工大学)

AI总结 本文提出CSV框架,通过语义聚类、采样和投票策略,将LLM调用次数降低至次线性复杂度,提升语义过滤效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04771 2026-03-06 cs.CV cs.AI

MADCrowner: Margin Aware Dental Crown Design with Template Deformation and Refinement

MADCrowner: 带边界的牙冠设计与模板变形与细化

Linda Wei, Chang Liu, Wenran Zhang, Yuxuan Hu, Ruiyang Li, Feng Qi, Changyao Tian, Ke Wang, Yuanyuan Wang, Shaoting Zhang, Dimitris Metaxas, Hongsheng Li

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) College of Biomedical Engineering, Fudan University(复旦大学生物医学工程学院) Sensetime Research(商汤科技研究院) Department of Second Dental Center, Shanghai Ninth People's Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院第九人民医院第二牙科中心) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Department of Computer Science, Rutgers University(罗格斯大学计算机科学系) Centre for Perceptual and Interactive Intelligence (CPII) under InnoHK(InnoHK下的感知与交互智能中心) Shanghai Stomatological Hospital, Fudan University(复旦大学上海牙科医院)

AI总结 MADCrowner通过结合模板变形和边缘分割网络,实现了高精度的牙冠设计,提升了几何精度和临床可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01601 2026-03-06 cs.LG cs.AI cs.CL

Adaptive Rollout Allocation for Online Reinforcement Learning with Verifiable Rewards

具有可验证奖励的在线强化学习中自适应 rollout 分配

Hieu Trung Nguyen, Bao Nguyen, Wenao Ma, Yuzhi Zhao, Ruifeng She, Viet Anh Nguyen

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Hong Kong Research Center(华为香港研究中心)

AI总结 VIP通过基于方差的预测分配策略提高在线强化学习中可验证奖励的采样效率和性能。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10534 2026-03-06 cs.AI

Achieving Olympia-Level Geometry Large Language Model Agent via Complexity Boosting Reinforcement Learning

通过复杂度提升强化学习实现奥lympia级几何大语言模型代理

Haiteng Zhao, Junhao Shen, Yiming Zhang, Songyang Gao, Kuikun Liu, Tianyou Ma, Fan Zheng, Dahua Lin, Wenwei Zhang, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) ICMAT Spanish National Research Council(西班牙国家研究委员会ICMAT) The Chinese University of Hong Kong(香港中文大学)

AI总结 InternGeometry通过复杂度提升强化学习实现几何问题求解,仅用13K训练示例解决44个IMO问题,超越平均金牌得主得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06690 2026-03-06 cs.CL

Think-While-Generating: On-the-Fly Reasoning for Personalized Long-Form Generation

在生成过程中思考:面向个性化长文本生成的即兴推理

Chengbing Wang, Yang Zhang, Wenjie Wang, Xiaoyan Zhao, Fuli Feng, Xiangnan He, Tat-Seng Chua

机构 * University of Science and Technology of China(科学技术大学) National University of Singapore(国立新加坡大学) The Chinese University of Hong Kong(香港中文大学) National Engineering Laboratory for BITA, University of Science and Technology of China(BITA国家工程实验室,科学技术大学)

AI总结 FlyThinker通过在生成过程中进行动态推理,提升个性化长文本生成的效率和效果。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22758 2026-03-06 cs.CL

EchoMind: An Interrelated Multi-level Benchmark for Evaluating Empathetic Speech Language Models

EchoMind: 一种相互关联的多级基准,用于评估共情语音语言模型

Li Zhou, Lutong Yu, You Lyu, Yihang Lin, Zefeng Zhao, Junyi Ao, Yuhao Zhang, Benyou Wang, Haizhou Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Research Institute of Big Data(深圳大数据研究院) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 EchoMind是一种多级基准,用于评估SLMs在共情对话中的能力,揭示了现有模型在处理高表现性语音线索方面的不足。

Comments Speech Language Models, Spoken Language Understanding, Vocal Cue Perception, Empathetic Dialogue, Benchmark Evaluation; Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16332 2026-03-06 cs.SD cs.AI cs.CL

Vevo2: A Unified and Controllable Framework for Speech and Singing Voice Generation

Vevo2:一种用于语音和歌唱语音生成的统一且可控的框架

Xueyao Zhang, Junan Zhang, Yuancheng Wang, Chaoren Wang, Yuanzhe Chen, Dongya Jia, Zhuo Chen, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ByteDance Seed(字节跳动种子) Shenzhen Loop Area Institute(深圳河套学院) City University of Macau(澳门城市大学) Amphion Technology Co., Ltd.(Amphion科技有限公司)

AI总结 Vevo2通过统一建模和可控框架实现语音与歌唱语音的生成,结合语调学习策略和多目标训练提升可控性和泛化能力。

Comments Accepted by the IEEE Transactions on Audio, Speech and Language Processing (TASLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21569 2026-03-06 quant-ph cs.LG

Structured quantum learning via em algorithm for Boltzmann machines

通过EM算法进行结构化量子学习:用于玻尔兹曼机

Takeshi Kimura, Kohtaro Kato, Masahito Hayashi

机构 * Department of Mathematical Informatics, Graduate School of Informatics, Nagoya University(数学信息学系,信息科学研究生院,名古屋大学) School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) International Quantum Academy(国际量子学院) Graduate School of Mathematics, Nagoya University(数学研究生院,名古屋大学)

AI总结 本文提出了一种基于量子EM算法的结构化量子学习方法,用于改进量子玻尔兹曼机的训练效率和稳定性。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09984 2026-03-06 cs.CV cs.AI cs.SD

InterActHuman: Multi-Concept Human Animation with Layout-Aligned Audio Conditions

InterActHuman: 多概念人类动画与布局对齐的音频条件

Zhenzhi Wang, Jiaqi Yang, Jianwen Jiang, Chao Liang, Gaojie Lin, Zerong Zheng, Ceyuan Yang, Yuan Zhang, Mingyuan Gao, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) ByteDance(字节跳动)

AI总结 InterActHuman通过引入布局对齐的音频条件,实现多概念人类动画,支持多身份的精确控制与高质量视频生成。

Comments ICLR 2026 Camera Ready Version. TL;DR: The first multi-person dialogue video generation method from pairs of reference image and audio via explicit layout-aligned condition injection. Project page https://zhenzhiwang.github.io/interacthuman/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05310 2026-03-06 eess.AS cs.SD

A Large-Scale Probing Analysis of Speaker-Specific Attributes in Self-Supervised Speech Representations

对自监督语音表示中说话人特定属性的大规模探测分析

Aemon Yat Fei Chiu, Kei Ching Fung, Roger Tsz Yeung Li, Jingyu Li, Tan Lee

机构 * Department of Electronic Engineering, The Chinese University of Hong Kong, Hong Kong(香港中文大学电子工程系) Independent Researcher(独立研究者) School of Data Science, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学深圳学校数据科学系)

AI总结 本研究通过大规模分析揭示了自监督语音表示中说话人特定属性的编码机制,发现大模型在深层结构中能恢复说话人身份,且中间表示更擅长捕捉动态语调。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏