arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-07-07 至 2026-07-07 共收录 15
2605.31604 2026-07-07 cs.CV 版本更新

Representation Forcing for Bottleneck-Free Unified Multimodal Models

表示强制:无瓶颈统一多模态模型

Yuqing Wang, Zhijie Lin, Ceyuan Yang, Yang Zhao, Fei Xiao, Hao He, Qi Zhao, Zihan Ding, Fuyun Wang, Shuai Wang, Youliang Zhang, Haoqi Fan, Xihui Liu

机构 * University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子) The Chinese University of Hong Kong(香港中文大学) Nanjing University(南京大学) Tsinghua University(清华大学)

AI总结 提出表示强制(RF)技术,通过让解码器自回归预测视觉表示作为中间令牌,再在相同骨干网络中引导像素扩散,从而消除统一多模态模型对预训练VAE的依赖,实现无瓶颈的端到端模型。

Comments Project page: https://yuqingwang1029.github.io/RepresentationForcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27243 2026-07-07 cs.CV 版本更新

Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models

检索头能看见图像吗?长上下文视觉语言模型中的多模态检索头

Aaron Branson Cigres Li, Zhaowei Wang, Yu Zhao, Yiming Du, Haobo Li, Xiyu Ren, Ginny Wong, Simon See, Lishu Luo, Haodong Duan, Pasquale Minervini, Yangqiu Song

机构 * HKUST(香港科技大学) University of Edinburgh(爱丁堡大学) CUHK(香港中文大学) NVAITC, NVIDIA, Santa Clara, USA(NVIDIA Santa Clara 分公司) Tsinghua University(清华大学)

AI总结 本文提出一种多模态检索头检测方法,发现视觉语言模型中仅有4.4-10.2%的注意力头贡献了50%的正检索分数,这些头对长上下文推理至关重要,且可直接用于文档检索提升性能。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18814 2026-07-07 cs.LG cs.AI 版本更新

A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning

模型可以自我帮助:无需奖励的自我训练用于大语言模型推理

Mengqi Li, Lei Zhao, Anthony Man-Cho So, Ruoyu Sun, Xiao Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出SePT方法,通过自我生成和训练自我生成响应交替进行,无需外部奖励提升大语言模型推理性能,实验表明在多个数学推理基准上有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19635 2026-07-07 cs.SD cs.AI 版本更新

StarTSE: Towards Streaming Target Speaker Extraction via Chunk-wise Interleaved Splicing of Autoregressive Language Model

面向流式目标说话人提取的分块交织拼接自回归语言模型

Shuhai Peng, Hui Lu, Jinjiang Liu, Liyang Chen, Guiping Zhong, Jiakui Li, Huimeng Wang, Haiyun Li, Liang Cao, Shiyin Kang, Zhiyong Wu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The Chinese University of Hong Kong(香港中文大学) SenseTime Research(商汤科技研究院)

AI总结 本文提出一种分块交织拼接方法,用于提升流式目标说话人提取的效率与稳定性,实验表明其在低延迟下保持高性能且优于离线基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13649 2026-07-07 cs.CV 版本更新

Distribution Matching Distillation Meets Reinforcement Learning

分布匹配蒸馏与强化学习的结合

Dengyang Jiang, Dongyang Liu, Zanyi Wang, Qilong Wu, Liuzhuozheng Li, Hengzhuang Li, Xin Jin, David Liu, Changsheng Lu, Zhen Li, Bo Zhang, Mengmeng Wang, Steven Hoi, Peng Gao, Harry Yang

机构 * HKUST(香港科技大学) Alibaba Group(阿里巴巴集团) SIAT, CAS(中国科学院深圳先进技术研究院) Shanghai AI Lab(上海人工智能实验室) ZJUT(浙江工业大学) CUHK(香港中文大学)

AI总结 本文提出DMDR框架,结合奖励倾斜分布匹配与动态蒸馏策略,通过联合优化提升生成质量与可控性,优于多步生成模型。

Comments [ECCV 26] The synergy of reinforcement learning and distribution matching distillation. See more: https://github.com/vvvvvjdy/dmdr

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03283 2026-07-07 cs.CV 版本更新

Utonia: Toward One Encoder for All Point Clouds

Utonia:迈向适用于所有点云的单一编码器

Yujia Zhang, Xiaoyang Wu, Yunhan Yang, Xianzhe Fan, Han Li, Yuechen Zhang, Zehao Huang, Naiyan Wang, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Xiaomi(小米)

AI总结 研究旨在训练跨多领域的单自监督点变压器编码器Utonia,其能学习一致表征空间实现跨域转移,统一各领域点云,提升感知能力,还对具身和多模态推理有益,有望成为稀疏3D数据基础模型。

Comments produced by Pointcept, project page: https://pointcept.github.io/Utonia

Journal ref International Conference on Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10711 2026-07-07 cs.SE cs.AI cs.CL 版本更新

Code Benchmarks Should Prioritize Rigor, Reliability, and Reproducibility

代码基准应优先考虑严谨性、可靠性和可重复性

Jialun Cao, Yuk-Kit Chan, Zixuan Ling, Wenxuan Wang, Shuqing Li, Mingwei Liu, Ruixi Qiao, Yuting Han, Chaozheng Wang, Boxi Yu, Pinjia He, Shuai Wang, Zibin Zheng, Michael R. Lyu, Shing-Chi Cheung

机构 * The Chinese University of Hong Kong(香港中文大学) Renmin University of China(中国人民大学) Sun Yat-Sen University(中山大学) Chinese Academy of Sciences, Institute of Automation(中国科学院自动化研究所) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 研究代码基准在评估大语言模型中的作用,指出其质量影响对模型能力的解读。通过对672个代码基准的调查发现实际与认知有差距,提出代码基准应在构建、评估和发布中分别注重严谨性、可靠性和可重复性,并给出准则。

Comments 66 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14192 2026-07-07 cs.AI cs.CL 版本更新

Toward Efficient Agents: Memory, Tool learning, and Planning

迈向高效智能体:记忆、工具学习与规划

Xiaofang Yang, Lijun Li, Heng Zhou, Tong Zhu, Xiaoye Qu, Yuchen Fan, Qianshan Wei, Rui Ye, Li Kang, Yiran Qin, Daizong Liu, Qi Li, Ning Ding, Siheng Chen, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiaotong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Hong Kong Polytechnic University(香港理工大学) Wuhan University(武汉大学) Tsinghua University(清华大学)

AI总结 研究将大语言模型扩展到智能体系统中的效率问题,从记忆、工具学习和规划三个核心组件考虑成本,回顾多种方法并详细讨论,以两种方式刻画效率,还探讨关键挑战与未来方向。

Comments 63 pages, 244 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16331 2026-07-07 cs.CL 版本更新

Re:Form -- Reducing Human Annotations in Scalable Formal Software Verification with RL in LLMs: A Preliminary Study on Dafny

Re:Form——利用大语言模型中的强化学习减少可扩展形式化软件验证中的人工标注:关于Dafny的初步研究

Chuanhao Yan, Fengdi Che, Xuhan Huang, Xu Xu, Xin Li, Yizhi Li, Xingwei Qu, Jingzhe Shi, Chenghua Lin, Yaodong Yang, Binhang Yuan, Hang Zhao, Yu Qiao, Bowen Zhou, Jie Fu

机构 * Shanghai AI Lab(上海人工智能实验室) University of Alberta(阿尔伯塔大学) Tsinghua University(清华大学) Chinese University of Hong Kong, Shenzhen(香港大学(深圳)) Hong Kong University of Science and Technology(香港科技大学) Nanyang Technological University(南洋理工大学) University of Manchester(曼彻斯特大学) Peking University(北京大学)

AI总结 研究利用形式语言Dafny减少人工标注,核心方法是引入自动可扩展数据处理流程及结合形式语言验证器反馈的强化学习设计,主要贡献是提升模型在DafnyComp基准测试表现。

Comments Published in Transactions on Machine Learning Research (TMLR), 05/2026. Reviewed on OpenReview: https://openreview.net/forum?id=cAQmIS4GOe

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23722 2026-07-07 cs.DC cs.AI 版本更新

OctoPipe: Reducing Pipeline Bubbles for Heterogeneous Models via Co-Optimizing Partitioning, Placement, and Scheduling

OctoPipe:通过共同优化分区、放置和调度减少异构模型的流水线气泡

Jihu Guo, Tenghui Ma, Wei Gao, Peng Sun, Xun Chen, Jiaxing Li, Zhisheng Ye, Yuyang Jin, Dahua Lin

机构 * FDU & Shanghai AI Laboratory(复旦大学及上海人工智能实验室) HKUST(香港科技大学) Unaffiliated(无隶属机构) Tsinghua University(清华大学) CUHK & SenseTime Research(香港大学及SenseTime研究院)

AI总结 研究针对模型架构异构性加剧流水线气泡降低训练效率的问题,提出OctoPipe系统,通过构建模拟器、开发调谐器、实现执行器共同优化分区、放置和调度,提升了吞吐量。

Comments 14 pages, 12 Figures; Accepted by SC'26;

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15330 2026-07-07 cs.CV 版本更新

CoDoL: Conditional Domain Prompt Learning for Out-of-Distribution Generalization

CoDoL:用于分布外泛化的条件域提示学习

Min Zhang, Yuyin Wang, Zhongxiang Dai, Zhikang Chen, Jie Zhou, Miao Liu, Sen Cui

机构 * East China Normal University(东华师范大学) Xidian University(西安电子科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Oxford(牛津大学) Tsinghua University(清华大学)

AI总结 针对基于提示的CLIP方法存在的文本描述不准确、视觉语言嵌入对齐有限问题,提出CoDoL方法,利用域信息形成提示,还提出DMN生成输入条件令牌,实验验证其在分布外泛化的有效性。

Comments Accepted to TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21571 2026-07-07 cs.LG cs.NA math.NA stat.ML 版本更新

Convergence of Stochastic Gradient Methods for Wide Two-Layer Physics-Informed Neural Networks for the Poisson Equation

用于泊松方程的宽两层物理信息神经网络的随机梯度方法的收敛性

Bangti Jin, Longjun Wu

机构 * Department of Mathematics, The Chinese University of Hong Kong, Shatin, N.T., Hong Kong, P.R. China(香港中文大学(深圳)数学系)

AI总结 研究求解泊松方程的过参数化两层物理信息神经网络,建立随机梯度下降/流的线性收敛性,扩展现有梯度下降分析结果,为随机算法训练物理信息神经网络提供保障。

Comments 32 pages, 2 figures, to appear at "Neural Networks"

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09484 2026-07-07 cs.CV 版本更新

Purify then Guide: Rethinking Domain Generalization for Multimodal Face Anti-Spoofing

净化然后引导:重新思考多模态人脸反欺骗的领域泛化

Yingjie Ma, Xun Lin, Zitong Yu, Haonan Wang, Ruixin Zhang, Shouhong Ding, Xin Liu, Xiaochen Yuan, Weicheng Xie, Linlin Shen

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) School of Computing and Information Technology, Great Bay University(大湾区大学计算与信息科技学院) Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息处理重点实验室) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(广东省智能信息处理重点实验室) Tencent Youtu Lab(腾讯优图实验室) School of Psychology, Shanghai Jiao Tong University(上海交通大学心理学院) Faculty of Applied Sciences, Macao Polytechnic University(澳门理工学院应用科学学院) The Chinese University of Hong Kong(香港中文大学)

AI总结 研究多模态人脸反欺骗中领域泛化问题,提出MMDA框架,利用CLIP零样本泛化能力,通过去噪和对齐机制提升跨模态对齐泛化性能,含多个模块及策略,实验表明优于现有方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06643 2026-07-07 cs.SE cs.CL 版本更新

Is Your Benchmark Still Useful? Dynamic Benchmarking for Code Language Models

你的基准仍然有用吗?代码语言模型的动态基准测试

Batu Guan, Xiao Wu, Yuanyuan Yuan, Shaohua Li

机构 * The Chinese University of Hong Kong(香港中文大学) Huazhong University of Science and Technology(华中科技大学) ETH Zurich(苏黎世联邦理工学院)

AI总结 研究模型评估中如何在模型训练可能已见过基准的情况下保持其有用性,提出动态基准测试框架,通过语义保留突变变换输入构建新基准,评估发现模型性能变差、排名变化及能抵抗数据污染问题。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14340 2026-07-07 math.OC cs.LG cs.NA math.NA 版本更新

Learning rate adaptive stochastic gradient descent optimization methods: numerical simulations for deep learning methods for partial differential equations and convergence analyses

学习率自适应随机梯度下降优化方法:用于偏微分方程深度学习方法的数值模拟与收敛性分析

Steffen Dereich, Arnulf Jentzen, Adrian Riekert

机构 * School of Data Science and Shenzhen Research Institute of Big Data, The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(数据科学学院和深圳大数据研究院,香港中文大学(深圳))

AI总结 提出学习率自适应的SGD方法,基于目标函数值的经验估计调整学习率,给出Adam优化器变体并用于多个机器学习问题,结果表明其能更快降低目标函数值,还证明特定二次最小化问题中自适应SGD变体收敛到全局最小值。

Comments 65 pages, 8 figures. To appear in Communications in Computational Physics (CiCP)

详情

展开后加载摘要…

URL PDF HTML 收藏