arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-04-20 至 2026-04-20 共收录 12
2509.25300 2026-04-20 cs.LG cs.AI

Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning

LLM强化学习后训练的扩展行为:数学推理中的实证研究

Zelin Tan, Hejia Geng, Xiaohang Yu, Mulei Zhang, Guancheng Wan, Yifan Zhou, Qiang He, Xiangyuan Xue, Heng Zhou, Yutao Fan, Zhongzhi Li, Zaibin Zhang, Guibin Zhang, Chen Zhang, Zhenfei Yin, Philip Torr, Lei Bai

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) University of Oxford(牛津大学) Imperial College London(伦敦帝国学院) University of Georgia(佐治亚大学) The Chinese University of Hong Kong(香港中文大学) Chinese Academy of Sciences(中国科学院) Dalian University of Technology(大连理工大学) National University of Singapore(新加坡国立大学) Wuhan University(武汉大学)

AI总结 本文通过实证研究探讨了LLM后训练强化学习中的扩展行为,重点分析了模型规模、数据量和计算预算对数学推理性能的影响,揭示了学习效率的饱和趋势及高质量数据重复利用的有效性。

Comments V4 version:This Paper has been accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16024 2026-04-20 cs.MA cs.CV

AstroVLM: Expert Multi-agent Collaborative Reasoning for Astronomical Imaging Quality Diagnosis

AstroVLM:专家多智能体协作推理用于天体成像质量诊断

Yaohui Han, Tianshuo Wang, Zixi Zhao, Zhengchun Zhu, Shuo Ren, Yiru Wang, Rongliang Fu, Tinghuan Chen, Tsung-Yi Ho

机构 * The Chinese University of Hong Kong(香港中文大学) Central South University(中南大学) Huawei Technologies Co., Ltd(华为技术有限公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学深圳校区)

AI总结 本文提出AstroVLM,通过多智能体协作推理解决复杂天体成像质量诊断问题,实验表明其在实际任务中优于所有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15847 2026-04-20 cs.CL

CiPO: Counterfactual Unlearning for Large Reasoning Models through Iterative Preference Optimization

CiPO:通过迭代偏好优化实现大型推理模型的反事实去学习

Junyi Li, Yongqiang Chen, Ningning Ding

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Chinese University of Hong Kong(香港中文大学)

AI总结 针对大型推理模型去学习难题,CiPO通过迭代偏好优化重新定义去学习为对推理过程的针对性干预,有效去除中间推理步骤和最终答案的知识,同时保持推理能力。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15718 2026-04-20 cs.CV cs.AI cs.CR cs.DB cs.LG

NeuroLip: An Event-driven Spatiotemporal Learning Framework for Cross-Scene Lip-Motion-based Visual Speaker Recognition

NeuroLip:一种基于跨场景唇部运动的时空学习框架用于视觉语音识别

Junguang Yao, Wenye Liu, Stjepan Picek, Yue Zheng

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) Faculty of Electrical Engineering and Computing University of Zagreb(Zagreb大学电气工程与计算学院) Faculty of Science, Radboud University(Radboud大学科学学院)

AI总结 NeuroLip通过事件驱动框架捕捉细粒度唇部动态,解决传统摄像机在运动模糊和动态范围低下的问题,实现跨场景的鲁棒识别,准确率超过71%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15709 2026-04-20 cs.AI

Bilevel Optimization of Agent Skills via Monte Carlo Tree Search

通过蒙特卡洛树搜索优化代理技能

Chenyi Huang, Haoting Zhang, Jingxu Xu, Zeyu Zheng, Yunduan Lin

机构 * Department of Mathematics(数学系) National University of Singapore(国立新加坡大学) Department of Industrial Engineering and Operations Research(工业工程与运营管理系) University of California at Berkeley(加州大学伯克利分校) Department of Decision, Operation and Technology(决策、运营与技术系) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出通过蒙特卡洛树搜索优化代理技能的双层优化框架,提升任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15392 2026-04-20 cs.LG cs.AI stat.ML

Lightweight Geometric Adaptation for Training Physics-Informed Neural Networks

轻量级几何适应用于训练物理信息神经网络

Kang An, Chenhao Si, Shiqian Ma, Ming Yan

机构 * Department of Computational Applied Mathematics and Operations Research(计算应用数学与运筹学部门) School of Data Science(数据科学学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本文提出一种轻量级曲率感知优化框架,通过自适应预测校正提升PINN在复杂偏微分方程中的收敛速度、训练稳定性及解精度。

Comments 22 pages, Chenhao Si and Kang An contributed equally to this work. Their authorship order was determined randomly

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11804 2026-04-20 cs.CV

OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation

OmniShow:统一多模态条件以生成人-物体交互视频

Donghao Zhou, Guisheng Liu, Hao Yang, Jiatong Li, Jingyu Lin, Xiaohu Huang, Yichen Liu, Xin Gao, Cunjian Chen, Shilei Wen, Chi-Wing Fu, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出OmniShow框架,统一文本、图像、音频和姿态多模态条件,解决人-物体交互视频生成中的可控性与质量平衡问题,通过统一通道条件和门控局部上下文注意力实现高效生成,建立HOIVG-Bench基准测试平台,取得多模态条件下的最佳性能。

Comments Project page: https://correr-zhou.github.io/OmniShow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02210 2026-04-20 cs.CV

HiFi-Inpaint: Towards High-Fidelity Reference-Based Inpainting for Generating Detail-Preserving Human-Product Images

HiFi-Inpaint:迈向高保真参考基于修复生成细节保留的人-产品图像

Yichen Liu, Donghao Zhou, Jie Wang, Xin Gao, Guisheng Liu, Jiatong Li, Quanwei Zhang, Qiang Lyu, Lanqing Guo, Shilei Wen, Weiqiang Wang, Pheng-Ann Heng

机构 * University of Chinese Academy of Sciences(中国科学院大学) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学)

AI总结 本文提出HiFi-Inpaint框架,通过Shared Enhancement Attention和Detail-Aware Loss解决人-产品图像生成中的细节保留问题,并构建了HP-Image-40K数据集,实验表明其在生成高保真图像方面表现优异。

Comments Accepted by CVPR 2026 (Project page: https://correr-zhou.github.io/HiFi-Inpaint/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05638 2026-04-20 cs.CV

SurgMotion: A Video-Native Foundation Model for Universal Understanding of Surgical Videos

SurgMotion: 一种用于外科视频通用理解的视频原生基础模型

Jinlin Wu, Felix Holm, Chuxi Chen, An Wang, Yaxin Hu, Xiaofan Ye, Zelin Zang, Miao Xu, Lihua Zhou, Huai Liao, Danny T. M. Chan, Ming Feng, Wai S. Poon, Hongliang Ren, Dong Yi, Nassir Navab, Gaofeng Meng, Jiebo Luo, Hongbin Liu, Zhen Lei

机构 * Center for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences, Hong Kong, China(人工智能与机器人中心,香港科学与创新研究院,中国科学院,香港,中国) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院,北京,中国) Computer Aided Medical Procedures, Technical University of Munich, Munich, Germany(医学辅助程序,慕尼黑技术大学,德国慕尼黑) Electronic Engineering Department, The Chinese University of Hong Kong, Hong Kong, China(电子工程系,香港中文大学,香港,中国) Neuromedical Centre, Hong Kong University Shenzhen Hospital, Shenzhen, China(神经医学中心,香港大学深圳医院,深圳,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Department of Respiratory Medicine, The First Affiliated Hospital of Sun Yat-sen University, Guangzhou, China(呼吸科,中山大学附属第一医院,广州,中国)

AI总结 SurgMotion通过引入视频原生基础模型,将学习范式从像素级重建转向潜在运动预测,通过三种关键技术改进提升外科视频理解能力,实验表明其在手术流程识别、动作三元组识别和技能评估等任务中均取得显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10262 2026-04-20 cs.CL cs.AI eess.AS

MTR-DuplexBench: Towards a Comprehensive Evaluation of Multi-Round Conversations for Full-Duplex Speech Language Models

MTR-DuplexBench:面向全双工语音语言模型多轮对话全面评估的综合评测

He Zhang, Wenqian Cui, Haoning Xu, Xiaohui Li, Lei Zhu, Haoli Bai, Shaohua Ma, Irwin King

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Huawei Technologies(华为技术)

AI总结 本文提出MTR-DuplexBench,用于评估全双工语音语言模型在多轮对话中的表现,涵盖对话质量、指令遵循和安全性等关键方面,揭示现有模型在多轮对话中的一致性问题。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07774 2026-04-20 cs.CL

Curing Miracle Steps in LLM Mathematical Reasoning with Rubric Rewards

用评分奖励模型治愈大语言模型数学推理中的奇迹步骤

Youliang Yuan, Qiuyang Mang, Jingbang Chen, Hong Wan, Xiaoyuan Liu, Junjielong Xu, Jen-tse Huang, Wenxuan Wang, Wenxiang Jiao, Pinjia He

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen, China(数据科学学院,香港中文大学(深圳)) UC Berkeley(加州大学伯克利分校) Zhejiang University(浙江大学) Johns Hopkins University(约翰霍普金斯大学) Renmin University of China(中国人民大学) Xiaohongshu Inc.(小红书公司)

AI总结 本文通过评分奖励模型解决大语言模型数学推理中的奇迹步骤问题,通过系统分析和人类验证建立失败模式分类,提升推理准确性和可靠性。

Comments Accepted by ACL 2026 Main, 22 pages, 10 figures, 7 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11025 2026-04-20 quant-ph cs.IT cs.LG math.IT

Generalization Bounds for Quantum Learning via Rényi Divergences

通过Rényi散度推导量子学习的泛化界限

Naqueeb Ahmad Warsi, Ayanava Dasgupta, Masahito Hayashi

机构 * Indian Statistical Institute, Kolkata(印度统计研究所,加尔各答) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) International Quantum Academy, Futian District, Shenzhen(深圳国际量子 academy,福田区) Graduate School of Mathematics, Nagoya University(名古屋大学数学研究生院)

AI总结 本文通过Rényi散度推导了量子学习算法的泛化误差上界,利用Caro等人(2024)的框架和新的期望真实损失定义,提出基于量子和经典Rényi散度的上界,并通过变分方法评估量子Rényi散度,展示了改进的sandwich量子Rényi散度在性能上的优势。

Comments 36 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏