arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

共收录 2402
2604.19295 2026-04-22 cs.LG

TEMPO: Scaling Test-time Training for Large Reasoning Models

TEMPO:用于大规模推理模型的测试时训练扩展

Qingyang Zhang, Xinke Kong, Haitao Wu, Qinghua Hu, Minghao Wu, Baosong Yang, Yu Cheng, Yun Luo, Ganqu Cui, Changqing Zhang

机构 * Tianjin University(天津大学) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) The Chinese University of Hong Kong(香港中文大学) Shanghai AI Lab(上海人工智能实验室)

AI总结 TEMPO通过交替策略优化和周期性批评者重校准提升测试时训练效果,显著提升模型在AIME 2024任务中的表现并保持高多样性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18005 2026-04-22 cs.MA cs.AI cs.CL

Diversity Collapse in Multi-Agent LLM Systems: Structural Coupling and Collective Failure in Open-Ended Idea Generation

多智能体大语言模型系统中的多样性崩溃:结构耦合与开放性创意生成中的集体失败

Nuo Chen, Yicheng Tong, Yuzhe Yang, Yufei He, Xueyi Zhang, Qingyun Zou, Qian Wang, Bingsheng He

机构 * National University of Singapore(国立新加坡大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 研究探讨了多智能体系统在开放性创意生成中多样性崩溃的原因,揭示了结构耦合导致的集体失败,强调了在设计创意任务时保持独立性和分歧的重要性。

Comments 56 pages, 15 figures; Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00993 2026-04-22 cs.CV

PhotoFramer: Multi-modal Image Composition Instruction

PhotoFramer:多模态图像构图指令

Zhiyuan You, Ke Wang, He Zhang, Xin Cai, Jinjin Gu, Tianfan Xue, Chao Dong, Zhoutong Zhang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Adobe NextCam Adobe Research Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(InnoHK下的CPII) Shenzhen University of Advanced Technology(深圳先进技术大学)

AI总结 PhotoFramer通过多模态框架为用户提供图像构图指导,通过自然语言描述改进方法并生成示例图像,结合文本与图像生成模型提升日常用户构图能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21563 2026-04-22 cs.IR cs.LG

VoteGCL: Enhancing Graph-based Recommendations with Majority-Voting LLM-Rerank Augmentation

VoteGCL: 通过多数投票LLM重排序增强基于图的推荐

Minh-Anh Nguyen, Bao Nguyen, Ha Lan N. T., Tuan Anh Hoang, Duc-Trong Le, Dung D. Le

机构 * Center for AI Research, VinUniversity(越南 Vin 大学人工智能研究中心) The Chinese University of Hong Kong(香港中文大学) RMIT University(皇家墨尔本理工大学) VNU University of Engineering and Technology(越南工程与技术大学)

AI总结 本文提出利用LLM和物品文本描述增强交互数据,通过多数投票生成高置信度合成用户-物品交互,结合图对比学习框架缓解分布偏移和流行度偏差,实验显示提升准确率并减少流行度偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18373 2026-04-21 econ.GN cs.AI q-fin.EC q-fin.GN

Dissecting AI Trading: Behavioral Finance and Market Bubbles

解析人工智能交易:行为金融与市场泡沫

Shumiao Ouyang, Pengfei Sui

机构 * Saïd Business School, University of Oxford(牛津大学said商学院) School of Management and Economics, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)管理学院)

AI总结 本文研究AI代理在实验资产市场中的预期形成与交易行为,发现AI代理表现出经典行为模式,并通过分析其推理文本展示针对性提示干预对市场泡沫的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18351 2026-04-21 cs.IR cs.LG

Balanced Co-Clustering of Users and Items for Embedding Table Compression in Recommender Systems

用户和物品的平衡协同聚类用于推荐系统中的嵌入表压缩

Runhao Jiang, Renchi Yang, Donghao Wu

机构 * Hong Kong Baptist University(香港 Baptist 大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出BACO框架,通过协同信号对用户和物品进行聚类,减少嵌入表参数,提升推荐系统效率,实验显示参数减少75%且召回率下降仅1.85%。

Comments 14 pages, The technical report for the paper titled "Balanced Co-Clustering of Users and Items for Embedding Table Compression in Recommender Systems" in SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18348 2026-04-21 cs.CV cs.AI

AdaCluster: Adaptive Query-Key Clustering for Sparse Attention in Video Generation

AdaCluster:用于视频生成中稀疏注意力的自适应查询-键聚类

Haoyue Tan, Shengnan Wang, Yulin Qiao, Juncheng Zhang, Youhui Bai, Ping Gong, Zewen Jin, Cheng Li

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) Independent Researcher(独立研究员) University of Macau(澳门大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 针对视频扩散变换器的高推理延迟问题,提出AdaCluster框架,通过自适应聚类方法提升生成速度并保持精度。

Comments CVPR 2026 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18210 2026-04-21 cs.AI cs.LG cs.MA

TacticGen: Grounding Adaptable and Scalable Generation of Football Tactics

TacticGen: 基于适应性和可扩展性的足球战术生成

Sheng Xu, Guiliang Liu, Tarak Kharrat, Yudong Luo, Mohamed Aloulou, Javier López Peña, Konstantin Sofeikov, Adam Reid, Paul Roberts, Steven Spencer, Joe Carnall, Ian McHale, Oliver Schulte, Hongyuan Zha, Wei-Shi Zheng

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) Real Analytics, London(Real Analytics,伦敦) Birmingham City Football Club, Birmingham(伯明翰城足球俱乐部,伯明翰) Management School, University of Liverpool(利物浦大学管理学院) School of Computing Science, Simon Fraser University(Simon Fraser大学计算机科学学院) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)

AI总结 TacticGen通过多智能体扩散变换器生成适应性战术,结合规则、自然语言和神经模型实现可扩展的战术设计,验证了其在专业足球战术规划中的实用性。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18027 2026-04-21 cs.SE cs.CL

CodePivot: Bootstrapping Multilingual Transpilation in LLMs via Reinforcement Learning without Parallel Corpora

CodePivot: 通过强化学习无需平行语料库提升LLM的多语言转译

Shangyu Li, Juyong Jiang, Meibo Ren, Sizhe Zhong, Huiri Tan, Yunhao Gou, Xu Han, Chun Yong Chong, Yun Peng, Jiasi Shen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Monash University(莫纳什大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 CodePivot通过Python作为中间表示和Aggressive-Partial-Functional奖励机制,无需平行语料库提升LLM的多语言转译能力,在10种编程语言上实验显示其在通用和低资源语言转译任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14548 2026-04-21 cs.SD cs.LG eess.AS

VoxSafeBench: Not Just What Is Said, but Who, How, and Where

VoxSafeBench:不仅仅是所说的内容,还有谁、如何以及在哪里

Yuxiang Wang, Hongyu Liu, Yijiang Xu, Qinke Ni, Li Wang, Wan Lin, Kunyu Feng, Dekun Chen, Xu Tan, Lei Wang, Jie Shi, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) Amphion Technology Co., Ltd.(Amphion科技有限公司)

AI总结 VoxSafeBench首次联合评估SLM在安全、公平和隐私三个维度上的社会契合度,揭示语音识别中的普遍缺口,即模型在文本中能识别社会规范,但在语音中却无法正确应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05543 2026-04-21 cs.CL cs.SD eess.AS

Closing the Modality Reasoning Gap for Speech Large Language Models

弥合语音大语言模型的模态推理差距

Chaoren Wang, Heng Lu, Xueyao Zhang, Shujie Liu, Yan Lu, Jinyu Li, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Microsoft Corporation(微软公司)

AI总结 本文提出TARS框架,通过不对称奖励设计对齐文本和语音条件轨迹,显著缩小模态推理差距并在7B级语音大语言模型中取得最佳性能。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06201 2026-04-21 eess.AS cs.AI cs.CL cs.LG cs.SD

TokenChain: A Discrete Speech Chain via Semantic Token Modeling

TokenChain: 一种通过语义令牌建模的离散语音链

Mingxuan Wang, Satoshi Nakamura

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本文提出TokenChain,通过语义令牌ASR与分阶段TTS的结合,提升语音识别与文本到语音的性能,实验显示其在多个数据集上均优于基线方法。

Comments 5 pages, 3 figures. Submitted to IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17814 2026-04-21 cs.CR cs.AI

Understanding Secret Leakage Risks in Code LLMs: A Tokenization Perspective

理解代码大语言模型中的秘密泄露风险:从分词角度出发

Meifang Chen, Zhe Yang, Huang Nianchen, Yizhan Huang, Yichen Li, Zihan Li, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学) University of Southern California(南加州大学) Fudan University(复旦大学)

AI总结 研究揭示代码大语言模型中因分词方式导致的秘密泄露问题,指出BPE分词引发的'垃圾话偏差'现象,并探讨其成因及缓解策略。

Comments Accepted by ACL 26 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17749 2026-04-21 cs.CV

Ego-InBetween: Generating Object State Transitions in Ego-Centric Videos

Ego-InBetween: 生成以自我为中心视频中的物体状态转换

Mengmeng Ge, Takashi Isobe, Xu Jia, Yanan Sun, Zetong Yang, Weinong Wang, Dong Zhou, Dong Li, Huchuan Lu, Emad Barsoum

机构 * Advanced Micro Devices, Inc.(先进微器件公司) Dalian University of Technology(大连理工大学) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) Xi’an Jiaotong University(西安交通大学)

AI总结 本文提出EgoIn框架,通过TransitionVLM和Object-aware Auxiliary Supervision生成物体状态转换序列,实现以自我为中心视角下的视觉状态迁移。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17190 2026-04-21 cs.CV

LookasideVLN: Direction-Aware Aerial Vision-and-Language Navigation

LookasideVLN: 基于方向的空中视觉与语言导航

Yuwei Ning, Ganlong Zhao, Yipeng Qin, Si Liu, Yang Liu, Liang Lin, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) The Chinese University of Hong Kong(香港中文大学) Centre for Perceptual and Interactive Intelligence(感知与交互智能中心) Cardiff University(卡迪夫大学) Beihang University(北航) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室)

AI总结 本文提出LookasideVLN,通过利用自然语言中的方向线索提升空中视觉与语言导航的准确性和效率,采用方向感知图、空间地标知识库和方向MLLM导航代理三种核心组件。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11552 2026-04-21 cs.SD cs.CL

MimicLM: Zero-Shot Voice Imitation through Autoregressive Modeling of Pseudo-Parallel Speech Corpora

MimicLM:通过自回归建模伪并行语音语料实现零样本语音模仿

Tao Feng, Yuxiang Wang, Yuancheng Wang, Xueyao Zhang, Dekun Chen, Chaoren Wang, Xun Guan, Zhizheng Wu

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 MimicLM通过自回归建模伪并行语音语料,利用合成语音作为训练源,保留真实录音作为目标,提升语音模仿的自然度和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15625 2026-04-21 cs.LG cs.AI

Robust Tool Use via Fission-GRPO: Learning to Recover from Execution Errors

通过Fission-GRPO实现鲁棒的工具使用:学习从执行错误中恢复

Zhiwei Zhang, Fei Zhao, Rui Wang, Zezhong Wang, Bin Liang, Jiakang Wang, Yao Hu, Shaosheng Cao, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) Xiaohongshu Inc.(小红书公司) MoE Key Laboratory of High Confidence Software Technologies(可信软件技术国家重点实验室)

AI总结 本文提出Fission-GRPO框架,通过将执行错误转化为在线纠正监督,提升模型在多轮执行中的错误恢复能力,实验显示其在BFCL v4 Multi-Turn上提升了Qwen3-8B的错误恢复率和整体准确率。

Comments 9 pages, 4 figures, 4 tables. Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06056 2026-04-21 cs.CL cs.AI

Data Compressibility Quantifies LLM Memorization

数据压缩性量化大语言模型的记忆性

Yizhan Huang, Zhe Yang, Meifang Chen, Huang Nianchen, Jianping Zhang, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学) University of Southern California(南加州大学) Meta

AI总结 本文通过数据压缩性量化大语言模型的记忆性,发现集级别指标能揭示熵与记忆性之间的线性关系。

Comments accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13674 2026-04-21 cs.CL cs.AI

PrefixMemory-Tuning: Modernizing Prefix-Tuning by Decoupling the Prefix from Attention

PrefixMemory-Tuning: 通过解耦前缀与注意力来现代化前缀微调

Haonan Wang, Brian Chen, Siquan Li, Xinhe Liang, Hwee Kuan Lee, Kenji Kawaguchi, Tianyang Hu

机构 * National University of Singapore(新加坡国立大学) Bioinformatics Institute, A*STAR(A*STAR生物信息研究所) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本文提出PrefixMemory-Tuning,通过将前缀模块移出注意力头以提升表达能力,实验证明其在多个基准上优于传统前缀微调方法,并在通用任务中表现接近现代PEFT技术。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17009 2026-04-21 cs.AI

Small Model as Master Orchestrator: Learning Unified Agent-Tool Orchestration with Parallel Subtask Decomposition

小模型作为主指挥者:通过并行子任务分解学习统一的智能体-工具协调

Wenzhen Yuan, Wutao Xiong, Fanchen Yu, Shengji Tang, Ting Liu, Tao Chen, Peng Ye, Yuzhuo Fu, Wanli Ouyang, Lei Bai

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Shanghai AI Lab(上海人工智能实验室) Sichuan University(四川大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出Agent-as-Tool框架,通过并行子任务分解和状态反馈提升多智能体系统协调效率,ParaManager在多个基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16862 2026-04-21 cs.LG

Learning to Trade Like an Expert: Cognitive Fine-Tuning for Stable Financial Reasoning in Language Models

学习像专家一样交易:用于语言模型在金融推理中稳定性的认知微调

Yuchen Pan, Soung Chang Liew

机构 * Department of Information Engineering, The Chinese University of Hong Kong(信息工程系,香港中文大学)

AI总结 本文提出一种框架,通过 curated 多选题数据集和两阶段评估协议,训练语言模型在金融决策中具备稳定性和风险意识,优于开源基线并接近前沿模型表现。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16839 2026-04-21 cs.CL

HeLa-Mem: Hebbian Learning and Associative Memory for LLM Agents

HeLa-Mem:基于Hebb学习和联想记忆的LLM代理

Jinchang Zhu, Jindong Li, Cheng Zhang, Jiahong Liu, Menglin Yang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Jilin University(吉林大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 HeLa-Mem通过生物启发的动态图模型,结合联想学习与语义存储,提升LLM在长时记忆中的表现,实验显示在四个问题类别上效果更优且使用更少上下文令牌。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16459 2026-04-21 eess.AS cs.AI cs.CV cs.LG cs.SD eess.SP

Deep Hierarchical Knowledge Loss for Fault Intensity Diagnosis

深度层次知识损失用于故障强度诊断

Yu Sha, Shuiping Gou, Bo Liu, Haofan Lu, Ningtao Liu, Jiahui Fu, Horst Stoecker, Domagoj Vnucec, Nadine Wetzstein, Andreas Widl, Kai Zhou

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院) School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院) School of Computer, Luoyang Institute of Science and Technology(洛阳理工学院计算机学院) Frankfurt Institute for Advanced Studies(法兰克福先进研究 institute) SAMSON AG(SAMSON公司)

AI总结 本文提出深度层次知识损失框架,通过层次树损失和焦点层次树损失提升故障诊断的识别能力,实验表明在多个工业数据集上优于现有方法。

Comments The paper has been accepted by Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.1 (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27462 2026-04-21 cs.CL cs.AI

VCORE: Variance-Controlled Optimization-based Reweighting for Chain-of-Thought Supervision

VCORE: 基于方差控制的优化重加权用于链式推理监督

Xuan Gong, Senmiao Wang, Hanbo Huang, Ruoyu Sun, Shiyu Liang

机构 * Shanghai Jiao Tong University(上海交通大学) Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

AI总结 VCORE通过将链式推理监督转化为约束优化问题,实现对token的自适应监督分配,提升大语言模型的推理泛化能力,在数学和编程基准测试中表现突出。

Comments Accepted to ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13759 2026-04-21 cs.CV

Uni-MMMU: A Massive Multi-discipline Multimodal Unified Benchmark

Uni-MMMU:一个大规模多学科多模态统一基准

Kai Zou, Ziqi Huang, Yuhao Dong, Shulin Tian, Dian Zheng, Hongbo Liu, Jingwen He, Bin Liu, Yu Qiao, Ziwei Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) S-Lab, Nanyang Technological University(南洋理工大学S实验室) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 Uni-MMMU通过八个以推理为中心的领域系统展开生成与理解的双向协同,评估模型在视觉理解和生成方面的性能差异及跨模态依赖,为统一模型发展提供可靠基础。

Comments Equal contributions from frst three authors. Project page: https://vchitect.github.io/Uni-MMMU-Project/ Code: https://github.com/vchitect/Uni-MMMU

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06296 2026-04-21 cs.PL cs.AI

VeriEquivBench: An Equivalence Score for Ground-Truth-Free Evaluation of Formally Verifiable Code

VeriEquivBench:一种无需真实地面真相的正式可验证代码评估等价分数

Lingfei Zeng, Fengdi Che, Xuhan Huang, Fei Ye, Xu Xu, Binhang Yuan, Jie Fu

机构 * Huazhong University of Science and Technology(华中科技大学) University of Alberta(阿尔伯塔大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Hong Kong University of Science and Technology(香港科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 本文提出VeriEquivBench,通过2389个复杂算法问题评估正式可验证代码的生成与推理能力,揭示当前LLM在生成正式规范和代码方面的挑战,推动可扩展可靠编码代理的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20360 2026-04-21 cs.CV

EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning

EditVerse:通过上下文学习统一图像和视频编辑与生成

Xuan Ju, Tianyu Wang, Yuqian Zhou, He Zhang, Qing Liu, Nanxuan Zhao, Zhifei Zhang, Yijun Li, Yuanhao Cai, Shaoteng Liu, Daniil Pakhomov, Zhe Lin, Soo Ye Kim, Qiang Xu

机构 * Adobe Research(Adobe研究院) CUHK(中国香港大学) Johns Hopkins University(约翰霍普金斯大学) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 本文提出EditVerse框架,通过统一token序列实现图像和视频生成编辑,利用自注意力机制实现跨模态知识迁移,实验表明其在视频编辑任务中达到SOTA水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02547 2026-04-21 cs.AI cs.CL

The Landscape of Agentic Reinforcement Learning for LLMs: A Survey

代理强化学习用于大语言模型的景观:综述

Guibin Zhang, Hejia Geng, Xiaohang Yu, Zhenfei Yin, Zaibin Zhang, Zelin Tan, Heng Zhou, Zhongzhi Li, Xiangyuan Xue, Yijiang Li, Yifan Zhou, Yang Chen, Chen Zhang, Yutao Fan, Zihu Wang, Songtao Huang, Francisco Piedrahita-Velez, Yue Liao, Hongru Wang, Mengyue Yang, Heng Ji, Jun Wang, Shuicheng Yan, Philip Torr, Lei Bai

机构 * University of Oxford(牛津大学) Shanghai AI Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Brown University(布朗大学) University College London(伦敦大学学院) University of Science and Technology of China(中国科学技术大学) Imperial College London(伦敦帝国学院) Dalian University of Technology(大连理工大学) Chinese Academy of Sciences(中国科学院) The Chinese University of Hong Kong(香港中文大学) University of Georgia(佐治亚大学) University of California, San Diego(加州大学圣地亚哥分校) University of California, Santa Barbara(加州大学圣塔芭芭拉分校) University of Bristol(布里斯托大学)

AI总结 本文综述了代理强化学习在大语言模型中的应用,提出双分类体系,探讨其核心能力与应用领域,并强调强化学习在使能力转化为适应性行为中的关键作用。

Comments Published on Transactions on Machine Learning Research: https://openreview.net/forum?id=RY19y2RI1O

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15229 2026-04-21 cs.CL cs.AI cs.LG

VocabTailor: Dynamic Vocabulary Selection for Downstream Tasks in Small Language Models

VocabTailor: 小语言模型下游任务中的动态词汇选择

Hanling Zhang, Yayu Zhou, Tongcheng Fang, Zhihang Yuan, Guohao Dai, Wanli Ouyang, Yu Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Infinigence AI Tsinghua University(清华大学) SLAI Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 VocabTailor通过动态词汇选择框架减少小语言模型词汇相关组件的内存使用,结合静态与动态策略,实现高达99%的内存节省且不影响性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25300 2026-04-20 cs.LG cs.AI

Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning

LLM强化学习后训练的扩展行为:数学推理中的实证研究

Zelin Tan, Hejia Geng, Xiaohang Yu, Mulei Zhang, Guancheng Wan, Yifan Zhou, Qiang He, Xiangyuan Xue, Heng Zhou, Yutao Fan, Zhongzhi Li, Zaibin Zhang, Guibin Zhang, Chen Zhang, Zhenfei Yin, Philip Torr, Lei Bai

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) University of Oxford(牛津大学) Imperial College London(伦敦帝国学院) University of Georgia(佐治亚大学) The Chinese University of Hong Kong(香港中文大学) Chinese Academy of Sciences(中国科学院) Dalian University of Technology(大连理工大学) National University of Singapore(新加坡国立大学) Wuhan University(武汉大学)

AI总结 本文通过实证研究探讨了LLM后训练强化学习中的扩展行为,重点分析了模型规模、数据量和计算预算对数学推理性能的影响,揭示了学习效率的饱和趋势及高质量数据重复利用的有效性。

Comments V4 version:This Paper has been accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏