arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Meituan(美团)

共收录 350
2605.28534 2026-05-28 cs.CL

GUI-CIDER: Mid-training GUI Agents via Causal Internalization and Density-aware Exemplar Reselection

GUI-CIDER:通过因果内化和密度感知示例重选进行GUI代理的中期训练

Zheng Wu, Chengcheng Han, Zhengxi Lu, Tianjie Ju, Yanyu Chen, Qi Gu, Xunliang Cai, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Meituan(美团) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出GUI-CIDER中期训练方法,通过因果内化和密度感知示例重选显式内化GUI世界知识,提升代理对GUI操作的理解和任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28424 2026-05-28 cs.CL

Skill0.5: Joint Skill Internalization and Utilization for Out-of-Distribution Generalization in Agentic Reinforcement Learning

Skill0.5:面向智能体强化学习中分布外泛化的联合技能内化与利用

Jiapeng Zhu, Jianxiang Yu, Yibo Zhao, Chengcheng Han, Qi Gu, Xunliang Cai, Xiang Li, Weining Qian

机构 * East China Normal University(华东师范大学) Meituan Longcat Team(美团Longcat团队)

AI总结 提出Skill0.5框架,通过区分通用技能内化与任务特定技能利用,结合动态难度感知路由器,在ALFWorld和WebShop上提升了分布内和分布外场景的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28184 2026-05-28 cs.LG

Joint Training of Multi-Token Prediction in Reinforcement Learning via Optimal Coefficient Calibration

通过最优系数校准在强化学习中联合训练多令牌预测

Zili Wang, Jiajun Chai, Lin Chen, Xiaohan Wang, Shiming Xiang, Guojun Yin

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Meituan(美团)

AI总结 本文从优化角度分析多令牌预测与强化学习联合训练失败的原因,提出最优系数校准方法,通过在线跟踪最优系数实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28079 2026-05-28 cs.CL

ATLAS: All-round Testing of Long-context Abilities across Scales

ATLAS: 跨尺度的长上下文能力全面测试

Deli Huang, Cunguang Wang, Hongyin Tang, Zhe Tang, Linsen Guo, Dongyu Ru, Ruoshi Yuan, Ziyue Zhu, Xiaoyu Li, Ziwen Wang, Chen Zhang, Anchun Gui, Wen Zan, Jiaqi Zhang, Xuezhi Cao, Jingang Wang, Xunliang Cai, Yixin Cao

机构 * Meituan(美团) Fudan University(复旦大学)

AI总结 提出ATLAS基准框架,通过分层分类、长度感知AUC评分和ATLAScore聚合指标,系统评估长上下文语言模型在不同长度和任务上的性能退化与能力分布。

Comments 29 pages, 13 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28069 2026-05-28 cs.AI

ZipRL: Adaptive Multi-Turn Context Compression with Hindsight Response Replay

ZipRL: 自适应多轮上下文压缩与事后响应回放

Zhexin Hu, Li Wang, Xiaohan Wang, Jiajun Chai, Xiaojun Guo, Wei Lin, Guojun Yin

机构 * Meituan(美团) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

AI总结 提出ZipRL框架,通过多粒度压缩机制和事后响应回放技术,在可验证奖励强化学习中实现自适应上下文压缩,平衡信息保留与token效率,在多个智能体任务中显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27899 2026-05-28 cs.AI

SKILLC: Learning Autonomous Skill Internalization in LLM Agents via Contrastive Credit Assignment

SKILLC: 通过对比信用分配学习LLM智能体的自主技能内化

Hongxiang Lin, Zhirui Kuai, Erpeng Xue, Lei Wang

机构 * Meituan(美团)

AI总结 提出SkillC框架,基于对比技能信用分配(CSCA)将技能帮助性对比转化为直接学习信号,实现LLM智能体的自主技能内化,在ALFWorld和WebShop上分别超越最强基线5.5%和4.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19444 2026-05-28 cs.LG cs.AI

Detecting and Mitigating the Correct-Answer Extinction Window in Test-Time Reinforcement Learning with Majority Voting

检测与缓解测试时强化学习中多数投票导致的正确答案灭绝窗口

Hongxiang Lin, Zhirui Kuai, Erpeng Xue, Lei Wang

机构 * Meituan(美团)

AI总结 本文提出TTRL-Guard框架,通过翻转率感知奖励缩放、少数保留采样和风险条件稀疏更新三种机制,检测并缓解测试时强化学习中多数投票导致的正确答案信号永久抑制问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27209 2026-05-27 cs.AI

Learning to Act under Noise: Enhancing Agent Robustness via Noisy Environments

在噪声中学习行动:通过噪声环境增强智能体鲁棒性

Yuxin Chen, Xiaodong Cai, Junfeng Fang, Zhuowen Han, Yu Wang, Yaorui Shi, Yi Zhang, Qi Gu, Xunliang Cai, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) Meituan(美团) Tsinghua University(清华大学) Tianjin University(天津大学) University of Science and Technology of China(中国科学技术大学)

AI总结 提出NoisyAgent框架,通过在训练中引入用户噪声和工具噪声,提升智能体在真实世界噪声环境下的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27141 2026-05-27 cs.AI

VitaBench 2.0: Evaluating Personalized and Proactive Agents in Long-Term User Interactions

VitaBench 2.0:评估长期用户交互中的个性化与主动型代理

Yuxin Chen, Yi Zhang, Zhengzhou Cai, Yaorui Shi, Zhiyuan Yao, Chenhang Cui, Jingnan Zheng, Yaqi Huo, Xi Su, Qi Gu, Xunliang Cai, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Meituan(美团) University of Science and Technology of China(中国科学技术大学) Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang University(浙江大学)

AI总结 针对现有代理基准忽视用户偏好推断与利用的问题,提出VitaBench 2.0基准,通过时间序列任务和可扩展记忆接口评估代理在长期交互中的个性化与主动性,实验表明最先进模型仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26842 2026-05-27 cs.LG cs.CL

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training

MONA: 基于Nesterov加速的Muon优化器用于可扩展语言模型训练

Jiacheng Li, Jianchao Tan, Hongtao Xu, Jiaqi Zhang, Yifan Lu, Yerui Sun, Yuchen Xie, Xunliang Cai

机构 * Meituan(美团)

AI总结 提出MONA优化器,通过将Nesterov加速项集成到Muon的梯度处理流程中,实现曲率感知加速,从而帮助逃离尖锐局部最小值,并在1B到68B参数的混合专家预训练中取得更优收敛和下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26486 2026-05-27 cs.CV

LongCat-Video-Avatar 1.5 Technical Report

LongCat-Video-Avatar 1.5 技术报告

Meituan LongCat Team, Xunliang Cai, Meng Cheng, Feng Gao, Zhe Kong, Jiamu Li, Le Li, Weiheng Li, Hongyu Liu, Shuai Tan, Xiaoming Wei, Tianyu Yang, Yong Zhang

机构 * Meituan LongCat Team(美团LongCat团队)

AI总结 本文提出 LongCat-Video-Avatar 1.5,一个通过升级音频编码器、优化训练策略、数据筛选和RLHF训练实现高精度唇同步、全身时间稳定性和长视频生成的开放框架,在多个基准测试中达到或超越商业系统性能。

Comments Homepage: https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/ Github: https://github.com/meituan-longcat/LongCat-Video

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25874 2026-05-26 cs.CV

WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation

WBench:面向交互式视频世界模型评估的综合多轮基准

Kaining Ying, Hengrui Hu, Siyu Ren, Jiamu Li, Fengjiao Chen, Ziwen Wang, Xuezhi Cao, Xunliang Cai, Henghui Ding

机构 * Fudan University(复旦大学) Meituan Longcat Team(美团Longcat团队)

AI总结 提出WBench,一个包含五个维度、289个测试用例和1058轮交互的综合多轮基准,用于系统评估交互式世界模型,并发现现有模型在不同维度上表现不一。

Comments Technical report of WBench. Homepage: https://meituan-longcat.github.io/WBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25864 2026-05-26 cs.LG cs.CL

When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards

当自我信念误导:面向可验证奖励的强化学习的主动标签获取

Li Wang, Xiaodong Lu, Xiaohan Wang, Yikun Ban, Jiajun Chai, Wei Lin, Tianhao Peng, Guojun Yin

机构 * Meituan(美团) Beihang University(北京航空航天大学) Nanyang Technological University(新加坡国立大学)

AI总结 提出RLAVR框架,通过主动获取少量真实标签并与伪标签结合,利用CAG指标和CARE策略稳定训练并提升有限标注预算下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25698 2026-05-26 cs.LG cs.AI

How Should LLMs Consume High-Quality Data? Optimal Data Scheduling via Quality-Aware Functional Scaling Laws

LLM应如何消费高质量数据?通过质量感知的功能缩放定律实现最优数据调度

Zhitao Zhu, Xili Wang, Shizhe Wu, Jiawei Fu, Xiaoqing Liu

机构 * Peking University(北京大学) Meituan(美团)

AI总结 本文通过引入数据质量维度扩展功能缩放定律,解析求解了联合数据质量和批次大小调度问题,揭示了高质量数据的双重角色,并提出了Drop-Stable-Rampup调度策略,在15B MoE模型上相比WSD和余弦衰减分别提升平均准确率+1.70和+2.98。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13643 2026-05-26 cs.CL

Prefix Teach, Suffix Fade: Local Teachability Collapse in Strong-to-Weak On-Policy Distillation

前缀教导,后缀消退:强到弱在线策略蒸馏中的局部可教性崩溃

Kaiyuan Liu, Ziyuan Zhuang, Yang Bai, Bing Wang, Rongxiang Weng, Jieping Ye

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Meituan LongCat Team, China(美团LongCat团队,中国) College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院)

AI总结 本文发现强到弱在线策略蒸馏中,教师反馈在生成轨迹的后缀部分缺乏局部对比度,导致“局部可教性崩溃”,并提出基于变化点检测的截断规则来优化监督区域,实验表明该方法优于全轨迹蒸馏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14054 2026-05-26 cs.LG cs.CL

$π$-Play: Multi-Agent Self-Play via Privileged Self-Distillation without External Data

$\pi$-Play: 通过特权自蒸馏实现的多智能体自对弈,无需外部数据

Yaocheng Zhang, Yuanheng Zhu, Wenyue Chong, Songjun Tu, Qichao Zhang, Jiajun Chai, Xiaohan Wang, Wei Lin, Guojun Yin, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) Meituan(美团) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 提出$\pi$-Play框架,利用自对弈中生成的问答构建路径作为特权信息,结合自蒸馏实现密集反馈的多智能体协同进化,无需外部数据即可超越全监督搜索代理。

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28767 2026-05-25 cs.CV

Gen-Searcher: Reinforcing Agentic Search for Image Generation

Gen-Searcher: 强化搜索代理用于图像生成

Kaituo Feng, Manyuan Zhang, Shuang Chen, Yunlong Lin, Kaixuan Fan, Yilei Jiang, Hongyu Li, Dian Zheng, Chenyang Wang, Xiangyu Yue

机构 * MMLab, CUHK(CUHK的MMLab) UCLA(加州大学洛杉矶分校) UC Berkeley(加州大学伯克利分校) Meituan Home(美团家庭)

AI总结 提出Gen-Searcher,首个通过多跳推理和搜索收集文本知识与参考图像的搜索增强图像生成代理,结合SFT和强化学习训练,显著提升生成质量。

Comments Project page: https://gen-searcher.vercel.app Code: https://github.com/tulerfeng/Gen-Searcher

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21605 2026-05-25 cs.CV

GenEvolve: Self-Evolving Image Generation Agents via Tool-Orchestrated Visual Experience Distillation

GenEvolve: 通过工具编排的视觉经验蒸馏实现自我进化的图像生成智能体

Sixiang Chen, Zhaohu Xing, Tian Ye, Xinyu Geng, Yunlong Lin, Jianyu Lai, Xuanhua He, Fuxiang Zhai, Jialin Gao, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Meituan(美团) The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学)

AI总结 提出GenEvolve框架,通过工具编排的视觉经验蒸馏,使图像生成智能体在多样化任务中自我进化,提升工具使用和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21487 2026-05-25 cs.CV

Uni-Edit: Intelligent Editing Is A General Task For Unified Model Tuning

Uni-Edit: 智能编辑作为统一模型调优的通用任务

Dian Zheng, Manyuan Zhang, Hongyu Li, Hongbo Liu, Kai Zou, Kaituo Feng, Hongsheng Li

机构 * CUHK MMLab(香港大学多模态实验室) Meituan(美团) TJU(天津大学) USTC(中国科学技术大学)

AI总结 提出将智能图像编辑作为统一多模态模型调优的通用任务,通过单一任务、单阶段训练和单一数据集同时提升图像理解、生成和编辑能力,并引入自动化数据合成流水线构建推理密集型指令数据集Uni-Edit-148k。

Comments Project Page: https://zhengdian1.github.io/Uni-Edit-proj/ Code: https://github.com/zhengdian1/Uni-Edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05997 2026-05-25 cs.CV

4DThinker: Thinking with 4D Imagery for Dynamic Spatial Understanding

4DThinker: 用4D图像进行动态空间理解的思考

Zhangquan Chen, Manyuan Zhang, Xinlei Yu, Xiang An, Bo Li, Xin Xie, ZiDong Wang, Mingze Sun, Shuang Chen, Hongyu Li, Xiaobin Hu, Ruqi Huang

机构 * Tsinghua University, SIGS(清华大学 SIGS) Meituan(美团) The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学) LMMs-Lab(LMMs实验室) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 提出4DThinker框架,通过动态潜在心理图像(在连续隐藏空间中模拟场景演化)增强视觉语言模型的动态空间推理能力,并引入无标注数据生成、动态图像微调及4D强化学习,在多个基准上超越强基线。

Comments 21 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22658 2026-05-22 cs.CV cs.LG cs.MM eess.IV

SegCompass: Exploring Interpretable Alignment with Sparse Autoencoders for Enhanced Reasoning Segmentation

SegCompass: 探索通过稀疏自编码器实现可解释对齐以增强推理分割

Zhenyu Lu, Liupeng Li, Jinpeng Wang, Haoqian Kang, Yan Feng, Ke Chen, Yaowei Wang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Meituan, Beijing(美团,北京) University of Chinese Academy of Sciences(中国科学院大学) College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院)

AI总结 本文提出SegCompass,一种通过稀疏自编码器实现可解释对齐的端到端模型,以提升推理分割的性能和可解释性。

Comments Accepted by CVPR 2026. 15 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22567 2026-05-22 cs.CL

LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance

LANG: 用于多语言推理的强化学习与语言自适应提示引导

Yuchun Fan, Bei Li, Peiguang Li, Yilin Wang, Yongyu Mu, Jian Yang, Xin Chen, Rongxiang Weng, Jingang Wang, Xunliang Cai, Jingbo Zhu, Tong Xiao

机构 * NLP Lab, School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院自然语言处理实验室) Meituan Inc.(美团公司) NiuTrans Research, Shenyang, China(牛译研所)

AI总结 本文提出LANG框架,通过语言条件提示引导非英语推理任务的探索,解决了多语言环境下强化学习在输入语言一致性与推理质量之间的权衡问题,提升了推理性能而不影响语言一致性。

Comments Accepted to ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22263 2026-05-22 cs.LG cs.AI

Tailoring Teaching to Aptitude: Direction-Adaptive Self-Distillation for LLM Reasoning

按能力定制教学:方向自适应自蒸馏用于LLM推理

Hongbin Zhang, Chaozheng Wang, Kehai Chen, Youcheng Pan, Yang Xiang, Jinpeng Wang, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology(计算智能研究所,哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Keeta AI, Meituan(Keeta AI,美团)

AI总结 本文提出方向自适应自蒸馏(DASD),通过熵引导的定向监督改进LLM推理,通过分析发现统一的教师监督导致探索被压制,DASD在六个数学推理基准中取得最佳表现。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21032 2026-05-21 cs.CV

Towards Physically Consistent 4D Scene Reconstruction for Closed-loop Autonomous Driving Simulation

迈向物理一致的闭环自动驾驶模拟中的4D场景重建

Bowyn Tan, Yutong Xie, Bai Huang, Fan Luo, Xiao Li, Naizheng Wang, Yang Guan, Shengbo Eben Li

机构 * Tsinghua University(清华大学) Meituan(美团) Central University of Finance and Economics(中央财经大学)

AI总结 本文提出了一种信息几何诊断框架,解决3DGS方法在同时实现空间和时间参数建模时的信用分配难题,通过引入正交投影梯度(OPG)和时间正则化策略,提升了4D场景重建的物理一致性。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20729 2026-05-21 cs.CL

MTR-Suite: A Framework for Evaluating and Synthesizing Conversational Retrieval Benchmarks

MTR-Suite: 一个用于评估和合成对话检索基准的框架

Junhao Ruan, Abudukeyumu Abudula, Bei Li, Yongjing Yin, Xinyu Liu, Kechen Jiao, Xin Chen, Jingang Wang, Xunliang Cai, Tong Xiao, Jingbo Zhu

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Meituan Inc.(美团公司) NiuTrans Research(牛译研所) Tsinghua University(清华大学)

AI总结 本文提出MTR-Suite框架,通过LLM审计、多智能体系统生成和通用领域基准,解决对话检索基准评估和合成中的成本高、标注稀疏和自动化方法僵化的问题。

Comments Accepted to ACL 2026 (main conference). 28 pages. Code and data: https://github.com/rangehow/mtr-suite

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07926 2026-05-21 cs.AI

AgentEscapeBench: Evaluating Out-of-Domain Tool-Grounded Reasoning in LLM Agents

AgentEscapeBench: 评估LLM代理在跨领域工具引导推理中的能力

Zhengkang Guo, Yiyang Li, Lin Qiu, Xiaohua Wang, Jingwen Xv, Dongyu Ru, Xiaoyu Li, Xiaoqing Zheng, Xuezhi Cao, Xunliang Cai

机构 * Fudan University(复旦大学) Meituan Longcat Team(美团Longcat团队)

AI总结 本文提出AgentEscapeBench基准测试,用于评估LLM代理在非熟悉工作流和短程交互之外维持工具引导推理的能力,通过逃亡室风格的任务测试代理在显式长距离依赖约束下推断、执行和修订新工具使用程序的能力,结果显示代理在依赖深度增加时表现显著下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19660 2026-05-20 cs.LG cs.CL

OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond

OScaR:LLMs及更广泛场景中的极压缩KV缓存量化之奥卡姆之刀

Zunhai Su, Rui Yang, Chao Zhang, Yaxiu Liu, Yifan Zhang, Wei Wu, Jing Xiong, Dayou Du, Xialie Zhuang, Yulei Qian, Yuchen Xie, Yik-Chung Wu, Hongxia Yang, Ngai Wong

机构 * Tsinghua University(清华大学) Meituan LongCat Team(美团LongCat团队) The University of Hong Kong(香港大学) The University of Edinburgh(爱丁堡大学) UCAS(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 本文针对LLMs中KV缓存极压缩时的量化保真问题,提出OScaR框架,通过Canalized Rotation和Omni-Token Scaling有效缓解Token Norm Imbalance,实现近无损的INT2量化性能,同时提升解码速度和吞吐量。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19425 2026-05-20 cs.LG cs.AI

When to Stop Reusing: Dynamic Gradient Gating for Sample-Efficient RLVR

何时停止重用:动态梯度门控用于样本高效的RLVR

Yuchun Miao, Sen Zhang, Yuqi Zhang, Yaorui Shi, Qi Gu, Xunliang Cai, Lefei Zhang

机构 * National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University(国家多媒体软件工程研究中心,武汉大学计算机学院) Meituan Longcat Team(美团Longcat团队) The University of Sydney(悉尼大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出动态梯度门控(DGG)方法,通过实时监控lm_head梯度范数来检测并阻止有害的梯度传播,从而提高样本效率和训练速度。

Comments 23 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18529 2026-05-19 cs.AI

AMR-SD: Asymmetric Meta-Reflective Self-Distillation for Token-Level Credit Assignment

AMR-SD:不对称元反射自蒸馏用于标记级信用分配

Zhenlin Wei, Pu Jian, Yingzhuo Deng, Xiaohan Wang, Jiajun Chai, Zhexin Hu, Wei Lin, Shanbin Zhang, Guojun Yin

机构 * Meituan Beijing, China(美团北京,中国) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出AMR-SD,一种不对称元反射自蒸馏方法,旨在解决大型语言模型在复杂推理中因统一序列奖励导致的信用分配瓶颈问题,通过引入反思瓶颈和因果信息增益机制,实现更精确的标记级优势调节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18500 2026-05-19 cs.CL

Implicit Hierarchical GRPO: Decoupling Tool Invocation from Execution for Tool-Integrated Mathematical Reasoning

隐式层次GRPO:将工具调用与执行解耦以实现工具集成的数学推理

Li Wang, Xiaohan Wang, Xiaodong Lu, Zipeng Zhang, Jinyang Wu, Jiajun Chai, Wei Lin, Guojun Yin

机构 * Meituan(美团) Tsinghua University(清华大学)

AI总结 本文提出了一种将工具调用与执行解耦的方法,通过引入延迟执行和显式控制来增强工具集成推理能力,并提出了一个分层控制框架和理论推导出的替代损失函数,从而得到隐式分层策略,最终提出IH-GRPO算法,在六个跨领域数学推理基准测试中,Qwen3-1.7B、Qwen3-4B和Qwen3-8B在最强基线方法上分别实现了1.87%、2.16%和2.53%的绝对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏