arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Meituan(美团)

2026-05-19 至 2026-05-19 共收录 5
2605.18529 2026-05-19 cs.AI

AMR-SD: Asymmetric Meta-Reflective Self-Distillation for Token-Level Credit Assignment

AMR-SD:不对称元反射自蒸馏用于标记级信用分配

Zhenlin Wei, Pu Jian, Yingzhuo Deng, Xiaohan Wang, Jiajun Chai, Zhexin Hu, Wei Lin, Shanbin Zhang, Guojun Yin

机构 * Meituan Beijing, China(美团北京,中国) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出AMR-SD,一种不对称元反射自蒸馏方法,旨在解决大型语言模型在复杂推理中因统一序列奖励导致的信用分配瓶颈问题,通过引入反思瓶颈和因果信息增益机制,实现更精确的标记级优势调节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18500 2026-05-19 cs.CL

Implicit Hierarchical GRPO: Decoupling Tool Invocation from Execution for Tool-Integrated Mathematical Reasoning

隐式层次GRPO:将工具调用与执行解耦以实现工具集成的数学推理

Li Wang, Xiaohan Wang, Xiaodong Lu, Zipeng Zhang, Jinyang Wu, Jiajun Chai, Wei Lin, Guojun Yin

机构 * Meituan(美团) Tsinghua University(清华大学)

AI总结 本文提出了一种将工具调用与执行解耦的方法,通过引入延迟执行和显式控制来增强工具集成推理能力,并提出了一个分层控制框架和理论推导出的替代损失函数,从而得到隐式分层策略,最终提出IH-GRPO算法,在六个跨领域数学推理基准测试中,Qwen3-1.7B、Qwen3-4B和Qwen3-8B在最强基线方法上分别实现了1.87%、2.16%和2.53%的绝对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17748 2026-05-19 cs.CV

Unleashing Vision Transformer Potential In Image Quality Assessment via Global-Local Adaptive Interaction

通过全局-局部自适应交互释放视觉Transformer在图像质量评估中的潜力

Yu Li, Puchao Zhou, Yachun Mi, Yanfeng Wu, Xiaoming Wang, Shaohui Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Meituan(美团)

AI总结 本文提出了一种全局-局部自适应交互框架,通过双流特征提取机制和交互式全局-局部融合,提升图像质量评估的预测精度和鲁棒性,同时减少可训练参数数量。

Journal ref Proceedings of the 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. [10567]-[10571], 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16416 2026-05-19 cs.CV cs.AI

SSL4RL: Revisiting Self-supervised Learning as Intrinsic Reward for Visual-Language Reasoning

SSL4RL:重新审视自监督学习作为视觉语言推理的内在奖励

Xiaojun Guo, Runyu Zhou, Yifei Wang, Qi Zhang, Chenheng Zhang, Stefanie Jegelka, Xiaohan Wang, Jiajun Chai, Guojun Yin, Wei Lin, Yisen Wang

机构 * Peking University(北京大学) MIT(麻省理工学院) TUM(技术大学(TUM)) Meituan(美团) Peking University School of CIT, MCML, MDSIEECS and CSAIL(北京大学计算机学院、MCML、MDSIEECS以及CSAIL)

AI总结 本文提出SSL4RL框架,利用自监督学习任务作为强化学习的可验证奖励,提升视觉语言推理性能,并通过实验验证其在多模态模型对齐中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14820 2026-05-19 cs.RO

A Visual Reinforcement Learning-Based Separate Primitive Policy for Peg-in-Hole Tasks

基于视觉强化学习的分步策略:用于铆钉入孔任务

Zichun Xu, Zhaomin Wang, Yuntao Li, Lei Zhuang, Zhiyuan Zhao, Guocai Yang, Jingdong Zhao

机构 * State Key Laboratory of Robotics and Systems, Harbin Institute of Technology(机器人系统国家重点实验室,哈尔滨工业大学) Ubtech Robotics(优必选科技) Meituan Academy of Robotics(美团机器人研究院) School of Mechanical Engineering, Shandong University(山东大学机械工程学院)

AI总结 本文提出S2P策略,通过视觉强化学习实现铆钉入孔任务中位置和插入动作的同步学习,提升了样本效率和成功率。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏