arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Meituan(美团)

共收录 350
2608.13560 2026-08-14 cs.CV cs.AI cs.CL 新提交

AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

AutoDesign:面向长视距智能体设计的元工具优化

Yaxin Luo, Haobin Jiang, Jialv Zou, Xu Huang, Wenhao Yan, Haodong Li, Zhengrong Yue, Jing Li, Xiaofu Chen, Xiaohan Zhao, Jiacheng Liu, Jiacheng Cui, Zhiqiang Shen, Xiaotong Li

机构 * Meituan(美团) MBZUAI(Mohamed bin Zayed University of Artificial Intelligence) Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 AutoDesign是符合人类设计先验的元工具优化框架,以论文转海报生成任务为实例,在PosterBench上性能优于Claude Design,集成其学习的DesignHarness可提升代码智能体性能,且获人类最高偏好。

Comments Tech Report. Code at: https://github.com/Yaxin9Luo/AutoDesign

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13417 2026-08-14 cs.AI 新提交

Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development

超越最终得分:面向长期人工智能研究与开发的智能体系统评估

Yiwei Li, Wanli Yang, Hexiang Tan, Xiangzhou Huang, Zhengyu Chen, Ziran Li, Borun Chen, Shanglin Lei, Huaisheng Zhu, Hao Tian, Fei Sun, Xunliang Cai, Jingang Wang

机构 * Meituan(美团) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文通过新框架评估7个前沿模型在36项长期任务上的表现,发现当前智能体更像工程优化器,方案多基于已有技术,为模型训练等环节改进指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13010 2026-08-14 cs.CL cs.CR cs.IR 新提交

RAGSieve: Self-Referenced Local Contrast for Knowledge-Poison Detection in Retrieval-Augmented Generation

RAGSieve:用于检索增强生成中知识投毒检测的自参考局部对比方法

Xinlong Xu, Yoshua Y. Li

机构 * Nanjing University of Information Science and Technology(南京信息工程大学) Meituan(美团)

AI总结 本研究提出RAGSieve框架,含RSQ与RSG两种局部对比方法,在多QA数据集和投毒构造上实现优异检测性能,联合部署可显著降低RAG攻击成功率且保留部分未投毒检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13006 2026-08-14 cs.CL cs.IR 新提交

EviReform: Evidence-Guided Query Reformulation for Multi-Hop Graph Retrieval

EviReform:面向多跳图检索的证据引导式查询重构

Xinlong Xu, Yoshua Y. Li

机构 * Nanjing University of Information Science and Technology(南京信息工程大学) Meituan(美团)

AI总结 EviReform将检索请求修订与图中证据聚合分离,结合原始与残差检索信号传播,在多跳问答数据集上较基线模型提升了Recall@5和F1指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08676 2026-08-11 cs.CV cs.AI 新提交

UniSpace: Unified Visual Representation and Scalable Multimodal Modeling

UniSpace:统一视觉表示与可扩展多模态建模

Jinbo Yan, Limeng Qiao, Jie Qin, Junyan He, Feize Wu, Guanglu Wan

机构 * Meituan(美团)

AI总结 本文提出 UniSpace,通过 Patch Reparameterization 改进语义 ViT,构建 80 亿参数的 Transformer 专家混合模型,实现同一视觉空间内的理解、生成与编辑,提升重建效果,支持文本到图像生成和指令式图像编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08569 2026-08-11 cs.AI cs.SD 新提交

VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference

VoxZip:面向长上下文音频推理的语义锚定时序KV缓存压缩

Wenxu Jia, Dongjie Fu, Xize Cheng, Fangming Feng, Linjun Li, Wenshi Chen, Yingming Li, Zhou Zhao, Tao Jin

机构 * Zhejiang University(浙江大学) Meituan(美团)

AI总结 针对语音大语言模型长上下文推理的KV缓存内存瓶颈,提出无训练两阶段语义锚定框架VoxZip,在多音频基准上实现高效压缩,维持高性能并提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08146 2026-08-11 cs.AI 新提交

Long SKILL Compliance as Logical Reasoning: Closure-Grounded Detection with Scaling-Guided On-Policy Distillation

长SKILL合规性检测作为逻辑推理:基于闭包的检测与尺度引导的在线策略蒸馏

Shuaitao Zhao, Feng Ni, Lichao Ma, Jiaye Lin, Fei Han, Yang Wei, Lu Pan

机构 * Meituan(美团)

AI总结 针对长SKILL合规性检测的成本与精度矛盾,提出SkillCDG框架,结合两级检索与依赖闭包实现检测,在多数据集上优于基线,还发现尺度趋势以优化小模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05987 2026-08-07 cs.AI cs.LG 新提交

AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning

AgentOPSD:面向智能体强化学习的递归自蒸馏方法

Zi-Han Wang, Zhengxi Lu, Zhiyuan Yao, Jinyang Wu, Jie Wu, Zhengzhou Cai, Yueqing Sun, Ziang Ye, Linji Hao, Qi Gu, Xunliang Cai, Yongliang Shen, Yujiu Yang

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) Meituan(美团)

AI总结 提出 AgentOPSD 这一无 critic 的递归自蒸馏方法,用于智能体强化学习的轮次级 credit 分配,在 ALFWorld 等数据集上优于 GRPO 等基线,在 Qwen2.5-7B 模型上实现 ALFWorld 89.1% 的成功率。

Comments Code: https://github.com/ZethWang/AgentOPSD

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06420 2026-08-07 cs.CV cs.AI 交叉投稿

HoloCount: A Holistic Visual Counting Benchmark for MLLMs

HoloCount:用于多模态大语言模型的整体视觉计数基准

Jinhong Deng, Limeng Qiao, Guanglu Wan

机构 * Meituan(美团)

AI总结 研究针对多模态大语言模型定量精度瓶颈及现有计数基准局限,引入HoloCount基准,从语义、分析计数和鲁棒性测试三方面评估模型,经对20多个模型详尽评估,揭示其性能差距,为多模态系统发展提供路线图。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04788 2026-08-06 cs.LG cs.AI cs.CL 新提交

Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation

带有观测校准自蒸馏的智能体强化学习

Yi Yang, Cong Qin, Xiaodan Liu, Chishui Chen, Qing Dong, Yan Zhang, Cao Liu, Zhao Yang, Lu Pan, Jiaye Lin, Yi Feng

机构 * Meituan(美团)

AI总结 本研究针对智能体强化学习的混淆问题,提出OCSD方法,通过对比两类回放视图推导观测残差,在高不确定步骤调制GRPO更新,在三类任务和多模型规模上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01953 2026-08-06 cs.CL cs.LG 版本更新

Look Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy Distillation

蒸馏前先前瞻:智能体策略内蒸馏中教师指导的未来轨迹验证

Chishui Chen, Yaoyou Fan, Te Sun, Yi Yang, Chenghao Sun, Delin Mao, Hongbo Qiao, Zuowei Zhang, Junxi Wang, Chenxing Sun, Yangen Hu, Lu Pan, Xuyang Liu, Linfeng Zhang

机构 * Meituan LongCat Interaction(美团龙猫交互) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Peking University(北京大学) Nanjing University(南京大学) University of Chinese Academy of Sciences(中国科学院大学) Jilin University(吉林大学) University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 该研究针对策略内蒸馏的学生轨迹偏差问题,提出FutureBridge-OPD方法,在多任务基准上显著优于现有方法,代码公开可用。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01662 2026-08-05 cs.AI cs.CL cs.DC cs.LG 版本更新

LongCat Sparse Attention: Taming the Lightning via Streaming-aware Hierarchical Cross-Layer Indexing

LongCat 稀疏注意力:通过流感知分层跨层索引驯服闪电(Lightning)

Wen Zan, Jiaqi Zhang, Jianchao Tan, Hong Liu, Cunguang Wang, Xiang Li, Duyue Ma, Guanyu Wu, Yifan Lu, Fengcun Li, Yerui Sun, Peng Pei, Yuchen Xie, Xunliang Cai

机构 * Meituan(美团) LongCat Team(LongCat团队)

AI总结 该研究提出软硬件协同设计的 LongCat 稀疏注意力框架,通过三种索引策略解决 DeepSeek 稀疏注意力的系统瓶颈,在多模型上实现与全注意力相当的性能,支撑 LongCat-2.0 开发并开源相关模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01743 2026-08-04 cs.LG cs.CL 新提交

Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning

面向大语言模型强化学习中能力保留的可塑性保持KL正则化方法

Li Wang, Xiaodong Lu, Xiaohan Wang, Jiajun Chai, Wei Lin, Tianhao Peng, Guojun Yin

机构 * Meituan(美团)

AI总结 针对LLM强化学习后训练中能力遗忘问题,提出CoKL正则化框架,可在目标任务改进与原有能力保留间实现更优平衡,优于现有正则化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00782 2026-08-04 cs.CL 新提交

Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance

从自适应教师指导中恢复负强化学习组的学习信号:针对失败情况进行知识蒸馏

Zhuowen Han, Jinwei Xiao, Zhengxi Lu, Renren Jin, Zhiyuan Yao, Yuxin Liu, Hongyan Hao, Yueqing Sun, Yu Yang, Qi GU, Xunliang Cai, Deyi Xiong

机构 * Tianjin University(天津大学) Meituan(美团)

AI总结 该研究针对GRPO与OPD简单结合的性能缺陷,提出RSTG方法,通过选择性自适应蒸馏及补充SFT,使数学任务性能提升4.02%、代码任务提升3.05%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00013 2026-08-04 cs.CL cs.AI cs.CV 新提交

What Transfers from Text to Vision? Capability Scaling Laws and Transfer Dynamics for VLMs

从文本到视觉的可迁移性:视觉语言模型(VLM)的能力缩放定律与迁移动态

Ziran Li, Qiang Wang, Zhengyu Chen, Shanglin Lei, Borun Chen, Jingang Wang, Xunliang Cai

机构 * Meituan(美团) Tsinghua University(清华大学)

AI总结 该研究提出首个跨家族的能力驱动多模态缩放定律,可通过LLM文本能力预测VLM性能,将主干选择从经验搜索转为定量决策,还揭示了LLM作为VLM主干的相关见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29209 2026-08-03 cs.LG cs.AI 新提交

SAF-OPD: Stable Advantage Fusion for On-Policy Distillation

SAF-OPD:面向策略内蒸馏的稳定优势融合

Yifan Ding, Xincheng Wei, Yoshua Y. Li, Ziheng Li, Yuquan Lu, Siyu Zhang, Dongsheng Ma, Rongxiang Weng, Xunliang Cai, Yun Chen

机构 * Shanghai University of Finance and Economics(上海财经大学) Meituan(美团) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学)

AI总结 该研究提出SAF框架解决RLVR与OPD固定系数融合的熵崩溃问题,通过四阶段机制优化优势融合,在7个推理与代码生成基准上提升模型性能与训练稳定性。

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09361 2026-08-03 cs.LG cs.AI 版本更新

GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR

GeoRA: 为强化学习可验证奖励设计的几何感知低秩适应

Jiaying Zhang, Lei Shi, Jiguo Li, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He

机构 * Meituan(美团) Peking University(北京大学)

AI总结 GeoRA通过利用RLVR更新子空间的各向异性与压缩性结构,采用SVD提取主方向初始化低秩适配器,冻结残差部分作为结构锚点,从而在数学、医学和编程领域优于现有低秩基线,同时在跨领域任务中表现更佳。

Comments Accepted at ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28037 2026-07-31 cs.LG 新提交

ClawTrack: Towards Trace-Level Evaluation and Improvement of Real-World Autonomous Agents

ClawTrack:面向真实世界智能体的追踪级评估与改进

Xingjian Wu, Xuhang Zhu, Xingchen Liu, Junlin Liu, Jianing Wang, Linsen Guo, Xiaoyu Li, Xuezhi Cao, Xunliang Cai

机构 * Meituan(美团)

AI总结 本研究针对现有智能体评估仅看结果的缺口,提出双评估基准ClawTrack,含320个任务及过程评分器,评估21个模型后发现其可归因推理、验证结果验证瓶颈等,助力智能体改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27929 2026-07-31 cs.AI 新提交

Meta-Task: Turning Terminal Task Synthesis into a Terminal Task for Scalable Agent Training

元任务:将终端任务综合转化为可扩展智能体训练的终端任务

Zhihong Pan, Jiyuan He, Kai Zhang, Yupeng Han, Ze Liu, Yuze Zhao, Yongcong Ye, Zhaohua Yang

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学) Meituan(美团)

AI总结 Meta-Task框架将终端任务综合转化为Terminal-Bench格式任务,通过多阶段机制等提升任务质量,生成3221条轨迹微调Qwen3系列模型,效果优于同期方法且训练数据更少。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26784 2026-07-30 cs.LG cs.AI 新提交

SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution

SkillRise:面向跨任务技能演化的智能体强化学习

Zhiyuan Yao, Yuxin Chen, Zhengxi Lu, Zishan Xu, Yueqing Sun, Yifu Guo, Yuquan Lu, Zhengzhou Cai, Kangning Zhang, Zhuowen Han, Zi-Han Wang, Ziang Ye, Qi Gu, Xunliang Cai, Weiwen Liu, Yongliang Shen

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) Meituan(美团)

AI总结 SkillRise是跨任务学习技能的统一强化学习框架,解耦信用分配机制实现任务求解与技能整理,在多基准上Pass@1性能优于基线,还降低了运行开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03273 2026-07-30 cs.CV cs.AI cs.CL 版本更新

VistaHop: Benchmarking Long-Horizon Visual DeepSearch

VistaHop: 视觉深度搜索的多跳视觉推理基准

Hang He, Chuhuai Yue, Chengqi Dong, Chengcheng Wan, Ting Su, Haiying Sun, Jiajun Chai, Xiaohan Wang, Guojun Yin

机构 * East China Normal University(东华大学) Meituan(美团) Shanghai Innovation Institute(上海创新研究院)

AI总结 提出VistaHop基准,通过多跳问答任务评估多模态大推理模型在视觉深度搜索中的迭代图像检查、视觉锚点定位和跨证据链推理能力,实验表明现有模型表现有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26017 2026-07-29 cs.CL 新提交

UniMem: Complementary Episodic-to-Parametric Memory for Boundary-Agnostic Task Streams

UniMem:用于无边界任务流的互补情景到参数记忆

Siyu Xia, Chenheng Zhang, Yanting Wu, Haoxuan Li, Jiajun Chai, Xiaohan Wang, Guojun Yin, Wei Lin, Zhouchen Lin, Haifeng Zhang, Jun Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Lab of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Meituan(美团) AI Centre, Department of Computer Science, University College London(伦敦大学学院计算机科学系人工智能中心)

AI总结 研究针对大语言模型在无边界任务流部署的稳定性 - 可塑性困境,提出UniMem自路由框架,用可学习路由令牌协调互补记忆路径,能按需扩展记忆,实验证明其在长周期流任务序列中优于基线并保持执行保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25554 2026-07-29 cs.AI 新提交

Distilling Temporal Search and Reasoning: Evolving LLMs for Future Prediction via Harness-Assisted Efficient Data Synthesis

提炼时间搜索与推理:通过 harness 辅助的高效数据合成发展用于未来预测的大语言模型

Wanxu Cai, Zhengyu Chen, Huaisheng Zhu, Wei Wang, Jingang Wang, Qiang Xu

机构 * The Chinese University of Hong Kong(香港中文大学) Meituan LongCat Team(美团龙猫团队)

AI总结 研究未来事件预测难题,提出时间截断 harness 方法,通过强制时间截断减少时间泄漏与对拒绝采样等的依赖,构建相关语料库和度量标准,经蒸馏实验验证该方法能提升模型表现,将高质量数据转化为模型参数提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25308 2026-07-29 cs.CL cs.AI 新提交

CAST: Game Solvers as Turn-Level Teachers for LLM Agents

CAST:将游戏求解器作为大语言模型智能体的回合级教师

Yu Wang, Yi-Kai Zhang, Wentao Shi, Ziang Ye, Yuchun Miao, Yueqing Sun, Qi Gu, Xunliang Cai, Lan-Zhe Guo, Han-Jia Ye, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学) Wuhan University(武汉大学) Meituan(美团)

AI总结 研究如何训练大语言模型在长期游戏中决策,提出CAST方法,利用游戏求解器状态值变化转化为求解器优势并注入RLVR,在多个游戏中优于基线,实现高平均零样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22724 2026-07-28 cs.LG cs.AI 新提交

Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks

用于长期代理任务的进度条件分组策略优化

Kaibing Yang, Guangfeng Cai, Shengtian Yang, Shuo He, Yu Li, Mengyi Liu, Pengwei Chen, Jun Xu, Lei Feng

机构 * Southeast University(东南大学) Kuaishou Technology(快手科技) Meituan(美团)

AI总结 研究长期代理任务中基于分组策略优化的采样不平衡问题,提出进度条件分组策略优化(ProGPO),通过特定条件下利用首次访问观察覆盖率,为访问更多新状态的轨迹或步骤赋予优势,实验证明该方法优于基线,尤其在困难任务上效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22662 2026-07-28 cs.AI 新提交

CuraWeb: Joint Optimization of Quality, Redundancy, and Diversity for Web-Scale Pretraining Data

CuraWeb:网络规模预训练数据的质量、冗余性和多样性联合优化

Peiguang Li, Yongwei Zhou, Juncheng Diao, Yuchun Fan, Jian Yang, Jianxiao Yang, Zhongda Su, Shuguang Jiao, Xiao Wei, Zhiye Zou, Gan Dong, Zhizhao Zeng, Rongxiang Weng, Jingang Wang, Xunliang Cai

机构 * Meituan(美团)

AI总结 研究针对开放网络语料库预训练数据优化的局限性,提出质量、冗余性和多样性联合优化范式,结合双轨清理与混合去重,构建CuraWeb语料库,实验证明其在多基准测试中性能显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21217 2026-07-24 cs.AI 新提交

ICAE-Bench: Evaluating Coding Agents as Interactive Project Builders

ICAE-Bench:将编码智能体评估为交互式项目构建者

Zhongyuan Peng, Dan Huang, Chuyu Zhang, Caijun Xu, Changyi Xiao, Shibo Hong, David Lo, Lin Qiu, Xuezhi Cao, Jiyuan He, Yixin Cao

机构 * Meituan(美团)

AI总结 研究针对编码智能体在交互式项目构建中作用转变,现有基准未跟上的问题,提出ICAE-Bench基准。从模糊需求出发,经自动化用户智能体模拟动态范式,引入避免需求模糊性、确保用户模拟质量、公平评估开放式仓库的关键设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18153 2026-07-21 cs.CV 新提交

Robust Multimodal Dynamic Object Segmentation

鲁棒多模态动态目标分割

Zhe Xin, Hanzhi Chang, Penghui Huang, Yinian Mao, Guoquan Huang

机构 * Meituan UAV(美团无人机) University of Delaware(特拉华大学)

AI总结 研究针对动态目标分割难题,提出整合多模态线索的框架,设计结合Transformer与特征聚类模块的网络进行分类,引入新后处理方法,在动态目标分割和静态场景重建任务中取得最优性能。

Comments Accepted by IEEE International Conference on Robotics & Automation ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17070 2026-07-21 cs.AI 新提交

Bridging the Information Gap: Semantic Densification and Hindsight Distillation for Cold-Start Prediction

弥合信息差距:冷启动预测的语义致密化与事后蒸馏

Hao Duong Le, Yifei Gao, Huan Li, Lun Jiang, Chen Bai, Ke Xing, Chen Zhang

机构 * Tsinghua University(清华大学) Meituan(美团)

AI总结 针对电子商务平台新用户冷启动预测难题,SemRaD框架利用结构化语义推理管道和事后感知蒸馏网络,有效弥合信息差距,提升了LTV和CVR,减少训练数据用量,在工业数据集和在线测试中均取得良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26256 2026-07-21 cs.LG cs.DC 版本更新

DORA: A Scalable Asynchronous Reinforcement Learning System for Language Model Training

DORA:一种用于语言模型训练的可扩展异步强化学习系统

Tianhao Hu, Xiangcheng Liu, Yuchun Miao, Youshao Xiao, Hongyu Zang, Yang Zheng, Xuan Huang, Jinrui Ding, Yufei Zhang, Yu Yang, Yi-Kai Zhang, Yueqing Sun, Chengcheng Han, Xiandi Ma, Wei Wang, Qi Gu, Yerui Sun, Yuchen Xie, Xunliang Cai

机构 * Meituan, China(美团(中国))

AI总结 DORA通过算法-系统协同设计解决异步训练中长尾轨迹问题,提升训练效率并保持收敛性,实验表明其在开源基准和工业应用中均显著提升强化学习训练速度。

详情

展开后加载摘要…

URL PDF HTML 收藏