AuRA: Internalizing Audio Understanding into LLMs as LoRA
AuRA: 将音频理解内化到LLM中作为LoRA
机构 * Meituan(美团) ; Jilin University(吉林大学)
AI总结 提出AuRA方法,通过层间蒸馏将ASR编码器的语音表示内化到LoRA适配的LLM中,实现紧耦合的语音-语言联合建模和高效并行端到端推理,在多个基准上优于级联系统和现有适应方法。
大厂专区
AuRA: 将音频理解内化到LLM中作为LoRA
机构 * Meituan(美团) ; Jilin University(吉林大学)
AI总结 提出AuRA方法,通过层间蒸馏将ASR编码器的语音表示内化到LoRA适配的LLM中,实现紧耦合的语音-语言联合建模和高效并行端到端推理,在多个基准上优于级联系统和现有适应方法。
HIPIF: 面向长视界LLM智能体学习的层次化规划与信息折叠
机构 * Meituan(美团) ; University of Chinese Academy of Sciences(中国科学院大学)
AI总结 提出层次化规划与信息折叠方法,通过子目标分解和历史折叠减少长上下文干扰,结合层次化反思和子目标过程奖励,提升LLM在多轮长视界任务中的表现。
STAGE-Claw:面向真实场景的基于状态的智能体自动化基准测试
机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) ; School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学前沿交叉科学学院) ; Chinese Academy of Sciences(中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Zhongguancun Academy(中关村学院) ; Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) ; Meituan(美团)
AI总结 提出STAGE-Claw框架,自动构建基于状态的个人计算环境中的真实场景任务,通过最终系统状态而非文本响应评估智能体性能,创建40个挑战性任务并分析11个前沿模型。
HMAF:一种分层多槽GD-RTB分配框架
机构 * Meituan(美团) ; Nanyang Technological University(南洋理工大学) ; China Agricultural University(中国农业大学)
AI总结 针对GD与RTB共存广告平台中短期收益与长期交付的平衡难题,提出分层多槽分配框架HMAF,采用计划-校准-执行范式,集成离线约束优化与在线决策,在美团实现GD交付率提升3.72%、广告总收入提升1.59%。
Comments Accepted by KDD 2026 Applied Data Science Track
面向长时域船舶轨迹与目的地预测的推理型大语言模型
机构 * Institute of High Performance Computing (IHPC), A*STAR, Singapore(新加坡科技研究局高性能计算研究所) ; The Key Laboratory of Road and Traffic Engineering, Ministry of Education, Tongji University(同济大学道路与交通工程教育部重点实验室) ; Meituan Inc., Shenzhen, China(美团(深圳)) ; Centre for Frontier AI Research (CFAR), A*STAR, Singapore(新加坡科技研究局前沿人工智能研究中心) ; Nankai University(南开大学) ; School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)
AI总结 提出基于可验证奖励强化学习(RLVR)的Maritime LLM后训练框架,将轨迹转化为语义文本,通过物理有效性约束和层次匹配提升长时域(30天)预测精度,4B模型表现最优。
Comments The IEEE International Conference on Intelligent Transportation Systems (ITSC) 2026, Naples, Italy
像飞行员一样思考:细粒度长时程无人机导航
机构 * Colab ; Beihang University(北航) ; Meituan(美团) ; National University of Singapore(新加坡国立大学)
AI总结 提出FLIGHT基准和FLIGHT VLA异步架构,通过低频飞行员推理VLM与高频扩散动作模型解耦,实现无人机长时程语义指令下的平滑连续飞行控制。
Transformer中的注意力汇聚:利用、解释与缓解综述
机构 * Tsinghua University(清华大学) ; Meituan LongCat Team(美团LongCat团队) ; The University of Hong Kong(香港大学) ; University of Michigan(密歇根大学) ; Xiamen University(厦门大学) ; The Ohio State University(俄亥俄州立大学) ; Columbia University(哥伦比亚大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; The Hong Kong Polytechnic University(香港理工大学)
AI总结 本文首次系统综述Transformer中的注意力汇聚现象,从基础利用、机制解释和策略缓解三个维度梳理研究现状,为未来研究提供指导。
PolarQuant: 利用极坐标变换实现高效键缓存量化和解码加速
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) ; ShanghaiTech University(上海科技大学) ; Meituan(美团)
AI总结 提出PolarQuant方法,通过将键向量分组为二维子向量并编码为量化半径和极角,解决键缓存量化中的异常值问题,同时通过查表加速解码,保持全精度模型性能。
Comments NeurIPS 2025 version with minor revisions to the methodology
TAPO: 通过信用转移实现工具感知策略优化用于多模态搜索代理
机构 * University of Science and Technology of China(中国科学技术大学) ; Meituan(美团)
AI总结 针对GRPO在多模态搜索代理中信用误分配问题,提出TAPO方法,利用工具参数确定性构建反事实证人进行保守优势校正,无需额外标注或采样,在多个基准上持续提升性能。
LLM持续预训练中最优超参数的可预测缩放定律
机构 * MeiTuan(美团) ; University of Chinese Academy of Sciences(中国科学院大学) ; Harbin Institute of Technology(哈尔滨工业大学)
AI总结 本文发现持续预训练中学习率和批大小等最优超参数遵循稳定可预测的缩放定律,并提出一个两阶段框架,通过小规模代理模型和状态感知预测,将超参数搜索开销降低90%且性能相当或更优。
CausalPOI:基于时空图因果建模的冷启动POI签到预测
机构 * Nanyang Technological University(南洋理工大学) ; China Agricultural University(中国农业大学) ; Meituan(美团)
AI总结 提出CausalPOI框架,利用时空功能交互图建模POI间语义和空间关系,通过结构对齐的处理和对照图模拟事实与反事实场景,解决冷启动POI签到预测问题,在真实数据集上显著优于基线。
Comments Accepted at KDD 2026
先过滤,再重加权:重新思考在线策略蒸馏中的优化粒度
机构 * THU(清华大学) ; HKUST(香港科技大学) ; BIT(北京理工大学) ; Meituan(美团) ; ZJU(浙江大学)
AI总结 针对在线策略蒸馏,提出FiRe-OPD方法,通过轨迹级过滤和令牌级软重加权实现细粒度优化,在多种设置下优于现有方法。
SpanNorm: 在深度Transformer中协调训练稳定性与性能
机构 * Meituan Inc.(美团公司) ; NLP Lab, School of Computer Science and Engineering(自然语言处理实验室,计算机科学与工程学院) ; Northeastern University, Shenyang, China(东北大学,沈阳,中国)
AI总结 本文提出SpanNorm技术,通过结合前归一化和后归一化的优势,解决深度Transformer中训练稳定性与性能之间的根本性权衡问题,理论分析和实验结果表明其在密集和专家混合(MoE)场景中均优于传统归一化方案。
Comments Accepted by ICML2026
重新思考持续经验内化以实现自我进化的大语言模型智能体
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 学院) ; School of Software, Beihang University(北航软件学院) ; Meituan(美团)
AI总结 本文通过经验粒度、注入模式和内化机制三个维度,提出一种稳定可持续的经验内化方法,解决多轮经验学习中的能力崩溃问题。
Comments 10 pages, 8 figures
解锁任务导向型对话中的主动性
机构 * Keeta AI, Meituan(Keeta AI,美团) ; Independent Researcher(独立研究者) ; CUHK(香港中文大学) ; HKUST(香港科技大学)
AI总结 针对任务导向型对话中主动性问题,提出认知用户模拟器和模拟器诱导的非对称视角策略优化,通过建模用户潜在关注实现主动对话。
AdaGrad的统一分析:带加权聚合和动量加速
机构 * JD Explore Academy, Beijing, China(京东探索研究院,北京,中国) ; Facebook, USA(Facebook,美国) ; Meituan, Beijing, China(美团,北京,中国) ; University of Minnesota, Twin Cities, USA(明尼苏达大学双城分校,美国) ; Tencent, Shenzhen, China(腾讯,深圳,中国)
AI总结 本文提出了一种名为AdaUSM的加权AdaGrad算法,通过统一动量方案和新型加权自适应学习率,实现了在非凸随机设置下的O(√(log(T)/T))收敛率,并从新视角解释了Adam和RMSProp的自适应学习率。
Comments IEEE TNNLS
SAGE: 智能体生态中社会化演化的定量评估
机构 * Tsinghua University, China(清华大学, 中国) ; Meituan, China(美团, 中国)
AI总结 提出SAGE框架,通过对比社会演化(SocialEvo)与自我演化(SelfEvo)两种计算条件,在三个领域评估共享经验对智能体性能的影响,发现群体历史并非普遍放大器,但能帮助陷入停滞的智能体取得突破,且社会收益依赖于抽象能力而非暴露量。
Comments 13 pages, 5 figures
CodeHacker: 用于检测竞赛编程解决方案漏洞的自动化测试用例生成
机构 * Shanghai University of Finance and Economics(上海金融学院) ; Northwestern Polytechnical University(西北工业大学) ; Meituan(美团) ; University of Toronto(多伦多大学)
AI总结 提出CodeHacker框架,通过多策略对抗测试用例生成(压力测试、反哈希攻击、逻辑特定攻击)和校准阶段,有效暴露程序漏洞,提升测试集真负率并增强RL训练模型性能。
SIRI:具有内在技能的自我内化强化学习用于LLM智能体训练
机构 * Xiamen University(厦门大学) ; Meituan(美团) ; Macao Polytechnic University(澳门 polytechnic 大学)
AI总结 提出SIRI框架,通过自我技能挖掘、验证和内化,使LLM智能体无需外部技能生成器或推理时技能库即可提升长程任务性能,在ALFWorld和WebShop上优于基线方法。
UME:跨域ETA的统一元泛化框架
机构 * Peking University(北京大学) ; Meituan(美团)
AI总结 针对即时物流中跨域ETA预测的零样本泛化、特征缺失和知识迁移问题,提出基于超网络元学习的统一双分支架构UME,通过元模块动态调制特征门控、专家注意力和最终预测,并在美团Keeta平台部署验证。
DriveAnchor: 用于自动驾驶规划的渐进式基于锚点的流学习
机构 * Meituan Autonomous Driving(美团自动驾驶) ; Xi’an Jiaotong University(西安交通大学) ; Beijing Institute of Technology(北京理工大学)
AI总结 提出三阶段框架DriveAnchor,通过示范流预训练、引导流后训练和奖励精炼流微调,实现行为多样性、可控性和安全性,在200万场景中近距碰撞率降低89%,平均奖励提升32%。
技能还是跳过?通过双粒度偏好学习在智能体任务中学习选择性技能调用
机构 * Meituan(美团) ; Fudan University(复旦大学) ; Shanghai Jiao Tong University(上海交通大学) ; Nanjing University(南京大学) ; Peking University(北京大学)
AI总结 提出SelSkill框架,通过双粒度偏好学习实现选择性技能调用,在ALFWorld和BFCL上显著提升任务成功率和执行精度。
Comments 18 pages, 4 figures, 10 tables
在线策略蒸馏是否必须完整展开?
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) ; Meituan(美团) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
AI总结 本文针对在线策略蒸馏(OPD)中完整展开计算成本高且早期训练时教师反馈不可靠的问题,提出渐进式OPD(POPD)和截断式OPD(TOPD)两种展开长度控制策略,在数学推理任务上实现高达3倍训练效率提升,并显著减少内存占用。
Comments 15 pages, 14 figures
SCOPE: 信号校准的在线策略蒸馏增强与双路径自适应加权
机构 * University of Science and Technology of China(中国科学技术大学) ; Meituan LongCat Interaction Team(美团 LongCat 交互团队) ; Nanjing University(南京大学) ; Fudan University(复旦大学) ; Huazhong University of Science and Technology(华中科技大学)
AI总结 针对在线策略强化学习中奖励稀疏导致的信用分配难题,提出SCOPE框架,通过双路径自适应加权机制分别处理正确与错误轨迹,实现信号校准的蒸馏增强,在六个推理基准上平均提升11.42%的Avg@32和7.30%的Pass@32。
LocalSearchBench:现实本地生活服务中的智能搜索基准测试
机构 * Meituan, Beijing, China(美团,北京,中国) ; East China Normal University Shanghai Innovation Institute(东华大学上海创新研究院) ; University of Science and Technology of China(中国科学技术大学) ; Shanghai Jiaotong University(上海交通大学) ; North China University of Technology, Beijing, China(华北理工大学,北京,中国) ; East China Normal University Shanghai China(东华大学上海)
AI总结 针对本地生活服务领域,提出包含130万商家条目和900个多跳问答任务的基准测试LocalSearchBench,并开发统一环境LocalPlayground,实验表明现有大推理模型性能不足。
Comments 12 pages; accepted to KDD 2026
Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD 2026), August 9--13, 2026, Jeju Island, Republic of Korea. ACM, New York, NY, USA, 12 pages
LocalSUG:面向本地生活服务的城市偏好增强大语言模型查询建议
机构 * Meituan(美团)
AI总结 提出LocalSUG框架,通过挖掘城市偏好候选词注入提示、束搜索GRPO算法和加速解码,解决大语言模型在本地生活服务查询建议中城市偏好不足、偏好暴露偏差和延迟约束问题。
跨模态注意力校准用于LVLM幻觉缓解
机构 * Sun Yat-sen University(中山大学) ; The University of Hong Kong(香港大学) ; Meituan(美团) ; Inspur Database Technology(Inspur数据库技术) ; Guilin University of Electronic Technology(桂林电子科技大学) ; Shenzhen Loop Area Institute(深圳河套学院) ; Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室)
AI总结 提出一种无需训练的跨模态注意力校准方法,通过设计模态间解码和位置校准模块,缓解大型视觉语言模型中的幻觉问题。
Comments CVPR2026
个性化轮级用户对话满意度基准
机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China.(清华大学计算机科学与技术系,北京,中国) ; Institute for AI Industry Research, Tsinghua University, Beijing, China.(清华大学人工智能产业研究院,北京,中国) ; Meituan(美团)
AI总结 针对AI助手响应的个性化满意度评估问题,提出结合用户记忆与目标轮上下文的满意度评估器,并构建PersTurnBench基准,通过回放实现生成模型的受控比较。
教师引导的策略优化:大策略差异下的在线推理蒸馏
机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) ; Tsinghua University(清华大学) ; Meituan(美团) ; Meta AI ; NiuTrans Research, Shenyang, China(新译研究院,沈阳,中国)
AI总结 针对在线蒸馏中教师与学生策略差异大时反向KL监督失效的问题,提出教师引导策略优化(TGPO),通过教师直接指导学生上下文的token级生成并结合RLVR奖励,在推理基准上优于现有方法。
MemoSight: 统一上下文压缩与多令牌预测以加速推理
机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) ; Meituan Inc.(美团公司) ; NiuTrans Research, Shenyang, China(牛译研所)
AI总结 提出 MemoSight 框架,通过特殊令牌和位置布局统一上下文压缩与多令牌预测,在保持思维链推理性能的同时减少 KV 缓存使用并提升推理速度。