arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Meituan(美团)

共收录 351
2601.15876 2026-01-26 cs.AI

EvoCUA: Evolving Computer Use Agents via Learning from Scalable Synthetic Experience

EvoCUA:通过可扩展的合成经验学习来进化计算机使用代理

Taofeng Xue, Chong Peng, Mianqiu Huang, Linsen Guo, Tiancheng Han, Haozhe Wang, Jianing Wang, Xiaocheng Zhang, Xin Yang, Dengchang Zhao, Jinrui Ding, Xiandi Ma, Yuchen Xie, Peng Pei, Xunliang Cai, Xipeng Qiu

机构 * Meituan(美团) Fudan University(复旦大学) Tongji University(同济大学) The Hong Kong University of Science and Technology(香港理工大学)

AI总结 EvoCUA通过可扩展的合成经验学习进化计算机使用代理,实现更高性能和通用性。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08521 2026-01-23 cs.LG

Your Group-Relative Advantage Is Biased

你的组相对优势存在偏差

Fengkai Yang, Zherui Chen, Xiaohan Wang, Xiaodong Lu, Jiajun Chai, Guojun Yin, Wei Lin, Shuai Ma, Fuzhen Zhuang, Deqing Wang, Yaodong Yang, Jianxin Li, Yikun Ban

机构 * Beihang University(北航大学) University of California, Berkeley(加州大学伯克利分校) Peking University(北京大学) Meituan(美团)

AI总结 本文提出HA-DW方法,通过修正组相对优势估计的偏差,提升基于组的强化学习在数学推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10061 2026-01-21 cs.CV cs.AI

DiffusionAgent: Navigating Expert Models for Agentic Image Generation

DiffusionAgent: 专家模型导航用于代理图像生成

Jie Qin, Jie Wu, Weifeng Chen, Yueming Lyu

机构 * Meituan(美团) ByteDance(字节跳动) Nanjing University(南京大学)

AI总结 DiffusionAgent通过统一代理框架实现多领域图像生成,结合树状思维导航和优势数据库提升生成质量与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12901 2026-01-21 cs.RO

PlannerRFT: Reinforcing Diffusion Planners through Closed-Loop and Sample-Efficient Fine-Tuning

PlannerRFT: 通过闭环和样本高效微调强化扩散规划器

Hongchen Li, Tianyu Li, Jiazhi Yang, Haochen Tian, Caojun Wang, Lei Shi, Mingyang Shang, Zengrong Lin, Gaoqiang Wu, Zhihui Hao, Xianpeng Lang, Jia Hu, Hongyang Li

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) OpenDriveLab at The University of Hong Kong(香港大学OpenDrive实验室) Meituan(美团) Li Auto Inc.(李自动公司)

AI总结 PlannerRFT通过闭环和样本高效微调提升扩散规划器的多模态轨迹生成能力,实现高效探索与鲁棒性增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12661 2026-01-21 cs.AI

MedConsultBench: A Full-Cycle, Fine-Grained, Process-Aware Benchmark for Medical Consultation Agents

MedConsultBench: 一个完整周期、细粒度、过程感知的医疗咨询代理基准

Chuhan Qiao, Jianghua Huang, Daxing Zhao, Ziding Liu, Yanjun Shen, Bing Cheng, Wei Lin, Kai Wu

机构 * Meituan(美团)

AI总结 MedConsultBench通过细粒度过程感知评估医疗咨询代理的完整咨询周期,揭示高诊断准确性背后的效率与安全问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13861 2026-01-21 cs.CV

PositionIC: Unified Position and Identity Consistency for Image Customization

PositionIC: 统一的位置和身份一致性用于图像定制

Junjie Hu, Tianyang Han, Kai Ma, Jialin Gao, Song Yang, Xianhua He, Junfeng Luo, Xiaoming Wei, Wenqiang Zhang

机构 * MeiGen AI Team, Meituan(美团MeiGen AI团队) Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan University(上海智能信息处理关键实验室,计算机科学与人工智能学院,复旦大学) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(智能机器人与先进制造学院,复旦大学)

AI总结 PositionIC通过统一框架实现高保真、空间可控的多主体图像定制,引入BMPDS数据合成和可视化感知注意力机制,提升空间精度与身份一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10355 2026-01-16 cs.CL

Unlocking Implicit Experience: Synthesizing Tool-Use Trajectories from Text

解锁隐含经验:从文本合成工具使用轨迹

Zhihao Xu, Rumei Li, Jiahuan Li, Rongxiang Weng, Jingang Wang, Xunliang Cai, Xiting Wang

机构 * Renmin University of China(中国人民大学) Meituan(美团)

AI总结 本研究提出GEM方法,通过文本数据生成多轮工具使用轨迹,提升LLM在多轮交互中的工具使用能力,实验显示其在基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09382 2026-01-15 cs.AI cs.CL

Long-term Task-oriented Agent: Proactive Long-term Intent Maintenance in Dynamic Environments

长期任务导向代理:动态环境中主动的长期意图维护

Qinglong Shi, Donghai Wang, Hantao Zhou, Jiguo Li, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He

机构 * School of Management, University of Science and Technology of China(中国科学技术大学管理学院) Meituan(美团)

AI总结 本文提出一种主动任务导向代理,通过意图条件监控和事件触发跟进,提升动态环境中长期意图维护的能力,并通过ChronosBench验证了其有效性。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10337 2026-01-15 cs.AI cs.LG

A Curriculum Learning Approach to Reinforcement Learning: Leveraging RAG for Multimodal Question Answering

一种基于RAG的强化学习课程学习方法:用于多模态问答

Chenliang Zhang, Lin Wang, Yuanyuan Lu, Yusheng Qi, Kexin Wang, Peixu Hou, Wenshi Chen

机构 * Meituan(美团)

AI总结 本文提出了一种结合课程学习与强化学习的方法,用于多模态问答任务,通过检索增强生成系统在挑战中取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09260 2026-01-15 cs.AI

Efficient Paths and Dense Rewards: Probabilistic Flow Reasoning for Large Language Models

高效路径与密集奖励:用于大语言模型的概率流推理

Yan Liu, Feng Zhang, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Han Liu, Yangdong Deng

机构 * Meituan(美团) Tsinghua University(清华大学) Peking University(北京大学) Dalian University of Technology(大连理工大学)

AI总结 CoT-Flow通过概率流框架提升大语言模型的推理效率与性能,采用流引导解码和流强化学习方法实现信息高效推理路径和密集奖励函数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09215 2026-01-15 cs.CL

UserLM-R1: Modeling Human Reasoning in User Language Models with Multi-Reward Reinforcement Learning

UserLM-R1: 通过多奖励强化学习建模人类推理在用户语言模型中的应用

Feng Zhang, Shijia Li, Chunmao Zhang, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Jingwen Xu, Han Liu

机构 * Meituan(美团) Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Chinese Academy of Sciences(中国科学院大学) Dalian University of Technology(大连理工大学)

AI总结 UserLM-R1通过多奖励强化学习和动态目标驱动策略,提升用户语言模型在跨领域和对抗性场景中的推理与策略能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08834 2026-01-15 cs.CV cs.AI cs.CL

Reading or Reasoning? Format Decoupled Reinforcement Learning for Document OCR

阅读还是推理?面向文档OCR的格式解耦强化学习

Yufeng Zhong, Lei Chen, Zhixiong Zeng, Xuanle Zhao, Deyang Jiang, Liming Zheng, Jing Huang, Haibo Qiu, Peng Shi, Siqi Yang, Lin Ma

机构 * Meituan(美团)

AI总结 本文提出格式解耦强化学习方法,通过高熵模式优化提升文档OCR性能,在OmniDocBench上取得新记录。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08942 2026-01-15 cs.CL

SOP-Maze: Evaluating Large Language Models on Complicated Business Standard Operating Procedures

SOP-Maze:在复杂业务标准操作规程上评估大语言模型

Jiaming Wang, Zhe Tang, Zehao Jin, Hefei Chen, Yilin Jin, Peng Ding, Xiaoyu Li, Xuezhi Cao

机构 * Meituan M17(美团M17) Georgia Institute of Technology(佐治亚理工学院) Nanjing University(南京大学)

AI总结 SOP-Maze通过评估大语言模型在复杂业务标准操作规程中的表现,揭示了模型在遵循规程、对话处理和计算推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08435 2026-01-14 cs.CL

Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management

细粒度反馈对齐的长期记忆管理:Fine-Mem

Weitao Ma, Xiaocheng Feng, Lei Huang, Xiachong Feng, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Meituan(美团) Peng Cheng Laboratory(鹏城实验室) The University of Hong Kong(香港大学)

AI总结 Fine-Mem通过细粒度反馈对齐提升长周期内存管理,通过块级奖励和证据锚定奖励分配优化策略,实现更高效的内存操作与长期效用对齐。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20313 2026-01-13 cs.CV

FlexVAR: Flexible Visual Autoregressive Modeling without Residual Prediction

FlexVAR: 无需残差预测的灵活视觉自回归建模

Siyu Jiao, Gengwei Zhang, Yinlong Qian, Jiancheng Huang, Yao Zhao, Humphrey Shi, Lin Ma, Yunchao Wei, Zequn Jie

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学学院) University of Technology Sydney(悉尼科技大学) Meituan(美团) Georgia Institute of Technology(佐治亚理工学院)

AI总结 FlexVAR通过无需残差预测的灵活视觉自回归建模,在低分辨率图像上实现高分辨率图像生成和多种图像任务处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19142 2026-01-13 cs.CV

CLIP-GS: Unifying Vision-Language Representation with 3D Gaussian Splatting

CLIP-GS: 通过3D高斯点划法统一视觉-语言表示

Siyu Jiao, Haoye Dong, Yuyang Yin, Zequn Jie, Yinlong Qian, Yao Zhao, Humphrey Shi, Yunchao Wei

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学学院) National University of Singapore(新加坡国立大学) Meituan(美团) Georgia Institute of Technology(佐治亚理工学院) Picsart AI Research (PAIR)(Picsart AI研究(PAIR))

AI总结 CLIP-GS通过3D高斯点划法统一视觉-语言表示,利用对比损失和图像投票损失提升多模态检索和分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06240 2026-01-12 cs.CL

Bridging External and Parametric Knowledge: Mitigating Hallucination of LLMs with Shared-Private Semantic Synergy in Dual-Stream Knowledge

弥合外部与参数化知识:通过共享-私有语义协同缓解LLM的幻觉

Yi Sui, Chaozhuo Li, Chen Zhang, Dawei song, Qiuchi Li

机构 * Beijing Institute of Technology, China(北京理工大学) Beijing University of Posts and Telecommunications, China(北京邮电大学) Meituan, China(美团) The Open University, UK(开放大学)

AI总结 本文提出DSSP-RAG框架,通过共享-私有语义协同机制,缓解LLM在整合外部知识时的幻觉问题,并提升生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04897 2026-01-09 cs.CL cs.CV cs.LG cs.MM

V-FAT: Benchmarking Visual Fidelity Against Text-bias

V-FAT:基于文本偏见的视觉真实性基准测试

Ziteng Wang, Yujie He, Guanliang Li, Siqi Yang, Jiaqi Xiong, Songxiang Liu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Meituan(美团) University of Oxford(牛津大学)

AI总结 V-FAT通过三级评估框架量化文本偏见对视觉真实性的干扰,揭示多模态大语言模型在高语言主导性下的视觉崩溃问题。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04706 2026-01-09 cs.CV

Forge-and-Quench: Enhancing Image Generation for Higher Fidelity in Unified Multimodal Models

锻造与淬火:提升统一多模态模型中图像生成的高保真度

Yanbing Zeng, Jia Wang, Hanghang Ma, Junqiang Wu, Jie Zhu, Xiaoming Wei, Jie Hu

机构 * Meituan(美团)

AI总结 本文提出Forge-and-Quench框架,通过利用理解模型增强生成图像的保真度和细节,提升多模态模型的生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04035 2026-01-08 cs.AI

MobileDreamer: Generative Sketch World Model for GUI Agent

MobileDreamer: 用于GUI代理的生成式草图世界模型

Yilin Cao, Yufeng Zhong, Zhixiong Zeng, Liming Zheng, Jing Huang, Haibo Qiu, Peng Shi, Wenji Mao, Wan Guanglu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Meituan(美团)

AI总结 MobileDreamer通过生成式草图世界模型和rollout想象策略,提升GUI代理在长周期任务中的决策能力,任务成功率提升5.25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07332 2026-01-08 cs.MA cs.RO

The Combined Problem of Online Task Assignment and Lifelong Path Finding in Logistics Warehouses: Rule-Based Systems Matter

物流仓库中在线任务分配与终身路径寻找的联合问题:基于规则的系统至关重要

Fengming Zhu, Weijia Xu, Yifei Guo, Fangzhen Lin

机构 * Hong Kong University of Science and Technology(香港科技大学) Meituan Academy of Robotics Shenzhen(美团机器人研究院(深圳))

AI总结 本文提出了一种基于规则的系统,用于解决物流仓库中的在线任务分配与终身路径寻找问题,通过提高效率和经济性,展示了其在实际应用中的优势。

Comments In Proceedings ICLP 2025, arXiv:2601.00047

Journal ref EPTCS 439, 2026, pp. 167-187

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03261 2026-01-08 cs.CL cs.AI

DeepResearch-Slice: Bridging the Retrieval-Utilization Gap via Explicit Text Slicing

DeepResearch-Slice: 通过显式文本切片弥合检索-利用差距

Shuo Lu, Yinuo Xu, Jianjie Cheng, Lingxiao He, Meng Wang, Jian Liang

机构 * NLPR & MAIS CASIA(CASIA NLPR与MAIS) School of AI UCAS(UCAS人工智能学院) Meituan Inc.(美团公司)

AI总结 DeepResearch-Slice通过显式文本切片技术,有效解决检索与利用之间的差距问题,提升模型在嘈杂环境中的鲁棒性。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11184 2026-01-08 cs.LG cs.CL

Reinforcement Learning for Tool-Integrated Interleaved Thinking towards Cross-Domain Generalization

强化学习用于工具集成的交叉领域泛化思考

Zhengyu Chen, Jinluan Yang, Teng Xiao, Ruochen Zhou, Luan Zhang, Xiangyu Xi, Xiaowei Shi, Wei Wang, Jinggang Wang

机构 * Meituan(美团) Zhejiang University(浙江大学) Allen Institute for Artificial Intelligence(人工智能算法研究所) City University of Hong Kong(香港城市大学)

AI总结 本文提出RITE方法,通过强化学习和交叉领域工具执行,提升LLM在跨领域推理中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05281 2026-01-08 cs.SE cs.CL

CoreCodeBench: Decoupling Code Intelligence via Fine-Grained Repository-Level Tasks

CoreCodeBench:通过细粒度仓库级任务解耦代码智能

Lingyue Fu, Hao Guan, Bolun Zhang, Haowei Yuan, Yaoming Zhu, Jun Xu, Zongyu Wang, Lin Qiu, Xunliang Cai, Xuezhi Cao, Weiwen Liu, Weinan Zhang, Yong Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Meituan(美团)

AI总结 CoreCodeBench通过细粒度仓库级任务解耦编码能力,揭示LLM在编程任务中的非单一性,提供更精确的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23966 2026-01-07 cs.CL cs.AI

Efficient Context Scaling with LongCat ZigZag Attention

高效上下文扩展与LongCat ZigZag注意力

Chen Zhang, Yang Bai, Jiahuan Li, Anchun Gui, Keheng Wang, Feifan Liu, Guanyu Wu, Yuwei Jiang, Defei Bu, Li Wei, Haihang Jing, Hongyin Tang, Xin Chen, Xiangzhou Huang, Fengcun Li, Rongxiang Weng, Yulei Qian, Yifan Lu, Yerui Sun, Jingang Wang, Yuchen Xie, Xunliang Cai

机构 * Meituan, China(美团,中国)

AI总结 LongCat ZigZag Attention通过稀疏化全注意力模型,提升长上下文处理效率,实现高效长期推理和代理能力。

Comments 10 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22455 2026-01-06 cs.LG cs.CL

AFA-LoRA: Enabling Non-Linear Adaptations in LoRA with Activation Function Annealing

AFA-LoRA:通过激活函数退火在LoRA中实现非线性适应

Jiacheng Li, Jianchao Tan, Zhidong Yang, Feiye Huo, Yerui Sun, Yuchen Xie, Xunliang Cai

机构 * Meituan, Beijing, China(美团,北京,中国) Hong Kong University of Science and Technology(香港科技大学)

AI总结 AFA-LoRA通过退火激活函数在LoRA中引入非线性表达能力,提升参数高效适应的性能和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18281 2026-01-06 cs.CV

MotionCharacter: Fine-Grained Motion Controllable Human Video Generation

MotionCharacter: 高精度可调控的人体视频生成

Haopeng Fang, Di Qiu, Binjie Mao, He Tang

机构 * Meituan(美团)

AI总结 MotionCharacter通过解耦动作类型与运动强度,实现高保真人体视频生成,提升细粒度运动控制与身份一致性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23512 2026-01-01 cs.CL cs.AI

UniHetero: Could Generation Enhance Understanding for Vision-Language-Model at Large Data Scale?

UniHetero:生成能否在大规模数据下增强视觉-语言模型的理解?

Fengjiao Chen, Minhao Jing, Weitao Lu, Yan Feng, Xiaoyu Li, Xuezhi Cao

机构 * Meituan, Beijing, China(美团,北京,中国)

AI总结 UniHetero通过大规模预训练探索生成对视觉-语言模型理解的增强作用,发现语义层面生成有效,而像素层面生成会导致理解性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14404 2025-12-30 cs.CV

ViC-Bench: Benchmarking Visual-Interleaved Chain-of-Thought Capability in MLLMs with Free-Style Intermediate State Representations

ViC-Bench: 用自由式中间状态表示法对多模态大语言模型的视觉交错链式思维能力进行基准测试

Xuecheng Wu, Jiaxing Liu, Danlei Huang, Yifan Wang, Yunyun Shi, Kedi Chen, Junxiao Xue, Yang Liu, Chunlin Chen, Hairong Dong, Dingkang Yang

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Meituan Inc.(美团公司) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) Research Center for Space Computing System, Zhejiang Lab(浙江实验室空间计算系统研究中心) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) School of Robotics and Automation, Nanjing University(南京大学机器人与自动化学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)

AI总结 ViC-Bench 通过自由式中间状态表示法,系统评估多模态大语言模型的视觉交错链式思维能力,涵盖四个任务并提出新评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20615 2025-12-24 cs.CV

Active Intelligence in Video Avatars via Closed-loop World Modeling

通过闭环世界建模实现视频虚拟角色的主动智能

Xuanhua He, Tianyu Yang, Ke Cao, Ruiqi Wu, Cheng Meng, Yong Zhang, Zhuoliang Kang, Xiaoming Wei, Qifeng Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Meituan(美团) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出ORCA框架,通过闭环世界建模和双系统架构,实现视频虚拟角色的主动智能与目标导向行为。

Comments Project Page: https://xuanhuahe.github.io/ORCA/

详情

展开后加载摘要…

URL PDF HTML 收藏