arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Meituan(美团)

共收录 351
2508.20615 2025-12-24 cs.CV

EmoCAST: Emotional Talking Portrait via Emotive Text Description

EmoCAST:通过情感文本描述生成情感对话头

Yiguo Jiang, Xiaodong Cun, Yong Zhang, Yudian Zheng, Fan Tang, Chi-Man Pun

机构 * University of Macau(澳门大学) GVC Lab, Great Bay University(大湾大学GVC实验室) Meituan(美团) ICT-CAS Project(ICT-CAS项目)

AI总结 EmoCAST通过情感文本描述生成逼真且音频同步的情感对话头视频,结合文本引导和音频对齐模块提升表达质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17227 2025-12-22 cs.CV

Learning When to Look: A Disentangled Curriculum for Strategic Perception in Multimodal Reasoning

学习何时观察:一种解耦的课程学习框架,用于多模态推理中的战略感知

Siqi Yang, Zilve Gao, Haibo Qiu, Fanfan Liu, Peng Shi, Zhixiong Zeng, Qingmin Liao, Lin Ma

机构 * Meituan(美团) Tsinghua University(清华大学)

AI总结 本文提出了一种解耦课程学习框架,通过分阶段训练提升多模态推理中的抽象推理与战略视觉感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16149 2025-12-19 cs.AI

ToolForge: A Data Synthesis Pipeline for Multi-Hop Search without Real-World APIs

ToolForge: 一种无需真实世界API的多跳搜索数据合成管道

Hao Chen, Zhexin Hu, Jiajun Chai, Haocheng Yang, Hang He, Xiaohan Wang, Wei Lin, Luhang Wang, Guojun Yin, Zhuofeng zhao

机构 * North China University of Technology(华北理工大学) Meituan(美团) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) National University of Singapore(新加坡国立大学) East China Normal University(华东师范大学)

AI总结 ToolForge通过构建虚拟工具生成多跳搜索数据,无需真实API调用,提升模型在多跳推理任务中的性能。

Comments 13 pages, 9 tables, 6 figures. Code available at https://github.com/Buycar-arb/ToolForge

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23049 2025-12-18 cs.LG cs.CL

DenoiseRotator: Enhance Pruning Robustness for LLMs via Importance Concentration

DenoiseRotator: 通过重要性集中增强大语言模型的剪枝鲁棒性

Tianteng Gu, Bei Liu, Bo Xiao, Ke Zeng, Jiacheng Liu, Yanmin Qian

机构 * Shanghai Jiao Tong University(上海交通大学) HKUST(香港科技大学) Meituan(美团)

AI总结 DenoiseRotator通过重要性集中提升大语言模型剪枝鲁棒性,采用可学习正交变换优化参数重要性分布,有效减少稀疏性约束下的性能下降。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13752 2025-12-17 cs.CV cs.AI

STAR: STacked AutoRegressive Scheme for Unified Multimodal Learning

STAR:用于统一多模态学习的堆叠自回归方案

Jie Qin, Jiancheng Huang, Limeng Qiao, Lin Ma

机构 * Meituan Inc(美团公司)

AI总结 STAR通过堆叠自回归方案提升多模态生成性能,同时保持理解能力,实验验证其在统一多模态学习中的有效性。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12690 2025-12-16 cs.LG cs.CL cs.CV

Reassessing the Role of Supervised Fine-Tuning: An Empirical Study in VLM Reasoning

重新评估监督微调的作用:VLM推理中的实证研究

Yongcan Yu, Lingxiao He, Shuo Lu, Lijun Sheng, Yinuo Xu, Yanbo Wang, Kuangpu Guo, Jianjie Cheng, Meng Wang, Qianlong Xie, Xingxing Wang, Dapeng Hu, Jian Liang

机构 * NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(人工智能研究院 & 模式识别与人工智能研究所,中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Meituan(美团)

AI总结 本研究通过实证分析发现,监督微调在VLM推理中具有重要作用,挑战了强化学习优于监督微调的主流观点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13080 2025-12-16 cs.CV

Counting Hallucinations in Diffusion Models

扩散模型中hallucination的计数

Shuai Fu, Jian Zhou, Qi Chen, Huang Jing, Huy Anh Nguyen, Xiaohan Liu, Zhixiong Zeng, Lin Ma, Quanshi Zhang, Qi Wu

机构 * University of Adelaide(阿德莱德大学) Meituan(美团) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出了一种针对扩散模型中计数hallucination的评估方法,通过构建CountHalluSet数据集,系统分析不同采样条件对hallucination的影响,并揭示FID等指标无法捕捉计数hallucination的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18271 2025-12-12 cs.CV cs.AI

Beyond Words and Pixels: A Benchmark for Implicit World Knowledge Reasoning in Generative Models

超越文字和像素:生成模型中隐式世界知识推理的基准测试

Tianyang Han, Junhao Su, Junjie Hu, Peizhen Yang, Hengyu Shi, Junfeng Luo, Jialin Gao

机构 * MeiGen AI Team, Meituan(美团梅基因AI团队) Fudan University(复旦大学) D^{4} Lab(D⁴实验室) HHMI Janelia Research Campus(HHMI贾能实验室)

AI总结 本文提出PicWorld基准测试,用于评估生成模型在隐式世界知识和物理因果推理方面的能力,揭示了现有T2I模型在这些方面的局限性,并提出了证据基础的多代理评估器进行细粒度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08294 2025-12-11 cs.CV

OpenSubject: Leveraging Video-Derived Identity and Diversity Priors for Subject-driven Image Generation and Manipulation

OpenSubject: 利用视频衍生的身份和多样性先验进行主体驱动的图像生成与操纵

Yexin Liu, Manyuan Zhang, Yueze Wang, Hongyu Li, Dian Zheng, Weiming Zhang, Changsheng Lu, Xunliang Cai, Yan Feng, Peng Pei, Harry Yang

机构 * HKUST(香港科技大学) Meituan(美团) HKUST(GZ)(香港科技大学(广州))

AI总结 OpenSubject通过视频衍生的大规模数据集提升主体驱动图像生成与操纵的性能,尤其在复杂场景中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07584 2025-12-09 cs.CV

LongCat-Image Technical Report

LongCat-Image 技术报告

Meituan LongCat Team, Hanghang Ma, Haoxian Tan, Jiale Huang, Junqiang Wu, Jun-Yan He, Lishuai Gao, Songlin Xiao, Xiaoming Wei, Xiaoqi Ma, Xunliang Cai, Yayong Guan, Jie Hu

机构 * Meituan LongCat Team(美团LongCat团队)

AI总结 LongCat-Image通过双语开源模型提升多语言图像生成与编辑能力,实现高效部署与高质量输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06674 2025-12-09 cs.CV

RunawayEvil: Jailbreaking the Image-to-Video Generative Models

RunawayEvil: 对图像到视频生成模型的劫持

Songping Wang, Rufan Qian, Yueming Lyu, Qinglong Liu, Linzhuang Zou, Jie Qin, Songhua Liu, Caifeng Shan

机构 * PRLab, Nanjing University(南京大学PRLab) Meituan(美团) Shanghai Jiao Tong University(上海交通大学)

AI总结 RunawayEvil是一种针对图像到视频生成模型的多模态劫持框架,通过自我进化机制实现动态攻击策略,显著提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05965 2025-12-08 cs.CV

EditThinker: Unlocking Iterative Reasoning for Any Image Editor

EditThinker: 解锁任何图像编辑器的迭代推理

Hongyu Li, Manyuan Zhang, Dian Zheng, Ziyu Guo, Yimeng Jia, Kaituo Feng, Hao Yu, Yexin Liu, Yan Feng, Peng Pei, Xunliang Cai, Linjiang Huang, Hongsheng Li, Si Liu

机构 * Beihang University(北航大学) Meituan(美团) CUHK MMLab CUHK IMIXR Tsinghua University(清华大学)

AI总结 EditThinker通过迭代推理框架提升图像编辑指令遵循能力,利用强化学习优化编辑过程,显著提高模型性能。

Comments Project page: https://appletea233.github.io/think-while-edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03783 2025-12-05 cs.AI cs.SD

Omni-AutoThink: Adaptive Multimodal Reasoning via Reinforcement Learning

Omni-AutoThink: 通过强化学习实现自适应多模态推理

Dongchao Yang, Songxiang Liu, Disong Wang, Yuanyuan Wang, Guanglu Wan, Helen Meng

机构 * The Chinese University of Hong Kong(香港中文大学) Meituan(美团)

AI总结 Omni-AutoThink通过强化学习实现自适应多模态推理,提升模型在不同任务难度下的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03918 2025-12-04 cs.CV

UniMo: Unifying 2D Video and 3D Human Motion with an Autoregressive Framework

UniMo:基于自回归框架统一2D视频与3D人体运动

Youxin Pang, Yong Zhang, Ruizhi Shao, Xiang Deng, Feng Gao, Xu Xiaoming, Xiaoming Wei, Yebin Liu

机构 * Tsinghua University(清华大学) Meituan(美团)

AI总结 UniMo通过自回归框架统一2D视频与3D人体运动,实现同时生成与理解,提升多模态联合建模能力。

Comments https://carlyx.github.io/UniMo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03737 2025-12-04 cs.CL cs.IR

AR-Med: Automated Relevance Enhancement in Medical Search via LLM-Driven Information Augmentation

AR-Med: 通过LLM驱动的信息增强实现医疗搜索的自动化相关性增强

Chuyue Wang, Jie Feng, Yuxi Wu, Hang Zhang, Zhiguo Fan, Bing Cheng, Wei Lin

机构 * Meituan Inc.(美团公司) Tsinghua University(清华大学) Independent Researcher(独立研究者)

AI总结 AR-Med通过LLM驱动的信息增强,实现医疗搜索的自动化相关性提升,提高了准确性和用户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03494 2025-12-04 cs.CL cs.LG

A Preliminary Study on the Promises and Challenges of Native Top-$k$ Sparse Attention

关于原生Top-k稀疏注意力的潜力与挑战的初步研究

Di Xiu, Hongyin Tang, Bolin Rong, Lizhi Yan, Jingang Wang, Yifan Lu, Xunliang Cai

机构 * Meituan, Beijing, China(美团,北京,中国)

AI总结 本研究探讨了原生Top-k稀疏注意力机制在解码和训练中的有效性,通过实验验证其在提升模型性能方面的潜力,并从熵的角度解释了其在下游任务中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02812 2025-12-03 cs.AI

Enhancing Automated Paper Reproduction via Prompt-Free Collaborative Agents

通过无提示协作代理增强自动论文复现

Zijie Lin, Qilin Cai, Liang Shen, Mingjun Xiao

机构 * University of Science and Technology of China(中国科学技术大学) Meituan(美团)

AI总结 本文提出一种无提示协作代理框架,通过验证和细化代理提升论文到代码生成的准确性和完整性,实验显示性能提升约15%和13%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01340 2025-12-02 cs.CV

EvalTalker: Learning to Evaluate Real-Portrait-Driven Multi-Subject Talking Humans

EvalTalker: 学习评估基于真实人像的多主体说话人类

Yingjie Zhou, Xilei Zhu, Siyu Ren, Ziyi Zhao, Ziwen Wang, Farong Wen, Yu Zhou, Jiezhang Cao, Xiongkuo Min, Fengjiao Chen, Xiaoyu Li, Xuezhi Cao, Guangtao Zhai, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Meituan(美团) Shanghai Innovation Institute(上海创新研究院)

AI总结 EvalTalker通过构建大规模多Talker生成的说话人类质量评估数据集,提出了一种能够感知整体质量、人类特征和身份一致性的新型质量评估框架,以提升多主体说话人类生成的质量和用户体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00789 2025-12-02 cs.CL

Auxiliary-Hyperparameter-Free Sampling: Entropy Equilibrium for Text Generation

辅助超参数-free采样:信息论视角下的文本生成熵平衡

Xiaodong Cai, Hai Lin, Shaoxiong Zhan, Weiqi Luo, Hong-Gee Kim, Hongyan Hao, Yu Yang, Hai-Tao Zheng

机构 * Meituan(美团)

AI总结 本文提出熵平衡采样方法,通过信息论原理实现无超参数调优的文本生成,提升生成质量和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23031 2025-12-01 cs.CV cs.AI

From Illusion to Intention: Visual Rationale Learning for Vision-Language Reasoning

从幻觉到意图:用于视觉-语言推理的视觉理由学习

Changpeng Wang, Haozhe Wang, Xi Chen, Junhan Liu, Taofeng Xue, Chong Peng, Donglian Qi, Fangzhen Lin, Yunfeng Yan

机构 * Zhejiang University(浙江大学) The University of Hong Kong(香港大学) Meituan(美团)

AI总结 本文提出视觉理由学习(ViRL),通过将视觉动作作为核心推理元素,提升视觉-语言推理模型的透明度和可信度。

Comments 19 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22853 2025-12-01 cs.LG

TARFVAE: Efficient One-Step Generative Time Series Forecasting via TARFLOW based VAE

TARFVAE:通过TARFLOW基于VAE实现高效的单步生成时间序列预测

Jiawen Wei, Lan Jiang, Pengbo Wei, Ziwen Ye, Teng Song, Chen Chen, Guangrui Ma

机构 * Meituan(美团)

AI总结 TARFVAE结合Transformer自回归流与VAE,实现高效单步生成时间序列预测,提升预测效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00279 2025-12-01 cs.MM cs.AI cs.CL cs.DC cs.LG cs.SD

LongCat-Flash-Omni Technical Report

LongCat-Flash-Omni 技术报告

Meituan LongCat Team, Bairui Wang, Bayan, Bin Xiao, Bo Zhang, Bolin Rong, Borun Chen, Chang Wan, Chao Zhang, Chen Huang, Chen Chen, Chen Chen, Chengxu Yang, Chengzuo Yang, Cong Han, Dandan Peng, Delian Ruan, Detai Xin, Disong Wang, Dongchao Yang, Fanfan Liu, Fengjiao Chen, Fengyu Yang, Gan Dong, Gang Huang, Gang Xu, Guanglu Wan, Guoqiang Tan, Guoqiao Yu, Haibo Qiu, Hao Lu, Hongbo Liu, Hongyu Xiang, Jiaheng Wu, Jian Yang, Jiaxing Liu, Jing Huang, Jingang Wang, Jinrui Ding, Juchao Jiang, Jun Kuang, Jun Wang, Junhui Mei, Ke Ding, Kefeng Zhang, Lei Chen, Liang Shi, Limeng Qiao, Liming Zheng, Lin Ma, Liuyang Guo, Liya Ma, Luying Sun, Man Gao, Mengshen Zhu, Miao Cao, Minliang Lin, Nuo Xu, Peng Shi, Qi Zhang, Qian Fang, Qian Wang, Qian Yang, Quanxiu Wang, Rongxiang Weng, Rongxin Guo, Ruoxuan Liang, Senbin Yang, Shanbo Xu, Shanglin Lei, Shengze Ye, Shimin Chen, Shuaiqi Chen, Shujie Hu, Shuo Li, Siqi Yang, Siyu Xu, Siyu Ren, Song Li, Songxiang Liu, Tianhao Bai, Tianye Dai, Wei Hong, Wei Wang, Weixiao Zhao, Wengang Cao, Wenlong Zhu, Wenlong He, Xi Su, Xi Nan, Xiaohan Zhao, Xiaohao Wang, Xiaoyu Zhao, Xiaoyu Wang, Xiaoyu Li, Xin Pan, Xin Chen, Xiusong Sun, Xu Xiang, Xudong Xing, Xuezhi Cao, Xunliang Cai, Yang Yang, Yanli Tan, Yao Yao, Yerui Sun, Yi Chen, Yifan Lu, Yin Gong, Yining Zhang, Yitian Chen, Yiyang Gan, Yuchen Tang, Yuchen Xie, Yueqian Wang, Yuewen Zheng, Yufei Zhang, Yufeng Zhong, Yulei Qian, Yuqi Peng, Yuqian Li, Yuwei Jiang, Zeyang Hu, Zheng Zhang, Zhengkun Tian, Zhiqing Hong, Zhixiong Zeng, Zhuqi Mi, Ziran Li, Ziwen Wang, Ziyi Zhao, Ziyuan Zhuang, Zizhe Zhao

机构 * Meituan LongCat Team(美团LongCat团队)

AI总结 LongCat-Flash-Omni 是一个具有5600亿参数的开源多模态模型,通过课程启发式训练策略实现高效实时音频视觉交互,具备强大的多模态和单模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00391 2025-12-01 cs.CV

VinciCoder: Unifying Multimodal Code Generation via Coarse-to-fine Visual Reinforcement Learning

VinciCoder:通过粗到细的视觉强化学习统一多模态代码生成

Xuanle Zhao, Deyang Jiang, Zhixiong Zeng, Lei Chen, Haibo Qiu, Jing Huang, Yufeng Zhong, Liming Zheng, Yilin Cao, Lin Ma

机构 * Meituan(美团)

AI总结 VinciCoder通过粗到细的视觉强化学习框架,统一多模态代码生成,实现最先进的性能,超越现有开源模型。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01088 2025-12-01 cs.CL

Privacy-Preserving Reasoning with Knowledge-Distilled Parametric Retrieval Augmented Generation

基于知识蒸馏的参数化检索增强生成隐私保护推理

Jinwen Chen, Hainan Zhang, Liang Pang, Yongxin Tong, Haibo Zhou, Yuan Zhan, Wei Lin, Zhiming Zheng

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算先进创新中心) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Meituan(美团)

AI总结 DistilledPRAG通过知识蒸馏实现高效参数化RAG,提升隐私保护推理的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21389 2025-11-27 cs.IR cs.AI

FITRep: Attention-Guided Item Representation via MLLMs

FITRep: 通过大语言模型实现的注意力引导的项目表示

Guoxiao Zhang, Ao Li, Tan Qu, Qianlong Xie, Xingxing Wang

机构 * Meituan(美团)

AI总结 FITRep通过引入注意力引导的白盒表示框架,利用多模态大语言模型实现细粒度项目去重,提升了广告点击率和每千次展示成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13100 2025-11-26 cs.RO

Count Every Rotation and Every Rotation Counts: Exploring Drone Dynamics via Propeller Sensing

计数每一次旋转,每一次旋转都重要:通过螺旋桨感知探索无人机动力学

Xuecheng Chen, Jingao Xu, Wenhua Ding, Haoyang Wang, Xinyu Luo, Ruiyang Duan, Jialong Chen, Xueqian Wang, Yunhao Liu, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院) The University of Hong Kong(香港大学) Meituan Academy of Robotics Shenzhen, China(美团机器人研究院(深圳)) School of Software, Tsinghua University, China(清华大学软件学院)

AI总结 通过螺旋桨旋转速度感知提升无人机传感性能,提出基于事件相机的解决方案,实现高精度飞行指令推断和跟踪精度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20519 2025-11-26 cs.CV cs.AI

Metis-HOME: Hybrid Optimized Mixture-of-Experts for Multimodal Reasoning

Metis-HOME: 面向多模态推理的混合优化专家混合模型

Xiaohan Lan, Fanfan Liu, Haibo Qiu, Siqi Yang, Delian Ruan, Peng Shi, Lin Ma

机构 * Meituan(美团)

AI总结 Metis-HOME通过混合优化专家混合模型,提升多模态推理的复杂推理能力和通用能力,解决推理与泛化之间的矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18437 2025-11-25 cs.CV

Perceptual-Evidence Anchored Reinforced Learning for Multimodal Reasoning

基于感知证据的强化学习用于多模态推理

Chi Zhang, Haibo Qiu, Qiming Zhang, Yufei Xu, Zhixiong Zeng, Siqi Yang, Peng Shi, Lin Ma, Jing Zhang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Meituan Inc(美团公司) The University of Sydney(悉尼大学)

AI总结 PEARL通过将推理锚定在验证的视觉证据上,提升多模态推理能力,有效解决视觉幻觉和奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16671 2025-11-21 cs.CV cs.AI cs.CL

Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation

生成中思考:在视觉生成过程中穿插文本推理

Ziyu Guo, Renrui Zhang, Hongyu Li, Manyuan Zhang, Xinyan Chen, Sifan Wang, Yan Feng, Peng Pei, Pheng-Ann Heng

机构 * CUHK(香港中文大学) IMIXR MMLab Meituan Project(美团项目)

AI总结 本文提出TwiG框架,通过在视觉生成过程中穿插文本推理,提升生成内容的上下文感知和语义丰富性。

Comments Project Page: https://think-while-gen.github.io Code: https://github.com/ZiyuGuo99/Thinking-while-Generating

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12464 2025-11-18 cs.CL

Probing Preference Representations: A Multi-Dimensional Evaluation and Analysis Method for Reward Models

Chenglong Wang, Yifu Huo, Yang Gan, Yongyu Mu, Qiaozhi He, Murun Yang, Bei Li, Chunliang Zhang, Tongran Liu, Anxiang Ma, Zhengtao Yu, Jingbo Zhu, Tong Xiao

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Meituan Inc.(美团公司) NiuTrans Research(牛译研所) CAS Key Laboratory of Behavioral Science, Institute of Psychology, CAS(中国科学院行为科学重点实验室) Kunming University of Science and Technology(昆明理工大学)

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏