arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Meituan(美团)

共收录 350
2601.11037 2026-04-22 cs.AI

BAPO: Boundary-Aware Policy Optimization for Reliable Agentic Search

BAPO:面向可靠代理搜索的边界感知策略优化

Shiyu Liu, Yongjing Yin, Jianhao Yan, Yunbo Tang, Qinggang Zhang, Bei Li, Xin Chen, Jingang Wang, Xunliang Cai, Jinsong Su

机构 * Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院) Meituan Inc.(美团公司) School of Informatics, Xiamen University(厦门大学信息学院) Westlake University(西湖大学) Jilin University(吉林大学) Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism, China(福建省和台湾非物质文化遗产数字化保护与智能处理重点实验室(厦门大学),中华人民共和国文旅部,中国)

AI总结 BAPO通过引入边界感知奖励和自适应奖励调节器,提升代理搜索的可靠性,避免过度依赖IDK响应,实验表明其显著增强可靠性。

Comments ACL 2026 Conference. Code is available at https://github.com/Liushiyu-0709/BAPO-Reliable-Search

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19021 2026-04-22 cs.LG

FG$^2$-GDN: Enhancing Long-Context Gated Delta Networks with Doubly Fine-Grained Control

FG$^2$-GDN:通过双重细粒度控制增强长上下文门控delta网络

Pingwei Sun, Yuxuan Hu, Jianchao Tan, Xue Wang, Jiaqi Zhang, Yifan Lu, Yerui Sun, Yuchen Xie, Xunliang Cai

机构 * Meituan Beijing(美团北京)

AI总结 FG$^2$-GDN通过引入通道级学习率向量和解耦键值缩放,提升长上下文关联记忆与理解能力,相比GDN和KDA在合成和现实基准上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18240 2026-04-21 cs.AI

AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware Evaluation

AJ-Bench:用于环境感知评估的代理作为裁判基准测试

Wentao Shi, Yu Wang, Yuyang Zhao, Yuxin Chen, Fuli Feng, Xueyuan Hao, Xi Su, Qi Gu, Hui Su, Xunliang Cai, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Meituan(美团)

AI总结 AJ-Bench通过三个领域155个任务评估代理作为裁判的能力,揭示了基于代理的验证方法在信息获取和过程验证中的性能提升及挑战。

Comments Accepted to ACL 2026 Findings. 43 pages total, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17884 2026-04-21 cs.AI

SPREG: Structured Plan Repair with Entropy-Guided Test-Time Intervention for Large Language Model Reasoning

SPREG:基于熵引导的测试时干预的结构化计划修复用于大语言模型推理

Xuan Wang, Yu Ming, Xinhao Zhong, Xinyu Yu, Wenjie Wang, Shuai Chen, Wei Lin

机构 * Meituan(美团)

AI总结 SPREG通过熵引导的测试时干预,解决大语言模型在长链推理中的逻辑幻觉和随机漂移问题,通过动态修复机制提升推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24235 2026-04-21 cs.LG cs.AI

PaTaRM: Bridging Pairwise and Pointwise Signals via Preference-Aware Task-Adaptive Reward Modeling

PaTaRM:通过偏好感知任务自适应奖励模型弥合成对和点状信号

Ai Jian, Jingqing Ruan, Xing Ma, Xiaoyun Zhang, Dailin Li, Weipeng Zhang, Ke Zeng, Xunliang Cai

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Meituan(美团) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 PaTaRM通过偏好感知奖励机制实现成对和点状信号的弥合,无需显式评分标签,提升奖励模型的鲁棒性和任务适应性,实验显示在多个基准测试中表现优异。

Comments ACL Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17419 2026-04-21 cs.MA cs.LG

ARMove: Learning to Predict Human Mobility through Agentic Reasoning

ARMove: 通过代理推理学习预测人类移动

Chuyue Wang, Jie Feng, Yuxi Wu, Shenglin Yi, Hang Zhang

机构 * Tencent(腾讯) Zhongguancun Academy(中关村学院) Alibaba Group(阿里巴巴集团) Meituan(美团)

AI总结 ARMove通过代理推理方法,解决人类移动预测中的可解释性、迭代学习和迁移性问题,实验表明其在六个指标上优于现有方法,且在不同地区和用户群体中表现稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17337 2026-04-21 cs.AI

AutoSearch: Adaptive Search Depth for Efficient Agentic RAG via Reinforcement Learning

AutoSearch: 通过强化学习实现高效的代理RAG自适应搜索深度

Jingbo Sun, Wenyue Chong, Songjun Tu, Qichao Zhang, Yaocheng Zhang, Jiajun Chai, Xiaohan Wang, Wei Lin, Guojun Yin, Dongbin Zhao

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所SKL-MAIS实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学交叉学科学院) Meituan(美团)

AI总结 本文提出AutoSearch框架,通过强化学习动态调整搜索深度,在保证搜索质量的同时提升效率,实现在复杂问题上的准确率与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17284 2026-04-21 cs.AI

HalluClear: Diagnosing, Evaluating and Mitigating Hallucinations in GUI Agents

HalluClear:诊断、评估和缓解GUI代理中的幻觉

Chao Jin, Wenkui Yang, Hao Sun, Yuqi Liao, Qianyi Jiang, Kai Zhou, Jie Cao, Ran He, Huaibo Huang

机构 * MAIS&NLPR, Institute of Automation, Chinese Academy of Sciences(自动化研究所人工智能与自然语言处理实验室,中国科学院) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Meituan(美团)

AI总结 HalluClear通过引入专门的幻觉分类、校准的评估流程和闭环推理方案,有效减少GUI代理中的幻觉,提升自动化可靠性。

Comments 47 pages, 44 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14389 2026-04-21 cs.LG cs.AI

From $\log π$ to $π$: Taming Divergence in Soft Clipping via Bilateral Decoupled Decay of Probability Gradient Weight

从log π到π:通过双侧解耦衰减概率梯度权重来驯服发散

Xiaoliang Fu, Jiaye Lin, Yangyi Fang, Chaowen Hu, Cong Qin, Zekai Shao, Binbin Zheng, Lu Pan, Ke Zeng

机构 * Meituan(美团) Fudan University(复旦大学) Tsinghua University(清华大学) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出DGPO方法,通过解耦衰减机制解决RLVR中概率梯度发散问题,提升大语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00069 2026-04-21 cs.LG cs.CL

Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning

压缩而非单纯剪枝:在MoE层剪枝中提升效率和性能

Mingyu Cao, Gen Li, Jie Ji, Jiaqi Zhang, Ajay Jaiswal, Li Shen, Xiaolong Ma, Shiwei Liu, Lu Yin

机构 * University of Surrey(萨里大学) Clemson University(克莱姆森大学) Meituan(美团) University of Texas at Austin(德克萨斯大学奥斯汀分校) Sun Yat-sen University(中山大学) The University of Arizona(亚利桑那大学) ELLIS Institute(ELLIS研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Tübingen AI Center(图宾根人工智能中心)

AI总结 本文提出CD-MoE方法,通过压缩稀疏MoE层为更密集的层,提升效率和性能,实验证明在DeepSeekMoE-16B模型中,内存使用减少27.5%,推理速度提升1.26倍,且通过轻量专家微调恢复98%原始性能。

Journal ref Published in TMLR 10/2025 (https://openreview.net/pdf?id=BQe6j6sAu6)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17550 2026-04-21 cs.LG cs.AI

MASPO: Unifying Gradient Utilization, Probability Mass, and Signal Reliability for Robust and Sample-Efficient LLM Reasoning

MASPO:统一梯度利用、概率质量与信号可靠性以实现鲁棒且样本高效的LLM推理

Xiaoliang Fu, Jiaye Lin, Yangyi Fang, Binbin Zheng, Chaowen Hu, Zekai Shao, Cong Qin, Lu Pan, Ke Zeng, Xunliang Cai

机构 * Meituan(美团) Fudan University(复旦大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学)

AI总结 MASPO通过统一框架解决RLVR方法中梯度利用低效、概率质量不敏感和信号可靠性不对称的问题,提升LLM推理的鲁棒性和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02880 2026-04-20 cs.CV

InstructTable: Improving Table Structure Recognition Through Instructions

InstructTable: 通过指令提升表格结构识别

Boming Chen, Zining Wang, Zhentao Guo, Jianqiang Liu, Chen Duan, Yu Gu, Kai zhou, Pengfei Yan

机构 * Meituan(美团) Beijing Institute of Technology(北京理工大学)

AI总结 本文提出InstructTable框架,通过指令引导多阶段训练提升表格结构识别,结合指令预训练和细调,构建BCDSTab基准,实现在复杂表格识别中的最优性能。

Comments 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition- FINDINGS Track (CVPRF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14580 2026-04-17 cs.CV cs.MM cs.SD

TurboTalk: Progressive Distillation for One-Step Audio-Driven Talking Avatar Generation

TurboTalk: 一步生成音频驱动的虚拟角色的渐进蒸馏

Xiangyu Liu, Feng Gao, Xiaomei Zhang, Yong Zhang, Xiaoming Wei, Zhen Lei, Xiangyu Zhu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Meituan(美团) The Hong Kong Polytechnic University(香港理工大学) CAIR, HKISI, CAS(中国科学院CAS HKISI CAIR)

AI总结 本文提出TurboTalk框架,通过分布匹配蒸馏和对抗蒸馏逐步压缩多步音频驱动视频扩散模型,实现单步生成高质量虚拟角色,推理速度提升120倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13828 2026-04-16 cs.CL

MUSE: Multi-Domain Chinese User Simulation via Self-Evolving Profiles and Rubric-Guided Alignment

MUSE:通过自演化档案和评分引导对齐实现多领域中文用户模拟

Zihao Liu, Hantao Zhou, Jiguo Li, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Peng Wang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Meituan(美团)

AI总结 MUSE通过自演化档案和评分引导对齐,生成逼真且行为一致的中文用户响应,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10164 2026-04-16 cs.AI

Pruning Long Chain-of-Thought of Large Reasoning Models via Small-Scale Preference Optimization

通过小规模偏好优化修剪大推理模型的长推理链

Bin Hong, Jiayu Liu, Kai Zhang, Jianwen Sun, Mengdi Zhang, Zhenya Huang

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence(人工智能研究院) Hefei Comprehensive National Science Center(合肥综合性国家科学中心) Central China Normal University(中部师范大学) Meituan(美团) NeoShell

AI总结 本文提出LCPO方法,通过统一的Bradley-Terry损失框架,有效减少大推理模型的输出长度,同时保持推理性能,实验显示在多个基准上平均输出长度减少超过50%。

Comments 26 pages, 8 figures, ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18847 2026-04-16 cs.CV cs.AI cs.CL

Failure Makes the Agent Stronger: Enhancing Accuracy through Structured Reflection for Reliable Tool Interactions

失败让智能体更强:通过结构化反思提升准确性以实现可靠的工具交互

Junhao Su, Yuanliang Wan, Junwei Yang, Hengyu Shi, Tianyang Han, Junfeng Luo, Yurui Qiu

机构 * Vision Agent Team, Meituan(美团视觉代理团队) MeiGen AI Team, Meituan(美团MeiGen AI团队)

AI总结 本文提出结构化反思方法,通过显式反思和优化提升工具交互的可靠性,实验表明在多轮工具调用中显著提高成功率并减少冗余调用。

Comments ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12630 2026-04-15 cs.CV cs.CL

GeoAlign: Geometric Feature Realignment for MLLM Spatial Reasoning

GeoAlign:用于MLLM空间推理的几何特征重定位

Zhaochen Liu, Limeng Qiao, Guanglu Wan, Tingting Jiang

机构 * National Engineering Research Center of Visual Technology, National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(视觉技术国家工程研究中心、多媒体信息处理国家重点实验室、计算机学院、北京大学) Meituan Inc.(美团公司) National Biomedical Imaging Center, Peking University(生物医学成像国家中心、北京大学)

AI总结 本文提出GeoAlign框架,通过动态聚合多层几何特征以解决MLLM在空间推理中的任务对齐偏差问题,实验表明其紧凑模型在多个基准测试中达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01045 2026-04-15 cs.MA cs.AI

Silo-Bench: A Scalable Environment for Evaluating Distributed Coordination in Multi-Agent LLM Systems

Silo-Bench:一种用于评估多智能体大语言模型分布式协调的可扩展环境

Yuzhe Zhang, Feiran Liu, Yi Shan, Xinyi Huang, Xin Yang, Yueqi Zhu, Xuxin Cheng, Cao Liu, Ke Zeng, Terry Jingchen Zhang, Wenyuan Jiang

机构 * Beijing University of Technology(北京理工大学) Zhejiang University(浙江大学) ETH Zürich(苏黎世联邦理工学院) Meituan LongCat Interaction Team(美团LongCat交互团队) Vector Institute for Artificial Intelligence(人工智能向量研究所)

AI总结 Silo-Bench通过30种算法任务和三个通信复杂度级别评估多智能体系统分布式协调,揭示了通信与推理之间的差距,证明单纯增加智能体数量无法克服上下文限制。

Comments 20 pages, 7 figures, Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11778 2026-04-14 cs.CL cs.AI

General365: Benchmarking General Reasoning in Large Language Models Across Diverse and Challenging Tasks

General365:在多样化和具有挑战性的任务中评估大语言模型的通用推理能力

Junlin Liu, Shengnan An, Shuang Zhou, Dan Ma, Shixiong Luo, Ying Xie, Yuan Zhang, Wenling Yuan, Yifan Zhou, Xiaoyu Li, Ziwen Wang, Xuezhi Cao, Xunliang Cai

机构 * University of Chinese Academy of Sciences(中国科学院大学) Meituan(美团)

AI总结 本文提出General365基准,通过限制背景知识至K-12水平,评估大语言模型在通用推理任务中的表现,揭示当前模型在非专业领域推理能力的不足。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11689 2026-04-14 cs.CV cs.RO

LARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action Alignment

LARY:一种产生通用视觉到动作对齐基准的潜在动作表示

Dujun Nie, Fengjiao Chen, Qi Lv, Jun Kuang, Xiaoyu Li, Xuezhi Cao, Xunliang Cai

机构 * Meituan(美团)

AI总结 本文提出LARY基准,通过大规模人类视频数据评估潜在动作表示,发现通用视觉模型在动作控制上优于专用模型,且潜在空间比像素空间更符合物理动作空间。

Comments Project: https://meituan-longcat.github.io/LARYBench Code: https://github.com/meituan-longcat/LARYBench Dataset: https://huggingface.co/datasets/meituan-longcat/LARYBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10425 2026-04-14 cs.CV

DiningBench: A Hierarchical Multi-view Benchmark for Perception and Reasoning in the Dietary Domain

DiningBench:面向饮食领域的分层多视角基准测试平台

Song Jin, Juntian Zhang, Xun Zhang, Zeying Tian, Fei Jiang, Guojun Yin, Wei Lin, Yong Liu, Rui Yan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Meituan(美团) Wuhan University(武汉大学)

AI总结 本文提出DiningBench,一个分层多视角基准,用于评估视觉语言模型在饮食领域感知与推理能力,包含3021种不同菜品,通过多视角输入和链式推理方法,揭示了当前VLM在细粒度视觉识别和营养推理上的不足。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25866 2026-04-14 cs.CV

DeepSketcher: Internalizing Visual Manipulation for Multimodal Reasoning

DeepSketcher:内化视觉操作以实现多模态推理

Chi Zhang, Haibo Qiu, Qiming Zhang, Zhixiong Zeng, Lin Ma, Jing Zhang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Meituan Inc(美团) Independent Researcher, China(独立研究者)

AI总结 DeepSketcher通过构建图像-文本交织数据集和自包含模型,实现了无需外部工具的视觉思考,提升了多模态推理能力。

Comments CVPR2026 FINDINGS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07815 2026-04-10 cs.CL

AsyncTLS: Efficient Generative LLM Inference with Asynchronous Two-level Sparse Attention

AsyncTLS: 高效的生成式大语言模型推理方法与异步两级稀疏注意力

Yuxuan Hu, Jianchao Tan, Jiaqi Zhang, Wen Zan, Pingwei Sun, Yifan Lu, Yerui Sun, Yuchen Xie, Xunliang Cai, Jing Zhang

机构 * School of Information, Renmin University of China(中国人民大学信息学院) Meituan(美团)

AI总结 AsyncTLS通过结合粗粒度块过滤与细粒度token选择,平衡精度与效率,并利用异步卸载引擎提升性能,实现高精度与高吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11635 2026-04-09 cs.AI

Do MLLMs Really Understand Space? A Mathematical Reasoning Evaluation

大规模语言模型真的能理解空间吗?一项数学推理评估

Shuo Lu, Jianjie Cheng, Yinuo Xu, Yongcan Yu, Lijun Sheng, Peijie Wang, Siru Jiang, Yongguan Hu, Run Ling, Yihua Shao, Ao Ma, Wei Feng, Lingxiao He, Meng Wang, Qianlong Xie, Xingxing Wang, Nicu Sebe, Ran He, Jian Liang

机构 * Meituan Inc.(美团) Northeastern University(东北大学) University of Trento(特伦托大学)

AI总结 本文通过MathSpatial数据集评估了大规模语言模型在数学空间推理上的能力,发现其在空间推理任务上表现不佳,提出该数据集有助于提升模型的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01702 2026-04-07 cs.CL

On the Role of Reasoning Patterns in the Generalization Discrepancy of Long Chain-of-Thought Supervised Fine-Tuning

在长链式思维监督微调中推理模式在泛化差异中的作用

Zhaoyi Li, Xiangyu Xi, Zhengyu Chen, Wei Wang, Gangwei Jiang, Ranran Shen, Linqi Song, Ying Wei, Defu Lian

机构 * University of Science and Technology of China(中国科学技术大学) Meituan LongCat Team(美团龙猫团队) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

AI总结 本文研究不同来源的长链式思维轨迹对模型泛化性能的影响,发现训练损失低并不一定带来更好的泛化能力,提出过滤频繁分支轨迹以提升SFT泛化性能。

Comments Under Review. version2: correct typos in Table 4 and add an ablation study (Table 5)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08980 2026-04-06 cs.CV cs.AI

Training Multi-Image Vision Agents via End2End Reinforcement Learning

通过端到端强化学习训练多图像视觉代理

Chengqi Dong, Chuhuai Yue, Hang He, Rongge Mao, Fenghe Tang, S Kevin Zhou, Zekun Xu, Xiaohan Wang, Jiajun Chai, Guojun Yin

机构 * MeiTuan(美团) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出IMAgent,通过端到端强化学习训练视觉代理,解决多图像问答任务中的输入限制问题,通过设计视觉反思和验证工具提升模型注意力,首次从注意力角度揭示工具使用对性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26546 2026-04-03 cs.CV

AutoWeather4D: Autonomous Driving Video Weather Conversion via G-Buffer Dual-Pass Editing

AutoWeather4D:通过G-Buffer双步编辑实现自动驾驶视频天气转换

Tianyu Liu, Weitao Xiong, Kunming Luo, Manyuan Zhang, Peng Li, Yuan Liu, Ping Tan

机构 * The Hong Kong University of Science and Technology(香港科技大学) Xiamen University(厦门大学) Meituan-M17, Hong Kong(美团-M17,香港)

AI总结 本文提出AutoWeather4D框架,通过G-Buffer双步编辑分离几何与光照,实现高质量天气合成,提供细粒度物理控制,适用于自动驾驶数据生成。

Comments Project Page: https://lty2226262.github.io/autoweather4d/ | Github: https://github.com/lty2226262/AutoWeather4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00438 2026-04-02 cs.CL

TR-ICRL: Test-Time Rethinking for In-Context Reinforcement Learning

TR-ICRL:基于上下文的强化学习中的测试时重新思考

Wenxuan Jiang, Yuxin Zuo, Zijian Zhang, Xuecheng Wu, Zining Fan, Wenxuan Liu, Li Chen, Xiaoyu Li, Xuezhi Cao, Xiaolong Jin, Ninghao Liu

机构 * The Hong Kong Polytechnic University(香港理工大学) Meituan(美团) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Xi’an Jiaotong University(西安交通大学) East China Normal University(华东师范大学) Northeastern University(东北大学)

AI总结 TR-ICRL通过在推理过程中重新思考来解决ICRL中的奖励估计问题,通过伪标签生成反馈,提升模型在推理和知识密集型任务中的性能。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16908 2026-04-02 cs.CV

Q-REAL: Towards Realism and Plausibility Evaluation for AI-Generated Content

Q-REAL:迈向AI生成内容真实性和可信度评估

Shushi Wang, Zicheng Zhang, Chunyi Li, Wei Wang, Liya Ma, Fengjiao Chen, Xiaoyu Li, Xuezhi Cao, Guangtao Zhai, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Meituan(美团) Shanghai AI Lab(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出Q-REAL数据集,用于细粒度评估AI生成图像的真实性和可信度,通过标注实体位置和设计判断问题,提升生成模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29339 2026-04-01 cs.SD eess.AS

LongCat-AudioDiT: High-Fidelity Diffusion Text-to-Speech in the Waveform Latent Space

LongCat-AudioDiT:在波形潜在空间中实现高保真的扩散文本到语音

Detai Xin, Shujie Hu, Chengzuo Yang, Chen Huang, Guoqiao Yu, Guanglu Wan, Xunliang Cai

机构 * Meituan LongCat Team(美团LongCat团队)

AI总结 LongCat-AudioDiT通过在波形潜在空间中直接操作,实现了高保真的文本到语音生成,无需复杂多阶段训练流程或高质量标注数据,展现出卓越的零样本语音克隆性能。

Comments Code and model weights are available at https://github.com/meituan-longcat/LongCat-AudioDiT

详情

展开后加载摘要…

URL PDF HTML 收藏