arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Meituan(美团)

共收录 350
2603.28353 2026-03-31 cs.CV

VistaGEN: Consistent Driving Video Generation with Fine-Grained Control Using Multiview Visual-Language Reasoning

VistaGEN: 通过多视角视觉语言推理实现一致的驾驶视频生成与细粒度控制

Li-Heng Chen, Ke Cheng, Yahui Liu, Lei Shi, Shi-Sheng Huang, Hongbo Fu

机构 * Hong Kong University of Science and Technology(香港科技大学) Meituan, Inc.(美团) Beijing Normal University(北京师范大学)

AI总结 本文提出VistaGEN,通过多视角视觉语言推理实现驾驶视频生成的细粒度控制与时空一致性,引入多视角视觉语言评估器和对象级细化模块,提升长视频生成质量与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09326 2026-03-31 cs.CV

OddGridBench: Exposing the Lack of Fine-Grained Visual Discrepancy Sensitivity in Multimodal Large Language Models

OddGridBench: 暴露多模态大语言模型在细粒度视觉差异敏感性方面的不足

Tengjin Weng, Wenhao Jiang, Jingyi Wang, Ming Li, Lin Ma, Zhong Ming

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Shenzhen Technology University(深圳技术大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Meituan(美团)

AI总结 本文提出OddGridBench基准,评估多模态大语言模型的视觉差异敏感性,发现其检测能力远低于人类,提出OddGrid-GRPO框架提升模型细粒度视觉辨别能力。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27538 2026-03-31 cs.CV cs.CL

LongCat-Next: Lexicalizing Modalities as Discrete Tokens

LongCat-Next:将模态词典化为离散标记

Meituan LongCat Team, Bin Xiao, Chao Wang, Chengjiang Li, Chi Zhang, Chong Peng, Hang Yu, Hao Yang, Haonan Yan, Haoze Sun, Haozhe Zhao, Hong Liu, Hui Su, Jiaqi Zhang, Jiawei Wang, Jing Li, Kefeng Zhang, Manyuan Zhang, Minhao Jing, Peng Pei, Quan Chen, Taofeng Xue, Tongxin Pan, Xiaotong Li, Xiaoyang Li, Xiaoyu Zhao, Xing Hu, Xinyang Lin, Xunliang Cai, Yan Bai, Yan Feng, Yanjie Li, Yao Qiu, Yerui Sun, Yifan Lu, Ying Luo, Yipeng Mei, Yitian Chen, Yuchen Xie, Yufang Liu, Yufei Chen, Yulei Qian, Yuqi Peng, Zhihang Yu, Zhixiong Han, Changran Wang, Chen Chen, Dian Zheng, Fengjiao Chen, Ge Yang, Haowei Guo, Haozhe Wang, Hongyu Li, Huicheng Jiang, Jiale Hong, Jialv Zou, Jiamu Li, Jianping Lin, Jiaxing Liu, Jie Yang, Jing Jin, Jun Kuang, Juncheng She, Kunming Luo, Kuofeng Gao, Lin Qiu, Linsen Guo, Mianqiu Huang, Qi Li, Qian Wang, Rumei Li, Siyu Ren, Wei Wang, Wenlong He, Xi Chen, Xiao Liu, Xiaoyu Li, Xu Huang, Xuanyu Zhu, Xuezhi Cao, Yaoming Zhu, Yifei Cao, Yimeng Jia, Yizhen Jiang, Yufei Gao, Zeyang Hu, Zhenlong Yuan, Zijian Zhang, Ziwen Wang

机构 * Meituan LongCat Team(美团LongCat团队)

AI总结 LongCat-Next提出了一种统一框架DiNA,通过共享离散空间实现多模态一致建模,引入dNaViT实现任意分辨率的标记化与反标记化,构建出单一自回归目标处理文本、视觉和音频的多模态模型,突破离散视觉建模的性能瓶颈。

Comments LongCat-Next Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27014 2026-03-31 cs.CV

GUIDED: Granular Understanding via Identification, Detection, and Discrimination for Fine-Grained Open-Vocabulary Object Detection

GUIDED: 通过识别、检测和辨别实现细粒度理解的细粒度开放词汇物体检测

Jiaming Li, Zhijia Liang, Weikai Chen, Lin Ma, Guanbin Li

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Meituan(美团) GuangDong Province Key Laboratory of Information Security Technology(广东省信息安全技术重点实验室) Research Institute, Sun Yat-sen University(中山大学深圳研究院)

AI总结 GUIDED通过分解框架解决细粒度提示中主体与属性的语义纠缠问题,通过分离定位与识别任务提升细粒度开放词汇物体检测性能。

Comments NIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03548 2026-03-31 cs.CL

SEAD: Self-Evolving Agent for Multi-Turn Service Dialogue

SEAD:多轮服务对话的自演化代理

Yuqin Dai, Ning Gao, Wei Zhang, Jie Wang, Zichen Luo, Jinpeng Wang, Yujie Wang, Ruiyuan Wu, Chaozheng Wang

机构 * Meituan(美团)

AI总结 SEAD通过自演化机制提升服务对话性能,无需大规模人工标注,实验显示其任务完成率和对话效率均优于开源和商用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16279 2026-03-31 cs.CV

MAN++: Scaling Momentum Auxiliary Network for Supervised Local Learning in Vision Tasks

MAN++: 用于视觉任务中监督局部学习的动量辅助网络扩展

Junhao Su, Feiyu Zhu, Hengyu Shi, Tianyang Han, Yurui Qiu, Junfeng Luo, Xiaoming Wei, Jialin Gao

机构 * Vision Intelligence in MeiTuan(美团视觉智能) AttrSense

AI总结 MAN++通过引入动态交互机制和可学习缩放偏置,提升视觉任务中监督局部学习的性能,减少GPU内存消耗并保持与端到端训练相当的精度。

Comments Accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26262 2026-03-30 cs.CV cs.LG

GLASS: Geometry-aware Local Alignment and Structure Synchronization Network for 2D-3D Registration

GLASS:面向2D-3D配准的几何感知局部对齐与结构同步网络

Zhixin Cheng, Jiacheng Deng, Xinjun Li, Bohao Liao, Li Liu, Xiaotian Yin, Baoqun Yin, Tianzhu Zhang

机构 * School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院) Meituan Inc(美团)

AI总结 本文提出GLASS网络,通过局部几何增强和图分布一致性模块,解决重复模式下2D-3D配准中的结构不一致问题,提升匹配精度。

Comments Accepted by IEEE Transactions on Circuits and Systems for Video Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25319 2026-03-27 cs.CV

MACRO: Advancing Multi-Reference Image Generation with Structured Long-Context Data

MACRO:通过结构化长上下文数据推进多参考图像生成

Zhekai Chen, Yuqing Wang, Manyuan Zhang, Xihui Liu

机构 * HKU MMLab(香港大学多媒体实验室) Meituan(美团)

AI总结 本文提出MACRO数据集和基准,解决多参考图像生成中参考数量增加导致性能下降的问题,通过结构化长上下文数据提升生成质量。

Comments Project Page: https://macro400k.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11336 2026-03-25 cs.CV

UFVideo: Towards Unified Fine-Grained Video Cooperative Understanding with Large Language Models

UFVideo:迈向统一的细粒度视频协作理解的大型语言模型

Hewen Pan, Cong Wei, Dashuang Liang, Zepeng Huang, Pengfei Gao, Ziqi Zhou, Lulu Xue, Pengfei Yan, Xiaoming Wei, Minghui Li, Shengshan Hu

机构 * Huazhong University of Science and Technology(华中科技大学) Meituan(美团)

AI总结 UFVideo通过统一多粒度协作理解能力,实现视频理解的全面覆盖,展示了其在多粒度视频任务中的灵活性和优势。

Comments CVPR 2026 Camera Ready, Github Code: https://github.com/Heven-Pan/UFVideo

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21565 2026-03-24 cs.CV

UAVLight: A Benchmark for Illumination-Robust 3D Reconstruction in Unmanned Aerial Vehicle (UAV) Scenes

UAVLight:用于无人机(UAV)场景中抗光照干扰的3D重建基准

Kang Du, Xue Liao, Junpeng Xia, Chaozheng Guo, Yi Gu, Yirui Guan, Duotun Wang, Sheng Huang, Zeyu Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Meituan UAV(美团无人机) Beijing University of Chemical Technology(北京化工大学)

AI总结 UAVLight基准通过可控且真实的飞行路径捕获多时段多光照条件下的场景,提供一致几何和校准下的自然光照变化,用于评估抗光照干扰的3D重建方法。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21065 2026-03-24 cs.AI cs.CL

LongCat-Flash-Prover: Advancing Native Formal Reasoning via Agentic Tool-Integrated Reinforcement Learning

LongCat-Flash-Prover:通过集成工具的强化学习推进原生形式推理

Jianing Wang, Jianfei Zhang, Qi Guo, Linsen Guo, Rumei Li, Chao Zhang, Chong Peng, Cunguang Wang, Dengchang Zhao, Jiarong Shi, Jingang Wang, Liulin Feng, Mengxia Shen, Qi Li, Shengnan An, Shun Wang, Wei Shi, Xiangyu Xi, Xiaoyu Li, Xuezhi Cao, Yi Lu, Yunke Zhao, Zhengyu Chen, Zhimin Lin, Wei Wang, Peng Pei, Xunliang Cai

机构 * Meituan(美团)

AI总结 本文提出LongCat-Flash-Prover,一个5600亿参数的混合专家模型,通过集成工具的强化学习提升Lean4中的原生形式推理能力,实现了自动形式化、草图生成和证明三大能力,并通过混合专家迭代框架和分层重要性采样策略提升训练效率。

Comments 43 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20212 2026-03-24 cs.CL cs.LG

Fast-Slow Thinking RM: Efficient Integration of Scalar and Generative Reward Models

快速-缓慢思考RM:标量与生成奖励模型的有效整合

Jiayun Wu, Peixu Hou, Shan Qu, Peng Zhang, Ning Gu, Tun Lu

机构 * Fudan University(复旦大学) Meituan(美团)

AI总结 本文提出F/S-RM,结合快速和缓慢思考机制,提升奖励模型性能并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18891 2026-03-20 cs.CV cs.LG

PromptHub: Enhancing Multi-Prompt Visual In-Context Learning with Locality-Aware Fusion, Concentration and Alignment

PromptHub: 通过局部感知融合、集中和对齐增强多提示视觉上下文学习

Tianci Luo, Jinpeng Wang, Shiyu Qin, Niu Lian, Yan Feng, Bin Chen, Chun Yuan, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校) Meituan, Beijing(美团,北京)

AI总结 PromptHub通过局部感知融合、集中和对齐方法提升多提示视觉上下文学习性能,验证了其在多种视觉任务中的优越性及泛化能力。

Comments Accepted to ICLR 2026. 17 pages, 11 figures, and 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15030 2026-03-20 cs.AI

VTC-Bench: Evaluating Agentic Multimodal Models via Compositional Visual Tool Chaining

VTC-Bench:通过组合视觉工具链评估代理多模态模型

Xuanyu Zhu, Yuhao Dong, Rundong Wang, Yang Shi, Zhipeng Wu, Yinlun Peng, YiFan Zhang, Yihang Lou, Yuanxing Zhang, Ziwei Liu, Yan Bai, Yuan Zhou

机构 * PKU(北京大学) NTU(国立台湾大学) USTC(中国科学技术大学) CQU(重庆大学) NUDT(南京理工大学) CASIA(中国科学院自动化研究所) Meituan(美团)

AI总结 VTC-Bench通过组合视觉工具链评估多模态大语言模型的工具使用能力,揭示了当前模型在复杂任务中适应性和多工具组合方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11173 2026-03-20 cs.CV cs.MM

CoPRS: Learning Positional Prior from Chain-of-Thought for Reasoning Segmentation

CoPRS:从链式思维中学习位置先验以进行推理分割

Zhenyu Lu, Liupeng Li, Jinpeng Wang, Yan Feng, Bin Chen, Ke Chen, Yaowei Wang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Meituan, Beijing(北京美团) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出CoPRS模型,通过多模态链式思维生成可解释的位置先验热图,提升推理分割的可解释性和精度,实验表明其在多个数据集上表现优异。

Comments Accepted to ICLR 2026. 20 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17813 2026-03-19 cs.CV

M2P: Improving Visual Foundation Models with Mask-to-Point Weakly-Supervised Learning for Dense Point Tracking

M2P:通过Mask-to-Point弱监督学习改进视觉基础模型以实现密集点跟踪

Qiangqiang Wu, Tianyu Yang, Bo Fang, Jia Wan, Matias Di Martino, Guillermo Sapiro, Antoni B. Chan

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系) Meituan, Shenzhen, China(美团(深圳,中国)) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) Department of Electrical and Computer Engineering, Duke University(杜克大学电气与计算机工程系)

AI总结 本文提出M2P学习方法,利用视频对象分割掩码注解改进视觉基础模型,通过局部结构一致性损失、掩码标签一致性损失和掩码边界约束,提升密集点跟踪性能,实验表明其在TAP-Vid-DAVIS基准上优于DINOv2和DINOv3。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09233 2026-03-19 cs.LG cs.AI cs.CL

GIFT: Reconciling Post-Training Objectives via Finite-Temperature Gibbs Initialization

GIFT:通过有限温度吉布斯初始化调和后训练目标

Zhengyang Zhao, Lu Ma, Yizhen Jiang, Xiaochen Ma, Zimo Meng, Chengyu Shen, Lexiang Tang, Haoze Sun, Peng Pei, Wentao Zhang

机构 * Peking University(北京大学) Meituan(美团)

AI总结 本文提出GIFT方法,通过将监督视为有限温度能量势,解决后训练阶段目标不一致问题,实验表明其在强化学习初始化中优于传统SFT及其他基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17427 2026-03-19 cs.CV

ECHO: Towards Emotionally Appropriate and Contextually Aware Interactive Head Generation

ECHO:面向情感恰当且情境感知的交互头生成

Xiangyu Kong, Xiaoyu Jin, Yihan Pan, Haoqin Sun, Hengde Zhu, Xiaoming Xu, Xiaoming Wei, Lu Liu, Siyang Song

机构 * University of Exeter, Exeter, UK(埃克塞特大学) Meituan, China(美团) College of Computer Science, Nankai University, China(南开大学计算机学院) School of Computer Science and Technology, Tongji University, China(同济大学计算机科学与技术学院)

AI总结 本文提出ECHO框架,通过长程上下文理解模块和空间感知解耦交叉注意力模块,提升交互头生成的上下文恰当性和情感合理性,同时改进唇部同步和视觉保真度。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16448 2026-03-19 cs.AI

TRUST-SQL: Tool-Integrated Multi-Turn Reinforcement Learning for Text-to-SQL over Unknown Schemas

TRUST-SQL:基于工具的多轮强化学习用于未知模式下的文本到SQL

Ai Jian, Xiaoyun Zhang, Wanrou Du, Jingqing Ruan, Jiangbo Pei, Weipeng Zhang, Ke Zeng, Xunliang Cai

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) State Key Lab of Processors, Institute of Computing Technology, CAS(中国科学院计算技术研究所处理器国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Meituan(美团)

AI总结 本文提出TRUST-SQL,通过工具集成的多轮强化学习解决文本到SQL在未知模式下的问题,通过结构化四阶段协议和Dual-Track GRPO策略提升性能,实验表明在多个基准上取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16483 2026-03-18 cs.CL

On the Emotion Understanding of Synthesized Speech

合成语音情感理解研究

Yuan Ge, Haishu Zhao, Aokai Hao, Junxiang Zhang, Bei Li, Xiaoqian Liu, Chenglong Wang, Jianjin Wang, Bingsen Zhou, Bingyu Liu, Jingbo Zhu, Zhengtao Yu, Tong Xiao

机构 * Northeastern University, China(东北大学) Meituan(美团) NiuTrans Research(NiuTrans研究院) Kunming University of Science and Technology(昆明理工大学)

AI总结 本文系统评估了合成语音上情感识别模型的泛化能力,发现现有模型因合成过程中的语音token预测导致表示不匹配,无法有效捕捉情感特征,且生成式语音模型易忽略非语言线索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05551 2026-03-18 cs.IR cs.CV

AutothinkRAG: Complexity-Aware Control of Retrieval-Augmented Reasoning for Image-Text Interaction

AutothinkRAG: 多模态文档问答中检索增强推理的复杂度感知控制

Jiashu Yang, Chi Zhang, Abudukelimu Wuerkaixi, Xuxin Cheng, Cao Liu, Ke Zeng, Xu Jia, Xunliang Cai

机构 * Dalian University of Technology(大连理工大学) Tsinghua University(清华大学) Meituan LongCat Interaction Team(美团LongCat交互团队)

AI总结 本文提出AutoThinkRAG,通过查询复杂度路由器和感知-推理解耦架构,提升多模态文档问答的效率与鲁棒性,实验表明在DocBench和MMLongBench上准确率提升,且降低计算与成本消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18632 2026-03-16 cs.CV cs.AI

Think with 3D: Geometric Imagination Grounded Spatial Reasoning from Limited Views

用3D思考:从有限视角出发的几何想象引导的空间推理

Zhangquan Chen, Manyuan Zhang, Xinlei Yu, Xufang Luo, Mingze Sun, Zihao Pan, Xiang An, Yan Feng, Peng Pei, Xunliang Cai, Ruqi Huang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Meituan(美团) National University of Singapore(新加坡国立大学) Beihang University(北航) LMMs-Lab(LMMs实验室)

AI总结 本文提出3DThinker框架,通过利用图像中的丰富几何信息实现空间推理,无需3D先验输入或显式标注3D数据,在多个基准测试中优于现有方法。

Comments 25 pages, 17 figures

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03034 2026-03-10 cs.CV

MAViD: A Multimodal Framework for Audio-Visual Dialogue Understanding and Generation

MAViD:一种多模态框架用于音频-视觉对话理解和生成

Youxin Pang, Jiajun Liu, Lingfeng Tan, Yong Zhang, Feng Gao, Xiang Deng, Zhuoliang Kang, Xiaoming Wei, Yebin Liu

机构 * Tsinghua University(清华大学) Meituan(美团)

AI总结 MAViD提出了一种多模态框架,通过Conductor-Creator架构实现音频-视觉对话的理解与生成,结合自回归和扩散模型提升长时多模态内容生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03575 2026-03-06 cs.CV

UniComp: Rethinking Video Compression Through Informational Uniqueness

UniComp:通过信息唯一性重新思考视频压缩

Chao Yuan, Shimin Chen, Minliang Lin, Limeng Qiao, Guanglu Wan, Lin Ma

机构 * Meituan Inc.(美团公司) Beihang University(北京航空航天大学)

AI总结 UniComp通过信息唯一性驱动的框架,在有限计算资源下提升视频压缩的信息保真度,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03314 2026-03-05 cs.CL cs.AI cs.LG

Towards Self-Robust LLMs: Intrinsic Prompt Noise Resistance via CoIPO

迈向自适应鲁棒大语言模型:通过CoIPO实现内在提示噪声抵抗力

Xin Yang, Letian Li, Abudukelimu Wuerkaixi, Xuxin Cheng, Cao Liu, Ke Zeng, Xunliang Cai, Wenyuan Jiang

机构 * Zhejiang University(浙江大学) Tsinghua University(清华大学) Meituan LongCat Interaction Team(美团LongCat交互团队) ETH Zürich(苏黎世联邦理工学院)

AI总结 本文提出CoIPO方法,通过对比学习提升大语言模型对提示噪声的内在鲁棒性,实验表明其在NoisyPromptBench上表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02908 2026-03-04 cs.AI

SAE as a Crystal Ball: Interpretable Features Predict Cross-domain Transferability of LLMs without Training

SAE作为水晶球:可解释特征预测LLM在跨领域迁移性无需训练

Qi Zhang, Yifei Wang, Xiaohan Wang, Jiajun Chai, Guojun Yin, Wei Lin, Yisen Wang

机构 * State Key Lab of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(通用人工智能国家重点实验室,智能科学与技术学院,北京大学) Meituan(美团) Amazon AGI SF Lab(亚马逊人工智能SF实验室) Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学)

AI总结 本文提出基于SAE的迁移性评分(STS),通过识别模型偏移维度预测LLM在跨领域迁移性,无需训练即可评估迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01966 2026-03-03 cs.CL cs.AI

AMemGym: Interactive Memory Benchmarking for Assistants in Long-Horizon Conversations

AMemGym:用于长时对话中助手的交互式记忆基准测试

Cheng Jiayang, Dongyu Ru, Lin Qiu, Yiyang Li, Xuezhi Cao, Yangqiu Song, Xunliang Cai

机构 * The Hong Kong University of Science and Technology(香港科技大学) Meituan(美团)

AI总结 AMemGym通过交互式环境实现长时对话中助手的内存管理优化,揭示现有内存系统性能差距并推动策略自我进化。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23040 2026-03-03 cs.CL cs.AI

Look Back to Reason Forward: Revisitable Memory for Long-Context LLM Agents

回望以推导前行:用于长上下文LLM代理的可回溯记忆

Yaorui Shi, Yuxin Chen, Siyuan Wang, Sihang Li, Hengxing Cai, Qi Gu, Xiang Wang, An Zhang

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) DP Technology(DP科技) Meituan(美团)

AI总结 ReMemR1通过整合记忆检索机制和多级奖励设计,提升长上下文问答任务的推理能力与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08427 2026-03-03 cs.CL cs.LG

Silence the Judge: Reinforcement Learning with Self-Verifier via Latent Geometric Clustering

沉默法官:通过潜在几何聚类的自我验证强化学习

Nonghai Zhang, Weitao Ma, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Jingwen Xu

机构 * Meituan(美团) Peking University(北京大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出Latent-GRPO框架,通过潜在空间几何聚类生成内在奖励,提升大语言模型推理性能并加速训练过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23739 2026-03-02 cs.CV

U-Mind: A Unified Framework for Real-Time Multimodal Interaction with Audiovisual Generation

U-Mind:一种实时光学交互的统一框架

Xiang Deng, Feng Gao, Yong Zhang, Youxin Pang, Xu Xiaoming, Zhuoliang Kang, Xiaoming Wei, Yebin Liu

机构 * Tsinghua University(清华大学) Meituan(美团)

AI总结 U-Mind 提出了一种统一框架,通过实时生成和多模态联合建模,实现高效且连贯的多模态交互,推动智能对话代理的发展。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏