arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Meituan(美团)

共收录 350
2605.17748 2026-05-19 cs.CV

Unleashing Vision Transformer Potential In Image Quality Assessment via Global-Local Adaptive Interaction

通过全局-局部自适应交互释放视觉Transformer在图像质量评估中的潜力

Yu Li, Puchao Zhou, Yachun Mi, Yanfeng Wu, Xiaoming Wang, Shaohui Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Meituan(美团)

AI总结 本文提出了一种全局-局部自适应交互框架,通过双流特征提取机制和交互式全局-局部融合,提升图像质量评估的预测精度和鲁棒性,同时减少可训练参数数量。

Journal ref Proceedings of the 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. [10567]-[10571], 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16416 2026-05-19 cs.CV cs.AI

SSL4RL: Revisiting Self-supervised Learning as Intrinsic Reward for Visual-Language Reasoning

SSL4RL:重新审视自监督学习作为视觉语言推理的内在奖励

Xiaojun Guo, Runyu Zhou, Yifei Wang, Qi Zhang, Chenheng Zhang, Stefanie Jegelka, Xiaohan Wang, Jiajun Chai, Guojun Yin, Wei Lin, Yisen Wang

机构 * Peking University(北京大学) MIT(麻省理工学院) TUM(技术大学(TUM)) Meituan(美团) Peking University School of CIT, MCML, MDSIEECS and CSAIL(北京大学计算机学院、MCML、MDSIEECS以及CSAIL)

AI总结 本文提出SSL4RL框架,利用自监督学习任务作为强化学习的可验证奖励,提升视觉语言推理性能,并通过实验验证其在多模态模型对齐中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14820 2026-05-19 cs.RO

A Visual Reinforcement Learning-Based Separate Primitive Policy for Peg-in-Hole Tasks

基于视觉强化学习的分步策略:用于铆钉入孔任务

Zichun Xu, Zhaomin Wang, Yuntao Li, Lei Zhuang, Zhiyuan Zhao, Guocai Yang, Jingdong Zhao

机构 * State Key Laboratory of Robotics and Systems, Harbin Institute of Technology(机器人系统国家重点实验室,哈尔滨工业大学) Ubtech Robotics(优必选科技) Meituan Academy of Robotics(美团机器人研究院) School of Mechanical Engineering, Shandong University(山东大学机械工程学院)

AI总结 本文提出S2P策略,通过视觉强化学习实现铆钉入孔任务中位置和插入动作的同步学习,提升了样本效率和成功率。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16143 2026-05-18 cs.AI cs.CL

Look Before You Leap: Autonomous Exploration for LLM Agents

先看再跳:面向LLM代理的自主探索

Ziang Ye, Wentao Shi, Yuxin Liu, Yu Wang, Zhengzhou Cai, Yaorui Shi, Qi Gu, Xunliang Cai, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Meituan(美团)

AI总结 本文提出自主探索能力,通过探索检查点覆盖率指标,改进LLM代理在陌生环境中的适应性,采用探索与执行交替训练策略,提升任务执行的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15905 2026-05-18 cs.IR cs.AI

Generative Long-term User Interest Modeling for Click-Through Rate Prediction

生成长期用户兴趣建模用于点击通过率预测

Jiangli Shao, Kaifu Zheng, Hao Fang, Huimu Ye, Zhiwei Liu, Bo Zhang, Shu Han, Xingxing Wang

机构 * MeiTuan Beijing China(美团北京中国)

AI总结 本文提出GenLI模型,通过生成兴趣模块、行为检索模块和兴趣融合模块,提升CTR预测的准确性和效率,解决传统方法中长期兴趣建模不完整和效率低的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02268 2026-05-18 cs.LG

SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization

SKILL0:基于上下文的代理强化学习用于技能内化

Zhengxi Lu, Zhiyuan Yao, Jinyang Wu, Chengcheng Han, Qi Gu, Xunliang Cai, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Meituan(美团) Tsinghua University(清华大学)

AI总结 SKILL0通过在训练时逐步减少技能上下文,使模型在无任务检索情况下实现自主行为,实验显示在多个任务中性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15155 2026-05-15 cs.LG cs.AI cs.CL

Self-Distilled Agentic Reinforcement Learning

自蒸馏代理强化学习

Zhengxi Lu, Zhiyuan Yao, Zhuowen Han, Zi-Han Wang, Jinyang Wu, Qi Gu, Xunliang Cai, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Meituan(美团) Tsinghua University(清华大学)

AI总结 本文提出SDAR方法,通过将OPSD作为辅助目标并保持RL为主优化,解决多轮代理中的稳定性问题,提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13641 2026-05-14 cs.LG cs.CL

Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization

多目标与混合奖励强化学习 via 奖励去相关策略优化

Yang Bai, Kaiyuan Liu, Ziyuan Zhuang, Jiahong Zhou, Rongxiang Weng, Xin Chen, Jingang Wang, Xunliang Cai

机构 * Meituan, China(美团,中国)

AI总结 本文提出RDPO方法,通过量化归一化和马氏白化处理,解决多任务和混合奖励环境中的奖励分布不均和相关性问题,提升模型在指令遵循和写作质量上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13083 2026-05-14 cs.RO

TouchAnything: A Dataset and Framework for Bimanual Tactile Estimation from Egocentric Video

TouchAnything: 一个用于从第一人称视频中估计双臂触觉的数据库和框架

Jianyi Zhou, Ziteng Gao, Feiyang Hong, Zirui Liu, Guannan Zhang, Weisheng Dai, Ruichen Zhen, Chuqiao Lyu, Haotian Wu, Yinian Mao, Xushi Wang, Yuxiang Jiang, Wenbo Ding, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳研究院) Meituan Academy of Robotics(美团机器人研究院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 本文提出EgoTouch数据库和TouchAnything框架,通过多视角视频数据提升双臂触觉估计性能,实验表明结合腕部视角可提升接触和体积IoU指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13037 2026-05-14 cs.AI

MAP: A Map-then-Act Paradigm for Long-Horizon Interactive Agent Reasoning

MAP:一种用于长周期交互代理推理的先映射再行动范式

Yuxin Liu, Ziang Ye, Yueqing Sun, Mingye Zhu, Jinwei Xiao, Zhuowen Han, Qi GU, Xunliang Cai, Lei Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Meituan(美团) Institution of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tianjin University(天津大学)

AI总结 本文提出MAP范式,通过先构建环境认知再执行任务,解决交互代理中环境感知延迟问题,实验显示在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06387 2026-05-14 cs.LG cs.AI

Asymmetric On-Policy Distillation: Bridging Exploitation and Imitation at the Token Level

非对称在线策略蒸馏:在令牌层面弥合利用与模仿

Nan Jia, Haojin Yang, Xing Ma, Jiesong Lian, Shuailiang Zhang, Weipeng Zhang, Ke Zeng, Xunliang Cai, Zequn Sun

机构 * Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Meituan(美团)

AI总结 本文提出非对称在线策略蒸馏,通过局部散度最小化改进传统策略蒸馏,提升数学推理任务表现,实现更稳定的策略熵和持续工具使用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06130 2026-05-13 cs.AI

Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning

技能1:通过强化学习实现技能增强代理的统一进化

Yaorui Shi, Yuxin Chen, Zhengxi Lu, Yuchun Miao, Shugui Liu, Qi GU, Xunliang Cai, Xiang Wang, An Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Meituan(美团) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) Wuhan University(武汉大学)

AI总结 本文提出Skill1框架,通过单一策略协同进化技能选择、利用与蒸馏,以共享任务目标优化技能库维护,实验表明其优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22663 2026-05-13 cs.CV

AIA: Rethinking Architecture Decoupling Strategy In Unified Multimodal Model

AIA: 重新思考统一多模态模型中的架构解耦策略

Dian Zheng, Manyuan Zhang, Hongyu Li, Kai Zou, Hongbo Liu, Ziyu Guo, Kaituo Feng, Yexin Liu, Ying Luo, Hongsheng Li

机构 * MMLab, CUHK(CUHK多媒体实验室) Meituan(美团) USTC(中国科学技术大学) TJU(天津大学)

AI总结 本文提出AIA损失函数,通过学习任务特定的多模态交互模式,缓解任务冲突而不依赖模型解耦,提升生成与理解性能。

Comments Project page: https://zhengdian1.github.io/AIA-project/ Code: https://github.com/zhengdian1/AIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10780 2026-05-13 cs.CV cs.AI

Beyond the Last Layer: Multi-Layer Representation Fusion for Visual Tokenization

超越最后一层:多层表示融合用于视觉标记化

Xuanyu Zhu, Yan Bai, Yang Shi, Yihang Lou, Yuanxing Zhang, Jing Jin, Yuan Zhou

机构 * Peking University(北京大学) Meituan Inc(美团公司) Tsinghua University(清华大学) IGDL

AI总结 本文提出DRoRAE,通过多层特征融合恢复丢失的视觉信息,提升图像生成质量,并揭示了表示丰富性与重建质量的log-linear关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10833 2026-05-12 cs.CV cs.AI

MMVIAD: Multi-view Multi-task Video Understanding for Industrial Anomaly Detection

MMVIAD:多视角多任务视频理解用于工业异常检测

Xiran Zhao, Jing Jin, Yan Bai, Zhongan Wang, Yifeng Sun, Yihang Lou, Xuanyu Zhu, Tao Feng, Yingna Wu

机构 * ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) Meituan Inc.(美团公司) Peking University(北京大学)

AI总结 本文提出MMVIAD,首个工业异常检测连续多视角视频数据集及多任务评估基准,通过两阶段训练流程提升模型泛化能力,在四个任务中取得优于GPT-5.4的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08911 2026-05-12 cs.CV

Unified Modeling of Lane and Lane Topology for Driving Scene Reasoning

车道与车道拓扑的统一建模用于驾驶场景推理

Han Li, Yulu Gao, Si Liu, Yuhang Wang, Bo Liu, Beipeng Mu

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) Hangzhou International Innovation Institute, Beihang University(杭州国际创新院,北京航空航天大学) Meituan, Beijing, China(美团,北京,中国)

AI总结 本文提出UniTopo方法,通过统一表示车道及其拓扑关系,实现车道位置和拓扑信息的联合感知,优于现有方法。

Comments Accepted by IEEE TCSVT

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19697 2026-05-11 cs.CV

Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks

揭示细粒度视觉痕迹:评估多模态交错推理链在多模态STEM任务中的表现

Jing Jin, Hao Liu, Yan Bai, Yihang Lou, Zhenke Wang, Tianrun Yuan, Juntong Chen, Yongkang Zhu, Fanhu Zeng, Xuanyu Zhu, Tao Feng, Yige Xu

机构 * Tsinghua University(清华大学) Meituan Inc(美团公司) Central South University(中南大学) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出StepSTEM基准,通过严格筛选的283个STEM问题,评估多模态大语言模型的跨模态推理能力,发现现有模型仍依赖文本推理,揭示了真实跨模态STEM推理的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06679 2026-05-11 cs.LG

Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding

打破幻觉:当积极与消极在多模态解码中相遇

Yubo Jiang, Yitong An, Xin Yang, Abudukelimu Wuerkaixi, Xuxin Cheng, Fengying Xie, Zhiguo Jiang, Cao Liu, Ke Zeng, Haopeng Zhang

机构 * School of Astronautics, Beihang University(北京航空航天大学航天学院) Longcat Interaction Team, Meituan(美团Longcat交互团队) Tianmushan Laboratory, Beihang University(北京航空航天大学天门山实验室)

AI总结 本文提出PND框架,通过在解码过程中引入正负对比路径,增强视觉真实性,无需重新训练即可在POPE、MME和CHAIR数据集上取得最佳性能。

Comments Accepted by CVPR 2026 (Conference on Computer Vision and Pattern Recognition). 11 pages, 5 figures. Code available at: https://github.com/JiangYubo4399/PND

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09782 2026-05-11 cs.LG cs.AI cs.CL

Flexible Entropy Control in RLVR with a Gradient-Preserving Perspective

在RLVR中采用梯度保持视角实现灵活熵控制

Kun Chen, Peng Shi, Fanfan Liu, Haibo Qiu, Zhixiong Zeng, Siqi Yang, Wenji Mao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Meituan(美团)

AI总结 本文从梯度保持裁剪角度出发,提出动态裁剪阈值机制和动态熵控制策略,有效缓解熵崩溃问题并提升多基准性能。

Comments https://github.com/Kwen-Chen/Flexible-Entropy-Control

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03043 2026-04-29 cs.CV

OneThinker: All-in-one Reasoning Model for Image and Video

OneThinker:面向图像和视频的统一推理模型

Kaituo Feng, Manyuan Zhang, Hongyu Li, Kaixuan Fan, Shuang Chen, Yilei Jiang, Dian Zheng, Peiwen Sun, Yiyuan Zhang, Haoze Sun, Yan Feng, Peng Pei, Xunliang Cai, Xiangyu Yue

机构 * MMLab, CUHK(CUHK多媒体实验室) Meituan Home(美团家)

AI总结 OneThinker提出一个统一的多模态推理模型,整合图像和视频理解,涵盖问答、描述生成、空间时间定位、跟踪和分割等任务,通过构建大规模训练语料和EMA-GRPO算法提升多任务强化学习效果。

Comments CVPR 2026, Project page: https://github.com/tulerfeng/OneThinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10718 2026-04-29 cs.LG cs.CL

SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining

SnapMLA: 通过硬件感知的FP8量化流水线实现高效的长上下文MLA解码

Yifan Zhang, Zunhai Su, Shuhao Hu, Rui Yang, Wei Wu, Yulei Qian, Yuchen Xie, Xunliang Cai

机构 * Meituan LongCat Team(美团LongCat团队) Tsinghua University(清华大学)

AI总结 SnapMLA通过硬件感知的FP8量化流水线优化,提升长上下文解码效率,实验显示在长输出解码任务中吞吐量提升达1.91倍,同时在推理和代码生成基准上与BF16基线表现相近。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22154 2026-04-29 cs.AI cs.CL

Exploring Reasoning Reward Model for Agents

探索用于智能体的推理奖励模型

Kaixuan Fan, Kaituo Feng, Manyuan Zhang, Tianshuo Peng, Zhixun Li, Yilei Jiang, Shuang Chen, Peng Pei, Xunliang Cai, Xiangyu Yue

机构 * MMLab, CUHK(CUHK 机器学习实验室) Meituan(美团) SEEM, CUHK(CUHK 系统工程与工程管理系)

AI总结 本文提出Agent-RRM模型,通过结构化反馈提升智能体推理能力,采用三种集成策略在12个基准测试中取得显著性能提升。

Comments ACL 2026 Findings, Project page: https://github.com/kxfan2002/Reagent

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24396 2026-04-28 cs.CV cs.AI

Global Context or Local Detail? Adaptive Visual Grounding for Hallucination Mitigation

全局上下文还是局部细节?面向幻觉缓解的自适应视觉 grounding

Yubo Jiang, Xin Yang, Abudukelimu Wuerkaixi, Zheming Yuan, Xuxin Cheng, Fengying Xie, Zhiguo Jiang, Cao Liu, Ke Zeng, Haopeng Zhang

机构 * School of Astronautics, Beihang University(北航航天学院) Longcat Interaction Team, Meituan(美团Longcat交互团队) Tianmushan Laboratory, Beihang University(北航天门山实验室)

AI总结 本文提出PND框架,通过双路径对比在解码过程中增强视觉真实性,减少幻觉并提升描述细节,无需模型微调。

Comments 9 pages, 8 figures, Findings of ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24029 2026-04-28 cs.CV cs.CL cs.IR cs.MM

DeepTaxon: An Interpretable Retrieval-Augmented Multimodal Framework for Unified Species Identification and Discovery

DeepTaxon: 一种可解释的检索增强多模态框架,用于统一的物种识别与发现

Jiawei Wang, Ming Lei, Yaning Yang, Xinyan Lin, Yuquan Le, Qiwei Ma, Zhiwei Xu, Zheqi Lv, Yuchen Ang, Zhe Quan, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Hunan University(湖南大学) Xiangtan University(湘潭大学) Hunan Normal University(湖南师范大学) Zhejiang University(浙江大学) Cornell University(康奈尔大学) Meituan(美团)

AI总结 DeepTaxon通过可解释的检索增强多模态框架,统一物种识别与发现,通过检索证据进行链式推理,提升识别和发现的准确性与可解释性。

Comments 13 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23318 2026-04-28 cs.CL cs.LG

Hidden States Know Where Reasoning Diverges: Credit Assignment via Span-Level Wasserstein Distance

隐藏状态知道推理分歧所在:通过跨度级瓦瑟斯坦距离进行信用分配

Xinzhu Chen, Wei He, Huichuan Fan, Wenzhe Niu, Zhongxiang Sun, Xuanru Wang, Jiuchong Gao, Jinghua Hao, Renqing He, Weijie Yu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Meituan(美团) Tianjin University(天津大学) Renmin University of China(中国人民大学) The University of Melbourne(墨尔本大学) University of International Business and Economics(国际经贸大学)

AI总结 本文提出SHEAR方法,利用跨度级瓦瑟斯坦距离提升信用分配精度,无需额外标注。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13847 2026-04-27 cs.LG cs.AI

SparseBalance: Load-Balanced Long Context Training with Dynamic Sparse Attention

SparseBalance: 基于动态稀疏注意力的负载平衡长上下文训练

Hongtao Xu, Jianchao Tan, Yuxuan Hu, Pengju Lu, Hongyu Wang, Pingwei Sun, Yerui Sun, Yuchen Xie, Xunliang Cai, Mingzhen Li, Weile Jia

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) Meituan(美团) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出SparseBalance算法系统协同设计框架,通过动态稀疏调整和稀疏感知批处理策略,解决长上下文训练中的负载不平衡问题,提升模型精度与系统效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21327 2026-04-24 cs.LG cs.AI cs.CL

Understanding and Mitigating Spurious Signal Amplification in Test-Time Reinforcement Learning for Math Reasoning

理解并缓解测试时间强化学习在数学推理中的虚假信号放大

Yongcan Yu, Lingxiao He, Jian Liang, Kuangpu Guo, Meng Wang, Qianlong Xie, Xingxing Wang, Ran He

机构 * NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所NLPR与MAIS实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Meituan(美团) University of Science and Technology of China(中国科学技术大学)

AI总结 本文研究了测试时间强化学习在数学推理中因标签噪声导致的虚假信号放大问题,提出DDRL框架通过频率采样、去偏优势估计和共识-off-policy优化来缓解该问题,实验表明其优于现有基线方法。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20261 2026-04-23 cs.AI

Memory-Augmented LLM-based Multi-Agent System for Automated Feature Generation on Tabular Data

基于记忆增强的LLM多智能体系统用于表格数据自动特征生成

Fengxian Dong, Zhi Zheng, Xiao Han, Wei Chen, Jingqing Ruan, Tong Xu, Yong Chen, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University of Technology(浙江工业大学) Meituan(美团)

AI总结 本文提出MALMAS系统,通过多智能体与记忆模块提升表格数据自动特征生成的效率与质量,实验验证其有效性。

Comments 16 pages (including appendix), 4 main figures, 15 tables. Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20755 2026-04-23 cs.AI cs.LG

V-tableR1: Process-Supervised Multimodal Table Reasoning with Critic-Guided Policy Optimization

V-tableR1:基于过程监督的多模态表格推理与批评引导的策略优化

Yubo Jiang, Yitong An, Xin Yang, Abudukelimu Wuerkaixi, Xuxin Cheng, Fengying Xie, Zhiguo Jiang, Cao Liu, Ke Zeng, Haopeng Zhang

机构 * School of Astronautics Beihang University(北航航天学院) Longcat Interaction Team Meituan(美团长猫交互团队) Tianmushan Laboratory Beihang University(北航天门实验室)

AI总结 V-tableR1通过过程监督强化学习框架,利用表格的确定性网格结构,提升多模态大语言模型的推理能力,通过批评引导策略优化方法,实现更严谨的逻辑推导,取得开放源代码模型在复杂表格基准上的最佳性能。

Comments 15 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16676 2026-04-23 cs.LG cs.CL

WISCA: A Lightweight Model Transition Method to Improve LLM Training via Weight Scaling

WISCA:一种轻量级模型转换方法,通过权重缩放提高LLM训练

Jiacheng Li, Jianchao Tan, Zhidong Yang, Pingwei Sun, Feiye Huo, Jiayu Qin, Xiangyu Zhang, Maoxin He, Yerui Sun, Yuchen Xie, Guangming Tan, Weile Jia, Xunliang Cai, Tong Zhao

机构 * Meituan, Beijing, China(美团,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科技大学,香港特别行政区,中国) Xiamen University, Xiamen, China(厦门大学,厦门,中国)

AI总结 WISCA通过优化神经网络权重模式提升LLM训练效率和模型质量,实验显示在GQA架构和LoRA微调任务中显著提升收敛质量。

Comments Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏