arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-26 至 2026-05-26 共收录 663 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 35 篇

2605.25846 2026-05-26 cs.CL 57%

On the Limits of Model Merging for Multilinguality in Pre-Training

论预训练中模型合并对多语言能力的限制

Seth Aycock, Fedor Vitiugin, Aleksandr Umnov, Christof Monz, Khalil Sima'an

机构 * University of Amsterdam(阿姆斯特丹大学) University of Turku(图尔库大学)

专题命中 预训练与数据 :post-training(abstract);分类 cs.CL

AI总结 通过控制实验比较混合预训练、模型合并和单语预训练,发现合并单语模型会导致性能崩溃,表明表示相似性是模型合并的前提。

Comments MeLLM Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24718 2026-05-26 cs.CL 57%

The Tokenizer Tax Across 25 European Languages: Domain Invariance, Cross-Lingual Few-Shot Effects, and the Ukrainian Penalty

25种欧洲语言的Tokenizer税:领域不变性、跨语言少样本效应与乌克兰语惩罚

Volodymyr Ovcharov

机构 * LEX AI Platform(LEX AI平台) legal.org.ua Kyiv, Ukraine(基辅,乌克兰)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.CL

AI总结 研究测量了10个基础模型在25种欧洲语言上的tokenizer生育率,揭示了从英语到其他语言的成本差异,并发现乌克兰语因预训练数据不足而支付额外成本。

Comments 16 pages, 3 figures, 8 tables. Dataset: https://huggingface.co/datasets/overthelex/tokenizer-fertility-map

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24451 2026-05-26 cs.CL 57%

Phonetic Modeling of Dialectal Variation in Vietnamese Speech

越南语音中方言变体的语音建模

Quan Ngoc Hoang, Long Hoang Huu Nguyen, Nghia Hieu Nguyen, Kiet Van Nguyen, Ngan Luu-Thuy Nguyen

机构 * Faculty of Computer Science(计算机科学系) Faculty of Information Science and Engineering(信息科学与工程系) University of Information Technology(信息技术大学) Vietnam National University, Ho Chi Minh city(越南国家大学,胡志明市)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL

AI总结 提出一种方言感知的语音框架,通过结构化语音成分和方言特定IPA映射,在词汇和解码层面显式建模越南语方言变体,在UIT-ViMD数据集上以更少参数和无外部预训练达到与最强预训练模型相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11815 2026-05-26 cs.CY 50%

Video Deepfake Abuse: How Company Choices Predictably Shape Misuse Patterns

视频深度伪造滥用:公司选择如何可预测地塑造滥用模式

Max Kamachee, Stephen Casper, Michelle L. Ding, Rui-Jie Yew, Anka Reuel, Stella Biderman, Dylan Hadfield-Menell

专题命中 预训练与数据 :post-training(abstract)

AI总结 本文通过分析2025年视频生成模型,指出少数开放权重的模型成为生成逼真AIG-NCII视频的主要工具,并论证开发者与分发平台的责任,强调风险管理可显著影响未来滥用难度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24065 2026-05-26 cs.CV 50%

fMRI-Diffusion: Generating fMRI Time Series Via a Temporal Transformer Diffusion Model for Major Depressive Disorder Diagnosis

fMRI-Diffusion: 用于重度抑郁症诊断的基于时间Transformer扩散模型的fMRI时间序列生成

Muhammad Asif Hasan, Yanming Zhu, Xuefei Yin, Alan Wee-Chung Liew

机构 * School of Information and Communication Technology, Griffith University(信息与通信技术学院,格里菲斯大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出fMRI-Diffusion框架,通过时间Transformer扩散模型合成ROI级fMRI时间序列而非功能连接矩阵,以保留时间信息并提升小样本下MDD诊断准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 59 篇

2403.04780 2026-05-26 cs.CL cs.AI 94%

Graph-oriented Instruction Tuning of Large Language Models for Generic Graph Mining

面向通用图挖掘的大语言模型图导向指令微调

Yanchao Tan, Hang Lv, Pengxiang Zhan, Shiping Wang, Carl Yang

机构 * Engineering Research Center of Big Data Intelligence, Ministry of Education(教育部大数据智能工程研究中心) Fujian Key Laboratory of Network Computing and Intelligent Information Processing(福建省网络计算与智能信息处理重点实验室) College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院) Department of Computer Science, Emory University(埃默里大学计算机科学系)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 提出MuseGraph框架,通过紧凑图描述、基于思维链的指令生成和图感知指令微调,将GNN与LLM结合,实现跨任务和数据集的高效图挖掘。

Comments Accepted by TPAMI 2025

Journal ref IEEE Trans. Pattern Anal. Mach. Intell., vol. 48, no. 1, pp. 155-169, Jan. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08213 2026-05-26 cs.CV cs.AI 92%

EditCaption: Human-Refined SFT and HAE-DPO for Image Editing Instruction Synthesis

EditCaption: 用于图像编辑指令合成的人工精炼SFT与HAE-DPO

Xiangyuan Wang, Honghao Cai, Yunhao Bai, Chao Hui, Tianze Zhou, Haohua Chen, Hao Shi, Yuling Wu, Yao Hu, Xu Tang, Yibo Chen, Wei Zhu

机构 * Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学) Beihang University(北京航空航天大学) Xiaohongshu Inc.(小红书公司)

专题命中 指令微调 :SFT(title,title_cn);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 提出EditCaption两阶段后训练流程,通过人工精炼SFT和基于难度自适应错误感知DPO(HAE-DPO)提升图像编辑指令合成质量,显著降低关键错误率并超越现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22925 2026-05-26 cs.IR cs.AI cs.LG 91%

BEAR: Towards Beam-Search-Aware Optimization for Recommendation with Large Language Models

BEAR:面向大语言模型推荐中束搜索感知的优化

Weiqin Yang, Bohao Wang, Zhenxiang Xu, Jiawei Chen, Shengjia Zhang, Jingbang Chen, Canghong Jin, Can Wang

机构 * Zhejiang University(浙江大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Hangzhou City University(杭州市城市大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn);LLM(abstract_cn)

AI总结 针对监督微调与束搜索推理之间的不一致性,提出BEAR正则化方法,通过确保正例每个token在解码步骤中排名前B来避免过早剪枝,显著提升推荐性能。

Comments Accepted by SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24375 2026-05-26 cs.AI 91%

Distilling Game Code World Model Generation into Lightweight Large Language Models

将游戏代码世界模型生成蒸馏到轻量级大型语言模型

Tyrone Serapio, Arjun Prakash, Haoyang Xu, Kevin Wang, Amy Greenwald

机构 * Brown University(布朗大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn);post-training(abstract)

AI总结 研究通过后训练将游戏代码世界模型生成能力蒸馏到小型模型,采用监督微调和带可验证奖励的强化学习提升生成代码的语法正确性和规则遵循性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24675 2026-05-26 cs.CV cs.AI 90%

VaaWIT: Visual-Aware Adaptation of Large Language Models for Multilingual Web Image Translation

VaaWIT: 面向多语言网页图像翻译的大语言模型视觉感知适配

Bo Li, Ronghao Chen, Ningyuan Deng, Huacan Wang, Shaolin Zhu, Lijie Wen

机构 * The Hong Kong University of Science(香港科技大学) Tianjin University(天津大学) Tsinghua University(清华大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对网页图像翻译中视觉表示差距问题,提出VaaWIT框架,通过双流注意力模块和视觉感知适配器,实现大语言模型对细粒度视觉特征的动态融合,在多个基准上超越开源模型并接近闭源模型性能。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12906 2026-05-26 cs.LG cs.AI 90%

Data Difficulty and the Generalization--Extrapolation Tradeoff in LLM Fine-Tuning

数据难度与LLM微调中的泛化-外推权衡

Siyuan Liu, Tinghong Chen, Xinghan Li, Yifei Wang, Jingzhao Zhang

机构 * IIIS, Tsinghua University(清华大学人工智能学院) College of AI, Tsinghua University(清华大学人工智能学院) Shanghai Qi Zhi Institute(上海启智研究院) Amazon AGI SF Lab(亚马逊AGI旧金山实验室)

专题命中 指令微调 :LLM(title,title_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文通过实证和理论分析,研究了监督微调中数据难度对模型行为的影响,发现数据难度与数据量共同决定泛化与外推之间的权衡,并存在最优难度随数据量增加而向更难数据偏移的规律。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09270 2026-05-26 cs.LG cs.AI 90%

Memorize Theorems, Not Instances: Probing SFT Generalization through Mathematical Reasoning

记忆定理而非实例:通过数学推理探究SFT泛化

Ruiying Peng, Mengyu Yang, Jing Lei, Xiaohui Li, Xueyu Wu, Xinlei Chen

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Huawei Technologies(华为技术)

专题命中 指令微调 :SFT(title,title_cn);分类 cs.AI、cs.LG

AI总结 针对监督微调(SFT)损害推理泛化的问题,提出Theorem-SFT方法,通过显式定理应用训练,在多个基准上取得显著提升,并揭示前馈层是推理规则的主要存储位置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24743 2026-05-26 cs.LG cs.AI 90%

Bilevel Optimization of Synthetic Trajectories for Multi-Turn LLM Fine-Tuning

用于多轮LLM微调的合成轨迹的双层优化

Shresth Verma, Mauricio Tec, Cheol Woo Kim, Kai Wang, Milind Tambe

机构 * Harvard University(哈佛大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出BOOST双层优化框架,通过内层加权训练和外层轻量级重加权头学习,解决合成轨迹质量异质性导致的LLM多轮交互性能下降问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24052 2026-05-26 cs.LG cs.AI 90%

Truthful Online Preference Aggregation for LLM Fine-Tuning in Mobile Crowdsourcing

移动众包中用于LLM微调的诚实在线偏好聚合

Shugang Hao, Lingjie Duan

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对移动众包中工人可能策略性谎报偏好反馈的问题,提出一种动态贝叶斯博弈模型和在线加权聚合机制,确保工人诚实反馈并实现次线性遗憾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24550 2026-05-26 cs.AI cs.CL cs.LG 89%

Jailbreak to Protect: Buffering and Reinforcing via Temporary Jailbreaking for Safe Fine-Tuning in Large Language Models

越狱以保护:通过临时越狱进行缓冲和强化以实现大型语言模型的安全微调

Seokil Ham, Jaehyuk Jang, Wonjun Lee, Changick Kim

机构 * School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院电子工程学院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对微调即服务中安全对齐被有害微调攻击削弱的问题,提出一种基于梯度分析的缓冲与强化框架,通过临时越狱适配器减少有害更新并利用QR分解合并强化安全,实现无需额外安全数据的高效防御。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23969 2026-05-26 cs.CL 89%

SLAP: Stratified Loss-based Pruning for On-Policy Data-Efficient Instruction Tuning

SLAP: 基于分层损失剪枝的在线策略数据高效指令微调

Run Zou, Jianhang Ding, Yifan Ding, Wen Wu, Hao Chen, Renshu Gu

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团) Hangzhou Lingju Intelligence AI Lab(杭州灵居智能AI实验室) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 指令微调 :instruction tuning(title,abstract);LLM(summary_cn);large language model(abstract);language model(abstract)

AI总结 提出SLAP框架,通过分布感知分层采样和相对距离优化实现批次级数据选择,在减少20-40%训练数据的同时保持或提升LLM性能。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26111 2026-05-26 cs.CV cs.AI cs.GR cs.LG cs.MM 88%

Squeezing Capacity from Multimodal Large Language Models for Subject-driven Generation

从多模态大语言模型中榨取能力用于主题驱动生成

Shuhong Zheng, Aashish Kumar Misraa, Yu-Teng Li, Yu-Jhe Li, Igor Gilitschenski

机构 * University of Toronto & Vector Institute(多伦多大学及向量研究所) Adobe(Adobe公司) Google(谷歌公司)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一种结合多模态大语言模型和VAE身份条件的方法,通过双层级聚合模块和多阶段去噪策略,在主题驱动图像生成中实现多模态理解与身份保持的平衡,优于现有方法。

Comments 33 pages, 18 figures, Project Page: https://zsh2000.github.io/squeeze-mllm-subject-gen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12474 2026-05-26 cs.CL cs.AI 88%

Integrating Structural and Semantic Signals in Text-Attributed Graphs with BiGTex

在文本属性图中整合结构信号与语义信号:BiGTex

Azadeh Beiranvand, Seyed Mehdi Vahidipour

机构 * Faculty of Electrical and Computer Engineering, University of Kashan(卡尚大学电气与计算机工程学院)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出BiGTex架构,通过堆叠图-文本融合单元实现GNN与LLM的双向注意力,以参数高效微调(LoRA)在节点分类和链接预测任务上达到最优性能。

Comments 26 pages, 4 figures

Journal ref Machine Learning with Applications 24 (2026) 100921

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09199 2026-05-26 cs.LG cs.AI cs.DC 88%

FLoRIST: Singular Value Thresholding for Efficient and Accurate Federated Fine-Tuning of Large Language Models

FLoRIST: 用于高效准确的大语言模型联邦微调的奇异值阈值化方法

Hariharan Ramesh, Jyotikrishna Dass

机构 * Anonymous Institution, Anonymous City, Anonymous Region, Anonymous Country(匿名机构,匿名城市,匿名地区,匿名国家)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出FLoRIST框架,通过奇异值阈值化在紧凑中间空间中对局部适配器进行分解,实现数学上准确的聚合,同时保持通信和计算高效。

Comments 21 pages, 12 figures

Journal ref Ninth Conference on Machine Learning and Systems (MLSys 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24549 2026-05-26 cs.AI 88%

PALoRA: Projection-Adaptive LoRA for Preserving Reasoning in Large Language Models

PALoRA: 投影自适应LoRA以保持大型语言模型的推理能力

Mustafa Hayri Bilgin, Mariam Barry, Albert Bifet, Azzedine Idir Ait Said, Soumya Banerjee

机构 * IT Group, Research, BNP Paribas(BNP巴黎研究院IT部门) LTCI, Télécom Paris, Institut Polytechnique de Paris(巴黎理工大学LTCI研究所) AI Institute, University of Waikato(瓦卡托大学人工智能研究所) Independent Researcher(独立研究员)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出PALoRA框架,通过奇异值微调(SVF)识别推理关键成分,并在正交约束下使用LoRA注入知识,以在保持推理能力的同时高效更新事实知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02605 2026-05-26 cs.NE cs.AI cs.CL q-bio.NC 88%

Fine-Tuning Language Models to Know What They Know

微调语言模型使其了解自身所知

Sangjun Park, Elliot Meyerson, Xin Qiu, Risto Miikkulainen

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Cognizant AI Lab(认知人工智能实验室)

专题命中 指令微调 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种框架,通过进化策略对齐方法(ESMA)在控制偏差的同时提升大语言模型的元认知能力,并在未见数据集、语言和新知识上展现出鲁棒泛化性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25399 2026-05-26 cs.AI 87%

Towards end-to-end LLM-based censoring-aware survival analysis

面向端到端基于大语言模型的删失感知生存分析

Yishu Wei, Hexin Dong, Yi Lin, Jiahe Qian, Yi Liu, Yifan Peng

机构 * Department of Population Health Science, Weill Cornell Medicine(人口健康科学系,韦尔·科恩医学中心) Weill Cornell Medicine(韦尔·科恩医学中心)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出LLMSurvival框架,通过成对排序重制定时间事件预测,实现删失感知的生存分析,在ICU死亡率和骨折风险预测中优于Cox比例风险模型和三种深度学习模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26110 2026-05-26 cs.LG cs.CL cs.CV 86%

Prism: A Plug-in Reproducible Infrastructure for Scalable Multimodal Continual Instruction Tuning

Prism:面向可扩展多模态持续指令微调的插件式可复现基础设施

Jun-Tao Tang, Yu-Cheng Shi, Zhen-Hao Xie, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对多模态持续指令微调中工程瓶颈问题,提出Prism插件式代码库,通过轻量级插件注册机制分离算法开发与骨干实现,支持大规模训练流水线,实现可复现、可扩展的实验。

Comments Code is available at https://github.com/LAMDA-CL/Prism

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23454 2026-05-26 cs.CL 85%

ARES: Automated Rubric Synthesis for Scalable LLM Reinforcement Learning

ARES: 面向可扩展大语言模型强化学习的自动评分标准合成

Xiaoyuan Li, Keqin Bao, Moxin Li, Yubo Ma, Yichang Zhang, Wenjie Wang, Fuli Feng, Dayiheng Liu

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) National University of Singapore(新加坡国立大学)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出ARES框架,从原始预训练文档自动生成问答对和实例级加权评分标准,用于可扩展的基于评分标准的强化学习,在多个开放任务上超越持续预训练、监督微调和二元奖励强化学习。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24834 2026-05-26 cs.CR cs.AI 85%

Reflect-Guard: Enhancing LLM Safeguards against Adversarial Prompts via Logical Self-Reflection

Reflect-Guard: 通过逻辑自我反思增强大语言模型对对抗性提示的防护

Lixing Lin, Juli You, Yue Li, Luyun Lin, Yiqing Wang, Zhen Zhang, Moxuan Zheng

机构 * Yale University(耶鲁大学) Columbia University(哥伦比亚大学) Citigroup(摩根大通) Independent Researcher(独立研究者)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Reflect-Guard方法,通过参数高效微调为大语言模型安全分类器注入链式思维自我反思能力,显著提升对对抗性越狱攻击的检测性能。

Comments 12 pages, 2 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11758 2026-05-26 cs.CV cs.AI cs.GR cs.RO 84%

Generalizable Vision-Language Few-Shot Adaptation with Predictive Prompts and Negative Learning

具有预测性提示和负学习的可泛化视觉语言少样本适应

Sriram Mandalika

机构 * Hasso Plattner Institute, University of Potsdam(霍普夫纳研究所,波茨坦大学)

专题命中 指令微调 :LLM(summary_cn,abstract);language model(abstract);分类 cs.AI

AI总结 提出SCAN框架,通过查询自适应负路由、LLM引导对比提示和自适应融合权重,解决视觉语言模型少样本适应中负类信号处理问题,在11个基准上平均提升4.61%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06505 2026-05-26 cs.LG cs.AI cs.CR 84%

PACZero: PAC-Private Fine-Tuning of Language Models via Sign Quantization

PACZero: 通过符号量化的语言模型PAC隐私微调

Murat Bilgehan Ertan, Xiaochen Zhu, Phuong Ha Nguyen, Marten van Dijk, Srinivas Devadas

机构 * CWI Amsterdam(阿姆斯特丹信息与计算科学研究所) MIT Cambridge(麻省理工学院) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 提出PACZero系列零阶机制,通过符号量化实现零互信息下的PAC隐私微调,在SST-2和SQuAD上取得竞争性结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25571 2026-05-26 cs.CV 83%

AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution

AnE: 通过锚点进化推动多模态大语言模型的推理前沿

Zehao Wang, Yihan Zeng, Zidong Gong, Yuanfan Guo, Feng Zhu, Hongzhi Zhang, Wei Zhang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Noah's Ark Lab(华为诺亚实验室) Independent Researcher(独立研究员)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出锚点进化(AnE)范式,通过真值锚点数据策展和脚手架剥离机制,解决多模态大模型推理中的认知漂移和幻觉路径问题,显著提升推理性能。

Comments 34 pages,10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26004 2026-05-26 cs.CV cs.CL 83%

MAGIC: Multimodal Alignment & Grounding-aware Instruction Coreset for Vision-Language Models

MAGIC: 面向视觉语言模型的多模态对齐与接地感知指令核心集

Shristi Das Biswas, Kaushik Roy

机构 * Purdue University(普渡大学)

专题命中 指令微调 :language model(title,abstract);instruction tuning(abstract);分类 cs.CL

AI总结 提出MAGIC方法,利用预训练VLM中的多模态增益、桥接相关性和技能神经元签名三种内在信号,通过无训练、前向传播的核心集选择,构建紧凑且行为保真的子集用于多模态指令微调,在20%预算下达到甚至超越全微调性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02979 2026-05-26 cs.CL cs.LG 82%

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning

CPMobius: 无数据强化学习的迭代式教练-玩家推理

Ran Li, Zeyuan Liu, Yinghao Chen, Bingxiang He, Jiarui Yuan, Zixuan Fu, Weize Chen, Jinyi Hu, Chen Qian, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出CPMobius协作式教练-玩家范式,通过无外部数据的合作优化循环提升数学推理能力,在Qwen2.5-Math-7B-Instruct上总体准确率提升4.9%,OOD准确率提升5.4%。

Comments Accepted to the ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏