arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-25 至 2026-06-25 共收录 189 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 15 篇

2606.17945 2026-06-25 cs.AI 新提交 90%

Small Initialization Matters for Large Language Models

小初始化对大语言模型至关重要

Liangkai Hang, Junjie Yao, Zhiyu Li, Feiyu Xiong, Hongkang Yang, Zhi-Qin John Xu

机构 * School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学科学学院) Institute of Natural Sciences, Shanghai Jiao Tong University(上海交通大学自然科学研究院) MemTensor (Shanghai) Technology Co., Ltd.(上海记忆张量科技有限公司) Institute for Advanced Algorithms Research(先进算法研究所)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);pretraining(abstract)

AI总结 本文发现减小初始化尺度能持续改善大语言模型预训练,尤其在推理任务上提升显著,并揭示了小初始化驱动参数从低复杂度结构向丰富表示演化的机制。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26050 2026-06-25 cs.LG cond-mat.dis-nn cs.AI cs.CL 新提交 87%

Natural Ungrokking: Asymmetric Control of Which Rules Survive Pretraining

自然去突现:不对称控制哪些规则在预训练中幸存

Juliana Li, Diya Sreedhar

机构 * Harvard University(哈佛大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 发现语言模型在预训练中学习规则后会自动遗忘,规则存亡由训练数据中支持频率决定,且遗忘不可逆。

Comments Foundations of Deep Generative Models (FoGen) Workshop at ICML 2026. 23 pages (5-page main text plus appendices), 5 figures. Code: https://github.com/lijuliana/Natural-Ungrokking

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24998 2026-06-25 cs.LG cs.AI 新提交 84%

Internal Data Repetition Destroys Language Models

内部数据重复破坏语言模型

Jessica Chudnovsky, Joshua Kazdan, Noam Levi, Rylan Schaeffer, Yegor Denisov-Blanch, Bo He, Mehmet Donmez, Sanmi Koyejo, David Donoho

机构 * Stanford Computer Science(斯坦福大学计算机科学系) Stanford Statistics(斯坦福大学统计学系) Tel Aviv University(特拉维夫大学) IMC Trading

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究重复数据对语言模型的影响,通过无重复缩放定律量化计算等效损失,发现重复次数存在最坏点,且该点随模型规模呈幂律增长。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20673 2026-06-25 cs.LG cs.AI cs.CV 新提交 84%

NeuroShield: A Device-Agnostic Foundation Model for EEG Authentication

NeuroShield: 一种设备无关的EEG认证基础模型

Matin Fallahi, Patricia Arias-Cabarcos, Thorsten Strufe

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) Joint Research Centre, European Commission(欧盟委员会联合研究中心)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 针对EEG认证中模型因采集设备差异而难以复用的问题,提出NeuroShield基础模型,采用双阶段Transformer架构从变通道、变长度EEG中学习身份判别嵌入,在三个公开数据集预训练后,微调后等错误率降低0.44-8.06个百分点,并泛化至未见过的通道布局和更长信号段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26062 2026-06-25 cs.CL 新提交 81%

When Certainty Is an Artifact: Keyword Lexicon Blindness and the (Mis)Measurement of Rhetorical Stance

当确定性是人为产物:关键词词典盲点与修辞立场的(误)测量

Bo Chen

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 通过对比关键词词典与LLM零样本分类在85篇访谈(2016-2026)中的表现,发现关键词计数产生的显著负情绪-确定性共现模式是测量伪影,而LLM揭示出悲观话语实际吸引的是模糊化而非确定性。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25721 2026-06-25 cs.CR cs.CL cs.IR 新提交 81%

Tracing Target Answers in Poisoned Retrieval Corpora via Token Influence Attribution

通过令牌影响归因追踪中毒检索语料库中的目标答案

Yan-Lun Chen, Pin-Yu Chen, Chia-Mu Yu, Ying-Dar Lin, Yu-Sung Wu, Wei-Bin Lee

机构 * National Yang Ming Chiao Tung University(阳明交通大学) IBM Research(IBM研究院) Hon Hai Research Institute(宏海研究院)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出TRACE框架,通过令牌影响归因识别检索增强生成系统中的语料投毒攻击,无需额外分类器或LLM验证,在三个QA基准和六个LLM上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24897 2026-06-25 cs.DL cs.CL cs.IR 新提交 81%

Invisible to humans, visible to machines: a preregistered audit of Unicode fidelity across four biomedical bibliographic APIs

对人类不可见,对机器可见:四个生物医学文献API的Unicode保真度预注册审计

Przemysław Czuma

机构 * Przemysław Czuma(普拉姆斯拉夫·茨马)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过预注册审计,评估四个生物医学API(PubMed、Crossref、OpenAlex、Semantic Scholar)返回摘要的Unicode保真度,发现PubMed和OpenAlex存在系统性字符丢失,影响文献计量和语料构建。

Comments 14 pages, 1 figure. Pre-registered on OSF. Data and code available on Zenodo and GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26021 2026-06-25 cs.CR cs.AI 新提交 79%

Privacy Vulnerabilities of Attention Layers in Tabular Foundation Models and Protection of High-Risk Queries

表格基础模型中注意力层的隐私漏洞及高风险查询的保护

Tânia Carvalho, Maxime Cordy

机构 * SnT, University of Luxembourg(卢森堡大学SnT研究所)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI

AI总结 本文发现表格基础模型的注意力机制会泄露成员信息,提出无影子模型的AMIA攻击,并基于k-匿名原理设计推理时防御,降低成员泄露风险。

Comments 18 pages, 12 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25935 2026-06-25 cs.CL cs.AI 新提交 73%

Overview of HIPE-2026: Person-Place Relation Extraction from Multilingual Historical Texts

HIPE-2026 概述:从多语言历史文本中提取人物-地点关系

Juri Opitz, Maud Ehrmann, Corina Raclé, Andrianos Michail, Matteo Romanello, Simon Clematide

机构 * University of Zurich(苏黎世大学) École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) Swiss Federal Institute of Technology Zurich (ETHZ)(苏黎世联邦理工学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出HIPE-2026评测任务,针对多语言历史文档中的人物-地点关系(at和isAt)进行提取,采用三方面评估框架,比较了多种方法在准确性、效率和跨域泛化上的表现。

Comments Condensed Overview of CLEF-HIPE-2026 Shared Task Results

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25010 2026-06-25 cs.LG cs.CL 新提交 73%

Emergent Capabilities Arise Randomly from Learning Sparse Attention Patterns

涌现能力随机地从学习稀疏注意力模式中产生

Vatsal Baherwani, Zixi Chen, Shikai Qiu, Andrew Gordon Wilson, Pavel Izmailov

机构 * New York University(纽约大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究发现,transformer模型的下游能力(如上下文学习)在训练过程中随机涌现,较大模型平均更早获得,且涌现对应于任务相关注意力模式的突然学习。

Comments 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25008 2026-06-25 cs.LG cs.CL 新提交 73%

Neural Scaling Universality: If Exponents Are Fixed, Time to Understand Coefficients

神经缩放普适性:如果指数固定,是时候理解系数了

Yizhou Liu, Jeff Gore

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文论证神经缩放定律中的幂律指数由通用机制固定,而系数对数据和架构细节敏感,理解系数是近期性能提升的关键。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25546 2026-06-25 cs.CV 新提交 71%

Disease-Centric Vision-Language Pretraining with Hybrid Visual Encoding for 3D Computed Tomography

面向3D计算机断层扫描的疾病中心视觉语言预训练与混合视觉编码

Bowen Shi, Weiwei Cao, Ruifeng Yuan, Wanxing Chang, Wenrui Dai, Hongkai Xiong, Ling Zhang, Jianpeng Zhang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab, 310023, Hangzhou, China(虎扑实验室,杭州,中国) Shanghai Jiao Tong University, China(上海交通大学,中国) Zhejiang University, China(浙江大学,中国) Fudan University, China(复旦大学,中国)

专题命中 预训练与数据 :pretraining(title)

AI总结 提出一种结合CNN-ViT混合编码器、疾病级对比学习和诊断感知提示的视觉语言预训练框架,在CT-RATE和Rad-ChestCT上取得最优性能,并提升零样本诊断可靠性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25253 2026-06-25 cs.CL cs.DL cs.IR 新提交 57%

Automatic Generation of Highlights for Academic Paper Via Prompt-based Learning

基于提示学习的学术论文亮点自动生成

Yi Xiang, Chengzhi Zhang, Heng Zhang

机构 * Department of Information Management, Nanjing University of Science and Technology(南京理工大学信息管理学院)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 研究利用提示学习自动生成学术论文亮点,设计特定提示模板结合摘要输入,评估GPT-2、T5及ChatGPT等模型,在三个数据集上达到甚至超越监督方法性能,且对提示设计敏感。

Journal ref Library Hi Tech, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24962 2026-06-25 cs.LG 新提交 57%

Towards Scalable Multi-Task Reinforcement Learning with Large Decision Models

迈向可扩展的多任务强化学习与大决策模型

Thibaut Kulak

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 提出LDM-v0,一个在大规模异构强化学习环境上离线预训练的Transformer策略,通过监督下一动作预测实现多任务学习,在约1000个环境中达到与独立训练策略相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09457 2026-06-25 cs.RO 新提交 50%

$ω$-EVA: Envision, Verify, and Act with Latent Interactive World Models

$ω$-EVA:基于潜在交互世界模型的构想、验证与行动

Zhenguo Sun, Yu Sun, Hande Huang, Alois Knoll

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出$ω$-EVA框架,通过潜在交互世界模型实现“构想-验证-行动”循环,利用动作条件潜在动力学和语言条件流策略生成动作,无需生成未来视频,在多种机器人操作任务中提升策略性能。

Comments Add some ablation experiments

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 13 篇

2606.26027 2026-06-25 cs.CL cs.LG 新提交 91%

Why Multi-Step Tool-Use Reinforcement Learning Collapses and How Supervisory Signals Fix It

为什么多步工具使用强化学习会崩溃以及监督信号如何修复它

Yupu Hao, Zhuoran Jin, Huanxuan Liao, Kang Liu, Jun Zhao

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究发现RL训练LLM工具使用时会出现控制token概率尖峰导致性能崩溃,而交错SFT与RL可提升稳定性,但OOD评估下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25987 2026-06-25 cs.CL cs.AI cs.LG 新提交 86%

Weave of Formal Thought

形式思维之织

Alexandre Bouayad

专题命中 指令微调 :SFT(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出WoFT框架,结合完整语法约束解码与潜在变量微调,使语言模型生成语法有效代码并学习结构表示,在Python上降低14.3%交叉熵。

Comments Code is available at https://github.com/alexbouayad/formal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25865 2026-06-25 q-bio.BM 新提交 85%

Molexar: A Unified Multimodal Molecular Foundation Model for Drug Design

Molexar:用于药物设计的统一多模态分子基础模型

Haoyu Lin, Yiyan Liao, Jinmei Pan, Xinliao Ling, Luhua Lai, Jianfeng Pei

专题命中 指令微调 :foundation model(title,abstract);SFT(abstract,abstract_cn)

AI总结 提出Molexar,一种基于Fragment-SELFIES的统一多模态分子基础模型,通过自回归解码和条件注入实现高效分子生成,在多个任务上达到或超越更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24196 2026-06-25 cs.AI 新提交 84%

Navigating User Behavior toward Personalized Multimodal Generation

导航用户行为以实现个性化多模态生成

Hengji Zhou, Yufeng Liu, Ye Liu, Yong Xu, Lianghao Xia, Liqiang Nie

机构 * South China University of Technology(华南理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 指令微调 :SFT(summary_cn,abstract);pretraining(abstract);分类 cs.AI

AI总结 提出NaviGen,通过双标识符编码用户行为并采用两阶段SFT+RL训练,将交互历史转化为可执行指令,提升个性化图像和视频生成质量。

Comments 16 pages, 15 figures, 5 tables. Code is available at https://github.com/iLearn-Lab/NaviGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25331 2026-06-25 cs.CL cs.AI cs.LG 新提交 83%

Improved Large Language Diffusion Models

改进的大规模语言扩散模型

Shen Nie, Qiyang Min, Shaoxuan Xu, Zihao Huang, Yuxuan Song, Yong Shan, Yankai Lin, Wayne Xin Zhao, Chongxuan Li, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京市大模型与智能治理重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(教育部新一代智能搜索与推荐工程研究中心) ByteDance Seed(字节跳动Seed)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出iLLaDA,一种8B参数的全双向注意力掩码扩散语言模型,从零训练至12T tokens,在通用、数学和代码基准上显著优于LLaDA,并可与Qwen2.5 7B竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24993 2026-06-25 cs.LG 新提交 81%

The Geometry of Sequential Learning: Lie-Bracket Prediction of Transfer Order

序列学习的几何:李括号预测迁移顺序

John Sweeney

机构 * Sideplane AI

专题命中 指令微调 :SFT(abstract,abstract_cn);LLM(abstract_cn);pretraining(abstract);分类 cs.LG

AI总结 提出李括号对偶性分数预测序列学习中的源域顺序,通过李括号锦标赛实现O(N log N)排序,在指令微调和DPO中达到高准确率。

Comments Accepted to ICML 2026. 20 pages, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24985 2026-06-25 cs.LG cs.AI 新提交 81%

Retrieval-Augmented Personalization with Foundation Models for Wearable Stress Detection

基于检索增强个性化与基础模型的可穿戴压力检测

Louis Simon, Mohamed Chetouani

机构 * Institut des Systèmes Intelligents et de Robotique(智能系统与机器人研究所) Sorbonne University(索邦大学)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 针对可穿戴压力检测中个体差异大的问题,提出基于检索增强的轻量级个性化方法,利用冻结的基础模型从用户历史中检索相似模式生成紧凑嵌入,在WESAD数据集上准确率提升3.92%,宏F1提升4.76%,接近监督微调性能且无需标签数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25821 2026-06-25 cs.CL cs.AI 新提交 73%

SARA: Unlocking Multilingual Knowledge in Mixture-of-Experts via Semantically Anchored Routing Alignment

SARA: 通过语义锚定路由对齐解锁混合专家模型中的多语言知识

Tianyu Dong, Yangyang Liu, Jiang Zhou, Xinwei Wu, Xiaohu Zhao, Hao Wang, Heng Liu, Linlong Xu, Longyue Wang, Weihua Luo, Shaolin Zhu, Deyi Xiong

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University, China(天津大学计算机科学与技术学院TJUNLP实验室) Alibaba Group, China(阿里巴巴集团)

专题命中 指令微调 :LLM(abstract_cn);instruction tuning(abstract);分类 cs.CL、cs.AI

AI总结 针对低资源语言在稀疏MoE架构中路由不一致的问题,提出SARA框架,利用对称JS散度约束对齐多语言输入与高资源语义锚点的路由分布,提升低资源语言性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25700 2026-06-25 cs.LG cs.RO 新提交 70%

Memory-Efficient Policy Libraries with Low-Rank Adaptation in Reinforcement Learning

基于低秩适配的强化学习内存高效策略库

Samuel Valland Lyngset, Tor Viljen Raanaas, Gard Sveipe, Eirik Møller Nilsen, Jim Torresen, Kai Olav Ellefsen, Tobias Lømo

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究将参数高效微调方法(如LoRA)迁移至机器人强化学习,通过PPO算法微调基线模型构建多任务策略库,实现内存占用降低20-160倍,存储节省90-95%,且成功率无显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24963 2026-06-25 cs.CV cs.LG 新提交 70%

Curvature-Guided Mixing for MLLM Adaptation

曲率引导混合用于MLLM适配

Jinglong Yang, Jiaxuan He, Wenjian Huang, Zhan Zhuang, Jianguo Zhang

机构 * Research Institute of Trustworthy Autonomous Systems and Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学可信自主系统研究院与计算机科学与工程系) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出曲率引导混合(CGM)框架,通过二阶Hessian近似推导最优软混合比,以及硬混合变体CGM†,在LLaVA-1.5和Qwen2.5VL上改善任务专化与通用知识保持的权衡。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24947 2026-06-25 cs.LG cs.SY eess.SY 新提交 70%

Supervised Reinforcement Learning for the Coordination of Distributed Energy Resources

分布式能源协调的监督强化学习

Haoyuan Deng, Yihong Zhou, Thomas Morstyn, Yi Wang

机构 * National Natural Science Foundation of China(国家自然科学基金) Research Grants Council of the Hong Kong SAR(香港研究资助局) Advanced Research + Invention Agency (ARIA)(高级研究与发明机构) Engineering and Physical Sciences Research Council (EPSRC)(工程与物理科学研究理事会)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出监督强化学习框架,先通过监督学习预训练策略,再经离线与在线微调,实现分布式能源高效协调,显著提升成本效益。

Comments Presented at PSCC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25475 2026-06-25 math.DS 新提交 67%

A Krieger Embedding Theorem for Near Markov Sofic Shifts

近马尔可夫索菲克平移的克里格嵌入定理

Brian Marcus, Tom Meyerovitch, Chengyu Wu

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 本文推广了Krieger嵌入定理,给出了将子平移嵌入到混合(不可约)近马尔可夫索菲克平移的充要条件,并证明了当被嵌入子平移为不可约索菲克时,条件可有限判定。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25195 2026-06-25 cs.CR cs.AI 新提交 57%

SoK: AI Secure Code Generation: Progress, Pitfalls, and Paths Forward

SoK:AI安全代码生成:进展、陷阱与前进之路

Rupam Patir, Keyan Guo, Haipeng Cai, Hongxin Hu

专题命中 指令微调 :prompting(abstract);分类 cs.AI

AI总结 本文系统化分析AI安全代码生成的进展、陷阱与前进方向,提出三层次框架衡量模型对安全编码原则的理解、代码级执行及两者间的知识-执行差距,发现原则理解是代码安全性的强预测因子,但存在显著知识-执行差距。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 12 篇

2606.25447 2026-06-25 cs.LG cs.CL 新提交 91%

The Interplay of Harness Design and Post-Training in LLM Agents

马具设计与后训练在LLM智能体中的相互作用

Kyungmin Kim, Youngbin Choi, Seoyeon Lee, Suhyeon Jun, Dongwoo Kim, Sangdon Park

机构 * Graduate School of Artificial Intelligence, POSTECH(浦项科技大学人工智能研究生院) Department of Computer Science and Engineering, POSTECH(浦项科技大学计算机科学与工程系)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);分类 cs.CL、cs.LG

AI总结 研究将马具(工具集成脚手架)作为可控设计维度,分析其对后训练的影响,发现马具感知的后训练能提升分布内和分布外性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26080 2026-06-25 cs.LG cs.AI 新提交 91%

Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents

被忽视的免费午餐:后训练中的进展优势用于LLM智能体

Changdae Oh, Wendi Li, Seongheon Park, Samuel Yeh, Tanwi Mallick, Sharon Li

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Argonne National Laboratory(阿贡国家实验室)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 提出进展优势概念,利用强化学习后训练中的隐式优势函数作为无标注、领域无关的步骤级评分,在测试时扩展、不确定性量化和失败归因中超越专用奖励模型。

详情

展开后加载摘要…

URL PDF HTML 收藏