arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-01 至 2026-06-01 共收录 411 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 29 篇

2601.19936 2026-06-01 cs.LG cs.AI cs.CL 91%

Gap-K%: Measuring Top-1 Prediction Gap for Detecting Pretraining Data

Gap-K%: 通过测量 Top-1 预测差距检测预训练数据

Minseo Kwak, Jaehyung Kim

机构 * Yonsei University(延世大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出 Gap-K% 方法,利用 LLM 的 top-1 预测与目标 token 的对数概率差距及滑动窗口策略,在 WikiMIA 和 MIMIR 基准上实现预训练数据检测的最优性能。

Comments ACL 2026 Main Conference; 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26121 2026-06-01 cs.LG cs.AI 88%

GEM: Geometric Entropy Mixing for Optimal LLM Data Curation

GEM: 用于最优LLM数据策展的几何熵混合

Yue Min, Ziyun Qiao, Ruining Chen, Yujun Li

机构 * The Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科学与技术大学) Peking University, Beijing, China(北京大学) University of Science and Technology of China, Hefei, China(中国科学技术大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出GEM框架,通过将数据策展重构为超球面上的变分问题并采用MM算法优化,解决了分类缺陷和嵌入各向异性问题,在1.1B参数模型上实现下游准确率提升1.2%。

Comments ICML 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11137 2026-06-01 cs.LG cs.AI cs.CL 87%

Weight Decay Improves Language Model Plasticity

权重衰减提升语言模型可塑性

Tessa Han, Sebastian Bordt, Hanlin Zhang, Sham Kakade

机构 * Broad Institute, Schmidt Center(Broad研究所,Schmidt中心) University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心) Harvard University(哈佛大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过系统实验表明,预训练中较大的权重衰减能提高模型的可塑性,使微调后下游性能更优,并揭示了其促进线性可分表示、正则化注意力矩阵和减少过拟合的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14842 2026-06-01 cs.CV cs.AI 85%

PictSure: Pretraining Embeddings Matters for In-Context Learning Image Classifiers

PictSure:预训练嵌入对上下文学习图像分类器至关重要

Lukas Schiesser, Cornelius Wolff, Sophie Haas, Simon Pukrop

机构 * German Research Center for AI (DFKI)(德国人工智能研究中心(DFKI)) Centrum Wiskunde & Informatica (CWI)(数学与信息学研究中心(CWI))

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出PictSure视觉上下文学习模型,发现预训练嵌入质量是下游性能的关键瓶颈,而融合层训练数据的多样性影响有限。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03415 2026-06-01 cs.PL cs.AI cs.CL cs.SE 85%

LLMs Lean on Priors, Not Programming Language Semantics

LLMs 依赖先验而非编程语言语义

Aditya Thimmaiah, Jiyang Zhang, Jayanth Srinivasa, Junyi Jessy Li, Milos Gligoric

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Cisco Research(思科研究)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 通过 PLSemanticsBench 基准测试,发现前沿大语言模型在程序执行任务中依赖预训练统计规律而非形式语义规则,语义变异和结构复杂度导致准确率大幅下降。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30393 2026-06-01 cs.LG cs.AI cs.CR 84%

NumLeak: Public Numeric Benchmarks as Latent Labels in Foundation Models

NumLeak: 基础模型中的公开数值基准作为潜在标签

Anany Kotawala

机构 * Princeton University(普林斯顿大学)

专题命中 预训练与数据 :foundation model(title,comments);LLM(abstract_cn);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出NumLeak框架,通过API边界探测和开源因果模型的白盒验证,揭示基础模型在预训练中记忆公开数值基准,导致评估高估泛化能力。

Comments 23 pages, 12 figures, 17 tables. Accepted at the ICML 2026 Workshop on the Impact of Memorization on Trustworthy Foundation Models (MemFM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31586 2026-06-01 cs.CL cs.AI 84%

Language Models Learn Constructional Semantics, Not To Mention Syntax: Investigating LM Understanding of Paired-Focus Constructions

语言模型学习构式语义,更不用说句法:探究LM对配对焦点构式的理解

Wesley Scivetti, Ethan Wilcox, Nathan Schneider, Kanishka Misra, Leonie Weissweiler

机构 * Georgetown University(乔治城大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Leipzig University(莱比锡大学)

专题命中 预训练与数据 :language model(title);LLM(abstract_cn);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 通过构建新数据集,研究不同规模开源语言模型对英语中稀有配对焦点构式(如“let alone”)的语义理解,发现中等规模模型能掌握其形式和意义,且语义学习晚于句法知识,并与世界知识相关。

Comments Conference on Natural Language Learning (CoNLL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30561 2026-06-01 cs.CV cs.AI 83%

VLM3: Vision Language Models Are Native 3D Learners

VLM3:视觉语言模型是原生3D学习者

Zhipeng Cai, Zhuang Liu, Yunyang Xiong, Zechun Liu, Vikas Chandra, Yangyang Shi

机构 * Meta Princeton University(普林斯顿大学)

专题命中 预训练与数据 :language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出VLM3,通过焦距统一、文本像素参考和数据混合缩放,使标准视觉语言模型无需复杂架构或损失函数即可高效掌握多种3D任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30826 2026-06-01 cs.CL cs.AI 82%

Beyond Agreement: Scoring Panel-Surfaced Biomedical Entity Candidates for Curator Triage

超越一致性:为策展人分类对面板筛选的生物医学实体候选进行评分

Shuheng Cao, Ruiqi Chen, Renjie Cao, Zhenhao Zhang, Siyu Zhang, Tingting Dan

机构 * University of California, San Diego(加州大学圣地亚哥分校) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) The Hong Kong University of Science and Technology, Guangzhou(香港科学与技术大学(广州)) ShanghaiTech University(上海科技大学) University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 提出BioConCal评分器,利用无金标准的一致性、提及、表面可用性和文档特征,对多LLM面板筛选的候选实体进行评分,显著提高候选筛选的精确率和召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30668 2026-06-01 cs.CL cs.AI 82%

CobSeg: Coherence Boundary Modeling for Dialogue Topic Segmentation

CobSeg: 对话主题分割的连贯性边界建模

Sijin Sun, Liangbin Zhao, Jiaxiang Cai, Ming Deng, Mingyu Luo, Xiuju Fu

机构 * Institute of High Performance Computing, Agency for Science, Technology and Technology(高性能计算研究所,科技局) Shanghai Univeristy(上海大学) Fudan University(复旦大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 提出CobSeg多分支架构,通过分离连贯性语义与词汇边界转换并利用边界信息加权和主题连贯性线索,在无需LLM调用下提升对话主题分割性能。

Comments 8 pages with appindx. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31136 2026-06-01 cs.CL 81%

Multilingual and Cross-Lingual Citation Needed Detection on Wikipedia for Lower-Resource Languages

低资源语言维基百科的多语言和跨语言引用需求检测

Gerrit Quaremba, Amy Rechkemmer, Elizabeth Black, Denny Vrandečić, Elena Simperl

机构 * King’s College London(伦敦国王学院) Wikimedia Foundation(维基媒体基金会)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);SLM(abstract_cn)

AI总结 针对低资源语言,提出多语言引用需求检测语料库MCN,并证明使用编码器风格目标微调的小型解码器语言模型在跨语言任务中优于大型语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30582 2026-06-01 cs.CL 81%

AI for Monitoring and Classifying Data Used in Research Literature

AI用于监控和分类研究文献中使用的数据

Rafael Macalaba, Aivin V. Solatorio

机构 * World Bank(世界银行) Office of the World Bank Group(世界银行集团办公室) Development Data Group(发展数据组)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出基于GLiNER的多任务框架,结合合成数据生成和LLM重验证,实现研究文献中数据集提及的提取、关系识别和使用上下文分类,以解决数据集使用监控中的标注稀缺和引用不一致问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21190 2026-06-01 cs.LG cs.AI 81%

Towards Foundation Models for Zero-Shot Time Series Anomaly Detection: Leveraging Synthetic Data and Relative Context Discrepancy

面向零样本时间序列异常检测的基础模型:利用合成数据和相对上下文差异

Tian Lan, Hao Duong Le, Jinbo Li, Wenjun He, Meng Wang, Chenghao Liu, Chen Zhang

机构 * Department of Industrial Engineering, Tsinghua University, Beijing, China(清华大学工业工程系) Datadog AI Research, Paris, France. This work was completed prior to joining Datadog(Datadog AI 研究院) Lab, Huawei Technologies, ShenZhen, China(华为技术2012实验室)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出基于相对上下文差异(RCD)的预训练范式,通过合成数据训练Transformer模型比较查询模式与上下文,实现零样本时间序列异常检测,在多个基准上超越现有基础模型。

Comments This manuscript is withdrawn, as the authors intend to further extend and develop the work beyond its current scope

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31329 2026-06-01 eess.AS 78%

Improving acoustic drone detection generalization through pretraining and data augmentation

通过预训练和数据增强提高声学无人机检测的泛化能力

Paul M. Reuter, Mattes Ohlenbusch, Christian Rollwage

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 针对声学无人机检测泛化挑战,提出基于预训练和在线数据增强的紧凑型DNN检测器,显著提升跨域检测性能。

Comments Accepted to Quiet Drones 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30288 2026-06-01 cs.AI 77%

MIRA: Mid-training Rubric Anchoring for Source-Aware Data Selection

MIRA: 基于自锚定评分标准的中期训练源感知数据选择

Haowen Wang, Yaxin Du, Jian Yang, Jiajun Wu, Shukai Liu, Yuxuan Zhang, Pingjie Wang, Siheng Chen, Tuney Zheng, Ming Zhou, Xianglong Liu, Bryan Dai

机构 * Beihang University(北洋大学) IQuest Research(IQuest研究院) Shanghai Jiao Tong University(上海交通大学) University of British Columbia(不列颠哥伦比亚大学) Langboat Multilingual-Multimodal-NLP/mira(Langboat多语言-多模态-NLP/mira)

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract);post-training(abstract);分类 cs.AI

AI总结 针对中期训练中异构数据源的选择问题,提出MIRA框架,通过自锚定评分标准发现和可扩展的学生评分器,在代码中期训练中仅用一半token即可匹配全语料性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31238 2026-06-01 cs.CL cs.LG 73%

Scaling Multi-Hop Training Data via Graph-Constrained Path Selection

通过图约束路径选择扩展多跳训练数据

Pengyu Chen, Yonggang Zhang, Mingming Chen, Jun Song, Wei Xue, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Hong Kong Generative AI Research and Development Center(香港生成式人工智能研究与发展中心) Hong Kong Baptist University(香港 Baptist 大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对专业文档的组成推理,提出基于图约束路径选择的方法,通过解耦路径发现与语言化,利用图约束过滤无效路径,显著扩展可用语料并提升模型性能。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30526 2026-06-01 cs.LG cs.CL 73%

Measuring, Localizing, and Ablating Alignment Signatures in LLMs

测量、定位和消融LLMs中的对齐特征

Aniket Anand, Janvijay Singh, Zhewei Sun, Dilek Hakkani-Tür, Nick Feamster

机构 * University of Chicago(芝加哥大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 预训练与数据 :language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 研究通过对比人类文本、基模型和对齐模型生成,发现对齐训练引入AI风格特征,并提出PASTA方法通过消融对齐方向来降低AI检测率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30376 2026-06-01 cs.LG cs.AI 73%

Unicorn: Scaling High-Dimensional Time Series Forecasting via Universal Correlation Modeling

Unicorn: 通过通用相关性建模实现高维时间序列的规模化预测

Haochen Yuan, Yichen Song, Yunbo Wang, Xiaokang Yang

机构 * MoE Key Lab of Artificial Intelligence(人工智能大规模并行计算实验室) AI Institute(人工智能研究院) School of Computer Science(计算机科学学院) Shanghai Jiao Tong University(上海交通大学)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出Unicorn框架,通过潜在原型码本解耦相关性建模与特定通道身份,实现跨异构数据集的可扩展多数据集预训练,在少样本迁移场景中显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11336 2026-06-01 cs.IR cs.AI cs.CL cs.HC 73%

Much of Geospatial Web Search Is Beyond Traditional GIS

大部分地理空间网络搜索超越了传统GIS

Ilya Ilyankou, Stefano Cavazzi, James Haworth

机构 * SpaceTimeLab(空间时间实验室) Department of Civil, Environmental, and Geomatic Engineering(土木、环境与测绘工程系) UCL(伦敦大学学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过密集句子嵌入、SetFit分类器和密度聚类,在MS MARCO语料库中发现18%的查询具有地理空间性质,并构建了88类分类体系,揭示地理搜索以事务性和实用性查询为主,多数超出传统GIS和知识图谱范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31371 2026-06-01 cs.LG 70%

Softsign: Smooth Sign in Your Optimizer For Better Parameter Heterogeneity Handling

Softsign: 优化器中的平滑符号函数以更好地处理参数异质性

Dmitrii Feoktistov, Timofey Belinsky, Andrey Veprikov, Amir Zainullin, Aleksandr Beznosikov

机构 * HSE University(莫斯科国立高等经济学院) Yandex Research(Yandex研究院) BRAIn Lab(BRAIn实验室) SB AI Lab(SB人工智能实验室) Innopolis University(因诺波利斯大学)

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract);分类 cs.LG

AI总结 提出SoftSignum和SoftMuon优化器,通过温度控制的软符号变换替代硬符号映射,结合自适应分位数温度调度,解决基于符号的优化器在参数异质性和终端收敛上的问题,并在随机非凸设置下证明收敛性,实验表明在多种深度学习任务(包括大语言模型预训练)中优于硬符号优化器和AdamW。

Comments 9 pages, 3 tables, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30838 2026-06-01 cs.AI 70%

COMPASS: Cognitive MCTS-Guided Process Alignment for Safe Search Agents

COMPASS: 认知MCTS引导的过程对齐用于安全搜索代理

Wenkai Shen, Pengyang Zhou, Jiahe Xu, Jiaming Qian, Haozhe He, Zhihao Huang, Chaochao Chen, Xiaolin Zheng

机构 * Zhejiang University(浙江大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出COMPASS框架,通过认知树探索和自省步骤对齐,在保持通用效用的同时实现搜索代理工作流中的鲁棒安全对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27881 2026-06-01 cs.CL 70%

Retrieval, Reward, and Training Protocols: What Matters in Training Search Agents?

检索、奖励与训练协议:训练搜索代理的关键因素是什么?

Yibo Zhao, Zichen Ding, Jiayi Wu, Zun Wang, Xiang Li

机构 * School of Data Science and Engineering, East China Normal University(东华大学数据科学与工程学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过控制实验,系统研究了检索语料库、奖励设计和训练协议三个维度对搜索代理训练的影响,发现纠正语料覆盖问题比算法差异更有效,简单的基于结果的奖励方法在多数设置下表现优异,并提出了实用训练指南。

Comments 18pages, 4 figures, and 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31495 2026-06-01 cond-mat.mtrl-sci 67%

General-purpose LLMs as Constrained Crystal Composition Generators

通用大语言模型作为约束晶体成分生成器

Hedda Oschinski, Maximilian L. Ach, Konstantin S. Jakob, Christian Carbogno, Karsten Reuter

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 本文提出使用通用大语言模型(LLMs)通过迭代提示-响应框架生成约束条件下的晶体成分,在Elpasolite基准上平均恢复96%的低能量结构,超越专用生成模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31126 2026-06-01 cs.CL cs.AI cs.LG 67%

Not All Synthetic Data Is Yours to Learn From

并非所有合成数据都适合学习

Sina Alemohammad, Li Chen, Richard G. Baraniuk, Zhangyang Wang

机构 * ECE Department(电子工程系) Apple(苹果公司) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Rice University(里奇大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究无提示、无教师、无验证器、无奖励模型的自训练中,语言模型能否从自身生成的文本中学习,发现合成数据与学生之间的兼容性是关键,并揭示了能力与逐字记忆可分离的现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18807 2026-06-01 cs.LG cs.AI 62%

Block-Based Double Decoders

基于块的双解码器

Asher Labovich, Benjamin Bradley, Vanessa Alexander, Chaitanya Harsha

机构 * Brown University(布朗大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出基于块的双解码器架构,利用双重因果块注意力掩码实现全损失监督和静态序列打包,结合解码器训练效率与编码器-解码器推理效率,在缩放定律实验中优于编码器-解码器并接近解码器模型,推理时KV缓存和每token计算减少至少2/3。

Comments 8 pages main, 13 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18333 2026-06-01 cs.LG cs.CL 62%

On the "Induction Bias" in Sequence Models

论序列模型中的“归纳偏置”

M. Reza Ebrahimi, Michaël Defferrard, Sunny Panchal, Roland Memisevic

机构 * Qualcomm AI Research is an initiative of Qualcomm Technologies, Inc(高通人工智能研究,由高通技术公司发起)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG

AI总结 通过大规模实验比较Transformer和RNN在状态跟踪任务上的数据效率,发现Transformer需要更多训练数据且难以跨长度共享权重,而RNN通过权重共享实现有效学习。

Comments Accepted to the International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00175 2026-06-01 cs.LG cs.AI 62%

Who Gets Credit or Blame? Attributing Accountability in Modern AI Systems

谁获得功劳或责备?在现代AI系统中分配责任

Shichang Zhang, Hongzhe Du, Jiaqi W. Ma, Himabindu Lakkaraju

机构 * Harvard University, Cambridge, MA, USA(哈佛大学) University of California, Los Angeles, Los Angeles, CA, USA(加州大学洛杉矶分校) University of Illinois Urbana-Champaign, Urbana-Champaign, IL, USA(伊利诺伊大学厄巴纳-香槟分校)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出一个归因框架,通过反事实问题量化模型开发各阶段(预训练、微调等)对最终行为的影响,并设计无需重训练的估计器,成功识别并移除多阶段任务中的虚假关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31090 2026-06-01 cs.CV cs.AI 57%

On Revisiting Entropy for Identifying Mislabeled Images

重新审视熵在识别错误标注图像中的应用

Chunlei Li, Zixuan Zheng, Yilei Shi, Guanglu Dong, Pengfei Li, Jingliang Hu, Xiao Xiang Zhu, Lichao Mou

机构 * MedAI Technology (Wuxi) Co. Ltd., Wuxi, China(MedAI技术(无锡)有限公司,无锡,中国) Sichuan University, Chengdu, China(四川大学,成都,中国) University of Basel, Allschwil, Switzerland(巴塞尔大学,阿勒西维尔,瑞士) Technical University of Munich, Munich, Germany(慕尼黑技术大学,慕尼黑,德国)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 提出基于训练动态的有符号熵积分(SEI)统计量,通过捕捉预测熵的幅度和时间趋势,有效识别训练集中的错误标注样本,在医学影像数据集上达到最优性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22794 2026-06-01 eess.SY cs.LG cs.SY 57%

Accelerating Reinforcement Learning for Wind Farm Control via Expert Demonstrations

通过专家演示加速风电场控制的强化学习

Marcus Binder Nilsen, Julian Quick, Tuhfe Göçmen, Nikolay Dimitrov, Pierre-Elouan Réthoré

机构 * Department of Wind and Energy Systems, Technical University of Denmark(丹麦技术大学风能与能源系统系)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 提出一种利用稳态尾流模型生成的专家演示预训练方法,通过行为克隆初始化Soft Actor-Critic网络,消除初始学习阶段,使初始性能接近基线水平,并在在线微调后超越查表控制器。

Comments Submitted to Journal of Physics: Conference Series (Torque 2026). This is the Accepted Manuscript version of an article accepted for publication in Journal of Physics: Conference Series. IOP Publishing Ltd is not responsible for any errors or omissions in this version of the manuscript or any version derived from it. This Accepted Manuscript is published under a CC BY licence

Journal ref J. Phys.: Conf. Ser. 3224 032016 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 45 篇

2605.30524 2026-06-01 cs.LG 92%

Representation Collapse in Sequential Post-Training of Large Language Models

大型语言模型顺序后训练中的表示坍缩

Yichen Liu, Mingyu Chen, Hao Wang, Xiaoran Xu, Chenxi Lin, Rui Zhang, Yutong Zhou, Yuxin Yang, Jiarui Wu, Wei Sun

机构 * Hangzhou Dianzi University(杭州电子科技大学) Zhejiang Gongshang University(浙江工商大学) Ningbo University(宁波大学) Shanghai University(上海大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);preference optimization(abstract)

AI总结 研究大型语言模型在顺序后训练阶段中内部表示逐渐压缩为低秩、各向异性且同质的特征空间,并提出轻量级干预措施以保持未来可学习性。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏