arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-23 至 2026-06-23 共收录 778 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 52 篇

2606.22878 2026-06-23 cs.LG cs.AI 新提交 79%

Priority-Aware Learning-Unlearning Correction for Dynamic Decentralized LoRA Fine-Tuning

面向动态去中心化LoRA微调的优先级感知学习-遗忘校正

Nuocheng Yang, Yechen He, Sihua Wang, Zihan Chen, Tony Q. S. Quek, Changchuan Yin

机构 * Beijing Key Laboratory of Network System Architecture and Convergence, Beijing University of Posts and Telecommunications(网络系统架构与融合北京市重点实验室,北京邮电大学) Information Systems Technology and Design Pillar, Singapore University of Technology and Design(新加坡科技设计大学信息系统技术与设计系)

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对去中心化边缘网络中设备动态加入/离开导致的参数纠缠问题,提出基于正交LoRA的优先级感知校正框架,通过拓扑调整和资源分配实现高效知识评估与修正。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22361 2026-06-23 cs.CL cs.AI 新提交 73%

First-Token Broadcasters: Mechanistic Origins of Language Identity and Distributed Robustness in Transformers

首个令牌广播者:Transformer中语言身份与分布式鲁棒性的机制起源

Arjun Pillai, Christian Hoang, Anjelo Jann Laroza

机构 * Irvington High School(欧文顿高中) GenAI4E Mapua University(马普阿大学)

专题命中 指令微调 :language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

AI总结 通过因果干预方法LIHA,发现Transformer中少量注意力头(如GPT-2的L6H1)持续关注首个令牌并广播语言信号,且消融后补偿呈现层级前馈模式;指令微调将语言身份电路重组至早期层。

Comments Under review at BlackboxNLP (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21854 2026-06-23 eess.AS cs.SD 新提交 71%

ESPnet3: Infrastructure for Scalable Speech and Audio Research in the Foundation Model Era

ESPnet3:基础模型时代可扩展语音与音频研究的基础设施

Masao Someki, Alexander Polok, Carlos Carvalho, Chyi-Jiunn Lin, Da-Hee Yang, Jiatong Shi, Jinchuan Tian, Nelson Enrique Yalta Soplin, Samuele Cornell, Siddhant Arora, Francisco Teixeira, Wei Wang, William Chen, Alberto Abad, Chenda Li, Shinji Watanabe, Wangyou Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Brno University of Technology(布拉格技术大学) Instituto Superior Técnico(技术高等研究院) Hanyang University(翰阳大学) Hitachi Astemo(日立阿美士多) Shanghai Jiao Tong University(上海交通大学)

专题命中 指令微调 :foundation model(title)

AI总结 提出ESPnet3框架,通过模块化系统架构、配置驱动的数据集组合和统一Python工作流,实现大规模语音音频研究的高效训练与扩展,显著降低工程开销。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23321 2026-06-23 cs.CL 新提交 70%

Tmax: A simple recipe for terminal agents

Tmax: 终端智能体的简单配方

Hamish Ivison, Junjie Oscar Yin, Rulin Shao, Teng Xiao, Nathan Lambert, Hannaneh Hajishirzi

机构 * Allen Institute for AI(人工智能研究院) University of Washington(华盛顿大学)

专题命中 指令微调 :language model(abstract);SFT(abstract);分类 cs.CL

AI总结 提出Tmax配方,通过新颖分类法生成数据并结合结果奖励的强化学习,在9B参数下达到27%的Terminal-Bench 2.0性能,超越先前更大模型。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23063 2026-06-23 cs.CV cs.AI 新提交 70%

Attention-Spectrum Regularization for Replay-Free Continual Multimodal LLMs

注意力谱正则化:无回放的连续多模态大语言模型

Chuangxin Zhao, Canran Xiao, Siyuan Ma, Mengyao Lyu, Yanbiao Ma, Jun Xia, Guiguang Ding, Yang Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学) Tsinghua University(清华大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出注意力谱正则化(ASR),一种无回放的连续学习框架,通过存储技能级交叉注意力原型分布并施加谱正则化约束,有效缓解多模态大语言模型在连续微调中的灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21078 2026-06-23 cs.CL 新提交 70%

A Validation-Gated Mechanistic Account of Suicidality Detection in LLMs

一种验证门控机制的自杀检测在LLMs中的解释

Nafiz Ahmed, Sarah Sharif, Dingjing Shi, Mike Banad

机构 * Intelligent Neuromorphic and Quantum Understanding for Innovative Research and Engineering (INQUIRE) Lab(智能神经形态与量子理解创新研究与工程实验室) School of Electrical and Computer Engineering(电气与计算机工程学院) University of Oklahoma(俄克拉荷马大学) School of Psychology(心理学学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出验证门控框架,通过因果分析发现Llama-3.1-8B-Instruct在自杀检测中依赖语义特征而非关键词,且该特征在多个模型和数据集中一致出现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18497 2026-06-23 cs.CR cs.AI cs.DB 新提交 70%

Ghost Vectors: Soft-Deleted Embeddings Remain Reconstructible in HNSW Vector Databases

幽灵向量:HNSW向量数据库中软删除的嵌入仍然可重构

Chandranil Chakraborttii, Jackeline García Alvarado, Sitora Abdulofizova, Shivanshu Dwivedi

机构 * Trinity College, USA(美国三一学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究揭示HNSW向量数据库的软删除机制存在安全漏洞,被标记删除的向量仍可通过存储层恢复,并提出基于加密密钥轮换的防护方案。

Comments 13 pages, 5 figures, 12 tables. Prepared for submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21915 2026-06-23 cs.CV 新提交 67%

GTA-Net: Cooperative Game Theory for Vision-Language Alignment in Chest X-Ray Report Generation

GTA-Net:合作博弈论在胸部X光报告生成中的视觉-语言对齐

Saif ur Rehman Khan, Imad Ahmed Waqar, Sebastian Vollmer, Andreas Dengel, Muhammad Nabeel Asim

机构 * Department of Computer Science, Rhineland-Palatinate Technical University of Kaiserslautern-Landau(莱茵兰-普法尔茨凯泽斯劳滕-兰道工业大学计算机科学系) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) IntelligentX GmbH

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 提出GTA-Net,利用合作博弈论实现图像区域与文本的显式对齐,通过二元和三元对齐器提升胸部X光报告生成的临床一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15980 2026-06-23 cs.LG cs.AI cs.CL 新提交 67%

Do Activation Monitors Survive Model Updates? Benchmarking, Predicting, and Repairing Activation-Monitor Staleness

安全监控器在更新后是否仍可靠?激活监控器陈旧性的基准测试与预测

Evan Duan

机构 * University of Michigan(密歇根大学)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究语言模型更新后激活监控器是否仍可靠,发现量化更新影响小,微调更新常导致监控器失效,且可通过预部署特征预测退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22272 2026-06-23 cs.CL cs.AI 新提交 62%

MixedPEFT: Combining Multiple PEFT Methods with Mixed Objectives for Unsupervised Domain Adaptation

MixedPEFT:结合混合目标的多参数高效微调方法用于无监督域适应

Mohammed Rawhani, Dervis Karaboga, Ozkan Ufuk Nalbantoglu, Alper Basturk, Bahriye Akay

机构 * Computer Engineering Department(计算机工程系) Erciyes University(埃里奇大学)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一种结合自定义PEFT架构和混合目标训练的参数高效无监督域适应策略,在MNLI数据集上超越现有方法,仅使用7%可训练参数。

Comments 6 pages, 5 tables. Builds upon our preliminary work presented at UBMK 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21496 2026-06-23 cs.RO cs.AI cs.CV cs.LG 新提交 62%

Decoupling the Declarative from the Procedural in Vision-Language-Action Models

在视觉-语言-动作模型中解耦声明性知识与程序性知识

Nikolaos Tsagkas, Andreas Sochopoulos, Chris Xiaoxuan Lu, Oisin Mac Aodha, Alexandros Kouris

机构 * University of Edinburgh(爱丁堡大学) UCL(伦敦大学学院) Samsung AI Center - Cambridge, UK(三星人工智能中心 - 英国剑桥)

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 针对现有VLA模型无法解耦声明性与程序性知识导致零样本技能迁移脆弱的问题,提出w$^{2}$VLA模型,通过重构信息流实现模块化、可解释的知识解耦,显著提升对未见物体的零样本技能迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01949 2026-06-23 cs.LG cs.AI cs.CE 版本更新 62%

Probabilistic Retrofitting of Learned Simulators

学习模拟器的概率性改造

Cristiana Diaconu, Miles Cranmer, Richard E. Turner, Tanya Marwah, Payel Mukhopadhyay

机构 * The Polymathic AI Collaboration(多智AI协作体) University of Cambridge(剑桥大学) Alan Turing Institute(艾伦·图灵研究所)

专题命中 指令微调 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出一种训练高效的策略,通过连续排序概率得分(CRPS)将预训练的确定性模型改造为概率模型,无需从头训练,适用于多种架构,在多个动力系统上显著提升预测性能。

Comments Code provided at https://github.com/cddcam/lola_crps

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23254 2026-06-23 cs.CV cs.AI 新提交 57%

SteerVTE: Seamless Video Text Editing with Style and Glyph Control

SteerVTE: 具有风格和字形控制的无缝视频文本编辑

Kai Zeng, Moran Li, Zhengwei Wang, Yingchen Yu, Yiheng Lin, Ruichuan An, Ming Lu, Qi She, Wentao Zhang

机构 * Peking University(北京大学)

专题命中 指令微调 :foundation model(abstract);分类 cs.AI

AI总结 提出SteerVTE框架,通过风格编码器和双粒度字形编码器控制冻结视频扩散模型,结合字形感知空间焦点损失和三阶段渐进训练,实现精确、连贯的视频文本编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22429 2026-06-23 cs.LG 新提交 57%

Enhancing LLMs for Graph Tasks via Graph-aware LoRA Generation

通过图感知的LoRA生成增强LLMs的图任务能力

Junshu Sun, Wanxing Chang, Qingming Huang, Shuhui Wang

机构 * State Key Lab. of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院)

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 提出GaRA模型,通过生成任务特定的低秩权重更新注入全图信息,避免信息损失,在零样本图学习任务上优于基线方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21553 2026-06-23 cs.CL cs.IR 新提交 57%

Dissecting Agentic RAG: A Component Ablation for Multi-Hop QA with a Local 7B Model

解析智能体RAG:基于本地7B模型的多跳问答组件消融研究

Sheroz Shaikh

机构 * Independent Researcher(独立研究员)

专题命中 指令微调 :language model(abstract);分类 cs.CL

AI总结 通过消融实验,发现固定混合检索和短检索循环对多跳问答贡献最大,自适应路由和深度循环并非必要。

Comments 8 pages, 4 figures, 4 tables. Code: https://github.com/sherozshaikh/agentic-rag-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20890 2026-06-23 cs.CL cs.IR 新提交 57%

Topic-to-Timestamp Alignment by Constrained Evidence Selection

通过约束证据选择的主题到时间戳对齐

Zeynep Yılbırt, Marina Litvak, Michael Färber

机构 * TU Dresden(德累斯顿工业大学) SpeechMind GmbH(SpeechMind 公司) Shamoon College of Engineering(沙蒙工程学院) ScaDS.AI Dresden/Leipzig(ScaDS.AI 德累斯顿/莱比锡)

专题命中 指令微调 :language model(abstract);分类 cs.CL

AI总结 针对会议记录中主题到时间戳的对齐问题,提出将时间戳预测重构为约束时间候选选择,通过检索时间戳转录块并选择最佳候选而非生成时间码,显著提升召回率和解析输出数量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21736 2026-06-23 cs.CV 新提交 50%

Adversarial Domain Prompt Tuning and Generation for Single Domain Generalization

对抗域提示调优与生成用于单域泛化

Zhipeng Xu, De Cheng, Xinyang Jiang, Nannan Wang, Dongsheng Li, Xinbo Gao

机构 * Xidian University(西安电子科技大学) Microsoft Research Asia(微软亚洲研究院) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 指令微调 :foundation model(abstract)

AI总结 提出渐进式对抗提示调优框架,利用预训练扩散模型生成多样域风格图像,实现单域泛化,性能超越现有方法。

Comments 12 pages, 6 figures, accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22234 2026-06-23 cond-mat.mtrl-sci cond-mat.mes-hall 新提交 50%

Fine-Tuned Machine-Learned Interatomic Potentials for Structural and Vibrational Properties of Twisted 2D Materials

用于扭曲二维材料结构和振动特性的微调机器学习原子间势

Viet-Anh Tran, Viet-Hung Nguyen, Wei Chen, Gian-Marco Rignanese, Jean-Christophe Charlier

专题命中 指令微调 :foundation model(abstract)

AI总结 通过微调通用原子基础模型,开发了适用于扭曲二维材料(如双层石墨烯、h-BN和MoS2)的机器学习原子间势,准确模拟了原子重构和莫尔声子谱,与实验吻合。

Comments 35 pages, 14 figures, Supplementary Materials

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20237 2026-06-23 cs.CV 版本更新 50%

AnimeAdapter: A Modular Adapter for Appearance-Consistent Anime Character Generation

AnimeAdapter: 细粒度且一致的零样本动漫人物生成

Yixuan Han

机构 * National University of Singapore, Singapore(新加坡国立大学)

专题命中 指令微调 :language model(abstract)

AI总结 本文提出了一种轻量级的外观适配器,用于在多样编辑条件下实现可控且一致的动漫人物生成,通过注入单张参考图像的细粒度视觉特征到扩散过程中,并结合CLIP的局部空间化特性,开发出语义选择性局部注意力机制,进一步解耦人物外观与空间布局,从而实现高效的动漫人物生成。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 33 篇

2606.22305 2026-06-23 cs.CL 新提交 91%

Learning at the Right Pace: Adaptive Data Scheduling Improves LLM Reinforcement Learning

以合适的速度学习:自适应数据调度改进大语言模型强化学习

Zicheng Xu, Ruixuan Zhang, Yu-Neng Chuang, Xiuyi Lou, Hoang Anh Duy Le, Oren Gal, Alexander S. Szalay, Zhaozhuo Xu, Guanchu Wang, Vladimir Braverman

机构 * Johns Hopkins University(约翰霍普金斯大学) Rice University(莱斯大学) University of Haifa(海法大学) Workato University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对LLM强化学习后训练中均匀采样忽视数据语义和策略变化的问题,提出自适应数据调度框架ADS,通过语义聚类和策略边界样本选择实现双层级调度,在三个LLM和七个推理基准上平均准确率提升5.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17385 2026-06-23 cs.LG cs.AI 版本更新 91%

Strengthening LLMs for Tabular Prediction with Structural Priors

利用结构先验增强LLM在表格预测中的能力

Pengxiang Cai, Zihao Gao, Wanchen Lian, Guocong Li, Jintai Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出PRPO方法,通过列排列不变性和两级优势估计将表格结构先验融入LLM后训练,使8B模型在139个OpenML数据集上达到与强监督基线竞争的性能,零样本设置下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10999 2026-06-23 cs.CL 版本更新 90%

KBQA-R1: Reinforcing Large Language Models for Knowledge Base Question Answering

KBQA-R1:强化大语言模型用于知识库问答

Xin Sun, Zhongqi Chen, Xing Zheng, Qiang Liu, Shu Wu, Bowen Song, Zilei Wang, Weiqiang Wang, Liang Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出KBQA-R1框架,通过强化学习(GRPO)将知识库问答建模为多轮决策过程,并引入参考拒绝采样(RRS)解决冷启动问题,在多个基准上取得最优性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23038 2026-06-23 cs.LG cs.AI 新提交 90%

EvoRubrics: Dynamic Rubrics as Rewards via Adversarial Co-Evolution for LLM Reinforcement Learning

EvoRubrics:通过对抗性协同进化为LLM强化学习提供动态评分准则作为奖励

Hongxin Ding, Baixiang Huang, Yue Fang, Weibin Liao, Zheng Li, Jinyang Zhang, Zhijing Wu, Junfeng Zhao, Yasha Wang

机构 * National Engineering Research Center of Software Engineering, Peking University(北京大学软件工程国家工程研究中心) School of Computer Science, Peking University(北京大学计算机学院) Key Laboratory of High Confidence Software Technologies, Ministry of Education(教育部高可信软件技术重点实验室) Peking University Information Technology Institute, Tianjin Binhai(北京大学滨海信息技术研究院) Research Institute, GRGBanking Equipment Co., Ltd.(广电运通金融电子股份有限公司研究院)

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出EvoRubrics框架,通过策略LLM与评分准则生成器的对抗性协同进化,在训练中动态调整奖励标准,解决静态评分准则导致的奖励饱和与策略欺骗问题,实验表明其优于静态和动态基线,且自监督变体也能有效提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03058 2026-06-23 cs.LG cs.AI cs.CL 版本更新 90%

VRPO: Rethinking Value Modeling for Robust RL under Noisy Supervision in LLM Post-Training

VRPO: 重新思考价值建模以实现大语言模型后训练中噪声监督下的鲁棒强化学习

Dingwei Zhu, Shihan Dou, Zhiheng Xi, Senjie Jin, Guoqiang Zhang, Jiazheng Zhang, Junjie Ye, Mingxu Chai, Enyu Zhou, Ming Zhang, Yuhui Wang, Caishuang Huang, Chenhao Huang, Yunke Zhang, Yuran Wang, Tao Gui, Qi Zhang, Xipeng Qiu, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Honor Device Co., Ltd(荣耀设备有限公司) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对强化学习中噪声监督导致策略不稳定问题,提出VRPO框架,通过熵和困惑度辅助损失及变分信息瓶颈增强价值模型,使其能过滤噪声并生成可靠优势估计,在多项任务上优于PPO和GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21090 2026-06-23 cs.AI cs.LG 新提交 89%

Self-Improvement Can Self-Regress: The Rise-and-Collapse Failure Mode of LLM Self-Training

自我改进可能导致自我退化:LLM自我训练的兴起与崩溃失败模式

Jianzhe Lin

机构 * MetaAI

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 研究LLM自我训练中pass@1先升后降的崩溃模式,发现非跨任务遗忘而是策略过度优化,提出CARE、ES和GRPO三种控制方法,在Qwen-2.5模型上验证效果。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21943 2026-06-23 cs.LG cs.AI 新提交 88%

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning

LLM上的模块化强化学习:从MDP创建到探索与学习

Zhao Yang, Yuxuan Jiang, Ting-Chih Chen, Lincen Yang, Annie Wong, Chao Gao, Jacob E. Kooi, Zhong Li, Jiayang Shi, Kevin Qiu, Qi Huang, Xinrui Zu, Shiping Yang, Hengyuan Zhang, Ngai Wong, Filip Ilievski, Shujian Yu, Aske Plaat, Zhaochun Ren, Mark Hoogendoorn, Vincent François-Lavet

机构 * VU Amsterdam(阿姆斯特丹自由大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Leiden University(莱顿大学) University of Warsaw(华沙大学) Simon Fraser University(西蒙菲莎大学) The University of Hong Kong(香港大学)

专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文系统梳理LLM后训练中的强化学习方法,从MDP构建、探索策略到学习范式,揭示当前方法分布不均,指出价值函数、离策略AC及自举法等领域存在研究空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21458 2026-06-23 cs.LG 新提交 88%

Post-Training Speech Enhancement Language Models with Perceptual Rewards

基于感知奖励的语音增强语言模型后训练

Frédéric Berdoz, Luca A. Lanzendörfer, Antonis Asonitis, Roger Wattenhofer

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);分类 cs.LG

AI总结 提出使用组序列策略优化(GSPO)结合多指标感知奖励对自回归语音增强语言模型进行后训练,直接优化非可微质量指标,在DNS2020基准上达到最优,且多奖励优化优于单指标变体。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21089 2026-06-23 cs.AI 新提交 87%

Repeated post-training is not Self-improving: Diagnosing Scientific Amnesia in Continual DPO Pipelines

重复后训练并非自我改进:诊断持续DPO流水线中的科学健忘症

Jianzhe Lin, Fei Wang, Xiaolin Li, Rajeshkumar Golani, Jubin Chheda

机构 * MetaAI

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(title);分类 cs.AI

AI总结 针对工业LLM团队在持续DPO训练中遇到的性能退化问题,本文提出“科学健忘症”概念,并设计诊断套件、基于程序的流水线及基准测试,通过对比五种策略发现,结论高度依赖流水线设置和评估设计。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04477 2026-06-23 cs.LG 版本更新 86%

Data-dependent Exploration for Online Reinforcement Learning from Human Feedback

基于数据的探索:面向人类反馈的在线强化学习

Zhen-Yu Zhang, Yuting Tang, Jiandong Zhang, Lanjihong Ma, Masashi Sugiyama

机构 * Center for Advanced Intelligence Project, RIKEN(日本理化学研究所先进智能研究中心) Graduate School of Frontier Sciences, The University of Tokyo(东京大学前沿科学研究生院) Northeastern University(东北大学) Zhejiang Gongshang University(浙江工商大学)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出数据依赖探索的偏好优化方法(DEPO),利用历史数据构建不确定性奖励,鼓励探索高价值区域,理论证明其数据依赖的遗憾界更紧,实验表明样本效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04389 2026-06-23 cs.CL cs.AI 版本更新 86%

Safety Is Not Universal: The Selective Safety Trap in LLM Alignment

安全并非普遍:大语言模型对齐中的选择性安全陷阱

Iago Alves Brito, Walcy Santos Rezende Rios, Julia Soares Dollis, Diogo Fernandes Costa Silva, Arlindo Rodrigues Galvão Filho

机构 * Advanced Knowledge Center for Immersive Technologies(沉浸式技术先进知识中心) Federal University of Goiás(戈亚斯联邦大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 研究揭示大语言模型在安全对齐中的选择性安全陷阱,通过MiJaBench基准测试发现安全防御存在人口统计学层级差异,通过DPO优化实现跨群体的安全泛化。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏