arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-07 至 2026-07-07 共收录 34 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 34 篇

2604.19139 2026-07-07 cs.CL cs.AI 版本更新 91%

The Rise of Verbal Tics in Large Language Models: A Systematic Analysis Across Frontier Models

大语言模型中言语 tic 的兴起:前沿模型的系统分析

Shuai Wu, Xue Li, Yanna Feng, Yufang Li, Zhijun Wang, Ran Wang

机构 * Lead Researcher(研究员) Research Assistant(研究助理) Academic Advisor(学术顾问) Research Consultant(研究顾问)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract,abstract_cn);LLM(abstract_cn)

AI总结 本文系统分析了八个前沿大语言模型中言语 tic 的现象,通过定制评估框架评估10,000个提示,发现 Gemini 3.1 Pro tic 值最高,DeepSeek V3.2 最低,并揭示了 tic 在多轮对话中的累积效应及跨语言差异。

Comments 17 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26997 2026-07-07 cs.DC cs.LG 新提交 91%

RolloutPipe: Overlapping Pipelined Rollout and Training in Disaggregated On-Policy LLM Reinforcement Learning

RolloutPipe: 分离式在线策略LLM强化学习中的流水线化Rollout与训练重叠

Rongjian Chen, Jianmin Hu, Kejiang Ye, Minxian Xu

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Southern University of Science and Technology(南方科技大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对分离式RLVR系统中rollout与训练阶段空闲问题,提出RolloutPipe框架,通过完整组流水线(CGP)和前沿组调度(FGD)实现训练与rollout重叠,保持在线策略正确性,减少训练等待时间30.7%-42.3%。

Comments 15 pages

Journal ref Proceedings of the 2026 International Conference on Cognitive Computing (ICCC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15765 2026-07-07 cs.LG cs.GT stat.ML 版本更新 90%

Shapley-based Data Valuation for LLM Alignment via Sequential Preference Optimization

基于Shapley值的大语言模型对齐数据估值:通过顺序偏好优化

Mélissa Tamine, Otmane Sakhi, Benjamin Heymann, Maxime Vono, Patrick Loiseau

机构 * Criteo AI lab(Criteo AI实验室) FairPlay joint team(FairPlay联合团队) CREST ENSAE Institut Polytechnique de Paris(巴黎理工学院) Inria(法国国家科学与技术研究院)

专题命中 后训练与偏好优化 :LLM(title,abstract);preference optimization(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型对齐中数据估值问题,针对基于Shapley值估值计算量大的挑战,提出顺序偏好优化方法,可高效近似Shapley值,计算真实偏好数据集的Shapley值并揭示各源对模型对齐的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04136 2026-07-07 cs.AI 版本更新 90%

A Technical Survey of Reinforcement Learning Techniques for Large Language Models

大语言模型强化学习技术的技术综述

Saksham Sahai Srivastava, Vaneet Aggarwal

机构 * University of Georgia(佐治亚大学) Purdue University(普渡大学)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(title);LLM(abstract);RLHF(abstract)

AI总结 综述强化学习与语言模型整合,介绍如近端策略优化等算法,分析其在各领域应用,对失败模式算法分析,给出分类法,评估趋势并探讨挑战与新兴方向,为研究提供路线图。

Comments Accepted to ACM Transactions on Intelligent Systems and Technology, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17673 2026-07-07 cs.CR cs.AI 版本更新 90%

Towards Reliable Local Security Agents: Verifiable Post-Training for Linux Privilege Escalation

在Linux提权中使用可验证奖励进行训练后的本地LLM代理

Philipp Normann, Andreas Happe, Jürgen Cito, Daniel Arp

专题命中 后训练与偏好优化 :LLM(title_cn,abstract);post-training(title,abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种两阶段训练流程,通过监督微调和强化学习提升Linux提权任务的性能,实现高成功率和低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03248 2026-07-07 cs.LG cs.AI 新提交 90%

Unbiased Alignment for Large Language Models with Noisy Preferences

具有噪声偏好的大语言模型的无偏对齐

Jialiang Wang, Xianming Liu, Xiong Zhou, Hui Liu, Haoliang Li

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型与人类偏好对齐问题,针对真实偏好数据集中噪声大的问题,提出无偏对齐理论框架,引入新损失函数,能直接从噪声数据集无偏训练模型,实验表明优于现有基线。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03528 2026-07-07 cs.LG cs.AI cs.CL 新提交 89%

Aligning Language Models with Selective Prediction

通过选择性预测使语言模型对齐

Gaoxiang Luo, Yifan Wu, Sinian Zhang, Aryan Deshwal, Ju Sun

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Bioinformatics and Computational Biology Program(生物信息学与计算生物学项目) Division of Biostatistics and Health Data Science(生物统计学与健康数据科学部) University of Minnesota Twin Cities(明尼苏达大学双城分校)

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);post-training(abstract)

AI总结 研究聚焦提升语言模型可靠性,采用选择性预测策略,在模型训练后对齐阶段,提出基于强化学习的框架RLSR,以风险-覆盖曲线下面积为目标,在域内域外任务中风险-覆盖权衡表现更好。

Comments Accepted by ICML 2026 Agents in the Wild: Safety, Security, and Beyond Workshop, Project Page: https://sun-umn.github.io/RLSR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28998 2026-07-07 cs.SE cs.AI 版本更新 89%

Reward-Free Code Alignment from Pretrained or Fine-Tuned LLM: Unpacking the Trade-offs for Code Generation

从预训练或微调的大语言模型进行无奖励代码对齐:揭示代码生成中的权衡

Sanjeepan Sivapiran, Gias Uddin

机构 * York University Canada(加拿大约克大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本研究通过实证分析,探讨了在代码生成任务中,对预训练或微调后的大语言模型进行无奖励对齐(DPO和BoNBoN)的效果,发现预训练到对齐的路径提升更大,但微调版本基线更高。

Journal ref The ACM International Conference on the Foundations of Software Engineering (FSE) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31876 2026-07-07 cs.AI cs.CV cs.LG 新提交 88%

Harnessing Textual Refusal Directions for Multimodal Safety

利用文本拒绝方向实现多模态安全

Moreno D'Incà, Nicu Sebe, Massimiliano Mancini

机构 * University of Trento(特伦托大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出MARS方法,通过从LLM骨干提取的文本拒绝方向泛化到多模态,无需多模态安全数据即可提升安全性,在五个先进MLLM上验证了有效性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07468 2026-07-07 cs.LG cs.CL cs.MA 版本更新 88%

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

通过在线自我博弈强化学习追踪移动目标以实现更安全的语言模型

Mickel Liu, Liwei Jiang, Yancheng Liang, Simon Shaolei Du, Yejin Choi, Tim Althoff, Natasha Jaques

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);RLHF(abstract)

AI总结 研究传统大语言模型安全对齐问题,引入Self-RedTeam算法,通过在线自我博弈多智能体强化学习持续共同进化攻防策略,有理论安全保障,实证效果好,推动从被动修补到主动协同进化转变。

Comments ICML 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08048 2026-07-07 cs.IR cs.AI cs.CL 版本更新 87%

TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance

TaoSR-AGRL:用于电子商务搜索相关性的自适应引导强化学习框架

Jianhui Yang, Yiming Jin, Pengkun Jiao, Chenhe Dong, Zerui Huang, Shaowei Yao, Xiaojiang Zhou, Dan Ou, Haihong Tang

机构 * Tsinghua University(清华大学) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团) Fudan University(复旦大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 电商搜索中查询-产品相关性预测很关键,现有方法有局限。提出TaoSR-AGRL框架,通过规则感知奖励塑造和自适应引导重放两大创新,提升模型推理能力,在实验中表现优于基线,已成功部署。

Comments Accepted to The Web Conference (WWW) 2026, Industry Track, Oral

Journal ref Proceedings of the ACM Web Conference 2026 (WWW '26), 2026, pp. 7955-7966

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03770 2026-07-07 cs.CV cs.AI cs.LG 新提交 86%

Self-Improving Diffusion Classifiers with Minority Preference Optimization

通过少数偏好优化实现自我改进的扩散分类器

Hyunsoo Kim, Jungmyung Wi, Soobin Um, Donghyun Kim, Suhyun Kim

机构 * Korea University(韩国大学) Kook Min University(国民大学) Kyung Hee University(庆熙大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究发现扩散分类器感知偏向多数区域,提出MiPO方法,利用少数偏好奖励微调预训练扩散模型,无需额外图像数据等,经实验验证可缓解偏差并提升零样本扩散分类性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18037 2026-07-07 cs.LG cs.AI cs.CL 版本更新 86%

Gradient Regularization Mitigates Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards

梯度正则化减轻基于人类反馈和可验证奖励的强化学习中的奖励作弊

Johannes Ackermann, Michael Noukhovitch, Takashi Ishida, Masashi Sugiyama

机构 * The University of Tokyo(东京大学) RIKEN AIP(理化学研究所AIP) Mila(蒙特利尔大学Mila)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);LLM(abstract);language model(abstract);post-training(abstract)

AI总结 研究基于人类反馈或可验证奖励的强化学习中奖励作弊问题,提出用梯度正则化使训练偏向奖励更准确区域,理论推导并实证验证,还改进方法,结果显示其比KL惩罚表现更好。

Comments Accepted at ICML 2026, 25 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01392 2026-07-07 cs.CL 新提交 85%

Multi-Objective Exploration and Preference Optimization via Mutual Information

基于互信息的多目标探索与偏好优化

Hongyan Xie, Yikun Ban, Ruiyu Fang, Zixuang Huang, Deqing Wang, Jianxin Li, Shuangyong Song

机构 * School of Computer, Beihang University(北京航空航天大学计算机学院) Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰AGI实验室,中国电信人工智能技术(北京)有限公司)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出MI-EPO框架,通过最大化生成响应、偏好反馈和偏好向量的联合条件互信息,统一多目标探索与对齐,实现可控且稳定的多目标权衡。

Comments Accepted at ECML/PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22851 2026-07-07 cs.LG cs.AI cs.CL 版本更新 85%

Adaptive Margin RLHF via Preference over Preferences

通过偏好之上的偏好进行自适应边际基于人类反馈的强化学习

Yaswanth Chittepu, Prasann Singhal, Greg Durrett, Scott Niekum

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 后训练与偏好优化 :RLHF(title,abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究在基于人类反馈的强化学习中奖励模型学习的边际优化问题,提出利用偏好之上的偏好推断自适应边际,介绍具体实例DPO-PoP,提升判别和生成性能,并给出采样策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10938 2026-07-07 cs.LG cs.AI 版本更新 84%

Safe RLHF Beyond Expectation: Stochastic Dominance for Universal Spectral Risk Control

超越期望的安全基于人类反馈的强化学习:用于通用谱风险控制的随机占优

Yaswanth Chittepu, Ativ Joshi, Rajarshi Bhattacharjee, Scott Niekum

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.AI、cs.LG

AI总结 研究基于人类反馈的安全强化学习,提出用一阶随机占优约束取代标量期望成本约束的框架RAD,通过最优传输框架比较成本分布,引入分位数加权FSD约束,实证显示其提升无害性且增强分布外无害性评估的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13156 2026-07-07 cs.CV cs.AI 新提交 81%

Iterative Visual Thinking and the Self-Correction Mirage in VLM Grounding

迭代视觉思维:通过视觉反馈教会视觉语言模型空间自我修正

Animesh Tripathy, Aswanth Krishnan

机构 * QpiAI India Pvt. Ltd(QpiAI印度私人有限公司)

专题命中 后训练与偏好优化 :SFT(summary_cn,abstract_cn);language model(abstract);分类 cs.AI

AI总结 提出迭代视觉思维(IVT)框架,通过视觉反馈闭环和两阶段训练(SFT+GRPO),使视觉语言模型具备空间自我修正能力,在三个基准上提升指标2.4-3.2个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00602 2026-07-07 cs.CL 版本更新 81%

OpenSIR: Open-Ended Self-Improving Reasoner

OpenSIR: 开放式自我改进推理器

Wai-Chung Kwan, Joshua Ong Jun Leang, Pavlos Vougiouklis, Jeff Z. Pan, Marco Valentino, Pasquale Minervini

机构 * University of Edinburgh(爱丁堡大学) Imperial College London(伦敦帝国理工学院)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出OpenSIR框架,通过多样性奖励和难度校准实现开放式自我对弈,无需外部验证器或标注数据,在七个数学基准上平均提升指令模型3.6分、推理模型3.1分,且唯一能泛化到通用推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05659 2026-07-07 cs.CV cs.AI cs.LG 版本更新 81%

When Rubrics Fail: Error Enumeration as Reward in Reference-Free RL Post-Training for Virtual Try-On

当评分标准失效时:在无参考RL后训练中通过错误枚举作为奖励

Wisdom Ikezogwo, Mehmet Saygin Seyfioglu, Ranjay Krishna, Karim Bouyarmane

机构 * University of Washington, Seattle, USA(华盛顿大学(西雅图)) Amazon, Seattle, USA(亚马逊(西雅图)) Allen Institute for AI(艾伦人工智能研究所)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出隐式错误计数方法,用于解决无参考答案的RL后训练问题,通过计算错误而非正确来生成可靠奖励,在虚拟试穿任务中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02959 2026-07-07 cs.CV cs.LG 新提交 79%

Incentivizing Vision Language Models to Search for Long Video Question Answering

激励视觉语言模型进行长视频问答搜索

Harsh Goel, S P Sharan, Sahil Shah, Minkyu Choi, Joungbin An, Kristen Grauman, Sandeep P. Chinchali

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 后训练与偏好优化 :language model(title);post-training(abstract);分类 cs.LG

AI总结 研究将长视频问答从被动单流程感知任务转变为多轮检索过程,核心方法是自然语言驱动搜索及强化学习后训练,贡献是提升长视频理解基准测试分数。

Comments To appear at the European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02840 2026-07-07 cs.RO 新提交 78%

TACO: TActile World Model as a Self-COrrector forScalable VLA Post-Training

TACO:作为可扩展VLA训练后自校正器的触觉世界模型

Shengbang Liu, Yueru Jia, Yuyang Yan, Jiaming Liu, Xinran Zhang, Qiuxuan Feng, Yandong Guo, Shiji Zhou, Boxin Shi, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理技术国家重点实验室) AI 2 Robotics(人工智能与机器人研究所) Sun Yat-sen University(中山大学) Beihang University(北京航空航天大学)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 研究VLA模型在接触丰富任务中的问题,提出TACO框架,通过触觉感知世界模型驱动可扩展VLA训练后校正,结合多种方法提升策略,实验表明其能显著提高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21545 2026-07-07 cs.LG cs.AI 73%

Evidence for Limited Metacognition in LLMs

对大语言模型有限元认知能力的证据

Christopher Ackerman

专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出评估大语言模型元认知能力的新方法,发现前沿模型在事实和推理问题上的自信心评估和预测能力有限,且与人类存在显著差异。

Comments 26 pages, 25 figures

Journal ref The Fourteenth International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04590 2026-07-07 cs.AI 新提交 70%

Attention Limited Reward Learning

注意力受限奖励学习

Wenqian Xing

机构 * Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 研究通过基于理性注意力不集中的简化模型,探讨标准奖励建模中遗漏的内容,分离两种模糊性,指出有限注意力会扭曲成对比较结果,学习受标签携带的关注信息量而非数量影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03025 2026-07-07 cs.AI cs.MA 新提交 70%

Human-Centric Reflective Architecture for Human-AI Collaborative Decision-Making

用于人类与人工智能协作决策的以人类为中心的反思架构

Andreas Kouridakis, Dimitrios Patiniotis Spyropoulos, George Vouros

机构 * University of Piraeus(比雷埃夫斯大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究人类与人工智能协作决策问题,将其建模为随机博弈,提出以人类为中心的反思架构,整合人类校准模型与强化学习智能体,提升决策有效性并给出高质量建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20280 2026-07-07 cs.IR cs.AI 新提交 70%

ELVA: Exploring Ranking-Driven Universal Multimodal Retrieval

ELVA:探索排序驱动的通用多模态检索

Yuhan Liu, Pei Fu, Hang Li, Yukun Qi, Chao Jiang, Jingwen Fu, Zhen Liu, Bin Qin, Zhenbo Luo, Jian Luan, Jingmin Xin

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家级重点实验室) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) MiLM Plus Xiaomi Inc(小米公司) Zhongguancun Academy(中关村学院) Beijing, China(北京市)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ELVA框架,通过基于规则的强化学习缓解对比学习中的粒度盲视问题,在通用多模态检索中实现排序优化,并在新基准MRBench上提升13.1%。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18603 2026-07-07 cs.CV 版本更新 67%

Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth

Starve to Perceive: 通过受限视觉带宽驯服VLMs中的懒惰感知

Yuhuan Wu, Cong Wei, Fangzhen Lin, Wenhu Chen, Haozhe Wang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Technology University of Waterloo(滑铁卢大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)

AI总结 本文提出了一种新的训练方法,通过限制视觉带宽迫使视觉语言模型主动感知,从而提升其在高分辨率视觉环境中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06628 2026-07-07 cs.RO cs.CV 版本更新 67%

MIND-V: Hierarchical World Model for Long-Horizon Robotic Manipulation with RL-based Physical Alignment

MIND-V:基于强化学习物理对齐的长期机器人操作分层世界模型

Ruicheng Zhang, Mingyang Zhang, Jun Zhou, Xiaofan Liu, Zunnan Xu, Zhizhou Zhong, Puxin Yan, Haocheng Luo, Xiu Li

机构 * Tsinghua University(清华大学) X Square Robot(X Square机器人) Sun Yat-sen University(中山大学) HKUST(香港科技大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)

AI总结 提出MIND-V分层世界模型,通过语义推理、行为语义桥接和运动视频生成,结合强化学习物理对齐,实现长期机器人操作视频的物理合理合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03453 2026-07-07 cs.LG cs.AI 新提交 62%

Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning

最佳中的更优N:通过上下文学习生成预对齐响应

Eric Lei, Hsiang Hsu, Chun-Fu Chen

机构 * JPMorganChase Global Technology Applied Research(摩根大通全球技术应用研究)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 提出Best-of-Better-$N$框架应对响应质量限制问题,利用检索高奖励示例及重写步骤,通过上下文学习使预训练模型输出分布向高奖励区域转移,在安全对齐和数学推理基准测试中有更好表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04531 2026-07-07 cs.LG cs.AI cs.NA eess.SP math.NA 新提交 62%

Lyapunov-Guided Training for Hardware-Safe Neural Networks Under Fixed-Point Arithmetic

定点运算下硬件安全神经网络的李雅普诺夫引导训练

Anis Hamadouche, Amir Hussain

机构 * The School of Engineering & Physical Sciences(工程与物理科学学院) SDAIA-KFUPM Joint Research Centre for Artificial Intelligence(SDAIA-KFUPM人工智能联合研究中心) Heriot-Watt University(赫瑞-沃森大学) King Fahd University of Petroleum and Minerals(国王法赫德石油大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对定点运算中低精度神经网络的问题,提出李雅普诺夫稳定量化框架,通过层状李雅普诺夫函数监测隐藏状态能量,应用单调投影确保状态稳定,实验表明该方法可抑制激活溢出并恢复稳定学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10494 2026-07-07 cs.CL cs.LG 版本更新 62%

Coverage-Controlled Preference Mining from Noisy Claim Verification for Evidence-Grounded Generation

基于噪声声明验证的覆盖控制偏好挖掘用于基于证据的生成

Weixin Liu, Congning Ni, Qingyuan Song, Susannah L. Rose, Murat Kantarcioglu, Bradley A. Malin, Zhijun Yin

机构 * Vanderbilt University(范德比大学) Vanderbilt University Medical Center(范德比大学医学中心) Lirio Virginia Tech(弗吉尼亚理工大学)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.CL、cs.LG

AI总结 研究临床简要医院病程总结中基于证据生成的问题,引入VERI-DPO框架,将噪声声明验证转化为覆盖控制的摘要级偏好,经实验验证该框架能降低不支持率,提升模型表现。

Comments 15 pages, 1 figure, 8 tables. Major revision with locked MIMIC-IV transfer evaluation, blinded pairwise human assessment, matched multi-seed ablations, revised title, and revised author list

详情

展开后加载摘要…

URL PDF HTML 收藏