arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-21 至 2026-05-21 共收录 337 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 26 篇

2605.20756 2026-05-21 cs.LG cs.AI math.OC stat.ML 86%

Correcting Stochastic Update Bias in Preconditioned Language Model Optimizers

纠正预条件语言模型优化器中的随机更新偏差

Nikhil Nayak, Julia White, Urchade Zaratiana, Kelton Zhang, Henrijs Princis, Dhruv Atreja, Henry Fawcett, Matthew Thomas, George Hurn-Maloney, Ash Lewis

机构 * Fastino Labs(Fastino实验室)

专题命中 指令微调 :language model(title,abstract);instruction tuning(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了预条件优化器中随机更新规则的有限样本偏差问题,提出了一种单批次偏差校正框架,通过交叉拟合预条件估计和方差校正逆运算来减少梯度-预条件器耦合偏差和逆运算偏差,从而提升预条件优化器的性能。

Comments 32 pages, 3 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04128 2026-05-21 cs.GR cs.AI cs.CL cs.CV cs.LG 83%

JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation

JoyAI-Image: 激活统一多模态理解和生成中的空间智能

Lin Song, Wenbo Li, Guoqing Ma, Wei Tang, Bo Wang, Yuan Zhang, Yijun Yang, Yicheng Xiao, Jianhui Liu, Yanbing Zhang, Guohui Zhang, Wenhu Zhang, Hang Xu, Nan Jiang, Xin Han, Haoze Sun, Maoquan Zhang, Haoyang Huang, Nan Duan

机构 * Joy Future Academy, JD(京东探索研究院)

专题命中 指令微调 :large language model(abstract);language model(abstract);foundation model(abstract);instruction tuning(abstract)

AI总结 本文提出JoyAI-Image,一种统一的多模态基础模型,用于视觉理解、文本到图像生成和指令引导的图像编辑。该模型结合了空间增强的多模态大语言模型(MLLM)和多模态扩散Transformer(MMDiT),通过共享的多模态接口实现感知与生成的交互。构建可扩展的训练配方,结合统一指令微调、长文本渲染监督、空间 grounded 数据和通用及空间编辑信号,使模型具备广泛的多模态能力,同时增强几何感知推理和可控视觉合成。实验表明,JoyAI-Image在理解、生成、长文本渲染和编辑基准上达到最先进的性能。更重要的是,增强的理解、可控的空间编辑和新视角辅助推理之间的双向循环使模型超越一般视觉能力,向更强的空间智能发展。

Comments Code: https://github.com/jd-opensource/JoyAI-Image

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21217 2026-05-21 stat.ML cs.LG 81%

Federated LoRA Fine-Tuning for LLMs via Collaborative Alignment

通过协作对齐的联邦LoRA微调大型语言模型

Shuaida He, Liwen Chen, Long Feng

机构 * School of Computing & Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了在联邦学习环境下使用LoRA进行参数高效微调的问题,提出了一种名为CLAIR的框架,通过结构低秩加块稀疏分解来恢复共享LoRA子空间并检测污染客户端,从而在噪声情况下实现精确恢复,并在不同条件下实现稳定和一致的协作集恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11354 2026-05-21 cs.CV cs.AI cs.LG 81%

FunduSegmenter: Leveraging the RETFound Foundation Model for Joint Optic Disc and Optic Cup Segmentation in Retinal Fundus Images

FunduSegmenter:利用RETFound基础模型进行视网膜底照相图像中视盘和视杯联合分割

Zhenyi Zhao, Muthu Rama Krishnan Mookiah, Emanuele Trucco

机构 * University of Dundee(邓迪大学)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于RETFound基础模型的FunduSegmenter模型,通过引入一系列新颖模块实现视盘和视杯的联合分割,实验表明该模型在多个数据集上均优于现有方法。

Journal ref Trans. Vis. Sci. Tech. 2026;15(5):14

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20199 2026-05-21 cs.CL cs.AI 81%

FlowLM: Few-Step Language Modeling via Diffusion-to-Flow Adaptation

FlowLM: 通过扩散到流的适应实现少步语言建模

Runzhe Zhang, Letian Chen, Wenpeng Zhang, Zhouhan Lin, Peilin Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出FlowLM,一种通过高效微调从预训练的扩散语言模型转换而来的流匹配语言模型,通过将扩散模型的弯曲采样轨迹重新对齐为直线流,实现了高质量的少步生成,其质量可与甚至超越2000步扩散采样。此外,作者提出了一种更有效的流匹配训练目标:预测干净数据以持续引导采样过程向真实数据分布靠近。

Comments 26 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11499 2026-05-21 cs.CV 80%

What if Agents Could Imagine? Reinforcing Open-Vocabulary HOI Comprehension through Generation

如果智能体能够想象?通过生成强化开放词汇人-物交互理解

Zhenlong Yuan, Yue Wang, Dapeng Zhang, Kejin Cui, Rui Chen, Jing Tang, Lei Sun, Hongwei Yu, Chengxuan Qian, Xiangxiang Chu, Shuo Li, Yuyin Zhou

机构 * Dream-X Team(Dream-X团队) Stanford University(斯坦福大学) National University of Singapore(新加坡国立大学) Independent Researcher(独立研究者) Case Western Reserve University(凯斯西储大学) UC Santa Cruz(加州大学圣克鲁兹分校)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出ImagineAgent框架,通过生成式世界建模和工具增强强化学习,解决开放词汇人-物交互理解中的跨模态幻觉和视角限制问题,实现了高效且鲁棒的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21485 2026-05-21 cs.LG 79%

EvoStruct: Bridging Evolutionary and Structural Priors for Antibody CDR Design via Protein Language Model Adaptation

EvoStruct: 通过蛋白质语言模型适应桥接进化和结构先验以进行抗体CDR设计

Mansoor Ahmed, Sujin Lee, Umar Khayaz, Murray Patterson

机构 * Georgia State University, Atlanta, USA(佐治亚州立大学,亚特兰大,美国) Georgia Institute of Technology, Atlanta, USA(佐治亚理工学院,亚特兰大,美国)

专题命中 指令微调 :language model(title,abstract);分类 cs.LG

AI总结 本文提出EvoStruct方法,通过蛋白质语言模型适应桥接进化和结构先验,解决抗体CDR设计中的词汇崩溃问题,提升了氨基酸恢复率和降低困惑度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20289 2026-05-21 cs.LG cs.AI 79%

Plug-and-Play Spiking Operators: Breaking the Nonlinearity Bottleneck in Spiking Transformers

插件式脉冲运算符:突破脉冲变换器中的非线性瓶颈

Xinzhe Yuan, Xiang Peng, Bin Gu, Huan Xiong

机构 * IASM, Harbin Institute of Technology, China(哈尔滨工业大学人工智能研究所,中国) School of Artificial Intelligence, Jilin University, China(吉林大学人工智能学院,中国)

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种插件式框架,通过将Transformer中的非线性运算分解为三个基本算子(除法、指数和ℓ2范数),并利用LIF神经元群体和轻量级位移缩放实现脉冲友好的近似,从而在不需微调的情况下支持常见的Transformer非线性运算。

Comments Accepted to ICML 2026. 9 pages main paper, 8 pages appendix, 6 figures, 5 tables. Correspondence to Bin Gu and Huan Xiong

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20640 2026-05-21 cs.CV cs.AI 77%

Pareto-Enhanced Portrait Generation: Vision-Aligned Text Supervision for Alignment, Realism, and Aesthetics

帕累托优化的肖像生成:用于对齐、真实性和美学的视觉对齐文本监督

Yunlong Wang, Jinjin Shi, Wenbin Gao, Xuran Xu, Runyu Shi, Ying Huang

专题命中 指令微调 :SFT(abstract,abstract_cn);foundation model(abstract);分类 cs.AI

AI总结 本文提出了一种多模态扩散变换器(MM-DiT)的特征监督方法,通过引入轻量级的跨模态对齐机制,隐式提取多粒度的视觉对齐文本表示,以提升文本-图像对齐、真实性和美学质量,从而在Pareto前沿上实现协同改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20936 2026-05-21 cs.LG cs.AI cs.CL 75%

DASH: Fast Differentiable Architecture Search for Hybrid Attention in Minutes on a Single GPU

DASH:在单个GPU上几分钟内完成的快速可微架构搜索用于混合注意力

Weizhe Chen, Miao Zhang, Junpeng Jiang, Yaping Li, Weili Guan, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出DASH,一种快速可微架构搜索框架,用于混合注意力架构设计,通过将离散的层间注意力操作放置转化为连续的架构logits,准备可重用的教师对齐线性候选,并在模型和操作权重冻结的情况下进行架构仅搜索,显著提高了搜索效率。DASH在Qwen2.5-3B-Instruct上优于现有的所有选择器风格的混合注意力设计基线,展示了直接可微搜索可以发现更强的混合架构。此外,DASH在RULER性能上优于已发布的Jet-Nemotron模型,同时在重叠的短上下文和通用基准上保持竞争力。值得注意的是,每个DASH搜索运行仅使用12.3M tokens,并在单个RTX Pro 6000 GPU上仅需约20分钟,对应Jet-Nemotron报告的PostNAS搜索tokens的0.006%。这些结果表明,通过分钟级的可微搜索可以获得高质量的混合注意力架构,为混合架构设计提供了有前景的方向。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21147 2026-05-21 cs.LG cs.CL 73%

SMoA: Spectrum Modulation Adapter for Parameter-Efficient Fine-Tuning

SMoA:用于参数高效微调的频谱调制适配器

Yongkang Liu, Xing Li, Mengjie Zhao, Shanru Zhang, Zijing Wang, Qian Li, Shi Feng, Feiliang Ren, Daling Wang, Hinrich Schütze

机构 * Northeastern University, China(东北大学,中国) Shandong University, China(山东大学,中国) CIS, LMU Munich, Germany(慕尼黑莱布尼茨大学CIS中心,德国) MCML, Germany(德国MCML)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出SMoA,一种频谱感知更新的适配器,通过在较小的参数预算下扩大可访问的频谱更新家族,提升参数高效微调的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20270 2026-05-21 cs.LG cs.AI stat.ML 73%

Conformal Selective Acting: Anytime-Valid Risk Control for RLVR-Trained LLMs

conformal selective acting: any-time-valid risk control for rlvr-trained llms

Hamed Khosravi, Xiaoming Huo

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究提出了一种 conformal selective acting 方法,用于在 rlvr 训练的 llms 部署中实现 anytime-valid 的风险控制,通过在部署要求下强制一个空单元,利用 e-process 和 bonferroni 网格来维护 pathwise 有效性,同时在多个基准测试中证明了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12960 2026-05-21 cs.CL 70%

DiM\textsuperscript{3}: Bridging Multilingual and Multimodal Models via Direction- and Magnitude-Aware Merging

DiM\textsuperscript{3}: 通过方向和幅度感知融合连接多语言和多模态模型

Zijing Wang, Mingyang Wang, Ercong Nie, Yongkang Liu, Shi Feng, Mengjie Zhao, Daling Wang, Xiaocui Yang, Hinrich Schütze

机构 * Northeastern University, China(东北大学,中国) CIS, LMU Munich, Germany(慕尼黑莱布尼茨大学计算机学院,德国) Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心(MCML),德国) Shanghai Jiao Tong University, China(上海交通大学,中国)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出DiM3方法,通过在共享语言模型骨干中融合残差更新,实现多语言和多模态能力的无缝整合,从而提升多语言性能并保持多模态能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20316 2026-05-21 cs.CV cs.AI 70%

FullFlow: Upgrading Text-to-Image Flow Matching Models for Bidirectional Vision--Language Generation

FullFlow: 通过双向视觉-语言生成升级文本到图像流匹配模型

Eric Tillmann Bill, Enis Simsar, Alessio Tonioni, Thomas Hofmann

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌)

专题命中 指令微调 :language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出FullFlow方法,通过仅训练LoRA适配器和轻量级文本头部,将预训练的rectified-flow文本到图像模型升级为双向视觉-语言生成器,从而在保持图像连续流的同时添加文本离散插入过程,提升文本到图像和图像到文本的生成质量。

Comments project page: https://ericbill21.github.io/fullflow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03296 2026-05-21 cs.CL cs.AI 62%

A Systematic Comparison between Extractive Self-Explanations and Human Rationales in Text Classification

抽取式自我解释与人类推理在文本分类中的系统比较

Stephanie Brandl, Oliver Eberle

机构 * Center for Social Data Science(社会科学数据科学中心) University of Copenhagen(哥本哈根大学) Machine Learning Group(机器学习小组) Technische Universität Berlin(柏林技术大学)

专题命中 指令微调 :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 本文比较了抽取式自我解释与人类推理在文本分类任务中的有效性,通过分析不同任务和语言的解释质量,发现自我解释在文本长度和任务复杂度上与人类推理存在显著差异。

Comments accepted to the Trustworthy NLP Workshop, co-located with ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20674 2026-05-21 cs.LG 57%

Modular Multimodal Classification Without Fine-Tuning: A Simple Compositional Approach

无需微调的模块化多模态分类:一种简单的组合方法

Herman Bergström, Aditya Mehrotra, Rahul G. Krishnan

机构 * Chalmers University of Technology and University of Gothenburg(查尔姆斯理工大学和哥德堡大学) Vector Institute(向量研究所) University of Toronto(多伦多大学)

专题命中 指令微调 :foundation model(abstract);分类 cs.LG

AI总结 本文提出CoMET,一种无需微调的多模态分类方法,通过冻结预训练的backbone对每个模态进行处理,使用PCA压缩嵌入并输入到表格基础模型中进行预测,展示了PCA作为适配器在不同模态上的强大鲁棒性能,并提出了PALPooling来提升表示质量,实现了无需训练的多模态学习最佳结果。

Comments 30 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15691 2026-05-21 cs.LG 57%

SEED: Targeted Data Selection by Weighted Independent Set

SEED:通过加权独立集实现目标数据选择

Yuan Zhang, Lifeng Guo, Junwen Pan, Wenzhao Zheng, Wen Zhou, Kuan Cheng, Kurt Keutzer, Shanghang Zhang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Beijing University of Posts and Telecommunications(北京邮电大学) Tianjin University(天津大学) EECS, UC Berkeley(伯克利大学电子工程与计算机科学系) Chinese Academy of Sciences(中国科学院)

专题命中 指令微调 :instruction tuning(abstract);分类 cs.LG

AI总结 本文提出SEED方法,通过将数据选择问题建模为加权独立集(WIS)在相似性图上,解决样本质量与多样性之间的平衡问题,并引入节点价值校准和局部尺度归一化来提升数据选择的鲁棒性和可扩展性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21060 2026-05-21 cs.CV 50%

Clinically-Informed Modeling for Pediatric Brain Tumor Classification from Whole-Slide Histopathology Images

基于临床信息的儿童脑肿瘤全切片病理图像分类建模

Joakim Nguyen, Jian Yu, Jinrui Fang, Nicholas Konz, Tianlong Chen, Sanjay Krishnan, Chandra Krishnan, Ying Ding, Hairong Wang, Ankita Shukla

机构 * Dept. of Computer Science(计算机科学系) University of Texas at Austin(德克萨斯大学奥斯汀分校) School of Information(信息学院) Dell Children's Medical Center(德尔儿童医学中心) Dept. of OREI(OREI部门) University of Nevada, Reno(内华达大学里诺分校)

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出一种结合临床信息的对比学习框架,用于在有限数据和类别不平衡条件下提高儿童脑肿瘤全切片图像的细粒度分类性能。

Comments Accepted at the IEEE International Conference on Healthcare Informatics (ICHI), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 22 篇

2605.06139 2026-05-21 cs.LG cs.AI 92%

Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex

列表式策略优化:基于组的RLVR作为LLM响应单纯形上的目标投影

Yun Qu, Qi Wang, Yixiu Mao, Heming Zou, Yuhang Jiang, Yingyue Li, Wutong Xu, Lizhou Cai, Weijie Liu, Clive Bai, Kai Yang, Yangkun Chen, Saiyong Yang, Xiangyang Ji

机构 * Department of Automation, Tsinghua University(清华大学自动化系) LLM Department, Tencent(腾讯LLM部门)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出列表式策略优化(LPO),通过显式执行目标投影来解构隐式目标,利用响应单纯形限制近端RL目标,并通过精确散度最小化进行策略投影,从而在多样推理任务和LLM基础上提升训练性能,同时保持优化稳定性和响应多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20834 2026-05-21 cs.AI cs.LG 91%

Conditional Equivalence of DPO and RLHF: Implicit Assumption, Failure Modes, and Provable Alignment

DPO与RLHF的条件等价性:隐含假设、失败模式与可证明对齐

Zhiqin Yang, Yonggang Zhang, Wei Xue, Dong Fang, Bo Han, Yike Guo

机构 * The Hong Kong University of Science(香港科技大学) Hong Kong Baptist University(香港 Baptist 大学)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了DPO与RLHF的等价性问题,指出其等价性依赖于一个隐含假设,当该假设不成立时,DPO会优化相对优势而非绝对对齐,从而导致路径性收敛。作者提出CPO方法,通过引入约束实现可证明对齐,并通过几何解释揭示DPO的margin ranking机制。

Comments 49 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20285 2026-05-21 cs.LG cs.AI 91%

Introspective X Training: Feedback Conditioning Improves Scaling Across all LLM Training Stages

反思式X训练:反馈条件化提升跨所有LLM训练阶段的扩展性

Brandon Cui, Ximing Lu, Jaehun Jung, Syeda Nahida Akter, Hyunwoo Kim, Yuxiao Qu, David Acuna, Shrimai Prabhumoye, Yejin Choi, Prithviraj Ammanabrolu

机构 * NVIDIA University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) UC San Diego(南加州大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出反思式训练(IXT),通过利用后续阶段的动态来改进早期阶段,从而提高LLM训练的扩展效率,实验表明该方法在计算效率和性能上均有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21295 2026-05-21 cs.LG cs.AI cs.HC 90%

TimeSRL: Generalizable Time-Series Behavioral Modeling via Semantic RL-Tuned LLMs -- A Case Study in Mental Health

TimeSRL: 通过语义RL调优的LLM实现通用的时间序列行为建模 -- 一项心理健康应用的案例研究

Yuang Fan, Lilin Xu, Millie Wu, Jingping Nie, Qingyu Chen, Yuzhe Yang, Zhuo Zhang, Xin Liu, Subigya Nepal, Xiaofan Jiang, Xuhai "Orson" Xu

机构 * Columbia University(哥伦比亚大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Yale University(耶鲁大学) University of California, Los Angeles(加州大学洛杉矶分校) Google(谷歌) University of Virginia(弗吉尼亚大学)

专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TimeSRL,一种两阶段LLM框架,通过显式的语义瓶颈路由预测,将原始信号抽象为高级自然语言,从而预测行为结果,该方法在心理健康预测中实现了最先进的跨群体泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16517 2026-05-21 cs.SE 89%

Customizing an LLM for Enterprise Software Engineering

为企业软件工程定制LLM

Aditya Kini, Satish Chandra, Milad Hashemi, Saksham Thakur, Aditya Pandey, Vincent Nguyen, Marc Brockschmidt, Franjo Ivančić, Danny Tarlow, Parthasarathy Ranganathan, Petros Maniatis, Ahmed Omran, Zaheer Abbas, Anita Gergely, Martin Sevenich, Gufeng Zhang, Amy Hua, Alexander Frömmgen

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(abstract)

AI总结 本文提出Gemini for Google,一种专为企业内部软件工程生态系统定制的LLM,通过端到端开发和中间训练策略,显著提升了开发效率和代码存活率,为其他组织提供了可复制的数据利用路径。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20994 2026-05-21 cs.CL cs.AI 88%

Towards Context-Invariant Safety Alignment for Large Language Models

面向大语言模型的上下文不变安全对齐

Yixu Wang, Yang Yao, Xin Wang, Yifeng Gao, Yan Teng, Xingjun Ma, Yingchun Wang

机构 * Fudan University, Shanghai, China(复旦大学,上海,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)

专题命中 后训练与偏好优化 :large language model(title);language model(title);post-training(abstract);preference optimization(abstract)

AI总结 本文提出了一种上下文不变的安全对齐方法,通过引入锚点不变正则化(AIR)来提升模型在不同上下文中的鲁棒性,从而增强安全约束对对抗性框架的抵抗力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20408 2026-05-21 cs.LG 88%

Spectral Souping: A Unified Framework for Online Preference Alignment

谱汤:一种在线偏好对齐的统一框架

Yinlam Chow, Guy Tennenholtz, Ted Yun, James Harrison, Arthur Gretton, Andre Barreto, Bo Dai

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出了一种统一的在线偏好对齐框架Spectral Souping,通过发现LLM中的通用谱表示,实现了高效的模型合并,从而在不需昂贵在线重训练的情况下快速适应个体用户偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21225 2026-05-21 cs.LG cs.AI 87%

PREFINE: Preference-Based Implicit Reward and Cost Fine-Tuning for Safety Alignment

PREFINE: 基于偏好的隐式奖励和成本微调以实现安全对齐

Richa Verma, Bavish Kulur, Sanjay Chawla, Balaraman Ravindran

机构 * TCS Research, \ of CSE, IIT Madras India Department of Computing Science, \ of Alberta Canada Qatar Computing Research Institute, \ Bin Khalifa University Qatar Department of Data Science \& AI, Wadhwani School of Data Science \& AI, IIT Madras India TCS Research, \ of CSE, IIT Madras Department of Computing Science, \ of Alberta Qatar Computing Research Institute, \ Bin Khalifa University Department of Data Science \& AI, Wadhwani School of Data Science \& AI, IIT Madras

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);language model(abstract);preference optimization(abstract)

AI总结 该研究提出PREFINE方法,通过基于偏好的隐式奖励和成本微调,在连续控制环境中实现安全策略对齐,通过微调预训练强化学习策略以生成低成本行为同时保持高奖励。

Comments Accepted at AAMAS 2026 as a full paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21266 2026-05-21 cs.LG cs.AI 86%

How Much Online RL is Enough? Informative Rollouts for Offline Preference Optimization in RLVR

在线强化学习需要多少?用于RLVR中离线偏好优化的信息性回放

Richa Verma, Balaraman Ravindran

机构 * TCS Research Department of CSE(TCS计算机科学系研究部) IIT Madras(印度理工学院马德拉斯分校) Department of Data Science & AI(数据科学与人工智能系) Wadhwani School of Data Science & AI(Wadhwani数据科学与人工智能学院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);SFT(abstract);分类 cs.AI、cs.LG

AI总结 本文提出G2D方法,通过短时GRPO预热、构建静态偏好数据集和离线DPO微调,以较低的计算成本实现优于GRPO的性能,强调偏好数据信息性而非数量的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21123 2026-05-21 cs.CV cs.LG 79%

Linear-DPO: Linear Direct Preference Optimization for Diffusion and Flow-Matching Generative Models

Linear-DPO: 用于扩散和流匹配生成模型的线性直接偏好优化

Kesong Li, Yixuan Xu, Kuo-kun Tseng, Weiyi Lu, Kan Liu, Tao Lan

机构 * School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

AI总结 本文提出Linear-DPO,通过统一的反向时间SDE框架推导出涵盖扩散和流匹配的通用DPO目标,指出标准DPO目标在文本到图像生成中不最优,并通过定性定量实验验证了其在扩散模型和流匹配模型上的优越性。

Comments Code and models are available at: https://github.com/Whynot0101/Linear-DPO . Work done during an internship at Alibaba Group

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20696 2026-05-21 cs.LG 79%

Distributed Direct Preference Optimization

分布式直接偏好优化

Zhanhong Jiang

机构 * Translational AI Center, Iowa State University, Ames, USA(翻译人工智能中心,爱荷华州立大学,爱荷华州阿姆斯)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

AI总结 本文研究了在分布式环境中直接偏好优化(DPO)的收敛性和时间复杂度,分析了联邦学习和去中心化学习中偏好数据碎片化对优化动态的影响,并提出了具有理论保证的鲁棒且可扩展的实现实现方法。

Comments 29 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04068 2026-05-21 cs.CV cs.AI 79%

Mind the Generative Details: Direct Localized Detail Preference Optimization for Video Diffusion Models

注意生成细节:面向视频扩散模型的直接局部化细节偏好优化

Zitong Huang, Kaidong Zhang, Yukang Ding, Chao Gao, Rui Ding, Ying Chen, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Alibaba Group - Taobao & Tmall Group(阿里巴巴集团-淘宝 & 天猫集团)

专题命中 后训练与偏好优化 :preference optimization(title);post-training(abstract);分类 cs.AI

AI总结 本文提出LocalDPO,一种新的后训练框架,通过从真实视频中构建局部偏好对,并在时空区域层面优化对齐,以提高视频生成的质量和人类偏好评分。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏