arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 5534 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 430 篇

2603.17426 2026-06-29 cs.CV 版本更新 50%

SHIFT: Motion Alignment in Video Diffusion Models with Adversarial Hybrid Fine-Tuning

SHIFT: 视频扩散模型中的运动对齐与对抗混合微调

Xi Ye, Wenjia Yang, Yangyang Xu, Xiaoyang Liu, Duo Su, Mengfei Xia, Jun Zhu

机构 * Tsinghua University(清华大学) Ant Group(蚂蚁集团) University of Chinese Academy of Science(中国科学院大学)

专题命中 指令微调 :post-training(abstract)

AI总结 针对视频扩散模型微调后运动保真度下降的问题,提出基于像素通量动力学的像素运动奖励和SHIFT框架(平滑混合微调),通过对抗优势改进收敛并缓解奖励黑客,有效解决动态度坍塌。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21970 2026-06-29 cs.RO 版本更新 50%

StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision

StereoVLA:利用立体视觉增强视觉-语言-动作模型

Shengliang Deng, Mi Yan, Yixin Zheng, Jiayi Su, Wenhao Zhang, Yitao Zeng, Xiaoguang Zhao, Heming Cui, Zhizheng Zhang, He Wang

机构 * Galbot CFCS, School of CS, Peking University(北京大学计算机学院CFCS) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) The University of Hong Kong(香港大学) Xiamen University Malaysia(厦门大学马来西亚分校) Southern University of Science and Technology(南方科技大学)

专题命中 指令微调 :foundation model(abstract)

AI总结 提出StereoVLA,首个利用大规模合成立体数据引入丰富几何线索的VLA模型,通过几何与语义联合编码和协同训练目标,在真实实验中成功率绝对提升33.4%,并展现出对近半球视角的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02564 2026-06-26 cs.CV 版本更新 50%

VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization

VLMs 是视频推理的好老师:通过自适应测试时优化

Junhao Cheng, Liang Hou, Tianxiong Zhong, Xin Tao, Pengfei Wan, Kun Gai, Jing Liao

机构 * City University of Hong Kong(香港城市大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 指令微调 :language model(abstract)

AI总结 提出将视觉语言模型(VLM)作为“教师”,通过提取任务规则并设计可微分奖励,指导视频生成模型(VGM)在测试时在线优化轻量级 LoRA 模块,从而提升视频推理的泛化能力。

Comments Project Page: https://VLM-as-Teacher.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20237 2026-06-23 cs.CV 版本更新 50%

AnimeAdapter: A Modular Adapter for Appearance-Consistent Anime Character Generation

AnimeAdapter: 细粒度且一致的零样本动漫人物生成

Yixuan Han

机构 * National University of Singapore, Singapore(新加坡国立大学)

专题命中 指令微调 :language model(abstract)

AI总结 本文提出了一种轻量级的外观适配器,用于在多样编辑条件下实现可控且一致的动漫人物生成,通过注入单张参考图像的细粒度视觉特征到扩散过程中,并结合CLIP的局部空间化特性,开发出语义选择性局部注意力机制,进一步解耦人物外观与空间布局,从而实现高效的动漫人物生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03156 2026-06-18 cs.CV 版本更新 50%

CAMEO: A Conditional and Quality-Aware Multi-Agent Image Editing Orchestrator

CAMEO: 一种条件感知与质量驱动的多智能体图像编辑编排器

Yuhan Pu, Hao Zheng, Ziqian Mo, Zirui Pang, Hill Zhang, Tianyi Fan, Shuhong Wu, Jiaheng Wei

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Harbin Institute of Technology(哈尔滨工业大学) Shenzhen University(深圳大学) Claremont McKenna College(克莱蒙特麦肯纳学院) Research Institute of Petroleum Exploration and Development, CNPC(石油勘探开发研究院,中石油)

专题命中 指令微调 :prompting(abstract)

AI总结 提出CAMEO多智能体框架,将条件图像编辑重构为质量感知的反馈驱动过程,通过分解编辑阶段、嵌入评估循环,在异常插入和人体姿态切换任务中平均胜率提升20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20436 2026-06-11 cs.CV 版本更新 50%

Lighting-aware Unified Model for Instance Segmentation

考虑光照的实例分割统一模型

Qisai Liu, Alloy Das, Zhanhong Jiang, Joshua R. Waite, Aditya Balu, Adarsh Krishnamurthy, Soumik Sarkar

机构 * Iowa State University(爱荷华州立大学)

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出了一种考虑光照的实例分割统一模型,通过开发Lighting Convolutional-Attention模块,在不微调重型主干网络的情况下提升分割鲁棒性,实验结果表明该方法能有效解决光照变化带来的领域差距问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05203 2026-06-11 cs.RO 版本更新 50%

SIL: Symbiotic Interactive Learning for Language-Conditioned Human-Agent Co-Adaptation

SIL: 语言条件的人机协同适应的共生交互学习

Linus Nwankwo, Bjoern Ellensohn, Christian Rauch, Elmar Rueckert

机构 * Technical University of Leoben(莱博恩技术大学)

专题命中 指令微调 :foundation model(abstract)

AI总结 提出共生交互学习(SIL)框架,实现人类与智能体在共享潜在任务空间中的双向协同适应,通过联合信念状态、FM空间推理和记忆架构,在指令跟随等任务中达到90.4%完成率和0.83信念对齐分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08195 2026-06-11 cs.CV 版本更新 50%

UI2Code^N: UI-to-Code Generation as Interactive Visual Optimization

UI2Code^N: 将UI到代码生成视为交互式视觉优化

Zhen Yang, Wenyi Hong, Mingde Xu, Xinyue Fan, Weihan Wang, Jiale Cheng, Xiaotao Gu, Jie Tang

机构 * Zhejiang University(浙江大学)

专题命中 指令微调 :language model(abstract)

AI总结 提出将UI截图转代码任务重构为交互式视觉优化问题,采用基于偏好的强化学习方法RVPO优化视觉排名,在UI起草、润色和编辑任务上达到SOTA。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13446 2026-06-10 cs.RO 版本更新 50%

CAST: Counterfactual Labels Improve Instruction Following in Vision-Language-Action Models

CAST: 反事实标签提升视觉-语言-动作模型中的指令跟随能力

Catherine Glossop, William Chen, Arjun Bhorkar, Dhruv Shah, Sergey Levine

机构 * University of California Berkeley(加州大学伯克利分校) Princeton University(普林斯顿大学)

专题命中 指令微调 :language model(abstract)

AI总结 针对VLA模型难以遵循细粒度指令的问题,提出利用视觉语言模型生成反事实标签增强数据集,提升语言基础多样性,实验表明该方法在导航和操作任务中显著提升指令跟随成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29569 2026-06-09 cs.CR 版本更新 50%

LoRA-Key: User-Centric LoRA Watermarking for Text-to-Image Diffusion Models

LoRA-Key:面向用户的文本到图像扩散模型LoRA水印

Yaopeng Wang, Qingliang Wang, Zhibo Wang, Huiyu Xu, Jiacheng Du, Qiu Wang, Jia-Li Yin, Kui Ren

专题命中 指令微调 :foundation model(abstract)

AI总结 提出LoRA-Key框架,通过可重用的用户特定水印LoRA实现版权保护,无需重新训练或修改目标LoRA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05478 2026-06-09 eess.AS 版本更新 50%

AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning

AQA-TTRL:音频问答中的测试时强化学习自适应

Haoyu Zhang, Jiaxian Guo, Dong Yang, Yusuke Iwasawa, Yutaka Matsuo

专题命中 指令微调 :language model(abstract)

AI总结 提出AQA-TTRL框架,通过测试时强化学习利用无标签数据实现音频语言模型的在线自适应,采用多数投票生成伪标签、置信度加权和多次采样策略,在MMAU等基准上显著提升性能。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17870 2026-06-09 cond-mat.mtrl-sci 版本更新 50%

General Learning of the Electric Response of Inorganic Materials

无机材料电响应的通用学习

Bradley A. A. Martin, Alex M. Ganose, Venkat Kapil, Tingwei Li, Keith T. Butler

专题命中 指令微调 :foundation model(abstract)

AI总结 提出MACE-Field场感知等变势,通过精确微分获得极化、玻恩有效电荷和极化率,实现跨化学体系的铁电与介电响应预测。

Comments 22 pages, 12 figures, 43 equations

Journal ref PRX Intelligence 1, 013006 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11890 2026-06-08 cs.SE 版本更新 50%

QUARE: Quality-Aware Requirements Analysis through Multi-Agent Dialectical Negotiation

QUARE:通过多智能体辩证协商进行质量感知的需求分析

Haowei Cheng, Milhan Kim, Foutse Khomh, Teeradaj Racharak, Nobukazu Yoshioka, Naoyasu Ubayashi, Hironori Washizaki

专题命中 指令微调 :LLM(abstract)

AI总结 QUARE通过多智能体辩证协商解决需求质量分析中的多属性冲突,生成高质量需求规格,提升合规性和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 257 篇

2605.04539 2026-07-20 cs.CL cs.AI 版本更新 95%

RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization

RLearner-LLM: 通过混合直接偏好优化平衡大语言模型中的逻辑性与流畅性

Qiming Bao, Juho Leinonen, Paul Denny, Michael J. Witbrock

机构 * University of Auckland(奥克兰大学) Aalto University(阿alto大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);preference optimization(title,abstract);large language model(title);language model(title)

AI总结 本文提出RLearner-LLM,通过融合DeBERTa-v3 NLI信号与验证器LLM评分,解决直接偏好优化在知识密集型生成中的逻辑对齐问题,实现NLI指标显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25148 2026-06-19 cs.AI 版本更新 94%

AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models

AAPA:用于大型语言模型后训练的对抗锚定偏好对齐

Faqiang Qian, Kang An, Weikun Zhang, Ziliang Wang, Xuhui Zheng, Liangjian Wen, Yong Dai, Mengya Gao, Yichao Wu

机构 * Southwest University of Finance and Economics(西南财经大学)

专题命中 后训练与偏好优化 :SFT(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);post-training(title,abstract)

AI总结 提出AAPA框架,通过固定轻量判别器对策略输出与专家响应进行句子级对抗锚定,增强SFT、GRPO等后训练目标,在指令遵循基准上持续提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03520 2026-06-11 cs.LG cs.AI cs.SY eess.SY 版本更新 94%

Certifiable Safe RLHF: Semantic Grounding and Fixed Penalty Constraint Optimization for Safer LLM Alignment

可认证安全RLHF:基于语义基础与固定惩罚约束优化的更安全大语言模型对齐

Kartik Pandit, Sourav Ganguly, Arnesh Banerjee, Shaahin Angizi, Arnob Ghosh

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) New Jersey Institute of Technology(新泽西理工学院) Department of Computer Engineering(计算机工程系) Heritage Institute of Technology(遗产理工学院)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对现有RLHF方法依赖奖励/成本函数和双变量调优导致性能敏感且缺乏可证明安全保证的问题,提出CS-RLHF,通过语义基础成本模型和固定惩罚约束优化,实现可认证安全对齐,效率提升至少5倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10812 2026-08-13 cs.CL cs.AI 版本更新 94%

Reference-Free Post-Training of Open Large Language Models for Multilingual Machine Translation

面向多语言机器翻译的开源大语言模型无参考后训练

Chris Han, Pengzhi Gao, Pei Fu, Jian Luan

机构 * Xiaomi Inc.(小米公司)

专题命中 后训练与偏好优化 :SFT(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);post-training(title,abstract)

AI总结 该研究针对多语言机器翻译,以开源大语言模型为对象,采用GRPO算法结合无参考质量评估奖励,通过检查点插值得到MiLMMT-46-v1.0,其翻译质量优于SFT模型及多款开源基线,在无参考评分上领先于谷歌翻译等专有系统,还发布了相关模型与代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16557 2026-07-31 cs.LG cs.CL cs.CV 版本更新 93%

S-GRPO: Unified Post-Training for Large Vision-Language Models

S-GRPO:面向大视觉语言模型的统一后训练方法

Yuming Yan, Kai Tang, Sihong Chen, Ke Xu, Dan Hu, Qun Yu, Pengfei Hu

机构 * Tencent(腾讯)

专题命中 后训练与偏好优化 :SFT(summary_cn,abstract);language model(title,abstract);post-training(title,abstract);preference optimization(abstract)

AI总结 本文提出S-GRPO,结合模仿学习指导与偏好优化的多轨迹探索,通过条件真实轨迹注入机制解决SFT与RL的效率问题,提升收敛速度与领域适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16411 2026-08-12 cs.CV cs.AI cs.CL cs.DB cs.LG 版本更新 93%

Grounded Post-Training with Hard Examples for Reducing Hallucination in Multimodal Large Language Models

通过分布偏移下的分阶段偏好优化减少视觉-语言模型中的幻觉

Qinwu Xu

机构 * Meta AI

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(title);post-training(title);LLM(abstract,abstract_cn)

AI总结 本文提出分阶段偏好优化框架,通过构建针对幻觉问题的数据集,提升视觉-语言模型的 grounded reasoning,减少幻觉并提高响应信息量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06337 2026-08-06 cs.CL cs.AI cs.LG 版本更新 93%

Can Post-Training Transform LLMs into Causal Reasoners?

训练后能否将大语言模型转变为因果推理者?

Junqi Chen, Sirui Chen, Chaochao Lu

机构 * Shanghai Artificial Intelligence Library(上海人工智能图书馆) Fudan University(复旦大学) Tongji University(同济大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(title,abstract);SFT(abstract,abstract_cn);large language model(abstract)

AI总结 本文通过CauGym数据集评估了训练后方法对LLM因果推理能力的提升,发现适当训练可使小型模型在因果推理任务中超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12843 2026-06-25 cs.LG cs.AI 版本更新 92%

Bias Fitting to Mitigate Length Bias of Reward Model in RLHF

偏差拟合以缓解RLHF中奖励模型的长度偏差

Kangwen Zhao, Jianfeng Cai, Jinhua Zhu, Ruopei Sun, Dongyun Xue, Wengang Zhou, Li Li, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 提出FiMi-RM框架,通过自学习长度与奖励的非线性关系并解耦,有效缓解RLHF中奖励模型因长度偏差导致的奖励破解问题。

Comments 16 pages, 12 figures. Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04879 2026-06-15 cs.LG cs.AI cs.CL 版本更新 92%

Rethinking the Trust Region in LLM Reinforcement Learning

重新思考LLM强化学习中的信任区域

Penghui Qi, Xiangxin Zhou, Zichen Liu, Tianyu Pang, Chao Du, Min Lin, Wee Sun Lee

机构 * University of California, Berkeley(加州大学伯克利分校) University of Toronto(多伦多大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对PPO在LLM微调中因词表大导致的训练不稳定问题,提出基于策略散度直接约束的DPPO算法,并引入高效近似方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29758 2026-07-28 cs.LG cs.AI 版本更新 92%

PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF

PS-PPO: 用于无评论者RLHF的前缀采样PPO

Doo Hwan Hwang, Kee-Eung Kim

专题命中 后训练与偏好优化 :RLHF(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出PS-PPO方法,通过前缀采样和重要性加权修正,在无评论者RLHF中减少训练计算和内存,保持准确率。

Journal ref ICML 2026 published

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08076 2026-07-22 cs.CL cs.AI cs.CY 版本更新 92%

"I understand your perspective": LLM Persuasion through the Lens of Communicative Action Theory

“我理解你的观点”:通过交往行动理论视角看LLM的说服与谄媚

Esra Dönmez, Agnieszka Falenska

机构 * Institute for Natural Language Processing, University of Stuttgart(斯图加特大学自然语言处理研究所) Interchange Forum for Reflecting on Intelligent Systems, University of Stuttgart(斯图加特大学智能系统反思交流论坛)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究基于哈贝马斯的交往行动理论,通过模拟Reddit讨论,发现LLM能有效传达言外之意(如建立信任),其谄媚策略与观点改变强相关,且人类更偏好LLM生成的论证。

Journal ref Findings of the Association for Computational Linguistics: ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06547 2026-07-21 cs.LG cs.AI 版本更新 92%

FAIR-Calib: Frontier-Aware Instability-Reweighted Calibration for Post-Training Quantization of Diffusion Large Language Models

FAIR-Calib:面向扩散大语言模型训练后量化的前沿感知不稳定重加权校准

Haoyu Huang, Linlin Yang, Sheng Xu, Boyu Liu, Guodong Guo, Zhongqian Fu, Hang Zhou, Baochang Zhang

机构 * FAIR

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 针对扩散大语言模型训练后量化中前沿决策易翻转并永久锁定放大的问题,提出两阶段PTQ框架FAIR-Calib,通过前沿命中与掩码阶段可靠性估计位置先验,并利用重加权隐状态MSE校准优先保护脆弱前沿状态,理论证明其作为输出KL散度代理,实验显著优于基线。

Comments Accepted as a poster at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03238 2026-07-10 cs.LG cs.AI 版本更新 92%

When RLHF Fails: A Mechanistic Taxonomy of Reward Hacking, Collapse, and Evaluator Gaming

当RLHF失败时:奖励黑客、崩溃和评估者博弈的机制分类

Zelalem Abahana, David Evans, Satish Mahadevan Srinivasan, Matjaz Gams

机构 * First Citizens Bank(第一公民银行) Alma Mater Europaea University(欧洲大学)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文通过PPO、DPO等方法的对比实验,提出了一种基于奖励和评估者分数方向的机制分类法,将RLHF失败模式分类为可定位、可预测的训练动态。

Comments 20 pages, 8 figures; includes code, artifacts, and live demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04145 2026-06-16 cs.LG cs.AI cs.DC 版本更新 92%

EvalStop: Using World Feedback to Detect and Correct Reward Overoptimization in Multi-Tenant RLHF Platforms

EvalStop:利用世界反馈检测和纠正多租户RLHF平台中的奖励过度优化

Guilin Zhang, Chuanyi Sun, Kai Zhao, Xu Chu, Shahryar Sarkani, John M. Fossaceca

机构 * DeepMind, London, UK(深度Mind, 英国伦敦) University of Cambridge, UK(英国剑桥大学) University of Washington, USA(美国华盛顿大学)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出EvalStop调度原语,通过检测评估分数连续下降来终止作业、释放GPU并保留最佳检查点,以纠正奖励过度优化,在RLHF负载上实现高精度检测并提升JCT。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16410 2026-07-22 cs.CL cs.AI 版本更新 91%

PlotTwist: A Creative Plot Generation Framework with Small Language Models

PlotTwist: 一种利用小语言模型的创意情节生成框架

Abhinav Thorat, Ravi Kolla, Jyotin Goel, Madhav Kataria, Niranjan Pedanekar

机构 * Sony Research India(索尼印度研究院)

专题命中 后训练与偏好优化 :language model(title,abstract);small language model(title,abstract);large language model(abstract);preference optimization(abstract)

AI总结 PlotTwist通过结构化框架使小语言模型生成高质量前提条件情节,优于大型模型,且在多个叙事质量维度上表现优异。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19139 2026-07-07 cs.CL cs.AI 版本更新 91%

The Rise of Verbal Tics in Large Language Models: A Systematic Analysis Across Frontier Models

大语言模型中言语 tic 的兴起:前沿模型的系统分析

Shuai Wu, Xue Li, Yanna Feng, Yufang Li, Zhijun Wang, Ran Wang

机构 * Lead Researcher(研究员) Research Assistant(研究助理) Academic Advisor(学术顾问) Research Consultant(研究顾问)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract,abstract_cn);LLM(abstract_cn)

AI总结 本文系统分析了八个前沿大语言模型中言语 tic 的现象,通过定制评估框架评估10,000个提示,发现 Gemini 3.1 Pro tic 值最高,DeepSeek V3.2 最低,并揭示了 tic 在多轮对话中的累积效应及跨语言差异。

Comments 17 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04773 2026-06-25 cs.LG cs.AI 版本更新 91%

Distribution Preference Optimization: A Fine-grained Perspective for LLM Unlearning

分布偏好优化:大语言模型遗忘的细粒度视角

Kai Qin, Jiaqi Wu, Jianxiang He, Haoyuan Sun, Yifei Zhao, Xu Wang, Bin Liang, Yongzhe Chang, Cheng Li, Tiantian Zhang, Houde Liu

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学) Jianghuai Advanced Technology Center(江淮先进技术中心) University of Technology Sydney(悉尼大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);preference optimization(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对大语言模型遗忘中负偏好优化缺乏显式正信号的问题,提出分布偏好优化(DiPO),通过选择性放大或抑制模型高置信度输出logits构建偏好分布对,实现细粒度遗忘,在TOFU和MUSE基准上取得最优遗忘质量与模型效用的平衡。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏