arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-09 至 2026-06-09 共收录 719 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 52 篇

2606.09165 2026-06-09 cs.AI 新提交 70%

Reliable to Expressive: A Curriculum for Rubric-Following Safety Judges

从可靠到表达:面向遵循评分标准的安全评判员的课程学习

Yongtaek Lim, Hyeji Choi, Minwoo Kim

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 提出一种结合动态评分标准和从可靠到表达的课程学习策略,训练安全评判员在多种评分标准下稳定评估,12B模型准确率达94.12-94.88%,跨标准方差仅0.76。

Comments Accepted to ICML 2026 Workshop on AIWILDS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09068 2026-06-09 cs.CL 新提交 70%

Emergent Misalignment Can Be Induced by Sycophancy and Reversed via Alignment Gating

由谄媚诱导的突现性失调可通过对齐门控逆转

Sicheng Wang, Xiangyang Zhu, Han Wang, Zongrui Wang, Yuan Tian, Kaiwei Zhang, Kaiyuan Ji, Qi Jia, Guangtao Zhai

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 发现谄媚微调(被动同意用户错误观点)可诱导广泛且严重的突现性失调,并提出对齐门控方法,通过插入可学习门控来识别并抑制不安全表示,从而高效逆转失调。

Comments Code is available at https://github.com/stay1to0/Sycophancy_Emergent_Misalignment_and_Gated_attention_FT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08578 2026-06-09 cs.LG 新提交 70%

Lost in the Non-convex Loss Landscape: How to Fine-tune the Large Time Series Model?

迷失在非凸损失景观中:如何微调大型时间序列模型?

Xu Zhang, Peang Wang, Wei Wang

机构 * Shanghai Key Laboratory of Data Science(上海市数据科学重点实验室) College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) Fudan University(复旦大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对预训练大型时间序列模型微调时因非凸损失景观导致过拟合的问题,提出平滑全微调(SFF)方法,通过随机初始化辅助模型插值平滑损失景观,提升可训练性,在八个代表性模型上取得一致改进。

Comments This paper has been accepted by The Fourteenth International Conference on Learning Representations (ICLR 2026). The code is available at the link \url{https://github.com/Meteor-Stars/SFF}

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09767 2026-06-09 cs.CL cs.AI cs.LG 新提交 67%

Data Synthesis and Parameter-Efficient Fine-Tuning for Low-Resource NMT: A Case Study on Q'eqchi' Mayan

低资源神经机器翻译的数据合成与参数高效微调:以Q'eqchi'玛雅语为例

Alexander Chulzhanov, Soeren Eberhardt, Arjun Mukherjee

机构 * University of Houston(休斯顿大学) MasterWord Services, Inc.(MasterWord Services公司) University of Washington(华盛顿大学)

专题命中 指令微调 :prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对低资源土著语言,提出数据合成方法(利用社区词典生成合成语料)结合LoRA参数高效微调,在Q'eqchi'玛雅语上实现高结构习得(BLEU 42.02),但存在结构-语义差距,需结合真实数据进行课程学习。

Comments Accepted to the 29th International Conference on Text, Speech and Dialogue (TSD 2026). This version of the contribution has been accepted for publication, after peer review but is not the Version of Record and does not reflect post-acceptance improvements, or any corrections

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08572 2026-06-09 cs.CV 新提交 67%

OmniCap-IF: Benchmarking and Improving Instruction Following Abilities for Omni-Video Captioning

OmniCap-IF:全视频字幕遵循指令能力的基准测试与改进

Jiahao Wang, An Ping, Yanghai Wang, Yuanxing Zhang, Shihao Li, Hanyan Bian, Yichi Ren, Yize Zhang, Han Wang, Haowen Chen, Junze Li, Jiaqi Wang, Yiyang Hu, Zhuze Xu, Zijie Zhang, Jiaheng Liu

机构 * NJU-LINK Team, Nanjing University(南京大学 NJU-LINK 团队) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 提出首个全模态字幕指令遵循基准OmniCap-IF,通过格式与内容正确性评估50种约束类型,揭示格式-内容权衡,并构建54K指令微调数据集OmniCap-IF-54K及模型OmniCaptioner-IF。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15094 2026-06-09 cs.SE 版本更新 67%

Parameter-Efficient Multi-Task Fine-Tuning in Code-Related Tasks

代码相关任务中的参数高效多任务微调

Md Zahidul Haque, Saima Afrin, Antonio Mastropaolo

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 研究多任务QLoRA微调在代码生成、翻译和总结中的效果,发现其在1.5B、3B和7B规模上达到或优于单任务QLoRA和全微调,大模型平衡正确性与质量更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09430 2026-06-09 cs.LG cs.AI 新提交 62%

LargeMonitor: Monitoring Online Task-Free Continual Learning via Large Pretrained Models

LargeMonitor: 通过大型预训练模型监控在线无任务持续学习

Mingqi Yuan, Xiaoquan Sun, Shihao Luo, Jiayu Chen

机构 * HKU(香港大学) Qicore Tech(启科科技)

专题命中 指令微调 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出LargeMonitor框架,利用大型预训练模型(LVM和LMM)解耦检测与诊断,实现无任务持续学习中的零样本漂移检测和语义病因诊断,提升现有算法性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03229 2026-06-09 cs.CL cs.LG 版本更新 62%

Sparse Memory Finetuning as a Low-Forgetting Alternative to LoRA and Full Finetuning

稀疏记忆微调:作为LoRA和全微调的低遗忘替代方案

Prakhar Gupta, Garv Shah, Satyam Goyal, Anirudh Kanchi

机构 * University of Washington(华盛顿大学)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.LG

AI总结 提出稀疏记忆微调(SMF),通过添加键值记忆层并仅更新当前批次最活跃的记忆行,在MedMCQA任务上提升2.5个百分点,同时将遗忘探针(WikiText困惑度和TriviaQA准确率)控制在基线的1个百分点内,优于LoRA和全微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03226 2026-06-09 cs.LG cs.AI cs.CR 版本更新 62%

Self-Mined Hardness for Safety Fine-Tuning

自我挖掘的难度用于安全微调

Prakhar Gupta, Garv Shah, Donghua Zhang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出通过模型自身生成结果评估提示难度,对最难的提示进行安全微调,在Llama-3模型上将攻击成功率降至1-3%,但增加了拒绝率,通过混合良性提示可平衡性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08051 2026-06-09 cs.AI cs.LG 新提交 62%

How Small Can You Go? LoRA Fine-Tuning 270M-8B Models for Merchant Information Extraction in Financial Transactions

你能做到多小?面向金融交易中商户信息抽取的 270M-8B 模型 LoRA 微调

Donghao Huang, Tomas Drietomsky, Benjamin Barrett, Zhaoxia Wang

机构 * Singapore Management University(新加坡管理大学) Mastercard(万事达卡) A*STAR Centre for Frontier AI Research(新加坡科技研究局前沿人工智能研究中心)

专题命中 指令微调 :prompting(abstract);分类 cs.AI、cs.LG

AI总结 针对金融交易中从嘈杂银行字符串提取结构化商户信息的生产需求,系统评估 24 种模型变体,发现 Qwen 3.5 4B 在参数量减半下 F1 仅低 0.35 点,0.8B 模型匹配 2.5-4 倍大模型性能,且思维链微调提升有限。

Comments 9 pages, 5 figures, 5 tables. Submitted to the IEEE International Conference on Data Mining (ICDM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03453 2026-06-09 cs.CL cs.LG 62%

Cropping outperforms dropout as an augmentation strategy for self-supervised training of text embeddings

裁剪优于dropout作为自监督训练文本嵌入的增强策略

Rita González-Márquez, Philipp Berens, Dmitry Kobak

机构 * Hertie Institute for AI in Brain Health(人工智能与脑健康赫尔蒂研究所) University of Tübingen(图宾根大学) University of Tübingen, Germany(德国图宾根大学)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了自监督微调中裁剪和dropout两种增强策略,发现裁剪在文本嵌入质量上表现更优,尤其在领域内数据中能快速生成高质量嵌入。

Journal ref Transactions on Machine Learning Research (TMLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08243 2026-06-09 cs.CL 新提交 57%

Building Comparative Motivation Profiles with Instrumental Interventions

构建带有工具性干预的比较动机概况

David Vella Zarb, Rustem Turtayev, Taywon Min, Jinghua Ou, Shi Feng

机构 * MATS University of Cambridge(剑桥大学) KAIST(韩国科学技术院) George Washington University(乔治华盛顿大学)

专题命中 指令微调 :prompting(abstract);分类 cs.CL

AI总结 通过对称工具性干预区分对齐伪装中的策略性自我保护与研究者期望追踪,发现模型对期望追踪更敏感,提示需要构念效度检验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07567 2026-06-09 q-bio.BM cs.AI cs.CE 新提交 57%

SurfDesign: Effective Protein Design on Molecular Surfaces

SurfDesign:基于分子表面的高效蛋白质设计

Fang Wu, Shuting Jin, Xiangru Tang, Mark Gerstein, Xiangxiang Zeng, Yejin Choi, Jure Leskovec, Jinbo Xu

机构 * Stanford University(斯坦福大学) Wuhan University of Science and Technology(武汉科技大学) Yale University(耶鲁大学) School of Medicine, Yale University(耶鲁大学医学院) Hunan University(湖南大学) Yuelushan Laboratory(岳麓实验室) Kumo.AI Toyota Technological Institute at Chicago(芝加哥技术研究所)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 提出SurfDesign框架,将分子表面建模为连续几何流形并整合预训练蛋白质语言模型,通过表面等变消息传递捕捉几何特征,在从头设计结合子和酶设计基准上优于现有方法。

Journal ref KDD 2026 AI4Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07102 2026-06-09 cs.CV cs.AI 新提交 57%

GP-Adapter: Gaussian Process CLIP-Adapter for Few-Shot Out-of-Distribution Detection

GP-Adapter: 基于高斯过程的CLIP适配器用于少样本分布外检测

Taisei Saito, Koretaka Ogata, Takafumi Hiroi

机构 * st Taisei Saito(第一作者) nd Koretaka Ogata(第二作者) rd Takafumi Hiroi(第三作者)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 提出GP-Adapter,一种无需训练的框架,通过高斯过程不确定性建模增强CLIP,用于少样本分类和分布外检测,无需微调骨干网络,仅依赖少量缓存和轻量超参数选择。

Comments 8 pages, 6 figures, Accepted at IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29823 2026-06-09 cs.AI 版本更新 57%

Quantifying and Optimizing Simplicity via Polynomial Representations

通过多项式表示量化和优化简单性

Tianren Zhang, Xiangxin Li, Minghao Xiao, Guanyu Chen, Feng Chen

机构 * [cs.AI](计算机科学与人工智能)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 提出多项式表示作为分布感知的低维神经函数代理,通过正交多项式基近似网络预测行为,以有效度作为简单性度量,并导出可微正则化器以提升泛化。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29569 2026-06-09 cs.CR 版本更新 50%

LoRA-Key: User-Centric LoRA Watermarking for Text-to-Image Diffusion Models

LoRA-Key:面向用户的文本到图像扩散模型LoRA水印

Yaopeng Wang, Qingliang Wang, Zhibo Wang, Huiyu Xu, Jiacheng Du, Qiu Wang, Jia-Li Yin, Kui Ren

专题命中 指令微调 :foundation model(abstract)

AI总结 提出LoRA-Key框架,通过可重用的用户特定水印LoRA实现版权保护,无需重新训练或修改目标LoRA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05478 2026-06-09 eess.AS 版本更新 50%

AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning

AQA-TTRL:音频问答中的测试时强化学习自适应

Haoyu Zhang, Jiaxian Guo, Dong Yang, Yusuke Iwasawa, Yutaka Matsuo

专题命中 指令微调 :language model(abstract)

AI总结 提出AQA-TTRL框架,通过测试时强化学习利用无标签数据实现音频语言模型的在线自适应,采用多数投票生成伪标签、置信度加权和多次采样策略,在MMAU等基准上显著提升性能。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17870 2026-06-09 cond-mat.mtrl-sci 版本更新 50%

General Learning of the Electric Response of Inorganic Materials

无机材料电响应的通用学习

Bradley A. A. Martin, Alex M. Ganose, Venkat Kapil, Tingwei Li, Keith T. Butler

专题命中 指令微调 :foundation model(abstract)

AI总结 提出MACE-Field场感知等变势,通过精确微分获得极化、玻恩有效电荷和极化率,实现跨化学体系的铁电与介电响应预测。

Comments 22 pages, 12 figures, 43 equations

Journal ref PRX Intelligence 1, 013006 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 43 篇

2606.09735 2026-06-09 cs.CL 新提交 94%

The Neutral Mask: How RLHF Provides Shallow Alignment while Leaving Partisan Structure Intact in a Large Language Model

中性面具:RLHF如何提供浅层对齐而保留大语言模型中的党派结构

Wendy K. Tam

机构 * Vanderbilt University(范德堡大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) National Center for Supercomputing Applications(国家超级计算应用中心)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究RLHF对Llama 3.1 8B党派倾向的影响,发现RLHF仅压缩党派信号方差以实现中性输出,而非移除党派结构,且特征级操控可绕过对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08656 2026-06-09 cs.CL 新提交 92%

From Player to Master: Enhancing Test-Time Learning of LLM Agents via Reinforcement Learning over Memory

从玩家到大师:通过基于记忆的强化学习增强LLM代理的测试时学习

Yishuo Cai, Xingyu Guo, Xuancheng Huang, Jinhua Du, Can Huang, Wenxuan Huang, Wenhan Ma, Yuyang Hu, Aohan Zeng, Jie Tang, Xu Sun

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出Memopilot,一种通过多轮GRPO训练记忆更新过程来优化冻结LLM代理在测试时学习的方法,在多人博弈中显著提升Elo评分。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07610 2026-06-09 cs.LG cs.AI cs.CL 新提交 92%

LEAF: Growing Trees Without Branching for Speech-Aware Large Language Model Post-Training

LEAF: 无需分支的树生长方法用于语音感知大语言模型后训练

Argyrios Gerogiannis, Yekaterina Yegorova, Mark Hasegawa-Johnson, Venugopal V. Veeravalli

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对语音感知大语言模型后训练中GRPO方法粗粒度信用分配问题,提出LEAF方法,通过回溯式树结构学习、高信息量边界选择和跨度级优势分配,在语音问答和翻译任务上超越GRPO。

Comments 15 pages, 3 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04913 2026-06-09 cs.CL cs.LG 版本更新 91%

Rethinking Local Learning: A Cheaper and Faster Recipe for LLM Post-Training

重新思考局部学习:一种更便宜更快的LLM后训练配方

Hengyu Shi, Tianyang Han, Peizhe Wang, Zhiling Wang, Xu Yang, Junhao Su

机构 * Independent Researcher(独立研究者) D 4 Lab(D4实验室) Southeast University(东南大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出LoPT,一种局部学习后训练策略,通过在transformer中点设置梯度边界,降低内存成本,提高训练效率并保留预训练能力。

Comments 35pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09124 2026-06-09 cs.AI 新提交 91%

A Regret Minimization Framework on Preference Learning in Large Language Models

大语言模型中偏好学习的遗憾最小化框架

Suhwan Kim, Taehyun Cho, Geon-Hyeong Kim, Yu Jin Kim, Youngsoo Jang, Moontae Lee, Jungwoo Lee

机构 * KAIST(韩国科学技术院)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract,abstract_cn);preference optimization(abstract)

AI总结 提出基于遗憾的偏好优化方法RePO,通过遗憾最小化而非奖励最大化来建模人类偏好,在数学推理和人类偏好数据集上取得一致性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09821 2026-06-09 cs.LG 新提交 91%

Rethinking the Divergence Regularization in LLM RL

重新思考LLM强化学习中的散度正则化

Jiarui Yao, Xiangxin Zhou, Penghui Qi, Wee Sun Lee, Liefeng Bo, Tianyu Pang

机构 * Tencent Hunyuan(腾讯混元) UIUC(伊利诺伊大学厄巴纳-香槟分校) NUS(新加坡国立大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对PPO等方法的硬裁剪或硬掩码在长尾词汇中分布偏移代理不佳的问题,提出DRPO,用平滑的优势加权二次正则化替代硬掩码,保持信任区域几何的同时提供连续梯度权重,提升训练稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07705 2026-06-09 cs.LG cs.AI 新提交 91%

SAW: Stage-Aware Dynamic Weighting for Multi-Objective Reinforcement Learning in Large Language Models

SAW: 面向大语言模型多目标强化学习的阶段感知动态加权

Yuchen He, Baolong Bi, Shenghua Liu, Huaming Liao, Yuyao Ge, Bolin Wan, Siqian Tong, Juan Chen, Jiafeng Guo, Xueqi Cheng

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Electronic Science and Technology of China(电子科技大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 针对多目标强化学习中奖励学习异步性问题,提出轻量级动态加权机制SAW,利用变异系数实时调整各目标贡献,在GRPO和GDPO框架下提升训练效率和最终性能。

Comments 17 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07629 2026-06-09 cs.LG cs.AI cs.CL cs.CY cs.HC 新提交 90%

Large Language Models Should Learn Personalized Rather Than Aggregated Human Preferences

大型语言模型应学习个性化而非聚合的人类偏好

Cristina Garbacea

机构 * University of Chicago, Data Science Institute(芝加哥大学数据科学学院)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文主张大型语言模型应学习个性化偏好而非聚合偏好,分析聚合偏好的理论局限与实证问题,提出通过有界个性化框架兼顾个体自主与集体安全。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08450 2026-06-09 cs.AI 新提交 90%

GIFT: LLM-Guided State-Reward Interface for Financial Reinforcement Learning

GIFT: 基于LLM引导的状态-奖励接口用于金融强化学习

Yanyan Wu, Boyi Zhang, Yanlin Liu, Xinyu Fang, Jining Luan, Meiqi Zhang, Jiacheng Liu, Hao Zeng, Dexu Yu, Chang Liu, Hanwen Du, Yongxin Ni, Youhua Li

机构 * East China University of Science and Technology(华东理工大学) University of Science and Technology of China(中国科学技术大学) Southwestern University of Finance and Economics(西南财经大学) University of Sydney(悉尼大学) City University of Hong Kong(香港城市大学) Northeastern University(东北大学) The Ohio State University(俄亥俄州立大学) National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出GIFT框架,利用大语言模型引导PPO强化学习中的状态增强和奖励塑造,提升金融交易策略的样本外风险调整收益。

Comments 25 pages, 7 figures. Code and data are available at https://github.com/KAG778/GIFT . Equal contribution: Yanyan Wu and Boyi Zhang. Corresponding author: Youhua Li

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07535 2026-06-09 cs.CL 新提交 89%

Multilingual Refusal Alignment for Safer Large Language Models

多语言拒绝对齐:构建更安全的大型语言模型

Aleksandra Krasnodębska, Wojciech Kusa, Aldo Lipani

机构 * NASK National Research Institute(国家研究 institute) University College London(伦敦大学学院)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.CL

AI总结 本研究系统探究多语言对齐动态,通过引入覆盖12种欧洲语言的RefusEU数据集和DPO实验,发现仅用英语对齐不足以保障跨语言安全,而多语言训练可在不降低通用性能的前提下提升安全性。

Comments Accepted to Findings ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03106 2026-06-09 cs.CL cs.AI 89%

Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback

Critique-GRPO:通过自然语言和数值反馈提升大语言模型推理能力

Xiaoying Zhang, Yipeng Zhang, Hao Sun, Kaituo Feng, Chaochao Lu, Chao Yang, Helen Meng

机构 * HCCL, The Chinese University of Hong Kong, Hong Kong, China(香港中文大学人工智能研究中心,香港,中国) University of Cambridge, Cambridge, United Kingdom(剑桥大学,剑桥,英国) MMLab, The Chinese University of Hong Kong, Hong Kong, China(香港中文大学人工智能实验室,香港,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)

专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Critique-GRPO框架,结合自然语言和数值反馈提升LLM推理能力,实验显示其在多个任务中优于传统方法,显著提升推理性能。

Comments Accepted by ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01357 2026-06-09 cs.LG 版本更新 89%

Your Self-Play Algorithm is Secretly an Adversarial Imitator: Understanding LLM Self-Play through the Lens of Imitation Learning

你的自对弈算法其实是一个对抗性模仿者:通过模仿学习的视角理解LLM自对弈

Shangzhe Li, Xuchao Zhang, Chetan Bansal, Weitong Zhang

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Microsoft Research(微软研究院)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文通过将自对弈微调建模为模型与自身参数化的正则化隐式奖励玩家之间的极小极大博弈,统一了自对弈模仿与偏好对齐,并提出了基于χ²散度的新算法,在多种语言模型微调任务上优于现有方法。

Comments 26 pages, 6 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏