arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-17 至 2026-04-17 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 9 篇

2506.09457 2026-04-17 cs.CL cs.LG 88%

Towards Bridging the Reward-Generation Gap in Direct Alignment Algorithms

朝着弥合直接对齐算法中的奖励生成差距而努力

Zeguan Xiao, Yun Chen, Guanhua Chen, Ke Tang

机构 * Shanghai University of Finance and Economics(上海财经大学) Beihang University(北航) Southern University of Science and Technology(南方科技大学)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);RLHF(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了直接对齐算法中奖励生成差距的问题,提出Prefix-Oriented Equal-length Training方法,通过截断响应长度来提升对齐效果,实验显示在AlpacaEval 2上提升显著。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14177 2026-04-17 cs.CL cs.AI 85%

Listen, Correct, and Feed Back: Spoken Pedagogical Feedback Generation

倾听、纠正与反馈:口语教学反馈生成

Junhong Liang, Yifan Lu, Ekaterina Kochmar, Fajri Koto

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SPFG数据集,基于Speak & Improve 2025语料,结合流畅性转录与GEC目标及人工验证的教师风格反馈,评估三种LLM在生成纠错与反馈中的表现,发现SFT效果最佳,DPO/KTO效果不一致,纠错与反馈质量弱相关。

Comments NLP8506 course project

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14053 2026-04-17 cs.LG cs.AI cs.CV cs.MA eess.IV 82%

LLMOrbit: A Circular Taxonomy of Large Language Models -From Scaling Walls to Agentic AI Systems

LLMOrbit:大型语言模型的圆形分类法——从扩展壁垒到智能体AI系统

Badri N. Patro, Vijay S. Agneeswaran

机构 * Microsoft(微软)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出LLMOrbit,通过八个维度分析2019-2025年50余种大型语言模型,揭示数据稀缺、成本激增和能源消耗三大危机,并提出六种突破扩展壁垒的范式,推动生成AI和智能体系统的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02585 2026-04-17 cs.AI cs.CL 82%

Mitigating LLM biases toward spurious social contexts using direct preference optimization

通过直接偏好优化减轻LLM对虚假社会情境的偏见

Hyunji Nam, Dorottya Demszky

机构 * Stanford University(斯坦福大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM对虚假社会情境的鲁棒性,提出Debiasing-DPO方法,通过自监督训练和监督微调减少偏见并提升预测准确性。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14951 2026-04-17 cs.CV cs.AI cs.CL cs.MM 79%

RaTA-Tool: Retrieval-based Tool Selection with Multimodal Large Language Models

RaTA-Tool: 基于检索的多模态大语言模型工具选择

Gabriele Mattioli, Evelyn Turri, Sara Sarto, Lorenzo Baraldi, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RaTA-Tool框架,利用多模态大语言模型将多模态查询转化为结构化任务描述,并通过语义丰富的工具描述检索合适工具,支持开放世界场景下的工具扩展。

Comments ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13175 2026-04-17 cs.LG cs.AI q-bio.BM q-bio.QM 73%

Pareto-Optimal Offline Reinforcement Learning via Smooth Tchebysheff Scalarization

通过平滑切比雪夫标量化实现帕累托最优的离线强化学习

Aadyot Bhatnagar, Peter Mørch Groth, Ali Madani

机构 * Profluent Bio, Inc.(Profluent生物公司)

专题命中 偏好对齐 :alignment(abstract);harmlessness(abstract);分类 cs.AI、cs.LG

AI总结 本文提出STOMP算法,通过平滑切比雪夫标量化方法解决多目标强化学习中的非凸帕累托前沿问题,验证了其在蛋白质工程任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14682 2026-04-17 cs.AI cs.CL 73%

Acceptance Dynamics Across Cognitive Domains in Speculative Decoding

跨认知领域接受动态的推测解码

Saif Mahmoud

机构 * College of Engineering, Al Ain University Abu Dhabi, United Arab Emirates(阿联酋阿因大学工程学院)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文研究了基于树的推测解码接受动态,分析了不同NLP任务领域对接受概率的影响,发现任务类型比树深度更能预测接受率,且聊天领域表现出较高的熵和接受率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14314 2026-04-17 cs.CV cs.AI cs.CL 73%

DharmaOCR: Specialized Small Language Models for Structured OCR that outperform Open-Source and Commercial Baselines

DharmaOCR:用于结构OCR的专用小型语言模型,其性能优于开源和商业基线

Gabriel Pimenta de Freitas Cardoso, Caio Lucas da Silva Chacon, Jonas Felipe da Fonseca Oliveira, Paulo Henrique de Medeiros Araujo

机构 * Dharma-AI

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 DharmaOCR通过联合优化转录质量、生成稳定性与推理成本,提出专用小型语言模型,并通过统一评估协议提升OCR性能,实现高质量低成本的文本提取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13833 2026-04-17 cs.CL 57%

Robust Reward Modeling for Large Language Models via Causal Decomposition

通过因果分解实现大型语言模型的鲁棒奖励建模

Yunsheng Lu, Zijiang Yang, Licheng Pan, Zhixuan Chu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Department of Statistics, University of Chicago(芝加哥大学统计系)

专题命中 偏好对齐 :safety(abstract);分类 cs.CL

AI总结 本文提出通过因果分解学习解码器,以增强奖励模型对提示意图的建模,从而提升在数学、帮助性和安全性的基准测试中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏