arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-01 至 2026-04-01 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 6 篇

2509.11452 2026-04-01 cs.LG cs.CL 81%

Learning to Optimize Multi-Objective Alignment Through Dynamic Reward Weighting

通过动态奖励加权学习多目标对齐

Yining Lu, Zilong Wang, Shiyang Li, Xin Liu, Changlong Yu, Qingyu Yin, Zhan Shi, Zixuan Zhang, Meng Jiang

机构 * University of Notre Dame(圣母大学) Amazon(亚马逊)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出动态奖励加权方法,解决多目标强化学习中固定权重无法捕捉非凸帕累托前沿的问题,通过两种新方法实现有效探索帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29259 2026-04-01 cs.IR cs.CL 77%

Aligning Multimodal Sequential Recommendations via Robust Direct Preference Optimization with Sparse MoE

通过鲁棒直接偏好优化与稀疏MoE对齐多模态序列推荐

Hejin Huang, Jusheng Zhang, Kaitong Cai, Jian Wang, Rong Pan

机构 * Sun Yat-sen University(中山大学) Snap Inc(Snap公司)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.CL

AI总结 本文研究了在隐式反馈下直接偏好优化的行为,通过系统实验比较了常见负样本选择策略及其与DPO训练的交互,发现用动态top-K候选池进行随机采样可提升排名性能,原因在于减少错误抑制梯度和保留信息硬信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29886 2026-04-01 cs.HC cs.CY 70%

AI Empathy Erodes Cognitive Autonomy in Younger Users

人工智能共情削弱年轻用户的认知自主性

Junfeng Jiao, Abhejay Murali, Saleh Afroogh

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CY

AI总结 本文研究人工智能共情对年轻用户认知自主性的影响,指出情感共鸣可能强化用户情绪状态,削弱独立情绪管理和批判性思维能力,提出以功能中性为核心的斯多葛式架构以保护用户自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27006 2026-04-01 cs.CL cs.AI cs.CY 67%

The Last Fingerprint: How Markdown Training Shapes LLM Prose

最后的指纹:Markdown训练如何塑造LLM的散文

E. M. Freeburg

机构 * Independent Researcher(独立研究员)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究发现LLM中连字符的使用受训练数据影响,通过实验揭示连字符频率作为微调方法的诊断指标,而非风格缺陷。

Comments 14 pages, 3 tables. Code and data: https://github.com/emfreeburg/the-last-fingerprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27971 2026-04-01 cs.LG 57%

Principal Prototype Analysis on Manifold for Interpretable Reinforcement Learning

流形上的主原型分析用于可解释的强化学习

Bodla Krishna Vamshi, Haizhao Yang

机构 * University of Maryland College park(马里兰大学帕克分校)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 本文提出一种自动选择最优原型的方法,用于增强强化学习的可解释性,无需人工定义原型,实验显示其性能与现有方法相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29292 2026-04-01 cs.SE cs.AI cs.PL 57%

Self-Improving Code Generation via Semantic Entropy and Behavioral Consensus

通过语义熵和行为共识的自我改进代码生成

Huan Zhang, Wei Cheng, Wei Hu

机构 * Nanjing University(南京大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

AI总结 本文提出ConSelf方法,利用语义熵构建课程和共识驱动优化,无需外部监督提升代码生成能力。

Comments Accepted in the 34th IEEE/ACM International Conference on Program Comprehension (ICPC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏