arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-27 至 2026-05-27 共收录 14 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 14 篇

2605.26315 2026-05-27 cs.LG cs.AI 93%

Curriculum Learning for Safety Alignment

用于安全对齐的课程学习

Sandeep Kumar, Virginia Smith, Chhavi Yadav

机构 * Carnegie Mellon University(卡内基梅隆大学) Simons Institute, UC Berkeley(Simons研究所,伯克利大学)

专题命中 偏好对齐 :safety(title,abstract);DPO(summary_cn,abstract);alignment(title,abstract);jailbreak(abstract)

AI总结 提出基于课程学习的Staged-Competence框架,通过难度分级的偏好数据和渐进式参考模型更新,提升DPO安全对齐的鲁棒性,在三个模型族上平均降低16%的OOD有害响应率和20%的越狱攻击成功率。

Comments Accepted at the ICML 2026 GlobalSouthML Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18384 2026-05-27 cs.RO cs.FL 83%

LAD-VF: LLM-Automatic Differentiation Enables Fine-Tuning-Free Robot Planning from Formal Methods Feedback

LAD-VF:LLM自动微分实现基于形式化方法反馈的无微调机器人规划

Yunhao Yang, Junyuan Hong, Gabriel Jacob Perin, Zhiwen Fan, Li Yin, Zhangyang Wang, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of São Paulo(圣保罗大学) Texas A&M University(德克萨斯A&M大学) SylphAI

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);safety(abstract);trustworthy(abstract)

AI总结 提出LAD-VF框架,利用形式化验证反馈和LLM自动微分自动优化提示词,无需微调即可提升机器人规划任务中规范符合率,成功率从60%提升至90%以上。

Comments Presented at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21883 2026-05-27 cs.CL 81%

Token-weighted Direct Preference Optimization with Attention

基于注意力的令牌加权直接偏好优化

Chengyu Huang, Zhuohang Li, Sheng-Yen Chou, Claire Cardie

机构 * Cornell University(康奈尔大学) Vanderbilt University(范德比大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL

AI总结 提出Token-weighted DPO (TwDPO)方法,利用注意力机制估计令牌权重,在不增加额外训练成本的情况下提升大语言模型与人类偏好对齐的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26442 2026-05-27 cs.CL cs.AI 81%

Alignment Tuning for Large Language Models: A Data-Centric Lens on Alignment Data Pipelines

大型语言模型的对齐调优:以数据为中心的对齐数据管道视角

Hwanjun Song

机构 * KAIST(韩国科学技术院)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文以数据为中心,将对齐调优重构为管道设计问题,分解为响应合成、偏好评估和偏好实例化三个阶段,并基于此框架统一分类现有对齐方法,总结设计权衡与失败模式,提炼高层原则,最后指出开放挑战。

Comments Accepted at the Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17218 2026-05-27 cs.CL cs.AI cs.GT 81%

Alignment Makes Language Models Normative, Not Descriptive

对齐使语言模型变得规范,而非描述性

Eilam Shapira, Moshe Tennenholtz, Roi Reichart

机构 * Technion – Israel Institute of Technology(技术离子-以色列理工学院)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 通过对比120个基础-对齐模型对在超过10,000个真实人类决策中的表现,发现对齐诱导了规范性偏差:在单轮教科书式博弈中提升预测,但在多轮战略博弈中因忽略互惠、报复等描述性动态而损害预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26486 2026-05-27 cs.CV 80%

LongCat-Video-Avatar 1.5 Technical Report

LongCat-Video-Avatar 1.5 技术报告

Meituan LongCat Team, Xunliang Cai, Meng Cheng, Feng Gao, Zhe Kong, Jiamu Li, Le Li, Weiheng Li, Hongyu Liu, Shuai Tan, Xiaoming Wei, Tianyu Yang, Yong Zhang

机构 * Meituan LongCat Team(美团LongCat团队)

专题命中 偏好对齐 :RLHF(summary_cn,abstract)

AI总结 本文提出 LongCat-Video-Avatar 1.5,一个通过升级音频编码器、优化训练策略、数据筛选和RLHF训练实现高精度唇同步、全身时间稳定性和长视频生成的开放框架,在多个基准测试中达到或超越商业系统性能。

Comments Homepage: https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/ Github: https://github.com/meituan-longcat/LongCat-Video

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18907 2026-05-27 cs.LG cs.CV cs.CY 73%

DeepInterestGR: Mining Deep Multi-Interest Using Multi-Modal LLMs for Generative Recommendation

DeepInterestGR: 利用多模态大语言模型挖掘深度多兴趣用于生成式推荐

Yangchen Zeng, Zhenyu Yu, Zhiyuan Hu, Wenxin Zhang, Jinze Wang, Rongfeng Guo

机构 * Southeast University(东南大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CY、cs.LG

AI总结 提出DeepInterestGR框架,通过多LLM兴趣挖掘、奖励标记深度兴趣和兴趣增强物品离散化,解决生成式推荐中的浅层兴趣问题,在三个Amazon数据集上显著提升推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18288 2026-05-27 cs.CL 70%

TFD: A Comprehensive Structured Tibetan Foundation Dataset for Low-Resource Language Processing and Large-Scale Modeling

TFD:面向低资源语言处理和大规模建模的综合结构化藏语基础数据集

Cheng Huang, Fan Gao, Nyima Tashi, Yutong Liu, Yadi Liu, Wenbin Wei, Xiangxiang Wang, Yongbin Yu

机构 * University of Electronic Science and Technology of China(电子科技大学) Xizang University(西藏大学) ZenWeave AI The State Key Laboratory of Tibetan Intelligence(藏语智能国家重点实验室) Nanyang Technological University(南洋理工大学)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 为解决藏语大语言模型开发中缺乏覆盖预训练、指令微调、安全对齐、偏好优化和推理监督等完整流程的数据集问题,提出首个结构化、大规模、专家精选的藏语基础数据集TFD,包含超过110亿词元的统一语料库及链式推理数据集,通过训练Sun-Shine系列藏语模型在理解、安全、推理和生成基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11486 2026-05-27 cs.LG 70%

Exploring the robustness of TractOracle methods in RL-based tractography

探索基于强化学习的纤维追踪中TractOracle方法的鲁棒性

Jeremi Levesque, Antoine Théberge, Maxime Descoteaux, Pierre-Marc Jodoin

机构 * Department of Computer Science, Faculty of Science, University of Sherbrooke(谢布罗克大学计算机科学系)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 本文通过整合强化学习的最新进展,扩展了TractOracle-RL框架,并引入迭代奖励训练(IRT)方法,实验表明基于oracle的RL方法在准确性和解剖有效性上显著优于传统纤维追踪技术。

Comments 38 pages, 8 figures. Submitted to Medical Image Analysis

Journal ref Medical Image Analysis, December 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26492 2026-05-27 cs.CL cs.AI cs.LG 67%

Elias in the Lighthouse, Again? Diagnosing Low Diversity in LLM Stories

灯塔中的伊莱亚斯,再次?诊断LLM故事中的低多样性

Sil Hamilton, David Mimno

机构 * Department of Information Science(信息科学系)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过采样20000个故事发现,LLM生成的故事中存在高度重复的词汇(如Elias、灯塔等),这些词汇来自偏好数据而非预训练数据,表明小数据集与强对齐算法的结合可能对多样性产生不成比例的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26554 2026-05-27 cs.LG cs.AI 62%

Linear and Neural Dueling Bandits with Delayed Feedback

线性与神经延迟反馈的对抗性赌博机

Xiangyi Wang, Pingchen Lu, Jie Mao, Mingze Kong, Zhi Hong, Zhiyong Wang, Zhongxiang Dai

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The Chinese University of Hong Kong(香港中文大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 针对随机延迟反馈下的上下文对抗性赌博机问题,提出线性(LDB-DF)和神经(NDB-DF)两种算法,通过将逆概率加权(IPW)机制直接融入损失函数实现无偏校正,并给出线性设置下O(d*sqrt(T))的遗憾界和神经设置下的次线性保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26738 2026-05-27 cs.CL 57%

KARMA: Karma-Aligned Reward Model Adaptation

KARMA:基于Karma对齐的奖励模型适应

Jared Scott, Jesse Roberts

机构 * Tennessee Tech University(田纳西科技大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 提出KARMA框架,利用Reddit对话数据训练奖励模型预测语境依赖的回应价值,并通过强化学习微调语言模型以提升语用能力,发现最佳奖励模型不一定带来最优对齐,且KARMA会降低事实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26717 2026-05-27 cs.IR cs.AI 57%

L2Rec: Towards Dual-View Understanding of LLMs for Personalized Recommendation

L2Rec:面向个性化推荐的LLM双视图理解

Pingjun Pan, Tingting Zhou, Peiyao Lu, Tingting Fei, Hongxiang Chen, Chuanjiang Luo

机构 * Netease Cloud Music(网易云音乐)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 提出L2Rec方法,通过双视图个性化混合专家机制在参数层面统一行为与语义理解,实现端到端个性化推荐,实验证明优于现有方法。

Comments Accepted at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27103 2026-05-27 cs.IR 50%

MuChator: Enabling Active Music Discovery via Conversational Music LLMs in Douyin Music

MuChator: 通过对话式音乐大语言模型在抖音音乐中实现主动音乐发现

Jiahao Liang, Linzhi Huang, Xuannan Liu, Xukai Wang, Xuanpu Luo, Yongchun Zhu, Jingwu Chen, Feng Zhang, Xiao Yang

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出MuChator框架,通过音乐知识预训练、上下文感知指令微调和偏好对齐,使大语言模型能够理解用户用自然语言表达的情境化音乐意图,并在抖音音乐中实现主动音乐发现。

详情

展开后加载摘要…

URL PDF HTML 收藏