arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-29 至 2026-05-29 共收录 15 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 15 篇

2605.27382 2026-05-29 cs.HC cs.AI cs.CL 91%

The Alignment Floor: How Persona Customization Breaks Safety in Weakly-Aligned LLMs

对齐下限:角色定制如何破坏弱对齐大语言模型的安全性

Xing Zhang, Guanghui Wang, Yanwei Cui, Wei Qiu, Ziyuan Li, Bing Zhu, Peiyang He

机构 * AWS Generative AI Innovation Center(AWS生成式人工智能创新中心) HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰技术中心,中国)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 通过对比强对齐与弱对齐模型在不同角色条件下的谄媚率变化,定义对齐下限Δ_floor作为评估模型角色定制安全性的审计指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05370 2026-05-29 cs.CL 89%

Mining or Synthesis? Rethinking Exploration Efficiency in Iterative Alignment of Mathematical Reasoning

挖掘还是合成?重新思考数学推理迭代对齐中的探索效率

Jun Rao, Zixiong Yu, Xuebo Liu, Guhan Chen, Jing Li, Hejin Wang, Jiansheng Wei, Xiaojun Meng, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院) Huawei Large Model Data Technology Lab(华为大模型数据技术实验室) Huawei Multimodal Model Lab(华为多模态模型实验室) Department of Statistics and Data Science, Tsinghua University, Beijing, China(清华大学统计与数据科学系)

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(title,abstract);分类 cs.CL

AI总结 针对数学推理任务中迭代DPO对齐时高N采样收益递减且引入噪声的问题,提出PACE框架,通过低预算探索与纠错合成偏好对,以约1/5计算量达到或超越高N基线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28888 2026-05-29 cs.IR cs.LG 81%

Generative Spatiotemporal Intent Sequence Recommendation via Implicit Reasoning in Amap

高德地图中基于隐式推理的生成式时空意图序列推荐

Sicong Wang, Ruiting Dong, Yue Liu, Bowen Zheng, Jun Meng, Jie Li, Shuaijun Guo, Yu Gu, Fanyi Di, Xin Li

机构 * AMAP, Alibaba Group(阿里集团地图(AMAP))

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.LG

AI总结 提出GPlan框架,通过渐进式隐式思维链蒸馏和时空反事实DPO,将LLM推理能力压缩至轻量模型,实现低延迟且符合时空约束的意图序列生成。

Comments 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29267 2026-05-29 cs.AI cs.LG 81%

When and How Human Curation Backfires: Preference Alignment under Multi-Model Self-Consuming Loop

人类策展何时以及如何适得其反:多模型自消费循环下的偏好对齐

Yang Zhang, Xiukun Wei, Xueru Zhang

机构 * Department of Computer Science and Engineering, The Ohio State University, Columbus, Ohio(计算机科学与工程系,俄亥俄州立大学,哥伦布,俄亥俄)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 研究多模型自消费训练中人类策展对模型对齐的影响,发现跨模型交互可能削弱甚至逆转策展效果,导致长期对齐退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29141 2026-05-29 cs.IR cs.AI 79%

Toward User Preference Alignment in LLM Recommendation via Explicit Context Feedback

通过显式上下文反馈实现LLM推荐中的用户偏好对齐

Weizhi Zhang, Wooseong Yang, Yuxin Cui, Zhaohui Guo, Hins Hu, Liangwei Yang, Henry Peng Zou, Qifei Wang, Hanqing Zeng, Jiayi Liu, Yinglong Xia, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Meta

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文主张在基于大语言模型的推荐系统中优先利用显式上下文反馈(如评论文本)来对齐用户偏好,提升推荐的个性化和可解释性。

Comments Published in CogMI 2025. https://ieeexplore.ieee.org/abstract/document/11417068

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28826 2026-05-29 cs.CL 77%

From Context Shift to Stylistic Collapse: Why Training Objectives Matter More Than Scale

从语境偏移到风格崩溃:为什么训练目标比规模更重要

Rohan Mahapatra

机构 * Independent Researcher(独立研究者)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL

AI总结 本文通过分析17个模型(410M-100B+参数)在24个语言探针上的表现,发现指令微调系统会导致语言熵沿语篇和结构维度系统性崩溃,并表明弱干预加剧崩溃而强控制可显著改善,揭示了当前对齐流程在重新分配风格概率质量方面的结构性局限。

Comments 26 pages, 13 tables, 2 figures. Planning to submit to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09629 2026-05-29 cs.CL 77%

HumorGen: Cognitive Synergy for Humor Generation in Large Language Models via Persona-Based Distillation

HumorGen: 基于角色蒸馏的大语言模型幽默生成的认知协同

Edward Ajayi, Prasenjit Mitra

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL

AI总结 针对大语言模型标准训练目标与幽默所需意外性之间的矛盾,提出认知协同框架,利用六种认知角色合成多样化喜剧视角数据,微调7B参数学生模型,实验表明认知驱动的数据策展比对齐算法或模型规模更关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30273 2026-05-29 cs.HC cs.AI cs.CL cs.CY cs.SI 75%

LLUMI: Improving LLM Writing Assistance for Mental Health Support with Online Community Feedback

LLUMI: 利用在线社区反馈改进心理健康支持中的LLM写作辅助

Jiwon Kim, Maya Ajit, Sherry Gong, Soorya Ram Shimgekar, Dong Whi Yoo, Eshwar Chandrasekharan, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)

专题命中 偏好对齐 :DPO(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 提出LLUMI框架,通过在线社区反馈(如Reddit投票)构建偏好对,结合监督微调和直接偏好优化训练开源小模型,在隐私保护下实现与GPT相当的心理健康支持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30323 2026-05-29 cs.LG cs.AI 73%

In-Context Reward Adaptation for Robust Preference Modeling

上下文奖励自适应用于鲁棒偏好建模

Zhenyu Sun, Zheng Xu, Ermin Wei

机构 * Northwestern University(西北大学) Meta Superintelligence Labs(Meta超智能实验室)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 提出基于Transformer的上下文奖励自适应框架,通过少量偏好示例和人类反应时间辅助信号,在线建模多样且未见的人类偏好,实现鲁棒的偏好建模和分布偏移适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29271 2026-05-29 cs.AI cs.IR cs.LG 73%

CoHyDE: Iterative Co-Training of LLM Rewriter & Dense Encoder for Tool Retrieval

CoHyDE: 用于工具检索的LLM改写器与稠密编码器的迭代协同训练

Vaishali Senthil, Ashutosh Hathidara, Sebastian Schreiber

机构 * SAP Labs(SAP实验室)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出CoHyDE方法,通过迭代协同训练稠密编码器和LLM改写器,结合对比学习和偏好对齐,在工具检索任务中同时提升标准查询和模糊查询的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18847 2026-05-29 cs.AI cs.CL 73%

Human-Guided Harm Recovery for Computer Use Agents

面向计算机使用代理的人类引导式危害恢复

Christy Li, Sky CH-Wang, Andi Peng, Andreea Bobu

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 针对LM代理在计算机系统中执行操作后的危害恢复问题,通过用户研究定义偏好对齐的恢复维度,提出基于奖励模型对候选恢复计划重排序的方法,并构建BackBench基准测试,实验表明该方法优于基线代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10228 2026-05-29 cs.AI 70%

SVSR: A Self-Verification and Self-Rectification Paradigm for Multimodal Reasoning

SVSR:一种用于多模态推理的自我验证与自我修正范式

Zhe Qian, Nianbing Su, Zhonghua Wang, Hebei Li, Zhongxing Xu, Yueying Li, Fei Luo, Zhuohan Ouyang, Yanbiao Ma

机构 * South China Agricultural University(华南农业大学) University of Glasgow(格拉斯哥大学) University of Electronic Science and Technology of China(电子科技大学) Monash University(莫纳什大学) University of Science and Technology of China(中国科学技术大学) National University of Defense Technology(国防科技大学) Renmin University of China(中国人民大学) South China Normal University(华南师范大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI

AI总结 提出SVSR框架,通过三阶段训练(统一偏好数据集构建、冷启动监督微调、半在线直接偏好优化)将自我验证与自我修正显式集成到多模态推理流程中,提升复杂视觉理解和多模态推理的鲁棒性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06254 2026-05-29 cs.AI cs.CL cs.LG 67%

PersonaAgent: Bridging Memory and Action for Personalized LLM Agents

PersonaAgent:弥合个性化LLM智能体的记忆与行动

Weizhi Zhang, Xinyang Zhang, Chenwei Zhang, Liangwei Yang, Jingbo Shang, Zhepei Wei, Henry Peng Zou, Zijie Huang, Zhengyang Wang, Yifan Gao, Xiaoman Pan, Lian Xiong, Jingguo Liu, Philip S. Yu, Xian Li

机构 * Amazon Stores Foundational AI(亚马逊基础AI)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PersonaAgent框架,通过整合个性化记忆模块(情景与语义记忆)和行动模块,并利用角色提示作为中介实现记忆与行动的协同,以解决LLM智能体的个性化任务。

Comments Accepted in ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21739 2026-05-29 cs.AI 57%

AttuneBench: A Conversation-Based Benchmark for LLM Emotional Intelligence

AttuneBench: 基于对话的LLM情商基准测试

Kate M. Lubrano, Faisal Sayed, Ankita Rathod, Akshansh, Craver Corbyn Thomas-Smith, Mark E. Whiting, Karina Nguyen

机构 * Pareto Thoughtful University of Pennsylvania(宾夕法尼亚大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 提出AttuneBench基准,基于200个真实多轮人机对话,评估LLM在情绪识别、行为分类、偏好预测和响应质量等方面的情商能力,发现这些能力相互独立且偏好对齐和响应质量更具区分性。

Comments v2: Updated def_18 and def_20 supplemental figures to cover all 11 evaluated models (previously 9). Removed redundant supplemental figures. Corrected select captions (color descriptions, chance baselines, figure-content mismatches). No changes to experimental results, numerical claims, or conclusions

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21151 2026-05-29 cs.IR 50%

VOGUE: A Multimodal Dataset for Conversational Recommendation in Fashion

VOGUE:面向时尚领域对话式推荐的多模态数据集

David Guo, Minqi Sun, Yilun Jiang, Jiazhou Liang, Scott Sanner

专题命中 偏好对齐 :alignment(abstract)

AI总结 为弥补多模态对话推荐数据集的不足,构建了包含60个人类对话、2100个细粒度标注话语的VOGUE数据集,支持视觉和上下文推理评估,并揭示了多模态大语言模型在偏好推断上的系统性分布误差。

详情

展开后加载摘要…

URL PDF HTML 收藏