arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-10 至 2026-03-10 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 8 篇

2603.03054 2026-03-10 cs.CL 85%

PrivMedChat: End-to-End Differentially Private RLHF for Medical Dialogue Systems

PrivMedChat: 医疗对话系统的端到端差分隐私RLHF

Sudip Bhujel

机构 * Graduate Student in the Department of Computer Science, University of Kentucky(计算机科学系研究生,肯塔基大学)

专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL

AI总结 PrivMedChat通过端到端差分隐私RLHF方法,在医疗对话系统中实现隐私保护与对齐,采用DP-SGD和DP-aware策略优化,避免临床标注成本,提供正式隐私保证。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07017 2026-03-10 cs.CL cs.AI cs.LG 85%

Can Safety Emerge from Weak Supervision? A Systematic Analysis of Small Language Models

安全能否从弱监督中涌现?小型语言模型的系统分析

Punyajoy Saha, Sudipta Halder, Debjyoti Mondal, Subhadarshi Panda

机构 * Samsung Research Institute(三星研究院)

专题命中 偏好对齐 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Self-MOA通过弱监督实现小型语言模型的安全对齐,显著提升安全性的同时保持有用性,减少对人工标注数据的依赖。

Comments 19 pages, 10 tables, 7 figures, under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07023 2026-03-10 cs.CL cs.AI 81%

Hit-RAG: Learning to Reason with Long Contexts via Preference Alignment

通过偏好对齐学习长上下文的推理

Junming Liu, Yuqi Li, Shiping Wen, Zhigang Zeng, Tingwen Huang

机构 * Tongji University(同济大学) The City University of New York(纽约城市大学) University of Technology Sydney(悉尼大学) Huazhong University of Science and Technology(华中科技大学) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 Hit-RAG通过多阶段偏好对齐框架解决长上下文推理中的注意力稀释和幻觉问题,提升模型在长上下文场景下的推理能力。

Comments 21 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06797 2026-03-10 cs.AI cs.LG 81%

Best-of-Tails: Bridging Optimism and Pessimism in Inference-Time Alignment

最佳尾部:在推理时间对齐中弥合乐观与悲观

Hsiang Hsu, Eric Lei, Chun-Fu Chen

机构 * JPMorganChase Global Technology Applied Research(摩根大通全球技术应用研究)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出BoT框架,通过Tsallis分歧作为正则化器,在推理时间对齐中平衡乐观与悲观,提升对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17252 2026-03-10 cs.LG cs.AI 79%

Adaptive Batch-Wise Sample Scheduling for Direct Preference Optimization

适应性批级样本调度用于直接偏好优化

Zixuan Huang, Yikun Ban, Lean Fu, Xiaojie Li, Zhongxiang Dai, Jianxin Li, Deqing Wang

机构 * Beihang University(北京航空航天大学) Bytedance China(字节跳动中国) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SamS算法,通过动态调度训练样本提升DPO性能,无需修改核心算法,有效提高LLM对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08412 2026-03-10 cs.CL cs.AI 62%

Aligning to Illusions: Choice Blindness in Human and AI Feedback

对幻觉的对齐:人类和AI反馈中的选择盲区

Wenbin Wu

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示RLHF中偏好构建的问题,显示人类和AI反馈中的选择盲区受上下文影响,导致奖励信号失真。

Comments 16 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16301 2026-03-10 cs.AI cs.CL 62%

Adaptation of Agentic AI: A Survey of Post-Training, Memory, and Skills

代理AI的适应:训练后、记忆和技能的综述

Pengcheng Jiang, Jiacheng Lin, Zhiyi Shi, Zifeng Wang, Luxi He, Yichen Wu, Ming Zhong, Peiyang Song, Qizheng Zhang, Heng Wang, Xueqiang Xu, Hanwen Xu, Pengrui Han, Dylan Zhang, Jiashuo Sun, Chaoqi Yang, Kun Qian, Tian Wang, Changran Hu, Manling Li, Quanzheng Li, Hao Peng, Sheng Wang, Jingbo Shang, Chao Zhang, Jiaxuan You, Liyuan Liu, Pan Lu, Yu Zhang, Heng Ji, Yejin Choi, Dawn Song, Jimeng Sun, Jiawei Han

机构 * UIUC(伊利诺伊大学香槟分校) Stanford(斯坦福大学) Princeton(普林斯顿大学) Harvard(哈佛大学) UC Berkeley(加州大学伯克利分校) Caltech(加州理工学院) UCSD(加州大学圣地亚哥分校) Georgia Tech(佐治亚理工学院) Northwestern(西北大学) TAMU(德克萨斯大学奥斯汀分校) MGH(麻省总医院) Keiji AI Unity

专题命中 偏好对齐 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了代理AI在训练后、记忆和技能方面的适应方法,提出四范式框架,分析了代理与工具适应的技术细节及权衡,探讨了开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08230 2026-03-10 cs.SD cs.AI eess.AS 57%

Disentangling Reasoning in Large Audio-Language Models for Ambiguous Emotion Prediction

解构大音频-语言模型中的推理能力以实现模糊情绪预测

Xiaofeng Yu, Jiaheng Dong, Jean Honorio, Abhirup Ghosh, Hong Jia, Ting Dang

机构 * University of Auckland, New Zealand(奥克兰大学) The University of Melbourne, Australia(墨尔本大学) University of Birmingham, United Kingdom(伯明翰大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

AI总结 本文提出了一种新的方法,通过将模糊情绪识别转化为分布推理问题,提升大音频-语言模型在模糊情绪预测中的推理能力。

Comments The paper was submitted to Interspeech for review

详情

展开后加载摘要…

URL PDF HTML 收藏