arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-01 至 2026-05-01 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 8 篇

2604.27401 2026-05-01 cs.CL cs.LG 85%

Perturbation Probing: A Two-Pass-per-Prompt Diagnostic for FFN Behavioral Circuits in Aligned LLMs

扰动探测:对齐语言模型中FFN行为电路的双次提示诊断

Hongliang Liu, Tung-Ling Li, Yuhao Wu

机构 * Palo Alto Networks(帕洛阿尔托网络公司)

专题命中 偏好对齐 :RLHF(summary_cn,abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 通过双次提示传递和无反向传播的扰动探测,识别LLM中两种行为电路结构,揭示RLHF组织的行为机制及模板层编辑工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03853 2026-05-01 cs.CR cs.LG 77%

Dr. Jekyll and Mr. Hyde: Two Faces of LLMs

医生贾克尔与 Mr. 海德:大语言模型的两面

Matteo Gioele Collu, Tom Janssen-Groesbeek, Stefanos Koffas, Mauro Conti, Stjepan Picek

机构 * University of Padova(帕多瓦大学) Radboud University(拉德博德大学) Delft University of Technology(代尔夫特理工大学) Örebro University(欧雷布罗大学) University of Zagreb Faculty of Electrical Engineering(Zagreb大学电子工程学院) University of Bergen(卑尔根大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);safety(abstract);分类 cs.LG

AI总结 研究通过角色扮演攻击揭示大语言模型的安全漏洞,展示通过伪装复杂人格可获取非法信息,验证了多种模型在2023-2025年间对攻击的脆弱性。

Comments Presented at the Joint National Conference on Cybersecurity (ITASEC & SERICS 2026), Cagliari, Italy, February 09-13, 2026. Published as Paper 35 in CEUR Workshop Proceedings, Vol-4198. Available at: https://ceur-ws.org/Vol-4198/

Journal ref Proc. Joint National Conference on Cybersecurity (ITASEC & SERICS 2026), CEUR-WS.org, Vol-4198, 35, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28036 2026-05-01 cs.LG cs.IT math.IT 70%

Exponential families from a single KL identity

从单个KL恒等式出发的指数族

Marc Dymetman

机构 * Scientific Consultant(科学顾问)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 本文通过一个简单的指数族KL差恒等式,推导出多项经典结果,包括三点恒等式、I投影定理、对数分区函数的凸性等,无需复杂推导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27969 2026-05-01 cs.SE cs.AI 70%

From Mirage to Grounding: Towards Reliable Multimodal Circuit-to-Verilog Code Generation

从幻象到基础:迈向可靠的多模态电路到Verilog代码生成

Guang Yang, Xing Hu, Xiang Chen, Xin Xi

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security, Hangzhou(杭州高新技术区(滨江)区块链与数据安全研究院,杭州) School of Artificial Intelligence and Computer Science, Nantong University(人工智能与计算机科学学院,南通大学)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出VeriGround模型,通过标识符匿名化、拒绝增强和D-ORPO对齐,解决了多模态模型在电路到Verilog代码生成中的可靠性问题,验证了真实视觉基础的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19342 2026-05-01 stat.ML cs.LG stat.ME 70%

Contextual Online Uncertainty-Aware Preference Learning for Human Feedback

基于上下文的在线不确定性感知偏好学习用于人类反馈

Nan Lu, Ethan Lee, Ethan X. Fang, Junwei Lu

机构 * Department of Biostatistics, Harvard T.H. Chan School of Public Health(哈佛大学T.H.陈公共卫生学院生物统计学系) Department of Biostatistics & Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出一种新的统计框架,利用动态上下文信息在线决策和统计推断最优模型,通过人类偏好数据实现最优 regret 绑定和估计量渐近分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27495 2026-05-01 cs.CL cs.AI 62%

Debiasing Reward Models via Causally Motivated Inference-Time Intervention

通过因果驱动的推理时干预去偏奖励模型

Kazutoshi Shinoda, Kosuke Nishida, Kyosuke Nishida

机构 * Human Informatics Labs., NTT, Inc.(NTT人类信息学实验室)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出因果驱动的干预方法,用于在推理时减轻奖励模型中的多种偏差。通过抑制与预定义偏差属性强相关的神经元激活,减少对虚假特征的敏感性,同时保持性能。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01611 2026-05-01 cs.CL 57%

In-context Learning vs. Instruction Tuning: The Case of Small and Multilingual Language Models

上下文学习与指令微调:小语言模型和多语言情况的案例

David Ponce, Thierry Etchegoyhen

机构 * Fundación Vicomtech, Basque Research and Technology Alliance (BRTA)(维克森科技基金会,巴斯克研究与技术联盟(BRTA)) University of the Basque Country UPV/EHU(巴斯克大学UPV/EHU)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 研究评估了上下文学习在非英语语言和不同模型大小下的指令遵循有效性,发现其表现下降,但通过直接偏好优化可部分提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27699 2026-05-01 cs.AI 57%

Bridging Values and Behavior: A Hierarchical Framework for Proactive Embodied Agents

连接价值与行为:一种面向主动具身代理的分层框架

Chunhui Zhang, Yuxuan Wang, Aoyang Qin, Yi-Long Lu, Kunlun Wu, Yizhou Wang, Wei Wang

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) School of Computer Science, Peking University(北京大学计算机学院) Tsinghua University(清华大学) Nat’l Eng. Research Center of Visual Technology, Peking University(北京大学视觉技术国家工程研究中心) Institute for AI, Peking University(北京大学人工智能研究院) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文提出ValuePlanner框架,通过分层认知架构分离高阶价值调度与低阶行动执行,结合LLM生成符号子目标并用PDDL规划器转化为行动计划,通过反馈机制提升自主性,实验表明其能生成连贯的长期自主行为。

详情

展开后加载摘要…

URL PDF HTML 收藏