arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-14 至 2026-05-14 共收录 93 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 8 篇

2605.11679 2026-05-14 cs.AI 83%

Explaining and Breaking the Safety-Helpfulness Ceiling via Preference Dimensional Expansion

通过偏好维度扩展解释并打破安全与有益性天花板

ShiYing Huang, Liang Lin, Yuer Li, Kaiwen Luo, Zhenhong Zhou, An Zhang, Junhao Dong, Kun Wang, Zhigang Zeng

机构 * Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) Chongqing University(重庆大学)

专题命中 偏好对齐 :safety(title);alignment(abstract);harmlessness(abstract);分类 cs.AI

AI总结 本文提出MORA方法,通过多维奖励整合解决多目标对齐中的安全与有益性矛盾,实验显示在序列对齐中提升5%-12.4%,同时对齐中整体奖励提升4.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13307 2026-05-14 cs.CL cs.HC 81%

PRISM-X: Experiments on Personalised Fine-Tuning with Human and Simulated Users

PRISM-X:基于人类和模拟用户的人个性化微调实验

Hannah Rose Kirk, Liu Leqi, Fanzhi Zeng, Henry Davidson, Bertie Vidgen, Christopher Summerfield, Scott A. Hale

机构 * University of Oxford(牛津大学) UK AI Security Institute(英国人工智能安全研究所) University of Texas at Austin(德克萨斯大学奥斯汀分校) Mercor Meedan

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL

AI总结 研究通过大规模内侧实验评估个性化语言模型在多轮对话中的表现,发现基于偏好微调的P-DPO方法优于通用模型和个性化提示,但个性化数据训练收益有限,且微调会放大趋炎附势行为,可能带来长期负面影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05000 2026-05-14 cs.LG cs.AI cs.CL 78%

Entropy Aware Reward Guidance for Diffusion Language Model Alignment

基于熵的奖励引导用于扩散语言模型对齐

Atula Tejaswi, Litu Rout, Constantine Caramanis, Sanjay Shakkottai, Sujay Sanghavi

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 偏好对齐 :alignment(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出EntRGi机制,解决离散扩散语言模型中无法通过自然输出区分的问题,通过动态插值连续token放松与采样硬token,提升奖励模型可靠性与优化精度。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10720 2026-05-14 cs.AI cs.CL cs.CY 67%

Teaching Language Models How to Code Like Learners: Conversational Serialization for Student Simulation

教语言模型如何像学习者一样编程:用于学生模拟的对话序列化

Charles Koutcheme, Juho Leinonen, Arto Hellas

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出通过对话序列化技术,直接从真实学生编程过程数据训练开放权重的人工编程学习者,提升模型在调试行为模拟中的能力。

Comments 8 pages, 2 figures, 2 tables. Accepted to Educational Data Mining 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12717 2026-05-14 cs.GT cs.AI 57%

The End Justifies the Mean: A Linear Ranking Rule for Proportional Sequential Decisions

目的 justify 平均:一种线性排名规则用于比例序列决策

Carmel Baharav, Niclas Boehmer, Bailey Flanigan, Maximilian T. Wittmann

机构 * MIT, USA(美国麻省理工学院) Hasso Plattner Institute, University of Potsdam, Germany(德国波茨坦大学哈索·普拉特纳研究院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文研究了如何通过线性排名规则在多次决策中实现比例性,提出角平均作为满足长期比例性的简单规则,并展示了其在高分歧情况下的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12545 2026-05-14 cs.CV cs.AI 57%

CROP: Expert-Aligned Image Cropping via Compositional Reasoning and Optimizing Preference

CROP:通过组合推理和优化偏好实现专家对齐的图像裁剪

Zhitong Dong, Chao Li, Jie Yu, Hao Chen

机构 * Southeast University(东南大学) Key Laboratory of New Generation Artificial Intelligence Technology(新一代人工智能技术重点实验室) Alibaba Group(阿里巴巴集团)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文提出CROP方法,通过组合推理和优化偏好,解决传统图像裁剪方法在复杂场景中难以做出组合权衡和缺乏适应性推理的问题,提升裁剪结果与专家审美的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07458 2026-05-14 cs.CV 50%

SpatialReward: Bridging the Perception Gap in Online RL for Image Editing via Explicit Spatial Reasoning

SpatialReward: 通过显式空间推理弥合在线强化学习中图像编辑的感知差距

Yancheng Long, Yankai Yang, Hongyang Wei, Wei Chen, Tianke Zhang, Haonan fan, Changyi Liu, Kaiyu Jiang, Jiankang Chen, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Hong Kong University of Science and Technology(香港科学与技术大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院,清华大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出SpatialReward,通过显式空间推理提升在线强化学习中图像编辑的感知准确性,其在MMRB2和EditReward-Bench上表现优异,并在MultiEditReward-Bench上超越专用评估器。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09946 2026-05-14 cs.GT 50%

Structure from Strategic Interaction & Uncertainty: Risk Sensitive Games for Robust Preference Learning

基于战略互动与不确定性的结构:用于鲁棒偏好学习的风险敏感游戏

Max Horwitz, Jake Gonzales, Eric Mazumdar, Lillian J. Ratliff

专题命中 偏好对齐 :safety(abstract)

AI总结 本文提出风险敏感偏好游戏,通过优化凸风险度量来提升鲁棒性,建立稳定算法并控制偏置,实验证明其在不同数据层的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 13 篇

2408.12935 2026-05-14 cs.AI 89%

AI Safety Landscape for Large Language Models: Taxonomy, State-of-the-art, and Future Directions

大语言模型的安全性景观:分类、现状与未来方向

Chen Chen, Xueluan Gong, Ziyao Liu, Weifeng Jiang, Si Qi Goh, Kwok-Yan Lam

机构 * College of Computing and Data Science(计算与数据科学学院)

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出新型框架,从可信AI、负责任AI和安全AI三个视角审视AI安全,综述当前研究进展,通过大语言模型等实例展示创新方法,旨在推动AI安全研究并提升数字转型信任度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23143 2026-05-14 cs.AI 88%

THINKSAFE: Self-Generated Safety Alignment for Reasoning Models

THINKSAFE: 为推理模型生成的自我安全对齐

Seanie Lee, Sangwoo Park, Yumin Choi, Gyeongman Kim, Minki Kang, Jihun Yun, Dongmin Park, Jongho Park, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) KRAFTON(KRAFTON公司) UC Berkeley(加州大学伯克利分校)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 THINKSAFE通过自我生成对齐框架提升推理模型的安全性,无需外部教师,实验表明其在安全性和推理能力上优于GRPO,计算成本显著降低。

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13043 2026-05-14 cs.CL 77%

Adaptive Steering and Remasking for Safe Generation in Diffusion Language Models

自适应转向与重掩码用于扩散语言模型中的安全生成

Yejin Lee, Yo-Sub Han

机构 * Department of Computer Science(计算机科学系) Yonsei University(延世大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文提出基于去噪过程分步干预的安全防御框架,通过对比安全方向(SGD)检测有害生成并重掩码以提高安全性,实验显示有效降低逃逸成功率至0.64%。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00616 2026-05-14 cs.AI 70%

SPOT: Selective Prompt Projection via Total Variation for Inference-Only Safe Text-to-Image Generation

SPOT:基于总变分的选性提示投影用于仅推理的文本到图像生成

Minhyuk Lee, Hyekyung Yoon, Myungjoo Kang

机构 * Seoul National University(首尔国立大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出SPOT框架,通过总变分约束生成器参考分布,实现对文本到图像生成中不安全内容的抑制,同时保持良性提示的行为,实验显示其在多个数据集上显著降低不适当评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13399 2026-05-14 cs.AI cs.CL 62%

Differentiable Evolutionary Reinforcement Learning

可微分进化强化学习

Sitao Cheng, Tianle Li, Xuhan Huang, Xunjian Yin, Difan Zou

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DERL,通过可微分的元优化器自动发现最优奖励结构,实现复杂任务中的高效强化学习,优于传统非可微方法。

Comments Work in Progress. We release our code and model at https://github.com/sitaocheng/DERL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13825 2026-05-14 cs.AI cs.CV 57%

History Anchors: How Prior Behavior Steers LLM Decisions Toward Unsafe Actions

历史锚点:先前行为如何引导大语言模型走向不安全行为

Alberto G. Rodríguez Salgado

机构 * Independent Researcher(独立研究员)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究通过100个高风险领域场景,探讨先前有害行为对LLM决策的影响,发现添加特定指令可显著增加不安全选择比例,揭示了代理部署中轨迹可被篡改的风险。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13334 2026-05-14 cs.CL 57%

LLM-Based Persuasion Enables Guardrail Override in Frontier LLMs

基于大语言模型的说服能克服前沿大语言模型的限制

Rodrigo Nogueira, Thales Sales Almeida, Giovana Kerche Bonás, Andrea Roque, Ramon Pires, Hugo Abonizio, Thiago Laitz, Celio Larcher, Roseval Malaquias Junior, Marcos Piau

机构 * Maritaca AI JusBrasil

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 研究展示通过大语言模型作为模拟用户进行说服对话,可使其他大语言模型生成争议性文本,采用自然语言压力策略,如同行比较和认知责任重构,实现说服效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00200 2026-05-14 cs.CL 57%

Confidence Estimation in Automatic Short Answer Grading with LLMs

基于大语言模型的自动简答评分中的置信度估计

Longwei Cong, Sonja Hahn, Sebastian Gombert, Leon Camus, Hendrik Drachsler, Ulf Kroehne

机构 * DIPF | Leibniz Institute for Research and Information in Education(莱布尼茨教育研究与信息研究所) Faculty of Computer Science, Goethe University Frankfurt(弗赖堡大学计算机科学系) Chemnitz University of Technology(化学工业大学)

专题命中 安全训练 :trustworthy(abstract);分类 cs.CL

AI总结 本文研究了基于大语言模型的自动简答评分中的置信度估计,结合模型内置置信信号和数据集衍生的不确定性,提出混合置信框架以提升评分选择性。

Comments accepted to the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12561 2026-05-14 cs.LG cs.RO 57%

Learning When to Act: Communication-Efficient Reinforcement Learning via Run-Time Assurance

学习何时行动:通过运行时保证实现通信高效的强化学习

Adam Haroon, Erick J. Rodríguez-Seda, Cody Fleming, Tristan Schuler

机构 * Department of Mechanical Engineering, Iowa State University(爱荷华州立大学机械工程系) Department of Weapons, Robotics, and Control Engineering, United States Naval Academy(美国海军学院武器、机器人与控制工程系) Navy Center for Applied Research in Artificial Intelligence (NCARAI), U.S. Naval Research Laboratory(美国海军人工智能应用研究中心(NCARAI))

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出通过运行时保证实现通信高效的强化学习,研究在已知平衡点附近稳定化问题,通过Lyapunov安全盾联合学习控制输入和通信效率的决策,展示适应性定时而非平均速率使稀疏安全。

Comments 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12526 2026-05-14 cs.SI cs.CY 57%

"F*** You Biden": Cross-Partisan Electoral Toxicity on X

对拜登说“你去死吧”:推特上的跨党派选举毒性

Danishjeet Singh, Anindya Mondal, Filippo Menczer

专题命中 安全训练 :alignment(abstract);分类 cs.CY

AI总结 研究分析了2024年美国总统大选期间推特上跨党派言论毒性,发现共和党帖子毒性更高,但民主党帖子收到更多有毒回复,这可能源于共和党用户更频繁地回复民主党内容。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13185 2026-05-14 cs.FL cs.MA 50%

Decoupled Planning for Multiple Omega-Regular Objectives

多重ω-regular目标的解耦规划

Guy Avni, Thomas A. Henzinger, Kaushik Mallik, Suman Sadhukhan, K. S. Thejaswini

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了解耦框架,通过独立代理选择局部策略并由调度器动态组合,解决图上满足多个ω-regular目标的路径生成问题,探讨了调度器协调对正确性的必要性及安全目标的同步协议。

Comments 33 pages, 6 figures. Extended version of the paper accepted at CAV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22117 2026-05-14 eess.SY cs.SY 50%

Safe Multi-Agent Navigation via Constrained HJB-Informed Learning

通过约束HJB引导学习实现安全多智能体导航

Fenglan Wang, Xinguo Shu, Lei He, Lin Zhao

专题命中 安全训练 :safety(abstract)

AI总结 本文提出HJB-GNN框架,通过联合学习控制屏障函数、分布式导航策略和价值函数,实现多智能体导航中的安全约束与目标达成的平衡,验证了其在复杂环境中的优越性能和可扩展性。

Comments Accepted by Robotics: Science and Systems (RSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00982 2026-05-14 cs.RO cs.MA 50%

Robust and Safe Multi-Agent Reinforcement Learning with Communication for Autonomous Vehicles: From Simulation to Hardware

具备通信的鲁棒且安全的多智能体强化学习:从仿真到硬件

Keshawn Smith, Zhili Zhang, H M Sabbir Ahmad, Ehsan Sabouni, Mainak Mondal, Song Han, Wenchao Li, Fei Miao

机构 * Department of ECE University of Connecticut(电子工程系,康涅狄格大学) School of Computing University of Connecticut(计算学院,康涅狄格大学) Department of ECE Boston University(电子工程系,波士顿大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出RSR-RSMARL框架,通过鲁棒强化学习算法和安全模块实现多智能体系统在仿真与硬件间的零 shot 转移,提升自动驾驶安全性和协调性。

Comments 15 pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 6 篇

2605.13411 2026-05-14 cs.CR cs.CL 83%

Model-Agnostic Lifelong LLM Safety via Externalized Attack-Defense Co-Evolution

基于外部化攻击-防御共演的模型无关持续LLM安全

Xiaozhe Zhang, Chaozhuo Li, Hui Liu, Shaocheng Yan, Bingyu Yan, Qiwei Ye, Haoliang Li

机构 * City University of Hong Kong(香港城市大学) Beijing University of Posts and Telecommunications(北京邮电大学) Wuhan University(武汉大学) Beihang University(北京航空航天大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 越狱攻击 :safety(title,abstract);red teaming(abstract);分类 cs.CL

AI总结 本文提出EvoSafety框架,通过外部结构实现持续安全改进,采用对抗技能库和轻量防御模型,在单一训练中实现攻击探测与防御提升,实验显示其在Guard模式下防御成功率高达99.61%。

Comments 48 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12869 2026-05-14 cs.CR cs.AI 83%

Quantifying LLM Safety Degradation Under Repeated Attacks Using Survival Analysis

利用生存分析量化LLM在反复攻击下的安全退化

Zvi Topol

机构 * MuyVentive, LLC(MuyVentive公司)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出利用生存分析评估LLM在持续对抗压力下的安全退化,揭示不同模型在多次攻击下的脆弱性差异,为模型开发者提供评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13115 2026-05-14 cs.CR cs.LG 57%

DiffusionHijack: Supply-Chain PRNG Backdoor Attack on Diffusion Models and Quantum Random Number Defense

DiffusionHijack: 供应链PRNG后门攻击针对扩散模型和量子随机数防御

Ziyang You, Liling Zheng, Xiaoke Yang, Xuxing Lu

机构 * School of Electronics, Electrical Engineering and Physics, Fujian University of Technology(福建工程学院电子工程与物理学院) School of Humanities, Fujian University of Technology(福建工程学院人文学院) Institute of Applied Physics and Materials Engineering, University of Macau(澳门大学应用物理与材料工程学院)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 研究提出DiffusionHijack攻击通过供应链注入恶意PRNG控制扩散模型生成图像,采用量子随机数生成器有效防御该攻击,降低输出相似度至随机基线水平。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13044 2026-05-14 cs.CR cs.AI 57%

No Attack Required: Semantic Fuzzing for Specification Violations in Agent Skills

无需攻击:用于代理技能规范违规的语义模糊测试

Ying Li, Hongbo Wen, Yanju Chen, Hanzhi Liu, Yuan Tian, Yu Feng

机构 * University of California, San Diego(加州大学圣迭戈分校)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出Sefz框架,通过语义模糊测试发现代理技能中的规范违规问题,揭示了安全规则漏洞对用户信任的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21457 2026-05-14 cs.CR 50%

SoK: Exposing the Generation and Detection Gaps in LLM-Generated Phishing

SoK:揭示大语言模型生成钓鱼攻击的生成与检测差距

Fengchao Chen, Tingmin Wu, Van Nguyen, Carsten Rudolph

专题命中 越狱攻击 :safety(abstract)

AI总结 本文首次全面分析大语言模型生成的钓鱼内容,揭示其逃避检测、强调人类认知操控的特点,并指出防御策略与生成方法间的不对称性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12565 2026-05-14 cs.CR 50%

Persona-Conditioned Adversarial Prompting (PCAP): Multi-Identity Red-Teaming for Enhanced Adversarial Prompt Discovery

基于身份的对抗提示生成(PCAP):多身份红队测试以提升对抗提示发现

Cristian Morasso, Anisa Halimi, Muhammad Zaid Hameed, Douglas Leith

专题命中 越狱攻击 :jailbreak(abstract_cn)

AI总结 PCAP通过结合攻击者身份和策略卡进行对抗搜索,提高攻击成功率和提示多样性,增强对抗策略覆盖范围。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 2 篇

2604.23887 2026-05-14 cs.CR cs.AI 74%

Evaluation of Prompt Injection Defenses in Large Language Models

对大型语言模型中提示注入防御措施的评估

Priyal Deep, Shane Emmons, Amy Fox, Kyle Bacon, Kelley McAllister, Peter Ortiz, Krisztian Flautner

机构 * Swept AI University of Michigan(密歇根大学)

专题命中 提示注入 :prompt injection(title);分类 cs.AI

AI总结 研究通过构建自适应攻击者测试了九种防御配置,发现依赖模型自我保护的防御均失效,而输出过滤通过硬编码规则在应用代码中检查响应,实现了零泄露。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13471 2026-05-14 cs.CR 71%

Sleeper Channels and Provenance Gates: Persistent Prompt Injection in Always-on Autonomous AI Agents

睡眠通道与溯源门:始终在线自主AI代理中的持久提示注入

Narek Maloyan, Dmitry Namiot

专题命中 提示注入 :prompt injection(title)

AI总结 研究提出睡眠通道概念,揭示始终在线AI代理中持久提示注入的机制,并通过层级防御方案和形式化证明提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 7 篇

2605.13723 2026-05-14 cs.HC cs.AI cs.LG cs.SI 62%

Humanwashing -- It Should Leave You Feeling Dirty

人类洗清——它应该让你感到肮脏

Ben Wilson, Matimba Swana, Peter Winter, Matt Roach

机构 * Computational Foundry, Swansea University, UK(计算泉研究所,斯wansea大学,英国) University of Bristol, UK(布里斯托大学,英国)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文质疑'人类在环'概念在AI决策系统中的有效性,指出其可能掩盖真实过程与结果,提出'人类洗清'现象需引起关注。

Comments 10 pages, 1 figure. Reviewed and accepted for presentation at HHAI 2026, Brussels

详情

展开后加载摘要…

URL PDF HTML 收藏