arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-22 至 2026-05-22 共收录 79 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 8 篇

2605.21822 2026-05-22 cs.AI 89%

Implicit Safety Alignment from Crowd Preferences

从大众偏好中隐式安全对齐

Qian Lin, Daniel S. Brown

机构 * Kahlert School of Computing, University of Utah(犹他大学计算学校)

专题命中 偏好对齐 :safety(title,abstract);alignment(title);RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 本文研究如何从大众偏好数据中提取共享的安全标准,并将其转移到下游强化学习任务中以规范智能体行为并确保安全。提出了一种基于大众偏好的安全强化学习框架,通过高级策略将安全对齐的技能组合起来,以安全地解决下游任务。

Comments Accepted to ICML 2026. Conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05660 2026-05-22 cs.CR cs.AI cs.CL 85%

Optimus: A Robust Defense Framework for Mitigating Toxicity while Fine-Tuning Conversational AI

Optimus: 一种用于在微调对话AI时缓解毒性行为的稳健防御框架

Aravind Cheruvu, Shravya Kanchi, Sifat Muhammad Abdullah, Nicholas Ka-Shing Kong, Daphne Yao, Murtuza Jadliwala, Bimal Viswanath

机构 * University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 本研究提出Optimus框架,通过整合训练无关的毒性分类方案和双重策略对齐过程,有效缓解微调过程中的毒性问题,并在有毒性分类器偏差时仍能保持高召回率,优于现有最佳防御方法StarDSS。

Comments Accepted at ACM CODASPY 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22211 2026-05-22 cs.AI 81%

CLORE: Content-Level Optimization for Reasoning Efficiency

CLORE:面向推理效率的内容级优化

Yuyang Wu, Qiyao Xue, Guanxing Lu, Weichen Liu, Zihan Wang, Manling Li, Olexandr Isayev

机构 * Carnegie Mellon University(卡内基梅隆大学) Northwestern University(西北大学) University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校) University of Pittsburgh(匹兹堡大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI

AI总结 本文提出CLORE框架,通过编辑正确在线轨迹来提升大语言模型的推理效率,通过外部增强模型删除冗余、不可读或无关内容,同时保留最终答案,并结合辅助参考-free DPO目标和标准策略梯度训练优化增强-原始对,实验表明CLORE在五个数学推理基准上提升了准确性和效率的平衡,并与GRPO、DAPO、Training Efficient和ThinkPrune兼容。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17602 2026-05-22 cs.AI cs.CV cs.LG 81%

AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image Alignment

AutoRubric-T2I: 一种用于文本到图像对齐的鲁棒基于规则的奖励模型

Kuei-Chun Kao, Daixuan Huo, Yuanhao Ban, Cho-Jui Hsieh

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出AutoRubric-T2I,一种首个用于文本到图像生成的规则学习框架,通过自动合成和选择显式规则来指导视觉语言模型(VLM)法官。该方法通过合成偏好对的推理轨迹生成候选规则,并利用VLM法官在每种规则下对配对图像进行评分,产生配对规则评分差异用于偏好学习。通过ℓ1正则化逻辑回归精简器去除噪声和冗余规则,从而在少量标注偏好数据下生成高质量、可解释的奖励信号,并在多个图像奖励基准测试中优于现有奖励模型基线。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12623 2026-05-22 cs.CL cs.CV cs.LG 73%

DocAtlas: Multilingual Document Understanding Across 80+ Languages

DocAtlas: 跨80多种语言的多语言文档理解

Ahmed Heakl, Youssef Mohamed, Abdullah Sohail, Rania Elbadry, Ahmed Nassar, Peter W. J. Staar, Fahad Shahbaz Khan, Imran Razzak, Salman Khan

机构 * MBZUAI(穆罕默德·本·拉谢德人工智能研究所) IBM Research(IBM研究院)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出DocAtlas框架,通过构建高保真的OCR数据集和基准测试,覆盖82种语言和9个评估任务,利用双重管道生成精确的结构注解,展示了直接偏好优化在多语言适应中的有效性,提升了领域内和领域外的准确率。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22717 2026-05-22 cs.SD cs.AI cs.LG cs.MM 62%

Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of Interactive Diffusion Music Generators

实时音乐扩散模型:交互式音乐生成扩散模型的高效微调与后训练

Zachary Novack, Stephen Brade, Haven Kim, Hugo Flores García, Nithya Shikarpur, Chinmay Talegaonkar, Suwan Kim, Valerie K. Chen, Julian McAuley, Taylor Berg-Kirkpatrick, Cheng-Zhi Anna Huang

机构 * UC San Diego(加州大学圣迭戈分校) MIT(麻省理工学院) Adobe(Adobe公司)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了音频扩散模型能否通过块级KV缓存高效地转化为交互式模型,从而在消费级硬件上实现。提出的Live Music Diffusion Models (LMDMs)通过块级KV缓存恢复并超越了离散Live Music Models (LMMs)的推理复杂度,并通过ARC-Forcing范式实现稳定的后训练对齐,从而在无需显式RL或奖励模型的情况下减少误差累积。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18721 2026-05-22 cs.LG cs.CL 62%

General Preference Reinforcement Learning

通用偏好强化学习

Muhammad Umer, Muhammad Ahmed Mohsin, Ahsan Bilal, Arslan Chaudhry, Andreas Haupt, Sanmi Koyejo, Emily Fox, John M. Cioffi

机构 * Stanford University(斯坦福大学) The University of Oklahoma(俄克拉荷马大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通用偏好强化学习(GPRL),通过引入通用偏好模型(GPM)解决传统强化学习在开放任务中连续探索不足的问题,通过多维偏好比较提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21967 2026-05-22 cs.IR 50%

Reinforced Preference Optimization for Reasoning-Augmented Recommendations

增强偏好优化用于推理增强的推荐

Jingtong Gao, Zeyu Song, Chi Lu, Xiaopeng Li, Derong Xu, Maolin Wang, Peng Jiang, Kun Gai, Qingpeng Cai, Xiangyu Zhao

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出RPORec框架,通过统一LLM的推理能力与专用推荐头,提升推荐系统的精确性,实验表明其在公开基准和大规模部署中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 8 篇

2605.21834 2026-05-22 cs.LG 85%

On-Policy Consistency Training Improves LLM Safety with Minimal Capability Degradation

基于策略的一致性训练通过最小能力退化提升大语言模型安全性

Andy Han, Kristina Fujimoto, Avidan Shah, Kiet Nguyen, Kai Xu, Chen Yueh-Han, Ilia Sucholutsky, Rico Angell

机构 * New York University(纽约大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.LG

AI总结 本文提出基于策略的一致性训练(OPCT)方法,通过模型自身响应对比性提示来提升大语言模型的安全性,实验表明OPCT在抑制顺从性、防止越狱和增强安全意识方面优于传统监督微调(SFT),同时避免了SFT导致的能力退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21683 2026-05-22 cs.AI 83%

Investigating Concept Alignment Using Implausible Category Members

通过不合理的类别成员探究概念对齐

Sunayana Rane, Brenden M. Lake, Thomas L. Griffiths

机构 * Department of Computer Science(计算机科学系) Princeton University(普林斯顿大学) Department of Psychology(心理学系)

专题命中 安全训练 :alignment(title);safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文研究了通过询问不合理类别成员来探究概念边界,发现AI模型在某些概念上与人类存在显著差异,如将'词语'归类为'车辆'或'衣物',并探讨了这些概念错位对AI安全的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21609 2026-05-22 cs.CL cs.AI cs.CY 82%

CR4T: Rewrite-Based Guardrails for Adolescent LLM Safety

CR4T:基于重写的青少年LLM安全机制

Heajun An, Qi Zhang, Vedanth Achanta, Jin-Hee Cho

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出CR4T框架,通过选择性响应重构替代拒绝导向的安全机制,以更符合青少年发展需求的方式提升LLM的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21496 2026-05-22 cs.LG cs.AI cs.CL 82%

HealthCraft: A Reinforcement Learning Safety Environment for Emergency Medicine

HealthCraft: 一种用于急救医学的强化学习安全环境

Brandon Dent

机构 * GOATnote Inc.(GOATnote公司)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出HealthCraft,首个公开的强化学习环境,用于在真实急救医学条件下奖励轨迹级安全,通过FHIR R4世界状态、24个MCP工具和双层评估标准,评估模型在急救任务中的安全性和性能,揭示了模型在多步骤工作流中的安全失败问题。

Comments 16 pages, 5 figures, 6 tables. Code, task suite, and Docker bundle: https://github.com/GOATnote-Inc/healthcraft

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22156 2026-05-22 cs.LG cs.AI 62%

One-Way Policy Optimization for Self-Evolving LLMs

单向策略优化用于自演化大语言模型

Shuo Yang, Jinda Lu, Kexin Huang, Chiyu Ma, Shaohang Wei, Yuyang Liu, Guoyin Wang, Jingren Zhou, Li Yuan

机构 * Shenzhen Graduate School, Peking University(北京大学深圳研究生院) Dartmouth College(达特茅斯学院) Alibaba(阿里巴巴)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出单向策略优化方法,通过解耦优化方向与更新幅度,解决传统方法中验证器奖励稀疏导致的训练不稳定问题,实现大语言模型的持续自演化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07799 2026-05-22 cs.RO cs.AI 57%

Learning Without Losing Identity: Capability Evolution for Embodied Agents

无需失去身份的学习:体素代理的能力进化

Xue Qin, Simin Luan, John See, Cong Yang, Zhijun Li

机构 * School of Software, Harbin Institute of Technology(哈尔滨工业大学软件学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Mathematical and Computer Sciences, Heriot-Watt University(赫瑞-沃德大学数学与计算机科学学院) School of Future Science and Engineering, Soochow University(苏州大学未来科学与工程学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种以能力为中心的体素代理进化范式,通过引入体素能力模块(ECMs)实现持续改进,同时保持代理身份的稳定性,实验表明其在任务成功率和安全性方面优于传统方法。

Comments 12 pages, 2 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21673 2026-05-22 physics.ao-ph cs.CY cs.DL 57%

From Licensing to Open Access: Designing a Sustainable Transition in Operational Weather Data

从许可到开放获取:设计可持续的运营天气数据转型

Emma Pidduck, Umberto Modigliani, Victoria L. Bennett, Fabio Venuti, Florian Pappenberger, Florence Rabier

专题命中 安全训练 :alignment(abstract);分类 cs.CY

AI总结 本文研究了欧洲中期天气预报中心(ECMWF)从受限数据许可模式向CC BY 4.0开放获取的转型,探讨了其设计方法和可持续性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21545 2026-05-22 cs.SE cs.AI 57%

RefusalBench: Why Refusal Rate Misranks Frontier LLMs on Biological Research Prompts

RefusalBench: 为什么拒绝率错误排名前沿大语言模型在生物研究提示中的表现

Lukas Weidener, Marko Brkić, Mihailo Jovanović, Emre Ulgac, Aakaash Meduri

机构 * Applied Scientific Intelligence, Inc.(应用科学智能公司)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出RefusalBench,通过141个提示的47组匹配三元组,评估前沿大语言模型在生物研究提示中的拒绝行为,发现拒绝率错误排名安全校准,揭示了模型在不同风险层级下的表现差异。

Comments 34 pages, 4 figures, 12 tables (10 in main text, 2 in supplementary). Code and data: https://github.com/AppliedScientific/refusalbench

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 3 篇

2605.10067 2026-05-22 cs.LG cs.AI 89%

Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization

Metis: 通过自进化元认知策略优化学习 jailbreak LLMs

Huilin Zhou, Jian Zhao, Yilu Zhong, Zhen Liang, Xiuyuan Chen, Yuchen Yuan, Tianle Zhang, Chi Zhang, Lan Zhang, Xuelong Li

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 越狱攻击 :jailbreak(title,title_cn);alignment(abstract);safety(abstract);red teaming(abstract)

AI总结 本文提出Metis框架,通过将jailbreaking重新表述为对抗性部分可观测马尔可夫决策过程中的推理时间策略优化,以提高对抗性测试的效率和效果,同时通过结构化反馈和透明推理轨迹提升可解释性,实验表明Metis在多种模型上均表现出更高的攻击成功率和更低的token成本。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21541 2026-05-22 cs.CR cs.AI cs.LG stat.ML 81%

Frequency-Domain Regularized Adversarial Alignment for Transferable Attacks against Closed-Source MLLMs

频域正则化对抗对齐用于针对闭源大语言模型的可转移攻击

Leitao Yuan, Qinghua Mao, Daizong Liu, Kun Wang, Wenjie Wang, Yan Teng, Jing Shao, Dongrui Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学)

专题命中 越狱攻击 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出FRA-Attack,通过频域正则化方法解决对抗转移性问题,通过高通DCT目标和频率域梯度正则化提升跨模型的对抗转移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21674 2026-05-22 cs.CR 67%

Adversarial Reframing: A Framework for Targeted Generation in Language Models

对抗性重构:一种用于语言模型针对性生成的框架

Shahnewaz Karim Sakib, Swati Kar, Anindya Bijoy Das

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)

AI总结 本文提出THREAT框架,通过协调多个语言模型进行迭代搜索,寻找文本劫持提示,并通过非凸优化问题解决提示发现问题,提高了攻击成功率并降低了计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 2 篇

2605.06669 2026-05-22 cs.CR cs.AI cs.LG 84%

Evaluating Prompt Injection Defenses for Educational LLM Tutors: Security-Usability-Latency Trade-offs

评估教育LLM导师的提示注入防御:安全-可用性-延迟的权衡

Alexandre Cristovão Maiorano

机构 * Lumytics

专题命中 提示注入 :prompt injection(title);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种评估提示注入防御方法的框架,探讨了在教育LLM导师中安全、可用性和延迟之间的权衡,并通过实验比较了不同防御机制的性能。

Comments 19 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06556 2026-05-22 cs.CR cs.AI 57%

Semantic Attacks on Tool-Augmented LLMs: Securing the Model Context Protocol Against Descriptor-Level Manipulation

对增强工具的语义攻击:保护模型上下文协议免受描述级操纵

Saeid Jamshidi, Arghavan Moradi Dakhel, Kawser Wazed Nafi, Foutse Khomh

机构 * SWAT Laboratory, Polytechnique Montréal(SWAT实验室,蒙特利尔理工学院)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文研究了通过工具描述符与外部工具交互的模型上下文协议(MCP)中存在的语义攻击问题,提出了一种分层防御方案,通过描述符完整性验证、预上下文语义审查和轻量级运行时防护机制,有效降低描述级操纵导致的不安全工具调用风险。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 3 篇

2605.21801 2026-05-22 cs.LG cs.CL 62%

Why Semantic Entropy Fails: Geometry-Aware and Calibrated Uncertainty for Policy Optimization

为何语义熵失效:面向策略优化的几何感知与校准不确定性

Zheyuan Zhang, Kaiwen Shi, Han Bao, Zehong Wang, Tianyi Ma, Yanfang Ye

机构 * University of Notre Dame(诺丁汉大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种新的策略优化框架GCPO,通过几何感知措施捕捉语义分歧,并利用基于奖励的校准对齐不确定性与学习信号强度,从而更准确地跟踪梯度变化并提升训练后性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15676 2026-05-22 cs.SE cs.AI 57%

Automated Self-Testing as a Quality Gate: Evidence-Driven Release Management for LLM Applications

自动化自我测试作为质量门:基于证据的LLM应用发布管理

Alexandre Cristovão Maiorano

机构 * Lumytics

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种自动化自我测试框架,通过五个实证基础的维度(任务成功率、研究环境保持、P95延迟、安全通过率和证据覆盖)实现基于证据的发布决策(PROMOTE/HOLD/ROLLBACK),并通过长期案例研究评估了该框架在多代理对话AI系统中的有效性。

Comments 20 pages, 6 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22322 2026-05-22 cs.RO 50%

How can reasoning capability empower the AI copilot robot in endoscopic surgery

推理能力如何赋能内窥手术中的AI助手机器人

Guankun Wang, Long Bai, Hongliang Ren

机构 * Department of Electronic Engineering(电子工程系)

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文研究了推理能力在内窥手术中AI助手机器人中的应用,提出通过整合多模态线索、解读手术意图和推断隐藏组织动态来提高手术的精确性、安全性和可持续性。

Comments Accepted by npj digital medicine

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 1 篇

2605.22139 2026-05-22 cs.CV 50%

EventGait: Towards Robust Gait Recognition with Event Streams

EventGait: 向事件流中实现鲁棒的步态识别

Senyan Xu, Shuai Chen, Chuanfu Shen, Kean Liu, Zhijing Sun, Chengzhi Cao, Xueyang Fu

机构 * University of Science and Technology of China(中国科学技术大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 隐私与版权 :alignment(abstract)

AI总结 本文提出EventGait,一种端到端的双流框架,通过事件相机捕捉动态和形状信息,提升在复杂光照和运动环境下的步态识别鲁棒性,并通过合成数据集和新基准测试验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 24 篇

2602.07340 2026-05-22 cs.LG 88%

Revisiting Robustness for LLM Safety Alignment via Selective Geometry Control

通过选择性几何控制重新审视LLM安全对齐的鲁棒性

Yonghui Yang, Wenjian Tao, Jilong Liu, Xingyu Zhu, Junfeng Fang, Weibiao Huang, Le Wu, Richang Hong, Tat-Sent Chua

机构 * National University of Singapore(新加坡国立大学) Hefei University of Technology(合肥工业大学) ST Engineering Ltd., Singapore(新加坡ST工程有限公司)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.LG

AI总结 本文通过优化几何视角重新审视LLM安全对齐的鲁棒性,提出ShaPO框架,通过选择性几何控制在对齐关键参数子空间上强制最坏对齐目标,提升安全鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13372 2026-05-22 cs.AI cs.LG 86%

MoralityGym: A Benchmark for Evaluating Hierarchical Moral Alignment in Sequential Decision-Making Agents

MoralityGym:用于评估序列决策代理中分层道德对齐的基准

Simon Rosen, Siddarth Singh, Ebenezer Gelo, Helen Sarah Robertson, Ibrahim Suder, Victoria Williams, Benjamin Rosman, Geraud Nangue Tasse, Steven James

机构 * University of the Witwatersrand(威特沃特斯兰大学)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MoralityGym基准,通过将道德规范表示为有序的规范约束,评估序列决策代理中分层道德对齐的挑战,展示了98个伦理困境问题,并通过心理学和哲学的见解改进了伦理决策方法。

Comments Accepted at AAMAS 2026

Journal ref Proc of the 25th International Conference on Autonomous Agents and Multiagent Systems AAMAS 2026, Paphos, Cyprus, May 25 to 29, 2026, IFAAMAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22720 2026-05-22 cs.AI cs.HC 83%

Can AI Make Conflicts Worse? An Alignment Failure in LLM Deployment Across Conflict Contexts

AI 是否会加剧冲突?在冲突情境下LLM部署中的对齐失败

Andrii Kryshtal

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文研究了AI模型在冲突情境下可能产生的对齐失败问题,通过测试九种模型配置,发现其在处理冲突相关场景时存在错误等价、否认种族灭绝和未能识别种族歧视术语等问题,提出了首个评估框架以提高AI在冲突情境下的安全性。

Comments Preprint. 8 pages, 2 figures. Code and evaluation framework: https://github.com/akryshtal/conflict-sensitivity-eval-bloom

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21712 2026-05-22 cs.CL 83%

Broadening Access to Transportation Safety Data with Generative AI: A Schema-Grounded Framework for Spatial Natural Language Queries

通过生成式AI拓宽交通安全管理数据的可及性:一种基于模式的时空自然语言查询框架

Mahdi Azhdari, Eric J. Gonzales

机构 * Department of Civil and Environmental Engineering, University of Massachusetts Amherst(麻省大学阿姆赫斯特分校土木与环境工程系)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.CL

AI总结 本文提出了一种基于模式的自然语言接口,利用大型语言模型解释用户意图,同时保持确定性和可审查的执行,以解决交通安全管理数据访问不均的问题,通过整合事故记录、道路属性和地理空间数据,提升公共部门的安全规划能力。

Comments 30 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15338 2026-05-22 cs.LG cs.CL 81%

Discovering Implicit Large Language Model Alignment Objectives

发现隐式大语言模型对齐目标

Edward Chen, Sanmi Koyejo, Carlos Guestrin

机构 * Stanford University(斯坦福大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出Obj-Disco框架,通过自动分解对齐奖励信号为可解释的目标,解决现有方法的不足,验证了框架在多种任务和模型上的鲁棒性,并发现潜在的对齐偏差。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏