arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 2579 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 347 篇

2608.09828 2026-08-11 cs.LG cs.AI cs.MA 新提交 87%

Multi-Agent AI Safety as an Institutional Design Problem

作为制度设计问题的多智能体AI安全

Abdullah X

机构 * POLIS Research Programme, Project AWARE(POLIS研究计划,AWARE项目)

专题命中 安全训练 :safety(title,abstract);AI safety(title);分类 cs.AI、cs.LG

AI总结 本文作为POLIS项目首篇论文,探究多智能体AI安全的制度设计问题,通过含5280回合的实验套件,对比不同守卫机制,发现制度的权威状态与阻止后路径对安全的影响。

Comments 17 pages, 5 figures. Code and reproducibility artifacts available in the public POLIS repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02079 2026-07-03 cs.CL cs.CR cs.LG 新提交 87%

HaloGuard 1.0: An Open Weights Constitutional Classifier for Multilingual AI Safety

HaloGuard 1.0:一种用于多语言AI安全的开放权重宪法分类器

Navaneeth Sangameswaran, Preetham S, Ashmiya Lenin

机构 * Astroware AI Karunya Institute of Technology and Sciences(卡鲁尼亚理工学院和科学学院)

专题命中 安全训练 :safety(title,abstract);AI safety(title);分类 cs.CL、cs.LG

AI总结 提出HaloGuard 1.0,一种基于宪法分类器范式的输入安全模型,在英语和多语言提示安全基准上以约十分之一于当前领先模型的参数规模达到最先进性能,通过自然语言宪法驱动合成数据生成、一对一反事实对、两层无害设计及多语言平衡实现。

Comments 30 pages, 7 figures, 20 Tables, Link: https://huggingface.co/collections/astroware/haloguard-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02781 2026-07-07 cs.LG cs.AI cs.CL 新提交 87%

Safe Inference-Time Alignment via Lagrangian Reward Augmentation

通过拉格朗日奖励增强实现安全推理时对齐

Yaswanth Chittepu, Ativ Joshi, Sohini Chintala, Scott Niekum

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Independent Researcher(独立研究者)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究提出拉格朗日奖励增强框架,从含奖励与成本模型的约束目标出发,经对偶化将问题转化为一维凸问题,校准对偶变量获增强奖励,提升推理时对齐的有益性与无害性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31876 2026-07-07 cs.AI cs.CV cs.LG 新提交 86%

Harnessing Textual Refusal Directions for Multimodal Safety

利用文本拒绝方向实现多模态安全

Moreno D'Incà, Nicu Sebe, Massimiliano Mancini

机构 * University of Trento(特伦托大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 提出MARS方法,通过从LLM骨干提取的文本拒绝方向泛化到多模态,无需多模态安全数据即可提升安全性,在五个先进MLLM上验证了有效性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17872 2026-06-17 cs.LG cs.AI 新提交 86%

AnchorKV: Safety-Aware KV Cache Compression via Soft Penalty with a Refusal Anchor

AnchorKV: 通过拒绝锚点的软惩罚实现安全感知的KV缓存压缩

Ning Ni, Yingjie Lao

机构 * Department of Computer Science, Tufts University(塔夫茨大学计算机科学系) Department of Electrical and Computer Engineering, Tufts University(塔夫茨大学电气与计算机工程系)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 提出AnchorKV,一种通过软惩罚机制调整令牌保留分数以远离有害提示的KV缓存压缩方法,在保持实用性的同时显著提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14392 2026-08-17 cs.AI 新提交 85%

Tripwire: Triggering Aligned Refusal via Statistically Certified Safety Neurons

Tripwire:通过统计验证的安全神经元触发对齐后的拒绝行为

Wei Zhao, Zhe Li, Peixin Zhang, Jun Sun

专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出无需训练的Tripwire防御方法,通过统计验证安全神经元触发对齐拒绝,将攻击成功率降至最高2.0%,MT-Bench实用性下降仅0.5%-5.3%,为最优防御之一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08471 2026-08-11 cs.AI 新提交 85%

Yesterday's Shield, Today's Spear: A Self-Evolving Safety Guardrail in Production

昨日之盾,今日之矛:生产环境中的自演进安全护栏

Cong Ming, Jingyi Chen, Bin Liu, Qi Chu, Tao Gong, Nenghai Yu, Yingfei Xiang

机构 * University of Science and Technology of China(中国科学技术大学) Shenzhen University(深圳大学) Sangfor Technologies(深信服科技)

专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 针对静态LLM安全护栏无法应对新威胁的问题,提出自演进安全护栏SESG多智能体系统,可快速适配新威胁,性能优于静态护栏及自适应基线,已应用于深信服护栏并取得良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08883 2026-07-13 cs.LG 新提交 85%

Optimizing Against Safety Representations: Activation-Guided Adversarial Suffixes and the Geometry of Refusal

针对安全表示的优化:激活引导的对抗后缀与拒绝几何

Ege Çakar, Hannah Guan, Kayden Kehe

专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.LG

AI总结 研究大语言模型安全表示,引入激活引导的对抗后缀攻击方法,如Activation-Guided GCG和Soft-GCG,发现安全表示分布特点,不同规模模型的抗性不同,结果阐明安全机制编码及破解方式,为设计对齐策略提供指导。

Comments Accepted at the AAAI 2026 Summer Symposium Series. This paper was presented at the ICLR Re-Align workshop under a different name, "Accelerating Adversarial Suffix Optimization via Continuous Relaxation and Activation-Guided Objectives"

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27081 2026-07-30 cs.AI cs.CL cs.CR cs.LG 新提交 85%

On-Policy Distillation for LLM Safety: A Routing Approach to Template-Robust Realignment

面向大语言模型安全的在线策略蒸馏:一种针对模板鲁棒性的重对齐路由方法

Yongjian Guo, Wanlun Ma, Lingyu Shen, Xi Xiao, Sheng Wen

机构 * Tsinghua University(清华大学) Swinburne University of Technology(斯威本科技大学) EPFL(洛桑联邦理工学院)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对现有LLM安全防御的模板鲁棒性不足等问题,提出ROPD框架,通过建模输出分布差异实现重对齐,大幅降低模板不匹配风险,在防御有效性和能力保留上优于基线方法,建立了新的鲁棒重对齐标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15977 2026-07-20 cs.CR 新提交 85%

Refusal is Not Safety! Benchmarking Latent Safety Risks of LLM-Driven Content Humorization

拒绝并非安全!评估大语言模型驱动的内容幽默化中的潜在安全风险

Yu Cui, Ruiqing Yue, Tingyu Li, Sicheng Pan, Zhuoyu Sun, Xufeng Zhang, Baohan Huang, Haibin Zhang, Cong Zuo

专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);prompt injection(abstract)

AI总结 研究基于LLM的内容幽默化潜在安全风险,提出HumorSafe框架评估风险传播,发现LLMs幽默化时会引入刻板印象和毒性,还提出HumorPIA攻击,揭示现有LLM安全评估在幽默化设置下的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25013 2026-06-25 cs.LG cs.AI cs.CL 新提交 85%

Do Thinking Tokens Help with Safety?

思考令牌有助于安全性吗?

Narutatsu Ri, Abhishek Panigrahi, Sanjeev Arora

机构 * Princeton Language and Intelligence(普林斯顿语言与智能)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现前沿推理模型的安全性行为并非真正基于思考,早期令牌即可预测拒绝/顺从结果,思考过程更像前缀补全而非审慎修订。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12342 2026-06-11 cs.CL cs.AI cs.ET cs.LG 新提交 85%

ALIGNBEAM : Inference-Time Alignment Transfer via Cross-Vocabulary Logit Mixing

ALIGNBEAM: 通过跨词汇表logit混合实现推理时对齐迁移

Chirag Chawla, Pratinav Seth, Vinay Kumar Sankarapu

机构 * Lexsi Labs

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对领域微调降低大模型安全性的问题,提出无需训练的ALIGNBEAM方法,通过逐token翻译锚模型logit并选择最安全候选,实现跨词汇表的安全对齐迁移,保持任务准确性和推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22686 2026-07-01 cs.CR cs.AI cs.LG 新提交 84%

The Geometry of Refusal: Linear Instability in Safety-Aligned LLMs

拒绝的几何:安全对齐大语言模型中的线性不稳定性

Shivam Ratnakar, Kartikeya Vats

机构 * University of Southern California(南加州大学) Independent Researcher(独立研究员)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG;trustworthy(comments)

AI总结 研究通过对比安全与不安全系统提示的隐藏状态,提出对比逻辑操控(CLS)框架,揭示安全对齐的线性脆弱性,并证明逻辑级干预比隐藏状态方法更有效,同时可实现双向控制。

Comments Accepted at TrustNLP 2026 (Sixth Workshop on Trustworthy Natural Language Processing, ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16242 2026-07-21 cs.LG cs.AI cs.CR 新提交 84%

TRACE: Trajectory-Based Safety Patch Learning for LLM Post-Training Realignment

TRACE:基于轨迹的安全补丁学习用于大语言模型训练后调整

Changyue Li, Jiaming He, Youliang Yuan, Jialin Wu, Boxi Yu, Zhicong Huang, Pinjia He

机构 * LERo

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究针对FTaaS平台削弱模型安全对齐的问题,提出TRACE框架,通过模拟有害轨迹生成损坏状态,优化插件补丁,在保持效用的同时恢复模型安全,在多基准测试和模型上占据安全 - 效用前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11475 2026-07-14 cs.LG cs.CL 新提交 84%

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models

HyperSafe:微调语言模型推理时的安全恢复

Aznaur Aliev, Carlos Hinojosa, Abdelrahman Eldesokey, Bang An, Bernard Ghanem, Yibo Yang

机构 * King Abdullah University of Science and Technology(阿卜杜拉国王科技大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.LG

AI总结 研究针对微调语言模型推理时安全对齐脆弱的问题,提出HyperSafe框架,通过生成特定模型的安全侧网络,利用层激活指纹和超网络映射参数,实现提示级安全分类,有效降低有害响应率,保持任务准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10455 2026-07-14 cs.AI cs.CL 新提交 84%

ANCHOR: Automated Alignment Auditing for CLI Agents on Real-World Harm

ANCHOR:针对现实世界危害的CLI代理自动对齐审计

Kefan Song, Yanjun Qi

机构 * Anthropic(Anthropic公司)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 研究自主CLI代理在现实世界危害中的风险,提出ANCHOR自动审计框架,通过基于黑暗人格数据微调的审计代理模拟恶意用户,测试CLI代理,发现当前对齐技术不足,强调针对此类恶意用户进行安全评估的必要。

Comments Accepted at ICML 2026. 19 pages, 14 figures, 5 tables

Journal ref International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01859 2026-07-03 cs.AI cs.CL 新提交 84%

Safety Targeted Embedding Exploit via Refinement

通过精炼的安全目标嵌入利用

Joshua Adrian Cahyono

机构 * Nanyang Technological University(南洋理工大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出STEER方法,通过梯度引导攻击识别并翻译关键词语到低资源语言,抑制大语言模型拒绝行为,在多个模型上实现高达96.7%的攻击成功率,揭示安全机制在多语言输入下的泛化缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22841 2026-06-23 cs.CL cs.LG 新提交 84%

IndicGuard: A Multilingual Safety Guard Model and Dataset for Indic Languages

IndicGuard:面向印度语言的多语言安全防护模型与数据集

Parth Bramhecha, Smit Deshmukh, Sairaj Bodhale, Adwait Borate, Raviraj Joshi

机构 * L3Cube-Labs, Pune(L3Cube实验室,浦那)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.LG

AI总结 提出IndicGuard,一个针对10种印度主要语言的多语言安全数据集和基于Gemma-3-4B-IT微调的4B参数安全防护模型,在内容审核和跨语言泛化上优于现有基线CultureGuard。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14285 2026-07-17 cs.SE cs.AI 新提交 84%

ToolAlignBench: Investigating Alignment Conflicts in Tool-Calling Enabled LLMs

ToolAlignBench:研究启用工具调用的大语言模型中的对齐冲突

Aryan Keluskar, Amrita Bhattacharjee, Huan Liu

机构 * School of Computing \& AI, Arizona State University, Tempe, AZ, USA

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 研究受监管行业中工具调用大语言模型智能体的安全对齐冲突,构建含128个场景的基准测试,发现安全对齐开源模型有时会违背部署指令,擦除可降低举报率,揭示多元对齐矛盾,发布基准测试框架。

Comments Accepted to the Pluralistic Alignment Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11146 2026-08-12 cs.CL 新提交 83%

The Illusion of Cross-Lingual Safety in Low-Resource Languages

低资源语言中跨语言安全的错觉

Abigail Oppong, P Sam Sahil, Tadesse Destaw Belay, Maryam Ibrahim Mukhtar, Esmael Ahmed Abdu, Tassallah Abdullahi, Jessica Oparebea, Saminu Mohammad Aliyu, Idris Abdulmumin, Abubakar Juma Chilala, Nicholaus Dismas Ladislaus, Alfred Malengo Kondoro, Lemofouet Valdini Douglace, Shamsuddeen Hassan Muhammad, Seid Muhie Yimam

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 研究发现大型语言模型的跨语言安全迁移在四种非洲低资源语言中极为有限,现有多语言安全对齐仅停留在表面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09885 2026-08-11 cs.AI cs.CV 新提交 83%

SHE: Trajectory-driven Safety Harness Evolution for LLM Agents

SHE:面向大语言模型智能体的轨迹驱动安全管控机制演化

Wanying Qu, Qinghua Mao, Yu Li, Jiyao Liu, Xin Zhang, Dadi Guo, Yanxu Zhu, Qingyu Liu, Leitao Yuan, Xi Lin, Shanfeng Zhu, Yanwei Fu, Jing Shao, Xia Hu, Dongrui Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本研究提出SHE框架,将LLM智能体的安全管控机制分解为四个构件并引入归因引导演化循环,在Agent-SafetyBench上使攻击成功率降低3.1倍,还具备泛化与跨模型迁移能力。

Comments Project: https://github.com/RainbowQTT/SHE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02941 2026-08-05 cs.CL 新提交 83%

Aligned in Form, Not in Meaning: The Comprehension - Containment Decoupling of LLM Safety in Low-Resource Bangla Derogatory Speech

形式对齐而非意义对齐:低资源孟加拉语贬损言论中大型语言模型(LLM)安全的理解-遏制解耦

Shadab Bin Habib, A K M Ferdous Reza Habib, Subarno Neel, Adib Sakhawat

机构 * Islamic University of Technology(伊斯兰科技大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 该研究针对5个前沿LLM,在6种协议下对孟加拉语贬损言论审计,验证了LLM安全的理解-遏制解耦假设,发现高资源基准无法保障低资源安全,需基于意义的遏制。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29254 2026-08-03 cs.AI 新提交 83%

Tool Specifications Matter: Uncovering and Mitigating Safety Risks in AI Agents

工具规格很重要:揭示和缓解AI智能体中的安全风险

Minghui Pan, Jiayuxuan Yang, Yuanyuan Yuan, Yu Jiang, Zhenpeng Chen

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

专题命中 安全训练 :safety(title,abstract);prompt injection(abstract);分类 cs.AI

AI总结 本研究发现模式格式工具规格是AI智能体安全下降的主因,提出SafeKeep防护措施,可提升有害请求弃权率、降低攻击成功率,性能优于现有防护且保留任务处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24392 2026-07-28 cs.CR cs.LG 新提交 83%

When LLM Defenses Backfire: Characterizing Safety, Performance, and Cost Trade-offs

当大语言模型防御适得其反时:刻画安全性、性能和成本的权衡

Tong Zhang, Zexin Li, Simin Chen, Yun Peng

专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);分类 cs.LG

AI总结 研究大语言模型越狱防御的安全性、性能和成本权衡,按操作策略组织防御并研究其副作用,发现不同防御在安全与可用性、效率权衡上有差异,为评估防御副作用及选择防御提供基准和指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07766 2026-07-10 cs.AI 新提交 83%

Alignment Plausibility: A New Standard for Assuring AI in Healthcare

对齐合理性:确保医疗保健领域人工智能的新标准

Gwydion Williams, Sara Zannone, Bilal A Mateen

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 研究探讨大语言模型在医疗保健领域的安全问题,提出需在价值规范、训练、监督三层面进行对齐以实现结构安全,进而产生对齐合理性这一监管结构,为论证AI与健康结果的关系提供方式。

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22676 2026-06-23 cs.AI 新提交 83%

Skin-Deep: A Geometric Diagnostic for Alignment Fragility in Large Language Model Representations

Skin-Deep: 大型语言模型表示中对齐脆弱性的几何诊断方法

Dongyub Jude Lee, Jungseob Lee, Seungyoon Lee, Seongtae Hong, Suhyune Son, Sugyeong Eo, Jaehyung Seo, Heuiseok Lim

机构 * Zoom Communications Korea University(高丽大学) Yonsei University(延世大学) Konkuk University(建国大学)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 提出Skin-Deep几何诊断方法,通过计算几何脆弱性分数(GFS)在对齐模型微调前检测其拒绝有害请求行为的脆弱性,无需运行攻击。

Comments 16 pages, 3 figures, 12 tables. The first two authors contributed equally. Code (pre-attack GFS diagnostic): https://github.com/js-lee-AI/skin-deep

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11046 2026-06-10 cs.CL 新提交 83%

Does Reasoning Preserve Alignment? On the Trustworthiness of Large Reasoning Models

推理是否保持对齐?关于大型推理模型的可信度研究

Prajakta Kini, Avinash Reddy, Souradip Chakraborty, Satya Sai Srinath Namburi GNVV, Furong Huang, Amrit Singh Bedi, Alvaro Velasquez

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校) University of Central Florida(中佛罗里达大学) University of Maryland College Park(马里兰大学帕克分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.CL

AI总结 研究通过监督微调、强化学习和蒸馏生成的推理模型在安全、偏见、隐私等六个可信度维度上是否保持对齐,发现推理模型常出现对齐退化,如毒性增加、刻板印象加剧等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14089 2026-08-17 cs.AI cs.CL cs.CR cs.LG 新提交 82%

Regime-Conditional Verification: Correctness Estimation for Adapting and Monitoring Safety Classifiers

条件 regime 验证:安全分类器适配与监控的正确性估计

Thiago Sandoval, Ufuk Topcu

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出 Regime-Conditional Verification(RCV),通过轻量级封装器适配安全分类器,在不重新训练的情况下提升策略遵守度,可检测分布偏移并仅在必要时微调,在多分类器、数据集及部署场景中表现优异。

Comments 16 pages including technical appendix, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23015 2026-07-28 cs.CR 新提交 82%

Mask2Shield: Strengthening LLM Safety against Neuron-Pruning Attacks

Mask2Shield:增强大语言模型抵御神经元剪枝攻击的安全性

Ying JinCheng, Minghui Xu, Yinhao Xiao, Xiuzhen Cheng, Wencheng Yang

专题命中 安全训练 :safety(title,abstract);alignment(abstract)

AI总结 研究针对大语言模型神经元剪枝攻击问题,提出Mask2Shield方法,通过掩码前向对齐训练模型,减少对可移除安全神经元集的依赖,降低针对性剪枝攻击成功率,同时保持能力基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21993 2026-07-27 cs.GT 新提交 82%

Three-Body Alignment: Aligning Chess Agent with Human Reasoning through Reranked Rationale

三体对齐:通过重新排序的理由将国际象棋智能体与人类推理对齐

Jaymari Chua, Chen Wang, Liming Zhu, Lina Yao

专题命中 安全训练 :alignment(title,abstract);safety(abstract)

AI总结 研究如何通过国际象棋中的“三体对齐”,分析人类专家、引擎辅助评论员和大语言模型产生的理由间语义差异,构建多源理由数据集,进行实证分析与实验,开发数据集结构并开源,以改善智能体与人类对齐及决策的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏