arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-26 至 2026-05-26 共收录 53 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 53 篇

2605.23989 2026-05-26 cs.AI cs.CL cs.CR 90%

Towards trustworthy agentic AI: a comprehensive survey of safety, robustness, privacy, and system security

迈向可信的自主AI:安全性、鲁棒性、隐私与系统安全的全面综述

Jinhu Qi, Muzhi Li, Jiahong Liu, Yuqin Shu, Dianzhi Yu, Shicheng Ma, Wenqian Cui, Yiyang Zhao, Yiyi Chen, Ruoxi Jiang, Irwin King, Zenglin Xu

机构 * Faculty of Engineering, Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学工程学院、计算机科学与工程系) Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 安全评测 :trustworthy(title,abstract);safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了自主AI系统在安全鲁棒性与隐私系统安全两个核心维度的风险来源、阶段缓解策略及统一评估指标,并讨论了开放挑战。

Comments 36 pages, 4 figures. Survey/review article on trustworthy agentic AI. Published in Academia AI and Applications, 2026

Journal ref Academia AI and Applications, vol. 2, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24962 2026-05-26 cs.CV 89%

Tempered Self-Similarity Alignment for Physically Plausible Video Generation

Tempered Self-Similarity Alignment for Physically Plausible Video Generation

Manjin Kim, Suha Kwak, Minsu Cho

机构 * Pohang University of Science and Technology (POSTECH)(浦项科学技术大学)

专题命中 安全评测 :alignment(title,title_cn)

AI总结 提出Tempered Self-Similarity Alignment (TSA)损失函数,通过将视觉基础模型中的时空自相似性关系知识迁移到视频生成模型中,以改善视频的物理合理性。

Comments Accepted to the CVPR 2026 Workshop on Video Generative Models: Benchmarks and Evaluation (VGBE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21602 2026-05-26 cs.AI cs.SE 83%

Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs

基准测试与改进LLMs中的分布外对齐失败监控器

Dylan Feng, Pragya Srivastava, Anca Dragan, Cassidy Laidlaw

机构 * University of California, Berkeley, USA(加州大学伯克利分校) Haize Labs, New York, USA(Haize实验室) Google DeepMind, India(谷歌DeepMind)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 针对大语言模型在分布外情境下的安全与对齐失败问题,提出MOOD基准并证明结合守卫模型与OOD检测器可提升监控召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13608 2026-05-26 cs.LG 83%

Is GPT-4o mini Blinded by its Own Safety Filters? Exposing the Multimodal-to-Unimodal Bottleneck in Hate Speech Detection

GPT-4o mini 是否被自身的安全过滤器蒙蔽?揭示多模态到单模态瓶颈在仇恨言论检测中的作用

Niruthiha Selvanayagam, Ted Kurti

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.LG

AI总结 本文通过 Hateful Memes Challenge 数据集系统分析 GPT-4o mini 在多模态仇恨言论检测中的安全架构,发现并实验验证了“单模态瓶颈”缺陷,即上下文无关的安全过滤器会优先阻断多模态推理,导致误报。

Comments This paper reports preliminary findings from a small-scale study whose sample size is insufficient to support the stated conclusions. The authors are withdrawing it to conduct a more comprehensive evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10921 2026-05-26 cs.CV cs.AI cs.LG 81%

FG-CLIP 2: A Bilingual Fine-grained Vision-Language Alignment Model

FG-CLIP 2: 一种双语细粒度视觉-语言对齐模型

Chunyu Xie, Bin Wang, Fanjing Kong, Jincheng Li, Dawei Liang, Ji Ao, Dawei Leng, Yuhui Yin

机构 * AI Research(360人工智能研究院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 提出FG-CLIP 2双语视觉语言模型,通过区域-文本匹配、长描述建模和文本内模态对比损失等细粒度监督,在英中双语上实现细粒度对齐,在29个数据集上取得最优结果。

Comments Accepted in ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25273 2026-05-26 cs.CY 79%

LLM-as-a-Judge in Healthcare: A Scoping Analysis of Applications, Methods, and Human Alignment

LLM-as-a-Judge 在医疗保健中的应用:应用、方法和人类一致性的范围分析

Lingyao Li, Deyi Li, Chen Chen, Renkai Ma, Runlong Yu, Mingquan Lin, Rui Yin, Lizhou Fan, Cathy Shyr, Siyuan Ma, Mei Liu, Steven Bethard

专题命中 安全评测 :alignment(title,abstract);分类 cs.CY

AI总结 本研究通过PRISMA指导的系统综述,分析了LLM-as-a-Judge在医疗保健中的应用场景、技术配置和与人类专家判断的一致性,发现其在临床决策支持、自然语言处理等领域有广泛应用,但可靠性因任务而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22827 2026-05-26 cs.CV cs.LG 79%

FairJudge: Abstention-Aware Multimodal Judges for Fairness and Alignment Evaluation in Text-to-Image Models

FairJudge: 文本到图像模型中公平性与对齐评估的弃权感知多模态裁判

Zahraa Al Sahili, Maimuna Nowaz, Maryam Fetanat, Ioannis Patras, Matthew Purver

机构 * Queen Mary University of London(伦敦玛丽女王大学) Institut Jožef Stefan(乔泽夫·斯蒂芬研究所) Imperial College London(伦敦帝国学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 提出FairJudge协议,利用多模态大语言模型作为结构化裁判,通过封闭标签、弃权机制和证据报告,在文本到图像模型中实现社会属性预测、职业定位和提示-图像对齐的公平性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25226 2026-05-26 cs.CL 79%

From Automation to Collaboration: Human-in-the-Loop Methods for Safe and Trustworthy NLP

从自动化到协作:面向安全可信NLP的人机协同方法

Most. Sharmin Sultana Samu, MD. Tanvir Ahmed Seum, Md. Rakibul Islam

机构 * Department of Computer Science and Engineering, BRAC University(布拉克大学计算机科学与工程系) Department of Electrical and Electronic Engineering, Rajshahi University of Engineering and Technology(拉贾沙希工程与技术大学电子与电气工程系)

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.CL

AI总结 本文综述了人机协同方法,通过人类监督支持审计、鲁棒性评估、数据构建和模型引导,以提升NLP在安全可信方面的表现,并指出了可扩展探测、可持续鲁棒性基准、低资源设置和私有系统治理等方面的差距。

Comments Preprint, manuscript under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25181 2026-05-26 cs.AI 79%

SpecAlign: A Semantic Alignment Framework for SystemVerilog Assertion Generation

SpecAlign: 一种用于 SystemVerilog 断言生成的语义对齐框架

Jaime Rafael Imperial, Hao Zheng

机构 * University of South Florida(佛罗里达州立大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 提出 SpecAlign 框架,通过基于蕴含的分类和自一致性投票机制,评估并改进 LLM 生成的 SVA 与自然语言规范之间的语义对齐,无需黄金 RTL。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24735 2026-05-26 cs.CY 79%

Dual-Use AI Face Swap Apps Are Mostly Unsafe: A Systematic Safety Audit

双用途AI换脸应用大多不安全:系统性安全审计

Alaa Daffalla, Sarah Chao, Eric Zeng

专题命中 安全评测 :safety(title,abstract);分类 cs.CY

AI总结 本研究系统审计了iOS和Android平台上的420款AI换脸应用,发现70%缺乏防止生成裸体图像的技术保障,且多数应用的服务条款未禁止此类滥用,建议平台和立法者强制要求安全过滤措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24076 2026-05-26 stat.ML cs.LG 79%

Causality as the Statistical Conscience of Artificial Intelligence: From Pearl's Ladder to Trustworthy Machines

因果关系作为人工智能的统计良知:从珀尔的阶梯到可信机器

Ernest Fokoué

机构 * School of Mathematics and Statistics, College of Science(数学与统计学学院,科学学院)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 本文论证因果推断是AI不可或缺的统计良知,通过统计必要性定理、统一因果统计估计框架以及三种AI失败模式的因果盲区分析,提出可信AI本质上是因果统计问题。

Comments 18 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10012 2026-05-26 cs.LG 79%

PID-Guided Partial Alignment for Multimodal Decentralized Federated Learning

PID引导的多模态去中心化联邦学习部分对齐

Yanhang Shi, Xiaoyu Wang, Houwei Cao, Jian Li, Yong Liu

机构 * Department of Electrical and Computer Engineering, Stony Brook University(石溪大学电气与计算机工程系) Department of Applied Mathematics and Statistics and the Department of Computer Science, Stony Brook University(石溪大学应用数学与统计系和计算机科学系) Department of Electrical and Computer Engineering, New York University(纽约大学电气与计算机工程系) Department of Computer Science, New York Institute of Technology(纽约理工学院计算机科学系)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 针对多模态去中心化联邦学习中异构代理间更新不兼容的问题,提出基于部分信息分解的PARSE框架,通过特征分裂和部分对齐实现高效通信与协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24462 2026-05-26 cs.CE 78%

No Certificate, No Execution: Certified Traces as a Foundation for Trustworthy AI Agents

无证书,不执行:认证轨迹作为可信AI代理的基础

Xiao-Yang Liu Yanglet, Xiaodong Wang, Agostino Capponi

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 提出提案-认证-执行(PCE)架构,通过可检查的认证轨迹确保AI代理仅在策略系统允许下执行,核心原则为“无证书,不执行”。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24614 2026-05-26 cs.CL cs.AI cs.LG 75%

Measuring the Depth of LLM Unlearning via Activation Patching

通过激活修补测量大语言模型遗忘的深度

Jaeung Lee, Dohyun Kim, Jaemin Jo

机构 * Sungkyunkwan University(全北大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出遗忘深度评分(UDS),通过激活修补量化遗忘的机制深度,在150个遗忘模型上的元评估中达到最高忠实性和鲁棒性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11296 2026-05-26 cs.CV cs.LG 74%

$Δ\mathrm{Energy}$: Optimizing Energy Change During Vision-Language Alignment Improves both OOD Detection and OOD Generalization

$Δ\mathrm{Energy}$: 优化视觉-语言对齐过程中的能量变化提升OOD检测与OOD泛化

Lin Zhu, Yifeng Yang, Xinbing Wang, Qinying Gu, Nanyang Ye

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全评测 :alignment(title);分类 cs.LG

AI总结 本文提出ΔEnergy分数,通过重新对齐视觉-语言模态时的能量变化来同时提升分布外检测和分布外泛化性能,并基于此开发了统一微调框架EBM。

Comments Accepted by NeurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26017 2026-05-26 cs.SE 71%

Trustworthy Software Project Generation : a Case Study with an Interactive Theorem Prover

可信软件项目生成:以交互式定理证明器为例的案例研究

Jian Fang, Yingfei Xiong

专题命中 安全评测 :trustworthy(title)

AI总结 本文研究利用交互式定理证明器(ITP)从自然语言需求自动生成大规模可信软件项目,通过将纯逻辑与有副作用的代码分离,在Rocq中完成验证并提取C++代码,成功生成一个RISC-V RV32I CPU解释器,证明了ITP作为LLM生成软件验证后端的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25258 2026-05-26 cs.IR cs.AI cs.CY cs.LG 69%

First, do no harm: Breaking suicidogenic echo chambers in media recommendation

首先,不伤害:打破媒体推荐中的自杀性回音室

Alberto Díaz-Álvarez, Raúl Lara-Cabrera, Fernando Ortega-Requena, Víctor Ramos-Osuna

机构 * E.T.S.I. Sistemas Informáticos (Universidad Politécnica de Madrid)(马德里理工大学信息系统工程系)

专题命中 安全评测 :safety(abstract,comments);分类 cs.AI、cs.CY、cs.LG

AI总结 针对推荐系统在心理健康场景中可能加剧用户自杀倾向的问题,提出RankAid重排序方法,通过惩罚有害内容并提升治疗性内容,在保持推荐准确性的同时确保临床安全。

Comments 10 pages, 5 figures. Research on safety-aware recommender systems and algorithmic ethics

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24331 2026-05-26 cs.CV 67%

Spatial-aware Vision Language Model for Autonomous Driving

面向自动驾驶的空间感知视觉语言模型

Weijie Wei, Zhipeng Luo, Ling Feng, Venice Erin Liong

机构 * Motional University of Amsterdam(阿姆斯特丹大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract)

AI总结 提出LVLDrive框架,通过融合LiDAR点云与视觉语言模型,利用渐进融合Q-Former和空间感知问答数据集,解决3D度量空间推理瓶颈,提升自动驾驶场景理解与决策可靠性。

Comments Accepted to CVPR AutoPilot Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24541 2026-05-26 cs.LG cs.AI cs.CL cs.IR 67%

SemanticZip: A Pilot Framework for Lossy Text Compression with LLMs as Semantic Decompressors

SemanticZip: 以LLM作为语义解压器的有损文本压缩的试点框架

Natalia Trukhina, Vadim Vashkelis

机构 * Embedded Intelligence Lab (EMILAB)(嵌入式智能实验室)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SemanticZip框架,通过LLM将文本压缩为紧凑代码并解压为任务相关语义,在结构化散文、JSON等六种表示上评估,发现结构化散文恢复率最高(WAR=0.956,19.1%令牌增益),而CCL-Min平衡性最佳(39.4%令牌增益,WAR=0.874)。

Comments 13 pages, 1 figure, 2 tables. Pilot framework paper; code and supplementary artifacts available in ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26112 2026-05-26 cs.AI cs.LG 62%

From Model Scaling to System Scaling: Scaling the Harness in Agentic AI

从模型扩展到系统扩展:扩展智能体AI中的“缰绳”

Shangding Gu

机构 * UC Berkeley(伯克利大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出智能体AI的下一个瓶颈是系统扩展而非仅模型扩展,通过设计可审计、持久、模块化和可验证的架构(称为“缰绳”),并研究上下文治理、可信记忆和动态技能路由三大瓶颈,以推动智能体行为从模型能力向长期任务执行转化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26074 2026-05-26 cs.CL cs.AI q-fin.GN 62%

StakeBench: Evaluating Language Understanding Grounded in Market Commitment

StakeBench: 评估基于市场承诺的语言理解

Yunhua Pei, Jingyu Hu, Yiwei Shi, Hongnan Ma, Weiru Liu, John Cartlidge

机构 * University of Bristol(布里斯托大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出StakeBench框架,通过将市场评论与可验证的交易记录关联,从市场行为中自动生成监督信号,评估语言模型对市场承诺的理解能力。

Comments 21 pages, 2 figures, 20 tables. Preprint. Dataset and evaluation code included

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26036 2026-05-26 cs.AI cs.LG 62%

CITYREP: A Unified Benchmark for Urban Representations Across Cities, Tasks, and Modalities

CITYREP:跨城市、任务和模态的城市表示统一基准

Junyuan Liu, Xinglei Wang, Zichao Zeng, Jiazhuang Feng, Quan Qin, Ilya Ilyankou, Guangsheng Dong, Tao Cheng

机构 * SpaceTimeLab, University College London, UK(伦敦大学空间时间实验室) DIMPact, University College London, UK(伦敦大学3DIMPact实验室) School of Resource and Environmental Sciences, Wuhan University, China(武汉大学资源与环境科学学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University, China(武汉大学测绘遥感信息工程国家重点实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出CityRep基准,通过空间结构划分评估城市表示在不同模态、城市和任务上的性能,解决随机划分导致的空间泄漏和性能膨胀问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26026 2026-05-26 cs.CV cs.AI cs.LG 62%

A Multimodal 3D Foundation Model for Light Sheet Fluorescence Microscopy Enables Few-Shot Segmentation, Classification, and Deblurring

一种用于光片荧光显微镜的多模态3D基础模型实现少样本分割、分类和去模糊

Adina Scheinfeld, Haotan Zhang, Shang Mu, Rudolf L. M. van Herten, Lucas Stoffl, Ali Erturk, Zhuhao Wu, Johannes C. Paetzold

机构 * Tri-Institutional Program in Computational Biology \& Medicine, Weill Cornell Medicine, New York, NY, USA Department of Radiology, Weill Cornell Medicine, New York, NY, USA Helen Robert Appel Alzheimers Disease Research Institute, Feil Family Brain Mind Research Institute, Weill Cornell Medicine, New York, NY, USA Graduate Program in Physiology, Biophysics Systems Biology, Weill Cornell Medicine, New York, NY, USA Cornell Tech, New York, NY, USA Institute for Intelligent Biotechnologies (iBIO), Helmholtz Center Munich, Neuherberg, Germany Institute for Stroke Dementia Research, Klinikum der Universität München, Ludwig-Maximilians University Munich, Munich, Germany

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出一种基于掩码重建与图像-文本对齐联合优化的3D基础模型,在光片荧光显微镜数据上预训练,通过少样本适应显著降低标注成本并提升分割、分类和去模糊性能。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25601 2026-05-26 cs.CL cs.AI 62%

Toward a Benchmark for Controllable Simulation of Imperfect Students with Large Language Models

面向大语言模型可控模拟不完美学生的基准

Alexander Apartsin, Omri Sason, Yehudit Aperstein

机构 * Holon Institute of Technology(霍隆理工学院) Afeka Tel Aviv Academic College of Engineering(阿法卡特拉维夫工程学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出一个基准框架,通过提示控制语言模型模拟具有指定技能轮廓的学生,并评估其可控性,为教师教育中的刻意练习提供支持。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03472 2026-05-26 cs.CL cs.AI 62%

Auditing Stealth Sycophancy in Mental-Health Dialogue: Structured Clinical-State Diagnostics and Clean Matched Benchmarks

审计心理健康对话中的隐性谄媚:结构化临床状态诊断与干净匹配基准

Tianze Han, Beining Xu, Hanbo Zhang, Yongming Lu

机构 * Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 针对心理健康对话模型中隐式谄媚(表面共情但强化消极认知)的问题,提出基于动态情感签名图(DESG)的结构化离线审计框架,通过临床状态转移评估响应方向,并在干净匹配基准上实现最优有害风险检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24699 2026-05-26 cs.AI cs.LG 62%

MDIA: A Multi-Agent Diagnostic Intelligence Pipeline on HealthBench Professional

MDIA:HealthBench Professional上的多智能体诊断智能流水线

Roberto Cruz, David Rey-Blanco

机构 * TietAI

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出MDIA多智能体诊断系统,通过7节点专业路由临床推理图架构,在非微调LLM上实现HealthBench Professional基准性能提升3.72个百分点,归因于系统架构设计而非提示工程。

Comments 33 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07647 2026-05-26 cs.CL cs.AI 62%

Quality-Conditioned Agreement in Automated Short Answer Scoring: Mid-Range Degradation and the Impact of Task-Specific Adaptation

自动简答题评分中的质量条件一致性:中等范围退化与任务特定适应的影响

Abigail Victoria Gurin Schleifer, Moriah Ariely, Beata Beigman Klebanov, Asaf Salman, Giora Alexandron

机构 * Weizmann Institute of Science(魏茨曼科学研究院) ETS(教育考试服务中心)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究自动简答题评分中不同模型的任务适应程度与质量条件评分一致性的关系,发现所有AI模型在完全正确和完全错误的回答上表现良好,但在中等范围回答上出现显著退化,且退化程度与任务特定数据量相关。

Comments PRE-PRINT VERSION Accepted to ACL 21st Workshop on Innovative Use of NLP for Building Educational Applications (BEA26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24266 2026-05-26 cs.CL cs.AI 62%

An Interactive Paradigm for Deep Research

深度研究的交互式范式

Lin Ai, Victor S. Bursztyn, Xiang Chen, Julia Hirschberg, Saayan Mitra

机构 * Adobe Research(Adobe研究院) Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出SteER框架,通过可解释的中间过程控制、成本效益决策和实时用户模型,在深度研究中实现用户对齐,性能优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24229 2026-05-26 cs.AI 61%

How Well Do Models Follow Their Constitutions?

模型遵循其宪法的程度如何?

Arya Jakkli, Senthooran Rajamanoharan, Neel Nanda

机构 * Anthropic

专题命中 安全评测 :alignment(abstract,comments);分类 cs.AI

AI总结 提出多方法审计流程,评估前沿AI模型在对抗性多轮交互中遵循其书面行为规范(如Anthropic宪法和OpenAI模型规范)的程度,发现新一代模型违规率显著下降。

Comments 37 pages including appendix. Code, tenet lists, and full transcripts: https://github.com/ajobi-uhc/constitution-audits. Companion blog post on LessWrong/AI Alignment Forum: https://www.lesswrong.com/posts/Tk4SF8qFdMrzGJGGw/how-well-do-models-follow-their-constitutions

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25998 2026-05-26 cs.LG 57%

Causal methods for LLM development and evaluation

因果方法在LLM开发与评估中的应用

Dennis Frauen, Marie Brockschmidt, Konstantin Hess, Haorui Ma, Yuchen Ma, Abdurahman Maarouf, Maresa Schröder, Jonas Schweisthal, Yuxin Wang, Athiya Deviyani, Sonali Parbhoo, Rahul G. Krishnan, Stefan Feuerriegel

机构 * Imperial College London(帝国理工学院伦敦分校) University of Toronto(多伦多大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出因果方法可解决LLM开发与评估中的关键因果问题,并系统梳理其在预训练、对齐、路由等环节的应用机会。

Comments Published in KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏