arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9248 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9248 篇

2202.07787 2022-02-17 cs.LG cs.AI 82%

Trustworthy Anomaly Detection: A Survey

Shuhan Yuan, Xintao Wu

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

Comments Paper list, see https://github.com/yuan-shuhan/trustworthy-anomaly-detection-papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28825 2026-05-29 cs.CL 81%

MechELK: A Mechanistic Interpretability Framework for Eliciting Latent Knowledge in Large Language Models

MechELK:一种用于激发大型语言模型中潜在知识的机制可解释性框架

Ji-jun Park, Soo-joon Choi, Jiwon Jeong, Taeyang Yoon, Ju-Wan Lee

机构 * Dongguk University(东国大学)

专题命中 安全评测 :alignment(abstract,abstract_cn);safety(abstract);AI safety(abstract);分类 cs.CL

AI总结 提出MechELK框架,通过定位、验证和激发三个阶段,利用稀疏自编码器特征分析和因果探测等方法,从大型语言模型中提取隐藏知识,在TruthfulQA等基准上平均激发准确率达84.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24826 2026-04-29 cs.CR cs.AI 81%

A Comparative Evaluation of AI Agent Security Guardrails

AI代理安全防护的比较评估

Qi Li, Jiu Li, Pingtao Wei, Jianjun Xu, Xueyi Wei, Jiwei Shi, Xuan Zhang, Yanhui Yang, Xiaodong Hui, Peng Xu, Lingquan Zhou

机构 * Beijing Caizhi Tech(北京彩智科技)

专题命中 安全评测 :safety(summary_cn,abstract);分类 cs.AI

AI总结 本文比较了DKnownAI Guard与AWS Bedrock Guardrails、Azure Content Safety和Lakera Guard在AI代理安全场景中的性能,发现DKnownAI在召回率和真正负样本率上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04837 2026-03-06 cs.AI 81%

Design Behaviour Codes (DBCs): A Taxonomy-Driven Layered Governance Benchmark for Large Language Models

设计行为代码(DBCs):一种以分类为导向的分层治理基准用于大型语言模型

G. Madan Mohan, Veena Kiran Nambiar, Kiranmayee Janardhan

专题命中 安全评测 :alignment(abstract);RLHF(abstract);DPO(abstract);safety(abstract)

AI总结 本文提出DBC基准,用于评估大型语言模型中的行为治理层,通过三臂实验展示DBC在降低风险暴露率和提升合规性方面的效果。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15859 2026-02-19 cs.CL 81%

From Transcripts to AI Agents: Knowledge Extraction, RAG Integration, and Robust Evaluation of Conversational AI Assistants

从语音记录到AI代理:知识提取、RAG整合及对话式AI助手的鲁棒评估

Krittin Pachtrachai, Petmongkon Pornpichitsuwan, Wachiravit Modecrua, Touchapon Kraisingkorn

机构 * Amity Research and Application Center (ARAC)(阿米蒂研究与应用中心)

专题命中 安全评测 :alignment(abstract);safety(abstract);red teaming(abstract);prompt injection(abstract)

AI总结 本文提出了一种端到端框架,通过历史通话记录构建和评估对话式AI助手,利用知识提取和RAG整合提升事实准确性和鲁棒性。

Comments 9 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08136 2026-02-10 cs.CV cs.AI 81%

Robustness of Vision Language Models Against Split-Image Harmful Input Attacks

视觉语言模型对分裂图像有害输入攻击的鲁棒性

Md Rafi Ur Rashid, MD Sadik Hossain Shanto, Vishnu Asutosh Dasu, Shagufta Mehnaz

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 安全评测 :alignment(abstract);RLHF(abstract);safety(abstract);jailbreak(abstract)

AI总结 本研究提出分裂图像视觉陷阱攻击(SIVA),揭示视觉语言模型在面对分裂图像攻击时的安全漏洞,并通过对抗性知识蒸馏算法提升跨模型攻击效果。

Comments 22 Pages, long conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08494 2025-09-11 cs.CY cs.AI cs.CL cs.HC cs.LG 81%

HumanAgencyBench: Scalable Evaluation of Human Agency Support in AI Assistants

Benjamin Sturgeon, Daniel Samuelson, Jacob Haimes, Jacy Reese Anthis

机构 * Apart Research AI Safety Cape Town University of Chicago(芝加哥大学) Stanford University(斯坦福大学) Sentience Institute(意识研究所)

专题命中 安全评测 :alignment(abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03053 2025-07-11 cs.MA cs.AI cs.CL cs.CY cs.LG 81%

MAEBE: Multi-Agent Emergent Behavior Framework

Sinem Erisken, Timothy Gothard, Martin Leitgab, Ram Potham

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Preprint. This work has been submitted to the Multi-Agent Systems Workshop at ICML 2025 for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00911 2025-06-03 cs.AI 81%

Conformal Arbitrage: Risk-Controlled Balancing of Competing Objectives in Language Models

William Overman, Mohsen Bayati

机构 * Graduate School of Business(商学院) Stanford University(斯坦福大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);harmlessness(abstract);trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14633 2025-05-21 cs.CL cs.AI cs.CY cs.HC cs.LG 81%

Will AI Tell Lies to Save Sick Children? Litmus-Testing AI Values Prioritization with AIRiskDilemmas

Yu Ying Chiu, Zhilin Wang, Sharan Maiya, Yejin Choi, Kyle Fish, Sydney Levine, Evan Hubinger

机构 * University of Washington(华盛顿大学) NVIDIA(NVIDIA公司) Cambridge(剑桥) Stanford(斯坦福大学) MIT(麻省理工学院) Harvard(哈佛大学) Anthropic(Anthropic公司)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 34 pages, 11 figures, see associated data at https://huggingface.co/datasets/kellycyy/AIRiskDilemmas and code at https://github.com/kellycyy/LitmusValues

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13195 2025-05-20 cs.AI 81%

Adversarial Testing in LLMs: Insights into Decision-Making Vulnerabilities

Lili Zhang, Haomiaomiao Wang, Long Cheng, Libao Deng, Tomas Ward

机构 * School of Computing, Dublin City University(都柏林城市大学计算机学院) Insight SFI Research Centre for Data Analytics(数据分析SFI研究中心) North China Electric Power University(华北电力大学) Harbin Institute of Technology (Weihai)(威海工业大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);AI safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12360 2026-08-14 cs.CY cs.LG 新提交 81%

Regulatory Approval Is Not Enough: Gaps in Trustworthy AI Reporting in FDA-Cleared Medical Devices

监管批准并不足够:FDA clearance医疗设备中可信赖AI报告的缺口

Ahmed M Salih, Oliver Díaz, Alejandro Guzman, Noah Marquez Vara, Fotios Avgoustidis, Rituraj Singh, Saman Barakat, Zahra Raisi-Estabragh, Karim Lekadir

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CY、cs.LG

AI总结 该研究分析2021-2025年FDA获批的519份AI/ML医疗设备报告,发现可信赖AI报告存在显著缺口,获批年份或临床领域不影响报告透明度,仅监管批准不足以证明AI可信赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12346 2026-08-14 cs.AI cs.CY 新提交 81%

Position: The Alignment Community is Unintentionally Building a Censor's Toolkit

立场:对齐社区正在无意之中构建审查者的工具包

Sarah Ball, Phil Hackemann

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 该立场论文指出现代AI对齐方法是两用技术,可能被恶意滥用,呼吁社区讨论其滥用风险并提出缓解策略。

Comments Accepted as oral paper at ICML 2026

Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11922 2026-08-13 cs.CL cs.IR cs.LG 新提交 81%

LODESTAR: Trustworthy Entropy Is Navigated, Not Merely Measured -- Reinforced Polarizer Keeps a Frozen LLM from Being Confidently Misled by the Wrong Evidence

LODESTAR:可信赖熵是被引导的,而非仅被测量——强化偏振器防止冻结型大语言模型(LLM)被错误证据误导而自信出错

Po-Jen Ko, Che-Cheng Wu, Hung-Chun Hsu, Li-Yang Chang, Chuan-Ju Wang

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL、cs.LG

AI总结 LODESTAR是首个通过强化学习训练偏振器、依据第三方冻结型LLM的不确定性评分文本干预的方法,可提升检索增强问答的F1值等指标,减少模型读取误导性段落的概率。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11830 2026-08-13 cs.CY cs.CL 新提交 81%

Quantifying the Relationship Between Clinical Safety and Environmental Impact in Therapeutic LLMs

量化治疗型大语言模型(LLMs)的临床安全性与环境影响之间的关系

Alireza A. Safaei, Laura M. Vowels, Matthew J. Vowels, Apoorv Jha, Shekoufeh Rahimi

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.CY

AI总结 该研究量化治疗型LLMs的临床安全性与环境影响的关系,发现安全分布高端存在非线性权衡,额外测试时计算未必提升安全,提出动态模型选择等可持续部署方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11493 2026-08-13 cs.AI cs.LG 新提交 81%

From Prompting to Behavioral Alignment: Personalized LLM Judges for Recommendation Evaluation

从提示工程到行为对齐:用于推荐评估的个性化大语言模型评判者

Alireza S. Ziabari, Kat Ellis, Colleen Chan, Ding Tong

机构 * Netflix(网飞公司)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究针对离线推荐评估中LLM存在的双向合理化问题,提出序列行为对齐框架,经真实日志验证,其Macro-F1较零样本基线提升32.19%,可缓解失效模式且无需人工管道开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07639 2026-08-11 cs.LG cs.AI 新提交 81%

SkillConsist: Detecting Inconsistencies in Agent Skills via Bidirectional Graph Alignment

SkillConsist:通过双向图对齐检测智能体技能中的不一致性

Chaofan Meng, Yuhang Zheng, Yingnan Zhou, Sihan Xu

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 SkillConsist针对智能体技能不一致检测的挑战,通过双向图对齐等技术构建基准并取得优于基线的检测性能,提升了技能一致性检测效果。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03361 2026-08-05 cs.CY cs.AI 新提交 81%

The Evolutionary Origin of Values: implications for AI alignment, sentience and existential risk

价值的进化起源:对AI对齐、感知能力和生存风险的启示

Francis Heylighen

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 该研究通过追溯生物价值的进化起源,论证LLMs无内在生存动机与感知能力,正交性论点不适用于它们,AI对齐的核心挑战是确保LLMs应用习得的伦理价值。

Comments submitted chapter for book: T. Veloz & C. Rittberg (Eds.), AI and Human Values. Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02238 2026-08-04 cs.AI cs.LG 新提交 81%

Trustworthy AI in Digital Health: A Comprehensive Review of Robustness and Explainability

数字健康中的可信AI:鲁棒性与可解释性的综合综述

Abdullah Mamun, Shovito Barua Soumma, Hassan Ghasemzadeh

机构 * College of Health Solutions, Arizona State University(亚利桑那州立大学健康解决方案学院) School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 本综述针对数字健康领域可信AI研究缺口,构建框架梳理鲁棒性与可解释性的技术进展、应用考量与评估指标,为相关开发提供支持。

Comments Preprint of the paper published in Progress in Biomedical Engineering. 26 pages, 5 figures

Journal ref Progress in Biomedical Engineering, Volume 8, Number 2, Article 022007, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01423 2026-08-04 cs.AI cs.GT cs.LG 新提交 81%

Scoring Rules! Statistical and Strategic Alignment for Text Evaluation Metrics

评分规则!文本评估指标的统计对齐与策略对齐

Shengwei Xu, Yuxuan Lu, Yifan Wu, Jason Hartline, Grant Schoenebeck

机构 * University of Michigan(密歇根大学) Peking University(北京大学) Microsoft Research(微软研究院) Northwestern University(西北大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究针对文本评估指标,提出统计与策略对齐概念及三项测试原则,开发基于互信息的指标设计框架,发现 LLM-as-a-Judge 相关性高但易操纵,新指标鲁棒性强且相关性具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26529 2026-08-04 cs.CL cs.AI cs.CV 版本更新 81%

The inattentional gap in task conditioned AI models that omit otherwise reportable safety critical signals

注意间隙:任务条件化的语言和视觉模型忽略它们本可报告的安全关键信号

Kwan Soo Shin

机构 * PolymathMinds Lab(PolymathMinds 实验室)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究揭示任务条件化会导致语言和视觉模型抑制对共存安全关键信号的报告,形成“注意间隙”,且该现象在多种模型和任务中普遍存在,不随规模增大而减弱,使基准安全与实际安全脱钩。

Comments 62 pages (31-page article and 31-page supplementary information), 8 figures, 4 tables. v3: corrects the author metadata to the sole author, Kwan Soo Shin; revised title and abstract; adds cross-vendor and flagship validation, signal-detection and specified-task controls, and dual-process probes. Reproducibility deposit: doi:10.5281/zenodo.20826823

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28079 2026-07-31 cs.LG cs.AI 新提交 81%

Chem World: A Large-Scale Benchmark and Physics-Informed Framework for Trustworthy Chemical Property Prediction

Chem World:用于可信赖化学性质预测的大规模基准及物理信息框架

Tianyou Bai, Huan Wang, Mingchen Gao, Fangyue Lin, Pinze Ren, Zhenlin Zhao, Siming Dong

机构 * Cleer Science(克利尔科学公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Imperial College London(伦敦帝国学院) Tsinghua University(清华大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究推出整合17类超80万分子样本的Chem World化学性质预测基准,并提出Mixture-PINN物理信息神经网络框架,经实验验证其可提升预测性能,为可信赖AI系统研发奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24155 2026-07-30 cs.CY cs.AI cs.HC 版本更新 81%

The Alignment Target Problem: Divergent Moral Judgments of Humans, AI Systems, and Their Designers

对齐目标问题:人类、人工智能系统及其设计者的道德判断分歧

Benjamin Minhao Chen, Xinyu Xie

机构 * The University of Hong Kong(香港大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 研究探讨了人类、AI系统及其设计者在道德判断上的差异,通过实验发现人类设计的AI行为会引发更强烈的道德约束,揭示了价值对齐的挑战。

Comments ACM FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07314 2026-07-30 cs.CL cs.AI 版本更新 81%

MEDIC: Comprehensive Evaluation of Leading Indicators for LLM Safety and Utility in Clinical Applications

MEDIC:对LLM在临床应用中的安全性和实用性领先指标的综合评估

Praveenkumar Kanithi, Clément Christophe, Marco AF Pimentel, Tathagata Raha, Prateek Munjal, Nada Saadi, Hamza A Javed, Svetlana Maslenkova, Nasir Hayat, Ronnie Rajan, Shadab Khan

机构 * M42

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 MEDIC通过综合评估框架揭示LLM在临床应用中的安全性和实用性差异,强调需采用组合方法以应对多维度性能权衡。

Comments Published in Transactions on Machine Learning Research (06/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24817 2026-07-29 cs.IR cs.AI cs.CL 新提交 81%

Retrieval-Augmented Generation in LLMs for Mental Health: Quantifying the Incremental Contribution of Retrieval Within a Layered Safety Architecture

大语言模型在心理健康领域的检索增强生成:量化分层安全架构中检索的增量贡献

Anand Gupta, Akshat Surolia, Shubham Mishra, Shakil Imtiaz, Chaitali Sinha

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 研究数字心理健康干预中,通过在名为Wysa的DMHI里对比启用和禁用检索增强生成(RAG)模式,评估六个大语言模型,计算相关指标并测试差异,发现RAG虽致误报增加,但符合安全原则,是提升LLM驱动的DMHIs相关性能的有前景方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23237 2026-07-28 cs.LG cs.AI 新提交 81%

Context-Aware Concept Distillation for Trustworthy Flood Prediction

用于可靠洪水预测的上下文感知概念蒸馏

Eli Levinkopf, Efrat Morin, Claudia V. Goldman

机构 * School of Computer Science and Engineering, The Hebrew University of Jerusalem(耶路撒冷希伯来大学计算机科学与工程学院) Institute of Earth Sciences, The Hebrew University of Jerusalem(耶路撒冷希伯来大学地球科学研究所) Hebrew University Business School, The Hebrew University of Jerusalem(耶路撒冷希伯来大学商学院)

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI、cs.LG

AI总结 针对深度学习模型‘黑箱’问题阻碍洪水预测信任度的挑战,提出上下文感知概念蒸馏框架CACD,引入无监督管道和残差超网络,经全球多流域评估,该模型高保真且优于黑箱基线,平衡了AI准确性与决策透明度。

Comments to be published in IJCAI 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20265 2026-07-23 cs.CL cs.AI 新提交 81%

The Maskability Index: Predicting Task-Objective Alignment in Pretrained Language Models

可掩码性指数:预测预训练语言模型中的任务目标对齐

Ahmad Pouramini, Mahsa Afsharzadeh

机构 * Sirjan University of Technology(锡尔詹理工大学) Department of Computer Engineering(计算机工程系)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 研究提出可掩码性指数(MI),用于评估知识关系适合的提示方式,通过掩码与未掩码模板的DepthRank分数差异计算。在ATOMIC2020基准上评估发现MI与下游生成性能正相关,有助于选择提示模板和策略提取预训练语言模型的关系知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19913 2026-07-23 cs.AI cs.CL cs.CR 新提交 81%

JANUS: Foreseeing Latent Risk for Long-Horizon Agent Safety

JANUS:预见长期智能体安全中的潜在风险

Yuan Xiong, Linji Hao, Shizhu He, Yequan Wang, Lijun Li

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 研究长期智能体安全潜在风险,提出JANUS框架,通过多智能体模拟合成轨迹,经预测与裁决耦合任务学习共享策略,用CoAA-RL联合优化,所产生的Vanguard模型提升了智能体安全防护及任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17601 2026-07-21 cs.LG cs.AI 新提交 81%

Trustworthy Protein-Ligand Binding Affinity Prediction via Reliability-Aware Multi-Engine Fusion

通过可靠性感知多引擎融合实现可靠的蛋白质-配体结合亲和力预测

Yongchan Hong, Defu Cao, Wenjin Liu, Thomas Ku, Jordy Homing Lam, Emily Nguyen, Willie Neiswanger, Vsevolod Katritch, Yan Liu

机构 * University of Southern California(南加州大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对蛋白质-配体结合亲和力预测中引擎结果不一致问题,提出RELIABLE-BA框架,通过三步实现多引擎预测,经实验验证其能提升预测竞争力和不确定性校准,可筛选高置信对减少误差,是首个结合证据融合与上下文可靠性的预测框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17270 2026-07-21 cs.CL cs.CY 新提交 81%

Safety That Does Not Transfer: Cross-Lingual Clinical Correctness Drift in Deployable Medical Language Models

不可转移的安全性:可部署医学语言模型中的跨语言临床正确性漂移

Anthonio Oladimeji Gabriel, Dimeji Olawuyi, Toba Ajayi, Temilola Aderemi

机构 * AI SafetyX(人工智能安全X)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.CY

AI总结 研究资源匮乏健康环境中可部署医学语言模型的跨语言临床正确性漂移,构建英语-豪萨语问题对评估六个模型,发现本地可部署模型临床正确性下降,前沿模型较稳定,缺陷源于可部署层而非语言或临床材料。

详情

展开后加载摘要…

URL PDF HTML 收藏