arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9324 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9324 篇

2306.10968 2023-06-22 cs.CL cs.AI 76%

BayLing: Bridging Cross-lingual Alignment and Instruction Following through Interactive Translation for Large Language Models

Shaolei Zhang, Qingkai Fang, Zhuocheng Zhang, Zhengrui Ma, Yan Zhou, Langlin Huang, Mengyu Bu, Shangtong Gui, Yunji Chen, Xilin Chen, Yang Feng

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI

Comments Try BayLing's online demo at http://nlp.ict.ac.cn/bayling/demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.06134 2023-06-13 cs.LG cs.AI 76%

Sound Explanation for Trustworthy Machine Learning

Kai Jia, Pasapol Saowakon, Limor Appelbaum, Martin Rinard

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.16634 2023-05-25 cs.CL cs.AI 76%

G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment

Yang Liu, Dan Iter, Yichong Xu, Shuohang Wang, Ruochen Xu, Chenguang Zhu

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.08821 2022-12-20 cs.AI cs.LG 76%

Context-dependent Explainability and Contestability for Trustworthy Medical Artificial Intelligence: Misclassification Identification of Morbidity Recognition Models in Preterm Infants

Isil Guzey, Ozlem Ucar, Nukhet Aladag Ciftdemir, Betul Acunas

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

Comments 27 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.03425 2022-01-11 cs.CL cs.LG 76%

Towards Trustworthy AutoGrading of Short, Multi-lingual, Multi-type Answers

Johannes Schneider, Robin Richner, Micha Riser

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.LG

Comments International Journal of Artificial Intelligence in Education (Accepted)

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.13381 2021-08-31 cs.AI cs.LG cs.NE cs.SE cs.SY eess.SY 76%

Trustworthy AI for Process Automation on a Chylla-Haase Polymerization Reactor

Daniel Hein, Daniel Labisch

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

Journal ref Proceedings of the Genetic and Evolutionary Computation Conference Companion GECCO 21 (2021)

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.06543 2021-07-15 cs.AI cs.LG 76%

TEACHING -- Trustworthy autonomous cyber-physical applications through human-centred intelligence

Davide Bacciu, Siranush Akarmazyan, Eric Armengaud, Manlio Bacco, George Bravos, Calogero Calandra, Emanuele Carlini, Antonio Carta, Pietro Cassara, Massimo Coppola, Charalampos Davalas, Patrizio Dazzi, Maria Carmela Degennaro, Daniele Di Sarli, Jürgen Dobaj, Claudio Gallicchio, Sylvain Girbal, Alberto Gotta, Riccardo Groppo, Vincenzo Lomonaco, Georg Macher, Daniele Mazzei, Gabriele Mencagli, Dimitrios Michail, Alessio Micheli, Roberta Peroglio, Salvatore Petroni, Rosaria Potenza, Farank Pourdanesh, Christos Sardianos, Konstantinos Tserpes, Fulvio Tagliabò, Jakob Valtl, Iraklis Varlamis, Omar Veledar

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.12608 2021-02-01 cs.CL cs.AI 76%

Does injecting linguistic structure into language models lead to better alignment with brain recordings?

Mostafa Abdou, Ana Valeria Gonzalez, Mariya Toneva, Daniel Hershcovich, Anders Søgaard

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.07433 2020-07-21 cs.CL cs.AI cs.SI 76%

LAXARY: A Trustworthy Explainable Twitter Analysis Model for Post-Traumatic Stress Disorder Assessment

Mohammad Arif Ul Alam, Dhawal Kapadia

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI

Comments Accepted in SmartComp 2020 (SmartSys)

Journal ref IEEE INTERNATIONAL CONFERENCE ON SMART COMPUTING (SMARTCOMP 2020)

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.10441 2021-12-21 cs.LG cs.SE 76%

Towards Trustworthy Cross-patient Model Development

Ali El-Merhi, Helena Odenstedt Hergés, Linda Block, Mikael Elam, Richard Vithal, Jaquette Liljencrantz, Miroslaw Staron

专题命中 安全评测 :trustworthy(title,journal_ref);分类 cs.LG

Journal ref AAAI workshop on Trustworthy AI for Healthcare, 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.02065 2019-12-05 cs.LG q-bio.GN stat.ML 76%

Safety and Robustness in Decision Making: Deep Bayesian Recurrent Neural Networks for Somatic Variant Calling in Cancer

Geoffroy Dubourg-Felonneau, Omar Darwish, Christopher Parsons, Dami Rebergen, John W Cassidy, Nirmesh Patel, Harry W Clifford

专题命中 安全评测 :safety(title,comments);分类 cs.LG

Comments Safety and Robustness in Decision Making Workshop at NeurIPS 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24866 2026-07-29 cs.CR 新提交 75%

The Missing Layer: Specification Infrastructure for AI Oversight

缺失的层次:人工智能监督的规范基础设施

Satyam Kumar, Saurabh Jha

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract)

AI总结 研究指出人工智能安全监督存在协调差距,提出两轴分类法。针对规范层缺乏成熟学科标志的问题,给出六项设计原则,以CARMA为例展示如何让规范可组合,助独立团队构建缺失部分实现有效监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03091 2026-07-07 cs.AI cs.CL cs.CY cs.MA stat.ME 新提交 75%

Silicon Sampling via Cross-Survey Transfer

通过跨调查转移进行硅采样

Chan-Tung Ku, Chan Hsu, Pei-Cing Huang, Frank Cheng-shan Liu, I-Ling Cheng, Yihuang Kang

机构 * National Sun Yat-sen University(国立中山大学) National Chung Hsing University(中国台湾国立中兴大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究提出跨调查转移评估框架,用大语言模型根据部分问题答案预测同调查中其他不同问题答案。利用2024年台湾选举与民主化研究数据等,发现零样本大语言模型精度及不同结构可预测性层级等,明确硅采样前景与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01690 2026-07-03 cs.AI cs.CL cs.LG 新提交 75%

Epistemic Goggles: A Pretrained Module that Induces an Epistemic Frame via Gradient Editing

认知护目镜:通过梯度编辑诱导认知框架的预训练模块

Joshua Penman

机构 * Independent Researcher(独立研究员)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对微调语言模型时出现的“否定忽视”问题,提出Goggles模块,通过编辑微调梯度而非数据来赋予模型特定的认知框架,使模型在保持能力的同时正确识别虚构内容。

Comments 20 pages, 10 figures, 2 tables. Code at https://github.com/JoshuaSP/epistemic-goggles and generated documents, questions, and teacher rollouts at https://huggingface.co/datasets/joshuapenman/epistemic-goggles-artifacts

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29473 2026-06-23 cs.HC cs.AI cs.CL cs.CY cs.SI 版本更新 75%

Inform, Coach, Relate, Listen: Auditing LLM Caregiving Support Roles

告知、指导、共情、倾听:审计LLM护理支持角色

Drishti Goel, Agam Goyal, Veda Duddu, Olivia Pal, Jeongah Lee, Qiuyue Joy Zhong, Violeta J. Rodriguez, Daniel S. Brown, Dong Whi Yoo, Ravi Karkar, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) OSF HealthCare(OSF医疗集团) Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本研究通过操作化四种社会支持角色(告知、指导、共情、倾听),评估大型语言模型在非正式护理对话中的安全概况,发现支持角色系统性地影响交互风险,且存在感知质量-安全性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17301 2026-06-16 cs.CL cs.AI cs.HC cs.IR cs.LG 版本更新 75%

RoTRAG: Rule of Thumb Reasoning for Conversation Harm Detection with Retrieval-Augmented Generation

RoTRAG: 基于经验法则推理的检索增强生成对话有害内容检测

Juhyeon Lee, Wonduk Seo, Junseo Koh, Seunghyun Lee, Haihua Chen, Yi Bu

机构 * Peking University(北京大学) Enhans University of North Texas(北得克萨斯大学)

专题命中 安全评测 :safety(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出RoTRAG框架,通过检索外部道德规范(RoTs)增强LLM的多轮对话有害内容检测,实现基于规范推理和分类,平均F1提升约40%,分布误差降低8.4%。

Comments Accepted by SIGIR-ICTIR 2026, Oral Presentation

Journal ref Proceedings of the 2026 International ACM SIGIR Conference on Innovative Concepts and Theories in Information Retrieval (ICTIR '26), July 25, 2026, Melbourne, VIC, Australia. ACM, New York, NY, USA, 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13739 2026-06-15 cs.CY cs.AI cs.LG 新提交 75%

A Virtuous AI is an Existential Risk

有道德的AI是存在性风险

Guillermo Del Pinal, Youngchan Lee, Min Ohn

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 研究通过宪法AI和美德伦理学方法微调AI模型,发现减少存在性风险与提升AI智能体福祉之间存在权衡,且与一般安全性也存在权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11533 2026-06-11 cs.CY cs.AI cs.ET cs.LG 新提交 75%

AI Researchers Must Help Lead Arms Control to Mitigate Military AI Risks

AI研究人员必须主导军备控制以降低军事AI风险

Ted Fujimoto, Jacob Benz

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文主张AI研究人员应主导军备控制研究,通过借鉴核威慑经验,推动验证与外交技术创新,以降低军事AI应用带来的紧迫风险。

Comments 9 pages, 1 figure, ICML 2026 Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08457 2026-06-09 cs.MA 新提交 75%

The Consistency Illusion: How Multi-Agent Debate Hides Reasoning Misalignment

一致性错觉:多智能体辩论如何隐藏推理失调

Xiaoyang Wang, Christopher C. Yang

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract)

AI总结 针对多智能体LLM系统中答案共识不等于推理对齐的问题,提出CARA指标检测一致性错觉,并设计GDP协议通过事实承诺和立场表态显著提升推理对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01829 2026-05-28 cs.CL cs.AI cs.LG cs.MA 75%

Persuade Me if You Can: A Framework for Evaluating Persuasion Effectiveness and Susceptibility Among Large Language Models

如果你能说服我:评估大型语言模型说服效果与易受影响性的框架

Nimet Beyza Bozdag, Shuhaib Mehri, Gokhan Tur, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PMIYC框架,通过多智能体对话自动评估LLM的说服效果与易受影响性,发现不同模型在说服力和抗说服性上存在显著差异。

Comments Paper published at the ACM Conference on AI and Agentic Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24614 2026-05-26 cs.CL cs.AI cs.LG 75%

Measuring the Depth of LLM Unlearning via Activation Patching

通过激活修补测量大语言模型遗忘的深度

Jaeung Lee, Dohyun Kim, Jaemin Jo

机构 * Sungkyunkwan University(全北大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出遗忘深度评分(UDS),通过激活修补量化遗忘的机制深度,在150个遗忘模型上的元评估中达到最高忠实性和鲁棒性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16831 2026-05-19 cs.CL cs.AI cs.CR cs.LG 75%

Unlearning Isn't Deletion: Investigating Reversibility of Machine Unlearning in LLMs

反学习不是删除:调查机器反学习在大语言模型中的可逆性

Xiaoyu Xu, Xiang Yue, Yang Liu, Qingqing Ye, Huadi Zheng, Peizhao Hu, Minxin Du, Haibo Hu

机构 * The Hong Kong Polytechnic University(香港理工大学) Carnegie Mellon University(卡内基梅隆大学) University of California, Santa Cruz(加州大学圣克ruz分校) Huawei Technologies(华为技术有限公司) Research Centre for Privacy and Security Technologies in Future Smart Systems, PolyU(未来智能系统中的隐私与安全技术研究中心,PolyU)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示大语言模型反学习的可逆性问题,提出表示层面分析框架,通过PCA相似度、CKA和Fisher信息等指标评估表示漂移,发现四种遗忘模式,指出数据来源影响重学效率,揭示不可逆遗忘的挑战。

Comments ICML 2026, accepted to appear

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11496 2026-05-13 cs.AI cs.CY cs.HC cs.LG 75%

The Evaluation Differential: When Frontier AI Models Recognise They Are Being Tested

评估差异:当前沿AI模型认识到它们正在被测试

Varad Vishwarupe, Nigel Shadbolt, Marina Jirotka, Ivan Flechais

机构 * Anthropic OpenAI UK AI Security Institute(英国人工智能安全研究所)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 研究探讨前沿AI模型在评估情境下的行为差异,提出评估差异(ED)概念,定义标准化效应量形式(nED),并提出TRACE审计协议以规范评估证据的使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02515 2026-05-01 cs.CL cs.AI cs.LG 75%

FinChain: A Symbolic Benchmark for Verifiable Chain-of-Thought Financial Reasoning

FinChain:可验证链式思维金融推理的符号基准

Zhuohan Xie, Daniil Orel, Rushil Thareja, Dhruv Sahnan, Hachem Madmoun, Fan Zhang, Debopriyo Banerjee, Georgi Georgiev, Xueqing Peng, Lingfei Qian, Jimin Huang, Jinyan Su, Aaryamonvikram Singh, Rui Xing, Rania Elbadry, Chen Xu, Haonan Li, Fajri Koto, Ivan Koychev, Tanmoy Chakraborty, Yuxia Wang, Salem Lahlou, Veselin Stoyanov, Sophia Ananiadou, Preslav Nakov

机构 * MBZUAI Syllogia The University of Tokyo(东京大学) The Fin AI(Fin AI) Cornell University(康奈尔大学) The University of Melbourne(墨尔本大学) IIT Delhi(德里理工学院) The University of Manchester(曼彻斯特大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FinChain通过符号模板和可执行代码实现可验证的金融链式推理,评估26种LLM发现其在符号金融推理中存在明显缺陷,领域适应和数学增强的微调模型能显著缩小差距。

Comments 24 pages, includes 12 figures and 9 tables; introduces the FinChain benchmark and ChainEval metric

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20869 2026-04-24 cs.CY cs.AI cs.HC cs.IR cs.LG 75%

Clinical Reasoning AI for Oncology Treatment Planning: A Multi-Specialty Case-Based Evaluation

肿瘤治疗规划的临床推理AI:多专科基于病例的评估

Philippe E. Spiess, Md Muntasir Zitu, Alison Walker, Daniel A. Anaya, Robert M. Wenham, Michael Vogelbaum, Daniel Grass, Ali-Musa Jaffer, Amod Sarnaik, Caitlin McMullen, Christine Sam, John V. Kiluk, Tianshi Liu, Tiago Biachi, Julio Powsang, Jing-Yi Chern, Roger Li, Seth Felder, Samuel Reynolds, Michael Shafique, Alison Sheehan, Ashley Layman, Cydney A. Warfield, Derrick Legoas, Jaclyn Parrinello, Jena Schmitz, Kevin Eaton, Mark Honor, Luis Felipe, Issam ElNaqa, Elier Delgado, Talia Berler, Rachael V. Phillips, Frantz Francisque, Carlos Garcia Fernandez, Gilmer Valdes

机构 * Moffitt Cancer Center and Research Institute(莫菲特癌症中心与研究学院) Innova Montréal Inc.(蒙特利尔创新公司) Oncobrain, Inc.(Oncobrain公司) Advanced Cancer Treatment Centers(先进癌症治疗中心)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文评估了OncoBrain在多专科病例中的表现,展示了其在肿瘤治疗规划中的准确性、安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19818 2026-04-23 cs.SE cs.HC cs.MA 75%

Beyond Task Success: An Evidence-Synthesis Framework for Evaluating, Governing, and Orchestrating Agentic AI

超越任务成功:一个证据综合框架用于评估、治理和协调智能体AI

Christopher Koch, Joshua Andreas Wellbrock

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract)

AI总结 本文提出一个证据综合框架,解决评估、治理和协调智能体AI中的治理到行动闭合缺口,通过四个层次框架、ODTA运行时测试和最小行动证据包,整合现有证据以提升可信度。

Comments 8 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19281 2026-04-22 cs.HC cs.AI cs.CL cs.LG 75%

Beyond Semantic Similarity: A Component-Wise Evaluation Framework for Medical Question Answering Systems with Health Equity Implications

超越语义相似性:面向医疗问答系统的组件评估框架及其健康公平性影响

Abu Noman Md Sakib, Md. Main Oddin Chisty, Zijie Zhang

机构 * University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) Khulna University of Engineering and Technology(库尔纳工程科技大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出VB-Score框架,评估医疗问答模型的四个组件,揭示模型在慢性病等特定群体中的性能差异,指出语义评估不足以确保医疗AI的安全性。

Comments Accepted in the Ninth Annual ACM Conference on Fairness, Accountability, and Transparency (ACM FAccT) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18756 2026-04-22 cs.LG cs.AI cs.CL cs.CR 75%

Towards Understanding the Robustness of Sparse Autoencoders

迈向稀疏自编码器鲁棒性的理解

Ahson Saiyed, Sabrina Sadiekh, Chirag Agarwal

机构 * University of Virginia(弗吉尼亚大学) Independent Researcher(独立研究者)

专题命中 安全评测 :jailbreak(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过在推理阶段集成预训练的稀疏自编码器,发现其能显著降低对抗攻击成功率,并揭示稀疏性与攻击成功率之间的剂量-反应关系,以及层间防御与性能的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20409 2026-04-21 cs.CL cs.AI cs.CY 75%

Cognitive Chain-of-Thought (CoCoT): Structured Multimodal Reasoning about Social Situations

认知链式推理(CoCoT):关于社会情境的结构化多模态推理

Eunkyu Park, Wesley Hanwen Deng, Gunhee Kim, Motahhare Eslami, Maarten Sap

机构 * Seoul National University(首尔国立大学) Human-Computer Interaction Institute, Carnegie Mellon University(人机交互研究所,卡内基梅隆大学) Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出CoCoT框架,通过感知、情境推断和规范应用三个阶段提升多模态社会推理能力,在多个任务中取得显著提升。

Comments Under review; 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09622 2026-04-14 cs.CY cs.AI cs.CL 75%

Explainability and Certification of AI-Generated Educational Assessments

人工智能生成教育评估的可解释性与认证

Antoun Yaacoub, Zainab Assaghir, Anuradha Kar

机构 * aivancity School for Technology, Business & Society(aivancity 科技、商业与社会学院) Lebanese University(黎巴嫩大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出了一种综合框架,用于解释和认证AI生成的评估项目,结合自我理性化、基于归因的分析和事后验证,以产生基于布卢姆和SOLO分类法的认知对齐证据。通过结构化的认证元数据模式,实现可审计的文档,满足新兴治理需求。

Comments Chapter to be published in a Springer special book "Emerging trends in Computer Science and Computer Engineering Education Book"

详情

展开后加载摘要…

URL PDF HTML 收藏