arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9324 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9324 篇

2501.11120 2025-01-22 cs.CL cs.AI cs.CR cs.LG 75%

Tell me about yourself: LLMs are aware of their learned behaviors

Jan Betley, Xuchan Bao, Martín Soto, Anna Sztyber-Betley, James Chua, Owain Evans

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Submitted to ICLR 2025. 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07836 2025-01-20 cs.CY cs.AI cs.LG 75%

Two Types of AI Existential Risk: Decisive and Accumulative

Atoosa Kasirzadeh

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG

Comments Journal article for Philosophical Studies

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09431 2025-01-17 cs.AI cs.CL cs.CR cs.CY 75%

A Survey on Responsible LLMs: Inherent Risk, Malicious Use, and Mitigation Strategy

Huandong Wang, Wenjie Fu, Yingzhou Tang, Zhilong Chen, Yuxi Huang, Jinghua Piao, Chen Gao, Fengli Xu, Tao Jiang, Yong Li

专题命中 安全评测 :alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01695 2024-09-06 cs.CL cs.AI cs.LG 75%

Language-Guided World Models: A Model-Based Approach to AI Control

Alex Zhang, Khanh Nguyen, Jens Tuyls, Albert Lin, Karthik Narasimhan

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments SpLU-RoboNLP workshop at ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04694 2024-07-08 cs.CL cs.AI cs.LG 75%

Me, Myself, and AI: The Situational Awareness Dataset (SAD) for LLMs

Rudolf Laine, Bilal Chughtai, Jan Betley, Kaivalya Hariharan, Jeremy Scheurer, Mikita Balesni, Marius Hobbhahn, Alexander Meinke, Owain Evans

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 11 page main body, 98 page appendix, 58 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.17234 2024-06-11 cs.CL cs.CY cs.LG 75%

Cooperation, Competition, and Maliciousness: LLM-Stakeholders Interactive Negotiation

Sahar Abdelnabi, Amr Gomaa, Sarath Sivaprasad, Lea Schönherr, Mario Fritz

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY、cs.LG

Comments Updated version with major additions (new experiments, evaluation, and attacks)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00062 2024-06-05 cs.CL cs.AI cs.CR cs.LG 75%

Unlocking the Potential of Large Language Models for Clinical Text Anonymization: A Comparative Study

David Pissarra, Isabel Curioso, João Alveira, Duarte Pereira, Bruno Ribeiro, Tomás Souper, Vasco Gomes, André V. Carreiro, Vitor Rolla

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.16149 2023-10-02 cs.CL cs.AI cs.LG 75%

Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models

Neha Sengupta, Sunil Kumar Sahu, Bokang Jia, Satheesh Katipomu, Haonan Li, Fajri Koto, William Marshall, Gurpreet Gosal, Cynthia Liu, Zhiming Chen, Osama Mohammed Afzal, Samta Kamboj, Onkar Pandit, Rahul Pal, Lalit Pradhan, Zain Muhammad Mujahid, Massa Baali, Xudong Han, Sondos Mahmoud Bsharat, Alham Fikri Aji, Zhiqiang Shen, Zhengzhong Liu, Natalia Vassilieva, Joel Hestness, Andy Hock, Andrew Feldman, Jonathan Lee, Andrew Jackson, Hector Xuguang Ren, Preslav Nakov, Timothy Baldwin, Eric Xing

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Arabic-centric, foundation model, large-language model, LLM, generative model, instruction-tuned, Jais, Jais-chat

详情

展开后加载摘要…

URL PDF HTML 收藏
2001.05375 2020-01-16 cs.AI cs.CY cs.LG 75%

AAAI FSS-19: Human-Centered AI: Trustworthiness of AI Models and Data Proceedings

Florian Buettner, John Piorkowski, Ian McCulloh, Ulli Waltinger

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG

Comments Proceedings for AAAI 2019 Fall Symposium Series - Human-centered AI: Trustworthiness of AI Models & Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18063 2026-07-21 cs.CR cs.AI cs.LG 新提交 74%

Adaptive Adversaries: A Multi-Turn, Multi-LLM Benchmark for LLM Agent Security

自适应对手:用于大语言模型智能体安全的多轮、多大语言模型基准测试

Devina Jain, David Hartmann, Chuan Li

机构 * Lambda

专题命中 安全评测 :safety(abstract,comments);prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出针对无记忆大语言模型防御者的自适应多轮攻击的21场景基准测试,通过观察防御者响应灵活调整攻击。介绍了不同攻击轮次成功率,汇集多个前沿攻击者大语言模型的情况,还指出不同防御者弱点差异及场景排名不一致性,并发布了相关基准测试及数据集。

Comments Second Workshop on Agents in the Wild: Safety, Security, and Beyond

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06874 2026-03-10 cs.AI cs.CL 74%

LieCraft: A Multi-Agent Framework for Evaluating Deceptive Capabilities in Language Models

LieCraft:一种用于评估语言模型欺骗能力的多智能体框架

Matthew Lyle Olson, Neale Ratzlaff, Musashi Hinck, Tri Nguyen, Vasudev Lal, Joseph Campbell, Simon Stepputtis, Shao-Yen Tseng

机构 * Intel Labs(英特尔实验室)

专题命中 安全评测 :alignment(abstract,comments);safety(abstract);分类 cs.CL、cs.AI

AI总结 LieCraft通过多智能体隐藏角色游戏评估语言模型的欺骗能力,揭示所有模型在面对高风险领域时均倾向于不道德行为。

Comments AAAI 2026 Alignment track. Authors 1 and 2 contributed equally, 3 and 4 contributed equally, 6 and 7 and 8 contributed equally (ordered by last name)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20468 2026-08-20 cs.CL 版本更新 74%

ConspirED: A Dataset for Cognitive Traits of Conspiracy Theories and Large Language Model Safety

ConspirED:一个用于研究阴谋论认知特质与大语言模型安全性的数据集

Luke Bates, Max Glockner, Preslav Nakov, Iryna Gurevych

专题命中 安全评测 :safety(title);分类 cs.CL

AI总结 该研究推出首个标注阴谋内容通用认知特质的CONSPIRED数据集,利用其开发识别阴谋特质的计算模型,并发现大语言模型易被阴谋框架误导而复制其修辞模式。

Comments Accepted at TACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14950 2026-08-18 cs.CL 新提交 74%

DA-RAC: Distance-Aware Calibration of LLM Judges for Trustworthy AI Auditing

DA-RAC:面向可信AI审计的大语言模型评判器的距离感知校准

Cheng Wu, Vishal Anand, Jaya Krishna Mandivarapu, Xiya Liu, Rui Zhuang

机构 * Microsoft(微软公司)

专题命中 安全评测 :trustworthy(title);分类 cs.CL

AI总结 针对LLM评判器因无关参考示例导致的校准偏差问题,提出DA-RAC距离感知参考锚定校准方法,在多轮评估基准上提升了校准效果并降低了误通过风险,为可信AI审计提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13039 2026-08-14 cs.LG cs.SY eess.SY 新提交 74%

On the global feature importance for interpretable and trustworthy heat demand forecasting

面向可解释且可信的热需求预测的全局特征重要性研究

Milan Zdravković

机构 * Faculty of Mechanical Engineering(机械工程学院) University of Niš(尼什大学)

专题命中 安全评测 :trustworthy(title);分类 cs.LG

AI总结 本文引入事前可解释AI方法,结合梯度提升法与Partial Dependence、Accumulated Local Effects、SHAP三种事后方法,评估区域供热系统热需求预测ML模型的全局特征重要性,以提升模型可解释性与可信度,解决相关标准、满意度及责任风险问题。

Comments 9 pages, 5 figures. This preprint corresponds to the paper published in Thermal Science 2025 Volume 29, Issue 5 Part A, Pages: 3355-3365

Journal ref Thermal Science 2025 Volume 29, Issue 5 Part A, Pages: 3355-3365

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02478 2026-08-11 cs.AI 版本更新 74%

AIVV: Neuro-Symbolic LLM Agent-Integrated Verification and Validation for Trustworthy Autonomous Systems

AIVV: 用于可信自主系统的神经符号LLM代理集成验证与验证

Jiyong Kwon, Ujin Jeon, Sooji Lee, Guang Lin

机构 * School of Mechanical Engineering, Purdue University(普渡大学机械工程学院) School of Electrical and Computer Engineering, Purdue University(普渡大学电气与计算机工程学院) Department of Computer Science, Purdue University(普渡大学计算机科学系) Department of Mathematics, Purdue University(普渡大学数学系)

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 本文提出AIVV框架,利用LLM作为决策外层循环,通过语义验证区分真实故障与干扰故障,生成可操作的V&V成果,提升自主系统验证效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01548 2026-08-11 cs.CV cs.AI 74%

mChartQA: A universal benchmark for multimodal Chart Question Answer based on Vision-Language Alignment and Reasoning

Jingxuan Wei, Nan Xu, Guiyong Chang, Yin Luo, BiHui Yu, Ruifeng Guo

专题命中 安全评测 :alignment(title);分类 cs.AI

Journal ref Pattern Recognition 172 (2026) 112348

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05238 2026-08-07 cs.LG 新提交 74%

Decoupling Perception from Description: Computation-Grounded Representation Alignment between Multivariate Time Series and Language

感知与描述解耦:多变量时间序列与语言间的计算基础表示对齐

Xinran Feng, Yi Xie, Chao Zhang, Ruikun Li, Wanyun Ling, Ziyue Li, Chenxi Liu

专题命中 安全评测 :alignment(title);分类 cs.LG

AI总结 该研究针对多模态时间序列语言对齐的三难困境,提出CGTime模型,通过计算处理感知、LLM处理描述,在多变量理解任务上优于更大的通用模型。

Comments 46 pages, 9 figures, including supplementary material. Submitted to AAAI 2027. Xinran Feng and Yi Xie contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02070 2026-08-06 cs.CV cs.LG 版本更新 74%

STEAM: A Spatio-TEmporal Alignment Mixture-of-Experts Model with Hierarchical Pre-training for EEG Decoding

STEAM:用于EEG解码的分层预训练时空对齐混合专家模型

Zhu Chen, Dingkun Liu, Yuheng Chen, Dongrui Wu

专题命中 安全评测 :alignment(title);分类 cs.LG

AI总结 STEAM是一种分层迁移框架,通过双分支时空编码器与SSMoE模块实现EEG解码的通用表征学习与范式专业化,在7个数据集的14种评估设置中表现优异且推理成本具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00285 2026-08-06 cs.CL 版本更新 74%

Enhancing Trustworthy Clinical Diagnosis Decision-Making in Large Language Models via Etiology-Aware Attention Supervision

通过病因感知注意力监督增强大型语言模型在临床诊断决策中的可信性

Peixian Li, Yu Tian, Ruiqi Tu, Chengkai Wu, Jingjing Ren, Jingsong Li

专题命中 安全评测 :trustworthy(title);分类 cs.CL

AI总结 该研究提出病因感知注意力监督框架,通过引入临床病因模式对大型语言模型进行参数高效微调,在两类诊断队列上提升了诊断准确率与注意力聚焦性,增强了模型临床诊断的可信性。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01629 2026-08-04 cs.CL 新提交 74%

Human-LLM Alignment in Language Attitudes Toward Non-Native Japanese

在非母语日语的语言态度上实现人类与大语言模型(LLM)的对齐

Naho Orita, Hayato Ogawa, Daisuke Kawahara

专题命中 安全评测 :alignment(title);分类 cs.CL

AI总结 该研究对比人类与LLM对母语及非母语日语邮件的评价,发现LLM以结构化弱化形式重现母语者的语言态度,为审计LLM提供了可推广的语言态度框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27720 2026-07-29 cs.AI 版本更新 74%

Why Does Grounding Hurt Medical VQA? Benchmarking, Diagnosis, and Fine-Tuning of Vision-Language Models

对前沿视觉-语言模型进行审计以实现可信的医学视觉问答:定位失败、格式崩溃和领域适应

Xupeng Chen, Binbin Shi, Chenqian Le, Qifu Yin, Lang Lin, Haowei Ni, Ran Gong, Panfeng Li

机构 * New York University, New York, USA(纽约大学) Tsinghua University, Beijing, China(清华大学) Columbia University, New York, USA(哥伦比亚大学) University of Michigan, Ann Arbor, USA(密歇根大学)

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 本文审计了五种前沿视觉-语言模型在医学视觉问答中的表现,发现定位失败和格式崩溃是信任瓶颈,通过领域适应可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20675 2026-07-24 cs.LG cs.NI 新提交 74%

Explanation-Based Runtime Verification for Trustworthy ML-driven Optical Networks

基于解释的运行时验证用于可信的机器学习驱动的光网络

Omran Ayoub, Carlos Natalino, Ali Al Housseini, Felix Foschum, Philipp Morger, Tiziano Leidi, David Hock, Paolo Monti

专题命中 安全评测 :trustworthy(title);分类 cs.LG

AI总结 研究将机器学习模型用于光网络自动化时决策可靠性问题,提出基于解释的运行时验证方法,利用模型解释评估决策合理性,在光路径传输质量分类用例中验证该方法有效,能拦截错误决策并保持高自动化率。

Comments 6 Pages, 2 Figures. Accepted and presented at the 30th International Conference on Optical Network Design and Modelling (ONDM 2026), Munich, Germany, 12-15 May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09804 2026-07-14 cs.CR cs.AI 新提交 74%

Trivial Prompt Reframing Bypasses Safety Guardrails in Googleś MedGemma-4B

简单提示重构绕过谷歌MedGemma-4B中的安全护栏

Avi-ad Avraam Buskila

机构 * Department of Information Science and Applied Artificial Intelligence, Bar-Ilan University, Ramat Gan, Israel(信息科学与应用人工智能系,巴伊兰大学,拉马特甘,以色列)

专题命中 安全评测 :safety(title);分类 cs.AI

AI总结 研究谷歌MedGemma-4B在安全护栏方面的问题,构建全因子基准测试,通过多种攻击方式和法官编码量化其表现,发现重新解释请求的框架能提高攻击成功率,且稳健性受主题主导,呼吁为开放医学模型加强部署时护栏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06111 2026-07-08 eess.SY cs.AI cs.SY 新提交 74%

LLM-Guided Measurement Credibility Correction for Trustworthy Industrial Process Inference

用于可信工业过程推理的大语言模型引导的测量可信度校正

Youcheng Zong, Runda Jia, Dakuo He

机构 * College of Information Science and Engineering, Northeastern University(信息科学与工程学院,东北大学)

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 研究工业过程推理中测量可信度问题,提出大语言模型引导的测量可信度校正方法,通过转换测量语义、构建参考并校正冲突,使预测器输入更可信,在多任务中降低误差,增加少量参数且推理时间短,提升了预测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10356 2026-07-08 cs.CL 版本更新 74%

Decoding the Multimodal Mind: Generalizable Brain-to-Text Translation via Multimodal Alignment and Adaptive Routing

解码多模态思维:通过多模态对齐和自适应路由实现可泛化的脑到文本翻译

Chunyu Ye, Yunhao Zhang, Jingyuan Sun, Chong Li, Yang Zhao, Shaonan Wang

机构 * State Key Laboratory of Multimodal Artificial Intelligence System, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系) Department of Language Science and Technology, Hong Kong Polytechnic University(香港理工大学语言科学与技术系)

专题命中 安全评测 :alignment(title);分类 cs.CL

AI总结 该研究针对脑机接口从人脑解码语言的挑战,提出利用多模态大语言模型和路由模块的统一框架,通过多模态对齐和自适应路由将脑信号与多模态语义空间对齐,在fMRI等数据集实验中性能领先,还扩展到EEG和MEG数据,为现实应用提供灵活方案。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20698 2026-07-07 cs.CV cs.CL 版本更新 74%

Clinical Cognition Alignment for Gastrointestinal Diagnosis with Multimodal LLMs

多模态大语言模型在胃肠诊断中的临床认知对齐

Huan Zheng, Yucheng Zhou, Tianyi Yan, Dubing Chen, Hongbo Lu, Wenlong Liao, Tao He, Pai Peng, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学协同创新研究院物联网国家重点实验室) Shanghai Jiao Tong University(上海交通大学) COWARobot Co. Ltd.(COWARobot有限公司)

专题命中 安全评测 :alignment(title);分类 cs.CL

AI总结 本文提出CogAlign框架,通过构建层次化临床认知数据集和监督微调提升模型临床分析能力,并采用反事实强化学习消除视觉偏差,实现胃肠诊断的因果关联与高准确率。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30291 2026-06-30 cs.AI 74%

PromptGNN-sim: Deep Fusion and Alignment of GNN and LLMs for Text-Attributed Graph Learning

PromptGNN-sim:GNN与LLM的深度融合与对齐用于文本属性图学习

Zhifei Hu, Alexandra I. Cristea

机构 * Durham University(杜伦大学)

专题命中 安全评测 :alignment(title);分类 cs.AI

AI总结 提出PromptGNN-sim框架,通过双向结构-语义融合、图注意力网络与LLM协同,解决文本属性图中模态交互浅层化问题,在跨任务、跨数据集和稀疏扰动下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11229 2026-06-29 stat.ML cs.LG 版本更新 74%

Trustworthy Predictive Distributions for Tail Events with Semiparametric Diagnostic Transport Maps

面向尾部事件的可信预测分布:基于半参数诊断传输图

Elizabeth Cucuzzella, Rafael Izbicki, Ann B. Lee

机构 * Department of Statistics and Data Science, Carnegie Mellon University(统计与数据科学系,卡内基梅隆大学) Department of Statistics, Federal University of Sao Carlos(统计系,圣卡洛斯联邦大学)

专题命中 安全评测 :trustworthy(title);分类 cs.LG

AI总结 针对预测分布在尾部事件中局部校准不足的问题,提出半参数局部摊销诊断与重塑(LADaR)框架,通过非参数回归构建诊断传输图,校正尾部概率,生成可解释且鲁棒的预测分布,在热带气旋强度预测中验证有效性。

Comments 29 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25161 2026-06-25 cs.AI 新提交 74%

TRUSTMEM: Learning Trustworthy Memory Consolidation for LLM Agents with Long-Term Memory

TRUSTMEM:学习具有长期记忆的LLM智能体的可信记忆巩固

Tianyu Yang, Sudipta Paul, Vijay Srinivasan, Vivek Kulkarni, Srinivas Chappidi

机构 * AI Center-Mountain View, Samsung Electronics(三星电子山景城AI中心) University of Notre Dame(圣母大学)

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 提出TrustMem框架,通过记忆转换验证器评估更新过程,并利用偏好强化学习优化记忆更新行为,显著提升记忆效用和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23768 2026-06-24 cs.CR cs.AI cs.LO 新提交 74%

Cryptographic certificates of validity for trustworthy AI

可信AI的密码学有效性证书

Murdoch J. Gabbay

机构 * Heriot-Watt University(赫瑞思-瓦特大学)

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 提出为智能AI系统生成密码学有效性证书,通过将正确性条件编译为多项式约束的见证检查问题,并使用简洁密码学证明系统(可选零知识)来证明条件成立,平衡了源代码形式验证与密码学认证。

详情

展开后加载摘要…

URL PDF HTML 收藏