arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9248 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9248 篇

2603.13292 2026-03-17 cs.LG cs.AI 84%

Pragma-VL: Towards a Pragmatic Arbitration of Safety and Helpfulness in MLLMs

Pragma-VL:迈向多模态大语言模型中安全与助人的务实仲裁

Ming Wen, Kun Yang, Xin Chen, Jingyu Zhang, Dingding Han, Shiwen Cui, Yuedong Xu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Ant Group(蚂蚁集团) Zhejiang University(浙江大学) UCLA(加州大学洛杉矶分校) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 Pragma-VL通过引入一种端到端的对齐算法,解决了多模态大语言模型在安全与助人之间的平衡问题,通过增强视觉风险感知和理论保证的奖励模型,在多数多模态安全基准上提升了性能。

Comments 31 pages, ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08275 2026-03-10 cs.CL cs.AI 84%

AdaCultureSafe: Adaptive Cultural Safety Grounded by Cultural Knowledge in Large Language Models

AdaCultureSafe: 基于文化知识的自适应文化安全大语言模型

Hankun Kang, Di Lin, Zhirong Liao, Pengfei Bai, Xinyi Zeng, Jiawei Jiang, Yuanyuan Zhu, Tieyun Qian

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 AdaCultureSafe通过整合文化知识与大语言模型,提升文化安全性和响应生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06485 2026-03-09 cs.CL cs.AI 84%

PONTE: Personalized Orchestration for Natural Language Trustworthy Explanations

PONTE:面向自然语言可信解释的个性化编排

Vittoria Vineis, Matteo Silvestri, Lorenzo Antonelli, Filippo Betello, Gabriele Tolomei

机构 * Sapienza University of Rome(罗马大学萨皮恩扎) Syllotips TellmewAI s.r.l.(TellmewAI公司)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 PONTE通过闭环验证和适应过程,实现自然语言可信解释的个性化生成,提升XAI的完整性和风格对齐性。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02482 2026-03-04 cs.LG cs.CL cs.CV cs.SD eess.AS 84%

MUSE: A Run-Centric Platform for Multimodal Unified Safety Evaluation of Large Language Models

MUSE:一种面向多模态统一安全评估的运行导向平台

Zhongxi Wang, Yueqian Lin, Jingyang Zhang, Hai Helen Li, Yiran Chen

机构 * Duke University(杜克大学) Virtue AI

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.LG

AI总结 MUSE提出一种多模态统一安全评估平台,通过多轮攻击和跨轮模态切换技术,评估大型语言模型在不同模态下的安全性能。

Comments Submitted to ACL 2026 System Demonstration Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07680 2026-02-19 cs.CV cs.AI cs.LG cs.RO 84%

Vision and Language: Novel Representations and Artificial intelligence for Driving Scene Safety Assessment and Autonomous Vehicle Planning

视觉与语言:新颖的表示方法和人工智能用于驾驶场景安全评估与自动驾驶规划

Ross Greer, Maitrayee Keskar, Angel Martinez-Sanchez, Parthib Roy, Shashank Shriram, Mohan Trivedi

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了视觉-语言表示在自动驾驶安全评估和规划中的应用,提出轻量级危险检测、轨迹规划框架整合及自然语言约束方法,强调表示-任务对齐的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08449 2026-02-17 cs.AI cs.CR cs.LG 84%

When Evaluation Becomes a Side Channel: Regime Leakage and Structural Mitigations for Alignment Assessment

当评估成为侧信道:对齐评估中的制度泄漏与结构缓解

Igor Santos-Grueiro

机构 * International University of La Rioja(拉里奥ja国际大学)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 研究提出通过制度盲机制减少制度条件下的失败,但无法完全消除策略风险,需结合白盒诊断评估制度意识。

Comments Added results for Llama and new cross model analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12092 2026-02-13 cs.CL cs.AI cs.CR cs.CV 84%

DeepSight: An All-in-One LM Safety Toolkit

DeepSight: 一个全方位的大型模型安全工具包

Bo Zhang, Jiaxuan Guo, Lijun Li, Dongrui Liu, Sujin Chen, Guanxu Chen, Zhijie Zheng, Qihao Lin, Lewen Yan, Chen Qian, Yijin Zhou, Yuyao Wu, Shaoxiong Guo, Tianyi Du, Jingyi Yang, Xuhao Hu, Ziqi Miao, Xiaoya Lu, Jing Shao, Xia Hu

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 DeepSight是一个开源工具包,旨在通过整合安全评估与诊断,提升大型模型的安全性与可解释性。

Comments Technical report, 29 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11444 2026-02-13 cs.CL cs.AI 84%

Towards Reliable Machine Translation: Scaling LLMs for Critical Error Detection and Safety

迈向可靠的机器翻译:扩展LLMs以检测关键错误和安全

Muskaan Chopra, Lorenz Sparrenberg, Rafet Sifa

机构 * Rheinische Friedrich-Wilhelms-Universität Bonn, Bonn, Germany(莱茵-威斯巴登大学波恩分校) Fraunhofer IAIS, Sankt Augustin, Germany(弗劳恩霍夫人工智能研究所) Lamarr Institute for Machine Learning(拉马尔人工智能与机器学习研究所)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文通过扩展LLMs检测关键错误,提升机器翻译的安全性和可靠性,减少虚假信息和语言伤害风险。

Comments Accepted at ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05980 2026-02-03 cs.CL cs.LG 84%

Lost in Localization: Building RabakBench with Human-in-the-Loop Validation to Measure Multilingual Safety Gaps

迷失于定位:通过人类在环验证构建RabakBench以衡量多语言安全差距

Gabriel Chua, Leanne Tan, Ziyu Ge, Roy Ka-Wei Lee

机构 * GovTech, Singapore(新加坡政府科技局) Singapore University of Technology and Design(新加坡科技与设计大学)

专题命中 安全评测 :safety(title,abstract);red teaming(abstract);分类 cs.CL、cs.LG

AI总结 RabakBench通过人类在环验证构建,用于衡量多语言安全差距,通过三阶段流程生成、标注和翻译数据,评估LLM在低资源语言中的安全性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17520 2026-01-28 cs.LG cs.CL 84%

MobileSafetyBench: Evaluating Safety of Autonomous Agents in Mobile Device Control

MobileSafetyBench: 评估移动设备控制自主代理的安全性

Juyong Lee, Dongyoon Hahm, June Suk Choi, W. Bradley Knox, Kimin Lee

专题命中 安全评测 :safety(title,abstract);prompt injection(abstract);分类 cs.CL、cs.LG

AI总结 MobileSafetyBench通过Android模拟器评估移动设备控制自主代理的安全性,揭示基于LLMs的代理在安全任务中存在缺陷,提出提示方法提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08843 2026-01-15 cs.CL cs.LG 84%

Rubric-Conditioned LLM Grading: Alignment, Uncertainty, and Robustness

基于评分标准的LLM评分:对齐、不确定性与鲁棒性

Haotian Deng, Chris Farber, Jiyoon Lee, David Tang

机构 * Purdue University(普渡大学)

专题命中 安全评测 :alignment(title,abstract);prompt injection(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了基于评分标准的LLM评分的对齐性、不确定性与鲁棒性,发现评分标准粒度增加时对齐性下降,通过信任曲线分析发现过滤低置信度预测可提升准确性,同时模型对同义词替换敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11590 2025-11-19 cs.CY cs.AI cs.HC 84%

Embedding Explainable AI in NHS Clinical Safety: The Explainability-Enabled Clinical Safety Framework (ECSF)

Robert Gigiu

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.CY

Comments 33 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12659 2025-11-18 cs.CY cs.AI 84%

The Hidden Risks of Large Reasoning Models: A Safety Assessment of R1

Kaiwen Zhou, Chengzhi Liu, Xuandong Zhao, Shreedhar Jangam, Jayanth Srinivasa, Gaowen Liu, Dawn Song, Xin Eric Wang

机构 * UC Santa Cruz(加州大学圣克ruz分校) UC Santa Barbara(加州大学圣芭芭拉分校) UC Berkeley(加州大学伯克利分校) Cisco Research(思科研究)

专题命中 安全评测 :safety(title,abstract);prompt injection(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12814 2025-10-21 cs.CL cs.AI 84%

PsyMem: Fine-grained psychological alignment and Explicit Memory Control for Advanced Role-Playing LLMs

Xilong Cheng, Yunxiao Qin, Yuting Tan, Zhengnan Li, Ye Wang, Hongjiang Xiao, Yuan Zhang

机构 * Communication University of China(中国传媒大学) State Key Laboratory of Media Convergence and Communication(媒体融合与传播国家重点实验室)

专题命中 安全评测 :alignment(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI

Comments Pre-MIT Press publication version, has been accepted by TACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12133 2025-10-15 cs.CL cs.AI 84%

SafeMT: Multi-turn Safety for Multimodal Language Models

Han Zhu, Juntao Dai, Jiaming Ji, Haoran Li, Chengkun Cai, Pengcheng Wen, Chi-Min Chan, Boyuan Chen, Yaodong Yang, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港理工大学) Peking University(北京大学) University of Edinburgh(爱丁堡大学)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04320 2025-10-07 cs.CL cs.LG 84%

Read the Scene, Not the Script: Outcome-Aware Safety for LLMs

Rui Wu, Yihao Quan, Zeru Shi, Zhenting Wang, Yanshu Li, Ruixiang Tang

机构 * Rutgers University(新泽西罗格斯大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16332 2025-09-23 cs.AI cs.CL 84%

Psychometric Personality Shaping Modulates Capabilities and Safety in Language Models

Stephen Fitz, Peter Romero, Steven Basart, Sipeng Chen, Jose Hernandez-Orallo

机构 * Keio University(keio大学) Universitat Politècnica de València(巴塞罗那理工大学) Center for AI Safety(人工智能安全中心) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18325 2025-09-18 cs.AI cs.LG 84%

Understanding and Mitigating Overrefusal in LLMs from an Unveiling Perspective of Safety Decision Boundary

Licheng Pan, Yongqi Tong, Xin Zhang, Xiaolu Zhang, Jun Zhou, Zhixuan Chu

机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院) Language and Machine Intelligence Department, Ant Group(蚂蚁集团语言与机器智能部门)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17450 2025-09-10 cs.CL cs.CY 84%

Persuasion Dynamics in LLMs: Investigating Robustness and Adaptability in Knowledge and Safety with DuET-PD

Bryan Chen Zhengyu Tan, Daniel Wai Kit Chin, Zhengyuan Liu, Nancy F. Chen, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design (SUTD)(新加坡科技设计大学) Institute for Infocomm Research (I2R), A*STAR, Singapore(信息通信研究院)

专题命中 安全评测 :safety(title,abstract);DPO(abstract);分类 cs.CL、cs.CY

Comments To appear at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12733 2025-08-28 cs.CL cs.AI 84%

LinguaSafe: A Comprehensive Multilingual Safety Benchmark for Large Language Models

Zhiyuan Ning, Tianle Gu, Jiaxin Song, Shixin Hong, Lingyu Li, Huacan Liu, Jie Li, Yixu Wang, Meng Lingyu, Yan Teng, Yingchun Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

Comments 7pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21169 2025-07-30 cs.CY cs.AI 84%

Trustworthy AI: UK Air Traffic Control Revisited

Rob Procter, Mark Rouncefield

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI、cs.CY

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09347 2025-07-10 cs.CL cs.AI 84%

Safer or Luckier? LLMs as Safety Evaluators Are Not Robust to Artifacts

Hongyu Chen, Seraphina Goldfarb-Tarrant

机构 * Cohere

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

Comments 9 pages, ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17620 2025-06-24 cs.LG cs.CY 84%

Trustworthy Chronic Disease Risk Prediction For Self-Directed Preventive Care via Medical Literature Validation

Minh Le, Khoi Ton

机构 * Georgia Institute of Technology(佐治亚理工学院) University of South Florida(佛罗里达州立大学)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15481 2025-06-12 cs.AI cs.CL 84%

Code-Switching Red-Teaming: LLM Evaluation for Safety and Multilingual Understanding

Haneul Yoo, Yongjin Yang, Hwaran Lee

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

Comments To appear in ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01252 2025-06-03 cs.CL cs.AI 84%

MTCMB: A Multi-Task Benchmark Framework for Evaluating LLMs on Knowledge, Reasoning, and Safety in Traditional Chinese Medicine

Shufeng Kong, Xingru Yang, Yuanyuan Wei, Zijie Wang, Hao Tang, Jiuqi Qin, Shuting Lan, Yingheng Wang, Junwen Bai, Zhuangbin Chen, Zibin Zheng, Caihua Liu, Hao Liang

机构 * School of Software Engineering, Sun Yat-sen University(中山大学软件学院) Institute of TCM Diagnostics, Hunan University of Chinese Medicine(湖南中医药大学中医诊断研究所) School of Artificial Intelligence, Guilin University of Electronic Technology(桂林电子科技大学人工智能学院) Department of Computer Science, Cornell University(康奈尔大学计算机科学系)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19939 2025-05-20 cs.CR cs.AI cs.CL cs.CV 84%

VLSBench: Unveiling Visual Leakage in Multimodal Safety

Xuhao Hu, Dongrui Liu, Hao Li, Xuanjing Huang, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Beihang University(北京航空航天大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

Comments ACL2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14827 2025-03-20 cs.CL cs.AI cs.CR 84%

MMDT: Decoding the Trustworthiness and Safety of Multimodal Foundation Models

Chejian Xu, Jiawei Zhang, Zhaorun Chen, Chulin Xie, Mintong Kang, Yujin Potter, Zhun Wang, Zhuowen Yuan, Alexander Xiong, Zidi Xiong, Chenhui Zhang, Lingzhi Yuan, Yi Zeng, Peiyang Xu, Chengquan Guo, Andy Zhou, Jeffrey Ziwei Tan, Xuandong Zhao, Francesco Pinto, Zhen Xiang, Yu Gai, Zinan Lin, Dan Hendrycks, Bo Li, Dawn Song

专题命中 安全评测 :safety(title,abstract);red teaming(abstract);分类 cs.CL、cs.AI

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00020 2025-03-04 cs.CL cs.AI cs.CV 84%

A Systematic Review of Open Datasets Used in Text-to-Image (T2I) Gen AI Model Safety

Rakeen Rouf, Trupti Bavalatti, Osama Ahmed, Dhaval Potdar, Faraz Jawed

专题命中 安全评测 :safety(title,abstract);AI safety(abstract);分类 cs.CL、cs.AI

Comments Accepted for publication in IEEE Access, DOI: 10.1109/ACCESS.2025.3539933

Journal ref IEEE Access 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09673 2025-02-24 cs.CL cs.AI 84%

Are Smarter LLMs Safer? Exploring Safety-Reasoning Trade-offs in Prompting and Fine-Tuning

Ang Li, Yichuan Mo, Mingjie Li, Yifei Wang, Yisen Wang

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06872 2025-02-12 cs.CL cs.AI 84%

Towards Trustworthy Retrieval Augmented Generation for Large Language Models: A Survey

Bo Ni, Zheyuan Liu, Leyao Wang, Yongjia Lei, Yuying Zhao, Xueqi Cheng, Qingkai Zeng, Luna Dong, Yinglong Xia, Krishnaram Kenthapadi, Ryan Rossi, Franck Dernoncourt, Md Mehrab Tanjim, Nesreen Ahmed, Xiaorui Liu, Wenqi Fan, Erik Blasch, Yu Wang, Meng Jiang, Tyler Derr

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏