arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9248 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9248 篇

2506.14922 2025-06-26 cs.CY cs.LG 81%

FORTRESS: Frontier Risk Evaluation for National Security and Public Safety

Christina Q. Knight, Kaustubh Deshpande, Ved Sirdeshmukh, Meher Mankikar, Scale Red Team, SEAL Research Team, Julian Michael

机构 * Scale AI

专题命中 安全评测 :safety(title,abstract);分类 cs.CY、cs.LG

Comments 12 pages, 7 figures, submitted to NeurIPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12368 2025-06-18 cs.CL cs.AI 81%

CAPTURE: Context-Aware Prompt Injection Testing and Robustness Enhancement

Gauri Kholkar, Ratinder Ahuja

机构 * First Author Affiliation(第一作者机构) Second Author Affiliation(第二作者机构)

专题命中 安全评测 :prompt injection(title,abstract);分类 cs.CL、cs.AI

Comments Accepted in ACL LLMSec Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10604 2025-06-18 cs.CV cs.AI cs.CL 81%

When language and vision meet road safety: leveraging multimodal large language models for video-based traffic accident analysis

Ruixuan Zhang, Beichen Wang, Juexiao Zhang, Zilin Bian, Chen Feng, Kaan Ozbay

机构 * New York University(纽约大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04951 2025-06-16 cs.CR cs.AI cs.LG 81%

Unsafe LLM-Based Search: Quantitative Analysis and Mitigation of Safety Risks in AI Web Search

Zeren Luo, Zifan Peng, Yule Liu, Zhen Sun, Mingchen Li, Jingyi Zheng, Xinlei He

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07564 2025-06-12 cs.AI cs.CL 81%

SAFEFLOW: A Principled Protocol for Trustworthy and Transactional Autonomous Agent Systems

Peiran Li, Xinkai Zou, Zhuohang Wu, Ruifeng Li, Shuo Xing, Hanwen Zheng, Zhikai Hu, Yuping Wang, Haoxi Li, Qin Yuan, Yingmo Zhang, Zhengzhong Tu

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL、cs.AI

Comments Former versions either contain unrelated content or cannot be properly converted to PDF

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01080 2025-06-09 cs.AI cs.CY 81%

The Coming Crisis of Multi-Agent Misalignment: AI Alignment Must Be a Dynamic and Social Process

Florian Carichon, Aditi Khandelwal, Marylou Fauchard, Golnoosh Farnadi

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.CY

Comments Preprint of NeurIPS 2025 Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10640 2025-06-04 cs.SE cs.AI cs.LG 81%

The Hitchhikers Guide to Production-ready Trustworthy Foundation Model powered Software (FMware)

Kirill Vasilevski, Benjamin Rombaut, Gopi Krishnan Rajbahadur, Gustavo A. Oliva, Keheliya Gallaba, Filipe R. Cogo, Jiahuei Lin, Dayi Lin, Haoxiang Zhang, Bouyan Chen, Kishanthan Thangarajah, Ahmed E. Hassan, Zhen Ming Jiang

机构 * Centre for Software Excellence, Huawei Canada(华为加拿大软件卓越中心) Queen’s University, Canada(加拿大女王大学) York University, Canada(加拿大约克大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10927 2025-06-04 cs.CL cs.AI 81%

OASST-ETC Dataset: Alignment Signals from Eye-tracking Analysis of LLM Responses

Angela Lopez-Cardona, Sebastian Idesis, Miguel Barreda-Ángeles, Sergi Abadal, Ioannis Arapakis

机构 * Telefónica Scientific Research(Telefónica科学研究中心) Universitat Politècnica de Catalunya(巴塞罗那理工大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments This paper has been accepted to ACM ETRA 2025 and published on PACMHCI

Journal ref Proceedings of the ACM on Human-Computer Interaction. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05873 2025-06-03 cs.CL cs.AI 81%

MEXA: Multilingual Evaluation of English-Centric LLMs via Cross-Lingual Alignment

Amir Hossein Kargaran, Ali Modarressi, Nafiseh Nikeghbal, Jana Diesner, François Yvon, Hinrich Schütze

机构 * LMU Munich & Munich Center for Machine Learning(慕尼黑大学及慕尼黑机器学习中心) Technical University of Munich(慕尼黑技术大学) Sorbonne Université & CNRS, ISIR(索邦大学及CNRS,ISIR)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments ACL Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20144 2025-05-27 cs.CL cs.LG 81%

SeMe: Training-Free Language Model Merging via Semantic Alignment

Jian Gu, Aldeida Aleti, Chunyang Chen, Hongyu Zhang

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.LG

Comments an early-stage version

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08085 2025-05-23 cs.CL cs.AI 81%

Can Knowledge Graphs Make Large Language Models More Trustworthy? An Empirical Study Over Open-ended Question Answering

Yuan Sui, Yufei He, Zifeng Ding, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) University of Cambridge(剑桥大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL、cs.AI

Comments This paper has been accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12301 2025-05-20 cs.AI cs.CL 81%

Beyond Single-Point Judgment: Distribution Alignment for LLM-as-a-Judge

Luyu Chen, Zeyu Zhang, Haoran Tan, Quanyu Dai, Hao Yang, Zhenhua Dong, Xu Chen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments 19 pages, 3 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16330 2025-05-20 cs.CL cs.AI 81%

Pruning via Merging: Compressing LLMs via Manifold Alignment Based Layer Merging

Deyuan Liu, Zhanyue Qin, Hairu Wang, Zhao Yang, Zecheng Wang, Fangying Rong, Qingbin Liu, Yanchao Hao, Xi Chen, Cunhang Fan, Zhao Lv, Zhiying Tu, Dianhui Chu, Bo Li, Dianbo Sui

机构 * Harbin Institute of Technology(哈尔滨工业大学) University of Science and Technology of China(中国科学技术大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shandong Agricultural University(山东农业大学) Tencent Inc.(腾讯公司) Anhui University(安徽大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06267 2025-05-13 cs.SE cs.AI cs.LG 81%

AKD : Adversarial Knowledge Distillation For Large Language Models Alignment on Coding tasks

Ilyas Oulkadda, Julien Perez

机构 * Laboratoire de Recherche de l'EPITA (LRE)(EPITA研究实验室) Department of XXX, University of YYY(YYY大学XXX系) School of ZZZ, Institute of WWW(WWW研究所ZZZ学院)

专题命中 安全评测 :alignment(title);safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11137 2025-05-09 cs.CL cs.AI 81%

Safety Evaluation of DeepSeek Models in Chinese Contexts

Wenjing Zhang, Xuejiao Lei, Zhaoxiang Liu, Ning Wang, Zhenhong Long, Peijun Yang, Jiaojiao Zhao, Minjie Hua, Chaoyang Ma, Kai Wang, Shiguo Lian

机构 * Unicom Data Intelligence(中国联通数据智能研究所) Data Science & Artificial Intelligence Research Institute(数据科学与人工智能研究院)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

Comments 12 pages, 2 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06172 2025-04-24 cs.AI cs.CL 81%

Multimodal Situational Safety

Kaiwen Zhou, Chengzhi Liu, Xuandong Zhao, Anderson Compalas, Dawn Song, Xin Eric Wang

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

Comments ICLR 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08863 2025-04-15 cs.CY cs.AI 81%

An Evaluation of Cultural Value Alignment in LLM

Nicholas Sukiennik, Chen Gao, Fengli Xu, Yong Li

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.CY

Comments Submitted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03767 2025-04-14 cs.CR cs.AI cs.LG 81%

MCP Safety Audit: LLMs with the Model Context Protocol Allow Major Security Exploits

Brandon Radosevich, John Halloran

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

Comments 27 pages, 21 figures, and 2 Tables. Cleans up the TeX source

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04473 2025-04-08 cs.CL cs.AI 81%

Directed Graph-alignment Approach for Identification of Gaps in Short Answers

Archana Sahu, Plaban Kumar Bhowmick

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments 30 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21902 2025-03-31 cs.AI cs.CL 81%

OntoAligner: A Comprehensive Modular and Robust Python Toolkit for Ontology Alignment

Hamed Babaei Giglou, Jennifer D'Souza, Oliver Karras, Sören Auer

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments 18 pages, 3 figures. Accepted for the ESWC 2025 Resource Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18762 2025-03-25 cs.LG cs.AI 81%

Mechanistic Interpretability of Fine-Tuned Vision Transformers on Distorted Images: Decoding Attention Head Behavior for Transparent and Trustworthy AI

Nooshin Bahador

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI、cs.LG

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19845 2025-03-25 cs.CR cs.AI cs.CE cs.LG 81%

Enhancing Trust and Safety in Digital Payments: An LLM-Powered Approach

Devendra Dahiphale, Naveen Madiraju, Justin Lin, Rutvik Karve, Monu Agrawal, Anant Modwal, Ramanan Balakrishnan, Shanay Shah, Govind Kaushal, Priya Mandawat, Prakash Hariramani, Arif Merchant

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17777 2025-03-24 cs.AI cs.CV cs.LG eess.SP 81%

Babel: A Scalable Pre-trained Model for Multi-Modal Sensing via Expandable Modality Alignment

Shenghong Dai, Shiqi Jiang, Yifan Yang, Ting Cao, Mo Li, Suman Banerjee, Lili Qiu

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

Comments Accepted by SenSys'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15092 2025-03-20 cs.CR cs.AI cs.CL 81%

Towards Understanding the Safety Boundaries of DeepSeek Models: Evaluation and Findings

Zonghao Ying, Guangyi Zheng, Yongxin Huang, Deyue Zhang, Wenxin Zhang, Quanchen Zou, Aishan Liu, Xianglong Liu, Dacheng Tao

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04610 2025-03-19 cs.LG cs.AI eess.SP stat.OT 81%

Data-Driven Semi-Supervised Machine Learning with Safety Indicators for Abnormal Driving Behavior Detection

Yongqi Dong, Lanxin Zhang, Haneen Farah, Arkady Zgonnikov, Bart van Arem

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

Comments 16 pages, 10 figures, accepted by the 103rd Transportation Research Board (TRB) Annual Meeting, accepted and published by Transportation Research Record: Journal of the Transportation Research Board

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07635 2025-03-12 cs.LG cs.CL cs.CV 81%

Cross-modal Causal Relation Alignment for Video Question Grounding

Weixing Chen, Yang Liu, Binglin Chen, Jiandong Su, Yongsen Zheng, Liang Lin

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.LG

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03523 2025-03-04 cs.LG cs.AI 81%

A Probabilistic Perspective on Unlearning and Alignment for Large Language Models

Yan Scholten, Stephan Günnemann, Leo Schwinn

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

Comments Accepted at ICLR 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00468 2025-02-28 cs.CV cs.AI cs.CL 81%

MMEvalPro: Calibrating Multimodal Benchmarks Towards Trustworthy and Efficient Evaluation

Jinsheng Huang, Liang Chen, Taian Guo, Fu Zeng, Yusheng Zhao, Bohan Wu, Ye Yuan, Haozhe Zhao, Zhihui Guo, Yichi Zhang, Jingyang Yuan, Wei Ju, Luchen Liu, Tianyu Liu, Baobao Chang, Ming Zhang

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL、cs.AI

Comments 18 pages, code released at https://github.com/chenllliang/MMEvalPro, Homepage at https://mmevalpro.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16361 2025-02-26 cs.CY cs.CL cs.CV 81%

A Framework for Evaluating Vision-Language Model Safety: Building Trust in AI for Public Sector Applications

Maisha Binte Rashid, Pablo Rivas

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.CY

Comments AAAI 2025 Workshop on AI for Social Impact: Bridging Innovations in Finance, Social Media, and Crime Prevention

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16971 2025-02-25 cs.CL cs.AI 81%

LongSafety: Evaluating Long-Context Safety of Large Language Models

Yida Lu, Jiale Cheng, Zhexin Zhang, Shiyao Cui, Cunxiang Wang, Xiaotao Gu, Yuxiao Dong, Jie Tang, Hongning Wang, Minlie Huang

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏