arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9331 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9331 篇

2502.04103 2025-02-14 cs.HC cs.AI cs.SE 70%

VTutor: An Open-Source SDK for Generative AI-Powered Animated Pedagogical Agents with Multi-Media Output

Eason Chen, Chenyu Lin, Xinyi Tang, Aprille Xi, Canwen Wang, Jionghao Lin, Kenneth R Koedinger

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02619 2025-02-04 cs.CR cs.LG 70%

Unelicitable Backdoors in Language Models via Cryptographic Transformer Circuits

Andis Draguns, Andrew Gritsevskiy, Sumeet Ramesh Motwani, Charlie Rogers-Smith, Jeffrey Ladish, Christian Schroeder de Witt

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.LG

Comments 19 pages, 7 figures

Journal ref 38th Conference on Neural Information Processing Systems (NeurIPS 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01818 2025-01-06 cs.CR cs.LG 70%

Rerouting LLM Routers

Avital Shafran, Roei Schuster, Thomas Ristenpart, Vitaly Shmatikov

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16087 2024-12-25 math.OC cs.LG 70%

Unlocking Global Optimality in Bilevel Optimization: A Pilot Study

Quan Xiao, Tianyi Chen

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17011 2024-12-24 cs.CL 70%

Robustness of Large Language Models Against Adversarial Attacks

Yiyi Tao, Yixian Shen, Hang Zhang, Yanxin Shen, Lun Wang, Chuanqi Shi, Shaoshuai Du

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13238 2024-12-20 cs.AI cs.ET cs.RO 70%

SafeDrive: Knowledge- and Data-Driven Risk-Sensitive Decision-Making for Autonomous Vehicles with Large Language Models

Zhiyuan Zhou, Heye Huang, Boqi Li, Shiyue Zhao, Yao Mu, Jianqiang Wang

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07278 2024-12-11 cs.AI cs.IT math.IT 70%

Superficial Consciousness Hypothesis for Autoregressive Transformers

Yosuke Miyanishi, Keita Mitani

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

Comments Accepted to PSS Workshop at AAAI25

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01020 2024-12-03 cs.DC cs.AI 70%

AI Benchmarks and Datasets for LLM Evaluation

Todor Ivanov, Valeri Penchev

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

Comments November 2024 v1.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10313 2024-11-26 cs.AI cs.CL cs.CY cs.LG 70%

How Far Are We From AGI: Are LLMs All We Need?

Tao Feng, Chuanyang Jin, Jingyu Liu, Kunlun Zhu, Haoqin Tu, Zirui Cheng, Guanyu Lin, Jiaxuan You

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11072 2024-11-20 cs.CL 70%

Multilingual Large Language Models: A Systematic Survey

Shaolin Zhu, Supryadi, Shaoyang Xu, Haoran Sun, Leiyu Pan, Menglong Cui, Jiangcun Du, Renren Jin, António Branco, Deyi Xiong

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09017 2024-11-06 cs.CL 70%

AraTrust: An Evaluation of Trustworthiness for LLMs in Arabic

Emad A. Alghamdi, Reem I. Masoud, Deema Alnuhait, Afnan Y. Alomairi, Ahmed Ashraf, Mohamed Zaytoon

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22932 2024-11-04 cs.CL 70%

Multi-Agent Large Language Models for Conversational Task-Solving

Jonas Becker

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15589 2024-11-04 cs.LG cs.CR 70%

Efficient Adversarial Training in LLMs with Continuous Attacks

Sophie Xhonneux, Alessandro Sordoni, Stephan Günnemann, Gauthier Gidel, Leo Schwinn

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22153 2024-10-30 cs.CL 70%

Benchmarking LLM Guardrails in Handling Multilingual Toxicity

Yahan Yang, Soham Dan, Dan Roth, Insup Lee

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08725 2024-10-14 cs.CV cs.AI cs.RO 70%

MetaUrban: An Embodied AI Simulation Platform for Urban Micromobility

Wayne Wu, Honglin He, Jack He, Yiran Wang, Chenda Duan, Zhizheng Liu, Quanyi Li, Bolei Zhou

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

Comments Technical report. Project page: https://metadriverse.github.io/metaurban/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06400 2024-10-10 eess.SP cs.LG 70%

Reliable Heading Tracking for Pedestrian Road Crossing Prediction Using Commodity Devices

Yucheng Yang, Jingjie Li, Kassem Fawaz

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05561 2024-10-01 cs.CL 70%

TrustLLM: Trustworthiness in Large Language Models

Yue Huang, Lichao Sun, Haoran Wang, Siyuan Wu, Qihui Zhang, Yuan Li, Chujie Gao, Yixin Huang, Wenhan Lyu, Yixuan Zhang, Xiner Li, Zhengliang Liu, Yixin Liu, Yijue Wang, Zhikun Zhang, Bertie Vidgen, Bhavya Kailkhura, Caiming Xiong, Chaowei Xiao, Chunyuan Li, Eric Xing, Furong Huang, Hao Liu, Heng Ji, Hongyi Wang, Huan Zhang, Huaxiu Yao, Manolis Kellis, Marinka Zitnik, Meng Jiang, Mohit Bansal, James Zou, Jian Pei, Jian Liu, Jianfeng Gao, Jiawei Han, Jieyu Zhao, Jiliang Tang, Jindong Wang, Joaquin Vanschoren, John Mitchell, Kai Shu, Kaidi Xu, Kai-Wei Chang, Lifang He, Lifu Huang, Michael Backes, Neil Zhenqiang Gong, Philip S. Yu, Pin-Yu Chen, Quanquan Gu, Ran Xu, Rex Ying, Shuiwang Ji, Suman Jana, Tianlong Chen, Tianming Liu, Tianyi Zhou, William Wang, Xiang Li, Xiangliang Zhang, Xiao Wang, Xing Xie, Xun Chen, Xuyu Wang, Yan Liu, Yanfang Ye, Yinzhi Cao, Yong Chen, Yue Zhao

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL

Comments This work is still under work and we welcome your contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04465 2024-09-10 cs.AI 70%

Here's Charlie! Realising the Semantic Web vision of Agents in the age of LLMs

Jesse Wright

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

Comments The 23rd International Semantic Web Conference, November 11--15, 2024, Hanover, MD - Posters and Demos track

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03759 2024-09-09 cs.IR cs.AI 70%

VERA: Validation and Evaluation of Retrieval-Augmented Systems

Tianyu Ding, Adi Banerjee, Laurent Mombaerts, Yunhong Li, Tarik Borogovac, Juan Pablo De la Cruz Weinstein

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

Comments Accepted in Workshop on Evaluation and Trustworthiness of Generative AI Models, KDD 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02565 2024-08-06 cs.CY 70%

Reasons to Doubt the Impact of AI Risk Evaluations

Gabriel Mukobi

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CY

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10254 2024-07-30 cs.CR cs.AI cs.CL cs.CY cs.LG 70%

LLM Platform Security: Applying a Systematic Evaluation Framework to OpenAI's ChatGPT Plugins

Umar Iqbal, Tadayoshi Kohno, Franziska Roesner

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments To appear in the proceedings of the 7th AAAI / ACM Conference on AI, Ethics, and Society (AIES), October 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15862 2024-07-24 cs.LG cs.AI cs.CL cs.CY 70%

Performance Evaluation of Lightweight Open-source Large Language Models in Pediatric Consultations: A Comparative Analysis

Qiuhong Wei, Ying Cui, Mengwei Ding, Yanqin Wang, Lingling Xiang, Zhengxiong Yao, Ceran Chen, Ying Long, Zhezhen Jin, Ximing Xu

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 27 pages in total with 17 pages of main manuscript and 10 pages of supplementary materials; 4 figures in the main manuscript and 2 figures in supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02395 2024-07-08 cs.SE cs.CL 70%

Is Your AI-Generated Code Really Safe? Evaluating Large Language Models on Secure Code Generation with CodeSecEval

Jiexin Wang, Xitong Luo, Liuwen Cao, Hongkui He, Hailin Huang, Jiayuan Xie, Adam Jatowt, Yi Cai

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL

Comments arXiv admin note: text overlap with arXiv:2310.16263

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11873 2024-06-19 cs.AI 70%

Logic-Based Explainability: Past, Present & Future

Joao Marques-Silva

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10091 2024-06-07 cs.AI 70%

Multi-Agent Reinforcement Learning: Methods, Applications, Visionary Prospects, and Challenges

Ziyuan Zhou, Guanjun Liu, Ying Tang

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

Comments 43 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00018 2024-06-04 cs.CL cs.IR 70%

Large Language Models' Detection of Political Orientation in Newspapers

Alessio Buscemi, Daniele Proverbio

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08317 2024-05-15 cs.CL cs.SD eess.AS 70%

SpeechGuard: Exploring the Adversarial Robustness of Multimodal Large Language Models

Raghuveer Peri, Sai Muralidhar Jayanthi, Srikanth Ronanki, Anshu Bhatia, Karel Mundnich, Saket Dingliwal, Nilaksh Das, Zejiang Hou, Goeric Huybrechts, Srikanth Vishnubhotla, Daniel Garcia-Romero, Sundararajan Srinivasan, Kyu J Han, Katrin Kirchhoff

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL

Comments 9+6 pages, Submitted to ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13161 2024-04-23 cs.CR cs.LG 70%

CyberSecEval 2: A Wide-Ranging Cybersecurity Evaluation Suite for Large Language Models

Manish Bhatt, Sahana Chennabasappa, Yue Li, Cyrus Nikolaidis, Daniel Song, Shengye Wan, Faizan Ahmad, Cornelius Aschermann, Yaohui Chen, Dhaval Kapil, David Molnar, Spencer Whitman, Joshua Saxe

专题命中 安全评测 :safety(abstract);prompt injection(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10354 2024-04-17 q-bio.QM cs.CE cs.LG 70%

Physical formula enhanced multi-task learning for pharmacokinetics prediction

Ruifeng Li, Dongzhan Zhou, Ancheng Shen, Ao Zhang, Mao Su, Mingqian Li, Hongyang Chen, Gang Chen, Yin Zhang, Shufei Zhang, Yuqiang Li, Wanli Ouyang

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14988 2024-03-25 cs.CL 70%

Risk and Response in Large Language Models: Evaluating Key Threat Categories

Bahareh Harandizadeh, Abel Salinas, Fred Morstatter

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL

Comments 19 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏