arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9311 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9311 篇

2412.08862 2024-12-13 cs.SE cs.AI 79%

Key Safety Design Overview in AI-driven Autonomous Vehicles

Vikas Vyas, Zheyuan Xu

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08639 2024-12-12 cs.CL cs.CV 79%

Fast Prompt Alignment for Text-to-Image Generation

Khalil Mrini, Hanlin Lu, Linjie Yang, Weilin Huang, Heng Wang

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments TikTok Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04661 2024-12-09 cs.IR cs.AI 79%

HEAL: Hierarchical Embedding Alignment Loss for Improved Retrieval and Representation Learning

Manish Bhattarai, Ryan Barron, Maksim Eren, Minh Vu, Vesselin Grantcharov, Ismael Boureima, Valentin Stanev, Cynthia Matuszek, Vladimir Valtchinov, Kim Rasmussen, Boian Alexandrov

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08981 2024-11-15 cs.AI cs.SY eess.SY 79%

Reliability, Resilience and Human Factors Engineering for Trustworthy AI Systems

Saurabh Mishra, Anand Rao, Ramayya Krishnan, Bilal Ayyub, Amin Aria, Enrico Zio

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08320 2024-11-14 cs.AI 79%

Responsible AI in Construction Safety: Systematic Evaluation of Large Language Models and Prompt Engineering

Farouq Sammour, Jia Xu, Xi Wang, Mo Hu, Zhenyu Zhang

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

Comments 29 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19361 2024-11-07 cs.AI 79%

Engineering Trustworthy AI: A Developer Guide for Empirical Risk Minimization

Diana Pfau, Alexander Jung

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17032 2024-10-23 cs.AI 79%

Insights on Disagreement Patterns in Multimodal Safety Perception across Diverse Rater Groups

Charvi Rastogi, Tian Huey Teh, Pushkar Mishra, Roma Patel, Zoe Ashwood, Aida Mostafazadeh Davani, Mark Diaz, Michela Paganini, Alicia Parrish, Ding Wang, Vinodkumar Prabhakaran, Lora Aroyo, Verena Rieser

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11773 2024-10-21 cs.IR cs.AI 79%

Behavior Alignment: A New Perspective of Evaluating LLM-based Conversational Recommender Systems

Dayu Yang, Fumian Chen, Hui Fang

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

Comments Accepted by the 47th International ACM SIGIR Conference on Research and Development in Information Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12971 2024-10-18 cs.CL 79%

Self-Pluralising Culture Alignment for Large Language Models

Shaoyang Xu, Yongqi Leng, Linhao Yu, Deyi Xiong

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments Implementation for the paper: https://github.com/shaoyangxu/CultureSPA

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07167 2024-10-17 cs.CV cs.CL 79%

Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate

Qidong Huang, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Jiaqi Wang, Dahua Lin, Weiming Zhang, Nenghai Yu

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments Project page: https://github.com/shikiw/Modality-Integration-Rate

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11114 2024-10-16 cs.CL 79%

Active Learning for Robust and Representative LLM Generation in Safety-Critical Scenarios

Sabit Hassan, Anthony Sicilia, Malihe Alikhani

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04965 2024-10-15 cs.CL 79%

Beyond Perplexity: Multi-dimensional Safety Evaluation of LLM Compression

Zhichao Xu, Ashim Gupta, Tao Li, Oliver Bentham, Vivek Srikumar

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

Comments Findings of EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07239 2024-10-11 cs.CL 79%

Locally Measuring Cross-lingual Lexical Alignment: A Domain and Word Level Perspective

Taelin Karidi, Eitan Grossman, Omri Abend

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03744 2024-10-11 cs.AI 79%

MedSafetyBench: Evaluating and Improving the Medical Safety of Large Language Models

Tessa Han, Aounon Kumar, Chirag Agarwal, Himabindu Lakkaraju

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05349 2024-10-10 cs.CR cs.AI 79%

SoK: Towards Security and Safety of Edge AI

Tatjana Wingarz, Anne Lauscher, Janick Edinger, Dominik Kaaser, Stefan Schulte, Mathias Fischer

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03304 2024-10-07 cs.CL 79%

Learning Personalized Alignment for Evaluating Open-ended Text Generation

Danqing Wang, Kevin Yang, Hanlin Zhu, Xiaomeng Yang, Andrew Cohen, Lei Li, Yuandong Tian

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12168 2024-10-04 cs.CL 79%

FIRST: Teach A Reliable Large Language Model Through Efficient Trustworthy Distillation

KaShun Shum, Minrui Xu, Jianshu Zhang, Zixin Chen, Shizhe Diao, Hanze Dong, Jipeng Zhang, Muhammad Omer Raza

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17233 2024-10-04 cs.SE cs.CL 79%

Self-Constructed Context Decompilation with Fined-grained Alignment Enhancement

Yunlong Feng, Dechuan Teng, Yang Xu, Honglin Mu, Xiao Xu, Libo Qin, Qingfu Zhu, Wanxiang Che

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.12903 2024-09-20 cs.NI cs.AI 79%

Towards Bridging the FL Performance-Explainability Trade-Off: A Trustworthy 6G RAN Slicing Use-Case

Swastika Roy, Hatim Chergui, Christos Verikoukis

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

Comments Submitted for possible publication in IEEE. arXiv admin note: text overlap with arXiv:2210.10147

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00710 2024-09-18 cs.HC cs.AI 79%

Interactive AI Alignment: Specification, Process, and Evaluation Alignment

Michael Terry, Chinmay Kulkarni, Martin Wattenberg, Lucas Dixon, Meredith Ringel Morris

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00935 2024-09-04 cs.CL 79%

Self-Judge: Selective Instruction Following with Alignment Self-Evaluation

Hai Ye, Hwee Tou Ng

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09798 2024-08-20 cs.LG 79%

Enhance Modality Robustness in Text-Centric Multimodal Alignment with Adversarial Prompting

Yun-Da Tsai, Ting-Yu Yen, Keng-Te Liao, Shou-De Lin

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

Comments arXiv admin note: text overlap with arXiv:2407.05036

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07094 2024-08-15 cs.LG stat.ML 79%

Overcoming Imbalanced Safety Data Using Extended Accident Triangle

Kailai Sun, Tianxiang Lan, Yang Miang Goh, Yueng-Hsiang Huang

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17075 2024-08-14 cs.CL 79%

SAFETY-J: Evaluating Safety with Critique

Yixiu Liu, Yuxiang Zheng, Shijie Xia, Jiajun Li, Yi Tu, Chaoling Song, Pengfei Liu

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17673 2024-07-31 cs.CV cs.AI cs.RO 79%

CRASAR-U-DROIDs: A Large Scale Benchmark Dataset for Building Alignment and Damage Assessment in Georectified sUAS Imagery

Thomas Manzini, Priyankari Perali, Raisa Karnik, Robin Murphy

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

Comments 16 Pages, 7 Figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16808 2024-07-12 cs.AI 79%

Navigating the EU AI Act: A Methodological Approach to Compliance for Safety-critical Products

J. Kelly, S. Zafar, L. Heidemann, J. Zacchi, D. Espinoza, N. Mata

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

Comments To be published in: 2024 IEEE Conference on Artificial Intelligence (CAI 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18871 2024-06-28 eess.AS cs.CL 79%

DeSTA: Enhancing Speech Language Models through Descriptive Speech-Text Alignment

Ke-Han Lu, Zhehuai Chen, Szu-Wei Fu, He Huang, Boris Ginsburg, Yu-Chiang Frank Wang, Hung-yi Lee

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments Accepted to Interspeech 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17957 2024-06-27 cs.SD cs.AI eess.AS 79%

Improving Robustness of LLM-based Speech Synthesis by Learning Monotonic Alignment

Paarth Neekhara, Shehzeen Hussain, Subhankar Ghosh, Jason Li, Rafael Valle, Rohan Badlani, Boris Ginsburg

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

Comments Published as a conference paper at INTERSPEECH 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.07045 2024-06-25 cs.CL 79%

SafetyBench: Evaluating the Safety of Large Language Models

Zhexin Zhang, Leqi Lei, Lindong Wu, Rui Sun, Yongkang Huang, Chong Long, Xiao Liu, Xuanyu Lei, Jie Tang, Minlie Huang

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

Comments ACL 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10117 2024-06-17 cs.LG 79%

Trustworthy Artificial Intelligence in the Context of Metrology

Tameem Adel, Sam Bilson, Mark Levene, Andrew Thompson

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

Journal ref In Producing Artificial Intelligent Systems: The roles of Benchmarking, Standardisation and Certification, Studies in Computational Intelligence, edited by M. I. A. Ferreira, 2024, Springer

详情

展开后加载摘要…

URL PDF HTML 收藏