arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1824 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 1824 篇

2505.04654 2025-05-09 cs.CL 79%

A Comparative Analysis of Ethical and Safety Gaps in LLMs using Relative Danger Coefficient

Yehor Tereshchenko, Mika Hämäläinen

机构 * Metropolia University of Applied Sciences(梅拉利亚应用科学大学)

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.CL

Journal ref Proceedings of the 5th International Conference on Natural Language Processing for Digital Humanities, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21964 2025-03-31 cs.LG q-bio.NC 79%

NeuroLIP: Interpretable and Fair Cross-Modal Alignment of fMRI and Phenotypic Text

Yanting Yang, Xiaoxiao Li

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18814 2025-03-25 cs.AI 79%

Towards Responsible AI Music: an Investigation of Trustworthy Features for Creative Systems

Jacopo de Berardinis, Lorenzo Porcaro, Albert Meroño-Peñuela, Angelo Cangelosi, Tess Buckley

专题命中 AI治理与伦理 :trustworthy(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13879 2025-03-24 cs.AI 79%

Bridging Social Psychology and LLM Reasoning: Conflict-Aware Meta-Review Generation via Cognitive Alignment

Wei Chen, Han Ding, Meng Yuan, Zhao Zhang, Deqing Wang, Fuzhen Zhuang

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00064 2025-02-20 cs.CV cs.AI 79%

DiffGuard: Text-Based Safety Checker for Diffusion Models

Massine El Khader, Elias Al Bouzidi, Abdellah Oumida, Mohammed Sbaihi, Eliott Binard, Jean-Philippe Poli, Wassila Ouerdane, Boussad Addad, Katarzyna Kapusta

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18551 2024-12-25 cs.CL 79%

Libra-Leaderboard: Towards Responsible AI through a Balanced Leaderboard of Safety and Capability

Haonan Li, Xudong Han, Zenan Zhai, Honglin Mu, Hao Wang, Zhenxuan Zhang, Yilin Geng, Shom Lin, Renxi Wang, Artem Shelmanov, Xiangyu Qi, Yuxia Wang, Donghai Hong, Youliang Yuan, Meng Chen, Haoqin Tu, Fajri Koto, Tatsuki Kuribayashi, Cong Zeng, Rishabh Bhardwaj, Bingchen Zhao, Yawen Duan, Yi Liu, Emad A. Alghamdi, Yaodong Yang, Yinpeng Dong, Soujanya Poria, Pengfei Liu, Zhengzhong Liu, Xuguang Ren, Eduard Hovy, Iryna Gurevych, Preslav Nakov, Monojit Choudhury, Timothy Baldwin

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08133 2024-12-12 cs.RO cs.AI cs.SY eess.SY 79%

Intelligent Electric Power Steering: Artificial Intelligence Integration Enhances Vehicle Safety and Performance

Vikas Vyas, Sneha Sudhir Shetiya

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI

Comments IEEE Summit on Reliability, Availability and Serviceability, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15302 2024-11-19 cs.CL cs.CR 79%

How (un)ethical are instruction-centric responses of LLMs? Unveiling the vulnerabilities of safety guardrails to harmful queries

Somnath Banerjee, Sayan Layek, Rima Hazra, Animesh Mukherjee

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.CL

Comments Accepted at AAAI Conference on Web and Social Media (ICWSM) 2025. [Dataset](https://huggingface.co/datasets/SoftMINER-Group/TechHazardQA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19862 2024-10-29 cs.CV cs.AI 79%

Real-Time Weapon Detection Using YOLOv8 for Enhanced Safety

Ayush Thakur, Akshat Shrivastav, Rohan Sharma, Triyank Kumar, Kabir Puri

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07826 2024-10-11 cs.CL 79%

Fine-Tuning Language Models for Ethical Ambiguity: A Comparative Study of Alignment with Human Responses

Pranav Senthilkumar, Visshwa Balasubramanian, Prisha Jain, Aneesa Maity, Jonathan Lu, Kevin Zhu

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL

Comments Accepted to NeurIPS 2024, SoLaR workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07304 2024-10-11 cs.HC cs.AI 79%

The Moral Turing Test: Evaluating Human-LLM Alignment in Moral Decision-Making

Basile Garcia, Crystal Qian, Stefano Palminteri

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00608 2024-10-02 cs.CY 79%

Measurement challenges in AI catastrophic risk governance and safety frameworks

Atoosa Kasirzadeh

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.CY

Comments Tech Policy Press

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15550 2024-09-04 cs.AI 79%

Trustworthy and Responsible AI for Human-Centric Autonomous Decision-Making Systems

Farzaneh Dehghani, Mahsa Dibaji, Fahim Anzum, Lily Dey, Alican Basdemir, Sayeh Bayat, Jean-Christophe Boucher, Steve Drew, Sarah Elaine Eaton, Richard Frayne, Gouri Ginde, Ashley Harris, Yani Ioannou, Catherine Lebel, John Lysack, Leslie Salgado Arzuaga, Emma Stanley, Roberto Souza, Ronnie de Souza Santos, Lana Wells, Tyler Williamson, Matthias Wilms, Zaman Wahid, Mark Ungrin, Marina Gavrilova, Mariana Bento

专题命中 AI治理与伦理 :trustworthy(title,abstract);分类 cs.AI

Comments 44 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14303 2024-07-22 cs.LG eess.SP 79%

Multi-Source and Test-Time Domain Adaptation on Multivariate Signals using Spatio-Temporal Monge Alignment

Théo Gnassounou, Antoine Collas, Rémi Flamary, Karim Lounici, Alexandre Gramfort

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13507 2024-06-21 cs.LG 79%

Scalable unsupervised alignment of general metric and non-metric structures

Sanketh Vedula, Valentino Maiorca, Lorenzo Basile, Francesco Locatello, Alex Bronstein

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08089 2024-06-13 cs.CL 79%

Improving In-context Learning of Multilingual Generative Language Models with Cross-lingual Alignment

Chong Li, Shaonan Wang, Jiajun Zhang, Chengqing Zong

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL

Comments NAACL 2024; Our code is available at https://github.com/chongli17/CrossLingualAlignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03250 2024-06-06 cs.CV cs.AI 79%

Prompt-based Visual Alignment for Zero-shot Policy Transfer

Haihan Gao, Rui Zhang, Qi Yi, Hantao Yao, Haochen Li, Jiaming Guo, Shaohui Peng, Yunkai Gao, QiCheng Wang, Xing Hu, Yuanbo Wen, Zihao Zhang, Zidong Du, Ling Li, Qi Guo, Yunji Chen

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI

Comments This paper has been accepted by ICML2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04818 2024-05-20 cs.LG cs.CV cs.DC 79%

Cross-Silo Federated Learning Across Divergent Domains with Iterative Parameter Alignment

Matt Gorbett, Hossein Shirazi, Indrakshi Ray

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.LG

Comments Published at IEEE Big Data 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05227 2024-02-28 cs.AI 79%

Kantian Deontology Meets AI Alignment: Towards Morally Grounded Fairness Metrics

Carlos Mougan, Joshua Brand

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03540 2024-02-07 cs.LG cs.GT stat.ML 79%

Regulation Games for Trustworthy Machine Learning

Mohammad Yaghini, Patty Liu, Franziska Boenisch, Nicolas Papernot

专题命中 AI治理与伦理 :trustworthy(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07579 2023-12-14 cs.NE cs.AI 79%

Cross Fertilizing Empathy from Brain to Machine as a Value Alignment Strategy

Devin Gonier, Adrian Adduci, Cassidy LoCascio

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03893 2023-12-08 cs.CY cs.HC 79%

Deliberative Technology for Alignment

Andrew Konya, Deger Turan, Aviv Ovadya, Lina Qui, Daanish Masood, Flynn Devine, Lisa Schirch, Isabella Roberts, Deliberative Alignment Forum

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19841 2023-11-01 cs.LG 79%

An interpretable clustering approach to safety climate analysis: examining driver group distinction in safety climate perceptions

Kailai Sun, Tianxiang Lan, Yang Miang Goh, Sufiana Safiena, Yueng-Hsiang Huang, Bailey Lytle, Yimin He

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.LG

Comments Submitted to Journal:Accident Analysis and Prevention

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02344 2023-10-05 cs.RO cs.AI 79%

Autonomous Systems' Safety Cases for use in UK Nuclear Environments

Christopher R. Anderson, Louise A. Dennis

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI

Comments In Proceedings AREA 2023, arXiv:2310.00333

Journal ref EPTCS 391, 2023, pp. 83-88

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00970 2023-10-03 cs.CL 79%

EALM: Introducing Multidimensional Ethical Alignment in Conversational Information Retrieval

Yiyao Yu, Junjie Wang, Yuxiang Zhang, Lin Zhang, Yujiu Yang, Tetsuya Sakai

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.10312 2023-07-21 cs.CY cs.HC 79%

Beyond the ML Model: Applying Safety Engineering Frameworks to Text-to-Image Development

Shalaleh Rismani, Renee Shelby, Andrew Smart, Renelito Delos Santos, AJung Moon, Negar Rostamzadeh

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.02856 2022-08-08 cs.LG 79%

Embedding Alignment for Unsupervised Federated Learning via Smart Data Exchange

Satyavrat Wagle, Seyyedali Hosseinalipour, Naji Khosravan, Mung Chiang, Christopher G. Brinton

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.LG

Comments Accepted for publication in IEEE Global Communications Conferences (GLOBECOM), 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.14412 2022-06-22 cs.RO cs.LG cs.SY eess.SY 79%

Towards Data-Driven Synthesis of Autonomous Vehicle Safety Concepts

Karen Leung, Andrea Bajcsy, Edward Schmerling, Marco Pavone

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.02838 2022-02-08 cs.AI cs.HC 79%

Aligning Eyes between Humans and Deep Neural Network through Interactive Attention Alignment

Yuyang Gao, Tong Sun, Liang Zhao, Sungsoo Hong

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.06207 2021-11-12 cs.CY 79%

Governance of Ethical and Trustworthy AI Systems: Research Gaps in the ECCOLA Method

Mamia Agbese, Hanna-Kaisa Alanen, Jani Antikainen, Erika Halme, Hannakaisa Isomäki, Marianna Jantunen, Kai-Kristian Kemell, Rebekah Rousi, Heidi Vainio-Pekka, Ville Vakkuri

专题命中 AI治理与伦理 :trustworthy(title,abstract);分类 cs.CY

Comments 8 pages, 1 figure, 2 tables, IEEE 29th International Requirements Engineering Conference Workshops (REW)

Journal ref 2021, pp 224-229

详情

展开后加载摘要…

URL PDF HTML 收藏