arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1824 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 1824 篇

2410.11143 2024-10-16 cs.CL cs.AI cs.LG 67%

LLM Unlearning via Loss Adjustment with Only Forget Data

Yaxuan Wang, Jiaheng Wei, Chris Yuhao Liu, Jinlong Pang, Quan Liu, Ankit Parag Shah, Yujia Bao, Yang Liu, Wei Wei

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01833 2024-10-04 cs.SE cs.HC 67%

Ethical software requirements from user reviews: A systematic literature review

Aakash Sorathiya, Gouri Ginde

专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16496 2024-09-26 cs.CY cs.AI cs.LG 67%

Articulation Work and Tinkering for Fairness in Machine Learning

Miriam Fahimi, Mayra Russo, Kristen M. Scott, Maria-Esther Vidal, Bettina Berendt, Katharina Kinder-Kurlanda

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11879 2024-08-23 cs.CL cs.AI cs.LG 67%

Beyond Labels: Aligning Large Language Models with Human-like Reasoning

Muhammad Rafsan Kabir, Rafeed Mohammad Sultan, Ihsanul Haque Asif, Jawad Ibn Ahad, Fuad Rahman, Mohammad Ruhul Amin, Nabeel Mohammed, Shafin Rahman

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted in ICPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10239 2024-08-21 cs.CY cs.AI cs.LG cs.SE 67%

A Conceptual Framework for Ethical Evaluation of Machine Learning Systems

Neha R. Gupta, Jessica Hullman, Hari Subramonyam

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11852 2024-08-16 cs.CY cs.AI cs.CL 67%

Risks from Language Models for Automated Mental Healthcare: Ethics and Structure for Implementation

Declan Grabb, Max Lamparth, Nina Vasan

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Updated with fine-tuned model results to match CoLM accepted camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04673 2024-08-12 cs.CL cs.AI cs.LG 67%

AutoFAIR : Automatic Data FAIRification via Machine Reading

Tingyan Ma, Wei Liu, Bin Lu, Xiaoying Gan, Yunqiang Zhu, Luoyi Fu, Chenghu Zhou

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01962 2024-08-06 cs.HC cs.AI cs.CL cs.CY cs.ET 67%

The Implications of Open Generative Models in Human-Centered Data Science Work: A Case Study with Fact-Checking Organizations

Robert Wolfe, Tanushree Mitra

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Accepted at Artificial Intelligence, Ethics, and Society 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19256 2024-07-30 cs.AI cs.CL cs.LG 67%

Stochastic Parrots or ICU Experts? Large Language Models in Critical Care Medicine: A Scoping Review

Tongyue Shi, Jun Ma, Zihan Yu, Haowei Xu, Minqi Xiong, Meirong Xiao, Yilin Li, Huiying Zhao, Guilan Kong

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 28 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15009 2024-07-24 cs.CY cs.AI cs.CL 67%

RogueGPT: dis-ethical tuning transforms ChatGPT4 into a Rogue AI in 158 Words

Alessio Buscemi, Daniele Proverbio

专题命中 AI治理与伦理 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01218 2024-07-02 cs.CL cs.AI cs.LG 67%

Self-Supervised Position Debiasing for Large Language Models

Zhongkun Liu, Zheng Chen, Mengqi Zhang, Zhaochun Ren, Pengjie Ren, Zhumin Chen

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by ACL 2024 findings, this is the camera-ready version; 21 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11780 2024-06-18 cs.LG cs.AI cs.CL 67%

Split, Unlearn, Merge: Leveraging Data Attributes for More Effective Unlearning in LLMs

Swanand Ravindra Kadhe, Farhan Ahmed, Dennis Wei, Nathalie Baracaldo, Inkit Padhi

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04064 2024-06-07 cs.CL cs.AI cs.CY 67%

Ask LLMs Directly, "What shapes your bias?": Measuring Social Bias in Large Language Models

Jisu Shin, Hoyun Song, Huije Lee, Soyeong Jeong, Jong C. Park

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Findings of ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06909 2024-05-14 cs.LG cs.AI cs.CY 67%

Fairness in Reinforcement Learning: A Survey

Anka Reuel, Devin Ma

专题命中 AI治理与伦理 :RLHF(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08605 2024-05-14 cs.CL cs.AI cs.CY cs.SI 67%

Exploring the Jungle of Bias: Political Bias Attribution in Language Models via Dependency Analysis

David F. Jenny, Yann Billeter, Mrinmaya Sachan, Bernhard Schölkopf, Zhijing Jin

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02822 2024-04-05 cs.CY cs.CL cs.LG 67%

Identifying Climate Targets in National Laws and Policies using Machine Learning

Matyas Juhasz, Tina Marchand, Roshan Melwani, Kalyan Dutia, Sarah Goodenough, Harrison Pim, Henry Franks

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.00225 2024-04-02 cs.AI cs.CY cs.LG 67%

Instructed to Bias: Instruction-Tuned Language Models Exhibit Emergent Cognitive Bias

Itay Itzhak, Gabriel Stanovsky, Nir Rosenfeld, Yonatan Belinkov

专题命中 AI治理与伦理 :RLHF(abstract);分类 cs.AI、cs.CY、cs.LG

Comments TACL 2024. Presented at ACL 2024. 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11053 2024-03-05 cs.CL cs.AI cs.CY 67%

Denevil: Towards Deciphering and Navigating the Ethical Values of Large Language Models via Instruction Learning

Shitong Duan, Xiaoyuan Yi, Peng Zhang, Tun Lu, Xing Xie, Ning Gu

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Accepted by ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.06924 2023-06-16 cs.AI cs.CR cs.CY cs.LG 67%

TASRA: a Taxonomy and Analysis of Societal-Scale Risks from AI

Andrew Critch, Stuart Russell

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.03503 2023-06-13 cs.CY cs.AI cs.CL 67%

Applying Standards to Advance Upstream & Downstream Ethics in Large Language Models

Jose Berengueres, Marybeth Sandell

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 8 pages, 4 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.13020 2023-05-17 cs.CY cs.AI cs.LG 67%

Law Informs Code: A Legal Informatics Approach to Aligning Artificial Intelligence with Humans

John J. Nay

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

Comments Northwestern Journal of Technology and Intellectual Property, Volume 20, Issue 3, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.15010 2023-05-01 cs.CV cs.AI cs.CL cs.LG cs.MM 67%

LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model

Peng Gao, Jiaming Han, Renrui Zhang, Ziyi Lin, Shijie Geng, Aojun Zhou, Wei Zhang, Pan Lu, Conghui He, Xiangyu Yue, Hongsheng Li, Yu Qiao

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Code and models are available at https://github.com/ZrrSkywalker/LLaMA-Adapter

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.06346 2022-11-14 cs.CY cs.AI cs.LG 67%

AI Ethics in Smart Healthcare

Sudeep Pasricha

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.00504 2022-10-18 stat.ML cs.AI cs.CY cs.LG 67%

Domain Adaptation meets Individual Fairness. And they get along

Debarghya Mukherjee, Felix Petersen, Mikhail Yurochkin, Yuekai Sun

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

Comments Published at NeurIPS 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.11569 2022-07-26 cs.RO cs.AI cs.CV cs.CY cs.LG 67%

Robots Enact Malignant Stereotypes

Andrew Hundt, William Agnew, Vicky Zeng, Severin Kacianka, Matthew Gombolay

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 30 pages, 10 figures, 5 tables. Website: https://sites.google.com/view/robots-enact-stereotypes . Published in the 2022 ACM Conference on Fairness, Accountability, and Transparency (FAccT 22), June 21-24, 2022, Seoul, Republic of Korea. ACM, DOI: https://doi.org/10.1145/3531146.3533138 . FAccT22 Submission dates: Abstract Dec 13, 2021; Submitted Jan 22, 2022; Accepted Apr 7, 2022

Journal ref In 2022 ACM Conference on Fairness, Accountability, and Transparency (FAccT 22). ACM, New York, NY, USA, 743-756

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.03295 2022-06-03 cs.LG cs.AI cs.CY 67%

The Road to Explainability is Paved with Bias: Measuring the Fairness of Explanations

Aparna Balagopalan, Haoran Zhang, Kimia Hamidieh, Thomas Hartvigsen, Frank Rudzicz, Marzyeh Ghassemi

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

Comments Published in FAccT 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.09447 2022-06-02 cs.LG cs.AI cs.CY stat.AP 67%

Algorithmic Fairness Verification with Graphical Models

Bishwamittra Ghosh, Debabrota Basu, Kuldeep S. Meel

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.05151 2022-04-12 cs.CY cs.AI cs.LG 67%

Metaethical Perspectives on 'Benchmarking' AI Ethics

Travis LaCroix, Alexandra Sasha Luccioni

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 39 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.10476 2022-03-01 cs.LG cs.AI cs.CY stat.ML 67%

Towards Return Parity in Markov Decision Processes

Jianfeng Chi, Jian Shen, Xinyi Dai, Weinan Zhang, Yuan Tian, Han Zhao

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

Comments AISTATS 2022. Code is released at https://github.com/JFChi/Return-Parity-MDP

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.12305 2021-07-23 cs.CL cs.AI cs.CY 67%

Confronting Abusive Language Online: A Survey from the Ethical and Human Rights Perspective

Svetlana Kiritchenko, Isar Nejadgholi, Kathleen C. Fraser

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments published in Journal of Artificial Intelligence Research, 71: 431-478, July 2021

详情

展开后加载摘要…

URL PDF HTML 收藏