arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1824 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 1824 篇

2507.02799 2025-07-04 cs.CL 70%

Is Reasoning All You Need? Probing Bias in the Age of Reasoning Language Models

Riccardo Cantini, Nicola Gabriele, Alessio Orsino, Domenico Talia

机构 * University of Calabria, Rende, Italy(卡拉布里亚大学)

专题命中 AI治理与伦理 :safety(abstract);jailbreak(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14191 2025-06-18 cs.CY 70%

The Ethics of Generative AI in Anonymous Spaces: A Case Study of 4chan's /pol/ Board

Parth Gaba, Emiliano De Cristofaro

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07282 2025-06-10 cs.CY 70%

Adultification Bias in LLMs and Text-to-Image Models

Jane Castleman, Aleksandra Korolova

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY

Comments Accepted to the ACM Conference on Fairness, Accountability, and Transparency (FAccT '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03497 2025-06-05 cs.CY 70%

Bridging the Artificial Intelligence Governance Gap: The United States' and China's Divergent Approaches to Governing General-Purpose Artificial Intelligence

Oliver Guest, Kevin Wei

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CY

Comments Published as a RAND commentary

Journal ref Santa Monica, CA: RAND Corporation, 2024. https://www.rand.org/pubs/perspectives/PEA3703-1.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16456 2025-06-03 cs.HC cs.AI 70%

Position: Beyond Assistance -- Reimagining LLMs as Ethical and Adaptive Co-Creators in Mental Health Care

Abeer Badawi, Md Tahmid Rahman Laskar, Jimmy Xiangji Huang, Shaina Raza, Elham Dolatabadi

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15365 2025-05-22 cs.HC cs.CL 70%

AI vs. Human Judgment of Content Moderation: LLM-as-a-Judge and Ethics-Based Response Refusals

Stefan Pasch

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00174 2025-05-07 cs.AI 70%

Real-World Gaps in AI Governance Research

Ilan Strauss, Isobel Moure, Tim O'Reilly, Sruly Rosenblat

机构 * AI Disclosures Project, Social Science Research Council Institute for Innovation and Public Purpose, University College London(AI披露项目,社会科学理事会创新与公共目的研究所,伦敦大学学院) AI Disclosures Project, Social Science Research Council(AI披露项目,社会科学理事会) O’Reilly Media(O’Reilly媒体)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI

Comments Corrected a previous error: replaced 'underrepresented in Academic AI research' with the intended phrase 'underrepresented in Corporate AI research'

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01150 2025-05-05 cs.CY 70%

Methodological Foundations for AI-Driven Survey Question Generation

Ted K. Mburu, Kangxuan Rong, Campbell J. McColley, Alexandra Werth

专题命中 AI治理与伦理 :alignment(abstract);trustworthy(abstract);分类 cs.CY

Comments 32 pages, 6 figures. Accepted for publication in the Journal of Engineering Education (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20086 2025-04-30 cs.CL cs.AI cs.CY cs.LG 70%

Understanding and Mitigating Risks of Generative AI in Financial Services

Sebastian Gehrmann, Claire Huang, Xian Teng, Sergei Yurovski, Iyanuoluwa Shode, Chirag S. Patel, Arjun Bhorkar, Naveen Thomas, John Doucette, David Rosenberg, Mark Dredze, David Rabinowitz

机构 * Bloomberg(彭博社) Johns Hopkins University(约翰霍普金斯大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Accepted to FAccT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02127 2025-04-04 cs.CY 70%

Reinsuring AI: Energy, Agriculture, Finance & Medicine as Precedents for Scalable Governance of Frontier Artificial Intelligence

Nicholas Stetler

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CY

Comments Working paper version (35 pages). Submitted to So. Ill. Law Journal; full-form citations retained for editorial review. Not peer-reviewed. Subject to revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22772 2025-04-01 cs.CY 70%

AI Family Integration Index (AFII): Benchmarking a New Global Readiness for AI as Family

Prashant Mahajan

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY

Comments 28 table, 7 Figures, 78 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00265 2025-03-14 cs.AI cs.CL cs.CY cs.LG 70%

Explainable Artificial Intelligence: A Survey of Needs, Techniques, Applications, and Future Direction

Melkamu Mersha, Khang Lam, Joseph Wood, Ali AlShami, Jugal Kalita

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

Journal ref 599(2024)128111

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07806 2025-03-12 cs.CL cs.AI cs.CY cs.LG 70%

Towards Large Language Models that Benefit for All: Benchmarking Group Fairness in Reward Models

Kefan Song, Jin Yao, Runnan Jiang, Rohan Chandra, Shangtong Zhang

专题命中 AI治理与伦理 :RLHF(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06411 2025-03-11 eess.SY cs.AI cs.SY 70%

Decoding the Black Box: Integrating Moral Imagination with Technical AI Governance

Krti Tallam

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09730 2025-02-18 cs.CL cs.AI cs.CY cs.HC cs.LG 70%

Sociodemographic Prompting is Not Yet an Effective Approach for Simulating Subjective Judgments with LLMs

Huaman Sun, Jiaxin Pei, Minje Choi, David Jurgens

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07959 2025-02-04 cs.CL cs.AI cs.CY cs.LG 70%

COMPL-AI Framework: A Technical Interpretation and LLM Benchmarking Suite for the EU Artificial Intelligence Act

Philipp Guldimann, Alexander Spiridonov, Robin Staab, Nikola Jovanović, Mark Vero, Velko Vechev, Anna-Maria Gueorguieva, Mislav Balunović, Nikola Konstantinov, Pavol Bielik, Petar Tsankov, Martin Vechev

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18299 2025-01-31 cs.AI 70%

Model-Free RL Agents Demonstrate System 1-Like Intentionality

Hal Ashton, Matija Franklin

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16946 2025-01-30 cs.CY 70%

Gradual Disempowerment: Systemic Existential Risks from Incremental AI Development

Jan Kulveit, Raymond Douglas, Nora Ammann, Deger Turan, David Krueger, David Duvenaud

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CY

Comments 19 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07780 2024-12-12 cs.CY 70%

A Taxonomy of Systemic Risks from General-Purpose AI

Risto Uuk, Carlos Ignacio Gutierrez, Daniel Guppy, Lode Lauwaert, Atoosa Kasirzadeh, Lucia Velasco, Peter Slattery, Carina Prunkl

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CY

Comments 34 pages, 9 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16771 2024-11-22 cs.CY 70%

Navigating Governance Paradigms: A Cross-Regional Comparative Study of Generative AI Governance Processes & Principles

Jose Luna, Ivan Tan, Xiaofei Xie, Lingxiao Jiang

专题命中 AI治理与伦理 :alignment(abstract);trustworthy(abstract);分类 cs.CY

Comments To appear at AIES 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12289 2024-11-18 cs.CY 70%

Catalog of General Ethical Requirements for AI Certification

Nicholas Kluge Corrêa, Julia Maria Mönig

专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract);分类 cs.CY

Comments Whitepaper - deliverable from the KI.NRW flagship-project "Zertifizierte KI"

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01426 2024-11-05 cs.HC cs.CY 70%

AURA: Amplifying Understanding, Resilience, and Awareness for Responsible AI Content Work

Alice Qian Zhang, Judith Amores, Mary L. Gray, Mary Czerwinski, Jina Suh

专题命中 AI治理与伦理 :safety(abstract);red teaming(abstract);分类 cs.CY

Comments To be presented at CSCW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09645 2024-10-15 cs.CY 70%

AI Model Registries: A Foundational Tool for AI Governance

Elliot McKernon, Gwyn Glasser, Deric Cheng, Gillian Hadfield

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14230 2024-09-24 cs.CY 70%

Views on AI aren't binary -- they're plural

Thorin Bristow, Luke Thorburn, Diana Acosta-Navas

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CY

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17129 2024-07-25 cs.CY 70%

Mapping the individual, social, and biospheric impacts of Foundation Models

Andrés Domínguez Hernández, Shyam Krishna, Antonella Maia Perini, Michael Katell, SJ Bennett, Ann Borda, Youmna Hashem, Semeli Hadjiloizou, Sabeehah Mahomed, Smera Jayadeva, Mhairi Aitken, David Leslie

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CY

Comments ACM Conference on Fairness, Accountability, and Transparency (FAccT '24). Association for Computing Machinery, New York, NY, USA, 776-796

Journal ref In Proceedings of the 2024 ACM Conference on Fairness, Accountability, and Transparency (FAccT '24). Association for Computing Machinery, New York, NY, USA, 776-796

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11360 2024-07-17 cs.AI 70%

Thorns and Algorithms: Navigating Generative AI Challenges Inspired by Giraffes and Acacias

Waqar Hussain

专题命中 AI治理与伦理 :safety(abstract);harmlessness(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12934 2024-06-21 cs.CR cs.AI cs.HC 70%

Current state of LLM Risks and AI Guardrails

Suriya Ganesh Ayyamperumal, Limin Ge

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI

Comments Independent study, Exploring LLMs, Deploying LLMs and their Risks

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17047 2024-05-27 cs.LG 70%

Near to Mid-term Risks and Opportunities of Open-Source Generative AI

Francisco Eiras, Aleksandar Petrov, Bertie Vidgen, Christian Schroeder de Witt, Fabio Pizzati, Katherine Elkins, Supratik Mukhopadhyay, Adel Bibi, Botos Csaba, Fabro Steibel, Fazl Barez, Genevieve Smith, Gianluca Guadagni, Jon Chun, Jordi Cabot, Joseph Marvin Imperial, Juan A. Nolazco-Flores, Lori Landay, Matthew Jackson, Paul Röttger, Philip H. S. Torr, Trevor Darrell, Yong Suk Lee, Jakob Foerster

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.LG

Comments Accepted to ICML'24 as a position paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02726 2024-05-07 cs.LG cs.SY eess.SY 70%

A Mathematical Model of the Hidden Feedback Loop Effect in Machine Learning Systems

Andrey Veprikov, Alexander Afanasiev, Anton Khritankov

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.LG

Comments 21 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16244 2024-04-30 cs.CY 70%

The Ethics of Advanced AI Assistants

Iason Gabriel, Arianna Manzini, Geoff Keeling, Lisa Anne Hendricks, Verena Rieser, Hasan Iqbal, Nenad Tomašev, Ira Ktena, Zachary Kenton, Mikel Rodriguez, Seliem El-Sayed, Sasha Brown, Canfer Akbulut, Andrew Trask, Edward Hughes, A. Stevie Bergman, Renee Shelby, Nahema Marchal, Conor Griffin, Juan Mateos-Garcia, Laura Weidinger, Winnie Street, Benjamin Lange, Alex Ingerman, Alison Lentz, Reed Enger, Andrew Barakat, Victoria Krakovna, John Oliver Siy, Zeb Kurth-Nelson, Amanda McCroskery, Vijay Bolina, Harry Law, Murray Shanahan, Lize Alberts, Borja Balle, Sarah de Haas, Yetunde Ibitoye, Allan Dafoe, Beth Goldberg, Sébastien Krier, Alexander Reese, Sims Witherspoon, Will Hawkins, Maribeth Rauh, Don Wallace, Matija Franklin, Josh A. Goldstein, Joel Lehman, Michael Klenk, Shannon Vallor, Courtney Biles, Meredith Ringel Morris, Helen King, Blaise Agüera y Arcas, William Isaac, James Manyika

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏