arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1832 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 1832 篇

2407.11733 2024-08-02 cs.CL 57%

How Are LLMs Mitigating Stereotyping Harms? Learning from Search Engine Studies

Alina Leidinger, Richard Rogers

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

Comments Accepted at AAAI/ACM AI, Ethics, and Society

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09241 2024-07-15 cs.CL 57%

The Sociolinguistic Foundations of Language Modeling

Jack Grieve, Sara Bartl, Matteo Fuoli, Jason Grafmiller, Weihang Huang, Alejandro Jawerbaum, Akira Murakami, Marcus Perlman, Dana Roemling, Bodo Winter

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.15399 2024-07-02 cs.CL 57%

Rethinking Machine Ethics -- Can LLMs Perform Moral Reasoning through the Lens of Moral Theories?

Jingyan Zhou, Minda Hu, Junan Li, Xiaoying Zhang, Xixin Wu, Irwin King, Helen Meng

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

Journal ref Findings of the Association for Computational Linguistics: NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11290 2024-07-01 cs.CL 57%

MBIAS: Mitigating Bias in Large Language Models While Retaining Context

Shaina Raza, Ananya Raval, Veronica Chatrath

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05506 2024-06-26 cs.CL 57%

Cross-Care: Assessing the Healthcare Implications of Pre-training Data on Language Model Bias

Shan Chen, Jack Gallifant, Mingye Gao, Pedro Moreira, Nikolaj Munch, Ajay Muthukkumar, Arvind Rajan, Jaya Kolluri, Amelia Fiske, Janna Hastings, Hugo Aerts, Brian Anthony, Leo Anthony Celi, William G. La Cava, Danielle S. Bitterman

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

Comments Submitted for review, data visualization tool available at: www.crosscare.net

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15376 2024-06-25 cs.CY cs.HC 57%

Crossing the principle-practice gap in AI ethics with ethical problem-solving

Nicholas Kluge Corrêa, James William Santos, Camila Galvão, Marcelo Pasetti, Dieine Schiavon, Faizah Naqvi, Robayet Hossain, Nythamar De Oliveira

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11661 2024-06-21 cs.CL 57%

Cultural Conditioning or Placebo? On the Effectiveness of Socio-Demographic Prompting

Sagnik Mukherjee, Muhammad Farid Adilazuarda, Sunayana Sitaram, Kalika Bali, Alham Fikri Aji, Monojit Choudhury

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09029 2024-06-14 cs.CY 57%

Fair by design: A sociotechnical approach to justifying the fairness of AI-enabled systems across the lifecycle

Marten H. L. Kaas, Christopher Burr, Zoe Porter, Berk Ozturk, Philippa Ryan, Michael Katell, Nuala Polo, Kalle Westerling, Ibrahim Habli

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03255 2024-06-06 cs.LG 57%

On the Maximal Local Disparity of Fairness-Aware Classifiers

Jinqiu Jin, Haoxuan Li, Fuli Feng

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.LG

Journal ref ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02622 2024-06-06 cs.CR cs.AI 57%

Safeguarding Large Language Models: A Survey

Yi Dong, Ronghui Mu, Yanghao Zhang, Siqi Sun, Tianle Zhang, Changshun Wu, Gaojie Jin, Yi Qi, Jinwei Hu, Jie Meng, Saddek Bensalem, Xiaowei Huang

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

Comments under review. arXiv admin note: text overlap with arXiv:2402.01822

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18346 2024-05-29 cs.AI 57%

Intelligent Clinical Documentation: Harnessing Generative AI for Patient-Centric Clinical Note Generation

Anjanava Biswas, Wrick Talukdar

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

Comments 15 pages, 7 figures

Journal ref International Journal of Innovative Science and Research Technology: Vol. 9 (2024): No. 5, 994-1008

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11668 2024-05-21 cs.CL 57%

Cyber Risks of Machine Translation Critical Errors : Arabic Mental Health Tweets as a Case Study

Hadeel Saadany, Ashraf Tantawy, Constantin Orasan

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03093 2024-05-21 cs.AI q-bio.PE 57%

XXAI: Towards eXplicitly eXplainable Artificial Intelligence

V. L. Kalmykov, L. V. Kalmykov

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

Comments 18 pages, 1 graphical abstract, 1 figure, 72 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.13765 2024-05-21 cs.AI 57%

Towards ethical multimodal systems

Alexis Roger, Esma Aïmeur, Irina Rish

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

Comments 5 pages, multimodal ethical dataset building, accepted in the NeurIPS 2023 MP2 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13605 2024-05-07 cs.CY 57%

Regulating AI-Based Remote Biometric Identification. Investigating the Public Demand for Bans, Audits, and Public Database Registrations

Kimon Kieslich, Marco Lünich

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02846 2024-05-07 cs.AI 57%

Responsible AI: Portraits with Intelligent Bibliometrics

Yi Zhang, Mengjia Wu, Guangquan Zhang, Jie Lu

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01697 2024-05-06 cs.CY 57%

Towards an Ethical and Inclusive Implementation of Artificial Intelligence in Organizations: A Multidimensional Framework

Ernesto Giralt Hernández

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

Comments This is an English version of the original article arXiv:2405.00225v1 [cs.CY] (Hacia una implementación ética e inclusiva de la Inteligencia Artificial en las organizaciones: un marco multidimensional)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00225 2024-05-02 cs.CY 57%

Hacia una implementación ética e inclusiva de la Inteligencia Artificial en las organizaciones: un marco multidimensional

Ernesto Giralt Hernández

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

Comments in Spanish language

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17522 2024-04-29 cs.SE cs.AI 57%

Enhancing Legal Compliance and Regulation Analysis with Large Language Models

Shabnam Hassani

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

Comments to be published in 32nd IEEE International Requirements Engineering 2024 Conference (RE'24) - Doctoral Symposium. arXiv admin note: text overlap with arXiv:2404.14356

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05414 2024-03-26 cs.RO cs.AI 57%

Ethics of Artificial Intelligence and Robotics in the Architecture, Engineering, and Construction Industry

Ci-Jyun Liang, Thai-Hoa Le, Youngjib Ham, Bharadwaj R. K. Mantha, Marvin H. Cheng, Jacob J. Lin

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

Comments 109 pages, 5 figures, submitted to Automation in Construction

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14049 2024-03-22 cs.RO cs.AI cs.HC 57%

A Roadmap Towards Automated and Regulated Robotic Systems

Yihao Liu, Mehran Armand

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.12624 2024-03-20 cs.LG math.OC stat.ML 57%

Mitigating Gradient Bias in Multi-objective Learning: A Provably Convergent Stochastic Approach

Heshan Fernando, Han Shen, Miao Liu, Subhajit Chaudhury, Keerthiram Murugesan, Tianyi Chen

专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG

Comments Changed hyper-parameter choice which affects some of the convergence rate results in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05696 2024-03-12 cs.CL cs.CV 57%

SeeGULL Multilingual: a Dataset of Geo-Culturally Situated Stereotypes

Mukul Bhutani, Kevin Robinson, Vinodkumar Prabhakaran, Shachi Dave, Sunipa Dev

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00292 2024-03-07 cs.CY 57%

Sustainable AI Regulation

Philipp Hacker

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY

Comments Privacy Law Scholars Conference 2023; Common Market Law Review (forthcoming)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11190 2024-02-20 cs.CL 57%

Disclosure and Mitigation of Gender Bias in LLMs

Xiangjue Dong, Yibo Wang, Philip S. Yu, James Caverlee

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

Comments The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09328 2024-02-15 stat.ML cs.LG stat.ME 57%

Connecting Algorithmic Fairness to Quality Dimensions in Machine Learning in Official Statistics and Survey Production

Patrick Oliver Schenk, Christoph Kern

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08797 2024-02-15 cs.CY 57%

Computing Power and the Governance of Artificial Intelligence

Girish Sastry, Lennart Heim, Haydn Belfield, Markus Anderljung, Miles Brundage, Julian Hazell, Cullen O'Keefe, Gillian K. Hadfield, Richard Ngo, Konstantin Pilz, George Gor, Emma Bluemke, Sarah Shoker, Janet Egan, Robert F. Trager, Shahar Avin, Adrian Weller, Yoshua Bengio, Diane Coyle

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

Comments Figures can be accessed at: https://github.com/lheim/CPGAI-Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04017 2024-02-13 cs.LG q-bio.QM 57%

PGraphDTA: Improving Drug Target Interaction Prediction using Protein Language Models and Contact Maps

Rakesh Bal, Yijia Xiao, Wei Wang

专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG

Comments AI for Science Workshop, NeurIPS 2023. 11 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05786 2024-02-12 cs.AI cs.GT 57%

Prompting Fairness: Artificial Intelligence as Game Players

Jazmia Henry

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00745 2024-02-02 cs.CL 57%

Enhancing Ethical Explanations of Large Language Models through Iterative Symbolic Refinement

Xin Quan, Marco Valentino, Louise A. Dennis, André Freitas

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

Comments Camera-ready for EACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏