arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1832 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 1832 篇

2412.11335 2024-12-17 cs.CY 57%

Generative AI regulation can learn from social media regulation

Ruth Elisabeth Appel

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

Comments Presented at 2nd Workshop on Regulatable ML at NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09799 2024-12-16 cs.CV cs.AI 57%

CP-DETR: Concept Prompt Guide DETR Toward Stronger Universal Object Detection

Qibo Chen, Weizhong Jin, Jianyue Ge, Mengdi Liu, Yuchao Yan, Jian Jiang, Li Yu, Xuanjiang Guo, Shuchang Li, Jianzhong Chen

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

Comments Accepted by AAAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07880 2024-12-13 cs.AI 57%

Towards Foundation-model-based Multiagent System to Accelerate AI for Social Impact

Yunfan Zhao, Niclas Boehmer, Aparna Taneja, Milind Tambe

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08181 2024-12-05 cs.AI 57%

Challenges in Guardrailing Large Language Models for Science

Nishan Pantha, Muthukumaran Ramasubramanian, Iksha Gurung, Manil Maskey, Rahul Ramachandran

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16691 2024-11-27 cs.CY 57%

The Dual Impact of Artificial Intelligence in Healthcare: Balancing Advancements with Ethical and Operational Challenges

Balaji Shesharao Ingole, Vishnu Ramineni, Nikhil Kumar Pulipeta, Manoj Jayntilal Kathiriya, Manjunatha Sughaturu Krishnappa, Vivekananda Jayaram

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

Journal ref European Journal of Computer Science and Information Technology,12 (6),35-45, 2024 Print ISSN: 2054-0957 (Print)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13659 2024-11-27 cs.AI 57%

Leveraging Large Language Models for Patient Engagement: The Power of Conversational AI in Digital Health

Bo Wen, Raquel Norel, Julia Liu, Thaddeus Stappenbeck, Farhana Zulkernine, Huamin Chen

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

Comments 10 pages, 6 figures, ICDH 2024 invited paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16193 2024-11-26 cs.CY 57%

The Critical Canvas--How to regain information autonomy in the AI era

Dong Chen

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00434 2024-11-25 cs.CY cs.RO 57%

Rapid Integration of LLMs in Healthcare Raises Ethical Concerns: An Investigation into Deceptive Patterns in Social Robots

Robert Ranisch, Joschka Haltaufderheide

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

Comments 7 pages, 1table, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08896 2024-11-15 eess.SP cs.LG cs.NI 57%

Demand-Aware Beam Hopping and Power Allocation for Load Balancing in Digital Twin empowered LEO Satellite Networks

Ruili Zhao, Jun Cai, Jiangtao Luo, Junpeng Gao, Yongyi Ran

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02577 2024-11-06 cs.CY 57%

Where Assessment Validation and Responsible AI Meet

Jill Burstein, Geoffrey T. LaFlair

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00860 2024-11-05 cs.CL cs.CV 57%

Survey of Cultural Awareness in Language Models: Text and Beyond

Siddhesh Pawar, Junyeong Park, Jiho Jin, Arnav Arora, Junho Myung, Srishti Yadav, Faiz Ghifari Haznitrama, Inhwa Song, Alice Oh, Isabelle Augenstein

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23310 2024-11-01 q-bio.NC cs.AI 57%

Moral Agency in Silico: Exploring Free Will in Large Language Models

Morgan S. Porter

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20321 2024-10-29 cs.AI 57%

Effective Instruction Parsing Plugin for Complex Logical Query Answering on Knowledge Graphs

Xingrui Zhuo, Jiapu Wang, Gongqing Wu, Shirui Pan, Xindong Wu

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00227 2024-10-28 cs.CY 57%

From human-centered to social-centered artificial intelligence: Assessing ChatGPT's impact through disruptive events

Skyler Wang, Ned Cooper, Margaret Eby

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

Comments 14 pages. Published version

Journal ref Big Data & Society 11(1), 1-14 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17602 2024-10-24 cs.RO cs.AI 57%

Integrating Large Language Models for UAV Control in Simulated Environments: A Modular Interaction Approach

Abhishek Phadke, Alihan Hadimlioglu, Tianxing Chu, Chandra N Sekharan

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17555 2024-10-24 cs.AI 57%

FairDgcl: Fairness-aware Recommendation with Dynamic Graph Contrastive Learning

Wei Chen, Meng Yuan, Zhao Zhang, Ruobing Xie, Fuzhen Zhuang, Deqing Wang, Rui Liu

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

Comments 12 pages, submitted to TKDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13116 2024-10-22 cs.CL 57%

A Survey on Knowledge Distillation of Large Language Models

Xiaohan Xu, Ming Li, Chongyang Tao, Tao Shen, Reynold Cheng, Jinyang Li, Can Xu, Dacheng Tao, Tianyi Zhou

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11084 2024-10-16 cs.CL 57%

Gender Bias in Decision-Making with Large Language Models: A Study of Relationship Conflicts

Sharon Levy, William D. Adler, Tahilin Sanchez Karver, Mark Dredze, Michelle R. Kaufman

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

Comments EMNLP Findings 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09992 2024-10-15 cs.CL 57%

Evaluating Gender Bias of LLMs in Making Morality Judgements

Divij Bajaj, Yuanyuan Lei, Jonathan Tong, Ruihong Huang

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

Comments Accepted by EMNLP Findings 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07589 2024-10-11 cs.IR cs.CL 57%

No Free Lunch: Retrieval-Augmented Generation Undermines Fairness in LLMs, Even for Vigilant Users

Mengxuan Hu, Hongyi Wu, Zihan Guan, Ronghang Zhu, Dongliang Guo, Daiqing Qi, Sheng Li

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06566 2024-10-10 cs.CL 57%

Detecting Bias and Enhancing Diagnostic Accuracy in Large Language Models for Healthcare

Pardis Sadat Zahraei, Zahra Shakeri

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01420 2024-10-08 cs.CY 57%

Coordinated Disclosure of Dual-Use Capabilities: An Early Warning System for Advanced AI

Joe O'Brien, Shaun Ee, Jam Kraprayoon, Bill Anderson-Samways, Oscar Delaney, Zoe Williams

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

Comments 76 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15497 2024-10-02 cs.CY 57%

Foregrounding Artist Opinions: A Survey Study on Transparency, Ownership, and Fairness in AI Generative Art

Juniper Lovato, Julia Zimmerman, Isabelle Smith, Peter Dodds, Jennifer Karson

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16371 2024-09-26 cs.CL 57%

Do the Right Thing, Just Debias! Multi-Category Bias Mitigation Using LLMs

Amartya Roy, Danush Khanna, Devanshu Mahapatra, Vasanthakumar, Avirup Das, Kripabandhu Ghosh

专题命中 AI治理与伦理 :DPO(abstract);分类 cs.CL

Comments 17 pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05247 2024-09-10 cs.CL 57%

Socially Responsible Data for Large Multilingual Language Models

Andrew Smart, Ben Hutchinson, Lameck Mbangula Amugongo, Suzanne Dikker, Alex Zito, Amber Ebinama, Zara Wudiri, Ding Wang, Erin van Liemt, João Sedoc, Seyi Olojo, Stanley Uwakwe, Edem Wornyo, Sonja Schmer-Galunder, Jamila Smith-Loud

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

Journal ref ACM conference on Equity and Access in Algorithms, Mechanisms, and Optimization, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12420 2024-08-23 cs.AI 57%

Dataset | Mindset = Explainable AI | Interpretable AI

Caesar Wu, Rajkumar Buyya, Yuan Fang Li, Pascal Bouvry

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10711 2024-08-21 cs.AI 57%

Investigating Context Effects in Similarity Judgements in Large Language Models

Sagar Uprety, Amit Kumar Jaiswal, Haiming Liu, Dawei Song

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

Comments Accepted at The First Workshop on AI Behavioral Science (AIBS 2024), held in conjunction with KDD 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10365 2024-08-21 cs.AI 57%

AI-Driven Review Systems: Evaluating LLMs in Scalable and Bias-Aware Academic Reviews

Keith Tyser, Ben Segev, Gaston Longhitano, Xin-Yu Zhang, Zachary Meeks, Jason Lee, Uday Garg, Nicholas Belsten, Avi Shporer, Madeleine Udell, Dov Te'eni, Iddo Drori

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

Comments 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10160 2024-08-19 cs.AI 57%

Reinforcement Learning from Multi-role Debates as Feedback for Bias Mitigation in LLMs

Ruoxi Cheng, Haoxuan Ma, Shuirong Cao, Jiaqi Li, Aihua Pei, Zhiqiang Wang, Pengliang Ji, Haoyu Wang, Jiaqi Huo

专题命中 AI治理与伦理 :RLHF(abstract);分类 cs.AI

Comments The first three authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07990 2024-08-06 cs.CV cs.AI 57%

OpenBias: Open-set Bias Detection in Text-to-Image Generative Models

Moreno D'Incà, Elia Peruzzo, Massimiliano Mancini, Dejia Xu, Vidit Goel, Xingqian Xu, Zhangyang Wang, Humphrey Shi, Nicu Sebe

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

Comments CVPR 2024 Highlight - Code: https://github.com/Picsart-AI-Research/OpenBias

详情

展开后加载摘要…

URL PDF HTML 收藏