arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1832 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 1832 篇

2502.03429 2025-02-06 cs.CL cs.AI 62%

On Fairness of Unified Multimodal Large Language Model for Image Generation

Ming Liu, Hao Chen, Jindong Wang, Liwen Wang, Bhiksha Raj Ramakrishnan, Wensheng Zhang

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00011 2025-02-04 cs.CY cs.AI cs.HC 62%

TOAST Framework: A Multidimensional Approach to Ethical and Sustainable AI Integration in Organizations

Dian Tjondronegoro

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY

Comments 25 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15287 2025-01-30 cs.CL cs.AI 62%

Sycophancy in Large Language Models: Causes and Mitigations

Lars Malmqvist

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

Journal ref Computing Conference 2025 (upcoming)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04472 2025-01-30 cs.CL cs.CY 62%

Collapsed Language Models Promote Fairness

Jingxuan Xu, Wuyang Chen, Linyi Li, Yao Zhao, Yunchao Wei

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.CY

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17420 2025-01-30 cs.CL cs.AI cs.HC 62%

Actions Speak Louder than Words: Agent Decisions Reveal Implicit Biases in Language Models

Yuxuan Li, Hirokazu Shirado, Sauvik Das

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11820 2025-01-23 cs.CY cs.AI 62%

Responsible AI Question Bank: A Comprehensive Tool for AI Risk Assessment

Sung Une Lee, Harsha Perera, Yue Liu, Boming Xia, Qinghua Lu, Liming Zhu, Olivier Salvado, Jon Whittle

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY

Comments 30 pages, 6 tables, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10391 2025-01-22 cs.CY cs.AI 62%

Developing an Ontology for AI Act Fundamental Rights Impact Assessments

Tytti Rintamaki, Harshvardhan J. Pandit

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

Comments Presented at CLAIRvoyant (ConventicLE on Artificial Intelligence Regulation) Workshop 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10390 2025-01-22 cs.CY cs.AI 62%

Towards an Environmental Ethics of Artificial Intelligence

Nynke van Uffelen, Lode Lauwaert, Mark Coeckelbergh, Olya Kudina

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09182 2025-01-17 cs.AI cs.CR cs.CY cs.SE 62%

A Blockchain-Enabled Approach to Cross-Border Compliance and Trust

Vikram Kulothungan

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY

Comments This is a preprint of paper that has been accepted for Publication at 2024 IEEE International Conference on Trust, Privacy and Security in Intelligent Systems, and Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01973 2025-01-10 cs.CV cs.AI cs.CY 62%

INFELM: In-depth Fairness Evaluation of Large Text-To-Image Models

Di Jin, Xing Liu, Yu Liu, Jia Qing Yap, Andrea Wong, Adriana Crespo, Qi Lin, Zhiyuan Yin, Qiang Yan, Ryan Ye

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

Comments Di Jin and Xing Liu contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14571 2025-01-10 cs.HC cs.AI cs.CY 62%

Driving Towards Inclusion: A Systematic Review of AI-powered Accessibility Enhancements for People with Disability in Autonomous Vehicles

Ashish Bastola, Hao Wang, Sayed Pedram Haeri Boroujeni, Julian Brinkley, Ata Jahangir Moshayedi, Abolfazl Razi

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05937 2024-12-10 cs.LG cs.AI cs.IR cs.MA 62%

Accelerating Manufacturing Scale-Up from Material Discovery Using Agentic Web Navigation and Retrieval-Augmented AI for Process Engineering Schematics Design

Sakhinana Sagar Srinivas, Akash Das, Shivam Gupta, Venkataramana Runkana

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19308 2024-12-10 cs.CL cs.AI 62%

Designing Domain-Specific Large Language Models: The Critical Role of Fine-Tuning in Public Opinion Simulation

Haocheng Lin

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01075 2024-12-03 cs.LG cs.AI 62%

Multi-Agent Deep Reinforcement Learning for Distributed and Autonomous Platoon Coordination via Speed-regulation over Large-scale Transportation Networks

Dixiao Wei, Peng Yi, Jinlong Lei, Xingyi Zhu

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00962 2024-12-03 cs.AI cs.CL cs.SC 62%

LLMs as mirrors of societal moral standards: reflection of cultural divergence and agreement across ethical topics

Mijntje Meijer, Hadi Mohammadi, Ayoub Bagheri

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02885 2024-12-03 cs.HC cs.CL cs.CY cs.SI 62%

CogErgLLM: Exploring Large Language Model Systems Design Perspective Using Cognitive Ergonomics

Azmine Toushik Wasi, Mst Rafia Islam

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.CY

Comments 10 Page, 3 Figures. Accepted in: (i) ICML'24: LLMs & Cognition Workshop (Non-archival; OpenReview: https://openreview.net/forum?id=63C9YSc77p) (ii) EMNLP'24 : NLP for Science Workshop (Archival; ACL Anthology: https://aclanthology.org/2024.nlp4science-1.22/)

Journal ref Proceedings of the 1st Workshop on NLP for Science (NLP4Science), EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20739 2024-12-02 cs.CL cs.AI 62%

Gender Bias in LLM-generated Interview Responses

Haein Kong, Yongsu Ahn, Sangyub Lee, Yunho Maeng

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted to NeurlIPS 2024, SoLaR workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05283 2024-12-02 cs.CL cs.AI 62%

On the Relationship between Truth and Political Bias in Language Models

Suyash Fulay, William Brannon, Shrestha Mohanty, Cassandra Overney, Elinor Poole-Dayan, Deb Roy, Jad Kabbara

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2024

Journal ref Proc. EMNLP (2024) 9004-9018

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12762 2024-11-27 cs.AI cs.CY 62%

How should AI decisions be explained? Requirements for Explanations from the Perspective of European Law

Benjamin Fresz, Elena Dubovitskaya, Danilo Brajovic, Marco Huber, Christian Horz

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

Journal ref Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society (2024), 7(1), 438-450

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13584 2024-11-22 cs.CL cs.AI 62%

AddrLLM: Address Rewriting via Large Language Model on Nationwide Logistics Data

Qinchen Yang, Zhiqing Hong, Dongjiang Cao, Haotian Wang, Zejun Xie, Tian He, Yunhuai Liu, Yu Yang, Desheng Zhang

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted by KDD'25 ADS Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12820 2024-11-21 cs.AI cs.CY 62%

Declare and Justify: Explicit assumptions in AI evaluations are necessary for effective regulation

Peter Barnett, Lisa Thiergart

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09788 2024-11-18 cs.HC cs.AI cs.CY 62%

AI-Driven Human-Autonomy Teaming in Tactical Operations: Proposed Framework, Challenges, and Future Directions

Desta Haileselassie Hagos, Hassan El Alami, Danda B. Rawat

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

Comments Submitted for review to the Proceedings of the IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07398 2024-11-13 cs.CL cs.AI cs.SE 62%

Beyond Keywords: A Context-based Hybrid Approach to Mining Ethical Concern-related App Reviews

Aakash Sorathiya, Gouri Ginde

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12789 2024-11-11 cs.LG cs.AI 62%

Fairness Without Harm: An Influence-Guided Active Sampling Approach

Jinlong Pang, Jialu Wang, Zhaowei Zhu, Yuanshun Yao, Chen Qian, Yang Liu

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14106 2024-11-11 cs.AI cs.LG 62%

Learning Human-like Representations to Enable Learning Human Values

Andrea Wynn, Ilia Sucholutsky, Thomas L. Griffiths

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03651 2024-11-07 cs.AI cs.GT cs.LG 62%

Policy Aggregation

Parand A. Alamdari, Soroush Ebadian, Ariel D. Procaccia

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03284 2024-11-06 cs.AI cs.CL cs.MA 62%

SMoA: Improving Multi-agent Large Language Models with Sparse Mixture-of-Agents

Dawei Li, Zhen Tan, Peijia Qian, Yifan Li, Kumar Satvik Chaudhary, Lijie Hu, Jiayi Shen

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13517 2024-11-06 cs.CL cs.AI 62%

Bias in the Mirror: Are LLMs opinions robust to their own adversarial attacks ?

Virgile Rennard, Christos Xypolopoulos, Michalis Vazirgiannis

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21279 2024-10-30 cs.CY cs.AI 62%

Comparative Global AI Regulation: Policy Perspectives from the EU, China, and the US

Jon Chun, Christian Schroeder de Witt, Katherine Elkins

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

Comments 36 pages, 11 figures and tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10284 2024-10-22 cs.CY cs.AI cs.RO 62%

Trust or Bust: Ensuring Trustworthiness in Autonomous Weapon Systems

Kasper Cools, Clara Maathuis

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY

Comments Accepted as a workshop paper at MILCOM 2024, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏