arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-17 至 2026-03-17 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 7 篇

2603.13244 2026-03-17 cs.CY cs.AI cs.CE 76%

Agentic AI, Retrieval-Augmented Generation, and the Institutional Turn: Legal Architectures and Financial Governance in the Age of Distributional AGI

代理AI、检索增强生成与制度转向:分布式AGI时代的法律架构与金融治理

Marcel Osmond

专题命中 AI治理与伦理 :alignment(abstract);RLHF(abstract);分类 cs.AI、cs.CY;safety(comments)

AI总结 本文探讨代理AI与检索增强生成对法律问责和金融市场完整性的影响,主张通过制度设计问题重构对齐机制,以构建合规行为主导的机构环境。

Comments 35 pages, 92 references. Comprehensive interdisciplinary analysis integrating AI safety, mechanism design, legal regulation, and financial governance. Published on Zenodo (https://doi.org/10.5281/zenodo.18711509). Includes industry practitioner perspectives alongside peer-reviewed literature

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14495 2026-03-17 cs.CY cs.AI 73%

Bridging the Gap in the Responsible AI Divides

弥合负责任AI分歧的鸿沟

Bálint Gyevnár, Atoosa Kasirzadeh

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 本文通过分析3550篇论文,探讨AI安全与AI伦理之间的分歧与重叠,提出通过解决关键问题促进负责任的AI治理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13636 2026-03-17 cs.CL cs.AI cs.CY 67%

Widespread Gender and Pronoun Bias in Moral Judgments Across LLMs

大范围性别和代词偏见在LLM道德判断中的表现

Gustavo Lúcius Fernandes, Jeiverson C. V. M. Santos, Pedro O. S. Vaz-de-Melo

机构 * Universidade Federal de Minas Gerais(巴西米纳斯吉拉斯联邦大学) Instituto Kunumi(昆米研究所)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究通过分析不同LLM对公平性判断的偏见,发现代词和性别标记显著影响道德分类,非二元性别受青睐,男性受歧视,需改进公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14625 2026-03-17 cs.MA cs.AI cs.LG cs.SY eess.SY 62%

EcoFair-CH-MARL: Scalable Constrained Hierarchical Multi-Agent RL with Real-Time Emission Budgets and Fairness Guarantees

EcoFair-CH-MARL:具有实时排放预算和公平性保证的可扩展约束层次多智能体强化学习

Saad Alqithami

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出EcoFair-CH-MARL框架,通过引入双重预算层、公平性奖励转换器和两级策略架构,实现高效、可持续且公平的海运物流解决方案,实验显示其在排放、吞吐量和公平性方面优于现有方法。

Comments Conference: The 28th European Conference on Artificial Intelligence (ECAI)

Journal ref Frontiers in Artificial Intelligence and Applications, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15187 2026-03-17 cs.CL 57%

The Hrunting of AI: Where and How to Improve English Dialectal Fairness

AI的提升:在哪里以及如何改进英语方言公平性

Wei Li, Adrian de Wynter

机构 * Boston College(波士顿学院) Microsoft(微软) The University of York(约克大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 研究探讨了数据质量和可用性对改进LLM在英语方言中的性能的影响,发现人类间的一致性直接影响LLM作为评判者的性能,并指出需谨慎评估数据以确保公平性和包容性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14838 2026-03-17 cs.CL 57%

The Impact of Ideological Discourses in RAG: A Case Study with COVID-19 Treatments

检索增强生成中意识形态话语的影响:以新冠治疗方案为例

Elmira Salari, Maria Claudia Nunes Delfino, Hazem Amamou, José Victor de Souza, Shruti Kshirsagar, Alan Davoust, Anderson Avila

机构 * Wichita State University(威斯康星州立大学) Pontifícia Universidade Católica de São Paulo(圣保罗天主教大学) Institut national de la recherche scientifique(国家科学研究中心) Université du Québec en Outaouais(魁北克大学Outaouais)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文研究检索到的意识形态文本对大语言模型输出的影响,通过新冠治疗方案案例,探讨意识形态在RAG框架中的识别与影响,揭示意识形态偏见与潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14325 2026-03-17 cs.AI 57%

FAIRGAME: a Framework for AI Agents Bias Recognition using Game Theory

FAIRGAME: 一个用于通过博弈论识别AI代理偏见的框架

Alessio Buscemi, Daniele Proverbio, Alessandro Di Stefano, The-Anh Han, German Castignani, Pietro Liò

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

AI总结 FAIRGAME利用博弈论框架识别AI代理中的偏见,通过模拟和比较不同场景下的结果,系统发现偏见并预测战略互动中的行为。

详情

展开后加载摘要…

URL PDF HTML 收藏