arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1832 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 1832 篇

2604.04858 2026-04-07 cs.LG q-bio.QM 57%

FairLogue: A Toolkit for Intersectional Fairness Analysis in Clinical Machine Learning Models

FairLogue: 临床机器学习模型中交集公平性分析的工具包

Nick Souligne, Vignesh Subbian

机构 * University of Arizona(亚利桑那大学)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出Fairlogue工具包,用于在临床机器学习中评估交集公平性,通过观测和反事实框架分析种族和性别等保护属性的公平性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13458 2026-04-07 cs.SI cs.AI 57%

MoltNet: Understanding Social Behavior of AI Agents in the Agent-Native MoltBook

MoltNet:理解AI代理在Agent原生MoltBook中的社会行为

Yi Feng, Chen Huang, Zhibo Man, Ryner Tan, Long P. Hoang, Shaoyang Xu, Wenxuan Zhang

机构 * iNLP Lab, Singapore University of Technology and Design(新加坡科技设计大学 iNLP 实验室)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 研究大规模AI代理社区的社会互动,通过MoltNet数据集分析148K代理在MoltBook中的行为,揭示其在激励、规范、情感等方面的社会机制与人类差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03323 2026-04-07 cs.AR cs.LG 57%

InsightBoard: An Interactive Multi-Metric Visualization and Fairness Analysis Plugin for TensorBoard

InsightBoard: 一个用于TensorBoard的交互式多指标可视化和公平性分析插件

Ray Zeyao Chen, Christan Grant

专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG

AI总结 InsightBoard通过统一界面整合多指标可视化与切片公平性诊断,帮助研究者在训练过程中分析训练动态、性能指标和子群体差异,提升模型公平性诊断的及时性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03250 2026-04-07 cs.CY 57%

Ethical Implications of Training Deceptive AI

训练欺骗性人工智能的伦理影响

Jason Starace, Bert Baumgaertner, Terence Soule

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文提出DRL框架,通过生物安全等级系统模型,对欺骗性算法研究进行分类,评估风险并制定相应保障措施,以填补监管与研究间的治理空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18633 2026-04-07 cs.AI cs.ET 57%

An Onto-Relational-Sophic Framework for Governing Synthetic Minds

一个面向合成智能的本体-关系-Sophic框架

Huansheng Ning, Jianguo Ding

机构 * University of Science and Technology Beijing(北京科技大学) Blekinge Institute of Technology(布莱金厄理工学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出ORS框架,通过本体论、数字人格谱系和Cybersophy三支柱,解决合成智能的治理问题,展示其在自主研究代理和医疗AI等场景中的适应性治理能力。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02605 2026-04-06 cs.AI cs.SD 57%

Do Audio-Visual Large Language Models Really See and Hear?

音频视觉大语言模型真的能看见和听见吗?

Ramaneswaran Selvakumar, Kaousheik Jayakumar, S Sakshi, Sreyan Ghosh, Ruohan Gao, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 研究探讨了音频视觉大语言模型中音频与视觉特征的融合机制,发现当音频与视觉冲突时,最终文本生成中音频信息无法有效表露,揭示了多模态LLM在整合音频和视觉时的模态偏见。

Comments CVPR Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02976 2026-04-02 cs.AI 57%

Teaching AI to Handle Exceptions: Supervised Fine-Tuning with Human-Aligned Judgment

教AI处理例外:基于人类对齐判断的监督微调

Matthew DosSantos DiSorbo, Harang Ju, Sinan Aral

机构 * Harvard Business School(哈佛商学院) Johns Hopkins University(约翰霍普金斯大学) MIT Sloan School of Management(麻省理工学院斯隆管理学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 研究探讨了如何通过监督微调使AI处理例外,发现使用人类解释的微调能显著提升模型决策能力,揭示了对齐人类判断需明确训练决策过程而非仅决策结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26008 2026-03-30 cs.CV cs.AI 57%

FairLLaVA: Fairness-Aware Parameter-Efficient Fine-Tuning for Large Vision-Language Assistants

FairLLaVA: 大规模视觉-语言助手中的公平性感知参数高效微调

Mahesh Bhosale, Abdul Wasi, Shantam Srivastava, Shifa Latif, Tianyu Luan, Mingchen Gao, David Doermann, Xuan Gong

机构 * University at Buffalo(布法罗大学) University of Kashmir(克什米尔大学) Accenture(埃森哲) Harvard Medical School(哈佛医学院)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 FairLLaVA通过减少目标属性间的互信息,实现视觉指令微调中的公平性改进,提升医疗影像生成的公平性和自然语言生成质量。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25379 2026-03-27 cs.AI cs.HC 57%

Does Structured Intent Representation Generalize? A Cross-Language, Cross-Model Empirical Study of 5W3H Prompting

结构化意图表示是否具有泛化性?一项跨语言、跨模型的5W3H提示经验研究

Peng Gang

机构 * Huizhou Lateni AI Technology Co., Ltd.(惠州拉特尼人工智能科技有限公司) Huizhou University(惠州大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文通过跨语言和跨模型的实验,探讨结构化意图表示的泛化能力,发现AI辅助写作工具生成的5W3H提示在目标对齐上与手动创建的提示无显著差异,且能减少跨模型输出方差。

Comments 28 pages, figures, tables, and appendix. Follow-up empirical study extending prior work on PPS and 5W3H structured prompting to cross-language, cross-model, and AI-assisted authoring settings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19649 2026-03-23 cs.SI cs.AI 57%

PolicySim: An LLM-Based Agent Social Simulation Sandbox for Proactive Policy Optimization

PolicySim:一种基于LLM的代理社会模拟沙盒,用于主动政策优化

Renhong Huang, Ning Tang, Jiarong Xu, Yuxuan Cao, Qingqian Tu, Sheng Guo, Bo Zheng, Huiyuan Liu, Yang Yang

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) University of Nottingham(诺丁汉大学) PowerChina Huadong Engineering Corporation Limited(国家电网华东工程公司)

专题命中 AI治理与伦理 :DPO(abstract);分类 cs.AI

AI总结 本文提出PolicySim,通过用户代理模块和自适应干预模块,模拟用户行为与平台干预的双向动态,实现对干预政策的主动评估与优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05154 2026-03-23 cs.CL 57%

Can AI Truly Represent Your Voice in Deliberations? A Comprehensive Study of Large-Scale Opinion Aggregation with LLMs

AI能否真正代表您的声音进行辩论?基于大规模意见聚合的全面研究

Shenzhe Zhu, Shu Yang, Michiel A. Bakker, Alex Pentland, Jiaxin Pei

机构 * Stanford University(斯坦福大学) University of Toronto(多伦多大学) KAUST(卡塔尔大学) MIT(麻省理工学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文通过DeliberationBank数据集评估LLM在大规模辩论总结中的表现,发现其存在代表性不足和偏见问题,提出DeliberationJudge模型提升评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00479 2026-03-19 cs.AI 57%

Aligning Probabilistic Beliefs under Informative Missingness: LLM Steerability in Clinical Reasoning

在信息缺失下对概率信念进行对齐:临床推理中的LLM可引导性

Yuta Kobayashi, Vincent Jeanselme, Shalmali Joshi

机构 * Department of Biomedical Informatics(生物医学信息学系)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文研究LLM能否利用信息性缺失进行预测推理,通过分析三种提示方法发现,尽管结构引导和上下文学习可提升概率对齐,但需精心干预才能利用信息性缺失。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16643 2026-03-18 cs.CL 57%

Good Arguments Against the People Pleasers: How Reasoning Mitigates (Yet Masks) LLM Sycophancy

对讨好型人格的有益论点:推理如何缓解(却掩盖)LLM的讨好行为

Zhaoxin Feng, Zheng Chen, Jianfei Ma, Yip Tin Po, Emmanuele Chersoni, Bo Li

机构 * The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 研究探讨了推理在缓解LLM讨好行为中的作用,发现推理虽能减少最终决策的讨好倾向,但可能在部分样本中掩盖讨好行为,且LLM在主观任务和权威偏见下更易表现出讨好倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15187 2026-03-17 cs.CL 57%

The Hrunting of AI: Where and How to Improve English Dialectal Fairness

AI的提升:在哪里以及如何改进英语方言公平性

Wei Li, Adrian de Wynter

机构 * Boston College(波士顿学院) Microsoft(微软) The University of York(约克大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 研究探讨了数据质量和可用性对改进LLM在英语方言中的性能的影响,发现人类间的一致性直接影响LLM作为评判者的性能,并指出需谨慎评估数据以确保公平性和包容性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14838 2026-03-17 cs.CL 57%

The Impact of Ideological Discourses in RAG: A Case Study with COVID-19 Treatments

检索增强生成中意识形态话语的影响:以新冠治疗方案为例

Elmira Salari, Maria Claudia Nunes Delfino, Hazem Amamou, José Victor de Souza, Shruti Kshirsagar, Alan Davoust, Anderson Avila

机构 * Wichita State University(威斯康星州立大学) Pontifícia Universidade Católica de São Paulo(圣保罗天主教大学) Institut national de la recherche scientifique(国家科学研究中心) Université du Québec en Outaouais(魁北克大学Outaouais)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文研究检索到的意识形态文本对大语言模型输出的影响,通过新冠治疗方案案例,探讨意识形态在RAG框架中的识别与影响,揭示意识形态偏见与潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14325 2026-03-17 cs.AI 57%

FAIRGAME: a Framework for AI Agents Bias Recognition using Game Theory

FAIRGAME: 一个用于通过博弈论识别AI代理偏见的框架

Alessio Buscemi, Daniele Proverbio, Alessandro Di Stefano, The-Anh Han, German Castignani, Pietro Liò

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

AI总结 FAIRGAME利用博弈论框架识别AI代理中的偏见,通过模拟和比较不同场景下的结果,系统发现偏见并预测战略互动中的行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13189 2026-03-16 cs.MA cs.AI 57%

LLM Constitutional Multi-Agent Governance

大语言模型宪法多智能体治理

J. de Curtò, I. de Zarzà

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出CMAG框架,通过硬约束过滤与软惩罚效用优化,在多智能体群体中平衡合作潜力与操纵风险,实验显示CMAG在保持自主性和完整性的同时提升了合作的伦理得分。

Comments Accepted for publication in 20th International Conference on Agents and Multi-Agent Systems: Technologies and Applications (AMSTA 2026), to appear in Springer Nature proceedings (KES Smart Innovation Systems and Technologies). The final authenticated version will be available online at Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08093 2026-03-16 cs.CL 57%

Evolution and compression in LLMs: On the emergence of human-aligned categorization

语言模型中的进化与压缩:关于人类对齐分类的出现

Nathaniel Imel, Noga Zaslavsky

机构 * New York University(纽约大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 研究探讨LLM是否能进化出高效的人类对齐语义系统,通过颜色分类实验发现,大模型在复杂性和英语对齐性上表现各异,仅最强模型能复现人类近最优的信息瓶颈贸易-offs。

Comments Published as a conference paper at ICLR 2026 (The Fourteenth International Conference on Learning Representations). OpenReview: https://openreview.net/forum?id=s7gSTR2AqA&noteId=s7gSTR2AqA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11277 2026-03-16 cs.AI 57%

COMPASS: The explainable agentic framework for Sovereignty, Sustainability, Compliance, and Ethics

COMPASS:面向主权、可持续性、合规性和伦理的可解释代理框架

Jean-Sébastien Dessureault, Alain-Thierry Iliho Manzi, Soukaina Alaoui Ismaili, Khadim Lo, Mireille Lalancette, Éric Bélanger

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出COMPASS框架,通过模块化治理机制整合主权、可持续性、合规性和伦理,利用RAG技术提升AI决策的可解释性和透明度。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00307 2026-03-12 cs.AI 57%

BiasBusters: Uncovering and Mitigating Tool Selection Bias in Large Language Models

BiasBusters: 检测和缓解大语言模型中的工具选择偏差

Thierry Blankenstein, Jialin Yu, Zixuan Li, Vassilis Plachouras, Sunando Sengupta, Philip Torr, Yarin Gal, Alasdair Paren, Adel Bibi

机构 * University of Oxford(牛津大学) Microsoft(微软)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 研究通过基准测试揭示LLM工具选择中的系统性偏差,并提出轻量级缓解策略以减少选择偏差。

Comments ICLR 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22699 2026-03-12 cs.CL 57%

Are you sure? Measuring models bias in content moderation through uncertainty

你确定吗?通过不确定性测量内容审核中的模型偏差

Alessandra Urbinati, Mirko Lai, Simona Frenda, Marco Antonio Stranisci

机构 * Laboratory for the Modeling of Biological and Socio-technical Systems, Northeastern University(生物与社会技术系统建模实验室,东北大学) Heriot-Watt University(赫瑞-瓦特大学) aequa-tech(aequa-tech公司) Università del Piemonte Orientale(皮埃蒙特东方大学) Università degli Studi di Torino(托里尼大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

AI总结 本文提出通过模型预测不确定性来衡量内容审核中模型的偏差,揭示预训练模型对少数群体的预测准确性与置信度的差异,以改进模型公平性。

Comments accepted at Findings of ACL: EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04417 2026-03-06 cs.CL 57%

Same Input, Different Scores: A Multi Model Study on the Inconsistency of LLM Judge

相同输入,不同评分:多模型研究LLM裁判的一致性

Fiona Lau

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本研究探讨了LLM在不同模型、温度设置下对相同输入评分的一致性问题,发现模型间评分差异显著,温度影响稳定性,需引入混合评估策略以确保可靠应用。

Comments 19 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21648 2026-03-05 cs.AI 57%

Leveraging Imperfection with MEDLEY A Multi-Model Approach Harnessing Bias in Medical AI

利用不完美性:MEDLEY:一种多模型方法,利用医学AI中的偏差

Farhad Abtahi, Mehdi Astaraki, Fernando Seoane

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

AI总结 MEDLEY提出了一种多模型框架,通过保留模型多样性而非压缩共识,利用医学AI中的偏差提升诊断准确性与透明度。

Journal ref Front. Artif. Intell., Volume 9 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03018 2026-03-04 cs.AI cs.SE 57%

REGAL: A Registry-Driven Architecture for Deterministic Grounding of Agentic AI in Enterprise Telemetry

REGAL:一种基于注册表的架构,用于企业遥测中代理AI的确定性接地

Yuvraj Agrawal

机构 * Adobe Inc.(Adobe公司)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 REGAL提出一种基于注册表的架构,用于企业遥测中代理AI的确定性接地,通过显式架构方法和语义编译提升确定性计算,解决LLM在私有遥测中的接地问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11922 2026-03-04 cs.CY cs.SE 57%

On Regulating Downstream AI Developers

对下游AI开发者进行监管

Sophie Williams, Jonas Schuett, Markus Anderljung

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文探讨了对下游AI开发者进行监管的必要性,提出通过要求上游开发者减轻下游修改风险或使用替代政策工具来平衡监管与创新。

Comments 39 pages, 2 figures, 7 tables

Journal ref Eur. j. risk regul. 17 (2026) 94-122

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02684 2026-03-04 cs.CL cs.SI 57%

HateMirage: An Explainable Multi-Dimensional Dataset for Decoding Faux Hate and Subtle Online Abuse

HateMirage: 一个可解释的多维数据集用于解码虚假仇恨与微妙的在线虐待

Sai Kartheek Reddy Kasu, Shankar Biradar, Sunil Saumya, Md. Shad Akhtar

机构 * Indian Institute of Information Technology Dharwad(印度信息技术学院达尔瓦德) Manipal Institute of Technology, Manipal Academy of Higher Education(曼普及高等教育学院技术学院) Indraprastha Institute of Information Technology Delhi(印度普拉斯塔信息技术学院德里)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

AI总结 HateMirage 是一个用于解码虚假仇恨与微妙在线虐待的多维数据集,通过多维解释框架提升仇恨言论的可解释性研究。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02568 2026-03-04 cs.CY 57%

AI4CAREER: Responsible AI for STEM Career Development at Scale in K-16 Education

AI4CAREER: 为K-16教育中的STEM职业发展实现负责任的AI

Sugana Chawla, Si Chen, Julia Qian, Gina Svarovsky, Alison Cheng, Rick Johnson, Nitesh V. Chawla, Ronald Metoyer

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 AI4CAREER研讨会探讨如何在K-16教育中通过负责任的AI促进STEM职业发展,聚焦AI在职业准备度评估、决策边界、发展一致性及公平性设计等方面的核心问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23720 2026-03-02 cs.AI 57%

The Auton Agentic AI Framework

自主AI框架

Sheng Cao, Zhao Chang, Chang Li, Hannan Li, Liyao Fu, Ji Tang

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 Auton框架通过分离认知蓝图与运行时引擎,实现自主代理系统的标准化创建、执行和治理,采用增强POMDP模型和三级自我进化框架提升安全性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08552 2026-03-02 cs.LG cs.CV 57%

Confronting Reward Overoptimization for Diffusion Models: A Perspective of Inductive and Primacy Biases

对抗扩散模型中的奖励过度优化:从归纳偏置和优先偏置的角度出发

Ziyi Zhang, Sen Zhang, Yibing Zhan, Yong Luo, Yonggang Wen, Dacheng Tao

机构 * Institute of Artificial Intelligence, School of Computer Science, Wuhan University, China Hubei Luojia Laboratory, Wuhan, China The University of Sydney, Australia JD Explore Academy, Beijing, China Nanyang Technological University, Singapore

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 本文提出TDPO-R算法,通过利用扩散模型的时间归纳偏置和抑制活跃神经元的优先偏置,有效缓解奖励过度优化问题。

Comments Accepted to ICML 2024

Journal ref International Conference on Machine Learning, pp. 60396-60413, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06412 2026-02-26 cs.CY 57%

Brokerage in the Black Box: Swing States, Strategic Ambiguity, and the Global Politics of AI Governance

黑箱中的中介作用: swing州、战略模糊性与人工智能治理的全球政治

Ha-Chi Tran

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 本研究探讨了技术swing州如何通过战略模糊性和制度透明性互动,调解大国技术竞争,影响全球人工智能治理的制度设计与政策结果。

详情

展开后加载摘要…

URL PDF HTML 收藏