arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-26 至 2026-05-26 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 9 篇

2605.25977 2026-05-26 cs.CL cs.AI cs.LG 82%

Creative Quality Alignment: Expert Tacit Knowledge Transfer via Chain-of-Thought Fine-Tuning

创意质量对齐:通过思维链微调实现专家隐性知识迁移

Bo Zou, Chao Xu

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过低数据成本和小基模型的严格工程条件,实证验证了校准惊喜中的创意质量度量,并发现数据偏差,提出创意质量对齐方法及理论解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25036 2026-05-26 cs.CL cs.AI 79%

Language Bias in LVLMs: From In-Depth Analysis to Simple and Effective Mitigation

LVLMs中的语言偏差:从深入分析到简单有效的缓解方法

Yangneng Chen, Jing Li

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳))

专题命中 AI治理与伦理 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文系统研究了大视觉语言模型中的语言偏差问题,发现其根源在于训练中的模态未对齐,并提出了两种简单有效的缓解方法:语言偏差正则化(LBR)和语言偏差惩罚(LBP)。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23981 2026-05-26 q-bio.NC cs.AI cs.CY cs.HC cs.SY eess.SY 62%

Metacognition Should Be the Scientific Framework for Bounded and Effective Self-Governance in Generative AI

元认知应成为生成式AI中有限且有效自我治理的科学框架

Eugene Yu Ji, Igor Grossmann, Amir-Hossein Karimi

机构 * University of Waterloo(滑铁卢大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出元认知作为生成式AI自我治理的科学框架,通过计算、算法和生态三个层面的元认知对齐实现有限且有效的自我治理。

Comments 16 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23935 2026-05-26 cs.AI cs.CY cs.MA cs.SE cs.SY eess.SY 62%

Operationalizing Reconstructive Authority: Runtime Construction, Dependency Resolution, and Execution Gating in Autonomous Agent Systems

操作化重构权威:自主智能体系统中的运行时构建、依赖解析与执行门控

Marcelo Fernandez - TraslaIA

机构 * TraslaIA

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出一种运行时执行模型,通过动态依赖解析和恢复循环,确保动作仅在当前状态可构建权威时执行,从而保证安全性和条件活性。

Comments Agent Governance Series, Paper P6. Companion papers on arXiv: P0 (2604.17511), P1 (2603.18829), P2 (2604.17517). P3/4 and P5 submitted concurrently (pending arXiv IDs). Zenodo: 10.5281/zenodo.19699460

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17198 2026-05-26 cs.LG cs.CL 62%

Structural Abstraction as an Inductive Bias for Non-Stationary Language Model Training

结构抽象作为非平稳语言模型训练的归纳偏置

Elnaz Rahmati, Nona Ghazizadeh, Zhivar Sourati, Nina Rouhani, Morteza Dehghani

机构 * University of Southern California(南加州大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 提出抽象增强训练(AAT)方法,通过联合优化具体实例及其结构抽象,减少灾难性干扰并提升关系泛化能力,在非平稳语言模型训练中验证了结构抽象作为稳定学习信号的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24580 2026-05-26 cs.CY 57%

From Replacement to Orchestration: A Socio-Technical Architecture for Agentic AI in Corporate R&D

从替代到编排:企业研发中代理型人工智能的社会技术架构

Haithem Boussaid, Marc Heemskerk, Jimmy Siméon, Adam Breen, Merouane Debbah

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 针对企业研发中的生产力悖论(如Eroom定律),提出HARMONY社会技术架构,通过认知负荷再分配和有界自主性设计,引入科学企业家角色和编排杠杆指标,以提升人类-代理混合系统的研发产出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24319 2026-05-26 cs.LG 57%

Omissive Bias in Religious Representation: Benchmarking LLM Answers to Everyday Ethical Decision-making

宗教表征中的省略偏见:评估LLM在日常伦理决策中的回答

David Wingate, Sheryl Carty, Joshua Coates, Daniel Feldman, Nancy Fulda, Larry Howell, Brett Israelson, Dallin Jacobs, Jonathan Karr, John Paul Kimes, Elisabeth Kincaid, Paul Martens, Gavin Mobley, Suzana Pinheiro, Lindsay Slemboski, Peter Whiting

机构 * Brigham Young University Baylor University University of Notre Dame Yeshiva University

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 通过构建AllFaith宗教表征基准,评估LLM在回答日常伦理问题时是否提及宗教,发现模型普遍存在省略宗教框架的偏见,尤其在个人实际情境中更为明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12961 2026-05-26 cs.CV cs.LG 57%

Reducing Bias and Variance: Generative Semantic Guidance and Bi-Layer Ensemble for Image Clustering

减少偏差与方差:用于图像聚类的生成语义引导与双层集成

Feijiang Li, Zhenxiong Li, Jieting Wang, Zizheng Jiu, Saixiong Liu, Liang Du

机构 * Institute of Big Data Science and Industry(大数据科学与产业研究院) Key Laboratory of Evolutionary Science Intelligence of Shanxi Province(山西省进化智能科学重点实验室) School of Artificial Intelligence, Shanxi University(山西大学人工智能学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 提出GSEC框架,通过生成语义引导减少偏差、双层集成学习降低方差,在六个基准数据集上超越18种最新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24729 2026-05-26 cs.HC 50%

"It Felt a Bit Eerie": Exploring Humanlike Interactions During Collaborative Writing with an Artificial Agent

"感觉有点诡异":与人工智能体协作写作中类人交互的探索

Michael Yin, Angela Chiang, Samuel Rhys Cox, Robert Xiao

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 通过构建三种不同类人程度的AI辅助编辑器并开展用户研究,探讨协作的时间与视觉维度如何影响写作体验及人机社会连接。

Comments 29 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏