arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-15 至 2026-04-15 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 8 篇

2604.12076 2026-04-15 cs.CL cs.AI cs.CY 82%

Narrative over Numbers: The Identifiable Victim Effect and its Amplification Under Alignment and Reasoning in Large Language Models

数字之外的叙事:可识别受害者效应及其在对齐和推理中的放大

Syed Rifat Raiyan

机构 * Systems and Software Lab (SSL), Department of Computer Science and Engineering(系统与软件实验室(SSL),计算机科学与工程系)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究探讨了大语言模型中可识别受害者效应的普遍存在及其受对齐训练的影响,发现指令调优模型表现出极端效应,而推理专精模型则逆转了该效应,且标准CoT提示放大了该效应。

Comments Under review, 49 pages, 20 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12851 2026-04-15 cs.CY 79%

Can Persona-Prompted LLMs Emulate Subgroup Values? An Empirical Analysis of Generalisability and Fairness in Cultural Alignment

基于人物提示的LLM能否模拟子群体价值观?对文化契合性一般性和公平性的实证分析

Bryan Chen Zhengyu Tan, Zhengyuan Liu, Xiaoyuan Yi, Jing Yao, Xing Xie, Nancy F. Chen, Roy Ka-Wei Lee

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CY

AI总结 本文探讨LLM在细粒度价值观对齐中的挑战,通过新加坡案例研究发现,即使使用GPT-4.1等先进模型,预测子群体偏好准确率仅57.4%,但通过结构化数值偏好微调可提升17.4%,但存在预存的公平性偏见。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10200 2026-04-15 cs.AI cs.CV 70%

Edu-MMBias: A Three-Tier Multimodal Benchmark for Auditing Social Bias in Vision-Language Models under Educational Contexts

Edu-MMBias: 一种三级多模态基准,用于在教育背景下审计视觉-语言模型中的社会偏见

Ruijia Li, Mingzi Zhang, Zengyi Yu, Yuang Wei, Bo Jiang

机构 * School of Computer Science and Technology, East China Normal University(东华师范大学计算机科学与技术学院) Shanghai Institute of Artificial Intelligence for Education, East China Normal University(东华师范大学教育人工智能研究所) Faculty of Education, East China Normal University(东华师范大学教育学院)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出Edu-MMBias基准,通过三级维度审计视觉-语言模型中的社会偏见,揭示模型存在补偿性类偏见和深层健康与种族刻板印象,视觉输入可触发偏见回潮。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11839 2026-04-15 cs.CR cs.AI 61%

Beyond Static Sandboxing: Learned Capability Governance for Autonomous AI Agents

超越静态沙箱:为自主AI代理的学得能力治理

Bronislav Sidik, Lior Rokach

机构 * Institute for Applied AI Research(应用人工智能研究所) Faculty of Computer and Information Science(计算机与信息科学学院) Ben-Gurion University of the Negev(贝内-约尔大学)

专题命中 AI治理与伦理 :safety(abstract,comments);分类 cs.AI

AI总结 本文提出Aethelgard框架,通过学得策略实现AI代理的最小必要能力集,解决能力过度配置问题。

Comments 17 pages (9 content pages), 2 figures, 7 tables. Submitted to NeurIPS 2026 Agent Safety Workshop. Code and dataset available at https://github.com/sidikbro/aethelgard

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05972 2026-04-15 cs.CY 57%

THETA: A Textual Hybrid Embedding-based Topic Analysis Framework and AI Scientist Agent for Scalable Computational Social Science

THETA: 一种基于文本混合嵌入的主题分析框架和AI科学家代理用于可扩展的计算社会科学

Zhenke Duan, Xin Li

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 THETA通过Domain-Adaptive Fine-tuning优化语义向量结构,结合AI Scientist Agent框架实现主题分析的理论深度与数据规模的平衡,实验显示其在捕捉领域特定解释性构念方面优于传统模型。

Comments we should change the authors and some results

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12133 2026-04-15 cs.AI 57%

Towards Platonic Representation for Table Reasoning: A Foundation for Permutation-Invariant Retrieval

迈向表格推理的柏拉图表示:一种排列不变检索的基础

Willy Carlos Tchuitcheu, Tan Lu, Ann Dooms

机构 * Department of Mathematics and Data Science, Vrije Universiteit Brussel (VUB)(瓦隆公国布鲁塞尔自由大学数学与数据科学系) Data Science Lab, Royal Library of Belgium (KBR)(比利时皇家图书馆数据科学实验室)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出柏拉图表示假设,主张表格推理需要内在排列不变的潜在空间,通过分析和实验揭示了现有模型在布局变化下的脆弱性,并提出结构感知的表格推理编码器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11934 2026-04-15 cs.CY 57%

BiasIG: Benchmarking Multi-dimensional Social Biases in Text-to-Image Models

BiasIG:评估文本到图像模型中多维社会偏见的基准测试

Hanjun Luo, Zhimu Huang, Haoyu Huang, Ziye Deng, Ruizhe Chen, Xinfeng Li, Zuozhu Liu, Hanan Salam

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 本文提出BiasIG基准,通过47040个提示的定制数据集量化多维社会偏见,结合社会学和机器伦理框架,揭示生成偏见的细粒度诊断方法,并验证了公平性在AIGC中的精确分类方法。

Comments Accepted by IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08740 2026-04-15 econ.TH 50%

Misspecified Model Estimation and Its Impact on Predictions

模型误设估计及其对预测的影响

Junnan He, Lin Hu, Matthew Kovach, Anqi Li

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 研究线性统计模型中,因变量依赖于具有固定总体系数和观察特定潜系数的自变量及测量误差。决策者估计总体系数并用于预测给定观察的潜系数。分析模型误设如何扭曲预测,探讨残差信息与误设向量与潜变量到系数映射的对齐性影响。

详情

展开后加载摘要…

URL PDF HTML 收藏