arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-10 至 2026-08-10 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 4 篇

2608.07367 2026-08-10 cs.AI 新提交 79%

People Are Not Just Their Countries. Disentangling Social Determinants of LLM Value Alignment Across Europe

人不只是其所属国家:在欧洲范围内解耦大型语言模型(LLM)价值对齐的社会决定因素

Maria-Louisa Wightman, Guillaume Bied, Tijl De Bie

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI

AI总结 本研究依托欧洲社会调查,发现LLMs与不同社会人口学群体的价值观对齐存在差异,国籍作为单独变量的解释力与全部社会人口学变量相当,国家与社会人口学因素在解释对齐模式上互补。

Comments Accepted at AIES 2026 (9th AAAI/ACM Conference on AI, Ethics, and Society)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05726 2026-08-10 cs.CL cs.AI 交叉投稿 62%

Mitigating Scoring Bias in LLM-as-a-Judge via Random Number Generation

通过随机数生成缓解作为评判者的大语言模型(LLM-as-a-Judge)中的评分偏差

Yuma Asato, Kiyoaki Shirai, Natthawut Kertkeidkachorn

机构 * Japan Advanced Institute of Science and Technology(日本先进科学技术学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对LLM-as-a-Judge的评分偏差问题,提出通过随机数生成识别并校正LLM潜在数字偏差的方法,在四项任务上的表现优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20255 2026-08-10 cs.CR cs.AI 版本更新 57%

The Ethics of Autonomous AI Agents for Offensive Security

用于进攻性安全的自主人工智能代理的伦理问题

Andreas Happe, Jürgen Cito, Jasmin Wachter

机构 * TU Wien(维也纳技术大学) University of Klagenfurt(克雷格福大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 研究使用自主人工智能代理进行进攻性安全时的伦理问题,分析道德归因在多方的扩散及技术对利益相关者的影响,通过研究其不确定性等特性及攻防成本不对称性,为现有框架不适用于此情况提供分层建议。

Comments accepted at FAIEMA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06829 2026-08-10 cs.SE 新提交 50%

How Reasoning Shapes Social Bias in LLM-Generated Code?

推理如何塑造大语言模型生成代码中的社会偏见?

Weifeng Sun, Jieke Shi, Zhou Yang, Yuchen Chen, Hongyan Li, Meng Yan, David Lo

专题命中 AI治理与伦理 :trustworthy(abstract)

AI总结 该研究首次系统探究基于推理的代码生成中的社会偏见,发现推理可降低偏见但会影响代码质量,进而提出ProbeDebias框架,有效检测并缓解代码偏见,同时保持较高质量。

Comments ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏