arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-22 至 2026-04-22 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 5 篇

2604.19548 2026-04-22 cs.CL cs.AI cs.CY 82%

Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment

通过辩证对齐平息代理中的行动者-观察者不对称性

Bobo Li, Rui Wu, Zibo Ji, Meishan Zhang, Hao Fei, Min Zhang, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(国立新加坡大学) Sichuan University(四川大学) University of Minnesota Twin Cities(明尼苏达大学双城分校) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校) University of Oxford(牛津大学)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出ReTAS模型,通过辩证对齐方法减少代理中的行动者-观察者不对称性,提升故障解决能力。

Comments ACL 2026 Main Conference. Project page: https://unikcc.github.io/ReTAS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15895 2026-04-22 cs.HC 78%

Co-Constructing Alignment: A Participatory Approach to Situate AI Values

共构对齐:一种参与式方法以定位AI价值观

Anne Arzberger, Enrico Liscio, Maria Luce Lupetti, Inigo Martinez de Rituerto de Troya, Jie Yang

专题命中 AI治理与伦理 :alignment(title,abstract)

AI总结 本文通过参与式工作坊探讨用户如何参与AI价值观对齐过程,发现用户更倾向于将对齐视为一种持续的、情境化的共同实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16369 2026-04-22 cs.CY cs.AI cs.CL 67%

Why AI Readiness Is an Organizational Learning Problem, Not a Technology Purchase

为何人工智能准备性是组织学习问题,而非技术采购问题

Jeanne McClure, Gregg Gerdau

机构 * Ars Innovate Technology and Consulting(Ars Innovate技术与咨询) Matador Advisors(Matador顾问) NC State University(北卡罗来纳州立大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文指出,人工智能项目失败本质上是组织学习问题而非技术不足,提出SIO模型指导企业AI能力发展。

Comments 8 Pages 2 figures 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21080 2026-04-22 cs.CL cs.AI cs.CY 67%

InsideOut: Measuring and Mitigating Insider-Outsider Bias in Interview Script Generation

InsideOut: 评估和缓解面试脚本生成中的内部-外部偏见

Yixin Wan, Xingrun Chen, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出InsideOut基准,通过文化情境面试脚本生成任务量化LLM的内部-外部偏见,采用三种评估指标,并提出基于代理的MFA框架缓解偏见,实验表明MFA方法显著降低偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18729 2026-04-22 cs.CL 57%

Investigating Counterfactual Unfairness in LLMs towards Identities through Humor

通过幽默探讨语言模型中身份相关的反事实不公平性

Shubin Kim, Yejin Son, Junyeong Park, Keummin Ka, Seungbeen Lee, Jaeyoung Lee, Hyeju Jang, Alice Oh, Youngjae Yu

机构 * Yonsei University(延世大学) KAIST(韩国科学技术院) Seoul National University(首尔国立大学) Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文通过观察在保持其他因素不变的情况下交换说话者和被指对象,研究语言模型在幽默生成拒绝、说话者意图推断及社会影响预测中的反事实不公平性,揭示身份相关的偏见模式。

Comments Accepted to ACL 2026 Main Conference. The first two authors contributed equally. The last three authors are co-corresponding authors

详情

展开后加载摘要…

URL PDF HTML 收藏