arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-15 至 2026-05-15 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 3 篇

2605.15164 2026-05-15 cs.LG cs.AI 81%

Position: Behavioural Assurance Cannot Verify the Safety Claims Governance Now Demands

位置:行为保证无法验证当前安全主张所要求的治理

Pratinav Seth, Vinay Kumar Sankarapu

机构 * Lexsi Labs(Lexsi实验室)

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文指出行为保证无法验证安全主张,现有治理框架要求验证隐含目标、抗失控前兆和有限灾难能力,但现有方法仅能验证可观测输出,无法验证隐含表示和长期行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09612 2026-05-15 cs.HC 71%

When Thinking Pays Off: Incentive Alignment for Human-AI Collaboration

思考有回报:人机协作中的激励对齐

Joshua Holstein, Patrick Hemmer, Gerhard Satzger, Wei Sun

专题命中 AI治理与伦理 :alignment(title)

AI总结 研究探讨了人机协作中激励结构对过度依赖AI的影响,提出新的激励机制减少过度依赖,通过实验验证其有效性,强调激励设计需与任务和互补性对齐。

Comments Accepted at the 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14486 2026-05-15 cs.CV 50%

Reduce the Artifacts Bias for More Generalizable AI-Generated Image Detection

降低艺术偏差以提高通用性的人工智能生成图像检测

Yiheng Li, Yang Yang, Zichang Tan, Gao Li, Zhen Lei, Wenhao Wang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部门) Sangfor Technologies Inc.(Sangfor技术公司) China Mobile Financial Technology Co., Ltd.(中国移动金融科技有限公司) CAIR, HKSIS, Chinese Academy of Sciences(中国科学院CAIR、HKSIS部门) SCSE, FIE, M.U.S.T, Macau, China(澳门SCSE、FIE、M.U.S.T部门) Vast Intelligence Lab, Sydney, Australia(悉尼澳大利亚Vast Intelligence Lab)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文提出SEF框架,通过分离专家融合减少领域干扰,提升AI生成图像检测的通用性与鲁棒性,实验表明在13个基准上表现优异。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏