arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-23 至 2026-06-23 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 7 篇

2606.22528 2026-06-23 cs.AI 新提交 79%

Governance Decay: How Context Compaction Silently Erases Safety Constraints in Long-Horizon LLM Agents

治理衰减:上下文压缩如何悄然消除长周期LLM智能体中的安全约束

Shiyang Chen

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI

AI总结 研究发现LLM智能体的上下文压缩机制会无意中移除安全约束,导致违规行为;提出ConstraintRot基准和Constraint Pinning缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21619 2026-06-23 cs.SE cs.LG cs.PL 新提交 79%

The Alignment Problem in Constrained Code Generation

约束代码生成中的对齐问题

Matteo Biagiola, Jahrim Gabriele Cesario, Luca Di Grazia, George Zakhour, Guido Salvaneschi

机构 * University of St. Gallen(圣加尔登大学) Università della Svizzera italiana (USI)(瑞士联邦理工学院)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.LG

AI总结 研究约束解码中约束器、语言模型与目标语言之间的对齐问题,发现约束器的不完整性会扭曲模型分布,导致功能正确性下降高达97%,并提出设计约束器的定量见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15205 2026-06-23 cs.CY 版本更新 70%

A Peek Behind the Curtain: Using Step-Around Prompt Engineering to Identify Bias and Misinformation in GenAI Models

幕后窥探:使用逐步提示工程识别生成式AI模型中的偏见与虚假信息

Don Hickerson, Mike Perkins

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY

AI总结 本文探讨逐步提示工程作为对抗性提示技术,用于测试生成式AI的安全护栏和偏见缓解机制,并提出了学术伦理治理框架。

Comments v3 Substantial text changes and addition of structured framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22097 2026-06-23 cs.CL cs.AI 新提交 62%

Plurification in/of language technology -- The integration of culture in next-generation AI

语言技术中的/对语言技术的净化——下一代AI中的文化整合

Gertraud Koch, Fausto Giunchiglia

机构 * University of Hamburg(汉堡大学) University of Trento(特伦托大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨如何在自然语言处理中操作化“文化”,提出文化对齐需要多元认识论,而非仅添加“其他文化”示例,并通过技术活动五层模型分析现有方法,指出多数方法仅停留在输出或表征层面,需转向反思性多元社会技术路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20699 2026-06-23 cs.MA cs.AI cs.CY 新提交 62%

Structural Distinguishability of Static and Adaptive Policy Regimes in Agent-Based Regulatory Simulation

基于智能体的监管模拟中静态与自适应政策机制的结构可区分性

Roberto Garrone

机构 * Open University of Cyprus(塞浦路斯开放大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文通过可配置的排放监管ABM基准,比较四种政策-智能体机制,揭示自适应政策与智能体交互导致监管结论差异,提出机制可区分性评估方法。

Comments 19 pages, 4 figures, 9 tables. Simulation-based methodological study

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09354 2026-06-23 cs.HC cs.AI 版本更新 57%

"Is This Really a Human Peer Supporter?": Misalignments Between Peer Supporters and Experts in LLM-Supported Interactions

“这真的是人类同伴支持者吗?”:同伴支持者与专家在LLM支持互动中的错位

Kellie Yu Hui Sim, Roy Ka-Wei Lee, Kenny Tsu Wei Choo

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 研究通过混合方法评估LLM模拟求助者、生成建议和实时情绪可视化系统,发现同伴支持者与心理健康专家在识别求助信号和给予建议上存在关键错位,凸显标准化培训需求。

Comments Accepted at CSCW 2026. 53 pages, 12 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05985 2026-06-23 cs.CY cs.CV 版本更新 57%

Generating Fearful Images: Investigating Potential Emotional Biases in Image-Generation Models

生成恐惧图像:探究图像生成模型中的潜在情感偏差

Maneet Mehta, Cody Buntain

机构 * Yale University(耶鲁大学) University of Maryland(马里兰大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 研究生成式AI模型在图像情感表达中的偏差,发现Stable Diffusion、ChatGPT和Gemini等模型生成的图像普遍倾向于引发恐惧情绪,表明存在系统性偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏