arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-31 至 2026-07-31 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 4 篇

2607.27232 2026-07-31 cs.CL cs.AI cs.CY cs.LG 新提交 83%

Sympathetic Framing: Evaluating AI Alignment across Sociodemographic Groups

共情框架:跨社会人口统计群体评估AI对齐

Haran Shani-Narkiss, Michael Fire, Oren Tsur

机构 * University College London(伦敦大学学院) Ben Gurion University of the Negev(内盖夫本古里安大学)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 该研究评估7款LLMs对新闻标题情感框架的理解与人类的对齐度,发现不同模型相关性差异大,领先模型总体对齐但存在人口统计组差异,凸显AI对齐的非普遍性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28094 2026-07-31 cs.AI 新提交 57%

An Instrument to Evaluate Governance Proposals: AI Policy Analysis at Scale

一种用于评估治理提案的工具:规模化AI政策分析

Paulo Carvao, Claudio Mayrink Verdun, Isabel Adler, Jeffrey Zhou

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种AI政策分析框架,结合专家见解与计算分析,以领域校准模型为基准评估商业LLM,助力用户评估AI治理提案的属性一致性,支持政策制定等人员应对复杂环境。

Comments 48 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27744 2026-07-31 cs.AI 版本更新 57%

A Policy-Driven Runtime Layer for Agentic LLM Serving

一种面向智能体LLM服务的策略驱动运行时层

Rui Zhang, Chaeeun Kim, Liting Hu

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 针对多智能体LLM系统中跨层策略难以高效实现的问题,提出在框架与引擎之间插入智能体运行时层,通过四个原语支持任意智能体感知策略,并在KV缓存策略CacheSage上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18687 2026-07-31 econ.GN cs.AI cs.GT q-fin.EC 版本更新 57%

When Do AI Gains Become Broadly Shareable? A Policy Threshold for AI-Driven Automation

为AI自动化经济中的租金资助型全民基本收入设定AI能力阈值

Aran Nayebi

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 该研究为AI自动化经济中通过AI能力阈值可持续资助UBI提供了闭式条件,并探讨了政策工具和市场结构对阈值的影响。

Comments 15 pages, 3 figures. To appear in AI, Ethics, and Society (AIES) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏