arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-08 至 2026-06-08 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 4 篇

2606.06972 2026-06-08 cs.AI 新提交 74%

Accounting for Context: Shaping Moral Credences for Value Alignment

考虑情境:塑造道德信念以实现价值对齐

Jazon Szabo, Sanjay Modgil

机构 * University of Oxford(牛津大学)

专题命中 幻觉与事实性 :alignment(title);分类 cs.AI

AI总结 本文针对价值对齐中道德多元性问题,提出在聚合道德评估时必须考虑情境因素,并形式化道德不确定性下的决策,揭示弱帕累托原则的违反是辛普森悖论的一种变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07441 2026-06-08 cs.CL 新提交 57%

Sycophantic Praise: Evaluating Excessive Praise in Language Models

谄媚式赞美:评估语言模型中的过度赞美

Daniel Vennemeyer, Phan Anh Duong, Meryl Ye, Ruihong Huang, Tianyu Jiang

机构 * University of Cincinnati(辛辛那提大学) Carnegie Mellon University(卡内基梅隆大学) Texas A&M University(德克萨斯大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 提出参数化框架衡量赞美是否过度,发现谄媚式赞美在社交和解释性领域远多于客观推理领域,且现有方法无法可靠测量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07130 2026-06-08 cs.CL 新提交 57%

Explicit Evidence Grounding via Structured Inline Citation Generation

通过结构化内联引文生成实现显式证据基础

Anar Yeginbergen, Amelie Wührl, Anna Rogers, Rodrigo Agerri

机构 * University of the Basque Country (UPV/EHU)(巴斯克大学) IT University of Copenhagen(哥本哈根IT大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 提出FullCite框架,通过提示生成、约束解码和后处理跨度对齐三种策略生成结构化内联引文,在三个QA基准上评估引文质量和忠实性,发现LLMs虽能识别相关文档但难以精确定位支持性证据跨度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07113 2026-06-08 cs.AI 新提交 57%

Beyond Post-hoc Explanation: Toward Glassbox AI via Probabilistic Mediation

超越事后解释:通过概率中介迈向玻璃箱AI

Manuele Leonelli

机构 * Manuele Leonelli(曼努埃尔·莱奥内利)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 针对大语言模型在关键领域的不透明性,提出玻璃箱框架,利用贝叶斯网络作为事前中介层,实现可审计推理、不确定性量化和可争议输出。

详情

展开后加载摘要…

URL PDF HTML 收藏