arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-11 至 2026-05-11 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 7 篇

2605.06908 2026-05-11 cs.LG cs.AI 62%

Same Signal, Opposite Meaning: Direction-Informed Adaptive Learning for LLM Agents

同信号,异意义:方向感知的自适应学习用于大语言模型代理

Ziming Li, Jiatan Huang, Xiaoguang Guo, Guilin Wang, Chuxu Zhang

机构 * University of Connecticut(康奈尔大学) New Jersey Institute of Technology(新泽西理工学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DIAL方法,通过方向感知的自适应学习解决LLM代理中计算需求与计算适宜性差异问题,提升性能-成本平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09839 2026-05-11 cs.AI cs.LG 62%

Steered LLM Activations are Non-Surjective

引导的LLM激活不是满射的

Aayush Mishra, Daniel Khashabi, Anqi Liu

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了激活引导是否能通过文本提示实现,证明引导行为在实际中无法通过提示复现,区分了白盒引导与黑盒提示的差异。

Comments 10 pages main text. ICLR 2026 Workshops (Sci4DL, Re-Align)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13224 2026-05-11 cs.AI cs.CL 62%

A Geometric Taxonomy of Hallucinations in LLMs

大语言模型幻觉的几何分类

Javier Marín

机构 * Javier Marín

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于嵌入空间几何的幻觉检测方法,通过三种操作类型区分可检测与不可检测的幻觉,验证了在不同领域数据集上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07671 2026-05-11 cs.GT cs.AI cs.MA econ.TH math.OC 57%

The Endogeneity of Miscalibration: Impossibility and Escape in Scored Reporting

误校准的内生性:在评分报告中的不可能性与逃避

Lauri Lovén, Sasu Tarkoma

机构 * Future Computing Group, University of Oulu(未来计算组,奥卢大学) University of Oulu(奥卢大学) University of Helsinki(赫尔辛基大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 研究探讨了在评分报告中如何避免误校准的内生性问题,发现使用非线性批准函数可实现最优监督,但会导致诚实报告次优。提出通过阶梯状批准阈值可实现最优筛选,尤其在布里尔评分下,二阶效用等价性独特。

Comments 38 pages, no figures. Targeting ACM Transactions on Economics and Computation (TEAC); preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07613 2026-05-11 cs.CL 57%

Intent-Driven Semantic ID Generation for Grounded Conversational News Recommendation

基于意图的语义ID生成用于 grounded 对话新闻推荐

Hongyang Su, Beibei Kong, Lei Cheng, Chengxiang Zhuo, Zang Li, Chenyun Yu

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Platform and Content Group, Tencent(腾讯平台与内容部)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本文提出意图驱动的语义ID生成方法,通过多任务对齐和GPT-4链式推理蒸馏,实现意图到层级SID前缀的映射,提升新闻推荐的 grounded 性和冷启动用户推荐效果。

Comments Accepted at ACL 2026 Industry Track (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08031 2026-05-11 cs.CV 50%

Object Hallucination-Free Reinforcement Unlearning for Vision-Language Models

面向视觉语言模型的无对象幻觉强化反学习

Kaidi Jia, Yujie Lin, Chengyi Yang, Jiayao Ma, Jinsong Su

机构 * Xiamen University(厦门大学)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出HFRU框架,通过视觉编码器深度语义删除,结合对齐破坏与GRPO优化,实现高效反学习,减少对象幻觉,实验显示在目标识别和人脸识别任务中性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06988 2026-05-11 cs.MA cs.IT cs.RO math.IT 50%

The Cost of Consensus: Malignant Epistemic Herding and Adaptive Gating in Distributed Multi-Agent Search

共识的成本:恶意认知从众与自适应门控在分布式多智能体搜索中的问题

David Farr, Iain Cruickshank, Kate Starbird, Jevin West

机构 * Information School, University of Washington(华盛顿大学信息学院) Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学系) Human Centered Design Engineering, University of Washington(华盛顿大学人本设计工程系)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 研究探讨了在分布式多智能体搜索中,通信频率和内容如何共同影响集体信念状态,提出认知对齐的概念,分析了通信设计对集体推理的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏