arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-20 至 2026-03-20 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 5 篇

2603.18353 2026-03-20 cs.AI 70%

Interpretability without actionability: mechanistic methods cannot correct language model errors despite near-perfect internal representations

无需可操作性:机制方法无法纠正语言模型错误,尽管内部表示几乎完美

Sanjay Basu, Sadiq Y. Patel, Parth Sheth, Bhairavi Muralidharan, Namrata Elamaran, Aakriti Kinra, John Morgan, Rajaie Batniji

机构 * University of California San Francisco(加州大学旧金山分校) Waymark University of Pennsylvania(宾夕法尼亚大学) Virginia Commonwealth University(弗吉尼亚 Commonwealth 大学) Stanford University(斯坦福大学)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 研究探讨了机制解释方法在纠正语言模型错误中的有效性,发现尽管内部表示接近完美,但现有方法无法有效将知识转化为正确输出,揭示了AI安全框架中的潜在问题。

Comments 27 pages, 5 figures, 10 tables. Code available at https://github.com/sanjaybasu/interpretability-triage

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18895 2026-03-20 cs.HC cs.AI cs.LG 62%

From Accuracy to Readiness: Metrics and Benchmarks for Human-AI Decision-Making

从准确到准备:人类-人工智能决策的度量与基准

Min Hun Lee

机构 * Singapore Management University(新加坡国立大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出评估人类-人工智能决策的度量框架,聚焦团队准备度,引入四类评价指标并连接人类-人工智能上boarding生命周期,通过交互轨迹评估校准、错误恢复与治理。

Comments ACM CHI 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02290 2026-03-20 cs.CL cs.AI 62%

Hallucination or Creativity: How to Evaluate AI-Generated Scientific Stories?

幻觉或创造力:如何评估AI生成的科学故事?

Alex Argese, Pasquale Lisena, Raphaël Troncy

机构 * EURECOM

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出StoryScore指标,用于评估AI生成的科学故事,结合语义对齐、词汇 grounding、叙事控制等方法,解决传统指标无法区分教育创造力与事实错误的问题。

Journal ref Proceedings of the Text2Story'26 Workshop, Delft (The Netherlands), 29-March-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09734 2026-03-20 cs.CL cs.AI 62%

From Detection to Diagnosis: Advancing Hallucination Analysis with Automated Data Synthesis

从检测到诊断:通过自动化数据合成推进幻觉分析

Yanyi Liu, Qingwen Yang, Tiezheng Guo, Feiyu Qu, Jun Liu, Yingyou Wen

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出从检测到诊断的新范式,通过自动化数据合成生成高质量训练样本,训练出HDM-4B-RL模型,在幻觉诊断任务中超越现有检测模型,实现更可靠的生成式AI系统。

Comments Accepted at The 40th Annual AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06265 2026-03-20 cs.CL 57%

Large Language Models Hallucination: A Comprehensive Survey

大语言模型幻觉:全面调查

Aisha Alansari, Hamzah Luqman

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL

AI总结 本文全面调查大语言模型中的幻觉现象,分析其成因、检测与缓解方法,探讨现有评估指标及未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏