arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-25 至 2026-05-25 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 5 篇

2605.23315 2026-05-25 cs.CL cs.AI 62%

Convergence Without Understanding: When Language Models Agree on Representations but Disagree on Reasoning

没有理解的趋同:当语言模型在表示上一致但在推理上分歧时

Muhammad Usama, Dong Eui Chang

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过分析16个语言模型在800个推理问题上的表示相似性,发现模型在表示上趋同但推理策略不同,表明表示趋同反映的是共享的输入处理约束而非共享的推理策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23043 2026-05-25 cs.CL stat.ML 57%

HawkesLLM: Semantic Uncertainty Propagation in Agentic Text Simulation

HawkesLLM:智能体文本模拟中的语义不确定性传播

Zewei Deng, Tinghan Ye, Liyan Xie

机构 * Department of Industrial and Systems Engineering, University of Minnesota(工业与系统工程系,明尼苏达大学) H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(H. Milton Stewart工业与系统工程学院,佐治亚理工学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 提出HawkesLLM框架,通过多变量Hawkes过程建模时间影响与文本生成分离,解决智能体文本模拟中语义不确定性路径依赖问题,在GDELT新闻级联案例中提升后期语义对齐。

Comments 10 pages, 4 figures, Accepted at the ICML 2026 Workshop on Statistical Frameworks for Uncertainty in Agentic Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02719 2026-05-25 cs.LG 57%

An Empirical Analysis of Calibration and Selective Prediction in Multimodal Clinical Condition Classification

多模态临床状况分类中的校准与选择性预测的实证分析

L. Julián Lechuga López, Farah E. Shamout, Tim G. J. Rudner

机构 * New York University(纽约大学) University of Toronto(多伦多大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本研究通过实证分析多标签临床状况分类中基于不确定性的选择性预测,发现其性能可能严重下降,原因是类别依赖的误校准,尤其对少数类别,并强调需要校准感知评估来确保临床AI的安全性。

Comments 40 pages, 14 figures, 16 tables. Accepted as a conference paper at AHLI Conference on Health, Inference, and Learning (CHIL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21500 2026-05-25 cs.LG 57%

Task-Awareness Improves LLM Generations and Uncertainty

任务感知提升大语言模型生成与不确定性

Tim Tomov, Dominik Fuchsgruber, Stephan Günnemann

机构 * School of Computation, Information \& Technology, Technical University of Munich Munich Data Science Institute Munich Center for Machine Learning

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 提出在任务依赖的潜在结构中直接建模LLM输出,通过贝叶斯最优响应合成和贝叶斯风险量化不确定性,优于标准解码方法并改善与输出质量的校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23249 2026-05-25 cs.LG cs.AI 54%

Enhancing Deep Neural Network Reliability with Refinement and Calibration

通过精炼和校准增强深度神经网络的可靠性

Ramya Hebbalaguppe, Ajay Shastry, Soumya Suvra Ghosal, Chetan Arora

机构 * SIT, Indian Institute of Technology Delhi, New Delhi, India(印度理工学院德里SIT,新德里)

专题命中 幻觉与事实性 :分类 cs.AI、cs.LG;alignment(comments);trustworthy(comments)

AI总结 针对深度神经网络置信度不可靠的问题,提出一种通过监督对比学习显式优化精炼度的损失函数,并联合优化校准、精炼和准确性的统一训练框架RefCal,在CIFAR-100-LT数据集上显著提升性能。

Comments ICLR 2026, Trustworthy AI and Representational Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏