arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-30 至 2026-07-30 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 5 篇

2512.04480 2026-07-30 cs.AI cs.CE cs.SY eess.SY math.OC 70%

Prescriptive Artificial Intelligence: A Formal Paradigm for Auditing Human Decisions Under Uncertainty

规范性人工智能:一种用于在不确定性下审计人类决策的正式范式

Pedro Passos

机构 * Institute of Computing, Universidade Federal Fluminense (UFF)(联邦弗鲁米嫩塞大学计算研究所)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出规范性人工智能作为高风险环境下的人类-人工智能决策协作范式,通过四个公理证明了其与预测系统的核心区别,并展示了在决策模仿中系统性偏差的限制。

Comments Preprint; suitable for AI, decision sciences, and prescriptive analytics. Short versions published in Wharton Sports Analytics Journal Fall 2025 (AI Feature Spotlight) and accepted to AAAI Bridge on LM Reasoning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26317 2026-07-30 cs.CY cs.AI cs.CL 新提交 67%

Aligning LLM-Simulated and Human Examinees for Psychometric Calibration: A Cognitive Diagnostic Profiling Approach

对齐大语言模型模拟与人类应试者的心理测量校准:一种认知诊断画像方法

Wenjie Zhou, Yunting Liu, Renjiao Tang, Mark Wilson

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 该研究提出认知诊断画像(CDP)零样本框架,优化LLM模拟应试者的心理测量对齐,在Tatsuoka分数减法数据集上提升了能力分布、掌握画像及题目难度与人类的匹配度,助力LLM模拟应试者用于测试开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26481 2026-07-30 cs.LG eess.SP 新提交 57%

Conformal Changepoint Localization and Root Cause Analysis with Corrupted Observations

含损坏观测值的保序变点定位与根因分析

Seunghun Yu, Meiyi Zhu, Petar Popovski, Joonhyuk Kang, Osvaldo Simeone

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) King’s College London(伦敦国王学院) Aalborg University(奥尔堡大学) Northeastern University London(伦敦东北大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文针对含损坏观测值的系统,提出加权CONCH与加权CROC方法,结合元学习优化权重,可在保证置信集目标覆盖率的前提下缩小其规模,提升变点定位与根因分析的实用性。

Comments 34 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23442 2026-07-30 cs.CL 版本更新 57%

Do LLM Debates Repeat Arguments Differently Across Languages?

大语言模型辩论在不同语言中重复论点的方式是否不同?

Huiqian Lai

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 研究大语言模型辩论在不同语言中重复论点的差异,用“先验论点相似度”方法,发现在多语言嵌入模型中中文与英文有正向差距,该差距在多种条件下持续,多样性提示未显著缩小差距,建议多语言辩论评估衡量论证发展并报告缓解效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26647 2026-07-30 cs.CV 新提交 50%

Anchoring and Steering Diffusion: Enhancing the Faithfulness of Text-to-Image Generation at Inference Time

锚定与引导扩散:在推理时提升文生图生成的忠实度

Xinyi Wang, Yuyang Huang, Yalin Su, Pengcheng Luan, Tao Zhang, Feiming Wei, Wenxian Yu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 提出无训练框架AnchorSteer,通过语义锚定与反射引导组件改进文生图扩散模型的推理,在GenEval等基准上提升文本-图像对齐性能且保持视觉质量。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏