arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-17 至 2026-04-17 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 6 篇

2604.09665 2026-04-17 cs.LG cs.AI 88%

Deliberative Alignment is Deep, but Uncertainty Remains: Inference time safety improvement in reasoning via attribution of unsafe behavior to base model

深度对齐但不确定性依然存在:通过将不安全行为归因于基础模型来改进推理时间的安全性

Pankayaraj Pathmanathan, Furong Huang

机构 * University of Maryland College Park(马里兰大学学院市)

专题命中 幻觉与事实性 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了对齐对语言模型安全性和通用性的影响,提出BoN采样方法将不安全行为归因于基础模型,减少多个安全基准的攻击成功率,同时保持实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05024 2026-04-17 stat.ME cs.AI cs.LG 62%

Model-Free Assessment of Simulator Fidelity via Quantile Curves

通过分位数曲线进行无模型的模拟器保真度评估

Garud Iyengar, Yu-Shiou Willy Lin, Kaizheng Wang

机构 * Department of IEOR and Data Science Institute, Columbia University(工业工程与数据科学学院,哥伦比亚大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过分位数曲线评估模拟器保真度,构建置信区间以估计潜变量参数差异,支持统计推断和风险测量,适用于多种输出空间。

Comments 39 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14829 2026-04-17 cs.AI 57%

Beyond Literal Summarization: Redefining Hallucination for Medical SOAP Note Evaluation

超越字面总结:重新定义医疗SOAP笔记评估中的幻觉

Bhavik Vachhani, Kush Shrisvastava, Pranshu Nema, Sai Chiranthan

机构 * Augnito Research(Augnito研究)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 本文提出通过校准提示和基于医学本体的检索,重新定义医疗SOAP笔记评估中的幻觉,发现传统评估方法高估了幻觉率,影响模型评估。

Comments 12 pages, 2 figures,3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20151 2026-04-17 cs.CL 57%

BoundRL: Efficient Structured Text Segmentation through Reinforced Boundary Generation

BoundRL: 通过强化边界生成实现高效的结构化文本分段

Haoyuan Li, Zhengyuan Shen, Sullam Jeoung, Yueyan Chen, Jiayu Li, Qi Zhu, Shuai Wang, Vassilis Ioannidis, Huzefa Rangwala

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Amazon Web Services(亚马逊网络服务)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本文提出BoundRL,一种高效处理长结构化文本的分段与标签预测方法,通过强化学习优化文档重建和语义对齐,减少输出token并降低幻觉风险,实验证明其在复杂提示下优于其他基线方法。

Comments accepted by ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14795 2026-04-17 cs.RO 50%

Keep It CALM: Toward Calibration-Free Kilometer-Level SLAM with Visual Geometry Foundation Models via an Assistant Eye

保持冷静:通过视觉几何基础模型实现无校准的千米级SLAM

Tianjun Zhang, Fengyi Zhang, Tianchen Deng, Lin Zhang, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, and Shanghai Key Laboratory of Navigation and Location Based Services, Shanghai Jiao Tong University(自动化与智能感知学院,导航与位置服务上海市重点实验室,上海交通大学) School of Electrical Engineering and Computer Science, The University of Queensland(电气工程与计算机科学学院,昆士兰大学) School of Computer Science and Technology, Tongji University(计算机科学与技术学院,同济大学)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出CAL2M框架,通过引入'助手眼'消除尺度模糊,利用epipolar引导模型修正内参和姿态,结合锚点传播实现全局一致的映射,解决传统方法在千米级SLAM中的精度问题。

Comments 19 pages, 8 figures, submitted to IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14360 2026-04-17 cs.CR cs.DC cs.SY eess.SY 50%

Digital Guardians: The Past and The Future of Cyber-Physical Resilience

数字守护者:网络物理系统过去与未来的韧性

Saurabh Bagchi, Hyunseung Kim, Tarek Abdelzaher, Homa Alemzadeh, Somali Chaterji, Glen Chou, Yuying Duan, Fanxin Kong, Michael Lemmon, Yin Li, Mengyu Liu, Wenhao Luo, Meiyi Ma, Sibin Mohan, Ayan Mukhopadhyay, Melkior Ornik, Dimitra Panagou, Kristin Yvonne Rozier, Ivan Ruchkin, Huajie Shao, Sze Zheng Yong, Majid Zamani, Xugui Zhou

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文探讨了网络物理系统韧性的核心挑战与方法,涵盖系统属性、学习赋能系统、主动措施、恢复机制及人类角色,通过智能交通与医疗系统案例,提供复杂环境下的韧性实现路径。

Comments Submitted to ACM CSUR; 32 pages + 10 pages of references

详情

展开后加载摘要…

URL PDF HTML 收藏