arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-30 至 2026-06-30 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 5 篇

2606.28963 2026-06-30 cs.CL cs.CY cs.LG 69%

Beyond the Mean: Three-Axis Fidelity for Aligning LLM-Based Survey Simulators from Small Pilot Data

超越均值:从小型试点数据对齐基于LLM的调查模拟器的三轴保真度

Eun Cheol Choi, Youngrae Kim, Prabhu Pugalenthi, Hong-En Chen, Bo-Ruei Huang

专题命中 幻觉与事实性 :alignment(abstract,comments);分类 cs.CL、cs.CY、cs.LG

AI总结 针对LLM模拟社会调查响应时的系统偏差,提出结构、边际和个体三轴保真度框架,通过提示、修正和微调三种方法对比,发现微调小型试点数据可实现平衡保真度,但保真度水平因子样本而异。

Comments 11 pages, 8 tables, 3 figures; Pluralistic Alignment @ ICML 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28817 2026-06-30 eess.SY cs.SY 67%

Trust-Calibrated Certified Repair for Physics-Constrained Decisions under Localized Model Misspecification

面向局部模型误设下物理约束决策的信任校准认证修复

Yifan Wang

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract)

AI总结 针对模型信任修复在局部模型误设下导致虚假安全的问题,提出信任校准认证修复(TCR),通过错误发现控制、测试门控收缩、不确定性比例安全裕度和认证修复程序,实现高可行性、低成本且可解释的修复。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28881 2026-06-30 cs.LG cs.AI 62%

An Integrated Machine Learning and Hierarchical Variance Decomposition Pipeline for Student Performance Prediction and Metacognitive Calibration on Multi-Signal Telemetry

一种用于多信号遥测的学生表现预测与元认知校准的集成机器学习与层次方差分解流水线

Gurdeep Singh Virdee

机构 * Fergana State Technical University(费尔干纳技术大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出UBP-CAP框架,集成LightGBM分类器、校准指标和交叉广义线性混合模型,引入预测-解释分歧指数(PEDI),在1195条记录上验证了系统性校准偏差和情境性校准特性。

Comments 11 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07965 2026-06-30 cs.AI cs.LG 62%

When Models Know When They Do Not Know: Calibration, Cascading, and Cleaning

当模型知道它不知道的时候:校准、级联和清洗

Chenjie Hao, Weyl Lu, Yuko Ishiwaka, Zengyi Li, Weier Wan, Yubei Chen

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种无需训练的通用方法,通过校准、级联和数据清洗提升模型识别自身不确定性的能力,验证了校准置信度的可靠性及应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29654 2026-06-30 cs.AI cs.MA 57%

Budgeted Act-or-Defer Multi-Agent LLM Deliberation with Local Reliability Bounds

预算约束下的多智能体LLM“行动或延迟”协商与局部可靠性界限

Mengdie Flora Wang, Haochen Xie, Guanghui Wang, Devin Zhang, Jae Oh Woo

机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心) General Motors (GM)(通用汽车(GM))

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 提出一种预算约束下的“行动或延迟”决策框架,通过k近邻下置信界评估LLM协商的可靠性,在满足用户指定的错误行动预算时自动执行,否则延迟人工审核,并在六个基准上验证了有效性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏