arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-02 至 2026-07-02 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 4 篇

2607.00908 2026-07-02 cs.LG 新提交 79%

Beyond Activation Alignment:The Alignment-Diversity Tradeoff in Task-Aware LLM Quantization

超越激活对齐:任务感知的大语言模型量化中的对齐-多样性权衡

Fei Wang, Chao Xue, Taoran Liu, Li Shen, Ye Liu, ChangXing Ding

机构 * South China University of Technology(华南理工大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Ocean University of China(中国海洋大学) Center for AI Theoretical Foundation and Systems, Shenzhen Loop Area Institute(深圳环区研究所人工智能理论基础与系统中心)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.LG

AI总结 本文揭示混合精度量化中的困惑度幻觉和对齐-多样性权衡,提出TASA框架联合优化校准数据组成和比特分配,在3.5比特平均精度下匹配或超越4比特基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00972 2026-07-02 cs.AI 新提交 57%

Bayesian Uncertainty Propagation for Agentic RAG Pipelines: A Proof-of-Concept Study on Multi-Hop Question Answering

面向智能体RAG管道的贝叶斯不确定性传播:多跳问答的概念验证研究

Louis Donaldson, Connor Walker, Koorosh Aslansefat, Yiannis Papadopoulos

机构 * University of Hull(赫尔大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 提出一种不确定性感知的智能体RAG框架,通过贝叶斯网络传播各阶段的不确定性信号,以估计系统级不确定性并定位潜在故障点,在HotpotQA上表现有效,但在StrategyQA上受限于校准问题。

Comments Submitted for 7th International Conference on Maintenance and Intelligent Asset Management (ICMIAM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22526 2026-07-02 cs.AI cs.HC 版本更新 57%

From Silos to Systems: Process-Oriented Hazard Analysis for AI Systems

从孤岛到系统:面向过程的人工智能系统危害分析

Shalaleh Rismani, Roel Dobbe, AJung Moon

机构 * McGill University(麦吉尔大学) Delft University of Technology(代尔夫特理工大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 针对AI系统危害分析中组件孤立的问题,借鉴系统安全领域,将系统理论过程分析(STPA)适配到AI系统,提出PHASE指南,实现系统级危害检测、社会因素纳入、可追溯问责链及持续监控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13445 2026-07-02 cs.CL cs.AI 版本更新 54%

Verbosity Tradeoffs and the Impact of Scale on the Faithfulness of LLM Self-Explanations

冗长性权衡与规模对LLM自我解释忠实度的影响

Noah Y. Siegel, Nicolas Heess, Maria Perez-Ortiz, Oana-Maria Camburu

机构 * Google DeepMind(谷歌DeepMind) Centre for AI, University College London(伦敦大学学院人工智能中心) Imperial College London(伦敦帝国学院) University College London(伦敦大学学院)

专题命中 幻觉与事实性 :分类 cs.CL、cs.AI;safety(comments);trustworthy(comments)

AI总结 本文分析13个模型家族共75个模型的反事实忠实度,提出phi-CCT和F-AUROC两个新指标,发现更大更强的模型在所有指标上更忠实。

Comments ICLR 2026 Workshop on Principled Design for Trustworthy AI - Interpretability, Robustness, and Safety across Modalities 67 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏