arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-09 至 2026-03-09 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 8 篇

2603.06333 2026-03-09 cs.AI cs.CL cs.LG 85%

SAHOO: Safeguarded Alignment for High-Order Optimization Objectives in Recursive Self-Improvement

SAHOO:递归自我改进中高阶优化目标的安全保障

Subramanyam Sahoo, Aman Chadha, Vinija Jain, Divya Chaudhary

机构 * MARS 4.0 Fellowship, Cambridge AI Safety Hub(CAISH), University of Cambridge(剑桥大学) AWS Generative AI Innovation Center, Amazon Web Services, USA(亚马逊网络服务) Google, USA(谷歌) Stanford University(斯坦福大学) Northeastern University, Seattle, WA, USA(东北大学)

专题命中 幻觉与事实性 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SAHOO通过三种保障措施实现递归自我改进中高阶优化目标的安全保障,显著提升代码生成和推理质量,同时保持约束和事实性。

Comments Published at ICLR 2026 Workshop on AI with Recursive Self-Improvement. 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05839 2026-03-09 cs.MA cs.AI 79%

Evaluating LLM Alignment With Human Trust Models

评估大语言模型与人类信任模型的对齐性

Anushka Debnath, Stephen Cranefield, Bastin Tony Roy Savarimuthu, Emiliano Lorini

机构 * School of Computing, University of Otago, New Zealand(奥塔哥大学计算机学院,新西兰) IRIT, CNRS, Toulouse University, France(IRIT,法国国家科学研究中心,图卢兹大学)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.AI

AI总结 本文通过对比提示生成嵌入向量,评估了EleutherAI/gpt-j-6B对信任的内部表示,发现其最接近Castelfranchi社会认知模型。

Comments This paper will appear in the post-proceedings of ICAART 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04897 2026-03-09 cs.CL 79%

Can LLMs Capture Expert Uncertainty? A Comparative Analysis of Value Alignment in Ethnographic Qualitative Research

LLMs能否捕捉专家不确定性?对人类学质性研究中价值对齐的比较分析

Arina Kostina, Marios Dikaiakos, Alejandro Porcel, Tassos Stassopoulos

机构 * University of Cyprus(塞浦路斯大学) University of Cambridge(剑桥大学)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL

AI总结 本文研究LLMs在人类学质性研究中捕捉专家不确定性的能力,发现Qwen在价值对齐上表现最佳,但需进一步探讨模型偏差问题。

Comments Accepted for a poster session at BIG.AI at MIT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05909 2026-03-09 cs.CL 57%

InfoGatherer: Principled Information Seeking via Evidence Retrieval and Strategic Questioning

InfoGatherer: 通过证据检索和策略性提问进行原理化的信息获取

Maksym Taranukhin, Shuyue Stella Li, Evangelos Milios, Geoff Pleiss, Yulia Tsvetkov, Vered Shwartz

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) CIFAR AI Chair(CIFAR人工智能主席) University of Washington(华盛顿大学) Dalhousie University(达尔豪斯大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL

AI总结 InfoGatherer通过证据检索和策略性提问,结合结构化证据网络和Dempster-Shafer理论,实现原理化的信息获取,提升医疗和法律任务中的可靠性与可解释性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05828 2026-03-09 cs.CL 57%

HART: Data-Driven Hallucination Attribution and Evidence-Based Tracing for Large Language Models

HART: 基于数据的幻觉归因与证据导向追踪用于大语言模型

Shize Liang, Hongzhi Wang

机构 * Faculty of Computing, Harbin Institute of Technology(计算机学院,哈尔滨工业大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 HART通过结构化建模方法提升大语言模型幻觉归因与证据追踪的准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08445 2026-03-09 cs.CV cs.LG 57%

Uncertainty-Aware Subset Selection for Robust Visual Explainability under Distribution Shifts

考虑不确定性的子集选择以在分布偏移下实现稳健的视觉可解释性

Madhav Gupta, Vishak Prasad C, Ganesh Ramakrishnan

机构 * Indian Institute of Technology Bombay(印度理工学院孟买学院)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出一种结合子模子集选择与层间梯度不确定性估计的方法,以提高在分布偏移下的视觉可解释性鲁棒性和保真度。

Comments Accepted to the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026

Journal ref Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05725 2026-03-09 cs.CR 50%

Challenges and Design Considerations for Finding CUDA Bugs Through GPU-Native Fuzzing

通过GPU原生模糊测试寻找CUDA漏洞的挑战与设计考虑

Mingkai Li, Joseph Devietti, Suman Jana, Tanvir Ahmed Khan

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文研究了通过GPU原生模糊测试寻找CUDA漏洞的挑战与设计考虑,强调程序行为的忠实性对异构系统安全的重要性。

Comments Accepted to appear in HotEthics 2026; 6 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25034 2026-03-09 cs.MA cs.SY eess.SY 50%

MARLIN: Multi-Agent Reinforcement Learning with Murmuration Intelligence and LLM Guidance for Reservoir Management

MARLIN: 基于星群智能与大语言模型引导的多智能体强化学习在水库管理中的应用

Heming Fu, Shan Lin, Guojun Xiong

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 MARLIN通过结合生物启发规则与大语言模型,实现多智能体强化学习在水库管理中的去中心化协调,提升不确定性处理能力并加快洪水响应。

Comments AAMAS'26

详情

展开后加载摘要…

URL PDF HTML 收藏