arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-29 至 2026-05-29 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 6 篇

2605.30353 2026-05-29 cs.AI astro-ph.CO cs.HC cs.SE 57%

Physics Is All You Need? A Case Study in Physicist-Supervised AI Development of Scientific Software

物理学就是一切?物理学家监督人工智能开发科学软件的案例研究

Nhat-Minh Nguyen

机构 * Kavli IPMU (WPI), UTIAS, The University of Tokyo(Kavli研究所(WPI)、UTIAS、东京大学) Center for Data-Driven Discovery(数据驱动发现中心) Institute For Interdisciplinary Research in Science(科学跨学科研究中心)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 通过一个物理学家监督AI编码代理开发可微扰动理论模块的案例,研究AI代理在科学软件开发中的可靠性,发现监督设计比模型能力更能决定输出可信度。

Comments 10 pages, 2 figures, 2 tables, 1 physicist and a few AI agents. Accepted by ICML 2026 AI for Science Workshop. Code and development log are available at this repo: https://github.com/MinhMPA/clax-pt

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29791 2026-05-29 cs.CL 57%

ActTraitBench: Quantifying the Knowledge-Decision Gap in Large Language Models via Human-Grounded Behavioral Validation

ActTraitBench: 通过人类行为验证量化大型语言模型中的知识-决策差距

Yutong Yang, Chenxi Miao, Weikang Li, Yunfang Wu

机构 * Peking University(北京大学) Baidu Inc(百度公司)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 提出ActTraitBench框架,基于人类数据建立心理测量方面与行为范式的一一映射,并通过分位数映射校准LLM评分分布,揭示LLM在自我报告与行为决策之间的知识-决策差距,并引入CoCA干预来缓解该差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29715 2026-05-29 cs.CL 57%

User-Aware Active Knowledge Acquisition for Emotional Support Dialogue

面向情感支持对话的用户感知主动知识获取

Mufan Xu, Kehai Chen, Jiahao Hu, Xinchao Xu, Muyun Yang, Tiejun Zhao, Min Zhang

机构 * Harbin Institute of Technology, China(哈尔滨工业大学) Baidu Inc., Beijing, China(百度公司)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 提出用户感知主动知识获取(UKA)框架,通过理论心智不确定性估计和主动学习,在情感支持对话中高效获取用户对齐的对话知识,提升对话质量和用户对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29615 2026-05-29 cs.CV cs.CL 57%

DiffSpot: Can VLMs Spot Fine-Grained Visual Differences in Web Interfaces?

DiffSpot:VLM能发现网页界面中的细微视觉差异吗?

Linhao Zhang, Aiwei Liu, Yuan Liu, Xiao Zhou

机构 * WeChat AI, Tencent Inc(腾讯公司)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 提出DiffSpot基准,通过CSS属性突变生成可控图像对,评估视觉语言模型在网页界面中检测细微视觉差异的能力,发现最佳模型仅识别40.7%的真实变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29139 2026-05-29 stat.ML cs.LG 57%

Anytime-Valid Federated Conformal RAG for LLM Swarms

面向LLM群体的任意有效联邦共形RAG

Prasanjit Dubey, Xiaoming Huo

机构 * H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(H.米尔顿·斯图尔特工业与系统工程学院,佐治亚理工学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 提出Anytime-FC-RAG,通过可累积的逐步校准偏差预算和截断投注e过程,将联邦共形RAG扩展到任意停止时间均有效的序贯覆盖,并保证时间均匀报警有效性、Hoeffding拼接累积误覆盖包络及自适应控制下的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08064 2026-05-29 cs.CL 57%

Calibration Is Not Enough: Evaluating Confidence Estimation Under Language Variations

校准还不够:评估语言变化下的置信度估计

Yuxi Xia, Dennis Ulmer, Terra Blevins, Yihong Liu, Hinrich Schütze, Benjamin Roth

机构 * Faculty of Computer Science, UniVie Doctoral School Computer Science(计算机科学系,维也纳大学计算机科学博士学院) Faculty of Philological and Cultural Studies, University of Vienna, Austria(文学与文化研究系,维也纳大学,奥地利) ILLC, University of Amsterdam, Netherlands(阿姆斯特丹大学ILLC,荷兰) Khoury College of Computer Sciences, Northeastern University, USA(东北大学计算机科学学院,美国) LMU Munich, Munich Center for Machine Learning (MCML), Germany(慕尼黑大学,慕尼黑机器学习中心(MCML),德国)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 提出一个基于鲁棒性、稳定性和敏感性的新评估框架,揭示现有置信度估计方法在区分语义不同答案方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏