Autonomous Microscopy Experiments through Large Language Model Agents
专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY
机构 * Computer Science Department, University of California, Los Angeles (UCLA)(加州大学洛杉矶分校计算机科学系)
专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
Comments ICML 2025 Poster
专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
Comments 19 pages, 18 figures
专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
Comments 9 pages, no figures
专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
Comments ACL 2024 (Camera Ready)
专题命中 幻觉与事实性 :alignment(abstract);harmlessness(abstract);分类 cs.CL、cs.AI
专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
Comments Accepted to ACL 2024
专题命中 幻觉与事实性 :safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI
Comments 44 pages; updated authors list and fixed author names
专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
Comments The paper is accepted by NeurIPS 2023. The code is available at: https://github.com/MiaoXiong2320/ProximityBias-Calibration
专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
Comments Keywords: probabilistic inference, uncertainty estimation, uncertainty quantification, epistemic uncertainty, clinical prognosis, electronic health records
专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
Comments 40 pages including Appendices, 1 figure, 5 tables
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY;trustworthy(comments)
Comments This paper was accepted for presentation at the 7th International Workshop on EXplainable, Trustworthy, and Responsible AI and Multi-Agent Systems (EXTRAAMAS 2025). Workshop website: https://extraamas.ehealth.hevs.ch/index.html
看清真相:公平关注提升 groundedness 并减少 hallucination 在视觉语言对齐中
机构 * Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, UAE(穆罕默德·本·扎耶德人工智能大学,阿布扎比,阿联酋) ; King Fahd University of Petroleum and Minerals, Dhahran, Saudi Arabia(法赫德国王石油矿产大学,达兰,沙特阿拉伯) ; Macquarie University, Sydney, Australia(麦考瑞大学,悉尼,澳大利亚) ; University of Surrey, Guildford, United Kingdom(萨里大学,吉尔福德,英国) ; University of New South Wales, Sydney, Australia(新南威尔士大学,悉尼,澳大利亚)
专题命中 幻觉与事实性 :alignment(title)
AI总结 本文提出DOP-OBC方法,通过公平分配注意力减少视觉语言对齐中的幻觉问题,提升生成的准确性与一致性。
Scalpel: 通过混合高斯桥梁实现细粒度注意力激活流形对齐以缓解多模态幻觉
机构 * Fujitsu Research & Development Center Co.,LTD.(Fujitsu 研究与开发中心有限公司) ; Fujitsu Limited(Fujitsu 有限公司)
专题命中 幻觉与事实性 :alignment(title)
AI总结 Scalpel通过高斯混合模型和熵最优传输减少多模态幻觉,实现注意力激活流形的细粒度对齐,提升视觉-语言模型的输出一致性。
Comments WACV 2026 (It was accepted in the first round, with an acceptance rate of 6%.)
专题命中 幻觉与事实性 :safety(title)
Comments 9 pages, 4 figures
专题命中 幻觉与事实性 :alignment(title)
Comments 32 pages, 7 figures
专题命中 幻觉与事实性 :alignment(title)
Journal ref Journal of Air Transport Management 89 (2020) 101905
专题命中 幻觉与事实性 :alignment(title)
通过检索增强的可靠性感知推理缓解多模态系统中的视觉幻觉
机构 * University of Massachusetts, Dartmouth(马萨诸塞大学达特茅斯分校)
专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.AI
AI总结 提出一种检索增强的可靠性感知推理框架,利用外部视觉证据库和多个可靠性指标进行决策门控,在不重训练模型的情况下减少视觉幻觉,将接受预测准确率从85.84%提升至88.88%。
Comments 29 pages, 9 figures
论用于思维链忠实性的引导向量的泛化性
机构 * University of Virginia(弗吉尼亚大学) ; University of Delaware(特拉华大学) ; Poseidon Research(波塞冬研究院)
专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 该研究针对三个模型探究提升思维链忠实性的引导向量的泛化性,发现其效果主要由评估设置决定,且仅对最大型模型有效,引导可减少未被确认的提示使用。
规范性人工智能:一种用于在不确定性下审计人类决策的正式范式
机构 * Institute of Computing, Universidade Federal Fluminense (UFF)(联邦弗鲁米嫩塞大学计算研究所)
专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 本文提出规范性人工智能作为高风险环境下的人类-人工智能决策协作范式,通过四个公理证明了其与预测系统的核心区别,并展示了在决策模仿中系统性偏差的限制。
Comments Preprint; suitable for AI, decision sciences, and prescriptive analytics. Short versions published in Wharton Sports Analytics Journal Fall 2025 (AI Feature Spotlight) and accepted to AAAI Bridge on LM Reasoning 2026
PCS-UQ:基于可预测性-可计算性-稳定性框架的不确定性量化
机构 * Department of Statistics, University of California, Berkeley(加州大学伯克利分校统计学系) ; Department of Epidemiology, University of Utah(犹他大学流行病学系) ; Department of Electrical Engineering and Computer Science, University of California, Berkeley(加州大学伯克利分校电气工程与计算机科学系)
专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.LG
AI总结 提出PCS-UQ框架,通过预测检查、bootstrap采样和乘法校准实现不确定性量化,在回归和分类任务中优于或媲美共形预测方法,并提供理论保证。
保护能力幻觉:当大语言模型声称具备不存在的能力时
机构 * Korea Cyber University(韩国网络大学) ; Yonsei University(延世大学)
专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 研究大语言模型的保护能力幻觉现象,通过三阶段研究发现其受情境严重程度和交互形式影响,体现了角色分配与能力边界规范的差距,提出能力边界的部署端规范是缓解该问题的目标。
数据集偏移下用于可参考糖尿病视网膜病变筛查的RETFound不确定性感知最后一层自适应
机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)
专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.LG
AI总结 用RETFound对糖尿病视网膜病变筛查的不确定性感知最后一层自适应进行以安全为中心的实证评估,比较多种方法,在APTOS上不确定性感知操作点改善了敏感性等,在DDR上结果有差异,强调安全评估的价值。
Comments 12 pages, 8 tables, 6 figures. Code available at https://github.com/kmardhani/uncertainty-aware-retfound
LLM导师院长:AI生成反馈的自动质量审查框架
专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.CY
AI总结 提出DeanLLM框架,通过16维度评估LLM导师反馈的内容、教育效果和幻觉风险,并利用微调GPT-4.1实现与人类专家高度一致的自动审查。
超越对话的心智理论与说服:通过规划与行动评估LLMs诱导信念状态的能力
机构 * Leverhulme Centre for the Future of Intelligence(勒沃霍姆未来智能中心) ; Prolific ; Google, Paradigms of Intelligence Team(谷歌智能范式团队)
专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 提出非对话式规划心智理论(NCP-ToM)框架,评估LLMs通过行动而非对话诱导他人信念状态的能力,发现GPT-5在80%任务中优于人类,但鲁棒性不足。
Comments 29 pages, 12 figures
通过梯度上升实现可解释人格控制与提示工程的桥梁
机构 * Department of Computer Science(计算机科学系) ; Indian Institute of Technology (ISM), Dhanbad(印度理工学院(ISM),丹巴德) ; National University of Singapore(新加坡国立大学) ; CIFAR Fellow(CIFAR研究员)
专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.LG
AI总结 本文提出RESGA和SAEGA方法,利用梯度上升优化随机初始化提示,以实现与识别的人格方向更一致的表示,有效控制LLM中的人格行为。
蛋白质语言模型中的残基级归因不能恢复过敏原表位
机构 * Swiss Institute of Allergy and Asthma Research, Davos, Switzerland(瑞士过敏与哮喘研究所,达沃斯,瑞士) ; ETH Zurich, Zurich, Switzerland(苏黎世联邦理工学院,苏黎世,瑞士) ; Swiss Institute of Bioinformatics, Lausanne, Switzerland(瑞士生物信息学研究所,洛桑,瑞士)
专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.LG
AI总结 本研究通过引入表位基准,评估蛋白质过敏原性模型的可解释性,发现分类器残基级归因与注释表位对齐不显著,模型可能依赖理化特征而非表位特异性机制。
Comments Accepted at the ICML 2026 Mechanistic Interpretability Workshop (peer-reviewed)
无感关怀:情感动态作为人-AI智能体协作的控制层
机构 * East China Normal University(华东师范大学) ; National University of Singapore(新加坡国立大学)
专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 本文综述情感动态在人-AI智能体协作中的作用,提出将情感视为协调层而非AI内部属性,用于校准信任、委托和治理。