arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-12 至 2026-05-12 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 9 篇

2605.01643 2026-05-12 cs.LG cs.AI 81%

AI Alignment via Incentives and Correction

通过激励与修正实现AI对齐

Rohit Agarwal, Joshua Lin, Mark Braverman, Elad Hazan

机构 * Princeton University(普林斯顿大学)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文从法律经济学威慑模型视角探讨AI对齐问题,提出通过激励机制和修正过程解决AI行为与对齐目标的平衡问题,构建双代理模型分析奖励设计对求解器和审计器行为的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09844 2026-05-12 cs.AI cs.CL cs.LG 67%

The Metacognitive Probe: Five Behavioural Calibration Diagnostics for LLMs

元认知探测:用于大语言模型的五种行为校准诊断

Rafael C. T. Oliveira

机构 * Independent Researcher(独立研究者)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出元认知探测工具,通过五个维度评估大语言模型的自信行为,揭示模型在特定领域的过度自信问题,展示了Gemini 2.5 Flash在不同任务中的显著差异。

Comments 27 pages, 13 tables. Code, data, prompts, and rubrics released with the paper. OSF deposit pending; DOI in v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10351 2026-05-12 cs.LG eess.SP 57%

Foundations of Reliable Inference: Reliability-Efficiency Co-Design

可靠推断的基础:可靠性与效率的协同设计

Jiayi Huang

机构 * The Department of Engineering(工程系) King’s College London(伦敦国王学院)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 本文探讨如何高效实现可靠推断,通过统一框架从两个视角出发,解决可靠性与效率的协同设计问题。

Comments PhD Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19838 2026-05-12 cs.AI 57%

Resolving space-sharing conflicts in road user interactions through uncertainty reduction: An active inference-based computational model

通过不确定性减少解决道路使用者互动中的空间共享冲突:一种基于主动推断的计算模型

Julian F. Schumann, Johan Engström, Ran Wei, Shu-Yuan Liu, Jens Kober, Arkady Zgonnikov

机构 * Department of Cognitive Robotics, Delft University of Technology, Netherlands(德鲁特理工大学认知机器人学系) Waymo LLC, Mountain View, CA, USA(Waymo公司)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 本文提出一种基于主动推断的计算模型,用于模拟道路使用者互动中的空间共享冲突解决,通过隐含沟通、规范预期和显性沟通机制提升冲突解决效率,但需考虑对方行为是否符合预期。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09624 2026-05-12 physics.ed-ph cs.CY physics.app-ph 57%

Preparing Students for AI-Powered Materials Discovery: A Workflow-Aligned Framework for AI Literacy, Equity, and Scientific Judgment

为AI赋能的材料发现培养学生:一种与工作流程对齐的AI素养、公平性及科学判断框架

Dongming Mei, Katherine Moore, Ben Sayler

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CY

AI总结 本文提出一种与工作流程对齐的AI素养框架,强调通过提升学生在材料信息学中的数据溯源、领域特定特征化等能力,促进AI在材料发现中的公平应用与科学判断。

Comments 22 pages, 4 figures, and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11181 2026-05-12 cs.CL 57%

Code Mixologist : A Practitioner's Guide to Building Code-Mixed LLMs

代码调酒师:构建代码混合LLM的从业者指南

Himanshu Gupta, Pratik Jayarao, Chaitanya Dwivedi, Neeraj Varshney

机构 * Arizona State University(亚利桑那州立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

AI总结 本文探讨了代码混合和切换在大语言模型中的挑战,提出统一的分类体系和实用指南,涵盖数据、建模和评估方法,分析现有评估实践并讨论安全问题。

Comments 8 pages main paper, 13 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09090 2026-05-12 cs.CV cs.AI 57%

Investigating Anisotropy in Visual Grounding under Controlled Counterfactual Perturbations

探究在可控反事实扰动下的视觉语义对齐中的各向异性

Gabriele Lombardo, Luigi Maiorana, Liliana Lo Presti, Marco La Cascia

机构 * Department of Engineering(工程系)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文研究了在可控反事实扰动下视觉语义对齐中的各向异性影响,通过对比两种不同嵌入几何的模型发现,余弦相似度与近似行为无显著关联,表明各向异性不足以解释反事实错误。

Comments To be published in the proceedings of the 5th Explainable AI for Computer Vision (XAI4CV) Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14044 2026-05-12 cs.AI cs.CR 57%

Multi-Stage Retrieval for Operational Technology Cybersecurity Compliance Using Large Language Models: A Railway Casestudy

基于大语言模型的多阶段检索在运营技术网络安全合规中的应用:铁路案例研究

Regan Bolton, Mohammadreza Sheikhfathollahi, Simon Parkinson, Dan Basher, Howard Parkinson

机构 * Digital Transit Limited, 3M Buckley Innovation Centre(数字交通有限公司,3M Buckley创新中心) Department of Computer Science at University of Huddersfield(赫德瑟尔大学计算机科学系)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型和多阶段检索提升铁路网络安全合规性验证,通过对比不同模型展示PCA在合规性验证中的有效性,建立评估指标并指出LLM在合规性验证中的优势与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10130 2026-05-12 cs.CV 50%

Thermal-Det: Language-Guided Cross-Modal Distillation for Open-Vocabulary Thermal Object Detection

Thermal-Det: 语言引导的跨模态蒸馏用于开放词汇热成像目标检测

Yasiru Ranasinghe, Elim Schenck, Florence Yellin, Shuowen Hu, Christopher Funk, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学) Kitware DEVCOM Army Research Laboratory(国防部陆军研究实验室)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出Thermal-Det,首个针对热成像的开放词汇检测器,通过合成数据集和跨模态蒸馏提升热成像目标检测性能,实验显示在公开基准上取得2-4%的AP提升。

Comments Accepted at CVPR 26

详情

展开后加载摘要…

URL PDF HTML 收藏