AI Alignment via Incentives and Correction
通过激励与修正实现AI对齐
机构 * Princeton University(普林斯顿大学)
专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 本文从法律经济学威慑模型视角探讨AI对齐问题,提出通过激励机制和修正过程解决AI行为与对齐目标的平衡问题,构建双代理模型分析奖励设计对求解器和审计器行为的影响。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
通过激励与修正实现AI对齐
机构 * Princeton University(普林斯顿大学)
专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 本文从法律经济学威慑模型视角探讨AI对齐问题,提出通过激励机制和修正过程解决AI行为与对齐目标的平衡问题,构建双代理模型分析奖励设计对求解器和审计器行为的影响。
元认知探测:用于大语言模型的五种行为校准诊断
机构 * Independent Researcher(独立研究者)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出元认知探测工具,通过五个维度评估大语言模型的自信行为,揭示模型在特定领域的过度自信问题,展示了Gemini 2.5 Flash在不同任务中的显著差异。
Comments 27 pages, 13 tables. Code, data, prompts, and rubrics released with the paper. OSF deposit pending; DOI in v2
可靠推断的基础:可靠性与效率的协同设计
机构 * The Department of Engineering(工程系) ; King’s College London(伦敦国王学院)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG
AI总结 本文探讨如何高效实现可靠推断,通过统一框架从两个视角出发,解决可靠性与效率的协同设计问题。
Comments PhD Thesis
通过不确定性减少解决道路使用者互动中的空间共享冲突:一种基于主动推断的计算模型
机构 * Department of Cognitive Robotics, Delft University of Technology, Netherlands(德鲁特理工大学认知机器人学系) ; Waymo LLC, Mountain View, CA, USA(Waymo公司)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI
AI总结 本文提出一种基于主动推断的计算模型,用于模拟道路使用者互动中的空间共享冲突解决,通过隐含沟通、规范预期和显性沟通机制提升冲突解决效率,但需考虑对方行为是否符合预期。
为AI赋能的材料发现培养学生:一种与工作流程对齐的AI素养、公平性及科学判断框架
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CY
AI总结 本文提出一种与工作流程对齐的AI素养框架,强调通过提升学生在材料信息学中的数据溯源、领域特定特征化等能力,促进AI在材料发现中的公平应用与科学判断。
Comments 22 pages, 4 figures, and 5 tables
代码调酒师:构建代码混合LLM的从业者指南
机构 * Arizona State University(亚利桑那州立大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL
AI总结 本文探讨了代码混合和切换在大语言模型中的挑战,提出统一的分类体系和实用指南,涵盖数据、建模和评估方法,分析现有评估实践并讨论安全问题。
Comments 8 pages main paper, 13 pages total
探究在可控反事实扰动下的视觉语义对齐中的各向异性
机构 * Department of Engineering(工程系)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
AI总结 本文研究了在可控反事实扰动下视觉语义对齐中的各向异性影响,通过对比两种不同嵌入几何的模型发现,余弦相似度与近似行为无显著关联,表明各向异性不足以解释反事实错误。
Comments To be published in the proceedings of the 5th Explainable AI for Computer Vision (XAI4CV) Workshop at CVPR 2026
基于大语言模型的多阶段检索在运营技术网络安全合规中的应用:铁路案例研究
机构 * Digital Transit Limited, 3M Buckley Innovation Centre(数字交通有限公司,3M Buckley创新中心) ; Department of Computer Science at University of Huddersfield(赫德瑟尔大学计算机科学系)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI
AI总结 本文提出利用大语言模型和多阶段检索提升铁路网络安全合规性验证,通过对比不同模型展示PCA在合规性验证中的有效性,建立评估指标并指出LLM在合规性验证中的优势与局限。
Thermal-Det: 语言引导的跨模态蒸馏用于开放词汇热成像目标检测
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Kitware ; DEVCOM Army Research Laboratory(国防部陆军研究实验室)
专题命中 幻觉与事实性 :alignment(abstract)
AI总结 本文提出Thermal-Det,首个针对热成像的开放词汇检测器,通过合成数据集和跨模态蒸馏提升热成像目标检测性能,实验显示在公开基准上取得2-4%的AP提升。
Comments Accepted at CVPR 26