Risky Business: Measuring The Faithfulness-Safety Tension
危险的业务:测量忠实度与安全性之间的张力
专题命中 幻觉与事实性 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对大型推理模型中忠实度与安全性的张力,构建HazMart数据集,提出TRR技术,发现QwQ-32B的反相关内部方向,并通过表征引导提升安全行为9个百分点。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
危险的业务:测量忠实度与安全性之间的张力
专题命中 幻觉与事实性 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对大型推理模型中忠实度与安全性的张力,构建HazMart数据集,提出TRR技术,发现QwQ-32B的反相关内部方向,并通过表征引导提升安全行为9个百分点。
为繁荣优化:繁荣度量与繁荣回报作为人工智能及后AGI经济系统的成功标准
专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.CY
AI总结 该研究提出将人类繁荣作为AI及后AGI经济系统的核心成功标准,构建了Flourishing Metrics框架与RoF评估方法,为AI及经济转型的价值核算提供了决策架构。
基础模型的博弈论:通过相似性推理实现理性合作的新路径
专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI
AI总结 本文提出针对基础模型智能体的嵌入贝叶斯智能体理论模型,通过嵌入均衡机制实现相似性推理,破解经典博弈论预测的社会困境中相互背叛问题,达成稳定合作。
Comments 75 pages, 11 figures
大规模事实核查:用于在线媒体真实性与上下文验证的多模态AI
专题命中 幻觉与事实性 :alignment(abstract)
AI总结 本文为2025年ACM多媒体大会多媒体验证挑战赛开发了多模态验证系统,整合视觉取证等技术,可检测脱离上下文的媒体,提升了多媒体验证水平,为相关从业者提供实用工具。