Language Models Embody and Amplify Human Cognitive Distortions: What Is to Be Done?
语言模型体现并放大人类认知扭曲:该怎么办?
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY
AI总结 研究指出语言模型存在社会认知偏见,它不仅体现人类偏见,还会放大、加剧并传递偏见,鉴于其对决策影响巨大,提出了从诊断、监管和操作方面应对语言模型偏见问题的对策。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
语言模型体现并放大人类认知扭曲:该怎么办?
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY
AI总结 研究指出语言模型存在社会认知偏见,它不仅体现人类偏见,还会放大、加剧并传递偏见,鉴于其对决策影响巨大,提出了从诊断、监管和操作方面应对语言模型偏见问题的对策。
诊断推理模型中的病理链式思维
机构 * Department of Epidemiology, CAUSALab, Harvard University, Boston, USA(流行病学系、CAUSALab、哈佛大学) ; Imperial College London, London, UK(伦敦帝国学院) ; McGill University, Montreal, Canada(麦吉尔大学) ; Geodesic Research, Cambridge, UK(Geodesic研究)
专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 本文提出了一种评估链式思维推理模型中病态的实用工具,通过定义具体度量标准和训练特定模型生物来识别和区分三种不同的病态现象。
自适应深度稀疏框架:基于相似性驱动的预训练语言模型资源分配
机构 * Southern University of Science and Technology(南方科技大学) ; Huawei Technologies Co., Ltd.(华为技术有限公司)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 研究针对预训练语言模型推理成本高的问题,提出自适应深度稀疏框架AdaDSF,基于层输入输出隐藏状态余弦相似性分配令牌保留率,用轻量级路由器选择信息令牌,在多任务中大幅降推理FLOPs且精度退化小。
Comments Accepted by ICIC 2026. 12 pages, 2 figures, 4 tables
EvoSpec: 通过实时词汇和参数自适应进化推测解码
机构 * School of Computer Science and Technology(计算机科学与技术学院)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 提出EvoSpec框架,通过动态词汇和参数自适应实现推测解码中草稿模型的实时进化,解决静态方法在专业领域和主题切换场景下接受率骤降的问题,在EAGLE-3上实现1.13倍加速并降低27%内存开销。
基于RSA的前瞻性规划:通过跨未来时间步投影用户意识实现动态环境中的高效信号传递
机构 * Saarland University(萨尔兰大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于RSA的前瞻性规划方法,通过跨未来时间步投影用户意识,优化动态环境中的人机协作效率。
Comments 11 pages, 3 figures
Journal ref Proc. of the 25th Int. Conf. on Autonomous Agents and Multiagent Systems (AAMAS 2026)
超越谄媚:大语言模型道德推理中的结构化抵抗与顺从
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 研究大语言模型道德推理中超越谄媚的结构化抵抗与顺从,通过三项研究揭示其判断修正沿与人类社会心理学现象平行的三个维度结构化,为区分建设性信念修正与谄媚顺从提供原则基础,助力道德交互更好对齐。
相同危险目标,相反建议:直接暴露与多智能体调解
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 研究通过测试发现,语言模型直接面对危险目标和经智能体转换传递指令时表现不同,存在行为反向转变及组合安全漏洞,高性能模型可用于特定自动化工作流程的用户端组件,却未明确其内部机制。
Comments 21 pages; welcome comments
用于指令微调的统一道德价值数据集
机构 * RWTH Aachen(亚琛工业大学) ; University of Bonn(波恩大学) ; Lamarr Institute for Machine Learning and Artificial Intelligence(拉玛尔机器学习与人工智能研究所)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 针对大语言模型与人类价值观对齐问题,构建统一道德价值数据集用于指令微调,通过合并现有数据集并转换格式而成,实验表明其结合通用任务数据集训练可保持性能,为对齐研究提供资源。
Comments Accepted at the 4th International Workshop on Value Engineering in AI (VALE 2026), co-located with IJCAI-ECAI 2026
注意力退化、功能令牌锚定以及基于注意力的大语言模型干预的局限性
机构 * London Metropolitan University(伦敦城市大学) ; Islington College(伊斯灵顿学院) ; Kathmandu University(加德满都大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 研究探讨大语言模型中注意力退化问题,通过六个实验刻画其模式及功能令牌锚定特点,测试干预机制效果,发现平均注意力退化多为描述性,功能令牌作用于隐藏状态计算,为可解释性方法及推理优化提供启示。
Comments 19 pages, 2 figures, 10 tables
角度语义:余弦相似度何时有效及失效
机构 * Baruch College, City University of New York(纽约城市大学巴克莱学院)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 研究探讨余弦相似度在信息处理等领域的应用,围绕其有用性取决于学习表示等因素展开,推导几何恒等式,区分失效机制,回顾证据并描述替代方法,得出其正尺度不变性有条件合理的结论。
数字搜索的演变:从蓝色链接到委托决策
专题命中 其他安全 :alignment(abstract)
AI总结 研究数字搜索从传统模式到人工智能原生模式的转变,指出小设计选择影响重大,未来搜索发展不由算法和界面改进决定,而是取决于开放透明有竞争力的代理系统设计,揭示多领域交叉的重大挑战。
Comments 4 pages, 0 figures
通过深度先验增强玻璃表面重建以提升机器人导航
机构 * Shenzhen Key Laboratory of Robotics and Computer Vision(机器人与计算机视觉深圳重点实验室) ; Southern University of Science and Technology(南方科技大学) ; CKS Robotics Institute(CKS机器人研究院)
专题命中 其他安全 :alignment(abstract)
AI总结 本文提出一种无需训练的框架,利用深度基础模型作为结构先验,结合鲁棒的局部RANSAC对齐方法,融合原始传感器深度数据,从而避免错误的玻璃测量污染,恢复准确的度量尺度,并引入新的RGB-D数据集用于玻璃区域的几何真实值。
Comments 9 pages, 8 figures, Accepted by IROS 2026