arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-24 至 2026-07-24 共收录 11 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 11 篇

2602.13904 2026-07-24 cs.AI 版本更新 70%

Diagnosing Pathological Chain-of-Thought in Reasoning Models

诊断推理模型中的病理链式思维

Manqing Liu, David Williams-King, Ida Caspary, Linh Le, Hannes Whittingham, Puria Radmard, Cameron Tice, Edward James Young

机构 * Department of Epidemiology, CAUSALab, Harvard University, Boston, USA(流行病学系、CAUSALab、哈佛大学) Imperial College London, London, UK(伦敦帝国学院) McGill University, Montreal, Canada(麦吉尔大学) Geodesic Research, Cambridge, UK(Geodesic研究)

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文提出了一种评估链式思维推理模型中病态的实用工具,通过定义具体度量标准和训练特定模型生物来识别和区分三种不同的病态现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21291 2026-07-24 cs.CL cs.LG 新提交 62%

Adaptive Depth Sparse Framework: Similarity-Driven Resource Allocation for Pre-Trained LLMs

自适应深度稀疏框架:基于相似性驱动的预训练语言模型资源分配

Yidu Wu, Xiang Wang, Kejie Zhao, Zhangchi Wang, Qinghai Guo, Xiaoying Tang

机构 * Southern University of Science and Technology(南方科技大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 研究针对预训练语言模型推理成本高的问题,提出自适应深度稀疏框架AdaDSF,基于层输入输出隐藏状态余弦相似性分配令牌保留率,用轻量级路由器选择信息令牌,在多任务中大幅降推理FLOPs且精度退化小。

Comments Accepted by ICIC 2026. 12 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27390 2026-07-24 cs.CL cs.AI 版本更新 62%

EvoSpec: Evolving Speculative Decoding via Real-Time Vocabulary and Parameter Adaptation

EvoSpec: 通过实时词汇和参数自适应进化推测解码

Shuyu Zhang, Lingfeng Pan, Qicheng Wang, Yaqi Shi, Yueyang Tan, Ruyu Yan, Jiaqi Chen, Lixing Du, Lu Wang

机构 * School of Computer Science and Technology(计算机科学与技术学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出EvoSpec框架,通过动态词汇和参数自适应实现推测解码中草稿模型的实时进化,解决静态方法在专业领域和主题切换场景下接受率骤降的问题,在EAGLE-3上实现1.13倍加速并降低27%内存开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23340 2026-07-24 cs.AI cs.CL cs.HC 62%

Planning Ahead with RSA: Efficient Signalling in Dynamic Environments by Projecting User Awareness across Future Timesteps

基于RSA的前瞻性规划:通过跨未来时间步投影用户意识实现动态环境中的高效信号传递

Anwesha Das, John Duff, Jörg Hoffmann, Vera Demberg

机构 * Saarland University(萨尔兰大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于RSA的前瞻性规划方法,通过跨未来时间步投影用户意识,优化动态环境中的人机协作效率。

Comments 11 pages, 3 figures

Journal ref Proc. of the 25th Int. Conf. on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21558 2026-07-24 cs.AI 新提交 57%

Beyond Sycophancy: Structured Resistance and Compliance in LLM Moral Reasoning

超越谄媚:大语言模型道德推理中的结构化抵抗与顺从

Baihui Wang, Bernard Koch

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究大语言模型道德推理中超越谄媚的结构化抵抗与顺从,通过三项研究揭示其判断修正沿与人类社会心理学现象平行的三个维度结构化,为区分建设性信念修正与谄媚顺从提供原则基础,助力道德交互更好对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21518 2026-07-24 cs.AI 新提交 57%

Same Dangerous Objective, Opposite Advice: Direct Exposure versus Multi-Agent Mediation

相同危险目标,相反建议:直接暴露与多智能体调解

Linjun Li

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 研究通过测试发现,语言模型直接面对危险目标和经智能体转换传递指令时表现不同,存在行为反向转变及组合安全漏洞,高性能模型可用于特定自动化工作流程的用户端组件,却未明确其内部机制。

Comments 21 pages; welcome comments

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21279 2026-07-24 cs.CL 新提交 57%

A Unified Moral-Value Dataset for Instruction Tuning

用于指令微调的统一道德价值数据集

Zhaohui Zeng, Florian Mai

机构 * RWTH Aachen(亚琛工业大学) University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉玛尔机器学习与人工智能研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 针对大语言模型与人类价值观对齐问题,构建统一道德价值数据集用于指令微调,通过合并现有数据集并转换格式而成,实验表明其结合通用任务数据集训练可保持性能,为对齐研究提供资源。

Comments Accepted at the 4th International Workshop on Value Engineering in AI (VALE 2026), co-located with IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20524 2026-07-24 cs.AI 新提交 57%

Attention Degradation, Function Token Anchoring, and the Limits of Attention-Based Intervention in Large Language Models

注意力退化、功能令牌锚定以及基于注意力的大语言模型干预的局限性

Sagar Dangal, Manoj Shakya

机构 * London Metropolitan University(伦敦城市大学) Islington College(伊斯灵顿学院) Kathmandu University(加德满都大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究探讨大语言模型中注意力退化问题,通过六个实验刻画其模式及功能令牌锚定特点,测试干预机制效果,发现平均注意力退化多为描述性,功能令牌作用于隐藏状态计算,为可解释性方法及推理优化提供启示。

Comments 19 pages, 2 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16318 2026-07-24 cs.LG 版本更新 57%

Semantics at an Angle: When Cosine Similarity Works Until It Doesn't

角度语义:余弦相似度何时有效及失效

Kisung You

机构 * Baruch College, City University of New York(纽约城市大学巴克莱学院)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 研究探讨余弦相似度在信息处理等领域的应用,围绕其有用性取决于学习表示等因素展开,推导几何恒等式,区分失效机制,回顾证据并描述替代方法,得出其正尺度不变性有条件合理的结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21459 2026-07-24 econ.GN q-fin.EC 新提交 50%

The Evolution of Digital Search: From Blue Links to Delegated Decision-Making

数字搜索的演变:从蓝色链接到委托决策

David M. Rothschild, Nicole Immorlica, Brendan Lucier, Markus Mobius, Aleksandrs Slivkins

专题命中 其他安全 :alignment(abstract)

AI总结 研究数字搜索从传统模式到人工智能原生模式的转变,指出小设计选择影响重大,未来搜索发展不由算法和界面改进决定,而是取决于开放透明有竞争力的代理系统设计,揭示多领域交叉的重大挑战。

Comments 4 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18336 2026-07-24 cs.RO cs.CV 版本更新 50%

Enhancing Glass Surface Reconstruction via Depth Prior for Robot Navigation

通过深度先验增强玻璃表面重建以提升机器人导航

Jiamin Zheng, Jingwen Yu, Guangcheng Chen, Hong Zhang

机构 * Shenzhen Key Laboratory of Robotics and Computer Vision(机器人与计算机视觉深圳重点实验室) Southern University of Science and Technology(南方科技大学) CKS Robotics Institute(CKS机器人研究院)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出一种无需训练的框架,利用深度基础模型作为结构先验,结合鲁棒的局部RANSAC对齐方法,融合原始传感器深度数据,从而避免错误的玻璃测量污染,恢复准确的度量尺度,并引入新的RGB-D数据集用于玻璃区域的几何真实值。

Comments 9 pages, 8 figures, Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏