arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-24 至 2026-07-24 共收录 21 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 2 篇

2511.05385 2026-07-24 cs.IR cs.AI 版本更新 81%

TeaRAG: A Token-Efficient Agentic Retrieval-Augmented Generation Framework

TeaRAG:一种令牌高效的智能检索增强生成框架

Chao Zhang, Yuhao Wang, Derong Xu, Haoxin Zhang, Yuanjie Lyu, Yuhao Chen, Shuochen Liu, Tong Xu, Xiangyu Zhao, Yan Gao, Yao Hu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Xiaohongshu Inc.(小红书公司)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI

AI总结 研究提出TeaRAG框架解决智能RAG令牌开销大问题,通过基于简洁三元组的图检索压缩检索内容,用IP-DPO减少推理步骤,在多个数据集上实验,提高了平均精确匹配,减少了输出令牌。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14180 2026-07-24 cs.CL cs.AI 版本更新 73%

Internal Knowledge Without External Expression: Probing the Generalization Boundary of a Classical Chinese Language Model

无外部表达的知识:探索经典中文语言模型的泛化边界

Jiuting Chen, Yuan Lian, Hao Wu, Tianqi Huang, Hiroshi Sasaki, Makoto Kouno, Jongil Choi

机构 * Eaglewood Japan Co., Ltd.(日本鹰木公司)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究通过训练纯经典中文语料库的Transformer模型,探讨模型能否区分已知与未知输入,并揭示内部与外部不确定性之间的差异。

Comments 27 pages, 4 figures, supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 5 篇

2605.05704 2026-07-24 cs.CR cs.AI 版本更新 79%

SafeHarbor: Defining Precise Decision Boundaries via Hierarchical Memory-Augmented Guardrail for LLM Agent Safety

SafeHarbor:用于LLM智能体安全的分层记忆增强防护栏

Zhe Liu, Zonghao Ying, Wenxin Zhang, Quanchen Zou, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang, Hao Peng

机构 * School of Cyber Science and Technology, Beihang University, Beijing, China(北京航空航天大学网络安全学院) Institute of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能研究院) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) AI Security Lab, Beijing, China(360人工智能安全实验室)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 提出SafeHarbor框架,通过分层记忆系统和信息熵自进化机制,在保持高安全拒绝率的同时提升对良性请求的响应能力。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04019 2026-07-24 cs.LG cs.AI cs.CL 版本更新 67%

Simple Policy Gradients for Reasoning with Diffusion Language Models

为扩散语言模型进行推理的简单策略梯度

Anthony Zhan

机构 * Stanford University(斯坦福大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出 AGRPO 算法,通过优化 dLLM 的去噪步骤提升推理性能,实现多个任务上的显著增益。

Comments 19 pages. ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19806 2026-07-24 cs.LG cs.AI 版本更新 62%

OPIUM: Mitigating Steering Externalities and Over-Refusal via Dual Objective Latent Optimization

OPIUM:通过双目标潜在优化减轻引导外部性和过度拒绝

Kavin Aravindan, Arihant Rastogi, Krishak Aneja, Aadi Prasad, Saiyam Jain, Vaishnavi Shivkumar, Ponnurangam Kumaraguru

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究激活引导向量存在的外部性问题,提出无训练方法OPIUM,通过表示匹配净化引导向量,在给定参考行为下优化新向量,改善安全与效用权衡,减轻激活引导的有害副作用。

Comments Accepted to the Mechanistic Interpretability Workshop at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11346 2026-07-24 cs.AI cs.PL 版本更新 57%

Compile, Then Page: Executable SOP Programs and a Capability-Gated Runtime for Procedural LLM Agents

编译,然后分页:用于过程性语言模型代理的可执行标准操作程序和能力门控运行时

Chenglin Yu, Li Yin, Qingxin Fan, Ying Yu, RunyangRay Zhong, Ming Li

机构 * The Hong Kong Polytechnic University(香港理工大学) The University of Hong Kong(香港大学) Zhejiang Normal University(浙江师范大学) Research Institute for Generative AI, The Hong Kong Polytechnic University(香港理工大学生成式人工智能研究所)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究针对企业代理遵循SOP的问题,将SOP约束编译成可执行伪代码,用程序引导堆栈机运行,通过实验表明编译文本有益,运行时指导受能力门控,给出编译后经模型级纪律检查再启用活动框架分页的实际指导。

Comments 9 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16619 2026-07-24 cs.RO cs.MA 版本更新 50%

SAGE: A Socially-Aware Generative Engine for Heterogeneous Multi-Agent Navigation

SAGE:用于异构多智能体导航的社会感知生成引擎

Lan Hu, Minghui Liwang, Wenbo Zhu, Xinlei Yi, Yiguang Hong, Xianbin Wang, Zhenzhen Jiao, Seyyedali Hosseinalipour

机构 * Guohao School, Tongji University(同济大学国豪书院) Shanghai Research Institute for Intelligent Autonomous Systems(上海智能无人系统科学中心) Tongji University(同济大学) Western University(西安大略大学) Aeromind Technology Co., Ltd.(深圳智元科技有限公司) University at Buffalo-SUNY(纽约州立大学布法罗分校)

专题命中 安全训练 :safety(abstract)

AI总结 针对开放人机环境中异构多智能体导航问题,提出SAGE,通过有向异构图和异构图变换器编码交互,扩散生成模块建模轨迹,无训练安全-社会能量引导机制优化轨迹,实验验证其有效性及可扩展性。

Comments 16 pages, 5 figures, and 14 tables. Includes supplementary experimental details

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 3 篇

2605.09504 2026-07-24 cs.CR cs.AI cs.LG 版本更新 79%

AI Security Policy Should Assess Systems, Not Only Models

位置:AI安全政策应针对系统,而非模型

Michael A. Riegler, Inga Strümke

机构 * AI Safety Department(人工智能安全部门) SimulaMet and OsloMet(SimulaMet和奥斯陆计量)

专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出swarm-attack框架,展示通过协调轻量级LLM代理发现系统漏洞和绕过安全机制的可能性,证明在低成本硬件上可实现零成本安全测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18672 2026-07-24 cs.LG stat.ML 版本更新 77%

Concept Concentration for Faithful Representation Intervention

用于忠实表示干预的概念集中化

Hongzheng Yang, Yongqiang Chen, Zeyu Qin, Tongliang Liu, Chaowei Xiao, Kun Zhang, Bo Han

机构 * SAIC Centre, USYD(SAIC中心)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.LG

AI总结 研究大语言模型表示干预中定位忠实概念的问题,提出概念集中化(COCA)方法,通过重构训练数据简化决策边界,有效降低分布内和分布外越狱成功率,且在常规任务上保持性能。

Comments ICML'26; Hongzheng and Yongqiang contributed equally; project page: https://causalcoat.github.io/coca

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31796 2026-07-24 cs.CL cs.AI 版本更新 62%

CHERRY: Compressed Hierarchical Experts with Recurrent Representational Yield

CHERRY: 具有循环表示收益的压缩层次专家

Dohyeon Kwon, Youngjin Park

机构 * TeamSparta Inc.(TeamSparta公司)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 提出三种互补技术训练计算高效语言模型:选择性监督与每令牌效率、深度压缩与循环恢复、压缩专家融合,在CHERRY-1.8B韩语模型上验证,实现参数减少2.5倍且性能接近。

Comments 64pp, LaTeX. v2 rebuilds arXiv:2606.31796 into a full report: matched-compute discrimination/generation dissociation, recurrent-yield compression (48->6)+MoEE, pre-registered 1B->13.7B H-PRESERVE, sovereign Korean tokenizer (+9.2% vs Gemma-4), government HLE(Ko) column lead, cyber specialization. Recurrent compression cited by Loopie (arXiv:2607.16051). Tables incl.; v1 in history

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 1 篇

2603.13026 2026-07-24 cs.LG cs.CR 版本更新 86%

PISmith: Reinforcement Learning-based Red Teaming for Prompt Injection Defenses

PISmith: 基于强化学习的提示注入防御红队测试

Chenlong Yin, Runpeng Geng, Yanting Wang, Jinyuan Jia

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 提示注入 :prompt injection(title,abstract);red teaming(title);分类 cs.LG

AI总结 本文提出PISmith框架,通过强化学习评估现有提示注入防御的鲁棒性,发现标准GRPO在攻击强防御时表现不佳,引入自适应熵正则化和动态优势加权以提升探索能力,实验表明最新防御仍易受适应性攻击影响。

Comments To appear in COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 2 篇

2508.05502 2026-07-24 cs.CV cs.AI cs.CL 版本更新 62%

MELLA: Bridging Linguistic Capability and Cultural Groundedness for Low-Resource Language MLLMs

MELLA:弥合低资源语言多模态大语言模型的语言能力与文化根基

Yufei Gao, Jiaying Fei, Nuo Chen, Ruirui Chen, Guohang Yan, Yunshi Lan, Botian Shi

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(东华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Institute of High Performance Computing, A*STAR(高性能计算研究所,A*STAR)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究针对低资源语言MLLMs文化内涵不足问题,提出MELLA数据集,采用双源策略,结合母语网络图像-替代文本对与生成翻译的图像描述进行监督,经实验表明能减轻文化幻觉,强调数据对齐对低资源语言文化基础多模态理解的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10230 2026-07-24 cs.LG cs.SD eess.AS 版本更新 57%

Encode Once, Decode Never: Reusing Audio LM Internals for Efficient Temporal Localization

帧级内部工具使用用于音频语言模型中的时序定位

Joseph An, Phillip Keung, Jiaqi Wang, Orevaoghene Ahia, Noah A. Smith

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文提出帧级内部工具使用方法,通过二元分类器和IHP损失提升音频语言模型的时序定位能力,实现50倍加速和鲁棒长度泛化。

Comments To appear in COLM 2026. Refer to https://github.com/inkitori/taudio/ for the codebase

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 3 篇

2607.20121 2026-07-24 cs.CL 版本更新 79%

OpenSkillRisk: Benchmarking Agent Safety When Using Real-World Risky Third-Party Skills

开放技能风险:使用现实世界中的危险第三方技能时对智能体安全性进行基准测试

Qiyuan Liu, Tingfeng Hui, Kun Zhan, Kaike Zhang, Ning Miao

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 研究基于语言模型的智能体使用第三方危险技能时的安全问题,构建OpenSkillRisk基准测试,涵盖多种不安全场景并能细粒度分析。实验发现当前系统处理危险技能能力不足,揭示三种失败模式,强调需改进语言模型风险推理和智能体框架执行控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13792 2026-07-24 cs.AI cs.CL 版本更新 73%

StackingNet: Collective Inference Across Independent AI Foundation Models

StackingNet:跨独立AI基础模型的集体推理

Siyang Li, Chenhao Liu, Dongrui Wu, Zhigang Zeng, Lieyun Ding

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 StackingNet通过元集成框架整合独立模型输出,提升准确率并减少误差,无需内部参数或训练数据,有效识别和修剪退化模型,在语言理解、视觉属性估计和学术论文评分中优于单一模型和经典集成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19372 2026-07-24 eess.IV q-bio.QM 版本更新 50%

endoExplain: A reproducible protocol for auditing score-localisation discordance in colonoscopy image classifiers

超越人工智能辅助结肠镜检查中的置信度:一种用于内镜人工智能审查的空间、时间和质量感知审计框架

Roberto Alcaraz Machado, Ana Lucía Rodríguez Blanco

专题命中 安全评测 :alignment(abstract)

AI总结 研究针对AI辅助结肠镜检查中仅置信度不能全面评估预测的问题,提出EndoExplain审计框架,整合多种要素。通过实验展示了分类器和分割器的性能,还验证了归因方法等,该框架能分离多种信号,为临床审查提供支持,是回顾性研究原型。

Comments 18 pages, 5 figures, 5 tables. Substantially revised version with a new title and scope; added calibration analysis, paired multi-CAM evaluation, random-deletion controls, architecture and seed robustness analyses, and frozen external spatial transfer

详情

展开后加载摘要…

URL PDF HTML 收藏

7. AI治理与伦理 1 篇

2604.01925 2026-07-24 cs.CL cs.AI 版本更新 73%

ImplicitBBQ: Benchmarking Implicit Bias in Large Language Models through Characteristic Based Cues

ImplicitBBQ: 通过基于特征的提示对大语言模型中的隐性偏见进行基准测试

Bhaskara Hanuma Vedula, Darshan Anghan, Ishita Goyal, Ponnurangam Kumaraguru, Abhijnan Chakraborty

机构 * International Institute of Information Technology, Hyderabad(国际信息技术学院海得拉巴) Indian Institute of Technology, Kharagpur(印度理工学院克勒格布尔分校)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ImplicitBBQ基准测试,通过基于特征的提示评估大语言模型中的隐性偏见,发现隐性偏见在模糊情境中比显性偏见高六倍,现有方法难以有效缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他安全 4 篇

2602.13904 2026-07-24 cs.AI 版本更新 70%

Diagnosing Pathological Chain-of-Thought in Reasoning Models

诊断推理模型中的病理链式思维

Manqing Liu, David Williams-King, Ida Caspary, Linh Le, Hannes Whittingham, Puria Radmard, Cameron Tice, Edward James Young

机构 * Department of Epidemiology, CAUSALab, Harvard University, Boston, USA(流行病学系、CAUSALab、哈佛大学) Imperial College London, London, UK(伦敦帝国学院) McGill University, Montreal, Canada(麦吉尔大学) Geodesic Research, Cambridge, UK(Geodesic研究)

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文提出了一种评估链式思维推理模型中病态的实用工具,通过定义具体度量标准和训练特定模型生物来识别和区分三种不同的病态现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27390 2026-07-24 cs.CL cs.AI 版本更新 62%

EvoSpec: Evolving Speculative Decoding via Real-Time Vocabulary and Parameter Adaptation

EvoSpec: 通过实时词汇和参数自适应进化推测解码

Shuyu Zhang, Lingfeng Pan, Qicheng Wang, Yaqi Shi, Yueyang Tan, Ruyu Yan, Jiaqi Chen, Lixing Du, Lu Wang

机构 * School of Computer Science and Technology(计算机科学与技术学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出EvoSpec框架,通过动态词汇和参数自适应实现推测解码中草稿模型的实时进化,解决静态方法在专业领域和主题切换场景下接受率骤降的问题,在EAGLE-3上实现1.13倍加速并降低27%内存开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16318 2026-07-24 cs.LG 版本更新 57%

Semantics at an Angle: When Cosine Similarity Works Until It Doesn't

角度语义:余弦相似度何时有效及失效

Kisung You

机构 * Baruch College, City University of New York(纽约城市大学巴克莱学院)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 研究探讨余弦相似度在信息处理等领域的应用,围绕其有用性取决于学习表示等因素展开,推导几何恒等式,区分失效机制,回顾证据并描述替代方法,得出其正尺度不变性有条件合理的结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18336 2026-07-24 cs.RO cs.CV 版本更新 50%

Enhancing Glass Surface Reconstruction via Depth Prior for Robot Navigation

通过深度先验增强玻璃表面重建以提升机器人导航

Jiamin Zheng, Jingwen Yu, Guangcheng Chen, Hong Zhang

机构 * Shenzhen Key Laboratory of Robotics and Computer Vision(机器人与计算机视觉深圳重点实验室) Southern University of Science and Technology(南方科技大学) CKS Robotics Institute(CKS机器人研究院)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出一种无需训练的框架,利用深度基础模型作为结构先验,结合鲁棒的局部RANSAC对齐方法,融合原始传感器深度数据,从而避免错误的玻璃测量污染,恢复准确的度量尺度,并引入新的RGB-D数据集用于玻璃区域的几何真实值。

Comments 9 pages, 8 figures, Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏