arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-10 至 2026-07-10 共收录 18 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3 篇

2606.03238 2026-07-10 cs.LG cs.AI 版本更新 93%

When RLHF Fails: A Mechanistic Taxonomy of Reward Hacking, Collapse, and Evaluator Gaming

当RLHF失败时:奖励黑客、崩溃和评估者博弈的机制分类

Zelalem Abahana, David Evans, Satish Mahadevan Srinivasan, Matjaz Gams

机构 * First Citizens Bank(第一公民银行) Alma Mater Europaea University(欧洲大学)

专题命中 偏好对齐 :RLHF(title,title_cn);DPO(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文通过PPO、DPO等方法的对比实验,提出了一种基于奖励和评估者分数方向的机制分类法,将RLHF失败模式分类为可定位、可预测的训练动态。

Comments 20 pages, 8 figures; includes code, artifacts, and live demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07856 2026-07-10 cs.AI 版本更新 84%

Dual-Difficulty Curriculum Learning for Direct Preference Optimization

用于直接偏好优化的双难度课程学习

Mengyang Li, Haozhan Geng, Zhong Zhang, Shuang Liu

机构 * Tianjin Key Laboratory of Wireless Mobile Communications and Power Transmission(天津无线移动通信与电力传输重点实验室) Tianjin Normal University(天津师范大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);分类 cs.AI

AI总结 研究针对大语言模型对齐中课程学习依赖一维难度视图的问题,提出将对齐难度重构为二维空间,开发DM-Curri-DPO框架,引入GSP-Curri-DPO分组自定进度学习框架,实验表明该方法提升了数据效率与鲁棒性,为LLM对齐建立新范式。

Comments We found a critical flaw in the prompt complexity metric, which affects the 2D curriculum grid construction and leads to potentially invalid comparisons. Since this undermines our main conclusions, we are withdrawing the paper and will revise the methodology before resubmission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19665 2026-07-10 cs.SE cs.AI 版本更新 74%

CriterAlign: Criterion-Centric Rationale Alignment for Code Preference Judging

CriterAlign: 以标准为中心的推理对齐用于代码偏好判断

Zhenyu Li, Aleksandar Cvejic, Zehui Chen, Peter Wonka

机构 * KAUST(卡塔尔人工智能研究 institute) ByteDance(字节跳动)

专题命中 偏好对齐 :alignment(title);分类 cs.AI

AI总结 本文提出CriterAlign,一种以标准为中心的推理对齐框架,通过直接的标准级 pairwise 判断、tie-driven 标准细化、swap-consistency 过滤和最终 pairwise 合成,改进了代码偏好判断的准确性,同时引入Human-Preference-Aligned Guidance (HPAG)来提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 5 篇

2605.12726 2026-07-10 cs.LG 版本更新 83%

Before the Last Token: Diagnosing Final-Token Safety Probe Failures

在最后的标记之前:诊断最终标记安全探针失败

Shravan Doda

机构 * SafeSwitch HarmBench SorryBench

专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);分类 cs.LG

AI总结 研究最终标记安全探针在预填充阶段的失败模式,发现安全证据分布在早期用户标记中,传统探针无法捕捉,提出基于PCA-HMM的轨迹模型提升诊断能力。

Comments 8 pages, 2 figures, 7 tables. Accepted at the ICML 2026 Mechanistic Interpretability Workshop and the ICML 2026 Failure Modes in Agentic AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03075 2026-07-10 cs.RO 版本更新 67%

A Collaborative Reasoning Framework for Anomaly Diagnostics in Underwater Robotics

水下机器人异常诊断的协作推理框架

Markus Buchholz, Niamh Ellis, Rahaf Abu Hara, Ignacio Carlucho, Yvan R. Petillot

机构 * School of Engineering & Physical Sciences, Heriot-Watt University(工程与物理科学学院,赫瑞斯泰大学)

专题命中 安全训练 :safety(abstract);trustworthy(abstract)

AI总结 研究水下机器人异常诊断,提出AURA协作框架,集成大语言模型、数字孪生和人在回路交互,通过两个代理进行异常检测与诊断,经人类验证的诊断转化为训练示例完善模型,建立可信赖、不断改进的人机团队模式。

Comments Paper was submitted for ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02379 2026-07-10 cs.CY cs.AI 版本更新 62%

The Contribution of XAI for the Safe Development and Certification of AI: An Expert-Based Analysis

可解释人工智能对人工智能安全开发与认证的贡献:基于专家的分析

Benjamin Fresz, Vincent Philipp Göbels, Safa Omri, Danilo Brajovic, Andreas Aichele, Janika Kutz, Jens Neuhüttler, Marco F. Huber

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 探讨可解释人工智能(XAI)方法对人工智能安全开发与认证的作用,通过对专家的15次定性访谈发现,XAI方法虽能揭示机器学习模型偏差等问题助力安全开发,但因认证需全面正确信息,其影响有限。

Comments This preprint has not undergone peer review or any post-submission improvements or corrections. The Version of Record of this contribution is published in Artificial Intelligence in HCI (HCII 2026), Lecture Notes in Computer Science, vol. 16745, and is available online at https://doi.org/10.1007/978-3-032-30849-8_13

Journal ref Degen, H., Ntoa, S. (eds) Artificial Intelligence in HCI. HCII 2026. Lecture Notes in Computer Science, vol 16745, pp. 219--242. Springer, Cham (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11549 2026-07-10 cs.HC 版本更新 50%

UNIPO: Unified Interactive Visual Explanation for RL Fine-Tuning Policy Optimization

UNIPO:统一的交互式可视化用于RL微调策略优化

Aeree Cho, Alexander D. Greenhalgh, Jonathan Bodea, Anthony Peng, Duen Horng Chau

专题命中 安全训练 :alignment(abstract)

AI总结 UNIPO通过统一设计揭示RL微调算法的token级训练动态,提供高阶训练概述、步骤级提示响应检查器和算法对比视图,支持非专家教学和AI从业者算法选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21858 2026-07-10 math.OC 版本更新 50%

When to Match: A Cost-Balancing Principle for Dynamic Markets

何时匹配:动态市场的成本平衡原则

Jie Liu, Hailun Zhang, Jiheng Zhang

专题命中 安全训练 :safety(abstract)

AI总结 研究动态市场中平台何时匹配的问题,提出成本平衡(CB)规则,在无需预测的情况下,能根据等待成本与当前匹配成本比例决定匹配时机,相比行业标准有成本和延迟优势,是简单高效且最坏情况最优策略。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 1 篇

2502.12497 2026-07-10 cs.CR 版本更新 50%

Demystifying LLM Supply Chain Vulnerabilities in the Wild: Distribution, Root Cause, and Real-World Impact

揭开大语言模型供应链在实际应用中的漏洞:分布、根源及现实世界影响

Shenao Wang, Yanjie Zhao, Zhao Liu, Quanchen Zou, Haoyu Wang

专题命中 越狱攻击 :safety(abstract)

AI总结 该研究首次系统大规模实证分析大语言模型供应链漏洞,分析529个实际漏洞,发现漏洞集中在应用层等,特定漏洞源于独特特征,还研究了现实影响,提炼5条见解,为保障供应链安全提供数据基础与研究方向。

Comments Accepted by Internetware 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 1 篇

2605.03378 2026-07-10 cs.CR cs.SE 版本更新 78%

ARGUS: Defending LLM Agents Against Context-Aware Prompt Injection

ARGUS:防御大语言模型智能体免受上下文感知提示注入攻击

Shihao Weng, Yang Feng, Jinrui Zhang, Xiaofei Xie, Jiongchi Yu, Jia Liu

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 研究针对LLM智能体的上下文感知提示注入攻击,提出AgentLure基准测试及ARGUS因果溯源审计器,通过构建溯源图等验证行动因果依据,在AgentLure上降低攻击成功率,提升安全-效用权衡表现。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 隐私与版权 1 篇

2603.10254 2026-07-10 cs.LG 版本更新 57%

Improving TabPFN's Synthetic Data Generation by Integrating Causal Structure

通过整合因果结构改进TabPFN的合成数据生成

Davide Tugnoli, Andrea De Lorenzo, Marco Virgolin, Giovanni Cinà

机构 * Department of Mathematics, Informatics and Geosciences(数学、信息学与地质科学系) University of Trieste(特里este大学) Department of Engineering and Architecture(工程与建筑系) InSilicoTrials Technologies BV(InSilicoTrials技术公司) Amsterdam UMC Institute for Logic, Language and Computation(阿姆斯特丹大学医学中心逻辑、语言与计算研究所) University of Amsterdam(阿姆斯特丹大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.LG

AI总结 通过整合因果结构改进TabPFN的合成数据生成,提升合成数据的质量和稳定性

Comments Camera-ready version, accepted at UAI 2026. 9 pages main text, 44 pages total (including supplementary material), 35 figures. Code: https://github.com/DavideTugnoli/tabpfn-causal-synthetic

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 4 篇

2604.26962 2026-07-10 cs.CY cs.AI cs.CL 版本更新 67%

DeepTutor: Towards Agentic Personalized Tutoring

DeepTutor:迈向代理式个性化辅导

Bingxi Zhao, Jiahao Zhang, Xubin Ren, Zirui Guo, Tianzhe Chu, Yi Ma, Chao Huang

机构 * The University of Hong Kong(香港大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 DeepTutor通过结合引用基础问题辅导与难度校准的问题生成,提出一个统一的开放源码框架,利用静态知识和动态学习者记忆实现个性化适应,并在五个领域大学课程中评估个性化教学效果。

Comments Tech Report, work in progress. Code available at https://github.com/HKUDS/DeepTutor

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00329 2026-07-10 eess.SY cs.LG cs.SY stat.ML 版本更新 57%

Benchmarking Recursive-Collapse Warning Claims Under Matched False-Positive Control

在匹配假阳性控制下对递归崩溃警告声明的基准测试

David Mullett

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 提出Loopzero基准框架,通过方向性遥测模式(增益G、递归持久性p、多样性δ)在匹配假阳性预算下评估递归系统崩溃警告声明,并报告标准检测器未达到可接受工作点。

Comments 29 pages, 7 figures, 2 tables; supplementary materials: 9 pages, 1 figure, 4 tables. Code, derived data packets, and Lean artifact: https://github.com/davidmullett/loopzero-paper-public (release tag lean-v1.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13994 2026-07-10 cs.CV cs.AI q-bio.NC 版本更新 57%

Human-like Object Grouping in Self-supervised Vision Transformers

自监督视觉Transformer中的类人物体分组

Hossein Adeli, Seoyoung Ahn, Andrew Luo, Mengmi Zhang, Nikolaus Kriegeskorte, Gregory Zelinsky

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文通过行为基准测试,探讨自监督视觉模型在物体感知上的类人特性,发现基于DINO目标的Transformer模型在预测人类反应时间方面表现最佳,且Gram矩阵结构对感知对齐有驱动作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19032 2026-07-10 cs.CV 版本更新 50%

Diagnosing Corruption-Induced Reliability Failures in Vision-Language Models

诊断视觉语言模型中由损坏引起的可靠性故障

Xiangjie Sui, Songyang Li, Hanwei Zhu, Baoliang Chen, Yuming Fang, Xin Sun

机构 * City University of Macau(澳门城市大学) Nanyang Technological University(南洋理工大学) Jiangxi University of Finance and Economics(江西财经大学)

专题命中 安全评测 :alignment(abstract)

AI总结 研究视觉损坏对视觉语言模型行为的影响,引入Bench-C测试平台及稳健对齐分数(RAS),通过对13个VLM实验发现轻度损坏会提高top-1准确率却降低预测结构,支持超越最终答案的稳健性评估。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他安全 3 篇

2606.06379 2026-07-10 cs.CV cs.AI 版本更新 57%

EasyLens: A Training-Free Plug-and-Play Subtle-Lesion Representation Amplifier for Medical Vision-Language Models

EasyLens: 一种无需训练的即插即用型微病变表示放大器,用于医学视觉语言模型

Qiwei Zeng, Hao Wang, Jinghao Lin, Shuchang Ye, Yuezhe Yang, Yige Peng, Haoyuan Che, Jinman Kim, Lei Bi

机构 * Jilin University(吉林大学) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) ByteDance(字节跳动) Institute of Translational Medicine, Shanghai Jiao Tong University(上海交通大学转化医学研究院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 提出EasyLens,一种无需训练的即插即用模块,通过构建病理-解剖原型空间、反事实推理选择病变相关补丁以及形态引导残差增强,放大医学视觉语言模型对微病变的表示能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01388 2026-07-10 cs.CV 版本更新 50%

LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding

LESV: 语言嵌入稀疏体素融合用于开放词汇3D场景理解

Fusang Wang, Nathan Piasco, Moussab Bennehar, Luis Roldão, Dzmitry Tsishkou, Fabien Moutarde

机构 * Huawei Noah's Ark Lab(华为诺亚方舟实验室) CAOR, Mines Paris-PSL, France(法国巴黎高科矿业学院CAOR实验室)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出LESV框架,通过稀疏体素 rasterization 解决3D场景理解中空间和语义模糊问题,利用AM-RADIO实现密集对齐,提升细粒度查询性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16456 2026-07-10 cs.CV 版本更新 50%

PhyMAGIC: Physical Motion-Aware Generative Inference with Confidence-guided LLM

PhyMAGIC:基于置信度引导的大语言模型的物理运动感知生成推理

Siwei Meng, Yawei Luo, Ping Liu

机构 * Department of Computer Science \& Engineering, University of Nevada, Reno, USA School of Software Technology, Zhejiang University, China

专题命中 其他安全 :alignment(abstract)

AI总结 针对3D内容生成中动态模型物理一致性问题,PhyMAGIC提出无需训练的框架,整合图像到视频扩散模型、大语言模型置信度引导推理及可微物理模拟器,通过迭代优化和模拟反馈生成物理一致的运动,性能优于现有方法。

Comments This work is accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏