arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-07 至 2026-07-07 共收录 105 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 7 篇

2607.03166 2026-07-07 cs.CL cs.AI cs.LG 新提交 82%

KARMA: Knowledge graph-based Automated Reasoning Materialization and Alignment

KARMA:基于知识图谱的自动推理实例化与对齐

Jinkyeong Choi, Chaebin Jeong, Donghyeon Park

机构 * Sejong University(世宗大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对基于模板对比合成的问题,提出KARMA方法,通过枚举知识图谱路径生成对比候选,用解耦槽级目标进行偏好监督,在多领域基准测试中表现优于基线。

Comments First version, 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03248 2026-07-07 cs.LG cs.AI 新提交 81%

Unbiased Alignment for Large Language Models with Noisy Preferences

具有噪声偏好的大语言模型的无偏对齐

Jialiang Wang, Xianming Liu, Xiong Zhou, Hui Liu, Haoliang Li

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型与人类偏好对齐问题,针对真实偏好数据集中噪声大的问题,提出无偏对齐理论框架,引入新损失函数,能直接从噪声数据集无偏训练模型,实验表明优于现有基线。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04590 2026-07-07 cs.AI 新提交 77%

Attention Limited Reward Learning

注意力受限奖励学习

Wenqian Xing

机构 * Stanford University(斯坦福大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.AI

AI总结 研究通过基于理性注意力不集中的简化模型,探讨标准奖励建模中遗漏的内容,分离两种模糊性,指出有限注意力会扭曲成对比较结果,学习受标签携带的关注信息量而非数量影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03453 2026-07-07 cs.LG cs.AI 新提交 73%

Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning

最佳中的更优N:通过上下文学习生成预对齐响应

Eric Lei, Hsiang Hsu, Chun-Fu Chen

机构 * JPMorganChase Global Technology Applied Research(摩根大通全球技术应用研究)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 提出Best-of-Better-$N$框架应对响应质量限制问题,利用检索高奖励示例及重写步骤,通过上下文学习使预训练模型输出分布向高奖励区域转移,在安全对齐和数学推理基准测试中有更好表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04235 2026-07-07 cs.CL 新提交 70%

Spinning Straw into Gold: Relabeling LLM Agent Trajectories in Hindsight for Successful Demonstrations

化腐朽为神奇:事后重新标记大语言模型智能体轨迹以实现成功示范

Zichao Li, Gang Wu, Zichao Wang, Ruiyi Zhang, Wanrong Zhu, Ryan A. Rossi, Vlad I Morariu, Jihyung Kil

机构 * Mila, McGill University(米拉,麦吉尔大学) Adobe Research(Adobe研究院)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL

AI总结 针对大语言模型智能体监督瓶颈,利用智能体展开中隐含的成功目标,引入事后监督学习(HSL),通过辅助大语言模型重新标记轨迹及目标并微调,提出两种技术减轻数据次优性,实验证明其优势。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03025 2026-07-07 cs.AI cs.MA 新提交 57%

Human-Centric Reflective Architecture for Human-AI Collaborative Decision-Making

用于人类与人工智能协作决策的以人类为中心的反思架构

Andreas Kouridakis, Dimitrios Patiniotis Spyropoulos, George Vouros

机构 * University of Piraeus(比雷埃夫斯大学)

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

AI总结 研究人类与人工智能协作决策问题,将其建模为随机博弈,提出以人类为中心的反思架构,整合人类校准模型与强化学习智能体,提升决策有效性并给出高质量建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01392 2026-07-07 cs.CL 新提交 57%

Multi-Objective Exploration and Preference Optimization via Mutual Information

基于互信息的多目标探索与偏好优化

Hongyan Xie, Yikun Ban, Ruiyu Fang, Zixuang Huang, Deqing Wang, Jianxin Li, Shuangyong Song

机构 * School of Computer, Beihang University(北京航空航天大学计算机学院) Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰AGI实验室,中国电信人工智能技术(北京)有限公司)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 提出MI-EPO框架,通过最大化生成响应、偏好反馈和偏好向量的联合条件互信息,统一多目标探索与对齐,实现可控且稳定的多目标权衡。

Comments Accepted at ECML/PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 16 篇

2607.02914 2026-07-07 cs.AI 新提交 88%

Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models

Oyster-II:大语言模型中用于建设性安全对齐的强化学习

Jiyang Guan, Yong Xie, Jun Chen, Jiexi Liu, Zipeng Ye, Defeng Li, Jiayu Shen, Jialing Tao, Hui Xue

机构 * Alibaba AAIG(阿里巴巴人工智能全球研究院)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 研究大语言模型安全等问题,指出传统策略不足。基于Oyster-I范式,提出Oyster-II框架,采用强化学习结合零强化学习范式,在多基准测试中安全维度表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02781 2026-07-07 cs.LG cs.AI cs.CL 新提交 87%

Safe Inference-Time Alignment via Lagrangian Reward Augmentation

通过拉格朗日奖励增强实现安全推理时对齐

Yaswanth Chittepu, Ativ Joshi, Sohini Chintala, Scott Niekum

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Independent Researcher(独立研究者)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究提出拉格朗日奖励增强框架,从含奖励与成本模型的约束目标出发,经对偶化将问题转化为一维凸问题,校准对偶变量获增强奖励,提升推理时对齐的有益性与无害性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31876 2026-07-07 cs.AI cs.CV cs.LG 新提交 86%

Harnessing Textual Refusal Directions for Multimodal Safety

利用文本拒绝方向实现多模态安全

Moreno D'Incà, Nicu Sebe, Massimiliano Mancini

机构 * University of Trento(特伦托大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 提出MARS方法,通过从LLM骨干提取的文本拒绝方向泛化到多模态,无需多模态安全数据即可提升安全性,在五个先进MLLM上验证了有效性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03386 2026-07-07 cs.AI cs.LG 新提交 81%

When Aggregate Alignment Misleads: Auditing Policy Repair Without Per-State Expert Actions

当聚合对齐产生误导时:无需逐状态专家操作的审核策略修复

Peiying Zhu, Sidi Chang

机构 * Blossom AI(绽放人工智能公司) Blossom AI Labs(绽放人工智能实验室)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 研究在酒店定价模拟器中,智能策略编辑器仅接收区域级诊断反馈时的策略修复问题,用多重启大语言模型编辑器进行修复,其不仅提升收益还减小情节构成距离,结果表明应按诊断反馈是否成可靠闭环结果评估策略修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05180 2026-07-07 cs.RO cs.CV cs.SY eess.SY 新提交 78%

VLM-CASE: Vision-Language Model Enabled Context-Adaptive Safety Envelopes for Anticipatory Safe Autonomous Driving

VLM-CASE:面向前瞻安全自动驾驶的视觉语言模型赋能上下文自适应安全包络

Tianjia Yang, Ke Li, Ruwen Qin, Xianbiao Hu

机构 * Department of Civil and Environmental Engineering, The Pennsylvania State University(宾夕法尼亚州立大学土木与环境工程系) Department of Civil Engineering, Stony Brook University(石溪大学土木工程系)

专题命中 安全训练 :safety(title,abstract)

AI总结 针对恶劣工况下自动驾驶感知与性能退化、仅能事后响应的问题,提出基于微调VLM的上下文自适应安全包络框架,实现前瞻安全控制,在多场景仿真中性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04728 2026-07-07 cs.CL cs.AI cs.LG 新提交 78%

Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment

将离策略令牌转换为策略内令牌:一种改进大语言模型对齐的插件方法

Yu Li, Xiuyu Li, Mingyang Yi, Jiaxing Wang, zhangliangxu, Zhaolong Xing, Zhen Chen

机构 * Renmin University of China(中国人民大学)

专题命中 安全训练 :alignment(title);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型强化学习后训练中离策略数据问题,提出选择性重要性采样(SIS),受拒绝采样启发,以离策略模型为提议分布进行令牌级拒绝测试,理论证明可减少梯度估计差距,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04846 2026-07-07 cs.LG cs.AI 新提交 73%

Pretraining Curricula Enable Selective Fine-tuning

预训练课程实现选择性微调

Sebastian A. Bruijns, Jirko Rubruck, Mia H. Whitefield, Kai J. Sandbrink, Fazl Barez, Christopher Summerfield

机构 * University of Oxford(牛津大学)

专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 研究预训练课程如何影响学习、泛化和微调选择性,对比平衡与不平衡预训练方式,发现不平衡预训练促进上下文学习并提高拒绝微调选择性,还扩展到合成语言学习任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05355 2026-07-07 cs.CL cs.ET cs.LG 新提交 62%

Faithfulness to Refusal: A Causal Audit of Neuron Selectors

对拒绝的忠实性:神经元选择器的因果审计

Ananth Eswar, Pratinav Seth, Utsav Avaiya, Vinay Kumar Sankarapu

机构 * Lexsi Labs(Lexsi实验室)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG

AI总结 针对归因分数识别神经元行的因果有效性未经验证的问题,通过单次神经元行置零的配对审计,验证归因方法在识别冗余行、实现安全拒绝行为上的因果有效性,揭示排序稳定性不能代表因果有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03177 2026-07-07 cs.SE cs.AI cs.LG 新提交 62%

CRRL: A Causality-Based Reinforcement Learning Framework for Autonomous System Recovery

CRRL:一种用于自主系统恢复的基于因果关系的强化学习框架

Safia Fatima, Kai Olav Ellefsen, Leon Moonen

机构 * Simula Research Laboratory(Simula研究实验室) University of Oslo(奥斯陆大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究自主系统恢复中传统强化学习问题,引入基于因果关系的CRRL框架,利用驾驶日志因果关系塑造训练信号,使策略与基于规则的恢复有效协作,提升相关指标。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02072 2026-07-07 cs.LG cs.AI cs.CR 新提交 62%

kNNGuard: Turning LLM Hidden Activations into a Training-Free Configurable Guardrail

kNNGuard:将LLM隐藏激活转化为无需训练的可配置护栏

Mahmoud Abdelfattah, Hamid Nasiri, Peter Garraghan

机构 * Lancaster University(兰卡斯特大学) Mindgard

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出kNNGuard,一种利用现成LLM激活空间的无需训练护栏,通过多层kNN融合激活和嵌入空间分数,在多个领域达到与微调方法相当或更优的F1,且速度更快。

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04668 2026-07-07 cs.OS cs.AI cs.PF 新提交 57%

Elastic Gang: Per-Token Membership Change for a Hard-Barriered LLM Inference Gang Co-Scheduled with OS Processes

弹性组:与操作系统进程协同调度的硬屏障大语言模型推理组的逐令牌成员变更

Daeyeon Son

机构 * Independent Researcher(独立研究员)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究设备上大语言模型解码中CPU - SIMD计算与操作系统对核心资源需求冲突问题,提出弹性组机制,通过ACK锁定期协议实现逐令牌核心成员变更,提升吞吐量并保障正确性。

Comments 14 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04290 2026-07-07 cs.NI cs.AI 新提交 57%

Agentic-V2X: Small Language Model Agents for Deadline-Aware V2X Scheduling in 5G/6G Networks

Agentic-V2X:用于5G/6G网络中具有截止日期感知的V2X调度的小型语言模型代理

Gerasimos Papanikolaou-Ntais, Alexandros Kaloxylos, Athanasios Kanavos

机构 * Department of Informatics, University of Piraeus(比雷埃克斯大学信息学院) Department of Informatics and Telecommunications, University of Peloponnese(希腊佩拉索斯大学信息与电信学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究针对5G/6G网络中V2X调度,提出Agentic-V2X架构。小型本地部署语言模型生成策略,经验证后由轻量级控制器执行,评估多种策略,该架构能生成有效可执行策略,在多方面有竞争力,但非最佳。

Comments 20 pages 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00269 2026-07-07 cs.AI 新提交 57%

Mnemosyne: Agentic Transaction Processing for Validating and Repairing AI-generated Workflows

Mnemosyne: 用于验证和修复AI生成工作流的代理事务处理

Edward Y. Chang, Longling Geng, Emily J. Chang

机构 * Stanford University(斯坦福大学) QuadriumAI

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出代理事务处理(ATP)模型,将生成动作视为不可信提案,通过确定性约束集验证后才提交,并实现运行时修复,确保状态正确性独立于生成层。

Comments 41 pages, 25 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04745 2026-07-07 cs.RO cs.CV 新提交 50%

Trajectory-Anchor Optimization for Overconfident Thermal Visual Place Recognition: Zero-Leakage OOD Auditing and Kidnapped-Robot Recovery

用于过度自信的热视觉场所识别的轨迹锚点优化:零泄漏异常检测与绑架机器人恢复

Zhiyuan Lu, Kanji Tanaka

专题命中 安全训练 :alignment(abstract)

AI总结 研究针对基于基础模型的热视觉场所识别前端在分布外或未映射条件下的过度自信强制匹配失败问题,提出轨迹锚点优化(TAO),通过压缩多视图时间验证解决组合挑战,实现高效故障安全过滤。

Comments 11 pages, 5 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03963 2026-07-07 cs.SE 新提交 50%

Neuro-Symbolic Reasoning for Vulnerability Detection

用于漏洞检测的神经符号推理

Yanjie Zhao, Hongjie Chen, Li Lu, Zhou Yang, Xiao Cheng, Haoyu Wang

专题命中 安全训练 :safety(abstract)

AI总结 研究基于大语言模型的漏洞检测不可靠性,提出神经符号框架LeanGuard,通过将代码解释与安全义务判定分离,神经侧过滤事实,符号侧形式验证,证据感知裁决器权衡结果,在五个CWE类上实例化框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02579 2026-07-07 cs.SE 新提交 50%

When Not to Write Memory: Governing False Promotion from Correlated Agent Traces

何时不写入内存:管理来自相关代理痕迹的错误推广

Yijiashun Qi, Xiang Xu, Yuxuan Li

专题命中 安全训练 :safety(abstract)

AI总结 研究语言代理从执行痕迹写入可复用内存时何时应拒绝写入的问题,引入GovMem策略,通过估计依赖感知支持等进行决策,在测试中能减少错误推广。

Comments accepted by mlise 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 2 篇

2607.04645 2026-07-07 cs.CL cs.AI cs.CR cs.LG 新提交 85%

Retroactive Chain-of-Thought (RetroCoT): Forensic Reconstruction Prompts as a Safety Diagnostic Across Model Generations

追溯性思维链(RetroCoT):作为跨模型代际安全诊断的法证重建提示

Samira Hajizadeh

机构 * Columbia University(哥伦比亚大学)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现大语言模型安全对齐受语用寄存器影响,介绍追溯性思维链攻击RetroCoT将有害请求重构为法证重建任务,在AdvBench测试中取得一定成功率,还发现模型代际差异及新语用寄存器对模型安全对齐的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02961 2026-07-07 cs.CV cs.CR 新提交 75%

Overloading Large Vision-Language Models for Jailbreaking

通过信息过载对大型视觉语言模型进行越狱攻击

Haoyu Zhang, Yangyang Guo, Mohan Kankanhalli

机构 * National University of Singapore(新加坡国立大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 研究大型视觉语言模型易受越狱攻击问题,提出基于递归图像排版布局的信息过载方法,含大量文本和多维图像攻击,大幅提升攻击成功率,凸显此为现实部署安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 1 篇

2606.20408 2026-07-07 cs.CR cs.AI 新提交 79%

NRT-Bench: Benchmarking Multi-Turn Red-Teaming of LLM Operator Agents in Safety-Critical Control Rooms

LLM智能体安全性、多轮红队测试、越狱基准、对抗鲁棒性、安全关键系统

Hanwool Lee, Dasol Choi, Bokyeong Kim, Haon Park, Seung Geun Kim

机构 * AIM Intelligence(AIM智能公司) KAERI(韩国原子能研究所)

专题命中 红队测试 :safety(title,abstract);分类 cs.AI

AI总结 提出NRT-Bench基准,通过模拟核电站控制室的多轮红队测试,评估LLM智能体在安全关键系统中的对抗鲁棒性,发现不同模型的漏洞几乎不重叠,且防御效果高度依赖模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 提示注入 4 篇

2607.03821 2026-07-07 cs.CR cs.AI 新提交 79%

DualView: Preventing Indirect Prompt Injection in Personal AI Agents

双视图:防止个人人工智能代理中的间接提示注入

Juhee Kim, Woohyuk Choi, Taehyun Kang, Youngmin Kim, Byoungyoung Lee

机构 * Seoul National University(首尔国立大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 研究个人人工智能代理面临的间接提示注入攻击问题,提出双视图方法,通过扩展不可信数据跟踪到用户环境,部署为插件,有效阻止攻击并保持实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05277 2026-07-07 cs.CR cs.LG 新提交 57%

Untrusted Content Masking for Web Agents with Security Guarantees

具备安全保证的Web智能体不可信内容掩码技术

Kristina Nikolić, Egor Zverev, Javier Rando, Matthew Jagielski, Edoardo Debenedetti, Florian Tramèr

机构 * ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心) ISTA(瑞士信息科学与技术学院) Anthropic(Anthropic公司)

专题命中 提示注入 :prompt injection(abstract);分类 cs.LG

AI总结 针对Web智能体的提示注入安全边界缺失问题,提出UCM方法,利用网页DOM区分内容区域,通过掩码与沙箱交互恢复安全边界,实现带安全保障的Web环境交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05120 2026-07-07 cs.CR cs.AI 新提交 57%

Agent Data Injection Attacks are Realistic Threats to AI Agents

智能体数据注入攻击对人工智能智能体构成现实威胁

Woohyuk Choi, Juhee Kim, Taehyun Kang, Jihyeon Jeong, Luyi Xing, Byoungyoung Lee

机构 * Seoul National University(首尔国立大学) Largosoft University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 介绍智能体数据注入攻击(ADI)这一新型间接提示注入,其伪装可信数据注入恶意数据使智能体执行意外操作,研究发现现实智能体漏洞及ADI在多种模型和智能体设置中有效,揭示智能体安全关键差距。

Comments 19 pages, 19 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04240 2026-07-07 cs.AI q-bio.CB 新提交 57%

Biological Motifs for Agentic Control

用于智能体控制的生物基序

Bogdan Banu

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 研究大语言模型向自主智能体转变带来的可靠性等挑战,通过基因调控网络与智能体软件系统的类型化接口对应,映射生物基序到软件设计模式,给出智能体操作数等核心贡献并具实践可行性。

Comments 80 pages. Preprint; feedback welcome

详情

展开后加载摘要…

URL PDF HTML 收藏