arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-06 至 2026-08-06 共收录 92 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3 篇

2608.05040 2026-08-06 cs.CR 新提交 88%

Private Direct Preference Optimization for LLM Alignment

面向大语言模型对齐的私有直接偏好优化

Yangfan Jiang, Fei Wei, Ergute Bao, Xiaokui Xiao, Yaliang Li, Bolin Ding

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(title,abstract)

AI总结 该研究针对DPO的隐私缺陷,提出PrivDPO方法,通过沿偏好轴添加校准随机性实现偏好隐私,在对齐基准和LLM上取得了更好的隐私-效用权衡。

Comments accepted for publication at CCS 2026, extended version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06337 2026-08-06 cs.CL cs.AI cs.LG 版本更新 75%

Can Post-Training Transform LLMs into Causal Reasoners?

训练后能否将大语言模型转变为因果推理者?

Junqi Chen, Sirui Chen, Chaochao Lu

机构 * Shanghai Artificial Intelligence Library(上海人工智能图书馆) Fudan University(复旦大学) Tongji University(同济大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过CauGym数据集评估了训练后方法对LLM因果推理能力的提升,发现适当训练可使小型模型在因果推理任务中超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03808 2026-08-06 cs.CV cs.LG 版本更新 57%

From Brute Force to Semantic Insight: Performance-Guided Data Transformation Design with LLMs

从暴力到语义洞察:基于LLM的性能引导数据转换设计

Usha Shrestha, Dmitry Ignatov, Radu Timofte

机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg(计算机视觉实验室、CAIDAS与IFI、乌尔姆大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 本文提出了一种基于LLM的性能引导数据转换设计方法,通过经验反馈实现闭环优化,减少穷举搜索需求,提升代码生成的准确性与任务对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 7 篇

2608.04415 2026-08-06 cs.CL 新提交 79%

Social Pressure Breaks Majority Voting in LLM Safety Panels

社交压力会破坏大语言模型安全评审团的多数投票机制

Yibo Hu, Jiaming Qu

机构 * Illinois Institute of Technology(伊利诺伊理工学院) Amazon(亚马逊)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 该研究发现,在LLM安全评审团中,同行的错误标签断言会大幅提升误报率,且评审员更易追随“不安全”方向,多数投票机制会因社交压力失效,还提供了部署前诊断方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05045 2026-08-06 cs.CR cs.AI cs.CL 新提交 62%

Gradient Immunity: Null-Space Resistance to Malicious Fine-Tuning

梯度免疫:对恶意微调的零空间抗性

Yuxuan Huang, Xingyu Zeng, Tianhang Zheng, Chaochao Lu

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 针对部分保护开放权重(PPOW)发布场景的大型语言模型,提出单向安全门(USG)防御,可抑制恶意微调的有害梯度,提升恶意下游适应的成本且无需下游用户配合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04289 2026-08-06 cs.AI cs.CL 新提交 62%

SafeCommit: Certifying When Memory-Grounded Agents May Safely Act

SafeCommit:验证基于记忆的智能体何时可以安全行动

Mayur Akewar, Ravi Ranjan

机构 * Florida International University(佛罗里达国际大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 针对长程智能体过早承诺的问题,提出SafeCommit风险控制层,通过构建合理潜在世界、共形动作证书等实现安全行动决策,还展示了安全-效用权衡。

Comments 14 pages, 6 tables, and 1 figure, target NeurIPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13028 2026-08-06 cs.LG cs.AI cs.RO 版本更新 62%

TerraZero: Procedural Driving Simulation for Zero-Demonstration Self-Play at Scale

TerraZero:用于大规模零演示自博弈的过程式驾驶模拟

Zhouchonghao Wu, Akshay Rangesh, Weixin Li, Wei-Jer Chang, Zachary Lee, Saeed Bonab, Tim Wang, Wei Zhan

机构 * Applied Intuition(应用直觉)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究旨在训练强大自动驾驶智能体,提出TerraZero过程式驾驶模拟器和自博弈训练堆栈,其速度快、逼真且多样。通过特定方式填充地图生成无限场景,智能体仅靠强化学习训练,能零样本泛化,在多个基准测试中表现出色。

Comments Technical Report from Applied Intuition Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04065 2026-08-06 cs.CR cs.AI 新提交 57%

An Inline Control Architecture for Language Models in Intelligent Transportation Systems

智能交通系统中语言模型的内联控制架构

Narendra Kumar Dewangan, Mounira Msahli

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 针对V2X系统中LLM的提示级攻击问题,提出Guarded-V2X内联语义护栏架构,经四阶段实验验证其可降低入侵成功率且不超延迟预算。

Comments 18 pages, under minor revision (IEEE transactions)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02009 2026-08-06 cs.AI 版本更新 57%

HALT: Verification-Aware Stopping for Retrieval-Augmented Search Agents

HALT:面向检索增强搜索智能体的感知验证式停止策略

Daeyoung Roh, Donghee Han

机构 * KAIST(韩国科学技术院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 该研究针对检索增强搜索智能体的冗余检索问题,提出轻量级感知验证停止策略HALT,在三个多跳QA基准上减少冗余搜索且保持精确匹配,无需修改宿主智能体。

Comments 23 pages, 6 figures. Code: https://github.com/Noverse0/HALT

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04175 2026-08-06 cs.CV 新提交 50%

TriCLE: Tri-Modal Vision-Language Reasoning for Edge-Deployed Fine-Grained Clustering

TriCLE:面向边缘部署的细粒度聚类的三模态视觉-语言推理

Kishor Datta Gupta, Md. Mahfuzur Rahman, Fahad Rahman, Ahmed Rafi Hasan, Faysal Mehrab Chowdhury, Mohd Ariful Haque, Roy George

机构 * Clark Atlanta University(克拉克亚特兰大大学) United International University(国际大学) North South University(北南大学)

专题命中 安全训练 :alignment(abstract)

AI总结 TriCLE是面向边缘部署的三模态视觉-语言系统,通过生成伪热视图和伪激光雷达深度,结合对齐策略实现细粒度飞机聚类,适配8GB内存边缘设备,验证与测试均取得良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 5 篇

2608.04034 2026-08-06 cs.CR 新提交 82%

A Multimodal Automatic Redteaming Evaluation based on Atomic Jailbreak Strategy Decoupling and Combination

基于原子越狱策略解耦与组合的多模态自动红队评估

Shiji Zhao, Yuxuan Zhou, Chen Xiong, Dongxian Wu, Yang Bai, Xun Chen

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)

AI总结 针对现有多模态越狱攻击的两大挑战,本文提出HACA方法,构建多模态原子越狱策略空间,对5种主流MLLMs平均攻击成功率达95.48%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02422 2026-08-06 cs.CR cs.AI 版本更新 70%

Dynamic Jailbreaking Attack

动态目标攻击

Kedong Xiu, Yunhan Yang, Churui Zeng, Tianhang Zheng, Xinzhe Huang, Di Wang, Puning Zhao, Zhan Qin, Kui Ren

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院) Nanyang Technological University(南洋理工大学) King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹科技大学) SUN YAT-SEN UNIVERSITY(孙中山大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 动态目标攻击通过利用目标模型自身响应作为自适应目标,提高了对抗攻击的成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15560 2026-08-06 cs.CR cs.AI cs.LG 交叉投稿 62%

Temporal Context Awareness: A Defense Framework Against Multi-turn Manipulation Attacks on Large Language Models

时序上下文感知:一种针对大型语言模型多轮操纵攻击的防御框架

Prashant Kulkarni, Assaf Namer

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

AI总结 针对LLMs易受多轮操纵攻击的问题,本文提出TCA框架,通过分析语义漂移等实现防御,初步评估显示其能识别传统方法遗漏的微妙操纵模式,为对话式AI系统提供安全保障。

Comments 6 pages, 2 figures, IEEE CAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04322 2026-08-06 cs.CL 新提交 57%

DataRx: Missingness-Aware Sampling for Safer Large Language Model Task-Specific Fine-Tuning

DataRx:面向更安全的大语言模型任务特定微调的缺失感知采样方法

Junbo Zhang, Qianli Zhou, Xinyang Deng, Wen Jiang

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL

AI总结 本文提出DataRx缺失感知采样方法,通过高维隐表示量化安全信号差距,仅用1% BeaverTails安全样本,即可大幅降低Llama3-8B-Instruct的攻击成功率,还可与现有安全数据合成方法结合提升防御效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04469 2026-08-06 cs.CR cs.MA 版本更新 50%

Cross-Layer Semantic Flow Reconstruction for Attack Detection in Agentic Systems

超越输入防护:为执行感知攻击检测重建跨代理语义流

Qizhi Cai, Yangyang Wei, Zhipeng Chen, Shouling Ji, Zhenyuan Li

专题命中 越狱攻击 :prompt injection(abstract)

AI总结 SysName通过重建跨代理语义流,实现执行感知的攻击检测,有效识别多种复合攻击向量,提升多代理系统安全性。

Comments 16 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 3 篇

2608.05108 2026-08-06 cs.CR 新提交 86%

Agent Against Agent: An Agentic System for Automatic Prompt Injection Red Teaming

智能体对抗智能体:一种用于自动提示注入红队测试的智能体系统

Yanting Wang, Chenlong Yin, Runpeng Geng, Jinyuan Jia

专题命中 红队测试 :prompt injection(title,abstract);red teaming(title)

AI总结 本研究提出PIMiner智能体系统,用于自动提示注入红队测试,该系统构建可迁移策略库,仅需少量查询即可在IPIArena、AgentDojo基准上对多款LLM实现高攻击成功率,解决现有方法泛化性差的问题。

Comments Our code is available at https://github.com/wang-yanting/PIMiner

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04018 2026-08-06 cs.CY cs.AI 新提交 81%

Governing Execution Risk in Agentic AI Systems: A Trajectory-Guided Framework for Red Teaming

管控智能体AI系统的执行风险:一种基于轨迹的红队测试框架

Zhihao Zhu, Yi Yang

专题命中 红队测试 :red teaming(title,abstract);分类 cs.AI、cs.CY

AI总结 本研究提出基于轨迹的红队测试框架TrajRed和运行时管控层TrajGuard,在AgentDojo实验中,TrajRed识别的漏洞更强,TrajGuard可将攻击成功率降至近零且保留任务效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04317 2026-08-06 cs.CR cs.AI cs.LG cs.MA 新提交 62%

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)

三叉戟:如何突破深度强化学习网络防御(智能体式)

Ryozo Masukawa, Ian Bryant, Armita Kazeminajafabadi, Sanggeon Yun, Hyunwoo Oh, SungHeon Jeong, Nathaniel D. Bastian, Mahdi Imani, Mohsen Imani

专题命中 红队测试 :red teaming(abstract);分类 cs.AI、cs.LG

AI总结 研究针对DRL网络防御对自适应威胁鲁棒性不足的问题,提出Trident智能体式LLM红队框架,通过含三类组件的设计,发现现有防御存在根本性脆弱性,大幅降低蓝方防御性能并揭示新兴行为。

Comments code: https://anonymous.4open.science/r/Trident-A934

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 提示注入 4 篇

2608.04053 2026-08-06 cs.CR cs.AI 新提交 79%

AgentAntibody: An Adaptive Immune System for Defending LLM Agents against Prompt Injection

AgentAntibody:一种用于防御大语言模型(LLM)智能体提示注入的自适应免疫系统

Shihao Weng, Yang Feng, Xiaofei Xie, Jiongchi Yu

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 针对LLM智能体的提示注入威胁,受自适应免疫启发提出AgentAntibody,通过持久抗体库识别威胁并进化增强防御,实验显示其在防有害行为同时保留合法任务完成上优于现有防御。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04565 2026-08-06 cs.CR cs.AI cs.CL 新提交 73%

Breadcrumbing Search Agents

面包屑式搜索智能体

Xuebin Li, Hanqing Zhao, Siyuan Liang, Kejiang Chen, Weiming Zhang, Dacheng Tao, Nenghai Yu

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM搜索智能体的安全问题,提出ACH和TGSE策略,通过操纵搜索结果形成连贯证据链,大幅提升攻击成功率。

Comments 38 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04741 2026-08-06 cs.CR 新提交 71%

LoginTrap: Uncovering Task-Agnostic Phishing-Style Indirect Prompt Injection Attacks against LLM-based Web Agents

LoginTrap:针对基于大语言模型的Web智能体的任务无关型钓鱼式间接提示注入攻击的发现

Longtao Guo, Zelin Zhang, Kaifeng Huang, Yang Shi

专题命中 提示注入 :prompt injection(title)

AI总结 该研究提出LoginTrap攻击,是针对基于LLM的Web智能体的任务无关型登录诱导攻击,在黑盒威胁模型下可达到86%的平均端到端攻击成功率,揭示了登录诱导的认证边界风险并推动相关防御研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04192 2026-08-06 cs.CR cs.AI cs.CL 新提交 62%

Behavioral Skill Reconstruction: Reconstructing Hidden Functionality from LLM Agent Skills

行为技能重构:从大语言模型智能体技能中重构隐藏功能

Peichun Hua, Haoxuan Xu, Mengyuan Li

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SkillClone黑盒攻击方法,可通过合法交互从隐藏的LLM智能体技能中重构其功能,表明仅文件保密无法确保功能保密。

Comments 20 pages, 5 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与事实性 6 篇

2608.04327 2026-08-06 cs.LG 新提交 57%

Real-time probabilistic tsunami forecasting via generative AI

基于生成式AI的实时概率海啸预报

Yusuke Oishi, Takashi Furumura, Fumihiko Imamura

机构 * Fujitsu Research, Fujitsu Limited(富士通研究所,富士通株式会社) Earthquake Research Institute, The University of Tokyo(东京大学地震研究所) International Research Institute of Disaster Science, Tohoku University(东北大学国际灾害科学研究所)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 该研究开发基于条件扩散模型的概率集成模型,利用2011年东北地方太平洋近海地震数据验证,实现实时概率海啸预报,将海啸预报从确定性转向概率性,为下一代预警奠定基础。

Comments 24 pages, 14 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04474 2026-08-06 cs.LG math.OC 新提交 57%

Local Violation Certification for Linear Predict-Then-Optimize Pipelines

线性“先预测后优化”管道的局部违规认证

Ş. İlker Birbil, Wenhao Chi

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 针对输入不确定性下的线性“先预测后优化”决策管道,提出局部违规认证框架,可通过单次优化求解直接计算局部故障风险,在电力调度系统上验证,成本低且评估精确可审计。

Comments 24 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16868 2026-08-06 cs.AI 版本更新 57%

Beyond Semantic Equivalence: Logical Graphs for LLM Uncertainty Quantification

超越语义等价:用于大语言模型不确定性量化的逻辑图

Yanni Dong, Minghua Liu, Meilin Zhu, Xiaowei Huang, Lijun Zhang

机构 * Institute of Intelligent Software(智能软件研究所) Institute of Software, CAS(中国科学院软件研究所) University of Liverpool(利物浦大学) Guangzhou Jiayi Software Technology Co., Ltd.(广州嘉意软件科技有限公司)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 研究大语言模型输出不可靠问题,提出逻辑图不确定性(LGU)框架,该框架能明确建模答案间逻辑关系,通过聚合概率质量、计算熵等方式改进不确定性估计,在多个问答基准测试中优于现有方法。

Comments 21 pages, 3 figures, 11 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04140 2026-08-06 eess.AS cs.CL 版本更新 57%

DELTA-TTS: Adapting Autoregressive Model into Diffusion Language Model for Text-to-Speech

DELTA-TTS:将自回归模型适配为扩散语言模型以实现文本转语音

Junwon Moon, Yejin Lee, Seungbeom Kim, Hoseong Ahn, Sewoong Park, Heeseung Kim, Kyuhong Shim

机构 * Sungkyunkwan University(首尔大学) University of Seoul(首尔大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 针对自回归TTS推理慢、鲁棒性差的问题,提出基于LoRA的轻量适配框架DELTA-TTS,将预训练AR TTS转为离散扩散语言模型,推理速度提升3.3倍且性能更优。

Comments ICML 2026 SPIGM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04991 2026-08-06 cs.DC 新提交 50%

RAC: Reference-Aware Activation Compression for Communication-Efficient Split LLM Inference

RAC:面向通信高效的分割式大语言模型推理的参考感知激活压缩

Guotao Yang, Mingxi Zhao, Haopeng Li, Zhengchao Wang, Sheng Chen, Yitao Hu, Keqiu Li

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 该研究针对分割式LLM推理的通信瓶颈,提出参考感知激活压缩方法RAC,通过参考感知编解码器等技术降低通信开销,在多模型多链路对实验中验证了其时间性能提升与任务分数变化情况。

Comments 10 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26987 2026-08-06 cs.SE 版本更新 50%

How Developers Experience Debugging Unfamiliar Codebases with Code Tours Generated and Evaluated by Local LLMs

开发者使用本地大语言模型生成和评估的代码导航体验陌生代码库调试的研究

Martin Balfroid, Julien Albert, Dzenatan Aliti, Xavier Devroey, Benoît Vanderose

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 该研究探讨开发者使用本地大语言模型生成评估的代码导航调试陌生代码库的体验,明确代码导航组件属性对开发者的影响,为优化代码导航生成与评估提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 隐私与版权 4 篇

2608.04772 2026-08-06 cs.CL cs.AI 新提交 62%

Guideline-as-Oracle: Zero-Annotation Training of an Ophthalmic Telephone Triage Agent

以指南为神谕:眼科电话分诊智能体的零标注训练

Chenyu Wang, Yi Liu, Baoqing Li, Min Tu, Diping Song

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出以指南为神谕(GAO)方法,将美国眼科学会指南转化为训练监督信号,零标注训练出GAO-Triage智能体,大幅提升眼科电话分诊的一致性与紧急案例召回率,且性能优于7个通用系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08604 2026-08-06 cs.CL cs.AI 版本更新 62%

Memorization in Large Language Models in Medicine: Prevalence, Characteristics, and Implications

医学领域大型语言模型中的记忆现象:普遍性、特征与影响

Anran Li, Lingfei Qian, Mengmeng Du, Yu Yin, Yan Hu, Zihao Sun, Yihang Fu, Hyunjae Kim, Erica Stutz, Xuguang Ai, Qianqian Xie, Rui Zhu, Jimin Huang, Yifan Yang, Siru Liu, Yih-Chung Tham, Lucila Ohno-Machado, Hyunghoon Cho, Zhiyong Lu, Hua Xu, Qingyu Chen

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨医学领域大型语言模型的记忆现象,分析其普遍性、特征及对医疗应用的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏