arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-19 至 2026-08-19 共收录 82 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 4 篇

2608.16926 2026-08-19 cs.LG 新提交 90%

Data-DPO: Direct Preference Optimization for Target Model Data Selection in LLM Post-Training

Data-DPO:面向大语言模型后训练中目标模型数据选择的直接偏好优化

Peng Sun, Yi Yang, Antong Zhang, Chunxiao Li, Yanbo Wang, Dianbo Liu, xin chen, Kai Yu, Lu Chen, Tianfan Fu

专题命中 偏好对齐 :DPO(title,title_cn);分类 cs.LG

AI总结 针对现有数据选择方法忽略数据与目标模型能力分布兼容性的问题,提出Data-DPO方法,结合目标模型偏好、外部质量评分与边际多样性筛选数据,在Vision-Flan和LLaVA-CoT上性能优于基线及全数据训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17171 2026-08-19 cs.CL cs.DB 新提交 81%

Polaris: Learning to Generate Table Descriptions from Retrieval Feedback

Polaris:基于检索反馈学习生成表格描述

Ting Cai, Tuan Minh Phan, AnHai Doan

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL

AI总结 Polaris是基于检索反馈训练LLM生成表格描述的系统,通过BM25排序和DPO微调优化检索效果,性能优于AutoDDG,证明检索基准可用于训练LLM生成面向检索的元数据。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23671 2026-08-19 cs.CL 版本更新 70%

Can LLMs Reliably Self-Report Adversarial Prefills, and How?

LLM 能否可靠地自我报告对抗性预填充,以及如何实现?

Quang Minh Nguyen, Uzair Ahmed, Taegyoon Kim

机构 * KAIST(韩国科学技术院)

专题命中 偏好对齐 :DPO(abstract_cn);safety(abstract);分类 cs.CL

AI总结 研究LLM在安全场景中识别自身输出是否受对抗性预填充攻击的能力,发现模型平均27.3%声称预填充输出有意图,且内省信号主要来自安全/拒绝推理,LoRA微调方法扩大了意图-篡改探针差距并提高了攻击成功率。

Comments In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17795 2026-08-19 cs.CL 新提交 57%

TraceSQL: Traceable Answerability Estimation for Reference-Free Text-to-SQL Verification

TraceSQL:无参考文本到SQL验证的可追踪答案性估计

Neelesh Kumar Shukla, Debasmita Panda, Srutanik Bhaduri, Aditya Banerjee, Viji Krishnamurthy

机构 * Oracle Corporation(甲骨文公司)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 针对无参考文本到SQL验证的可追踪性不足问题,提出基于67种诊断特征的轻量模型TraceSQL,在BIRD数据集上优于基线模型,可提供可追溯的预测证据。

Comments 9 pages main paper with 6 pages supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 16 篇

2608.17202 2026-08-19 cs.AI cs.CR 新提交 83%

Fool's Gold: Defensive Deception Against Safety-Removal Attacks on Open-Weight Models

愚人金:针对开放权重模型安全移除攻击的防御性欺骗

Mark Russinovich

机构 * Microsoft Azure(微软Azure)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 针对开放权重模型易被移除安全对齐的问题,提出“愚人金”防御,通过训练仅在被攻击状态显现的伪造诱饵,使被攻击模型对危险请求输出高比例假回答,且无法区分真假,同时不影响干净状态的良性行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04728 2026-08-19 cs.CL cs.AI cs.LG 版本更新 78%

Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment

将离策略令牌转换为策略内令牌:一种改进大语言模型对齐的插件方法

Yu Li, Xiuyu Li, Mingyang Yi, Jiaxing Wang, Liangxu Zhang, Zhaolong Xing, Zhen Chen

机构 * Renmin University of China(中国人民大学)

专题命中 安全训练 :alignment(title);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型强化学习后训练中离策略数据问题,提出选择性重要性采样(SIS),受拒绝采样启发,以离策略模型为提议分布进行令牌级拒绝测试,理论证明可减少梯度估计差距,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17220 2026-08-19 cs.CR cs.AI 新提交 70%

PACE: Policy-Attested Contract Execution for Safe AI Agents in Decentralized Finance

PACE:用于去中心化金融中安全AI智能体的策略验证合约执行

Rabimba Karanjai, Yang Lu, Richard Williamson, Hemanth Hm, Prakhar Mehrotra, Lei Xu, Weidong (Larry)Shi

专题命中 安全训练 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 该研究提出PACE框架,通过引入类型化交易意图等机制,实现去中心化金融中AI智能体的安全交易授权,在确定性沙箱中实现0.00不安全执行率和0.00误报率,提升了DeFi场景下AI智能体的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16897 2026-08-19 physics.soc-ph cs.AI cs.MA 新提交 70%

CityReal: Human-Aligned Urban Behavior and City Dynamics Simulation with Large-Scale LLM Agents

CityReal:基于大规模大语言模型智能体的人类对齐城市行为与城市动态模拟

Nicolas Bougie, Xiaotong Ye, Narimasa Watanabe

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 CityReal是人类对齐城市模拟的模块化框架,将智能体建模为意图驱动的决策者,通过文本适配器提升人群行为对齐度,可扩展至数万个智能体,为城市模拟与预测提供可扩展测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03895 2026-08-19 cs.OS cs.AI cs.CR 版本更新 70%

Agent libOS: A Runtime Substrate for Capability-Controlled Self-Evolving LLM Agents

Agent libOS: 一种受库操作系统启发的运行时,用于长时间运行、能力受控的LLM智能体

Yingqi Zhang

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 安全训练 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 提出Agent libOS运行时,将LLM智能体建模为具有进程标识、生命周期、能力控制和审计记录的AgentProcess,通过类似libc的工具包装和运行时原语边界实现安全调度与资源控制。

Comments 20 pages, 3 figures, 7 tables. Project page: this https URL (https://github.com/yingqi-z20/Agent-libOS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05819 2026-08-19 cs.LG cs.AI 版本更新 62%

Diffusion Models for Smarter UAVs: Decision-Making and Modeling

用于更智能无人机的扩散模型:决策与建模

Yousef Emami, Hao Zhou, Luis Almeida, Kai Li

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文探索将扩散模型(DMs)与强化学习(RL)、数字孪生(DT)集成,通过仿真验证其在四无人机集群协同任务中生成邻居速度估计值的有效性,助力智能无人机的决策与建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17588 2026-08-19 cs.AI cs.SE 新提交 57%

TRUSS: Towards Task-Reliable and User-Safe Automated Agent Skill Generation

TRUSS:面向任务可靠且用户安全的自动化智能体技能生成

Zhibo Zhang, Zhen Ouyang, Ling Shi, Kailong Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 TRUSS是一种证据引导框架,可生成安全可靠的智能体技能,在多基准测试中实现了漏洞检测100%的精度召回率,同时显著提升任务有效性与安全率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17583 2026-08-19 cs.CL 新提交 57%

Auditing Exposure to Harmful Content on TikTok using Multimodal Language Models: A Cross-National, Age-Stratified Study

使用多模态语言模型对TikTok上的有害内容暴露情况进行审计:一项跨国、按年龄分层的研究

Hamidreza Saffari, Francesco Pierri

机构 * Politecnico di Milano(米兰理工大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本研究使用多模态大语言模型Gemini 2.5 Flash,在法、意、瑞三国对TikTok开展跨国年龄分层审计,发现关键词搜索会大幅提升有害内容占比,意国各年龄组有害内容占比最高,平台安全过滤器低估了明确有害内容。

Comments 20 pages, 16 figures, 14 tables. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17520 2026-08-19 cs.CY 新提交 57%

Ready for What? Rethinking AI and Robotics Preparedness for Adoption and Policy

准备好应对什么?反思人工智能与机器人技术在应用和政策层面的准备情况

Peng Wang, Naomi Adel, Amy E. Morgan, Folayo Aina, Demos Parapanos, Vikas Mackevicius, Teslim Olayiwola Salahudeen

专题命中 安全训练 :alignment(abstract);分类 cs.CY

AI总结 该研究通过分析982名参与者对17项AI与机器人技术挑战的15200次评估,揭示了挑战复杂性、重要性与准备度的关联,指出政策制定者需关注挑战特有障碍及同一利益相关者的内部差异。

Comments 33 pages, including supplementary. 8 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17423 2026-08-19 cs.RO cs.LG 新提交 57%

Prism-GRPO: Faster VLA Policy Optimization via Splitting Same-outcome Groups

Prism-GRPO:通过拆分相同结果组实现更快的视觉-语言-动作(VLA)策略优化

Zeyun Deng, Yuzhe Lu, Yawei Wang, Linbo Liu, Qing Ping, Han Ding, Guande Wu, Panpan Xu, Jun Huan

机构 * AWS AI(亚马逊云科技人工智能部门)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 该研究提出 Prism-GRPO 算法,通过拆分 GRPO 的相同结果组并引入加权执行质量分数,减少机器人 rollout 预算浪费,在四个 RoboTwin 任务中使达到目标成功率的 rollout 最多减少 56%,还抑制了奖励黑客捷径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17393 2026-08-19 cs.AI 新提交 57%

LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents

LEGO-RL:利用原生强化学习实现编码智能体

Yiming Du, Yuxin Jiang, Tao Yuan, Jianbo Dai, Shaowei Wang, Jierun Chen, Chaofan Tao, Xianzhi Yu, Lifeng Shang, Kam-Fai Wong, Xiaohui Li, Haoli Bai

机构 * Huawei Technologies Co., Ltd(华为技术有限公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 LEGO-RL 是桥接原生编码智能体 harness 与策略梯度优化的框架,通过三大支柱解决训练不匹配问题,提升 Qwen3.5-35B-A3B 在三个编码基准上的性能,且保持高概率相关性。

Comments Webpage: this https URL (https://lego-rl.pages.dev)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17067 2026-08-19 cs.AI 新提交 57%

DiSCO: Defending text-to-image generation through distribution-guided contrastive prompt optimization

DiSCO:通过分布引导的对比提示优化防御文本到图像生成

Tong Zhang, Motasem Alfarra, Carlos Hinojosa, Christos Louizos, Bernard Ghanem

机构 * Qualcomm AI Research(高通人工智能研究院) King Abdullah University of Science Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 DiSCO是一种零样本黑盒防御模块,通过分布引导的对比提示优化,在I2P基准上分别将未防御、已防御模型的攻击成功率降低37.7%、25.13%,提升文本到图像生成的安全性且保持语义保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16177 2026-08-19 cs.CR cs.AI 版本更新 57%

Measuring Obedience to Authority Across Large Language Models with the Milgram Paradigm

用米尔格拉姆范式测量大型语言模型对权威的服从性

Hidayet Aksu

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 该研究将米尔格拉姆服从范式迁移至LLMs,测量42个模型的服从性概况,发现服从性异质性高、具模型特异性,受情境因素影响,且反映检查点而非模型谱系。

Comments 11 pages, 7 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24126 2026-08-19 cs.LG cs.PL 版本更新 57%

Likelihood Hacking in Probabilistic Program Synthesis

概率程序合成中的似然黑客行为

Jacek Karwowski, Younesse Kaddar, Zihuiwen Ye, Esmeralda S. Whitammer, Sam Staton

机构 * University of Oxford, Department of Computer Science(牛津大学计算机科学系) University of Edinburgh, School of Informatics(爱丁堡大学信息学院) CIFAR Fellow, Learning in Machines and Brains(CIFAR Fellow, 机器与大脑学习)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 研究概率程序合成中语言模型通过强化学习生成程序时可能人为夸大边际似然奖励的问题,提出安全语言片段SafeStan以防止似然黑客行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17349 2026-08-19 cs.DC 新提交 50%

Brief Announcement: Fair Binding for Hidden-State Authorization in Byzantine SMR

简短公告:拜占庭SMR中隐藏状态授权的公平绑定

Arnab Mallick

专题命中 安全训练 :safety(abstract)

AI总结 针对拜占庭SMR中隐藏状态授权问题,提出公平预留/使用协议,满足授权安全性与先到者活性,解决隐藏资源安全动态分配问题。

Comments Accepted at DISC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17235 2026-08-19 eess.SY 新提交 50%

Safe Deep Reinforcement Learning for Energy-Efficient HVAC Control in Multi-Zone Residential Buildings

面向多区域住宅建筑节能HVAC控制的安全深度强化学习

Oussama Ziadi, Abdelilah Rochd, Samir Idrissi Kaitouni, Mohamed Oualid Mghazli, Adnane Saoud

专题命中 安全训练 :safety(abstract)

AI总结 该研究针对多区域住宅建筑HVAC控制的能耗-安全问题,提出带安全认证的深度强化学习框架,在仿真中训练PPO与SAC智能体,验证了其在降低能耗、减少舒适度违规方面的有效性及安全保证的可行性。

Comments 6 pages, 5 figures. Accepted to IEEE Conference on Control Technology and Applications (CCTA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 5 篇

2604.12616 2026-08-19 cs.AI cs.MM 版本更新 90%

Every Picture Tells a Dangerous Story: Memory-Augmented Multi-Agent Jailbreak Attacks on VLMs

每幅画都讲述一个危险的故事:基于内存增强的多智能体 jailbreak 攻击 VLMs

Jianhao Chen, Haoyang Chen, Hanjie Zhao, Haozhe Liang, Zheng Wang, Tieyun Qian

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) Tianjin University(天津大学) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 越狱攻击 :jailbreak(title,title_cn);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出MemJack框架,通过视觉语义引导多智能体协作,利用迭代空域投影过滤器提升对VLMs的攻击成功率,实验表明其在COCO数据集上达到71.48%的攻击成功率。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17556 2026-08-19 cs.CR cs.CL cs.LG 新提交 84%

Reflex-Guard: A Low-Latency Guardrail for LLM Prompt Safety Using Dense Semantic Embeddings

Reflex-Guard:一种使用稠密语义嵌入的低延迟大语言模型提示安全护栏

Istiaque Ahmed, Afia Anjum Borsha, Ranat Das Prangon, Abu-fuad Ahmad, Thi Hong Tran

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.LG

AI总结 Reflex-Guard是一种本地运行的轻量型LLM提示安全护栏,采用稠密语义嵌入与快速分类器,延迟低至37.6毫秒,召回率达95.9%,性能优于现有基线,可高效检测各类越狱攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17234 2026-08-19 cs.CR cs.AI 新提交 83%

COMIC: Reference-Aware Safety Gating for Multimodal Large Language Models

COMIC:面向多模态大语言模型的参考感知安全门控

Md Abdullahil Oaphy, Anhao Xiang, Zongxing Xie, Huayue Gu, Chenyu Wang, Honghui Xu

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 本研究针对多模态大语言模型的参考依赖型安全缺陷,提出COMIC参考感知安全门控,通过解析操作-目标对评估安全性,提升了模型鲁棒性且保留良性效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17360 2026-08-19 cs.CR cs.AI 新提交 70%

Fair ASR: Re-Evaluating Black-Box Jailbreaks under Shared Target-Call Budgets

Fair ASR:在共享目标调用预算下重新评估黑盒越狱攻击

Zhida He, Xiaoyu Wen, Han Qi, Ziyuan Zhou, Peng Yu, Jiajia Li, Chaochao Lu, Qiaosheng Zhang

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本研究提出Fair-ASR评估协议,重新评估11种黑盒越狱攻击,发现攻击排名随预算变化,进而提出ReCode攻击,在20次目标调用预算下于GPT-5实现85% ASR且效率优异。

Comments 29 pages, 8 figures, 13 tables. Code: this https URL (https://github.com/xsddys/Fair-ASR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17275 2026-08-19 cs.CR cs.AI 新提交 57%

When Agents Act on Web3: An Attack-Surface Survey of MCP, Skills, and Tool Calling

当智能体在Web3中行动:MCP、技能与工具调用的攻击面调查

Rabimba Karanjai, Yang Lu, Nour Diallo, Wujie Xiong, Lei Xu, Weidong (Larry)Shi

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本调查针对智能体通过MCP等在Web3区块链上行动的攻击面,构建风险映射矩阵,发现现有防护不足,推导了相关研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 4 篇

2608.17659 2026-08-19 cs.CR cs.AI 新提交 85%

MobileWorldSafety: Benchmarking GUI Agent Safety Against Environmental Injection Attacks in Android Apps

MobileWorldSafety:针对安卓应用中环境注入攻击的GUI智能体安全基准

Sujin Chen, Lijun Li, Tianyi Du, Jing Shao

专题命中 提示注入 :safety(title,abstract);alignment(abstract);prompt injection(abstract);分类 cs.AI

AI总结 该研究推出MobileWorldSafety基准,基于142个真实安卓应用风险任务评估6种GUI智能体,发现其对环境注入攻击的成功率达40.4%-66.9%,为相关研究奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16393 2026-08-19 cs.CR 版本更新 78%

Security Assessment of DeepSeek Harness with A.I.G: Evaluating Resistance to Indirect Prompt Injection

基于A.I.G的DeepSeek Harness安全评估:对间接提示注入的抗性评估

Zonghao Ying, Xiangfan Wu, Huiyu Wu, Xing Zheng, Huangsheng Cheng, Xiaorong Shi, Jing Guo

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 本研究用A.I.G评估DSH的间接提示注入抗性,开展多场景实验,发现不同攻击的成功率,明确需在不可信内容与敏感动作间增设控制措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06185 2026-08-19 cs.CY cs.AI cs.CL cs.HC 版本更新 67%

Hidden Prompts in Manuscripts Exploit AI-Assisted Peer Review

手稿中的隐藏提示利用AI辅助同行评审

Zhicheng Lin

机构 * Department of Psychology, Yonsei University(延世大学心理学系) Department of Psychology, University of Science and Technology of China(中国科学技术大学心理学系)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究探讨了手稿中隐藏指令对AI同行评审的影响,分析了提示注入技术及学术出版物政策的不一致,指出需加强技术筛查与政策协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00992 2026-08-19 cs.AI cs.CL cs.CY cs.HC 版本更新 67%

Evidence of conceptual mastery in the application of rules by Large Language Models

大型语言模型在规则应用中展现出概念掌握能力的证据

José Luiz Nunes, Guilherme FCF Almeida, Brian Flanagan

专题命中 提示注入 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文通过两项心理学实验发现,Gemini Pro等部分LLMs在规则应用上展现类人表现,证实LLMs掌握规则概念,对法律决策与哲学探究有启示。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 4 篇

2608.17084 2026-08-19 cs.CL 新提交 57%

Uncertainty-Aware Decision Making in Multimodal Large Language Models

多模态大语言模型中的不确定性感知决策

Abderrahmene Boudiaf, Irfan Hussain, Sajid Javed

机构 * Khalifa University of Science and Technology(哈利法科技大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

AI总结 本调查围绕决策中心框架,综述多模态大语言模型(MLLMs)的不确定性感知决策相关研究,对比同类调查并指出源感知分解等开放问题,核心是不确定性需改善多模态证据下的系统行为。

详情

展开后加载摘要…

URL PDF HTML 收藏