arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 528 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 528 篇

2604.20732 2026-04-23 cs.MA cs.AI cs.CL 62%

Anchor-and-Resume Concession Under Dynamic Pricing for LLM-Augmented Freight Negotiation

基于动态定价的LLM增强货运谈判中的锚定与恢复让步

Hoang Nguyen, Lu Wang, Marta Gaia Bras

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种双指标锚定与恢复框架,解决动态定价下传统让步框架的局限性,通过实时价差推导β参数并保证非递减报价,实验证明其在不同价差情况下均能提升谈判效率与收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02850 2026-04-21 cs.CL cs.CR cs.LG 62%

LLM Hypnosis: Exploiting User Feedback for Unauthorized Knowledge Injection to All Users

LLM催眠:利用用户反馈进行未经授权的知识注入以影响所有用户

Almog Hilel, Riddhi Bhagwat, Idan Shenfeld, Jacob Andreas, Leshem Choshen

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) IBM Research(IBM研究院)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.LG

AI总结 研究揭示语言模型通过用户反馈进行知识注入的漏洞,通过反馈信号可操控模型行为,导致事实错误、代码漏洞和虚假新闻。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17139 2026-04-21 cs.CL cs.AI cs.MA 62%

The Consensus Trap: Rescuing Multi-Agent LLMs from Adversarial Majorities via Token-Level Collaboration

共识陷阱:通过令牌级协作拯救多智能体大语言模型免受对抗性多数的侵害

Jiayuan Liu, Shiyi Du, Weihua Du, Mingyu Guo, Vincent Conitzer

机构 * Carnegie Mellon University(卡内基梅隆大学) Foundations of Cooperative AI Lab (FOCAL)(协作人工智能基础实验室(FOCAL)) Adelaide University(阿德莱德大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 本文提出令牌级轮询协作方法,通过共享自回归上下文中的序列生成,解决多智能体系统中对抗性多数导致的响应级聚合失效问题,证明其在多种推理基准上具有鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12230 2026-04-07 cs.LG cs.AI cs.CR 62%

Security Considerations for Artificial Intelligence Agents

人工智能代理的安全性考虑

Ninghui Li, Kaiyuan Zhang, Kyle Polley, Jerry Ma

机构 * Perplexity

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了前沿AI代理的安全性问题,分析了代理架构对代码-数据分离、权限边界和执行可预测性的影响,并提出了针对间接提示注入、混淆代理行为和长流程级联故障的防护措施。

Comments This article is adapted from Perplexity's response to NIST/CAISI Request for Information 2025-0035. 91 Fed. Reg. 698 (Jan. 8, 2026). The originally submitted response can be found on the public docket at https://www.regulations.gov/comment/NIST-2025-0035-0505

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14043 2026-03-31 cs.AI cs.CL cs.MA 62%

AISAC: An Integrated multi-agent System for Transparent, Retrieval-Grounded Scientific Assistance

AISAC:一个集成的多智能体系统,用于透明、基于检索的科学协助

Chandrachur Bhattacharya, Sibendu Som

机构 * Transportation and Power Systems Division, Argonne National Laboratory, USA(美国阿贡国家实验室交通与动力系统部)

专题命中 提示注入 :safety(abstract);分类 cs.CL、cs.AI

AI总结 AISAC 提供了一个透明的多智能体运行环境,支持长期的证据支持科学推理,通过结构化保证实现角色语义、预算管理、可追溯执行和工具交互可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18907 2026-03-10 cs.AI cs.LG 62%

Stronger Enforcement of Instruction Hierarchy via Augmented Intermediate Representations

通过增强的中间表示实现更强的指令层级强制执行

Sanjay Kariyappa, G. Edward Suh

机构 * NVIDIA(英伟达)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 通过在中间表示中注入增强的指令层级信号,有效降低提示注入攻击的成功率,同时保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20666 2026-03-03 cs.CL cs.AI 62%

Cognitive models can reveal interpretable value trade-offs in language models

认知模型可以揭示语言模型中的可解释价值权衡

Sonia K. Murthy, Rosie Zhao, Jennifer Hu, Sham Kakade, Markus Wulfmeier, Peng Qian, Tomer Ullman

机构 * Kempner Institute for Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究所) Google DeepMind(谷歌DeepMind) Department of Psychology, Harvard University(哈佛大学心理学系)

专题命中 提示注入 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用认知模型评估语言模型中的价值权衡,揭示其行为特征变化及对社会行为的影响。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22481 2026-02-27 cs.CL cs.AI 62%

Sydney Telling Fables on AI and Humans: A Corpus Tracing Memetic Transfer of Persona between LLMs

悉尼在AI与人类之间讲述寓言:LLM间人设的语料追溯膜传

Jiří Milička, Hana Bednářová

专题命中 提示注入 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文通过分析LLM生成的文本,探讨悉尼人设在AI与人类关系中的传播与影响,并构建了相关语料库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22157 2026-02-26 cs.CL cs.HC cs.LG 62%

Dynamic Personality Adaptation in Large Language Models via State Machines

通过状态机实现大语言模型的动态人格适应

Leon Pielage, Ole Hätscher, Mitja Back, Bernhard Marschall, Benjamin Risse

机构 * Institute for Geoinformatics, University of Münster(地理信息研究所,穆尔斯特大学) Faculty of Mathematics and Computer Science, University of Münster(数学与计算机科学学院,穆尔斯特大学) Department of Psychology, University of Münster(心理学系,穆尔斯特大学) Institute of Medical Education and Student Affairs, University of Münster(医学教育与学生事务研究所,穆尔斯特大学)

专题命中 提示注入 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过状态机实现大语言模型动态人格适应的框架,通过模块化评分管道实现人格状态的动态调整,提升在复杂互动场景中的表现。

Comments 22 pages, 5 figures, submitted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21051 2026-01-30 cs.AI cs.CR cs.LG 62%

Llama-3.1-FoundationAI-SecurityLLM-Reasoning-8B Technical Report

Llama-3.1-FoundationAI-SecurityLLM-Reasoning-8B 技术报告

Zhuoran Yang, Ed Li, Jianliang He, Aman Priyanshu, Baturay Saglam, Paul Kassianik, Sajana Weerawardhena, Anu Vellore, Blaine Nelson, Neusha Javidnia, Arthur Goldblatt, Fraser Burch, Avi Zohary, Assaf Eisenman, Mahdi Sabbaghi, Supriti Vijay, Rahim Dharssi, Dhruv Kedia, Kojin Oshiba, Yaron Singer, Amin Karbasi

机构 * Foundation AI–Cisco Systems Inc.(Foundation AI–Cisco系统公司) Yale University(耶鲁大学) University of California, San Diego(加州大学圣地亚哥分校) University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 提示注入 :safety(abstract);分类 cs.AI、cs.LG

AI总结 Llama-3.1-FoundationAI-SecurityLLM-Reasoning-8B 是首个开源的网络安全专用推理模型,通过结合监督微调和强化学习训练,实现了在网络安全任务上的高性能表现。

Comments 31 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16314 2026-01-26 cs.CL cs.AI 62%

Machine-Assisted Grading of Nationwide School-Leaving Essay Exams with LLMs and Statistical NLP

利用LLM和统计NLP进行全国性毕业考试作文自动评分

Andres Karjus, Kais Allkivi, Silvia Maine, Katarin Leppik, Krister Kruusmaa, Merilin Aruvee

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了利用LLM和统计NLP进行全国毕业考试作文自动评分的可行性,证明其在保持人类监督的同时可实现高精度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10338 2026-01-16 cs.CR cs.AI cs.CL cs.SE 62%

Agent Skills in the Wild: An Empirical Study of Security Vulnerabilities at Scale

真实世界中的智能体技能:大规模安全漏洞实证研究

Yi Liu, Weizhe Wang, Ruitao Feng, Yao Zhang, Guangquan Xu, Gelei Deng, Yuekang Li, Leo Zhang

机构 * Tianjin University(天津大学) Southern Cross University(南方十字大学) School of Cybersecurity, Tianjin University(安全学院,天津大学) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) Griffith University(格里菲斯大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示了智能体技能中普遍存在的安全漏洞,提出了一种多阶段检测框架,并展示了技能捆绑执行脚本与漏洞之间的显著关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01228 2025-12-19 cs.CL cs.LG 62%

Who is In Charge? Dissecting Role Conflicts in Instruction Following

谁在掌控?解析指令遵循中的角色冲突

Siqi Zeng

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 提示注入 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 研究揭示大型语言模型在指令遵循中存在角色冲突,通过机制分析发现系统-用户冲突与社会冲突的不同处理方式,并强调了对齐方法的重要性。

Comments 12 pages, 5 figures, Mech Interp Workshop (NeurIPS 2025) Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11238 2025-10-14 cs.CL cs.AI 62%

Attacks by Content: Automated Fact-checking is an AI Security Issue

Michael Schlichtkrull

机构 * School of Electronic Engineering and Computer Science(电子工程与计算机科学学院) Queen Mary University of London(伦敦女王学院)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02961 2025-10-03 cs.AI cs.CL cs.CR 62%

Defend LLMs Through Self-Consciousness

Boshi Huang, Fabio Nonato de Paula

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.AI

Comments company requests to withdraw

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00124 2025-09-03 cs.CR cs.AI cs.CY 62%

A Whole New World: Creating a Parallel-Poisoned Web Only AI-Agents Can See

Shaked Zychlinski

机构 * JFrog

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI、cs.CY

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08970 2025-06-16 cs.CR cs.AI cs.LG 62%

Self-interpreting Adversarial Images

Tingwei Zhang, Collin Zhang, John X. Morris, Eugene Bagdasarian, Vitaly Shmatikov

机构 * Cornell Tech(康奈尔科技) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI、cs.LG

Comments in USENIX Security 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00626 2025-05-06 cs.CL cs.AI 62%

The Illusion of Role Separation: Hidden Shortcuts in LLM Role Learning (and How to Fix Them)

Zihao Wang, Yibo Jiang, Jiahao Yu, Heqing Huang

机构 * Zihao Wang(独立研究者)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12335 2025-04-18 cs.CL cs.AI 62%

You've Changed: Detecting Modification of Black-Box Large Language Models

Alden Dima, James Foulds, Shimei Pan, Philip Feldman

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.AI

Comments 26 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12321 2025-04-18 cs.CL cs.AI 62%

AttentionDefense: Leveraging System Prompt Attention for Explainable Defense Against Novel Jailbreaks

Charlotte Siska, Anush Sankaran

专题命中 提示注入 :jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00799 2025-03-07 cs.CR cs.CL cs.CY 62%

Get my drift? Catching LLM Task Drift with Activation Deltas

Sahar Abdelnabi, Aideen Fay, Giovanni Cherubin, Ahmed Salem, Mario Fritz, Andrew Paverd

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.CY

Comments SaTML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13490 2025-02-20 cs.CL cs.AI 62%

What are Models Thinking about? Understanding Large Language Model Hallucinations "Psychology" through Model Inner State Analysis

Peiran Wang, Yang Liu, Yunfei Lu, Jue Hong, Ye Wu

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19501 2024-12-10 cs.CL cs.LG 62%

Monitoring Latent World States in Language Models with Propositional Probes

Jiahai Feng, Stuart Russell, Jacob Steinhardt

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14738 2024-11-25 cs.CL cs.AI cs.CR 62%

Universal and Context-Independent Triggers for Precise Control of LLM Outputs

Jiashuo Liang, Guancheng Li, Yang Yu

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20902 2024-06-03 cs.CL cs.AI cs.CR 62%

Preemptive Answer "Attacks" on Chain-of-Thought Reasoning

Rongwu Xu, Zehan Qi, Wei Xu

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.AI

Comments Accepted to ACL'24 (Findings). Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13208 2024-04-23 cs.CR cs.CL cs.LG 62%

The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions

Eric Wallace, Kai Xiao, Reimar Leike, Lilian Weng, Johannes Heidecke, Alex Beutel

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30837 2026-06-16 cs.CR cs.LG 版本更新 61%

Send a SCOUT First: Pre-hoc Reasoning for Adaptive Detector Allocation in Prompt-Injection Defense

先派侦察兵:提示注入防御中自适应检测器分配的预推理方法

Shuhao Zhang, Jiarui Li, Qi Cao, Ruiyi Zhang, Pengtao Xie

机构 * UC San Diego(加州大学圣迭戈分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 提示注入 :safety(abstract,comments);分类 cs.LG

AI总结 针对提示注入检测器异构且不可靠的问题,提出SCOUT框架,通过预测每个检测器对每个样本的可靠性和延迟,动态分配检测器,实现安全性与效率的权衡。

Comments We propose SCOUT, a detector allocation framework that predicts each detector's accuracy and latency on a given input before running it, letting operators control the safety-utility trade-off with a single threshold and route to an LLM judge only when needed

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04653 2026-05-26 cs.CR cs.LG 61%

Inference-Time Backdoors via Chat Templates: From LLM Supply Chains to Agentic System Compromise

通过聊天模板的推理时后门:从LLM供应链到代理系统妥协

Ariel Fogel, Omer Hofman, Eilon Cohen, Roman Vainshtein

机构 * Fujitsu Research of Europe(富士通欧洲研究)

专题命中 提示注入 :prompt injection(abstract);分类 cs.LG;trustworthy(comments)

AI总结 提出一种通过恶意修改聊天模板实现推理时后门攻击的方法,无需修改模型权重或训练数据,在LLM、代理和多代理系统层面均能成功攻击,且能绕过现有防御。

Comments V3: Accepted to ICLR 2026 Trustworthy AI Workshop, V4: Submitted to CCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11803 2026-08-13 cs.CY 新提交 57%

Silent Updates: Measuring and Closing the Post-Deployment Disclosure Gap

静默更新:测量并弥合部署后的披露差距

Sophia Abraham, Ben Bucknall

专题命中 提示注入 :safety(abstract);分类 cs.CY

AI总结 本文针对基础模型部署后的静默更新问题,分析了相关披露实践,推出了测量披露情况的评分卡,并提出了触发披露义务的三部分行为触发系统。

Comments Accepted to AIES-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08468 2026-08-11 cs.CR cs.AI 新提交 57%

SkillsMetric: Mapping the Detection Boundary of Static Analysis for Malicious Agent Skills

SkillsMetric:映射恶意智能体技能静态分析的检测边界

Xinze Chen, Chi Zhang, Ping Ji, Yimin Liu

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本研究提出五阶段静态分析框架SkillsMetric,构建含2266个技能的对抗性数据集,发现静态分析对部分攻击检测不足,需结合静态预筛选与语义审查的纵深防御架构。

Comments 6 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏