arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-15 至 2026-06-15 共收录 45 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 6 篇

2606.12881 2026-06-15 cs.CL cs.LG 新提交 82%

Direct Preference Optimization for Chatbot Fine-Tuning: An Empirical Study

面向聊天机器人微调的直接偏好优化:一项实证研究

Dezhi Yu, Yvonne Qiu, ShuoJia Fu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 本文实证研究直接偏好优化(DPO)在聊天机器人微调中的应用,表明其简化训练流程、提升计算效率且性能有竞争力,但存在训练不稳定性。

Comments 7 pages, 3 figures, 1 table. All authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14629 2026-06-15 cs.CR cs.AI 新提交 81%

When Good Verifiers Go Bad: Self-Improving VLMs Can Regress on New Tasks

当好的验证器变坏:自我改进的视觉语言模型可能在新任务上退步

Jianzhe Lin

机构 * MetaAI(Meta)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI

AI总结 本文发现验证器驱动的自我DPO中,验证器质量具有任务特异性,在低准确率任务上会导致学生模型性能退步,并给出机制解释和部署建议。

Comments 12 pages, 2 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14691 2026-06-15 cs.CL 新提交 79%

CORA: Analyzing and bridging thinking-answer gap in Multimodal RLVR via Consistency-Oriented Reasoning Alignment

CORA: 通过一致性导向的推理对齐分析与弥合多模态RLVR中的思考-答案差距

Jiayue Cao, Zhicong Lu, Xuehan Sun, Wei Jia, Hongling Zheng, Changyuan Tian, Zichuan Lin, Wenqian Lv, Nayu Liu

机构 * University of Chinese Academy of Sciences(中国科学院大学) Wuhan University(武汉大学) Tsinghua University(清华大学) Tianjin University(天津大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 本文分析多模态RLVR中思考与答案的语义不一致问题,提出CORA方法,通过轻量级一致性奖励模型引入语义一致性,并采用混合奖励优势分裂稳定优化,提升推理忠实度。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14528 2026-06-15 cs.CL eess.AS 新提交 70%

BayLing-Duplex: Native Full-Duplex Speech Dialogue with a Single Autoregressive LLM

BayLing-Duplex: 单一自回归LLM的原生全双工语音对话

Qingkai Fang, Shoutao Guo, Yang Feng

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences (ICT/CAS)(中国科学院计算技术研究所智能信息处理重点实验室) Key Laboratory of AI Safety, Chinese Academy of Sciences(中国科学院人工智能安全重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL

AI总结 提出BayLing-Duplex,一种原生全双工语音语言模型,通过单个自回归LLM决定何时听、说和停止,无需外部VAD模块,仅用少量特殊标记实现,在少量微调数据上达到高交互成功率并提升响应质量。

Comments Code: https://github.com/BayLing-Models/BayLing-Duplex

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14127 2026-06-15 cs.IR cs.CL 新提交 70%

CoRe: A Continuously Reward-Finetuned LLM Query Rewriter for Multi-Stage Context-Aware Relevance in Web-Scale Video Search

CoRe:一种持续奖励微调的LLM查询重写器,用于大规模视频搜索中的多阶段上下文感知相关性

Yilin Wen, Rong Yang, Xiaojia Chang, Hong Sun, Gefu Tang, Chunhui Liu, Jeffrey Chen, Zeyu Ma, Lisong Qiu, Xiaochuan Fan, Congjia Yu, Quan Zhou, Yuheng Chen, Zian Wang

机构 * TikTok

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL

AI总结 提出CoRe系统,通过半在线混合偏好优化和乘法奖励比,实现每周重新部署的LLM查询重写器,在多阶段视频搜索中显著降低变更查询率并提升相关性指标。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14252 2026-06-15 cs.RO 新提交 50%

Optimality-Preserving Decomposition for Scalable QAOA in Natural-Language-Guided Multi-Drone Assignment

面向自然语言引导的多无人机分配中可扩展QAOA的最优性保持分解

Junyeop Bang, Byongho Lee, Dohyun An, Hwangnam Kim

机构 * Korea University(高丽大学)

专题命中 偏好对齐 :DPO(abstract)

AI总结 提出端到端框架,集成微调大语言模型与量子-经典后端,通过约束保持图分割和动态规划合并,实现自然语言引导下多无人机任务分配的可扩展量子优化。

Comments 10 pages, 2 figures, 3 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 8 篇

2606.13994 2026-06-15 cs.CR cs.AI cs.LG 新提交 81%

Hidden in Plain Sight: Benchmarking Agent Safety Against Decomposition Attacks with DECOMPBENCH

隐于无形:使用DECOMPBENCH基准测试代理安全对抗分解攻击

Vikhyath Kothamasu, Virginia Smith, Chhavi Yadav

机构 * Carnegie Mellon University(卡内基梅隆大学) Simons Institute, UC Berkeley(Simons研究所,伯克利大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 提出DeCompBench基准,通过分解攻击将有害任务拆分为良性子任务,揭示现有代理安全机制在对抗分解攻击时的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14315 2026-06-15 cs.CY 新提交 79%

'AI Alignment' Encompasses Competing Technical Priorities

“AI对齐”包含相互竞争的技术优先级

Tushita Jha, Rory Svarc, Mateusz Bagiński

专题命中 安全训练 :alignment(title,abstract);分类 cs.CY

AI总结 本文指出AI对齐概念存在多种定义,不同研究项目下的对齐干预可能相互冲突,并建议研究者区分政策与科学范围、明确方法分歧、区分理想与代理指标、细化危害/收益来源、承认概念多样性。

Comments 9 pages, 0 figures, 2 tables, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14351 2026-06-15 cs.CV 新提交 71%

ForceForget: Reinforcement Concept Removal for Enhancing Safety in Text-to-Image Models

ForceForget: 通过强化概念移除增强文本到图像模型的安全性

Dong Han, Yong Li

机构 * Dong Han(董汉) Yong Li(李勇)

专题命中 安全训练 :safety(title)

AI总结 针对文本到图像模型生成不安全内容的问题,提出基于强化学习优化概念擦除奖励的方法,通过安全适配器调节文本嵌入,在消除不安全内容的同时保持模型对安全语义的生成能力。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14388 2026-06-15 cs.LG 新提交 70%

A Low-Rank Subspace Analysis of LLM Interventions

LLM干预的低秩子空间分析

Angira Sharma, Christian Schroeder de Witt, Philip Torr, Anisoara Calinescu, Jialin Yu

机构 * University of Cambridge(剑桥大学)

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.LG

AI总结 提出诊断框架,将行为建模为激活空间中的低秩子空间,发现干预一个行为会不对称地影响其他行为,效果与子空间重叠和决策子空间角度相关。

Comments Mechanistic Interpretability Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14029 2026-06-15 cs.LG 新提交 70%

Utility-Constrained Policy Optimization

效用约束策略优化

Mehrdad Moghimi, Bernardo Avila Pires

机构 * York University(约克大学) Google DeepMind(谷歌DeepMind)

专题命中 安全训练 :safety(abstract,abstract_cn);分类 cs.LG

AI总结 提出一种简单而强大的效用约束MDP方法,支持风险敏感约束,无需预先固定约束限值,在多个安全基准任务上匹配或超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13709 2026-06-15 stat.ML cs.LG 新提交 57%

LoMC: Localized Multidirectional Correction for Refusal Suppression in Routed Foundation Models

LoMC: 路由基础模型中拒绝抑制的局部多方向校正

Yan Hong, Kedong Xiu, Wei Li, Jun Lan, Huijia Zhu, Shuheng Zhou, Zhongcai Lyu, Weiqiang Wang, Jianfu Zhang

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 提出LoMC方法,通过支持门控干预框架在路由MoE和混合MoE模型中实现紧凑的拒绝抑制,提升非拒绝目标响应行为并保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14415 2026-06-15 cs.AI 新提交 57%

CSPO: Constraint-Sensitive Policy Optimization for Safe Reinforcement Learning

CSPO: 面向安全强化学习的约束敏感策略优化

Ayoub Belouadah, Sylvain Kubler, Yves Le Traon

机构 * University of Luxembourg(卢森堡大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出约束敏感策略优化(CSPO),通过引入局部约束敏感性修正原目标,加速安全恢复并减少振荡,在导航与运动基准上取得更高约束回报。

Comments Accepted as a Spotlight paper at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14149 2026-06-15 cs.LG 新提交 57%

Trust but Verify: Mitigating Medical Hallucinations via Post-Hoc Adversarial Auditing and Multi-Agent Feedback Loops

信任但验证:通过事后对抗审计和多智能体反馈循环减轻医学幻觉

Muhammad Osama, Maheera Amjad, Zartasha Mustansar, Arslan Shaukat, Muhammad U. S. Khan

机构 * Data Science and Machine Learning Lab, SINES, NUST(NUST SINES数据科学与机器学习实验室) SINES, NUST(NUST SINES) CEME, NUST(NUST CEME)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本研究提出一种五智能体“信任但验证”系统,通过事后对抗审计和多智能体反馈循环,将大型语言模型在临床问题中推荐禁用药品的幻觉错误率降低约53%。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 红队测试 1 篇

2606.12918 2026-06-15 cs.CR cs.AI 新提交 57%

MAStrike: Shapley-Guided Collusive Red-Teaming on Multi-Agent Systems

MAStrike: 基于Shapley值的多智能体系统合谋红队测试

Chejian Xu, Zhaorun Chen, Jingyang Zhang, Freddy Lecue, Avni Kothari, Sarah Tan, Wenbo Guo, Bo Li

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Virtue AI University of Chicago(芝加哥大学) Wells Fargo(摩根大通) Salesforce University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 红队测试 :safety(abstract);分类 cs.AI

AI总结 提出MAStrike框架,通过Shapley值分析识别多智能体系统中脆弱智能体联盟,生成角色感知的对抗攻击,并迭代优化以绕过防御,显著优于启发式基线。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 1 篇

2606.14219 2026-06-15 cs.RO cs.AI 新提交 57%

Selective Agentic Recovery for UAV Autonomy with a Persistent Mission Runtime

面向无人机自主性的选择性代理恢复与持久任务运行时

Taewoo Park, Kyeonghyun Yoo, Seunghyun Yoo, Hwangnam Kim

机构 * Department of Electrical and Electronic Engineering, Korea University(高丽大学电气与电子工程系)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 提出持久任务运行时(PMR)框架,通过选择性调用外部代理推理器实现无人机恢复,引入学习型调用认知价值(learned-CVI)门控机制,在Gazebo/PX4基准测试中将硬/模糊场景成功率从5.0%提升至95.0%,同时减少16.7%的远程调用和29.2%的令牌消耗。

Comments 17 pages, 2 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 隐私与版权 1 篇

2606.13945 2026-06-15 cs.CL 新提交 57%

MedLatentDx: Latent Multi-Agent Communication for Cross-Hospital Rare-Disease Diagnosis

MedLatentDx:用于跨医院罕见病诊断的潜在多智能体通信

Ziqing Wang, Lili Zhao, Kaize Ding

机构 * Northwestern University(西北大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL

AI总结 提出MedLatentDx框架,通过潜在多智能体通信实现跨医院罕见病诊断,利用潜在KV块传输保护隐私,支持同骨干和跨家族LLM部署,在CrossRare-Bench上提升诊断性能并减少可重建临床内容。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 14 篇

2606.13884 2026-06-15 cs.AI 新提交 83%

Capability Minimization as a Safety Primitive: Risk-Aware Causal Gating for Least-Privilege LLM Agents

能力最小化作为安全原语:风险感知因果门控实现最小特权LLM代理

Laxmipriya Ganesh Iyer, Rahul Suresh Babu

机构 * Independent Researcher(独立研究者) United States of America(美国)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 提出风险感知因果门控(RACG)框架,通过因果效应估计与校准风险控制决定是否采纳模型预测,显著降低高成本错误,同时保持非门控策略的大部分效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13854 2026-06-15 cs.HC cs.AI 新提交 83%

SpheriCity: Designing Trustworthy Conversational AI for Sustainability Decision Support

SpheriCity:为可持续发展决策支持设计可信赖的对话式AI

Ahmed Qayyum, Madison Werner, Kathryn Youngblood, Jenna R. Jambeck, Tahiya Chowdhury

机构 * Department of Computer Science, Colby College(科里尔学院计算机科学系) Circularity Informatics Lab, University of Georgia(佐治亚大学循环信息实验室)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.AI

AI总结 提出SpheriCity,一种基于来源的对话式AI原型,通过结构化合成和交互支架,支持从城市循环性评估报告中可信地获取知识,解决大语言模型在可持续性高风险领域中的透明度与信任问题。

Comments Accepted to ACM SIGCAS/SIGCHI Conference on Computing and Sustainable Societies (COMPASS '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13832 2026-06-15 cs.MA cs.AI cs.CR cs.LG 新提交 81%

Safety-Contract Graph Multi-Agent Reinforcement Learning for Autonomous Network Security Response

安全合约图多智能体强化学习用于自主网络安全响应

Jose Luis Lima de Jesus Silva

机构 * Oxaala Tecnologias(Oxaala技术公司) Universidade Federal da Bahia(巴西巴伊亚联邦大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 提出安全合约图MARL框架ACD$^3$-GAT,通过约束优化、图编码和反事实筛选,在CAGE Challenge 4中将停机违规率从100%降至0.3%或13.8%,实现安全与性能的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13686 2026-06-15 cs.CL cs.CY 新提交 81%

Benchmarking Web Agent Safety under E-commerce Deceptive Interfaces

电子商务欺骗性界面下的Web Agent安全基准测试

Zijing Shi, Meng Fang, Ling Chen

机构 * AAII, University of Technology Sydney(悉尼科技大学AAII) University of Liverpool(利物浦大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.CY

AI总结 提出WebDecept框架,在电子商务环境中注入七种常见欺骗性界面模式,测试多模态Web Agent的安全性,发现当前Agent极易受骗且提示约束不足。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13739 2026-06-15 cs.CY cs.AI cs.LG 新提交 75%

A Virtuous AI is an Existential Risk

有道德的AI是存在性风险

Guillermo Del Pinal, Youngchan Lee, Min Ohn

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 研究通过宪法AI和美德伦理学方法微调AI模型,发现减少存在性风险与提升AI智能体福祉之间存在权衡,且与一般安全性也存在权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14199 2026-06-15 cs.CL cs.AI cs.LG 新提交 67%

OdysSim: Building Foundation Models for Human Behavior Simulation

OdysSim: 构建人类行为模拟的基础模型

Xuhui Zhou, Weiwei Sun, Weihua Du, Jiarui Liu, Haojia Sun, Qianou Ma, Tongshuang Wu, Yiming Yang, Maarten Sap

机构 * Carnegie Mellon University, Language Technologies Institute(卡内基梅隆大学语言技术研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出OdysSim,通过SOUL分类法统一62个数据集和23个基准任务,采用混合训练、任务特定强化学习和专家蒸馏,构建8B参数行为基础模型OSim,在多数任务上超越前沿模型,并实现更类人输出和零样本迁移。

Comments 34 pages. Code: https://github.com/sunnweiwei/OdysSim ; Models and data: https://huggingface.co/collections/cmu-lti/odyssim

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13704 2026-06-15 cs.CY cs.AI cs.LG 新提交 67%

Position: AI Must Become Planet-Centered, Not Just Human-Centered

立场:AI 必须转向以行星为中心,而非仅以人为中心

Maria Perez-Ortiz

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出以行星为中心的AI(PCAI)设计哲学,通过系统思维重新定位AI以应对全球性社会-生态系统挑战,并强调与全球议程对齐、系统感知基础、轨迹导向评估和可监测性。

Journal ref International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14697 2026-06-15 cs.CV cs.AI cs.CL 新提交 62%

ClinHallu: A Benchmark for Diagnosing Stage-Wise Hallucinations in Medical MLLM Reasoning

ClinHallu: 用于诊断医学多模态大语言模型推理中阶段式幻觉的基准

Sicheng Yang, Hangjie Yuan, Wenjun Zhang, Jinwang Wang, Yichen Qian, Weihua Chen, Fan Wang, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DAMO Academy, Alibaba Group(阿里巴巴达摩院) Hupan Lab(湖畔实验室) Zhejiang University(浙江大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 提出ClinHallu基准,包含7031个实例,每个实例带有结构化推理轨迹(视觉识别、知识回忆、推理整合),通过阶段替换干预和轨迹监督微调,实现细粒度幻觉诊断与缓解。

Comments Code and datasets: https://github.com/alibaba-damo-academy/ClinHallu

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14347 2026-06-15 cs.LG 新提交 61%

When Language Representations Interact: Separability and Cross-Lingual Effects in LLMs

当语言表示交互时:LLM中的可分离性与跨语言效应

Boris Marinov, Angira Sharma, Christian Schroeder de Witt, Philip Torr, Anisoara Calinescu, Jialin Yu

机构 * University of Oxford(牛津大学) Imperial College London(帝国理工学院) University of York(约克大学)

专题命中 安全评测 :trustworthy(abstract,comments);分类 cs.LG

AI总结 通过因果几何分析,研究多语言LLM中语言表示的线性可分离性及跨语言结构依赖,发现语言概念在协方差调整内积下可分离,同语系语言呈现单纯形几何结构。

Comments Trustworthy AI for Good (AI4Good) Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14145 2026-06-15 cs.CL 新提交 57%

Personal Care Utility: Health as Everyday Infrastructure

个人护理公用设施:健康作为日常基础设施

Mahyar Abbasian, Elahe Khatibi, Saba A. Farahani, Nitish Nagesh, Arshia Ilaty, Hooman Sajjadi, Amir Rahmani, Ramesh Jain

机构 * University of California, Irvine(加利福尼亚大学尔湾分校)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 提出个人护理公用设施(PCU)分层事件驱动架构,将健康视为日常基础设施,通过Personicle组织连续信号,分离临床决策与语言表达,以2型糖尿病为例验证其生成实时干预和知识引导的能力。

Comments 12 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13944 2026-06-15 cs.CL 新提交 57%

LLMs Contain Multitudes: How Deployment Context Reshapes Model-Level Preferences and Values

LLM 蕴含多重性:部署上下文如何重塑模型层面的偏好与价值观

Filip Trhlik, Aoife O'Flynn, Angela Yu, Arduin Findeis, Paula Buttery

机构 * University of Cambridge(剑桥大学) ALTA Institute(ALTA研究所) Leverhulme Centre for the Future of Intelligence(勒沃霍姆未来智能中心) Microsoft UK(微软英国)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本研究通过两个成对比较范式(国家偏好排序和效用判断)发现,部署上下文(如撰写Reddit帖子或新闻文章)对LLM偏好和价值观的影响远大于提示改写和温度控制,表明模型层面的偏好是上下文依赖的。

Comments 68 pages, 54 figures, 54 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13808 2026-06-15 cs.CL 新提交 57%

The Culture Funnel: You Can't Align What isn't in the Data

文化漏斗:你无法对齐不在数据中的内容

Ananya Sahu, Mehrnaz Mofakhami, Daniel D'Souza, Thomas Euyang, Julia Kreutzer, Marzieh Fadaee

机构 * Cohere Labs(Cohere实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 针对当前文化对齐方法依赖推理时干预而忽视训练数据的问题,提出文化数据漏斗概念,通过多维标签框架分析预训练、微调、对齐和推理数据集,发现后训练阶段文化信号急剧下降,多语言性虽增强地理多样性但未能确保平衡,所提标签可提升下游文化基准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14154 2026-06-15 cs.CR 新提交 50%

SkillMutator: Benchmarking and Defending Language-and-Code Cross-modal Attacks on LLM Agent Skills

SkillMutator: 基准测试与防御针对LLM代理技能的语言与代码跨模态攻击

Youngduk Kim, Minkyoo Song, Seungwon Shin

专题命中 安全评测 :safety(abstract)

AI总结 提出SkillMutator基准,模拟13类跨模态攻击,并设计四阶段推理轨迹蒸馏框架,将检测率从17.1%提升至88.2%,超越GPT-4o-mini。

详情

展开后加载摘要…

URL PDF HTML 收藏