arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 2678 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 964 篇

2606.11201 2026-06-11 cs.LG cs.AI cs.CL 新提交 82%

To Intervene or Not: Guiding Inference-time Alignment with Probabilistic Model Blending

干预还是不干预:通过概率模型混合指导推理时对齐

Jin Gan, Xin Li, Jun Luo

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出BlendIn框架,通过质量感知对齐和按可靠性加权混合模型知识,解决推理时对齐中指导有效性差异大的问题,在困难模型对上实现最高50%的性能提升。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12360 2026-08-14 cs.CY cs.LG 新提交 81%

Regulatory Approval Is Not Enough: Gaps in Trustworthy AI Reporting in FDA-Cleared Medical Devices

监管批准并不足够:FDA clearance医疗设备中可信赖AI报告的缺口

Ahmed M Salih, Oliver Díaz, Alejandro Guzman, Noah Marquez Vara, Fotios Avgoustidis, Rituraj Singh, Saman Barakat, Zahra Raisi-Estabragh, Karim Lekadir

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CY、cs.LG

AI总结 该研究分析2021-2025年FDA获批的519份AI/ML医疗设备报告,发现可信赖AI报告存在显著缺口,获批年份或临床领域不影响报告透明度,仅监管批准不足以证明AI可信赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12346 2026-08-14 cs.AI cs.CY 新提交 81%

Position: The Alignment Community is Unintentionally Building a Censor's Toolkit

立场:对齐社区正在无意之中构建审查者的工具包

Sarah Ball, Phil Hackemann

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 该立场论文指出现代AI对齐方法是两用技术,可能被恶意滥用,呼吁社区讨论其滥用风险并提出缓解策略。

Comments Accepted as oral paper at ICML 2026

Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11922 2026-08-13 cs.CL cs.IR cs.LG 新提交 81%

LODESTAR: Trustworthy Entropy Is Navigated, Not Merely Measured -- Reinforced Polarizer Keeps a Frozen LLM from Being Confidently Misled by the Wrong Evidence

LODESTAR:可信赖熵是被引导的,而非仅被测量——强化偏振器防止冻结型大语言模型(LLM)被错误证据误导而自信出错

Po-Jen Ko, Che-Cheng Wu, Hung-Chun Hsu, Li-Yang Chang, Chuan-Ju Wang

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL、cs.LG

AI总结 LODESTAR是首个通过强化学习训练偏振器、依据第三方冻结型LLM的不确定性评分文本干预的方法,可提升检索增强问答的F1值等指标,减少模型读取误导性段落的概率。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11830 2026-08-13 cs.CY cs.CL 新提交 81%

Quantifying the Relationship Between Clinical Safety and Environmental Impact in Therapeutic LLMs

量化治疗型大语言模型(LLMs)的临床安全性与环境影响之间的关系

Alireza A. Safaei, Laura M. Vowels, Matthew J. Vowels, Apoorv Jha, Shekoufeh Rahimi

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.CY

AI总结 该研究量化治疗型LLMs的临床安全性与环境影响的关系,发现安全分布高端存在非线性权衡,额外测试时计算未必提升安全,提出动态模型选择等可持续部署方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11493 2026-08-13 cs.AI cs.LG 新提交 81%

From Prompting to Behavioral Alignment: Personalized LLM Judges for Recommendation Evaluation

从提示工程到行为对齐:用于推荐评估的个性化大语言模型评判者

Alireza S. Ziabari, Kat Ellis, Colleen Chan, Ding Tong

机构 * Netflix(网飞公司)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究针对离线推荐评估中LLM存在的双向合理化问题,提出序列行为对齐框架,经真实日志验证,其Macro-F1较零样本基线提升32.19%,可缓解失效模式且无需人工管道开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07639 2026-08-11 cs.LG cs.AI 新提交 81%

SkillConsist: Detecting Inconsistencies in Agent Skills via Bidirectional Graph Alignment

SkillConsist:通过双向图对齐检测智能体技能中的不一致性

Chaofan Meng, Yuhang Zheng, Yingnan Zhou, Sihan Xu

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 SkillConsist针对智能体技能不一致检测的挑战,通过双向图对齐等技术构建基准并取得优于基线的检测性能,提升了技能一致性检测效果。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02238 2026-08-04 cs.AI cs.LG 新提交 81%

Trustworthy AI in Digital Health: A Comprehensive Review of Robustness and Explainability

数字健康中的可信AI:鲁棒性与可解释性的综合综述

Abdullah Mamun, Shovito Barua Soumma, Hassan Ghasemzadeh

机构 * College of Health Solutions, Arizona State University(亚利桑那州立大学健康解决方案学院) School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 本综述针对数字健康领域可信AI研究缺口,构建框架梳理鲁棒性与可解释性的技术进展、应用考量与评估指标,为相关开发提供支持。

Comments Preprint of the paper published in Progress in Biomedical Engineering. 26 pages, 5 figures

Journal ref Progress in Biomedical Engineering, Volume 8, Number 2, Article 022007, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01423 2026-08-04 cs.AI cs.GT cs.LG 新提交 81%

Scoring Rules! Statistical and Strategic Alignment for Text Evaluation Metrics

评分规则!文本评估指标的统计对齐与策略对齐

Shengwei Xu, Yuxuan Lu, Yifan Wu, Jason Hartline, Grant Schoenebeck

机构 * University of Michigan(密歇根大学) Peking University(北京大学) Microsoft Research(微软研究院) Northwestern University(西北大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究针对文本评估指标,提出统计与策略对齐概念及三项测试原则,开发基于互信息的指标设计框架,发现 LLM-as-a-Judge 相关性高但易操纵,新指标鲁棒性强且相关性具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28079 2026-07-31 cs.LG cs.AI 新提交 81%

Chem World: A Large-Scale Benchmark and Physics-Informed Framework for Trustworthy Chemical Property Prediction

Chem World:用于可信赖化学性质预测的大规模基准及物理信息框架

Tianyou Bai, Huan Wang, Mingchen Gao, Fangyue Lin, Pinze Ren, Zhenlin Zhao, Siming Dong

机构 * Cleer Science(克利尔科学公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Imperial College London(伦敦帝国学院) Tsinghua University(清华大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究推出整合17类超80万分子样本的Chem World化学性质预测基准,并提出Mixture-PINN物理信息神经网络框架,经实验验证其可提升预测性能,为可信赖AI系统研发奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24817 2026-07-29 cs.IR cs.AI cs.CL 新提交 81%

Retrieval-Augmented Generation in LLMs for Mental Health: Quantifying the Incremental Contribution of Retrieval Within a Layered Safety Architecture

大语言模型在心理健康领域的检索增强生成:量化分层安全架构中检索的增量贡献

Anand Gupta, Akshat Surolia, Shubham Mishra, Shakil Imtiaz, Chaitali Sinha

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 研究数字心理健康干预中,通过在名为Wysa的DMHI里对比启用和禁用检索增强生成(RAG)模式,评估六个大语言模型,计算相关指标并测试差异,发现RAG虽致误报增加,但符合安全原则,是提升LLM驱动的DMHIs相关性能的有前景方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23237 2026-07-28 cs.LG cs.AI 新提交 81%

Context-Aware Concept Distillation for Trustworthy Flood Prediction

用于可靠洪水预测的上下文感知概念蒸馏

Eli Levinkopf, Efrat Morin, Claudia V. Goldman

机构 * School of Computer Science and Engineering, The Hebrew University of Jerusalem(耶路撒冷希伯来大学计算机科学与工程学院) Institute of Earth Sciences, The Hebrew University of Jerusalem(耶路撒冷希伯来大学地球科学研究所) Hebrew University Business School, The Hebrew University of Jerusalem(耶路撒冷希伯来大学商学院)

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI、cs.LG

AI总结 针对深度学习模型‘黑箱’问题阻碍洪水预测信任度的挑战,提出上下文感知概念蒸馏框架CACD,引入无监督管道和残差超网络,经全球多流域评估,该模型高保真且优于黑箱基线,平衡了AI准确性与决策透明度。

Comments to be published in IJCAI 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20265 2026-07-23 cs.CL cs.AI 新提交 81%

The Maskability Index: Predicting Task-Objective Alignment in Pretrained Language Models

可掩码性指数:预测预训练语言模型中的任务目标对齐

Ahmad Pouramini, Mahsa Afsharzadeh

机构 * Sirjan University of Technology(锡尔詹理工大学) Department of Computer Engineering(计算机工程系)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 研究提出可掩码性指数(MI),用于评估知识关系适合的提示方式,通过掩码与未掩码模板的DepthRank分数差异计算。在ATOMIC2020基准上评估发现MI与下游生成性能正相关,有助于选择提示模板和策略提取预训练语言模型的关系知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19913 2026-07-23 cs.AI cs.CL cs.CR 新提交 81%

JANUS: Foreseeing Latent Risk for Long-Horizon Agent Safety

JANUS:预见长期智能体安全中的潜在风险

Yuan Xiong, Linji Hao, Shizhu He, Yequan Wang, Lijun Li

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 研究长期智能体安全潜在风险,提出JANUS框架,通过多智能体模拟合成轨迹,经预测与裁决耦合任务学习共享策略,用CoAA-RL联合优化,所产生的Vanguard模型提升了智能体安全防护及任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17601 2026-07-21 cs.LG cs.AI 新提交 81%

Trustworthy Protein-Ligand Binding Affinity Prediction via Reliability-Aware Multi-Engine Fusion

通过可靠性感知多引擎融合实现可靠的蛋白质-配体结合亲和力预测

Yongchan Hong, Defu Cao, Wenjin Liu, Thomas Ku, Jordy Homing Lam, Emily Nguyen, Willie Neiswanger, Vsevolod Katritch, Yan Liu

机构 * University of Southern California(南加州大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对蛋白质-配体结合亲和力预测中引擎结果不一致问题,提出RELIABLE-BA框架,通过三步实现多引擎预测,经实验验证其能提升预测竞争力和不确定性校准,可筛选高置信对减少误差,是首个结合证据融合与上下文可靠性的预测框架。

Journal ref KDD '2026: Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17270 2026-07-21 cs.CL cs.CY 新提交 81%

Safety That Does Not Transfer: Cross-Lingual Clinical Correctness Drift in Deployable Medical Language Models

不可转移的安全性:可部署医学语言模型中的跨语言临床正确性漂移

Anthonio Oladimeji Gabriel, Dimeji Olawuyi, Toba Ajayi, Temilola Aderemi

机构 * AI SafetyX(人工智能安全X)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.CY

AI总结 研究资源匮乏健康环境中可部署医学语言模型的跨语言临床正确性漂移,构建英语-豪萨语问题对评估六个模型,发现本地可部署模型临床正确性下降,前沿模型较稳定,缺陷源于可部署层而非语言或临床材料。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16938 2026-07-21 cs.CV cs.AI cs.LG cs.RO 新提交 81%

What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning

他们看到了什么?通过视觉-语言-动作模型的视角解读复杂道路场景以实现安全可靠的自动驾驶学习

Kalpana Panda, Wesley Maia, Vinti Agarwal, Ross Greer

机构 * Birla Institute of Technology and Science, Pilani(贝拉理工科学学院皮拉尼分校) University of California, Merced(加州大学默塞德分校)

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI、cs.LG

AI总结 研究自动驾驶模型内部逻辑不透明问题,提出反事实消融框架CVAA,通过移除摄像头图像中物体创建反事实集评估模型响应差异,应用于阿尔帕马约1轨迹预测器,分析物体因果影响,还通过可解释性技术深入理解模型,创建可解释驾驶系统巩固人机信任。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13078 2026-07-16 cs.CR cs.AI cs.LG 新提交 81%

Operational Evidence Gaps for LLMs in Fraud Detection and Trust-and-Safety Workflows

大语言模型在欺诈检测和信任与安全工作流程中的操作证据差距

Keyur Gabani

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 研究LLMs用于欺诈检测等信任与安全工作流程时的操作证据差距。通过对相关操作源编码调查发现证据失衡,欺诈任务部分大但缺乏关键证据。贡献了FORTE框架和部署证据清单,确定支持LLMs部署所需研究。

Comments 22 pages, 3 figures, 6 tables. Ancillary files include the evidence matrix, search note, and numeric claim check

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13038 2026-07-16 cs.CY cs.AI 新提交 81%

Designing Safety-Constrained LLM Systems for Public Health Information Access

设计用于公共卫生信息访问的安全约束大语言模型系统

Ben Torkian, Jun Zhou

机构 * University of South Carolina(南卡罗来纳大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.CY

AI总结 针对公共卫生信息访问,尤其是母婴健康资源导航,设计实现安全约束大语言模型系统。采用多层架构,含领域受限RAG等,通过可控数据管道确保回复基于精选资源。经场景验证,系统安全约束执行一致、性能稳定,为相关领域部署LLM系统提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08374 2026-07-10 cs.CL cs.AI cs.HC cs.RO cs.SI 新提交 81%

Large-Language-Models-as-a-Judge in Theory-Agnostic Adaptive Metric-Alignment for Prototypical Networks in Personality Recognition

大语言模型作为人格识别中原型网络的理论无关自适应度量对齐的评判器

Jing Jie Tan, Ban-Hoe Kwan, Danny Wee-Kiat Ng, Yan-Chai Hum, Shih-Yu Lo, Po-An Chen, Noriyuki Kawarazaki, Kosuke Takano, Anissa Mokraoui

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对人格识别受理论依赖公式限制的问题,提出理论无关的JAM框架,通过注意力池化图原型网络和跨理论协调方法学习结构化表示并统一数据集,还用大语言模型作为评判器机制,提升了跨框架泛化能力和性能。

Journal ref IEEE Transactions on Affective Computing (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07184 2026-07-09 cs.LG cs.AI 新提交 81%

Predicting LLM Safety Before Release by Simulating Deployment

通过模拟部署预测大语言模型发布前的安全性

Marcus Williams, Hannah Sheahan, Cameron Raymond, Tomek Korbak, Deng Pan, Peilin Yang, Leon Maksin, Ningyi Xie, Phillip Guo, Ian Kivlichan, Micah Carroll

机构 * OpenAI(开放人工智能研究公司)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 研究通过模拟部署预测大语言模型发布前安全性的方法,从去识别化对话出发,固定前缀用候选模型生成回复来评估。该方法能估计行为不当率,优于基线,还能克服工具重新采样挑战,为外部研究提供途径,助力预测模型现实行为及评估部署风险。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31644 2026-07-07 cs.CL cs.CY 新提交 81%

Moral Safety in LLMs: Exposing Performative Compliance with Puzzled Cues

大语言模型中的道德安全:揭示对困惑线索的表演性遵从

Mohammadamin Shafiei, Shuyue Stella Li, Yulia Tsvetkov

机构 * University of Milan(米兰大学) University of Washington(华盛顿大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.CY

AI总结 本研究提出“表演性遵从”概念,揭示大语言模型在道德困境中当身份标签被隐藏时公平性显著下降,并引入线索变化方法和“线索可见性差距”指标来区分真实与表演性道德安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25782 2026-06-25 cs.CL cs.AI 新提交 81%

Do Encoders Suffice? A Systematic Comparison of Encoder and Decoder Safety Judges for LLM Adversarial Evaluation

编码器足够吗?用于LLM对抗性评估的编码器与解码器安全评判器的系统比较

Han Jeon, Shiv Medler, Joseph Voyles, Matt Wood

机构 * PricewaterhouseCoopers(普华永道)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 系统比较ModernBERT系列编码器分类器与基于LLM的解码器评判器在识别有害LLM输出上的性能,发现编码器可在保持低延迟和低成本的同时接近LLM评判器的效果。

Comments 13 pages, 5 figures, Accepted into ICANN2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18936 2026-06-25 cs.AI cs.CY 新提交 81%

SciRisk-Bench: A Risk-Dimension-Aware Benchmark for AI4Science Safety

SciRisk-Bench:面向AI4Science安全的风险维度感知基准

Linghao Feng, Yinqian Sun, Dongqi Liang, Sicheng Shen, Chenfei Yan, Yuxuan Peng, Yilin Zhao, Haibo Tong, Kai Li, FeiFei Zhao, Yi Zeng

机构 * Brain-inspired Cognitive Intelligence Lab, Institute of Automation, Chinese Academy of Sciences, Beijing, China(脑启发认知智能实验室,自动化研究所,中国科学院,北京,中国) School of Future Technology, University of Chinese Academy of Sciences, China(未来技术学院,中国科学院大学,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, China(人工智能学院,中国科学院大学,中国) Zhongguancun Academy, China(中关村学院,中国) Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) Gaoling School of AI, Renmin University of China(甘露人工智能学院,中国人民大学) Beijing Institute of AI Safety and Governance (Beijing-AISI)(北京人工智能安全与治理研究院(北京-AISI)) School of Humanities, University of Chinese Academy of Sciences, China(人文学院,中国科学院大学,中国)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.CY

AI总结 提出SciRisk-Bench基准,从显式风险维度和科学学科两个角度评估AI4Science安全,覆盖7个学科、31个子学科和10个风险维度,实验揭示主流及科学大模型的安全薄弱环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20626 2026-06-23 cs.CY cs.AI 新提交 81%

Efficient Safety Benchmarking via Item Response Theory

通过项目反应理论实现高效安全基准测试

Fabio Spagliardi, Mírian Silva, Ayan Datta, Aiden Zhou, Vamshi Bonagiri, Diogo Cruz

机构 * Supervised Program for Alignment Research (SPAR)(对齐研究监督计划) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Yale University(耶鲁大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.CY

AI总结 针对安全基准测试中项目信息量不均的问题,利用项目反应理论(IRT)实现自适应项目选择,将评估成本降低至少80%,最高达99.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18986 2026-06-18 cs.CL cs.AI 新提交 81%

Beyond Tokenization: Direct Timestep Embedding and Contrastive Alignment for Time-Series Question Answering

超越分词:面向时间序列问答的直接时间步嵌入与对比对齐

Yafeng Wu, Huu Hiep Nguyen, Thin Nguyen, Hung Le

机构 * Deakin University(德肯大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 提出CADE框架,通过逐点线性编码器直接嵌入每个时间步,避免分词瓶颈,并利用单向监督对比损失对齐时间序列与文本锚点,在Time-MQA基准上提升六项TSQA任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18383 2026-06-18 cs.LG cs.CL 新提交 81%

From Sparse Features to Trustworthy Proxies: Certifying SAE-Based Interpretability

从稀疏特征到可信代理:认证基于SAE的可解释性

Dibyanayan Bandyopadhyay, Asif Ekbal

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Patna(印度理工学院巴特那分校计算机科学与工程系)

专题命中 安全评测 :trustworthy(title);alignment(abstract);分类 cs.CL、cs.LG

AI总结 提出一种后验泛化框架,通过稀疏代理(SAE重建)认证语言模型,推导期望风险上界,并在GPT-2 Small等模型上验证非平凡界,揭示深层更易认证且特征分解区分语义对齐与统计稀疏性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13832 2026-06-15 cs.MA cs.AI cs.CR cs.LG 新提交 81%

Safety-Contract Graph Multi-Agent Reinforcement Learning for Autonomous Network Security Response

安全合约图多智能体强化学习用于自主网络安全响应

Jose Luis Lima de Jesus Silva

机构 * Oxaala Tecnologias(Oxaala技术公司) Universidade Federal da Bahia(巴西巴伊亚联邦大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 提出安全合约图MARL框架ACD$^3$-GAT,通过约束优化、图编码和反事实筛选,在CAGE Challenge 4中将停机违规率从100%降至0.3%或13.8%,实现安全与性能的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13686 2026-06-15 cs.CL cs.CY 新提交 81%

Benchmarking Web Agent Safety under E-commerce Deceptive Interfaces

电子商务欺骗性界面下的Web Agent安全基准测试

Zijing Shi, Meng Fang, Ling Chen

机构 * AAII, University of Technology Sydney(悉尼科技大学AAII) University of Liverpool(利物浦大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.CY

AI总结 提出WebDecept框架,在电子商务环境中注入七种常见欺骗性界面模式,测试多模态Web Agent的安全性,发现当前Agent极易受骗且提示约束不足。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11804 2026-06-11 cs.AI cs.CR cs.LG 新提交 81%

Toward Trustworthy AI: Multi-Target Adversarial Attacks and Robust Defenses for Continuous Data Summarization

迈向可信赖的人工智能:针对连续数据摘要的多目标对抗攻击与鲁棒防御

Yuefang Lian, Longkun Guo, Zhongrui Zhao, Zhigang Lu, Yanan Cai, Shuchao Pang, Dachuan Xu, Jason Xue

机构 * Nankai University(南开大学) James Cook University(詹姆斯库克大学) Western Sydney University(西悉尼大学) Beijing University of Technology(北京工业大学) Fuzhou University(福州大学) Nanjing University of Science and Technology(南京理工大学) CSIRO's Data 61(澳大利亚联邦科学与工业研究组织Data61) The University of Adelaide(阿德莱德大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 研究通过DR-子模优化在相似性层面扰动下对连续数据摘要进行对抗攻击,提出多目标攻击生成和鲁棒防御的近似算法,实验表明攻击有效且防御能改善鲁棒性-缓解权衡。

Comments Submitted to IEEE Transactions on Information Forensics and Security (IEEE TIFS)

详情

展开后加载摘要…

URL PDF HTML 收藏