arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 930 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 930 篇

2606.19356 2026-06-19 cs.CL cs.AI 新提交 76%

Trustworthy Multi-Agent Systems: Mitigating Semantic Drift with the Argent Signaling Protocol

可信多智能体系统:使用Argent信令协议缓解语义漂移

Anantha Sharma

机构 * Synechron Inc(Synechron公司)

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI

AI总结 提出Argent信令协议(ASP),通过结构化质量信号区分可修复与不可修复的失败,在文档问答和多智能体系统中分别提升通过率和阻断无依据传播。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07520 2026-06-09 cs.CL cs.LG 新提交 76%

TinyJudge: Unverifiable Constraint Alignment via Lightweight Specialist Ensembles

TinyJudge: 通过轻量级专家集成实现不可验证约束对齐

Yirong Zeng, Yufei Liu, Xiao Ding, Yutai Hou, Yuxian Wang, Wu Ning, Haonan Song, Dandan Tu, Qixun Zhang, Yuxiang He, Bibo Cai, Ting Liu

机构 * Harbin Institute of Technology SCIR Lab(哈尔滨工业大学SCIR实验室) Peking University(北京大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.LG

AI总结 针对LLM遵循不可验证约束时奖励黑客和计算开销大的问题,提出TinyJudge框架,利用多个小型语言模型集成提供奖励,在五个基准上平均性能提升约10%,奖励精度提升12%,训练速度提升3倍。

Comments ACL 2026 Main Conference;15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07309 2026-06-08 cs.SD cs.AI cs.CL 新提交 76%

Acoustic Cue Alignment in Audio Language Models for Speech Emotion Recognition

语音情感识别中音频语言模型的声学线索对齐

Iosif Tsangko, Andreas Triantafyllopoulos, Björn W. Schuller

机构 * DFG's Reinhart Koselleck project(德国科研基金Reinhart Koselleck项目) EU H2020 project(欧盟H2020项目)

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI

AI总结 研究音频语言模型中显式声学线索的对齐性,通过eGeMAPS特征提取六种可解释声学概念标记,发现对齐标记提升UAR,而错乱标记降低性能,模型对符号线索敏感但仍部分依赖音频信号。

Comments 6 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24866 2026-07-29 cs.CR 新提交 75%

The Missing Layer: Specification Infrastructure for AI Oversight

缺失的层次:人工智能监督的规范基础设施

Satyam Kumar, Saurabh Jha

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract)

AI总结 研究指出人工智能安全监督存在协调差距,提出两轴分类法。针对规范层缺乏成熟学科标志的问题,给出六项设计原则,以CARMA为例展示如何让规范可组合,助独立团队构建缺失部分实现有效监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03091 2026-07-07 cs.AI cs.CL cs.CY cs.MA stat.ME 新提交 75%

Silicon Sampling via Cross-Survey Transfer

通过跨调查转移进行硅采样

Chan-Tung Ku, Chan Hsu, Pei-Cing Huang, Frank Cheng-shan Liu, I-Ling Cheng, Yihuang Kang

机构 * National Sun Yat-sen University(国立中山大学) National Chung Hsing University(中国台湾国立中兴大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究提出跨调查转移评估框架,用大语言模型根据部分问题答案预测同调查中其他不同问题答案。利用2024年台湾选举与民主化研究数据等,发现零样本大语言模型精度及不同结构可预测性层级等,明确硅采样前景与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01690 2026-07-03 cs.AI cs.CL cs.LG 新提交 75%

Epistemic Goggles: A Pretrained Module that Induces an Epistemic Frame via Gradient Editing

认知护目镜:通过梯度编辑诱导认知框架的预训练模块

Joshua Penman

机构 * Independent Researcher(独立研究员)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对微调语言模型时出现的“否定忽视”问题,提出Goggles模块,通过编辑微调梯度而非数据来赋予模型特定的认知框架,使模型在保持能力的同时正确识别虚构内容。

Comments 20 pages, 10 figures, 2 tables. Code at https://github.com/JoshuaSP/epistemic-goggles and generated documents, questions, and teacher rollouts at https://huggingface.co/datasets/joshuapenman/epistemic-goggles-artifacts

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13739 2026-06-15 cs.CY cs.AI cs.LG 新提交 75%

A Virtuous AI is an Existential Risk

有道德的AI是存在性风险

Guillermo Del Pinal, Youngchan Lee, Min Ohn

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 研究通过宪法AI和美德伦理学方法微调AI模型,发现减少存在性风险与提升AI智能体福祉之间存在权衡,且与一般安全性也存在权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11533 2026-06-11 cs.CY cs.AI cs.ET cs.LG 新提交 75%

AI Researchers Must Help Lead Arms Control to Mitigate Military AI Risks

AI研究人员必须主导军备控制以降低军事AI风险

Ted Fujimoto, Jacob Benz

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文主张AI研究人员应主导军备控制研究,通过借鉴核威慑经验,推动验证与外交技术创新,以降低军事AI应用带来的紧迫风险。

Comments 9 pages, 1 figure, ICML 2026 Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08457 2026-06-09 cs.MA 新提交 75%

The Consistency Illusion: How Multi-Agent Debate Hides Reasoning Misalignment

一致性错觉:多智能体辩论如何隐藏推理失调

Xiaoyang Wang, Christopher C. Yang

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract)

AI总结 针对多智能体LLM系统中答案共识不等于推理对齐的问题,提出CARA指标检测一致性错觉,并设计GDP协议通过事实承诺和立场表态显著提升推理对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18063 2026-07-21 cs.CR cs.AI cs.LG 新提交 74%

Adaptive Adversaries: A Multi-Turn, Multi-LLM Benchmark for LLM Agent Security

自适应对手:用于大语言模型智能体安全的多轮、多大语言模型基准测试

Devina Jain, David Hartmann, Chuan Li

机构 * Lambda

专题命中 安全评测 :safety(abstract,comments);prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出针对无记忆大语言模型防御者的自适应多轮攻击的21场景基准测试,通过观察防御者响应灵活调整攻击。介绍了不同攻击轮次成功率,汇集多个前沿攻击者大语言模型的情况,还指出不同防御者弱点差异及场景排名不一致性,并发布了相关基准测试及数据集。

Comments Second Workshop on Agents in the Wild: Safety, Security, and Beyond

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13039 2026-08-14 cs.LG cs.SY eess.SY 新提交 74%

On the global feature importance for interpretable and trustworthy heat demand forecasting

面向可解释且可信的热需求预测的全局特征重要性研究

Milan Zdravković

机构 * Faculty of Mechanical Engineering(机械工程学院) University of Niš(尼什大学)

专题命中 安全评测 :trustworthy(title);分类 cs.LG

AI总结 本文引入事前可解释AI方法,结合梯度提升法与Partial Dependence、Accumulated Local Effects、SHAP三种事后方法,评估区域供热系统热需求预测ML模型的全局特征重要性,以提升模型可解释性与可信度,解决相关标准、满意度及责任风险问题。

Comments 9 pages, 5 figures. This preprint corresponds to the paper published in Thermal Science 2025 Volume 29, Issue 5 Part A, Pages: 3355-3365

Journal ref Thermal Science 2025 Volume 29, Issue 5 Part A, Pages: 3355-3365

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05238 2026-08-07 cs.LG 新提交 74%

Decoupling Perception from Description: Computation-Grounded Representation Alignment between Multivariate Time Series and Language

感知与描述解耦:多变量时间序列与语言间的计算基础表示对齐

Xinran Feng, Yi Xie, Chao Zhang, Ruikun Li, Wanyun Ling, Ziyue Li, Chenxi Liu

专题命中 安全评测 :alignment(title);分类 cs.LG

AI总结 该研究针对多模态时间序列语言对齐的三难困境,提出CGTime模型,通过计算处理感知、LLM处理描述,在多变量理解任务上优于更大的通用模型。

Comments 46 pages, 9 figures, including supplementary material. Submitted to AAAI 2027. Xinran Feng and Yi Xie contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01629 2026-08-04 cs.CL 新提交 74%

Human-LLM Alignment in Language Attitudes Toward Non-Native Japanese

在非母语日语的语言态度上实现人类与大语言模型(LLM)的对齐

Naho Orita, Hayato Ogawa, Daisuke Kawahara

专题命中 安全评测 :alignment(title);分类 cs.CL

AI总结 该研究对比人类与LLM对母语及非母语日语邮件的评价,发现LLM以结构化弱化形式重现母语者的语言态度,为审计LLM提供了可推广的语言态度框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20675 2026-07-24 cs.LG cs.NI 新提交 74%

Explanation-Based Runtime Verification for Trustworthy ML-driven Optical Networks

基于解释的运行时验证用于可信的机器学习驱动的光网络

Omran Ayoub, Carlos Natalino, Ali Al Housseini, Felix Foschum, Philipp Morger, Tiziano Leidi, David Hock, Paolo Monti

专题命中 安全评测 :trustworthy(title);分类 cs.LG

AI总结 研究将机器学习模型用于光网络自动化时决策可靠性问题,提出基于解释的运行时验证方法,利用模型解释评估决策合理性,在光路径传输质量分类用例中验证该方法有效,能拦截错误决策并保持高自动化率。

Comments 6 Pages, 2 Figures. Accepted and presented at the 30th International Conference on Optical Network Design and Modelling (ONDM 2026), Munich, Germany, 12-15 May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09804 2026-07-14 cs.CR cs.AI 新提交 74%

Trivial Prompt Reframing Bypasses Safety Guardrails in Googleś MedGemma-4B

简单提示重构绕过谷歌MedGemma-4B中的安全护栏

Avi-ad Avraam Buskila

机构 * Department of Information Science and Applied Artificial Intelligence, Bar-Ilan University, Ramat Gan, Israel(信息科学与应用人工智能系,巴伊兰大学,拉马特甘,以色列)

专题命中 安全评测 :safety(title);分类 cs.AI

AI总结 研究谷歌MedGemma-4B在安全护栏方面的问题,构建全因子基准测试,通过多种攻击方式和法官编码量化其表现,发现重新解释请求的框架能提高攻击成功率,且稳健性受主题主导,呼吁为开放医学模型加强部署时护栏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06111 2026-07-08 eess.SY cs.AI cs.SY 新提交 74%

LLM-Guided Measurement Credibility Correction for Trustworthy Industrial Process Inference

用于可信工业过程推理的大语言模型引导的测量可信度校正

Youcheng Zong, Runda Jia, Dakuo He

机构 * College of Information Science and Engineering, Northeastern University(信息科学与工程学院,东北大学)

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 研究工业过程推理中测量可信度问题,提出大语言模型引导的测量可信度校正方法,通过转换测量语义、构建参考并校正冲突,使预测器输入更可信,在多任务中降低误差,增加少量参数且推理时间短,提升了预测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25161 2026-06-25 cs.AI 新提交 74%

TRUSTMEM: Learning Trustworthy Memory Consolidation for LLM Agents with Long-Term Memory

TRUSTMEM:学习具有长期记忆的LLM智能体的可信记忆巩固

Tianyu Yang, Sudipta Paul, Vijay Srinivasan, Vivek Kulkarni, Srinivas Chappidi

机构 * AI Center-Mountain View, Samsung Electronics(三星电子山景城AI中心) University of Notre Dame(圣母大学)

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 提出TrustMem框架,通过记忆转换验证器评估更新过程,并利用偏好强化学习优化记忆更新行为,显著提升记忆效用和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23768 2026-06-24 cs.CR cs.AI cs.LO 新提交 74%

Cryptographic certificates of validity for trustworthy AI

可信AI的密码学有效性证书

Murdoch J. Gabbay

机构 * Heriot-Watt University(赫瑞思-瓦特大学)

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 提出为智能AI系统生成密码学有效性证书,通过将正确性条件编译为多项式约束的见证检查问题,并使用简洁密码学证明系统(可选零知识)来证明条件成立,平衡了源代码形式验证与密码学认证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06105 2026-08-07 cs.LG cs.AI cs.MA 新提交 73%

Does Latent Context Help? A Controlled Evaluation of Inverse Reinforcement Learning in Arctic Shipping

潜在上下文是否有帮助?北极航运中逆强化学习的受控评估

Vaishnav Vaidheeswaran, Dilith Jayakody, Biruk Ambaw, Jaswanth Kumar, Md Mahbub Alam, Gabriel Spadon

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过对北极航运航次的受控评估,发现非线性共享奖励模型优于线性基线,添加船舶特定潜在上下文反而降低性能,表明可观测特征已能解释行为差异,为安全关键领域的AI部署提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06020 2026-08-07 cs.AI cs.LG 新提交 73%

From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models

从经济智能体到智能体经济:经济世界模型的系统蓝图

Jiale Han, Xiang Li, Jing Qian, Wenyuan Gu, Pin Gao, Ye Luo, Hongyuan Zha, Dacheng Tao, Benyou Wang, Lin William Cong

机构 * Shenzhen Loop Area Institute(深圳河套学院) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出经济世界模型(EWM)的六级能力阶梯实施蓝图,旨在加速可作为人类决策沙箱与AI智能体基础的下一代高保真经济模拟环境开发。

Comments Project page: https://github.com/FreedomIntelligence/Awesome-Economic-World-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05439 2026-08-07 cs.AI cs.LG 新提交 73%

SCP-NL2TL: Selective Conformal Prediction with Semantic Verification for Natural Language to Temporal Logic Specifications

SCP-NL2TL:用于自然语言到时间逻辑规范的带语义验证的选择性共形预测

Yixuan Wang, Licheng Luo, Yu Fu, Kaidi Xu, Yue Dong, Mingyu Cai

机构 * University of California, Riverside(加州大学河滨分校) City University of Hong Kong(香港城市大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出SCP-NL2TL框架,结合选择性共形预测与语义验证,可生成自然语言到时间逻辑的规范并判断其可靠性,在三类逻辑上提升了翻译可靠性与鲁棒性,为可信自然语言接口提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25485 2026-07-29 cs.AI cs.CL 新提交 73%

PatientAgentBench: A Benchmark Framework for Evaluating Patient-Facing Health AI Agents

PatientAgentBench:一个用于评估面向患者的健康人工智能代理的基准框架

Korosh Vatanparvar, Ashutosh Joshi, Maria Xenochristou, Mohammad Abuzar Hashemi, Prasad Kasu, Deepak Bansal, Daniel Lopez-Martinez, Anchal Nema, Ramya Ganesan, Will Kimbrough, Alex Woody, Yadunandana Rao, Dilek Hakkani-Tur, Wilko Schulz-Mahlendorf

机构 * Amazon Health AI(亚马逊健康人工智能)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 研究面向患者的健康人工智能代理评估问题,核心方法是用PatientAgentBench框架,通过语言模型评审团在多维度评估,主要贡献是发现模型临床差距,发布可重复、经临床医生验证的评估标准助领域弥补差距。

Comments Code: https://github.com/amazon-science/PatientAgentBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24769 2026-07-29 cs.AI cs.CL 新提交 73%

LLM Scheming Inversely Scales with Pretraining Language Coverage

大语言模型的策略规划与预训练语言覆盖范围成反比

Nathan Truong, Aryan Panda, Rayming Ye, Zoe Sun, Maheep Chaudhary

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 研究前沿模型中策略规划与预训练语言覆盖范围的关系,应用Petri框架评估Qwen3-30B-A3B,发现策略规划得分与预训练语言覆盖范围成反比,低资源语言得分更高,且该影响在不同策略行为中不均一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22797 2026-07-28 cs.LG cs.AI 新提交 73%

Physically Verifiable Evidence and LLM-Based Reporting for Bearing Fault Diagnosis

基于物理可验证证据和大语言模型的轴承故障诊断报告

Yuntong Chen, Jianyu Liu, Guobin Zhao, Ziang Wang, Chao Chen, Ju Huang, Xitian Tian, Lijiang Huang

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 针对安全关键型机械系统中AI诊断的验证问题,提出诊断证据网络DENet,将输出扩展为结构化证据记录,包括分类、预测特征频率等,能检测误分类,还通过约束语言模型减少无根据声明率,提升诊断可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20379 2026-07-23 cs.AI cs.CL 新提交 73%

Train the Model, Not the Reader: Decodability Supervision for Verifiable Activation Explanations

训练模型,而非读者:可验证激活解释的可解码性监督

Hiskias Dingeto

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 研究自然语言自动编码器对隐藏激活解释评分的问题,提出RECAP等方法,能使指定内容可解码,提高解释忠实度与安全性,如在预训练模型上实现可靠探测解码,提升对真实声明评分及识别谎言能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19011 2026-07-22 cs.CL cs.AI cs.MM 新提交 73%

Computational Humor with Multimodal LLMs: Methods, Datasets, Evaluation, and Challenges

基于多模态语言模型的计算幽默:方法、数据集、评估及挑战

Tuo Liang, Zhe Hu, Disheng Liu, Jing Li, Yu Yin

机构 * Case Western Reserve University(凯斯西储大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究聚焦于单图像和多面板作品中的视觉幽默理解,通过与先前综述对比,按能力层次组织文献,综合基准设计等内容,追溯领域转变,指出进展的主要障碍包括易出现捷径的评估、文化覆盖有限等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11892 2026-07-15 cs.CL cs.AI 新提交 73%

G-SHARE: A Guideline-Based Structured Reasoning Framework for Human-Factor Event Diagnosis

G-SHARE:一种基于指南的人为因素事件诊断结构化推理框架

Xingyu Xiao, Mao Du, Jiejuan Tong, Jingang Liang, Haitao Wang

机构 * Institute of Nuclear and New Energy Technology, Tsinghua University(清华大学核能与新能源技术研究院) National Key Laboratory of Human Factors Engineering(人因工程重点实验室) Fujian Fuqing Nuclear Power Co., Ltd.(福建福清核电有限公司)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 研究针对核电站人为因素事件诊断问题,提出基于指南的结构化推理框架G-SHARE,将诊断指南转化为多阶段流程,含证据提取等步骤。通过构建数据集评估,其性能显著优于基线,证明了转化专家指南为推理流程对安全关键行业智能分析的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08773 2026-07-13 cs.AI cs.LG 新提交 73%

Interval Certifications for Multilayered Perceptrons via Lattice Traversal

通过格遍历实现多层感知器的区间认证

Merkouris Papamichail, Konstantinos Varsos, Giorgos Flouris, João Marques-Silva

机构 * University of Crete(克里特大学) Catalan Institution for Research and Advanced Studies(加泰罗尼亚研究与高级研究所) University of Lleida(莱里达大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 研究人工智能安全中对抗鲁棒性问题,通过格遍历将其转化为区间认证问题,开发格遍历算子并用于细化与验证迭代方案,保证合理最大化和完全最小化,研究了优化问题的不对称性及对称区间优化问题,还进行了实证评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06163 2026-07-08 cs.LG cs.AI 新提交 73%

X-FEMR: A Token-level Explainable Approach for Electronic Health Records Foundation Models using Transformer-based Models

X-FEMR:一种使用基于Transformer的模型对电子健康记录基础模型进行令牌级可解释的方法

Jie Huang, Pengfei Yin, Zihan Xu, Daniel Capurro, Mike Conway, Ting Dang

机构 * School of Computing and Information Systems, University of Melbourne(墨尔本大学计算与信息系统学院) Royal Melbourne Hospital(皇家墨尔本医院)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 针对电子健康记录基础模型是黑箱模型的问题,提出基于Transformer的令牌级可解释性方法,训练替代模型近似其行为,识别有影响力令牌,引入临床对齐度量,结果显示该方法能实现可解释且可信的临床人工智能。

Comments Accepted by IJCAI-ECAI 2026 AI and Health Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20023 2026-07-08 cs.SE cs.AI cs.CL 新提交 73%

When Lower Privileges Suffice: Investigating Over-Privileged Tool Selection in LLM Agents

当较低权限足够时:探究LLM代理中的过度权限工具选择

Kaiyue Yang, Yuyan Bu, Jingwei Yi, Yuchi Wang, Biyu Zhou, Juntao Dai, Songlin Hu, Yaodong Yang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Beijing Academy of Artificial Intelligence(北京人工智能研究院) The Chinese University of Hong Kong(香港中文大学) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM代理在工具选择中偏好高权限工具的安全问题,提出ToolPrivBench评估框架,发现主流代理普遍存在过度权限选择且被瞬态故障放大,并设计权限感知后训练防御方法有效减少不必要的高权限工具使用。

Comments code: https://github.com/AISafetyHub/agent-tool-selection-bias

详情

展开后加载摘要…

URL PDF HTML 收藏