arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-07 至 2026-08-07 共收录 56 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3 篇

2608.06179 2026-08-07 cs.LG 新提交 87%

SAGA: Score-Weighted Adaptive Generation Alignment for Low-Resource Nordic Language Models

SAGA:面向低资源北欧语言模型的分数加权自适应生成对齐

Hoda Fakharzadehjahromy, Emil Wiman, Andreas Bueff, Hafsteinn Einarsson, Fredrik Heintz

机构 * Linköping University(林雪平大学) University of Iceland(冰岛大学)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);分类 cs.LG

AI总结 该研究提出SAGA框架,用依存句法分析器监督取代人类偏好标注,在丹麦语、冰岛语等低资源北欧语言上提升了GPT-SW3-1.3B的语法质量,为相关语言的语法对齐提供了实用替代方案。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06377 2026-08-07 cs.CL cs.AI cs.LG 新提交 83%

Learning When to Trust via Selective Context Preference Optimization

通过选择性上下文偏好优化学习何时信任

Xian Sun, Wei Chow, Yingshuo Wang, Junhao Liu, Wei Gao, Qing Wu, Lingdong Kong

机构 * Duke University(杜克大学) National University of Singapore(新加坡国立大学) UC Berkeley(加州大学伯克利分校) UC Irvine(加州大学欧文分校) Northeastern University(东北大学) Nanyang Technological University(南洋理工大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究针对语言模型易受误导性外部信号影响的问题,提出SCOPE方法,在含四种条件的MIST基准上优化DPO目标,降低SC2W的同时保持正常上下文下的准确率,主张以选择性信任评判模型。

Comments Project Page at https://worldbench.github.io/scope GitHub Repo at https://github.com/worldbench/SCOPE HF Dataset at https://huggingface.co/datasets/worldbench/MIST-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05341 2026-08-07 cs.CV cs.LG 新提交 81%

Positive-Unlabeled Preference Optimization For Chest X-ray Report Generation

面向胸部X射线报告生成的正例-无标签偏好优化

Yuta Kobayashi, Pradyun Ramesh, Muhammad Ahmed Chaudhry, Vincent Jeanselme, Judy Wawira Gichoya, Sanmi Koyejo, Kathleen Capaccione, Shalmali Joshi

机构 * Columbia University(哥伦比亚大学) Stanford University(斯坦福大学) Emory University(埃默里大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.LG

AI总结 该研究针对放射报告生成VLM的遗漏噪声问题,提出PU-DPO框架,将未提及项视为无标签,通过对比对优化,提升病理检测率与隐藏正例恢复能力,增强对遗漏噪声的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 8 篇

2608.05409 2026-08-07 cs.CL 新提交 88%

Mood Matters: How Syntactic Sensitivity Undermines Safety Alignment

情绪很重要:句法敏感性如何破坏安全对齐

Alina Klerings, Jannik Brinkmann, Heiner Stuckenschmidt, Simone Paolo Ponzetto

机构 * University of Mannheim(曼海姆大学) Technical University Clausthal(克劳斯塔尔工业大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL

AI总结 该研究发现大型语言模型存在句法敏感性漏洞,16个700亿参数级模型可通过调控句法特征触发或抑制拒绝行为,源于开源模型后训练数据的语言偏见,增加句法多样性可缓解问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05578 2026-08-07 cs.CR 新提交 78%

Detecting Safety Training Modification in Language Models via Activation Analysis

通过激活分析检测语言模型中的安全训练修改

Glen Messenger

专题命中 安全训练 :safety(title,abstract)

AI总结 本研究提出AMS工具,通过激活空间几何结构检测语言模型的安全训练修改,在14种模型配置上验证了其有效性,可区分四类安全训练修改中的前三者。

Journal ref IEEE Access, vol. 14, pp. 91723-91737, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05158 2026-08-07 cs.CL cs.LG cs.NE 新提交 62%

Safe Evolution with Circuit Anchors

基于回路锚点的安全进化

Yan Liu, Jie Fu, Tsung-Yi Ho

机构 * Chinese University of Hong Kong(香港中文大学) IQuest Research(艾奎斯特研究院)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG

AI总结 受生物发育约束启发,提出回路锚定进化(CAE)方法,通过锚定占比不足2%的安全回路,在极小能力损失下实现更优的安全保留,性能优于显式奖励约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05732 2026-08-07 cs.LG 新提交 57%

CircuitSteer: Geometrically Aligned Multi-Layer Steering via Sparse Autoencoder Circuits

CircuitSteer:基于稀疏自编码器回路的几何对齐多层引导方法

Mehrshad Saadatinia, Parsa Razmara, Ardalan Aryashad, Ali Abbasi, Seyedarmin Azizi

机构 * University of Southern California(南加利福尼亚大学)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 CircuitSteer是利用SAEs识别多层语义回路的新型框架,通过几何对齐合成引导向量实现多点干预,在多任务多模型上,其引导效果优于牺牲流畅性或覆盖不足的对比方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05588 2026-08-07 cs.RO cs.AI cs.MA 新提交 57%

Search-Aided Joint Agent-Environment Reinforcement Learning for Robust Lifelong Multi-Agent Path Finding with Rotations

用于带旋转的鲁棒终身多智能体路径规划的搜索辅助联合智能体-环境强化学习

He Jiang, Jingtian Yan, Yulun Zhang, Yimin Tang, Tanishq Duhan, Rishi Veerapaneni, Guillaume Sartoretti, Jiaoyang Li

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 针对带旋转约束的鲁棒终身多智能体路径规划难题,提出搜索辅助联合强化学习方法,通过结合Causal PIBT与联合优化智能体-环境策略,在高密度地图及混合现实仓库环境中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05438 2026-08-07 cs.CY 新提交 57%

A Vision for the Future of an AI-Integrated Research Ecosystem

人工智能整合型研究生态系统的未来愿景

Ryan E. Dougherty, Natalie Kiesler

专题命中 安全训练 :trustworthy(abstract);分类 cs.CY

AI总结 本文探讨生成式AI渗透研究生涯后科学交流的演变,提出从管控AI转向构建溯源、校准与问责基础设施的愿景,并邀请学界参与相关对话。

Comments 4 pages, accepted to ACM AI Leadership Summit

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05391 2026-08-07 cs.AI cs.MA 新提交 57%

Adaptive Arena-based Contestable Argumentative Network-of-Experts for Open-Ended Care Plan Coordination

面向开放式护理计划协调的自适应竞技场式可争议专家论证网络

Truong Thanh Hung Nguyen, Hoang-Loc Cao, Phuc Ho, Phuc Truong Loc Nguyen, René Richard, Hung Cao

机构 * University of New Brunswick(新不伦瑞克大学) National Research Council Canada(加拿大国家研究委员会)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 针对开放式护理计划协调中单一LLM流程的不足,提出多Agent神经符号框架CANOE,经医学微调模型在相关数据集上表现出强临床正确性,且CANOE具备可解释性与人类可争议性。

Comments Accepted at the 4th International Conference on Frontiers of Artificial Intelligence, Ethics, and Multidisciplinary Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05210 2026-08-07 cs.CV cs.AI cs.CR 新提交 57%

Innocent Panels, Hateful Stories: Evaluating and Detecting Hateful Intent in Multi-Turn Visual Story Generation

无辜的面板,仇恨的故事:评估与检测多轮视觉故事生成中的仇恨意图

Ye Leng, Junjie Chu, Yiting Qu, Mingjie Li, Yun Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心) Hewlett Packard Enterprise(惠普企业)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究针对多轮视觉故事生成的组级仇恨意图问题,构建了专用评估数据集,发现现有审核系统存在漏检,提出互补防御方法,强调安全需适配视觉叙事的发展。

Comments 16 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 红队测试 1 篇

2608.05659 2026-08-07 cs.CR 新提交 71%

Breaking Customized LLMs for Coding: Automated Red Teaming for Instruction Backdoor Attacks

针对代码任务定制化大语言模型的突破:针对指令后门攻击的自动红队测试

Yuchen Chen, Wei Cheng, Yuan Xiao, Wising Sun, Chunrong Fang, Yang Liu, Zhenyu Chen, Baowen Xu

专题命中 红队测试 :red teaming(title)

AI总结 本文提出ARIA自动红队测试框架,可高效生成针对代码定制化LLM的隐蔽带后门指令,攻击成功率达0.945且规避检测能力强,性能优于现有基线攻击。

Comments Accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 3 篇

2608.05715 2026-08-07 cs.RO cs.AI 新提交 79%

Hijacking Robots with a Piece of Paper: A Systematic Study of Physical Prompt Injection in VLM-Controlled Robots

用一张纸劫持机器人:对VLM控制机器人的物理提示注入的系统研究

S. M . Bhagya P. Samarakoon, M. A. Viraj J. Muthugala, W. K. R. Sachinthana, Mohan Rajesh Elara

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 该研究针对VLM控制的分拣机器人,系统分析了四类物理提示注入攻击的成功率,发现其存在显著脆弱性,且三种简单防御措施可大幅降低风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05495 2026-08-07 cs.CR cs.HC 新提交 78%

PromptShield Home: Ambient Multimodal Prompt Injection Defense for Smart-Home Agents

PromptShield Home:面向智能家居智能体的环境多模态提示注入防御方案

He Zhang, Feilong Li, Dingning Long, Yilin Cui, Peijun Zhang, Yuewen Zhang, Qianyao Xu, Xinyi Fu

专题命中 提示注入 :prompt injection(title);safety(abstract)

AI总结 该研究针对智能家居智能体的提示注入安全问题,构建了现实场景基准测试PromptShield-Home,对比了三类防御层的性能,发现多智能体调解的上限性能最优,提出应采用学习路由与传感器融合方案保障安全。

Comments This work has been accepted as a poster to UbiComp 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05430 2026-08-07 cs.CR cs.LG 新提交 57%

Robust Context-Aware Detection of Malicious Instructions in Text

文本中恶意指令的鲁棒上下文感知检测

Buzhao Liu, Xinhang Ma, Yevgeniy Vorobeychik

专题命中 提示注入 :prompt injection(abstract);分类 cs.LG

AI总结 该研究针对LLM易受间接提示注入攻击的问题,提出上下文感知的恶意句子分类方法及两种对抗训练技术,在静态和自适应攻击下均提升了IPI防御性能,且需根据领域调整参数。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 4 篇

2608.05909 2026-08-07 cs.CR 新提交 67%

MMAligner: Safeguarding Multimodal Large Language Models through Representation Calibration

MMAligner:通过表示校准保护多模态大语言模型

Shenyi Zhang, Keyan Guo, Zihao Wang, Xuebin Li, Lingchen Zhao, Hongxin Hu, Chao Shen, Qian Wang

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract)

AI总结 MMAligner通过校准多模态大语言模型的表示,将不安全多模态输入的拒绝率提升至99%,仅造成不足2%的效用下降,显著优化了安全与效用的权衡。

Comments To Appear in the Proceedings of The ACM Conference on Computer and Communications Security (CCS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05993 2026-08-07 cs.CL 新提交 57%

Clinical Communication Processing with Models Trained on LLM-Generated Synthetic Data: A Structured Survey and Novel Application Case Studies

基于大语言模型生成的合成数据训练模型的临床通信处理:结构化综述与新型应用案例研究

Alexander Apartsin, Yehudit Aperstein

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

AI总结 本文综述用大语言模型生成的合成数据训练临床NLP系统的研究,结合13项无真实标注数据的案例,发现合成通信可支撑相关系统,微调编码器模型具竞争力,需真实数据迁移等完善。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05616 2026-08-07 cs.CV 新提交 50%

TruthLens: Object Hallucination Detection via Self-Evaluating Truthfulness Scores in LVLMs

TruthLens:通过大型视觉语言模型(LVLM)中的自评估真实性分数检测对象幻觉

Yanqi Wu, Runhe Lai, Xinhua Lu, Qichao Chen, Zhiping Zhou, Jia-Xin Zhuang, Weijiang Yu, Ruixuan Wang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Peng Cheng Laboratory(鹏城实验室) University of Nottingham Malaysia(马来西亚诺丁汉大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 TruthLens 是一种无需额外成本的 LVLM 对象幻觉检测框架,通过微调 LM 头部输出真实性分数,在 MS-COCO 数据集上的 Qwen2.5-VL-7B 上实现了超 17% 的 AUROC 提升,性能达当前最优。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05302 2026-08-07 cs.IR 新提交 50%

Cross-platform epistemic verification for improving factual reliability in AI-generated news summarization

用于提升AI生成新闻摘要事实可靠性的跨平台认知验证

Zhuo Xie, Haoze Ni

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 本研究提出多源证据共识验证(MECV)框架,通过多异构来源证据聚合与多LLM陪审团机制修正AI生成新闻摘要的幻觉,在SummEdits基准上提升了事实一致性,为可信AI与自动化新闻研究提供了新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 1 篇

2608.06265 2026-08-07 cs.AI cs.DB cs.LG 新提交 62%

Improving the Realism of Synthetic Clinical Benchmarks Under Utility Constraints

在效用约束下提升合成临床基准的真实性

Omid Bazgir, Md Nasir, Jacob Hoffman, Yang Yang, Manu Agrawal, Anusua Trivedi, Vinay Rao Dandin, Chris Gibbons, Christine Swisher

机构 * Oracle Health and Life Sciences(甲骨文健康与生命科学部门)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文针对合成临床基准的结构不真实问题,提出在不破坏下游效用检查的前提下提升其真实性的方法,通过确定性修正改善基准指标,明确需将效用作为约束而非真实性的充分证据。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 25 篇

2608.06202 2026-08-07 cs.HC cs.AI 新提交 83%

What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)

当前AI基准测试未测量的内容:模态、搜索、引用及其对安全评估的启示

Ro Encarnación, Tina Behzad, Emma Lurie, Danaé Metaxa

专题命中 安全评测 :safety(title,abstract);AI safety(abstract);分类 cs.AI

AI总结 该研究发现AI基准测试未涵盖模态、搜索等关键因素,以ChatGPT为例对比两种模态及搜索条件,发现这些因素会影响模型准确率、一致性等,主张AI安全评估需纳入这些维度。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05571 2026-08-07 cs.LG cs.IR 新提交 79%

Align-RAG: Alignment Is All You Need for TSFM In-Context Learning

Align-RAG:TSFM上下文学习的全部需求在于对齐

Mohammad Asadi, Soheil Hor, Bardiya Akhbari, Jack W. O'Sullivan, Tahoura Nedaee, Layne C. Price, Raviteja Anantha, Euan Ashley, Ehsan Adeli

机构 * Stanford University(斯坦福大学) Amazon(亚马逊公司)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 提出无需训练的Align-RAG方法,通过闭式对齐检索窗口,在冻结TSFM上提升检索增强预测性能,证明冻结TSFM可动态整合检索结果,闭式对齐可作为默认基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05560 2026-08-07 cs.CV cs.CL 新提交 79%

From Sports to Safety: Benchmarking Proactive Risk Inference in MLLMs

从运动到安全:多模态大语言模型(MLLM)主动风险推理基准测试

Jiawei Qiu, Yichen Xu, Jianzhe Ma, Mingyang Yu, Wenbin Zhu, Yang Han, Pinzheng Lv, Wenxuan Wang

机构 * School of Information, Renmin University of China(中国人民大学信息学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 该研究构建了运动主动风险推理基准SPRINT,评估发现当前MLLM危险感知率高但原因识别率低,仅具备表层主动安全能力,缺乏稳定的基于原因的早期预警。

Comments Preprints

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05238 2026-08-07 cs.LG 新提交 74%

Decoupling Perception from Description: Computation-Grounded Representation Alignment between Multivariate Time Series and Language

感知与描述解耦:多变量时间序列与语言间的计算基础表示对齐

Xinran Feng, Yi Xie, Chao Zhang, Ruikun Li, Wanyun Ling, Ziyue Li, Chenxi Liu

专题命中 安全评测 :alignment(title);分类 cs.LG

AI总结 该研究针对多模态时间序列语言对齐的三难困境,提出CGTime模型,通过计算处理感知、LLM处理描述,在多变量理解任务上优于更大的通用模型。

Comments 46 pages, 9 figures, including supplementary material. Submitted to AAAI 2027. Xinran Feng and Yi Xie contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06105 2026-08-07 cs.LG cs.AI cs.MA 新提交 73%

Does Latent Context Help? A Controlled Evaluation of Inverse Reinforcement Learning in Arctic Shipping

潜在上下文是否有帮助?北极航运中逆强化学习的受控评估

Vaishnav Vaidheeswaran, Dilith Jayakody, Biruk Ambaw, Jaswanth Kumar, Md Mahbub Alam, Gabriel Spadon

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过对北极航运航次的受控评估,发现非线性共享奖励模型优于线性基线,添加船舶特定潜在上下文反而降低性能,表明可观测特征已能解释行为差异,为安全关键领域的AI部署提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06020 2026-08-07 cs.AI cs.LG 新提交 73%

From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models

从经济智能体到智能体经济:经济世界模型的系统蓝图

Jiale Han, Xiang Li, Jing Qian, Wenyuan Gu, Pin Gao, Ye Luo, Hongyuan Zha, Dacheng Tao, Benyou Wang, Lin William Cong

机构 * Shenzhen Loop Area Institute(深圳河套学院) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出经济世界模型(EWM)的六级能力阶梯实施蓝图,旨在加速可作为人类决策沙箱与AI智能体基础的下一代高保真经济模拟环境开发。

Comments Project page: https://github.com/FreedomIntelligence/Awesome-Economic-World-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05439 2026-08-07 cs.AI cs.LG 新提交 73%

SCP-NL2TL: Selective Conformal Prediction with Semantic Verification for Natural Language to Temporal Logic Specifications

SCP-NL2TL:用于自然语言到时间逻辑规范的带语义验证的选择性共形预测

Yixuan Wang, Licheng Luo, Yu Fu, Kaidi Xu, Yue Dong, Mingyu Cai

机构 * University of California, Riverside(加州大学河滨分校) City University of Hong Kong(香港城市大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出SCP-NL2TL框架,结合选择性共形预测与语义验证,可生成自然语言到时间逻辑的规范并判断其可靠性,在三类逻辑上提升了翻译可靠性与鲁棒性,为可信自然语言接口提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06312 2026-08-07 cs.CL 新提交 70%

Benchmarking and Enhancing LLMs for Rule-Intensive Review of National Standard Documents

面向规则密集型国家标准文档评审的大语言模型基准测试与增强

Tao Wang, Qihao Yang, Rongjiao Liang, Lianghong Lin, Haitao Wang, Xinyu Cao, Tianyong Hao

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL

AI总结 该研究针对规则密集型国家标准文档评审推出首个基准GB/T-Bench,提出多智能体框架GB/T-Reviewer,实验显示其大幅缩小了LLM与专家在该任务上的能力差距,为高风险文档领域可信AI奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05810 2026-08-07 cs.AI cs.CL 新提交 62%

When Self-Evolution Backfires: Pre-Commit Gating against Skill Contamination in LLM Agents

当自进化适得其反:针对LLM智能体中技能污染的预提交门控机制

Linfang Shang, Ming Xu, Yiding Sun, Tianle Xia, Lingxiang Hu, Lan Xu, Ning Zheng

专题命中 安全评测 :harmlessness(abstract);分类 cs.CL、cs.AI

AI总结 该研究发现LLM智能体自进化会出现技能污染导致性能下降的不可逆问题,提出VaG预提交门控机制,可提升性能并实现技能池跨模型迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05695 2026-08-07 cs.AI cs.CL cs.CR 新提交 62%

DreamGuard: Efficient Runtime Guardrail for LLM Agents via Risk-Aware World Model

DreamGuard:基于风险感知世界模型的LLM智能体高效运行时护栏

Wenhao Lin, Chenyu Yu, Xingwei Lin, Sicong Cao, Xiang Chen, Lei Xue, Le Yu, Letian Sha, Chunming Wu

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM智能体运行时护栏的长视野风险盲点问题,提出基于风险感知世界模型的主动式护栏DreamGuard,经实验验证其安全-效用权衡更优且延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏