arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3278 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3278 篇

2608.03838 2026-08-05 cs.AI 新提交 57%

LatentGuard: Efficient and Inspectable Latent Reasoning for LLM Safeguards

LatentGuard:面向大语言模型安全防护的高效可检查潜在推理方法

Zhinan Liu, Jie Li, Mingyu Kang, Jiayi Ji

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 LatentGuard是将连续潜在推理引入防护模型的高效可检查框架,其8B参数版本在提升安全判定性能的同时大幅降低推理成本,还具备良好的审计效用,为可部署的LLM安全防护提供了可行路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02595 2026-08-04 cs.LG 新提交 57%

onepot-Bench 0: towards lab-aware in silico chemistry benchmarks

onepot-Bench 0:面向实验室实际场景的计算机化学基准测试

Brandon Wang, Andrei S. Tyrin, Daniil A. Boiko

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本研究推出专有基准测试onepot-Bench 0,通过三个互补评估衡量语言模型在湿实验室合成化学场景下的基础能力、可靠性等,弥补现有评估的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02446 2026-08-04 cs.IR cs.LG 新提交 57%

Advancing Relevance Measurement with Vision-Language Models for Web-Scale Search

利用视觉语言模型推进Web规模搜索的相关性测量

Han Wang, Alex Whitworth, Pak Ming Cheung, Zhenjie Zhang, Krishna Kamath, Xi Chen, Roberto Konow, Kurchi Subhra Hazra

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本研究提出基于VLM的自动化相关性评估流水线,部署于Pinterest搜索A/B实验,验证其与人工标注一致性,提升评估效率,降低MDEs,助力优化搜索体验。

Comments RecSys'26 Industry track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02101 2026-08-04 cs.CL 新提交 57%

Cross-Domain Hybrid OPD for Generalizable Search Agents

面向通用搜索智能体的跨域混合在线策略蒸馏

Hongzhan Chen, Xiaoyu Liu, Dengming Zhang, Minzhou Huang, Dongliang Xu, Jingcheng Xie, Dongxiang Fang, Bowen Qin, Minsheng Hao, Yaozong Shen, Xiaojun Quan, Mona Zhou, Haosheng Zou, Jeff Chen

机构 * Yuanbao Team, Tencent Shanghai Innovation Institute(腾讯上海研究院元宝团队)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 本研究提出基于混元3架构的元宝搜索智能体训练框架,通过跨域混合在线策略蒸馏联合优化搜索专业化与通用能力,缓解对齐损耗,在现实搜索场景中实现两者的良好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00558 2026-08-04 cs.SE cs.AI 新提交 57%

AiFlow: Token-Native Reactive Orchestration with Bounded Backpressure for Streaming LLM Applications

AiFlow:面向流式大语言模型应用的带界背压令牌原生反应式编排框架

Qunhui Zhang

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 针对现有流式LLM工作流编排的背压等管理缺陷,提出AiFlow令牌原生反应式编排模型,经实验验证可降低应用TTFPT并控制队列深度。

Comments 24 pages, 5 figures, 12 tables, 1 algorithm, and 1 code listing. Public implementation: https://github.com/ModelEngine-Group/fit-framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20449 2026-08-04 cs.CL 版本更新 57%

LM-mixup: Text Data Augmentation via Language Model based Mixup

LM-mixup:基于语言模型的混合文本数据增强方法

Zhijie Deng, Zhouan Shen, Ling Li, Yao Zhou, Zhaowei Zhu, Yanji He, Wei Wang, Jiaheng Wei

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) BIAI, ZJUT & D5Data.ai(BIAI、ZJUT及D5Data.ai)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 本文提出LM-Mixup方法,通过构建MIXTURE数据集并结合监督微调与GRPO强化学习,仅用3%的蒸馏数据即可高效增强低质量指令跟随数据,提升LLMs的指令微调效率与性能。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28826 2026-08-03 cs.LG 新提交 57%

Distilling Knowledge from Large Language Models into Lightweight Reinforcement Learning Agents for Autonomous Cyber Operations

将大型语言模型中的知识蒸馏为用于自主网络操作的轻量级强化学习智能体

Konur Tholl, François Rivest, Mariam El Mezouar, Adrian Taylor, Ranwa Al Mallah

机构 * Royal Military College of Canada(加拿大皇家军事学院) Defence Research and Development Canada(加拿大国防研究与发展部) Polytechnique Montreal(蒙特利尔理工学院)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 该研究针对自主网络操作中强化学习智能体训练不稳定的问题,通过提示工程证明80亿参数网络安全LLM性能优于基线RL智能体,再经在线策略蒸馏将其防御知识迁移至仅64910参数的轻量级RL智能体,为前沿网络安全模型的实用化提供了可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28677 2026-08-03 cs.AI 新提交 57%

Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support

现实世界临床护理中的推理:为何大型语言模型(LLM)尚不适合自主临床决策支持

Shayndhan Sivanathan, Shravan Nageswaran, Mehdi Zadem, Ryaan Sultan, Nicolas von Mallinckrodt, Max Solovyev, Alexey Matyushkin, Sumon Sadhu, Gabriele C DeLuca, Sanjeeva Jeyaretna, James Hillis, Manoj Ramachandran, Prakash Jayakumar

机构 * Atman Labs(阿特曼实验室) Oxford University Hospitals(牛津大学医院) University of Oxford(牛津大学) NIHR Oxford Biomedical Research Centre(英国国立卫生研究院牛津生物医学研究中心) Imperial College London(伦敦帝国理工学院) Technical University of Munich(慕尼黑工业大学) Massachusetts General Hospital(麻省总医院) Mass General Brigham(麻省总医院布里格姆医疗系统) Harvard Medical School(哈佛医学院) Barts Health NHS Trust(巴特保健国民保健信托基金会) the University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文指出,尽管LLM在医学考试和部分病例推理上表现出色,但因存在信息收集缺陷等问题,尚不适合用于无医生参与的自主临床分诊。

Comments 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30544 2026-08-03 cs.AI 版本更新 57%

Latent Actions from Factorized Transition Effects under Agent Ambiguity

基于因子化转移效应的潜在动作在智能体模糊性下的研究

Heejeong Nam, Chandradithya S Jonnalagadda, Harshit Aggarwal, Eric Xu, Randall Balestriero

机构 * Brown University(布朗大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 针对多物体或干扰场景中动作源模糊问题,提出观测转移因子化(OTF)方法,将转移分解为稀疏的观测转移基元,并构建OTF-LAM模型,在逆向前向动力学框架下抽象出动作潜变量,实现零样本迁移和下游策略学习。

Comments Project Page: https://hazel-heejeong-nam.github.io/LAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28520 2026-07-31 cs.GT cs.AI cs.MA 新提交 57%

Agents That Certify Their Own Exploits: Confidence-Scheduled Restricted Responses for Safe Opponent Exploitation

可证明自身利用行为的智能体:用于安全利用对手的置信度调度受限响应

Boning Li, Longbo Huang

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 该研究提出CS-RNR方法,通过置信序列跟踪对手行动频率,生成可自我审计的安全利用策略,在Leduc等博弈中实现远超基准的收益且符合预算要求。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28187 2026-07-31 cs.AI cs.CR cs.SE 新提交 57%

Old Tricks, New Models: How Simple Image Transformations Break Modern AI-based Content Moderation

旧技巧,新模型:简单图像变换如何破解基于现代AI的内容审核

Marco Alecci, Francesco Marchiori, Iyiola Emmanuel Olatunji, Tegawendé F. Bissyandé, Jacques Klein

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 该研究通过黑盒评估发现,商用多模态图像审核API可被简单图像变换绕过,且不同服务稳健性差异大,表明这类API无法单独作为可靠安全过滤器,需结合分层审核管道部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26200 2026-07-30 cs.CL 新提交 57%

Choosing Where and How to Moderate: End-to-End Trade-offs in Filter Placement and Response Rewriting

选择 moderation 的位置与方式:过滤点与响应重写的端到端权衡

Mengya Hu, Susie Park, Suzana Ilic, Qiong Wei, Sandeep Atluri, Myra Deng, Tucker Fross, Curt Tigges

机构 * Microsoft Responsible AI(微软负责任人工智能部门) Goodfire(古德法尔公司)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 该研究针对内容审核部署中的过滤点与响应方式,对比不同方案的有用性、有害暴露等指标,发现响应重写可平衡流量恢复与安全,支持按部署约束选择审核配置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13097 2026-07-30 cs.PL cs.AI 版本更新 57%

Functional Cache Grafting: Robust and Rapid Code-Policy Synthesis for Embodied Agents

功能缓存嫁接:具身智能体的鲁棒且快速代码策略合成

Saehun Chun, Wonje Choi, Sera Choi, Sanghyun Ahn, Honguk Woo

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出FCGraft框架,通过维护函数级验证代码骨架及其键值缓存,对新任务进行缓存嫁接(拼接和修补),减少预填充计算并复用验证结构,实现更鲁棒和快速的策略合成。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24898 2026-07-29 cs.CV cs.AI 新提交 57%

Harm is not Universal: Community-Specific Toxicity Detection is Urgently Needed

危害并非普遍存在:迫切需要针对特定社区的毒性检测

Xinnuo Xu, Anja Thieme, Daniela Massiceti, Ioana Tanase, Rita Marques, Melanie Fernandez Pradier, Martin Grayson, Camilla Longden, Cecily Morrison

机构 * Microsoft Research Cambridge, UK(英国剑桥微软研究院) Microsoft Paris, France(法国巴黎微软)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究指出文本到图像生成的通用毒性检测方法不能保护边缘化社区,主张特定社区毒性检测(CTD)。通过与专家合作制定指南,利用图像数据集实验表明现有模型表现不佳,基于提示的方法和参数高效微调可提升性能,但CTD性能仍远低于通用检测,需持续研究。

Comments 18 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24893 2026-07-29 cs.CR cs.AI 新提交 57%

Early Detection of Distributed Backdoors in Multi-Agent LLM Systems: A Characterization Study

多智能体大语言模型系统中分布式后门的早期检测:一项特征研究

Diego Fernandez Arias, Dev Prashant Mistry, Ren Wang, Yibo Hu

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究多智能体大语言模型系统中分布式后门早期检测,构建分层多智能体系统实例,通过记录片段注入及载荷组装执行时间来检测。前缀检测器能较早标记多数成功攻击,部分检测器依赖表面线索,微调模型可减少线索去除后的损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24789 2026-07-29 cs.IR cs.CV cs.LG cs.MM 新提交 57%

NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model

NEXT:通过视觉语言模型进行推理驱动的视频推荐

Yuming Liu, Hongye Yang, Harrison Zhao, Ellie Zhu, Bokai Cao, Lei Huang, Lizhu Zhang, Xiangjun Fan

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 研究提出推理驱动的视频推荐框架NEXT,通过对用户已观看视频推理推断其下一个意图来检索后续视频。训练NEXT-8B视觉语言模型,在DocVQA性能上表现出色,在特定评估中提升下一个意图逻辑质量,部署后带来生产收益,证明其可作为实用推理引擎。

Comments 13 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24672 2026-07-28 cs.LG 新提交 57%

Explainable Reinforcement Learning via Physics-Aware Policy Distillation

通过物理感知策略蒸馏实现可解释强化学习

Shaker Al-Tamari, Waled Kadour

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 研究针对安全关键领域中深度强化学习的黑箱问题,利用策略蒸馏框架,以高性能TD3为教师模型,基于浅层决策树生成可解释学生代理,通过特定方法生成数据集,实现性能与教师相当并保持系统稳定性和可解释性。

Comments 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24625 2026-07-28 cs.CR cs.AI 新提交 57%

Agentic Permissions Policy Algebra for Taint Confinement in LLM Agents

用于大语言模型代理中污点限制的代理权限策略代数

Arseny Kravchenko, Vadim Liventsev, Innokentii Konstantinov, Ildar Iskhakov, Matvey Kukuy

专题命中 安全训练 :prompt injection(abstract);分类 cs.AI

AI总结 研究大语言模型代理处理混合机密数据时的安全风险,提出APPA框架,通过引擎管理上下文分支等解决可用性瓶颈,经双幺半群模型证明相关特性,实验表明其能抑制数据泄露并恢复部分被污点跟踪损失的效用。

Comments Preprint. Submitted to the 19th ACM Workshop on Artificial Intelligence and Security (AISec '26). 10 pages, 2 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24057 2026-07-28 cs.LG 新提交 57%

Constrained Reinforcement Learning Using Successor Representations

使用后继表示的约束强化学习

Michael Girstl, Alexander Mattick, Christopher Mutschler

机构 * Technical University of Darmstadt (TU Darmstadt)(达姆施塔特工业大学) Hessian Center for Artificial Intelligence (hessian.AI)(黑森州人工智能中心) Fraunhofer Institute for Integrated Circuits IIS, Fraunhofer IIS(弗劳恩霍夫集成电路研究所IIS) University of Technology Nuremberg (UTN)(纽伦堡工业大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 研究针对现实世界强化学习中策略难适应成本函数变化的问题,提出SafeDSR方法,通过引入可学习权重矩阵扩展深度后继表示到约束强化学习,能快速重训策略,在二维导航环境展示竞争力与灵活性。

Comments published in Transactions for Machine Learning Research 2026

Journal ref Michael Girstl, Alexander Mattick, & Christopher Mutschler (2026). Constrained Reinforcement Learning Using Successor Representations. Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23336 2026-07-28 cs.CY 新提交 57%

Constitutional governance for societies of AI agents in the built environment: a research agenda

建筑环境中人工智能代理社会的宪法治理:一项研究议程

Ali Ghoroghi

专题命中 安全训练 :safety(abstract);分类 cs.CY

AI总结 本文针对建筑环境中人工智能代理社会的治理提出研究议程,围绕深度不确定性下改造的机制设计、建筑运营中代理的物理信息验证、冲击下城市基础设施的抗脆弱协调三个问题,借鉴多代理系统研究成果,阐述基础、识别问题并概述相关要求。

Comments 23 pages, 2 figures. Supplementary material is included in the same PDF

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22611 2026-07-28 cs.AI cs.CR cs.ET cs.MA 新提交 57%

Decentralized Granular Access Control for Agentic AI Systems in Critical Infrastructure

关键基础设施中智能体人工智能系统的去中心化粒度访问控制

Arun Malik, Deepal Jayasinghe, Bradley Klemick, Prachi Shah, Nitish Talasu, Vineet Tushar Trivedi

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究关键基础设施中智能体人工智能系统的安全挑战,提出去中心化多层访问控制架构,含复合身份模型等四项创新,基于OWASP威胁分类法设计,经云提供商生产验证,能有效实施粒度访问控制并防止特权升级。

Comments 7 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23617 2026-07-28 cs.LG math.OC 新提交 57%

Optimal Reward Shaping: Autonomous Car Parking Case Study

最优奖励塑造:自动驾驶汽车停车案例研究

Emre Özkaya, Nicolas R. Gauger

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 研究非完整约束下无模型强化学习奖励函数设计难题,提出含覆盖门控对齐反馈等的参数化奖励塑造框架,通过联合元优化及基于代理的贝叶斯优化,优化后的深度Q网络代理在停车任务中表现出色。

Comments 12 pages, 8 figures. Includes supplementary video demonstration and open-source code link

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25582 2026-07-27 cs.LG 版本更新 57%

Safe In-Context Reinforcement Learning

安全的上下文强化学习

Amir Moeini, Minjae Kwon, Alper Kamil Bozkurt, Yuichi Motai, Rohan Chandra, Lu Feng, Shangtong Zhang

机构 * University of Virginia(弗吉尼亚大学) Virginia Commonwealth University(弗吉尼亚 Commonwealth 大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 提出SCARED方法,在无参数更新的上下文强化学习适应过程中,通过精确惩罚对偶法在约束马尔可夫决策过程框架下保证安全,实现奖励最大化与成本约束。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21401 2026-07-24 cs.CV cs.AI 新提交 57%

When Are Reasoning-Based Guardrails Not Efficient? ResponseGuard: A Fast Vision-Language Guard for Real-Time Moderation

基于推理的防护栏何时效率不高?ResponseGuard:用于实时审核的快速视觉语言防护工具

Dongbin Na

机构 * POSTECH(浦项科技大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究视觉语言防护栏筛查回复是否需推理,提出无链式推理的ResponseGuard,通过对请求、回复和图像的单一合并表示一次前向传递读取有害裁决,在回复有害性检测上优于基于推理的防护栏,且时间成本低,还发现了差距原因及推理防护栏注意力问题。

Comments 8 pages, 6 figures, 3 tables. Project page: https://ndb796.github.io/ResponseGuard ; Code: https://github.com/ndb796/ResponseGuard

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20982 2026-07-24 cs.AI 新提交 57%

GuardianAgentBench: Where Agents Fail and How to Guard Them

GuardianAgentBench:智能体何处失败及如何防范

Vishal Ishwar Naik, Chenyu Xu, Donna Dong, Hussein Hassan, Abhishek Pradhan, Ofer Mendelevitch, Tallat Shafat, Humayun Irshad

机构 * Vectara, Inc.(Vectara公司) Anthropic(Anthropic公司) OpenAI(OpenAI公司) Google DeepMind(谷歌DeepMind) DeepSeek-AI(DeepSeek人工智能公司)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究大语言模型智能体安全可靠行为问题,提出GuardianAgentBench基准测试,含多阶段验证和攻击模式。实验发现模型有两种失败模式,性能随工具集和轮次深度下降。护栏实现优于系统提示防御,证明执行时结构干预可提升安全性且不影响正确行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20547 2026-07-24 cs.LG 新提交 57%

Conflict Resolution under Degraded Surveillance in Air Corridors Using Multi-Agent Reinforcement Learning

使用多智能体强化学习解决空中走廊降级监视下的冲突

Esrat Farhana Dulia, Syed Arbab Mohd Shihab, Caleb Adams, Ruben Del Rosario

机构 * College of Aeronautics and Engineering(航空与工程学院) Center for Advanced Air Mobility(先进空中交通中心)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 研究针对空中走廊降级监视下的冲突解决问题,开发基于深度Q网络的多智能体强化学习框架,为两类飞机训练策略,经模拟评估策略效果,揭示安全与走廊容量权衡,支持相关冲突解决策略评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20488 2026-07-24 cs.AI 新提交 57%

Autonomous Topology Mutation: Safe Runtime Restructuring for Multi-Agent LLM Systems with Capability, State, and Shadow Invariants

自主拓扑变异:具有能力、状态和影子不变量的多智能体大语言模型系统的安全运行时重组

Bronislav Sidik, Chaya Levi, Nizzan Kimhi

机构 * Toga Networks (Huawei)(托加网络(华为))

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究多智能体大语言模型系统运行时无自我重组机制的问题,提出自主拓扑变异(ATM)机制,结合遥测驱动过载检测与安全不变量,经实验验证可提升任务成功率、减少隐私内存暴露并降低延迟,且相关内容已开源。

Comments 9 pages, 5 tables. Code and benchmark harness available at https://github.com/sidikbro/jiuwen_atm

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20472 2026-07-24 cs.AI 新提交 57%

Robust Critics: Defending LLMs Against Multi-Turn Attacks

鲁棒评论家:防御大语言模型免受多轮攻击

Roman Belaire, Arunesh Sinha, Pradeep Varakantham

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究针对大语言模型在多轮攻击下的安全问题,提出对话评论家引导采样(DCGS)框架,通过推断用户意图、建模为马尔可夫决策过程并学习价值和遗憾评论家来生成回复,在多个数据集上评估优于基线和前沿模型,还能迁移提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20674 2026-07-24 cs.LG cs.SY eess.SY math.OC 新提交 57%

End-to-End Learning of Safe Optimal Feedback Control in High Dimensions with Control Barrier Function Layers

基于控制障碍函数层的高维安全最优反馈控制的端到端学习

Xingjian Li, Kelvin Kan, Deepanshu Verma, Krishna Kumar, Stanley Osher, Samy Wu Fung

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 研究在硬安全约束下高维半全局反馈控制器的学习问题,结合算子分裂与无雅可比反向传播方法,实现可扩展端到端训练并保持安全保证,证明该方法在高维多智能体非线性控制问题上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11346 2026-07-24 cs.AI cs.PL 版本更新 57%

Compile, Then Page: Executable SOP Programs and a Capability-Gated Runtime for Procedural LLM Agents

编译,然后分页:用于过程性语言模型代理的可执行标准操作程序和能力门控运行时

Chenglin Yu, Li Yin, Qingxin Fan, Ying Yu, RunyangRay Zhong, Ming Li

机构 * The Hong Kong Polytechnic University(香港理工大学) The University of Hong Kong(香港大学) Zhejiang Normal University(浙江师范大学) Research Institute for Generative AI, The Hong Kong Polytechnic University(香港理工大学生成式人工智能研究所)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究针对企业代理遵循SOP的问题,将SOP约束编译成可执行伪代码,用程序引导堆栈机运行,通过实验表明编译文本有益,运行时指导受能力门控,给出编译后经模型级纪律检查再启用活动框架分页的实际指导。

Comments 9 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏