arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3278 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3278 篇

2607.20345 2026-07-23 cs.RO cs.AI 新提交 57%

Closing the Lab-to-Store Gap: A Data-Efficient Post-Training and Experience-Driven Learning VLA Framework for Retail Humanoids

弥合实验室与商店之间的差距:一种用于零售类人机器人的数据高效训练后及经验驱动学习的VLA框架

Roger Sala Sisó, Tiago Silvério, Jakob Sand, Tran Nguyen Le

机构 * HIVE Robots(蜂巢机器人公司) Technical University of Denmark(丹麦技术大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 研究针对VLA类人机器人弥合实验室与实际应用差距的问题,提出DEED系统级方法,含数据高效训练后管道、经验驱动细化研究及潜在空间分析工具,经实验证明精心设计数据和训练后处理可解决该问题。

Comments 8 pages. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20327 2026-07-23 cs.CL 新提交 57%

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference

PyroDash:具有成本效益的令牌级小语言模型与大语言模型协作推理

Niqi Lyu, Pengtao Shi, Wei Qiu, Jianlin Zhong, Sicong Xia, Jianyao Ma, Yicheng Ding

机构 * Pyromind Dynamics Inc.(Pyromind动力学公司)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 研究针对大语言模型推理成本高、小语言模型可靠性低的问题,提出PyroDash框架,通过令牌级协作推理,分三阶段训练小语言模型,在数学推理基准测试中能支持不同操作点,可减少大语言模型使用并保持推理性能。

Comments 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20005 2026-07-23 cs.AI 新提交 57%

Safe Remediation as Risk-Constrained Intervention Decision in Microservice Systems

作为微服务系统中风险约束干预决策的安全修复

Chengxiao Dai, Zhaokun Yan, Chenjun Lei, Qiao Li, Luyan Zhang

机构 * School of Computer Science, University of Sydney(悉尼大学计算机科学学院) Khoury College of Computer Sciences, Northeastern University(美国东北大学库里计算机科学学院) School of Computation, Information and Technology, Technical University of Munich(慕尼黑工业大学计算、信息与技术学院) College of Business and Economics, Australian National University(澳大利亚国立大学商业与经济学院) School of Computer Science and Technology, Fujian Normal University(福建师范大学计算机科学与技术学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究微服务系统中安全修复问题,将其转化为风险约束干预决策问题并构建约束马尔可夫决策过程,引入三维风险分解和上下文自适应人在回路门,通过实验验证该框架能降低错误修复率、提高修复成功率并减轻值班升级负载。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19351 2026-07-23 cs.AI 新提交 57%

OpenEvoShield: Dual Non-Stationary Continual Defense for Open-World Multi-Agent System Attacks

OpenEvoShield:面向开放世界多智能体系统攻击的双重非平稳持续防御

Litian Zhang, Chaozhuo Li, Yuting Zhang, Zejian Chen, Bingyu Yan, Qiwei Ye

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北京航空航天大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 针对LLM-MAS中对手通过通信注入恶意指令的双重动态攻击,提出OpenEvoShield持续防御框架,含不对称速率控制器等组件,实验表明其在多基准和拓扑上优于基线,能检测多数未见攻击且误报率低。

Comments 29 pages, 5 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05865 2026-07-23 cs.CV cs.AI cs.CR 版本更新 57%

CGCE: Classifier-Guided Concept Erasure in Generative Models

CGCE:生成模型中的分类器引导概念擦除

Viet Nguyen, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究针对生成模型不安全内容生成的问题,提出分类器引导概念擦除(CGCE)框架。该框架用轻量级分类器检测并细化不良概念提示,仅在推理时修改不安全嵌入,能防止有害内容生成,在安全性和性能间取得平衡,实验验证其有效性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18359 2026-07-22 cs.MA cs.LG 新提交 57%

Decentralized Multi-agent Reinforcement Learning for Resilient Critical Infrastructures

用于弹性关键基础设施的去中心化多智能体强化学习

Minghui Ding, Evangelos Pournaras

机构 * School of Computer Science, University of Leeds(利兹大学计算机科学学院) School of Energy Systems, LUT University(卢特大学能源系统学院)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 研究用于弹性关键基础设施的去中心化多智能体强化学习,基于对其特性与基础设施要求的分析,指出信用分配和通信是实际可行的核心条件,提出包含结构、因果、弹性感知信用分配及相关通信等的研究议程,为弹性关键基础设施构建有条件的基础。

Comments Accepted at the 2026 IEEE International Conference on Autonomic Computing and Self-Organizing Systems (ACSOS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18268 2026-07-22 cs.AI 新提交 57%

Fence: Specialized SLM Guardrails for LLM Applications

Fence:用于大语言模型应用的专用小型语言模型护栏

Kumud Lakara, Ruibo Shi, Fran Silavong

机构 * JPMorgan(摩根大通)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究使用闭源大语言模型的实际应用的安全措施问题,提出用在合成数据上训练的小型语言模型作专用护栏,引入受GAN启发的合成数据生成方法,实验证明该方法训练的护栏比基于提示的性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23381 2026-07-22 cs.CL 版本更新 57%

Guard Vector: Beyond English LLM Guardrails with Task-Vector Composition and Streaming-Aware Prefix SFT

Guard Vector:通过任务向量合成和流感知前缀监督微调超越英语大语言模型护栏

Wonhyuk Lee, Youngchol Kim, Yunjin Park, Junhyung Moon, Dongyoung Jeong, Wanjin Park

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 研究提出Guard Vector安全任务向量,通过与目标语言模型合成及流感知方法调整得到TGM,能提升分类质量、实现语言扩展和模型可移植性,前缀SFT保持流环境下分类质量,单令牌输出设计提高效率,有助于构建更负责的AI生态系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18069 2026-07-21 cs.AR cs.LG 新提交 57%

Hardware Mechanisms to Dynamically Throttle AI Performance

动态限制人工智能性能的硬件机制

Haiyue Ma, Lauren Malek, Joseph Forzani, David Wentzlaff

机构 * Princeton University(普林斯顿大学) Princeton University Electrical(普林斯顿大学电子与计算机工程)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 研究在人工智能模型集成到关键系统时缺乏意图控制的问题,提出用微架构旋钮动态控制硬件资源限制AI性能,评估候选旋钮并构建机制,展示其高性能敏感度等优势及多旋钮组合效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17575 2026-07-21 cs.AI 新提交 57%

A Dual-Hypothesis Reasoning Framework for LLM Guardrails

一种用于大语言模型护栏的双假设推理框架

Md Asiful Islam, Mihai Surdeanu

机构 * University of Arizona(亚利桑那大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 该研究提出ARBITER大语言模型护栏框架,采用双假设推理和多组件监督微调方法,用成本效益高的策略生成推理痕迹及基于LoRA微调,性能超现有方法,还能为不安全决策提供解释,在安全审核基准实验中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17225 2026-07-21 cs.SE cs.AI 新提交 57%

Specifying the Delegated-Autonomy Boundary: Requirements Engineering for Agentic AI

指定委托自治边界:智能体人工智能的需求工程

Chetan Arora, Andreas Vogelsang, Abbi Sharma

机构 * Faculty of IT, Monash University(莫纳什大学信息科技学院) University of Duisburg-Essen(杜伊斯堡-埃森大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究智能体人工智能系统带来的需求工程问题,提出机构理由记录和智能体委托策略两个互补工件,通过分级建模权限,以医院出院协调智能体和自动代码审查智能体为例阐释框架,解决委托自治边界相关需求工程问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08879 2026-07-21 cs.CL 版本更新 57%

GRASP: Grounded CoT Reasoning with Dual-Stage Optimization for Multimodal Sarcasm Target Identification

GRASP:基于双阶段优化的 grounded CoT 推理用于多模态讽刺目标识别

Faxian Wan, Xiaocui Yang, Yifan Cao, Shi Feng, Daling Wang, Yifei Zhang

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 GRASP通过整合视觉定位与显式Co-T推理,解决多模态讽刺目标识别中的细粒度定位问题,提出MSTI-MAX数据集和双阶段联合优化策略,实验表明其在多模态讽刺目标识别中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15942 2026-07-20 cs.CV cs.LG 新提交 57%

More with Less: a Large Scale Remote Sensing VLM with a Simple Recipe

以少胜多:一种简单方法构建的大规模遥感视觉语言模型

Stefan Maria Ailuro, Mario Markov, Mohammad Mahdi, Luc Van Gool, Danda Pani Paudel

机构 * INSAIT, Sofia University “St. Kliment Ohridski”(索非亚大学“圣克莱门特·奥赫里德斯基”信息与自动化研究所)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 研究针对遥感视觉语言模型,质疑架构专业化必要性,提出通用模型经大规模跨数据和任务训练可获好性能。核心方法是用单一语言策略及多任务强化学习框架训练。主要贡献是在多基准测试中取得竞争力结果,证明数据规模更关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15738 2026-07-20 cs.CY 新提交 57%

EduGuard: A Safe RAG-Based LLM Tutor for Programming Education

EduGuard:一种用于编程教育的基于安全检索增强生成的语言模型导师

S M Asif Hossain, Ruksat Khan Shayoni, M. F. Mridha, Jungpil Shin

专题命中 安全训练 :alignment(abstract);分类 cs.CY

AI总结 研究针对学生使用GenAI进行编程学习时的问题,提出EduGuard安全RAG辅导框架,集成多种功能。通过构建基准测试并与强基线比较,在正确性、基础等方面表现最佳,能提升准确率并降低过度依赖,证明安全GenAI辅导需多方面保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15367 2026-07-20 cs.AI 新提交 57%

AnovaX: A Local, Multi-Agent Voice Assistant with LLM Planning, Typed Executors, and Adaptive Recovery

AnovaX:一个具有大语言模型规划、类型化执行器和自适应恢复功能的本地多智能体语音助手

Raunak B Sinha

机构 * BITS Pilani(贝拉理工学院皮拉尼分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究桌面语音助手局限,提出AnovaX本地多智能体语音助手,通过Python进程连接多组件,含规划器、安全层等,各工具对应专用智能体类,有递归元智能体及自适应恢复循环,还介绍配套服务器功能,展示其独特优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22204 2026-07-20 cs.RO cs.AI 版本更新 57%

Human-Inspired Neuro-Symbolic World Modeling and Logic Reasoning for Interpretable Safe UAV Landing Site Assessment

受人类启发的神经符号世界建模与逻辑推理用于可解释的安全无人机着陆点评估

Weixian Qian, Tianyi Yang, Sebastian Schroder, Yao Deng, Jiaohong Yao, Xiao Cheng, Richard Han, Xi Zheng

机构 * Macquarie University(麦考瑞大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 NeuroSymLand通过结合神经符号方法,实现了可解释的安全无人机着陆点评估,优于现有基线方法。

Comments The paper has a major update, which is uploaded to https://arxiv.org/abs/2607.02277

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12548 2026-07-17 cs.LG 版本更新 57%

Human-In-The-Loop Machine Learning for Safe and Ethical Autonomous Vehicles: Principles, Challenges, and Opportunities

用于安全且符合道德的自动驾驶车辆的人在回路机器学习:原理、挑战与机遇

Yousef Emami, Mohammadhossein Homaei, Miguel Gutiérrez Gaitán, Luis Almeida, Kai Li, Hui Huang, Zhu Han

机构 * IEEE

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文针对自动驾驶车辆面临的挑战,对人在回路机器学习进行教程式综述,涵盖课程学习、人在回路强化学习、人在回路大语言模型、主动学习等方法及道德原则,以推动安全且符合道德的自动驾驶发展。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14046 2026-07-16 cs.AI 新提交 57%

Earthquaker-AI: A Retrieval-Augmented Generation Framework with Rubric-Based Assessment for Primary School Earthquake Education

地震人工智能:一种基于评分标准评估的小学地震教育检索增强生成框架

Xanthi Kokkinou, Chaido Mizeli, Nafsika Koulaxidou, Marina Delianidi, Konstantinos Diamantaras

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究针对小学生地震教育问题,提出地震人工智能混合教育框架,集成检索增强生成对话式AI助手,结合乐高机器人、评分标准和AI,通过不同年级的渐进学习提升学生地震应对能力,实验显示有高可信度和准确性。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12784 2026-07-15 cs.RO cs.LG 新提交 57%

Directional Constraints for Efficient Exploration in Safe Reinforcement Learning

安全强化学习中高效探索的方向约束

Paolo Magliano, Puze Liu, Jan Peters, Davide Tateo, Raffaello Camoriano

机构 * Dipartimento di Automatica e Informatica, Politecnico di Torino(自动控制与信息工程系,都灵理工大学) Tongji University, Shanghai Research Institute for Intelligent Autonomous Systems(同济大学,上海智能自主系统研究院) German Research Center for AI (DFKI)(德国人工智能研究中心(DFKI)) Intelligent Autonomous Systems Group, TU Darmstadt(智能自主系统组,达姆施塔特工业大学) Lund University(隆德大学) Istituto Italiano di Tecnologia(意大利技术研究院)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 针对安全强化学习中约束学习降低速度和性能的问题,提出扩展ATACOM框架的ATACOM-DC方法,通过引入方向约束区分动作,改善安全与性能权衡,在模拟机器人控制任务中评估,分析约束违反成本和任务性能。

Comments This paper has been accepted for publication at the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Pittsburgh, USA, 2026. 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11906 2026-07-15 cs.AI 新提交 57%

In-Context Reinforcement Learning under Non-Stationarity: A Survey

非平稳性下的上下文强化学习:一项综述

A Run, Ziluo Ding

机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 该综述围绕非平稳性下的上下文强化学习展开,探讨预训练或微调决策模型在交互中推断规则改善行为的能力。将其定义为策略固定时通过上下文适应问题,关联多种相关技术,并从变化内容、展开方式及智能体可观察性三方面组织文献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11226 2026-07-14 cs.AI 新提交 57%

Heterogeneous Agent Cohorts for Safe Open-Ended Exploration with Runtime Constraint Memory

用于安全开放式探索的异构智能体群组及运行时约束记忆

Tengjiao Liu

机构 * Google DeepMind(谷歌DeepMind)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究针对语言模型智能体安全与探索困境,提出将关注点分离到专门角色,通过蒙特卡洛树搜索编译失败为‘伤疤’约束补丁,在空间语义沙盒实验中,该方法能到达远程目标、防止违规、减少令牌消耗,还能在资源约束下降低成本。

Comments 12 pages, 1 figure, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11012 2026-07-14 cs.CL 新提交 57%

EasyOPD: An Easy-to-use On-Policy Distillation Framework for Large Language Models

EasyOPD:一种易于使用的大语言模型在线策略蒸馏框架

Jie Sun, Mao Zheng, Mingyang Song, Qiyong Zhong, Gengsheng Li, Zhepei Hong, Chang Wu, Pengfei Liu, Junfeng Fang, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Tencent(腾讯) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 研究针对传统语言模型蒸馏问题,提出基于verl构建的EasyOPD框架,分离用户配置等,为三种OPD设置实例化方法,经多基准测试,其实现可通过同一后端执行,还发布了相关配置、文档及演示包。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30616 2026-07-14 cs.CL 版本更新 57%

Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent

扩展视野而非参数:以35B智能体达到万亿参数性能

Lei Bai, Zongsheng Cao, Yang Chen, Zhiyao Cui, Shangheng Du, Yue Fan, Shiyang Feng, Zijie Guo, Haonan He, Liang He, Xiaohan He, Shuyue Hu, Yusong Hu, Songtao Huang, Yichen Jiang, Hao Li, Xin Li, Dahua Lin, Weihao Lin, Fenghua Ling, Dongrui Liu, Zhuo Liu, Wenjie Lou, Runmin Ma, Chunjiang Mu, Haoyang Peng, Tianshuo Peng, Jinxin Shi, Luohe Shi, Boyuan Sun, Zelin Tan, Shengji Tang, Yan Teng, Qianyi Wang, Xiaosong Wang, Yiming Wu, Yi Xie, Xiangchao Yan, Jingqi Ye, Peng Ye, Fangchen Yu, Jiakang Yuan, Bihao Zhan, Bo Zhang, Chen Zhang, Shufei Zhang, Shuaiyu Zhang, Wenlong Zhang, Yiqun Zhang, Junpeng Zhao, Zhijie Zhong, Bowen Zhou, Yuhao Zhou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 提出35B混合专家智能体模型Agents-A1,通过扩展智能体视野(长程轨迹与异构能力)达到万亿参数级别性能,采用三阶段训练(全领域微调、领域教师模型、多教师领域路由策略蒸馏)在多个长程基准上取得领先或竞争力结果。

Comments The model checkpoints and evaluation codebase are available at https://huggingface.co/collections/InternScience/agents-a1 and https://github.com/InternScience/Agents-A1

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04277 2026-07-14 cs.RO cs.AI 版本更新 57%

VehAnchor: Metadata-Free Metric Scale Recovery from Vehicle Cues in Aerial Imagery

VANGUARD:用于GPS受限环境下的无人机车辆锚定地面采样距离估计

Yifei Chen, Chenqian Le, Jiayi Cheng, Xupeng Chen

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) Tandon School of Engineering, New York University(纽约大学工学院) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 VANGUARD通过利用车辆锚点和核密度估计,为无人机在GPS受限环境中提供可靠地面采样距离估计,降低空间推理中的误差和失败率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09156 2026-07-13 cs.LG 新提交 57%

Present but Rescaled: Chat-to-Agent Transfer of Additive Activation Steering

存在但重新缩放:加法激活引导的聊天到智能体的转移

Lucas Pinto

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 研究加法激活引导从聊天到智能体的转移,通过匹配信息设计进行研究,发现转移真实但重新缩放,确定了加法特定机制,定位了重新缩放位置,指出智能体部署对引导拒绝绕过影响不可预测。

Comments 12 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14130 2026-07-13 cs.LG cs.MA 新提交 57%

Contract-Based Compositional Shielding for Safe Multi-Agent Reinforcement Learning

基于合约的组合屏蔽实现安全多智能体强化学习

Omar Adalat, Edwin Hamel-De le Court, Francesco Belardinelli

机构 * Imperial College London(伦敦帝国学院) University of Manchester(曼彻斯特大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 提出一种去中心化屏蔽方法,通过合约机制协调智能体局部LTL安全义务,在无集中运行时控制下保证全局安全并优化团队奖励。

Comments Accepted to EUMAS 2026, the 23rd European Conference on Multi-Agent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02966 2026-07-10 cs.CL 新提交 57%

Distill Where the Student Goes: Teacher-Regularized RL for English-Evidence Cross-Lingual RAG

提炼学生的走向:用于英语-证据跨语言检索增强生成的教师正则化强化学习

Haotian Zhou, Weiran Huang, Siqi Liu, Xiting Wang, Xin Zhang, Zhihao Wen

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系) Ant International, Ant Group(蚂蚁集团蚂蚁国际) Shanghai Innovation Institute(上海创新研究院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 研究英语证据跨语言检索增强生成中的问题,提出教师正则化强化学习方法TR-RAG,结合奖励优化与策略内蒸馏,引入奖励分解,在多基准测试中提升语言依从性和证据正确性。

Comments 42 pages, 19 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07397 2026-07-09 cs.AI cs.DB 新提交 57%

Agentic Data Environments

智能体数据环境

Elaine Ang, Chenxi Huang, Georgios Liargkovas, Jerry Liu, Jinhui Liu, Nikos Pagonas, Charlie Summers, Haonan Wang, Jiakai Xu, Tianle Zhou, Yusen Zhang, Zhou Yu, Zhuo Zhang, Tianyi Peng, Kostis Kaffes, Eugene Wu

机构 * Columbia University(哥伦比亚大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 探讨智能体数据环境,其作为智能体运行的执行基础,既能增强智能体能力又保障安全。该环境拓宽了智能体运行的数据范围,改变了对数据系统的传统认知,有望在提升智能体效能同时控制故障成本。

Journal ref IEEE Data Bulletin Vol. 50 No. 1 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07252 2026-07-09 cs.LG cs.RO 新提交 57%

Safe Reinforcement Learning using Ideas from Model Predictive Control

利用模型预测控制思想的安全强化学习

Georg Schäfer, Jakob Rehrl, Stefan Huber, Simon Hirlaender

机构 * Salzburg University of Applied Sciences(萨尔茨堡应用科学大学) Paris Lodron University of Salzburg(萨尔茨堡巴黎洛德伦大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 针对强化学习在安全约束方面的挑战,提出结合深度强化学习与模型预测控制的通用框架,利用系统动力学模型定义可行状态 - 动作空间,经安全过滤器投影动作,在实验室试验台验证该方法可成功探索并稳定收敛。

Comments Accepted at Eurocast 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05842 2026-07-08 cs.SE cs.AI cs.CR 新提交 57%

Beyond Refusal: A Same-Lineage Study of Aligned and Abliterated LLMs for Vulnerability Analysis

超越拒绝:用于漏洞分析的对齐和消除拒绝的大语言模型的同谱系研究

Mingchen Li, Meikang Qiu, Zifan Peng, Heng Fan, Song Fu, Junhua Ding, Yunhe Feng

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究大语言模型辅助软件安全中,同谱系模型的安全状态(对齐或消除拒绝)对软件安全工作流程防御效用的影响,通过比较不同模型在多方面的表现,发现评估应综合考量模型响应、响应正确性及输出在工程流程中的可操作性。

详情

展开后加载摘要…

URL PDF HTML 收藏