arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 2579 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 347 篇

2607.10221 2026-07-14 cs.SE cs.CR 新提交 50%

Which Neurons Detect Malicious Code? A Probing Study of LLM Security Knowledge

哪些神经元能检测恶意代码?对大语言模型安全知识的探索性研究

Lam D. Dao, Vang T. Nguyen, Anh M. T. Bui, Phuong T. Nguyen

专题命中 安全训练 :alignment(abstract)

AI总结 研究探索大语言模型中检测恶意代码的神经元,应用机械可解释性方法定位相关神经元,通过对恶意和良性PyPI包实验发现放大促进神经元、抑制抑制神经元可提升准确率,有助于了解模型编码恶意概念方式,为可靠防御机制提供思路。

Comments The paper has been peer reviewed and accepted for publication in the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15920 2026-07-10 cs.CV 新提交 50%

OmniOPSD: Rationale-Privileged On-Policy Self-Distillation for Affective Computing

OmniOPSD:面向情感计算的理性特权在线自蒸馏

Zebang Cheng, Shuimu Chen, Boxue Yang, Yuanshen Guan, Jingyi Chen, Zheng Lian, Xiaojiang Peng, Fei Ma, LaiZhong Cui, Qi Tian

机构 * Shenzhen University(深圳大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) Shenzhen Technology University(深圳技术大学) Tongji University(同济大学) Huawei(华为)

专题命中 安全训练 :safety(abstract)

AI总结 针对多模态大模型在复杂推理任务中奖励稀疏的问题,提出OmniOPSD框架,利用前沿模型生成的理性作为教师特权证据而非学生模仿目标,通过在线自蒸馏提供密集令牌级监督,在MER-UniBench上取得84.19平均分的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04745 2026-07-07 cs.RO cs.CV 新提交 50%

Trajectory-Anchor Optimization for Overconfident Thermal Visual Place Recognition: Zero-Leakage OOD Auditing and Kidnapped-Robot Recovery

用于过度自信的热视觉场所识别的轨迹锚点优化:零泄漏异常检测与绑架机器人恢复

Zhiyuan Lu, Kanji Tanaka

专题命中 安全训练 :alignment(abstract)

AI总结 研究针对基于基础模型的热视觉场所识别前端在分布外或未映射条件下的过度自信强制匹配失败问题,提出轨迹锚点优化(TAO),通过压缩多视图时间验证解决组合挑战,实现高效故障安全过滤。

Comments 11 pages, 5 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03963 2026-07-07 cs.SE 新提交 50%

Neuro-Symbolic Reasoning for Vulnerability Detection

用于漏洞检测的神经符号推理

Yanjie Zhao, Hongjie Chen, Li Lu, Zhou Yang, Xiao Cheng, Haoyu Wang

专题命中 安全训练 :safety(abstract)

AI总结 研究基于大语言模型的漏洞检测不可靠性,提出神经符号框架LeanGuard,通过将代码解释与安全义务判定分离,神经侧过滤事实,符号侧形式验证,证据感知裁决器权衡结果,在五个CWE类上实例化框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02579 2026-07-07 cs.SE 新提交 50%

When Not to Write Memory: Governing False Promotion from Correlated Agent Traces

何时不写入内存:管理来自相关代理痕迹的错误推广

Yijiashun Qi, Xiang Xu, Yuxuan Li

专题命中 安全训练 :safety(abstract)

AI总结 研究语言代理从执行痕迹写入可复用内存时何时应拒绝写入的问题,引入GovMem策略,通过估计依赖感知支持等进行决策,在测试中能减少错误推广。

Comments accepted by mlise 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02294 2026-07-03 cs.SE 新提交 50%

Coding Agents Are Guessing: Measuring Action-Boundary Violations in Underspecified DevOps Instructions

编码代理在猜测:测量欠指定DevOps指令中的动作边界违规

Zimo Ji, Zekai Zhang, Congying Xu, Zongjie Li, Yudong Gao, Shuai Wang, Shing-Chi Cheung

专题命中 安全训练 :safety(abstract)

AI总结 提出UnderSpecBench基准,通过69个任务族和2208个提示变体,评估编码代理在欠指定DevOps指令下的动作边界违规,发现55.8-67.8%的运行至少违反一个边界,表明完成度评估高估了安全自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02192 2026-07-03 eess.SY cs.SY 新提交 50%

Reference-Governed Distributed Safe Gradient Flow for Safe Optimal Output Agreement of Multi-Agent Systems

参考调控的分布式安全梯度流用于多智能体系统的安全最优输出一致性

Zhanglin Shangguan, Wei Xiao, Bo Yang, Xinping Guan

专题命中 安全训练 :safety(abstract)

AI总结 提出参考调控双层架构,上层通过一阶控制屏障函数约束梯度流,下层基于内模输出调节器构建动态安全裕度,实现非线性多智能体系统的安全最优输出一致性,避免高阶控制屏障函数的调参敏感和稳态偏移问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01138 2026-07-02 cs.CR 新提交 50%

Antaeus: Hunting Repository-Level Logic Vulnerabilities via Context-Grounded LLM Reasoning

Antaeus: 通过上下文锚定的LLM推理发现仓库级逻辑漏洞

Michele Armillotta, Nicolò Romandini, Rebecca Montanari, Lorenzo Cavallaro

专题命中 安全训练 :safety(abstract)

AI总结 提出Antaeus框架,通过仓库级代码上下文锚定LLM推理,结合函数优先级排序、上下文推理、比较验证和结构化报告,有效检测逻辑漏洞,在28个仓库中检测出15个漏洞,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00654 2026-07-02 cs.CV 新提交 50%

Linguistic Relative Policy Optimization for Video Anomaly Reasoning

语言相对策略优化用于视频异常推理

Jiaxu Leng, Jiankang Zheng, Mengjingcheng Mo, Zhanjie Wu, Haosheng Chen, Ji Gan, Xinbo Gao

机构 * Chongqing College of Artificial Intelligence(重庆人工智能学院)

专题命中 安全训练 :alignment(abstract)

AI总结 提出语言相对策略优化(LRPO),通过从多个推理轨迹中提取群体相对语义优势,构建语言表达的异常经验先验,无需参数更新即可引导模型输出,在无调参设置下显著超越现有方法。

Comments Accepted at ICML 2026; 18 pages, 8 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00622 2026-07-02 cs.CV 新提交 50%

Learning to Watch: Active Video Anomaly Understanding via Interleaved Policy Optimization

学习观察:通过交错策略优化的主动视频异常理解

Mengjingcheng Mo, Jiaxu Leng, Xinbo Gao

机构 * School of Computer Science and Technology, Chongqing University of Posts and Telecommunications, Chongqing, China(重庆邮电大学计算机科学与技术学院) School of Computer Science(计算机科学学院) Chongqing College of Artificial Intelligence, Chongqing, China(重庆人工智能学院)

专题命中 安全训练 :alignment(abstract)

AI总结 提出Anom-π闭环框架,将视频异常理解建模为主动序列决策过程,通过交错策略统一内部推理与证据获取,并设计iDPO实现轨迹级策略对齐,仅2B参数即超越大规模模型。

Comments Accepted at ICML 2026; 25 pages, 8 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00160 2026-07-02 cs.RO 新提交 50%

Distributed Multi Robot Lunar Cargo Transportation via Phase Decomposed Reinforcement Learning

基于相位分解强化学习的分布式多机器人月球货物运输

Ashutosh Mishra, Elian Neppel, Shreya Santra, Antoine Jonquières, Muhammad Athallah Naufal, Kentaro Uno, Kazuya Yoshida

机构 * Tohoku University(东北大学) École Centrale de Lille(里尔中央理工学院) Institut Teknologi Bandung(万隆理工学院)

专题命中 安全训练 :safety(abstract)

AI总结 提出相位分解强化学习框架,将月球货物运输分解为提升、运输和放置三个阶段,分别优化联合状态策略,实现分布式机器人协同运输,仿真和硬件实验验证了可靠性。

Comments 8 pages, 9 Figures, Accepted at IROS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25189 2026-07-02 cs.OS 新提交 50%

ActPlane: Programmable OS-Level Policy Enforcement for Agent Harnesses

ActPlane:面向代理框架的可编程操作系统级策略执行

Yusheng Zheng, Tianyuan Wu, Quanzhi Fu, Tong Yu, Wenan Mao, Tao Ma, Dan Williams, Wei Wang, Andi Quinn

专题命中 安全训练 :safety(abstract)

AI总结 提出ActPlane,一种在操作系统内核中执行代理策略的引擎,通过eBPF实现信息流控制,弥补语义鸿沟,覆盖工具层无法观察的间接执行路径,开销1.9%-8.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31732 2026-07-01 cs.CV 新提交 50%

UniCoder: Unified Visual-to-Code Generation via Symbolic Rewards and Reference-Guided Code Optimization

UniCoder: 通过符号奖励和参考引导代码优化的统一视觉到代码生成

Yaozhi Zheng, Yilei Jiang, Manyuan Zhang, Yuxuan Wan, Kaituo Feng, Tianshuo Peng, Bo Zhang, Xiangyu Yue

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全训练 :alignment(abstract)

AI总结 提出UniCoder框架,通过符号属性对齐实现密集元素级奖励,并利用参考引导代码优化策略克服探索停滞,在多个基准上达到与专有模型相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31572 2026-07-01 cs.SE 新提交 50%

FormIDEAble: Safe and Socially-aware Autonomous Systems

FormIDEAble:安全且具有社会感知能力的自主系统

Livia Lestingi, Amel Bennaceur, Marcello M. Bersani, Carlos Gavidia-Calderon, Anastasia Kordoni, Mark Levine, Bashar Nuseibeh, Matteo Rossi

专题命中 安全训练 :safety(abstract)

AI总结 提出FormIDEAble方法,通过带代价的马尔可夫决策过程建模人机协作,将决策形式化为代价有界可达性问题,在保证安全的同时实现社会感知策略合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31056 2026-07-01 eess.SY cs.SY 新提交 50%

A Simplex-Inspired Architecture for Integrating Quantum Capabilities into Cyber-Physical Systems

一种受单纯形启发的架构,用于将量子能力集成到信息物理系统中

Tamim Ahmed, Dacheng Shen, Mengyu Liu, Monowar Hasan

专题命中 安全训练 :safety(abstract)

AI总结 提出基于单纯形架构的混合经典-量子系统辨识框架,结合量子辅助希尔伯特空间高斯过程回归与经典高斯过程回归,通过运行时监控实现性能与安全性的可控权衡。

Comments Poster presented at the 2nd Workshop on HPC/AI Integration with Quantum Computing/Networking 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26199 2026-06-29 cs.CR 新提交 50%

MIRAGE: Protecting against Malicious Image Editing via False Moderation

MIRAGE: 通过虚假审核保护图像免受恶意编辑

Anshul Nasery, Ramnath Kumar, Cho-Jui Hsieh, Sewoong Oh

专题命中 安全训练 :safety(abstract)

AI总结 提出MIRAGE方法,通过对抗性扰动使审核分类器将图像标记为违规,从而阻止AI图像编辑,无需模型权重或提示,在商业API上成功率超88%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26886 2026-06-26 cs.HC 新提交 50%

Optimizing Human-Machine Interface for Real-Time AI Support in the Operating Room: the CVS Copilot

优化手术室中实时AI支持的人机界面:CVS Copilot

Lorenzo Arboit, Nicolas Chanel, Aditya Murali, Pietro Mascagni, Nicolas Padoy

专题命中 安全训练 :safety(abstract)

AI总结 针对腹腔镜胆囊切除术中自动CVS评估的AI系统,通过17名外科医生的用户中心设计研究,优化了术中HMI,提出外科医生控制、角色自适应的CVS Copilot界面。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25599 2026-06-25 eess.SY cs.SY 新提交 50%

Reference-Free Heterogeneous Multi-Agent Reinforcement Learning for Grid-Friendly Tie-Line Power Shaping in Industrial Microgrids

无参考异构多智能体强化学习实现工业微电网并网友好型联络线功率整形

Daniyaer Paizulamua, Lin Cheng, Fashun Shi, Haoyu Zheng, Pengfei He, Haiwang Zhong

专题命中 安全训练 :safety(abstract)

AI总结 提出顺序异构智能体协调框架,通过多时间尺度异构资源协同,实现无参考轨迹的联络线功率整形,显著降低购电成本、合同越限时间和爬坡越限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25458 2026-06-25 cs.RO 新提交 50%

Generative AI for Safe and Photorealistic Drone Light Shows

生成式AI实现安全且逼真的无人机灯光秀

Pascal Reinhold, Alexander Gräfe, Sebastian Trimpe

机构 * Institute for Data Science in Mechanical Engineering, RWTH Aachen University(机械工程机械工程数据科学研究所,亚琛工业大学)

专题命中 安全训练 :safety(abstract)

AI总结 提出SWAN端到端流水线,从文本提示生成逼真、大规模且无碰撞的无人机编队,通过自适应点跟踪算法和安全性过滤器实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25334 2026-06-25 cs.MA 新提交 50%

Bridging the Post-discharge Gap: A Traceable Multi-agent Framework for Safe and Continuous Care

弥合出院后鸿沟:用于安全持续护理的可追溯多智能体框架

Runwei Guan, Yi Zhou, Heyi Lin, Jinjing Zhu, Mingyuan Hou, Yang Yang, Fang Yuan, Xiaohong Lin, Shaofeng Liang, Xuming Hu, Tao Li, Tianbin Zhao, Yutao Yue, Zhiyuan Wang, Hui Xiong

专题命中 安全训练 :safety(abstract)

AI总结 提出Healink框架,通过记忆增强的多智能体架构和约束检索生成,实现基于处方的可追溯出院后随访,在回顾性和盲评中优于医生基线。

Comments 23 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25160 2026-06-25 cs.RO cs.CV 新提交 50%

Toward Low-Latency Vision-Language Models with Doubly-Correct Predictions in Egocentric Visual Understanding

面向低延迟视觉语言模型:在自我中心视觉理解中实现双重正确预测

Qitong Wang, Fan Du, Pranav Maneriker, Jihui Jin, Christopher Rasmussen

机构 * Dolby Laboratories, Inc.(杜比实验室公司) University of Delaware(特拉华大学)

专题命中 安全训练 :safety(abstract)

AI总结 针对人机协作中低延迟需求,提出基于双重正确预测的剪枝策略,在保持证据定位的同时提升预测准确性,在自我中心视频数据集上实现最高精度与双重正确性。

Comments International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21577 2026-06-23 cs.RO 新提交 50%

Conflict-Aware Switching for CBF-CLF-Based Multi-Goal Navigation

基于CBF-CLF的多目标导航中的冲突感知切换

Rohan Walia, Kevin Leahy

机构 * Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 安全训练 :safety(abstract)

AI总结 针对CBF-CLF-QP控制中安全与目标约束冲突导致性能下降的问题,提出冲突感知切换策略,通过检测高冲突条件并切换标称控制目标,在多智能体多目标场景中降低完成时间和超时率。

Comments CDC 2026 Submission Copy

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20243 2026-06-19 cs.SE cs.MA 新提交 50%

Phoenix: Safe GitHub Issue Resolution via Multi-Agent LLMs

Phoenix: 通过多智能体LLM实现安全的GitHub问题解决

Kipngeno Koech, Muhammad Adam, Baimam Boukar Jean Jacques, Joao Barros

专题命中 安全训练 :safety(abstract)

AI总结 提出多智能体LLM系统Phoenix,通过六个专业智能体和七层安全控制,在SWE-bench Lite子集上达到75%的解决率,并在真实问题中保持100%正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20394 2026-06-19 cs.RO math.OC 新提交 50%

Agentic AutoResearch forSpace Autonomy: An Auditable, LLM-Driven Research Agent for Aerospace Control Problems

面向空间自主性的智能体自动研究:用于航空航天控制问题的可审计、LLM驱动的研究代理

Amit Jain, Richard Linares

机构 * Department of Aeronautics and Astronautics(航空航天学系)

专题命中 安全训练 :safety(abstract)

AI总结 提出AutoResearch框架,利用大语言模型作为离线研究代理,自动迭代开发航天控制策略,并通过内置可信层审计结果,消除种子噪声影响,在交会和对接问题上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17246 2026-06-17 cs.CV cs.MA 新提交 50%

GeoDisaster: Benchmarking Orchestrated Agents for Operational Disaster Geo-Intelligence

GeoDisaster: 用于操作化灾害地理智能的编排智能体基准测试

Maram Hasan, Aman Verma, Savitra Roy, Hariseetharam Gunduboina, Daksh Jain, Muhammad Haris Khan, Subhasis Chaudhuri, Biplab Banerjee

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 安全训练 :alignment(abstract)

AI总结 提出GeoDisaster基准,包含2921个实例和43种问题类型,用于评估遥感视觉语言模型在工具化空间推理和结构化决策方面的能力,并设计多智能体框架RCEA提升工具使用和证据基础。

Comments 28 pages, 11 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16436 2026-06-16 cs.RO cs.CV 新提交 50%

V2P-Manip: Learning Dexterous Manipulation from Monocular Human Videos

V2P-Manip:从单目人类视频学习灵巧操作

Kaihan Chen, Yanming Shao, Haifeng Ji, Xiaokang Yang, Yao Mu

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 安全训练 :alignment(abstract)

AI总结 提出V2P-Manip框架,从单目人类演示视频中提取具有视觉保真度和物理合理性的轨迹,通过两阶段精炼实现空间对齐与物理一致性,在TACO和OakInk基准上显著优于先前方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16116 2026-06-16 eess.SY cs.MA cs.RO cs.SY math.DS 新提交 50%

Distributed Safe Consensus Under Asymmetric Input and Time-Varying Output Constraints

非对称输入与时变输出约束下的分布式安全一致性

Abhinav Sinha, Shashi Ranjan Kumar

机构 * Guidance, Autonomy, Learning, and Control for Intelligent Systems (GALACxIS) Lab, Department of Aerospace Engineering and Engineering Mechanics, University of Cincinnati(智能系统引导、自主、学习与控制实验室,航空航天工程与工程力学系,辛辛那提大学) Intelligent Systems and Control (ISaC) Lab, Department of Aerospace Engineering, Indian Institute of Technology Bombay(智能系统与控制实验室,航空航天工程系,印度班加罗尔理工学院)

专题命中 安全训练 :safety(abstract)

AI总结 针对单积分多智能体系统,提出一种结合障碍坐标变换的分布式控制律,同时满足非对称执行器约束和时变输出安全约束,实现渐近同步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10598 2026-06-10 cs.SE 新提交 50%

Exploring and Complementing End Users' Requirements in IoT enabled System

探索与补充物联网系统中终端用户的需求

Haotian Li, Xiaohong Chen, Zhi Jin, Shuyuan Xiao, Chenxu Wang, Haoxiang Yan, Xiaoyi Chen

专题命中 安全训练 :safety(abstract)

AI总结 针对终端用户通过触发动作编程创建物联网规则时表达碎片化的问题,提出一种基于意图的需求补全方法,利用双向需求可追溯树和多智能体框架,结合大语言模型推理与结构化可追溯性,实现功能完整且内在安全的规则补全,将规则补全率提升43%,逻辑冲突减少21%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09841 2026-06-10 cs.HC 新提交 50%

Human-Centered AI for Safe Shuttle Car Routing in Underground Room-and-Pillar Coal Mines Using Graph Neural Networks

面向人类中心的图神经网络安全穿梭车路径规划在房柱式地下煤矿中的应用

Bryant Pollard

专题命中 安全训练 :safety(abstract)

AI总结 针对地下煤矿低能见度、动态环境下的安全路径决策问题,提出基于图神经网络的人类中心AI决策支持系统,通过专家合成数据训练、浏览器界面部署及SHAP可解释性分析,提升任务完成率、响应速度和用户信任。

Comments 18 pages, 3 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08137 2026-06-09 eess.SY cs.SY 新提交 50%

A Barrier-Modulated Architecture for Safe Affine Formation Control in Second-Order Multi-Agent Systems

面向二阶多智能体系统安全仿射编队控制的屏障调制架构

Ashik Abrar Naeem, Mohammad Ariful Haque

专题命中 安全训练 :safety(abstract)

AI总结 提出一种结合高阶控制屏障函数与自适应动态规划的屏障调制架构,实现二阶多智能体系统的安全仿射编队控制,通过分析型与数据驱动两种安全控制器保证绝对避碰和一致最终有界编队跟踪误差。

详情

展开后加载摘要…

URL PDF HTML 收藏