arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 347 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 347 篇

2606.31056 2026-07-01 eess.SY cs.SY 新提交 50%

A Simplex-Inspired Architecture for Integrating Quantum Capabilities into Cyber-Physical Systems

一种受单纯形启发的架构,用于将量子能力集成到信息物理系统中

Tamim Ahmed, Dacheng Shen, Mengyu Liu, Monowar Hasan

专题命中 安全训练 :safety(abstract)

AI总结 提出基于单纯形架构的混合经典-量子系统辨识框架,结合量子辅助希尔伯特空间高斯过程回归与经典高斯过程回归,通过运行时监控实现性能与安全性的可控权衡。

Comments Poster presented at the 2nd Workshop on HPC/AI Integration with Quantum Computing/Networking 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26199 2026-06-29 cs.CR 新提交 50%

MIRAGE: Protecting against Malicious Image Editing via False Moderation

MIRAGE: 通过虚假审核保护图像免受恶意编辑

Anshul Nasery, Ramnath Kumar, Cho-Jui Hsieh, Sewoong Oh

专题命中 安全训练 :safety(abstract)

AI总结 提出MIRAGE方法,通过对抗性扰动使审核分类器将图像标记为违规,从而阻止AI图像编辑,无需模型权重或提示,在商业API上成功率超88%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26886 2026-06-26 cs.HC 新提交 50%

Optimizing Human-Machine Interface for Real-Time AI Support in the Operating Room: the CVS Copilot

优化手术室中实时AI支持的人机界面:CVS Copilot

Lorenzo Arboit, Nicolas Chanel, Aditya Murali, Pietro Mascagni, Nicolas Padoy

专题命中 安全训练 :safety(abstract)

AI总结 针对腹腔镜胆囊切除术中自动CVS评估的AI系统,通过17名外科医生的用户中心设计研究,优化了术中HMI,提出外科医生控制、角色自适应的CVS Copilot界面。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25599 2026-06-25 eess.SY cs.SY 新提交 50%

Reference-Free Heterogeneous Multi-Agent Reinforcement Learning for Grid-Friendly Tie-Line Power Shaping in Industrial Microgrids

无参考异构多智能体强化学习实现工业微电网并网友好型联络线功率整形

Daniyaer Paizulamua, Lin Cheng, Fashun Shi, Haoyu Zheng, Pengfei He, Haiwang Zhong

专题命中 安全训练 :safety(abstract)

AI总结 提出顺序异构智能体协调框架,通过多时间尺度异构资源协同,实现无参考轨迹的联络线功率整形,显著降低购电成本、合同越限时间和爬坡越限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25458 2026-06-25 cs.RO 新提交 50%

Generative AI for Safe and Photorealistic Drone Light Shows

生成式AI实现安全且逼真的无人机灯光秀

Pascal Reinhold, Alexander Gräfe, Sebastian Trimpe

机构 * Institute for Data Science in Mechanical Engineering, RWTH Aachen University(机械工程机械工程数据科学研究所,亚琛工业大学)

专题命中 安全训练 :safety(abstract)

AI总结 提出SWAN端到端流水线,从文本提示生成逼真、大规模且无碰撞的无人机编队,通过自适应点跟踪算法和安全性过滤器实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25334 2026-06-25 cs.MA 新提交 50%

Bridging the Post-discharge Gap: A Traceable Multi-agent Framework for Safe and Continuous Care

弥合出院后鸿沟:用于安全持续护理的可追溯多智能体框架

Runwei Guan, Yi Zhou, Heyi Lin, Jinjing Zhu, Mingyuan Hou, Yang Yang, Fang Yuan, Xiaohong Lin, Shaofeng Liang, Xuming Hu, Tao Li, Tianbin Zhao, Yutao Yue, Zhiyuan Wang, Hui Xiong

专题命中 安全训练 :safety(abstract)

AI总结 提出Healink框架,通过记忆增强的多智能体架构和约束检索生成,实现基于处方的可追溯出院后随访,在回顾性和盲评中优于医生基线。

Comments 23 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25160 2026-06-25 cs.RO cs.CV 新提交 50%

Toward Low-Latency Vision-Language Models with Doubly-Correct Predictions in Egocentric Visual Understanding

面向低延迟视觉语言模型:在自我中心视觉理解中实现双重正确预测

Qitong Wang, Fan Du, Pranav Maneriker, Jihui Jin, Christopher Rasmussen

机构 * Dolby Laboratories, Inc.(杜比实验室公司) University of Delaware(特拉华大学)

专题命中 安全训练 :safety(abstract)

AI总结 针对人机协作中低延迟需求,提出基于双重正确预测的剪枝策略,在保持证据定位的同时提升预测准确性,在自我中心视频数据集上实现最高精度与双重正确性。

Comments International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21577 2026-06-23 cs.RO 新提交 50%

Conflict-Aware Switching for CBF-CLF-Based Multi-Goal Navigation

基于CBF-CLF的多目标导航中的冲突感知切换

Rohan Walia, Kevin Leahy

机构 * Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 安全训练 :safety(abstract)

AI总结 针对CBF-CLF-QP控制中安全与目标约束冲突导致性能下降的问题,提出冲突感知切换策略,通过检测高冲突条件并切换标称控制目标,在多智能体多目标场景中降低完成时间和超时率。

Comments CDC 2026 Submission Copy

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20243 2026-06-19 cs.SE cs.MA 新提交 50%

Phoenix: Safe GitHub Issue Resolution via Multi-Agent LLMs

Phoenix: 通过多智能体LLM实现安全的GitHub问题解决

Kipngeno Koech, Muhammad Adam, Baimam Boukar Jean Jacques, Joao Barros

专题命中 安全训练 :safety(abstract)

AI总结 提出多智能体LLM系统Phoenix,通过六个专业智能体和七层安全控制,在SWE-bench Lite子集上达到75%的解决率,并在真实问题中保持100%正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20394 2026-06-19 cs.RO math.OC 新提交 50%

Agentic AutoResearch forSpace Autonomy: An Auditable, LLM-Driven Research Agent for Aerospace Control Problems

面向空间自主性的智能体自动研究:用于航空航天控制问题的可审计、LLM驱动的研究代理

Amit Jain, Richard Linares

机构 * Department of Aeronautics and Astronautics(航空航天学系)

专题命中 安全训练 :safety(abstract)

AI总结 提出AutoResearch框架,利用大语言模型作为离线研究代理,自动迭代开发航天控制策略,并通过内置可信层审计结果,消除种子噪声影响,在交会和对接问题上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17246 2026-06-17 cs.CV cs.MA 新提交 50%

GeoDisaster: Benchmarking Orchestrated Agents for Operational Disaster Geo-Intelligence

GeoDisaster: 用于操作化灾害地理智能的编排智能体基准测试

Maram Hasan, Aman Verma, Savitra Roy, Hariseetharam Gunduboina, Daksh Jain, Muhammad Haris Khan, Subhasis Chaudhuri, Biplab Banerjee

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 安全训练 :alignment(abstract)

AI总结 提出GeoDisaster基准,包含2921个实例和43种问题类型,用于评估遥感视觉语言模型在工具化空间推理和结构化决策方面的能力,并设计多智能体框架RCEA提升工具使用和证据基础。

Comments 28 pages, 11 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16436 2026-06-16 cs.RO cs.CV 新提交 50%

V2P-Manip: Learning Dexterous Manipulation from Monocular Human Videos

V2P-Manip:从单目人类视频学习灵巧操作

Kaihan Chen, Yanming Shao, Haifeng Ji, Xiaokang Yang, Yao Mu

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 安全训练 :alignment(abstract)

AI总结 提出V2P-Manip框架,从单目人类演示视频中提取具有视觉保真度和物理合理性的轨迹,通过两阶段精炼实现空间对齐与物理一致性,在TACO和OakInk基准上显著优于先前方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16116 2026-06-16 eess.SY cs.MA cs.RO cs.SY math.DS 新提交 50%

Distributed Safe Consensus Under Asymmetric Input and Time-Varying Output Constraints

非对称输入与时变输出约束下的分布式安全一致性

Abhinav Sinha, Shashi Ranjan Kumar

机构 * Guidance, Autonomy, Learning, and Control for Intelligent Systems (GALACxIS) Lab, Department of Aerospace Engineering and Engineering Mechanics, University of Cincinnati(智能系统引导、自主、学习与控制实验室,航空航天工程与工程力学系,辛辛那提大学) Intelligent Systems and Control (ISaC) Lab, Department of Aerospace Engineering, Indian Institute of Technology Bombay(智能系统与控制实验室,航空航天工程系,印度班加罗尔理工学院)

专题命中 安全训练 :safety(abstract)

AI总结 针对单积分多智能体系统,提出一种结合障碍坐标变换的分布式控制律,同时满足非对称执行器约束和时变输出安全约束,实现渐近同步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10598 2026-06-10 cs.SE 新提交 50%

Exploring and Complementing End Users' Requirements in IoT enabled System

探索与补充物联网系统中终端用户的需求

Haotian Li, Xiaohong Chen, Zhi Jin, Shuyuan Xiao, Chenxu Wang, Haoxiang Yan, Xiaoyi Chen

专题命中 安全训练 :safety(abstract)

AI总结 针对终端用户通过触发动作编程创建物联网规则时表达碎片化的问题,提出一种基于意图的需求补全方法,利用双向需求可追溯树和多智能体框架,结合大语言模型推理与结构化可追溯性,实现功能完整且内在安全的规则补全,将规则补全率提升43%,逻辑冲突减少21%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09841 2026-06-10 cs.HC 新提交 50%

Human-Centered AI for Safe Shuttle Car Routing in Underground Room-and-Pillar Coal Mines Using Graph Neural Networks

面向人类中心的图神经网络安全穿梭车路径规划在房柱式地下煤矿中的应用

Bryant Pollard

专题命中 安全训练 :safety(abstract)

AI总结 针对地下煤矿低能见度、动态环境下的安全路径决策问题,提出基于图神经网络的人类中心AI决策支持系统,通过专家合成数据训练、浏览器界面部署及SHAP可解释性分析,提升任务完成率、响应速度和用户信任。

Comments 18 pages, 3 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08137 2026-06-09 eess.SY cs.SY 新提交 50%

A Barrier-Modulated Architecture for Safe Affine Formation Control in Second-Order Multi-Agent Systems

面向二阶多智能体系统安全仿射编队控制的屏障调制架构

Ashik Abrar Naeem, Mohammad Ariful Haque

专题命中 安全训练 :safety(abstract)

AI总结 提出一种结合高阶控制屏障函数与自适应动态规划的屏障调制架构,实现二阶多智能体系统的安全仿射编队控制,通过分析型与数据驱动两种安全控制器保证绝对避碰和一致最终有界编队跟踪误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08035 2026-06-09 cs.CV 新提交 50%

DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning

DyCo-RL: 用于视觉推理的动态跨模态协调

Hangui Lin, Yan Shu, Zhengyang Liang, Chi Liu, Xiangrui Liu, Minghao Qin, Teng Long, Zheng Liu, Nicu Sebe

机构 * University of Trento(特伦托大学) BAAI(北京智源人工智能研究院) Singapore Management University(新加坡管理大学) IQuest Research

专题命中 安全训练 :alignment(abstract)

AI总结 提出DyCo-RL,通过Fisher-Rao测地距离量化模态内注意力转移,实现动态跨模态协调,并利用对齐引导的优势重加权优化策略,提升多模态大模型在视觉推理中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏