arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3281 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3281 篇

2605.19967 2026-05-20 eess.SY cs.SY 50%

Safe Deep Reinforcement Learning for Spacecraft Reorientation with Pointing Keep-Out Constraint

具有指向保持区约束的空间飞行器再定向的安全深度强化学习

Juntang Yang, Mohamed Khalil Ben-Larbi

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种用于具有单一指向保持区的空间飞行器再定向控制的深度强化学习方法,设计了新的状态空间表示,制定了奖励函数以实现控制目标并施加姿态约束,采用软演员评论家算法处理连续状态和动作空间,并通过课程学习方法训练智能体,通过基于控制屏障函数的安全过滤器保证姿态约束的合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12501 2026-05-15 cs.IT math.IT 50%

A Heterogeneous Dual-Network Framework for Emergency Delivery UAVs: Communication Assurance and Path Planning Coordination

一种异构双网络框架用于应急配送无人机:通信保障与路径规划协调

Ping Huang, Bin Duo, Ziedor Godfred, Liuwei Huo, Jin Ning, Xiaojun Yuan, Jun Li

专题命中 安全训练 :safety(abstract)

AI总结 本文提出异构双网络框架HDNF,通过结合应急通信支持网络和配送路径网络,提升无人机在灾害环境中的通信可靠性与路径规划效率,优化任务分配和能源消耗。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13185 2026-05-14 cs.FL cs.MA 50%

Decoupled Planning for Multiple Omega-Regular Objectives

多重ω-regular目标的解耦规划

Guy Avni, Thomas A. Henzinger, Kaushik Mallik, Suman Sadhukhan, K. S. Thejaswini

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了解耦框架,通过独立代理选择局部策略并由调度器动态组合,解决图上满足多个ω-regular目标的路径生成问题,探讨了调度器协调对正确性的必要性及安全目标的同步协议。

Comments 33 pages, 6 figures. Extended version of the paper accepted at CAV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22117 2026-05-14 eess.SY cs.SY 50%

Safe Multi-Agent Navigation via Constrained HJB-Informed Learning

通过约束HJB引导学习实现安全多智能体导航

Fenglan Wang, Xinguo Shu, Lei He, Lin Zhao

专题命中 安全训练 :safety(abstract)

AI总结 本文提出HJB-GNN框架,通过联合学习控制屏障函数、分布式导航策略和价值函数,实现多智能体导航中的安全约束与目标达成的平衡,验证了其在复杂环境中的优越性能和可扩展性。

Comments Accepted by Robotics: Science and Systems (RSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00982 2026-05-14 cs.RO cs.MA 50%

Robust and Safe Multi-Agent Reinforcement Learning with Communication for Autonomous Vehicles: From Simulation to Hardware

具备通信的鲁棒且安全的多智能体强化学习:从仿真到硬件

Keshawn Smith, Zhili Zhang, H M Sabbir Ahmad, Ehsan Sabouni, Mainak Mondal, Song Han, Wenchao Li, Fei Miao

机构 * Department of ECE University of Connecticut(电子工程系,康涅狄格大学) School of Computing University of Connecticut(计算学院,康涅狄格大学) Department of ECE Boston University(电子工程系,波士顿大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出RSR-RSMARL框架,通过鲁棒强化学习算法和安全模块实现多智能体系统在仿真与硬件间的零 shot 转移,提升自动驾驶安全性和协调性。

Comments 15 pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12251 2026-05-13 cs.GT 50%

Social Welfare under Heterogeneous Time Preferences

社会福利在异质时间偏好下的研究

Sarvin Bahmani, Soumyajit Paul, Sven Schewe, Shadi Tasdighi Kalat, Ashutosh Trivedi

专题命中 安全训练 :alignment(abstract)

AI总结 本文研究了在异质时间偏好下,如何通过社会福利最大化来制定最优策略,展示了即使所有主体获得相同奖励,最优策略也不再是位置性的,但策略结构仍保持简单。

Comments 14 pages including appendices, Accepted to IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17510 2026-05-13 cs.RO 50%

Interpreting Context-Aware Human Preferences for Multi-Objective Robot Navigation

解释情境感知的人类偏好以实现多目标机器人导航

Tharun Sethuraman, Subham Agrawal, Nils Dengler, Jorge de Heuvel, Teena Hassan, Maren Bennewitz

机构 * Hochschule Bonn-Rhein-Sieg, Germany(波恩-莱茵-锡格应用科学大学,德国) University of Bonn, Germany(波恩大学,德国) Lamarr Institute for Machine Learning and Artificial Intelligence, Germany(拉马尔机器学习与人工智能研究所,德国)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种结合基础模型与多目标强化学习政策的框架,使机器人能理解并应用情境依赖的导航偏好,提升在共享人类环境中的适应性、透明性和可用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10481 2026-05-12 cs.MA 50%

Safe Multi-Agent Behavior Must Be Maintained, Not Merely Asserted: Constraint Drift in LLM-Based Multi-Agent Systems

安全多智能体行为必须被维护,而非仅仅被断言:基于LLM的多智能体系统中的约束漂移

Tianxiao Li, Yixing Ma, Haiquan Wen, Zhenglin Huang, Qianyu Zhou, Zeyu Fu, Guangliang Cheng

专题命中 安全训练 :safety(abstract)

AI总结 本文探讨了基于LLM的多智能体系统中约束漂移问题,指出安全约束在执行过程中可能丢失、扭曲或减弱,提出约束状态治理作为研究范式,以确保安全行为在轨迹中持续有效。

Comments 12 pages, 2 figures, 4 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09606 2026-05-12 cs.CR cs.CV 50%

On the Generation and Mitigation of Harmful Geometry in Image-to-3D Models

关于图像到3D模型中有害几何的生成与缓解

Yule Liu, Yilong Yang, Jiale Teng, Hanze Jia, Zeren Luo, Jingyi Zheng, Zifan Peng, Ke Li, Yifan Liao, Zhen Sun, Jiaheng Wei, Yang Liu, Zhuo Ma, Xinlei He

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Xidian University(西安电子科技大学) Zhejiang University(浙江大学) Wuhan University(武汉大学)

专题命中 安全训练 :alignment(abstract)

AI总结 研究探讨了图像到3D模型生成有害几何的风险及缓解方法,通过系统评估发现当前模型能有效重建有害几何,但现有防护措施存在不足,提出堆叠防御策略以降低有害几何留存率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23251 2026-05-11 cs.CV 50%

Structure Over Scale: Learning Visual Reasoning from Pedagogical Video

结构优先于规模:从教育视频中学习视觉推理

Bishoy Galoaa, Xiangyu Bai, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出SoSVQA基准,利用教育视频中的结构化推理轨迹提升视觉语言模型的推理能力,通过GRPO优化在少量数据下实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05260 2026-05-08 cs.CR 50%

SecureMCP: A Policy-Enforced LLM Data Access Framework for AIoT Systems via Model Context Protocol

SecureMCP: 一种通过模型上下文协议实现的基于策略的LLM数据访问框架,用于AIoT系统

Wonbae Kim, Hee-Kyong Yoo

专题命中 安全训练 :prompt injection(abstract)

AI总结 本文提出SecureMCP框架,结合RBAC与MCP服务器,通过五种防御模块实现多层防护,提升LLM生成SQL的安全性,实验显示其在保护数据安全和执行准确率方面表现优异。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28129 2026-05-08 cs.RO 50%

A Position Statement on Endovascular Models and Effectiveness Metrics for Mechanical Thrombectomy Navigation, on behalf of the Stakeholder Taskforce for AI-assisted Robotic Thrombectomy (START)

关于内血管模型和机械取栓导航的有效性指标的立场声明,代表人工智能辅助机器人取栓利益相关者工作组(START)

Harry Robertshaw, Anna Barnes, Phil Blakelock, Raphael Blanc, Robert Crossley, Rebecca Fahrig, Ameer E. Hassan, Benjamin Jackson, Lennart Karstensen, Neelam Kaur, Markus Kowarschik, Jeremy Lynch, Franziska Mathis-Ullrich, Dwight Meglan, Vitor Mendes Pereira, Mouloud Ourak, Matteo Pantano, S. M. Hadi Sadati, Alice Taylor-Gee, Tom Vercauteren, Phil White, Alejandro Granados, Thomas C. Booth

机构 * on behalf of the Stakeholder Taskforce for AI-assisted Robotic Thrombectomy (START)(人工智能辅助机器人取栓任务组成员)

专题命中 安全训练 :safety(abstract)

AI总结 本文旨在建立共识框架,开发和验证人工智能辅助机器人用于取栓,标准化有效性指标并定义参考测试环境,以提升地理多样性人群的及时取栓访问。

Comments Published in Journal of the American Heart Association

Journal ref J Am Heart Assoc. 2026;15:e044931

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01517 2026-05-05 cs.CV 50%

VAnim: Rendering-Aware Sparse State Modeling for Structure-Preserving Vector Animation

VAnim:基于渲染的稀疏状态建模用于结构保持的向量动画

Guotao Liang, Zhangcheng Wang, Chuang Wang, Juncheng Hu, Haitao Zhou, Junhua Liu, Jing Zhang, Dong Xu, Qian Yu

机构 * School of Software, Beihang University, Beijing, China(北京航空航天大学软件学院) Department of Computer Science, The University of Hong Kong, Hong Kong, China(香港大学计算机科学系) College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院)

专题命中 安全训练 :alignment(abstract)

AI总结 VAnim提出了一种基于LLM的框架,通过稀疏状态更新和渲染感知强化学习,实现结构保持的向量动画生成,优于现有方法。

Comments Accepted to ICML 2026. Project page: https://yukinonooo.github.io/VAnimProject

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27728 2026-05-01 cs.RO 50%

Connected Dependability Cage: Run-Time Function and Anomaly Monitoring for the Development and Operation of Safe Automated Vehicles

连接的可靠性笼:运行时功能与异常监控用于安全自动驾驶车辆的开发和运营

Iqra Aslam, Nour Habib, Abhishek Buragohain, Meng Zhang, Andreas Rausch, Vaibhav Tiwari, Mohamed Benchat

机构 * Institute for Software and System Engineering(软件与系统工程研究所)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出连接的可靠性笼架构,通过功能监控和异常监控机制,提升自动驾驶系统在故障和未知环境下的安全性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26653 2026-04-30 cs.IR 50%

AgentSim: A Platform for Verifiable Agent-Trace Simulation

AgentSim:可验证代理跟踪模拟平台

Saber Zerhoudi, Michael Granitzer, Jelena Mitrovic

专题命中 安全训练 :trustworthy(abstract)

AI总结 本文提出AgentSim平台,通过多模型验证和主动人工参与流程,生成可验证的代理推理轨迹,构建了覆盖三个信息检索基准的Agent-Trace Corpus,并揭示了先进模型在信息检索中的系统性差异。

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '26), July 20--24, 2026, Melbourne, VIC, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24116 2026-04-28 cs.SE stat.AP 50%

Closing the Loop: A Software Framework for AI to Support Business Decision Making

闭环:一个支持商业决策制定的AI软件框架

Jeffrey Wong, Antoine Creux

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一个软件框架,通过数学简化和软件设计优化,提升AI在商业闭环中的学习与迭代效率,改进因果分析并增强实验效果预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00520 2026-04-28 cs.MA 50%

Toward a Safe Internet of Agents

迈向安全的智能体互联网

Juan A. Wibowo, George C. Polyzos

专题命中 安全训练 :safety(abstract)

AI总结 本文提出安全智能体系统的框架,通过分层分析揭示智能体安全的核心原则,为构建安全可靠的智能体AI提供指导。

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22504 2026-04-27 cs.IR 50%

Objective Shaping with Hard Negatives: Windowed Partial AUC Optimization for RL-based LLM Recommenders

通过硬负样本进行目标塑造:基于RL的LLM推荐系统中的窗口化部分AUC优化

Wentao Shi, Qifan Wang, Chen Chen, Fei Liu, Dongfang Liu, Xu Liu, Wanli Ma, Junfeng Pan, Linhong Zhu, Fuli Feng

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出窗口化部分AUC优化方法,通过约束假阳性率提升与Top-K指标的一致性,改进基于RL的LLM推荐系统性能。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21587 2026-04-24 cs.IT math.IT 50%

Generative Learning Enhanced Intelligent Resource Management for Cell-Free Delay Deterministic Communications

生成学习增强的智能资源管理用于无基站确定性通信

Shuangbo Xiong, Cheng Zhang, Wen Wang, Wenwu Yu, Yongming Huang

专题命中 安全训练 :safety(abstract)

AI总结 本文研究了无基站MIMO系统中的资源分配问题,提出基于虚拟约束马尔可夫决策过程的离线预训练框架,通过证据感知条件高斯混合模型提升效率和安全性,实验表明其在能效和延迟约束方面表现优异。

Comments The paper has been submitted to IEEE Transactions on Wireless Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18046 2026-04-21 cs.CE cs.MA 50%

EvoMarket: A High-Fidelity and Scalable Financial Market Simulator

EvoMarket:一种高保真且可扩展的金融市场模拟器

Muyao Zhong, Zhenhua Yang, Yuxiang Liu, Ke Tang, Peng Yang

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出EvoMarket,一种多资产和跨日环境下的多智能体金融市场模拟器,通过高吞吐量执行核心和显式机构机制,实现高保真度、可扩展性和计算可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17313 2026-04-21 cs.CR 50%

GuardPhish: Securing Open-Source LLMs from Phishing Abuse

GuardPhish: 保护开源大语言模型免受钓鱼攻击

Rina Mishra, Gaurav Varshney, Doddipatla Sesha Sahithi

专题命中 安全训练 :safety(abstract)

AI总结 本文通过GuardPhish数据集研究开源大语言模型在静态安全配置下的钓鱼风险,发现即使模型能识别钓鱼意图,仍可能生成有效钓鱼内容,提出基于GuardPhish的分类器提升防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03293 2026-04-21 eess.SY cs.SY 50%

Chance-Constrained Neural MPC under Uncontrollable Agents via Sequential Convex Programming

在不可控代理下通过序列凸编程实现机会约束神经MPC

Shuqi Wang, Mingyang Feng, Yu Chen, Yue Gao, Xiang Yin

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种神经MPC框架,通过学习离线数据预测不可控代理轨迹,并采用区域鲁棒符合预测方案构建时间依赖性不确定性界,以确保预测误差的正式概率保证,实验表明该方法在自动驾驶场景中安全性和效率优于基线方法。

Comments Extended version of a paper accepted to the 23rd IFAC World Congress 2026, Busan, Korea, under the journal publication option

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15485 2026-04-20 cs.SE 50%

LLM4C2Rust: Large Language Models for Automated Memory-Safe Code Transpilation

LLM4C2Rust: 利用大型语言模型实现自动内存安全代码转译

Sarah Bedell, Nazanin Siavash, Armin Moin

专题命中 安全训练 :safety(abstract)

AI总结 本文提出基于检索增强生成的框架,利用大型语言模型与小型语言模型结合,实现C/C++到Rust的转译,提升内存安全性。实验表明该方法能有效提高代码正确性和安全性,减少原始指针解引用和不安全类型转换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20643 2026-04-20 eess.SY cs.SY 50%

Safe Decentralized Density Control of Multi-Robot Systems using PDE-Constrained Optimization with State Constraints

多机器人系统中使用偏微分方程约束优化的安全去中心化密度控制

Longchen Niu, Gennaro Notomista

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种去中心化优化密度控制器,通过设计去中心化控制屏障函数,确保局部安全约束下的全局安全。采用Fokker-Planck方程建模机器人空间概率密度函数,降低计算和通信开销,通过四架四旋翼飞行器的仿真和实验验证有效性。

Comments Accepted to MRS 2025

Journal ref 2025 IEEE International Symposium on Multi-Robot and Multi-Agent Systems (MRS), Singapore, Singapore, 2025, pp. 1-7

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13801 2026-04-16 cs.IR 50%

DUET: Joint Exploration of User Item Profiles in Recommendation System

DUET:推荐系统中用户和物品轮廓的联合探索

Yue Chen, Yifei Sun, Lu Wang, Fangkai Yang, Pu Zhao, Minjie Hong, Yifei Dong, Minghua He, Nan Hu, Jianjin Zhang, Zhiwei Dai, Yuefeng Zhan, Weihao Han, Hao Sun, Qingwei Lin, Weiwei Deng, Feng Sun, Qi Zhang, Saravan Rajmohan, Dongmei Zhang

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出DUET,一种基于用户历史和物品证据的交互感知轮廓生成器,通过三阶段流程实现用户和物品轮廓的联合生成与优化,实验表明其在推荐任务中优于现有基线方法。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13292 2026-04-16 cs.CV 50%

See&Say: Vision Language Guided Safe Zone Detection for Autonomous Package Delivery Drones

See&Say:基于视觉语言的自主配送无人机安全区域检测

Mahyar Ghazanfari, Peng Wei

机构 * George Washington University(乔治·华盛顿大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出See&Say框架,结合几何安全提示与语义感知,利用视觉语言模型实现迭代优化,提升无人机配送中安全区域检测的可靠性与动态适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13245 2026-04-16 cs.RO cs.SY eess.SY 50%

Capability-Aware Heterogeneous Control Barrier Functions for Decentralized Multi-Robot Safe Navigation

具备能力的异构控制屏障函数用于去中心化多机器人安全导航

Joonkyung Kim, Yanze Zhang, Wenhao Luo, Yiwei Lyu

机构 * Department of Computer Science and Engineering, Texas A&M University(德克萨斯A&M大学计算机科学与工程系) Department of Computer Science, University of Illinois Chicago(伊利诺伊大学芝加哥分校计算机科学系)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出CA-HCBF框架,通过统一动力学模型和能力度量,实现异构机器人团队的安全一致性和能力感知协调,提升安全性和任务效率。

Comments 8 pages, 3 figures, 2 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13098 2026-04-16 cs.MA cs.CV cs.RO 50%

C$^2$T: Captioning-Structure and LLM-Aligned Common-Sense Reward Learning for Traffic--Vehicle Coordination

C$^2$T:基于图像描述与大语言模型对齐的常识奖励学习用于交通-车辆协调

Yuyang Chen, Kaiyan Zhao, Yiming Wang, Ming Yang, Bin Rao, Zhenning Li

机构 * The State Key Laboratory of Internet of Things for Smart City, University of Macau(物联网智能城市国家重点实验室,澳门大学) Wuhan University(武汉大学) Hong Kong Polytechnic University(香港理工大学) Computer and Information Science, University of Macau(澳门大学计算机与信息科学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出C2T框架,通过从交通-车辆动态中学习常识协调模型,结合大语言模型的常识知识,提升交通协调系统的效率、安全性和舒适性。

Comments Accepted to CVPR 2026 Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10026 2026-04-15 cs.CV 50%

LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA

LaV-CoT:具有多方面奖励优化的语言感知视觉CoT

Jing Huang, Zhiya Tan, Shutao Gong, Fanwei Zeng, Joey Tianyi Zhou, Changtao Miao, Huazhe Tan, Weibin Yao, Jianshu Li

机构 * Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) CFAR, Agency for Science, Technology and Research(科技研究局CFAR)

专题命中 安全训练 :alignment(abstract)

AI总结 LaV-CoT通过多阶段推理流程和多方面奖励优化,提升多语言视觉问答的准确性和泛化能力,实现在公开数据集上的9.5%准确率提升。

Comments Accepted by WWW 2026 Industry Track - Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12639 2026-04-14 cs.CV 50%

RoboStereo: Dual-Tower 4D Embodied World Models for Unified Policy Optimization

RoboStereo: 双塔4D具身世界模型用于统一策略优化

Ruicheng Zhang, Guangyu Chen, Zunnan Xu, Zihao Liu, Zhizhou Zhong, Mingyang Zhang, Jun Zhou, Xiu Li

机构 * Tsinghua University(清华大学) X Square Robot HKUST(香港科技大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出RoboStereo,通过双塔4D具身世界模型实现统一策略优化,解决几何幻觉和缺乏统一优化框架的问题,实验显示在细粒度操作任务中平均相对提升超过97%。

详情

展开后加载摘要…

URL PDF HTML 收藏