arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3281 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3281 篇

2601.12672 2026-01-21 cs.CV 50%

VILTA: A VLM-in-the-Loop Adversary for Enhancing Driving Policy Robustness

VILTA:一种用于增强驾驶策略鲁棒性的视觉语言模型闭环对抗者

Qimao Chen, Fang Li, Shaoqing Xu, Zhiyi Lai, Zixun Xie, Yuechen Luo, Shengyin Jiang, Hanbing Li, Long Chen, Bing Wang, Yi Zhang, Zhi-Xin Yang

专题命中 安全训练 :safety(abstract)

AI总结 VILTA通过整合视觉语言模型到闭环训练中,提升自动驾驶策略在长尾事件中的安全性和鲁棒性。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12634 2026-01-21 cs.CR cs.SE 50%

The Cost of Convenience: Identifying, Analyzing, and Mitigating Predatory Loan Applications on Android

便利的代价:识别、分析和缓解Android上的掠夺性贷款申请

Olawale Amos Akanji, Manuel Egele, Gianluca Stringhini

专题命中 安全训练 :safety(abstract)

AI总结 本文研究了Android上贷款应用的合规性问题,发现大量应用违反国家和谷歌政策,通过分析揭示敏感数据滥用,并建议加强隐私保护和技术保障。

Comments 15 pages, accepted at ACM ASIA CCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11983 2026-01-21 cs.CV 50%

An AI-IoT Based Smart Wheelchair with Gesture-Controlled Mobility, Deep Learning-Based Obstacle Detection, Multi-Sensor Health Monitoring, and Emergency Alert System

基于AI-IoT的智能轮椅:具有手势控制移动、深度学习障碍检测、多传感器健康监测和紧急警报系统

Md. Asiful Islam, Abdul Hasib, Tousif Mahmud Emon, Khandaker Tabin Hasan, A. S. M. Ahsanul Sarkar Akib

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Military Institute of Science and Technology(军事科学与技术学院) University of Frontier Technology(前沿技术大学) American International University-Bangladesh(美国国际大学-孟加拉国) Robo Tech Valley(机器人技术谷)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种基于AI-IoT的智能轮椅系统,结合手势控制、深度学习障碍检测、多传感器健康监测和紧急警报,实现安全导航与健康监测的集成解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08012 2026-01-14 cs.SE 50%

Towards Verifiably Safe Tool Use for LLM Agents

面向LLM代理工具使用的可验证安全性

Aarya Doshi, Yining Hong, Congying Xu, Eunsuk Kang, Alexandros Kapravelos, Christian Kästner

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种基于STPA的框架,通过形式化规范数据流和工具序列,实现LLM代理的可验证安全性,减少对人工标注的依赖。

Comments 4 pages, 1 figure; accepted to ICSE NIER 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07715 2026-01-13 eess.SY cs.SY 50%

Safe Navigation under Uncertain Obstacle Dynamics using Control Barrier Functions and Constrained Convex Generators

在不确定障碍动态下使用控制屏障函数和约束凸生成器的安全导航

Hugo Matias, Daniel Silvestre

专题命中 安全训练 :safety(abstract)

AI总结 本文提出利用控制屏障函数和约束凸生成器实现安全导航,通过凸优化问题转换障碍物流为CBF,适用于不确定障碍动态的代理导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04334 2026-01-09 cs.RO math.OC 50%

Autonomous Reasoning for Spacecraft Control: A Large Language Model Framework with Group Relative Policy Optimization

自主推理的航天器控制:一种基于大语言模型的框架与群体相对策略优化

Amit Jain, Richard Linares

机构 * Department of Aeronautics \& Astronautics Massachusetts Institute of Technology Cambridge, MA 02139

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种基于大语言模型和群体相对策略优化的自主推理航天器控制框架,通过两阶段训练方法生成可解释的控制策略,适用于复杂动态系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00321 2026-01-05 cs.MA 50%

Offline Multi-Agent Reinforcement Learning for 6G Communications: Fundamentals, Applications and Future Directions

离线多智能体强化学习用于6G通信:基础、应用与未来方向

Eslam Eldeeb, Hirley Alves

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种基于保守Q学习的离线多智能体强化学习算法,用于6G通信中的无线资源管理和无人机网络,旨在解决多智能体环境下的安全高效训练问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22386 2026-01-01 cs.IR 50%

OxygenREC: An Instruction-Following Generative Framework for E-commerce Recommendation

OxygenREC: 一种用于电商推荐的指令遵循生成框架

Xuegang Hao, Ming Zhang, Alex Li, Xiangyu Qian, Zhi Ma, Yanlong Zang, Shijie Yang, Zhongxuan Han, Xiaolong Ma, Jinguang Liu, Zhen Li, Zhida Jiang, Shusheng Wang, Ning Tang, Yanchen Qiao, Chenxiang Yang, Chen Sun, Jincheng Yuan, Chunhua Peng, Heng Hu, Peijun Yang, Baopeng Yuan, Caiyun Qiu, Zhaolong Xing, Haofei Yuan, Haipeng Zhang, Yuzhang Guo, Weijie Ding, Jiahua Gao, Hao Huang, Zhen Chen, Tongxuan Liu, Pinghua Gong

专题命中 安全训练 :alignment(abstract)

AI总结 OxygenREC通过快慢思考架构和语义对齐机制,实现低延迟多场景的深度推荐推理。

Comments 37 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23505 2025-12-30 cs.RO cs.SY eess.SY 50%

Robust Deep Learning Control with Guaranteed Performance for Safe and Reliable Robotization in Heavy-Duty Machinery

具有保证性能的鲁棒深度学习控制:用于重载机械中安全可靠机器人化的关键技术

Mehdi Heydari Shahna

机构 * Business Finland Partnership Project(Business Finland合作伙伴项目) Tampere(塔尔帕)

专题命中 安全训练 :safety(abstract)

AI总结 本研究提出了一种鲁棒深度学习控制框架,旨在提升重型机械在电气化和自主性转型中的安全性和可靠性,通过模块化设计和分层策略实现性能保障。

Comments Doctoral Dissertation, Tampere University

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04279 2025-12-30 cs.RO 50%

Driving Beyond Privilege: Distilling Dense-Reward Knowledge into Sparse-Reward Policies

超越特权:将密集奖励知识蒸馏到稀疏奖励策略中

Feeza Khan Khanzada, Jaerock Kwon

机构 * Department of Electrical and Computer Engineering, University of Michigan-Dearborn(电气与计算机工程系,密歇根大学迪尔伯恩分校)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出通过密集奖励蒸馏学习稀疏奖励策略,提升自动驾驶在稀疏目标上的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13021 2025-12-29 eess.SY cs.SY 50%

Safe Control of Multi-Agent Systems with Minimal Communication

多智能体系统安全控制的最小通信

Mo Yang, Jing Yu, Necmiye Ozay

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种多智能体系统中最小化通信的控制器设计方法,通过秩最小化问题和系统级合成实现安全性和协调性的保障。

Comments to appear at 2025 IEEE Conference on Decision and Control (CDC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13276 2025-12-16 cs.CV 50%

CogniEdit: Dense Gradient Flow Optimization for Fine-Grained Image Editing

CogniEdit: 密集梯度流优化用于细粒度图像编辑

Yan Li, Lin Liu, Xiaopeng Zhang, Wei Xue, Wenhan Luo, Yike Guo, Qi Tian

机构 * Hongkong University of Science and Technology(香港科学与技术大学) Huawei Company(华为公司)

专题命中 安全训练 :alignment(abstract)

AI总结 CogniEdit通过密集梯度流优化实现细粒度图像编辑,结合多模态推理与动态令牌焦点重新定位,提升指令遵循与视觉质量的平衡

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10392 2025-12-12 eess.SY cs.SY 50%

Collision-Aware Density-Driven Control of Multi-Agent Systems via Control Barrier Functions

考虑碰撞的密度驱动多智能体系统控制方法 via 控制屏障函数

Sungjun Seo, Kooktae Lee

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种结合密度驱动控制与控制屏障函数的多智能体系统控制方法,用于在存在障碍物的环境中实现安全高效的区域覆盖。

Comments 6 pages, 7 figures, Accepted for presentation at the 5th Modeling, Estimation and Control Conference (MECC 2025), Pittsburgh, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06659 2025-12-09 cs.CR 50%

The Evolution of Agentic AI in Cybersecurity: From Single LLM Reasoners to Multi-Agent Systems and Autonomous Pipelines

代理AI在网络安全中的演变:从单一LLM推理者到多代理系统和自主流水线

Vaishali Vinay

专题命中 安全训练 :safety(abstract)

AI总结 本文探讨了网络安全中代理AI从单一LLM到多代理系统的发展,分析了五代分类法及各代在推理深度、工具使用等维度的差异,并总结了当前面临的挑战。

Comments Accepted at ICAIC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06268 2025-12-09 eess.SY cs.MA cs.SY 50%

A Physics-Informed Fixed Skyroad Model for Continuous UAS Traffic Management (C-UTM)

一种融合物理信息的固定天空路模型用于连续无人机交通管理(C-UTM)

Muhammad Junayed Hasan Zahed, Hossein Rastgoftar

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种融合物理信息的固定天空路模型,用于解决低空无人机交通管理中的动态空域分配问题,通过构建多层天空路结构和连续UTM框架,提高空域利用率和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22609 2025-12-01 cs.CV cs.RO 50%

MG-Nav: Dual-Scale Visual Navigation via Sparse Spatial Memory

MG-Nav:基于稀疏空间记忆的双尺度视觉导航

Bo Wang, Jiehong Lin, Chenzhi Liu, Xinting Hu, Yifei Yu, Tianjia Liu, Zhongrui Wang, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

专题命中 安全训练 :alignment(abstract)

AI总结 MG-Nav通过稀疏空间记忆图和VGGT-adapter模块实现双尺度视觉导航,结合全局规划与局部控制,实现零样本导航的高鲁棒性与高性能。

Comments 10pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12099 2025-12-01 cs.CV 50%

TinyRS-R1: Compact Multimodal Language Model for Remote Sensing

TinyRS-R1:用于遥感的紧凑多模态语言模型

Aybora Koksal, A. Aydin Alatan

机构 * Center for the Image Analysis (OGAM) and Department of Electrical and Electronics Engineering of Middle East Technical University (METU)(图像分析中心(OGAM)和中欧技术大学(METU)电子与电气工程系)

专题命中 安全训练 :alignment(abstract)

AI总结 TinyRS-R1是一种专为遥感设计的紧凑多模态语言模型,通过四阶段训练实现高效性能,兼具推理增强与低资源消耗。

Comments Accepted to IEEE Geoscience and Remote Sensing Letters (GRSL). Code, models, and the captions for datasets are available at https://github.com/aybora/TinyRS

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20919 2025-11-27 physics.ed-ph hep-ex 50%

Virtual high voltage lab: gamified learning in a safe 3d environment

虚拟高压实验室:在安全3D环境中的游戏化学习

Vladyslav Pliuhin, Yevgen Tsegelnyk, Maria Sukhonos, Ihor Biletskyi, Sergiy Plankovskyy, Taras Sakhoshko

专题命中 安全训练 :safety(abstract)

AI总结 本研究提出一个基于Unreal Engine 5的虚拟高压实验室,通过游戏化和沉浸式技术提升学生在高压工程学习中的参与度和实践技能,增强城市能源系统韧性。

Comments 54 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20617 2025-11-26 cs.SE cs.PL 50%

Translating Large-Scale C Repositories to Idiomatic Rust

将大规模C仓库翻译为idiomatic Rust

Saman Dehghan, Tianran Sun, Tianxiang Wu, Zihan Li, Reyhaneh Jabbarvand

专题命中 安全训练 :safety(abstract)

AI总结 Rustine是一种高效自动化的C到idiomatic Rust翻译工具,实现了高质量的功能等价性,比现有方法更安全、更idiomatic且更易读。

Comments 21 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19691 2025-11-26 cs.RO 50%

Multi-Agent gatekeeper: Safe Flight Planning and Formation Control for Urban Air Mobility

多智能体守门人:面向城市空中交通的安全飞行规划与编队控制

Thomas Marshall Vielmetti, Devansh R Agrawal, Dimitra Panagou

机构 * Department of Electrical & Computer Engineering(电气与计算机工程系) Department of Robotics(机器人学系) Department of Robotics and Department of Aerospace Engineering(机器人学系和航空航天工程系)

专题命中 安全训练 :safety(abstract)

AI总结 多智能体守门人框架通过安全轨迹备份和碰撞避免算法,实现城市空中交通中的安全飞行规划与编队控制。

Comments 13 pages, 4 figures, to appear AIAA SciTech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18617 2025-11-26 cs.RO cs.CV 50%

AutoFocus-IL: VLM-based Saliency Maps for Data-Efficient Visual Imitation Learning without Extra Human Annotations

AutoFocus-IL:基于视觉语言模型的数据高效视觉模仿学习中的显著性图

Litian Gong, Fatemeh Bahrani, Yutai Zhou, Amin Banayeeanzade, Jiachen Li, Erdem Bıyık

机构 * Department of Electrical and Computer Engineering, University of California, Riverside, USA(电气与计算机工程系,加州大学河滨分校) Thomas Lord Department of Computer Science, University of Southern California, USA(汤姆斯·劳德计算机科学系,南加州大学)

专题命中 安全训练 :alignment(abstract)

AI总结 AutoFocus-IL通过视觉语言模型自动生成显著性图,提升视觉模仿学习的数据效率和泛化能力,无需额外人类标注。

Comments 8 pages, 6 figures. Code and datasets available at http://autofocus-il.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02025 2025-11-26 cs.SE 50%

SAFE: Harnessing LLM for Scenario-Driven ADS Testing from Multimodal Crash Data

SAFE: 借助LLM从多模态碰撞数据中驱动场景的ADS测试

Siwei Luo, Yang Zhang, Yao Deng, Linfeng Liang, Xi Zheng

专题命中 安全训练 :safety(abstract)

AI总结 SAFE通过多模态提取和LLM技术,提升从碰撞数据中重建真实场景和检测安全违规的能力,实现高准确率和高效生成。

Comments The paper has been accepted for publication in the proceedings of the IEEE/ACM 48th International Conference on Software Engineering to be held 12-18 April 2026 (ICSE2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19450 2025-11-26 cs.DC 50%

AI-driven Predictive Shard Allocation for Scalable Next Generation Blockchains

基于AI的预测性分片分配用于可扩展下一代区块链

M. Zeeshan Haider, Tayyaba Noreen, M. D. Assuncao, Kaiwen Zhang

专题命中 安全训练 :safety(abstract)

AI总结 本文提出PSAP协议,通过预测性分片分配提升区块链可扩展性,实验显示吞吐量提升2倍,延迟降低35%

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16986 2025-11-25 cs.CV 50%

VCE: Safe Autoregressive Image Generation via Visual Contrast Exploitation

VCE:通过视觉对比利用实现安全的自回归图像生成

Feng Han, Chao Gong, Zhipeng Wei, Jingjing Chen, Yu-Gang Jiang

专题命中 安全训练 :DPO(abstract)

AI总结 VCE通过视觉对比利用方法,有效保护自回归图像生成模型,实现对不安全内容的精确擦除并保持安全内容的完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11425 2025-11-25 cs.MA 50%

Tapas Are Free! Training-Free Adaptation of Programmatic Agents via LLM-Guided Program Synthesis in Dynamic Environments

Tapas Are Free! 通过LLM引导的程序合成实现动态环境下的免训练程序代理适应

Jinwei Hu, Yi Dong, Youcheng Sun, Xiaowei Huang

专题命中 安全训练 :safety(abstract)

AI总结 TAPA通过LLM引导的程序合成,在动态环境中实现免训练的程序代理适应,提升网络安全和群体智能任务的性能与可靠性。

Comments Extended version of the paper accepted at AAAI-26 Oral to comply with the AAAI camera-ready requirements with minor revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16958 2025-11-24 econ.TH 50%

Real Option AI: Reversibility, Silence, and the Release Ladder

实时选项AI:可逆性、沉默与释放阶梯

I. Sebastian Buhai

专题命中 安全训练 :safety(abstract)

AI总结 本文研究了AI产品发布节奏作为战略实时选项的最优执行,揭示了可逆性、沉默与释放阶梯的内生机制,以及杠杆对不可逆性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15358 2025-11-20 cs.RO 50%

Platform-Agnostic Reinforcement Learning Framework for Safe Exploration of Cluttered Environments with Graph Attention

Gabriele Calzolari, Vidya Sumathy, Christoforos Kanellakis, George Nikolakopoulos

机构 * Robotics and AI Group, Department of Computer Science, Electrical and Space Engineering, Luleå University of Technology(机器人与人工智能组,计算机科学、电气与空间工程系,吕勒奥技术大学)

专题命中 安全训练 :safety(abstract)

Comments 8 pages, 6 figures, submitted to the 2026 IEEE International Conference on Robotics & Automation

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14378 2025-11-19 physics.soc-ph 50%

Emergent Cooperative Driving Strategies for Stop-and-Go Wave Mitigation via Multi-Agent Reinforcement Learning

Raphael Korbmacher, Daniel Straub, Antoine Tordeux, Claudia Totzeck

专题命中 安全训练 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11567 2025-11-19 eess.SY cs.RO cs.SY 50%

Who Moved My Distribution? Conformal Prediction for Interactive Multi-Agent Systems

Allen Emmanuel Binny, Anushri Dixit

专题命中 安全训练 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12274 2025-11-19 cs.RO 50%

Hierarchical LLMs In-the-Loop Optimization for Real-Time Multi-Robot Target Tracking under Unknown Hazards

Yuwei Wu, Yuezhan Tao, Peihan Li, Guangyao Shi, Gaurav S. Sukhatme, Vijay Kumar, Lifeng Zhou

机构 * GRASP Lab, University of Pennsylvania(宾夕法尼亚大学GRASP实验室) Department of Electrical and Computer Engineering, Drexel University(德雷塞尔大学电气与计算机工程系) Department of Computer Science, University of Southern California(南加州大学计算机科学系)

专题命中 安全训练 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏