arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3281 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3281 篇

2603.01035 2026-03-03 cs.HC 50%

From Human Negotiation to Agent Negotiation: Personal Mobility Agents in Automated Traffic

从人类协商到智能体协商:个人移动智能体在自动化交通中的应用

Pascal Jansen

专题命中 安全训练 :safety(abstract)

AI总结 本文提出个人移动智能体,通过代理用户偏好与安全规则协商交通行为,解决自动化交通中用户与系统冲突的问题。

Comments Position Paper at the CHI 2026 Workshop AutomationXP26: Agentic Automation Experiences - Rethinking the Interaction of Humans and AI Agents. April 14, 2026. Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00913 2026-03-03 cs.RO 50%

Minimalist Compliance Control

极简合规控制

Haochen Shi, Songbo Hu, Yifan Hou, Weizhuo Wang, Karen Liu, Shuran Song

专题命中 安全训练 :safety(abstract)

AI总结 极简合规控制通过仅使用电机电流或电压信号实现无需力传感器的合规控制,适用于多种机器人和规划方法。

Comments Project website: https://minimalist-compliance-control.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23993 2026-03-03 cs.CV cs.RO 50%

Advancing Multi-agent Traffic Simulation via R1-Style Reinforcement Fine-Tuning

通过R1风格强化微调推进多智能体交通模拟

Muleilan Pei, Shaoshuai Shi, Shaojie Shen

机构 * Hong Kong University of Science and Technology(香港理工大学) Voyager Research, Didi Chuxing(Voyager研究,滴滴出行)

专题命中 安全训练 :alignment(abstract)

AI总结 SMART-R1通过R1风格强化微调提升多智能体交通模拟的现实度与性能

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23896 2026-03-02 cs.RO 50%

TSC: Topology-Conditioned Stackelberg Coordination for Multi-Agent Reinforcement Learning in Interactive Driving

TSC:基于拓扑条件的Stackelberg协调用于交互驾驶中的多智能体强化学习

Xiaotong Zhang, Gang Xiong, Yuanjing Wang, Siyu Teng, Alois Knoll, Long Chen

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Department of Natural Sciences, University of Durham(达勒姆大学自然科学系) College of Civil and Transportation Engineering, Shenzhen University(深圳大学土木与交通工程学院) Chair of Robotics, Artificial Intelligence and Realtime Systems, Technical University of Munich(慕尼黑技术大学机器人、人工智能与实时系统教授职位)

专题命中 安全训练 :safety(abstract)

AI总结 TSC通过拓扑条件的Stackelberg协调方法,在无通信执行下实现密集交通中的去中心化多智能体强化学习,提升训练稳定性和安全性。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19110 2026-02-24 physics.plasm-ph 50%

Machine learning prediction of plasma behavior from discharge configurations on WEST

基于WEST磁约束装置放电配置的机器学习预测等离子体行为

Chenguang Wan, Feda Almuhisen, Philippe Moreau, Remy Nouailletas, Zhisong Qu, Youngwoo Cho, Robin Varennes, Kyungtak Lim, Kunpeng Li, Jia Huang, Weidong Chen, Jiangang Li, Xavier Garbet

专题命中 安全训练 :safety(abstract)

AI总结 本研究提出基于变换器的机器学习模型,用于预测WEST托卡马克的关键等离子体参数,实现快速放电规划与实时控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11995 2026-02-24 cs.MA 50%

Compositionally Safe Construction of Autonomous Driving Systems

基于组成安全性的自动驾驶系统构建

Marius Bozga, Joseph Sifakis

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种基于组成安全性的自动驾驶系统构建方法,通过协调执行驾驶操作来确保安全,采用分阶段控制策略,涵盖主要驾驶任务。

Comments 34 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18967 2026-02-24 cs.RO 50%

TactEx: An Explainable Multimodal Robotic Interaction Framework for Human-Like Touch and Hardness Estimation

TactEx:一种可解释的多模态机器人交互框架,用于类人触觉和硬度估计

Felix Verstraete, Lan Wei, Wen Fan, Dandan Zhang

专题命中 安全训练 :alignment(abstract)

AI总结 TactEx通过融合视觉、触觉和语言模态,实现类人触觉和硬度估计,展示了在水果成熟度评估中的高任务成功率和可解释性。

Comments Accepted by 2026 ICRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17415 2026-02-20 cs.RO cs.SY eess.SY 50%

Distributed Virtual Model Control for Scalable Human-Robot Collaboration in Shared Workspace

分布式虚拟模型控制用于可扩展的人机协作在共享工作空间

Yi Zhang, Omar Faris, Chapa Sirithunge, Kai-Fung Chu, Fumiya Iida, Fulvio Forni

机构 * Department of Engineering, University of Cambridge(工程系,剑桥大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种分布式虚拟模型控制框架,通过去中心化方法实现安全的人机协作,有效解决死锁问题并提升协作效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17078 2026-02-20 cs.MA 50%

Safe Continuous-time Multi-Agent Reinforcement Learning via Epigraph Form

通过epigraph形式实现安全的连续时间多智能体强化学习

Xuefeng Wang, Lei Zhang, Henglin Pu, Husheng Li, Ahmed H. Qureshi

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种基于epigraph形式的连续时间约束MDP框架,通过物理信息神经网络实现稳定高效的连续时间多智能体强化学习,验证了方法在安全环境中的有效性。

Comments Accepted by ICLR 2026. 27 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12638 2026-02-16 eess.SY cs.SY 50%

Safe Controller Synthesis Using Lyapunov-based Barriers for Linear Hybrid Systems with Simplex Architecture

利用Lyapunov基屏障的安全控制器合成用于具有简单架构的线性混合系统

Sunandan Adhikary, Soumyajit Dey

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种基于Lyapunov基屏障的安全控制器合成方法,旨在通过切换不同执行速率的BSC来实现最大安全性和及时恢复,同时优化控制计算的带宽使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07960 2026-02-10 cs.CV 50%

D-ORCA: Dialogue-Centric Optimization for Robust Audio-Visual Captioning

D-ORCA:面向鲁棒音频视觉描述的对话中心优化

Changli Tang, Tianyi Wang, Fengyun Rao, Jing Lyu, Chao Zhang

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)

专题命中 安全训练 :alignment(abstract)

AI总结 D-ORCA通过对话中心优化,提升音频视觉描述的鲁棒性和准确性,填补开源生态关键空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06971 2026-02-10 cs.RO 50%

Formal Methods in Robot Policy Learning and Verification: A Survey on Current Techniques and Future Directions

机器人策略学习与验证中的形式方法:对当前技术与未来方向的综述

Anastasios Manganaris, Vittorio Giammarino, Ahmed H. Qureshi, Suresh Jagannathan

专题命中 安全训练 :safety(abstract)

AI总结 本文综述了形式方法在机器人策略学习与验证中的应用,探讨了当前技术及未来发展方向,旨在提升机器人系统的安全性和正确性。

Comments 19 Pages. 6 Figures. Published in Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04188 2026-02-09 cs.CV 50%

DiMo: Discrete Diffusion Modeling for Motion Generation and Understanding

DiMo:用于运动生成与理解的离散扩散建模

Ning Zhang, Zhengyu Li, Kwong Weng Loh, Mingxi Xu, Qi Wang, Zhengyu Wen, Xiaoyu He, Wei Zhao, Kehong Gong, Mingyuan Zhang

机构 * Huawei Central Media Technology Institute(华为中央媒体技术研究所) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 安全训练 :alignment(abstract)

AI总结 DiMo提出了一种离散扩散式框架,实现双向文本-运动理解和生成,通过迭代掩码标记细化提升运动质量和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04803 2026-02-05 eess.SP 50%

Safe-NEureka: a Hybrid Modular Redundant DNN Accelerator for On-board Satellite AI Processing

Safe-NEureka: 一种用于卫星 onboard AI 处理的混合模块冗余 DNN 加速器

Riccardo Tedeschi, Luigi Ghionda, Alessandro Nadalini, Yvan Tortorella, Arpan Suravi Prasad, Luca Benini, Davide Rossi, Francesco Conti

专题命中 安全训练 :safety(abstract)

AI总结 Safe-NEureka 是一种用于卫星 onboard AI 处理的混合模块冗余 DNN 加速器,结合冗余保护与性能优化,适用于安全关键和性能关键任务。

Comments 22 pages, 13 figures, ACM journal format

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03248 2026-02-04 cs.RO physics.app-ph physics.optics 50%

A thin and soft optical tactile sensor for highly sensitive object perception

一种薄而柔软的光学触觉传感器用于高灵敏度物体感知

Yanchen Shen, Kohei Tsuji, Haruto Koizumi, Jiseon Hong, Tomoaki Niiyama, Hiroyuki Kuwabara, Hayato Ishida, Jun Hiramitsu, Mitsuhito Mase, Satoshi Sunada

机构 * Graduate School of Natural Science and Technology, Kanazawa University(自然科学技术研究生院,金泽大学) Faculty of Mechanical Engineering, Institute of Science and Engineering, Kanazawa University(机械工程学部,科学工程研究所,金泽大学) Hamamatsu Photonics K.K.(Hamamatsu光子株式会社)

专题命中 安全训练 :alignment(abstract)

AI总结 本研究提出了一种薄而柔软的光学触觉传感器,通过散射图案变化实现高灵敏度的力测量和纹理识别,适用于软机器人和可穿戴设备。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01916 2026-02-03 cs.RO 50%

ForSim: Stepwise Forward Simulation for Traffic Policy Fine-Tuning

ForSim:基于逐步前向模拟的交通策略微调

Keyu Chen, Wenchao Sun, Hao Cheng, Zheng Fu, Sifa Zheng

机构 * School of Vehicle and Mobility, Tsinghua University(车辆与移动系统学院,清华大学)

专题命中 安全训练 :safety(abstract)

AI总结 ForSim通过逐步闭环前向模拟范式提升交通模拟的保真度,结合组相对优化微调交通策略,提高安全性与效率。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19016 2026-02-03 cs.CR 50%

DREAM: Dynamic Red-teaming across Environments for AI Models

DREAM: 为AI模型跨环境动态红队测试

Liming Lu, Xiang Gu, Junyu Huang, Jiawei Du, Xu Zheng, Yunhuai Liu, Yongbin Zhou, Shuchao Pang

专题命中 安全训练 :safety(abstract)

AI总结 DREAM通过动态多阶段攻击测试揭示LLM代理在跨环境安全中的关键漏洞,指出上下文脆弱性和长期恶意意图追踪不足,并提出评估工具以提升防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22221 2026-02-03 cs.CV 50%

Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models

迈向遥感中的可信推理:一种基于感知的地理空间思维链用于视觉-语言模型

Jiaqi Liu, Lang Sun, Ronghao Fu, Bo Yang

机构 * Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education(教育部符号计算与知识工程重点实验室)

专题命中 安全训练 :alignment(abstract)

AI总结 本研究提出Geo-CoT框架,通过两阶段策略提升遥感VLMs的推理能力,实现可验证的多步骤分析,显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01129 2026-02-03 cs.CR 50%

SMCP: Secure Model Context Protocol

SMCP: 安全模型上下文协议

Xinyi Hou, Shenao Wang, Yifan Zhang, Ziluo Xue, Yanjie Zhao, Cai Fu, Haoyu Wang

专题命中 安全训练 :prompt injection(abstract)

AI总结 SMCP通过统一身份管理、强认证和细粒度策略执行,提升智能体系统在工具调用中的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15587 2026-02-02 cond-mat.soft cs.MA physics.bio-ph 50%

Learning to flock in open space by avoiding collisions and staying together

在开放空间中通过避障和保持在一起学习群体运动

Martino Brambati, Antonio Celani, Marco Gherardi, Francesco Ginelli

专题命中 安全训练 :alignment(abstract)

AI总结 该研究通过多智能体强化学习框架,在开放空间中实现群体协同运动,通过避障和保持在一起的策略,产生高极性秩序的集体运动。

Comments 13 pages + appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22680 2026-02-02 cs.CV 50%

Visual Personalization Turing Test

视觉个性化图灵测试

Rameen Abdal, James Burgess, Sergey Tulyakov, Kuan-Chieh Jackson Wang

机构 * Snap Research(Snap研究)

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出视觉个性化图灵测试,通过感知不可区分性评估个性化生成模型,引入VPTT框架和评分指标,验证其在人类和VLM判断中的可靠性。

Comments Webpage: https://snap-research.github.io/vptt

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22295 2026-02-02 math.OC 50%

Operating Imperfect AI: Reliability Drift and Human Congestion

操作不完美的AI:可靠性漂移与人类拥堵

Ziyao Wang, Svetlozar T Rachev

专题命中 安全训练 :safety(abstract)

AI总结 本文提出动态排队控制方法,解决算法可靠性漂移与人类接管能力稀缺之间的矛盾,通过容量影子价格驱动最优策略,建立拥堵缓解与安全缓冲机制,并识别容量相变临界点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21510 2026-01-30 nlin.CD 50%

From Basins to safe sets: a machine learning perspective on chaotic dynamics

从盆地到安全集:从机器学习视角看混沌动力学

David Valle, Alexandre Wagemakers, Miguel A. F. Sanjuán

专题命中 安全训练 :safety(abstract)

AI总结 本文从机器学习视角探讨混沌动力学,展示数据驱动方法在加速经典任务和实现可扩展干预方面的潜力。

Comments Chaos control, machine learning, neural networks, basins of attraction, transient chaos

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19750 2026-01-29 cs.MM cs.CV cs.IR 50%

Benchmarking Multimodal Large Language Models for Missing Modality Completion in Product Catalogues

在电子商务目录中评估多模态大语言模型用于缺失模态补全

Junchen Fu, Wenhao Deng, Kaiwen Zheng, Ioannis Arapakis, Yu Ye, Yongxin Ni, Joemon M. Jose, Xuri Ge

机构 * University of Glasgow(格拉斯哥大学) Telefónica Scientific Research(电信科研机构) National University of Singapore(新加坡国立大学) Shandong University(山东大学)

专题命中 安全训练 :alignment(abstract)

AI总结 本文研究了多模态大语言模型在电子商务目录中补全缺失模态的能力,通过MMPCBench基准测试发现MLLMs在细粒度对齐上存在不足,并探索了GRPO方法以提升补全效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03906 2026-01-27 cs.CV 50%

From Filters to VLMs: Benchmarking Defogging Methods through Object Detection and Segmentation Performance

从滤波器到视觉语言模型:通过目标检测和分割性能评估去雾方法

Ardalan Aryashad, Parsa Razmara, Amin Mahjoub, Seyedarmin Azizi, Mahdi Salmani, Arad Firouzkouhi

机构 * University of Southern California(南加州大学)

专题命中 安全训练 :alignment(abstract)

AI总结 本文通过目标检测和分割性能评估,探讨了去雾方法在真实与合成环境中的有效性,揭示了视觉语言模型在恶劣天气下的应用潜力。

Comments Accepted at WACV 2026 Proceedings (Oral), 5th Workshop on Image, Video, and Audio Quality Assessment in Computer Vision, with a focus on VLM and Diffusion Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17107 2026-01-27 cs.CV 50%

StealthMark: Harmless and Stealthy Ownership Verification for Medical Segmentation via Uncertainty-Guided Backdoors

StealthMark: 通过不确定性引导后门实现医疗分割的无害且隐蔽的所有权验证

Qinkai Yu, Chong Zhang, Gaojie Jin, Tianjin Huang, Wei Zhou, Wenhui Li, Xiaobo Jin, Bo Huang, Yitian Zhao, Guang Yang, Gregory Y. H. Lip, Yalin Zheng, Aline Villavicencio, Yanda Meng

机构 * Computer Science Department, University of Exeter(埃克塞特大学计算机科学系) Bioengineering Program, Biological and Environmental Science and Engineering Division (BESE), King Abdullah University of Science and Technology (KAUST)(科廷大学科学与技术学院生物工程项目) School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学分校高级技术学院) School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院) College of Optoelectronic Engineering, Chongqing University(重庆大学光电工程学院) Ningbo Cixi Institute of Biomedical Engineering, Chinese Academy of Sciences(宁波慈溪生物医学工程研究所,中国科学院) School of Bioengineering, Imperial College London(伦敦帝国理工学院生物工程学院) Liverpool Centre for Cardiovascular Science at University of Liverpool, Liverpool John Moores University and Liverpool Heart & Chest Hospital(利物浦大学心血管科学中心,利物浦约翰摩尔斯大学,利物浦心脏和胸科医院) Eye and Vision Department, University of Liverpool(利物浦大学眼科学与视觉科学系)

专题命中 安全训练 :harmlessness(abstract)

AI总结 StealthMark通过不确定性引导后门实现医疗分割模型的隐蔽无害所有权验证,有效提升模型安全性与实用性。

Comments 15 pages,7 figures. Accepted to IEEE Transactions on Image Processing (TIP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15115 2026-01-22 cs.CV 50%

Training-Free and Interpretable Hateful Video Detection via Multi-stage Adversarial Reasoning

无需训练的多阶段对抗推理 hateful 视频检测

Shuonan Yang, Yuchen Zhang, Zeyu Fu

机构 * Multimodal Intelligence Lab, Department of Computer Science, University of Exeter, United Kingdom(埃克塞特大学计算机科学系多模态智能实验室) Institute for Analytics and Data Science, University of Essex, United Kingdom(埃塞克斯大学分析与数据科学研究所)

专题命中 安全训练 :safety(abstract)

AI总结 MARS通过多阶段对抗推理框架实现无需训练的可解释仇恨视频检测,提升检测可靠性与透明度。

Comments Accepted at ICASSP 2026. \c{opyright} 2026 IEEE. This is the author accepted manuscript. The final published version will be available via IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14324 2026-01-22 cs.HC 50%

When Generative AI Is Intimate, Sexy, and Violent: Examining Not-Safe-For-Work (NSFW) Chatbots on FlowGPT

当生成AI变得亲密、性感和暴力:检验FlowGPT上的不适宜内容聊天机器人

Xian Li, Yuanning Han, Di Liu, Pengcheng An, Shuo Niu

专题命中 安全训练 :safety(abstract)

AI总结 研究分析FlowGPT上NSFW聊天机器人的类型及用户互动,揭示虚拟亲密、性幻想、暴力表达等特征,提出对聊天机器人设计和内容审核的启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06136 2026-01-22 cs.CR 50%

"Abuse Risks are Often Inherent to Product Features": Exploring AI Vendors' Bug Bounty and Responsible Disclosure Policies

滥用风险往往与产品特性相关

Yangheran Piao, Jingjie Li, Daniel W. Woods

专题命中 安全训练 :alignment(abstract)

AI总结 本文研究了AI供应商在漏洞赏金和负责任披露政策中的风险与实践,发现36%的供应商无明确政策,且数据访问等漏洞最常被纳入范围,而劫持等漏洞则被排除。

Comments At USENIX Security Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13057 2026-01-21 eess.SY cs.SY 50%

Convex Model Predictive Control for Safe Output Consensus of Nonlinear Multi-Agent Systems

凸优化模型预测控制用于非线性多智能体系统的安全输出一致性

Chao Wang, Shuyuan Zhang, Lei Wang

专题命中 安全训练 :safety(abstract)

AI总结 本文提出基于SQP方案的凸模型预测控制方法,通过线性化和凸化非线性约束,有效降低计算复杂度,实现在非线性多智能体系统中的安全输出一致性控制。

详情

展开后加载摘要…

URL PDF HTML 收藏