arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9324 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9324 篇

2605.24462 2026-05-26 cs.CE 78%

No Certificate, No Execution: Certified Traces as a Foundation for Trustworthy AI Agents

无证书,不执行:认证轨迹作为可信AI代理的基础

Xiao-Yang Liu Yanglet, Xiaodong Wang, Agostino Capponi

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 提出提案-认证-执行(PCE)架构,通过可检查的认证轨迹确保AI代理仅在策略系统允许下执行,核心原则为“无证书,不执行”。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07919 2026-05-25 cs.CV 78%

MedVIGIL: Evaluating Trustworthy Medical VLMs Under Broken Visual Evidence

MedVIGIL: 在视觉证据受损下评估可信的医学视觉语言模型

Hanqi Jiang, Junhao Chen, Mingyu Kang, Hyeokjae Kwon, Yi Pan, Lifeng Chen, Weihang You, Haozhen Gong, Ruiyu Yan, Jinglei Lv, Lin Zhao, Hui Ren, Quanzheng Li, Tianming Liu, Xiang Li

机构 * University of Georgia(佐治亚大学) Harvard Medical School(哈佛医学院) Chungbuk National University(Chungbuk国立大学) Chungnam National University Hospital(Chungnam国立大学医院) National University of Singapore(新加坡国立大学) New York University(纽约大学) University of Sydney(悉尼大学) New Jersey Institute of Technology(新泽西理工学院)

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 本文提出MedVIGIL基准,通过300例由放射科医生监督构建的扰动证据测试集,评估医学视觉语言模型在视觉证据失效时的可靠性,并引入MedVIGIL复合评分(MCS)进行审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20759 2026-05-21 cs.CR 78%

Rethinking Fraud Safety Evaluation: Multi-Round Attacks Reveal Safety-Utility Tradeoffs in Graph-Context LLM Defenders

重新思考欺诈安全评估:多轮攻击揭示图上下文LLM防御中的安全与效用权衡

Laura Jiang, Reza Ryan, Qian Li, Nasim Ferdosian

专题命中 安全评测 :safety(title,abstract)

AI总结 本文通过多轮攻击评估欺诈防御系统,发现图上下文防御在早期安全拒绝方面优于纯文本基线,但同时产生更多的良性误报,揭示了安全与效用之间的权衡。

Comments 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20881 2026-05-19 cs.SE 78%

PseudoBridge: Pseudo Code as the Bridge for Better Semantic and Logic Alignment in Code Retrieval

PseudoBridge: 伪代码作为连接语义与逻辑的桥梁以提升代码检索性能

Yixuan Li, Xinyi Liu, Weidong Yang, Ben Fei, Shuhao Li, Mingjie Zhou, Lipeng Ma

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文提出PseudoBridge框架,通过引入伪代码作为中间半结构化模态,解决自然语言与编程语言之间的语义和逻辑对齐问题,实验表明其在代码检索任务中表现优异,尤其在零样本场景中效果显著。

Comments 42 pages, 14 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17229 2026-05-19 cs.RO cs.SY eess.SY 78%

Generating Realistic Safety-Critical Scenarios for Vehicle-Pedestrian Interactions

生成车辆-行人交互的安全关键场景

Qingwen Pu, Kun Xie, Yuan Zhu, Guocong Zhai

机构 * Transportation Informatics Lab, Department of Civil and Environmental Engineering, Old Dominion University(交通信息实验室,土木与环境工程系,旧 Dominion 大学) Inner Mongolia Center for Transportation Research, Inner Mongolia University(内蒙古交通研究所,内蒙古大学) School of Transportation and Logistics, National Engineering Laboratory of Integrated Transportation Big Data Application Technology, National and Local Joint Engineering Research Center of Integrated Transportation Intelligence, Southwest Jiaotong University(交通运输学院,国家集成交通大数据应用技术工程实验室,国家与地方联合集成交通智能工程研究中心,西南交通大学)

专题命中 安全评测 :safety(title,abstract)

AI总结 本文提出了一种三阶段框架,结合现实数据与自适应模拟,生成大规模行为真实的安全关键场景,通过多智能体状态空间Transformer增强DDPG算法,在车辆-行人交互中实现了高精度的避让行为生成,最终生成了VPSCI数据集。

Comments 49 pages, 13 figures, 11 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01245 2026-05-19 cs.CR 78%

Comprehensive Vulnerability Analysis is Necessary for Trustworthy LLM-MAS

全面的漏洞分析对于可信的LLM-MAS至关重要

Pengfei He, Yue Xing, Juanhui Li, Shen Dong, Zhenwei Dai, Xianfeng Tang, Hui Liu, Han Xu, Zhen Xiang, Charu C. Aggarwal, Hui Liu

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 本文探讨了构建可信LLM-MAS需进行全面漏洞分析,提出统一框架以量化不同架构中的漏洞,并识别关键挑战如构建专用评估基准和实现安全信任管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10485 2026-05-12 cs.RO 78%

VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models

VEGA:面向空间感知的视觉编码器对齐用于视觉-语言-动作模型

Hao Wang, Xiaobao Wei, Jingyang He, Chengyu Bai, Chun-Kai Fan, Jiajun Cao, Jintao Chen, Ying Li, Shanyu Rong, Ming Lu, Xiaozhu Ju, Jian Tang, Shanghang Zhang

机构 * Peking University(北京大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 安全评测 :alignment(title,abstract)

AI总结 VEGA通过直接对齐视觉编码器输出与空间感知特征,提升视觉-语言-动作模型的空间意识,实现更可解释的对齐目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10484 2026-05-12 cs.CV cs.RO 78%

OpenSGA: Efficient 3D Scene Graph Alignment in the Open World

OpenSGA: 在开放世界中高效的3D场景图对齐

Gang Chen, Sebastián Barbas Laina, Stefan Leutenegger, Javier Alonso-Mora

机构 * Autonomous Multi-Robots Lab, Department of Cognitive Robotics, School of Mechanical Engineering, Delft University of Technology, 2628 CD, Delft, Netherlands(代尔夫特理工大学机械工程学院认知机器人学系自主多机器人实验室) Mobile Robotics Lab, School of Computation, Information and Technology, Technical University of Munich(慕尼黑技术大学计算、信息与技术学院移动机器人实验室)

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文提出OpenSGA框架,通过融合视觉-语言、文本和几何特征实现高效的3D场景图对齐,包含空间注意力编码器、最小成本流分配器和全局场景嵌入生成器模块,实验表明在F2S和S2S任务中表现最佳。

Comments 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01266 2026-05-05 cs.CV 78%

Exploring Prompt Alignment with Clinical Factors in Zero-Shot Segmentation VLMs for NSCLC Tumor Segmentation

探索临床因素在零样本分割VLMs中的提示对齐用于NSCLC肿瘤分割

Suraj Pai, Thibault Heintz, Cosmin Ciausu, Marion Tonneau, Hugo Aerts, Raymond Mak

机构 * Artificial Intelligence in Medicine Program, Mass General Brigham, Harvard Medical School, USA(麻省总医院布里奇沃特医学中心人工智能医学项目,哈佛医学院,美国)

专题命中 安全评测 :alignment(title,abstract)

AI总结 研究通过分析VoxTell在NSCLC肿瘤数据集上的提示对齐方向,发现解剖位置主导空间注意力,零样本分割VLMs在NSCLC肿瘤分割中表现优于其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23831 2026-04-28 cs.AR cs.SY eess.SY 78%

Architectural Isolation as a Timing Safety Primitive for Edge AI Medical Devices: Controlled Experimental Evidence on a Shared-Silicon Platform

架构隔离作为边缘AI医疗设备的定时安全原语:在共享硅平台上的受控实验证据

Akul Mallayya Swami

专题命中 安全评测 :safety(title,abstract)

AI总结 研究通过受控实验验证架构隔离在保持准确性与输出稳定性的同时,如何影响边缘AI医疗设备的定时约束,提出联合STER和延迟验证作为FDA指南的候选方法。

Comments 10 pages, 3 figures, 5 tables. Submitted to IEEE Embedded Systems Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16198 2026-04-20 cs.SE 78%

Bridging the Gap between User Intent and LLM: A Requirement Alignment Approach for Code Generation

弥合用户意图与大语言模型之间的鸿沟:一种用于代码生成的需求对齐方法

Jia Li, Ruiqi Bai, Yangkang Luo, Yiran Zhang, Wentao Yang, Zeyu Sun, Tiankuo Zhao, Dongming Jin, Lei Li, Zhi Jin

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文提出REA-Coder方法,通过需求对齐提升大语言模型的代码生成性能,实验表明其在多个编程基准测试中表现优异,平均提升率达7.93%至30.25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12411 2026-04-15 cs.CV 78%

DeferredSeg: A Multi-Expert Deferral Framework for Trustworthy Medical Image Segmentation

DeferredSeg: 一种多专家延迟框架用于可信的医学图像分割

Qiuyu Tian, Haoliang Sun, Yunshan Wang, Yinghuan Shi, Yilong Yin

机构 * School of Software, Shandong University(山东大学软件学院) Department of Clinical Laboratory, Shandong Provincial Hospital Affiliated to Shandong First Medical University(山东第一医科大学附属山东省人民医院临床检验科) School of Computer Science and Technology, Nanjing University(南京大学计算机科学与技术学院)

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 DeferredSeg通过引入延迟感知分割框架,在医学图像分割中实现人机协作,通过动态路由和损失函数提升分割可靠性,优于基线方法。

Comments 27 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11686 2026-04-14 cs.IR 78%

EA-Agent: A Structured Multi-Step Reasoning Agent for Entity Alignment

EA-Agent:一种用于实体对齐的结构化多步推理代理

Yixuan Nan, Xixun Lin, Yanmin Shang, Ge Zhang, Zheng Fang, Fang Fang, Yanan Cao

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文提出EA-Agent,通过多步规划与执行将实体对齐转化为结构化推理过程,引入属性和关系三元组选择器提升效率,实验表明其在三个基准数据集上均优于现有方法。

Comments ACL 2026,Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08089 2026-04-10 cs.SE 78%

GALA: Multimodal Graph Alignment for Bug Localization in Automated Program Repair

GALA: 多模态图对齐用于自动化程序修复中的缺陷定位

Zhuoyao Liu, Zhengran Zeng, Shu-Dong Huang, Yang Liu, Shikun Zhang, Wei Ye

专题命中 安全评测 :alignment(title,abstract)

AI总结 GALA通过多模态图对齐方法,解决GUI截图场景下自动化程序修复的缺陷定位问题,通过结构化推理提升视觉与代码的映射精度。

Comments Code available at: https://github.com/lzyyyyy666/GALA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04772 2026-04-07 math.OC cs.SY eess.SY 78%

Collaborative Altruistic Safety in Coupled Multi-Agent Systems

耦合多智能体系统中的协作利他安全

Brooks A. Butler, Xiao Tan, Aaron D. Ames, Magnus Egerstedt

专题命中 安全评测 :safety(title,abstract)

AI总结 本文提出一种基于协作控制屏障函数的框架,通过协作控制确保动态耦合多智能体系统的安全性,利用哈密顿规则定义利他安全条件,提升系统整体安全性和鲁棒性。

Comments This work is to appear at the 2026 American Control Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04496 2026-04-07 cs.CV 78%

The Indra Representation Hypothesis for Multimodal Alignment

多模态对齐的Indra表示假说

Jianglin Lu, Hailing Wang, Kuo Yang, Yitian Zhang, Simon Jenni, Yun Fu

机构 * Northeastern University(东北大学) Adobe Research(Adobe研究院)

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文提出Indra表示假说,通过范畴论中的V富化Yoneda嵌入,定义样本间关系轮廓,提升多模态对齐的鲁棒性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03341 2026-04-07 stat.AP physics.ao-ph stat.ML 78%

Generative Unsupervised Downscaling of Climate Models via Domain Alignment: Application to Wind Fields

通过域对齐生成无监督降尺度:应用于风场

Julie Keisler, Boutheina Oueslati, Anastase Charantonis, Yannig Goude, Claire Monteleoni

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文提出基于域对齐的生成模型,用于多变量风场降尺度与偏差校正,提升空间一致性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27139 2026-04-07 cs.CV 78%

The Geometry of Robustness: Optimizing Loss Landscape Curvature and Feature Manifold Alignment for Robust Finetuning of Vision-Language Models

鲁棒性几何:优化损失景观曲率和特征流形对齐以增强视觉-语言模型的鲁棒微调

Shivang Chopra, Shaunak Halbe, Chengyue Huang, Brisa Maneechotesuwan, Zsolt Kira

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文提出GRACE框架,通过联合调节参数空间曲率和特征空间不变性,提升视觉-语言模型在分布内准确率、分布外泛化和对抗鲁棒性之间的平衡,实验显示在ImageNet微调中ID准确率提升10.8%,对抗准确率提升13.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23304 2026-03-25 cs.CR 78%

Security Barriers to Trustworthy AI-Driven Cyber Threat Intelligence in Finance: Evidence from Practitioners

可信AI驱动的金融网络安全威胁情报中的安全障碍:来自实践者的证据

Emir Karaosman, Advije Rizvani, Irdin Pekaric

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 研究探讨金融机构在使用AI驱动的威胁情报时面临的安全障碍,结合文献综述、访谈和调查,识别出四个阻碍可信AI部署的社会技术失败模式,并提出三种安全操作保障措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23814 2026-03-24 cs.CR 78%

Beyond the TESSERACT:Trustworthy Dataset Curation for Sound Evaluations of Android Malware Classifiers

超越TESSERACT:为Android恶意软件分类器提供可信的数据集编纂

Theo Chow, Mario D'Onghia, Lorenz Linhardt, Zeliang Kan, Daniel Arp, Lorenzo Cavallaro, Fabio Pierazzi

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 本文探讨了Android恶意软件分类器评估中数据集编纂的重要性,识别了五个影响性能差异的新因素,提出了可信数据集编纂的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21104 2026-03-24 cs.RO cs.CV 78%

CounterScene: Counterfactual Causal Reasoning in Generative World Models for Safety-Critical Closed-Loop Evaluation

CounterScene: 生成世界模型中的反事实因果推理用于安全关键闭环评估

Bowen Jing, Ruiyang Hao, Weitao Zhou, Haibao Yu

机构 * Tuojing Intelligence(途京智能) King's College London(伦敦大学国王学院) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 安全评测 :safety(title,abstract)

AI总结 CounterScene通过结构化反事实推理生成安全关键驾驶场景,通过因果对抗代理识别和冲突感知交互世界模型,提升长周期碰撞率并保持轨迹真实性。

Comments 28 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20721 2026-03-24 cs.CV 78%

Cross-modal Fuzzy Alignment Network for Text-Aerial Person Retrieval and A Large-scale Benchmark

跨模态模糊对齐网络用于文本-空中人检索及一个大规模基准

Yifei Deng, Chenglong Li, Yuyang Zhang, Guyue Hu, Jin Tang

机构 * State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology(光电信息采集与防护技术国家重点实验室) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) The University of Hong Kong(香港大学)

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文提出跨模态模糊对齐网络,通过模糊逻辑量化token级可靠性,结合地面图像作为桥梁代理,提升文本与空中图像的语义对齐鲁棒性,并构建了大规模基准数据集AERI-PEDES。

Comments Accepted by CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19228 2026-03-20 cs.CV 78%

SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editing

SAMA:用于指令引导视频编辑的因子化语义锚定与运动对齐

Xinyao Zhang, Wenkai Dong, Yuxin Song, Bo Fang, Qi Zhang, Jing Wang, Fan Chen, Hui Zhang, Haocheng Feng, Yu Lu, Hang Zhou, Chun Yuan, Jingdong Wang

机构 * Baidu(百度) Tsinghua University(清华大学) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

专题命中 安全评测 :alignment(title,abstract)

AI总结 SAMA通过因子化语义锚定和运动对齐方法,在无需外部先验知识的情况下实现精确语义修改与运动保真的平衡,展示了强大的零样本视频编辑能力。

Comments 24 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17647 2026-03-19 cs.CV 78%

Part-Aware Open-Vocabulary 3D Affordance Grounding via Prototypical Semantic and Geometric Alignment

面向部分的开放词汇3D功能接地 via 语义和几何对齐

Dongqiang Gou, Xuming He

机构 * ShanghaiTech University(上海科技大学)

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文提出一种双阶段跨模态框架,通过增强语义和几何表示,解决开放词汇3D功能接地中的语义一致性、几何对齐和开放词汇泛化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15655 2026-03-18 cs.LG cs.AI cs.CL cs.IT cs.MA math.IT 78%

Beyond Reward Suppression: Reshaping Steganographic Communication Protocols in MARL via Dynamic Representational Circuit Breaking

超越奖励压制:通过动态表示电路断开重塑MARL中的隐写通信协议

Liu Hung Ming

机构 * PARRAWA AI(PARRAWA人工智能)

专题命中 安全评测 :safety(abstract,comments);AI safety(abstract,comments);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出动态表示电路断开机制,用于检测MARL中的隐写协作,通过统计对象转换和动态干预提升观测准确性并降低波动性。

Comments 38 pages, includes 5 figures and 8 tables, preliminary version, AI safety / multi-agent reinforcement learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20744 2026-03-12 cs.SE 78%

From Law to Gherkin: A Human-Centred Quasi-Experiment on the Quality of LLM-Generated Behavioural Specifications from Food-Safety Regulations

从法律到Gherkin:一项以人类为中心的准实验,探讨LLM生成的行为规范质量

Shabnam Hassani, Mehrdad Sabetzadeh, Daniel Amyot

专题命中 安全评测 :safety(title,abstract)

AI总结 本文通过准实验评估LLMs从法律文本生成Gherkin规范的能力,发现其在相关性和清晰性方面表现良好,但需人类监督以纠正遗漏和幻觉。

Comments This article has been accepted for publication in Information and Software Technology (IST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07134 2026-03-10 cs.HC 78%

More Than 1v1: Human-AI Alignment in Early Developmental Communities with Multimodal LLMs

多于一对一:在早期发展社区中的人工智能对齐与多模态大语言模型

Weiyan Shi, Kenny Tsu Wei Choo

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文探讨了在早期发展社区中,利用多模态大语言模型实现人机对齐的挑战,提出分层社区对齐框架,强调社区治理而非个体优化。

Comments Accepted at CHI 2026 BiAlign Workshop; OpenReview URL: https://openreview.net/forum?id=ikeH0hsBLN

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05936 2026-03-09 cs.CV 78%

OD-RASE: Ontology-Driven Risk Assessment and Safety Enhancement for Autonomous Driving

基于本体的风险评估与安全增强:面向自动驾驶

Kota Shimomura, Masaki Nambata, Atsuya Ishikawa, Ryota Mimura, Takayuki Kawabuchi, Takayoshi Yamashita, Koki Inoue

机构 * Chubu University(楚鸟大学) Elith Inc.(Elith公司) Honda R&D Co., Ltd.(本田研发公司)

专题命中 安全评测 :safety(title,abstract)

AI总结 OD-RASE通过本体驱动的数据过滤和视觉语言模型生成,提升自动驾驶系统对事故诱因道路结构的预测和改进能力,增强交通环境的安全性。

Comments Accepted ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22773 2026-03-09 cs.SE 78%

A Structured Approach to Safety Case Construction for AI Systems

面向AI系统的安全案例构建的结构化方法

Sung Une Lee, Liming Zhu, Md Shamsujjoha, Liming Dong, Qinghua Lu, Jieshan Chen, Lionel Briand

专题命中 安全评测 :safety(title,abstract)

AI总结 本文提出了一种面向AI系统的结构化安全案例构建方法,通过定义特定于AI的声明类型、论点类型和证据家族,提供可重用的模板以应对AI系统动态变化的风险特征。

Comments 45 pages, 8 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05255 2026-03-06 cs.CV 78%

CATNet: Collaborative Alignment and Transformation Network for Cooperative Perception

CATNet:用于协作感知的协同对齐与变换网络

Gong Chen, Chaokun Zhang, Tao Tang, Pengcheng Lv, Feng Li, Xin Xie

机构 * School of Computer Science and Technology, Tianjin University(计算机科学与技术学院,天津大学) School of Cybersecurity, Tianjin University(网络安全学院,天津大学) School of Future Technology, Tianjin University(未来技术学院,天津大学)

专题命中 安全评测 :alignment(title,abstract)

AI总结 CATNet通过时空同步、小波去噪和自适应选择器提升多代理协作感知的鲁棒性和适应性。

Comments Accepted by CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏