No Certificate, No Execution: Certified Traces as a Foundation for Trustworthy AI Agents
无证书,不执行:认证轨迹作为可信AI代理的基础
专题命中 安全评测 :trustworthy(title,abstract)
AI总结 提出提案-认证-执行(PCE)架构,通过可检查的认证轨迹确保AI代理仅在策略系统允许下执行,核心原则为“无证书,不执行”。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
无证书,不执行:认证轨迹作为可信AI代理的基础
专题命中 安全评测 :trustworthy(title,abstract)
AI总结 提出提案-认证-执行(PCE)架构,通过可检查的认证轨迹确保AI代理仅在策略系统允许下执行,核心原则为“无证书,不执行”。
MedVIGIL: 在视觉证据受损下评估可信的医学视觉语言模型
机构 * University of Georgia(佐治亚大学) ; Harvard Medical School(哈佛医学院) ; Chungbuk National University(Chungbuk国立大学) ; Chungnam National University Hospital(Chungnam国立大学医院) ; National University of Singapore(新加坡国立大学) ; New York University(纽约大学) ; University of Sydney(悉尼大学) ; New Jersey Institute of Technology(新泽西理工学院)
专题命中 安全评测 :trustworthy(title,abstract)
AI总结 本文提出MedVIGIL基准,通过300例由放射科医生监督构建的扰动证据测试集,评估医学视觉语言模型在视觉证据失效时的可靠性,并引入MedVIGIL复合评分(MCS)进行审计。
重新思考欺诈安全评估:多轮攻击揭示图上下文LLM防御中的安全与效用权衡
专题命中 安全评测 :safety(title,abstract)
AI总结 本文通过多轮攻击评估欺诈防御系统,发现图上下文防御在早期安全拒绝方面优于纯文本基线,但同时产生更多的良性误报,揭示了安全与效用之间的权衡。
Comments 19 pages, 3 figures
PseudoBridge: 伪代码作为连接语义与逻辑的桥梁以提升代码检索性能
专题命中 安全评测 :alignment(title,abstract)
AI总结 本文提出PseudoBridge框架,通过引入伪代码作为中间半结构化模态,解决自然语言与编程语言之间的语义和逻辑对齐问题,实验表明其在代码检索任务中表现优异,尤其在零样本场景中效果显著。
Comments 42 pages, 14 figures, 8 tables
生成车辆-行人交互的安全关键场景
机构 * Transportation Informatics Lab, Department of Civil and Environmental Engineering, Old Dominion University(交通信息实验室,土木与环境工程系,旧 Dominion 大学) ; Inner Mongolia Center for Transportation Research, Inner Mongolia University(内蒙古交通研究所,内蒙古大学) ; School of Transportation and Logistics, National Engineering Laboratory of Integrated Transportation Big Data Application Technology, National and Local Joint Engineering Research Center of Integrated Transportation Intelligence, Southwest Jiaotong University(交通运输学院,国家集成交通大数据应用技术工程实验室,国家与地方联合集成交通智能工程研究中心,西南交通大学)
专题命中 安全评测 :safety(title,abstract)
AI总结 本文提出了一种三阶段框架,结合现实数据与自适应模拟,生成大规模行为真实的安全关键场景,通过多智能体状态空间Transformer增强DDPG算法,在车辆-行人交互中实现了高精度的避让行为生成,最终生成了VPSCI数据集。
Comments 49 pages, 13 figures, 11 table
全面的漏洞分析对于可信的LLM-MAS至关重要
专题命中 安全评测 :trustworthy(title,abstract)
AI总结 本文探讨了构建可信LLM-MAS需进行全面漏洞分析,提出统一框架以量化不同架构中的漏洞,并识别关键挑战如构建专用评估基准和实现安全信任管理。
VEGA:面向空间感知的视觉编码器对齐用于视觉-语言-动作模型
机构 * Peking University(北京大学) ; Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)
专题命中 安全评测 :alignment(title,abstract)
AI总结 VEGA通过直接对齐视觉编码器输出与空间感知特征,提升视觉-语言-动作模型的空间意识,实现更可解释的对齐目标。
OpenSGA: 在开放世界中高效的3D场景图对齐
机构 * Autonomous Multi-Robots Lab, Department of Cognitive Robotics, School of Mechanical Engineering, Delft University of Technology, 2628 CD, Delft, Netherlands(代尔夫特理工大学机械工程学院认知机器人学系自主多机器人实验室) ; Mobile Robotics Lab, School of Computation, Information and Technology, Technical University of Munich(慕尼黑技术大学计算、信息与技术学院移动机器人实验室)
专题命中 安全评测 :alignment(title,abstract)
AI总结 本文提出OpenSGA框架,通过融合视觉-语言、文本和几何特征实现高效的3D场景图对齐,包含空间注意力编码器、最小成本流分配器和全局场景嵌入生成器模块,实验表明在F2S和S2S任务中表现最佳。
Comments 13 figures
探索临床因素在零样本分割VLMs中的提示对齐用于NSCLC肿瘤分割
机构 * Artificial Intelligence in Medicine Program, Mass General Brigham, Harvard Medical School, USA(麻省总医院布里奇沃特医学中心人工智能医学项目,哈佛医学院,美国)
专题命中 安全评测 :alignment(title,abstract)
AI总结 研究通过分析VoxTell在NSCLC肿瘤数据集上的提示对齐方向,发现解剖位置主导空间注意力,零样本分割VLMs在NSCLC肿瘤分割中表现优于其他模型。
架构隔离作为边缘AI医疗设备的定时安全原语:在共享硅平台上的受控实验证据
专题命中 安全评测 :safety(title,abstract)
AI总结 研究通过受控实验验证架构隔离在保持准确性与输出稳定性的同时,如何影响边缘AI医疗设备的定时约束,提出联合STER和延迟验证作为FDA指南的候选方法。
Comments 10 pages, 3 figures, 5 tables. Submitted to IEEE Embedded Systems Letters
弥合用户意图与大语言模型之间的鸿沟:一种用于代码生成的需求对齐方法
专题命中 安全评测 :alignment(title,abstract)
AI总结 本文提出REA-Coder方法,通过需求对齐提升大语言模型的代码生成性能,实验表明其在多个编程基准测试中表现优异,平均提升率达7.93%至30.25%。
DeferredSeg: 一种多专家延迟框架用于可信的医学图像分割
机构 * School of Software, Shandong University(山东大学软件学院) ; Department of Clinical Laboratory, Shandong Provincial Hospital Affiliated to Shandong First Medical University(山东第一医科大学附属山东省人民医院临床检验科) ; School of Computer Science and Technology, Nanjing University(南京大学计算机科学与技术学院)
专题命中 安全评测 :trustworthy(title,abstract)
AI总结 DeferredSeg通过引入延迟感知分割框架,在医学图像分割中实现人机协作,通过动态路由和损失函数提升分割可靠性,优于基线方法。
Comments 27 pages,6 figures
EA-Agent:一种用于实体对齐的结构化多步推理代理
专题命中 安全评测 :alignment(title,abstract)
AI总结 本文提出EA-Agent,通过多步规划与执行将实体对齐转化为结构化推理过程,引入属性和关系三元组选择器提升效率,实验表明其在三个基准数据集上均优于现有方法。
Comments ACL 2026,Main Conference
GALA: 多模态图对齐用于自动化程序修复中的缺陷定位
专题命中 安全评测 :alignment(title,abstract)
AI总结 GALA通过多模态图对齐方法,解决GUI截图场景下自动化程序修复的缺陷定位问题,通过结构化推理提升视觉与代码的映射精度。
Comments Code available at: https://github.com/lzyyyyy666/GALA
耦合多智能体系统中的协作利他安全
专题命中 安全评测 :safety(title,abstract)
AI总结 本文提出一种基于协作控制屏障函数的框架,通过协作控制确保动态耦合多智能体系统的安全性,利用哈密顿规则定义利他安全条件,提升系统整体安全性和鲁棒性。
Comments This work is to appear at the 2026 American Control Conference
多模态对齐的Indra表示假说
机构 * Northeastern University(东北大学) ; Adobe Research(Adobe研究院)
专题命中 安全评测 :alignment(title,abstract)
AI总结 本文提出Indra表示假说,通过范畴论中的V富化Yoneda嵌入,定义样本间关系轮廓,提升多模态对齐的鲁棒性和一致性。
通过域对齐生成无监督降尺度:应用于风场
专题命中 安全评测 :alignment(title,abstract)
AI总结 本文提出基于域对齐的生成模型,用于多变量风场降尺度与偏差校正,提升空间一致性与鲁棒性。
鲁棒性几何:优化损失景观曲率和特征流形对齐以增强视觉-语言模型的鲁棒微调
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 安全评测 :alignment(title,abstract)
AI总结 本文提出GRACE框架,通过联合调节参数空间曲率和特征空间不变性,提升视觉-语言模型在分布内准确率、分布外泛化和对抗鲁棒性之间的平衡,实验显示在ImageNet微调中ID准确率提升10.8%,对抗准确率提升13.5%。
可信AI驱动的金融网络安全威胁情报中的安全障碍:来自实践者的证据
专题命中 安全评测 :trustworthy(title,abstract)
AI总结 研究探讨金融机构在使用AI驱动的威胁情报时面临的安全障碍,结合文献综述、访谈和调查,识别出四个阻碍可信AI部署的社会技术失败模式,并提出三种安全操作保障措施。
超越TESSERACT:为Android恶意软件分类器提供可信的数据集编纂
专题命中 安全评测 :trustworthy(title,abstract)
AI总结 本文探讨了Android恶意软件分类器评估中数据集编纂的重要性,识别了五个影响性能差异的新因素,提出了可信数据集编纂的方法。
CounterScene: 生成世界模型中的反事实因果推理用于安全关键闭环评估
机构 * Tuojing Intelligence(途京智能) ; King's College London(伦敦大学国王学院) ; Tsinghua University(清华大学) ; The University of Hong Kong(香港大学)
专题命中 安全评测 :safety(title,abstract)
AI总结 CounterScene通过结构化反事实推理生成安全关键驾驶场景,通过因果对抗代理识别和冲突感知交互世界模型,提升长周期碰撞率并保持轨迹真实性。
Comments 28 pages, 7 figures
跨模态模糊对齐网络用于文本-空中人检索及一个大规模基准
机构 * State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology(光电信息采集与防护技术国家重点实验室) ; School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) ; School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) ; The University of Hong Kong(香港大学)
专题命中 安全评测 :alignment(title,abstract)
AI总结 本文提出跨模态模糊对齐网络,通过模糊逻辑量化token级可靠性,结合地面图像作为桥梁代理,提升文本与空中图像的语义对齐鲁棒性,并构建了大规模基准数据集AERI-PEDES。
Comments Accepted by CVPR 2026 main track
SAMA:用于指令引导视频编辑的因子化语义锚定与运动对齐
机构 * Baidu(百度) ; Tsinghua University(清华大学) ; City University of Hong Kong(香港城市大学) ; Zhejiang University(浙江大学)
专题命中 安全评测 :alignment(title,abstract)
AI总结 SAMA通过因子化语义锚定和运动对齐方法,在无需外部先验知识的情况下实现精确语义修改与运动保真的平衡,展示了强大的零样本视频编辑能力。
Comments 24 pages, 12 figures
面向部分的开放词汇3D功能接地 via 语义和几何对齐
机构 * ShanghaiTech University(上海科技大学)
专题命中 安全评测 :alignment(title,abstract)
AI总结 本文提出一种双阶段跨模态框架,通过增强语义和几何表示,解决开放词汇3D功能接地中的语义一致性、几何对齐和开放词汇泛化问题。
超越奖励压制:通过动态表示电路断开重塑MARL中的隐写通信协议
机构 * PARRAWA AI(PARRAWA人工智能)
专题命中 安全评测 :safety(abstract,comments);AI safety(abstract,comments);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出动态表示电路断开机制,用于检测MARL中的隐写协作,通过统计对象转换和动态干预提升观测准确性并降低波动性。
Comments 38 pages, includes 5 figures and 8 tables, preliminary version, AI safety / multi-agent reinforcement learning
从法律到Gherkin:一项以人类为中心的准实验,探讨LLM生成的行为规范质量
专题命中 安全评测 :safety(title,abstract)
AI总结 本文通过准实验评估LLMs从法律文本生成Gherkin规范的能力,发现其在相关性和清晰性方面表现良好,但需人类监督以纠正遗漏和幻觉。
Comments This article has been accepted for publication in Information and Software Technology (IST)
多于一对一:在早期发展社区中的人工智能对齐与多模态大语言模型
专题命中 安全评测 :alignment(title,abstract)
AI总结 本文探讨了在早期发展社区中,利用多模态大语言模型实现人机对齐的挑战,提出分层社区对齐框架,强调社区治理而非个体优化。
Comments Accepted at CHI 2026 BiAlign Workshop; OpenReview URL: https://openreview.net/forum?id=ikeH0hsBLN
基于本体的风险评估与安全增强:面向自动驾驶
机构 * Chubu University(楚鸟大学) ; Elith Inc.(Elith公司) ; Honda R&D Co., Ltd.(本田研发公司)
专题命中 安全评测 :safety(title,abstract)
AI总结 OD-RASE通过本体驱动的数据过滤和视觉语言模型生成,提升自动驾驶系统对事故诱因道路结构的预测和改进能力,增强交通环境的安全性。
Comments Accepted ICCV2025
面向AI系统的安全案例构建的结构化方法
专题命中 安全评测 :safety(title,abstract)
AI总结 本文提出了一种面向AI系统的结构化安全案例构建方法,通过定义特定于AI的声明类型、论点类型和证据家族,提供可重用的模板以应对AI系统动态变化的风险特征。
Comments 45 pages, 8 figures, 9 tables
CATNet:用于协作感知的协同对齐与变换网络
机构 * School of Computer Science and Technology, Tianjin University(计算机科学与技术学院,天津大学) ; School of Cybersecurity, Tianjin University(网络安全学院,天津大学) ; School of Future Technology, Tianjin University(未来技术学院,天津大学)
专题命中 安全评测 :alignment(title,abstract)
AI总结 CATNet通过时空同步、小波去噪和自适应选择器提升多代理协作感知的鲁棒性和适应性。
Comments Accepted by CVPR26