How Robust is Model Editing after Fine-Tuning? An Empirical Study on Text-to-Image Diffusion Models
机构 * University of Sheffield, UK(谢菲尔德大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * University of Sheffield, UK(谢菲尔德大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
专题命中 安全评测 :alignment(abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.CL、cs.AI
Comments in French language
专题命中 安全评测 :alignment(abstract);safety(abstract);harmlessness(abstract);分类 cs.AI、cs.CY
专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
Comments 28 pages
专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
Comments In submission to AI and Ethics Journal. 24 pages total, 15 pages of writing with 9 pages of appendices
专题命中 安全评测 :safety(abstract);jailbreak(abstract);AI safety(abstract);分类 cs.CL、cs.AI
Comments 15 pages, 6 figures
MANIGUARD:用于基于规范的机器人操作安全评估与改进的基准及数据集套件
机构 * Northwestern University(西北大学) ; Stanford University(斯坦福大学) ; William & Mary(威廉玛丽学院)
专题命中 安全评测 :safety(title,abstract)
AI总结 本研究提出ManiGuard基准与数据集套件,针对机器人操作基础模型策略,通过含23000余次滚动的实验证实安全需独立于任务成功评估,微调可提升安全表现但仍存差距。
平衡安全与自主性:面向认知障碍群体的生成式AI可及性导向干预
专题命中 安全评测 :safety(title,abstract)
AI总结 本研究针对认知障碍老年群体使用生成式AI的安全与自主冲突问题,通过对45名患者及照护者的质性研究,提出五种可及性导向机制,发现机制效果随障碍程度变化,强调需设计平衡安全与自主的动态AI方案。
Comments Accepted to ASSETS 2026
通过近似VCG机制下的即时惩罚实现可信的物联网AI代理
专题命中 安全评测 :trustworthy(title,abstract)
AI总结 本文提出了一种结合近似Vickrey-Clarke-Groves双拍卖和即时单次惩罚的物联网能源交易信任保障框架,旨在通过单轮过程恢复 truthful 报告,即使在分配精度近似和监控噪声的情况下,同时通过理论分析和实验验证了轻量级惩罚设计在对齐战略物联网代理与社会最优能源交易结果中的有效性。
Journal ref IEEE Internet of Things Journal, 2026
从“假设”到“事实”:面向视觉脑解码的反事实思维启发语义对齐
专题命中 安全评测 :alignment(title,abstract)
AI总结 提出ConceptAlign框架,通过反事实语义对齐解决视觉脑解码的语义错误问题,在自然场景数据集上相比MindEye2提升了重构、语义区分等指标。
Comments Under Review
谁测试测试者?LLM代理工具调用安全的系统枚举与覆盖审计
专题命中 安全评测 :safety(title,abstract)
AI总结 本文提出SafeAudit框架,通过系统生成测试用例和规则阻力指标,发现现有测试未覆盖的20%不安全行为,揭示当前安全评估的不足。
基于最优传输的基于大语言模型的视听语音识别语义对齐
专题命中 安全评测 :alignment(title,abstract)
AI总结 研究基于大语言模型的视听语音识别,提出基于最优传输的语义对齐框架,通过在多模态融合前对齐声学和视觉表征弥合模态差距,经实验验证该方法能有效提升性能,在多种条件下达到最优。
当LLM编码时会出现什么问题?表征自主代码助手的操作安全故障
专题命中 安全评测 :safety(title,abstract)
AI总结 通过系统分析文献和GitHub问题,构建了包含33种操作风险类型的多维安全分类法,发现编码代理故障通常严重且主要源于约束违反、破坏性操作、授权绕过和欺骗。
Comments This paper is accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026), Research Track
SemDINO: 一种基于DINOv3的跨时间语义对齐变化检测网络
机构 * Xinjiang Institute of Ecology and Geography, Chinese Academy of Sciences(中国科学院新疆生态与地理研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; School of Computer Science, Xiangtan University(湘潭大学计算机科学学院) ; College of Information and Communication Engineering, Harbin Engineering University(哈尔滨工程大学信息与通信工程学院)
专题命中 安全评测 :alignment(title,abstract)
AI总结 提出SemDINO网络,通过双分支编码器、多尺度时序交互、语义净化与变化增强模块,解决语义变化检测中跨时间对齐不足、多尺度表示弱及伪变化鲁棒性差的问题。
将大语言模型嵌入流程控制:一种用于自适应且可信的自动化烹饪的智能体框架
专题命中 安全评测 :trustworthy(title,abstract)
AI总结 针对自动化烹饪机器人的个性化与可信性问题,提出智能体框架,通过多智能体分解需求、分阶段生成执行代码,实验验证其在真实场景中可靠且实用。
结合前缀树约束的令牌预测与层级感知语义对齐的HS编码预测
专题命中 安全评测 :alignment(title,abstract)
AI总结 本研究提出TRIE-HSA方法,结合前缀树约束的令牌预测与层级感知语义对齐,在集装箱码头数据实验中,其HS6准确率较零样本推理提升49.96个百分点,为受限环境下的HS编码预测提供实用方案。
TCellAlign:使用命名法引导的多智能体工作流程进行跨研究 T 细胞群体对齐
专题命中 安全评测 :alignment(title,abstract)
AI总结 该研究针对跨研究 T 细胞群体对齐难题,提出 TCellAlign 多智能体框架,含文献检索等模块,能保留原始术语与证据并生成标准化标签。构建基准数据集,实验表明其在语义一致性等方面表现出色,助力 T 细胞相关知识整合与模型发展。
N选最佳语音合成评估受自动语音识别家族对齐的影响
专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现最佳N选语音合成评估受ASR家族对齐影响,同家族验证器-评估器对效果更好。提出两种跨家族排名集成方法,能降低平均词错误率,建议交叉评估器三角测量作为默认报告实践。
Comments Accepted at ICML 2026 Workshop on Machine Learning for Audio
ECHO-PPI:用于蛋白质-蛋白质相互作用网络中重叠蛋白质模块检测的可信人工智能
专题命中 安全评测 :trustworthy(title,abstract)
AI总结 提出ECHO-PPI框架,通过整合加权网络拓扑、语义蛋白特征和基因本体证据,实现可解释的重叠蛋白质模块检测,并为每个分配提供证据分数和置信度标签。
Comments 39 pages, 15 figures, 12 tables, and 8 algorithm descriptions. The manuscript presents ECHO-PPI, an original computational biology framework evaluated on the Gavin and Krogan yeast PPI benchmarks and compared with MCL, MCL+overlap, ClusterONE, and SLPA. Reproducibility scripts, code, machine-readable outputs, and appendices are included in the submission package
潜在去噪提升大多模态模型的视觉对齐
机构 * University of Southern California(南加州大学) ; DEVCOM ARL Army Research Office(DEVCOM ARL陆军研究办公室)
专题命中 安全评测 :alignment(title,abstract)
AI总结 本文提出通过潜在去噪框架改进大多模态模型的内部视觉特征对齐和多模态理解,采用掩码和高斯噪声混合腐蚀视觉token,并利用解码器恢复教师特征,提升模型在分布偏移下的鲁棒性。
Comments ACM MM 2026
编排不可逆状态转换的智能体的安全不变量:在公共账本上评估的四维形式主义
专题命中 安全评测 :safety(title,abstract)
AI总结 该研究针对编排不可逆状态转换的智能体,提出四维形式主义与七个安全不变量,在公共账本场景下验证其可提升智能体安全栈通过率,且可推广至其他不可逆状态交互场景。
Comments 29 pages, 8 figures, 7 tables
SafeBuild-Bench:一种具有图增强数据挖掘能力的时序鲁棒建筑安全基准
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 安全评测 :safety(title,abstract)
AI总结 研究人员构建了图增强数据挖掘的时序鲁棒建筑安全基准SafeBuild-Bench,开发可扩展验证的GEMS流水线,发现现有多模态大语言模型对建筑安全理解仍不足。
Comments Accepted by KDD 2026. 12 pages, 6 figures
安全的假象:AI与人类C++代码的多层验证
专题命中 安全评测 :safety(title,abstract)
AI总结 提出VULBENCH-CPP基准,通过四层验证发现AI生成C++代码的运行时违规率约为人类代码的两倍,静态分析会因代码长度产生安全假象。
聚焦女性安全分析:多模态数据集能否增强VAD模型?
机构 * Indian Institute of Technology Bhubaneswar(印度理工学院巴特那分校) ; Artificial Intelligence and Robotics Institute, Korea Institute of Science and Technology(人工智能与机器人研究所,韩国科学技术院) ; Yonsei-KIST Convergence Research Institute, Yonsei University(延世大学KIST融合研究中心)
专题命中 安全评测 :safety(title,abstract)
AI总结 针对现有视频异常检测数据集缺乏女性中心异常样本的问题,提出包含1001个视频及文本描述的多模态基准ExtrAnom,覆盖5种犯罪类型,并验证了多模态方法在检测女性中心异常上的有效性。
Comments 15 pages, 8 figures, 6 tables
模式0:面向路侧计算单元辅助安全通信的新型3GPP V2X资源分配类别
专题命中 安全评测 :safety(title,abstract)
AI总结 针对现有3GPP V2X资源分配框架中基站与车辆UE二元分类的结构性缺陷,提出以路侧计算单元(RCU)为核心实体的新模式0,通过集成感知、通信与计算能力,实现高密度交通场景下的低延迟安全通信,并利用MAPPO仿真验证了其性能优势。
Comments v4: substantial restructure; new sections on institutional authority, escalation security, and pool sizing; title revised; references expanded to 34. 44 pages, 7 figures, 4 tables
氛围建模的必要性:基于AI的可信软件开发中缺失的一环
专题命中 安全评测 :trustworthy(title,abstract)
AI总结 本文提出在AI辅助软件开发中引入氛围建模作为轻量中间抽象,通过学生调查验证其在提升LLM输出理解、降低验证工作量及增强信任方面的潜力,为可信AI软件工程研究提供方向。
Comments 7 pages, 1 figure
TrustChain-Review:一种用于可信AI辅助代码审查的风险自适应区块链与博弈论框架
专题命中 安全评测 :trustworthy(title,abstract)
AI总结 该研究提出TrustChain-Review框架,结合区块链、博弈论与风险自适应治理,通过模拟验证其在AI辅助代码审查中平衡可信性与成本的效果,为不同风险场景提供治理方案。
Comments 24 pages, 3 figures, 10 tables
我们能信任6G中的AI吗?可验证且可审计的AI驱动可信无线网络
专题命中 安全评测 :trustworthy(title);safety(abstract)
AI总结 针对6G中AI在无线网络应用的信任问题,提出基于3GPP规范的机械审计方法与原生审计网络架构,支持AI功能的部署前认证和运行时审计,为AI驱动的可信无线网络提供解决方案。
Comments Submitted for possible journal publication
BioDisclose:对抗性诱导下生物医学安全的可操作性感知基准
专题命中 安全评测 :safety(title,abstract)
AI总结 研究针对大语言模型在对抗性诱导下生物医学知识披露行为不足问题,引入BioDisclose基准,含多领域多类别提示,对模型响应四级评分,通过实验揭示不同模型、策略及风险类别差异,为评估生物医学安全提供新测试平台。
Comments 27 pages, 3 figures
PRIMA:通过大语言模型进行风险集成图像-元数据对齐的医学诊断预训练
机构 * Department of Biomedical Engineering, Duke University(杜克大学生物医学工程系) ; Department of Ophthalmology and Visual Sciences, University of Michigan(密歇根大学眼科与视觉科学系)
专题命中 安全评测 :alignment(title,abstract)
AI总结 提出PRIMA框架,通过检索增强生成策展风险-疾病关联专家语料库优化文本编码器,用双编码器预训练策略及四个互补损失函数弥合模态差距,融合特征用于疾病分类,性能优于其他方法。