AI Assurance in UK Defence: Challenges in Operationalising JSP 936
英国国防中的人工智能保证:JSP 936 操作化的挑战
机构 * Synoptix
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
AI总结 本文通过结构化解释性审查,识别了英国国防中实施JSP 936进行AI保证的八大挑战,并指出其依赖未解决的技术、组织和保证问题。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
英国国防中的人工智能保证:JSP 936 操作化的挑战
机构 * Synoptix
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
AI总结 本文通过结构化解释性审查,识别了英国国防中实施JSP 936进行AI保证的八大挑战,并指出其依赖未解决的技术、组织和保证问题。
角色设定会让LLM成为K-pop粉丝吗?基于LLM的在线演唱会观众智能体初步研究
机构 * Graduate School of Culture Technology, KAIST, Daejeon, South Korea(韩国成均馆大学文化科技研究生院) ; Department of Artificial Intelligence, Yonsei University, Seoul, South Korea(延世大学人工智能系)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 研究通过多智能体系统模拟K-pop演唱会实时粉丝聊天,发现角色设定能提升聊天质量和自然度,但未增强社交连接或情感反应,表明有意义的集体体验需更深层次对齐。
Comments Accepted at the ICML 2026 Workshop on Culture x AI: Evaluating AI as a Cultural Technology
管道中的弗兰肯斯坦:面部识别中的计算性知识灭绝
机构 * Universidade Estadual de Campinas(坎皮纳斯州立大学) ; Instituto da Hora(时间研究所)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY
AI总结 本文借鉴玛丽·雪莱的《弗兰肯斯坦》作为方法论框架,分析基于嵌入的面部识别如何通过检测、地标定位、对齐/正面化和嵌入等步骤,逐步将面部简化为数据,实施“计算性知识灭绝”,并论证废除主义作为规范性立场。
Comments Accepted to ACM FAccT 2026. Author's version. 17 pages, 2 figures
认知可比性与治理的局限:在极端能力不对称下评估权威
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY
AI总结 本文通过六维框架探讨治理中权威的评估问题,发现极端能力不对称下存在结构性失效,部分维度需新规范理论而非制度设计。
Comments 20 pages, 2 tables. Interdisciplinary paper on AI governance and political theory
SPECTRA:通过分布化LLM推理揭示用户偏好的全频谱
机构 * Carnegie Mellon University(卡内基梅隆大学) ; TikTok Inc.(TikTok公司)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL
AI总结 提出SPECTRA方法,将微调后的LLM视为隐式概率模型,通过探测softmax层推断用户偏好的概率分布,有效恢复长尾偏好并提升公平性。
由谄媚诱导的突现性失调可通过对齐门控逆转
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL
AI总结 发现谄媚微调(被动同意用户错误观点)可诱导广泛且严重的突现性失调,并提出对齐门控方法,通过插入可学习门控来识别并抑制不安全表示,从而高效逆转失调。
Comments Code is available at https://github.com/stay1to0/Sycophancy_Emergent_Misalignment_and_Gated_attention_FT
基于大语言模型的时间序列预测的因果语义对齐
机构 * University of Science and Technology of China(中国科学技术大学) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 其他安全 :alignment(title,abstract);分类 cs.LG
AI总结 提出CVAformer框架,通过因果干预解耦变量中的动态和不变成分,消除对齐中的混杂偏差,在多种预测场景下达到或超越最先进性能。
安全是上下文相关的,而LLM评判者不是:应对评估者的刚性先验
机构 * University of Oxford(牛津大学) ; Cohere
专题命中 其他安全 :safety(title,abstract);分类 cs.AI
AI总结 研究LLM作为安全评判者时,对上下文信息的依赖性和对不同安全定义的可引导性,发现它们难以在上下文或安全定义与自身先验矛盾时调整评估。
通过任务复杂度操作化浅层对齐假设
机构 * University of Maryland(马里兰大学) ; University of California, Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; University of Toronto(多伦多大学) ; University of Edinburgh(爱丁堡大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.LG
AI总结 提出任务复杂度指标(达到目标性能的最短程序长度)来量化浅层对齐假设,实验表明预训练大幅降低任务复杂度,而微调可将复杂度降低数个数量级。
Comments ICML 2026
IEA:通过三阶段多任务对齐的业余友好型对话式图像编辑代理
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institution(上海创新研究院) ; Huawei Technologies Ltd.(华为技术有限公司) ; Nanyang Technological University(南洋理工大学) ; Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室)
专题命中 其他安全 :alignment(title);分类 cs.CL、cs.AI
AI总结 提出IEA对话式图像编辑代理,通过三阶段多任务训练学习操作参数化工具,实现可解释编辑轨迹,在像素距离和ROUGE-L指标上优于基线,用户研究中指令跟随和感知质量表现最佳。
Comments [CVPR 2026 Findings] Our data and code are released at https://github.com/OpenDFM/Image_Edit_Agent
应变连贯性:编码代理执行轨迹中的故障前信号
专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出“应变连贯性”模式,即编码代理识别到问题但仍按原计划行动,通过构建Claude Sonnet 4.6检测器在44条轨迹上实现94%故障预测精度,优于基线方法。
CURE:基于课程引导的多任务训练实现可靠的解剖学接地报告生成
机构 * Pontificia Universidad Católica de Chile(智利天主教大学) ; CENIA ; iHEALTH ; KAUST(科威特皇家科学与技术局)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出CURE框架,通过课程学习动态调整多任务训练,提升医学报告生成的视觉接地准确性和事实一致性,无需额外数据。
Comments 31 pages, 7 figures, accepted to CVPR 2026 (oral)
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 36279-36289
对齐但非伙伴特定:区分多模态LLM智能体在参考游戏中如何成功而无需类人惯例
机构 * National Taiwan University(国立台湾大学) ; Max Planck Institute for Psycholinguistics(马克斯·普朗克心理语言学研究所) ; Radboud University(拉德堡德大学) ; Institut Jean Nicod(让·尼科研究所)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 通过约束伪对基线方法,区分多模态LLM智能体在参考游戏中的标签对齐是源于伙伴特定交互还是共享任务词汇,发现智能体通过冗长描述而非压缩表达实现协调。
贡献权重:自注意力Transformer的几何分析
机构 * University of Cambridge(剑桥大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出基于投影的贡献权重度量,结合注意力权重、值向量大小和方向对齐,更准确识别关键令牌,并揭示注意力汇的主动抑制功能。
桥接传统可解释性方法与多模态多语言模型:基于XAI的分析
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 提出多模态Shapley值框架,结合频谱图引导的音素对齐(SGPA)预处理方法,实现文本与音频特征的可解释性归因,并开源计算包与可视化工具。
Comments Bachelor's thesis
mllm-shap:面向文本-音频多模态大语言模型的Shapley值可解释性平台
机构 * Warsaw University of Technology(华沙理工大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 提出mllm-shap框架,通过模态感知掩码、多轮对话追踪和音素对齐分组技术,将Shapley值可解释性扩展到文本-音频多模态大语言模型,并实现10-50倍的计算加速。
Comments Submitted to ACL2026
Muon²:通过自适应二阶矩预条件提升穆隆
机构 * University of California at Santa Barbara(加州大学圣巴巴拉分校) ; University at Albany, SUNY(阿尔巴尼大学,SUNY)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 Muon²通过引入Adam风格的自适应二阶矩预条件改进了穆隆的效率与质量,提升了极化近似中的收敛速度和实际正交化质量,实验表明其在参数规模达13B的预训练任务中表现更优。
Comments Preprint, subject to update
知道更多,更清晰:大型语言模型中知识增强的元认知框架
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 提出元认知框架,利用内部认知信号划分知识空间为掌握、混淆和缺失区域,通过差异化干预和认知一致性机制增强知识并校准置信度,实验证明优于基线方法。
利用大型语言模型实现化工流程图的自动纠错
机构 * Process Intelligence Research Group, Department of Chemical Engineering, Delft University of Technology(过程智能研究组,化学工程系,代尔夫特理工大学)
专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG
AI总结 提出一种基于大型语言模型的生成式AI方法,自动识别化工流程图中的错误并给出修正建议,在合成数据集上达到80%的top-1准确率。
Journal ref Computer Aided Chemical Engineering, Volume 53, 2024, Pages 3109-3114
文本就是一切?文本作为语音大语言模型的通用信息瓶颈
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Microsoft Corporation(微软公司) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 提出Convex Gate(C-Gate)桥接语音与LLM,通过凸包约束将语音表示限制在LLM输入嵌入流形内,在ASR和情感识别上取得联合最优性能,并揭示几何结构而非离散性是关键设计因素。
无需修改的隐写术:通过LLM种子进行隐藏通信
机构 * Institute for IT Security, University of Lübeck(吕贝克大学信息安全部) ; Technische Hochschule Lübeck(吕贝克技术大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 利用LLM推理栈中确定性解码的伪随机数生成器种子依赖性,提出一种无需修改模型权重或采样代码的隐写信道,通过种子编码秘密消息,接收者通过穷举搜索恢复。
Comments To appear in the Proceedings of the International Conference on Availability, Reliability and Security (ARES 2026)
超大规模下的自主事件解决:面向网络运维的智能体AI架构
机构 * Arun Malik
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 提出一种多智能体编排框架,通过分层分解、技能调用、知识编码和渐进自主,在超大规模云网络中实现90%以上常见事件的自主解决,并保障安全。
Comments 7 pages, 6 figures
语言感知令牌增强:无需微调的大语言模型语言混淆减少
机构 * SCB DataX ; Tsinghua University(清华大学) ; SCBX
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 提出无需微调的语言混淆减少方法,通过语言感知令牌增强(LATB)和自适应版本(Adaptive-LATB)对目标语言令牌施加扰动,有效提升多语言对齐并保持摘要质量。
Comments ACL2026 Main Conference
InA-Probe:面向LLM时间序列预测的指令感知主动探测
机构 * Nanyang Technological University(南洋理工大学) ; Khalifa University(哈利法大学) ; Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; Singapore University of Technology and Design(新加坡科技设计大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 提出指令感知主动探测(InA-Probe),通过多级指令注入和自适应查询生成,结合双阶段注意力机制,在7个基准上超越现有方法,跨域误差降低37%。
TRADE: 换能器增强的语音大语言模型解码器
机构 * Hippocratic AI ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 提出TRADE模型,通过换能器分支增强多模态大语言模型,实现帧同步对齐与语言推理结合,支持流式和非流式解码,在多个基准上取得低词错误率。
通过智能体间协议克服监管瓶颈:以核能为例
机构 * Argonne National Laboratory(阿贡国家实验室) ; Idaho National Laboratory(爱达荷国家实验室)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 提出监管上下文协议(RCP),一种智能体间通信标准,将监管与申请方之间的人工流程转为结构化、可审计的智能体通道,在核反应堆审批中降低成本50-77%、缩短时间65%。
Comments 26 pages, 10 figures
视觉语言模型能否感知传感器所感?一种可扩展的专家引导设计用于从街景评估轮椅可达性
机构 * University of Florida(佛罗里达大学) ; University of South Florida(南佛罗里达大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 其他安全 :alignment(abstract);分类 cs.CY
AI总结 本文提出专家引导的检索增强框架,利用视觉语言模型从谷歌街景图像识别轮椅可达性障碍,通过GPS轮椅停留行为验证,表明VLM评分与移动摩擦部分一致,但细粒度障碍识别有限。
PQR:一个生成多样化且逼真用户查询的框架,以引发问答代理失败
机构 * Columbia University(哥伦比亚大学) ; University of California San Diego(加州大学圣地亚哥分校) ; Walmart(沃尔玛)
专题命中 其他安全 :safety(abstract);分类 cs.CL
AI总结 PQR框架通过迭代交互生成多样化且逼真的用户查询,以发现问答代理的失败案例,其方法比现有方法更有效。
基于梯度的任务亲和性估计在多任务学习中的信息论要求
机构 * Great Neck South High School(Great Neck South 高中)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 本文探讨了多任务学习中梯度基于任务亲和性估计的信息论要求,发现任务样本重叠度对梯度对齐的影响,并揭示了样本重叠度的相变特性。
Comments 8 pages, 4 figures. ACM BCB 2026 Short Paper. Accepted at workshop on AI for Accelerated Materials Design, Foundation Models for Science: Real-World Impact and Science-First Design, and Generative and Experimental Perspectives for Biomolecular Design at ICLR 2026
混合饮食使DINO成为杂食视觉编码器
机构 * Google DeepMind(谷歌DeepMind) ; University College London(伦敦大学学院)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 针对DINOv2等预训练视觉编码器在不同视觉模态间特征对齐差的问题,提出杂食视觉编码器,通过后训练框架学习模态无关特征空间,实现跨模态鲁棒理解。
Comments CVPR 2026 Highlight