The Illusion of Safety: Multi-Tier Verification of AI vs. Human C++ Code
安全的假象:AI与人类C++代码的多层验证
专题命中 安全评测 :safety(title,abstract)
AI总结 提出VULBENCH-CPP基准,通过四层验证发现AI生成C++代码的运行时违规率约为人类代码的两倍,静态分析会因代码长度产生安全假象。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
安全的假象:AI与人类C++代码的多层验证
专题命中 安全评测 :safety(title,abstract)
AI总结 提出VULBENCH-CPP基准,通过四层验证发现AI生成C++代码的运行时违规率约为人类代码的两倍,静态分析会因代码长度产生安全假象。
聚焦女性安全分析:多模态数据集能否增强VAD模型?
机构 * Indian Institute of Technology Bhubaneswar(印度理工学院巴特那分校) ; Artificial Intelligence and Robotics Institute, Korea Institute of Science and Technology(人工智能与机器人研究所,韩国科学技术院) ; Yonsei-KIST Convergence Research Institute, Yonsei University(延世大学KIST融合研究中心)
专题命中 安全评测 :safety(title,abstract)
AI总结 针对现有视频异常检测数据集缺乏女性中心异常样本的问题,提出包含1001个视频及文本描述的多模态基准ExtrAnom,覆盖5种犯罪类型,并验证了多模态方法在检测女性中心异常上的有效性。
Comments 15 pages, 8 figures, 6 tables
模式0:面向路侧计算单元辅助安全通信的新型3GPP V2X资源分配类别
专题命中 安全评测 :safety(title,abstract)
AI总结 针对现有3GPP V2X资源分配框架中基站与车辆UE二元分类的结构性缺陷,提出以路侧计算单元(RCU)为核心实体的新模式0,通过集成感知、通信与计算能力,实现高密度交通场景下的低延迟安全通信,并利用MAPPO仿真验证了其性能优势。
Comments v4: substantial restructure; new sections on institutional authority, escalation security, and pool sizing; title revised; references expanded to 34. 44 pages, 7 figures, 4 tables
PRIMA:通过大语言模型进行风险集成图像-元数据对齐的医学诊断预训练
机构 * Department of Biomedical Engineering, Duke University(杜克大学生物医学工程系) ; Department of Ophthalmology and Visual Sciences, University of Michigan(密歇根大学眼科与视觉科学系)
专题命中 安全评测 :alignment(title,abstract)
AI总结 提出PRIMA框架,通过检索增强生成策展风险-疾病关联专家语料库优化文本编码器,用双编码器预训练策略及四个互补损失函数弥合模态差距,融合特征用于疾病分类,性能优于其他方法。
处于风险中的智能体:用户如何在不知情的情况下破坏大语言模型的安全性
专题命中 安全评测 :safety(title,abstract)
AI总结 研究基于大语言模型的智能体安全问题,介绍用户中继上下文操纵攻击,通过让良性用户在请求中传递对抗性内容,实验表明该攻击在多种防御下优于提示注入基线,揭示当前智能体框架设计缺陷。
Comments User-relayed Context Manipulation; LLM-based Agents; Agent Security; Human Factors in Cybersecurity; Web-Use Agents; Planning Agents
超越《她》:角色扮演AI伴侣中的安全动态
专题命中 安全评测 :safety(title,abstract)
AI总结 通过混合方法研究,揭示角色扮演AI伴侣使用中用户内化问题、AI角色人格和风险互动模式共同塑造安全动态,并发现短期情绪缓解与长期恶化并存的趋势,提出自适应安全防护设计。
Comments Under review
工业检测场景安全评估的多模态基准
机构 * Department of Automation, Tsinghua University(清华大学自动化系) ; Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学具身智能与机器人研究所) ; TetraBOT Intelligence Co., Ltd.(天博智能科技有限公司) ; DAMO Academy, Alibaba Group(阿里巴巴达摩院) ; School of Automation, Southeast University(东南大学自动化学院)
专题命中 安全评测 :safety(title,abstract)
AI总结 针对工业现场多模态安全评估缺乏真实数据的问题,构建了首个包含真实机器人巡检数据、像素级标注和七种同步模态的基准数据集InspecSafe-V1,覆盖五个典型场景,支持多模态异常识别与安全评估。
Comments 14 pages, 6 figures, Accepted by Scientific Data
什么语义能经受住连接器的考验?视频编辑中VLM到DiT对齐的诊断
机构 * HKUST(香港理工大学) ; FDU(福建大学) ; ZJU(浙江大学) ; NUS(新加坡国立大学)
专题命中 安全评测 :alignment(title,abstract)
AI总结 本研究探讨了视频生成模型中VLM与DiT对齐过程中的语义瓶颈问题,通过提出TRACE-Edit数据集和诊断协议,发现连接器模块会导致细粒度结构语义的严重退化,挑战了原有假设。
迈向可信的AI代理无线网络优化数字孪生:挑战、解决方案与机遇
专题命中 安全评测 :trustworthy(title,abstract)
AI总结 本文提出一种新的数字孪生评估框架,用于确保AI代理基于网络优化的数字孪生的可信度,通过任务导向的评估方法减少训练和测试成本,同时保持部署性能。
对齐发现与诊断:一种自洽的强化学习框架用于可信的放射学报告
机构 * University of Pittsburgh(匹兹堡大学) ; University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷分校) ; The University of Manchester(曼彻斯特大学)
专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG
AI总结 本文提出了一种自洽的强化学习框架,用于生成可信的放射学报告,通过优化生成过程和减少幻觉,提升了临床效果。
BizFinBench.v2:通过真实用户数据和离线/在线双语评估实现金融领域可靠的大语言模型
机构 * HiThink Research(HiThink研究机构) ; Shanghai University of Finance and Economics(上海财经大学)
专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI
AI总结 研究针对大语言模型在金融应用中实际效果与报告性能差距大的问题,构建BizFinBench.v2基准,涵盖中美股票市场真实用户数据及多个任务,通过实验评估模型,揭示现有模型局限,为金融领域大语言模型部署提供基础。
可判定性通过构造实现:面向可信AI的设计时验证
机构 * SpeakEZ Technologies
专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG
AI总结 提出一种设计时验证框架,通过将AI模型属性约束为有限生成阿贝尔群上的可判定问题,在训练前以极低计算成本验证数值稳定性、计算正确性和物理一致性,消除后验验证开销。
Comments 21 pages, 1 figure
告知、指导、共情、倾听:审计LLM护理支持角色
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; OSF HealthCare(OSF医疗集团) ; Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本研究通过操作化四种社会支持角色(告知、指导、共情、倾听),评估大型语言模型在非正式护理对话中的安全概况,发现支持角色系统性地影响交互风险,且存在感知质量-安全性权衡。
RoTRAG: 基于经验法则推理的检索增强生成对话有害内容检测
机构 * Peking University(北京大学) ; Enhans ; University of North Texas(北得克萨斯大学)
专题命中 安全评测 :safety(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 提出RoTRAG框架,通过检索外部道德规范(RoTs)增强LLM的多轮对话有害内容检测,实现基于规范推理和分类,平均F1提升约40%,分布误差降低8.4%。
Comments Accepted by SIGIR-ICTIR 2026, Oral Presentation
Journal ref Proceedings of the 2026 International ACM SIGIR Conference on Innovative Concepts and Theories in Information Retrieval (ICTIR '26), July 25, 2026, Melbourne, VIC, Australia. ACM, New York, NY, USA, 12 pages
AIVV: 用于可信自主系统的神经符号LLM代理集成验证与验证
机构 * School of Mechanical Engineering, Purdue University(普渡大学机械工程学院) ; School of Electrical and Computer Engineering, Purdue University(普渡大学电气与计算机工程学院) ; Department of Computer Science, Purdue University(普渡大学计算机科学系) ; Department of Mathematics, Purdue University(普渡大学数学系)
专题命中 安全评测 :trustworthy(title);分类 cs.AI
AI总结 本文提出AIVV框架,利用LLM作为决策外层循环,通过语义验证区分真实故障与干扰故障,生成可操作的V&V成果,提升自主系统验证效率。
STEAM:用于EEG解码的分层预训练时空对齐混合专家模型
专题命中 安全评测 :alignment(title);分类 cs.LG
AI总结 STEAM是一种分层迁移框架,通过双分支时空编码器与SSMoE模块实现EEG解码的通用表征学习与范式专业化,在7个数据集的14种评估设置中表现优异且推理成本具竞争力。
通过病因感知注意力监督增强大型语言模型在临床诊断决策中的可信性
专题命中 安全评测 :trustworthy(title);分类 cs.CL
AI总结 该研究提出病因感知注意力监督框架,通过引入临床病因模式对大型语言模型进行参数高效微调,在两类诊断队列上提升了诊断准确率与注意力聚焦性,增强了模型临床诊断的可信性。
Comments 20 pages, 8 figures
对前沿视觉-语言模型进行审计以实现可信的医学视觉问答:定位失败、格式崩溃和领域适应
机构 * New York University, New York, USA(纽约大学) ; Tsinghua University, Beijing, China(清华大学) ; Columbia University, New York, USA(哥伦比亚大学) ; University of Michigan, Ann Arbor, USA(密歇根大学)
专题命中 安全评测 :trustworthy(title);分类 cs.AI
AI总结 本文审计了五种前沿视觉-语言模型在医学视觉问答中的表现,发现定位失败和格式崩溃是信任瓶颈,通过领域适应可提升性能。
解码多模态思维:通过多模态对齐和自适应路由实现可泛化的脑到文本翻译
机构 * State Key Laboratory of Multimodal Artificial Intelligence System, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系) ; Department of Language Science and Technology, Hong Kong Polytechnic University(香港理工大学语言科学与技术系)
专题命中 安全评测 :alignment(title);分类 cs.CL
AI总结 该研究针对脑机接口从人脑解码语言的挑战,提出利用多模态大语言模型和路由模块的统一框架,通过多模态对齐和自适应路由将脑信号与多模态语义空间对齐,在fMRI等数据集实验中性能领先,还扩展到EEG和MEG数据,为现实应用提供灵活方案。
Comments Accepted to ACL 2026 Findings
多模态大语言模型在胃肠诊断中的临床认知对齐
机构 * SKL-IOTSC, CIS, University of Macau(澳门大学协同创新研究院物联网国家重点实验室) ; Shanghai Jiao Tong University(上海交通大学) ; COWARobot Co. Ltd.(COWARobot有限公司)
专题命中 安全评测 :alignment(title);分类 cs.CL
AI总结 本文提出CogAlign框架,通过构建层次化临床认知数据集和监督微调提升模型临床分析能力,并采用反事实强化学习消除视觉偏差,实现胃肠诊断的因果关联与高准确率。
Comments ECCV 2026
面向尾部事件的可信预测分布:基于半参数诊断传输图
机构 * Department of Statistics and Data Science, Carnegie Mellon University(统计与数据科学系,卡内基梅隆大学) ; Department of Statistics, Federal University of Sao Carlos(统计系,圣卡洛斯联邦大学)
专题命中 安全评测 :trustworthy(title);分类 cs.LG
AI总结 针对预测分布在尾部事件中局部校准不足的问题,提出半参数局部摊销诊断与重塑(LADaR)框架,通过非参数回归构建诊断传输图,校正尾部概率,生成可解释且鲁棒的预测分布,在热带气旋强度预测中验证有效性。
Comments 29 pages, 5 figures, 2 tables
用于代理网络运维和AI运维的大型语言模型:架构、评估与安全
机构 * School of Computing and Communications(计算与通信学院) ; University of Cambridge(剑桥大学) ; School of Software(软件学院) ; Nanjing University of Information Science and Technology(南京信息科技大學) ; TU Wien(维也纳技术大学) ; ICREA
专题命中 安全评测 :safety(title);分类 cs.AI
AI总结 本文探讨了大型语言模型在网络运维和AI运维中的应用,分析了代理架构、评估方法及安全挑战,强调系统可靠性依赖于模型周边机制,而非模型本身。
Comments 49 pages, 15 figures, 6 tables; survey article
当表格基础模型遇见策略性表格数据:一种先验对齐方法
机构 * University of Science and Technology of China(中国科学技术大学) ; Tsinghua University(清华大学)
专题命中 安全评测 :alignment(title);分类 cs.AI
AI总结 本文研究了表格基础模型在策略性表格数据上的泛化能力,提出了一种策略感知的先验对齐框架SPN,以提高模型在策略性环境中的鲁棒性和预测性能。
Comments Accepted by ICML2026
重新审视关机问题
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文重新评估了AI关机问题的难度,指出现有论证未能证明其难以解决,且相关技术方案对模型性能造成了高安全代价。
Logit边界几何置信接口与稀疏层束 enclaves 协议:安全网络电子健康记录(EHR)互操作性的自包含底层架构
机构 * Light Imaging Technologies, Inc.(光成像技术公司)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出Logit边界几何置信接口与稀疏层束 enclaves 协议,构建EHR互操作的自包含底层架构,经GBI BoundaryBench v0.1评估,Qwen3-4B-Instruct-2507在该接口下无符合要求的输出,为接受边界提供实证证据。
Comments 39 pages; executable Julia verification code included as ancillary material; companion public benchmark: https://github.com/AlvinSpivey/GBI-BoundaryBench
Infra-Bayesian 强化学习智能体在最坏情况鲁棒性上优于经典强化学习
机构 * Purdue University(普渡大学) ; Carnegie Mellon University(卡内基梅隆大学) ; WorldQuant University(WorldQuant大学) ; UC Berkeley(加州大学伯克利分校) ; Aix-Marseille University(阿维尼翁-马赛大学) ; MIT(麻省理工学院) ; University of Zurich(苏黎世大学) ; University of British Columbia(不列颠哥伦比亚大学) ; University of Stuttgart(斯图加特大学) ; University of Buenos Aires(布宜诺斯艾利斯大学) ; California State University, Fresno(弗雷斯诺加州州立大学) ; University of Chicago(芝加哥大学)
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
AI总结 针对经典强化学习在模型误设和策略依赖不确定性下的失败,提出 Infra-Bayesian 框架,通过区分概率不确定性和 Knightian 不确定性并采用最坏情况决策,在有限状态无状态决策问题中实现更低的最坏情况遗憾。
Comments RLC 2026: Accepted to Finding the Frame Workshop
FinTrace: LLM工具调用在长周期金融任务中的轨迹级综合评估
机构 * Stevens Institute of Technology(斯蒂文斯理工学院) ; Independent Researcher(独立研究者) ; The FinAI(FinAI) ; Duke University(杜克大学)
专题命中 安全评测 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文提出FinTrace基准,通过800个专家标注的轨迹评估LLM工具调用,揭示模型在信息利用和最终答案质量上的不足,并通过FinTrace-Training数据集提升中间推理能力,但最终答案质量仍受限。
神经符号AI中的符号接地:推理快捷方式的入门介绍
机构 * University of Trento(特伦托大学) ; Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) ; Sapienza University of Rome(罗马大学) ; University of Edinburgh(爱丁堡大学) ; Huawei Labs(华为实验室)
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 本文探讨神经符号AI中推理快捷方式的问题,分析其成因与影响,并提供解决方法与策略,以提升模型的可靠性和可信度。
Comments Published on JAIR (Integration of Logical Constraints in Deep Learning special track)
Token Buncher: 保护大语言模型免受有害强化学习微调的威胁
机构 * Nanyang Technological University(南洋理工大学) ; Centre for Frontier AI Research, A*STAR(前沿人工智能研究中心,A*STAR) ; Northwestern University(西北大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG
AI总结 本文提出TokenBuncher,通过限制模型响应熵来防御基于强化学习的有害微调,实验显示其能有效抑制有害行为同时保持正常任务性能。
Comments Accepted by ACM CCS 26
语言模型输出分布中的尾部风险估计
机构 * Columbia University(哥伦比亚大学) ; Department of Computer Science, New York University(纽约大学计算机科学系) ; Center for Data Science, New York University(纽约大学数据科学中心)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 提出一种基于重要性采样的方法,通过创建不安全版本来高效估计语言模型产生有害输出的尾部概率,在10-20倍更少样本下匹配蒙特卡洛估计,并揭示模型对输入的敏感性。
Comments Accepted to ICML 2026