FENCE: A Financial and Multimodal Jailbreak Detection Dataset
FENCE:一个金融和多模态越狱检测数据集
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI
AI总结 针对金融领域多模态越狱检测资源匮乏的问题,提出FENCE数据集,包含韩英双语文本和图像,用于训练和评估检测器,实验表明基线检测器准确率达99%。
Comments lrec 2026 accepted paper
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
FENCE:一个金融和多模态越狱检测数据集
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI
AI总结 针对金融领域多模态越狱检测资源匮乏的问题,提出FENCE数据集,包含韩英双语文本和图像,用于训练和评估检测器,实验表明基线检测器准确率达99%。
Comments lrec 2026 accepted paper
HalluJudge: 代码审查自动化中上下文错位的无参考幻觉检测
机构 * Monash University Australia(墨尔本大学澳大利亚) ; The University of Melbourne Australia(墨尔本大学澳大利亚) ; Atlassian USA(Atlassian美国)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
AI总结 提出无参考幻觉检测方法HalluJudge,通过上下文对齐评估生成评论的根基性,采用多分支推理策略,在F1=0.85且成本$0.009下与开发者偏好67%一致。
Comments Accepted at FSE'26: Industry Track, Full-Length, Peer-Reviewed
多轮交互中的安全隐患:工具使用智能体的多轮安全风险基准与防御
机构 * Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校)
专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出多轮工具使用安全基准MT-AgentRisk,发现多轮设置下攻击成功率平均增加16%,并设计无训练、与工具无关的自探索防御方法ToolShield,平均降低30%攻击成功率。
GenAutoML: 面向时间序列分析的动态架构生成与优化的智能体框架
机构 * Paul Wurth S.A.(保罗·沃思公司) ; Otto-von-Guericke University(奥托·冯·格里克大学) ; Technical University of Munich(慕尼黑技术大学)
专题命中 安全评测 :safety(abstract);分类 cs.LG
AI总结 提出GenAutoML框架,利用大语言模型作为神经架构师,通过沙盒反射循环和签名感知运行时自动生成并优化时间序列预测与异常检测的神经网络架构,引入动态可逆实例归一化提升非平稳条件下的鲁棒性。
Comments 26 pages, 17 figures, 12 tables. Under review
大型语言模型中的事实性观点能否被编辑(操纵)?
机构 * The Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 提出FOE基准测试,评估当前知识编辑技术对事实性观点(如公众人物立场)的操纵能力,并发现其仅能实现表面修改,无法保持观点与证据的一致性;进而提出自生成证据对齐方法实现观点-证据对齐。
Comments Accepted to the ACL 2026 Main Conference
地球科学基础模型:从感知到推理与发现
机构 * Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
AI总结 本文综述了地球科学基础模型,探讨了其从感知到多模态推理及科学发现的能力演进,并总结了其在大气、水圈、岩石圈等领域的广泛应用。
BLUEmed: 基于检索增强的多智能体辩论用于临床错误检测
机构 * University of California, San Diego(加州大学圣地亚哥分校)
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 提出BLUEmed框架,结合混合检索增强生成与多智能体辩论,通过分解临床笔记、检索证据、专家辩论及安全层过滤,在术语替换错误检测中达到最优性能。
Comments Accepted to the IEEE International Conference on Healthcare Informatics (ICHI) 2026
BrainPro:迈向大规模脑状态感知的脑电图表征学习
机构 * Nanyang Technological University(南洋理工大学) ; Shanghai Jiao Tong University(上海交通大学) ; Advanced Telecommunications Research Institute International(先进电信研究院) ; Southeast University(东南大学)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 提出BrainPro模型,通过检索式空间对齐和脑状态解耦模块,学习共享与特定状态表征,在9个公共BCI数据集上取得最优性能。
Comments 31 pages, 11 figures
位置、类型、原因与重要性:面向文本到图像反馈的结构化缺陷定位
机构 * Tsinghua University(清华大学) ; Kolors Team, Kuaishou Technology(快手科技Kolors团队) ; University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所) ; South China Normal University(华南师范大学)
专题命中 安全评测 :alignment(abstract)
AI总结 提出结构化缺陷定位(SDG)方法,将文本到图像生成中的缺陷诊断建模为结构化集合预测,通过构建SDG-30K数据集和SDG-Eval评估协议,并利用视觉语言模型作为检测器,结合BoxFlow-GRPO将预测的缺陷集合转化为空间奖励以改进扩散模型对齐。
Comments 25 pages, 9 figures
从看见到体验:通过强化学习扩展导航基础模型
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Coco Robotics(Coco机器人)
专题命中 安全评测 :safety(abstract)
AI总结 提出S2E框架,结合离线视频预训练和模拟环境强化学习,通过锚点引导分布匹配和残差注意力模块,提升导航基础模型的交互性和安全性。
Comments 27 pages, 20 figures, 9 tables, conference
智能作为受管自主:代理型AI系统的失败、升级与治理
机构 * DNRS.ai USA(DNRS.ai美国公司)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY
AI总结 本文提出SMARt模型,通过形式化能力检测认知漂移、暂停推理、尝试恢复并在可靠性下降时放弃控制,以解决自主AI系统中的幻觉和持续不合理行为问题。
Comments This peer-reviewed paper is to appear in the Journal of Intelligent and Robotic Systems
PaLMR: 通过多模态过程对齐实现忠实视觉推理
机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) ; Data Science & Artificial Intelligence Research Institute, China Unicom(中国unicom数据科学与人工智能研究院) ; Unicom Data Intelligence, China Unicom(中国unicom数据智能)
专题命中 其他安全 :alignment(title);分类 cs.AI
AI总结 提出PaLMR框架,通过感知对齐数据层和过程对齐优化层,减少推理幻觉并提升视觉推理忠实度,在多个基准上取得最优结果。
Journal ref CVPR 2026 Findings
解析句法:语言建模与语法的子结构
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 本文研究语言模型在上下文无关语法子结构上的学习行为,证明损失函数在顶层子语法上线性递归,并发现参数化模型并行学习子语法,子语法预训练能提升小模型性能并改善内部表征。
Comments Equal contribution by LYS and DM. Accepted to the 43rd International Conference on Machine Learning (ICML 2026)
固态合成预测机器学习模型的热力学评估
机构 * University of Minnesota(明尼苏达大学)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 评估了机器学习模型预测固态材料合成可行性的热力学一致性,发现模型普遍高估合成可能性,但部分分数与热力学启发式趋势一致。