The coordination gap in frontier AI safety policies
前沿人工智能安全政策中的协调缺口
专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY
AI总结 本文探讨了前沿人工智能安全政策在预防措施之外的协调能力不足问题,提出通过借鉴核安全、疫情准备和关键基础设施中的机制来改进人工智能治理。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
前沿人工智能安全政策中的协调缺口
专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY
AI总结 本文探讨了前沿人工智能安全政策在预防措施之外的协调能力不足问题,提出通过借鉴核安全、疫情准备和关键基础设施中的机制来改进人工智能治理。
因果路径对齐:为可控的参数知识编辑锚定优化轨迹
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
专题命中 安全评测 :alignment(title,summary_cn);trustworthy(abstract);分类 cs.CL
AI总结 本文提出Causal Path Alignment框架,通过锚定优化轨迹来解决参数知识编辑中的主体主导记忆干扰问题,提升关系特异性并减少副作用。
Comments Accepted by IJCAI 2026
Geometry-Lite: 通过层间边际几何进行可解释的安全探测
机构 * Yonsei University(延世大学) ; Yonsei University College of Medicine(延世大学医学院) ; Department Biomedical Systems Informatics(生物医学系统信息学部门)
专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究了大语言模型在提示级别上的安全探测问题,提出了一种名为Geometry-Lite的紧凑探测器,通过层间边际几何分析来提高安全检测的可解释性和准确性。
基于任务的指令调制多模态大语言模型探测:在自然主义刺激下的区域特定大脑对齐模式
机构 * Technische Universität Berlin(柏林技术大学) ; Rice University(Rice 大学) ; AWS AI Labs, Amazon(Amazon 人工智能实验室) ; IIT Delhi(德里理工学院) ; University of Wisconsin - Madison(威斯康星大学麦迪逊分校) ; Spector Inc(Spector 公司) ; IIIT-Hyderabad(海得拉巴理工学院) ; Microsoft(微软)
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究探讨了指令调制多模态大语言模型在自然主义刺激下的大脑对齐模式,通过比较不同模型在视频和音频任务中的表现,揭示了指令调制对模型表示能力的影响。
Comments 57 pages, 39 figures
EvalMORAAL: 可解释的链式推理与大语言模型道德对齐的LLM-as-Judge评估
机构 * Department of Methodology and Statistics, Utrecht University(方法论与统计学系,乌得勒支大学)
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出EvalMORAAL框架,通过两种评分方法和模型作为裁判的同行评审,评估20个大语言模型的道德对齐情况,发现西方与非西方地区存在显著的道德对齐差距。
Comments Accepted as a poster at *SEM 2026
LLM-脑对齐的跨语言鲁棒性及其计算根源
机构 * Grammar and Cognition Lab, Department of Translation & Language Sciences, Universitat Pompeu Fabra(语言与翻译科学系语法与认知实验室,庞培法华大学) ; Department of Adult Psychiatry and Psychotherapy, University of Zurich(苏黎世大学成人精神病学与心理治疗系) ; Neuroscience Center Zurich, University of Zurich and ETH Zurich(苏黎世大学神经科学中心与苏黎世联邦理工学院) ; Center for Clinical Neuroscience and Cognition and Department of Psychiatry, University of Groningen, University Medical Center Groningen(格罗宁根大学临床神经科学与认知中心及精神病学系,格罗宁根大学医学中心) ; Scalable Scientific Machine Learning Lab, Imperial College London, Department of Earth Science and Engineering(伦敦帝国理工学院可扩展科学机器学习实验室,地球科学与工程系) ; Institut Català de Recerca i Estudis Avançats (ICREA), Barcelona, Spain(加泰罗尼亚高级研究与研究机构(ICREA),巴塞罗那,西班牙)
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL
AI总结 该研究探讨了大型语言模型与大脑对齐的跨语言鲁棒性,通过多语言全脑编码框架分析了中文、英语和法语在自然故事听觉过程中大脑与LLM的对齐情况,发现其在空间上具有跨语言重叠性,但无法通过预测不确定性或表征几何来解释。
GrandGuard:面向老年人与聊天机器人交互安全的分类、基准及防护措施
机构 * The Hong Kong University of Science and Technology(香港科技大学)
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 本文提出GrandGuard框架,用于评估和缓解LLM交互中的老年人特定风险,通过建立包含50种细粒度风险类型的三级分类体系,构建了10,404个标注提示和响应的基准,展示了主流LLM在处理老年人特定情境风险时的不足,并通过两种防护措施实现了高达96.2%和90.9%的不安全提示检测准确率。
重新思考欺诈安全评估:多轮攻击揭示图上下文LLM防御中的安全与效用权衡
专题命中 安全评测 :safety(title,abstract)
AI总结 本文通过多轮攻击评估欺诈防御系统,发现图上下文防御在早期安全拒绝方面优于纯文本基线,但同时产生更多的良性误报,揭示了安全与效用之间的权衡。
Comments 19 pages, 3 figures
TRAM: 测试时风险适应与代理混合
机构 * UT Austin(得克萨斯大学) ; University of Central Florida(中央佛罗里达大学) ; MIT(麻省理工学院) ; UMD(大学公园分校)
专题命中 安全评测 :safety(abstract,abstract_cn);alignment(abstract);分类 cs.LG
AI总结 本文研究了在部署时无需更新的零更新适应问题,提出TRAM方法通过混合代理评估源策略的风险调整分数,以降低部署风险并保持奖励。
谱遗忘:无需重新训练的后验能力恢复
机构 * Zeta Labs(泽塔实验室) ; Lahore University of Management Sciences(拉合尔管理科学大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 研究探讨了语言模型在目标任务微调过程中因训练数据未显式威胁而退化的能力现象,提出了一种仅使用预训练检查点和微调后检查点的后验修复方法,通过谱修复技术恢复受损能力并保留目标任务收益。
针对大型语言模型的对话响应生成中的有毒子词修剪
机构 * FaceMind Corporation(FaceMind公司) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 本文提出了一种名为ToxPrune的新型算法,通过修剪包含有毒词的子词来防止大型语言模型生成有毒内容,同时提升了对话响应生成任务中非有毒模型的表现。
Comments ACL *SEM 2026
当控制遇见大语言模型:从词语到动态
专题命中 安全评测 :alignment(abstract);trustworthy(abstract)
AI总结 本文探讨了大语言模型与控制之间的双向关系,研究了LLM如何通过直接辅助控制器设计和间接增强研究流程来推动控制领域的发展,同时分析了控制理论如何帮助LLM偏离不良含义,提高可达性和对齐性,并通过状态空间框架将LLM视为动态系统,最后指出了关键挑战和未来研究方向。
Journal ref Engineering Applications of Artificial Intelligence 178(2), 115119 (2026)
conformal selective acting: any-time-valid risk control for rlvr-trained llms
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出了一种 conformal selective acting 方法,用于在 rlvr 训练的 llms 部署中实现 anytime-valid 的风险控制,通过在部署要求下强制一个空单元,利用 e-process 和 bonferroni 网格来维护 pathwise 有效性,同时在多个基准测试中证明了其有效性。
在压力下:情感框架引发小型语言模型可测量的行为转变和结构化内部几何
机构 * Independent Researcher(独立研究者)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 该研究探讨情感框架如何影响小型本地部署语言模型的行为和内部表示,通过四个不可能约束编码任务和八个后续框架评估,发现压力框架在行为和内部几何上产生显著变化,同时揭示了模型在不同框架下的响应模式。
Comments 18 pages, 4 figures. Exploratory empirical study with fully local experiments on small open language models. Code and data: https://github.com/ranausmanai/LLMEmotionGeometry
UCSF-PDGM-VQA: 用于脑肿瘤MRI解读的视觉问答数据集
机构 * Fung Institute for Engineering Leadership(工程领导力基金会) ; University of California, Berkeley(加州大学伯克利分校) ; Department of Radiology(放射科) ; University of California, San Francisco(加州大学旧金山分校) ; Division of Clinical Informatics and Digital Transformation(临床信息学与数字转型部) ; Department of Neurological Surgery(神经外科部)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本文提出一个临床相关的视觉问答基准数据集UCSF-PDGM-VQA,包含2387个问题-答案对,用于评估视觉语言模型在处理多序列3D MRI扫描中的能力,发现现有模型在多模态处理上存在缺陷。
Comments 10 pages, 2 figures, 6 tables
当AI出错时:AI辅助用药决策系统中的可靠性与风险
机构 * Ducaltus(Ducaltus公司) ; School of Computing, Engineering & Digital Technologies(计算、工程与数字技术学院) ; Teesside University(泰赛德大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了AI辅助用药系统在现实决策中的可靠性问题,通过模拟药物相互作用和剂量决策场景,分析系统故障类型及其潜在临床影响,强调在安全关键领域如药房实践中,需补充传统性能指标的风险意识评估方法。
Comments 9 pages, 1 figure. Position paper with simulated experimental analysis of AI reliability in medication decision systems. Minor Correction to Title Metadata (Typo Fix)
十二篇LLM代理基准测试论文披露了什么:一项初步审计和开放评分方案
机构 * Research Division, BrightMind AI(BrightMind AI研究部) ; Texas Tech University(德克萨斯理工大学) ; University of Texas at Arlington(德克萨斯大学阿灵顿分校)
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
AI总结 本文通过分析十二篇知名LLM代理基准测试论文,揭示了这些论文在评估方法披露方面的不足,设计了一种开放评分方案以提高透明度和可重复性。
Comments Pilot audit of 12 LLM agent benchmark papers; schema, codebook, and per-paper scoring sheet released. Submission to IEEE Big Data 2026
LoCar: 通过细粒度社会语言学控制评估车载助手的本地化
机构 * KAIST(韩国科学技术院) ; BMW Group(宝马集团)
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 本文提出了一种新的车载助手评估框架,专注于韩语本地化,揭示了当前LLM在细粒度韩语敬语控制方面的不稳定性以及策略性对话指标上的表现不足,强调了汽车AI需要向精确语言定制和可靠安全交互管理发展。
Comments To appear in ACL 2026 Industry Track
AIMBio-Mat: 一个面向AI的FAIR平台,用于闭环材料发现与生物医学转化
机构 * Department of Physics, University of South Dakota(南达科他大学物理系) ; South Dakota School of Mines and Technology(南达科他州矿学院) ; Department of Chemistry, Physics and Materials Science, Fayetteville State University(费耶特维尔州立大学化学、物理与材料科学系) ; University of South Dakota(南达科他大学) ; PROMISE Lab, Sanford Research(桑福德研究机构PROMISE实验室) ; Department of Mechanical Engineering, University of Mississippi(密西西比大学机械工程系) ; Department of Physics and Astronomy, University of Kansas(堪萨斯大学物理与天文学系) ; Tiospa Zina Tribal School(蒂奥萨宾纳部落学校) ; Department of Mechanical and Materials Engineering, University of Nebraska–Lincoln(内布拉斯加大学林肯分校机械与材料工程系)
专题命中 安全评测 :safety(abstract);分类 cs.LG
AI总结 本文提出AIMBio-Mat平台,通过整合材料来源、生物医学背景、知识图谱、不确定性感知的机器学习和人机协作主动学习,解决材料发现与生物医学转化中跨领域推理的问题,并提供可验证的平台蓝图。
Comments 35 pages, 4 figures, and 12 tables
MTR-Suite: 一个用于评估和合成对话检索基准的框架
机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) ; Meituan Inc.(美团公司) ; NiuTrans Research(牛译研所) ; Tsinghua University(清华大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文提出MTR-Suite框架,通过LLM审计、多智能体系统生成和通用领域基准,解决对话检索基准评估和合成中的成本高、标注稀疏和自动化方法僵化的问题。
Comments Accepted to ACL 2026 (main conference). 28 pages. Code and data: https://github.com/rangehow/mtr-suite
S2Aligner: 用于稀疏文本属性图的高效且可迁移的预训练方法
机构 * Beihang University(北航大学) ; Tianjin University(天津大学)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 本文提出S2Aligner,一种针对稀疏文本属性图的高效且可迁移的预训练方法,通过解耦语义对齐与结构建模,增强对齐过程而不污染共享的语义空间,从而减少跨域泛化差距。
Comments 19 pages
FineVision: 你只需要开放数据
机构 * Hugging Face ; Technical University of Munich(慕尼黑技术大学) ; Stanford University(斯坦福大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本文提出FineVision,一个包含2400万样本的高质量数据集,通过半自动化流程整合了200多个来源,通过严格的数据清洗和人工审核确保数据质量,训练基于该数据集的模型在广泛评估中表现更优,推动数据驱动的视觉语言模型研究。
使监管多智能体协作成为可能:架构、挑战与解决方案
机构 * School of Cyber Science and Engineering(网络科学与工程学院) ; Xi'an Jiaotong University(西安交通大学) ; School of Mechatronic Engineering and Automation(机械电子工程与自动化学院) ; Shanghai University(上海大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 本文提出了一种基于区块链的分层架构,用于监管智能体协作,设计了三个关键模块以实现自动问责、动态声誉评估和恶意行为预测,从而建立可信、健壮和可扩展的监管机制。
Comments This work has been submitted to the IEEE for possible publication
近端状态引导:减少人工智能辅助下的技能退化
机构 * Stanford University(斯坦福大学) ; University of California Los Angeles(加州大学洛杉矶分校) ; Toyota Research Institute(丰田研究院)
专题命中 安全评测 :safety(abstract);分类 cs.LG
AI总结 本文提出了一种名为近端状态引导(PSN)的共享自主算法,通过引导用户向最易学习的状态发展,同时优化技能发展和任务表现,以减少人工智能辅助下的技能退化问题。
Comments 9 pages
TextSculptor: 训练和评估场景文本编辑
机构 * Beijing Jiaotong University(北京交通大学) ; Bytedance(字节跳动)
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出TextSculptor框架,通过构建大规模数据集和基准测试,解决场景文本编辑中高质量训练数据稀缺和缺乏标准化评估的问题,提升开源模型性能。
AttriStory: 基于扩散模型的视觉叙事中细粒度属性实现
机构 * Indian Institute of Science(印度科学研究院)
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出AttriStory基准,通过细粒度属性实现提升视觉叙事的质量,引入了在早期去噪步骤中操作的潜在优化模块,并通过AttriLoss目标增强属性-对象对的对齐度,从而实现更精确的属性定位。
Comments Accepted at CVPR AIStory Workshop, 2026
VISTAQA: 评估联合视觉问答与像素级证据
机构 * University of Waterloo(滑铁卢大学) ; Stanford University(斯坦福大学) ; NVIDIA(英伟达)
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出VISTAQA基准,用于评估视觉问答中自由回答的正确性和像素级证据的定位,通过引入GROVE指标,强调回答正确性与视觉证据对齐的重要性,实验显示现有系统在该指标下表现有限,揭示了回答准确性和视觉证据对齐之间的显著差距。
基于 RDF 图的数字孪生元模型语义 grounding
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出了一种基于 RDF 图的数字孪生元模型语义 grounding 方法,通过设计多层数字孪生模型、将元模型提升为 RDF 图以及图基对齐方法 SSM-OM,实现了多层数字孪生的语义一致性与互操作性。
Comments Submitted to Conference, 15 pages excluding references, 4 figures
CardioBench: 心脏超声基础模型是否能超越实验室?
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·本·扎耶德人工智能大学)
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出CardioBench,一个用于评估心脏超声基础模型的基准,通过统一多个公开数据集,评估不同模型在零样本、探测和对齐协议下的性能,揭示通用模型在功能任务上表现优异,但细粒度区分任务上存在不足。
HalluCXR: 评估和缓解医疗视觉-语言模型在胸部X光解读中的幻觉
机构 * Department of Biostatistics & Health Informatics, Institute of Psychiatry, Psychology & Neuroscience, King’s College London(生物统计学与健康信息学系,精神病学、心理学与神经科学研究所,伦敦国王学院)
专题命中 安全评测 :safety(abstract)
AI总结 本文提出HalluCXR基准,评估六种不同架构的视觉-语言模型在856例分层MIMIC-CXR胸部X光图像上的表现,发现61.9%-82.3%的输出存在幻觉,其中80.2%存在临床危险错误,通过引入幻觉分类学、检测管道和模型集成方法,提出了缓解幻觉的策略。