Generative Unsupervised Downscaling of Climate Models via Domain Alignment: Application to Wind Fields
通过域对齐生成无监督降尺度:应用于风场
专题命中 安全评测 :alignment(title,abstract)
AI总结 本文提出基于域对齐的生成模型,用于多变量风场降尺度与偏差校正,提升空间一致性与鲁棒性。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
通过域对齐生成无监督降尺度:应用于风场
专题命中 安全评测 :alignment(title,abstract)
AI总结 本文提出基于域对齐的生成模型,用于多变量风场降尺度与偏差校正,提升空间一致性与鲁棒性。
鲁棒性几何:优化损失景观曲率和特征流形对齐以增强视觉-语言模型的鲁棒微调
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 安全评测 :alignment(title,abstract)
AI总结 本文提出GRACE框架,通过联合调节参数空间曲率和特征空间不变性,提升视觉-语言模型在分布内准确率、分布外泛化和对抗鲁棒性之间的平衡,实验显示在ImageNet微调中ID准确率提升10.8%,对抗准确率提升13.5%。
LLM-as-a-Judge 的安全性:全面的系统化知识综述
机构 * University of Pavia(帕维亚大学) ; Cochin University of Science and Technology(科钦科技大学)
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI
AI总结 本文系统分析了LLM-as-a-Judge的安全性问题,提出分类框架,探讨了攻击、防御和应用等方向,揭示了现有框架的漏洞及改进方向。
通过基督教对人类繁荣的理解评估人工智能
机构 * Gloo ; WinShape Foundation(WinShape基金会) ; Biblica
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 本文提出基督教单轮Flourishing AI基准,评估前沿模型在七个维度上的人类繁荣表现,发现AI默认采用世俗主义,导致道德和神学推理不足。
代理AI安全:威胁、防御、评估与开放挑战
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 本文探讨代理AI系统的安全威胁与防御策略,分析其在自动化中的独特风险,并提出安全设计的开放挑战。
Comments Published in IEEE Access. DOI: https://doi.org/10.1109/access.2026.3675554
VERDI:嵌入视觉语言模型的自动驾驶推理
机构 * Princeton University(普林斯顿大学) ; Torc Robotics
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 VERDI通过在训练时整合视觉语言模型的推理过程和常识知识,提升自动驾驶系统的决策能力,实现更高效的模块化架构,同时保持快速推理速度。
基于受控扰动的理性稳定性经验表征
机构 * The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) ; Department of Computer Science, The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校计算机科学系) ; Department of Mechanical, Aerospace, and Industrial Engineering, The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校机械、航空航天与工业工程系)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出一种新指标评估模型解释的一致性,通过BERT等预训练模型和SHAP计算特征重要性,检测模型在相似输入下是否保持一致的推理行为。
Comments 28th International Conference on Pattern Recognition (ICPR) 2026
Cite Pretrain: 无需检索的知识归因于大语言模型
机构 * Duke University(杜克大学) ; Meta
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出CitePretrainBench基准,通过修改训练过程使大语言模型在无检索情况下可靠归因于训练期间看到的文档。通过两阶段方法提升模型在短形式和长形式引用任务中的表现,实验显示Active Indexing在多个任务和模型中均取得30.2%的引用精度提升。
LLMs 自我评判:一种用于人类对齐评估的游戏理论框架
机构 * Beijing Institute of Technology(北京理工大学) ; Southeast Academy of Information Technology(东南信息技术研究院)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种基于游戏理论的自动相互评估框架,通过LLM自我评估和同伴评审,结合人类投票行为,探索LLM评估的对齐性。
ACT:代理分类树
机构 * AXA AI Research(AXA人工智能研究) ; Stanford University(斯坦福大学) ; EPFL, Lausanne, Switzerland(瑞士洛桑联邦理工学院) ; Polish Academy of Sciences, IBS PAN, Warsaw, Poland(波兰科学院计算机科学研究所)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 ACT通过将决策树扩展到非结构化输入,利用自然语言问题和LLM反馈提升透明度和可解释性,实验证明其在文本基准上优于基于提示的方法。
Comments 25 pages, 8 figures
测量能力,而非表现:跨医学基准的项目意识评估
机构 * School of Computing and Information, University of Pittsburgh(匹兹堡大学计算与信息学院) ; Department of Educational Psychology, University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校教育心理学系) ; Department of Emergency Medicine, University of Pittsburgh(匹兹堡大学急诊医学系)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本文提出MedIRT框架,通过项目反应理论评估LLM在医学领域的实际能力,揭示了不同医学主题的领域异质性,并展示了项目难度分析对不同响应模式的诊断价值。
VERT:用于放射学报告评估的可靠LLM评判者
机构 * Cornell University(康奈尔大学) ; Microsoft Healthcare & Life Sciences(微软医疗健康与生命科学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出VERT作为LLM评判者,通过对比现有指标和实验验证,展示了其在多模态和解剖结构上的鲁棒性及轻量级微调的有效性。
利用大语言模型评估数字农业工具的包容性:人类与AI评估的比较分析
机构 * International Water Management Institute(国际水资源管理研究所)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY
AI总结 本文探讨大语言模型在快速评估数字农业工具包容性方面的潜力,比较四种模型与专家评估的性能,发现其在某些维度上能接近专家判断,但可靠性因模型和情境而异。
Comments 24 pages, 6 figures, 5 tables
学习、潜能与保留:评估自适应AI医疗设备的方法
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本文提出三种测量方法:学习、潜能和保留,用于评估自适应AI医疗设备的性能变化,通过模拟人口变化验证了其有效性。
DIRECT:通过分层多智能体规划和意图引导编辑实现视频混剪创作
机构 * School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) ; School of Computer Science, Peking University(北京大学计算机科学学院) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本文提出DIRECT框架,通过分层多智能体规划和意图引导编辑解决视频混剪中多模态协调问题,提出Mashup-Bench基准并验证了方法在客观和主观评估上的优越性。
我们离目标还有多远?对LLMs与人类专家在数学建模竞赛中的系统评估
机构 * Beijing Institute of Technology(北京理工大学) ; Southeast Academy of Information Technology(东南信息技术研究院)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文系统评估了LLMs与人类专家在数学建模竞赛中的能力差异,揭示了当前先进LLMs在执行阶段存在显著缺陷,需超越模型扩展的解决方案。
基于构造的合规性论证图:利用生成式AI生成证据关联的正式论证以实现认证级问责
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本文提出一种结合生成式AI与结构化正式论证表示的合规性架构,通过类型化论证图、检索增强生成、推理验证内核和溯源账本,确保论证的可验证性和可追溯性,防止不支持的主张进入决策记录。
Comments Accepted at FACCT 2026, IoT CPS Week
增强基础视觉语言模型对缺失模态的鲁棒性:可扩展的扩散用于双向特征恢复
机构 * Department of Electronics ; Information \ 'an Jiaotong University Xi'an China ; School of Information ; Communications Engineering \ 'an Jiaotong University Xi'an China ; School of Mathematics ; Statistics \ 'an Jiaotong University Xi'an China ; Information \ 'an Jiaotong University ; Communications Engineering \ 'an Jiaotong University ; Statistics \ 'an Jiaotong University
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本文提出一种通用缺失模态恢复策略,通过增强扩散模型实现双向特征对齐,提升视觉语言模型在模态缺失情况下的鲁棒性和可扩展性。
Comments 10 pages, 8 figures, 6 tables. Experiments and some details have been updated
重写视频:基于文本的视频重写
机构 * Columbia University(哥伦比亚大学) ; Adobe Research(Adobe研究院)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本文提出基于文本的视频重写方法,通过生成重建算法将视频转为可编辑文本提示,并通过交互式工具Rewrite Kit实现视频内容的重写,探讨了文本驱动视频重写的新范式。
HAG:基于主题自适应的分层人口树状代理生成
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) ; University of Chinese Academy of Sciences(中国科学院大学) ; School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学前沿交叉科学学院)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本文提出HAG框架,通过分层决策过程生成符合主题需求的代理群体,提升宏观分布与微观一致性。实验表明HAG在减少群体对齐误差和增强社会一致性方面表现优异。
Comments Accepted by ACL 2026 main
上下文中的矛盾:医疗领域检索增强生成的挑战
机构 * Deakin University(迪肯大学) ; RMIT University(皇家墨尔本理工大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
AI总结 本文研究了在医疗领域使用检索增强生成方法时,源文档中过时或矛盾信息对模型性能的影响,提出了一个基准数据集并分析了不同LLM的表现。
XiYan-SQL:一种新型多生成器框架用于文本到SQL
机构 * Alibaba Cloud Computing Co., Ltd.(阿里云计算有限公司)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文提出XiYan-SQL框架,通过多生成器 ensemble 方法生成高质量SQL查询,并结合schema过滤和选择模型提升性能,实现在BIRD和Spider数据集上均取得SOTA结果。
Comments Published in IEEE TKDE
POEMetric:人类的最后一段
机构 * University of Birmingham(伯明翰大学) ; University of Trento(特伦托大学) ; Institute of Data and AI (IDAI)(数据与人工智能研究所)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文提出POEMetric框架,评估诗歌生成能力,通过人类和LLM的对比发现,尽管顶级模型在形式准确性和主题匹配上表现优异,但整体诗歌质量仍逊于人类诗人。
Journal ref ICLR 2026
SecPI: 通过安全推理内化实现安全代码生成
机构 * University of California, Berkeley(加州大学伯克利分校) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 SecPI通过内化结构化安全推理,使推理模型在无需安全指令的情况下生成安全代码,经验证在多个安全基准测试中显著提升代码功能正确性和安全性。
一种用于自主代理的分层错误校正图框架:基于大语言模型的动作生成
机构 * Independent Researcher(独立研究者) ; Beihang University(北京航空航天大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本文提出HECG框架,通过多维可转移策略、误差矩阵分类和因果-上下文图检索三大创新,提升自主代理在动态任务中的策略选择、错误分析和情境适应能力。
KindSleep:基于血氧数据的阻塞性睡眠呼吸暂停诊断
机构 * Georgia Institute of Technology(佐治亚理工学院) ; UT Southwestern Medical Center(德克萨斯大学西南医学中心)
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
AI总结 KindSleep利用深度学习整合临床知识与单通道血氧数据,实现精准的阻塞性睡眠呼吸暂停诊断,其在不同人群中均优于现有方法。
紧凑超立方体嵌入用于快速基于文本的野生动物观察检索
机构 * Inria, LIRMM, UM(法国国家信息与自动化研究所,蒙彼利埃计算机科学实验室,蒙彼利埃大学)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 本文提出紧凑超立方体嵌入框架,通过二进制表示实现高效文本检索,提升大规模野生动物图像和音频数据库的检索效率与鲁棒性。
鲁棒性悖论:在高风险决策中解耦基于规则的逻辑与情感噪声
机构 * Kenyon College(凯尼恩学院)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 研究揭示了大语言模型在高风险决策中对情感噪声的鲁棒性悖论,通过三个领域实验发现模型在逻辑约束下比人类更稳定,但对提示格式敏感。
Comments 47 pages, 14 figures, 23 tables. Substantially revised from v1: added immigration domain extension (14,183 cells), adversarial narrative pilot (2,054 cells), reasoning-trace analysis, scaffolding decomposition. Total: 84,245 valid responses across 13 experiments. Under review at TMLR. Code and data will be released upon publication
超越语义:通过通用物理描述符揭示合成检测的物理本质
机构 * SDIC Intelligence Information Technology Co., Ltd.(国投智能信息技术有限公司) ; Xia'men University(厦门大学)
专题命中 安全评测 :trustworthy(abstract)
AI总结 本文提出通过通用物理描述符区分真实与AI生成图像,探索跨模态合成检测中的核心物理特征及多模态模型整合方法,实现高准确率检测。
将领域专用语言模型与AI测量工具整合用于确定性原子分辨率实验
专题命中 安全评测 :trustworthy(abstract)
AI总结 本文提出一种框架,通过专门的小语言模型实现扫描探针显微镜的自主控制,结合AI驱动的测量工具,实现室温下的原子分辨率SPM实验,提升实验可靠性和可控性。