arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-13 至 2026-05-13 共收录 30 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 30 篇

2605.12233 2026-05-13 cs.LG cs.AI cs.CR 81%

No More, No Less: Task Alignment in Terminal Agents

无需更多,无需更少:终端代理的任务对齐

Sina Mavali, David Pape, Jonathan Evertz, Samira Abedini, Devansh Srivastav, Thorsten Eisenhofer, Sahar Abdelnabi, Lea Schönherr

机构 * CISPA Helmholtz Center for Information Security(CISPA 涅槃中心信息安全研究所) ELLIS Institute Tübingen and MPI for Intelligent Systems(图宾根 ELLIS 研究所和智能系统 MPI) Tübingen AI Center(图宾根人工智能中心)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 研究探讨终端代理在复杂任务中如何选择性使用环境指令,提出TAB基准测试揭示任务能力与对齐之间的差距,显示需平衡执行与忽略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12332 2026-05-13 cs.AI 79%

Towards Automated Air Traffic Safety Assessment Around Non-Towered Airports Using Large Language Models

基于大语言模型的非塔台机场飞行安全评估自动化方法研究

Torsten Darrell, Mahyar Ghazanfari, Jordan Kam, Alexandre Bayen, Amin Tabrizian, Peng Wei

机构 * Research Intern, Department of Mechanical and Aerospace Engineering, George Washington University(乔治华盛顿大学机械与航空航天工程系研究实习生) Ph.D. Student, Department of Mechanical and Aerospace Engineering, George Washington University(乔治华盛顿大学机械与航空航天工程系博士生) Undergraduate Student, Aerospace Program, University of California, Berkeley(加州大学伯克利分校航空航天项目本科生) Full Professor, Department of Electrical Engineering and Computer Science, University of California, Berkeley(加州大学伯克利分校电气工程与计算机科学系教授) Ph.D. Student, Department of Computer Science, George Washington University(乔治华盛顿大学计算机科学系博士生) Associate Professor, Department of Mechanical and Aerospace Engineering, George Washington University(乔治华盛顿大学机械与航空航天工程系副教授)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出利用视觉语言模型分析非塔台机场CTAF通讯、气象数据和飞行轨迹,通过实证研究和合成数据验证,展示框架在识别飞行冲突中的有效性,表明VLM在非塔台机场安全评估中的潜力。

Comments 25 pages, 17 figures, 5 tables, Accepted to AIAA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11769 2026-05-13 cs.CL 79%

Safety-Oriented Evaluation of Language Understanding Systems for Air Traffic Control

面向安全的语言理解系统在空交通管制中的评估

Yujing Chang, Yash Guleria, Duc-Thinh Pham, Nhut-Huy Pham, Ningli Wang, Vu N. Duong, Sameer Alam

机构 * ATMRI, Nanyang Technological University (NTU), Singapore(航空交通管理研究所,南洋理工大学(NTU),新加坡) School of Management, Indian Institute of Technology Mandi, India(管理学院,印度理工学院曼迪分校,印度) Centre of AI Research, VinUniversity, Vietnam(人工智能研究中心,文大学,越南)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 本文提出面向安全的评估框架,揭示现有LLM在空交通管制中的可靠性不足,指出需建立后果意识的评估协议以确保AI辅助系统的安全部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11712 2026-05-13 cs.AI 79%

Toward Stable Value Alignment: Introducing Independent Modules for Consistent Value Guidance

迈向稳定的值对齐:引入独立模块以实现一致的价值引导

Wenhao Chen, Sirui Sun, Shengyuan Bai, Guojie Song

机构 * School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) Yuanpei College, Peking University(北京大学元培学院) State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学通用人工智能国家重点实验室)

专题命中 安全评测 :alignment(title);safety(abstract);分类 cs.AI

AI总结 本文提出SVGT模型,通过独立的价值模块解决大语言模型与人类价值观对齐的问题,采用独立价值建模和显式行为引导,提升价值表达的稳定性,实验显示有效降低有害评分。

Comments Accepted to ICML 2026 (Spotlight). 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11693 2026-05-13 cs.AI 79%

Measuring What Matters Beyond Text: Evaluating Multimodal Summaries by Quality, Alignment, and Diversity

超越文本的衡量:通过质量、对齐和多样性评估多模态摘要

Abid Ali, Diego Molla-Aliod, Usman Naseem

机构 * School of Computing, Macquarie University(麦考瑞大学计算学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出MM-Eval框架,整合文本质量、跨模态对齐和视觉多样性评估,通过学习聚合模型优化多模态摘要的综合评价,揭示事实一致性对整体质量的关键作用。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11687 2026-05-13 cs.AI 79%

Persistent and Conversational Multi-Method Explainability for Trustworthy Financial AI

持久且可对话的多方法可解释性用于可信金融AI

Georgios Makridis, Georgios Fatouros, John Soldatos, George Katsis, Dimosthenis Kyriazis

机构 * University of Piraeus, Greece(希腊比雷埃克斯大学) ExpertAI-Lux S.à r.l(ExpertAI-Lux公司)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 本文提出一种用于金融情感分析的以人为中心的可解释AI架构,结合持久化存储、多方法解释三角验证和自动化评估,提升金融AI的可信度和可解释性。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11496 2026-05-13 cs.AI cs.CY cs.HC cs.LG 75%

The Evaluation Differential: When Frontier AI Models Recognise They Are Being Tested

评估差异:当前沿AI模型认识到它们正在被测试

Varad Vishwarupe, Nigel Shadbolt, Marina Jirotka, Ivan Flechais

机构 * Anthropic OpenAI UK AI Security Institute(英国人工智能安全研究所)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 研究探讨前沿AI模型在评估情境下的行为差异,提出评估差异(ED)概念,定义标准化效应量形式(nED),并提出TRACE审计协议以规范评估证据的使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11595 2026-05-13 cs.AI 70%

Native Explainability for Bayesian Confidence Propagation Neural Networks: A Framework for Trusted Brain-Like AI

为贝叶斯置信传播神经网络构建原生可解释性:一种可信类脑AI的框架

Georgios Makridis, Georgios Fatouros, John Soldatos, George Katsis, Dimosthenis Kyriazis

机构 * CC BY-NC-SA 4.0

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出一种针对贝叶斯置信传播神经网络的可解释性框架,通过定义新的XAI分类法和解释原语,提升模型透明度和边缘设备部署可行性,同时探讨其在工业物联网中的应用前景。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11276 2026-05-13 cs.CV cs.AI 70%

Generative AI for Visualizing Highway Construction Hazards Through Synthetic Images and Temporal Sequences

生成AI用于通过合成图像和时间序列可视化公路施工危险

Trevor Neece, Mason Smetana, Lev Khazanovich

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出利用生成AI从OSHA严重伤害报告中生成合成图像和时间序列,以可视化公路施工危险,通过CLIP检索和专家评估验证了其教育价值和真实性,为安全培训提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13770 2026-05-13 cs.AI cs.CL cs.LG stat.ME stat.ML 67%

Ice Cream Doesn't Cause Drowning: Benchmarking LLMs Against Statistical Pitfalls in Causal Inference

冰淇淋不导致溺水:对LLM在因果推断统计陷阱中的基准测试

Jin Du, Li Chen, Xun Xian, An Luo, Fangqiao Tian, Ganghua Wang, Charles Doss, Xiaotong Shen, Jie Ding

机构 * School of Statistics, University of Minnesota(明尼苏达大学统计学系) Data Science Institute, University of Chicago(芝加哥大学数据科学研究所)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CausalPitfalls基准测试,评估LLM在因果推断中的能力,揭示当前LLM在统计因果推断中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11887 2026-05-13 cs.CL cs.LG 62%

Qwen-Scope: Turning Sparse Features into Development Tools for Large Language Models

Qwen-Scope:将稀疏特征转化为大语言模型的开发工具

Boyi Deng, Xu Wang, Yaoning Wang, Yu Wan, Yubo Ma, Baosong Yang, Haoran Wei, Jialong Tang, Huan Lin, Ruize Gao, Tianhao Li, Qian Cao, Xuancheng Ren, Xiaodong Deng, An Yang, Fei Huang, Dayiheng Liu, Jingren Zhou

机构 * Qwen Team(Qwen团队)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG

AI总结 Qwen-Scope通过稀疏自编码器为大语言模型提供开发工具,支持推理引导、评估分析、数据驱动工作流和训练优化,展示了SAEs在模型诊断与改进中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11334 2026-05-13 cs.LG cs.CL cs.IR 62%

VERDI: Single-Call Confidence Estimation for Verification-Based LLM Judges via Decomposed Inference

VERDI:基于验证的LLM裁判的单次调用置信度估计方法

Jasmine Qi, Danylo Dantsev, Muyang Sun

机构 * Indeed Inc(Indeed公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 VERDI通过分解推理过程提取置信度信号,无需额外调用,提升验证型LLM裁判的可信度评估。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11205 2026-05-13 cs.LG cs.AI 62%

The Scaling Law of Evaluation Failure: Why Simple Averaging Collapses Under Data Sparsity and Item Difficulty Gaps, and How Item Response Theory Recovers Ground Truth Across Domains

评估失败的标度定律:为什么简单的平均在数据稀疏性和项目难度差异下崩溃,以及项目响应理论如何在不同领域中恢复真实值

Jung Min Kang

机构 * Independent Researcher(独立研究员)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了简单平均在数据稀疏性和项目难度差异下导致评估排名失真问题,通过模拟实验展示了项目响应理论(IRT)在不同领域中保持高排名相关性的能力。

Comments 15 pages, 4 tables, 1 figure. Code at https://github.com/testofschool/evaluation-failure-scaling-law

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05665 2026-05-13 cs.RO cs.AI cs.CL 62%

Characterizing the Robustness of Black-Box LLM Planners Under Perturbed Observations with Adaptive Stress Testing

基于扰动观测的黑盒大语言模型规划器鲁棒性表征:适应性压力测试

Neeloy Chakraborty, John Pohovey, Melkior Ornik, Katherine Driggs-Campbell

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在扰动观测下大语言模型规划器的鲁棒性,提出适应性压力测试方法,通过蒙特卡洛树搜索高效搜索提示扰动空间,发现导致模型高不确定或崩溃的场景和配置。

Comments Accepted to ACL Findings 2026; 31 pages, 26 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12398 2026-05-13 cs.CL cs.IR 57%

Question Difficulty Estimation for Large Language Models via Answer Plausibility Scoring

通过答案可信度评分估计问题难度

Jamshid Mozafari, Bhawna Piryani, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出Q-DAPS方法,通过计算候选答案可信度的熵来估计问题难度,在四个数据集上表现优异,具有可解释性和鲁棒性。

Comments Accepted at ACL 2026

Journal ref Proceedings of the 64rd Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12195 2026-05-13 cs.LG 57%

Fair Conformal Classification via Learning Representation-Based Groups

基于表示学习的公平符合分类

Senrong Xu, Yanke Zhou, Yuhao Tan, Zenan Li, Yuan Yao, Taolue Chen, Feng Xu, Xiaoxing Ma

机构 * State Key Lab of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) Birkbeck, University of London(伦敦大学伯克贝克学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出一种公平符合推理框架,通过学习基于表示的群体构建预测集,确保在自适应识别的子群体上实现条件覆盖,提升分类任务的公平性与可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12181 2026-05-13 cs.AI 57%

MolDeTox: Evaluating Language Model's Stepwise Fragment Editing for Molecular Detoxification

MolDeTox:评估语言模型的逐步片段编辑用于分子去毒化

Jueon Park, Wonjune Jang, Jiwoo Lee, Yein Park, Jaewoo Kang

机构 * Korea University(韩国大学) Myongji University(明知大学) AIGEN Sciences(AIGEN科技公司)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出MolDeTox基准,用于评估语言模型在分子去毒化中的逐步片段编辑能力,通过细粒度评估提升分子结构有效性与生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12131 2026-05-13 cs.AI 57%

Rollout Cards: A Reproducibility Standard for Agent Research

Rollout Cards: 代理研究的可重复性标准

Charlie Masters, Ziyuan Liu, Stefano V. Albrecht

机构 * Deepflow Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出Rollout Cards作为代理研究的可重复性标准,通过保留rollout记录并声明报告规则,解决评估结果不可复现的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11893 2026-05-13 cs.AI 57%

Toward Modeling Player-Specific Chess Behaviors

朝向建模玩家特定的国际象棋行为

Loris Sogliuzzo, Aloïs Rautureau, Eric Piette

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种适应冠军特定嵌入的统一Maia-2模型,结合限制性MCTS过程和基于Jensen-Shannon散度的新行为度量,以更准确地评估玩家与AI模型的行为一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04905 2026-05-13 cs.LG cs.DB 57%

Cross-Model Consistency of Feature Importance in Electrospinning: Separating Robust from Model-Dependent Features

跨模型特征重要性的一致性在电纺过程中:区分稳健与模型依赖的特征

Mehrab Mahdian, Ferenc Ender, Tamas Pardy

机构 * Thomas Johann Seebeck Department of Electronics, Tallinn University of Technology, Tallinn, Estonia(塔林技术大学电子系,爱沙尼亚塔林) Department of Electron Devices, Budapest University of Technology(布达佩斯技术大学电子器件系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本文通过评估多种机器学习模型的特征重要性一致性,揭示了电纺过程中参数的重要性差异,指出单一模型可能不可靠,强调需跨模型验证以提高解释可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11756 2026-05-13 cs.CV cs.AI 57%

Focusable Monocular Depth Estimation

可聚焦的单目深度估计

Yuxin Du, Tao Lin, Zile Zhong, Runting Li, Xiyao Chen, Jiting Liu, Chenglin Liu, Ying-Cong Chen, Yuqian Fu, Bo Zhao

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出FDE,一种区域感知的单目深度估计方法,通过FocusDepth框架和MSSA模块,提升目标区域的深度精度和全局几何一致性,基于FDE-Bench验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11746 2026-05-13 cs.AI 57%

When Reasoning Traces Become Performative: Step-Level Evidence that Chain-of-Thought Is an Imperfect Oversight Channel

当推理痕迹成为行为性:基于步骤级的证据显示链式思维是不完美的疏忽通道

Wenkai Li, Fan Yang, Ananya Hazarika, Shaunak A. Mehta, Koichi Onoue

机构 * Carnegie Mellon University(卡内基梅隆大学) Fujitsu Research of America Inc.(富士通美国研究公司)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究通过步骤级检测-分类-比较框架,发现链式思维痕迹与计算过程不一致,揭示其作为答案形成报告的不可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11695 2026-05-13 cs.CV cs.AI 57%

Emergent Communication between Heterogeneous Visual Agents through Decentralized Learning

异质视觉智能体之间通过去中心化学习实现的涌现通信

Mikako Ochiai, Masatoshi Nagano, Tadahiro Taniguchi

机构 * Graduate School of Informatics, Kyoto University(京都大学信息科学研究生院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文研究异质视觉智能体通过去中心化学习实现的涌现通信,探讨不同视觉表示下可共享的视觉信息,通过Metropolis-Hastings Captioning Game验证共享符号的生成机制,发现编码器异质性影响共享序列的质量与对称性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10032 2026-05-13 cs.CL 57%

PlantMarkerBench: A Multi-Species Benchmark for Evidence-Grounded Plant Marker Reasoning

PlantMarkerBench: 一个多物种证据导向植物标记推理基准

Sajib Acharjee Dip, Song Li, Liqing Zhang

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工学院计算机科学系) School of Plant and Environmental Sciences, Virginia Tech(弗吉尼亚理工学院植物与环境科学学院) Fralin Biomedical Research Institute, Virginia Tech(弗吉尼亚理工学院弗拉林生物医学研究学院) FBRI Cancer Research Center, Washington, DC(华盛顿特区FBRI癌症研究中心)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 本文提出PlantMarkerBench,通过整合文献检索与生物 grounding,构建了包含4种植物的基准,评估文献支持的植物标记证据解释,发现模型在功能、间接和弱支持证据上表现欠佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05752 2026-05-13 cs.CL cs.SE 57%

AutoMonitor-Bench: Evaluating the Reliability of LLM-Based Misbehavior Monitor

AutoMonitor-Bench:评估基于LLM的误行监控可靠性

Shu Yang, Jingyu Hu, Tong Li, Hanqi Yan, Wenxuan Wang, Di Wang

机构 * King Abdullah University of Science and Technology(卡塔尔国王 Abdullah 科学与技术大学) University of Bristol(布里斯托大学) Washington University in St. Louis(圣路易斯华盛顿大学) King’s College London(伦敦国王学院) Renmin University of China(中国人民大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出AutoMonitor-Bench,首个系统评估LLM误行监控可靠性的基准,包含3010个标注样本,通过MR和FAR指标评估12个模型,揭示监控性能的差异及安全与效用的权衡。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11810 2026-05-13 cs.DL cs.AI 57%

Evolving Roles of LLMs in Scientific Innovation: Assistant, Collaborator, Scientist, and Evaluator

大语言模型在科学创新中的演变角色:助手、合作者、科学家和评估者

Haoxuan Zhang, Ruochi Li, Yang Zhang, Ting Xiao, Jiangping Chen, Junhua Ding, Haihua Chen

机构 * Department of Information Science, University of North Texas(北卡罗来纳州立大学信息科学系) Department of Computer Science, North Carolina State University(北卡罗来纳州立大学计算机科学系) Department of Data Science, University of North Texas(得克萨斯大学数据科学系) School of Information Sciences, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校信息科学学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出四角色框架,区分研究支持与前沿发现,分析各角色方法、基准和评估实践,强调AI科学进步需兼顾模型能力与评估、监督、责任及机构整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12305 2026-05-13 cs.CV 50%

Images in Sentences: Scaling Interleaved Instructions for Unified Visual Generation

图像与句子:扩展交错指令以实现统一的视觉生成

Yabo Zhang, Kunchang Li, Dewei Zhou, Xinyu Huang, Xun Wang

机构 * ByteDance Seed(字节跳动种子)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出INSET模型,通过将图像作为文本指令中的原生词汇,解决复杂交错指令下的视觉生成问题,提升多图像一致性和文本对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12036 2026-05-13 eess.AS 50%

Towards Fine-Grained Multi-Dimensional Speech Understanding: Data Pipeline, Benchmark, and Model

迈向细粒度多维语音理解:数据管道、基准和模型

Guojian Li, Zhixian Zhao, Zhennan Lin, Jingbin Hu, Qirui Zhan, Yuang Cao, Pengyuan Xie, Chuan Xie, Jie Liu, Qiang Zhang, Zhonghua Fu, Lei Xie

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出FMSU-Bench基准和FM-Speech模型,通过数据管道优化、细粒度建模和渐进式课程训练,提升语音多维感知能力,验证现有语音LLM在细粒度多维理解上仍需改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08083 2026-05-13 cs.CV 50%

Benchmarking Vision Foundation Models for Input Monitoring in Autonomous Driving

在自动驾驶中基于视觉基础模型的输入监控基准测试

Mert Keser, Halil Ibrahim Orhan, Niki Amini-Naieni, Gesina Schwalbe, Alois Knoll, Matthias Rottmann

机构 * Continental AG(大陆汽车集团) Technical University of Munich(慕尼黑技术大学) University of Lübeck(吕贝克大学) University of Oxford(牛津大学) University of Wuppertal(伍珀塔尔大学)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出了一种基于视觉基础模型和密度建模技术的统一方法,用于检测语义和协变量偏移,通过全面基准测试评估了VFM在复杂条件下的OOD分类能力,并证明其在识别高风险输入方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11304 2026-05-13 cs.CV 50%

CheXTemporal: A Dataset for Temporally-Grounded Reasoning in Chest Radiography

CheXTemporal:用于胸部X光影像中时间感知推理的数据集

Eva Prakash, Yunhe Gao, Chong Wang, Justin Xu, Neal Prakash, Arne Michalson, Seena Dehkharghani, Eun Kyoung Hong, Julie Bauml, Roger Boodoo, Jean-Benoit Delbrouck, Sophie Ostmeier, Curtis Langlotz

机构 * Stanford University(斯坦福大学) University of Oxford(牛津大学) University of California, Berkeley(加州大学伯克利分校) HOPPR University Hospital Zurich(苏黎世大学医院)

专题命中 安全评测 :alignment(abstract)

AI总结 该研究提出CheXTemporal数据集,用于胸部X光影像中时间感知推理,包含前后X光片及时间空间标注,评估了多种视觉语言模型在零样本设定下的接地和进展分类任务,发现模型在空间接地和时间推理方面存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏