arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-21 至 2026-08-21 共收录 56 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 56 篇

2608.19299 2026-08-21 cs.AI 新提交 92%

Air Traffic Control Using Large Language Models: Prompt Engineering, Architecture, and Evaluation

使用大语言模型的空中交通管制:提示工程、架构与评估

Mahyar Ghazanfari, Matthias Casanova, Jordan Kam, Alex Zongo, Peng Wei, Torsten Darrell, Alexandre Bayen

机构 * The George Washington University(乔治华盛顿大学) California Institute of Technology(加州理工学院) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究针对ATC仍以人工为主的问题,设计5种提示结构并在9种LLMs上实验,发现简洁提示表现最佳,注入正确历史可修复脚本严格提示的错误,明确了LLM辅助ATC的路径与局限。

Comments 39 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19347 2026-08-21 cs.SE 新提交 92%

Hype Meets Reality: Large Language Models as Mutators in Search-based Automated Program Repair of Simulink-Stateflow Models

炒作与现实的碰撞:大型语言模型作为基于搜索的Simulink-Stateflow模型自动化程序修复中的变异器

Ayesha Irshad, Pablo Valle, Jon Ayerdi, Aitor Arrieta

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文以Simulink/Stateflow建模的CPS为研究对象,扩展FlowRepair方法用LLM生成的变异替换部分算子,受控实验发现该方法大幅降低修复性能,分析指出盲目集成LLM到基于搜索的APR存在根本局限,需发展混合方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20106 2026-08-21 cs.CL 新提交 91%

OenoBench: A Wine-Domain Benchmark for Knowledge-Grounded Evaluation of Large Language Models

OenoBench:用于大型语言模型知识基础评估的葡萄酒领域基准

Nikita Khudov

机构 * DipWSET(葡萄酒与烈酒教育基金会文凭) StrategAI

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(title);分类 cs.CL

AI总结 本研究推出葡萄酒领域基准OenoBench,构建含3266道题的语料库,评估16种LLM配置,发现不同模型准确率差异及推理模式提升等规律并发布相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19323 2026-08-21 cs.LG cs.AI stat.ML 新提交 91%

Improved Confidence Estimates for Black-Box Large Language Models

黑盒大型语言模型的改进置信度估计

Sokhna Diarra Mbacke, Mouloud Belbahri, Gabriel Loaiza-Ganem

机构 * Layer 6 AI TD Insurance(TD保险)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本研究针对黑盒大型语言模型的不确定性量化问题,利用目标数据集构建基于现有分数和相似查询正确性的简单分类器,以改进置信度估计,且计算开销极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19208 2026-08-21 cs.CL cs.CV 新提交 90%

When Irrelevant Text Matters: Affine Margin Shifts in Multimodal Large Language Models

当无关文本起作用时:多模态大语言模型中的仿射间隔偏移

Yinfeng Wang, Zhiyuan Yao, Zheren Fu, Lei Zhang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文研究多模态大语言模型(MLLMs)中任务无关文本对视觉判断任务的影响,发现其会使模型决策间隔发生可预测的仿射变换,为提升模型对噪声上下文的鲁棒性提供了诊断基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19802 2026-08-21 cs.CL 新提交 90%

Stopping and Routing LLM Judge Panels

停止与路由大语言模型(LLM)评审小组

Bin Zhu, Yi Xie, Yanghui Rao

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Sun Yat-sen University(中山大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 该研究将LLM评审小组设计建模为角色条件分配问题,提出策略优化评审调用,经多类审计对比,生成可复用的评审调用计划。

Comments 21 pages, 2 figures, 20 tables. Accepted at WISE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19689 2026-08-21 cs.AI 新提交 90%

Rethinking the Evaluation and Optimization of LLM-Based Social Simulation

重新思考基于大语言模型(LLM)的社会模拟的评估与优化

Pei Wang, Xu Chen, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 针对LLM社会模拟中基于准确率的评估与硬标签训练的缺陷,提出主观性自适应软标签训练(SALT),构建SUBJSIM基准并验证其在现实场景下的可行性与优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01034 2026-08-21 cs.CL stat.ME 版本更新 90%

A Finite-Calibration Regime Map for LLM Judge Panels

有限校准机制图:LLM评审团面板

Bin Zhu, Yi Xie, Yanghui Rao

机构 * School of Computer Science and Engineering(计算机科学与工程学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 研究在有限人工标注预算下,低维堆叠器与联合输出表对LLM评审团面板的校准权衡,提出有限校准面板选择方法,实验表明多数评审输出可加或冗余。

Comments 33 pages, 11 figures, 40 tables. Accepted at WISE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19437 2026-08-21 cs.CL cs.AI cs.CY 新提交 90%

Are LLMs becoming similarly creative? Evidence from three years of models

大型语言模型(LLM)正变得同样具有创造力吗?来自三年模型的证据

Nirav Patel, Josiah Crossman, Eva Aggarwal, Emily Wenger

机构 * Duke University(杜克大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过分析三年间的LLM在Infinity-Chat100和替代用途任务上的表现,发现LLM创造性输出多样性随时间显著下降,存在同质化趋势,需关注其对人机协同创作中人类能动性的影响。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20304 2026-08-21 q-fin.RM 新提交 89%

Calibration-Induced Degeneracy in LLM Financial Forecasting: An Audit-Trailed Case Study on Next-Day Market Risk

LLM金融预测中校准诱导的退化:关于次日市场风险的审计跟踪案例研究

Arin Mohanty

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 该研究以次日市场风险为对象,发现LLM金融预测中存在校准诱导的退化问题,提出校准可行性检查点,验证低成本基准的关键作用并终止了无效的全历史推理阶段。

Comments 13 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19235 2026-08-21 cs.DL 新提交 89%

Beyond Document Retrieval: Architectural Challenges When LLM Agents Query Structured Enterprise Data

超越文档检索:LLM智能体查询结构化企业数据时的架构挑战

Sheikh Nazib Ahmed

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对企业智能体查询结构化数据的架构挑战,划分七个维度提出设计框架,经实验验证其可消除授权违规,还给出评估协议与开放问题。

Comments 9 pages, 4 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06635 2026-08-21 cs.IR 版本更新 89%

Can LLM Annotations Replace User Clicks for Learning to Rank?

大语言模型标注能否替代用户点击用于学习排序?

Lulu Yu, Keping Bi, Jiafeng Guo, Shihao Liu, Shuaiqiang Wang, Dawei Yin, Xueqi Cheng

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文探究LLM标注能否替代点击数据用于学习排序,经多维度对比实验发现二者各有优劣,提出两种整合二者监督信号的训练策略可提升排序性能。

Comments 12 pages, 7 figures, accepted as a Full Research Paper at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20320 2026-08-21 cs.AI cs.CL 新提交 88%

An Agentic Approach for Active Data Collection, Travel Behavior Modeling, and Weather-Sensitive Demand Prediction

一种用于主动数据收集、出行行为建模及天气敏感需求预测的智能体方法

Narges Ahmadi (1), Yubo Jiao (1), Jônatas Augusto Manzolli (1), Jiangbo Yu (1), Luis Miranda-Moreno (1) ((1) McGill University)

机构 * McGill University(麦吉尔大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究提出三智能体工作流,结合对话式调查、传统建模与多模态LLM预测,基于学生通勤数据实现天气敏感出行需求预测,视觉配置模型准确率达71.5%

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19760 2026-08-21 cs.LG cs.AI cs.CL 新提交 88%

Credit Without Ground Truth: Auditing Step-Level Credit Assignment in LLM Agents Against Executed Replay

无真实值的信用:针对执行重放的大语言模型智能体的步骤级信用分配审计

Haiyue Zhang

机构 * University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对LLM智能体,在ALFWorld环境中审计步骤级信用分配,发现现有信用信号无法识别关键步骤,提出需匹配有效样本量比较信用规则。

Comments 49 pages, 7 figures. Pre-registered; frozen analysis plans and prompts included in the appendices. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20338 2026-08-21 cs.CL 新提交 88%

ConceptGuard: Benchmarking Context-Sensitive Unlearning in Large Language Models

ConceptGuard:评估大语言模型中上下文敏感的遗忘能力

Sahil Kale, Ian Harris

机构 * Pune Institute of Computer Technology(浦那计算机技术学院) University of California, Irvine(加州大学欧文分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 该研究针对大语言模型遗忘能力评估的缺陷,提出ConceptGuard基准,聚焦两用概念,发现现有遗忘技术存在性能缺陷,为实用安全的遗忘方法提供思路。

Comments Submitted to NeurIPS E&D Track 2026; 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20116 2026-08-21 cs.CL 新提交 88%

When Text and Numbers Disagree: Evidence Arbitration in Large Language Models

当文本与数字不一致时:大型语言模型中的证据仲裁

Mattia Carletti, Edward Phillips, Fredrik K. Gustafsson, Patitapaban Palo, Lei Clifton, Danielle Belgrave, Xiao Gu, David A. Clifton

机构 * University of Oxford(牛津大学) GlaxoSmithKline(葛兰素史克) Oxford Suzhou Centre for Advanced Research(牛津大学苏州高等研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 该研究构建合成基准探究LLMs在文本与数字证据冲突时的仲裁行为,发现其存在系统性偏好,常依赖启发式策略,凸显工具增强决策系统的失效模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19981 2026-08-21 cs.CL 新提交 88%

HealMed: Multilingual Evaluation of Large Language Models in Medicine

HealMed:面向医学领域的大语言模型多语言评估

Yingjian Chen, Fan Gao, Sherry T. Tong, Haoyu Zhang, Aosong Feng, Kevin W. Jin, Xing Wu, Jinghui Lu, Abdul Samad, Akbar Faruqi, Cesar Caraballo, Cibele Brandão, Dhruva (Drew) Gupta, Eunji Jeon, Gabriel Madera-Santiago, Geon Lee, Hugo Toshio Itikawa, Insook Cho, Isabelli Martins, Isarar Siddique, Israr Ahmed, Jihyo Kwak, Kanyakorn Veerakanjana, Luis Guilherme Cardoso, Minjin Kim, Piyalitt Ittichaiwong, Renee Dua, Santiago Gudiño-Rosales, Xiujie Chen, Zeo Lapalus, Zixin Xu, Michihiro Yasunaga, Rex Ying, Heuiseok Lim, Jaewoo Kang, Chanjun Park, Hang Jiang, Ethan Goh, Hyunjae Kim, Edison Marrese-Taylor, Yusuke Iwasawa, Yutaka Matsuo, Qingyu Chen, Irene Li

机构 * HealMed Research Team(HealMed研究团队)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究推出医学领域大语言模型多语言评估基准HealMed,经多国专家历时两年开发,实验发现低资源语言性能下降明显,专有模型更稳定,医学专业知识不保证多语言鲁棒性,翻译质量影响评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19974 2026-08-21 cs.AI 新提交 87%

ReguSim: Evaluating LLM Agent Rule Grounding in Financial Compliance

ReguSim:评估大语言模型智能体在金融合规中的规则落地

Yiyang Luo, Yihang Jiang, Qijun Xie, Liang Lan, Lin Willian Cong, Anyi Rao, Yunya Song

机构 * HKUST(香港科技大学) HKBU(香港浸会大学) NTU(新加坡南洋理工大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 研究针对LLM智能体在金融合规中的规则落地问题,构建ReguSim环境与ReguBench基准,发现可见规则无法完全消除违规动作,结构化监控基线表现优于纯提示LLM,为金融合规评估提供新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19746 2026-08-21 cs.CL 新提交 87%

PersonalBench: Measuring the Authorship Gap in LLM Personalization

PersonalBench:测量大语言模型个性化中的作者差距

Yash Ganpat Sawant

机构 * Independent AI Researcher(独立人工智能研究员)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 本研究推出PersonalBench基准,通过LUAR、LLM评判者、自动风格计量学评估LLM个性化方法,发现其可区分作者但未达人类水平,发布该基准为LLM个性化提供校准工具。

Comments 17 pages. Extended version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23522 2026-08-21 cs.CL cs.AI 版本更新 87%

Qworld: Question-Specific Evaluation Criteria for LLMs

Qworld: 为LLMs设计的问题特定评估标准

Shanghua Gao, Yuchang Su, Pengwei Sui, Curtis Ginder, Marinka Zitnik

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) Department of Medicine, Brigham and Women’s Hospital(布里洛妇产科医院医学部) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究 institute) Broad Institute of MIT and Harvard(MIT 和哈佛大学Broad研究所) Harvard Data Science Initiative(哈佛大学数据科学计划)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Qworld通过递归扩展树生成问题特定评估标准,覆盖89%专家标准并产生79%新标准,揭示LLM在长期影响、公平性等维度的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19893 2026-08-21 cs.CL cs.AI 新提交 86%

Interrupting the Loop: Periodic Subject Changes Raise Judged Surprise and Connection in Base Language Models

打断循环:周期性主体变化提升基础语言模型的惊讶度与关联度

Roberto I. Ono Filho

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究探究基础语言模型的长文本生成特性,发现周期性注入新主体的打断操作可提升模型生成文本的惊讶度与关联度,还提出了长文本生成的评估方案。

Comments 48 pages including appendix; code, data pipeline and lab notebook at this https URL (https://github.com/RobertoOno/interrupting-the-loop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08866 2026-08-21 cs.SE 版本更新 86%

ArkEval: Benchmarking and Evaluating Automated CodeRepair for ArkTS

ArkEval: 对ArkTS自动代码修复的基准测试与评估

Bang Xie, Senjian Zhang, Zhiyuan Peng, Wei Chen, Chenhao Ying, Yuan Luo

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 ArkEval为ArkTS自动代码修复提供首个全面基准,通过挖掘官方仓库问题并采用LLM测试机制,评估了四种先进模型的修复能力,揭示了LLM在该领域的现状与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17379 2026-08-21 cs.CL cs.AI 版本更新 85%

PTXBench: Benchmark and Adapt LLMs for GPU Kernel Optimization with Architecture-specific PTX

PTXBench:用于结合架构特定PTX优化GPU内核的大型语言模型基准测试与适配

Genghan Zhang, Yixin Dong, Chengze Fan, Zhichen Zeng, Yueming Yuan, Shaowei Zhu, Kunle Olukotun

机构 * Carnegie Mellon University(卡内基梅隆大学) RadixArk Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究提出PTXBench基准测试,评估LLM结合架构特定PTX优化GPU内核的能力,发现现有模型能力不均衡,经微调Qwen3.6-27B可改善部分任务但泛化仍不均,该基准为相关研究提供可审计测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06108 2026-08-21 cs.AI 版本更新 84%

Evaluating Investment Logic in Large Language Models: A Real-World Benchmark Towards Personalzied Financial Agents

评估大语言模型的投资逻辑:面向个性化金融智能体的真实世界基准

Yuanhong Jiang, Jingjie Zou, Rui Jiang, Zhenghong Lin, Xusheng Yu, Qiqi Huang, Shuai Jia, Shijie Dai

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.AI

AI总结 该研究推出原生过程基准InvestLogicBench,含151位真实投资者的201247项决策,评估发现金融LLMs逻辑合理性高但事件接地性低,指出需以P→E→R→D→O轨迹评估个性化决策智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19475 2026-08-21 cs.SE cs.AI cs.CL cs.LO 新提交 82%

Measuring What a Specification Determines: A Formal Semantic-Block Model and an Execution-Judged Benchmark

测量规范决定的内容:一种形式化语义块模型与基于执行判断的基准

Oleg Grynets, Dmytro Kostetskyi, Vasyl Lyashkevych

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出形式化语义块模型与基于执行判断的基准,验证其在Oracle-PostgreSQL迁移规范中的有效性,支持确定性为形式化概念但非LLM实现者的独立经验质量指标。

Comments 11 pages, 1 figure, 7 tables, 37 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23955 2026-08-21 cs.AI cs.DC cs.LG cs.SI q-fin.CP 版本更新 82%

From Accuracy to Auditability: A Survey of Determinism in Financial AI Systems

从准确性到可审计性:金融AI系统中的确定性综述

Ruizhe Zhou, Xiaoyang Liu, Gaoyuan Du, Yi Zheng, Shouxi Ren, Deepayan Chakrabarti, Dengdu Jiang

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文从系统视角综述了金融AI中表格模型、图网络和基于LLM的智能体工作流三种模态的不可重现性问题,通过实验量化了确定性指标并提出了分层评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28969 2026-08-21 cs.CL cs.AI cs.HC 版本更新 82%

Beyond Recall: Behavioral Specification as an Interpretive Layer for AI Personalization

超越回忆:行为规范作为AI个性化的解释层

Aarik Gulaya

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 提出行为规范作为解释层,通过压缩用户数据为解释性模式,显著提升AI代理对用户意图的表示准确性,减少模型规避,并在解释型问题上优于原始语料和商业记忆系统。

Comments 142 pages, 4 figures. Code, data, judge prompts, and reproduction instructions: this http URL (http://github.com/agulaya24/beyond-recall) 8/19 Replacement: Pages updated to 142 from 134. Added Table of Contents. Updated table/graph formatting. Updated Section 8: Data, Code, and Reproducibility to include updated links, corrected author names

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19207 2026-08-21 cs.CL 新提交 81%

Compliance, Capability, and Conflict: Benchmarking Multimodal LLMs under System Messages

合规性、能力与冲突:基于系统消息的多模态大语言模型基准测试

Juan Yeo, Geewook Kim

机构 * NAVER Cloud(NAVER云) KAIST AI(韩国科学技术院人工智能)

专题命中 评测与基准 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL

AI总结 该研究构建基准VSysBench测试多模态大语言模型在系统消息下的合规性,发现施加系统消息会降低任务准确率,开放权重模型易受用户冲突影响,视觉约束最难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09498 2026-08-21 cs.CL 版本更新 81%

Self-Harness: Harnesses That Improve Themselves

Self-Harness:自我改进的操控框架

Hangfan Zhang, Shao Zhang, Kangcong Li, Chen Zhang, Yang Chen, Yiqun Zhang, Lei Bai, Shuyue Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出Self-Harness范式,让LLM智能体通过弱点挖掘、框架提议和验证迭代改进自身操控框架,在Terminal-Bench-2.0上使三种模型的通过率分别提升21.4%、14.3%和14.2%。

Comments this https URL (https://github.com/qzzqzzb/Self-Harness)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25497 2026-08-21 cs.CV cs.AI 版本更新 79%

A Distributional Robustness Margin For Pathology Foundation Models

超越计数:病理学基础模型的分布稳健性余量

Clément Grisi, Jeroen van der Laak, Geert Litjens

机构 * Radboud University Medical Center(拉德堡德大学医学中心)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 研究病理学基础模型受非生物学变异影响的问题,提出交叉混杂稳健性余量(CRoMa),通过直接比较距离评估模型稳健性,将其重塑为队列范围的余量分布,为模型选择和稳健性评估提供原则基础。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏