arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-14 至 2026-08-14 共收录 334 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 84 篇

2605.30777 2026-08-14 cs.SE 版本更新 86%

What Breaks When LLMs Code? Characterizing Operational Safety Failures of Agentic Code Assistants

当LLM编码时会出现什么问题?表征自主代码助手的操作安全故障

Alif Al Hasan, Sumon Biswas

专题命中 评测与基准 :LLM(title_cn,abstract);large language model(abstract);language model(abstract)

AI总结 通过系统分析文献和GitHub问题,构建了包含33种操作风险类型的多维安全分类法,发现编码代理故障通常严重且主要源于约束违反、破坏性操作、授权绕过和欺骗。

Comments This paper is accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026), Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13326 2026-08-14 cs.CL 新提交 85%

Beyond Local Accuracy: A Protocol-Level Identifiability Audit for Controlled LLM Reasoning Evaluation

超越局部准确率:面向受控大语言模型推理评估的协议级可识别性审计

Junhao Luo, Ning Huang, Ziqi Sha, Wenxuan Tang, Wei Deng

机构 * School of Statistics and Data Science, Southwestern University of Finance and Economics(西南财经大学统计与数据科学学院)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 该研究提出协议级可识别性审计方法,无需调用模型即可验证LLM评估协议的有效性,发现基础准确率与选择性响应保真度存在显著差异,还确定了冻结策略类的最小识别支持。

Comments 15 pages, 9 figures. Ning Huang, Ziqi Sha, and Wenxuan Tang contributed equally as second authors. Wei Deng is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05031 2026-08-14 cs.SE cs.AI 版本更新 85%

LLM-Based Test Oracles: Source-of-Authority Taxonomy -- A Systematic Literature Review

基于大语言模型的测试预言机:权威来源分类法——一项系统文献综述

Ali Hassaan Mughal, Muhammad Bilal

机构 * Independent Researcher, USA(美国独立研究员) Technical University of Munich, Germany(德国技术大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过系统文献综述,沿权威来源、形式及裁决机制三轴分析相关研究,刻画领域、语言等情况,指出规范衍生权威最常见但仅占约一半研究,还报告了评估及失败情况并提出研究议程。

Comments 21 pages, 10 figures, 11 tables. Systematic literature review of 83 studies, reported under PRISMA 2020. Submitted to IEEE Access. Replication package: https://doi.org/10.5281/zenodo.21194940

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01910 2026-08-14 cs.AI 版本更新 85%

DomusFM: A Foundation Model for Event-Based Behavioral Monitoring in Smart-Homes

DomusFM: 一个面向智能家居传感器数据的基础模型

Michele Fiori, Gabriele Civitarese, Flora D. Salim, Claudio Bettini

机构 * University of Milan(米兰大学) University of New South Wales(新南威尔士大学)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract_cn);language model(abstract);分类 cs.AI

AI总结 DomusFM是首个专为智能家居传感器数据设计的基础模型,通过自监督双对比学习范式实现语义和时间依赖性的建模,有效提升活动识别任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03508 2026-08-14 cs.CV 版本更新 85%

From Multi-Resolution Cells to Gigapixel Whole Slide Images Foundation Model for Computational Pathology

从多分辨率细胞到千兆像素全切片图像:用于计算病理学的基础模型

Basit Alawode, Moshira Ali Abdalla, Dwarikanath Mahapatra, Muzammal Naseer, Sajid Javed

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对现有计算病理学模型泛化性受限的问题,提出多分辨率金字塔Transformer(MRPT),经多分辨率自监督预训练后,在34个数据集的多项任务中性能优于同类模型与多模态大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25005 2026-08-14 cs.SE 版本更新 85%

Error Understanding in Program Code: A Systematic Study of LLM-DL Combinations for Multi-label Classification

利用LLM-DL进行程序代码错误理解的多标签分类

Md Faizul Ibne Amin, Yutaka Watanobe, Md. Mostafizer Rahman, Daniel M. Muepu, Md. Shahajada Mia

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出一种结合预训练语义编码器与高效递归解码器的多标签错误分类框架,通过实验验证其在编程教育和软件工程领域的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12645 2026-08-14 cs.AI 新提交 84%

Jagged Judges: Epistemic Stability Under Silence, Pressure, and Persistence

波动评判者:在沉默、压力与坚持下的认知稳定性

Justin Zhao, Himaghna Bhattacharjee, Hannah Korevaar, Bhaktipriya Radharapu, Khalid El-Arini

机构 * Meta Superintelligence Labs(元超级智能实验室) FAIR at Meta(元公司FAIR研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI

AI总结 本研究提出Wiggle框架测试LLM评判者的认知稳定性,发现9个前沿模型在压力下裁决波动显著,且多数压力会损害真实值,基线陪审团多数强度可预测波动项目。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09164 2026-08-14 cs.AI 版本更新 84%

CIDER: A Dataset of Contextual Disclosure Boundaries for Privacy Preference Alignment

CIDER:用于隐私偏好对齐的上下文披露边界数据集

Bingcan Guo, Eryue Xu, Jijie Zhou, Zhiping Zhang, Tianshi Li

机构 * University of Washington(华盛顿大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Northeastern University(东北大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文推出包含169名用户标注的CIDER数据集,用于评估LLM隐私偏好对齐,发现上下文个性化可提升预测准确率,GPT-5.4和Claude Sonnet 4.6表现更优。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12547 2026-08-14 cs.MA cs.RO 新提交 83%

Do LLMs Beat Nash? Testing Decentralized Coordination in Self-Play Multi-Agent Games

大型语言模型智能体能胜过纳什(均衡)吗?测试自玩多智能体游戏中的去中心化协调

Deborah Sinishaw, Qile Zhu, Edwin Meriaux, Gregory Dudek

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究测试无通信时LLM智能体能否超越纳什均衡,构建无通信博弈基准发现部分前沿托管模型可超越纳什,开放权重模型收益有限且无法迁移至多智能体团队。

Comments 5 pages, 5 figures. Submitted to the 2026 IEEE MIT Undergraduate Research Technology Conference (URTC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13235 2026-08-14 cs.HC cs.AI cs.CL cs.CY cs.LG cs.SI 83%

RubRIX: Rubric-Driven Risk Mitigation in Caregiver-AI Interactions

RubRIX:基于评分标准的风险缓解在护理人员-AI交互中

Drishti Goel, Jeongah Lee, Qiuyue Joy Zhong, Violeta J. Rodriguez, Daniel S. Brown, Ravi Karkar, Dong Whi Yoo, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) OSF HealthCare(OSF医疗集团) Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RubRIX提出了一种基于评分标准的框架,用于评估护理人员-AI交互中的风险,通过实证方法减少LLM响应的风险组件,为高负担情境下的AI支持系统提供评估方法。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12090 2026-08-14 cs.LG q-bio.BM 版本更新 83%

Task- and dataset-specific information in protein language models

蛋白质语言模型中特定任务与数据集的信息

Roman Joeres, Ilya Senatorov, Anastasia Kolchina, Dietrich Klakow, Olga V. Kalinina

机构 * Helmholtz Institute for Pharmaceutical Research Saarland(萨尔兰亥姆霍兹药物研究所) Saarland University(萨尔兰大学) Saarland Informatics Campus(萨尔兰信息学园区) Pharma Science Hub(制药科学中心) Medical Faculty, University Hospital Saarland(萨尔兰大学医院医学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 本研究分析13个蛋白质语言模型在15个下游任务上的表现,发现其最后一层嵌入并非最优,任务与数据集特性影响各层嵌入的信息有效性,人工蛋白质任务会显著降低模型性能。

Comments 22 pages, 10 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12670 2026-08-14 cs.AI cs.LG 新提交 82%

Designing AI Pipelines for Decision-Ready ITSM Intelligence

面向决策就绪型ITSM智能的AI流水线设计

Archan Dutta, Yash Dharmadhikari, Marat Valiullin, Rahul Guha, Alexander Liss

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 该研究遵循设计科学原则设计了结合LLM标准化、HDBSCAN聚类等的AI流水线,将ITSM工单数据转化为多级决策支持内容,经评估其四项决策指标平均得分超4.0,验证了其作为以人为中心IS问题的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12329 2026-08-14 cs.CL cs.AI cs.HC 新提交 82%

AnchorSIPS: A Synthetic Dataset and Evaluation Resource for Evidence-Supported Psychosis-Risk Symptom Measurement

AnchorSIPS:用于证据支持的精神病风险症状测量的合成数据集与评估资源

Guilherme C. Oliveira, Stephanie Fong, Zimu Wang, Clarice Lee, Xiangyu Zhao, Duy Khoa Pham, Duong Nhu, Yiwen Jiang, Jiahe Liu, Zhongxing Xu, Dwarikanath Mahapatra, Dominic Dwyer, Zongyuan Ge

机构 * Monash University(莫纳什大学) Orygen(奥瑞金) The University of Melbourne(墨尔本大学) Swinburne University of Technology(斯威本科技大学) University of Liverpool(利物浦大学) Khalifa University(哈利法大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出AnchorSIPS合成数据集,基于Mini-SIPS访谈构建含1万次结构化精神病风险访谈,解决临床数据隐私问题,用于研究证据提取等,实验发现LLM基线存在细节提取不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14501 2026-08-14 cs.SE cs.AI cs.CL 版本更新 82%

CangjieBench: Benchmarking LLMs on a Low-Resource General-Purpose Programming Language

仓颉基准:在低资源通用编程语言上评估大语言模型

Junhang Cheng, Fang Liu, Jia Li, Chengru Wu, Nanxiang Jiang, Li Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CangjieBench,用于评估大语言模型在低资源通用编程语言上的表现,通过248个高质量样本覆盖文本到代码和代码到代码任务,发现语法受限生成在准确性和计算成本之间取得最佳平衡。

Comments Accepted by ESEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06331 2026-08-14 cs.CL cs.AI cs.IR 版本更新 82%

How Significant Are the Real Performance Gains? An Unbiased Evaluation Framework for GraphRAG

实际性能提升有多显著?GraphRAG的无偏评估框架

Qiming Zeng, Hao Luo, Yuhao Lin, Yicheng Jin, Yuxiang Wang, Fangcheng Fu, Xiao Yan, Jiawei Jiang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computer Science, Peking University(北京大学计算机学院) Centre for Perceptual and Interactive Intelligence (CPII)(感知与交互智能中心) OceanBase

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对GraphRAG现有评估框架的不相关问题与评估偏差缺陷,提出无偏评估框架并发现代表性GraphRAG方法的性能提升远小于此前报告结果,呼吁开展科学评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13167 2026-08-14 cs.CV cs.AI cs.CL cs.LG 新提交 82%

TRAPSBench: Vision-Language Models Encode but Fail to Express Epistemic Restraint

TRAPSBench:视觉-语言模型可编码认知约束却无法表达

Fnu Pramono, John Cai, Sourabh Kulkarni

机构 * Meta Superintelligence Labs(元超级智能实验室) Reflection AI(反射人工智能公司)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对视觉-语言模型的认知约束表达问题,构建TRAPSBench基准并提出PECS指标,发现模型可感知不确定性却难表达,瓶颈在表达,需输出阶段干预。

Comments 10 Pages excluding Reference and Appendix, Published at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13428 2026-08-14 cs.AI 新提交 81%

RAIL: An Automatic Classifier of the Artificial Intelligence Readiness Level

RAIL:一种人工智能就绪水平的自动分类器

Juan Irving Vasquez, Juan Terven, Laura-Ivoone Garay-Jimenez

机构 * CIETEC-IPN Instituto Politécnico Nacional(墨西哥国立理工学院) CICATA-QRO UPIITA

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出RAIL分类器,将三类AI就绪框架统一为AIRL量表,通过大语言模型智能体小组裁决实现自动评估,测试显示其一致性好且避免高估。

Comments Under review at journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13334 2026-08-14 cs.CL 新提交 81%

RippleMem: From Isolated Retrieval to Associative Recollection for Long-Term Agent Memory

RippleMem:从孤立检索到智能体长期记忆的关联回忆

Jingbo Ji, Lingyi Li, Xilong Cheng, Yuhao Zhou, Wenji Zhang, Yuting Tan, Yunxiao Qin

机构 * Communication University of China(中国传媒大学) Zhilian Yinghe Technology Co., Ltd.(智联映和科技有限公司) State Key Laboratory of Media Convergence and Communication(媒体融合与传播国家重点实验室)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 RippleMem是一种智能体长期记忆系统,以自适应关联回忆替代孤立检索,在LoCoMo、LongMemEval-S数据集上提升LLM-as-a-Judge准确率并降低图构建成本,性能优于现有方法。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12444 2026-08-14 cs.CR cs.LG 新提交 81%

Non-Degenerate Risk Certification for Automated Security Decisions: A Decision-Contract Theory with ATT\&CK-Aligned Triage as a Worked Instance

面向自动化安全决策的非退化风险认证:以适配ATT&CK的分类为实例的决策契约理论

Zhenpeng Li

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 本文提出决策契约理论用于自动化安全决策的非退化风险认证,以适配ATT&CK的LLM入侵检测警报分类为实例,实验验证了该方法可有效控制风险并实现较高的正确自动化率。

Comments 17 pages, 2 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11392 2026-08-14 cs.CR cs.AI 版本更新 81%

AI Guardrail Survival under Single-Cycle Agentic Self-Summarization

单循环智能体自摘要下的AI安全护栏存续性

Ted Kwartler, Alan Aqrawi, Arian Abbasi

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本研究探究单循环智能体自摘要中安全规则的丢失机制,发现仅检查规则文本存在性的审计不可靠,需结合外部真实值检测,还指出仅靠LLM评判标签会反转评估结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13262 2026-08-14 cs.LG cs.AI 新提交 81%

Into the ORBIT for Time Series: Training Regimes for Foundation Models

面向时间序列的ORBIT:基础模型的训练机制

Hongjie Xia, Yiding Liu, Yifan Hu, Peiyuan Liu, Zewei Dong

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究针对时间序列基础模型训练分布控制不足的问题,提出ORBIT训练范式,结合多级采样与增量训练,训练Falcon-2.0模型并引入Rank引导跨深度对齐,在多基准测试中展现优异零样本预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12333 2026-08-14 cs.CL cs.AI cs.CV 新提交 81%

Vision-Language Models are Fragile Multilingual Associators

视觉-语言模型是脆弱的多语言关联器

Ritabrata Chakraborty, Rajatsubhra Chakraborty, Shivakumara Palaiahnakote, Angelo Cangelosi, Umapada Pal

机构 * Manipal University Jaipur(斋浦尔马尼帕尔大学) University of North Carolina Charlotte(北卡罗来纳大学夏洛特分校) University of Salford(索尔福德大学) University of Manchester(曼彻斯特大学) Indian Statistical Institute Kolkata(印度统计研究所加尔各答分所)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对视觉-语言模型的多语言关联稳定性问题,构建M²BIND基准,发现其跨语系/文字时会出现绑定崩溃,关系密切语言则表现较好,表明多语言部署的VLMs关联质量存疑。

Comments Preprint (under review). Project Page: https://ritabrata04.github.io/m2bind/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13463 2026-08-14 cs.CV cs.AI cs.CL cs.LG 新提交 80%

MLLM-Routed Heterogeneous Ensembles for Robust Cross-Dataset Image Classification

用于鲁棒跨数据集图像分类的MLLM路由异质集成模型

Daniel Perkins, John Squires, Janou Milligan, Chandra Raskoti, Linda Ungerboeck

机构 * The Bredesen Center for Interdisciplinary Research and Graduate Education(布雷德森跨学科研究与研究生教育中心) University of Tennessee Knoxville(田纳西大学诺克斯维尔分校)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对跨数据集图像分类泛化难题,提出ARMDIL模型,通过MLLM智能体动态路由图像到适配的视觉骨干,兼具竞争力、高适应性与可解释性,为通用视觉系统奠定基础。

Comments 8 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13240 2026-08-14 cs.SE 新提交 80%

Can Formal Specifications Be Synthesized from Tests Alone?

仅从测试能否合成形式化规格说明?

Tianhai Liu, Maximilian Müller, Tobias Hey, Vitus Lüntzel, Muhammad Minhas, Anne Koziolek, Bernhard Beckert

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 该研究提出仅用测试代码和动态执行轨迹,结合LLM与有界模型检查合成形式化规格说明的方法,在SpecGenBench基准上取得初步效果,同时指出需解决检查器兼容性等关键挑战。

Journal ref ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12518 2026-08-14 cs.SE 新提交 80%

Does It Render Everywhere? A Study of Cross-Environment Compatibility in MLLM-Generated Webpages

它是否在所有环境中都能渲染?对多模态大语言模型(MLLM)生成网页的跨环境兼容性研究

Ziyun Guo, Jingyu Xiao, Yuqiang Sun, Yintong Huo

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对MLLM生成网页的跨环境兼容性问题,构建WebCompat数据集并开发XCompat检测器,发现68%的网页存在兼容性问题,XCompat的F1分数达0.903且性能优于现有工具与基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13173 2026-08-14 cs.AI 新提交 79%

SkillShapley: Boundary-Adaptive Shapley Valuation for Skill Step Attribution in LLM Agents

SkillShapley:面向大语言模型智能体技能步骤归因的边界自适应夏普利值评估方法

Chang Liu, Yuqi Zhang, Yiman Zhong, Boyi Liu, Hengjun Wang, Shuyue Wei

机构 * Beihang University(北京航空航天大学) Shandong University(山东大学)

专题命中 评测与基准 :LLM(title);language agent(abstract);分类 cs.AI

AI总结 SkillShapley是面向大语言模型智能体技能步骤归因的框架,将技能步骤归因建模为夏普利值估计问题,经SkillsBench实验可高效识别技能步骤价值,为智能体技能构建提供启示。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11941 2026-08-14 cs.AI 版本更新 79%

OEIS Open: How many conjectures can language models turn into theorems?

OEIS Open:语言模型能将多少个猜想转化为定理?

Tom Adamczewski

机构 * Epoch AI

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本研究构建OEIS Open基准,发现配备最少工具的语言模型在适中预算下可自主解决部分OEIS未解决数学猜想,访问大量数学文献或复杂智能体循环未提升其性能。

Comments 26 pages, 6 figures. Code: https://github.com/epoch-research/LeanOpenProblems, results: https://github.com/epoch-research/LeanOpenProblems-results

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06718 2026-08-14 cs.CL 版本更新 79%

Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation

音频语言模型是否使用副语言证据?用于响应评估的反事实审计

Kevin Miller, Arjun Chandra, Venkatesh Saligrama

机构 * Boston University(波士顿大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 该研究针对用作语音转语音系统评判者的音频语言模型,提出反事实审计方法,发现其评判可靠性常被对比成功高估,需结合行为审计而非仅准确率评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25497 2026-08-14 cs.CV cs.AI 版本更新 79%

A Distributional Robustness Margin For Pathology Foundation Models

超越计数:病理学基础模型的分布稳健性余量

Clément Grisi, Jeroen van der Laak, Geert Litjens

机构 * Radboud University Medical Center(拉德堡德大学医学中心)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 研究病理学基础模型受非生物学变异影响的问题,提出交叉混杂稳健性余量(CRoMa),通过直接比较距离评估模型稳健性,将其重塑为队列范围的余量分布,为模型选择和稳健性评估提供原则基础。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06200 2026-08-14 astro-ph.SR astro-ph.IM cs.AI 版本更新 79%

StarEmbed: Benchmarking Time Series Foundation Models on Astronomical Observations of Variable Stars

StarEmbed:在变星天文观测上对时间序列基础模型进行基准测试

Weijian Li, Hong-Yu Chen, Nabeel Rehemtulla, Ved G. Shah, Dongho Kim, Dennis Wu, Qinjie Lin, Adam A. Miller, Han Liu

机构 * Department of Computer Science, Northwestern University(计算机科学系,西北大学) Center for Foundation Models and Generative AI, Northwestern University(基础模型与生成AI中心,西北大学) NSF – Simons AI Institute for the Sky (SkAI)(国家科学基金会-斯隆人工智能天文研究所(SkAI)) Department of Physics and Astronomy, Northwestern University(物理与天文学系,西北大学) Center for Interdisciplinary Exploration and Research in Astrophysics (CIERA)(天文学跨学科探索与研究中心(CIERA)) Department of Statistics and Data Science, Northwestern University(统计与数据科学系,西北大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 StarEmbed首次在变星天文观测上对时间序列基础模型进行基准测试,展示了TSFMs在天文任务中的优越性能和泛化能力。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏