arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-02 至 2026-07-02 共收录 294 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 72 篇

2607.00910 2026-07-02 cs.MA 新提交 89%

Calibrating the Instrument: Controllability of an LLM-Driven Synthetic Population

校准仪器:LLM驱动的合成人群的可控性

Mirko Degli Esposti

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出SIVE实验,通过七项预注册标准评估LLM驱动合成人群对已知效价刺激的响应可控性,发现弱阳性消息被识别为阴性,经重新设计后恢复预期排序,并揭示噪声特性与微观动力学。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00555 2026-07-02 cs.SE 新提交 89%

Rise From The Ashes: LLM-based Static Analysis for Deep Learning Framework Bugs

从灰烬中崛起:基于LLM的深度学习框架缺陷静态分析

Shaoyu Yang, Haifeng Lin, Chunrong Fang, Xiang Chen, Wei Cheng, Jiawei Liu, Yiyu Zhang, Hongyu Liu, Zhenyu Chen

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出首个基于LLM的静态分析技术Phoenix,通过结构化语义桥接中间表示建模跨语言张量流,结合多智能体工作流检测深度学习框架缺陷,已在PyTorch中发现31个新bug。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29088 2026-07-02 cs.SE cs.AI 版本更新 89%

Diff-Based Code Corruption using LLMs for Large-Scale Bugfix Benchmarking

基于LLM的差异代码损坏用于大规模错误修复基准测试

Balázs Szalontai, Ábel Szauter, Balázs Márton, Péter Verebics, Balázs Pintér, Tibor Gregorics

机构 * Eötvös Loránd University(罗兰大学) Faculty of Informatics(信息学学院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出MegaBugFix,一个包含12,629个由LLM通过差异生成的有缺陷Python程序的大规模基准,用于评估模型错误修复能力,发现现有模型在此基准上表现更差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29228 2026-07-02 cs.CL cs.LG 版本更新 88%

Understanding Evaluation Illusion in Diffusion Large Language Models

理解扩散大语言模型中的评估幻觉

Hengxiang Zhang, Jiaxi Ren, Renchunzi Xie, Hongxin Wei

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 发现扩散大语言模型的解码方法排名对提示模板高度敏感,单模板评估会产生性能无损失的幻觉,实际并行解码方法无法突破速度-质量权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00939 2026-07-02 cs.SE quant-ph 新提交 88%

Leveraging LLM-Based Agentic Systems to Generate Quantum Applications for Test Optimization

利用基于LLM的代理系统生成量子应用以优化测试

Ming Tao, Yuechen Li, Tao Yue, Man Zhang, Aitor Arrieta Marcos

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出QPipe,一种基于大语言模型的多代理架构,自动将自然语言需求转化为可执行的量子应用工作流,在测试优化问题上实现高编译率和执行率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12415 2026-07-02 cs.SE 版本更新 88%

SWE-Perf: Can Language Models Optimize Code Performance on Real-World Repositories?

SWE-Perf:语言模型能否优化真实仓库中的代码性能?

Xinyi He, Qian Liu, Mingzhe Du, Lin Yan, Zhijie Fan, Yiming Huang, Yin Zheng, Zejian Yuan, Zejun Ma

专题命中 评测与基准 :language model(title,abstract);LLM(summary_cn,abstract_cn);large language model(abstract)

AI总结 提出SWE-Perf基准,用于系统评估LLM在真实仓库中的代码性能优化能力,通过140个实例评估发现现有模型与专家水平存在显著差距。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00292 2026-07-02 cs.NI cs.AI cs.CL 新提交 88%

An LLM-Based Framework for Intent-Driven Network Topology Design

基于LLM的意图驱动网络拓扑设计框架

Kholoud El-Habbouli, Fen Zhou, Stephane Huet

机构 * CERI-LIA, University of Avignon(阿维尼翁大学CERI-LIA实验室)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一个结合分层建模和系统验证的约束驱动流水线,利用大语言模型从自然语言需求生成结构有效且符合约束的网络拓扑,并通过多模型对比评估其正确性和弹性。

Comments submitted to IEEE CNSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25420 2026-07-02 cs.SE cs.HC 88%

Recommending Usability Improvements with Multimodal Large Language Models

利用多模态大语言模型推荐可用性改进

Sebastian Lubos, Alexander Felfernig, Damian Garber, Viet-Man Le, Manuel Henrich

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出一种利用多模态大语言模型自动识别和推荐用户界面可用性改进的方法,通过分析有限的应用上下文和用户交互屏幕记录,基于尼尔森可用性启发式方法生成优先级排序的改进建议,验证了其在软件工程中的实用性。

Comments Accepted for publication at the ACM International Conference on the Foundations of Software Engineering (FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00601 2026-07-02 cs.CL 新提交 87%

"Don't Say It!": Constraints, Compliance, and Communication when Language Models Play Taboo

“别说出来!”:语言模型玩禁忌游戏时的约束、合规与沟通

Sara Candussio, Francesca Padovani, Daniel Scalena, Malvina Nissim

机构 * Center for Language and Cognition (CLCG), University of Groningen(格罗宁根大学) University of Milano - Bicocca(米兰比可卡大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL

AI总结 研究语言模型在禁忌游戏中如何在严格词汇约束下生成有效描述,通过提示、生成时约束和内部表示操纵干预,评估合规性与沟通效果,发现模型在约束下表现弱于人类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08625 2026-07-02 cs.CL 新提交 87%

From Holistic Evaluation to Structured Criteria: Rubrics Across the Evolving LLM Landscape

从整体评估到结构化标准:大语言模型演变中的评分准则

Hao Chen, Ziyu Han, Yukun Yan, Qingfu Zhu, Maosong Sun, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心) Department of Computer Science and Technology, Institute for AI(计算机科学与技术系,人工智能研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出评分准则作为统一框架,通过分解整体判断为可验证维度、提供过程级反馈和动态涌现自模型行为三个层次,连接人类意图与机器行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00627 2026-07-02 cs.AI 新提交 86%

AGI Maze as a Benchmark Framework for World-Modeling Agents

AGI Maze:作为世界建模智能体的基准框架

Alexey Potapov

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AGI Maze框架,通过部分可观测网格迷宫任务评估LLM构建世界状态表示的能力,发现标准LLM在推理时无法内部表示迷宫,即使借助工作记忆也难以可靠求解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00596 2026-07-02 cs.CV 新提交 86%

Semantic-Guided Reading Order Reconstruction in Historical Armenian Newspapers with LLMs

基于语义引导的LLM历史亚美尼亚报纸阅读顺序重建

Chahan Vidal-Gorène, Nadi Tomeh, Victoria Khurshudyan

机构 * École nationale des chartes-PSL(法国国立文献学院-巴黎文理研究大学) Inalco(法国国立东方语言文化学院) Calfa

专题命中 评测与基准 :LLM(title_cn,summary_cn)

AI总结 针对历史亚美尼亚报纸复杂版面和低资源问题,提出混合方法结合语义区域检测与生成式LLM,排序错误率较几何基线降低76%。

Comments International Conference on Pattern Recognition, 2026, Lyon, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00309 2026-07-02 cs.SD cs.CL cs.HC eess.AS 新提交 85%

A Text-Steerable Instrument for Sketching Procedural Soundscapes via Language Models

一种通过语言模型驱动文本可操控的草图式程序化声景乐器

Prabal Gupta

机构 * Rama Labs(Rama实验室)

专题命中 评测与基准 :language model(title);LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL

AI总结 提出一种实时音乐界面,将自然语言场景描述转化为可演化的程序化声景,通过直接参数调整实现细粒度控制,并采用三种可互换后端生成连贯音频流。

Comments 10 pages, 7 figures, 2 tables. Accepted to the International Conference on New Interfaces for Musical Expression (NIME 2026), London, UK. Supplementary material included as an appendix. Code and demo: https://github.com/prabal-rje/latentscore

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00918 2026-07-02 cs.CL cs.AI cs.MA 新提交 85%

From Personas to Plot: Character-Grounded Multi-Agent Story Generation for Long-Form Narratives

从角色到情节:基于角色的多智能体长篇小说生成

Aayush Aluru, Chloe Ho, Muhammad Hammouri, Kerry Luo, Myra Malik, Ryan Lagasse, Arjun Bahuguna, Vasu Sharma

机构 * Pocket FM Princeton University(普林斯顿大学) University of Michigan(密歇根大学) University of Maryland(马里兰大学) Universitat Pompeu Fabra(庞培法布拉大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出MAGNET多智能体叙事引擎和ATLAS幻觉检测管线,通过角色代理和世界状态追踪,在100页故事中减少41%注释和50%幻觉,实现连贯长篇小说生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31522 2026-07-02 cs.CL cs.AI 新提交 85%

FinPersona-Bench: A Benchmark for Longitudinal Psychometric Stability of Autonomous Financial Agents

FinPersona-Bench: 自主金融代理纵向心理测量稳定性的基准

Muhammad Usman Safder, Ayesha Gull, Rania Elbadry, Fan Zhang, Yankai Chen, Xueqing Peng, Xue, Liu, Preslav Nakov, Zhuohan Xie

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) The University of Tokyo(东京大学) McGill University(麦吉尔大学) The Fin AI(Fin AI公司) Kyoto University(京都大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出FinPersona-Bench基准,通过合成市场分离价格与价值,评估LLM金融代理在长期部署中指令显著性衰减现象,发现指令重固化的效果因代理类型和市场环境而异。

Comments 29 pages, includes figures and tables; formalizes Mandate Salience Decay and introduces FinPersona-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00304 2026-07-02 cs.LG cs.AI cs.CL 新提交 83%

Mapping the Evaluation Frontier: An Empirical Survey of the Bias-Reliability Tradeoff Across Eleven Evaluator-Agent Conditions

映射评估前沿:跨11种评估器-智能体条件的偏差-可靠性权衡的实证调查

Zewen Liu

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过扩展至11种评估条件,实证验证了LLM评估系统中评估器耦合、策略多样性与小样本测量可靠性之间的权衡,并发布了标准化基准数据集。

Comments 5 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00009 2026-07-02 cs.CL cs.AI 新提交 82%

Controllable Narrative Rendering for Enhanced Assisted Writing

可控叙事渲染以增强辅助写作

Mingzhe Lu, Yanbing Liu, Jiayue Wu, Jiarui Zhang, Qihao Wang, Yue Hu, Yunpeng Li, Yangyan Xu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) HiThink Research(海天瑞声)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型在创意写作中安全编辑与无控制情节扩展的二元失败问题,提出基于叙事学故事/话语区分的Loom框架,通过三层流水线和意图中心符号链实现叙事意图与渲染密度的精确控制,在保持事实完整性的同时提升描述强度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31597 2026-07-02 cs.CV 版本更新 82%

SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models

SOCO: 视觉基础模型中语义对象对应关系的基准测试

Olaf Dünkel, Basavaraj Sunagad, Haoran Wang, David T. Hoffmann, Christian Theobalt, Adam Kortylewski

机构 * Max Planck Institute for Informatics(马克斯·普朗克研究所信息学研究所) Saarland Informatics Campus(萨尔州信息学校园) CISPA Helmholtz Center for Information Security(信息安全霍夫曼中心) University of Freiburg(弗赖堡大学)

专题命中 评测与基准 :foundation model(title,abstract);language model(abstract)

AI总结 提出SOCO基准,通过引入对应类型分类法和100个类别上超过100万对功能上有意义的关键点注释,系统评估视觉基础模型中的语义对应能力,并揭示模型在跨类别迁移、语言引导定位与视觉对应之间的差距。

Comments Project page: https://genintel.github.io/SOCO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01136 2026-07-02 cs.SE cs.AI 新提交 81%

Skills Are Not Islands: Measuring Dependency and Risk in Agent Skill Supply Chains

技能并非孤岛:衡量智能体技能供应链中的依赖性与风险

Changguo Jia, Tianqi Zhao, Runzhi He, Minghui Zhou

机构 * Peking University(北京大学) Zhongguancun Laboratory(中关村实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出智能体技能供应链(ASSC)概念,设计SkillDepAnalyzer工具从自然语言中提取依赖关系,在超143万技能上揭示四种结构模式和安全风险,建议类型化依赖清单和风险预警审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00990 2026-07-02 cs.SE cs.AI 新提交 81%

SWE-Doctor: Guiding Software Engineering Agents with Runtime Diagnosis from Multi-Faceted Bug Reproduction Tests

SWE-Doctor: 通过多面缺陷复现测试的运行时诊断引导软件工程智能体

Yaoqi Guo, Yang Liu, Jie M. Zhang, Yun Ma, Yiling Lou, Zhenpeng Chen

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SWE-Doctor,通过生成多面缺陷复现测试并执行调试,构建运行时诊断记录,结合定位信息指导补丁生成,在SWE-bench Verified和Pro上平均解决率分别达75.7%和59.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00053 2026-07-02 cs.SE cs.AI 新提交 81%

SWE-Router: Routing in Multi-turn Agentic Software Engineering Tasks

SWE-Router:多轮智能体软件工程任务中的路由

Seongho Son, Sangwoong Yoon, Jiahua Tang, Shuhan Wang, Lorenz Wolf, Ilija Bogunovic

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SWE-Router,一种基于价值的时间路由方法,通过让廉价模型探索几轮后根据部分轨迹决定是否升级到昂贵模型,在保持强模型大部分性能的同时大幅提升成本效率。

Comments The 5th Deep Learning for Code Workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00041 2026-07-02 cs.SE cs.AI 新提交 81%

ATM: CID-Brokered Pre-Write Admission for Multi-Agent Code Co-Synthesis

ATM:基于CID的预写准入机制用于多智能体代码协同合成

Eagl Huang

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出ATM框架,通过CID代理和适配器引导的原子化,解决多智能体LLM系统中并发写意图的准入、组合与序列化问题,支持可审计性和有限恢复能力。

Comments 40 pages, 8 figures. Source code and supplementary artifact links are described in the manuscript appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00968 2026-07-02 cs.CL cs.HC 新提交 81%

Quantifying the Affective Gap: A Zero-Shot Evaluation of LLMs on Fine-Grained Emotion Taxonomies

量化情感差距:大型语言模型在细粒度情感分类上的零样本评估

Lawrence Obiuwevwi, Krzysztof J. Rechowicz, Jessica M. Johnson, Vikas Ashok, Sachin Shetty, Sampath Jayarathna

机构 * Old Dominion University(欧道明大学)

专题命中 评测与基准 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究对Claude、ChatGPT和Gemini三种商业LLM进行零样本细粒度13类情感分类评估,发现最高准确率仅39.9%,模型在爱情、困惑等情感上表现差,且无显著差异,揭示当前前沿AI在零样本情感分类中的局限性。

Comments in Proc. 27th IEEE Int. Conf. (IRI'2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00664 2026-07-02 cs.CL 新提交 81%

YOMI-Bench: A Benchmark for Evaluating Kanji Reading and Phonological Understanding of LLMs for Japanese

YOMI-Bench:评估日语大语言模型汉字读音与音韵理解的基准

Ryota Mibayashi, Hiroya Takamura, Hitomi Yanaka

机构 * Kobe University(神户大学) National Institute of Advanced Industrial Science and Technology (AIST)(国立研究开发法人产业技术综合研究所(AIST)) The University of Tokyo(东京大学) RIKEN(理化学研究所) Tohoku University(东北大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出YOMI-Bench基准,通过四个任务评估大语言模型在日语汉字读音上的表现,发现专用模型和商业模型均表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00139 2026-07-02 cs.CL 新提交 81%

Benchmarking Frontier LLMs on Arabic Cultural and Sociolinguistic Knowledge: A Cross-Evaluation Framework with Human SME Ground Truth

前沿大语言模型在阿拉伯文化与社会语言学知识上的基准测试:基于人类专家真实标注的交叉评估框架

Sajjad Abdoli, Ghassan Al-Sumaidaee, Ahmad ElShiekh, Clayton W. Taylor, Ahmed Rashad

机构 * Perle AI

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);language model(abstract);分类 cs.CL

AI总结 提出一个交叉评估框架,通过人类专家标注的103个提示-评分标准对,评估前沿LLM在埃及和伊拉克阿拉伯语文化与社会语言学知识上的表现,发现GPT-5.4是最可靠的自动评判者,文化任务比语言任务更难评分,且模型在埃及提示上表现优于伊拉克提示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28517 2026-07-02 cs.HC 版本更新 80%

Drag, Infer, Reproject: Grounding LLMs through Spatial Interaction for Image Clustering

拖拽、推断、重投影:通过空间交互为图像聚类的LLM基础

Yang Liu, Xuxin Tang, Jiahao Xu, Chris North

专题命中 评测与基准 :LLM(title_cn);large language model(abstract);language model(abstract)

AI总结 提出CriterionSI方法,利用大语言模型从用户拖拽交互中推断聚类标准,并引导重投影,实现渐进式标准对齐的图像聚类布局。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01086 2026-07-02 cs.CV cs.AI 新提交 79%

LongVQUBench: Benchmarking Long-Term Video Quality Understanding of Vision-Language Models

LongVQUBench:评估视觉语言模型的长期视频质量理解能力

Arpita Nema, Hanwei Zhu, Xi Zhang, Weisi Lin

机构 * Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 提出LongVQUBench基准,包含1200+长视频和1500个问题,通过三级评估(局部、跨事件、全局)和针孔失真问答范式,揭示现有LVLMs在长视频质量理解上的局限性。

Comments Accepted at European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01001 2026-07-02 cs.CV cs.LG 新提交 79%

Foundation Models vs. Radiomics for Lung Computed Tomography: A Benchmark of Feature Extractors, Classification Heads, and Segmentation Choices

基础模型与放射组学在肺部计算机断层扫描中的比较:特征提取器、分类头和分割选择的基准测试

Nils Neukirch, Martin Maurer, Nils Strodthoff

机构 * Division AI4Health, Carl von Ossietzky Universität Oldenburg(奥尔登堡卡尔·冯·奥西茨基大学AI4Health部门) University Institute for Diagnostic and Interventional Radiology, Klinikum Oldenburg AöR(奥尔登堡医院大学诊断与介入放射学研究所)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本研究通过基准测试五种特征提取器、七种分类头和三种分割策略,评估基础模型与放射组学在CT肺癌表型分析中的性能,发现最优设计取决于任务,推荐Curia结合肿瘤分割和CatBoost分类头作为安全默认方案。

Comments 17 pages, 8 figures, 2 tables, Code is available at https://github.com/AI4HealthUOL/lung-ct-benchmarking

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18367 2026-07-02 cs.LG 新提交 79%

Do Time Series Foundation Model Benchmarks Hide Regime-Dependent Failures? Evidence from Traffic Speed Forecasting

时间序列基础模型基准是否隐藏了依赖于状态的失败?来自交通速度预测的证据

Yingshuo Wang, Xian Sun, Lingdong Kong, Wei Gao, Yanhang Li, Zhichao Fan, Zexin Zhuang

机构 * University of California, Berkeley(加州大学伯克利分校) Duke University(杜克大学) National University of Singapore(新加坡国立大学) Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Southern Methodist University(南卫理公会大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出状态分层评估方法,发现时间序列基础模型在交通状态转换时准确率和预测区间覆盖率显著下降,并提出了双峰混合增强方法以改善转换状态覆盖。

Comments 5 pages, 2 figures. Accepted at the Workshop on Forecasting as a New Frontier of Intelligence, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28418 2026-07-02 cs.LG 版本更新 79%

Explaining Tabular Foundation Model Differences Through Meta-Features

重新审视元特征以解释表格数据上的模型差异

Markus Herre, Andrej Tschalzev, Sascha Marton, Christian Bartelt

机构 * Clausthal University of Technology, Clausthal-Zellerfeld, Germany(Clausthal技术大学,Clausthal-Zellerfeld,德国) University of Mannheim, Mannheim, Germany(曼海姆大学,曼海姆,德国)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 研究通过严格统计检验和留一法分析,发现数据集元特征无法稳健解释表格数据上不同模型族(如神经网络与树模型、非基础模型与基础模型)之间的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏