arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2707 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2707 篇

2607.13453 2026-07-16 cs.CR cs.AI 新提交 79%

Adversarial Prompting Framework for AI Safety Assessment

用于人工智能安全评估的对抗性提示框架

Yash Bhatnagar, Kunal Banerjee, Anirban Chatterjee

机构 * Microsoft(微软)

专题命中 评测与基准 :prompting(title,abstract);分类 cs.AI

AI总结 针对人工智能尤其是生成式人工智能应用增加带来的安全问题,提出对抗性提示框架,通过生成多复杂程度的对抗性提示评估模型弹性,在企业环境中实现自动化测试并获定量指标及差异结果。

Comments 3 pages, 1 figure, presented as a poster at International Conference on Data Science (CODS), December 17-20, 2025, Pune, India

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13071 2026-07-16 cs.SE cs.AI 新提交 79%

Compaction as Epistemic Failure: How Agentic LLM Tools Fabricate Confirmed Results from Killed Processes

作为认知失败的压缩:智能语言模型工具如何从终止进程中编造确认结果

Hiroki Tamba

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究智能语言模型编码工具中Claude Code的失败模式,即超时命令部分输出被误记为确认结果并传播误报,揭示其观察与持久性 conflation 的机制,指出对依赖会话连续性的工作流程有影响。

Comments 8 pages, companion to arXiv:2606.26185

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12986 2026-07-15 cs.AI cs.SE 新提交 79%

Win by Silence: Deletion Non-Monotonicity, Autonomous Exploitation, and Typed-State Gating in LLM Plan Evaluation

以沉默取胜:大语言模型计划评估中的删除非单调性、自主利用和类型状态门控

Aleh Manchuliantsau

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究大语言模型计划评估中删除非单调性等问题,通过命题1给出得分变化公式,经实验发现优化器能找到改进结构,GATE可约束搜索,PCSC能消除事后省略拼接,但GATE不验证策略质量。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12200 2026-07-15 cs.AI cs.CR cs.CY 新提交 79%

A Threshold Exceedance Framework for CBRN Uplift Evaluation in Frontier Language Models

前沿语言模型中用于CBRN提升评估的阈值超越框架

Rahul Gupta, Abhinav Mohanty, Payal Motwani, Venkatesh Saligrama, Satyapriya Krishna, Connor Harris, Gary Anthony Ackerman, Brandon Behlendorf, Tom Hobson, Theodore Wilson, Spyros Matsoukas

机构 * Amazon(亚马逊) Nemesys Insights(Nemesys洞察)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究前沿语言模型中CBRN提升评估问题,引入阈值超越标准(TEC)框架,将提升研究分解为独立组件,通过大规模实证研究确定两种提升形式,揭示领域异质性,为相关决策提供信息并总结方法经验。

Comments 19 pages, 1 figure, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11643 2026-07-14 cs.RO cs.AI 新提交 79%

Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model

小米机器人-U0:基于世界基础模型的统一具身合成

Xinghang Li, Jun Guo, Qiwei Li, Long Qian, Hang Lai, Yueze Wang, Hongyu Yan, Jiahang Cao, Xi Chen, Jingen Qu, Jiaxi Song, Nan Sun, Hanye Zhao, Futeng Liu, Wanli Peng, Heyun Wang, Yunhong Wang, Caoyu Xia, Jack Zhao, Diyun Xiang, Hangjun Ye, Heng Qu, Huaping Liu, Jason Li

机构 * Xiaomi Robotics(小米机器人)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 研究针对基础模型应用于具身场景受限问题,提出小米机器人-U0多模态自回归模型,将具身生成扩展为基础图像和视频生成的形式,联合优化多种生成任务,在多方面取得领先成果,证明基础世界模型可用于具身智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11564 2026-07-14 cs.CL cs.HC cs.IR 新提交 79%

PaperRouter-Agent: A Content-Grounded LLM Agent for Personalized Hierarchical Paper Routing

论文路由器-智能体:用于个性化分层论文路由的基于内容的语言模型智能体

Keshen Zhou, Lintao Wang, Suqin Yuan, Zhuqiang Lu, Yu Luo, Zhiyong Wang

机构 * University of Sydney(悉尼大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 研究个性化分层论文路由问题,提出无需训练基于文件夹成员决策的PaperRouter-Agent智能体,在真实个人图书馆和公共基准测试中,该智能体有效提升论文路由召回率和准确率,且成本低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11287 2026-07-14 cs.CV cs.AI 新提交 79%

A Unified Framework for Comprehensive Cardiac CT Segmentation and Phenotyping: Human-in-the-Loop Data Annotation, Vision Foundation Model Development, Multicenter Evaluation and Clinical Validation

用于心脏CT综合分割与表型分析的统一框架:人在回路数据标注、视觉基础模型开发、多中心评估及临床验证

Pooya Mohammadi Kazaj, Leo Fridolin Weber, Wen Xie, Seyed Amir Ahmad Safavi-Naini, Anselm Stark, Giovanni Baj, Ali Mokhtari, Toshiya Yoshida, Christoph Ryffel, Taishi Okuno, Yoshihiro Akashi, Ronny R. Buechel, Thomas Pilgrim, Waldo Valenzuela, George C. M. Siontis, Xiaowei Xu, Moritz Hundertmark, Stephan Windecker, Christoph Grani, Isaac Shiri

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 该研究提出统一框架用于心脏CT综合分割与表型分析,结合人在回路标注、增强技术与自监督预训练模型,组建大型数据集,在多数据集上表现优于开源工具,提高标注效率,推动心脏表型分析发展,还提供了可重复基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10846 2026-07-14 cs.CL 新提交 79%

Quantifying the Sources of Instability in LLM-Based Stance Analysis of Public Discourse

量化基于大语言模型的公共话语立场分析中的不稳定来源

Bo Chen

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 研究基于大语言模型的公共话语立场分析中不稳定来源,通过对256次YouTube采访比较两种说话人日记化管道和两种测量方法,发现问题并给出能区分管道与测量效应的诊断框架,强调研究结论需验证对两种变化来源的稳健性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10826 2026-07-14 cs.CV cs.AI cs.GR 新提交 79%

3D-DefectBench: A Controlled Factorial Study of Vision-Language Model Evaluation Pipelines for Fine-Grained 3D Generation Defects

3D-缺陷基准:用于细粒度3D生成缺陷的视觉语言模型评估管道的控制因子研究

Zhenyu Zhao, Nanshan Jia, Jihyeon Je, Yifu Tang, Alvin Chan, Michael Spedden, Michael V. Palleschi, Sui Huang, Jingshen Wang, Zeyu Zheng

机构 * Roblox Corporation(罗布乐思公司) Berkeley AI Research Lab & Department of Industrial Engineering and Operations Research, University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究实验室及工业工程与运筹学系) Computer Science Department, Stanford University(斯坦福大学计算机科学系) Division of Biostatistics, University of California, Berkeley(加州大学伯克利分校生物统计学系)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究基于视觉语言模型的3D缺陷检测管道评估,引入3D-DefectBench基准框架,通过平衡因子设计改变多个管道因素进行实验,发现模型选择影响最大,各因素相互作用,还得出一些协议表现及评判与人工标注对比情况等结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10626 2026-07-14 cs.CL 新提交 79%

Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG

评估对矩阵:基于事实的检索增强生成中大型语言模型评判器的答案配对元评估

Sriram Selvam, Anneswa Ghosh

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 研究针对基于事实的检索增强生成中大型语言模型评判器自我宽容难识别问题,引入Eval-Pair Matrix协议,通过特定流程生成答案并评估,经实验得出同模型效应等结果,强调RAG评判器研究应报告多方面内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10511 2026-07-14 cs.CL 新提交 79%

Articulate Intuition or Genuine Analysis? Benchmarking Epistemic Reliability in LLM-as-a-Judge Peer Reviews

清晰的直觉还是真正的分析?评估大语言模型作为评审员的同行评审中的认知可靠性基准

Nuo Chen, Qian Wang, Qingyun Zou, Bingsheng He

机构 * National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 研究大语言模型评审员与人类评审员对同行评审评估的差异,将卡尼曼双过程理论转化为评分标准并发布Kahneman4Review基准,通过多方面发现揭示问题,强调可靠基准应区分分析形式与认知功能并给出设计选择。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10487 2026-07-14 cs.CR cs.AI 新提交 79%

Temporary Authority, Permanent Effects: Commit-Time Authorization for LLM Agents

临时权限,永久影响:大型语言模型代理的提交时间授权

Igor Santos-Grueiro

机构 * International University of La Rioja(拉里奥ja国际大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究大型语言模型代理提交时间授权问题,构建受控失效套件实验,发现端点成功率高但授权完成率低,评估缓解措施,提出CommitGuard可阻止过时持久影响尝试,指出端点成功是实用指标,授权提交是安全属性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07251 2026-07-09 cs.CL 新提交 79%

Evaluation of Multilingual Ability to Use Spatial Deictic Expressions in Vision-Language Models

视觉语言模型中使用空间指示表达式的多语言能力评估

Kaito Watanabe, Taisei Yamamoto, Tomoki Doi, Hitomi Yanaka

机构 * The University of Tokyo(东京大学) Riken(理化学研究所) Tohoku University(东北大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 研究聚焦视觉语言模型的空间推理能力,通过开发基准评估其使用四种语言空间指示表达式的多语言能力,实验发现测试模型使用指示词方式与人类不同,特别是在依距离选指示词方面。

Comments Accepted to ACL SRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06485 2026-07-08 cs.CV cs.AI 新提交 79%

AirflowAttack: Thermal-Airflow Adversarial Perturbations against Infrared Remote-Sensing Vision-Language Models

AirflowAttack:针对红外遥感视觉语言模型的热气流对抗扰动

Cong Su, Jiaju Han, Xuemeng Sun, Chengyin Hu, Qike Zhang, Jiujiang Guo, Yiwei Wei, Jiahuan Long

机构 * China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) Tianjin University(天津大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究针对红外遥感视觉语言模型的对抗攻击,提出AirflowAttack方法,用热气流湍流作扰动先验,由轻量级生成器合成扰动。该方法在多个CLIP主干上攻击成功率高,能降低模型场景分类准确率,还揭示了红外VLM生态系统的关键漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05970 2026-07-08 cs.IR cs.AI 新提交 79%

Faithful or Findable? Evaluating LLM-Generated Metadata for RDF Dataset Search

忠实还是可查找?评估用于RDF数据集搜索的大语言模型生成的元数据

Riccardo Terrenzi, Serkan Ayvaz

机构 * University of Southern Denmark(南部丹麦大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究RDF数据集六种元数据生成设置,评估其检索有效性与忠实性。发现无约束重写检索增益强但忠实性低,更有根据的设置提高了忠实性,基于配置文件的重写权衡最佳,将合成元数据定位为需综合评估多方面的系统级信息检索问题。

Comments 5 pages, 1 figure, accepted at SynthIR @ SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05171 2026-07-07 cs.CL 新提交 79%

RABBiT: Rapidly adaptive BOLD foundation model via brain-tuning for accurate zero-shot and few-shot prediction of speech-elicited responses in the brain

RABBiT:基于脑调优的快速自适应BOLD基础模型,用于脑内语音诱发响应的精准零样本与少样本预测

Omer Moussa, Mariya Toneva

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL

AI总结 针对脑语言理解泛化难问题,提出RABBiT紧凑音频-fMRI编码器,依托脑调优等创新实现跨被试跨场景语音诱发脑响应的高精度零/少样本预测,支撑规模化脑语言分析。

Comments Under review at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04576 2026-07-07 cs.CL cs.CY cs.IR 新提交 79%

Progressive Disclosure for LLM-Maintained Wiki Knowledge Bases: a Preregistered Ablation

大语言模型维护的维基知识库的渐进式披露:一项预注册的对比研究

Theodore O. Cochran

机构 * AI for Altruism (A4A)(人工智能促进利他主义组织)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 研究针对大语言模型维护的维基知识库,通过预注册对比研究,改造知识库实现渐进式披露。虽原节省索引加载成本未实现,但答案质量达标且成本降低,源于更有针对性的访问。

Comments 14 pages, 2 figures, 6 tables. Preregistered on OSF (https://osf.io/feka7, DOI 10.17605/OSF.IO/FEKA7). Materials-availability and deviations described in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04528 2026-07-07 cs.AI 新提交 79%

Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents

测量多步语言模型智能体中工具诱导的信念差异

Haiwen Yi, Xinyuan Song

机构 * University of Toronto(多伦多大学) Emory University(埃默里大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究多步语言模型智能体中工具对其信念的影响,引入信念展开诊断,定义跨工具信念差异并分解,通过实验表明工具设计是智能体评估中的实验变量。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02623 2026-07-07 cs.LG cs.SY eess.SY 新提交 79%

Evaluating Time Series Foundation Models for Electricity Price Forecasting: Contamination Risk, Distributional Shifts, and Covariate Dependence

评估用于电价预测的时间序列基础模型:污染风险、分布变化和协变量依赖性

Zhenghua Pan, Ahmed Aziz Ezzat

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 针对电价预测中时间序列基础模型在协变量驱动、非平稳设置下泛化不足的问题,提出双数据集基准框架,评估其多方面表现,发现该模型有竞争力但性能依赖协变量支持,简单集成有潜力。

Journal ref ICML 2026 Foundation Models for Structured Data Workshop, 43rd International Conference on Machine Learning (ICML), Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02599 2026-07-07 cs.SE cs.AI cs.LO 新提交 79%

AgentLTL: A Trace-Verification Framework for Measuring, Enforcing, and Training Procedural Compliance in Tool-Using LLM Agents

AgentLTL:一种用于测量、执行和训练使用工具的语言模型代理程序合规性的跟踪验证框架

Laïla Elkoussy, Julien Perez

机构 * EPITA Bpifrance

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 介绍基于一阶线性时态逻辑的AgentLTL语言,用于表达代理跟踪的程序规则,产生确定性无评判的合规分数,此框架可用于约束和微调,提升模型合规性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02575 2026-07-07 cs.CV cs.AI 新提交 79%

Criterion-Conditional In-Context Learning: Evaluating Criterion-Shift Adaptation in Vision-Language Models

标准条件上下文学习:评估视觉语言模型中的标准转移适应性

Kaiyun Yang, Ruilin Yang, Zhimin Yao, J. Wang, Wei Ge

机构 * Megvii Technology Inc., Beijing, China(美科科技有限公司,北京,中国)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究提出标准条件上下文学习(CC-ICL)新设置,模型需从上下文推断潜在标准并据此调整预测。为此提出两个评估指标,构建CC-Bench基准。实验发现多数模型有边界偏差,简单多标准训练可改善。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06857 2026-07-07 cs.CL 新提交 79%

Interpreting Brain Responses to Language with Sparse Features from Language Models

用语言模型稀疏特征解释大脑对语言的响应

Michael A. Lepori, Kendrick Kay, Greta Tuckute

机构 * Brown University(布朗大学) University of Minnesota(明尼苏达大学) Harvard University(哈佛大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 提出增强稀疏编码模型,用分层稀疏自编码器特征替代密集LM隐状态,并加入惊奇度预测器,解释大脑语言皮层响应,发现前颞叶语言网络由共同特征预测,且大脑响应与LM中最通用的特征对应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02459 2026-07-03 cs.CL 新提交 79%

Language Models as Measurement Apparatus for Culture

语言模型作为文化测量仪器

Kent K. Chang

机构 * School of Information University of California, Berkeley(信息学院加州大学伯克利分校)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文提出语言模型的文化测量是物质-话语实践,通过Karen Barad的能动切割概念,论证模型设计选择构成所测量的文化现实,并通过三个案例和三个仪器检查展示这一观点。

Comments Accepted to the Big Picture workshop co-located with ACL 2026. This version expands the camera-ready (adding Fig. 3 and section 6.3, as well as correcting minor typos) in Proceedings of The Big Picture v2: Crafting a Research Narrative, pp. 131--143, San Diego, CA, USA. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02269 2026-07-03 cs.CV cs.AI 新提交 79%

AnyGroundBench: A Specialized-Domain Benchmark for Video Grounding in Vision-Language Models

AnyGroundBench: 视觉语言模型中视频定位的专业领域基准

Rintaro Otsubo, Ryo Fujii, Reina Ishikawa, Taiki Kanaya, Kanta Sawafuji, Hiroki Kajita, Shigeki Sakai, Hideo Saito, Ryo Hachiuma

机构 * Keio University(庆应大学) Keio AI Research Center(庆应人工智能研究中心) Keio University School of Medicine(庆应大学医学部) NVIDIA(英伟达)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 提出AnyGroundBench基准,将STVG评估从零样本转向领域适应,涵盖五个专业领域,评估15个VLM的零样本和上下文学习能力,发现现有模型在专业领域表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01966 2026-07-03 cs.LG 新提交 79%

Probabilistic Low-Voltage Peak Load Forecasting with Time Series Foundation Models Evaluated on Application-Oriented Metrics

基于时间序列基础模型的概率低压峰值负荷预测及其面向应用的评估指标

Benedikt Kaas, Manuel Treutlein, Hannes Benedikt Gerber, Oliver Neumann, Cheewan Phatthanakhuha, Oliver Resch, Ralf Mikut, Veit Hagenmeyer

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) Netze BW GmbH(Netze BW有限公司)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本研究评估时间序列基础模型在200个实际低压馈线短期净负荷预测中的性能,提出面向应用的指标连接峰值预测与电网资产规划中的成本-风险权衡。

Comments A poster abstract of this publication will be available at the 15th DACH+ Conference on Energy Informatics (2026 in Linz, Austria)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01740 2026-07-03 cs.AI 新提交 79%

Meta-Benchmarks for Financial-Services LLM Evaluation

金融服务大语言模型评估的元基准

Blair Hudson

机构 * Commonwealth Bank of Australia(澳大利亚联邦银行)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 针对公共排行榜忽略金融服务特定认知需求的问题,提出元基准框架,将452个基准映射到41个O*NET工作活动和38个BIAN银行业务领域,采用乘法加权方案和Elo锦标赛生成可比较的工作活动与业务领域得分。

Comments 27 pages, 13 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01086 2026-07-02 cs.CV cs.AI 新提交 79%

LongVQUBench: Benchmarking Long-Term Video Quality Understanding of Vision-Language Models

LongVQUBench:评估视觉语言模型的长期视频质量理解能力

Arpita Nema, Hanwei Zhu, Xi Zhang, Weisi Lin

机构 * Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 提出LongVQUBench基准,包含1200+长视频和1500个问题,通过三级评估(局部、跨事件、全局)和针孔失真问答范式,揭示现有LVLMs在长视频质量理解上的局限性。

Comments Accepted at European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01001 2026-07-02 cs.CV cs.LG 新提交 79%

Foundation Models vs. Radiomics for Lung Computed Tomography: A Benchmark of Feature Extractors, Classification Heads, and Segmentation Choices

基础模型与放射组学在肺部计算机断层扫描中的比较:特征提取器、分类头和分割选择的基准测试

Nils Neukirch, Martin Maurer, Nils Strodthoff

机构 * Division AI4Health, Carl von Ossietzky Universität Oldenburg(奥尔登堡卡尔·冯·奥西茨基大学AI4Health部门) University Institute for Diagnostic and Interventional Radiology, Klinikum Oldenburg AöR(奥尔登堡医院大学诊断与介入放射学研究所)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本研究通过基准测试五种特征提取器、七种分类头和三种分割策略,评估基础模型与放射组学在CT肺癌表型分析中的性能,发现最优设计取决于任务,推荐Curia结合肿瘤分割和CatBoost分类头作为安全默认方案。

Comments 17 pages, 8 figures, 2 tables, Code is available at https://github.com/AI4HealthUOL/lung-ct-benchmarking

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18367 2026-07-02 cs.LG 新提交 79%

Do Time Series Foundation Model Benchmarks Hide Regime-Dependent Failures? Evidence from Traffic Speed Forecasting

时间序列基础模型基准是否隐藏了依赖于状态的失败?来自交通速度预测的证据

Yingshuo Wang, Xian Sun, Lingdong Kong, Wei Gao, Yanhang Li, Zhichao Fan, Zexin Zhuang

机构 * University of California, Berkeley(加州大学伯克利分校) Duke University(杜克大学) National University of Singapore(新加坡国立大学) Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Southern Methodist University(南卫理公会大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出状态分层评估方法,发现时间序列基础模型在交通状态转换时准确率和预测区间覆盖率显著下降,并提出了双峰混合增强方法以改善转换状态覆盖。

Comments 5 pages, 2 figures. Accepted at the Workshop on Forecasting as a New Frontier of Intelligence, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27672 2026-06-29 cs.LG 新提交 79%

Are Time-Series Foundation Models Ready for E-Nose Data? An Empirical Assessment of Their Embeddings

时间序列基础模型是否准备好处理电子鼻数据?对其嵌入的经验评估

Taeyeong Choi, Mohammed Kamruzzaman

机构 * Department of Information Technology(信息科技系) Department of Agricultural and Biological Engineering(农业与生物工程系) Kennesaw State University(凯斯沃州立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文系统评估了Chronos-2和MOMENT等时间序列基础模型在电子鼻数据上的嵌入表示,发现微调是必要步骤,且融合专用模型表示可提升气体识别和浓度预测性能。

Comments Submitted to IEEE SENSORS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏