ReasonCast: Towards Explainable Time Series Forecasting with Reasoning
ReasonCast:面向可解释时间序列预测的推理方法
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出任务融合模型ReasonCast,通过微调LLM实现时间序列预测与可解释文本推理的联合生成,在预测准确性上优于LLM和TS模型,还构建了联合评估基准ReasonTS-Bench。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
ReasonCast:面向可解释时间序列预测的推理方法
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出任务融合模型ReasonCast,通过微调LLM实现时间序列预测与可解释文本推理的联合生成,在预测准确性上优于LLM和TS模型,还构建了联合评估基准ReasonTS-Bench。
基于精确贝叶斯最优标准测量语言模型的上下文内算法推理能力
机构 * Oxford Immune Algorithmics(牛津免疫算法学公司) ; Oxford University Innovation(牛津大学创新公司) ; London Institute for Healthcare Engineering(伦敦医疗工程研究所) ; King’s College London(伦敦国王学院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本研究提出F-ICL基准,以精确贝叶斯最优标准测量语言模型的上下文内算法推理能力,发现多数模型分布与最优标准存在差距,该差距与准确率无关且不受模型规模缩小,基准已开放。
大型视觉语言模型(LVLMs)能否揭示视觉错觉背后的真相?感知与推理能力分析
机构 * Adelaide University(阿德莱德大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Tsinghua University(清华大学) ; Amap, Alibaba Group(阿里巴巴集团高德地图) ; Beihang University(北京航空航天大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文利用IllusionReasoning基准,以视觉错觉为诊断工具评估LVLMs,发现多款LVLMs的推理能力不及宣称水平,为其优化提供了新方向。
一种用于不规则临床时间序列问答的经济高效多模态大语言模型推理框架
机构 * Shandong University(山东大学) ; University of Auckland(奥克兰大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 针对不规则临床时间序列问答,提出ClinPRISM框架。该框架含不规则感知多尺度编码器、时间证据蒸馏器和渐进对齐策略,通过构建训练数据,在40亿参数大语言模型主干上实现最优性能,兼具低时间序列令牌数和低推理延迟。
评估具有挑战性的真实世界临床病例中的多轮多模态诊断推理
机构 * Center for Biomedical Data Science, Duke-NUS Medical School(生物医学数据科学中心,杜克 - 新加坡国立大学医学院) ; Duke-NUS AI + Medical Sciences Initiative, Duke-NUS Medical School(杜克 - 新加坡国立大学人工智能与医学科学计划,杜克 - 新加坡国立大学医学院) ; Department of Population Health Sciences, Weill Cornell Medicine(人口健康科学系,威尔康奈尔医学院) ; System Engineering, College of Engineering, Cornell University(系统工程,康奈尔大学工程学院) ; Graduate School of Frontier Sciences, The University of Tokyo(前沿科学研究生院,东京大学) ; RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心) ; Department of Biostatistics and Bioinformatics, Duke University(生物统计学与生物信息学系,杜克大学) ; Perelman School of Medicine, University of Pennsylvania(佩雷尔曼医学院,宾夕法尼亚大学) ; School of Clinical Medicine, University of Cambridge(临床医学学院,剑桥大学) ; Hospital of the University of Pennsylvania(宾夕法尼亚大学医院) ; Children’s Hospital of Philadelphia (CHOP)(费城儿童医院) ; Department of Anatomic Pathology and Laboratory Medicine, Hospital of the University of Pennsylvania(解剖病理学与检验医学系,宾夕法尼亚大学医院) ; Department of Pathology and Laboratory Medicine, University of California, San Francisco(病理学与检验医学系,加州大学旧金山分校) ; Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 研究针对现有多模态大语言模型评估难以捕捉现实临床诊断复杂性的问题,开发ClinMM-Bench基准,用两级框架评估15个模型,发现专有模型诊断准确性最高,但各模型完全正确诊断比例有限,当前模型诊断推理有局限并明确了失败模式。
用于虚假订单欺诈检测的可追溯大语言模型推理
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 针对大规模虚假订单欺诈检测难题,提出基于大语言模型的DeepScrub框架,通过语义统一、持续预训练及SURE机制实现可追溯推理。实验及试点结果显示,该框架提升了欺诈审查精度与召回率,减少工作量并节省成本。
Comments 15 pages, 3 figures
推理去噪器:用于大型推理模型中幻觉检测的推理痕迹去噪
机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) ; Zhejiang University(浙江大学) ; Australian Artificial Intelligence Institute, University of Technology Sydney(悉尼科技大学澳大利亚人工智能研究所)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 针对大型推理模型中推理痕迹含噪声影响幻觉检测的问题,提出REDE框架,利用最终答案注意力塑造表示空间去噪,经实验验证,该框架能有效提升幻觉检测性能。
揭示语言模型中的潜在推理策略
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 研究将预训练语言模型响应分布分解为策略条件表示的问题,提出潜在变量分解方法,引入新变分目标,通过多策略算法任务基准验证了该方法能恢复潜在代码并保留基础模型响应分布。
量化递归推理模型
机构 * Integrated Systems Laboratory, ETH Zürich(集成系统实验室,瑞士苏黎世联邦理工学院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 研究递归推理模型量化问题,发现其因激活缩放粒度致精度崩溃,提出用逐块缩放恢复转换,应用MXInt4格式,该格式在任务中与浮点格式有竞争力,克服架构量化敏感性弱点,还能转移到ARC - AGI基准测试。
Comments Preprint, 27 pages, 4 tables, 12 figures
利用指令微调与合并实现推理模型适配
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 研究如何利用大量未使用的监督微调数据提升推理语言模型性能,先对模型进行经典指令微调,再与原始推理模型合并,该技术在多领域提升了模型性能且成本效益高。
G-SHARE:一种基于指南的人为因素事件诊断结构化推理框架
机构 * Institute of Nuclear and New Energy Technology, Tsinghua University(清华大学核能与新能源技术研究院) ; National Key Laboratory of Human Factors Engineering(人因工程重点实验室) ; Fujian Fuqing Nuclear Power Co., Ltd.(福建福清核电有限公司)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 研究针对核电站人为因素事件诊断问题,提出基于指南的结构化推理框架G-SHARE,将诊断指南转化为多阶段流程,含证据提取等步骤。通过构建数据集评估,其性能显著优于基线,证明了转化专家指南为推理流程对安全关键行业智能分析的价值。
用于改进推理和上下文修剪的结构化思维
机构 * University of Chicago(芝加哥大学) ; Capital One(第一资本金融公司)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 研究针对大语言模型长推理痕迹的问题,引入结构化思维框架,通过构建数据集微调模型,使其采用结构化推理风格提升性能,还能实现上下文修剪,在数学任务中可节省内存并保持一定性能。
SPARK:大语言模型中基于敏感性的潜在推理状态分析与引导
机构 * Xi’an Jiaotong University(西安交通大学) ; Peking University(北京大学) ; Tencent(腾讯)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 研究大语言模型推理失败问题,提出SPARK方法,利用隐藏状态响应诊断推理状态并引导测试时干预,通过长度控制敏感性等手段,在实验中提升了Qwen3系列模型性能,证明敏感性对推理失败诊断及干预的作用。
大语言模型在代理临床推理中的信息获取失败
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 研究大语言模型在临床推理中信息获取失败问题,开发血液肿瘤学代理评估框架,发现信息利用率是诊断准确性关键指标,推理痕迹与准确性不相关,主要失败模式为搜索满足等,指出模型主要限制是不确定性下信息获取失败。
Comments 66 pages, 9 figures; includes supplementary material
PhysMRV:用于物理合理性推理的物理内存检索与验证
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 针对视频语言模型物理合理性推理不可靠的问题,提出免训练的PhysMRV框架,通过将训练视频转化为分层内存库,利用结构化物理证据指导VLM验证物理合理性,在多基准测试中取得一致改进,有效增强该推理能力。
从推理中估计不确定性:对大语言模型中多语言和跨语言MCQA性能的大规模研究
机构 * INSAIT(萨格勒布信息与智能技术研究所) ; Amazon(亚马逊)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 研究对22种语言的不确定性估计方法进行大规模评估,使用两个人工整理的问答数据集,比较不同模型和架构下的UE方法。发现促使模型用英语推理可提升UE性能,缩小不同资源语言间的性能差距,且UE方法选择取决于模型规模,还给出了选择性预测阈值选择的分析。
InvestPhilBench: 评估大型语言模型在专家投资哲学中程序性推理的多层动态基准
机构 * University of California, Riverside (UCR)(加州大学河滨分校) ; Illinois Institute of Technology (IIT)(伊利诺伊理工学院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 提出InvestPhilBench基准,通过八层认知层级和自动化评分管道,揭示前沿LLM在投资决策程序推理中的复合评分饱和但程序性缺陷隐藏的问题。
Comments 65 pages, 6 figures, 26 tables. Benchmark, data, and code released. v0.6 release; preliminary empirical study (de-confounded multi-model leaderboard forthcoming)
用于专家模型适配的开放式场景推理
机构 * College of Information Science and Engineering, Northeastern University(东北大学信息科学与工程学院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 研究流程工业专家模型在新场景中退化问题,提出ROAM框架,利用大语言模型知识和推理,在不重训情况下使冻结模型适应新场景,实验证明该框架能有效降低误差并控制开销。
TUDUM:面向Qwen3.5-27B的土耳其语思维推理流水线
机构 * Department of Artificial Intelligence and Data Engineering(人工智能与数据工程系) ; Faculty of Engineering(工程学院) ; Ankara University(安卡拉大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出TUDUM流水线,通过SFT和GRPO强化学习将Qwen3.5-27B适配为土耳其语思维模型,使推理过程本身使用土耳其语,而非仅输出本地化答案。
面向长推理的信息感知KV缓存压缩
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出InfoKV框架,通过结合预测不确定性与注意力分数进行KV缓存压缩,在长上下文推理中优于现有方法。
检索预热能量基推理:结构化推理任务上扩散即推断的五臂消融方法
机构 * Department of Computer Science and Software Engineering, Auburn University(奥本大学计算机科学与软件工程系) ; Department of Information Management, National Central University(国立中央大学信息管理系)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 提出五臂消融方法(oracle、best-constant、per-query-random、shuffled、aligned)分离检索预热能量基推理中的三种混淆效应,在连通性-2任务上发现逐图对齐主导性能提升,而在数独任务上关键质量成为瓶颈。
Comments 8 Pages, 6 Figures
LLM时代:战争迷雾下大型语言模型的推理、外交与可靠性的战略1v1基准测试
机构 * Independent researcher, Switzerland(瑞士独立研究员)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出Age of LLM基准,在13x7网格上让两个LLM进行1v1对战,包含战争迷雾、完全外交和严格JSON格式可靠性维度,通过54场比赛评估15个推理模型,发现核冲刺主导、外交频繁但极少达成、非法动作反映信念追踪,并初步关联可靠性与获胜。
Comments 25 pages including appendices, 8 figures, 4 tables; appendices include verbatim system prompt and engine resolution pseudocode. All correlations reported with p-values, 95% bootstrap confidence intervals and Spearman's rho; includes a Steiger test and Bradley-Terry fit
基于大语言模型的知识图谱推理中的幻觉检测
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Tsinghua University(清华大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出LUCID方法,结合LLM注意力分数、知识图谱语义和结构信息,利用图神经网络检测LLM在知识图谱推理中的幻觉,在九个数据集上达到最优性能。
欧盟法律自动化中的测量差距:欧盟AI法案下教义性法律推理的基准测试
机构 * Chair of Law and Artificial Intelligence and Director, CZS Institute for Artificial Intelligence and Law, University of Tübingen(法律与人工智能教授、人工智能与法律研究所主任,图宾根大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 针对当前缺乏评估大型语言模型进行教义性法律推理的基准,提出该能力对满足欧盟AI法案中“适当准确性”要求至关重要。
解码推理型LLM中的隐藏欺骗:用于欺骗审计的激活解释器
机构 * Zhejiang University(浙江大学) ; Griffith University(格里菲斯大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出STATEWITNESS,一种通过解码目标模型隐藏状态来生成自然语言查询答案和结构化报告的激活解释器,在欺骗检测中平均AUROC达0.916,优于现有方法。
Comments Under review
ClinHallu: 用于诊断医学多模态大语言模型推理中阶段式幻觉的基准
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; DAMO Academy, Alibaba Group(阿里巴巴达摩院) ; Hupan Lab(湖畔实验室) ; Zhejiang University(浙江大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出ClinHallu基准,包含7031个实例,每个实例带有结构化推理轨迹(视觉识别、知识回忆、推理整合),通过阶段替换干预和轨迹监督微调,实现细粒度幻觉诊断与缓解。
Comments Code and datasets: https://github.com/alibaba-damo-academy/ClinHallu
Poker Arena: 大型语言模型中策略推理与记忆的多轴剖析
机构 * Indian Institute of Technology Roorkee(印度理工学院罗尔基分校) ; Raeth AI
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出Poker Arena平台,通过三层记忆架构和九轴认知剖面分解策略推理,揭示标量排行榜系统性误排模型能力结构。
Comments 33 pages, ICML Workshop
LLM作为调查员:基于证据优先的鲁棒交互式问题诊断
机构 * University of Calabria(卡拉布里亚大学) ; University of Cambridge(剑桥大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 提出证据优先的AI方法LLM-as-an-Investigator,通过估计问题歧义、生成假设、提问澄清并更新概率,避免过早接受用户假设,提升诊断准确性。
WorldReasoner: 评估语言模型代理是否通过有效推理预测事件
机构 * Department of Computer Science and Technology, University of Cambridge(剑桥大学计算机科学与技术系)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出WorldReasoner框架,通过时间有效检索、证据质量和因果图推理三个维度评估语言模型代理的事件预测能力,发现时间有效检索是结果准确性的最强驱动因素。
语言模型如何失败:承诺性和持续性推理错误的令牌级特征
机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学) ; Department of Aeronautics and Astronautics, Stanford University(航空航天工程系,斯坦福大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 通过令牌级不确定性信号,将语言模型推理失败分为承诺性失败(早期锁定错误路径)和持续性不确定性(不确定性持续累积),并在23个模型-数据集配置中验证了可预测性,为自我一致性策略提供了指导。