arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10414 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10414 篇

2608.04591 2026-08-06 cs.CL cs.AI 新提交 81%

When Absence Is Evidence: Evaluating Completeness-Sensitive Negative Reasoning in Large Language Models

当缺失即证据:评估大语言模型中对完整性敏感的负向推理能力

Byoungjae Min, Kennedy Edemacu, Sae-Hong Cho, Yoonhyuk Choi, Beakcheol Jang, Jong Wook Kim

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大语言模型的完整性敏感负向推理能力,构建CROWN-QA评估基准,发现模型存在过度闭合等问题,提示无法持续解决错误,且部分覆盖不对称性在真实文档中依然存在。

Comments 19 pages, 2 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04519 2026-08-06 cs.AI cs.CL 新提交 81%

Leak-Resistant Unlearning: A New Benchmark for Evaluating Multi-Hop Reasoning Consistency and Recovery Robustness

防泄露遗忘:评估多跳推理一致性与恢复鲁棒性的新基准

Haoting Qian, Qingjie Zhang, Zhicong Huang, Cheng Hong, Han Qiu

机构 * Tsinghua University(清华大学) Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出新基准unlearning评估LLM遗忘的鲁棒性,实验发现现有遗忘方法易受多跳推理路径和恢复攻击影响,还探究了遗忘质量、鲁棒性与模型效用的权衡。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00513 2026-08-06 cs.LG cs.AI cs.CV cs.IR 版本更新 81%

MOON3.0: Reasoning-aware Multimodal Representation Learning for E-commerce Product Understanding

MOON3.0: 基于推理的多模态表示学习用于电商产品理解

Junxian Wu, Chenghan Fu, Zhanheng Nie, Daoze Zhang, Bowen Wan, Wanxian Guan, Chuan Yu, Jian Xu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 MOON3.0通过多头模态融合、联合对比与强化学习框架及细粒度残差增强模块,提升电商产品细粒度属性建模能力,并在大规模多模态电商基准MBe3.0上实现零样本最优性能。

Comments Accepted by the 34th ACM International Conference on Multimedia (ACM MM), 2026. 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03321 2026-08-06 cs.LG cs.AI 版本更新 81%

HERO: Hierarchical Evidential Reasoning Optimization for Radiology Report Generation via Reason-then-Summarize

对齐发现与诊断:一种自洽的强化学习框架用于可信的放射学报告

Kun Zhao, Guodong Liu, Hui Ji, Siyuan Dai, Pan Wang, Jifeng Song, Chenghua Lin, Liang Zhan, Haoteng Tang

机构 * University of Pittsburgh(匹兹堡大学) University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷分校) The University of Manchester(曼彻斯特大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种自洽的强化学习框架,用于生成可信的放射学报告,通过优化生成过程和减少幻觉,提升了临床效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03401 2026-08-05 cs.LG cs.AI 新提交 81%

Shorter Reasoning, Earlier Answers? An Evaluation of Reasoning Interfaces

更短的推理,更早的答案?对推理接口的评估

Francesca Carlon, Vincent Ginis, Andres Algaba

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究评估大型语言模型的推理接口,测试提示词和训练设置对推理长度、准确率的影响,发现早答指令和低 effort 推理在特定 token 限制下可提升部分数据集准确率,需综合报告多维度评估指标。

Comments 52 pages, 13 figures, 30 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11996 2026-08-05 cs.CL cs.AI 版本更新 81%

Filtered Reasoning Score: Evaluating Reasoning Quality on a Model's Most-Confident Traces

过滤推理得分:在模型最自信的轨迹上评估推理质量

Manas Pathak, Xingyao Chen, Shuozhe Li, Amy Zhang, Liu Leqi

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出过滤推理得分,用于评估模型推理质量,区分相似准确率的模型,并提高对输入提示和生成配置变化的鲁棒性。

Comments Accepted at the Conference on Language Modeling (COLM) 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02442 2026-08-04 cs.AI cs.CL 新提交 81%

Right Answer, Wrong Method: Shortcut Hacking Misleads the Evaluation of LLM Reasoning on Frontier Science Benchmarks

正确答案,错误方法:捷径作弊误导前沿科学基准上的大语言模型推理评估

Xuan Ren, Weiqi Zhai, Tianle Pu, Yihua Zhu, Yihua Zhu, Hu Wei, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团) Alibaba DAMO Academy(阿里巴巴达摩院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究指出前沿LLM在科学推理基准中存在解题作弊问题,仅答案评估会高估其推理能力,开发的反作弊策略可抑制该问题。

Comments working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01875 2026-08-04 cs.AI cs.LG 新提交 81%

ReasonCast: Towards Explainable Time Series Forecasting with Reasoning

ReasonCast:面向可解释时间序列预测的推理方法

Seunghan Lee, Jun Seo, Jaehoon Lee, Junhyeok Kang, Sangjun Han, Sungdong Yoo, Minjae Kim, Tae Yoon Lim, Dongwan Kang, Hwanil Choi, Soonyoung Lee, Wonbin Ahn

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出任务融合模型ReasonCast,通过微调LLM实现时间序列预测与可解释文本推理的联合生成,在预测准确性上优于LLM和TS模型,还构建了联合评估基准ReasonTS-Bench。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01575 2026-08-04 cs.LG cs.AI 新提交 81%

Measuring in-context algorithmic reasoning in language models against an exact Bayes-optimal standard

基于精确贝叶斯最优标准测量语言模型的上下文内算法推理能力

Hector Zenil, Luan Ozelim

机构 * Oxford Immune Algorithmics(牛津免疫算法学公司) Oxford University Innovation(牛津大学创新公司) London Institute for Healthcare Engineering(伦敦医疗工程研究所) King’s College London(伦敦国王学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出F-ICL基准,以精确贝叶斯最优标准测量语言模型的上下文内算法推理能力,发现多数模型分布与最优标准存在差距,该差距与准确率无关且不受模型规模缩小,基准已开放。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22536 2026-08-04 cs.CL cs.AI 版本更新 81%

A Comprehensive FP8 Training Recipe for Reasoning-Enhanced Language Models

用于推理增强型语言模型的综合FP8训练方案

Wenjun Wang, Shuo Cai, Congkai Xie, Mingfa Feng, Yiming Zhang, Zhen Li, Kejing Yang, Ming Li, Jiannong Cao, Hongxia Yang

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出整合持续预训练与监督微调的端到端FP8训练方案,通过混合粒度量化实现高效无损失训练,效率较BF16提升显著,将发布代码推动大规模模型训练普及。

Comments This paper has been withdrawn by the authors due to a significant bug discovered in our data processing pipeline. This bug affects the validity of the experimental results, and we can no longer stand by the conclusions presented

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16301 2026-08-03 cs.CY cs.AI cs.LG 版本更新 81%

Do LLMs Hold Their Values? MANTA: A Multi-Turn Adversarial Benchmark for Animal Welfare Reasoning

LLMs 是否坚持其价值观?MANTA:一个用于动物福利推理的多轮对抗性基准

Isabella Luong, Joyee Chen, Sankalpa Ghose, David Williams-King, Linh Le, Allen Lu

机构 * SPAR Compassion Aligned Machine Learning(同情对齐机器学习) NUS(新加坡大学) Mila(Mila研究所) ERA Cambridge(剑桥ERA)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出 MANTA 基准,通过多轮对抗性对话评估大语言模型在动物福利推理中的价值观稳定性和道德敏感性,发现单轮基准无法捕捉的排名变化和物种-压力交互效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27747 2026-07-31 cs.CL cs.AI 新提交 81%

Can LVLMs Uncover the Truth Behind Visual Illusions? An Analysis of Perceptual and Reasoning Capabilities

大型视觉语言模型(LVLMs)能否揭示视觉错觉背后的真相?感知与推理能力分析

Liangjie Zhao, Jiaqing Lyu, Kexin Tang, Zecheng Fang, Rong Yin, Yulan Hu, Da Li, Jianing Li

机构 * Adelaide University(阿德莱德大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Amap, Alibaba Group(阿里巴巴集团高德地图) Beihang University(北京航空航天大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文利用IllusionReasoning基准,以视觉错觉为诊断工具评估LVLMs,发现多款LVLMs的推理能力不及宣称水平,为其优化提供了新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25947 2026-07-29 cs.AI cs.CL 新提交 81%

A Cost-Effective Multimodal LLM Reasoning Framework for Question Answering over Irregular Clinical Time Series

一种用于不规则临床时间序列问答的经济高效多模态大语言模型推理框架

Frank Nie, Ethan B Liu, Yuan Zhu, Wei Fan, Jindong Han

机构 * Shandong University(山东大学) University of Auckland(奥克兰大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对不规则临床时间序列问答,提出ClinPRISM框架。该框架含不规则感知多尺度编码器、时间证据蒸馏器和渐进对齐策略,通过构建训练数据,在40亿参数大语言模型主干上实现最优性能,兼具低时间序列令牌数和低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25933 2026-07-29 cs.CL cs.AI 新提交 81%

Evaluating Multi-Turn Multimodal Diagnostic Reasoning on Challenging Real-World Clinical Cases

评估具有挑战性的真实世界临床病例中的多轮多模态诊断推理

Rui Yang, Weihao Xuan, Yi Lin, Zhuhan Bao, Jonathan Chong Kai Liew, Matthew Yu Heng Wong, Nicolás Lescano, Nikita R. Paripati, Emily Ling-Lin Pai, Jiarui Liu, Heli Qi, Heng-Jui Chang, Benny Kai Guo Loo, Huitao Li, Kunyu Yu, Yufan Wang, Chuan Hong, Shijian Lu, Douglas Teodoro, Naoto Yokoya, Ross Koppel, Mona Diab, Hua Xu, David W. Bates, Nan Liu, Yifan Peng

机构 * Center for Biomedical Data Science, Duke-NUS Medical School(生物医学数据科学中心,杜克 - 新加坡国立大学医学院) Duke-NUS AI + Medical Sciences Initiative, Duke-NUS Medical School(杜克 - 新加坡国立大学人工智能与医学科学计划,杜克 - 新加坡国立大学医学院) Department of Population Health Sciences, Weill Cornell Medicine(人口健康科学系,威尔康奈尔医学院) System Engineering, College of Engineering, Cornell University(系统工程,康奈尔大学工程学院) Graduate School of Frontier Sciences, The University of Tokyo(前沿科学研究生院,东京大学) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心) Department of Biostatistics and Bioinformatics, Duke University(生物统计学与生物信息学系,杜克大学) Perelman School of Medicine, University of Pennsylvania(佩雷尔曼医学院,宾夕法尼亚大学) School of Clinical Medicine, University of Cambridge(临床医学学院,剑桥大学) Hospital of the University of Pennsylvania(宾夕法尼亚大学医院) Children’s Hospital of Philadelphia (CHOP)(费城儿童医院) Department of Anatomic Pathology and Laboratory Medicine, Hospital of the University of Pennsylvania(解剖病理学与检验医学系,宾夕法尼亚大学医院) Department of Pathology and Laboratory Medicine, University of California, San Francisco(病理学与检验医学系,加州大学旧金山分校) Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有多模态大语言模型评估难以捕捉现实临床诊断复杂性的问题,开发ClinMM-Bench基准,用两级框架评估15个模型,发现专有模型诊断准确性最高,但各模型完全正确诊断比例有限,当前模型诊断推理有局限并明确了失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03957 2026-07-29 cs.CL cs.AI 版本更新 81%

NormWorlds-CF: Solver-Verified Counterfactual Normative Reasoning with Metamorphic-Relation GRPO

NormWorlds-CF:使用变质关系GRPO进行求解器验证的反事实规范推理

Xinqi Zhang

机构 * Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 介绍NormWorlds-CF用于可执行规则世界的反事实规范推理,其求解器能产生多种结果用于监督评估。通过实验对比不同奖励机制对任务的影响,显示验证的反事实结构可影响训练后表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23075 2026-07-28 cs.CR cs.AI cs.LG 新提交 81%

Traceable LLM Reasoning for Fake-Order Fraud Detection

用于虚假订单欺诈检测的可追溯大语言模型推理

Siqi You, Bingsong Xu, Zhixian Zheng, Xinjian Peng, Yang Xie, Ying Wang, Jiarong Xu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 针对大规模虚假订单欺诈检测难题,提出基于大语言模型的DeepScrub框架,通过语义统一、持续预训练及SURE机制实现可追溯推理。实验及试点结果显示,该框架提升了欺诈审查精度与召回率,减少工作量并节省成本。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22098 2026-07-27 cs.AI cs.LG 新提交 81%

Reasoning Denoiser: Denoising Reasoning Traces for Hallucination Detection in Large Reasoning Models

推理去噪器:用于大型推理模型中幻觉检测的推理痕迹去噪

Junlin Fang, Do Nguyen-Thanh, Xiaogang Xu, Zhen Fang, Sean Du

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Zhejiang University(浙江大学) Australian Artificial Intelligence Institute, University of Technology Sydney(悉尼科技大学澳大利亚人工智能研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 针对大型推理模型中推理痕迹含噪声影响幻觉检测的问题,提出REDE框架,利用最终答案注意力塑造表示空间去噪,经实验验证,该框架能有效提升幻觉检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04572 2026-07-22 cs.AI cs.LG 版本更新 81%

Context-Masked Truncated Reasoning Audits for Answer-Key Dependence in LLM Tutors

通过截断的思维链审计检测基于大语言模型的教育辅导中的答案驱动推理

Bonan Shen, Dingyan Shang, Youting Wang, Tao Ning, Bowen Liu

机构 * Independent Researcher(独立研究员) Northeastern University(东北大学) Syracuse University(Syracuse大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究基于大语言模型的教育辅导中,模型能否利用答案信息生成答案驱动的解释,用截断推理AUC评估法在三种辅导情境下评估,发现答案信息能提升模型表现,支持截断思维链审计用于诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18421 2026-07-22 cs.CL cs.AI 版本更新 81%

TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models

TReB:评估大语言模型表格推理能力的综合基准

Ce Li, Xiaofan Liu, Zhiyan Song, Ce Chi, Boshen Shi, Chen Zhao, Guanguang Chang, Zhendong Wang, Kexin Yang, Xing Wang, Chao Deng, Junlan Feng

机构 * JIUTIAN Research(天研机构)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型处理表格数据推理能力评估基准缺失的问题,提出TReB基准,用分类法涵盖26个子任务,经数据处理构建高质量数据集,设计含三种推理模式的评估框架,揭示现有模型在表格任务上有改进空间,且数据和框架均公开。

Comments published by SIGIR 2026

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval, 2026, 3267-3275

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17674 2026-07-21 cs.LG cs.AI 新提交 81%

Uncovering Latent Reasoning Strategies in Language Models

揭示语言模型中的潜在推理策略

Awni Altabaa, John Lafferty

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究将预训练语言模型响应分布分解为策略条件表示的问题,提出潜在变量分解方法,引入新变分目标,通过多策略算法任务基准验证了该方法能恢复潜在代码并保留基础模型响应分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16237 2026-07-21 cs.LG cs.AI 新提交 81%

Quantizing Recursive Reasoning Models

量化递归推理模型

Thorir Mar Ingolfsson, Wajeeha Tahir, Anna Tegon, Lionnus Kesting, Gamze İslamoğlu, Luca Benini

机构 * Integrated Systems Laboratory, ETH Zürich(集成系统实验室,瑞士苏黎世联邦理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究递归推理模型量化问题,发现其因激活缩放粒度致精度崩溃,提出用逐块缩放恢复转换,应用MXInt4格式,该格式在任务中与浮点格式有竞争力,克服架构量化敏感性弱点,还能转移到ARC - AGI基准测试。

Comments Preprint, 27 pages, 4 tables, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02722 2026-07-21 cs.AI cs.LG 版本更新 81%

Enhancing LLMs' Clinical Reasoning with Real-World Data from a Nationwide Sepsis Registry

利用全国脓毒症登记处的真实世界数据增强大语言模型的临床推理能力

Junu Kim, Chaeeun Shim, Sungjin Park, Su Yeon Lee, Gee Young Suh, Chae-Man Lim, Seong Jin Choi, Song Mi Moon, Kyoung-Ho Song, Eu Suk Kim, Hong Bin Kim, Sejoong Kim, Chami Im, Dong-Wan Kang, Yong Soo Kim, Hee-Joon Bae, Sung Yoon Lim, Han-Gil Jeong, Edward Choi

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Microsoft(微软) Asan Medical Center, University of Ulsan College of Medicine(釜山大学医学院阿桑医疗中心) Samsung Medical Center, Sungkyunkwan University School of Medicine(成均馆大学医学院三星医疗中心) Seoul National University Bundang Hospital, Seoul National University College of Medicine(首尔国立大学医学院首尔国立大学医院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究旨在增强大语言模型临床推理能力,利用全国脓毒症登记处数据构建问题,通过强化学习微调模型得到C-Reason,该模型在域内测试集表现出色,推理能力能推广到不同任务和疾病,为开发通用临床推理模型提供思路。

Comments Accepted at MLHC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14895 2026-07-17 cs.LG cs.CL 新提交 81%

Leveraging Instruction Tuning and Merging for Reasoning Model Adaptation

利用指令微调与合并实现推理模型适配

Yu-Du Feng, Niels Mündler-Sasahara, Mark Vero, Martin Vechev

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 研究如何利用大量未使用的监督微调数据提升推理语言模型性能,先对模型进行经典指令微调,再与原始推理模型合并,该技术在多领域提升了模型性能且成本效益高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11892 2026-07-15 cs.CL cs.AI 新提交 81%

G-SHARE: A Guideline-Based Structured Reasoning Framework for Human-Factor Event Diagnosis

G-SHARE:一种基于指南的人为因素事件诊断结构化推理框架

Xingyu Xiao, Mao Du, Jiejuan Tong, Jingang Liang, Haitao Wang

机构 * Institute of Nuclear and New Energy Technology, Tsinghua University(清华大学核能与新能源技术研究院) National Key Laboratory of Human Factors Engineering(人因工程重点实验室) Fujian Fuqing Nuclear Power Co., Ltd.(福建福清核电有限公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对核电站人为因素事件诊断问题,提出基于指南的结构化推理框架G-SHARE,将诊断指南转化为多阶段流程,含证据提取等步骤。通过构建数据集评估,其性能显著优于基线,证明了转化专家指南为推理流程对安全关键行业智能分析的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01113 2026-07-15 cs.LG cs.AI cs.DS 版本更新 81%

Efficiently Learning Branching Networks for Multitask Algorithmic Reasoning

高效学习用于多任务算法推理的分支网络

Dongyue Li, Zhenshuo Zhang, Minxuan Duan, Edgar Dobriban, Hongyang R. Zhang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究旨在实现多任务算法推理,提出分支神经网络架构,通过递归树状划分任务,利用基于梯度的亲和度聚类,降低搜索复杂度。经实验验证,在多个基准测试中性能优于现有方法,减少运行时和内存使用,还可用于重叠社区检测。

Comments 31 pages. Modified the experiments section and improved exposition

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10386 2026-07-14 cs.CL cs.AI 新提交 81%

Structured Thoughts For Improved Reasoning And Context Pruning

用于改进推理和上下文修剪的结构化思维

Zain Sarwar, Supriyo Chakraborty, Berkcan Kapusuzoglu, Chia-Hsuan Lee, Anirban Das, Stephen Rawls, Kartik Balasubramaniam, Sambit Sahu

机构 * University of Chicago(芝加哥大学) Capital One(第一资本金融公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型长推理痕迹的问题,引入结构化思维框架,通过构建数据集微调模型,使其采用结构化推理风格提升性能,还能实现上下文修剪,在数学任务中可节省内存并保持一定性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10296 2026-07-14 cs.AI cs.CL 新提交 81%

SPARK: Susceptibility-Guided Profiling and Steering of Latent Reasoning States in Large Language Models

SPARK:大语言模型中基于敏感性的潜在推理状态分析与引导

Dongxu Zhang, Yiding Sun, Zihao Guo, Xiangyang Yang, Kai Tang, Lin Chen, Cheng Tan, Jihua Zhu

机构 * Xi’an Jiaotong University(西安交通大学) Peking University(北京大学) Tencent(腾讯)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型推理失败问题,提出SPARK方法,利用隐藏状态响应诊断推理状态并引导测试时干预,通过长度控制敏感性等手段,在实验中提升了Qwen3系列模型性能,证明敏感性对推理失败诊断及干预的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10275 2026-07-14 cs.AI cs.CL 新提交 81%

Information-seeking failures of large language models in agentic clinical reasoning

大语言模型在代理临床推理中的信息获取失败

Krischan Braitsch, Laura K. Schmalbrock, Theresa Weltermann, Andrew F. Berdel, Isabella Miller, Kai Tran, Michael Heider, Sabrina Kraus, Florian Bassermann, Jacqueline Lammert, Sebastian Ziegelmayer, Marcus Makowski, Lisa C. Adams, Keno K. Bressem

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型在临床推理中信息获取失败问题,开发血液肿瘤学代理评估框架,发现信息利用率是诊断准确性关键指标,推理痕迹与准确性不相关,主要失败模式为搜索满足等,指出模型主要限制是不确定性下信息获取失败。

Comments 66 pages, 9 figures; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10190 2026-07-14 cs.LG cs.AI cs.CV 新提交 81%

PhysMRV: Physical Memory Retrieval and Verification for Physics Plausibility Reasoning

PhysMRV:用于物理合理性推理的物理内存检索与验证

Wenyuan Wang, Lianyu Hu, Hao Wang, Yang Liu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 针对视频语言模型物理合理性推理不可靠的问题,提出免训练的PhysMRV框架,通过将训练视频转化为分层内存库,利用结构化物理证据指导VLM验证物理合理性,在多基准测试中取得一致改进,有效增强该推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06327 2026-07-13 cs.CL cs.AI 新提交 81%

Estimating Uncertainty from Reasoning: A Large-Scale Study of Multi- and Crosslingual MCQA Performance in LLMs

从推理中估计不确定性:对大语言模型中多语言和跨语言MCQA性能的大规模研究

Andrea Bacciu, Andrea Alfarano, Saab Mansour, Amin Mantrach, Marcello Federico

机构 * INSAIT(萨格勒布信息与智能技术研究所) Amazon(亚马逊)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究对22种语言的不确定性估计方法进行大规模评估,使用两个人工整理的问答数据集,比较不同模型和架构下的UE方法。发现促使模型用英语推理可提升UE性能,缩小不同资源语言间的性能差距,且UE方法选择取决于模型规模,还给出了选择性预测阈值选择的分析。

详情

展开后加载摘要…

URL PDF HTML 收藏