arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10364 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10364 篇

2606.21821 2026-06-23 cs.LG cs.CL 新提交 88%

Local Causal Attribution of Chain-of-Thought Reasoning

链式思维推理的局部因果归因

Dennis Wei, Yannis Belkhiter, Erik Miehling, Radu Marinescu

机构 * IBM Research(IBM研究院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.LG

AI总结 提出AttriCoT算法,通过结构因果模型对链式思维推理中的单元进行局部因果归因,仅需O(U)次前向传播即可获得忠实于模型行为的归因结果。

Comments Camera-ready version for the Mechanistic Interpretability Workshop at ICML 2026. 37 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00020 2026-06-02 cs.CL cs.AI 88%

CSRP: Chain-of-Thought Reasoning for Chinese Text Correction via Reinforcement Learning with Efficiency-Aware Rewards

CSRP:基于效率感知奖励的强化学习链式推理中文文本纠错

Wei Tian, Yuhao Zhou, Man Lan

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai Institute of Artificial Intelligence for Education, East China Normal University(东华大学教育人工智能研究所)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.AI

AI总结 提出CSRP三阶段框架,通过连续预训练、链式推理监督微调和基于效率感知奖励的组相对策略优化,在NACGEC基准上实现最优性能,有效缓解过度纠正偏差。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026, Main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16154 2026-04-15 cs.CL cs.AI 88%

AdaMCoT: Rethinking Cross-Lingual Factual Reasoning through Adaptive Multilingual Chain-of-Thought

AdaMCoT:通过自适应多语言链式思考重新思考跨语言事实推理

Weihua Zheng, Xin Huang, Zhengyuan Liu, Tarun Kumar Vangani, Bowei Zou, Xiyan Tao, Yuhao Wu, Ai Ti Aw, Nancy F. Chen, Roy Ka-Wei Lee

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出AdaMCOT框架,通过动态路由中间'思考语言'中的推理过程提升多语言事实推理能力,实验表明在低资源语言中表现显著提升。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18940 2026-03-30 cs.CL cs.LG 88%

Entropy trajectory shape predicts LLM reasoning reliability: A diagnostic study of uncertainty dynamics in chain-of-thought

熵轨迹形状预测LLM推理可靠性:对不确定性动态的诊断研究

Xinghao Zhao

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.LG

AI总结 研究通过分析推理过程中熵轨迹形状来预测大语言模型的推理可靠性,提出了一种基于轨迹形状而非标量大小的诊断方法,展示了其在黑盒环境中的实用性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04913 2025-11-11 cs.LG cs.CL 88%

Dissecting Long-Chain-of-Thought Reasoning Models: An Empirical Study

Yongyu Mu, Jiali Zeng, Bei Li, Xinyan Guan, Fandong Meng, Jie Zhou, Tong Xiao, Jingbo Zhu

机构 * Pattern Recognition Center, WeChat AI, Tencent Inc.(腾讯人工智能研究院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.LG

Comments Working in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05003 2025-10-07 cs.CL cs.AI 88%

Resource-Efficient Fine-Tuning of LLaMA-3.2-3B for Medical Chain-of-Thought Reasoning

Imran Mansha

机构 * Department of Information Technology(信息科技系) The Islamia University of Bahawalpur(巴哈瓦尔普尔伊斯兰大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.AI

Comments 6 pages, 2 figures. Submitted to arXiv for open access

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05234 2025-08-08 cs.CL cs.AI 88%

Resource-Limited Joint Multimodal Sentiment Reasoning and Classification via Chain-of-Thought Enhancement and Distillation

Haonan Shangguan, Xiaocui Yang, Shi Feng, Daling Wang, Yifei Zhang, Ge Yu

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03786 2025-05-08 cs.LG cs.CL 88%

When Reasoning Beats Scale: A 1.5B Reasoning Model Outranks 13B LLMs as Discriminator

Md Fahim Anjum

机构 * Department of Neurology University of California San Francisco(神经病学系,加州大学旧金山分校)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract,comments);chain-of-thought(abstract);CoT(abstract)

Comments 12 pages, 5 figures. Code available at: https://github.com/MDFahimAnjum/llm-planning-with-reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16779 2025-03-24 cs.CL cs.AI 88%

Chain-of-Tools: Utilizing Massive Unseen Tools in the CoT Reasoning of Frozen Language Models

Mengsong Wu, Tong Zhu, Han Han, Xiang Zhang, Wenbiao Shao, Wenliang Chen

专题命中 推理评测 :reasoning(title,abstract);CoT(title,abstract);分类 cs.CL、cs.AI

Comments 11 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05879 2025-02-11 cs.CL cs.AI 88%

Enhancing Depression Detection with Chain-of-Thought Prompting: From Emotion to Reasoning Using Large Language Models

Shiyu Teng, Jiaqing Liu, Rahul Kumar Jain, Shurong Chai, Ruibo Hou, Tomoko Tateyama, Lanfen Lin, Yen-wei Chen

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12863 2024-01-24 cs.CL cs.AI 88%

KAM-CoT: Knowledge Augmented Multimodal Chain-of-Thoughts Reasoning

Debjyoti Mondal, Suraj Modi, Subhadarshi Panda, Rituraj Singh, Godawari Sudhakar Rao

专题命中 推理评测 :reasoning(title,abstract);CoT(title,abstract);分类 cs.CL、cs.AI

Comments AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11792 2023-10-17 cs.CL cs.AI 88%

Cue-CoT: Chain-of-thought Prompting for Responding to In-depth Dialogue Questions with LLMs

Hongru Wang, Rui Wang, Fei Mi, Yang Deng, Zezhong Wang, Bin Liang, Ruifeng Xu, Kam-Fai Wong

专题命中 推理评测 :CoT(title,abstract);chain-of-thought(title);reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.12321 2021-07-27 cs.AI cs.CV cs.LG 88%

AGENT: A Benchmark for Core Psychological Reasoning

Tianmin Shu, Abhishek Bhandwaldar, Chuang Gan, Kevin A. Smith, Shari Liu, Dan Gutfreund, Elizabeth Spelke, Joshua B. Tenenbaum, Tomer D. Ullman

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(title);planning(abstract);分类 cs.AI、cs.LG

Comments ICML 2021, 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13239 2026-08-14 cs.CV 新提交 88%

Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?

社会视听问答的推理:我们处于什么阶段?

Koen P. de Vries, Xavier Alameda-Pineda, Estefanía Talavera, Stéphane Lathuilière

机构 * Inria(法国国家信息与自动化研究所) Univ. Grenoble Alpes(格勒诺布尔大学) CNRS(法国国家科学研究中心) University of Twente(特文特大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn)

AI总结 本文针对社会视听问答研究,发现IntentBench存在高噪声,Vanilla SFT基线性能优于现有推理方法,仅用文本模态即可实现与视频相当的性能,并发布了IntentBench-Prime等资源。

Comments Accepted at HCMIW ECCV workshop. Code available here: https://github.com/koenv759/VanillaSFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01462 2026-06-02 cs.AI cs.CL cs.LG 88%

An Enigma of Artificial Reason: Investigating the Production-Evaluation Gap in Large Reasoning Models

人工推理之谜:探究大型推理模型中的生成-评估差距

Mingzhong Sun, Teresa Yeo, Armando Solar-Lezama, Tan Zhi-Xuan

机构 * NUS Department of Computer Science(国立新加坡大学计算机科学系) MIT EECS(麻省理工学院电子工程与计算机科学系) A*STAR(新加坡科技研究局) Singapore-MIT Alliance for Research and Technology (SMART)(新加坡-麻省理工联合研究技术机构(SMART))

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过VAIR数据集发现大型推理模型在评估推理时存在显著缺陷,表现为答案确认偏差,即模型倾向于验证答案正确性而非仔细检查推理步骤。

Comments 10 pages, 8 figures, 2 tables (Appendix: 19 pages, 13 figures, 3 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25549 2026-05-26 cs.CL cs.AI cs.LG 88%

BC Protocol: Structured Dual-Expert Dialogue for Eliciting High-Quality Chain-of-Thought Post-Training Data

BC协议:结构化双专家对话用于生成高质量思维链后训练数据

Bo Zou, Chao Xu

专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对大语言模型后训练中高质量专家思维链数据生产瓶颈,提出BC协议——一种结构化双专家引出方法,通过配对领域专家与知识工程师,系统外化专家隐性判断为自然语言推理链,实验证明其在推理过程自然性上具有压倒性优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06672 2026-05-11 cs.AI cs.CL cs.LG 88%

More Thinking, More Bias: Length-Driven Position Bias in Reasoning Models

更多思考,更多偏见:推理模型中的长度驱动位置偏见

Xiao Wang

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现推理模型中位置偏见随推理轨迹长度增加而增强,指出不应默认认为推理模型在多项选择评估中具有顺序鲁棒性,并提供诊断工具用于审计位置偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14684 2025-12-01 cs.CL cs.AI 88%

Mind the Gap: Bridging Thought Leap for Improved Chain-of-Thought Tuning

注意间隔:为改进链式推理微调而弥合思维跳跃

Haolei Xu, Yuchen Yan, Yongliang Shen, Wenqi Zhang, Guiyang Hou, Shengpei Jiang, Kaitao Song, Weiming Lu, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学) SF Technology(SF技术) Microsoft Research Asia(微软亚洲研究院)

专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract,comments);reasoning(abstract);logical reasoning(abstract)

AI总结 本文提出CoT思维跳跃桥任务,通过生成缺失的中间推理步骤提升数学推理任务的性能,实验表明在NuminaMath上改进达+5.87%。

Comments Accepted to NeurIPS 2025. Camera ready version. Code: https://github.com/ZJU-REAL/Mind-the-Gap Project: https://zju-real.github.io/CoT-Bridge/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27958 2026-07-21 cs.AI 版本更新 88%

CARV: A Diagnostic Benchmark for Compositional Analogical Reasoning in Multimodal LLMs

CARV:多模态大语言模型中组合类比推理的诊断基准

Yongkang Du, Xiaohan Zou, Minhao Cheng, Lu Lin

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.AI

AI总结 本文提出CARV任务及5500样本数据集,评估多模态大语言模型在组合类比推理中的能力,发现Gemini-2.5 Pro准确率仅为40.4%,远低于人类水平,揭示模型在规则提取与组合变换上的局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12252 2026-06-19 cs.CV cs.CL 版本更新 88%

EndoCoT: Scaling Endogenous Chain-of-Thought Reasoning in Diffusion Models

EndoCoT:扩散模型中的内生思维链推理扩展

Xuanlang Dai, Yujie Zhou, Long Xing, Jiazi Bu, Xilin Wei, Yuhong Liu, Beichen Zhang, Kai Chen, Yuhang Zang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Xi’an Jiaotong University(西安交通大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiaotong University(上海交通大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL

AI总结 提出EndoCoT框架,通过迭代思维引导模块激活MLLM的推理潜力,并利用终端思维接地模块确保推理轨迹与文本监督对齐,使DiT逐步执行复杂任务,在多个基准上平均准确率达92.1%。

Comments 23 pages, 18 figures, The code and dataset are publicly available at https://internlm.github.io/EndoCoT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14068 2026-05-19 cs.CV cs.LG 88%

CurveBench: A Benchmark for Exact Topological Reasoning over Nested Jordan Curves

CurveBench:一种用于嵌套乔丹曲线精确拓扑推理的基准

Amirreza Mohseni, Mona Mohammadi, Morteza Saghafian, Naser Talebizadeh Sardari

机构 * Maastricht University(马斯特里赫特大学) Cornell University(康奈尔大学) TU Wien(维也纳技术大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.LG

AI总结 CurveBench是一个用于从视觉输入中进行层次拓扑推理的基准,包含756张非相交的乔丹曲线图像,通过结构预测任务恢复由曲线诱导的根树结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11439 2026-05-13 cs.CV cs.LG 88%

Instruct-ICL: Instruction-Guided In-Context Learning for Post-Disaster Damage Assessment

Instruct-ICL:基于指令的上下文学习用于灾后损害评估

Armin Zarbaft, Ehsan Karimi, Nhut Le, Maryam Rahnemoonfar

专题命中 推理评测 :CoT(summary_cn,abstract);chain-of-thought(abstract,abstract_cn);reasoning(abstract);分类 cs.LG

AI总结 本文提出Instruct-ICL方法,通过指令引导的上下文学习提升预训练多模态大语言模型在灾后视觉问答中的可靠性,实验表明结合CoT推理能显著提高回答准确性。

Comments Accepted by the 2026 IEEE International Geoscience and Remote Sensing Symposium (IGARSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26288 2026-05-01 cs.CV cs.AI 88%

CheXthought: A global multimodal dataset of clinical chain-of-thought reasoning and visual attention for chest X-ray interpretation

CheXthought:一个包含临床推理链和视觉注意力的全球多模态数据集,用于胸部X光解读

Sonali Sharma, Jin Long, George Shih, Sarah Eid, Christian Bluethgen, Francine L. Jacobson, Emily B. Tsai, Global Radiology Consortium, Ahmed M. Alaa, Curtis P. Langlotz

机构 * Center for Artificial Intelligence in Medicine and Imaging(医学与影像人工智能中心) Department of Radiology(放射科) Department of Pediatrics(儿科) Department of Radiology, Weill Cornell Medicine(韦氏 Cornell 医学院放射科) Department of Radiology, Brigham and Women’s Hospital(布里奇妇产科医院放射科) University of California, Berkeley(加州大学伯克利分校) University of California, San Francisco(加州大学旧金山分校) Department of Biomedical Data Science(生物医学数据科学部)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.AI

AI总结 CheXthought数据集通过501名放射科医生的50312例多读X光片,提供了103592条推理链和6609082条同步视觉注意力标注,展示了临床推理模式,并在事实准确性、空间定位、病理分类、视觉忠实度、时间推理和不确定性沟通等方面提升了视觉语言模型性能。

Comments 51 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12782 2026-04-21 cs.AI 88%

HeroBench: A Benchmark for Long-Horizon Planning and Structured Reasoning in Virtual Worlds

HeroBench:一个用于虚拟世界中长horizon规划和结构化推理的基准测试

Petr Anokhin, Roman Khalikov, Stefan Rebrikov, Viktor Volkov, Artyom Sorokin, Vincent Bissonnette

机构 * Artyom Sorokin(AXXX) Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) Higher School of Economics(高等经济学院) Kurchatov Institute(库尔斯克研究所) Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

AI总结 本文提出HeroBench,用于评估在复杂RPG-inspired虚拟世界中长horizon分层规划和结构化推理的能力,通过模拟评估可执行计划,揭示了现有大型语言模型在长horizon自主规划中的性能差异和挑战。

Comments Code is available at https://github.com/stefanrer/HeroBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11987 2026-03-13 cs.AI 88%

LABSHIELD: A Multimodal Benchmark for Safety-Critical Reasoning and Planning in Scientific Laboratories

LABSHIELD:一种多模态基准,用于科学实验室中的安全关键推理和规划

Qianpu Sun, Xiaowei Chi, Yuhan Rui, Ying Li, Kuangzhi Ge, Jiajun Li, Sirui Han, Shanghang Zhang

专题命中 推理评测 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

AI总结 LABSHIELD是一个多模态基准,用于评估MLLM在科学实验室中的安全关键推理和规划能力,揭示了现有模型在专业实验室场景中的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17842 2026-03-10 cs.CL 88%

EFT-CoT: A Multi-Agent Chain-of-Thought Framework for Emotion-Focused Therapy

EFT-CoT:一种针对情感导向治疗的多智能体链式思考框架

Lanqing Du, Yunong Li, YuJie Long, Shihong Chen

专题命中 推理评测 :chain-of-thought(title,abstract);CoT(title,abstract);分类 cs.CL

AI总结 EFT-CoT提出一种基于情感导向治疗的多智能体框架,通过三个阶段工作流程提升心理健康问答的共情深度和专业性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18077 2026-03-09 cs.CL 88%

Chain-of-Thought Reasoning Improves Context-Aware Translation with Large Language Models

基于链式推理的翻译改进:大型语言模型的上下文感知翻译

Shabnam Ataee, Hugo Huart, Andrei Popescu-Belis

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL

AI总结 本文通过链式推理提升大型语言模型在上下文感知翻译中的表现,发现推理能力显著提高翻译准确率。

Comments Proceedings of LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20901 2026-02-25 cs.CV cs.LG 88%

SpatiaLQA: A Benchmark for Evaluating Spatial Logical Reasoning in Vision-Language Models

SpatiaLQA: 一个评估视觉-语言模型空间逻辑推理能力的基准

Yuechen Xie, Xiaoyan Zhang, Yicheng Shan, Hao Zhu, Rui Tang, Rong Wei, Mingli Song, Yuanyu Wan, Jie Song

机构 * Zhejiang University(浙江大学) The University of Sydney(悉尼大学) ManyCore State Key Laboratory of Blockchain and Security, Zhejiang University(浙江大学区块链与安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.LG

AI总结 SpatiaLQA提出了一种评估视觉-语言模型空间逻辑推理能力的基准,通过递归场景图辅助推理方法提升模型在复杂场景中的推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09831 2025-11-14 cs.CL cs.CY 88%

Answering Students' Questions on Course Forums Using Multiple Chain-of-Thought Reasoning and Finetuning RAG-Enabled LLM

Neo Wang, Sonit Singh

机构 * School of Computer Science and Engineering, University of New South Wales, Sydney, Australia(计算机科学与工程学院,新南威尔士大学,悉尼,澳大利亚)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00378 2025-10-15 cs.AI cs.CV 88%

CoRGI: Verified Chain-of-Thought Reasoning with Post-hoc Visual Grounding

Shixin Yi, Lin Shang

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.AI

Comments The paper is not yet mature and needs further improvement

详情

展开后加载摘要…

URL PDF HTML 收藏