arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 4988 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 4988 篇

2311.08097 2024-06-24 cs.CL cs.AI 86%

Empowering Multi-step Reasoning across Languages via Tree-of-Thoughts

Leonardo Ranaldi, Giulia Pucci, Federico Ranaldi, Elena Sofia Ruzzetti, Fabio Massimo Zanzotto

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Findings of the Association for Computational Linguistics: NAACL 2024

Journal ref 2024.findings-naacl.78

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13035 2024-06-18 cs.CL cs.AI 86%

Learning to Check: Unleashing Potentials for Self-Correction in Large Language Models

Che Zhang, Zhenyang Xiao, Chengcheng Han, Yixin Lian, Yuejian Fang

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03348 2024-06-11 cs.CL cs.AI 86%

Learning to Maximize Mutual Information for Chain-of-Thought Distillation

Xin Chen, Hanxian Huang, Yanjun Gao, Yi Wang, Jishen Zhao, Ke Ding

专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Accepted to ACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08704 2024-04-16 cs.CL cs.AI 86%

MM-PhyQA: Multimodal Physics Question-Answering With Multi-Image CoT Prompting

Avinash Anand, Janak Kapuriya, Apoorv Singh, Jay Saraf, Naman Lal, Astha Verma, Rushali Gupta, Rajiv Shah

专题命中 复杂问题求解 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18338 2024-02-28 cs.CL cs.AI 86%

Small Language Models Fine-tuned to Coordinate Larger Language Models improve Complex Reasoning

Gurusha Juneja, Subhabrata Dutta, Soumen Chakrabarti, Sunny Manchanda, Tanmoy Chakraborty

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2023 (Typos corrected)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.13982 2023-11-27 cs.CL cs.AI 86%

Probabilistic Tree-of-thought Reasoning for Answering Knowledge-intensive Complex Questions

Shulin Cao, Jiajie Zhang, Jiaxin Shi, Xin Lv, Zijun Yao, Qi Tian, Juanzi Li, Lei Hou

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Accepted by EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11721 2023-10-19 cs.CL cs.LG 86%

Chain-of-Thought Tuning: Masked Language Models can also Think Step By Step in Natural Language Understanding

Caoyun Fan, Jidong Tian, Yitian Li, Wenqing Chen, Hao He, Yaohui Jin

专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.LG

Comments EMNLP2023 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16621 2023-09-29 cs.CL cs.AI 86%

Stress Testing Chain-of-Thought Prompting for Large Language Models

Aayush Mishra, Karan Thakkar

专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04679 2023-08-10 cs.CL cs.AI 86%

Sci-CoT: Leveraging Large Language Models for Enhanced Knowledge Distillation in Small Models for Scientific QA

Yuhan Ma, Haiqi Jiang, Chenyou Fan

专题命中 复杂问题求解 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.07932 2023-06-26 cs.CL cs.AI 86%

Human-in-the-Loop through Chain-of-Thought

Zefan Cai, Baobao Chang, Wenjuan Han

专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.10625 2023-04-18 cs.AI cs.CL 86%

Least-to-Most Prompting Enables Complex Reasoning in Large Language Models

Denny Zhou, Nathanael Schärli, Le Hou, Jason Wei, Nathan Scales, Xuezhi Wang, Dale Schuurmans, Claire Cui, Olivier Bousquet, Quoc Le, Ed Chi

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

Comments ICLR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16419 2025-08-25 cs.CL 86%

Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models

Yang Sui, Yu-Neng Chuang, Guanchu Wang, Jiamu Zhang, Tianyi Zhang, Jiayi Yuan, Hongyi Liu, Andrew Wen, Shaochen Zhong, Na Zou, Hanjie Chen, Xia Hu

机构 * Rice University(里士大学) University of Houston(休斯顿大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments Accepted by TMLR 2025. Project website: https://github.com/Eclipsess/Awesome-Efficient-Reasoning-LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.10001 2023-06-02 cs.CL 86%

Towards Understanding Chain-of-Thought Prompting: An Empirical Study of What Matters

Boshi Wang, Sewon Min, Xiang Deng, Jiaming Shen, You Wu, Luke Zettlemoyer, Huan Sun

专题命中 复杂问题求解 :chain-of-thought(title,abstract);CoT(abstract,comments);reasoning(abstract);分类 cs.CL

Comments ACL-23 Camera Ready. Code and model input/output are available at https://github.com/sunlab-osu/Understanding-CoT

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01203 2026-01-30 cs.SI 86%

HetGCoT: Heterogeneous Graph-Enhanced Chain-of-Thought LLM Reasoning for Academic Question Answering

HetGCoT:异构图增强的链式思考LLM推理用于学术问答

Runsong Jia, Mengjia Wu, Ying Ding, Jie Lu, Yi Zhang

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title)

AI总结 HetGCoT通过异构图增强链式思考LLM推理,提升学术问答的可解释性和准确性。

Comments Findings of the Association for Computational Linguistics: EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06637 2025-10-01 cs.MM 86%

SCI-Reason: A Dataset with Chain-of-Thought Rationales for Complex Multimodal Reasoning in Academic Areas

Chenghao Ma, Haihong E., Junpeng Ding, Jun Zhang, Ziyan Ma, Huang Qing, Bofei Gao, Liang Chen, Yifan Zhu, Meina Song

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title)

Comments Submitted to ICCV 2025. 11 pages (including references)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14003 2026-08-17 cs.CL 新提交 85%

Batch-wise Adaptive Pruning: Periodic Neuron Activation-Aware Weight Pruning for Language Reasoning Model

批量自适应剪枝:面向语言推理模型的周期性神经元激活感知权重剪枝

Yongmin Kim, Shota Takashiro, Yusuke Iwasawa, Takeshi Kojima, Yutaka Matsuo

机构 * The University of Tokyo(东京大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本研究针对语言推理模型批量推理下自适应剪枝性能下降的问题,提出带周期性top-k选择和激活记忆的无训练剪枝方法,在DeepSeek-R1-Distill-Qwen-7B上实现39.7个百分点准确率提升与1.40倍推理加速。

Comments Accepted at COLM 2026. 28 pages, 12 figures, 18 tables. Code: https://github.com/matsuolab/batch-wise-prune

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16694 2026-08-11 cs.AI 版本更新 85%

RankGuide: Tensor-Rank-Guided Routing and Steering for Efficient Reasoning

RankGuide: 张量秩引导的路由与引导以实现高效的推理

Jiayi Tian, Yupeng Su, Ryan Solgi, Souvik Kundu, Zheng Zhang

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) Intel Labs(英特尔实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI

AI总结 RankGuide通过张量秩引导的路由与引导提升小推理模型与大推理模型的协作效率,减少推理延迟并提高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16819 2026-07-21 cs.AI 新提交 85%

FUSAR-R1: A Large-Scale Reasoning Model for Intelligent Interpretation of SAR Images

FUSAR-R1:一种用于合成孔径雷达图像智能解释的大规模推理模型

Yi Yang, Xiaokun Zhang, Yuxuan Li, Ruyi Zhang, Xinpeng Zhou, Haipeng Wang

机构 * Fudan University(复旦大学) Key Laboratory for Information Science of Electromagnetic Waves (MoE)(电磁波信息科学教育部重点实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);self-correction(abstract);分类 cs.AI

AI总结 针对SAR图像智能解释问题,提出FUSAR-R1模型。通过模拟专家解释构建思维链推理数据指导指令学习,赋予基本推理能力,再用强化学习策略优化输出。该模型在多种SAR解释任务中表现优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11089 2026-07-14 cs.AI 新提交 85%

OS-Pruner: Pruning Chains-of-Thought of Reasoning Models via Optimal Stopping

OS-Pruner:通过最优停止修剪推理模型的思维链

Mohammed Ehab, Aymane El Gadarri, Vivek F. Farias, Adam Jozefiak, Ciamac C. Moallemi

机构 * MIT(麻省理工学院) Columbia Business School(哥伦比亚商学院)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 研究针对大语言模型思维链推理存在计算过度问题,提出轻量级框架OS-Pruner,将思维链修剪转化为最优停止问题,通过优化效用动态评估终止点,在多基准和模型上减少生成长度且精度牺牲小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01482 2026-06-24 cs.AI 版本更新 85%

Grounding Multi-Hop Reasoning in Structural Causal Models via Group Relative Policy Optimization

通过群体相对策略优化在结构因果模型中 grounding 多跳推理

Yunhan Bu, Quan Zhang, Huaping Zhang, Guotong Geng, Chunxiao Gao, Askar Hamdulla, Juan Wang, Qiuchi Li, Baohua Zhang, Shuai Lei, Yunbo Cao, Zhunchen Luo

机构 * School of Computer Science and Technology, Xinjiang University, Urumqi, China(新疆大学计算机科学与技术学院,乌鲁木齐,中国) Beijing Institute of Technology, Beijing, China(北京理工大学,北京,中国) Military Science Information Research Center, Academy of Military Science, Beijing, China(军事科学院军事科学信息研究中心,北京,中国)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract_cn);分类 cs.AI

AI总结 本文提出基于结构因果模型的多跳事实验证框架,通过群体相对策略优化解决推理链长度与准确率的平衡问题,实验表明其在HoVer和EX-FEVER数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12171 2026-06-09 cs.AI 版本更新 85%

MatSciBench: Benchmarking the Reasoning Ability of Large Language Models in Materials Science

MatSciBench: 基准测试大型语言模型在材料科学中的推理能力

Junkai Zhang, Jingru Gan, Xiaoxuan Wang, Zian Jia, Changquan Gu, Jianpeng Chen, Yanqiao Zhu, Mingyu Derek Ma, Dawei Zhou, Ling Li, Wei Wang

机构 * University of California, Los Angeles Computer Science Department(加州大学洛杉矶分校计算机科学系) University of Pennsylvania Department of Materials Science and Engineering(宾夕法尼亚大学材料科学与工程系) Virginia Tech Department of Computer Science(弗吉尼亚理工大学计算机科学系)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);self-correction(abstract);分类 cs.AI

AI总结 提出MatSciBench基准,包含1340道大学级材料科学问题,覆盖6个主领域和31个子领域,评估LLM推理能力,发现当前模型在领域知识、计算和图表理解方面存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17956 2026-06-04 cs.CL 85%

Towards Better Understanding of Program-of-Thought Reasoning in Cross-Lingual and Multilingual Environments

在跨语言和多语言环境中更好地理解程序思维推理

Patomporn Payoungkhamdee, Pume Tuchinda, Jinheon Baek, Samuel Cahyawijaya, Can Udomcharoenchaikit, Potsawee Manakul, Peerat Limkonchotiwat, Ekapol Chuangsuwanich, Sarana Nutanong

机构 * School of Information Science and Technology, VISTEC(信息科学与技术学院,VISTEC) KAIST(韩国科学技术院) Cohere SCB 10X AI Singapore(AI新加坡) Department of Computer Engineering, Chulalongkorn University(朱拉隆梭大学计算机工程系)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 通过分离推理与代码执行,提出评估程序思维提示的框架,发现微调显著提升多语言推理能力,且推理质量与答案准确性强相关。

Journal ref Findings of the Association for Computational Linguistics: ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03217 2026-06-03 stat.ML cond-mat.dis-nn cs.LG 85%

An Asymptotic Theory of Chain-of-Thought in In-Context Learning

上下文学习中思维链的渐近理论

Kaito Takanami, Cengiz Pehlevan

机构 * Department of Physics, Graduate School of Science, The University of Tokyo(东京大学物理系研究生院) John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛大学约翰·A·保罗森工程与应用科学学院) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学凯普勒人工智能研究 institute) Center for Brain Science, Harvard University(哈佛大学脑科学中心)

专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.LG

AI总结 通过高维随机矩阵理论,推导了线性回归中上下文学习思维链的泛化误差精确公式,揭示了推理深度、预训练数据量和上下文长度之间的相变现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26680 2026-05-27 cs.CV cs.AI 85%

DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding

DynFrame: 自适应推理驱动的多模态框架与动态帧增强用于复杂视频理解

Peng Zhang, Guanghao Zhang, Wanggui He, Longxiang Zhang, Mushui Liu, Yan Xia, Zhenhao Peng, Weilong Dai, Jinlong Liu, Haobing Tang, Le Zhang, Hao Jiang, Pipei Huang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI

AI总结 提出DynFrame框架,通过将时间窗口和采样密度作为原生token进行单步检索,并引入分段解耦GRPO优化,解决了视频多模态大模型中采样密度不可学习及检索与回答优化耦合的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00938 2026-04-13 cs.LG 85%

Large Reasoning Models Learn Better Alignment from Flawed Thinking

大规模推理模型通过 flawed thinking 学习更好的对齐

ShengYun Peng, Eric Smith, Ivan Evtimov, Song Jiang, Pin-Yu Chen, Hongyuan Zhan, Haozhu Wang, Duen Horng Chau, Mahesh Pasupuleti, Jianfeng Chi

机构 * Meta Superintelligence Labs(Meta超级智能实验室) IBM Research(IBM研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 RECAP通过强化学习提升模型安全对齐能力,减少偏见并增强鲁棒性,同时保持推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06787 2026-04-09 cs.CL 85%

When Is Thinking Enough? Early Exit via Sufficiency Assessment for Efficient Reasoning

思考何时足够?通过充分性评估实现高效的推理早期退出

Yang Xiang, Yixin Ji, Ruotao Xu, Dan Qiao, Zheming Yang, Juntao Li, Min Zhang

机构 * Soochow University(苏州大学) ByteDance(字节跳动)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出DTSR框架,通过动态评估推理链的充分性,实现早期退出,减少计算冗余,提升推理效率。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02155 2026-04-03 cs.CL 85%

Brief Is Better: Non-Monotonic Chain-of-Thought Budget Effects in Function-Calling Language Agents

简洁即更好:函数调用语言代理中的非单调链式思维预算效应

Xuan Qi

机构 * IIIS, Tsinghua University(清华大学交叉信息研究院)

专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 研究探讨了链式思维预算对函数调用代理性能的影响,发现简短的链式思维显著提升准确性,而延长的链式思维反而降低性能,提出Function-Routing CoT方法提升可靠性。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22942 2026-03-25 cs.AI 85%

Optimizing Small Language Models for NL2SQL via Chain-of-Thought Fine-Tuning

通过链式思维微调优化小型语言模型用于自然语言到SQL转换

Anshul Solanki, Sanchit Latawa, Koushik Chakraborty, Navneet Kamboj

专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 本文通过链式思维微调优化小型语言模型,发现小型模型在NL2SQL任务中表现优于大型模型,显著提升准确率并降低成本。

Comments 9 pages , 3 fifures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16252 2026-03-20 cs.CL 85%

Fin-R1: A Large Language Model for Financial Reasoning through Reinforcement Learning

Fin-R1:通过强化学习构建的金融推理大语言模型

Zhaowei Liu, Xin Guo, Zhi Yang, Fangqi Lou, Lingfeng Zeng, Jinyi Niu, Mengping Li, Qi Qi, Zhiqiang Liu, Yiyang Han, Dongpo Cheng, Ronghao Chen, Huacan Wang, Xingdong Feng, Huixia Judy Wang, Chengchun Shi, Liwen Zhang

机构 * School of Statistics and Data Science, Shanghai University of Finance and Economics, China(上海金融学院统计与数据科学学院,中国) School of Mathematical Sciences, Fudan University, China(复旦大学数学科学学院,中国) School of Economics, Shanghai University of Finance and Economics, China(上海金融学院经济学院,中国) AI Finance Development and Service Center, Shanghai University of Finance and Economics, China(上海金融学院人工智能金融发展与服务中心,中国) QuantaAlpha, China(QuantaAlpha,中国) Department of Statistics, Rice University, USA(里士满大学统计学系,美国) Department of Statistics, London School of Economics and Political Science, UK(伦敦政治经济学院统计学系,英国) Qinghai Provincial Key Laboratory of Big Data in Finance and Artificial Intelligence Application Technology, Qinghai Institute of Technology, China(青海省大数据在金融与人工智能应用技术重点实验室,青海技术学院,中国)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 Fin-R1通过强化学习方法,解决金融领域推理问题,具备高精度和可解释性,适用于合规检查和智能投顾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01113 2026-03-20 cs.CL 85%

LLMs Faithfully and Iteratively Compute Answers During CoT: A Systematic Analysis With Multi-step Arithmetics

LLMs忠实且迭代地计算答案期间进行Co-T:多步算术中的系统分析

Keito Kudo, Yoichi Aoki, Tatsuki Kuribayashi, Shusaku Sone, Masaya Taniguchi, Ana Brassard, Keisuke Sakaguchi, Kentaro Inui

机构 * Tohoku University(东北大学) RIKEN(理化学研究所) MBZUAI

专题命中 复杂问题求解 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 研究LLMs在Co-T推理中的内部信息流,发现其在生成推理链时逐步计算子答案,而非预先确定最终答案,从而验证了推理链的忠实性。

详情

展开后加载摘要…

URL PDF HTML 收藏