arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 4978 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 4978 篇

2408.14511 2024-08-29 cs.AI cs.CL cs.LG math.ST stat.ML stat.TH 87%

Unveiling the Statistical Foundations of Chain-of-Thought Prompting Methods

Xinyang Hu, Fengzhuo Zhang, Siyu Chen, Zhuoran Yang

专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 150 pages, 18 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09101 2024-08-20 cs.CL cs.AI cs.IR cs.LG 87%

Towards A Unified View of Answer Calibration for Multi-Step Reasoning

Shumin Deng, Ningyu Zhang, Nay Oo, Bryan Hooi

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by NLRSE@ACL2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09762 2024-06-25 cs.CL cs.AI cs.LG 87%

Graph Elicitation for Guiding Multi-Step Reasoning in Large Language Models

Jinyoung Park, Ameen Patel, Omar Zia Khan, Hyunwoo J. Kim, Joo-Kyung Kim

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03268 2024-06-24 cs.LG cs.AI cs.CL 87%

Understanding Reasoning Ability of Language Models From the Perspective of Reasoning Paths Aggregation

Xinyi Wang, Alfonso Amayuelas, Kexun Zhang, Liangming Pan, Wenhu Chen, William Yang Wang

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18869 2023-11-09 cs.LG cs.AI cs.CL 87%

Dissecting Chain-of-Thought: Compositionality through In-Context Filtering and Learning

Yingcong Li, Kartik Sreenivasan, Angeliki Giannou, Dimitris Papailiopoulos, Samet Oymak

专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted for NeurIPS 2023. Changes in this version: refined title, restructured content, included new out-of-distribution experiments, and code now available

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.11768 2023-07-26 cs.CL cs.AI cs.LG 87%

Question Decomposition Improves the Faithfulness of Model-Generated Reasoning

Ansh Radhakrishnan, Karina Nguyen, Anna Chen, Carol Chen, Carson Denison, Danny Hernandez, Esin Durmus, Evan Hubinger, Jackson Kernion, Kamilė Lukošiūtė, Newton Cheng, Nicholas Joseph, Nicholas Schiefer, Oliver Rausch, Sam McCandlish, Sheer El Showk, Tamera Lanham, Tim Maxwell, Venkatesa Chandrasekaran, Zac Hatfield-Dodds, Jared Kaplan, Jan Brauner, Samuel R. Bowman, Ethan Perez

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments For few-shot examples and prompts, see https://github.com/anthropics/DecompositionFaithfulnessPaper

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.10071 2023-06-14 cs.CL cs.AI cs.LG 87%

Large Language Models Are Reasoning Teachers

Namgyu Ho, Laura Schmid, Se-Young Yun

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2023 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00550 2023-06-02 cs.LG cs.AI cs.CL 87%

Chain-Of-Thought Prompting Under Streaming Batch: A Case Study

Yuxin Tang

专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.12726 2023-01-31 cs.CL cs.AI cs.LG 87%

Specializing Smaller Language Models towards Multi-Step Reasoning

Yao Fu, Hao Peng, Litu Ou, Ashish Sabharwal, Tushar Khot

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20833 2026-07-30 cs.CL 版本更新 86%

REFACT: Adaptive Fact Restatement for Compact and Faithful Chain-of-Thought Reasoning

REFACT:用于紧凑且忠实的思维链推理的自适应事实重述

Zhensheng Jin, Xin Dai, Zhenghao Liu, Chaojun Xiao, Huiyuan Xie, Yu Gu, Ge Yu, Maosong Sun

机构 * Northeastern University(东北大学) Tsinghua University(清华大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title);分类 cs.CL

AI总结 研究复杂任务中语言模型推理轨迹易偏离上下文的问题,提出REFACT自适应事实重述框架,经两阶段优化,实验证明其能提升长上下文问答等能力,减少令牌消耗,保留更多证据使推理轨迹更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10245 2026-07-14 cs.CL cs.IR 新提交 86%

PTEI: Integrating Personality Traits to Enhance Emotional Intelligence in Large Language Models

PTEI:在大语言模型中整合人格特质以提高情商

Amir Reza Jafari, Praboda Rajapaksha, Reza Farahbakhsh, Noel Crespi

机构 * Telecom SudParis, Institut Polytechnique de Paris(巴黎电信学院,巴黎综合理工学院) Aberystwyth University(阿伯里斯特威斯大学)

专题命中 复杂问题求解 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 研究针对大语言模型在复杂情感推理中不如人类的问题,提出PTEI框架,通过提取人格特质并用于人格感知提示引导模型推理,结合对比学习优化检索系统,经实验验证其能增强模型情感理解能力,与CoT推理结合可进一步提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07436 2026-05-12 cs.CV cs.AI cs.ET 86%

Prompt to Protection: A Comparative Study of Multimodal LLMs in Construction Hazard Recognition

提示到保护:多模态大语言模型在建筑危险识别中的比较研究

Nishi Chaudhary, S M Jamil Uddin, Sathvik Sharath Chandra, Anto Ovid, Alex Albert

机构 * Department of Construction Management, Colorado State University(科罗拉多州立大学建设管理系) Department of Civil, Construction, and Environmental Engineering, North Carolina State University(北卡罗来纳州立大学土木、建设与环境工程系)

专题命中 复杂问题求解 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文比较了五种先进多模态大语言模型在建筑危险识别中的表现,发现提示策略显著影响性能,CoT提示效果最佳,GPT-4.5和GPT-o3表现突出,强调了提示设计在提升建筑安全应用准确性中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08282 2026-01-14 cs.CL 86%

D$^2$Plan: Dual-Agent Dynamic Global Planning for Complex Retrieval-Augmented Reasoning

D$^2$Plan: 双智能体动态全局规划用于复杂检索增强推理

Kangcheng Luo, Tinglang Wu, Yansong Feng

机构 * Peking University(北京大学)

专题命中 复杂问题求解 :reasoning(title,abstract);planning(title);分类 cs.CL

AI总结 D$^2$Plan通过双智能体协作提升复杂检索增强推理的连贯性和抗干扰能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09544 2025-10-13 cs.CL 86%

Beyond Surface Reasoning: Unveiling the True Long Chain-of-Thought Capacity of Diffusion Large Language Models

Qiguang Chen, Hanjing Li, Libo Qin, Dengyun Peng, Jinhao Liu, Jiangyi Wang, Chengyue Wu, Xie Chen, Yantao Du, Wanxiang Che

机构 * LARG, Research Center for Social Computing and Interactive Robotics, Harbin Institute of Technology(LARG,社会计算与交互机器人研究中心,哈尔滨工业大学) School of Computer Science and Engineering, Central South University(计算机科学与工程学院,中南大学) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) ByteDance Seed (China)(字节跳动种子(中国))

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09970 2025-05-20 cs.AI 86%

Pre-Act: Multi-Step Planning and Reasoning Improves Acting in LLM Agents

Mrinal Rawat, Ambuje Gupta, Rushil Goomer, Alessandro Di Bari, Neha Gupta, Roberto Pieraccini

机构 * Uniphore

专题命中 复杂问题求解 :reasoning(title,abstract);planning(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07140 2025-03-11 cs.CL 86%

Application of Multiple Chain-of-Thought in Contrastive Reasoning for Implicit Sentiment Analysis

Liwei Yang, Xinying Wang, Xiaotang Zhou, Zhengchao Wu, Ningning Tan

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02833 2026-08-05 cs.CV cs.AI cs.CL 新提交 86%

CURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning

CURV:通过课程可视化接地推理增强图表理解

Xuehang Guo, Pingyue Zhang, Ruiyi Zhang, Zhenhailong Wang, Hanrui Lyu, Heng Ji, Tong Sun, Qingyun Wang, Manling Li

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型视觉接地与推理不足的问题,提出CURV课程学习框架,结合CCQA数据集,在图表问答任务中实现显著性能提升并具备良好泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05737 2026-05-08 cs.AI cs.CL 86%

ReFlect: An Effective Harness System for Complex Long-Horizon LLM Reasoning

ReFlect:一种有效的复杂长周期LLM推理Harness系统

Fan Huang

机构 * Indiana University Bloomington(印第安纳大学布卢明顿)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 ReFlect通过创建确定性封装逻辑,有效检测和恢复LLM推理中的错误,提升多阶段任务的成功率,尤其在SWE-bench中显著提高代码补全质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11716 2026-04-14 cs.AI cs.CL 86%

SWE-AGILE: A Software Agent Framework for Efficiently Managing Dynamic Reasoning Context

SWE-AGILE:一种用于高效管理动态推理上下文的软件代理框架

Shuquan Lian, Juncheng Liu, Yazhe Chen, Yuhong Chen, Hui Li

机构 * Microsoft(微软)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 SWE-AGILE通过动态推理上下文策略平衡推理深度与效率,实现高效多轮软件工程任务处理,实验证明其在SWE-Bench-Verified上优于7B-8B模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17024 2026-03-20 cs.CV cs.AI cs.CL 86%

HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning

HopChain: 多跳数据合成用于通用视觉语言推理

Shenzhi Wang, Shixuan Liu, Jing Zhou, Chang Gao, Xiong-Hui Chen, Binghai Wang, An Yang, Shiji Song, Bowen Yu, Gao Huang, Junyang Lin

机构 * Qwen Team, Alibaba Inc.(通义实验室,阿里巴巴公司) LeapLab, Tsinghua University(清华大学跃迁实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出HopChain框架,通过多跳视觉语言推理数据合成提升VLMs的通用推理能力,实验表明其在多个基准测试中显著提升性能。

Comments 28 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14251 2026-03-17 cs.CL cs.AI 86%

Mitigating Overthinking in Large Reasoning Language Models via Reasoning Path Deviation Monitoring

通过推理路径偏差监控缓解大型推理语言模型中的过度思考

Weixin Guan, Liang Li, Jiapeng Liu, Bing Li, Peng Fu, Chengyang Fang, Xiaoshuai Hao, Can Ma, Weiping Wang

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种与原生推理过程紧密耦合的早退方法,利用路径偏差指数监测高熵转移标记,动态检测并终止过度思考轨迹,提升推理效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10000 2026-03-13 cs.CL cs.LG 86%

Beyond the Prompt in Large Language Models: Comprehension, In-Context Learning, and Chain-of-Thought

大型语言模型中的提示之外:理解、上下文学习与推理链

Yuling Jiao, Yanming Lai, Huazhen Lin, Wensen Ma, Houduo Qi, Defeng Sun

专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.LG

AI总结 本研究探讨了大型语言模型在提示之外的理解、上下文学习和推理链机制,揭示了模型通过自回归过程推断转移概率、减少提示歧义以及分解复杂问题的能力,为高级提示工程提供了理论支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24156 2026-03-03 cs.AI cs.CL 86%

Reasoning or Retrieval? A Study of Answer Attribution on Large Reasoning Models

推理还是检索?对大推理模型答案归因的研究

Yuhui Wang, Changjiang Li, Guangke Chen, Jiacheng Liang, Ting Wang

机构 * Stony Brook University(石溪大学) Palo Alto Networks(帕洛阿尔托网络) Wuhan University(武汉大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了大型推理模型在推理与检索机制之间的冲突,提出FARL框架通过抑制检索捷径提升推理能力。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24393 2026-03-03 cs.AI cs.CL 86%

Towards Safe Reasoning in Large Reasoning Models via Corrective Intervention

通过纠正干预实现大推理模型的安全推理

Yichi Zhang, Yue Ding, Jingwen Yang, Tianwei Luo, Dongbai Li, Ranjie Duan, Qiang Liu, Hang Su, Yinpeng Dong, Jun Zhu

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海启智机构) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) RealAI

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出IPO方法,通过干预优化提升大推理模型的安全性,显著降低有害性并保持性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01034 2026-02-03 cs.AI cs.CL 86%

Discovering Process-Outcome Credit in Multi-Step LLM Reasoning

在多步骤LLM推理中发现过程-结果信用

Xiangwei Wang, Wei Wang, Ken Chen, Nanduni Nimalsiri, Saman Halgamuge

机构 * The University of Melbourne(墨尔本大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种新的框架,通过分步边际信息增益机制和解耦掩码策略,提升多步骤LLM推理的样本效率和准确性,并增强模型的分布外鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04472 2026-01-13 cs.LG cs.AI 86%

DAST: Difficulty-Adaptive Slow-Thinking for Large Reasoning Models

DAST: 为大推理模型引入难度自适应的慢思考

Yi Shen, Jian Zhang, Jieyun Huang, Shuming Shi, Wenjing Zhang, Jiangze Yan, Ning Wang, Kai Wang, Zhaoxiang Liu, Shiguo Lian

机构 * Unicom Data Intelligence(中国unicom数据智能) Data Science & Artificial Intelligence Research Institute(数据科学与人工智能研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 DAST通过自适应调整推理步骤长度,有效减少大模型的过度思考问题,同时保持复杂任务的推理准确性。

Comments EMNLP 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22662 2026-01-09 cs.CL cs.LG 86%

AutoL2S: Auto Long-Short Reasoning for Efficient Large Language Models

AutoL2S: 自动长短期推理用于高效大语言模型

Feng Luo, Yu-Neng Chuang, Guanchu Wang, Hoang Anh Duy Le, Shaochen Zhong, Hongyi Liu, Jiayi Yuan, Yang Sui, Vladimir Braverman, Vipin Chaudhary, Xia Hu

机构 * Rice University(里士大学) University of North Carolina at Charlotte(北卡罗来纳州立大学) John Hopkins University(约翰·霍普金斯大学) Case Western Reserve University(凯斯西储大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG

AI总结 AutoL2S通过动态调整推理长度,提升大语言模型的推理效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03506 2026-01-08 cs.CL cs.AI 86%

Reasoning Pattern Alignment Merging for Adaptive Reasoning

适应性推理的推理模式对齐融合

Zhaofeng Zhong, Wei Yuan, Tong Chen, Xiangyu Zhao, Quoc Viet Hung Nguyen, Hongzhi Yin

机构 * The University of Queensland(昆士兰大学) City University of Hong Kong(香港城市大学) Griffith University(格里菲斯大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RPAM,通过融合长链式思考和短链式提示模型,实现高效的查询自适应推理,减少推理成本并保持高性能。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26226 2025-12-25 cs.LG cs.CL 86%

Thinking-Free Policy Initialization Makes Distilled Reasoning Models More Effective and Efficient Reasoners

无需思考的策略初始化使蒸馏推理模型更有效和高效

Xin Xu, Cliveb AI, Kai Yang, Tianhao Chen, Yang Wang, Saiyong Yang, Can Yang

机构 * LLM Department, Tencent(腾讯大语言模型部门) The Hong Kong University of Science and Technology(香港科技大学) The University of Hong Kong(香港大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG

AI总结 TFPI通过简化RLVR训练流程,提高了推理模型的效率和性能,实现了更高效的模型训练和更高的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19206 2025-12-23 cs.LG cs.AI 86%

MixKVQ: Query-Aware Mixed-Precision KV Cache Quantization for Long-Context Reasoning

MixKVQ: 为长上下文推理的查询感知混合精度KV缓存量化

Tao Zhang, Ziqian Zeng, Hao Peng, Huiping Zhuang, Cen Chen

机构 * South China University of Technology(南方科技大学) Beihang University(北航) Pazhou Laboratory(琶洲实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 MixKVQ通过查询感知的混合精度量化策略,提升长上下文推理性能并降低内存开销。

详情

展开后加载摘要…

URL PDF HTML 收藏