arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 4988 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 4988 篇

2505.14147 2025-05-27 cs.AI 83%

SHARP: Synthesizing High-quality Aligned Reasoning Problems for Large Reasoning Models Reinforcement Learning

Xiong Jun Wu, Zhenduo Zhang, ZuJie Wen, Zhiqiang Zhang, Wang Ren, Lei Shi, Cai Chen, Deng Zhao, Qing Wang, Xudong Han, Chengfu Tang, Dingnan Jin, Qing Cui, Jun Zhou

机构 * AI Alignment at Ant Group(蚂蚁集团人工智能对齐部) NextEvo Platform at Ant Group(蚂蚁集团平台部)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07787 2025-05-13 cs.CL 83%

Learning from Peers in Reasoning Models

Tongxu Luo, Wenyu Du, Jiaxi Bi, Stephen Chung, Zhengyang Tang, Hao Yang, Min Zhang, Benyou Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) DualityRL USTB(中国矿业大学) Huawei(华为)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL

Comments 29 pages, 32 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23496 2025-03-04 cs.CL 83%

Smaller Large Language Models Can Do Moral Self-Correction

Guangliang Liu, Zhiyu Xue, Xitong Zhang, Rongrong Wang, Kristen Marie Johnson

专题命中 复杂问题求解 :self-correction(title,abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20145 2025-02-11 cs.CL 83%

Efficient Multi-Agent Collaboration with Tool Use for Online Planning in Complex Table Question Answering

Wei Zhou, Mohsen Mesgar, Annemarie Friedrich, Heike Adel

专题命中 复杂问题求解 :planning(title,abstract);reasoning(abstract);分类 cs.CL

Comments Accepted at NAACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04780 2025-02-10 cs.AI 83%

SiriuS: Self-improving Multi-agent Systems via Bootstrapped Reasoning

Wanjia Zhao, Mert Yuksekgonul, Shirley Wu, James Zou

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13599 2025-01-17 q-fin.ST cs.AI 83%

Can ChatGPT Overcome Behavioral Biases in the Financial Sector? Classify-and-Rethink: Multi-Step Zero-Shot Reasoning in the Gold Investment

Shuoling Liu, Gaoguo Jia, Yuhang Jiang, Liyuan Chen, Qiang Yang

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17218 2025-01-09 cs.SE cs.CR cs.LG 83%

To Err is Machine: Vulnerability Detection Challenges LLM Reasoning

Benjamin Steenhoek, Md Mahbubur Rahman, Monoshi Kumar Roy, Mirza Sanjida Alam, Hengbo Tong, Swarna Das, Earl T. Barr, Wei Le

专题命中 复杂问题求解 :reasoning(title,abstract);math reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19000 2024-10-28 cs.LG 83%

Make LLMs better zero-shot reasoners: Structure-orientated autonomous reasoning

Pengfei He, Zitao Li, Yue Xing, Yaling Li, Jiliang Tang, Bolin Ding

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16078 2024-10-08 cs.CL 83%

First Heuristic Then Rational: Dynamic Use of Heuristics in Language Model Reasoning

Yoichi Aoki, Keito Kudo, Tatsuki Kuribayashi, Shusaku Sone, Masaya Taniguchi, Keisuke Sakaguchi, Kentaro Inui

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

Comments This paper is accepted at EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12411 2024-09-20 cs.CL 83%

Textualized Agent-Style Reasoning for Complex Tasks by Multiple Round LLM Generation

Chen Liang, Zhifan Feng, Zihe Liu, Wenbin Jiang, Jinan Xu, Yufeng Chen, Yong Wang

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12117 2024-08-23 cs.CL 83%

The Curious Case of Nonverbal Abstract Reasoning with Multi-Modal Large Language Models

Kian Ahrabian, Zhivar Sourati, Kexuan Sun, Jiarui Zhang, Yifan Jiang, Fred Morstatter, Jay Pujara

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08390 2024-07-02 cs.CL 83%

Predicting Text Preference Via Structured Comparative Reasoning

Jing Nathan Yan, Tianqi Liu, Justin T Chiu, Jiaming Shen, Zhen Qin, Yue Yu, Yao Zhao, Charu Lakshmanan, Yair Kurzion, Alexander M. Rush, Jialu Liu, Michael Bendersky

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00376 2024-07-02 cs.CL 83%

Small Language Models Learn Enhanced Reasoning Skills from Medical Textbooks

Hyunjae Kim, Hyeon Hwang, Jiwoo Lee, Sihyeon Park, Dain Kim, Taewhoo Lee, Chanwoong Yoon, Jiwoong Sohn, Donghee Choi, Jaewoo Kang

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

Comments Added new LLaMA-3-based models and experiments on NEJM case challenges

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08148 2024-04-15 cs.CL 83%

Distilling Algorithmic Reasoning from LLMs via Explaining Solution Programs

Jierui Li, Raymond Mooney

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

Comments pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07702 2024-03-15 cs.CL 83%

Better Zero-Shot Reasoning with Role-Play Prompting

Aobo Kong, Shiwan Zhao, Hao Chen, Qicheng Li, Yong Qin, Ruiqi Sun, Xin Zhou, Enzhi Wang, Xiaohang Dong

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

Comments NAACL 2024, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09387 2024-03-14 cs.RO cs.AI 83%

Multi-Level Compositional Reasoning for Interactive Instruction Following

Suvaansh Bhambri, Byeonghwi Kim, Jonghyun Choi

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.AI

Comments AAAI 2023 (Oral) (Project page: https://bhkim94.github.io/projects/MCR-Agent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06754 2023-11-14 cs.CL 83%

From Complex to Simple: Unraveling the Cognitive Tree for Reasoning with Small Language Models

Junbing Yan, Chengyu Wang, Taolin Zhang, Xiaofeng He, Jun Huang, Wei Zhang

专题命中 复杂问题求解 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

Comments emnlp 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.08913 2023-07-18 cs.CL 83%

Unifying Structure Reasoning and Language Model Pre-training for Complex Reasoning

Siyuan Wang, Zhongyu Wei, Jiarong Xu, Taishan Li, Zhihao Fan

专题命中 复杂问题求解 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

Comments 10 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18898 2023-05-31 cs.RO cs.AI 83%

AlphaBlock: Embodied Finetuning for Vision-Language Reasoning in Robot Manipulation

Chuhao Jin, Wenhui Tan, Jiange Yang, Bei Liu, Ruihua Song, Limin Wang, Jianlong Fu

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.02265 2023-05-08 cs.CL 83%

A Neural Divide-and-Conquer Reasoning Framework for Image Retrieval from Linguistically Complex Text

Yunxin Li, Baotian Hu, Yuxin Ding, Lin Ma, Min Zhang

专题命中 复杂问题求解 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

Comments Accepted to ACL 2023 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09014 2023-03-17 cs.CL 83%

ART: Automatic multi-step reasoning and tool-use for large language models

Bhargavi Paranjape, Scott Lundberg, Sameer Singh, Hannaneh Hajishirzi, Luke Zettlemoyer, Marco Tulio Ribeiro

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.08466 2022-11-17 cs.CL 83%

Reasoning Circuits: Few-shot Multihop Question Generation with Structured Rationales

Saurabh Kulshreshtha, Anna Rumshisky

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17508 2026-02-20 cs.LG cs.AI cs.CL 83%

On the Design of KL-Regularized Policy Gradient Algorithms for LLM Reasoning

关于为LLM推理设计KL正则化策略梯度算法的设计

Yifan Zhang, Yifeng Liu, Huizhuo Yuan, Yang Yuan, Quanquan Gu, Andrew Chi-Chih Yao

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RPG通过统一KL正则化方法和改进的梯度估计,提升LLM推理准确率,实现稳定且可扩展的强化学习算法。

Comments Published in ICLR 2026; Project Page: https://github.com/complex-reasoning/RPG

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.14000 2025-04-18 cs.CL cs.AI cs.LG cs.LO 83%

Multi-Step Deductive Reasoning Over Natural Language: An Empirical Study on Out-of-Distribution Generalisation

Qiming Bao, Alex Yuxuan Peng, Tim Hartill, Neset Tan, Zhenyun Deng, Michael Witbrock, Jiamou Liu

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 10 pages, 3 figures, The 2nd International Joint Conference on Learning & Reasoning and 16th International Workshop on Neural-Symbolic Learning and Reasoning (IJCLR-NeSy 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11562 2024-01-26 cs.AI cs.CL cs.CV cs.LG 83%

A Survey of Reasoning with Foundation Models

Jiankai Sun, Chuanyang Zheng, Enze Xie, Zhengying Liu, Ruihang Chu, Jianing Qiu, Jiaqi Xu, Mingyu Ding, Hongyang Li, Mengzhe Geng, Yue Wu, Wenhai Wang, Junsong Chen, Zhangyue Yin, Xiaozhe Ren, Jie Fu, Junxian He, Wu Yuan, Qi Liu, Xihui Liu, Yu Li, Hao Dong, Yu Cheng, Ming Zhang, Pheng Ann Heng, Jifeng Dai, Ping Luo, Jingdong Wang, Ji-Rong Wen, Xipeng Qiu, Yike Guo, Hui Xiong, Qun Liu, Zhenguo Li

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 20 Figures, 160 Pages, 750+ References, Project Page https://github.com/reasoning-survey/Awesome-Reasoning-Foundation-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02234 2026-07-03 cs.AI cs.LG 新提交 82%

Purified OPSD: On-Policy Self-Distillation Without Losing How to Think

纯化OPSD:在不失去思考能力的情况下进行在线自我蒸馏

Zhanming Shen, Jintao Tong, Shaotian Yan, Chen Shen, Hao Chen, Wentao Ye, Xiaomeng Hu, Rui Miao, Haobo Wang, Junbo Zhao, Gang Chen, Jieping Ye

机构 * Zhejiang University(浙江大学) Tongyi Lab, Alibaba Group(阿里云实验室,阿里巴巴集团) Huazhong University of Science and Technology(华中科技大学) Jilin University(吉林大学)

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 针对在线自我蒸馏(OPSD)在长链思维推理模型中失效的问题,通过分解教师监督信号,发现参考诱导成分导致死记硬背,提出基于点互信息的参考隔离方法,在保持模型认知行为的同时提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07548 2026-06-09 cs.IR cs.AI cs.CL 新提交 82%

Evaluating Advanced Prompting on Gemini Flash for Multi-Hop Biomedical QA

评估 Gemini Flash 上的高级提示工程用于多跳生物医学问答

Ahmed Bajaber, Mohammed Alliheedi

机构 * Saudi Med AI Lab (SMAIL)(沙特医学人工智能实验室(SMAIL)) Prince Sultan University(普森国王大学) Al-Baha University(阿勒巴哈大学)

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过设计多组件提示(角色扮演、多步思维链示例和格式规则),在 Gemini 2.0 Flash 上实现概念级得分0.720,显著优于基线0.565,并接近下一代模型性能,证明高级提示设计对释放LLM推理能力至关重要。

Comments 8 pages, proceedings of the BioCreative IX Challenge and Workshop (BC9) at IJCAI 2025

Journal ref Proc. BioCreative IX Workshop (BC9), IJCAI 2025, Montreal, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13792 2026-04-20 cs.CL cs.AI 82%

Interpretable Traces, Unexpected Outcomes: Investigating the Disconnect in Trace-Based Knowledge Distillation

可解释的轨迹,意外的结果:探讨基于轨迹的知识蒸馏中的断层

Siddhant Bhambri, Upasana Biswas, Subbarao Kambhampati

机构 * School of Computing & AI, Arizona State University(计算与人工智能学院,亚利桑那州立大学)

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文通过规则问题分解设计实验,探讨基于轨迹的知识蒸馏中轨迹语义正确性与可解释性之间的断层,发现轨迹正确性并不能保证最终答案正确,且可解释的分解轨迹在准确性上不具优势。

Comments Accepted at The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14214 2026-04-17 cs.CL cs.AI 82%

CROP: Token-Efficient Reasoning in Large Language Models via Regularized Prompt Optimization

CROP:通过正则化提示优化实现大语言模型的token高效推理

Deep Shah, Sanket Badhe, Nehal Kathrotia, Priyanka Tiwari

机构 * Google LLC(谷歌公司) Purdue University(普渡大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI;logical reasoning(comments)

AI总结 CROP通过正则化提示优化,在保持准确性的同时显著降低token消耗,适用于复杂推理任务。

Comments Accepted at ICLR 2026 Workshop on Logical Reasoning of Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12651 2026-04-15 cs.CL cs.AI 82%

Learning Chain Of Thoughts Prompts for Predicting Entities, Relations, and even Literals on Knowledge Graphs

学习链式思维提示以预测知识图谱中的实体、关系以及甚至字面量

Alkid Baci, Luke Friedrichs, Caglar Demir, N'Dah Jean Kouagou, Axel-Cyrille Ngonga Ngomo

机构 * Department of Computer Science(计算机科学系)

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RALP方法,通过学习基于字符串的链式思维提示作为评分函数,提升知识图谱链接预测的性能,实验表明其在多个基准测试中均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏