arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 4988 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 4988 篇

2506.23888 2025-12-04 cs.CL cs.LG 84%

Advancing Multi-Step Mathematical Reasoning in Large Language Models through Multi-Layered Self-Reflection with Auto-Prompting

通过多层自反思与自动提示推进大语言模型的多步数学推理

André de Souza Loureiro, Jorge Valverde-Rebaza, Julieta Noguez, David Escarcega, Ricardo Marcacini

机构 * Luiz de Queiroz College of Agriculture University of São Paulo(圣保罗大学农业学院) School of Engineering and Sciences Tecnologico de Monterrey(蒙特雷技术学院工程与科学学院) Institute of Mathematics and Computer Sciences University of São Paulo(圣保罗大学数学与计算机科学研究所)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.LG

AI总结 本文提出MAPS框架,通过多层自反思与自动提示提升大语言模型的多步数学推理能力,实验证明其在多个基准测试中优于标准CoT并接近优化模型。

Comments Accepted for publication in: European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML PKDD 2025). Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02389 2025-12-03 cs.AI cs.LG 84%

Synthetic Error Injection Fails to Elicit Self-Correction In Language Models

合成错误注入无法在语言模型中引发自我修正

David X. Wu, Shreyas Kapur, Anant Sahai, Stuart Russell

机构 * ucb(伯克利大学)

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究发现合成错误注入无法有效提升语言模型的自我修正能力,揭示了策略性强化学习在激发自我修正方面的独特优势。

Comments 13 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04902 2025-11-10 cs.LG cs.AI 84%

You Need Reasoning to Learn Reasoning: The Limitations of Label-Free RL in Weak Base Models

Shuvendu Roy, Hossein Hajimirsadeghi, Mengyao Zhai, Golnoosh Samei

机构 * Sea AI Lab(海思人工智能实验室) National University of Singapore(新加坡国立大学) Singapore Management University(新加坡管理学院)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: MATH-AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07382 2025-10-30 cs.AI cs.LG 84%

Pentest-R1: Towards Autonomous Penetration Testing Reasoning Optimized via Two-Stage Reinforcement Learning

He Kong, Die Hu, Jingguo Ge, Liangxiong Li, Hui Li, Tong Li

机构 * State Key Laboratory of Cyberspace Security Defense, Institute of Information Engineering, Chinese Academy of Sciences(中国科学院网络空间安全防御重点实验室,信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络与安全学院)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18254 2025-10-24 cs.AI cs.LG 84%

Illusions of reflection: open-ended task reveals systematic failures in Large Language Models' reflective reasoning

Sion Weatherhead, Flora Salim, Aaron Belbasis

机构 * University of New South Wales Sydney(新南威尔士大学悉尼分校) Aurecon Group(Aurecon集团)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.AI、cs.LG

Comments Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17244 2025-10-16 cs.CL cs.AI 84%

ReasoningShield: Safety Detection over Reasoning Traces of Large Reasoning Models

Changyi Li, Jiayi Wang, Xudong Pan, Geng Hong, Min Yang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09633 2025-10-14 cs.CR cs.AI cs.LG cs.PL 84%

Hound: Relation-First Knowledge Graphs for Complex-System Reasoning in Security Audits

Bernhard Mueller

机构 * Bernhard Mueller(伯纳德·穆勒)

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03918 2025-09-29 cs.CL cs.AI 84%

Chain or tree? Re-evaluating complex reasoning from the perspective of a matrix of thought

Fengxiao Tang, Yufeng Li, Zongzong Wu, Ming Zhao

机构 * School of Computer,Science and Engineering(计算机科学与工程学院)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03871 2025-09-05 cs.CL cs.AI cs.CR 84%

A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models

Yanbo Wang, Yongcan Yu, Jian Liang, Ran He

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(神经语言处理与机器智能中心,中国科学院自动化研究所)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments 38 pages. This survey considers papers published up to June 30, 2025. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02350 2025-09-03 cs.CL cs.AI 84%

Implicit Reasoning in Large Language Models: A Comprehensive Survey

Jindong Li, Yali Fu, Li Fan, Jiahong Liu, Yao Shu, Chengwei Qin, Menglin Yang, Irwin King, Rex Ying

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Jilin University(吉林大学) The Chinese University of Hong Kong(香港中文大学) Yale University(耶鲁大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15861 2025-08-25 cs.CL cs.LG 84%

XFinBench: Benchmarking LLMs in Complex Financial Problem Solving and Reasoning

Zhihan Zhang, Yixin Cao, Lizi Liao

机构 * School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡管理大学) Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究院,复旦大学)

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01539 2025-08-22 cs.CL cs.AI 84%

Pragmatic Inference Chain (PIC) Improving LLMs' Reasoning of Authentic Implicit Toxic Language

Xi Chen, Shuo Wang

机构 * Nanyang Technological University(南洋理工大学) University of Macau(澳门大学)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments 14 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01969 2025-08-05 cs.LG cs.AI 84%

Accelerating LLM Reasoning via Early Rejection with Partial Reward Modeling

Seyyed Saeid Cheshmi, Azal Ahmad Khan, Xinran Wang, Zirui Liu, Ali Anwar

机构 * University of Minnesota(明尼苏达大学)

专题命中 复杂问题求解 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22844 2025-07-31 cs.LG cs.AI 84%

RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents

Zijing Zhang, Ziyang Chen, Mingxiao Li, Zhaopeng Tu, Xiaolong Li

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18183 2025-07-21 cs.AI cs.CL 84%

Reasoning about Uncertainty: Do Reasoning Models Know When They Don't Know?

Zhiting Mei, Christina Zhang, Tenny Yin, Justin Lidard, Ola Shorinwa, Anirudha Majumdar

机构 * Princeton University(普林斯顿大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10548 2025-07-15 cs.CV cs.AI cs.CL 84%

EmbRACE-3K: Embodied Reasoning and Action in Complex Environments

Mingxian Lin, Wei Huang, Yitang Li, Chengjie Jiang, Kui Wu, Fangwei Zhong, Shengju Qian, Xin Wang, Xiaojuan Qi

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

Comments Project page: https://mxllc.github.io/EmbRACE-3K/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07495 2025-07-11 cs.CL cs.AI 84%

PLAN-TUNING: Post-Training Language Models to Learn Step-by-Step Planning for Complex Problem Solving

Mihir Parmar, Palash Goyal, Xin Liu, Yiwen Song, Mingyang Ling, Chitta Baral, Hamid Palangi, Tomas Pfister

专题命中 复杂问题求解 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

Comments 15 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23840 2025-07-01 cs.CL cs.AI 84%

Do Thinking Tokens Help or Trap? Towards More Efficient Large Reasoning Model

Bowen Ding, Yuhan Chen, Futing Wang, Lingfeng Ming, Tao Lin

机构 * Zhejiang University(浙江大学) Boston University(波士顿大学) ByteDance(字节跳动) School of Engineering, Westlake University(西溪大学工程学院) Research Center for Industries of the Future, Westlake University(西溪大学未来产业研究中心)

专题命中 复杂问题求解 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10647 2025-06-17 cs.LG cs.AI 84%

Data Shifts Hurt CoT: A Theoretical Study

Lang Yin, Debangshu Banerjee, Gagandeep Singh

机构 * Department of Computer Science University of Illinois Urbana-Champaign(计算机科学系伊利诺伊大学厄巴纳-香槟分校)

专题命中 复杂问题求解 :CoT(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

Comments Comparison to v1: upgraded the quality of a figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08399 2025-06-12 cs.AI cs.LG 84%

SafeCoT: Improving VLM Safety with Minimal Reasoning

Jiachen Ma, Zhanhui Zhou, Chao Yang, Chaochao Lu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 复杂问题求解 :reasoning(title);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03939 2025-06-05 cs.AI cs.CL 84%

Graph Counselor: Adaptive Graph Exploration via Multi-Agent Synergy to Enhance LLM Reasoning

Junqi Gao, Xiang Zou, YIng Ai, Dong Li, Yichen Niu, Biqing Qi, Jianxing Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Mathematics, Harbin Institute of Technology(哈尔滨工业大学数学学院) Department of Control Science and Engineering, Harbin Institute of Technology(哈尔滨工业大学控制科学与工程学院)

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00483 2025-06-03 cs.CL cs.LG 84%

Auto-Patching: Enhancing Multi-Hop Reasoning in Language Models

Aviv Jan, Dean Tahory, Omer Talmi, Omar Abo Mokh

机构 * Tel Aviv University(特拉维夫大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15558 2025-05-20 cs.AI cs.CV cs.LG cs.RO 84%

Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning

NVIDIA, :, Alisson Azzolini, Junjie Bai, Hannah Brandon, Jiaxin Cao, Prithvijit Chattopadhyay, Huayu Chen, Jinju Chu, Yin Cui, Jenna Diamond, Yifan Ding, Liang Feng, Francesco Ferroni, Rama Govindaraju, Jinwei Gu, Siddharth Gururani, Imad El Hanafi, Zekun Hao, Jacob Huffman, Jingyi Jin, Brendan Johnson, Rizwan Khan, George Kurian, Elena Lantz, Nayeon Lee, Zhaoshuo Li, Xuan Li, Maosheng Liao, Tsung-Yi Lin, Yen-Chen Lin, Ming-Yu Liu, Xiangyu Lu, Alice Luo, Andrew Mathau, Yun Ni, Lindsey Pavao, Wei Ping, David W. Romero, Misha Smelyanskiy, Shuran Song, Lyne Tchapmi, Andrew Z. Wang, Boxin Wang, Haoxiang Wang, Fangyin Wei, Jiashu Xu, Yao Xu, Dinghao Yang, Xiaodong Yang, Zhuolin Yang, Jingxu Zhang, Xiaohui Zeng, Zhe Zhang

机构 * NVIDIA

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04955 2025-05-09 cs.CL cs.AI 84%

Chain-of-Thought Tokens are Computer Program Variables

Fangwei Zhu, Peiyi Wang, Zhifang Sui

机构 * School of Computer Science, State Key Laboratory of Multimedia Information Processing, Peking University(计算机科学学院、多媒体信息处理国家重点实验室、北京大学)

专题命中 复杂问题求解 :chain-of-thought(title);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02576 2025-05-06 cs.AI cs.LG 84%

Recursive Decomposition with Dependencies for Generic Divide-and-Conquer Reasoning

Sergio Hernández-Gutiérrez, Minttu Alakuijala, Alexander V. Nikitin, Pekka Marttinen

机构 * Department of Computer Science Aalto University(计算机科学系 阿尔托大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21318 2025-05-01 cs.AI cs.CL 84%

Phi-4-reasoning Technical Report

Marah Abdin, Sahaj Agarwal, Ahmed Awadallah, Vidhisha Balachandran, Harkirat Behl, Lingjiao Chen, Gustavo de Rosa, Suriya Gunasekar, Mojan Javaheripi, Neel Joshi, Piero Kauffmann, Yash Lara, Caio César Teodoro Mendes, Arindam Mitra, Besmira Nushi, Dimitris Papailiopoulos, Olli Saarikivi, Shital Shah, Vaishnavi Shrivastava, Vibhav Vineet, Yue Wu, Safoora Yousefi, Guoqing Zheng

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09777 2025-04-15 cs.LG cs.AI 84%

Reasoning without Regret

Tarun Chitra

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08813 2025-04-15 cs.LG cs.AI cs.CR 84%

SafeMLRM: Demystifying Safety in Multi-modal Large Reasoning Models

Junfeng Fang, Yukai Wang, Ruipeng Wang, Zijun Yao, Kun Wang, An Zhang, Xiang Wang, Tat-Seng Chua

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04578 2025-04-08 cs.AI cs.LG cs.RO 84%

Hierarchical Planning for Complex Tasks with Knowledge Graph-RAG and Symbolic Verification

Cristina Cornelio, Flavio Petruzzellis, Pietro Lio

专题命中 复杂问题求解 :planning(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01141 2025-04-02 cs.CL cs.AI 84%

How Well do LLMs Compress Their Own Chain-of-Thought? A Token Complexity Approach

Ayeong Lee, Ethan Che, Tianyi Peng

专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏