arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10379 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10379 篇

2508.15754 2025-08-22 cs.CL cs.AI 86%

Dissecting Tool-Integrated Reasoning: An Empirical Study and Analysis

Yufeng Zhao, Junnan Liu, Hongwei Liu, Dongsheng Zhu, Yuan Shen, Songyang Zhang, Kai Chen

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Preprint, working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03737 2025-08-07 cs.CL cs.AI 86%

GanitBench: A bi-lingual benchmark for evaluating mathematical reasoning in Vision Language Models

Ashutosh Bandooni, Brindha Subburaj

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments 6 pages, 3 figures. Accepted, Presented and Published as part of Proceedings of the 6th International Conference on Recent Advantages in Information Technology (RAIT) 2025

Journal ref 2025 6th International Conference on Recent Advances in Information Technology (RAIT), Dhanbad, India, 2025, pp. 1-6

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17476 2025-07-24 cs.CL cs.AI 86%

MultiNRC: A Challenging and Native Multilingual Reasoning Evaluation Benchmark for LLMs

Alexander R. Fabbri, Diego Mares, Jorge Flores, Meher Mankikar, Ernesto Hernandez, Dean Lee, Bing Liu, Chen Xing

机构 * Scale AI

专题命中 推理评测 :reasoning(title,abstract);math reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16206 2025-07-23 cs.LG cs.AI 86%

METER: Multi-modal Evidence-based Thinking and Explainable Reasoning -- Algorithm and Benchmark

Xu Yang, Qi Zhang, Shuming Jiang, Yaowen Xu, Zhaofan Zou, Hao Sun, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(电信人工智能研究院) Institute of Artificial Intelligence and Robotics(IAIR), Xi’an Jiaotong University(人工智能与机器人研究院) Advanced Technique of Artificial Intelligence(ATAI), Chongqing University of Technology(人工智能先进技术研究院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

Comments 9 pages,3 figures ICCV format

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09876 2025-07-15 cs.CV cs.AI cs.CL 86%

ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Language Models

Yongheng Zhang, Xu Liu, Ruihan Tao, Qiguang Chen, Hao Fei, Wanxiang Che, Libo Qin

机构 * School of Computer Science and Engineering, Central South University(计算机科学与工程学院,中南大学) Research Center for SCIR, Harbin Institute of Technology(SCIR研究中心,哈尔滨工业大学) NExT Research Center, National University of Singapore(NExT研究中心,新加坡国立大学)

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02145 2025-07-04 cs.CL cs.AI 86%

Reasoning or Not? A Comprehensive Evaluation of Reasoning LLMs for Dialogue Summarization

Keyan Jin, Yapeng Wang, Leonel Santos, Tao Fang, Xu Yang, Sio Kei Im, Hugo Gonçalo Oliveira

机构 * Faculty of Applied Sciences, Macao Polytechnic University(澳门理工大学应用科学学院) Computer Science and Communication Research Center, School of Technology and Management, Polytechnic of Leiria(莱里亚理工学院技术与管理学院计算机科学与通信研究中心) Institute of International Language Services Studies, Macau Millennium College(澳门 millennium 学院国际语言服务研究学院) CISUC, Department of Informatics Engineering, University of Coimbra(科英布拉大学信息工程系 CISUC)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21523 2025-06-23 cs.CL cs.AI cs.CV 86%

More Thinking, Less Seeing? Assessing Amplified Hallucination in Multimodal Reasoning Models

Chengzhi Liu, Zhongxing Xu, Qingyue Wei, Juncheng Wu, James Zou, Xin Eric Wang, Yuyin Zhou, Sheng Liu

机构 * UC Santa Cruz(加州大学圣克ruz分校) Stanford University(斯坦福大学) UC Santa Barbara(加州大学圣芭芭拉分校)

专题命中 推理评测 :reasoning(title,abstract);math reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16033 2025-06-12 cs.CL cs.AI 86%

Multimodal Inconsistency Reasoning (MMIR): A New Benchmark for Multimodal Reasoning Models

Qianqi Yan, Yue Fan, Hongquan Li, Shan Jiang, Yang Zhao, Xinze Guan, Ching-Chen Kuo, Xin Eric Wang

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) eBay(eBay公司)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07463 2025-06-10 cs.CL cs.AI 86%

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models

Guang Liu, Liangdong Wang, Jijie Li, Yang Yu, Yao Xu, Jiabei Chen, Yu Bai, Feng Liao, Yonghua Lin

机构 * Data Research Team(数据研究团队) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04574 2025-06-06 cs.CL cs.AI 86%

Reasoning or Overthinking: Evaluating Large Language Models on Financial Sentiment Analysis

Dimitris Vamvourellis, Dhagash Mehta

机构 * BlackRock, Inc.(黑石公司)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02096 2025-06-04 cs.LG cs.CL cs.CV 86%

SynthRL: Scaling Visual Reasoning with Verifiable Data Synthesis

Zijian Wu, Jinjie Ni, Xiangyan Liu, Zichen Liu, Hang Yan, Michael Qizhe Shieh

机构 * National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(title,abstract);math reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23646 2025-05-30 cs.CL cs.LG 86%

Are Reasoning Models More Prone to Hallucination?

Zijun Yao, Yantao Liu, Yanxu Chen, Jianhui Chen, Junfeng Fang, Lei Hou, Juanzi Li, Tat-Seng Chua

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20664 2025-05-28 cs.CL cs.AI 86%

Self-Route: Automatic Mode Switching via Capability Estimation for Efficient Reasoning

Yang He, Xiao Ding, Bibo Cai, Yufei Zhang, Kai Xiong, Zhouhao Sun, Bing Qin, Ting Liu

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17952 2025-05-26 cs.CL cs.AI 86%

Beyond Distillation: Pushing the Limits of Medical LLM Reasoning with Minimalist Rule-Based RL

Che Liu, Haozhe Wang, Jiazhen Pan, Zhongwei Wan, Yong Dai, Fangzhen Lin, Wenjia Bai, Daniel Rueckert, Rossella Arcucci

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17119 2025-05-26 cs.CL cs.LG 86%

Systematic Evaluation of Machine-Generated Reasoning and PHQ-9 Labeling for Depression Detection Using Large Language Models

Zongru Shao, Xin Wang, Zhanyang Liu, Chenhan Wang, K. P. Subbalakshmi

机构 * Silicon Austria Labs(硅 Austria 实验室) Jiangnan University(江南大学) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.CL、cs.LG

Comments 8 pages without references

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05345 2024-11-11 cs.CL cs.AI 86%

Reasoning Robustness of LLMs to Adversarial Typographical Errors

Esther Gan, Yiran Zhao, Liying Cheng, Yancan Mao, Anirudh Goyal, Kenji Kawaguchi, Min-Yen Kan, Michael Shieh

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01805 2024-08-30 cs.CL cs.AI 86%

Can LLMs perform structured graph reasoning?

Palaash Agrawal, Shavak Vasania, Cheston Tan

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments International Conference on Pattern Recognition (ICPR), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11599 2024-08-22 cs.CL cs.AI 86%

Cause-Aware Empathetic Response Generation via Chain-of-Thought Fine-Tuning

Xinhao Chen, Chong Yang, Man Lan, Li Cai, Yang Chen, Tu Hu, Xinlin Zhuang, Aimin Zhou

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07399 2024-05-13 cs.CL cs.AI 86%

Large Language Models are Clinical Reasoners: Reasoning-Aware Diagnosis Framework with Prompt-Generated Rationales

Taeyoon Kwon, Kai Tzu-iunn Ong, Dongjin Kang, Seungjun Moon, Jeong Ryong Lee, Dosik Hwang, Yongsik Sim, Beomseok Sohn, Dongha Lee, Jinyoung Yeo

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Accepted to AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14497 2024-04-19 cs.CL cs.AI 86%

Self-Polish: Enhance Reasoning in Large Language Models via Problem Refinement

Zhiheng Xi, Senjie Jin, Yuhao Zhou, Rui Zheng, Songyang Gao, Tao Gui, Qi Zhang, Xuanjing Huang

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2023 Findings. Codes and prompts are available at https://github.com/WooooDyy/Self-Polish

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09241 2023-11-17 cs.CV cs.AI cs.LG 86%

Chain of Images for Intuitively Reasoning

Fanxu Meng, Haotong Yang, Yiding Wang, Muhan Zhang

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);logical reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08395 2023-10-24 cs.CL cs.AI 86%

Prompting Large Language Models with Chain-of-Thought for Few-Shot Knowledge Base Question Generation

Yuanyuan Liang, Jianing Wang, Hanlun Zhu, Lei Wang, Weining Qian, Yunshi Lan

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Accepted by EMNLP 2023 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14740 2023-10-24 cs.AI cs.CL cs.CV 86%

ECHo: A Visio-Linguistic Dataset for Event Causality Inference via Human-Centric Reasoning

Yuxi Xie, Guanzhen Li, Min-Yen Kan

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Findings of EMNLP 2023. 10 pages, 6 figures, 5 tables (22 pages, 8 figures, 15 tables including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.09261 2022-10-18 cs.CL cs.AI 86%

Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them

Mirac Suzgun, Nathan Scales, Nathanael Schärli, Sebastian Gehrmann, Yi Tay, Hyung Won Chung, Aakanksha Chowdhery, Quoc V. Le, Ed H. Chi, Denny Zhou, Jason Wei

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments GitHub repository: https://github.com/suzgunmirac/BIG-Bench-Hard

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24065 2026-03-26 cs.AI 86%

Enhanced Mycelium of Thought (EMoT): A Bio-Inspired Hierarchical Reasoning Architecture with Strategic Dormancy and Mnemonic Encoding

增强思维菌丝(EMoT):一种受生物启发的分层推理架构,具有战略休眠和记忆编码

Florian Odi Stummer

机构 * Institute of General Medicine(医学系)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 EMoT是一种受生物启发的分层推理架构,通过四层结构(微、中、宏、元)实现战略休眠与激活,结合记忆宫殿和五种记忆编码方式,提升多领域复杂问题解决能力,但存在样本量小、计算成本高等限制。

Comments 32 pages, 6 figures, 15 tables; includes ablation studies and reasoning trace visualisation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02983 2026-03-16 cs.AI 86%

Do LLMs Share Human-Like Biases? Causal Reasoning Under Prior Knowledge, Irrelevant Context, and Varying Compute Budgets

大型语言模型是否具有人类般的偏见?在先验知识、无关上下文和不同计算预算下的因果推理

Hanna M. Dettki, Charley M. Wu, Bob Rehder

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文通过对比20余种LLM与人类基准,在11个由碰撞结构形式化的因果判断任务中发现,小型可解释模型能有效压缩LLM的因果判断,多数LLM表现出比人类更规则化的推理策略,但未表现出人类典型的碰撞偏见。

Journal ref ICLR 2026 Workshop "From Human Cognition to AI Reasoning (HCAIR)"

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10229 2026-01-21 cs.CL 86%

GeoSteer: Faithful Chain-of-Thought Steering via Latent Manifold Gradients

GeoSteer: 通过潜在流形梯度实现忠实的思维链引导

Kentaro Kazama, Daiki Shirafuji, Tatsuhiko Saito

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract,comments);CoT(abstract);分类 cs.CL

AI总结 GeoSteer通过学习高质量CoT轨迹的低维流形,利用梯度引导提升LLM中间推理质量,实验显示在GSM8k数据集上准确率和推理质量均显著提升。

Comments The Third workshop of NeusymBridge @AAAI 2026 (Bridging Neurons and Symbols for NLP and Knowledge Graph Reasoning)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01783 2026-08-04 cs.SD cs.HC stat.AP 新提交 86%

Comparative Validation of GPT-4o-mini and Teacher Mean Scores for Automated Scoring of Music Analysis Responses: Single-Pass Deployment, Repeatability, and Strategy-Specific Bias

GPT-4o-mini与教师平均评分在音乐分析回答自动评分中的比较验证:单次部署、可重复性及策略特异性偏差

Baicheng Lin, Lingxi Jin, Kyung-Seok Min

机构 * Sejong University(世宗大学) Ewha Womans University(梨花女子大学)

专题命中 推理评测 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract)

AI总结 本研究以教师平均评分为基准,评估GPT-4o-mini对音乐分析回答的自动评分能力,发现Fs+CoT策略与教师评分一致性最强,不同策略评分特征不同,实际应用需针对性校准与人工监督。

Comments Proceedings of the International Meeting of the Psychometric Society: The 91st Annual Meeting, Seoul, Republic of Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07621 2026-08-11 cs.AI cs.CV cs.RO 新提交 85%

CMU-Drive and V2V-VLA: Cooperative Multi-agent Unified Driving with Reasoning Benchmark and Vehicle-to-Vehicle Vision-Language-Action Models

CMU-Drive与V2V-VLA:具备推理能力的协同多智能体统一驾驶基准及车对车视觉-语言-动作模型

Hsu-kuang Chiu, Stephen F. Smith

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出协同多智能体统一驾驶基准CMU-Drive及车对车视觉-语言-动作模型V2V-VLA,解决现有VLA模型缺乏协同能力的问题,构建了协同自动驾驶研究的首个基准并将相关资源开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14591 2026-08-06 cs.SD cs.AI 版本更新 85%

AudioDER: A Deduplication-Enhanced Reasoning Dataset for Post-Training Large Audio-Language Models

AudioDER: 一种用于后训练大型音频语言模型的去重增强推理数据集

Hui Geng, Yi Su, Zijian Gao, Tianjiao Wan, Qisheng Xu, Jiaxin Chen, Hengzhu Liu, Kele Xu

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Shanghai Jiaotong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract_cn);分类 cs.AI

AI总结 针对现有音频-语言数据集冗余导致后训练效果下降的问题,提出基于声学相似性去重的数据构建流程,生成包含191k样本的推理导向数据集AudioDER,显著提升LALM在多个音频推理基准上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏