arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10414 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10414 篇

2210.05359 2022-10-12 cs.CL cs.AI 81%

Mind's Eye: Grounded Language Model Reasoning through Simulation

Ruibo Liu, Jason Wei, Shixiang Shane Gu, Te-Yen Wu, Soroush Vosoughi, Claire Cui, Denny Zhou, Andrew M. Dai

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.07760 2022-09-19 cs.CL cs.AI 81%

Possible Stories: Evaluating Situated Commonsense Reasoning under Multiple Possible Scenarios

Mana Ashida, Saku Sugawara

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to COLING 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.05470 2022-08-11 cs.CV cs.AI cs.LG cs.MA cs.RO 81%

EvolveHypergraph: Group-Aware Dynamic Relational Reasoning for Trajectory Prediction

Jiachen Li, Chuanbo Hua, Jinkyoo Park, Hengbo Ma, Victoria Dax, Mykel J. Kochenderfer

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.05849 2022-05-13 cs.AI cs.CL 81%

e-CARE: a New Dataset for Exploring Explainable Causal Reasoning

Li Du, Xiao Ding, Kai Xiong, Ting Liu, Bing Qin

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.10521 2022-04-25 cs.CL cs.AI cs.HC 81%

Rethinking Offensive Text Detection as a Multi-Hop Reasoning Problem

Qiang Zhang, Jason Naradowsky, Yusuke Miyao

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments 18 pages, 4 figures, 10 tables, accepted in Findings of the Association for Computational Linguistics 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.14207 2021-12-22 cs.CL cs.AI 81%

How Much Coffee Was Consumed During EMNLP 2019? Fermi Problems: A New Reasoning Challenge for AI

Ashwin Kalyan, Abhinav Kumar, Arjun Chandrasekaran, Ashish Sabharwal, Peter Clark

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted for publication at EMNLP 2021, 11 pages, 5 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.06860 2021-09-15 cs.CL cs.AI cs.CV 81%

Broaden the Vision: Geo-Diverse Visual Commonsense Reasoning

Da Yin, Liunian Harold Li, Ziniu Hu, Nanyun Peng, Kai-Wei Chang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments EMNLP 2021. Code and data are available at https://github.com/WadeYin9712/GD-VCR

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.09692 2021-08-31 cs.AI cs.LG 81%

Hi-Phy: A Benchmark for Hierarchical Physical Reasoning

Cheng Xue, Vimukthini Pinto, Chathura Gamage, Peng Zhang, Jochen Renz

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments We have updated this paper with considerable modifications

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.06823 2021-06-15 cs.CL cs.AI 81%

Prompting Contrastive Explanations for Commonsense Reasoning Tasks

Bhargavi Paranjape, Julian Michael, Marjan Ghazvininejad, Luke Zettlemoyer, Hannaneh Hajishirzi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments ACL 2021 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.01074 2021-06-03 cs.CL cs.AI cs.DB 81%

Database Reasoning Over Text

James Thorne, Majid Yazdani, Marzieh Saeidi, Fabrizio Silvestri, Sebastian Riedel, Alon Halevy

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments To appear at ACL2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.00969 2021-06-03 cs.CL cs.AI 81%

COM2SENSE: A Commonsense Reasoning Benchmark with Complementary Sentences

Shikhar Singh, Nuan Wen, Yu Hou, Pegah Alipoormolabashi, Te-Lin Wu, Xuezhe Ma, Nanyun Peng

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments In Proceedings of Findings of the Association for Computational Linguistics: ACL 2021 (ACL-Findings). Contains 16 pages, 14 figures and 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.10193 2021-04-22 cs.CL cs.AI 81%

Identify, Align, and Integrate: Matching Knowledge Graphs to Commonsense Reasoning Tasks

Lisa Bauer, Mohit Bansal

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments EACL 2021 (14 pages, 2 figures, 10 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.14232 2021-03-29 cs.CV cs.AI cs.LG 81%

ACRE: Abstract Causal REasoning Beyond Covariation

Chi Zhang, Baoxiong Jia, Mark Edmonds, Song-Chun Zhu, Yixin Zhu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments CVPR 2021 paper. Supplementary: http://wellyzhang.github.io/attach/cvpr21zhang_acre_supp.pdf Project: http://wellyzhang.github.io/project/acre.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.00763 2021-01-06 cs.AI cs.CV cs.LG 81%

Bongard-LOGO: A New Benchmark for Human-Level Concept Learning and Reasoning

Weili Nie, Zhiding Yu, Lei Mao, Ankit B. Patel, Yuke Zhu, Animashree Anandkumar

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments 22 pages, NeurIPS 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.03705 2020-12-01 cs.CL cs.AI cs.CV 81%

CommonGen: A Constrained Text Generation Challenge for Generative Commonsense Reasoning

Bill Yuchen Lin, Wangchunshu Zhou, Ming Shen, Pei Zhou, Chandra Bhagavatula, Yejin Choi, Xiang Ren

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2020 Findings. Add one more human reference for each test example: Table 1,3 & Figure 4 & Section 3.3, 3.4 are updated. Project page: https://inklab.usc.edu/CommonGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.00730 2020-05-15 cs.CL cs.LG 81%

ESPRIT: Explaining Solutions to Physical Reasoning Tasks

Nazneen Fatema Rajani, Rui Zhang, Yi Chern Tan, Stephan Zheng, Jeremy Weiss, Aadit Vyas, Abhijit Gupta, Caiming XIong, Richard Socher, Dragomir Radev

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

Comments ACL 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2001.04170 2020-05-06 cs.CL cs.AI cs.IR 81%

Joint Reasoning for Multi-Faceted Commonsense Knowledge

Yohan Chalier, Simon Razniewski, Gerhard Weikum

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments 11 pages

Journal ref AKBC 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.03745 2020-04-28 cs.CL cs.AI 81%

Reasoning Over Semantic-Level Graph for Fact Checking

Wanjun Zhong, Jingjing Xu, Duyu Tang, Zenan Xu, Nan Duan, Ming Zhou, Jiahai Wang, Jian Yin

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments 9pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.06050 2020-03-16 cs.LG cs.CL stat.ML 81%

Heterogeneous Relational Reasoning in Knowledge Graphs with Reinforcement Learning

Mandana Saebi, Steven Krieg, Chuxu Zhang, Meng Jiang, Nitesh Chawla

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.00262 2019-11-04 cs.LG cs.CL cs.IR stat.ML 81%

Finding the most similar textual documents using Case-Based Reasoning

Marko Mihajlovic, Ning Xiong

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.04076 2019-09-13 cs.CL cs.AI 81%

Counterfactual Story Reasoning and Generation

Lianhui Qin, Antoine Bosselut, Ari Holtzman, Chandra Bhagavatula, Elizabeth Clark, Yejin Choi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.05656 2019-08-16 cs.LG cs.AI stat.ML 81%

PHYRE: A New Benchmark for Physical Reasoning

Anton Bakhtin, Laurens van der Maaten, Justin Johnson, Laura Gustafson, Ross Girshick

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.10550 2018-11-27 cs.AI cs.CL 81%

Challenges in the Automatic Analysis of Students' Diagnostic Reasoning

Claudia Schulz, Christian M. Meyer, Michael Sailer, Jan Kiesewetter, Elisabeth Bauer, Frank Fischer, Martin R. Fischer, Iryna Gurevych

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.05457 2018-03-16 cs.AI cs.CL cs.IR 81%

Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge

Peter Clark, Isaac Cowhey, Oren Etzioni, Tushar Khot, Ashish Sabharwal, Carissa Schoenick, Oyvind Tafjord

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments 10 pages, 7 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09743 2026-07-14 cs.AI cs.GT 新提交 80%

Scaffolding the Strategist: Architecture-Dependent Reasoning Interventions in Hotelling Spatial Markets

为策略制定者搭建框架:霍特林空间市场中与架构相关的推理干预

Pratyush Singh

机构 * California Institute of Technology(加州理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究结构化推理干预对大语言模型战略经济推理的影响及与模型架构的关系,以霍特林模型评估GPT - 4.1 - mini和GPT - 5 - mini,发现支架类型与模型架构有交叉交互作用,对抗性测试有损害,还存在陈述性 - 程序性差距。

Comments 26 pages (11 main + 15 appendix), 6 figures, 4 tables. Accepted at the ICLR 2026 Workshop on LLM Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29254 2026-06-30 cs.CL cs.NE 80%

Travel-Oriented Reasoning Large Language Model via Domain-Specific Knowledge Graphs

面向旅游的推理大语言模型:基于领域特定知识图谱

Vignesh Ram Nithin Kappagantula, Shayan Hassantabar, Samuel Simpson, Golnaz Moallem

机构 * Expedia Group(Expedia集团)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出一种模块化流水线,利用专家构建的知识图谱生成多跳问答对,微调大语言模型以提升旅游领域推理的准确性和校准能力,在基准上达到82.4%精确匹配。

Comments Accepted to the Uncertainty Reasoning and Quantification in Decision Making (UDM) Workshop, KDD 2026 (To be presented in August 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10479 2026-06-10 cs.AI 新提交 80%

ComBench: A Benchmark for Rigorous Proof Reasoning and Constructive Realization in Olympiad-Level Combinatorics

ComBench: 奥林匹克级组合数学中严格证明推理与构造实现的基准测试

Shunkai Zhang, Haoran Zhang, Yun Luo, Qianjia Cheng, Haodi Lei, Yizhuo Li, Runzhe Zhan, Zhilin Wang, Bangjie Xu, Yucheng Su, Xinmiao Han, Xiaoye Qu, Dongrui Liu, Zhouchen Lin, Yu Qiao, Ning Ding, Yafu Li, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出ComBench基准,包含100道奥林匹克级组合问题,分分析和构造两类,通过评分与验证评估大模型推理能力,发现最强模型准确率仅65.4%,且证明推理与构造实现能力存在差异。

Comments 39 pages, 6 figures, 26 tables. Project page: https://simplified-reasoning.github.io/ComBench/docs/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07966 2026-04-22 cs.CV cs.CL 80%

Visual-TableQA: Open-Domain Benchmark for Reasoning over Table Images

视觉-表格问答:面向表格图像推理的开放领域基准

Boammani Aser Lompo, Marc Haraoui

机构 * École de Technologie Supérieure(埃克塞技术学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出Visual-TableQA,一个大规模开放领域多模态数据集,用于评估和提升视觉推理能力,包含2500个LaTeX渲染表格和6000对推理密集型问答对,通过多模型协作生成,验证了模型在外部基准上的鲁棒性。

Comments Accepted at the First Workshop on Foundations of Reasoning in Language Models, NeurIPS 2025. Available at: https://openreview.net/forum?id=fvJRsGwhPf

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08140 2026-04-10 cs.CR cs.AI cs.MM cs.NI 80%

Multimodal Reasoning with LLM for Encrypted Traffic Interpretation: A Benchmark

基于LLM的多模态推理用于加密流量解释:一个基准

Longgang Zhang, Xiaowei Fu, Fuxiang Huang, Lei Zhang

机构 * School of Microelectronics and Communication Engineering, Chongqing University(重庆大学微电子与通信工程学院) School of Data Science, Lingnan University(岭南大学数据科学学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出BGTD基准和mmTraffic框架,通过结合原始字节与结构化注释,实现可解释的加密流量解释,生成高保真的人可读报告,同时保持高分类准确率。

Comments Project page \url{https://github.com/lgzhangzlg/Multimodal-Reasoning-with-LLM-for-Encrypted-Traffic-Interpretation-A-Benchmark}

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12896 2026-03-30 cs.CL 80%

None of the Others: a General Technique to Distinguish Reasoning from Memorization in Multiple-Choice LLM Evaluation Benchmarks

并非其他:一种区分推理与记忆的通用技术,用于多选LLM评估基准

Eva Sánchez Salido, Julio Gonzalo, Guillermo Marco

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出一种通用方法,通过改变数学问题的数值来区分LLM的推理能力与记忆能力,评估了多个模型在公开和私有数据集上的表现,发现模型在该方法下准确率显著下降,揭示了记忆在当前LLM回答中的重要作用。

Journal ref "On the Limits of LLM Reasoning: Evidence From Contamination, Translation, and Answer Modification in Multiple-Choice Benchmarks," in IEEE Access, vol. 14, pp. 9384-9393, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏