arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10440 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10440 篇

2103.13009 2021-03-25 cs.CL 79%

UNICORN on RAINBOW: A Universal Commonsense Reasoning Model on a New Multitask Benchmark

Nicholas Lourie, Ronan Le Bras, Chandra Bhagavatula, Yejin Choi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments 27 pages, 19 figures, 34 tables. Accepted to AAAI 2021. For associated code and data see https://github.com/allenai/rainbow

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.04966 2021-01-14 cs.CL 79%

Improving Commonsense Causal Reasoning by Adversarial Training and Data Augmentation

Ieva Staliūnaitė, Philip John Gorinski, Ignacio Iacobacci

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments 7 pages + pages references, 4 figures, 3 tables, paper accepted at AAAI2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.08012 2020-12-16 cs.CL 79%

Learning to Rationalize for Nonmonotonic Reasoning with Distant Supervision

Faeze Brahman, Vered Shwartz, Rachel Rudinger, Yejin Choi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments AAAI 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.07410 2020-12-15 cs.CL 79%

Reasoning in Dialog: Improving Response Generation by Context Reading Comprehension

Xiuying Chen, Zhi Cui, Jiayi Zhang, Chen Wei, Jianwei Cui, Bin Wang, Dongyan Zhao, Rui Yan

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments 9 pages, 1 figure

Journal ref AAAI 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.07690 2020-12-15 cs.CL 79%

Reasoning about Goals, Steps, and Temporal Ordering with WikiHow

Li Zhang, Qing Lyu, Chris Callison-Burch

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments In EMNLP 2020

Journal ref Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP) (2020) 4630-4639

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.13282 2020-09-29 cs.CL 79%

Graph-based Multi-hop Reasoning for Long Text Generation

Liang Zhao, Jingjing Xu, Junyang Lin, Yichang Zhang, Hongxia Yang, Xu Sun

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.05739 2020-02-17 cs.CL 79%

Abductive Commonsense Reasoning

Chandra Bhagavatula, Ronan Le Bras, Chaitanya Malaviya, Keisuke Sakaguchi, Ari Holtzman, Hannah Rashkin, Doug Downey, Scott Wen-tau Yih, Yejin Choi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments ICLR 2020 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.09728 2019-09-10 cs.CL 79%

SocialIQA: Commonsense Reasoning about Social Interactions

Maarten Sap, Hannah Rashkin, Derek Chen, Ronan LeBras, Yejin Choi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments the first two authors contributed equally; accepted to EMNLP 2019; camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.11983 2019-07-30 cs.CL 79%

A Hybrid Neural Network Model for Commonsense Reasoning

Pengcheng He, Xiaodong Liu, Weizhu Chen, Jianfeng Gao

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments 9 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.02361 2019-06-07 cs.CL 79%

Explain Yourself! Leveraging Language Models for Commonsense Reasoning

Nazneen Fatema Rajani, Bryan McCann, Caiming Xiong, Richard Socher

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Accepted at ACL, 11 pages total

Journal ref In Proceedings of the Association for Computational Linguistics (ACL), 2019. Florence, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11192 2026-07-16 cs.CV 版本更新 79%

GDP.pdf: Benchmarking Grounded Multimodal Reasoning over Professional PDF Documents

GDP.pdf:针对专业PDF文档的基础多模态推理基准测试

Suhaas Garre, Emily Ritchie, Sushant Mehta, Edwin Chen

机构 * Surge AI

专题命中 推理评测 :reasoning(title,abstract)

AI总结 该研究针对专业PDF文档构建多模态推理基准测试GDP.pdf,由专业人员编写问题-文档对,通过严格筛选保留问题,有详细评分标准和能力分类。评估七个前沿模型,发现多数错误源于特定模式,公开了完整基准测试。

Comments 9 pages. v2: results updated to July 2026 leaderboard (17 models). Accepted at the 2nd Workshop on Knowledge-Intensive Multimodal Reasoning (KnowledgeMR) at CVPR 2026 (non-archival), under the former title "PDFParse: A Benchmark for Grounded Multimodal Reasoning over Professional PDF Documents". Dataset: https://huggingface.co/datasets/surgeai/GDP.pdf ; Code: https://github.com/surge-ai/gdp-pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05404 2026-04-15 cs.PF cs.SE 79%

Beyond Accuracy: Unveiling Inefficiency Patterns in Tool-Integrated Reasoning

超越准确性:揭示工具集成推理中的低效模式

Qisheng Su, Shiting Huang, Zhen Fang, Ziyan Chen, Zehui Chen, Feng Zhao

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出PTE指标,用于衡量工具集成推理的效率,揭示了低效模式,并发现高PTE成本与推理正确性下降相关。

Comments Accepted at ACL 2026. Code: https://github.com/sqs-ustc/tool-reasoning-framework-PTE

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05091 2025-12-05 cs.CV 79%

Visual Reasoning Tracer: Object-Level Grounded Reasoning Benchmark

视觉推理追踪器:对象级 grounded 推理基准

Haobo Yuan, Yueyi Sun, Yanwei Li, Tao Zhang, Xueqing Deng, Henghui Ding, Lu Qi, Anran Wang, Xiangtai Li, Ming-Hsuan Yang

机构 * UC Merced(加州大学默塞德分校) PKU(北京大学) NTU(国立台湾大学) CUHK(香港中文大学) WHU(武汉大学) FDU(福建大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出视觉推理追踪器任务,通过对象级 grounded 推理基准评估模型的推理路径生成能力,并引入了新的评估指标和大规模数据集提升模型推理表现。

Comments Technical Report; Project Page: https://harboryuan.github.io/visual-reasoning-tracer

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.01692 2023-07-20 cs.CL cs.AI cs.LG 79%

Can In-context Learners Learn a Reasoning Concept from Demonstrations?

Michal Štefánik, Marek Kadlčík

专题命中 推理评测 :reasoning(title,comments);分类 cs.CL、cs.AI、cs.LG

Comments Awarded Best Paper at ACL 2023 Natural Language Reasoning and Structured Explanations (NLRSE) workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03059 2026-07-28 cs.LG cs.AI 版本更新 79%

Loong: Synthesize Long Chain-of-Thoughts at Scale through Verifiers

Loong:通过验证器大规模合成长思维链

Xingyue Huang, Rishabh, Gregor Franke, Ziyi Yang, Jiamu Bai, Weijie Bai, Jinhe Bi, Zifeng Ding, Yiqun Duan, Chengyu Fan, Wendong Fan, Xin Gao, Ruohao Guo, Yuan He, Zhuangzhuang He, Xianglong Hu, Neil Johnson, Bowen Li, Fangru Lin, Siyu Lin, Tong Liu, Yunpu Ma, Hao Shen, Hao Sun, Beibei Wang, Fangyijie Wang, Hao Wang, Haoran Wang, Yang Wang, Yifeng Wang, Zhaowei Wang, Ziyang Wang, Yifan Wu, Zikai Xiao, Chengxing Xie, Fan Yang, Junxiao Yang, Qianshuo Ye, Ziyu Ye, Guangtao Zeng, Yuwen Ebony Zhang, Zeyu Zhang, Zihao Zhu, Bernard Ghanem, Philip Torr, Guohao Li

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 研究针对将LLMs推理能力扩展到其他领域的挑战,提出Loong项目这一开源框架,由LoongBench和LoongEnv组成,通过它们形成强化学习的智能体-环境循环,经实验评估及对合成数据的分析,推动推理密集型领域发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14109 2026-07-17 cs.CL cs.AI 新提交 79%

Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation

简单性悖论:揭穿关于大语言模型评估中提示和数据集的神话

Inder Preet, Shuxin Lin, Dhaval Patel

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型评估中提示和数据集相关问题,通过对8种提示技术在10个MCQA数据集上的实证研究,发现基线提示常优于复杂技术,还研究了相关关键现象,表明LLM评估社区或使提示工程过复杂,存在性能差距,为模型改进提供机会。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03007 2026-07-07 cs.LG cs.AI q-bio.BM 新提交 79%

Back to Basics: Improving Molecular Understanding in LLMs via SMILES-Graph Translation

回归基础:通过SMILES-图翻译提升大语言模型中的分子理解

Wenda Wang, Jinjia Feng, Zhewei Wei

机构 * Gaoling School of Artificial Intelligence(中关村人工智能学院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 研究针对分子大语言模型缺乏可靠结构基础的问题,提出MolBasic框架,通过SMILES-图翻译加强结构理解,用多级结构感知基准和渐进学习方案,提升了结构理解及下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20897 2026-06-23 cs.CL cs.AI 新提交 79%

PeerCheck: Enhancing LLM-Generated Academic Reviews Towards Human-Level Quality

PeerCheck: 提升大语言模型生成的学术评审至人类水平质量

Zeyuan Chen, Ziqing Yang, Yihan Ma, Michael Backes, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心)

专题命中 推理评测 :CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 提出PeerCheck框架,分析LLM与人类评审差异,采用思维链和检索增强生成提升评审质量,发现思维链显著改善但RAG存在悖论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00658 2026-06-23 cs.CL cs.AI 版本更新 79%

Sarc7: Evaluating Sarcasm Detection and Generation with Seven Types and Emotion-Informed Techniques

Sarc7: 基于七种类型和情感感知技术评估讽刺检测与生成

Raina Gao, Alyssa Jeong, Lang Xiong, Yicheng Fu, Sean O'Brien, Vasu Sharma, Kevin Zhu

机构 * Algoverse AI Research(Algoverse AI研究院)

专题命中 推理评测 :CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 提出Sarc7基准,将MUStARD数据集标注为七种讽刺类型,并通过零样本、少样本、思维链及新型情感提示技术进行分类评估,同时开发基于情感的生成方法,实验表明情感提示技术优于其他设置。

Comments Accepted to EMNLP WiNLP and COLM Melt, Solar, PragLM, and Origen

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18557 2026-06-18 cs.AI cs.LG cs.LO 新提交 79%

DeFAb: A Verifiable Benchmark for Defeasible Abduction in Foundation Models

DeFAb:基础模型中可废止溯因的可验证基准

Patrick Cooper, Alvaro Velasquez

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出DeFAb基准,通过将知识库转换为可验证的溯因实例,评估基础模型在可废止推理中的创造力与理论推理能力,发现前沿模型准确率远低于符号求解器。

Comments 33 pages, 14 figures, 23 tables. Dataset: https://huggingface.co/datasets/PatrickAllenCooper/DeFAb ; code and evaluation harness: https://github.com/PatrickAllenCooper/blanc

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16312 2026-05-28 cs.CL cs.AI 79%

Teaching and Evaluating LLMs to Reason About Polymer Design Related Tasks

教授和评估LLMs推理聚合物设计相关任务

Dikshya Mohanty, Mohammad Saqib Hasan, Syed Mostofa Monsur, Size Zheng, Benjamin Hsiao, Niranjan Balasubramanian

机构 * Stony Brook University(石溪大学)

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PolyBench基准数据集和知识增强推理蒸馏方法,使中小型语言模型在聚合物设计任务上性能接近前沿闭源LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02035 2026-05-27 cs.CL cs.AI 79%

VIDA: A dataset for Visually Dependent Ambiguity in Multimodal Machine Translation

VIDA: 多模态机器翻译中视觉依赖歧义的数据集

Jingheng Pan, Xintong Wang, Longyue Wang, Liang Ding, Weihua Luo, Chris Biemann

机构 * Department of Informatics, Universität Hamburg(汉堡大学信息学院) Alibaba Group(阿里巴巴集团) Alibaba Cloud(阿里云)

专题命中 推理评测 :CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 提出VIDA数据集,包含2500个精心策划的实例,用于评估多模态机器翻译中需要视觉证据才能解决的歧义,并引入以歧义消解为中心的指标,实验表明链式思维微调能提升跨分布歧义消解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15897 2026-03-18 cs.CL cs.AI 79%

COGNAC at SemEval-2026 Task 5: LLM Ensembles for Human-Level Word Sense Plausibility Rating in Challenging Narratives

COGNAC在SemEval-2026任务5中的应用:用于挑战性叙事中人类水平词义可信度评估的LLM集成

Azwad Anjum Islam, Tisa Islam Erana

机构 * Florida International University Knight Foundation School of Computing and Information Sciences(佛罗里达国际大学骑士基金会计算与信息科学学院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出使用多个闭源商业LLM的集成方法,通过三种提示策略提升短篇故事中多义词词义可信度评估的准确性,最终在比赛中获得第四名。

Comments System description paper in SemEval-2026, Task 5

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24945 2026-03-02 cs.CL cs.AI 79%

MobileLLM-R1: Exploring the Limits of Sub-Billion Language Model Reasoners with Open Training Recipes

MobileLLM-R1: 探索子十亿参数语言模型推理能力的极限与开放训练配方

Changsheng Zhao, Ernie Chang, Zechun Liu, Chia-Jung Chang, Wei Wen, Chen Lai, Sheng Cao, Yuandong Tian, Raghuraman Krishnamoorthi, Yangyang Shi, Vikas Chandra

机构 * Meta AI

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 MobileLLM-R1通过开放训练配方在较少数据下实现子十亿参数模型的推理能力突破,显著超越现有模型。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16467 2026-02-19 cs.CL cs.AI 79%

IndicEval: A Bilingual Indian Educational Evaluation Framework for Large Language Models

IndicEval:一种用于大型语言模型的双语印度教育评估框架

Saurabh Bharti, Gaurav Azad, Abhinaw Jagtap, Nachiket Tapas

机构 * Department of Computer Sciencce and Engineering(计算机科学与工程系) Swami Vivekanand Technical University Bhilai, India(斯瓦米·维韦kanand技术大学比哈尔,印度)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 IndicEval提出了一种双语印度教育评估框架,通过真实考试题目评估LLM的推理、领域知识和双语适应性,揭示了跨模型性能差异和多语言退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08108 2026-01-14 cs.CL cs.AI 79%

Debiasing Large Language Models via Adaptive Causal Prompting with Sketch-of-Thought

通过适应性因果提示的草图思维去偏Large Language Models

Bowen Li, Ziqi Xu, Jing Ren, Renqiang Luo, Xikun Zhang, Xiuzhen Zhang, Yongli Ren, Feng Xia

机构 * RMIT University(皇家墨尔本理工大学) Jilin University(吉林大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 ACPS通过适应性因果提示与草图思维方法,提升Large Language Models的推理效率与泛化能力。

Comments Accepted by Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21711 2025-12-29 cs.CL cs.AI 79%

Do Latent Tokens Think? A Causal and Adversarial Analysis of Chain-of-Continuous-Thought

潜在标记是否思考?对连续思维链的因果和对抗分析

Yuyi Zhang, Boyu Tang, Tianjie Ju, Sufeng Duan, Gongshen Liu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文通过因果和对抗分析揭示COCONUT作为伪推理机制的问题,指出其依赖捷径而非真实推理。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21933 2025-12-09 cs.CL cs.AI 79%

Why Chain of Thought Fails in Clinical Text Understanding

为什么链式思维在临床文本理解中失效

Jiageng Wu, Kevin Xie, Bowen Gu, Nils Krüger, Kueiyu Joshua Lin, Jie Yang

机构 * Harvard Medical School(哈佛医学院) MIT(麻省理工学院) Broad Institute of MIT and Harvard(MIT与哈佛大学Broad研究所)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本研究发现链式思维在临床文本理解中导致性能下降,揭示了其在临床任务中可靠性与可解释性的矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10900 2025-11-20 cs.CL cs.AI 79%

Expert-Guided Prompting and Retrieval-Augmented Generation for Emergency Medical Service Question Answering

Xueren Ge, Sahil Murtaza, Anthony Cortez, Homa Alemzadeh

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07966 2025-10-01 cs.CV cs.AI cs.CL 79%

Scaling RL to Long Videos

Yukang Chen, Wei Huang, Baifeng Shi, Qinghao Hu, Hanrong Ye, Ligeng Zhu, Zhijian Liu, Pavlo Molchanov, Jan Kautz, Xiaojuan Qi, Sifei Liu, Hongxu Yin, Yao Lu, Song Han

机构 * NVIDIA MIT(麻省理工学院) HKU(香港大学) UC Berkeley(加州大学伯克利分校)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Accepted by NeurIPS 2025. Code at https://github.com/NVlabs/Long-RL and model at https://huggingface.co/Efficient-Large-Model/LongVILA-R1-7B

详情

展开后加载摘要…

URL PDF HTML 收藏