arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10379 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10379 篇

2504.00993 2025-04-08 cs.CL cs.AI 84%

MedReason: Eliciting Factual Medical Reasoning Steps in LLMs via Knowledge Graphs

Juncheng Wu, Wenlong Deng, Xingxuan Li, Sheng Liu, Taomian Mi, Yifan Peng, Ziyang Xu, Yi Liu, Hyunjin Cho, Chang-In Choi, Yihan Cao, Hui Ren, Xiang Li, Xiaoxiao Li, Yuyin Zhou

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

Comments 18 pages, 11 figures, 6 tables. Project page: https://github.com/UCSC-VLAA/MedReason

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16061 2025-02-06 cs.LG cs.CL 84%

PORT: Preference Optimization on Reasoning Traces

Salem Lahlou, Abdalgader Abubaker, Hakim Hacid

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17819 2024-12-25 cs.CL cs.AI 84%

Inductive Linguistic Reasoning with Large Language Models

Raghav Ramji, Keshav Ramji

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13975 2024-12-23 cs.CL cs.AI 84%

MR-Ben: A Meta-Reasoning Benchmark for Evaluating System-2 Thinking in LLMs

Zhongshen Zeng, Yinhong Liu, Yingjia Wan, Jingyao Li, Pengguang Chen, Jianbo Dai, Yuxuan Yao, Rongwu Xu, Zehan Qi, Wanru Zhao, Linling Shen, Jianqiao Lu, Haochen Tan, Yukang Chen, Hao Zhang, Zhan Shi, Bailin Wang, Zhijiang Guo, Jiaya Jia

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18711 2024-12-06 cs.AI cs.CL 84%

Calibrating Reasoning in Language Models with Internal Consistency

Zhihui Xie, Jizhou Guo, Tong Yu, Shuai Li

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2024 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23703 2024-11-01 cs.LG cs.CL 84%

OCEAN: Offline Chain-of-thought Evaluation and Alignment in Large Language Models

Junda Wu, Xintong Li, Ruoyu Wang, Yu Xia, Yuxin Xiong, Jianing Wang, Tong Yu, Xiang Chen, Branislav Kveton, Lina Yao, Jingbo Shang, Julian McAuley

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL、cs.LG

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14790 2024-10-07 cs.CL cs.AI 84%

Step-by-Step Reasoning to Solve Grid Puzzles: Where do LLMs Falter?

Nemika Tyagi, Mihir Parmar, Mohith Kulkarni, Aswin RRV, Nisarg Patel, Mutsumi Nakamura, Arindam Mitra, Chitta Baral

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted at EMNLP 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14277 2024-09-24 cs.AI cs.CL cs.CV cs.RO 84%

Can-Do! A Dataset and Neuro-Symbolic Grounded Framework for Embodied Planning with Large Multimodal Models

Yew Ken Chia, Qi Sun, Lidong Bing, Soujanya Poria

专题命中 推理评测 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05221 2024-08-13 cs.CL cs.AI 84%

LLM Reasoners: New Evaluation, Library, and Analysis of Step-by-Step Reasoning with Large Language Models

Shibo Hao, Yi Gu, Haotian Luo, Tianyang Liu, Xiyan Shao, Xinyuan Wang, Shuhua Xie, Haodi Ma, Adithya Samavedhi, Qiyue Gao, Zhen Wang, Zhiting Hu

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Project website: https://www.llm-reasoners.net/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11303 2024-06-18 cs.CV cs.AI cs.CL 84%

VideoVista: A Versatile Benchmark for Video Understanding and Reasoning

Yunxin Li, Xinyu Chen, Baotian Hu, Longyue Wang, Haoyuan Shi, Min Zhang

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

Comments 38 pages, 44 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17644 2024-06-11 cs.CL cs.AI 84%

Are LLMs Capable of Data-based Statistical and Causal Reasoning? Benchmarking Advanced Quantitative Reasoning with Data

Xiao Liu, Zirui Wu, Xueqing Wu, Pan Lu, Kai-Wei Chang, Yansong Feng

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments Findings of ACL 2024. Project website: https://xxxiaol.github.io/QRData/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.09711 2024-05-17 cs.AI cs.CL cs.CV 84%

STAR: A Benchmark for Situated Reasoning in Real-World Videos

Bo Wu, Shoubin Yu, Zhenfang Chen, Joshua B Tenenbaum, Chuang Gan

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

Comments NeurIPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10730 2024-02-27 cs.CL cs.AI 84%

Mixed Distillation Helps Smaller Language Model Better Reasoning

Chenglin Li, Qianglong Chen, Liangyue Li, Caiyu Wang, Yicheng Li, Zulong Chen, Yin Zhang

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Working in Progress, 17 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03991 2024-01-11 cs.AI cs.CL cs.DB cs.LO 84%

Advancing Spatial Reasoning in Large Language Models: An In-Depth Evaluation and Enhancement Using the StepGame Benchmark

Fangjun Li, David C. Hogg, Anthony G. Cohn

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments Camera-Ready version for AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03065 2024-01-09 cs.SE cs.AI cs.LG 84%

CRUXEval: A Benchmark for Code Reasoning, Understanding and Execution

Alex Gu, Baptiste Rozière, Hugh Leather, Armando Solar-Lezama, Gabriel Synnaeve, Sida I. Wang

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);分类 cs.AI、cs.LG

Comments 71 pages, 29 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.04023 2023-11-29 cs.CL cs.AI 84%

A Multitask, Multilingual, Multimodal Evaluation of ChatGPT on Reasoning, Hallucination, and Interactivity

Yejin Bang, Samuel Cahyawijaya, Nayeon Lee, Wenliang Dai, Dan Su, Bryan Wilie, Holy Lovenia, Ziwei Ji, Tiezheng Yu, Willy Chung, Quyet V. Do, Yan Xu, Pascale Fung

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

Comments 45 pages, AACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13186 2023-10-24 cs.CL cs.AI 84%

SCITAB: A Challenging Benchmark for Compositional Reasoning and Claim Verification on Scientific Tables

Xinyuan Lu, Liangming Pan, Qian Liu, Preslav Nakov, Min-Yen Kan

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments Accepted at EMNLP 2023 (main conference, long paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.09117 2023-10-02 cs.CL cs.AI 84%

Contrastive Decoding Improves Reasoning in Large Language Models

Sean O'Brien, Mike Lewis

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments 9 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.06100 2023-05-12 cs.CL cs.AI 84%

Can GPT-3 Perform Statutory Reasoning?

Andrew Blair-Stanek, Nils Holzenberger, Benjamin Van Durme

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.10266 2022-01-26 cs.AI cs.CV cs.LG cs.LO cs.RO 84%

Combining Commonsense Reasoning and Knowledge Acquisition to Guide Deep Learning in Robotics

Mohan Sridharan, Tiago Mota

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI、cs.LG

Comments 37 pages, 17 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22016 2026-08-11 cs.LG cs.AI cs.CL 版本更新 83%

ROM: Real-time Overthinking Mitigation via Streaming Detection and Intervention

ROM:通过流式检测和干预实时抑制过度思考

Xinyan Wang, Xiaogeng Liu, Ming Pei, Chaowei Xiao

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract_cn);self-correction(abstract)

AI总结 ROM通过流式检测和干预框架减少大推理模型的过度思考,提升准确率并缩短响应长度,在多个数据集上均取得显著效果。

Comments Code is available at https://github.com/SaFo-Lab/ROM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18262 2026-06-18 cs.HC 新提交 83%

When Prompts Mislead: Textual Dominance and Diagnostic Bias in MLLMs

当提示误导:多模态大语言模型中的文本主导与诊断偏差

Inhyuk Park, Doohyun Park

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);self-correction(abstract)

AI总结 研究揭示在医学多模态大语言模型中,文本提示会主导视觉线索,导致诊断偏差,即使模型具备空间定位能力,提示策略仍可能不安全。

Comments Accepted to the CVPR 2026 MMFM-BIOMED Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22873 2026-06-16 cs.LG cs.AI cs.CL 版本更新 83%

When Do LLMs Reason? A Dynamical Systems View via Entropy Phase Transitions

LLM何时推理?基于熵相变的动力系统视角

Wei Xia, Haoqing Wang, Zhi-Hong Deng, Yehui Tang

机构 * Samsung Research(三星研究院) State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(通用人工智能国家重点实验室,北京理工大学)

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过早期解码熵动态检测LLM的推理状态,提出轻量级无训练路由框架EDRM,自适应选择推理策略,在减少token消耗的同时提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21411 2026-05-21 cs.CV 83%

RoadTones: Tone Controllable Text Generation from Road Event Videos

RoadTones: 从道路事件视频生成可调节语气的文本

Chirag Parikh, Siddhi Pravin Lipare, Ravi Kiran Sarvadevabhatla

机构 * CVIT & iHub-Data, IIIT Hyderabad, India(CVIT与iHub-Data,IIIT海得拉巴,印度)

专题命中 推理评测 :CoT(summary_cn,abstract);chain-of-thought(abstract)

AI总结 本文提出RoadTones-51K数据集和RoadTones-VL-CoT模型,通过生成语气条件的推理草稿提升可解释性,并引入RoadTones-Eval评估体系,共同为上下文敏感的可调节视频描述奠定基础。

Comments Accepted at CVPR Findings 2026. Project page: https://roadtones.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22245 2026-04-27 eess.AS 83%

Listening with Time: Precise Temporal Awareness for Long-Form Audio Understanding

通过时间聆听:为长音频理解实现精确的时间意识

Mingchen Shao, Hang Su, Wenjie Tian, Bingshen Mu, Zhennan Lin, Lichun Fan, Zhenbo Luo, Jian Luan, Lei Xie

专题命中 推理评测 :chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn);reasoning(abstract)

AI总结 本文提出LAT-Audio模型,通过构建长音频数据集和基准测试,解决长音频时间意识任务中的性能下降问题,提升模型对长音频的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12997 2025-10-21 cs.LG cs.AI cs.CL 83%

Max It or Miss It: Benchmarking LLM On Solving Extremal Problems

Binxin Gao, Jingjun Han

机构 * University of Maryland(马里兰大学) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

Comments Our benchmark dataset is available at https://huggingface.co/datasets/binxingao/extrem-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18791 2025-05-27 cs.CL cs.AI cs.LG 83%

Can LLMs Help Uncover Insights about LLMs? A Large-Scale, Evolving Literature Analysis of Frontier LLMs

Jungsoo Park, Junmo Kang, Gabriel Stanovsky, Alan Ritter

机构 * Georgia Institute of Technology(佐治亚理工学院) The Hebrew University of Jerusalem(特拉维夫大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);math reasoning(abstract)

Comments ACL 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15263 2025-04-22 cs.RO 83%

Interpretable Locomotion Prediction in Construction Using a Memory-Driven LLM Agent With Chain-of-Thought Reasoning

Ehsan Ahmadi, Chao Wang

机构 * Bert S. Turner Department of Construction Management, Louisiana State University, Baton Rouge, LA 70803(伯特·S·特纳建设管理系,路易斯安那州立大学,巴吞鲁日,LA 70803)

专题命中 推理评测 :reasoning(title);chain-of-thought(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24376 2025-04-01 cs.CV cs.AI cs.CL cs.LG 83%

Exploring the Effect of Reinforcement Learning on Video Understanding: Insights from SEED-Bench-R1

Yi Chen, Yuying Ge, Rui Wang, Yixiao Ge, Lu Qiu, Ying Shan, Xihui Liu

专题命中 推理评测 :reasoning(abstract);CoT(abstract);planning(abstract);logical reasoning(abstract)

Comments Technical Report (In Progress); Code released at: https://github.com/TencentARC/SEED-Bench-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00481 2024-12-03 eess.SP 83%

MaintAGT:Sim2Real-Guided Multimodal Large Model for Intelligent Maintenance with Chain-of-Thought Reasoning

Hongliang He, Jinfeng Huang, Qi Li, Xu Wang, Feibin Zhang, Kangding Yang, Li Meng, Fulei Chu

专题命中 推理评测 :reasoning(title);chain-of-thought(title)

详情

展开后加载摘要…

URL PDF HTML 收藏