arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10414 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10414 篇

2505.17897 2025-05-26 cs.AI cs.CL 81%

T2I-Eval-R1: Reinforcement Learning-Driven Reasoning for Interpretable Text-to-Image Evaluation

Zi-Ao Ma, Tian Lan, Rong-Cheng Tu, Shu-Hang Liu, Heyan Huang, Zhijing Wu, Chen Xu, Xian-Ling Mao

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16673 2025-05-23 cs.CV cs.AI cs.CL 81%

R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO

Huanjin Yao, Qixiang Yin, Jingyi Zhang, Min Yang, Yibo Wang, Wenhao Wu, Fei Su, Li Shen, Minghui Qiu, Dacheng Tao, Jiaxing Huang

机构 * Nanyang Technological University(南洋理工大学) ByteDance(字节跳动) Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) The University of Sydney(悉尼大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15245 2025-05-22 cs.CL cs.AI 81%

Towards Explainable Temporal Reasoning in Large Language Models: A Structure-Aware Generative Framework

Zihao Jiang, Ben Liu, Miao Peng, Wenjie Xu, Yao Xiao, Zhenyan Shan, Min Peng

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments In Findings of the Association for Computational Linguistics: ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20930 2025-05-22 cs.AI cs.CL cs.CV 81%

ChestX-Reasoner: Advancing Radiology Foundation Models with Reasoning through Step-by-Step Verification

Ziqing Fan, Cheng Liang, Chaoyi Wu, Ya Zhang, Yanfeng Wang, Weidi Xie

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14064 2025-05-21 eess.IV cs.AI cs.CV cs.LG 81%

NOVA: A Benchmark for Anomaly Localization and Clinical Reasoning in Brain MRI

Cosmin I. Bercea, Jun Li, Philipp Raffler, Evamaria O. Riedel, Lena Schmitzer, Angela Kurz, Felix Bitzer, Paula Roßmüller, Julian Canisius, Mirjam L. Beyrle, Che Liu, Wenjia Bai, Bernhard Kainz, Julia A. Schnabel, Benedikt Wiestler

机构 * Technical University of Munich(慕尼黑技术大学) Klinikum Rechts der Isar(莱比锡医院) Helmholtz Center Munich(慕尼黑海德堡中心) FAU Erlangen-Nürnberg(埃尔朗根-纽伦堡弗赖堡大学) Imperial College London(伦敦帝国理工学院) King’s College London(伦敦国王学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13498 2025-05-21 cs.CL cs.AI 81%

IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation

Khanh-Tung Tran, Barry O'Sullivan, Hoang D. Nguyen

机构 * University College Cork(科尔克大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11074 2025-05-21 cs.CL cs.AI 81%

RoMath: A Mathematical Reasoning Benchmark in Romanian

Adrian Cosma, Ana-Maria Bucur, Emilian Radoi

机构 * POLITEHNICA Bucharest National University of Science and Technology(巴格达理工大学科学与技术国立大学) Interdisciplinary School of Doctoral Studies, University of Bucharest(布加勒斯特大学跨学科博士研究学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments 5 Figures, 11 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11849 2025-05-20 cs.AI cs.AR cs.LG cs.PL 81%

VeriReason: Reinforcement Learning with Testbench Feedback for Reasoning-Enhanced Verilog Generation

Yiting Wang, Guoheng Sun, Wanghao Ye, Gang Qu, Ang Li

机构 * Department of Electrical Engineering, University of Maryland(电气工程系,马里兰大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01698 2025-05-19 cs.CL cs.AI 81%

Do Theory of Mind Benchmarks Need Explicit Human-like Reasoning in Language Models?

Yi-Long Lu, Chunhui Zhang, Jiajun Song, Lifeng Fan, Wei Wang

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) BIGAI

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10182 2025-05-16 cs.CL cs.LG 81%

Mining Hidden Thoughts from Texts: Evaluating Continual Pretraining with Synthetic Data for LLM Reasoning

Yoichi Ishibashi, Taro Yano, Masafumi Oyamada

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13517 2025-05-14 cs.CL cs.AI 81%

CURIE: Evaluating LLMs On Multitask Scientific Long Context Understanding and Reasoning

Hao Cui, Zahra Shamsi, Gowoon Cheon, Xuejian Ma, Shutong Li, Maria Tikhanovskaya, Peter Norgaard, Nayantara Mudur, Martyna Plomecka, Paul Raccuglia, Yasaman Bahri, Victor V. Albert, Pranesh Srinivasan, Haining Pan, Philippe Faist, Brian Rohr, Ekin Dogus Cubuk, Muratahan Aykol, Amil Merchant, Michael J. Statt, Dan Morris, Drew Purves, Elise Kleeman, Ruth Alcantara, Matthew Abraham, Muqthar Mohammad, Ean Phing VanLee, Chenfei Jiang, Elizabeth Dorfman, Eun-Ah Kim, Michael P Brenner, Viren Jain, Sameera Ponda, Subhashini Venugopalan

机构 * Google(谷歌) Harvard(哈佛大学) University of Zurich(苏黎世大学) NIST(国家标准与技术研究院) UMD College Park(大学公园大学分校) Rutgers(罗格斯大学) FU Berlin(柏林自由大学) Modelyst Cornell(康奈尔大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted at ICLR 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05093 2025-05-13 cs.CL cs.AI 81%

Order Matters in Hallucination: Reasoning Order as Benchmark and Reflexive Prompting for Large-Language-Models

Zikai Xie

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments 8 pages, submitted to ACL ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15627 2025-05-07 cs.LG cs.AI 81%

HardML: A Benchmark For Evaluating Data Science And Machine Learning knowledge and reasoning in AI

Tidor-Vlad Pricope

机构 * Independent Machine Learning Engineer(独立机器学习工程师)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01539 2025-05-06 cs.AI cs.LG 81%

Parameterized Argumentation-based Reasoning Tasks for Benchmarking Generative Language Models

Cor Steging, Silja Renooij, Bart Verheij

机构 * Bernoulli Institute of Mathematics, Computer Science and Artificial Intelligence, University of Groningen(伯努利数学、计算机科学和人工智能研究所,格罗宁根大学) Department of Information and Computing Sciences, Utrecht University(信息与计算科学系,乌得勒支大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments This manuscript has been accepted for presentation as a short paper at the 20th International Conference of AI & Law in Chicago, June 16 to 20 of 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12511 2025-04-18 cs.HC cs.AI cs.CV cs.LG 81%

Multimodal LLM Augmented Reasoning for Interpretable Visual Perception Analysis

Shravan Chaudhari, Trilokya Akula, Yoon Kim, Tom Blake

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12256 2025-04-17 cs.CV cs.AI cs.LG 81%

FLIP Reasoning Challenge

Andreas Plesner, Turlan Kuzhagaliyev, Roger Wattenhofer

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments Published at First Workshop on Open Science for Foundation Models at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19955 2025-04-17 cs.LG cs.AI cs.IR 81%

Bridging Stepwise Lab-Informed Pretraining and Knowledge-Guided Learning for Diagnostic Reasoning

Pengfei Hu, Chang Lu, Fei Wang, Yue Ning

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11186 2025-04-16 cs.CL cs.AI 81%

Benchmarking Next-Generation Reasoning-Focused Large Language Models in Ophthalmology: A Head-to-Head Evaluation on 5,888 Items

Minjie Zou, Sahana Srinivasan, Thaddaeus Wai Soon Lo, Ke Zou, Gabriel Dawei Yang, Xuguang Ai, Hyunjae Kim, Maxwell Singer, Fares Antaki, Kelvin Li, Robert Chang, Marcus Tan, David Ziyou Chen, Dianbo Liu, Qingyu Chen, Yih Chung Tham

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments 83 pages, 6 figures, 3 tables, 9 supplementary figures, 7 supplementary tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09421 2025-04-16 cs.CL cs.AI 81%

ClinicalGPT-R1: Pushing reasoning capability of generalist disease diagnosis with large language model

Wuyang Lan, Wenzheng Wang, Changwei Ji, Guoxing Yang, Yongbo Zhang, Xiaohong Liu, Song Wu, Guangyu Wang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07087 2025-04-10 cs.CL cs.AI cs.IR 81%

KG-LLM-Bench: A Scalable Benchmark for Evaluating LLM Reasoning on Textualized Knowledge Graphs

Elan Markowitz, Krupa Galiya, Greg Ver Steeg, Aram Galstyan

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments To be presented at NAACL-HLT, KnowledgeNLP Workshop (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10380 2025-04-02 cs.CV cs.AI cs.CL cs.IR 81%

NTSEBENCH: Cognitive Reasoning Benchmark for Vision Language Models

Pranshu Pandya, Vatsal Gupta, Agney S Talwarr, Tushar Kataria, Dan Roth, Vivek Gupta

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments 28 pages, 3 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00472 2025-04-02 cs.CL cs.AI 81%

Memorizing is Not Enough: Deep Knowledge Injection Through Reasoning

Ruoxi Xu, Yunjie Ji, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Ben He, Yingfei Sun, Xiangang Li, Le Sun

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23157 2025-04-02 cs.LG cs.AI cs.DB cs.PL 81%

Reasoning-SQL: Reinforcement Learning with SQL Tailored Partial Rewards for Reasoning-Enhanced Text-to-SQL

Mohammadreza Pourreza, Shayan Talaei, Ruoxi Sun, Xingchen Wan, Hailong Li, Azalia Mirhoseini, Amin Saberi, Sercan "O. Arik

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments Mohammadreza Pourreza and Shayan Talaei contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23084 2025-04-01 cs.CL cs.AI 81%

The Reasoning-Memorization Interplay in Language Models Is Mediated by a Single Direction

Yihuai Hong, Dian Zhou, Meng Cao, Lei Yu, Zhijing Jin

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19193 2025-03-26 cs.AI cs.CL cs.IR cs.MA 81%

Browsing Lost Unformed Recollections: A Benchmark for Tip-of-the-Tongue Search and Reasoning

Sky CH-Wang, Darshan Deshpande, Smaranda Muresan, Anand Kannappan, Rebecca Qian

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01895 2025-03-17 cs.LG cs.AI 81%

Evaluating System 1 vs. 2 Reasoning Approaches for Zero-Shot Time Series Forecasting: A Benchmark and Insights

Haoxin Liu, Zhiyuan Zhao, Shiduo Li, B. Aditya Prakash

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09326 2025-03-13 cs.CL cs.AI 81%

A Survey on Enhancing Causal Reasoning Ability of Large Language Models

Xin Li, Zhuo Cai, Shoujin Wang, Kun Yu, Fang Chen

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04415 2025-03-11 cs.AI cs.LG 81%

Geometric Analysis of Reasoning Trajectories: A Phase Space Approach to Understanding Valid and Invalid Multi-Hop Reasoning in LLMs

Javier Marin

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05212 2025-03-10 cs.CL cs.AI 81%

Knowledge Updating? No More Model Editing! Just Selective Contextual Reasoning

Guoxiu He, Xin Song, Aixin Sun

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04801 2025-03-10 cs.CL cs.AI 81%

Exploring and Evaluating Multimodal Knowledge Reasoning Consistency of Multimodal Large Language Models

Boyu Jia, Junzhe Zhang, Huixuan Zhang, Xiaojun Wan

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏