arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10439 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10439 篇

2503.07018 2025-03-11 cs.CL 79%

Toward Multi-Session Personalized Conversation: A Large-Scale Dataset and Hierarchical Tree Framework for Implicit Reasoning

Xintong Li, Jalend Bantupalli, Ria Dharmani, Yuwei Zhang, Jingbo Shang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01145 2025-03-07 cs.CL 79%

Dual Reasoning: A GNN-LLM Collaborative Framework for Knowledge Graph Question Answering

Guangyi Liu, Yongqi Zhang, Yong Li, Quanming Yao

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00841 2025-03-04 cs.AI 79%

A Law Reasoning Benchmark for LLM with Tree-Organized Structures including Factum Probandum, Evidence and Experiences

Jiaxin Shen, Jinan Xu, Huiqi Hu, Luyi Lin, Fei Zheng, Guoyang Ma, Fandong Meng, Jie Zhou, Wenjuan Han

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04046 2025-03-04 cs.CC cs.AI 79%

ActionReasoningBench: Reasoning about Actions with and without Ramification Constraints

Divij Handa, Pavel Dolin, Shrinidhi Kumbhar, Tran Cao Son, Chitta Baral

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments Accepted in ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09961 2025-03-03 cs.SE cs.CL cs.CV 79%

ChartMimic: Evaluating LMM's Cross-Modal Reasoning Capability via Chart-to-Code Generation

Cheng Yang, Chufan Shi, Yaxin Liu, Bo Shui, Junjie Wang, Mohan Jing, Linran Xu, Xinyu Zhu, Siheng Li, Yuxiang Zhang, Gongye Liu, Xiaomei Nie, Deng Cai, Yujiu Yang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Accepted to ICLR 2025. Data and code are available at https://github.com/ChartMimic/ChartMimic

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17807 2025-02-26 cs.AI 79%

DocPuzzle: A Process-Aware Benchmark for Evaluating Realistic Long-Context Reasoning Capabilities

Tianyi Zhuang, Chuqiao Kuang, Xiaoguang Li, Yihua Teng, Jihao Wu, Yasheng Wang, Lifeng Shang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13042 2025-02-26 cs.CL 79%

Does Table Source Matter? Benchmarking and Improving Multimodal Scientific Table Understanding and Reasoning

Bohao Yang, Yingji Zhang, Dong Liu, André Freitas, Chenghua Lin

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16922 2025-02-25 cs.CL 79%

Benchmarking Temporal Reasoning and Alignment Across Chinese Dynasties

Zhenglin Wang, Jialong Wu, Pengfei LI, Yong Jiang, Deyu Zhou

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16428 2025-02-25 cs.CV cs.AI 79%

Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT

Nidhal Jegham, Marwan Abdelatti, Abdeltawab Hendawi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16268 2025-02-25 cs.CL 79%

ThinkBench: Dynamic Out-of-Distribution Evaluation for Robust LLM Reasoning

Shulin Huang, Linyi Yang, Yan Song, Shuang Chen, Leyang Cui, Ziyu Wan, Qingcheng Zeng, Ying Wen, Kun Shao, Weinan Zhang, Jun Wang, Yue Zhang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14588 2025-02-25 cs.CL 79%

Beyond Guilt: Legal Judgment Prediction with Trichotomous Reasoning

Kepu Zhang, Haoyue Yang, Xu Tang, Weijie Yu, Jun Xu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14083 2025-02-21 cs.CL 79%

Are Rules Meant to be Broken? Understanding Multilingual Moral Reasoning as a Computational Pipeline with UniMoral

Shivani Kumar, David Jurgens

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments 21 pages, 10 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13119 2025-02-20 cs.CL 79%

STEER-ME: Assessing the Microeconomic Reasoning of Large Language Models

Narun Raman, Taylor Lundy, Thiago Amin, Jesse Perla, Kevin Leyton-Brown

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10674 2025-02-19 cs.CV cs.CL 79%

Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!

Mohamed Fazli Imam, Chenyang Lyu, Alham Fikri Aji

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Our dataset can be found at \url{https://huggingface.co/datasets/fazliimam/temporal-vqa}

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09447 2025-02-14 cs.CV cs.CL 79%

Pixel-Level Reasoning Segmentation via Multi-turn Conversations

Dexian Cai, Xiaocui Yang, Yongkang Liu, Daling Wang, Shi Feng, Yifei Zhang, Soujanya Poria

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08954 2025-02-14 cs.CL 79%

Medicine on the Edge: Comparative Performance Analysis of On-Device LLMs for Clinical Reasoning

Leon Nissen, Philipp Zagar, Vishnu Ravi, Aydin Zahedivash, Lara Marie Reimer, Stephan Jonas, Oliver Aalami, Paul Schmiedmayer

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08235 2025-02-13 cs.AI 79%

The Danger of Overthinking: Examining the Reasoning-Action Dilemma in Agentic Tasks

Alejandro Cuadron, Dacheng Li, Wenjie Ma, Xingyao Wang, Yichuan Wang, Siyuan Zhuang, Shu Liu, Luis Gaspar Schroeder, Tian Xia, Huanzhi Mao, Nicholas Thumiger, Aditya Desai, Ion Stoica, Ana Klimovic, Graham Neubig, Joseph E. Gonzalez

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08148 2025-02-13 cs.AI 79%

ACCESS : A Benchmark for Abstract Causal Event Discovery and Reasoning

Vy Vo, Lizhen Qu, Tao Feng, Yuncheng Hua, Xiaoxi Kang, Songhai Fan, Tim Dwyer, Lay-Ki Soon, Gholamreza Haffari

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Journal ref Proceedings of the 2025 Conference of the North American Chapter of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07912 2025-02-13 cs.CL 79%

Elevating Legal LLM Responses: Harnessing Trainable Logical Structures and Semantic Knowledge with Legal Reasoning

Rujing Yao, Yang Wu, Chenghao Wang, Jingwei Xiong, Fang Wang, Xiaozhong Liu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08597 2025-01-16 cs.CL 79%

Dynamic Knowledge Integration for Enhanced Vision-Language Reasoning

Julian Perry, Surasakdi Siripong, Thanakorn Phonchai

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14526 2025-01-14 cs.SD cs.CL eess.AS 79%

What Are They Doing? Joint Audio-Speech Co-Reasoning

Yingzhi Wang, Pooneh Mousavi, Artem Ploujnikov, Mirco Ravanelli

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Accepted to ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01290 2025-01-03 cs.CL 79%

ToolComp: A Multi-Tool Reasoning & Process Supervision Benchmark

Vaskar Nath, Pranav Raja, Claire Yoon, Sean Hendryx

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11711 2024-12-25 cs.CL 79%

MiMoTable: A Multi-scale Spreadsheet Benchmark with Meta Operations for Table Reasoning

Zheng Li, Yang Du, Mao Zheng, Mingyang Song

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Accepted by COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16849 2024-12-24 cs.AI 79%

OpenRFT: Adapting Reasoning Foundation Model for Domain-specific Tasks with Reinforcement Fine-Tuning

Yuxiang Zhang, Yuqi Yang, Jiangming Shu, Yuhang Wang, Jinlin Xiao, Jitao Sang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19732 2024-12-23 cs.CL cs.CV 79%

Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models

Yucheng Zhou, Zhi Rao, Jun Wan, Jianbing Shen

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11763 2024-12-17 cs.CL 79%

QUENCH: Measuring the gap between Indic and Non-Indic Contextual General Reasoning in LLMs

Mohammad Aflah Khan, Neemesh Yadav, Sarah Masud, Md. Shad Akhtar

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments 17 Pages, 6 Figures, 8 Tables, COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18375 2024-12-17 cs.CL 79%

Thai Winograd Schemas: A Benchmark for Thai Commonsense Reasoning

Phakphum Artkaew

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Accepted to SEALP 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15891 2024-11-26 cs.LG 79%

From Laws to Motivation: Guiding Exploration through Law-Based Reasoning and Rewards

Ziyu Chen, Zhiqing Xiao, Xinbei Jiang, Junbo Zhao

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07681 2024-11-19 cs.LG 79%

What Do Learning Dynamics Reveal About Generalization in LLM Reasoning?

Katie Kang, Amrith Setlur, Dibya Ghosh, Jacob Steinhardt, Claire Tomlin, Sergey Levine, Aviral Kumar

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00369 2024-11-11 cs.CL 79%

GRS-QA -- Graph Reasoning-Structured Question Answering Dataset

Anish Pahilajani, Devasha Trivedi, Jincen Shuai, Khin S. Yone, Samyak Rajesh Jain, Namyong Park, Ryan A. Rossi, Nesreen K. Ahmed, Franck Dernoncourt, Yu Wang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments 15 pages, 24 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏