arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10414 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10414 篇

2503.03983 2025-03-07 cs.SD cs.CL cs.LG eess.AS 81%

Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities

Sreyan Ghosh, Zhifeng Kong, Sonal Kumar, S Sakshi, Jaehyeon Kim, Wei Ping, Rafael Valle, Dinesh Manocha, Bryan Catanzaro

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12753 2025-03-07 cs.CL cs.AI 81%

OlympicArena: Benchmarking Multi-discipline Cognitive Reasoning for Superintelligent AI

Zhen Huang, Zengzhi Wang, Shijie Xia, Xuefeng Li, Haoyang Zou, Ruijie Xu, Run-Ze Fan, Lyumanshan Ye, Ethan Chern, Yixin Ye, Yikai Zhang, Yuqing Yang, Ting Wu, Binjie Wang, Shichao Sun, Yang Xiao, Yiyuan Li, Fan Zhou, Steffi Chern, Yiwei Qin, Yan Ma, Jiadi Su, Yixiu Liu, Yuxiang Zheng, Shaoting Zhang, Dahua Lin, Yu Qiao, Pengfei Liu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15683 2025-03-07 cs.CV cs.AI cs.CL 81%

Visual Description Grounding Reduces Hallucinations and Boosts Reasoning in LVLMs

Sreyan Ghosh, Chandra Kiran Reddy Evuru, Sonal Kumar, Utkarsh Tyagi, Oriol Nieto, Zeyu Jin, Dinesh Manocha

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to ICLR 2025. Project: https://sreyan88.github.io/VDGD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00912 2025-03-04 cs.CL cs.AI 81%

HiBench: Benchmarking LLMs Capability on Hierarchical Structure Reasoning

Zhuohang Jiang, Pangjing Wu, Ziran Liang, Peter Q. Chen, Xu Yuan, Ye Jia, Jiancheng Tu, Chen Li, Peter H. F. Ng, Qing Li

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09542 2025-03-03 cs.CL cs.AI 81%

MIRAGE: Evaluating and Explaining Inductive Reasoning Process in Language Models

Jiachun Li, Pengfei Cao, Zhuoran Jin, Yubo Chen, Kang Liu, Jun Zhao

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted as ICLR 2025 conference paper (26 pages, 16 tables, 9 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20508 2025-03-03 cs.CL cs.AI 81%

TripCraft: A Benchmark for Spatio-Temporally Fine Grained Travel Planning

Soumyabrata Chaudhuri, Pranav Purkar, Ritwik Raghav, Shubhojit Mallick, Manish Gupta, Abhik Jana, Shreya Ghosh

专题命中 推理评测 :planning(title,abstract);分类 cs.CL、cs.AI

Comments 27 pages, 18 Tables and 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13766 2025-02-26 cs.CL cs.AI 81%

UGMathBench: A Diverse and Dynamic Benchmark for Undergraduate-Level Mathematical Reasoning with Large Language Models

Xin Xu, Jiaxin Zhang, Tianhao Chen, Zitong Chao, Jishan Hu, Can Yang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to ICLR 2025

Journal ref International Conference on Learning Representations (ICLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16171 2025-02-25 cs.CL cs.AI 81%

EPERM: An Evidence Path Enhanced Reasoning Model for Knowledge Graph Question and Answering

Xiao Long, Liansheng Zhuang, Aodi Li, Minghong Yao, Shafei Wang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15810 2025-02-25 cs.CL cs.AI 81%

Zero-Shot Commonsense Validation and Reasoning with Large Language Models: An Evaluation on SemEval-2020 Task 4 Dataset

Rawand Alfugaha, Mohammad AL-Smadi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02007 2025-02-21 cs.CL cs.LG 81%

Reasoning Bias of Next Token Prediction Training

Pengxiao Lin, Zhongwang Zhang, Zhi-Qin John Xu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

Comments 19 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12499 2025-02-18 cs.CL cs.AI 81%

LinguaLIFT: An Effective Two-stage Instruction Tuning Framework for Low-Resource Language Reasoning

Hongbin Zhang, Kehai Chen, Xuefeng Bai, Yang Xiang, Min Zhang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06394 2025-02-18 cs.AI cs.CL 81%

GameArena: Evaluating LLM Reasoning through Live Computer Games

Lanxiang Hu, Qiyu Li, Anze Xie, Nan Jiang, Ion Stoica, Haojian Jin, Hao Zhang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08859 2025-02-17 cs.AI cs.CL 81%

EnigmaEval: A Benchmark of Long Multimodal Reasoning Challenges

Clinton J. Wang, Dean Lee, Cristina Menghini, Johannes Mols, Jack Doughty, Adam Khoja, Jayson Lynch, Sean Hendryx, Summer Yue, Dan Hendrycks

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18409 2025-02-14 cs.AI cs.CL cs.CV 81%

A Cognitive Evaluation Benchmark of Image Reasoning and Description for Large Vision-Language Models

Xiujie Song, Mengyue Wu, Kenny Q. Zhu, Chunhao Zhang, Yanyi Chen

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07980 2025-02-13 cs.LG cs.AI 81%

CIRCUIT: A Benchmark for Circuit Interpretation and Reasoning Capabilities of LLMs

Lejla Skelic, Yan Xu, Matthew Cox, Wenjie Lu, Tao Yu, Ruonan Han

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06873 2025-02-12 cs.CL cs.AI 81%

Multimodal Cognitive Reframing Therapy via Multi-hop Psychotherapeutic Reasoning

Subin Kim, Hoonrae Kim, Heejin Do, Gary Geunbae Lee

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments NAACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06279 2025-02-11 cs.CL cs.LG 81%

DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models

Utkarsh Tiwari, Aryan Seth, Adi Mukherjee, Kaavya Mer, Kavish, Dhruv Kumar

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17874 2025-02-11 cs.CL cs.AI 81%

Evaluating LLM Reasoning in the Operations Research Domain with ORQA

Mahdi Mostajabdaveh, Timothy T. Yu, Samarendra Chandan Bindu Dash, Rindranirina Ramamonjison, Jabo Serge Byusa, Giuseppe Carenini, Zirui Zhou, Yong Zhang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments 12 pages, 10 figures. Accepted and to be published in AAAI25

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16361 2025-01-29 cs.LG cs.AI 81%

Large Language Models Meet Graph Neural Networks for Text-Numeric Graph Reasoning

Haoran Song, Jiarui Feng, Guangfu Li, Michael Province, Philip Payne, Yixin Chen, Fuhai Li

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments 29 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09775 2025-01-28 cs.CL cs.AI 81%

Multiple Choice Questions: Reasoning Makes Large Language Models (LLMs) More Self-Confident Even When They Are Wrong

Tairan Fu, Javier Conde, Gonzalo Martínez, María Grandury, Pedro Reviriego

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10642 2025-01-27 cs.CL cs.LG 81%

Self-playing Adversarial Language Game Enhances LLM Reasoning

Pengyu Cheng, Tianhao Hu, Han Xu, Zhisong Zhang, Zheng Yuan, Yong Dai, Lei Han, Nan Du, Xiaolong Li

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13833 2025-01-24 cs.AI cs.CL cs.IT math.IT 81%

On the Reasoning Capacity of AI Models and How to Quantify It

Santosh Kumar Radha, Oktay Goktas

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07240 2025-01-15 cs.CL cs.AI 81%

UTMath: Math Evaluation with Unit Test via Reasoning-to-Coding Thoughts

Bo Yang, Qingping Yang, Yingwei Ma, Runtao Liu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06715 2025-01-14 cs.CL cs.AI 81%

ZNO-Eval: Benchmarking reasoning capabilities of large language models in Ukrainian

Mykyta Syromiatnikov, Victoria Ruvinskaya, Anastasiya Troynina

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments 7 pages, 5 figures. X International conference "Informatics. Culture. Technology." (2024)

Journal ref X International conference "Informatics. Culture. Technology." (2024) 185-191

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16837 2025-01-14 cs.CV cs.AI cs.CL 81%

MLLM-CompBench: A Comparative Reasoning Benchmark for Multimodal LLMs

Jihyung Kil, Zheda Mai, Justin Lee, Zihe Wang, Kerrie Cheng, Lemeng Wang, Ye Liu, Arpita Chowdhury, Wei-Lun Chao

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments This paper has been accepted to NeurIPS 2024. The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04167 2025-01-09 cs.CL cs.AI cs.IR 81%

Reasoning-Enhanced Self-Training for Long-Form Personalized Text Generation

Alireza Salemi, Cheng Li, Mingyang Zhang, Qiaozhu Mei, Weize Kong, Tao Chen, Zhuowan Li, Michael Bendersky, Hamed Zamani

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09614 2024-12-30 cs.CL cs.AI 81%

Reasoning over Uncertain Text by Generative Large Language Models

Aliakbar Nafar, Kristen Brent Venable, Parisa Kordjamshidi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18194 2024-12-25 cs.RO cs.AI cs.CL cs.CV 81%

VLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning Tasks

Shiduo Zhang, Zhe Xu, Peiju Liu, Xiaopeng Yu, Yuan Li, Qinghui Gao, Zhaoye Fei, Zhangyue Yin, Zuxuan Wu, Yu-Gang Jiang, Xipeng Qiu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01446 2024-12-24 cs.CL cs.AI 81%

Adaptive-Solver Framework for Dynamic Strategy Selection in Large Language Model Reasoning

Jianpeng Zhou, Wanjun Zhong, Yanlin Wang, Jiahai Wang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by Information Processing & Management

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19813 2024-12-20 cs.CL cs.AI 81%

Improving Retrieval Augmented Language Model with Self-Reasoning

Yuan Xia, Jingbo Zhou, Zhenhui Shi, Jun Chen, Haifeng Huang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments AAAI 2025 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏