arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10439 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10439 篇

2405.15638 2025-04-28 cs.CV cs.CL 79%

M4U: Evaluating Multilingual Understanding and Reasoning for Large Multimodal Models

Hongyu Wang, Jiayu Xu, Senwei Xie, Ruiping Wang, Jialin Li, Zhaojie Xie, Bin Zhang, Chuyan Xiong, Xilin Chen

机构 * Key Laboratory of AI Safety of Chinese Academy of Sciences (CAS)(中国科学院人工智能安全重点实验室(中国科学院)) Institute of Computing Technology, CAS(中国科学院计算技术研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12597 2025-04-25 cs.CL 79%

GeoSense: Evaluating Identification and Application of Geometric Principles in Multimodal Reasoning

Liangyu Xu, Yingxiu Zhao, Jingyun Wang, Yingyao Wang, Bu Pi, Chen Wang, Mingliang Zhang, Jihao Gu, Xiang Li, Xiaoyong Zhu, Jun Song, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba Beijing China(阿里巴巴北京公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15903 2025-04-25 cs.AI 79%

Impact of Noise on LLM-Models Performance in Abstraction and Reasoning Corpus (ARC) Tasks with Model Temperature Considerations

Nikhil Khandalkar, Pavan Yadav, Krishna Shinde, Lokesh B. Ramegowda, Rajarshi Das

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments 60 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18203 2025-04-24 cs.CV cs.CL 79%

Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning

Di Zhang, Junxian Li, Jingdi Lei, Xunzhi Wang, Yujie Liu, Zonglin Yang, Jiatong Li, Weida Wang, Suorong Yang, Jianbo Wu, Peng Ye, Wanli Ouyang, Dongzhan Zhou

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) Nankai University(南开大学) Shanghai University(上海大学) Nanyang Technological University(南洋理工大学) Hong Kong Polytechnic University(香港理工大学) Tongji University(同济大学) Nanjing University(南京大学) University of California, Merced(加州大学梅德福分校) Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15716 2025-04-23 cs.AI 79%

DianJin-R1: Evaluating and Enhancing Financial Reasoning in Large Language Models

Jie Zhu, Qian Chen, Huaixia Dou, Junhui Li, Lifan Guo, Feng Chen, Chi Zhang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15415 2025-04-23 cs.CV cs.CL 79%

IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs

David Ma, Yuanxing Zhang, Jincheng Ren, Jarvis Guo, Yifan Yao, Zhenlin Wei, Zhenzhu Yang, Zhongyuan Peng, Boyu Feng, Jun Ma, Xiao Gu, Zhoufutu Wen, King Zhu, Yancheng He, Meng Cao, Shiwen Ni, Jiaheng Liu, Wenhao Huang, Ge Zhang, Xiaojie Jin

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14462 2025-04-22 cs.CL 79%

CoLoTa: A Dataset for Entity-based Commonsense Reasoning over Long-Tail Knowledge

Armin Toroghi, Willis Guo, Scott Sanner

机构 * University of Toronto(多伦多大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10358 2025-04-15 cs.CV cs.AI 79%

FingER: Content Aware Fine-grained Evaluation with Reasoning for AI-Generated Videos

Rui Chen, Lei Sun, Jing Tang, Geng Li, Xiangxiang Chu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07825 2025-04-11 cs.CL 79%

What the HellaSwag? On the Validity of Common-Sense Reasoning Benchmarks

Pavel Chizhov, Mattia Nee, Pierre-Carl Langlais, Ivan P. Yamshchikov

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05782 2025-04-09 cs.CV cs.AI 79%

MDK12-Bench: A Multi-Discipline Benchmark for Evaluating Reasoning in Multimodal Large Language Models

Pengfei Zhou, Fanrui Zhang, Xiaopeng Peng, Zhaopan Xu, Jiaxin Ai, Yansheng Qiu, Chuanhao Li, Zhen Li, Ming Li, Yukang Feng, Jianwen Sun, Haoquan Zhang, Zizhen Li, Xiaofeng Mao, Wangbo Zhao, Kai Wang, Xiaojun Chang, Wenqi Shao, Yang You, Kaipeng Zhang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05725 2025-04-09 cs.CV cs.AI 79%

Black Swan: Abductive and Defeasible Video Reasoning in Unpredictable Events

Aditya Chinchure, Sahithya Ravi, Raymond Ng, Vered Shwartz, Boyang Li, Leonid Sigal

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments CVPR 2025. For data, visit https://blackswan.cs.ubc.ca

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03164 2025-04-08 cs.CV cs.AI 79%

NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving

Kexin Tian, Jingrui Mao, Yunlong Zhang, Jiwan Jiang, Yang Zhou, Zhengzhong Tu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01879 2025-04-03 cs.CL cs.CV cs.IR 79%

TransientTables: Evaluating LLMs' Reasoning on Temporally Evolving Semi-structured Tables

Abhilash Shankarampeta, Harsh Mahajan, Tushar Kataria, Dan Roth, Vivek Gupta

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments 19 Pages. 21 Tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01296 2025-04-03 cs.CL 79%

ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning

Bairu Hou, Yang Zhang, Jiabao Ji, Yujian Liu, Kaizhi Qian, Jacob Andreas, Shiyu Chang

专题命中 推理评测 :chain-of-thought(title);reasoning(abstract);分类 cs.CL

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00016 2025-04-02 cs.CL 79%

Medical Reasoning in LLMs: An In-Depth Analysis of DeepSeek R1

Birger Moell, Fredrik Sand Aronsson, Sanian Akbar

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16081 2025-03-31 cs.LG cs.IR 79%

OThink-MR1: Stimulating multimodal generalized reasoning capabilities via dynamic reinforcement learning

Zhiyuan Liu, Yuting Zhang, Feng Liu, Changwang Zhang, Ying Sun, Jun Wang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03562 2025-03-27 cs.CV cs.AI 79%

Towards Visual Discrimination and Reasoning of Real-World Physical Dynamics: Physics-Grounded Anomaly Detection

Wenqiao Li, Yao Gu, Xintao Chen, Xiaohao Xu, Ming Hu, Xiaonan Huang, Yingna Wu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments Accepted by CVPR25

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19633 2025-03-26 cs.CL 79%

1.4 Million Open-Source Distilled Reasoning Dataset to Empower Large Language Model Training

Han Zhao, Haotian Wang, Yiping Peng, Sitong Zhao, Xiaoyu Tian, Shuaiting Chen, Yunjie Ji, Xiangang Li

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05069 2025-03-26 cs.CV cs.AI 79%

Commonsense Video Question Answering through Video-Grounded Entailment Tree Reasoning

Huabin Liu, Filip Ilievski, Cees G. M. Snoek

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18533 2025-03-25 cs.AI 79%

MMCR: Advancing Visual Language Model in Multimodal Multi-Turn Contextual Reasoning

Dawei Yan, Yang Li, Qing-Guo Chen, Weihua Luo, Peng Wang, Haokui Zhang, Chunhua Shen

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18071 2025-03-25 cs.CL 79%

Mind with Eyes: from Language Reasoning to Multimodal Reasoning

Zhiyu Lin, Yifei Gao, Xian Zhao, Yunfan Yang, Jitao Sang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11921 2025-03-24 cs.LG 79%

RePanda: Pandas-powered Tabular Verification and Reasoning

Atoosa Malemir Chegini, Keivan Rezaei, Hamid Eghbalzadeh, Soheil Feizi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13109 2025-03-18 cs.CL 79%

Code-Driven Inductive Synthesis: Enhancing Reasoning Abilities of Large Language Models with Sequences

Kedi Chen, Zhikai Lei, Fan Zhang, Yinqi Zhang, Qin Chen, Jie Zhou, Liang He, Qipeng Guo, Kai Chen, Wei Zhang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12505 2025-03-18 cs.AI cs.CV 79%

MPBench: A Comprehensive Multimodal Reasoning Benchmark for Process Errors Identification

Zhaopan Xu, Pengfei Zhou, Jiaxin Ai, Wangbo Zhao, Kai Wang, Xiaojiang Peng, Wenqi Shao, Hongxun Yao, Kaipeng Zhang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07601 2025-03-18 cs.CV cs.CL 79%

Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models

Jiacong Xu, Shao-Yuan Lo, Bardia Safaei, Vishal M. Patel, Isht Dwivedi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments 19 pages, 10 figures, accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11348 2025-03-17 cs.CL 79%

RESPONSE: Benchmarking the Ability of Language Models to Undertake Commonsense Reasoning in Crisis Situation

Aissatou Diallo, Antonis Bikakis, Luke Dickens, Anthony Hunter, Rob Miller

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02465 2025-03-17 cs.CL 79%

DetectiveQA: Evaluating Long-Context Reasoning on Detective Novels

Zhe Xu, Jiasheng Ye, Xiaoran Liu, Xiangyang Liu, Tianxiang Sun, Zhigeng Liu, Qipeng Guo, Linlin Li, Qun Liu, Xuanjing Huang, Xipeng Qiu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11996 2025-03-14 cs.CL 79%

Holistic Reasoning with Long-Context LMs: A Benchmark for Database Operations on Massive Textual Data

Seiji Maekawa, Hayate Iso, Nikita Bhutani

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments ICLR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05628 2025-03-13 cs.AI 79%

A Unified Framework for Motion Reasoning and Generation in Human Interaction

Jeongeun Park, Sungjoon Choi, Sangdoo Yun

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments https://vim-motion-language.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08540 2025-03-12 cs.SD cs.AI eess.AS 79%

Mellow: a small audio language model for reasoning

Soham Deshmukh, Satvik Dixit, Rita Singh, Bhiksha Raj

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments Checkpoint and dataset available at: https://github.com/soham97/mellow

详情

展开后加载摘要…

URL PDF HTML 收藏