arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10414 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10414 篇

2512.04307 2025-12-05 cs.LG cs.AI 81%

Evaluating Long-Context Reasoning in LLM-Based WebAgents

评估基于大语言模型的WebAgent的长上下文推理能力

Andy Chung, Yichi Zhang, Kaixiang Lin, Aditya Rawal, Qiaozi Gao, Joyce Chai

机构 * University of Michigan(密歇根大学) Amazon(亚马逊)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文评估了基于大语言模型的WebAgent在长上下文场景中的推理能力,发现随着上下文长度增加,性能显著下降,提出隐式RAG方法以改进任务执行。

Comments Accepted NeurIPS 25 LAW Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03082 2025-12-04 cs.CL cs.AI 81%

Alleviating Choice Supportive Bias in LLM with Reasoning Dependency Generation

通过推理依赖生成缓解LLM中的选择支持性偏见

Nan Zhuang, Wenshuo Wang, Lekai Qian, Yuxiao Wang, Boyu Cao, Qi Liu

机构 * School of Future Technology, South China University of Technology(未来技术学院,华南理工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过推理依赖生成缓解LLM中选择支持性偏见的方法,生成无偏推理数据并提升模型在决策任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23143 2025-12-04 cs.AI cs.LG cs.SY eess.SY 81%

MathBode: Measuring the Stability of LLM Reasoning using Frequency Response

MathBode: 通过频率响应测量大语言模型推理的稳定性

Charles L. Wang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 MathBode通过频率响应分析大语言模型推理的稳定性,揭示系统性低通行为和相位滞后,提供可重复的动态诊断方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01992 2025-12-02 cs.AI cs.CL 81%

LLM CHESS: Benchmarking Reasoning and Instruction-Following in LLMs through Chess

LLM CHESS: 通过国际象棋评估大语言模型的推理与指令遵循能力

Sai Kolasani, Maxim Saplin, Nicholas Crispino, Kyle Montgomery, Jared Quincy Davis, Matei Zaharia, Chi Wang, Chenguang Wang

机构 * UC Berkeley(加州大学伯克利分校) Independent Researcher(独立研究者) UC Santa Cruz(加州大学圣克鲁兹分校) Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 LLM CHESS通过国际象棋评估大语言模型的推理与指令遵循能力,揭示了推理模型与非推理模型的显著差异,并提供了评估框架和公开排行榜。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01979 2025-12-02 cs.AI cs.CL cs.CV 81%

Chain-of-Ground: Improving GUI Grounding via Iterative Reasoning and Reference Feedback

Chain-of-Ground: 通过迭代推理和参考反馈提升GUI定位

Aiden Yiliu Li, Bizhi Yu, Daoan Lei, Tianhe Ren, Shilong Liu

机构 * University College London(伦敦大学学院) Chico Future AI Lab(芝加哥未来人工智能实验室) The University of Hong Kong(香港大学) Princeton University(普林斯顿大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 Chain-of-Ground通过迭代推理和参考反馈提升GUI定位,实现68.4的准确率,并在现实世界界面中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15209 2025-12-02 cs.CV cs.AI cs.LG 81%

PRIMA: Multi-Image Vision-Language Models for Reasoning Segmentation

PRIMA:多图像视觉-语言模型用于推理分割

Muntasir Wahed, Kiet A. Nguyen, Adheesh Sunil Juvekar, Xinzhuo Li, Xiaona Zhou, Vedant Shah, Tianjiao Yu, Pinar Yanardag, Ismini Lourentzou

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 PRIMA通过整合像素级定位与多图像推理,提升了多图像分割任务的性能,其在Recall和S-IoU上分别优于现有基线7.83%和11.25%。

Comments Project page: https://plan-lab.github.io/prima

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01943 2025-12-01 cs.CL cs.AI cs.CV cs.RO 81%

ROVER: Recursive Reasoning Over Videos with Vision-Language Models for Embodied Tasks

ROVER:基于视觉语言模型的视频递归推理用于具身任务

Philip Schroeder, Ondrej Biza, Thomas Weng, Hongyin Luo, James Glass

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) RAI Institute(RAI研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 ROVER通过递归分解视频轨迹提升具身任务中的视频推理能力,有效减少幻觉并提高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01584 2025-12-01 cs.AI cs.LG 81%

ReasoningWeekly: A General Knowledge and Verbal Reasoning Challenge for Large Language Models

ReasoningWeekly: 一个面向大语言模型的通用知识和逻辑推理挑战

Zixuan Wu, Francesca Lucchetti, Aleksander Boruch-Gruszecki, Jingmiao Zhao, Carolyn Jane Anderson, Joydeep Biswas, Federico Cassano, Arjun Guha

机构 * Northeastern University(东北大学) Wellesley College(韦尔斯利学院) University of Texas at Austin(德克萨斯大学奥斯汀分校) Cursor

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 ReasoningWeekly是一个基于NPR周日谜题挑战的通用知识和逻辑推理基准,揭示了现有评估中不明显的模型能力差距,并发现了新的推理失败类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20531 2025-11-26 cs.AI cs.CV cs.LG 81%

Beyond Generation: Multi-Hop Reasoning for Factual Accuracy in Vision-Language Models

超越生成:面向视觉语言模型事实准确性的多跳推理

Shamima Hossain

机构 * Department of Computer Science, Brac University(布鲁尔大学计算机科学系) bKash Limited(bKash公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于知识图谱的多跳推理框架,提升视觉语言模型在事实准确性上的表现,通过多步骤推理增强模型的逻辑推理能力。

Comments Accepted as poster at NewInML Workshop ICML, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19496 2025-11-26 cs.LG cs.AI 81%

Xmodel-2.5: 1.3B Data-Efficient Reasoning SLM

Xmodel-2.5: 1.3B数据高效推理SLM

Yang Liu, Xiaolong Zhong, Ling Jiang

机构 * Xiaoduo AI Lab(小多人工智能实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 Xmodel-2.5通过最大更新参数化和混合精度训练,实现了1.3B参数高效推理模型,提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13837 2025-11-25 cs.AI cs.CL cs.CV 81%

Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?

强化学习真的能激励大语言模型在基础模型之外提升推理能力吗?

Yang Yue, Zhiqi Chen, Rui Lu, Andrew Zhao, Zhaokai Wang, Yang Yue, Shiji Song, Gao Huang

机构 * LeapLab, Tsinghua University(清华大学 LeapLab) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究发现RLVR方法未有效激发LLMs的新型推理能力,而蒸馏方法能更有效地扩展模型推理能力。

Comments 31 pages, 27 figures

Journal ref NeurIPS 2025 Oral; ICML 2025 AI4MATH workshop best paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15994 2025-11-21 cs.AI cs.CL 81%

CARE-RAG - Clinical Assessment and Reasoning in RAG

CARE-RAG - 临床评估与推理中的RAG

Deepthi Potluri, Aby Mammen Mathew, Jeffrey B DeWitt, Alexander L. Rasgon, Yide Hao, Junyuan Hong, Ying Ding

机构 * Department of Computer Science(计算机科学系) University of Texas at Austin(德克萨斯大学奥斯汀分校) Behavioral Science and Psychiatry(行为科学与精神病学) Department of Statistics(统计学系) University of Michigan(密歇根大学) School of Information(信息学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 CARE-RAG研究了检索增强生成在临床环境中的推理能力,提出评估框架以确保推理的准确性和一致性。

Comments The Second Workshop on GenAI for Health: Potential, Trust, and Policy Compliance

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15958 2025-11-21 cs.AI cs.CL 81%

JudgeBoard: Benchmarking and Enhancing Small Language Models for Reasoning Evaluation

JudgeBoard: 对小语言模型进行推理评估的基准测试与增强

Zhenyu Bi, Gaurav Srivastava, Yang Li, Meng Lu, Swastik Roy, Morteza Ziyadi, Xuan Wang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 JudgeBoard通过多代理框架提升小语言模型的推理判断能力,展示其在数学和常识推理任务中与大模型相当的性能。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13948 2025-11-19 cs.CV cs.CL cs.LG 81%

EchoAgent: Guideline-Centric Reasoning Agent for Echocardiography Measurement and Interpretation

Matin Daghyani, Lyuyang Wang, Nima Hashemi, Bassant Medhat, Baraa Abdelsamad, Eros Rojas Velez, XiaoXiao Li, Michael Y. C. Tsang, Christina Luong, Teresa S. M. Tsang, Purang Abolmaesumi

机构 * University of British Columbia(不列颠哥伦比亚大学) Vancouver General Hospital(温哥华总医院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

Comments 12 pages, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04688 2025-11-18 cs.CL cs.LG 81%

Evaluating LLMs' Reasoning Over Ordered Procedural Steps

Adrita Anika, Md Messal Monem Miah

机构 * Amazon(亚马逊公司) Texas A&M University(德克萨斯A&M大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

Comments Accepted to IJCNLP-AACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12008 2025-11-18 cs.AI cs.CV cs.LG 81%

Adaptive Diagnostic Reasoning Framework for Pathology with Multimodal Large Language Models

Yunqi Hong, Johnson Kao, Liam Edwards, Nein-Tzu Liu, Chung-Yen Huang, Alex Oliveira-Kowaleski, Cho-Jui Hsieh, Neil Y. C. Lin

机构 * Computer Science Department, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校计算机科学系) Mechanical and Aerospace Engineering Department, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校机械与航空航天工程系) Department of Pathology, Tri-Service General Hospital, National Defense Medical Center, Taipei, Taiwan(台湾国防医学院三军总医院病理部) Department of Pathology, National Taiwan University Hospital, Taipei, Taiwan(台湾国立台湾大学医院病理部) Department of Pathology, David Geffen School of Medicine, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校大卫·Geffen医学院病理部) Bioengineering Department, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校生物工程系) Institute for Quantitative and Computational Biosciences, University of California, CA, USA(加州大学定量与计算生物科学研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01903 2025-11-12 cs.CL cs.AI 81%

STAR-1: Safer Alignment of Reasoning LLMs with 1K Data

Zijun Wang, Haoqin Tu, Yuhan Wang, Juncheng Wu, Yanqing Liu, Jieru Mei, Brian R. Bartoldson, Bhavya Kailkhura, Cihang Xie

机构 * UC Santa Cruz(加州大学圣克ruz分校) Google(谷歌) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15144 2025-11-10 cs.AI cs.CL cs.CY 81%

HugAgent: Benchmarking LLMs for Simulation of Individualized Human Reasoning

Chance Jiajie Li, Zhenze Mo, Yuhan Tang, Ao Qu, Jiayi Wu, Kaiya Ivy Zhao, Yulu Gan, Jie Fan, Jiangbo Yu, Hang Jiang, Paul Pu Liang, Jinhua Zhao, Luis Alberto Alonso Pastor, Kent Larson

机构 * MIT Media Lab(MIT媒体实验室) MIT EECS(MIT电子工程与计算机科学系) MIT BCS(MIT生物科学系) MIT IDSS(MIT国际设计系统研究所) MIT CEE(MIT土木与环境工程系) MIT DUSP(MIT设计学教授职位) MIT Architecture(MIT建筑系) Northeastern University(东北大学) Brown University(布朗大学) McGill University(麦吉尔大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments To appear in NeurIPS 2025 Workshop on Bridging Language, Agent, and World Models (LAW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02817 2025-11-05 cs.CL cs.AI 81%

Oolong: Evaluating Long Context Reasoning and Aggregation Capabilities

Amanda Bertsch, Adithya Pratapa, Teruko Mitamura, Graham Neubig, Matthew R. Gormley

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00162 2025-11-05 cs.AI cs.LG 81%

ARC-GEN: A Mimetic Procedural Benchmark Generator for the Abstraction and Reasoning Corpus

Michael D. Moffitt

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26606 2025-11-03 cs.AI cs.CL 81%

Normative Reasoning in Large Language Models: A Comparative Benchmark from Logical and Modal Perspectives

Kentaro Ozeki, Risako Ando, Takanobu Morishita, Hirohiko Abe, Koji Mineshima, Mitsuhiro Okada

机构 * Keio University(Keio大学) University of Tokyo(东京大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to the 8th BlackboxNLP Workshop at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12989 2025-11-03 cs.CL cs.AI cs.SI 81%

A Multi-Stage Framework with Taxonomy-Guided Reasoning for Occupation Classification Using Large Language Models

Palakorn Achananuparp, Ee-Peng Lim, Yao Lu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to ICWSM'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26732 2025-10-31 cs.AI cs.CL 81%

Cross-Platform Evaluation of Reasoning Capabilities in Foundation Models

J. de Curtò, I. de Zarzà, Pablo García, Jordi Cabot

机构 * BARCELONA Supercomputing Center (BSC)(巴塞罗那超级计算中心) LUXEMBOURG Institute of Science(卢森堡科学研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26037 2025-10-31 cs.CR cs.AI cs.CL 81%

SIRAJ: Diverse and Efficient Red-Teaming for LLM Agents via Distilled Structured Reasoning

Kaiwen Zhou, Ahmed Elgohary, A S M Iftekhar, Amin Saied

机构 * Microsoft Responsible AI Research(微软负责任人工智能研究) University of California(加州大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24150 2025-10-29 cs.CL cs.AI 81%

Ko-MuSR: A Multistep Soft Reasoning Benchmark for LLMs Capable of Understanding Korean

Chanwoo Park, Suyoung Park, JiA Kang, Jongyeon Park, Sangho Kim, Hyunji M. Park, Sumin Bae, Mingyu Kang, Jaejin Lee

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments submitted to ACL ARR Rolling Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21329 2025-10-27 cs.CL cs.AI 81%

TripTide: A Benchmark for Adaptive Travel Planning under Disruptions

Priyanshu Karmakar, Soumyabrata Chaudhuri, Shubhojit Mallick, Manish Gupta, Abhik Jana, Shreya Ghosh

机构 * School of Electrical and Computer Sciences, IIT Bhubaneswar(电子与计算机科学学院,印度理工学院Bhubaneswar分校) Microsoft(微软)

专题命中 推理评测 :planning(title,abstract);分类 cs.CL、cs.AI

Comments 12 pages, 12 tables and 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16986 2025-10-27 cs.CL cs.AI 81%

T1: A Tool-Oriented Conversational Dataset for Multi-Turn Agentic Planning

Amartya Chakraborty, Paresh Dashore, Nadia Bathaee, Anmol Jain, Anirban Das, Shi-Xiong Zhang, Sambit Sahu, Milind Naphade, Genta Indra Winata

机构 * Capital One

专题命中 推理评测 :planning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by NeurIPS 2025 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20603 2025-10-24 cs.AI cs.CL 81%

What Defines Good Reasoning in LLMs? Dissecting Reasoning Steps with Multi-Aspect Evaluation

Heejin Do, Jaehui Hwang, Dongyoon Han, Seong Joon Oh, Sangdoo Yun

机构 * ETH Zürich, ETH AI Center(苏黎世联邦理工学院,ETH人工智能中心) NAVER AI Lab(NAVER人工智能实验室) University of Tübingen(图宾根大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18458 2025-10-24 cs.CL cs.AI cs.CV 81%

Fast-Slow Thinking GRPO for Large Vision-Language Model Reasoning

Wenyi Xiao, Leilei Gan

机构 * Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19258 2025-10-24 cs.CL cs.AI 81%

Not All Heads Matter: A Head-Level KV Cache Compression Method with Integrated Retrieval and Reasoning

Yu Fu, Zefan Cai, Abedelkadir Asi, Wayne Xiong, Yue Dong, Wen Xiao

机构 * University of California, Riverside(加州大学河滨分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Microsoft(微软公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to ICLR2025

详情

展开后加载摘要…

URL PDF HTML 收藏