arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10414 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10414 篇

2508.16383 2025-08-25 cs.AI cs.CL cs.CY 81%

GLARE: Agentic Reasoning for Legal Judgment Prediction

Xinyu Yang, Chenlong Deng, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11944 2025-08-19 cs.AI cs.CL cs.HC 81%

CHBench: A Cognitive Hierarchy Benchmark for Evaluating Strategic Reasoning Capability of LLMs

Hongtao Liu, Zhicheng Du, Zihe Wang, Weiran Shen

机构 * Gaoling School of Artificial Intelligence(北京语言大学人工智能学院) Renmin University of China(中国人民大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06220 2025-08-14 cs.CL cs.AI 81%

InfoCausalQA:Can Models Perform Non-explicit Causal Reasoning Based on Infographic?

Keummin Ka, Junhyeong Park, Jaehyun Jeon, Youngjae Yu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00043 2025-08-13 cs.CL cs.AI cs.CV 81%

CrossWordBench: Evaluating the Reasoning Capabilities of LLMs and LVLMs with Controllable Puzzle Generation

Jixuan Leng, Chengsong Huang, Langlin Huang, Bill Yuchen Lin, William W. Cohen, Haohan Wang, Jiaxin Huang

机构 * CMU(卡内基梅隆大学) WUSTL(华盛顿大学) UIUC(伊利诺伊大学香槟分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05386 2025-08-12 cs.CL cs.AI 81%

Leaps Beyond the Seen: Reinforced Reasoning Augmented Generation for Clinical Notes

Lo Pang-Yun Ting, Chengshuai Zhao, Yu-Hua Zeng, Yuan Jee Lim, Kun-Ta Chuang, Huan Liu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13147 2025-08-11 cs.AI cs.CL 81%

Are Your LLMs Capable of Stable Reasoning?

Junnan Liu, Hongwei Liu, Linchen Xiao, Ziyi Wang, Kuikun Liu, Songyang Gao, Wenwei Zhang, Songyang Zhang, Kai Chen

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments ACL 2025 Camera, Benchmark: https://huggingface.co/datasets/opencompass/LiveMathBench, Code: https://github.com/open-compass/GPassK

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04531 2025-08-07 cs.CL cs.AI 81%

Unveiling the Landscape of Clinical Depression Assessment: From Behavioral Signatures to Psychiatric Reasoning

Zhuang Chen, Guanqun Bi, Wen Zhang, Jiawei Hu, Aoyun Wang, Xiyao Xiao, Kun Feng, Minlie Huang

机构 * School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) CoAI Group, DCST, IAI, BNRIST, Tsinghua University(清华大学) University of International Relations(国际关系大学) Central China Normal University(华中师范大学) Lingxin AI(灵心AI) Yuquan Hospital, Tsinghua University(清华大学友谊医院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04118 2025-08-07 cs.AI cs.CL 81%

AgREE: Agentic Reasoning for Knowledge Graph Completion on Emerging Entities

Ruochen Zhao, Simone Conia, Eric Peng, Min Li, Saloni Potdar

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02018 2025-08-05 cs.CL cs.AI 81%

SpeechR: A Benchmark for Speech Reasoning in Large Audio-Language Models

Wanqi Yang, Yanda Li, Yunchao Wei, Meng Fang, Ling Chen

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21476 2025-07-30 cs.CL cs.AI 81%

Which LLMs Get the Joke? Probing Non-STEM Reasoning Abilities with HumorBench

Reuben Narad, Siddharth Suresh, Jiayi Chen, Pine S. L. Dysart-Bricken, Bob Mankoff, Robert Nowak, Jifan Zhang, Lalit Jain

机构 * University of Washington(华盛顿大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Air Mail and Cartoon Collections(航空邮报与漫画收藏)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16802 2025-07-29 cs.CL cs.LG 81%

Agentar-Fin-R1: Enhancing Financial Intelligence through Domain Expertise, Training Efficiency, and Advanced Reasoning

Yanjun Zheng, Xiyang Du, Longfei Liao, Xiaoke Zhao, Zhaowen Zhou, Jingze Song, Bo Zhang, Jiawei Liu, Xiang Qi, Zhe Li, Zhiqiang Zhang, Wei Wang, Peng Zhang

机构 * Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18442 2025-07-25 cs.CL cs.AI 81%

AraTable: Benchmarking LLMs' Reasoning and Understanding of Arabic Tabular Data

Rana Alshaikh, Israa Alghanmi, Shelan Jeawak

机构 * Department of Information Systems, Faculty of Computing and Information Technology(信息系统系,计算与信息科技学院) King Abdulaziz University(国王阿卜杜勒阿齐兹大学) Department of Information Systems and Technology, College of Computer Science and Engineering(信息系统与技术系,计算机科学与工程学院) University of Jeddah(朱德赫大学) School of Computing and Creative Technologies(计算与创意科技学院) University of the West of England(西英格兰大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15874 2025-07-23 cs.AI cs.CL 81%

Why Braking? Scenario Extraction and Reasoning Utilizing LLM

Yin Wu, Daniel Slieter, Vivek Subramanian, Ahmed Abouelazm, Robin Bohn, J. Marius Zöllner

机构 * CARIAD SE(CARIAD公司) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) FZI Research Center for Information Technology(弗劳恩霍夫信息技术研究中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15717 2025-07-22 cs.CL cs.AI 81%

BEnchmarking LLMs for Ophthalmology (BELO) for Ophthalmological Knowledge and Reasoning

Sahana Srinivasan, Xuguang Ai, Thaddaeus Wai Soon Lo, Aidan Gilson, Minjie Zou, Ke Zou, Hyunjae Kim, Mingjia Yang, Krithi Pushpanathan, Samantha Yew, Wan Ting Loke, Jocelyn Goh, Yibing Chen, Yiming Kong, Emily Yuelei Fu, Michelle Ongyong Hui, Kristen Nwanyanwu, Amisha Dave, Kelvin Zhenghao Li, Chen-Hsin Sun, Mark Chia, Gabriel Dawei Yang, Wendy Meihua Wong, David Ziyou Chen, Dianbo Liu, Maxwell Singer, Fares Antaki, Lucian V Del Priore, Jost Jonas, Ron Adelman, Qingyu Chen, Yih-Chung Tham

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01909 2025-07-22 cs.LG cs.AI 81%

Attend or Perish: Benchmarking Attention in Algorithmic Reasoning

Michal Spiegel, Michal Štefánik, Marek Kadlčík, Josef Kuchař

机构 * Kempelen Institute of Intelligent Technologies(智能技术研究所) Language Technology, University of Helsinki(语言技术,赫尔辛基大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00152 2025-07-21 cs.CL cs.AI 81%

Temporal reasoning for timeline summarisation in social media

Jiayu Song, Mahmud Elahi Akhter, Dana Atzil Slonim, Maria Liakata

机构 * Queen Mary University of London(伦敦女王学院) Bar-Ilan University(巴伊兰大学) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18424 2025-07-16 cs.AI cs.CL 81%

LongDocURL: a Comprehensive Multimodal Long Document Benchmark Integrating Understanding, Reasoning, and Locating

Chao Deng, Jiale Yuan, Pi Bu, Peijie Wang, Zhong-Zhi Li, Jian Xu, Xiao-Hui Li, Yuan Gao, Jun Song, Bo Zheng, Cheng-Lin Liu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(人工智能研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团) Zhongguancun Academy, Beijing(中关村学院,北京)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.21033 2025-07-16 cs.CL cs.AI 81%

Plancraft: an evaluation dataset for planning with LLM agents

Gautier Dagan, Frank Keller, Alex Lascarides

机构 * University of Edinburgh(爱丁堡大学)

专题命中 推理评测 :planning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04142 2025-07-08 cs.CL cs.AI 81%

Dissecting Clinical Reasoning in Language Models: A Comparative Study of Prompts and Model Adaptation Strategies

Mael Jullien, Marco Valentino, Leonardo Ranaldi, Andre Freitas

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04014 2025-07-08 cs.CL cs.AI cs.CY 81%

Nunchi-Bench: Benchmarking Language Models on Cultural Reasoning with a Focus on Korean Superstition

Kyuhee Kim, Sangah Lee

机构 * EPFL Lausanne, Switzerland(洛桑联邦理工学院) Seoul National University(首尔国立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02773 2025-07-08 cs.AI cs.LG cs.MA 81%

KERAP: A Knowledge-Enhanced Reasoning Approach for Accurate Zero-shot Diagnosis Prediction Using Multi-agent LLMs

Yuzhang Xie, Hejie Cui, Ziyang Zhang, Jiaying Lu, Kai Shu, Fadi Nahab, Xiao Hu, Carl Yang

机构 * Emory University(埃默里大学) Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

Journal ref American Medical Informatics Association (AMIA) 2025 Annual Symposium, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03001 2025-07-08 cs.CL cs.AI 81%

Evaluating Hierarchical Clinical Document Classification Using Reasoning-Based LLMs

Akram Mustafa, Usman Naseem, Mostafa Rahimi Azghadi

机构 * College of Science and Engineering, James Cook University(科学与工程学院,詹姆斯库克大学) School of Computing, Macquarie University(计算学院,麦考瑞大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01702 2025-07-03 cs.CL cs.AI 81%

AdamMeme: Adaptively Probe the Reasoning Capacity of Multimodal Large Language Models on Harmfulness

Zixin Chen, Hongzhan Lin, Kaixin Li, Ziyang Luo, Zhen Ye, Guang Chen, Zhiyong Huang, Jing Ma

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00214 2025-07-02 cs.CL cs.AI 81%

Two-Stage Reasoning-Infused Learning: Improving Classification with LLM-Generated Reasoning

Mads Henrichsen, Rasmus Krebs

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01933 2025-07-02 cs.CL cs.AI 81%

DiReCT: Diagnostic Reasoning for Clinical Notes via Large Language Models

Bowen Wang, Jiuyang Chang, Yiming Qian, Guoxin Chen, Junhao Chen, Zhouqiang Jiang, Jiahao Zhang, Yuta Nakashima, Hajime Nagahara

机构 * Premium Research Institute for Human Metaverse Medicine (WPI-PRIMe)(人类元宇宙医学高级研究机构(WPI-PRIMe)) Osaka University(大阪大学) Department of Cardiology, The First Affiliated Hospital of Dalian Medical University(大连医科大学第一附属医院心内科) Institute of Computing Technology, Chinese Academy of Science(中国科学院计算技术研究所) D3 Center, Osaka University(大阪大学D3中心) Agency for Science, Technology and Research (A*STAR)(科技研究局(A*STAR))

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by NeurIPS 2024 D&B Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23719 2025-07-01 cs.LG cs.AI 81%

DABstep: Data Agent Benchmark for Multi-step Reasoning

Alex Egg, Martin Iglesias Goyanes, Friso Kingma, Andreu Mora, Leandro von Werra, Thomas Wolf

机构 * Adyen(阿德耶恩) Hugging Face

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23563 2025-07-01 cs.AI cs.CL cs.CV 81%

MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI

Huanjin Yao, Jiaxing Huang, Yawen Qiu, Michael K. Chen, Wenzheng Liu, Wei Zhang, Wenjie Zeng, Xikun Zhang, Jingyi Zhang, Yuxin Song, Wenhao Wu, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) Baidu Inc.(百度公司) University of California(加州大学) University of Science and Technology of China(中国科学技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04413 2025-06-30 cs.CL cs.AI cs.IR 81%

MedRAG: Enhancing Retrieval-augmented Generation with Knowledge Graph-Elicited Reasoning for Healthcare Copilot

Xuejiao Zhao, Siyan Liu, Su-Yin Yang, Chunyan Miao

机构 * LILY Research Centre(LILY研究机构) Nanyang Technological University(南洋理工大学) Tan Tock Seng Hospital(坦托克森医院) Woodlands Health(伍尔德斯健康)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20664 2025-06-26 cs.AI cs.CL cs.HC cs.MA 81%

The Decrypto Benchmark for Multi-Agent Reasoning and Theory of Mind

Andrei Lupu, Timon Willi, Jakob Foerster

机构 * FAIR at Meta(Meta 的 FAIR) University of Oxford(牛津大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments 41 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08638 2025-06-25 cs.AI cs.CL 81%

TRAIL: Trace Reasoning and Agentic Issue Localization

Darshan Deshpande, Varun Gangal, Hersh Mehta, Jitin Krishnan, Anand Kannappan, Rebecca Qian

机构 * Patronus AI

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Dataset: https://huggingface.co/datasets/PatronusAI/TRAIL

详情

展开后加载摘要…

URL PDF HTML 收藏