arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10379 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10379 篇

2410.02429 2025-12-02 cs.AI cs.CL 84%

IoT-LLM: a framework for enhancing Large Language Model reasoning from real-world sensor data

IoT-LLM: 一个增强大语言模型现实世界传感器数据推理能力的框架

Tuo An, Yunjiao Zhou, Han Zou, Jianfei Yang

机构 * MARS Lab, School of Mechanical and Aerospace Engineering, Nanyang Technological University, Singapore(MARS实验室,机械与航空航天工程学院,南洋理工大学,新加坡) School of Mechanical and Aerospace Engineering, Nanyang Technological University, Singapore(机械与航空航天工程学院,南洋理工大学,新加坡)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 IoT-LLM通过整合物联网数据与常识知识,提升大语言模型在现实世界传感任务中的推理能力。

Comments 33 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20680 2025-11-27 cs.CL cs.AI 84%

Cognitive bias in LLM reasoning compromises interpretation of clinical oncology notes

大语言模型的认知偏差影响临床肿瘤学笔记的解读

Matthew W. Kenaston, Umair Ayub, Mihir Parmar, Muhammad Umair Anjum, Syed Arsalan Ahmed Naqvi, Priya Kumar, Samarth Rawal, Aadel A. Chaudhuri, Yousef Zakharia, Elizabeth I. Heath, Tanios S. Bekaii-Saab, Cui Tao, Eliezer M. Van Allen, Ben Zhou, YooJung Choi, Chitta Baral, Irbaz Bin Riaz

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本研究揭示了大语言模型在肿瘤学笔记解读中因推理缺陷导致的临床安全隐患,并提出了一种可推广的推理错误分类框架。

Comments 24 pages, 6 figures, 1 supplementary figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20399 2025-11-27 cs.CL cs.AI 84%

BengaliFig: A Low-Resource Challenge for Figurative and Culturally Grounded Reasoning in Bengali

BengaliFig:一种低资源挑战,用于孟加拉语中的隐喻和文化相关推理

Abdullah Al Sefat

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 BengaliFig通过孟加拉语隐喻和文化相关推理的低资源挑战,评估LLM在文化特定推理中的表现,并推动包容性NLP评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08552 2025-11-18 cs.CL cs.AI 84%

Efficient Post-Training Refinement of Latent Reasoning in Large Language Models

Xinyuan Wang, Dongjie Wang, Wangyang Ying, Haoyue Bai, Nanxu Gong, Sixun Dong, Kunpeng Liu, Yanjie Fu

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27042 2025-11-13 cs.AI cs.LG 84%

e1: Learning Adaptive Control of Reasoning Effort

Michael Kleinman, Matthew Trager, Alessandro Achille, Wei Xia, Stefano Soatto

机构 * AWS Agentic AI(AWS智能人工智能)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12403 2025-11-11 cs.CL cs.AI 84%

FedCoT: Federated Chain-of-Thought Distillation for Large Language Models

Tao Fan, Weijing Chen, Yan Kang, Guoqiang Ma, Hanlin Gu, Yuanfeng Song, Lixin Fan, Qiang Yang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) WeBank Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22371 2025-10-28 cs.AI cs.CL 84%

Reasoning Models Reason Well, Until They Don't

Revanth Rameshkumar, Jimson Huang, Yunxin Sun, Fei Xia, Abulhair Saparov

机构 * University of Washington(华盛顿大学) Purdue University(普渡大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18492 2025-10-20 cs.CR cs.AI cs.LG 84%

GuardReasoner: Towards Reasoning-based LLM Safeguards

Yue Liu, Hongcheng Gao, Shengfang Zhai, Yufei He, Jun Xia, Zhengyu Hu, Yulin Chen, Xihong Yang, Jiaheng Zhang, Stan Z. Li, Hui Xiong, Bryan Hooi

机构 * NUS(新加坡国立大学) HKUST (Guangzhou)(香港科技大学(广州)) Westlake University(西湖大学)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);分类 cs.AI、cs.LG

Comments 22 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04192 2025-10-14 cs.CV cs.AI cs.CL 84%

ViDRiP-LLaVA: A Dataset and Benchmark for Diagnostic Reasoning from Pathology Videos

Trinh T. L. Vuong, Jin Tae Kwak

机构 * Korea University(韩国大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08800 2025-10-13 cs.CL cs.AI 84%

Benchmarking Chinese Commonsense Reasoning with a Multi-hop Reasoning Perspective

Wangjie You, Xusheng Wang, Xing Wang, Wenxiang Jiao, Chao Feng, Juntao Li, Min Zhang

机构 * Douyin Content Group, ByteDance(字节跳动内容部) School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03214 2025-10-01 cs.CL cs.AI cs.CV 84%

iVISPAR -- An Interactive Visual-Spatial Reasoning Benchmark for VLMs

Julius Mayer, Mohamad Ballout, Serwan Jassim, Farbod Nosrat Nezami, Elia Bruni

机构 * Institute of Cognitive Science, Osnabrück University(认知科学研究所,奥斯纳布吕克大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24981 2025-09-30 cs.LG cs.AI 84%

Random Policy Valuation is Enough for LLM Reasoning with Verifiable Rewards

Haoran He, Yuxiao Ye, Qingpeng Cai, Chen Hu, Binxing Jiao, Daxin Jiang, Ling Pan

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Kuaishou Technology(快手科技) StepFun

专题命中 推理评测 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02954 2025-09-23 cs.CL cs.AI 84%

Advanced Financial Reasoning at Scale: A Comprehensive Evaluation of Large Language Models on CFA Level III

Pranam Shetty, Abhisek Upadhayaya, Parth Mitesh Shah, Srikanth Jagabathula, Shilpi Nayak, Anna Joo Fee

机构 * Rochester Institute of Technology(罗切斯特理工学院) GoodFin, Inc(GoodFin公司) New York University(纽约大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments Accepted at FinLLM @ IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14403 2025-09-16 cs.AI cs.LG 84%

Unearthing Gems from Stones: Policy Optimization with Negative Sample Augmentation for LLM Reasoning

Zhaohui Yang, Yuxiao Ye, Shilei Jiang, Chen Hu, Linjing Li, Shihong Deng, Daxin Jiang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Institute of Technology(北京理工大学) StepFun, China(中国StepFun)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16821 2025-08-26 cs.AI cs.LG 84%

PuzzleJAX: A Benchmark for Reasoning and Learning

Sam Earle, Graham Todd, Yuchen Li, Ahmed Khalifa, Muhammad Umair Nasir, Zehua Jiang, Andrzej Banburski-Fahey, Julian Togelius

机构 * New York University(纽约大学) University of Malta(马耳他大学) University of the Witwatersrand(沃斯兰大学) Microsoft(微软公司)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

Comments 25 pages, 11 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08224 2025-08-14 cs.CL cs.AI 84%

Capabilities of GPT-5 on Multimodal Medical Reasoning

Shansong Wang, Mingzhe Hu, Qiang Li, Mojtaba Safari, Xiaofeng Yang

机构 * Department of Radiation Oncology, Winship Cancer Institute, Emory University School of Medicine(放射肿瘤科、Winship癌症研究所、埃默里大学医学院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments Corrected some typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04699 2025-08-08 cs.SE cs.AI cs.CL 84%

R2Vul: Learning to Reason about Software Vulnerabilities with Reinforcement Learning and Structured Reasoning Distillation

Martin Weyssow, Chengran Yang, Junkai Chen, Ratnadira Widyasari, Ting Zhang, Huihui Huang, Huu Hung Nguyen, Yan Naing Tun, Tan Bui, Yikun Li, Ang Han Wei, Frank Liauw, Eng Lieh Ouh, Lwin Khin Shar, David Lo

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03686 2025-08-06 cs.CL cs.AI 84%

CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward

Shudong Liu, Hongwei Liu, Junnan Liu, Linchen Xiao, Songyang Gao, Chengqi Lyu, Yuzhe Gu, Wenwei Zhang, Derek F. Wong, Songyang Zhang, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) NLP 2 CT Lab, University of Macau(澳门大学自然语言处理与计算机视觉实验室) University of Macau(澳门大学)

专题命中 推理评测 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

Comments Technical Report; 31 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13626 2025-08-05 cs.CL cs.AI 84%

Thought Manipulation: External Thought Can Be Efficient for Large Reasoning Models

Yule Liu, Jingyi Zheng, Zhen Sun, Zifan Peng, Wenhan Dong, Zeyang Sha, Shiwen Cui, Weiqiang Wang, Xinlei He

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16660 2025-07-23 cs.LG cs.AI q-bio.QM 84%

BioMaze: Benchmarking and Enhancing Large Language Models for Biological Pathway Reasoning

Haiteng Zhao, Chang Ma, Fangzhi Xu, Lingpeng Kong, Zhi-Hong Deng

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03483 2025-07-09 cs.CL cs.AI 84%

BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset

Zhiheng Xi, Guanyu Li, Yutao Fan, Honglin Guo, Yufang Liu, Xiaoran Fan, Jiaqi Liu, Jingchao Ding, Wangmeng Zuo, Zhenfei Yin, Lei Bai, Tao Ji, Tao Gui, Qi Zhang, Philip Torr, Xuanjing Huang

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) East China Normal University(华东师范大学) Oxford(牛津大学) University of Sydney(悉尼大学) Yimudata(云墨数据)

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21252 2025-06-27 cs.CL cs.AI 84%

Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents

Tianyi Men, Zhuoran Jin, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)

专题命中 推理评测 :planning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI

Comments ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01044 2025-06-17 cs.AI cs.CL 84%

RATIONALYST: Mining Implicit Rationales for Process Supervision of Reasoning

Dongwei Jiang, Guoxuan Wang, Yining Lu, Andrew Wang, Jingyu Zhang, Chuyu Liu, Benjamin Van Durme, Daniel Khashabi

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Notre Dame(诺特大学)

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

Comments Our code, data, and model can be found at this repository: https://github.com/JHU-CLSP/Rationalyst

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10209 2025-06-13 cs.CL cs.AI 84%

TTT-Bench: A Benchmark for Evaluating Reasoning Ability with Simple and Novel Tic-Tac-Toe-style Games

Prakamya Mishra, Jiang Liu, Jialian Wu, Xiaodong Yu, Zicheng Liu, Emad Barsoum

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01252 2025-06-03 cs.CL cs.AI 84%

MTCMB: A Multi-Task Benchmark Framework for Evaluating LLMs on Knowledge, Reasoning, and Safety in Traditional Chinese Medicine

Shufeng Kong, Xingru Yang, Yuanyuan Wei, Zijie Wang, Hao Tang, Jiuqi Qin, Shuting Lan, Yingheng Wang, Junwen Bai, Zhuangbin Chen, Zibin Zheng, Caihua Liu, Hao Liang

机构 * School of Software Engineering, Sun Yat-sen University(中山大学软件学院) Institute of TCM Diagnostics, Hunan University of Chinese Medicine(湖南中医药大学中医诊断研究所) School of Artificial Intelligence, Guilin University of Electronic Technology(桂林电子科技大学人工智能学院) Department of Computer Science, Cornell University(康奈尔大学计算机科学系)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08972 2025-06-02 cs.CL cs.AI 84%

RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios

Ruiwen Zhou, Wenyue Hua, Liangming Pan, Sitao Cheng, Xiaobao Wu, En Yu, William Yang Wang

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) University of Arizona(亚利桑那大学) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

Comments ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17482 2025-05-26 cs.AI cs.CL 84%

From Reasoning to Generalization: Knowledge-Augmented LLMs for ARC Benchmark

Chao Lei, Nir Lipovetzky, Krista A. Ehinger, Yanchuan Chang

机构 * School of Computing and Information Systems, The University of Melbourne(计算与信息系统学院,墨尔本大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21027 2025-05-01 cs.CL cs.AI 84%

UrbanPlanBench: A Comprehensive Urban Planning Benchmark for Evaluating Large Language Models

Yu Zheng, Longyi Liu, Yuming Lin, Jie Feng, Guozhen Zhang, Depeng Jin, Yong Li

机构 * The Thørväld Group(Thørväld集团) Inria Paris-Rocquencourt(Inria巴黎-罗克桑court分部) Rajiv Gandhi University Doimukh(拉贾格恩迪大学多伊穆克) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒默研究实验室) The Kumquat Consortium(Kumquat联盟)

专题命中 推理评测 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15362 2025-04-23 cs.CV cs.CL cs.LG 84%

LongPerceptualThoughts: Distilling System-2 Reasoning for System-1 Perception

Yuan-Hong Liao, Sven Elflein, Liu He, Laura Leal-Taixé, Yejin Choi, Sanja Fidler, David Acuna

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.LG

Comments 24 pages, 10 figures, in submission. Project page: https://andrewliao11.github.io/LongPerceptualThoughts

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08437 2025-04-15 cs.AI cs.CL 84%

Autonomous Evaluation of LLMs for Truth Maintenance and Reasoning Tasks

Rushang Karia, Daniel Bramblett, Daksh Dobhal, Siddharth Srivastava

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏