arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10414 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10414 篇

2510.19358 2025-10-23 cs.CL cs.AI 81%

M3-SLU: Evaluating Speaker-Attributed Reasoning in Multimodal Large Language Models

Yejin Kwon, Taewoo Kang, Hyunsoo Yoon, Changouk Kim

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Submitted to LREC 2026. 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18672 2025-10-22 cs.LG cs.AI 81%

Reasoning Language Model Inference Serving Unveiled: An Empirical Study

Qi Li, Junpan Wu, Xiang Liu, Yuxin Wang, Zeyu Li, Zhenheng Tang, Yuhan Chen, Shaohuai Shi, Xiaowen Chu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) HKBU(香港 Baptist University) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15216 2025-10-22 cs.LG cs.CL 81%

Soundness-Aware Level: A Microscopic Signature that Predicts LLM Reasoning Potential

Xuansheng Wu, Xiaoman Pan, Wenlin Yao, Jianshu Chen

机构 * University of Georgia(佐治亚大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17900 2025-10-22 cs.CY cs.AI cs.CL 81%

Are LLMs Court-Ready? Evaluating Frontier Models on Indian Legal Reasoning

Kush Juvekar, Arghya Bhattacharya, Sai Khadloya, Utkarsh Saxena

机构 * Adalat AI

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16899 2025-10-21 cs.LG cs.AI 81%

SNOMED CT-powered Knowledge Graphs for Structured Clinical Data and Diagnostic Reasoning

Dun Liu, Qin Pang, Guangai Liu, Hongyu Mou, Jipeng Fan, Yiming Miao, Pin-Han Ho, Limei Peng

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15211 2025-10-20 cs.LG cs.AI 81%

ReasonIF: Large Reasoning Models Fail to Follow Instructions During Reasoning

Yongchan Kwon, Shang Zhu, Federico Bianchi, Kaitlyn Zhou, James Zou

机构 * Together AI Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00022 2025-10-20 cs.CL cs.LG physics.ed-ph 81%

Scaling Physical Reasoning with the PHYSICS Dataset

Shenghe Zheng, Qianjia Cheng, Junchi Yao, Mengsong Wu, Haonan He, Ning Ding, Yu Cheng, Shuyue Hu, Lei Bai, Dongzhan Zhou, Ganqu Cui, Peng Ye

机构 * Shanghai AI Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Tsinghua University(清华大学) CUHK(香港中文大学) BUAA(北京航空航天大学) UESTC(电子科技大学) Soochow University(苏州大学) USTC(中国科学技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

Comments Accepted to the NeurIPS Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14773 2025-10-17 cs.CL cs.AI 81%

Finding Answers in Thought Matters: Revisiting Evaluation on Large Language Models with Reasoning

Hwiyeol Jo, Joosung Lee, Jaehone Lee, Sang-Woo Lee, Joonsuk Park, Kang Min Yoo

机构 * NAVER Cloud(NAVER云) Neurofusion University of Richmond(里奇蒙大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments ARR Submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09011 2025-10-17 cs.AI cs.CL 81%

TripScore: Benchmarking and rewarding real-world travel planning with fine-grained evaluation

Yincen Qu, Huan Xiao, Feng Li, Gregory Li, Hui Zhou, Xiangying Dai, Xiaoru Dai

机构 * Trip.com Group(Trip.com集团) Chongqing University(重庆大学) Stanford University(斯坦福大学)

专题命中 推理评测 :planning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12818 2025-10-16 cs.CL cs.AI cs.CY 81%

MEDEQUALQA: Evaluating Biases in LLMs with Counterfactual Reasoning

Rajarshi Ghosh, Abhay Gupta, Hudson McBride, Anurag Vaidya, Faisal Mahmood

机构 * Lone Star College Algoverse AI Research Empire State University Brigham and Women’s Hospital, Harvard Medical School

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03536 2025-10-15 cs.CL cs.AI 81%

Triplet-Structured Knowledge Integration for Multi-Turn Medical Reasoning

Zhaohan Meng, Zaiqiao Meng, Siwei Liu, Iadh Ounis

机构 * School of Computing Science, University of Glasgow, UK(格拉斯哥大学计算机科学学院) School of Natural and Computing Science, University of Aberdeen, UK(阿伯丁大学自然与计算科学学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10592 2025-10-14 cs.AI cs.CL 81%

A Layered Intuition -- Method Model with Scope Extension for LLM Reasoning

Hong Su

机构 * School of Computer Science, Chengdu University of Information Technology(计算机科学学院,成都信息科技学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24869 2025-10-14 cs.IR cs.AI cs.CL 81%

Retro*: Optimizing LLMs for Reasoning-Intensive Document Retrieval

Junwei Lan, Jianlyu Chen, Zheng Liu, Chaofan Li, Siqi Bao, Defu Lian

机构 * University of Science and Technology of China(中国科学技术大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Beijing University of Posts and Telecommunications(北京邮电大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) Hong Kong Polytechnic University(香港理工大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12661 2025-10-14 cs.LG cs.CL cs.CV 81%

VLMGuard-R1: Proactive Safety Alignment for VLMs via Reasoning-Driven Prompt Optimization

Menglan Chen, Xianghe Pang, Jingjing Dong, WenHao Wang, Yaxin Du, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10293 2025-10-14 cs.CL cs.AI 81%

MatryoshkaThinking: Recursive Test-Time Scaling Enables Efficient Reasoning

Hongwei Chen, Yishu Lei, Dan Zhang, Bo Ke, Danxiang Zhu, Xuyi Chen, Yuxiang Lu, Zhengjie Huang, Shikun Feng, Jingzhou He, Yu Sun, Hua Wu, Haifeng Wang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10278 2025-10-14 cs.LG cs.AI 81%

Simulating Viva Voce Examinations to Evaluate Clinical Reasoning in Large Language Models

Christopher Chiu, Silviu Pitis, Mihaela van der Schaar

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Toronto(多伦多大学) University of Cambridge(剑桥大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09302 2025-10-13 cs.CV cs.AI cs.CL 81%

CapGeo: A Caption-Assisted Approach to Geometric Reasoning

Yuying Li, Siyi Qian, Hao Liang, Leqi Zheng, Ruichuan An, Yongzhen Guo, Wentao Zhang

机构 * THU(清华大学) PKU(北京大学) Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06274 2025-10-09 cs.AI cs.LG 81%

Bridging Reasoning to Learning: Unmasking Illusions using Complexity Out of Distribution Generalization

Mohammad Mahdi Samiei Paqaleh, Arash Marioriyad, Arman Tahmasebi-Zadeh, Mohamadreza Fereydooni, Mahdi Ghaznavai, Mahdieh Soleymani Baghshah

机构 * Department of Computer Engineering(计算机工程系) Sharif University of Technology(沙里夫技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12891 2025-10-09 cs.AI cs.CL 81%

TIME: A Multi-level Benchmark for Temporal Reasoning of LLMs in Real-World Scenarios

Shaohang Wei, Wei Li, Feifan Song, Wen Luo, Tianyi Zhuang, Haochen Tan, Zhijiang Guo, Houfeng Wang

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by NeurIPS 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07086 2025-10-08 cs.LG cs.CL 81%

A Sober Look at Progress in Language Model Reasoning: Pitfalls and Paths to Reproducibility

Andreas Hochlehnert, Hardik Bhatnagar, Vishaal Udandarao, Samuel Albanie, Ameya Prabhu, Matthias Bethge

机构 * Tübingen AI Center, University of Tübingen(图宾根人工智能中心,图宾根大学) University of Cambridge(剑桥大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

Comments Accepted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05278 2025-10-07 cs.CL cs.AI 81%

Micro-Act: Mitigating Knowledge Conflict in LLM-based RAG via Actionable Self-Reasoning

Nan Huo, Jinyang Li, Bowen Qin, Ge Qu, Xiaolong Li, Xiaodong Li, Chenhao Ma, Reynold Cheng

机构 * The University of Hong Kong(香港大学) BAAI(百度人工智能研究院) Xiamen University(厦门大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02351 2025-10-06 cs.CL cs.AI 81%

Language, Culture, and Ideology: Personalizing Offensiveness Detection in Political Tweets with Reasoning LLMs

Dzmitry Pihulski, Jan Kocoń

机构 * Department of Artificial Intelligence, Wroclaw Tech, Poland(人工智能系,沃拉布技术学院,波兰)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments To appear in the Proceedings of the IEEE International Conference on Data Mining Workshops (ICDMW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02272 2025-10-03 cs.CL cs.AI 81%

Parallel Scaling Law: Unveiling Reasoning Generalization through A Cross-Linguistic Perspective

Wen Yang, Junhong Wu, Chong Li, Chengqing Zong, Jiajun Zhang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01700 2025-10-03 cs.AI cs.CV cs.LG 81%

VaPR -- Vision-language Preference alignment for Reasoning

Rohan Wadhawan, Fabrice Y Harel-Canada, Zi-Yi Dou, Suhaila Shakiah, Robinson Piramuthu, Nanyun Peng

机构 * Department of Computer Science, University of California Los Angeles(加州大学洛杉矶分校计算机科学系) Amazon.com, Inc.(亚马逊公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

Journal ref COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14459 2025-10-03 cs.CL cs.AI cs.IR 81%

Reasoning over User Preferences: Knowledge Graph-Augmented LLMs for Explainable Conversational Recommendations

Zhangchi Qiu, Linhao Luo, Shirui Pan, Alan Wee-Chung Liew

机构 * School of ICT, Griffith University(格里菲斯大学信息与通信技术学院) Department of Data Science and AI, Monash University(莫纳什大学数据科学与人工智能系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by ICDM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00694 2025-10-02 cs.CL cs.AI cs.IR 81%

ALARB: An Arabic Legal Argument Reasoning Benchmark

Harethah Abu Shairah, Somayah AlHarbi, Abdulaziz AlHussein, Sameer Alsabea, Omar Shaqaqi, Hebah AlShamlan, Omar Knio, George Turkiyyah

机构 * King Abdullah University of Science and Technology(卡塔尔国王阿卜杜勒阿齐兹科学与技术大学) THIQAH

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted paper at ArabicNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00255 2025-10-02 cs.CL cs.AI 81%

TASER: Translation Assessment via Systematic Evaluation and Reasoning

Monishwaran Maheswaran, Marco Carini, Christian Federmann, Tony Diaz

机构 * University of California, Berkeley(加州大学伯克利分校) Apple Inc.(苹果公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22929 2025-10-02 cs.CL cs.AI cs.CV cs.MA 81%

EH-Benchmark Ophthalmic Hallucination Benchmark and Agent-Driven Top-Down Traceable Reasoning Workflow

Xiaoyu Pan, Yang Bai, Ke Zou, Yang Zhou, Jun Zhou, Huazhu Fu, Yih-Chung Tham, Yong Liu

机构 * Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(高性能计算研究所,科技研究局(A*STAR)) Centre for Innovation and Precision Eye Health(创新与精准眼健康中心) Department of Ophthalmology, NUHS Tower Block, Level 7, 1E Kent Ridge Road, Singapore, 119228(眼科部,NUHS塔楼7层,1E Kent Ridge Road,新加坡,119228) Singapore Eye Research Institute, Singapore National Eye Centre, 20 College Road, Singapore, 169856(新加坡眼研究 institute,新加坡国家眼科中心,20 College Road,新加坡,169856)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments 9 figures, 5 tables. submit/6621751

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25543 2025-10-01 cs.CL cs.AI 81%

Aligning Multilingual Reasoning with Verifiable Semantics from a High-Resource Expert Model

Fahim Faisal, Kaiqiang Song, Song Wang, Simin Ma, Shujian Liu, Haoyun Deng, Sathish Reddy Indurthi

机构 * Zoom

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22034 2025-09-30 cs.AI cs.CL 81%

The Thinking Spectrum: An Empirical Study of Tunable Reasoning in LLMs through Model Merging

Xiaochong Lan, Yu Zheng, Shiteng Cao, Yong Li

机构 * Tsinghua University(清华大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏