arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10451 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10451 篇

2511.06125 2025-11-11 cs.CL cs.AI cs.IR 62%

Evaluation of retrieval-based QA on QUEST-LOFT

Nathan Scales, Nathanael Schärli, Olivier Bousquet

机构 * Google DeepMind(谷歌DeepMind)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13624 2025-11-11 cs.CL cs.LG 62%

Latent Traits and Cross-Task Transfer: Deconstructing Dataset Interactions in LLM Fine-tuning

Shambhavi Krishna, Atharva Naik, Chaitali Agarwal, Sudharshan Govindan, Taesung Lee, Haw-Shiuan Chang

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Anthropic

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Proceedings of the 14th Joint Conference on Lexical and Computational Semantics (*SEM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04372 2025-11-11 cs.LG cs.AI cs.SE 62%

Benchmarking Large Language Models with Integer Sequence Generation Tasks

Daniel O'Malley, Manish Bhattarai, Nishath Rajiv Ranasinghe, Erick Draayer, Javier Santos

机构 * Earth and Environmental Sciences Division Los Alamos National Laboratory(地球与环境科学 division 洛斯阿拉莫斯国家实验室) Theoretical Division Los Alamos National Laboratory(理论 division 洛斯阿拉莫斯国家实验室) Computational Sciences Division Los Alamos National Laboratory(计算科学 division 洛斯阿拉莫斯国家实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05040 2025-11-10 cs.CL cs.AI cs.SE 62%

UA-Code-Bench: A Competitive Programming Benchmark for Evaluating LLM Code Generation in Ukrainian

Mykyta Syromiatnikov, Victoria Ruvinskaya

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 8 pages, 5 figures. XI International conference "Informatics. Culture. Technique." (2025)

Journal ref XI International conference "Informatics. Culture. Technique." (2025) 308-314

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04705 2025-11-10 cs.CL cs.AI 62%

POLIS-Bench: Towards Multi-Dimensional Evaluation of LLMs for Bilingual Policy Tasks in Governmental Scenarios

Tingyue Yang, Junchi Yao, Yuhui Guo, Chang Liu

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03279 2025-11-10 cs.LG cs.AI stat.ML 62%

Conformal Information Pursuit for Interactively Guiding Large Language Models

Kwan Ho Ryan Chan, Yuyan Ge, Edgar Dobriban, Hamed Hassani, René Vidal

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03265 2025-11-10 cs.LG cs.AI 62%

Cognitive Edge Computing: A Comprehensive Survey on Optimizing Large Models and AI Agents for Pervasive Deployment

Xubin Wang, Qing Li, Weijia Jia

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03635 2025-11-06 cs.CL cs.LG 62%

Towards Transparent Stance Detection: A Zero-Shot Approach Using Implicit and Explicit Interpretability

Apoorva Upadhyaya, Wolfgang Nejdl, Marco Fisichella

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Accepted in AAAI CONFERENCE ON WEB AND SOCIAL MEDIA (ICWSM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16638 2025-11-06 cs.CL cs.AI 62%

Do Automatic Factuality Metrics Measure Factuality? A Critical Evaluation

Sanjana Ramprasad, Byron C. Wallace

机构 * Northeastern University(东北大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02490 2025-11-05 cs.LG cs.AI 62%

BRAINS: A Retrieval-Augmented System for Alzheimer's Detection and Monitoring

Rajan Das Gupta, Md Kishor Morol, Nafiz Fahad, Md Tanzib Hosain, Sumaya Binte Zilani Choya, Md Jakir Hossen

机构 * American International University-Bangladesh(美国国际大学-孟加拉国) Multimedia University(多媒体大学) George Mason University(乔治·梅森大学) ELITE Research Lab(ELITE研究实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Accepted for publication in ICMLA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02374 2025-11-05 cs.CL cs.AI 62%

AyurParam: A State-of-the-Art Bilingual Language Model for Ayurveda

Mohd Nauman, Sravan Gvm, Vijay Devane, Shyam Pawar, Viraj Thakur, Kundeshwar Pundalik, Piyush Sawarkar, Rohit Saluja, Maunendra Desarkar, Ganesh Ramakrishnan

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02119 2025-11-05 cs.AI cs.CL 62%

InsurAgent: A Large Language Model-Empowered Agent for Simulating Individual Behavior in Purchasing Flood Insurance

Ziheng Geng, Jiachen Liu, Ran Cao, Lu Cheng, Dan M. Frangopol, Minghui Cheng

机构 * University of Miami(迈阿密大学) Hunan University(湖南大学) University of Illinois Chicago(伊利诺伊大学香槟分校) Lehigh University(莱斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19667 2025-11-04 cs.CL cs.AI 62%

Can Large Language Models Analyze Graphs like Professionals? A Benchmark, Datasets and Models

Xin Li, Weize Chen, Qizhi Chu, Haopeng Li, Zhaojun Sun, Ran Li, Chen Qian, Yiwei Wei, Zhiyuan Liu, Chuan Shi, Maosong Sun, Cheng Yang

机构 * School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机科学学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) College of Petroleum Engineering, China University of Petroleum (Beijing) at Karamay(中国石油大学(北京)克拉玛依校区石油工程学院) Institute for Artificial Intelligence, Tsinghua University(清华大学人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16093 2025-11-04 cs.CL cs.AI 62%

Beyond Pointwise Scores: Decomposed Criteria-Based Evaluation of LLM Responses

Fangyi Yu, Nabeel Seedat, Dasha Herrmannova, Frank Schilder, Jonathan Richard Schwarz

机构 * Thomson Reuters Foundational Research(汤姆森·路透基础研究) Thomson Reuters Labs(汤姆森·路透实验室) Imperial College London(帝国理工学院伦敦分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted by 2025 EMNLP industry track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17050 2025-11-04 cs.CL cs.AI cs.CE cs.CY cs.MM 62%

Towards Robust Evaluation of STEM Education: Leveraging MLLMs in Project-Based Learning

Xinyi Wu, Yanhao Jia, Qinglin Zhang, Yiran Qin, Luwei Xiao, Shuai Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27238 2025-11-03 cs.DB cs.AI cs.CL cs.IR 62%

DRAMA: Unifying Data Retrieval and Analysis for Open-Domain Analytic Queries

Chuxuan Hu, Maxwell Yang, James Weiland, Yeji Lim, Suhas Palawala, Daniel Kang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted to SIGMOD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26616 2025-11-03 cs.LG cs.AI 62%

Aeolus: A Multi-structural Flight Delay Dataset

Lin Xu, Xinyun Yuan, Yuxuan Liang, Suwan Yin, Yuankai Wu

机构 * Sichuan University(四川大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26802 2025-10-31 cs.CV cs.AI cs.CL 62%

Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark

Ziyu Guo, Xinyan Chen, Renrui Zhang, Ruichuan An, Yu Qi, Dongzhi Jiang, Xiangtai Li, Manyuan Zhang, Hongsheng Li, Pheng-Ann Heng

机构 * CUHK(香港中文大学) IMIXR MMLab Peking University(北京大学) Northeastern University(东北大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Project Page: https://video-cof.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25694 2025-10-30 cs.SE cs.AI cs.CL 62%

Process-Level Trajectory Evaluation for Environment Configuration in Software Engineering Agents

Jiayi Kuang, Yinghui Li, Xin Zhang, Yangning Li, Di Yin, Xing Sun, Ying Shen, Philip S. Yu

机构 * Youtu-LLM Team, Tencent Youtu Lab(腾讯优设实验室) Sun Yat-sen University(中山大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24788 2025-10-30 cs.CV cs.AI cs.LG 62%

The Underappreciated Power of Vision Models for Graph Structural Understanding

Xinjian Zhao, Wei Pang, Zhongkai Xue, Xiangru Jian, Lei Zhang, Yaoyao Xu, Xiaozhuang Song, Shu Wu, Tianshu Yu

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Cheriton School of Computer Science, University of Waterloo(滑铁卢大学切尔顿计算机科学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24762 2025-10-30 cs.CL cs.AI 62%

Falcon: A Comprehensive Chinese Text-to-SQL Benchmark for Enterprise-Grade Evaluation

Wenzhen Luo, Wei Guan, Yifan Yao, Yimin Pan, Feng Wang, Zhipeng Yu, Zhe Wen, Liang Chen, Yihong Zhuang

机构 * Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22967 2025-10-30 cs.CL cs.AI 62%

MAD-Fact: A Multi-Agent Debate Framework for Long-Form Factuality Evaluation in LLMs

Yucheng Ning, Xixun Lin, Fang Fang, Yanan Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences, Beijing 100085, China(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences, Beijing 100049, China(中国科学院大学网络安全学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-025-51369-x}

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10844 2025-10-30 cs.AI cs.CL 62%

Creativity or Brute Force? Using Brainteasers as a Window into the Problem-Solving Abilities of Large Language Models

Simeng Han, Howard Dai, Stephen Xia, Grant Zhang, Chen Liu, Lichang Chen, Hoang Huy Nguyen, Hongyuan Mei, Jiayuan Mao, R. Thomas McCoy

机构 * Yale University(耶鲁大学) Meta Superintelligence Labs(Meta超智能实验室) Georgia Institute of Technology(佐治亚理工学院) TTIC Massachusetts Institute of Technology(麻省理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24345 2025-10-29 cs.CL cs.AI 62%

LongWeave: A Long-Form Generation Benchmark Bridging Real-World Relevance and Verifiability

Zikai Xiao, Fei Huang, Jianhong Tu, Jianhui Wei, Wen Ma, Yuxuan Zhou, Jian Wu, Bowen Yu, Zuozhu Liu, Junyang Lin

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 推理评测 :verifier(abstract);分类 cs.CL、cs.AI

Comments EMNLP Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23948 2025-10-29 cs.LG cs.AI 62%

ChessQA: Evaluating Large Language Models for Chess Understanding

Qianfeng Wen, Zhenwei Tang, Ashton Anderson

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 33 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01161 2025-10-29 cs.LG cs.AI 62%

Prosperity before Collapse: How Far Can Off-Policy RL Reach with Stale Data on LLMs?

Haizhong Zheng, Jiawei Zhao, Beidi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) Meta AI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17234 2025-10-28 cs.CL cs.AI 62%

ClaimGen-CN: A Large-scale Chinese Dataset for Legal Claim Generation

Siying Zhou, Yiquan Wu, Hui Chen, Xavier Hu, Kun Kuang, Adam Jatowt, Ming Hu, Chunyan Zheng, Fei Wu

机构 * Zhejiang University(浙江大学) University of Innsbruck(因斯布鲁克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22475 2025-10-28 cs.CL cs.AI 62%

CHOIR: Collaborative Harmonization fOr Inference Robustness

Xiangjue Dong, Cong Wang, Maria Teleki, Millennium Bismay, James Caverlee

机构 * Texas A&M University(德克萨斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments updated version

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15550 2025-10-28 cs.LG cs.AI physics.soc-ph 62%

PhysGym: Benchmarking LLMs in Interactive Physics Discovery with Controlled Priors

Yimeng Chen, Piotr Piȩkos, Mateusz Ostaszewski, Firas Laakom, Jürgen Schmidhuber

机构 * Center of Excellence for Generative AI, KAUST(生成人工智能卓越中心,KAUST) The Swiss AI Lab, IDSIA-USI/SUPSI(瑞士人工智能实验室,IDSIA-USI/SUPSI) NNAISENSE Principia-AI/PhysGym(NNAISENSE 原初人工智能/PhysGym)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 31 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21956 2025-10-28 cs.LG cs.CL 62%

Transformer Based Linear Attention with Optimized GPU Kernel Implementation

Armin Gerami, Ramani Duraiswami

机构 * Department of Computer Science, Umiacs University of Maryland College Park, MD(计算机科学系,乌米亚茨大学马里兰大学学院公园分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏