arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10451 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10451 篇

2504.04373 2025-04-08 cs.CL cs.AI cs.LG 67%

StyleRec: A Benchmark Dataset for Prompt Recovery in Writing Style Transformation

Shenyang Liu, Yang Gao, Shaoyan Zhai, Liqiang Wang

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 2024 IEEE International Conference on Big Data (BigData)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17475 2025-04-08 eess.SP cs.AI cs.CL cs.LG 67%

ECG-Expert-QA: A Benchmark for Evaluating Medical Large Language Models in Heart Disease Diagnosis

Xu Wang, Jiaju Kang, Puyu Han, Yubao Zhao, Qian Liu, Liwenfei He, Lingqiong Zhang, Lingyun Dai, Yongcheng Wang, Jie Tao

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02189 2025-04-08 cs.CV cs.AI cs.CL cs.LG cs.RO 67%

A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges

Zongxia Li, Xiyang Wu, Hongyang Du, Fuxiao Liu, Huy Nghiem, Guangyao Shi

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 22 pages, 3 figures

Journal ref Navigating the Future: Ensuring Trustworthiness in Multi-Modal Open-World Intelligence @ CVPR, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12784 2025-04-08 cs.AI cs.CL cs.LG 67%

JudgeBench: A Benchmark for Evaluating LLM-based Judges

Sijun Tan, Siyuan Zhuang, Kyle Montgomery, William Y. Tang, Alejandro Cuadron, Chenguang Wang, Raluca Ada Popa, Ion Stoica

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13269 2025-04-02 cs.DB 67%

DAgent: A Relational Database-Driven Data Analysis Report Generation Agent

Wenyi Xu, Yuren Mao, Xiaolu Zhang, Chao Zhang, Xuemei Dong, Mengfei Zhang, Yunjun Gao

专题命中 推理评测 :reasoning(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20851 2025-03-28 cs.SE 67%

StepGrade: Grading Programming Assignments with Context-Aware LLMs

Mohammad Akyash, Kimia Zamiri Azar, Hadi Mardani Kamali

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract)

Comments Accepted to the 15th IEEE Integrated STEM Education Conference (ISEC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08687 2025-03-27 cs.CV 67%

VisionArena: 230K Real World User-VLM Conversations with Preference Labels

Christopher Chou, Lisa Dunlap, Koki Mashita, Krishna Mandal, Trevor Darrell, Ion Stoica, Joseph E. Gonzalez, Wei-Lin Chiang

专题命中 推理评测 :reasoning(abstract);planning(abstract)

Comments updated for CVPR Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16416 2025-03-21 cs.AI cs.CL cs.LG 67%

Survey on Evaluation of LLM-based Agents

Asaf Yehudai, Lilach Eden, Alan Li, Guy Uziel, Yilun Zhao, Roy Bar-Haim, Arman Cohan, Michal Shmueli-Scheuer

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13335 2025-03-18 cs.CL cs.AI cs.LG stat.AP 67%

Reliable and Efficient Amortized Model-based Evaluation

Sang Truong, Yuheng Tu, Percy Liang, Bo Li, Sanmi Koyejo

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11400 2025-03-17 cs.CV cs.RO 67%

A Framework for a Capability-driven Evaluation of Scenario Understanding for Multimodal Large Language Models in Autonomous Driving

Tin Stribor Sohn, Philipp Reis, Maximilian Dillitzer, Johannes Bach, Jason J. Corso, Eric Sax

专题命中 推理评测 :reasoning(abstract);planning(abstract)

Comments Submitted to IEEE IAVVC 2025, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05788 2025-03-17 cs.LG cs.AI cs.CL 67%

Emergent Abilities in Large Language Models: A Survey

Leonardo Berti, Flavio Giorgi, Gjergji Kasneci

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07002 2025-03-11 cs.CV 67%

Taking Notes Brings Focus? Towards Multi-Turn Multimodal Dialogue Learning

Jiazheng Liu, Sipeng Zheng, Börje F. Karlsson, Zongqing Lu

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06074 2025-03-11 cs.CL cs.AI cs.LG 67%

Towards Conversational AI for Disease Management

Anil Palepu, Valentin Liévin, Wei-Hung Weng, Khaled Saab, David Stutz, Yong Cheng, Kavita Kulkarni, S. Sara Mahdavi, Joëlle Barral, Dale R. Webster, Katherine Chou, Avinatan Hassidim, Yossi Matias, James Manyika, Ryutaro Tanno, Vivek Natarajan, Adam Rodman, Tao Tu, Alan Karthikesalingam, Mike Schaekermann

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 62 pages, 7 figures in main text, 36 figures in appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04828 2025-03-10 cs.CL cs.AI cs.LG 67%

Beyond Next Word Prediction: Developing Comprehensive Evaluation Frameworks for measuring LLM performance on real world applications

Vishakha Agrawal, Archie Chaudhury, Shreya Agrawal

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04808 2025-03-10 cs.CL cs.AI cs.LG 67%

Learning from Failures in Multi-Attempt Reinforcement Learning

Stephen Chung, Wenyu Du, Jie Fu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10351 2025-03-10 cs.SE 67%

Bias Unveiled: Investigating Social Bias in LLM-Generated Code

Lin Ling, Fazle Rabbi, Song Wang, Jinqiu Yang

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract)

Comments accepted for publication in the Association for the Advancement of Artificial Intelligence (AAAI), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04176 2025-03-07 cs.AI cs.CE cs.CL cs.LG 67%

TIMER: Temporal Instruction Modeling and Evaluation for Longitudinal Clinical Records

Hejie Cui, Alyssa Unell, Bowen Chen, Jason Alan Fries, Emily Alsentzer, Sanmi Koyejo, Nigam Shah

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08587 2025-03-03 cs.CL cs.AI cs.LG 67%

CS-Bench: A Comprehensive Benchmark for Large Language Models towards Computer Science Mastery

Xiaoshuai Song, Muxi Diao, Guanting Dong, Zhengyang Wang, Yujia Fu, Runqi Qiao, Zhexu Wang, Dayuan Fu, Huangxuan Wu, Bin Liang, Weihao Zeng, Yejie Wang, Zhuoma GongQue, Jianing Yu, Qiuna Tan, Weiran Xu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00234 2025-03-03 cs.HC cs.AI cs.CL cs.LG 67%

Can Generative AI Support Patients' & Caregivers' Informational Needs? Towards Task-Centric Evaluation Of AI Systems

Shreya Rajagopal, Jae Ho Sohn, Hari Subramonyam, Shiwali Mohan

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Journal ref Joint Proceedings of the ACM IUI Workshops 2025, March 24-27, 2025, Cagliari, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20356 2025-02-28 cs.CL cs.AI cs.LG 67%

Bridging the Creativity Understanding Gap: Small-Scale Human Alignment Enables Expert-Level Humor Ranking in LLMs

Kuan Lok Zhou, Jiayi Chen, Siddharth Suresh, Reuben Narad, Timothy T. Rogers, Lalit K Jain, Robert D Nowak, Bob Mankoff, Jifan Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15790 2025-02-27 cs.CL cs.AI cs.LG 67%

Small Language Models: Survey, Measurements, and Insights

Zhenyan Lu, Xiang Li, Dongqi Cai, Rongjie Yi, Fangming Liu, Xiwen Zhang, Nicholas D. Lane, Mengwei Xu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08090 2025-02-25 cs.CL cs.AI cs.LG 67%

Multilingual LLMs Inherently Reward In-Language Time-Sensitive Semantic Alignment for Low-Resource Languages

Ashutosh Bajpai, Tanmoy Chakraborty

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14905 2025-02-24 cs.CL cs.AI cs.LG 67%

Think Inside the JSON: Reinforcement Strategy for Strict LLM Schema Adherence

Bhavik Agarwal, Ishan Joshi, Viktoria Rojkova

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14619 2025-02-21 cs.LG cs.AI cs.CL 67%

Reward Models Identify Consistency, Not Causality

Yuhui Xu, Hanze Dong, Lei Wang, Caiming Xiong, Junnan Li

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14318 2025-02-21 cs.CL cs.AI cs.LG 67%

Line Goes Up? Inherent Limitations of Benchmarks for Evaluating Large Language Models

James Fodor

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11886 2025-02-18 cs.LG cs.AI cs.CL 67%

LIMR: Less is More for RL Scaling

Xuefeng Li, Haoyang Zou, Pengfei Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 6pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10263 2025-02-17 cs.CL cs.AI cs.CY cs.DB cs.LG 67%

Large Language Models and Synthetic Data for Monitoring Dataset Mentions in Research Papers

Aivin V. Solatorio, Rafael Macalaba, James Liounis

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Project GitHub repository at https://github.com/worldbank/ai4data-use

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11044 2025-02-11 cs.CL cs.AI cs.LG 67%

Evaluating the Performance of Large Language Models via Debates

Behrad Moniri, Hamed Hassani, Edgar Dobriban

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02804 2025-02-10 cs.AI cs.CL cs.LG 67%

ACCORD: Closing the Commonsense Measurability Gap

François Roewer-Després, Jinyue Feng, Zining Zhu, Frank Rudzicz

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments For leaderboard and dataset download, see https://www.codabench.org/competitions/3160/ For source code, see https://github.com/francois-rd/accord/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12747 2025-02-04 cs.LG cs.AI cs.CL stat.ML 67%

ALMANACS: A Simulatability Benchmark for Language Model Explainability

Edmund Mills, Shiye Su, Stuart Russell, Scott Emmons

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Code is available at https://github.com/edmundmills/ALMANACS}{https://github.com/edmundmills/ALMANACS

详情

展开后加载摘要…

URL PDF HTML 收藏