arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10451 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10451 篇

2507.02851 2025-07-04 cs.CL cs.AI cs.IT cs.LG cs.SY eess.SY math.IT 67%

MOTIF: Modular Thinking via Reinforcement Fine-tuning in LLMs

Purbesh Mitra, Sennur Ulukus

机构 * University of Maryland(马里兰大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02506 2025-07-04 cs.CL cs.AI cs.LG 67%

IndianBailJudgments-1200: A Multi-Attribute Dataset for Legal NLP on Indian Bail Orders

Sneha Deshmukh, Prathmesh Kamble

机构 * Department of Computer Engineering, Datta Meghe College of Engineering(计算机工程系,达塔梅赫学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 9 pages, 9 figures, 2 tables. Dataset available at Hugging Face and GitHub. Submitted to arXiv for open access

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21319 2025-07-03 cs.HC cs.CV 67%

SimVecVis: A Dataset for Enhancing MLLMs in Visualization Understanding

Can Liu, Chunlin Da, Xiaoxiao Long, Yuxiao Yang, Yu Zhang, Yong Wang

机构 * Nanyang Technological University(南洋理工大学) ByteDance Inc.(字节跳动公司) Nanjing University(南京大学) Tsinghua University(清华大学) University of Oxford(牛津大学)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22419 2025-07-02 cs.AI cs.CL cs.LG 67%

The Automated LLM Speedrunning Benchmark: Reproducing NanoGPT Improvements

Bingchen Zhao, Despoina Magka, Minqi Jiang, Xian Li, Roberta Raileanu, Tatiana Shavrina, Jean-Christophe Gagnon-Audet, Kelvin Niu, Shagun Sodhani, Michael Shvartsman, Andrei Lupu, Alisia Lupidi, Edan Toledo, Karen Hambardzumyan, Martin Josifoski, Thomas Foster, Lucia Cipolina-Kun, Abhishek Charnalia, Derek Dunfield, Alexander H. Miller, Oisin Mac Aodha, Jakob Foerster, Yoram Bachrach

机构 * Meta University of Edinburgh(爱丁堡大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01875 2025-07-01 cs.CL cs.AI cs.LG 67%

Time-MQA: Time Series Multi-Task Question Answering with Context Enhancement

Yaxuan Kong, Yiyuan Yang, Yoontae Hwang, Wenjie Du, Stefan Zohren, Zhangyang Wang, Ming Jin, Qingsong Wen

机构 * University of Oxford(牛津大学) PyPOTS Research(PyPOTS研究) University of Texas at Austin(德克萨斯大学奥斯汀分校) Griffith University(格里菲斯大学) Squirrel Ai Learning(Squirrel Ai学习)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Annual Meeting of the Association for Computational Linguistics (ACL 2025, Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03124 2025-07-01 cs.CL cs.AI cs.LG 67%

PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models

Mingyang Song, Zhaochen Su, Xiaoye Qu, Jiawei Zhou, Yu Cheng

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by ACL 2025 Main. Project Page: https://prmbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21558 2025-06-30 cs.CL cs.AI cs.LG 67%

Bench to the Future: A Pastcasting Benchmark for Forecasting Agents

FutureSearch, :, Jack Wildman, Nikos I. Bosse, Daniel Hnyk, Peter Mühlbacher, Finn Hambly, Jon Evans, Dan Schwarz, Lawrence Phillips

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00412 2025-06-23 cs.LG cs.AI cs.CL 67%

Adapting While Learning: Grounding LLMs for Scientific Problems with Intelligent Tool Usage Adaptation

Bohan Lyu, Yadi Cao, Duncan Watson-Parris, Leon Bergen, Taylor Berg-Kirkpatrick, Rose Yu

机构 * Tsinghua University(清华大学) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 37 pages, 16 figures

Journal ref In Proceedings of the Forty-second International Conference on Machine Learning (ICML 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15594 2025-06-19 cs.CL cs.AI cs.LG 67%

WikiMixQA: A Multimodal Benchmark for Question Answering over Tables and Charts

Negar Foroutan, Angelika Romanou, Matin Ansaripour, Julian Martin Eisenschlos, Karl Aberer, Rémi Lebret

机构 * EPFL(苏黎世联邦理工学院) Google DeepMind(谷歌DeepMind) Universidad Nacional de Córdoba(国家科隆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14100 2025-06-18 cs.RO cs.SY eess.SY 67%

A Hierarchical Test Platform for Vision Language Model (VLM)-Integrated Real-World Autonomous Driving

Yupeng Zhou, Can Cui, Juntong Peng, Zichong Yang, Juanwu Lu, Jitesh H Panchal, Bin Yao, Ziran Wang

机构 * Purdue University(普渡大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12525 2025-06-17 cs.RO 67%

A Spatial Relationship Aware Dataset for Robotics

Peng Wang, Minh Huy Pham, Zhihao Guo, Wei Zhou

机构 * Manchester Metropolitan University(曼彻斯特 Metropolitan 大学) Cardiff University(卡迪夫大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

Comments 7 pages; 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11110 2025-06-16 cs.CL cs.AI cs.LG 67%

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models

Jaeho Lee, Atharv Chowdhary

机构 * Brown University(布朗大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 15 pages, 4 figures, appendix contains 2 additional figures and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10378 2025-06-13 cs.LG cs.AI cs.CL stat.ML 67%

Discovering Hierarchical Latent Capabilities of Language Models via Causal Representation Learning

Jikai Jin, Vasilis Syrgkanis, Sham Kakade, Hanlin Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04907 2025-06-13 cs.CL cs.AI cs.IR cs.LG 67%

Context Is Not Comprehension

Alex Pan, Mary-Anne Williams

机构 * UNSW Business School(新南威尔士大学商学院) UNSW AI Institute(新南威尔士大学人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 24 pages, 2 figures, 4 tables; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09930 2025-06-12 cs.RO cs.CV 67%

From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models

Irving Fang, Juexiao Zhang, Shengbang Tong, Chen Feng

机构 * New York University(纽约大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17441 2025-06-12 cs.CL cs.AI cs.LG 67%

Discovering Forbidden Topics in Language Models

Can Rager, Chris Wendler, Rohit Gandikota, David Bau

机构 * Independent(独立研究者) Northeastern University(东北大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08920 2025-06-11 cs.CL cs.AI cs.LG 67%

PropMEND: Hypernetworks for Knowledge Propagation in LLMs

Zeyu Leo Liu, Greg Durrett, Eunsol Choi

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09622 2025-06-10 cs.LG cs.AI cs.CL stat.ML 67%

Theoretical Benefit and Limitation of Diffusion Language Model

Guhao Feng, Yihan Geng, Jian Guan, Wei Wu, Liwei Wang, Di He

机构 * Peking University(北京大学) Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 32 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18433 2025-06-10 cs.LG cs.AI cs.CL 67%

Easy2Hard-Bench: Standardized Difficulty Labels for Profiling LLM Performance and Generalization

Mucong Ding, Chenghao Deng, Jocelyn Choo, Zichu Wu, Aakriti Agrawal, Avi Schwarzschild, Tianyi Zhou, Tom Goldstein, John Langford, Anima Anandkumar, Furong Huang

机构 * University of Maryland(马里兰大学) University of Waterloo(滑铁卢大学) Carnegie Mellon University(卡内基梅隆大学) California Institute of Technology(加州理工学院) Microsoft(微软) Capital One

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2024 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.20331 2025-06-10 cs.CV cs.AI cs.CL cs.LG 67%

Unsolvable Problem Detection: Robust Understanding Evaluation for Large Multimodal Models

Atsuyuki Miyai, Jingkang Yang, Jingyang Zhang, Yifei Ming, Qing Yu, Go Irie, Yixuan Li, Hai Li, Ziwei Liu, Kiyoharu Aizawa

机构 * The University of Tokyo(东京大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室) Duke University(杜克大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) LY Corporation(LY公司) Tokyo University of Science(东京科学大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10415 2025-06-10 cs.CL cs.AI cs.LG 67%

LLM-SRBench: A New Benchmark for Scientific Equation Discovery with Large Language Models

Parshin Shojaee, Ngoc-Hieu Nguyen, Kazem Meidani, Amir Barati Farimani, Khoa D Doan, Chandan K Reddy

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICML 2025 Oral. Project page: https://github.com/deep-symbolic-mathematics/llm-srbench , Benchmark page: https://huggingface.co/datasets/nnheui/llm-srbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07978 2025-06-10 cs.CL cs.AI cs.LG 67%

AfroBench: How Good are Large Language Models on African Languages?

Jessica Ojo, Odunayo Ogundepo, Akintunde Oladipo, Kelechi Ogueji, Jimmy Lin, Pontus Stenetorp, David Ifeoluwa Adelani

机构 * Masakhane NLP(Masakhane自然语言处理) Mila - Quebec AI Institute & McGill University(Mila-魁北克人工智能研究所及麦吉尔大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) Lelapa AI(Lelapa人工智能) The African Research Collective(非洲研究集体) University of Waterloo(滑铁卢大学) University College London(伦敦大学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to ACL 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05429 2025-06-09 cs.CV cs.AI cs.CL cs.LG 67%

Coordinated Robustness Evaluation Framework for Vision-Language Models

Ashwin Ramesh Babu, Sajad Mousavi, Vineet Gundecha, Sahand Ghorbanpour, Avisek Naug, Antonio Guillen, Ricardo Luna Gutierrez, Soumyendu Sarkar

机构 * Hewlett Packard Enterprise (Hewlett Packard Labs)(惠普企业公司(惠普实验室))

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted: IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04089 2025-06-05 cs.LG cs.AI cs.CL cs.RO 67%

AmbiK: Dataset of Ambiguous Tasks in Kitchen Environment

Anastasiia Ivanova, Eva Bakaeva, Zoya Volovikova, Alexey K. Kovalev, Aleksandr I. Panov

机构 * LMU(慕尼黑大学) MIPT(莫斯科 Institute of Physics and Technology) AIRI(空气研究所)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12094 2025-06-03 cs.CL cs.AI cs.LG 67%

SepLLM: Accelerate Large Language Models by Compressing One Segment into One Separator

Guoxuan Chen, Han Shi, Jiawei Li, Yihang Gao, Xiaozhe Ren, Yimeng Chen, Xin Jiang, Zhenguo Li, Weiyang Liu, Chao Huang

专题命中 推理评测 :CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13948 2025-06-03 cs.AI cs.CL cs.LG 67%

CityGPT: Empowering Urban Spatial Cognition of Large Language Models

Jie Feng, Tianhui Liu, Yuwei Du, Siqi Guo, Yuming Lin, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系、BNRist、清华大学) School of Electronic and Information Engineering, Beijing Jiaotong University(电子信息工程学院、北京交通大学) Department of Electronic Engineering, Tsinghua University(电子工程系、清华大学) Department of Urban Planning, Tsinghua University(城市规划系、清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by KDD 2025 Research Track, https://github.com/tsinghua-fib-lab/CityGPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00072 2025-06-03 cs.CY cs.AI cs.CL cs.LG 67%

Evaluating Prompt Engineering Techniques for Accuracy and Confidence Elicitation in Medical LLMs

Nariman Naderi, Zahra Atf, Peter R Lewis, Aref Mahjoub far, Seyed Amir Ahmad Safavi-Naini, Ali Soroush

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments This paper was accepted for presentation at the 7th International Workshop on EXplainable, Trustworthy, and Responsible AI and Multi-Agent Systems (EXTRAAMAS 2025). Workshop website: https://extraamas.ehealth.hevs.ch/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24878 2025-06-02 cs.AI cs.CL cs.CV cs.LG 67%

Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents

Yaxin Luo, Zhaoyi Li, Jiacheng Liu, Jiacheng Cui, Xiaohan Zhao, Zhiqiang Shen

机构 * VILA Lab, MBZUAI(VILA实验室,MBZUAI) MetaAgentX

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Code at: https://github.com/MetaAgentX/OpenCaptchaWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23854 2025-06-02 cs.CL cs.AI cs.LG 67%

Revisiting Uncertainty Estimation and Calibration of Large Language Models

Linwei Tao, Yi-Fan Yeh, Minjing Dong, Tao Huang, Philip Torr, Chang Xu

机构 * School of Computer Science University of Sydney(悉尼大学计算机科学学院) City University of Hong Kong(香港城市大学) Shanghai Jiao Tong University(上海交通大学) Department of Engineering Science University of Oxford(牛津大学工程科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23504 2025-05-30 cs.CV 67%

VAU-R1: Advancing Video Anomaly Understanding via Reinforcement Fine-Tuning

Liyun Zhu, Qixiang Chen, Xi Shen, Xiaodong Cun

机构 * Australian National University(澳大利亚国立大学) GVC Lab, Great Bay University(大湾大学GVC实验室) Intellindust AI Lab(Intellindust AI实验室)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏