arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10379 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10379 篇

2504.15777 2025-06-13 cs.CL cs.AI cs.LG 82%

Tina: Tiny Reasoning Models via LoRA

Shangshang Wang, Julian Asilis, Ömer Faruk Akgül, Enes Burak Bilgin, Ollie Liu, Willie Neiswanger

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08295 2025-06-11 cs.LG cs.AI cs.CL 82%

From Passive to Active Reasoning: Can Large Language Models Ask the Right Questions under Incomplete Information?

Zhanke Zhou, Xiao Feng, Zhaocheng Zhu, Jiangchao Yao, Sanmi Koyejo, Bo Han

机构 * TMLR Group, Department of Computer Science, Hong Kong Baptist University Stanford University Mila - Qu\'ebec AI Institute Cooperative Medianet Innovation Center, Shanghai Jiao Tong University

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07936 2025-06-10 cs.CV cs.AI cs.CL cs.LG 82%

Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models

Chengyue Huang, Yuchen Zhu, Sichen Zhu, Jingyun Xiao, Moises Andrade, Shivang Chopra, Zsolt Kira

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20377 2025-06-10 cs.LG cs.AI cs.CL 82%

PhantomWiki: On-Demand Datasets for Reasoning and Retrieval Evaluation

Albert Gong, Kamilė Stankevičiūtė, Chao Wan, Anmol Kabra, Raphael Thesmar, Johann Lee, Julius Klenke, Carla P. Gomes, Kilian Q. Weinberger

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08248 2025-06-10 cs.CL cs.AI cs.IR cs.LG 82%

Eliciting In-context Retrieval and Reasoning for Long-context Large Language Models

Yifu Qiu, Varun Embar, Yizhe Zhang, Navdeep Jaitly, Shay B. Cohen, Benjamin Han

机构 * University of Edinburgh(爱丁堡大学) Apple(苹果公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05632 2025-06-09 cs.CL cs.AI cs.LG 82%

Reasoning Towards Fairness: Mitigating Bias in Language Models through Reasoning-Guided Fine-Tuning

Sanchit Kabra, Akshita Jha, Chandan K. Reddy

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07608 2025-06-06 cs.CL cs.AI cs.LG 82%

MiMo: Unlocking the Reasoning Potential of Language Model -- From Pretraining to Posttraining

LLM-Core Xiaomi, :, Bingquan Xia, Bowen Shen, Cici, Dawei Zhu, Di Zhang, Gang Wang, Hailin Zhang, Huaqiu Liu, Jiebao Xiao, Jinhao Dong, Liang Zhao, Peidian Li, Peng Wang, Shihua Yu, Shimao Chen, Weikun Wang, Wenhan Ma, Xiangwei Deng, Yi Huang, Yifan Song, Zihan Jiang, Bowen Ye, Can Cai, Chenhong He, Dong Zhang, Duo Zhang, Guoan Wang, Hao Tian, Haochen Zhao, Heng Qu, Hongshen Xu, Jun Shi, Kainan Bao, Kai Fang, Kang Zhou, Kangyang Zhou, Lei Li, Menghang Zhu, Nuo Chen, Qiantong Wang, Shaohui Liu, Shicheng Li, Shuhao Gu, Shuhuai Ren, Shuo Liu, Sirui Deng, Weiji Zhuang, Weiwei Lv, Wenyu Yang, Xin Zhang, Xing Yong, Xing Zhang, Xingchen Song, Xinzhe Xu, Xu Wang, Yihan Yan, Yu Tu, Yuanyuan Tian, Yudong Wang, Yue Yu, Zhenru Lin, Zhichao Song, Zihao Yue

机构 * LLM-Core Xiaomi(LLM-Core小米)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02911 2025-06-04 cs.CL cs.AI cs.CE cs.HC cs.LG 82%

Cell-o1: Training LLMs to Solve Single-Cell Reasoning Puzzles with Reinforcement Learning

Yin Fang, Qiao Jin, Guangzhi Xiong, Bowen Jin, Xianrui Zhong, Siru Ouyang, Aidong Zhang, Jiawei Han, Zhiyong Lu

机构 * National Institutes of Health(美国国立卫生研究院) University of Virginia(弗吉尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 28 pages; 16 tables; 7 figures; Code: https://github.com/ncbi-nlp/cell-o1

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13508 2025-06-04 cs.CL cs.AI cs.LG 82%

Time-R1: Towards Comprehensive Temporal Reasoning in LLMs

Zijia Liu, Peixuan Han, Haofei Yu, Haoru Li, Jiaxuan You

机构 * Siebel School of Computing and Data Science, University of Illinois at Urbana-Champaign(计算机与数据科学学院,伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24823 2025-06-02 cs.LG cs.AI cs.CL 82%

PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models

Yinggan Xu, Yue Liu, Zhiqiang Gao, Changnan Peng, Di Luo

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02826 2025-05-28 cs.CV 82%

Envisioning Beyond the Pixels: Benchmarking Reasoning-Informed Visual Editing

Xiangyu Zhao, Peiyuan Zhang, Kexian Tang, Xiaorong Zhu, Hao Li, Wenhao Chai, Zicheng Zhang, Renqiu Xia, Guangtao Zhai, Junchi Yan, Hua Yang, Xue Yang, Haodong Duan

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Wuhan University(武汉大学) Tongji University(同济大学) Princeton University(普林斯顿大学)

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13112 2025-05-28 cs.CV 82%

SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models

Xianda Guo, Ruijun Zhang, Yiqun Duan, Yuhang He, Dujun Nie, Wenke Huang, Chenming Zhang, Shuai Liu, Hao Zhao, Long Chen

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Waytous University of Technology Sydney(悉尼大学) Microsoft Research(微软研究院) IAIR, Xi’an Jiaotong University(西安交通大学IAIR) TikTok AIR, Tsinghua University(清华大学AIR)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16367 2025-05-23 cs.IR 82%

Chain-of-Thought Poisoning Attacks against R1-based Retrieval-Augmented Generation Systems

Hongru Song, Yu-an Liu, Ruqing Zhang, Jiafeng Guo, Yixing Fan

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract)

Comments 7 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14552 2025-05-22 cs.CL cs.AI cs.LG 82%

KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation

Jiajun Shi, Jian Yang, Jiaheng Liu, Xingyuan Bu, Jiangjie Chen, Junting Zhou, Kaijing Ma, Zhoufutu Wen, Bingli Wang, Yancheng He, Liang Song, Hualei Zhu, Shilong Li, Xingjian Wang, Wei Zhang, Ruibin Yuan, Yifan Yao, Wenjun Yang, Yunli Wang, Siyuan Fang, Siyu Yuan, Qianyu He, Xiangru Tang, Yingshui Tan, Wangchunshu Zhou, Zhaoxiang Zhang, Zhoujun Li, Wenhao Huang, Ge Zhang

机构 * Beihang University(北航)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14396 2025-05-21 cs.AI cs.CL cs.LG 82%

Causal Cartographer: From Mapping to Reasoning Over Counterfactual Worlds

Gaël Gendron, Jože M. Rožanec, Michael Witbrock, Gillian Dobbie

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 29 pages, 9 pages for the main paper, 20 pages for the references and appendix, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13115 2025-05-20 cs.CL cs.AI cs.LG cs.SD eess.AS 82%

Benchmarking and Confidence Evaluation of LALMs For Temporal Reasoning

Debarpan Bhattacharya, Apoorva Kulkarni, Sriram Ganapathy

机构 * Indian Institute of Science(印度科学研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted in INTERSPEECH, 2025, Rotterdam, The Netherlands

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04653 2025-05-09 cs.CL cs.AI cs.CV cs.LG 82%

Advancing Conversational Diagnostic AI with Multimodal Reasoning

Khaled Saab, Jan Freyberg, Chunjong Park, Tim Strother, Yong Cheng, Wei-Hung Weng, David G. T. Barrett, David Stutz, Nenad Tomasev, Anil Palepu, Valentin Liévin, Yash Sharma, Roma Ruparel, Abdullah Ahmed, Elahe Vedadi, Kimberly Kanada, Cian Hughes, Yun Liu, Geoff Brown, Yang Gao, Sean Li, S. Sara Mahdavi, James Manyika, Katherine Chou, Yossi Matias, Avinatan Hassidim, Dale R. Webster, Pushmeet Kohli, S. M. Ali Eslami, Joëlle Barral, Adam Rodman, Vivek Natarajan, Mike Schaekermann, Tao Tu, Alan Karthikesalingam, Ryutaro Tanno

机构 * Google(谷歌) DeepMind(深Mind) Google Research(谷歌研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20752 2025-05-08 cs.CL cs.AI cs.LG 82%

Grokking in the Wild: Data Augmentation for Real-World Multi-Hop Reasoning with Transformers

Roman Abramov, Felix Steinbauer, Gjergji Kasneci

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to the International Conference on Machine Learning (ICML) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18080 2025-04-28 cs.CL cs.AI cs.LG 82%

Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization

Wataru Kawakami, Keita Suzuki, Junichiro Iwasawa

机构 * Preferred Networks Inc.(Preferred Networks公司) Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02810 2025-04-28 cs.CL cs.AI cs.LG 82%

Generative Evaluation of Complex Reasoning in Large Language Models

Haowei Lin, Xiangyu Wang, Ruilin Yan, Baizhou Huang, Haotian Ye, Jianhua Zhu, Zihao Wang, James Zou, Jianzhu Ma, Yitao Liang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12523 2025-04-18 cs.CL cs.AI cs.LG 82%

Memorization vs. Reasoning: Updating LLMs with New Knowledge

Aochong Oliver Li, Tanya Goyal

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04348 2025-04-17 cs.CV 82%

OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning

Shihao Wang, Zhiding Yu, Xiaohui Jiang, Shiyi Lan, Min Shi, Nadine Chang, Jan Kautz, Ying Li, Jose M. Alvarez

专题命中 推理评测 :reasoning(title,abstract);planning(abstract)

Comments Mistaken resubmission. The original version is at arXiv:2405.01533

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01533 2025-04-17 cs.CV 82%

OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning

Shihao Wang, Zhiding Yu, Xiaohui Jiang, Shiyi Lan, Min Shi, Nadine Chang, Jan Kautz, Ying Li, Jose M. Alvarez

专题命中 推理评测 :reasoning(title,abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13640 2025-04-17 cs.CL cs.AI cs.LG 82%

Knowledge Graph Reasoning with Self-supervised Reinforcement Learning

Ying Ma, Owen Burns, Mingqiu Wang, Gang Li, Nan Du, Laurent El Shafey, Liqiang Wang, Izhak Shafran, Hagen Soltau

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 17 pages, 11 figures

Journal ref IEEE Transactions on Audio, Speech and Language Processing, vol. 33, pp. 1508-1519, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09644 2025-04-15 cs.CV 82%

SegEarth-R1: Geospatial Pixel Reasoning via Large Language Model

Kaiyu Li, Zepeng Xin, Li Pang, Chao Pang, Yupeng Deng, Jing Yao, Guisong Xia, Deyu Meng, Zhi Wang, Xiangyong Cao

专题命中 推理评测 :reasoning(title,abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04945 2025-04-08 cs.LG cs.AI cs.CL 82%

A Llama walks into the 'Bar': Efficient Supervised Fine-Tuning for Legal Reasoning in the Multi-state Bar Exam

Rean Fernandes, André Biedenkapp, Frank Hutter, Noor Awad

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments COLM 2025 preprint, 9 pages, 3 figures, 16 appendix pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23064 2025-04-03 cs.CV 82%

VGRP-Bench: Visual Grid Reasoning Puzzle Benchmark for Large Vision-Language Models

Yufan Ren, Konstantinos Tertikas, Shalini Maiti, Junlin Han, Tong Zhang, Sabine Süsstrunk, Filippos Kokkinos

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract)

Comments 8 pages; Project page: https://yufan-ren.com/subpage/VGRP-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23421 2025-04-01 cs.SE 82%

A Multi-agent Onboarding Assistant based on Large Language Models, Retrieval Augmented Generation, and Chain-of-Thought

Andrei Cristian Ionescu, Sergey Titov, Maliheh Izadi

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract)

Comments Accepted in The ACM International Conference on the Foundations of Software Engineering (FSE 2025) - Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06874 2025-03-28 cs.CL cs.AI cs.LG 82%

Group Reasoning Emission Estimation Networks

Yanming Guo, Xiao Qian, Kevin Credit, Jin Ma

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10639 2025-03-14 cs.CV 82%

GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing

Rongyao Fang, Chengqi Duan, Kun Wang, Linjiang Huang, Hao Li, Shilin Yan, Hao Tian, Xingyu Zeng, Rui Zhao, Jifeng Dai, Xihui Liu, Hongsheng Li

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract)

Comments Dataset and models are released in https://github.com/rongyaofang/GoT

详情

展开后加载摘要…

URL PDF HTML 收藏