arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10379 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10379 篇

2601.10455 2026-01-16 cs.CL cs.RO 83%

SurgGoal: Rethinking Surgical Planning Evaluation via Goal-Satisfiability

SurgGoal: 重新思考手术计划评估 via 目标满足性

Ruochen Li, Kun Yuan, Yufei Xia, Yue Zhou, Qingyu Lu, Weihang Li, Youxiang Zhu, Nassir Navab

机构 * Technical University of Munich, Germany(慕尼黑技术大学) University of Strasbourg, France(斯特拉斯堡大学) University of Glasgow, United Kingdom(格拉斯哥大学) Nanyang Technological University, Singapore(南洋理工大学) University of Massachusetts Boston, USA(马萨诸塞大学波士顿分校)

专题命中 推理评测 :planning(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 SurgGoal通过目标满足性度量重新评估手术计划,揭示视频大语言模型在安全关键环境中的性能问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19126 2026-01-16 cs.CL 83%

AWPO: Enhancing Tool-Use of Large Language Models through Adaptive Integration of Reasoning Rewards

AWPO: 通过适应性整合推理奖励增强大语言模型的工具使用

Zihan Lin, Xiaohan Wang, Hexiong Yang, Jiajun Chai, Jie Cao, Guojun Yin, Wei Lin, Ran He

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 AWPO通过适应性整合推理奖励提升大语言模型的工具使用性能,实现多轮场景中的卓越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07375 2026-01-13 cs.CL 83%

GROKE: Vision-Free Navigation Instruction Evaluation via Graph Reasoning on OpenStreetMap

GROKE: 通过OpenStreetMap上的图推理进行无视觉导航指令评估

Farzad Shami, Subhrasankha Dey, Nico Van de Weghe, Henrikki Tenkanen

机构 * Aalto University(阿alto大学) Ghent University(根特大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.CL

AI总结 GROKE提出一种基于OpenStreetMap的无视觉导航指令评估框架,通过图推理和拓扑导航提升评估精度与可扩展性。

Comments Under Review for ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02739 2026-01-07 cs.CL 83%

Mitigating Prompt-Induced Hallucinations in Large Language Models via Structured Reasoning

通过结构化推理缓解大型语言模型中的提示诱导幻觉

Jinbo Hao, Kai Yang, Qingzhen Su, Yang Chen, Yifan Li, Chao Jiang

机构 * School of Computer Engineering, Jiangsu Ocean University(江苏海洋大学计算机工程学院) School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文通过引入代码模块和结构化推理方法,有效缓解了大型语言模型中的提示诱导幻觉问题,提升了模型的准确性和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01825 2026-01-06 cs.CL 83%

CSCBench: A PVC Diagnostic Benchmark for Commodity Supply Chain Reasoning

CSCBench: 一种用于商品供应链推理的PVC诊断基准

Yaxin Cui, Yuanqiang Zeng, Jiapeng Yan, Keling Lin, Kai Ji, Jianhui Zeng, Sheng Zhang, Xin Luo, Binzhu Su, Chaolai Shen, Jiahao Yu

机构 * Xiamen SmartChain Innovations Co., Ltd.(厦门智能链创新有限公司) Xiamen ITG Digital Technology Co., Ltd.(厦门ITG数字科技有限公司) Xiamen C&D Co., Ltd.(厦门C&D有限公司) Xiamen Xiangyu Co., Ltd.(厦门翔宇有限公司)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.CL

AI总结 CSCBench通过PVC 3D评估框架,为商品供应链推理提供诊断基准,评估LLMs在过程、品种和认知轴上的表现,发现其在品种轴上尤其存在显著下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01407 2026-01-06 cs.CL 83%

From Emotion Classification to Emotional Reasoning: Enhancing Emotional Intelligence in Large Language Models

从情绪分类到情绪推理:提升大语言模型情感智能

Arjhun Sreedar, Rohan Pillay, Laukik Patade

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文通过合成情绪链式思维数据提升大语言模型的情感推理能力,实验表明微调后模型在情绪理解与意识评估上显著提升。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26122 2026-01-06 cs.CL 83%

Reasoning Path Divergence: A New Metric and Curation Strategy to Unlock LLM Diverse Thinking

推理路径分歧:一种新的度量和筛选策略,以解锁LLM多样化思考

Feng Ju, Zeyu Qin, Rui Min, Zhitao He, Lingpeng Kong, Yi R. Fung

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) University of Science and Technology of China(中国科学技术大学) The University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出了一种新的训练范式1PNS和度量RPD,通过增加推理多样性提升LLM的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13082 2025-12-30 cs.CL 83%

Patience Is The Key to Large Language Model Reasoning

耐心是大型语言模型推理的关键

Yijiong Yu

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

AI总结 本研究提出了一种无需额外知识或技能的简单方法,通过鼓励模型采用更耐心的推理风格,提升大型语言模型在复杂任务中的性能。

Comments The paper is not solid enough because the evaluation data is too less and the improvement is not significant

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22275 2025-12-30 cs.CV cs.AI 83%

The Illusion of Clinical Reasoning: A Benchmark Reveals the Pervasive Gap in Vision-Language Models for Clinical Competency

临床推理的幻觉:一个基准揭示了视觉语言模型在临床能力方面的广泛差距

Dingyu Wang, Zimu Yuan, Jiajun Liu, Shanggui Liu, Nan Zhou, Tianxing Xu, Di Huang, Dong Jiang

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本研究提出B&J基准测试,揭示了视觉语言模型在临床推理任务中存在显著的多模态整合能力不足问题,强调需在多模态整合和视觉理解上取得突破才能实现临床应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20324 2025-12-24 cs.CL 83%

Can LLMs Solve My Grandma's Riddle? Evaluating Multilingual Large Language Models on Reasoning Traditional Bangla Tricky Riddles

LLMs能解决我奶奶的谜题吗?评估多语言大语言模型在推理传统孟加拉谜题上的能力

Nurul Labib Sayeedi, Md. Faiyaz Abdullah Sayeedi, Khushnur Binte Jahangir, Swakkhar Shatabda, Sarah Masud Preum

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本研究评估了多语言大语言模型在解决传统孟加拉谜题上的能力,发现其在推理任务中表现有限,但为低资源隐喻推理提供了新的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19317 2025-12-23 cs.AI 83%

SafeMed-R1: Adversarial Reinforcement Learning for Generalizable and Robust Medical Reasoning in Vision-Language Models

SafeMed-R1: 为视觉-语言模型中的通用性和鲁棒性医疗推理设计的对抗强化学习

A. A. Gde Yogi Pramana, Jason Ray, Anthony Jaya, Michael Wijaya

机构 * National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 SafeMed-R1通过对抗训练与组相对策略优化提升视觉-语言模型在医疗推理中的鲁棒性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16442 2025-12-22 cs.CV cs.AI 83%

EDVD-LLaMA: Explainable Deepfake Video Detection via Multimodal Large Language Model Reasoning

EDVD-LLaMA: 通过多模态大语言模型推理进行可解释的深度伪造视频检测

Haoran Sun, Chen Cai, Huiping Zhuang, Kong Aik Lee, Lap-Pui Chau, Yi Wang

机构 * Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(电子与电气工程系,香港理工大学) School of Electrical and Electronic Engineering, Nanyang Technological University(电子与电气工程学院,南洋理工大学) Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(智能工程学院,华南理工大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 EDVD-LLaMA通过多模态大语言模型推理实现深度伪造视频检测的可解释性,结合时空特征提取和细粒度推理机制,提升检测准确性与解释可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14691 2025-12-18 cs.CL cs.CV 83%

MMGR: Multi-Modal Generative Reasoning

MMGR:多模态生成推理

Zefan Cai, Haoyi Qiu, Tianyi Ma, Haozhe Zhao, Gengze Zhou, Kung-Hsiang Huang, Parisa Kordjamshidi, Minjia Zhang, Wen Xiao, Jiuxiang Gu, Nanyun Peng, Junjie Hu

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California, Los Angeles(加州大学洛杉矶分校) Michigan State University(密歇根州立大学) University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Adelaide(阿德莱德大学) Salesforce AI Research(Salesforce人工智能研究) Microsoft(微软) Adobe Research(Adobe研究)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.CL

AI总结 MMGR提出一个多模态生成推理评估框架,通过物理、逻辑、空间和时间五个能力评估视频和图像生成模型,揭示其在抽象推理和具身导航中的性能不足。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09677 2025-12-18 cs.CV cs.AI 83%

Benchmarking Gaslighting Negation Attacks Against Reasoning Models

对抗性否定攻击下推理模型的基准测试

Bin Zhu, Hailong Yin, Jingjing Chen, Yu-Gang Jiang

机构 * Singapore Management University, Singapore College of Computer Science(新加坡国立管理学院计算机科学学院) Artificial Intelligence, Fudan University, China(人工智能,复旦大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文评估了三种顶级推理模型在对抗性否定攻击下的表现,发现其准确率显著下降,并提出了GaslightingBench-R基准以进一步研究模型对这类攻击的防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21320 2025-12-16 cs.CL 83%

SciReasoner: Laying the Scientific Reasoning Ground Across Disciplines

SciReasoner: 跨学科的科学推理基础

Yizhou Wang, Chen Tang, Han Deng, Jiabei Xiao, Jiaqi Liu, Jianyu Wu, Jun Yao, Pengze Li, Encheng Su, Lintao Wang, Guohang Zhuang, Yuchen Ren, Ben Fei, Ming Hu, Xin Chen, Dongzhan Zhou, Junjun He, Xiangyu Yue, Zhenfei Yin, Jiamin Wu, Qihao Zheng, Yuhao Zhou, Huihui Xu, Chenglong Ma, Yan Lu, Wenlong Zhang, Chunfeng Song, Philip Torr, Shixiang Tang, Xinzhu Ma, Wanli Ouyang, Lei Bai

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 SciReasoner通过跨学科学习提升科学推理能力,支持多种任务,增强跨领域泛化和准确性。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10430 2025-12-12 cs.CL 83%

T-pro 2.0: An Efficient Russian Hybrid-Reasoning Model and Playground

T-pro 2.0:一种高效的俄语混合推理模型与游乐场

Dmitrii Stoianov, Danil Taranets, Olga Tsymboi, Ramil Latypov, Almaz Dautov, Vladislav Kruglikov, Nikita Surkov, German Abramov, Pavel Gein, Dmitry Abulkhanov, Mikhail Gashkov, Viktor Zelenkovskiy, Artem Batalov, Aleksandr Medvedev, Anatolii Potapov

机构 * Gen-T Team T-Tech(Gen-T团队T-Tech)

专题命中 推理评测 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL

AI总结 T-pro 2.0是一种高效的俄语混合推理模型,通过开放权重和适应后的EAGLE推测解码流水线实现快速推理和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21581 2025-11-27 cs.LG 83%

Learning When to Stop: Adaptive Latent Reasoning via Reinforcement Learning

学习何时停止:通过强化学习实现自适应潜在推理

Alex Ning, Yen-Ling Kuo, Gabe Gomes

机构 * University of Virginia(弗吉尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 本文提出通过强化学习优化潜在推理长度,实现更高效的推理压缩,实验显示推理长度减少52%且准确性无损失。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15065 2025-11-25 cs.CV cs.AI 83%

Reasoning via Video: The First Evaluation of Video Models' Reasoning Abilities through Maze-Solving Tasks

通过视频推理:首次评估视频模型在迷宫解决任务中的推理能力

Cheng Yang, Haiyuan Wan, Yiran Peng, Xin Cheng, Zhaoyang Yu, Jiayi Zhang, Junchi Yu, Xinlei Yu, Xiawu Zheng, Dongzhan Zhou, Chenglin Wu

机构 * DeepWisdom Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Renmin University of China(中国人民大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) Xiamen University(厦门大学) Hong Kong University of Science and Technology (GuangZhou)(香港科技大学(广州))

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文首次评估视频模型在迷宫解决任务中的推理能力,提出VR-Bench基准,展示视频生成在空间推理中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11978 2025-11-18 cs.CL 83%

A Reasoning Paradigm for Named Entity Recognition

Hui Huang, Yanping Chen, Ruizhang Huang, Chuan Lin, Yongbin Qin

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16040 2025-11-11 cs.CL 83%

Evaluating Test-Time Scaling LLMs for Legal Reasoning: OpenAI o1, DeepSeek-R1, and Beyond

Yinghao Hu, Yaoyao Yu, Leilei Gan, Bin Wei, Kun Kuang, Fei Wu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Guanghua Law School, Zhejiang University(浙江大学光华法学院) School of Software Technology, Zhejiang University(浙江大学软件学院) Law & AI Lab, Zhejiang University(浙江大学法律与人工智能实验室) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

Comments 23 pages, Published in Findings of the Association for Computational Linguistics: EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24932 2025-10-30 cs.CL 83%

RiddleBench: A New Generative Reasoning Benchmark for LLMs

Deepon Halder, Alan Saji, Thanmay Jayakumar, Ratish Puduppully, Anoop Kunchukuttan, Raj Dabre

机构 * Nilekani Centre at AI4Bharat(AI4Bharat的Nilekani中心) Indian Institute of Technology Madras(印度理工学院马德拉斯分校) IT University of Copenhagen(哥本哈根技术大学) Microsoft(微软) Indian Institute of Engineering, Science and Technology, Shibpur(Shibpur印度工程科学技术学院)

专题命中 推理评测 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04458 2025-10-30 cs.CL 83%

Think Twice Before You Judge: Mixture of Dual Reasoning Experts for Multimodal Sarcasm Detection

Soumyadeep Jana, Abhrajyoti Kundu, Sanasam Ranbir Singh

机构 * Indian Institute of Technology Guwahati(印度理工学院古瓦哈提)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18154 2025-10-22 cs.AI cs.CY 83%

Annotating the Chain-of-Thought: A Behavior-Labeled Dataset for AI Safety

Antonio-Gabriel Chacón Menke, Phan Xuan Tan, Eiji Kamioka

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17498 2025-10-21 cs.CL 83%

Deep Self-Evolving Reasoning

Zihan Liu, Shun Zheng, Xumeng Wen, Yang Wang, Jiang Bian, Mao Yang

机构 * Peking University(北京大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02253 2025-10-16 cs.AI 83%

Scaling LLM Planning: NL2FLOW for Parametric Problem Generation and Rigorous Evaluation

Jungkoo Kang

机构 * IBM Research(IBM研究院) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 推理评测 :planning(title,abstract);reasoning(abstract);分类 cs.AI

Comments 30 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22017 2025-10-15 cs.CL 83%

The Price of a Second Thought: On the Evaluation of Reasoning Efficiency in Large Language Models

Siqi Fan, Bowen Qin, Peng Han, Shuo Shang, Yequan Wang, Aixin Sun

机构 * University of Electronic Science and Technology of China(电子科技大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

Comments Added new experiments and revised the manuscript for clarity

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11031 2025-10-14 cs.CL 83%

LogiNumSynth: Synthesizing Joint Logical-Numerical Reasoning Problems for Language Models

Yiwei Liu, Yucheng Li, Xiao Li, Gong Cheng

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) Nanjing University(南京大学)

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

Comments 30 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08964 2025-10-13 cs.CV cs.CL 83%

Unleashing Perception-Time Scaling to Multimodal Reasoning Models

Yifan Li, Zhenghao Chen, Ziheng Wu, Kun Zhou, Ruipu Luo, Can Zhang, Zhentao He, Yufei Zhan, Wayne Xin Zhao, Minghui Qiu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大模型与智能治理重点实验室) ByteDance(字节跳动) University of California, San Diego(加州大学圣地亚哥分校) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 推理评测 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08559 2025-10-10 cs.CV cs.AI 83%

SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models

Andong Deng, Taojiannan Yang, Shoubin Yu, Lincoln Spencer, Mohit Bansal, Chen Chen, Serena Yeung-Levy, Xiaohan Wang

机构 * University of Central Florida(中央佛罗里达大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06430 2025-10-09 cs.CL 83%

MathRobust-LV: Evaluation of Large Language Models' Robustness to Linguistic Variations in Mathematical Reasoning

Neeraja Kirtane, Yuvraj Khanna, Peter Relan

机构 * Got It Education(Got It 教育)

专题命中 推理评测 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏