arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10379 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10379 篇

2504.03234 2025-05-22 cs.CL cs.AI cs.LG 85%

Think When You Need: Self-Adaptive Chain-of-Thought Learning

Junjie Yang, Ke Lin, Xing Yu

机构 * Xiaohongshu Inc(小红书公司)

专题命中 推理评测 :chain-of-thought(title);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06912 2025-05-13 cs.CV 85%

Building a Human-Verified Clinical Reasoning Dataset via a Human LLM Hybrid Pipeline for Trustworthy Medical AI

Chao Ding, Mouxiao Bian, Pengcheng Chen, Hongliang Zhang, Tianbin Li, Lihao Liu, Jiayuan Chen, Zhuoran Li, Yabei Zhong, Yongqi Liu, Haiqing Huang, Dongming Shan, Junjun He, Jie Xu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Kupas Technology Limited Company(上海库帕斯科技有限公司)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14851 2025-05-12 cs.CL cs.AI cs.LG cs.LO 85%

JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models

Michael K. Chen, Xikun Zhang, Dacheng Tao

机构 * College of Computing \& Data Science, Nanyang Technological University, Singapore

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07080 2025-04-10 cs.CL cs.AI cs.LG 85%

DeduCE: Deductive Consistency as a Framework to Evaluate LLM Reasoning

Atharva Pandey, Kshitij Dubey, Rahul Sharma, Amit Sharma

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06606 2025-04-10 cs.CV 85%

Benchmarking Multimodal CoT Reward Model Stepwise by Visual Program

Minghe Gao, Xuqi Liu, Zhongqi Yue, Yang Wu, Shuang Chen, Juncheng Li, Siliang Tang, Fei Wu, Tat-Seng Chua, Yueting Zhuang

专题命中 推理评测 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04471 2025-04-08 cs.CV 85%

VideoAgent2: Enhancing the LLM-Based Agent System for Long-Form Video Understanding by Uncertainty-Aware CoT

Zhuo Zhi, Qiangqiang Wu, Minghe shen, Wenbo Li, Yinchuan Li, Kun Shao, Kaiwen Zhou

专题命中 推理评测 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23660 2025-04-01 cs.CV 85%

DeepDubber-V1: Towards High Quality and Dialogue, Narration, Monologue Adaptive Movie Dubbing Via Multi-Modal Chain-of-Thoughts Reasoning Guidance

Junjie Zheng, Zihao Chen, Chaofan Ding, Xinhan Di

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12799 2025-03-25 cs.CV cs.MM 85%

Grounded Chain-of-Thought for Multimodal Large Language Models

Qiong Wu, Xiangcong Yang, Yiyi Zhou, Chenxin Fang, Baiyang Song, Xiaoshuai Sun, Rongrong Ji

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13399 2025-03-18 cs.CV cs.AI cs.CL cs.LG q-bio.CB 85%

MicroVQA: A Multimodal Reasoning Benchmark for Microscopy-Based Scientific Research

James Burgess, Jeffrey J Nirschl, Laura Bravo-Sánchez, Alejandro Lozano, Sanket Rajan Gupte, Jesus G. Galaz-Montoya, Yuhui Zhang, Yuchang Su, Disha Bhowmik, Zachary Coman, Sarina M. Hasan, Alexandra Johannesson, William D. Leineweber, Malvika G Nair, Ridhi Yarlagadda, Connor Zuraski, Wah Chiu, Sarah Cohen, Jan N. Hansen, Manuel D Leonetti, Chad Liu, Emma Lundberg, Serena Yeung-Levy

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments CVPR 2025 (Conference on Computer Vision and Pattern Recognition) Project page at https://jmhb0.github.io/microvqa Benchmark at https://huggingface.co/datasets/jmhb/microvqa

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05444 2025-01-10 cs.CV 85%

Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark

Yunzhuo Hao, Jiawei Gu, Huichen Will Wang, Linjie Li, Zhengyuan Yang, Lijuan Wang, Yu Cheng

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);test-time compute(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12572 2024-10-16 cs.CL cs.AI cs.LG 85%

Mathador-LM: A Dynamic Benchmark for Mathematical Reasoning on Large Language Models

Eldar Kurtic, Amir Moeini, Dan Alistarh

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14874 2024-08-26 cs.CL cs.AI cs.LG 85%

Distillation Contrastive Decoding: Improving LLMs Reasoning with Contrastive Decoding and Distillation

Phuc Phan, Hieu Tran, Long Phan

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08302 2024-08-16 cs.AI cs.CL cs.LG 85%

Benchmarking the Capabilities of Large Language Models in Transportation System Engineering: Accuracy, Consistency, and Reasoning Behaviors

Usman Syed, Ethan Light, Xingang Guo, Huan Zhang, Lianhui Qin, Yanfeng Ouyang, Bin Hu

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09136 2024-07-15 cs.CL cs.AI cs.LG 85%

Stepwise Verification and Remediation of Student Reasoning Errors with Large Language Model Tutors

Nico Daheim, Jakub Macina, Manu Kapur, Iryna Gurevych, Mrinmaya Sachan

专题命中 推理评测 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint. Nico Daheim and Jakub Macina contributed equally. Code and dataset can be found under: https://github.com/eth-lre/verify-then-generate

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14897 2024-06-24 cs.CL cs.AI cs.LG 85%

Chain-of-Thought Unfaithfulness as Disguised Accuracy

Oliver Bentham, Nathan Stringham, Ana Marasović

专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments TMLR accepted paper camera-ready version. First two authors contributed equally. 8 pages main, 13 pages appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08516 2024-06-05 cs.AI cs.CL cs.LG 85%

LLMs cannot find reasoning errors, but can correct them given the error location

Gladys Tyen, Hassan Mansoor, Victor Cărbune, Peter Chen, Tony Mak

专题命中 推理评测 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.17167 2024-03-15 cs.AI cs.CL cs.LG 85%

DyVal: Dynamic Evaluation of Large Language Models for Reasoning Tasks

Kaijie Zhu, Jiaao Chen, Jindong Wang, Neil Zhenqiang Gong, Diyi Yang, Xing Xie

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICLR 2024 spotlight; 38 pages; code is at aka.ms/dyval

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03094 2024-02-12 cs.CL cs.AI cs.LG 85%

Large Language Model Cascades with Mixture of Thoughts Representations for Cost-efficient Reasoning

Murong Yue, Jie Zhao, Min Zhang, Liang Du, Ziyu Yao

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04350 2024-01-18 cs.CL cs.AI cs.LG 85%

CLadder: Assessing Causal Reasoning in Language Models

Zhijing Jin, Yuen Chen, Felix Leeb, Luigi Gresele, Ojasv Kamal, Zhiheng Lyu, Kevin Blin, Fernando Gonzalez Adauto, Max Kleiman-Weiner, Mrinmaya Sachan, Bernhard Schölkopf

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2023; updated with CLadder dataset v1.5

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.06706 2023-02-15 cs.AI cs.CL cs.LG 85%

On the Planning Abilities of Large Language Models (A Critical Investigation with a Proposed Benchmark)

Karthik Valmeekam, Sarath Sreedharan, Matthew Marquez, Alberto Olmo, Subbarao Kambhampati

专题命中 推理评测 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments arXiv admin note: text overlap with arXiv:2206.10498

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.09513 2022-10-18 cs.CL cs.AI cs.CV cs.LG cs.MM 85%

Learn to Explain: Multimodal Reasoning via Thought Chains for Science Question Answering

Pan Lu, Swaroop Mishra, Tony Xia, Liang Qiu, Kai-Wei Chang, Song-Chun Zhu, Oyvind Tafjord, Peter Clark, Ashwin Kalyan

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to NeurIPS 2022. 22 pages, 17 figures, 9 tables. Project: https://scienceqa.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.03057 2022-10-07 cs.CL cs.AI cs.LG 85%

Language Models are Multilingual Chain-of-Thought Reasoners

Freda Shi, Mirac Suzgun, Markus Freitag, Xuezhi Wang, Suraj Srivats, Soroush Vosoughi, Hyung Won Chung, Yi Tay, Sebastian Ruder, Denny Zhou, Dipanjan Das, Jason Wei

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14702 2026-05-12 cs.AI cs.CL 84%

Polymath: A Challenging Multi-modal Mathematical Reasoning Benchmark

PolyMATH:一个具有挑战性的多模态数学推理基准

Himanshu Gupta, Shreyas Verma, Ujjwala Anantheswaran, Kevin Scaria, Mihir Parmar, Swaroop Mishra, Chitta Baral

机构 * Arizona State University(亚利桑那州立大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 PolyMATH基准通过5000张高质量图像评估多模态大语言模型的推理能力,揭示其在空间关系和抽象推理上的不足,指出模型无法真正理解视觉信息,存在逻辑错误风险。

Comments Accepted in Neural Information Processing Systems (NeurIPS 2025) Workshop: Foundations of Reasoning in Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01039 2026-08-13 cs.CR cs.AI 版本更新 84%

Evaluation and Hardening of LLM System Instructions Against Extraction via Encoding Attacks

用于评估和加固LLM系统指令对抗编码攻击的自动化框架

Anubhab Sahu, Diptisha Samanta, Reza Soosahabi

机构 * Keysight Technologies

专题命中 推理评测 :chain-of-thought(summary_cn,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出自动化框架评估LLM系统指令在对抗编码攻击时的保密性,通过四个模型和46条指令测试发现结构化序列化攻击成功率高,提出基于Chain-of-Thought的缓解策略。

Comments An earlier version of this manuscript will appear in the proceedings of IEEE Cyber-AI 2026 Conference. Project source code is available at https://github.com/Keysight/LLM-EncodeGuard

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12779 2026-08-14 cs.CL cs.AI cs.IR 新提交 84%

CRAFT: LLM-Based Iterative Refinement for Temporal Reasoning over Clinical Narratives

CRAFT:基于大语言模型的迭代优化用于临床叙事的时间推理

Chengyang He, Tahreem Arif, Marko Zivkovic, Lijing Wang, Yue Ning, Ping Wang

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Genesis Research Group(创世纪研究集团) New Jersey Institute of Technology(新泽西理工学院)

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 针对临床叙事中时间锚点稀疏导致的症状轨迹重建难题,提出基于大语言模型的CRAFT框架,通过生成器与约束验证器迭代优化,在MedTempo基准上提升了时间排序准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11047 2026-08-12 cs.AI cs.CE cs.LG 新提交 84%

V-FiLLM: Verified Financial LLM Reasoning Benchmark

V-FiLLM:经过验证的金融大语言模型推理基准

Alicia Larsen, Victoire Laurent, Aulia Kharis Rakhamsari, Lara Turgut, Nino Antulov-Fantulin

机构 * ETH Zürich(苏黎世联邦理工学院) Aisot Technologies Ltd(艾索特科技有限公司)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文提出V-FiLLM框架生成高可靠性金融推理基准,发现开源模型在金融推理深度增加及数值扰动下准确率显著下降,轻量级LoRA微调可提升模型在相关任务的表现。

Comments 10 pages, 6 tables, 2 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24210 2026-08-11 cs.CL cs.AI 版本更新 84%

From Leaky Thoughts to Private Reasoning: Controlling What LRMs Say to Themselves

从泄露思维到私有推理:控制LRM对自己说的话

Haritz Puerto, Haonan Li, Xudong Han, Timothy Baldwin, Iryna Gurevych

机构 * Mohamed bin Zayed University of Artificial Intelligence, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大型推理模型(LRM)推理过程中隐私泄露问题,提出通过指令跟随(IF)训练和分阶段解码策略(Staged Decoding)增强隐私保护,在IF和隐私基准上分别提升高达20.9和51.9个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04001 2026-08-05 cs.LG cs.AI 新提交 84%

Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility

推理大语言模型中的测试时缩放:推理机制、评估与可复现性

Mohsen Hariri, Weicong Chen, Nahal Shahini, Vikash Singh, Kai Ye, Amirhossein Samandar, Debargha Ganguly, Sreehari Sankar, Yanyan Zhang, Shouren Wang, Jerry Peng, Biyao Zhang, Michael Hinczewski, Vipin Chaudhary

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对推理大语言模型的测试时缩放,明确三种推理机制,提出系统评估原则与可复现性要求,应用于多类基准并发布超20亿条推理轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09999 2026-07-24 cs.CL cs.LG 版本更新 84%

Silent Failures in Quantized LLM Reasoning: A Taxonomy-Based Analysis of Hollow Convergence and Failure Mode Shifts

量化语言模型推理中的无声失败:基于分类法的空洞收敛和失败模式转移分析

Renuka Oladri, Mohan Vamsi Varadaraju Priya, Jerry Wu

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 研究量化大语言模型推理中的无声失败,用六类失败分类法对五个模型在三种精度和四个基准下的思维链输出分类,发现空洞收敛等问题有精度和基准依赖性,且无法从文本特征可靠检测,揭示了标准评估管道未捕捉到的失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01431 2026-07-03 cs.CL cs.AI 新提交 84%

IsoSci: A Benchmark of Isomorphic Cross-Domain Science Problems for Evaluating Reasoning versus Knowledge Retrieval in LLMs

IsoSci: 用于评估LLM中推理与知识检索的同构跨域科学问题基准

Samir Abdaljalil, Erchin Serpedin, Hasan Kurban

机构 * Texas A&M University(德克萨斯农工大学) Hamad Bin Khalifa University(哈马德·本·哈利法大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 提出IsoSci基准,通过逻辑结构相同但领域知识不同的科学问题对,分离推理能力与领域知识检索,发现91.3%的推理增益依赖于知识而非结构,挑战了思维链推理提升科学问题解决的假设。

详情

展开后加载摘要…

URL PDF HTML 收藏