arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10379 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10379 篇

2504.05118 2025-04-14 cs.AI 85%

VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks

Yu Yue, Yufeng Yuan, Qiying Yu, Xiaochen Zuo, Ruofei Zhu, Wenyuan Xu, Jiaze Chen, Chengyi Wang, TianTian Fan, Zhengyin Du, Xiangpeng Wei, Xiangyu Yu, Gaohong Liu, Juncai Liu, Lingjun Liu, Haibin Lin, Zhiqi Lin, Bole Ma, Chi Zhang, Mofan Zhang, Wang Zhang, Hang Zhu, Ru Zhang, Xin Liu, Mingxuan Wang, Yonghui Wu, Lin Yan

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10442 2025-04-08 cs.CL cs.CV 85%

Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization

Weiyun Wang, Zhe Chen, Wenhai Wang, Yue Cao, Yangzhou Liu, Zhangwei Gao, Jinguo Zhu, Xizhou Zhu, Lewei Lu, Yu Qiao, Jifeng Dai

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10167 2025-03-19 cs.CL 85%

"Well, Keep Thinking": Enhancing LLM Reasoning with Adaptive Injection Decoding

Hyunbin Jin, Je Won Yeom, Seunghyun Bae, Taesup Kim

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17589 2025-02-26 cs.CL 85%

End-to-End Chart Summarization via Visual Chain-of-Thought in Vision-Language Models

Raymond Choi, Frank Burns, Chase Lawrence

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.06275 2024-11-20 cs.CL 85%

Re-Reading Improves Reasoning in Large Language Models

Xiaohan Xu, Chongyang Tao, Tao Shen, Can Xu, Hongbo Xu, Guodong Long, Jian-guang Lou, Shuai Ma

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments EMNLP 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11863 2024-10-21 cs.CL 85%

How Interpretable are Reasoning Explanations from Prompting Large Language Models?

Wei Jie Yeo, Ranjan Satapathy, Rick Siow Mong Goh, Erik Cambria

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments NAACL Findings 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05355 2024-07-09 cs.CV cs.CL 85%

VideoCoT: A Video Chain-of-Thought Dataset with Active Annotation Tool

Yan Wang, Yawen Zeng, Jingsheng Zheng, Xiaofen Xing, Jin Xu, Xiangmin Xu

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL

Comments ACL 2024 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12242 2024-01-24 cs.CR cs.LG 85%

BadChain: Backdoor Chain-of-Thought Prompting for Large Language Models

Zhen Xiang, Fengqing Jiang, Zidi Xiong, Bhaskar Ramasubramanian, Radha Poovendran, Bo Li

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.LG

Comments Accepted to ICLR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03734 2023-11-08 cs.CL 85%

Leveraging Structured Information for Explainable Multi-hop Question Answering and Reasoning

Ruosen Li, Xinya Du

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments Findings of EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.06599 2023-09-08 cs.SE cs.CL 85%

Structured Chain-of-Thought Prompting for Code Generation

Jia Li, Ge Li, Yongmin Li, Zhi Jin

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL

Comments arXiv admin note: text overlap with arXiv:2303.17780

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08922 2023-07-19 cs.CL 85%

Large Language Models Perform Diagnostic Reasoning

Cheng-Kuang Wu, Wei-Lin Chen, Hsin-Hsi Chen

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments Accepted as a Tiny Paper at ICLR 2023 (10 pages, 5 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15262 2023-05-25 cs.CL 85%

Revisiting Parallel Context Windows: A Frustratingly Simple Alternative and Chain-of-Thought Deterioration

Kejuan Yang, Xiao Liu, Kaiwen Men, Aohan Zeng, Yuxiao Dong, Jie Tang

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11495 2025-03-17 cs.CV 85%

V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning

Zixu Cheng, Jian Hu, Ziquan Liu, Chenyang Si, Wei Li, Shaogang Gong

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

Comments A benchmark for Video Spatio-Temporal Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18614 2026-06-02 cs.CL cs.LG cs.MM cs.SD eess.AS 85%

MAVL: A Multilingual Audio-Video Lyrics Dataset for Animated Song Translation

MAVL:面向动画歌曲翻译的多语言音视频歌词数据集

Woohyun Cho, Youngmin Kim, Sunghyun Lee, Youngjae Yu

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 推理评测 :CoT(summary_cn,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 提出首个多语言多模态歌词翻译基准MAVL,并设计音节约束的音视频大语言模型SylAVL-CoT,利用音视频线索和音节约束提升歌词可唱性和翻译准确性。

Comments Accepted to EMNLP 2025, Project Page: https://k1064190.github.io/papers/paper1.html, our codes and datasets are available at https://github.com/k1064190/MAVL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10317 2026-08-12 cs.CV 新提交 85%

From Detection to Understanding: TAR and TAR-Bench for Multi-Task Traffic Anomaly Reasoning

从检测到理解:用于多任务交通异常推理的TAR与TAR-Bench

Han Zhang, Yilin Zhao, Zaid Pervaiz Bhat, Zheng Tang, Varun Praveen, Vidya N. Murali, David C. Anastasiu, Tomasz Kornuta

机构 * NVIDIA(英伟达) Santa Clara University(圣克拉拉大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 该研究提出TAR与TAR-Bench数据集,用于训练评估超越异常检测的视频-语言模型,经实验验证其多任务微调可提升模型推理能力,且为2026年AI城市挑战赛第3赛道提供官方数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26553 2026-07-30 cs.SD 新提交 85%

ThinkOmni: A Reasoning-Driven Omni-Modal LLM Framework for Audio Forgery Detection and Localization

ThinkOmni:用于音频伪造检测与定位的推理驱动全模态大语言模型框架

Yuxiong Xu, Kaiqing Lin, Bin Li, Haodong Li, Sheng Li

机构 * Shenzhen University(深圳大学) Afirstsoft Technology Group Co., Ltd.(安福软件科技集团有限公司)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn)

AI总结 针对现有AFDL方法泛化能力不足的问题,提出推理驱动的全模态大语言模型ThinkOmni,构建FACoT数据集,引入FMIL与FCML,实现了跨数据集的音频伪造检测与定位。

Comments Accepted by ACM MM 2026, 21 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08571 2026-07-22 cs.LG cs.AI cs.CL 版本更新 85%

Robust Reasoning Benchmark

鲁棒推理基准

Pavel Golikov, Evgenii Opryshko, Gennady Pekhimenko, Mark C. Jeffrey

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出鲁棒推理基准(RRB),通过13种确定性文本扰动评估8种前沿模型,发现Claude在面对变换提示时表现出异常拒绝行为,而开放权重模型在结构噪声下出现多种失败模式,如认知冲刷、分词崩溃和推理崩溃,导致平均准确率下降高达54%。研究进一步发现由模型自身推理链引起的注意力稀释问题,并提出Intra-Query Attention Dilution概念,表明中间推理步骤会污染标准密集注意力机制,未来架构需整合显式上下文重置以实现可靠推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19464 2026-07-20 cs.RO 版本更新 85%

Can LLMs Prove Robotic Path Planning Optimality? A Benchmark for Research-Level Algorithm Verification

大语言模型能否证明机器人路径规划的最优性?一种用于研究级算法验证的基准测试

Zhengbang Yang, Md. Tasin Tazwar, Minghan Wei, Zhuangdi Zhu

机构 * George Mason University(乔治梅森大学) Florida Atlantic University(佛罗里达大西洋大学)

专题命中 推理评测 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出首个评估大语言模型在机器人路径规划算法近似比证明能力的基准测试,包含34个研究级证明任务,揭示了LLM在缺乏领域知识时的局限性,并通过上下文补充分析改进推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11106 2026-07-14 cs.CV 新提交 85%

Beyond the Eye: Efficient Multimodal Reasoning via Self-Regulated Implicit Visual Tools

超越视觉:通过自我调节的隐式视觉工具实现高效多模态推理

Xiuwei Chen, Quanlin Chen, Wentao Hu, Zisheng Chen, Kun Xiang, Zehua Ma, Mingyang Zhang, Jianhua Han, Hanhui Li, Hang Xu, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) The Hong Kong Polytechnic University(香港理工大学) Yinwang Intelligent Technology Co., Ltd.(银望智能科技有限公司)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 研究针对多模态大语言模型推理效率问题,提出超越视觉(BEE)的隐式视觉工具范式,通过将视觉工具调用行为纳入训练目标,经两阶段训练,包括形式化思维链监督微调与自我调节奖励驱动对齐,提升了模型在细粒度视觉感知任务中的性能和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08758 2026-07-01 eess.IV cs.CV 版本更新 85%

M3CoTBench: Benchmark Chain-of-Thought of MLLMs in Medical Image Understanding

M3CoTBench:医学图像理解中多模态大语言模型的思维链基准测试

Juntao Jiang, Jiangning Zhang, Yali Bi, Jinsheng Bai, Weixuan Liu, Weiwei Jin, Zhucun Xue, Yong Liu, Xiaobin Hu, Shuicheng Yan

机构 * Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) East China Normal University(华东师范大学) Zhejiang Provincial People’s Hospital(浙江省人民医院) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract)

AI总结 提出M3CoTBench基准,通过多层级难度数据集和专用评估指标,系统评测多模态大语言模型在医学图像理解中的思维链推理正确性、效率、影响和一致性。

Comments 39 pages, 8 figures; accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30124 2026-06-30 cs.CV 85%

SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation

SciIR:面向科学图像推理生成的大规模训练数据集与基准

Zhiyuan Ma, Zhengfeng Shi, Yuning An, Peize Li, Jiabao Wei, Ruijie Li, Junhao Xiao, Jianjun Li, Bowen Zhou

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology, China(华中科技大学计算机科学与技术学院,中国) School of Airspace Science and Engineering, Shandong University, China(山东大学航空航天科学与工程学院,中国) Department of Electronic Engineering, Tsinghua University, China(清华大学电子工程系,中国)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);logical reasoning(abstract)

AI总结 为解决文本到图像模型在科学图像生成中语义对齐与逻辑推理不足的问题,构建了包含8万+高质量科学图像-文本对的SciIR-82k数据集,并提出三层次科学推理框架及可验证评估基准SciIR-Bench,微调模型Qwen-Image-SciIR在基准上得分从35%提升至43%。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17301 2026-06-16 cs.CL cs.AI cs.HC cs.IR cs.LG 版本更新 85%

RoTRAG: Rule of Thumb Reasoning for Conversation Harm Detection with Retrieval-Augmented Generation

RoTRAG: 基于经验法则推理的检索增强生成对话有害内容检测

Juhyeon Lee, Wonduk Seo, Junseo Koh, Seunghyun Lee, Haihua Chen, Yi Bu

机构 * Peking University(北京大学) Enhans University of North Texas(北得克萨斯大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出RoTRAG框架,通过检索外部道德规范(RoTs)增强LLM的多轮对话有害内容检测,实现基于规范推理和分类,平均F1提升约40%,分布误差降低8.4%。

Comments Accepted by SIGIR-ICTIR 2026, Oral Presentation

Journal ref Proceedings of the 2026 International ACM SIGIR Conference on Innovative Concepts and Theories in Information Retrieval (ICTIR '26), July 25, 2026, Melbourne, VIC, Australia. ACM, New York, NY, USA, 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10055 2026-06-03 cs.CV 85%

Physical Plausibility Reasoning via HCM-GRPO: Empowering Compact Model for Superior Performance

通过 HCM-GRPO 实现物理合理性推理:赋能紧凑模型以获得卓越性能

Zhiyuan Hu, Zheng Sun, Yi Wei, Long Yu

机构 * Tsinghua University(清华大学) Alibaba Health Information Technology Limited(阿里巴巴健康信息技术有限公司)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn)

AI总结 针对多模态大语言模型在物理合理性推理中数据缺乏和推理能力弱的问题,提出包含大规模数据集和 HCM-GRPO 方法的完整解决方案,以紧凑模型超越大规模开源和闭源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15693 2026-05-18 cs.CV 85%

Skyra: AI-Generated Video Detection via Grounded Artifact Reasoning

Skyra:通过 grounded artifact reasoning 实现 AI 生成视频检测

Yifei Li, Wenzhao Zheng, Yanran Zhang, Runze Sun, Yu Zheng, Lei Chen, Jie Zhou, Jiwen Lu

机构 * Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 推理评测 :reasoning(title,title_cn);CoT(abstract)

AI总结 本文提出 Skyra,一种专门用于识别 AI 生成视频中人类可感知的视觉瑕疵的多模态大语言模型,通过这些瑕疵作为基础证据进行检测和解释,同时构建了首个大规模 AI 生成视频瑕疵数据集并提出两阶段训练策略。

Comments Camera Ready Version. Project Page: https://github.com/JoeLeelyf/Skyra

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25866 2026-04-14 cs.CV 85%

DeepSketcher: Internalizing Visual Manipulation for Multimodal Reasoning

DeepSketcher:内化视觉操作以实现多模态推理

Chi Zhang, Haibo Qiu, Qiming Zhang, Zhixiong Zeng, Lin Ma, Jing Zhang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Meituan Inc(美团) Independent Researcher, China(独立研究者)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 DeepSketcher通过构建图像-文本交织数据集和自包含模型,实现了无需外部工具的视觉思考,提升了多模态推理能力。

Comments CVPR2026 FINDINGS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09235 2026-04-13 cs.CR 85%

Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor

Unreal Thinking: 通过两阶段后门实现链式思维劫持

Wenhan Chang, Tianqing Zhu, Ping Xiong, Faqian Guan, Wanlei Zhou

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract)

AI总结 本文提出MRTS和TSBH方法,解决LLM链式思维劫持中的数据稀缺和稳定性问题,通过生成对齐的CoT实现可控的恶意行为诱导,并提供安全推理数据集和缓解方法。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07814 2026-04-10 cs.CV 85%

AgriChain Visually Grounded Expert Verified Reasoning for Interpretable Agricultural Vision Language Models

AgriChain:基于视觉的专家验证推理用于可解释的农业视觉语言模型

Hazza Mahmood, Yongqiang Yu, Rao Anwer

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出AgriChain数据集,通过专家验证的推理链提升农业视觉语言模型的准确性和可解释性,实验表明其在植物病害诊断中优于多个基线模型。

Comments 9 pages

Journal ref LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23265 2026-03-27 cs.CV 85%

SPR-128K: A New Benchmark for Spatial Plausibility Reasoning with Multimodal Large Language Models

SPR-128K:一种多模态大语言模型空间合理性推理的新基准

Zhiyuan Hu, Zheng Sun, Yi Wei, Long Yu

机构 * Tsinghua University(清华大学) Alibaba Health Information Technology Limited(阿里巴巴健康信息技术有限公司)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出SPR-128K数据集及DPA-GRPO方法,解决图像筛选中多模态大语言模型空间推理能力不足的问题,实验表明小型模型在该任务上优于主流模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07515 2026-03-10 cs.CV 85%

EvolveReason: Self-Evolving Reasoning Paradigm for Explainable Deepfake Facial Image Identification

EvolveReason: 为可解释的深度伪造面部图像识别设计的自演化推理范式

Binjia Zhou, Dawei Luo, Shuai Chen, Feng Xu, Seow, Haoyuan Li, Jiachi Wang, Jiawen Wang, Zunlei Feng, Yijun Bei

机构 * School of Software Technology, Zhejiang University(浙江大学软件技术学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 EvolveReason通过模仿人类推理过程和构建特定数据集,提升深度伪造面部图像识别的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06243 2026-03-09 cs.IR 85%

MLLMRec-R1: Incentivizing Reasoning Capability in Large Language Models for Multimodal Sequential Recommendation

MLLMRec-R1: 通过大型语言模型增强多模态序列推荐的推理能力

Yu Wang, Yonghui Yang, Le Wu, Jiancan Wu, Hefei Xu, Hui Lin

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 MLLMRec-R1通过离线文本化视觉信号和混合粒度数据增强策略,提升多模态序列推荐中基于GRPO的推理效率与稳定性。

Comments 14 pages, 10figures

详情

展开后加载摘要…

URL PDF HTML 收藏