arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10379 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10379 篇

2506.24119 2026-03-03 cs.AI cs.CL cs.LG 85%

SPIRAL: Self-Play on Zero-Sum Games Incentivizes Reasoning via Multi-Agent Multi-Turn Reinforcement Learning

SPIRAL:通过多智能体多轮强化学习进行零和游戏的自我对战以促进推理

Bo Liu, Leon Guertler, Simon Yu, Zichen Liu, Penghui Qi, Daniel Balcells, Mickel Liu, Cheston Tan, Weiyan Shi, Min Lin, Wee Sun Lee, Natasha Jaques

机构 * National University of Singapore(新加坡国立大学) Northeastern University(东北大学) Sea AI Lab(Sea AI 实验室) Centre for Frontier AI Research (CFAR), A*STAR(前沿人工智能研究中心(CFAR),A*STAR) Plastic Labs University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SPIRAL通过多智能体多轮强化学习在零和游戏中促进推理,展示了模型在多个基准测试中的显著性能提升。

Comments Accepted at ICLR 2026. Code: https://github.com/spiral-rl/spiral

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01353 2026-03-03 cs.LG cs.AI cs.CL 85%

Constructing Synthetic Instruction Datasets for Improving Reasoning in Domain-Specific LLMs: A Case Study in the Japanese Financial Domain

构建合成指令数据集以提升领域特定大语言模型的推理能力:以日本金融领域为例

Yuma Okochi, Fabio Milentiansen Sim, Tomoyasu Okada

机构 * Nomura Research Institute, Ltd.(摩根士丹利研究机构)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出了一种通用方法,通过构建合成指令数据集提升领域特定大语言模型的推理能力,并在金融领域进行了验证。

Comments 8 pages, 2 figures. Japanese version published in NLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08588 2026-02-10 cs.DB 85%

MMTS-BENCH: A Comprehensive Benchmark for Time Series Understanding and Reasoning

MMTS-BENCH: 一个全面的时间序列理解和推理基准

Yao Yin, Zhenyu Xiao, Musheng Li, Yiwen Liu, Sutong Nan, Yiting He, Ruiqi Wang, Zhenwei Zhang, Qingmin Liao, Yuantao Gu

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 MMTS-BENCH通过多模态基准评估大语言模型在时间序列理解与推理中的表现,揭示了TS-LLMs在跨领域泛化和多模态整合方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01081 2026-02-03 cs.CV 85%

MedAD-R1: Eliciting Consistent Reasoning in Interpretible Medical Anomaly Detection via Consistency-Reinforced Policy Optimization

MedAD-R1: 通过一致性强化策略优化实现可解释医学异常检测中的一致推理

Haitao Zhang, Yingying Wang, Jiaxiang Wang, Haote Xu, Hongyang Zhang, Yirong Chen, Yue Huang, Xinghao Ding

机构 * School of Informatics, Xiamen University(厦门大学信息学院) Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院) Zhejiang Expressway Co., Ltd.(浙江高速公路有限公司) School of Science and Engineering, Chinese University of Hong Kong(香港中文大学科学与工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 MedAD-R1通过一致性强化策略优化实现医学异常检测中的可解释推理,提升模型的可信度和可解释性。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10165 2026-01-16 cs.CV 85%

Advancing Adaptive Multi-Stage Video Anomaly Reasoning: A Benchmark Dataset and Method

推动自适应多阶段视频异常推理:一个基准数据集和方法

Chao Huang, Benfeng Wang, Wei Wang, Jie Wen, Li Shen, Wenqi Ren, Yong Xu, Xiaochun Cao

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学计算机科学与技术学院(深圳校区)) Shenzhen Key Laboratory of Visual Object Detection and Recognition, Harbin Institute of Technology(哈尔滨工业大学深圳视觉目标检测与识别重点实验室)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出视频异常推理任务及相应数据集,通过结构化思维链和自适应策略优化,提升多阶段视频异常推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20936 2025-12-25 cs.CV 85%

Reasoning-Driven Amodal Completion: Collaborative Agents and Perceptual Evaluation

基于推理的无遮挡完成:协作代理与感知评估

Hongxing Fan, Shuyu Zhao, Jiayang Ao, Lu Sheng

机构 * School of Computer Science and Engineering, Beihang University(计算机科学与工程学院,北京航空航天大学) School of Software, Beihang University(软件学院,北京航空航天大学) School of Computing and Information Systems, The University of Melbourne(计算与信息系统学院,墨尔本大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract)

AI总结 本文提出一种协作多代理推理框架,通过解耦语义规划与视觉合成,提升无遮挡完成任务的语义一致性和结构完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17911 2025-12-23 cs.CL cs.AI cs.LG 85%

Towards Reasoning-Preserving Unlearning in Multimodal Large Language Models

面向多模态大语言模型的推理保留反学习

Hongji Li, Junchi yao, Manjiang Yu, Priyanka Singh, Xue Li, Di Wang, Lijie Hu

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(Mohamed bin Zayed人工智能大学) University of Queensland(昆士兰大学) Provable Responsible AI and Data Analytics (PRADA) Lab(可证明责任人工智能与数据分析实验室) King Abdullah University of Science and Technology (KAUST)(卡塔尔科学与技术大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出R-MUSE框架,通过子空间指导和自适应引导,在推理过程中有效消除多模态大语言模型中的推理痕迹,同时保留通用推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07984 2025-12-01 cs.CV 85%

SAMChat: Introducing Chain of Thought Reasoning and GRPO to a Multimodal Small Language Model for Small Scale Remote Sensing

SAMChat:引入链式推理和GRPO以增强小规模遥感遥感小语言模型

Aybora Koksal, A. Aydin Alatan

机构 * Center for the Image Analysis (OGAM) and Department of Electrical and Electronics Engineering of Middle East Technical University (METU)(图像分析中心(OGAM)和中东部技术大学(METU)电子与电气工程系)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 SAMChat通过引入链式推理和GRPO,专为遥感影像分析优化,实现了在开放描述和分类任务上的高精度表现。

Comments Accepted to Journal of Selected Topics in Applied Earth Observations and Remote Sensing (JSTARS) Special Issue on Foundation and Large Vision Models for Remote Sensing. Code and dataset are available at https://github.com/aybora/SAMChat

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12901 2025-11-11 cs.CE 85%

Agentar-DeepFinance-100K: A Large-Scale Financial Dataset via Systematic Chain-of-Thought Synthesis Optimization

Xiaoke Zhao, Zhaowen Zhou, Lin Chen, Lihong Wang, Zhiyi Huang, Kaiyuan Zheng, Yanjun Zheng, Xiyang Du, Longfei Liao, Jiawei Liu, Xiang Qi, Bo Zhang, Peng Zhang, Wei Wang, Zhe Li

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10514 2025-11-11 cs.CV cs.AI cs.CL cs.LG 85%

ColorBench: Can VLMs See and Understand the Colorful World? A Comprehensive Benchmark for Color Perception, Reasoning, and Robustness

Yijun Liang, Ming Li, Chenrui Fan, Ziyue Li, Dang Nguyen, Kwesi Cobbina, Shweta Bhardwaj, Jiuhai Chen, Fuxiao Liu, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by NeurIPS2025. 36 pages, including references and appendix. Code is available at https://github.com/tianyi-lab/ColorBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23968 2025-10-31 cs.CV 85%

Reasoning Visual Language Model for Chest X-Ray Analysis

Andriy Myronenko, Dong Yang, Baris Turkbey, Mariam Aboian, Sena Azamat, Esra Akcicek, Hongxu Yin, Pavlo Molchanov, Marc Edgar, Yufan He, Pengfei Guo, Yucheng Tang, Daguang Xu

机构 * NVIDIA NIH/NCI CHOP/UPenn Basaksehir Cam and Sakura City Hospital

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

Comments NV-Reason-CXR-3B

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20843 2025-09-26 cs.RO 85%

MTRDrive: Memory-Tool Synergistic Reasoning for Robust Autonomous Driving in Corner Cases

Ziang Luo, Kangan Qian, Jiahua Wang, Yuechen Luo, Jinyu Miao, Zheng Fu, Yunlong Wang, Sicong Jiang, Zilin Huang, Yifei Hu, Yuhao Yang, Hao Ye, Mengmeng Yang, Xiaojian Dong, Kun Jiang, Diange Yang

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) Automotive and Robotics, Xiaomi Corporation(小鹏汽车与机器人部) McGill University(麦吉尔大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract)

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02318 2025-09-23 cs.SD cs.AI cs.CL cs.LG cs.MM eess.AS 85%

Audio-Reasoner: Improving Reasoning Capability in Large Audio Language Models

Zhifei Xie, Mingbao Lin, Zihang Liu, Pengcheng Wu, Shuicheng Yan, Chunyan Miao

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Rakuten

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Technical report, in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14405 2025-09-22 cs.IR 85%

RaCT: Ranking-aware Chain-of-Thought Optimization for LLMs

Haowei Liu, Xuyang Wu, Guohao Sun, Zhiqiang Tao, Yi Fang

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14180 2025-09-18 cs.CL cs.AI cs.LG 85%

Synthesizing Behaviorally-Grounded Reasoning Chains: A Data-Generation Framework for Personal Finance LLMs

Akhil Theerthala

机构 * Perfios Software Solutions(Perfios软件解决方案)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 24 pages, 11 figures. The paper presents a novel framework for generating a personal finance dataset. The resulting fine-tuned model and dataset are publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02175 2025-09-05 cs.CV cs.AI cs.CL cs.LG 85%

Understanding Space Is Rocket Science -- Only Top Reasoning Models Can Solve Spatial Understanding Tasks

Nils Hoehing, Mayug Maniparambil, Ellen Rushe, Noel E. O'Connor, Anthony Ventresque

机构 * School of Computer Science(计算机科学学院) University College Dublin(都柏林大学) School of Computing(计算机科学学院) Dublin City University(都柏林城市大学) School of Electronic Engineering(电子工程学院) Trinity College Dublin(都柏林三一学院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01444 2025-09-03 cs.CY 85%

Strata-Sword: A Hierarchical Safety Evaluation towards LLMs based on Reasoning Complexity of Jailbreak Instructions

Shiji Zhao, Ranjie Duan, Jiexi Liu, Xiaojun Jia, Fengxiang Wang, Cheng Wei, Ruoxi Cheng, Yong Xie, Chang Liu, Qing Guo, Jialing Tao, Hui Xue, Xingxing Wei

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16213 2025-08-25 cs.CV 85%

MedOmni-45°: A Safety-Performance Benchmark for Reasoning-Oriented LLMs in Medicine

Kaiyuan Ji, Yijin Guo, Zicheng Zhang, Xiangyang Zhu, Yuan Tian, Ning Liu, Guangtao Zhai

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08764 2025-08-13 cs.MA 85%

CARES: Collaborative Agentic Reasoning for Error Detection in Surgery

Chang Han Low, Zhu Zhuo, Ziyue Wang, Jialang Xu, Haofeng Liu, Nazir Sirajudeen, Matthew Boal, Philip J. Edwards, Danail Stoyanov, Nader Francis, Jiehui Zhong, Di Gu, Evangelos B. Mazomenos, Yueming Jin

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21924 2025-07-30 cs.CV 85%

MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning

Tianhong Gao, Yannian Fu, Weiqun Wu, Haixiao Yue, Shanshan Liu, Gang Zhang

机构 * Baidu Inc.(百度公司)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07313 2025-07-11 cs.CL cs.AI cs.LG 85%

Frontier LLMs Still Struggle with Simple Reasoning Tasks

Alan Malek, Jiawei Ge, Nevena Lazic, Chi Jin, András György, Csaba Szepesvári

机构 * Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 53 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16141 2025-06-23 cs.CV cs.AI cs.CL cs.LG 85%

GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning

Yi Chen, Yuying Ge, Rui Wang, Yixiao Ge, Junhao Cheng, Ying Shan, Xihui Liu

机构 * The University of Hong Kong(香港大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Code released at: https://github.com/TencentARC/GRPO-CARE

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05478 2025-06-18 cs.CL cs.AI cs.CV cs.LG cs.RO 85%

Language and Planning in Robotic Navigation: A Multilingual Evaluation of State-of-the-Art Models

Malak Mansour, Ahmed Aly, Bahey Tharwat, Sarim Hashmi, Dong An, Ian Reid

专题命中 推理评测 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments This work has been accepted for presentation at LM4Plan@AAAI'25. For more details, please check: https://llmforplanning.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10525 2025-06-13 cs.SE 85%

AdaptiveLLM: A Framework for Selecting Optimal Cost-Efficient LLM for Code-Generation Based on CoT Length

Junhang Cheng, Fang Liu, Chengru Wu, Li Zhang

专题命中 推理评测 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract)

Comments Accepted by Internetware 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05523 2025-06-09 cs.CV cs.AI cs.CL cs.LG 85%

MORSE-500: A Programmatically Controllable Video Benchmark to Stress-Test Multimodal Reasoning

Zikui Cai, Andrew Wang, Anirudh Satheesh, Ankit Nakhawa, Hyunwoo Jae, Keenan Powell, Minghui Liu, Neel Jay, Sungbin Oh, Xiyao Wang, Yongyuan Liang, Tom Goldstein, Furong Huang

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16832 2025-05-29 cs.AI cs.CL cs.CV cs.LG 85%

From EduVisBench to EduVisAgent: A Benchmark and Multi-Agent Framework for Reasoning-Driven Pedagogical Visualization

Haonian Ji, Shi Qiu, Siyang Xin, Siwei Han, Zhaorun Chen, Dake Zhang, Hongyi Wang, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) University of Chicago(芝加哥大学) Rutgers University(罗格斯大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 16 pages; 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13062 2025-05-29 cs.MM cs.SD eess.AS 85%

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model

Yong Ren, Chenxing Li, Le Xu, Hao Gu, Duzhen Zhang, Yujie Chen, Manjie Xu, Ruibo Fu, Shan Yang, Dong Yu

机构 * Chinese Academy of Sciences(中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Tencent AI Lab(腾讯AI实验室) Institute of Automation School of Artificial Intelligence(自动化研究所人工智能学院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

Comments Accepted by Interspeech 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19702 2025-05-27 cs.CV 85%

Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning

Minheng Ni, Zhengyuan Yang, Linjie Li, Chung-Ching Lin, Kevin Lin, Wangmeng Zuo, Lijuan Wang

机构 * Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology(哈尔滨工业大学) Microsoft(微软公司)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16135 2025-05-23 cs.AI cs.CL cs.LG 85%

Sudoku-Bench: Evaluating creative reasoning with Sudoku variants

Jeffrey Seely, Yuki Imajuku, Tianyu Zhao, Edoardo Cetin, Llion Jones

机构 * Sakana AI

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14625 2025-05-23 cs.LG cs.AI cs.CL 85%

TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning

Zhangchen Xu, Yuetai Li, Fengqing Jiang, Bhaskar Ramasubramanian, Luyao Niu, Bill Yuchen Lin, Radha Poovendran

机构 * University of Washington(华盛顿大学) Western Washington University(西雅图华盛顿大学)

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏