arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10428 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10428 篇

2512.02942 2025-12-03 cs.CV cs.AI 79%

Benchmarking Scientific Understanding and Reasoning for Video Generation using VideoScience-Bench

基于视频科学基准的视频生成科学理解与推理评估

Lanxiang Hu, Abhilash Shankarampeta, Yixin Huang, Zilin Dai, Haoyang Yu, Yujie Zhao, Haoqiang Kang, Daniel Zhao, Tajana Rosing, Hao Zhang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 VideoScience-Bench是首个评估视频模型科学理解和推理能力的基准测试,通过200个精心设计的提示评估模型在物理和化学领域的科学推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02699 2025-12-03 cs.AI 79%

Learning What to Attend First: Modality-Importance-Guided Reasoning for Reliable Multimodal Emotion Understanding

学习优先关注什么:模态重要性引导的推理用于可靠的多模态情感理解

Hyeongseop Rha, Jeong Hun Yeo, Junil Won, Se Jin Park, Yong Man Ro

机构 * Integrated Vision and Language Lab, KAIST, South Korea(韩国成均馆大学集成视觉与语言实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出MIGR框架,通过模态重要性引导推理,提升多模态情感理解的可靠性,实验表明能有效减少情感不一致的解释实例。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00881 2025-12-02 cs.AI 79%

Hybrid-DMKG: A Hybrid Reasoning Framework over Dynamic Multimodal Knowledge Graphs for Multimodal Multihop QA with Knowledge Editing

Hybrid-DMKG: 一种基于动态多模态知识图谱的混合推理框架用于多模态多跳问答与知识编辑

Li Yuan, Qingfei Huang, Bingshan Zhu, Yi Cai, Qingbao Huang, Changmeng Zheng, Zikun Deng, Tao Wang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 Hybrid-DMKG通过动态多模态知识图谱实现多跳问答中的准确推理,提升对知识更新的鲁棒性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12263 2025-12-02 cs.CV cs.AI 79%

CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models

CrossVid: 一个用于评估多模态大语言模型在跨视频推理中的综合基准

Jingyao Li, Jingyun Wang, Molin Tan, Haochen Wang, Cilin Yan, Likun Shi, Jiayin Cai, Xiaolong Jiang, Yao Hu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 CrossVid是首个用于评估多模态大语言模型跨视频推理能力的综合基准,通过多样化的任务和数据集验证了模型在复杂视频推理任务中的表现。

Comments Accepted to AAAI 2026 (main track). For code and data, see https://github.com/chuntianli666/CrossVid

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11278 2025-12-02 cs.HC cs.AI cs.SE 79%

Is General-Purpose AI Reasoning Sensitive to Data-Induced Cognitive Biases? Dynamic Benchmarking on Typical Software Engineering Dilemmas

通用人工智能推理是否受数据诱导的认知偏差影响?典型软件工程困境中的动态基准测试

Francesco Sovrano, Gabriele Dominici, Rita Sevastjanova, Alessandra Stramiglio, Alberto Bacchelli

机构 * Collegium Helveticum, ETH Zurich(瑞士苏黎世联邦理工学院) University of Zurich(苏黎世大学) University of Italian-speaking Switzerland(意大利语瑞士大学) ETH Zurich(苏黎世联邦理工学院) University of Bologna(博洛尼亚大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过动态基准测试框架评估GPAI在软件工程中对数据诱导认知偏差的敏感性,发现GPAI系统在面对偏见诱导语言线索时易产生错误推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23269 2025-12-01 cs.AI 79%

OctoMed: Data Recipes for State-of-the-Art Multimodal Medical Reasoning

OctoMed:面向尖端多模态医疗推理的数据配方

Timothy Ossowski, Sheng Zhang, Qianchu Liu, Guanghui Qin, Reuben Tan, Tristan Naumann, Junjie Hu, Hoifung Poon

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 OctoMed通过结构化推理轨迹的数据配方,提升医疗多模态推理模型的性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23112 2025-12-01 cs.CV cs.LG 79%

MathSight: A Benchmark Exploring Have Vision-Language Models Really Seen in University-Level Mathematical Reasoning?

MathSight: 一个探索视觉语言模型在大学级数学推理中是否真正看到的基准

Yuandong Wang, Yao Cui, Yuxin Zhao, Zhen Yang, Yangfu Zhu, Zhenzhou Shao

机构 * Capital Normal University(首都师范大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 MathSight基准测试通过对比不同视觉输入条件,探索视觉语言模型在大学级数学推理中视觉信息的真实贡献。

Comments Comments: 32 pages, 15 figures, 9 tables, includes appendix. Project page: https://cnu-bot-group.github.io/MathSight/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20994 2025-11-27 cs.CV cs.AI cs.CR 79%

GuardTrace-VL: Detecting Unsafe Multimodel Reasoning via Iterative Safety Supervision

GuardTrace-VL: 通过迭代安全监督检测不安全的多模型推理

Yuxiao Xiang, Junchi Chen, Zhenchao Jin, Changtao Miao, Haojie Yuan, Qi Chu, Tao Gong, Nenghai Yu

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络安全学院) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室) The University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 GuardTrace-VL通过联合图像-文本分析监控多模态推理全过程,有效检测不安全推理内容,实现93.1%的F1分数提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15974 2025-11-27 cs.AI 79%

KRAL: Knowledge and Reasoning Augmented Learning for LLM-assisted Clinical Antimicrobial Therapy

KRAL: 用于LLM辅助临床抗菌治疗的知识与推理增强学习

Zhe Li, Yehan Qiu, Yujie Chen, Xiang Zhou

机构 * Information Center, State Key Laboratory of Complex Severe and Rare Diseases, Peking Union Medical College Hospital(信息中心、复杂严重罕见疾病国家重点实验室、北京友谊医院) Department of Critical Care Medicine, State Key Laboratory of Complex Severe and Rare Diseases, Peking Union Medical College Hospital, Peking Union Medical College and Chinese Academy of Medical Sciences(重症医学科、复杂严重罕见疾病国家重点实验室、北京友谊医院、北京友谊医院和中国医学科学院) Medical Intensive Care Unit, State Key Laboratory of Complex Severe and Rare Diseases, Peking Union Medical College Hospital, Peking Union Medical College and Chinese Academy of Medical Sciences(医疗重症病房、复杂严重罕见疾病国家重点实验室、北京友谊医院、北京友谊医院和中国医学科学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 KRAL通过知识与推理增强学习提升LLM在临床抗菌治疗中的诊断能力,以低成本高效方式优化医疗决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18955 2025-11-27 cs.AI cs.CR cs.SE 79%

Co-PatcheR: Collaborative Software Patching with Component(s)-specific Small Reasoning Models

Co-PatcheR: 基于组件特定小推理模型的协作软件修补

Yuheng Tang, Hongwei Li, Kaijie Zhu, Michael Yang, Yangruibo Ding, Wenbo Guo

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 Co-PatcheR通过组件特定的小推理模型实现协作软件修补,提升修补效率并减少训练资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25628 2025-11-26 cs.CL 79%

EHR-R1: A Reasoning-Enhanced Foundational Language Model for Electronic Health Record Analysis

EHR-R1: 一种增强推理能力的基础语言模型用于电子健康记录分析

Yusheng Liao, Chaoyi Wu, Junwei Liu, Shuyang Jiang, Pengcheng Qiu, Haowen Wang, Yun Yue, Shuai Zhen, Jian Wang, Qianrui Fan, Jinjie Gu, Ya Zhang, Yanfeng Wang, Yu Wang, Weidi Xie

机构 * Shanghai Jiao Tong University(上海交通大学) Intelligence Healthcare Department, AntGroup(智能医疗部,蚂蚁集团) Intelligence Computing and Sensing Laboratory, Peking University(智能计算与感知实验室,北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 EHR-R1是一种针对电子健康记录分析设计的增强推理能力的基础语言模型,通过大规模推理数据集和多阶段训练方法提升了EHR分析的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01341 2025-11-26 cs.CL 79%

TurnBench-MS: A Benchmark for Evaluating Multi-Turn, Multi-Step Reasoning in Large Language Models

TurnBench-MS: 一个评估大语言模型多轮多步推理能力的基准

Yiran Zhang, Mo Wang, Xiaoyang Li, Kaixuan Ren, Chencheng Zhu, Usman Naseem

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 TurnBench-MS通过互动破码任务评估大语言模型的多轮多步推理能力,揭示当前模型在复杂推理任务中的显著不足。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2025

Journal ref Findings of the ACL: EMNLP 2025, pp. 19892-19924, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19005 2025-11-25 cs.AI 79%

Introducing Visual Scenes and Reasoning: A More Realistic Benchmark for Spoken Language Understanding

引入视觉场景和推理:一个更现实的口语语言理解基准

Di Wu, Liting Jiang, Ruiyu Fang, Bianjing, Hongyan Xie, Haoxiang Su, Hao Huang, Zhongjiang He, Shuangyong Song, Xuelong Li

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出VRSLU数据集,通过引入视觉信息和显式推理提升口语语言理解的现实应用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17775 2025-11-25 cs.CL 79%

FoREST: Frame of Reference Evaluation in Spatial Reasoning Tasks

FoREST: 空间推理任务中的参考框架评估

Tanawan Premsri, Parisa Kordjamshidi

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Michigan State University(密歇根州立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 FoREST基准通过空间引导提示法提升LLMs在空间推理任务中的参考框架理解能力。

Comments 10 pages, 3 Figures, 4 Tables, EMNLP-2025 Main (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11025 2025-11-25 cs.CV cs.AI 79%

AirCopBench: A Benchmark for Multi-drone Collaborative Embodied Perception and Reasoning

AirCopBench: 多无人机协作具身感知与推理的基准测试

Jirong Zha, Yuxuan Fan, Tianyu Zhang, Geng Chen, Yingfeng Chen, Chen Gao, Xinlei Chen

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 AirCopBench是一个针对多无人机协作具身感知与推理的首个全面基准测试,通过模拟与现实数据生成14600+问题,评估MLLMs在复杂协作场景中的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07852 2025-11-25 cs.AI 79%

FinMR: A Knowledge-Intensive Multimodal Benchmark for Advanced Financial Reasoning

FinMR:面向高级金融推理的知识密集型多模态基准

Shuangyan Deng, Haizhou Peng, Jiachen Xu, Rui Mao, Ciprian Doru Giurcăneanu, Jiamou Liu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 FinMR是一个面向高级金融推理的知识密集型多模态基准,通过精心设计的问题-答案对和多样化的金融主题,评估专业分析师级别的金融推理能力。

Comments The methodology section contains inaccuracies that may lead to misleading interpretations. The authors have withdrawn this version for correction

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18572 2025-11-25 cs.CV cs.LG 79%

GeoReasoner: Geo-localization with Reasoning in Street Views using a Large Vision-Language Model

GeoReasoner: 基于大规模视觉-语言模型的街景地理定位

Ling Li, Yu Ye, Yao Zhou, Bingchuan Jiang, Wei Zeng

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tongji University(同济大学) Independent Researcher(独立研究者) Information Engineering University(信息工程大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 GeoReasoner通过整合外部知识和改进的微调方法,提升了街景地理定位的性能,优于现有模型并节省训练资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16885 2025-11-24 cs.CL 79%

Improving Latent Reasoning in LLMs via Soft Concept Mixing

通过软概念混合改进大语言模型的潜在推理

Kang Wang, Xiangyu Duan, Tianyi Du

机构 * School of Computer Science and Technology, Soochow University(计算机科学与技术学院,苏州大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 通过引入Soft Concept Mixing方法,改进大语言模型的潜在推理能力,提升推理性能并保持训练稳定性。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16198 2025-11-21 cs.CL cs.DL 79%

SemanticCite: Citation Verification with AI-Powered Full-Text Analysis and Evidence-Based Reasoning

SemanticCite: 借助AI全文本分析和基于证据的推理进行引文验证

Sebastian Haan

机构 * The University of Sydney(悉尼大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 SemanticCite通过AI全文本分析和证据推理,提供高效的引文验证系统,结合多种检索方法和四类分类系统,实现精准的引文准确性验证,并开源数据集和模型以促进研究诚信。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15717 2025-11-21 cs.AI cs.CV cs.MA 79%

How Modality Shapes Perception and Reasoning: A Study of Error Propagation in ARC-AGI

模态如何塑造感知与推理:ARC-AGI中误差传播的研究

Bo Wen, Chen Wang, Erhan Bilal

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究通过对比文本和图像模态,发现结构化文本能精确获取稀疏特征,图像对分辨率敏感,结合两者可提升执行精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14366 2025-11-21 cs.CL 79%

ATLAS: A High-Difficulty, Multidisciplinary Benchmark for Frontier Scientific Reasoning

ATLAS:面向前沿科学推理的高难度、多学科基准

Hongwei Liu, Junnan Liu, Shudong Liu, Haodong Duan, Yuqiang Li, Mao Su, Xiaohong Liu, Guangtao Zhai, Xinyu Fang, Qianhong Ma, Taolin Zhang, Zihan Ma, Yufeng Zhao, Peiheng Zhou, Linchen Xiao, Wenlong Zhang, Shijie Zhou, Xingjian Ma, Siqi Sun, Jiaye Ge, Meng Li, Yuhong Liu, Jianxin Dong, Jiaying Li, Hui Wu, Hanwen Liang, Jintai Lin, Yanting Wang, Jie Dong, Tong Zhu, Tianfan Fu, Conghui He, Qi Zhang, Songyang Zhang, Lei Bai, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 ATLAS是一个由领域专家开发的高难度、跨学科科学推理基准,通过原创问题和严格质量控制,评估模型在多领域知识整合和复杂推理能力上的表现。

Comments 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14777 2025-11-20 cs.AI 79%

The Illusion of Procedural Reasoning: Measuring Long-Horizon FSM Execution in LLMs

Mahdi Samiei, Mahdi Mansouri, Mahdieh Soleymani Baghshah

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08008 2025-11-20 cs.AI 79%

Combining LLM Semantic Reasoning with GNN Structural Modeling for Multi-View Multi-Label Feature Selection

Zhiqi Chen, Yuzhou Liu, Jiarui Liu, Wanfu Gao

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14120 2025-11-19 cs.CV cs.AI 79%

Multi-view Phase-aware Pedestrian-Vehicle Incident Reasoning Framework with Vision-Language Models

Hao Zhen, Yunxiang Yang, Jidong J. Yang

机构 * College of Engineering University of Georgia(工程学院 乔治亚大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments 23 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12215 2025-11-19 cs.AI 79%

Xiangqi-R1: Enhancing Spatial Strategic Reasoning in LLMs for Chinese Chess via Reinforcement Learning

Yuhao Chen, Shuochen Liu, Yuanjie Lyu, Chao Zhang, Jiayao Shi, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15089 2025-11-19 cs.CL 79%

LongReason: A Synthetic Long-Context Reasoning Benchmark via Context Expansion

Zhan Ling, Kang Liu, Kai Yan, Yifan Yang, Weijian Lin, Ting-Han Fan, Lingfeng Shen, Zhengyin Du, Jiecao Chen

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06067 2025-11-18 cs.CV cs.AI 79%

Reasoning under Vision: Understanding Visual-Spatial Cognition in Vision-Language Models for CAPTCHA

Python Song, Luke Tenyi Chang, Yun-Yun Tsai, Penghui Li, Junfeng Yang

机构 * Columbia University Department of Computer Science(哥伦比亚大学计算机科学系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments 14pages, 11figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12014 2025-11-18 cs.CL cs.HC 79%

CURE: Cultural Understanding and Reasoning Evaluation - A Framework for "Thick" Culture Alignment Evaluation in LLMs

Truong Vo, Sanmi Koyejo

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04832 2025-11-18 cs.CL 79%

Joint Evaluation of Answer and Reasoning Consistency for Hallucination Detection in Large Reasoning Models

Changyue Wang, Weihang Su, Qingyao Ai, Yiqun Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Quan Cheng Laboratory(泉城实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05129 2025-11-17 cs.IR cs.CL 79%

Navigating Through Paper Flood: Advancing LLM-based Paper Evaluation through Domain-Aware Retrieval and Latent Reasoning

Wuqiang Zheng, Yiyan Xu, Xinyu Lin, Chongming Gao, Wenjie Wang, Fuli Feng

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Accepted for publication in AAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏