arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-20 至 2026-03-20 共收录 26 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 26 篇

2510.11173 2026-03-20 cs.CV cs.MM 89%

CoPRS: Learning Positional Prior from Chain-of-Thought for Reasoning Segmentation

CoPRS:从链式思维中学习位置先验以进行推理分割

Zhenyu Lu, Liupeng Li, Jinpeng Wang, Yan Feng, Bin Chen, Ke Chen, Yaowei Wang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Meituan, Beijing(北京美团) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract)

AI总结 本文提出CoPRS模型,通过多模态链式思维生成可解释的位置先验热图,提升推理分割的可解释性和精度,实验表明其在多个数据集上表现优异。

Comments Accepted to ICLR 2026. 20 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18662 2026-03-20 cs.AI 83%

Thinking with Constructions: A Benchmark and Policy Optimization for Visual-Text Interleaved Geometric Reasoning

通过构造进行思考:一种用于视觉-文本交错几何推理的基准和策略优化

Haokun Zhao, Wanshi Xu, Haidong Yuan, Songjun Cao, Long Ma, Yanghua Xiao

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of ECE, Peking University(北京大学电子工程学院) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Tencent Youtu Lab(腾讯优图实验室)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出GeoAux-Bench基准和A2PO策略优化框架,通过交错视觉-文本辅助工具提升几何推理性能,实验表明有效构造能降低推理困惑度,使MLLMs在选择性辅助构造上获得3.51%的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19182 2026-03-20 cs.AI cs.CL 81%

Box Maze: A Process-Control Architecture for Reliable LLM Reasoning

迷宫盒子:一种用于可靠大语言模型推理的过程控制架构

Zou Qiang

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Box Maze框架,通过内存 grounding、结构化推理和边界约束三层结构提升LLM推理可靠性,实验显示其在对抗性场景中显著降低边界失效率。

Comments 10 pages, 5 tables, 0 figures. Conceptual architecture with preliminary simulation-based validation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19017 2026-03-20 cs.CL cs.AI 81%

What Really Controls Temporal Reasoning in Large Language Models: Tokenisation or Representation of Time?

真正控制大语言模型时间推理的是令牌化还是时间表示?

Gagan Bhatia, Ahmad Muhammad Isa, Maxime Peyrard, Wei Zhao

机构 * University of Aberdeen(阿伯丁大学) Université Grenoble Alpes & CNRS(格勒诺布尔阿尔卑斯大学及国家科学研究中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究通过MultiTempBench验证了大语言模型时间推理的核心因素,发现令牌化质量是资源依赖型瓶颈,同时时间线性度在高资源语言中是主要预测因素,而碎片化在低资源语言中更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21814 2026-03-20 cs.AI cs.CL 81%

Prompt Architecture Determines Reasoning Quality: A Variable Isolation Study on the Car Wash Problem

提示架构决定推理质量:关于汽车洗问题的变量隔离研究

Heejin Jo

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过变量隔离研究,探讨了提示架构层在汽车洗问题推理中的作用,发现STAR框架可将准确率提升至85%,结合用户资料和RAG上下文后达到100%。

Comments 9 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18892 2026-03-20 cs.CV cs.AI 79%

MultihopSpatial: Multi-hop Compositional Spatial Reasoning Benchmark for Vision-Language Model

MultihopSpatial: 用于视觉语言模型的多跳组合空间推理基准

Youngwan Lee, Soojin Jang, Yoorhim Cho, Seunghwan Lee, Yong-Ju Lee, Sung Ju Hwang

机构 * Electronics and Telecommunications Research Institute, South Korea(韩国电信研究院) Korea Advanced Institute of Science and Technology, South Korea(韩国科学技术院) Sungkyunkwan University, South Korea(成均馆大学) DeepAuto, South Korea(DeepAuto)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出MultihopSpatial基准,针对多跳组合空间推理问题,引入Acc@50IoU指标,并通过大规模训练集提升视觉语言模型的空间推理能力。

Comments Project page: https://youngwanlee.github.io/multihopspatial

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18614 2026-03-20 cs.AI 79%

ZEBRAARENA: A Diagnostic Simulation Environment for Studying Reasoning-Action Coupling in Tool-Augmented LLMs

ZEBRAARENA:一种用于研究工具增强大语言模型中推理-动作耦合的诊断模拟环境

Wanjia Zhao, Ludwig Schmidt, James Zou, Vidhisha Balachandran, Lingjiao Chen

机构 * Stanford University(斯坦福大学) Microsoft Research(微软研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ZEBRAARENA通过可控难度和知识最小化设计,研究工具增强大语言模型中的推理-动作耦合,强调深度推理与精准工具调用的结合,揭示理论最优与实际工具使用间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18418 2026-03-20 cs.CV cs.AI 79%

Mind the Rarities: Can Rare Skin Diseases Be Reliably Diagnosed via Diagnostic Reasoning?

注意罕见病:罕见皮肤疾病能否通过诊断推理可靠诊断?

Yang Liu, Jiyao Yang, Hongjin Zhao, Xiaoyong Li, Yanzhe Ji, Xingjian Li, Runmin Jiang, Tianyang Wang, Saeed Anwar, Dongwoo Kim, Yue Yao, Zhenyue Qin, Min Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Australian National University(澳大利亚国立大学) University of Western Australia(西澳大学) POSTECH Yale University(耶鲁大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出DermCase基准,通过多模态数据评估罕见皮肤疾病诊断推理能力,揭示现有模型在诊断准确性和临床推理中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20579 2026-03-20 cs.CV cs.AI cs.MM 79%

Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence

Open-o3-Video: 基于显式时空证据的视频推理

Jiahao Meng, Xiangtai Li, Haochen Wang, Yue Tan, Tao Zhang, Lingdong Kong, Yunhai Tong, Anran Wang, Zhiyang Teng, Yujing Wang, Zhuochen Wang

机构 * PKU(北京大学) ByteDance(字节跳动) CASIA(CASIA研究院) WHU(武汉大学) NUS(新加坡国立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Open-o3-Video,通过显式时空证据提升视频推理的可追溯性与可验证性,基于STGR数据集和冷启动强化学习策略,在V-STAR基准上取得SOTA性能,并支持置信度感知的测试时扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18988 2026-03-20 cs.RO 78%

MERGE: Guided Vision-Language Models for Multi-Actor Event Reasoning and Grounding in Human-Robot Interaction

MERGE:面向人类机器人交互中多主体事件推理与 grounding 的引导视觉-语言模型

Joerg Deigmoeller, Nakul Agarwal, Stephan Hasler, Daniel Tanneberg, Anna Belardinelli, Reza Ghoddoosian, Chao Wang, Felix Ocker, Fan Zhang, Behzad Dariush, Michael Gienger

机构 * Honda Research Institute Europe(本田欧洲研究院) Honda Research Institute USA(本田美国研究院)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 MERGE 通过引导视觉语言模型实现动态人类机器人交互中多主体事件的推理与 grounding,提升 situational awareness 与效率,基于 GROUND 数据集验证其性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19092 2026-03-20 cs.CV cs.AI cs.CL cs.LG 67%

SAVeS: Steering Safety Judgments in Vision-Language Models via Semantic Cues

SAVeS: 通过语义线索引导视觉-语言模型中的安全判断

Carlos Hinojosa, Clemens Grange, Bernard Ghanem

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹大学科学与技术学院) Technical University of Munich(慕尼黑技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过语义线索引导视觉-语言模型的安全判断,提出SAVeS基准和评估协议,验证安全决策对语义线索的敏感性,揭示模型对视觉-语言关联的依赖及潜在安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19149 2026-03-20 cs.CL cs.LG 62%

Optimal Splitting of Language Models from Mixtures to Specialized Domains

从混合数据中语言模型的最优分割以专用于特定领域

Skyler Seto, Pierre Ablin, Anastasiia Filippova, Jiayuan Ye, Louis Bethune, Angelos Katharopoulos, David Grangier

机构 * Apple(苹果公司) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种方法,通过独立预训练多个模型并利用缩放定律确定预训练和继续预训练之间的最佳计算分配,从而提升不同模型大小和计算预算下的常识知识和推理基准性能。

Comments 26 pages, 11 tables, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18773 2026-03-20 cs.LG cs.AI 62%

Automatic Configuration of LLM Post-Training Pipelines

大语言模型后训练流程的自动配置

Channe Chwa, Xinle Wu, Yao Lu

机构 * National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AutoPipe框架,通过学习历史运行数据和贝叶斯优化,有效配置大语言模型后训练流程,减少计算成本并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18007 2026-03-20 cs.CL cs.AI 62%

Do Large Language Models Possess a Theory of Mind? A Comparative Evaluation Using the Strange Stories Paradigm

大型语言模型具备心智理论吗?使用奇怪故事范式进行比较评估

Anna Babarczy, Andras Lukacs, Peter Vedres, Zeteny Bujka

机构 * ELTE Research Centre for Linguistics(ELTE语言学研究中心) Department of Cognitive Science, Faculty of Natural Sciences, Budapest University of Technology and Economics(布达佩斯技术与经济大学自然科学学院认知科学系) Institute of Mathematics, Eötvös Lóránd University(欧多布雷尼大学数学研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过奇怪故事范式评估了大型语言模型是否具备心智理论能力,发现GPT-4o在复杂条件下表现接近人类,而早期小型模型易受相关线索影响且易受无关信息干扰。

Comments 19 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09734 2026-03-20 cs.CL cs.AI 62%

From Detection to Diagnosis: Advancing Hallucination Analysis with Automated Data Synthesis

从检测到诊断:通过自动化数据合成推进幻觉分析

Yanyi Liu, Qingwen Yang, Tiezheng Guo, Feiyu Qu, Jun Liu, Yingyou Wen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出从检测到诊断的新范式,通过自动化数据合成生成高质量训练样本,训练出HDM-4B-RL模型,在幻觉诊断任务中超越现有检测模型,实现更可靠的生成式AI系统。

Comments Accepted at The 40th Annual AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18976 2026-03-20 cs.AI 57%

Evaluating 5W3H Structured Prompting for Intent Alignment in Human-AI Interaction

评估5W3H结构提示在人机交互中的意图对齐

Peng Gang

机构 * Huizhou Lateni AI Technology Co., Ltd.(惠州拉提尼人工智能科技有限公司) Huizhou University(惠州大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文通过对比三种提示条件,评估了基于5W3H的PPS框架在人机交互中提升意图对齐的效果,发现渲染化的PPS在高歧义任务中表现更优,且揭示了结构化提示在实际应用中的价值。

Comments 27 pages, figures, tables, and appendix. Primary category: human-computer interaction / human-AI interaction. Public artifact repository and implementation resources are referenced in the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18729 2026-03-20 cs.AI 57%

Analysis Of Linguistic Stereotypes in Single and Multi-Agent Generative AI Architectures

单Agent和多Agent生成式AI架构中语言刻板印象的分析

Martina Ullasci, Marco Rondina, Riccardo Coppola, Flavio Giobergia, Riccardo Bellanca, Gabriele Mancari Pasi, Luca Prato, Federico Spinoso, Silvia Tagliente

机构 * Politecnico di Torino(托斯卡纳理工学院)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

AI总结 本文分析了生成式AI在单Agent和多Agent架构中对不同方言的刻板印象生成,探讨了通过提示工程和多Agent架构缓解偏见的效果,发现不同模型在刻板印象表现上存在显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18677 2026-03-20 cs.HC cs.AI cs.CY 57%

Cognitive Amplification vs Cognitive Delegation in Human-AI Systems: A Metric Framework

认知放大与认知委托在人机系统中的区别:一个度量框架

Eduardo Di Santi

机构 * University of Colorado Boulder(科罗拉多大学波德穆尔分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出度量框架区分认知放大与认知委托,通过定义CAI*、D、HRI和HCDR等指标,评估人机系统协同性能及人类认知可持续性。

Comments 16 pages, 2 figures. Conceptual and mathematical framework for human-AI collaboration, cognitive amplification, cognitive delegation, and cognitive sustainability

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18508 2026-03-20 cs.CV cs.AI 57%

Foundations and Architectures of Artificial Intelligence for Motor Insurance

人工智能在机动车保险中的基础与架构

Teerapong Panboonyuen

机构 * Thaivivat Insurance Public Company Limited(泰维瓦特保险公共公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文系统阐述了机动车保险中人工智能的基础与架构,结合大规模实际应用,提出统一的垂直整合AI范式,整合感知、多模态推理和生产基础设施,实现汽车风险评估和理赔流程的端到端自动化。

Comments 173 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09909 2026-03-20 cs.AI 57%

MedMASLab: A Unified Orchestration Framework for Benchmarking Multimodal Medical Multi-Agent Systems

MedMASLab:多模态医疗多智能体系统的统一协调框架

Yunhang Qian, Xiaobin Hu, Jiaquan Yu, Siyang Xin, Xiaokun Chen, Jiangning Zhang, Peng-Tao Jiang, Jiawei Liu, Hongwei Bran Li

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Zhejiang University(浙江大学) vivo Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出MedMASLab框架,解决医疗多智能体系统中多模态整合碎片化问题,通过标准化通信协议、自动化评估器和大规模基准测试,揭示领域特定性能差距,为未来自主临床系统建立新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19098 2026-03-20 cs.CV 50%

TAU-R1: Visual Language Model for Traffic Anomaly Understanding

TAU-R1:用于交通异常理解的视觉语言模型

Yuqiang Lin, Kehua Chen, Sam Lockyer, Arjun Yadav, Mingxuan Sui, Shucheng Zhang, Yan Shi, Bingzhang Wang, Yuang Zhang, Markus Zarbock, Florain Stanek, Adrian Evans, Wenbin Li, Yinhai Wang, Nic Zhang

机构 * University of Bath(巴斯大学) University of Washington(华盛顿大学) City of Carmel, Indiana(印第安纳州卡迈尔市) Starwit GmbH

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出TAU-R1模型,通过两层框架提升交通异常识别与推理能力,结合定制化训练策略与数据集,实现高效部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19059 2026-03-20 cs.CV 50%

SignAgent: Agentic LLMs for Linguistically-Grounded Sign Language Annotation and Dataset Curation

SignAgent:用于语言学基础的手语标注和数据集整理的代理LLM

Oliver Cory, Ozge Mercanoglu Sincan, Richard Bowden

机构 * Centre for Vision, Speech and Signal Processing(视觉、语音和信号处理中心)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出SignAgent,一种利用大语言模型进行可扩展、语言学基础的手语标注和数据集整理的新框架。通过SignAgent协调器和SignGraph,解决传统方法和手动标注的瓶颈,实现大规模语言感知数据标注。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18625 2026-03-20 cs.CV 50%

GenVideoLens: Where LVLMs Fall Short in AI-Generated Video Detection?

GenVideoLens:在AI生成视频检测中LVLMs的局限性

Yueying Zou, Pei Pei Li, Zekun Li, Xinyu Guo, Xing Cui, Huaibo Huang, Ran He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Center for Research on Intelligent Perception and Computing, NLPR, Institute of Automation, Chinese Academy of Sciences(智能感知与计算中心、国家智能感知与信息处理实验室、中国科学院自动化研究所)

专题命中 推理评测 :reasoning(abstract)

AI总结 GenVideoLens通过细粒度评估揭示LVLM在AI生成视频检测中的能力差距,发现其在光学一致性、物理交互和时间因果推理上表现不足,且模型性能在不同维度上差异显著。

Comments ECCV 2026 submission. 14 pages, 6 figures, 4 tables. Supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18753 2026-03-20 cs.CV 50%

CrossHOI-Bench: A Unified Benchmark for HOI Evaluation across Vision-Language Models and HOI-Specific Methods

CrossHOI-Bench: 一个统一的HOI评估基准,涵盖视觉-语言模型和特定HOI方法

Qinqian Lei, Bo Wang, Robby T. Tan

机构 * National University of Singapore(新加坡国立大学) University of Mississippi(密西西比大学) ASUS Intelligent Cloud Services(ASUS智能云服务)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出CrossHOI-Bench,通过显式正例和 curated 负例,统一评估VLM和HOI方法,揭示两者在多任务和细粒度交互上的互补优劣。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18516 2026-03-20 cs.IR 50%

Total Recall QA: A Verifiable Evaluation Suite for Deep Research Agents

全面回忆问答:深度研究代理的可验证评估套件

Mahta Rafiee, Heydar Soudani, Zahra Abbasiantaeb, Mohammad Aliannejadi, Faegheh Hasibi, Hamed Zamani

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出Total Recall QA评估框架,通过结构化知识库和文本语料构建精准查询,建立基于Wikidata-Wikipedia和合成电商知识库的基准测试,评估深度研究代理的检索与生成能力。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02009 2026-03-20 cs.DC 50%

STRATUS: A Multi-agent System for Autonomous Reliability Engineering of Modern Clouds

STRATUS:一种用于现代云服务自主可靠性工程的多智能体系统

Yinfang Chen, Jiaqi Pan, Jackson Clark, Yiming Su, Noah Zheutlin, Bhavya Bhavya, Rohan Arora, Yu Deng, Saurabh Jha, Tianyin Xu

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出STRATUS,一种基于LLM的多智能体系统,用于实现云服务的自主SRE。系统通过状态机组织多个专用智能体,提升故障检测、诊断和缓解的效率,并通过Transactional No-Regression规范提高自主故障缓解的成功率。

Comments 10 pages for main text

详情

展开后加载摘要…

URL PDF HTML 收藏