arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-09 至 2026-03-09 共收录 77 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 25 篇

2603.06422 2026-03-09 cs.CR 50%

Before You Hand Over the Wheel: Evaluating LLMs for Security Incident Analysis

在交出轮子之前:评估LLMs用于安全事件分析

Sourov Jajodia, Madeena Sultana, Suryadipta Majumdar, Adrian Taylor, Grant Vandenberghe

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出SIABENCH框架,通过构建首个涵盖安全事件分析两大类任务的数据集,并实现自主执行SIA任务的代理,对11种LLM进行基准测试,以评估其在动态安全事件分析中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00092 2026-03-09 cs.CV 50%

Spatial4D-Bench: A Versatile 4D Spatial Intelligence Benchmark

Spatial4D-Bench: 一种多功能的4D空间智能基准

Pan Wang, Yang Liu, Guile Wu, Eduardo R. Corral-Soto, Chengjie Huang, Binbin Xu, Dongfeng Bai, Xu Yan, Yuan Ren, Xingxin Chen, Yizhe Wu, Tao Huang, Wenjun Wan, Xin Wu, Pei Zhou, Xuyang Dai, Kangbo Lv, Hongbo Zhang, Yosef Fried, Aixue Ye, Bailan Feng, Zhenyu Chen, Zhen Li, Yingcong Chen, Yiyi Liao, Bingbing Liu

机构 * Pan Wang Fundation Model Dept, Huawei(王潘 基础模型部门,华为) Yang Liu Noah’s Ark Lab, Huawei(刘阳 神秘 Ark 实验室,华为) Guile Wu Noah’s Ark Lab, Huawei(吴古力 神秘 Ark 实验室,华为) Eduardo R. Corral-Soto Noah’s Ark Lab, Huawei(埃杜阿多·R·科拉尔-索托 神秘 Ark 实验室,华为) Chengjie Huang Noah’s Ark Lab, Huawei(黄成杰 神秘 Ark 实验室,华为) Binbin Xu Noah’s Ark Lab, Huawei(徐彬彬 神秘 Ark 实验室,华为) Dongfeng Bai Noah’s Ark Lab, Huawei(白东风 神秘 Ark 实验室,华为) Xu Yan Fundation Model Dept, Huawei(颜绪 基础模型部门,华为) Yuan Ren Noah’s Ark Lab, Huawei(袁仁 神秘 Ark 实验室,华为) Xingxin Chen Noah’s Ark Lab, Huawei(陈星心 神秘 Ark 实验室,华为) Yizhe Wu Fundation Model Dept, Huawei(吴义哲 基础模型部门,华为) Tao Huang Fundation Model Dept, Huawei(黄涛 基础模型部门,华为) Wenjun Wan Central Media Technology Institute, Huawei(万文军 中央媒体技术研究院,华为) Xin Wu Central Media Technology Institute, Huawei(吴新 中央媒体技术研究院,华为) Pei Zhou Central Media Technology Institute, Huawei(周佩 中央媒体技术研究院,华为) Xuyang Dai Central Media Technology Institute, Huawei(戴绪阳 中央媒体技术研究院,华为) Kangbo Lv Fundation Model Dept, Huawei(吕康博 基础模型部门,华为) Hongbo Zhang Fundation Model Dept, Huawei(张宏波 基础模型部门,华为) Yosef Fried Fundation Model Dept, Huawei(弗里德·约瑟夫 基础模型部门,华为) Aixue Ye Fundation Model Dept, Huawei(叶爱雪 基础模型部门,华为) Bailan Feng Fundation Model Dept, Huawei(冯 Bailan 基础模型部门,华为) Zhenyu Chen Fundation Model Dept, Huawei(陈振宇 基础模型部门,华为) Zhen Li CUHK-Shenzhen(李振 中山大学深圳校区) Yingcong Chen HKUST-GZ(陈应聪 香港科技大学-广东) Yiyi Liao Zhejiang University(廖亿毅 浙江大学) Bingbing Liu Fundation Model Dept, Huawei(刘冰冰 基础模型部门,华为)

专题命中 推理评测 :reasoning(abstract)

AI总结 Spatial4D-Bench提出了一种多功能的4D空间智能基准,用于评估多模态大语言模型的4D空间推理能力,并揭示其在路线规划、动作识别等任务中的局限性。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06366 2026-03-09 cs.CV 50%

OralGPT-Plus: Learning to Use Visual Tools via Reinforcement Learning for Panoramic X-ray Analysis

OralGPT-Plus:通过强化学习学习使用视觉工具进行全景X射线分析

Yuxuan Fan, Jing Hao, Hong Chen, Jiahao Bao, Yihua Shao, Yuci Liang, Kuo Feng Hung, Hao Tang

机构 * The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学) Faculty of Dentistry, The University of Hong Kong(香港大学牙医学院) School of Computer Science, Peking University(北京大学计算机学院) Shanghai Jiao Tong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 OralGPT-Plus通过强化学习实现全景X射线分析中的交互式对称推理,提升诊断可靠性。

Comments 34 pages, 24 figures, conference

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06065 2026-03-09 cs.IR 50%

ChatShopBuddy: Towards Reliable Conversational Shopping Agents via Reinforcement Learning

ChatShopBuddy:通过强化学习实现可靠的对话购物代理

Yiruo Cheng, Kelong Mao, Tianhao Li, Jiejun Tan, Ji-Rong Wen, Zhicheng Dou

专题命中 推理评测 :reasoning(abstract)

AI总结 ChatShopBuddy通过强化学习优化对话购物代理,结合分层奖励建模和动态对比策略优化,提升购物代理的稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05646 2026-03-09 cs.PL 50%

Evaluating LLMs in the Context of a Functional Programming Course: A Comprehensive Study

在函数式编程课程背景下评估LLM:一项全面研究

Yihan Zhang, Brigitte Pientka, Xujie Si

专题命中 推理评测 :reasoning(abstract)

AI总结 本文评估了LLM在函数式编程课程中的有效性,通过构建三个基准测试,发现LLM在纠正语法和类型错误及回答基础概念问题方面表现良好,但解决低资源环境下家庭作业问题的能力较弱。

Journal ref The Art, Science, and Engineering of Programming, 2026, Vol. 11, Issue 1, Article 5

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05515 2026-03-09 cs.HC 50%

Enhancing Tool Calling in LLMs with the International Tool Calling Dataset

通过国际工具调用数据集增强大语言模型的工具调用能力

Zuoyu Zhang, Yancheng Zhu

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出国际工具调用数据集ITC,用于提升大语言模型在多语言、多地区工具调用场景中的性能与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15481 2026-03-09 cs.CV 50%

FunnyNodules: A Customizable Medical Dataset Tailored for Evaluating Explainable AI

FunnyNodules: 一种可定制的医学数据集,用于评估可解释AI

Luisa Gallée, Yiheng Xiong, Meinrad Beer, Michael Götz

机构 * Ulm University Medical Center(乌尔姆大学医学中心) XAIRAD - Cooperation for Artificial Intelligence in Experimental Radiology(XAIRAD——实验放射学人工智能合作) Department of Diagnostic and Interventional Radiology(诊断与介入放射学系)

专题命中 推理评测 :reasoning(abstract)

AI总结 FunnyNodules是一种可定制的医学数据集,用于评估可解释AI模型的属性推理能力。

Comments accepted at Medical Imaging with Deep Learning (MIDL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15625 2026-03-09 cs.CV 50%

EarthScape: A Multimodal Dataset for Surficial Geologic Mapping and Earth Surface Analysis

EarthScape:一种用于地表地质制图和地表分析的多模态数据集

Matthew Massey, Nusrat Munia, Abdullah-Al-Zubaer Imran

机构 * Kentucky Geological Survey(肯塔基地质调查局) University of Kentucky(肯塔基大学) Department of Computer Science(计算机科学系)

专题命中 推理评测 :planning(abstract)

AI总结 EarthScape是一种用于地表地质制图和地表分析的多模态数据集,通过整合多种数据源提供统一的基准测试平台,提升多模态融合和领域适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 9 篇

2603.02872 2026-03-09 cs.CV 89%

Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models

Think-as-You-See: 为大视觉-语言模型设计的流式推理链式思维

Jialiang Zhang, Junlong Tong, Junyan Lin, Hao Wu, Yirong Sun, Yunpu Ma, Xiaoyu Shen

机构 * Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究院,东技术学院) Ocean University of China(中国海洋大学) Shanghai Jiao Tong University(上海交通大学) The Hong Kong Polytechnic University(香港理工大学) Munich Center for Machine Learning, LMU Munich(慕尼黑机器学习中心,慕尼黑大学) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract)

AI总结 TaYS为大视觉-语言模型设计了流式推理链式思维框架,通过并行化生成、流约束训练和解耦的KV缓存,提升视频理解的效率和响应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13238 2026-03-09 cs.CV 78%

DianJin-OCR-R1: Enhancing OCR Capabilities via a Reasoning-and-Tool Interleaved Vision-Language Model

DianJin-OCR-R1: 通过推理与工具交替的视觉语言模型增强OCR能力

Qian Chen, Xianyin Zhang, Lifan Guo, Feng Chen, Chi Zhang

机构 * Qwen DianJin Team, Alibaba Cloud Computing(文心一言团队,阿里云计算)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 DianJin-OCR-R1通过推理与工具交替的视觉语言模型框架,提升OCR识别的准确性和上下文理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05696 2026-03-09 cs.CE cs.AI cs.CL cs.NA math.NA 76%

Autonomous Algorithm Discovery for Ptychography via Evolutionary LLM Reasoning

基于进化大语言模型推理的自主算法发现用于ptychography

Xiangyu Yin, Ming Du, Junjing Deng, Zhi Yang, Yimo Han, Yi Jiang

机构 * Advanced Photon Source, Argonne National Laboratory, Lemont, IL, USA(阿贡国家实验室先进光子源) Department of Materials Science and NanoEngineering, Rice University, Houston, TX, USA(材料科学与纳米工程系,德克萨斯大学里士满分校)

专题命中 其他推理 :reasoning(title);分类 cs.CL、cs.AI

AI总结 Ptychi-Evolve通过进化大语言模型推理,自主发现并优化正则化算法,提升ptychography图像重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06123 2026-03-09 cs.CL cs.LG 62%

Diffusion Language Models Are Natively Length-Aware

扩散语言模型天生具有长度感知能力

Vittorio Rossi, Giacomo Cirò, Davide Beltrame, Luca Gandolfi, Paul Röttger, Dirk Hovy

机构 * Department of Computing Sciences, Bocconi University, Milan, Italy(计算机科学系,博科尼大学,米兰,意大利)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过动态裁剪上下文窗口减少扩散语言模型生成步骤,从而提升效率并减少计算消耗,在多个基准测试中实现显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05517 2026-03-09 cs.LG cs.AI cs.CR cs.SE 62%

Traversal-as-Policy: Log-Distilled Gated Behavior Trees as Externalized, Verifiable Policies for Safe, Robust, and Efficient Agents

路径作为策略:基于日志提炼的门控行为树作为可验证的外部化策略,用于安全、鲁棒且高效的智能体

Peiran Li, Jiashuo Sun, Fangzhou Lin, Shuo Xing, Tianfu Fu, Suofei Feng, Chaoqun Ni, Zhengzhong Tu

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Worcester Polytechnic Institute(沃斯特理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 通过日志提炼生成门控行为树作为外部化策略,提升智能体在安全、鲁棒性和效率方面的表现。

Comments 30 pages, 1 figurres, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06002 2026-03-09 cs.CV cs.AI 57%

Demystifying KAN for Vision Tasks: The RepKAN Approach

揭开KAN在视觉任务中的神秘面纱:RepKAN方法

Minjong Cheon

机构 * Sejong University(世宗大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 RepKAN通过结合CNN和KAN的优势,实现遥感图像分类的可解释性提升,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05778 2026-03-09 cs.CL 57%

Tutor Move Taxonomy: A Theory-Aligned Framework for Analyzing Instructional Moves in Tutoring

辅导动作分类:一种与理论一致的框架,用于分析辅导中的教学动作

Zhuqian Zhou, Kirk Vanacore, Tamisha Thompson, Jennifer St John, Rene Kizilcec

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种辅导动作分类法,用于系统分析辅导中的教学动作,通过混合演绎归纳方法构建分类框架,涵盖四个类别并支持AI标注和学习成果分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13082 2026-03-09 cs.AI 57%

Discerning What Matters: A Multi-Dimensional Assessment of Moral Competence in LLMs

辨别重要之物:对大语言模型道德能力的多维评估

Daniel Kilov, Caroline Hendy, Secil Yanik Guyot, Aaron J. Snoswell, Seth Lazar

机构 * Machine Intelligence and Normative Theory Lab, Australian National University, Acton, ACT 2601, Australia(澳大利亚国立大学机器智能与规范理论实验室) Digital Media Research Centre GenAI Lab, Queensland University of Technology, Kelvin Grove, QLD 4012, Australia(昆士兰科技大学数字媒体研究中心GenAI实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种多维评估方法,用于评估大语言模型的道德能力,发现现有评估方法存在不足,通过实验揭示LLMs在特定情境下的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18847 2026-03-09 quant-ph physics.comp-ph 50%

El Agente Cuantico: Automating quantum simulations

量子代理:自动化量子模拟

Ignacio Gustin, Luis Mantilla Calderón, Juan B. Pérez-Sánchez, Jérôme F. Gonthier, Yuma Nakamura, Karthik Panicker, Manav Ramprasad, Zijian Zhang, Yunheng Zou, Varinia Bernales, Alán Aspuru-Guzik

专题命中 其他推理 :reasoning(abstract)

AI总结 El Agente Cuántico通过自然语言接口自动化量子模拟,整合多种模拟范式,提升量子模拟的可扩展性和自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏