arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-01 至 2026-05-01 共收录 24 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 24 篇

2506.02515 2026-05-01 cs.CL cs.AI cs.LG 89%

FinChain: A Symbolic Benchmark for Verifiable Chain-of-Thought Financial Reasoning

FinChain:可验证链式思维金融推理的符号基准

Zhuohan Xie, Daniil Orel, Rushil Thareja, Dhruv Sahnan, Hachem Madmoun, Fan Zhang, Debopriyo Banerjee, Georgi Georgiev, Xueqing Peng, Lingfei Qian, Jimin Huang, Jinyan Su, Aaryamonvikram Singh, Rui Xing, Rania Elbadry, Chen Xu, Haonan Li, Fajri Koto, Ivan Koychev, Tanmoy Chakraborty, Yuxia Wang, Salem Lahlou, Veselin Stoyanov, Sophia Ananiadou, Preslav Nakov

机构 * MBZUAI Syllogia The University of Tokyo(东京大学) The Fin AI(Fin AI) Cornell University(康奈尔大学) The University of Melbourne(墨尔本大学) IIT Delhi(德里理工学院) The University of Manchester(曼彻斯特大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FinChain通过符号模板和可执行代码实现可验证的金融链式推理,评估26种LLM发现其在符号金融推理中存在明显缺陷,领域适应和数学增强的微调模型能显著缩小差距。

Comments 24 pages, includes 12 figures and 9 tables; introduces the FinChain benchmark and ChainEval metric

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26288 2026-05-01 cs.CV cs.AI 88%

CheXthought: A global multimodal dataset of clinical chain-of-thought reasoning and visual attention for chest X-ray interpretation

CheXthought:一个包含临床推理链和视觉注意力的全球多模态数据集,用于胸部X光解读

Sonali Sharma, Jin Long, George Shih, Sarah Eid, Christian Bluethgen, Francine L. Jacobson, Emily B. Tsai, Global Radiology Consortium, Ahmed M. Alaa, Curtis P. Langlotz

机构 * Center for Artificial Intelligence in Medicine and Imaging(医学与影像人工智能中心) Department of Radiology(放射科) Department of Pediatrics(儿科) Department of Radiology, Weill Cornell Medicine(韦氏 Cornell 医学院放射科) Department of Radiology, Brigham and Women’s Hospital(布里奇妇产科医院放射科) University of California, Berkeley(加州大学伯克利分校) University of California, San Francisco(加州大学旧金山分校) Department of Biomedical Data Science(生物医学数据科学部)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.AI

AI总结 CheXthought数据集通过501名放射科医生的50312例多读X光片,提供了103592条推理链和6609082条同步视觉注意力标注,展示了临床推理模式,并在事实准确性、空间定位、病理分类、视觉忠实度、时间推理和不确定性沟通等方面提升了视觉语言模型性能。

Comments 51 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28011 2026-05-01 cs.CV 78%

Echo-α: Large Agentic Multimodal Reasoning Model for Ultrasound Interpretation

Echo-α:用于超声解读的大型代理多模态推理模型

Jing Zhang, Wentao Jiang, Tao Huang, Zhiwei Wang, Jianxin Liu, Jian Chen, Ping Ye, Gang Wang, Zengmao Wang, Bo Du, Dacheng Tao

机构 * MiliLab(Mili实验室)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 Echo-α结合了精确的病变定位和整体临床推理,通过九任务监督课程和强化学习提升超声解读的准确性和可解释性。

Comments 12 pages, 4 figures. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27763 2026-05-01 cs.AI 70%

Intent2Tx: Benchmarking LLMs for Translating Natural Language Intents into Ethereum Transactions

Intent2Tx:评估大语言模型将自然语言意图转换为以太坊交易的基准测试

Zhuoran Pan, Yue Li, Zhi Guan, Jianbin Hu, Zhong Chen

机构 * Taiyuan University of Technology(太原科技大学) Peking University(北京大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出Intent2Tx基准测试,基于真实以太坊链上数据,评估大语言模型将自然语言意图转换为功能正确、状态依赖的链上交易的能力,发现现有模型在多步规划和泛化能力上存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22615 2026-05-01 cs.RO 67%

GazeVLA: Learning Human Intention for Robotic Manipulation

GazeVLA:学习人类意图以促进机器人操作

Chengyang Li, Kaiyi Xiong, Yuan Xu, Lei Qian, Yizhou Wang, Wentao Zhu

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology, Ningbo(宁波东部科技研究院) Peking University(北京大学) ShanghaiTech University(上海科技大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出GazeVLA框架,通过学习人类意图弥合人机之间的固有差距,提升机器人操作性能。

Comments Project page: https://gazevla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27981 2026-05-01 cs.LG cs.AI 62%

ITS-Mina: A Harris Hawks Optimization-Based All-MLP Framework with Iterative Refinement and External Attention for Multivariate Time Series Forecasting

ITS-Mina:一种基于Harris Hawks优化的全MLP框架,结合迭代细化和外部注意力机制用于多变量时间序列预测

Pourya Zamanvaziri, Amirhossein Sadr, Aida Pakniyat, Dara Rahmati

机构 * Department of Computer Science and Engineering, Shahid Beheshti University, Iran(伊朗谢赫·贝赫什提大学计算机科学与工程系) School of Computer Science, Institute for Research in Fundamental Sciences (IPM), Iran(伊朗基础科学研究院(IPM)计算机科学学院)

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ITS-Mina,一种全MLP框架,通过迭代细化机制、外部注意力模块和Harris Hawks优化算法,实现多变量时间序列预测的高精度与低计算成本。

Comments 19 pages, 2 figures, 3 tables, 4 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27776 2026-05-01 cs.AI cs.CL 62%

WindowsWorld: A Process-Centric Benchmark of Autonomous GUI Agents in Professional Cross-Application Environments

WindowsWorld: 一个以进程为中心的自主GUI代理跨应用专业环境基准测试

Jinchao Li, Yunxin Li, Chenrui Zhao, Zhenran Xu, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出WindowsWorld基准测试,用于评估自主GUI代理在跨应用复杂任务中的能力,发现代理在多应用任务中表现不佳,执行效率低,需进一步改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10702 2026-05-01 cs.CL cs.AI cs.IR 62%

Grounding Agent Memory in Contextual Intent

在上下文意图中 grounding 代理记忆

Ruozhen Yang, Yucheng Jiang, Yueqi Jiang, Priyanka Kargupta, Yunyi Zhang, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 STITCH通过上下文意图索引提升长周期交互的记忆检索能力,有效减少歧义和干扰,实现在动态目标轨迹中的高效检索。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07180 2026-05-01 cs.CL cs.AI cs.CV 62%

Flattery in Motion: Benchmarking and Analyzing Sycophancy in Video-LLMs

视频中的奉承:视频大语言模型中奉承行为的基准测试与分析

Wenrui Zhou, Mohamed Hendy, Shu Yang, Qingsong Yang, Zikun Guo, Yuyu Luo, Lijie Hu, Di Wang

机构 * Provable Responsible AI and Data Analytics (PRADA) Lab(可证负责任人工智能与数据 analytics 实验室) King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹科学与技术大学) HKUST(香港科技大学) MBZUAI(穆罕默德·本·拉希德人工智能研究所) University of Science and Technology of China(中国科学技术大学) Kyungpook National University(庆尚国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VISE基准,用于评估视频大语言模型在面对误导性输入时的奉承行为,通过多类型分析和两种无训练缓解策略提升模型可靠性。

Comments 27 Pages, Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17056 2026-05-01 cs.CL cs.AI 62%

From Test-taking to Cognitive Scaffolding: A Pedagogical Diagnostic Benchmark for LLMs on English Standardized Tests

从应试到认知支架:一种面向LLM的教育诊断基准测试标准测试

Luoxi Tang, Tharunya Sundar, Yuqiao Meng, Shuai Yang, Ankita Patra, Lakshmi Manohar Chippada, Jiqian Zhao, Yi Li, Weicheng Ma, Zhaohan Xi

机构 * Binghamton University(宾夕法尼亚州立大学比灵顿分校) BlossomsAI(BlossomsAI公司) Dartmouth College(达特茅斯学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种教育诊断基准,通过认知框架模拟英语标准化测试问题解决过程,展示ESTBook基准测试在识别认知轨迹和改进教学推理中的实用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28178 2026-05-01 cs.AI 57%

LLM as Clinical Graph Structure Refiner: Enhancing Representation Learning in EEG Seizure Diagnosis

基于LLM的临床图结构细化:增强EEG癫痫诊断中的表示学习

Lincan Li, Zheng Chen, Yushun Dong

机构 * Department of Computer Science, Florida State University(佛罗里达州立大学计算机科学系) SANKEN, The University of Osaka(大阪大学SANKEN)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型对图结构进行细化,以提升EEG信号在癫痫诊断中的表示学习效果,通过两阶段框架去除冗余边,提高诊断准确率和图结构意义。

Comments This paper is accepted by the 35th International Joint Conference on Artificial Intelligence (IJCAI-ECAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28039 2026-05-01 cs.AI 57%

SpecVQA: A Benchmark for Spectral Understanding and Visual Question Answering in Scientific Images

SpecVQA:一种用于科学图像光谱理解和视觉问答的基准测试

Jialu Shen, Han Lyu, Suyang Zhong, Hanzheng Li, Haoyi Tao, Nan Wang, Changhong Chen, Xi Fang

机构 * DP Technology(DP技术)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 SpecVQA通过7种典型光谱类型和专家标注的问答对,评估多模态模型在科学光谱理解中的能力,提出光谱数据采样与插值重建方法,提升模型在科学光谱理解中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19630 2026-05-01 cs.CL 57%

Real-World Doctor Agent with Proactive Consultation through Multi-Agent Reinforcement Learning

现实世界中的医生代理通过多智能体强化学习实现主动咨询

Yichun Feng, Jiawei Wang, Lu Zhou, Yikai Zheng, Zhen Lei, Yixue Li

机构 * Guangzhou National Laboratory(广州国家实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出DoctorAgent-RL框架,通过多智能体强化学习提升医疗咨询的动态决策能力,实现70%的准确诊断匹配率,验证了其在现实中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27151 2026-05-01 cs.AI 57%

Step-level Optimization for Efficient Computer-use Agents

面向高效计算机使用代理的步骤级优化

Jinbiao Wei, Kangqi Ni, Yilun Zhao, Guo Gan, Arman Cohan

机构 * Yale NLP Lab(耶鲁大学自然语言处理实验室) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种事件驱动的步骤级级联框架,通过动态分配计算资源提升计算机使用代理的效率,减少冗余计算并增强任务完成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26986 2026-05-01 cs.CL 57%

BatteryPass-12K: The First Dataset for the Novel Digital Battery Passport Conformance Task

BatteryPass-12K:首个数字电池护照符合性任务数据集

Tosin Adewumi, Martin Karlsson, Lama Alkhaled, Marcus Liwicki

机构 * Machine Learning Group, EISLAB(机器学习组,EISLAB) Research Center for Advanced Battery Technology(先进电池技术研究中心) Luleå University of Technology(吕勒奥理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文介绍了首个数字电池护照符合性任务数据集BatteryPass-12K,评估了22种语言模型在零样本推理中的表现,发现思考模型性能最佳,少样本示例显著提升性能,且参数规模扩大并不必然提升性能。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20577 2026-05-01 cs.SE cs.LG 57%

Evaluating Assurance Cases as Text-Attributed Graphs for Structure and Provenance Analysis

评估作为文本属性图的保证案例用于结构和来源分析

Fariz Ikhwantri, Dusica Marijan

机构 * Simula Research Laboratory(Simula研究实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出基于图诊断框架分析保证案例的结构和来源,通过链接预测和图分类检测偏见,实验表明GNN在链接预测和来源检测中表现优异。

Comments 10 pages, 4 figures, 8 tables. Accepted to EASE 2026 AI Models / Data track, Glasgow, United Kingdom Fix the captions of tables 7 and 8

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09408 2026-05-01 cs.AI 57%

HiL-Bench (Human-in-Loop Benchmark): Do Agents Know When to Ask for Help?

HiL-Bench (Human-in-Loop Benchmark): 代理何时该请求帮助?

Mohamed Elfeki, Tu Trinh, Kelvin Luu, Guangze Luo, Nathan Hunt, Ernesto Montoya, Nandan Marwaha, Yannis He, Charles Wang, Fernando Crabedo, Alessa Castilo, Bing Liu

专题命中 推理评测 :self-correction(abstract);分类 cs.AI

AI总结 HiL-Bench通过评估代理在任务中何时请求帮助的能力,揭示了当前基准测试的不足。核心指标Ask-F1衡量代理在请求与猜测之间的平衡,证明判断力可通过强化学习提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00095 2026-05-01 cs.CV cs.AI cs.CY 57%

EDU-CIRCUIT-HW: Evaluating Multimodal Large Language Models on Real-World University-Level STEM Student Handwritten Solutions

EDU-CIRCUIT-HW:评估多模态大语言模型在真实世界大学级STEM学生手写解答中的表现

Weiyu Sun, Liangliang Chen, Yongnuo Cai, Huiru Xie, Yi Zeng, Ying Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院) Virginia Tech(弗吉尼亚理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出EDU-CIRCUIT-HW数据集,用于评估多模态大语言模型在处理包含数学公式、图表和文本推理的大学STEM学生手写解答中的性能,揭示模型在自动评分中的可靠性问题,并提出通过纠正识别错误提升AI评分系统鲁棒性的方法。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026. Project Website: https://gt-learning-innovation.github.io/CIRCUIT_EDU_HW_ACL GitHub and Dataset: https://gt-learning-innovation.github.io/CIRCUIT_EDU_HW_ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14988 2026-05-01 cs.CV 50%

Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation

在细粒度图像任务上评估大型视觉-语言模型:全面评估

Hong-Tao Yu, Yuxin Peng, Serge Belongie, Xiu-Shen Wei

机构 * School of Computer Science and Engineering, School of Intelligence Science and Engineering and Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Southeast University, China(东南大学计算机科学与工程学院、智能科学与工程学院及新一代人工智能技术及其跨学科应用关键实验室,中国) Wangxuan Institute of Computer Technology, Peking University, China(北京大学王轩计算机技术研究所,中国) University of Copenhagen, Denmark(丹麦哥本哈根大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出FG-BMK基准,通过101万问题和33万张图像评估LVLMs的语义识别与细粒度特征表示能力,揭示训练范式、模态对齐等对性能的影响,为未来模型设计提供指导。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27654 2026-05-01 cs.CV 50%

MSR:Hybrid Field Modeling for CT-MRI Rigid-Deformable Registration of the Cervical Spine with an Annotated Dataset

MSR:用于带有标注数据集的颈椎脊柱CT-MRI刚-变形配准的混合场建模

Bohai Zhang, Wenjie Chen, Mu Li, Kaixing Long, Xing Shen, Xinqiang Yao, Jincheng Yang, Jianting Chen, Wei Yang, Qianjin Feng, Lei Cao

机构 * School of Biomedical Engineering, Southern Medical University, Guangzhou, 510515, China.(南方医科大学生物医学工程学院) Guangdong Provincial Key Laboratory of Medical Image Processing, Guangzhou, 510515, China.(广东省医学图像处理重点实验室) Guangdong Province Engineering Laboratory for Medical Imaging(广东省医学影像与诊断技术工程实验室) Information Center, Nanfang Hospital, Southern Medical University, Guangzhou, 510515, China.(南方医科大学南华医院信息中心) Division of Spine Surgery, Department of Orthopaedics, Nanfang hospital, Southern Medical University, Guangzhou, Guangdong, 510515, China.(南方医科大学南华医院骨科脊柱外科)

专题命中 推理评测 :planning(abstract)

AI总结 本文提出MSR框架,通过混合刚-变形配准方法提升颈椎脊柱CT-MRI配准精度,解决复杂结构配准难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27582 2026-05-01 cs.CV 50%

Assessing Pancreatic Ductal Adenocarcinoma Vascular Invasion: the PDACVI Benchmark

评估胰腺导管腺癌血管侵袭:PDACVI基准

M. Riera-Marín, O. K. Sikha, J. Rodríguez-Comas, M. S. May, T. Kirscher, X. Coubez, P. Meyer, S. Faisan, Z. Pan, X. Zhou, X. Liang, C. Hémon, V. Boussot, J. -L. Dillenseger, J. -C. Nunes, K. -C. Kahl, C. Lüth, J. Traub, P. -H. Conze, M. M. Duh, A. Aubanell, R. de Figueiredo Cardoso, S. Egger-Hackenschmidt, J. García-López, M. A. González-Ballester, A. Galdran

机构 * Sycai Technologies SL, Scientific Technical Department, Barcelona, Spain Universit\" a tsklinikum Erlangen, Department of Radiology of the Uniklinikum Erlangen (UKER), Erlangen, Germany University Hospital Erlangen, Imaging Science Institute, Erlangen, Germany ICUBE Laboratory, CNRS UMR-7357, University of Strasbourg, Strasbourg, France Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China University of Chinese Academy of Sciences, Beijing, China German Cancer Research Center (DKFZ), Medical Image Computing (E230), Heidelberg, Germany Hospital de Matar\' o , Matar\' o , Spain Hospital de Sant Pau i la Santa Creu, Diagnostic Imaging Department, Barcelona, Spain Institut de Recerca Sant Pau - CERCA, Advanced Medical Imaging, Artificial Intelligence Imaging-Guided Therapy Research Group, Barcelona, Spain TECNALIA, Basque Research

专题命中 推理评测 :planning(abstract)

AI总结 本文提出PDACVI基准,通过密集标注数据集评估胰腺癌血管侵袭,揭示传统体积重叠指标的局限性,强调概率模型在术前决策中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27366 2026-05-01 cs.CV 50%

Judge, Then Drive: A Critic-Centric Vision Language Action Framework for Autonomous Driving

评判,然后驾驶:一种以评判为中心的视觉语言动作框架用于自动驾驶

Lijin Yang, Jianing Huang, Zhongzhan Huang, Shu Liu, Hao Yang

机构 * Bosch Research(博世研究院)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出CriticVLA框架,通过多模态评估和单步优化提升自动驾驶决策质量,实验显示其在复杂场景中性能显著优于现有方法。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27261 2026-05-01 cs.DB 50%

SynSQL: Synthesizing Relational Databases for Robust Evaluation of Text-to-SQL Systems

SynSQL: 为文本到SQL系统的稳健评估合成关系数据库

Mohammadamin Habibollah, Davood Rafiei

专题命中 推理评测 :reasoning(abstract)

AI总结 SynSQL通过合成语义一致的关系数据库,揭示了文本到SQL系统在固定基准数据库外的性能下降,为研究LLM的结构化数据合成能力提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27001 2026-05-01 cs.CR cs.SE 50%

An Empirical Security Evaluation of LLM-Generated Cryptographic Rust Code

对LLM生成的密码学Rust代码的实证安全评估

Mohamed Elsayed, Kenneth Fulton, Jeong Yang

专题命中 推理评测 :chain-of-thought(abstract)

AI总结 本文评估了三种LLM生成的加密Rust代码的安全性,发现通用工具不足,提示策略对结果影响显著,且存在nonce重用等系统性问题。

Comments 10 pages, 2 figures , EASE 2026-The 6th International Workshop on Software Security Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏