arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-05 至 2026-05-05 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 18 篇

2604.05134 2026-05-05 cs.LG cs.AI 82%

How Reasoning Evolves from Post-Training Data: An Empirical Study Using Chess

推理如何从训练数据中演变:使用国际象棋的实证研究

Lucas Dionisopoulos, Nicklas Majamaki, Prithviraj Ammanabrolu

机构 * Department of Computer Science and Engineering, University of California San Diego, San Diego, United States(计算机科学与工程系,加州大学圣地亚哥分校,圣地亚哥,美国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究语言模型推理从监督微调到强化学习的演变,发现直接预测最佳走法的微调能提升性能,但强化学习阶段导致不一致推理,而多步轨迹训练则能获得更稳定的推理。

Comments Accepted at ICML 2026. An earlier version appeared at the NeurIPS 2025 Foundations of Reasoning in Language Models (FoRLM) Workshop (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09883 2026-05-05 cs.CL cs.LG 81%

DELTA: Dynamic Layer-Aware Token Attention for Efficient Long-Context Reasoning

DELTA: 动态层感知令牌注意力机制用于高效的长上下文推理

Hossein Entezari Zarch, Lei Gao, Chaoyi Jiang, Murali Annavaram

机构 * University of Southern California(南加州大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 DELTA通过动态层感知令牌注意力机制提升长上下文推理效率,减少计算成本而不牺牲准确性,在AIME和GPQA-Diamond等基准上表现优异。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07731 2026-05-05 cs.AI cs.CL 81%

oMeBench: Towards Robust Benchmarking of LLMs in Organic Mechanism Elucidation and Reasoning

oMeBench:面向有机机制阐明和推理的鲁棒基准测试

Ruiling Xu, Yifan Zhang, Qingyun Wang, Carl Edwards, Heng Ji

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出oMeBench,首个大规模专家 curated 的有机机制推理基准,包含10000+注释步骤,评估LLM在化学一致性与多步推理能力,发现通过提示策略和领域微调可使性能提升50%。

Comments We need adjust some authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01048 2026-05-05 cs.CL cs.LG 73%

Compared to What? Baselines and Metrics for Counterfactual Prompting

与什么相比?反事实提示的基线和度量标准

Zihao Yang, Mosh Levy, Yoav Goldberg, Byron C. Wallace

机构 * Northeastern University(东北大学) Bar-Ilan University(巴伊兰大学) Allen Institute for AI(人工智能研究所)

专题命中 推理评测 :CoT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文探讨了反事实提示中基线和度量标准的重要性,指出单纯改变文本因素无法准确评估模型敏感性,提出通过统计检验比较干预差异与改写影响的框架,发现模型对患者性别等的敏感性在考虑一般模型敏感性后显著降低。

Comments 24 pages, 10 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00907 2026-05-05 cs.CV cs.AI cs.LG 73%

TRIP-Evaluate: An Open Multimodal Benchmark for Evaluating Large Models in Transportation

TRIP-Evaluate: 一个用于评估交通领域大模型的开放多模态基准

Han Gong, Zhen Zhou, Yunyang Shi, Yan Tan, Jinbiao Huo, Qi Hong, Zhiyuan Liu

机构 * School of Transportation(交通学院) Southeast University(东南大学) School of Artificial Intelligence and Computer Science(人工智能与计算机科学学院) Jiangnan University(江南大学) Department of Civil and Environmental Engineering(土木与环境工程系) Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 TRIP-Evaluate是首个开放多模态交通评估基准,通过837项任务覆盖车辆、交通管理、旅行者和规划设计功能,提供能力、模态和难度标签,支持跨模态诊断,揭示大模型在多步工程计算、规则约束推理和多模态场景理解方面的不足。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01338 2026-05-05 cs.AI 70%

DiagramNet: An End-to-End Recognition Framework and Dataset for Non-Standard System-Level Diagrams

DiagramNet: 一种面向非标准系统级图表的端到端识别框架和数据集

Jincheng Lou, Ruohan Xu, Jiapeng Li, Junyin Pi, Runzhe Tao, Weijian Fan, Xiao Tan, Guojie Luo, Yibo Lin

机构 * School of IC, Peking University, Beijing, China(北京大学信息科学技术学院) College of Artificial Intelligence, Xi'an Jiaotong University, Xi'an, China(西安交通大学人工智能学院) Department of Precision Instruments, Tsinghua University, Beijing, China(清华大学精密仪器系) School of Software and Microelectronics, Peking University, Beijing, China(北京大学软件与微电子学院) School of Computer Science, Peking University, Beijing, China(北京大学计算机科学系) Institute of EDA, Peking University, Beijing, China(北京大学EDA研究院) Beijing Advanced Innovation Center for IC, Beijing, China(北京集成电路先进创新中心)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出DiagramNet数据集和训练框架,通过端到端方法在系统级图表识别中超越现有模型,提升多模态大语言模型的图表理解能力。

Comments 13 pages, 7 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01417 2026-05-05 cs.CL cs.AI 62%

Medmarks: A Comprehensive Open-Source LLM Benchmark Suite for Medical Tasks

Medmarks:面向医疗任务的综合性开源大语言模型评估套件

Benjamin Warner, Ratna Sagari Grandhi, Max Kieffer, Aymane Ouraq, Saurav Panigrahi, Geetu Ambwani, Kunal Bagga, Nikhil Khandekar, Arya Hariharan, Nishant Mishra, Manish Ram, Shamus Sim Zi Yang, Ahmed Essouaied, Adepoju Jeremiah Moyondafoluwa, Robert Scholz, Bofeng Huang, Molly Beavers, Srishti Gureja, Anish Mahishi, Sameed Khan, Maxime Griot, Hunar Batra, Jean-Benoit Delbrouck, Siddhant Bharadwaj, Ronald Clark, Ashish Vashist, Anas Zafar, Leema Krishna Murali, Harsh Deshpande, Ameen Patel, William Brown, Johannes Hagemann, Connor Lane, Paul Steven Scotti, Tanishq Mathew Abraham

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Medmarks,一个包含30个医疗任务基准的开源评估套件,系统评估61个模型,揭示前沿模型在医疗推理中的优势及模型对答案顺序偏见的敏感性。

Comments website: https://medmarks.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00833 2026-05-05 cs.LG cs.AI 62%

Agentopic: A Generative AI Agent Workflow for Explainable Topic Modeling

Agentopic:一种用于可解释主题建模的生成式AI代理工作流

Brice Valentin Kok-Shun, Johnny Chan, Gabrielle Peko, David Sundaram

机构 * The University of Auckland, New Zealand(奥克兰大学,新西兰)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Agentopic通过多代理协作实现主题识别与解释,提升可解释性与准确性,其在BBC数据集上达到0.95的F1分数,优于LDA并接近BERTopic。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19298 2026-05-05 cs.CL cs.AI cs.IR 62%

IndiaFinBench: An Evaluation Benchmark for Large Language Model Performance on Indian Financial Regulatory Text

IndiaFinBench:用于评估大语言模型在印度金融监管文本性能的评估基准

Rajveer Singh Pall

机构 * Gyan Ganga Institute of Technology and Sciences(加延加anga科技与科学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出IndiaFinBench,首个公开的评估基准,用于评估大语言模型在印度金融监管文本上的性能,包含406个专家标注的问题-答案对,涵盖四个任务类型,评估十二个模型,发现数值推理任务表现最显著。

Comments 24 pages, 4 figures, 11 tables. Dataset and evaluation code at https://github.com/rajveerpall/IndiaFinBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15037 2026-05-05 cs.AI cs.CL cs.SD 62%

From Reactive to Proactive: Assessing the Proactivity of Voice Agents via ProVoice-Bench

从被动到主动:通过ProVoice-Bench评估语音代理的主动性

Ke Xu, Yuhao Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ProVoice-Bench评估框架,通过四个新任务评估语音代理的主动性,揭示当前模型在过度触发和推理能力上的不足,为开发更自然的主动代理提供方向。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01546 2026-05-05 cs.NI cs.AI 57%

6G Needs Agents: Toward Agentic AI-Native Networks for Autonomous Intelligence

6G需要智能体:迈向面向自主智能的智能体AI原生网络

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, United Arab Emirates University, UAE(计算机与网络工程系,阿联酋大学) Research Institute for Digital Future, Khalifa University, UAE(数字未来研究院,哈利法大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的智能体架构,用于构建AI原生6G网络,通过分层推理和分布式多智能体系统平衡性能与效率,揭示了模型异构部署和量化影响的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01484 2026-05-05 cs.LG stat.ML 57%

Evaluating LLMs on Large-Scale Graph Property Estimation via Random Walks

通过随机游走评估大图属性估计中的LLM

Sunil Kumar Maurya, Xin Liu

机构 * University of Tokyo(东京大学) AIST(日本产业技术综合研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出EstGraph基准数据集,设计四类任务估计大图属性,通过随机游走采样生成提示,评估LLM在大图场景下的推理能力。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01394 2026-05-05 cs.SE cs.AI 57%

LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation

LiveFMBench: 揭示代理工作流在规范生成中的力量与局限

Dong Xu, Jialun Cao, Guozhao Mo, Junjie Hu, Cheng Wen, Hongyu Lin, Xianpei Han, Shengchao Qin, Cong Tian, Shing-Chi Cheung, Le Sun, Yaojie Lu

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) The Hong Kong University of Science(香港科学与技术大学) Guangzhou Institute of Technology, Xidian University(西安电子科技大学广州研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文通过LiveFMBench系统研究LLM和代理在C程序形式化规范生成中的能力与失败模式,发现直接提示和代理流程显著提升成功率,但需排除不忠实行为以准确评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17677 2026-05-05 cs.AI 57%

EngiBench: A Benchmark for Evaluating Large Language Models on Engineering Problem Solving

EngiBench:用于评估大型语言模型在工程问题解决上的基准

Xiyuan Zhou, Xinlei Wang, Yirui He, Yang Wu, Ruixi Zou, Yuheng Cheng, Yulu Xie, Wenxuan Liu, Huan Zhao, Yan Xu, Jinjin Gu, Junhua Zhao

机构 * Nanyang Technological University(南洋理工大学) The University of Sydney(悉尼大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) The University of Hong Kong(香港大学) Hong Kong Polytechnic University(香港理工大学) AIRS

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 EngiBench是一个分层基准,用于评估大型语言模型在解决工程问题上的能力,涵盖基础知识检索、情境推理和开放性建模三个层次,揭示当前LLM在现实工程中仍缺乏高级推理能力。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01496 2026-05-05 cs.CV 50%

SF20K Competition 2025: Summary and findings

SF20K竞赛2025:总结与发现

Ridouane Ghermi, Xi Wang, Vicky Kalogeiton, Ivan Laptev

机构 * SLoMO Workshop(SLoMO工作坊) Hugging Face

专题命中 推理评测 :reasoning(abstract)

AI总结 本文总结了首个SF20K竞赛的结果,探讨了视频问答任务中多模态理解的重要性,并指出信息选择和推理结构是长视频问答的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01368 2026-05-05 cs.RO 50%

Assistance Without Interruption: A Benchmark and LLM-based Framework for Non-Intrusive Human-Robot Assistance

无中断协助:一种非侵入式人机协助的基准和基于大语言模型的框架

Yuedi Zhang, Shuanghao Bai, Wanqi Zhou, Haoran Zhang, Qi Zhang, Zhirong Luan, Badong Chen

机构 * Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) Xi’an Jiaotong University(西安交通大学) School of Electrical Engineering(电气工程学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出非侵入式协助的基准和框架,通过模拟基准和新指标评估,结合LLM与评分模型实现主动非侵入式协助,减少人类努力并保持任务有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00927 2026-05-05 q-bio.OT 50%

BioVeil MATRIX: Uncovering and categorizing vulnerabilities of agentic biological AI scientists

BioVeil MATRIX: 洞察和分类代理生物AI科学家中的漏洞

Kimon Antonios Provatas, Avery Self, Ioannis Mouratidis, Ilias Georgakopoulos-Soares

专题命中 推理评测 :planning(abstract)

AI总结 研究探讨了代理生物AI科学家在多学科科学流程中的应用,指出现有安全评估无法覆盖双用途应用风险,提出BioVeil MATRIX作为防御分类体系,用于系统化分类生物安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00904 2026-05-05 cs.CV 50%

Robustness of Transformer-Based Fluence Map Prediction Under Clinically Realistic Perturbations

基于变换器的荧光图预测在临床真实扰动下的鲁棒性

Ujunwa Mgboh, Rafi Ibn Sultan, Joshua Kim, Kundan Thind, Dongxiao Zhu

机构 * Wayne State University(韦恩州立大学) Henry Ford Health(亨利福特健康)

专题命中 推理评测 :planning(abstract)

AI总结 研究基于变换器的荧光图预测在临床真实扰动下的鲁棒性,通过对比不同注意力机制的变换器模型,发现分层变换器在能量误差上表现更优,强调了物理指导评估的重要性。

Comments Accepted by The Artificial Intelligence in Medicine (AIME) 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏