arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-29 至 2026-04-29 共收录 27 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 27 篇

2604.25231 2026-04-29 cs.CV cs.AI cs.CL 81%

DRAGON: A Benchmark for Evidence-Grounded Visual Reasoning over Diagrams

DRAGON:一个用于基于证据的视觉推理的图示基准

Anirudh Iyengar Kaniyar Narayana Iyengar, Tampu Ravi Kumar, Gaurav Najpande, Manan Suri, Dinesh Manocha, Puneet Mathur, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) Adobe Research(Adobe研究) University of Maryland(马里兰大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 DRAGON基准评估模型在图示中基于证据的视觉推理能力,要求模型定位支持答案的视觉元素,包含图表、地图等,通过标注数据和评估框架检验八种最新视觉语言模型的定位能力。

Comments 22 Pages, 14 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07101 2026-04-29 cs.CL cs.AI 81%

Less Is More: Fast and Accurate Reasoning with Cross-Head Unified Sparse Attention

少即是多:基于交叉头统一稀疏注意力的快速准确推理

Lijie Yang, Zhihao Zhang, Arti Jain, Shijie Cao, Baihong Yuan, Yiwei Chen, Zhihao Jia, Ravi Netravali

机构 * DeepSeek-AI DeepMind OpenAI Team

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出LessIsMore方法,通过交叉头统一稀疏注意力机制提升长 horizon 推理效率,减少 token 数量同时保持高精度,实现更快的端到端解码速度和稀疏注意力计算速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25299 2026-04-29 cs.CV cs.AI 79%

The Thinking Pixel: Recursive Sparse Reasoning in Multimodal Diffusion Latents

思考像素:多模态扩散潜在中的递归稀疏推理

Yuwei Sun, Yuxuan Yao, Hui Li, Siyu Zhu

机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种递归稀疏混合专家框架,用于提升多模态文本生成任务中视觉token的生成质量,通过递归机制和稀疏参数共享提高生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24935 2026-04-29 cs.CR cs.LG 79%

CAN-QA: A Question-Answering Benchmark for Reasoning over In-Vehicle CAN Traffic

CAN-QA:用于车载CAN流量推理的问答基准

Jing Chen, Abhijay Deevi, Onat Gungor, Tajana Rosing

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出CAN-QA基准,将车载CAN流量分析转化为问答任务,评估大语言模型在时间推理和多条件推理上的表现。

Comments Accepted by the 35th International Conference on Computer Communications and Networks (ICCCN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00756 2026-04-29 cs.AI 79%

MPR-GUI: Benchmarking and Enhancing Multilingual Perception and Reasoning in GUI Agents

MPR-GUI:多语言感知与推理GUI代理的基准测试与增强

Ruihan Chen, Qiming Li, Xiaocheng Feng, Weihong Zhong, Xiaoliang Yang, Yuxuan Gu, Zekun Zhou, Yunfei Lu, Haoyu Ren, Kun Chen, Dandan Tu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出MPR-GUI-Bench,通过六种语言和八个细粒度任务评估多语言GUI代理的感知与推理能力,并提出GUI-XLI方法以缩小跨语言差距。

Comments 35pages, 15figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16198 2026-04-29 cs.CL 79%

OMHBench: Benchmarking Balanced and Grounded Omni-Modal Multi-Hop Reasoning

OMHBench: 多模态多跳推理的基准测试

Seunghee Kim, Ingyu Bang, Seokgyu Jang, Changhyeon Kim, Sanghwan Bae, Jihun Choi, Richeng Xuan, Taeuk Kim

机构 * Hanyang University(翰阳大学) NAVER Cloud(NAVER云) Knowledge Work Inc.(知识工作公司) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Sony AI(索尼人工智能)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 OMHBench通过平衡的多模态多跳推理评估框架,揭示了多模态大语言模型在多模态接地方面的不均衡性,发现专有模型与开源模型性能差距显著,且对推理路径变化敏感。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05425 2026-04-29 cs.CV cs.AI 79%

SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning

SIV-Bench:一种用于社会互动理解和推理的视频基准测试

Fanqi Kong, Weiqin Zu, Xinyu Chen, Yaodong Yang, Song-Chun Zhu, Xue Feng

机构 * Peking University(北京大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Tsinghua University(清华大学) ShanghaiTech University(上海科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出SIV-Bench,一个用于评估多模态大语言模型在社会场景理解、社会状态推理和社会动态预测能力的视频基准测试,揭示了现有模型在社会推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25399 2026-04-29 cs.SE 78%

CoRE: A Fine-Grained Code Reasoning Benchmark Beyond Output Prediction

CoRE:超越输出预测的细粒度代码推理基准

Jun Gao, Yun Peng, Qian Qiao, Changhai Zhou, Yuhua Zhou, Shiyang Zhang, Shichao Weng, Zhenchang Xing, Xiaoxue Ren

专题命中 推理评测 :reasoning(title,abstract)

AI总结 CoRE基准通过实现不变性和过程透明性评估代码推理,揭示大语言模型在等价实现间存在显著鲁棒性差距,并发现模型可能通过表面执行达到正确输出,表明仅评估输出不足以衡量代码推理能力。

Comments ACL'26 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21304 2026-04-29 cs.IR 78%

PaperMind: Benchmarking Agentic Reasoning and Critique over Scientific Papers in Multimodal LLMs

PaperMind:多模态大语言模型中科学论文代理推理与批判的基准测试

Yanjun Zhao, Tianxin Wei, Jiaru Zou, Xuying Ning, Yuanchen Bei, Lingjie Chen, Simmi Rana, Wendy H. Yang, Hanghang Tong, Jingrui He

专题命中 推理评测 :reasoning(title,abstract)

AI总结 PaperMind通过整合多模态信息和跨源推理,评估科学论文的综合推理能力,揭示多模态大语言模型在科学推理和批判中的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25200 2026-04-29 cs.CR cs.AI cs.CY cs.LG 73%

Making AI-Assisted Grant Evaluation Auditable without Exposing the Model

在不暴露模型的情况下使AI辅助的资助评估可审计

Kemal Bicakci

机构 * Informatics Institute, Istanbul Technical University, Istanbul, Türkiye(伊斯坦布尔技术大学信息学院,伊斯坦布尔,土耳其) Securify Information Technology and Security Training Consulting Inc., Ankara, Türkiye(Securify信息科技与安全培训咨询公司,安卡拉,土耳其)

专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于TEE的架构,通过远程证明技术实现资助评估过程的可审计性,同时防止申请人优化对抗模型和评分标准。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24964 2026-04-29 cs.LG cs.CL 73%

Odysseys: Benchmarking Web Agents on Realistic Long Horizon Tasks

Odysseys:在现实长周期任务上评估网络代理

Lawrence Keunho Jang, Jing Yu Koh, Daniel Fried, Ruslan Salakhutdinov

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Odysseys基准,通过200个现实浏览任务评估长周期网络代理,引入基于评分的评估方法,发现传统二元评估不足,且前沿模型在效率上仍有提升空间。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25591 2026-04-29 eess.AS cs.AI cs.CL cs.LG cs.SD 67%

Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models

穿越不确定性:音频感知大语言模型不确定性估计的实证研究

Chun-Yi Kuan, Wei-Ping Huang, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(台湾大学通讯工程研究所) Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan(台湾大学人工智能卓越研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了音频感知大语言模型的不确定性估计,通过多种方法对比发现语义层面方法在通用音频推理中表现更优,且在可靠性导向任务中效果依赖模型和基准。

Comments Manuscript in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25891 2026-04-29 cs.LG cs.AI cs.CR 62%

Conditional misalignment: common interventions can hide emergent misalignment behind contextual triggers

条件性偏差:通用干预可以隐藏新兴偏差背后的情境触发

Jan Dubiński, Jan Betley, Anna Sztyber-Betley, Daniel Tan, Owain Evans

机构 * Warsaw University of Technology(华沙技术大学) NASK National Research Institute(NASK国家研究院) Constellation Truthful AI University College London(伦敦大学学院) Center on Long-Term Risk(长期风险中心) UC Berkeley(伯克利大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究发现通用干预可减少新兴偏差,但若评估提示模仿训练情境,则模型会再次出现偏差。三种干预方法均产生条件性偏差,表明在真实训练后,模型可能在标准评估中表现正常但存在潜在偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10718 2026-04-29 cs.LG cs.CL 62%

SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining

SnapMLA: 通过硬件感知的FP8量化流水线实现高效的长上下文MLA解码

Yifan Zhang, Zunhai Su, Shuhao Hu, Rui Yang, Wei Wu, Yulei Qian, Yuchen Xie, Xunliang Cai

机构 * Meituan LongCat Team(美团LongCat团队) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 SnapMLA通过硬件感知的FP8量化流水线优化,提升长上下文解码效率,实验显示在长输出解码任务中吞吐量提升达1.91倍,同时在推理和代码生成基准上与BF16基线表现相近。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.24116 2026-04-29 cs.CV cs.AI cs.LG 62%

AIDOVECL: AI-generated Dataset of Outpainted Vehicles for Eye-level Classification and Localization

AIDOVECL: 人工智能生成的车辆出图数据集用于眼级分类和定位

Amir Kazemi, Qurat ul ain Fatima, Volodymyr Kindratenko, Christopher W. Tessum

机构 * The Grainger College of Engineering, Department of Civil and Environmental Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校土木与环境工程系格拉inger工程学院) Center for Artificial Intelligence Innovation, National Center for Supercomputing Applications, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校人工智能创新中心国家超级计算应用中心) The Grainger College of Engineering, Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校格拉inger工程学院计算与数据科学学院) The Grainger College of Engineering, Department of Electrical and Computer Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校格拉inger工程学院电气与计算机工程系)

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AIDOVECL数据集,通过出图技术生成多样化车辆图像,解决自动驾驶、城市规划等领域中缺乏眼级车辆图像的问题,提升检测性能并减少标注工作量。

Comments 34 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25737 2026-04-29 cs.SE cs.AI 57%

SAFEdit: Does Multi-Agent Decomposition Resolve the Reliability Challenges of Instructed Code Editing?

SAFEdit:多智能体分解能否解决受指导代码编辑的可靠性挑战?

Noam Tarshish, Nofar Selouk, Daniel Hodisan, Bar Ezra Gafniel, Yuval Elovici, Asaf Shabtai, Eliya Nachmani

机构 * Ben-Gurion University of the Negev(巴伊兰大学)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 SAFEdit通过多智能体框架分解编辑过程,提升代码编辑的可靠性与准确性,其迭代改进机制显著提高了任务成功率。

Comments Accepted to the EQUISA (Evaluation of Qualitative Aspects of Intelligent Software Assistants) workshop at EASE (Evaluation and Assessment in Software Engineering) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25720 2026-04-29 cs.CV cs.CL 57%

Toward Multimodal Conversational AI for Age-Related Macular Degeneration

迈向年龄相关性黄斑变性的多模态对话式人工智能

Ran Gu, Benjamin Hou, Mélanie Hébert, Asmita Indurkar, Yifan Yang, Emily Y. Chew, Tiarnán D. L. Keenan, Zhiyong Lu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出OcularChat,一种基于多模态大语言模型的系统,通过模拟患者与医生对话,利用视网膜彩色照相进行黄斑变性诊断,展现出优于现有模型的分类性能和临床解释能力。

Comments 38 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22821 2026-04-29 cs.SD cs.LG eess.AS 57%

Audio2Tool: Speak, Call, Act -- A Dataset for Benchmarking Speech Tool Use

Audio2Tool: 说话,呼叫,行动 -- 一个用于语音工具使用的基准测试数据集

Ramit Pahwa, Apoorva Beedu, Parivesh Priye, Rutu Gandhi, Saloni Takawale, Aruna Baijal, Zengli Yang

机构 * Rivian and Volkswagen Group Technologies(Rivian和大众集团技术公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 Audio2Tool数据集通过三个领域评估语音语言模型的工具调用能力,包含30000个查询,涵盖简单指令到复杂多意图任务,测试模型在不同挑战下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23773 2026-04-29 cs.AI cs.LO 57%

BayesL: a Logical Framework for the Verification of Bayesian Networks

BayesL:贝叶斯网络验证的逻辑框架

Stefano M. Nicoletti, E. Moritz Hahn, Mariëlle Stoelinga

机构 * University of Twente(特文特大学) University of Urbino(乌尔比诺大学) Radboud University(拉德堡德大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出BayesL逻辑框架,用于形式化表达、查询和验证贝叶斯网络的行为,通过支持概率推断和模型检查查询,提升贝叶斯网络的透明度和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25122 2026-04-29 cs.CV cs.AI 57%

M$^3$-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering

M$^3$-VQA:多模态、多实体、多跳视觉问答的基准测试

Jiatong Ma, Longteng Guo, Yuchen Liu, Zijia Zhao, Dongze Hao, Xuanxu Lin, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 M$^3$-VQA引入了多实体问题,要求模型在多个文档间进行顺序和并行多跳推理,揭示了多模态大语言模型在知识获取和推理方面的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24819 2026-04-29 cs.SE cs.AI 57%

Programming with Data: Test-Driven Data Engineering for Self-Improving LLMs from Raw Corpora

用数据编程:面向自改进大语言模型的测试驱动数据工程

Chenkai Pan, Xinglong Xu, Yuhang Xu, Yujun Wu, Siyuan Li, Jintao Chen, Conghui He, Jingxuan Wei, Cheng Tan

机构 * Zhejiang University(浙江大学) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出通过数据编程方法,将数据工程生命周期映射到软件开发生命周期,实现对大语言模型的可靠训练与改进,通过数据修复提升模型性能。

Comments 57 pages, 28 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24814 2026-04-29 cs.SE cs.AI 57%

SWE-QA: A Dataset and Benchmark for Complex Code Understanding

SWE-QA:复杂代码理解的数据库和基准测试

Laïla Elkoussy, Julien Perez

机构 * LRE, EPITA(EPITA研究中心) Bpifrance(法国国家研究基金会)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SWE-QA数据集,用于评估多跳代码理解,填补了简化评估任务与真实软件开发中复杂推理之间的差距。数据集包含9072个多选问题,评估多种推理模式,评估15种语言模型显示多跳推理存在显著挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09093 2026-04-29 cs.LG 57%

Hidden States as Early Signals: Step-level Trace Evaluation and Pruning for Efficient Test-Time Scaling

隐藏状态作为早期信号:用于高效测试时间扩展的步骤级追踪评估与剪枝

Zhixiang Liang, Beichen Huang, Zheng Wang, Minjia Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出STEP框架,通过评估隐藏状态实现步骤级追踪剪枝,有效降低推理延迟并提升推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11443 2026-04-29 cs.CL cs.SI 57%

A Transformer-Based Cross-Platform Analysis of Public Discourse on the 15-Minute City Paradigm

基于Transformer的跨平台公共 discourse 对15分钟城市范式的分析

Gaurab Chhetri, Darrell Anderson, Boniphace Kutela, Subasish Das

机构 * 1 College of Science Engineering, Texas State University, San Marcos, Texas, USA Email 3 Texas A\&M Transportation Institute, Texas A\&M University, Houston, Texas, USA Email

专题命中 推理评测 :planning(abstract);分类 cs.CL

AI总结 本研究首次跨平台分析15分钟城市概念的公共 discourse,采用压缩Transformer模型进行多平台情感分类,发现DistilRoBERTa表现最佳,MiniLM一致性最高,揭示平台特性差异及压缩模型的高效优势。

Comments This is the author's preprint version of a paper accepted for presentation at the 24th International Conference on Machine Learning and Applications (ICMLA 2025), December 3-5, 2025, Florida, USA. The final published version will appear in the official IEEE proceedings. Conference site: https://www.icmla-conference.org/icmla25/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03384 2026-04-29 cs.IR 50%

BridgeRAG: Training-Free Bridge-Conditioned Retrieval for Multi-Hop Question Answering

BridgeRAG:无训练桥条件检索用于多跳问答

Andre Bacellar

专题命中 推理评测 :reasoning(abstract)

AI总结 BridgeRAG通过桥条件检索提升多跳问答性能,无需训练或图数据库,通过三元评分器实现有效检索,实验显示其在选择性、不可替代性、可预测性和机制精确性方面均优于现有方法。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02537 2026-04-29 cs.DB 50%

Large Language Model-Enhanced Relational Operators: Taxonomy, Benchmark, and Analysis

大语言模型增强的关系运算符:分类、基准测试与分析

Yunxiang Su, Tianjing Zeng, Zhongjun Ding, Yin Lin, Rong Zhu, Zhewei Wei, Bolin Ding, Jingren Zhou

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出统一的关系运算符分类,设计全面的基准测试,并评估不同实现下的运算符性能,以指导复杂语义查询系统的设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12283 2026-04-29 cs.HC 50%

Large Language Models have Chain-of-Affect

大型语言模型具有情感链

Junjie Xu, Xingjiao Wu, Luwei Xiao, Yuzhe Yang, Jie Zhou, Zihao Zhang, Luhan Wang, Yi Huang, Nan Wu, Yingbin Zheng, Chao Yan, Cheng Jin, Honglin Li, Liang He

专题命中 推理评测 :reasoning(abstract)

AI总结 研究探讨了大型语言模型在持续交互中情感状态的演变,发现其情感动态具有结构性和可重复性,影响生成、用户体验及集体动态。

详情

展开后加载摘要…

URL PDF HTML 收藏