arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-14 至 2026-05-14 共收录 24 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 24 篇

2605.12524 2026-05-14 cs.LO cs.AI 83%

Stress-Testing the Reasoning Competence of LLMs With Proofs Under Minimal Formalism

用最小形式主义对LLM推理能力进行压力测试:通过证明

Konstantine Arkoudas, Serafim Batzoglou

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 ProofGrid通过机器可验证的证明评估LLM推理能力,涵盖证明写作、检查、遮蔽和补全等任务,采用简洁形式化符号,提供可重复、细粒度的评估方法,揭示当前模型在复杂推理任务上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01707 2026-05-14 cs.CV cs.AI cs.CL 81%

StreamGaze: Gaze-Guided Temporal Reasoning and Proactive Understanding in Streaming Videos

StreamGaze:流媒体视频中的目光引导时间推理与前瞻性理解

Daeun Lee, Subhojyoti Mukherjee, Branislav Kveton, Ryan A. Rossi, Viet Dac Lai, Seunghyun Yoon, Trung Bui, Franck Dernoncourt, Mohit Bansal

机构 * University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校) Adobe Research(Adobe研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 StreamGaze通过引入目光引导的任务评估多模态大语言模型在流媒体视频中的时间推理和前瞻性理解能力,揭示了现有模型在目光引导下的时间推理、意图建模和前瞻性预测方面的局限性。

Comments Accepted to CVPR 2026 with strong scores (5/5/5) but desk-rejected after the camera-ready due to not completing all reviewing duties

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12918 2026-05-14 cs.CL 79%

CommonWhy: A Dataset for Evaluating Entity-Based Causal Commonsense Reasoning in Large Language Models

CommonWhy:用于评估大语言模型实体基础因果常识推理的数据集

Armin Toroghi, Faeze Moradi Kalarde, Scott Sanner

机构 * University of Toronto(多伦多大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 CommonWhy数据集通过15000个为什么问题评估大语言模型的因果关系实体推理能力,揭示现有模型在因果推理和事实生成上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15616 2026-05-14 cs.CV 78%

LENS: Multi-level Evaluation of Multimodal Reasoning with Large Language Models

LENS:基于大语言模型的多级多模态推理评估

Ruilin Yao, Bo Zhang, Jirui Huang, Xinwei Long, Yifang Zhang, Tianyu Zou, Yufei Wu, Shichao Su, Yifan Xu, Wenxi Zeng, Zhaoyu Yang, Guoyou Li, Shilan Zhang, Zichan Li, Yaxiong Chen, Shengwu Xiong, Peng Xu, Jiajun Zhang, Bowen Zhou, David Clifton, Luc Van Gool

机构 * Wuhan University of Technology(武汉理工大学) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai AI Lab(上海人工智能实验室) University of Oxford(牛津大学) INSAIT, Sofia Un. St Kliment Ohridski(索菲亚大学克里门特·欧里迪斯基学院)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 LENS提出一个包含3.4K图像和60K+问题的多级评估基准,涵盖8个任务和12种日常场景,用于评估大语言模型在多模态推理中的表现。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10187 2026-05-14 cs.CV 78%

SciVQR: A Multidisciplinary Multimodal Benchmark for Advanced Scientific Reasoning Evaluation

SciVQR:一个多学科多模态基准用于高级科学推理评估

Longteng Guo, Xuanxu Lin, Dongze Hao, Tongtian Yue, Pengkang Huo, Jiatong Ma, Yuchen Liu, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) OPPO AI Center(OPPO AI中心)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 SciVQR通过54个学科的多模态任务评估科学推理能力,包含专家解答的复杂推理挑战,揭示了多模态大语言模型在复杂推理和跨学科整合方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13542 2026-05-14 cs.AI cs.CL cs.LG cs.MA 67%

RealICU: Do LLM Agents Understand Long-Context ICU Data? A Benchmark Beyond Behavior Imitation

RealICU: 大语言模型能否理解长期上下文ICU数据?一个超越行为模仿的基准测试

Chengzhi Shen, Weixiang Shen, Tobias Susetzky, Chen, Chen, Jun Li, Yuyuan Liu, Xuepeng Zhang, Zhenyu Gong, Daniel Rueckert, Jiazhen Pan

机构 * Technical University of Munich(慕尼黑技术大学) TUM University Hospital(TUM大学医院) LMU Munich(慕尼黑大学) University of Sheffield(谢菲尔德大学) University of Oxford(牛津大学) Zhongshan Hospital Fudan University(复旦大学中山医院) Sun Yat-sen University Cancer Center(中山大学肿瘤中心) Imperial College London(伦敦帝国学院) Munich Center for Machine Learning(慕尼黑机器学习中心) relAI – Konrad Zuse School of Excellence in Reliable AI(relAI – 卡诺夫茨卓越可靠人工智能学校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RealICU通过真实ICU场景评估大语言模型的长期上下文理解能力,提出四个医生驱动任务,揭示现有模型在临床推荐中的召回与安全性的权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13485 2026-05-14 cs.LG cs.CL cs.IT math.IT 62%

Effective Context in Transformers: An Analysis of Fragmentation and Tokenization

Transformer中的有效上下文:碎片化与分词分析

Amirmehdi Jafari Fesharaki, Mohammadamin Rami, Aslan Tchamkerten

机构 * Department of Communications and Electronics(通讯与电子系) Institut Polytechnique de Paris(巴黎高等理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了不同表示方式对Transformer有限上下文预测的影响,发现碎片化会增加信息损失,而分词方法能扩展上下文范围,揭示了表示选择的信息论框架。

Comments 30 pages, 9 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13021 2026-05-14 cs.LG cs.AI 62%

Rethinking Efficient Graph Coarsening via a Non-Selfishness Principle

重新思考通过非自私原则的高效图粗化

Xu Bai, Bin Lu, Kun Zhang, Shengbo Chen, Xinbing Wang, Chenghu Zhou, Meng Jin

机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University, Shanghai, China(上海交通大学信息科学与电子工程学院) School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院) School of Environment Science and Engineering, Shanghai Jiao Tong University, Shanghai, China(上海交通大学环境科学与工程学院) School of Artificial Intelligence, Nanchang University, Nanchang, China(南昌大学人工智能学院) Institute of Geographic Sciences and Natural Resources Research, Chinese Academy of Sciences, Beijing, China(中国科学院地理科学与资源研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出非自私原则的图粗化方法NOPE,通过局部各向同性假设降低计算复杂度,实现线性内存和近线性时间复杂度,实验显示在高阶节点上具有显著加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12645 2026-05-14 cs.CL cs.AI 62%

Training LLMs with Reinforcement Learning for Intent-Aware Personalized Question Answering

通过强化学习训练LLMs进行意图感知的个性化问答

Maryam Amirizaniani, Benjamin Charles Germain Lee, Jevin West, Nicholas Weber

机构 * University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出IAP框架,通过强化学习直接从单轮问题推断用户意图并生成意图感知的回答,实验表明其在LaMP-QA基准上优于所有基线,平均宏得分提升约7.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09636 2026-05-14 cs.AI cs.CV cs.HC cs.LG 62%

PersonalAlign: Hierarchical Implicit Intent Alignment for Personalized GUI Agent with Long-Term User-Centric Records

PersonalAlign:面向个性化GUI代理的分层隐式意图对齐

Yibo Lyu, Gongwei Chen, Rui Shao, Weili Guan, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PersonalAlign,通过长期用户记录实现个性化GUI代理的隐式意图对齐,引入AndroidIntent基准测试,评估代理在模糊指令解析和主动建议中的表现,HIM-Agent在执行和主动性能上提升显著。

Comments Accepted to ACL26 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08461 2026-05-14 cs.LG cs.AI cs.CV hep-ex 62%

Adapting Vision-Language Models for Neutrino Event Classification in High-Energy Physics

为高能物理中的中微子事件分类适应视觉-语言模型

Dikshant Sagar, Kaiwen Yu, Alejandro Yankelevich, Jianming Bian, Pierre Baldi

机构 * Department of Computer Science, University of California, Irvine, CA, USA(计算机科学系,加州大学欧文分校,加州,美国) Department of Physics, University of California, Irvine, CA, USA(物理系,加州大学欧文分校,加州,美国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了将微调后的LLaMA 3.2应用于中微子事件分类,对比了Transformer架构与CNN在准确性和鲁棒性上的表现,展示了视觉-语言模型在物理事件分类中的潜力。

Comments Accepted for publication in Communications Physics (Nature Portfolio)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12525 2026-05-14 cs.SI cs.AI cs.CL 62%

PERCEIVE: A Benchmark for Personalized Emotion and Communication Behavior Understanding on Social Media

PERCEIVE:面向社交媒体个性化情绪与交流行为理解的基准测试

Jian Liao, Yujin Zheng, Suge Wang, Jianxing Zheng, Deyu Li

机构 * School of Computer and Information Technology, Shanxi University, China(山西大学计算机与信息学院) Key Laboratory of Computational Intelligence and Chinese Information Processing of Ministry of Education, Shanxi University, China(教育部计算智能与中文信息处理重点实验室,山西大学,中国) Joint Laboratory of Tourism Big Data in Shanxi Province, China(山西省旅游大数据联合实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 PERCEIVE是首个整合五维社交感知的双语大规模基准,通过真实用户互动捕捉读者个性化情绪响应,推动社交智能NLP研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13651 2026-05-14 cs.SD cs.AI 57%

NAACA: Training-Free NeuroAuditory Attentive Cognitive Architecture with Oscillatory Working Memory for Salience-Driven Attention Gating

NAACA:无训练神经听觉注意力认知架构:具有振荡工作记忆的显著性驱动注意力门控

Zhongju Yuan, Geraint Wiggins, Dick Botteldooren

机构 * WAVES Research Group, Ghent University, Gent, Belgium(根特大学WAVES研究组,比利时根特) AI Lab, Vrije Universiteit Brussel, Brussel, Belgium(布鲁塞尔自由大学AI实验室,比利时布鲁塞尔) EECS, Queen Mary University of London, London, UK(伦敦大学学院女王学院电子工程与计算机科学系,英国伦敦)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 NAACA通过振荡工作记忆实现听觉显著性过滤,提升音频理解精度并减少冗余处理,实验显示在XD-Violence数据集上AP提升17.1%。

Comments Accepted as a regular paper by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13408 2026-05-14 cs.CL 57%

From Rosetta to Match-Up: A Paired Corpus of Linguistic Puzzles with Human and LLM Benchmarks

从罗塞塔到配对:一种带有人类和LLM评估的语料库语言谜题

Neh Majmudar, Anne Huang, Jinfan Frank Hu, Elena Filatova

机构 * City University of New York (CUNY)(纽约城市大学) Davidson Academy(戴维森学院) Phillips Academy(菲利普斯学术院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文研究了高中语言竞赛中使用的语言谜题,重点分析了罗塞塔石和配对两种常见形式,并提出了一种系统方法将现有罗塞塔石谜题转换为对应的配对谜题,通过人类和LLM评估验证了其有效性。

Comments Proceedings of the Fifteenth Language Resources and Evaluation Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11726 2026-05-14 cs.LG 57%

Block-R1: Rethinking the Role of Block Size in Multi-domain Reinforcement Learning for Diffusion Large Language Models

Block-R1: 重新审视块大小在多领域强化学习中的作用以提升扩散大语言模型

Yan Jiang, Ruihong Qiu, Zi Huang

机构 * The University of Queensland(昆士兰大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文从领域冲突角度研究多领域场景下扩散大语言模型强化学习中的块大小问题,提出领域块大小冲突公式、Block-R1-41K数据集、Block-R1基准和跨领域强化学习方法,通过13个数据集和7种算法验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16246 2026-05-14 cs.AI 57%

Toward Scalable Verifiable Reward: Proxy State-Based Evaluation for Multi-turn Tool-Calling LLM Agents

迈向可扩展的可验证奖励:基于代理状态的多轮工具调用LLM代理评估

Yun-Shiuan Chuang, Chaitanya Kulkarni, Alec Chiu, Avinash Thangali, Zijie Pan, Shivani Shekhar, Yirou Ge, Yixi Li, Uma Kona, Linsey Pang, Prakhar Mehrotra

机构 * PayPal AI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于代理状态的评估框架,用于多轮工具调用LLM代理的可扩展可验证奖励评估,通过LLM驱动的模拟框架实现稳定且区分模型的排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13332 2026-05-14 cs.AI cs.CC 57%

Diversity of Extensions in Abstract Argumentation

抽象论证中扩展的多样性

Johannes K. Fichte, Markus Hecher, Yasir Mahmood, Zhengjun Wang

机构 * Department of Computer and Information Science (IDA), Linköping University, Sweden(链接öping大学计算机与信息科学系(IDA)) University of Potsdam, Germany & University of Artois, CNRS, UMR8188 (CRIL), France(波茨坦大学 & 阿尔托伊斯大学、法国CNRS UMR8188(CRIL)) Data Science Group, Heinz Nixdorf Institute, Paderborn University, Germany(帕德博恩大学数据科学小组、海因茨·尼克斯多夫研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究了抽象论证中扩展多样性的量化概念,探讨了扩展的兼容性及计算最大多样性k值的方法。

Comments Technical Report to the paper accepted at IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13311 2026-05-14 cs.AI cs.IR cs.MA 57%

IdeaForge: A Knowledge Graph-Grounded Multi-Agent Framework for Cross-Methodology Innovation Analysis and Patent Claim Generation

IdeaForge: 一种基于知识图谱的多智能体框架,用于跨方法论创新分析和专利主张生成

Joy Bose

机构 * Independent Researcher(独立研究员)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 IdeaForge通过多智能体框架整合TRIZ、设计思维和SCAMPER等创新方法,利用知识图谱实现跨方法论的创新分析和专利主张生成,提升创新候选的多样性和可追溯性。

Comments 14 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12988 2026-05-14 cs.AI cs.CY cs.IR 57%

Retrieval-Augmented Tutoring for Algorithm Tracing and Problem-Solving in AI Education

增强检索的辅导系统用于AI教育中的算法追踪与问题解决

Mragisha Jain, Tirth Bhatt, Griffin Pitts, Aum Pandya, Peter Brusilovsky, Narges Norouzi, Arto Hellas, Juho Leinonen, Bita Akram

机构 * North Carolina State University(北卡罗来纳州立大学) University of Pittsburgh(匹兹堡大学) University of California, Berkeley(加州大学伯克利分校) Aalto University(阿尔托大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出KITE系统,通过增强检索生成技术辅助学生理解算法追踪和问题解决,提升算法推理能力。

Comments Paper accepted to the 21st Workshop on Innovative Use of NLP for Building Educational Applications (BEA 2026), co-located with ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10267 2026-05-14 cs.AI 57%

IndustryBench: Probing the Industrial Knowledge Boundaries of LLMs

IndustryBench: 探索大语言模型在工业知识边界的限制

Songlin Bai, Xintong Wang, Linlin Yu, Bin Chen, Zhiang Xu, Yuyang Sheng, Changtong Zan, Xiaofeng Zhu, Yizhe Zhang, Jiru Li, Mingze Guo, Ling Zou, Yalong Li, Chengfu Huo, Liang Ding

机构 * Multimodal and Industrial AI Team(多模态与工业AI团队)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 IndustryBench通过中国国家标准和工业产品记录构建2049项工业采购问答基准,揭示LLM在工业QA中的可靠性问题,发现标准与术语能力最弱,扩展推理降低安全调整分数,安全违规率影响排行榜。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18842 2026-05-14 cs.CR cs.AI cs.CV 57%

GUIGuard-Bench: Toward a General Evaluation for Privacy-Preserving GUI Agents

GUIGuard-Bench:面向隐私保护GUI代理的通用评估

Yanxi Wang, Zhiling Zhang, Wenbo Zhou, Weiming Zhang, Jie Zhang, Qiannan Zhu, Yu Shi, Shuxin Zheng, Jiyan He

机构 * Beijing Normal University(北京师范大学) Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) A*STAR Zhongguancun Institution of Artificial Intelligence(中关村人工智能研究所)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 GUIGuard-Bench通过241个真实GUI代理轨迹和4080张截图,评估隐私保护GUI代理的隐私识别、规划一致性和保护策略影响,揭示隐私识别是实际应用中的关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00839 2026-05-14 cs.SE cs.AI 57%

CodeClash: Benchmarking Goal-Oriented Software Engineering

CodeClash:面向目标导向软件工程的基准测试

John Yang, Kilian Lieret, Joyce Yang, Carlos E. Jimenez, Muhtasham Oblokulov, Aryan Siddiqui, Ofir Press, Ludwig Schmidt, Diyi Yang

机构 * Stanford University(斯坦福大学) Princeton University(普林斯顿大学) Cornell University(康奈尔大学) Technical University of Munich(慕尼黑技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 CodeClash通过多轮竞赛评估语言模型在无明确指导下迭代开发代码以实现开放性目标的能力,揭示了模型在战略推理和长期代码维护方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13034 2026-05-14 cs.CV cs.IR 50%

ViDR: Grounding Multimodal Deep Research Reports in Source Visual Evidence

ViDR:基于源视觉证据的多模态深度研究报告 grounding

Zhuofan Shi, Peilun Jia, Baoqin Sun, Haiyang Shen, Sixiong Xie, Yun Ma, Xiang Jing

机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) National Key Laboratory of Data Space Technology and System(数据空间技术与系统国家重点实验室) School of Software Engineering, Beijing Jiaotong University(北京交通大学软件学院) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 ViDR通过源视觉证据构建多模态深度研究报告框架,提升报告质量与证据可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13054 2026-05-14 cs.CV 50%

Topo-R1: Detecting Topological Anomalies via Vision-Language Models

Topo-R1: 通过视觉-语言模型检测拓扑异常

Meilong Xu, Qingqiao Hu, Xiaoling Hu, Shahira Abousamra, Xin Yu, Weimin Lyu, Kehan Qi, Dimitris Samaras, Chao Chen

机构 * Stony Brook University(石溪大学) Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院) Stanford University(斯坦福大学) Penn State University(宾夕法尼亚州立大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文通过构建拓扑感知基准Topo-R1,评估视觉-语言模型在检测管状网络拓扑异常中的能力,发现现有模型缺乏拓扑感知,提出基于拓扑感知奖励的联合评分方法,显著提升模型在ID和OOD测试中的性能。

Comments 26 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏