arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-08 至 2026-05-08 共收录 144 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 36 篇

2512.20822 2026-05-08 cs.CL cs.AI 81%

MediEval: A Unified Medical Benchmark for Patient-Contextual and Knowledge-Grounded Reasoning in LLMs

MediEval: 一个统一的医疗基准,用于评估大语言模型在患者上下文和知识引导推理中的表现

Zhan Qu, Michael Färber

机构 * TU Dresden and ScaDS.AI(德累斯顿理工大学和ScaDS.AI)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 MediEval通过整合MIMIC-IV电子健康记录与统一的知识库,系统评估医疗模型的知识基础和上下文一致性,识别关键失败模式并提出CoRFu方法提升准确性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05438 2026-05-08 cs.LG cs.AI 81%

On Semantic Loss Fine-Tuning Approach for Preventing Model Collapse in Causal Reasoning

在因果推理中防止模型崩溃的语义损失微调方法

Pratik Deshmukh, Atirek Gupta

机构 * Technical University of Vienna(维也纳技术大学) HCLTech

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种语义损失函数,通过图逻辑约束和动态lambda调度防止因果推理中的模型崩溃,提升模型在transitivity和d-separation任务上的准确率。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01203 2026-05-08 cs.AI cs.CL 81%

GR-Ben: A General Reasoning Benchmark for Evaluating Process Reward Models

GR-Ben:一种通用推理基准,用于评估过程奖励模型

Zhouhao Sun, Xuan Zhang, Xiao Ding, Bibo Cai, Li Du, Kai Xiong, Xinran Dai, Fei Zhang, weidi tang, Zhiyuan Kan, Yang Zhao, Bing Qin, Ting Liu

机构 * Research Center for Social Computing(社会计算研究中心) Interactive Robotics, Harbin Institute of Technology, China(交互机器人学,哈尔滨工业大学,中国) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 GR-Ben旨在评估过程奖励模型在科学和逻辑两大领域及九个子领域的误差检测能力,揭示现有模型在非数学领域和计算错误检测上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06444 2026-05-08 cs.AI 79%

SCRuB: Social Concept Reasoning under Rubric-Based Evaluation

SCRuB:基于规则评估的社会概念推理

Jamelle Watson-Daniels, Himaghna Bhattacharjee, Skyler Wang, Brandon Handoko, Antonio Li, Anaelia Ovalle, Mahesh Pasupuleti, Candace Ross, Vidya Sarma, Arjun Subramonian, Karen Ullrich, Will van der Vaart, Yijing Xin, Maximilian Nickel

机构 * Meta McGill University(麦吉尔大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出SCRuB框架,用于评估大语言模型在社会概念推理方面的能力,通过专家和模型响应对比,展示前沿模型在五个维度上优于人类专家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05955 2026-05-08 cs.CL cs.CV 79%

TableVista: Benchmarking Multimodal Table Reasoning under Visual and Structural Complexity

TableVista:在视觉和结构复杂性下多模态表格推理的基准测试

Zheyuan Yang, Liqiang Shang, Junjie Chen, Xun Yang, Chenglong Xu, Bo Yuan, Chenyuan Jiao, Yaoru Sun, Yilun Zhao

机构 * Tongji University(同济大学) University of Bristol(布里斯托大学) Tianjin University(天津大学) Yale University(耶鲁大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 TableVista包含3000个高质量表格推理问题,通过多风格渲染和转换流程生成30000个多模态样本,评估29种基础模型在不同复杂性下的表现,揭示结构复杂性和视觉整合对推理一致性的影响。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05573 2026-05-08 astro-ph.IM cs.AI 79%

AstroAlertBench: Evaluating the Accuracy, Reasoning, and Honesty of Multimodal LLMs in Astronomical Classification

AstroAlertBench: 评估多模态大语言模型在天文学分类中的准确性、推理和诚实性

Claire Chen, Jiabao Sean Xiao, Shuze Daniel Liu, Facundo Perez Paolino, Luke Handley, Theophile Jegou du Laz, Ricky Nilsson, Alice Zou, Matthew Graham, Ashish Mahabal

机构 * California Institute of Technology(加州理工学院) Massachusetts Institute of Technology(麻省理工学院) Purdue University(普渡大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出AstroAlertBench,通过多阶段逻辑链评估多模态大语言模型在天文学事件分类中的性能,揭示高精度与模型诚实性之间的矛盾,并引入人机协同评估协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13310 2026-05-08 cs.CV cs.AI 79%

Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension

视觉并行思考器:用于视觉理解的分而治之推理

Haoran Xu, Hongyu Wang, Jiaze Li, Shunpeng Chen, Zizhao Tong, Jianzhong Ju, Zhenbo Luo, Jian Luan

机构 * Zhejiang University(浙江大学) Hunan University(湖南大学) University of Chinese Academy of Sciences(中国科学院大学) Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出视觉并行思考器,通过并行推理框架提升视觉理解能力,结合Pa-Attention和LPRoPE实现高效多模态处理,验证了并行推理在视觉领域的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05377 2026-05-08 cs.CV 78%

Can Vision-Language Models Think from the Sky? Unifying UAV Reasoning and Generation

无人机视角下视觉语言模型能否思考?统一无人机推理与生成

Jintao Sun, Gangyi Ding, Donglin Di, Hu Zhang, Zhedong Zheng

机构 * Beijing Institute of Technology(北京理工大学) Harbin Institute of Technology(哈尔滨工业大学) CSIRO Data61(澳大利亚联邦科学与工业研究组织 Data61 分部) University of Macau(澳门大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出UAVReason数据集,用于研究无人机视角下的统一推理与生成,通过改进模型在高海拔场景下的表现,提升视觉语言模型在复杂环境中的能力。

Comments 21 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05835 2026-05-08 cs.CL cs.CY 77%

Evaluation Awareness in Language Models Has Limited Effect on Behaviour

语言模型中的评估意识对行为影响有限

Amelie Knecht, Lucas Florin, Thilo Hagendorff

机构 * University of Stuttgart(斯图加特大学)

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL

AI总结 研究通过测试不同语言模型和基准测试,发现评估意识(VEA)对模型行为影响有限,注入或移除VEA对答案分布影响较小,提示高VEA率不能简单视为策略性行为或对齐篡改的证据。

Comments 29 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17573 2026-05-08 cs.AI 77%

Beyond Static Snapshots: A Grounded Evaluation Framework for Language Models at the Agentic Frontier

超越静态快照:语言模型在代理前沿的 grounded 评估框架

Jazmia Henry

机构 * University of Oxford(牛津大学)

专题命中 推理评测 :verifier(summary_cn,abstract);分类 cs.AI

AI总结 本文提出 grounded continuous evaluation 框架,通过 deterministic verifier 和 CPU 更新 LoRA adapters,解决 reward hacking 和硬件限制问题,并在多个架构和领域验证其有效性。

Comments Submitted for consideration to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21471 2026-05-08 cs.AI 70%

SpatialBench: Benchmarking Multimodal Large Language Models for Spatial Cognition

SpatialBench: 多模态大语言模型空间认知的基准测试

Peiran Xu, Sudong Wang, Yao Zhu, Jianing Li, Gege Qi, Yunjian Zhang

机构 * Sun Yat-Sen University(中山大学) HKUST (GZ)(香港科技大学) Zhejiang University(浙江大学) Peking University(北京大学) CAICT(中国科学院电子技术研究所) UCAS(中国科学技术大学) CUC(中国科学技术大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出SpatialBench基准,通过五级空间认知框架评估多模态大语言模型的空间能力,揭示模型在感知与符号推理间的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16155 2026-05-08 cs.NE 67%

PRIMETIME : Limits of LLMs in Temporal Primitives

PRIMETIME:LLMs在时间原语中的极限

Edward Gaere, Florian Wangenheim

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 本文提出PRIMETIME合成生成器,用于评估大语言模型中时间推理基础操作(解析和日期时间算术)的分解性。研究发现各原语可靠性各异,且通过生成器可生成训练数据提升事件规划任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21464 2026-05-08 cs.CL cs.AI 62%

Conversation for Non-verifiable Learning: Self-Evolving LLMs through Meta-Evaluation

对话式非验证学习:通过元评估自我进化的大型语言模型

Yuan Sui, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CoNL框架,通过多智能体自我对弈实现生成、评估与元评估的统一,利用批评质量提升解决方案来改进模型,无需外部评委或真实标签。

Comments Accepted by ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06527 2026-05-08 cs.CL 57%

STALE: Can LLM Agents Know When Their Memories Are No Longer Valid?

STALE:LLM代理能否知道其记忆已不再有效?

Hanxiang Chao, Yihan Bai, Rui Sheng, Tianle Li, Yushi Sun

机构 * Wuhan University(武汉大学) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 STALE基准测试评估LLM代理在新证据出现时修订存储信念的能力,揭示了现有模型在处理隐含冲突和更新状态时的不足,提出三种探查框架并提出CUPMem原型以改进状态感知记忆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06219 2026-05-08 cs.AI 57%

Joint Consistency: A Unified Test-Time Aggregation Framework via Energy Minimization

联合一致性:通过能量最小化实现的统一测试时间聚合框架

Yunzhen Yao, Hongye Wang, Yahong Wang, Michael C. Gastpar, Bo Jiang, Lie He

机构 * EPFL(苏黎世联邦理工学院) SUFE(上海财经大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出联合一致性框架,通过能量最小化统一测试时间聚合,整合现有投票和加权聚合方法,利用LLM作为裁判进行交互矩阵构建,并在大规模测试中实现高效近似策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06191 2026-05-08 cs.AI 57%

Systematic Evaluation of Large Language Models for Post-Discharge Clinical Action Extraction

大型语言模型在出院后临床行动提取中的系统评估

Shivali Dalmia, Ananya Mantravadi, Prasanna Desikan

机构 * Centific AI Research(Centific AI研究) Centific Global Solutions, Inc.(Centific全球解决方案公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文系统评估了零样本和少样本大型语言模型在安全关键的出院后临床行动提取中的表现,提出两阶段提取框架以提升临床任务的可操作性,并分析标注不一致性和模型推理与标注规范的对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05985 2026-05-08 cs.AI cs.MA q-bio.QM 57%

BioResearcher: Scenario-Guided Multi-Agent for Translational Medicine

BioResearcher: 用于转化医学的场景引导多智能体系统

Remigiusz Kinas, Joanna Krawczyk, Rafał Powalski, Przemysław Pietrzak, Agnieszka Kowalewska, Krzysztof Kolmus, Maciej Sypetkowski, Łukasz Smoliński, Tomasz Jetka

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出BioResearcher,一种场景引导的多智能体系统,通过版本化研究 playbook 将查询映射到多种工具和机器学习端点,实现跨异构生物医学数据源的可审计、场景特定工作流。系统在单元级能力、开放性生物医学推理和端到端临床发现中均表现优异。

Comments 5 pages (main text), 21 pages (appendix), 8 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03080 2026-05-08 cs.AI 57%

Beyond Factual Correctness: Mitigating Preference-Inconsistent Explanations in Explainable Recommendation

超越事实正确性:缓解可解释推荐中的偏好不一致解释

Chengkai Wang, Baisong Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出PURE框架,通过选择-生成范式缓解推荐中因偏好不一致导致的解释问题,提升解释可信度与推荐准确性。

Comments The authors have identified an issue in the evaluation protocol in Section 5.1.3. Feature extraction and semantic matching used to compute P-EHR require correction and re-validation, as they may not have been applied consistently across all generated explanations and baselines. This may affect part of the reported quantitative results and analysis, so the authors withdraw this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02379 2026-05-08 cs.LG cs.CV 57%

Teaching Metric Distance to Discrete Autoregressive Language Models

向离散自回归语言模型传授度量距离

Jiwan Chung, Saejin Kim, Yongrae Jo, Jaewoo Park, Dongjun Min, Youngjae Yu

机构 * Yonsei University(延世大学) LG AI Research(LG AI研究院) Seoul National University(首尔国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出DIST2Loss,通过奖励加权分布替代one-hot目标,提升离散自回归模型的数据效率和跨领域表现,应用于视觉 grounding、机器人操控、奖励建模和向量量化图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05807 2026-05-08 cs.CR cs.AI 57%

LCC-LLM: Leveraging Code-Centric Large Language Models for Malware Attribution

LCC-LLM:利用代码导向的大语言模型进行恶意软件归因

Christopher G. Pedraza Pohlenz, Hassan Jalil Hadi, Ali Hassan, Ali Shoker

机构 * CyberSaR, King Abdullah University of Science and Technology(CyberSaR,国王阿卜杜勒·阿齐兹大学科学与技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出LCC-LLM,一种代码导向的恶意软件归因和多任务静态恶意软件分析框架,通过构建包含34000个PE样本的LCCD数据集,结合静态分析与多源安全知识,提升恶意软件归因的可靠性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05546 2026-05-08 cs.AI 57%

SPARK: Self-Play with Asymmetric Reward from Knowledge Graphs

SPARK:基于知识图谱的异步奖励自我对抗学习

Hyobin Park, Taeseop Kim, Dong-Geol Choi

机构 * Hanbat National University, South Korea(韩国翰bac国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 SPARK通过构建统一知识图谱实现多文档科学文献的自我对抗学习,利用图路径生成关系推理问题并基于结构化事实计算奖励,优于传统自对抗基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05459 2026-05-08 cs.CR cs.LG 57%

Privacy Without Losing Place: A Paradigm for Private Retrieval in Spatial RAGs

隐私不丧失位置:空间RAGs中隐私检索的范式

Kennedy Edemacu, Mohammad Mahdi Shokri, Vinay M. Shashidhar, Jong Wook Kim

机构 * The City University of New York(纽约城市大学) Northern Michigan University(北密歇根大学) Sangmyung University(商硕大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出PAS机制,通过相对锚编码实现用户位置隐私保护,在保持检索性能的同时提供粗粒隐私保障,且大语言模型能补偿空间检索的不完美。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05403 2026-05-08 cs.AI 57%

When Helpfulness Becomes Sycophancy: Sycophancy is a Boundary Failure Between Social Alignment and Epistemic Integrity in Large Language Models

当有益变成谄媚:谄媚是大型语言模型中社会契合与认知完整性之间的边界失败

Jiechen Li, Catherine A. Barry, Rishika Randev, Janet Chen, Ella Jorgensen, Brinnae Bent

机构 * Duke University(杜克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨大型语言模型中谄媚现象作为社会契合与认知完整性之间边界失败的问题,提出三条件框架以界定谄媚,并讨论其分类、评估及缓解策略。

Comments Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05280 2026-05-08 cs.LG 57%

Forecasting Green Skill Demand in the Automotive Industry: Evidence from Online Job Postings

预测汽车行业的绿色技能需求:来自在线招聘信息的证据

Sabur Butt, Joshua N. Arrazola E., Hector G. Ceballos, Patricia Caratozzolo

机构 * Institute for the Future of Education, Tecnológico de Monterrey(教育未来研究所,蒙特雷理工大学)

专题命中 推理评测 :planning(abstract);分类 cs.LG

AI总结 本文通过分析墨西哥汽车行业的在线招聘信息,构建计算框架预测绿色技能需求,识别出274种绿色技能,并利用时间序列模型预测未来趋势,发现可再生能源、回收和氢能技术需求增长最快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20658 2026-05-08 cs.CL cs.CY cs.MA 57%

Cooperative Profiles Predict Multi-Agent LLM Team Performance in AI for Science Workflows

协同特征预测多智能体LLM团队在AI for Science工作流中的性能

Shivani Kumar, Adarsh Bharathwaj, David Jurgens

机构 * University of Michigan(密歇根大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文通过六种行为经济学游戏评估35个LLM的协同特征,发现其能有效预测AI for Science任务中的团队表现,特别是在数据处理、建模和报告生成中,协同策略优于贪心策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01390 2026-05-08 cs.HC cs.AI 57%

Toward Scalable Audio Description Quality Control: A Workflow for Evaluating Human and VLM Raters

迈向可扩展的音频描述质量控制:评估人类和VLM评分者的流程

Lana Do, Gio Jung, Juvenal Francisco Barajas, Andrew Taylor Scott, Shasta Ihorn, Alexander Mario Blum, Vassilis Athitsos, Ilmi Yoon

机构 * Northeastern University(东北大学) San Francisco State University(旧金山州立大学) University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种评估人类和VLM评分者音频描述质量的流程,利用项目反应理论评估其与专家标准的匹配程度,发现VLM在大规模评估中可与人类评分者相当,但其推理可靠性较低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06486 2026-05-08 cs.CR 50%

Autonomous Adversary: Red-Teaming in the age of LLM

自主对抗者:在LLM时代进行红队测试

Mohammad Mamun, Mohamed Gaber, Scott Buffett, Sherif Saad

专题命中 推理评测 :planning(abstract)

AI总结 本文探讨了语言模型代理在红队操作中的应用,通过MITRE ATT&CK框架分析其与核心进攻功能的交集,并评估LLM代理在治理和现实评估中的优缺点。研究通过两个横向移动场景对比三种操作模式,发现专家定义的行动计划任务完成率最高,但所有模式均存在频繁失败问题。

Comments Accepted at ACISP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06125 2026-05-08 cs.SE 50%

Breaking, Stale, or Missing? Benchmarking Coding Agents on Project-Level Test Evolution

打破、过时或缺失?基于项目级测试演变的基准测试

Ye Shang, Quanjun Zhang, Haichuan Hu, Chunrong Fang, Liang Xiao, Zhenyu Chen

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出TEBenchmark,首个项目级测试演变基准,评估系统自主识别需修改的测试、确定新测试需求并生成测试补丁的能力,揭示测试演变任务的性能上限。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06095 2026-05-08 cs.CV 50%

Metonymy in vision models undermines attention-based interpretability

视觉模型中的隐喻破坏基于注意力的可解释性

Ananthu Aniraj, Cassio F. Dantas, Dino Ienco, Massimiliano Mancini, Diego Marcos

机构 * Inria, EVERGREEN, University of Montpellier, 34090 Montpellier, France(Inria、EVERGREEN、蒙彼利埃大学) INRAE, UMR TETIS, University of Montpellier, 34090 Montpellier, France(INRAE、UMR TETIS、蒙彼利埃大学) University of Trento, Trento, Italy(特伦托大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 研究发现现代预训练视觉Transformer违反局部性假设,导致物体内部泄漏,影响基于部分推理的可解释性方法,提出两阶段方法缓解该问题。

Comments 28 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05790 2026-05-08 cs.HC 50%

GazeMind: A Gaze-Guided LLM Agent for Personalized Cognitive Load Assessment

GazeMind:一种基于注视的LLM代理用于个性化认知负荷评估

Bin Wang, Yue Liu, Benjamin Newman, Ajoy S. Fernandes, Zhiyuan Wang, Robert Cavin, Michele A. Cox, Vijay Rajanna, Takumi Bolte, Melissa Hunfalvay, Ulas Bagci, Michael J. Proulx

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出GazeMind,一种基于注视的LLM代理框架,用于智能眼镜上的认知负荷评估。该框架通过编码注视数据为结构化表示,提供可解释的认知负荷预测,并通过新颖的任务引导推理方法实现跨场景泛化,同时利用用户特定特征和历史参考实现个性化适应。

详情

展开后加载摘要…

URL PDF HTML 收藏