arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-21 至 2026-05-21 共收录 115 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 37 篇

2605.21076 2026-05-21 cs.CL 57%

GradeLegal: Automated Grading for German Legal Cases

GradeLegal: 自动化评分德国法律案例

Abdullah Al Zubaer, Lorenz Wendlinger, Simon Alexander Nonn, Michael Granitzer, Jelena Mitrovic

机构 * University of Passau(帕绍大学) Deggendorf Institute of Technology(德格多夫技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究探讨了大型语言模型能否用于自动化评分德国刑事和公法案例解决方案,通过系统评估27个专有和开源LLM,发现基于样本解决方案和评分标准的提示策略能有效模拟专家评分,尤其在公法领域达到0.91的QWK值,而在刑事法律领域仅为0.60,表明刑事法律评分任务更难。此外,集成方法能进一步提高评分一致性,并为更强的闭源单模型提供替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20833 2026-05-21 cs.CL 57%

MemGym: a Long-Horizon Memory Environment for LLM Agents

MemGym: 一种长时间跨度的记忆环境用于LLM智能体

Wujiang Xu, Yu Wang, Kai Mei, Kaiqu Liang, Zhenting Wang, Mingyu Jin, Han Zhang, Shi-Xiong Zhang, Wenyue Hua, Sambit Sahu, Dimitris N. Metaxas

机构 * Rutgers University(罗杰斯大学) Capital One Princeton University(普林斯顿大学) Microsoft Research(微软研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出MemGym,一种用于评估LLM智能体记忆能力的基准测试环境,通过统一现有智能体 gym 和内部记忆基础管道,提供一个记忆推理接口。MemGym 包含五个评估赛道,涵盖四个智能体领域,能够独立评估记忆性能,排除推理、检索和工具使用能力的干扰。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20742 2026-05-21 cs.AI 57%

VBFDD-Agent for Electric Vehicle Battery Fault Detection and Diagnosis: Descriptive Text Modeling of Battery Digital Signals

VBFDD-Agent 用于电动汽车电池故障检测与诊断:电池数字信号的描述性文本建模

Joey Chan, Zhen Chen, Ershun Pan

机构 * Department of Industrial Engineering and Management, School of Mechanical Engineering, Shanghai Jiao Tong University, Shanghai 200240, China(工业工程与管理系,机械工程学院,上海交通大学,上海200240,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出了一种基于描述性文本建模的电池信号报告方法,用于解决开放源代码电池故障报告数据集稀缺和缺乏统一维护知识表示的问题,通过构建语言语料库来改进电池健康诊断和维护,提出了VBFDD-Agent,整合了描述性电池状态文本、历史案例检索、本地维护手册和大语言模型推理,生成结构化的诊断结果和维护建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20630 2026-05-21 cs.AI 57%

Evaluating Temporal Semantic Caching and Workflow Optimization in Agentic Plan-Execute Pipelines

评估代理计划-执行管道中的时间语义缓存和工作流优化

Alimurtaza Mustafa Merchant, Krish Veera, Sajal Kumar Goyla, Shambhawi Bhure, Dhaval Patel, Kaoutar El Maghraoui

机构 * Columbia University(哥伦比亚大学) IBM IBM Research(IBM研究院)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文研究了在代理计划-执行管道中时间语义缓存和工作流优化的问题,提出两种互补的优化层以提高效率,并展示了其在工业资产操作工作流中的应用效果。

Comments 13 pages, 8 figures, 3 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28103 2026-05-21 cs.DL cs.AI cs.IR 57%

Transcription and Recognition of Italian Parliamentary Speeches Using Vision-Language Models

使用视觉-语言模型进行意大利议会演讲的转录与识别

Luigi Curini, Alfio Ferrara, Giovanni Pagano, Sergio Picascia

机构 * Università degli Studi di Milano(米兰大学) Department of Social and Political Sciences(社会科学系) Department of Literary Studies, Philology and Linguistics(文学研究、语言学与语言学系) Department of Computer Science(计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于视觉-语言模型的 pipeline,用于自动转录、语义分割和实体链接意大利议会演讲,提升转录质量和发言者标注。

Comments to be published in: ParlaCLARIN V: Interoperability, Multilinguality, and Multimodality in Parliamentary Corpora, organized within the 15th Language Resource and Evaluation Conference (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06925 2026-05-21 cs.CV cs.AI 57%

Are Vision-Language Models Ready for Dietary Assessment? Exploring the Next Frontier in AI-Powered Food Image Recognition

视觉-语言模型是否准备好进行饮食评估?探索AI驱动的食品图像识别的下一个前沿

Sergio Romero-Tapiador, Ruben Tolosana, Blanca Lacruz-Pleguezuelos, Laura Judith Marcos Zambrano, Guadalupe X. Bazán, Isabel Espinosa-Salinas, Julian Fierrez, Javier Ortega-Garcia, Enrique Carrillo de Santa Pau, Aythami Morales

机构 * Biometrics and Data Pattern Analytics Lab, Universidad Autonoma de Madrid(生物度量与数据模式分析实验室,马德里自治大学) IMDEA Food, CEI UAM+CSIC(IMDEA食品,CEI UAM+CSIC)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文评估了六种先进的视觉-语言模型在不同层次上的食品识别能力,提出了一个新的评估指标,并展示了FoodNExTDB数据库在饮食评估中的应用潜力。

Comments Accepted at IEEE/CVF Computer Vision and Pattern Recognition Conference workshops 2025 (CVPRw) 10 pages, 4 figures, 2 tables

Journal ref 2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2025, pp. 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20510 2026-05-21 cs.CV cs.AI cs.CY 57%

ShadeBench: A Benchmark Dataset for Building Shade Simulation in Sustainable Society

ShadeBench: 一个用于可持续社会建筑阴影模拟的基准数据集

Longchao Da, Mithun Shivakoti, Xiangrui Liu, T Pranav Kutralingam, Yezhou Yang, Hua Wei

机构 * School of Computing and Augmented Intelligence, Arizona State University(计算与增强智能学院,亚利桑那州立大学) Global Futures Laboratory, Arizona State University(全球未来实验室,亚利桑那州立大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出ShadeBench,一个用于城市阴影理解的综合数据集和基准,通过多模态数据支持阴影生成、分割和3D建筑重建,并提供标准化评估协议和基线方法,为数据驱动的城市气候研究和热适应城市规划提供基础。

Comments 12 pages, 13 figures, 2 tables. Accepted by KDD 2026 AI for Sciences Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20485 2026-05-21 cs.LG 57%

ZEBRA: Zero-shot Budgeted Resource Allocation for LLM Orchestration

ZEBRA: 零样本预算化资源分配用于LLM编排

May Hamri, Inbal Talgam-Cohen

机构 * Tel Aviv University(特拉维夫大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 该研究提出ZEBRA框架,通过将多阶段预算分配转化为连续非线性背包问题,有效解决多智能体流水线中预算分配问题,实验显示其在多个任务上均优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20197 2026-05-21 cs.CL 57%

MedicalBench: Evaluating Large Language Models Toward Improved Medical Concept Extraction

MedicalBench: 评估大型语言模型以改进医疗概念提取

Zhichao Yang, Gregory D. Lyng, Sanjit Singh Batra, Robert E. Tillman

机构 * Optum AI

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出MedicalBench,一个用于评估大型语言模型在医疗概念提取中的表现的基准,重点在于隐含概念的提取和证据 grounding,通过多阶段流程构建数据集并定义两种互补的评估任务,揭示了隐含概念提取的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09174 2026-05-21 cs.CL 57%

Facet-Level Tracing of Evidence Uncertainty and Hallucination in RAG

面向证据不确定性和幻觉的面级追踪(RAG)

Passant Elchafei, Monorama Swain, Shahed Masoudian, Markus Schedl

机构 * Johannes Kepler University Linz(约翰内斯·开普勒大学林茨) Linz Institute of Technology(林茨技术学院) Institute of Computational Perception(计算感知研究所) Artificial Intelligence Lab(人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种面向问答任务的面级诊断框架,通过分解每个输入问题为原子推理面,评估证据充分性和基础性,揭示RAG系统中幻觉产生的根源在于生成过程中证据整合的方式,而非检索准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20676 2026-05-21 cs.CV 50%

VISTAQA: Benchmarking Joint Visual Question Answering and Pixel-Level Evidence

VISTAQA: 评估联合视觉问答与像素级证据

Mozhgan Nasr Azadani, Yimu Wang, Yongpeng Zhu, Lihong Chen, Milan Ganai, Sean Sedwards, Marco Pavone, Krzysztof Czarnecki

机构 * University of Waterloo(滑铁卢大学) Stanford University(斯坦福大学) NVIDIA(英伟达)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出VISTAQA基准,用于评估视觉问答中自由回答的正确性和像素级证据的定位,通过引入GROVE指标,强调回答正确性与视觉证据对齐的重要性,实验显示现有系统在该指标下表现有限,揭示了回答准确性和视觉证据对齐之间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20544 2026-05-21 cs.RO cs.CV 50%

The Yes-Man Syndrome: Benchmarking Abstention in Embodied Robotic Agents

顺从综合征:具身机器人代理中的退避基准测试

Doguhan Yeke, Elif Su Temirel, Ananth Shreekumar, Brandon Lee, Dongyan Xu, Z Berkay Celik

机构 * Purdue University(普渡大学) Bilkent University(比尔肯特大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出了一种用于具身机器人代理的退避基准测试框架RoboAbstention,通过五种机器人数据集中的图像生成退避指令,评估了多个前沿VLMs在退避任务中的表现,并探讨了改进退避性能的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05253 2026-05-21 cs.IR 50%

EnterpriseRAG-Bench: A RAG Benchmark for Company Internal Knowledge

EnterpriseRAG-Bench: 一个用于企业内部知识的RAG基准测试

Yuhong Sun, Joachim Rahmfeld, Chris Weaver, Weijia Chen, Roshan Desai, Wenxi Huang, Mark H. Butler

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出EnterpriseRAG-Bench,一个包含50万文档和500个问题的基准测试,用于评估和比较基于检索增强生成(RAG)方法在企业内部知识处理中的性能。

Comments Code and dataset available at https://github.com/onyx-dot-app/EnterpriseRAG-Bench or https://huggingface.co/datasets/onyx-dot-app/EnterpriseRAG-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 12 篇

2605.20194 2026-05-21 cs.CL cs.AI cs.LG 82%

Parallel LLM Reasoning for Bias-Resilient, Robust Conceptual Abstraction

并行大语言模型推理用于偏见鲁棒、稳健的概念抽象

Aisvarya Adeseye, Jouni Isoaho, Adeyemi Adeseye

机构 * University of Turku, Turku, Finland(图尔库大学,芬兰图尔库) Brilloconnetz Partners avoin yhtiö, Turku, Finland(Brilloconnetz Partners 公司,芬兰图尔库)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种结合并行分块处理与证据锚定整合的结构化框架,旨在减少长文档分析中的偏见、遗漏误差和过度泛化问题,通过并行处理和证据锚定提高文本分析的可靠性和可扩展性。

Comments Accepted to be Published in 12th Intelligent Systems Conference 2026, 3-4 September 2026 in Amsterdam, The Netherlands

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09860 2026-05-21 cs.AI 79%

When to Re-Commit: Temporal Abstraction Discovery for Long-Horizon Vision-Language Reasoning

何时重新承诺:为长时间视觉-语言推理发现时间抽象

Chen Li, Zhantao Yang, Fangyi Chen, Han Zhang, Anudeepsekhar Bolimera, Marios Savvides

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出了一种可学习的状态条件化承诺深度方法,用于长时间视觉-语言推理任务,通过动态调整承诺深度,提高了求解率并减少了基本动作数量,优于固定深度基线和现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09001 2026-05-21 cs.CL cs.AI cs.LG 67%

Retrospective Sparse Attention for Efficient Long-Context Generation

回顾性稀疏注意力用于高效长上下文生成

Seonghwan Choi, Beomseok Kang, Dongwon Jo, Jae-Joon Kim

机构 * Seoul National University(首尔国立大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RetroAttention,一种新的KV缓存更新技术,通过回顾后续解码步骤的KV条目来修正过去的注意力输出,从而提高长上下文生成的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09492 2026-05-21 cs.CL cs.AI 62%

APCD: Adaptive Path-Contrastive Decoding for Reliable Large Language Model Generation

APCD:自适应路径对比解码用于可靠的大型语言模型生成

Tianyu Zheng, Hong Wu, Jiaji Zhong

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种自适应路径对比解码方法,通过自适应探索和受控路径交互提高大型语言模型生成的可靠性,实验表明在保持解码效率的同时提升了事实准确性。

Comments This paper has been withdrawn by the author to resolve a conflict of interest/compliance issue

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20924 2026-05-21 cs.CL cs.AI 62%

Strategy-Induct: Task-Level Strategy Induction for Instruction Generation

Strategy-Induct: 任务级策略诱导用于指令生成

Po-Chun Chen, Hen-Hsen Huang, Hsin-Hsi Chen

机构 * Department of Computer Science and Information Engineering, National Taiwan University, Taiwan(国立台湾大学计算机科学与资讯工程学系) Institute of Information Science, Academia Sinica, Taiwan(台湾“中央研究院”资讯科学研究所) AI Research Center (AINTU), National Taiwan University, Taiwan(国立台湾大学人工智能研究中心)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出了一种任务级策略诱导方法Strategy-Induct,通过仅使用少量示例问题生成任务指令,无需依赖标注答案,从而在指令生成任务中取得优于现有方法的性能。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06139 2026-05-21 cs.LG cs.AI 62%

Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex

列表式策略优化:基于组的RLVR作为LLM响应单纯形上的目标投影

Yun Qu, Qi Wang, Yixiu Mao, Heming Zou, Yuhang Jiang, Yingyue Li, Wutong Xu, Lizhou Cai, Weijie Liu, Clive Bai, Kai Yang, Yangkun Chen, Saiyong Yang, Xiangyang Ji

机构 * Department of Automation, Tsinghua University(清华大学自动化系) LLM Department, Tencent(腾讯LLM部门)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出列表式策略优化(LPO),通过显式执行目标投影来解构隐式目标,利用响应单纯形限制近端RL目标,并通过精确散度最小化进行策略投影,从而在多样推理任务和LLM基础上提升训练性能,同时保持优化稳定性和响应多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20863 2026-05-21 cs.DC cs.LG 57%

PlexRL: Cluster-Level Orchestration of Serviceized LLM Execution for RLVR

PlexRL: 服务化大语言模型执行在RLVR中的集群级编排

Yiqi Zhang, Fangzheng Jiao, Tian Tang, Boyu Tian, Hangyu Wang, Qiaoling Chen, Guoteng Wang, Zhen Jiang, Peng Sun, Ping Zhang, Xiaohe Hu, Ziming Liu, Menghao Zhang, Yanmin Jia, Yang You, Siyuan Feng

机构 * National University of Singapore(新加坡国立大学) Beihang University(北航) Shanghai Qiji Zhifeng Co., Ltd.(上海启智风科技有限公司) Nanyang Technological University(南洋理工大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出PlexRL,通过集群级编排服务化大语言模型执行,解决RLVR训练中的效率问题,提升集群容量并降低GPU小时成本,同时保持算法灵活性和最小的单任务开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20809 2026-05-21 cs.CL 57%

Refining and Reusing Annotation Guidelines for LLM Annotation

对LLM注释的注释指南进行细化和重用

Kon Woo Kim, Jin-Dong Kim, Akiko Aizawa

机构 * The Graduate University for Advanced Studies, SOKENDAI(Graduate University for Advanced Studies, SOKENDAI) National Institute of Informatics (NII)(National Institute of Informatics) BioData Science Initiative (BSI), National Institute of Genetics (NIG)(BioData Science Initiative (BSI), National Institute of Genetics)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种系统性的注释指南重用和细化方法,通过迭代审核框架来对LLM注释进行改进,并在生物医学NER任务中验证了指南整合的有效性、推理优化模型的优势以及在最小监督下的审核可行性。

Comments 14 pages, 7 figures. Accepted to the ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10673 2026-05-21 cs.IR 50%

Breaking User-Centric Agency: A Tri-Party Framework for Agent-Based Recommendation

打破以用户为中心的代理:一个三方框架用于基于代理的推荐

Yaxin Gong, Chongming Gao, Chenxiao Fan, Haoyan Liu, Wenjie Wang, Jianshan Sun, Yangyang Li, Fuli Feng, Xiangnan He

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出一个三方框架TriRec,用于基于代理的推荐系统,旨在协调用户效用、物品曝光和平台层面的公平性,从而提高推荐系统的准确性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21239 2026-05-21 cs.MM 50%

Multimodal Emotion Recognition with Large Language Models

基于大语言模型的多模态情感识别

Hongrui Zhang, Daiqing Wu, Yangyang Li, Kuien Liu, Yuhui Wang, Yu Zhou, Sicheng Zhao

专题命中 其他推理 :reasoning(abstract)

AI总结 本文探讨了多模态情感识别中利用大语言模型的范式,总结了现有研究在情感数据增强、多模态情感表示和多模态情感推理三个方向上的进展与挑战,旨在为该领域的发展提供清晰的学术路线图。

Comments Accepted by IJCAI 2026 Survey Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20818 2026-05-21 cs.CV 50%

OSGNet with MLLM Reranking @ Ego4D Episodic Memory Challenge 2026

OSGNet with MLLM Reranking @ Ego4D Episodic Memory Challenge 2026

Yisen Feng, Leigang Qu, Haoyu Zhang, Qiaohui Chu, Meng Liu, Xuemeng Song, Weili Guan, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) National University of Singapore(新加坡国立大学) Pengcheng Laboratory(鹏城实验室) Shandong Jianzhu University(山东建筑大学) Southern University of Science and Technology(南方科技大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出一种基于多模态大语言模型(MLLM)的重排序框架,用于解决Ego4D事件记忆挑战2026中的自然语言查询和目标步 tracks,通过结合现有定位模型OSGNet的候选片段和MLLM的视频-语言推理能力,提升时间片段的定位精度。

Comments Champion solution for the Natural Language Queries and GoalStep tracks of the Ego4D Challenge at the CVPR EgoVis Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20548 2026-05-21 cs.MA 50%

What Do Agents Communicate? Characterizing Information Exchange in Multi-Agent Systems

智能体通信什么?多智能体系统中信息交换的特征化

Yong Jin Chun, Iftekhar Ahmed

专题命中 其他推理 :reasoning(abstract)

AI总结 本文研究了多智能体系统中信息交换的核心问题,发现缺乏推理和验证的信息会显著降低性能,并提出了一种增强技术来恢复通信中的关键信息,从而提高了系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏