arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-20 至 2026-07-20 共收录 22 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 22 篇

2603.19464 2026-07-20 cs.RO 版本更新 85%

Can LLMs Prove Robotic Path Planning Optimality? A Benchmark for Research-Level Algorithm Verification

大语言模型能否证明机器人路径规划的最优性?一种用于研究级算法验证的基准测试

Zhengbang Yang, Md. Tasin Tazwar, Minghan Wei, Zhuangdi Zhu

机构 * George Mason University(乔治梅森大学) Florida Atlantic University(佛罗里达大西洋大学)

专题命中 推理评测 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出首个评估大语言模型在机器人路径规划算法近似比证明能力的基准测试,包含34个研究级证明任务,揭示了LLM在缺乏领域知识时的局限性,并通过上下文补充分析改进推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07019 2026-07-20 stat.ME cs.AI stat.AP stat.ML 版本更新 83%

Latency-Response Theory Model: Evaluating Large Language Models via Response Accuracy and Chain-of-Thought Length

延迟-响应理论模型:通过响应准确性和思维链长度评估大语言模型

Zhiyu Xu, Jia Liu, Yixin Wang, Yuqi Gu

机构 * Department of Statistics, Columbia University(哥伦比亚大学统计系) Department of Statistics, University of Michigan(密歇根大学统计系)

专题命中 推理评测 :chain-of-thought(title);reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 针对大语言模型评估问题,提出延迟-响应理论(LaRT)模型,联合考虑响应准确性和思维链长度,通过引入关键参数建模,推导高效算法估计参数,经理论和模拟研究验证其优势,实际数据评估中表现优于项目反应理论(IRT)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15418 2026-07-20 cs.AI cs.CV 新提交 79%

DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings

DrawingVQA:建筑图纸上多深度视觉文本推理的真实世界基准测试

Yoonhwa Jung, Junryu Fu, Mani Golparvar-Fard

机构 * Louisiana State University(路易斯安那州立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 DrawingVQA针对建筑图纸多深度视觉文本推理设计基准测试,利用图纸与问答对,提出双分类框架评估模型,揭示模型与专家表现差距,为领域特定多模态推理及AI与工程工作流程整合奠定基础。

Comments CVPR 2026 Findings accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08423 2026-07-20 cs.AI 版本更新 79%

OmniFood-Bench: Evaluating VLMs for Nutrient Reasoning and Personalized Health Advice

OmniFood-Bench:评估用于营养推理和个性化健康建议的视觉语言模型

Qian Jiang, Zhecheng Shi, Jingpu Yang, Zirui Song, Miao Fang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 介绍OmniFood-Bench基准评估用于营养推理和个性化健康建议的VLMs,基于MM-Food-100K数据集,评估其三种能力,实验发现模型在菜品命名与质量估计等方面存在“语义-物理差距”,为公共卫生自主智能体建立可信度标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16193 2026-07-20 cs.CV 新提交 78%

Knowing the Self, Understanding the World: A Dual-Cognition Benchmark for UAV Spatio-temporal Reasoning with MLLMs

认识自我,理解世界:用于基于多模态大语言模型的无人机时空推理的双认知基准测试

Like Liu, Zhengzheng Xu, Haitao He, Hongzhe Li, Shuchang Zhang, Dian Shao

机构 * Northwestern Polytechnical University(西北工业大学) China University of Petroleum(中国石油大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 该研究针对多模态大语言模型在无人机场景双认知能力评估不足的问题,提出UAV-DualCog基准测试,涵盖图像和视频任务,通过自动化管道构建数据,评估发现现有模型存在瓶颈,该基准测试有价值。

Comments 11 pages, 4 figures, 7 tables. Project website: https://uav-dualcog.lozumi.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16370 2026-07-20 cs.CL cs.AI cs.CV 版本更新 73%

Brain-CLIPLM: Semantic Compression for EEG-to-Text Decoding

Brain-CLIPLM: 用于EEG到文本解码的语义压缩

Xiaoli Yang, Huiyuan Tian, Yurui Li, Jianyu Zhang, Shijian Li, Gang Pan

机构 * Beijing Institute of Technology, Beijing, China(北京理工大学,北京,中国)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出Brain-CLIPLM框架,通过语义锚点恢复和锚点引导的句子重建,解决EEG信号低信噪比和信息带宽限制的问题,实现了更高的文本检索准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16165 2026-07-20 cs.CV cs.AI cs.CL cs.LG 新提交 67%

An Exam for Active Observers

主动观察者的测试

Jiarui Zhang, Muzi Tao, Shangshang Wang, Ollie Liu, Xuezhe Ma, Willie Neiswanger

机构 * University of Southern California(南加州大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究多模态大语言模型是否具备主动观察能力,引入ActiveVision基准测试,发现前沿模型表现不佳,即便能编写视觉代码差距仍存,表明当前模型缺乏主动视觉观察,呼吁构建闭合感知 - 推理循环的架构和训练目标。

Comments 17 pages, 8 figures, 4 tables. Project page: https://activevision.dev

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19834 2026-07-20 cs.CV 版本更新 67%

KD-Judge: A Knowledge-Driven Automated Judge Framework for Functional Fitness Movements on Edge Devices

KD-Judge:一种基于知识的自动化评判框架,用于边缘设备上的功能性健身动作

Shaibal Saha, Fan Li, Yunge Li, Arun Iyengar, Lucas Alves, Lanyu Xu

机构 * Department of Computer Science and Engineering, Oakland University, Rochester Hills, USA(计算机科学与工程系,奥克兰大学,罗切斯特希尔,美国)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出KD-Judge,一种基于知识的自动化评判框架,用于在边缘设备上对功能性健身动作进行重复标准的自动评判,通过规则结构化和确定性规则系统提高效率和准确性。

Comments Accepted at IEEE/ACM CHASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11889 2026-07-20 cs.CL cs.AI 版本更新 62%

Scaling Point-in-Time Language Models

扩展即时语言模型

Bryan Kelly, Semyon Malamud, Johannes Schwab, Teng Andrea Xu

机构 * Yale School of Management(耶鲁大学管理学院) AQR Capital Management(AQR资产管理公司) NBER(美国国家经济研究局) Swiss Finance Institute(瑞士金融研究所) EPFL(洛桑联邦理工学院) CEPR(经济政策研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究旨在解决大型语言模型的前瞻性偏差问题,通过在大量按时间顺序过滤的令牌上训练仅解码器变压器构建即时语言模型,缩小了与无约束模型的性能差距,经LoRA微调提升可用性,并发布完整管道支持相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10024 2026-07-20 cs.CV cs.AI cs.LG 版本更新 62%

LVSum: A Benchmark for Timestamp-Aware Long Video Summarization

LVSum:一个用于时间感知长视频摘要的基准测试

Alkesh Patel, Melis Ozyildirim, Ying-Chang Cheng, Ganesh Nagarajan

机构 * Apple(苹果公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LVSum基准测试,用于评估长视频摘要中时间对齐的性能,通过引入新的评估指标揭示现有MLLM在时间理解上的系统性差距。

Comments 25 pages, 5 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15768 2026-07-20 cs.CV cs.AI 新提交 57%

GeoChrono: Benchmarking and Rethinking Long-Term Temporal Understanding in Remote Sensing

GeoChrono:遥感中长期时间理解的基准测试与重新思考

Yujie Li, Jiancheng Pan, Zhiwei Wei, Jiuniu Wang, Mugen Peng, Wenjia Xu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Hunan Normal University(湖南师范大学) City University of Hong Kong(香港城市大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对遥感中长期时间理解缺乏系统评估的问题,引入ChronoBench基准。基于评估结果提出GeoChrono模型,设计相关编码器和压缩器并构建训练数据集,该模型在基准测试中性能领先,压缩器有效减少视觉令牌。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15079 2026-07-20 cs.AI 版本更新 57%

BrainPilot: Automating Brain Discovery with Agentic Research

BrainPilot:通过智能研究实现大脑发现自动化

Haoxuan Li, Tianci Gao, Jianhe Li, Yang Fan, Runze Shi, Weiran Wang, Tianxiang Zhao, Zezhao Wu, Xiaoyang Jiang, Qihui Zhang, Jia Li, Xiao Xiao, Kai Du, Xiaoxuan Jia, Chao Xie, Lu Mi

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Shanghai Qizhi Institute(上海期智研究院) Business School, Renmin University of China(中国人民大学商学院) School of Physics, Beihang University(北京航空航天大学物理学院) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) Behavioral and Cognitive Neuroscience Center, Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑科学与智能技术研究院行为与认知神经科学中心) College of Engineering, Georgia Institute of Technology(佐治亚理工学院工程学院) School of Life Sciences & IDG/McGovern Institute for Brain Research, Tsinghua University(清华大学生命科学学院&清华-IDG/麦戈文脑科学研究院) School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院) Weixian College, Tsinghua University(清华大学未央学院) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对脑科学研究整合证据难、人工智能代理有缺陷的问题,提出完全开源的多智能体系统BrainPilot,它有可追溯日志和验证结果,含知识库与技能库,经实验评估,其开源模型以低成本达先进框架性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26614 2026-07-20 cs.HC cs.AI cs.GR 版本更新 57%

HiLSVA: Design and Evaluation of a Human-in-the-Loop Agentic System for Scientific Visualization

HiLSVA:用于科学可视化的人机协同智能系统设计与评估

Kuangshi Ai, Patrick Phuoc Do, Chaoli Wang

机构 * Department of Computer Science and Engineering, University of Notre Dame(Notre Dame 大学计算机科学与工程系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出HiLSVA,一种人机协同智能系统,通过计划优先的多智能体架构、显式人类监督和逐步溯源,支持混合主动的科学可视化工作流,增强而非替代人类分析推理。

Comments IEEE Transactions on Visualization and Computer Graphics (IEEE VIS '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15677 2026-07-20 cs.CL cs.CV 版本更新 57%

VCG-Bench: Towards A Unified Visual-Centric Benchmark for Structured Generation and Editing

VCG-Bench:迈向统一的视觉导向基准,用于结构化生成与编辑

Xiaoyan Su, Peijie Dong, Zhenheng Tang, Song Tang, Yuyao Zhai, Kaitao Lin, Liang Chen, Gai Yuhang, Yuyu Luo, Qiang Wang, Xiaowen Chu

机构 * The Hong Kong University of Science and Technology (GuangZhou)(香港科学与技术大学(广州)) Huawei Technologies Co., Ltd(华为技术有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) South China University of Technology(华南理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出VCG-Bench,一个统一的视觉导向mxGraph任务基准,通过符号逻辑和XML实现精确的图表生成与编辑,解决现有方法在结构化任务中的局限性。

Comments Accepted by ICML2026, 37 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06742 2026-07-20 cs.SE cs.AI 版本更新 57%

Evaluating LLM-Based 0-to-1 Software Generation in End-to-End CLI Tool Scenarios

评估基于LLM的从零开始软件生成在端到端CLI工具场景中的表现

Ruida Hu, Xinchen Wang, Chao Peng, Cuiyun Gao, David Lo

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Independent Researcher, China(独立研究者,中国) Singapore Management University, Singapore(新加坡管理大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出CLI-Tool-Bench基准,用于评估从零生成CLI工具的能力,发现顶级模型成功率低于43%,指出生成代码倾向单体化。

Comments Data link: https://github.com/kinesiatricssxilm14/CLI-Tool-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16105 2026-07-20 cs.CV cs.HC 新提交 50%

Attention-Guided Saliency Maps for Interpreting Visualization Literacy in VLMs

用于解释视觉语言模型中视觉素养的注意力引导显著图

Maeve Hutchinson, Abderrahmane Wassim Mehdaoui, Pranava Madhyastha

机构 * The Alan Turing Institute(艾伦·图灵研究所)

专题命中 推理评测 :reasoning(abstract)

AI总结 研究视觉语言模型如何解释数据可视化这一问题,提出针对图像文本生成的轻量级诊断显著图方法,通过聚合注意力并映射到图像,生成快速无梯度显著图,用删除度量评估,揭示模型注意力分配情况。

Comments To be presented at IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15738 2026-07-20 cs.CY 新提交 50%

EduGuard: A Safe RAG-Based LLM Tutor for Programming Education

EduGuard:一种用于编程教育的基于安全检索增强生成的语言模型导师

S M Asif Hossain, Ruksat Khan Shayoni, M. F. Mridha, Jungpil Shin

专题命中 推理评测 :verifier(abstract)

AI总结 研究针对学生使用GenAI进行编程学习时的问题,提出EduGuard安全RAG辅导框架,集成多种功能。通过构建基准测试并与强基线比较,在正确性、基础等方面表现最佳,能提升准确率并降低过度依赖,证明安全GenAI辅导需多方面保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15283 2026-07-20 cs.IR 新提交 50%

Adaptive Retrieval Strategies for Biomedical Question Answering

生物医学问答的自适应检索策略

Han Yue, Eric Zhou, Alex Hu, Xueshen Li, Yuan Zhang, Jinfeng Zhang

专题命中 推理评测 :reasoning(abstract)

AI总结 研究生物医学问答中不同问题类型的有效检索策略,提出自适应检索框架,依问题类型选检索和证据聚合策略,结合多种技术,经实验验证该策略能提升证据相关性和答案质量,为增强相关问答系统提供有效方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04020 2026-07-20 cs.CV 版本更新 50%

Paired Uterine Whole-Slide Images and Pathology Reports for Multimodal Computational Pathology

用于多模态计算病理学的配对子宫全切片图像和病理报告

Han Li, Jingsong Liu, Ayako Ura, Junlin Hou, Zhengyang Xu, Azar Kazemi, Oskar Thaeter, Christian Grashei, Fabian Gülhan, Reza Nasirigerdeh, Xun Ma, Rui Yan, Hao Chen, S. Kevin Zhou, Nassir Navab, Carolin Mogler, Peter Schüffler

机构 * Institute of Pathology, Technical University of Munich(慕尼黑工业大学病理研究所) Computer Aided Medical Procedures (CAMP), Technical University of Munich(慕尼黑工业大学计算机辅助医疗程序(CAMP)) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Department of Human Pathology, Juntendo University Graduate School of Medicine(顺天堂大学医学研究生院人体病理学部) The Hong Kong University of Science and Technology(香港科技大学) Munich Data Science Institute (MDSI)(慕尼黑数据科学研究所)

专题命中 推理评测 :planning(abstract)

AI总结 研究子宫疾病病理诊断,针对全切片图像与病理报告配对数据集稀缺问题,引入TUM-Uteria数据集,含多对病例及切片级配对,经验证,为计算病理学研究提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20147 2026-07-20 cs.SE 版本更新 50%

Not All Tokens Matter: Data-Centric Optimization for Efficient Code Summarization

并非所有标记都重要:面向高效代码摘要的数据导向优化

Saima Afrin, Zaiyu Cheng, Tushar Sharma, Alexander Serebrenik, Massimiliano Di Penta, Antonio Mastropaolo

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究探讨了系统提示对代码生成任务中ILMs和CLMs性能的影响,发现模型规模越大影响越显著,少样本提示效果优于零样本提示,且Java对提示变化更敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23213 2026-07-20 cs.SE 版本更新 50%

GAPS: Targeted Execution of Android Apps via Static Path Reconstruction

GAPS:通过静态路径重构实现安卓应用的定向执行

Samuele Doria, Alexander Pilgun, Jordan Samhi, Jacques Klein, Eleonora Losiouk

专题命中 推理评测 :reasoning(abstract)

AI总结 研究安卓应用定向执行难题,提出GAPS方法,结合静态程序分析与动态GUI探索,通过反向遍历调用图和数据流推理识别路径并转化为策略,在基准测试和热门应用评估中表现出色,有效且可扩展地解决了定向方法执行问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12620 2026-07-20 cs.SE cs.PL 版本更新 50%

Improving Code Understanding in Large Language Models through Concept-Aware Consistency Learning

通过概念感知一致性学习提高大语言模型中的代码理解能力

Xiaoning Ren, Qiang Hu, Wei Ma, Chongyang Liu, Yan Li, Yao Zhang, Lingxiao Jiang, Yongqiang Lyu, Yinxing Xue

专题命中 推理评测 :reasoning(abstract)

AI总结 研究针对大语言模型对基本编程概念理解浅的问题,引入结合概念感知调整的反事实代码增强框架,经多模型和基准综合评估,证明此方法能引导大语言模型增强概念理解,有效提升其在代码相关任务中的表现。

Comments To appear at IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏