arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-03 至 2026-04-03 共收录 27 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 27 篇

2604.01657 2026-04-03 cs.CL 83%

What Do Claim Verification Datasets Actually Test? A Reasoning Trace Analysis

声明验证数据集实际上测试什么?一种推理跟踪分析

Delip Rao, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.CL

AI总结 研究通过分析24K个验证案例的推理轨迹,发现数据集主要测试直接证据提取,而多句综合和数值推理不足,不同领域存在显著偏差,提出改进评估体系的建议。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01754 2026-04-03 cs.CL cs.AI cs.LG 82%

LiveMathematicianBench: A Live Benchmark for Mathematician-Level Reasoning with Proof Sketches

LiveMathematicianBench: 一个用于数学家级推理的实时基准

Linyang He, Qiyao Yu, Hanze Dong, Baohao Liao, Xinxing Xu, Micah Goldblum, Jiang Bian, Nima Mesgarani

机构 * Columbia University(哥伦比亚大学) Microsoft Research(微软研究院) University of Amsterdam(阿姆斯特丹大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LiveMathematicianBench,一个基于近期arXiv论文的动态多选基准,用于评估大语言模型的数学推理能力,通过证明草图指导的干扰项生成机制,提升对真实理解的检测。

Comments Project page: https://livemathematicianbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12957 2026-04-03 cs.CV 82%

Adaptive Reinforcement for Open-ended Medical Reasoning via Semantic-Guided Reward Collapse Mitigation

通过语义引导的奖励崩溃缓解实现自适应的开放性医疗推理

Yizhou Liu, Dingkang Yang, Zizhi Chen, Minghao Han, Xukun Zhang, Keliang Liu, Jingwei Wei, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Fysics Intelligence Technologies Co., Ltd. (Fysics AI)(菲斯克智能科技有限公司(菲斯克AI)) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本文提出ARMed框架,通过监督微调和强化优化提升开放性医疗VQA的推理一致性和事实准确性,实验表明其在六个医疗VQA基准上显著提升准确性和泛化能力。

Comments Accept to 2026 CVPR Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12864 2026-04-03 cs.CL cs.AI cs.LG 82%

LEXam: Benchmarking Legal Reasoning on 340 Law Exams

LEXam:基于340法律考试的法律推理基准测试

Yu Fan, Jingwei Ni, Jakob Merane, Yang Tian, Yoan Hermstrüwer, Yinya Huang, Mubashara Akhtar, Etienne Salimbeni, Florian Geering, Oliver Dreyer, Daniel Brunner, Markus Leippold, Mrinmaya Sachan, Alexander Stremitzer, Christoph Engel, Elliott Ash, Joel Niklaus

机构 * ETH Zurich(苏黎世联邦理工学院) University of Zurich(苏黎世大学) University of Lausanne(洛桑大学) Max Planck Institute for Research on Collective Goods(马克斯·普朗克集体物品研究所) Omnilex University of St. Gallen(圣加仑大学) Swiss Federal Supreme Court(瑞士联邦最高法院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LEXam基准测试通过340法律考试数据,包含7537道英语和德语法律考试题目,涵盖多种法律课程和学位级别,旨在评估大语言模型在长文本法律推理中的挑战与性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16082 2026-04-03 q-bio.QM cs.AI cs.LG 81%

BIOGEN: Evidence-Grounded Multi-Agent Reasoning Framework for Transcriptomic Interpretation in Antimicrobial Resistance

BIOGEN:基于证据的多智能体推理框架用于抗菌药物耐药性中的转录组解释

Elias Hossain, Mehrdad Shoeibi, Ivan Garibay, Niloofar Yousefi

机构 * College of Engineering and Computer Science, University of Central Florida(中佛罗里达大学工程与计算机科学学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 BIOGEN通过结合生物信息检索、结构化推理和多批评验证,生成可追溯的转录组模块解释,其在抗菌药物耐药性研究中表现出强生物学基础和零幻觉率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01634 2026-04-03 cs.LG cs.CL 81%

CRIT: Graph-Based Automatic Data Synthesis to Enhance Cross-Modal Multi-Hop Reasoning

CRIT: 基于图的自动数据合成以增强跨模态多跳推理

Junyoung Sung, Seungwoo Lyu, Minjun Kim, Sumin An, Arsha Nagrani, Paul Hongsuck Seo

机构 * Dept. of CSE, Korea University(高丽大学计算机科学与工程系) Google DeepMind(谷歌DeepMind)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 CRIT通过图基自动管道生成复杂跨模态推理任务,提升多跳推理能力,实验表明先进模型在该任务上表现欠佳,训练于CRIT的模型在SPIQA等基准上显著提升。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12797 2026-04-03 cs.CV cs.AI cs.CL 81%

KARL: Knowledge-Aware Reasoning and Reinforcement Learning for Knowledge-Intensive Visual Grounding

KARL:面向知识密集型视觉定位的知识感知推理与强化学习

Xinyu Ma, Ziyang Ding, Zhicong Luo, Chi Chen, Zonghao Guo, Derek F. Wong, Zhen Zhao, Xiaoyi Feng, Maosong Sun

机构 * University of Macau(澳门大学) Shandong University(山东大学) Northwestern Polytechnical University(西北工业大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出KARL框架,通过知识引导的推理数据和强化学习方法,提升模型在知识密集型视觉定位任务中的表现,实现跨领域泛化能力的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01916 2026-04-03 cs.CL 79%

SURE: Synergistic Uncertainty-aware Reasoning for Multimodal Emotion Recognition in Conversations

SURE:用于对话中多模态情绪识别的协同不确定性推理

Yiqiang Cai, Chengyan Wu, Bolei Ma, Bo Chen, Yun Xue, Julia Hirschberg, Ziwei Gong

机构 * Guangdong Provincial Key Laboratory of Quantum Engineering and Quantum Materials(广东省量子工程与量子材料重点实验室) School of Electronic Science and Engineering (School of Microelectronics), South China Normal University(华南师范大学电子科学与工程学院(微电子学院)) Shenzhen University(深圳大学) Columbia University(哥伦比亚大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 SURE通过整合多模态信号并增强鲁棒性和上下文建模,改进了对话中情绪识别的不确定性处理和细粒度推理能力。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01711 2026-04-03 cs.CL 79%

Human-Guided Reasoning with Large Language Models for Vietnamese Speech Emotion Recognition

基于大语言模型的人机协同推理用于越南语语音情感识别

Truc Nguyen, Then Tran, Binh Truong, Phuoc Nguyen T. H

机构 * University of Information Technology, Ho Chi Minh City, Vietnam(越南胡志明市信息技术大学) Vietnam National University Ho Chi Minh City, Ho Chi Minh City, Vietnam(越南胡志明市国家大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出一种融合人类知识的语音情感识别框架,通过LLM推理处理模糊样本,提升低资源环境下的情感分类性能,达到86.59%的准确率。

Comments 6 pages, 2 figures. Dataset of 2,764 Vietnamese speech samples across three emotion classes

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01639 2026-04-03 cs.CL 79%

Fragile Reasoning: A Mechanistic Analysis of LLM Sensitivity to Meaning-Preserving Perturbations

脆弱的推理:对大语言模型对意义保持扰动敏感性的机制分析

Shou-Tzu Han, Rodrigue Rizk, KC Santosh

机构 * University of South Dakota(南达科他大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 研究评估了三种大语言模型在数学推理任务中的表现,发现其对意义保持的表面扰动敏感,提出MPD框架分析失败机制,提出三种故障分类并验证修复效果。

Comments Preprint. Under review at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08640 2026-04-03 cs.SE cs.AI 79%

Automating Android Build Repair: Bridging the Reasoning-Execution Gap in LLM Agents with Domain-Specific Tools

自动化Android构建修复:通过领域特定工具弥合LLM代理中的推理-执行差距

Ha Min Son, Huan Ren, Xin Liu, Zhe Zhao

机构 * University of California, Davis(加州大学戴维斯分校) CodeDroid LLC(CodeDroid有限责任公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出AndroidBuildBench基准和GradleFixer工具,通过领域特定抽象提升LLM修复Android构建错误的效率,解决LLM在低层执行中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23824 2026-04-03 cs.CL 79%

Reviewing Scientific Papers for Critical Problems With Reasoning LLMs: Baseline Approaches and Automatic Evaluation

利用推理LLM审查科学论文中的关键问题:基线方法与自动评估

Tianmai M. Zhang, Neil F. Abernethy

机构 * University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出利用推理LLM作为论文质量检查器,介绍基线方法和自动评估框架,通过arXiv论文验证方法,并评估其在识别科学论文关键错误中的性能。

Comments Accepted and presented at NeurIPS 2025 AI for Science Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01988 2026-04-03 cs.AI 70%

SenseMath: Do LLMs Have Number Sense? Evaluating Shortcut Use, Judgment, and Generation

SenseMath: 大语言模型有数感吗?评估快捷方式的使用、判断和生成

Haomin Zhuang, Xiangqi Wang, Yili Shen, Ying Cheng, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 研究通过SenseMath基准测试评估大语言模型在数值推理中的结构敏感性,发现模型在提示下能有效使用快捷方式,但在标准提示下仅在少数情况下应用,且无法生成有效问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01259 2026-04-03 cs.RO 67%

Bench2Drive-VL: Benchmarks for Closed-Loop Autonomous Driving with Vision-Language Models

Bench2Drive-VL: 用于基于视觉语言模型的闭环自动驾驶的基准测试

Xiaosong Jia, Yuqian Shao, Zhenjie Yang, Qifeng Li, Zhiyuan Zhang, Junchi Yan

机构 * Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身智能重点实验室)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出Bench2Drive-VL,通过闭环评估方法提升视觉语言模型在自动驾驶中的性能,包含DriveCommenter生成多样化问题对、统一协议接口、灵活推理框架及完整开发生态,开源代码和标注数据。

Comments All codes and annotated datasets are available at \url{https://github.com/Thinklab-SJTU/Bench2Drive-VL} and \url{https://huggingface.co/datasets/Telkwevr/Bench2Drive-VL-base}

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18123 2026-04-03 cs.CV cs.AI cs.CL cs.LG 67%

Bias Is a Subspace, Not a Coordinate: A Geometric Rethinking of Post-hoc Debiasing in Vision-Language Models

偏差是子空间,而非坐标:视觉-语言模型中事后去偏的几何重思

Dachuan Zhao, Weiyue Li, Zhenda Shen, Yushu Qiu, Bowen Xu, Haoyu Chen, Yongchao Chen

机构 * Harvard University(哈佛大学) MIT(麻省理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SPD框架,通过几何方法识别并去除线性可解码的偏子空间,提升视觉-语言模型的公平性与任务性能。

Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01504 2026-04-03 cs.CL cs.AI cs.CY 62%

Magic, Madness, Heaven, Sin: LLM Output Diversity is Everything, Everywhere, All at Once

魔术、疯狂、天堂、罪恶:LLM输出多样性无处不在

Harnoor Dhingra

机构 * Microsoft(微软)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Magic, Madness, Heaven, Sin框架,从四个规范性场景分析LLM输出多样性,揭示任务目标对输出多样性的影响,强调需基于任务目标进行多样性评估。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01966 2026-04-03 cs.CV cs.AI cs.RO 57%

Ego-Grounding for Personalized Question-Answering in Egocentric Videos

面向第一视角视频的个性化问答中的自我定位

Junbin Xiao, Shenglang Zhang, Pengxiang Zhu, Angela Yao

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出MyEgo数据集,用于评估多模态大语言模型在需要自我定位的个性化问答中的能力,发现现有模型在自我记忆和推理方面存在显著不足。

Comments To appear at CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01379 2026-04-03 cs.SI cs.AI 57%

Can LLMs Predict Academic Collaboration? Topology Heuristics vs. LLM-Based Link Prediction on Real Co-authorship Networks

大语言模型能预测学术合作吗?拓扑启发式方法与基于LLM的链接预测在真实合著网络中的比较

Fan Huang, Munjung Kim

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了大语言模型能否通过作者资料预测未来学术合作,发现LLM与拓扑启发式方法捕捉不同信号,在互补场景中表现最佳,且在不平衡数据中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01298 2026-04-03 cs.LG 57%

Forecasting Supply Chain Disruptions with Foresight Learning

利用前瞻性学习预测供应链中断

Benjamin Turtel, Paul Wilczewski, Kris Skotheim

机构 * Lightning Rod Labs(闪电杆实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出一种端到端框架,通过真实中断结果训练LLM生成校准的概率预测,优于基线模型,在准确性、校准和精确度上表现突出,展示了结构化概率推理的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01235 2026-04-03 cs.AI 57%

Runtime Burden Allocation for Structured LLM Routing in Agentic Expert Systems: A Full-Factorial Cross-Backend Methodology

结构化大语言模型路由在代理专家系统中的运行时负担分配:一种全因子跨后端方法论

Zhou Hanlin, Chan Huah Yong

机构 * School of Computer Sciences, Universiti Sains Malaysia (USM)(马来西亚理科大学计算机科学学院) Xiamen Software Vocational & Technical College(厦门软件职业技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了结构化LLM路由在代理专家系统中的负担分配问题,提出了一种全因子跨后端方法论,通过全面评估不同后端配置下的性能,揭示了后端特定交互效应对性能的主导作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22862 2026-04-03 cs.SE cs.CL 57%

The Evolution of Tool Use in LLM Agents: From Single-Tool Call to Multi-Tool Orchestration

大语言模型代理中工具使用的演变:从单工具调用到多工具编排

Haoyuan Xu, Chang Li, Xinyan Ma, Xianhao Ou, Zihan Zhang, Tao He, Xiangyu Liu, Zixiang Wang, Jiafeng Liang, Zheng Chu, Runxuan Liu, Rongchuan Mu, Dandan Tu, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Harvard University(哈佛大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 推理评测 :planning(abstract);分类 cs.CL

AI总结 本文探讨了大语言模型代理中工具使用从单次调用到长期编排的演变,分析了多工具代理的最新进展,涵盖任务规划、安全控制、效率优化及实际应用等领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21687 2026-04-03 cs.AI 57%

MIRAGE: The Illusion of Visual Understanding

MIRAGE:视觉理解的幻觉

Mohammad Asadi, Jack W. O'Sullivan, Fang Cao, Tahoura Nedaee, Kamyar Rajabalifardi, Fei-Fei Li, Ehsan Adeli, Euan Ashley

机构 * Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究揭示多模态AI系统在视觉-语言推理中的漏洞,指出模型能生成未提供图像的详细描述及推理,挑战现有假设,提出B-Clean作为公平评估方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11812 2026-04-03 cs.AI 57%

Predicting LLM Output Length via Entropy-Guided Representations

通过熵引导表示预测LLM输出长度

Huanyi Xie, Yubin Chen, Liangyu Wang, Lijie Hu, Di Wang

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Provable Responsible AI and Data Analytics (PRADA) Lab(可验证负责任人工智能与数据分析实验室) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出熵引导标记池化和渐进长度预测方法,有效减少LLM推理中的计算浪费,提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08462 2026-04-03 cs.AI 57%

M3-BENCH: Process-Aware Evaluation of LLM Agents' Social Behaviors in Mixed-Motive Games

M3-BENCH:混合动机游戏中LLM代理社会行为过程感知评估

Sixiong Xie, Zhuofan Shi, Haiyang Shen, Yun Ma, Xiang Jing

机构 * Peking University(北京大学) National Key Laboratory of Data Space Technology and System(数据空间技术与系统全国重点实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 M3-BENCH通过24个混合动机游戏,从行为轨迹、推理过程和沟通内容三个视角评估LLM代理的社会能力,揭示了仅关注结果的评估方法无法捕捉到的社交能力差异,尤其是推理模型在内部 deliberation 与有效沟通之间的矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14870 2026-04-03 cs.CV eess.IV 50%

HERBench: A Benchmark for Multi-Evidence Integration in Video Question Answering

HERBench:视频问答中多证据整合的基准

Dan Ben-Ami, Gabriele Serussi, Kobi Cohen, Chaim Baskin

机构 * INSIGHT Lab, Ben-Gurion University of the Negev(本-古里安大学 INSIGHT 实验室) Ben-Gurion University of the Negev(本-古里安大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 HERBench通过要求至少三个非重叠视频片段线索,推动视频问答中多证据整合的研究,评估13种最新视频大语言模型,发现其准确率仅31-42%,揭示检索与融合两大瓶颈。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01572 2026-04-03 cs.CR 50%

AI-Assisted Hardware Security Verification: A Survey and AI Accelerator Case Study

AI辅助的硬件安全验证:综述与AI加速器案例研究

Khan Thamid Hasan, Md Ajoad Hasan, Nashmin Alam, Md. Touhidul Islam, Upoma Das, Farimah Farahmandi

专题命中 推理评测 :reasoning(abstract)

AI总结 本文综述了AI辅助硬件安全验证的最新进展,通过NVDLA案例研究展示AI在自动化验证流程中的应用,强调AI输出需基于仿真证据和形式验证确保可信安全。

Comments This paper will be presented at IEEE VLSI Test Symposium (VTS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01569 2026-04-03 cs.CV cs.MM 50%

VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification

VideoZeroBench: 通过时空证据验证探测视频多模态大语言模型的极限

Jiahao Meng, Tan Yue, Qi Xu, Haochen Wang, Zhongwei Ren, Weisong Liu, Yuhao Wang, Renrui Zhang, Yunhai Tong, Haodong Duan

机构 * PKU(北京大学) WHU(武汉大学) CASIA(中国科学院自动化研究所) BJTU(北京交通大学) CUHK(香港中文大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 VideoZeroBench通过严格验证时空证据,揭示视频多模态大语言模型在长视频问答中的不足,发现即使在标准设置下,模型正确率也低于17%,且在严格约束下性能显著下降,凸显了基于证据的视频理解仍是瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏