arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-04 至 2026-06-04 共收录 28 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 28 篇

2510.08647 2026-06-04 cs.CL cs.AI 91%

Can Reasoning Path still be Effective as Input? Bridging Post-Reasoning to Chain-of-Thought Compression

推理路径作为输入仍然有效吗?将后推理与思维链压缩连接起来

Chengzhengxu Li, Xiaoming Liu, Zhaohan Zhang, Shengchao Liu, Guoxin Ma, Yu Lan, Cong Wang, Chao Shen

机构 * Faculty of Electronic and Information Engineering, Xi’an Jiaotong University(西安交通大学电子与信息工程学院) Queen Mary University of London(伦敦大学玛丽女王学院) City University of Hong Kong(香港城市大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出后推理范式,通过将思维链作为上下文输入来简化推理任务,并设计UCoT框架训练轻量级压缩器生成软令牌形式的上下文思维链,从而在保持推理能力的同时显著压缩输出长度。

Comments ACL 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03660 2026-06-04 cs.AI 83%

From Answers to States: Verifiable Process-Level Evaluation of Chemical Reasoning in Large Language Models

从答案到状态:大语言模型中化学推理的可验证过程级评估

Hongyu Guo, Hao Li, He Cao, Gongbo Zhang, Li Yuan

机构 * Peking University, Shenzhen Graduate School(北京大学深圳研究生院) International Digital Economy Academy (IDEA)(国际数字经济学院)

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 提出ChemCoTBench-V2基准,通过确定性规则和参考轨迹验证结构化化学推理步骤,揭示模型在最终答案正确性与推理状态一致性之间的差距。

Comments 23 pages, 6 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17315 2026-06-04 cs.AI cs.CL cs.LG 82%

Longer Context, Deeper Thinking: Uncovering the Role of Long-Context Ability in Reasoning

更长上下文,更深思考:揭示长上下文能力在推理中的作用

Wang Yang, Zirui Liu, Hongye Jin, Qingyu Yin, Vipin Chaudhary, Xiaotian Han

机构 * Case Western Reserve University(凯斯西储大学) University of Minnesota - Twin Cities(明尼苏达大学双城分校) Texas A&M University(德克萨斯阿姆大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过实验发现,增强模型的长上下文能力(在监督微调前)能显著提升推理性能,即使对于短输入任务也有泛化收益,表明长上下文建模是推理能力的关键基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04503 2026-06-04 cs.LG cs.AI 81%

Smart Picks in the Dark: Towards Efficient RLVR for Reasoning via Tracing Metacognitive Pivots

暗中选择:通过追踪元认知支点实现高效的推理可验证奖励强化学习

Guangcheng Zhu, Shenzhi Yang, Haobo Wang, Xing Zheng, Yingfan MA, Xuening Feng, Zhongqi Chen, Bowen Song, Weiqiang Wang, Gang Chen

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 针对可验证奖励强化学习(RLVR)中数据效率低的问题,提出PivotTrace框架,利用注意力动态追踪推理过程中的元认知支点,通过支点密度量化不确定性实现数据自动分流,在仅使用29.3%标注样本和2.75倍收敛加速下超越全监督模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04442 2026-06-04 cs.CL cs.AI 81%

MemoryDocDataSet: A Benchmark for Joint Conversational Memory and Long Document Reasoning

MemoryDocDataSet: 联合对话记忆与长文档推理的基准测试

Qiyang Xie, Jialun Wu, Xinjie He, Su Liu, Shuai Xiao, Zhiyuan Lin, Weikai Zhou

机构 * Northeastern University(东北大学) Johns Hopkins University(约翰霍普金斯大学) Columbia University(哥伦比亚大学) Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出MemoryDocDataSet合成基准,包含50个微世界和1000个QA对,评估系统同时处理多轮对话历史和长文档阅读理解的能力,其中75.1%的问题需要混合推理(先导航对话历史再提取文档答案),实验显示联合检索存在明显差距。

Comments 17 pages, 2 figures, 8 tables. Submitted for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05722 2026-06-04 cs.CL cs.AI 81%

OckBench: Measuring the Efficiency of LLM Reasoning

OckBench:衡量LLM推理效率

Zheng Du, Hao Kang, Song Han, Tushar Krishna, Ligeng Zhu

机构 * Georgia Institute of Technology(佐治亚理工学院) Massachusetts Institute of Technology(麻省理工学院) NVIDIA(英伟达)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出OckBench基准,联合评估推理和编码任务中的准确性与token效率,揭示当前模型token利用率低下问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04986 2026-06-04 cs.CV 80%

Food-R1: A Unified Multi-Task Food Vision-Language Model with Reinforcement Learning

Food-R1: 一种基于强化学习的统一多任务食品视觉语言模型

Yu Zhu, Yongkang Li, Wenjie Zhu, Haoyi Jiang, Wenyu Liu, Wei Yang, Bin Li, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 针对现有食品视觉语言模型依赖监督微调导致推理和泛化能力受限以及营养标注稀缺的问题,提出包含链式思维标注的大规模基准CalorieBench-80K和基于强化微调(GRPO)的统一多任务食品视觉语言模型Food-R1,在食品相关任务上持续超越强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04751 2026-06-04 cs.AI 79%

FALSIFYBENCH: Evaluating Inductive Reasoning in LLMs with Rule Discovery Games

FALSIFYBENCH: 通过规则发现游戏评估大语言模型中的归纳推理

Leonardo Bertolazzi, Katya Tentori, Raffaella Bernardi

机构 * University of Trento(特伦托大学) Free University of Bozen-Bolzano(博泽-博尔扎诺自由大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出FALSIFYBENCH框架,基于Wason 2-4-6任务评估LLM在假设生成、证据收集和信念修正方面的归纳推理能力,发现推理模型优于指令微调模型,且主动寻求证伪的负测试策略是成功的关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04466 2026-06-04 cs.CL 79%

Learning What to Learn: Stage-Specific Data Sets for SFT-then-RL in Small Language Model Reasoning

学习什么:小语言模型推理中SFT-then-RL的阶段特定数据集

Chongyang He, Rui Zhang, Zixuan Wang, Xin Li

机构 * Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) DiDi(滴滴出行) University of Electronic Science and Technology of China(电子科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出一种难度感知的SFT-then-RL框架,通过阶段特定数据集(SFT阶段使用桥接机制,RL阶段使用批判微调)协调数据难度,提升小语言模型推理性能。

Comments 25 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19852 2026-06-04 cs.CL 79%

Are Tools Always Beneficial? Learning to Invoke Tools Adaptively for Dual-Mode Multimodal LLM Reasoning

工具总是有益的吗?学习自适应调用工具以实现双模式多模态大语言模型推理

Qinghe Ma, Zhen Zhao, Yiming Wu, Jian Zhang, Lei Bai, Yinghuan Shi

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出AutoTool模型,通过强化学习框架自适应决定是否调用工具,结合双模式推理策略和模式特定奖励函数,在提升准确率的同时降低推理开销。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18577 2026-06-04 cs.AI 79%

MedForge: Interpretable Medical Deepfake Detection via Forgery-aware Reasoning

MedForge:基于伪造感知推理的可解释医学深度伪造检测

Zhihui Chen, Kai He, Qingyuan Lei, Bin Pu, Jian Zhang, Yuling Xu, Mengling Feng

机构 * National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Hunan University(湖南大学) Xi’an Jiaotong University(西安交通大学) Guangdong Provincial People’s Hospital(广东省人民医院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出MedForge框架,通过构建大规模基准数据集MedForge-90K和局部-分析推理方法,实现可解释的医学图像伪造检测,在准确性和专家对齐解释上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04806 2026-06-04 cs.CV cs.AI 74%

NoRA: Evaluating Grounded Reasonableness in Visual First-person Normative Action Reasoning

NoRA: 评估视觉第一人称规范性动作推理中的基于事实的合理性

Sichao Li, Sai Ma, Daniel Kilov, Secil Yanik Guyot, Zhuang Li, Seth Lazar

机构 * The University of Sydney(悉尼大学) Australian National University(澳大利亚国立大学) RMIT University(皇家墨尔本理工大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 提出NoRA基准,通过事实-理由-动作支持图评估多模态模型生成合理动作并基于可见事实进行推理的能力,发现当前VLM在构建完整动作空间和绑定正确支持方面存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00819 2026-06-04 cs.CL cs.AI 62%

Emotion Entanglement and Bayesian Inference for Multi-Dimensional Emotion Understanding

情感纠缠与贝叶斯推理用于多维情感理解

Hemanth Kotaprolu, Kishan Maharaj, Raey Zhao, Abhijit Mishra, Pushpak Bhattacharyya

机构 * Indian Institute of Technology Bombay(印度理工学院班加罗尔) University of Texas at Austin(德克萨斯大学奥斯汀分校) IBM Research(IBM研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出基于Plutchik基本情绪理论的情感场景基准EmoScene,并利用情感共现统计的贝叶斯推理框架进行联合后验推理,提升多维情感理解的结构一致性。

Comments 19 pages in total, 10 Figures, 7 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09719 2026-06-04 cs.CL cs.AI 62%

Bounded Hyperbolic Tangent: A Stable and Efficient Alternative to Pre-Layer Normalization in Large Language Models

有界双曲正切:大型语言模型中预层归一化的稳定高效替代方案

Hoyoon Byun, Youngjun Choi, Taero Kim, Sungrae Park, Kyungwoo Song

机构 * Yonsei University(延世大学) Upstage AI

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出BHyT,通过有界双曲正切和数据驱动的输入约束替代Pre-LN,在保持稳定性的同时提升训练和推理效率。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04915 2026-06-04 cs.CL cs.IR 57%

Caliper: Probing Lexical Anchors versus Causal Structure in LLMs

Caliper: 探究LLM中的词汇锚点与因果结构

Zhenyu Yu, Shuigeng Zhou

机构 * Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 通过词汇匿名化扰动,揭示大语言模型在因果推理基准上的表现主要依赖词汇模式匹配而非结构因果推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04739 2026-06-04 cs.SE cs.AI 57%

Revisiting Vul-RAG: Reproducibility and Replicability of RAG-based Vulnerability Detection with Open-Weight Models

重新审视Vul-RAG:基于RAG的漏洞检测的可复现性与可复制性——使用开放权重模型

Sabrina Kaniewski, Fabian Schmidt, Tobias Heer

机构 * Institute for Secure Networked Systems, Esslingen University(安全网络系统研究所,埃斯林根大学) Institute for Intelligent Systems, Esslingen University(智能系统研究所,埃斯林根大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过本地部署和多种开放权重模型,复现并扩展了Vul-RAG框架,发现其性能存在约0.30成对准确率的上限,且模型能力提升无法显著改善性能。

Comments Accepted at AI&CCPS 2026 workshop, co-located with the 21st International Conference on Availability, Reliability and Security (ARES 2026). This is the authors' preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04691 2026-06-04 cs.CL 57%

SMADE-IE: Sparse Multi-Agent Framework with Evidence-Driven Debate for Zero-Shot Information Extraction

SMADE-IE: 基于证据驱动辩论的稀疏多智能体框架用于零样本信息抽取

Kenfeng Huang, Yi Cai, Xin Wu, Zikun Deng, Li Yuan

机构 * School of Software Engineering, South China University of Technology(华南理工大学软件学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出SMADE-IE稀疏多智能体框架,通过自适应模式选择器和证据驱动辩论机制,在零样本信息抽取中减少冗余交互并提升性能。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04592 2026-06-04 cs.CY cs.AI cs.HC 57%

Synthetic Personalities: How Well Can LLMs Mimic Individual Respondents Using Socio-Economic Microdata?

合成人格:LLM 如何使用社会经济微观数据模仿个体受访者?

Leonard Kinzinger, Jochen Hartmann

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究利用德国社会经济面板数据构建个体级数字孪生,通过评估不同构建方法(模型、信息深度、嵌入方式、推理模式)对200万以上孪生响应的准确性,发现信息深度在75%熵分位数达到成本效益帕累托点,最佳单元准确率达78.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04296 2026-06-04 cs.AI 57%

The Saturation Trap and the Subjectivity of Intervention Timing: Why Affect-Based Triggers and LLM Judges Fail to Time Interventions on Autonomous Agents

饱和陷阱与干预时机的主观性:为什么基于情感的触发器和LLM评判者无法在自主智能体上把握干预时机

Manvendra Modgil

机构 * manvendramodgil.ai

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过18维情感动力学引擎HEART诊断自主智能体干预时机问题,发现状态饱和陷阱、LLM评判者的能力与上下文门槛,以及人类标注者之间极低的干预时机一致性,表明干预时机是一个低可靠性构念。

Comments 11 pages, 5 tables. Code and data:https://github.com/2025eb1100268-tech/intervention-timing-saturation-trap

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04202 2026-06-04 cs.AI 57%

SMAC-Talk: A Natural Language Extension of the StarCraft Multi-Agent Challenge for Large Language Models

SMAC-Talk: 面向大型语言模型的星际争霸多智能体挑战的自然语言扩展

Joel Sol, Homayoun Najjaran

机构 * Faculty of Engineering and Computer Science(工程与计算机科学学院) University of Victoria(维多利亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出SMAC-Talk环境,通过自然语言通信通道评估LLM智能体在合作多智能体场景中的协调与信任,并构建含欺骗性通信者的评估场景。

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04072 2026-06-04 cs.RO cs.DC cs.LG cs.SY eess.SY 57%

CADET: A Modular Platform for Evaluating Distributed Cooperative Autonomy in Connected Autonomous Vehicles

CADET:用于评估网联自动驾驶车辆中分布式协作自主性的模块化平台

Pragya Sharma, Brian Wang, Mani Srivastava

机构 * UCLA Amazon Scholar(亚马逊学者)

专题命中 推理评测 :planning(abstract);分类 cs.LG

AI总结 提出CADET模块化平台,通过解耦自动驾驶堆栈并集成网络与工作负载仿真,系统评估分布式协作自主系统在真实部署条件下的安全性与性能。

Journal ref ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24782 2026-06-04 cs.LG 57%

The Perception-Physics Paradox: Probing Scientific Alignment with TC-Bench

感知-物理悖论:用TC-Bench探究科学对齐

Dingling Yao, Andrea Polesello, Adeel Pervez, Caroline Muller, Francesco Locatello

机构 * ETH Zurich(苏黎世联邦理工学院) DeepMind University of Cambridge(剑桥大学) University of Amsterdam(阿姆斯特丹大学) University of Toronto(多伦多大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出科学对齐概念,通过结构同构性构建层次化必要条件,并发布TC-Bench基准数据集,揭示视觉基础模型在极端条件下依赖视觉捷径而非科学推理。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11194 2026-06-04 cs.AI 57%

Aligning Deep Implicit Preferences by Learning to Reason Defensively

通过防御性推理对齐深度隐式偏好

Peiming Li, Zhiyuan Hu, Yang Tang, Shiyu Li, Xi Chen

机构 * Basic Algorithm Center, PCG, Tencent(腾讯基本算法中心) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出基于批判驱动推理对齐(CDRA)的方法,通过DeepPref基准和个性化生成过程奖励模型(Pers-GenPRM),将偏好对齐转化为结构化推理过程,以推断用户深层隐式偏好并实现防御性推理。

Journal ref ICLR 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20233 2026-06-04 cs.CL 57%

REFLEX: Self-Refining Explainable Fact-Checking via Verdict-Anchored Style Control

REFLEX: 通过裁决锚定风格控制实现自我精炼的可解释事实核查

Chuyi Kong, Wei Gao, Jing Ma, Hongzhan Lin, Yuxi Sun

机构 * Hong Kong Baptist University(香港 Baptist 大学) Singapore Management University(新加坡 Management 大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出REFLEX方法,利用自我分歧的真实性信号构建引导向量,以裁决锚定风格控制实现自我精炼的事实核查,仅需465个样本即达最优性能。

Comments 29 pages

Journal ref ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15416 2026-06-04 cs.AI 57%

Adaptive Minds: Empowering Agents with LoRA-as-Tools

自适应心智:将LoRA作为工具赋予智能体能力

Pavan C Shekar, Aswanth Krishnan

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出将LoRA适配器作为可调用工具的框架,通过路由和智能体推理聚合多个专业适配器的优势,在30个适配器库中达到98.3%路由准确率,并在九类任务上显著提升性能。

Comments 13 pages, 3 figures, 9 tables. ICML 2026 CompLearn Workshop camera-ready (non-archival). Code: https://github.com/qpiai/adaptive-minds

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05003 2026-06-04 cs.HC 50%

PhysDox: Benchmarking LLMs on Physical Feasibility Auditing of Physiological Sensing Protocols

PhysDox: 对生理传感协议的物理可行性审计进行LLM基准测试

He Liu, Boyuan Gu, Shuaiqi Cheng, Haiyang Sun, Siyu You, Xuming Hu

专题命中 推理评测 :reasoning(abstract)

AI总结 提出PhysDox基准,通过两阶段评估(严重性检测和约束级诊断)测试LLM对生物医学协议物理可行性的审计能力,发现模型存在支架偏差和隐式约束高漏检率等问题。

Comments 31 Pages,7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05001 2026-06-04 cs.SE 50%

TeleSWEBench: A Commit-Driven Benchmark for Evaluating LLM-Powered Software Engineering in Telecommunications

TeleSWEBench:一个面向电信领域评估基于LLM的软件工程的提交驱动基准

Pranshav Gajjar, Ali Mamaghani, Dinesh Bharadia, Vijay K Shah

专题命中 推理评测 :reasoning(abstract)

AI总结 提出TeleSWEBench,首个面向电信领域的提交驱动基准,通过从srsRAN 5G仓库挖掘真实提交并构建734个可执行测试用例,结合分层LLM评判框架TeleJudge,评估ASE工具在电信软件工程中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04220 2026-06-04 cs.CE 50%

Dead Science Walking: Publication Bias and the AI Scientist Pipeline

Dead Science Walking: 出版偏见与AI科学家管道

Kargi Chauhan

专题命中 推理评测 :reasoning(abstract)

AI总结 本文研究AI科学家系统因文献中阳性结果过度代表而导致的语料库失真问题,通过量化零结果差距并提出放大指数,揭示了标准管道可放大失真2.18倍,并识别了四种治理失败模式及三种干预措施。

详情

展开后加载摘要…

URL PDF HTML 收藏