arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-21 至 2026-08-21 共收录 40 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 2 篇

2608.19802 2026-08-21 cs.CL 新提交 70%

Stopping and Routing LLM Judge Panels

停止与路由大语言模型(LLM)评审小组

Bin Zhu, Yi Xie, Yanghui Rao

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Sun Yat-sen University(中山大学)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 该研究将LLM评审小组设计建模为角色条件分配问题,提出策略优化评审调用,经多类审计对比,生成可复用的评审调用计划。

Comments 21 pages, 2 figures, 20 tables. Accepted at WISE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20314 2026-08-21 cs.AI 新提交 57%

MidTool: Mid-training Data Synthesis for Agentic Tool Use

MidTool:面向智能体工具使用的训练中期数据合成

Fengqing Jiang, Yite Wang, Boyi Liu, Zhaoyang Wang, Canwen Xu, Zhewei Yao, Radha Poovendran, Yuxiong He

机构 * University of Washington(华盛顿大学) Snowflake(雪花公司) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出MidTool流水线,构建面向智能体工具使用的训练中期数据,在MidTool-Mix上微调Qwen3模型,可显著提升工具使用相关下游任务性能,证明通用工具使用需专门训练中期调整。

Comments Data & Model: this https URL (https://hf.co/collections/MidTool/midtool-release)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 2 篇

2608.19626 2026-08-21 cs.SE 新提交 50%

Auditing and Decomposing Feedback-Driven Evolution in LLM Test Generation under the Oracle Problem

在神谕问题下对LLM测试生成中反馈驱动演化的审计与分解

Yunhao Liang, Chengguang Gan, Ruixuan Ying, Hanjun Wei, Zhe Cui, Shiwen Ni

专题命中 代码与定理证明 :verifier(abstract)

AI总结 该研究针对LLM测试生成中反馈驱动演化的神谕问题,通过多任务实验发现单一神谕会膨胀演化增益,提出审计-安慰剂协议以分离验证器人工制品等,为相关评估提供改进方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19240 2026-08-21 math.CV 新提交 50%

A Nonmonotone Real-Rootedness Set for Symmetric Imaginary Shifts

Vasily Stodolsky

专题命中 代码与定理证明 :verifier(abstract)

Comments 7 pages, 1 table. AI Research Artifact with material AI use and author accountability disclosed in the paper. Corresponds to Zenodo v0.1.3, DOI: https://doi.org/10.5281/zenodo.21922629

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 5 篇

2608.19794 2026-08-21 cs.AI cs.RO 新提交 83%

Towards general embodied intelligence: integrating large language models, knowledge bases, and reasoning capabilities to build the next generation of AI agents

迈向通用具身智能:整合大语言模型、知识库与推理能力以构建下一代AI智能体

Fujiang Yuan, Xia Huang, Lusheng Wang, Jun Ding, Zhen Tian, Yuxin Wang, Shaojie Gu, Yuki Funabora, Yanhong Peng, Zebing Mao

机构 * College of Mechanical Engineering, Chongqing University of Technology(重庆理工大学机械工程学院) James Watt School of Engineering, University of Glasgow(格拉斯哥大学詹姆斯·瓦特工程学院) School of Energy and Power, Jiangsu University of Science and Technology(江苏科技大学能源与动力学院) Magnesium Research Center, Kumamoto University(熊本大学镁研究中心) Department of Information and Communication Engineering, Nagoya University(名古屋大学信息与通信工程系) State Key Laboratory of Fluid Power and Mechatronic Systems, Zhejiang University(浙江大学流体动力与机电系统国家重点实验室)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文综述以LLM为核心的智能系统演进,提出整合LLMs、KBs、RA与具身性的概念框架,明确高效LLM部署等五大挑战,为开发复杂动态环境下的自适应多模态智能体提供路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19701 2026-08-21 cs.AI 新提交 74%

Beyond Memory Majority: Latent-Source Reasoning for Multi-Agent Memory Arbitration

超越记忆多数:面向多智能体记忆仲裁的潜在源推理

Chenchen Lin, Wenhao Yuan, Xuehe Wang, Edith Cheuk Han Ngai

专题命中 逻辑推理 :reasoning(title);分类 cs.AI

AI总结 该研究针对多智能体记忆仲裁中的记忆关联偏差问题,提出CAMA框架,通过解耦记忆、估计独立证据源数量及主动恢复缺失证据,有效抑制虚假多数,性能优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19880 2026-08-21 cs.AI cs.CL cs.LG 新提交 67%

EnvHarness: Awakening Static Worlds for Agent Learning

EnvHarness:为智能体学习唤醒静态环境

Chengsong Huang, Zifeng Wang, Rujun Han, Jun Yan, Yanfei Chen, Zoey CuiZhu, Ke Jiang, Peng Xia, Han Yu, Yufan Zhuang, Yifei Ming, Jiaqi Pan, Bhavana Dalvi Mishra, Jiaxin Huang, Burak Gokturk, Tomas Pfister, Chen-Yu Lee

专题命中 逻辑推理 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 EnvHarness是包裹静态环境的可编程插件层,结合EnvRigger自动合成组件,在多领域基准测试中提升智能体学习性能,减少执行步骤并支持策略与环境协同进化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20201 2026-08-21 cs.AI cs.SE 新提交 57%

The Third Restructuring of Software Form: From the Three-Tier Architecture to Storage, Models, and Agents

软件形态的第三次重构:从三层架构到存储、模型与智能体

Wei Lin, Tao Zhou, Zhaofei Xie, Changgui Hong

机构 * Nanjing Liancheng Intelligent Technology Group(南京连城智能科技集团)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出软件形态正经历第三次范式转变Software 3.0,其核心为存储、大模型与智能体的架构,将重塑开发者、数据库行业及软件工程的角色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19379 2026-08-21 cs.CY cs.HC 新提交 50%

Multi-Tier Mentorship with AI-Assisted Development: Authentic Engineering for K-12 and Undergraduates

结合AI辅助开发的多层级指导模式:面向K-12学生与本科生的真实工程实践

Kelly Yuan, Ronald Liu, Daniel Crawford, Weihao Qu

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出结合AI辅助开发的多层级指导框架,让K-12学生与本科生协作开发LuckyTag系统,试点显示该模式可降低技术障碍、提升架构理解,为跨群体计算协作提供了新方案。

Comments 8 pages, 8 figures, 2 tables. Accepted to IEEE ISEC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 10 篇

2608.20237 2026-08-21 cs.AI 新提交 83%

Rule-Compliant Visual Spatial Planning for Multimodal Large Language Models

面向多模态大语言模型的符合规则的视觉空间规划

Yu Chen, Ting Lei, Yaoyi Li, Jia Cai, Zhecen Wu, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) Yinwang Intelligent Technology Co., Ltd(银湾智能科技有限公司)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 该研究针对多模态大语言模型的规则遵循空间规划问题,构建了RuleMaze基准,提出语言-逻辑-函数混合方法和解耦多模态规划(DMP),提升了规则遵循度与规划成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20084 2026-08-21 cs.RO cs.AI 新提交 83%

Evidence-Gated Task and Motion Planning with Vision-Language Models

基于视觉语言模型的证据门控任务与运动规划

Tsunehiko Tanaka, Matthew Stephenson, Alistair Macvicar, Edgar Simo-Serra

机构 * Waseda University(早稻田大学) Flinders University(弗林德斯大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 针对机器人执行自然语言指令长时操纵任务时的部分可观测问题,提出 EAFG 框架,通过视觉证据获取与可行性门控提升食谱完成率并减少无效操纵尝试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19964 2026-08-21 cs.LG 新提交 83%

G-MARK: Grounded Multi-Agent Reasoning for Cooperative Driving via Knowledge Graphs

G-MARK:基于知识图谱的协同驾驶接地多智能体推理

Bhavya Gupta, Onat Gungor, Tajana Rosing

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校) West Virginia University(西弗吉尼亚大学)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.LG

AI总结 提出 G-MARK 框架,通过知识图谱实现协同驾驶多智能体推理,提升遮挡推理与控制选择性能,减小通信负载,效果优于现有基线。

Comments Accepted for oral presentation at the 25th IEEE International Conference on Machine Learning and Applications (ICMLA'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20161 2026-08-21 cs.AI 新提交 79%

DARS: Dual-Level Credit Assignment RL with Structured Reasoning for Instruction-Based Image Editing

DARS:用于基于指令的图像编辑的带结构化推理的双层级信用分配强化学习

Haoxiang Cao, Jiajiong Cao, Xuanpu Zhang, Changqian Yu, Chaoqun Wang

机构 * South China Normal University(华南师范大学) KlingAI Research(可灵AI研究院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出DARS框架,解决基于指令的图像编辑系统仅用最终奖励训练效率低的问题,通过双层级信用分配实现更好性能,在推理密集型编辑上增益显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20129 2026-08-21 cs.MA cs.CL cs.CV 新提交 79%

Multi-Agent Orchestration with the Common-Sense Reasoning Capabilities of LLMs for Autonomous Driving

结合大语言模型常识推理能力的多智能体协同框架用于自动驾驶

Mehdi Azarafza, Faezeh Pasandideh, Ali Ehteshami Bejnordi, Stefan Henkler, Achim Rettberg

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 该研究针对自动驾驶中强化学习等方法的上下文推理缺陷,提出结合LLM常识推理的混合多智能体协同框架,经CARLA场景验证可保留结构化控制与安全机制,具备应用潜力。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20336 2026-08-21 cs.CV 新提交 71%

WithEveryone: Unified Planning and Identity Grounding for Group Image Generation

WithEveryone:面向群体图像生成的统一规划与身份定位

Hengyuan Xu, Qixun Wang, Yiji Cheng, Miles Yang, Zhao Zhong, Wei Cheng, Xingjun Ma, Yu-gang Jiang

机构 * Fudan University(复旦大学) Hunyuan, Tencent(腾讯混元) The University of Hong Kong(香港大学)

专题命中 规划推理 :planning(title)

AI总结 针对多人物群体图像生成的身份保留难题,提出WithEveryone框架,通过布局定位身份损失等技术,提升了人脸相似度并降低伪影,实现高身份覆盖率与低重复率。

Comments Project Page: this http URL (http://doby-xu.github.io/WithEveryone/);Code will be released: this http URL (http://github.com/Doby-Xu/WithEveryone/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20316 2026-08-21 cs.AI 新提交 57%

Pandora's AI Model Routing Box: Efficient Allocation with Costly Value Estimation

潘多拉的AI模型路由盒:带代价价值估计的高效分配

Adam Fisch, Shubhendu Trivedi, Fantine Huot, William W. Cohen, Michael Kaisers, Mirella Lapata, Kate Larson, Jacob Eisenstein

机构 * Google DeepMind(谷歌DeepMind)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对异构AI系统的查询路由问题,提出带代价价值估计的Pandora's Router集中式策略及Pandora's Bidder去中心化策略,可在保证路由质量的同时减少高成本估计器的使用,还能在不同场景优化分配效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20026 2026-08-21 cs.CV cs.LG 新提交 57%

From Street View Imagery to Street Quality Indicators: Vision Language Inference for the Suburban 15-minute City

从街景图像到街道质量指标:面向郊区15分钟城市的视觉语言推理

Joan Perez, Giovanni Fusco

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文以法国尼斯东北部郊区为研究对象,采用开源的SAGAI工作流,利用视觉语言模型从街景图像评估街景质量,发现理想街景仅存在于部分郊区区域,证明了VLM可支持郊区城市诊断,助力循证规划。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19854 2026-08-21 cs.SE cs.AI 新提交 57%

Repo0: Design-Driven Zero-to-All Code Generation

Repo0:面向从零到全代码生成的设计驱动框架

Silin Chen, Haoyi Teng, Xiaodong Gu, Yuling Shi, Jiale Huang, Yongpan Wang, Hongyu Zhang, Haibing Guan

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 Repo0是面向从零到全代码生成的连续结构演化框架,通过Dual-DAG架构等技术,在RepoCraft数据集上相较RPG大幅提升了代码生成的功能覆盖率与通过率。

Comments Our code and data are available at this https URL (https://github.com/cslsolow/Repo0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20317 2026-08-21 cs.IR 新提交 50%

Projecting BrowseComp-Plus onto ClimbMix: Toward More Realistic Corpora for Agentic Search

将BrowseComp-Plus映射到ClimbMix:构建更符合智能体搜索需求的真实语料库

Sahel Sharifymoghaddam, Lingwei Gu, Yijun Ge, Jimmy Lin

专题命中 规划推理 :reasoning(abstract)

AI总结 该研究将BrowseComp-Plus的查询映射到NVIDIA的ClimbMix语料库,构建了与基准无关的映射流水线,生成57个有效查询,使智能体搜索难度向检索环节转移,发布了相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 2 篇

2608.19726 2026-08-21 cs.CL cs.CV cs.LG 新提交 62%

Projector Is All You Train

仅训练投影器就足够

Nyx Iskandar, Saathvik Selvan, Slater Victoroff

机构 * Ramen VR(拉面VR公司) University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 该研究探究多模态大语言模型适配新模态是否需微调主干,经实验发现仅训练投影器即可实现强多模态性能,还能避免联合训练导致的语言模型能力漂移,且训练样本吞吐量约为联合训练的两倍,通过多类基准验证了结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19298 2026-08-21 cs.CV 新提交 50%

SceneGTMM: A Conformal Mapping-based Scene-Aware Transferable GNN-Transformer Dual-Graph Interaction Framework for Map Matching

SceneGTMM:一种基于保角映射的场景感知可迁移GNN-Transformer双图交互地图匹配框架

Yongliang Zhang, Feng Song, Ji Chen, Lishuai Guo, Yong Deng, Yue Zheng, Tianyi Liu, Zhixiong Chen, Qixin Zhang

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出SceneGTMM框架,通过保角映射场景策略、双图交互架构与CRF增强预测,提升地图匹配的噪声鲁棒性、跨区域迁移性与可解释性,在多源及跨城轨迹匹配中表现优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 测试时计算 6 篇

2608.20256 2026-08-21 cs.AI 新提交 86%

Learning When to Think: Adaptive Reasoning for Test-Time Compute Allocation

学习何时思考:面向测试时计算分配的自适应推理

Gijs Kassenaar, Zhao Yang, Vincent François-Lavet

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(title);分类 cs.AI

AI总结 该研究提出基于GRPO的自适应推理模型,通过三种模式选择分配测试时计算,在MATH数据集上减少41%响应长度且保留高准确率,还可迁移至其他基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19807 2026-08-21 cs.LG 新提交 83%

Answer-Level Trust Selection for Physical Vision-Language Reasoning

面向物理视觉-语言推理的答案级信任选择

Rongyu Yu, Ke Niu, Fengxiang He

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.LG

AI总结 针对VLM部署中预测信任问题,提出模型无关的ATS框架,聚合8种诊断分数评估答案可靠性,可识别稳定错判等失效模式,补充模型级能力评估。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20202 2026-08-21 cs.AI cs.CL cs.CY cs.DB cs.LG 新提交 75%

MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use

MemTrapBench:大语言模型记忆使用中认知陷阱的基准测试

Mengru Wang, Haozhe Luo, Zhenqian Xu, Zhixiang Cui, Haoming Xu, Qu Yang, Jizhan Fang, Junfeng Fang, Ningyu Zhang

专题命中 测试时计算 :reasoning(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究人员提出MemTrapBench基准测试,发现现有LLM记忆策略存在认知陷阱致性能下降,进而提出AdaptiveMem方法可缓解该问题并提升标准记忆基准性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19861 2026-08-21 cs.AI cs.CL cs.LG 新提交 67%

PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents

PolicyGuide:从单一动作防护到合规LLM智能体的全流程引导

Seongjae Kang, Taehyung Yu, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PolicyGuide将领域政策编译为工作流图,通过主动验证器引导LLM智能体合规执行,在多领域提升了合规率,且工作流可跨模型迁移,攻击成功率低、程序性合规性强。

Comments 26 pages, 15 figures, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19611 2026-08-21 cs.CL cs.AI cs.LG 新提交 67%

Forking Fast: Efficiently Estimating Uncertainty Dynamics in Text Generation

快速分叉:高效估计文本生成中的不确定性动态

Eric Bigelow, Amir Zur, Satchel Grant, Tal Haklay, Can Rager, Owen Lewis, Thomas McGrath, Jack Merullo, Ekdeep Singh Lubana, Atticus Geiger

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对文本生成中不确定性动态估计成本高的问题,本研究开发统计模型平滑低采样推理数据以近似高采样数据,提升重采样分析效率,揭示不确定性动态的稳定模式及噪声来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19893 2026-08-21 cs.CL cs.AI 新提交 62%

Interrupting the Loop: Periodic Subject Changes Raise Judged Surprise and Connection in Base Language Models

打断循环:周期性主体变化提升基础语言模型的惊讶度与关联度

Roberto I. Ono Filho

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 本研究探究基础语言模型的长文本生成特性,发现周期性注入新主体的打断操作可提升模型生成文本的惊讶度与关联度,还提出了长文本生成的评估方案。

Comments 48 pages including appendix; code, data pipeline and lab notebook at this https URL (https://github.com/RobertoOno/interrupting-the-loop)

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 复杂问题求解 2 篇

2608.20055 2026-08-21 cs.CR cs.AI 新提交 93%

EchoCoT: Extracting Hidden Chain-of-Thought from Large Reasoning Models

EchoCoT:从大型推理模型中提取隐藏的思维链

Yiting Qu, Ziqing Yang, Chi Cui, Ye Leng, Junjie Chu, Yang Zhang

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(summary_cn,abstract);分类 cs.AI

AI总结 本研究提出EchoCoT多步骤攻击方法,通过API交互可从开源及前沿专有大型推理模型中近乎逐字提取隐藏思维链,该方法还具备泛化性,凸显隐藏CoT提取的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20099 2026-08-21 cs.MA cs.CL cs.LG 新提交 62%

Reward-Guided Autoregressive Graph Generation for Efficient Multi-Agent Communication Topology Design

奖励引导自回归图生成的高效多智能体通信拓扑设计

Poomphob Suwannapichat, Boonyarit Changaival, Caesar Wu, Pascal Bouvry

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 针对多智能体系统通信拓扑设计中 token 消耗过高的问题,本文提出 RGA-Designer 方法,通过结合 RLHF 训练奖励模型微调图生成器,在保持任务准确率的同时降低了 token 消耗。

Comments Full version of extended abstract accepted at ICONIP 2026 (poster)

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 推理评测 8 篇

2608.19819 2026-08-21 eess.SY 新提交 78%

Large reasoning models for abnormal situation management in safety-critical industrial processes

面向安全关键工业过程异常状况管理的大型推理模型

Khalid Alhazmi

专题命中 推理评测 :reasoning(title,abstract)

AI总结 该研究提出通用大型推理模型,通过有界经程序验证的动作接口管理安全关键工业过程的异常状况,在39种异常测试中表现优于基础调节控制,可实现无需人类参与的运行时异常状况管理。

详情

展开后加载摘要…

URL PDF HTML 收藏