arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-09 至 2026-07-09 共收录 24 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 2 篇

2605.19723 2026-07-09 cs.CL cs.AI 版本更新 84%

Mathematical Reasoning in Large Language Models: Benchmarks, Architectures, Evaluation, and Open Challenges

大型语言模型中的数学推理:基准测试、架构、评估与开放挑战

Husnain Amjad, Raja Khurram Shahzad, Aamir Shahzad, Mehwish Fatima

机构 * organization= School of Electrical Engineering Computer Science, National University of Science organization= School of Computing, Data Mathematical Sciences, Western Sydney University, Indonesia organization= Department of Communication, Quality Management Information Systems, Mid Sweden University, Östersund Campus, Sweden

专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大型语言模型在数学推理方面的最新进展,通过分析数据集、架构、训练策略和评估协议,探讨了数学推理的基准测试、架构设计、评估方法以及未来的研究挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21476 2026-07-09 cs.CL 版本更新 57%

Thinking Seeds: Leveraging Historical Diversity for Position-Aware RL in LLMs

思维种子:在语言模型中利用历史多样性进行位置感知强化学习

Lei Yang, Wei Bi, Chenxi Sun, Renren Jin, Deyi Xiong

机构 * TJUNLP Lab, College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院 TJUNLP 实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 研究语言模型在线强化学习问题,提出思维种子这一令牌级混合策略框架,利用模型历史检查点作离线前缀,通过令牌级重要性比率有效利用历史多样性,实验表明其性能优于标准在线训练和现有离线扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 逻辑推理 2 篇

2605.30170 2026-07-09 cs.MM cs.CV cs.LG 版本更新 57%

Unveiling the Visual Counting Bottleneck in Vision-Language Models

揭示视觉语言模型中的视觉计数瓶颈

Xingzhou Pang, Yifan Hou, Junling Wang, Mrinmaya Sachan

机构 * Department of Computer Science, ETH Zürich(苏黎世联邦理工学院计算机科学系)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 通过分解视觉计数为三个认知阶段,发现视觉语言模型在符号映射阶段失败,提出断裂数量假说:模型学习到分离的模态特定统计流形,无法实现跨模态对齐。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00086 2026-07-09 cs.CL 版本更新 57%

RIMRULE: Improving Tool-Using Language Agents via MDL-Guided Rule Learning

RIMRULE:通过MDL引导的规则学习改进使用工具的语言智能体

Xiang Gao, Yuguang Yao, Qi Zhang, Kaiwen Dong, Avinash Baidya, Ruocheng Guo, Hilaf Hasson, Kamalika Das

机构 * Intuit AI Research(Intuit AI研究)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 研究针对大型语言模型在特定领域使用工具的难题,提出RIMRULE神经符号方法,通过从失败轨迹提炼规则并用MDL目标巩固,以动态注入规则提升性能,实验证明该方法能提高工具使用准确性,且规则具有跨架构可移植性。

Comments Published as a long paper in the main conference of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 规划推理 5 篇

2603.23800 2026-07-09 cs.RO cs.AI cs.LG 版本更新 81%

Object Search in Partially-Known Environments via LLM-informed Model-based Planning and Prompt Selection

通过LLM引导的基于模型的规划与提示选择进行部分已知环境中的物体搜索

Abhishek Paudel, Abhish Khanal, Raihan I. Arnob, Shahriar Hossain, Gregory J. Stein

机构 * Department of Computer Science, George Mason University(乔治·马歇尔大学计算机科学系)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于LLM的模型规划框架和提示选择方法,用于部分已知环境中的物体搜索。利用LLM估计不同位置搜索目标物体的可能性,并结合环境地图提取的旅行成本,以实现有效的搜索性能。

Comments 10 pages, 8 figures. Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18784 2026-07-09 cs.AI 版本更新 79%

Successor-Generator Planning with LLM-generated Heuristics

基于大语言模型生成启发式策略的后继生成器规划

Alexander Tuisov, Yonatan Vernik, Alexander Shleyfman

机构 * Computer Science Department, Bar-Ilan University(巴伊兰大学计算机科学系)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 研究借助大语言模型,从规划任务中生成特定问题启发式函数并集成到搜索算法。该方法在多规划基准测试中性能优异,还能解决传统形式难表达的问题,经评估展现出有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29744 2026-07-09 cs.CV 版本更新 67%

HTC-SGA Former: A Hybrid Transformer-CNN Network with Self-Guided Attention and a New Boundary-Weighted Adaptive Loss for Coronary DSA Vessel Segmentation

HTC-SGA Former: 一种结合自引导注意力与新型边界加权自适应损失的混合Transformer-CNN网络用于冠状动脉DSA血管分割

Rayan Merghani Ahmed, Marwa Omer Mohammed Omer, Mohamed Elmanna, Shijie Li, Bin Li, Shoujun Zhou

机构 * Shenzhen Institutes of Advanced Technology (SIAT)(深圳先进技术研究院) University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Department of Biomedical Engineering and Systems, Faculty of Engineering(工程学院生物医学工程与系统系) Cairo University(开罗大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 提出HTC-SGA Former混合网络,通过CNN编码器提取局部血管形态、Transformer解码器建模上下文、MS-GLWA模块实现全局-局部注意力、SGFA模块增强弱血管响应及BWACL损失函数优化边界,在0.81M参数下超越14种方法,提升细血管恢复与连续性。

Comments 20 pages, 10 figures, 3 tables. Submitted for journal review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12265 2026-07-09 cs.CL 版本更新 57%

Fast, Slow, and Tool-augmented Thinking for LLMs: A Review

大语言模型的快速、慢速和工具增强思维:综述

Xinda Jia, Jinpeng Li, Zezhong Wang, Jingjing Li, Xingshan Zeng, Yasheng Wang, Weinan Zhang, Yong Yu, Weiwen Liu

机构 * School of Mechanical Engineering, Shanghai Jiao Tong University, Shanghai 200240, China(上海交通大学机械工程学院) School of Computer Science, Shanghai Jiao Tong University, Shanghai 200240, China(上海交通大学计算机科学学院) Huawei Technologies Co., Ltd., Beijing 100084, China(华为技术有限公司) Department of Systems Engineering and Engineering Management, The Chinese University of Hong Kong, Hong Kong 999077, China(香港中文大学系统工程与工程管理系) Department of Computer Science and Engineering, The Chinese University of Hong Kong, Hong Kong 999077, China(香港中文大学计算机科学与工程系) Huawei Hong Kong Research Center, Hong Kong 999077, China(华为香港研究中心)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 综述大语言模型推理进展,基于认知心理学提出LLM推理策略分类法,沿快速/慢速、内部/外部两个知识边界分类,系统调查相关工作并依关键因素归类方法,指出其面临的挑战与未来方向。

Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-026-51673-0}

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19887 2026-07-09 cs.DC cs.MA cs.RO cs.SY eess.SY 版本更新 50%

DAG-Based QoS-Aware Dynamic Task Placement for Networked Multi-Stage Control Pipelines

基于DAG的QoS感知动态任务放置用于网络化多阶段控制流水线

Thien Tran, Jonathan Kua, Thuong Hoang, Minh Tran, Yuemin Ding, Jiong Jin

机构 * Deakin University, Australia(德坎大学,澳大利亚) RMIT University, Vietnam(皇家墨尔本理工大学,越南) University of Navarra, Spain(纳瓦拉大学,西班牙) Swinburne University of Technology, Australia(斯威本科技大学,澳大利亚)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出一种基于DAG的QoS感知动态任务放置框架,用于网络化机器人中的感知-感知-规划-控制流水线,通过动态任务放置优化计算、通信延迟和任务放置集,解决传统静态边缘卸载和单阶段模型的不足。

Comments 5 pages, 1 figure, 1 table, 1 algorithm, accepted paper on the 24th IEEE International Conference on Industrial Informatics (INDIN), 26-29 July, 2026, Melbourne, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视觉空间推理 2 篇

2602.23802 2026-07-09 cs.AI cs.CV 版本更新 79%

EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models

EMO-R3:多模态大语言模型中用于情感推理的反射强化学习

Yiyang Fang, Wenke Huang, Pei Fu, Yihao Yang, Kehua Su, Zhenbo Luo, Jian Luan, Mang Ye

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 针对多模态大语言模型情感推理难题,提出EMO-R3框架。引入结构化情感思维并设计反射情感奖励,经大量实验验证,该框架显著提升模型可解释性与情商,在多视觉情感理解基准测试中表现出色。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21133 2026-07-09 cs.RO 版本更新 50%

Humanoid Whole-Body Manipulation via Active Spatial Brain and Generalizable Action Cerebellum

通过主动空间大脑和可泛化动作小脑的人形全身 manipulation

Zhizhao Liang, Yi-Lin Wei, Xuhang Chen, Mu Lin, Yi-Xiang He, Zhexi Luo, Jun-Hui Liu, Kun-Yu Lin, Wei-Shi Zheng

机构 * School of Computer Science(计算机科学学院) Engineering, Sun Yat-sen University(工程学院,中山大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出了一种通用的人形 locomotion-manipulation 框架,通过主动空间大脑和可泛化动作小脑来解决复杂3D环境中空间理解困难和动作生成泛化困难的问题,展示了在多种任务和环境中的强性能。

Comments Project page: https://leungchaos.github.io/Humanoid-Whole-Body-Manipulation-via-Active-Spatial-Brain-and-Generalizable-Action-Cerebellum/

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 测试时计算 1 篇

2605.17842 2026-07-09 cs.LG 版本更新 57%

SNLP: Layer-Parallel Inference via Structured Newton Corrections

SNLP:通过结构化牛顿校正的层并行推理

Ligong Han, Kai Xu, Hao Wang, Akash Srivastava

机构 * Core AI, IBM(IBM核心AI)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 提出结构化牛顿层并行(SNLP)框架,通过将Transformer层间依赖视为非线性残差方程并用结构化牛顿校正并行求解,实现推理加速,在0.5B模型上获得高达2.58倍加速。

Comments Project webpage: https://github.com/phymhan/nanochat-snlp

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 复杂问题求解 3 篇

2508.17298 2026-07-09 cs.CV cs.AI 版本更新 84%

Explain Before You Answer: A Survey on Compositional Visual Reasoning

回答之前先解释:组合视觉推理综述

Fucai Ke, Joy Hsu, Zhixi Cai, Zixian Ma, Xin Zheng, Xindi Wu, Sukai Huang, Weiqing Wang, Pari Delir Haghighi, Gholamreza Haffari, Ranjay Krishna, Jiajun Wu, Hamid Rezatofighi

机构 * Monash University(墨尔本大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) Griffith University(格里菲斯大学) Princeton University(普林斯顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 综述2023年至2025年组合视觉推理文献,形式化核心定义,追溯范式转变,编目基准指标,提炼见解、识别挑战并概述方向,为该领域提供统一分类、历史路线图和批判性展望。

Comments Project Page: https://github.com/pokerme7777/Compositional-Visual-Reasoning-Survey

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15207 2026-07-09 cs.LG cs.MA 版本更新 57%

TeamTR: Trust-Region Fine-Tuning for Multi-Agent LLM Coordination

TeamTR: 用于多智能体大语言模型协调的信赖区域微调

Yi Xie, Siao Liu, Falong Fan, Yuanqi Yao, Yue Zhao, Bo Liu

机构 * Department of Electrical \& Computer Engineering, University of Arizona Engineering College, Soochow University INSAIT, Sofia University "St. Kliment Ohridski" Department of Electrical Computer Engineering, Stony Brook University

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本文提出TeamTR,通过信赖区域框架在每个组件更新后重采样轨迹并控制每个智能体的发散度,解决多智能体系统中因上下文分布变化导致的性能下降问题,实验表明其在协调回归抑制和组件替换支持方面优于单智能体和序列基线。

Comments 9pages, Accepted at ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04809 2026-07-09 cs.SE 版本更新 50%

Watts This Smell: A Comprehensive Taxonomy of Software Energy Smells

一种经过验证的软件能耗异味分类

Mohammadjavad Mehditabar, Saurabhsingh Rajput, Tushar Sharma

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出了一种全面的软件能耗异味分类,通过系统文献综述和雪球抽样,将320种低效模式分类为12种主要能耗异味和65种根本原因。通过实证验证,发现71%的样本存在多种共存的异味,内存相关异味的修复节能效果最高。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 推理评测 7 篇

2508.10956 2026-07-09 cs.CV cs.AI 版本更新 79%

A Study of Commonsense Reasoning over Visual Object Properties

关于视觉对象属性的常识推理研究

Abhishek Kolari, Mohammadhossein Khojasteh, Yifan Jiang, Floris den Hengst, Filip Ilievski

机构 * Department of Computer Science, Vrije Universiteit(自由大学计算机科学系) Information Sciences Institute, University of Southern California(南加州大学信息科学研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究针对视觉对象属性的常识推理,引入含特定图像类型、推理层次和属性维度的评估框架,在两个VQA基准中实验,发现现有VLM存在显著局限,虽新模型有进步但仍与人类有差距,还提供了相关数据和代码以助未来研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06445 2026-07-09 cs.CV 版本更新 78%

What if? Emulative Simulation with World Models for Situated Reasoning

如果呢?基于世界模型的仿真模拟用于情境推理

Ruiping Liu, Yufan Chen, Yuheng Zhang, Junwei Zheng, Kunyu Peng, Chengzhi Wu, Chenguang Huang, Di Wen, Jiaming Zhang, Kailun Yang, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Hunan University(湖南大学) ETH Zürich(苏黎世联邦理工学院) INSAIT, Sofia University ``St. Kliment Ohridski''(INSAIT,索菲亚大学『圣克莱门特·奥赫里迪斯』) RAI Institute(RAI研究所)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 提出WanderDream数据集,利用世界模型进行心理探索的仿真模拟,使代理无需主动探索即可回答空间假设问题,实验证明心理探索对情境推理至关重要。

Comments Accepted at ECCV 2026. The data and code are available at: https://github.com/RuipingL/WanderDream

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09595 2026-07-09 cs.AI cs.CL cs.LG 版本更新 67%

LiveOIBench: Can Large Language Models Outperform Human Contestants in Informatics Olympiads?

LiveOIBench:大语言模型在信息学奥林匹克竞赛中能超越人类参赛者吗?

Kaijian Zou, Aaron Xiong, Yunxiang Zhang, Frederick Zhang, Yueqi Ren, Jirong Yang, Ayoung Lee, Shitanshu Bhushan, Lu Wang

机构 * University of Michigan(密歇根大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究大语言模型在信息学奥林匹克竞赛中的表现,引入含403个专家策划问题的LiveOIBench基准,通过四个关键特性评估34个模型,发现GPT - 5等不及顶级人类参赛者,还表明强大推理模型特点及基准数据污染少。

Comments ICML 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03800 2026-07-09 cs.LG cs.AI 版本更新 62%

Trading Human Curation for Synthetic Augmentation in RLVR

在RLVR中用合成增强替代人工策展

Akshansh, Leonardo Rosa Rodrigues, Michael Korostelev, Youssef Hassan, Mark E. Whiting

机构 * Pareto AI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究通过预指定、门控过滤的增强任务替代人工策展任务,在RLVR中实现成本效益权衡,并保持泛化性能。

Comments 21 pages, 5 main-text figures, 4 appendix figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22140 2026-07-09 cs.CL 版本更新 57%

Psy-Chronicle:A Structured Pipeline for Synthesizing Long-Horizon Campus Psychological Counseling Dialogues

Psy-Chronicle: 一个用于合成长周期校园心理辅导对话的结构化流水线

Chaogui Gou

机构 * University of Science and Technology Beijing(北京科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Psy-Chronicle,一种结构化数据生成框架,用于合成长周期校园心理辅导对话,通过生成学期跨度的时间压力事件图和学生与辅导员代理的交互模拟,构建了包含100个学生档案和9万条对话的CPCD数据集,并通过CPCD-Bench评估模型的长周期校园辅导能力,实验结果表明CPCD有效提升了模型的会话级响应生成和长周期记忆召回能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18735 2026-07-09 cs.CV cs.AI 版本更新 57%

Thinking Ahead: Foresight Intelligence in MLLMs and World Model

提前思考:多模态语言模型和世界模型中的预见智能

Zhantao Gong, Liaoyuan Fan, Qing Guo, Xun Xu, Xulei Yang, Shijie Li

机构 * College of Software, Nankai University, China(南开大学软件学院) The University of Hong Kong, China(香港大学) NKIARI, Shenzhen Futian, China(NKIARI,深圳福田,中国) AAIS & VCIP, Nankai University, China(AAIS与VCIP,南开大学,中国) A*STAR Institute of Advanced Intelligence and Computing, Singapore(新加坡A*STAR先进智能与计算研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究定义预见智能,引入FSU-QA数据集,对视觉语言模型在预见任务中全面研究,发现当前模型不足。该数据集可评估世界模型,增强预见推理,微调小模型能超大型先进模型,为开发下一代模型提供基础,还验证了评估协议。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05711 2026-07-09 cs.CV 版本更新 50%

From My View to Yours: Learning Egocentric Cues from Exocentric Video using Privileged Egocentric Supervision

从我的视角到你的视角:利用特权自我中心监督从外中心视频中学习自我中心线索

Dominick Reilly, Manish Kumar Govind, Le Xue, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) Elorian AI

专题命中 推理评测 :reasoning(abstract)

AI总结 研究针对视觉语言模型难以从外中心视频推断自我中心属性的问题,提出Ego2ExoVLM框架,利用时间同步视频对及特权监督,通过两个组件实现此能力,在多任务评估中取得领先性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他推理 2 篇

2604.11840 2026-07-09 cs.LG cs.AI cs.CY cs.MA 版本更新 66%

Diversity Without Fidelity: A Solver-Sampler Mismatch in Multi-Agent LLM Negotiation Simulation

当推理模型损害行为模拟:多智能体大语言模型谈判中的求解器-采样器不匹配

Sandro Andric

专题命中 其他推理 :reasoning(abstract,comments);分类 cs.AI、cs.LG

AI总结 研究指出推理增强模型在模拟行为时可能表现不佳,通过三个多智能体谈判环境实验发现,有界推理能产生更多样且妥协导向的轨迹,强调模拟应将模型视为采样器而非求解器。

Comments 20 pages, 2 figures. Substantially revised. Formerly titled "When Reasoning Models Hurt Behavioral Simulation: A Solver-Sampler Mismatch in Multi-Agent LLM Negotiation"

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00533 2026-07-09 cs.LG cs.IT math.IT 版本更新 57%

Toward Robust Open-set Adaptation: Synapse Consolidation Inspired by Rac1/MAPK Pathways

在开放测试流中学习并适应未知

Xiao Zhang, Tianyu Hu, Juntao Lyu, Qianchuan Zhao, Huimin Ma

机构 * University of Science and Technology Beijing(北京科技大学) Tsinghua University(清华大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出SyCo方法,通过Rac1和MAPK路径实现参数高效适应,解决LLM在动态任务中的适应问题,实验表明其在18个NLP数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏