arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-09 至 2026-07-09 共收录 48 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 7 篇

2607.06447 2026-07-09 cs.AI cs.CL cs.MA 新提交 86%

Danus: Orchestrating Mathematical Reasoning Agents with Fact-Graph Memory

Danus:利用事实图内存编排数学推理智能体

Jihao Liu, Guoxiong Gao, Zeming Sun, Bin Wu, Shurui Liu, Jiedong Jiang, Haocheng Ju, Leheng Chen, Ronnie Cheng, Xiping Zhang, Bin Dong

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Beijing International Center for Mathematical Research, Peking University(北京大学北京国际数学研究中心) Research Institute for Mathematical Sciences, Kyoto University(京都大学数理解析研究所) School of Mathematics, Tianjin University(天津大学数学学院) Zhongguancun Academy(中关村科学院) Department of Mathematics, Stanford University(斯坦福大学数学系) Westlake Institute for Advanced Study, Westlake University(西湖大学西湖高等研究院) School of Mathematical Sciences, Key Laboratory of Intelligent Computing and Applications (Ministry of Education), Tongji University(同济大学数学科学学院(教育部智能计算与应用重点实验室)) Beijing International Center for Mathematical Research and the New Cornerstone Science Laboratory, Peking University(北京大学北京国际数学研究中心与新基石科学实验室) Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) Center for Intelligent Computing, Great Bay Institute for Advanced Study, Great Bay University(大湾区大学高等研究院智能计算中心)

专题命中 数学推理 :reasoning(title,abstract);planning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 本文针对基于大语言模型的数学推理智能体扩展和编排难题,提出以共享事实图为全局内存管理机制的Danus系统,由主智能体、工作智能体和验证器构成,通过案例研究评估,展示其构建长证明的能力,为长期研究问题提供有效编排途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06855 2026-07-09 cs.LG cs.CL 新提交 81%

Geometric Self-Distillation for Reasoning Generalization

用于推理泛化的几何自蒸馏

Josip Jukić, Ivan Titov

机构 * ILLC, University of Amsterdam(阿姆斯特丹大学伊利沙伯格学院) ILCC, University of Edinburgh(爱丁堡大学伊利沙伯格中心)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 研究针对大语言模型特权上下文自蒸馏中监督难以信赖、导致分布外推理能力下降的问题,提出几何自蒸馏目标GeoSD,通过Hellinger损失和近端项对抗漂移,提升了模型分布外推理准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07391 2026-07-09 cs.AI 新提交 79%

MIRA-Math: A Benchmark for Minimal Information Requesting and Mathematical Reasoning

MIRA-Math:最小信息请求与数学推理基准测试

Charbel Al Bateh, Samer Saab

机构 * Lebanese American University(黎巴嫩美国大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 介绍MIRA-Math基准测试,用于解决特定数学问题,求解器需按预算请求缺失信息并整合到答案,包含多类实例,实验表明请求成功率和答案准确率可分离,还发布相关工具支持可重复评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07026 2026-07-09 cs.LG 新提交 77%

Constrained Decoding for Diffusion Language Models via Efficient Inference over Finite Automata

通过有限自动机上的高效推理实现扩散语言模型的约束解码

Meihua Dang, Stefano Ermon

机构 * Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 研究扩散语言模型的约束解码问题,提出基于有限自动机高效推理的算法,能保证约束满足,支持多种解码方式,经实验验证在多种任务上提升准确率且推理开销小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07066 2026-07-09 cs.LG cs.AI math.NT math.RT 新提交 62%

Multiplication Beyond Groups: Stratified Fourier Mechanisms in Transformer Circuits

超越群的乘法:Transformer电路中的分层傅里叶机制

Zitong Andrew Chen, Junaid Hasan, Akhil Srinivasan, Hemkesh Bandi, Jarod Alper

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究小型变压器学习复合模上模整数乘法的方法,提出幺半群扩展,将输入空间划分区域,发现训练的变压器中嵌入、注意力等呈现特定特性,表明相关表示理论机制可超越群扩展到更一般结构。

Comments 29 pages, 15 figures. Spotlight at the Mechanistic Interpretability Workshop at ICML 2026. First three authors contributed equally. Code at https://github.com/uw-math-ai/interpreting-monoids

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06820 2026-07-09 cs.AI 新提交 57%

Evaluating SageMath-Augmented LLM Agents for Computational and Experimental Mathematics

评估用于计算和实验数学的SageMath增强型大语言模型智能体

Pavel Snopov, German Magai

机构 * The Sage Developers(Sage开发者团队)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究聚焦AI在数学领域进展,提出结合大语言模型推理与SageMath反馈的智能体设置,改进RealMath基准。实验表明该设置能提升模型性能,缩小模型差距,CAS增强型智能体在计算探索上有潜力,朝自动猜想发现迈进。

Comments 37 pages, 16 figures, accepted to 3rd AI for Math Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05835 2026-07-09 math.AG cs.AI math.CO 新提交 57%

Tangent classes of matroids and wonderful compactifications

拟阵的切线类与美妙紧化

Ronnie Cheng, Shurui Liu, Guoxiong Gao

机构 * Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文针对无环拟阵 \(M\) 及特定构建集 \(\mathcal{G}\) 构造整切线类 \(T_{M,\mathcal{G}}^{\mathbb{Z}}\),可恢复周环希尔伯特级数等。主体由人工智能达努斯自主生成,在相关论文公开前解决问题,展现了AI在数学研究中的潜力。

Comments v2: added reference to Danus report [Liu et al., arXiv:2607.06447] and minor edits

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 1 篇

2607.06757 2026-07-09 cs.AI cs.MA 新提交 74%

LLM-powered reasoning in agent-based modeling

基于代理建模中的大语言模型驱动推理

Sifat Afroj Moon, Dakotah Maguire, Adam Spannaus, Joe Tuccillo, Maksudul Alam, Sudip K. Seal, John Gounley, Heidi Hanson

机构 * ORNL(橡树岭国家实验室)

专题命中 代码与定理证明 :reasoning(title);分类 cs.AI

AI总结 研究针对传统基于代理建模(ABM)依赖静态先验无法适应实时变化的问题,提出利用大语言模型(LLMs)的可扩展混合代理和语言驱动的流行病(HALE)建模框架,并通过模拟COVID-19验证其可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 4 篇

2607.07316 2026-07-09 cs.LG 新提交 74%

Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning

神经网络的机械可解释性:电路、稀疏特征和符号推理

Pranav Sawant, Jakub Krejčí

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) VSB—Technical University of Ostrava(奥斯特拉瓦技术大学)

专题命中 逻辑推理 :reasoning(title);分类 cs.LG

AI总结 研究神经网络机械可解释性,通过Transformer电路分析、Sparse Autoencoders等工具应对叠加等挑战,探索控制模型行为方法,还将机械见解与神经符号人工智能框架联系,以实现神经网络内部算法逆向工程及可解释。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06724 2026-07-09 cs.RO 新提交 71%

EvoPlan: Evolutionary Neuro-Symbolic Robot Planning with Spatio-Temporal Guarantees

EvoPlan:具有时空保证的进化神经符号机器人规划

Bhavya Sai Nukapotula, Samin Moosavi, Haoze Wang, Luke Duncan, Diya Shakkottai, Varun Murali, Srinivas Shakkottai

机构 * Texas A&M University(德克萨斯农工大学)

专题命中 逻辑推理 :planning(title)

AI总结 研究针对基于LLM的机器人规划器不足及经典PDDL规划器问题,提出含离线STL约束挖掘、进化PDDL规划器和受约束执行循环的神经符号框架,能保证计划属性,在基准测试中表现良好且可在无云环境下部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07436 2026-07-09 cs.AI cs.CL cs.CR 新提交 62%

The Blind Curator: How a Biased Judge Silently Disables Skill Retirement in Self-Evolving Agents

盲选策展人:有偏见的评判者如何在自我进化的智能体中悄然阻碍技能淘汰

Xing Zhang, Yanwei Cui, Guanghui Wang, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He

机构 * AWS Generative AI Innovation Center(亚马逊云科技生成式人工智能创新中心) HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰科技中心,中国)

专题命中 逻辑推理 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 研究自我进化智能体中,有偏见的评判者对技能淘汰的影响。通过损坏奖励分析等方法发现,“误判通过”偏差会导致技能淘汰机制失效,此为行为安全结果。还提出廉价审计可判断评判者是否越过阈值影响智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07386 2026-07-09 cs.LG 新提交 57%

Sparse Delta Memory: Scaling the State of Linear RNNs through Sparsity

稀疏增量记忆:通过稀疏性扩展线性循环神经网络的状态

Loïc Cabannes, Pierre-Emmanuel Mazaré, Gergely Szilvasy, Matthijs Douze, Maria Lomeli, Ilze Amanda Auzina, Justin Carpentier, Gabriel Synnaeve, Hervé Jégou

机构 * Meta FAIR Inria Paris(巴黎信息与自动化研究所) ENS-PSL University(巴黎文理研究大学) University of Tübingen(图宾根大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 研究针对线性注意力模型长上下文召回不足的问题,提出稀疏增量记忆(SDM)架构,通过稀疏寻址扩展门控线性循环神经网络隐藏状态,在等FLOP和参数数量下提升性能,还能改进常识与推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 7 篇

2607.06964 2026-07-09 cs.RO cs.AI 新提交 79%

End-to-End LLM Flight Planning with RAG-based Memory and Multi-modal Coach Agent

基于基于检索增强生成的记忆和多模态教练代理的端到端大语言模型飞行规划

Amin Tabrizian, Arsyi Aziz, Aarifah Ullah, Mahyar Ghazanfari, Pouria Razzaghi, Peng Wei

机构 * George Washington University(乔治华盛顿大学) Metis Solutions Technology Inc

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 针对电动垂直起降飞机部署中传统飞行规划算法难以融入人类偏好的问题,提出FRAMe工具,集成规划器LLM、多模态教练代理和基于RAG的记忆,在多场景演示中效果最佳,能将自然语言指令转化为优质飞行路线。

Comments Accepted at the ICML 2026 LM4Plan Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07350 2026-07-09 cs.RO 新提交 78%

Towards Reliable Aerial Ground Vehicle Collaboration: An Integrated Planning and Autonomy Framework for Field Deployment

迈向可靠的空地车辆协作:用于实地部署的集成规划与自主框架

Md Safwan Mondal, Luca Russo, James D. Humann, James M. Dotterweich, Pranav Bhounsule

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 规划推理 :planning(title,abstract)

AI总结 研究针对无人机长时间任务飞行续航受限问题,提出集成规划与自主框架。通过深度强化学习规划器解决协同路由问题,引入标准化API弥合规划与执行差距,还有轻量级重新规划器,经实验验证系统在动态任务中有强大协同导航和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06990 2026-07-09 cs.RO 新提交 67%

A Closed-Loop Multi-Agent Framework for Robust Multi-Robot Manipulation

用于鲁棒多机器人操作的闭环多智能体框架

Yi-Xiang He, Lan Wei, Haoming Cen, Jian-Jian Jiang, Zhuohao Li, Guanxing Lu, Yihan Yang, Dandan Zhang, Wei-Shi Zheng

机构 * Sun Yat-sen University(中山大学) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部机器智能与先进计算重点实验室) Imperial College London(帝国理工学院) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 针对多机器人操作中高级推理应用于实际执行的挑战,提出基于分层闭环智能体的LLM框架,含规划、操作、验证智能体。经实际实验验证,该框架成功率高、适应性强,为多样操作任务提供可推广方法。

Comments RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07612 2026-07-09 cs.CY cs.AI 新提交 57%

Towards Agentic AI Governance: A Preliminary Assessment

迈向智能体人工智能治理:初步评估

Mubarak Raji, Masooda Bashir

机构 * School of Information Sciences, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校信息科学学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文针对智能体人工智能快速发展带来的新挑战,对其治理新兴文献做系统综述,分析其与传统系统不同的特征及治理需求,综合治理重点、机制和利益相关者角色,为制定指导智能体人工智能治理的路线图奠定基础。

Comments International Conference on the AI Revolution: Research, Ethics, and Society (AIR-RES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07467 2026-07-09 cs.AI 新提交 57%

SpaCellAgent: A Self-Evolving LLM-Based Multi-Agent Framework for Trajectory Analysis

SpaCellAgent:一种基于自进化大语言模型的轨迹分析多智能体框架

Songhan Wang, Haoang Chi, He Li, Zhiheng Zhang, Jiayan Yuan, Cheems Wang, Hao Peng, Xinwang Liu, Wenjing Yang

机构 * University of Shanghai for Science and Technology(上海理工大学) National University of Defense Technology(国防科技大学) Hong Kong Baptist University(香港浸会大学) Shanghai University of Finance and Economics(上海财经大学) Tsinghua University(清华大学) Beihang University(北京航空航天大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究针对轨迹推断现有方法需大量人工干预的问题,提出基于大语言模型的多智能体框架SpaCellAgent,利用多智能体架构、动态工具编排引擎和自进化模块,经实验验证其能大幅提高分析效率,推动先进时空建模民主化。

Comments 27 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06595 2026-07-09 cs.CR cs.AI 新提交 57%

When Agents Remember Too Much: Memory Poisoning Attacks on Large Language Model Agents

当智能体记忆过多时:对大语言模型智能体的内存中毒攻击

George Torres, Sharad Shrestha, Satyajayant Misra

机构 * George Torres3(乔治·托雷斯(第三作者)) Sharad Shrestha1(沙拉德·什雷斯塔(第一作者)) Satyajayant Misra4(萨蒂亚扬特·米什拉(第四作者))

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究大语言模型驱动的个人智能体因缺乏内存安全治理存在安全漏洞,提出攻击向量GhostWriter,实现近98%注入率和约60%激活率,还提出AM-Sentry缓解技术,显著降低GhostWriter成功率并保持智能体效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07534 2026-07-09 cs.CV 新提交 50%

Infinite Worlds with Versatile Interactions

具有通用交互的无限世界

Zelin Gao, Qiuyu Wang, Jiapeng Zhu, Jingye Chen, Zichen Liu, Qingyan Bai, Jiahao Wang, Yufeng Yuan, Hanlin Wang, Yichong Lu, Ka Leong Cheng, Haojie Zhang, Jian Gao, Tianrui Feng, Yuzheng Liu, Yao Yao, Yinghao Xu, Xing Zhu, Yujun Shen, Hao Ouyang

专题命中 规划推理 :planning(abstract)

AI总结 介绍LingBot-World 2.0的升级,包括通过因果预训练实现无界交互、提炼实时变体保证快速响应,引入多样交互元素,集成智能控制并开发共享界面,还将主模型与轻量级模型配对便于单GPU部署。

Comments Project page: https://technology.robbyant.com/lingbot-world-v2 Code: https://github.com/robbyant/lingbot-world-v2

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 4 篇

2607.07601 2026-07-09 cs.RO cs.AI 新提交 79%

CARLA-GS: Decoupling Representation, Reasoning, and Physics Simulation for Autonomous Driving Corner-Case Synthesis

CARLA-GS:用于自动驾驶极端情况合成的解耦表示、推理和物理模拟

Kaicong Huang, Meng Ma, Ruimin Ke

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究自动驾驶极端情况合成问题,提出CARLA-GS模块化管道,解耦视觉表示、语义推理和物理执行并保持跨模块耦合,能从实际驾驶数据生成可编辑场景,经多智能体大语言模型推理等步骤,实现可控生成及逼真、时空一致的视频。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06620 2026-07-09 cs.CV cs.AI 新提交 79%

SpaR3D-MoE: Adaptive 3D Spatial Reasoning from Sparse Views Meets Geometry-Inductive Mixture-of-Experts

SpaR3D-MoE:来自稀疏视图的自适应3D空间推理与几何归纳专家混合模型

Haida Feng, Hao Wei, Haolin Wang, Shiwei Li, Chade Li, Yihong Wu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) YUKUN Intelligent World(宇琨智能世界)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型在2D与3D表征差距问题,提出SpaR3D-MoE框架,通过自适应时空采样和几何归纳专家混合模型,从稀疏RGB输入实现自适应空间推理,在多个实验中取得最优性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06691 2026-07-09 cs.CV 新提交 67%

CoMind: Understanding Collaborative Human Activity from Multiple Minds and Views

CoMind:从多视角理解人类协作活动

Alexey Gavryushin, Dingxi Zhang, Zhao Huang, Alexandros Delitzas, Jiaqi Chen, Ben Ellis, Cedric Zöllner, Manthan Patel, Manuel Kaufmann, Marc Pollefeys, Xi Wang

机构 * ETH Zurich(苏黎世联邦理工学院) MPI for Informatics(马克斯·普朗克信息研究所) Microsoft Switzerland(微软瑞士公司) TU Munich(慕尼黑工业大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 研究旨在填补人类协作认知过程研究空白,引入CoMind数据集,整合多模态数据并标注,建立相关基准,有助于开发和评估能建模复杂社会互动及推理人类行为的AI系统。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07357 2026-07-09 cs.RO cs.AI 新提交 57%

HumAIN: Human-Aware Implicit Social Robot Navigation

HumAIN:人类感知的隐式社交机器人导航

Daeun Song, Nhat Le, Jeffrey Chen, Mohammad Nazeri, Amirreza Payandeh, Rohan Chandra, Reuth Mirsky, Ross Mead, Ling Xiao, Xuesu Xiao

机构 * Ewha Womans University(梨花女子大学) George Mason University(乔治梅森大学) University of Virginia(弗吉尼亚大学) Tufts University(塔夫茨大学) Semio(Semio公司) Hokkaido University(北海道大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 研究提出HumAIN框架,通过知识蒸馏将隐式社交线索融入机器人导航规划。利用基于Transformer的教师模型学习强大表示,蒸馏到轻量级学生模型。实验表明该方法能有效提升轨迹预测指标,在资源受限平台实现类人导航意识。

Comments 8 pages, 4 figures. Accepted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 测试时计算 7 篇

2607.06764 2026-07-09 cs.AI 新提交 83%

Cost-Effective Agent Harnesses for Abstract Reasoning and Generalization on ARC-AGI-1

用于ARC-AGI-1上抽象推理和泛化的经济高效智能体框架

Kabir Moghe, Peter Chin

机构 * Dartmouth College(达特茅斯学院)

专题命中 测试时计算 :reasoning(title);chain-of-thought(abstract);test-time compute(abstract);分类 cs.AI

AI总结 研究ARC-AGI-1上在严格预算下非思考模式的开放权重模型,构建智能体框架,包括探索者-定义者管道和反思协调器,通过特定架构提升基线成绩,分析了管道特性,确定思考工具是重要组件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06974 2026-07-09 cs.CL cs.LG 新提交 81%

MILES: Modular Instruction Memory with Learnable Selection for Self-Improving LLM Reasoning

MILES:用于自我改进的语言模型推理的具有可学习选择的模块化指令内存

Ruilin Tong, Dong Gong

机构 * University of New South Wales(新南威尔士大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 研究针对LLMs测试时推理问题,提出MILES框架,通过动态扩展内存及正确性优化的内存组合,利用模块化内存单元与可学习选择头实现粗到细检索机制,实验表明该框架在性能、效率及权衡上表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06720 2026-07-09 cs.AI cs.CL 新提交 81%

When Does In-Context Search Help? A Sampling-Complexity Theory of Reflection-Driven Reasoning

上下文搜索何时有用?基于反射驱动推理的采样复杂性理论

Yotam Wolf, Noam Wies, Amnon Shashua

机构 * The Hebrew University(希伯来大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究上下文搜索何时有用,通过将其建模为对推理轨迹的近似推理分析采样复杂性,表明反思能定位早期错误时可指数级改进,收益稳健可学习,还在强化学习抽象下验证了理论预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06799 2026-07-09 cs.LG cs.AI 新提交 73%

What Predicts Correctness in Text-to-SQL? A Selective-Prediction Study

什么能预测文本到SQL的正确性?一项选择性预测研究

Robert Richardson

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究哪些信号能预测文本到SQL的正确性,黑盒信号AUROC在0.61到0.68之间,基于验证的评判器分数更高,集成可达0.82 AUROC。还探讨验证器训练,微调后的验证器在分布内表现较好,但跨模式泛化能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08068 2026-07-09 cs.LG 新提交 70%

DICE: Entropy-Regularized Equilibrium Selection for Stable Multi-Agent LLM Coordination

DICE: 用于稳定多智能体LLM协调的熵正则化均衡选择

Yi Xie, Zhanke Zhou, Chentao Cao, Bo Liu, Bo Han

机构 * University of Arizona(亚利桑那大学) Hong Kong Baptist University(香港浸会大学)

专题命中 测试时计算 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 提出DICE框架,通过熵正则化均衡选择(HQRE)解决多智能体LLM协调中的不稳定性,实现线性收敛和有限贝叶斯遗憾,在11个基准上平均提升4.3-8.5个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07508 2026-07-09 cs.LG cs.AI 新提交 62%

Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning

用于智能强化学习的单步异步优化

Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong

机构 * Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对异步强化学习中训练稳定性和离策略挑战,提出单步异步优化(SAO)。核心方法是用单步采样取代分组采样,改进单步策略并引入裁剪策略。主要贡献是SAO训练稳定,性能优于GRPO及其变体,在模拟在线学习中有效且成功部署于模型训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06987 2026-07-09 cs.LG 新提交 57%

UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma

UP:用于打破探索-稳定性困境的无界正不对称优化

Chongyu Fan, Pengfei Liu, Jingjia Huang, Sijia Liu, Yi Lin

机构 * ByteDance Seed(字节跳动种子) Michigan State University(密歇根州立大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 研究针对强化学习探索-稳定性困境,提出无界正不对称优化(UP)方法,通过特殊设计重组优化过程,在多种算法、模型架构及训练模式下增强探索能力,实现卓越推理精度,是通用即插即用的强化学习训练增强方法。

详情

展开后加载摘要…

URL PDF HTML 收藏