arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-14 至 2026-05-14 共收录 123 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 12 篇

2605.13165 2026-05-14 cs.CL 87%

STOP: Structured On-Policy Pruning of Long-Form Reasoning in Low-Data Regimes

STOP:低数据场景下长形式推理的结构化在线剪枝

Chenjun Xu, Zhennan Zhou, Zhan Su, Bill Howe, Lucy Lu Wang, Bingbing Wen

机构 * University of Washington(华盛顿大学) University of Montreal(蒙特利尔大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 STOP通过结构化在线剪枝减少低数据场景下的长形式推理生成token,同时保持准确性,提升推理效率与结构效率。

Comments 20 pages, 6 figures, 6 tables. Code available at: https://github.com/chenjux/ECN-STOP

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10931 2026-05-14 cs.LG cs.CL 81%

Asynchronous Reasoning: Training-Free Interactive Thinking LLMs

异步推理:无需训练的交互式思考LLM

George Yakushev, Nataliia Babina, Masoud Vahid Dastgerdi, Vyacheslav Zhdanovskiy, Denis Kuznedelev, Alina Shutova, Max Ryabinin

机构 * Yandex HSE University(俄罗斯高等经济大学) The University of Tokyo(东京大学) MATS Together AI

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种无需额外训练的LLM异步推理方法,通过位置嵌入特性实现同时思考、倾听和生成输出,提升数学、常识和安全推理任务的准确性和响应速度。

Comments Preprint, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13301 2026-05-14 cs.AI cs.CL 81%

Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling

通过简单统一的扩展实现金牌级竞赛推理

Yafu Li, Runzhe Zhan, Haoran Zhang, Shunkai Zhang, Yizhuo Li, Zhilin Wang, Jiacheng Chen, Futing Wang, Xuyang Hu, Yuchen Fan, Bangjie Xu, Yucheng Su, Xinmiao Han, Chenxi Li, Haodi Lei, Yufeng Zhao, Zejin Lin, Qianjia Cheng, Tong Zhu, Xiaoye Qu, Ganqu Cui, Peng Ye, Yun Luo, Zhouchen Lin, Yu Qiao, Bowen Zhou, Ning Ding, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种简单统一的方法,将训练好的推理模型扩展为金牌级竞赛解题器,通过反熵课程和两级强化学习提升证明搜索能力,最终在数学和物理竞赛中取得金牌水平表现。

Comments Technical Report. 77 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08504 2026-05-14 cs.CL 70%

A Single Layer to Explain Them All:Understanding Massive Activations in Large Language Models

一层解释所有:理解大语言模型中大规模激活现象

Zeru Shi, Zhenting Wang, Fan Yang, Qifan Wang, Ruixiang Tang

机构 * Rutgers University(罗格斯大学) Wake Forest University(威克森林大学) Meta AI

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

AI总结 研究大语言模型中大规模激活的起源,发现ME层是大规模激活首次出现的层,并提出方法减少大规模激活的刚性,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13695 2026-05-14 cs.CL cs.AI 62%

RTLC -- Research, Teach-to-Learn, Critique: A three-stage prompting paradigm inspired by the Feynman Learning Technique that lifts LLM-as-judge accuracy on JudgeBench with no fine-tuning

RTLC -- 研究、教以学、批判:一种受费曼学习技术启发的三阶段提示范式,无需微调即可提升LLM-as-judge在JudgeBench上的准确性

Andrea Morandi

机构 * Cisco(思科)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 RTLC通过三阶段提示方法提升LLM在JudgeBench上的准确性,无需微调或外部工具,其核心方法包括研究、教以学和批判三个阶段,显著提升客观正确性评分的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13295 2026-05-14 cs.CL cs.AI cs.MA 62%

CANTANTE: Optimizing Agentic Systems via Contrastive Credit Attribution

CANTANTE:通过对比信用分配优化代理系统

Tom Zehle

机构 * University of Freiburg(弗赖堡大学) ELLIS Institute(埃里克·林斯研究所) Tübingen(图宾根)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CANTANTE框架,通过对比多个联合配置的rollouts分解系统奖励为单个代理的更新信号,提升多代理系统优化效果,在编程、数学推理和多跳问答任务中均取得最佳排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13399 2026-05-14 cs.AI cs.CL 62%

Differentiable Evolutionary Reinforcement Learning

可微分进化强化学习

Sitao Cheng, Tianle Li, Xuhan Huang, Xunjian Yin, Difan Zou

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DERL,通过可微分的元优化器自动发现最优奖励结构,实现复杂任务中的高效强化学习,优于传统非可微方法。

Comments Work in Progress. We release our code and model at https://github.com/sitaocheng/DERL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11274 2026-05-14 cs.CL cs.LG 62%

Learning a Continue-Thinking Token for Enhanced Test-Time Scaling

学习一个持续思考标记以增强测试时扩展

Liran Ringel, Elad Tolochinsky, Yaniv Romano

机构 * Department of Computer Science, Technion – Israel Institute of Technology(计算机科学系,技术学院–以色列理工学院) Department of Electrical and Computer Engineering, Technion – Israel Institute of Technology(电气与计算机工程系,技术学院–以色列理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了通过学习专用持续思考标记来提升测试时扩展性能的方法,实验表明该方法在数学基准测试中优于固定标记方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05410 2026-05-14 cs.AI cs.CL 62%

ChatSR: Multimodal Large Language Models for Scientific Formula Discovery

ChatSR:用于科学公式发现的多模态大语言模型

Yanjie Li, Lina Yu, Weijun Li, Min Wu, Liping Zhang, Jingyi Liu, Yusong Deng, Mingzhu Wan, Xin Ning

机构 * AnnLab, Institute of Semiconductors, Chinese Academy of Sciences, Beijing, China(安 lab,半导体研究所,中国科学院,北京,中国) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences, Beijing, China(电子、电气与通信工程学院,中国科学院大学,北京,中国) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing 101408, China(先进交叉科学学院,中国科学院大学,北京101408,中国) College of Materials Science and Opto-Electronic Technology, University of Chinese Academy of Sciences, Beijing, 100049, China(材料科学与光电技术学院,中国科学院大学,北京100049,中国) School of Integrated Circuits, University of Chinese Academy of Sciences, Beijing 100049, China(集成电路学院,中国科学院大学,北京100049,中国)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ChatSR通过设计专用编码器和模态对齐机制,将科学数据映射到可被大语言模型处理的表示空间,从而生成符合领域先验的数学公式,推动科学发现自动化。

Comments 14 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13414 2026-05-14 cs.AI 57%

TRIAGE: Evaluating Prospective Metacognitive Control in LLMs under Resource Constraints

TRIAGE:在资源限制下评估大语言模型的前瞻性元认知控制

Zabir Al Nazi, Shubhashis Roy Dipta

机构 * University of California, Riverside, USA(加州大学河滨分校) University of Maryland, Baltimore County, USA(马里兰大学巴尔的摩县分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究评估了大语言模型在资源限制下的前瞻性元认知控制能力,通过Triage框架测试不同模型在多个领域的表现,揭示了现有模型在该能力上的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09923 2026-05-14 cs.AI 57%

expo: Exploration-prioritized policy optimization via adaptive kl regulation and gaussian curriculum sampling

expo: 通过自适应KL调节和高斯课程采样优先政策优化

Mingxiong Lin, Zhangquan Gong, Maowen Tang, Qian Li, Chuangchuang Wang, Jian Ma, Sutian Huang, Kai Tang, Haonan Lu

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出EXPO算法,通过自适应KL调节和高斯课程采样提升策略探索效率,实验表明其在数学推理任务中显著优于传统GRPO方法。

Comments Duplicate submission of arXiv:2605.11403

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00066 2026-05-14 cs.LG 57%

Sharpness-Guided Group Relative Policy Optimization via Probability Shaping

通过概率塑造的锐度引导组相对策略优化

Tue Le, Linh Ngo Van, Trung Le

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出GRPO-SG,通过降低可能引起过大梯度的token权重,提升RLVR的泛化能力,实验显示在数学推理、逻辑谜题和工具增强问答中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 6 篇

2605.12532 2026-05-14 q-fin.TR cs.AI stat.ME 79%

AgenticAITA: A Proof-Of-Concept About Deliberative Multi-Agent Reasoning for Autonomous Trading Systems

AgenticAITA: 关于自主交易系统中 deliberative 多智能体推理的证明概念

Ivan Letteri

机构 * Department of Information Engineering, Computer Science, and Mathematics, Center of Excellence for Research DEWS, University of L’Aquila(信息工程、计算机科学和数学系,DEWS研究中心,拉奎拉大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出AGENTICAITA框架,通过多智能体协作推理替代传统信号执行模式,实现自主交易系统中无离线训练的决策流程,展示其在金融决策中的可行性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07147 2026-05-14 cs.LO cs.AI cs.LG 62%

MathlibPR: Pull Request Merge-Readiness Benchmark for Formal Mathematical Libraries

MathlibPR: 用于正式数学库的拉取请求合并准备性基准

Zixuan Xie, Xinyu Liu, Shangtong Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MathlibPR基准,通过真实Mathlib4 PR历史评估LLM在审查合并准备性PR中的能力,揭示LLM在区分有效PR与需修订PR中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18917 2026-05-14 cs.AI cs.PL cs.SE 57%

ClassInvGen: Class Invariant Synthesis using Large Language Models

ClassInvGen:利用大语言模型进行类不变式合成

Chuyue Sun, Viraj Agashe, Saikat Chakraborty, Jubi Taneja, Clark Barrett, David Dill, Xiaokang Qiu, Shuvendu K. Lahiri

机构 * Stanford University(斯坦福大学) Microsoft Research(微软研究院) Purdue University(普渡大学)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 本文提出ClassInvGen,利用大语言模型生成C++等主流语言的可执行类不变式及测试输入,优于纯LLM方法和Daikon等传统技术,提供基准测试和案例研究验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13171 2026-05-14 cs.AI 57%

Formal Conjectures: An Open and Evolving Benchmark for Verified Discovery in Mathematics

形式猜想:一个开放且不断演进的数学验证发现基准

Moritz Firsching, Paul Lezeau, Salvatore Mercuri, Miklós Z. Horváth, Yaël Dillies, Calle Sönne, Eric Wieser, Fred Zhang, Thomas Hubert, Blaise Agüera y Arcas, Pushmeet Kohli

机构 * Google DeepMind(谷歌DeepMind) Imperial College London(帝国理工学院伦敦分校) Stockholms universitet(斯德哥尔摩大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 Formal Conjectures提供2615个形式化的数学问题,包含1029个开放猜想和836个已解决问题,用于评估自动化推理系统的能力,并通过协作项目确保正确性,推动数学证明发现的进展。

Comments 21 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12694 2026-05-14 cs.SE cs.AI cs.PL 57%

Agentic Interpretation: Lattice-Structured Evidence for LLM-Based Program Analysis

代理解释:基于格结构的证据用于基于LLM的程序分析

Jacqueline L. Mitchell, Chao Wang

机构 * University of Southern California, Los Angeles, California, USA(美国南加州大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出代理解释框架,结合格结构静态分析与LLM程序推理,通过分解分析目标为局部断言并跟踪LLM判断,改进程序分析的灵活性和准确性。

Comments 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09675 2026-05-14 cs.CL 57%

d-TreeRPO: Towards More Reliable Policy Optimization for Diffusion Language Models

d-TreeRPO:迈向更可靠的扩散语言模型策略优化

Leyi Pan, Shuchang Tao, Yunpeng Zhai, Zheyu Fu, Liancheng Fang, Minghua He, Lingzhe Zhang, Zhaoyang Liu, Bolin Ding, Aiwei Liu, Lijie Wen

机构 * Tsinghua University(清华大学) Tongyi Lab(通义实验室) University of Illinois at Chicago(伊利诺伊大学香槟分校) Peking University(北京大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 本文提出d-TreeRPO框架,通过树状回滚和可验证奖励提升扩散语言模型策略优化的可靠性,理论证明预测信心提升可减少预测概率偏差,并在多个推理基准上取得显著提升。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 4 篇

2505.12415 2026-05-14 cs.CL cs.AI 82%

Table-R1: Region-based Reinforcement Learning for Table Understanding

基于区域的表格理解强化学习:Table-R1

Zhenhe Wu, Jian Yang, Zhongjiang He, Changzai Pan, Jie Zhang, Jiaheng Liu, Xianjie Wu, Yu Zhao, Shuangyong Song, Yongxiang Li, Zhoujun Li, Xueling Li

机构 * Beihang University(北京航空航天大学) Xingchen AGI Lab(星辰AGI实验室) China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(中国电信人工智能技术(北京)有限公司) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI))

专题命中 逻辑推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Table-R1,通过区域证据增强和TARPO优化提升LLM的表格理解能力,在多个数据集上提升14.36个百分点,同时降低响应token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06475 2026-05-14 cs.LG 79%

Towards Generalizable Reasoning: Group Causal Counterfactual Policy Optimization for LLM Reasoning

迈向通用性推理:面向LLM推理的群体因果反事实策略优化

Jingyao Wang, Peizheng Guo, Wenwen Qiang, Jiahuan Zhou, Huijie Guo, Changwen Zheng, Hui Xiong

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Wangxuan Institute of Computer Technology, Peking University(北京大学王宣计算机技术研究所) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出群体因果反事实策略优化方法,通过反事实奖励提升LLM推理的通用性,强调推理过程的鲁棒性和有效性,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12520 2026-05-14 cs.CL cs.AI 76%

BoostTaxo: Zero-Shot Taxonomy Induction via Boosting-Style Agentic Reasoning and Constraint-Aware Calibration

BoostTaxo:通过提升式代理推理和约束感知校准进行零样本分类诱导

Yancheng Ling, Zhenlin Qin, Leizhen Wang, Zhenliang Ma

机构 * KTH Royal Institute of Technology(皇家理工学院) Monash University(莫纳什大学)

专题命中 逻辑推理 :reasoning(title);分类 cs.CL、cs.AI

AI总结 BoostTaxo通过提升式代理推理和约束感知校准方法,提升零样本分类诱导的泛化能力、结构可靠性及效率,实验证明其在WordNet、DBLP和SemEval-Sci数据集上性能优异。

Comments 13 pages,7 figtures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12718 2026-05-14 cs.AI cs.LG cs.MA 62%

CHAL: Council of Hierarchical Agentic Language

CHAL:层次代理语言委员会

Tommaso Giovannelli, Griffin D. Kent

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 CHAL框架通过将辩论视为信念优化过程,改进了LLM在可反驳领域中的推理能力,通过层次代理结构和可审计的信念记录,实现了更透明和可解释的多代理辩论系统。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 30 篇

2510.08992 2026-05-14 cs.LG 90%

Constraints-of-Thought: A Framework for Constrained Reasoning in Language-Model-Guided Search

思维约束:一种在语言模型引导搜索中进行约束推理的框架

Kamel Alrashedy, Vriksha Srihari, Zulfiqar Zaidi, Ridam Srivastava, Pradyumna Tambwekar, Matthew Gombolay

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);planning(abstract)

AI总结 本文提出Const-o-T框架,通过约束推理提升语言模型在多步骤任务中的规划效率和决策可靠性,适用于风险游戏、CAD代码生成和算术推理等复杂领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03167 2026-05-14 cs.CL cs.AI cs.LG 87%

Where Do Reasoning Models Refuse?

推理模型拒绝发生在何处?

Kureha Yamaguchi, Benjamin Etheridge, Andy Arditi

机构 * The Alan Turing Institute(艾伦·图灵研究所) University of Oxford(牛津大学) Northeastern University(东北大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨推理模型在生成响应前拒绝决策的位置,发现推理链中的初始句子对拒绝决定有显著影响,并通过激活方向分析揭示了拒绝机制。

Comments v1 accepted to the ICML 2025 Workshop on Reliable and Responsible Foundation Models (R2FM). 20 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09505 2026-05-14 cs.AI 83%

EpiGraph: Building Generalists for Evidence-Intensive Epilepsy Reasoning in the Wild

EpiGraph:构建证据密集型癫痫推理的通用专家

Yuyang Dai, Zheng Chen, Jathurshan Pradeepkumar, Yasuko Matsubara, Jimeng Sun, Yasushi Sakurai, Yushun Dong

机构 * Florida State University(佛罗里达州立大学) The University of Osaka(大阪大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 EpiGraph通过整合癫痫领域异构知识图谱,提升证据驱动的临床推理能力,在药基因组学任务中提升30-41%,为神经科应用提供实用评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
1307.7494 2026-05-14 cs.AI cs.LO cs.RO 83%

ReAct! An Interactive Tool for Hybrid Planning in Robotics

ReAct! 一种用于机器人混合规划的交互工具

Zeynep Dogmus, Esra Erdem, Volkan Patoglu

机构 * Sabancı University(Sabanci大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 ReAct! 提供了一种交互式工具,使机器人研究人员能够在无需了解底层形式化细节的情况下,通过高级推理解决复杂规划问题,适用于服务机器人和认知工厂等动态领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26839 2026-05-14 cs.LG cs.CV 83%

From Pixels to BFS: High Maze Accuracy Does Not Imply Visual Planning

从像素到BFS:高迷宫精度并不意味着视觉规划

Alberto G. Rodriguez Salgado

机构 * Independent Researcher(独立研究者)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.LG

AI总结 本文通过MazeBench基准测试,揭示了多模态模型在视觉空间任务中依赖于文本网格转换和逐步路径枚举,而非真正的规划,高精度并不等同于人类空间理解。

Comments 15 pages, 10 figures. Code and mazes available at https://github.com/alrod97/LLMs_mazes

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11556 2026-05-14 cs.CL cs.AI cs.MA 81%

Systematic Failures in Collective Reasoning under Distributed Information in Multi-Agent LLMs

多智能体大语言模型中分布式信息下的集体推理系统性失效

Yuxuan Li, Aoi Naito, Hirokazu Shirado

机构 * School of Computer Science, Carnegie Mellon University, Pittsburgh, USA(计算机科学学院,卡内基梅隆大学,匹兹堡,美国) School of Environment and Society, Institute of Science Tokyo, Tokyo, Japan(环境与社会学院,东京科学研究所,东京,日本)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究发现多智能体大语言模型在分布式信息下仅能获得30.1%的准确率,而单智能体在完整信息下可达80.7%。系统性失效源于智能体无法识别和应对潜在的信息不对称,导致关键分布式事实未被探索。通过轻量级结构化通信协议可显著提升集体推理能力。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13534 2026-05-14 cs.AI 79%

Scaling Retrieval-Augmented Reasoning with Parallel Search and Explicit Merging

通过并行搜索和显式合并扩展检索增强推理

Jiabei Liu, Wenyu Mao, Junfei Tan, Chunxu Shen, Lingling Yi, Jiancan Wu, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) WeChat Technical Architecture Department, Tecent Inc.(腾讯公司微信技术架构部门)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出MultiSearch框架,通过多查询检索和显式信息融合提升检索增强推理效果,实验表明其在问答任务中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13481 2026-05-14 cs.CL 79%

PersonalAI 2.0: Enhancing knowledge graph traversal/retrieval with planning mechanism for Personalized LLM Agents

PersonalAI 2.0:通过规划机制增强知识图谱遍历/检索以实现个性化大语言模型代理

Mikhail Menschikov, Matvey Iskornev, Alexander Kharitonov, Alina Bogdanova, Mikhail Belkin, Ekaterina Lisitsyna, Artyom Sosedka, Victoria Dochkina, Ruslan Kostoev, Ilia Perepechkin, Evgeny Burnaev

机构 * Huawei, Moscow, Russia(华为,莫斯科,俄罗斯)

专题命中 规划推理 :planning(title);reasoning(abstract);分类 cs.CL

AI总结 PersonalAI 2.0通过动态多阶段查询流程提升知识图谱遍历与检索能力,结合实体提取和生成线索查询,提升回答准确性,优于现有方法,且在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏