arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-16 至 2026-06-16 共收录 251 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 18 篇

2606.15877 2026-06-16 cs.CL cs.AI 新提交 88%

Free Energy Heuristics: Fast-And-Frugal Cognition as Active Inference Under Uncertain Precision

自由能启发式:作为不确定精度下主动推理的快速节俭认知

Alex Bogdan

机构 * Evolutionairy AI Toronto, Canada(进化人工智能(多伦多,加拿大))

专题命中 数学推理 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);planning(abstract)

AI总结 本文提出元不确定性决定链式思维(CoT)的效果:当模型对自身证据的可靠性高度不确定时,更多推理会降低准确率。通过自由能最小化策略证明,在重尾精度先验下,有限数量的高有效性线索后停止整合,与“取最优”启发式等价。实验验证了高元不确定性下长CoT导致准确率下降17.3个百分点。

Comments 64 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16010 2026-06-16 cs.IR cs.AI 新提交 83%

Theorem-Grounded Execution Ontologies for Interpretable Machine Reasoning

定理驱动的可执行本体用于可解释机器推理

Raghu Anantharangachar

机构 * Independent Researcher(独立研究者)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出TGEO框架,将推理建模为可执行状态转换过程,通过定理族识别、本体绑定、语义对象发现等步骤生成可解释推理图,实现可验证、可重放的AI推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08577 2026-06-16 cs.CL cs.AI cs.LG cs.PF 版本更新 82%

Think-at-Hard: Selective Latent Iterations to Improve Reasoning Language Models

Think-at-Hard: 选择性潜在迭代以改进推理语言模型

Tianyu Fu, Yichen You, Zekai Chen, Guohao Dai, Huazhong Yang, Yu Wang

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对循环变压器中潜在过思考问题,提出Think-at-Hard方法,通过轻量级决策器选择性地在困难令牌上触发潜在迭代,并采用深度感知LoRA和双因果注意力机制,在数学、问答和编码任务上一致提升性能。

Comments Accepted by ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01444 2026-06-16 cs.AI cs.CL cs.LG 版本更新 82%

Dual-Uncertainty Guided Policy Learning for Multimodal Reasoning

双不确定性引导的多模态推理策略学习

Rui Liu, Dian Yu, Tong Zheng, Runpeng Dai, Zongxia Li, Wenhao Yu, Zhenwen Liang, Linfeng Song, Haitao Mi, Pratap Tokekar, Dong Yu

机构 * Tencent Hunyuan(腾讯文汇) University of Maryland(马里兰大学) University of North Carolina(北卡罗来纳大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出DUPL方法,通过量化感知不确定性和输出不确定性来引导策略更新,在多个多模态推理基准上显著提升模型准确率,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16934 2026-06-16 cs.CL cs.LG 新提交 81%

Exploring Extrinsic and Intrinsic Properties for Effective Reasoning with Code Interpreter

探索代码解释器有效推理的外在属性与内在属性

Patomporn Payoungkhamdee, Napat Laosaengpha, Jenta Wonglertsakul, Pittawat Taveekitworachai, Pume Tuchinda, Panjapong Poobanchuen, Ekapol Chuangsuwanich, Can Udomcharoenchaikit, Samuel Cahyawijaya, Peerat Limkonchotiwat, Sarana Nutanong

机构 * Vidyasirimedhi Institute of Science and Technology(维达亚希米科技学院) Kasetsart University(科琼大学) SCB 10X King Mongkut’s University of Technology Thonburi(朱拉隆功技术大学泰竹分校) Department of Computer Engineering Chulalongkorn Univesity(朱拉隆功大学计算机工程系) Cohere AI Singapore(AI新加坡)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文从外在属性(关键token)和内在属性(代码特定认知行为)两个角度研究代码解释器推理,发现强模型更频繁出现关键token和验证、回溯等行为,并利用这些属性在推理和训练中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15576 2026-06-16 cs.LG cs.AI 新提交 81%

Localizing Credit at the Divergence: Path-Conditioned Self-Distillation for LLM Reasoning

在分歧处定位信用:路径条件自蒸馏用于LLM推理

Yu Li, Shu Hong, Tian Lan

机构 * Department of Electrical and Computer Engineering, George Washington University(乔治华盛顿大学电气与计算机工程系)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出Hindsight Self-Distillation (HSD)方法,通过将教师模型条件于当前训练组中的成功同伴轨迹,在失败与成功轨迹的分歧处提供密集信用信号,提升LLM在数学和代码推理任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15080 2026-06-16 cs.CL cs.AI 新提交 81%

AdaMame: A Training Recipe for Adaptive Multilingual Reasoning

AdaMame: 一种自适应多语言推理的训练方案

Dayeon Ki, Kevin Duh, Marine Carpuat

机构 * University of Maryland(马里兰大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对多语言推理中的语言崩溃问题,提出两阶段训练方案AdaMame,通过SFT建立多语言能力,再以自适应GRPO优化推理语言对齐,在准确率、语言保真度和令牌效率上达到帕累托最优。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09655 2026-06-16 cs.CL cs.LG 版本更新 81%

DRA-GRPO: Your GRPO Needs to Know Diverse Reasoning Paths for Mathematical Reasoning

DRA-GRPO:你的GRPO需要了解多样化的推理路径以进行数学推理

Xiwen Chen, Wenhui Zhu, Peijie Qiu, Xuanzhao Dong, Hao Wang, Haiyu Wu, Huayu Li, Aristeidis Sotiras, Yalin Wang, Abolfazl Razi

机构 * Morgan Stanley(摩根士丹利) Clemson University(克莱姆森大学) Arizona State University(亚利桑那州立大学) Washington University in St. Louis(圣路易斯华盛顿大学) University of Notre Dame(圣母大学) University of Arizona(亚利桑那大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 针对GRPO在数学推理中因奖励信号非单射导致策略坍塌的问题,提出基于子模互信息的多样性感知奖励调整框架DRA,通过逆倾向评分去偏梯度估计,在五个数学基准上以少量数据和成本取得平均58.2%的准确率。

Comments ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17104 2026-06-16 cs.AI cs.CL cs.LO 版本更新 81%

Towards Advanced Mathematical Reasoning for LLMs via First-Order Logic Theorem Proving

迈向基于一阶逻辑定理证明的大语言模型高级数学推理

Chuxue Cao, Mengze Li, Juntao Dai, Jinluan Yang, Zijian Zhao, Shengyu Zhang, Weijie Shi, Chengzhong Liu, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型在多步一阶逻辑数学推理中的困难,提出DREAM方法,通过公理驱动策略多样化和子命题错误反馈提升推理多样性和正确性,在定理证明数据集上性能提升0.6%-6.4%。

Comments Accepted by EMNLP 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16152 2026-06-16 cs.AI 新提交 79%

The Quality-Utility Paradox: Why High-Reward Data Impairs Small Model Mathematical Reasoning

质量-效用悖论:为什么高奖励数据会损害小模型的数学推理

Haolong Qian, Xianliang Yang, Yinuo ma, Lirong Che, Feng Lu, Ye Guo, Lei Song, Jiang Bian, Chun Yuan

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 发现数学推理蒸馏中的质量-效用悖论:Oracle精炼的高奖励数据因分布漂移增加适应成本,反而不如SLM自生成数据;提出风格对齐精炼方法恢复效用。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17024 2026-06-16 cs.LG 新提交 77%

ExpRL: Exploratory RL for LLM Mid-Training

ExpRL: 用于LLM中期训练的探索性强化学习

Violet Xiang, Amrith Setlur, Chase Blagden, Nick Haber, Aviral Kumar

机构 * Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学) OpenAI Rogo

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);self-correction(abstract);分类 cs.LG

AI总结 提出ExpRL方法,利用人类编写的问答数据作为奖励支架,通过密集奖励强化推理过程中的部分进展和有用行为,在数学推理任务上优于SFT、稀疏奖励GRPO和自蒸馏,并为后续稀疏奖励RL提供更好的初始化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07079 2026-06-16 cs.LG cs.CL 版本更新 73%

Entropy-Aware On-Policy Distillation of Language Models

熵感知的在线策略蒸馏语言模型

Woogyeol Jin, Taywon Min, Yongjin Yang, Dennis Wei, Yi Zhou, Swanand Ravindra Kadhe, Nathalie Baracaldo, Kimin Lee

机构 * IBM Research, San Jose, CA, USA(IBM研究院,旧金山,加州,美国) University of Toronto, Ontario, Canada(多伦多大学,安大略,加拿大) Vector Institute, Ontario, Canada(向量研究所,安大略,加拿大)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG

AI总结 针对在线策略蒸馏中反向KL导致生成多样性下降和教师高熵时学习信号不稳定的问题,提出熵感知的在线策略蒸馏方法,通过在高熵时引入前向KL平衡模式寻求与模式覆盖,提升了生成多样性和学生-教师对齐度。

Comments 18 pages, 11 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03417 2026-06-16 cs.CR cs.AI 版本更新 70%

Parallel Test-Time Scaling with Multi-Sequence Verifiers

并行测试时扩展与多序列验证器

Yegon Kim, Seungyoo Lee, Chaeyun Jang, Hyungi Lee, Juho Lee

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 提出多序列验证器(MSV),通过条件化候选集预测正确性,改善校准性,提升最佳选择准确率并实现早停策略,在数学推理任务中以不到一半延迟达到相同精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16793 2026-06-16 cs.LG 版本更新 70%

Escaping the Cognitive Well: Efficient Competition Math with Off-the-Shelf Models

逃离认知陷阱:使用现成模型高效解决竞赛数学问题

Xingyu Dang, Rohit Agarwal, Rodrigo Porto, Anirudh Goyal, Liam H Fowl, Sanjeev Arora

机构 * Princeton University(普林斯顿大学) Princeton Language and Intelligence(普林斯顿语言与智能)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.LG

AI总结 提出一种推理流水线,利用现成模型以极低成本在IMO风格数学问题上达到最佳性能,通过猜想提取和上下文分离解决求解器-评分器流水线中的认知陷阱问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15994 2026-06-16 cs.AI cs.LG 新提交 62%

Agentic Framework for Deep Learning workload migration via In-Context Learning

基于上下文学习的深度学习工作负载迁移智能体框架

Qiyue Liang, Steven Ingram, George Vanica, Andi Gavrilescu, Newfel Harrat, Hassan Sipra, Sethuraman Sankaran

机构 * Google(谷歌)

专题命中 数学推理 :self-correction(abstract);分类 cs.AI、cs.LG

AI总结 提出结合上下文学习与Oracle驱动的自调试的自主系统,实现从PyTorch到JAX的深度学习模型自动迁移,在神经模块上达到91%数值等价性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16111 2026-06-16 cs.CL 新提交 57%

Towards Pareto-Optimal Tool-Integrated Agents with Pareto Ranking Policy Optimization

面向帕累托最优工具集成智能体的帕累托排名策略优化

Junyi Li, Xiaowei Qian, Yingyi Zhang, Wenlin Zhang, Guojing Li, Sheng Zhang, Xiao Han, Yichao Wang, Xiangyu Zhao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 提出ParetoPO框架,通过超体积引导动态标量化和帕累托排名优势计算,在多目标下优化工具使用语言模型的准确性与效率权衡。

Comments ICML 2026 Spotlight Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15577 2026-06-16 cs.AI 新提交 57%

Large Language Models as Optimizers: A Survey of Direct vs. Tool-Augmented Approaches and Their Performance Frontiers

大型语言模型作为优化器:直接方法与工具增强方法的调查及其性能前沿

Roko Peran, Luka Hobor, Mihael Kovac, Mario Brcic

机构 * University of Zagreb, Faculty of Electrical Engineering and Computing(萨格勒布大学电气工程与计算学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 综述LLM作为优化器的三种范式(直接优化、工具增强优化、工具创造优化),分析性能前沿与推理差距,探讨直接优化的未来潜力与工具增强优化的可审计性之间的权衡。

Comments 6 pages, 1 figure, 2 tables, accepted at 49th ICT and Electronics Convention, MIPRO - https://mipro.hr; Paper ID: #23463

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13782 2026-06-16 cs.AI 新提交 57%

MA-ProofBench: A Two-Tiered Evaluation of LLMs for Theorem Proving in Mathematical Analysis

MA-ProofBench: 数学分析中定理证明的大语言模型双层评估基准

Lushi Pu, Weiming Zhang, Xinheng Xie, Zixuan Fu, Bingxiang He, Hongya Lyu, Xin Li, Jie Zhou, Yudong Wang

机构 * ModelBest Inc. Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出首个面向数学分析的形式化定理证明基准MA-ProofBench,包含200个定理,覆盖6个核心主题和27个子类别,分为本科和博士资格两级难度,评估发现当前模型表现不佳,GPT-5.5在Level I上仅达16% Pass@8。

Comments 19 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 7 篇

2606.15972 2026-06-16 cs.CL cs.AI cs.LG 新提交 88%

Formalize Once, Edit the Rest: Efficient Lean-Based Answer Selection for Math Reasoning

一次形式化,其余编辑:基于Lean的高效数学推理答案选择

Ji Feng, Zhouxing Shi

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 代码与定理证明 :reasoning(title,abstract);math reasoning(title);分类 cs.CL、cs.AI、cs.LG

AI总结 提出BASE流水线,通过形式化一个候选答案并编辑其余答案,减少自动形式化调用约5倍,同时提升选择准确性。

Comments 15 pages, 1 figure. Code available at https://github.com/ucr-rai/base-and-edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06646 2026-06-16 cs.CL cs.AI 新提交 62%

CAF-Gen: A Multi-Agent System for Enriching Argumentation Structures

CAF-Gen: 一种用于丰富论证结构的多智能体系统

Jakub Bąba, Jarosław A. Chudziak

机构 * Faculty of Electronics and Information Technology, Warsaw University of Technology(电子与信息技术学院,华沙技术大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出CAF-Gen多智能体框架,通过迭代创建-评审流程将浅层论证结构自动转换为符合Carneades论证框架的丰富模型,克服单次生成的结构不稳定性。

Comments Accepted for publication in the proceedings of ICCCI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15258 2026-06-16 cs.AI 新提交 57%

Mask-Proof: An LLM-based Automated Data Curation Pipeline on Mathematical Proofs

Mask-Proof: 一种基于LLM的数学证明自动数据整理流水线

Jierui Zhang, Siyuan Tan, Xinhang Li, Longzhuangzhi Lin, Dailin Li, Chengfeng Gu, Xinping Li, Yaxian Hao, Shengjia Liang, Yuxiang Ren, Wenhao Liu

机构 * School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机学院) Graduate College for Engineers, Beijing University of Posts and Telecommunications(北京邮电大学研究生院工程师学院) School of Mathematical Sciences, Fudan University(复旦大学数学科学学院) School of Cyberspace Security, Beijing University of Posts and Telecommunications(北京邮电大学网络空间安全学院) School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) Chu Kochen Honors College, Zhejiang University(浙江大学竺可桢学院) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出Mask-Proof流水线,将真实证明转化为可自动检查的掩码步骤任务,通过LLM等价性判断器评估模型推理,构建包含292个问题的基准,推理增强模型性能提升12%-27%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15096 2026-06-16 cs.AI 新提交 57%

VGPT-RSI for RH-Adjacent Formal Progress: Boundary Certificates, Verified Finite Lagarias Inequalities, and Explicit Failure Localization

VGPT-RSI 用于 RH 邻近形式化进展:边界证书、已验证的有限 Lagarias 不等式和显式故障定位

Zhixin Hu, Tao Xu, Xiaodian Sun, Li Jin, Momiao Xiong

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出 VGPT-RSI 系统,通过构造并验证有限 RH 边界证书和 Lagarias 准则的有限形式化,实现 Riemann 假设邻近问题的部分形式化进展,并明确识别剩余数学障碍。

Comments 31 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15078 2026-06-16 cs.AI cs.GT physics.soc-ph 新提交 57%

Cognitive Debt: AI as Intellectual Leverage and the Dynamics of Systemic Fragility

认知债务:作为智力杠杆的AI与系统性脆弱性的动态机制

Shuchen Meng

机构 * New York University(纽约大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出认知债务的形式化理论,通过建立包含认知资本和认知债务的状态变量模型,证明理性代理人会积累认知债务,并导致认知明斯基时刻和系统性脆弱性。

Comments 46 pages, 3 figures. Preliminary version; comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12291 2026-06-16 cs.CL 新提交 57%

Measuring Epistemic Resilience of LLMs Under Misleading Medical Context

测量大语言模型在误导性医疗上下文下的认知韧性

Hongjian Zhou, Xinyu Zou, Jinge Wu, Sean Wu, Junchi Yu, Bradley Max Segal, Tobias Erich Niebuhr, Sara Amro, Michael Petrus, Sheikh Momin, Alexandra M. Cardoso Pinto, Rachel Niesen, Laura Sophie Wegner, Dhruv Darji, Jung Moses Koo, Joshua Fieggen, Kapil Narain, Mingde Zeng, Lei Clifton, Linda Shapiro, Fenglin Liu, David A. Clifton

机构 * University of Oxford(牛津大学) University of Washington(华盛顿大学) University College London(伦敦大学学院) University of Waterloo(滑铁卢大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出MedMisBench基准,通过注入误导性上下文测试大语言模型在医疗场景中的认知韧性,发现模型准确率从71.1%降至38.0%,权威性虚假信息攻击成功率达69.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15122 2026-06-16 cs.SE 新提交 50%

The Hitchhiker's Guide to Program Analysis, Part III: Mostly Harmless LLMs

程序分析漫游指南,第三部分:基本无害的LLMs

Haonan Li, Tianyang Zhou, Manu Sridharan, Hang Zhang, Zhiyun Qian

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 提出Evident系统,将LLM用于构建分析框架,后端形式化验证错误状态不可达,在151个真实警告中正确分类,未漏报任何确认漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 20 篇

2606.15682 2026-06-16 cs.LG 新提交 83%

ReQAT: Achieving Full-Precision Reasoning Accuracy with 4-bit Floating-Point Quantization-Aware Training

ReQAT: 实现全精度推理精度的4位浮点量化感知训练

Janghwan Lee, Sihwa Lee, Jinseok Kim, Yongjik Kim, Jieun Lim, Jinwook Oh, Jungwook Choi

机构 * Hanyang University(汉阳大学) Samsung Advanced Institute of Technology(三星综合技术院)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 针对大推理模型在低比特量化(W4A4KV4)下推理精度严重下降的问题,提出ReQAT框架,通过迹对齐QAT、选择性熵最小化和量化友好初始化,恢复并超越BF16微调精度,实现最高3.9倍吞吐加速。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16886 2026-06-16 cs.SE 新提交 82%

Neuro-Symbolic Software Verification: Hyper-charging Local Language Models with Symbolic Reasoning at Scale

神经符号软件验证:通过符号推理在规模上增强本地语言模型

Muhammad A. A. Pirzada, Julian Parsert, Weiqi Wang, Konstantin Korovin, Lucas C. Cordeiro

专题命中 逻辑推理 :reasoning(title);chain-of-thought(abstract);verifier(abstract)

AI总结 提出VerIbmc管道,结合符号不变量生成与本地开源语言模型及ESBMC验证工具,通过结构化的验证器反馈迭代优化,实现隐私保护且高效的循环不变量合成,在520个问题上达到86.4%的解决率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15686 2026-06-16 cs.AI cs.LG 新提交 81%

Recurrent Reasoning on Symbolic Puzzles with Sequence Models

基于序列模型的符号谜题循环推理

Gowrav Mannem, Chowdhury Marzia Mahjabin, Jason Chen, Shivank Garg, Kevin Zhu

机构 * Algoverse AI Research Cornell University(康奈尔大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出 RecurrReason 基准,包含四个递归逻辑谜题,通过控制难度参数 N 评估序列模型,发现架构比规模更重要,预训练仅对局部结构转移函数的谜题有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10967 2026-06-16 cs.LG cs.AI 版本更新 81%

Retro-Expert: Collaborative Reasoning for Interpretable Retrosynthesis

Retro-Expert: 面向可解释逆合成的协同推理

Xinyi Li, Sai Wang, Yutian Lin, Yu Wu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出Retro-Expert框架,通过强化学习结合大语言模型与专用模型,实现可解释的逆合成预测,并生成基于化学逻辑的自然语言解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15155 2026-06-16 cs.LG 新提交 79%

Semantic Reasoning in Medicine: The Role of Knowledge Graphs Across Five Key Domains

医学中的语义推理:知识图谱在五个关键领域的作用

Haniye Sherafatmandjoo, Mohammad Akbari, Zahed Rahmati

机构 * Amirkabir University of Technology(阿米尔卡比尔理工大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.LG

AI总结 综述知识图谱在医学中的应用,涵盖临床决策支持、疾病预测、健康推荐、精准医疗和医学问答,并讨论构建方法、挑战及未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏