arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-13 至 2026-07-13 共收录 16 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 16 篇

2604.16966 2026-07-13 cs.CR cs.AI 85%

Visual Inception: Compromising Long-term Planning in Agentic Recommenders via Multimodal Memory Poisoning

视觉 inception:通过多模态记忆污染在代理推荐系统中妥协长期规划

Jiachen Qian

机构 * City University of Hong Kong(香港城市大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出视觉 inception 攻击,通过污染用户上传的图片在代理推荐系统中影响长期规划,提出 CognitiveGuard 防御框架以降低攻击风险。

Comments 17 pages, 6 figures, 16 tables

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 20846-20862, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08894 2026-07-13 cs.AI cs.LG 新提交 81%

GATS: Graph-Augmented Tree Search with Layered World Models for Efficient Agent Planning

GATS:用于高效智能体规划的具有分层世界模型的图增强树搜索

Maureese Williams, Dymitr Nowicki

机构 * Institute for Cybernetics of NAS of Ukraine(乌克兰国家科学院控制论研究所)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对LLM智能体规划计算成本高和行为随机的问题,提出GATS框架,结合系统树搜索与分层世界模型,在合成任务和综合测试中表现优异,规划时无需LLM调用,生成确定性计划,优于LLM引导探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09452 2026-07-13 cs.SE cs.AI 新提交 79%

Practical Source Code Recovery from Binary Functions Using Anchor-Based Retrieval and LLM Reasoning

使用基于锚点的检索和大语言模型推理从二进制函数中进行实用的源代码恢复

Charles Edward Gagnon, Steven H. H. Ding, Philippe Charland, Benjamin C. M. Fung

机构 * McGill University(麦吉尔大学) Defence Research and Development Canada(国防研究与发展加拿大)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究如何从二进制函数恢复源代码,结合逆向工程、基于锚点检索和大语言模型推理,在基于高保真数据库对tcpdump二进制文件评估中,匹配方法实现95.2%汇编指令覆盖率,在GitHub数据库实验中平均覆盖率35.5%。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09603 2026-07-13 cs.MA 新提交 78%

Mosaic: Runtime-Efficient Multi-Agent Embodied Planning

Mosaic:运行时高效的多智能体实体规划

Kunjal Panchal, Saayan Mitra, Sunav Choudhary, Victor Bursztyn, Somdeb Sarkhel, Hui Guan

专题命中 规划推理 :planning(title,abstract)

AI总结 研究基于LLM的多智能体实体规划执行延迟高问题,提出Mosaic框架,通过智能体中心语义内存和整数线性规划应对挑战,在多基准测试中执行更快、调用更少、步数更少且成功率更高,证明相关因素对多智能体规划的重要性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09195 2026-07-13 cs.AI cond-mat.mtrl-sci 新提交 70%

Toward Auditable AI Scientists: A Hypothesis Evolution Protocol for LLM Agents

迈向可审计的人工智能科学家:大语言模型智能体的假设演化协议

Izumi Takahara, Teruyasu Mizoguchi

机构 * Institute of Industrial Science, The University of Tokyo(东京大学产业科学研究所)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究旨在让大语言模型智能体在科学发现中发挥核心作用。提出假设演化协议(HEP),使假设生成等操作可审计。在材料科学任务中,该协议能让智能体运行关键循环,跨问题概括并随模型能力提升更充分利用协议,迈向可审计的人工智能科学家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20297 2026-07-13 cs.AI 版本更新 70%

Improving Language Agents through BREW: Bootstrapping expeRientially-learned Environmental knoWledge

通过BREW改进语言智能体:引导式经验学习环境知识

Shashank Kirtania, Param Biyani, Priyanshu Gupta, Yasharth Bajpai, Roshni Iyer, Sumit Gulwani, Gustavo Soares

机构 * University of Michigan(密歇根大学) Independent(独立研究者) Microsoft(微软) Apple(苹果公司)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究基于LLM的智能体无法从经验学习的问题,提出BREW框架,通过提炼交互轨迹成知识库、引入EG-MCTS算法及适应事后重标记等方法,在多基准测试中提升任务成功率并减少执行步骤,且知识库具有良好特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20134 2026-07-13 cs.AI cs.ET quant-ph 版本更新 70%

QAgent: An LLM-based Multi-Agent System for Autonomous OpenQASM programming

QAgent:一种基于大语言模型的用于自主OpenQASM编程的多智能体系统

Zhenxiao Fu, Lei Jiang, Yilun Xu, Gang Huang, Fan Chen

机构 * Zhenxiao Fu1, Lei Jiang1, Yilun Xu2, Gang Huang2, Fan Chen1(作者1、作者2、作者3、作者4、作者5)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究针对OpenQASM编程挑战提出QAgent,它是基于大语言模型的多智能体系统,集成规划、合成和校准工作流程,利用检索增强生成及多智能体推理确保正确性,在多模型评估中表现出色,证明集成对可靠量子程序生成很关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09298 2026-07-13 cs.LG cs.AI 新提交 62%

Risk-Aware General-Utility Markov Decision Processes

风险感知通用效用马尔可夫决策过程

Pedro P. Santos, Fábio Vital, Alberto Sardinha, Francisco S. Melo

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究风险感知通用效用马尔可夫决策过程,聚焦熵风险度量,提出基于蒙特卡洛树搜索的方法,可解决该过程并达任意精度,实验表明此方法在多种任务的GUMDPs中优化风险感知行为时成功。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08778 2026-07-13 cs.LG cs.AI 新提交 62%

iLENS: Interpretable LLM-Guided Mixture-of-Experts for Neuroimaging Survival Analysis

iLENS:用于神经影像生存分析的可解释大语言模型引导的专家混合模型

Farica Zhuang, Seong Woo Han, Zixuan Wen, Shu Yang, Yize Zhao, Li Shen

机构 * University of Pennsylvania(宾夕法尼亚大学) Yale University(耶鲁大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对阿尔茨海默病前驱期转化预测问题,提出iLENS框架,基于专家混合模型,利用大语言模型合成信息指导专家路由,具备竞争力的预测性能,能为决策提供透明且基于生物学的原理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09092 2026-07-13 cs.CL 新提交 57%

AgentKGV: Agentic LLM-RAG Framework with Two-Stage Training for the Fact Verification of Knowledge Graphs

AgentKGV:用于知识图谱事实验证的两阶段训练的智能语言模型-检索增强生成框架

Yumin Heo, Hyeon-gu Lee, Sumin Seo, Youngjoong Ko

机构 * SungKyunKwan University(成均馆大学) NAVER(纳维)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 针对知识图谱事实错误验证难题,提出AgentKGV框架,集成动态路由等处理表面形式不匹配。引入两阶段训练策略,在开放域T-REx基准上,该框架提升了宏观F1,减少搜索调用次数,提高了验证准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09076 2026-07-13 cs.AI 新提交 57%

Neuro-Agentic Control: A Deep Learning-based LLM-Powered Agentic AI Framework for Controlling Security Controls

神经代理控制:一种基于深度学习的由大型语言模型驱动的用于控制安全控制的代理人工智能框架

Saroj Gopali, Bipin Chhetri, Deepika Giri, Sima Siami-Namini, Akbar Siami Namin

机构 * Texas Tech University(德克萨斯理工大学) Cumberland University(坎伯兰大学) Advanced Academic Programs Science(高级学术项目科学部) Johns Hopkins University(约翰·霍普金斯大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 针对运营技术网络攻击问题,提出神经代理控制框架,结合基于LLM的规划器与预训练的TimesFM,并引入“反事实物理注入”机制,在工业数据集评估中表现优于基线,能有效保障关键基础设施中代理人工智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16238 2026-07-13 cs.LG physics.ao-ph stat.ML 版本更新 57%

Enhancing AI and Dynamical Subseasonal Forecasts with Probabilistic Bias Correction

通过概率性偏误校正增强人工智能和动力学亚季预测

Hannah Guan, Soukayna Mouatadid, Paulo Orenstein, Judah Cohen, Haiyu Dong, Zekun Ni, Jeremy Berman, Genevieve Flaspohler, Alex Lu, Jakob Schloer, Joshua Talib, Jonathan A. Weyn, Lester Mackey

机构 * Harvard College(哈佛学院) University of Toronto(多伦多大学) Instituto de Matemática Pura e Aplicada(数学与应用数学研究所) Massachusetts Institute of Technology(麻省理工学院) Atmospheric and Environmental Research(大气与环境研究) Microsoft Corporation(微软公司) Rhiza Research(Rhiza研究) Microsoft Research New England(微软新英格兰研究院) European Centre for Medium-Range Weather Forecasts(欧洲中期天气预报中心)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出概率性偏误校正方法,通过学习历史概率预测来减少系统性误差,显著提升亚季预测能力,应用于ECMWF模型后,AI预测系统技能翻倍,操作性去偏模型在91%压力、92%温度和98%降水目标上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23449 2026-07-13 cs.AI cs.CR cs.SE 版本更新 57%

Beyond Embeddings: Interpretable Feature Extraction for Binary Code Similarity

超越嵌入:用于二进制代码相似性的可解释特征提取

Charles E. Gagnon, Steven H. H. Ding, Philippe Charland, Benjamin C. M. Fung

机构 * Defence Research and Development Canada(加拿大国防研究与发展署) McGill University(麦吉尔大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 研究二进制代码相似性检测问题,利用基于语言模型的智能体对汇编代码结构化推理分析生成可解释特征,无需匹配训练,在跨架构和跨优化任务中召回率表现良好,结合嵌入优于现有技术,实现准确性、可扩展性和可解释性共存。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09315 2026-07-13 cs.RO 新提交 50%

Robot Trajectron V3: A Probabilistic Shared Control Framework for SE(3) Manipulation

机器人轨迹生成器V3:一种用于SE(3)操作的概率共享控制框架

Pinhao Song, Zhongxi Li, Ze Fu, Federico Ulloa Rios, Renaud Detry

机构 * KU Leuven(鲁汶大学) Flanders Make(法兰德斯制造)

专题命中 规划推理 :planning(abstract)

AI总结 针对远程操作机器人手臂执行高自由度操作任务的难题(认知要求高、易出错、依赖低带宽接口),提出概率共享控制框架RT-V3,通过贝叶斯推理结合用户意图先验与实时命令估计后验分布,实验证明其在多方面表现出色,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09101 2026-07-13 cs.SE 新提交 50%

Multi-Agent LLM Collaboration for Unit Test Generation via Human-Testing-Inspired Workflows

通过受人工测试启发的工作流程进行多智能体大语言模型协作以生成单元测试

Quanjun Zhang, Ye Shang, Siqi Gu, Jianyi Zhou, Chunrong Fang, Zhenyu Chen, Liang Xiao

专题命中 规划推理 :reasoning(abstract)

AI总结 研究针对现有基于大语言模型的单元测试生成方法的局限,提出TestAgent,通过多智能体协作机制模拟人工测试,设计专门智能体、配备工具API并构建知识图谱,在Java项目实验中取得优异结果,性能优于基线和搜索工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00138 2026-07-13 cs.LO cs.DC cs.MA cs.PL 版本更新 50%

JustAct: A Framework for Auditable Multi-Agent Systems Regulated by Inter-Organisational Policies

JustAct:一个由组织间政策监管的可审计多智能体系统框架

Christopher A. Esterhuyse, Tim Müller, L. Thomas van Binsbergen

专题命中 规划推理 :reasoning(abstract)

AI总结 研究跨越组织边界的开放多智能体系统中行动受复杂政策监管的问题,提出JustAct框架,智能体可凭动态政策信息证明行动合理,通过特定语言和系统的实例及案例研究展示评估该框架。

详情

展开后加载摘要…

URL PDF HTML 收藏