arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-13 至 2026-07-13 共收录 72 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3 篇

2604.20140 2026-07-13 cs.AI cs.LG 版本更新 82%

HiPO: Hierarchical Preference Optimization for Adaptive Reasoning in LLMs

HiPO:用于大语言模型自适应推理的分层偏好优化

Darsh Kachroo, Arjun Prasaath Anbazhagan, Adriana Caraeni, Brennan Lagasse, Kevin Zhu

机构 * Vellore Institute of Technology(维洛雷理工学院) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Northwestern University(西北大学) Yale University(耶鲁大学) Algoverse AI Research(Algoverse AI研究)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG;math reasoning(comments)

AI总结 HiPO通过分层优化提升大语言模型在复杂推理任务中的表现,结合偏好优化与结构化推理的优势,实现更高效的训练和更一致的输出。

Comments 12 pages, 4 figures, 6 tables. Includes ablation study across Qwen2.5-7B-Instruct and Llama-3.1-8B-Instruct on 5 math reasoning benchmarks (GSM8K, MATH500, Minerva, AIME24, Gaokao2023). GPT-4.1 used for structured evaluation of reasoning quality

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29943 2026-07-13 cs.CV 版本更新 78%

Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting

EC-Bench:超长视频的枚举与计数基准

Fumihiko Tsuchiya, Taiki Miyanishi, Shunsuke Yasuki, Mahiro Ukai, Nakamasa Inoue, Shuhei Kurita, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo, Japan(东京大学) Institute of Science Tokyo, Japan(东京科学大学) National Institute of Informatics, Japan(国立信息学研究所)

专题命中 数学推理 :reasoning(title,abstract)

AI总结 EC-Bench针对超长视频的枚举与计数问题,通过152部超过30分钟的视频和1699个查询,评估多模态大语言模型的性能,揭示模型在时间推理和计数任务中的局限性。

Comments The first two authors are equally contributed. The data and code are publicly available at: https://github.com/matsuolab/EC-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03595 2026-07-13 cs.CL 版本更新 57%

Decoupling Task-Solving and Output Formatting in LLM Generation

在大语言模型生成中解耦任务解决与输出格式

Haikang Deng, Po-Nien Kung, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 研究针对大语言模型任务指令与格式要求交织致性能下降的问题,提出解耦框架Deco-G,将格式遵循委托给单独模块,引入指令感知蒸馏等三项创新,实验证明其优于基线方法,能保证格式符合。

Comments Update to the latest ACL published version and add a link to the released code

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), Association for Computational Linguistics, 2026, pp. 16764-16781

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 5 篇

2607.09059 2026-07-13 cs.AI 新提交 79%

ARCANA: A Reflective Multi-Agent Program Synthesis Framework for ARC-AGI-2 Reasoning

ARCANA:用于ARC-AGI-2推理的反射式多智能体程序合成框架

Kunbo Zhang, Lei Fu, Zeyu Wang, Zijing Liu, Kejian Tong

机构 * Columbia University(哥伦比亚大学) University of California, Los Angeles(加州大学洛杉矶分校) Northeastern University(东北大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 ARCANA是用于ARC-AGI-2推理的多智能体框架,将任务分解为感知、假设生成等步骤,智能体通过可微黑板通信,由元控制器调度。其设计结合程序搜索与校正,提升了抽象转换任务的推理效率和解决方案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28215 2026-07-13 cs.AI cs.CL cs.LG cs.LO cs.MA 版本更新 75%

Explaining is Harder Than Predicting Alone: Evaluating Concept-based Explanations of MLLMs as ICL Visual Classifiers

解释比单独预测更难:评估基于概念的MLLM解释作为ICL视觉分类器

Carmen Quiles-Ramírez, Leticia L. Rodríguez, Nicolás Martorell, Natalia Díaz-Rodríguez

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过五种形式化程度递增的条件,系统评估多模态大语言模型在少样本上下文学习中的基于概念的可解释性,发现解释比预测更难,且强制生成形式化解释会降低预测准确性。

Comments Accepted to the CompLearn Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09217 2026-07-13 cs.AI cs.MS 新提交 57%

OpenProver: Agentic and Interactive Theorem Proving with Lean 4

OpenProver:使用Lean 4进行智能且交互式的定理证明

Matěj Kripner, Milan Straka

机构 * Charles University, Faculty of Mathematics and Physics(查尔斯大学数学与物理系)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 介绍用于大语言模型驱动的自动化定理证明的开源系统OpenProver,它集成特定架构,完全开源,能自动验证证明,提供交互式界面,通过在ProofNet上评估展示自动验证在定量消融实验中的潜力。

Comments 7 pages, 2 figures. Accepted at the 19th Conference on Intelligent Computer Mathematics (CICM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09632 2026-07-13 quant-ph cs.AI 新提交 57%

Lean-QIT: Towards a Formal Infrastructure for Quantum Information Theory

Lean-QIT:迈向量子信息理论的形式化基础设施

Chengkai Zhu, Ziao Tang, Guocheng Zhen, Yimeng Cao, Yusheng Zhao, Ranyiliu Chen, Xuanqiang Zhao, Lei Zhang, Xin Wang

机构 * QudeLeap Research(QudeLeap研究院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Quantum Science Center of Guangdong-Hong Kong-Macao Greater Bay Area(粤港澳大湾区量子科学中心) The University of Hong Kong(香港大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 研究旨在为量子信息理论构建形式化基础设施,通过Lean 4库LeanQIT提供相关接口,将多个重要定理形式化,分离操作定义与解析表征,为形式化QIT及相关推理提供基础和知识底物。

Comments 24+5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20064 2026-07-13 cs.PL cs.AI cs.CR 版本更新 57%

The LLMbda Calculus: AI Agents, Conversations, and Information Flow

LLMlambda 计算:人工智能代理、对话与信息流

Zac Garby, Andrew D. Gordon, David Sands

机构 * University of Nottingham, UK(诺丁汉大学) University of Edinburgh, UK(爱丁堡大学) Chalmers University of Technology(查尔姆斯理工大学) The University of Gothenburg, Sweden(哥德堡大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种无类型的lambda计算模型,用于形式化描述和验证人工智能代理中对话和信息流的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 10 篇

2601.09097 2026-07-13 cs.AI 版本更新 85%

Programming over Thinking: Efficient and Robust Multi-Constraint Planning

编程而非思考:高效且稳健的多约束规划

Derrick Goh Xin Deik, Quanyu Long, Zhengyuan Liu, Nancy F. Chen, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学) Agency for Science, Technology and Research(科技研究局)

专题命中 逻辑推理 :planning(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 多约束规划面临挑战,现有大语言模型方法有局限。本文提出SCOPE框架,将特定查询推理与通用代码执行分离,产生一致、可重用的求解器函数,降低成本和延迟,性能达最优。

Comments Accepted at ACL 2026 : Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09600 2026-07-13 cs.AI cs.CL 新提交 81%

Agora: Enhancing LLM Agent Reasoning Via Auction-Based Task Allocation

Agora:通过基于拍卖的任务分配增强大语言模型智能体推理

Kaiji Zhou, Ales Leonardis, Yue Feng

机构 * University of Birmingham(伯明翰大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究旨在增强LLM智能体推理能力,提出Agora框架,通过基于拍卖的机制动态分配任务,将推理步骤视为可交易项目让智能体依纠正能力投标,实验表明该框架在多基准测试中表现优且能实现成本-质量权衡。

Comments Preprint. 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15806 2026-07-13 cs.CL cs.AI 版本更新 81%

REAL: REtrieval-reAsoning and Logic-constructed Attention Behaviors for Long-Context KV Cache Compression

REAL:用于长上下文KV缓存压缩的检索推理和逻辑构建注意力行为

Mengjie Li, Yuan Feng, Xike Xie, William J. Song

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型KV缓存问题,受混淆矩阵启发提出REAL方法,通过注意力行为矩阵全面分析注意力头行为,最大化信噪比,经评估在多模型和基准测试中性能显著,为长上下文建模方法转变提供新思路。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08960 2026-07-13 cs.LG cs.AI 新提交 76%

Eluna: An Agentic LLM System for Automating Warehouse Operations with Reasoning and Task Execution

Eluna:一个用于通过推理和任务执行实现仓库运营自动化的智能语言模型系统

Ning Liu, Kalle Kujanpää, Zhaoxuan Zhu, P Aditya Sreekar, Kaiwen Liu, Chuanneng Sun, Jorge Marchena Menendez, Matthew Bales, Tianyu Yang, Shahnawaz Alam, Rose Yu, Baoyuan Liu, Kristina Klinkner, Shervin Malmasi

机构 * Amazon.com, Inc. Fulfillment Technologies and Robotics(亚马逊公司履约技术与机器人部门)

专题命中 逻辑推理 :reasoning(title);分类 cs.AI、cs.LG

AI总结 研究针对仓库运营中SOP执行问题,提出Eluna智能体系统,它是图形引导多智能体框架,采用非对称情节蒸馏方法,在基准测试和生产应用中,微调模型表现出色,匹配或超教师模型,击败基线,在票务处理应用达94%专家一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09054 2026-07-13 cs.SE 新提交 67%

Automating Just-In-Time Python Type Annotation Updating

自动化即时Python类型注释更新

Zhipeng Xue, Zhipeng Gao, Xing Hu, Jingyuan Chen, Xin Xia, Shanping Li

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)

AI总结 研究Python项目中类型注释易过时问题,提出基于大语言模型的TypeUp方法自动更新类型注释,能依据旧注释和代码更改生成新注释,性能优于现有方法,在实际项目评估中展现实用价值。

Comments 12 pages, accepted by ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09649 2026-07-13 cs.AI 新提交 57%

ConceptSMILE: Auditing the Trustworthiness of Concept-Based Explainable AI

ConceptSMILE:审计基于概念的可解释人工智能的可信度

Mohadeseh Mollapour, Koorosh Aslansefat, Zeinab Dehghani, Bhupesh Kumar Mishra, Tejal Shah, Zhibao Mian

机构 * University of Hull(赫尔大学) Newcastle University(纽卡斯尔大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 研究基于概念的可解释人工智能中概念级输出的可信度问题,提出ConceptSMILE审计框架,通过扰动输入区域等方法评估可靠性,在视网膜眼底图像上评估发现不同概念和路径可靠性有差异,为评估此类人工智能可信度提供独立审计层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09330 2026-07-13 cs.AI cs.MA 新提交 57%

Communication-Efficient Digital-Twin Coordination for Heterogeneous LLM Embodied Agents over Computing Power Networks

基于计算能力网络的异构大语言模型实体代理的通信高效数字孪生协调

Nuocheng Yang, Sihua Wang, Zihan Chen, Tony Q. S. Quek, Changchuan Yin

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 针对异构大语言模型实体代理协作面临的通信开销大、协调质量受LLMs能力限制和行动延迟等挑战,提出基于轻量级数字孪生的LDT-Coord框架,通过特定方法减少通信开销,实现与传统方法相当的任务成功率且保持鲁棒性。

Comments 14 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12267 2026-07-13 cs.SE cs.AI 57%

NeuroStrata: Harnessing Neurosymbolic Paradigms for Improved Design, Testability, and Verifiability of Autonomous CPS

NeuroStrata:利用神经符号范式提升自主 CPS 的设计、可测试性和可验证性

Xi Zheng, Ziyang Li, Ivan Ruchkin, Ruzica Piskac, Miroslav Pajic

机构 * Macquarie University(麦考瑞大学) University of Pennsylvania(宾夕法尼亚大学) University of Florida(佛罗里达大学) Yale University(耶鲁大学) Duke University(杜克大学)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 NeuroStrata通过神经符号范式提升自主CPS的设计、测试和验证能力,解决不确定性带来的信任和安全认证问题。

Journal ref FSE Companion '25: Companion Proceedings of the 33rd ACM International Conference on the Foundations of Software Engineering, Trondheim, Norway, June 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09176 2026-07-13 cs.CR 新提交 50%

SherAgent: Scaling Attack Investigation in the Wild via LLM-Empowered Iterative Query-Filter Backtracking

SherAgent:通过大语言模型赋能的迭代查询-过滤回溯在野外扩展攻击调查

Zhenyuan Li, Zhengkai Wang, Ling Jiang, Xiangmin Shen, Ruixiao Lin, Sen Nie, Shi Wu, Shouling Ji

专题命中 逻辑推理 :reasoning(abstract)

AI总结 研究针对野外攻击调查中依赖爆炸和因果链碎片化问题。提出SherAgent系统,基于大语言模型,采用迭代“查询-过滤”回溯范式处理非结构化数据,克服相关问题。相比传统方法,提高调查成功率,且运行高效,减轻专家分析负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08809 2026-07-13 cs.CR cs.NI 新提交 50%

Privacy-Preserving Intent Fulfilment and Assurance for 6G RAN

6G无线接入网的隐私保护意图实现与保证

Joss Armstrong

专题命中 逻辑推理 :verifier(abstract)

AI总结 研究6G无线接入网隐私保护意图实现与保证问题,提出一种架构,协调器依意图类别分配资源且仅用O1接口计数器验证,定义隐私属性并证明其成立,映射到相关框架确定运行点,实验表明意图类别粒度变化对分配和保证有相应影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 16 篇

2604.16966 2026-07-13 cs.CR cs.AI 85%

Visual Inception: Compromising Long-term Planning in Agentic Recommenders via Multimodal Memory Poisoning

视觉 inception:通过多模态记忆污染在代理推荐系统中妥协长期规划

Jiachen Qian

机构 * City University of Hong Kong(香港城市大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出视觉 inception 攻击,通过污染用户上传的图片在代理推荐系统中影响长期规划,提出 CognitiveGuard 防御框架以降低攻击风险。

Comments 17 pages, 6 figures, 16 tables

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 20846-20862, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08894 2026-07-13 cs.AI cs.LG 新提交 81%

GATS: Graph-Augmented Tree Search with Layered World Models for Efficient Agent Planning

GATS:用于高效智能体规划的具有分层世界模型的图增强树搜索

Maureese Williams, Dymitr Nowicki

机构 * Institute for Cybernetics of NAS of Ukraine(乌克兰国家科学院控制论研究所)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对LLM智能体规划计算成本高和行为随机的问题,提出GATS框架,结合系统树搜索与分层世界模型,在合成任务和综合测试中表现优异,规划时无需LLM调用,生成确定性计划,优于LLM引导探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09452 2026-07-13 cs.SE cs.AI 新提交 79%

Practical Source Code Recovery from Binary Functions Using Anchor-Based Retrieval and LLM Reasoning

使用基于锚点的检索和大语言模型推理从二进制函数中进行实用的源代码恢复

Charles Edward Gagnon, Steven H. H. Ding, Philippe Charland, Benjamin C. M. Fung

机构 * McGill University(麦吉尔大学) Defence Research and Development Canada(国防研究与发展加拿大)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究如何从二进制函数恢复源代码,结合逆向工程、基于锚点检索和大语言模型推理,在基于高保真数据库对tcpdump二进制文件评估中,匹配方法实现95.2%汇编指令覆盖率,在GitHub数据库实验中平均覆盖率35.5%。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09603 2026-07-13 cs.MA 新提交 78%

Mosaic: Runtime-Efficient Multi-Agent Embodied Planning

Mosaic:运行时高效的多智能体实体规划

Kunjal Panchal, Saayan Mitra, Sunav Choudhary, Victor Bursztyn, Somdeb Sarkhel, Hui Guan

专题命中 规划推理 :planning(title,abstract)

AI总结 研究基于LLM的多智能体实体规划执行延迟高问题,提出Mosaic框架,通过智能体中心语义内存和整数线性规划应对挑战,在多基准测试中执行更快、调用更少、步数更少且成功率更高,证明相关因素对多智能体规划的重要性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09195 2026-07-13 cs.AI cond-mat.mtrl-sci 新提交 70%

Toward Auditable AI Scientists: A Hypothesis Evolution Protocol for LLM Agents

迈向可审计的人工智能科学家:大语言模型智能体的假设演化协议

Izumi Takahara, Teruyasu Mizoguchi

机构 * Institute of Industrial Science, The University of Tokyo(东京大学产业科学研究所)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究旨在让大语言模型智能体在科学发现中发挥核心作用。提出假设演化协议(HEP),使假设生成等操作可审计。在材料科学任务中,该协议能让智能体运行关键循环,跨问题概括并随模型能力提升更充分利用协议,迈向可审计的人工智能科学家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20297 2026-07-13 cs.AI 版本更新 70%

Improving Language Agents through BREW: Bootstrapping expeRientially-learned Environmental knoWledge

通过BREW改进语言智能体:引导式经验学习环境知识

Shashank Kirtania, Param Biyani, Priyanshu Gupta, Yasharth Bajpai, Roshni Iyer, Sumit Gulwani, Gustavo Soares

机构 * University of Michigan(密歇根大学) Independent(独立研究者) Microsoft(微软) Apple(苹果公司)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究基于LLM的智能体无法从经验学习的问题,提出BREW框架,通过提炼交互轨迹成知识库、引入EG-MCTS算法及适应事后重标记等方法,在多基准测试中提升任务成功率并减少执行步骤,且知识库具有良好特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20134 2026-07-13 cs.AI cs.ET quant-ph 版本更新 70%

QAgent: An LLM-based Multi-Agent System for Autonomous OpenQASM programming

QAgent:一种基于大语言模型的用于自主OpenQASM编程的多智能体系统

Zhenxiao Fu, Lei Jiang, Yilun Xu, Gang Huang, Fan Chen

机构 * Zhenxiao Fu1, Lei Jiang1, Yilun Xu2, Gang Huang2, Fan Chen1(作者1、作者2、作者3、作者4、作者5)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究针对OpenQASM编程挑战提出QAgent,它是基于大语言模型的多智能体系统,集成规划、合成和校准工作流程,利用检索增强生成及多智能体推理确保正确性,在多模型评估中表现出色,证明集成对可靠量子程序生成很关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09298 2026-07-13 cs.LG cs.AI 新提交 62%

Risk-Aware General-Utility Markov Decision Processes

风险感知通用效用马尔可夫决策过程

Pedro P. Santos, Fábio Vital, Alberto Sardinha, Francisco S. Melo

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究风险感知通用效用马尔可夫决策过程,聚焦熵风险度量,提出基于蒙特卡洛树搜索的方法,可解决该过程并达任意精度,实验表明此方法在多种任务的GUMDPs中优化风险感知行为时成功。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08778 2026-07-13 cs.LG cs.AI 新提交 62%

iLENS: Interpretable LLM-Guided Mixture-of-Experts for Neuroimaging Survival Analysis

iLENS:用于神经影像生存分析的可解释大语言模型引导的专家混合模型

Farica Zhuang, Seong Woo Han, Zixuan Wen, Shu Yang, Yize Zhao, Li Shen

机构 * University of Pennsylvania(宾夕法尼亚大学) Yale University(耶鲁大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对阿尔茨海默病前驱期转化预测问题,提出iLENS框架,基于专家混合模型,利用大语言模型合成信息指导专家路由,具备竞争力的预测性能,能为决策提供透明且基于生物学的原理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09092 2026-07-13 cs.CL 新提交 57%

AgentKGV: Agentic LLM-RAG Framework with Two-Stage Training for the Fact Verification of Knowledge Graphs

AgentKGV:用于知识图谱事实验证的两阶段训练的智能语言模型-检索增强生成框架

Yumin Heo, Hyeon-gu Lee, Sumin Seo, Youngjoong Ko

机构 * SungKyunKwan University(成均馆大学) NAVER(纳维)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 针对知识图谱事实错误验证难题,提出AgentKGV框架,集成动态路由等处理表面形式不匹配。引入两阶段训练策略,在开放域T-REx基准上,该框架提升了宏观F1,减少搜索调用次数,提高了验证准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09076 2026-07-13 cs.AI 新提交 57%

Neuro-Agentic Control: A Deep Learning-based LLM-Powered Agentic AI Framework for Controlling Security Controls

神经代理控制:一种基于深度学习的由大型语言模型驱动的用于控制安全控制的代理人工智能框架

Saroj Gopali, Bipin Chhetri, Deepika Giri, Sima Siami-Namini, Akbar Siami Namin

机构 * Texas Tech University(德克萨斯理工大学) Cumberland University(坎伯兰大学) Advanced Academic Programs Science(高级学术项目科学部) Johns Hopkins University(约翰·霍普金斯大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 针对运营技术网络攻击问题,提出神经代理控制框架,结合基于LLM的规划器与预训练的TimesFM,并引入“反事实物理注入”机制,在工业数据集评估中表现优于基线,能有效保障关键基础设施中代理人工智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16238 2026-07-13 cs.LG physics.ao-ph stat.ML 版本更新 57%

Enhancing AI and Dynamical Subseasonal Forecasts with Probabilistic Bias Correction

通过概率性偏误校正增强人工智能和动力学亚季预测

Hannah Guan, Soukayna Mouatadid, Paulo Orenstein, Judah Cohen, Haiyu Dong, Zekun Ni, Jeremy Berman, Genevieve Flaspohler, Alex Lu, Jakob Schloer, Joshua Talib, Jonathan A. Weyn, Lester Mackey

机构 * Harvard College(哈佛学院) University of Toronto(多伦多大学) Instituto de Matemática Pura e Aplicada(数学与应用数学研究所) Massachusetts Institute of Technology(麻省理工学院) Atmospheric and Environmental Research(大气与环境研究) Microsoft Corporation(微软公司) Rhiza Research(Rhiza研究) Microsoft Research New England(微软新英格兰研究院) European Centre for Medium-Range Weather Forecasts(欧洲中期天气预报中心)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出概率性偏误校正方法,通过学习历史概率预测来减少系统性误差,显著提升亚季预测能力,应用于ECMWF模型后,AI预测系统技能翻倍,操作性去偏模型在91%压力、92%温度和98%降水目标上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏