arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-16 至 2026-04-16 共收录 117 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 8 篇

2604.14121 2026-04-16 cs.CL 86%

Correct Prediction, Wrong Steps? Consensus Reasoning Knowledge Graph for Robust Chain-of-Thought Synthesis

正确预测,错误步骤?基于共识推理的知识图谱用于鲁棒的推理链合成

Zipeng Ling, Shuliang Liu, Shenghong Fu, Yuehao Tang, Seonil Son, Yao Wan, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Pennsylvania(宾夕法尼亚大学) Huazhong University of Science and Technology(华中科技大学) Hong Kong Polytechnic University(香港理工大学) RLWRLD

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title);分类 cs.CL

AI总结 本文提出CRAFT框架,通过构建共识推理知识图谱缓解LLM推理中的内部和步骤性错误,提升推理链质量,实验显示其在逻辑和数学推理基准上表现优越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13062 2026-04-16 cs.CL 79%

Mathematical Reasoning Enhanced LLM for Formula Derivation: A Case Study on Fiber NLI Modellin

增强数学推理的LLM用于公式推导:光纤非线性干扰建模的案例研究

Yao Zhang, Yuchen Song, Xiao Luo, Shengnan Li, Xiaotian Jiang, Min Zhang, Danshi Wang

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出一种增强数学推理的生成AI方法,用于光学通信公式推导,聚焦光纤非线性干扰建模,通过结构化提示引导LLM推导出已知闭式ISRS GN表达式并推导出适用于多段C和C+L波段传输的新近似式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24869 2026-04-16 cs.CV 78%

SiLVR: A Simple Language-based Video Reasoning Framework

SiLVR:一种简单的基于语言的视频推理框架

Ce Zhang, Yan-Bo Lin, Ziyang Wang, Mohit Bansal, Gedas Bertasius

机构 * Department of Computer Science(计算机科学系) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 数学推理 :reasoning(title,abstract)

AI总结 SiLVR通过将复杂视频理解分解为两个阶段,利用多感官输入生成语言表示,并通过强大推理LLM解决复杂视频-语言任务,实现了在多个视频评估任务上的最佳表现。

Comments Accepted by TMLR (01/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00222 2026-04-16 cs.AI cs.CL cs.LG 75%

RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization

RL-PLUS: 通过混合策略优化对抗LLMs在强化学习中的能力边界崩溃

Yihong Dong, Xue Jiang, Yongding Tao, Huanyu Liu, Kechi Zhang, Lili Mou, Rongyu Cao, Yingwei Ma, Jue Chen, Binhua Li, Zhi Jin, Fei Huang, Yongbin Li, Ge Li

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Department of Computing Science, University of Alberta(阿尔伯塔大学计算机科学系) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RL-PLUS通过混合策略优化解决LLMs在强化学习中的能力边界崩溃问题,结合内部利用与外部数据提升推理能力,实验表明其在数学推理和分布外任务中表现优异。

Comments Accepted to ACL 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13371 2026-04-16 cs.CL 70%

Empirical Evidence of Complexity-Induced Limits in Large Language Models on Finite Discrete State-Space Problems with Explicit Validity Constraints

大语言模型在有限离散状态空间问题中复杂性诱导限制的实证证据

Md. Fahad Ullah Utsho, Mohd. Ruhul Ameen, Akif Islam, Md. Golam Rashed, Dipankar Das

机构 * Department of Information and Communication Engineering, University of Rajshahi, Bangladesh(拉贾沙希大学信息与通信工程系,孟加拉国) College of Engineering and Computer Sciences, Marshall University, Huntington, WV, USA(马歇尔大学工程与计算机科学学院,美国,亨廷顿,西弗吉尼亚) Department of Computer Science and Engineering, University of Rajshahi, Bangladesh(拉贾沙希大学计算机科学与工程系,孟加拉国)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 本文通过构建九个经典推理任务,系统评估大推理模型在逐渐增加的复杂性下的鲁棒性,发现模型在低复杂度时表现良好,但超过特定阈值后显著退化,提出推理崩溃现象。

Comments 45 pages, 36 figures, 7 tables, Journal Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13286 2026-04-16 cs.CL cs.AI 62%

English is Not All You Need: Systematically Exploring the Role of Multilinguality in LLM Post-Training

英语并非一切所需:系统探索多语言在大语言模型后训练中的作用

Mehak Dhaliwal, Shashwat Chaurasia, Yao Qin, Dezhi Hong, Thomas Butler

机构 * UC Santa Barbara(加州大学圣巴巴拉分校) Amazon(亚马逊)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究通过220次监督微调实验,探讨训练语言覆盖、模型规模和任务领域间的相互作用,发现增加后训练语言覆盖对各任务和模型规模均有益,低资源语言受益最大,高资源语言趋于稳定。单语种多语言性可提升英语表现和跨语言泛化,英语独占后训练效果不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13902 2026-04-16 cs.LG 57%

DiPO: Disentangled Perplexity Policy Optimization for Fine-grained Exploration-Exploitation Trade-Off

DiPO:解耦 perplexity 的策略优化用于细粒度探索-利用平衡

Xiaofan Li, Ming Yang, Zhiyuan Ma, Shichao Ma, Jintao Du, Yu Cheng, Weiqiang Wang, Zhizhong Zhang, Xin Tan, Yanyun Qu, Lizhuang Ma, Yuan Xie

机构 * East China Normal University(东华师范大学) Ant Group(蚂蚁集团) Shanghai Innovation Institute(上海创新研究院) Xiamen University(厦门大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出 DiPO 方法,通过解耦 perplexity 空间来优化探索与利用的平衡,提升 LLM 在数学推理和函数调用任务中的性能。

Comments LLM Reinforce Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26519 2026-04-16 cs.LG 57%

Think Outside the Policy: In-Context Steered Policy Optimization

突破政策限制:基于上下文的政策优化

Hsiu-Yuan Huang, Chenming Tang, Weijie Liu, Clive Bai, Saiyong Yang, Yunfang Wu

机构 * National Key Laboratory for Multimedia Information Processing(国家多媒体信息处理重点实验室) School of Computer Science(计算机学院) LLM Department(大模型部门) Tencent(腾讯)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出ICPO框架,利用大推理模型的上下文学习能力,通过混合策略GRPO和隐式专家强制扩展探索范围,提升RLVR在数学推理任务中的性能和稳定性。

Comments ACL 2026 Findings. 19 pages, 13 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 2 篇

2604.02709 2026-04-16 cs.CL cs.AI cs.LG cs.SE 82%

Evaluating the Formal Reasoning Capabilities of Large Language Models through Chomsky Hierarchy

通过乔姆斯基层级评估大语言模型的正式推理能力

Yihong Dong, Jianha Xiao, Xue Jiang, Xuyuan Guo, Zhiyuan Fan, Jiaru Qian, Kechi Zhang, Jia Li, Zhi Jin, Ge Li

机构 * Peking University(北京大学) Wuhan University(武汉大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ChomskyBench基准,通过乔姆斯基层级系统评估大语言模型的正式推理能力,揭示其在结构化语言处理中的性能分层及效率瓶颈。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02811 2026-04-16 cs.AR cs.AI 57%

ChatSVA: Bridging SVA Generation for Hardware Verification via Task-Specific LLMs

ChatSVA: 通过任务特定的LLM桥接SVA生成用于硬件验证

Lik Tung Fu, Jie Zhou, Shaokai Ren, Mengli Zhang, Jia Xiong, Hugo Jiang, Nan Guan, Xi Wang, Jun Yang

机构 * National ASIC Center, School of Integrated Circuits, Southeast University, China(国家集成电路中心,东南大学集成电路学院,中国) National Center of Technology Innovation for Electronic Design Automation, China(电子设计自动化技术创新国家中心,中国) Department of Computer Science, City University of Hong Kong, Hong Kong, China(计算机科学系,香港城市大学,香港,中国)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 ChatSVA利用多智能体框架生成SVA,实现98.66%的语法正确率和96.12%的功能通过率,功能覆盖率提升33.3个百分点,建立了一个在少样本、领域特定场景中解决长链推理问题的稳健框架。

Comments Accepted by DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 12 篇

2601.02902 2026-04-16 cs.AI cs.CL cs.LO 91%

Logical Phase Transitions: Understanding Collapse in LLM Logical Reasoning

逻辑相变:理解大语言模型逻辑推理中的崩溃

Xinglang Zhang, Yunyao Zhang, ZeLiang Chen, Junqing Yu, Wei Yang, Zikai Song

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究通过控制逻辑复杂性分析大语言模型的逻辑推理性能,发现逻辑相变现象,提出神经符号课程调优框架以提升高复杂度下的推理能力。

Comments Accepted at ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13065 2026-04-16 cs.CL cs.AI cs.LO 85%

Correct Chains, Wrong Answers: Dissociating Reasoning from Output in LLM Logic

正确推理,错误答案:分离LLM中的推理与输出

Abinav Rao, Sujan Rachuri, Nikhil Vemuri

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI;logical reasoning(comments)

AI总结 本文提出新型操作测试基准,区分操作逻辑与名称,揭示LLM在深度推理中存在策略与内容两类失败模式,验证名称不决定推理能力。

Comments 9 pages, 4 figures. ICLR 2026 Workshop on Logical Reasoning of LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13993 2026-04-16 cs.AI cs.CL cs.CV 81%

Reward Design for Physical Reasoning in Vision-Language Models

用于视觉语言模型中物理推理的奖励设计

Derek Lilienthal, Manisha Mukherjee, Sameera Horawalavithana

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了奖励设计对视觉语言模型物理推理的影响,通过对比不同奖励信号发现,基于准确性的奖励在多数领域表现最佳,而基于注意力权重的奖励提升了空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13759 2026-04-16 cs.AI cs.LG 81%

The cognitive companion: a lightweight parallel monitoring architecture for detecting and recovering from reasoning degradation in LLM agents

认知伙伴:一种轻量级并行监控架构,用于检测和从LLM代理的推理退化中恢复

Rafflesia Khan, Nafiul Islam Khan

机构 * IBM Dublin(IBM都柏林) Citi Polytechnic Institute Khulna(基蒂理工学院库尔纳)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出认知伙伴,一种轻量级并行监控架构,用于检测和恢复LLM代理的推理退化。通过实验验证了其在不同任务类型中的有效性,并指出任务类型依赖性和潜在的规模限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14051 2026-04-16 cs.IR 71%

Enhancing Local Life Service Recommendation with Agentic Reasoning in Large Language Model

通过大语言模型中的代理推理增强本地生活服务推荐

Shiteng Cao, Xiaochong Lan, Yuwei Du, Jie Feng, Yinxing Liu, Xinlei Shi, Yong Li

专题命中 逻辑推理 :reasoning(title)

AI总结 本文提出一种联合预测生活需求和服务推荐的框架,通过行为聚类和强化学习提升推荐准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13979 2026-04-16 cs.CL cs.AI cs.DB 62%

Leveraging LLM-GNN Integration for Open-World Question Answering over Knowledge Graphs

利用LLM-GNN集成进行知识图谱上的开放世界问答

Hussein Abdallah, Ibrahim Abdelaziz, Panos Kalnis, Essam Mansour

机构 * Concordia University(康科迪亚大学) IBM KAUST(科威特大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GLOW系统,结合预训练GNN和LLM进行开放世界知识图谱问答,通过结构化提示引导LLM推理,提升多跳推理和缺失链接处理能力,在GLOW-BENCH基准上取得显著提升。

Comments 18 pages,6 figures,10 tables. https://aclanthology.org/2026.eacl-long.26/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13107 2026-04-16 cs.SE cs.AI cs.LG 62%

Can Coding Agents Be General Agents?

编码代理可以是通用代理吗?

Maksim Ivanov, Abhijay Rana, Gokul Prabhakaran

机构 * Agentic Labs

专题命中 逻辑推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨编码代理能否实现端到端业务流程自动化,发现其在简单任务上表现可靠,但在复杂任务上存在瓶颈,指出领域逻辑与代码执行的衔接是通用性关键障碍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08046 2026-04-16 cs.CL 57%

Guaranteeing Knowledge Integration with Joint Decoding for Retrieval-Augmented Generation

通过联合解码实现知识整合的检索增强生成

Zhengyi Zhao, Shubo Zhang, Zezhong Wang, Yuxi Zhang, Huimin Wang, Yutian Zhao, Yefeng Zheng, Binyang Li, Kam-Fai Wong, Xian Wu

机构 * The Chinese University of Hong Kong(香港中文大学) University of International Relations(国际关系大学) Tencent Jarvis Lab(腾讯Jarvis实验室) Westlake University(西湖大学) Ministry of Education Key Laboratory of High Confidence Software Technologies, CUHK(教育部高可信软件技术重点实验室,香港中文大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出GuarantRAG框架,通过分离推理与证据整合,提升检索增强生成的准确性和事实性,实验显示在五个问答基准上准确率提升12.1%,幻觉减少16.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13346 2026-04-16 cs.CL 57%

AgentSPEX: An Agent SPecification and EXecution Language

AgentSPEX:一种代理规范与执行语言

Pengcheng Wang, Jerry Huang, Jiarui Yao, Rui Pan, Peizhi Niu, Yaowenqi Liu, Ruida Wang, Renhao Lu, Yuwei Guo, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Baylor College of Medicine(贝勒医学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出AgentSPEX,一种用于定义LLM代理工作流的显式控制流和模块化结构的语言,支持类型步骤、分支、循环、并行执行和显式状态管理,并提供可定制的代理框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06921 2026-04-16 cs.CR cs.AI 57%

Neuro-Symbolic AI for Cybersecurity: State of the Art, Challenges, and Opportunities

神经符号AI在网络安全中的应用:现状、挑战与机遇

Safayat Bin Hakim, Muhammad Adil, Alvaro Velasquez, Shouhuai Xu, Houbing Herbert Song

机构 * Department of Information Systems, University of Maryland, Baltimore County(信息系统系,马里兰大学巴尔的摩分校) Department of Computer Science and Engineering, University at Buffalo(计算机科学与工程系,布法罗大学) Department of Computer Science, University of Colorado Boulder(计算机科学系,科罗拉多大学博尔德分校) Laboratory for Cybersecurity Dynamics, Department of Computer Science, University of Colorado Colorado Springs(网络安全动力实验室,科罗拉多大学科罗拉多斯普林斯分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文综述了神经符号AI在网络安全中的应用,分析了103篇文献,指出多智能体和结构化集成架构在复杂场景中表现更优,因果推理能提升防御能力,知识引导学习提高效率和可解释性,但评估标准化和人机协作仍是挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19378 2026-04-16 cs.CL 57%

TableMaster: A Recipe to Advance Table Understanding with Language Models

TableMaster: 一种提升语言模型表格理解能力的方案

Lang Cao, Hanbing Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出TableMaster方案,通过提取表格内容并增强语义上下文,结合自适应推理方法,提升语言模型对表格数据的理解能力,实验表明其在WikiTQ数据集上准确率达78.13%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14044 2026-04-16 cs.CV 50%

Decoding the Delta: Unifying Remote Sensing Change Detection and Understanding with Multimodal Large Language Models

解读Delta:利用多模态大语言模型统一遥感变化检测与理解

Xiaohe Li, Jiahao Li, Kaixin Zhang, Yuqiang Fang, Leilei Lin, Hong Wang, Haohua Wu, Zide Fan

机构 * Aerospace Information Research Institute, CAS(航天信息研究所,中国科学院) Space Engineering University(航天工程大学) Capital Normal University(首都师范大学)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出Delta-LLaVA框架,通过多时间尺度对比推理和空间定位,解决遥感变化理解中的时间盲问题,实现像素级分割与视觉问答的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 19 篇

2601.11340 2026-04-16 cs.CL 90%

Neural Chain-of-Thought Search: Searching the Optimal Reasoning Path to Enhance Large Language Models

神经链式推理搜索:寻找最优推理路径以增强大语言模型

Guoming Ling, Zhongzhan Huang, Yupei Lin, Junxin Li, Shanshan Zhong, Hefeng Wu, Liang Lin

机构 * Sun Yat-sen University(中山大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出神经链式推理搜索框架,通过动态搜索最优推理策略提升大语言模型性能,实验表明在多个基准测试中准确率提升超3.5%,生成长度减少超22%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04442 2026-04-16 cs.CV cs.CL 83%

Addressing Overthinking in Large Vision-Language Models via Gated Perception-Reasoning Optimization

通过门控感知-推理优化解决大视觉-语言模型中的过度思考

Xingjian Diao, Zheyuan Liu, Chunhui Zhang, Weiyi Wu, Keyi Kong, Lin Shi, Kaize Ding, Soroush Vosoughi, Jiang Gui

机构 * Dartmouth College(达特茅斯学院) University of Notre Dame(诺丁汉大学) Cornell University(康奈尔大学) Northwestern University(西北大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出GPRO方法,通过动态路由计算路径提升大视觉-语言模型的推理效率与准确性,减少过度思考带来的冗余响应。

Comments Accepted to Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13942 2026-04-16 cs.RO 82%

Goal2Skill: Long-Horizon Manipulation with Adaptive Planning and Reflection

Goal2Skill:基于自适应规划与反思的长时程操作

Zhen Liu, Xinyu Ning, Zhe Hu, Xinxin Xie, Weize Li, Zhipeng Tang, Chongyu Wang, Zejun Yang, Hanlin Wang, Yitong Liu, Zhongzhu Pu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 本文提出双系统框架,通过分离高层语义推理与低层运动执行,提升长时程操作的鲁棒性和适应性,实验表明其在RMBench任务中显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13814 2026-04-16 cs.HC cs.AI 79%

Cognitive Offloading in Agile Teams: How Artificial Intelligence Reshapes Risk Assessment and Planning Quality

敏捷团队中的认知卸载:人工智能如何重塑风险评估与规划质量

Adriana Caraeni, Alexander Shick, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文通过实验比较AI、人类和混合规划模型,发现AI虽高效但风险评估差,人类虽灵活但成本高,提出混合框架提升规划质量。

Comments 7 pages, 5 Tables, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13115 2026-04-16 cs.CL cs.IR 79%

Agentic Conversational Search with Contextualized Reasoning via Reinforcement Learning

基于强化学习的上下文化推理对话搜索代理

Fengran Mo, Yifan Gao, Sha Li, Hansi Zeng, Xin Liu, Zhaoxuan Tan, Xian Li, Jianshu Chen, Dakuo Wang, Meng Jiang

机构 * University of Montreal(蒙特利尔大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Notre Dame(诺特丹大学) Northeastern University(东北大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出一种基于强化学习的对话搜索代理,通过在对话轮次中交替搜索与推理,实现探索性与适应性行为,优于现有基准方法。

Comments Accepted by ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13156 2026-04-16 cs.CR cs.AI 77%

In-Context Autonomous Network Incident Response: An End-to-End Large Language Model Agent Approach

上下文自主网络事件响应:一种端到端的大语言模型代理方法

Yiran Gao, Kim Hammar, Tao Li

机构 * Department of Systems Engineering, City University of Hong Kong(香港城市大学系统工程系) Department of Electrical and Electronic Engineering, University of Melbourne(墨尔本大学电子与电气工程系)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出一种端到端的大语言模型代理方法,通过整合感知、推理、规划和行动功能,实现网络事件响应的自主学习与适应,实验表明其恢复效率比前沿模型快23%。

Comments 2026 AAAI Summer Symposium on Human-Aware AI Agents for the Cyber Battlefield

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07165 2026-04-16 cs.AI cs.LG 73%

Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization

链式推理,树状学习:多轮智能体策略优化的自我校正与嫁接

Yu Li, Sizhe Tang, Tian Lan

机构 * Department of Electrical and Computer Engineering, George Washington University(电气与计算机工程系,乔治·华盛顿大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出T-STAR框架,通过构建认知树整合轨迹,引入自我校正机制和上下文思维嫁接,提升多轮推理任务中策略优化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19268 2026-04-16 cs.RO cs.LG 70%

Hierarchical DLO Routing with Reinforcement Learning and In-Context Vision-language Models

基于强化学习和上下文视觉-语言模型的分层DLO路由

Mingen Li, Houjian Yu, Yixuan Huang, Youngjin Hong, Hantao Ye, Changhyun Choi

机构 * Department of Electrical and Computer Engineering, University of Minnesota(明尼苏达大学电气与计算机工程系) Princeton University(普林斯顿大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 本文提出了一种自主分层框架,利用视觉-语言模型进行上下文高层推理,结合强化学习训练的低层技能,解决长视距DLO路由任务,实现92%的成功率。

Comments 8 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏