arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-27 至 2026-05-27 共收录 180 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 12 篇

2512.04868 2026-05-27 cs.CL cs.AI 73%

SEAL: Self-Evolving Agentic Learning for Conversational Question Answering over Knowledge Graphs

SEAL: 面向知识图谱对话问答的自我演进智能体学习

Hao Wang, Jialun Zhong, Changcheng Wang, Zhujun Nie, Zheng Li, Shunyu Yao, Yanzeng Li, Xinchi Li

机构 * Institute of Big Data and Artificial Intelligence, China Telecom Research Institute(大数据与人工智能研究院,中国电信研究院) Wangxuan Institute of Computer Technology, Peking University(王宣计算机技术研究所,北京大学) School of Artificial Intelligence, China University of Geosciences (Beijing)(人工智能学院,中国地质大学(北京)) Center for Cognition and Neuroergonomics, State Key Laboratory of Cognitive Neuroscience and Learning, Beijing Normal University(认知与神经工效学中心,认知神经科学与学习国家重点实验室,北京师范大学) Institute of Artificial Intelligence and Future Networks, Beijing Normal University(人工智能与未来网络研究院,北京师范大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出SEAL两阶段语义解析框架,通过自我演进智能体学习解决知识图谱对话问答中的指代消解、上下文依赖和复杂逻辑推理问题,在SPICE基准上达到最先进性能。

Comments Accept by NeuroComputing

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27068 2026-05-27 cs.CL cs.AI cs.MA 62%

QUACK: Questioning, Understanding, and Auditing Communicated Knowledge in Multimodal Social Deduction Agents

QUACK: 多模态社交推理智能体中的沟通知识质疑、理解与审计

Ye Yuan, Rui Song, Weien Li, Zeyu Li, Haochen Liu, Xiangyu Kong, Changjiang Han, Yonghan Yang, Zichen Zhao, Zixuan Dong, Fuyuan Lyu, Bowei He, Haolun Wu, Jikun Kang, Xue Liu

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) University of Cambridge(剑桥大学) MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(MBZUAI - 摩苏尔·本·扎耶德人工智能大学) University of Toronto(多伦多大学) Salesforce

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出QUACK框架,通过游戏结果、行为轨迹和话语一致性三级评估,自动审计多模态社交推理智能体语言与感知行为的一致性,发现最强智能体仍有15.1%的空间幻觉和过半无据指控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20586 2026-05-27 cs.AI cs.LG 62%

PaTAS: A Framework for Trust Propagation in Neural Networks Using Subjective Logic

PaTAS:基于主观逻辑的神经网络信任传播框架

Koffi Ismael Ouattara, Ioannis Krontiris, Theo Dimitrakos, Dennis Eisermann, Houda Labiod, Frank Kargl

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出PaTAS框架,利用主观逻辑在神经网络中并行传播信任,通过信任节点和信任函数量化输入、参数和激活的信任,并设计参数信任更新和推理路径信任评估方法,以在对抗或退化条件下提供可解释的信任估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27311 2026-05-27 cs.CL cs.CV 57%

Chartographer: Counterfactual Chart Generation for Evaluating Vision-Language Models

Chartographer: 用于评估视觉语言模型的反事实图表生成

Yifan Jiang, Dae Yon Hwang, Jesse C. Cresswell, Freda Shi

机构 * University of Waterloo(滑铁卢大学) Vector Institute(向量研究所) Layer 6 AI

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 提出 Chartographer 框架,通过将图表逆向工程为可执行代码并生成反事实变体,揭示视觉语言模型在图表问答中的视觉推理缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26405 2026-05-27 cs.CL 57%

Towards Just-in-Time Adaptive Feedback: Enhancing Student Learning via Knowledge-Grounded LLM

面向即时自适应反馈:通过知识增强的大语言模型提升学生学习

Younghun Lee, Amir Bralin, Nobel Sanjay Rebello, Dan Goldwasser

机构 * Department of Computer Science(计算机科学系) Department of Physics and Astronomy(物理与天文学系) College of Education(教育学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 提出一个框架,利用领域专家知识增强大语言模型,在真实教学场景中提供即时自适应反馈,并在大规模大学课程中提升学生成绩超过80%。

Comments 8 pages, Accepted to 21st Workshop on Innovative Use of NLP for Building Educational Applications (BEA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27124 2026-05-27 cs.PL cs.SE 50%

ProDebug: An Automated Debugging System for Prolog

ProDebug:Prolog的自动化调试系统

Ricardo Brancas, Vasco Manquinho, Ruben Martins

专题命中 逻辑推理 :reasoning(abstract)

AI总结 提出结合大语言模型、频谱和变异技术的Prolog自动调试系统ProDebug,用于识别学生作业中的错误并生成修复方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26739 2026-05-27 cs.LO 50%

From Actions to Obligations: A Deontic Action Model Logic

从行动到义务:道义行动模型逻辑

Giorgio Cignarale

专题命中 逻辑推理 :reasoning(abstract)

AI总结 提出道义行动模型逻辑(DAML),通过整合道义评估机制扩展认知行动模型逻辑,用于推理多智能体系统中关于行动的义务,并证明其公理化系统的可靠性和完备性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24461 2026-05-27 cs.AR cs.DC cs.SY eess.SY 50%

Provisioning to Runtime Optimization of a 100 MW-Scale AI Cluster

一个100兆瓦级AI集群的供应到运行时优化

Ehsan K. Ardestani, Leonardo Piga, Jovan Stojkovic, Pavan Balaji, Mustafa Ozdal, Mikel Jimenez Fernandez, Mihaela Dimovska, Luka Tadic, Hao Shen, Devika Vishwanath, Richa Mishra, Melaku Mihret, Valentin Andrei, Mauricio Cespedes, Julien Prigent, James Monahan, Tyler Graf, Bin Li, Charles Marquez, Shobhit Kanaujia, Kaushik Veeraraghavan, Chunqiang Tang

专题命中 逻辑推理 :planning(abstract)

AI总结 本文首次描述了超大规模AI数据中心从早期电力规划到运行时动态功耗管理的端到端过程,并提供了150兆瓦数据中心中83K GB200 GPU集群的详细功耗测量数据。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划推理 32 篇

2510.01833 2026-05-27 cs.AI cs.CL 91%

Plan Then Action:High-Level Planning Guidance Reinforcement Learning for LLM Reasoning

先规划后行动:面向LLM推理的高层规划引导强化学习

Zhihao Dou, Qinjian Zhao, Zhongwei Wan, Dinggen Zhang, Weida Wang, Towsif Raiyan, Benteng Chen, Qingtao Pan, Yang Ouyang, Chaoda Song, Zhiqiang Gao, Shufei Zhang, Sumon Biswas

机构 * Case Western Reserve University, Cleveland, OH, USA(凯斯西储大学) Kean University, Union, NJ, USA(凯恩大学) The Ohio State University, Columbus, OH, USA(俄亥俄州立大学) Fudan University, Shanghai, China(复旦大学) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) The University of Hong Kong, Hong Kong, China(香港大学) North Carolina State University, Raleigh, NC, USA(北卡罗来纳州立大学)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 提出PTA-GRPO两阶段框架,通过高层规划引导与强化学习联合优化,提升LLM在数学和自然科学推理任务中的准确性和泛化能力。

Comments 19 pages and 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09551 2026-05-27 cs.CV 88%

GeoSolver: Scaling Test-Time Reasoning in Remote Sensing with Fine-Grained Process Supervision

GeoSolver: 利用细粒度过程监督扩展遥感中的测试时推理

Lang Sun, Ronghao Fu, Zhuoran Duan, Haoran Liu, Xueyan Liu, Bo Yang

机构 * College of Computer Science and Technology(计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education Jilin University(教育部符号计算与知识工程重点实验室)

专题命中 规划推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);verifier(abstract)

AI总结 提出GeoSolver框架,通过构建大规模过程监督数据集Geo-PRM-2M和训练过程奖励模型GeoPRM,结合过程感知树GRPO强化学习算法,实现遥感中可验证的逐步推理,在多个基准上达到最优性能并支持测试时扩展。

Comments Code: https://github.com/yourname/GeoSolver

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25480 2026-05-27 cs.CL 83%

Retrieval as Reasoning: Self-Evolving Agent-Native Retrieval via LLM-Wiki

检索即推理:通过LLM-Wiki实现自我进化的智能体原生检索

Haoliang Ming, Feifei Li, Xiaoqing Wu, Wenhui Que

机构 * Tencent Inc.(腾讯公司)

专题命中 规划推理 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL

AI总结 提出LLM-Wiki系统,将外部知识组织为可编译、可组合、自进化的Wiki页面,通过工具调用接口实现搜索、阅读和链接跟踪操作,并引入错误簿进行持续自纠正,在多项多跳问答基准上取得最优结果。

Comments 15 pages, 3 figures, 10 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13217 2026-05-27 cs.IR cs.LG 83%

LLM-guided Hierarchical Search for End-to-end Reasoning Intensive Retrieval

LLM引导的层次化搜索用于端到端推理密集型检索

Nilesh Gupta, Wei-Cheng Chang, Ngot Bui, Cho-Jui Hsieh, Inderjit S. Dhillon

机构 * UT Austin(得克萨斯大学) UCLA(加州大学洛杉矶分校) Google(谷歌)

专题命中 规划推理 :reasoning(title,abstract);verifier(abstract);分类 cs.LG

AI总结 本文提出LATTICE,一种无需嵌入模型的LLM引导层次化搜索方法,通过LLM构建搜索索引并校准路径聚合遍历,在推理密集型基准上达到与最优微调集成基线相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20505 2026-05-27 cs.AI cs.CL cs.LG 82%

LiPUP-MA: A Residential Experience-centric Multi-Agent Framework for Living-in-the-loop Participatory Urban Planning

LiPUP-MA:一种以居住体验为中心的循环参与式城市多智能体规划框架

Hang Ni, Yuzhi Wang, Yizhi Song, Hao Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong Polytechnic University(香港理工大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出LiPUP-MA多智能体框架,通过模拟居住生活与体验驱动的计划修订循环,利用基于图的经验库和空间约束技能增强规划器,解决参与式城市规划中经验落地与反馈空间化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04310 2026-05-27 cs.AI 81%

EvoEmo: Towards Evolved Emotional Policies for Adversarial LLM Agents in Multi-Turn Price Negotiation

EvoEmo:面向多轮价格谈判中对抗性LLM智能体的进化情感策略

Yunbo Long, Liming Xu, Lukas Beckenbauer, Yuhan Liu, Alexandra Brintrup

机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) Rotman School of Management, University of Toronto(多伦多大学罗特曼管理学院) TUM School of Management, Technical University of Munich(慕尼黑技术大学管理学院) The Alan Turing Institute, London, UK(伦敦阿尔安·图灵研究院)

专题命中 规划推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出EvoEmo进化强化学习框架,通过将情感状态转移建模为马尔可夫决策过程并采用种群遗传优化,动态优化多轮谈判中的情感表达,显著提升LLM智能体的谈判成功率、效率和买家节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26969 2026-05-27 cs.CL cs.AI 81%

Recon: Reconstruction-Guided Reasoning Synthesis for User Modeling

Recon:基于重建指导的推理合成用于用户建模

Alan Zhu, Mihran Miroyan, Carolyn Wang, Andrew Zhou, Lisa Dunlap, Narges Norouzi, Joseph E. Gonzalez

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出Recon方法,通过动作重建分数评估推理轨迹的预测能力,以改进用户建模中的推理合成,在多个领域优于事后合理化基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25281 2026-05-27 cs.CL cs.AI 81%

READER: Reasoning-Enhanced AI-Generated Text Detection

READER: 增强推理的AI生成文本检测

Pingfan Su, Kai Ye, Shijin Gong, Erhan Xu, Jin Zhu, Giulia Livieri, Chengchun Shi

机构 * School of Mathematics, University of Birmingham(布里斯托尔大学数学学院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出READER方法,通过微调1.5B参数的LLM在结构化推理数据集READ上,结合推理与检测,在分布偏移下优于GPT-5.2等大100-1000倍的模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22511 2026-05-27 cs.AI cs.CL cs.IR 81%

Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented Reasoning

Search-E1: 自蒸馏驱动搜索增强推理中的自我进化

Zihan Liang, Yufei Ma, Ben Chen, Zhipeng Qian, Xuxin Zhang, Huangyu Dai, Lingtao Mao

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出Search-E1方法,通过交替使用普通GRPO和在线策略自蒸馏(OPSD),让搜索增强智能体无需外部监督或复杂模块即可自我进化,在七个QA基准上以3B模型超越所有开源基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26463 2026-05-27 cs.CL cs.AI 81%

Towards Error-Free EHRs: Reasoning-Intensive Consistency Verification Between Clinical Notes and Structured Tables in Electronic Health Records

迈向无差错的电子健康记录:临床笔记与结构化表格之间的推理密集型一致性验证

Yeonsu Kwon, Jiho Kim, Junseong Choi, Paloma Rabaey, Minseo Kim, Sujeong Im, Jeewon Yang, Jun-Min Lee, Sangji Lee, Jiwon Kim, Hangyul Yoon, Hyunwook Kwon, Edward Choi

机构 * KAIST(韩国科学技术院) Ghent University(根特大学) Samsung Medical Center(三星医疗中心) Samsung Changwon Hospital(三星昌原医院) Asan Medical Center(亚山医疗中心)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对电子健康记录中临床笔记与结构化表格数据不一致的问题,提出推理密集型基准EHR-ReasonCon和基于大语言模型的框架EHR-Inspector,通过锚点实体提取、时间引用和表格探索工具实现高效一致性验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26333 2026-05-27 cs.AI 79%

Managing Uncertainty in LLM-Generated Procedural Knowledge for Virtual Laboratory Planning

管理虚拟实验室规划中LLM生成程序性知识的不确定性

Polychronis Karpodinis, Dimitris Kalles

机构 * School of Science and Technology, Hellenic Open University(希腊开放大学科学与技术学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 针对LLM生成实验程序存在的不确定性,提出一个原型框架,通过结构化领域表示和不确定的状态转移样本提取候选程序规则,转化为显式约束并修复不确定步骤,以提升虚拟实验室规划的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24152 2026-05-27 cs.AI 79%

Neuro-Inspired Inverse Learning for Planning and Control

神经启发式逆向学习用于规划与控制

Maryna Kapitonova, Tonio Ball

机构 * NeuroMentum AI IMBIT, University of Freiburg, Germany(NeuroMentum AI IMBIT,弗赖堡大学,德国)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 提出一种神经启发式框架Inverter,通过逆向学习(IL)结合前向/逆向内部模型、开环多步运动指令和层次化动作组织,在规划与控制任务中实现高效推理,平均性能提升24.2%且计算时间降低一到两个数量级。

Comments Version 2, minor fix in online version of the abstract, pdf unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27071 2026-05-27 cs.AI 74%

Traceable Knowledge Graph Reasoning Enables LLM-Assisted Decision Support for Industrial VOCs in the Steel Industry

可溯源知识图谱推理助力钢铁行业工业VOCs的LLM辅助决策支持

Changqing Su, Yu Ding, Zuhong Lin, Hongyu Liu, Xi He, Zheng Zeng, Liqing Li

机构 * Hunan Key Laboratory of Carbon Neutrality and Intelligent Energy, School of New Energy and Environment, Hunan University of Technology and Business(湖南碳中和与智能能源重点实验室,新能环境学院,湖南科技商务大学) Aerospace Kaitian Environmental Technology Co., Ltd.(航天凯天环境科技有限公司) School of Energy Science and Engineering, Central South University(能源科学与工程学院,中南大学)

专题命中 规划推理 :reasoning(title);分类 cs.AI

AI总结 针对钢铁行业VOCs治理知识分散、通用大模型易产生幻觉的问题,提出基于知识图谱增强的多智能体问答系统Chat-ISV,通过拓扑优化、多智能体路由和源回溯检索实现高可靠性决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13853 2026-05-27 cs.CL cs.AI 73%

APEX-Searcher: Refining Credit Assignment with Subgoaling for Agentic Retrieval-Augmented Generation

APEX-Searcher: 通过子目标细化信用分配以增强智能体检索增强生成

Kun Chen, Qingchao Kong, Zhao Feifei, Wenji Mao

机构 * University of Chinese Academy of Sciences(中国科学院大学) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部) Wenge Technology Co., Ltd(Wenger科技有限公司)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 针对复杂多跳问答中检索路径模糊和端到端强化学习奖励稀疏的问题,提出APEX-Searcher,通过分离规划与执行的信用分配(规划用RL优化、执行用SFT学习),在多个基准上取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27209 2026-05-27 cs.AI 70%

Learning to Act under Noise: Enhancing Agent Robustness via Noisy Environments

在噪声中学习行动:通过噪声环境增强智能体鲁棒性

Yuxin Chen, Xiaodong Cai, Junfeng Fang, Zhuowen Han, Yu Wang, Yaorui Shi, Yi Zhang, Qi Gu, Xunliang Cai, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) Meituan(美团) Tsinghua University(清华大学) Tianjin University(天津大学) University of Science and Technology of China(中国科学技术大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出NoisyAgent框架,通过在训练中引入用户噪声和工具噪声,提升智能体在真实世界噪声环境下的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27013 2026-05-27 cs.AI 70%

Generating Robust Portfolios of Optimization Models using Large Language Models

使用大型语言模型生成鲁棒的优化模型组合

Eleni Straitouri, Cheol Woo Kim, Milind Tambe

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Harvard University(哈佛大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出一种利用LLM作为随机生成器和推理评估器的统一框架,生成鲁棒的优化模型组合,并保证在生成器或评估器之一与人类偏好对齐时组合中包含高质量候选模型。

Comments Accepted at the ICML 2026 LM4Plan Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26720 2026-05-27 cs.AI 70%

Towards Feedback-to-Plan Decisions for Self-Evolving LLM Agents in CUDA Kernel Generation

面向CUDA内核生成中自进化LLM代理的反馈到计划决策

Yee Hin Chong, Jiaming Wu, Youhui Zhang, Peng Qu

机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) Beijing National Research Center for Information Science and Technology, Beijing, China(北京信息科学国家研究中心)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 通过轨迹冻结和选择性反馈注入,提出CUDAnalyst框架以归因规划决策对反馈组件的贡献,揭示显式规划仅在反馈对齐时有效,且有效规划源于结构化多反馈交互。

Comments ICML 2026 accpeted, camera-ready in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26102 2026-05-27 cs.SE cs.CL 70%

SWE-Edit: Rethinking Code Editing for Efficient SWE-Agent

SWE-Edit:重新思考高效SWE智能体的代码编辑

Yikai Zhang, Jiaxin Pei, Kenan Li, Qirui Jin, Maoquan Wang, Jin Pan, Yu Kang, Shengyu Fu, Elsie Nallipogu, Junjie Hu, Yufan Huang, Zijian Jin

机构 * Microsoft(微软) Department of Computer Sciences, University of Wisconsin–Madison(威斯康星大学麦迪逊分校计算机科学系) Stanford Institute for Human-Centered Artificial Intelligence (HAI), Stanford University(斯坦福大学人机交互研究所)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 提出SWE-Edit框架,通过将代码编辑分解为查看器和编辑器两个子智能体,解决上下文耦合问题,在SWE-Bench Verified上提升解决率2.1个百分点并降低推理成本17.9%,且通过GRPO训练小模型实现高效编辑格式选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07358 2026-05-27 cs.IR 67%

A Comprehensive Survey on Agent Skills: Taxonomy, Techniques, and Applications

智能体技能综述:分类、技术与应用

Yingli Zhou, Wang Shu, Yaodong Su, Wenchuan Du, Yixiang Fang, Xuemin Lin

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文从智能体技能的生命周期(表示、获取、检索和演化)出发,系统综述了基于大语言模型的智能体在自动化复杂工作流中的技能定义、方法、资源及应用,并讨论了质量控制、互操作性、安全更新和长期能力管理等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26763 2026-05-27 cs.LG cs.AI 62%

Adversarial Training for Robust Coverage Network under Worst-case Facility Losses

对抗训练用于最坏设施损失下的鲁棒覆盖网络

Changhao Miao, Yuntian Zhang, Tongyu Wu, Fang Deng, Chen Chen

机构 * State Key Laboratory of Autonomous Intelligent Unmanned Systems, Beijing Institute of Technology(自主智能无人系统国家重点实验室,北京理工大学) School of AI, Beijing Institute of Technology(北京理工大学人工智能学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 针对最大覆盖选址-阻断问题,提出基于对抗学习的双智能体深度强化学习框架,实现高效求解与鲁棒决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01327 2026-05-27 cs.SE cs.CL cs.LG 62%

SWE-Adept: An LLM-Based Agentic Framework for Deep Codebase Analysis and Structured Issue Resolution

SWE-Adept:基于LLM的深度代码库分析与结构化问题解决代理框架

Kang He, Kaushik Roy

机构 * Electrical and Computer Engineering, Purdue University(电子工程与计算机工程系,普渡大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.LG

AI总结 提出SWE-Adept双代理框架,通过代理引导的深度优先搜索进行代码定位,结合自适应规划和结构化问题解决,在SWE-Bench上提升端到端解决率最多4.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27141 2026-05-27 cs.AI 57%

VitaBench 2.0: Evaluating Personalized and Proactive Agents in Long-Term User Interactions

VitaBench 2.0:评估长期用户交互中的个性化与主动型代理

Yuxin Chen, Yi Zhang, Zhengzhou Cai, Yaorui Shi, Zhiyuan Yao, Chenhang Cui, Jingnan Zheng, Yaqi Huo, Xi Su, Qi Gu, Xunliang Cai, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Meituan(美团) University of Science and Technology of China(中国科学技术大学) Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang University(浙江大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 针对现有代理基准忽视用户偏好推断与利用的问题,提出VitaBench 2.0基准,通过时间序列任务和可扩展记忆接口评估代理在长期交互中的个性化与主动性,实验表明最先进模型仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏