arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-14 至 2026-04-14 共收录 86 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 86 篇

2604.02460 2026-04-14 cs.CL cs.MA 89%

Single-Agent LLMs Outperform Multi-Agent Systems on Multi-Hop Reasoning Under Equal Thinking Token Budgets

单代理LLM在多跳推理中优于多代理系统(在相等的思考令牌预算下)

Dat Tran, Douwe Kiela

机构 * Stanford University(斯坦福大学)

专题命中 规划决策 :agent(title,abstract);multi-agent(title,abstract);agentic(abstract);分类 cs.CL

AI总结 在相等的思考令牌预算下,单代理系统在多跳推理任务中表现优于多代理系统,研究通过信息论论证指出单代理系统在信息效率上更具优势,并揭示了多代理系统在计算和上下文利用下降时的竞争性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10470 2026-04-14 cs.CL cs.AI 88%

From Query to Counsel: Structured Reasoning with a Multi-Agent Framework and Dataset for Legal Consultation

从查询到建议:基于多智能体框架和数据集的结构化推理用于法律咨询

Mingfei Lu, Yi Zhang, Mengjia Wu, Yue Feng

机构 * Australian Artificial Intelligence Institute (AAII), University of Technology Sydney(悉尼科技大学澳大利亚人工智能研究所) School of Computer Science, University of Birmingham(伯明翰大学计算机科学学院)

专题命中 规划决策 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出JurisCQAD数据集和JurisMA框架,通过结构化任务分解和多智能体协作,提升法律咨询问答的准确性与解释性。

Comments Accepted by ACL 2026 Main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13356 2026-04-14 cs.CY cs.CL 88%

CogniAlign: Survivability-Grounded Multi-Agent Moral Reasoning for Safe and Transparent AI

CogniAlign:基于生存性的多智能体道德推理以实现安全透明的AI

Hasin Jawad Ali, Ilhamul Azam, Ajwad Abrar, Md. Kamrul Hasan, Hasan Mahmud

机构 * Islamic University of Technology(伊斯兰科技大学)

专题命中 规划决策 :agent(title,abstract);multi-agent(title,abstract);分类 cs.CL

AI总结 CogniAlign通过基于自然主义道德现实的多智能体框架,将道德推理 grounded 在生存性上,通过学科专家智能体的结构化辩论实现透明和经验锚定的判断,证明了可审计的AI对齐方法的可行性。

Comments Under Review

Journal ref AI and Ethics (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10386 2026-04-14 cs.AI cs.MA 88%

TrajOnco: a multi-agent framework for temporal reasoning over longitudinal EHR for multi-cancer early detection

TrajOnco:一个用于纵向电子健康记录上时间推理的多智能体框架,用于多癌症早期检测

Sihang Zeng, Young Won Kim, Wilson Lau, Ehsan Alipour, Ruth Etzioni, Meliha Yetisgen, Anand Oka

机构 * Truveta Inc.(Truveta公司) University of Washington(华盛顿大学) Fred Hutch Cancer Center(弗雷德·哈钦森癌症中心)

专题命中 规划决策 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 TrajOnco通过多智能体框架对纵向EHR中的时间序列临床事件进行推理,生成患者总结和风险评分,实现多癌症早期检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10917 2026-04-14 cs.CL 87%

HTAA: Enhancing LLM Planning via Hybrid Toolset Agentization & Adaptation

HTAA:通过混合工具集代理化与适应增强大语言模型规划

Chengrui Huang, Junshuo Zhang, Zhiyuan Ma, Xikun Wang, Ximeng Wang, Menghua Jiang, Gang Zeng, Zhaobing Han, Shen Gao, Shuo Shang

机构 * University of Electronic Science and Technology of China(电子科技大学) DiDi Global Inc.(滴滴全球股份有限公司)

专题命中 规划决策 :planning(title,abstract);agent(abstract);tool-use(abstract);workflow(abstract)

AI总结 本文提出HTAA框架,通过混合工具集代理化与适应方法,提升大语言模型在复杂任务中的规划效率与可靠性,实验表明其在任务成功率、工具调用轨迹长度及上下文开销方面均优于基线模型。

Comments 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04269 2026-04-14 cs.AI cs.LG 86%

Beyond Fluency: Toward Reliable Trajectories in Agentic IR

超越流畅性:迈向可靠的代理信息检索轨迹

Anushree Sinha, Srivaths Ranganathan, Debanshu Das, Abhishek Dharmaratnakar

机构 * Google(谷歌)

专题命中 规划决策 :agentic(title,abstract);autonomous agent(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了代理信息检索中轨迹完整性与因果归因的重要性,提出通过验证门和系统性回避策略来减少累积误差和欺骗性流畅性,强调过程正确性而非终点准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09584 2026-04-14 cs.AI cs.CV 85%

Agentic Exploration of PDE Spaces using Latent Foundation Models for Parameterized Simulations

基于潜在基础模型的PDE空间代理探索用于参数化模拟

Abhijeet Vishwasrao, Francisco Giral, Mahmoud Golestanian, Federica Tonti, Andrea Arroyo Ramo, Adrian Lozano-Duran, Steven L. Brunton, Sergio Hoyas, Soledad Le Clainche, Hector Gomez, Ricardo Vinuesa

机构 * University of Michigan(密歇根大学) Universidad Politécnica de Madrid(马德里理工大学) Purdue University(普渡大学) Universitat Politècnica de València(瓦伦西亚理工大学) Caltech(加州理工学院) University of Washington(华盛顿大学)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出利用多代理LLM与潜在基础模型耦合,实现对PDE参数空间的连续探索,发现流体中不同尺度的标度律,展示了代理推理在PDE系统中的自动化科学发现能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07794 2026-04-14 cs.CL cs.AI cs.LG 85%

HiPRAG: Hierarchical Process Rewards for Efficient Agentic Retrieval Augmented Generation

HiPRAG:分层过程奖励用于高效代理检索增强生成

Peilin Wu, Mian Zhang, Kun Wan, Wentian Zhao, Kaiyu He, Xinya Du, Zhiyu Chen

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) Adobe Inc.(Adobe公司)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 HiPRAG通过引入细粒度的知识引导过程奖励,优化代理检索增强生成的推理过程,提升搜索效率并减少无效搜索。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11540 2026-04-14 cs.AI 83%

A collaborative agent with two lightweight synergistic models for autonomous crystal materials research

一种用于自主晶体材料研究的双轻量协同模型协作代理

Tongyu Shi, Yutang Li, Zhanyuan Li, Qian Liu, Jie Zhou, Wenhe Xu, Yang Li, Dawei Dai, Rui He, Wenhua Zhou, Jiahong Wang, Xue-Feng Yu

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Chinese Academy of Sciences(中国科学院大学) Institute for Advanced Study, Chengdu University(成都大学高等研究院) Key Laboratory of Cyberspace Big Data Intelligent Security, Ministry of Education, Chongqing University of Posts and Telecommunications(重庆邮电大学教育部网络空间大数据智能安全重点实验室)

专题命中 规划决策 :agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出MatBrain,一种轻量级协作代理系统,通过双协同模型提升材料研究效率,显著优于大模型,减少硬件部署成本,并在催化剂设计中实现100倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11378 2026-04-14 cs.AI cs.SY eess.SY 83%

From Agent Loops to Structured Graphs:A Scheduler-Theoretic Framework for LLM Agent Execution

从代理循环到结构化图:一个用于LLM代理执行的调度理论框架

Hu Wei

专题命中 规划决策 :agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出SGH框架,通过将控制流显式化为静态DAG,解决代理循环的隐式依赖、无限恢复循环和调试困难问题,同时分析可控性、表达性和可实现性之间的权衡。

Comments 51 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11686 2026-04-14 cs.IR 82%

EA-Agent: A Structured Multi-Step Reasoning Agent for Entity Alignment

EA-Agent:一种用于实体对齐的结构化多步推理代理

Yixuan Nan, Xixun Lin, Yanmin Shang, Ge Zhang, Zheng Fang, Fang Fang, Yanan Cao

专题命中 规划决策 :agent(title,abstract);planning(abstract)

AI总结 本文提出EA-Agent,通过多步规划与执行将实体对齐转化为结构化推理过程,引入属性和关系三元组选择器提升效率,实验表明其在三个基准数据集上均优于现有方法。

Comments ACL 2026,Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26163 2026-04-14 cs.CY 82%

Exploring Dissatisfaction in Bus Route Reduction through LLM-Calibrated Agent-Based Modeling

通过LLM校准的Agent-Based建模探索公交路线削减中的不满

Qiumeng Li, Xinxi Yang, Suhong Zhou

专题命中 规划决策 :agent(title,abstract);planning(abstract)

AI总结 研究通过LLM校准的ABM探讨公交路线削减对不同群体不满及网络韧性的影响,发现网络结构对系统稳定性影响大于容量因素,路线削减导致不满指数急剧上升,尤其影响残疾人士和老年人。

Comments The authors have withdrawn this preprint due to errors in figure presentation and labeling. A revised manuscript will be submitted once these issues are resolved

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22942 2026-04-14 cs.MA 82%

ClawMobile: Rethinking Smartphone-Native Agentic Systems

ClawMobile:重新思考原生智能手机代理系统

Hongchao Du, Shangyu Wu, Qiao Li, Riwei Pan, Jinheng Li, Youcheng Sun, Chun Jason Xue

专题命中 规划决策 :agentic(title,abstract);planning(abstract)

AI总结 本文提出ClawMobile,一种针对智能手机环境的代理系统架构,通过分层设计提升执行稳定性与可重复性,并探讨移动LLM运行时的关键挑战。

Comments Accepted at EuroMLSys 2026, 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09580 2026-04-14 cs.AI cs.LG 81%

OOWM: Structuring Embodied Reasoning and Planning via Object-Oriented Programmatic World Modeling

OOWM: 通过面向对象的程序化世界建模结构化具身推理与规划

Hongyu Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室) X-Era AI Lab(X-Era AI实验室)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 OOWM通过软件工程形式化方法构建具身推理框架,利用UML类图和活动图实现环境状态与控制策略的显式建模,结合监督微调与分组相对策略优化提升规划效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11302 2026-04-14 cs.RO cs.AI 79%

3D-Anchored Lookahead Planning for Persistent Robotic Scene Memory via World-Model-Based MCTS

基于世界模型的MCTS的3D锚定前瞻性规划用于持久性机器人场景记忆

Bronislav Sidik, Dror Mizrahi

机构 * Huawei Technologies, Israel R&D Center(华为技术有限公司以色列研发中心)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出3D-Anchored Lookahead Planning,结合MCTS与3D一致的世界模型,通过持续的相机到世界锚点实现精准重规划,提升了机器人在需要空间记忆任务中的成功率。

Comments 5 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10517 2026-04-14 cs.AI 79%

From Perception to Planning: Evolving Ego-Centric Task-Oriented Spatiotemporal Reasoning via Curriculum Learning

从感知到规划:通过课程学习进化自主任务导向的空间时间推理

Xiaoda Yang, Yuxiang Liu, Shenzhou Gao, Can Wang, Jingyang Xue, Lixin Yang, Yao Mu, Tao Jin, Shuicheng Yan, Zhimeng Zhang, Zhou Zhao

机构 * Zhejiang University(浙江大学) Tianjin University(天津大学) Qingdao University(青岛大学) Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出EgoTSR框架,通过课程学习提升任务导向的空间时间推理能力,解决静态感知和动态环境中的时空幻觉问题,实验显示其在长周期推理任务中准确率达92.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10420 2026-04-14 cs.LG 79%

CARE-ECG: Causal Agent-based Reasoning for Explainable and Counterfactual ECG Interpretation

CARE-ECG:基于因果代理的可解释与反事实ECG解读

Elahe Khatibi, Ziyu Wang, Ankita Sharma, Krishnendu Chakrabarty, Sanaz Rahimi Moosavi, Farshad Firouzi, Amir Rahmani

机构 * University of California, Irvine(加州大学尔湾分校) Arizona State University(亚利桑那州立大学) California State University, Dominguez Hills(加州州立大学多明格斯山分校)

专题命中 规划决策 :agent(title);agentic(abstract);分类 cs.LG

AI总结 CARE-ECG通过统一的表示学习、诊断和解释流程,提升ECG解读的准确性与可信度,减少幻觉,适用于多基准和专家问答场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09578 2026-04-14 cs.AI 79%

Explainable Planning for Hybrid Systems

混合系统的可解释规划

Mir Md Sajid Sarwar

机构 * School of Mathematical and Computational Sciences, Indian Association for the Cultivation of Science, Kolkata(印度科学培育协会数学与计算科学学院,加尔各答)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 研究针对混合系统中的可解释人工智能规划,探讨生成AI系统解释的方法,以应对自动化规划在复杂安全领域中的应用需求。

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09866 2026-04-14 cs.SE cs.AI 79%

Automating Structural Analysis Across Multiple Software Platforms Using Large Language Models

利用大型语言模型在多个软件平台间自动化结构分析

Ziheng Geng, Jiachen Liu, Ian Franklin, Ran Cao, Dan M. Frangopol, Minghui Cheng

机构 * University of Miami(迈阿密大学) HBC Engineering Company(HBC工程公司) Hunan University(湖南大学) Lehigh University(里海大学)

专题命中 规划决策 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出一种多软件平台结构分析自动化方法,通过两阶段多智能体架构实现跨平台建模与分析,实验表明其在多个主流软件中均达到90%以上的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05697 2026-04-14 cs.RO cs.SY eess.SY 78%

GraspSense: Physically Grounded Grasp and Grip Planning for a Dexterous Robotic Hand via Language-Guided Perception and Force Maps

GraspSense: 为灵活机械手提供基于语言引导感知和力图的抓取与握力规划

Elizaveta Semenyakina, Ivan Snegirev, Mariya Lezina, Miguel Altamirano Cabrera, Safina Gulyamova, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Skolkovo Institute of Science and Technology(斯科尔科沃科技学院智能空间机器人实验室)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出一种基于力图的抓取与握力规划方法,通过物理建模和力图分析,使机械手能选择结构更坚固的接触区域并保持安全的抓取力。

Comments 6 pages, 4 figures, 4 tables. Minor non-semantic changes in the main scheme

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04436 2026-04-14 cs.RO cs.SY eess.SY 78%

Reliable and Real-Time Highway Trajectory Planning via Hybrid Learning-Optimization Frameworks

通过混合学习-优化框架实现可靠且实时的高速公路轨迹规划

Yujia Lu, Chong Wei, Lu Ma, Lounis Adouane

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出混合高速公路轨迹规划框架,结合学习方法的适应性和优化方法的正式安全保证,确保在多车交互复杂情况下实现高可靠性和实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10883 2026-04-14 cs.HC 78%

Towards Designing for Resilience: Community-Centered Deployment of an AI Business Planning Tool in a Small Business Center

迈向韧性设计:在小型企业中心部署一个AI业务规划工具的社区中心化方法

Quentin Romero Lauro, Aakash Gautam, Yasmine Kotturi

专题命中 规划决策 :planning(title,abstract)

AI总结 本文探讨了在资源有限社区中,通过社区中心化设计部署AI业务规划工具BizChat,研究创业者如何通过集体AI素养发展建立韧性,发现AI工具在降低融资门槛的同时也引发了对规划本质的质疑。

Comments 17 pages, accepted to CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10750 2026-04-14 eess.SY cs.SY 78%

Motion planning and approximate controllability of a moving cantilever beam with a tip-mass

带有末端质量的移动悬臂梁的运动规划与近似可控性

Soham Chatterjee, Aman Batra, Vivek Natarajan

专题命中 规划决策 :planning(title,abstract)

AI总结 本文研究了带有末端质量的悬臂梁模型在给定时间区间内从初始状态转移到最终状态的运动规划问题,并利用生成函数方法证明了该模型的近似可控性。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12022 2026-04-14 cs.RO cs.SY eess.SY 78%

SBAMP: Sampling Based Adaptive Motion Planning

基于采样的自适应运动规划:SBAMP

Shreyas Raorane, Kabir Ram Puri, Anh-Quan Pham

机构 * General Robotics, Automation, Sensing and Perception (GRASP) Laboratory, University of Pennsylvania(宾夕法尼亚大学通用机器人、自动化、感知与感知(GRASP)实验室)

专题命中 规划决策 :planning(title,abstract)

AI总结 SBAMP结合RRT*全局规划与在线Lyapunov稳定的SEDS控制器,实现动态环境下的稳定实时适应与全局路径保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01215 2026-04-14 math.OC 78%

A New Approach to Motion Planning in 3D for a Dubins Vehicle: Special Case on a Sphere

在球面上Dubins车辆3D运动规划的新方法:特殊情形

Deepak Prakash Kumar, Swaroop Darbha, Satyanarayana Gupta Manyam, David Casbeer

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出了一种适用于空中车辆的3D运动规划新模型,研究了曲率受限车辆在球面表面的运动规划问题,推导了最小转弯半径车辆的最优路径,并扩展了最优路径的范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10134 2026-04-14 cs.CR 78%

PlanGuard: Defending Agents against Indirect Prompt Injection via Planning-based Consistency Verification

PlanGuard:通过基于规划的一致性验证防御代理 against 间接提示注入

Guangyu Gong, Zizhuang Deng

专题命中 规划决策 :planning(title);agent(abstract)

AI总结 本文提出PlanGuard,一种基于上下文隔离的无训练防御框架,通过规划器生成有效动作集和分层验证机制,有效防御间接提示注入攻击,实验显示攻击成功率从72.8%降至0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10589 2026-04-14 cs.AI 77%

Working Paper: Towards Schema-based Learning from a Category-Theoretic Perspective

工作论文:从范畴论视角迈向基于模式的学习

Pablo de los Riscos, Fernando J. Corbacho, Michael A. Arbib

机构 * Cognodata I+D & Universidad Autonoma de Madrid(Cognodata I+D 与马德里自治大学) University of California San Diego(加利福尼亚大学圣迭戈分校)

专题命中 规划决策 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出一种分层范畴框架,用于基于模式的学习,通过四个相互关联的层次结构,构建了模式、实现、语义和智能体等层面,实现了模式语义、认知、具身化和架构抽象的弱分层n-范畴结构。

Comments 43 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09596 2026-04-14 cs.AI cs.MA 77%

DERM-3R: A Resource-Efficient Multimodal Agents Framework for Dermatologic Diagnosis and Treatment in Real-World Clinical Settings

DERM-3R:一种资源高效的多模态代理框架,用于皮肤病诊断和治疗的现实世界临床应用

Ziwen Chen, Zhendong Wang, Chongjing Wang, Yurui Dong, Luozhijie Jin, Jihao Gu, Kui Chen, Jiaxi Yang, Bingjie Lu, Zhou Zhang, Jirui Dai, Changyong Luo, Xiameng Gai, Haibing Lan, Zhi Liu

机构 * School of Pharmacy, Nanjing University of Chinese Medicine(南京中医药大学药学院) Department of Dermatology, the Gulou Hospital of Traditional Chinese Medicine of Beijing(北京鼓楼中医医院皮肤科) Infectious disease department, Dongfang Hospital, Beijing University of Chinese Medicine(北京中医药大学东方医院感染科) College of Art and Science, university of Washington(华盛顿大学文理学院) Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Fudan Unversity(复旦大学) Zhejiang Lab(之江实验室) University College London(伦敦大学学院) Department of Dermatology, Inner Mongolia Hospital of Traditional Chinese Medicine(内蒙古自治区中医医院皮肤科) International Campus of Zhejiang University(浙江大学国际校区)

专题命中 规划决策 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出DERM-3R框架,通过三个协作代理解决皮肤病诊断中的细粒度病变识别、多视角病变表示和综合推理问题,展示了其在资源受限下的高效性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27484 2026-04-14 cs.LG cs.AI cs.CL 75%

Thought Branches: Interpreting LLM Reasoning Requires Resampling

思维分支:解释大语言模型推理需要重采样

Uzay Macar, Paul C. Bogdan, Senthooran Rajamanoharan, Neel Nanda

机构 * MATS

专题命中 规划决策 :planning(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文通过重采样研究大语言模型推理过程中的因果影响,探讨了单个推理链的局限性,并提出了基于重采样的方法来分析模型决策和推理步骤的影响。

Comments Uzay Macar and Paul C. Bogdan contributed equally to this work, and their listed order was determined by coinflip

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10674 2026-04-14 cs.LG cs.AI cs.CL 75%

Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents

Skill-SD:基于多轮LLM代理的技能条件自蒸馏

Hao Wang, Guozhi Wang, Han Xiao, Yufeng Zhou, Yue Pan, Jichao Wang, Ke Xu, Yafei Wen, Xiaohu Ruan, Xiaoxin Chen, Honggang Qi

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学) vivo AI Lab(vivo AI实验室)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 Skill-SD通过将代理自身轨迹转化为动态训练监督,结合重要加权反KL损失稳定训练,提升多轮LLM代理性能,实验显示优于标准RL和OPD方法。

Comments Project page: https://k1xe.github.io/skill-sd/

详情

展开后加载摘要…

URL PDF HTML 收藏