arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-29 至 2026-04-29 共收录 126 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 6 篇

2602.11224 2026-04-29 cs.SE cs.CL 91%

Agent-Diff: Benchmarking LLM Agents on Enterprise API Tasks via Code Execution with State-Diff-Based Evaluation

Agent-Diff:通过代码执行基于状态差的评估来基准测试LLM代理在企业API任务上的表现

Hubert M. Pysklo, Artem Zhuravel, Patrick D. Watson

机构 * Minerva University(Minerva大学)

专题命中 工具调用 :agent(title,title_cn);agentic(abstract);分类 cs.CL、cs.SE

AI总结 本文提出Agent-Diff框架,通过代码执行和基于状态差的评估,评估LLM代理在企业API任务中的性能,提供了九个LLM在224个任务上的基准测试,并通过消融实验评估框架的鲁棒性。

Comments Pre-Print. Under review for KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25012 2026-04-29 cs.LG 88%

Why Search When You Can Transfer? Amortized Agentic Workflow Design from Structural Priors

为何需要搜索?从结构先验出发的 amortized 智能工作流设计

Shiyi Du, Jiayuan Liu, Weihua Du, Yue Huang, Jiayi Li, Yingtao Luo, Xiangliang Zhang, Vincent Conitzer, Carl Kingsford

机构 * Carnegie Mellon University(卡内基梅隆大学) Foundations of Cooperative AI Lab (FOCAL)(合作人工智能基础实验室) University of Notre Dame(圣约翰大学)

专题命中 工具调用 :workflow(title,abstract);agentic(title,abstract);分类 cs.LG

AI总结 本文提出SWIFT框架,通过结构先验和跨任务工作流演示,实现工作流设计的 amortization,减少计算成本并提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25555 2026-04-29 cs.CR cs.AI 85%

From CRUD to Autonomous Agents: Formal Validation and Zero-Trust Security for Semantic Gateways in AI-Native Enterprise Systems

从CRUD到自主代理:面向AI原生企业系统的语义网关的正式验证与零信任安全

Ignacio Peyrano

机构 * Universidad Austral(乌尔苏拉大学)

专题命中 工具调用 :autonomous agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出了一种基于模型上下文协议的语义网关,通过正式验证和实证评估,解决了AI原生系统中自主代理的安全验证问题,采用零信任安全模型和语义模糊化技术,实现了对动态状态转换系统的安全审计。

Comments 25 pages, 4 figures, 4 tables. Open-source proof-of-concept (47 automated tests, deterministic semantic fuzzer) available at https://github.com/PeyranoDev/semantic-gateway-poc

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25846 2026-04-29 cs.CR cs.AI 83%

Towards Agentic Investigation of Security Alerts

朝向安全警报的代理调查

Even Eilertsen, Vasileios Mavroeidis, Gudmund Grov

机构 * University of Oslo(奥斯陆大学) Norwegian Defence Research Establishment (FFI)(挪威国防研究机构(FFI))

专题命中 工具调用 :agentic(title,abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出一种利用大语言模型自动化安全警报初步调查的代理工作流,通过预定义查询和结构化工具访问提高准确性,减少人工工作量。

Comments 10 pages, 3 figures, 4 tables. Accepted at the 2025 IEEE International Conference on Big Data (BigData)

Journal ref Proc. 2025 IEEE Int. Conf. on Big Data (BigData), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16918 2026-04-29 cs.CV 78%

AdaTooler-V: Adaptive Tool-Use for Images and Videos

AdaTooler-V:面向图像和视频的自适应工具使用

Chaoyang Wang, Kaituo Feng, Dongyang Chen, Zhongyu Wang, Zhixun Li, Sicheng Gao, Meng Meng, Xu Zhou, Manyuan Zhang, Yuzhang Shang, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学MML实验室) THU(清华大学) SJTU(上海交通大学) DB Group, CUHK(香港中文大学DB小组) UCF(佛罗里达大学) Sangfor(Sangfor公司) JMU(约翰·霍普金斯大学)

专题命中 工具调用 :tool-use(title,abstract)

AI总结 本文提出AdaTooler-V,通过自适应工具使用提升多模态大语言模型的视觉推理能力,通过强化学习算法和定制数据集优化工具调用策略,实验证明其在多种视觉任务中表现优异。

Comments ACL 2026 Findings, Project page: https://github.com/CYWang735/AdaTooler-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22821 2026-04-29 cs.SD cs.LG eess.AS 74%

Audio2Tool: Speak, Call, Act -- A Dataset for Benchmarking Speech Tool Use

Audio2Tool: 说话,呼叫,行动 -- 一个用于语音工具使用的基准测试数据集

Ramit Pahwa, Apoorva Beedu, Parivesh Priye, Rutu Gandhi, Saloni Takawale, Aruna Baijal, Zengli Yang

机构 * Rivian and Volkswagen Group Technologies(Rivian和大众集团技术公司)

专题命中 工具调用 :tool use(title);分类 cs.LG

AI总结 Audio2Tool数据集通过三个领域评估语音语言模型的工具调用能力,包含30000个查询,涵盖简单指令到复杂多意图任务,测试模型在不同挑战下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 36 篇

2604.25318 2026-04-29 cs.GR cs.AI cs.CL 92%

Cutscene Agent: An LLM Agent Framework for Automated 3D Cutscene Generation

Cutscene Agent:一种用于自动化3D场景生成的LLM代理框架

Lanshan He, Haozhou Pang, Qi Gan, Xin Shen, Ziwei Zhang, Yibo Liu, Gang Fang, Bo Liu, Kai Sheng, Shengfeng Zeng, Chaofan Li, Zhen Hui, Keer Zhou, Lan Zhou, Shujun Dai

机构 * Kuaishou GameMind Lab(快手游戏大脑实验室)

专题命中 规划决策 :agent(title,title_cn);tool-use(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Cutscene Agent框架,通过双向集成LLM代理与游戏引擎,实现多代理协作生成可编辑的电影化3D内容,并构建了针对长周期多步骤协作的评估基准。

Comments 27 pages excluding appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07236 2026-04-29 cs.AI cs.CL 88%

How Much Heavy Lifting Can an Agent Harness Do?: Measuring the LLM's Residual Role in a Planning Agent

代理能承载多少实质性工作?:测量规划代理中LLM的残余作用

Sungwoo Jung, Seonil Son

机构 * Independent Researcher(独立研究者)

专题命中 规划决策 :agent(title,abstract);planning(title,abstract);分类 cs.AI、cs.CL

AI总结 研究通过外部测量规划代理各层,量化LLM在决策中的残余作用,发现声明性规划承担主要工作,而符号反思和LLM支持的修订仅在特定情况下生效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15473 2026-04-29 cs.AI 88%

Agent Lifecycle Toolkit (ALTK): Reusable Middleware Components for Robust AI Agents

智能体生命周期工具包(ALTK):用于鲁棒AI智能体的可重用中间件组件

Zidane Wright, Jason Tsay, Anupama Murthi, Osher Elhadad, Diego Del Rio, Saurabh Goyal, Kiran Kate, Jim Laredo, Koren Lazar, Vinod Muthusamy, Yara Rizk

机构 * IBM Research(IBM研究院) IBM

专题命中 规划决策 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI

AI总结 ALTK通过模块化中间件组件系统性解决智能体全生命周期中的故障模式问题,提供一致接口并兼容低代码工具,显著降低构建可靠生产级智能体的难度。

Comments to appear in CAIS 2026 demonstration track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22154 2026-04-29 cs.AI cs.CL 87%

Exploring Reasoning Reward Model for Agents

探索用于智能体的推理奖励模型

Kaixuan Fan, Kaituo Feng, Manyuan Zhang, Tianshuo Peng, Zhixun Li, Yilei Jiang, Shuang Chen, Peng Pei, Xunliang Cai, Xiangyu Yue

机构 * MMLab, CUHK(CUHK 机器学习实验室) Meituan(美团) SEEM, CUHK(CUHK 系统工程与工程管理系)

专题命中 规划决策 :agent(summary_cn,abstract);tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Agent-RRM模型,通过结构化反馈提升智能体推理能力,采用三种集成策略在12个基准测试中取得显著性能提升。

Comments ACL 2026 Findings, Project page: https://github.com/kxfan2002/Reagent

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25788 2026-04-29 cs.RO 82%

KinDER: A Physical Reasoning Benchmark for Robot Learning and Planning

KinDER:机器人学习与规划的运动学与动力学推理基准

Yixuan Huang, Bowen Li, Vaibhav Saxena, Yichao Liang, Utkarsh Aashu Mishra, Liang Ji, Lihan Zha, Jimmy Wu, Nishanth Kumar, Sebastian Scherer, Danfei Xu, Tom Silver

机构 * Princeton University(普林斯顿大学) Carnegie Mellon University(卡内基梅隆大学) Georgia Tech(佐治亚理工学院) University of Cambridge(剑桥大学) NVIDIA(英伟达) MIT(麻省理工学院)

专题命中 规划决策 :planning(title,abstract);tool use(abstract)

AI总结 KinDER基准针对机器人学习与规划中的物理推理挑战,包含25个生成环境、Python库和评估套件,旨在通过系统比较不同方法提升机器人物理推理能力。

Comments Project website: https://prpl-group.com/kinder-site/. 21 pages, 8 figures. Accepted to Robotics Science and Systems (RSS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07927 2026-04-29 cs.AI 81%

EigentSearch-Q+: Enhancing Deep Research Agents with Structured Reasoning Tools

EigentSearch-Q+: 通过结构化推理工具增强深度研究代理

Boer Zhang, Mingyan Wu, Dongzhuoran Zhou, Yuqicheng Zhu, Wendong Fan, Puzhen Zhang, Zifeng Ding, Guohao Li, Yuan He

机构 * Meta Northeastern University, China(东北大学) University of Oslo(奥斯陆大学) Bosch Center for AI(博世人工智能中心) University of Stuttgart(斯图加特大学) University of Cambridge(剑桥大学) Mina AI Amazon(亚马逊)

专题命中 规划决策 :agent(abstract);AI agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 本文提出Q+工具,通过引导查询规划和证据提取提升深度研究代理的搜索效率,实验显示在多个基准测试中提升了模型准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14248 2026-04-29 cs.AI cs.CL 81%

Why Do LLM-based Web Agents Fail? A Hierarchical Planning Perspective

为什么基于大语言模型的网络代理会失败?一种分层规划视角

Mohamed Aghzal, Gregory J. Stein, Ziyu Yao

机构 * Department of Computer Science, George Mason University(乔治·马歇尔大学计算机科学系)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.CL

AI总结 本文从分层规划角度分析了LLM网络代理失败原因,发现低层执行是主要瓶颈,改进感知接地和自适应控制对实现人类可靠性至关重要。

Comments Accepted to The 64th Annual Meeting of the Association for Computational Linguistics (ACL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25267 2026-04-29 cs.RO cs.AI 79%

Dynamic UGV-UAV Cooperative Path Planning in Uncertain Environments

动态不确定环境中UGV-UAV协同路径规划

Ninh Nguyen, Srinivas Akella

机构 * Department of Computer Science, University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校计算机科学系)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出动态UGV-UAV协同路径规划方法,通过无人机动态检测道路以提高地面车辆路径安全性与效率,实验表明双向策略在多数情况下表现最佳,多无人机可减少地面车辆行驶时间但增加计算时间。

Comments Accepted to IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05310 2026-04-29 cs.RO 78%

Instantaneous Planning, Control and Safety for Navigation in Unknown Underwater Spaces

未知水下空间导航中的即时规划、控制与安全性

Veejay Karthik, Udit Ekansh, Tejal Bedmutha, Shivam Vishwakarma, Rohan Deshpande, Leena Vachhani

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出一种集成规划与控制框架,利用实时传感器数据动态生成闭环AUV轨迹,提升水下复杂环境中的避障能力和机动性。

Comments Uploaded by mistake. A different version of the study is under process

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25329 2026-04-29 cs.RO 78%

ProDrive: Proactive Planning for Autonomous Driving via Ego-Environment Co-Evolution

ProDrive:通过自我环境共演实现自动驾驶的前瞻性规划

Chuyao Fu, Shengzhe Gan, Zhuoli Ouyang, Yuhan Rui, Xiaowei Chi, Sirui Han, Jiankun Wang, Hong Zhang

机构 * Southern University of Science and Technology(南方科技大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 ProDrive通过自我环境共演实现自动驾驶前瞻性规划,结合查询导向的轨迹规划器和鸟瞰图世界模型,提升安全性和规划效率。

Comments Accepted to CVPR 2026 GigaBrain Challenge Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21304 2026-04-29 cs.IR 78%

PaperMind: Benchmarking Agentic Reasoning and Critique over Scientific Papers in Multimodal LLMs

PaperMind:多模态大语言模型中科学论文代理推理与批判的基准测试

Yanjun Zhao, Tianxin Wei, Jiaru Zou, Xuying Ning, Yuanchen Bei, Lingjie Chen, Simmi Rana, Wendy H. Yang, Hanghang Tong, Jingrui He

专题命中 规划决策 :agentic(title);agent(abstract)

AI总结 PaperMind通过整合多模态信息和跨源推理,评估科学论文的综合推理能力,揭示多模态大语言模型在科学推理和批判中的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.06768 2026-04-29 cs.RO 78%

Hierarchical Time-Optimal Planning for Multi-Vehicle Racing

多车辆赛车的分层时间最优规划

Georg Jank, Matthias Rowold, Boris Lohmann

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出了一种多对手赛车的分层规划算法,通过结合离散和连续规划方法,实现全局时间最优,且无需粗粒度离散化。通过低分辨率时空可见图确定最快行为,并计算机动包络作为时间最优控制问题的约束,相比并行方法更高效且可单核执行。

Comments 6 pages, accepted to be published as part of the 26th IEEE International Conference on Intelligent Transportation Systems (ITSC 2023), Bilbao, Bizkaia, Spain, September 24-28, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25203 2026-04-29 cs.CL cs.AI cs.LG 75%

BARRED: Synthetic Training of Custom Policy Guardrails via Asymmetric Debate

BARRED: 通过不对称辩论合成定制策略的守卫规则

Arnon Mazza, Elad Levi

机构 * Plurai Inc.(Plurai公司)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 BARRED通过不对称辩论生成合成训练数据,提升定制策略的安全性与效率,实验表明其优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08567 2026-04-29 cs.CL cs.MA 70%

Multi-User Large Language Model Agents

多用户大语言模型代理

Shu Yang, Shenzhe Zhu, Hao Zhu, José Ramón Enríquez, Di Wang, Alex Pentland, Michiel A. Bakker, Jiaxin Pei

机构 * Stanford University(斯坦福大学) KAUST UT Austin(得克萨斯大学奥斯汀分校) MIT(麻省理工学院)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.CL

AI总结 本文首次系统研究多用户LLM代理,提出统一交互协议并设计压力测试场景,揭示前沿模型在优先级维护、隐私保护和协调效率方面的系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16340 2026-04-29 cs.CL cs.AI 62%

Thinking About Thinking: Evaluating Reasoning in Post-Trained Language Models

思考中的思考:评估后训练语言模型的推理能力

Pratham Singla, Shivank Garg, Ayush Singh, Ishan Garg, Ketan Suhaas Saichandran

机构 * Indian Institute of Technology Roorkee(印度理工学院罗奥克学院) Boston University(波士顿大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 研究评估后训练语言模型的推理能力,通过三个核心能力评估其意识、泛化和推理与输出的对齐情况,发现强化学习模型在意识和泛化上优于SFT模型,但推理与输出对齐较差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25526 2026-04-29 cs.SE cs.AI 62%

AI as Consumer and Participant: A Co-Design Agenda for MBSE Substrates and Methodology

AI作为消费者和参与者:MBSE子系统与方法论的协同设计议程

Siyuan Ji

专题命中 规划决策 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 本文探讨了AI在MBSE模型中的应用问题,指出现有模型未为AI消费设计,提出需协同设计模型与方法论,使其成为可查询的知识子系统,而非仅为人导航的结构化 artifacts。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24832 2026-04-29 cs.LG cs.AI 62%

On the Trainability of Masked Diffusion Language Models via Blockwise Locality

通过块级局部性训练掩码扩散语言模型

Yuxiang Wang, Yu Xiang, Baojian Zhou, Qifang Zhao, Keyue Jiang, Yanghua Xiao, Xiaoxiao Xu

机构 * Fudan University, Shanghai, China(复旦大学,上海,中国) Alibaba Group, China(阿里巴巴集团,中国)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究通过块级局部性改进掩码扩散语言模型,发现其在结构生成任务中稳定性不足,提出Jigsaw和Scatter模型提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.24116 2026-04-29 cs.CV cs.AI cs.LG 62%

AIDOVECL: AI-generated Dataset of Outpainted Vehicles for Eye-level Classification and Localization

AIDOVECL: 人工智能生成的车辆出图数据集用于眼级分类和定位

Amir Kazemi, Qurat ul ain Fatima, Volodymyr Kindratenko, Christopher W. Tessum

机构 * The Grainger College of Engineering, Department of Civil and Environmental Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校土木与环境工程系格拉inger工程学院) Center for Artificial Intelligence Innovation, National Center for Supercomputing Applications, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校人工智能创新中心国家超级计算应用中心) The Grainger College of Engineering, Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校格拉inger工程学院计算与数据科学学院) The Grainger College of Engineering, Department of Electrical and Computer Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校格拉inger工程学院电气与计算机工程系)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AIDOVECL数据集,通过出图技术生成多样化车辆图像,解决自动驾驶、城市规划等领域中缺乏眼级车辆图像的问题,提升检测性能并减少标注工作量。

Comments 34 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25796 2026-04-29 cs.AI 57%

StratFormer: Adaptive Opponent Modeling and Exploitation in Imperfect-Information Games

StratFormer:不完全信息游戏中的自适应对手建模与利用

Andy Caen, Mark H. M. Winands, Dennis J. N. J. Soemers

机构 * Department of Advanced Computing Sciences, Maastricht University(马斯特里赫特大学高级计算科学系)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 StratFormer通过双阶段课程学习,结合双轮标记和桶率特征,实现了对不完全信息游戏对手的建模与利用,其在Leduc Hold'em上表现出色,平均收益超过GTO。

Comments Accepted at Computers and Games 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28421 2026-04-29 quant-ph cs.AI 57%

Learning Unified Control of Intrinsic Nonlinear Spin Dynamics in Atomic Qudits for Magnetometry

在原子四态中学习统一控制内在非线性自旋动力学用于磁力计

C. Z. Cao, J. Z. Han, M. Xiong, M. Deng, L. Wang, X. Lv, M. Xue

机构 * College of Physics, Nanjing University of Aeronautics(南京航空航天大学物理学院) China Mobile (Suzhou) Software Technology Co., Ltd.(中国移动(苏州)软件技术有限公司) Shanghai Institute of Optics and Fine Mechanics(上海光学精密机械研究所) Chinese Academy of Sciences(中国科学院) Key Laboratory of Aerospace Information Sensing(航空航天信息感知重点实验室)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文通过强化学习在原子四态中统一控制内在非线性自旋动力学,实现磁力计的高灵敏度测量,突破标准量子限。

Comments (6+3+2.5) pages, (4+2) figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11100 2026-04-29 cs.AI 57%

ReCreate: Reasoning and Creating Domain Agents Driven by Experience

ReCreate:基于经验的推理与创造领域代理框架

Zhezheng Hao, Hong Wang, Jian Luo, Jianqing Zhang, Yuyan Zhou, Qiang Lin, Can Wang, Hande Dong, Jiawei Chen

机构 * Zhejiang University(浙江大学) Tencent(腾讯) Independent Researcher(独立研究者) Shanghai Jiao Tong University(上海交通大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文提出ReCreate框架,通过利用代理交互历史,自动创建和适应领域代理,优于人类设计和现有自动化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25534 2026-04-29 cs.AI 57%

Sample-efficient Neuro-symbolic Proximal Policy Optimization

样本高效神经符号近端策略优化

Simone Murari, Celeste Veronese, Daniele Meli

机构 * Dept. of Computer Science, University of Verona(威尼斯大学计算机科学系)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出神经符号扩展的近端策略优化方法,通过将简单实例中学习的部分逻辑策略规范用于指导更复杂的环境学习,提升了在稀疏奖励领域中的学习效率和回报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25477 2026-04-29 cs.CV cs.AI 57%

DDA-Thinker: Decoupled Dual-Atomic Reinforcement Learning for Reasoning-Driven Image Editing

DDA-Thinker: 解耦双原子强化学习用于推理驱动的图像编辑

Hanqing Yang, Qiang Zhou, Yongchao Du, Sashuai Zhou, Zhibin Wang, Jun Song, Tiezheng Ge, Cheng Yu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出DDA-Thinker框架,通过解耦的规划模块与固定生成模型,提升图像编辑中的推理能力,采用双原子强化学习分解反馈,结合可验证检查清单提升训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25376 2026-04-29 cs.CV cs.AI 57%

CoRE: Concept-Reasoning Expansion for Continual Brain Lesion Segmentation

CoRE:基于概念推理的连续脑病变分割

Qianqian Chen, Anglin Liu, Jingyang Zhang, Yudong Zhang

机构 * Southeast University, Nanjing, China(东南大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出CoRE框架,通过整合视觉特征与结构化概念,解决连续学习中容量限制和冗余参数增长问题,实现基于临床先验的模型进化。

详情

展开后加载摘要…

URL PDF HTML 收藏