arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 35436 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 35436 篇

2603.00876 2026-05-19 cs.AI cs.MA 83%

BioProAgent: Neuro-Symbolic Grounding for Constrained Scientific Planning

BioProAgent:用于受限科学规划的神经符号接地

Yuyang Liu, Jingya Wang, Liuzhenghao Lv, Yonghong Tian

机构 * School of AI for Science, Peking University(科学人工智能学院,北京大学) School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) School of Computer Science, Peking University(计算机科学学院,北京大学)

专题命中 规划决策 :planning(title,abstract);workflow(abstract);分类 cs.AI

AI总结 BioProAgent通过神经符号框架将概率规划锚定在确定性有限状态机中,解决复杂设备模式中的上下文瓶颈,提升物理执行的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03018 2026-05-19 cs.AI cs.RO 83%

Beyond Policy Optimization: A Data Curation Flywheel for Sparse-Reward Long-Horizon Planning

超越策略优化:一种数据整理飞轮用于稀疏奖励长周期规划

Yutong Wang, Pengliang Ji, Kaixin Li, Baolong Bi, Tao Feng, Guillaume Sartoretti

机构 * Department of Mechanical Engineering, National University of Singapore(新加坡国立大学机械工程系) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) School of Computing, National University of Singapore(新加坡国立大学计算机科学学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 规划决策 :planning(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出BPO框架,通过自改进的数据飞轮开发鲁棒推理模型,解决多轮代理规划中稀疏奖励长周期问题,实现高效推理和显著的token效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16481 2026-05-19 cs.CV cs.AI 83%

Visual Agentic Memory: Enabling Online Long Video Understanding via Online Indexing, Hierarchical Memory, and Agentic Retrieval

视觉代理记忆:通过在线索引、分层记忆和代理检索实现在线长视频理解

Aiden Yiliu Li, Nels Numan, Anthony Steed

机构 * University College London(伦敦大学学院)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出视觉代理记忆框架,通过在线索引、分层记忆和代理检索实现长视频理解,实验显示其在OVO-Bench和MM-Lifelong数据集上均取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16269 2026-05-19 cs.HC cs.AI 83%

Train the Trainers -- An Agentic AI Framework for Peer-Based Mental Health Support in Battlefield Environments

训练培训者——一种基于同伴的AI框架,用于战场环境中的同伴心理支持

Atmaram Yarlagadda, Eranga Bandara, Ross Gore, Anita H. Clayton, Preston Samuel, Christopher K. Rhea, Sachin Shetty, Ravi Mukkamala, Xueping Liang, Amin Hass, Abdul Rahman

机构 * McDonald Army Health Center(麦克唐纳陆军健康中心) Old Dominion University(老 Dominion 大学) Blanchfield Army Community Hospital(布莱恩菲尔德陆军社区医院) Department of Psychiatry and Neurobehavioral Sciences(精神病学与神经行为科学系) University of Virginia School of Medicine(弗吉尼亚大学医学院) Florida International University(佛罗里达国际大学) Accenture Technology Labs(埃森哲技术实验室)

专题命中 规划决策 :agentic(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出一种基于同伴的AI框架,利用AI代理提升战场环境下心理支持的效率,减少撤离需求并提高持续护理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15237 2026-05-18 cs.AR cs.AI 83%

A3D: Agentic AI flow for autonomous Accelerator Design

A3D: 基于代理AI的自主加速器设计流程

Abinand Nallathambi, Christopher Knight, Shantanu Ganguly, Wilfried Haensch, Anand Raghunathan

机构 * Purdue University(普渡大学) Argonne National Laboratory(阿贡国家实验室) University of Chicago(芝加哥大学)

专题命中 规划决策 :agentic(title,abstract);planning(abstract);分类 cs.AI

AI总结 A3D通过代理AI实现端到端的硬件加速器设计自动化,自动分析工作负载、识别性能瓶颈、生成微架构并探索速度-面积权衡空间,利用LLM和EDA工具提升复杂应用的加速器设计效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29665 2026-05-15 cs.CL 83%

Near-Miss: Latent Policy Failure Detection in Agentic Workflows

近似失误:代理工作流中的潜在策略失败检测

Ella Rabinovich, David Boaz, Naama Zwerdling, Ateret Anaby-Tavor

机构 * IBM Research(IBM研究院)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 本文提出一种新指标,用于检测代理对话轨迹中的潜在策略失败,通过分析代理工具调用决策的充分性,揭示当前评估方法的盲点。

Comments GEM@ACL2026, 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14051 2026-05-15 cs.AI 83%

SPIN: Structural LLM Planning via Iterative Navigation for Industrial Tasks

SPIN:通过迭代导航进行工业任务的结构LLM规划

Yusuke Ozaki, Dhaval Patel

机构 * University at Albany(阿尔巴马大学) IBM(国际商业机器公司) Kwansei Gakuin University(关西大学)

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.AI

AI总结 SPIN通过结合验证的有向无环图规划与前缀执行控制,减少任务执行次数并提高完成率,适用于工业任务规划。

Comments 31 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13716 2026-05-14 cs.SE cs.MA 83%

SkillOps: Managing LLM Agent Skill Libraries as Self-Maintaining Software Ecosystems

SkillOps:将LLM代理技能库视为自维护的软件生态系统进行管理

Hongji Pu, Xinyuan Song, Liang Zhao

专题命中 规划决策 :agent(title,abstract);planning(abstract);分类 cs.SE

AI总结 SkillOps通过自维护软件生态系统方法管理LLM代理技能库,解决技能库中的技术债务问题,提升技能检索、组合和执行效率,实验表明其在ALFWorld上任务成功率高达79.5%。

Comments 23 pages, 9 figures. Submitted to NeurIPS 2026. Code is available at https://github.com/Hik289/SkillOps.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12916 2026-05-14 cs.MA cs.LG 83%

SHM-Agents: A Generalist-Specialist Integrated Agent System for Structural Health Monitoring

SHM-Agents:一种用于结构健康监测的通用-专家集成代理系统

Yuequan Bao, Xing Li, Huabin Sun, Dawei Liu, Yuxuan Tian, Haiyang Hu

机构 * Key Lab of Smart Prevention and Mitigation of Civil Engineering Disasters of the Ministry of Industry and Information Technology, Harbin Institute of Technology, Harbin(工业和信息化部智能防灾减灾重点实验室,哈尔滨工业大学,哈尔滨) Key Lab of Structures Dynamic Behavior and Control of the Ministry of Education, Harbin Institute of Technology, Harbin(教育部结构动态行为与控制重点实验室,哈尔滨工业大学,哈尔滨) School of Civil Engineering, Harbin Institute of Technology, Harbin(哈尔滨工业大学土木工程学院)

专题命中 规划决策 :agent(title,abstract);planning(abstract);分类 cs.LG

AI总结 本文提出SHM-Agents,结合大语言模型的推理能力与专用算法的问题解决能力,实现结构健康监测任务的端到端执行,提升部署效率与系统扩展性。

Comments 19 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07433 2026-05-14 cs.LG cs.CV 83%

Data Agent: Learning to Select Data via End-to-End Dynamic Optimization

数据代理:通过端到端动态优化学习数据选择

Suorong Yang, Fangjian Su, Hai Gan, Ziqi Ye, Jie Li, Baile Xu, Furao Shen, Soujanya Poria

机构 * National University of Singapore(新加坡国立大学) Nanjing University(南京大学) Nanyang Technological University(南洋理工大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.LG

AI总结 本文提出数据代理框架,通过端到端动态优化解决数据选择问题,提升训练效率并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12004 2026-05-13 cs.CL 83%

Learning Agentic Policy from Action Guidance

从动作指导学习代理策略

Yuxiang Ji, Zengbin Wang, Yong Wang, Shidong Yang, Ziyu Ma, Guanhua Chen, Zonghua Sun, Liaoni Wu, Xiangxiang Chu

机构 * Xiamen University(厦门大学) AMAP, Alibaba Group(阿里云实验室,阿里巴巴集团) Southern University of Science and Technology(南方科技大学)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 本文提出ActGuide-RL方法,通过利用日常人类交互生成的动作数据,减少对昂贵迭代监督微调的依赖,提升代理强化学习在搜索代理基准上的性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08978 2026-05-13 cs.AI 83%

Learning to Explore: Scaling Agentic Reasoning via Exploration-Aware Policy Optimization

学习探索:通过探索意识策略优化实现代理推理的扩展

Xingyuan Hua, Sheng Yue, Ju Ren

机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) School of Cyber Science and Technology, Sun Yat-sen University Shenzhen Campus, Shenzhen, China(中山大学深圳校区信息科学与技术学院) State Key Laboratory of Internet Architecture, Tsinghua University, Beijing, China(清华大学互联网体系结构国家重点实验室)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出一种探索意识强化学习框架,使LLM代理在不确定性高时主动探索,通过细粒度奖励函数和探索意识分组机制提升任务完成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11578 2026-05-12 cs.AI 83%

Efficient LLM Collaboration via Planning

通过规划实现高效的LLM协作

Byeongchan Lee, Jonghoon Lee, Dongyoung Kim, Jaehyung Kim, Kyungjoon Park, Dongjun Lee, Jinwoo Shin

机构 * KAIST(韩国科学技术院) Yonsei University(延世大学)

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出COPE框架,通过规划模型与执行模型的协作,提升小模型和大模型在复杂任务中的性能,同时显著降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10074 2026-05-12 cs.CR cs.SE 83%

Agentic Fuzzing: Opportunities and Challenges

代理模糊测试:机遇与挑战

Junyoung Park, Insu Yun

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.SE

AI总结 本文提出代理模糊测试方法,通过历史漏洞引导深度代理进行推理,发现逻辑漏洞变种。AFuzz在V8引擎发现40个漏洞,获35000美元奖金,并被分配两个CVE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09879 2026-05-12 cs.AI 83%

M2A: Synergizing Mathematical and Agentic Reasoning in Large Language Models

M2A:在大型语言模型中协同数学与代理推理

Junjian Wang, Xin Zhou, Qiran Xu, Kun Zhan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Li Auto Inc.(Li Auto公司)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出M2A框架,通过模型融合协同数学与代理推理,提升多任务学习下的推理稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08526 2026-05-12 cs.LG 83%

Skill-CMIB: Multimodal Agent Skill for Consistent Action via Conditional Multimodal Information Bottleneck

Skill-CMIB: 多模态代理技能用于通过条件多模态信息瓶颈实现一致行动

Zihan Huang, Junda Wu, Tong Yu, Qianqi Yan, Rohan Surana, Uttaran Bhattacharya, Lina Yao, Xin Eric Wang, Julian McAuley

机构 * UC San Diego(UC圣地亚哥大学) Adobe Research(Adobe研究院) UC Santa Barbara(UC圣芭芭拉大学) University of New South Wales(新南威尔士大学)

专题命中 规划决策 :agent(title,abstract);planning(abstract);分类 cs.LG

AI总结 本文提出Skill-CMIB方法,通过条件多模态信息瓶颈构建多模态技能,解决多模态环境下代理执行不一致的问题,提升执行稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08478 2026-05-12 cs.LG 83%

When Independent Sampling Outperforms Agentic Reasoning

独立采样优于代理推理

Yihe Dong, Boris Shigida

机构 * Princeton University(普林斯顿大学)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.LG

AI总结 本文研究在固定预算下如何分配推理时间计算以提高编程竞赛表现,发现独立采样在准确率与成本、查询数的权衡上优于代理推理,且在资源受限条件下独立探索更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01507 2026-05-12 cs.AI 83%

MILD: Mediator Agent System with Bidirectional Perception and Multi-Layered Alignment for Human-Vehicle Collaboration

MILD:具有双向感知和多层对齐的中介代理系统用于人车协作

Jiyao Wang, Yunbiao Wang, Yubo Jiao, Xiao Yang, Dengbo He, Sasan Jafarnejad, Luis Miranda-Moreno, Raphael Frank, Jiangbo Yu

机构 * Department of Civil Engineering, McGill University(麦吉尔大学土木工程系) Systems Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)系统中心) Interdisciplinary Centre for Security, Reliability and Trust, University of Luxembourg(卢森堡大学安全、可靠与信任跨学科中心)

专题命中 规划决策 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出MILD系统,通过双向感知和多层对齐提升人车协作效率,采用ECPO算法确保策略符合安全规范和人类价值观,实验证明其在感知准确性和策略质量上优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18486 2026-05-12 cs.CV cs.CL cs.RO 83%

Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation

小米OneVL:基于视觉-语言解释的一步潜在推理与规划

Jinghui Lu, Jiayi Guan, Zhijian Huang, Jinlong Li, Guang Li, Lingdong Kong, Yingyan Li, Han Wang, Shaoqing Xu, Yuechen Luo, Fang Li, Chenxu Dang, Junli Wang, Tao Xu, Jing Wu, Jianhua Wu, Xiaoshuai Hao, Wen Zhang, Tianyi Jiang, Lingfeng Zhang, Lei Zhou, Yingbo Tang, Jie Wang, Yinfeng Gao, Xizhou Bu, Haochen Tian, Yihang Qiu, Feiyang Jia, Lin Liu, Yigu Ge, Hanbing Li, Yuannan Shen, Jianwei Cui, Hongwei Xie, Bing Wang, Haiyang Sun, Jingwei Zhao, Jiahui Huang, Pei Liu, Zeyu Zhu, Yuncheng Jiang, Zibin Guo, Chuhong Gong, Hanchao Leng, Kun Ma, Naiyan Wang, Guang Chen, Kuiyuan Yang, Hangjun Ye, Long Chen

机构 * Xiaomi Embodied Intelligence Team(小米具身智能团队)

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.CL

AI总结 OneVL通过双重辅助解码器监督的紧凑潜在标记,实现了视觉-语言解释的一步潜在推理与规划,首次在延迟条件下超越了显式推理方法。

Comments Technical Report; 49 pages, 22 figures, 10 tables; Project Page at https://xiaomi-embodied-intelligence.github.io/OneVL GitHub at https://github.com/xiaomi-research/onevl

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07768 2026-05-11 eess.SY cs.LG cs.SY 83%

Interactive Trajectory Planning with Learning-based Distributionally Robust Model Predictive Control and Markov Systems

基于学习的分布鲁棒模型预测控制与马尔可夫系统的交互轨迹规划

Erik Börve, Nikolce Murgovski, Morteza Haghir Chehreghani, Leo Laine

机构 * Chalmers University of Technology(查尔姆斯理工大学) Volvo Group Trucks Technology(沃尔沃集团卡车技术)

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.LG

AI总结 本文研究了在周围智能体决策不确定性下的交互轨迹规划问题,提出结合PAC学习与分布鲁棒优化的DR-MPC框架,通过样本数量实现鲁棒MPC与随机MPC之间的插值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06601 2026-05-08 cs.CR cs.AI 83%

Patch2Vuln: Agentic Reconstruction of Vulnerabilities from Linux Distribution Binary Patches

Patch2Vuln: 基于Linux发行版二进制补丁的漏洞重构

Isaac David, Arthur Gervais

机构 * University College London(伦敦大学学院)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文探讨利用语言模型代理从Linux发行版二进制补丁中重构漏洞,提出Patch2Vuln流程,通过提取ELF对、差异分析和代理审计,验证了二进制补丁中漏洞重构的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22382 2026-05-08 cs.LG 83%

Purely Agent-Driven Black-Box Optimization for Biological Design

纯粹的基于代理的黑盒优化用于生物设计

Natalie Maus, Yimeng Zeng, Haydn Thomas Jones, Yining Huang, Gaurav Ng Goel, Alden Rose, Kyurae Kim, Hyun-Su Lee, Marcelo Der Torossian Torres, Fangping Wan, Cesar de la Fuente-Nunez, Mark Yatskar, Osbert Bastani, Jacob R. Gardner

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 规划决策 :agent(title,abstract);agentic(abstract);分类 cs.LG

AI总结 本文提出PABLO框架,通过基于语言的代理方法在生物设计中实现高效黑盒优化,提升样本效率和目标值,展示其在抗微生物肽优化中的卓越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01293 2026-05-05 cs.AI 83%

Lifting Traces to Logic: Programmatic Skill Induction with Neuro-Symbolic Learning for Long-Horizon Agentic Tasks

将轨迹提升到逻辑:基于神经符号学习的程序化技能诱导用于长视界代理任务

Jie-Jing Shao, Haiyan Yin, Yueming Lyu, Xingrui Yu, Lan-Zhe Guo, Ivor Tsang, James Kwok, Yu-Feng Li

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学) School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学) School of Intelligence Science and Technology, Nanjing University, China(智能科学与技术学院,南京大学) Centre for Frontier AI Research(前沿人工智能研究中心) Institute of High Performance Computing, Agency for Science, Technology and Research, Singapore(高性能计算研究所,新加坡科技研究局) Department of Computer Science and Engineering, Hong Kong University of Science and Technology, China(香港科学与技术大学计算机科学与工程系)

专题命中 规划决策 :agentic(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出NSI框架,通过将交互轨迹提升为模块化逻辑 grounded 程序,使代理能从少量示例中归纳技能并适应新目标,优于现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00071 2026-05-04 cs.CR cs.AI cs.CE cs.MA 83%

Compliance-Aware Agentic Payments on Stablecoin Rails

合规意识的代理支付系统在稳定币轨道上

Kenneth See, Xue Wen Tan

机构 * Monetary Authority of Singapore(新加坡金融管理局) Infocomm Media Development Authority(信息通信媒体发展局)

专题命中 规划决策 :agentic(title,abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出一种合规意识的代理支付架构,结合签名基支付授权与可编程合规性,通过链上护栏实现低摩擦结算和交易证明记录。

Comments Demo Paper Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25120 2026-05-04 cs.CL 83%

SCOPE:Planning for Hybrid Querying over Clinical Trial Data

SCOPE:面向临床试验数据的混合查询规划

Suparno Roy Chowdhury, Manan Roy Choudhury, Tejas Anvekar, Muhammad Ali Khan, Kaneez Zahra Rubab Khakwani, Mohamad Bassam Sonbol, Irbaz Bin Riaz, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) Mayo Clinic(梅奥诊所)

专题命中 规划决策 :planning(title,abstract);agentic(abstract);分类 cs.CL

AI总结 本文提出SCOPE框架,通过多LLM规划分解任务,提升临床试验数据的推理准确性与效率,解决隐含属性提取问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12019 2026-04-30 cs.AI cs.HC 83%

A Framework for Longitudinal Health AI Agents

面向长期健康AI代理的框架

Georgianna Lin, Rencong Jiang, Noémie Elhadad, Xuhai "Orson" Xu

机构 * Columbia University, Biomedical Informatics(哥伦比亚大学生物医学信息学) Columbia University, Computer Science(哥伦比亚大学计算机科学)

专题命中 规划决策 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出一个多层框架,用于支持长期健康交互的AI代理,强调适应性、连贯性、连续性和自主性,通过案例展示如何维持有意义的参与并支持个性化决策。

Comments 10 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15262 2026-04-30 cs.AI 83%

Probe-then-Plan: Environment-Aware Planning for Industrial E-commerce Search

探测-然后规划:面向工业电商搜索的环境感知规划

Mengxiang Chen, Zhouwei Zhai, Jin Li

机构 * JD.com Beijing China(京东北京中国)

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出环境感知搜索规划(EASP),通过探测-规划机制解决电商搜索中盲点与延迟的矛盾,通过离线数据合成、规划器训练和在线服务适应性路由提升搜索相关召回率和UCVR、GMV。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14438 2026-04-30 cs.CL 83%

WebAggregator: Enhancing Compositional Reasoning Capabilities of Deep Research Agent Foundation Models

WebAggregator:增强深度研究代理基础模型的组合推理能力

Rui Wang, Ce Zhang, Jun-Yu Ma, Jianshu Zhang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Zhisong Zhang, Hongming Zhang, Haitao Mi, Dong Yu, Kam-Fai Wong

机构 * MoE Lab, The Chinese University of Hong Kong(莫埃实验室,香港中文大学) Tencent AI Lab(腾讯AI实验室)

专题命中 规划决策 :agent(title,abstract);agentic(abstract);分类 cs.CL

AI总结 本文提出WebAggregator数据合成管道,通过主动探索和组合逻辑提案,提升深度研究代理的组合推理能力,并在多个基准测试中超越GPT-4.1和Claude-3.7-Sonnet。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19839 2026-04-23 cs.CV cs.AI 83%

Environmental Understanding Vision-Language Model for Embodied Agent

面向具身智能体的环境理解视觉-语言模型

Jinsik Bang, Jaeyeon Bae, Donggyu Lee, Siyeol Jung, Taehwan Kim

机构 * UNIST(全南国立大学)

专题命中 规划决策 :agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出EUEA框架,通过细调四项核心技能提升具身智能体的环境理解能力,结合恢复步骤和GRPO阶段提升任务执行效果,实验显示在ALFRED任务中性能显著优于行为克隆基线。

Comments CVPR Findings 2026, Project Page: https://eu-ea.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08712 2026-04-23 cs.AI 83%

Model Space Reasoning as Search in Feedback Space for Planning Domain Generation

模型空间推理作为反馈空间中的搜索用于规划领域生成

James Oswald, Daniel Obolensky, Volodymyr Varha, Vasilije Dragovic, Kavitha Srinivas, Harsha Kokel, Michael Katz, Shirin Sohrabi

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) IBM Research(IBM研究院)

专题命中 规划决策 :planning(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文探讨了通过反馈空间中的启发式搜索优化规划领域生成的质量,利用符号反馈机制提升生成效果。

Comments Accepted at ICLR 2026 the 2nd Workshop on World Models: Understanding, Modelling and Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏