arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 909 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 909 篇

2603.17418 2026-07-07 eess.SY cs.SY 版本更新 85%

PowerDAG: Supervisory Agentic AI System for Automating Distribution Grid Analysis

PowerDAG:用于自动化配电网络分析的可靠代理AI系统

Emmanuel O. Badmus, Amritanshu Pandey

专题命中 规划决策 :agentic(title,abstract);agent(abstract);planning(abstract)

AI总结 本文提出PowerDAG,一种用于自动化复杂配电网络分析的代理AI系统,通过自适应检索和即时监督机制提升可靠性,实验显示其在未见查询上表现优异,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09171 2026-06-10 cs.LG cs.AI cs.CL 版本更新 85%

Fact-Augmented Lookahead Planning for LLM Agents

面向LLM智能体的事实增强前瞻规划

Samuel Holt, Max Ruiz Luyten, Thomas Pouplin, Mihaela van der Schaar

机构 * University of Cambridge(剑桥大学)

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出LWM-Planner框架,通过从轨迹中提取关键事实并用于条件化动作提议、世界模型模拟和状态值估计,实现无需参数更新的在线规划改进,在多个环境上优于ReAct/Reflexion和纯搜索基线。

Comments Accepted at the 29th International Conference on Artificial Intelligence and Statistics (AISTATS 2026). Camera-ready version. 9-page main text plus appendices (63 pages total), 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10048 2026-06-09 cs.IR 版本更新 85%

HARPO: Hierarchical Agentic Reasoning for User-Aligned Conversational Recommendation

HARPO:面向用户对齐的对话推荐的分层代理推理

Subham Raj, Aman Vaibhav Jha, Mayank Anand, Sriparna Saha

专题命中 规划决策 :agentic(title,abstract);agent(abstract);multi-agent(abstract)

AI总结 HARPO通过分层代理推理框架优化多维推荐质量,结合上下文依赖的偏好学习、 deliberative树搜索和领域无关的推理抽象,提升推荐质量与用户对齐性。

Comments Accepted at the Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13278 2026-06-08 cs.CL cs.LG 版本更新 84%

AutoTool: Dynamic Tool Selection and Integration for Agentic Reasoning

AutoTool: 面向智能体推理的动态工具选择与集成

Jiaru Zou, Ling Yang, Yunzhe Qi, Sirui Chen, Mengting Ai, Ke Shen, Jingrui He, Mengdi Wang

机构 * Nanyang Technological University(南洋理工大学)

专题命中 规划决策 :agentic(title,abstract);tool use(abstract);分类 cs.CL、cs.LG

AI总结 提出AutoTool框架,通过双阶段优化(SFT+RL轨迹稳定化和KL正则化Plackett-Luce排序)使大语言模型具备动态工具选择能力,在数学、科学、代码和多模态推理等任务上平均提升6.4%-7.7%。

Comments ICML2026; Best Paper Award at ICCV 2025 Workshop on Multi-Modal Reasoning for Agentic Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20891 2026-07-31 cs.AI 版本更新 84%

Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions

深度研究可靠吗?误导性知识会导致错误结论

Pengyu Zhu, Lijun Li, Longju Yang, Sen Su, Jing Shao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 规划决策 :agent(summary_cn,abstract);planning(abstract);分类 cs.AI

AI总结 研究深度研究代理在开放信息环境中的可靠性,引入MisKnow-Agent框架生成误导性实例,通过实验发现其易因误导知识得出错误结论,验证与实际证据使用脱节,评估防御措施效果,强调需提升模型和框架层面的证据验证及纠正能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03924 2026-08-13 cs.CL cs.AI 版本更新 84%

Uncertainty as a Planning Signal: Multi-Turn Decision Making for Goal-Oriented Conversation

不确定性作为规划信号:面向目标导向对话的多轮决策

Xinyi Ling, Ye Liu, Reza Averly, Xia Ning

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出CUP框架,通过结合语言模型与结构化规划,解决目标导向对话中不确定性与信息获取之间的平衡问题,提升对话成功率并减少交互轮次。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14574 2026-08-11 cs.CL cs.AI 版本更新 84%

SIMMER: Benchmarking Latent Failures in LLM Executable Planning with a World Model

SIMMER: 基于世界模型评估LLM可执行规划中的潜在故障

Xiaoxin Lu, Ranran Haoran Zhang, Rui Zhang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 规划决策 :planning(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.CL

AI总结 提出SIMMER基准,通过人工策划的厨房领域符号世界模型,评估LLM规划中的潜在故障;实验发现前沿模型最多17%无错误计划,56%含潜在故障,多数不可逆;反事实预演可减少72%潜在故障和75%不可逆案例。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10739 2026-08-04 cs.CL cs.AI 版本更新 84%

Intern-S1-MO: Long-horizon Reasoning Agent for Olympiad?Level Mathematical Problem Solving

长周期推理代理用于竞赛级数学问题求解

Yuzhe Gu, Songyang Gao, Zijian Wu, Lingkai Kong, Wenwei Zhang, Zhongrui Cai, Fan Zheng, Tianyou Ma, Junhao Shen, Haiteng Zhao, Duanyang Zhang, Huilun Zhang, Kuikun Liu, Chengqi Lyu, Yanhui Duan, Chiyu Chen, Ningsheng Ma, Jianfei Gao, Han Lyu, Dahua Lin, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) MMLab The Chinese University of Hong Kong(香港中文大学) ICMAT Spanish National Research Council(西班牙国家科研 council) The High School Affiliated to Renmin University of China(中国人民大学附属高中) Ren Hui Academy of Beijing(北京润辉学院)

专题命中 规划决策 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Intern-S1-MO,通过多轮分层推理和OREAL-H框架,突破IMO级数学问题的上下文限制,实现26/35分的优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12384 2026-08-03 cs.LG cs.AI 版本更新 84%

APPO: Agentic Procedural Policy Optimization

APPO: 智能体程序策略优化

Xucong Wang, Ziyu Ma, Yong Wang, Yuxiang Ji, Shidong Yang, Guanhua Chen, Pengkun Wang, Xiangxiang Chu

机构 * University of Science and Technology of China(中国科学技术大学) AMAP, Alibaba Group(阿里巴巴集团高德地图) Southern University of Science and Technology(南方科技大学)

专题命中 规划决策 :agentic(title,abstract);tool-use(abstract);分类 cs.AI、cs.LG

AI总结 提出APPO方法,通过细粒度分支和程序级优势缩放改进智能体强化学习的信用分配,在13个基准上平均提升近4个点。

Comments 25 pages, including 14 pages of main text and 11 pages of appendix; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21005 2026-07-17 cs.AI cs.CL 版本更新 84%

Building Agent Harnesses for Scientific Curation from Multimodal Sources

构建用于多模态来源科学数据提取的智能体框架

Sheng Zhang, Qin Liu, Renqian Luo, Shufang Xie, Reuben Tan, Sean Hayes, Gregory Bryman, Wendong Ge, Ruilian Zhang, Oluwaseun Egbelowo, Kelly Yee, Hoifung Poon

机构 * Microsoft Research(微软研究院) University of California, Davis(加州大学戴维斯分校) Merck & Co., Inc., Rahway, NJ, USA(默克公司(美国新泽西州拉威))

专题命中 规划决策 :agent(title,abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 提出Beaver框架,通过任务分解、多模态证据工具和可追溯性,将科学文献中的结构化信息提取转化为可审计的工作流,在GRAS指标上比前沿智能体提升23个绝对百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13213 2026-07-08 cs.AI cs.HC cs.LG 版本更新 84%

Agentic AI for Commercial Insurance Underwriting with Adversarial Self-Critique

用于商业保险承保的具有对抗性自我批评的智能体人工智能

Joyjit Roy, Samaresh Kumar Singh

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 研究针对商业保险承保中AI可靠性问题,提出含对抗性自我批评机制的人在回路智能体系统,开发故障模式分类法。实验表明该机制降低幻觉率、提高准确率,还确保人类权威,为受监管领域安全部署AI提供模型。

Comments 9 pages, 8 figuers, 6 tables, Presented at 9th International Conference on Modern Computing, Networking and Applications (MCNA2026)

Journal ref 2026 International Conference on Modern Computing, Networking and Applications (MCNA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20209 2026-06-23 cs.LG cs.CL 版本更新 84%

Spark: Strategic Policy-Aware Exploration via Dynamic Branching for Long-Horizon Agentic Learning

Spark: 通过动态分支进行战略性策略感知探索以实现长周期智能体学习

Jinyang Wu, Shuo Yang, Changpeng Yang, Yuhao Shen, Shuai Zhang, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 规划决策 :agentic(title);agent(abstract);planning(abstract);分类 cs.CL、cs.LG

AI总结 提出Spark框架,通过关键状态动态分支实现资源高效探索,在长周期任务中以更少样本取得更高成功率和泛化能力。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11682 2026-06-16 cs.AI cs.LG 版本更新 84%

MedAI: Evaluating TxAgent's Therapeutic Agentic Reasoning in the NeurIPS CURE-Bench Competition

MedAI: 评估 TxAgent 在 NeurIPS CURE-Bench 竞赛中的治疗性智能推理

Tim Cofala, Christian Kalfar, Jingge Xiao, Johanna Schrader, Michelle Tang, Wolfgang Nejdl

机构 * L3S Research Center(L3S研究中心)

专题命中 规划决策 :agentic(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文介绍 TxAgent,一种通过迭代检索增强生成和统一生物医学工具集进行治疗决策的智能AI方法,并在CURE-Bench竞赛中评估其推理质量,通过改进工具检索策略提升性能,荣获开放科学卓越奖。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06493 2026-06-10 cs.RO cs.AI cs.LG 版本更新 84%

HANDOFF: Humanoid Agentic Task-Space Whole-Body Control via Distilled Complementary Teachers

HANDOFF: 通过蒸馏互补教师实现人形机器人任务空间全身控制

Lizhi Yang, Junheng Li, Nehar Poddar, Yiling Hou, Gio Huh, Robert Griffin, Georgia Gkioxari, Aaron Ames

机构 * California Institute of Technology(加州理工学院) The Institute for Human & Machine Cognition(人机认知研究院)

专题命中 规划决策 :agentic(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 提出HANDOFF框架,通过多教师KL蒸馏和上下文门控机制,将全身运动跟踪、行走和跌倒恢复三个专家策略融合为混合专家学生策略,实现基于紧凑显式接口的全身控制,在Unitree G1上达到先进的速度跟踪性能并扩展了操作工作空间。

Comments 22 pages, 9 figures, Project page: https://lzyang2000.github.io/HANDOFF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03292 2026-06-09 cs.CL cs.AI cs.IR 版本更新 84%

From Conflict to Consensus: Boosting Medical Reasoning via Multi-Round Agentic RAG

从冲突到共识:通过多轮代理RAG提升医疗推理

Wenhao Wu, Zhentao Tang, Yafu Li, Shixiong Kai, Mingxuan Yuan, Zhenhong Sun, Chunlin Chen, Zhi Wang

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出MA-RAG框架,通过多轮代理循环迭代优化外部证据和内部推理历史,提升医疗复杂推理能力,实验显示在7个医疗问答基准上表现优于现有方法。

Comments 27 pages, 8 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10429 2026-08-03 cs.MA cs.AI 版本更新 84%

AIvilization v0: Toward Large-Scale Artificial Social Simulation with a Unified Agent Architecture and Adaptive Agent Profiles

AIvilization v0:迈向大规模人工社会模拟的统一代理架构与自适应代理档案

Wenkai Fan, Shurui Zhang, Xiaolong Wang, Haowei Yang, Tsz Wai Chan, Xingyan Chen, Junquan Bi, Zirui Zhou, Jia Liu, Kani Chen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Bauhinia AI

专题命中 规划决策 :agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 AIvilization v0通过统一代理架构和自适应代理档案,实现大规模人工社会模拟,解决目标稳定性与反应正确性矛盾,支持长周期自主性和多目标环境下的稳健性。

Comments v2: major revision. Agent architecture and environment consolidated into self-contained sections; new problem-setting section formalizing the asynchronous event model; evaluation reorganized by experiment with results reported alongside each protocol; added action-simulator audit, and human-steering analyses; other sections rewritten

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15867 2026-07-21 hep-ph hep-ex 版本更新 83%

HEPTAPOD: Orchestrating High Energy Physics Workflows Towards Autonomous Agency

HEPTAPOD:编排高能物理工作流程以实现自主智能体

Tony Menzo, Alexander Roman, Sergei Gleyzer, Konstantin Matchev, George T. Fleming, Stefan Höche, Stephen Mrenna, Prasanth Shyamsundar

专题命中 规划决策 :agent(abstract);tool use(abstract);planning(abstract);workflow(abstract)

AI总结 研究针对高能物理工作流程,介绍HEPTAPOD编排框架,能集成外部大语言模型,使其与特定领域工具交互构建管理HEP管道,通过案例展示其能力,为高能物理中人工参与及智能体辅助工作流程奠定基础。

Comments 47 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11753 2026-08-17 cs.CL 版本更新 83%

Agentic Aggregation for Parallel Scaling of Long-Horizon Agentic Tasks

代理聚合用于长周期代理任务的并行扩展

Yoonsang Lee, Howard Yen, Xi Ye, Danqi Chen

机构 * Princeton Language and Intelligence, Princeton University(普林斯顿大学语言与智能实验室)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 本文提出AggAgent,通过将并行轨迹视为环境,有效解决长周期代理任务中轨迹信息聚合问题,提升性能并降低开销。

Comments COLM 2026. Code is available at this https URL (https://github.com/princeton-pli/AggAgent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09508 2026-08-17 cs.CV cs.AI 版本更新 83%

VISOR: Agentic Visual Retrieval-Augmented Generation via Iterative Search and Over-horizon Reasoning

VISOR: 通过迭代搜索和超视距推理实现基于视觉检索的增强生成

Yucheng Shen, Jiulong Wu, Jizhou Huang, Dawei Yin, Lingyong Yan, Min Cao

机构 * Soochow University(苏州大学) Baidu Inc.(百度公司)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 VISOR通过结构化证据空间和动态轨迹机制解决多步推理中的视觉证据稀疏和搜索漂移问题,实现高效长视距视觉推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08322 2026-08-14 cs.AI cs.HC math.CO 版本更新 83%

Agentic Neurosymbolic Collaboration for Mathematical Discovery: A Case Study in Combinatorial Design

代理神经符号协作用于数学发现:组合设计的一个案例研究

Hai Xia, Carla P. Gomes, Bart Selman, Stefan Szeider

机构 * Algorithms and Complexity Group, TU Wien(算法与复杂性组,维也纳技术大学) Department of Computer Science, Cornell University(计算机科学系,康奈尔大学)

专题命中 规划决策 :agentic(title);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文通过代理神经符号协作方法,在组合设计理论中发现了一个新的紧下界,展示了人类与AI协作在数学发现中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17045 2026-08-14 cs.CL 版本更新 83%

Large Language Models Persuade Without Planning Theory of Mind

大语言模型无需规划即可说服理论之心理论

Jared Moore, Rasmus Overmark, Ned Cooper, Beba Cibralic, Nick Haber, Cameron R. Jones

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.CL

AI总结 大语言模型通过战略性揭示信息说服目标,无需显式理论之心推理,实验显示其在说服任务中表现优于人类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09790 2026-08-12 cs.AI cs.MA cs.SI 版本更新 83%

CARD: Controlled Agentic Reddit Discussions for Credit Card Simulation

CARD:用于信用卡模拟的受控智能体Reddit讨论框架

Yaoning Yu, Kai-Min Chang, Ye Yu, Yi-Chia Wang, Haojing Luo, Haohan Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) U.S. Bank(美国银行) Stanford University(斯坦福大学)

专题命中 规划决策 :agentic(title,abstract_cn);planning(abstract);分类 cs.AI

AI总结 本研究提出CARD框架,通过规划器、生成器与校准循环,结合多维度控制项生成逼真信用卡讨论线程,经多指标评估,其效果优于多种LLM模拟基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09096 2026-08-12 cs.CL 版本更新 83%

Evo-Bench: Can Language Models Improve Agent Harness?

Evo-Bench:语言模型能否改进智能体框架?

Lisheng Huang, Chen Yang, Hao Zhou, Huatong Song, Zongchao Chen, Ran Le, Yang Song, Wayne Xin Zhao, Tao Zhang

专题命中 规划决策 :agent(title,abstract);autonomous agent(abstract);分类 cs.CL

AI总结 本研究推出首个智能体框架进化基准Evo-Bench,评估语言模型的自主框架优化能力,发现其在通用、搜索任务中优于人工框架,在办公任务中表现不佳,且合成框架可迁移提升各类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03031 2026-08-12 cs.AI 版本更新 83%

CastFSR: A Fast--Slow--Reflect Agentic Reasoning Framework for Context-Aware Time Series Forecasting

CastFSR:用于上下文感知时间序列预测的快慢反思智能体推理框架

Xiaoyu Tao, Mingyue Cheng, Bokai Pan, Chuang Jiang, Huanjian Zhang, Tian Gao, Yaguo Liu, Qi Liu, Enhong Chen

专题命中 规划决策 :agentic(title,abstract);workflow(abstract);分类 cs.AI

AI总结 本研究提出CastFSR智能体框架,将上下文感知时间序列预测建模为快慢反思工作流,通过实验证明其在公共数据集上的表现优于代表性基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24850 2026-08-12 cs.IR cs.LG 版本更新 83%

SearchArt: Training Long-Horizon Search Agent with Scalable Synthetic and Verified Task

SearchArt:使用可扩展的合成和经过验证的任务训练长视野搜索代理

Lang Mei, Xiaohan Yu, Chong Chen, Liyan Liu, Xiangnan Chen, Jinchao Ma, Chao Feng, Li Huang, Siyu Mo, Sichen Kang, Yunkun Xu, Zhihan Yang, Zhujun Xue, Jingren Zhang, Qing He, Yingdi Huang, Hao Jiang, Ziao Ma, Zewei Pan, Minhao Sun, Zhuo Tao, Jinzhao Xiao, Gangtao Xin, Huanyao Zhang, Wenjian Zhang, Jiangshan Zhang, Guojie Zhu, Fangzhou Zou, Jiaxin Mao, Wentao Zhang

专题命中 规划决策 :agent(title);tool-use(abstract);planning(abstract);分类 cs.LG

AI总结 针对训练长视野搜索代理的挑战,SearchArt提出通过验证驱动任务合成及多阶段训练管道的框架,构建大规模数据集并验证数据可靠性,经此训练的代理在多基准测试中表现出色,参数少却成绩优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05144 2026-08-11 cs.AI 版本更新 83%

Argus: A General-Purpose Agentic Reasoning Runtime for Long-Horizon Tasks

Argus:面向长程推理的通用智能体运行时

Boxiu Li, Zimo Wen, Yijia Fan, Chuan Wen, Fan Yang, Hangxi Guo, Jiaao Wu, Jiachen Zhang, Junxiang Lei, Mukai Li, Ruize Tang, Runjing Gu, Shibo Hu, Sihan Chen, Sufeng Guo, Wanbo Zhang, Xian Zhang, Xiaoyu Chen, Xuanhe Zhou, Xuyao Huang, Yifei Gao, Yifei Shen, Yilin Chen, Yuheng Wu, Yuzhe Zhang, Zelong Zhao, Zhijie Deng

机构 * Microsoft(微软公司) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Nanjing University(南京大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学) Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Donghua University(东华大学)

专题命中 规划决策 :agentic(title,abstract);workflow(abstract);分类 cs.AI

AI总结 Argus是面向长程推理的通用智能体运行时,通过多角色协作与自进化,在多个基准测试中表现优于同类方法,还完成了实际应用任务并产出结构化轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06233 2026-08-11 cs.AI 版本更新 83%

Demonstrating TOFFEE: A Learned System for Synthesizing Data Agent Trajectories at Scale

展示TOFFEE:一个大规模合成数据代理轨迹的学习系统

Ziting Wang, Yin Li, Zuhao Yang, Xiuchang Li, Jiale Bai, Gao Cong

机构 * Nanyang Technological University(南洋理工大学) Huawei(华为) Industrial and Commercial Bank of China Limited(中国工商银行)

专题命中 规划决策 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 针对现有数据代理难以适应新环境的问题,提出TOFFEE系统,通过蒙特卡洛树搜索等方法,能从给定数据环境合成高质量数据代理轨迹,可用于监督微调与上下文学习,还展示了系统框架、界面及工作流程与应用场景。

Comments Accepted to VLDB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09730 2026-08-11 cs.AI 版本更新 83%

SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep Research

SearchSwarm:面向长周期深度研究的代理LLM委托智能

Xiaochong Lan, Quan Chen, Kun Tao, Xinyu Tang, Tianshu Wang, Qianggang Cao, Xinyu Kong, Zujie Wen, Zhiqiang Zhang, Jun Zhou

机构 * Tsinghua University(清华大学) Peking University(北京大学) Ant Group(蚂蚁集团) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 规划决策 :agentic(title);agent(abstract);workflow(abstract);分类 cs.AI

AI总结 提出SearchSwarm框架,通过监督微调将任务分解与委托决策内化到模型权重中,在BrowseComp和BrowseComp-ZH上取得同规模最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24235 2026-08-07 cs.AI 版本更新 83%

SP-Mind: An Autonomous Reasoning Agent for Spatial Proteomics Analysis

SP-Mind: 用于空间蛋白质组学分析的自主推理智能体

Yucheng Yuan, Yuanfeng Ji, Zhongxiao Li, Ruijiang Li

机构 * Department of Computer Science, Stanford University, Stanford, USA(计算机科学系,斯坦福大学,斯坦福,美国) Department of Radiation Oncology, Stanford University, Stanford, USA(放射肿瘤学系,斯坦福大学,斯坦福,美国)

专题命中 规划决策 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 提出首个自主AI智能体SP-Mind,统一空间蛋白质组学分析流程,通过自然语言查询实现端到端分析,在SP-Bench基准上达到最优性能。

Comments 24 pages, 6 figures. Accepted to ICML 2026. Equal contribution by Yucheng Yuan and Yuanfeng Ji

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02011 2026-08-05 cs.AI 版本更新 83%

Before Reasoning Can Fail: Pre-Evidence Procedural Failures in Agentic RAG

在推理失效之前:智能体检索增强生成(RAG)中的证据前程序失效

Daeyoung Roh, Donghee Han

机构 * KAIST(韩国科学技术院)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 该研究针对智能体RAG系统在推理前的程序失效,提出将错误答案分为两类失效,评估Read-Gate机制,发现强制阅读可提升准确率,且证据收集应作为独立轨迹控制问题评估。

Comments 22 pages, 7 figures. Code: https://github.com/Noverse0/before-reasoning-fails

详情

展开后加载摘要…

URL PDF HTML 收藏