arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-31 至 2026-07-31 共收录 199 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 9 篇

2510.25333 2026-07-31 cs.CL 版本更新 88%

CRMWeaver: Building Powerful Business Agent via Agentic RL and Shared Memories

CRMWeaver:通过智能体强化学习与共享记忆构建强大的商业智能体

Yilong Lai, Yipin Yang, Ting Liang, Jialong Wu, Zhenglin Wang, Jianguo Lin, Keping Yang

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团) Southeast University(东南大学) University of Montreal(蒙特利尔大学)

专题命中 工具调用 :agent(title,abstract);agentic(title,abstract);分类 cs.CL

AI总结 针对商业智能体面临的数据复杂、任务异质问题,提出CRMWeaver方法,通过智能体强化学习训练与共享记忆机制提升性能,在CRMArena-Pro数据集的B2B、B2C场景中取得竞争力结果,实用价值显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27235 2026-07-31 cs.AI cs.CV 新提交 83%

RadHarmony: Radiological Data Handling in the Era of Agentic AI

RadHarmony:智能体AI时代的放射数据处理方案

Frank Li, Bardia Khosravi, Mohammadreza Chavoshi, Theo Dapamede, YoungSeok Jeon, Janice Newsome, Hari Trivedi, Judy Gichoya

机构 * Emory University(埃默里大学) Yale University(耶鲁大学)

专题命中 工具调用 :agentic(title);agent(abstract);workflow(abstract);分类 cs.AI

AI总结 RadHarmony是一款开源Python库,用于统一处理异构放射数据集,引入AI智能体技能简化数据集整合,可预训练视觉Transformer基线并提供相关代码与模型权重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28055 2026-07-31 cs.IR 新提交 80%

VIG-RL: Learning to Search and Insert for Verified Image Grounding

VIG-RL:学习搜索与插入以实现可验证的图像定位

Qinhan Yu, Jun Guang, Chong Chen, Wentao Zhang

专题命中 工具调用 :agent(abstract);autonomous agent(abstract);workflow(abstract);agentic(abstract)

AI总结 本文针对现有检索增强框架无法动态推理视觉证据插入时机与位置的问题,提出自主智能体框架VIG-RL,将相关工作流建模为主动决策过程,经强化学习优化后实现SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28459 2026-07-31 cs.AI cs.LO 新提交 70%

LeanCSP: A Framework for Certifying Constraint Reformulation and Solving in Lean

LeanCSP:Lean中用于验证约束重构与求解的框架

Pablo Manrique, Stefan Szeider

机构 * TU Wien(维也纳技术大学)

专题命中 工具调用 :planning(abstract);workflow(abstract);分类 cs.AI

AI总结 本研究在Lean定理证明器中提出LeanCSP框架,可验证约束重构的语义正确性与求解器结果,其已验证对称性破缺能大幅减少求解搜索工作量,且Lean内认证成本可承受。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28618 2026-07-31 cs.CL cs.AI cs.IR cs.LG 新提交 67%

AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis

AskChem:面向化学文献综合的以主张为中心的基础设施

Bing Yan, Gregory Wolfe, Stefano Martiniani, Kyunghyun Cho

机构 * New York University(纽约大学) Matterstack, Inc.(Matterstack公司)

专题命中 工具调用 :AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 AskChem是一种以主张为中心的跨论文化学搜索基础设施,将检索单元改为带来源的主张,提供多种检索结构与访问接口,在基准测试中提升了DOI可解析率,为化学文献综合提供了支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27726 2026-07-31 cs.AI cs.CL cs.LG 新提交 67%

Baikal: Structured Search for Deep Research over Data Lakes

Baikal:面向数据湖深度研究的结构化搜索框架

Dhruv Agarwal, Rishitha Guttapalle Mohan, Aarti Kumari, Ashi Sinha, Athulya Anil, Kavitha Srinivas, Horst Samulowitz, Andrew McCallum

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 Baikal是面向数据湖深度研究的结构化搜索框架,通过聚类证据为语义区域并自适应搜索,在HybridQA和TAT-QA数据湖上较基线方法提升报告得分28%和36%,展现了结构化语义探索的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27258 2026-07-31 q-bio.GN cs.LG 新提交 57%

PlantBGC: Transformer for Plant BGC Discovery via Label-Free Domain Adaptation and Weak Supervision

PlantBGC:基于无标签领域自适应与弱监督的植物生物合成基因簇发现Transformer

Yuhan Zhao, Nidhi Grover, Zhishan Guo, Ning Sui

专题命中 工具调用 :workflow(abstract);分类 cs.LG

AI总结 该研究针对植物BGC标签稀缺问题,提出PlantBGC模型,通过无标签领域自适应与弱监督实现植物BGC的精准发现,提升了已知BGC的恢复率并缩短了基因座长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28050 2026-07-31 cs.AI 新提交 57%

IndustryForge-27B: A Domain-Enhanced Multimodal Foundation Model for Industrial CAD

IndustryForge-27B:面向工业CAD的领域增强多模态基础模型

Nianchen Deng, Jiaxin Ai, Tao Hu, Shu Zou, Yurui Dong, Siqi Li, Xinyu Cai, Xuemeng Yang, Licheng Wen, Hongbin Zhou, Hairong Zhang, Pinlong Cai, Botian Shi

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 该研究构建基于Qwen3.5-VL-27B的IndustryForge-27B多模态基础模型,整合6个工业CAD子语料库训练,在CAD基准测试中性能远超基础模型与GPT-5.4,可作为工业智能体的通用基础。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27686 2026-07-31 cs.AI 新提交 57%

Evaluating and Pricing Advertisements in AI-Generated Responses

评估和定价AI生成响应中的广告

John L. Turner-Smith, Zimeng Huang, Yuhan Fu, Yihang Zhang, Tonghan Wang

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 针对AI生成响应中广告评估与定价的核心挑战,该研究构建智能体模拟框架生成监督,提炼出高效评估器,实现更优的点击意图预测,还推导了最优支付规则并扩展了广告生成的训练目标。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 53 篇

2607.28595 2026-07-31 cs.CV 新提交 85%

Beacon: Knowing When and How to Perform Agentic Visual Reasoning

Beacon:智能体何时及如何执行智能体视觉推理

Qixun Wang, Yang Shi, Letian Cheng, Zhuoran Zhang, Yan He, Yuqi Tang, Qi Zhang, Xinlei Yu, Ruizhe Chen, Tianrun Xu, Yuanxing Zhang, Pengfei Wan, Haotian Wang, Xianghua Ying

机构 * Peking University(北京大学) Kling Team(Kling团队) HKUST(GZ)(香港科技大学(广州)) CUHK(香港中文大学) ZJU(浙江大学) THU(清华大学)

专题命中 规划决策 :agentic(title,abstract);tool use(abstract);tool-use(abstract)

AI总结 本研究针对现有智能体视觉推理模型模式适应性有限、工具增益被损害抵消的问题,提出Beacon模型,通过强化学习相关机制提升性能与适应性,在多基准上表现优异。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20891 2026-07-31 cs.AI 版本更新 84%

Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions

深度研究可靠吗?误导性知识会导致错误结论

Pengyu Zhu, Lijun Li, Longju Yang, Sen Su, Jing Shao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 规划决策 :agent(summary_cn,abstract);planning(abstract);分类 cs.AI

AI总结 研究深度研究代理在开放信息环境中的可靠性,引入MisKnow-Agent框架生成误导性实例,通过实验发现其易因误导知识得出错误结论,验证与实际证据使用脱节,评估防御措施效果,强调需提升模型和框架层面的证据验证及纠正能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27435 2026-07-31 cs.DB 新提交 83%

AgenticER: the next frontier in Entity Resolution

AgenticER:实体解析的下一个前沿领域

George Papadakis, Panos Korovesis, Manolis Koubarakis, Themis Palpanas

专题命中 规划决策 :agentic(summary_cn,abstract);autonomous agent(abstract)

AI总结 针对现有实体解析被动范式无法适配异构流数据场景的问题,提出Agentic ER新范式,将其建模为自主智能体的序列决策过程,构建参考架构并明确研究挑战,开拓数据管理与智能体交叉的新研究方向。

Comments Vision paper submitted to VLDB, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28374 2026-07-31 cs.LG 新提交 83%

LEDGERMIND: Provenance-Constrained Multimodal Agentic Reasoning with a Structured Evidence Ledger

LEDGERMIND:基于结构化证据账本的溯源约束多模态智能体推理

Enjun Du, Hange Zhou, Chenxu Du, Siyi Liu, Zirong Chen, Ziyu Zheng, Yongqi Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Hong Kong(香港大学) Tsinghua University(清华大学) University of Sussex(萨塞克斯大学)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.LG

AI总结 该研究提出LedgerMind,通过结构化证据账本及三层依据协议等组件,解决多模态智能体推理中最终答案准确率无法反映轨迹可信度的问题,在多模态基准上同时提升了答案准确率与轨迹可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27562 2026-07-31 cs.AI 新提交 83%

DeepResearch Agent System

DeepResearch 智能体系统

Yong Huang, Yulu Huang, for the team Collaboration

机构 * Software Copyright Research and Development Document(软件版权研究与开发文档)

专题命中 规划决策 :agent(title,abstract);tool-use(abstract);分类 cs.AI

AI总结 DeepResearch 智能体系统是基于稀疏激活架构的大语言模型,通过双模式推理引擎、多工具协调等技术,在多个智能体基准测试中取得最优性能,已完全开源并支持多领域应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27636 2026-07-31 cs.AI cs.RO cs.SE 新提交 81%

HALO: Heterogeneous Admission through Localized Obligations for Safe Agentic Execution

HALO:基于局部义务的异构准入机制,用于安全智能体执行

Taewoo Park, Kyeonghyun Yoo, Kiseok Kim, Seunghyun Yoo, Hwangnam Kim

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.SE

AI总结 HALO是一种保障智能体执行安全的运行时协议,可保留有效组件、检查动作有效性并替换被阻止动作,在多组实验中均展现出优于整体响应策略的性能。

Comments 16 pages, 2 figures; supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27443 2026-07-31 cs.AI 新提交 79%

Leveraging Trajectory Graphs for Pre-Execution Error Diagnosis in Agentic LLM Systems

利用轨迹图实现智能体大语言模型系统的预执行错误诊断

Xu Zheng, Zhuomin Chen, Chaohao Lin, Hua Wei, Haifeng Chen, Wei Cheng, Dongsheng Luo

机构 * Florida International University(佛罗里达国际大学) Arizona State University(亚利桑那州立大学) NEC Laboratories America(美国 NEC 实验室) Singapore Management University(新加坡管理大学)

专题命中 规划决策 :agentic(title);agent(abstract);分类 cs.AI

AI总结 该研究提出Trajectory Graph Copilot框架,以Graph Debugger为核心,通过预执行错误诊断提升LLM智能体完成长周期任务的能力,在多基准测试中平均提升14.69%通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27360 2026-07-31 cs.AI 新提交 79%

SkillMentor: LLM Agent Self-Evolution via Learning Blind-Spot Diagnosis

SkillMentor:基于盲点诊断的大语言模型智能体自我进化

Xiaoyi Bao, Yuanzhen Xie, Yunzhi Tan, Jinghang Gu, Zhongqing Wang, Chu-Ren Huang, Bo Hu, Zang Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Platform and Content Group, Tencent(腾讯平台与内容事业群) Soochow University(苏州大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 本文提出SkillMentor,将盲点诊断作为独立于执行的可学习智能体能力,通过强化学习训练导师策略,在AppWorld和BFCLv3上使执行器性能平均提升44.2%,实现无需更新执行器的智能体自我进化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27287 2026-07-31 cs.AI cs.LO 新提交 79%

PIE-APT: A Unified Framework for Temporal Planning and Contradiction Hunting via Incremental Direct-Derivation Abduction

PIE-APT:基于增量直接推导溯因的时态规划与矛盾检测统一框架

Amir Hossein Sharafi, Alireza Shahbazi

机构 * Najm(纳吉姆) Tafresh University(塔夫雷什大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 该研究提出统一框架PIE-APT,含PIE-Abducer与PIE-APT模块,通过增量直接推导溯因解决动态知识图谱规划与矛盾检测问题,在OWL基准上优于经典规划器与MHS基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21419 2026-07-31 cs.AI 版本更新 79%

PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learning

PATS:用于智能体强化学习的策略感知训练框架

Yipeng Shi, Zhipeng Ma, Yue Wang, Qitai Tan, Yang Li, Peng Chen, Zhengzhou Zhu

专题命中 规划决策 :agentic(title);agent(abstract);分类 cs.AI

AI总结 研究针对长期语言模型智能体强化学习中弱策略问题,提出以策略为中心的训练范式Pats,将技能作为动态训练框架,通过转换展开组为证据卡、特定任务评估调整上下文等改进策略,在多个任务上取得良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27564 2026-07-31 cs.CV 新提交 79%

Inference-Time Agentic Decision Rules Beat Longer Evolving Search for Multi-Image Medical Reasoning

推理时代理决策规则在多图像医学推理任务中优于更长的进化搜索

Site Li, Jianyi Hao, Xiaofeng Liu

机构 * Yale University(耶鲁大学)

专题命中 规划决策 :agentic(title,abstract)

AI总结 本研究对比5种推理时代理策略,发现多图像医学推理中,顺序投票决策规则比扩展进化搜索预算的影响更大,其最终测试准确率显著优于基线及复杂变体。

Comments Presented at the CVPR 2026 Workshop on Multi-Modal Reasoning for Agentic Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28098 2026-07-31 cs.AI cs.CL 新提交 79%

SciDataSailor: Deep Scientific Data Exploring

SciDataSailor:深度科学数据探索

Jiyong Rao, Yicheng Qiu, Chi Zhang, Chunfeng Song, Runkai Zhao

专题命中 规划决策 :tool use(abstract);planning(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 该研究针对科学数据仓库交互难题,提出SciDataSailor框架,以带特定机制的MCTS实现轨迹合成,构建了微调模型与含千余任务的评估基准,推动LLM智能体的科学数据探索能力。

Comments 63 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28171 2026-07-31 math.OC 新提交 78%

The optimality of an (s, S) hiring policy on a workforce planning problem with fixed recruitment costs and binomial turnover

带有固定招聘成本和二项式人员流动的劳动力规划问题中(s, S)招聘策略的最优性

Zhen Chen, Roberto Rossi, Belen Martin-Barragan, S. Armagan Tarim

专题命中 规划决策 :planning(title,abstract)

AI总结 针对含固定招聘成本和二项式人员流动的有限期劳动力规划问题,研究人员通过建立离散凸性与K-凸性证明最优(s, S)招聘策略,并提出分段近似方法生成MILP公式求解,该方法计算快且最优性差距小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16059 2026-07-31 cs.RO 版本更新 78%

Ultrafast Sampling-based Kinodynamic Planning via Differential Flatness

基于微分平坦性的超快采样动力学规划

Thai Duong, Clayton W. Ramsey, Zachary Kingston, Wil Thomason, Lydia E. Kavraki

机构 * Department of Computer Science, Rice University(计算机科学系,里士大学) Ken Kennedy Institute(肯尼迪研究所)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出FLASK框架,利用微分平坦性将运动规划问题从状态空间转换到平坦输出空间,通过并行计算实现快速、精确的动态可行性轨迹生成,适用于多种机器人系统。

Comments 20 pages, 10 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26494 2026-07-31 cs.AI cs.CL cs.LG 版本更新 75%

The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence

MiniMax-M2系列:小激活释放最大现实智能

Aili Chen, Aonian Li, Baichuan Zhou, Bangwei Gong, Binyang Jiang, Boji Dan, Changhao Zhang, Changqing Yu, Chao Wang, Cheng Ma, Cheng Zhong, Cheng Zhu, Chengjun Xiao, Chengyi Yang, Chengyu Du, Chenyang Zhang, Chi Zhang, Chuangyi Huang, Chunhao Zhang, Chunhui Du, Chunyu Zhao, Congchao Guo, Da Chen, Deming Ding, Dianjun Sun, Dong Li, Dongyu Zhang, Enhui Yang, Fei Yu, Guang Zheng, Guodong Zheng, Guohong Li, Haichao Zhu, Haigang Zhou, Haimo Zhang, Han Ding, Hao Zhang, Haohai Sun, Haolin Lyu, Haonan Lu, Haoyu Wang, Huajie Shi, Huiyang Li, Jiacheng Chen, Jian Zhang, Jiaqi Zhuang, Jiaren Cai, Jiaxin Pan, Jiayao Li, Jiayuan Song, Jichuan Zhang, Jie Wang, Jihao Gu, Jin Zhu, Jingwei Dong, Jingyang Li, Jingyu Zhang, Jingze Zhuang, Jinhao Tian, Jinli Liu, Jinyi Hu, Jun Tao, Jun Zhang, Junbin Ruan, Junhao Xu, Junjie Yan, Junteng Liu, Junxian He, Kang Xu, Ke Ji, Ke Yang, Kecheng Xiao, Keyu Duan, Keyu Li, Le Han, Letian Ruan, Li Yuan, Lianfei Yu, Liheng Feng, Lijie Mo, Lin Li, Linge Du, Lingye Bao, Lingyu Yang, Lingyuan Zhou, Loki, Lu Chen, Lunbin Zeng, Ming Li, Ming Zhong, Mingliang Tao, Mingyuan Chi, Mujie Lin, Nan Hu, Ningxin Chen, Peiyin Zhu, Peng Gao, Pengcheng Gao, Pengfei Li, Penglin Li, Pengyu Zhao, Qibin Ren, Qibing Ren, Qidi Xu, Qihan Ren, Qile Li, Qin Wang, Quanliang Chen, Qunhong Zeng, Rong Tian, Rongxin Guo, Rui Dong, Ruitao Leng, Ruize Zhang, Shanqi Liu, Shaoxiang Chen, Shaoyu Chen, Sheng Jia, Shun Yao, Shuoran Zhao, Shuqi Yu, Sichen Li, Sicheng Pan, Songquan Zhu, Tengfei Li, Tian Xie, Tiancheng Qin, Tianle Li, Tianrun Liang, Wei Liu, Weiqi Xu, Weitao Li, Weixiang Chen, Weiyu Cheng, Weiyu Zhang, Wenhu Chen, Wenqian Zhao, Xiancai Chen, Xiangjun Song, Xiangyuan Wang, Xianzhen Luo, Xiao Luo, Xiao Su, Xiaobo Li, Xiaodong Han, Xiaojie Wu, Xihao Song, Xingyi Han, Xinyu Guan, Xuan Lu, Xun Zou, Xunhao Lai, Xutong Li, Xuyang Shen, Yan Gong, Yan Ma, Yang Jiao, Yang Wang, Yang Xu, Yangsen Wang, Ye Tang, Yicheng Chen, Yihang Wang, Yinran Qiu, Yiqi Shi, Yiting Guo, Yiwen Huang, Yixuan Wang, Yongyi Hu, Yu Gao, Yu Zhang, Yuan Li, Yuanxiang Ying, Yuanzhen Zhang, Yubo Wang, Yuchen Song, Yufeng Yang, Yuhang Meng, Yuhang Miao, Yuhao Li, Yujie Liu, Yulin Hu, Yunan Huang, Yunji Li, Yunyi Huang, Yusen Zhang, Yusu Hong, Yutao Xie, Yutong Zhang, Yuwen Liao, Yuxuan Shi, Yuze Wenren, Zebin Li, Zehan Li, Zejian Luo, Zeyu Jin, Zeyuan Sun, Zhanpeng Zhou, Zhaochen Su, Zhendong Li, Zhengmao Zhu, Zhengyuan Peng, Zhenhua Fan, Zhi Zhang, Zhichao Xu, Zhiheng Lv, Zhikang Xu, Zhitao He, Zhiwei He, Zhongyuan Li, Zibo Gao, Zijia Wu, Zijian Song, Zijian Zhou, Zijun Sun, Zishan Huang, Ziying Chen, Ziyue Ge

机构 * MiniMax

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出MiniMax-M2系列混合专家语言模型,通过小激活参数实现前沿性能,核心包括智能体驱动数据管道、可扩展强化学习系统Forge及自进化检查点M2.7。

Comments Technical Report. 35 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06494 2026-07-31 cs.CG cs.GR cs.RO 版本更新 71%

An Efficient Solution to the 2D Visibility Problem in Cartesian Grid Maps and its Application in Heuristic Path Planning

笛卡尔栅格地图中二维可见性问题的高效解决方案及其在启发式路径规划中的应用

Ibrahim Ibrahim, Joris Gillis, Wilm Decré, Jan Swevers

专题命中 规划决策 :planning(title)

AI总结 本文提出一种高效的二维栅格可见性求解方法,将其作为启发式函数实现无局部极小值的路径规划器,性能优于传统光线投射算法。

Comments 7 pages, 5 figures, IEEE ICRA 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28367 2026-07-31 cs.AI 新提交 70%

How Benchmarks Mis-Score Computer-Use Agents

基准测试如何错误评估计算机使用智能体

Zihan Dong, Zhiyuan Ma, Zekun Wang, Yunqing Li, Zirou Liu, Ruixuan Deng, Qishi Zhan, Rui Qian

机构 * Georgia Institute of Technology(佐治亚理工学院) North Carolina State University(北卡罗来纳州立大学) Lenovo AI Technology Center(联想人工智能技术中心) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Marquette University(马凯特大学) Fudan University(复旦大学)

专题命中 规划决策 :planning(abstract);workflow(abstract);分类 cs.AI

AI总结 该研究指出计算机使用智能体的基准测试分数存在可靠性问题,审计150条轨迹发现15.3%的“失败”判定错误,进而推导了CUA评估各阶段的设计规则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27599 2026-07-31 cs.AI cs.RO 新提交 70%

World Action Planner: Generalizable Decision-Making with Action-Conditioned World Models

世界动作规划器:基于动作条件世界模型的通用决策方法

Xiangcheng Zhang, Yilun Du

机构 * Harvard University(哈佛大学)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 本研究提出World Action Planner机器人规划系统,结合VLMs与多任务位姿图像条件世界模型,可迭代优化动作规划,在组合任务、新布局等场景中泛化性能优于VLAs、WAMs等端到端策略模型。

Comments Project page at worldactionplanner.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27484 2026-07-31 cs.AI cs.MA 新提交 70%

Skill Use or Skill Theater? Evaluating the Reasoning Backroom in Skill-Augmented Language Agents

技能使用还是技能表演?评估技能增强型语言智能体中的推理后台

Jinwei Hu, Yi Qi, Xinmiao Huang, Youcheng Sun, Yi Dong, Xiaowei Huang

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本研究针对技能增强型语言智能体,提出BACKTRACE评估框架及BACKROOMBench测试平台,发现其存在推理后台现象,即技能使用声明与实际决策影响存在系统性差距,需通过干预进行审计。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04227 2026-07-31 cs.CV cs.LG 版本更新 70%

Continual Learning for VLMs: A Survey and Taxonomy Beyond Forgetting

视觉语言模型的持续学习:超越遗忘的综述与分类

Yuyang Liu, Qiuhe Hong, Linlan Huang, Alexandra Gomez-Villa, Dipam Goswami, Tiantian Peng, Xialei Liu, Joost van de Weijer, Yonghong Tian

专题命中 规划决策 :autonomous agent(abstract);agentic(abstract);分类 cs.LG

AI总结 本文综述了视觉语言模型的持续学习挑战,提出四种核心范式以解决跨模态特征漂移和灾难性遗忘问题,强调零样本学习和智能体生态系统的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01427 2026-07-31 cs.AI 版本更新 70%

A Tale of LLMs and Induced Small Proxies: Scalable Small Language Models for Knowledge Mining

小型语言模型代理实现高效高质量的知识挖掘

Sipeng Zhang, Longfei Yun, Zilong Wang, Letian Peng, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校) Carneigie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划决策 :planning(abstract);agentic(abstract);分类 cs.AI

AI总结 提出Falconer框架,结合大语言模型的代理推理与轻量级代理模型,通过规划与标注实现可扩展的知识挖掘,在保持指令遵循精度的同时降低90%推理成本并加速20倍以上。

Comments Code available: https://github.com/LongfeiYun17/falconer

详情

展开后加载摘要…

URL PDF HTML 收藏