arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-03 至 2026-07-03 共收录 205 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 13 篇

2602.22897 2026-07-03 cs.AI cs.CL cs.CV cs.LG cs.MM 版本更新 85%

OmniGAIA: Towards Native Omni-Modal AI Agents

OmniGAIA:迈向原生全模态AI代理

Xiaoxi Li, Wenxiang Jiao, Jiarui Jin, Haoxuan Li, Hao Wang, Shijian Wang, Guanting Dong, Jiajie Jin, Yinuo Wang, Yuan Lu, Ji-Rong Wen, Zhicheng Dou, Zhouchen Lin

机构 * Renmin University of China(中国人民大学) Xiaohongshu Inc.(小红书公司) Peking University(北京大学) Southeast University(东南大学) Tsinghua University(清华大学)

专题命中 工具调用 :AI agent(title);agent(abstract);tool-use(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出OmniGAIA基准和OmniAtlas代理,通过全模态事件图和后见引导树探索策略,实现跨视频、音频和图像的深度推理与工具使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01510 2026-07-03 cs.AI cs.CR 新提交 83%

Janus: a Playground for User-Involved Agentic Permission Management

Janus:用户参与的智能体权限管理实验平台

Natalie Grace Brigham, Eugene Bagdasarian, Tadayoshi Kohno, Franziska Roesner

机构 * University of Washington(华盛顿大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Georgetown University(乔治城大学)

专题命中 工具调用 :agentic(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 提出Janus系统,通过模块化框架和自动化评估工具,研究用户参与AI智能体权限管理的设计空间,发现用户输入可增强隐私安全,AI辅助可降低认知负担,但需考虑权限疲劳等现实行为。

Comments Code and data released on GitHub: https://github.com/GraceBrigham/Janus

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01366 2026-07-03 cs.AI 新提交 83%

Auto-FL-Research: Agentic Search for Federated Learning Algorithms

Auto-FL-Research: 联邦学习算法的智能搜索

Holger R. Roth, Ziyue Xu, Chester Chen, Daguang Xu, Peter Cnudde, Andrew Feng

机构 * NVIDIA, Santa Clara, USA(英伟达,美国圣克拉拉)

专题命中 工具调用 :agentic(title);agent(abstract);workflow(abstract);分类 cs.AI

AI总结 提出Auto-FL-Research (AFR),一种约束编码代理工作流,用于自动搜索联邦学习算法,在五个医疗和六个LEAF任务上验证了有效性,并分析了搜索结果的机制。

Comments 8 pages; 5 figures; 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22431 2026-07-03 cs.AI cs.CL cs.FL 82%

Monadic Context Engineering

单子上下文工程

Yifan Zhang, Yang Yuan, Mengdi Wang, Andrew Chi-Chih Yao

机构 * IIIS, Tsinghua University(清华大学人工智能研究院)

专题命中 工具调用 :agent(abstract);AI agent(abstract);autonomous agent(abstract);tool use(abstract)

AI总结 本文提出Monadic Context Engineering,利用函子、应用函子和单子的代数结构,为智能体设计提供形式基础,通过分层方法构建高效可靠的AI智能体。

Comments We found some issues in the categorical foundations of this work, so we respectfully withdraw it

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02387 2026-07-03 cs.IR cs.LG 新提交 79%

Bringing Agentic Search to Earth Observation Data Discovery

将智能搜索引入地球观测数据发现

Minghan Yu, Youran Sun, Chugang Yi, Yixin Wen, Haizhao Yang

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 工具调用 :agentic(title,abstract);分类 cs.LG

AI总结 提出一个基于智能搜索的系统,利用知识图谱和大型语言模型,从自然语言查询中返回匹配的地球科学数据集和工具,显著提升检索性能。

Comments 19 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02345 2026-07-03 cs.SE cs.AI cs.CL 新提交 75%

SkillFuzz: Fuzzing Skill Composition for Implicit Intents Discovery in Open Skill Marketplaces

SkillFuzz: 面向开放技能市场中隐式意图发现的技能组合模糊测试

Jinwei Hu, Yi Dong, Youcheng Sun, Xiaowei Huang

机构 * School of Computer Science and Informatics, University of Liverpool(利物浦大学计算机科学与信息学学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 工具调用 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 提出SkillFuzz,首个无需执行的模糊测试方法,通过提取结构化技能契约并利用契约引导的蒙特卡洛树搜索,在开放技能市场中高效发现因技能组合导致的隐式意图,验证了80%以上高风险组合。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01972 2026-07-03 cs.CL cs.AI cs.LG 新提交 75%

Object Aligner: A Configurable JSON Schema Similarity Score for Graphs, Applied to LLM Prompt Optimization

Object Aligner: 一种可配置的图结构JSON模式相似度评分,应用于LLM提示优化

Jan Drchal

机构 * Artificial Intelligence Center, Faculty of Electrical Engineering, Czech Technical University in Prague(捷克理工大学电气工程学院人工智能中心)

专题命中 工具调用 :planning(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出Object Aligner,一种基于递归树对齐和引用对齐的JSON相似度评分方法,通过Weisfeiler-Leman颜色细化近似图同构,用于LLM输出评估和提示优化。

Comments 28 pages, This is a submitted version of a manuscript under review at IEEE Access; it has not been peer reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01465 2026-07-03 cs.AI 新提交 74%

Beyond Next-Token Prediction: An RLVR Proof of Concept for Tool-Use Agents on Atlassian Workflows

超越下一个词预测:Atlassian工作流中工具使用代理的RLVR概念验证

Karthikeya Aditya Vissa, Sankalp Mane, Ananya Mantravadi, Harshit Rajgarhia, Abhishek Mukherji

机构 * Centific

专题命中 工具调用 :tool-use(title);分类 cs.AI

AI总结 针对企业SaaS工作流中LLM因目标不匹配导致的静默失败,提出在目标环境中直接应用可验证奖励强化学习(RLVR),在五个合成Jira/Confluence环境中训练Qwen模型,将平均奖励从0.35-0.92提升至0.95-1.00。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00593 2026-07-03 cs.CL cs.AI 版本更新 73%

SPADER: Step-wise Peer Advantage with Diversity-Aware Exploration Rewards for Multi-Answer Question Answering

SPADER: 面向多答案问答的逐步同伴优势与多样性感知探索奖励

Qiming Shi, Zhaolu Kang, Yunfan Zhou, Di Weng, Yingcai Wu

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) School of Software Technology, Zhejiang University(浙江大学软件技术学院)

专题命中 工具调用 :tool use(abstract);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 提出SPADER强化学习框架,通过逐步同伴优势(SPA)机制和多样性感知探索奖励,解决多答案问答中长程工具使用的细粒度信用分配与持续探索问题,实验表明在多个数据集上提升了召回率和F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30441 2026-07-03 cs.MA cs.AI 版本更新 70%

Translating Natural Language to Strategic Temporal Specifications via LLMs

通过大语言模型将自然语言翻译为策略时序规范

Marco Aruta, Francesco Improta, Vadim Malvone, Aniello Murano, Vladana Perlić

机构 * University of Naples Federico II(那不勒斯费德里科二世大学) LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信,巴黎理工学院)

专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出利用大语言模型将自然语言描述的策略需求翻译为ATL/ATL*公式,构建专家验证数据集,通过领域内微调小模型达到与强少样本专有API基线相当的语义准确性(0.84 vs 0.86),并集成到模型检查器中支持非专家用户。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14157 2026-07-03 cs.AI cs.CV 版本更新 70%

Ophiuchus: Incentivizing Tool-augmented "Think with Images" for Joint Medical Segmentation, Understanding and Reasoning

Ophiuchus: 激励工具增强的“图像思考”用于联合医学分割、理解与推理

Yankai Jiang, Yujie Zhang, Peng Zhang, Wenjie Li, Yichen Li, Jintai Chen, Xiaoming Shi, Shihui Zhen

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Information Hub, HKUST (Guangzhou)(信息枢纽,香港科技大学(广州))

专题命中 工具调用 :AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出Ophiuchus框架,通过三阶段训练策略(冷启动SFT、自反思微调、工具强化学习)使MLLM动态聚焦细粒度视觉区域,实现精准医学分割与诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03056 2026-07-03 cs.AI 版本更新 57%

SkillDAG: Self-Evolving Typed Skill Graphs for LLM Skill Selection at Scale

SkillDAG:面向大规模LLM技能选择的自演化类型化技能图

Tong Bai, Zhenglin Wan, Pengfei Zhou, Xingrui Yu, Yang You, Ivor W. Tsang

机构 * Fudan University(复旦大学) National University of Singapore(国立新加坡大学) CFAR A*STAR

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 提出SkillDAG,通过类型化有向图建模技能间关系,并作为推理时可调用的结构化检索接口,支持在线演化,在ALFWorld和SkillsBench上显著超越基线。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01664 2026-07-03 physics.gen-ph 新提交 50%

Substrate-Agnostic 3x: Biosignatures, Technosignatures, Ecologies

底物无关的3x:生物印记、技术印记、生态学

Lukáš Likavčan

专题命中 工具调用 :agent(abstract)

AI总结 本文提出底物无关生态学概念,整合生物印记与技术印记研究,基于生态位构建理论建立统一视角。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 47 篇

2607.01942 2026-07-03 cs.AI 新提交 86%

Atomic Task Graph: A Unified Framework for Agentic Planning and Execution

原子任务图:智能体规划与执行的统一框架

Yue Zhang, Sihan Chen, Ziwen Huang, Hanyun Cui, Kangye Ji, Zhi Wang

机构 * South China University of Technology(华南理工大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 规划决策 :planning(title,abstract);agentic(title);分类 cs.AI

AI总结 提出原子任务图(ATG)框架,通过显式图结构暴露子任务依赖、支持并行执行和局部错误修复,在三个交互基准上使用7B-8B模型显著提升成功率和执行效率。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02436 2026-07-03 cs.SE cs.AI 新提交 84%

Reasoning effort, not tool access, buys first-try reliability in agentic code generation: an observational study

推理努力,而非工具访问,决定了智能体代码生成的首试可靠性:一项观察性研究

Achint Mehta

机构 * TrendAI

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 本研究通过90次独立智能体运行构建同一应用,发现推理努力(从高到极高)将首试完美运行率从28%提升至89%,而测试工具虽增加成本却未改善功能得分或可靠性。

Comments 22 pages, 5 figures, 10 tables. Dataset and evaluation artifacts: https://doi.org/10.5281/zenodo.21134406

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01120 2026-07-03 cs.DC 新提交 82%

Next-Generation Agentic Reinforcement Learning Systems Enable Self-Evolving Agents

下一代智能体强化学习系统实现自进化智能体

Ran Yan, Wei Fu, Jiale Li, Shusheng Xu, Zhiyu Mei, Jiaxuan Gao, Jiarui Zhang, Wentai Zhang, Hao Dai, Xujie Shen, Chuyi He, Zhen Pu, Jun Mei, Zhiyao Lin, Haitao Wang, Zhiqiang Ding, Jiawei Zhang, Huaijie Wang, Ruida Xu, Honghua Dong, Youhe Jiang, Yi Wu, Tongkai Yang, Binhang Yuan

专题命中 规划决策 :agentic(title,abstract);agent(abstract)

AI总结 针对企业级大规模智能体服务中自进化部署的瓶颈,提出智能体在线强化学习系统需在轨迹数据协议、数据代理和进化控制平面三方面进行协同设计,并通过AReaL2.0实例化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01421 2026-07-03 cs.SE cs.AI 新提交 81%

Risk Architecture for AI-Native Engineering Teams: An Organizational Framework for Agentic System Governance

AI原生工程团队的风险架构:智能体系统治理的组织框架

Laxmipriya Ganesh Iyer

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.SE

AI总结 针对AI原生团队违反传统软件工程假设的问题,提出七维团队画像、六类故障模式(含依赖边界确定性失配)和框架充分性评估方法,发现风险覆盖随AI原生程度单调下降,最严重故障出现在组织边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02403 2026-07-03 cs.RO cs.AI cs.CV 新提交 79%

ACID: Action Consistency via Inverse Dynamics for Planning with World Models

ACID: 通过逆动力学实现行动一致性以用于世界模型规划

Gawon Seo, Dongwon Kim, Suha Kwak

机构 * POSTECH KAIST(韩国科学技术院)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 提出ACID框架,通过逆动力学模型引入循环行动一致性约束,改进基于世界模型的决策时规划,在多种任务中提升规划效果并降低计算成本。

Comments Project Page: [this https URL](https://gawon1224.github.io/ACID/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04520 2026-07-03 cs.AI 版本更新 79%

Aria: An Agent For Retrieval and Iterative Auto-Formalization via Dependency Graph

Aria: 基于依赖图的检索与迭代自动形式化智能体

Hanyu Wang, Ruohan Xie, Yutong Wang, Guoxiong Gao, Xintao Yu, Bin Dong

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 提出Aria系统,通过两阶段思维图过程递归分解定理陈述为依赖图并构建形式化,结合AriaScorer验证语义正确性,在ProofNet、FATE-X和同调猜想数据集上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19775 2026-07-03 cs.AI cs.CL cs.ET cs.MA cs.RO 版本更新 79%

From Actions to Understanding: Conformal Interpretability of Temporal Concepts in LLM Agents

从行为到理解:LLM代理中时间概念的符合可解释性

Trilok Padhi, Ramneet Kaur, Krishiv Agarwal, Adam D. Cobb, Daniel Elenius, Manoj Acharya, Colin Samplawski, Alexander M. Berenbeim, Nathaniel D. Bastian, Susmit Jha, Ugur Kursuncu, Anirban Roy

机构 * Georgia State University(佐治亚州立大学) Computer Science Lab, SRI(SRI计算机科学实验室) Army Cyber Institute(陆军网络学院) United States Military Academy(美国军事学院) University of Florida(佛罗里达大学)

专题命中 规划决策 :agent(abstract);autonomous agent(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 本文提出通过符合视角解释LLM代理时间概念演变的框架,结合逐步奖励建模与符合预测,识别时间概念的潜在方向,实验表明这些概念可线性分离,为LLM代理提供可靠故障检测和干预方法。

Comments Accepted at the Mechanistic Interpretability Workshop, 43rd International Conference on Machine Learning, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02115 2026-07-03 cs.IR 新提交 78%

Planning over Matrix-Factorization MDPs for Candidate Generation

基于矩阵分解MDP的候选生成规划

Mikhail Trapeznikov, Maksim Utushkin

专题命中 规划决策 :planning(title,abstract)

AI总结 将推荐系统的用户旅程建模为MDP,通过折叠更新用户状态进行规划,实验表明单步前瞻即可显著提升固定嵌入下的检索效果。

Comments Accepted to the 5th Workshop on End-to-End Customer Journey Optimization at KDD 2026. 6 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01631 2026-07-03 cs.RO 新提交 78%

Path planning for unmanned naval surface vehicles

无人水面航行器的路径规划

Daniel G. Schwartz

机构 * Department of Computer Science, Florida State University(计算机科学系,佛罗里达州立大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 针对无人水面航行器(USV)的固定和移动障碍物避碰问题,提出结合全局与局部路径规划器的新方法,全局规划器融合三种算法,局部规划器基于障碍物运动方向决策,仿真验证了有效性。

Journal ref AI Insights, Article 939, 1(1), 2025, 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00508 2026-07-03 cs.IR 新提交 78%

When RAG Meets Query Planning: Logical Query Trees for Resolving Exploratory Reasoning Problems

当RAG遇见查询规划:用于解决探索性推理问题的逻辑查询树

Ganlin Xu, Linghao Zhang, Zhitao Yin, Hongda Xi, Chen Yang, Jiaqing Liang, Weijia Lu, Sihang Jiang, Yanghua Xiao, Deqing Yang

专题命中 规划决策 :planning(title,abstract)

AI总结 针对检索增强生成在探索性推理问题中的检索噪声和错误累积问题,提出PlanRAG框架,将自然语言建模为逻辑查询树,通过动态规划和代价模型优化查询树,实现高效并行处理,在WikiWeb-ERP数据集上优于现有方法。

Comments Accepted by SIGMOD 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06874 2026-07-03 eess.SP cs.SY eess.SY 78%

Radio-Coverage-Aware Path Planning for Cooperative Autonomous Vehicles

面向无线覆盖的协同自主车辆路径规划

Giuseppe Baruffa, Luca Rugini, Francesco Binucci, Fabrizio Frescura, Paolo Banelli, Renzo Perfetti

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出一种考虑无线覆盖的路径规划算法,通过修改Dijkstra和A*等算法的成本函数,优化路径选择以减少行驶距离并提高覆盖效率。

Comments 11 pages, 19 figures

Journal ref IEEE Access, vol. 14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01189 2026-07-03 cs.RO cs.SY eess.SY 版本更新 78%

SPOT: Spatio-Temporal Obstacle-free Trajectory Planning for UAVs in Unknown Dynamic Environments

SPOT:未知动态环境中无人机的时空无碰撞轨迹规划

Astik Srivastava, Thomas J Chackenkulam, Bitla Bhanu Teja, Antony Thomas, Madhava Krishna

机构 * Robotics Research Center, IIIT Hyderabad, India(IIIT海得拉巴机器人研究中心,印度) IIT-BHU, India(IIT-BHU,印度)

专题命中 规划决策 :planning(title,abstract)

AI总结 提出一种基于4维时空规划器、视觉安全飞行走廊生成和轨迹优化的无地图反应式运动规划方法,实现无人机在未知动态环境中的避障,并通过备份规划模块应对死锁。

Comments Accepted for publication at ICRA 2026. Code available at (https://astik-2002.github.io/ICRA-2026-SPOT/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13940 2026-07-03 cs.RO 版本更新 78%

NeHMO: Neural Hamilton-Jacobi Reachability Learning for Decentralized Safe Multi-Arm Motion Planning

NeHMO:用于分散式安全多臂运动规划的神经Hamilton-Jacobi可达性学习

Qingyi Chen, Zachary Kingston, Ahmed H. Qureshi

机构 * Department of Computer Science at Purdue University(普渡大学计算机科学系)

专题命中 规划决策 :planning(title,abstract)

AI总结 提出基于神经Hamilton-Jacobi可达性学习的方法,学习安全值函数以捕获最坏情况下的臂间安全约束,并开发分散式轨迹优化框架,实现可扩展、数据高效的多臂运动规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01639 2026-07-03 cs.AI 新提交 77%

Autonomous discovery of traffic laws with AI traffic scientists

AI交通科学家自主发现交通规律

Xingyuan Dai, Yue Liu, Xiaoyan Gong, Qinghai Miao, Junyou Shang, Yutong Wang, Chao Guo, Yonglin Tian, Yizhang Chai, Chao Xiang, Yisheng Lv, Fei-Yue Wang

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) China Telecom Research Institute(中国电信研究院) Macau Institute of Systems Engineering, Macau University of Science and Technology(澳门科技大学澳门系统工程研究所) State Key Laboratory for Management and Control of Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统管理与控制国家重点实验室)

专题命中 规划决策 :planning(abstract);workflow(abstract);agentic(abstract);分类 cs.AI

AI总结 提出TrafficSci智能体系统,通过迭代工作流自主发现交通规律,在四个案例中重现已知规律并发现城市驾驶行为中的内在时间记忆尺度。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02440 2026-07-03 cs.AI cs.CL 新提交 73%

EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments

EvoPolicyGym:评估交互环境中的自主策略进化

Zhilin Wang, Han Song, Runzhe Zhan, Jusen Du, Jiacheng Chen, Tianle Li, Qingyu Yin, Yulun Wu, Zhennan Shen, Tong Zhu, Yanshu Li, Guanjie Chen, Derek F. Wong, Yafu Li, Yu Cheng, Yang Yang

机构 * University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) University of Macau(澳门大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) Soochow University(苏州大学) Brown University(布朗大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 规划决策 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL

AI总结 提出自主策略进化评估框架,通过EvoPolicyGym基准测试代理在固定交互预算下迭代改进策略的能力,GPT-5.5在16个环境中表现最优,并揭示预算分配与反馈转化机制。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06288 2026-07-03 cs.AI cs.LG 版本更新 73%

BuilderBench: The Building Blocks of Intelligent Agents

BuilderBench:智能体的构建模块

Raj Ghugare, Roger Creus Castanyer, Catherine Ji, Kathryn Wantlin, Jin Schofield, Karthik Narasimhan, Benjamin Eysenbach

机构 * Princeton University(普林斯顿大学) Mila – Quebec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 提出BuilderBench基准,通过开放式探索训练智能体构建结构,实验表明现有前沿语言模型和强化学习算法无法解决任何非平凡任务。

Comments Blogpost: https://rajghugare19.github.io/builderbench and Code: https://github.com/rajghugare19/builderbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02504 2026-07-03 cs.CL cs.AI cs.CV 新提交 62%

Reasoning LLM Improves Speaker Recognition in Long-form TV Dramas

推理大模型提升长篇电视剧中的说话人识别

Yuxuan Li, Lingxi Xie, Xinyue Huo, Jihao Qiu, Jiacheng Shao, Pengfei Chen, Jiannan Ge, Kaiwen Duan, Qi Tian

专题命中 规划决策 :tool-use(abstract);分类 cs.AI、cs.CL

AI总结 提出DramaSR-532K大规模基准和基于推理大模型的DramaSR-LRM方法,通过多模态工具使用聚合上下文证据,显著提升长篇电视剧中说话人识别准确率,尤其对短话语效果显著。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏