ActionStudio: A Lightweight Framework for Data and Training of Large Action Models
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
Comments 16 pages; large action models; xLAM; ActionStudio
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
Comments 16 pages; large action models; xLAM; ActionStudio
机构 * RespAI Lab, School of Computer Engineering, KIIT Bhubaneswar(RespAI实验室,计算机工程学院,KIIT大学)
专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
Comments Accepted to COLM 2025
机构 * Big Data&AI Lab, ICBC(大数据与人工智能实验室,ICBC) ; Shanghai Jiao Tong University(上海交通大学) ; Meituan Inc.(美团公司) ; Tongji University(同济大学) ; Fudan University(复旦大学) ; Northeastern University(东北大学)
专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
Comments 20 pages, 4 figures, Under review. Code: https://github.com/weiyali126/TACTIC
机构 * Salesforce AI Research(Salesforce人工智能研究)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);workflow(abstract);分类 cs.AI、cs.CL
机构 * University of Waterloo(滑铁卢大学) ; Votee AI ; Vector Institute(向量研究所)
专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI、cs.CL
Comments accepted to ACL 2025 main, camera ready
专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.LG
Comments Open source code available at https://github.com/moment-timeseries-foundation-model/TimeSeriesGym. YC, XL, MG and MW contributed equally, and should be considered joint first authors
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
Comments 9 pages, 5 figures, 1 table
专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
Comments Minor typos revision
专题命中 Agent评测 :planning(abstract);workflow(abstract);function calling(abstract);分类 cs.AI、cs.LG
专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG
Comments Our project website is at: http://generalroboticslab.com/CREW
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
Comments Accepted by EMNLP 2024 Findings
专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.LG
Comments 32 pages, 13 figures, previous version published as a NeurIPS 2021 workshop: https://openreview.net/forum?id=Np8Pumfoty
专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG
Comments ICML 2023
专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.LG
Comments 7 pages, 7 figures
专题命中 Agent评测 :agent(abstract);tool use(abstract);multi-agent(abstract);分类 cs.AI、cs.LG
专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.LG
专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.LG
Comments Adaptive Learning Agents (ALA) Workshop at AAMAS 2019. arXiv admin note: substantial text overlap with arXiv:1812.00045
专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG
Comments The authors contributed equally to this work
专题命中 Agent评测 :agent(abstract,comments);agentic(abstract);multi-agent(abstract);分类 cs.CL
Comments 42p, 17f, 10t. Revisions: Merged paragraphs in Intro to emphasize contributions. Clarified benchmark design (Sec 3.5.1). Added single-agent, OpenAI-guided & 6-round experiments (Sec 5.2). Note: we only ran each experiment once; statistical tests are needed for strong claims. Revised Sec 6. Added acknowledgements, 2 new co-authors, and corrected typos/grammar
专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI
Journal ref 24th International Conference on Autonomous Agents and Multiagent Systems 2025
智能体模型对公交线路规划问题复杂度的影响
专题命中 Agent评测 :agent(title,abstract)
AI总结 该研究分析公交线路规划问题的复杂度,发现智能体成本模型、是否允许智能体选择步行等因素会影响问题难度,相关结果还证明了其NP-hard性与参数化难解性。
基于核化多臂老虎机的动态委托代理问题中的自适应激励设计
专题命中 Agent评测 :agent(title,abstract)
AI总结 本文针对动态委托代理问题的现有局限,提出引入随机效用模型的Heteroscedastic GP-UCB算法,建立了累积遗憾界,并在V2G激励设计中验证了其更优的经济性能。
零和思维对代理利益的损害在正和世界中有多大?
专题命中 Agent评测 :agent(title,abstract)
AI总结 研究零和决策规则(maximin和minimax)在正和战略环境中的影响,发现maximin在某些情况下比纳什均衡更有利于代理利益,且两者在游戏类别上具有相同的数量级。
一种用于指导零样本加密货币交易的反思型大语言模型智能体
专题命中 Agent评测 :agent(title,abstract)
AI总结 本研究开发了结合链上链下数据分析与反思机制的LLM智能体CryptoTrade,拓展了LLM在加密货币交易的应用,建立了相关策略基准,其收益表现优于传统策略和时间序列基线。
Comments Published at EMNLP 2024 (Main Conference)
SteerBench-Work:动作边界处智能体决策的基准测试
机构 * AgentDock
专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL、cs.LG
AI总结 本研究推出职场智能体动作边界决策基准SteerBench-Work,发现模型在该任务中存在过度拒绝的显著偏差,且通用能力与引导校准并不等同。
通过代理评估和稳定性感知排名实现多模态大语言模型的鲁棒检查点选择
机构 * Meta AI
专题命中 Agent评测 :agentic(title);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出了一种多阶段框架,结合了精心挑选的现实世界数据、结构化的LLM判断和多阶段排名协议,以解决多模态大语言模型检查点选择中的鲁棒决策问题,强调数据质量(特别是OCR可读性)对评估有效性的重要性。
作为智能体可调用工具的分光双星探测:从SDSS DR19 APOGEE光谱中探测40000+主序双星候选体
专题命中 Agent评测 :agent(title,abstract)
AI总结 本研究将分光双星探测方法打包为智能体可调用工具,从SDSS DR19 APOGEE光谱中探测出41466个SB2双星候选体,新增大量相关天体并完成多项分析,发布工具与星表。
Comments 23 pages, 16 figures, submitted to OJAp
技能不是文档:面向LLM智能体技能路由的查询条件基准与两阶段检索器
专题命中 Agent评测 :agent(title,abstract)
AI总结 针对LLM智能体技能路由中技能兼容性被忽视的问题,提出Reject-as-Resource Retriever (R3)框架,构建双语基准R3-Skill,并设计两阶段检索系统(R3-Embedding + R3-Reranker)显式建模技能兼容性,显著提升检索效果。
Comments 24 pages, 8 figures
通过智能体引导的精确平方和证书证明4维下的Dittert猜想
专题命中 Agent评测 :agent(title,abstract)
AI总结 该研究通过智能体引导的符号-数值方法构造精确平方和证书,在4维下证明Dittert猜想,确定均匀矩阵为对应Dittert泛函的唯一最大值点,且证书经Lean形式化验证。