Quantum Consciousness Soccer Simulator
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI
Comments 9 pages, grammatically improved
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI
Comments 9 pages, grammatically improved
在组合知识库中通过反思性编辑传播扩展专家反馈
专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(journal_ref)
AI总结 提出RAID系统,通过反思性代理推断专家编辑意图并自动传播到整个知识库,以规模化扩展专家反馈。
Comments Accepted to ACM CAIS '26 Demo Track
Journal ref ACM Conference on AI and Agentic Systems (CAIS '26), May 26-29, 2026, San Jose, CA, USA
专题命中 Agent评测 :agent(abstract,comments);AI agent(abstract)
Comments Published in Proceedings of the 10th International Conference on Human-Agent Interaction (HAI2022)
专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG;agent(comments);multi-agent(comments)
Comments 47 pages, 10 figures. Code: https://github.com/agodinezmm2007/docling_mod. Demo: https://youtu.be/ZCy5ESJ1gVE?si=K8CttwgTj7yGrWjn. ETL+multi-agent RAG framework for literature synthesis, 35.1% improvement over PDF chunking. Real application: reduced 17,400 papers to 24 relevant ones (99.86%) in 10 minutes for wastewater epidemiology review
专题命中 Agent评测 :agent(comments,journal_ref);autonomous agent(comments,journal_ref);multi-agent(comments,journal_ref);分类 cs.AI、cs.LG
Comments 19 pages, The 24th International Conference on Autonomous Agents and Multi-Agent Systems (AAMAS25)
Journal ref The 24th International Conference on Autonomous Agents and Multi-Agent Systems, AAMAS-2025
通过块替换改进部分序计划的执行并发性
专题命中 Agent评测 :planning(abstract);分类 cs.AI;agent(journal_ref);autonomous agent(journal_ref)
AI总结 本文提出通过块替换优化部分序计划的并发性,通过引入非并发约束条件和资源优化算法,提升计划执行效率。
Comments arXiv admin note: text overlap with arXiv:2406.03091
Journal ref Autonomous Agents and Multi-Agent Systems, vol. 39, April 2025
专题命中 Agent评测 :agent(abstract,comments);分类 cs.AI;autonomous agent(comments);multi-agent(comments)
Comments This is an updated version of the paper which appeared at the 23rd International Conference on Autonomous Agents and Multi-Agent Systems (AAMAS-24)
专题命中 Agent评测 :agent(abstract,comments);分类 cs.AI;autonomous agent(comments);multi-agent(comments)
Comments This version is to appear in Autonomous Agents and Multi-Agent Systems
Journal ref A previous version presented at AAAI 2019 with the title 'Object Reachability via Swaps along a Line'
专题命中 Agent评测 :agent(abstract,comments);分类 cs.AI;autonomous agent(comments);multi-agent(comments)
Comments 18 pages, 3 figures, Proceedings of the 16th Conference on Autonomous Agents and Multi-Agent Systems (AAMAS, 2017)
AI4AI-Bench:用于递归自我改进算法设计中大语言模型智能体的基准测试
机构 * Navers Lab(Navers实验室) ; Tsinghua University(清华大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出AI4AI-Bench基准测试,测试大语言模型智能体设计训练算法的能力,实验显示现有智能体仅缩小了已有算法与最优值间不到五分之一的差距,发布相关资源供重复测量。
Task-CoEvolve:通过自适应验证任务选择实现高效的智能体框架优化
机构 * The University of Tokyo(东京大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 Task-CoEvolve通过自适应验证任务选择,使LLM智能体框架与验证任务协同演化,在保持全集搜索最终性能的同时,减少80%评估次数,实现高效的智能体框架优化。
Comments Github: https://github.com/Agent4Science-UTokyo/Task-CoEvolve
随机突变作为新冠病毒新变体出现的机制——关于人工智能范式的科学猜想
专题命中 Agent评测 :agent(abstract);AI agent(abstract)
AI总结 本文总结新冠疫情传播动力学研究,提出科学猜想是科研的重要驱动力,还提出问答式AI相比AI智能体更高效低成本的AI范式猜想。
Comments 22 pages, 4 figures
面向单步逆合成的化学合理性感知大语言模型训练
机构 * Insilico Medicine AI Limited(英矽智能人工智能有限公司) ; Insilico Medicine Canada Inc.(英矽智能加拿大公司) ; Insilico Medicine Hong Kong Ltd.(英矽智能香港有限公司)
专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 该研究针对单步逆合成的一对多特性,提出Top-K提示范式,构建超大规模反应数据集训练C3LM,结合特定奖励机制在基准上达最优性能,为逆合成系统提供新方向。
LLM委托的契约:技术与努力选择中的道德风险
专题命中 Agent评测 :agent(abstract);agentic(abstract)
AI总结 该研究扩展委托-代理框架至LLM委托场景,推导最优线性契约,用MATH、MMLUPro基准校准模型,证明线性契约可激励智能体的技术感知委托行为。
基于深度强化学习的量子电路优化:跨多门集的应用
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract)
AI总结 该研究提出将CR算法嵌入强化学习环境的框架,在两类门集上实现更短量子电路,训练于小电路的RL可应用于大电路,为量子系统编译优化提供稳健方法。
Comments 11 pages, comments welcome
SCOPE-Router:面向执行导向任务的成本感知开放集视觉语言模型路由
机构 * CASIA(中国科学院自动化研究所) ; UCAS(中国科学院大学) ; NUS(新加坡国立大学) ; Tencent(腾讯)
专题命中 Agent评测 :agentic(abstract,abstract_cn)
AI总结 本文提出SCOPE-Router与CRM+RCCR,构建执行导向VLM路由基准VLM-ExecRouterBench,解决现有VLM路由局限,在多基准上取得更优性能。
OccDirector:基于语言的4D占用空间中行为与交互生成
机构 * SKL-IOTSC, CIS, University of Macau, Macau, China(SKL-IOTSC、CIS、澳门大学、澳门、中国) ; Li Auto Inc, Beijing, China(Li Auto Inc、北京、中国)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract)
AI总结 本文提出OccDirector框架,通过自然语言生成4D占用空间动态,解决复杂多代理交互生成问题,引入多级语言指令数据集和评估基准,实现语言驱动的行为编排。
SkillNet: 创建、评估和连接AI技能
机构 * Zhejiang University(浙江大学) ; Tongji University(同济大学) ; Southeast University(东南大学) ; Alibaba Group(阿里巴巴集团) ; Tencent(腾讯) ; Fudan University(复旦大学) ; The University of Edinburgh(爱丁堡大学) ; Monash University(墨尔本大学) ; National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学) ; Huzhou University(湖州大学) ; Hornor Device Co., Ltd(Hornor设备有限公司) ; Hangzhou Institute for Advanced Study, UCAS(杭州先进研究所,UCAS)
专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 SkillNet通过统一的本体和多维评估机制,大规模创建、评估和连接AI技能,提升代理性能并促进技能的持久掌握。
Comments http://skillnet.openkg.cn/; add SkillNet-Gym, a benchmark for evaluating skill retrieval, utilization, composition, and SkillNet-Fabric for task-specific skill routing through lightweight Wikis
自改进智能体的脆弱性:方差、任务顺序与规格不足
机构 * Salesforce AI Research(Salesforce AI研究院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本研究通过多轮运行与打乱任务顺序的实验,揭示当前基于记忆的自改进智能体存在脆弱性,发现其性能受方差与任务顺序影响,还指出规格不足是相关诱因,呼吁采用更严格评估方案与人工监督机制。
Comments Code: https://github.com/SalesforceAIResearch/self-improve-fragility Data: https://huggingface.co/datasets/Salesforce/self-improve-fragility
HarnessEval-W:将视觉世界评估智能体化
专题命中 Agent评测 :agent(abstract);workflow(abstract)
AI总结 该研究提出智能体化评估流程HarnessEval-W,将LLM生态的harness范式应用于世界模型基准测试,对18个世界模型的330个案例评估,其判断与人类偏好一致且提供可验证诊断,已开源并邀社区贡献。
Comments Project Page: https://mirros-lab.github.io/HarnessEval-W
FDABench:异构数据上分析查询的数据代理基准
专题命中 Agent评测 :agent(abstract);agentic(abstract)
AI总结 提出FDABench基准,通过2007个任务覆盖六种数据模态,并设计PUDDING框架自动构建数据集,以评估数据代理在异构数据上的推理能力。
Comments Accepted to KDD'26
HumanoidVLN:面向多种人形机器人形态的基于物理的视觉语言导航模拟器与基准
机构 * VinMotion, Inc.(VinMotion公司) ; University of Southern California(南加州大学)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract)
AI总结 本研究针对人形机器人VLN的物理约束与形态差异问题,提出基于NVIDIA Isaac Sim的HumanoidVLN模拟器与基准,验证其与多种模型、机器人的兼容性,实验揭示了VLN模型、控制器与人形形态的交互关系。
仓颉基准:在低资源通用编程语言上评估大语言模型
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 本文提出CangjieBench,用于评估大语言模型在低资源通用编程语言上的表现,通过248个高质量样本覆盖文本到代码和代码到代码任务,发现语法受限生成在准确性和计算成本之间取得最佳平衡。
Comments Accepted by ESEM 2026
基于声誉的自适应探索的强化学习促进合作的进化
专题命中 Agent评测 :agent(abstract);multi-agent(abstract)
AI总结 本文提出一种结合局部声誉差异和非对称状态依赖声誉更新的Q学习模型,通过高声誉低探索、低声誉高探索机制促进合作,并增强低地位的合作收益和高地位的背叛惩罚。
Comments 12 pages, 6 figures
Journal ref Chaos: An Interdisciplinary Journal of Nonlinear Science, 2026, 36(8)
VideoVIBE:用于一次性交互式网站生成的基于视频的诊断基准
专题命中 Agent评测 :agent(abstract);multi-agent(abstract)
AI总结 针对现有一次性交互式网站生成质量评估的不足,提出VideoVIBE基准与V2Lens多智能体系统,实验显示V2Lens可提升Video MLLM的评估性能。
确定性跨域接口的自动合成
专题命中 Agent评测 :agent(abstract,abstract_cn)
AI总结 该研究提出框架,利用LLM实现智能体与处理程序模块,自动合成跨域确定性网络的静态、动态契约,经实验验证其动态契约性能优于静态配置,且分工模式可保障模型可靠性。
奖励塑造以缓解强化学习从人类反馈中的奖励黑客
机构 * Fudan University(复旦大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 PAR通过利用奖励模型中的潜在偏好信号,有效缓解RLHF中的奖励黑客问题,表现出更高的性能和数据效率。
克服动作可控世界模型中的统计偏差
专题命中 Agent评测 :agent(abstract);planning(abstract)
AI总结 该研究针对动作可控世界模型的统计偏差问题,提出CoCo反事实一致性框架,结合ARC、DE评估指标及Mini-SSMB数据集,在多项任务上提升了动作可控性与视频预测性能。
用于工具结构化大语言模型推理方法的仅幅度前馈网络干预:门控评估协议及跨模型实证结果
专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 研究推理时FFN干预改善大语言模型结构化输出,提出无损的幅度门控方法,定义细粒度干预系统和评估协议。在多个模型上实验,AG在工具结构化任务中效果最佳,不同AG变体各有优劣,确定工具结构化推理是FFN级推理优化首要目标。
Comments 30 pages, 9 figures
ContinualSkillBench:大语言模型智能体真的能发展其能力吗?
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本研究提出动态评估框架ContinualSkillBench,发现大语言模型智能体顺序执行可提升任务性能,上下文学习与显式技能维护效果相当,弱模型易积累零散技能,当前机制仍难整合经验为稳健可迁移技能。