A Survey of Personalization: From RAG to Agent
专题命中 Agent评测 :agent(title,abstract);planning(abstract);agentic(abstract)
Comments 18 pages, 5 figures
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 Agent评测 :agent(title,abstract);planning(abstract);agentic(abstract)
Comments 18 pages, 5 figures
专题命中 Agent评测 :agent(title,abstract);planning(abstract);multi-agent(abstract)
Comments arXiv admin note: substantial text overlap with arXiv:2406.02063
Journal ref JFSMA-JFMS 2024
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract)
专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.LG;autonomous agent(comments)
Comments Full version of the paper presented at AAMAS 2018 (International Conference on Autonomous Agents and Multiagent Systems)
面向开放式护理计划协调的自适应竞技场式可争议专家论证网络
机构 * University of New Brunswick(新不伦瑞克大学) ; National Research Council Canada(加拿大国家研究委员会)
专题命中 Agent评测 :agent(summary_cn,abstract);multi-agent(abstract);分类 cs.AI
AI总结 针对开放式护理计划协调中单一LLM流程的不足,提出多Agent神经符号框架CANOE,经医学微调模型在相关数据集上表现出强临床正确性,且CANOE具备可解释性与人类可争议性。
Comments Accepted at the 4th International Conference on Frontiers of Artificial Intelligence, Ethics, and Multidisciplinary Applications
ASTELD:自主AI智能体的六轴分类框架——设计、评估与OpenClaw案例研究
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract,comments);分类 cs.AI
AI总结 该研究提出ASTELD六轴分类框架,用于比较自主AI智能体平台,通过案例研究验证其效用,揭示跨平台模式与创新方向,发现本地优先部署与企业级安全结合的空白区域。
Comments 40 pages, 4 figures, 6 tables. Introduces and empirically evaluates the ASTELD six-axis classification framework across eight autonomous AI agent platforms, with OpenClaw as an in-depth case study
ExtractBench:模式引导的企业文档抽取基准
专题命中 Agent评测 :agentic(summary_cn,abstract);agent(abstract);分类 cs.AI
AI总结 研究针对企业文档模式引导抽取的评估需求,构建首个同时评估值准确率等多指标的基准ExtractBench,发现LlamaExtract Agentic Plus在成本远低于编码智能体的情况下,准确率可与之媲美。
从分析到综合:个性化大语言模型智能体中的隐式行为对齐基准测试
机构 * National University of Singapore(新加坡国立大学) ; University of Toronto(多伦多大学) ; University of Minnesota Twin Cities(明尼苏达大学双城分校) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; University of Oxford(牛津大学)
专题命中 Agent评测 :agent(summary_cn,abstract);autonomous agent(abstract);分类 cs.AI
AI总结 该研究针对大语言模型智能体的个性化问题,构建了IBA-Bench基准,提出IBA-Agent框架,实验显示其可在九类场景中提升隐式行为对齐效果,但有效个性化仍是重大挑战。
I-WebGenBench: 评估大语言模型生成的科学网页应用中的交互性
机构 * Vast Intelligence Lab(vast 智能实验室) ; UTS ; University of Liverpool(利物浦大学)
专题命中 Agent评测 :agent(summary_cn,abstract);autonomous agent(abstract);tool use(abstract);分类 cs.CL
AI总结 提出 Paper-to-Interactive-System Agent 将研究论文转化为可执行交互式网页系统,并构建 PaperVoyager 框架以显式建模机制和交互逻辑,显著提升生成质量。
Comments 9 pages, 4 figures
面向VLM-as-a-Judge评估的视障辅助基准
机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)
专题命中 Agent评测 :agent(summary_cn,abstract);workflow(abstract);分类 cs.CL
AI总结 针对视障辅助任务中VLM-as-a-Judge评估的可靠性问题,提出VIABLE基准(含30万+样本、有效性-公正性-稳定性框架及12种失败模式分类),发现现有模型不可靠,并开发VIA-Judge-Agent方法提升诊断准确性和用户偏好。
Agentick: 一个统一的连续决策制定代理基准测试
机构 * Mila Quebec AI Institute(魁北克AI研究所) ; Université de Montréal(蒙特利尔大学) ; Google DeepMind(谷歌DeepMind)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract);planning(abstract)
AI总结 Agentick是一个统一的连续决策制定代理基准测试,评估RL、LLM、VLM等代理在共同基础上的表现,揭示各方法的不足,为通用自主代理研究提供实验基础。
AI代理合谋的脆弱性
机构 * National University of Singapore(新加坡国立大学) ; Boston University(波士顿大学)
专题命中 Agent评测 :agent(title);AI agent(title);分类 cs.AI
AI总结 本文研究了AI代理合谋的脆弱性,发现异质性会减少合谋均衡。实验显示,耐心异质性和数据访问异质性削弱合谋,而模型大小差异反而稳定合谋,讨论了反垄断政策。
Comments 48 pages, 7 figures, 8 tables (including appendix)
Helmsman: 通过协作LLM代理实现联邦学习系统的自主合成
机构 * Eindhoven University of Technology(埃因霍温理工大学)
专题命中 Agent评测 :agent(abstract);planning(abstract);workflow(abstract);agentic(abstract)
AI总结 Helmsman通过协作LLM代理实现联邦学习系统的自主合成,提供端到端的自动化解决方案,生成性能优于传统手工基线。
专题命中 Agent评测 :agent(title);AI agent(title);分类 cs.AI
Comments Add Limitations section
机构 * Harvard Medical School(哈佛医学院) ; University of Saskatchewan(萨斯喀彻温大学) ; University Hospital Heidelberg (UKHD)(海德堡大学医院(UKHD))
专题命中 Agent评测 :agent(title);AI agent(title);分类 cs.CL
专题命中 Agent评测 :agent(title);multi-agent(title);分类 cs.CL
基于缩放假设的无标签智能体学习控制器能力评估
机构 * Georgian
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出基于缩放假设的无标签智能体学习控制器评估框架,以教师模型与学生模型的收敛度为评分指标,验证其可作为标签缺失时控制器真实增益的有效代理。
Comments 18 pages, 6 figures. Accepted at CAMLIS 2025 (Conference on Applied Machine Learning for Information Security)
AI智能体为何违反规则?框架、情境与社会信号如何影响合规性
专题命中 Agent评测 :AI agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 该研究运用法律与经济学的合规理论,发现安全微调AI模型大体合规,任务优化与智能体模型会在低惩罚等条件下违规,且引入经济激励等会导致大规模合规失败,指出模型选择与合规性评估需改进。
智能体网络安全的下一个挑战:一个现实、无污染的逆向工程基准
专题命中 Agent评测 :agentic(title,abstract);AI agent(abstract);分类 cs.AI、cs.SE
AI总结 研究针对智能体逆向工程基准的缺陷,构建SRE-Bench基准,评估五款前沿LLMs的逆向工程能力,发现RE仍未解决,强调其为智能体网络安全重要前沿及SRE-Bench的测试价值。
TRACE Bench:任务驱动的角色扮演智能体清单评估基准
机构 * Kuaishou GameMind Lab(快手GameMind实验室)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL
AI总结 研究针对角色扮演评估的黑箱问题,提出TRACE Bench框架,通过清单分解与对话跟踪实现更透明的评估,在覆盖度、鲁棒性等方面优于现有基准,支持闭环演化。
Comments Project page: https://kuaishou-gamemind.github.io/projects/trace_bench/. Code: https://github.com/KuaishouGameMind/TRACE-Bench
协作差距:开放世界智能体协作的探索与基准测试
机构 * EPFL(瑞士联邦理工学院) ; Microsoft Research(微软研究院)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL
AI总结 该研究提出协作迷宫求解基准,评估32个模型的协作能力,发现模型存在协作差距,提出中继推理等缓解措施,强调协作相关评估、训练与交互设计的重要性。
Comments Accepted to COLM 2026, code available at https://github.com/trdavidson/collaboration_gap
智能体自动驾驶显微镜基准测试支持性能验证,但不一定能泛化到未见任务
机构 * Carl Zeiss Research Microscopy Solutions(卡尔蔡司研究显微镜解决方案)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG
AI总结 本研究开发基准框架评估显微镜智能体架构等因素的性能,发现其虽可用于验证比较,但现有基准无法预测智能体在未见显微镜任务上的表现。
Comments 20 pages, 8 figures
InsightEmb:面向智能体洞察检索的动作-意图嵌入学习
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; WeChat AI, Tencent(腾讯微信人工智能)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL
AI总结 该研究针对智能体洞察检索任务,提出对比嵌入框架InsightEmb,利用数学推理数据学习可迁移的检索几何结构,在无特定环境训练时优于现有模型,验证了匹配几何结构的跨域迁移性。
CUADebug:计算机使用智能体故障的诊断与修复
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 本研究提出CUADebug框架,含错误分类、CUAErrorBench基准与CUADebugger工具,可诊断修复计算机使用智能体故障,提升任务完成与重新执行成功率,证明其能提供可操作修复信号。
Comments 23 pages, 10 figures, 6 tables
SecRespond:面向真实入侵后事件响应的AI智能体基准测试集
专题命中 Agent评测 :AI agent(title);agent(abstract);workflow(abstract);分类 cs.AI、cs.CL
AI总结 研究人员推出首个入侵后事件响应AI智能体基准测试集SecRespond,评估23种前沿LLM在10个靶场的表现,发现现有智能体难以及时发现隐蔽入侵并制定全面修复计划,存在根本瓶颈。
EvoPINN:面向物理信息神经网络可执行算法的智能体式发现框架
机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG
AI总结 EvoPINN是智能体式框架,将PINN开发转化为基于执行的算法发现,通过LLM智能体迭代优化,自主发明SLRC-PINN,可显著降低PDE求解的相对L₂误差,为科学计算提供新机制。
SARC-DQ:智能体AI的运行时数据质量门控:隐性证据缺陷、无能防护机制与仅下游修复
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE
AI总结 该研究针对智能体AI的元数据缺陷问题,提出SARC-DQ运行时数据质量门控机制,实验显示模型能力未提升怀疑能力,所提门控结合下游修复可恢复部分损失,无模型预言机能精准跟踪缺陷率。
Comments https://github.com/besanson/dqSarc
$τ$-Rec:面向智能推荐系统的可验证基准
机构 * Independent Researcher(独立研究员) ; Princeton University(普林斯顿大学)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL
AI总结 针对多轮对话式智能推荐系统评估中主观性强、成本高的问题,提出$τ$-Rec基准,通过可验证奖励和揭示标记引导机制,结合pass^k可靠性指标,系统评估模型推理一致性,发现当前最佳模型可靠性仅约57%。
Comments Accepted at ACM RecSys 2026 (Reproducibility and Resource Track)
对时间、空间和语义规避的自主代理进行基准测试
机构 * Tsinghua University(清华大学)
专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出了一种针对基于大语言模型(LLM)的代理系统的多维规避框架,通过引入时间、空间和语义三种隐蔽攻击向量,系统地量化了这些威胁,并展示了其在实际威胁场景中的效果,揭示了现有自主代理系统在架构层面的系统性漏洞。
Comments 18 pages, 12 figures, 8 tables. Code and data available at https://github.com/antgroup/Agent3Sigma-Stage
用于基础设施即代码生成的智能语言模型的验证优先评估
专题命中 Agent评测 :agentic(title,abstract);planning(abstract);分类 cs.AI、cs.SE
AI总结 研究针对自然语言生成基础设施即代码的问题,对七种智能策略在特定基准测试上进行验证优先评估,通过多种方法得出如主动检索提升性能、迭代优化有收敛效果等五个主要发现,为相关研究提供了重要参考。
Comments 26 pages, 3 figures, 17 tables. Benchmark dataset available at https://huggingface.co/datasets/iac-eval-v2/iac-eval-v2