arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2608.19974 2026-08-21 cs.AI 新提交 74%

ReguSim: Evaluating LLM Agent Rule Grounding in Financial Compliance

ReguSim:评估大语言模型智能体在金融合规中的规则落地

Yiyang Luo, Yihang Jiang, Qijun Xie, Liang Lan, Lin Willian Cong, Anyi Rao, Yunya Song

机构 * HKUST(香港科技大学) HKBU(香港浸会大学) NTU(新加坡南洋理工大学)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 研究针对LLM智能体在金融合规中的规则落地问题,构建ReguSim环境与ReguBench基准,发现可见规则无法完全消除违规动作,结构化监控基线表现优于纯提示LLM,为金融合规评估提供新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17756 2026-08-20 cs.AI 版本更新 74%

D$^2$ACCI: A Dual-Loop Diagnostic Protocol for Evidence-Preserving Agent Memory

D²ACCI:一种用于保留证据的智能体记忆的双循环诊断协议

Xule Liu, Yijun Liu, Chao Li, Shao Kun

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 该研究针对LLM智能体持久记忆流程故障难以定位的问题,提出双循环诊断协议D²ACCI,引入DCR指标与D²ACCI-Eval人工制品,在三个公开基准上取得明确性能增益,填补了记忆系统迭代缺乏可追踪证据的空白。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15391 2026-08-18 cs.AI cs.CR 新提交 74%

TwinGridShield: Consequence-Aware Runtime Authorization for LLM Grid-Agent Actions

TwinGridShield:面向LLM网格智能体动作的后果感知运行时授权

Md Fazley Rafy

机构 * West Virginia University(西弗吉尼亚大学)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 TwinGridShield是与模型无关的LLM网格智能体动作运行时授权层,通过确定性网络孪生体评估动作,在匹配模型实验中实现0次不安全发布,模型不匹配下鲁棒性存在一定风险。

Comments 6 pages, 3 figures, 4 tables and accepted in North American Power Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12880 2026-08-14 cs.CR cs.AI 新提交 74%

Labels Are Not Endpoints: Treatment Leakage and Construct Validity in MCP Agent Security Evaluation

标签并非终点:MCP智能体安全评估中的处理泄露与构念效度

Rana Muhammad Ahmed, Sabahat Abbas

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 本研究针对MCP智能体安全评估中标签与行为事实的偏差问题,通过审计留存评估活动发现处理泄露现象,提出七环节完整性链及端点完整性检查器,完成活动受限的测量审计。

Comments 24 pages, 10 figures, 4 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12814 2026-08-14 cs.CL 新提交 74%

FastThaiG2P: Lightning-fast Thai Grapheme-to-phoneme Conversion for Voice Agent Pipelines

FastThaiG2P:面向语音智能体流水线的极速泰语字素转音素转换工具

Charin Polpanumas

机构 * AWS(亚马逊云科技)

专题命中 Agent评测 :agent(title);分类 cs.CL

AI总结 FastThaiG2P是一款极速泰语字素转音素转换工具,采用PyThaiNLP分词字典与归一化规则,亚毫秒级延迟,可支撑泰语TTS开发,经其处理的数据集训练出的StyleTTS 2模型合成语音清晰,实时率达0.25。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11392 2026-08-14 cs.CR cs.AI 版本更新 74%

AI Guardrail Survival under Single-Cycle Agentic Self-Summarization

单循环智能体自摘要下的AI安全护栏存续性

Ted Kwartler, Alan Aqrawi, Arian Abbasi

专题命中 Agent评测 :agentic(title);分类 cs.AI

AI总结 本研究探究单循环智能体自摘要中安全规则的丢失机制,发现仅检查规则文本存在性的审计不可靠,需结合外部真实值检测,还指出仅靠LLM评判标签会反转评估结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09251 2026-08-11 cs.AI 版本更新 74%

DRBENCHER: Can Your Agent Identify the Entity, Retrieve Its Properties and Do the Math?

DRBENCHER:你的智能体能识别实体、检索其属性并进行数学运算吗?

Young-Suk Lee, Ramon Fernandez Astudillo, Radu Florian

机构 * IBM Research(IBM研究院)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 DRBENCHER通过综合评估浏览与计算能力,揭示了现有基准测试的不足,其四维标准确保了问题的可验证性、复杂性、难度和多样性,展示了智能体在动态数据环境下的性能限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05778 2026-08-07 cs.AI 新提交 74%

When Do Prompt-Side Agent Playbooks Transfer? Accuracy, Cost, and Runtime Shift in Agent Deployment

提示侧智能体剧本何时可迁移?智能体部署中的准确性、成本与运行时偏移

Weihong Lin, Lin Sun, Xiangzheng Zhang

机构 * Beijing Qiyuan Technology Co., Ltd.(北京奇源科技有限公司)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 该研究在蒸馏-验证-迁移协议下探究提示侧智能体剧本的可迁移性,在ALFWorld、TAU2-Bench、XBench-DeepSearch等基准上测试发现其为有条件的冷启动选项,需目标侧验证相关指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02880 2026-08-07 cs.IR cs.LG 版本更新 74%

Field Aware Agent Skill Retrieval

领域感知智能体技能检索

Paimon Goulart, Liang Wu, Kelly Wan, Evangelos E. Papalexakis, Liangjie Hong

专题命中 Agent评测 :agent(title);分类 cs.LG

AI总结 本研究针对终身学习智能体技能检索瓶颈,提出领域感知的技能表示方法,通过保留技能的多字段结构计算相似度,在 SkillRet 和 SRA-Bench 基准上取得优于拼接基线的检索效果,且优势随技能库规模增大而提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03154 2026-08-05 cs.CL 新提交 74%

ANCHOR-RE: An Agentic Neuro-Symbolic Framework for Grounded Biomedical Relation Extraction

ANCHOR-RE:用于接地生物医学关系抽取的智能体神经符号框架

Shufan Ming, Yikun Han, Gibong Hong, Rui Zhang, Halil Kilicoglu

专题命中 Agent评测 :agentic(title);分类 cs.CL

AI总结 该研究提出ANCHOR-RE框架,将本体引导推理等集成到LLM推理中,在多个BioRE基准及2026年生物医学文章数据集上,该框架性能优于直接LLM提示及部分现有方法,是实用的无训练生物医学文献挖掘方法。

Comments Submitted to Journal of Biomedical Informatics (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18529 2026-08-03 cs.HC cs.AI 版本更新 74%

EduPanel: A Three-Agent LLM Judge for Teaching Videos -- Reliability, Complementarity, and Human Trust Calibration

EduPanel:用于教学视频的三智能体大语言模型评判器——可靠性、互补性和人类信任校准

Jia-Kai Dong, Yi-Cheng Lin, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) NTU Artificial Intelligence Center of Research Excellence(NTU人工智能卓越研究中心)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 针对教学视频教学质量评估需求,提出基于评分标准、以学习者为条件的EduPanel大语言模型评判器,通过专门智能体分解评估,经多项分析实现高可靠性,能辅助教育评估,提高评分准确性且让专家可检测不可靠输出。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17877 2026-08-03 cs.AI 版本更新 74%

PAIR: Prefix-Aware Internal Reward Model for Multi-Turn Agent Optimization

PAIR:面向多轮代理优化的前缀感知内部奖励模型

Wonjoong Kim, Yeonjun In, Sangwu Park, Dongha Lee, Chanyoung Park

机构 * KAIST(韩国科学技术院) Yonsei University(延世大学)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 本文提出PAIR模型,通过结合冻结的隐藏状态探针和轻量级注意力头部,解决多轮任务中内部正确性探针的可靠性问题,从而在不依赖外部模型调用或地面真实依赖的情况下,为GRPO训练提供密集的步骤级奖励信号。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28317 2026-07-31 cs.AI 新提交 74%

One Human, $N$ Agents: Audit-Budget Allocation for LLM Agent Fleets under Miscalibrated, Correlated Confidence

一个人类,N个智能体:校准不当且相关置信度下LLM智能体集群的审计预算分配

Cesare Zavattari, Alessandro Tommasi, Giuseppe Prencipe

机构 * Università di Pisa(比萨大学)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 针对单人类需在有限审计预算下审计N个LLM智能体的问题,研究了置信度校准不当且存在相关性时的审计预算分配,发现校准阈值的变化规律,验证了部分大语言模型置信度的实用性,给出了无效监督的定量准则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21799 2026-07-28 cs.CL cs.CY 版本更新 74%

Agentic Evaluation of Copyright Law Compliance

版权法合规性的智能体评估

Zheng Hui, Doni Bloomfield, Noam Kolt

专题命中 Agent评测 :agentic(title);分类 cs.CL

AI总结 研究LLM智能体版权法合规性评估问题,通过引入Copyright - Bench基准,由网站开发等商业任务组成,含提示变化与时间压力,对比智能体与人类基线,发现智能体存在选择版权作品及违规率受偏好和压力影响等情况。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29596 2026-07-07 cs.SI cs.LG 版本更新 74%

Boundary Degree as a Node-level Feature for Epidemic Scenario Identification in Agent-based Cascade Simulations

边界度作为基于智能体的级联模拟中流行病场景识别的节点级特征

Amro Alabsi Aljundi, Galen Harrison, Jiangzhuo Chen, Abhijin Adiga, Anil Kumar Vullikanti, Madhav V. Marathe

机构 * Biocomplexity Institute(生物复杂性研究所)

专题命中 Agent评测 :agent(title);分类 cs.LG

AI总结 提出边界度作为节点级级联特征,通过消融实验证明其单独提升场景识别准确率19%,并理论证明无边界或边信息时某些场景不可区分。

Comments 28 pages, 10 figures, preliminary version; not final

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22164 2026-06-23 cs.LG 新提交 74%

Drowning in Routine: Signal Dilution in Multi-Turn Agent Training

淹没在例行公事中:多轮智能体训练中的信号稀释

Yann Pernot, Vi Retault

机构 * Mila - Qu\'ebec AI Institute

专题命中 Agent评测 :agent(title);分类 cs.LG

AI总结 本文提出决策密度ρ的概念,揭示多轮智能体训练中例行轮次导致信号稀释,并推导出轨迹级信噪比与ρ^{-1/2}成比例,实验验证了该缩放关系。

Comments Accepted at the FAGEN Workshop at ICML 2026, Seoul, South Korea. 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08552 2026-06-19 cs.DB cs.AI 版本更新 74%

Automated Standardization of Legacy Biomedical Metadata Using an Ontology-Constrained LLM Agent

使用本体约束的LLM代理自动化标准化遗留生物医学元数据

Josef Hardi, Martin J. O'Connor, Marcos Martinez-Romero, Jean G. Rosario, Stephen A. Fisher, Mark A. Musen

机构 * Division of Computational Medicine, Stanford University(斯坦福大学计算医学部) Department of Biology, University of Pennsylvania(宾夕法尼亚大学生物学系)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 提出基于LLM的元数据标准化系统,通过实时查询标准指南和本体服务,在839条HuBMAP记录上验证,相比纯LLM方法显著提升预测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18003 2026-06-17 cs.CR cs.AI cs.CY 版本更新 74%

BadScientist: Can a Research Agent Write Convincing but Unsound Papers that Fool LLM Reviewers?

BadScientist: 研究代理能否写出令人信服但不严谨的论文来欺骗LLM审稿人?

Fengqing Jiang, Yichen Feng, Yuetai Li, Luyao Niu, Basel Alomair, Radha Poovendran

机构 * University of Washington(华盛顿大学) King Abdulaziz City for Science and Technology(卡布斯科学与技术城) HUMAIN

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 提出BadScientist框架,通过无需真实实验的呈现操纵策略生成造假论文,揭示LLM审稿系统存在系统性漏洞,造假论文接受率高达一定水平,且审稿人存在“担忧-接受冲突”,当前检测方法效果有限。

Comments ACL 2026; Project Page at https://bad-scientist.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14715 2026-06-16 cs.MA cs.AI cs.SI 新提交 74%

MiroBench: Benchmarking Realism in Agentic Simulation of Real-world Discussions

MiroBench:真实世界讨论的智能体模拟真实性基准测试

Yaoning Yu, Ye Yu, Haojing Luo, Haohan Wang

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Starc.Institute(Starc研究院)

专题命中 Agent评测 :agentic(title);分类 cs.AI

AI总结 提出MiroBench基准,基于4292条真实Reddit帖子,通过统计测试评估LLM智能体模拟在重复性、叙事内容、毒性攻击和结构复杂度四个方面的分布匹配度,发现当前模拟器与真实讨论存在分布差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05333 2026-05-28 cs.AI 74%

Graph-of-Skills: Dependency-Aware Structural Retrieval for Massive Agent Skills

技能图谱:面向大规模智能体技能的依赖感知结构检索

Dawei Liu, Zongxia Li, Hongyang Du, Xiyang Wu, Shihang Gui, Yongbei Kuang, Lichao Sun

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Maryland(马里兰大学) Brown University(布朗大学) Carnegie Mellon University(卡内基梅隆大学) Lehigh University(莱斯大学)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 提出技能图谱(GoS),一种推理时的结构检索层,通过构建可执行技能图并利用混合语义-词汇种子、反向感知个性化PageRank和上下文预算水合,实现依赖感知的技能束检索,在SkillsBench和ALFWorld上显著提升奖励并节省令牌。

Comments 11 pages of main text, 12 pages of appendix. Core contribution by Dawei Liu and Zongxia Li. Project page: https://github.com/davidliuk/graph-of-skills

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23149 2026-05-27 cs.CL 74%

AlignEvoSkill: Towards Knowledge-Aware and Task-Aligned Agent Skill Evolution

AlignEvoSkill: 迈向知识感知与任务对齐的智能体技能进化

Dingzirui Wang, Xuanliang Zhang, Keyan Xu, Qingfu Zhu, Wanxiang Che, Yang Deng

机构 * Singapore Management University(新加坡国立大学)

专题命中 Agent评测 :agent(title);分类 cs.CL

AI总结 提出AlignEvoSkill框架,通过联合建模知识覆盖和任务对齐,从失败轨迹中识别知识标签、检索并适配候选技能,再基于知识覆盖和任务对齐分数筛选高质量技能,在3个基准和4个LLM骨干上相对提升34.7%,实现技能进化新SOTA且成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22984 2026-05-26 cs.AI 74%

Why Your Deep Research Agent Fails? On Hallucination Evaluation in Full Research Trajectory

为什么你的深度研究智能体会失败?关于完整研究轨迹中的幻觉评估

Yuhao Zhan, Tianyu Fan, Linxuan Huang, Zirui Guo, Chao Huang

机构 * Zhejiang University(浙江大学) The University of Hong Kong(香港大学)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 针对深度研究智能体(DRA)在完整研究轨迹中累积的幻觉问题,提出从结果评估转向过程感知评估的PING分类法和细粒度评估框架,并构建DeepHalluBench基准,实验揭示系统性的可靠性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22643 2026-05-25 cs.CL 74%

Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety

温水煮青蛙:面向智能体安全的多轮基准测试

Piercosma Bisconti, Matteo Prandi, Federico Pierucci, Federico Sartore, Enrico Panai, Laura Caroli, Yue Zhu, Adam Leon Smith, Luca Nannini, Marcello Galisai, Susanna Cifani, Francesco Giarrusso, Marcantonio Bracale Syrnikov, Daniele Nardi

机构 * Icaro Foundation(Icaro基金会) Sapienza University of Rome(罗马萨皮恩扎大学) Sant’Anna School of Advanced Studies(圣安娜高级研究学校) Tongji University School of Law(同济大学法学院) AIQI Consortium(AIQI联盟) Università Cattolica del Sacro Cuore(圣心大学) Piccadilly Labs(皮卡迪利实验室) VU Amsterdam(阿姆斯特丹伏伊大学) Independent(独立)

专题命中 Agent评测 :agentic(title);分类 cs.CL

AI总结 提出一个多轮基准测试,评估工具使用AI模型在办公场景中对渐进式攻击的脆弱性,发现平均攻击成功率为44.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05910 2026-05-20 cs.AI 74%

The World Won't Stay Still: Programmable Evolution for Agent Benchmarks

世界不会静止:为智能体基准测试的可编程进化

Guangrui Li, Yaochen Xie, Yi Liu, Ziwei Dong, Xingyuan Pan, Tianqi Zheng, Jason Choi, Michael J. Morais, Binit Jha, Shaunak Mishra, Bingrou Zhou, Chen Luo, Monica Xiao Cheng, Dawn Song

机构 * Amazon(亚马逊公司) UC Berkeley(伯克利大学)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 本文研究了结构化环境进化作为智能体基准测试构建问题,提出了一种基于图的框架ProEvolve,使环境进化可编程,并在电商和航班预订领域验证了其在质量、实现有效性及失败模式方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19337 2026-05-20 cs.AI 74%

Agentic Trading: When LLM Agents Meet Financial Markets

代理交易:当大语言模型代理与金融市场相遇

Yihan Xia, Panpan You, Taotao Wang, Fang Liu, Han Qi, Xiaoxiao Wu, Shengli Zhang

机构 * College of Electronic and Information Engineering, Shenzhen University, Shenzhen, China(深圳大学电子与信息工程学院) Shenzhen Audencia Financial Technology Institute, Shenzhen University, Guangdong, People's Republic of China(深圳大学审计金融科技研究所)

专题命中 Agent评测 :agentic(title);分类 cs.AI

AI总结 本文探讨了如何将大语言模型(LLM)作为交易系统中的代理,感知市场信息、检索上下文、进行决策推理、发出可交易动作并适应市场反馈。研究通过分析77项研究,发现协议不可比性是主要问题,提出证据日志、可重复性审计和报告检查表作为主要贡献。

Comments 59 pages, 15 figures, 27 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10114 2026-05-12 cs.CL 74%

SkillRAE: Agent Skill-Based Context Compilation for Retrieval-Augmented Execution

SkillRAE: 基于技能的上下文编译用于检索增强执行

Xiangcheng Meng, Shu Wang, Yixiang Fang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 Agent评测 :agent(title);分类 cs.CL

AI总结 SkillRAE提出一种两阶段检索增强执行方法,通过构建多级技能图和救援感知紧凑编译,提升技能证据组织效率,实验证明在SkillsBench上比SOTA方法提升11.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09443 2026-05-12 cs.CV cs.CL 74%

Through the Lens of Character: Resolving Modality-Role Interference in Multimodal Role-Playing Agent

通过角色视角:解决多模态角色扮演代理中的模态-角色干扰

Yihong Tang, Kehai Chen, Xuefeng Bai, Min Zhang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shenzhen Loop Area Institute (SLAI)(深圳环城院)

专题命中 Agent评测 :agent(title);分类 cs.CL

AI总结 本文提出CAVI框架,通过角色视角减少多模态角色扮演代理中的模态-角色干扰,提升角色一致的多模态交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05250 2026-05-08 cs.IR cs.AI 74%

Decision-aware User Simulation Agent for Evaluating Conversational Recommender Systems

面向决策意识的用户模拟代理用于评估对话推荐系统

Yuan-Chi Li, Li-Chi Chen, Sung-Yi Wu, Yu-Che Tsai, Shou-De Lin

机构 * Department of Computer Science and Information Engineering(计算机科学与信息工程系)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 本文提出Hesitator框架,通过模块化决策模块模拟人类在选择过载下的决策过程,实验表明其能有效缓解模拟器在高过载条件下的不现实行为,复现了心理学经济学中的行为模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10981 2026-04-21 cs.AI cs.IR 74%

ATANT v1.1: Positioning Continuity Evaluation Against Memory, Long-Context, and Agentic-Memory Benchmarks

ATANT v1.1:针对内存、长上下文和代理记忆基准的连续性评估

Samuel Sameer Tanguturi

机构 * Kenotic Labs(肯otic实验室)

专题命中 Agent评测 :agentic(title);分类 cs.AI

AI总结 本文基于ATANT v1.0,分析了现有内存基准与连续性定义的不匹配,指出各基准仅覆盖少量连续性属性,提出连续性评估的校准对比例。

Comments Companion paper to arXiv:2604.06710 (ATANT v1.0). 12 pages, 1 table, 2 appendices. Related-work extension; does not modify the v1.0 standard

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17019 2026-04-21 cs.AI 74%

Mini-BEHAVIOR-Gran: Revealing U-Shaped Effects of Instruction Granularity on Language-Guided Embodied Agents

Mini-BEHAVIOR-Gran:揭示指令粒度对语言引导的具身智能体的影响

Sukai Huang, Chenyuan Zhang, Fucai Ke, Zhixi Cai, Gholamreza Haffari, Lizhen Qu, Hamid Rezatofighi

机构 * Faculty of Information Technology, Monash University(信息技术学院,莫纳什大学)

专题命中 Agent评测 :agent(abstract,comments);planning(abstract,comments);分类 cs.AI

AI总结 本文提出Mini-BEHAVIOR-Gran基准,通过多级指令变体研究指令粒度对具身智能体性能的影响,发现粒度与性能呈非单调U型关系,粗粒度性能反弹与浅层 grounding 有关。

Comments 23 pages, Keywords: Language Grounding, Language Granularity, Instruction Following Agent, Width-based Planning Research Area: Multimodality and Language Grounding to Vision, Robotics and Beyond Research Area Keywords: vision language navigation, multimodality, neurosymbolic approaches

详情

展开后加载摘要…

URL PDF HTML 收藏