Towards the Harness of Embodied Agents
迈向具身智能体的管控
专题命中 代码评测 :coding agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出名为Thea的具身智能体管控系统,通过场景图和退出码评估弥合物理世界与智能体的差距,实现长程任务完成。
Comments Project page: https://eit-hai.github.io/thea
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
迈向具身智能体的管控
专题命中 代码评测 :coding agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出名为Thea的具身智能体管控系统,通过场景图和退出码评估弥合物理世界与智能体的差距,实现长程任务完成。
Comments Project page: https://eit-hai.github.io/thea
利用自主LLM研究循环优化专家设计的晶体图网络用于带隙预测
机构 * Department of Materials Science and NanoEngineering(材料科学与纳米工程系)
专题命中 代码评测 :coding agent(abstract);分类 cs.AI、cs.LG
AI总结 提出一个自主LLM研究循环,在MatBench带隙基准上构建了无需外部预训练的最准确模型,超越了所有17个专家设计模型,通过实现元素对特征和空间群嵌入等已知方法。
基于大语言模型的因果智能体
专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对LLM难以处理因果问题的挑战,提出Causal Agent框架,构建CausalTQA基准,实验显示其在多层级因果问题及真实数据集上性能优于SOTA。
Diagram-MMU:面向科学图表的多模态基准测试
机构 * Nanjing University of Science and Technology(南京理工大学) ; Baidu Inc(百度公司) ; AIML, Adelaide University(阿德莱德大学AIML) ; SUTD(新加坡科技设计大学) ; Southeast University(东南大学) ; East China Normal University(华东师范大学) ; University of Oxford(牛津大学)
专题命中 代码评测 :code generation(abstract);分类 cs.AI
AI总结 本文构建了多模态基准测试Diagram-MMU,评估MLLMs的科学图表解析与理解能力,发现图表转代码任务更具挑战,Claude-4.6 Opus在智能体场景下表现最优。
AutoWorldModel-Bench:面向自动化世界模型研究的以状态为中心的基准
机构 * Electronic Arts(美国艺电公司) ; Simon Fraser University(西蒙菲莎大学)
专题命中 代码评测 :coding agent(abstract);分类 cs.AI
AI总结 AutoWorldModel-Bench是面向AI编码智能体的闭环基准,涵盖8个游戏环境,采用结构化状态表征,64次会话中多数智能体通过研究式修改改进了世界模型,可评估智能体的开放式研究能力。
Comments Project page: https://electronicarts.github.io/AutoWorldModelBench/