Adaptive Action Chunking via Multi-Chunk Q Value Estimation
基于多片段Q值估计的自适应动作分块
机构 * KAIST(韩国科学技术院)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出自适应动作分块方法,通过动态调节分块长度提升强化学习性能,实验表明其在复杂环境中具有更好的泛化能力和学习效率。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
基于多片段Q值估计的自适应动作分块
机构 * KAIST(韩国科学技术院)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出自适应动作分块方法,通过动态调节分块长度提升强化学习性能,实验表明其在复杂环境中具有更好的泛化能力和学习效率。
群体认知学习:通过受控的双阶段智能体协作使一切变得更好
机构 * University of Macau(澳门大学) ; Universiti Malaysia Perlis(马来西亚霹雳大学) ; Peking University(北京大学) ; Xinjiang University(新疆大学)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG
AI总结 本文提出群体认知学习框架,通过双阶段智能体协作解决多模态学习中的模态主导和虚假耦合问题,实验表明其在回归和分类任务中达到最优性能。
Comments This study has been Accepted by ICML 2026. The current version is a manuscript, please refer to the official version released at ICML 2026 for the final published version
PRISM: 通过调度-内存协同设计实现快速在线LLM服务
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG
AI总结 PRISM通过协同设计调度与内存管理,优化LLM服务响应时间,减少TTFT并提升缓存命中率。
Comments 25 pages, 9 figures, Preprint
基于有序代理的人群协议
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 本文研究了基于有序代理的人群协议,探讨了其在识别无歧义星形自由语言中的作用,并展示了在特定条件下协议与空间复杂度的关系。
为序列理性战略代理制定动作推荐
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 本文研究如何通过动作推荐激励战略代理采用服从策略,提出基于逆向归纳法求解线性规划的算法,以实现设计者目标与代理序列理性之间的平衡。
MapNav: 一种通过标注语义地图的新型记忆表示方法用于视觉-语言导航
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Tsinghua University(清华大学) ; Beijing Innovation Center of Humanoid Robotics Co., Ltd.(北京人形机器人创新中心有限公司) ; School of Computer Science, Wuhan University(武汉大学计算机学院) ; State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室,计算机学院)
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 本文提出MapNav,通过标注语义地图替代传统历史帧,提升视觉-语言导航任务的性能,实验表明其在模拟和现实环境中均达到SOTA水平。
Agent-ValueBench: 一个全面的评估代理价值观的基准
机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) ; School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) ; Peking University School of Software and Microelectronics(北京大学软件与微电子学院) ; Peking University School of Psychological and Cognitive Sciences(北京大学心理与认知科学学院) ; Key Laboratory of Machine Perception (Ministry of Education), Peking University(北京大学机器感知重点实验室)
专题命中 Agent评测 :agent(title,title_cn);autonomous agent(abstract);agentic(abstract);分类 cs.AI
AI总结 本文提出Agent-ValueBench,首个专门评估代理价值观的基准,包含394个环境和4335个价值冲突任务,揭示代理价值观与基础LLM的差异及Harness和技能对价值观的影响。
Agent-Omit:适应性上下文省略以提高LLM代理效率
机构 * AI Thrust, The Hong Kong University of Science(香港科学与技术大学人工智能前沿) ; Didichuxing Co. Ltd(滴滴出行有限公司)
专题命中 Agent评测 :agent(title,title_cn);agentic(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Agent-Omit框架,通过省略冗余思考和观察提升LLM代理效率,实验表明其在多个基准测试中表现优异。
Comments ICML 2026
一致性作为可检验的属性:评估AI代理可靠性的统计方法
机构 * Northeastern University(东北大学) ; University of Pécs(佩奇大学) ; University of Michigan(密歇根大学) ; AT&T Chief Data Office(AT&T首席数据办公室) ; Indian Institute of Management Bangalore(班加罗尔印度管理学院)
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);agentic(abstract);分类 cs.AI
AI总结 本文提出了一种评估AI代理可靠性的统计方法,通过输出级可靠性和轨迹级稳定性指标,揭示代理核心能力与执行鲁棒性之间的差异,验证了轨迹一致性指标在诊断敏感性上的优势。
Comments 33 pages, 5 figures, 2 tables
一种多功能AI代理用于罕见病诊断和风险基因优先级排序
机构 * Interdepartmental Program in Computational Biology and Bioinformatics, Yale University(耶鲁大学计算生物学与生物信息学联合计划) ; Department of Biostatistics, Yale University(耶鲁大学生物统计学系) ; Broad Institute of MIT and Harvard(哈佛大学与麻省理工学院联合Broad研究所) ; Center for Biomedical Data Science, Duke-NUS Medical School(杜克-新加坡医学学校生物医学数据科学中心) ; Sport and Exercise Medicine Service, KK Women’s and Children’s Hospital Training Program, Duke-NUS Medical School(杜克-新加坡医学学校KK妇女儿童医院运动与医学服务培训项目) ; Training Program, Duke-NUS Medical School(杜克-新加坡医学学校培训项目) ; Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系) ; Department of Complexity Science and Engineering, The University of Tokyo(东京大学复杂科学与工程系) ; Center for Advanced Intelligence Project, RIKEN(日本理化学研究所高级智能项目中心) ; NUS Artificial Intelligence Institute, National University of Singapore(新加坡国立大学人工智能研究所) ; Department of Biostatistics and Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系) ; Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) ; Department of Genetics, Yale University(耶鲁大学遗传学系) ; Wu Tsai Institute, Yale University(耶鲁大学吴天教授研究所) ; Department of Biomedical Informatics and Data Science, Yale University(耶鲁大学生物医学信息学与数据科学系)
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI
AI总结 本文提出Hygieia系统,通过整合多源数据提升罕见病诊断准确性与风险基因优先级排序能力,实验表明其在多个诊断基准上表现优异,有效减轻临床工作负担。
Comments 32 pages, 6 figures
MATRA:代理AI系统的攻击面建模——OpenClaw案例研究
机构 * DistriNet, KU Leuven(DistriNet,根特大学) ; IBM Research(IBM研究院) ; CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心) ; Imperial College London(伦敦帝国理工学院) ; A*STAR Institute for Infocomm Research(A*STAR信息与通信研究机构)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);autonomous agent(abstract)
AI总结 本文提出MATRA框架,用于评估代理AI系统中已知威胁转化为具体风险的机制,通过OpenClaw案例展示如何利用攻击树和安全控制降低风险。
Comments Accepted for presentation at the 5th International Workshop on Designing and Measuring Security in Systems with AI (DeMeSSAI 2026), co-located with the 11th IEEE European Symposium on Security and Privacy (EuroS&P 2026), Lisbon, Portugal, July 10, 2026
RewardHarness: 自我进化代理的后训练
机构 * University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所) ; Kolors Team, Kuaishou Technology(快手团队) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Waterloo(滑铁卢大学) ; Etude AI ; Tsinghua University(清华大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.LG
AI总结 RewardHarness通过自我进化代理框架,利用少量人类偏好示例迭代优化工具库,实现高效图像编辑评估,准确率达47.4%,超越GPT-5 5.3个百分点。
Comments Project page: https://rewardharness.com
边缘端的代理性能:基准测试中的见解
机构 * University of Exeter(埃克塞特大学) ; Technical University of Munich(慕尼黑技术大学)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.AI
AI总结 本文探讨了在边缘系统中,受限于内存、功率和延迟的模型规模对代理任务质量的影响,提出了一种领域条件评估方法,并揭示了模型选择与工具工作流联合设计的重要性。
Comments Accepted to AutoEdge workshop, co-located with MobiSys 2026
MDGYM:在分子模拟上评估AI代理的基准测试
机构 * Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(印度理工学院德里人工智能学院) ; Department of Computer Science and Engineering, Indian Institute of Technology Delhi(印度理工学院德里计算机科学与工程系) ; Department of Civil and Environmental Engineering, Indian Institute of Technology Delhi(印度理工学院德里土木与环境工程系)
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI
AI总结 本文通过MDGYM基准测试,评估了AI代理在分子动力学模拟中的表现,发现现有代理在物理推理方面存在显著不足。
SDialog:一个用于端到端代理构建、用户模拟、对话生成和评估的Python工具包
机构 * Idiap Research Institute(Idiap研究 institute) ; Université de Toulon(里昂大学) ; Aix Marseille Univ(马赛大学) ; LIS(LIS实验室) ; Avignon University(阿维尼翁大学) ; Zenidoc University of Zurich(苏黎世Zenidoc大学) ; Stenograf ; Solventum CNRS & ILLS(Solventum CNRS与ILLs) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 SDialog工具包通过统一的对话生成、评估和可解释性框架,提供多代理模拟、综合评估、机制可解释性和音频生成功能,支持混合后端实验。
Comments Pre-print submitted to EACL System Demonstration (under review)
迈向Web 4.0:AI代理与区块链之间的双向信任
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);autonomous agent(abstract)
AI总结 本文探讨AI代理与区块链之间的双向信任机制,分析区块链为代理提供的信任基础设施及AI代理在区块链核心机制中的参与,揭示现有标准生态的不足及未来研究方向。
Comments due to the limitation "The abstract field cannot be longer than 1,920 characters", the abstract appearing here is slightly shorter than that in the PDF file
AnomalyClaw:通过工具引导的反驳实现通用视觉异常检测代理
机构 * Department of Computer Science and Engineering, Southern University of Science and Technology (SUSTech), Shenzhen, China(南方科技大学计算机科学与工程系,深圳,中国) ; School of EEE, Nanyang Technological University (NTU), Singapore(南洋理工大学电子工程学院,新加坡) ; CFAR, Agency for Science, Technology and Research (A*STAR), Singapore(科技研究局(A*STAR)的CFAR,新加坡)
专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI
AI总结 本文提出AnomalyClaw,一种无需训练的视觉异常检测代理,通过多轮反驳过程提升异常判断。在CrossDomainVAD-12基准上,AnomalyClaw在多个模型上均取得显著提升,且引入自演化扩展提升模型性能。
Comments We release the agent, the benchmark, and the analysis artifacts at https://github.com/jam-cc/AnomalyClaw
你的驾驶世界模型是全能选手吗?
专题命中 Agent评测 :agent(summary_cn,abstract);planning(abstract)
AI总结 本文提出WorldLens基准测试,评估驾驶世界模型在视觉和行为真实性方面的综合表现,揭示现有模型在不同维度上的不足,并引入WorldLens-26K和WorldLens-Agent提升评估的可解释性。
Comments CVPR 2026 VideoWorldModel Workshop; Project Page at https://worldbench.github.io/worldlens GitHub at https://github.com/worldbench/WorldLens
WildClawBench: 一个用于真实世界、长周期代理评估的基准测试
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Fudan University(复旦大学) ; University of Science and Technology of China(中国科学技术大学) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学) ; Shanghai Innovation Institute(上海创新研究院) ; Zhejiang University(浙江大学) ; Nanyang Technological University(南洋理工大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.CL
AI总结 本文提出WildClawBench,一个包含60个双语多模态任务的原生运行时基准测试,评估代理在真实工具环境中的长周期任务能力,结果显示当前前沿模型在真实运行时表现仍不理想。
Comments Github link: https://github.com/internlm/WildClawBench
一致性在AI代理社会中产生集体偏离
机构 * University of Konstanz(康斯坦茨大学) ; Sony Computer Science Laboratories - Rome(索尼计算机科学实验室-罗马) ; Sapienza University of Rome(罗马大学) ; Max Planck Institute for Dynamics and Self-Organization(马克斯·普朗克动态与自组织研究所) ; Institute for the Dynamics of Complex Systems, University of Gottingen(复杂系统动力学研究所,哥廷根大学)
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.CL
AI总结 研究探讨了个体对齐的AI代理群体在一致性动态下可能陷入长期偏离状态的现象,揭示了集体安全性的不确定性。
ASIA:一个自主系统识别代理
机构 * Dalle Molle Institute for Artificial Intelligence (IDSIA), SUPSI(达勒莫利人工智能研究所(IDSIA),SUPSI)
专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI
AI总结 ASIA通过自主编码代理自动完成系统识别中的模型选择与参数调优,基于两个基准测试分析其搜索行为和发现的架构策略,探讨了该方法的潜力与局限性。
MonitoringBench: 面向代理监控的半自动化红队测试
机构 * Independent(独立)
专题命中 Agent评测 :agent(title,abstract);tool-use(abstract);分类 cs.AI
AI总结 本文提出半自动化红队方法,针对代理监控中的攻击检测问题,通过改进攻击生成和测试流程,构建了包含2644条攻击轨迹的MonitoringBench基准,评估监控能力与失败模式。
对AI代理的可信评估需要日志分析
机构 * Princeton University(普林斯顿大学) ; Independent(独立) ; UK AISI(英国AISI) ; Meridian Labs(梅里登实验室) ; Transluce ; Apollo Research(Apollo研究) ; UC Berkeley(伯克利大学)
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI
AI总结 本文提出通过日志分析解决AI代理评估中的可信问题,揭示了日志分析在识别评估威胁和指导原则中的作用,并展示了tau-Bench Airline中日志分析发现的性能缺陷和部署失败模式。
一个评估自主AI代理结果驱动约束违反的基准
机构 * McGill University(麦吉尔大学) ; Tiptree Advanced Systems Corporation(蒂普里高级系统公司) ; Polytechnique Montréal(蒙特利尔理工学院) ; National Research Council Canada(加拿大国家研究委员会) ; Rochester Institute of Technology(罗切斯特理工学院) ; University of Dubai(迪拜大学)
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI
AI总结 本文提出一个包含40个场景的基准,用于评估自主AI代理在追求目标优化时出现的结果驱动约束违反问题,发现多数模型存在25%以上的偏差。
AdaRubric:面向可靠LLM代理评估和奖励学习的任务自适应评分标准
机构 * The University of Sydney(悉尼大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL
AI总结 AdaRubric通过自适应生成任务特定评分标准,结合置信度加权评分和密集奖励信号,提升LLM代理评估的准确性与可靠性,实验表明其在多个基准测试中表现优异。
Comments KnowFM @ ACL 2026
为老年人设计的反思性叙事代理:在基于LLM的个性化叙事中整合论证方案和论证挖掘
机构 * Umeå University, Department of Computing Science(乌尔姆大学计算机科学系)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本研究探讨了基于知识驱动的LLM叙事是否能支持老年人与数字伴侣的有意义互动。通过整合知识图谱、用户建模、论证理论和论证挖掘,系统在生成叙事时提供指导和检查。研究发现,论证质量与清晰度相关,文化相关性影响使用意愿,而高幻觉风险指标的叙事常被感知为不一致。
Comments Submitted to ACM Transactions on Intelligent Systems and Technology (TIST)
代理基准能否支持其分数?基于证据的交互代理评估的边界
机构 * The University of Sydney(悉尼大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本文提出一种证据报告层,通过验证存储的艺术品来提高交互代理评估的可靠性,明确区分不同失败模式。
通用智能体评估
机构 * IBM Research(IBM研究院) ; MIT(麻省理工学院)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本文系统评估了通用智能体在不同协议和环境下的性能,提出统一协议和评估框架,揭示了智能体架构和基础模型对性能的影响,发现通用智能体无需定制即可适应多种领域。
Comments Presented at the ICLR 2026 Workshop on Agents in the Wild
LITMUS:在真实操作系统环境中评估LLM代理行为越狱的基准测试
机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; Zhejiang University(浙江大学)
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.CL
AI总结 LITMUS通过语义-物理双重验证机制和操作系统级状态回滚,解决现有基准测试在物理层危害评估和测试隔离上的不足,揭示LLM代理在行为安全方面的缺陷和漏洞。
AgentRx: 一种针对多模态临床预测任务的LLM代理基准研究
机构 * New York University Abu Dhabi(纽约大学阿布扎克分校)
专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI
AI总结 本文研究了LLM代理在多模态临床预测任务中的表现,发现单代理框架在处理多模态数据和校准方面优于多代理系统,强调了改进多代理协作的重要性。
Comments Accepted at the AHLI Conference on Health, Inference, and Learning 2026