arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-28 至 2026-05-28 共收录 32 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 32 篇

2605.27705 2026-05-28 cs.CR cs.MM 90%

AgenticVBench: Can AI Agents Complete Real-World Post-Production Tasks?

AgenticVBench: AI代理能否完成真实的后期制作任务?

Zongheng Cao, Yi Zheng, Rui Song, Xinyu Hu

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);tool use(abstract);tool-use(abstract)

AI总结 本文提出AgenticVBench基准,包含100个来自真实后期制作流程的代理任务,评估多模态AI代理的复合能力,发现最佳代理栈性能仅略超30%,远低于人类专家。

Comments 22 pages, 6 figures. Benchmark website: https://agenticvbench.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27428 2026-05-28 cs.LG 90%

$E^3$-Agent: An Executable and Evolving Agent for Resource Management of Edge Generative Inference

$E^3$-Agent: 一种用于边缘生成式推理资源管理的可执行且可演化智能体

Rui Bao, Yaping Sun, Zhiyong Chen, Feng Yang, Meixia Tao, Nan Li, Wenjun Zhang

机构 * Cooperative Medianet Innovation Center, Shanghai Jiao Tong University, Shanghai 200240, China(上海交通大学合作中位网创新中心,上海,中国) Department of Broadband Communication, Pengcheng Laboratory, Shenzhen 518000, China(鹏城实验室宽带通信部门,深圳,中国) China Mobile Research Institute, Beijing 100053, China(中国移动研究院,北京,中国)

专题命中 Agent评测 :agent(title,title_cn);分类 cs.LG

AI总结 针对边缘生成式推理中设备性能未知且时变的问题,提出一种可执行且可演化的智能体$E^3$-Agent,通过分离快速路径路由器和慢速路径大语言模型元控制器,实现在线学习与自适应资源管理,在动态场景下平均延迟降低65%-73%。

Comments 13 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28683 2026-05-28 cs.AI 85%

VeriTrip: A Verifiable Benchmark for Travel Planning Agents over Unstructured Web Corpora

VeriTrip: 面向非结构化网络语料的旅行规划智能体可验证基准

Yuting Xu, Jiayi Tian, Jian Liang, Xin Xiong, Hang Zhang, Mu Xu, Xiao-Yu Zhang

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) School of Cyber Security, UCAS(中国科学技术大学网络安全学院) Amap, Alibaba Group(阿里巴巴集团阿地图) NLPR & MAIS, Institute of Automation, CAS(中国科学院自动化研究所神经信息处理实验室及机器智能研究所) School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院)

专题命中 Agent评测 :planning(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 提出VeriTrip基准,通过多模态检索库和可验证知识库,评估智能体在非结构化网络语料中基于证据推理的旅行规划能力,揭示检索-推理权衡问题。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28371 2026-05-28 cs.AI cs.LG cs.SE 85%

From paper to benchmark: agentic, framework-based reproduction of under-specified methods in machine health intelligence

从论文到基准测试:基于智能体和框架的机器健康智能中欠规范方法复现

Raffael Theiler, Ludovico Comito, David Leko, Leandro Von Krannichfeldt, Lev Telyatnikov, Olga Fink

机构 * EPFL(苏黎世联邦理工学院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 提出一种基于智能体和共享框架的方法,通过槽绑定接口将论文转化为可执行、可比较的基准测试实现,解决工业预测与健康管理中方法复现的困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12015 2026-05-28 cs.CR cs.AI cs.CL cs.LG cs.MA 85%

SkillSafetyBench: Evaluating Agent Safety under Skill-Facing Attack Surfaces

SkillSafetyBench:在技能面攻击表面下评估智能体安全性

Chang Jin, An Wang, Zeming Wei, Kai Wang, Biaojie Zeng, Qiaosheng Zhang, Chao Yang, Jingjing Qu, Xia Hu, Xingcheng Xu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) East China Normal University(华东师范大学)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出SkillSafetyBench基准,通过155个对抗案例评估大语言模型智能体在技能、本地工件和执行环境文件等非用户攻击下的安全失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27984 2026-05-28 cs.CL cs.AI 81%

KVoiceBench, KOpenAudioBench, and KMMAU: Agent-Driven Korean Speech Benchmarks for Evaluating SpeechLMs

KVoiceBench, KOpenAudioBench 和 KMMAU:用于评估语音语言模型的智能体驱动的韩语语音基准

Haechan Kim, Seungjun Chung, Inkyu Park, Jihoo Lee, Jonghyun Lee

机构 * KRAFTON Graduate School of AI, KAIST(韩国科学技术院人工智能研究生院) Department of Mathematical Sciences, Seoul National University(首尔国立大学数学科学系)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 针对语音语言模型评估中英语中心化的问题,提出两种智能体驱动的基准构建框架,构建并发布了三个韩语语音基准(KVoiceBench、KOpenAudioBench、KMMAU),通过评估八个最新模型揭示了英语-韩语性能差距和不同任务间的互补性弱点。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27922 2026-05-28 cs.AI 79%

Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows

Harness-Bench: 在真实智能体工作流中测量不同模型的框架效应

Yilun Yao, Xinyu Tan, Chao-Hsuan Liu, Yaoming Li, Zhengyang Wang, Wenhan Yu, Zhewen Tan, Yuxuan Tian, Guangxiang Zhao, Lin Sun, Xiangzheng Zhang, Tong Yang

机构 * Peking University(北京大学) Qiyuan Tech(启元科技)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出Harness-Bench基准,通过106个沙盒离线任务评估不同模型与框架配置组合下的执行性能,发现智能体能力应归因于模型-框架配置而非基础模型。

Comments 16 pages, 4 figures, 11 tables. The first three authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27879 2026-05-28 cs.AI 79%

Towards Faithful Agentic XAI: A Verification Method and an Open-World Benchmark for Better Model Faithfulness

迈向忠实代理式XAI:一种验证方法和一个用于更好模型忠实度的开放世界基准

Jaechang Kim, Sunung Mun, Seungjoon Lee, Jaewoong Cho, Jungseul Ok

机构 * Graduate School of AI, POSTECH(POSTECH人工智能研究生院) Department of Computer Science and Engineering, POSTECH(POSTECH计算机科学与工程系) Krafton

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 提出FAX框架,通过显式验证分解解释声明并交叉检查忠实工具,以及CRAFTER-XAI-Bench开放世界基准,在强化学习环境中将模拟忠实度从0.20提升至0.46。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02503 2026-05-28 cs.AI 79%

DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis

DataClawBench: 面向探索性真实世界金融数据分析的智能体基准

Qiaohong Zhang, Weihao Ye, Jialong Chen, Yi Luo, BoYuan Li, Bowen Deng, Zibin Zheng, Jianhao Lin, Wei-Shi Zheng, Chuan Chen

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Software Engineering, Sun Yat-sen University(中山大学软件学院) Lingnan College, Sun Yat-sen University(中山大学岭南学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出DataClawBench基准,通过金融智库场景评估智能体在无先验指导下的探索性数据分析能力,包含约206万条跨领域真实噪声数据及492个多步任务,实验发现探索行为与任务进展及正确性不呈正相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27820 2026-05-28 cs.AI 77%

EgoBench: An Interactive Egocentric Multimodal Benchmark for Tool-Using Agents

EgoBench:面向工具使用智能体的交互式自我中心多模态基准

Yunqi Liu, Tong Niu, Zitong Wang, Zhenlong Dai, Yuqi Qing, Weiqiang Wang, Jian Liu

机构 * Ant Group(蚂蚁集团)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出EgoBench,首个交互式自我中心多模态基准,通过1045个自我中心视频任务和用户-智能体-工具交互环境,联合评估视觉感知、工具增强多跳推理和动态交互能力,揭示当前最先进模型性能上限(平均准确率19.43%)。

Comments 68 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05333 2026-05-28 cs.AI 74%

Graph-of-Skills: Dependency-Aware Structural Retrieval for Massive Agent Skills

技能图谱:面向大规模智能体技能的依赖感知结构检索

Dawei Liu, Zongxia Li, Hongyang Du, Xiyang Wu, Shihang Gui, Yongbei Kuang, Lichao Sun

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Maryland(马里兰大学) Brown University(布朗大学) Carnegie Mellon University(卡内基梅隆大学) Lehigh University(莱斯大学)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 提出技能图谱(GoS),一种推理时的结构检索层,通过构建可执行技能图并利用混合语义-词汇种子、反向感知个性化PageRank和上下文预算水合,实现依赖感知的技能束检索,在SkillsBench和ALFWorld上显著提升奖励并节省令牌。

Comments 11 pages of main text, 12 pages of appendix. Core contribution by Dawei Liu and Zongxia Li. Project page: https://github.com/davidliuk/graph-of-skills

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17654 2026-05-28 cs.CL cs.AI 73%

EVADE-Bench: Multimodal Benchmark for Evaluating and Enhancing Evasive Content Detection

EVADE-Bench:用于评估和增强规避性内容检测的多模态基准

Ancheng Xu, Zhihao Yang, Jingpeng Li, Guanghu Yuan, Longze Chen, Liang Yan, Jiehui Zhou, Zhen Qin, Hengyu Chang, Yukun Chen, Hamid Alinejad-Rokny, Min Yang

机构 * SIAT, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) University of New South Wales(新南威尔士大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 针对电商平台中LLM/VLM易受规避性内容攻击的问题,提出首个专家标注的中文多模态基准EVADE-Bench,评估26个模型并发现规则分类可提升检测一致性,多智能体分解策略能显著提高准确率。

Comments SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27452 2026-05-28 cs.CV 71%

Fine-Tuning Vision-Language Models for Understanding Current Damage and Scoring Priority with Quality Guard Agent

微调视觉语言模型以理解当前损伤并使用质量卫士代理进行优先级评分

Takato Yasuno

专题命中 Agent评测 :agent(title)

AI总结 本文通过微调LLaVA-1.5-7B视觉语言模型,结合规则引擎和质量卫士代理,实现了桥梁损伤自动理解与修复优先级评分,有效降低了评分变异并提升了效率。

Comments 23 pages, 11 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28465 2026-05-28 cs.CL 70%

Beyond One Path: Evaluating and Enhancing Divergent Thinking in Interactive LLM Agents

超越单一路径:评估与增强交互式LLM代理的发散性思维

Jihyeong Park, Ingeol Baek, Jeonghyun Park, Hwanhee Lee

机构 * Chung-Ang University(Chung-Ang 大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 提出交互式基准MUTATE和策略ReDNA,用于评估和增强LLM代理在路径和动作层面的发散性思维,解决现有框架中即时收敛压力导致的动作固定问题。

Comments 28 pages, 16 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26959 2026-05-28 cs.LO cs.CL 70%

MerLean-Prover: A Recursive Looping Harness for Lean 4 Theorem Proving

MerLean-Prover:用于 Lean 4 定理证明的递归循环框架

Jinzheng Li, Zeru Zhu, Yuanjie Ren

机构 * Northeastern University(东北大学) Stony Brook University(石溪大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.CL

AI总结 提出一种基于递归循环框架的端到端 Lean4 定理证明器 MerLean-Prover,通过规划、检查与证明三种智能体协作,无需微调或定制强化学习,在 FormalQualBench 和 Putnam2025 上超越现有开源基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22166 2026-05-28 cs.AI 70%

Adapting the Interface, Not the Model: Runtime Harness Adaptation for Deterministic LLM Agents

适配接口而非模型:面向确定性LLM智能体的运行时框架适配

Tianshi Xu, Huifeng Wen, Meng Li

机构 * Peking University(北京大学)

专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 提出Life-Harness运行时框架,通过从训练轨迹中演化出可复用的环境侧干预,在不修改模型权重或评估环境的情况下,显著提升冻结LLM智能体在确定性任务中的性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15015 2026-05-28 cs.LG 70%

Plug-and-Play Benchmarking of Reinforcement Learning Algorithms for Large-Scale Flow Control

强化学习算法在大规模流动控制中的即插即用基准测试

Jannis Becktepe, Aleksandra Franz, Nils Thuerey, Sebastian Peitz

机构 * TU Dortmund University(图卢兹大学) Lamarr Institute for Machine Learning(拉马尔机器学习研究所) Technical University Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 提出首个完全基于PyTorch、可微分的强化学习流动控制基准套件FluidGym,通过标准化评估协议实现控制方法的系统比较。

Comments Accepted to ICML 2026. Code available at https://github.com/safe-autonomous-systems/fluidgym

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09580 2026-05-28 cs.CR 67%

AICrypto: Evaluating Cryptography Capabilities of Large Language Models

AICrypto:评估大型语言模型的密码学能力

Yu Wang, Yijian Liu, Liheng Ji, Han Luo, Wenjie Li, Xiaofei Zhou, Chiyun Feng, Puji Wang, Yuhan Cao, Geyuan Zhang, Xiaojian Li, Rongwu Xu, Yilei Chen, Tianxing He

专题命中 Agent评测 :agent(abstract,abstract_cn)

AI总结 构建AICrypto基准测试,通过多项选择题、夺旗挑战和证明题评估LLM在密码学知识记忆、漏洞利用和形式推理方面的能力,发现最先进模型在常规任务上匹配或超越人类专家,但在抽象概念理解和多步推理上仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23955 2026-05-28 cs.AI cs.DC cs.LG cs.SI q-fin.CP 62%

From Accuracy to Auditability: A Survey of Determinism in Financial AI Systems

从准确性到可审计性:金融AI系统中的确定性综述

Ruizhe Zhou, Xiaoyang Liu, Gaoyuan Du, Yi Zheng, Shouxi Ren, Deepayan Chakrabarti, Dengdu Jiang

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文从系统视角综述了金融AI中表格模型、图网络和基于LLM的智能体工作流三种模态的不可重现性问题,通过实验量化了确定性指标并提出了分层评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14585 2026-05-28 cs.AI cs.CL 62%

Prompt Optimization Is a Coin Flip: Diagnosing When It Helps in Compound AI Systems

提示优化如同抛硬币:诊断其在复合AI系统中何时有效

Xing Zhang, Guanghui Wang, Yanwei Cui, Wei Qiu, Ziyuan Li, Bing Zhu, Peiyang He

机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心) HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰技术中心,中国)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 通过大量实验发现提示优化在复合AI系统中效果不稳定,仅当任务具有可挖掘的输出结构时才有帮助,并提供了两阶段诊断方法。

Comments Accepted to the 1st Workshop on Combining Theory and Benchmarks, CTB@ICML 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28359 2026-05-28 cs.AI q-fin.TR 57%

From Knowing to Doing: A Memory-Controlled Benchmark for LLM Trading Agents on Stock Markets

从知道到做到:面向LLM股票市场交易智能体的记忆控制基准

Taojie Zhu, Wentao Zhao, Rui Sun, Beidi Luan, Jiacheng Lu, Sinuo Wang, Jing Li, Daxin Jiang, Yonghong He, Zuo Bai

机构 * Tsinghua University(清华大学) Stepfun FinStep Shanghai Jiao Tong University(上海交通大学) Adelaide University(阿德莱德大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对LLM交易智能体评估中的知识泄露和收益归因问题,提出KTD-Fin基准,通过数据掩码和Barra风格归因框架,分离市场记忆与投资决策,并揭示收益主要来自被动市场暴露而非选股能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28287 2026-05-28 cs.LG cond-mat.mtrl-sci 57%

AtomComposer: Discovering Chemical Space from First Principles with Reinforcement Learning

AtomComposer: 基于强化学习从第一性原理发现化学空间

Bjarke Hastrup, Francois Cornet, Tejs Vegge, Arghya Bhowmik

机构 * Dept. of Energy Conversion and Storage, Technical University of Denmark(丹麦技术大学能源转换与存储系) Dept. of Applied Mathematics and Computer Science, Technical University of Denmark(丹麦技术大学应用数学与计算机科学系) Pioneer Center for Accelerating P2X Materials Discovery (CAPeX), Kgs. Lyngby, Denmark(加速P2X材料发现的先锋中心(CAPeX),Lyngby,丹麦)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出AtomComposer,一种无需预训练数据、通过在线强化学习自主构建有效3D异构体的智能体,在未见化学式上发现的异构体数量比现有方法多一个数量级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27955 2026-05-28 cs.PL cs.CL 57%

Skill-as-Pseudocode: Refactoring Skill Libraries to Pseudocode for LLM Agents

技能即伪代码:将技能库重构为面向LLM智能体的伪代码

Xinze Li, Yuhang Zang, Yixin Cao, Aixin Sun

机构 * Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出Skill-as-Pseudocode (SaP)方法,自动将Markdown技能库转换为带类型伪代码,通过确定性质量检查解决LLM智能体在检索技能时产生的混淆循环问题,在ALFWorld任务上显著优于基线。

Comments Preprint. Code: https://github.com/InternLM/Skill-as-Pseudocode

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23472 2026-05-28 cs.AI 57%

Escher-Loop: Mutual Evolution by Closed-Loop Self-Referential Optimization

Escher-Loop:通过闭环自我指涉优化的共同进化

Ziyang Liu, Xinyan Guo, Xuchen Wei, Han Hao, Liu Yang

机构 * Shenzhen X-Institute(深圳X研究所) Soochow University(苏州大学) Shenzhen Loop Area Institute(深圳河套学院) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI

AI总结 提出Escher-Loop框架,通过任务代理和优化代理的闭环共同进化及动态基准机制,实现超越静态基线的持续性能提升。

Comments The first three authors contributed equally. Corresponding Authors: Han Hao, Liu Yang

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02259 2026-05-28 cs.LG cs.CV 57%

Segment to Focus: Guiding Latent Action Models in the Presence of Distractors

聚焦分割:在干扰物存在下引导潜在动作模型

Marcus Fechner, Hamza Adnan, Constantin C. Lüth, Matthew T. Jackson, Alexey Zakharov, J. Marius Zöllner

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) University of Oxford(牛津大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 针对动作相关视觉干扰导致潜在动作模型失效的问题,提出MaskLAM方法,利用分割基础模型(如SAM)零样本获取智能体掩码,限制重建目标于智能体像素,迫使潜在动作编码内源动态,显著提升下游策略性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28757 2026-05-28 math.OC 50%

Learning Approximate Solutions to Multiparametric Generalized Nash Equilibrium Problems

学习多参数广义纳什均衡问题的近似解

A. Bemporad, T. Tatarenko

专题命中 Agent评测 :agent(abstract)

AI总结 提出一种基于学习的方法,利用Nikaido-Isoda间隙函数作为训练损失,通过值函数代理避免双层优化,快速近似求解目标与约束均耦合的多参数广义纳什均衡问题。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28330 2026-05-28 cs.RO 50%

Chance-Constrained MPPI under State and Dynamic Object Prediction Uncertainty and the Evaluation of Collision Risk Calibration

状态与动态物体预测不确定性下的机会约束MPPI及碰撞风险校准评估

Benjamin Serfling, Konrad Doll, Kati Radkhah-Lens

机构 * Faculty of Engineering and Informatics, University of Applied Sciences Aschaffenburg(应用科学阿施芬堡大学工程与信息学院)

专题命中 Agent评测 :planning(abstract)

AI总结 针对机会约束MPPI控制中上游不确定性校准不足导致的过自信或过保守问题,提出DUCCT-MPPI架构,通过无迹变换和蒙特卡洛聚合联合集成定位与动态障碍预测不确定性,在仿真中实现鲁棒导航,成功率提升28%。

Comments Submitted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27670 2026-05-28 quant-ph hep-th 50%

Benchmarking Quantum Annealing for a Greenhouse-Inspired Control QUBO

温室启发式控制QUBO的量子退火基准测试

Hamzeh Alavirad, Maryam Bahrami Zanjani

专题命中 Agent评测 :workflow(abstract)

AI总结 针对温室启发式二进制加热器调度QUBO问题,通过物理解码评估经典模拟退火、路径积分模拟量子退火和D-Wave量子退火工作流的性能,未发现量子优势但提供了可重复的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27589 2026-05-28 cs.CV 50%

What-If World: A Causal Benchmark for General World Models in Embodied Scenarios

What-If World: 具身场景中通用世界模型的因果基准

Kunlin Cai, Rui Song, Jinghuai Zhang, Kaiyuan Zhang, Pranav Bodapati, Alicia Yu, Fnu Suya, Mohammad Rostami, Jiaqi Ma, Yuan Tian

机构 * UCLA(加州大学洛杉矶分校) University of Tennessee(田纳西大学) Amazon(亚马逊)

专题命中 Agent评测 :planning(abstract)

AI总结 提出 What-If World 基准,通过成对提示测试视频生成模型在物理变化下的因果一致性,发现现有模型在因果干预上表现不佳。

Comments 38 pages, World Model Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15375 2026-05-28 quant-ph physics.comp-ph 50%

Learning to Maximize Quantum Neural Network Expressivity via Effective Rank

通过有效秩学习最大化量子神经网络表达力

Juan Yao

专题命中 Agent评测 :agent(abstract)

AI总结 提出有效秩κ作为量子神经网络表达力的量化指标,并通过强化学习框架自动设计高表达力电路架构。

Comments 6 pages, 5 figures

Journal ref Quantum Science and Technology, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏