Security of World-Model-Based Embodied AI: A Lifecycle of Threats, Defenses, and Evaluation
基于世界模型的具身智能安全性:威胁、防御与评估的生命周期
专题命中 Agent评测 :planning(abstract);分类 cs.AI
AI总结 本综述针对基于世界模型的具身智能,梳理其生命周期内的各类安全威胁,提出分类法与评估协议,并从多维度构建防御体系,同时指出世界模型兼具安全护盾与安全错觉的双重属性。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
基于世界模型的具身智能安全性:威胁、防御与评估的生命周期
专题命中 Agent评测 :planning(abstract);分类 cs.AI
AI总结 本综述针对基于世界模型的具身智能,梳理其生命周期内的各类安全威胁,提出分类法与评估协议,并从多维度构建防御体系,同时指出世界模型兼具安全护盾与安全错觉的双重属性。
DataClawEval:面向真实工业场景的数据工程智能体基准测试
机构 * Tencent(腾讯) ; Xidian University(西安电子科技大学) ; South China Normal University(华南师范大学)
专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI
AI总结 DataClawEval是首个针对真实工业数据工程场景的智能体基准,含100项跨5种引擎的任务,用确定性脚本评分,评估16个前沿智能体发现最强模型仅得74.9分,自主数据工程仍是挑战。
共享评判,学习弃权:专业化在大语言模型评估中的作用
机构 * Cheung Kong Graduate School of Business(长江商学院)
专题命中 Agent评测 :agentic(abstract);分类 cs.AI
AI总结 该研究探讨大语言模型评估中领域专业化的架构设计,发现将专业化置于弃权而非评判环节,通过共享学习与级联路由可提升评估准确率并降低计算量。
Comments 12 pages, 4 figures, 5 tables
Rehearse:从自改进自动研究中的置信度悬崖后退
机构 * Tencent(腾讯)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 该研究发现自动研究中存在置信度悬崖问题,提出Rehearse方法通过聚焦过往尝试结果记忆提升判断准确率,在三个任务的4000次训练运行预算下改善了终点性能。
大语言模型能否解决真实的Java合并冲突?一项使用校准后的LLM作为评判者的评估
专题命中 Agent评测 :agent(abstract);分类 cs.SE
AI总结 该研究针对真实Java合并冲突,构建仅用推理信号的LLM求解器,经校准的LLM评判者评估发现,其解决冲突的覆盖和匹配开发者方案的表现优于传统工具AutoMerge,但结构正确性仍需确定性检查保障。
面向视觉语言赋能的无人机分类与灾害响应的系统工程框架
机构 * University of Arkansas(阿肯色大学) ; University of Michigan-Dearborn(密歇根大学迪尔伯恩分校)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 该研究提出将视觉语言模型(VLMs)作为协同智能体嵌入人-无人机回路的系统工程框架,经评估可降低人因负担、提升AI信任度,推进了高风险灾害响应的人-自主系统协同。
Comments 10 pages, 8 figures. Author accepted manuscript of AIAA Paper 2026-4010, published in the AIAA AVIATION 2026 Forum
Journal ref AIAA AVIATION 2026 Forum, AIAA Paper 2026-4010, 2026
PAUSE:统一服务环境中面向用户的个人AI助手基准测试
机构 * University of Alberta(阿尔伯塔大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 研究人员针对现有个人AI助手基准测试的缺陷,提出PAUSE基准测试,采用多机制评估框架,实验发现现有先进模型在相关场景任务完成率不足70%,还提出可扩展生成任务的合成流水线。
AgentS4D:基于大语言模型的工作空间智能体执行生命周期内运行时风险基准
专题命中 Agent评测 :agent(abstract);分类 cs.SE
AI总结 研究推出AgentS4D基准,评估20种智能体配置在328个风险案例中的表现,发现任务完成不代表安全,需跨风险条件完整评估智能体配置。
FAVA:基于证据支持的权限图的经验证智能体的形式化授权
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 FAVA是一种用于智能体执行的带权限授权框架,通过LLM引导的权限IR、证据支持的权限图和SMT授权器保障安全,在多场景评估中达90.5%决策合规率,可拦截动态违规迹。
高效有限反馈下的在线符合选择
机构 * Google Research(谷歌研究) ; Department of Computer Science, Duke University(杜克大学计算机科学系)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出一种在有限反馈下高效实现在线符合选择的方法,通过适应性符合推断更新规则,在保证目标概率下实现亚线性效率 regret,适用于带隙和半带隙反馈场景。
连续时间强化学习用于多 regime 最优化切换
机构 * Department of Applied Mathematics, The Hong Kong Polytechnic University(应用数学系,香港理工大学) ; School of Mathematics and Statistics, University of Sydney(数学与统计学学院,悉尼大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出了一种基于连续时间强化学习的多 regime 最优化切换方法,通过熵正则化和马尔可夫链生成矩阵实现策略优化,并利用神经网络验证了算法有效性。
Comments Keywords: Optimal regime switching, continuous-time reinforcement learning, system of HJB equations, policy improvement, policy iteration convergence, financial applications
解释宏观经济惯性之谜
专题命中 Agent评测 :agent(abstract)
AI总结 本文通过将调查预期替代主体自身预期,结合嵌入不可观测成分模型的异质性主体一般均衡框架,解释了宏观经济惯性之谜,并指出惯性政策会延长传导滞后。
委托式公平分配
专题命中 Agent评测 :agent(abstract)
AI总结 该研究针对委托式公平分配模型,区分两种信息结构并提供高效算法,生成同时满足中心与代理人层面基于嫉妒的公平性保证的分配方案。
CoSimRec:衡量推荐反馈循环中的协同内容渗透
专题命中 Agent评测 :agent(abstract)
AI总结 研究推荐反馈循环中协同内容渗透问题,提出CoSimRec离线代理评估框架,通过算法渗透率指标家族衡量相关情况,在多数据集和推荐器上评估,发现随机控制无显著正向渗透,基于流行度和反馈敏感排名有提升,同步感知排名降低APR。
Comments This work has been submitted to the IEEE for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible
代理视频生成:通过工具约束的LLM规划从文本到可执行事件图
机构 * Institute of Mathematics of the Romanian Academy(罗马尼亚科学院数学研究所) ; National University of Science and Technology Politehnica Bucharest(布加勒斯特理工大学) ; Büchi Labortechnik AG(布奇实验室技术股份公司)
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出了一种代理系统,通过LLM生成结构化的事件图规范,并在3D引擎中确定性执行,解决了传统视频生成的语义可靠性问题,展示了在物理真实性和语义对齐上的优越表现。
图灵谷:AI能力如何塑造劳动力收入
专题命中 Agent评测 :agent(abstract)
AI总结 本文研究AI能力在不同维度上如何影响劳动力收入,揭示了人类与AI沟通方式对劳动力市场的影响。
隐藏任务难度下的诊断反馈
专题命中 Agent评测 :agent(abstract)
AI总结 该研究针对隐藏任务难度的场景,提出均衡精炼机制,可在特定条件下实现对困难任务的诊断,证明隐藏难度能生成智能体相关信息,且该机制适用于连续努力与不完美诊断的情况。
BCNet:基于结构引导表征学习的支气管分类
专题命中 Agent评测 :planning(abstract)
AI总结 该研究针对自动支气管分类的个体拓扑差异挑战,提出结构引导的BCNet框架,在BronAtlas基准上F1分数超现有最优方法8%以上,还发布了支气管成像分析开放基准BronAtlas。
Comments The benchmark is available at https://osf.io/pskr9/?viewonly=94fa3d87274b4095ac9a4b88cc9a1341
重新思考医学影像中的人工智能:假设、现实与重构
专题命中 其他Agent :agentic(abstract);分类 cs.AI
AI总结 本文指出医学影像AI研究转化不足源于结构性错位,明确六大错位维度并提出重构路径,最终愿景是开发与医生对齐、扩展而非替代临床判断的智能体AI。
Comments 10 pages, 2 figures