arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-06 至 2026-08-06 共收录 185 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 31 篇

2608.04774 2026-08-06 cs.CY cs.SI 新提交 50%

Decentralization of Agenda-Setting Power and Domain-Selective Bridging: Algorithm Design Beyond the Echo Chamber Debate

议程设置权力的去中心化与领域选择性桥接:超越回音室辩论的算法设计

Masahiro Fujita

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出议程民主化指数与社会信息健康模型,设计领域选择性桥接算法,经智能体模拟验证,该算法能在集体决策相关领域改善信息共享,同时维持爱好与生活方式领域用户体验,将回音室辩论转化为工程设计问题。

Comments 34 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04536 2026-08-06 cs.DB 新提交 50%

From Research Questions to Columns: Operationalization-Aware Data Discovery

从研究问题到列:感知操作化的数据发现

Houming Chen, H. V. Jagadish

专题命中 Agent评测 :agent(abstract)

AI总结 该研究提出感知操作化的数据发现(OADD)任务,构建基准OADD-Bench,评估多种方法后发现OADD仍是未解决问题,其中OADD定向智能体表现最佳。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04042 2026-08-06 cs.RO 新提交 50%

Kitchen Robotic Manipulation utilizing Foundation Models

基于基础模型的厨房机器人操作

Myung-Hwan Jeon, Sankalp Yamsani, Joohyung Kim

机构 * Kumoh National Institute of Technology(金乌国立技术大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :planning(abstract)

AI总结 本研究提出一种整合多种基础模型的模块化厨房机器人感知流水线,经评估优化后可在杂乱遮挡场景下实现89.12%的ADI,无需环境重训练即可完成餐具处理等家庭操作任务。

Comments Intelligent Service Robotics (ISR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23112 2026-08-06 cs.CY 版本更新 50%

How Should AI Safety Benchmarks Benchmark Safety?

AI安全基准应该如何进行基准测试?

Cheng Yu, Severin Engelmann, Ruoxuan Cao, Dalia Ali, Orestis Papakyriakopoulos

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出改进AI安全基准的方法,通过系统回顾210个基准,指出其技术、知识论和社会技术缺陷,并提出稳健度量和风险管理原则以提升基准有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 1 篇

2608.04033 2026-08-06 cs.CR 新提交 50%

SoK: How Frontier AI Reshapes System-Level Security Risk Dynamics in Critical Infrastructure

SoK:前沿人工智能如何重塑关键基础设施中的系统级安全风险动态

Chandra Thapa, Mohan Baruwal Chhetri, Marthie Grobler, Shahroz Tariq, Tooba Aamir

专题命中 其他Agent :agentic(abstract)

AI总结 本研究提出五维风险动态框架,分析前沿人工智能重塑关键基础设施系统级安全风险的机制,指出学术研究与运营约束的错配,推动系统级安全保证研究。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏