arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-04 至 2026-08-04 共收录 61 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 61 篇

2608.00548 2026-08-04 cs.CV 新提交 89%

DrawAI: Agentic Benchmark and Workflow for Making Raster Images Editable

DrawAI:用于生成可编辑光栅图像的智能体基准与工作流

Pu Cao, Qingye Kong, Xuedan Yin, Xuekun Zhao, Rupeng Yan, Qing Song, Yao Zhang, Lu Yang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学)

专题命中 Agent评测 :workflow(title,abstract);agentic(title,abstract);agent(abstract)

AI总结 DrawAI提出图像到可编辑重建任务,构建含DrawAI-Bench基准与DrawAI-Flow工作流的智能体方案,经实验验证DrawAI-Flow可提升可编辑结构,不同模型-harness配置的重建质量与成本差异显著。

Comments Project URL: https://drawai.renaissancemind.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01341 2026-08-04 cs.AI 新提交 88%

402Pilot: An x402 Decision Layer for Autonomous Agent Micropayments

402Pilot:面向自主智能体微支付的x402决策层

Yin Li, Yanbo He, Boo-Ho Yang, Rav Lawana, Ziyue Li, Wei Zeng, Jing Tang, Fugee Tsung

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title,abstract);分类 cs.AI

AI总结 针对自主智能体微支付的买方决策问题,提出协议无关的402Pilot决策层,结合PA-DCT策略在402Pilot-Bench基准中验证其自适应采购的有效性,为可编程支付补充买方决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02441 2026-08-04 cs.AI 新提交 87%

Agentic Commerce World: An Auditable and Verifiable Environment for Vibe Commerce

智能体商业世界:一种可审计可验证的氛围式商业环境

Shicheng Fan, Mingdai Yang, Duohao Wang, Canyu Chen, Yongfeng Zhang, Hua Wei, Manling Li, Julian McAuley, Kun Zhang, Philip S. Yu, Kejing Yu, Zhiwei Liu

机构 * University of Illinois at Chicago(伊利诺伊大学芝加哥分校) Springbrand(斯普林布兰德公司) Northwestern University(西北大学) Rutgers University(罗格斯大学) Arizona State University(亚利桑那州立大学) University of California San Diego(加州大学圣迭戈分校) Carnegie Mellon University(卡内基梅隆大学) MBZUAI(Mohamed bin Zayed 人工智能大学) Microsoft AI(微软人工智能部门)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 该研究提出智能体商业世界(ACWorld)环境,通过氛围式商业协议(VCP)实现可审计可验证的氛围式商业智能体评估,构建含两类轨道的基准并验证模型性能,分析得出过程级证据对评估智能体的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02470 2026-08-04 cs.CV cs.AI 新提交 85%

Grounding Agentic VLMs with Dedicated Segmentation for Fine-Grained Vehicle Damage Assessment

基于专用分割模型实现具身智能视觉语言模型(Agentic VLMs)的细粒度车辆损伤评估

Vishwajeet Shivaji Hogale, Anjali Pai, Nitya Ravi

机构 * Northeastern University(东北大学)

专题命中 Agent评测 :agentic(title,title_cn);agent(abstract);分类 cs.AI

AI总结 针对VLMs空间定位不可靠问题,本文提出TinyDamage架构,将空间定位委托给专用多任务分割模型,集成至7节点LangGraph智能体流程,在车辆损伤评估中大幅降低报告虚构率。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01042 2026-08-04 cs.SE cs.AI cs.HC cs.LG 新提交 85%

What Could the Agent See at 19:05? Generating Temporal Enterprise Scenarios from Real Research and Replaying Them to Evaluate Agents

智能体在19:05能看到什么?从真实研究生成时间化企业场景并回放以评估智能体

Tezan Sahu, Himani Arora

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 本研究提出从真实研究生成时间化企业场景并回放的系统,用于解决现有离线评估智能体仅基于最终静态快照的问题,可在任意时刻评估可插拔智能体。

Comments 6 pages, 3 figures, 4 tables. Accepted as a poster at SERI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02171 2026-08-04 cs.AI 新提交 84%

From Profiling to Synthesis: Benchmarking Implicit Behavioral Alignment in Personalized LLM Agents

从分析到综合:个性化大语言模型智能体中的隐式行为对齐基准测试

Jiajia Song, Bobo Li, Haiwen Yi, Zibo Ji, Meishan Zhang, Hao Fei, Min Zhang, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) University of Toronto(多伦多大学) University of Minnesota Twin Cities(明尼苏达大学双城分校) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) University of Oxford(牛津大学)

专题命中 Agent评测 :agent(summary_cn,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 该研究针对大语言模型智能体的个性化问题,构建了IBA-Bench基准,提出IBA-Agent框架,实验显示其可在九类场景中提升隐式行为对齐效果,但有效个性化仍是重大挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00711 2026-08-04 cs.AI 新提交 83%

Tracing the Cascade: A Topology-Aware Evaluation Framework for Scientific Agent Hallucinations

追踪级联:一种面向科学智能体幻觉的拓扑感知评估框架

Xinshun Feng, Ziqi Miao, Lijun Li, Jing Shao

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 该研究针对科学智能体幻觉的拓扑结构评估缺口,提出SCHEMA框架,通过构建科学概念图等方式评估,发现幻觉集中于知识枢纽、最终准确率与推理轨迹诚实性脱钩,为高风险科学应用提供机制级评估方案。

Comments 36 pages, 7 figures and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00677 2026-08-04 cs.CL 新提交 83%

OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution

OpenART:通过开放式环境演化扩展智能体红队演练规模

Yunhao Chen, Xin Wang, Yixu Wang, Yi Liu, Jie Li, Yan Teng, Xingjun Ma, Xia Hu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) XSafeAI

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.CL

AI总结 本研究针对现有智能体安全基准无法捕捉累积风险的问题,推出开放式智能体红队演练平台OpenART,并提出EMHA攻击方法,在75种智能体模型配置上实现85.0%的汇总攻击成功率,为复杂环境下的智能体安全研究提供可扩展基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00102 2026-08-04 cs.AI cs.MA 新提交 83%

Can LLM Agents Price Competitively? A Dynamic Multi-Attribute Auction Benchmark for Agentic Commerce

大语言模型智能体能否进行竞争性定价?面向智能体商务的动态多属性拍卖基准

Shimaa Ahmed, Yiwei Cai, Mohsen Minaei, Rahul Rachuri

机构 * Visa Research(维萨研究院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本研究推出动态多属性拍卖基准Bazaar,测试11个前沿LLM智能体的定价能力,发现其在客户获取与利润表现上存在差异,需求冲击下排名变化,最强智能体仅获不到三分之一最优利润,显示仍有提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25379 2026-08-04 cs.AI 版本更新 83%

Cyber-Capable AI Agents: Vulnerabilities, Evaluation Containment, and Defensive Response

具备网络能力的人工智能代理:漏洞、评估遏制与防御响应

Abu Bakar Siddik

机构 * Rajshahi University of Engineering & Technology(拉杰沙希工程技术大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究具备网络能力的人工智能代理的漏洞等问题,综合五类漏洞,以特定事件为案例研究,探讨遏制等控制措施,确定评估网络能力及其运行环境安全性的实际优先事项。

Comments 27 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01004 2026-08-04 cs.LG cs.AI cs.SE 新提交 82%

Who Belongs in the Eval Set? A Capability-Taxonomy-Driven Pipeline for Curating Regression Eval Sets in Agent-Extensibility Platforms

哪些应该进入评估集?面向智能体可扩展性平台的、基于能力分类法的回归评估集编建流水线

Tezan Sahu, Aritra Das, Pankaj Mittal, Sudipta Das

机构 * Microsoft(微软) Indian Institute of Technology Roorkee(鲁尔基印度理工学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 针对智能体可扩展性平台的回归评估集编建问题,提出基于能力分类法的流水线,通过三个组件实现查询决策,可适配带类型化能力分类法的各类编建场景。

Comments Extended abstract accepted at the SERI 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00894 2026-08-04 cs.AR 新提交 82%

Rethinking Agentic Kernel Generation for Emerging Accelerators

面向新兴加速器的智能体内核生成方法反思

Ruijie Gao, Jirong Yang, Barry Lyu, Haoran Jin, Nathan Bleier

专题命中 Agent评测 :agentic(title,abstract);agent(abstract)

AI总结 针对新兴加速器内核生成的现有方法反复重建无关语义的问题,提出编译器介导的Zomboss框架,将语义编译为可复用接口,在20个Gemmini和36个PLENA工作负载上实现全实例正确,且性能优于基线方法、推理成本更低。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05621 2026-08-04 cs.IR 版本更新 82%

ANCHOR: Agentic Noise Creation Framework for Human Simulation and Denoising Recommendation

ANCHOR: 用于人类模拟和去噪推荐的智能体噪声创建框架

Xiangming Li, Hua Chu, Jiaming Liang, Jianan Li, Yangtao Zhou

专题命中 Agent评测 :agentic(title,abstract);agent(abstract)

AI总结 提出ANCHOR框架,通过智能体模拟用户行为生成真实噪声标签,将推荐去噪转化为监督学习问题,实现高效噪声识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01918 2026-08-04 cs.LG cs.CL 新提交 81%

HarnessCompass: Guiding Automatic Harness Evolution toward Generalizable and Effective Agent Harnesses

HarnessCompass:引导自动 harness 进化以生成可泛化且有效的智能体 harness

Luan Zhang, Ruochen Zhou, Dandan Song, Zhengyu Chen, Yuhang Tian, Jun Yang, Huipeng Ma, Chenhao Li, Guangyuan Feng, Xudong Li, Yizhou Jin, Yan Xu

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL、cs.LG

AI总结 HarnessCompass 是一种自动 harness 进化框架,通过约束进化、主动反馈和组件式优化,在 SWE-bench Verified 上用 GPT-5.4 使 Pass@1 提升至 66%,且泛化能力优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00355 2026-08-04 cs.CL cs.LG 新提交 81%

CurveShift: Is Agent Progress Scalar? Separating Level from Shape

CurveShift:智能体的进展是标量吗?区分水平与形态

Hanwen Xing, Pengyun Wang, BingXu Meng, Kumail Alhamoud, Xiang Li, Jicheng Wang, Xin Yu, Xinyang Han, Xiaomin Li, Philip Torr, Yuexing Hao

机构 * University of Southern California(南加利福尼亚大学) University of Chicago(芝加哥大学) University of California, Berkeley(加利福尼亚大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学) University of California, Davis(加利福尼亚大学戴维斯分校) Pennsylvania State University(宾夕法尼亚州立大学) Harvard University(哈佛大学) University of Oxford(牛津大学)

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对大型语言模型进展的标量总结问题,通过LiveCodeBench基准分离混淆,发现2024年9月后发布的模型在竞赛编程难任务上有超出预期的增益,发布了相关数据集与代码。

Comments 25 pages, 4 figures, 7 tables. Data and code: https://github.com/harvenstar/CurveShift

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02444 2026-08-04 cs.AI 新提交 79%

ParEvalLayer: When Partial LLM-Agent Evaluations Support a Decision

ParEvalLayer:当部分大语言模型智能体评估支持决策时

Wei-Jung Huang, Bonan Shen

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 该研究提出ParEvalLayer决策层,可基于部分任务结果判断LLM智能体比较结论,部分基准仅需15%-25%任务结果即可得出与完整评估一致的决策。

Comments Accepted at the 2026 ACM International Conference on AI-ML Systems (AIMLSystems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00981 2026-08-04 cs.AI 新提交 79%

Auditing Discovery Claims: A Two-Sided Criterion for Agentic Science, with the Negative Side Decidable

审计发现主张:面向智能体科学的双边准则,其负面侧可判定

Wenhui Chen, Jianlin Chen, Ziyao Lin, Chi Man Vong

机构 * University of Macau(澳门大学) South China University of Technology(华南理工大学)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 该研究提出面向智能体科学的双边审计准则,通过实验揭示AI科学系统能力主张的夸大问题,证实智能体编写的程序在低计算量下可击败人类程序,但未明确可迁移的机制。

Comments 51 pages, 10 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00106 2026-08-04 cs.LG 新提交 79%

Learning Compositional Meta-Routing for Agentic Workflows: An Executable Benchmark

面向智能体工作流的组合式元路由学习:一个可执行基准

Natan Vidra, Alina Kapanova, Arun Kanhai, Spurthi Setty

专题命中 Agent评测 :agentic(title,abstract);分类 cs.LG

AI总结 本文提出一个智能体工作流的可执行基准和感知预算的组合式元路由器,在保留测试集上实现100%成功率,成本比静态策略低43%,但在词汇偏移挑战任务上表现不佳,凸显词汇泛化是主要限制。

Comments 7 pages, 1 figure; AAAI 2027 anonymous submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11245 2026-08-04 cs.AI 版本更新 79%

Mind the Sim2Real Gap in User Simulation for Agentic Tasks

注意用户模拟中的Sim2Real差距以实现代理任务

Xuhui Zhou, Weiwei Sun, Qianou Ma, Yiqing Xie, Jiarui Liu, Weihua Du, Sean Welleck, Yiming Yang, Graham Neubig, Sherry Tongshuang Wu, Maarten Sap

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 研究发现基于LLM的用户模拟器在代理任务中存在Sim2Real差距,表现出过度合作和缺乏真实反馈,需通过人类验证提升模拟真实性。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01684 2026-08-04 cs.AI 新提交 77%

GABench: A Comprehensive Benchmark for Evaluating LLM Agents on Graph Analysis Tasks

GABench:用于评估大语言模型智能体图分析任务的综合基准

Jiarui Tan, Zhongjian Zhang, YaBo Guo, Jiawei Liu, Yujie Xing, Muhan Zhang, Cheng Yang, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出GABench这一综合基准,涵盖多类图类型与任务及84个可执行工具,构建10400个带可验证答案的任务,评估前沿LLM及智能体框架,发现现有智能体应对复杂图任务仍存局限等结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01645 2026-08-04 cs.AI 新提交 77%

GISAgentBench: A Practitioner-Sourced Benchmark for Evaluating LLM Agents on GIS Tasks

GISAgentBench:面向GIS任务的、由从业者提供的用于评估大语言模型智能体的基准测试

Abhinav Pothuri, Zhe Jiang, Zelin Xu, Di Yang

专题命中 Agent评测 :agent(abstract);planning(abstract);workflow(abstract);分类 cs.AI

AI总结 针对现有GIS智能体基准缺乏真实输出等问题,推出由从业者提供的GISAgentBench基准,含349项多步骤GIS任务,评估显示最佳智能体仅完成32.7%的任务,凸显真实GIS工作流的挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00832 2026-08-04 cs.LG 新提交 77%

AdvPlan-Bench: Adversarial Evaluation of Structured Plan-Generation Agents

AdvPlan-Bench:结构化计划生成智能体的对抗性评估基准

Alina Kapanova, Arun Kanhai, Natan Vidra, Spurthi Setty

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.LG

AI总结 本文提出AdvPlan-Bench,这一结构化计划生成智能体的对抗性评估离线基准,通过多维度指标开展实验验证,为相关研究提供可复现的基准支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00005 2026-08-04 cs.CL cs.AI 新提交 73%

RubricReviewer: From Direct Critique to Objective and Comprehensive Rubric-Driven Peer Review

RubricReviewer:从直接批评到客观全面的基于评分规则的同行评审

Shuyu Guo, Wenxiang Hu, Yuyue Zhao, Yougang Lyu, Xiaohui Yan

机构 * Shandong University(山东大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL

AI总结 RubricReviewer是一种基于评分规则驱动的框架,通过将评分规则生成为中间步骤,并结合Scout与Aligner模型,生成更全面、具判别性且抗攻击的评审意见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14896 2026-08-04 cs.SE cs.AI cs.MA 版本更新 73%

StructureClaw: Traceable LLM Agents and an Executable Benchmark for Structural Engineering Workflows

StructureClaw:用于结构工程工作流程的可追溯大语言模型智能体及可执行基准测试

Sizhong Qin, Yi Gu, Yao Jiang, Ao Cai, Changjian Zhou, Shaoxuan Shuai, Jiachang Wang, Tianhao Shen, Yueqiang Li, Xinhao Li, Li Zeng, Yueshi Chen, Dachen Gao, Genrong Xu, Wenjie Liao, Xinzheng Lu

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 针对结构工程请求评估中难以验证完整证据链的问题,提出StructureClaw及可执行基准测试StructureClaw-Bench,通过工件中心评估提高成功率,发现交互式和多模态评估的挑战,为评估改进结构工程智能体提供更严格基础。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01204 2026-08-04 cs.CL 新提交 70%

ShiJianBench: From Dialogue to Decision for Long-Horizon Evaluation of Investment Advisors

ShiJianBench:面向投资顾问长周期评估的从对话到决策基准

Jie Gong, Maowei Jiang, Zhiwei Liu, Yang Qiao, Wenxi Wu, Mengxi Xiao, Enze Zhang, Ziyan Kuang, Yankai Chen, Caishuang Huang, Meng Zhou, Xiku Du, Xue Liu, Guojun Xiong, Min Peng, Qianqian Xie, Sophia Ananiadou

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 该研究推出ShiJianBench离线框架,用多智能体投资者模拟器评估对话式投资顾问,发现LLM顾问在个性化内容与投资者轨迹上表现更优,凸显需开展轨迹感知评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01149 2026-08-04 cs.AI 新提交 70%

PATH-Bench: Path-Dependent Evaluation of Lifelong Agents

PATH-Bench:面向终身智能体的路径依赖评估基准

Xidong Yang, Xingyi Zhang, Wenhao Li, Wenyan Liu, Junjie Sheng, Yun Hua, Wei Yin, Tao Fang, Chuyun Shen, Xiangfeng Wang

专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 本研究构建了面向终身智能体路径依赖评估的基准PATH-Bench,评估8个智能体后提出SEU机制,该机制可减少遗忘、提升正向迁移,为设计更优终身智能体提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02277 2026-08-04 cs.CR cs.AI 版本更新 70%

Quantifying Frontier LLM Capabilities for Container Sandbox Escape

量化前沿大语言模型突破容器沙盒的能力

Rahul Marchand, Art O Cathain, Jerome Wynne, Philippos Maximos Giavridis, Stuart Jennings, Freddy Tuxworth, Tolga H. Dur, Sam Deverett, John Wilkinson, Jason Gwartz, Harry Coppock

机构 * University of Oxford(牛津大学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 研究大语言模型突破容器沙盒的能力,通过引入SANDBOXESCAPEBENCH基准,利用嵌套沙盒架构和CTF评估,涵盖多种逃逸机制,发现添加漏洞时大语言模型能识别利用,证明此类评估对保障沙盒封装高性能模型的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18130 2026-08-04 cs.SE 版本更新 70%

Doc2Feat-Bench: Evaluating Documentation-Driven Feature Addition

Doc2Feat-Bench:评估文档驱动的功能添加

Zhonghao Jiang, Le Deng, Jialun Cao, Michael Pradel, Zhongxin Liu

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.SE

AI总结 本研究构建了Doc2Feat-bench基准及经人工验证的子集,用于评估软件工程智能体基于文档变更实现功能的能力,发现当前最先进智能体在该任务上的最佳成功率仅为37.72%,且面临跨文件编辑等关键挑战。

Comments Accepted by ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00964 2026-08-04 cs.CY 新提交 67%

Copyright Is the Headline; Capability Is the Blind Spot: AI Technology in the Book-Publishing Trade Press, November 2025--August 2026

版权是头条,能力是盲区:2025年11月—2026年8月图书出版行业媒体中的人工智能技术

Fred Zimmerman

专题命中 Agent评测 :agent(abstract);workflow(abstract)

AI总结 本研究通过分析多国行业媒体的89篇文章,指出图书出版领域AI报道存在能力盲区,提出设立常设AI报道板块等改进建议。

Comments 7 pages, 2 figures. 15-page Supplemental Information, coded 89-item corpus, crosstabs, BibTeX database, and citation audit included as ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00012 2026-08-04 cs.CL cs.AI cs.CY cs.LG 新提交 67%

Obshazard-bench: Benchmarking Multimodal Foundation Models for Real-Time Disaster Intelligence from Raw Earth Observation Streams

Obshazard-bench:面向原始地球观测流的实时灾害情报多模态基础模型基准测试

Fengxiang Wang, Qiuyang Yu, Yueying Li, Mingshuo Chen, Chengchi Fei, Kaiyi Xu, Lixin Gu, Wangxu Wei, Junchao Gong, Lipeng Ma, Jiong Wang, Fenghua Ling, Wenlong Zhang, Xue Yang, Wenjing Yang, Ben Fei, Long Lan

机构 * National University of Defense Technology(国防科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究推出Obshazard-bench基准测试,评估多模态基础模型的实时灾害情报能力,发现现有模型在将原始多通道物理观测转化为符合决策需求的灾害推理方面存在显著局限。

详情

展开后加载摘要…

URL PDF HTML 收藏