arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 806 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 806 篇

2608.09719 2026-08-11 cs.HC 新提交 67%

Mirroring the Past: Exploring How Ancestral Digital Self Influences History Learning

镜像过去:探索祖先数字自我如何影响历史学习

Duo Gong, Fan Sun, Yucen Wang, Yufan Hu, Wen Zhong, Wei Zhang, Pengcheng An

专题命中 工作流自动化 :agent(abstract);workflow(abstract)

AI总结 该研究针对历史学习中学习者与自身的疏离问题,提出AI生成的“祖先数字自我”教学智能体,经被试内研究发现其可提升体验性指标,但未改善即时学习结果,为相关教育环境设计提供启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07952 2026-08-11 cs.LG cs.AI cs.CR cs.SE 新提交 67%

Persistent Semantic Entities in Tool-Augmented LLM Systems

工具增强型大语言模型系统中的持久语义实体

Zhaohui Wang

专题命中 工作流自动化 :agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 该研究定义工具增强型LLM系统的持久语义实体(PSEs),证实其在24款不同规模模型中普遍存在,偏好/指令污染难自校正,上下文隔离自验证可降低污染,为智能体系统安全提供关键发现。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026). Camera-ready version; 32 pages . The openreview url is https://openreview.net/forum?id=zPjmtawzT8&noteId=CXB95ws5so and ICML poster url is https://icml.cc/virtual/2026/poster/60521

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03534 2026-08-05 cs.CR 新提交 67%

A Challenge-Nonce Freshness Gap in Project Veraison's TPM Reference Schemes, Found by Appraising Application-Layer Action Evidence End-to-End

通过端到端评估应用层行动证据发现Project Veraison的TPM参考方案中存在的挑战随机数新鲜度缺口

Anton Sokolov

专题命中 工作流自动化 :agent(abstract);AI agent(abstract)

AI总结 本文发现Project Veraison的TPM参考方案存在挑战随机数新鲜度缺口,通过端到端测试验证修复方案,使重放Quote的评估结果变为否定,提升了RATS架构的安全性。

Comments 18 pages, 3 figures. Responsible disclosure: veraison/services#427, fixed in PR #432. Artifact and data: doi:10.5281/zenodo.20998730

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28836 2026-08-03 cs.ET cs.MA cs.NI 新提交 67%

The AnyLog Edge Data Fabric

AnyLog 边缘数据架构

Roy Shadmon, Mark Davidson, Eric Aquaronne, Massimiliano Pinto, Ori Shadmon, Moshe Shadmon

专题命中 工作流自动化 :agent(abstract);AI agent(abstract)

AI总结 本文提出 AnyLog 边缘数据架构,该基于智能体与边缘的平台可在源端管理运营数据,通过多项技术让用户无需知晓资源位置即可操作分布式资源,为分布式 SQL 等提供类云操作模式,无单点故障且不依赖集中式基础设施。

Comments Keywords: IoT Data Management, Edge Data Management, Edge Data Fabric, Distributed Query, Edge AI, P2P Data Layer, Decentralized Data Layer. 30 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27918 2026-07-31 math.OC 新提交 67%

OptGraph: Large Language Models Enhanced Evolutionary Optimization Via Graph Retrieval-Augmented Generation

OptGraph:基于图检索增强生成的大语言模型增强进化优化

Xianchao Xiu, Jianhao Li, Huangyue Chen, Wanquan Liu

专题命中 工作流自动化 :workflow(abstract);agentic(abstract)

AI总结 针对现有LLM自动化进化优化的局限,提出引入GraphRAG的OptGraph工作流,通过类型化图复用经验等方法,在基准数据集上较现有框架平均精确准确率提升8.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25326 2026-07-29 cs.GR cs.CG 新提交 67%

Functionally Grading the Slicing Process by Compiling Design Intent into Slicer Projects

通过将设计意图编译到切片器项目中对切片过程进行功能分级

Charles Wade, Devon Beck, Robert MacCurdy

专题命中 工作流自动化 :planning(abstract);workflow(abstract)

AI总结 研究如何对切片过程进行功能分级,核心方法是提出切片器项目编译的自动化工作流程,将异构隐式设计转换为切片器原生项目,主要贡献是通过示例展示该方法并开源实现,连接异构设计与切片器生态系统,助力功能分级FFF制造。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23588 2026-07-28 cs.CV 新提交 67%

JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents

JarvisHub:用于原生画布多模态创意智能体的开放框架

Yunlong Lin, Zixu Lin, Zhaohu Xing, Biqiang Li, Chenxin Li, Haonan Wang, Haitao Wu, Hengyu Liu, Jianghai Chen, Kaituo Feng, Kaixin Li, Shawn Chen, Shijue Huang, Sixiang Chen, Tsung-Yi Ho, Wenxuan Huang, Xiangyan Liu, Xiaomeng Hu, Xuanhua He, Yan Sun, Yunqing Zhao, Zhiqin Yang, Zehan Wang, Zhengyang Tang, Tianyu Pang, Xiangyu Yue

专题命中 工作流自动化 :agent(abstract);tool use(abstract)

AI总结 研究针对创意人工智能从单步到多模态创作转变中现有系统不足的问题,引入JarvisHub框架,以可编辑画布为核心,通过三层架构让智能体实现持续、人工可控的创意自动化创作。

Comments 15 pages, 9 figures. Project page: https://www.jarvishub.site/ Code github: https://github.com/LYL1015/JarvisHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21608 2026-07-27 cs.SE cs.AI cs.CL cs.CY 新提交 67%

From Obligation to Specification: A Survey on Validating EU AI Act Requirements in RE

从义务到规范:关于在需求工程中验证欧盟人工智能法案要求的调查

T. Y. Emmy Lai, Sven Giesselbach, Matthias Koch, Héctor Allende-Cid

专题命中 工作流自动化 :agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 研究围绕欧盟人工智能法案生效后组织面临的新义务,通过混合方法探索性研究,评估组织准备及对大语言模型智能验证工具的看法,发现虽法案相关但结构化机制缺失,该工具在映射义务等方面有前景但需保障措施,还概述了闭环方法最低要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20453 2026-07-24 cs.CL cs.AI cs.LG 新提交 67%

A Knowledge-Injection Framework for Zero-Shot Adaptation of LLMs to Delirium Prediction

一种用于将大语言模型零样本适应谵妄预测的知识注入框架

Jessica Sena, Shesadree Priyadarshani, Miguel Contreras, Bharat Gandhi, Scott Siegel, Subhash Nerella, Parisa Rashidi

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 针对大语言模型零样本适应谵妄预测中领域知识不足问题,提出轻量级知识注入框架。在推理时用外部临床知识报告增强数据摘要,无需微调或检索。实验表明该方法能提升模型性能,缩小与前沿模型差距,且收益依赖临床意义内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18316 2026-07-22 cs.SE cs.AI cs.CL 新提交 67%

Binding Drift in Multi-Step Tool-Augmented Agents

多步工具增强智能体中的绑定漂移

Rahul Suresh Babu, Shashank Indukuri

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 研究多步工具增强智能体中实体绑定随时间的变化,区分绑定漂移与错误传播。通过实验发现实体锁定会放大错误操作,实用的重新验证器可减少错误,自然设置下基线智能体有漂移现象,且持久性和重新验证不可互换。

Comments 14 pages, 5 tables, 1 figure. Equal contribution by both authors. Code and data: https://github.com/shashank-indukuri/binding-drift

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18039 2026-07-21 cs.IR 新提交 67%

Evidence-in-the-Loop: Trace-Driven Optimization for Customer-Service LLM Agents

循证优化:面向客户服务语言模型代理的跟踪驱动优化

Chunming Wu, Dafei Qiu, Congde Yuan, Charles Quan, Jun Wu, Suipeng Li, Mo Wu, Gavin Xie, Hope Chen, Max Yao

专题命中 工作流自动化 :agent(abstract);workflow(abstract)

AI总结 研究面向客户服务语言模型代理的优化,提出循证客户服务代理工作流程,通过多种技术构建证据,结合政策引导编排。贡献混合RAG证据构建、循证问题/行动决策、跟踪驱动的RAG和重排器改进三种部署模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13306 2026-07-03 cs.GT 新提交 67%

EconCSLib: AI-Assisted Lean Formalization for Economics & Computation research

EconCSLib: 人工智能辅助的经济学与计算研究Lean形式化

Nikhil Garg

专题命中 工作流自动化 :agent(abstract);workflow(abstract)

AI总结 提出EconCSLib,一个基于Lean 4的库和工作流,利用语言模型辅助形式化经济学与计算领域的研究论文,通过人-AI-Lean协作流程实现论文声明到形式化语句的翻译与验证。

Comments Accepted to EC'26 Workshop on AI-Driven Research in EconCS (AI-EconCS '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24177 2026-06-24 cs.SE cs.AI cs.CL cs.MA 新提交 67%

Agon: An Autonomous Large-Scale Omnidisciplinary Research System Built on Prompt Economy

Agon:基于提示经济学的自主大规模全学科研究系统

Youran Sun, Xingyu Ren, Chugang Yi, Jiaxuan Guo, Kejia Zhang, Jianda Du, Haizhao Yang

机构 * University of Maryland, College Park(马里兰大学 College Park 分校) The Chinese University of Hong Kong(香港中文大学) Stanford University(斯坦福大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 提出Agon研究编排系统,通过提示经济学循环实现大规模自主研究,将可验证任务自动化,不可验证判断留给人类,并分类了系统失败类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21167 2026-06-23 cs.PL cs.LO 新提交 67%

AI-Assisted Completion of CertiGC Proofs: An Experience Report

AI辅助完成CertiGC证明:经验报告

Shengyi Wang

专题命中 工作流自动化 :workflow(abstract);agentic(abstract)

AI总结 本文报告使用Codex辅助完成CertiGC垃圾收集器证明的经验,通过引入记录后向边不变量修复证明,并审计清理了过时条件。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22774 2026-06-23 physics.optics 新提交 67%

Autonomous Generation of Metamaterial Databases Based on Multimodal Agents

基于多模态代理的元材料数据库自主生成

Shilong Qin, Zhicai Yu, Xuan Zheng, Yan Zhang, Aodi Yang, Kezhan Zhao, Qi Cheng Chen, Jian Wei You, Tie Jun Cui

专题命中 工作流自动化 :agent(abstract);multi-agent(abstract)

AI总结 提出MetaDataGenAgent多模态多代理框架,通过文献到仿真的自动化流程,从非结构化科学文献中提取并生成元材料结构-响应数据库,实现远场波束偏转、近场全息成像等功能。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11722 2026-06-11 cs.LG cs.AI cs.CL 新提交 67%

ICA Lens: Interpreting Language Models Without Training Another Dictionary

ICA Lens: 无需训练另一本词典即可解释语言模型

Sida Liu, Feijiang Han

机构 * Independent Researcher(独立研究员) University of Maryland(马里兰大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出ICALens,基于独立成分分析(ICA)高效提取语言模型表示中可解释方向,无需训练稀疏自编码器,在SAEBench上表现竞争力。

Comments Ongoing Project

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08400 2026-06-09 cs.SE cs.AI cs.CL 新提交 67%

Impacts of Histories and Models on LLM Grading: A Study in Advanced Software Engineering Courses

历史与模型对LLM评分的影响:高级软件工程课程研究

Qilin Zhou, Zhuo Wang, Yue Li, W. K. Chan

机构 * City University of Hong Kong(香港城市大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 针对研究生阅读报告评分负担重的问题,提出人机协同的LLM辅助评分流程,基于180份作业评估Grok和GPT的评分一致性与人类对齐,发现交互历史导致评分标准漂移,需特定操作缓解不公平。

Comments 5 pages, accepted by ISET 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07491 2026-06-08 cs.DC cs.AI cs.LG cs.SE 新提交 67%

Twelve quick tips for designing AI-driven HPC workflows

设计AI驱动的高性能计算工作流的十二条快速技巧

Jamie J. Alnasir

机构 * Department of Computer Science(计算机科学系) Royal Holloway University of London(伦敦皇家霍洛威大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 本文针对AI与HPC融合带来的新挑战,提出十二条实用技巧,涵盖容器化、作业数组、反馈循环和I/O优化,帮助设计高效、可扩展、可复现的AI驱动HPC工作流。

Comments 12 pages, 1 figure. Formatted using the bioRxiv LaTeX preprint style

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06727 2026-06-08 cs.RO cs.SY eess.SY 新提交 67%

IDDMBSE: Integrating Data-Driven and Model-Based Systems Engineering for Trusted Autonomous Cyber-Physical Systems

IDDMBSE:集成数据驱动和基于模型的系统工程用于可信自主网络物理系统

John S. Baras, Sai Sandeep Damera, Ryan Matheu, Clinton Enwerem, Praveen M. S. Kumar

机构 * Institute for Systems Research, University of Maryland, College Park(系统研究所,马里兰大学,College Park)

专题命中 工作流自动化 :planning(abstract);workflow(abstract)

AI总结 提出IDDMBSE方法,将MBSE V流程与数据驱动循环结合,通过开源工具链PERFECT、TRADES-X和VERITAS实现,在自主地面机器人全生命周期验证其有效性。

Comments 9 pages, 11 figures. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13459 2026-08-14 cs.SE cs.AI cs.LO 新提交 62%

CAPRI: Contract-Aware Proof Repair for Isabelle

CAPRI:面向Isabelle的感知契约的证明修复

Jim Woodcock, Gabriel Leite, Augusto Sampaio, Ran Wei

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 该研究提出CAPRI工具,用于解决Isabelle证明修复中LLM修改未授权内容的问题,通过契约检查机制保障安全,在12个失败证明的实验中验证了不同工作流的修复效果。

Comments 17 pages, 1 figure, 7 tables. Submitted to SBMF 2026. Reproducibility artefact available on Zenodo

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12144 2026-08-13 cs.SE cs.LG 新提交 62%

ADEPT: A Unified Framework for Deep Learning Test Adequacy

ADEPT:深度学习测试充分性的统一框架

Yidi Kao, Shawn Burnham, Tommi Rose Fahy, Ali Ghanbari

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG、cs.SE

AI总结 本文提出 ADEPT 框架,整合多种深度学习测试充分性指标,提供统一工作流与配置管理,解决指标难复现、难比较问题,方便研究人员和从业者使用。

Comments Proceedings of 35th ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08618 2026-08-11 cs.RO cs.AI cs.CL 新提交 62%

RAG-Based Auto-Configuration for Industrial Fieldbus Devices

基于检索增强生成(RAG)的工业现场总线设备自动配置

Aadil Gani Ganie, Saad Ezzini, Naveed Farooz Marazi

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 针对工业现场总线设备手动配置的低效易错问题,提出SysName流水线,结合RAG、本地LLM与两级弃权门控,在多协议设备配置任务中实现高效高准确率的端到端自动化,经基准测试与案例验证效果优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07435 2026-08-10 cs.CV cs.AI cs.CL 新提交 62%

SABRE: Scalable and Automated Benchmarking of VLMs under Stress

SABRE:压力场景下视觉语言模型(VLM)的可扩展自动化基准测试

Zixuan Lan, Luzhe Sun, Matthew R. Walter, Jiawei Zhou

机构 * University of Chicago(芝加哥大学) Toyota Technological Institute at Chicago(芝加哥丰田技术学院) Stony Brook University(石溪大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 SABRE是可扩展自动化VLM压力测试框架,可生成多维度测试样本,经实验验证其能有效评估VLMs对视觉证据与世界先验的依赖程度,支持多种压力测试场景。

Comments 22 pages, 10 figures. Code and resources will be available at https://zesearch.github.io/vlm-SABRE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06265 2026-08-07 cs.AI cs.DB cs.LG 新提交 62%

Improving the Realism of Synthetic Clinical Benchmarks Under Utility Constraints

在效用约束下提升合成临床基准的真实性

Omid Bazgir, Md Nasir, Jacob Hoffman, Yang Yang, Manu Agrawal, Anusua Trivedi, Vinay Rao Dandin, Chris Gibbons, Christine Swisher

机构 * Oracle Health and Life Sciences(甲骨文健康与生命科学部门)

专题命中 工作流自动化 :AI agent(abstract);分类 cs.AI、cs.LG

AI总结 本文针对合成临床基准的结构不真实问题,提出在不破坏下游效用检查的前提下提升其真实性的方法,通过确定性修正改善基准指标,明确需将效用作为约束而非真实性的充分证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05060 2026-08-06 cs.SE cs.AI 新提交 62%

RepairFormer: Automated Repair of Structured Inputs Using Transformers

RepairFormer:基于Transformer的结构化输入自动修复框架

Ovi Paul, Tom J King, Ali Shokri

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 RepairFormer是基于Transformer的结构化输入修复框架,通过格式标签、预言机验证等技术提升修复与内容恢复率,运行速度较现有最优方法快5倍,可高效修复JSON等结构化输入。

Comments 5 pages, 2 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03926 2026-08-05 cs.LG cs.AI cs.CV 新提交 62%

PRISM: Powerful Time Series to Image (TS2I) Representations for Multivariate Anomaly Detection

PRISM:用于多元异常检测的强大时间序列转图像(TS2I)表示

Mateusz Smendowski, Kamil Faber, Piotr Nawrocki, Nathalie Japkowicz, Roberto Corizzo

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 PRISM是用于多元异常检测的即插即用元工作流,通过构建基于图像的时间序列表示,在14个数据集中的10个上取得最佳VUS-PR,冻结ImageNet预训练编码器可高效迁移至TSAD,性能损失小且训练更快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03913 2026-08-05 cs.LG cs.CL 新提交 62%

Sparse Weight Decomposition for Efficient Circuit Extraction

用于高效电路提取的稀疏权重分解

Chuanhao Yan, Xuhan Huang, Yawen Duan, Zhenfei Yin, Hang Zhao, Bryan Dai, Jie Fu

专题命中 工作流自动化 :workflow(abstract);分类 cs.CL、cs.LG

AI总结 提出Sparse Weight Decomposition(SWD)方法,将预训练Transformer权重矩阵分解为稀疏因子以提供可解释电路单元,在低数据量下实现高保真电路提取,适用于多模型及全模型替换,还支持零数据变体以拓展机械可解释性分析应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02662 2026-08-05 cs.LG cs.AI 新提交 62%

Verifier-Guided Model Discovery for Physical Dynamical Systems with Pretrained Symbolic Transformers

基于预训练符号 Transformer 的物理动力系统验证器引导式模型发现

Farbod Faraji, Francesco Belardinelli

机构 * Imperial College London(伦敦帝国学院)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出了一种验证器引导式(VG)工作流程,基于预训练符号 Transformer ODEFormer 实现物理动力系统的可解释预测,在范德波尔振荡器和涡旋脱落场景中展现出优于原方法的性能与泛化能力。

Comments 33 pages, 13 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02638 2026-08-05 cs.SE cs.AI 新提交 62%

Studying, Identifying, and Fixing Hidden Technical Debt in AI-Intensive Cyber-Physical Systems

研究、识别与修复人工智能密集型网络物理系统中的隐性技术债务

Beena

专题命中 工作流自动化 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 本论文针对AI密集型网络物理系统(AI-CPS)的特殊技术债务,通过分析生态系统、代码仓库及开发者访谈刻画其特征,提出识别与缓解方法,并计划开发自动化工具以监控和偿还该类技术债务。

Comments Doctoral Symposium of the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02027 2026-08-04 cs.LG cs.SE 新提交 62%

Scikit-fingerprints: Python library for scikit-learn compatible molecular fingerprints and chemoinformatics

scikit-fingerprints:兼容scikit-learn的分子指纹与化学信息学Python库

Jakub Adamczyk, Adam Staniszewski

机构 * Faculty of Computer Science, AGH University of Krakow(克拉科夫AGH科技大学计算机科学学院)

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG、cs.SE

AI总结 该研究推出基于RDKit的scikit-fingerprints库,填补化学信息学框架与scikit-learn生态的兼容空白,整合多类功能,提升分子机器学习的原型开发、复现与部署效率。

详情

展开后加载摘要…

URL PDF HTML 收藏