arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 10469 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 10469 篇

2608.13459 2026-08-14 cs.SE cs.AI cs.LO 新提交 62%

CAPRI: Contract-Aware Proof Repair for Isabelle

CAPRI:面向Isabelle的感知契约的证明修复

Jim Woodcock, Gabriel Leite, Augusto Sampaio, Ran Wei

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 该研究提出CAPRI工具,用于解决Isabelle证明修复中LLM修改未授权内容的问题,通过契约检查机制保障安全,在12个失败证明的实验中验证了不同工作流的修复效果。

Comments 17 pages, 1 figure, 7 tables. Submitted to SBMF 2026. Reproducibility artefact available on Zenodo

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12144 2026-08-13 cs.SE cs.LG 新提交 62%

ADEPT: A Unified Framework for Deep Learning Test Adequacy

ADEPT:深度学习测试充分性的统一框架

Yidi Kao, Shawn Burnham, Tommi Rose Fahy, Ali Ghanbari

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG、cs.SE

AI总结 本文提出 ADEPT 框架,整合多种深度学习测试充分性指标,提供统一工作流与配置管理,解决指标难复现、难比较问题,方便研究人员和从业者使用。

Comments Proceedings of 35th ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00408 2026-08-12 cs.LG cs.AI physics.optics quant-ph 版本更新 62%

Exact and Asymptotically Complete Robust Verifications of Neural Networks via Ising Solvers

基于量子优化的神经网络精确且渐进完备的鲁棒验证

Wenxin Li, Wenchao Liu, Weihao Li, Chuan Wang, Qi Gao, Yin Ma, Hai Wei, Kai Wen

机构 * Beijing QBoson Quantum Technology Co., Ltd.(北京QBoson量子技术有限公司) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文提出两种基于量子优化的模型,用于精确且渐进完备地验证神经网络的鲁棒性,通过分段线性界限和量子Benders分解提高认证效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08618 2026-08-11 cs.RO cs.AI cs.CL 新提交 62%

RAG-Based Auto-Configuration for Industrial Fieldbus Devices

基于检索增强生成(RAG)的工业现场总线设备自动配置

Aadil Gani Ganie, Saad Ezzini, Naveed Farooz Marazi

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 针对工业现场总线设备手动配置的低效易错问题,提出SysName流水线,结合RAG、本地LLM与两级弃权门控,在多协议设备配置任务中实现高效高准确率的端到端自动化,经基准测试与案例验证效果优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07435 2026-08-10 cs.CV cs.AI cs.CL 新提交 62%

SABRE: Scalable and Automated Benchmarking of VLMs under Stress

SABRE:压力场景下视觉语言模型(VLM)的可扩展自动化基准测试

Zixuan Lan, Luzhe Sun, Matthew R. Walter, Jiawei Zhou

机构 * University of Chicago(芝加哥大学) Toyota Technological Institute at Chicago(芝加哥丰田技术学院) Stony Brook University(石溪大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 SABRE是可扩展自动化VLM压力测试框架,可生成多维度测试样本,经实验验证其能有效评估VLMs对视觉证据与世界先验的依赖程度,支持多种压力测试场景。

Comments 22 pages, 10 figures. Code and resources will be available at https://zesearch.github.io/vlm-SABRE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06265 2026-08-07 cs.AI cs.DB cs.LG 新提交 62%

Improving the Realism of Synthetic Clinical Benchmarks Under Utility Constraints

在效用约束下提升合成临床基准的真实性

Omid Bazgir, Md Nasir, Jacob Hoffman, Yang Yang, Manu Agrawal, Anusua Trivedi, Vinay Rao Dandin, Chris Gibbons, Christine Swisher

机构 * Oracle Health and Life Sciences(甲骨文健康与生命科学部门)

专题命中 工作流自动化 :AI agent(abstract);分类 cs.AI、cs.LG

AI总结 本文针对合成临床基准的结构不真实问题,提出在不破坏下游效用检查的前提下提升其真实性的方法,通过确定性修正改善基准指标,明确需将效用作为约束而非真实性的充分证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05060 2026-08-06 cs.SE cs.AI 新提交 62%

RepairFormer: Automated Repair of Structured Inputs Using Transformers

RepairFormer:基于Transformer的结构化输入自动修复框架

Ovi Paul, Tom J King, Ali Shokri

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 RepairFormer是基于Transformer的结构化输入修复框架,通过格式标签、预言机验证等技术提升修复与内容恢复率,运行速度较现有最优方法快5倍,可高效修复JSON等结构化输入。

Comments 5 pages, 2 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03926 2026-08-05 cs.LG cs.AI cs.CV 新提交 62%

PRISM: Powerful Time Series to Image (TS2I) Representations for Multivariate Anomaly Detection

PRISM:用于多元异常检测的强大时间序列转图像(TS2I)表示

Mateusz Smendowski, Kamil Faber, Piotr Nawrocki, Nathalie Japkowicz, Roberto Corizzo

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 PRISM是用于多元异常检测的即插即用元工作流,通过构建基于图像的时间序列表示,在14个数据集中的10个上取得最佳VUS-PR,冻结ImageNet预训练编码器可高效迁移至TSAD,性能损失小且训练更快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03913 2026-08-05 cs.LG cs.CL 新提交 62%

Sparse Weight Decomposition for Efficient Circuit Extraction

用于高效电路提取的稀疏权重分解

Chuanhao Yan, Xuhan Huang, Yawen Duan, Zhenfei Yin, Hang Zhao, Bryan Dai, Jie Fu

专题命中 工作流自动化 :workflow(abstract);分类 cs.CL、cs.LG

AI总结 提出Sparse Weight Decomposition(SWD)方法,将预训练Transformer权重矩阵分解为稀疏因子以提供可解释电路单元,在低数据量下实现高保真电路提取,适用于多模型及全模型替换,还支持零数据变体以拓展机械可解释性分析应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02662 2026-08-05 cs.LG cs.AI 新提交 62%

Verifier-Guided Model Discovery for Physical Dynamical Systems with Pretrained Symbolic Transformers

基于预训练符号 Transformer 的物理动力系统验证器引导式模型发现

Farbod Faraji, Francesco Belardinelli

机构 * Imperial College London(伦敦帝国学院)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出了一种验证器引导式(VG)工作流程,基于预训练符号 Transformer ODEFormer 实现物理动力系统的可解释预测,在范德波尔振荡器和涡旋脱落场景中展现出优于原方法的性能与泛化能力。

Comments 33 pages, 13 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02638 2026-08-05 cs.SE cs.AI 新提交 62%

Studying, Identifying, and Fixing Hidden Technical Debt in AI-Intensive Cyber-Physical Systems

研究、识别与修复人工智能密集型网络物理系统中的隐性技术债务

Beena

专题命中 工作流自动化 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 本论文针对AI密集型网络物理系统(AI-CPS)的特殊技术债务,通过分析生态系统、代码仓库及开发者访谈刻画其特征,提出识别与缓解方法,并计划开发自动化工具以监控和偿还该类技术债务。

Comments Doctoral Symposium of the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02027 2026-08-04 cs.LG cs.SE 新提交 62%

Scikit-fingerprints: Python library for scikit-learn compatible molecular fingerprints and chemoinformatics

scikit-fingerprints:兼容scikit-learn的分子指纹与化学信息学Python库

Jakub Adamczyk, Adam Staniszewski

机构 * Faculty of Computer Science, AGH University of Krakow(克拉科夫AGH科技大学计算机科学学院)

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG、cs.SE

AI总结 该研究推出基于RDKit的scikit-fingerprints库,填补化学信息学框架与scikit-learn生态的兼容空白,整合多类功能,提升分子机器学习的原型开发、复现与部署效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01640 2026-08-04 cs.SE cs.AI 新提交 62%

AI-assisted Script Management for Requirements Elicitation Interviews

AI辅助的需求启发访谈脚本管理

Anmol Singhal, Paulo Carvalho, Travis Breaux

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 本文提出结合业务目标的AI辅助脚本生成与实时主题追踪、按需跟进问题生成的需求启发工作流,准实验显示其脚本质量更高、访谈表现更优,为需求启发提供了AI辅助支架。

Comments 12 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08277 2026-08-04 quant-ph cs.AI cs.LG 版本更新 62%

QARIMA: A Quantum Approach To Classical Time Series Analysis

QARIMA:一种用于经典时间序列分析的量子方法

Nishikanta Mohanty, Bikash K. Behera, Badshah Mukherjee, Pravat Dash, Giuseppe Sergioli, Roberto Giuntini

机构 * Università degli Studi di Cagliari(卡利亚里大学) SAS Middle East Fz-Llc.(SAS中东有限责任公司)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种结合量子辅助滞后发现与固定配置变分量子电路的量子启发ARIMA方法,通过量子自相关和量子偏自相关识别差分和候选滞后,提升时间序列参数估计与滞后细化效率。

Comments 17 Algorithms, 19 Figures , 26 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06543 2026-08-04 cs.CL cs.LG 版本更新 62%

The Illusion of Stochasticity in LLMs

大语言模型中的随机性错觉

Xiangming Gu, Soham De, Michalis Titsias, Larisa Markeeva, Petar Veličković, Razvan Pascanu

机构 * Google DeepMind(谷歌DeepMind) National University of Singapore(新加坡国立大学)

专题命中 工作流自动化 :agentic(abstract);分类 cs.CL、cs.LG

AI总结 研究指出大语言模型作为智能体在随机采样方面存在根本性缺陷,通过多模型家族和分布的实证分析揭示了这一问题。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29383 2026-08-03 cs.LG cs.DC cs.SE 新提交 62%

Exploring Block Anomaly Detection In HDFS Log Data Analysis

HDFS日志数据分析中的块异常检测探索

WenYang Zhong, Tutut Herawan

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG、cs.SE

AI总结 本研究针对HDFS日志人工异常检测复杂枯燥的问题,提出结合LLM-BiLSTM模型与Kafka流式管道的检测方案,实现HDFS块异常的快速准确检测。

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28666 2026-08-03 cs.CL cs.LG 新提交 62%

The Checking Problem: What must be true before AI ships in a regulated firm

核查问题:受监管企业在AI产品交付前必须满足什么条件

Prerit Ahuja

专题命中 工作流自动化 :workflow(abstract);分类 cs.CL、cs.LG

AI总结 本文研究受监管金融服务领域AI项目停滞的机制,通过多模型多配置实验发现,AI工作流价值更多取决于人类审核量,而非正确率,且审核负担可通过样本外估算测量。

Comments 10 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08804 2026-08-03 cs.CY cs.CL cs.LG 62%

Estimating Item Difficulty Using Large Language Models and Tree-Based Machine Learning Algorithms

利用大语言模型和基于树的方法进行项目难度估计

Pooya Razavi, Sonya Powers

专题命中 工作流自动化 :workflow(abstract);分类 cs.CL、cs.LG

AI总结 本研究利用大语言模型和基于树的方法预测K-5数学和阅读评估项目的难度,发现基于特征的方法在预测准确性上优于直接估计方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27955 2026-07-31 cs.DL cs.AI cs.CL cs.IR 新提交 62%

SciSchema.org: A Multidisciplinary Collection of Schemas for Structured Scientific Process Descriptions

SciSchema.org:用于结构化科学过程描述的多学科模式集合

Jennifer D'Souza, Sameer Sadruddin, Anisa Rula, Ana Bossler, Andrés Fullana, Enric Bas, Syed Ather, Defne Circi, Anlan Chen, L. Catherine Brinson, Alyssa Columbus, George Demetriou, Dongjun Jeong, Tarun Kumar, Frank Krüger, Sascha Genehr, Kai Budde-Sagert, Anamaria Leonescu, Francesco Lodola, Chiara Florindi, Gagana Balasubramanya Murthy, Samson Oluwapelumi Olagbile, Nazia Riasat, Yan Sha, Kevin Shen, Shaokai Yang

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 SciSchema.org发布首个多学科科学过程模式集合,采用人在回路模式挖掘工作流构建,支持科学领域结构化标注等多项应用。

Comments 25 pages, 9 figures, Submitted for peer review to Nature Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16138 2026-07-31 cs.LG cs.AI hep-ex 版本更新 62%

SNAC-Pack 2.0: Scaled-Out Surrogate Neural Architecture Codesign

代理神经架构协同设计包(SNAC-Pack)

Jason Weitz, Dmitri Demler, Benjamin Hawks, Aaron Wang, Nhan Tran, Javier Duarte

机构 * University of California San Diego(加州大学圣地亚哥分校) ETH Zurich(苏黎世联邦理工学院) Fermi National Accelerator Laboratory(费米国家加速器实验室) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 工作流自动化 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SNAC-Pack,一种面向硬件的自动化机器学习框架,用于神经架构协同设计和端到端FPGA部署,通过多目标全局搜索和硬件代理模型减少合成成本,并结合量化感知训练和迭代幅度剪枝来压缩模型,最终在FPGA上实现高效部署。

Comments 16 pages, 3 figures, Camera-ready version for International Conference on Automated Machine Learning (AutoML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23696 2026-07-28 cs.AI cs.LG 新提交 62%

Offline-to-Online Creative Optimization with Generative Models and Adaptive Testing

基于生成模型和自适应测试的离线到在线创意优化

Kevin Lee, Benjamin Letham, Zhiyuan Jerry Lin, Elodie Samson, Eric Onofrey, Poppy Zhang, Shawndra Hill, Eytan Bakshy

机构 * University of Michigan(密歇根大学) Meta

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 研究如何利用历史A/B测试数据,通过性能驱动的离线到在线工作流程,用预测模型指导生成测试广告位候选创意,经实验验证该方法能有效提升创意参与度,为创意优化提供设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22688 2026-07-28 cs.AI cs.CL 新提交 62%

Co-Harness: Co-Evolving Harnesses and Model Weights for LLM Agents

协同控制:大语言模型智能体的控制与模型权重协同进化

Zhengyu Chen, Teng Xiao, Huaisheng Zhu, Yige Yuan, Luan Zhang, Jingang Wang

专题命中 工作流自动化 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究针对训练后智能体优化问题,提出协同控制框架,交替优化控制与模型参数。通过基于大语言模型的控制批评家分析失败轨迹并提出更新,再用改进控制生成的轨迹微调模型,案例研究显示该方法能提升智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00044 2026-07-28 physics.chem-ph cs.AI cs.LG q-bio.QM 62%

UAlign: Pushing the Limit of Template-free Retrosynthesis Prediction with Unsupervised SMILES Alignment

UAlign: 推动无模板反合成预测的极限:基于无监督SMILES对齐

Kaipeng Zeng, Bo yang, Xin Zhao, Yu Zhang, Fan Nie, Xiaokang Yang, Yaohui Jin, Yanyan Xu

专题命中 工作流自动化 :planning(abstract);分类 cs.AI、cs.LG

AI总结 UAlign通过无监督SMILES对齐技术,提升无模板反合成预测的准确性,超越现有模板化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22428 2026-07-27 cs.HC cs.AI cs.LG cs.MM 新提交 62%

Unboxing Diffusion Models for the Arts: Interactive Model Bending and Practice-Based Explainability

剖析艺术领域的扩散模型:交互式模型调整与基于实践的可解释性

Ahmed M. Abuzuraiq, Philippe Pasquier

机构 * School of Interactive Arts and Technology, Surrey, Canada(交互艺术与技术学院,英国苏城)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨创意实践中可解释人工智能,提出以实验和干预为中心的方法,通过集成模型调整和交互界面到工作流程,经对Stable Diffusion 1.5分析,助艺术家理解模型组件对生成图像的影响,让大型模型成为创意材料。

Comments Under review for "Explainable AI for the Arts" (N. Bryan-Kinns, Ed.), Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21117 2026-07-24 cs.LG cs.AI 新提交 62%

GlucoTune: A Unified Framework for Blood Glucose Preprocessing, Forecasting, and Benchmarking in Diabetes

GlucoTune:糖尿病血糖预处理、预测及基准测试的统一框架

Davide Marelli, Giorgia Rigamonti, Mirko Paolo Barbato, Paolo Napoletano

机构 * Department of Informatics, Systems and Communication, University of Milano-Bicocca(米兰比可卡大学信息、系统与通信系)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 GlucoTune框架解决糖尿病血糖数据预处理等缺乏标准流程与评估协议问题,通过可配置管道实现可重复预处理,提供统一接口和基准测试排行榜,集成数据集,经实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18256 2026-07-22 cs.AI cs.LG 新提交 62%

PEARL: Solver-in-the-Loop Interactive Optimization Modeling from Natural Language

PEARL:基于自然语言的循环求解器交互式优化建模

Hongliang Lu, Zhong Li, Yuxuan Chen, Yuan Lan, Fan Zhang, Zaiwen Wen

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 研究旨在解决优化建模问题,提出PEARL系统,通过在循环中使用Python执行和数学编程求解器,学习优化策略,在多轮工具集成设置下提升求解率,在优化建模任务中表现优于强大基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17427 2026-07-21 cs.LG cs.CL q-fin.CP 新提交 62%

Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families

删除并非手术刀:拒绝移除对不同模型家族决策倾向的非目标效应

Aleksander Fafuła

机构 * huihui-ai(慧慧人工智能)

专题命中 工作流自动化 :agent(abstract);分类 cs.CL、cs.LG

AI总结 研究“无审查”开放权重模型中删除模型拒绝方向的操作影响,以21600个不确定性决策为探针,对比两个专家混合模型家族的基础与删除模型,发现有多种效应,还发现污染渠道,表明部署此类模型得到的是不同决策者。

Comments 11 pages, 5 figures, 4 tables. Preregistered. Data and code: https://github.com/oleczek/paper-abliteration-not-a-scalpel ; dataset DOI: 10.5281/zenodo.21314839

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05690 2026-07-21 cs.AI cs.CL 版本更新 62%

Memory in the Loop: In-Process Retrieval as Extended Working Memory for Language Agents

循环中的记忆:进程内检索作为语言智能体的扩展工作记忆

Yusuf Khan, Carlo Lipizzi

机构 * Stevens(史蒂文斯理工学院)

专题命中 工作流自动化 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究语言智能体中记忆进入循环的情况,通过对比网络存储和进程内存储的延迟,利用扩展思维理论提出进程内检索可作扩展工作记忆,经实验验证能提升召回率,还重新定位了操作瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26258 2026-07-17 cs.CL cs.LG 版本更新 62%

FlowBot: Inducing LLM Workflows with Bilevel Optimization and Textual Gradients

FlowBot:通过双层优化和文本梯度诱导LLM工作流

Hongyeon Yu, Young-Bum Kim, Yoon Kim

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 工作流自动化 :workflow(abstract);分类 cs.CL、cs.LG

AI总结 本文提出FlowBot,一种基于双层优化和文本梯度的数据驱动方法,自动诱导LLM代理和工作流,与人类设计的基线相比表现相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13189 2026-07-16 cs.CL cs.AI 新提交 62%

RAGthoven at SemEval-2026 Task 1: A Multi-Stage Pipeline Walks Into a Benchmark and Barely Clears the Bar

RAGthoven参加SemEval-2026任务1:一个多阶段管道进入基准测试且勉强达标

Marek Šuppa, Viktória Ondrejová, Lucia Ganajová, Gregor Karetka, Daniel Skala

机构 * Comenius University in Bratislava(布拉迪斯拉发的夸美纽斯大学) Cisco Systems(思科系统公司) Zaitra s.r.o.(扎伊特拉有限公司) NaiveNeuron(天真神经元)

专题命中 工作流自动化 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 介绍用于SemEval-2026任务1子任务A的RAGthoven系统,它将幽默文本生成分解为多阶段LLM管道,经多次实验优化,最终配置用RAG增强规划器,还评估两种智能变体,虽工具调用预算增加,但在英语样本上未超非智能管道,在三种语言中与基线并列第一,显示语言相关回报递减。

Comments SemEval-2026 Task 1

详情

展开后加载摘要…

URL PDF HTML 收藏