arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-07 至 2026-08-07 共收录 218 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 25 篇

2608.05966 2026-08-07 cs.HC 新提交 78%

A Modular Workflow for Multimodal Reading Experiments

多模态阅读实验的模块化工作流程

Thomas Krämer, Thomas Kosch, Dagmar Kern, Daniel Hienert

专题命中 工作流自动化 :workflow(title,abstract)

AI总结 该研究提出一种基于网络的模块化工作流程,整合眼动、EEG等多模态数据,可适配不同实验设置,用于在线阅读的多模态研究,支持生态情境下的实证验证。

Comments In Proceedings of the 30th International Conference on Knowledge-Based and Intelligent Information & Engineering Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06366 2026-08-07 cs.AI cs.LG 新提交 73%

Tracing the Heart: An Evidence-Linked Pipeline for Heart-Failure Feature Engineering

追踪核心:一种用于心力衰竭特征工程的证据关联管道

Soorya Ram Shimgekar, Michelle Hu, Dorisa Shehi, Daniel Kang, Roy Ka-Wei Lee, Koustuv Saha, Christian Poellabauer, Christopher Lee, Sajeev Singh, Piyum Zonooz, Navin Kumar, Zeeshan Ahmed, Priyadarshini Kachroo

机构 * Nimblemind(宁敏德(音译)) Singapore University of Technology and Design(新加坡科技设计大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Florida International University(佛罗里达国际大学) University of California Los Angeles(加利福尼亚大学洛杉矶分校) Rutgers University Newark(罗格斯大学纽瓦克分校) Rutgers Institute for Health Health Care Policy and Aging Research(罗格斯大学健康、医疗保健政策与老龄化研究所) Robert Wood Johnson Medical School(罗伯特·伍德·约翰逊医学院) Rutgers Health(罗格斯医疗)

专题命中 工作流自动化 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对心力衰竭EHR特征工程瓶颈,开发了nMAS管道,经500条虚拟记录验证,可提升HFrEF和HFpEF表型分析的AUROC,为自动化可审核特征工程提供了可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06265 2026-08-07 cs.AI cs.DB cs.LG 新提交 62%

Improving the Realism of Synthetic Clinical Benchmarks Under Utility Constraints

在效用约束下提升合成临床基准的真实性

Omid Bazgir, Md Nasir, Jacob Hoffman, Yang Yang, Manu Agrawal, Anusua Trivedi, Vinay Rao Dandin, Chris Gibbons, Christine Swisher

机构 * Oracle Health and Life Sciences(甲骨文健康与生命科学部门)

专题命中 工作流自动化 :AI agent(abstract);分类 cs.AI、cs.LG

AI总结 本文针对合成临床基准的结构不真实问题,提出在不破坏下游效用检查的前提下提升其真实性的方法,通过确定性修正改善基准指标,明确需将效用作为约束而非真实性的充分证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04738 2026-08-07 cs.AI 版本更新 57%

EviGraph: Evidence-Guided Autonomous Research Agents

EviGraph:证据引导的自主研究智能体

Zhenjiang Ren, Ruiji Li, Xujing Zhang, Ziliang Pang, Shuo Ren, Jiajun Zhang

专题命中 工作流自动化 :agent(abstract);分类 cs.AI

AI总结 EviGraph是一种自主研究框架,通过证据图维护研究状态,修复证据链问题,在ARC-Bench-ML和NanoResearch-20上优于基线,提升了主张支持率和实验数据一致性。

Comments 23 pages,2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15557 2026-08-07 cs.CL 版本更新 57%

SkillCorpus: Consolidating and Evaluating the Open Skill Ecosystem for Real-World LLM Agents

SkillCorpus:整合与评估面向现实世界大语言模型智能体的开放技能生态系统

Yanze Wang, Pengfei Yao, Tianyi Sun, Chuanrui Hu, Yan Xiao, Xiaotian Luo, Yunyun Han, Yifan Chen, Jun Sun, Yafeng Deng

专题命中 工作流自动化 :agent(abstract);分类 cs.CL

AI总结 研究针对大语言模型智能体技能文件碎片化等问题,提出SkillCorpus框架,通过多阶段管道过滤技能并与检索选择堆栈配对,经多基准端到端评估,整合该框架能带来一致收益,明确了其对实际智能体任务的作用边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22191 2026-08-07 cs.CR cs.CL 版本更新 57%

Behavioral Canaries: Auditing Private Retrieved Context Usage in RL Fine-Tuning

行为 Canary:在 RL 微调中审计私有检索上下文的使用

Chaoran Chen, Dayu Yuan, Peter Kairouz

机构 * Google(谷歌)

专题命中 工作流自动化 :agentic(abstract);分类 cs.CL

AI总结 本文提出 Behavioral Canaries 机制,用于审计 RL 微调过程中是否非法使用受保护的检索上下文,通过行为信号检测未经授权的文档条件训练,实现 67% 的检测率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01075 2026-08-07 cs.LG cs.DC 57%

Provenance Tracking in Large-Scale Machine Learning Systems

Gabriele Padovani, Valentine Anantharaj, Sandro Fiore

机构 * University of Trento(特伦托大学) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG

Journal ref ICPP Workshops 2025: Workshop Proceedings of the 54th International Conference on Parallel Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05911 2026-08-07 cs.CV 新提交 50%

Mapping Armenian Paris: Extracting and Geocoding Commercial Advertisements from the 20th-Century Diaspora Press

绘制亚美尼亚巴黎:从20世纪侨民报刊中提取并地理编码商业广告

Chahan Vidal-Gorène, Seda Kirakosyan, Edita Matevosyan

专题命中 工作流自动化 :workflow(abstract)

AI总结 本研究提出基于IIIF的VLM驱动端到端流程,从西亚美尼亚语报刊中提取并地理编码商业广告,构建巴黎亚美尼亚商业社区交互式地图,相关成果可迁移至其他资源匮乏历史语料库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05888 2026-08-07 cs.AR cs.PF 新提交 50%

An Open-Source Power Measurement Platform for System-Level Semiconductor Testing

面向系统级半导体测试的开源功耗测量平台

Linus Bantel, Sarah Rottacker, Dirk Pflüger

专题命中 工作流自动化 :workflow(abstract)

AI总结 针对工业半导体测试设备昂贵难集成的问题,提出一款集成Raspberry Pi等组件的开源功耗测量平台,支持自动化测试与远程交互,适用于研究、原型开发及教育场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05836 2026-08-07 cs.CR 新提交 50%

An End-to-End Threat Model for the Quantum-as-a-Service Pipeline

量子即服务(QaaS)流水线的端到端威胁模型

Badhon Rahman, Majid Haghparast, Tommi Mikkonen

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文针对QaaS流水线缺乏结构化威胁建模的问题,结合STRIDE将其工作流分解为六阶段模型,分析各层级攻击向量,研究未被充分探索的环节并区分出三条高影响跨阶段攻击链。

Comments 2 pages, 1 Table. Accepted as a poster paper at the IEEE International Conference on Quantum Computing & Engineering (QCE26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05412 2026-08-07 cs.DB 新提交 50%

BEGIN AI TRANSACTION: Semantic Isolation for Durable AI Workflows

AI事务:持久AI工作流的语义隔离

Barzan Mozafari

专题命中 工作流自动化 :workflow(abstract)

AI总结 针对AI工作流因语义环境并发变更导致结果不一致的问题,提出语义隔离框架,定义四类异常,推导隔离级别偏序,原型SemIso可高效检查并阻止不兼容资源与分支合并。

Comments 6 pages, 4 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05226 2026-08-07 cs.CV 新提交 50%

NeuroAdaptTrainer: A Fiji/ImageJ Plugin for YOLO-Based Neuron Segmentation, InteractiveCorrection and Transfer Learning

NeuroAdaptTrainer:一款用于基于YOLO的神经元分割、交互式校正与迁移学习的Fiji/ImageJ插件

Daniela Eraso-Casas, Gerard Villarroya-Pique, Esther Serrano-Pertierra, M. Teresa Fernández-Sánchez, Antonello Novellie, Angel Rio-Alvarez, Víctor M. González

机构 * University of Oviedo(奥维耶多大学) Institute of Biotechnology of Asturias (IUBA)(阿斯图里亚斯生物技术研究所)

专题命中 工作流自动化 :workflow(abstract)

AI总结 该研究开发了一款名为NeuroAdaptTrainer的Fiji/ImageJ插件,整合YOLO实例分割模型,支持神经元自动检测、交互式校正及迁移学习,降低非专业用户使用深度学习分割技术的门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05317 2026-08-07 math.NA cs.NA 新提交 50%

A variational framework for Bayesian inversion in moving boundary Darcy flow

移动边界达西流中贝叶斯反演的变分框架

Michael E. Causon, Marco A. Iglesias, Michael V. Tretyakov

专题命中 工作流自动化 :workflow(abstract)

AI总结 针对移动边界达西流的对数渗透率反演,提出逐观测表示公式的变分框架,大幅降低计算成本,1D精度接近MCMC,2D效果优于大规模集合卡尔曼反演。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05398 2026-08-07 physics.comp-ph math-ph math.MP 新提交 50%

Multiphysics tritium transport modelling of the ARC breeding blanket with FESTIM

采用FESTIM的ARC增殖包层多物理场氚输运建模

James Dark, Arpan Sircar, Jin Whan Bae, Jørgen S. Dokken, Rémi Delaporte-Mathurin

专题命中 工作流自动化 :workflow(abstract)

AI总结 本研究开发耦合OpenMC、OpenFOAM与FESTIM的多物理场框架,模拟ARC级聚变反应堆包层氚输运,得到氚 inventory、输运机制等关键结果,为相关高保真分析提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05387 2026-08-07 cond-mat.mtrl-sci 新提交 50%

Fine-Tuning Small Language Models for Reliable VASP INCAR Generation

微调小型语言模型以生成可靠的VASP INCAR文件

Xinyue Zhang, Jixiang Li, Bin Shao, Baishun Yang, Zhiyang Liu, Weichao Wang

专题命中 工作流自动化 :workflow(abstract)

AI总结 本研究通过微调小型语言模型(SLM)并搭配后处理器VASPGuard构建INCAR-SLM,在INCARBench上优于通用大模型,证明小型模型经适配可可靠生成VASP INCAR文件,适配后性能随规模增长趋于饱和。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04901 2026-08-07 physics.geo-ph 版本更新 50%

Theoretical Framework for Phase-space Local-Angle-Domain Waveform Inversion in Anisotropic Elastic Media

各向异性弹性介质中相空间局部角度域波形反演的理论框架

Zvi Koren

专题命中 工作流自动化 :workflow(abstract)

AI总结 该研究提出各向异性弹性介质中相空间局部角度域弹性全波形反演的理论框架,推导了相关算子,其海森更对角占优,可集成多项功能,为弹性反演等提供统一工作流程。

Comments 80 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03759 2026-08-07 physics.optics physics.comp-ph 版本更新 50%

AFLOW-EMERALD: ElectroMagnetic modes EngineeRing in Advanced LayereD materials

AFLOW-EMERALD:先进层状材料中的电磁模式工程

Stefano Campanaro, Luca Bursi, Nicholas H. Anderson, Stefano Curtarolo, Arrigo Calzolari

专题命中 工作流自动化 :workflow(abstract)

AI总结 AFLOW-EMERALD是一款开源模块化电磁计算框架,可模拟层状材料电磁波传播,适用于材料-几何耦合工程,为相关光子学等材料设计提供实用平台。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21290 2026-08-07 hep-ex 版本更新 50%

Model-independent ZH production cross section at FCC-ee

FCC-ee上模型无关的ZH产生截面

Ang Li, Jan Eysermans, Gregorio Bernardi, Kevin Dewyspelaere, Michele Selvaggi, Christoph Paus

专题命中 工作流自动化 :workflow(abstract)

AI总结 利用反冲质量法在FCC-ee上测量模型无关的ZH产生截面,通过轻子和强子通道的联合分析,在240 GeV和365 GeV能级下分别达到0.31%和0.52%的精度。

Comments 23 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 14 篇

2608.04661 2026-08-07 cs.SE 版本更新 88%

An Exploratory Study of Agent Plans for Agentic AI Coding Tools in Open-Source Software

面向开源软件中智能体式AI编码工具的智能体计划探索性研究

Muhammad Auwal Abubakar, Seyedmoein Mohsenimofidi, Jai Lal Lulla, Jie M. Zhang, Christoph Treude, Sebastian Baltes, Matthias Galster

专题命中 软件智能体 :agent(title,abstract);agentic(title,abstract);分类 cs.SE

AI总结 本文通过筛选36710个GitHub仓库识别出85个Markdown智能体计划文件,研究其支持的软件工程工作类型与提供的执行指导,明确其是研究人-智能体工作流任务意图的丰富工件。

Comments 14 pages, 2 figures, 4 tables. Accepted at the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026), Emerging Results, Vision, and Reflection Papers Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22256 2026-08-07 cs.SE cs.AI 版本更新 86%

Agentic Software Issue Resolution with Large Language Models: A Survey

基于大语言模型的代理软件问题解决:综述

Zhonghao Jiang, David Lo, Zhongxin Liu

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡管理大学)

专题命中 软件智能体 :agentic(title,abstract);planning(abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 本文综述了基于大语言模型的代理软件问题解决的最新研究,探讨了其方法、挑战及未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05959 2026-08-07 cs.SE 新提交 83%

AgentExecutor: Partial Code Execution via Agentic Context Generation

AgentExecutor:基于智能体上下文生成的部分代码执行工具

Junkai Chen, Chengran Yang, Xing Hu, Zhenhao Li, Xin Xia, David Lo

专题命中 软件智能体 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.SE

AI总结 本文提出多智能体框架AgentExecutor,通过三阶段设计和自适应优化策略提升部分代码执行效果,在两个数据集上的覆盖度、执行时间和成本均优于现有最优方法Treefix。

Comments ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05886 2026-08-07 cs.SE cs.AI 新提交 81%

CodeGrep: An RL-Trained Retrieval Agent for LLM Coding Agents

CodeGrep:用于LLM编码智能体的基于强化学习训练的检索智能体

Wuya Chen, Yihao yang, Yang Cao, Yue Lin

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 该研究针对LLM编码智能体查找文件效率低的问题,提出基于GRPO训练的14B检索智能体CodeGrep,在SWE-Bench Verified上保持解决率的同时,减少了交互轮数和token使用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05884 2026-08-07 cs.CR cs.CL 新提交 77%

The Vulnerability With No CVE: Managing Persistent Gaps Between Mandate and Authority in AI Coding Agents

无CVE的漏洞:管理AI编码智能体中授权与权限之间的持续差距

Shayell Aharon Salomon Amir Shaked Matan Noga

专题命中 软件智能体 :agentic(abstract,abstract_cn);agent(abstract);分类 cs.CL

AI总结 该研究针对AI编码智能体中授权与权限的持续差距,提出智能体姿态漏洞(APV)的概念,区分其与相关风险,提供定义、模式、生命周期等内容,为相关安全管理提供可操作框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06153 2026-08-07 cs.SE cs.AI 新提交 73%

Learning Globally Reusable Skills for Coding Agents

为编码智能体学习全局可复用技能

Chen Yang, Jiashuo Tian, Ziqi Wang, Xinyin Liu, Meiru Ye, Junjie Chen

专题命中 软件智能体 :agent(abstract,abstract_cn);分类 cs.AI、cs.SE

AI总结 研究针对编码智能体技能进化的过拟合与泛化问题,提出GSE框架,通过技能关系图、聚类整合与回放验证优化,在多个编码任务与智能体上实现性能提升,效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05855 2026-08-07 cs.DC 新提交 67%

RepoOMP: Repository-Aware Hotspot OpenMP Parallelization via Dependency-Aware Context Reduction

RepoOMP:基于仓库感知的热点OpenMP并行化方法——通过依赖感知的上下文缩减

Yongjie Qian, Ke Gao, Zhibin Zhang, Shaohui Peng, Ling Li

专题命中 软件智能体 :agent(abstract);workflow(abstract)

AI总结 RepoOMP是一种混合框架,通过构建MAP和STC,在951个热点上实现平均加速比8.23×至8.96×,降低智能体令牌成本,为仓库热点并行化提供证据引导的工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00023 2026-08-07 cs.CL cs.AI 版本更新 62%

Role Steering of Language Models for Social Simulations

用于社会模拟的语言模型角色引导

Isaac Song, Mohammed Rehan Parwani, Glenn Matlin, Emile Anand, Akhil Theerthala, Arjun Chatterjee, Anthony Wen-Ming Zang, Maria Kostylew, Yonadav G. Shavit, Sebastien Krier, Mark Riedl

机构 * Georgia Institute of Technology(佐治亚理工学院) ML Alignment & Theory Scholars (MATS)(ML对齐与理论学者组织(MATS)) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Oxford(牛津大学) Google DeepMind(谷歌DeepMind) OpenAI(开放人工智能公司)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出针对语言模型智能体的角色引导筛选工作流,在OLMo-3-7B-Instruct上验证其角色画像对齐度更高且词汇多样性更好,发现需按角色选引导系数而非统一高强度设置。

Comments 35 pages. Published at the Social Sim'26 Workshop, COLM 2026. Code: https://github.com/eilab-gt/casting-call-vectors

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05430 2026-08-07 cs.CR cs.LG 新提交 57%

Robust Context-Aware Detection of Malicious Instructions in Text

文本中恶意指令的鲁棒上下文感知检测

Buzhao Liu, Xinhang Ma, Yevgeniy Vorobeychik

专题命中 软件智能体 :agentic(abstract);分类 cs.LG

AI总结 该研究针对LLM易受间接提示注入攻击的问题,提出上下文感知的恶意句子分类方法及两种对抗训练技术,在静态和自适应攻击下均提升了IPI防御性能,且需根据领域调整参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05234 2026-08-07 cs.LG cs.PL 新提交 57%

PPDL: LLM-Based Flows as Probabilistic Programs

PPDL:基于大语言模型的流作为概率程序

Louis Mandel, Guillaume Baudart, Mandana Vaziri, Martin Hirzel

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 本文提出用于编程基于LLM的流的概率语言PPDL,可量化传播流中不确定性,无需额外代码即可尝试推理缩放技术,还通过实验及面向Rocq的定理证明智能体案例验证了其能力。

Comments Published at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05223 2026-08-07 cs.SE cs.CR 新提交 57%

Towards a Risk Assessment of Malicious Skill Files in Coding Agents

面向编码智能体中恶意技能文件的风险评估

Rui Yang, Michael Fu, Kla Tantithamthavorn, Chetan Arora, Joey Chua

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 该研究针对编码智能体技能接口的恶意文件风险,提出对抗性技能合成方法与评估流水线,发现企业级智能体易被恶意技能利用,仅少数运行有明确安全识别,呼吁企业提前评估风险。

Comments 29 pages, 6 figures, 6 tables. Preprint; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01347 2026-08-07 cs.CL 版本更新 57%

Same Task, Different Work: Prompt-Induced Waste in Coding Agents

提示词诱导的大推理模型浪费:一项预注册的双框架编码智能体基准测试

Sarel Weinberger, Amir Hozez

机构 * PointFive

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 该研究通过预注册基准测试发现,提示词措辞和智能体框架会大幅影响大推理编码智能体的成本,部分提示指令可成倍增加推理成本却不提升任务成功率,框架选择的成本差异更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏