Optimizing Latency and Reliability of Pipeline Workflow Applications
专题命中 工作流自动化 :workflow(title)
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 工作流自动化 :workflow(title)
智能体在自动研究(AutoResearch)中如何失败?针对100项真实前沿研究任务的端到端诊断评估
专题命中 工作流自动化 :agent(abstract);agentic(abstract);分类 cs.CL
AI总结 本研究推出AutoResearchEval评估平台,构建含45种失效模式的ARFT分类体系,发现当前智能体缺乏元认知循环是核心缺陷,公开发布相关资源以推动自主科学发现研究。
Comments *Equal Contribution (alphabetical order by last name)
编写、执行、优化:通过执行反馈强化学习从技能跟随者到技能优化器
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; The Chinese University of Hong Kong(香港中文大学) ; Huawei Technologies Co., Ltd.(华为技术有限公司) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 工作流自动化 :agent(abstract);workflow(abstract);分类 cs.CL
AI总结 本研究提出WER多阶段框架,通过冻结执行器、程序验证器打分及混合轨迹优化训练技能优化器,在BFCL v4和tau2-bench上显著提升智能体工具使用性能,4B优化器表现优于通用模型。
通过合成任务扩展实现AI科学家
机构 * Princeton University(普林斯顿大学) ; Microsoft Research(微软研究院)
专题命中 工作流自动化 :agent(abstract_cn);AI agent(abstract);分类 cs.AI
AI总结 本文提出一种合成环境生成管道,用于训练能从实践中学习的机器学习代理。通过真实数据集验证和自调试循环,生成高质量合成任务,提升Qwen3-4B和Qwen3-8B在MLGym上的性能,AUP指标分别提升9%和12%。
面向有机6G的对话式编排
专题命中 工作流自动化 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 针对有机6G跨域编排的开销与可部署性问题,提出基于LLM驱动域代理的轻量级去中心化对话式编排框架,仿真验证其控制开销可控且决策质量稳健。
Comments 7 pages, 6 figures. Accepted for publication in IEEE Network Magazine
可修正性转换:构建接受更新的目标
机构 * University of Toronto(多伦多大学)
专题命中 工作流自动化 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 该研究提出一种可修正性转换方法,可在不牺牲性能的情况下将几乎任何目标转换为可修正版本,能诱导AI产生可修正行为,为AI安全提供了关键的可修正目标方案。
面向大型语言模型系统的安全导向生命周期模型
专题命中 工作流自动化 :workflow(abstract);agentic(abstract);分类 cs.AI
AI总结 本文针对LLM系统生命周期框架重效率轻安全、治理与生命周期阶段脱节的问题,提出含32个阶段的安全导向生命周期模型,整合多监管框架发现治理证据分布不均的结构特性。
Comments Accepted as: Batzolis, E., Drosatos, G., Katsouros, V., & Rantos, K. (2026). A Security-Oriented Lifecycle Model for Large Language Model Systems. In: Kieseberg, P., Skopik, F., Atli, B., Schrittwieser, S., & Asplund, M. (Eds.), Availability, reliability and security---ARES 2026 EU Projects Symposium workshops (Lecture Notes in Computer Science, pp. 1-18). Springer Nature Switzerland
行为语法:通过微型语言模型先验和二阶时序分析检测自适应恶意软件
专题命中 工作流自动化 :agent(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出Behavioral Grammar架构,用0.88M参数的TinyGPT学习主机行为语法,结合多模块提升检测能力,在AAA威胁下实现93%检测率,建立利于防御者的结构不对称性。
Comments 29 pages, 8 figures
生成AI在行动:来自阿里巴巴客户服务中心的实地实验证据
机构 * Fudan University(复旦大学) ; Zhejiang University(浙江大学) ; Dartmouth College(达特茅斯学院) ; Alibaba Group Inc.(阿里巴巴集团)
专题命中 工作流自动化 :agent(abstract);workflow(abstract);分类 cs.AI
AI总结 本研究通过大规模实地实验评估生成AI助手对电商售后客服人员绩效的影响,发现AI显著提升服务速度和服务质量,但对顶级员工产生负面影响,提示需定制化部署策略。
VISTA:一种用于日常协助的生成性眼动视频框架
机构 * Department of Computer Science, National Yang Ming Chiao Tung University(国立阳明交通大学计算机科学系)
专题命中 工作流自动化 :AI agent(abstract);workflow(abstract);分类 cs.CL
AI总结 VISTA通过生成高保真眼动视频为AI代理提供训练和评估数据,支持从日常家务到紧急安全情况的主动协助,包含反应性和前瞻性干预模式,提供可定制的视频基准测试。
Comments pre-print
Crystalis:用于协同多视图可视化生成的渐进式成核与语义退火
机构 * Zhejiang University(浙江大学)
专题命中 工作流自动化 :workflow(abstract);agentic(abstract);分类 cs.AI
AI总结 研究针对大语言模型难以生成协同多视图可视化的问题,提出Crystalis框架,基于以查询为中心的CMV建模,通过渐进式成核和语义退火机制,在多任务基准测试中取得高成功率,且经用户研究验证了工作流程可用性。
HeraSys:通过细粒度端到端优化实现多个大语言模型工作流的协同服务
专题命中 工作流自动化 :workflow(abstract);agentic(abstract);分类 cs.AI
AI总结 针对大语言模型服务系统,HeraSys通过细粒度编排消除工作流间计算冗余,引入负载感知联合调度策略,结合资源倾斜机制等,有效减轻尾部延迟并提高吞吐量,实验证明其能显著降低延迟、提升服务吞吐量。
Comments to be published in ICML 2026
小巧、免费且高效:编排开放权重的小型语言模型以在恶意软件分析中超越单个大语言模型
专题命中 工作流自动化 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 研究恶意软件分析中,小型语言模型编排集成能否超越单个大语言模型。通过测试多种模型建立基线,设计评估四种编排架构,其中混合系统表现出色,总体准确率超专业和前沿基线,证明基于证据的编排可提升SLM性能。
Comments To appear in Proceedings of the 29th International Symposium on Research in Attacks, Intrusions, and Defenses (RAID)
跨金融机构治理生成式AI:符合SR 26-2要求的生成式AI风险控制框架
机构 * Citigroup(摩根大通) ; Florida State University(佛罗里达州立大学)
专题命中 工作流自动化 :workflow(abstract);agentic(abstract);分类 cs.LG
AI总结 针对SR 26-2未覆盖生成式AI的治理难题,本文提出兼容该监管规则的GAICF框架,将模型风险管理原则转化为分层控制结构,助力金融机构合规管控生成式AI应用。
重新思考人工智能系统的渗透测试:从资源妥协到行为目标违反
机构 * Sensifai BV(Sensifai公司)
专题命中 工作流自动化 :workflow(abstract);agentic(abstract);分类 cs.AI
AI总结 本文重新思考人工智能系统渗透测试,将其定义为目标驱动的行为评估,涵盖多种对抗途径。提出测试工作流程,通过实例展示渗透可通过行为影响发生,为评估已部署人工智能系统中的对抗成功提供技术框架。
Comments 42 pages, 5 Tables, 21 references
SeedSmith:用于定向模糊测试的基于大语言模型的种子合成
专题命中 工作流自动化 :workflow(abstract);agentic(abstract);分类 cs.SE
AI总结 研究针对定向模糊测试常无法触发崩溃的问题,提出SeedSmith这一基于大语言模型的管道,通过复制分析师工作流程合成种子,提升模糊器性能,在Magma和ARVO上取得显著加速和发现新漏洞的成果。
AfterVibe:对话结束后留下了什么
专题命中 工作流自动化 :agent(abstract);AI agent(abstract);分类 cs.SE
AI总结 AfterVibe框架从vibe编码会话恢复自然语言规范,用语言模型提取规范并经再生测试验证,在72个项目上评估发现其恢复的规范抽象且强,优于人工描述,可迭代加强,意味着规范或成人工审查主要工件和记录来源。
用于前端设计中电子设计自动化的大语言模型:挑战与机遇
机构 * Chair of Electronic Design Automation, Technical University of Munich(电子设计自动化教授团,慕尼黑技术大学) ; Resource-Efficient AI Group, Technical University of Ilmenau(高效人工智能小组,伊门豪技术大学)
专题命中 工作流自动化 :autonomous agent(abstract);agentic(abstract);分类 cs.LG
AI总结 探讨芯片前端设计瓶颈下,大语言模型在电子设计自动化中的潜力,回顾其在前端设计关键任务及流程中的进展,讨论集成大语言模型到EDA面临的挑战与限制,概述未来机遇,为相关研究提供系统视角。
Comments Invited paper at the ACM/IEEE DAC 2026 Special Research Session, 5 pages, 9 figures
更好的框架,更小的模型:通过自动框架适配构建成本降低90%的智能体
专题命中 工作流自动化 :agent(abstract);agentic(abstract);分类 cs.SE
AI总结 研究针对前沿语言模型智能体推理成本高的问题,提出通过自动框架适配让小语言模型智能体以低90%成本匹配语言模型性能,创建相关框架和优化器,经实验验证该方法能扩大小语言模型智能体在日常业务任务中的部署范围。
编码代理可以复现科学机器学习论文
机构 * School of Mechanical Engineering, Purdue University(机械工程学院,普渡大学)
专题命中 工作流自动化 :agent(abstract);workflow(abstract);分类 cs.AI
AI总结 提出Paper-replication工作流,让编码代理以目标驱动方式复现论文的计算声明,通过记录目标、重建方法、运行实验并验证,在四篇论文的12次独立运行中全部完成并通过验证。
精神病院:一个用于评估精神科临床问诊的虚拟环境
机构 * School of Computer Science, Chongqing University(重庆大学计算机科学学院) ; School of Computer Science, Hunan University(湖南大学计算机科学学院)
专题命中 工作流自动化 :planning(abstract);workflow(abstract);分类 cs.AI
AI总结 研究针对大语言模型在精神科临床问诊评估不足的问题,引入MentalHospital虚拟环境,实例化S.O.A.P.工作流程,用双轨协议评估,开发MentalEval,经测试其具有临床保真度且与专家高度一致,指出大语言模型在精神状态评估上落后临床医生。
CanvasAgent:通过视觉工具编排实现复杂图像创建和编辑
机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))
专题命中 工作流自动化 :agent(abstract);tool-use(abstract);分类 cs.AI
AI总结 研究复杂图像创建编辑问题,提出CanvasAgent代理,通过多轮交互编排异构视觉工具,先经监督微调学习轨迹,再用广义信赖域策略优化器结合多种信号优化,结合CanvasCraft数据集进行实验,证明其对复杂多工具图像创建工作流程有效。
Comments 18pages, 5 figures
Memisis:协调和评估表格健康数据的合成数据
机构 * University of California Irvine(加州大学尔湾分校)
专题命中 工作流自动化 :agent(abstract);workflow(abstract);分类 cs.LG
AI总结 本文提出Memisis工具,通过结合现有合成数据工具、大语言模型和先进评估指标,协调和评估合成数据,以提高下游预测任务和临床决策的质量。
关于用于进化优化的大语言模型的系统综述:从建模到求解
专题命中 工作流自动化 :workflow(abstract);agentic(abstract);分类 cs.AI
AI总结 该综述聚焦进化优化,通过工作流框架系统回顾相关进展,将文献分为优化建模与求解两阶段,求解阶段再分三类范式,分析方法、局限性及与传统方法关系,还给出基准、比较及应用,并指出研究方向。
Comments Accepted by IEEE CIM
语言模型作为文化测量仪器
机构 * School of Information University of California, Berkeley(信息学院加州大学伯克利分校)
专题命中 工作流自动化 :workflow(abstract);agentic(abstract);分类 cs.CL
AI总结 本文提出语言模型的文化测量是物质-话语实践,通过Karen Barad的能动切割概念,论证模型设计选择构成所测量的文化现实,并通过三个案例和三个仪器检查展示这一观点。
Comments Accepted to the Big Picture workshop co-located with ACL 2026. This version expands the camera-ready (adding Fig. 3 and section 6.3, as well as correcting minor typos) in Proceedings of The Big Picture v2: Crafting a Research Narrative, pp. 131--143, San Diego, CA, USA. Association for Computational Linguistics
从失败轨迹到可靠的LLM代理:诊断与修复框架缺陷
专题命中 工作流自动化 :agent(abstract);workflow(abstract);分类 cs.SE
AI总结 提出HarnessFix框架,通过轨迹引导诊断代理失败并修复执行框架,在多个基准上提升15.2%-50.0%性能。
从实验到专长:面向AI驱动计算物理的科学知识巩固
专题命中 工作流自动化 :AI agent(abstract);workflow(abstract);分类 cs.AI
AI总结 提出QMatSuite平台,通过记录、检索和反思机制巩固计算材料科学中的知识,减少推理开销并提高模拟准确性。
Comments v2: camera-ready version, accepted at the ICML 2026 Workshop on AI for Physics (AI4Physics@ICML 2026). 20 pages, 6 figures
对Nature Portfolio元分析文章进行LLM代理基准测试
机构 * Tsinghua University(清华大学)
专题命中 工作流自动化 :agent(abstract);workflow(abstract);分类 cs.CL
AI总结 提出MetaSyn数据集,包含442篇专家策划的元分析,用于评估LLM代理在检索-筛选-综合全流程中的表现,发现当前系统在筛选阶段存在严重瓶颈。
Comments 17 pages, 8 figures, 11 tables. Code and evaluation: https://github.com/THUIR/MetaSyn Dataset: https://huggingface.co/datasets/THUIR/MetaSyn Model: https://huggingface.co/BFTree/MA-Retriever
FormIDEAble:安全且具有社会感知能力的自主系统
专题命中 工作流自动化 :agent(abstract);autonomous agent(abstract);分类 cs.SE
AI总结 提出FormIDEAble方法,通过带代价的马尔可夫决策过程建模人机协作,将决策形式化为代价有界可达性问题,在保证安全的同时实现社会感知策略合成。
面向室内环境的模块化视觉-语言-动作机器人框架
机构 * TCS Research, Tata Consultancy Services(塔塔咨询服务公司TCS研究部) ; CMU(卡内基梅隆大学)
专题命中 工作流自动化 :agent(abstract);autonomous agent(abstract);分类 cs.AI
AI总结 提出模块化架构,集成环境建图、问题处理和导航,通过双流并行处理(语义体素建图与语言分类)实现自然语言指令驱动的自主任务执行。
Comments IEEE IROS 2025 Workshop on Generative AI for Robotics and Smart Manufacturing