arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 317 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 317 篇

2605.29151 2026-06-12 math.AG cs.AI cs.NE 版本更新 70%

Real-rootedness of the Poincaré polynomials of $\overline{\mathcal M}_{0,n}$: an AI-assisted proof

Poincaré多项式的实根性:一个AI辅助的证明

Gergely Bérczi, Young-Hoon Kiem

机构 * Department of Mathematics, Aarhus University(阿arhus大学数学系) School of Mathematics, Korea Institute for Advanced Study(韩国高级研究院数学系)

专题命中 工作流自动化 :workflow(abstract);agentic(abstract);分类 cs.AI

AI总结 通过引入双变量变形揭示隐藏的交错结构,证明了稳定有理曲线模空间Poincaré多项式的实根性,并进一步推广到Fulton-MacPherson空间。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11484 2026-06-09 cs.AI 版本更新 70%

Engagement Process: Rethinking the Temporal Interface of Action and Observation

参与过程:重新思考动作与观察的时间接口

Jialian Li, Yuchen Cao, Junhong Liu, Weiran Guo, Xutao Wang, Jiaming Song, Jiahao Zhang, Jie Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 工作流自动化 :agent(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出参与过程(EP)模型,通过显式时间接口处理动作与观察的不同时间尺度交互,支持多速率协调和子系统组合,揭示隐藏的时间行为并使策略适应显式时间成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16544 2026-08-11 cond-mat.str-el cond-mat.mes-hall 版本更新 67%

AIMS: an AI experimentalist turns uncertainty into quantum matter discovery

AIMS:一种用于量子物质的不确定性感知人工智能实验者

Siyuan Qiu, Philip D. Suh, Nhat Huy Tran, Xirui Wang, Heonjoon Park, Kutay Akin, Kevin K. S. Multani, Seungwon Jung, Wenkai Cai, Xinyu Liu, León Garcia, Ziyan Zhu, Chunjing Jia, Zhantao Chen, Zhixun Shen, Zhurun Ji

专题命中 工作流自动化 :agent(abstract);AI agent(abstract)

AI总结 研究量子材料实验中的不确定性问题,提出AIMS这一不确定性感知人工智能实验者,通过连接三个嵌套循环实现感知恢复、测量选择和能量尺度分辨机制归因,展示了对量子物质的不确定性感知实验能动性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14137 2026-08-06 cs.CL cs.AI cs.LG 版本更新 67%

From Feelings to Metrics: Understanding and Formalizing How Users Vibe-Test LLMs

从感受至指标:理解并形式化用户如何通过 vibes 测试 LLMs

Itay Itzhak, Eliya Habba, Gabriel Stanovsky, Yonatan Belinkov

机构 * Technion – Israel Institute of Technology(技术离子-以色列理工学院) The Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究用户通过非正式经验评估LLM的方式,并形式化该过程以支持系统分析,通过个性化测试和用户感知标准改进模型评估。

Comments Published at COLM 2026. 50 pages, 20 figures. Code and data at https://technion-cs-nlp.github.io/vibe-testing-llms

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13531 2026-07-23 cs.LO cs.DC cs.ET cs.SY eess.SY 版本更新 67%

Ripple: An Open, AI-Formalized Lean 4 Framework for Computing with CRNs

Ripple:一个用于化学反应网络计算的开放的、人工智能形式化的Lean 4框架

Ho-Lin Chen, Xiang Huang

专题命中 工作流自动化 :AI agent(abstract);workflow(abstract)

AI总结 介绍用于CRN计算实数数学的Ripple框架,它形式化多种模型阶梯,开发可靠,暴露并修复证明漏洞,还证明新结果,且形式化主要由人工智能代理利用公开模型完成,工作流程可重现。

Comments 26 pages. v2 removes the incorrect claim that the formalization found a gap in the Angluin-Aspnes-Eisenstat (2008) approximate-majority proof: the flawed inequality was internal to our formalization, not their argument. It also corrects the attribution of zeta(3)'s CRN-computability to the Fermi-Dirac integral route. Abstract revised

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09994 2026-07-22 cs.NI 版本更新 67%

ORCHID: Fairness-Aware Orchestration in Mission-Critical Air-Ground Integrated Networks

ORCHID:面向关键任务空地一体化网络的公平性感知编排

Chuan-Chi Lai, Chi Jai Choy

专题命中 工作流自动化 :agent(abstract);multi-agent(abstract)

AI总结 ORCHID提出一种两阶段学习框架,通过拓扑分区和重置微调机制提升多UAV编排稳定性,实现服务公平性与能效的协同优化。

Comments 18 pages, 8 figures, 1 Table. Full research paper proposing a resilient two-stage orchestration framework for collaborative UAV-GBS deployment in mission-critical Air-Ground Integrated Networks (AGINs). This revised version introduces a game-theoretic approach (Egalitarian Bargaining Game) and an aerodynamic energy model to enhance system robustness. Under review at an IEEE journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00613 2026-07-15 physics.chem-ph 版本更新 67%

Ai2-Kit: Streamlining AI-Accelerated Ab Initio Workflows for Complex Chemical Systems

Ai2-Kit: 为复杂化学系统简化AI加速从头算工作流

Sheng Bi, Wei-Hong Xu, Yong-Bin Zhuang, Jia-Xin Zhu, Jiang-Peng Qiu, Yu-Hang Tang, Xiang-Long Du, Qi You, Yun-Pei Liu, Fu-Qiang Gong, Yu-Xin Guo, Yi-Ze Wang, Cheng-Xuan Wang, Zi-Heng Gong, Zi-Qiang Chen, Chang Liu, Siyuan Han, Jian Gu, Jia-Xin Li, Yi-Ming Chen, Lin Huang, Si-Jie Chen, Bo-Ying Huang, Jie-Zhen Xia, Fan-Jie Xu, Su-Yang Zhong, Peng-Wei Xu, Jun-Yi Wang, Xing-Yun Xie, Yu-Lei Gong, Yan-Yi Su, Yue Liu, Rui-Hao Bi, Lang Li, Fei-Teng Wang, Jing-Xiang Zou, Mei Jia, Jie-Qiong Li, Min Lin, Qi-Yuan Fan, Juan-Juan Sun, Jia-Bo Le, Zixuan Wei, Jin-Yuan Hu, Meng-Lei Jia, Yan Sun, Xiao-Hui Yang, Fujie Tang, Feng Wang, Jun Cheng

专题命中 工作流自动化 :agent(abstract);workflow(abstract)

AI总结 提出ai2-kit工具包,通过命令行和Python API整合第一性原理计算、机器学习势训练、分子动力学、增强采样和HPC编排,实现复杂化学系统的AI加速从头算工作流自动化与可扩展。

Comments 24 pages, 11 figures. Submitted to Chemical Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02080 2026-06-25 cs.AI cs.FL cs.LG cs.SE 版本更新 67%

The 4/$δ$ Bound: Designing Predictable LLM-Verifier Systems for Formal Method Guarantee

4/δ 界:设计具有形式方法保证的可预测 LLM-验证器系统

Pierre Dantas, Lucas Cordeiro, Youcheng Sun, Waldir Junior

专题命中 工作流自动化 :planning(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 提出 LLM-验证器收敛定理,将多阶段验证建模为顺序吸收马尔可夫链,证明成功概率 δ>0 时系统几乎必然验证,并导出精确延迟上界 4/δ,经 90000+ 试验验证。

Comments 36 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18684 2026-06-24 cs.CR cs.AI cs.CL cs.LG cs.SY eess.SY 版本更新 67%

FALCON: Transforming Cyber Threat Intelligence into Deployable IDS Rules with Self-Reflection

FALCON:通过自我反思将网络威胁情报转化为可部署的入侵检测系统规则

Shaswata Mitra, Subash Neupane, Martin Duclos, Sudip Mittal, Aritran Piplai, Md Rayhanur Rahman, Edward Zieglar, Shahram Rahimi

机构 * Meharry Medical College(梅哈里医学院) The University of Texas at El Paso(德克萨斯理工大学) The University of Alabama(阿拉巴马大学) National Security Agency(国家安全局)

专题命中 工作流自动化 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出FALCON框架,通过新颖的CTI-规则语义评分器实现规则检索、生成和验证,解决签名型入侵检测系统中规则创建的手动瓶颈和验证难题,在Snort和YARA平台上达到0.72平均相关性。

Comments 17 pages, 10 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05171 2026-06-17 cs.CL cs.AI 版本更新 66%

Guidelines for the Annotation and Visualization of Legal Argumentation Structures in Chinese Judicial Decisions

中国司法判决中法律论证结构的标注与可视化指南

Kun Chen, Xianglei Liao, Kaixue Fei, Yi Xing, Xinrui Li

机构 * Law School, Nanjing University(南京大学法学院)

专题命中 工作流自动化 :workflow(abstract,comments);分类 cs.AI、cs.CL

AI总结 提出一个系统化、可操作的标注框架,用于表示司法判决中的法律论证结构,支持大规模司法推理分析和法律论证挖掘。

Comments This Guideline has been developed through revision and refinement based on the first edition. The element label system has been adjusted, and the annotation granularity and annotation workflow have been further optimized

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28008 2026-08-17 cs.CL cs.AI 版本更新 62%

RepBench: Compiling Benchmarks into Capability Representations for Large Language Models

RepBench:将基准编译为大语言模型的能力表征

Yanshi Li, Xueru Bai, Shuman Liu, Long Zhang

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 RepBench构建多基准支撑的大语言模型能力表征探测数据层,揭示读出方式与聚合准则对评估的重要性,相关资源以闭环工作流形式发布。

Comments 22 pages, 8 figures, with appendices. Yanshi Li and Xueru Bai contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00408 2026-08-12 cs.LG cs.AI physics.optics quant-ph 版本更新 62%

Exact and Asymptotically Complete Robust Verifications of Neural Networks via Ising Solvers

基于量子优化的神经网络精确且渐进完备的鲁棒验证

Wenxin Li, Wenchao Liu, Weihao Li, Chuan Wang, Qi Gao, Yin Ma, Hai Wei, Kai Wen

机构 * Beijing QBoson Quantum Technology Co., Ltd.(北京QBoson量子技术有限公司) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文提出两种基于量子优化的模型,用于精确且渐进完备地验证神经网络的鲁棒性,通过分段线性界限和量子Benders分解提高认证效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08277 2026-08-04 quant-ph cs.AI cs.LG 版本更新 62%

QARIMA: A Quantum Approach To Classical Time Series Analysis

QARIMA:一种用于经典时间序列分析的量子方法

Nishikanta Mohanty, Bikash K. Behera, Badshah Mukherjee, Pravat Dash, Giuseppe Sergioli, Roberto Giuntini

机构 * Università degli Studi di Cagliari(卡利亚里大学) SAS Middle East Fz-Llc.(SAS中东有限责任公司)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种结合量子辅助滞后发现与固定配置变分量子电路的量子启发ARIMA方法,通过量子自相关和量子偏自相关识别差分和候选滞后,提升时间序列参数估计与滞后细化效率。

Comments 17 Algorithms, 19 Figures , 26 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06543 2026-08-04 cs.CL cs.LG 版本更新 62%

The Illusion of Stochasticity in LLMs

大语言模型中的随机性错觉

Xiangming Gu, Soham De, Michalis Titsias, Larisa Markeeva, Petar Veličković, Razvan Pascanu

机构 * Google DeepMind(谷歌DeepMind) National University of Singapore(新加坡国立大学)

专题命中 工作流自动化 :agentic(abstract);分类 cs.CL、cs.LG

AI总结 研究指出大语言模型作为智能体在随机采样方面存在根本性缺陷,通过多模型家族和分布的实证分析揭示了这一问题。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16138 2026-07-31 cs.LG cs.AI hep-ex 版本更新 62%

SNAC-Pack 2.0: Scaled-Out Surrogate Neural Architecture Codesign

代理神经架构协同设计包(SNAC-Pack)

Jason Weitz, Dmitri Demler, Benjamin Hawks, Aaron Wang, Nhan Tran, Javier Duarte

机构 * University of California San Diego(加州大学圣地亚哥分校) ETH Zurich(苏黎世联邦理工学院) Fermi National Accelerator Laboratory(费米国家加速器实验室) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 工作流自动化 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SNAC-Pack,一种面向硬件的自动化机器学习框架,用于神经架构协同设计和端到端FPGA部署,通过多目标全局搜索和硬件代理模型减少合成成本,并结合量化感知训练和迭代幅度剪枝来压缩模型,最终在FPGA上实现高效部署。

Comments 16 pages, 3 figures, Camera-ready version for International Conference on Automated Machine Learning (AutoML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05690 2026-07-21 cs.AI cs.CL 版本更新 62%

Memory in the Loop: In-Process Retrieval as Extended Working Memory for Language Agents

循环中的记忆:进程内检索作为语言智能体的扩展工作记忆

Yusuf Khan, Carlo Lipizzi

机构 * Stevens(史蒂文斯理工学院)

专题命中 工作流自动化 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究语言智能体中记忆进入循环的情况,通过对比网络存储和进程内存储的延迟,利用扩展思维理论提出进程内检索可作扩展工作记忆,经实验验证能提升召回率,还重新定位了操作瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26258 2026-07-17 cs.CL cs.LG 版本更新 62%

FlowBot: Inducing LLM Workflows with Bilevel Optimization and Textual Gradients

FlowBot:通过双层优化和文本梯度诱导LLM工作流

Hongyeon Yu, Young-Bum Kim, Yoon Kim

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 工作流自动化 :workflow(abstract);分类 cs.CL、cs.LG

AI总结 本文提出FlowBot,一种基于双层优化和文本梯度的数据驱动方法,自动诱导LLM代理和工作流,与人类设计的基线相比表现相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.01898 2026-07-15 cs.LG cs.AI stat.ML 版本更新 62%

Propheticus: Machine Learning Framework for the Development of Predictive Models for Reliable and Secure Software

Propheticus:用于开发可靠安全软件预测模型的机器学习框架

João R. Campos, Marco Vieira, Ernesto Costa

机构 * DEI/CISUC, University of Coimbra,\ Portugal

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 针对软件可靠性与安全性需求,介绍Propheticus机器学习框架,抽象其复杂性以便用户使用,通过漏洞预测和在线故障预测两个案例研究,展示该框架能简化并加速机器学习工作流程。

Comments Accepted for publication in the 30th IEEE International Symposium on Software Reliability Engineering (ISSRE) 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00827 2026-06-26 cs.LG cs.AI 版本更新 62%

Beyond Independent Manipulation: Individual Fairness-aware Strategic Classification with Peer Imitation

超越独立操纵:具有同伴模仿的个体公平感知策略分类

Xinpeng Lv, Chunyuan Zheng, Yunxin Mao, Renzhe Xu, Jinxuan Yang, Yuanlong Chen, Wangrong Huang, Shaowu Yang, Wenjing Yang, Xinwang Liu, Peng Cui, Haotian Wang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) School of Mathematical Sciences, Peking University(北京大学数学学院) Institute for Theoretical Computer Science, Shanghai University of Finance and Economics(上海财经大学理论计算机科学研究所) Information Technology Development, Aetos Capital Group, Sydney(悉尼Aetos资本集团信息技术部) Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 工作流自动化 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出个体公平感知策略分类(IFSC)框架,通过建模基于个体公平的同伴驱动操纵(模仿邻近被接受同伴),并采用鲁棒学习过程处理同伴可观测性不确定性,以改善个体公平一致性并减轻模仿引起的扭曲。

Comments Accepted by SIGKDD2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04840 2026-06-24 eess.AS cs.AI cs.CL 版本更新 62%

An Approach to Simultaneous Acquisition of Real-Time MRI Video, EEG, and Surface EMG for Articulatory, Brain, and Muscle Activity During Speech Production

一种用于言语产生过程中发音、大脑和肌肉活动的实时MRI视频、脑电图和表面肌电图同步采集方法

Jihwan Lee, Parsa Razmara, Kevin Huang, Sean Foley, Aditya Kommineni, Haley Hsu, Woojae Jeong, Prakash Kumar, Xuan Shi, Yoonjeong Lee, Tiantian Feng, Takfarinas Medani, Ye Tian, Sudarsana Reddy Kadiri, Krishna S. Nayak, Dani Byrd, Louis Goldstein, Richard M. Leahy, Shrikanth Narayanan

机构 * Signal Analysis and Interpretation Laboratory, University of Southern California(南加州大学信号分析与解释实验室) Ming Hsieh Dept. of Electrical and Computer Engineering, University of Southern California(南加州大学明希斯电气与计算机工程系) Dept. of Linguistics, University of Southern California(南加州大学语言学系)

专题命中 工作流自动化 :planning(abstract);分类 cs.AI、cs.CL

AI总结 本文首次实现了言语产生过程中实时MRI、EEG和表面EMG的同步采集,并提出了针对三模态设置的伪影抑制流程,为言语神经科学和脑机接口提供新视角。

Comments Accepted for Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17315 2026-06-19 cs.LG cs.AI 版本更新 62%

Flickering Multi-Armed Bandits

闪烁多臂老虎机

Sourav Chakraborty, Amit Kiran Rege, Claire Monteleoni, Lijun Chen

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校) INRIA Paris(巴黎国家信息与自动化研究所)

专题命中 工作流自动化 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出闪烁多臂老虎机模型,通过随机图约束动作可用性,设计两阶段懒惰随机游走算法实现次线性遗憾界,并证明信息论下界的最优性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27599 2026-06-16 cs.LG cs.AI cs.AR cs.DC cs.PF 版本更新 62%

The Energy Blind Spot: NVIDIA's Flagship Edge AI Hardware Cannot Support Process-Level Energy Attribution

能源盲点:NVIDIA 旗舰边缘 AI 硬件无法支持进程级能源归因

Deepak Panigrahy, Aakash Tyagi

机构 * Independent Researcher(独立研究者) Texas A&M University(德克萨斯农工大学)

专题命中 工作流自动化 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文审计了 ASUS Ascent GX10 (GB10 SoC) 平台的能源可观测性,发现其缺乏 CPU 能源计数器等关键接口,导致无法像 x86 的 RAPL 那样进行进程级能源归因,并提出通过外部直流计量和 GPU 减法进行校准的临时方案,呼吁将能源可观测性作为硬件的一等要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04243 2026-06-16 cs.LG cs.AI 版本更新 62%

Automated ultrasound doppler angle estimation using deep learning

基于深度学习的自动化超声多普勒角度估计

Nilesh Patil, Ajay Anand

机构 * Goergen Institute for Data Science(戈尔根数据科学研究所) University of Rochester Medical Center(罗切斯特大学医学中心) University of Rochester(罗切斯特大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 提出一种基于深度学习的自动化多普勒角度估计方法,使用2100张颈动脉超声图像及预训练模型,平均绝对误差3.9°-9.4°,最佳模型误差低于临床可接受阈值,可避免正常速度误判为狭窄。

Journal ref Annu Int Conf IEEE Eng Med Biol Soc. 2019 Jul;2019:28-31

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02221 2026-06-10 cs.LG cs.AI 版本更新 62%

MedFeat: Model-Aware and Explainability-Driven Feature Engineering with LLMs for Clinical Tabular Prediction

MedFeat: 基于模型感知与可解释性驱动的LLM特征工程用于临床表格预测

Zizheng Zhang, Yiming Li, Justin Xu, Jinyu Wang, Rui Wang, Lei Song, Jiang Bian, David W Eyre, Jingjing Fu

机构 * Microsoft Research(微软研究院) University of Oxford(牛津大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 提出MedFeat框架,利用模型感知和特征重要性信号迭代引导LLM生成针对性特征,在临床表格预测中平均提升超10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17629 2026-06-10 cs.LG cs.AI 版本更新 62%

SCOPE: Sequential Causal Optimization of Process Interventions

SCOPE: 过程干预的顺序因果优化

Jakob De Moor, Hans Weytjens, Johannes De Smedt, Jochen De Weerdt

机构 * Research Centre for Information Systems Engineering (LIRIS), KU Leuven, Leuven, Belgium(信息系统工程研究中心(LIRIS),鲁汶大学,比利时列文) School of Computation, Information and Technology, Technical University of Munich (TUM), Munich, Germany(计算、信息与技术学院,慕尼黑技术大学(TUM),德国慕尼黑)

专题命中 工作流自动化 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出SCOPE方法,通过反向归纳和因果学习直接利用观测数据,优化业务流程中顺序干预的KPI,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29475 2026-06-09 cs.CL cs.AI cs.CE cs.HC 版本更新 62%

MOOSE-Copilot: A Web-Based Interactive Assistant for Unified Exploratory and Fine-Grained Scientific Hypothesis Discovery

MOOSE-Copilot:一个基于网络的交互式助手,用于统一探索性和细粒度科学假设发现

Hongran An, Zonglin Yang

机构 * Central Conservatory of Music(中央音乐学院) Nanyang Technological University(南洋理工大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 提出MOOSE-Copilot,通过形式化的人机交互协议,将发散性探索和收敛性细化统一,利用蓝图、路由和反馈三种信号引导生成,显著优于纯自主基线。

Comments Accepted to ACL 2026 (System Demonstrations)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15727 2026-06-09 cs.LG cs.CL 版本更新 62%

Towards Automated Kernel Generation in the Era of LLMs

面向LLM时代的自动化内核生成

Yang Yu, Peiyu Zang, Chi Hsu Tsai, Haiming Wu, Yixin Shen, Jialing Zhang, Haoyu Wang, Zhiyou Xiao, Jingze Shi, Yuyu Luo, Wentao Zhang, Chunlei Men, Guang Liu, Yonghua Lin

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Beijing Normal University(北京师范大学) Peking University(北京大学) Beijing Institute of Technology(北京理工大学) Cornell University(康奈尔大学) Beijing Jiaotong University(北京交通大学) Renmin University of China(中国人民大学) Hong Kong University of Science and Technology (Guangzhou)(广州科技大学)

专题命中 工作流自动化 :agentic(abstract);分类 cs.CL、cs.LG

AI总结 本文综述了利用大语言模型(LLM)和智能体系统自动化生成与优化GPU内核的方法,系统梳理了现有方法、数据集和基准,并指出了未来研究方向。

Comments In IJCAI 2026. 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11625 2026-08-17 cs.AI 版本更新 57%

Making AI-Generated Feedback Matter: A Large-Scale Study of Feedback Workflows and Student Enactment

让AI生成的反馈发挥作用:从提供到学生执行

Omar Alsaiari, Nilufar Baghaei, Jason M. Lodge, Dragan Gaševi'c, Naomi Winstone, Hassan Khosravi

机构 * The University of Queensland(昆士兰大学) University of Surrey(萨里大学) The University of Hong Kong(香港大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI

AI总结 该研究通过13037名学生的大规模准实验,发现主动构建的AI反馈执行工作流可显著提升学生对AI反馈的接受度、自我评估信心及作品质量,强调需设计针对性AI反馈工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09959 2026-08-14 physics.ao-ph cs.LG 版本更新 57%

AIFS-TC: A simple correction competitive with the operational frontier for tropical cyclone intensity forecasting

AIFS-TC:一种可与业务前沿水平媲美的热带气旋强度预报简单修正方法

Anna Allen, Wessel P. Bruinsma, Michael Maier-Gerber, Harrison Cook, Matthew Chantry, Richard E. Turner

专题命中 工作流自动化 :agentic(abstract);分类 cs.LG

AI总结 该研究提出AIFS-TC修正方法,基于开源AIFS-Single模型,可在12小时至7天时效内媲美业务前沿的热带气旋强度预报性能,且由Claude Fable 5自主设计,凸显智能体编码在预警系统研发中的潜力。

Comments 6 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22015 2026-08-13 cs.SE 版本更新 57%

Are Production Cloud Skills Adequately Tested? Measuring and Governing Skill Test Adequacy in Practice

生产云技能是否得到充分测试?在实践中衡量和管理技能测试覆盖率

Haotian Si, Junyi Chen, Shuyang Yu, Ruifeng Nie, Jiate Li, Jianqiang Zhao, Meng Li, Dengcheng He

专题命中 工作流自动化 :AI agent(abstract);分类 cs.SE

AI总结 研究生产云技能测试覆盖率问题,开发测量管道恢复操作义务、映射测试用例并生成覆盖报告,结合模型辅助与专家评审确保覆盖率基于证据,将覆盖差距转化为测试改进建议。

详情

展开后加载摘要…

URL PDF HTML 收藏