arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 6842 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 497 篇

2606.19644 2026-06-19 cs.SE 新提交 57%

Prompt Quality and Pull Request Outcomes: A Stage-Based Empirical Study of LLM-Assisted Development

提示质量与拉取请求结果:基于阶段的LLM辅助开发实证研究

Richard Sserunjogi, Daniel Ogenrwot, John Businge

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 通过分析265个开发者与ChatGPT的交互,研究提示结构(上下文、具体性、验证)对LLM辅助开发中代码生成、采纳和集成深度的影响,发现不同维度在不同阶段有不同作用。

Comments 48 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19319 2026-06-18 cs.MA cs.AI cs.DB 新提交 57%

Data Intelligence Agents: Interpreting, Modeling, and Querying Enterprise Data via Autonomous Coding Agents

数据智能代理:通过自主编码代理解释、建模和查询企业数据

Anoushka Vyas, Aarushi Dhanuka, Sina Khoshfetrat Pakazad, Henrik Ohlsson

机构 * C3 AI

专题命中 软件智能体 :workflow(abstract);分类 cs.AI

AI总结 提出Data Intelligence Agents (DIA)系统,由三个自主编码代理组成,通过执行、验证和修复工件来压缩数据集成工作流,在七个SQL基准测试中达到或超越最佳结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16769 2026-06-16 cs.AI 新提交 57%

Skill-to-LoRA: From Using Skills to Learning Behaviors for Token-Efficient LLM Agents

Skill-to-LoRA:从使用技能到学习行为以实现令牌高效的LLM智能体

Tianyi Zhang, Zhonghao Qi

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 提出Skill-to-LoRA方法,将技能文本转换为LoRA适配器,替代运行时注入技能文档,在SWE-Skills-Bench上提升通过率并降低令牌成本。

Comments Preprint. 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16545 2026-06-16 cs.CL 新提交 57%

Can LLM Coding Agents Reason About Time Series?

LLM 编码智能体能否推理时间序列?

Filip Rechtorík, Ondřej Dušek, Zdeněk Kasner

机构 * Institute of Formal and Applied Linguistics, Faculty of Mathematics and Physics, Charles University(查尔斯大学数学与物理学院形式与应用语言学研究所)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 研究 LLM 编码智能体在时间序列分析中的能力,发现代码访问可提升性能达 10%,但仍有 22-34% 错误,并分析了推理差距。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16540 2026-06-16 q-bio.QM cs.LG q-bio.BM q-bio.GN 新提交 57%

MultiMolecule: a modular ecosystem for biomolecular sequence-model workflows

MultiMolecule: 一个用于生物分子序列模型工作流的模块化生态系统

Zhiyuan Chen

机构 * DanLing Team(丹 Ling 团队)

专题命中 软件智能体 :workflow(abstract);分类 cs.LG

AI总结 提出MultiMolecule开源生态系统,通过标准化接口整合RNA、DNA和蛋白质序列模型,提供53个模型族实现、112个检查点和16个数据集资源,支持模型复用、评估和生物预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15349 2026-06-16 cs.CY cs.AI 新提交 57%

LearnOpt: Recovering the Latent Cognitive Structure of Standardized Examinations via Knowledge Graphs and Constrained Optimization

LearnOpt: 通过知识图谱和约束优化恢复标准化考试的潜在认知结构

Joy Bose, Om Thomas

机构 * Independent Researchers(独立研究者)

专题命中 软件智能体 :planning(abstract);分类 cs.AI

AI总结 提出LearnOpt框架,利用知识图谱和约束优化从历史试题中恢复潜在认知结构,生成个性化学习计划;在NEET和JEE Advanced考试数据上验证了潜在结构的稳定性和可检测的转变。

Comments 26 pages, 2 figures, 6 tables. Code, data, and calibration tooling: https://github.com/joyboseroy/learnopt. Datasets on HuggingFace: joyboseroy/neet-skill-tags-2016-2024, joyboseroy/jee-advanced-skill-tags-2016-2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15348 2026-06-16 q-bio.NC cs.AI 新提交 57%

Intrinsic Computational Functionalism and Simulated Consciousness

内在计算功能主义与模拟意识

Ryota Kanai, Shuqin Ma

机构 * Araya Inc.(Araya公司) School of Philosophy, Fudan University(复旦大学哲学学院) Sussex Centre for Consciousness Science, University of Sussex(Sussex大学意识科学中心)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文从内在计算功能主义出发,提出机制丰富的规范结构,论证若意识是计算构成的,则任何满足内在因果-计算实现关系的系统(生物、人工或模拟)都实现相同的意识相关属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13392 2026-06-15 cs.AI 新提交 57%

MiniMax Sparse Attention

MiniMax 稀疏注意力

Xunhao Lai, Weiqi Xu, Yufeng Yang, Qiaorui Chen, Yang Xu, Lunbin Zeng, Xiaolong Li, Haohai Sun, Haichao Zhu, Vito Zhang, Jinkai Hu, Jiayao Li, Rui Gao, Zekun Li, Songquan Zhu, Jingkai Zhou, Pengyu Zhao

机构 * MiniMax Peking University(北京大学) NVIDIA(英伟达) Zhejiang University(浙江大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 提出 MiniMax 稀疏注意力(MSA),一种基于分组查询注意力的块级稀疏注意力机制,通过轻量索引分支选择 Top-k 键值块,实现高效长上下文处理,在 109B 模型上以 1M 上下文减少 28.4 倍注意力计算,并带来 14.2 倍预填充和 7.6 倍解码加速。

Comments 30 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12329 2026-06-11 cs.AI 新提交 57%

PROJECTMEM: A Local-First, Event-Sourced Memory and Judgment Layer for AI Coding Agents

PROJECTMEM:面向AI编码代理的本地优先、事件溯源记忆与判断层

Ripon Chandra Malo, Tong Qiu

机构 * University of Utah(犹他大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 提出PROJECTMEM,一种本地优先、事件溯源的记忆与判断层,通过记录事件日志并生成紧凑摘要,帮助AI编码代理避免重复错误,实现记忆即治理。

Comments 12 pages, 5 figures, 1 table. Code: https://github.com/riponcm/projectmem

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11476 2026-06-11 cs.SE 新提交 57%

SentTrack: Sentiment-Driven Bottleneck Detection in GitHub Issue Repositories

SentTrack: GitHub问题仓库中情感驱动的瓶颈检测

Xinyu Hu, Ali Behbahani, Daniel Moon, Yaren Dogan, Nasir U. Eisty

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 提出SentTrack双管道框架,结合大语言模型摘要与ABCDE交互分类,从约9000个GitHub问题线程中检测社会技术瓶颈,发现49%线程停滞,仅13%解决,并通过加权评分引擎优先处理高摩擦讨论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11447 2026-06-11 cs.CL 新提交 57%

AI Coding Agents Can Reproduce Social Science Findings

AI编码智能体能够复现社会科学研究结果

Meysam Alizadeh, Mohsen Mosleh, Fabrizio Gilardi, Atoosa Kasirzadeh, Joshua Tucker

机构 * University of Oxford(牛津大学) University of Zurich(苏黎世大学) Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 本研究构建SocSci-Repro-Bench基准测试,评估Claude Code和Codex两个前沿编码智能体在221项社会科学任务中的复现能力,发现它们能复现大部分结果,且Claude Code表现更优,同时提示框架会影响确认性规范搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11416 2026-06-11 cs.CR cs.AI 新提交 57%

MPC-Patch-Bench: Security-Aware LLM Code Patch for Multi-Party Computation

MPC-Patch-Bench:面向多方计算的安全感知LLM代码补丁

Yukuan Zhang, Mengxin Zheng, Qian Lou

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 针对多方计算(MPC)软件缺乏仓库级代码修复基准的问题,提出MPC-Patch-Bench,包含数据筛选框架和MPC验证器,评估LLM在MPC仓库级修复中的安全性和数值保真度。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11356 2026-06-11 physics.ao-ph cs.DC cs.SE physics.comp-ph 新提交 57%

An Ocean Model Ported by a Large Language Model: Experience and Lessons from FESOM2 (Fortran to C to C++/Kokkos)

大型语言模型移植海洋模型:FESOM2(Fortran到C再到C++/Kokkos)的经验与教训

Nikolay V. Koldunov, Suvarchal K. Cheedela, Sergey Danilov, Dmitry Sidorenko, Sebastian Beyer, Thomas Jung

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本文展示利用LLM将FESOM2海洋模型从Fortran移植到C再到C++/Kokkos,通过两阶段翻译、严格字面转换和逐级验证,在数周内保持物理准确性并实现GPU加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10933 2026-06-10 cs.AI 新提交 57%

Frontier Coding Agents Use Metaprogramming to Adapt to Unfamiliar Programming Languages

前沿编码代理使用元编程适应不熟悉的编程语言

Aman Sharma, Sushrut Thorat, Paras Chopra

机构 * Lossfunk

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 研究评估LLM编码代理在陌生语言上的表现,发现强代理通过元编程(如用Python生成目标语言代码)适应,禁止此策略性能大幅下降,而弱代理无法从中受益。

Comments 43 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09867 2026-06-10 cs.AR cs.AI 新提交 57%

EstRTL: Functional Estimation Guided RTL Code Generation

EstRTL:功能估计引导的RTL代码生成

Qi Xiong, Renzhi Chen, Bowei Wang, Yuqing Xiong, Libo Huang, Lei Wang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) Defense Innovation Institute, Academy of Military Science (AMS)(军事科学院创新院) School of Computer Science and Technology, Shandong University(山东大学计算机科学与技术学院) Key Laboratory of Advanced Microprocessor Chips and Systems, Changsha, China, and College of Computer Science and Technology, National University of Defense Technology, Changsha, China(先进微处理器芯片与系统重点实验室,长沙,中国,和国防科技大学计算机科学与技术学院,长沙,中国) Defense Innovation Institute, AMS, Beijing, China and Qiyuan Lab, Beijing, China(军事科学院创新院,北京,中国和启元实验室,北京,中国)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 提出EstRTL框架,通过静态功能评分估计,结合生成、评估和修正三阶段范式,提升LLM生成RTL代码的功能正确性,在通用LLM上正确率提升3.2%-9.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07999 2026-06-09 cs.AI 新提交 57%

Efficient Skill Grounding via Code Refactoring with Small Language Models

通过小型语言模型的代码重构实现高效技能落地

Sera Choi, Wonje Choi, Saehun Chun, Daehee Lee, Jooyoung Kim, Chaeun Lee, Honguk Woo

机构 * KAIST(韩国科学技术院)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 提出RECENT框架,通过将技能语义与执行绑定解耦,利用小型语言模型进行代码重构实现高效技能落地,在动态环境中达到与大型语言模型相当的性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07683 2026-06-09 cs.SE eess.SP 新提交 57%

Review the Code, Not the Story: A Vision and Protocol for Code-First Peer Review

审查代码,而非故事:代码优先同行评审的愿景与协议

Jienan Chen

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 提出代码优先同行评审协议,由AI系统构建环境、执行实验并生成标准化审查包,将评审焦点从叙述转向可执行证据。

Comments 17 pages, vision and protocol paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26117 2026-07-30 cs.SE cs.AI cs.LG 新提交 56%

Try Again, Don't Look Back: Blind Resampling Outperforms Self-Repair in Small Code Models

再试一次,不要回头:小型代码模型中盲重采样优于自我修复

Yuvraj Verma

专题命中 软件智能体 :分类 cs.AI、cs.LG、cs.SE;agent(comments)

AI总结 该研究针对MBPP+数据集在三种规模代码模型上发现,盲重采样在7B以下表现最优,成本远低于其他重试方法,而基于自身失败尝试的自我修复存在锚定效应导致的性能损失。

Comments Code, pre-registrations and run traces: https://github.com/vermayuvraj/self-improving-agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19816 2026-08-21 cs.CY 新提交 50%

Understanding as an Explicit and Assessable Component of Frontier AI Safety Decisions

将理解作为前沿AI安全决策的明确且可评估的组成部分

Stephen Barrett, Robin Bloomfield, Alexandra Chirilă, Mamoon Masud, David Meredith Hardy, Phillip Mulvana

专题命中 软件智能体 :agent(abstract)

AI总结 该研究提出一种基于Assurance 2.0框架的临时方法,用于明确且可评估前沿AI安全决策中的理解,经两种场景测试,该方法可应用且能驱动工程工作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18129 2026-08-20 math.OC cs.MA 新提交 50%

Simulation-Optimization of Systems of Optimizers: Exploiting the Inner Optimization's Geometry

优化器系统的模拟优化:利用内部优化的几何结构

Zhou He

专题命中 软件智能体 :agent(abstract)

AI总结 该研究针对优化器系统(SOSO)的模拟优化,提出利用内部优化几何结构的 PRIME 求解器,在多类测试平台上实现了优异性能,大幅降低了方差,为模拟优化提供了新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16961 2026-08-19 cs.CR cs.NI cs.PF 新提交 50%

Quantum-Safe Web Service Architecture Using Time-Based One-Time Passwords

使用基于时间的一次性密码的量子安全Web服务架构

Abel C. H. Chen

专题命中 软件智能体 :agent(abstract)

AI总结 本研究开发了一种量子安全Web服务架构,采用基于后量子密码学的TLS与HTTPS保障传输安全,通过HMAC驱动的TOTP保障服务安全,并实验对比了四种哈希算法的性能以支撑部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17257 2026-08-19 astro-ph.IM astro-ph.EP 新提交 50%

The Roman Coronagraph Community Participation Program: corgisim - a simulation suite for the Nancy Grace Roman Space Telescope Coronagraph Instrument

罗马日冕仪社区参与计划:corgisim——南希·格蕾丝·罗马空间望远镜日冕仪的模拟套件

Jingwen Zhang, Sophie Noiret, Maxwell A. Millar Blanchaer, Jason Wang, Alexis Lau, Neil Zimmerman, Jessica Gersh-Range, Eric Shen, Kevin Ludwick, Taichi Uyama, Chen Xie, Vanessa P. Bailey, John Krist, Elodie Choquet, Julien Girard, Alexis Bidot, Arthur Vigan

专题命中 软件智能体 :planning(abstract)

AI总结 该研究开发了开源模拟包corgisim,作为罗马日冕仪社区参与计划的一部分,用于南希·格蕾丝·罗马空间望远镜日冕仪观测的端到端模拟,为相关任务提供数据支持与应用指导。

Comments Proceedings of SPIE Astronomical Telescopes + Instrumentation 2026 (Paper No.14145-182)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17152 2026-08-19 astro-ph.IM 新提交 50%

The Roman Coronagraph Community Participation Program: target database and tools

罗曼日冕仪社区参与计划:目标数据库与工具

Dmitry Savransky, Rifah Tasnim, Saanika Choudhary, Hovik Grigoryan, Justin Hom, Bijan Nemati, Neil Zimmerman, Ramya Anche, Nicholas Phillips, Louie Donesa, Parth Mittal, Amira Razack, Savaas Iqbal, Javier Majumdar, Schuyler G. Wolff, Vanessa P. Bailey

专题命中 软件智能体 :planning(abstract)

AI总结 针对罗曼空间望远镜日冕仪的调试与观测需求,罗曼日冕仪社区参与计划开发了含多类目标的数据库及配套工具,用于观测规划与调度。

Comments Presented at SPIE Astronomical Telescopes + Instrumentation 2026. Paper Number 14145-183

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17077 2026-08-19 astro-ph.IM 新提交 50%

The Roman Coronagraph Community Participation Program: trials and triumphs of designing an observing program for a technology demonstration instrument

罗曼日冕仪社区参与计划:为技术演示仪器设计观测计划的试验与成功实践

Schuyler G. Wolff, Vanessa P. Bailey, Justin Hom, Beth Biller, Dmitry Savransky, Julien H. Girard, Ellis Bogat, Óscar Carrión-González, Clarissa R. Do Ó, Masayuki Kuzuhara, Chen Xie, Maxwell Millar-Blanchaer, Susan Redmond, Johan Mazoyer, Macarena Vega-Pallauta, Gael Chauvin, Matthieu Ravet, Alexandra Greenbaum, Eric Cady, Ramya Anche, James Ingalls, the Roman Coronagraph Community Participation Program Team

专题命中 软件智能体 :planning(abstract)

AI总结 该研究介绍罗曼日冕仪社区参与计划过去两年的活动,重点为罗曼望远镜初始在轨校验及观测首六个月做观测规划,还阐述了天文界后续参与公开数据研究的未来机会。

Comments Submitted to SPIE Astronomical Telescopes + Instrumentation 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13610 2026-08-17 eess.IV cs.MM 新提交 50%

LoopVSR: A Loop Engineering Framework for Automated Repair of Visual Speech Recognition Inference Pipelines

LoopVSR:用于自动修复视觉语音识别推理流水线的循环工程框架

Fei Qin, Bowen Zhang, Chao Fan, Pengcheng Luo, Genke Yang

专题命中 软件智能体 :agent(abstract)

AI总结 LoopVSR是一种循环工程框架,可让代码智能体结合端到端执行证据自动修复VSR推理流水线,在CMLR VSR系统上的表现远优于静态防护,可实现100%平均修复率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13448 2026-08-14 cs.RO 新提交 50%

Mind the Context: Continual Learning of Socially Appropriate Robot Actions via Environmental-Social Disentanglement

关注上下文:通过环境-社会解耦实现社会适配机器人动作的持续学习

Rafal Robert Karpinski, Fethiye Irmak Dogan, Nikhil Churamani, Yiming Luo, Maartje M. A. de Graaf, Davide Dell'Anna, Hatice Gunes

机构 * Utrecht University(乌得勒支大学) University of Cambridge(剑桥大学)

专题命中 软件智能体 :agent(abstract)

AI总结 该研究针对社交机器人在多样上下文场景下的持续学习问题,提出EDD框架解耦环境与社会知识,缓解遗忘,性能优于现有基线,相关代码已公开。

Comments Extended version of the paper accepted at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13027 2026-08-14 cs.AR 新提交 50%

Why Do Prefetchers Fail? Let Agents Answer

预取器为何失效?让智能体来解答

Xiangfeng Sun, Ceyu Xu, Ningzhi Ai, Zeyu Zhu, Yiyang Yuan, Yuan Xie

专题命中 软件智能体 :agent(abstract)

AI总结 该研究提出智能体驱动的自动研究流程构建预取器混合模型MoP,在SPEC CPU2006/2017上实现61.1%几何平均IPC加速,超越多款人工设计预取器,为硬件预取器设计提供新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12195 2026-08-13 cs.HC 新提交 50%

IF:CARGO: LLM-Based Semantic Compilation for Al-Native Rule Programming Games

IF:CARGO:面向AI原生规则编程游戏的基于大语言模型的语义编译

Ting-Chen Hsu, Lianye Zhang, Jiangxu Lin, Zhaoyi Yu, Fei Qin, Zihao Chen

专题命中 软件智能体 :agent(abstract)

AI总结 本研究通过实验性益智游戏IF:CARGO,将大语言模型用作语义编译器而非游戏代理,开展24人混合方法游戏测试,提出AI原生游戏需约束自然语言输入、保留玩家创作权并确保确定性执行的模式。

Comments Accepted to 2026 AAAI Conference on Artificial Intelligence and Digital Interactive Entertainment (AIIDE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11932 2026-08-13 math.OC 新提交 50%

Joint Identifiability and Conditioning in Finite-Horizon Continuous-Time Inverse LQR with Unknown Dynamics

未知动力学下有限时域连续时间逆LQR的联合可识别性与条件约束

Meiling Yu, Yuan-Hua Ni, Lei Jiang

专题命中 软件智能体 :agent(abstract)

AI总结 本文针对未知动力学的有限时域连续时间逆LQR问题,利用时变最优增益的内生激励建立联合可识别性条件,开发感知条件的采样数据重构方法,通过数值实验验证了理论与条件指数的诊断价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09410 2026-08-11 cs.RO 新提交 50%

Skills in Weights, Memory in Code: Hybrid Learning for Memory-Dependent Robot Manipulation

权重中的技能,代码中的记忆:面向依赖记忆的机器人操作的混合学习

Yunhao Zhao, Zhenyang Ni, Haoyang Chen, Ruohan Zhang, Qi Zhu

专题命中 软件智能体 :agent(abstract)

AI总结 针对现实机器人操作的非马尔可夫性,提出混合学习框架 HyMeS,结合编码智能体与马尔可夫 VLA,在 RoboMemArena 上显著提升操作成功率,实现数据高效的组合泛化。

Comments 9 pages, 4 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏