arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3217 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 3217 篇

2510.08341 2026-02-02 cs.LG cs.AI 62%

Post-Norm can Resharpen Attention

Post-Norm 可增强注意力

Pál Zsámboki, Benjamin Levi, David Ansel Josef Smith, Mitansh Kagalwala, Arlington Kell, Samuel Liechty, Cong Wang

机构 * HUN-REN Alfréd Rényi Institute of Mathematics, Budapest, Hungary(匈牙利REN阿弗雷德·雷尼数学研究所) University of Rochester, Rochester, NY, USA(罗切斯特大学) The University of Alabama, Tuscaloosa, AL, USA(阿拉巴马大学) University of Virginia, Charlottesville, VA, USA(弗吉尼亚大学) Georgia Institute of Technology, Atlanta, GA, USA(佐治亚理工学院) Brigham Young University, Provo, UT, USA(Brigham Young大学) Carleton College, Northfield, MN, USA(卡洛尔顿学院)

专题命中 软件智能体 :autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 Post-Norm通过增强注意力机制,解决Transformer在长度泛化任务中因注意力分散导致的性能下降问题。

Comments 17 pages, 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21115 2026-01-30 cs.CL cs.AI 62%

Multi-task Code LLMs: Data Mix or Model Merge?

多任务代码LLM:数据混合还是模型合并?

Mingzhi Zhu, Boris Sobolev, Rahul Krishna, Raju Pavuluri, Stacy Patterson, Michele Merler

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) IBM Research(IBM研究院)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本研究比较了数据混合与模型合并在多任务代码LLM中的效果,发现模型合并在大模型规模下表现更优,而数据混合在小规模更有效,为资源受限场景提供了高效解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18241 2026-01-27 cs.SE cs.AI 62%

TAM-Eval: Evaluating LLMs for Automated Unit Test Maintenance

TAM-Eval: 评估用于自动单元测试维护的LLM

Elena Bruches, Vadim Alperovich, Dari Baturova, Roman Derunets, Daniil Grebenkin, Georgy Mkrtchyan, Oleg Sedukhin, Mikhail Klementev, Ivan Bondarenko, Nikolay Bushkov, Stanislav Moiseev

机构 * Both authors contributed equally to this research.(共同作者)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 TAM-Eval提出一个评估LLM在自动单元测试维护能力的框架和基准,通过测试套件创建、修复和更新三个场景,揭示LLM在真实测试维护中的局限性。

Comments Accepted for publication at the 9th Workshop on Validation, Analysis and Evolution of Software Tests (VST 2026), co-located with the the 33rd IEEE International Conference on Software Analysis, Evolution and Reengineering (SANER 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17584 2026-01-27 cs.SE cs.AI 62%

Prompt Driven Development with Claude Code: Building a Complete TUI Framework for the Ring Programming Language

通过Claude Code驱动的开发:为环编程语言构建完整的终端用户界面框架

Mahmoud Samir Fayed, Ahmed Samir Fayed

专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 通过Claude Code驱动开发,为环编程语言构建完整终端用户界面框架,展示了提示驱动方法在软件工程中的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17133 2026-01-27 cs.LG cs.AI cs.CR cs.DC cs.MA 62%

Learning to Collaborate: An Orchestrated-Decentralized Framework for Peer-to-Peer LLM Federation

学习协作:一种协同-去中心化框架用于点对点大语言模型联邦

Inderjeet Singh, Eleonore Vissol-Gaudin, Andikan Otung, Motoyoshi Sekiya

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 KNEXA-FL通过协同去中心化框架提升点对点大语言模型联邦学习的效率与稳定性

Comments Accepted to AAAI 2026. 13 pages, 3 figures, 10 tables. Code available at: https://github.com/FujitsuResearch/knexa-fl

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11655 2026-01-21 cs.SE cs.CL 62%

Advances and Frontiers of LLM-based Issue Resolution in Software Engineering: A Comprehensive Survey

大语言模型在软件工程中的问题解决进展与前沿:一项全面的调查

Caihua Li, Lianghong Guo, Yanlin Wang, Daya Guo, Wei Tao, Zhenyu Shan, Mingwei Liu, Jiachi Chen, Haoyu Song, Duyu Tang, Hongyu Zhang, Zibin Zheng

机构 * Sun Yat-sen University(中山大学) Hangzhou Normal University(杭州师范大学) Zhejiang University(浙江大学) Huawei Technologies Co, Ltd(华为技术有限公司) Chongqing University(重庆大学)

专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.SE

AI总结 本文全面调查了大语言模型在软件工程中问题解决的进展与前沿,分析了数据构建、方法和技术挑战,并提供了开源资源。

Comments 26 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19825 2026-01-21 cs.LG cs.AI cs.DB 62%

Position: Foundation Models for Tabular Data within Systemic Contexts Need Grounding

位置:在系统性情境中为表格数据构建的基础模型需要接地

Tassilo Klein, Johannes Hoffart

专题命中 软件智能体 :autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出语义链接表和SLT基础模型,通过双阶段训练实现表格数据在操作上下文中的接地,强调操作知识对自主代理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09122 2026-01-19 cs.SE cs.AI 62%

Vendor-Aware Industrial Agents: RAG-Enhanced LLMs for Secure On-Premise PLC Code Generation

面向供应商的工业代理:增强型LLM用于安全本地PLC代码生成

Joschka Kersting, Michael Rummel, Gesa Benndorf

机构 * Centre for Machine Learning(机器学习中心) Fraunhofer IOSB-INA(弗劳恩霍夫IOSB-INA研究所) FA-EDC Mitsubishi Electric Europe(三菱电机欧洲)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出了一种基于RAG增强的LLM方法,用于在低数据域中安全生成本地PLC代码,通过提示工程和定向检索提升代码生成质量。

Comments ICIT2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10773 2026-01-19 cs.SE cs.AI 62%

LogicLens: Leveraging Semantic Code Graph to explore Multi Repository large systems

LogicLens: 通过语义代码图探索多仓库大型系统

Niko Usai, Dario Montagnini, Kristian Ilianov Iliev, Raffaele Camanzo

机构 * Sourcesense

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 LogicLens通过构建语义多仓库图,帮助开发者探索复杂软件系统,支持自然语言交互和动态检索子图,实现领域逻辑和运行时行为的分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.17380 2026-01-19 cs.AI cs.LG 62%

Traffic expertise meets residual RL: Knowledge-informed model-based residual reinforcement learning for CAV trajectory control

交通专家与残差强化学习相遇:基于知识的模型驱动残差强化学习用于智能交通车辆轨迹控制

Zihao Sheng, Zilin Huang, Sikai Chen

机构 * Department of Civil and Environmental Engineering, University of Wisconsin-Madison, Madison, WI, 53706, USA(土木与环境工程系,威斯尼大学麦迪逊分校)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于知识的模型驱动残差强化学习框架,用于智能交通车辆轨迹控制,结合交通专家知识与传统控制方法,提升学习效率与交通流平滑度。

Comments Accepted by Communications in Transportation Research

Journal ref Communications in Transportation Research 4 (2024): 100142

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10112 2026-01-16 cs.SE cs.AI 62%

Repository Intelligence Graph: Deterministic Architectural Map for LLM Code Assistants

仓库智能图:用于LLM代码助手的确定性架构图

Tsvi Cherny-Shahar, Amiram Yehudai

机构 * Blavatnik School of Computer Science Tel Aviv University(布拉瓦特尼克计算机科学学院特拉维夫大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本研究提出仓库智能图(RIG)以提升LLM代码助手的构建和测试结构理解能力,通过确定性架构图和SPADE提取器实现结构化问题解答的准确性与效率提升。

Comments 35 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06099 2026-01-13 cs.SE cs.AI 62%

ENCO: Life-Cycle Management of Enterprise-Grade Copilots

ENCO:企业级协作者的生命周期管理

Yiwen Zhu, Mathieu Demarne, Kai Deng, Wenjing Wang, Nutan Sahoo, Divya Vermareddy, Hannah Lerner, Yunlei Lu, Swati Bararia, Anjali Bhavan, William Zhang, Xia Li, Katherine Lin, Miso Cilimdzic, Subru Krishnan

机构 * Microsoft(微软公司) Carnegie Mellon University(卡内基梅隆大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 ENCO 通过 DECO 框架提升企业级协作者的生命周期管理,实现高效检索增强生成和自动化资源访问,提高工程效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02410 2026-01-07 cs.SE cs.AI cs.CY cs.GR 62%

The Vibe-Check Protocol: Quantifying Cognitive Offloading in AI Programming

Vibe-Check协议:量化AI编程中的认知卸载

Aizierjiang Aiersilan

机构 * The George Washington University(乔治·华盛顿大学)

专题命中 软件智能体 :AI agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出Vibe-Check协议,通过量化指标评估Vibe Coding在软件工程教学中的效果,探讨其对技能保留和概念理解的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07017 2026-01-01 cs.SE cs.AI 62%

Benchmarking LLMs for Fine-Grained Code Review with Enriched Context in Practice

基于实践丰富上下文的LLM细粒度代码审查基准测试

Ruida Hu, Xinchen Wang, Xin-Cheng Wen, Zhao Zhang, Bo Jiang, Pengfei Gao, Chao Peng, Cuiyun Gao

机构 * Harbin Institute of Technology(哈尔滨工业大学) ByteDance(字节跳动)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 ContextCRBench通过丰富上下文的细粒度代码审查基准测试,评估LLM在代码审查中的性能,发现文本上下文比代码上下文更有效,且在工业应用中提升了审查系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20482 2025-12-24 cs.SE cs.AI 62%

SweRank+: Multilingual, Multi-Turn Code Ranking for Software Issue Localization

SweRank+: 多语言、多轮次代码排名用于软件问题定位

Revanth Gangi Reddy, Ye Liu, Wenting Zhao, JaeHyeok Doo, Tarun Suresh, Daniel Lee, Caiming Xiong, Yingbo Zhou, Semih Yavuz, Shafiq Joty

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Salesforce AI Research(Salesforce AI研究院) KAIST AI(韩国科学技术院AI研究中心)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 SweRank+结合跨语言代码排名工具和代理搜索设置,实现多轮次的代码库推理,提升多语言软件问题定位的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10713 2025-12-23 cs.SE cs.AI 62%

PACIFIC: a framework for generating benchmarks to check Precise Automatically Checked Instruction Following In Code

PACIFIC:用于检查精确自动指令遵循的代码基准生成框架

Itay Dreyfuss, Antonio Abu Nassar, Samuel Ackerman, Axel Ben David, Eitan Farchi, Rami Katan, Orna Raz, Marcel Zalmanovici

机构 * IBM Research(IBM研究)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 PACIFIC框架通过生成具有明确预期输出的基准,评估LLM在代码指令遵循和dry运行能力上的表现,提供了一种抗污染且可扩展的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14757 2025-12-23 cs.SE cs.AI 62%

SWE-Synth: Synthesizing Verifiable Bug-Fix Data to Enable Large Language Models in Resolving Real-World Bugs

SWE-Synth:合成可验证的bug修复数据以使大语言模型能够解决现实中的bug

Minh V. T. Pham, Huy N. Phan, Hoang N. Phan, Cuong Le Chi, Tien N. Nguyen, Nghi D. Q. Bui

机构 * FPT Software AI Center, Viet Nam(越南FPT软件AI中心) Nanyang Technological University, Singapore(新加坡南洋理工大学) University of Texas at Dallas, US(美国德克萨斯大学达拉斯分校)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 SWE-Synth通过合成可验证的bug修复数据集,提升大语言模型在解决现实bug中的性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11068 2025-12-23 cs.LG cs.DC cs.SE 62%

A Reinforcement Learning Environment for Automatic Code Optimization in the MLIR Compiler

为MLIR编译器自动代码优化设计的一种强化学习环境

Mohammed Tirichine, Nassim Ameur, Nazim Bendib, Iheb Nassim Aouadj, Bouchama Djad, Rafik Bouloudene, Riyadh Baghdadi

机构 * New York University Abu Dhabi(纽约大学阿布扎赫尔分校) ESI(埃斯国际研究所) USTHB(阿尔及利亚国家技术与高等理工学院)

专题命中 软件智能体 :agent(abstract);分类 cs.LG、cs.SE

AI总结 本文提出MLIR RL,一种为MLIR编译器设计的强化学习环境,用于自动代码优化,通过多离散动作空间和level pointers方法提升策略学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07501 2025-12-09 cs.SE cs.AI 62%

AutoICE: Automatically Synthesizing Verifiable C Code via LLM-driven Evolution

AutoICE: 通过LLM驱动的进化自动合成可验证的C代码

Weilin Luo, Xueyi Liang, Haotian Deng, Yanan Liu, Hai Wan

机构 * Sun Yat-sen University, School of Computer Science and Engineering(中山大学计算机科学与工程学院)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 AutoICE通过LLM驱动的进化搜索方法,自动合成可验证的C代码,验证成功率高达90.36%,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01119 2025-12-02 cs.LG cs.AI 62%

World Model Robustness via Surprise Recognition

通过惊喜识别提升世界模型鲁棒性

Geigh Zollicoffer, Tanush Chopra, Mingkuan Yan, Xiaoxu Ma, Kenneth Eaton, Mark Riedl

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 通过惊喜识别提升世界模型在噪声环境下的鲁棒性,增强自动驾驶模拟中智能体的稳定性与性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21877 2025-12-01 cs.SE cs.AI 62%

LLM-Empowered Event-Chain Driven Code Generation for ADAS in SDV systems

基于大语言模型的事件链驱动的ADAS代码生成方法

Nenad Petrovic, Norbert Kroth, Axel Torschmied, Yinglei Song, Fengjunjie Pan, Vahid Zolfaghari, Nils Purschke, Sven Kirchner, Chengdong Wu, Andre Schamschurko, Yi Zhang, Alois Knoll

机构 * Federal Ministry of Research, Technology and Space of Germany(德国联邦研究、技术和空间部)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 本文提出基于事件链驱动和大语言模型的ADAS代码生成方法,通过RAG层提高代码生成的准确性和一致性,无需重新训练大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17853 2025-11-25 cs.SE cs.AI 62%

A Low-Code Methodology for Developing AI Kiosks: a Case Study with the DIZEST Platform

一种低代码方法论用于开发AI信息亭:以DIZEST平台的案例研究

SunMin Moon, Jangwon Gim, Chaerin Kim, Yeeun Kim, YoungJoo Kim, Kang Choi

专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 本文提出了一种基于DIZEST平台的低代码方法论,用于开发AI信息亭,通过案例研究展示了其在提高互操作性和用户体验方面的优势。

Comments 5 pages, 2 figures, conference, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17573 2025-11-25 cs.LG cs.AI cs.CR 62%

Binary BPE: A Family of Cross-Platform Tokenizers for Binary Analysis

二进制BPE:用于二进制分析的跨平台分词器家族

Michael J. Bommarito

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 二进制BPE分词器家族通过跨平台训练,提升二进制分析的上下文效率和压缩效果,适用于恶意软件检测与逆向工程。

Comments 17 pages, 3 figures, 9 tables. Paper source available at https://github.com/mjbommar/binary-tokenizer-paper ; tokenizers available at https://huggingface.co/mjbommar - mjbommar/binary-tokenizer-001-{4k,8k,16k,32k,64k}

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16005 2025-11-21 cs.SE cs.AI 62%

InfCode-C++: Intent-Guided Semantic Retrieval and AST-Structured Search for C++ Issue Resolution

InfCode-C++: 基于意图的语义检索与AST结构化搜索用于C++问题解决

Qingao Dong, Mengfei Wang, Hengzhi Zhang, Zhichao Li, Yuan Yuan, Mu Li, Xiang Gao, Hailong Sun, Chunming Hu, Weifeng Lv

机构 * Beihang University(北航) Beijing Tokfinity Technology Co., Ltd.(北京 Tokfinity 技术有限公司)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 INFCODE-C++ 是首个针对 C++ 的自主系统,通过结合语义代码意图检索和 AST 结构查询,实现端到端的问题解决,其性能显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07071 2025-11-21 q-fin.TR cs.AI cs.LG q-fin.CP 62%

TRADES: Generating Realistic Market Simulations with Diffusion Models

TRADES: 使用扩散模型生成逼真市场模拟

Leonardo Berti, Bardh Prenkaj, Paola Velardi

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 TRADES通过基于变换器的扩散模型生成逼真市场模拟,提升合成数据在金融任务中的应用价值。

Comments 8 pages

Journal ref ECAI 2025. Volume 413: Pages 3703 - 3710

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13972 2025-11-19 cs.SE cs.CL 62%

Show and Tell: Prompt Strategies for Style Control in Multi-Turn LLM Code Generation

Jeremiah Bohr

专题命中 软件智能体 :workflow(abstract);分类 cs.CL、cs.SE

Comments 23 pages, 2 figures, 3 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11933 2025-11-18 cs.CL cs.LG 62%

InData: Towards Secure Multi-Step, Tool-Based Data Analysis

Karthikeyan K, Raghuveer Thirukovalluru, Bhuwan Dhingra, David Edwin Carlson

专题命中 软件智能体 :tool-use(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26546 2025-11-17 cs.SE cs.LG 62%

Towards Verified Code Reasoning by LLMs

Meghana Sistla, Gogul Balakrishnan, Pat Rondon, José Cambronero, Michele Tufano, Satish Chandra

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Google DeepMind(谷歌DeepMind) Google(谷歌) Meta Platforms(元平台)

专题命中 软件智能体 :agent(abstract);分类 cs.LG、cs.SE

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09964 2025-11-14 cs.SE cs.AI cs.PL 62%

EnvTrace: Simulation-Based Semantic Evaluation of LLM Code via Execution Trace Alignment -- Demonstrated at Synchrotron Beamlines

Noah van der Vleuten, Anthony Flores, Shray Mathur, Max Rakitin, Thomas Hopkins, Kevin G. Yager, Esther H. R. Tsai

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06067 2025-11-11 cs.CL cs.SE 62%

Automating Hardware Design and Verification from Architectural Papers via a Neural-Symbolic Graph Framework

Haoyue Yang, Xuanle Zhao, Yujie Liu, Zhuojun Zou, Kailin Lyu, Changchun Zhou, Yao Zhu, Jie Hao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 软件智能体 :workflow(abstract);分类 cs.CL、cs.SE

Comments Preprint Version, Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏