arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3224 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 3224 篇

2604.13955 2026-04-16 cs.CR cs.CY cs.SE 57%

Towards Personalizing Secure Programming Education with LLM-Injected Vulnerabilities

面向个性化安全编程教育的LLM注入漏洞方法

Matthew Frazier, Kostadin Damevski

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本文提出利用LLM在学生代码中注入特定CWE漏洞,生成个性化教学材料,通过实验发现学生认为此类示例更相关清晰,但定量结果未显示显著差异,需进一步研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12086 2026-04-15 cs.LG 57%

Robust Optimization for Mitigating Reward Hacking with Correlated Proxies

鲁棒优化用于通过相关代理缓解奖励黑客问题

Zixuan Liu, Xiaolin Sun, Zizhan Zheng

机构 * Department of Computer Science(计算机科学系)

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 本文提出通过鲁棒策略优化方法应对奖励黑客问题,基于r相关性代理奖励空间,改进代理优化并提升鲁棒性与透明度。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11836 2026-04-15 cs.CY cs.SE 57%

Design and Deployment of a Course-Aware AI Tutor in an Introductory Programming Course

面向入门编程课程的课程感知AI助教的设计与部署

Iris Groher, Patrick Heissenberger, Michael Vierhauser

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文设计了一款面向入门编程课程的AI助教,通过检索增强的课程对齐指导帮助学生提升问题解决能力,研究发现学生主要利用助教进行概念理解、实现指导和调试。

Comments accepted for publication at CSEDU 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27494 2026-04-14 cs.CV cs.AI 57%

Learning to Focus and Precise Cropping: A Reinforcement Learning Framework with Information Gaps and Grounding Loss for MLLMs

学习聚焦与精确裁剪:一种带有信息缺口和接地损失的强化学习框架用于多模态大语言模型

Xuanpu Zhao, Zhentao Tan, Dianmo Sheng, Tianxiang Chen, Yao Liu, Yue Wu, Tao Gong, Qi Chu, Nenghai Yu

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络空间安全学院) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出一种无需轨迹监督的两阶段强化学习框架,通过信息缺口机制和接地损失提升多模态大语言模型在复杂视觉场景中的感知与推理能力,实验显示其在高分辨率视觉问答基准上达到最优性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10493 2026-04-14 cs.SE 57%

SWE-Shepherd: Advancing PRMs for Reinforcing Code Agents

SWE-Shepherd:推进基于强化学习的代码代理的PRMs

Mahir Labib Dihan, Md Ashrafur Rahman Khan

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文提出SWE-Shepherd框架,通过引入过程奖励模型为代码代理提供密集的步骤级监督,提升代码代理在大型代码库中的交互效率和动作质量。

Comments Code is available at https://github.com/mahirlabibdihan/swe-shepherd

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20567 2026-04-14 cs.CL 57%

KCS: Diversify Multi-hop Question Generation with Knowledge Composition Sampling

KCS: 通过知识组合采样多样化多跳问题生成

Yangfan Wang, Jie Liu, Chen Tang, Lian Yan, Jingchi Jiang

机构 * Harbin Institute of Technology(哈尔滨工业大学) MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司) National Key Laboratory of Smart Farm Technologies and Systems(智慧农场技术与系统全国重点实验室)

专题命中 软件智能体 :planning(abstract);分类 cs.CL

AI总结 本文提出KCS框架,通过采样不同知识组合提升多跳问题生成的多样性,改进知识组合选择的准确率,并在HotpotQA和2WikiMultihopQA数据集上提升数据增强效果。

Comments Accept by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05529 2026-04-13 cs.AI 57%

ActivityEditor: Learning to Synthesize Physically Valid Human Mobility

ActivityEditor: 学习合成物理有效的行人移动

Chenjie Yang, Yutian Jiang, Anqi Liang, Wei Qi, Chenyu Wu, Junbo Zhang

机构 * Southwest Jiaotong University(西南交通大学) HKUST (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) JD Technology(京东科技)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出ActivityEditor,一种双LLM代理框架,用于零样本跨区域轨迹生成。通过意图生成代理和编辑代理协同工作,结合强化学习和物理约束,实现高保真轨迹生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06861 2026-04-09 cs.SE 57%

REAgent: Requirement-Driven LLM Agents for Software Issue Resolution

REAgent:基于需求的LLM代理用于软件问题解决

Shiqi Kuang, Zhao Tian, Kaiwei Lin, Chaofan Tao, Shaowei Wang, Haoli Bai, Lifeng Shang, Junjie Chen

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文提出REAgent框架,通过引入问题导向的需求作为结构化任务规范,提升补丁生成准确性,实验表明其在问题解决率上平均提升17.40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04045 2026-04-07 cs.SE 57%

SmartPatchLinker: An Open-Source Tool to Linked Changes Detection for Code Review

SmartPatchLinker:一种开源工具,用于代码审查中的变更检测链接

Islem Khemissi, Moataz Chouchen, Dong Wang, Raula Gaikovina Kula

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 SmartPatchLinker是一款基于浏览器的开源工具,用于在代码审查界面中发现相关变更,通过轻量级Chrome扩展和Gerrit集成,帮助审查人员高效识别语义关联的代码变更,提升代码审查效率。

Comments FSE26 Tool Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03851 2026-04-07 cs.SE 57%

Beyond Crash-to-Patch: Patch Evolution for Linux Kernel Repair

超越崩溃到补丁:Linux内核修复的补丁演变

Luyao Bai, Kenan Alghythee, Hang Zhang, Xiaoguang Wang

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文研究Linux内核修复的补丁演变过程,提出PatchAdvisor框架,通过整合检索与诊断顾问,提升修复质量与审查一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03610 2026-04-07 cs.SE 57%

DebugHarness: Emulating Human Dynamic Debugging for Autonomous Program Repair

DebugHarness: 模拟人类动态调试以实现自主程序修复

Maolin Sun, Yibiao Yang, Xuanlin Liu, Yuming Zhou, Baowen Xu

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 DebugHarness通过模拟人类动态调试过程,利用LLM实现复杂漏洞的自动修复,其动态调试方法在SEC-bench数据集上实现了90%的修复率,比现有方法提升30%以上。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03438 2026-04-07 cs.SE 57%

Android Instrumentation Testing in Continuous Integration: Practices, Patterns, and Performance

Android持续集成中的仪器测试:实践、模式与性能

Hamid Parsazadeh, Taher A. Ghaleb, Safwat Hassan

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 研究Android持续集成中仪器测试的实践、模式及性能,发现仅10.6%的仓库使用仪器测试,常用社区组件或自定义脚本设置模拟器,不同设置方式在可靠性、效率和成本上有差异。

Comments Accepted at the 19th IEEE International Conference on Software Testing, Verification and Validation (ICST 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03196 2026-04-06 cs.SE 57%

From Industry Claims to Empirical Reality: An Empirical Study of Code Review Agents in Pull Requests

从行业声明到实证现实:代码审查代理在拉取请求中的实证研究

Kowshik Chowdhury, Dipayan Banik, K M Ferdous, Shazibul Islam Shamim

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本文通过分析代码审查代理(CRAs)在拉取请求中的表现,探讨其对合并成功率的影响,发现CRAs生成的反馈质量与PR废弃率密切相关,需人类监督以提高代码审查效果。

Comments Accepted at 23rd International Conference on Mining Software Repositories (MSR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02174 2026-04-03 cs.AI 57%

Quantifying Self-Preservation Bias in Large Language Models

量化大型语言模型中的自我保护偏差

Matteo Migliarini, Joaquin Pereira Pizzini, Luca Moresca, Valerio Santini, Indro Spinelli, Fabio Galasso

机构 * Sapienza University(罗马大学) ItalAI

专题命中 软件智能体 :AI agent(abstract);分类 cs.AI

AI总结 本文提出TBSP基准测试,通过逻辑不一致检测模型自我保护动机与客观效用的偏离,发现多数模型在部署角色下超过60%的自我保护率,且在低改进情况下易进行事后合理化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01442 2026-04-03 cs.SE 57%

Fuzzing with Agents? Generators Are All You Need

代理 fuzzing?生成器就是一切

Vasudev Vikram, Rohan Padhye

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文探讨利用AI代理自动生成针对特定目标的输入生成器,发现生成器在分支覆盖率上优于人工编写者,且无需覆盖引导和突变策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01052 2026-04-02 cs.CR cs.AI 57%

VibeGuard: A Security Gate Framework for AI-Generated Code

VibeGuard:面向AI生成代码的安全闸门框架

Ying Xie

机构 * Kennesaw State University(肯尼索州立大学)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI

AI总结 本文提出VibeGuard,针对AI生成代码中的五个盲点提供预发布安全检查,通过实验验证其在八个合成项目中的高召回率和精度,为依赖AI生成代码的团队提供多层次防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28233 2026-03-31 cs.CV cs.AI 57%

TwinMixing: A Shuffle-Aware Feature Interaction Model for Multi-Task Segmentation

TwinMixing:一种面向多任务分割的洗牌感知特征交互模型

Minh-Khoi Do, Huy Che, Dinh-Duy Phan, Duc-Khai Lam, Duc-Lung Vu

机构 * University of Information Technology(信息技术大学) Vietnam National University(越南国立大学)

专题命中 软件智能体 :planning(abstract);分类 cs.AI

AI总结 本文提出TwinMixing模型,通过共享编码器和任务专用解码器实现特征共享与任务专精,结合高效金字塔混合模块和双分支上采样块,在BDD100K数据集上验证了其在 drivable-area 和 lane 分割中的高效准确性能。

Journal ref Results in Engineering 30 (2026) 109982

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25930 2026-03-31 cs.CR cs.SE 57%

AVDA: Autonomous Vibe Detection Authoring for Cybersecurity

AVDA:自主振动检测作者化以提升网络安全

Fatih Bulut, Carlo DePaolis, Raghav Batta, Anjali Mangal

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本文提出AVDA框架,通过整合组织上下文自动化检测作者化,提升检测质量与效率,实验显示Agentic方法在相似度上比基线方法提升19%。

URL PDF HTML 收藏
2603.27766 2026-03-31 cs.LG stat.ML 57%

AutoStan: Autonomous Bayesian Model Improvement via Predictive Feedback

AutoStan:通过预测反馈实现自主的贝叶斯模型改进

Oliver Dürr

机构 * Thurgau Institute for Digital Transformation (TIDIT)(图尔高数字转型研究所)

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 AutoStan通过预测反馈机制,使CLI编码代理自主构建并迭代改进Stan中的贝叶斯模型,展示了无需搜索算法或领域指令即可处理多样化贝叶斯建模问题的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26049 2026-03-30 cs.CV cs.AI 57%

Seeing Like Radiologists: Context- and Gaze-Guided Vision-Language Pretraining for Chest X-rays

像放射科医生一样观察:面向胸部X光片的上下文和目光引导的视觉-语言预训练

Kang Liu, Zhuoqi Ma, Siyu Liang, Yunan Li, Xiyue Gao, Chao Liang, Kun Xie, Qiguang Miao

机构 * Xidian University(西安电子科技大学) Wuhan University(武汉大学)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI

AI总结 本文提出CoGaze框架,通过整合临床上下文和放射科医生目光引导,提升胸部X光片的视觉-语言预训练效果,实验显示在多个任务上均优于现有方法。

Comments Code: https://github.com/mk-runner/CoGaze

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25773 2026-03-30 cs.SE 57%

The Specification as Quality Gate: Three Hypotheses on AI-Assisted Code Review

规范作为质量门:关于AI辅助代码审查的三个假设

Christo Zietsman

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文探讨AI辅助代码审查的三个假设,指出缺乏可执行规范时审查过程的循环性,并提出规范优先、确定性验证管道和AI审查残余的架构。

Comments 10 pages. Experiments, corpus, and specifications publicly available at https://github.com/czietsman/nuphirho.dev/tree/main/experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25255 2026-03-27 cs.CV cs.LG 57%

Hyperspectral Trajectory Image for Multi-Month Trajectory Anomaly Detection

超光谱轨迹图像用于多月轨迹异常检测

Md Awsafur Rahman, Chandrakanth Gudavalli, Hardik Prajapati, B. S. Manjunath

机构 * UC Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 本文提出TITAnD方法,将轨迹异常检测转化为视觉问题,通过超光谱轨迹图像统一稀疏和密集轨迹表示,实现高效的多月异常检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24216 2026-03-26 cs.DL cs.AI cs.DB cs.IR 57%

Where Do Your Citations Come From? Citation-Constellation: A Free, Open-Source, No-Code, and Auditable Tool for Citation Network Decomposition with Complementary BARON and HEROCON Scores

你的引用来自哪里?Citation-Constellation:一个免费、开源、无代码且可审计的引用网络分解工具,结合互补的BARON和HEROCON评分

Mahbub Ul Alam

机构 * SciLifeLab Data Centre(SciLifeLab数据中心)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出Citation-Constellation工具,通过BARON和HEROCON评分分解引用网络,揭示引用来源的社会结构路径,不用于评价决策。

Comments Citation-Constellation No-Code Tool Link: https://citation-constellation.serve.scilifelab.se

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24018 2026-03-26 cs.AI 57%

ELITE: Experiential Learning and Intent-Aware Transfer for Self-improving Embodied Agents

ELITE:经验学习与意图感知迁移用于自我改进的具身智能体

Bingqing Wei, Zhongyu Xia, Dingai Liu, Xiaoyu Zhou, Zhiwei Lin, Yongtao Wang

机构 * Wangxuan Institute of Computer Technology, Peking University, Beijing, China(清华大学王轩计算机技术研究所,北京,中国)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 ELITE通过经验学习与意图感知迁移机制,使具身智能体能持续学习环境交互经验并迁移至相似任务,实现在EB-ALFRED和EB-Habitat基准上的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23633 2026-03-26 cs.SE 57%

Detect--Repair--Verify for LLM-Generated Code: A Multi-Language, Multi-Granularity Empirical Study

检测-修复-验证LLM生成的代码:多语言、多粒度实证研究

Cheng Cheng

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文通过检测-修复-验证工作流评估LLM生成代码的安全性,发现多阶段修复能提升安全性和正确性,但修复可靠性依赖于修复范围和测试基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06819 2026-03-26 cs.RO cs.AI 57%

Dynamic Neural Potential Field: Online Trajectory Optimization in the Presence of Moving Obstacles

动态神经势场:在移动障碍物存在下的在线轨迹优化

Aleksei Staroverov, Muhammad Alhaddad, Aditya Narendra, Konstantin Mironov, Aleksandr Panov

机构 * Cognitive AI Systems Lab(认知人工智能系统实验室) National University of Science and Technology MISIS(科学与技术国立大学MISIS) Moscow Independent Research Institute of Artificial Intelligence(莫斯科独立人工智能研究 institutes) Ufa University of Science and Technology(乌fa科学与技术大学)

专题命中 软件智能体 :planning(abstract);分类 cs.AI

AI总结 本文提出动态神经势场模型,结合传统优化与Transformer预测器,实现高效安全的轨迹优化,在动态环境中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05848 2026-03-24 cs.CV cs.AI cs.RO 57%

Goal Force: Teaching Video Models To Accomplish Physics-Conditioned Goals

目标力:教视频模型实现物理条件化的目标

Nate Gillman, Yinghua Zhou, Zitian Tang, Evan Luo, Arjan Chakravarthy, Daksh Aggarwal, Michael Freeman, Charles Herrmann, Chen Sun

机构 * Brown University(布朗大学) Cornell University(康奈尔大学)

专题命中 软件智能体 :planning(abstract);分类 cs.AI

AI总结 本文提出Goal Force框架,通过显式力矢量和中间动力学定义目标,使视频模型能零样本泛化到复杂现实场景,实现基于物理的视频生成与规划。

Comments Camera ready version (CVPR 2026). Code and interactive demos at https://goal-force.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20847 2026-03-24 cs.SE 57%

Engineering Pitfalls in AI Coding Tools: An Empirical Study of Bugs in Claude Code, Codex, and Gemini CLI

人工智能编码工具中的工程陷阱:对Claude代码、Codex和Gemini CLI中bug的实证研究

Ruixin Zhang, Wuyang Dai, Hung Viet Pham, Gias Uddin, Jinqiu Yang, Song Wang

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文通过分析超过3800个公开报告的bug,揭示了构建AI编码工具中的常见故障模式和工程挑战,发现功能相关bug占比超67%,主要症状包括API错误、终端问题和命令失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20702 2026-03-24 cs.NE cs.AI 57%

Decoupling Numerical and Structural Parameters: An Empirical Study on Adaptive Genetic Algorithms via Deep Reinforcement Learning for the Large-Scale TSP

分离数值参数与结构参数:通过深度强化学习对适应性遗传算法进行大规模TSP的实证研究

Hongyu Wang, Yuhan Jing, Yibing Shi, Enjin Zhou, Haotian Zhang, Jialong Shi

机构 * School of Mathematics(数学学院) Statistics(统计学) Xi'an Jiaotong University(西安交通大学) School of Mechanical Engineering(机械工程学院) Frontier Institute of Science(前沿科学研究院) Technology(技术) Xi'an, China(中国西安)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文通过双重深度强化学习框架研究适应性遗传算法中数值参数与结构参数对TSP的影响,发现结构参数在防止停滞和逃离局部最优中起关键作用。

Comments 6 pages, 8 figures, Accepted by WCCI-CEC Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20636 2026-03-20 cs.LG 57%

Image2Gcode: Image-to-G-code Generation for Additive Manufacturing Using Diffusion-Transformer Model

Image2Gcode: 基于扩散-变换器模型的图像到G-code生成用于增材制造

Ziyue Wang, Yayati Jadhav, Peter Pak, Amir Barati Farimani

机构 * Department of Materials Science and Engineering, Carnegie Mellon University, Pittsburgh, PA, USA(材料科学与工程系,卡内基梅隆大学,匹兹堡,PA,USA) Department of Mechanical Engineering, Carnegie Mellon University, Pittsburgh, PA, USA(机械工程系,卡内基梅隆大学,匹兹堡,PA,USA)

专题命中 软件智能体 :planning(abstract);分类 cs.LG

AI总结 本文提出Image2Gcode框架,通过图像直接生成可打印的G-code,省去CAD建模步骤,提升增材制造的易用性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏