arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-21 至 2026-04-21 共收录 324 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 27 篇

2604.18231 2026-04-21 cs.CR cs.OS 78%

AgenTEE: Confidential LLM Agent Execution on Edge Devices

AgenTEE: 在边缘设备上实现保密大语言模型代理执行

Sina Abdollahi, Mohammad M Maheri, Javad Forough, Amir Al Sadi, Josh Millar, David Kotz, Marios Kogias, Hamed Haddadi

专题命中 工作流自动化 :agent(title,abstract)

AI总结 本文提出AgenTEE系统,通过在边缘设备上部署保密虚拟机实现安全代理管道执行,降低延迟并保护隐私,实验显示其性能接近原生水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18230 2026-04-21 q-bio.QM cond-mat.mtrl-sci cond-mat.soft 78%

ToFiE, a Topology-aware Fiber Extraction workflow for 3D reconstruction of dense and heterogeneous biological fiber networks from microscopy images

ToFiE,一种拓扑感知的纤维提取工作流程,用于从显微图像中重建密集且异质的生物纤维网络

Risa Togo, Sara Cardona, Irène Nagle, Gijsje H. Koenderink, Behrooz Fereidoonnezhad, Mathias Peirlinck

专题命中 工作流自动化 :workflow(title,abstract)

AI总结 本文提出ToFiE工作流程,用于从高分辨率显微图像中重建密集且异质的生物纤维网络,保留三维连接性,通过合成图像和胶原凝胶网络验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17262 2026-04-21 cond-mat.mtrl-sci eess.IV 71%

Unsupervised segmentation and clustering workflow for efficient processing of 4D-STEM and 5D-STEM data

无监督分割与聚类工作流用于高效处理4D-STEM和5D-STEM数据

Serin Lee, Stephanie M. Ribet, Arthur R. C. McCray, Andrew Barnum, Jennifer A. Dionne, Colin Ophus

专题命中 工作流自动化 :workflow(title)

AI总结 本文提出一种无监督分割与聚类方法,用于高效处理4D-STEM和5D-STEM数据,通过局部衍射图案相似性提取闭合轮廓,实现结构一致行为的分割,提升信号质量并压缩数据量,适用于原位液态细胞4D-STEM数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01379 2026-04-21 cs.SE 70%

Multi-LLM Orchestration for High-Quality Code Generation: Exploiting Complementary Model Strengths

多LLM协同生成高质量代码:利用互补模型优势

Huashan Chen, Zhenyu Qi, Haotang Li, Hong Chen, Jinfu Chen, Kebin Peng, In Kee Kim, Kyu Hyung Lee, Sen He, Weiyi Shang

专题命中 工作流自动化 :agent(abstract);multi-agent(abstract);分类 cs.SE

AI总结 本文提出PerfOrch系统,通过分阶段、分类别的多模型协作提升代码生成质量,利用Memory模块选择最适合的模型,实现高准确率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18468 2026-04-21 cs.CV cs.AI cs.GR cs.LG 62%

Asset Harvester: Extracting 3D Assets from Autonomous Driving Logs for Simulation

资产收割者:从自动驾驶日志中提取3D资产用于模拟

Tianshi Cao, Jiawei Ren, Yuxuan Zhang, Jaewoo Seo, Jiahui Huang, Shikhar Solanki, Haotian Zhang, Mingfei Guo, Haithem Turki, Muxingzi Li, Yue Zhu, Sipeng Zhang, Zan Gojcic, Sanja Fidler, Kangxue Yin

机构 * NVIDIA

专题命中 工作流自动化 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Asset Harvester,通过图像到3D模型的端到端流程,将稀疏的现实日志中物体观测转换为完整的模拟资产,结合大规模数据整理、几何感知预处理和鲁棒训练方案,解决自动驾驶数据中的稀疏视角等挑战。

Comments NVIDIA white paper. The project page: https://research.nvidia.com/labs/sil/projects/asset-harvester/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06812 2026-04-21 cs.AI cs.CY cs.LG 62%

Generative midtended cognition and Artificial Intelligence. Thinging with thinging things

生成性中介认知与人工智能。思考与思考之物

Xabier E. Barandiaran, Marta Pérez-Verdugo

机构 * IAS-Research Centre for Life, Mind and Society, Dept. Philosophy, UPV/EHU, University of the Basque Country, Donostia, Gipuzkoa (Spain)(生命、心智与社会研究中心,哲学系,巴斯克大学,Donostia, Gipuzkoa (西班牙))

专题命中 工作流自动化 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨生成性中介认知概念,分析生成AI与人类认知的结合,提出该认知类型更接近社会认知而非传统扩展认知,并定义了生成性中介认知的两个维度:宽度和深度。

Comments 16 pages, 2 figures. Post-print of article published in Synthese. The final published version is available open access at https://doi.org/10.1007/s11229-025-04961-4

Journal ref Synthese 205 (2025) 137

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03122 2026-04-21 cond-mat.mtrl-sci cs.AI cs.LG 62%

EGMOF: Efficient Generation of Metal-Organic Frameworks Using a Hybrid Diffusion-Transformer Architecture

EGMOF:一种高效生成金属有机框架的混合扩散-Transformer架构

Seunghee Han, Yeonghun Kang, Taeun Bae, Junho Kim, Younghun Kim, Varinia Bernales, Alan Aspuru-Guzik, Jihan Kim

机构 * Department of Chemical and Biomolecular Engineering, Korea Advanced Institute of Science and Technology(韩国科学技术院化学与生物分子工程系) Department of Chemistry, University of Toronto(多伦多大学化学系) Vector Institute for Artificial Intelligence(人工智能矢量研究所) Department of Chemistry, Sungkyunkwan University(成均馆大学化学系) Acceleration Consortium(加速联盟) Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Department of Materials Science & Engineering, University of Toronto(多伦多大学材料科学与工程系) Department of Chemical Engineering & Applied Chemistry, University of Toronto(多伦多大学化学工程与应用化学系) Canadian Institute for Advanced Research (CIFAR)(加拿大高级研究 institute (CIFAR)) NVIDIA

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 EGMOF通过模块化流程实现高效MOF逆向设计,利用扩散模型与Transformer模型生成结构,仅需1000个训练样本即取得显著提升,适用于多种属性数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18085 2026-04-21 cs.LG 61%

Predicting LLM Compression Degradation from Spectral Statistics

从谱统计预测大语言模型压缩退化

Mingxue Xu

机构 * Department of Electrical and Electronic Engineering, Imperial College London(帝国理工学院伦敦分校电子与电气工程系)

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG;agentic(comments)

AI总结 本文通过分析四种低秩压缩方法,发现稳定秩和信息密度主导性能退化,提出γ·ρ_s交互项作为准确度退化的预测指标,实现了高相关性验证。

Comments Profoundly assisted by agentic AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18152 2026-04-21 stat.ML cs.LG 57%

mlr3torch: A Deep Learning Framework in R based on mlr3 and torch

mlr3torch: 基于mlr3和torch的深度学习框架

Sebastian Fischer, Lukas Burk, Carson Zhang, Bernd Bischl, Martin Binder

机构 * LMU Munich(慕尼黑莱布尼茨大学) MCML(预防研究与流行病学研究所) Leibniz Institute for Prevention Research and Epidemiology - BIPS(预防研究与流行病学研究所) University of Bremen(布伦瑞大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG

AI总结 本文介绍mlr3torch框架,基于mlr3生态系统构建,简化了神经网络的定义、训练和评估,支持表格数据和通用张量,提供预定义架构和图形化建模流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18131 2026-04-21 cs.AI 57%

Training LLM Agents for Spontaneous, Reward-Free Self-Evolution via World Knowledge Exploration

通过世界知识探索训练具有自发、无奖励自我进化的LLM代理

Qifan Zhang, Dongyang Ma, Tianqing Fang, Jia Li, Jing Tang, Nuo Chen, Haitao Mi, Yan Wang

机构 * Tencent(腾讯) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 工作流自动化 :agent(abstract);分类 cs.AI

AI总结 本文提出一种无需外部监督的LLM代理自我进化方法,通过世界知识探索提升任务成功率,实验表明在WebVoyager和WebWalker上性能提升20%,并使紧凑型Qwen3模型超越Gemini-2.5-Flash。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17870 2026-04-21 cs.CL 57%

GraSP: Graph-Structured Skill Compositions for LLM Agents

GraSP:用于LLM代理的图结构技能组合

Tianle Xia, Lingxiang Hu, Yiding Sun, Ming Xu, Lan Xu, Siying Wang, Wei Xu, Jie Jiang

机构 * Tencent(腾讯)

专题命中 工作流自动化 :agent(abstract);分类 cs.CL

AI总结 本文提出GraSP,一种可执行技能图架构,通过引入编译层提升LLM代理技能编排效率,通过五种类型操作符将扁平技能集转化为带前提-效应边的有向无环图,提升任务完成效率和奖励。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21804 2026-04-21 cs.LG physics.flu-dyn 57%

XRePIT: A deep learning-computational fluid dynamics hybrid framework implemented in OpenFOAM for fast, robust, and scalable unsteady simulations

XRePIT:一种基于深度学习与计算流体动力学的混合框架,用于在OpenFOAM中实现快速、稳健且可扩展的非稳态模拟

Shilaj Baral, Youngkyu Lee, Sangam Khanal, Joongoo Jeon

机构 * Division of Advanced Nuclear Engineering, Pohang University of Science and Technology(浦项国立科学技术大学先进核工程系) Division of Applied Mathematics, Brown University(布朗大学应用数学系) Graduate School of Integrated Energy-AI, Jeonbuk National University(全北国立大学整合能源-人工智能研究生院)

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG

AI总结 本文提出基于OpenFOAM的XRePIT混合框架,通过自动工作流实现神经代理与传统求解器的稳定耦合,提升非稳态模拟的效率与鲁棒性,实验表明其在3D浮力驱动流中能实现2.91倍的加速率,同时保持误差在O(1E-03)以内。

Journal ref 10.1016/j.compfluid.2026.107075

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16649 2026-04-21 cs.LG 57%

FLARE: A Data-Efficient Surrogate for Predicting Displacement Fields in Directed Energy Deposition

FLARE:一种数据高效的替代模型,用于预测定向能量沉积中的位移场

Kittipong Thiamchaiboonthawee, Ghadi Nehme, Ram Mohan Telikicherla, Jiawei Tian, Balaji Jayaraman, Vikas Chandan, Dhanushkodi Mariappan, Faez Ahmed

机构 * Massachusetts Institute of Technology(麻省理工学院) GE Vernova Advanced Research Center(GE Vernova先进研究中心)

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG

AI总结 本文提出FLARE模型,通过线性仿射重建在权重空间中高效预测定向能量沉积的位移场,提升了设计迭代和工艺优化中的准确性。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16343 2026-04-21 cs.HC cs.AI 57%

Elder-Sim: A Psychometrically Validated Platform for Personality-Stable Elderly Digital Twins

Elder-Sim:一种经过心理测量学验证的用于构建性格稳定的老年人数字孪生平台

Jiaqing Wang, Zhongfang Yang, Xingyuan Zhu, Zong'an Huang, Hao Wang, Li Tian, Ying Cao, Xiaomin Qu, Xiang Qi, Bei Wu, Zheng Zhu

机构 * Yulin AI-Enhanced HealthCare Lab(云林人工智能增强医疗实验室) School of Nursing, Fudan University(复旦大学护理学院) School of Nursing, Medical College of Soochow University(苏州大学医学院护理学院) School of Nursing, Dali University(大理大学护理学院) Department of Advanced Interdisciplinary Studies, The University of Tokyo(东京大学先进跨学科研究部) The First Affiliated Hospital of Soochow University(苏州大学第一附属医院) Department of Nursing, The First Affiliated Hospital, Jiangxi Medical College, Nanchang University(江西医学院护理部,南昌大学第一附属医院) School of Social Development, East China University of Political Science and Law(中国政法大学社会发展学院) Rory Meyers College of Nursing, New York University(纽约大学 Rory Meyers 护理学院) New York University Shanghai(纽约大学上海校区)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI

AI总结 本文提出Elder-Sim平台,通过心理测量学验证方法构建性格稳定的老年人数字孪生代理,利用认知概念化图和LoRA微调提升性格一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.09771 2026-04-21 cs.CY cs.GL 56%

Automation and AI Technology in Surface Mining With a Brief Introduction to Open-Pit Operations in the Pilbara

表面采矿中的自动化与人工智能技术及皮尔巴拉露天采矿简介

Raymond Leung, Andrew J Hill, Arman Melkumyan

专题命中 工作流自动化 :planning(abstract,comments)

AI总结 本文综述了采矿行业,特别是西澳皮尔巴拉铁矿区在工程问题、技术创新、机器人开发和自动化方面的挑战与进展,旨在展示技术现状并提高工程界对采矿中AI和自动化趋势的认识。

Comments Accepted manuscript. Paper provides insights on state-of-the-art technologies and future trends. Keywords: Mining automation, robotics, intelligent systems, machine learning, remote sensing, geostatistics, planning, scheduling, optimization, modelling, geology, complex systems. Document: 21 pages, 6 figures, 2 tables. 2024 Update: Added ICRA conference poster + slides as ancilliary files

Journal ref IEEE Robotics & Automation Magazine 32:3 (2025) 164-183

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17618 2026-04-21 physics.optics physics.ed-ph physics.soc-ph 50%

From Flat-Optics Concept to Qualified Hardware: Skills Map for the Meta-Optics and Diffractive Optics Workforce

从平面光学概念到合格硬件:元光学和衍射光学工作队伍技能图谱

Ingrid Torres, Alex Krasnok

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出一个阶段-闸门工作流程,通过紧凑的技术检查、实例设备和基于artifact的技能图谱,帮助工作队伍减少冗余设计循环,使性能声明可审计,并明确学生、教师和雇主应能产出、审查和批准的内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01032 2026-04-21 cs.CV 50%

Sub-metre Lunar DEM Generation and Validation from Chandrayaan-2 OHRC Multi-View Imagery Using an Open-Source Pipeline

基于Chandrayaan-2 OHRC多视角影像的亚米级月球数字高程模型生成与验证:一种开源流程

Aaranay Aadi, Jai Singla, Nitant Dube, Oleg Alexandrov

机构 * School of Computer Science and Engineering Manipal University(曼海姆大学计算机科学与工程学院) Space Applications Centre (SAC) Indian Space Research Organisation (ISRO)(空间应用中心(SAC)印度空间研究组织(ISRO)) Intelligent Robotics Group NASA Ames Research Center(智能机器人小组美国国家航空航天局阿姆斯研究中心)

专题命中 工作流自动化 :planning(abstract)

AI总结 本文首次利用开源流程从Chandrayaan-2 OHRC多视角影像生成亚米级月球DEM,通过几何分析和三角测量生成点云并验证其精度,达到亚米级分辨率。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16903 2026-04-21 cs.RO 50%

Leveraging VR Robot Games to Facilitate Data Collection for Embodied Intelligence Tasks

利用VR机器人游戏促进具身体验任务的数据收集

Yihan Zhang, Ziyun Huang, Linqi Ye

机构 * School of Computer Engineering and Science, Shanghai University(上海大学计算机工程与科学学院) School of Future Technology, Shanghai University(上海大学未来技术学院)

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出基于Unity的VR数据收集框架,通过虚拟环境游戏化实现高效的数据采集,验证了其在具身体验任务中的有效性与扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16827 2026-04-21 cs.CR 50%

ParikkhaChain: Blockchain-Based Result Processing and Privacy-Preserving Academic Record Management for the Complete Examination Lifecycle

ParikkhaChain: 基于区块链的考试结果处理与隐私保护的学术记录管理:完整考试生命周期

Rabib Jahin Ibn Momin, Ahmed Mahir Sultan Rumi, Rezwana Reaz

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出ParikkhaChain,通过区块链框架实现完整考试生命周期管理,包括匿名评分、透明评估流程和隐私保护验证,解决了传统考试系统中的身份偏见和透明度问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 16 篇

2604.17464 2026-04-21 cs.SE cs.AI 86%

Project Prometheus: Bridging the Intent Gap in Agentic Program Repair via Reverse-Engineered Executable Specifications

普罗米修斯计划:通过反向工程可执行规范弥合代理程序修复中的意图差距

Yongchao Wang, Zhiqiu Huang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出普罗米修斯框架,通过规范推断而非代码生成解决代理程序修复中的意图差距问题,实现了93.97%的正确补丁率和74.4%的救援率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17288 2026-04-21 cs.AR cs.AI 83%

Clover: A Neural-Symbolic Agentic Harness with Stochastic Tree-of-Thoughts for Verified RTL Repair

Clover:一种基于随机树-of-thoughts的神经符号代理体系用于验证RTL修复

Zizhang Luo, Yansong Xu, Runlin Guo, Fan Cui, Kexing Zhou, Mile Xia, Hongyuan Hou, Yuhao Luo, Yun Liang

机构 * Peking University(北京大学)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 Clover通过结构化搜索代码操作解决RTL修复问题,结合LLM和符号求解器动态调度任务,实现高可靠性修复,修复率高达96.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19555 2026-04-21 cs.CR cs.AI 83%

SOK: A Taxonomy of Attack Vectors and Defense Strategies for Agentic Supply Chain Runtime

SOK:代理供应链运行时的攻击向量和防御策略分类

Xiaochong Jiang, Shiqi Yang, Wenting Yang, Yichen Liu, Cheng Ji

机构 * Independent Researcher(独立研究者)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文系统化了现有研究,提出统一的运行时框架,区分数据和工具供应链攻击,并识别出病毒代理循环现象,主张采用零信任运行时架构。

Comments Published at ICLR 2026 Workshop on AI for Mechanism Design and Strategic Decision Making

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16520 2026-04-21 cs.HC 82%

AgentClick: A Skill-Based Human-in-the-Loop Review Layer for Terminal AI Agents

AgentClick: 一个基于技能的人机协作审查层用于终端AI代理

Haomin Zhuang, Hanwen Xing, Xiangliang Zhang

专题命中 软件智能体 :AI agent(title,abstract);agent(abstract)

AI总结 AgentClick通过浏览器界面提供结构化交互,降低非专家用户与AI代理协作的门槛,提升效率和质量。

Comments Accepted to ACM CAIS 2026 System Demonstrations. Conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16314 2026-04-21 cs.SE 79%

Software Self-Extension with SelfEvolve: an Agentic Architecture for Runtime Code Generation

软件自我扩展与SelfEvolve:一种用于运行时代码生成的代理架构

Md Asif Iqbal Fahim, Oluwadamilola Adebayo, Alessio Ferrari

专题命中 软件智能体 :agentic(title,abstract);分类 cs.SE

AI总结 本文提出SelfEvolve架构,通过自主生成和整合新功能实现运行时自我扩展,展示其在11个任务中达到92.7%的准确率,优于现有基线方法。

Comments 6 pages, 1 figure, accepted at 21st International Conference on Software Engineering for Adaptive and Self-Managing Systems, April 13--14, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16584 2026-04-21 cs.SE cs.AI cs.PL 79%

Certified Program Synthesis with a Multi-Modal Verifier

带有多模验证器的认证程序合成

Yueyang Feng, Dipesh Kafle, Vladimir Gladshtein, Vitaly Kurin, George Pîrlea, Qiyuan Zhao, Peter Müller, Ilya Sergey

机构 * National University of Singapore(新加坡国立大学) Neapolis University Pafos(纳皮奥斯大学帕福斯)

专题命中 软件智能体 :agentic(abstract,abstract_cn);workflow(abstract);分类 cs.AI、cs.SE

AI总结 本文提出LeetProof,通过多模验证器解决认证程序合成中的规范缺陷和验证模式碎片化问题,实现更高效的全认证解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16021 2026-04-21 cs.SE cs.AI 73%

Neurosymbolic Repo-level Code Localization

神经符号层面的代码定位

Xiufeng Xu, Xiufeng Wu, Zejun Zhang, Yi Li

机构 * Nanyang Technological University(南洋理工大学)

专题命中 软件智能体 :workflow(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文提出KA-LCL问题,引入KA-LogicQuery基准测试,展示现有方法在无命名提示下的性能下降,提出LogicLoc框架结合LLM和Datalog实现精确代码定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17364 2026-04-21 cs.AI cs.MA cs.PL 70%

LLM-Guided Strategy Synthesis for Scalable Equality Saturation

基于大型语言模型的策略合成用于可扩展的等式饱和

Chenyun Yin, Youwei Xiao, Yuze Luo, Yuyang Zou, Yun Liang

机构 * Peking University(北京大学) School of Integrated Circuits(集成电路学院)

专题命中 软件智能体 :workflow(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出EggMind框架,通过领域特定语言EqSatL和LLM引导的代理工作流,高效合成可重用的等式饱和策略,提升资源质量平衡,减少成本和内存消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17795 2026-04-21 cs.CL cs.AI cs.LG cs.MA cs.SE 70%

What Makes AI Research Replicable? Executable Knowledge Graphs as Scientific Knowledge Representations

什么使AI研究可重复?可执行知识图谱作为科学知识表示

Yujie Luo, Zhuoyun Yu, Xuehai Wang, Yuqi Zhu, Ningyu Zhang, Lanning Wei, Lun Du, Da Zheng, Huajun Chen

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(知识图谱联合实验室)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出可执行知识图谱(xKG),通过整合文献中的代码片段和技术洞察,提升AI研究的可重复性,实验显示其在PaperBench上性能提升显著。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16790 2026-04-21 cs.SE cs.AI 62%

Bias in the Loop: Auditing LLM-as-a-Judge for Software Engineering

循环中的偏见:用于软件工程的LLM作为评判者的审计

Zixiao Zhao, Amirreza Esmaeili, Fatemeh Fard

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文研究了LLM作为评判者在代码评估中的偏见问题,通过测量优先的方法分析了代码生成、修复和测试生成任务中的评判制度,并发现提示偏见显著影响评判结果,甚至改变任务结论和模型排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15220 2026-04-21 cs.CL 57%

Privacy Collapse: Benign Fine-Tuning Can Break Contextual Privacy in Language Models

隐私崩溃:良性微调可能在语言模型中破坏上下文隐私

Anmol Goel, Cornelius Emde, Sangdoo Yun, Seong Joon Oh, Martin Gubri

机构 * Parameter Lab(参数实验室) TU Darmstadt(图腾达姆斯塔特大学) University of Oxford(牛津大学) NAVER AI Lab(NAVER AI实验室) University of Tübingen(图宾根大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.CL

AI总结 研究发现语言模型在良性微调过程中可能因训练数据中的细微模式导致上下文隐私崩溃,揭示了当前安全评估在专用代理部署中的关键缺口。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏