arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 6842 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 497 篇

2607.21656 2026-07-27 cs.SE cs.AI 新提交 66%

Cross-Model LLM Code Review: Should you use Claude to review Codex or vice versa?

跨模型大语言模型代码审查:应该用Claude审查Codex还是相反?

Zuodong Xiang, Yike Zhang, YueMing Zhang, Hailu Xu

机构 * University of California, Davis(加州大学戴维斯分校) Johns Hopkins University(约翰霍普金斯大学) California State University, Long Beach(长滩加州州立大学)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE;agentic(comments)

AI总结 研究开发者同时使用Claude和Codex进行代码审查的成本、时间及配对顺序问题,通过对116个任务的六种条件实验发现,Claude审查Codex草稿效果好,反向则不佳,有用的配对是不对称的,应Claude审查Codex。

Comments This paper had been accepted by Agentic SE @ KDD'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20274 2026-08-21 cs.AI cs.CL 新提交 62%

Break It Down, Pass It On: Cross-Task Skill Transfer in LLM Agents

分解与传递:大语言模型智能体的跨任务技能迁移

Yiyang Feng, Biddut Sarker Bijoy, Niranjan Balasubramanian, Jiawei Zhou

机构 * Stony Brook University(石溪大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究探究LLM智能体跨任务技能迁移的可靠性,对比任务级与子任务级、文本与代码两种技能格式,提出结合特异性与抽象性的技能效用分数,发现子任务级文本技能迁移效果更优,可用于诊断技能记忆。

Comments 34 pages, 28 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19799 2026-08-21 cs.CL cs.SE 新提交 62%

SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?

SWE-bench Science:编码智能体能解决科学领域的工程任务吗?

Zhipeng Xu, Jiahao Lu, Yining Zheng, Yuxin Wang, Xipeng Qiu

专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.SE

AI总结 本研究推出SWE-bench Science基准,含20个领域98个仓库的119项任务,评估发现最优智能体pass@1低于50%,揭示科学软件工程的挑战,分析四类失败机制并经消融实验明确科学知识的作用,为编码智能体研究提供测试平台。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19703 2026-08-21 cs.SE cs.AI 新提交 62%

Loreley: Repository-Scale Program Evolution with Quality-Diversity Search

Loreley:基于质量多样性搜索的仓库级程序演化

Mohan Chen

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究提出名为 Loreley 的 QD 方法,将完整仓库状态存入存档采样,在 Zstandard 实验中对比三种策略,发现 48 作业时 QD 未显优势但垫脚石机制生效,早期活动已产出多文件改进。

Comments 15 pages, 3 figures, 8 tables. Code and evidence: https://github.com/NeapolitanIcecream/loreley

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13867 2026-08-17 cs.SE cs.AI 新提交 62%

Engineering Reliable Coding Agents: Evaluating and Operating the System Around the Model

构建可靠的编码智能体:评估与运行模型周边系统

Stephanie Jarmak

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本研究针对AI编码智能体的可靠性问题,整合多源证据构建系统级评估与运行框架,区分模型与基础设施效应,提出可靠性记录目录及相关方法以提升智能体系统可靠性。

Comments Technical review and engineering monograph, 314 pages, 30 figures. Includes an evidence audit, a companion research artifact with 206 reliability records, and runnable protocols for evaluating and operating AI coding agents. August 2026. Source, companion, and reusable protocols: https://github.com/sjarmak/engineering-reliable-coding-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13681 2026-08-17 cs.SE cs.AI cs.ET 新提交 62%

Fine-Tuning Qwen3-27B for C-to-Rust Code Translation: A Three-Stage Curriculum of Pretraining, Debugging-Aware SFT, and Task-Specific SFT

微调Qwen3-27B实现C到Rust代码翻译:预训练、调试感知监督微调与任务特定监督微调的三阶段课程

Pu Zhao, Changdi Yang, Yixiao Chen, Yi Gao, Yifan Cao, Haochen Zeng, Yanzhi Wang

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 本研究针对C到Rust代码翻译任务,对Qwen3-27B采用三阶段微调课程,结合SACTOR框架评估后,其性能优于基线模型及其他LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13568 2026-08-17 cs.CL cs.AI 新提交 62%

Does a Language Server Save Tokens for Coding Agents? A Measurement Methodology and Preliminary Study

语言服务器能为编码智能体节省 token 吗?一种测量方法与初步研究

Pengcheng Xu

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文通过五组消融实验等方法,对比 LSP 与 grep 检索的 token 效率,发现 LSP 通常不节省 token,仅对最弱模型有 token 节省效果,需根据任务、模型等选择检索工具。

Comments 13 pages, 6 figures. Code and data: https://github.com/Poytr1/lsp-vs-grep-token-study

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12771 2026-08-14 cs.SE cs.AI 新提交 62%

Memorization Diagnostics for Code LLMs Should be Scale-Aware

代码大语言模型的记忆诊断应考虑规模因素

Prateek Kumar Rajput, Abdoul Aziz Bonkoungou, Alberick Euraste Djiré, Xunzhu Tang, Yewei Song, Iyiola Emmanuel Olatunji, El Hacen Diallo, Jacques Klein, Tegawendé F. Bissyandé

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 该研究针对代码大语言模型记忆诊断的规模敏感性问题,通过分离表征负载与记忆,发现现有探测技术在大规模模型上失效,提出未来评估需解耦二者的方法。

Comments 26 pages, 6 figures, 6 tables. Under review at EMSE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11282 2026-08-13 eess.IV cs.AI cs.LG 新提交 62%

Physics-Informed Implicit Neural Representations for Improved Myocardial Perfusion MRI Quantification

用于改进心肌灌注MRI定量的物理信息隐式神经表示

Christos Tsepas, Chang Yan, Maximilian Fuetterer, Sebastian Kozerke, Cian M Scannell

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究将物理信息神经网络(PINN)框架扩展加入时空隐式神经表示(INRs),在真实模拟CMR数据集上提升了心肌灌注参数估计的鲁棒性与准确性。

Comments Accepted at the STACOM workshop at MICCAI, Strasbourg 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11232 2026-08-13 cs.CL cs.AI 新提交 62%

Backtrader-Bench: Benchmarking LLM Agents on Algorithmic Trading with Self-Generated MCQs

Backtrader-Bench:基于自生成多项选择题的算法交易大语言模型智能体基准测试

Ruoxi Zhao, Maziar Raissi

机构 * University of California, Riverside(加利福尼亚大学河滨分校)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 Backtrader-Bench是用于算法交易LLM智能体的基准框架,通过自生成MCQ解决评估难题,实验显示带工具智能体准确率显著高于无工具模型,还可生成强化学习训练语料以构建专用量化交易智能体。

Comments Accepted to the FinLLM Workshop at IJCAI 2026. Code and data: https://github.com/rzhao999/Backtrader-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09934 2026-08-12 cs.CL cs.AI 新提交 62%

LLM Agents Factory: Retrieval of Domain-Specific LLM Agents

LLM智能体工厂:领域特定大语言模型智能体的检索

Vitalii Belov, Artyom Sosedka, Andrey Sakhovskiy, Elizaveta Kovtun, Artyom Boyarskikh, Semen Budennyy

机构 * Sber AI Moscow Institute of Physics and Technology(莫斯科物理技术学院) National University of Science and Technology MISIS(莫斯科国立科学技术大学MISIS) Skolkovo Institute of Science and Technology(斯科尔科沃科学技术研究所) Artificial Intelligence Research Institute(人工智能研究所)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出LLM Agents Factory框架,通过检索2万余个预设智能体配置文件按需构建领域特定智能体,在多基准测试中实现高准确率与低推理成本,为工业应用提供动态智能体生成的替代方案。

Comments 7 pages, 1 figure, SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09802 2026-08-11 cs.CL cs.SE 新提交 62%

SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring

SWE-Bench ProMax:面向大规模多语言代码重构的智能体基准测试

Yuling Shi, Jinghan Xu, Kelin Fu, Wenhao Zeng, Shilin He, Lei Zhang, Yue Liu, Zelin Zhao, Terry Yue Zhuo, Jialun Cao, Siyu Ye, Tianyu Liu, Kai Cai, Shing-Chi Cheung, Xiaodong Gu

专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.SE

AI总结 该研究推出SWE-Bench ProMax多语言代码重构基准,含170个跨7种语言的大规模重构任务,经严格筛选后前沿模型仅达41.2%解决率,为AI编码智能体提供挑战性测试。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09292 2026-08-11 cs.LG cs.CL 新提交 62%

Beyond the Capability Boundary: Zeroth-Order Optimization for Self-Evolving LLM Agents

超越能力边界:用于自进化大语言模型智能体的零阶优化

Bingzhen Liu, Xiaomeng Fan, Yuwei Wu, Zhi Gao, Mingyang Gao, Chuanhao Li, Yunde Jia

机构 * Beijing Institute of Technology(北京理工大学) Shenzhen MSU-BIT University(深圳北理莫斯科大学) Alaya Lab(阿莱亚实验室)

专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.LG

AI总结 本文提出零阶自进化框架,通过扰动LLM的LoRA参数形成闭环自进化循环,结合并行扰动推理等机制,在多基准实验中显著提升了LLM智能体在困难样例上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07645 2026-08-11 cs.AI cs.LG 新提交 62%

Mendel Gödel Machine: Recursive Self-Improving Coding Agents via Comparative Evolution

孟德尔哥德尔机:基于比较进化的递归自改进编码智能体

Changzhi Liu, Yilun Liu, Sikuan Yan, Volker Tresp, Yunpu Ma

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对现有自改进编码智能体仅利用单轨迹的缺陷,提出孟德尔哥德尔机,新增反应规范突变与跨谱系杂交两种自修改策略,经理论证明与实验验证,其在编码任务上的性能、效率及泛化性均优于基线方法。

Comments Project Page at https://reallcz.github.io/MGM; Code at https://github.com/RealLcz/MGM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02685 2026-08-05 cs.SE cs.AI 新提交 62%

BulkPR-Bench: Benchmarking Queue-Level Governance of Interacting Pull Requests

BulkPR-Bench:针对交互拉取请求的队列级治理基准

Zetong Xiong, Qiao Zhao, Jun Zhang, Xueying Lyu, Zhi Li, Yixiang Tu, Xiaowen Yang, Yunjie Zhang, Yufeng Wang, Zhe Zhang, Kaize Yu, Hanwen Du, Zhongkai Sun, Zhuoxin Liu, Zekun Lin, Jianwen Yang, Ruining Chen, Ying Zhang, Tingxuan Pan, Ke Chen, Shubin Han, Chuanhao Sun, Yehua Yang

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究推出BulkPR-Bench基准,针对交互PR队列治理,实验显示现有模型在该任务上表现优于顺序基准,但仍存在较大提升空间。

Comments 12 pages, 5 figures. Artifact: https://github.com/Eureka246/BulkPR-Bench-Release ; archived artifact: https://doi.org/10.5281/zenodo.21717780

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01868 2026-08-04 cs.CY cs.AI cs.CL cs.MA 新提交 62%

No One Wins in Nuclear War: A Social Simulation of Military Decision-making

核战争中无人取胜:军事决策的社会模拟

Glenn Matlin, Isaac Song, Anthony Wen-Ming Zang, Mark Riedl

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究构建了名为WOPR的社会模拟环境,以兵棋推演为载体,采用Concordia为默认工具,实现了带有可验证规则引擎和四级沟通阶梯的模拟系统,将军事决策等战略选择转化为智能体的明确决策。

Comments 16 pages, 11 figures. Published at the Social Sim'26 Workshop at COLM 2026. Code and replay data: https://github.com/eilab-gt/wopr

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01715 2026-08-04 cs.SE cs.AI 新提交 62%

Coding Agents as Test-Suite Auditors: Finding What Official Suites Miss While Approaching What They Catch

编码智能体作为测试套件审计器:在接近官方测试套件检测能力的同时发现官方套件遗漏的问题

Shuyang Xie, Shuxiao Xie, Feng Zhu, Yanli Ji, Wangmeng Zuo

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究提出编码智能体作为测试套件审计器,结合认证链识别官方套件遗漏的缺陷提交,在接近官方套件覆盖度的同时,无官方套件时其构建的套件表现最优。

Comments 24 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27409 2026-07-31 cs.SE cs.AI 新提交 62%

SWE-NFI: Studying and Benchmarking Coding Agents for Non-Functional Improvements

SWE-NFI:面向非功能改进的编码智能体研究与基准测试

Pengyu Xue, He Yang Yuan, Xin Wang, Junkai Chen, Haonan Zhang, Boyuan Chen, Zishuo Ding, Zhenhao Li, Weiyi Shang

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出SWE-NFI基准,基于开源Python项目的真实合并拉取请求构建188个任务,评估编码智能体的非功能改进能力,发现智能体在该能力上普遍落后于人类开发者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27228 2026-07-31 cs.CL cs.AI cs.DL 新提交 62%

AI-assisted pre-review of open-source software submissions: an experience report from BOSC 2026

AI辅助的开源软件提交预评审:来自BOSC 2026的经验报告

Tazro Ohta, Nomi L. Harris, Seth Carbon

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本研究针对BOSC 2026投稿激增问题,开发bosc-pre-review与Runabilly辅助评审,调查显示该预评审工具对志愿评审人员有用,需人工复核结论。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26819 2026-07-30 cs.SE cs.AI 新提交 62%

A First Look at Coding Agents' Compliance with AI Contribution Rules in Open-Source Communities

初探编码智能体在开源社区中对AI贡献规则的合规性

Wenhao Yang, Runzhi He, Minghui Zhou

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本研究构建RepoComplianceBench基准测试编码智能体对开源社区AI贡献规则的合规性,发现当前智能体几乎不主动检索规则,仅在提示等辅助下实现披露与验证,但始终不执行AI禁令。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21677 2026-07-27 cs.SE cs.AI 新提交 62%

Enhancing SLMs for Sustainable Code Optimization in Radio-Astronomy

增强小型语言模型以实现射电天文学中的可持续代码优化

Elisa Chiarotto, Jingbo Li, P. Chris Broekema, Rob V. van Nieuwpoort

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 研究利用小型语言模型(SLMs)优化射电天文学代码,通过多采样生成策略和纳入编译器反馈两种方式增强SLMs,提高代码生成质量和性能,用更少计算资源匹配或超越大型单生成模型,且使所有测试模型持续改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21672 2026-07-27 cs.SE cs.AI cs.CV 新提交 62%

Pixels for Programs? A Cross-Provider Case Study of Input-Token Accounting for Source Code as Text and Images

像素换程序?关于将源代码作为文本和图像的输入令牌计费的跨供应商案例研究

Ronak Bhalgami

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究将源代码作为文本和图像时商业API如何计费,通过可重复案例研究,涵盖五种编程语言、多种源长度及多个模型别名,得出不同模型的图像与文本比率及收支平衡行为差异,还发布了重现研究所需的资料。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21641 2026-07-27 cs.SE cs.AI 新提交 62%

Tool-Guided Retrieval-Augmented Repair for Securing LLM-Generated C Code

用于保护大语言模型生成的C代码的工具引导检索增强修复

Vidyut Sriram, Saatvik Pradhan, Suman Saha

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 研究大语言模型生成C代码可靠性问题,提出结合编译诊断、CodeQL静态分析等及检索先前修复模式的分析与修复工作流程,在相关C编程任务上评估,该方法有效降低了基线模型的编译失败率和安全缺陷率,提升了代码安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20972 2026-07-24 cs.AI cs.SE 新提交 62%

Delivery, Not Storage: Cue-Anchored Working Memory as a Harness Property for Coding Agents

传递而非存储:线索锚定工作记忆作为编码代理的一种约束属性

Swapnanil Saha

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究编码代理记忆问题,提出基于认知文献的两层设计理论及线索锚定记忆模型,通过实际编码任务评估,表明传递而非存储是关键,可靠记忆通道应让代理无需思考,给出相关实验结果及贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20908 2026-07-24 cs.LG cs.AI 新提交 62%

Multi-turn RL with Structural and Performance Aware Rewards for CUDA Kernel Generation

用于 CUDA 内核生成的具有结构和性能感知奖励的多轮强化学习

Quazi Ishtiaque Mahmud, Nesreen K. Ahmed, Ali Jannesari

机构 * Iowa State University(爱荷华州立大学) Cisco AI Research(思科人工智能研究院)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究针对 CUDA 内核生成,提出 CudaPerf 框架,结合可验证执行奖励与结构代码感知奖励,分离线排序和在线训练两阶段,利用执行反馈迭代细化,通过实验证明其显著优于基线,在加速和正确性上有大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20507 2026-07-24 cs.AI cs.LG 新提交 62%

MiniCache: Reusable Program Caching with Small Model Interfaces for Efficient LLM Inference

MiniCache:用于高效大语言模型推理的具有小模型接口的可重复使用程序缓存

Jingquan Chen, Jinghua Piao, Jie Feng, Shaogang Hu, Yong Li

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型推理成本高的问题,提出MiniCache框架,将PoT程序转换为参数化缓存对象,通过重用小模型进行语义变量提取和推测性起草,减少目标大语言模型调用,实验证明其能提升推理性能,平衡延迟、缓存重用和准确性。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18356 2026-07-22 cs.SE cs.AI 新提交 62%

CODENS: Transforming Code Changes into Living, Accessible, and Queryable Documentation

CODENS:将代码变更转化为生动、可访问且可查询的文档

Abdelhak Kelious, Chyrine Tahri, Eliot Bardet

机构 * CAPSENS

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究如何在快速发展代码库中维护文档,提出CODENS系统,它从拉取请求构建知识图,经语义提取等操作,通过三种检索模式展示知识,保留变更历史并集成评估指标,在项目中评估效果良好,但在文档综合方面有挑战。

Comments Accepted at the 26th ACM Symposium on Document Engineering (DocEng 2026). DOI: 10.1145/3820755.3832807

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18213 2026-07-21 cs.CL cs.SE 新提交 62%

SWE-Pruner Pro: The Coder LLM Already Knows What to Prune

SWE-Pruner Pro:编码语言模型已知道该修剪什么

Yuhang Wang, Yuling Shi, Shaoqiu Zhang, Jialiang Liang, Shilin He, Siyu Ye, Yuting Chen, Kai Cai, Xiaodong Gu

专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.SE

AI总结 研究针对编码代理长上下文修剪问题,提出SWE-Pruner Pro,利用代理内部表示直接修剪工具输出。在多基准测试中节省令牌,保持任务质量,在MiMo-V2-Flash上提升解决率和准确率。

Comments Project page: https://github.com/Ayanami1314/swe-pruner-pro

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16632 2026-07-21 cs.SE cs.AI 新提交 62%

CLOSER-Bench: Evaluating Budgeted Cross-Stage Design Closure for Hardware Agents

CLOSER-Bench:评估硬件代理的预算跨阶段设计封闭性

Peilong Zhou, Zhirong Chen, Cangyuan Li, Haoyu Gao, Kaiyan Chang, Ziming Qu, Ying Wang

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究硬件代理跨阶段设计封闭性评估难题,提出CLOSER-Bench协议,通过配对任务记录调用,测量多方面指标。经试点和验证揭示差距,构建加速器,促使将硬件封闭视为预算顺序决策问题。

Comments 6 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15205 2026-07-17 cs.SE cs.AI 新提交 62%

MM-IssueLoc: A Controlled Benchmark for Evaluating Visual Evidence in Multimodal Repository-Level Issue Localization

MM-IssueLoc:用于评估多模态仓库级问题定位中视觉证据的可控基准

Shaoxiong Zhan, Shi Hu, Boyu Feng, Hai Lin, Andrew Gong, Zhengda Zhou, Jiaying Zhou, Yunyun Hou, Hao Su, Hai-Tao Zheng

机构 * Tsinghua University(清华大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究针对仓库级问题定位多为文本任务,视觉证据作用不明的情况,引入MM-IssueLoc基准和评估协议,含多语言实例与标注等。评估LLM和检索系统,发现现有系统距可靠多模态定位有差距,该基准让视觉证据成评估变量,助于后续研究。

详情

展开后加载摘要…

URL PDF HTML 收藏