arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1613 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1613 篇

2608.15869 2026-08-18 cs.CV cs.AI cs.CL cs.LG cs.MM 新提交 80%

Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning

超越视觉思维链:用于主动视频推理的内化视觉思维

Xiaoyu Zhu, Xinke Deng, Suresh Taddewadikar, Arnab Kumar Mondal, Zhongyu Jiang, Ian Fasel, Joerg Liebelt

机构 * Apple(苹果公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出后训练框架IVT,在训练时内化视觉预测能力,推理时直接生成答案,相较Visual CoT性能相当或更优且延迟降低5倍以上,可实现更高效准确的主动视频推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15491 2026-08-18 cs.SE 新提交 80%

HxAgent: Iterative Agent Planning for End-to-End Web Application Testing

HxAgent:用于端到端Web应用测试的迭代智能体规划方法

Tu Nguyen, Duy Cao, Viet Nguyen, Phu Nguyen, Vy Le, Nguyen TK Nguyen, Tien N. Nguyen, Vu Nguyen

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 HxAgent是一种基于LLM的迭代规划智能体,通过主动修正策略结合多类信息优化Web测试,在MiniWoB++、350项Web任务及OnlineMind2Web数据集上均优于WALT模型,表现优异。

Comments Under review for a conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11394 2026-08-13 cs.SE 新提交 80%

GraphAlignCoder: Aligning Program and Proof Graphs for Code Generation

GraphAlignCoder:对齐程序与证明图的代码生成框架

Yueke Zhang, Zihan Fang, Kevin Leach, Yu Huang

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 GraphAlignCoder是将显式正确性结构迁移至代码生成的训练框架,通过对齐程序与证明图提升性能,在多个基准测试中优于现有方法,验证图注入与验证到代码的整合是关键。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09477 2026-08-11 cs.SE 新提交 80%

SmellCC: A Tool for Automated Code Smells Remediation

SmellCC:一种用于自动修复代码异味的工具

Xiaoting Zhang, Yujie Zhang, Zhipeng Gao, Xing Hu, Xin Xia

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 SmellCC是一款Visual Studio Code扩展,结合SonarQube与LLM流水线,采用思维链和少样本学习,可一键修复Python前10种常见代码异味,清洁率96.8%、准确率91.3%,能提升软件可维护性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08884 2026-08-11 cs.RO cs.HC 新提交 80%

SHRIMP: Iterative Refinement of Robot Task Plans

SHRIMP:机器人任务计划的迭代优化

Mya Schroder, Yuna Hwang, Callie Y. Kim, Leqian Cheng, Jeffrey Li-cheng Liu, Chenchen Zheng, Xinning He, Bilge Mutlu

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对协作机器人任务计划的语义歧义与透明度不足问题,提出SHRIMP系统,可通过自然语言生成分层机器人原语计划并迭代修正,经35人用户研究验证其能提升用户感知控制与机器人透明度。

Comments 11 pages, 8 figures, The 39th Annual ACM Symposium on User Interface Software and Technology (UIST '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05956 2026-08-07 cs.MA cs.SY eess.SY 新提交 80%

Certifying Collective Reasoning in Multi-Agent Systems via Koopman Spectral Analysis

基于Koopman谱分析的多智能体系统集体推理验证

Nuzhat Khan, Indrakshi Dey

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出基于Koopman算子理论的框架,通过分析多智能体集体的Koopman转移算子谱,实现对其推理收敛时间、派系及决策的可验证,在注意力共识模型上验证了方法的有效性,且运行高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05521 2026-08-07 cs.SE 新提交 80%

Reasoning from Traces: Divergence-Guided Agentic Repair of WebAssembly Discrepancies

从痕迹中推理:分歧引导的智能体修复WebAssembly差异

Liyan Huang, Kaicheng Wang, Weihang Wang

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 本文提出WasmMend系统,通过差分痕迹分析定位Wasm与原生执行的分歧函数,引导LLM智能体生成补丁,在真实C/C++项目上修复率达70.0%,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04798 2026-08-06 cs.HC 新提交 80%

Reference-Based Manipulation: A Framework and Pipeline for Multimodal Spatial Reasoning

基于参考的操作:多模态空间推理的框架与流程

Yangyang He, Zhuangze Hou, Yonglin Chen, Can Liu

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 本研究针对沉浸式平台中多模态空间交互问题,提出基于参考的操作框架,分解空间参考为源、锚点、框架组件,实现LLM驱动的流程并验证其效用,为空间交互设计提供关键经验。

Comments 16 pages, 10 figures. Accepted to the 39th Annual ACM Symposium on User Interface Software and Technology (UIST 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03648 2026-08-05 cs.MA 新提交 80%

Group Perspective Matters: Regulating Debate Relationships Can Mitigate Blind Conformity in Multi-Agent Debate

群体视角至关重要:调控辩论关系可缓解多智能体辩论中的盲目从众

Hao Wu, Shoucheng Song, Chang Yao, Haoyu Wang, Huaiyu Wan, Youfang Lin, Kai Lv

专题命中 推理与问题求解 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 针对多智能体辩论中LLMs易盲目从众的问题,提出DEAR框架,通过动态调控辩论关系缓解该问题,实验显示其性能更优且token消耗显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03558 2026-08-05 cs.SE 新提交 80%

EffiHolmes: Differential Profiling-Guided Repository Level Time Inefficiency Fix Localization

EffiHolmes:基于差分分析的仓库级时间低效修复定位

Haowen Yang, Yun Peng, Zishuo Ding

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 EffiHolmes是基于LLM的仓库级时间低效修复定位框架,通过差分分析等技术提升定位精度,在RepoEffi-Bench上优于多种基线方法,且跨模型规模稳健。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026). 13 pages, 3 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01964 2026-08-04 cs.CV 新提交 80%

LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks

LongHorizon-Harness:推进面向真实世界任务的长时程智能体

Ziyu Ma, Hailang Huang, Shun Zou, Yong Wang, Shidong Yang, Yiming Hu, Fei Wei, XiangXiang Chu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出LongHorizon-Harness框架,通过MEA循环等设计解决长时程智能体的状态追踪与错误传播问题,在多个基准测试中显著提升了Qwen、Claude等模型的表现。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00743 2026-08-04 cs.CV 新提交 80%

LUT: Latent Utility Training for Visual Reasoning

LUT:用于视觉推理的隐式效用训练

Jiaxuan Kang, Siyu Chen, Mingda Li, Mingjie Liu, Tianyue Wang, Zhaoyang Wei, Yongheng Zhang, Yanchao Hao, Zheng Wei

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出仅用标准VQA对训练的LUT框架,通过轨迹和步骤层面的隐式效用优化,在感知密集型视觉推理基准上性能优于现有隐式推理方法,且标注成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00692 2026-08-04 cs.SE 新提交 80%

Vul4Py: Benchmarking Automated Vulnerability Repair in Python with Paired Exploit and Functional Oracles

Vul4Py:利用配对漏洞利用与功能预言机对Python自动化漏洞修复进行基准测试

Tan Bui, Ting Zhang, Ferdian Thung, Yunpeng Xiong, Penghao Jiang, Xin Zhou, David Lo

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出Vul4Py基准测试,含100个Python真实漏洞及配对预言机,对比三类AVR方法,发现智能体OpenHands修复漏洞数远超同类方法,配对预言机保障结果可信。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00533 2026-08-04 cs.CL cs.AI cs.LG 新提交 80%

Native Multilingual Chain-of-Thought Reasoning in Low-Resource Southeast Asian Languages

低资源东南亚语言中的原生多语言思维链推理

Sean Gip Lim, William Chandra Tjhi, Hai Leong Chieu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对低资源东南亚语言大模型推理的跨语言崩溃与微调瓶颈,提出OSCD算法,结合翻译智能体循环与联合嵌入语义对齐,在AIME25等基准上实现数学推理的显著提升。

Comments 22 pages, 16 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00202 2026-08-04 cs.CR 新提交 80%

From Monoliths to Swarms: A Study of Attack Surface Evolution in the Transition to Multi-Agent Web Systems

从单体到群体:多智能体Web系统转型中的攻击面演化研究

Yashaswi Malla, Sandra Siby

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文针对从单智能体到多智能体Web系统转型的安全问题,提出MAS攻击向量分类法,构建WebMASLab测试平台,发现新型电话环路攻击对多数前沿多智能体模型威胁显著,提示防御通用性有限,揭示多智能体架构的新型安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00878 2026-08-04 cs.IT math.IT 新提交 80%

Goal-Oriented Logic-based Semantic Communication for Neuro-Symbolic Reasoning with Applications onto Autonomous Driving

面向目标的基于逻辑的语义通信及用于自动驾驶的神经符号推理

Ahmet Faruk Saz, Duo Xu, Faramarz Fekri

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract_cn);language model(abstract_cn)

AI总结 本文针对自动驾驶场景,提出基于一阶逻辑的目标导向语义通信方法,通过选择关键证据传输实现安全决策,在相同通信预算下优于均匀证据选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19966 2026-07-23 cs.SE 新提交 80%

Towards Reliable C-to-Rust Translation with Rule-Guided Reasoning and Reinforcement Learning

通过规则引导推理和强化学习实现可靠的C到Rust翻译

Feng Luo, Jiachen Liu, Cuiyun Gao, Jia Feng, Kui Liu

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究旨在解决利用大语言模型进行C到Rust自动翻译时存在的问题,提出TRAVEL框架,通过规则引导推理和强化学习两个模块,在多个数据集上评估,该框架提升了翻译准确率、成功率并降低不安全率。

Comments Accepted to the Industry Showcase of ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19226 2026-07-22 cs.CL cs.AI cs.LG 新提交 80%

The Price of Reasoning: Cost-Quality Tradeoffs in Reinforcement Learning for Neural Machine Translation

推理的代价:神经机器翻译强化学习中的成本-质量权衡

Michael Jungo, Aixiu An

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究神经机器翻译强化学习中推理痕迹对翻译质量的影响,通过在训练或推理阶段省略推理痕迹进行实验,发现推理尤其是推理阶段能提升质量,还研究了推理导致计算需求增加与翻译质量提升间的成本-质量权衡。

Journal ref Proceedings of the 2026 ACM Symposium on Document Engineering (DocEng '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16255 2026-07-21 cs.LG cs.AI cs.CL 新提交 80%

Feature Generation Using LLMs: An Evolutionary Algorithm Approach

使用大语言模型进行特征生成:一种进化算法方法

Aria Nourbakhsh, Benoît Alcaraz, Christoph Schommer

机构 * University of Luxembourg(卢森堡大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究利用大语言模型解决表格数据特征生成问题,创建管道结合属性与提示生成新特征,经选择算法筛选,应用于八个不同数据集,结果显示语言模型生成的新特征有助于给定任务并提升分类效果。

Journal ref Commun. Comput. Inf. Sci. 2471, 48-64 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16107 2026-07-20 eess.AS cs.CV 新提交 80%

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

视听火烈鸟:用于长而复杂视频的开放视听智能

Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Siddharth Gururani, Hanrong Ye, Pritam Biswas, Yuanhang Su, Ehsan Hosseini-Asl, Sang-gil Lee, Zhifeng Kong, Jaehyeon Kim, Sungwon Kim, S Sakshi, Ramani Duraiswami, Dinesh Manocha, Andrew Tao, Mohammad Shoeybi, Bryan Catanzaro, Ming-Yu Liu, Wei Ping

机构 * NVIDIA, USA(美国NVIDIA公司) University of Maryland, USA(美国马里兰大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究提出视听火烈鸟,用于长复杂视频的联合理解与推理。贡献包括构建大规模视频集、设计三阶段课程及推理框架。实验显示其在多基准测试中表现优异,超越同类开放模型,在长复杂视听理解推理任务中竞争力强,有现实应用价值和泛化能力。

Comments Project Page: https://avflamingo.pages.dev/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11615 2026-07-14 cs.SE 新提交 80%

ThinkLog: Leveraging Reasoning for Log Statement Generation

ThinkLog:利用推理进行日志语句生成

Kazuki Kusama, Honglin Shu, Masanari Kondo, Tao Xiao, Yasutaka Kamei

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 针对现有端到端日志语句生成方法准确性有限的问题,提出ThinkLog,该方法基于LLM,通过将推理融入提示作为少样本示例,引导LLM生成日志语句,在准确率提升15.4%的同时,推理成本约为现有最佳方法的50%。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11388 2026-07-14 cs.AI cs.CL cs.LG cs.MA 新提交 80%

StructAgent: Harness Long-horizon Digital Agents with Unified Causal Structure

StructAgent:利用统一因果结构驾驭长时程数字智能体

Wenyi Wu, Sibo Zhu, Kun Zhou, Aayush Salvi, Zixuan Song, Biwei Huang

机构 * University of California, San Diego(加利福尼亚大学圣地亚哥分校) Aether AI Lab(以太人工智能实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对长时程任务中智能体任务进展难解释、验证和恢复的问题,提出StructAgent框架,通过统一因果结构维护任务进展并规范工作流程,实验证明其能提升多种模型性能且具有通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07708 2026-07-09 cs.CL cs.AI cs.CE cs.LG 新提交 80%

Accurate, Interdisciplinary and Transparent Structure-property Understanding with Deep Native Structural Reasoning

通过深度原生结构推理实现准确、跨学科和透明的结构-属性理解

Chen Tang, Yizhou Wang, Jianyu Wu, Lintao Wang, Shixiang Tang, Pengze Li, Encheng Su, Jun Yao, Jiabei Xiao, Yuqi Shi, Jielan Li, Hongxia Hao, Zhangyang Gao, Fang Wu, Ben Fei, Xiangyu Yue, Pan Tan, Bozitao Zhong, Jinouwen Zhang, Aoran Wang, Yan Lu, Jiaheng Liu, Xinzhu Ma, Liang Hong, Mingyue Zheng, Phil Torr, Bowen Zhou, Wanli Ouyang, Lei Bai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) University of Sydney(悉尼大学) Nanjing University(南京大学) University of Oxford(牛津大学) The University of Science and Technology of China(中国科学技术大学) Drug Discovery and Design Center, State Key Laboratory of Drug Research, Shanghai Institute of Materia Medica, Chinese Academy of Sciences(药物发现与设计中心、国家药物研究重点实验室、上海中医药材料医学研究所、中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究聚焦利用人工智能解释结构-属性关系的挑战,提出多模态科学基础模型SciReasoner,通过离散化结构信息为可寻址单元进行推理,在多领域基准测试中表现出色,实现准确预测与可解释科学推理的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06724 2026-07-09 cs.RO 新提交 80%

EvoPlan: Evolutionary Neuro-Symbolic Robot Planning with Spatio-Temporal Guarantees

EvoPlan:具有时空保证的进化神经符号机器人规划

Bhavya Sai Nukapotula, Samin Moosavi, Haoze Wang, Luke Duncan, Diya Shakkottai, Varun Murali, Srinivas Shakkottai

机构 * Texas A&M University(德克萨斯农工大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 研究针对基于LLM的机器人规划器不足及经典PDDL规划器问题,提出含离线STL约束挖掘、进化PDDL规划器和受约束执行循环的神经符号框架,能保证计划属性,在基准测试中表现良好且可在无云环境下部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03963 2026-07-07 cs.SE 新提交 80%

Neuro-Symbolic Reasoning for Vulnerability Detection

用于漏洞检测的神经符号推理

Yanjie Zhao, Hongjie Chen, Li Lu, Zhou Yang, Xiao Cheng, Haoyu Wang

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究基于大语言模型的漏洞检测不可靠性,提出神经符号框架LeanGuard,通过将代码解释与安全义务判定分离,神经侧过滤事实,符号侧形式验证,证据感知裁决器权衡结果,在五个CWE类上实例化框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02748 2026-07-07 cs.OS cs.PL cs.SE 新提交 80%

Characterizing and Bridging the Diagnostic Gap in eBPF Verifier Rejections

表征和弥合eBPF验证器拒绝中的诊断差距

Yusheng Zheng, Zhengjie Ji, Weichen Tao, Xiangyu Gao, Jianchang Su, Wei Zhang, Andi Quinn, Dan Williams

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 研究eBPF验证器拒绝程序时的诊断差距,通过对235次拒绝进行实证研究量化问题。提出bpfix工具重建证明过程,构建75个LLM修复任务基准评估,发现定位证明丢失位置对修复关键,bpfix可提升修复成功率。

Comments Yusheng Zheng, Zhengjie Ji, Weichen Tao have equal contribution to the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12057 2026-07-07 stat.AP 新提交 80%

ChargeBD: Character-Aware Heterogeneous Agent Reasoning for Guided Engineering in Battery Development

ChargeBD:面向电池开发中引导工程的字符感知异构智能体推理

Rui Huang, Zekun Jiang, Mengran Hou, Xingyu Niu, Yuqiang Li, Qinying Gu, Tianhang Zhou

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出ChargeBD框架,通过MBTI启发的角色智能体矩阵,结合异构推理,解决液流电池多尺度多目标研发中的自适应问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00544 2026-07-02 cs.CV 新提交 80%

GEAR-Seg: A Grounded Explainable Agent for Reasoning Segmentation and Data Engine

GEAR-Seg:用于推理分割和数据引擎的基于可解释智能体

Yanan Wang, Wen Li, Yibin Ying, Zhenghao Fei

机构 * College of Biosystems Engineering and Food Science, Zhejiang University(浙江大学生物系统工程与食品科学学院) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学杭州国际科创中心)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出GEAR-Seg,一种解耦的智能体框架,通过将像素转换为属性文本实现可解释推理分割,零样本性能优异,并可作为数据引擎构建大规模基准GEAR-131K。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27505 2026-06-29 cs.CV 新提交 80%

TruEye: Fine-Grained Detection of AI-Generated Human Subjects in Images

TruEye:图像中AI生成人物的细粒度检测

Jay Barot, Dan Lin

机构 * Vanderbilt University(范德堡大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出TruEye模型,通过掩码条件双流Transformer区分五种合成内容类别,实现AI生成或篡改人物与场景的细粒度检测和定位,无需大型语言模型,速度提升百倍。

Comments 18 Pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25588 2026-06-25 cs.SE 新提交 80%

IntentTester: Intent-Driven Multi-agent Framework for Cross-Library Test Migration

IntentTester:面向意图驱动的跨库测试迁移多智能体框架

Yi Gao, Ziyuan Zhang, Xing Hu, Xiaohu Yang, Xin Xia

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 提出IntentTester多智能体框架,通过将测试抽象为语言无关的测试描述语言(TDL),结合知识图谱对齐语义实体,并利用LLM推理与迭代验证生成可执行测试,实现跨库跨语言测试迁移,在9个开源项目上生成2776个测试,正确率85%,有效性74%,并发现多处隐藏缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏