SmellCC: A Tool for Automated Code Smells Remediation
SmellCC:一种用于自动修复代码异味的工具
专题命中 推理与问题求解 :LLM(summary_cn,abstract)
AI总结 SmellCC是一款Visual Studio Code扩展,结合SonarQube与LLM流水线,采用思维链和少样本学习,可一键修复Python前10种常见代码异味,清洁率96.8%、准确率91.3%,能提升软件可维护性。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
SmellCC:一种用于自动修复代码异味的工具
专题命中 推理与问题求解 :LLM(summary_cn,abstract)
AI总结 SmellCC是一款Visual Studio Code扩展,结合SonarQube与LLM流水线,采用思维链和少样本学习,可一键修复Python前10种常见代码异味,清洁率96.8%、准确率91.3%,能提升软件可维护性。
SHRIMP:机器人任务计划的迭代优化
专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 针对协作机器人任务计划的语义歧义与透明度不足问题,提出SHRIMP系统,可通过自然语言生成分层机器人原语计划并迭代修正,经35人用户研究验证其能提升用户感知控制与机器人透明度。
Comments 11 pages, 8 figures, The 39th Annual ACM Symposium on User Interface Software and Technology (UIST '26)
基于Koopman谱分析的多智能体系统集体推理验证
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文提出基于Koopman算子理论的框架,通过分析多智能体集体的Koopman转移算子谱,实现对其推理收敛时间、派系及决策的可验证,在注意力共识模型上验证了方法的有效性,且运行高效。
从痕迹中推理:分歧引导的智能体修复WebAssembly差异
专题命中 推理与问题求解 :LLM(summary_cn,abstract)
AI总结 本文提出WasmMend系统,通过差分痕迹分析定位Wasm与原生执行的分歧函数,引导LLM智能体生成补丁,在真实C/C++项目上修复率达70.0%,优于基线方法。
基于参考的操作:多模态空间推理的框架与流程
专题命中 推理与问题求解 :LLM(summary_cn,abstract)
AI总结 本研究针对沉浸式平台中多模态空间交互问题,提出基于参考的操作框架,分解空间参考为源、锚点、框架组件,实现LLM驱动的流程并验证其效用,为空间交互设计提供关键经验。
Comments 16 pages, 10 figures. Accepted to the 39th Annual ACM Symposium on User Interface Software and Technology (UIST 2026)
群体视角至关重要:调控辩论关系可缓解多智能体辩论中的盲目从众
专题命中 推理与问题求解 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)
AI总结 针对多智能体辩论中LLMs易盲目从众的问题,提出DEAR框架,通过动态调控辩论关系缓解该问题,实验显示其性能更优且token消耗显著降低。
EffiHolmes:基于差分分析的仓库级时间低效修复定位
专题命中 推理与问题求解 :LLM(summary_cn,abstract)
AI总结 EffiHolmes是基于LLM的仓库级时间低效修复定位框架,通过差分分析等技术提升定位精度,在RepoEffi-Bench上优于多种基线方法,且跨模型规模稳健。
Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026). 13 pages, 3 figures, and 4 tables
LongHorizon-Harness:推进面向真实世界任务的长时程智能体
机构 * Alibaba Group(阿里巴巴集团)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本研究提出LongHorizon-Harness框架,通过MEA循环等设计解决长时程智能体的状态追踪与错误传播问题,在多个基准测试中显著提升了Qwen、Claude等模型的表现。
Comments 29 pages
LUT:用于视觉推理的隐式效用训练
专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文提出仅用标准VQA对训练的LUT框架,通过轨迹和步骤层面的隐式效用优化,在感知密集型视觉推理基准上性能优于现有隐式推理方法,且标注成本更低。
Vul4Py:利用配对漏洞利用与功能预言机对Python自动化漏洞修复进行基准测试
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本研究提出Vul4Py基准测试,含100个Python真实漏洞及配对预言机,对比三类AVR方法,发现智能体OpenHands修复漏洞数远超同类方法,配对预言机保障结果可信。
低资源东南亚语言中的原生多语言思维链推理
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对低资源东南亚语言大模型推理的跨语言崩溃与微调瓶颈,提出OSCD算法,结合翻译智能体循环与联合嵌入语义对齐,在AIME25等基准上实现数学推理的显著提升。
Comments 22 pages, 16 figures, 12 tables
从单体到群体:多智能体Web系统转型中的攻击面演化研究
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文针对从单智能体到多智能体Web系统转型的安全问题,提出MAS攻击向量分类法,构建WebMASLab测试平台,发现新型电话环路攻击对多数前沿多智能体模型威胁显著,提示防御通用性有限,揭示多智能体架构的新型安全风险。
面向目标的基于逻辑的语义通信及用于自动驾驶的神经符号推理
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract_cn);language model(abstract_cn)
AI总结 本文针对自动驾驶场景,提出基于一阶逻辑的目标导向语义通信方法,通过选择关键证据传输实现安全决策,在相同通信预算下优于均匀证据选择。
通过规则引导推理和强化学习实现可靠的C到Rust翻译
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究旨在解决利用大语言模型进行C到Rust自动翻译时存在的问题,提出TRAVEL框架,通过规则引导推理和强化学习两个模块,在多个数据集上评估,该框架提升了翻译准确率、成功率并降低不安全率。
Comments Accepted to the Industry Showcase of ASE 2026
推理的代价:神经机器翻译强化学习中的成本-质量权衡
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究神经机器翻译强化学习中推理痕迹对翻译质量的影响,通过在训练或推理阶段省略推理痕迹进行实验,发现推理尤其是推理阶段能提升质量,还研究了推理导致计算需求增加与翻译质量提升间的成本-质量权衡。
Journal ref Proceedings of the 2026 ACM Symposium on Document Engineering (DocEng '26)
使用大语言模型进行特征生成:一种进化算法方法
机构 * University of Luxembourg(卢森堡大学)
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究利用大语言模型解决表格数据特征生成问题,创建管道结合属性与提示生成新特征,经选择算法筛选,应用于八个不同数据集,结果显示语言模型生成的新特征有助于给定任务并提升分类效果。
Journal ref Commun. Comput. Inf. Sci. 2471, 48-64 (2025)
视听火烈鸟:用于长而复杂视频的开放视听智能
机构 * NVIDIA, USA(美国NVIDIA公司) ; University of Maryland, USA(美国马里兰大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 研究提出视听火烈鸟,用于长复杂视频的联合理解与推理。贡献包括构建大规模视频集、设计三阶段课程及推理框架。实验显示其在多基准测试中表现优异,超越同类开放模型,在长复杂视听理解推理任务中竞争力强,有现实应用价值和泛化能力。
Comments Project Page: https://avflamingo.pages.dev/
StructAgent:利用统一因果结构驾驭长时程数字智能体
机构 * University of California, San Diego(加利福尼亚大学圣地亚哥分校) ; Aether AI Lab(以太人工智能实验室)
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对长时程任务中智能体任务进展难解释、验证和恢复的问题,提出StructAgent框架,通过统一因果结构维护任务进展并规范工作流程,实验证明其能提升多种模型性能且具有通用性。
通过深度原生结构推理实现准确、跨学科和透明的结构-属性理解
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学) ; University of Sydney(悉尼大学) ; Nanjing University(南京大学) ; University of Oxford(牛津大学) ; The University of Science and Technology of China(中国科学技术大学) ; Drug Discovery and Design Center, State Key Laboratory of Drug Research, Shanghai Institute of Materia Medica, Chinese Academy of Sciences(药物发现与设计中心、国家药物研究重点实验室、上海中医药材料医学研究所、中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Stanford University(斯坦福大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究聚焦利用人工智能解释结构-属性关系的挑战,提出多模态科学基础模型SciReasoner,通过离散化结构信息为可寻址单元进行推理,在多领域基准测试中表现出色,实现准确预测与可解释科学推理的结合。
EvoPlan:具有时空保证的进化神经符号机器人规划
机构 * Texas A&M University(德克萨斯农工大学)
专题命中 推理与问题求解 :LLM(summary_cn,abstract)
AI总结 研究针对基于LLM的机器人规划器不足及经典PDDL规划器问题,提出含离线STL约束挖掘、进化PDDL规划器和受约束执行循环的神经符号框架,能保证计划属性,在基准测试中表现良好且可在无云环境下部署。
用于漏洞检测的神经符号推理
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究基于大语言模型的漏洞检测不可靠性,提出神经符号框架LeanGuard,通过将代码解释与安全义务判定分离,神经侧过滤事实,符号侧形式验证,证据感知裁决器权衡结果,在五个CWE类上实例化框架。
表征和弥合eBPF验证器拒绝中的诊断差距
专题命中 推理与问题求解 :LLM(summary_cn,abstract)
AI总结 研究eBPF验证器拒绝程序时的诊断差距,通过对235次拒绝进行实证研究量化问题。提出bpfix工具重建证明过程,构建75个LLM修复任务基准评估,发现定位证明丢失位置对修复关键,bpfix可提升修复成功率。
Comments Yusheng Zheng, Zhengjie Ji, Weichen Tao have equal contribution to the paper
ChargeBD:面向电池开发中引导工程的字符感知异构智能体推理
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出ChargeBD框架,通过MBTI启发的角色智能体矩阵,结合异构推理,解决液流电池多尺度多目标研发中的自适应问题。
GEAR-Seg:用于推理分割和数据引擎的基于可解释智能体
机构 * College of Biosystems Engineering and Food Science, Zhejiang University(浙江大学生物系统工程与食品科学学院) ; ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学杭州国际科创中心)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出GEAR-Seg,一种解耦的智能体框架,通过将像素转换为属性文本实现可解释推理分割,零样本性能优异,并可作为数据引擎构建大规模基准GEAR-131K。
Comments 21 pages, 8 figures
TruEye:图像中AI生成人物的细粒度检测
机构 * Vanderbilt University(范德堡大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出TruEye模型,通过掩码条件双流Transformer区分五种合成内容类别,实现AI生成或篡改人物与场景的细粒度检测和定位,无需大型语言模型,速度提升百倍。
Comments 18 Pages, 3 figures
IntentTester:面向意图驱动的跨库测试迁移多智能体框架
专题命中 推理与问题求解 :LLM(summary_cn,abstract)
AI总结 提出IntentTester多智能体框架,通过将测试抽象为语言无关的测试描述语言(TDL),结合知识图谱对齐语义实体,并利用LLM推理与迭代验证生成可执行测试,实现跨库跨语言测试迁移,在9个开源项目上生成2776个测试,正确率85%,有效性74%,并发现多处隐藏缺陷。
SupplyNet: 通过上下文多智能体模拟支持供应链中的视觉探索式学习
专题命中 推理与问题求解 :LLM(summary_cn,abstract)
AI总结 提出SupplyNet,一种基于上下文图的多智能体LLM框架的视觉模拟系统,通过交互式网络视图、分支时间线和任务分析控制台,支持供应链中的反事实探索、因果追踪和比较推理,提升用户参与度和理解。
Comments 25 pages, 7 figures
使用宽松自然形式语言的可验证数学自动形式化
专题命中 推理与问题求解 :LLM(summary_cn,abstract)
AI总结 提出一种宽松自然形式语言作为中间目标,通过分阶段精化实现可验证的数学自动形式化,结合规则转换与LLM启发式方法,并利用领域特定策略语言生成验证条件。
AgenticOS: 面向自主AI代理的意图导向安全操作系统架构
专题命中 推理与问题求解 :LLM(summary_cn,abstract)
AI总结 针对LLM驱动代理面临的结构性安全挑战,提出AgenticOS架构,将OS从资源管理器重构为意图过滤器,通过四层架构和意图ABI实现最小权限环境。
Comments 11 pages,5 figures,1 tables
门仅与其合约一样诚实:面向风险感知因果门控合约层的ContractGuard
专题命中 推理与问题求解 :LLM(summary_cn,abstract)
AI总结 针对工具增强型LLM代理的间接提示注入,提出ContractGuard,通过验证合约完整性(而非风险标签)来防御攻击,在基准测试中实现零注入成功率。