Assessing Behavioral Validation in UI Component Test Suites Using Inferred Metamorphic Relations
利用推断的变形关系评估UI组件测试套件中的行为验证
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 该研究提出基于推断变形关系(MR)的框架,可补充执行类指标,用于评估UI组件测试套件的行为验证,发现现有测试存在行为缺口,且MR覆盖率具备实际应用价值。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
利用推断的变形关系评估UI组件测试套件中的行为验证
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 该研究提出基于推断变形关系(MR)的框架,可补充执行类指标,用于评估UI组件测试套件的行为验证,发现现有测试存在行为缺口,且MR覆盖率具备实际应用价值。
对代理生成的拉取请求中图书馆使用情况的研究
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 研究探讨了代理生成的拉取请求中图书馆使用情况,发现代理频繁导入图书馆但很少引入新依赖项,且在引入时遵循严格的版本控制实践。
Comments 5 pages, 3 tables. Accepted at MSR '26 (Challenge Track)
Journal ref 23rd International Conference on Mining Software Repositories: MSR 2026
FinVerse:金融时间序列基准
专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG
AI总结 本研究推出金融时间序列预测基准FinVerse,其针对43个公开时间序列基础模型的分析显示,通用预测标准下的优异表现未必对应实用金融预测,凸显了领域感知基准的必要性。
Comments 24 pages
将比赛建模为语言:一种生成式Transformer方法用于足球中的反事实球员估值
机构 * Department of Artificial Intelligence, University of Seoul, Seoul, Republic of Korea(首尔大学人工智能系) ; Institute for Sports and Preventive Medicine, Saarland University, Saarbrücken, Germany(萨尔兰州预防医学研究所) ; Chair for Sports Analytics, Saarland University(萨尔兰州体育分析教授职位)
专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出ScoutGPT,通过将足球比赛事件视为序列标记,利用生成式Transformer模型模拟反事实球员估值,提升对球员转会效果的预测能力。
Comments 21 pages, 4 figures, 11 tables. Accepted at ECML-PKDD 2026 (Applied Data Science Track)
用于合成组织病理学图像生成的条件扩散模型评估
专题命中 评测与基准 :foundation model(abstract);分类 cs.LG
AI总结 本研究针对合成组织病理学图像生成的评估问题,提出基于数字病理学预训练基础模型改进的FID、IS及精确率-召回率指标,实验发现改进后的IS与下游细胞核分割性能相关性更高,且生成数据多样性对分割性能的提升作用强于单张图像视觉保真度。
Comments 11 pages, 3 figures
语言的作用与证据支持:具身智能体中语言接地的功能角色分类与证据审查
专题命中 评测与基准 :foundation model(abstract);分类 cs.CL
AI总结 本研究提出具身智能体中语言的五种功能角色,构建框架审查现有文献,发现语言功能使用与证据支持存在差距,以角色主张为单位可合理比较不同具身智能体。
Comments 19 pages, 3 figures, 11 tables
NOMADD:适配数据漂移的模型数值优化方法
专题命中 评测与基准 :foundation model(abstract);分类 cs.LG
AI总结 本文提出适用于多种模型的事后概念漂移缓解方法NOMADD,通过参数外推提升模型在18个数据集基准上的性能,训练耗时远低于同类最先进方法。
评估盲区:无声的测量故障如何从训练到部署破坏AI系统
专题命中 评测与基准 :LLM(abstract);分类 cs.LG
AI总结 本文提出评估盲区概念,指出测量故障会从AI训练到部署阶段无声传播,通过案例与50起真实事件验证,发现53%公开失效为无声,强调测量基础设施需覆盖全生命周期。
Comments 10 pages, 7 figures
CUADebug:计算机使用智能体故障的诊断与修复
专题命中 评测与基准 :prompting(abstract);分类 cs.AI
AI总结 本研究提出CUADebug框架,含错误分类、CUAErrorBench基准与CUADebugger工具,可诊断修复计算机使用智能体故障,提升任务完成与重新执行成功率,证明其能提供可操作修复信号。
Comments 23 pages, 10 figures, 6 tables
TransVLM:一种用于检测任意 shot 转换的视觉-语言框架和基准
机构 * University of Melbourne(墨尔本大学) ; HeyGen Research(HeyGen研究院) ; Nanyang Technological University(南洋理工大学)
专题命中 评测与基准 :language model(abstract);分类 cs.AI
AI总结 TransVLM 提出了一种视觉-语言框架,通过注入光流作为关键运动先验,提升对任意 shot 转换的检测能力,同时设计了可扩展的数据引擎和基准测试,实验表明其性能优于传统方法和现有 VLM。
Comments v2: Corrected an inaccurate statement in the abstract regarding production deployment. Accepted by ECCV 2026. For more related research, please visit HeyGen Research (https://www.heygen.com/research) and HeyGen Avatar-V (https://www.heygen.com/research/avatar-v-model). Project page: https://chence17.github.io/TransVLM/
机构 * Department of Computer Science and Engineering(计算机科学与工程系) ; The Pennsylvania State University(宾夕法尼亚州立大学) ; Department of Industrial and Manufacturing Engineering(工业与制造工程系)
专题命中 评测与基准 :pretraining(abstract);分类 cs.AI
Comments IEEE-ISTAS conference
Journal ref 2025 IEEE International Symposium on Technology and Society (ISTAS)
MT-Web2Code:面向多轮区域重构与局部修改的编码智能体基准测试
专题命中 评测与基准 :language model(abstract)
AI总结 MT-Web2Code是首个面向多轮区域重构与局部修改的多模态编码基准,实验发现现有编码智能体存在多轮错误滚雪球等问题,其评估指标或助力相关研究。
SeCo-SBIR:用于零样本草图-图像检索的语义一致提示学习
专题命中 评测与基准 :prompting(abstract)
AI总结 SeCo-SBIR是解决CLIP适配ZS-SBIR时域适配与泛化矛盾的语义一致提示学习框架,结合多模态提示、一致性约束与多目标损失,在三类ZS-SBIR基准上达最优性能。
Comments ACMMM 26
机器学习指导EMT沸石的合成
专题命中 评测与基准 :foundation model(abstract)
AI总结 本研究开发机器学习模型,基于174组合成参数预测沸石骨架,识别关键参数并找到6种EMT合成新条件,5种经实验验证,为加速沸石合成提供数据驱动方案。
Journal ref Phys. Rev. Materials 10, 083801, 2026
从像素到语义:一种多阶段AI框架用于卫星图像中的结构损坏检测
机构 * The Beacom College of Computer & Cyber Sciences, Dakota State University(达科他州立大学比康计算机与网络科学学院)
专题命中 评测与基准 :language model(abstract)
AI总结 本文提出一种多阶段AI框架,结合超分辨率、目标检测和视觉-语言模型,提升灾害后建筑损坏评估的语义解读能力,通过CLIPScore和多模型策略提高检测可靠性。
Journal ref IEEE/CVF Conference on Computer Vision & Pattern Recognition Workshop (CVPRW) 2026
StereoVGGT: 一种无需训练的视觉几何变换器用于立体视觉
专题命中 评测与基准 :foundation model(abstract)
AI总结 本文提出StereoVGGT,一种专为立体视觉设计的特征骨干网络,通过冻结VGGT并引入无训练特征调整流程,缓解几何退化,提升立体匹配性能,在KITTI基准中取得第一。
OCR评估方法和指标及历史文件的不可见性综述
机构 * The Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 评测与基准 :language model(abstract)
AI总结 本文探讨OCR系统在历史文档中的评估问题,指出现代文档评估方法忽视了历史档案的布局、字体和材料退化,导致结构性不可见和代表性伤害。
Comments This manuscript is the author's submitted version to the ACM Conference on Fairness, Accountability, and Transparency (FAccT 2026). Please cite the final published version via ACM Digital Library when available
Journal ref FAccT '26: The 2026 ACM Conference on Fairness, Accountability, and Transparency
TQLite:多大语言模型评审团引导的蒸馏用于实时MQM翻译质量评估
机构 * Netflix(网飞公司)
专题命中 效率与部署 :LLM(title,summary_cn);SLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本研究提出TQLite蒸馏框架,通过多LRM评审团生成合成训练数据,使SLMs的MQM翻译质量评估性能远超普通SLM,成为LLM/LRM评估器的高性价比替代方案。
Comments 16 pages, 9 figures
面向大型语言模型系统的安全导向生命周期模型
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 本文针对LLM系统生命周期框架重效率轻安全、治理与生命周期阶段脱节的问题,提出含32个阶段的安全导向生命周期模型,整合多监管框架发现治理证据分布不均的结构特性。
Comments Accepted as: Batzolis, E., Drosatos, G., Katsouros, V., & Rantos, K. (2026). A Security-Oriented Lifecycle Model for Large Language Model Systems. In: Kieseberg, P., Skopik, F., Atli, B., Schrittwieser, S., & Asplund, M. (Eds.), Availability, reliability and security---ARES 2026 EU Projects Symposium workshops (Lecture Notes in Computer Science, pp. 1-18). Springer Nature Switzerland
基于句子级能量景观的黑盒大语言模型解释
机构 * Sharif University of Technology(谢里夫理工大学)
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 针对黑盒LLM的可解释性缺失问题,提出一种句子级模型无关后验归因解释器,通过EBM代理捕获概念一致性,无需额外API查询即可量化提示对目标输出的影响,实验验证其能有效识别关键提示。
OmniPack:面向高效全模态大语言模型的统一令牌压缩方法
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)
AI总结 本文针对全模态大语言模型的高计算开销问题,提出无需训练的OmniPack框架,通过LLM前结构压缩与LLM内语义优化的协作,在5个基准上实现最优性能-效率权衡,在Qwen2.5-Omni-7B上大幅降低计算量且保持高性能。
Comments 16 pages, 5 figures, 15 tables
SparSEEty:通过确定性侧信道从利用稀疏性的大语言模型(LLM)服务系统中提取 token
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 SparSEEty 是一种针对利用稀疏性的 LLM 服务系统的 token 提取攻击,通过 CVM 侧信道构建预言机、降低监控开销并反转激活轨迹,可高准确率重建 token,监控开销仅 3.7%-7.2%。
语义捆绑:使用大语言模型简化知识图谱的交互式节点与边捆绑
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)
AI总结 该研究提出基于LLM的语义捆绑技术,在开源系统AgentK中实现,用于简化知识图谱,通过节点边捆绑形成高级结构,在电影评论等场景中可揭示文档集合新见解。
Comments Under review. 12 pages, 13 figures
SKILL-KD:面向大语言模型智能体的对比式技能蒸馏
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 SKILL-KD是面向LLM智能体的对比式技能蒸馏框架,通过将师生智能体的可操作差异蒸馏为技能补丁并迭代优化,结合感知漂移的技能整合,在五个智能体基准上提升了冻结学生智能体性能。
野外环境下的大语言模型服务:框架、方法与系统设计的实证研究
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本研究通过实证分析开源软件系统中5种LLM服务框架的应用情况,明确了框架使用特点、常用服务方法及应用场景,为相关人员提供了实践见解。
TraceCompiler:技能引导的LLM智能体轨迹挖掘与编译为近确定性工作流
专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG
AI总结 本文提出TraceCompiler系统,通过技能引导挖掘含噪声的LLM智能体轨迹并编译为近确定性工作流,在T1、AppWorld数据集上验证了依赖恢复的高精度,实现了Venmo资金请求意图的调用减少。
Comments 17 pages, 4 figures, 5 tables
FLARE: 混合语言模型的扩散方法
机构 * Adobe Research(Adobe研究院) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 效率与部署 :language model(title,abstract);LLM(summary_cn,abstract_cn);large language model(abstract);post-training(abstract)
AI总结 提出FLARE框架,通过结合自回归和扩散目标、硬件感知内核和统一推理,将混合注意力LLM转换为支持并行解码的扩散模型,在保持能力的同时提升吞吐量。
面向大语言模型测试时缩放的可解释自适应采样
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究针对LLM测试时推理的固定计算预算不灵活、不可解释的问题,提出带轻量级模糊控制器的自适应采样方法,在问答和数学任务上提升性能并减少平均采样数,为高效测试时推理提供实用方向。
LeanMem:面向LLM智能体的简单高效长期记忆系统
专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI
AI总结 LeanMem是面向LLM智能体的轻量级长期记忆框架,通过差异化处理历史内容、动态分配资源,在两个数据集上提升了记忆基线的准确率,同时降低了成本与延迟。
面向高效低比特大语言模型推理的异构感知微缩放技术
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 研究针对低比特LLM推理的MX格式精度损失问题,提出异构感知的AdaMX格式与加速器,在不增加EBW的前提下提升精度、降低存储能耗,在多类LLM及多模态模型上表现优异。