Agent-Based Software Artifact Evaluation
基于代理的软件工件评估
专题命中 评测与基准 :LLM(abstract);prompting(abstract)
AI总结 研究针对软件工件评估中人工评估难及现有政策缺乏验证标准的问题,构建ArtifactGuide评分标准,设计ArtifactCopilot代理,通过实验评估,该框架提升了评估性能,提高了评审信心,还为设计高质量工件提供了实践指导。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
基于代理的软件工件评估
专题命中 评测与基准 :LLM(abstract);prompting(abstract)
AI总结 研究针对软件工件评估中人工评估难及现有政策缺乏验证标准的问题,构建ArtifactGuide评分标准,设计ArtifactCopilot代理,通过实验评估,该框架提升了评估性能,提高了评审信心,还为设计高质量工件提供了实践指导。
为在线学习共同设计数字人:人机教学整合框架
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 研究为在线学习共同设计数字人框架,结合对多领域作品分析、学习者调查及专家研讨,为教育工作者等提供指导,助力构建更优质在线学习环境。
形式而非内容?对冻结小代码模型中通过提示和权重进行的学习错误条件自修复的预注册、安慰剂对照评估
机构 * PythaLab, Yıldız Technical University, Istanbul, Turkey(PythaLab,Yıldız技术大学,伊斯坦布尔,土耳其)
专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG
AI总结 研究冻结小代码模型中错误条件自修复,引入PoPE方法,通过提示和权重通道对其评估,结果表明在提示通道内容消除形式安慰剂下解锁单元数有差异,权重通道各情况有不同表现,未确认内容归因优越性,PoPE是可重新测试的测量标准。
Comments 54 pages, 6 figures, 17 tables. Preregistered, placebo-controlled evaluation
AAAI-26双重投稿:新挑战
机构 * OSU Libraries(俄勒冈州立大学图书馆) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Nanyang Technological University(南洋理工大学) ; AAAI Washington, DC(AAAI华盛顿特区) ; Indiana University(印第安纳大学) ; University of Alberta(阿尔伯塔大学)
专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG
AI总结 AAAI-26评审中发现双重投稿问题严重,通过标题+摘要相似性评估等方法处理,导致141篇主赛道投稿被拒稿。提醒注意双重投稿增长,其因生成式AI工具加剧,还给出更新政策、设检查工具等应对建议。
Comments 12 pages, 5 figures, 2 tables
AgentLens:用于编码智能体评估的生产评估轨迹审查
机构 * Explyt ; St. Petersburg Department of the Steklov Institute of Mathematics(圣彼得堡斯捷克洛夫数学研究所圣彼得堡分部) ; St. Petersburg State University(圣彼得堡国立大学)
专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG
AI总结 介绍用于编码智能体评估的AgentLens基准,结合形式验证、大语言模型编写的轨迹审查和并排比较来评估智能体整个轨迹,不仅能排名,还可用于诊断模型行为、比较智能体版本及发现产品回归问题,且已开源。
Atlas H&E-TME:基于AI的可扩展组织分析,达到专家病理学家级别的准确性
机构 * Aignostics, Germany(Aignostics,德国) ; Institute of Pathology, Charité – Universitätsmedizin Berlin, Germany(柏林夏里特医学院病理学研究所) ; Berlin Institute of Health, Charité – Universitätsmedizin Berlin, Germany(柏林夏里特医学院柏林健康研究所) ; Massachusetts General Hospital, Department of Pathology, Harvard Medical School, Boston, MA, US(哈佛医学院麻省总医院病理学系) ; Department of Laboratory Medicine and Pathology, Mayo Clinic, Rochester, MN, US(梅奥诊所检验医学与病理学系) ; Machine Learning Group, Technische Universität Berlin, Germany(柏林工业大学机器学习组) ; BIFOLD – Berlin Institute for the Foundations of Learning and Data, Germany(柏林学习与数据基础研究所) ; Department of Artificial Intelligence, Korea University, Republic of Korea(高丽大学人工智能系) ; Max-Planck Institute for Informatics, Germany(马克斯·普朗克信息学研究所) ; German Cancer Research Center (DKFZ) & German Cancer Consortium (DKTK), Berlin & Munich Partner Sites, Germany(德国癌症研究中心及德国癌症联盟柏林和慕尼黑合作站点) ; Institute of Pathology, Ludwig-Maximilians-Universität München, Germany(慕尼黑大学病理学研究所) ; Bavarian Cancer Research Center (BZKF), Germany(巴伐利亚癌症研究中心)
专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG
AI总结 提出Atlas H&E-TME系统,利用病理基础模型预测组织质量、区域和细胞类型,通过IHC共识验证和20万+注释基准,在多种癌症中达到或超越病理学家水平。
监督金融NLP中的测量风险:JF-ICR的评分标准和度量敏感性
机构 * Blossom AI Labs, Tokyo, Japan(blossom AI 实验室,东京,日本) ; Blossom AI Labs, San Francisco, USA(blossom AI 实验室,旧金山,美国)
专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL、cs.AI
AI总结 研究监督金融NLP基准中评分标准和度量对模型评估的影响,发现评分标准用词和度量选择会显著改变模型标签,提出可识别的度量标准以提高评估可靠性。
Comments Accepted to IEEE Computational Intelligence in Financial Engineering and Economics (CIFEr) 2026, Tokyo, JP
大语言模型能写出可靠的评分标准吗?实验复现的元评估
机构 * The University of Manchester(曼彻斯特大学) ; Institute for Infocomm Research (I²R), A*STAR(资讯通信研究院(I²R),新加坡科技研究局) ; IQuest Research(IQuest研究公司) ; ELLIS Manchester(ELLIS曼彻斯特) ; University of Information Technology, VNU(越南国家大学信息技术大学)
专题命中 评测与基准 :LLM(abstract);分类 cs.CL
AI总结 研究大语言模型生成的论文复现评分标准,将其 reformulate 为清单样式,在两个骨干模型上评估四种生成设置,通过语义相似性和分数对齐进行元评估,结果显示增强设置改善下游评估对齐,同时指出其存在过于细化、偏向高分和适应性差等问题。
无声警报:一种用于跨模型和量化级别比较危险识别的J空间协议
机构 * HSE University(俄罗斯高等经济大学)
专题命中 评测与基准 :LLM(abstract);分类 cs.AI
AI总结 研究提出JADR协议,通过J空间测量模型内部表示,不依赖外部评判模型,计算本地运行。应用于六个模型跨越三种权重表示形式,以SafetyAUC指标比较,能显著区分不同安全机制模型,捕捉量化差异。
Comments 17 pages, 12 figures
全切片图像多模态基准测试中的数据泄露审计
机构 * University of Virginia(弗吉尼亚大学) ; Merck & Co., Inc.(默克公司)
专题命中 评测与基准 :language model(abstract);分类 cs.LG
AI总结 研究针对计算病理学中WSI VQA基准测试数据泄露问题,通过追踪标识符发现患者级和机构级泄露,证明其可从基础模型特征空间解码,导致准确率差距,当前评估无法区分推理与检索,最后给出无污染评估建议。
重新思考智能体的 harness 进化评估
机构 * Allen Institute for AI(艾伦人工智能研究所) ; University of Washington(华盛顿大学)
专题命中 评测与基准 :LLM(abstract);分类 cs.AI
AI总结 研究重新审视大语言模型智能体的自动 harness 进化评估,通过在可比条件下与基线比较及在保留任务上测试,发现其不总优于简单方法且泛化有限,对其有效性提出质疑,强调需更公平评估协议和基准。
实现对话代理的多维评估:一种具有选择性重新评估和模型基准测试的可扩展、受治理的管道
机构 * Lowes(劳氏公司)
专题命中 评测与基准 :LLM(abstract);分类 cs.AI
AI总结 研究针对零售对话代理评估难题,提出GenAI Evaluation管道,通过规范化等处理生产日志,能评估多维度指标。选择性重新评估提高效率,支持审计。每日处理约50000条记录,已评估超两百万次交互,取得较好分数和准确率。
Comments 14 pages, 1 figure of design of architecture and 2 tables exploring the results and benchmarking
非平稳性下的上下文强化学习:一项综述
机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)
专题命中 评测与基准 :pretraining(abstract);分类 cs.AI
AI总结 该综述围绕非平稳性下的上下文强化学习展开,探讨预训练或微调决策模型在交互中推断规则改善行为的能力。将其定义为策略固定时通过上下文适应问题,关联多种相关技术,并从变化内容、展开方式及智能体可观察性三方面组织文献。
AlphaFunctor:弥合蛋白质功能注释与特性预测之间的差距
专题命中 评测与基准 :foundation model(abstract)
AI总结 研究旨在弥合蛋白质功能注释与特性预测的差距,提出基于范畴论的AlphaFunctor平台,直接从序列预测蛋白质功能并映射到特性预测,经大量数据训练,无需特定任务网络设计,性能优于其他竞争预测器。
GEST引擎:从事件图到合成视频。完整技术报告
机构 * Institute of Mathematics of the Romanian Academy(罗马尼亚科学院数学研究所) ; National University of Science and Technology Politehnica Bucharest(布加勒斯特理工大学) ; Büchi Labortechnik AG(布赫实验室技术公司)
专题命中 评测与基准 :LLM(abstract)
AI总结 GEST引擎从自然语言文本生成多角色视频,核心是明确的世界模型,以GEST表示世界状态。通过程序或智能系统生成GEST,经四阶段管道执行,能输出多种视频相关数据,且保证相关特性,其输出可作视频理解多方面工具。
GTASA:用于视频模型空间时间分析、评估和训练的地面真实标注
机构 * Institute of Mathematics of the Romanian Academy(罗马尼亚科学院数学研究所) ; National University of Science and Technology Politehnica Bucharest(布加勒斯特理工大学)
专题命中 评测与基准 :pretraining(abstract)
AI总结 本文提出GTASA,一种包含多主体视频的标注数据集,通过空间关系图和事件级时间映射,验证了其在视频模型训练和评估中的优势。
通过业务逻辑提取与适应的上下文感知功能测试生成
专题命中 评测与基准 :LLM(abstract)
AI总结 LogiDroid通过业务逻辑提取与适应,实现上下文感知的功能测试生成,显著提升测试用例生成效率。
Comments Accepted by TOSEM (ACM Transactions on Software Engineering and Methodology) 2026
RoboDesign1M:用于机器人设计理解的大规模数据集
机构 * FPT Software AI Center(FPT软件人工智能中心) ; University of Liverpool(利物浦大学) ; University of Information Technology(信息技术大学) ; Automation & Control Institute(自动化与控制研究所) ; Department of Creative Informatics(创意信息系) ; Faculty of Environment and Information Studies(环境与信息科学系)
专题命中 评测与基准 :foundation model(abstract)
AI总结 针对机器人设计领域缺乏大规模数据集的问题,介绍了含100万个样本的RoboDesign1M数据集,提出半自动数据收集管道,经多项实验评估,该数据集可推动机器人设计理解研究及相关自动化发展。
Comments 8 pages, accepted to IROS 2026
面向可扩展性的LLM基人类移动模拟移动感知缓存框架
机构 * Lehigh University(莱维大学) ; State University of New York at Binghamton(纽约州立大学布法罗分校)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 MobCache通过移动感知缓存框架提升大规模LLM基人类移动模拟的效率和保真度。
可解释且可验证的硬件生成:基于LLM驱动的逐步细化
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Fudan University(复旦大学) ; USA(美国)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出结合LLM创造力与形式化方法可解释性的硬件生成框架,通过迭代应用变换规则将设计规范转换为正确性有保证的RTL程序。
TXL融合:一种整合化学启发法和大语言模型的混合机器学习框架,用于拓扑材料发现
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)
AI总结 TXL融合通过整合化学启发法和大语言模型,提升拓扑材料发现的效率与准确性。
加速掩码扩散大语言模型:高效推理技术综述
机构 * KAIST AI(韩国科学技术院人工智能研究所) ; Yonsei University(延世大学)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 综述介绍用于扩散大语言模型的统一延迟分解框架,以理清算法、架构和系统因素对推理速度的影响,将加速技术分类,提供可重复基准测试指导方针并强调实现并行生成潜力的挑战。
Comments Accepted at IJCAI-ECAI 2026 (Survey Track)
Transformer及大语言模型在无人机应用中的最新进展
机构 * LSEA Laboratory, Department of Electrical Engineering, University of Medea, 26000, Algeria(里塞阿实验室,电气工程系,梅迪亚大学,阿尔及利亚) ; Institute of Technology, University Centre Salhi Ahmed, Naama, Algeria(技术研究所,萨利哈·阿赫迈德大学中心,纳马,阿尔及利亚) ; Cybersecurity Institute, Department of Computer Science, University of Liverpool, L69 3BX, Liverpool, UK(网络安全研究所,计算机科学系,利物浦大学,英国) ; LCPTS Laboratory, University of Sciences(LCPTS实验室,科学大学) ; College of Computing(计算学院) ; Data Science, Nanyang Technological University, Singapore.(数据科学,南洋理工大学,新加坡)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 本文综述了Transformer及大语言模型在无人机应用中的最新进展,包括分类、混合模型、强化学习和大语言模型的应用,以及精准农业和自主导航等新兴应用。
Journal ref ACM Computing Surveys, 2026
QDEvo:用于自动启发式设计的多目标质量多样性框架
机构 * Hanoi University of Science and Technology(河内科学技术大学) ; George Mason University(乔治·梅森大学)
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究针对LLMs与进化计算集成用于自动启发式设计时的模式崩溃问题,提出多目标QDEvo框架,结合质量多样性优化与LLM驱动启发式搜索,通过实验证明该框架能发现高性能、高效且语义多样的启发式方法,优于现有方法。
Comments 4 pages; Accepted as poster at GECCO 2026
dMX: 低精度浮点格式的可微分混合精度分配
机构 * AMD
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出可微分混合精度量化框架 dMX,通过连续优化每层浮点格式参数并配合退火调度和正则化项,实现硬件兼容的 MXFP 格式分配,在 LLM 上取得帕累托最优效果。
用于稀疏专家混合模型LLM插拔式负载平衡的复制和量化策略
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Minnesota Twin Cities(明尼苏达大学双城分校) ; North Carolina State University(北卡罗来纳州立大学) ; Meta AI ; Stevens Institute of Technology(史蒂文斯理工学院)
专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 提出Replicate-and-Quantize策略,通过动态工作量重新平衡提升稀疏混合专家模型LLM的推理效率和稳定性。
用于消费级设备上混合CPU - GPU大语言模型推理的自动张量调度
机构 * School of Computer Science, Nanjing University(南京大学计算机科学学院)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究在消费级设备运行大语言模型时因模型权重超GPU内存需卸载推理的问题,提出ATSInfer系统,通过结合静态张量放置与负载感知动态传输及异步协调,在代表性平台评估,相比现有系统显著提升吞吐量、利用率等,改善本地大语言模型部署体验。
保持策略梯度主导:面向长程工具使用智能体的兄弟引导信用蒸馏
机构 * Amazon Web Services(亚马逊云服务)
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对长程工具使用强化学习中轨迹级优势信号稀疏的问题,提出兄弟引导信用蒸馏(SGCD),通过动态采样成功与失败轨迹、外部LLM对比生成逐步信用参考,实现密集信用分配,在AppWorld和τ³-airline任务上显著提升性能。
遵循潜在路径:利用锚定令牌导航扩散LLM的可撤销解码
机构 * King's College London(伦敦国王学院) ; The Chinese University of Hong Kong(香港中文大学) ; The Alan Turing Institute, UK(英国艾伦·图灵研究所)
专题命中 效率与部署 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对扩散大语言模型解码速度与质量的权衡,提出无训练框架ASRD,通过锚定令牌解耦上下文,结合锚定引导生成与锚定扰动验证,在数学和编码基准上提升准确率6.4%,加速推理7.2倍。
注意力折扣自适应采样器用于掩码扩散语言模型
机构 * University of Bern(伯尔尼大学) ; EPFL(瑞士联邦理工学院洛桑分校)
专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 针对掩码扩散语言模型并行解码中候选词交互导致的不安全问题,提出训练无关的重排序规则ADAS,通过注意力折扣软惩罚改进子集构建,在多个基准上提升低NFE性能。