Lacuna: A Research Map for Machine Learning
Lacuna:机器学习研究地图
专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI
AI总结 提出Lacuna研究地图,利用LLM将论文转化为摘要、概念、方向和建议,在多项基准上超越OpenScholar,并评估了多阶段报告代理Lacuna Deep Research的性能。
Comments 14 pages, 3 figures. Preprint
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
Lacuna:机器学习研究地图
专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI
AI总结 提出Lacuna研究地图,利用LLM将论文转化为摘要、概念、方向和建议,在多项基准上超越OpenScholar,并评估了多阶段报告代理Lacuna Deep Research的性能。
Comments 14 pages, 3 figures. Preprint
确定性审计中的概率性智能体:基于德国IT-Grundschutz的自动化审计多智能体系统评估
机构 * Department of Mathematics and Computer Science(数学与计算机科学系) ; Freie Universität Berlin(柏林自由大学)
专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI
AI总结 提出结合混合检索增强生成的多智能体系统架构,通过假设验证循环和解耦推理流水线部分自动化IT-Grundschutz认证,实验表明在语义任务上高效但在逻辑推理阶段受限于LLM的概率性。
Comments Accepted for publication at the 2026 IEEE International Systems Conference (SysCon), Halifax, NS, Canada, April 6-9, 2026. 8 pages, 1 figure
基于公式驱动的在线策略蒸馏综述与研究议程
机构 * Tsinghua University(清华大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI
AI总结 本文提出一种公式驱动的分类法,将在线策略蒸馏(OPD)视为反馈到更新的问题,区分直接分布损失和策略梯度式对数比更新,并揭示状态兼容性、支持构建、时间信用、词汇路由等关键因素。
用于肺栓塞风险评估的高效多模态临床问答
机构 * University of Auckland(奥克兰大学) ; University of Cambridge(剑桥大学) ; University of Adelaide(阿德莱德大学) ; University of Melbourne(墨尔本大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI
AI总结 本研究构建了基于INSPECT数据集的肺栓塞多模态基准,通过结构化问答任务评估高效多模态大模型在CTPA和EHR输入下的诊断与预后性能,发现Gemma4模型在结合CTPA+EHR时表现更优,且诊断任务优于预后任务。
基于源数据的文本到JSON学习数据生成
机构 * Seoul National University(首尔大学)
专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL
AI总结 提出STAGE方法,利用电子表格作为源数据,通过LLM生成报告和JSON模式,并验证真实值,显著提升文本到JSON任务的训练数据质量。
Comments Preprint
基准测试幻觉:剪枝后的大语言模型能通过多项选择但无法回答问题
机构 * Institute of Science Tokyo(东京科学大学) ; Tohoku University(东北大学) ; Nanyang Technological University(南洋理工大学) ; KTH Royal Institute of Technology(瑞典皇家理工学院) ; Shandong University(山东大学)
专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究发现,高稀疏度剪枝后的大语言模型在多项选择评估中表现良好,但在开放生成中无法正确回答相同问题,揭示了基准测试的盲点。
超越NL2Code:多模态代码智能的结构化综述
机构 * Meituan(美团) ; The University of Hong Kong(香港大学) ; The Chinese University of Hong Kong(香港中文大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Nanjing University(南京大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所) ; Ludwig Maximilian University of Munich(慕尼黑大学) ; University of Science and Technology of China(中国科学技术大学) ; Queen Mary University of London(伦敦玛丽女王大学)
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文系统综述多模态代码智能,将任务按代码角色分类,覆盖GUI、科学可视化、结构化图形及前沿任务,并提出四个基于验证的未来方向。
Comments Work completed in January 2026. Updating now
QIAS 2026:伊斯兰继承推理共享任务综述
机构 * Hamad bin Khalifa University(哈马德·本·哈利法大学) ; Nazarbayev University(纳扎尔巴耶夫大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL
AI总结 本文介绍 QIAS 2026 共享任务,评估大语言模型在伊斯兰继承领域的复杂推理能力,基于 MAWARITH 数据集,使用 MIR-E 多步指标评估,16 支队伍参与,结果显示该任务对当前模型极具挑战性。
基于多模态大语言模型的移动用户体验推理:任务、基准与方法
机构 * Ant Group(蚂蚁集团)
专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI
AI总结 提出UXBench基准(2000个VQA样本)评估多模态大模型在UI推理上的能力,并设计UI-UX模型,通过奖励路由和不对称过渡奖励机制在UXBench上达到0.7963准确率,超越Claude-4.5-Sonnet。
Comments 10 pages, 6 figures, Accepted at CVPR 2026 Findings
Polar: 评估大语言模型中政治偏见的基准
机构 * Graduate School of Data Science, Seoul National University(首尔大学数据科学研究生院) ; Dept. of Computer Science and Engineering, Seoul National University(首尔大学计算机科学与工程系)
专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出Polar基准,通过选项级似然度测量大语言模型的政治偏见,覆盖美国和韩国政治语境,发现偏见随语境、议题、模型组和语言变化。
Comments Submitted to ARR 2026 May cycle
HybridCodeAuthorship:一个用于行级代码作者归属检测的基准数据集
专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对现有基准无法反映真实AI代码助手使用场景的问题,提出HybridCodeAuthorship数据集,包含交错的人类和AI编写代码行,并评估两种检测算法性能。
Comments Accepted to LREC 2026
Journal ref LREC 2026 proceedings (pp. 1520-1532)
指令调优大语言模型解码时真实性方法的受控研究
机构 * Independent Researcher(独立研究员)
专题命中 评测与基准 :LLM(abstract_cn);language model(abstract);prompting(abstract);分类 cs.CL
AI总结 本研究通过分析每层令牌logits特征,提出CHAIR框架检测幻觉,在TruthfulQA和MMLU上显著提升零样本检测准确率。
Spatial-Omni:通过FOA编码在多模态大语言模型中实现空间音频理解
机构 * Zhejiang University(浙江大学) ; Tencent Hunyuan(腾讯文心)
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出Spatial-Omni,通过SO-Encoder将一阶Ambisonics空间音频注入现有全模态大语言模型,以轻量方式实现空间音频理解,并在构建的SO-Bench基准上超越现有模型。
BenSyc: 孟加拉语上下文中大语言模型对话谄媚与人类对齐的基准测试
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Virginia Tech(弗吉尼亚理工大学) ; Bangladesh University of Engineering and Technology(孟加拉工程与技术大学) ; BRAC University(BRAC大学) ; University of Toronto(多伦多大学)
专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出BenSyc基准,基于孟加拉语社交数据构建五级标注集,评估15+模型在对话对齐分类与生成任务上的表现,发现前沿模型在区分共情与强化性认可上仍存在困难。
OmniGameArena: 一个统一的UE5基准测试,用于具有改进动态的VLM游戏智能体
机构 * The University of Hong Kong(香港大学) ; LIGHTSPEED ; The Chinese University of Hong Kong(香港中文大学) ; Tsinghua University(清华大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI
AI总结 提出OmniGameArena,一个包含12个UE5游戏的统一基准,以及改进动态曲线(IDC),通过反思机制评估VLM智能体的冷启动分数、改进动态和泛化能力。
超越通过率:开放代码大语言模型的多语言、执行基础评估
机构 * Sayed Erfan Arefin
专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI
AI总结 针对12种编程语言的2707道LeetCode问题,评估9个开放代码LLM,发现最佳模型Yi-Coder-9B-Chat的正确率仅23.64%,远低于人类57.2%的基准,且排名因问题难度和语言而异,编译错误占失败原因的63.25%。
措辞效应:量化大语言模型基准测试性能中的双向漂移
机构 * IBM Research India(IBM印度研究院) ; IBM Research Almaden(IBM阿尔马登研究院)
专题命中 评测与基准 :LLM(title);分类 cs.CL、cs.AI
AI总结 该研究提出BenchDrift方法,通过生成基准问题的保义变体,发现大语言模型性能存在双向漂移,且漂移与重新措辞相关,模型性能提升未消除措辞敏感性。
RamanPFN:基于表格基础模型学习拉曼光谱结构
机构 * Beihang University(北京航空航天大学) ; Cleer Science(Cleer科技公司)
专题命中 评测与基准 :foundation model(title);分类 cs.AI、cs.LG
AI总结 RamanPFN在TabPFN推理前编码拉曼光谱依赖关系,经74个公开拉曼数据集的150项任务评估,可降低回归与分类误差,是高维拉曼测量与可复用表格推理的有效接口。
超越全局规范:无需重新训练即可在语言模型中实现毒性敏感性个性化
机构 * Delft University of Technology(代尔夫特理工大学)
专题命中 评测与基准 :language model(title);分类 cs.CL、cs.AI
AI总结 研究如何在语言模型中实现毒性敏感性个性化,通过对免训练方法在三个推理阶段进行比较评估,与PRISM数据集目标对比,各方法降低对齐误差28 - 47%,揭示了多目标间权衡。
评估审稿人指南设计对基于大语言模型的自动同行评审的影响
机构 * Keio University(庆应义塾大学) ; NEC Corporation(日本电气公司)
专题命中 评测与基准 :LLM(title);分类 cs.CL、cs.AI
AI总结 研究分析不同类型审稿人指南对基于大语言模型的自动同行评审的影响,通过实验发现官方会议指南效果最佳,模仿审稿人指南较差,且严格评分标准会降低性能,强调主观和整体评分的重要性。
Comments 18 pages, 2 figures, ACL 2026 Findings
SeT-Diff:面向高性能计算遥测和时间序列的语义基础模型
机构 * University of Bologna(博洛尼亚大学) ; CINECA(意大利国家科研计算中心)
专题命中 评测与基准 :foundation model(title);分类 cs.AI、cs.LG
AI总结 针对数据中心计算节点建模需求,提出SeT-Diff基础模型,采用基于扩散的方法,在真实超级计算机数据集实验中,其重建任务平均绝对误差为0.0470,有零样本排列稳定性,单个模型可有效执行多种任务,是高性能计算系统有效的数据驱动数字孪生。
路由子空间:审计微调语言模型中评估到部署的不匹配
机构 * Centre for Industrial Software, University of Southern Denmark(南丹麦大学工业软件中心) ; ProMake(宝迈可)
专题命中 评测与基准 :language model(title);分类 cs.CL、cs.AI
AI总结 研究微调语言模型评估到部署的不匹配问题,提出在路径修补告知的中深度窗口拟合配对激活对比并修改结果坐标的方法,在多个模型实例中缩小了差距,还指出单坐标审计的局限性,此审计用于诊断微调检查点。
CRAFT:聚类评分标准以诊断大型语言模型的能力短板并生成针对性的微调数据
机构 * Scale AI(Scale人工智能公司)
专题命中 评测与基准 :LLM(title);分类 cs.AI、cs.LG
AI总结 研究针对评估应指导模型改进及提供训练数据的问题,提出CRAFT方法,将评分标准评估数据集转化为模型能力短板诊断,通过聚类能力描述、评估模型节点等生成微调数据,实验表明该方法能更精准诊断模型弱点并提升性能。
Comments 18 pages, 3 Tables, 2 Figures
ConflictScore: 识别和衡量语言模型如何处理冲突证据
专题命中 评测与基准 :language model(title);分类 cs.CL、cs.AI
AI总结 提出ConflictScore指标,通过将回答分解为原子声明并与证据文档对比,量化模型对冲突证据的识别程度,实验表明该指标能有效检测过度自信声明并提升真实性。
频谱-时间干扰混淆空间音频基础模型中的相位编码
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Jilin University(吉林大学) ; Hunan University(湖南大学) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 评测与基准 :foundation model(title);分类 cs.CL、cs.AI
AI总结 提出基于双耳掩蔽级差的心理声学基准,评估空间自监督音频模型对微秒级耳间相位精细结构的编码能力,发现通用双耳SSL模型依赖频谱-时间干扰纹理而非真实相位计算。
Comments Accepted to INTERSPEECH 2026; 6 pages, 3 figures
面向更好评估大型语言模型(LLMs)在临床错误检测中的性能
机构 * University of Delaware(特拉华大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究针对LLMs临床错误检测评估的不足,通过多语言多模型实验发现多数LLMs配对判别能力差,提出用配对评估补充聚合指标的改进方案。
Comments Accepted at Machine Learning for Healthcare (MLHC) 2026; to appear in Proceedings of Machine Learning Research (PMLR), Vol. 340
BOCoDe:面向工程设计的贝叶斯优化基准测试
专题命中 评测与基准 :LLM(abstract,abstract_cn);foundation model(abstract)
AI总结 该研究针对贝叶斯优化的基准测试与工程设计场景不匹配的问题,推出开源BOCoDe基准集,含307个黑盒优化问题,评估31种算法,发现标准基准排名无法迁移至工程任务,为BO方法开发提供支撑。
大型语言模型(LLMs)知道该问什么以及何时提问吗?评估多轮信息获取能力
机构 * Harvard University(哈佛大学) ; Google DeepMind(谷歌DeepMind)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究构建MT-InfoSeek评估套件,从提问内容、时机及信息影响三方面评估LLMs的多轮信息获取能力,发现其存在低估信息需求等缺陷,且该能力未被现有评估覆盖。
条件 regime 验证:安全分类器适配与监控的正确性估计
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出 Regime-Conditional Verification(RCV),通过轻量级封装器适配安全分类器,在不重新训练的情况下提升策略遵守度,可检测分布偏移并仅在必要时微调,在多分类器、数据集及部署场景中表现优异。
Comments 16 pages including technical appendix, 6 figures
SteerBench-Work:动作边界处智能体决策的基准测试
机构 * AgentDock
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究推出职场智能体动作边界决策基准SteerBench-Work,发现模型在该任务中存在过度拒绝的显著偏差,且通用能力与引导校准并不等同。