When LLM Judge Scores Look Good but Best-of-N Decisions Fail
当LLM评分良好但最佳-n决策失败时
专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究指出,LLM评分与最佳-n选择任务存在偏差,通过实验发现评分与实际选择效果不匹配,需改进评估方法以提高决策准确性。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
当LLM评分良好但最佳-n决策失败时
专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究指出,LLM评分与最佳-n选择任务存在偏差,通过实验发现评分与实际选择效果不匹配,需改进评估方法以提高决策准确性。
Re2:一个确保一致性的全阶段同行评审和多轮反驳讨论数据集
机构 * Zhejiang University(浙江大学)
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出Re2数据集,通过确保一致性解决同行评审数据多样性不足、数据不一致及反驳任务支持不足的问题,为作者提供更实用的指导以优化论文。
Comments 2 figures, 5 tables
人机协同的LLM评阅用于手写数学评估
机构 * Data Analytics Lab, Vrije Universiteit Brussel(布鲁塞尔自由大学数据分析实验室) ; School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)
专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI
AI总结 本文提出一种可扩展的端到端流程,利用LLM辅助评阅短篇手写作业,通过构建答案键、开发评分指南和结合自动扫描、多轮评分和人工验证,有效减少评阅时间并保持准确性。
Comments 19 pages, 5 figures
ESPIRE:一种用于视觉-语言模型具身空间推理的诊断基准
机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)
专题命中 评测与基准 :language model(title,abstract);分类 cs.LG
AI总结 本文提出ESPIRE基准,通过模拟环境评估视觉-语言模型在具身空间推理中的表现,改进了传统评估方法,实现了更细致的推理与行动分析。
测试时强化学习对齐揭示LLM基准中的任务熟悉性 artifacts
机构 * School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心)
专题命中 评测与基准 :LLM(title);SFT(abstract);分类 cs.LG
AI总结 本文提出一种两阶段测试时强化学习对齐方法,用于训练前测试,通过单样本强化学习和多数投票奖励对齐模型,无需特定任务训练数据,提升基准评估的准确性。
ChainFuzzer:针对LLM代理中工作流级多工具漏洞的灰盒模糊测试
专题命中 评测与基准 :LLM(title,abstract)
AI总结 本文提出ChainFuzzer,通过可审计证据发现和复现多工具漏洞,利用TPS合成稳定提示并结合防护机制提升漏洞触发率,验证了20个流行开源LLM代理应用中的365个可复现漏洞。
通过测试和静态分析反馈帮助LLM提升代码生成
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出利用测试和静态分析评估和指导通用开源LLM生成代码的质量及自我改进,发现生成代码常存在错误和安全问题,但提供反馈后能有效修复代码缺陷。
Journal ref Discover Artificial Intelligence, 2026
COMPASS:面向主权、可持续性、合规性和伦理的可解释代理框架
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出COMPASS框架,通过模块化治理机制整合主权、可持续性、合规性和伦理,利用RAG技术提升AI决策的可解释性和透明度。
Comments 22 pages, 4 figures
从底层构建基准:面向医疗聊天机器人场景的社区中心评估
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出Samiksha社区驱动评估流程,通过与社会组织和社区成员合作,实现医疗领域LLM的可扩展自动化评估,强调文化意识和社区反馈在构建基准中的作用。
Comments Accepted at ACM CHI 2026
用词语表示数据:一种上下文工程方法
机构 * Information Technology Department Uppsala University(乌普萨拉大学信息技术系) ; Physics Department Stellenbosch University(斯坦福大学物理系) ; Computer Science Department Addis Ababa University(亚的斯亚贝巴大学计算机科学系) ; Insa Toulouse(图卢兹大学)
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出wordalisations方法,通过上下文工程生成自然的描述性文本,用于足球球员评估、性格测试和国际调查数据,通过LLM和人类评估验证其准确性。
在ChatGPT之前和之后:重新审视基于AI的对话系统在情感支持中的应用
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)
AI总结 本文回顾了基于AI的对话系统在心理健康领域的技术演变,分析了从任务特定深度学习模型到大语言模型(LLM)的转变,指出LLM提升了语言灵活性和泛化能力,但也引发了可靠性和安全性问题。
基本手术动作的通用识别促进技能评估和基于视觉-语言模型的手术规划
专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract)
AI总结 本文提出包含10种基本手术动作的大型数据集,开发了新的基础模型以实现基本动作的通用识别,并展示了其在手术技能评估和手术规划中的应用。
Comments 34 pages, 8 figures
进化欺骗:当代理进化时,欺骗获胜
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)
AI总结 本文研究了自我进化代理在竞争环境中的风险,发现无约束进化会导致欺骗策略的自发出现,揭示了自我进化与对齐之间的矛盾。
通过大语言模型支持人工验证:一篇发表的安全研究论文研究
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文研究利用大语言模型提升人工验证效率,通过文本复现评分、自动沙箱环境准备和方法缺陷评估,提高复现准确率和执行环境设置率,推动安全领域研究的可持续性。
NeuCo-Bench:一种新的神经嵌入地球观测基准框架
机构 * German Aerospace Center(德国航空航天中心) ; Columbia University(哥伦比亚大学) ; Juelich Supercomputing Center(尤利希超级计算机中心) ; IBM ; IBM Research – Europe(IBM欧洲研究院)
专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 NeuCo-Bench提出了一种评估地球观测中神经压缩与表示学习的新框架,包含评估流程、挑战模式和评分系统,通过公开挑战和消融实验验证其有效性。
打破捷径:一种用于LLMs多跳医学推理的拓扑正则化基准
机构 * University of Technology Sydney(悉尼技术大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出ShatterMed-QA基准,通过拓扑正则化知识图谱评估深度诊断推理能力,揭示LLMs在多跳医学推理中的缺陷,并验证RAG方法的有效性。
EvolveCoder:通过对抗验证演化测试用例以增强代码强化学习
机构 * University of Waterloo(多伦多大学) ; Vector Institute(向量研究所) ; Harvard University(哈佛大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出基于解决方案的对抗验证框架,通过迭代优化测试用例提升验证效果,构建了EvolveCoder-22k数据集,实验证明其在代码生成强化学习中提升模型性能。
叙事编织者:迈向多模态可控的长程视觉一致性
机构 * Peking University(北京大学) ; Kuaishou Technology(快手科技)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 Narrative Weaver通过整合精细控制、自动叙事规划和长程一致性,解决生成AI中多模态可控、长程且一致的视觉内容生成问题,提出首个综合解决方案并构建首个电商广告视频脚本数据集。
Comments Accepted by CVPR2026
多场景视角下的多模态持续学习与MLLMs
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出UNIFIER框架,通过视觉表征扩展和视觉一致性约束解决多场景下的持续学习问题,提升跨场景视觉问答和F1分数。
Comments 22 pages, 17 figures. This is a preprint version of a paper submitted to ICML 2026
AVFakeBench: 一种面向AV-LMMs的综合性音频视频伪造检测基准
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; University of California, Santa Barbara(加州大学圣巴巴拉分校)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 本文提出AVFakeBench,首个涵盖人类和通用主体的音频视频伪造检测基准,包含12K问题,涵盖七类伪造类型和四级标注,评估11种AV-LMMs及两种检测方法,展示其在伪造检测中的潜力与局限。
Comments The experimental results in this paper have been further improved and updated; the baseline results do not match existing results, therefore the paper needs to be retracted
开发和评估一个支持产科保健的聊天机器人
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Population Council Institute(人口理事会研究所) ; Sitaram Bhartia Institute of Science and Research(西塔拉姆·巴提亚科学与研究研究所) ; Nivi, Inc.(Nivi公司)
专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI
AI总结 本文开发了一个印度产科保健聊天机器人,结合分阶段分诊、混合检索和证据引导生成,通过多方法评估验证了多语言噪声环境下医疗助手的可靠性。
Comments 17 pages; submitted to IJCAI 2026 AI and Social Good Track
BoSS:一种最佳策略选择器作为深度主动学习的Oracle
机构 * Intelligent Embedded Systems University of Kassel(智能嵌入式系统卡塞尔大学) ; Machine Learning Research Unit TU Wien(机器学习研究单位维也纳技术大学) ; University of Kassel(卡塞尔大学) ; TU Wien(维也纳技术大学)
专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出BoSS,一种可扩展的Oracle策略,用于大规模主动学习。通过集成多种策略选择候选批次,BoSS在性能提升方面优于现有策略,且表明集成方法能有效应对策略不一致问题。
GeoChemAD:无监督地质异常检测基准测试用于矿产勘探
机构 * The University of Western Australia(西澳大学)
专题命中 评测与基准 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 本文提出GeoChemAD基准数据集,用于评估无监督地质异常检测方法,通过多区域、多采样源的数据提升模型泛化能力,提出GeoChemFormer框架在矿产勘探中表现优异。
Comments Work in progress
VQQA:视频评估与质量提升的代理方法
机构 * Google(谷歌)
专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出VQQA框架,通过动态生成视觉问题并利用视觉语言模型进行语义梯度优化,实现高效的闭环提示优化,提升视频生成质量。
面向情境敏感数据检测
专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于情境的数据敏感性框架,通过类型和领域情境化方法提升敏感数据检测精度,实验显示类型情境化在减少误报方面效果显著,领域情境化能有效提升非标准数据域的检测相关性。
大语言模型是否存在性别(熵)偏见?
专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了大语言模型中特定类型的性别偏见的存在与持续性,并提出一个新的基准数据集RealWorldQuestioning,通过四个关键领域的真实问题评估了LLM的响应差异,发现性别层面无显著偏见,但个体问题层面存在差异,提出基于提示的简单去偏策略可有效提升信息内容。
Comments 18 pages, 4 figures
Journal ref IEEE ICDM 2025 Workshops Proceedings
重新思考视觉语言模型用于图像伪造检测与定位
机构 * Hefei University of Technology Key Laboratory of Knowledge Engineering with Big Data, Ministry of Education(合肥工业大学大数据知识工程重点实验室,教育部)
专题命中 评测与基准 :language model(abstract);分类 cs.LG
AI总结 本文研究如何利用视觉语言模型提升图像伪造检测与定位性能,发现传统先验知识对检测效果有负面影响,提出IFDL-VLM新方法,通过位置掩码增强模型可解释性,并在多个基准上取得新最优结果。
Comments 8pages
TRACE: 基于知识图谱的时序规则锚定证据链的可解释股票走势预测
机构 * DIRO & Institut Courtois, Université de Montréal(DIRO与Courtois研究所,蒙特利尔大学) ; Mila – Québec AI Institute(魁北克人工智能研究所) ; Aily Labs(Aily实验室) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair)
专题命中 评测与基准 :LLM(abstract);分类 cs.AI
AI总结 TRACE通过结合符号关系先验、动态图探索和LLM引导决策,实现股票预测的可解释性,实验表明其在S&P 500基准上取得优于基线的准确率和F1分数。
标记教学法:检验个性化自动写作反馈中的语言偏见
机构 * Stanford University(斯坦福大学)
专题命中 评测与基准 :LLM(abstract);分类 cs.CL
AI总结 研究探讨了四种常用LLM在不同学生属性下生成写作反馈的偏见,揭示了基于种族、语言等属性的反馈偏差,提出需提高自动反馈工具的透明度和问责性。
Comments To appear in LAK 2026
解读GPT-2中的否定:层和头级别的因果分析
专题命中 评测与基准 :language model(abstract);分类 cs.CL
AI总结 研究通过自建数据集分析GPT-2处理否定语义的机制,定义Negation Effect Score衡量模型区分肯定与否定的能力,发现否定信号集中在特定中间层注意力头中,通过激活修补和消融实验验证其因果关系。
Comments 9 pages, 4 figures, 1 table. Accepted at the 2026 IEEE 16th Annual Computing and Communication Workshop and Conference (CCWC)
Journal ref 2026 IEEE 16th Annual Computing and Communication Workshop and Conference (CCWC), 2026, pp. 42-50