Cheap Reward Hacking Detection
廉价奖励黑客检测
机构 * Tamarillo
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 提出用小Transformer编码器将轨迹映射到单位球面,使嵌入距离近似奖励与元数据的L1距离,线性探针检测奖励黑客,AUC达0.9467,成本比LLM-as-judge低四个数量级。
Comments 20 pages, 6 figures, 12 tables
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
廉价奖励黑客检测
机构 * Tamarillo
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 提出用小Transformer编码器将轨迹映射到单位球面,使嵌入距离近似奖励与元数据的L1距离,线性探针检测奖励黑客,AUC达0.9467,成本比LLM-as-judge低四个数量级。
Comments 20 pages, 6 figures, 12 tables
摘要生成尚未消亡
机构 * Saarland University(萨尔大学) ; Max Planck Institute for Informatics(马克斯·普朗克信息学研究所) ; University of Cambridge(剑桥大学) ; University of Edinburgh(爱丁堡大学) ; Zhejiang University(浙江大学) ; Tencent YouTu Lab(腾讯优图实验室)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 通过多维度评估,发现人类参考摘要在信息量和忠实度上仍优于大语言模型,后者仅在表面连贯性和流畅性上占优,表明摘要生成研究仍有挑战。
UrduMMLU:乌尔都语理解的大规模多任务基准
机构 * MBZUAI
专题命中 评测与基准 :LLM(summary_cn,abstract_cn);prompting(abstract);分类 cs.CL、cs.AI
AI总结 针对乌尔都语缺乏本地教育来源的MMLU风格基准,提出包含26,431道多选题的UrduMMLU,覆盖26个学科,评估30个LLM发现Gemini-3.5-Flash最佳,多数模型在人文科目上表现差。
Comments 27 pages, 18 figures, 17 tables, Submitted to ARR May 2026
OpenHalDet:面向多种生成场景的幻觉检测统一基准
机构 * University of Technology Sydney(新南威尔士大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; University of Bristol(布里斯托大学) ; The University of Queensland(昆士兰大学) ; Nanyang Technological University(南洋理工大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出OpenHalDet基准,标准化幻觉检测评估流程,支持黑盒、灰盒、白盒检测器,实现跨任务、模型和检测器的可控比较。
Comments Preprint. Code and data are available at https://github.com/Nellie179/Hallucination-Detection
基于大语言模型增强的语义感知类型检查的漏洞发现
专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)
AI总结 本文提出语义感知类型系统SETYPE,由LLMs执行类型推断与检查,构建PYSETYPE原型,在真实Python Web应用中实现87%精度、88%准确率,识别出15个潜在零日漏洞,9个获开发者确认。
TRAPSBench:视觉-语言模型可编码认知约束却无法表达
机构 * Meta Superintelligence Labs(元超级智能实验室) ; Reflection AI(反射人工智能公司)
专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对视觉-语言模型的认知约束表达问题,构建TRAPSBench基准并提出PECS指标,发现模型可感知不确定性却难表达,瓶颈在表达,需输出阶段干预。
Comments 10 Pages excluding Reference and Appendix, Published at COLM 2026
2026 IEEE SLT智能眼镜挑战赛:基于音频-语言模型的自我中心多说话人语音识别与理解基准测试
专题命中 评测与基准 :language model(title,abstract);large language model(abstract)
AI总结 本文介绍IEEE SLT 2026智能眼镜挑战赛,构建含714个真实场景会话的106小时四通道自我中心语音数据集,评估TSA-ASR与SLU,发现说话人重叠影响TSA-ASR性能、音频-语言模型难理解副语言声学。
Comments 7 pages, 7 figures
IF:CARGO:面向AI原生规则编程游戏的基于大语言模型的语义编译
专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)
AI总结 本研究通过实验性益智游戏IF:CARGO,将大语言模型用作语义编译器而非游戏代理,开展24人混合方法游戏测试,提出AI原生游戏需约束自然语言输入、保留玩家创作权并确保确定性执行的模式。
Comments Accepted to 2026 AAAI Conference on Artificial Intelligence and Digital Interactive Entertainment (AIIDE)
Pseudo2CodeQA:面向基于大语言模型的代码生成中结构化算法推理的基准测试
专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)
AI总结 本文提出Pseudo2Code基准测试及Pseudo2Code Agentic Framework,实验表明该框架性能优于现有基线,验证了结构化伪代码对代码生成的提升作用。
Comments 8 pages, 3 figures
EcoAgent-Bench:评估预算约束下大语言模型智能体的经济决策能力
专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出EcoAgent-Bench基准,评估大语言模型智能体在预算约束下的经济决策能力,发现现有智能体在该任务上表现不佳,发布了相关研究资源。
Comments 8 pages, 3 figures, 4 tables. Benchmark, dataset (304 budget-conditioned agent tasks), and evaluation harness; artifacts to be released
脑电基础模型能否迁移至语音?显性与想象语音解码的基准测试
机构 * University of Granada, Spain(格拉纳达大学) ; Research Centre for Information and Communication Technologies (CITIC-UGR), Spain(信息与通信技术研究中心) ; University of Chouaib Doukkali, Morocco(舒艾卜·杜卡利大学) ; Brain, Mind, and Behavior Research Center (CIMCYC), University of Granada, Spain(大脑、心智与行为研究中心)
专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract)
AI总结 本文开展首个脑电基础模型语音解码基准测试,对比LaBraM等模型与EEGNet等基线,发现通用脑电预训练未在语音任务上展现一致优势,为语音专用基础模型研究提供依据。
Comments 6 pages, 1 figure, 3 tables, submitted to IberSPEECH 2026
代码语言模型是否利用测试?测试驱动代码生成的行为与表征研究
专题命中 评测与基准 :language model(title,abstract);large language model(abstract)
AI总结 该研究以Qwen2.5-Coder-7B和Qwen3.6-27B为对象,针对多个代码生成任务探究代码语言模型对测试的利用情况,发现测试通过语义引导和上下文扰动影响模型,仅表征变化不代表有效利用测试。
ReCon:用于跨摄取和检索管道的基于大语言模型的网络安全合规性的资源受限基准测试
专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)
AI总结 研究政府、企业和机构网络安全合规问题,利用无需GPU和高内存的大语言模型进行合规检查任务基准测试,实验证明低资源大语言模型在政策文件合规检查中可提供良好一致性/准确性。
Comments 22 pages, 5 figures
DBA-Bench:基于大语言模型的数据库操作代理的生产保真度基准测试
机构 * University of Electronic Science and Technology of China(电子科技大学)
专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究基于大语言模型的数据库操作代理评估问题,提出DBA-Bench基准测试,通过生产保真度等解决评估与生产操作差距,含多场景和难度标签,评估多基线组,揭示安全端到端修复困难。
Comments 14 pages, 6 figures, 2 tables
大语言模型多智能体网络中的可靠性传播可行性
专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)
AI总结 研究大语言模型多智能体网络中错误主张传播问题,制定校正感知网络模型并结合多数投票基准,推导早期入侵条件等,通过模拟和实验得出相关结果,为在可靠性和传播约束下选择连通性提供依据。
使用大语言模型引导的约束合成实现zkEVM的自动化形式验证
专题命中 评测与基准 :LLM(title,abstract);prompting(abstract)
AI总结 研究针对zkEVM因实现错误可能破坏加密保证的问题,提出VeriSynth框架,通过大语言模型引导从Rust代码合成验证模型,采用混合范式及集成多种技术处理状态转换,在验证基准上错误检测率超90%,远超基线。
Comments 11 pages
使用小型多模态语言模型进行伤口分类的上下文学习
机构 * Jönköping University(延雪平大学) ; Halmstad University(哈尔姆斯塔德大学) ; Mölnlycke Health Care(墨尼克医疗保健公司) ; Centre for Reliable Machine Learning, Royal Holloway, University of London(伦敦大学皇家霍洛威学院可靠机器学习中心)
专题命中 评测与基准 :language model(title,abstract);prompting(abstract)
AI总结 研究评估小型多模态语言模型能否通过基于检索的上下文学习为伤口分类提供免训练替代方案,使用两个数据集和多种方法实验,结果显示查询条件下的上下文学习效果较好,Qwen 3.5 27B搭配kNN+MMR表现最佳,该方法可实现适应性伤口图像分类。
世界杯竞技场:语言模型和深度研究代理在足球预测上的细粒度评估
机构 * Shanghai Jiao Tong University(上海交通大学) ; McGill University(麦吉尔大学) ; University College London(伦敦大学学院)
专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 介绍世界杯竞技场这一语言模型和深度研究代理的动态基准,用于足球预测。模型赛前接收证据或自行搜索信息进行多项预测,赛后与实际结果对比。通过多指标评估104场比赛和13个系统,展示不同模型表现及与基线对比情况,且新赛程可添加用于评估未来模型。
挖掘工作流图用于对话式大语言模型代理的黑盒边界测试
专题命中 评测与基准 :LLM(title,abstract);prompting(abstract)
AI总结 研究针对对话式大语言模型代理内部工作流失败难测问题,提出黑盒测试框架AgentEval,通过挖掘对话工作流图,利用其结构枚举测试目标,执行测试,在与白盒审计器对比测试中,能有效覆盖多个不同边界,降低重复率和误报率。
我关心的音乐:对(几乎)任何音乐的大语言模型音乐感知技能进行自动化多模态基准测试
机构 * Charles University(查尔斯大学) ; Brno University of Technology(布拉格技术大学)
专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)
AI总结 针对当前音乐基准测试的局限,引入MusICA-MetaBench框架,利用结构化符号表示和预定义模板生成按需基准测试,通过ChoraleBricks数据集展示并确定规模,经与基线比较证明能测音乐感知,推动了大语言模型音乐感知跨模态评估。
Comments 9 pages, 4 figures, 4 tables
编码代理能否实现错过的编译器优化?在LLVM窥孔优化上评估大语言模型代理
专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)
AI总结 研究编码代理能否开发编译器优化,引入PeepholeBench框架,其任务来自LLVM的实际窥孔优化问题,通过对比衡量编码代理与人工修复,发现正确性和收益性间存在矛盾及主要失败模式,为编码代理提供了现实且具挑战性的基准。
情感AI安全:LLM安全中缺失的一环
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 本文提出情感安全作为AI安全的新类别,分类情感伤害类型,并指出现有框架未能充分应对,呼吁建立专门框架处理累积性、关系性和身份层面的影响。
为什么机器误读教学质量:基于LLM的前测问题评估中的人机对齐
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 针对大规模前测问题设计挑战,提出AI辅助工作流,通过2x2实验发现人机分歧具有系统性,且评分标准修订比对齐效果更大,两者互补。
重新思考突发缓冲区优化:通过混合分析和LLM指导实现布局异构性
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 提出Proteus系统,通过结合静态代码结构和轻量级运行时信号重建I/O意图,在无需训练或详尽分析的情况下优化突发缓冲区的数据布局,实现高达3.24倍和2.9倍的写密集和元数据密集工作负载加速。
胸部X光片的视觉-语言模型并不总是需要图像
机构 * Pattern Recognition Lab, Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-埃尔朗根-纽伦堡大学模式识别实验室) ; Department of Diagnostic and Interventional Radiology, TUM University Clinic, School of Medicine and Health, Klinikum rechts der Isar, Technical University of Munich(慕尼黑工业大学医学院与健康学院伊萨尔河右岸医院诊断与介入放射学系) ; Lab for AI in Medicine, RWTH Aachen University(亚琛工业大学医学人工智能实验室) ; Department of Diagnostic and Interventional Radiology, University Hospital RWTH Aachen(亚琛工业大学医院诊断与介入放射学系)
专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过因果审计方法,发现许多医学视觉-语言模型在胸部X光片任务中依赖文本先验而非图像,纯文本模型与多模态模型性能接近,并提出了基于图像依赖性的评估框架。
视觉-语言模型作为组织病理学中的零标注预言机
机构 * Imperial College London(帝国理工学院) ; Leiden University Medical Center(莱顿大学医学中心) ; KU Leuven(鲁汶大学) ; University Hospitals Leuven(鲁汶大学医院) ; University Medical Center Utrecht(乌得勒支大学医学中心) ; Friedrich-Alexander University Erlangen-Nürnberg(埃尔朗根-纽伦堡大学)
专题命中 评测与基准 :language model(title,abstract);prompting(abstract)
AI总结 提出一种粗到细方法,利用通用视觉-语言模型作为零标注预言机进行前景分割,在特殊染色上优于监督基线,并通过伪标签蒸馏轻量学生模型。
Comments 11 pages, 1 figure, 6 tables. Code available at https://github.com/VishalJ99/vlm-wsi-auto-context
基于反馈驱动多轮精化的二进制反编译大语言模型
专题命中 评测与基准 :LLM(title,abstract)
AI总结 提出AutoDecompiler,利用强化学习进行反馈驱动的多轮二进制反编译,通过编译、执行和I/O测试反馈迭代改进代码,显著提升行为可重执行性。
多模态大语言模型评判器的对抗鲁棒性
机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) ; State Key Laboratory of Virtual Reality Technology and System, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) ; State Key Laboratory of Software Development Environment, Jiangxi Research Institute, Beihang University(北京航空航天大学江西研究院软件开发环境国家重点实验室) ; School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算机与信息系统学院)
专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)
AI总结 提出RobustMLLMJudge框架评估多模态大语言模型作为评判器时的对抗鲁棒性,并设计MGSIA攻击方法,通过语义诱导和高分流形对齐生成可迁移的分数膨胀扰动,揭示其脆弱性。
图基础模型在节点属性预测中的公平评估
机构 * HSE University(俄罗斯高等经济学院) ; Yandex Research(Yandex研究院)
专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文对9种图基础模型进行公平评估,发现仅基于先验数据拟合网络的最新模型在预测性能上优于调优的图神经网络,但推理成本更高。
Comments Accepted at The Workshop on Graph Foundation Models at ICML 2026
药物难治性癫痫中致痫区识别的基础模型
机构 * McGill University(麦吉尔大学) ; Mila-Quebec AI Institute(米拉-魁北克人工智能研究所) ; Montreal Neurological Institute and Hospital, McGill University(蒙特利尔神经学研究所与医院,麦吉尔大学) ; Institute of Scientific Instruments, The Czech Academy of Sciences(捷克科学院科学仪器研究所) ; Brno Epilepsy Center, Department of Neurology, St Anne’s University Hospital(布尔诺癫痫中心,圣安妮大学医院神经内科) ; Faculty of Medicine, Masaryk University(马萨里克大学医学院) ; Duke University Medical Center(杜克大学医学中心) ; Duke Pratt School of Engineering(杜克普拉特工程学院)
专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 提出EpiiSLM双基础模型系统,通过信号基础模型和语言基础模型整合sEEG与临床信息,在接触级PPV上超越传统方法15.1%,仅需一夜发作间期睡眠数据。
Comments Keywords: drug-resistant epilepsy, epileptogenic zone, stereo-electroencephalography, signal foundation models, language foundation models