FunL2O: LLM-Guided Feature Function Design for Learning to Optimize
FunL2O:面向学习优化的大语言模型引导特征函数设计
专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究提出首个大语言模型驱动特征自动化设计的L2O统一框架FunL2O,经多类优化任务及四种大语言模型验证,其演化特征性能优于人工设计特征。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
FunL2O:面向学习优化的大语言模型引导特征函数设计
专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究提出首个大语言模型驱动特征自动化设计的L2O统一框架FunL2O,经多类优化任务及四种大语言模型验证,其演化特征性能优于人工设计特征。
Flat Score, Amplified Failures:误差预算如何掩盖量化大语言模型智能体中的损害
专题命中 评测与基准 :LLM(title);post-training(abstract);分类 cs.AI、cs.LG
AI总结 本文以τ²-bench为基准,发现量化大语言模型智能体的分数看似平稳,但会放大原有工具调用失败,其损害被基准的10个错误预算掩盖,缩小预算可暴露该问题,相关诊断方法可与任务奖励一同报告。
Comments preprint
表格基础模型的分布外性能实证评估
机构 * Colegio de Ciencias e Ingenierías, Universidad San Francisco de Quito (USFQ)(基多圣弗朗西斯科大学科学与工程学院) ; Rey Juan Carlos University(胡安·卡洛斯国王大学) ; Facultad de Ingeniería, Universidad Latina de Panamá(巴拿马拉丁大学工程学院)
专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 研究对九种表格基础模型进行分布外性能实证评估,涵盖多种策略与架构,用三个真实世界数据集测试。结果显示模型在分布变化下会退化,还存在可扩展性差距,扩展了表格数据分布外的基准,为高风险领域应用提供证据。
统一融合:在统一反向速率目标下将自回归语言模型适配到离散扩散
机构 * Tsinghua University(清华大学) ; Beijing Institute of Mathematical Sciences and Applications(北京数学科学与应用研究院) ; Wuhan University(武汉大学) ; MathonAI(未知(暂未找到合适中文翻译))
专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG
AI总结 研究旨在将预训练的自回归语言模型适配到均匀噪声扩散。通过建立不同模型间联系并推导转换,提出UNIFUSION方法。经实验评估,该方法能改善生成困惑度与单字熵权衡,在相同规模模型中多项指标表现优异。
从正则表达式中分离大语言模型对齐:对抗性变异下的零覆盖率和度量相关散度
机构 * Vertex AI(顶点人工智能)
专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG
AI总结 研究在语料库被设计绕过正则表达式时大语言模型对齐情况,引入$L_5$-无正则表达式并评估,发现对齐贡献度量相关,自然语言探针中无额外覆盖率提升,对抗性变体中能检测到子串分类器错过的拒绝。
Comments 15 pages, 2 figures, 7 tables
ENTRAP-VL:视觉语言模型中双上下文夹带的分类探测器
机构 * IIIT Delhi(德里信息技术学院) ; Dr. Ambedkar Institute of Technology(阿姆贝德卡尔技术学院) ; Heritage Institute of Technology(遗产技术学院) ; PwC(普华永道)
专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 研究视觉语言模型中上下文夹带现象,提出需构建分类结构化双模态工具。引入ENTRAP-VL数据集,含1500个项目,跨八类,分文本和视觉夹带流,提供工具、分类法及评估协议,助力社区严格研究该现象。
作为替罪羊的护栏:审计工具增强型大语言模型智能体中不忠实的安全拒绝行为
专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG
AI总结 研究工具增强型大语言模型智能体安全拒绝行为审计问题,引入轻量级黑盒审计框架,将智能体响应分类。实验发现伪造行为占主导,不忠实安全拒绝行为在基线时少,增强安全语言会显著增加该行为,还提出检测方法及治理影响。
Comments 10 pages, 3 figures. Accepted at the ACM KDD 2026 Workshop on Evaluation and Trustworthiness of Agentic AI
用适当评估估计语言模型中的罕见事件
机构 * Johns Hopkins University(约翰·霍普金斯大学)
专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG
AI总结 研究语言模型中罕见事件概率估计难题,提出梯度激活自适应多级分裂方法及移位幂布雷格曼损失,通过实验揭示偏差 - 方差权衡,强调估计器与部署上下文匹配,确立激活空间为易处理域。
Comments 37 pages, 24 figures
信息阴影:衡量语言模型学习的结构限制
机构 * Sirena Ai(Sirena人工智能公司)
专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG
AI总结 研究语言模型学习的结构限制,引入信息阴影概念,包含语言无法表达的结构等三类。通过语言压缩残差等探针测试,揭示不同类型限制,发布探针套件并探讨其对基准设计等方面的影响。
自适应对手:用于大语言模型智能体安全的多轮、多大语言模型基准测试
机构 * Lambda
专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究提出针对无记忆大语言模型防御者的自适应多轮攻击的21场景基准测试,通过观察防御者响应灵活调整攻击。介绍了不同攻击轮次成功率,汇集多个前沿攻击者大语言模型的情况,还指出不同防御者弱点差异及场景排名不一致性,并发布了相关基准测试及数据集。
Comments Second Workshop on Agents in the Wild: Safety, Security, and Beyond
使用表格基础模型重新审视数据驱动的动态安全评估
专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 研究针对数据驱动的电力系统动态安全评估方法的局限,提出用表格基础模型,通过上下文学习评估稳定性,无需重新训练或调参。单个模型可评估多故障,经案例研究表明该模型用少量标记样本就能达到高分数,为电力系统基础模型开发部署奠基。
Comments Paper is in the review process
库存盘点:使用公平预言机测量大语言模型智能体中感知与行动之间的差距
机构 * QpiAI
专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型智能体在多周决策任务中的知行差距,提出库存盘点基准,通过公平参考策略区分感知与行动失败,测量知行差距两方向,为评估大语言模型智能体提供新途径。
语言模型中的分级实体熟悉度读数:波兰语适配、跨语言鲁棒性和拒绝引导
机构 * Prosit AS(Prosit公司)
专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG
AI总结 研究语言模型能否在生成答案前估计对实体的熟悉度,通过新数据集及实验发现熟悉度探测分数可区分实体,在波兰语适配家族中追踪实体受欢迎程度,跨语言鲁棒,在特定模型中可调节拒绝率,校准后的熟悉度探测有竞争力。
Comments 16 pages, 8 figures, 5 tables. Code and data: https://github.com/agentGreg/bielik-entity-familiarity
使用多智能体大语言模型系统进行自动化教科书审核
机构 * University of Bucharest(布加勒斯特大学) ; Dimitrie Cantemir Christian University(迪米特里·坎泰米尔基督教大学)
专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI
AI总结 研究旨在确保教材质量,提出人工智能教科书审核器这一多智能体管道,通过事实技术与语法双轨道分析生成报告,经判断智能体过滤误报,支持两种摄取模式且可领域适配,在两本教科书上验证可减少人工查找问题工作量。
Comments Presented @ iTextbooks 2026: 7th Workshop on Intelligent Textbooks at AIED'2026
在资源受限情况下学习微调基础模型
机构 * Athens University of Economics and Business(雅典经济与商业大学)
专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 研究资源受限设备上基础模型的最优持续微调问题,将其建模为约束马尔可夫决策过程,提出基于强化学习的演员评论家算法,实验表明该方法在准确率上优于同预算微调方法,且大幅减少微调步骤。
Comments 6 pages, 2 figures, 1 table, accepted and presented at ICMLCN 2026
分数集之前的核心集:用于大语言模型基准测试的评估无监督提示子集选择
机构 * University of Washington(华盛顿大学) ; University of California, Berkeley(加利福尼亚大学伯克利分校) ; Oracle(甲骨文公司) ; Together AI(Together AI公司) ; LMSYS ; NVIDIA(英伟达公司)
专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI
AI总结 研究大语言模型基准测试的核心集选择,采用评估无监督方法,利用次模子集选择,开发多种次模函数。在新大规模套件上实验发现设施选址函数效果好,该目标不限于特定模式,在相关排行榜上表现优且计算成本低,证明次模性对基准压缩有用。
全睡眠:一种通过中枢神经系统-自主神经系统动态分层对比学习的睡眠基础模型
机构 * Department of Biomedical Engineering, Southern University of Science and Technology(南方科技大学生物医学工程系) ; Omni-Intelligence(全知智能) ; Shenzhen Loop Area Institute(深圳河套学院)
专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 介绍全睡眠模型,利用CNS/ANS划分,通过分层对比学习的三个目标进行拓扑约束表示学习,在多中心多模态PSG数据预训练后用于睡眠分期和多疾病分类,性能优于基线,凸显生理层次对睡眠表示学习的价值。
预训练语言模型嵌入的黎曼几何
机构 * IBM Automation and AI(IBM自动化与人工智能) ; Hother(霍瑟) ; University of Warsaw(华沙大学) ; Centre for Credible AI, Warsaw University of Technology(华沙理工大学可信人工智能中心)
专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 研究预训练语言模型嵌入的几何结构,提出黎曼均值池化方法,通过提取回拉度量并聚合,在三个数据集上RMP优于欧几里得均值池化,消融实验定位增益来源,训练好的编码器在特定数据集贡献额外信号。
当评判者改变时,测量结果也会改变:评估大语言模型作为评判者的可靠性
机构 * Dyson School of Design Engineering, Imperial College London(伦敦帝国理工学院戴森设计工程学院) ; Department of Electrical and Electronic Engineering, Imperial College London(伦敦帝国理工学院电气与电子工程系) ; School of Electronic Information, Nanchang Institute of Technology(南昌工程学院电子信息学院)
专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI
AI总结 研究大语言模型作为评判者时分数因评估者变化而改变的问题,通过在四个数据集上比较两种升级路径,发现评判者升级不可互换,强评判者可减偏差,重复采样陪审团作用有限,结构化辩论能改决策,提出报告应含多方面内容。
Comments 6 pages, 6 figures, 4 tables
基于基础模型的集体智能
机构 * Department of Computer Applications in Science \& Engineering, BARCELONA Supercomputing Center, 08034 Barcelona, Spain Escuela Técnica Superior de Ingeniería (ICAI), Universidad Pontificia Comillas, 28015 Madrid, Spain Human Centered AI, Data \& Software, LUXEMBOURG Institute of Science
专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL、cs.AI
AI总结 研究如何将多个基础模型协调成合作推理系统,提出多智能体框架,含求解器、批评和聚合智能体及评分模块。通过消融研究比较四种配置,发现模型异质性是性能提升关键,能提高逐步准确率、降低方差,还讨论了相关原则、方法及对应用人工智能的影响。
Comments Accepted as a book chapter in "Advances in Global Applied Artificial Intelligence" (G. A. Tsihrintzis, M. Virvou, N. G. Bourbakis, L. C. Jain, Eds.), authenticated version will be published in Springer series: Learning and Analytics in Intelligent Systems
RPAM:一种用于评估语言模型中关联的原则性度量,在下游输出中具有高预测有效性
机构 * University of Washington(华盛顿大学)
专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 研究针对语言模型偏差评估难题,引入相对概率关联度量(RPAM),通过对不同语言模型及评估数据集的实验,发现RPAM测量与人类观察到的关联及下游偏差紧密相关,优于先前记录值,有效填补了上游度量与现实世界关联关系研究的空白。
Comments 14 pages
SPEARBench:面向流式语音转语音语言模型的自然度评估基准
机构 * Department of Electrical and Computer Engineering, Johns Hopkins University(约翰霍普金斯大学电气与计算机工程系) ; Amazon Inc.(亚马逊公司)
专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 针对现有基准无法评估流式语音转语音模型对话自然度的问题,构建多维度评估基准SPEARBench,可从多维度评测模型,发现当前模型在多类对话行为维度仍与人类存在差距。
Comments Corresponding Website: https://thomasthebaud.github.io/SPEAR-benchmark-website/#welcome
Evalci:用于语言模型评估统计严格比较的Python库
机构 * Shreyaskc(Shreyas K Chandrahas)
专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 研究语言模型评估中仅依单一准确率数字判断优劣的问题,用evalci库通过统计方法处理结果表,给出严谨结论,如置信区间等,还通过案例分析发现部分排行榜差距无统计学意义。
Comments 7 pages, 1 figure. Software: https://pypi.org/project/evalci/ (source: https://github.com/Shreyaskc/evalci, Zenodo DOI: 10.5281/zenodo.21201815)
用于地球系统基础模型的统一数据集
机构 * Politecnico di Milano, Department of Management, Economics and Industrial Engineering(米兰理工大学管理、经济与工业工程系) ; RFF-CMCC European Institute on Economics and the Environment(资源未来研究所-欧洲经济与环境CMCC研究所) ; CMCC Foundation - Euro-Mediterranean Center on Climate Change(CMCC基金会-欧洲地中海气候变化中心)
专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 研究针对地球系统基础模型训练数据缺乏统一资源的问题,构建WorldTensor数据集,整合多类数据到标准网格,为训练和评估模型提供资源,推动多模态地球系统基础模型发展。
Comments Under review
视觉语义熵:视觉语言模型能否识别视觉模糊性?
机构 * Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学) ; Flinders University(弗林德斯大学)
专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 针对视觉语言模型在模糊输入下产生自信错误预测的问题,提出视觉语义熵(VSE),通过仅扰动图像并聚类生成答案的语义原型来量化不确定性,在五个模型和五个基准上达到最优。
Comments Accepted at ECCV2026
表格基础模型对微生物组数据中真实查询分布偏移的鲁棒性如何?
机构 * IRD, Sorbonne Université, Unité de Modélisation Mathématique et Informatique des Systèmes Complexes (UMMISCO)(法国发展研究所、索邦大学、复杂系统数学建模与信息学单元) ; Inria, CNRS, I3S, Université Côte d’Azur(法国国家信息与自动化研究所、法国国家科学研究中心、信息系统与软件工程实验室、蔚蓝海岸大学) ; INSERM, Nutrition et Obésités(法国国家健康与医学研究院、营养与肥胖症) ; Approches Systémiques, NutriOmique, AP-HP, Hôpital Pitié-Salpêtrière(系统方法、营养组学、巴黎公立医院集团、皮提耶-萨勒佩特里医院)
专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 本研究通过引入基准测试,评估表格基础模型在六个人类肠道微生物组数据集上对三种生物启发式扰动(去除高丰度类群、稀疏化、零值注入)的鲁棒性,发现即使保留判别性特征,模型性能仍下降,零值注入破坏性最大。
PHANTOM:面向视觉-语言模型的多模态对抗攻击大规模数据集
机构 * The Italian Institute of Artificial Intelligence (AI4I)(意大利人工智能研究所(AI4I)) ; HikmaAI S.r.l.(HikmaAI有限责任公司)
专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG
AI总结 提出一个大规模开源对抗攻击数据集PHANTOM,涵盖10个高级类别和55个子类别的有害意图,包含47,524个对抗样本,旨在降低对抗研究门槛,促进VLM鲁棒性和安全性的系统评估。
Comments The dataset has been released at: https://huggingface.co/datasets/it4lia/PHANTOM
视频语言模型何时停止观看?多模态RLVR中视觉捷径的形成与逆转受奖励强度控制
机构 * Zekun Xu(徐泽坤)
专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG
AI总结 研究多模态强化学习中视觉捷径的形成与逆转机制,发现惩罚强度可控制其出现和消除,且存在关键干预窗口。
Comments 11 pages, 4 figures
UPLOTS: 一种用于约束时间序列生成的统一预训练语言模型
机构 * University of New South Wales(新南威尔士大学) ; HKUST(GZ)(香港科技大学(广州)) ; BUAA(北京航空航天大学)
专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG
AI总结 提出UPLOTS,一种基于统一预训练语言模型和提示引导的框架,通过动态多数据集损失重加权和提示到模式映射,实现跨领域约束时间序列生成,在四个基准上验证了其泛化性和数据增强效果。
使用整流流变换器扩展胸部X光片的生成式基础模型
机构 * Imperial College London(帝国理工学院) ; Causality in Healthcare AI Hub(医疗AI因果关系中心) ; University of Edinburgh(爱丁堡大学) ; Cleveland Clinic London(克利夫兰诊所伦敦) ; Department of Perioperative Medicine, CHU Clermont-Ferrand(克莱蒙费朗大学医院围手术期医学科) ; Department of Medicine, Massachusetts General Hospital(麻省总医院医学部) ; Broad Institute of MIT and Harvard(麻省理工学院与哈佛大学博德研究所)
专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 提出首个十亿参数级胸部X光片生成基础模型,通过整流流变换器实现高保真可控合成,显著提升合成图像与真实图像的不可区分性。
Comments Project page: https://RadiT-project.github.io