A Dataset for Dynamic Human Preferences for Vision Language Models
面向视觉语言模型的动态人类偏好数据集
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 提出一个评估视觉语言模型理解动态人类偏好能力的基准,通过自动化管道生成包含图像依赖变化的数据集,并评估了现有模型。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
面向视觉语言模型的动态人类偏好数据集
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 提出一个评估视觉语言模型理解动态人类偏好能力的基准,通过自动化管道生成包含图像依赖变化的数据集,并评估了现有模型。
多层上下文伪装:一种用于抗作弊在线评估的语义叠加与上下文分层框架
专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI
AI总结 该研究提出多层上下文伪装理论(MCCT),构建含六个耦合结构的数学框架,通过语义叠加保护在线评估内容,保障合法用户恢复,为抗作弊在线评估提供理论基础。
Comments 11 Pages, 36 Equations, 8 Figures
基于基准的公开基准印度基础模型对比评估:能力与评估成熟度框架
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 本文提出能力与评估成熟度框架,对公开基准的印度基础模型与全球同类模型对比评估,发现其在传统基准表现尚可但参与新评估不足,还提出基准成熟度指数,指出能力差距或源于评估生态问题。
Comments 18 pages, 11 tables
利用地球观测数据对齐优化边缘冰区的冰标记
机构 * British Antarctic Survey(英国南极调查局)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 该研究提出基于互信息对齐的架构,对齐Sentinel-1与MODIS的多模态卫星场景,构建稀疏专家标注数据集,提升海冰分类准确率,实现从稀疏监督的精确密集海冰分割。
Comments ECCV Workshop paper; BEAM 2
自演进的代码-图像推理
机构 * Nokia(诺基亚) ; University of Georgia(佐治亚大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 该研究提出代码-图像推理范式,通过无训练反思循环让模型自我演进技能,在CwI-Bench上显著提升多模态模型视觉任务准确率,技能可跨规模与任务家族迁移。
Comments 37 pages
GLocFM:面向三维室内无线定位的几何感知基础模型
专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI
AI总结 该研究针对现有学习式无线定位器无法利用环境几何信息的问题,提出GLocFM模型,联合利用WiFi测量与三维点云场景几何,在两类数据集上较基线降低近50%定位误差,鲁棒性与有效性经消融实验验证。
Comments 13 pages, single column
PressureMesh:基于多设备压力图像的3D人体网格估计
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 针对单设备压力监测范围有限的问题,提出端到端网络MDP-Net,结合MoE框架的多模态融合机制,构建MDP数据集,实现跨设备压力数据的3D人体网格估计,关节位置误差为12.6cm。
大语言模型的测试时增强:在计算资源匹配时输入多样性优于输出多样性
机构 * Amazon Web Services(亚马逊网络服务)
专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI
AI总结 本研究提出测试时增强(TTA),经匹配计算对比发现,中端大语言模型采用语义复述的TTA策略,比自洽性更高效地将计算转化为准确率,每美元准确率约为自洽性的1.8倍。
Comments Published at the COLM 2026 Workshop on Efficient Reasoning
正确答案,错误依据:面向红外图像多模态大语言模型的感知感知评估与热基础反馈机制
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 该研究针对红外图像多模态大语言模型仅以答案准确率评估的问题,提出感知感知评估框架与无需训练的热基础反馈机制,可提升解释热基础度,为可信红外场景理解模型的开发提供了方向。
Comments This manuscript is currently under peer review. Copyright may subsequently be transferred to the publisher, after which the availability of this version may be subject to the publisher's policy
首届“教学怪兽挑战赛”的研究发现:AI智能体的教学内容知识基准
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 研究推出首个以学习者角色为评估标准的教学视频生成基准“教学怪兽挑战赛”,测试发现当前AI教学系统内容适配能力不足,自动裁判存在局限,发布相关资源供后续研究。
AI评估应衡量验证成本,而非仅正确性
机构 * Hitachi, Ltd.(日立制作所) ; Hitachi Rail(日立铁路)
专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI
AI总结 该研究指出AI评估仅靠正确性不足,提出需纳入验证成本,定义了验证成本错误,通过代码生成等证据说明高基准准确率可能掩盖高验证成本,主张评估应考虑现实资源约束下的错误可检测性。
Comments 20 pages, 1 table
面向不完整信息诊断推理的深度概率逻辑编程:以脑卒中检测为例
机构 * German University of Digital Science(德国数字科学大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 本研究以脑卒中检测为案例,提出结合最大熵技术与DeepProbLog的诊断系统构建方法,分析了不完整数据模型的性能及ProbFOIL 2压缩模型的潜力,拓展了神经符号方法在医疗诊断中的应用。
Comments Accepted for presentation at IJCLR 2026. This is the accepted version, _not_ the camera-ready version for the post-proceedings of the conference
MRBench:用于人体动作-文本检索的综合基准
专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出综合动作-文本检索基准MRBench,针对现有基准缺陷构建,提出轻量级粒度感知模型,提升混合粒度检索效果,为动作-语言对齐评估提供测试平台。
优势引导门:重塑基于视觉的空间智能的开放式推理
机构 * University of Science and Technology of China(中国科学技术大学) ; Suzhou Institute for Advanced Research, USTC(中国科学技术大学苏州高等研究院) ; Institute of Advanced Intelligence and Computing (IAIC), Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局高级智能与计算研究所) ; East China Normal University(华东师范大学) ; National University of Singapore(新加坡国立大学) ; Durham University(杜伦大学) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 本文针对MLLMs开放式推理易出错的问题,提出优势引导门框架,结合蒙特卡洛价值评估与两类优势门,构建Reasoning-Tree-160k数据集并经两阶段学习,有效提升了基准MLLMs的视觉空间推理性能。
LAD-COD:面向伪装目标检测的语言对齐密集感知
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 本研究针对伪装目标检测中密集视觉特征缺乏语言指导的问题,提出LAD-COD框架,通过语言对齐双视觉融合实现语义与分层视觉特征的对齐,在三个数据集的12组对比中取得最优结果。
法官知道自己何时知晓:基于大语言模型的A/B测试预测的校准弃权(不执行)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CL
AI总结 该研究探究多模态LLM能否仅通过网页截图预测A/B测试结果,发现Gemini 3 Flash法官表现不佳,提出投票边际关卡隔离置信判断可提升性能,还在人类中重现了共识与真实结果脱节的现象,并发布了相关研究资源。
Comments 15 pages. Pre-registered experimental program with a public, tiered claims ledger; includes powered negative results, a label-validity audit, a cross-judge shared-prior measurement (n_eff ~ 2 of 16 votes), and a first-party 15-expert human baseline. Pre-registrations, statistical harness, human responses, and the full experiment ledger are released
CAS2UML:用于类图和活动图的手绘草图到PlantUML数据集
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 CAS2UML是含557幅手绘类图与活动图及对应PlantUML代码的公开数据集,配套验证工具与脚本,可实现草图转UML方法的可复现基准测试。
先理解再检测:用于全域红外小目标检测的视觉-语言学习
机构 * National University of Defense Technology(国防科技大学) ; College of Computer Science, Nankai University(南开大学计算机学院) ; Peking University(北京大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 针对全域红外小目标检测的域偏移问题,提出“先理解再检测”范式及JinSight方法,构建视觉-语言数据集OmniIRST-VL,实现跨异构红外域的泛化检测。
科学边缘评估:SEE——迈向真实科学发现的缺失环节
机构 * Alibaba Group(阿里巴巴集团) ; University of Chinese Academy of Sciences(中国科学院大学) ; Tsinghua University(清华大学) ; University of Alberta(阿尔伯塔大学) ; Zhejiang University(浙江大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 该研究构建多模态基准SEE评估19个MLLMs,发现其仅达48.7%准确率,通用模型优于专用模型,工具使用可提至52.7%但仍难实现科学发现所需的证据约束推断,需从解释转向推导。
基于概念激活向量的L2口语评估系统的偏差分析
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 该研究将概念激活向量(CAV)分析扩展到BERT和Whisper两个L2口语评估系统,发现概念可恢复性及对概念的敏感性依赖于模型架构,稀疏自编码器(SAEs)可提升概念线性恢复性但会减弱激活空间敏感性。
MT-Web2Code:面向多轮区域重构与局部修改的编码智能体基准测试
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 MT-Web2Code是首个面向多轮区域重构与局部修改的多模态编码基准,实验发现现有编码智能体存在多轮错误滚雪球等问题,其评估指标或助力相关研究。
DataSpace:针对异构工作空间可验证分析的数据智能体基准测试
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 该研究推出DataSpace基准,用于评估异构工作空间下数据智能体的可验证分析能力,包含多类型任务与数据,实验揭示了智能体框架、多模态集成等对准确率的影响,为提升数据智能体可靠性指明了方向。
Comments 8 pages of main text, 7 figures, with a supplementary appendix
3DGSI-Assessor:面向3D高斯溅射图像质量评估的大规模数据集与基于大视觉语言模型的方法
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 针对3D高斯溅射压缩的失真评估缺口,提出含15200张图像的多维IQA数据集3DGS-IEval-15K+,并构建基于大视觉语言模型的一体化IQA框架3DGSI-Assessor,该框架在对应数据集上达SOTA且泛化性良好。
面向跨站点可解释皮肤病图像诊断的开放语言概念统一学习
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 针对现有概念模型跨站点泛化差、适配FVLMs成本高的问题,提出开放语言概念统一学习框架UniCon,通过共享语义空间等三项创新实现多模态可解释皮肤病诊断,获顶级准确率且具备跨站点干预能力。
Comments accepted by ACM Multimedia 2026
CAPEval:跨理解与生成的解耦式标题评估
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 本研究提出解耦式标题评估基准CAPEval,将标题质量分为覆盖度与精确度,发现二者分别对应理解与生成任务性能,为标题生成器的选择优化提供指导。
Comments 21 pages, 8 figures. Code and dataset will be available at https://liuzhipenggg.github.io/CAPEval/
T²exture:稀疏扰动热成像转纹理成像
专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV
AI总结 针对现有热纹理成像方法的缺陷,提出T²exture框架,通过两阶段重建实现稀疏主动采集成像下的热纹理序列,在模拟基准上参数增量小且PSNR提升显著,纹理与结构恢复效果优于VFI基线。
Comments 13 pages, 7 figures
SVGEval:用于文本到SVG生成中感知质量基准测试与评估的视觉基础框架
机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) ; School of Integrated Circuits (School of Information Science and Electronic Engineering), Shanghai Jiao Tong University(上海交通大学集成电路学院(信息科学与工程学院)) ; Zhiyuan College, Shanghai Jiao Tong University(上海交通大学致远学院)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 研究针对文本到SVG生成评估的缺陷,提出视觉基础的SVGEval基准,发现多模态模型在几何布局判断上的差距,训练出可解释的SVG质量评分器,为SVG生成评估改进提供支撑。
Comments Accepted by ECCV 2026
将语义与视觉解耦:一种用于可靠视觉-文本压缩评估的框架
机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) ; Shenzhen Technology University(深圳技术大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 本研究针对现有视觉-文本压缩评估依赖下游任务性能的缺陷,提出解耦语义与视觉的评估框架,引入ZeroSense基准消除文本依赖,实验证实VTC质量与下游任务准确率存在显著差异。
面向病理全切片图像的无分布外检测训练方法
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 本文提出基于视觉-语言病理基础模型的无训练多模态OOD检测器ZIO,在14700余张病理WSI上优于40种现有OOD方法,为临床AI安全部署提供支撑。
Comments Under review. The code is available in https://github.com/muskahya/ZIO
从像素到光子单元(PCells):一种用于光子组件创建的神经符号方法
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Research Laboratory of Electronics(电子学研究实验室) ; University of Chicago(芝加哥大学) ; The College(学院)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 该研究提出神经符号系统PixCell,用多模态智能体将视觉呈现的光子组件转为参数化程序,经验证器引导修正的模型在光子组件设计任务上IoU显著提升,建立了相关设计的受控框架。
Comments 16 pages, 13 figures, 3 tables