Benchmarking Foundation and Large Language Models for Few-Shot Medical Image Segmentation
基准测试用于小样本医学图像分割的基础模型与大语言模型
专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 该研究推出统一基准FAME,涵盖四类模型,含14958个样本,评估得出小样本分割的关键规律,助力开发更有效的小样本医学分割方法。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
基准测试用于小样本医学图像分割的基础模型与大语言模型
专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 该研究推出统一基准FAME,涵盖四类模型,含14958个样本,评估得出小样本分割的关键规律,助力开发更有效的小样本医学分割方法。
视觉输入中指代目标对象的多语言表达式理解
机构 * Instituto Superior Técnico(技术高等学院)
专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV
AI总结 本研究针对多语言指代表达式理解问题,构建了含10种语言的统一多语言数据集,提出基于多语言SigLIP2编码器的注意力锚定高效架构,验证了该模型在多语言视觉定位任务上的竞争力与稳定性。
SCVIB:面向多轮个性化定位的可编辑状态条件视觉实例绑定
专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV
AI总结 该研究提出多轮个性化定位设置SCVIB,结合TT-VG与VEGA方法构建测试平台,解决多轮定位中支持证据利用不足问题,相关指标优于对比方法。
NEURON:一种面向临床可解释性的神经符号系统
机构 * University of North Texas(北卡罗来纳大学达顿分校) ; Texas Tech University Health Sciences Center(德克萨斯农工大学健康科学中心)
专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI
AI总结 NEURON结合医学本体和机器学习模型,提升预测可靠性与临床可解释性,通过RAG层生成自然语言解释,在MIMIC-IV数据集上提升AUC至0.84-0.88。
大型语言模型中的数字能力:基本局限与改进路径
机构 * University of Chinese Academy of Sciences(中国科学院大学)
专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI
AI总结 本研究针对LLMs在基础数值任务中的不可靠性,提出数值基础框架(NGF)并结合三大基准评估前沿模型,给出改进数值能力的部署建议与研究方向。
VOS-Agent:第8届LSVOS挑战赛(MOSEv2赛道)的第一名解决方案
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Nanyang Technological University(南洋理工大学) ; Shenzhen Loop Area Institute(深圳河套学院)
专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 针对复杂视频目标分割中微小目标、语义主导目标的稳健传播难题,本文提出VOS-Agent协作框架,以SAM3为共享密集分割模块,根据目标特征激活专用智能体,在ECCV 2026第8届LSVOS挑战赛MOSEv2赛道获第一名,J&JF指标达69.82%。
Comments 1st Place Solution for the 8th LSVOS MOSEv2 Challenge (ECCV 2026 Workshop)
NBA_Streaming:用于连续流中细粒度篮球评论生成的大规模基准测试
机构 * School of Information Science and Technology, Beijing University of Technology(北京工业大学信息科学与技术学院) ; Fudan University(复旦大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV
AI总结 针对现有篮球评论生成方法与数据集不适用于连续流的局限,推出大规模基准NBA_Streaming,提出因果两阶段框架,可有效提升在线细粒度篮球评论生成性能。
Omni-Persona:系统性基准测试与改进多模态个性化
机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电气与计算机工程系) ; Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔国立大学人工智能跨学科项目) ; Department of Artificial Intelligence, University of Seoul(首尔大学人工智能系)
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 Omni-Persona提出首个多模态个性化基准,通过Persona Modality Graph任务组和细粒度任务,系统分析多模态个性化中的接地行为,提出Calibrated Accuracy评估方法,揭示开源模型在音频与视觉接地上的差距及SFT与RLVR的局限性。
Comments Project Page: https://github.com/oyt9306/Omni-Persona
正确答案,错误依据:面向红外图像多模态大语言模型的感知感知评估与热基础反馈机制
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 该研究针对红外图像多模态大语言模型仅以答案准确率评估的问题,提出感知感知评估框架与无需训练的热基础反馈机制,可提升解释热基础度,为可信红外场景理解模型的开发提供了方向。
Comments This manuscript is currently under peer review. Copyright may subsequently be transferred to the publisher, after which the availability of this version may be subject to the publisher's policy
通过部分信息分解理解多模态语言模型中的模态交互
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.AI
AI总结 引入部分信息分解(PID)框架,分离感官和语言输入的独特、冗余和协同贡献,揭示多模态大模型中的模态使用模式,并扩展至三模态系统。
Comments Accepted by ICML 2026
分析多模态大语言模型代理在城市感知中生成解释的角色效应
机构 * Universidade Tecnologica Federal do Parana(巴西南里奥格兰德联邦技术大学) ; University of Toronto(多伦多大学)
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 通过对比不同角色提示和无角色设置下多模态大语言模型生成的文本,发现标题描述趋同,但理由描述随社会经济和政治属性系统变化,感知标签无显著差异。
Comments 17 pages, 9 figures
任意视频时间定位器的共形覆盖保证
专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV
AI总结 针对视频时间定位器的模糊性问题,提出与模型无关的COVER包装器,可保证输出区域以至少1-α的概率包含真实时刻,在多基准和定位器上验证了其覆盖度符合目标值。
Comments Submitted to AAAI 2027
Scenix:基于可执行场景程序的稀疏视图3D场景重建
专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出Scenix框架,通过可执行场景程序实现稀疏视图3D室内场景重建,构建了含约11万场景的数据集,引入观测一致性监督,在多类案例上完成相关评估。
Comments 4 figures 5 table 9 pages
ECAD:超越以事物为中心的对象性的扩展类无关检测
专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV
AI总结 针对现有目标检测仅聚焦以事物为中心的实例、忽略关键场景元素的问题,本文提出ECAD设置,构建BTCO-Bench基准,设计ECADet检测器并引入GAER与PGQM模块,实验验证其在BTCO-Bench上的性能优势。
视觉感知不等于决策:多模态大语言模型能成为有效的首席执行官吗?
专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI
AI总结 该研究构建C-SUITEBENCH多模态基准,评估9个前沿模型作为CEO的决策能力,发现多模态输入可提升证据推理但会损害受限资源分配,揭示多模态智能体的视觉感知与受限行动是可分离瓶颈。
Comments 25 pages
当智能体AI遇上集成感知与通信
机构 * University of Luxembourg(卢森堡大学) ; CSIRO(联邦科学与工业研究组织) ; Qassim University(卡西姆大学) ; Edith Cowan University(伊迪丝·考恩大学)
专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI
AI总结 本综述提出智能体AI与集成感知通信结合的AISAC范式,构建六阶段闭环框架与五成熟度等级,梳理相关领域进展,分析交叉需求,发现现有系统智能体成熟度不足,并指出多方面开放挑战。
Comments 35 pages, 132 references, 10 tables, 9 figures
面向有效边界表示(B-Rep)生成:无需训练的线框异常检测与修复
专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);分类 cs.CV
AI总结 该研究针对CAD模型B-Rep生成中线框的几何拓扑异常问题,提出无需训练的WDR框架,通过GTAD检测风险、EGGTR修复,提升了B-Rep有效性且保留模型质量,可集成至多种生成流水线。
面向跨域小样本目标检测的、结合特征扰动的提示驱动模拟方法
机构 * Fuzhou University(福州大学) ; Xiamen University(厦门大学)
专题命中 视觉定位与Grounding :VLM(abstract_cn);grounding(abstract);分类 cs.CV
AI总结 本文提出PSP-FSOD框架,结合提示驱动域模拟与特征扰动正则化,缓解跨域小样本目标检测的域偏移与标注数据不足问题,在多个基准上实现性能提升。
视频模型作为原生4D渲染器:基于动画网格的世界 grounding 条件
机构 * Tsinghua University(清华大学) ; The Hong Kong Polytechnic University(香港理工大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Sun Yat-sen University(中山大学) ; The University of Hong Kong(香港大学) ; University of Science and Technology of China(中国科学技术大学) ; Nanyang Technological University(南洋理工大学)
专题命中 视觉定位与Grounding :grounding(title_cn);分类 cs.CV
AI总结 该研究提出参考引导渲染器DAR,扩展Wan2.2相机控制,用跟踪和世界位置组成的4D G缓冲作为条件,在DAR-4D基准上实现优于现有方法的视频生成性能。
Comments 14 pages, 5 figures
结合先进深度学习技术的优势,从无人机影像中评估灾后建筑物损毁情况
机构 * KDDI Research, Inc.(KDDI研究所)
专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV
AI总结 本文提出将CV模型与LVLM结合的混合框架,在RescueNet、FloodNet基准上评估,可准确统计灾后建筑物损毁情况,性能优于单独基准模型且仅需少量标注数据,相关资源公开。
Comments Accepted at ECMLPKDD 2026, 31 pages (including appendix), 18 figures
Scene2Sound:面向3D高斯世界的听觉锚定声景生成
机构 * Hokkaido University(北海道大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 Scene2Sound是一个无训练框架,通过听觉锚定和高斯集匹配为3D高斯世界生成空间一致的声景,在保留音频质量的同时解决了现有方法空间不一致的问题,经实验和用户研究验证有效。
Comments 14 pages. Project page: https://masaki-lmd.github.io/scene2sound/
大基础模型时代的手物交互:重建、生成与具身迁移
专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV
AI总结 本综述系统梳理大基础模型在手物交互(HOI)领域的应用,建立基础模型子先验分类,分析其在HOI任务与机器人学习中的作用,总结数据集与评估协议并展望未来方向。
ABRA:跨领域细调知识的传送用于开放词汇物体检测
机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学)
专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV
AI总结 ABRA通过在预训练检测器的权重空间中将类别特定检测知识从标注源域传输到目标域,解决领域偏移下的开放词汇物体检测问题,实验表明其在多种恶劣条件下有效。
Comments Paper under consideration for acceptance at Pattern Recognition Letters
基准测试如何错误评估计算机使用智能体
机构 * Georgia Institute of Technology(佐治亚理工学院) ; North Carolina State University(北卡罗来纳州立大学) ; Lenovo AI Technology Center(联想人工智能技术中心) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Marquette University(马凯特大学) ; Fudan University(复旦大学)
专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI
AI总结 该研究指出计算机使用智能体的基准测试分数存在可靠性问题,审计150条轨迹发现15.3%的“失败”判定错误,进而推导了CUA评估各阶段的设计规则。
Veritas++:面向感知增强的AIGI检测的值感知在线策略蒸馏
机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences (UCAS)(中国科学院大学先进交叉科学学院) ; Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院) ; Ant Group(蚂蚁集团) ; Sangfor Technologies Inc.(深信服科技股份有限公司)
专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 该研究针对现有AIGI检测模型的感知瓶颈,提出Veritas++框架,通过PoRL与VaOPD机制增强感知能力,提升了检测泛化性与效率。
利用语义地图进行城市尺度的跨视图定位
机构 * CSAIL, MIT(麻省理工学院计算机科学与人工智能实验室) ; DEVCOM Army Research Laboratory (ARL)(陆军研究实验室)
专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);分类 cs.CV
AI总结 研究如何让机器人在未遍历环境中利用先验数据定位,提出克服提取语义信息和关联观测与先验地图两挑战的方法,即从视觉语言模型提炼轻量级匹配器,结合贝叶斯滤波器创建姿态估计,发布数据集并证明方法可泛化。
Comments Equal contribution by Ethan Fahnestock and Erick Fuentes. 13 pages, 7 figures, and 5 tables
IMPRINT:用于长尾目标导航的图像条件查询增强
机构 * University of Padova(帕多瓦大学) ; Fondazione Bruno Kessler (FBK)(布鲁诺·凯斯勒基金会)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 研究针对具身人工智能中ObjectNav依赖纯文本查询可靠性低的问题,提出IMPRINT框架,用网络图像丰富文本查询改善定位,无需训练导航策略。通过新基准HSSD-rare评估,显示图像条件查询可提升导航增益,还指出下游检测质量是关键瓶颈。
Comments Accepted at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). Project page: https://github.com/JelinR/IMPRINT
用于电网诊断的多模态大语言模型的任务条件忠实性审计
机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校) ; Brookhaven National Laboratory(布鲁克海文国家实验室) ; Southern Methodist University(南卫理公会大学)
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.AI
AI总结 研究针对多模态大语言模型用于电网诊断时答案准确性与证据使用的问题,提出通用框架进行任务条件忠实性审计,通过比较多种依赖并设计校正和重新审计机制,经案例研究验证了框架检测、诊断及纠正相关失败的能力。
ReflexTrack:一种用于无训练的引用视频对象分割的反馈驱动智能体
机构 * School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院) ; Centre for Vision, Speech and Signal Processing, University of Surrey(萨里大学视觉、语音和信号处理中心)
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 研究针对引用视频对象分割问题,提出无训练、反馈驱动的ReflexTrack智能体。通过掩码引导空间细化和视频级掩码反射实现空间与时间层面反馈,提升预测可靠性,在Ref-VPS和ReasonVOS上取得较好分数。
使用对象和光照进行引擎原生可编辑3D世界重建
机构 * Tsinghua University(清华大学) ; Nankai University(南开大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Sun Yat-sen University(中山大学) ; Nanyang Technological University(南洋理工大学)
专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);分类 cs.CV
AI总结 研究旨在实现引擎原生可编辑3D世界重建。核心方法是引入Lumera管道,基于Lumera-2K数据,用Lumera-Box和Lumera-Light解析相关元素并组装。主要贡献是确立参数化灯光目标,揭示多方面剩余瓶颈,且在检测等方面取得一定分数。
Comments 18 pages, 7 figures, Project Page: https://haidilao0328.github.io/Lumera/