CASTing Your Model: Learning to Localize Improves Self-Supervised Representations
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments ACL'20
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments NeurIPS 2019. First two authors contributed equally. Project page: http://vcml.csail.mit.edu/
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments EMNLP 2018 Camera Ready
Journal ref EMNLP 2018
利用双曲几何进行有害提示检测与净化
机构 * University of Genoa(热那亚大学) ; Sapienza University of Rome(罗马大学) ; University of Cagliari(卡利亚里大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI;VLM(comments)
AI总结 本文提出HyPE和HyPS方法,利用双曲几何空间检测和净化有害提示,提升视觉语言模型的安全性与鲁棒性。
Comments Paper accepted at ICLR 2026. Webpage available at: https://hype-vlm.github.io
涌现不变性:从符号化思维到结构控制
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 该研究形式化了语言为核心的智能的限制,提出动态边界控制框架,通过DeepSeek V4-Flash实验验证其可提升大语言模型的推理性能,组织了大语言模型的涌现限制。
StocksTalk:一种面向网络数据结构化查询生成的语音赋能对话智能体
机构 * IIIT-Delhi(德里印度信息技术学院) ; Singapore Institute of Technology(新加坡理工学院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 StocksTalk是一种语音赋能对话系统,可将口语化金融请求转为结构化查询,通过多模块提升准确性,为股票筛选决策提供支持。
标准可解释模型:一种基于拉格朗日力学的可解释机器学习通用理论,用于演绎设计可解释方法
机构 * IBM Research (CH)(IBM研究院(瑞士)) ; University of Oxford (UK)(牛津大学(英国)) ; University of Cambridge (UK)(剑桥大学(英国)) ; KU Leuven (BE)(鲁汶大学(比利时)) ; Institute of Physics of the Czech Academy of Sciences (CZ)(捷克科学院物理研究所(捷克))
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 提出标准可解释模型(SIM),基于拉格朗日力学从前提演绎出可解释性对称性和约束,通过最小化拉格朗日函数得到最优可解释模型,解决现有方法局限性并指导新方法设计。
HarmTrace:用于恶意梗图细粒度目标识别的锚定校准解耦优化方法
专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本研究针对多模态恶意梗图检测中存在的目标识别错误问题,提出HarmTrace框架,结合实体感知微调与CTPO方法,在Qwen3-VL-8B上JRA提升至52.51%,还构建了Meme3W数据集与JRA指标。
通过数据合成与统一规划扩展基于手册的家电操作规模
机构 * Center on Frontiers of Computing Studies, School of Computer Science, Peking University(北京大学计算机学院计算前沿研究中心) ; Beijing University of Aeronautics and Astronautics(北京航空航天大学) ; Jingdong Technology Information Technology Co., Ltd(京东科技信息技术有限公司)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 针对现有大模型缺乏支持基于手册的家电操作规划的数据集的问题,提出MAGE数据合成流水线构建UseAppliance数据集,开发AppliancePlan模型,在RealAppliance-Bench和真实机器人实验中表现优异,推进通用家用机器人发展。
Comments Accepted by ACM MM 26
Handoff-H1:一种用于从建筑蓝图中提取材料工程量的协同视觉智能体系统
机构 * Handoff AI Research(汉德夫人工智能研究院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 该研究提出Handoff-H1视觉智能体系统,结合专用计算机视觉模型、工具智能体与建筑知识库,在建筑蓝图工程量提取基准上,性能优于前沿模型和人类专业估算师。
Comments 15 pages, 7 figures. Evaluation harness available on https://github.com/handoffai/residential-takeoff-benchmark/. Request data via e-mail to research@handoff.ai
我们能否防御AI生成视频对现实世界危机事件的攻击?对检测器、生成器及社交传播的系统性评估
专题命中 视觉定位与Grounding :MLLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 本研究推出RA-Bench基准,系统评估AI生成视频检测器、生成器及社交传播特性,发现现有检测器泛化性差、难以检测逼真生成视频,需鲁棒检测器。
Comments 63 pages, 20 figures, 32 tables
分割一切模型中的提示工程:方法、应用与新兴挑战
机构 * School of Computer Science and Technology, Tongji University(计算机科学与技术学院,同济大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本综述系统梳理了SAM的提示工程技术,将其分为三类并分析方法演变,探讨其跨领域应用,指出三大挑战并提出有前景的研究方向,为相关领域提供参考。
基于ISO标准的非功能性需求(NFR)规范是否能提升大语言模型(LLM)的代码生成能力?针对丰富干预方式、结构化干预方式与自然语言基线的对比研究
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 该研究对比了ISO标准下丰富自然语言、结构化JSON与单行基线三种NFR规范对LLM代码生成的影响,发现前者可提升代码静态质量,且语义内容比格式更重要。
Comments 11 pages, 2 figures, Accepted for publication at the 20th Brazilian Symposium on Software Components, Architectures, and Reuse (SBCARS 2026)
针对特定语料库的临床检索增强生成(RAG)系统在HealthBench上的表现与较新的前沿大语言模型相当或更优
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 本文评估专为中低收入环境构建的临床RAG系统VITA,其在HealthBench基准测试中与前沿LLM表现相当或更优,语料库特异性可提升模型落地性但会降低沟通流畅度。
Comments 2 tables
CORE-3D: 基于嵌入的上下文感知开放词汇检索
机构 * Department of Electrical Engineering, Sharif University of Technology(电气工程系,谢里夫大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 CORE-3D通过结合上下文感知的CLIP编码和渐进粒度细化,提升3D场景理解中开放词汇检索和语义分割的准确性与鲁棒性。
用于跨多个显微镜数据集实现稳健白血病细胞分类的检索增强视觉基础模型
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG
AI总结 本研究提出基于预训练视觉基础模型的两阶段检索增强框架,经多数据集测试,可实现跨异构数据集的稳健白血病细胞分类,为解决领域偏移问题提供低成本替代方案。
Comments Accepted at SPIE Optics + Photonics 2026 for oral presentation. 23 pages, 12 figures, 9 tables
可操作的幻觉检测:将潜在不确定性转化为智能体批判
机构 * Samsung Research America(美国三星研究院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出Latent Critic轻量级LoRA适配器,可实时检测LLM智能体的幻觉,定位准确率超80%、AUROC达0.966,能拦截幻觉并助力智能体自我修正,效能优于同类基线方法。
Comments 22 pages, 6 figures
DOCSCHISEL:面向大语言模型智能体的自适应工具文档优化框架
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对LLM智能体工具文档的异质性与泛化问题,提出DocsChisel自适应优化框架,经实验较原始文档及EasyTool、DRAFT基线大幅提升任务成功率,且开销有限。
EventCoT:用于推理时间定位的以事件为中心的视频思维链
机构 * Pohang University of Science and Technology(浦项科技大学) ; Korea Advanced Institute of Science and Technology(韩国科学技术院) ; Handong Global University(韩东国际大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 提出EventCoT框架解决推理时间定位难题,先对视频进行以事件为中心的分词,再在识别出的事件内推理生成答案,通过嵌入匹配确定时间间隔,在相关任务中取得好结果。
Comments 27 pages, 11 figures, 19 tables. Co-corresponding authors: Dongkeun Kim and Suha Kwak
在大型语言模型中自我改进的极限:没有符号模型合成,奇点并不临近
机构 * Algorithmic Dynamics Lab(算法动力实验室) ; Department of Biomedical Computing(生物医学计算系) ; School of Biomedical Engineering and Imaging Sciences(生物医学工程与成像科学学院) ; King’s Institute for AI(国王人工智能研究所) ; King’s College London(伦敦国王学院) ; Oxford Immune Algorithmics(牛津免疫算法公司) ; Oxford University Innovation(牛津大学创新中心) ; London Institute for Healthcare Engineering(伦敦医疗工程研究所)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 研究指出大型语言模型在缺乏外部信号时自我改进会退化,提出神经符号整合方法以突破这一限制。
Comments 31 pages. Update: DPI and Levin's non-growth is not violated explanation when it comes to finite learners
当潜变量遗忘像素时:在扩散Transformer超分辨率中恢复保真度
机构 * Dartmouth College(达特茅斯学院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本研究针对扩散Transformer超分辨率中VAE压缩导致的保真度下降问题,提出像素锚定超分辨率框架,通过复用VAE前的像素证据提升结果的忠实度,实验验证其性能优于现有潜变量生成式超分辨率方法。
GRACE:用于可扩展混合数据聚类的大语言模型(LLM)基础语义度量空间
机构 * Guangdong University of Technology(广东工业大学) ; Tsinghua University(清华大学) ; Peking University(北京大学) ; Shenzhen University(深圳大学) ; Xiamen University(厦门大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 针对混合数据聚类中语义丰富度与可扩展性的矛盾,提出GRACE框架,通过多视角LLM查询实现一次性语义嵌入,兼顾可扩展性与聚类性能,优于11种对比方法。
Comments 13 pages
SARVLM:一种用于SAR图像语义理解的视觉语言基础模型
机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) ; Yuelushan Center for Industrial Innovation(岳麓山创新中心) ; School of Medical Information Engineering, Jining Medical University(济南医学院医学信息工程学院)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出SARVLM,一种专为SAR图像设计的视觉语言基础模型,通过多阶段领域迁移策略和集成策略提升跨场景泛化能力,在多个基准测试中表现优异。
Comments 13 pages, 13 figures
Pixel-TTS: 基于图像的文字渲染实现鲁棒文本转语音
机构 * SPRING Lab, Indian Institute of Technology, Madras, India(SPRING实验室,印度理工学院,马德拉斯,印度) ; MBZUAI, UAE(MBZUAI,阿联酋)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 提出Pixel-TTS框架,将文本渲染为图像并通过2D卷积生成嵌入,消除嵌入矩阵扩展,提升对未见字符和拼写变体的鲁棒性,实现零样本泛化。
Comments 11 pages, 5 figures, 15 tables
什么驱动了CLIP的测试时适应?从更新视角进行的受控实证研究
机构 * Tsinghua University(清华大学) ; Shenzhen Technology University(深圳技术大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 本文通过受控实证研究,从更新视角分析了CLIP测试时适应方法的驱动因素,揭示了适应增益主要来自测试时证据和可靠代理,而非繁重优化,并指出无单一范式普遍最优。
Comments Benchmark and codes are available at https://github.com/walawalagoose/TTABC
训练多模态大语言模型(MLLMs)说“不”:基于拒绝校准GRPO的广义指代表达理解
专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 针对MLLMs因训练缺负样本导致无法拒绝不存在对象的问题,提出RC-GRPO方法,在保持定位精度的同时增强拒绝能力,在三个GREC基准上表现优异。
TimeSearch: 基于聚光灯和反射的层次视频搜索用于类人长视频理解
机构 * ByteDance(字节跳动) ; School of Computer Science, Peking University(北京大学计算机科学学院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 TimeSearch通过Spotlight和Reflection机制,提升长视频理解的准确性和效率
Comments ACMMM 2026
Video-DeepResearch:迈向新一代多模态深度研究智能体
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 该研究提出Video-DR智能体框架,通过解耦感知-探索流水线与分阶段工具解锁解决现有多模态模型的模态偏差和知识泄漏问题,构建基准并在视频问答任务上取得SOTA性能。