arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7387 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7387 篇

2601.05848 2026-03-24 cs.CV cs.AI cs.RO 62%

Goal Force: Teaching Video Models To Accomplish Physics-Conditioned Goals

目标力:教视频模型实现物理条件化的目标

Nate Gillman, Yinghua Zhou, Zitian Tang, Evan Luo, Arjan Chakravarthy, Daksh Aggarwal, Michael Freeman, Charles Herrmann, Chen Sun

机构 * Brown University(布朗大学) Cornell University(康奈尔大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Goal Force框架,通过显式力矢量和中间动力学定义目标,使视频模型能零样本泛化到复杂现实场景,实现基于物理的视频生成与规划。

Comments Camera ready version (CVPR 2026). Code and interactive demos at https://goal-force.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08138 2026-03-24 cs.CV cs.AI cs.MM 62%

Understanding Temporal Logic Consistency in Video-Language Models through Cross-Modal Attention Discriminability

通过跨模态注意力可区分性理解视频-语言模型中的时间逻辑一致性

Chengzhi Li, Heyan Huang, Ping Jian, Zhen Yang, Yaning Tian, Zhongbin Guo

机构 * School of Computer Science and Technology, Beijing Institute of Technology, Beijing, China(北京理工大学计算机科学与技术学院,北京,中国) Beijing Engineering Research Center of High Volume Language Information Processing and Cloud Computing Applications, Beijing Institute of Technology, Beijing, China(高性能语言信息处理与云计算应用北京工程研究中心,北京理工大学,北京,中国)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究探讨视频-语言模型在时间逻辑一致性问题上的核心原因,提出TCAS方法提升跨模态注意力的时序分辨能力,实验验证了方法对时间逻辑一致性的提升效果。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13275 2026-03-24 cs.LG cs.AI 62%

PREBA: Surgical Duration Prediction via PCA-Weighted Retrieval-Augmented LLMs and Bayesian Averaging Aggregation

PREBA:通过PCA加权检索增强LLMs和贝叶斯平均聚合进行手术持续时间预测

Wanyin Wu, Kanxue Li, Baosheng Yu, Haoyun Zhao, Yibing Zhan, Dapeng Tao, Hua Jin

机构 * School of Information Science and Engineering, Yunnan University(云南大学信息科学与工程学院) School of Computer Science, Wuhan University(武汉大学计算机学院) Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李科钦医学院) First People’s Hospital of Yunnan Province(云南省第一人民医院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 PREBA通过PCA加权检索增强和贝叶斯平均聚合,结合机构特定临床证据和统计先验,提升手术持续时间预测的准确性和稳定性,实验显示其性能显著优于零样本推理方法。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06931 2026-03-24 cs.AI cs.LG 62%

Automated Formalization via Conceptual Retrieval-Augmented LLMs

通过概念检索增强的LLM实现自动化形式化

Wangyue Lu, Lun Du, Sirui Li, Ke Weng, Haozhe Sun, Hengyu Liu, Minghe Yu, Tiancheng Zhang, Ge Yu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang 110819, China(东北大学计算机科学与工程学院,沈阳 110819,中国) Ant Research, Ant Group, Beijing, China(蚂蚁集团北京蚂蚁研究院,中国) Department of Computer Science, Aalborg University, Denmark(丹麦奥尔堡大学计算机科学系) Software College, Northeastern University, Shenyang 110819, China(东北大学软件学院,沈阳 110819,中国)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CRAMF框架,通过检索数学概念定义提升LLM形式化能力,解决模型幻觉和语义鸿沟问题,在三个基准测试中实现显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13925 2026-03-24 cs.CV cs.AI 62%

Segmenting Visuals With Querying Words: Language Anchors For Semi-Supervised Image Segmentation

通过查询词进行视觉分割:用于半监督图像分割的语言锚点

Numair Nadeem, Saeed Anwar, Muhammad Hamza Asad, Abdul Bais

机构 * University of Regina, Canada(里嘉大学) The University of Western Australia, Australia(西澳大学) University Canada West, Canada(加拿大西大学)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HVLFormer,通过生成多尺度文本查询和引入跨视角一致性正则化,提升视觉与文本对齐,以实现更准确的半监督图像分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16196 2026-03-24 cs.CV cs.LG 62%

Learn from Foundation Model: Fruit Detection Model without Manual Annotation

从基础模型学习:无需人工标注的水果检测模型

Yanan Wang, Zhenghao Fei, Ruichen Li, Yibin Ying

机构 * College of Biosystems Engineering and Food Science, Zhejiang University(浙江大学生物系统工程与食品科学学院) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学杭州全球科技创新中心) Faculty of Science, National University of Singapore(新加坡国立大学科学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出SDM-D框架,通过SDM和知识蒸馏技术,在无标注数据下训练高效的小模型,实现水果检测的高精度与速度,超越现有开放集检测方法。

Comments 35 pages, 11figures, conference or other essential info

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19608 2026-03-23 cs.CV cs.AI 62%

FB-CLIP: Fine-Grained Zero-Shot Anomaly Detection with Foreground-Background Disentanglement

FB-CLIP:基于前景-背景解耦的细粒度零样本异常检测

Ming Hu, Yongsheng Huo, Mingyu Dou, Jianfu Yin, Peng Zhao, Yao Wang, Cong Hu, Bingliang Hu, Quan Wang

机构 * Xi’an Institute of Optics and Precision Mechanics, Chinese Academy of Sciences(西安光学精密机械研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Xi’an Jiaotong University(西安交通大学) Zhongnan Hospital of Wuhan University(武汉大学中南医院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FB-CLIP框架,通过多策略文本表示和前景-背景分离,提升细粒度零样本异常检测的准确性和定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19531 2026-03-23 cs.CV cs.AI 62%

dinov3.seg: Open-Vocabulary Semantic Segmentation with DINOv3

dinov3.seg: 基于DINOv3的开放词汇语义分割

Saikat Dutta, Biplab Banerjee, Hamid Rezatofighi

机构 * IITB-Monash Research Academy(IITB-莫纳什研究学院) IIT Bombay(印度理工学院班加罗尔) Monash University(莫纳什大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出dinov3.seg,通过改进DINOv3模型实现开放词汇语义分割,结合文本嵌入与视觉特征,提升复杂场景下的分割精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19008 2026-03-20 cs.CL cs.AI cs.LG 62%

Hypothesis-Conditioned Query Rewriting for Decision-Useful Retrieval

基于假设的查询重写用于决策有用的检索

Hangeol Chang, Changsun Lee, Seungjoon Rho, Junho Yeo, Jong Chul Ye

机构 * Graduate School of AI, KAIST, Republic of Korea(韩国科学技术院人工智能研究生院) School of Electrical Engineering, KAIST, Republic of Korea(韩国科学技术院电气工程学院) Department of Industrial Engineering, Yonsei University, Republic of Korea(延世大学工业工程系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出HCQR框架,通过重写查询获取证据支持假设、区分替代方案和验证关键线索,提升检索与答案选择的对齐度,实验表明在MedQA和MMLU-Med上优于传统RAG方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02906 2026-03-20 cs.CV cs.AI cs.MM 62%

MRD: Multi-resolution Retrieval-Detection Fusion for High-Resolution Image Understanding

MRD:多分辨率检索-检测融合用于高分辨率图像理解

Fan Yang, Xingping Dong, Xin Yu, Wenhan Luo, Wei Liu, Kaihao Zhang

机构 * HITSZ(哈尔滨工业大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MRD框架,通过多分辨率语义融合和开放词汇检测提升高分辨率图像理解,实现局部和全局视角的增强,取得单目标和多目标理解任务的最先进性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23098 2026-03-20 cs.CV cs.AI 62%

Blind to Position, Biased in Language: Probing Mid-Layer Representational Bias in Vision-Language Encoders for Zero-Shot Language-Grounded Spatial Understanding

无视位置,语言偏见:探测视觉语言编码器中中间层表征偏见以实现零样本语言基础空间理解

Na Min An, Inha Kang, Minhyun Lee, Hyunjung Shim

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Samsung Electronics(三星电子)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究探讨了视觉语言编码器中间层中位置和语言相关信息的偏见,通过层间分析发现常规最终层多模态嵌入优先考虑全局语义对齐,导致视觉嵌入对位置线索敏感性低,多语言文本嵌入在共享空间中形成语言依赖的几何偏移,提出构建空间地图的方法提升零样本图像分割性能。

Comments 61 pages, 28 Figures, 15 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07923 2026-03-18 cs.CV cs.AI 62%

Exploring the Underwater World Segmentation without Extra Training

探索无需额外训练的水下世界分割

Bingyu Li, Tao Huo, Da Zhang, Zhiyuan Zhao, Junyu Gao, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom, China(人工智能研究院(TeleAI),中国电信,中国) University of Science and Technology of China, China(中国科学技术大学,中国) Northwestern Polytechnical University, China(西北工业大学,中国)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AquaOV255水下分割数据集及Earth2Ocean框架,通过几何引导视觉掩码生成和类别-视觉语义对齐模块,在无需额外训练的情况下实现高效的水下开放词汇分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02869 2026-03-18 cs.CY cs.AI cs.CV 62%

Representing Beauty: Towards a Participatory but Objective Latent Aesthetics

表现美:迈向一种参与但客观的潜在美学

Alexander Michael Rusnak

机构 * Digital Humanities Laboratory(数字人文实验室) École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院洛桑分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨神经网络如何表征美,通过跨模型表征收敛研究,发现美能产生更相似的表示,而不美的图像则不能。研究提出美的现实基础,并强调人类感知与创作在塑造深度学习模型潜在空间中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06993 2026-03-18 cs.AI cs.CV 62%

IMAIA: Interactive Maps AI Assistant for Travel Planning and Geo-Spatial Intelligence

IMAIA:交互式地图AI助手用于旅行规划和地理空间智能

Jieren Deng, Zhizhang Hu, Ziyan He, Aleksandar Cvetkovic, Pak Kiu Chung, Dragomir Yankov, Chiqun Zhang

机构 * Microsoft(微软) Amazon(亚马逊)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 IMAIA通过自然语言交互整合矢量地图和卫星影像,结合地理空间信息提升地图相关问答和摄像头到地点的关联能力,实现空间感知的对话式地图系统。

Comments Accepted to The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13993 2026-03-17 cs.CV cs.AI 62%

VAD4Space: Visual Anomaly Detection for Planetary Surface Imagery

VAD4Space:行星表面影像的视觉异常检测

Fabrizio Genilotti, Arianna Stropeni, Francesco Borsatti, Manuel Barusco, Davide Dalle Pezze, Gian Antonio Susto

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VAD4Space框架,用于自动化发现行星探索中的异常现象,通过实测评估了最先进的基于特征的VAD方法,并建立了两个基准数据集以支持行星科学中的异常检测应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13241 2026-03-17 stat.ML cs.AI cs.LG 62%

A Hybrid Tsallis-Polarization Impurity Measure for Decision Trees: Theoretical Foundations and Empirical Evaluation

一种混合的Tsallis-极化杂质度量用于决策树:理论基础和经验评估

Edouard Lansiaux, Idriss Jairi, Hayfa Zgaya-Biau

机构 * Emergency Department, Lille University Hospital(里尔大学医院急诊科) Lille University(里尔大学) LIRMM Montpellier University(蒙彼利埃大学LIRMM) UMontpellier(蒙彼利埃大学) CRISTAL UMR CNRS 9189 Lille University(里尔大学CRISTAL UMR CNRS 9189)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种结合归一化Tsallis熵与指数极化成分的混合杂质度量ITC,理论分析与实验验证显示其在决策树学习中具有良好的理论基础和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06213 2026-03-09 cs.CV cs.AI 62%

Cut to the Chase: Training-free Multimodal Summarization via Chain-of-Events

直击核心:一种无需训练的多模态摘要方法 via 事件链

Xiaoxing You, Qiang Huang, Lingyu Li, Xiaojun Chang, Jun Yu

机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机科学学院) School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 无需训练的多模态摘要方法CoE通过事件链和层次事件图实现跨模态整合与时间推理,提升摘要质量与领域适应性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04819 2026-03-06 cs.RO cs.AI cs.LG 62%

On the Strengths and Weaknesses of Data for Open-set Embodied Assistance

关于数据在开放集具身助益中的优势与劣势

Pradyumna Tambwekar, Andrew Silva, Deepak Gopinath, Jonathan DeCastro, Xiongyi Cui, Guy Rosman

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了多模态基础模型在开放集辅助任务中的泛化能力,通过合成数据集评估模型在新用户行为和新配置中的表现,揭示了辅助数据集设计对模型性能的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17100 2026-03-06 cs.LG cs.AI 62%

Generative Models in Decision Making: A Survey

生成模型在决策中的应用:综述

Xinyu Shao, Jianping Zhang, Haozhi Wang, Leo Maxime Brunswic, Kaiwen Zhou, Jiqian Dong, Kaiyang Guo, Zhitang Chen, Jun Wang, Jianye Hao, Xiu Li, Yinchuan Li

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文综述提出了一种基于概率框架的控制作为推理的系统分类,将生成决策置于其中,通过变分因子分解轨迹后验,概念化了四个功能角色,并探讨了生成模型在高风险领域的应用及挑战。

Comments Project page:https://github.com/xyshao23/Awesome-Generative-Models-for-Decision-Making-Taxonomy

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04002 2026-03-05 cs.CV cs.AI 62%

Discriminative Perception via Anchored Description for Reasoning Segmentation

通过锚定描述实现的判别感知用于推理分割

Tao Yang, Qing Zhou, Yanliang Li, Qi Wang

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DPAD方法,通过生成描述性标题来增强推理分割的判别能力,提升推理链的聚焦性和效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03343 2026-03-05 q-bio.NC cs.AI cs.LG 62%

Neuro-Symbolic Decoding of Neural Activity

神经符号解码神经活动

Yanchen Wang, Joy Hsu, Ehsan Adeli, Jiajun Wu

机构 * Columbia University(哥伦比亚大学) Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 NEURONA通过结合符号推理与fMRI基础,提升神经活动解码的准确性和泛化能力。

Comments ICLR 2026. First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14572 2026-03-04 cs.LG cs.AI 62%

Robust Weight Imprinting: Insights from Neural Collapse and Proxy-Based Aggregation

鲁棒性权重印刻:来自神经坍缩和基于代理的聚合的见解

Justus Westerhoff, Golzar Atefi, Mario Koddenbrock, Alexei Figueroa, Alexander Löser, Erik Rodner, Felix A. Gers

机构 * DATEXIS, Berliner Hochschule für Technik (BHT), Germany(DATEXIS,柏林技术学院(BHT)) KI-Werkstatt, University of Applied Sciences Berlin, Merantix Momentum, Germany(KI工作室,柏林应用技术大学,Merantix Momentum) Hochschule für Technik und Wirtschaft Berlin (HTW)(柏林技术与经济高等学院(HTW))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出IMPRINT框架,通过神经坍缩现象和代理聚合改进迁移学习,实现4%的性能提升。

Journal ref Transactions on Machine Learning Research (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01274 2026-03-03 cs.LG cs.AI 62%

GlassMol: Interpretable Molecular Property Prediction with Concept Bottleneck Models

GlassMol:通过概念瓶颈模型实现可解释的分子属性预测

Oscar Rivera, Ziqing Wang, Matthieu Dagommer, Abhishek Pandey, Kaize Ding

机构 * Northwestern University(西北大学) AbbVie(阿比维)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 GlassMol通过自动化概念整理和LLM引导的概念选择,解决分子属性预测中的可解释性与性能权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01844 2026-03-03 cs.CV cs.AI 62%

CloDS: Visual-Only Unsupervised Cloth Dynamics Learning in Unknown Conditions

CloDS: 未知条件下的视觉-only 无监督布料动力学学习

Yuliang Zhan, Jian Li, Wenbing Huang, Wenbing Huang, Yang Liu, Hao Sun

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) School of Engineering Science, University of Chinese Academy of Sciences(中国科学院大学工程科学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 CloDS通过无监督学习从多视角视觉数据中学习布料动力学,解决未知条件下的动态模拟问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06203 2026-03-03 cs.LG cs.AI 62%

Reference Grounded Skill Discovery

基于参考的技能发现

Seungeun Rho, Aaron Trinh, Danfei Xu, Sehoon Ha

机构 * School of Interactive Computing(交互计算学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 RGSD通过语义有意义的潜在空间实现技能发现,有效模仿和发现多样行为,在运动任务中优于模仿学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16612 2026-03-03 cs.CL cs.AI cs.CV 62%

MemeIntel: Explainable Detection of Propagandistic and Hateful Memes

MemeIntel: 可解释性地检测宣传性及仇恨言论的迷因

Mohamed Bayan Kmainasi, Abul Hasnat, Md Arid Hasan, Ali Ezzat Shahroor, Firoj Alam

机构 * Qatar Computing Research Institute(卡塔尔计算研究 institute)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 MemeIntel通过多阶段优化方法和视觉-语言模型,提升了阿拉伯语宣传性迷因和英语仇恨言论的检测与解释生成性能,准确率提升显著。

Comments disinformation, misinformation, factuality, harmfulness, fake news, propaganda, hateful meme, multimodality, text, images

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15852 2026-03-03 cs.CV cs.AI 62%

Advancing Complex Video Object Segmentation via Progressive Concept Construction

通过渐进式概念构建推进复杂视频对象分割

Zhixiong Zhang, Shuangrui Ding, Xiaoyi Dong, Songxin He, Jianfan Lin, Junsong Tang, Yuhang Zang, Yuhang Cao, Dahua Lin, Jiaqi Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Harbin Institute of Technology(哈尔滨工业大学) CPII under InnoHK(InnoHK下的CPII)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 SeC通过渐进式概念构建方法,在复杂视频对象分割任务中实现了显著性能提升,特别是在语义复杂场景下的表现优于现有方法。

Comments project page: https://rookiexiong7.github.io/projects/SeC/ ; code: https://github.com/OpenIXCLab/SeC ; dataset: https://huggingface.co/datasets/OpenIXCLab/SeCVOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13671 2026-03-03 cs.CV cs.LG 62%

FiLo: Zero-Shot Anomaly Detection by Fine-Grained Description and High-Quality Localization

FiLo:通过细粒度描述和高质量定位实现零样本异常检测

Zhaopeng Gu, Bingke Zhu, Guibo Zhu, Yingying Chen, Hao Li, Ming Tang, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所基础模型研究中心) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) Objecteye Inc., Beijing, China(Objecteye公司) Central South University, Hunan, China(中南大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 FiLo通过细粒度描述和高质量定位实现零样本异常检测,提升检测和定位性能。

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00155 2026-03-03 cs.CV cs.AI cs.IR 62%

EfficientPosterGen: Semantic-aware Efficient Poster Generation via Token Compression and Accurate Violation Detection

EfficientPosterGen: 通过令牌压缩和准确违规检测的语义感知高效海报生成

Wenxin Tang, Jingyu Xiao, Yanpei Gong, Fengyuan Ran, Tongchuan Xia, Junliang Liu, Man Ho Lam, Wenxuan Wang, Michael R. Lyu

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Harbin Institute of Technology(哈尔滨工业大学) Wuhan University(武汉大学) Beijing University of Posts and Telecommunications(北京邮电大学) Dalian Maritime University(大连海事大学) Renmin University of China(中国人民大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 EfficientPosterGen通过语义感知检索、视觉上下文压缩和无代理布局检测技术,实现高效且可靠的学术海报自动生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00136 2026-03-03 cs.CV cs.AI 62%

TinyVLM: Zero-Shot Object Detection on Microcontrollers via Vision-Language Distillation with Matryoshka Embeddings

TinyVLM:通过Matryoshka嵌入的视觉-语言蒸馏实现微控制器上的零样本目标检测

Bibin Wilson

机构 * Independent Researcher(独立研究者)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 TinyVLM通过Matryoshka嵌入和视觉-语言蒸馏,在微控制器上实现低内存的零样本目标检测

详情

展开后加载摘要…

URL PDF HTML 收藏