arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2619 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 89 篇

2608.18602 2026-08-20 cs.CV 新提交 57%

Teach a Molmo2Fish: Towards interactive fish tracking with natural language guidance

Teach a Molmo2Fish:面向自然语言引导的交互式鱼类追踪

Kai Van Brunt, Justin Kay, Sara Beery

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 本研究针对声呐鱼类追踪数据集定制了多模态大语言模型工具Molmo2Fish,通过交互式预测修正工作流开展实验,发现其在鱼类追踪和轨迹修正上性能良好,但自然语言引导的融入仍需提升。

Comments 29 pages, 6 figures, to be published in Third Workshop on Computer Vision for Ecology at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14226 2026-08-17 cs.CV 新提交 57%

RankT2I: A Submodular Framework for Discovering Interpretable and Diverse Semantics in Text-to-Image Models

RankT2I:一种用于发现文本到图像模型中可解释且多样化语义的子模框架

Ritika Allada, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文提出无训练、模型无关的RankT2I框架,通过子模方法自动发现T2I模型的可编辑语义,性能优于现有方法,可高效获取多领域文本到图像编辑所需的多样化语义。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13974 2026-08-17 cs.CV 新提交 57%

ProFocus: Interpreting Affective Experience in Artistic Images with Progressive Visual Focusing

ProFocus:通过渐进式视觉聚焦解释艺术图像中的情感体验

Zhiyan Zhang, Zicheng Yan, Jianqi Chen, Peipei Song, Shanshan Wang, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) Anhui University(安徽大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 本研究针对现有方法无法捕捉艺术情感细微线索的问题,提出ProFocus框架,通过层级艺术评论家与渐进式提示融合模块,在ArtEmis数据集上实现了更优的情感识别与解释性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13605 2026-08-17 cs.AI cs.RO 新提交 57%

Active Perception for Embodied Disambiguation

用于具身消歧的主动感知

Yiwei Liu, Luwei Yang

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) Shenzhen Research Institute of Big Data(深圳大数据研究院)

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

AI总结 该研究针对具身环境中目标歧义问题,提出以主动观测为核心的主动感知框架,结合视觉语言模型实现信息获取与用户意图澄清,经真实机器人实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12532 2026-08-14 cs.MM cs.CV cs.IR 新提交 57%

MASCOT: Model-Aware Submodular Coverage for Composite-Attribute Text-to-Image Retrieval

MASCOT:面向复合属性文本到图像检索的模型感知子模覆盖

Aaryan Sharma, Vishak Prasad C, Virendra Singh, Ganesh Ramakrishnan

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 针对现有流形重排序方法在复合属性文本到图像检索的多样性降低任务中早期排名召回率大幅下降的问题,提出MASCOT方法,在PixelProse数据集复合约束任务中表现优于MS-DPP,尤其在排名1后召回率上优势显著。

Comments 21 pages, 4 figures. Accepted at ACM Multimedia 2026 (MM '26), Rio de Janeiro, Brazil. Extended version with full appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11425 2026-08-13 cs.CV 新提交 57%

VLMs Win a Systematic Evaluation of Underwater Image Reconstruction

视觉语言模型(VLMs)在水下图像重建的系统评估中胜出

Sara Aghajanzadeh, Yingxue Wang, Ieva Bagdonaviciute, David Forsyth

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文提出水下图像重建的系统评估流程,评估发现未经过明确物理模型训练的视觉语言模型(VLMs)显著优于基于物理的模型,真实场景图像结果验证了该评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10154 2026-08-12 cs.CL cs.AI 新提交 57%

Multimodal Item Parameter Estimation using Simulated Response Probabilitie

基于模拟响应概率的多模态题目参数估计

Christopher Ormerod, YoungKoung Kim

机构 * College Board(大学理事会)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 本研究基于Qwen3.5微调多模态大语言模型,利用含图像与文本的多项选择题训练语料,通过学习学生能力相关的选择概率,实现了题目参数的准确估计。

Comments Submitted and Accepted for AIME-Con 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08402 2026-08-11 cs.CV 新提交 57%

Agentic AI-powered flexible fiber-bundle endoscopy for high-resolution NIR-II fluorescence imaging in vivo

智能体驱动的柔性光纤束内窥镜用于体内高分辨率近红外二区(NIR-II)荧光成像

Yanzhao Shi, Yuanhua Liu, Sixin Xu, Wayne Jason Li, Yuyuan Chen, Danyang Xu, Zhisheng Wu, Hanze Yu, Ian Yu-Hong Wong, Simon Ying-Kit Law, Hongjie Dai, Liangqiong Qu, Feifei Wang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 该研究开发了AI驱动的柔性光纤束内窥镜平台,通过光学-计算协同设计及GAME流水线提升NIR-II成像分辨率,实现体内生物样本高分辨率成像,为临床转化奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06467 2026-08-10 cs.CV 新提交 57%

Test-Time Adaptation with Online Personalized Energy-Based Cache for Fine-Grained Video Expression Recognition

用于细粒度视频表情识别的基于能量缓存的在线个性化测试时自适应

Masoumeh Sharafi, Muhammad Osama Zeeshan, Soufiane Belharbi, Alessandro Lameiras Koerich, Marco Pedersoli, Eric Granger

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 针对视频FER的测试时自适应难题,提出EB-CaP方法,通过轻量级能量模型结合CLIP生成个性化缓存,在低开销下优于现有SOTA方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05215 2026-08-07 cs.RO cs.CV 新提交 57%

VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances

VLAff:用于统一可操作 affordance 的视觉-语言-affordance 模型

Jihoon Oh, Kento Kawaharazuka, Kei Okada

机构 * University of Tokyo(东京大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本研究提出 VLAff 模型,结合 EgoAffordance 数据集,解决人类与机器人 embodiment 不匹配问题,实现视觉 affordance 预测及真实机器人零样本操作等应用。

Comments 8 pages, 5 figures. Accepted to IEEE/RSJ IROS 2026. Project page: https://ojh6404.github.io/vlaff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00736 2026-08-04 cs.CV 新提交 57%

MDTD-ArtIR: Benchmarking Image Editing and Restoration Models for Art Image Restoration under Texture-Overlay Degradations

MDTD-ArtIR:针对纹理叠加退化的艺术图像修复的图像编辑与修复模型基准测试

Mridula Vijendran, Shuang Chen, Hubert P. H. Shum

机构 * Durham University(杜伦大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本研究构建MDTD-Art基准及MDTD-Art数据集,对比各类模型,发现图像编辑模型在艺术图像修复中优于专用修复架构,结构化提示可放大其性能优势。

Comments 15 pages, 6 figures, 6 tables. Preprint submitted to Elsevier Journal of Visual Communication and Image Representation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00284 2026-08-04 cs.RO cs.AI 新提交 57%

Hybrid Attention Estimation Pipeline for Adaptive HRI Using an Expressive Robotic Head

基于富有表现力的机器人头部的自适应人机交互混合注意力估计流程

Pablo Moraes, Monica Rodriguez, Christopher Peters, Hiago Sodre, Tobias Doernbach, Bruna Guterres, Ricardo Grando

机构 * Technological University of Uruguay(乌拉圭科技大学) Ostfalia University of Applied Sciences(奥斯特法利亚应用科技大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

AI总结 该研究提出结合几何与语义感知层的混合注意力估计流程,通过有限状态机调节自适应人机交互,经10人40次试验验证其交互启动可靠、暂停行为一致且输出信息非冗余。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29192 2026-08-03 cs.CV 新提交 57%

Locally Consistent Transductive Information Maximization for Few-Shot Remote Sensing Scene Classification

用于小样本遥感场景分类的局部一致直推式信息最大化

Karim El Khoury, Benoît Gérin, Benoît Macq, Christophe De Vleeschouwer

机构 * ICTEAM, UCLouvain(天主教鲁汶大学 ICTEAM 研究所)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 针对小样本遥感场景分类问题,提出LC-TIM方法,融合多源遥感基础模型亲和图,建立首个直推式小样本遥感场景分类基准,实验表明其性能优于现有方法。

Comments Accepted at ECCVW2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25642 2026-07-29 cs.CV cs.CL 新提交 57%

Instruction-based Image Editing: A Survey on Data, Models, Evaluation, and Applications

基于指令的图像编辑:数据、模型、评估及应用综述

Xianghao Zang, Zijian Jiang, Jiarong Cheng, Qianrui Teng, Ying He, Yuxuan Mu, Chao Ban, Huayu Zhang, Lanxiang Zhou, Zerun Feng, Chi Zhang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 综述基于指令的图像编辑研究,围绕任务定义、数据构建、模型架构、评估指标及商业应用五个维度展开,提出综合深度诊断基准,通过开源方案比较揭示优缺点,探讨未来研究方向以推动该领域发展。

Comments 33 pages, 7 figures, Vicinagearth

Journal ref Zang, X., Jiang, Z., Cheng, J. et al. Instruction-based image editing: a survey on data, models, evaluation, and applications. Vicinagearth 3, 3 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23808 2026-07-28 cs.CL cs.AI 新提交 57%

Indic DiarBench: A Multilingual Joint Diarization and ASR Benchmark for Indian Languages

Indic DiarBench:印度语言的多语言联合语音分离与自动语音识别基准

Deovrat Mehendale, Aditya Mehndiratta, Dhruv Rathi, Kaushal Bhogale, Mitesh M. Khapra

机构 * Sarvam AI(萨尔瓦姆人工智能公司) AI4Bharat, IIT Madras(印度理工学院马德拉斯分校人工智能促进印度发展实验室)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 介绍涵盖印度22种在册语言的Indic DiarBench基准数据集,含约108小时多说话者音频,经人工校正注释。通过评估领先系统建立基线,该数据集作为开放资源推动印度语言多语言语音技术研究。

Comments 5 pages, 2 figures, Interspeech 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22632 2026-07-28 cs.AI 新提交 57%

VlogReward: Learning Multi-Dimensional Evaluation for Vlog Editing

VlogReward:学习用于Vlog编辑的多维评估

Yexiang Liu, Wen Zhong, Sijie Zhu, Xin Gu, Fan Chen, Junxian Duan, Jie Cao, Longyin Wen, Zhenfang Chen

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 针对Vlog评估主观性强且缺乏标准等问题,提出VlogReward模型。通过专业指导定义评估框架,构建数据集和基准,增强GRPO框架。该模型能提供多维分数与反馈,优于现有MLLMs,助力Vlog创作者及自动化评估完善系统。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19767 2026-07-23 cs.AI 新提交 57%

Symbol and Footprint Database for Electronic Components by Agentic Recognition and Generation

基于智能识别与生成的电子元件符号与引脚封装数据库

Yichen Shi, Yuzhi Liu, Zhuofu Tao, Li Huang, Yuhao Gao, Ting-Jung Lin, Lei Hel

机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波数字孪生研究院,东方理工大学) Shanghai Jiao Tong University(上海交通大学) BTD Technology(BTD科技)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 研究利用多模态大语言模型开发电子元件符号和引脚封装智能识别与生成流程SFgen,其符号生成准确率86%,引脚封装生成准确率80%,并用此创建含1000个元件的SFnet数据库,为PCB设计自动生成奠定基础。

Comments Accepted by PRCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05994 2026-07-08 cs.CV 新提交 57%

SparseCtrl-HOI: Sparse Temporal Control for Human-Object Interaction Video Generation

SparseCtrl-HOI:用于人机交互视频生成的稀疏时间控制

Shenbo Xie, Mingrui Cai, Xu Yang, Yifei Liu, Changxing Ding

机构 * South China University of Technology(华南理工大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 研究针对人机交互视频生成中建模物理动力学及时空协调复杂、现有方法依赖密集指导成本高且影响多样性的问题,提出SparseCtrl-HOI框架,用关键帧结合新机制和模块控制,构建数据集,降低标注开销,提升直播电商视频质量。

Comments ECCV 2026, Project Page: https://mpi-lab.github.io/SparseCtrl-HOI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20280 2026-07-07 cs.IR cs.AI 新提交 57%

ELVA: Exploring Ranking-Driven Universal Multimodal Retrieval

ELVA:探索排序驱动的通用多模态检索

Yuhan Liu, Pei Fu, Hang Li, Yukun Qi, Chao Jiang, Jingwen Fu, Zhen Liu, Bin Qin, Zhenbo Luo, Jian Luan, Jingmin Xin

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家级重点实验室) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) MiLM Plus Xiaomi Inc(小米公司) Zhongguancun Academy(中关村学院) Beijing, China(北京市)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 提出ELVA框架,通过基于规则的强化学习缓解对比学习中的粒度盲视问题,在通用多模态检索中实现排序优化,并在新基准MRBench上提升13.1%。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01748 2026-07-03 cs.CV 新提交 57%

RTE-FM-Dehazer: Radiative Transfer Equation Inspired Flow Matching for Real-World Image Dehazing

RTE-FM-Dehazer: 辐射传输方程启发的流匹配用于真实图像去雾

Chenfeng Wei, Chun Wang, Boyang Zhao, Si Zuo, Shenhong Wang, Chenguang Yang

机构 * Mashang Consumer Finance Co. Ltd(马上消费金融股份有限公司) Tsinghua University(清华大学) Hunan University(湖南大学) University of Liverpool(利物浦大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 提出基于辐射传输方程(RTE)的流匹配去雾方法RTE-FM-Dehazer,通过扩散-吸收正则化引导去雾轨迹,并构建包含5万对真实雾/清晰图像的P-HAZE数据集,在五个真实基准上取得领先结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00416 2026-07-02 cs.CV 新提交 57%

DroneIQA-VLE: Multi-Task Drone Image Quality Assessment via Vision-Language Ensemble

DroneIQA-VLE:基于视觉-语言集成的多任务无人机图像质量评估

Wei Sun, Weixia Zhang, Hongjian Zhan, Mingkai Lu, Yixuan Gao, Guangtao Zhai

机构 * East China Normal University(华东师范大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 提出DroneIQA-VLE框架,通过集成SigLIP2视觉编码器与多任务回归头以及LoRA微调的Qwen3.5-9B多模态大模型,联合预测全局、目标和背景质量分数,在ICME 2026无人机图像质量评估挑战赛中获得第二名。

Comments The model achieves 2nd place in ICME 2026 Drone-IQA Grand Challenge on Target-aware Image Quality Assessment for Low-altitude UAV Images

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26348 2026-06-26 cs.AI 新提交 57%

What We are Missing in Multimodal LLM Evaluation?

我们在多模态大语言模型评估中缺失了什么?

Po-han Li, Shenghui Chen, Sandeep Chinchali, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 本文分析现有多模态大语言模型评估基准的不足,识别出时空连贯性、物理世界理解、多模态一致性和选择性注意等关键缺失,强调填补这些空白对衡量多模态智能真实进展的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24649 2026-06-26 cs.CV 新提交 57%

Agentic Collaborative Cognition for Zero-Shot 3D Understanding

零样本3D理解的智能体协作认知

Wenxin Wang, Bo Zhang, Feng Chen, Zixuan Wang, Wen Li, Changsheng Li, Yinjie Lei

机构 * Sichuan University(四川大学) Adelaide University(阿德莱德大学) University of Electronic Science and Technology of China(电子科技大学) Beijing Institute of Technology(北京理工大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 提出协作多智能体框架,通过规划智能体补充视角和感知智能体构建结构化认知地图,实现零样本3D理解,在6个基准上达到最优性能。

Comments Accepted by ECCV 2026. Project page: https://zhangbo135.github.io/agentic-collaborative-cognition/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17110 2026-06-24 cs.CR cs.LG 新提交 57%

Loss Landscape Poisoning: Targeted Extraction of Unseen Training Data from LLMs

损失景观投毒:从大语言模型中定向提取未见训练数据

Md Abdullah Al Mamun, Ngoc Phu Doan, Pedram Zaree, Nael Abu-Ghazaleh, Ihsen Alouani

机构 * Queen's University Belfast(女王大学贝尔法斯特) CSIT, Queen's University Belfast(女王大学贝尔法斯特计算机科学与技术研究所)

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

AI总结 提出一种通过投毒重塑模型损失景观,迫使模型记忆目标数据并实现高成功率提取的攻击方法,在语言和视觉-语言模型上验证有效性,并发现差分隐私可防御但存在绕过攻击。

Comments Updated author order. No technical changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21657 2026-06-23 cs.CV cs.CL 新提交 57%

Chehre: An Emoji-Prompted Video Dataset for Perceptually Diverse Facial Expression Recognition

Chehre: 一个用于感知多样面部表情识别的表情符号提示视频数据集

Bita Azari, Zoe Stanley, Avneet Batra, Poorvi Bhatia, Hali Kil, Manolis Savva, Angelica Lim

机构 * Simon Fraser University(西蒙弗雷泽大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 提出Chehre数据集,通过表情符号提示收集动态面部表情视频,并转移至合成人脸以保护隐私,定义主导和分布表情识别任务,基准测试显示现有模型表现有限。

Comments 16 pages, 8 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19727 2026-06-19 cs.CL cs.AI 新提交 57%

NRITYAM: Language Models Meet Art and Heritage of Dance

NRITYAM:语言模型遇见舞蹈的艺术与遗产

Punit Kumar Singh, Niladri Ghosh, Advait Joshiınst, Shailee Choudhary, Michael Färber, Haiqin Yang

机构 * Shenzhen Technology University(深圳技术大学) New Delhi Institute of Management(新德里管理学院) Technische Universität Dresden(德累斯顿工业大学) Ramakrishna Mission Vivekananda Educational and Research Institute(罗摩克里希纳传道会维韦卡南达教育与研究学院) Indian Institute of Technology(印度理工学院) Swami Vivekananda Institute of Technology(斯瓦米·维韦卡南达技术学院) GuangDong Engineering Technology Research Center of Edge Intelligence(广东省边缘智能工程技术研究中心)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 提出NRITYAM基准,包含9,260个跨12语言的文化问答对,评估语言模型对全球舞蹈传统的文化理解能力,涵盖多种模型类型。

Comments 18 pages, 12 figures, in ECML_PKDD'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15888 2026-06-16 cs.SD cs.AI eess.AS 新提交 57%

NVMOS: Non-Verbal Vocalization Quality Assessment in Speech

NVMOS:语音中非语言发声质量评估

Jialong Mai, Jinxin Ji, Xiaofen Xing, Wencui Liu, Xiangmin Xu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 针对非语言发声(如笑声、叹息)的感知质量评估空白,构建NV-MOS数据集,提出首个专用模型NVMOS,通过局部聚焦模块达到专家级评估一致性。

Comments 6 pages. Code and model: https://github.com/yongaifadian1/NVMOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15169 2026-06-16 cs.CV 新提交 57%

Label Shift Aware Adaptation for Online Zero-shot Learning with Contrastive Language-Image Pre-Training (CLIP)

基于对比语言-图像预训练(CLIP)的在线零样本学习中的标签偏移感知自适应

Pengxiao Han, Changkun Ye, Yanshuo Wang, Jinguang Tong, Miaohua Zhang, Xuesong Li, Jie Hong, Lars Petersson

机构 * Australian National University(澳大利亚国立大学) China North Vehicle Research Institute(中国北方车辆研究所) The Hong Kong Polytechnic University(香港理工大学) Griffith University(格里菲斯大学) CSIRO(澳大利亚联邦科学与工业研究组织) The University of Hong Kong(香港大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 针对在线零样本学习中测试数据与CLIP训练数据分布不匹配的问题,提出标签偏移感知(LSA)方法,通过域自适应和标签偏移校正提升分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12125 2026-06-11 cs.CV 新提交 57%

Q-Fold: Query-Aware Focus-Context Spatio-Temporal Folding for Long Video Understanding

Q-Fold: 查询感知的焦点-上下文时空折叠用于长视频理解

Biao Tang, Xu Chen, Shuxiang Gou, Jingyi Yuan, Yuhan Zhang, Chenqiang Gao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(电子科技大学深圳高等研究院)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 提出Q-Fold,一种无需训练的长视频输入构建框架,通过查询引导将相关片段保留为高保真焦点帧,不相关片段折叠为上下文布局,在固定预算下提升多模态大模型的长视频理解性能。

Comments 10 pages, 5 figures, 8 tables. Code will be made publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07161 2026-06-08 cs.CV 新提交 57%

TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance

TraRA: 面向城市监控视频文本识别的轨迹级识别聚合方法

Duc Tri Tran, Trung Thanh Nguyen, Vijay John, Phi Le Nguyen, Yasutomo Kawanishi

机构 * RIKEN(日本理化学研究所) Hanoi University of Science and Technology(河内科学技术大学) Nagoya University(名古屋大学) Lawrence Technological University(劳伦斯技术大学) Ritsumeikan University(立命馆大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 提出TraRA方法,通过轨迹级文本识别聚合,利用时间与多模态一致性,解决监控视频中运动模糊、遮挡等导致的帧级识别不一致问题,在多个基准上提升跟踪与识别性能。

Comments 22nd IEEE International Conference on Advanced Visual and Signal-Based Systems

详情

展开后加载摘要…

URL PDF HTML 收藏