arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-27 至 2026-03-27 共收录 13 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 13 篇

2512.14698 2026-03-27 cs.CV cs.AI cs.CL cs.MM 84%

TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs

TimeLens:重新思考视频时间接地与多模态大语言模型

Jun Zhang, Teng Wang, Yuying Ge, Yixiao Ge, Xinhao Li, Ying Shan, Limin Wang

机构 * Nanjing University(南京大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) Shanghai AI Lab(上海人工智能实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出TimeLens,通过数据质量和算法设计两个维度系统研究多模态大语言模型的视频时间接地能力,构建高质量数据集并提出有效训练方法,实现开源模型在视频时间接地任务上的领先性能。

Comments CVPR 2026. Website: https://timelens-arc-lab.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25250 2026-03-27 cs.CV cs.AI cs.LG 83%

Activation Matters: Test-time Activated Negative Labels for OOD Detection with Vision-Language Models

激活至关重要:基于视觉语言模型的测试时激活负标签用于分布外检测

Yabin Zhang, Maya Varma, Yunhe Gao, Jean-Benoit Delbrouck, Jiaming Liu, Chong Wang, Curtis Langlotz

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :vision-language model(title);VLM(abstract,comments);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出测试时激活负标签(TANL)方法,通过动态评估激活水平和测试批次内的激活信息,提升分布外检测的性能和鲁棒性,实验表明其在ImageNet基准上显著降低FPR95。

Comments CVPR 2026 main track, Codes are available at https://github.com/YBZh/OpenOOD-VLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25537 2026-03-27 cs.CL 82%

Humans vs Vision-Language Models: A Unified Measure of Narrative Coherence

人类与视觉-语言模型:叙事连贯性的一种统一衡量方法

Nikolai Ilinykh, Hyewon Jang, Shalom Lappin, Asad Sayeed, Sharid Loáiciga

机构 * University of Gothenburg(哥德堡大学) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract)

AI总结 研究通过比较人类写作与视觉语言模型生成的叙事,评估视觉基础故事中的叙事连贯性,发现模型在连贯性方面与人类存在系统性差异。

Comments 9 pages of content, 1 page of appendices, 9 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24876 2026-03-27 cs.CV 79%

OptiSAR-Net++: A Large-Scale Benchmark and Transformer-Free Framework for Cross-Domain Remote Sensing Visual Grounding

OptiSAR-Net++:跨领域遥感视觉定位的大型基准和无Transformer框架

Xiaoyu Tang, Jun Dong, Jintao Cheng, Rui Fan

机构 * South China Normal University(华南师范大学) Hong Kong University of Science and Technology(香港科技大学) Tongji University(同济大学) Shanghai Research Institute for Intelligent Autonomous Systems(上海自主智能无人系统科学中心) State Key Laboratory of Intelligent Autonomous Systems(智能自主系统国家重点实验室) Frontiers Science Center for Intelligent Autonomous Systems(智能自主系统前沿科学中心)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出OptiSAR-Net++,通过构建首个跨领域遥感视觉定位基准数据集,解决跨领域特征建模、计算效率和细粒度语义区分问题,提升定位精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24684 2026-03-27 cs.CV 77%

KitchenTwin: Semantically and Geometrically Grounded 3D Kitchen Digital Twins

KitchenTwin: 基于语义和几何的3D厨房数字孪生

Quanyun Wu, Kyle Gao, Daniel Long, David A. Clausi, Jonathan Li, Yuhao Chen

机构 * University of Waterloo(滑铁卢大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出一种基于语义和几何的3D厨房数字孪生框架,通过融合视觉引导的对象网格与Transformer预测的全局点云,实现几何一致的数字孪生构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00141 2026-03-27 cs.CV cs.AI cs.LG eess.IV 67%

From Scale to Speed: Adaptive Test-Time Scaling for Image Editing

从尺度到速度:面向图像编辑的自适应测试时间缩放

Xiangyan Qu, Zhenlong Yuan, Jing Tang, Rui Chen, Datao Tang, Meng Yu, Lei Sun, Yancheng Bai, Xiangxiang Chu, Gaopeng Gou, Gang Xiong, Yujun Cai

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) AMAP, Alibaba Group(阿里巴巴集团高德地图) University of Queensland(昆士兰大学)

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出ADE-CoT框架,通过动态资源分配、编辑特定验证和深度优先停止策略,提升图像编辑效率与性能,实验显示在同等采样预算下性能优于现有方法。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25186 2026-03-27 cs.LG 57%

Knowledge-Guided Retrieval-Augmented Generation for Zero-Shot Psychiatric Data: Privacy Preserving Synthetic Data Generation

基于知识的检索增强生成用于零样本心理数据:隐私保护的合成数据生成

Adam Jakobsen, Sushant Gautam, Hugo Lewi Hammer, Susanne Olofsdotter, Miriam S Johanson, Pål Halvorsen, Vajira Thambawita

机构 * SimulaMet Oslo Metropolitan University(奥斯陆城市大学) Uppsala University(乌普萨拉大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出一种零样本知识引导框架,利用检索增强生成技术生成隐私保护的合成心理数据,通过对比CTGAN和TVAE模型,证明临床知识增强LLM在生成高质量、隐私保护的合成数据方面具有优势。

Comments Submitted to CBMS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22752 2026-03-27 cs.CL cs.AI 57%

Towards Simulating Social Media Users with LLMs: Evaluating the Operational Validity of Conditioned Comment Prediction

向LLMs模拟社交媒体用户迈进:评估条件评论预测的运作有效性

Nils Schwager, Simon Münker, Alistair Plum, Achim Rettinger

机构 * Trier University(特里尔大学) University of Luxembourg(卢森堡大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文通过条件评论预测任务评估LLMs在模拟社交媒体用户行为方面的运作有效性,发现监督微调在低资源环境下会导致表层结构与语义脱节,强调真实行为轨迹优于描述性人设。

Comments 14 pages, 1 figure, 7 tables. Accepted to the 15th Workshop on Computational Approaches to Subjectivity, Sentiment & Social Media Analysis (WASSA) at EACL 2026, Rabat, Morocco

Journal ref Proceedings of the 15th Workshop on Computational Approaches to Subjectivity, Sentiment & Social Media Analysis (WASSA), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15186 2026-03-27 cs.CV 57%

Instruction-Guided Lesion Segmentation for Chest X-rays with Automatically Generated Large-Scale Dataset

基于指令的胸部X光片病变分割方法及大规模数据集构建

Geon Choi, Hangyul Yoon, Hyunju Shin, Hyunki Park, Sang Hoon Seo, Eunho Yang, Edward Choi

机构 * KAIST(韩国科学技术院) Samsung Medical Center(三星医学中心) AITRICS

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出基于指令的病变分割方法,构建首个大规模指令-回答数据集,通过自动化流程生成标注,提升胸部X光片病变分割的实用性与准确性。

Comments Camera-ready version for CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15869 2026-03-27 cs.CV 57%

Self-Calibrated CLIP for Training-Free Open-Vocabulary Segmentation

自校准CLIP用于无训练开放词汇分割

Sule Bai, Yong Liu, Yifei Han, Haoji Zhang, Yansong Tang, Jie Zhou, Jiwen Lu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出自校准CLIP,通过消除异常token影响,提升CLIP在开放词汇分割中的表现,实现更精细的特征表示和语义一致性。

Comments Accepted by IEEE TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25097 2026-03-27 cs.AI 57%

ElephantBroker: A Knowledge-Grounded Cognitive Runtime for Trustworthy AI Agents

ElephantBroker:一个基于知识的认知运行时用于可信AI代理

Cristian Lupascu, Alexandru Lupascu

机构 * Elephant Broker(大象经纪人)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出ElephantBroker,一个结合Neo4j知识图谱与Qdrant向量存储的认知运行时,通过Cognee SDK实现可信AI代理的记忆管理,包含认知循环、证据验证、安全防护等模块,支持多部署层级和安全审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07237 2026-03-27 cs.CV 57%

Unified Camera Positional Encoding for Controlled Video Generation

统一的相机位置编码用于受控视频生成

Cheng Zhang, Boying Li, Meng Wei, Yan-Pei Cao, Camilo Cruz Gambardella, Dinh Phung, Jianfei Cai

机构 * Monash University(莫纳什大学) Building 4.0 CRC(4.0建筑CRC) VAST(VAST研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出UCPE,通过统一相机信息实现视频生成中的高可控性与视觉真实性,结合轻量级注意力适配器提升模型性能。

Comments Camera Ready of CVPR2026. Project Page: https://chengzhag.github.io/publication/ucpe/ Code: https://github.com/chengzhag/UCPE

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09575 2026-03-27 cs.RO 50%

Traffic Scene Generation from Natural Language Description for Autonomous Vehicles with Large Language Model

基于大语言模型的自然语言描述生成交通场景用于自动驾驶车辆

Bo-Kai Ruan, Hao-Tang Tsui, Yung-Hui Li, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Carnegie Mellon University(卡内基梅隆大学) AI Research Center, Hon Hai Research Institute(鸿海研究院人工智能研究中心)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出TTSG框架,通过自然语言生成可控交通场景,解决文本到空间布局、无预设位置场景构建及多智能体行为规划问题,实验表明其在安全关键场景中碰撞率低且提升驾驶 captioning 模型性能。

Comments Accepted by WAD@CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏