arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5048 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5048 篇

2601.16582 2026-01-26 cs.CV 70%

X-Aligner: Composed Visual Retrieval without the Bells and Whistles

X-Aligner:无需炫技的组合视觉检索

Yuqian Zheng, Mariana-Iuliana Georgescu

机构 * Technical University of Munich(慕尼黑技术大学) Helmholtz Munich(亥姆霍兹慕尼黑)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 X-Aligner通过结合视觉和文本查询,提升视频检索性能,采用多阶段训练和交叉注意力模块实现更优的多模态表示对齐。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16549 2026-01-26 cs.AI 70%

LLM is Not All You Need: A Systematic Evaluation of ML vs. Foundation Models for text and image based Medical Classification

LLM并非万能:对ML与基础模型在文本和图像医学分类中的系统评估

Meet Raval, Tejul Pandit, Dhvani Upadhyay

机构 * University of Southern California Los Angeles, USA(美国南加州大学) Dhirubhani Ambani University Gandhinagar, India(印度达尔布哈尼·阿班尼大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文系统评估了ML与基础模型在医学分类中的表现,发现传统ML模型在多数任务中表现优异,而PEFT方法的效果依赖于适应策略。

Comments 9 pages, 5 figures, 3 tables, paper accepted in AAIML'26 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13797 2026-01-21 cs.CV 70%

PREGEN: Uncovering Latent Thoughts in Composed Video Retrieval

PREGEN:在合成视频检索中揭示潜在思想

Gabriele Serussi, David Vainshtein, Jonathan Kouchly, Dotan Di Castro, Chaim Baskin

机构 * Bosch Center for AI(博世人工智能中心) INSIGHT Lab(洞察实验室) Ben-Gurion University of the Negev(巴伊兰大学内盖夫分校)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 PREGEN通过结合预训练VLM和轻量级编码模型,高效解决合成视频检索问题,显著提升检索性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12493 2026-01-21 cs.CV 70%

Histopath-C: Towards Realistic Domain Shifts for Histopathology Vision-Language Adaptation

Histopath-C: 向 histopathology 视觉-语言适应的现实领域偏移迈进

Mehrdad Noori, Gustavo Adolfo Vargas Hakim, David Osowiechi, Fereshteh Shakeri, Ali Bahri, Moslem Yazdanpanah, Sahar Dastani, Ismail Ben Ayed, Christian Desrosiers

机构 * LIVIA, ÉTS Montreal, Canada International Laboratory on Learning Systems (ILLS)(LIVIA,蒙特利尔工程学院,加拿大国际学习系统实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 Histopath-C通过引入现实合成损坏的基准和LATTE策略,提升组织病理学图像的视觉-语言适应鲁棒性。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12481 2026-01-21 cs.CV cs.GR 70%

NeuralFur: Animal Fur Reconstruction From Multi-View Images

NeuralFur: 从多视角图像中重建动物毛发

Vanessa Sklyarova, Berna Kabadayi, Anastasios Yiannakidis, Giorgio Becherini, Michael J. Black, Justus Thies

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ETH Zürich(苏黎世联邦理工学院) Technical University of Darmstadt(德累斯顿技术大学) University of Tübingen(图宾根大学)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 NeuralFur通过视觉语言模型指导多视角图像重建,实现不同动物的高保真3D毛发建模。

Comments For additional results and code, please refer to https://neuralfur.is.tue.mpg.de

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11724 2026-01-21 cs.CV 70%

SemAlign: Language Guided Semi-supervised Domain Generalization

SemAlign:语言引导的半监督领域泛化

Muditha Fernando, Kajhanan Kailainathan, Krishnakanth Nagaratnam, Isuranga Udaravi Bandara Senavirathne, Ranga Rodrigo

机构 * University of Moratuwa(穆塔瓦大学)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 SemAlign通过将模型中间特征与视觉语言模型的语义特征空间对齐,结合增强和正则化策略,提升半监督领域泛化的性能。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10781 2026-01-19 cs.CV 70%

Future Optical Flow Prediction Improves Robot Control & Video Generation

未来光流预测改进机器人控制与视频生成

Kanchana Ranasinghe, Honglu Zhou, Yu Fang, Luyu Yang, Le Xue, Ran Xu, Caiming Xiong, Silvio Savarese, Michael S Ryoo, Juan Carlos Niebles

机构 * Salesforce AI Research(Salesforce AI研究院) Stony Brook University(石溪大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 FOFPred通过统一的视觉-语言模型和扩散架构,实现高效的未来光流预测,提升机器人控制与视频生成的性能。

Comments Project Site (Code, Models, Demo): https://fofpred.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08219 2026-01-14 cs.LG 70%

A Preliminary Agentic Framework for Matrix Deflation

一个初步的代理框架用于矩阵消去

Paimon Goulart, Evangelos E. Papalexakis

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.LG

AI总结 本文提出了一种基于代理的矩阵消去方法,利用LLM和VLM实现无阈值的消去,通过上下文学习和排列优化,在不同数据集上取得有竞争力的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23243 2026-01-12 cs.CV 70%

Multimodal Interpretation of Remote Sensing Images: Dynamic Resolution Input Strategy and Multi-scale Vision-Language Alignment Mechanism

遥感图像的多模态解释:动态分辨率输入策略与多尺度视觉-语言对齐机制

Siyu Zhang, Lianlei Shan, Runhe Qiu

机构 * Tsinghua University(清华大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出动态分辨率输入策略与多尺度视觉-语言对齐机制,提升遥感图像多模态解释的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15480 2026-01-09 cs.CL cs.AI 70%

Instruction Tuning with and without Context: Behavioral Shifts and Downstream Impact

带有和不带上下文的指令微调:行为变化和下游影响

Hyunji Lee, Seunghyun Yoon, Yunjae Won, Hanseok Oh, Geewook Kim, Trung Bui, Franck Dernoncourt, Elias Stengel-Eskin, Mohit Bansal, Minjoon Seo

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Adobe Research(Adobe研究) KAIST AI(韩国科学技术院人工智能实验室) Mila – Quebec AI Institute(魁北克人工智能研究所) NAVER Cloud AI(NAVER云人工智能)

专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 本文研究了指令微调中带上下文与不带上下文对模型行为和下游性能的影响,发现上下文增强训练能提升模型基础性并减少幻觉,同时提出在实际部署中分离上下文模型以获得更稳健的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20561 2025-12-24 cs.CV 70%

FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models

FlashVLM: 大规模多模态模型中的文本引导视觉令牌选择

Kaitong Cai, Jusheng Zhang, Jing Yang, Yijia Fan, Pengtao Xie, Jian Wang, Keze Wang

机构 * Sun Yat-sen University(中山大学) University of California, San Diego(加州大学圣地亚哥分校) Snap Inc.(Snap公司)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

AI总结 FlashVLM通过文本引导的视觉令牌选择,实现了高效压缩和高准确率,在大规模多模态模型中表现出色。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16446 2025-12-19 cs.RO cs.AI 70%

E-SDS: Environment-aware See it, Do it, Sorted - Automated Environment-Aware Reinforcement Learning for Humanoid Locomotion

E-SDS: 环境感知的见它、做它、排序——面向人类oid运动的自动化环境感知强化学习

Enis Yalcin, Joshua O'Hara, Maria Stamatopoulou, Chengxu Zhou, Dimitrios Kanoulas

机构 * University College London(伦敦大学学院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 E-SDS通过整合视觉-语言模型与实时地形传感器分析,实现了自动化环境感知强化学习,显著提升了人形机器人在复杂地形中的运动鲁棒性和效率。

Comments 12 pages, 3 figures, 4 tables. Accepted at RiTA 2025 (Springer LNNS)

Journal ref RiTA 2025 (Springer LNNS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16250 2025-12-19 cs.AI cs.MA 70%

AMUSE: Audio-Visual Benchmark and Alignment Framework for Agentic Multi-Speaker Understanding

AMUSE:面向代理多说话者理解的音频-视觉基准与对齐框架

Sanjoy Chowdhury, Karren D. Yang, Xudong Liu, Fartash Faghri, Pavan Kumar Anasosalu Vasu, Oncel Tuzel, Dinesh Manocha, Chun-Liang Li, Raviteja Vemulapalli

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Apple(苹果公司)

专题命中 VLM训练与架构 :grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 AMUSE提出一个面向多说话人理解的音频-视觉基准与对齐框架RAFT,通过代理推理提升多模态模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15611 2025-12-18 cs.CV 70%

If you can describe it, they can see it: Cross-Modal Learning of Visual Concepts from Textual Descriptions

如果你能描述它,他们就能看到它:从文本描述中跨模态学习视觉概念

Carlo Alberto Barbano, Luca Molinaro, Massimiliano Ciranni, Emanuele Aiello, Vito Paolo Pastore, Marco Grangetto

机构 * University of Turin(都灵大学) University of Genoa(热那亚大学) Politecnico di Torino(都灵理工大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出通过文本描述跨模态学习视觉概念的方法,利用知识迁移技术提升视觉-语言模型的零样本性能。

Comments 27 pages. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14336 2025-12-17 cs.CV 70%

Vector Prism: Animating Vector Graphics by Stratifying Semantic Structure

向量棱柱:通过分层语义结构来动画化向量图形

Jooyeol Yun, Jaegul Choo

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出了一种通过分层语义结构来提升向量图形动画质量的框架,通过统计汇总弱预测来恢复语义,从而提高VLMs动画生成的连贯性和准确性。

Comments yeolj00.github.io/personal-projects/vector-prism

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04564 2025-12-16 cs.CV 70%

Conditional Representation Learning for Customized Tasks

基于条件的表示学习用于定制任务

Honglin Liu, Chao Sun, Peng Hu, Yunfan Li, Xi Peng

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) National Key Laboratory of Fundamental Algorithms and Models for Engineering Numerical Simulation, Sichuan University(四川大学工程数值模拟基础算法与模型国家重点实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出条件表示学习(CRL),通过生成描述性文本构建语义基底,将图像表示投影到定制特征空间,以提升定制任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17982 2025-12-15 cs.CV 70%

Few-Shot Learning from Gigapixel Images via Hierarchical Vision-Language Alignment and Modeling

通过层次化视觉-语言对齐和建模实现高像素图像的少样本学习

Bryan Wong, Jong Woo Kim, Huazhu Fu, Mun Yong Yi

机构 * KAIST(韩国科学技术院) IHPC, A*STAR(A*STAR研究院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 HiVE-MIL通过层次化视觉-语言对齐和建模,提升高像素图像的少样本学习性能,实现4.1%的宏F1提升。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10894 2025-12-12 cs.CV 70%

DuetSVG: Unified Multimodal SVG Generation with Internal Visual Guidance

DuetSVG:基于内部视觉引导的统一多模态SVG生成

Peiying Zhang, Nanxuan Zhao, Matthew Fisher, Yiran Xu, Jing Liao, Difan Liu

机构 * City University of Hong Kong(香港城市大学) Adobe Research(Adobe研究院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 DuetSVG通过端到端生成图像和SVG标记,结合内部视觉引导提升SVG生成质量,实现视觉忠实与语义一致的统一多模态生成。

Comments Project page: https://intchous.github.io/DuetSVG-site

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08374 2025-12-10 cs.CV 70%

The Unseen Bias: How Norm Discrepancy in Pre-Norm MLLMs Leads to Visual Information Loss

看不见的偏见:预规范MLLM中规范差异如何导致视觉信息丢失

Bozhou Li, Xinda Xue, Sihan Yang, Yang Shi, Xinlong Chen, Yushuo Guan, Yuanxing Zhang, Wentao Zhang

机构 * Peking University(北京大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Xi’an Jiaotong University(西安交通大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文揭示了预规范MLLM中规范差异导致的视觉信息丢失问题,并提出通过插入层规范层来解决这一问题,提升模型整体能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04713 2025-12-10 cs.CV 70%

Enabling Validation for Robust Few-Shot Recognition

使基于VLM微调的鲁棒少样本识别得以验证

Hanxin Wang, Tian Liu, Shu Kong

机构 * University of Macau(澳门大学) Texas A&M University(德克萨斯A&M大学) Institute of Collaborative Innovation(协同创新研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出VEST框架,通过验证启用的分阶段微调策略,解决少样本识别中验证数据不足的问题,提升模型在ID和OOD数据上的泛化能力。

Comments Project website: https://hannawang09.github.io/projects/vest/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17432 2025-12-09 cs.CV 70%

Breaking the Modality Barrier: Universal Embedding Learning with Multimodal LLMs

突破模态壁垒:基于多模态大语言模型的通用嵌入学习

Tiancheng Gu, Kaicheng Yang, Ziyong Feng, Xingjun Wang, Yanzhao Zhang, Dingkun Long, Yingda Chen, Weidong Cai, Jiankang Deng

机构 * The University of Sydney(悉尼大学) DeepGlint Tongyi Lab, Alibaba Group(阿里云实验室) Imperial College London(伦敦帝国理工学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 UniME通过两阶段框架提升多模态表示学习,利用知识蒸馏和硬负样本微调增强判别能力与指令遵循性能。

Comments 13 pages, 8 figures, Accepted by ACM MM2025, Project page: https://garygutc.github.io/UniME

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06447 2025-12-09 cs.CV 70%

Towards Stable Cross-Domain Depression Recognition under Missing Modalities

迈向稳定跨领域抑郁识别下的缺失模态

Jiuyi Chen, Mingkui Tan, Haifeng Lu, Qiuna Xu, Zhihua Wang, Runhao Zeng, Xiping Hu

机构 * School of Future Technology, South China University of Technology(未来技术学院,华南理工大学) PengCheng Laboratory(鹏城实验室) School of Software Engineering, South China University of Technology(软件工程学院,华南理工大学) Artificial Intelligence Research Institute, Shenzhen MSU-BIT University(人工智能研究院,深圳MSU-BIT大学) Guangdong-Hong Kong-Macao Joint Laboratory for Emotional Intelligence and Pervasive Computing(粤港澳大湾区情感智能与泛在计算联合实验室) School of Computer Science and Technology, Guangdong University of Technology(计算机科学与技术学院,广东工业大学) Department of Computer Science, City University of Hong Kong(计算机科学系,香港城市大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出SCD-MLLM框架,通过多源数据适配器和模态感知自适应融合模块,实现稳定跨领域抑郁症识别,提升多模态数据处理的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06255 2025-12-09 cs.CV 70%

Language-driven Fine-grained Retrieval

基于语言的细粒度检索

Shijie Wang, Xin Yu, Yadan Luo, Zijian Wang, Pengfei Zhang, Zi Huang

机构 * The University of Queensland(昆士兰大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 LaFG通过将类别名称转换为属性级监督,利用语言模型和视觉-语言模型生成属性描述并聚类属性词汇,以提升细粒度图像检索的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04555 2025-12-08 cs.RO cs.CV 70%

Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment

Evo-1:轻量级视觉-语言-动作模型,保持语义对齐

Tao Lin, Yilei Zhong, Yuxin Du, Jingjing Zhang, Jiting Liu, Yinxinyu Chen, Encheng Gu, Ziyan Liu, Hongyi Cai, Yanwen Zou, Lixing Zou, Zhaoye Zhou, Gen Li, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) EvoMind Tech(EvoMind科技) IAAR-Shanghai(IAAR-上海) SII Carnegie Mellon University(卡内基梅隆大学) University of Cambridge(剑桥大学) Nanyang Technological University(南洋理工大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 Evo-1是一种轻量级的视觉-语言-动作模型,通过减少计算并保持语义对齐,实现了高效的部署和强大的性能。

Comments Github: https://github.com/MINT-SJTU/Evo-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01513 2025-12-04 cs.CR cs.CV 70%

SafePTR: Token-Level Jailbreak Defense in Multimodal LLMs via Prune-then-Restore Mechanism

SafePTR: 通过剪枝-恢复机制实现多模态大语言模型的令牌级 Jailbreak 防御

Beitao Chen, Xinyu Lyu, Lianli Gao, Jingkuan Song, Heng Tao Shen

机构 * Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(电子科技大学深圳研究院) Southwestern University of Finance and Economics(西南财经大学) Engineering Research Center of Intelligent Finance, Ministry of Education(教育部智能金融工程研究中心) Tongji University(同济大学)

专题命中 VLM训练与架构 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 SafePTR 提出一种无需训练的多模态大语言模型防御机制,通过剪枝有害令牌并恢复良性特征,有效提升安全性并保持效率。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00903 2025-12-02 cs.CV cs.RO 70%

SwiftVLA: Unlocking Spatiotemporal Dynamics for Lightweight VLA Models at Minimal Overhead

SwiftVLA: 解锁轻量VLA模型的时空动态以最小的开销

Chaojun Ni, Cheng Chen, Xiaofeng Wang, Zheng Zhu, Wenzhao Zheng, Boyuan Wang, Tianrun Chen, Guosheng Zhao, Haoyun Li, Zhehao Dong, Qiang Zhang, Yun Ye, Yang Wang, Guan Huang, Wenjun Mei

机构 * GigaAI Peking University(北京大学) Moxin (Huzhou) Technology Co., Ltd.(摩西(湖州)科技有限公司) Tsinghua University(清华大学) X-Humanoid Project(X-人形项目)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 SwiftVLA通过4D视觉几何Transformer和Fusion Tokens提升轻量VLA模型的时空推理能力,实现高效且性能优异的视觉-语言-动作处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22470 2025-12-01 cs.CV 70%

Hybrid, Unified and Iterative: A Novel Framework for Text-based Person Anomaly Retrieval

混合、统一和迭代:一种基于文本的人员异常检索新框架

Tien-Huy Nguyen, Huu-Loc Tran, Huu-Phong Phan-Nguyen, Quang-Vinh Dinh

机构 * University of Information Technology Vietnam National University(信息技术大学越南国家大学) AI VIETNAM Lab(AI越南实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出了一种混合、统一和迭代的新型框架,通过结合局部-全局视角和统一图像-文本模型,提升基于文本的人员异常检索性能。

Comments Accepted on World Wide Web 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20965 2025-11-27 cs.CV cs.CL 70%

TrafficLens: Multi-Camera Traffic Video Analysis Using LLMs

TrafficLens: 多摄像头交通视频分析使用LLMs

Md Adnan Arefeen, Biplob Debnath, Srimat Chakradhar

机构 * NEC Laboratories America(NEC美国实验室) University of Missouri–Kansas City (UMKC)(密苏里大学-堪萨斯城分校)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 TrafficLens通过利用多摄像头重叠区域和对象相似性检测,高效地将视频转换为文本,减少处理时间并提升交通视频分析效率。

Comments 2024 IEEE 27th International Conference on Intelligent Transportation Systems (ITSC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20770 2025-11-27 cs.CV 70%

Text-Guided Semantic Image Encoder

基于文本的语义图像编码器

Raghuveer Thirukovalluru, Xiaochuang Han, Bhuwan Dhingra, Emily Dinan, Maha Elbayad

机构 * Duke University(杜克大学) FAIR at Meta(Meta的FAIR)

专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出基于文本的语义图像编码器,通过文本指导生成图像表示,提升视觉-语言模型在多个基准测试中的性能,并提高推理效率。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01812 2025-11-27 cs.CY cs.AI cs.CL 70%

From Text to Multimodality: Exploring the Evolution and Impact of Large Language Models in Medical Practice

从文本到多模态:探索大型语言模型在医疗实践中的演变与影响

Qian Niu, Keyu Chen, Ming Li, Pohsun Feng, Ziqian Bi, Lawrence KQ Yan, Yichao Zhang, Caitlyn Heqi Yin, Cheng Fei, Junyu Liu, Tianyang Wang, Yunze Wang, Silin Chen, Ming Liu, Benji Peng, Xinyuan Song, Ziyuan Qin, Riyang Bao, Zekun Jiang

机构 * Kyoto University(京都大学) Georgia Institute of Technology(佐治亚理工学院) National Taiwan Normal University(台湾师范大学) Indiana University(印第安纳大学) Hong Kong University of Science(香港科学大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Cornell University(康奈尔大学) University of Liverpool(利物浦大学) University of Edinburgh(爱丁堡大学) Zhejiang University(浙江大学) Purdue University(Purdue 大学) Emory University, Atlanta, GA, USA(埃默里大学) West China Biomedical Big Data Center, West China Hospital, Sichuan University, Chengdu, China(西京生物大数据中心,四川大学西京医院,成都,中国)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

AI总结 本文探讨了多模态大型语言模型在医疗实践中的发展与影响,分析其在医疗影像、临床决策支持等领域的应用及面临的挑战。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏