arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5048 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5048 篇

2603.23159 2026-03-27 cs.CV cs.LG 73%

Conformal Cross-Modal Active Learning

符合性跨模态主动学习

Huy Hoang Nguyen, Cédric Jung, Shirin Salehi, Tobias Glück, Anke Schmeink, Andreas Kugi

机构 * AIT Austrian Institute of Technology(奥地利理工学院) Automation & Control Institute, Technical University of Vienna(维也纳技术大学自动化与控制研究所) Chair of Information Theory and Data Analytics (INDA), RWTH Aachen University(亚琛工业大学信息理论与数据分析教席)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出CCMA框架,通过教师-学生架构融合视觉与语言模态,利用多模态符合评分与多样性意识选择策略,提升数据效率。

Comments 20 pages, 14 figures

Journal ref CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23311 2026-03-25 cs.CV cs.LG 73%

ARGENT: Adaptive Hierarchical Image-Text Representations

ARGENT:自适应层次图像-文本表示

Chuong Huynh, Hossein Souri, Abhinav Kumar, Vitali Petsiuk, Deen Dayal Mohan, Suren Kumar

机构 * University of Maryland, College Park(马里兰大学 College Park分校) Samsung Research America, AI Center(三星美国研究院人工智能中心)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 ARGENT通过自适应蕴含损失和规范正则化解决超几何VLM的层级结构问题,引入角度基于的概率蕴含协议评估层次理解,提升图像分类、文本到图像检索及层次指标性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22287 2026-03-25 cs.CV cs.AI cs.CL 73%

Founder effects shape the evolutionary dynamics of multimodality in open LLM families

奠基效应塑造了开放大语言模型家族中多模态的进化动态

Manuel Cebrian

机构 * Center for Automation and Robotics, Spanish National Research Council, Madrid, Spain(自动化与机器人中心,西班牙国家研究委员会,西班牙马德里)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 研究通过分析模型谱系数据,发现多模态能力在开放大语言模型家族中通过罕见的奠基事件进入,并在后代谱系中快速扩展,导致多模态能力的采用动态呈现突变特征。

Comments 7 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20697 2026-03-24 cs.CV cs.AI 73%

Satellite-to-Street: Synthesizing Post-Disaster Views from Satellite Imagery via Generative Vision Models

卫星到街道:通过生成视觉模型从卫星图像合成灾害后视角

Yifan Yang, Lei Zou, Wendy Jepson

机构 * Department of Geography Texas A\&M University(地理系德克萨斯农工大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过生成视觉模型从卫星图像合成灾害后街道视角的方法,对比了基于VLM和MoE的生成策略,揭示了高现实感生成与结构信息保留之间的平衡问题。

Comments Accepted for presentation at IGARSS 2026 (IEEE International Geoscience and Remote Sensing Symposium)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20422 2026-03-24 cs.CV cs.AI cs.IR 73%

PEARL: Personalized Streaming Video Understanding Model

PEARL:个性化流视频理解模型

Yuanhong Zheng, Ruichuan An, Xiaopeng Lin, Yuxing Liu, Sihan Yang, Huanyu Zhang, Haodong Li, Qintong Zhang, Renrui Zhang, Guopeng Li, Yifan Zhang, Yuheng Li, Wentao Zhang

机构 * Peking University(北京大学) Adobe CASIA Stepfun CUHK(香港中文大学) Zhongguancun Academy(中关村学院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出个性化流视频理解任务PSVU,并引入PEARL-Bench基准测试,通过帧级和视频级两种模式评估模型对个性化概念的响应能力,提出无需训练的PEARL策略,实现先进性能。

Comments Arxiv Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06678 2026-03-20 cs.CV cs.LG 73%

Flexible Concept Bottleneck Model

灵活的概念瓶颈模型

Xingbo Du, Qiantong Dou, Lei Fan, Rui Zhang

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出灵活的概念瓶颈模型(FCBM),通过动态概念适应和改进的稀疏max模块,提升模型在新概念下的适应性与灵活性,实验表明其在多个基准上的表现优异。

Comments To appear in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14549 2026-03-19 cs.CV cs.LG 73%

ASAP: Attention-Shift-Aware Pruning for Efficient LVLM Inference

ASAP: 一种面向高效视觉-语言模型推理的注意力转移感知剪枝方法

Surendra Pathak, Bo Han

机构 * George Mason University(乔治·马歇尔大学)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.LG

AI总结 本文提出ASAP方法,通过动态双向软注意力掩码缓解注意力转移问题,并引入加权软合并组件减少语义冗余,实现视觉上下文近似无损压缩,保持99.02%的LLaVA-NeXT-7B性能,计算量降低约80%。

Comments Update in V2: Added citations, refrences, and other minor rewrites

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13341 2026-03-17 cs.CV cs.AI 73%

Mind the Discriminability Trap in Source-Free Cross-domain Few-shot Learning

注意源无关跨域少样本学习中的判别性陷阱

Zhenyu Zhang, Yixiong Zou, Yuhua Li, Ruixuan Li, Guangyao Chen

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文研究源无关跨域少样本学习中增强视觉模态判别性会抑制VLM性能的现象,提出通过扰动视觉学习以引导跨模态对齐的方法,实验显示在多种设置和数据集上取得新状态-of-the-art结果。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06688 2026-03-16 cs.CV cs.AI 73%

Narrative Weaver: Towards Controllable Long-Range Visual Consistency with Multi-Modal Conditioning

叙事编织者:迈向多模态可控的长程视觉一致性

Zhengjian Yao, Yongzhi Li, Xinyuan Gao, Quan Chen, Peng Jiang, Yanye Lu

机构 * Peking University(北京大学) Kuaishou Technology(快手科技)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 Narrative Weaver通过整合精细控制、自动叙事规划和长程一致性,解决生成AI中多模态可控、长程且一致的视觉内容生成问题,提出首个综合解决方案并构建首个电商广告视频脚本数据集。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23228 2026-03-16 cs.CV cs.AI 73%

MovieTeller: Tool-augmented Movie Synopsis with ID Consistent Progressive Abstraction

MovieTeller: 借助工具的电影概要与ID一致的渐进抽象

Yizhi Li, Xiaohan Chen, Miao Jiang, Wentao Tang, Gaoang Wang

机构 * Central Universities(中央高校) National Natural Science Foundation of China(中国国家自然科学基金委员会) Research Fund for International Scientists of National Natural Science Foundation of China(中国国家自然科学基金委员会国际科学家研究基金)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 MovieTeller通过工具增强的渐进抽象生成电影概要,解决传统VLM在长视频摘要中的身份一致性和叙事连贯性问题,提升事实准确性与一致性。

Comments 6 pages, CSCWD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10549 2026-03-12 cs.CV cs.AI eess.SP 73%

Towards Cognitive Defect Analysis in Active Infrared Thermography with Vision-Text Cues

面向主动红外热成像的认知缺陷分析:结合视觉-文本线索

Mohammed Salah, Eman Ouda, Giuseppe Dell'Avvocato, Fabrizio Sarasini, Ester D'Accardi, Jorge Dias, Davor Svetinovic, Stefano Sfarra, Yusra Abdulrahman

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种结合视觉-文本线索的主动红外热成像认知缺陷分析框架,利用预训练多模态模型实现零样本缺陷检测,实验显示其信噪比提升超过10dB,交并比达70%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19535 2026-03-09 cs.CV cs.AI 73%

CASA: Cross-Attention over Self-Attention for Efficient Vision-Language Fusion

CASA: 交叉注意力优于自注意力用于高效的视觉-语言融合

Moritz Böhle, Amélie Royer, Juliette Marrie, Edouard Grave, Patrick Pérez

机构 * Kyutai

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 CASA通过交叉注意力机制提升视觉-语言模型的效率,实现实时视频字幕处理中的低延迟和恒定内存成本。

Comments updated with improved CA results

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03681 2026-03-05 cs.CV cs.AI 73%

EvoPrune: Early-Stage Visual Token Pruning for Efficient MLLMs

EvoPrune:面向高效MLLMs的早期阶段视觉标记剪枝

Yuhao Chen, Bin Shan, Xin Ye, Cheng Chen

机构 * ByteDance(字节跳动)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 EvoPrune通过在视觉编码早期阶段剪枝视觉标记,提升多模态大语言模型的推理效率,实现在VideoMME数据集上2倍加速且性能损失低于1%。

Comments 16 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06512 2026-03-05 cs.CV cs.AI 73%

Merlin: A Computed Tomography Vision-Language Foundation Model and Dataset

Merlin:一种计算断层扫描视觉-语言基础模型和数据集

Louis Blankemeier, Ashwin Kumar, Joseph Paul Cohen, Jiaming Liu, Longchao Liu, Dave Van Veen, Syed Jamal Safdar Gardezi, Hongkun Yu, Magdalini Paschali, Zhihong Chen, Jean-Benoit Delbrouck, Eduardo Reis, Robbie Holland, Cesar Truyts, Christian Bluethgen, Yufu Wu, Long Lian, Malte Engmann Kjeldskov Jensen, Sophie Ostmeier, Maya Varma, Jeya Maria Jose Valanarasu, Zhongnan Fang, Zepeng Huo, Zaid Nabulsi, Diego Ardila, Wei-Hung Weng, Edson Amaro Junior, Neera Ahuja, Jason Fries, Nigam H. Shah, Greg Zaharchuk, Marc Willis, Adam Yala, Andrew Johnston, Robert D. Boutin, Andrew Wentland, Curtis P. Langlotz, Jason Hom, Sergios Gatidis, Akshay S. Chaudhari

机构 * Stanford University(斯坦福大学) Stanford Center for Artificial Intelligence in Medicine and Imaging(斯坦福大学医学与成像人工智能中心) Department of Electrical Engineering(电气工程系) University of California Berkeley(加州大学伯克利分校) Department of Radiology(放射科) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Hospital Israelita Albert Einstein(以色列特医院阿尔伯特·爱因斯坦医院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 Merlin是一种基于3D视觉-语言模型的医学影像分析工具,通过多阶段预训练框架,实现了对腹部CT扫描、电子健康记录和放射科报告的综合学习,提升了医学影像分析的自动化水平。

Comments Nature (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02026 2026-03-03 cs.CV cs.CL cs.LG 73%

Learning to Read Where to Look: Disease-Aware Vision-Language Pretraining for 3D CT

学习如何注视:面向3D CT的疾病感知视觉-语言预训练

Simon Ging, Philipp Arnold, Sebastian Walter, Hani Alnahas, Hannah Bast, Elmar Kotter, Jiancheng Yang, Behzad Bozorgtabar, Thomas Brox

机构 * Computer Vision Group, University of Freiburg, Germany Adaptive \& Agentic AI (A3) Lab, Aarhus University, Denmark Department of Radiology, Medical Center -- University of Freiburg, Germany Chair of Algorithms Data Structures, University of Freiburg, Germany ELLIS Institute Finland School of Electrical Engineering, Aalto University, Finland

专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出了一种面向3D CT的疾病感知视觉-语言预训练模型,通过对比预训练和基于提示的疾病监督,实现了文本到图像检索、疾病分类及内扫描片段定位的统一模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00938 2026-03-03 cs.CV cs.AI 73%

Seeing Beyond 8bits: Subjective and Objective Quality Assessment of HDR-UGC Videos

超越8位:HDR-UGC视频的主观和客观质量评估

Shreshth Saini, Bowen Chen, Neil Birkbeck, Yilin Wang, Balu Adsumilli, Alan C. Bovik

机构 * Laboratory for Image and Video Engineering (LIVE), UT Austin(图像与视频工程实验室(LIVE),得克萨斯大学奥斯汀分校) Google/YouTube(谷歌/YouTube)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HDR-Q,首个针对HDR-UGC视频的多模态大语言模型,通过HDR感知编码器和HAPO框架实现超越8位的高质量视频评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00483 2026-03-03 cs.CV cs.AI 73%

RAISE: Requirement-Adaptive Evolutionary Refinement for Training-Free Text-to-Image Alignment

RAISE:基于需求的进化精炼用于无训练文本到图像对齐

Liyao Jiang, Ruichen Chen, Chao Gao, Di Niu

机构 * Department of ECE, University of Alberta, Canada(阿尔伯塔大学电子工程系) Huawei Technologies, Canada(华为技术有限公司)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 RAISE是一种无训练、需求驱动的进化框架,通过动态调整生成过程实现高效且通用的文本到图像对齐。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17702 2026-03-03 cs.CV cs.AI 73%

Seek-CAD: A Self-refined Generative Modeling for 3D Parametric CAD Using Local Inference via DeepSeek

Seek-CAD: 一种基于局部推理的自优化生成模型用于3D参数化CAD设计

Xueyang Li, Jiahao Li, Yu Song, Yunzhong Lou, Xiangdong Zhou

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) School of Information and Intelligent Science, Donghua University(信息与智能科学学院,东华大学)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 Seek-CAD通过结合视觉和链式思维反馈,利用本地开源模型生成3D参数化CAD模型,提升生成效率和实用性。

Comments Accepted to ICLR 2026. The datatset has been released publicly and can be acessed in https://github.com/Sunny-Hack/Seek-CAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06764 2026-03-03 cs.CV cs.AI 73%

SemHiTok: A Unified Image Tokenizer via Semantic-Guided Hierarchical Codebook for Multimodal Understanding and Generation

SemHiTok:一种通过语义引导的层次代码本实现的统一图像分词器,用于多模态理解和生成

Zisheng Chen, Chunwei Wang, Runhui Huang, Hongbin Xu, Xiuwei Chen, Jun Zhou, Jianhua Han, Hang Xu, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) Huawei Noah’s Ark Lab(华为诺亚实验室) University of Hong Kong(香港大学) South China University of Technology(华南理工大学)

专题命中 VLM训练与架构 :LLaVA(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 SemHiTok通过语义引导的层次代码本实现统一图像分词器,提升多模态理解和生成性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24943 2026-02-24 cs.IR cs.AI cs.CL cs.LG 73%

RAIR: A Rule-Aware Benchmark Uniting Challenging Long-Tail and Visual Salience Subset for E-commerce Relevance Assessment

RAIR:一种融合长尾和视觉显著子集的规则感知基准,用于电商相关性评估

Chenji Lu, Zhuo Chen, Hui Zhao, Zhenyi Wang, Pengjie Wang, Chuan Yu, Jian Xu

机构 * Taobao \& Tmall Group of Alibaba Beijing China Taobao \& Tmall Group of Alibaba

专题命中 VLM训练与架构 :VLM(abstract);visual language model(abstract);分类 cs.AI、cs.LG

AI总结 RAIR提出了一种融合长尾和视觉显著子集的规则感知基准,用于评估电商相关性,通过标准化框架和多子集数据提升模型评估的全面性与挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22914 2026-02-18 cs.CV cs.LG 73%

cadrille: Multi-modal CAD Reconstruction with Reinforcement Learning

cadrille: 多模态CAD重建与强化学习

Maksim Kolodiazhnyi, Denis Tarasov, Dmitrii Zhemchuzhnikov, Alexander Nikulin, Ilya Zisman, Anna Vorontsova, Anton Konushin, Vladislav Kurenkov, Danila Rukhovich

机构 * Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) AXXX ETH Zurich(苏黎世联邦理工学院) Innopolis University(因诺波利斯大学) Institute of Mechanics, Armenia(亚美尼亚力学研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 cadrille通过强化学习实现多模态CAD重建,首次在CAD任务中应用RL微调,提升重建性能并设定新基准。

Comments ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13315 2026-02-17 cs.CV cs.AI 73%

IDPruner: Harmonizing Importance and Diversity in Visual Token Pruning for MLLMs

IDPruner: 在视觉令牌修剪中协调重要性与多样性

Yifan Tan, Yifu Sun, Shirui Huang, Hong Liu, Guanghua Yu, Jianchen Zhu, Yangdong Deng

机构 * School of Software, Tsinghua University(清华大学软件学院) Tencent(腾讯)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 IDPruner通过协调重要性与多样性,提出了一种高效的视觉令牌修剪方法,实现最优平衡并提升多模态大语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11636 2026-02-13 cs.CV cs.AI 73%

ScalSelect: Scalable Training-Free Multimodal Data Selection for Efficient Visual Instruction Tuning

ScalSelect: 可扩展的无训练多模态数据选择用于高效的视觉指令微调

Changti Wu, Jiahuai Mao, Yuzhuo Miao, Shijie Lian, Bin Yu, Xiaopeng Lin, Cong Huang, Lei Zhang, Kai Chen

机构 * East China Normal University(华东师范大学) Zhongguancun Academy(中关村学院) The Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology(哈尔滨工业大学) Huazhong University of Science and Technology(华中科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 ScalSelect提出一种无训练、可扩展的多模态数据选择方法,通过线性时间复杂度实现高效视觉指令微调,实验显示其性能接近甚至超越全数据训练。

Comments The code is available at \href{https://github.com/ChangtiWu/ScalSelect}{ScalSelect}

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10458 2026-02-12 cs.AI cs.LG 73%

Found-RL: foundation model-enhanced reinforcement learning for autonomous driving

Found-RL: 基于基础模型的强化学习用于自动驾驶

Yansong Qu, Zihao Sheng, Zilin Huang, Jiancong Chen, Yuhao Luo, Tianyi Wang, Yiheng Feng, Samuel Labi, Sikai Chen

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.AI、cs.LG

AI总结 Found-RL通过异步批量推理和多样化监督机制,提升自动驾驶中强化学习的效率与实时性。

Comments 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07041 2026-02-10 cs.CV cs.LG 73%

OMNI-Dent: Towards an Accessible and Explainable AI Framework for Automated Dental Diagnosis

OMNI-Dent:迈向一个可及且可解释的AI框架,用于自动化牙科诊断

Leeje Jang, Yao-Yi Chiang, Angela M. Hastings, Patimaporn Pungchanchaikul, Martha B. Lucas, Emily C. Schultz, Jeffrey P. Louie, Mohamed Estai, Wen-Chen Wang, Ryan H. L. Ip, Boyen Huang

机构 * University of Minnesota(明尼苏达大学) Khon Kaen University(科恩卡恩大学) Minnesota State University(明尼苏达州立大学) The University of Western Australia(西澳大学) Kaohsiung Medical University(高雄医学院) Auckland University of Technology(奥克兰理工大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 OMNI-Dent通过结合临床推理原则和视觉语言模型,提供一个数据高效且可解释的牙科诊断框架,帮助用户识别异常并判断是否需要专业评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02033 2026-02-04 cs.CV cs.AI cs.MM 73%

One Size, Many Fits: Aligning Diverse Group-Wise Click Preferences in Large-Scale Advertising Image Generation

一个尺寸,多种适配:在大规模广告图像生成中对多样化群体点击偏好进行对齐

Shuo Lu, Haohan Wang, Wei Feng, Weizhen Wang, Shen Zhang, Yaoyu Li, Ao Ma, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Bing Zhan, Yuan Xu, Huizai Yao, Yongcan Yu, Chenyang Si, Jian Liang

机构 * NLPR & MAIS, CASIA(中国科学院长春光学精密机械与物理研究所 & 中国科学院自动化所) School of AI, UCAS(中国科学院大学人工智能学院) HKUST(gz)(香港科技大学) PRLab, NJU(南京大学PRLab)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出OSMF框架,通过自适应分组和群组感知多模态模型,解决广告图像生成中用户群体点击偏好多样性的优化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01610 2026-02-03 cs.AI cs.LG 73%

ToPT: Task-Oriented Prompt Tuning for Urban Region Representation Learning

为城市区域表示学习设计的任务导向提示微调:ToPT

Zitao Guo, Changyang Jiang, Tianhong Zhao, Jinzhou Cao, Genan Dai, Bowen Zhang

机构 * College of Applied Science, Shenzhen University, Shenzhen, China(深圳大学应用科学学院) School of Artificial Intelligence, Shenzhen Technology University, Shenzhen, China(深圳科技大学人工智能学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG

AI总结 ToPT通过空间一致融合和任务对齐提升城市区域表示学习,实现任务导向的提示微调,提升多个城市任务的性能。

Comments The paper has been accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06746 2026-02-02 cs.CV cs.AI 73%

AlignGemini: Generalizable AI-Generated Image Detection Through Task-Model Alignment

AlignGemini: 通过任务-模型对齐实现通用的AI生成图像检测

Ruoxin Chen, Jiahui Gao, Kaiqing Lin, Keyue Zhang, Yandan Zhao, Isabel Guan, Taiping Yao, Shouhong Ding

机构 * Tencent Youtu Lab East China University of Science Shenzhen University Hong Kong University of Science Department of XXX, University of YYY, Location, Country School of ZZZ, Institute of WWW, Location, Country

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 AlignGemini通过任务-模型对齐原则,结合语义和像素伪影检测,提升AI生成图像检测的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13385 2026-01-21 cs.CV cs.AI 73%

Organ-Aware Attention Improves CT Triage and Classification

器官感知注意力提升CT分诊与分类

Lavsen Dahal, Yubraj Bhandari, Geoffrey D. Rubin, Joseph Y. Lo

机构 * Duke University(杜克大学) University of Arizona(亚利桑那大学)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 ORACLE-CT通过器官感知注意力和标量融合方法,在胸部和腹部CT分诊中实现最先进的分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16281 2026-01-15 cs.RO cs.AI cs.LG 73%

Do What You Say: Steering Vision-Language-Action Models via Runtime Reasoning-Action Alignment Verification

按言行事:通过运行时推理-动作对齐验证引导视觉-语言-动作模型

Yilin Wu, Anqi Li, Tucker Hermans, Fabio Ramos, Andrea Bajcsy, Claudia Pérez-D'Arpino

机构 * NVIDIA(NVIDIA公司) Carnegie Mellon University(卡内基梅隆大学) University of Utah(犹他大学) University of Sydney(悉尼大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.AI、cs.LG

AI总结 通过运行时推理-动作对齐验证方法提升视觉-语言-动作模型的鲁棒性和行为组合能力

详情

展开后加载摘要…

URL PDF HTML 收藏