arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-14 至 2026-04-14 共收录 34 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 34 篇

2604.09841 2026-04-14 cs.CV cs.AI 86%

Is There Knowledge Left to Extract? Evidence of Fragility in Medically Fine-Tuned Vision-Language Models

还有可以提取的知识吗?医学微调视觉语言模型中的脆弱性证据

Oliver McLaughlin, Daniel Shubin, Carsten Eickhoff, Ritambhara Singh, William Rudman, Michal Golovanevsky

机构 * Brown University(布朗大学) University of Washington(华盛顿大学) University of Tübingen(蒂宾根大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 研究评估了四个医学微调的视觉语言模型在四个医学影像任务中的表现,发现任务难度增加时性能下降至接近随机水平,表明临床推理有限,医学微调无明显优势,模型对提示词敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10985 2026-04-14 cs.AI cs.CL cs.CV 84%

Back to the Barn with LLAMAs: Evolving Pretrained LLM Backbones in Finetuning Vision Language Models

回到牛棚与LLAMAs:在微调视觉语言模型中进化预训练LLM骨干

Sameera Horawalavithana, Lauren Phillips, Ian Stewart, Sai Munikoti, Karl Pazdernik

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 研究探讨了在微调视觉语言模型时,不同预训练LLM骨干对下游任务性能的影响,发现新版本LLM并非总能提升性能,且表现依赖具体任务。

Comments Preprint and under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09695 2026-04-14 cs.CV cs.AI 84%

Assessing Privacy Preservation and Utility in Online Vision-Language Models

评估在线视觉语言模型中的隐私保护与效用

Karmesh Siddharam Chaudhari, Youxiang Zhu, Amy Feng, Xiaohui Liang, Honggang Zhang

机构 * University of Massachusetts Boston(马萨诸塞大学波士顿分校)

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了在线视觉语言模型中个人身份信息泄露问题,探讨了图像中上下文关系提取对隐私的影响,并提出保护隐私同时保持效用的方法。

Comments Accepted for publication in IEEE ICC 2026. \c{opyright} IEEE. Personal use of this material is permitted. The final version will appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11374 2026-04-14 cs.CV cs.CL 83%

What Do Vision-Language Models Encode for Personalized Image Aesthetics Assessment?

视觉-语言模型如何编码个性化图像审美评估?

Koki Ryu, Hitomi Yanaka

机构 * The University of Tokyo(东京大学) Riken(理化学研究所) Tohoku University(东北大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文分析了视觉-语言模型内部表示中审美属性的分布,利用这些属性实现轻量级个性化图像审美评估,无需微调模型。

Comments To appear at ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15489 2026-04-14 cs.CV cs.CL cs.MM 83%

Seeing Through Deception: Uncovering Misleading Creator Intent in Multimodal News with Vision-Language Models

穿透欺骗:在多模态新闻中揭示误导性创作者意图

Jiaying Wu, Fanxiao Li, Zihang Fu, Min-Yen Kan, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) Yunnan University(云南大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出DeceptionDecoded基准数据集,通过意图引导模拟框架生成12000组图像-描述对,旨在揭示多模态虚假信息中的误导性意图,评估14种最新视觉-语言模型,发现其在意图推理上存在不足,提出系统合成数据以提升模型意图理解能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22911 2026-04-14 cs.CV cs.AI 81%

ForestPrune: High-ratio Visual Token Compression for Video Multimodal Large Language Models via Spatial-Temporal Forest Modeling

ForestPrune: 通过时空森林建模实现视频多模态大语言模型的高比率视觉令牌压缩

Shaobo Ju, Baiyang Song, Tao Chen, Jiapeng Zhang, Qiong Wu, Chao Chang, HuaiXi Wang, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) National University of Defense Technology(国防科技大学)

专题命中 VLM训练与架构 :multimodal large language model(title);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ForestPrune,一种无需训练的视频MLLM令牌压缩方法,通过时空森林建模实现高效高比率压缩,实验表明其在视频任务中效果优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06165 2026-04-14 cs.CV cs.AI 81%

What Users Leave Unsaid: Under-Specified Queries Limit Vision-Language Models

用户未言明的内容:未指定查询限制视觉语言模型

Dasol Choi, Guijin Son, Hanwool Lee, Minhyuk Kim, Hyunwoo Ko, Teabin Lim, Ahn Eungyeol, Jungwhan Kim, Seunghyeok Hong, Youngsook Song

机构 * AIM Intelligence Yonsei University(延世大学) OneLineAI Korea University(高丽大学) Doodlin Corp.(Doodlin公司) NAVER Cloud(NAVER云) Hankuk University of Foreign Studies(韩国外国语大学) Lablup Inc.(Lablup公司)

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract);分类 cs.CV、cs.AI

AI总结 研究探讨了现实用户查询的不明确性对视觉语言模型的影响,通过HAERAE-Vision基准测试发现,即使使用先进模型,未指定查询的准确率仍低于50%,且明确化查询能显著提升性能,揭示了模型能力与实际应用间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09585 2026-04-14 cs.HC cs.AI cs.CV 81%

Evaluating Visual Prompts with Eye-Tracking Data for MLLM-Based Human Activity Recognition

基于眼动数据的视觉提示在基于多模态LLM的人类活动识别中的评估

Jae Young Choi, Seon Gyeom Kim, Hyungjun Yoon, Taeckyung Lee, Donggun Lee, Jaeryung Chung, Jihyung Kil, Ryan Rossi, Sung-Ju Lee, Tak Yeon Lee

机构 * KAIST(韩国科学技术院) Adobe Research(Adobe研究院)

专题命中 VLM训练与架构 :MLLM(title,abstract);分类 cs.CV、cs.AI

AI总结 本文通过眼动数据可视化方法提升多模态LLM处理高频传感器数据的效率,验证了视觉提示在人类活动识别中的有效性与扩展性。

Comments 6 pages. Conditionally accepted to IEEE PacificVis 2026 (VisNotes track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11299 2026-04-14 cs.CL cs.AI 79%

Enhancing Multimodal Large Language Models for Ancient Chinese Character Evolution Analysis via Glyph-Driven Fine-Tuning

通过字形驱动微调增强多模态大语言模型用于古汉字演变分析

Rui Song, Lida Shi, Ruihua Qi, Yingji Li, Hao Xu

机构 * College of Computer Science and Technology, Jilin University, China(吉林大学计算机科学与技术学院) Key Laboratory of Ancient Chinese Script, Culture Relics and Artificial Intelligence, Jilin University, China(吉林大学古文字、文物与人工智能重点实验室) School of Artificial Intelligence, Jilin University, China(吉林大学人工智能学院) School of Archaeology, Jilin University, China(吉林大学考古学院)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.AI

AI总结 本文提出GEVO框架,通过字形驱动微调提升多模态大语言模型在古汉字演变分析中的能力,实验显示模型在多个任务上均取得显著提升。

Comments Accepted by ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11136 2026-04-14 cs.CV cs.AI 73%

BoxTuning: Directly Injecting the Object Box for Multimodal Model Fine-Tuning

BoxTuning:直接注入物体框进行多模态模型微调

Zekun Qian, Ruize Han, Wei Feng

机构 * School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) Faculty of Computer Science and Artificial Intelligence, Shenzhen University of Advanced Technology(深圳理工大学计算机科学与人工智能学院)

专题命中 VLM训练与架构 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 BoxTuning通过将物体空间时间信息直接注入视觉模态,解决多模态大语言模型在视频问答中物体细粒度定位的不足,显著降低token成本并保持时间分辨率,实验表明其在空间导向任务中优于文本坐标方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02736 2026-04-14 cs.CV 70%

THOM: Generating Physically Plausible Hand-Object Meshes From Text

THOM:从文本生成物理合理的手-物体网格

Uyoung Jeong, Yihalem Yimolal Tiruneh, Hyung Jin Chang, Seungryul Baek, Kwang In Kim

机构 * UNIST(蔚山科学技术院) University of Birmingham(伯明翰大学) POSTECH(浦项科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 THOM通过两阶段流程从文本生成物理合理的手-物体网格,无需模板网格,结合物理优化和视觉语言模型提升交互合理性。

Comments accepted to CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12067 2026-04-14 cs.LG cs.AI cs.CL cs.CV 67%

MM-LIMA: Less Is More for Alignment in Multi-Modal Datasets

MM-LIMA:多模态数据集对齐中的‘少即是多’

Lai Wei, Xiaozhe Li, Zihao Jiang, Weiran Huang, Lichao Sun

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) Shanghai Innovation Institute(上海创新研究院) Lehigh University(里海大学) Tongji University(同济大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出MM-LIMA,仅用200个示例(约6%的指令数据)训练,通过数据选择器过滤低质量数据,使模型在多项评估中超越MiniGPT-4,证明高质量少量指令数据的有效性。

Comments Published at Artificial Intelligence for Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10060 2026-04-14 cs.PF 67%

Mosaic: Cross-Modal Clustering for Efficient Video Understanding

Mosaic:用于高效视频理解的跨模态聚类

Tuowei Wang, He Zhou, Chengru Song, Qiushi Li, Ju Ren

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

AI总结 Mosaic是首个针对流式长视频理解的跨模态聚类驱动VLM推理系统,通过优化KVCache管理实现1.38倍速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08942 2026-04-14 cs.CV cs.AI cs.CL cs.LG 67%

BiCLIP: Domain Canonicalization via Structured Geometric Transformation

BiCLIP:通过结构几何变换实现领域规范化

Pranav Mantini, Shishir K. Shah

机构 * University of Houston(休斯顿大学) The University of Oklahoma(俄克拉荷马大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 BiCLIP通过结构几何变换提升跨模态对齐,利用少量锚点样本实现领域规范化,实验表明其在11个基准测试中均取得最优性能。

Comments Accepted at Domain Generalization: Evolution, Breakthroughs, and Future Horizons Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11122 2026-04-14 cs.CV cs.AI 62%

Semantic-Geometric Dual Compression: Training-Free Visual Token Reduction for Ultra-High-Resolution Remote Sensing Understanding

语义-几何双压缩:无训练视觉令牌减少用于超高清遥感理解

Yueying Li, Fengxiang Wang, Yan Li, Mingshuo Chen, Mengying Zhao, Long Lan

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DualComp框架,通过任务自适应双流令牌压缩方法,有效解决超高清遥感图像处理中视觉令牌过多导致的计算开销问题,提升处理效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11095 2026-04-14 cs.LG cs.AI 62%

Bottleneck Tokens for Unified Multimodal Retrieval

瓶颈令牌用于统一多模态检索

Siyu Sun, Jing Ren, Zhaohe Liao, Dongxiao Mao, Xiangyuan Ren, Yiyi Zhang, Haohua Zhao, Weixiong Lin, Jiang Shaohua, Liqing Zhang, Yuchao Zheng

机构 * Shanghai Jiao Tong University(上海交通大学) ByteDance(字节跳动)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出瓶颈令牌和生成信息压缩方法,解决多模态大语言模型在统一检索中的隐式池化和对比微调问题,提升语义压缩效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16333 2026-04-14 cs.CV cs.LG 62%

RL makes MLLMs see better than SFT

强化学习使多模态大语言模型比监督微调看得更清楚

Junha Song, Sangdoo Yun, Dongyoon Han, Jaegul Choo, Byeongho Heo

机构 * NAVER AI Lab(NAVER AI实验室)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV、cs.LG

AI总结 本文研究了强化学习在多模态大语言模型中的视觉编码器影响,发现RL能产生更精确的视觉表示,提出PIVOT方法提升视觉编码性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17574 2026-04-14 cs.CV cs.AI 62%

HumanVBench: Probing Human-Centric Video Understanding in MLLMs with Automatically Synthesized Benchmarks

HumanVBench: 通过自动合成基准测试探测多模态大语言模型中的以人为本的视频理解

Ting Zhou, Daoyuan Chen, Qirui Jiao, Bolin Ding, Yaliang Li, Ying Shen

机构 * Sun Yat-Sen University(中山大学) Alibaba Group(阿里巴巴集团) Peng Cheng Laboratory(鹏城实验室) Guangdong Provincial Key Laboratory of Fire Science and Intelligent Emergency Technology(广东省消防科学与智能应急技术重点实验室)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HumanVBench,一个针对多模态大语言模型(MLLMs)中以人为本的视频理解能力的综合基准测试,通过自动化流程生成高质量视频注释和挑战性问题,揭示30个领先MLLMs在感知细微情绪和对齐语音与视觉线索方面的不足。

Comments Accepted as a conference paper at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07516 2026-04-14 cs.CL cs.AI cs.LG 62%

Controlling Multimodal Conversational Agents with Coverage-Enhanced Latent Actions

通过增强覆盖的潜在动作控制多模态对话代理

Yongqi Li, Hao Lang, Tieyun Qian, Yongbin Li

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Tongyi Lab(通义实验室) Zhongguancun Academy(中关村学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过增强覆盖的潜在动作空间改进多模态对话代理的强化学习微调,利用跨模态投影器提升鲁棒性,在两个对话任务中优于基线方法。

Comments Accepted to ACL 2026 (Main), camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10297 2026-04-14 cs.CV cs.AI 62%

FashionMV: Product-Level Composed Image Retrieval with Multi-View Fashion Data

FashionMV:基于多视角时尚数据的产品级复合图像检索

Peng Yuan, Bingyin Mei, Hui Zhang

机构 * Tsinghua University(清华大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FashionMV,首个大规模多视角时尚数据集,用于产品级复合图像检索。通过构建包含127K产品、472K多视角图像和220K三元组的数据集,结合ProCIR框架,采用多阶段对话、标题对齐和思维链引导等机制,提升了检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11751 2026-04-14 cs.RO cs.AI 57%

Grounded World Model for Semantically Generalizable Planning

基于语义泛化的世界模型用于规划

Quanyi Li, Lan Feng, Haonan Zhang, Wuyang Li, Letian Wang, Alexandre Alahi, Harold Soh

机构 * Independent(独立) EPFL(瑞士联邦理工学院洛桑) Beihang University(北京航空航天大学) University of Toronto(多伦多大学) NUS(新加坡国立大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.AI

AI总结 本文提出基于视觉-语言对齐潜在空间的世界模型,用于改进视觉-运动模型控制,实现更广泛的语义泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11337 2026-04-14 cs.MA cs.AI cs.CY 57%

Governance by Design: A Parsonian Institutional Architecture for Internet-Wide Agent Societies

设计治理:一种帕森斯制度架构用于互联网范围的智能体社会

Anbang Ruan

机构 * NetX Foundation(NetX 基金会)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种基于帕森斯AGIL框架的制度架构,用于治理互联网范围的智能体社会,发现现有生态系统缺乏协调层和规范基础,提出治理基础设施的优先路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12748 2026-04-14 cs.AI cs.HC cs.SE 57%

X-SYS: A Reference Architecture for Interactive Explanation Systems

X-SYS:交互解释系统的参考架构

Tobias Labarta, Nhi Hoang, Maximilian Dreyer, Jim Berend, Oleg Hein, Jackie Ma, Wojciech Samek, Sebastian Lapuschkin

机构 * Fraunhofer Heinrich Hertz Institute(弗劳恩霍夫海因里希·赫兹研究所) Technische Universität Berlin(柏林工业大学) BIFOLD – Berlin Institute for the Foundations of Learning and Data(BIFOLD – 柏林学习与数据基础研究所) Technical University Dublin(都柏林理工大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出X-SYS参考架构,通过STAR质量属性和五组件分解,指导交互解释系统的设计与实现,解决可解释AI在系统部署中的挑战。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10940 2026-04-14 cs.CV 57%

AmodalSVG: Amodal Image Vectorization via Semantic Layer Peeling

AmodalSVG:基于语义层剥离的模态图像向量化

Juncheng Hu, Ziteng Xue, Guotao Liang, Anran Qi, Buyu Li, Sheng Wang, Dong Xu, Qian Yu

机构 * School of Software, Beihang University(北京航空航天大学软件学院) Igarashi Lab, The University of Tokyo(东京大学五十岚实验室) Bambu Lab Department of Computer Science, The University of Hong Kong(香港大学计算机科学系)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 AmodalSVG通过语义层剥离技术,实现对自然图像中遮挡区域的完整几何向量化,提升SVG的结构编辑能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10789 2026-04-14 cs.CV 57%

ReplicateAnyScene: Zero-Shot Video-to-3D Composition via Textual-Visual-Spatial Alignment

ReplicateAnyScene:通过文本-视觉-空间对齐实现零样本视频到3D场景的合成

Mingyu Dong, Chong Xia, Mingyuan Jia, Weichen Lyu, Long Xu, Zheng Zhu, Yueqi Duan

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 本文提出ReplicateAnyScene框架,通过五阶段流水线实现视频到结构化3D场景的零样本合成,引入C3DR基准评估重建质量,实验表明其在生成高质量3D场景方面优于现有方法。

Comments Project Page: https://xiac20.github.io/ReplicateAnyScene/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09547 2026-04-14 cs.CV 57%

Tango: Taming Visual Signals for Efficient Video Large Language Models

Tango:驯服视觉信号以提高视频大语言模型的效率

Shukang Yin, Sirui Zhao, Hanchao Wang, Baozhi Jia, Xianquan Wang, Chaoyou Fu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Reconova AI Lab(Reconova AI实验室) Nanjing University(南京大学)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

AI总结 Tango通过改进注意力选择和相似性聚类方法,优化视频大语言模型的视觉信号利用,实现在保留10%视频token时性能损失仅0.1%,推理速度提升1.88倍。

Comments Code: https://github.com/xjtupanda/Tango

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07765 2026-04-14 cs.CV 57%

RemoteAgent: Bridging Vague Human Intents and Earth Observation with RL-based Agentic MLLMs

RemoteAgent: 通过基于强化学习的代理多模态大语言模型弥合模糊人类意图与遥感观测之间的鸿沟

Liang Yao, Shengxiang Xu, Fan Liu, Chuanyi Zhang, Bishun Yao, Rui Min, Yongjun Li, Chaoqian Ouyang, Shimin Di, Min-Ling Zhang

机构 * Hohai University(河海大学) Southeast University(东南大学) Sun Yat-sen University(中山大学)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

AI总结 本文提出RemoteAgent框架,通过VagueEO数据集和强化学习微调,使多模态大语言模型能直接解决图像和稀疏区域任务,并通过模型上下文协议智能协调专用工具进行密集预测,提升遥感任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20725 2026-04-14 cs.CV 57%

Premier: Personalized Preference Modulation with Learnable User Embedding in Text-to-Image Generation

Premier: 基于可学习用户嵌入的个性化偏好调节在文本到图像生成中

Zihao Wang, Yuxiang Wei, Xinpeng Zhou, Tianyu Zhang, Tao Liang, Yalong Bai, Hongzhi Zhang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Duxiaoman(度小满)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 Premier通过可学习用户嵌入和偏好适配器实现个性化图像生成,引入分散损失提升用户偏好区分度,实验显示其在偏好对齐和文本一致性上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05564 2026-04-14 cs.CV 57%

ProPhy: Progressive Physical Alignment for Dynamic World Simulation

ProPhy:渐进式物理对齐用于动态世界模拟

Zijun Wang, Panwen Hu, Jing Wang, Terry Jingchen Zhang, Yuhao Cheng, Long Chen, Yiqiang Yan, Zutao Jiang, Hanhui Li, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Peng Cheng Laboratory(鹏城实验室) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ETH Zürich(苏黎世联邦理工学院) Lenovo Research(联想研究院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 ProPhy通过渐进式物理对齐框架,实现物理感知的视频生成,提升动态物理现象的准确性与物理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14543 2026-04-14 cs.CV 57%

Exploring Cross-Modal Flows for Few-Shot Learning

探索跨模态流用于少样本学习

Ziqi Jiang, Yanghao Wang, Long Chen

机构 * Department of CSE, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出跨模态流匹配对齐(FMA)方法,通过多步调整提升跨模态对齐精度与鲁棒性,在多种基准和模型上均取得显著性能提升。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏