arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2597 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 533 篇

2607.24353 2026-07-28 cs.CV 新提交 70%

PRISM: Prompt Refinement via Image-grounded Self-rewarding Mechanism for Text-to-Image Generation

PRISM:通过基于图像的自我奖励机制进行文本到图像生成的提示优化

Guo Tang, HongJie Luo, Tianxu Wang, Ying Zhang, Hao Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Sun Yat-sen University(中山大学) South China University of Technology(华南理工大学) Guangdong University of Technology(广东工业大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对文本到图像生成模型对提示制定敏感的问题,提出PRISM框架,通过基于图像的自我奖励机制,利用结构化视觉诊断和多任务监督微调等方法,提高图像质量和语义对齐,并提供可解释反馈。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21076 2026-07-24 cs.CV 新提交 70%

C-PTQ: Fisher-weighted Channel-wise Sensitivity for Post-training Quantization of MLLMs

C-PTQ:用于多模态大语言模型训练后量化的Fisher加权通道敏感性

Jiameng Li, Han Zhou, Matthew B. Blaschko

专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 研究针对多模态大语言模型训练后量化中异常通道致性能下降问题,提出C-PTQ方法,通过设计Fisher加权目标统一任务特定损失扰动和量化误差,无需辅助模块达最优性能,经实验验证有效。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20357 2026-07-23 cs.CV 新提交 70%

Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs

少看,快思考:多模态大语言模型的联合令牌-计算适配

Pengcheng Wang, Zhiquan Wang, Jayoung Lee, Zhuoyan Xu, Ran Xu, Saurabh Bagchi, Yin Li, Somali Chaterji

机构 * Purdue University(普渡大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) NVIDIA(英伟达)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 针对多模态大语言模型推理成本高的问题,提出SmartVL框架,通过视觉侧令牌控制器和LLM侧计算控制器联合控制视觉令牌数量和模型计算能力,实验证明该框架优于先前方法,实现更好的精度-效率平衡。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16105 2026-07-20 cs.CV cs.HC 新提交 70%

Attention-Guided Saliency Maps for Interpreting Visualization Literacy in VLMs

用于解释视觉语言模型中视觉素养的注意力引导显著图

Maeve Hutchinson, Abderrahmane Wassim Mehdaoui, Pranava Madhyastha

机构 * The Alan Turing Institute(艾伦·图灵研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 研究视觉语言模型如何解释数据可视化这一问题,提出针对图像文本生成的轻量级诊断显著图方法,通过聚合注意力并映射到图像,生成快速无梯度显著图,用删除度量评估,揭示模型注意力分配情况。

Comments To be presented at IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15246 2026-07-17 cs.CV 新提交 70%

ARMOR++: Agentic Orchestration of a Multi-Domain Primitive Set for Transferable Attacks on Deepfake Detectors

ARMOR++:用于对深度伪造检测器进行可转移攻击的多域原语集的智能编排

Christos Korgialas, Gabriel Lee Jun Rong, Dion Jia Xu Ho, Pai Chet Ng, Xiaoxiao Miao, Konstantinos N. Plataniotis

机构 * Department of Informatics, Aristotle University of Thessaloniki(塞萨洛尼基亚里士多德大学信息学系) Infocomm Technology Cluster, Singapore Institute of Technology(新加坡科技学院信息通信技术集群) Department of Applied Physics and Applied Mathematics, Columbia University(哥伦比亚大学应用物理与应用数学系) Division of Natural and Applied Sciences, Duke Kunshan University(昆山杜克大学自然科学与应用科学部) Department of Electrical and Computer Engineering, University of Toronto(多伦多大学电气与计算机工程系)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 研究针对深度伪造检测器在黑盒对抗转移下可靠性下降问题,提出ARMOR++多智能体框架,利用视觉与语言模型提供语义先验并编排原语选择等,整合多种原语有效针对异构偏差,实验表明其性能优于现有基线,凸显当前检测器可靠性差距及智能编排的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08312 2026-07-10 cs.LG 新提交 70%

Write-Protected Discrete Bottlenecks for Language-Grounded World Models: A Structural Limitation and Sufficient Fix

用于语言基础世界模型的写保护离散瓶颈:一种结构限制及充分修复

Jiayi Fang

机构 * Shanghai University of Finance and Economics(上海金融学院)

专题命中 VLM训练与架构 :VLM(abstract);grounding(abstract);分类 cs.LG

AI总结 研究语言与世界模型离散符号系统的交互问题,提出防止基于Gumbel-softmax的离散符号瓶颈失败的三个约束,经实验验证该方法能实现高基础准确率,且修复参数少、无需微调。

Comments 20 pages, 7 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08027 2026-07-10 cs.CL cs.AI 新提交 70%

Structured Pruning of Large Language Models via Power Transformation and Sign-Preserving Score Aggregation with Adaptive Feature Retention

通过幂变换和符号保留分数聚合与自适应特征保留对大语言模型进行结构化剪枝

Ryota Kobayashi, Tsubasa Hirakawa, Takayoshi Yamashita, Hironobu Fujiyoshi, Yasunori Ishii, Tomoyuki Okuno, Kazuki Kozuka

机构 * Chubu University(楚ubu大学) Panasonic Holdings Corporation(松下电器控股公司)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.AI

AI总结 研究针对大语言模型结构化剪枝,改进自适应特征保留技术。结合幂变换、符号保留分数聚合及异常值去除方法,解决应用中出现的分布不匹配等问题。实验表明该方法能保持准确率,通过结构化剪枝加速推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06726 2026-07-09 cs.CV 新提交 70%

A Good Initialization is All You Need for Faithful Visual Attribution

忠实视觉归因只需一个良好的初始化

Zihan Gu, Jiayu Wang, Hua Zhang, Yue Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 VLM训练与架构 :LLaVA(abstract);MLLM(abstract);分类 cs.CV

AI总结 研究忠实视觉归因中掩码优先问题,介绍CoPAIR和TRACE两种仅向前方法,用于构建紧凑的top-k证据掩码。在多个模型和任务上实验,初始化搜索方法达新前沿,TRACE+贪心在多模态语言模型归因中表现优,直接的TRACE掩码有高修复率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02593 2026-07-07 cs.CV cs.CL 新提交 70%

Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation

多模态大语言模型知识蒸馏的令牌级响应视觉注意力引导

Jaehyun Jang, Eunseop Yoon, Hee Suk Yoon, SooHwan Eom, Mark A. Hasegawa-Johnson, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 研究多模态大语言模型知识蒸馏,挑战传统依赖,发现下游性能与响应视觉注意力相似度强相关。提出令牌级响应视觉注意力引导方法,通过自适应加权散度,有效引导学生模型,实验证明其性能优于基线。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01383 2026-07-03 cs.CV 新提交 70%

MIBE: Multi-subject Interaction Benchmark and Evaluator for Personalized Image Generation

MIBE:面向个性化图像生成的多主体交互基准与评估器

Zhihan Chen, Yuhuan Zhao, Yijie Zhu, Xinyu Yao, Mengcong Ren, Suwen Wang, Qiuyang Yin, Yuchen Sun, Qin Wang, Lu Xin

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Southern California(南加州大学) DeerLab LLC(DeerLab有限责任公司) Carnegie Mellon University(卡内基梅隆大学) Clemson University(克莱姆森大学) Google(谷歌) San Jose State University(圣何塞州立大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出MIBE框架,包含多主体交互基准(MIB)和评估器(MIE),通过解耦数据体制和双头排序诊断目标,解决多主体个性化图像生成中主体遗漏、外观失配和交互错误问题,在黄金集上达到0.922成对准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24564 2026-07-03 cs.CV 新提交 70%

PatternGSL: A Structured Specification Language for Template-Free and Simulation-Ready 3D Garments

PatternGSL: 一种用于无模板且可模拟的3D服装的结构化规范语言

Zhenyang Li, Lutao Jiang, Yizhou Zhao, Ying-Cong Chen, Xin Wang, Weikai Chen, Yifan Peng

机构 * The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Carnegie Mellon University(卡内基梅隆大学) LIGHTSPEED Shenzhen(LIGHTSPEED深圳) LIGHTSPEED Los Angeles(LIGHTSPEED洛杉矶)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出PatternGSL,一种无模板、可学习的结构化服装表示语言,从单张图像直接预测完整缝纫图案,实现可模拟的3D服装重建。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00606 2026-07-02 cs.CV 新提交 70%

Retrieved Images as Visual Thought: Training-Free Multimodal In-Context Learning for the Open-vs-Closed Gap

检索图像作为视觉思维:面向开放与封闭差距的无训练多模态上下文学习

Bingchen Huang, Zhiling Wang, Yifu Chen, Yuanchao Du

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.CV

AI总结 提出无训练框架ReVisIT,通过检索图像-标签对作为视觉思维单元,结合结构化类定义、多模态检索和交替注入示例,在多个基准上显著提升性能,弥合开放与封闭任务差距。

Comments 12 pages, 6 figures. Includes appendix. Introduces the MAAC-Bench benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31711 2026-07-01 cs.AI 新提交 70%

Arena-T2I Hard: Benchmarking and Improving Faithfulness with Dependency-Aware Checklist

Arena-T2I Hard:基于依赖感知清单的忠实性基准测试与改进

Yuanhao Ban, Tong Xie, Sohyun An, Yunqi Hong, Evan Frick, I-Hung Hsu, Wei-Lin Chiang, Ion Stoica, Cho-Jui Hsieh

机构 * Arena Intelligence Inc UCLA(加州大学洛杉矶分校)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对现有忠实性基准在复杂指令上的不足,提出310条压力测试提示集Arena-T2I Hard,并设计依赖感知清单奖励结合美学奖励,显著提升文本到图像模型的忠实性-美学权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31392 2026-07-01 cs.AI 新提交 70%

ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents

ReGRPO: 用于工具使用智能体的反思增强策略优化

Binjie Zhang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show Lab)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.AI

AI总结 提出ReGRPO框架,通过反思数据引擎和联合优化反射令牌与纠正动作,提升工具使用智能体在故障后的恢复能力,在GTA和GAIA上取得最佳效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27251 2026-06-26 cs.RO cs.AI 新提交 70%

Advancing Omnimodal Embodied Agents from Isolated Skills to Everyday Physical Autonomy

推进全模态具身智能体:从孤立技能到日常物理自主

Junhao Shi, Zezheng Huai, Siyin Wang, Jia Chen, Yubang Wang, Zhaoye Fei, Hechang Chen, Jingjing Gong, Xipeng Qiu, Yu-Gang Jiang

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出OmniAct框架,通过分层异步架构统一规划、记忆和验证,实现机器人在非结构化环境中的持久自主,在40项真实任务中提升成功率并降低token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25509 2026-06-25 cs.RO cs.CV 新提交 70%

ASSCG: Just-Right Gating over Chattering for Fast-Slow LLM Planning in Autonomous Driving

ASSCG:自动驾驶中快慢LLM规划的恰到好处门控

Sining Ang, Yuan Chen, Liu Haiyan, Xuanyao Mao, Jason Bao, Xuliang, Bingchuan Sun, Yan Wang

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Department of Automation, University of Science and Technology of China(中国科学技术大学自动化系) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Lenovo Group Limited(联想集团)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出自适应慢系统控制门(ASSCG),通过帧级查询/缓存/丢弃决策优化快慢规划器调用,结合RWKV骨干网络和GRPO风格强化学习,在nuPlan和NAVSIM上分别提升性能并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24447 2026-06-24 cs.CV 新提交 70%

P-MTP: Efficient Document Parsing via Multi-Token Prediction with Progressive Depth Scaling

P-MTP: 通过渐进深度缩放的多令牌预测实现高效文档解析

Le Xiang, Chenxi Zhai, Shu Wei, Jingjing Wu, Qunyi Xie, Xiao Tan, Kunbin Chen, Wei He

机构 * Department of Computer Vision Technology (VIS) Baidu Inc China(百度计算机视觉技术部(VIS)) Tsinghua University Shenzhen International Graduate School China(清华大学深圳国际研究生院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出P-MTP框架,通过渐进式多令牌预测和轻量级MTP模块,结合渐进课程损失和置信门控动态草稿,实现文档解析高达5倍加速且精度损失极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23494 2026-06-23 cs.CV 新提交 70%

Brain-Adapter: A Dual-Stream Vision-Language MIL Framework for Comprehensive 3D CT Diagnosis of Acute Intracranial Pathologies

Brain-Adapter: 一种用于急性颅内病理综合3D CT诊断的双流视觉-语言MIL框架

Zhenyu Yi, Zhiyun Song, Yusong Sun, Zelin Liu, Manman Fei, Zhenhao Li, Jiaxuan Zhao, Xu Han, Lichi Zhang

机构 * School of Biomedical Engineering, Shanghai Jiao Tong University(上海交通大学生物医学工程学院) Department of Computing, Imperial College London(伦敦帝国理工学院计算系)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出Brain-Adapter双流多实例学习框架,利用预训练2D生物医学视觉-语言模型和原始诊断报告,通过文本条件注意力和不确定性感知融合实现3D CT扫描的多标签分类,无需密集标注。

Comments Accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22779 2026-06-23 cs.CR cs.CV 新提交 70%

DE-FIVE: Detecting Malicious Image Prompts via Fourier Features and Image Vector Embeddings

DE-FIVE: 通过傅里叶特征和图像向量嵌入检测恶意图像提示

Xingwei Zhong, Varun Sharma, Kar Wai Fok, Vrizlynn L. L. Thing

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出DE-FIVE框架,利用傅里叶域特征和图像向量嵌入,无需训练即可检测针对视觉语言模型的恶意图像提示,包括间接提示注入攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21915 2026-06-23 cs.CV 新提交 70%

GTA-Net: Cooperative Game Theory for Vision-Language Alignment in Chest X-Ray Report Generation

GTA-Net:合作博弈论在胸部X光报告生成中的视觉-语言对齐

Saif ur Rehman Khan, Imad Ahmed Waqar, Sebastian Vollmer, Andreas Dengel, Muhammad Nabeel Asim

机构 * Department of Computer Science, Rhineland-Palatinate Technical University of Kaiserslautern-Landau(莱茵兰-普法尔茨凯泽斯劳滕-兰道工业大学计算机科学系) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) IntelligentX GmbH

专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出GTA-Net,利用合作博弈论实现图像区域与文本的显式对齐,通过二元和三元对齐器提升胸部X光报告生成的临床一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21596 2026-06-23 cs.CV 新提交 70%

$ϕ$-Scene: Physically Grounded Image-to-3D Scene Reconstruction

$\phi$-Scene: 物理驱动的图像到3D场景重建

Haodong Li, Lulu Shao, Haolin Lu, Yu Fu, Yen-Ru Chen, Seemandhar Jain, Manmohan Chandraker

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出$\phi$-Scene方法,将单图像3D场景重建视为拓扑驱动的物理组装过程,通过SDF优化和刚体仿真解决穿透与不稳定接触问题,在3D-Front数据集上取得最优性能。

Comments Project page: https://phi-scene.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21174 2026-06-23 cs.CV q-bio.GN 新提交 70%

HERO: Hypothesis-Driven Evidence Retrieval from Omics for Multi-Task Breast Cancer Analysis

HERO:基于假设驱动的组学证据检索用于多任务乳腺癌分析

Xiangyu Li, Ran Su

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出HERO框架,将组学数据作为形态学假设进行显式检索,通过稀疏通路先验和TF-IDF检索实现可审计的多模态乳腺癌分析,在TCGA-BRCA上取得多项预测任务的最优结果。

Comments 11 pages, 3 figures, Early accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20709 2026-06-23 cs.CV 新提交 70%

TeleStyle V2: Beyond Content-Preserving Style Transfer with Self-Distillation and Distribution-Matching-Distillation

TeleStyle V2:超越内容保持风格迁移的自蒸馏与分布匹配蒸馏

Shiwen Zhang, Yifan Xu, Haibin Huang, Chi Zhang, Xuelong Li

机构 * TeleAI

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出TeleStyle V2,通过自蒸馏数据合成和分布匹配蒸馏,支持四种内容-风格参考组合,解决内容一致性退化问题,性能与Qwen-Image-Edit和Gemini 3 Pro相当。

Comments https://github.com/Tele-AI/TeleStyleV2

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20246 2026-06-23 cs.RO cs.AI 新提交 70%

Finetuning Vision-Language-Action Models Requires Fewer Layers Than You Think

微调视觉-语言-动作模型所需的层数比你想象的少

Gia-Binh Nguyen, Trong-Bao Ho, Thien-Loc Ha, Khoa Vo, Philip Lund Møller, Quang T. Nguyen, Long Dinh, Tung M. Luu, Tuan Dam, Vu Duong, Trung Le, Nghi D. Q. Bui, Minh Vu, Tran Nguyen Le, An Thai Le, Ngan Le, Daniel Sonntag, James Zou, Jan Peters, Duy M. H. Nguyen, Ngo Anh Vien

机构 * Center for AI Research, VinUniversity(VinUniversity人工智能研究中心) VinRobotics University of Arkansas(阿肯色大学) Technical University of Denmark(丹麦技术大学) Hanoi University of Science and Technology(河内科技大学) KAIST(韩国科学技术院) Monash University(莫纳什大学) Oldenburg University(奥尔登堡大学) DFKI(德国人工智能研究中心) University of Stuttgart(斯图加特大学) IMPRS-IS(国际马克斯·普朗克智能系统研究学院) Stanford University(斯坦福大学) Technische Universität Darmstadt(达姆施塔特工业大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文发现VLA模型存在层间表示冗余,提出无需训练的压缩方法,通过去除冗余层将模型深度减少50%,实现40-50%训练加速和30%推理加速,性能不变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19989 2026-06-19 cs.DC cs.LG 新提交 70%

Online Dynamic Batching with Formal Guarantees for LLM Training

面向LLM训练的具有形式保证的在线动态批处理

Dian Li, Zekun Wang, Yaoru Wang, Jiahong Yan

机构 * Tencent(腾讯)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.LG

AI总结 提出在线动态批处理(ODB)系统,在数据加载器侧将批构建延迟到样本真实成本可观测时,解决离线批采样中预处理成本不可见问题,实现1.58-4.43x吞吐量提升,并提供无死锁有界终止的形式化保证。

Comments 29 pages, 3 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17213 2026-06-17 cs.CL cs.CV 新提交 70%

Revisiting LLM Adaptation for 3D CT Report Generation: A Study of Scaling and Diagnostic Priors

重新审视用于3D CT报告生成的LLM适应:缩放与诊断先验研究

Vanshali Sharma, Andrea M. Bejar, Halil Ertugrul Aktas, Quoc-Huy Trinh, Debesh Jha, Gorkem Durak, Ulas Bagci

机构 * Northwestern University(西北大学) University of South Dakota(南达科他大学) Aalto University(阿尔托大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出RAD3D-Prefix轻量级诊断先验框架,通过冻结大语言模型并融合多标签分类逻辑,在少量可训练参数下实现3D CT报告生成,优于全微调基线并展现强泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14700 2026-06-15 cs.CV 新提交 70%

RepFusion: Leveraging Multimodal Priors for Denoising in Representation Space

RepFusion:利用多模态先验在表示空间中进行去噪

Xichen Pan, Aashu Singh, Satya Narayan Shukla, Xiangjun Fan, Shlok Kumar Mishra, Saining Xie

机构 * Meta AI New York University(纽约大学)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出RepFusion方法,利用多模态大语言模型作为噪声表示编码器,为扩散变压器提供条件信号,在相似推理预算下优于新初始化解码器基线。

Comments Project Page: https://xichenpan.com/repfusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14153 2026-06-15 cs.CV cs.RO 新提交 70%

Encoder Winners Do Not Reliably Transfer Across VLA Backbone Scale: A Frozen-Backbone Grafting Diagnostic

编码器胜者无法可靠跨VLA骨干网络规模迁移:一种冻结骨干嫁接诊断方法

Qingping Zeng, Fei She

机构 * Tsinghua University(清华大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出冻结骨干嫁接诊断方法,发现小规模VLA上最优的视觉编码器在大规模骨干上并非最优,编码器选择依赖于骨干网络规模。

Comments 23 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12994 2026-06-15 cs.LG cs.CE 新提交 70%

DeepJEB++: Foundation Model-Driven Large-Scale 3D Engineering Dataset via 2D Latent Space Augmentation

DeepJEB++: 基于基础模型驱动的二维潜空间增强的大规模三维工程数据集

Soyoung Yoo, Leekyo Jeong, Jinsu Ra, Dongeon Lee, Sunwoong Yang, Hyogu Jeong, Namwoo Kang

机构 * Cho Chun Shik Graduate School of Mobility, Korea Advanced Institute of Science and Technology(韩国科学技术院赵春植移动研究生院) Department of Mechanical Engineering, Hanyang University(汉阳大学机械工程系) Narnia Labs(纳尼亚实验室)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出DeepJEB++框架,通过二维潜空间增强和基础模型,将少量喷气发动机支架种子设计扩展为大规模带仿真标签的三维数据集,实现40倍扩展。

Comments 16 pages, 14 figures. Submitted to ASME Journal of Mechanical Design

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12012 2026-06-11 cs.CV 新提交 70%

FitVTON: Fit-aware Virtual Try-On via Body-Garment Size Control

FitVTON: 通过身体-服装尺寸控制实现合身感知的虚拟试穿

Yiqun Ning, Ao Shen, Chenhang He, Lei Zhang

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) Nuvatech

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对现有虚拟试穿忽略物理合身性的问题,提出FitVTON模型,通过结构化文本提示编码服装-身体尺寸,并引入辅助头预测服装和暴露身体掩膜,结合纹理校正阶段,在真实数据集FittingEffect3K上验证了尺寸准确性和形状保持的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏