arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5048 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5048 篇

2608.00502 2026-08-04 cs.CV 新提交 70%

SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance

SpatialAfford:教紧凑视觉语言模型(VLMs)关注何处与定位何处以实现 affordance

Yufei Zhang, Chenlu Zhan, Donghui Sun, Xiaoxin Chen, Hongwei Wang

机构 * Zhejiang University(浙江大学) Vivo Mobile Communication Co., Ltd(维沃移动通信有限公司)

专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 SpatialAfford 是一个两阶段框架,通过空间注意力对齐和空间感知 GRPO,使紧凑 4B VLMs 在多个基准上的 affordance 定位性能优于更强的 7B+ 基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02457 2026-08-04 cs.CV 版本更新 70%

PatchAlign3D: Local Feature Alignment for Dense 3D Shape Understanding

PatchAlign3D: 本地特征对齐用于密集3D形状理解

Souhail Hadgi, Bingchen Gong, Ramana Sundararaman, Emery Pierson, Lei Li, Peter Wonka, Maks Ovsjanikov

机构 * École polytechnique(巴黎政治学院) University of Virginia(弗吉尼亚大学) KAUST(王国立阿联酋科技大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 PatchAlign3D通过点云直接生成语言对齐的片段特征,实现高效零样本3D部分分割,优于传统渲染方法。

Comments CVPR 2026. Project website: https://souhail-hadgi.github.io/patchalign3dsite/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25333 2026-08-03 cs.CV 版本更新 70%

Teaching Video Generators to Remember: Eliciting Dynamic Memory for Out-of-Sight State Evolution

教会视频生成器记忆:为不可见状态演化引出动态记忆

Tianshuo Xu, Yichen Xie, Depu Meng, Chensheng Peng, Quentin Herau, Bo Jiang, Yihan Hu, Wei Zhan

机构 * Applied Intuition(应用直觉) University of California, Berkeley(加州大学伯克利分校)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对视频生成模型在观测中断时状态冻结的问题,提出ReMind框架,通过面向记忆的数据构建、事件感知训练和缓存适配,利用KV缓存机制实现动态记忆,在STEVO-Bench和恢复任务上取得最佳成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21628 2026-07-31 cs.AI eess.IV 版本更新 70%

Wavelet Phase Diffusion for Structurally and Semantically Consistent Sim-to-Real Translation

用于结构和语义一致的模拟到真实翻译的小波相位扩散

Kaiwen Wang, Frank Bieder, Yinzhe Shen, Carlos Fernandez, Jan-Hendrik Pauls, Omer Sahin Tas

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究模拟到真实翻译中弥合合成与真实域外观差距并保持结构语义一致的问题,提出小波相位扩散方法,通过双树复小波包变换域操作及低频随机化,在未配对数据训练,提升了图像和视频翻译的真实感与一致性。

Comments Project Page: https://kit-mrt.github.io/Wavelet-Phase-Diffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26647 2026-07-30 cs.CV 新提交 70%

Anchoring and Steering Diffusion: Enhancing the Faithfulness of Text-to-Image Generation at Inference Time

锚定与引导扩散:在推理时提升文生图生成的忠实度

Xinyi Wang, Yuyang Huang, Yalin Su, Pengcheng Luan, Tao Zhang, Feiming Wei, Wenxian Yu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出无训练框架AnchorSteer,通过语义锚定与反射引导组件改进文生图扩散模型的推理,在GenEval等基准上提升文本-图像对齐性能且保持视觉质量。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24821 2026-07-29 cs.MM cs.CV cs.SD 新提交 70%

AVE-Compass: Towards Holistic Evaluation for Audio-Video Editing Abilities

AVE-Compass:迈向音频-视频编辑能力的整体评估

Yuqing Wen, Yukai Huang, Qianqian Xie, Jiangtao Wu, Yibin Lin, Yikai Gu, Jialu Chen, Yuanxing Zhang, Jiaheng Liu

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 研究针对现有视频编辑基准未充分考虑视听耦合问题,提出AVE-Compass基准及AVE-Agent框架,通过多种评估方式评估编辑能力,能分解复杂指令迭代改进结果,提升了跨模态编辑等方面表现及感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24611 2026-07-28 cs.CV 新提交 70%

Test-Time Adaptation via Dual Distillation for Videos Under Severe Distribution Shifts

通过双重蒸馏实现严重分布偏移下视频的测试时自适应

André Sacilotti, Samuel Felipe dos Santos, Jurandy Almeida

机构 * University of São Paulo(圣保罗大学) Federal University of São Carlos(圣卡洛斯联邦大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 研究针对视频在严重分布偏移下测试时自适应难题,提出双重蒸馏的测试时自适应框架TADD,依赖轻量级投影适配器及互补损失适应目标域,在多个视频动作识别基准测试中优于现有TTA基线,显著提升识别准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24353 2026-07-28 cs.CV 新提交 70%

PRISM: Prompt Refinement via Image-grounded Self-rewarding Mechanism for Text-to-Image Generation

PRISM:通过基于图像的自我奖励机制进行文本到图像生成的提示优化

Guo Tang, HongJie Luo, Tianxu Wang, Ying Zhang, Hao Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Sun Yat-sen University(中山大学) South China University of Technology(华南理工大学) Guangdong University of Technology(广东工业大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对文本到图像生成模型对提示制定敏感的问题,提出PRISM框架,通过基于图像的自我奖励机制,利用结构化视觉诊断和多任务监督微调等方法,提高图像质量和语义对齐,并提供可解释反馈。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19190 2026-07-27 cs.RO cs.AI 版本更新 70%

Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents

智能体真实到模拟:使用视觉语言智能体进行基于物理的世界建模

Guanxiong Chen, Qianjun Xia, Jiawei Peng, Heng Zhang, Bole Ma, Justin Qian, Ziyi Jiao, Bingyang Zhou, Luoxin Ye, Kaifeng Zhang, Kunyi Wang, Weijia Zeng, Yunuo Chen, Pengzhi Yang, Ziqiu Zeng, Siyuan Luo, Huamin Wang, Chao Liu, Alan Yuille, Fan Shi, Changxi Zheng, Yunzhu Li, Chenfanfu Jiang, Peter Yichen Chen

机构 * University of British Columbia(英属哥伦比亚大学) Johns Hopkins University(约翰·霍普金斯大学) National University of Singapore(新加坡国立大学) Columbia University(哥伦比亚大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Style3D(无合适对应中文名)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究针对机器人与物体交互的真实到模拟转换难题,提出智能体真实到模拟框架,利用视觉语言智能体进行广义物理世界建模,能转换真实记录为可模拟孪生体,在多场景评估效果良好,成本低,可用于下游机器人任务。

Comments Authorship change

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21076 2026-07-24 cs.CV 新提交 70%

C-PTQ: Fisher-weighted Channel-wise Sensitivity for Post-training Quantization of MLLMs

C-PTQ:用于多模态大语言模型训练后量化的Fisher加权通道敏感性

Jiameng Li, Han Zhou, Matthew B. Blaschko

专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 研究针对多模态大语言模型训练后量化中异常通道致性能下降问题,提出C-PTQ方法,通过设计Fisher加权目标统一任务特定损失扰动和量化误差,无需辅助模块达最优性能,经实验验证有效。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20357 2026-07-23 cs.CV 新提交 70%

Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs

少看,快思考:多模态大语言模型的联合令牌-计算适配

Pengcheng Wang, Zhiquan Wang, Jayoung Lee, Zhuoyan Xu, Ran Xu, Saurabh Bagchi, Yin Li, Somali Chaterji

机构 * Purdue University(普渡大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) NVIDIA(英伟达)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 针对多模态大语言模型推理成本高的问题,提出SmartVL框架,通过视觉侧令牌控制器和LLM侧计算控制器联合控制视觉令牌数量和模型计算能力,实验证明该框架优于先前方法,实现更好的精度-效率平衡。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09080 2026-07-23 cs.CV 版本更新 70%

GeoTrace: Geometry-Aware Trajectory Token Compression for Video Large Language Models

GeoTrace:用于视频大语言模型的几何感知轨迹令牌压缩

Guohuan Xie, Mengqi Lei, Chuan Shi, Wei Bao, Yue Gao, Siqi Li

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.CV

AI总结 研究针对Video LLMs视觉令牌多致效率受限问题,提出GeoTrace框架,通过CFPA和TCRC分别处理骨架与残差令牌,经实验评估证明该框架在多模型架构和场景下有效,能在大幅减少计算量时保留高比例性能。

Comments Withdrawn by the authors due to an incomplete internal approval process

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02402 2026-07-23 cs.CV 版本更新 70%

Show Me Examples: Inferring Visual Concepts from Image Sets

展示示例:从图像集合中推断视觉概念

Nick Stracke, Kolja Bauer, Stefan Andreas Baumann, Miguel Angel Bautista, Josh Susskind, Björn Ommer

机构 * Munich Center for Machine Learning(慕尼黑机器学习中心) Apple(苹果公司)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出VICIS任务评估视觉语言模型从图像集合中推断共享概念的能力,并设计训练框架与架构,使模型能提取概念嵌入并生成与查询一致的新图像。

Comments for code, view https://github.com/CompVis/set-learner

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25578 2026-07-21 cs.CV 版本更新 70%

H-Adapter: Pose-Robust Hairstyle Transfer via Attention-Derived, Source-Aligned Hair Masks

H-Adapter: 通过注意力导出的源对齐头发掩码实现姿态鲁棒的发型迁移

Seulgi Jeong, Yunseong Cho, Sanghun Park

机构 * SNOW Corp.(SNOW公司)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出H-Adapter,利用区域特定损失解耦头发与非头发目标,导出源对齐头发编辑掩码引导扩散修复,实现大姿态差异下的鲁棒发型迁移,在FID、FID_CLIP和CLIP-I指标上取得最优。

Comments Accepted at ECCV 2026. Project page: https://sanghunpark.github.io/hadapter_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16105 2026-07-20 cs.CV cs.HC 新提交 70%

Attention-Guided Saliency Maps for Interpreting Visualization Literacy in VLMs

用于解释视觉语言模型中视觉素养的注意力引导显著图

Maeve Hutchinson, Abderrahmane Wassim Mehdaoui, Pranava Madhyastha

机构 * The Alan Turing Institute(艾伦·图灵研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 研究视觉语言模型如何解释数据可视化这一问题,提出针对图像文本生成的轻量级诊断显著图方法,通过聚合注意力并映射到图像,生成快速无梯度显著图,用删除度量评估,揭示模型注意力分配情况。

Comments To be presented at IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07383 2026-07-20 cs.RO cs.LG 版本更新 70%

RhinoVLA Technical Report

RhinoVLA 技术报告

Huixi Technology, :, Chen Zhang, Chenyang Zhou, Guanglei Ding, Guanghui He, Haibin Gao, Jiajia Chen, Jianyong Zhang, Lianyi Yu, Ningyi Xu, Ping Xu, Qingchen Li, Yingjun Hu, Yijia Zhang, Yuxi Liu

机构 * Huixi Intelligence(慧溪智能)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.LG

AI总结 针对边缘硬件上VLA模型部署延迟问题,提出RhinoVLA,通过令牌高效骨干、连续动作专家和统一接口实现实时闭环控制,在Huixi R1上达到11.69 Hz推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15246 2026-07-17 cs.CV 新提交 70%

ARMOR++: Agentic Orchestration of a Multi-Domain Primitive Set for Transferable Attacks on Deepfake Detectors

ARMOR++:用于对深度伪造检测器进行可转移攻击的多域原语集的智能编排

Christos Korgialas, Gabriel Lee Jun Rong, Dion Jia Xu Ho, Pai Chet Ng, Xiaoxiao Miao, Konstantinos N. Plataniotis

机构 * Department of Informatics, Aristotle University of Thessaloniki(塞萨洛尼基亚里士多德大学信息学系) Infocomm Technology Cluster, Singapore Institute of Technology(新加坡科技学院信息通信技术集群) Department of Applied Physics and Applied Mathematics, Columbia University(哥伦比亚大学应用物理与应用数学系) Division of Natural and Applied Sciences, Duke Kunshan University(昆山杜克大学自然科学与应用科学部) Department of Electrical and Computer Engineering, University of Toronto(多伦多大学电气与计算机工程系)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 研究针对深度伪造检测器在黑盒对抗转移下可靠性下降问题,提出ARMOR++多智能体框架,利用视觉与语言模型提供语义先验并编排原语选择等,整合多种原语有效针对异构偏差,实验表明其性能优于现有基线,凸显当前检测器可靠性差距及智能编排的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10385 2026-07-15 cs.CV 版本更新 70%

GTASA: Ground Truth Annotations for Spatiotemporal Analysis, Evaluation and Training of Video Models

GTASA:用于视频模型空间时间分析、评估和训练的地面真实标注

Nicolae Cudlenco, Mihai Masala, Marius Leordeanu

机构 * Institute of Mathematics of the Romanian Academy(罗马尼亚科学院数学研究所) National University of Science and Technology Politehnica Bucharest(布加勒斯特理工大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出GTASA,一种包含多主体视频的标注数据集,通过空间关系图和事件级时间映射,验证了其在视频模型训练和评估中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08312 2026-07-10 cs.LG 新提交 70%

Write-Protected Discrete Bottlenecks for Language-Grounded World Models: A Structural Limitation and Sufficient Fix

用于语言基础世界模型的写保护离散瓶颈:一种结构限制及充分修复

Jiayi Fang

机构 * Shanghai University of Finance and Economics(上海金融学院)

专题命中 VLM训练与架构 :VLM(abstract);grounding(abstract);分类 cs.LG

AI总结 研究语言与世界模型离散符号系统的交互问题,提出防止基于Gumbel-softmax的离散符号瓶颈失败的三个约束,经实验验证该方法能实现高基础准确率,且修复参数少、无需微调。

Comments 20 pages, 7 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08027 2026-07-10 cs.CL cs.AI 新提交 70%

Structured Pruning of Large Language Models via Power Transformation and Sign-Preserving Score Aggregation with Adaptive Feature Retention

通过幂变换和符号保留分数聚合与自适应特征保留对大语言模型进行结构化剪枝

Ryota Kobayashi, Tsubasa Hirakawa, Takayoshi Yamashita, Hironobu Fujiyoshi, Yasunori Ishii, Tomoyuki Okuno, Kazuki Kozuka

机构 * Chubu University(楚ubu大学) Panasonic Holdings Corporation(松下电器控股公司)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.AI

AI总结 研究针对大语言模型结构化剪枝,改进自适应特征保留技术。结合幂变换、符号保留分数聚合及异常值去除方法,解决应用中出现的分布不匹配等问题。实验表明该方法能保持准确率,通过结构化剪枝加速推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06726 2026-07-09 cs.CV 新提交 70%

A Good Initialization is All You Need for Faithful Visual Attribution

忠实视觉归因只需一个良好的初始化

Zihan Gu, Jiayu Wang, Hua Zhang, Yue Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 VLM训练与架构 :LLaVA(abstract);MLLM(abstract);分类 cs.CV

AI总结 研究忠实视觉归因中掩码优先问题,介绍CoPAIR和TRACE两种仅向前方法,用于构建紧凑的top-k证据掩码。在多个模型和任务上实验,初始化搜索方法达新前沿,TRACE+贪心在多模态语言模型归因中表现优,直接的TRACE掩码有高修复率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17390 2026-07-09 cs.CV 版本更新 70%

FMMC: Harnessing the Power of Foundation Models for Accurate Material Classification

利用基础模型提升材料分类的准确性

Qingran Lin, Fengwei Yang, Chaolun Zhu

机构 * Georgia Institute of Technology(佐治亚理工学院) Duke University(杜克大学) Waseda University(早稻田大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出一种利用基础模型克服数据限制并提升分类准确性的新框架,通过生成高质量数据集和融合视觉语言模型先验知识,有效提高材料分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02593 2026-07-07 cs.CV cs.CL 新提交 70%

Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation

多模态大语言模型知识蒸馏的令牌级响应视觉注意力引导

Jaehyun Jang, Eunseop Yoon, Hee Suk Yoon, SooHwan Eom, Mark A. Hasegawa-Johnson, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 研究多模态大语言模型知识蒸馏,挑战传统依赖,发现下游性能与响应视觉注意力相似度强相关。提出令牌级响应视觉注意力引导方法,通过自适应加权散度,有效引导学生模型,实验证明其性能优于基线。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08377 2026-07-07 cs.CV 版本更新 70%

UniVideo: Unified Understanding, Generation, and Editing for Videos

UniVideo:视频的统一理解、生成与编辑

Cong Wei, Quande Liu, Zixuan Ye, Qiulin Wang, Xintao Wang, Pengfei Wan, Kun Gai, Wenhu Chen

机构 * University of Waterloo(多伦多大学) Kling Team, Kuaishou Technology(快手技术团队)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 提出UniVideo框架,采用双流设计,结合多模态大语言模型与多模态DiT进行视频生成等任务。统一多种视频任务于单范式,实验表明其性能出色,还支持任务组合与能力迁移,且发布了模型和代码。

Comments Project Website https://congwei1230.github.io/UniVideo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15061 2026-07-07 cs.RO cs.CV 版本更新 70%

Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue

Ask-to-Clarify: 通过多轮对话解决指令歧义

Xingyao Lin, Xinghao Zhu, Tianyi Lu, Guojin Zhong, Sicheng Xie, Hui Zhang, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

机构 * College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China(复旦大学计算机科学与人工智能学院) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Mechanical Systems Control Lab, UC Berkeley, California, USA(伯克利机械系统控制实验室)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出Ask-to-Clarify框架,通过多轮对话解决指令歧义问题,结合视觉语言模型和扩散模型,采用两阶段知识绝缘策略训练,实现多任务中更高效的协作式具身代理。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15330 2026-07-07 cs.CV 版本更新 70%

CoDoL: Conditional Domain Prompt Learning for Out-of-Distribution Generalization

CoDoL:用于分布外泛化的条件域提示学习

Min Zhang, Yuyin Wang, Zhongxiang Dai, Zhikang Chen, Jie Zhou, Miao Liu, Sen Cui

机构 * East China Normal University(东华师范大学) Xidian University(西安电子科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Oxford(牛津大学) Tsinghua University(清华大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 针对基于提示的CLIP方法存在的文本描述不准确、视觉语言嵌入对齐有限问题,提出CoDoL方法,利用域信息形成提示,还提出DMN生成输入条件令牌,实验验证其在分布外泛化的有效性。

Comments Accepted to TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01383 2026-07-03 cs.CV 新提交 70%

MIBE: Multi-subject Interaction Benchmark and Evaluator for Personalized Image Generation

MIBE:面向个性化图像生成的多主体交互基准与评估器

Zhihan Chen, Yuhuan Zhao, Yijie Zhu, Xinyu Yao, Mengcong Ren, Suwen Wang, Qiuyang Yin, Yuchen Sun, Qin Wang, Lu Xin

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Southern California(南加州大学) DeerLab LLC(DeerLab有限责任公司) Carnegie Mellon University(卡内基梅隆大学) Clemson University(克莱姆森大学) Google(谷歌) San Jose State University(圣何塞州立大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出MIBE框架,包含多主体交互基准(MIB)和评估器(MIE),通过解耦数据体制和双头排序诊断目标,解决多主体个性化图像生成中主体遗漏、外观失配和交互错误问题,在黄金集上达到0.922成对准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24564 2026-07-03 cs.CV 新提交 70%

PatternGSL: A Structured Specification Language for Template-Free and Simulation-Ready 3D Garments

PatternGSL: 一种用于无模板且可模拟的3D服装的结构化规范语言

Zhenyang Li, Lutao Jiang, Yizhou Zhao, Ying-Cong Chen, Xin Wang, Weikai Chen, Yifan Peng

机构 * The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Carnegie Mellon University(卡内基梅隆大学) LIGHTSPEED Shenzhen(LIGHTSPEED深圳) LIGHTSPEED Los Angeles(LIGHTSPEED洛杉矶)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出PatternGSL,一种无模板、可学习的结构化服装表示语言,从单张图像直接预测完整缝纫图案,实现可模拟的3D服装重建。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00606 2026-07-02 cs.CV 新提交 70%

Retrieved Images as Visual Thought: Training-Free Multimodal In-Context Learning for the Open-vs-Closed Gap

检索图像作为视觉思维:面向开放与封闭差距的无训练多模态上下文学习

Bingchen Huang, Zhiling Wang, Yifu Chen, Yuanchao Du

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.CV

AI总结 提出无训练框架ReVisIT,通过检索图像-标签对作为视觉思维单元,结合结构化类定义、多模态检索和交替注入示例,在多个基准上显著提升性能,弥合开放与封闭任务差距。

Comments 12 pages, 6 figures. Includes appendix. Introduces the MAAC-Bench benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30599 2026-07-01 cs.CV 版本更新 70%

Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing

Goku:百万级通用指令视频编辑数据集与基准

Sen Liang, Cong Wang, Zhentao Yu, Fengbin Guan, Zhengguang Zhou, Teng Hu, Youliang Zhang, Yuan Zhou, Xin Li, Qinglin Lu, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Tencent Hunyuan(腾讯混元)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出首个百万级多任务视频编辑数据集Goku,包含200万高质量指令对齐对,并设计高效数据合成流程和渐进过滤系统,基于此提出双分支模型Goku-Edit及包含1000个测试用例的基准Goku-Bench,在指令遵循上提升8%。

Comments Project Page: https://flying-sky999.github.io/Goku.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏