arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1566 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1566 篇

2606.01819 2026-06-02 cs.CV eess.IV 57%

Hist2Style: Histogram-Guided Stylization with Bilateral Grids

Hist2Style: 基于双边网格的直方图引导风格化

Dekel Galor, Adam Pikielny, Zhoutong Zhang, Ke Wang, Laura Waller, Jiawen Chen, Ilya Chugunov

机构 * Adobe Nextcam University of California, Berkeley(加州大学伯克利分校)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 提出Hist2Style,利用双边网格实现快速、边缘感知的逼真风格迁移,通过蒸馏大模型为轻量网络,并基于直方图嵌入提供可解释的用户控制。

Comments 10 pages, 8 figures. Extended results are at https://www.dekelgalor.com/hist2style

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31029 2026-06-01 cs.CV 57%

PEEK: Picking Essential frames via Efficient Knowledge distillation

PEEK: 通过高效知识蒸馏提取关键帧

Killian Steunou, Anas Filali Razzouki, Khalil Guetari, Mounîm A. El-Yacoubi, Yannis Tevissen

机构 * Télécom SudParis — SAMOVAR(Telecom SudParis — SAMOVAR) Institut Polytechnique de Paris(巴黎政治学院) Moments Lab

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

AI总结 提出PEEK方法,通过知识蒸馏将教师模型的帧相关性排名迁移至轻量级时序模型,实现高效动态帧采样,在低帧预算下显著提升视频字幕生成性能。

Comments Supplementary material at https://www.killian-steunou.com/peek/static/pdfs/peek_supplementary.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10714 2026-05-28 cs.CV cs.GR 57%

Alterbute: Editing Intrinsic Attributes of Objects in Images

Alterbute: 编辑图像中物体的内在属性

Tal Reiss, Daniel Winter, Matan Cohen, Alex Rav-Acha, Yael Pritch, Ariel Shamir, Yedid Hoshen

机构 * Google(谷歌) The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Reichman University(雷赫曼大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 提出Alterbute方法,通过扩散模型结合松弛训练目标和视觉命名实体,在保持物体身份和场景上下文的同时编辑颜色、纹理、材质和形状等内在属性。

Comments ICML 2026. Project page is available at https://talreiss.github.io/alterbute/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00814 2026-05-28 cs.CV 57%

IRPO: Boosting Image Restoration via Post-training GRPO

IRPO:通过后训练GRPO提升图像恢复

Haoxuan Xu, Yi Liu, Tianfu Li, Ruolin Shen, Boyuan Jiang, Jinlong Peng, Donghao Luo, Xiaobin Hu, Shuicheng Yan, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学) Technical University of Munich(慕尼黑技术大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) National University of Singapore(新加坡国立大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 提出IRPO框架,利用GRPO后训练优化确定性恢复模型,通过数据筛选和复合奖励建模,在域内和域外任务上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19673 2026-05-27 cs.CV 57%

InHabit: Leveraging Image Foundation Models for Scalable 3D Human Placement

InHabit: 利用图像基础模型实现可扩展的3D人体放置

Nikita Kister, Pradyumna YM, István Sárándi, Jiayi Wang, Anna Khoreva, Gerard Pons-Moll

机构 * Bosch Center of Artificial Intelligence(博世人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息学院)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 提出InHabit方法,通过渲染-生成-提升流程利用2D基础模型知识自动生成3D场景中与几何一致的人体交互数据,并构建大规模数据集InHabitants,显著提升3D人体-场景重建和接触估计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26411 2026-05-25 cs.AI 57%

MedSAE: Dissecting MedCLIP Representations with Sparse Autoencoders

MedSAE: 用稀疏自编码器剖析MedCLIP表示

Riccardo Renzulli, Colas Lepoutre, Enrico Cassano, Marco Grangetto

机构 * University of Turin(都灵大学) École polytechnique(巴黎-萨克勒高等理工学院)

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

AI总结 提出MedSAE方法,通过稀疏自编码器解析MedCLIP的潜在空间,结合相关性指标、熵分析和自动神经元命名框架,在CheXpert数据集上验证了比原始MedCLIP特征更高的单语义性和可解释性。

Comments Accepted at ICIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22645 2026-05-22 cs.AI 57%

AtelierEval: Agentic Evaluation of Humans & LLMs as Text-to-Image Prompters

AtelierEval: 人类与LLM作为文本到图像提示器的代理评估

Hanjun Luo, Zhimu Huang, Sylvia Chung, Yiran Wang, Yingbin Jin, Jialin Li, Jiang Li, Xinfeng Li, Hanan Salam

机构 * New York University Abu Dhabi(纽约大学阿布扎克校区) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出AtelierEval,首个统一基准,通过360个专家设计的任务量化提示能力,引入技能基于的记忆增强代理评估器,实现与人类专家的高相关性,验证了提示器在图像增强方向的优越性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22552 2026-05-22 cs.CV cs.MM 57%

FashionLens: Toward Versatile Fashion Image Retrieval via Task-Adaptive Learning

FashionLens:通过任务自适应学习实现多功能时尚图像检索

Haokun Wen, Xuemeng Song, Xinghao Xie, Xiaolin Chen, Xiangyu Zhao, Weili Guan

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) School of Information Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)信息科学与技术学院) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出FashionLens框架,通过任务自适应学习实现多功能时尚图像检索,解决现有方法无法处理多样检索需求的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22366 2026-05-22 cs.CV 57%

AgroTools: A Benchmark for Tool-Augmented Multimodal Agents in Agriculture

AgroTools: 一个用于农业中增强工具的多模态代理基准

Zi Ye, Yibin Wen, Xiaoya Fan, Xinyu Zhang, Jing Wu, Kun Zeng, Zurong Mai, Jiarui Zhang, Bohan Shi, Juepeng Zheng, Jianxi Huang, Yutong Lu, Haohuan Fu

机构 * Sun Yat-Sen University(中山大学) Southwest University(西南大学) Northeastern University(东北大学) National Supercomputing Center in Shenzhen(深圳国家超算中心) Southwest Jiaotong University(西南交通大学) China Agricultural University(中国农业大学) Tsinghua University(清华大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出AgroTools基准,用于评估农业中增强工具的多模态代理,通过539个问题-答案实例和1097张异构农业图像,评估模型在工具使用中的执行质量和任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01334 2026-05-22 cs.CV 57%

What Does Vision Tool-Use Reinforcement Learning Really Learn? Disentangling Tool-Induced and Intrinsic Effects for Crop-and-Zoom

视觉工具使用强化学习究竟在学习什么?解构工具诱导效应与内在效应以实现作物和缩放

Yan Ma, Weiyu Zhang, Tianle Li, Linge Du, Xuyang Shen, Pengfei Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

AI总结 本文研究了视觉工具使用强化学习在作物和缩放任务中的学习机制,通过引入MED框架解耦内在能力变化与工具诱导效应,发现改进主要由内在学习驱动,而工具使用强化学习主要减少工具诱导的负面影响,而非掌握工具。

Comments ICML 2026 camera ready. Code: https://github.com/GAIR-NLP/Med

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20700 2026-05-20 cs.CV 57%

NGL: Natural Garment Language for Training-Free Sewing Pattern Estimation

NGL:自然服装语言用于无训练缝纫图案估计

Anna Badalyan, Pratheba Selvaraju, Giorgio Becherini, Omid Taheri, Victoria Fernandez Abrevaya, Michael Black

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本研究提出NGL自然服装语言,通过利用视觉语言模型的自然描述能力,实现无训练的缝纫图案估计,解决了传统方法在泛化能力、真实世界关联性和多层服装处理上的不足。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09304 2026-05-15 cs.CV 57%

GeRM: A Generative Rendering Model From Physically Realistic to Photorealistic

GeRM:从物理真实到照片级的生成渲染模型

Jiayuan Lu, Rengan Xie, Xuancheng Jin, Zhizhen Wu, Qi Ye, Tian Xie, Hujun Bao, Rui Wang. Yuchi Huo

机构 * State Key Lab of CAD\&CG, Zhejiang University Zhejiang Lab China State Key Laboratory of Industrial Control Technology, Zhejiang University China Zhejiang University China Zhejiang Lab State Key Laboratory of Industrial Control Technology, Zhejiang University Zhejiang University

专题命中 其他VLM :visual language model(abstract);分类 cs.CV

AI总结 GeRM是首个多模态生成渲染模型,通过学习分布转移向量场实现从物理真实到照片级的过渡,结合控制网络和多代理框架提升图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10409 2026-05-12 cs.CV 57%

Progressive Photorealistic Simplification

渐进式逼真简化

Adi Rosenthal, Dana Berman, Yedid Hoshen, Ariel Shamir

机构 * Reichman University and Google(里奇曼大学和谷歌) Google Israel(谷歌以色列) Hebrew University and Google(希伯来大学和谷歌) Google(谷歌)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文提出渐进式语义图像简化框架,通过迭代去除并修补元素保持逼真外观,结合视觉-语言模型和学习验证器实现高效高质量的简化过程,应用于内容感知清理和交互编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09954 2026-05-12 cs.RO cs.CV 57%

JODA: Composable Joint Dynamics for Articulated Objects

JODA:可组合的联合动力学用于连杆物体

Tianhong Gao, Cheng Yu, Yinghao Xu, Mengyu Chu

机构 * Peking University(北京大学) Ant Group, Robbyant(蚂蚁集团,Robbyant)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 JODA通过结构化三通道场生成关节级动力学,结合视觉和语言模型推断并优化关节动力学,实现可控的连杆物体动力学建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07478 2026-05-11 cs.CV 57%

AudioFace: Language-Assisted Speech-Driven Facial Animation with Multimodal Language Models

AudioFace: 基于语言的语音驱动面部动画与多模态语言模型

Kai Zheng, Zejian Kang, Rui Mao, Hongyuan Zou, Yuanchen Fei, Xuanyang Xu, Xiangru Huang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) Tiangong University(天工大学) Hunan University(湖南大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出AudioFace框架,通过语言和发音信息指导语音驱动的面部动作生成,提升语音与面部运动的对应精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05910 2026-05-08 cs.CV 57%

Plug-and-play Class-aware Knowledge Injection for Prompt Learning with Visual-Language Model

即插即用的类感知知识注入用于具有视觉-语言模型的提示学习

Junhui Yin, Nan Pu, Xinyu Zhang, Lingfeng Yang, Lin Wu, Xiaojie Wang, Zhun Zhong

机构 * University of Science and Technology Beijing(北京科技大学) Hefei University of Technology(合肥工业大学) University of Auckland(奥克兰大学) Nanjing University of Science and Technology(南京理工大学) Swansea University(斯旺西大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文提出CAKI框架,通过类特定提示生成和查询-键提示匹配,补充现有方法中的类特定知识,提升基类和新类的性能。

Comments Accepted by International Journal of Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05241 2026-05-08 cs.RO cs.LG 57%

DexSim2Real: Foundation Model-Guided Sim-to-Real Transfer for Generalizable Dexterous Manipulation

DexSim2Real: 基于基础模型的仿真到现实迁移用于通用的灵巧操作

Zijian Zeng, Fei Ding, Huiming Yang, Xianwei Li, Yuhao Liao

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Bengbu University(Bengbu大学) UCSI University(UCSI大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

AI总结 本文提出DexSim2Real框架,结合基础模型引导的域随机化、触觉视觉交叉注意力策略和渐进技能课程,提升灵巧操作的仿真到现实迁移性能,实验表明其在现实世界中的成功率达到78.2%。

Comments 13 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01272 2026-05-05 cs.CV eess.IV 57%

GameScope: A Multi-Attribute, Multi-Codec Benchmark Dataset for Gaming Video Quality Assessment

GameScope:一个多属性、多编码器的视频游戏质量评估基准数据集

Rajesh Sureddi, Shreshth Saini, Avinab Saha, Alan C. Bovik

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

AI总结 GameScope是首个多编码器、多属性的视频游戏质量评估数据集,包含4048个视频样本,涵盖H.264、H.265和AV1等主流编码,提供细粒度质量属性,评估了多个视频质量方法,包括超越所有基准的视觉语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06061 2026-04-30 cs.LG 57%

PromptEvolver: Prompt Inversion through Evolutionary Optimization in Natural-Language Space

PromptEvolver:通过自然语言空间中的进化优化实现提示倒置

Asaf Buchnick, Aviv Shamsian, Aviv Navon, Ethan Fetaya

机构 * Bar-Ilan University(巴伊兰大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

AI总结 本文提出PromptEvolver,通过进化优化生成自然语言提示,实现高保真图像重建,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25361 2026-04-29 cs.CV 57%

HuM-Eval: A Coarse-to-Fine Framework for Human-Centric Video Evaluation

HuM-Eval: 一种以人为中心的视频评估框架

Bingzi Zhang, Kaisi Guan, Ruihua Song

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

AI总结 本文提出HuM-Eval框架,通过粗到细策略评估生成视频中的人体运动质量,实验显示其在人体相关性上达到58.2%的平均值,优于现有方法。

Comments Accepted to the 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24479 2026-04-28 cs.CV 57%

Zero-to-CAD: Agentic Synthesis of Interpretable CAD Programs at Million-Scale Without Real Data

从零到CAD:在百万级规模上无需真实数据合成可解释的CAD程序

Mohammadmehdi Ataei, Farzaneh Askari, Kamal Rahimi Malekshan, Pradeep Kumar Jayaraman

机构 * Autodesk Research(Autodesk研究院)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文提出Zero-to-CAD框架,通过代理搜索方法生成可执行的CAD构造序列,实现百万级可解释CAD程序的合成,并展示了其在多视图图像重建中的应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21061 2026-04-24 cs.AI 57%

InVitroVision: a Multi-Modal AI Model for Automated Description of Embryo Development using Natural Language

InVitroVision:一种多模态AI模型,用于通过自然语言自动描述胚胎发育

Nicklas Neu, Thomas Ebner, Jasmin Primus, Raphael Zefferer, Bernhard Schenkenfelder, Mathias Brunbauer, Florian Kromp

机构 * Software Competence Center Hagenberg GmbH(软件能力中心海根贝格有限公司) Kinderwunsch Zentrum Kepler Universitätsklinikum(儿童愿望中心凯普勒大学诊所) Wunschkind Klinik Dr. Brunbauer(愿望宝宝诊所布兰鲍尔医生)

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

AI总结 本文提出InVitroVision模型,通过微调多模态视觉语言模型,实现了对胚胎形态和发育的自然语言描述预测,展示了基础视觉语言模型在有限数据下应用于体外受精任务的潜力。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21978 2026-04-24 cs.CV 57%

PAT3D: Physics-Augmented Text-to-3D Scene Generation

PAT3D:融合物理的文本到3D场景生成

Guying Lin, Kemeng Huang, Michael Liu, Ruihan Gao, Hanke Chen, Lyuhao Chen, Beijia Lu, Taku Komura, Yuan Liu, Jun-Yan Zhu, Minchen Li

机构 * Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Genesis AI

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 PAT3D通过融合视觉-语言模型与物理模拟,生成物理合理且无交叠的3D场景,提升场景质量和物理稳定性。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13533 2026-04-23 cs.RO cs.CV 57%

Evolvable Embodied Agent for Robotic Manipulation via Long Short-Term Reflection and Optimization

可进化具身代理:通过长期短期反思与优化实现机器人操作

Jianzong Wang, Botao Zhao, Yayun He, Junqing Peng, Xulong Zhang

机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文提出EEAgent框架,通过长短期反思优化机制提升机器人在复杂任务中的适应能力,实现自我进化,优于现有方法。

Comments This work has been accepted for publication in the Proceedings of the 2026 International Joint Conference on Neural Networks (IJCNN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.14649 2026-04-23 cs.CV 57%

DetailCLIP: Injecting Image Details into CLIP's Feature Space

DetailCLIP: 将图像细节注入CLIP的特征空间

Zilun Zhang, Cuifeng Shen, Yuan Shen, Xinyu Zhou, Huixin Xiong, Tiancheng Zhao, Jianwei Yin

机构 * Zhejiang University(浙江大学) Peking University(北京大学) Megvii(科大讯飞) Om AI Research(Om人工智能研究院) Binjiang Research Institute of Zhejiang University(浙江大学滨江研究院)

专题命中 其他VLM :visual language model(abstract);分类 cs.CV

AI总结 本文提出DetailCLIP框架,通过生成高分辨率图像的单一特征表示,保留多尺度细节并共享CLIP的语义空间,提升遥感文本-图像检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19489 2026-04-22 cs.CV cs.CY 57%

Seeing Candidates at Scale: Multimodal LLMs for Visual Political Communication on Instagram

大规模识别候选人:用于推特视觉政治沟通的多模态大语言模型

Michael Achmann-Denkler, Mario Haim, Christian Wolff

机构 * Media Informatics Group University of Regensburg(媒体信息学组莱比锡大学) Department of Media and Communication Ludwig-Maximilians-Universität Munich, Germany(媒体与传播系路德维希-马克西米利安大学慕尼黑,德国)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 本文评估了专用机器学习模型和新兴多模态大语言模型在视觉政治沟通分析中的能力,展示了GPT-4o在识别领先政治人物和计数中的优越性能。

Comments An earlier version was presented at #SMSociety 2024 (London)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20867 2026-04-21 cs.SD cs.AI eess.AS 57%

Generalizable Prompt Tuning for Audio-Language Models via Semantic Expansion

通过语义扩展实现音频-语言模型的通用提示微调

Jaehyuk Jang, Wonjun Lee, Kangwook Ko, Changick Kim

机构 * KAIST(韩国科学技术院)

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

AI总结 本文提出SEPT框架,通过引入语义扩展损失提升音频-语言模型提示微调的泛化能力,增强嵌入空间语义结构,改进基到新泛化和跨数据集迁移。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13464 2026-04-21 cs.CL cs.AI 57%

Estimating Commonsense Plausibility through Semantic Shifts

通过语义转变估计常识可信度

Wanqing Cui, Wei Huang, Keping Bi, Jiafeng Guo, Xueqi Cheng

机构 * CAS Key Lab of Network Data Science and Technology, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院网络数据科学与技术重点实验室,计算技术研究所,中国科学院,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

AI总结 本文提出ComPaSS框架,通过测量在添加常识信息时的语义变化来量化常识可信度,验证了判别方法在细粒度常识评估中的优势,并展示了视觉语言模型在结合ComPaSS后的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14710 2026-04-17 cs.CV 57%

G-MIXER: Geodesic Mixup-based Implicit Semantic Expansion and Explicit Semantic Re-ranking for Zero-Shot Composed Image Retrieval

G-MIXER:基于测地混合的隐式语义扩展和显式语义重新排序用于零样本复合图像检索

Jiyoung Lim, Heejae Yang, Jee-Hyong Lee

机构 * Sungkyunkwan University(顺天大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 G-MIXER通过测地混合生成隐式语义特征并重新排序显式语义,提升零样本复合图像检索的多样性和准确性,实现跨多个基准的最优性能。

Comments CVPR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13581 2026-04-16 cs.CV 57%

SocialMirror: Reconstructing 3D Human Interaction Behaviors from Monocular Videos with Semantic and Geometric Guidance

SocialMirror: 从单目视频中利用语义和几何引导重建3D人体交互行为

Qi Xia, Peishan Cong, Ziyi Wang, Yujing Sun, Qin Sun, Xinge Zhu, Mao Ye, Ruigang Yang, Yuexin Ma

机构 * ShanghaiTech University(上海科技大学) Nanyang Technological University(南洋理工大学) Guangzhou Institute of Energy Conversion, CAS(广州能源研究所,中国科学院) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) Inceptio Technology(Inceptio科技) Shanghai Jiao Tong University(上海交通大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SocialMirror框架,通过语义和几何引导解决单目视频中人体重建的挑战,实现高精度交互行为重建,展现强大的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏