Improving Diversity in Zero-Shot GAN Adaptation with Semantic Variations
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
Comments Accepted to ICCV 2023 (poster)
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
Comments Accepted to ICCV 2023 (poster)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
Comments WASPAA 2023. Project page: https://juliawilkins.github.io/sound-effects-retrieval-from-video/. 4 pages, 2 figures, 2 tables
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
Comments Proceedings of the IEEE/CVF International Conference on Computer Vision 2023
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
Comments ICCV 2023
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
Comments Accepted by ACM MM 2023
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV
Comments Technical Report; Project released at: https://github.com/AILab-CVC/SEED-Bench
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition 2023
专题命中 其他VLM :vision-language model(abstract);分类 cs.AI
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
Comments T4V Workshop
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
Comments Accepted to CVPR 2023
专题命中 其他VLM :vision-language model(abstract);分类 cs.LG
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
Comments EMNLP 2022
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
Comments 22 pages, 14 figures, 2 tables, fixed figure 3
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
Comments Preprint
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
Comments arXiv admin note: text overlap with arXiv:2201.11307
Journal ref WACV2023
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
Comments cvpr2022
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
Comments Under Submission
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
Comments SIGGRAPH 2022; Project Page https://hongfz16.github.io/projects/AvatarCLIP.html Codes available at https://github.com/hongfz16/AvatarCLIP
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
Comments ECCV 2020 accepted spotlight paper
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
为房间脉冲响应生成适应文本到音频模型
专题命中 其他VLM :vision-language model(abstract)
AI总结 本文提出利用预训练文本到音频模型生成房间脉冲响应,通过视觉语言模型提取声学描述解决数据稀缺问题,验证大规模生成音频先验在该任务中的有效性。
Comments Accepted to IWAENC 2026
VizRAG:通过超图可视化增强检索增强生成
机构 * Southern University of Science and Technology(南方科技大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Huawei Research(华为研究院) ; Beihang University(北京航空航天大学)
专题命中 其他VLM :multimodal large language model(abstract)
AI总结 研究旨在增强检索增强生成,核心方法是通过视觉线索将超图感知整合到RAG系统中,引入VizRAG支持视觉超图结构感知,实验证明该方法显著优于基线,验证了超图可视化用于RAG系统的潜力。
B-repLer:CAD模型的语言引导编辑
专题命中 其他VLM :multimodal large language model(abstract)
AI总结 研究语言引导的CAD编辑问题,提出B-repLer框架直接连接自然语言与CAD模型编辑,绕过构建历史,还引入数据集,展示其自动生成等方法,能对复杂CAD形状准确执行复杂编辑。
Comments Accepted by SIGGRAPH 2026; Project page at https://yilinliu77.github.io/brepler.github.io Code at https://github.com/yilinliu77/Brepler
你如何通过提问来获取信息:审核TikTok搜索中的乳腺癌错误信息
专题命中 其他VLM :vision-language model(abstract)
AI总结 研究TikTok搜索中用户查询框架对乳腺癌错误信息曝光的影响,通过受控实验发现查询框架与错误信息曝光紧密相关,替代医学查询错误信息返回率高,医学信息查询也有错误信息,强调审核查询驱动搜索系统的重要性。
突破15%的障碍:一个由用户非语言线索触发的、用于主动社交机器人的真实世界数据驱动系统
机构 * Kyushu Institute of Technology(九州工业大学) ; CyberAgent(CyberAgent公司) ; The University of Osaka(大阪大学)
专题命中 其他VLM :vision-language model(abstract)
AI总结 研究零售商店中服务机器人交互,发现非语言行为触发机器人话语占比15.3%。通过分析客户行为定义非语言线索,开发识别器和对话框架,能基于非语言线索实现主动机器人响应,还进行了离线评估和展示在线原型。
Comments 8 pages, accepted as a conference paper for IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS2026)