What Limits Virtual Agent Application? OmniBench: A Scalable Multi-Dimensional Benchmark for Essential Virtual Agent Capabilities
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Accepted by ICML 2025 (Oral)
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Accepted by ICML 2025 (Oral)
机构 * The University of Hong Kong(香港大学) ; ARC Lab, Tencent PCG(腾讯PCG ARC实验室)
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Project released at: https://qiulu66.github.io/animeshooter/
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) ; Sensetime Research(商汤科技研究院) ; Tongji University(同济大学) ; Beijing Institute of Technology(北京理工大学) ; Shanghai AI Lab(上海人工智能实验室)
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Project Page: https://github.com/MCG-NJU/SORCE
机构 * The University of Hong Kong(香港大学) ; Fudan University(复旦大学) ; Shanghai Jiao Tong University(上海交通大学) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments ICML'25, 305 pages, 115 tables, 177 figures, project page: https://generalist.top/
机构 * CVLAB, University of Bologna(CV实验室,博洛尼亚大学)
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Under submission. Project page at https://andreamaduzzi.github.io/llana/
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Accepted to CVPR 2025. Code and demo available at https://magic-quill.github.io
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Accepted by CVPR2025
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments ICLR 2025
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 其他VLM :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Accepted by ICASSP 2025
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Under review. Project page: https://andreamaduzzi.github.io/llana/
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments NeurIPS 2024 Spotlight
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Our models, codes and datasets are released in https://github.com/TencentARC/SEED-Story
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Technical Report; Dataset released in https://huggingface.co/datasets/AILab-CVC/SEED-Data-Edit
专题命中 其他VLM :vision language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Accepted at CLVL: 5th Workshop On Closing The Loop Between Vision And Language (ICCV 2023 Workshop)
VizPilot:基于多模态大语言模型的SVG复合可视化自动引导系统
专题命中 其他VLM :multimodal large language model(abstract,abstract_cn)
AI总结 VizPilot是基于多模态大语言模型的SVG复合可视化自动引导工具,通过双模块实现自动生成交互式引导,经评估可降低创作工作量并减轻用户认知负荷,提升复合可视化可用性。
Comments Accepted by IEEE VIS 2026
NTNU系统在S&I挑战2025 SLA开放赛道中的表现
机构 * National Taiwan Normal University(国立台湾师范大学) ; Department of Computer Science and Information Engineering(计算机科学与信息工程系) ; Institute of AI Interdisciplinary Applied Technology(人工智能跨学科应用技术研究所)
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract)
AI总结 本文提出整合W2V与Phi-4多模态大语言模型的系统,通过分数融合策略提升SLA评估性能,在Speak & Improve Challenge 2025中取得第二名,RMSE为0.375。
Comments submitted to the ISCA SLaTE-2025 Workshop
面向视觉-语言场景的迭代自过滤数据选择
机构 * Mila, Université de Montréal(蒙特利尔大学Mila实验室)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出一种自举式方法,通过迭代训练CLIP模型并自选择改进的数据混合,无需额外数据或预训练模型即可提升下游性能。
VCIFBench:评估视频理解中的复杂指令遵循能力
机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) ; Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University(知识驱动人机智能工程研究中心,吉林大学) ; International Center of Future Science, Jilin University(未来科学国际中心,吉林大学)
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract_cn)
AI总结 提出VCIFBench基准,通过混合验证流水线评估多模态大模型在视频理解中遵循内容、格式、风格和结构约束的复杂指令能力,实验表明联合约束满足仍具挑战,DPO训练可提升性能。
基于模式的思考:通过模式诱导突破视觉规划中的感知瓶颈
机构 * State Key Lab of CAD& CG(CAD与CG国家重点实验室)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出通过模式诱导的方法,利用模式推理和模式诱导策略,使视觉语言模型在视觉规划任务中实现更高效和准确的感知与推理,解决传统模型在复杂输入下的感知瓶颈问题。