Integration of Large Vision Language Models for Efficient Post-disaster Damage Assessment and Reporting
专题命中 其他VLM :vision language model(title,abstract)
Comments 13 pages, 4 figures
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 其他VLM :vision language model(title,abstract)
Comments 13 pages, 4 figures
专题命中 其他VLM :vision-language model(title,abstract)
Comments EMNLP 2024 main conference
专题命中 其他VLM :vision language model(title,abstract)
专题命中 其他VLM :multimodal large language model(title,abstract)
Comments COLM camera-ready version. Code is released at https://github.com/hrlics/LITE
专题命中 其他VLM :vision-language model(title,abstract)
Comments 24 pages, 13 figures, submitted to Advanced Robotics Special Issue on Real-World Robot Applications of the Foundation Models
专题命中 其他VLM :visual language model(title,abstract)
专题命中 其他VLM :vision-language model(title,abstract)
Comments Taiyi-Diffusion-XL Tech Report
专题命中 其他VLM :vision-language model(title,abstract)
专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.AI、cs.LG
专题命中 其他VLM :visual language model(title);分类 cs.CV、cs.AI、cs.LG
通过偏好丰富样本挖掘和群组合并进行个性化图像美学评估
机构 * Xidian University(西安电子科技大学)
专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 研究个性化图像美学评估问题,提出基于多模态大语言模型的PRAC方法,通过偏好丰富样本挖掘和美学共鸣群组合并建模个体美学偏好,经实验验证该方法优于现有技术。
Comments The paper has been accepted by ACM MM 2026
SpatialSV: 通过任务导向的视觉监督在多模态大语言模型中内化可解释的3D空间感知
机构 * School of Intelligent Systems Engineering, Sun Yat-sen University(中山大学智能工程学院)
专题命中 其他VLM :MLLM(summary_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 提出SpatialSV框架,通过任务导向的视觉监督将MLLM的2D特征提升为显式3D表示(深度图、相机姿态、点云),实现可解释的3D空间感知内化,无需外部工具,并在半监督设置中展现强泛化能力。
Comments Accepted by IJCAI 2026
EvoIR-Agent: 通过经验驱动学习实现自进化图像修复智能体
专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出EvoIR-Agent,通过经验驱动学习解决图像修复中经验不足导致的规划失败问题,通过构建分层经验池和自进化机制提升修复性能和效率,实验表明其在全参考指标上表现优异,且在性能与效率之间取得显著平衡。
Comments Temporarily withdrawn for institutional clearance and compliance review. A revised version will be uploaded once the process is finalized
多模态视频理解中的视觉状态追踪基准测试
机构 * New York University(纽约大学) ; KAIST(韩国科学技术院)
专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 提出VSTAT基准,通过需要连续感知和整合整个视频流的问题评估多模态大语言模型的视觉状态追踪能力,发现当前模型远低于人类表现,失败主要源于视觉感知而非文本推理。
Comments Website: https://vision-x-nyu.github.io/vstat-site/
Social Caption: 评估多模态模型的社会理解能力
机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)
专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.LG
AI总结 提出基于交互理论的SOCIAL CAPTION框架,从社会推理、整体社会分析和定向社会分析三个维度评估多模态大语言模型的社会理解能力,并分析影响性能的因素。
Comments 25 pages, 10 figures
CCS:放射学报告生成的临床共识选择
机构 * School of Computing Science, University of Glasgow(格拉斯哥大学计算机科学学院) ; School of Electrical and Computer Engineering, University of Sydney(悉尼大学电气与计算机工程学院) ; Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)
专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 提出CCS框架,通过采样多个候选报告并选择临床共识最高的一个,以改进放射学报告生成在推理时的质量。
Comments 17 pages, 6 figures
用更好的检索核查事实:用于证据检索的动态对比学习
机构 * Zhengzhou University(郑州大学) ; Henan University of Science and Technology(河南科技大学)
专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI
AI总结 提出动态自适应对比学习方法DACLR,通过事件级特征提取、两阶段检索和动态对比损失优化,提升多模态证据检索的准确性。
CrossCult-KIBench:一种用于多模态大语言模型跨文化知识插入的基准测试
机构 * Hefei University of Technology(合肥工业大学) ; Key Laboratory of Ethnic Language Intelligent Analysis and Security Governance of MOE, Minzu University of China(民族语言智能分析与安全治理国家重点实验室,中央民族大学) ; School of Information Engineering, Minzu University of China(中央民族大学信息工程学院)
专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI
AI总结 本文提出CrossCult-KIBench基准测试,用于评估跨文化知识插入的有效性及非目标文化的影响,通过9800个图像场景测试不同语言文化的适应性,提出MCKI方法并揭示了当前模型在文化适应与行为保持间的平衡难题。
为精细化视频检索适应大语言模型
机构 * Visual Geometry Group, University of Oxford(牛津大学视觉几何组)
专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出一种统一嵌入模型,通过对比损失微调文本训练的多模态大语言模型,以处理视频检索中的时间、否定和多模态细微差别,实现最先进的检索性能。
Comments 38 Pages. Project page at http://bpiyush.github.io/tara-website
FriendBench:人类与多模态大语言模型的二元熟悉度推理基准
机构 * Fluid Concepts Research(流体概念研究机构)
专题命中 其他VLM :multimodal large language model(title);分类 cs.CV、cs.AI
AI总结 该研究推出FriendBench基准,通过20秒二元破冰对话片段推断两人熟悉度,对比7家公司26个模型与人类的表现,发现模型与人类准确率无统计差异但先验倾向不同,且仅人类能从可见行为中获益,同时发布了相关资源。
Comments 15 pages, 3 figures
为什么我们看那里:一种最大化场景理解的视网膜视觉语言模型表现出的人类样注视模式
机构 * Psychological & Brain Sciences, University of California, Santa Barbara(加州大学圣芭芭拉分校心理学与脑科学系) ; Electrical and Computer Engineering, University of California, Santa Barbara(加州大学圣芭芭拉分校电气与计算机工程系) ; Computer Science, University of California, Santa Barbara(加州大学圣芭芭拉分校计算机科学系)
专题命中 其他VLM :visual language model(title);分类 cs.CV、cs.AI
AI总结 研究探讨了人类自由观看时注视模式的形成机制,发现最大化场景理解的视网膜视觉语言模型能够产生类似人类的注视模式,表明这种模式可能是优化场景理解的副产品。
机构 * Stanford University, Department of Computer Science, Stanford, CA, USA(斯坦福大学计算机科学系) ; Stanford University, Department of Biomedical Data Science, Stanford, CA, USA(斯坦福大学生物医学数据科学系) ; Stanford University, Stanford Institute for Human-Centered Artificial Intelligence, Stanford, CA, USA(斯坦福大学人类中心人工智能研究所) ; Stanford University, School of Medicine, Department of Dermatology, Stanford, CA, USA(斯坦福大学医学院皮肤科系) ; Stanford University, Department of Radiology, Stanford, CA, USA(斯坦福大学放射科)
专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.AI
机构 * Sun Yat-sen University(中山大学) ; Nanyang Technological University(南洋理工大学) ; Desay SV Automotive Co., Ltd(德赛西威汽车有限公司) ; Pazhou Laboratory(琶洲实验室)
专题命中 其他VLM :multimodal large language model(title);分类 cs.CV、cs.AI
Comments Accepted at ACM MM 2025 Grand Challenge
机构 * Google DeepMind(谷歌DeepMind) ; EPFL(苏黎世联邦理工学院)
专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.AI
Comments Accepted by Transactions on Machine Learning Research
专题命中 其他VLM :vision language model(title);分类 cs.CV、cs.AI
专题命中 其他VLM :MLLM(title);分类 cs.CV、cs.AI
Comments CVPR 2025
专题命中 其他VLM :visual language model(title);分类 cs.CV、cs.AI
Comments 11 pages, 5 figures, 2 tables. Oral presentation at KES-InMed 2024 held in Madeira, Portugal
专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.AI
Comments Accepted at WACV, 2025
专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.AI
Comments 2023 Joint international Scientific conferences on AI and Machine Learning (BNAIC-BeNeLearn)
专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.LG
Comments 30 pages, 3 tables, 3 figures