How Do VLMs Behave When Blind or Misled? Behavioral Evaluation of VLMs on Scientific Figures
视觉语言模型(VLMs)在失明或被误导时的表现如何?针对科学图表的VLMs行为评估
Paul Osemudiame Oamen, Owusu-Banahene Osei, Ananya Mukherjee, Christian Greisinger, Steffen Eger, Pius Onobhayedo, Wei Zhao
机构
*
University of Aberdeen(阿伯丁大学)
;
International Institute of Information Technology Hyderabad(海德拉巴国际信息技术学院)
;
University of Technology Nuremberg(纽伦堡工业大学)
;
University of Southern California(南加利福尼亚大学)
StrAD: A Streaming Method and Benchmark for Audio Description Generation for Long-form Videos
StrAD:面向长视频音频描述生成的流式方法与基准
Julian Spravil, Sebastian Houben, Sven Behnke
机构
*
Fraunhofer IAIS(弗劳恩霍夫智能分析与信息系统研究所)
;
University of Bonn(波恩大学)
;
University of Applied Sciences Bonn-Rhein-Sieg(波恩-莱茵-锡格应用科学大学)
;
Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所)
;
Center for Robotics, University of Bonn(波恩大学机器人中心)