Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model
人工智能生成的以人为中心的视频的多维质量评估:数据集与模型
Sijing Wu, Yunhao Li, Huiyu Duan, Yucheng Zhu, Xiongkuo Min, Patrick Le Callet, Guangtao Zhai
机构
*
Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所)
;
USC-SJTU Institute of Cultural and Creative Industry, Shanghai Jiao Tong University(上海交通大学南加州大学文化创意产业学院)
;
Polytech Nantes, Université de Nantes(法国南特大学高等理工学院)
专题命中
视觉问答
:MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment
回答前看清楚:通过显著性驱动的感知重新对齐减轻LVLMs中的幻觉
Pengxu Chen, Yao Zhu, Guangming Zhu, Jun Sheng, Jincai Huang, Xiangyang Ji, Liang Zhang
机构
*
Xidian University(西安电子科技大学)
;
Tsinghua University(清华大学)
;
Shanghai Road Transport Development Center(上海市道路运输发展中心)
;
Hunan Institute of Advanced Technology(湖南先进技术研究院)
Orientation Reading by Production Vision-Language Models on Optotype Charts: A Controlled Multi-Model Evaluation Across Reasoning Modes, Prompts, and Access Modalities
机构
*
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
;
Great Bay University(大湾区大学)
;
Dongguan Key Laboratory for Intelligence and Information Technology(东莞市智能信息技术重点实验室)
专题命中
视觉推理
:grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
机构
*
School of Intelligent Science and Technology, Nanjing University(南京大学智能科学与技术学院)
;
School of Computer Science, Peking University(北京大学计算机科学学院)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV
Art Beyond Semantics: Sheaf-Informed Contrastive Learning for Multi-Relational Representations
超越语义的艺术:用于多关系表示的层状信息对比学习
Ludovica Schaerf, Antonio Purificato, Piera Riccio, Fabrizio Silvestri, Noa Garcia
机构
*
University of Zurich(苏黎世大学)
;
Max Planck Institute Bibliotheca Hertziana(马克斯·普朗克赫兹iana图书馆研究所)
;
Sapienza University of Rome(罗马第一大学)
;
Amazon(亚马逊)
;
University of Amsterdam(阿姆斯特丹大学)
;
The University of Osaka(大阪大学)
Autonomous VR-Based Risk Detection for Situational Awareness in Dangerous Settings
基于自主虚拟现实的危险环境态势感知风险检测
Mohammad Eskandari, Murali Krishna Varma Indukuri, Stephanie M. Lukin, Cynthia Matuszek
机构
*
Interactive Robotics and Language Lab, University of Maryland Baltimore County(马里兰大学巴尔的摩县分校交互式机器人与语言实验室)
;
DEVCOM Army Research Laboratory(陆军研究实验室)
专题命中
视觉定位与Grounding
:VLM(summary_cn,abstract);vision language model(abstract);分类 cs.CV、cs.AI
Simple Domain Generalization for Strong Pixel-Level Image Tampering Detection in Modern VLMs
现代视觉语言模型中用于强像素级图像篡改检测的简单域泛化
Yi Tang, Xinyi Shang, Jiacheng Cui, Sondos Mahmoud Bsharat, Jiacheng Liu, Xiaohan Zhao, Tran Dinh Tien, Ahmed Elhagry, Salwa K. Al Khatib, Tianjun Yao, Yonina C. Eldar, Jing-Hao Xue, Hao Li, Salman Khan, Zhiqiang Shen
机构
*
Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
;
University College London(伦敦大学学院)
;
Weizmann Institute of Science(魏茨曼科学研究所)
Memory-Supported Synergistic Adaptation for Training-Free Test-Time Medical Image Segmentation
用于无训练测试时医学图像分割的内存支持协同适应
Lingrui Li, Nan Pu, Dong Zhao, Wenjing Li, Andrew P French, Zhun Zhong, Xin Chen
机构
*
School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院)
;
School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院)
;
Information Systems Technology and Design Pillar, Singapore University of Technology and Design(新加坡科技设计大学信息系统技术与设计支柱)