PRPO: Paragraph-level Policy Optimization for Vision-Language Deepfake Detection
PRPO:用于视觉-语言深度伪造检测的段级策略优化
Tuan Nguyen, Naseem Khan, Khang Tran, NhatHai Phan, Issa Khalil
机构
*
Qatar Computing Research Institute, Hamad Bin Khalifa University, Doha, Qatar(卡塔尔计算研究所,哈马德·本·哈利法大学,多哈)
;
New Jersey Institute of Technology, NJ, USA(新泽西理工学院)
Fine-tuning a vision-language model for fracture-surface morphology recognition
对骨折表面形貌识别进行视觉-语言模型的微调
Quanliang Liu, Jungtaek Kim, Kangwook Lee, Hyunseok Oh
机构
*
Department of Materials Science & Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校材料科学与工程系)
;
Department of Electrical & Computer Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校电气与计算机工程系)
;
KRAFTON
;
Ludo Robotics
机构
*
School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院)
;
School of Computer Science and Technology and the State Key Laboratory of Advanced Rail Autonomous Operation, Beijing Jiaotong University(北京交通大学计算机科学与技术学院和先进轨道交通自主运行国家重点实验室)
;
School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)
;
School of Mechanical Engineering, Guizhou University(贵州大学机械工程学院)
Can Vision-Language Models Think from the Sky? Unifying UAV Reasoning and Generation
无人机视角下视觉语言模型能否思考?统一无人机推理与生成
Jintao Sun, Gangyi Ding, Donglin Di, Hu Zhang, Zhedong Zheng
机构
*
Beijing Institute of Technology(北京理工大学)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
CSIRO Data61(澳大利亚联邦科学与工业研究组织 Data61 分部)
;
University of Macau(澳门大学)
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
RosettaSearch: Multi-Objective Inference-Time Search for Protein Sequence Design
RosettaSearch:蛋白质序列设计的多目标推理时间搜索
Meghana Kshirsagar, Allen Nie, Ching-An Cheng, Fanglei Xue, Rahul Dodhia, Juan Lavista Ferres, Kevin K. Yang, Frank DiMaio
机构
*
AI for Good, Microsoft Redmond(微软红mond AI for Good)
;
Google DeepMind(谷歌DeepMind)
;
Google Research(谷歌研究)
;
Institute for Protein Design University of Washington(蛋白质设计研究所华盛顿大学)
;
Microsoft Research New England(微软新英格兰研究)
;
Department of Biochemistry Institute for Protein Design University of Washington(生物化学系蛋白质设计研究所华盛顿大学)
QCalEval: Benchmarking Vision-Language Models for Quantum Calibration Plot Understanding
QCalEval:用于量子校准图理解的视觉-语言模型基准测试
Shuxiang Cao, Zijian Zhang, Abhishek Agarwal, Grace Bratrud, Niyaz R. Beysengulov, Daniel C. Cole, Alejandro Gómez Frieiro, Elena O. Glen, Hao Hsu, Gang Huang, Raymond Jow, Greshma Shaji, Tom Lubowe, Ligeng Zhu, Luis Mantilla Calderón, Nicola Pancotti, Joel Pendleton, Brandon Severin, Charles Etienne Staub, Sara Sussman, Antti Vepsäläinen, Neel Rajeshbhai Vora, Yilun Xu, Varinia Bernales, Daniel Bowring, Elica Kyoseva, Ivan Rungger, Giulia Semeghini, Sam Stanwyck, Timothy Costa, Alán Aspuru-Guzik, Krysta Svore
机构
*
NVIDIA
;
University of Toronto(多伦多大学)
;
IQM Quantum Computers(IQM量子计算机)
;
Lawrence Berkeley National Laboratory(伯克利国家实验室)
;
Conductor Quantum(Conductor量子)
;
National Physical Laboratory(国家物理实验室)
;
Infleqtion
;
Harvard University(哈佛大学)
;
Fermi National Accelerator Laboratory(费米国家加速器实验室)
;
Northwestern University(西北大学)
;
EeroQ Corporation(EeroQ公司)
;
Royal Holloway University of London(伦敦皇家霍洛威大学)
;
Vector Institute for Artificial Intelligence(人工智能向量研究所)
SnapGuard: Lightweight Prompt Injection Detection for Screenshot-Based Web Agents
SnapGuard: 基于截图的轻量级提示注入检测方法
Mengyao Du, Han Fang, Haokai Ma, Jiahao Chen, Kai Xu, Quanjun Yin, Ee-Chien Chang
机构
*
National University of Defense Technology(国防科技大学)
;
University of Science and Technology of China(中国科学技术大学)
;
National University of Singapore(新加坡国立大学)
;
Zhejiang University(浙江大学)
Probing CLIP's Comprehension of 360-Degree Textual and Visual Semantics
探测CLIP对360度文本和视觉语义的理解
Hai Wang, Xiaochen Yang, Mingzhi Dong, Jing-Hao Xue
机构
*
Department of Statistical Science, University College London, UK(伦敦大学统计科学系)
;
School of Mathematics and Statistics, University of Glasgow, UK(格拉斯哥大学数学与统计学学院)
;
Department of Computer Science, University of Bath, UK(巴斯大学计算机科学系)
机构
*
School of Biomedical Engineering, Tsinghua University(清华大学生物医学工程学院)
;
Department of Radiology, Mianyang Central Hospital(绵阳市中心医院放射科)
;
Center for Biomedical Imaging Research, Tsinghua University(清华大学生物医学成像研究中心)
Test-Time Perturbation Learning with Delayed Feedback for Vision-Language-Action Models
基于延迟反馈的测试时扰动学习用于视觉-语言-动作模型
Zehua Zang, Xi Wang, Fuchun Sun, Xiao Xu, Lixiang Lium, Jiahuan Zhou, Jiangmeng Li
机构
*
Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Tsinghua University(清华大学)
;
Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所)
;
National Defense University(国防大学)