DocVAL: Validated Chain-of-Thought Distillation for Grounded Document VQA
DocVAL:用于基于文档的视觉问答的验证链式思维蒸馏
Pinaki Prasad Guha Neogi, Ahmad Mohammadshirazi, Ser-Nam Lim, Rajiv Ramnath
机构
*
Department of Computer Science(计算机科学系)
;
Engineering, Ohio State University, Ohio, US(工程系,俄亥俄州立大学,俄亥俄,美国)
;
Department of Computer Science, University of Central Florida, Florida, US(计算机科学系,中央佛罗里达大学,佛罗里达,美国)
机构
*
The Hong Kong University of Science and Technology(香港科学与技术大学)
;
Tencent(腾讯)
;
Tsinghua University(清华大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Beijing Film Academy(北京电影学院)
;
Stanford University(斯坦福大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Singapore Institute of Technology(新加坡理工学院)
DDX-TRACE: A Benchmark for Medical Diagnostic Trajectories in VLMs
DDX-TRACE: 视觉语言模型中医学诊断轨迹的基准
Jiazhen Pan, Weixiang Shen, Jun Li, Julian Canisius, Felix Bitzer, Paula Roßmüller, Jiancheng Yang, Virginie Kreutzinger, Daniel Rueckert, Benedikt Wiestler
机构
*
Technical University of Munich(慕尼黑技术大学)
;
TUM University Hospital(TUM大学医院)
;
Munich Center for Machine Learning(慕尼黑机器学习中心)
;
LMU Munich(慕尼黑大学)
;
Aalto University(阿尔托大学)
;
Imperial College London(伦敦帝国学院)
A Proactive Multi-Agent Dialogue Framework for Assessing Social Language Disorder Traits in Autism
一种主动式多智能体对话框架用于评估自闭症中的社交语言障碍特征
Chuanbo Hu, Minglei Yin, Bin Liu, Wenqi Li, Lynn K. Paul, Shuo Wang, Xin Li
机构
*
Department of Computer Science(计算机科学系)
;
University at Albany(阿尔巴尼大学)
;
Department of Management Information System(管理信息系统系)
;
West Virginia University(西弗吉尼亚大学)
;
Department of Radiology(放射学系)
;
Washington University in St. Louis(圣路易斯华盛顿大学)
;
Humanities and Social Sciences(人文学与社会科学)
GT-HarmBench: Benchmarking AI Safety Risks Through the Lens of Game Theory
GT-HarmBench:通过博弈论视角评估AI安全风险
Pepijn Cobben, Xuanqiang Angelo Huang, Thao Amelia Pham, Isabel Dahlgren, Terry Jingchen Zhang, Zhijing Jin
机构
*
ETH Zürich(苏黎世联邦理工学院)
;
Berea College(贝雷学院)
;
University of Toronto(多伦多大学)
;
Vector Institute(向量研究所)
;
Max Planck Institute for Intelligent Systems, Tübingen, Germany(图宾根德国智能系统马克斯·普朗克研究所)
Learnability-Informed Fine-Tuning of Diffusion Language Models
扩散语言模型的可学习性感知微调
Shubham Parashar, Atharv Chagi, Jacob Helwig, Lakshmi Jotsna, Sushil Vemuri, James Caverlee, Dileep Kalathil, Shuiwang Ji
机构
*
Department of Computer Science and Engineering, Texas A\&M University, College Station, TX, USA(计算机科学与工程系,德克萨斯A&M大学,College Station, TX, USA)
;
Department of Electrical and Computer Engineering, Texas A\&M University, College Station, TX, USA(电气与计算机工程系,德克萨斯A&M大学,College Station, TX, USA)
IyàwóBench: A Benchmark for Evaluating Large Language Model Clinical Triage Accuracy on Undifferentiated Febrile Illness in Nigerian Primary Health Settings
机构
*
The University of Queensland(昆士兰大学)
;
Stanford University(斯坦福大学)
;
The Australian National University(澳大利亚国立大学)
;
Zhejiang University(浙江大学)
;
Murdoch University(莫纳什大学)
;
The University of Adelaide(阿德莱德大学)