SPARC-Rad: A Multimodal Benchmark Dataset and Evaluation Pipeline for Spatial and Anatomical Reasoning in Radiology Vision-Language Models
SPARC-Rad:面向放射学视觉语言模型的空间与解剖推理多模态基准数据集及评估流程
Satvik Tripathi, Mustafa Ege Seker, Kristian Quevada, Ebubechukwu D Enwerem, Pratham Khandelwal, Emine Meltem, Bera Koca, Shahriar Faghani, Jacinta Arnold, Dania Daye, Tessa S. Cook
机构
*
Pfizer(辉瑞公司)
;
University of California San Diego(加利福尼亚大学圣地亚哥分校)
;
Institute for Medical Philosophy and Future Artificial Intelligence(医学哲学与未来人工智能研究所)
;
Tongji University(同济大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Institute of Humanities and Social Science Data, Fudan University(复旦大学人文社会科学数据研究所)
专题命中
评测与基准
:language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI
机构
*
Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心)
;
Department of Computer Science and Technology, Institute for AI(计算机科学与技术系,人工智能研究院)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
Adversarial Diffusion Across Modalities: A Fusion Survey of Attacks, Defenses, and Evaluation for Text, Vision, and Vision-Language Models
跨模态对抗扩散:文本、视觉与视觉-语言模型的攻击、防御与评估融合综述
Abrar Alotaibi, Moataz Ahmed
机构
*
Information and Computer Science Department, King Fahd University of Petroleum & Minerals(国王法赫德石油矿物大学信息与计算机科学系)
;
College of Computer Science and Information Technology, Imam Abdulrahman Bin Faisal University(伊玛目阿卜杜勒拉赫曼·本·法伊塞尔大学计算机科学与信息科技学院)
;
SDAIA-KFUPM Joint Research Center for Artificial Intelligence, King Fahd University of Petroleum & Minerals(SDAIA-KFUPM人工智能联合研究中心,国王法赫德石油矿物大学)
专题命中
评测与基准
:language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL
Quantifying and Auditing LLM Evaluation via Positive--Unlabeled Learning
通过正-无标签学习量化与审计大语言模型评估
Zilong Zhang, Yi-Ting Hung, Lei Ding, Chi-Kuang Yeh
机构
*
Department of Mathematics and Statistics(数学与统计学系)
;
Georgia State University(佐治亚州立大学)
;
Department of Statistics(统计学系)
;
University of Manitoba(曼尼托巴大学)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
SEAGym: An Evaluation Environment for Self-Evolving LLM Agents
SEAGym: 自我进化LLM智能体的评估环境
Congjie Zheng, Chuanyi Xue, Bin Liang, Jun Yang, Changshui Zhang
机构
*
Department of Automation, Tsinghua University(清华大学自动化系)
;
Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University(北京信息科学与技术国家研究中心(BNRist),清华大学)
机构
*
School of Computer Science, Chongqing University(重庆大学计算机学院)
;
AI Research Institution, Mashang Financial Institution(马上金融人工智能研究院)
;
Department of Information, Third Military Medical University(陆军军医大学信息系)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI