Enhancing Zero-shot Commonsense Reasoning by Integrating Visual Knowledge via Machine Imagination
通过机器想象力整合视觉知识以增强零样本常识推理
Hyuntae Park, Yeachan Kim, SangKeun Lee
机构
*
Department of Artificial Intelligence, Korea University(人工智能系,韩国大学)
;
Department of Computer Science and Engineering, Korea University(计算机科学与工程系,韩国大学)
Jonathan D. Chang, Andrew Drozdov, Shubham Toshniwal, Owen Oertell, Alexander Trott, Jacob Portes, Abhay Gupta, Pallavi Koppol, Ashutosh Baheti, Sean Kulinski, Ivan Zhou, Irene Dea, Krista Opsahl-Ong, Simon Favreau-Lessard, Sean Owen, Jose Javier Gonzalez Ortiz, Arnav Singhvi, Xabi Andrade, Cindy Wang, Kartik Sreenivasan, Sam Havens, Jialu Liu, Peyton DeNiro, Wen Sun, Michael Bendersky, Jonathan Frankle
Evaluating GPT-5 as a Multimodal Clinical Reasoner: A Landscape Commentary
评估GPT-5作为多模态临床推理者的有效性:领域评论
Alexandru Florea, Shansong Wang, Mingzhe Hu, Qiang Li, Zach Eidex, Luke del Balzo, Mojtaba Safari, Xiaofeng Yang
机构
*
Department of Radiation Oncology, Winship Cancer Institute, Emory University School of Medicine(放射肿瘤科,Winship癌症研究所,埃默里大学医学院)
;
Department of Biomedical Engineering, Georgia Institute of Technology(生物医学工程系,佐治亚理工学院)
MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers
MCP-SafetyBench:一种用于评估大型语言模型在真实MCP服务器安全性的大规模基准
Xuanjun Zong, Zhiqi Shen, Lei Wang, Yunshi Lan, Chao Yang
机构
*
East China Normal University(东华师范大学)
;
Salesforce AI Research(Salesforce人工智能研究)
;
Singapore Management University(新加坡国立大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
Conversational Speech Reveals Structural Robustness Failures in SpeechLLM Backbones
会话语音揭示了SpeechLLM骨干结构鲁棒性失效
Maria Teleki, Sai Janjur, Haoran Liu, Oliver Grabner, Ketan Verma, Thomas Docog, Xiangjue Dong, Lingfeng Shi, Cong Wang, Stephanie Birkelbach, Jason Kim, Yin Zhang, Éva Székely, James Caverlee
机构
*
Texas A&M University(德克萨斯大学)
;
KTH Royal Institute of Technology(皇家理工学院)
机构
*
School of Cyber Science and Engineering, Nanjing University of Science and Technology(南京理工大学信息科学与工程学院)
;
School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)
;
Department of Neurology, China-Japan Union Hospital of Jilin University(吉林大学中日联谊医院神经内科)
;
Department of Anesthesiology, China-Japan Union Hospital of Jilin University(吉林大学中日联谊医院麻醉科)
;
School of Computing, Macquarie University(麦考瑞大学计算机学院)
EchoMind: An Interrelated Multi-level Benchmark for Evaluating Empathetic Speech Language Models
EchoMind: 一种相互关联的多级基准,用于评估共情语音语言模型
Li Zhou, Lutong Yu, You Lyu, Yihang Lin, Zefeng Zhao, Junyi Ao, Yuhao Zhang, Benyou Wang, Haizhou Li
机构
*
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
Shenzhen Research Institute of Big Data(深圳大数据研究院)
;
Shenzhen Loop Area Institute(深圳河套学院)
GhostEI-Bench: Do Mobile Agents Resilience to Environmental Injection in Dynamic On-Device Environments?
GhostEI-Bench: 移动代理在动态设备环境中的环境注入鲁棒性研究
Chiyu Chen, Xinhao Song, Yunkai Chai, Yang Yao, Haodong Zhao, Lijun Li, Jie Li, Yan Teng, Gongshen Liu, Yingchun Wang
机构
*
Shanghai Jiao Tong University, School of Computer Science(上海交通大学计算机科学学院)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
The University of Hong Kong(香港大学)