DeepTumorVQA: A Hierarchical 3D CT Benchmark for Stage-Wise Evaluation of Medical VLMs and Tool-Augmented Agents
DeepTumorVQA: 一种分层的3D CT基准,用于分阶段评估医学视觉语言模型和工具增强代理
Yixiong Chen, Wenjie Xiao, Pedro R. A. S. Bassi, Boyan Wang, Liang He, Xinze Zhou, Sezgin Er, Ibrahim Ethem Hamamci, Zongwei Zhou, Alan Yuille
机构
*
Johns Hopkins University(约翰霍普金斯大学)
;
University of Bologna(博洛尼亚大学)
;
Istanbul Medipol University(伊斯坦布尔梅迪波尔大学)
;
Center for Biomolecular Nanotechnologies, Istituto Italiano di Tecnologia(生物分子纳米技术中心,意大利技术研究院)
;
The First Affiliated Hospital, Sun Yat-Sen University(中山大学第一附属医院)
;
Tongji University(同济大学)
PDEAgent-Bench: A Multi-Metric, Multi-Library Benchmark for PDE Solver Generation
PDEAgent-Bench: 一个多指标、多库的PDE求解器生成基准
Zhen Hang, Yushan Yashengjiang, Junhui Li, Huanshuo Dong, Yang Wei, Zhezheng Hao, Jiangtao Ma, Songlin Bai, Haozhong Kai, Xihang Yue, Gangzong Si, Dongming Jiang, Chao Yao, Zhanhua Hu, Jiangqing Zhang, Pengwei Liu, Yaomin Shen, Xingyu Ren, Lei Liu, Zikang Xu, Han Li, Qingsong Yao, Hande Dong, Hong Wang
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Tencent(腾讯)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Zhejiang University(浙江大学)
;
National University of Singapore(新加坡国立大学)
;
Tsinghua University(清华大学)
;
University of Texas at Dallas(德克萨斯大学达拉斯分校)
;
Arizona State University(亚利桑那州立大学)
;
Rice University(里士满大学)
;
Technical University of Munich(慕尼黑技术大学)
;
Stanford University(斯坦福大学)
;
Alibaba Group(阿里巴巴集团)
SEMASIA: A Large-Scale Dataset of Semantically Structured Latent Representations
SEMASIA:一个大规模的语义结构化潜在表示数据集
Mario Edoardo Pandolfo, Enrico Grimaldi, Lorenzo Marinucci, Leonardo Di Nino, Simone Fiorellino, Sergio Barbarossa, Paolo Di Lorenzo
机构
*
Dept. Computer, Control and Management Engineering(计算机、控制与管理工程系)
;
Sapienza University of Rome(罗马大学西皮恩扎分校)
;
National Inter-University Consortium for Telecommunications (CNIT)(电信全国大学联合体(CNIT))
;
Dept. of Statistical Sciences(统计科学系)
;
Dept. of Information Engineering, Electronics, and Telecommunications(信息工程、电子与电信系)
Neuroprobe: Evaluating Intracranial Brain Responses to Naturalistic Stimuli
Neuroprobe:评估自然刺激下的颅内脑响应
Andrii Zahorodnii, Christopher Wang, Geeling Chau, Bennett Stankovits, Charikleia Moraitaki, Eli Gross, Alexander Brady, Andrei Barbu, Boris Katz, Ila R Fiete
机构
*
MIT CSAIL, CBMM(MIT CSAIL,CBMM)
;
MIT McGovern Institute(MIT McGovern研究所)
;
Caltech(加州理工学院)
;
Columbia University(哥伦比亚大学)
;
ETH Zurich(苏黎世联邦理工学院)
A Benchmark for Evaluating Outcome-Driven Constraint Violations in Autonomous AI Agents
一个评估自主AI代理结果驱动约束违反的基准
Miles Q. Li, Benjamin C. M. Fung, Martin Weiss, Pulei Xiong, Khalil Al-Hussaeni, Claude Fachkha
机构
*
McGill University(麦吉尔大学)
;
Tiptree Advanced Systems Corporation(蒂普里高级系统公司)
;
Polytechnique Montréal(蒙特利尔理工学院)
;
National Research Council Canada(加拿大国家研究委员会)
;
Rochester Institute of Technology(罗切斯特理工学院)
;
University of Dubai(迪拜大学)
A Paired Point-of-Care Ultrasound Dataset for Image Quality Enhancement and Benchmarking via a cGAN Baseline
一种配对的点即护理超声数据集用于通过cGAN基线的图像质量增强和基准测试
Lennard M. van Karnenbeek, Hilde G. A. van der Pol, Mark Wijkhuizen, Eva Poelman, Caroline A. Drukker, Theo Ruers, Freija Geldof, Behdad Dashtbozorg
机构
*
Department of Nanobiophysics, Faculty of Science and Technology, University of Twente(特文特大学科学与技术学院生物医学系)
;
Image-Guided Surgery, Department of Surgery, Netherlands Cancer Institute(荷兰癌症研究所手术引导外科部)
;
Netherlands Cancer Institute(荷兰癌症研究所)
;
Center for Early Cancer Detection, Netherlands Cancer Institute(荷兰癌症研究所早期癌症检测中心)
WATCH: Wide-Area Archaeological Site Tracking for Change Detection
WATCH:大范围考古遗址跟踪用于变化检测
Girmaw Abebe Tadesse, Titien Bartette, Andrew Hassanali, Allen Kim, Jonathan Chemla, Andrew Zolli, Yves Ubelmann, Caleb Robinson, Inbal Becker-Reshef, Juan Lavista Ferres
机构
*
Microsoft AI for Good Research Lab(微软AI for Good研究实验室)
;
Iconem, Paris, France(Iconem公司,巴黎,法国)
;
Planet Labs PBC(Planet Labs公司)
RoboMemArena: A Comprehensive and Challenging Robotic Memory Benchmark
RoboMemArena:一个全面且具有挑战性的机器人记忆基准
Huashuo Lei, Wenxuan Song, Huarui Zhang, Jieyuan Pei, Jiayi Chen, Haodong Yan, Han Zhao, Pengxiang Ding, Zhipeng Zhang, Lida Huang, Donglin Wang, Yan Wang, Haoang Li
机构
*
The Hong Kong University of Science and Technology(香港科学与技术大学)
;
Zhejiang University(浙江大学)
;
Westlake University(西湖大学)
;
Tsinghua University(清华大学)
;
Zhejiang University of Technology(浙江工业大学)
;
Shanghai Jiao Tong University(上海交通大学)
ReaMOT: A Benchmark and Framework for Reasoning-based Multi-Object Tracking
ReaMOT:基于推理的多目标跟踪基准与框架
Sijia Chen, Yanqiu Yu, En Yu, Wenbing Tao
机构
*
National Key Laboratory of Science and Technology on Multi-spectral Information Processing, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(国家多谱信息处理科学与技术重点实验室,人工智能与自动化学院,华中科技大学)
Reducing Prompt Sensitivity in LLM-based Speech Recognition Through Learnable Projection
通过可学习投影减少基于LLM的语音识别中的提示敏感性
Sergio Burdisso, Esaú Villatoro-Tello, Shashi Kumar, Srikanth Madikeri, Andrés Carofilis, Pradeep Rangappa, Manjunath K E, Kadri Hacioglu, Petr Motlicek, Andreas Stolcke
机构
*
Idiap Research Institute(Idiap研究 institute)
;
EPFL(苏黎世联邦理工学院)
;
Uniphore(Uniphore公司)
;
University of Zurich(苏黎世大学)
;
Brno University of Technology(布拉格技术大学)
专题命中
效率与部署
:LLM(title,title_cn);large language model(abstract);language model(abstract);foundation model(abstract)
TetraJet-v2: Accurate NVFP4 Training for Large Language Models with Oscillation Suppression and Outlier Control
TetraJet-v2:用于大语言模型的准确NVFP4训练方法,具有振荡抑制和异常值控制
Yuxiang Chen, Yifan Liu, Xiaoming Xu, Pengle Zhang, Michael Beyer, Martin Rapp, Jun Zhu, Jianfei Chen
机构
*
Dept. of Comp. Sci. and Tech., Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint ML Center, Tsinghua University(计算机科学与技术系,人工智能研究所,BNRist中心,THBI实验室,清华-博世联合机器学习中心,清华大学)
;
Zhili College, Tsinghua University(紫荆学院,清华大学)
;
Bosch AI Research, Renningen, Germany(博世人工智能研究,德国Renningen)
专题命中
效率与部署
:large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG