arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-31 至 2026-03-31 共收录 405 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 62 篇

2603.26683 2026-03-31 cs.IR cs.AI cs.CL cs.CV 73%

LITTA: Late-Interaction and Test-Time Alignment for Visually-Grounded Multimodal Retrieval

LITTA:晚期交互与测试时对齐用于视觉接地多模态检索

Seonok Kim

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LITTA通过查询扩展提升多模态文档检索,利用晚期交互评分和反向排名融合提高检索鲁棒性,适用于计算机科学、制药和工业手册等多领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26730 2026-03-31 cs.RO 71%

Why Cognitive Robotics Matters: Lessons from OntoAgent and LLM Deployment in HARMONIC for Safety-Critical Robot Teaming

为何认知机器人很重要:来自OntoAgent和HARMONIC中LLM部署的启示

Sanjay Oruganti, Sergei Nirenburg, Marjorie McShane, Jesse English, Michael Roberts, Christian Arndt, Ramviyas Parasuraman, Luis Sentis

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) University of Georgia(佐治亚大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 效率与部署 :LLM(title)

AI总结 研究探讨了在物理世界部署具身体AI代理所需的认知能力,通过HARMONIC架构评估LLM是否能复制OntoAgent的认知能力,发现LLM在知识状态评估上存在缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26359 2026-03-31 quant-ph cs.AI 70%

Automated near-term quantum algorithm discovery for molecular ground states

自动近 term 量子算法发现用于分子基态

Fabian Finger, Frederic Rapp, Pranav Kalidindi, Kerry He, Kante Yin, Alexander Koziell-Pipe, David Zsolt Manrique, Gabriel Greene-Diniz, Stephen Clark, Hamza Fawzi, Bernardino Romera-Paredes, Alhussein Fawzi, Konstantinos Meichanetzidis

机构 * Quantinuum Hiverge

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文利用AI平台Hive发现高效量子启发式算法,解决LiH、H2O和F2分子基态问题,减少量子资源消耗,并通过可解释性研究和实验验证,为化学精度提供系统要求。

Comments main: 17 pages, 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27664 2026-03-31 cs.CL 70%

Investigating the Influence of Language on Sycophantic Behavior of Multilingual LLMs

探究语言对多语言大语言模型趋炎附势行为的影响

Bayan Abdullah Aldahlawi, A. B. M. Ashikur Rahman, Irfan Ahmad

机构 * King Fahd University of Petroleum and Minerals(法赫德国王石油矿产大学) SDAIA-KFUPM Joint Research Center for AI (JRCAI)(SDAIA-KFUPM人工智能联合研究中心)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过评估三种先进模型在五种语言下的回应,发现尽管新模型趋炎附势倾向降低,但语言仍显著影响其行为,揭示了文化与语言模式。

Comments 15 Pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27462 2026-03-31 cs.DS cs.LG cs.PF 70%

RSR-core: A High-Performance Engine for Low-Bit Matrix-Vector Multiplication

RSR-core:一种高性能的低比特矩阵向量乘法引擎

Mohsen Dehghankar, Abolfazl Asudeh

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出RSR-core,一种基于RSR算法的高性能引擎,实现低比特矩阵向量乘法的优化低层内核,支持CPU和CUDA环境,显著提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26837 2026-03-31 cs.RO cs.AI cs.CV 70%

SpatialAnt: Autonomous Zero-Shot Robot Navigation via Active Scene Reconstruction and Visual Anticipation

SpatialAnt:通过主动场景重建与视觉预判实现自主零样本机器人导航

Jiwen Zhang, Xiangyu Shi, Siyuan Wang, Zerui Li, Zhongyu Wei, Qi Wu

机构 * Fudan University(复旦大学) University of Southern California(南加州大学) Adelaide University(阿德莱德大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SpatialAnt通过主动场景重建和视觉预判机制,解决零样本机器人导航中自建场景的不完整和噪声问题,提升导航性能。

Comments 10 pages, 4 figures, 5 tables. Homepage: https://imnearth.github.io/Spatial-X/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28713 2026-03-31 cs.CV 67%

DreamLite: A Lightweight On-Device Unified Model for Image Generation and Editing

DreamLite:一种轻量级的设备端统一模型用于图像生成和编辑

Kailai Feng, Yuxiang Wei, Bo Chen, Yang Pan, Hu Ye, Songwei Liu, Chenqian Yan, Yuan Gao

机构 * Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)

专题命中 效率与部署 :pretraining(abstract);SFT(abstract)

AI总结 本文提出DreamLite,一种轻量级设备端统一扩散模型,支持图像生成和文本引导的图像编辑,通过剪枝移动U-Net骨干网络和潜在空间内的上下文空间拼接实现统一条件化,达到高效生成和编辑效果。

Comments https://carlofkl.github.io/dreamlite/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27819 2026-03-31 cs.LG cs.AI cs.CL 67%

KVSculpt: KV Cache Compression as Distillation

KVSculpt:KV缓存压缩作为蒸馏

Bo Jiang, Sian Jin

机构 * Temple University(天普大学)

专题命中 效率与部署 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 KVSculpt通过优化连续嵌入空间中的小规模KV对,保留各层注意力行为,相比传统方法在压缩比下显著降低KL散度,引入自适应预算分配提升压缩效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22674 2026-03-31 cs.CV 67%

VisionTrim: Unified Vision Token Compression for Training-Free MLLM Acceleration

VisionTrim: 一种用于无训练多模态大语言模型加速的统一视觉标记压缩方法

Hanxun Yu, Wentong Li, Xuan Qu, Song Wang, Junbo Chen, Jianke Zhu

机构 * State Key Lab of CAD & CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) NUAA(南京航空航天大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出VisionTrim,通过整合DVTS和TGVC模块,有效减少视觉标记,提升多模态大语言模型在高分辨率和视频场景中的计算效率。

Comments ICLR2026, Code Link: https://github.com/hanxunyu/VisionTrim

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09695 2026-03-31 cs.DB 67%

Exqutor: Extended Query Optimizer for Vector-augmented Analytical Queries

Exqutor:面向向量增强分析查询的扩展查询优化器

Hyunjoon Kim, Chaerim Lim, Hyeonjun An, Rathijit Sen, Kwanghyun Park

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出Exqutor,一种用于向量增强分析查询的查询优化器,通过改进向量搜索的基数估计方法,提升查询性能,实验证明在pgvector、VBASE和DuckDB中性能提升达四量级。

Comments Accepted to the 42nd IEEE International Conference on Data Engineering (ICDE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05825 2026-03-31 cs.LG cs.AI cs.CL stat.ML 67%

Mitigating Premature Exploitation in Particle-based Monte Carlo for Inference-Time Scaling

缓解粒子基蒙特卡洛在推理时间扩展中的过早利用

Giorgio Giannone, Guangxuan Xu, Nikhil Shivakumar Nayak, Rohan Mahesh Awhad, Shivchander Sudalairaj, Kai Xu, Akash Srivastava

机构 * Core AI, IBM(IBM核心人工智能)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ePF算法,通过熵退火和前瞻性调节技术缓解粒子退化问题,提升粒子过滤在复杂数学推理任务中的性能。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16430 2026-03-31 cs.CL cs.AI 62%

EngGPT2: Sovereign, Efficient and Open Intelligence

EngGPT2:主权、高效且开放的智能

G. Ciarfaglia, A. Rosanova, S. Cipolla, J. Bartoli, A. Di Domenico, C. Fioroni, A. Fontana, M. R. Scoleri, M. I. Mone, D. Franchi, M. C. Del Gaudio, A. Leodori, F. Cinti, M. Capozzi, C. Baston, F. Picariello, M. Gabusi, S. Bonura, V. Morreale, I. Bailo

机构 * Engineering Group(工程集团)

专题命中 效率与部署 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 EngGPT2是工程集团最新迭代的意大利大语言模型,通过训练2.5万亿token实现高效性能,其在多个基准测试中表现接近8B-16B密集模型,同时消耗更少的推理和训练资源,支持多语言推理模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10465 2026-03-31 cs.CL cs.AI 62%

Beyond Elicitation: Provision-based Prompt Optimization for Knowledge-Intensive Tasks

超越启发:基于供应的提示优化用于知识密集型任务

Yunzhe Xu, Zhuosheng Zhang, Zhe Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能全国重点实验室)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出KPPO框架,通过系统整合知识而非潜在启发来优化提示,解决知识密集型任务中静态知识容量的局限,提升性能并降低token消耗。

Comments Accepted by IEEE Transactions on Audio, Speech and Language Processing (TASLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06188 2026-03-31 cs.AI cs.CL cs.MA 62%

SkillFlow: Scalable and Efficient Agent Skill Retrieval System

SkillFlow:可扩展且高效的智能体技能检索系统

Fangzhou Li, Pagkratios Tagkopoulos, Ilias Tagkopoulos

机构 * University of California, Davis(加州大学戴维斯分校) USDA/NSF AI Institute for Next Generation Food Systems(美国农业部/国家科学基金会下一代食品系统人工智能研究所) Process Integration and Predictive Analytics(过程集成与预测分析)

专题命中 效率与部署 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 SkillFlow通过多阶段检索流程提升智能体技能检索效率,实现在SkillsBench上Pass@1提升78.3%,但Terminal-Bench显示检索效果受限于技能库质量

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28405 2026-03-31 cs.CV cs.AI 57%

EdgeDiT: Hardware-Aware Diffusion Transformers for Efficient On-Device Image Generation

EdgeDiT:面向边缘设备的高效扩散变换器

Sravanth Kodavanti, Manjunath Arveti, Sowmya Vajrala, Srinivas Miriyala, Vikram N R

机构 * Samsung Research Institute Bangalore, India(三星研究所班加罗尔)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI

AI总结 本文提出EdgeDiT,一种为移动端NPU优化的高效生成变换器,通过硬件感知优化减少参数和计算量,提升边缘设备图像生成效率。

Comments Accepted at the Mobile AI Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27678 2026-03-31 cs.LG 57%

Prototype-Aligned Federated Soft-Prompts for Continual Web Personalization

原型对齐的联邦软提示用于持续网页个性化

Canran Xiao, Liwei Hou

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Hunan University(湖南大学)

专题命中 效率与部署 :prompting(abstract);分类 cs.LG

AI总结 本文提出ProtoFed-SP框架,通过双时间尺度软提示实现隐私保护的持续个性化,提升NDCG和HR指标,降低遗忘率并保持准确性。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27400 2026-03-31 cs.RO cs.LG 57%

Rainbow-DemoRL: Combining Improvements in Demonstration-Augmented Reinforcement Learning

Rainbow-DemoRL: 结合演示增强强化学习的改进方法

Dwait Bhatt, Shih-Chieh Chou, Nikolay Atanasov

机构 * University of California San Diego(加州大学圣地亚哥分校) National Sun Yat-sen University(国立中山大学)

专题命中 效率与部署 :pretraining(abstract);分类 cs.LG

AI总结 本文通过分类和实证研究,探讨了演示增强强化学习中不同策略的优劣及组合效果,发现直接复用离线数据和行为克隆初始化在提升在线样本效率方面表现更优。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27299 2026-03-31 cs.LG 57%

From Inference Routing to Agent Orchestration: Declarative Policy Compilation with Cross-Layer Verification

从推理路由到代理编排:基于跨层验证的声明性策略编译

Huamin Chen, Xunzhuo Liu, Bowei He, Xue Liu

机构 * McGill University(麦吉尔大学)

专题命中 效率与部署 :LLM(abstract);分类 cs.LG

AI总结 本文扩展了非图灵完备的策略语言,从单请求路由到多步骤代理工作流,通过跨层验证确保策略一致性,提升可审计性和可验证性。

Comments Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27269 2026-03-31 quant-ph cs.AI 57%

From Foundation ECG Models to NISQ Learners: Distilling ECGFounder into a VQC Student

从基础ECG模型到NISQ学习者:将ECGFounder distill 为一个VQC学生

Giovanni dos Santos Franco, Felipe Mahlow, Ellison Fernando Cardoso, Felipe Fanchini

机构 * São Paulo State University (Unesp)(圣保罗州立大学) Hospital Israelita Albert Einstein(以色列阿尔伯特·爱因斯坦医院) University of São Paulo Faculty of Medicine Clinics Hospital(圣保罗大学医学院临床医院)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI

AI总结 本文探讨了通过知识蒸馏将高容量ECGFounder模型转化为紧凑学生模型的方法,评估了经典和量子学习器在ECG分类中的性能,展示了参数减少与准确率之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27247 2026-03-31 cs.CL cs.SE 57%

SCOPE: Tree-based Self-Correcting Online Log Parsing via Syntactic-Semantic Collaboration

SCOPE:基于树结构的自校正在线日志解析方法:通过语法-语义协作

Dongyi Fan, Suqiong Zhang, Lili He, Ming Liu, Yifan Huo

机构 * Zhejiang Sci-Tech University(浙江理工大学)

专题命中 效率与部署 :LLM(abstract);分类 cs.CL

AI总结 SCOPE通过语法-语义协作框架,结合轻量NLP模型和LLM,实现高效准确的日志解析,平衡效率与效果。

Comments Accepted at the 34th International Conference on Program Comprehension (ICPC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27153 2026-03-31 cs.LG 57%

Preconditioned Attention: Enhancing Efficiency in Transformers

预条件注意力:提升Transformer的效率

Hemanth Saratchandran

机构 * Australian Institute for Machine Learning (AIML), Adelaide University(阿德莱德大学澳大利亚机器学习研究所(AIML))

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 本文提出预条件注意力机制,通过引入条件矩阵降低注意力矩阵的条件数,提升训练效率,适用于多种Transformer应用。

Comments AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26944 2026-03-31 cs.AI 57%

Neuro-Symbolic Learning for Predictive Process Monitoring via Two-Stage Logic Tensor Networks with Rule Pruning

基于两阶段逻辑张量网络与规则剪枝的神经符号学习用于预测过程监控

Fabrizio De Santis, Gyunam Park, Francesco Zanichelli

机构 * University of Parma(帕尔马大学) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI

AI总结 本文提出一种神经符号学习方法,通过两阶段优化策略结合逻辑张量网络与规则剪枝,提升预测过程监控的准确性,尤其在合规约束下表现优异。

Comments Accepted PAKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18151 2026-03-31 cs.DC cs.AR cs.CV cs.LG cs.NI 57%

AVERY: Intent-Driven Adaptive VLM Split Computing via Embodied Self-Awareness for Efficient Disaster Response Systems

AVERY:基于具身自感知的意图驱动自适应VLM分发计算以实现高效的灾害响应系统

Rajat Bhattacharjya, Sing-Yao Wu, Hyunwoo Oh, Chaewon Nam, Suyeon Koo, Mohsen Imani, Elaheh Bozorgzadeh, Nikil Dutt

机构 * University of California, Irvine(加州大学尔湾分校) Kookmin University(国民大学)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 AVERY通过意图驱动的自适应分发计算框架,在资源受限平台高效部署VLM,利用双流分发策略提升灾害响应系统实时查询能力,实现更高的准确性和更低的能耗。

Comments Paper is currently under review. Authors' version posted for personal use and not for redistribution. Previous version of the preprint was titled: 'AVERY: Adaptive VLM Split Computing through Embodied Self-Awareness for Efficient Disaster Response Systems'

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27900 2026-03-31 cs.CV 50%

Rényi Entropy: A New Token Pruning Metric for Vision Transformers

瑞尼熵:一种新的token剪枝度量标准用于视觉变换器

Wei-Yuan Su, Ruijie Zhang, Zheng Zhang

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 效率与部署 :language model(abstract)

AI总结 本文提出基于瑞尼熵的无训练token重要性度量Col-Ln,用于改进视觉变换器中早期层的token剪枝,提升推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11479 2026-03-31 cs.RO 50%

OVSegDT: Segmenting Transformer for Open-Vocabulary Object Goal Navigation

OVSegDT:用于开放词汇物体目标导航的分割Transformer

Tatiana Zemskova, Aleksei Staroverov, Dmitry Yudin, Aleksandr Panov

机构 * Cognitive AI Systems Lab(认知人工智能系统实验室) MIRAI NUST MISIS(国立研究型技术大学MISIS)

专题命中 效率与部署 :language model(abstract)

AI总结 本文提出OVSegDT,一种轻量级Transformer策略,通过语义分支和熵自适应损失调节解决开放词汇物体目标导航中的过拟合和安全问题,提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02023 2026-03-31 cs.SE 50%

PCREQ: Automated Inference of Compatible Requirements for Python Third-party Library Upgrades

PCREQ:自动化推断Python第三方库升级的兼容性需求

Huashan Lei, Guanping Xiao, Yepang Liu, Zheng Zheng

专题命中 效率与部署 :LLM(abstract)

AI总结 PCREQ通过结合版本和代码兼容性分析,自动化推断Python第三方库升级的兼容性需求,解决了现有工具无法处理代码层面不兼容问题的不足,其在真实世界基准测试中表现出高准确率和高效处理能力。

Comments Accepted by ACM Transactions on Software Engineering and Methodology

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 领域大模型 35 篇

2603.27164 2026-03-31 cs.AI cs.CL 90%

daVinci-LLM:Towards the Science of Pretraining

daVinci-LLM:迈向预训练的科学

Yiwei Qin, Yixiu Liu, Tiantian Mi, Muhang Xie, Zhen Huang, Weiye Si, Pengrui Lu, Siyuan Feng, Xia Wu, Liming Liu, Ye Luo, Jinlong Hou, Qipeng Guo, Yu Qiao, Pengfei Liu

机构 * SII SJTU(上海交通大学) GAIR

专题命中 领域大模型 :LLM(title,abstract);pretraining(title,abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文提出daVinci-LLM,通过结合工业级资源与科研自由,探索预训练的科学方法。采用开放范式,通过数据达尔文主义框架和两阶段适应课程,训练3B参数模型,验证处理深度对能力的影响及不同领域饱和动态的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20863 2026-03-31 cs.CR 89%

Misleading Large Language Models used (or misused) in Scientific Peer-Reviewing via Hidden Prompt-Injection Attacks

通过隐藏提示注入攻击误导用于科学同行评审的大型语言模型

Matteo Gioele Collu, Umberto Salviati, Roberto Confalonieri, Mauro Conti, Giovanni Apruzzese

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 研究探讨了通过隐藏提示注入攻击误导科学同行评审中使用的大型语言模型的潜力,设计了不可见于人类读者但能引导LLM输出的对抗性提示,并评估了其在不同系统和论文中的鲁棒性。

Comments Accepted to ACM TAISAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05658 2026-03-31 cs.CL cs.AI 88%

Multilingual Medical Reasoning for Question Answering with Large Language Models

多语言医疗推理用于问答的大型语言模型

Pietro Ferrazzi, Aitor Soroa, Rodrigo Agerri

机构 * HiTZ Center - Ixa, University of the Basque Country EHU(HiTZ中心 - Ixa,巴斯克大学EHU)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于维基百科医疗知识生成多语言推理轨迹的方法,通过检索增强生成技术生成英文、意大利语和西班牙语的50万条轨迹,提升医疗问答性能,达到8B参数模型的最新水平。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19467 2026-03-31 cs.CL cs.AI 88%

BRIDGE: Benchmarking Large Language Models for Understanding Real-world Clinical Practice Text

BRIDGE:用于评估大语言模型理解现实世界临床实践文本的基准测试

Jiageng Wu, Bowen Gu, Ren Zhou, Kevin Xie, Doug Snyder, Yixing Jiang, Valentina Carducci, Richard Wyss, Rishi J Desai, Emily Alsentzer, Leo Anthony Celi, Adam Rodman, Sebastian Schneeweiss, Jonathan H. Chen, Santiago Romero-Brufau, Kueiyu Joshua Lin, Jie Yang

机构 * Brigham and Women's Hospital(布莱根妇女医院) Harvard Medical School(哈佛医学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Massachusetts Institute of Technology(麻省理工学院) Mayo Clinic(梅奥诊所) Harvard T.H. Chan School of Public Health(哈佛大学陈曾熙公共卫生学院) Harvard University(哈佛大学) Stanford University(斯坦福大学) Beth Israel Deaconess Medical Center(贝斯以色列女执事医疗中心) Kempner Institute for the Study of Natural and Artificial Intelligence(肯普纳自然与人工智能研究所) Broad Institute of MIT and Harvard(博德研究所) Harvard Data Science Initiative(哈佛数据科学计划)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出BRIDGE基准测试,涵盖9种语言的87项任务,涵盖患者护理全过程的六个临床阶段和20种应用,评估95种LLM在不同推理策略下的性能差异,展示开源模型与专业模型的性能对比。

详情

展开后加载摘要…

URL PDF HTML 收藏