arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-21 至 2026-05-21 共收录 337 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 58 篇

2605.21395 2026-05-21 cs.AI cs.LG 62%

Towards Resilient and Autonomous Networks: A BlueSky Vision on AI-Native 6G

迈向稳健和自主的网络:AI原生6G的BlueSky愿景

Liang Wu, Kelly Wan, Mayank Darbari, Liangjie Hong

机构 * Nokia(诺基亚)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种AI原生6G的BlueSky愿景,旨在将人工智能原生整合到6G中,从'为AI的网络'转向'为网络的AI',通过基础模型和协作多智能体系统,将网络管理转化为统一的多模态多任务优化问题,推动6G向智能自维持通信基础设施发展。

Comments Accepted at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21258 2026-05-21 cs.RO cs.AI 57%

Learning Structural Latent Points for Efficient Visual Representations in Robotic Manipulation

为机器人操作中的高效视觉表征学习结构潜在点

Yicheng Jiang, Jiaxu Wang, Junhao He, Zesen Gan, Junhao Li, Qiang Zhang, Jingkai Sun, Jiahang Cao, Mingyuan Sun, Xiangyu Yue, Qiming Shao

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) X-Humanoid Robots(X-Humanoid机器人) The University of Hong Kong(香港大学) Tsinghua University(清华大学)

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI

AI总结 本文提出了一种新的预训练框架,通过学习混合表示-结构潜在点,结合隐式表示的表达能力和显式表示的结构先验,以提高机器人操作中的视觉表征效率和鲁棒性。

Journal ref International Conference on Robotics and Automation 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20799 2026-05-21 cs.DC cs.LG 57%

Instant GPU Efficiency Visibility at Fleet Scale

在舰队规模上实现GPU效率的即时可见性

Connor Pedersen, Dong H. Ahn, Michel Migdal, Collin Neale, Nik Konyuchenko

机构 * Microsoft(微软) Alphabet Meta

专题命中 效率与部署 :pretraining(abstract);分类 cs.LG

AI总结 本文提出了一种硬件级别的GPU效率指标Overall FLOP Utilization (OFU),用于HPC系统上的AI工作负载,通过两种芯片级性能计数器:张量管道活动和SM时钟频率来推导。OFU无需应用程序仪器化,适用于所有GPU代际和数值精度。通过在H100和GB200上进行受控的GEMM实验,研究了OFU近似值的五个属性,并在FP16、TF32、FP8和NVFP4上进行了验证。经过瓷砖量化修正后,OFU可以预测应用级别的MFU误差不超过2个百分点。在608个生产训练任务中,OFU与应用级别的MFU相关性达到0.78,并揭示了两个框架级别的FLOPs计算错误。在大规模GPU舰队上部署后,OFU检测到2.5倍的效率退化,并追踪了混合精度预训练中的精度依赖性利用变化。评估和运营经验表明,OFU是应用级别MFU的实用且可部署的补充,用于持续的舰队级效率监控。

Comments 12 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20551 2026-05-21 cs.CV cs.AI cs.RO 57%

Faster or Stronger: Towards Flexible Visual Place Recognition via Weighted Aggregation and Token Pruning

更快或更强:通过加权聚合和标记剪枝实现灵活的视觉位置识别

Zichao Zeng, June Moh Goo, Junwei Zheng, Weijia Fan, Jiaming Zhang, Rainer Stiefelhagen, Jan Boehm

机构 * University College London(伦敦大学学院) Karlsruhe Institute of Technology(卡尔斯鲁厄大学) Hunan University(湖南大学) Shenzhen University(深圳大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI

AI总结 本文提出了一种加权聚合描述符(WeiAD)和标记剪枝框架(WeiToP),用于提升视觉位置识别的性能和效率,通过动态调整特征提取的精度与效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18860 2026-05-21 cs.LG cs.CV 57%

Spectral structural distortion reveals redundant neurons in neural networks

谱结构扭曲揭示神经网络中的冗余神经元

Yongyu Wang

机构 * MTU(密苏里大学)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 本文提出了一种基于谱结构扭曲的神经元冗余判定方法,通过分析神经网络层变换前后的关系结构,识别可移除的神经元并保持任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07560 2026-05-21 cs.RO 50%

How to Utilize Failure Demo Data?: Effective Data Selection for Imitation Learning Using Distribution Differences in Attention Mechanism

如何利用失败演示数据?:利用注意力机制中的分布差异进行有效的模仿学习数据选择

Kana Miyamoto, Kanata Suzuki, Tetsuya Ogata

机构 * Faculty of Science and Engineering, Waseda University, Tokyo, Japan(科学与工程学部,早稻田大学,东京,日本) Physical AI Laboratory, Fujitsu Limited, Kanagawa, Japan(物理人工智能实验室, Fujitsu 有限,神奈川,日本)

专题命中 效率与部署 :post-training(abstract)

AI总结 本文提出了一种利用注意力机制中的分布差异来有效选择模仿学习数据的方法,通过学习成功-失败差异的潜在表示,提高行动稳定性,并引入一个后训练度量来选择有益于学习的失败样本。

Comments 15 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20808 2026-05-21 cs.CV 50%

Spatial Gram Alignment for Ultra-High-Resolution Image Synthesis

基于超高清图像合成的空间图对齐

Jinjin Zhang, Xiefan Guo, Di Huang

机构 * Beihang University(北航大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 本文提出空间图对齐(SGA)方法,通过利用视觉基础模型的表示先验,保留LDMs的生成能力,解决超高清图像合成中生成质量与结构完整性之间的冲突,实现高质量的文本到图像合成。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17472 2026-05-21 cs.CV 50%

Weighted Reverse Convolution for Feature Upsampling

加权反卷积用于特征上采样

Wentong Li, Zhiyuan Qi, Zichen Zhao, Kai Zhang, Lei Zhang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) The Hong Kong Polytechnic University(香港理工大学) Nanjing University(南京大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 本文提出加权反卷积(WRC),从逆问题的角度重新审视视觉基础模型中的特征上采样,通过空间自适应的逆操作提升高层视觉描述符的密度,从而在需要细粒度定位、密集预测和点对应的任务中提升性能。

Comments 18 pages, 7 figures, code:https://github.com/PolyU-VCLab/WRC

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01273 2026-05-21 cs.CV 50%

Q-DiT4SR: Exploration of Detail-Preserving Diffusion Transformer Quantization for Real-World Image Super-Resolution

Q-DiT4SR: 探索细节保留的扩散变换器量化以实现实景图像超分辨率

Xun Zhang, Kaicheng Yang, Hongliang Lu, Haotong Qin, Yong Guo, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei(华为)

专题命中 效率与部署 :post-training(abstract)

AI总结 本文提出Q-DiT4SR,一种专门针对基于扩散变换器的实现实景图像超分辨率的后训练量化框架,通过引入层次化SVD和变异性感知时空混合精度方法,在保持细节的同时实现高效的模型压缩和加速。

Comments Accepted to ICML 2026. Our code and models will be available at https://github.com/xunzhang1128/Q-DiT4SR

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 领域大模型 17 篇

2605.20591 2026-05-21 cs.CL cs.CY 92%

Do No Harm? Hallucination and Actor-Level Abuse in Web-Deployed Medical Large Language Models

有害吗?网络部署医疗大语言模型中的幻觉与作用层面滥用

Sunday Oyinlola Ogundoyin, Muhammad Ikram, Rahat Masood

机构 * The University of New South Wales, Sydney, Australia(新南威尔士大学,悉尼,澳大利亚)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文研究了网络部署的医疗大语言模型中的幻觉和作用层面滥用问题,通过评估6233个MedGPT和10个开源LLM,发现25-30%的MedGPT事实准确性较低,33.6-54.3%违反操作阈值,57.06%的Action-enabled模型缺乏充分的隐私披露,揭示了系统性漏洞,强调了多指标评估和更强的安全保障的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20734 2026-05-21 cs.CR cs.AI 92%

An Application-Layer Multi-Modal Covert-Channel Reference Monitor for LLM Agent Egress

面向LLM代理出站的应用层多模态隐通道参考监控器应用

Alfredo Metere

机构 * Enclawed, LLC(Enclawed公司)

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种应用层多模态隐通道参考监控器,用于检测和防止LLM代理在消息中泄露数据,通过多阶段文本管道、媒体加密器和残余容量测量来实现对隐通道的监控和管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00086 2026-05-21 cs.CL cs.AI cs.SD eess.AS 91%

Iterative LLM-based improvement for French Clinical Interview Transcription and Speaker Diarization

基于迭代的LLM改进法用于法语临床访谈的转录与说话人识别

Ambre Marie, Thomas Bertin, Guillaume Dardenne, Gwenolé Quellec

机构 * LaTIM UMR 1101 INSERM(INSERM拉蒂姆UMR1101) University of Western Brittany(西布列塔尼大学) University of Rouen Normandy(诺曼底大学)

专题命中 领域大模型 :LLM(title,title_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出一种多轮LLM后处理架构,通过交替进行说话人识别和词识别流程,提高法语医疗对话的转录准确性和说话人归属,通过两个法语临床数据集的消融研究验证了四种设计选择的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21076 2026-05-21 cs.CL 88%

GradeLegal: Automated Grading for German Legal Cases

GradeLegal: 自动化评分德国法律案例

Abdullah Al Zubaer, Lorenz Wendlinger, Simon Alexander Nonn, Michael Granitzer, Jelena Mitrovic

机构 * University of Passau(帕绍大学) Deggendorf Institute of Technology(德格多夫技术学院)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究探讨了大型语言模型能否用于自动化评分德国刑事和公法案例解决方案,通过系统评估27个专有和开源LLM,发现基于样本解决方案和评分标准的提示策略能有效模拟专家评分,尤其在公法领域达到0.91的QWK值,而在刑事法律领域仅为0.60,表明刑事法律评分任务更难。此外,集成方法能进一步提高评分一致性,并为更强的闭源单模型提供替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22693 2026-05-21 q-fin.ST cs.AI cs.CL 88%

Bridging Language Models and Financial Analysis

连接语言模型与金融分析

Alejandro Lopez-Lira, Jihoon Kwon, Sangwoon Yoon, Jy-yong Sohn, Chanyeol Choi

机构 * University of Florida(佛罗里达大学) Ministry of Justice, Republic of Korea(韩国司法部) Yonsei University(延世大学) LinqAlpha

专题命中 领域大模型 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文旨在通过概述最近的语言模型研究进展,探讨其在金融领域中的应用潜力,填补语言模型在金融行业中的实际应用与研究进展之间的差距。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20469 2026-05-21 cs.CV 85%

HalluCXR: Benchmarking and Mitigating Hallucinations in Medical Vision-Language Models for Chest Radiograph Interpretation

HalluCXR: 评估和缓解医疗视觉-语言模型在胸部X光解读中的幻觉

Haoyu Wang, Zitong Li

机构 * Department of Biostatistics & Health Informatics, Institute of Psychiatry, Psychology & Neuroscience, King’s College London(生物统计学与健康信息学系,精神病学、心理学与神经科学研究所,伦敦国王学院)

专题命中 领域大模型 :language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出HalluCXR基准,评估六种不同架构的视觉-语言模型在856例分层MIMIC-CXR胸部X光图像上的表现,发现61.9%-82.3%的输出存在幻觉,其中80.2%存在临床危险错误,通过引入幻觉分类学、检测管道和模型集成方法,提出了缓解幻觉的策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09724 2026-05-21 cs.SE cs.AI 84%

InteractScience: Programmatic and Visually-Grounded Evaluation of Interactive Scientific Demonstration Code Generation

InteractScience: 交互式科学演示代码生成的程序化与视觉导向评估

Qiaosheng Chen, Yang Liu, Lei Li, Kai Chen, Qipeng Guo, Gong Cheng, Fei Yuan

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家重点实验室,南京大学,中国南京) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,中国上海) Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学,美国匹兹堡)

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出InteractScience基准,用于评估大语言模型在生成交互式科学演示代码时结合科学知识与前端交互能力的综合表现,通过程序化测试和视觉测试相结合的方法,评估30种开源和闭源LLM的表现,揭示了在整合领域知识与交互前端编码方面的持续不足。

Comments 27 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10673 2026-05-21 cs.IR 80%

Breaking User-Centric Agency: A Tri-Party Framework for Agent-Based Recommendation

打破以用户为中心的代理:一个三方框架用于基于代理的推荐

Yaxin Gong, Chongming Gao, Chenxiao Fan, Haoyan Liu, Wenjie Wang, Jianshan Sun, Yangyang Li, Fuli Feng, Xiangnan He

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出一个三方框架TriRec,用于基于代理的推荐系统,旨在协调用户效用、物品曝光和平台层面的公平性,从而提高推荐系统的准确性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21180 2026-05-21 cs.LG cs.SE 77%

Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards

用于密集奖励的领域可适应强化学习代码生成

Erfan Aghadavoodi Jolfaei, Daniel Maninger, Abhinav Anand, Mert Tiftikci, Mira Mezini

机构 * Hessian Center for Artificial Intelligence (hessian.AI)(海斯曼人工智能中心) National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE)

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究提出了一种领域可适应的强化学习框架,用于改进代码生成的正确性、质量和安全性,通过定制化的执行感知奖励公式和令牌级奖励映射机制,提高了代码生成在不同领域中的适应性和执行效率。

Comments 10 pages, 2 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08292 2026-05-21 cs.CL cs.AI 73%

Do LLMs Triage Like Clinicians? A Dynamic Study of Outpatient Referral

大语言模型像医生一样分诊吗?对外科会诊的动态研究

Xiaoxiao Liu, Qingying Xiao, Bingquan Zhang, Junying Chen, Xiangyi Feng, Ziniu Li, Xiang Wan, Jian Chang, Guangjun Yu, Yan Hu, Benyou Wang

机构 * Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Bournemouth University(伯恩茅斯大学) National Health Data Institute, Shenzhen(深圳国家健康数据研究院) Shenzhen Research Institute of Big Data(深圳大数据研究院)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大语言模型在动态分诊过程中的表现,发现其在动态场景中通过有效提问减少不确定性,优于传统分类器,但静态场景下优势有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20284 2026-05-21 cs.CV cs.AI cs.LG 73%

JUDO: A Juxtaposed Domain-Oriented Multimodal Reasoner for Industrial Anomaly QA

JUDO: 一种面向工业异常问答的多模态推理框架

Hyunju Kang, Woohyun Lee, Jaewon Kim, Hogun Park

机构 * Sungkyunkwan University(成均馆大学) Seoul National University(首尔国立大学)

专题命中 领域大模型 :SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出JUDO框架,通过结合领域知识和上下文提升多模态推理能力,以解决工业异常检测中模型缺乏领域知识的问题,实验表明其在MMAD基准上优于Qwen2.5-VL-7B和GPT-4o。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20682 2026-05-21 cs.CV 67%

IndusAgent: Reinforcing Open-Vocabulary Industrial Anomaly Detection with Agentic Tools

IndusAgent: 通过智能工具增强开放词汇工业异常检测

Rongbin Tan, Fangfang Lin, Zhenlong Yuan, Min Qiu, Kejin Cui, Mengmeng Wang, Yi Wang, Zijian Song, Zhiyuan Wang, Jiyuan Wang, Yue Wang, Shuhan Song§, Huawei Cao

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) Santa Clara University(圣克拉拉大学) LongCat Team(LongCat团队) Independent Researcher(独立研究者) New York University(纽约大学) Sun Yat-sen University(孙中山大学) Nanyang Technological University(南洋理工大学) Stanford University(斯坦福大学) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 本文提出IndusAgent框架,通过整合视觉观测、高分辨率局部片段和专家正常性先验,提升开放词汇工业异常检测的零样本性能,验证了方法的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20548 2026-05-21 cs.MA 67%

What Do Agents Communicate? Characterizing Information Exchange in Multi-Agent Systems

智能体通信什么?多智能体系统中信息交换的特征化

Yong Jin Chun, Iftekhar Ahmed

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 本文研究了多智能体系统中信息交换的核心问题,发现缺乏推理和验证的信息会显著降低性能,并提出了一种增强技术来恢复通信中的关键信息,从而提高了系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20457 2026-05-21 cs.SI 67%

The Structure and Dynamics of the Online MAHA-sphere

在线MAHA球体的结构与动态

Sabit Ahmed, Subigya Nepal, Henry Kautz

专题命中 领域大模型 :LLM(abstract,abstract_cn)

AI总结 本研究探讨了MAHA运动在线社区中意识形态的结构和动态,通过分析Reddit数据揭示了MAHA相关思想的交集、网络结构、参与模式、意见动态和语言差异,并发现疫苗怀疑可能成为更广泛反科学参与的入口。

Comments Submitted to [TBA]

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17618 2026-05-21 cs.AI 57%

Prediction of Challenging Behaviors Associated with Profound Autism in a Classroom Setting Using Wearable Sensors

使用可穿戴传感器预测课堂环境中与深度自闭症相关的行为问题

Yadhu Kartha, Conor Anderson, Jenny Foster, Theresa Hamlin, Johanna Lantz, Ryan Lay, Juergen Hahn, Gari D. Clifford, Hyeokhyen Kwon

机构 * Georgia Institute of Technology(佐治亚理工学院) The Center For Discovery(发现中心) Rensselaer Polytechnic Institute(伦斯勒理工学院) Georgia Institute of Technology, Emory University(佐治亚理工学院与埃默里大学)

专题命中 领域大模型 :foundation model(abstract);分类 cs.AI

AI总结 本研究通过可穿戴传感器和机器学习方法,在真实课堂环境中预测自闭症深度患者的行为问题,展示了在教育环境中提前10分钟预测行为问题的可行性,并实现了AUC-ROC为0.78的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22080 2026-05-21 cs.AI 57%

Sound Agentic Science Requires Adversarial Experiments

声音代理科学需要对抗性实验

Dionizije Fa, Marko Culjak

专题命中 领域大模型 :LLM(abstract);分类 cs.AI

AI总结 该研究探讨了代理辅助科学中对抗性实验的重要性,指出传统方法在科学发现中的局限性,并提出应以证伪优先的标准来评估代理生成的科学主张。

Comments Published at ICLR 2026 Workshop on Agents in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01053 2026-05-21 cs.IR cs.AI cs.DB 57%

M3: Conversational LLMs Simplify Secure Clinical Data Access, Understanding, and Analysis

M3: 对话式大语言模型简化安全的临床数据访问、理解与分析

Rafi Al Attrach, Pedro Moreira, Rajna Fani, Renato Umeton, Amelia Fiske, Leo Anthony Celi

机构 * Massachusetts Institute of Technology(麻省理工学院) Technical University of Munich(慕尼黑技术大学) Universitat Pompeu Fabra(庞培法华大学) St. Jude Children’s Research Hospital(圣犹大儿童研究医院) Beth Israel Deaconess Medical Center(贝斯以色列医疗中心) Harvard T.H. Chan School of Public Health(哈佛大学T.H. Chan公共卫生学院)

专题命中 领域大模型 :language model(abstract);分类 cs.AI

AI总结 本文提出M3系统,通过模型上下文协议实现对MIMIC-IV数据库的自然语言查询,降低了临床数据访问和分析的技术门槛,并展示了其在安全性和性能上的优势。

Comments 18 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 知识编辑与模型理解 24 篇

2605.20197 2026-05-21 cs.CL 90%

MedicalBench: Evaluating Large Language Models Toward Improved Medical Concept Extraction

MedicalBench: 评估大型语言模型以改进医疗概念提取

Zhichao Yang, Gregory D. Lyng, Sanjit Singh Batra, Robert E. Tillman

机构 * Optum AI

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出MedicalBench,一个用于评估大型语言模型在医疗概念提取中的表现的基准,重点在于隐含概念的提取和证据 grounding,通过多阶段流程构建数据集并定义两种互补的评估任务,揭示了隐含概念提取的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25898 2026-05-21 eess.SY cs.AI cs.SE cs.SY 90%

On Integrating Resilience and Human Oversight into LLM-Assisted Modeling Workflows for Digital Twins

在数字孪生构建中整合韧性与人类监督 into LLM辅助建模工作流

Lekshmi P, Neha Karanjkar

机构 * Indian Institute of Technology Goa(印度理工学院 Goa)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出三种关键设计原则,用于将韧性与人类监督整合到LLM辅助的数字孪生建模工作流中,通过FactoryFlow框架的研究,探讨了如何通过正交化结构建模与参数拟合、限制模型IR到参数化预验证库组件以及使用密度保持的IR来提高建模的鲁棒性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21227 2026-05-21 cs.CL 88%

Do LLMs Know What Luxembourgish Borrows? Probing Lexical Neology in Low-Resource Multilingual Models

LLMs是否知道卢森堡语借词?探测低资源多语言模型中的词汇新词

Nina Hosseini-Kivanani

机构 * University of Luxembourg(卢森堡大学) Radio Télévision Luxembourg (RTL)(卢森堡广播电视台(RTL))

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过LexNeo-Bench基准测试,探讨了低资源多语言模型在词汇借词识别中的表现,发现通过构建语言知识图谱可以显著提升模型的借词分类准确率,表明词汇资源对LLM评估具有结构化上下文的作用。

Comments Accepted to Neollm colocated with LREC2026, Three figures and three tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21102 2026-05-21 cs.CL cs.AI cs.SE 87%

ACL-Verbatim: hallucination-free question answering for research

ACL-Verbatim: 无幻觉的科研问答

Gábor Recski, Szilveszter Tóth, Nadia Verdha, István Boros, Ádám Kovács

机构 * TU Wien(维也纳技术大学) KR Labs(KR实验室)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出ACL-Verbatim系统,通过提取式问答方法在科研论文中精准映射用户查询到相关文本片段,构建了新的真实数据集并训练评估了多种提取模型,最终通过150M参数的ModernBERT模型在词级F1得分上达到53.6,优于最强的LLM提取器。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏