arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-08 至 2026-07-08 共收录 263 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 38 篇

2606.14048 2026-07-08 cs.CV cs.RO 新提交 50%

WAM4D: Fast 4D World Action Model via Spatial Register Tokens

WAM4D:通过空间注册令牌实现快速4D世界动作模型

Ying Li, Xiaobao Wei, Jiajun Cao, Hao Wang, Xiaowei Chi, Chengyu Bai, Qianpu Sun, Jiajun Li, Xiaojie Zhang, Peidong Jia, Jian Tang, Sirui Han, Shanghang Zhang

机构 * Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出WAM4D,利用轻量级空间注册令牌将预训练几何先验迁移至因果视频-动作变换器,实现高效4D世界动作建模,在RoboTwin 2.0和真实操作任务中提升空间一致性并保持快速推理。

Comments 15 pages, 7figures, 9tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27932 2026-07-08 cs.CV 版本更新 50%

Dynamic Cluster Data Sampling for Efficient and Long-Tail-Aware Vision-Language Pre-training

动态聚类数据采样用于高效且长尾感知的视觉-语言预训练

Mingliang Liang, Zhuoran Liu, Arjen P. de Vries, Martha Larson

机构 * Institute for Computing and Information Sciences(计算与信息科学研究所)

专题命中 效率与部署 :language model(abstract)

AI总结 本文提出动态聚类采样方法DynamiCS,通过动态调整数据分布平衡语义长尾概念,降低训练成本并提升长尾概念表现。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 领域大模型 22 篇

2410.14074 2026-07-08 cs.CL 版本更新 88%

Transferring Natural Language Datasets Between Languages Using Large Language Models for Modern Decision Support and Sci-Tech Analytical Systems

使用大语言模型在语言之间转移自然语言数据集以用于现代决策支持和科技分析系统

Dmitrii Popov, Egor Terentev, Danil Serenko, Ilya Sochenkov, Igor Buyanov

机构 * Faculty of Physics and Mathematics and Natural Sciences, RUDN University(俄罗斯人民友谊大学物理与数学及自然科学学院) Institute for Information Transmission Problems of the Russian Academy of Sciences(俄罗斯科学院信息传输问题研究所) Ivannikov Institute for System Programming of the Russian Academy of Sciences(俄罗斯科学院伊万诺夫系统编程研究所)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究如何用大语言模型在语言间转移自然语言数据集,以助力研发决策。通过英语和俄语对实验翻译DEFT语料库,提供注释转移管道,并在翻译数据集上训练基于BERT的模型建立基线,推动不同语言间知识共享。

Journal ref Big Data Cogn. Comput. 2025, 9(5), 116

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18181 2026-07-08 cs.IR cs.AI cs.CY 新提交 87%

IUU+DB: Tracking Illegal, Unreported, and Unregulated Fishing, Seafood Fraud, and Labor Abuse through LLM-driven Information Extraction

IUU+DB:通过LLM驱动的信息提取追踪非法、不报告和不管制捕捞、海鲜欺诈和劳工虐待

Henry Bodwell, Hong Yang, John C. Simeone, Kelvin Gorospe, Bella Sullivan, Lana Huang, Jessica Gephart, Sandy Aylesworth, Molly Masterton, Naren Ramakrishnan

机构 * University Of Washington(华盛顿大学)

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出IUU+概念扩展非法捕捞定义,并构建基于大语言模型的IUU+DB系统,从异构文档中自动提取事件关键信息,支持去重和趋势分析,为渔业监管和研究提供数据支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15932 2026-07-08 cs.CV 版本更新 86%

NAMD: Virtual Follow-up Computed Tomography Synthesis via Nodule-Aligned Multimodal Diffusion Models for Early Lung Cancer Diagnosis

基于LLM驱动多模态扩散的结节对齐潜在空间学习:用于肺结节进展预测

James Song, Yifan Wang, Chuan Zhou, Liyue Shen

机构 * Department of EECS, University of Michigan(电子工程与计算机科学系,密歇根大学) University of Michigan Medical School(密歇根大学医学学院)

专题命中 领域大模型 :LLM(title_cn,summary_cn)

AI总结 本文提出NAMD框架,通过生成1年随访CT图像预测肺结节进展,利用结节对齐潜在空间和LLM驱动控制机制,在NLST数据集上实现优于基线和现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05808 2026-07-08 cs.CY 新提交 83%

Say What? Examining Text and Voice Input Modalities for Prompt-Based Programming in Computing Education

说什么?审视计算教育中基于提示的编程的文本和语音输入方式

Kaitlin Riegel, Yan Cathy Hua, Paul Denny, Victor-Alexandru Pădurean, Juho Leinonen, James Prather, Adish Singla

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 探索编程入门学生用文本或语音输入解决提示问题的情况,发现输入文本提示的学生更易首次尝试成功,多数学生偏好文本,定性分析揭示学生对两种输入方式的看法及优缺点,为计算教育多模态工具和教学设计提供启示。

Comments ITiCSE'26 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05880 2026-07-08 cs.CV cs.AI 新提交 83%

Harrison.Rad 1.5 Technical Report: A radiology foundation model that can draft reports from images, priors and clinical context

哈里森.Rad 1.5技术报告:一种可根据图像、先验知识和临床背景起草报告的放射学基础模型

Suneeta Mall, Vladimir Nekrasov, Ashnil Kumar, Sajith Karunasena, Aiden Nibali, Alix Bird, Mateo Diaz Shine, Jarrel Seah

专题命中 领域大模型 :foundation model(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对放射科报告积压问题,提出HR1.5多模态大语言模型,通过三阶段训练,用特定评分框架评估,该模型是唯一达模拟FRCR及格标准的系统,在多方面准确率最高,还研究了可解释性等以支持临床应用评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13808 2026-07-08 cs.CV 版本更新 82%

VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models

VisCoP:用于视觉语言模型视频域适应的视觉探测

Dominick Reilly, Manish Kumar Govind, Le Xue, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳州立大学查塔努加分校) Elorian AI(Elorian人工智能公司)

专题命中 领域大模型 :language model(title,abstract);pretraining(abstract)

AI总结 研究针对视觉语言模型在新领域性能下降问题,提出参数高效的VisCoP框架,通过可学习视觉探测器增强视觉编码器,在多种适应设置下评估,该框架优于现有策略,能有效适应新领域且保留源域能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06080 2026-07-08 cs.CL cs.AI cs.SI 新提交 81%

From Blueprint to Reality: Modeling and Applying Putnam's Social Capital Theory with LLM-based Multi-agent Simulations

从蓝图到现实:基于大语言模型的多智能体模拟对普特南社会资本理论的建模与应用

Shiyi Ling, Zhi Zheng, Hui Zheng, Wenjun Xue, Feng Ye, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学) Anhui University(安徽大学) North Automatic Control Technology Institute(北方自动控制技术研究所)

专题命中 领域大模型 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 研究利用基于大语言模型的多智能体模拟框架SocaSim,对普特南社会资本理论进行建模与应用,通过构建特定环境及智能体实验分析智能老年护理挑战,重现宏观模式且具微观因果路径可解释性,弥合了社会科学与计算机科学。

Comments 23 pages, 13 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05764 2026-07-08 cs.CL cs.IR 新提交 79%

Inject or Navigate? Token-Efficient Retrieval for LLM Analysis of Transactional Legal Documents

注入还是导航?用于交易法律文件大语言模型分析的令牌高效检索

Mahmoud Hany, Mourad ElSheraey, Mahmoud Said, Peter Naoum

机构 * Syntheia Pty Ltd(合成有限公司)

专题命中 领域大模型 :LLM(title,abstract);分类 cs.CL

AI总结 研究如何在交易法律文件分析中高效检索,对比全语料库注入与两种结构化检索模式(NAVEMBED和NAVINDEX),发现NAVINDEX在令牌占用、上下文及成本方面优势明显,还得出缓存交叉规则。

Comments 17 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05956 2026-07-08 cs.AI cs.CL 新提交 79%

Integrating knowledge graphs and multilingual scholarly corpora for domain-adaptive LLMs in SSH

将知识图谱和多语言学术语料库集成用于社会科学与人文领域的领域自适应语言模型

Adam Faci, Alessio Miaschi, Anne Combe, Pascal Cuxac, Francesca Frontini, Nicolas Larrousse, Stéphane Pouyllau

机构 * Huma-Num, CNRS(人文数字实验室,法国国家科学研究中心) CNR - Institute for Computational Linguistics “A. Zampolli” (CNR-ILC)(意大利国家研究委员会 - 计算语言学“ A. 赞波利”研究所(CNR-ILC)) Inria(法国国家信息与自动化研究所) Inist, CNRS(法国国家科学研究中心人文社会科学信息研究所)

专题命中 领域大模型 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文针对LLMs集成到SSH科研工作流程的挑战,介绍欧洲项目LLMs4EU和ALT-EDIC基础设施中的用例,通过遵循特定协议的评估框架,将模型适配嵌入相关框架,探索领域敏感且合规的生成式AI对SSH学术研究的支持。

Comments 8 pages, 4 tables, workshop LLMs4SSH of LREC 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19458 2026-07-08 cs.AI cond-mat.mtrl-sci 版本更新 77%

VASP Agent: An Agentic Framework for Autonomous First-principles Calculations

VASP智能体:一种用于自主第一性原理计算的智能框架

Zeyu Xia, Jinzhe Ma, Congjie Zheng, Zhongyao Wang, Shufei Zhang, Yuqiang Li, Hang Su, P. Hu, Changshui Zhang, Xingao Gong, Wanli Ouyang, Lei Bai, Dongzhan Zhou, Mao Su

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Department of Computer Science and Technology(计算机科学与技术系) School of Physical Science and Technology(物理科学与技术学院) Department of Automation(自动化系) Beijing National Research Center for Information Science and Technology (BNRist)(北京信息科学与技术国家研究中心) School of Chemistry and Chemical Engineering(化学与化工学院) Key Laboratory of Computational Physical Sciences (Ministry of Education)(计算物理科学重点实验室) The Chinese University of Hong Kong(香港中文大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对第一性原理材料计算对自主性的高要求,提出VASP智能体系统,结合多种技能和工具执行多步VASP计算,经多任务评估,其计算结果更优,还能诊断并恢复计算错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19777 2026-07-08 cs.SE 版本更新 75%

Independent Test Generation for RESTful APIs

用于RESTful API的独立测试生成

S M Sadrul Islam Asif, James Chen, Kennett Puerto Diaz, Earl T. Barr, Mark Marron

专题命中 领域大模型 :LLM(summary_cn,abstract_cn)

AI总结 研究针对RESTful API测试中多步骤测试的问题,提出TECTON方法,通过显式状态合成及两种互补机制,利用组合测试和LLM处理请求组件,生成高覆盖率测试负载,相比传统方法提升了行覆盖率并暴露更多运行时错误,推动API验证技术进步。

Comments This paper was previously posted on arXiv under the title "BOSQTGEN: Breaking the Sound Barrier in Test Generation"

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12569 2026-07-08 cs.CL cs.AI 新提交 73%

eCREAM-MedCorpus A Large-Scale Corpus of Clinical Notes for Italian

EDEN:意大利语临床笔记的大规模语料库

Tiziano Labruna, Guido Bertolini, Pietro Ferrazzi, Bernardo Magnini

机构 * Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) Istituto di Ricerche Farmacologiche Mario Negri IRCCS(马里奥·内格里药理研究所IRCCS) University of Padua(帕多瓦大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文介绍EDEN,一个大规模意大利语急诊临床笔记语料库,包含约400万份匿名笔记及6000份专家标注数据,用于支持大语言模型在医疗中的应用,并提出了CRF填充作为新的结构化信息提取基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05685 2026-07-08 cs.HC cs.AI 新提交 70%

Depression Symptoms and Relational Patterns in 187k ChatGPT Histories

18.7万条ChatGPT对话记录中的抑郁症状与关系模式

Neil K. R. Sehgal, Dunigan Folk, Lyle Ungar, Sharath Chandra Guntuku

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究有抑郁症状者如何使用ChatGPT,通过分析766名参与者的18.7万条对话,比较不同症状程度人群的使用模式、语言特点等,发现基于语言预测筛查效果不佳,认为这些记录可作大语言模型成非正式支持设施的证据。

Journal ref CSCW Companion '26: Companion Publication of the 2026 Conference on Computer-Supported Cooperative Work and Social Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13566 2026-07-08 cs.AI 新提交 70%

A Three-Layer Framework for AI in Scientific Discovery

人工智能在科学发现中的三层框架

Guojun Liao

机构 * Department of Mathematics, University of Texas at Arlington(德克萨斯大学阿灵顿分校数学系)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AI在科学发现中的三层框架,核心创新是第二层:通过定性推理进行模型形成,识别框架结构不足并寻找缺失概念,通过三个案例说明其重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17437 2026-07-08 cs.SE cs.LG 版本更新 70%

A semantic mutation metric for metamorphic relation adequacy in scientific computing programs

一种用于科学计算程序元突变关系充分性的语义突变度量

Meng Li, Xiaohua Yang, Jie Liu, Shiyu Yan

机构 * School of Computing, University of South China(南华大学计算机学院) Hunan Engineering Research Center of Software Evaluation and Testing for Intellectual Equipment(湖南软件测评与智能设备工程研究中心) CNNC Key Laboratory on High Trusted Computing(中核集团高可信计算重点实验室)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出了一种基于领域语义操作符的语义突变度量(SMS),旨在解决传统突变度量在科学计算中忽略领域语义的问题,通过引入五个领域语义操作符,提高了对元突变关系充分性的评估能力。

Comments 93 pages in elsarticle review mode (12pt double-spaced, ~28-35 pp typeset), 3 figures. Replication package: https://doi.org/10.5281/zenodo.20250664. Corresponding author: Meng Li (mlemon@usc.edu.cn)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05537 2026-07-08 stat.AP 新提交 67%

Prompt engineering using order-of-addition experiments: An application to generating two-level fractional factorial designs

使用加法顺序实验的提示工程:在生成二级部分因子设计中的应用

Duoduo Danny Ying, Alan R. Vazquez, Hongquan Xu

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 针对大语言模型的顺序依赖问题,引入用加法顺序实验量化提示元素排序效应及确定最佳位置的方法,通过构建二级部分因子设计证明该方法可阐明顺序依赖,助力确定高质量提示配置。

Comments Main manuscript: 35 pages, 6 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05937 2026-07-08 cs.CL cs.LG 新提交 62%

Is Domain Adaptation Always Helpful? A Frozen-Backbone Study of Cross-Domain Sentiment Transfer

域适应总是有帮助吗?跨域情感转移的冻结主干研究

Phat Tran, Artin Lahni, Pranav Kulkarni, Yaolun Zhang

机构 * Oregon State University(俄勒冈州立大学)

专题命中 领域大模型 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨使用冻结预训练语言模型主干时显式域适应的效果,通过训练轻量级MLP适配器并评估向不同领域转移,发现域适应效果因主干对目标域覆盖情况而异,对抗对齐对域专用主干有负面影响,监督对比损失有积极作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06364 2026-07-08 cs.CL cs.CR 新提交 57%

Automated Compliance Mapping in Cloud Security with Domain-Adapted Sentence Transformers

基于领域适应句子变换器的云安全自动化合规映射

John Bianchi, Luca Petrillo, Fabio Martinelli, Marinella Petrocchi

机构 * Institute for Informatics and Telematics (IIT-CNR)(信息与电信研究所(意大利国家研究委员会信息与电信研究所)) IMT School for Advanced Studies Lucca(卢卡高等研究院) Institute for High Performance Computing and Networking (ICAR-CNR)(高性能计算与网络研究所(意大利国家研究委员会高性能计算与网络研究所))

专题命中 领域大模型 :LLM(abstract);分类 cs.CL

AI总结 研究云安全控制到技术指标的映射自动化问题,核心方法是对句子变换器模型进行领域适应,构建并扩展训练语料库,微调五种架构,在两个任务上评估性能,主要贡献是模型优于零样本基线,证明领域内训练数据对性能的重要性。

Comments 10 pages, 6 figures. Submitted to the 30th International Conference on Knowledge-Based and Intelligent Information & Engineering Systems (KES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02714 2026-07-08 cs.CR cs.AI 新提交 57%

Not All Refusals Are Equal: How Safety Alignment Fails Cybersecurity at Scale

并非所有拒绝都是等同的:安全对齐如何在大规模情况下使网络安全失败

Vadym Hadetskyi, Dario Pasquini, Artem Sorokin

机构 * Cracken AI

专题命中 领域大模型 :LLM(abstract);分类 cs.AI

AI总结 研究安全对齐在网络安全领域的问题,通过对24个开源语言模型的实验,以Kimi K2为例展示特定领域删减可行,探讨模型特征与删减效果的关联并分类模型,提出相关猜想。

Comments 14 pages, 11 figures. Under review at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06271 2026-07-08 cs.DS 新提交 50%

A Unique Normal Form for Tensor Trains over Arbitrary Fields

任意域上张量列的唯一范式

Renaud Vilmart

专题命中 领域大模型 :prompting(abstract)

AI总结 研究任意域上张量列的可约性问题,提出唯一范式及多项式时间约简策略,能从完整张量提取范式、获取相关索引值并给出大小上限,加强其作为形式工具的应用,扩展张量网络形式主义到更一般设置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05762 2026-07-08 cs.SE hep-ex hep-ph 新提交 50%

Articulating Assumptions in AI-Generated Scientific Analyses through Task Decomposition

通过任务分解阐明人工智能生成的科学分析中的假设

Ahmed Hammad, Mihoko Nojiri

专题命中 领域大模型 :LLM(abstract)

AI总结 研究旨在解决大语言模型生成的科学分析结果的可理解性和可重现性问题,通过引入基于数量的语义差异多智能体框架及相关模块,经对撞机物理分析验证,模块化任务分解提升了透明度与可靠性,还能让小模型执行完整流程。

Comments 20 pages, 1 figure and 4 tabels

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09846 2026-07-08 cs.SE cs.CY 版本更新 50%

Identifying and Prioritizing Generative AI Use Cases in an Organization: An Industrial Case Study

识别组织中生成式人工智能的用例并确定其优先级:一个行业案例研究

Malik Abdul Sami, Zeeshan Rasheed, Meri Olenius, Muhammad Waseem, Kai-Kristian Kemell, Jussi Rasku, Pekka Abrahamsson

专题命中 领域大模型 :LLM(abstract)

AI总结 本研究以能源公司为例,通过半结构化访谈等收集数据,分析员工对人工智能采用的理解,确定其有用领域及引入方式,为能源行业人工智能应用提供概述及实施切入点,助力跨行业比较研究。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 知识编辑与模型理解 13 篇

2510.23636 2026-07-08 cs.LG cs.AI cs.CL 版本更新 91%

LLM4Delay: Flight Delay Prediction via Cross-Modality Adaptation of Large Language Models and Aircraft Trajectory Representation

LLM4Delay:通过大语言模型与飞机轨迹表示的跨模态适应进行航班延误预测

Thaweerath Phisannupawong, Joshua Julian Damanik, Han-Lim Choi

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LLM4Delay框架,通过整合文本航空信息和轨迹数据,提升航班延误预测精度,展示出文本与轨迹数据互补的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28815 2026-07-08 cs.DL cs.AI cs.CL 版本更新 90%

Categorizing Mathematical Concepts with LLM Voting Ensembles in Mathswitch

使用Mathswitch中的LLM投票集成对数学概念进行分类

Katja Berčič, Slobodan Stanojevikj

机构 * Faculty of Mathematics and Physics, University of Ljubljana(卢布尔雅那大学数学与物理系) Institute of Mathematics, Physics and Mechanics(数学、物理与力学研究所)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出Mathswitch项目,利用LLM投票集成过滤从Wikidata等来源导入的噪声数学概念数据,通过正控制实验评估分类效果,并分析分类分歧类型。

Comments Submitted (pre-peer-review) version. Accepted at CICM 2026; the Version of Record will appear in Springer LNAI. We'll add the DOI once the proceedings are published

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05721 2026-07-08 cs.CL 新提交 89%

SpanUQ: Span-Level Uncertainty Quantification for Large Language Model Generation

SpanUQ:用于大语言模型生成的跨度级不确定性量化

Yimeng Zhang, Yingying Zhuang, Ziyi Wang, Yuxuan Lu, Pei Chen, Aman Gupta, Zhe Su, Ming Tan, Zhilin Zhang, Qun Liu, Manikandarajan Ramanathan, Rajashekar Maragoud, Edward Vul, Jing Huang, Dakuo Wang

机构 * Amazon(亚马逊) Northeastern University(东北大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 研究大语言模型生成的跨度级不确定性量化问题,提出SPANUQ轻量级探测器,通过混合贝塔分布估计不确定性,经特殊训练方式构建基准。实验显示其在不确定性质量、速度及错误定位上表现出色,且能在多个大语言模型上通用。

Comments The project page is available at https://damon-demon.github.io/SpanUQ.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05587 2026-07-08 cs.SE 新提交 87%

A Mechanistic Lens on Semantic Conflicts: Using Activation Patching to Understand LLM Behavior

语义冲突的机制视角:使用激活修补来理解大语言模型行为

Youssef Abdelsalam, Norman Peitek, Anna-Maria Maurer, Marvin Wyrich, Sven Apel

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型在语义冲突下的行为,构建Python代码片段三元组,用行为性能度量和残差流激活修补评估四个LLMs在输出预测和单元测试生成任务中的表现,发现语义冲突影响任务且相关信息集中,展示分析LLMs整合代码信息的框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06163 2026-07-08 cs.LG cs.AI 新提交 81%

X-FEMR: A Token-level Explainable Approach for Electronic Health Records Foundation Models using Transformer-based Models

X-FEMR:一种使用基于Transformer的模型对电子健康记录基础模型进行令牌级可解释的方法

Jie Huang, Pengfei Yin, Zihan Xu, Daniel Capurro, Mike Conway, Ting Dang

机构 * School of Computing and Information Systems, University of Melbourne(墨尔本大学计算与信息系统学院) Royal Melbourne Hospital(皇家墨尔本医院)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 针对电子健康记录基础模型是黑箱模型的问题,提出基于Transformer的令牌级可解释性方法,训练替代模型近似其行为,识别有影响力令牌,引入临床对齐度量,结果显示该方法能实现可解释且可信的临床人工智能。

Comments Accepted by IJCAI-ECAI 2026 AI and Health Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06224 2026-07-08 cs.LG 新提交 79%

Canopy: A Heterograph Foundation Model for Metabolic Engineering

Canopy:用于代谢工程的异构图基础模型

Jake Bowden, Laurence Legon, Satnam Surae

机构 * an in-house laboratory information management system (LIMS)(一个内部实验室信息管理系统(LIMS))

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 代谢工程中设计高产微生物菌株有挑战,Canopy异构图基础模型集成多数据源成知识图谱,用特定模型编码特征,经自监督目标预训练,在发酵滴度预测任务中表现优于基线。

Comments Accepted at ICML GenBio Workshop 2026 https://openreview.net/forum?id=H8bvgKoT7j

详情

展开后加载摘要…

URL PDF HTML 收藏