arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-29 至 2026-04-29 共收录 226 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 29 篇

2601.09093 2026-04-29 cs.LG 70%

Hidden States as Early Signals: Step-level Trace Evaluation and Pruning for Efficient Test-Time Scaling

隐藏状态作为早期信号:用于高效测试时间扩展的步骤级追踪评估与剪枝

Zhixiang Liang, Beichen Huang, Zheng Wang, Minjia Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出STEP框架,通过评估隐藏状态实现步骤级追踪剪枝,有效降低推理延迟并提升推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14910 2026-04-29 cs.PF cs.AR 67%

PipeWeave: Synergizing Analytical and Learning Models for Unified GPU Performance Prediction

PipeWeave:融合分析与学习模型的统一GPU性能预测

Kaixuan Zhang, Yunfan Cui, Shuhao Zhang, Chutong Ding, Shiyou Qian, Luping Wang, Jian Cao, Guangtao Xue, Cheng Huang, Guodong Yang, Liping Zhang

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 PipeWeave通过结合分析模型与机器学习模型,实现高精度的GPU性能预测,其在多个GPU架构上的测试表明,其预测准确率和泛化能力优于现有方法。

Comments Accepted to ISCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21101 2026-04-29 cs.LG cs.NA math.NA 57%

A Hybridizable Neural Time Integrator for Stable Autoregressive Forecasting

一种用于稳定自回归预测的混合神经时间积分器

Brooks Kinch, Xiaozhe Hu, Yilong Huang, Martine Dyring Hansen, Sunniva Meltzer, Nathaniel Donald Hamlin, David Sirajuddin, Eric C. Cyr, Nathaniel Trask

机构 * Mechanical Engineering and Applied Mechanics, University of Pennsylvania(宾夕法尼亚大学机械工程与应用力学系) Department of Mathematics, Tufts University(塔夫茨大学数学系) Department of Mathematics and Cybernetics, SINTEF Digital(SINTEF数字技术部门数学与控制系) Department of Mathematical Sciences, Norwegian University of Science and Technology(挪威科技大学数学科学系) Department of Physics, University of Oslo(奥斯陆大学物理系) Sandia National Laboratories(桑地亚国家实验室)

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 本文提出一种混合技术,将自回归变压器嵌入新型射击基混合有限元方案中,通过暴露拓扑结构实现可证明的稳定性,结合视觉Transformer实现结构保持动力学,以65倍减少的参数优于现代基础模型,实现混沌系统的长时预测。

Comments 29 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25409 2026-04-29 cs.CL 57%

Scaling Probabilistic Transformer via Efficient Cross-Scale Hyperparameter Transfer

通过高效的跨尺度超参数转移扩展概率变换器

Penghao Kuang, Haoyi Wu, Kewei Tu

机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 本文通过maximal update parametrization方法,将概率变换器参数扩展至0.4B规模,在相同参数预算下,MLM任务中性能优于标准变换器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20006 2026-04-29 eess.AS cs.AI cs.SD 57%

BERT-APC: A Reference-free Framework for Automatic Pitch Correction via Musical Context Inference

BERT-APC:一种基于音乐上下文推断的无参考自动音高修正框架

Sungjae Kim, Kihyun Na, Jinyoung Choi, Injung Kim

机构 * Computer Science and Electrical Engineering Department, Handong Global University(计算机科学与电气工程系,韩东全球大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 BERT-APC通过音乐上下文推断实现无参考自动音高修正,结合静态音高预测和上下文感知音高预测,提升音质与表达性,优于现有方法。

Comments 14 pages, 8 figures, 8 tables. Accepted for publication in IEEE Transactions on Audio, Speech, and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24997 2026-04-29 cs.CV 50%

DouC: Dual-Branch CLIP for Training-Free Open-Vocabulary Segmentation

DouC:基于双分支CLIP的无训练开放词汇分割

Mohamad Zamini, Diksha Shukla

机构 * Department of Electrical Engineering and Computer Science, University of Wyoming, Laramie, WY, USA(电气工程与计算机科学系,怀俄明大学,拉勒米,怀俄明州,美国)

专题命中 效率与部署 :foundation model(abstract)

AI总结 DouC提出无训练双分支CLIP框架,通过分解密集预测为互补组件,结合轻量级推理时标记门控提升补丁可靠性,以及通过冻结视觉基础模型引导的代理注意力注入外部结构先验,实现局部标记可靠性与结构感知补丁交互的联合影响,无需额外参数和重训练。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 领域大模型 19 篇

2604.25297 2026-04-29 cs.CL cs.AI 92%

LegalMidm: Use-Case-Driven Legal Domain Specialization for Korean Large Language Model

LegalMidm: 面向韩国法律领域的用例驱动型法律领域专业化

Youngjoon Jang, Chanhee Park, Hyeonseok Moon, Young-kyoung Ham, Jiwon Moon, Jinhyeon Kim, JuKyung Jung, Heuiseok Lim

机构 * Department of Computer Science and Engineering, Korea University(韩国大学计算机科学与工程系) KT (Korea Telecom)(韩国电信)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于法律领域实际需求的系统训练框架,开发了韩国法律领域的LLM LegalMidm,并通过与法律专业人士合作和严格数据筛选,构建高质量的用例驱动型法律数据集和优化训练流程。

Comments ICLR 2026 DATA-FM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14807 2026-04-29 cs.AI cs.CL 90%

The LLM Fallacy: Misattribution in AI-Assisted Cognitive Workflows

大语言模型谬误:人工智能辅助认知工作流中的误归因

Hyunwoo Kim, Harin Yu, Hanau Yi

机构 * ddai Inc.(ddai公司)

专题命中 领域大模型 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨大语言模型使用如何导致用户错误归因自身能力,提出LLM谬误概念,分析其在认知、语言、分析和创作领域的影响,并提出教育、招聘和AI素养的启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25639 2026-04-29 cs.CY cs.AI 88%

Large language models eroding science understanding: an experimental study

大语言模型侵蚀科学理解:一项实验研究

Harry Collins, Hartmut Grote, Paul Newbury, Patrick Sutton, Simon Thorne

机构 * Springer Nature

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文研究大语言模型是否能可靠回答科学问题,并展示其易受边缘科学材料影响。通过修改模型优先考虑特定边缘论文,发现其回答与专家和标准模型相比存在矛盾,凸显模型易受操控的风险。

Comments Under review in AI and Ethics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24987 2026-04-29 cs.AI 83%

Assessing Y-Axis Influence: Bias in Multimodal Language Models on Chart-to-Table Translation

评估Y轴影响:多模态语言模型在图表到表格翻译中的偏差

Seok Hwan Song, Azher Ahmed Efat, Wallapak Tavanapong

机构 * Department of Computer Science, Iowa State University(计算机科学系,爱荷华州立大学)

专题命中 领域大模型 :language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 研究探讨了多模态语言模型在图表到表格翻译中因Y轴信息不平衡导致的偏差问题,提出FairChart2Table框架,发现数字长度、刻度数量、值范围及刻度格式等影响模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22067 2026-04-29 cs.CL cs.AI 82%

Optimal Question Selection from a Large Question Bank for Clinical Field Recovery in Conversational Psychiatric Intake

从大规模问题库中选择最优问题以实现临床场景中的对话恢复

Guan Gui, Peter Zandi, Jacob Taylor, Ananya Joshi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个基于临床问题库的问题选择框架,通过对比随机提问、临床基线和LLM引导策略,发现结构化问题和适应性策略能显著提升临床对话信息恢复效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03266 2026-04-29 cs.CL cs.AI 79%

Benchmarking and Adapting On-Device LLMs for Clinical Decision Support

对设备大语言模型在临床决策支持中的基准测试与适应性研究

Alif Munim, Jun Ma, Omar Ibrahim, Alhusain Abdalla, Shuolin Yin, Leo Chen, Bo Wang

机构 * AI Collaborative Centre, University Health Network(人工智能协同中心,健康大学网络) Princess Margaret Cancer Centre, University Health Network(彭菲癌症中心,健康大学网络) Department of Electrical and Computer Engineering, University of Toronto(电气与计算机工程系,多伦多大学) Division of Urology, Department of Surgery, St. Michael’s Hospital, Unity Health Toronto and University of Toronto(泌尿科,外科部,圣米歇尔医院,统一健康多伦多及多伦多大学) Peter Munk Cardiac Centre, University Health Network(彼得·默克心脏中心,健康大学网络) Department of Laboratory Medicine and Pathobiology and Department of Computer Science, University of Toronto(实验室医学与病理学系及计算机科学系,多伦多大学) Vector Institute, Toronto(向量研究所,多伦多)

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过基准测试和微调,评估了多种设备端大语言模型在临床任务中的性能,发现其在诊断准确率上可与开源模型和专有模型相媲美,并展示了微调对提升诊断准确性的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25199 2026-04-29 cond-mat.mtrl-sci cond-mat.str-el cs.AI cs.LG physics.comp-ph 73%

Kohn-Sham Hamiltonian from Effective Field Theory: Quasiparticle Band Narrowing from Frozen Core Dynamics

从有效场论看Kohn-Sham哈密顿量:冻结核心动力学导致的准粒子带变窄

Xiansheng Cai, Han Wang, Kun Chen

机构 * Institute of Theoretical Physics, Chinese Academy of Sciences, Beijing 100190, China(中国科学院理论物理研究所,北京100190,中国)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文通过有效场论揭示Kohn-Sham带宽与ARPES测量的差异,提出冻结核心修正因子,解决准粒子带宽问题,验证了第一性原理智能科学方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02709 2026-04-29 cs.CL cs.AI 73%

Sensory-Aware Sequential Recommendation via Review-Distilled Representations

通过评论蒸馏表示实现感知-aware的序列推荐

Yeo Chan Yoon, Chanjun Park, Kyuhan Koh

机构 * Jeju National University(济州国立大学) Soongsil University(顺斯大学) California State University Stanislaus(加州州立大学斯坦尼斯劳斯分校)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种感知-aware的序列推荐框架,通过语言提取的产品评论中的感官属性来增强物品表示。ASER方法通过离线提取和蒸馏流程,利用预训练语言模型生成结构化的感官属性值对,并将其转化为紧凑的嵌入表示,提升推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11100 2026-04-29 cs.AI 70%

ReCreate: Reasoning and Creating Domain Agents Driven by Experience

ReCreate:基于经验的推理与创造领域代理框架

Zhezheng Hao, Hong Wang, Jian Luo, Jianqing Zhang, Yuyan Zhou, Qiang Lin, Can Wang, Hande Dong, Jiawei Chen

机构 * Zhejiang University(浙江大学) Tencent(腾讯) Independent Researcher(独立研究者) Shanghai Jiao Tong University(上海交通大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ReCreate框架,通过利用代理交互历史,自动创建和适应领域代理,优于人类设计和现有自动化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25296 2026-04-29 cs.CL 70%

Learning from Medical Entity Trees: An Entity-Centric Medical Data Engineering Framework for MLLMs

从医学实体树学习:一种以实体为中心的医疗数据工程框架用于多模态大语言模型

Jianghang Lin, Haihua Yang, Deli Yu, Kai Wu, Kai Ye, Jinghao Lin, Zihan Wang, Yuhang Wu, Liujuan Cao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, China(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学,中国) ByteDance(字节跳动) Northeastern University(东北大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出以实体为中心的医疗数据工程框架,通过构建医学实体树,提升多模态大语言模型在医疗领域的表现,通过实体引导检索、双重过滤和知识感知数据合成等方法,增强模型处理复杂临床问题的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22762 2026-04-29 cs.IR cs.AI 70%

Behavioral Intelligence Platforms: From Event Streams to Autonomous Insight via Probabilistic Journey Graphs, Behavioral Knowledge Extraction, and Grounded Language Generation

行为智能平台:通过概率旅程图、行为知识提取和 grounded 语言生成从事件流到自主洞察

Arun Patra, Bhushan Vadgave

机构 * Journium, Inc.(Journium公司)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出行为智能平台BIP,通过概率旅程图、行为知识提取和 grounded 语言生成,将原始事件流转化为自动洞察,解决传统主动查询模式的瓶颈问题。

Comments v2: corrected numerical values in Fig 3 and Sec 7.2 fact bundle to match published simulation scripts; clarified Markov-property identity in Sec 4.2.2; added simulate_trajectories.py for Monte Carlo reproducibility; softened confidence and path-quality presentation; added Markov-attribution citations (Anderl 2016, Shao & Li 2011, Kakalejcik 2022). Formal results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25648 2026-04-29 cs.CY 67%

Curiosity and Metacognition: Towards a Unified Framework for Learning and Education in the Age of AI

好奇心与元认知:迈向人工智能时代的学习与教育统一框架

Chloé Desvaux, Rania Abdelghani, Pierre-Yves Oudeyer, Hélène Sauzéon

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 本文探讨了好奇心与元认知在自主学习中的作用,提出整合行为、计算与心理教育维度的统一框架,并评估了提升课堂好奇心的干预措施,指出生成式AI对好奇心驱动学习的潜在影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15697 2026-04-29 eess.SY cs.SY 67%

Integrating AI and Simulation for Teaching Power System Dynamics: An Interactive Framework for Engineering Education

将人工智能与模拟整合用于教学电力系统动力学:一种用于工程教育的交互框架

Osasumwen Cedric Ogiesoba-Eguakun, Phani Kumar Inkollu, Rupesh Sah, Zia Rashid, Douglas Jussaume, Suman Rath

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 本文提出一种结合模拟与智能反馈的人工智能交互学习框架,通过实时互动提升学生对电力系统动力学的理解与参与度。

Comments 2 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23829 2026-04-29 cs.AI 57%

Domain-Filtered Knowledge Graphs from Sparse Autoencoder Features

从稀疏自编码器特征中提取领域过滤的知识图谱

John Winnicki, Abeynaya Gnanasekaran, Eric Darve

机构 * Institute for Computational and Mathematical Engineering, Stanford University(计算与数学工程研究所,斯坦福大学)

专题命中 领域大模型 :language model(abstract);分类 cs.AI

AI总结 本文提出通过对比激活和多阶段过滤构建领域特定概念集,并构建共现图和转换机制图,将稀疏自编码器特征转化为可读的知识图谱,揭示模型知识结构和推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25256 2026-04-29 cs.AI 57%

AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature Discovery

AutoResearchBench:基于复杂科学文献发现的AI代理基准测试

Lei Xiong, Kun Luo, Ziyi Xia, Wenbo Zhang, Jin-Ge Yao, Zheng Liu, Jingying Shao, Jianlyu Chen, Hongjin Qian, Xi Yang, Qian Yu, Hao Li, Chen Yue, Xiaan Du, Yuyang Wang, Yesheng Liu, Haiyu Xu, Zhicheng Dou

机构 * AutoResearchBench Team(AutoResearchBench团队)

专题命中 领域大模型 :LLM(abstract_cn);分类 cs.AI

AI总结 本文提出AutoResearchBench,用于评估AI代理在复杂科学文献发现中的能力,包含深度研究和广泛研究两种任务,相比现有代理网络浏览基准,其研究导向、文献聚焦和开放性特征使其更具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24807 2026-04-29 cs.CY cs.AI cs.MA 57%

From Prototype to Classroom: An Intelligent Tutoring System for Quantum Education

从原型到课堂:面向量子教育的智能辅导系统

Iizalaarab Elhaimeur, Nikos Chrisochoides

机构 * Center for Real-Time Computing(实时计算中心) Computer Science Department(计算机科学系) Old Dominion University(旧 Dominion 大学) Physics Departments(物理系)

专题命中 领域大模型 :LLM(abstract);分类 cs.AI

AI总结 本文提出ITAS系统,通过多智能体架构和课程设计解决量子教育中的可靠性问题,验证系统在真实课堂中的可行性及教学分析能力。

Comments 10 pages, 6 figures, 1 table. Submitted to IEEE QCE 2026. Companion papers (in preparation): ITAS architecture and latency analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25255 2026-04-29 cs.CV 50%

Personalized Cross-Modal Emotional Correlation Learning for Speech-Preserving Facial Expression Manipulation

面向语音保留的面部表情操控的个性化跨模态情感相关学习

Tianshui Chen, Yujie Zhu, Jianman Lin, Zhijing Yang, Chunmei Qing, Feng Gao, Liang Lin

机构 * Guangdong University of Technology(广东工业大学) South China University of Technology(华南理工大学) Peking University(北京大学) Sun Yat-Sen University(中山大学)

专题命中 领域大模型 :language model(abstract)

AI总结 本文提出PCMECL算法,通过个性化提示和特征差分提升跨模态对齐,解决面部表情操控中情感操控的监督问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24876 2026-04-29 cs.CV 50%

ESICA: A Scalable Framework for Text-Guided 3D Medical Image Segmentation

ESICA:一种可扩展的文本引导3D医学图像分割框架

Yu Xin, Gorkem Can Ates, Jun Ma, Sumin Kim, Ying Zhang, Kaleb E Smith, Kuang Gong, Wei Shao

机构 * University of Florida(佛罗里达大学) University of Toronto(多伦多大学) NVIDIA Corporation(NVIDIA公司)

专题命中 领域大模型 :pretraining(abstract)

AI总结 本文提出ESICA框架,通过改进的掩码预测、高效解码器和双阶段训练策略,实现高效且可扩展的文本引导3D医学图像分割,提升分割精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05330 2026-04-29 cs.CV 50%

MTPano: Multi-Task Panoramic Scene Understanding via Label-Free Integration of Dense Prediction Priors

MTPano:通过无标签集成密集预测先验实现多任务全景场景理解

Jingdong Zhang, Xiaohang Zhan, Lingzhi Zhang, Yizhou Wang, Zhengming Yu, Jionghao Wang, Wenping Wang, Xin Li

机构 * Texas A\&M University(德克萨斯农工大学) Adobe(Adobe公司)

专题命中 领域大模型 :foundation model(abstract)

AI总结 本文提出MTPano,通过无标签集成密集预测先验解决全景场景理解中的数据稀缺和任务干扰问题,采用双桥网络和ERP令牌混合器提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 知识编辑与模型理解 13 篇

2604.25011 2026-04-29 cs.CL 93%

Why Does Reinforcement Learning Generalize? A Feature-Level Mechanistic Study of Post-Training in Large Language Models

为什么强化学习能够泛化?对大语言模型后训练的特征层面机制研究

Dan Shi, Zhuowen Han, Simon Ostermann, Renren Jin, Josef van Genabith, Deyi Xiong

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院TJUNLP实验室) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Saarland University(萨尔兰大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);SFT(abstract,abstract_cn)

AI总结 研究通过对比强化学习与监督微调在大语言模型中的表现,揭示其泛化机制,发现强化学习通过持续演变的特征保持基模型表示,而监督微调引入稳定但专用的特征。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10692 2026-04-29 cs.CL 90%

Unconditional Truthfulness: Learning Unconditional Uncertainty of Large Language Models

无条件真实性:学习大语言模型的无条件不确定性

Artem Vazhentsev, Ekaterina Fadeeva, Rui Xing, Gleb Kuzmin, Ivan Lazichny, Alexander Panchenko, Preslav Nakov, Timothy Baldwin, Maxim Panov, Artem Shelmanov

机构 * MBZUAI Skoltech(斯克利切夫斯基因工大学) AIRI ETH Zürich(苏黎世联邦理工学院) The University of Melbourne(墨尔本大学) FRC CSC RAS(俄罗斯科学院计算技术研究所)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出通过学习注意力特征来解决大语言模型生成过程中不确定性评分的难题,通过两阶段训练方法提升了选择性生成的效果,优于其他无监督和监督方法。

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14427 2026-04-29 cs.CL 89%

Token-Level Density-Based Uncertainty Quantification Methods for Eliciting Truthfulness of Large Language Models

基于令牌密度的不确定性量化方法用于获取大语言模型的真实性

Artem Vazhentsev, Lyudmila Rvanova, Ivan Lazichny, Alexander Panchenko, Maxim Panov, Timothy Baldwin, Artem Shelmanov

机构 * Skoltech(斯克里普切尔技术学院) AIRI(人工智能研究所) MBZUAI(马斯克商学院人工智能研究所) MIPT(莫斯科国立信息技术机械与光学学院) FRC CSC RAS(俄罗斯科学院远东分院计算机科学与控制学院) The University of Melbourne(墨尔本大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出一种基于令牌密度的不确定性量化方法,通过提取多层嵌入并计算Mahalanobis距离,提升文本生成和事实核查任务的不确定性评估精度与效率。

Journal ref Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25591 2026-04-29 eess.AS cs.AI cs.CL cs.LG cs.SD 89%

Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models

穿越不确定性:音频感知大语言模型不确定性估计的实证研究

Chun-Yi Kuan, Wei-Ping Huang, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(台湾大学通讯工程研究所) Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan(台湾大学人工智能卓越研究中心)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了音频感知大语言模型的不确定性估计,通过多种方法对比发现语义层面方法在通用音频推理中表现更优,且在可靠性导向任务中效果依赖模型和基准。

Comments Manuscript in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25167 2026-04-29 cs.AI 88%

From Insight to Action: A Novel Framework for Interpretability-Guided Data Selection in Large Language Models

从洞察到行动:一种新的框架,用于基于可解释性指导的数据选择在大语言模型中

Ling Shi, Xinwei Wu, Xiaohu Zhao, Hao Wang, Heng Liu, Yangyang Liu, Linlong Xu, Longyue Wang, Deyi Xiong, Weihua Luo

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University, China(天津大学计算机科学与技术学院TJUNLP实验室,中国) Alibaba Group, China(阿里巴巴集团,中国)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出IGDS框架,通过内部任务特征识别和选择共振数据来提升大语言模型性能,实验显示在数学推理任务中数据效率提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏