arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7550 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7550 篇

2601.21702 2026-05-18 cs.LG cs.CL 82%

Beyond Forgetting: Machine Unlearning Elicits Controllable Side Behaviors and Capabilities

超越遗忘:机器去学习引发可控的副作用和能力

Tien Dang, The-Hai Nguyen, Dinh Mai Phuong, Nguyen Minh Phuong, Anh Bui, Hoang Thanh-Tung, Le-Minh Nguyen, Naoya Inoue

机构 * Japan Advanced Institute of Science and Technology(日本先进科学研究所) Quantum AI and Cyber Security Institute(量子人工智能与网络安全研究所) FPT Corporation(FPT公司) Monash University(墨尔本大学) RIKEN(理化学研究所)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了通过去学习引发可控副作用和能力的现象,通过线性表示假设验证了该现象在行为控制和能力增强任务中的有效性。

Comments 36 pages, 19 tables, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13188 2026-05-14 stat.ML cs.CL cs.LG stat.ME 82%

LLMs as Implicit Imputers: Uncertainty Should Scale with Missing Information

大型语言模型作为隐式填补器:不确定性应与缺失信息成比例

Stef van Buuren

机构 * TNO - Netherlands Organization for Applied Scientific Research(荷兰应用科学研究院) Dept. of Methodology and Statistics, University of Utrecht(乌得勒支大学方法学与统计学系)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了大型语言模型在不完整上下文下的不确定性衡量,通过实验发现熵比置信度更能反映缺失信息的影响,且在不同证据水平上解释了更多准确性变化。

Comments 9 pages, 3 figures, 2 tables, NeurIPS 2026 position paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11436 2026-05-13 cs.CL cs.AI 82%

Agent-BRACE: Decoupling Beliefs from Actions in Long-Horizon Tasks via Verbalized State Uncertainty

Agent-BRACE: 通过 verbalized 状态不确定性解耦信念与行动以应对长 horizon 任务

Joykirat Singh, Zaid Khan, Archiki Prasad, Justin Chih-Yao Chen, Akshay Nambi, Hyunji Lee, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Microsoft Research(微软研究院)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Agent-BRACE 通过解耦信念状态模型与策略模型,利用强化学习优化,在长 horizon 部分可观测任务中提升性能,实现上下文窗口恒定且任务相关信息保留。

Comments Code: https://github.com/joykirat18/Agent-BRACE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24623 2026-04-28 cs.AI cs.IR cs.LG 82%

XGRAG: A Graph-Native Framework for Explaining KG-based Retrieval-Augmented Generation

XGRAG:一种用于基于知识图谱检索增强生成的图原生解释框架

Zhuoling Li, Ha Linh Hong Tran Nguyen, Valeria Bladinieres, Maxim Romanovsky

机构 * Berlin Technology Centre(柏林技术中心) Deutsche Bank(德意志银行)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 XGRAG通过图基扰动策略生成因果解释,提升GraphRAG系统的可解释性,在多个问答数据集上实现解释质量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18880 2026-04-22 cs.CL cs.AI 82%

Where Fake Citations Are Made: Tracing Field-Level Hallucination to Specific Neurons in LLMs

伪造引用的产生地:追踪领域层面的幻觉到LLM中的特定神经元

Yuefei Chen, Yihao Quan, Xiaodong Lin, Ruixiang Tang

机构 * Rutgers University(罗格斯大学)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);分类 cs.CL、cs.AI

AI总结 研究发现LLM生成虚假引用时,作者名错误率最高,领域特定的幻觉神经元通过内部模型信号可检测和缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13543 2026-04-20 cs.LG cs.AI 82%

Enhancing Visual Representation with Textual Semantics: Textual Semantics-Powered Prototypes for Heterogeneous Federated Learning

通过文本语义增强视觉表示:基于文本语义的原型用于异构联邦学习

Xinghao Wu, Jianwei Niu, Xuefeng Liu, Guogang Zhu, Jiayuan Zhang, Shaojie Tang, Wei Chen

机构 * State Key Laboratory of Virtual Reality Technology and Systems, School of Computer Science and Engineering, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,计算机科学与工程学院,北京航空航天大学,北京,中国) Zhongguancun Laboratory, Beijing, China(中关村实验室,北京,中国) Center for AI Business Innovation, Department of Management Science and Systems, School of Management, University at Buffalo, USA(人工智能商业创新中心,管理科学与系统系,管理学院,布法罗大学,美国)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FedTSP,利用预训练语言模型构建语义丰富的原型,以解决异构联邦学习中的数据异质性问题,提升模型收敛速度和泛化能力。

Comments Accepted by CVPR 2026 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15945 2026-04-20 cs.CL cs.LG 82%

RAGognizer: Hallucination-Aware Fine-Tuning via Detection Head Integration

RAGognizer: 通过检测头整合实现hallucination-aware微调

Fabian Ridder, Laurin Lessel, Malte Schilling

机构 * Computer Science Department(计算机科学系)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 RAGognizer通过整合轻量级检测头,实现hallucination-aware微调,提升内部状态分离性并减少生成hallucination。

Comments accepted at IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17671 2026-02-23 cs.HC cs.AI cs.CL 82%

AI Hallucination from Students' Perspective: A Thematic Analysis

从学生视角看AI幻觉:一项主题分析

Abdulhadi Shoufan, Ahmad-Azmi-Abdelhamid Esmaeil

机构 * Department of Computer and Information Engineering, Center for Cyber Physical Systems, Khalifa University(计算机与信息工程系,跨物理系统中心,哈利法大学) Department of Psychology, University Malaysia Sabah(心理学系,马来西亚Sabah大学)

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究通过主题分析探讨学生对AI幻觉的认知与应对策略,揭示学生在检测幻觉时的依赖策略及对幻觉成因的误解,强调需在AI素养教育中加强验证意识和准确思维模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18179 2026-02-04 cs.CL cs.AI 82%

Problem Solved? Information Extraction Design Space for Layout-Rich Documents using LLMs

问题已解决?利用LLMs处理布局丰富文档的信息提取设计空间

Gaye Colakoglu, Gürkan Solmaz, Jonathan Fürst

机构 * Zurich University of Applied Sciences(苏黎世应用科学大学) NEC Laboratories Europe(NEC欧洲实验室)

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过LayIE-LLM测试套件研究了利用LLMs处理布局丰富文档的信息提取设计空间,证明通用LLMs在优化配置下可媲美专用模型,提供低成本无微调方案。

Comments accepted at EMNLP'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21969 2026-02-02 cs.CL cs.AI 82%

Token-Guard: Towards Token-Level Hallucination Control via Self-Checking Decoding

Token-Guard: 通过自检解码实现token级幻觉控制

Yifan Zhu, Huiqiang Rong, Haoran Luo

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学)

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 Token-Guard通过自检解码技术,实现对大型语言模型中token级幻觉的有效控制,提升生成准确性与输出可靠性。

Comments Accepted by ICLR 2026 main conference

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17941 2025-10-22 cs.CL cs.AI 82%

Believe It or Not: How Deeply do LLMs Believe Implanted Facts?

Stewart Slocum, Julian Minder, Clément Dumas, Henry Sleight, Ryan Greenblatt, Samuel Marks, Rowan Wang

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13664 2025-09-18 cs.CL cs.AI 82%

Sparse Neurons Carry Strong Signals of Question Ambiguity in LLMs

Zhuoxuan Zhang, Jinhao Duan, Edward Kim, Kaidi Xu

机构 * Brown University(布朗大学) Drexel University(德雷塞尔大学)

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments To be appeared in EMNLP 2025 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00914 2025-08-05 cs.AI cs.LG 82%

Knowledge Editing for Multi-Hop Question Answering Using Semantic Analysis

Dominic Simon, Rickard Ewetz

机构 * University of Florida(佛罗里达大学)

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 14 pages, 15 figures, pre-print of paper accepted to IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08648 2025-02-17 cs.CL cs.AI 82%

MAGNET: Augmenting Generative Decoders with Representation Learning and Infilling Capabilities

Savya Khosla, Aditi Tiwari, Kushal Kafle, Simon Jenni, Handong Zhao, John Collomosse, Jing Shi

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12692 2024-12-24 cs.CL cs.AI cs.DB cs.HC 82%

MAGIC: Generating Self-Correction Guideline for In-Context Text-to-SQL

Arian Askari, Christian Poelitz, Xinye Tang

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Accepted at Proceedings of the Thirty-Ninth AAAI Conference on Artificial Intelligence (AAAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13043 2024-09-10 cs.CV cs.CL cs.LG 82%

Data Alignment for Zero-Shot Concept Generation in Dermatology AI

Soham Gadgil, Mahtab Bigverdi

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

Comments Accepted as a workshop paper to ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07592 2023-11-15 cs.CL cs.AI cs.IR 82%

Hallucination-minimized Data-to-answer Framework for Financial Decision-makers

Sohini Roychowdhury, Andres Alvarez, Brian Moore, Marko Krema, Maria Paz Gelpi, Federico Martin Rodriguez, Angel Rodriguez, Jose Ramon Cabrejas, Pablo Martinez Serrano, Punit Agrawal, Arijit Mukherjee

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 11 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.07971 2023-03-15 cs.CL cs.LG 82%

A Theory of Emergent In-Context Learning as Implicit Structure Induction

Michael Hahn, Navin Goyal

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);pretraining(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12450 2024-06-10 cs.SE cs.AI 82%

PathOCL: Path-Based Prompt Augmentation for OCL Generation with GPT-4

Seif Abukhalaf, Mohammad Hamdaqa, Foutse Khomh

专题命中 知识编辑与模型理解 :foundation model(abstract,comments);LLM(abstract);large language model(abstract);language model(abstract)

Comments Updated affiliations. This paper has been accepted to be published in the 2024 IEEE/ACM First International Conference on AI Foundation Models and Software Engineering (Forge)

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.13063 2024-03-19 cs.CL 82%

Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs

Miao Xiong, Zhiyuan Hu, Xinyang Lu, Yifei Li, Jie Fu, Junxian He, Bryan Hooi

专题命中 知识编辑与模型理解 :LLM(abstract,comments);large language model(abstract);language model(abstract);prompting(abstract)

Comments The paper is accepted by ICLR 2024. The code is publicly available at https://github.com/MiaoXiong2320/llm-uncertainty

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17544 2026-08-19 eess.SP 新提交 82%

Channel2World: A Wireless Foundation Model for RF Environment Representation

Channel2World:一种用于射频环境表征的无线基础模型

Hyung-Joo Moon, Joonkyu Jang, Kwang Soon Kim, Seong-Lyun Kim, Robert W. Heath, Chan-Byoung Chae

专题命中 知识编辑与模型理解 :foundation model(title,abstract);pretraining(abstract)

AI总结 该研究提出无线基础模型Channel2World,用Transformer编码器聚合多环境MIMO信道数据,预训练后作为环境条件模块,在UE定位等任务中能有效适配未见环境,性能优于或媲美特定站点微调。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10725 2026-08-12 cs.CV cs.SC 新提交 82%

Rethinking LLM Verification: Evidence Structure, Uncertainty, and Selective Refinement

重新思考大语言模型验证:证据结构、不确定性与选择性优化

Uma Ranjan, Kunal Tilaganji, Aditya Koul, Anurag Mahipal, Dashpreet Singh, Hriday Rana, Manan Jain, Sidharth Gupta, Ajo Babu George, Vineeth Balasubramanian, Nagarajan Natarajan, Amit Sharma

机构 * Indian Institute of Technology Jammu(贾姆穆印度理工学院) Microsoft Research(微软研究院) SCB Dental College and Hospital(SCB牙科学院与医院)

专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract)

AI总结 该研究针对LLMs医疗应用的安全问题,提出两阶段框架,利用模型弃权信号优化推理,在GPT-5.5、DeepSeek-R1模型及MedReason、MedQA数据集上显著提升了医疗假设验证的准确率。

Comments Findings Track at the Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04935 2026-08-10 cs.CV 版本更新 82%

Unleashing the Potential of Vision-Language Models for Generalizable AI-Generated Image Detection

释放视觉-语言模型在通用人工智能生成图像检测中的潜力

Weihan Cai, Hao Tan, Zichang Tan, Jun Wan, Xinping Gao

专题命中 知识编辑与模型理解 :language model(title,abstract);foundation model(abstract)

AI总结 该研究针对AI生成图像检测,发现视觉-语言模型PE比DINOv3更具潜力,提出语义原型校准(SPC)方法得到PE-SPC,在多基准测试中达到新的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05793 2026-08-07 eess.SP 新提交 82%

Radio-FM: A Foundation Model for Radio Signal Representation Learning and Its Applications

Radio-FM:用于无线电信号表示学习的基础模型及其应用

Jinchao Zhou, Wupeng Xie, Zhuangzhi Chen, Yao Lu, Qi Xuan, Yun Lin, Guan Gui

专题命中 知识编辑与模型理解 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文提出Radio-FM基础模型,采用双通道处理等技术,预训练于15个数据集,在15个下游基准中13个达最优,少样本迁移能力强,可作为无线电信号理解通用骨干。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05329 2026-08-07 q-bio.GN 新提交 82%

Frozen but Not Always Accessible: A Representation Analysis of Genomic Language Models

冻结但并非始终可及:基因组语言模型的表征分析

Nirjhor Datta, Swakkhar Shatabda, M. Sohel Rahman

专题命中 知识编辑与模型理解 :language model(title,abstract);foundation model(abstract)

AI总结 本研究分析了DNABERT-2等基因组语言模型作为冻结特征提取器时,在不同基因组任务中的表征可及性,发现其性能随任务变化,局部生物信号存在但并非总能通过池化嵌入获取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05160 2026-08-07 cs.AI cs.CL cs.LG 新提交 82%

The Ignition Index: Measuring Global Workspace Dynamics in Language Models

点火指数:测量语言模型中的全局工作空间动力学

Saman Rahbar

机构 * Dialpad, Inc.(戴尔德公司)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出点火指数I作为量化指标,用于测量Transformer语言模型的全局工作空间动力学,揭示了不同架构模型的点火特性及相关规律,为GWT与机制可解释性搭建了定量桥梁。

Comments 26 pages, 10 figures. Code: https://github.com/saman-rahbar/ignition-index

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18673 2026-08-05 cs.CV 版本更新 82%

MissingBench-Verified: Probing Vision-Language Models' Inability to Detect Missing Object Parts

MissingBench-Verified:探究视觉语言模型检测缺失物体部分的无能

Wenqi Marshall Guo, Qingyun Qian, Shiyu Zhou, Guoping Luo, Shan Du

机构 * University of British Columbia(英属哥伦比亚大学) Weathon Software(威盛软件)

专题命中 知识编辑与模型理解 :language model(title,abstract);prompting(abstract)

AI总结 研究视觉语言模型检测缺失物体部分的能力,提出MissingBench-Verified基准,发现十个领先模型在此场景存在高失败率,现有缓解策略效果不佳,揭示当前VLM在检查监测任务中的根本局限,强调架构或训练干预的必要。

Comments Submitted to the ECCV 2026 Workshop on Explainable Computer Vision (eXCV). 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00586 2026-08-04 cs.CV 新提交 82%

Representation Transfer of Foundation Models for Ultra-Widefield Retinal Imaging

用于超广域视网膜成像的基础模型表示迁移

Mingya Alexa Gong, Da Ma, Lovre Antonio Budimir, Ivana Matovinovic, Sven Loncaric, Myeong Jin Ju, Yukun Zhou, Siegfried K. Wagner, Pearse A. Keane, Marinko V. Sarunic

机构 * Institute of Ophthalmology, University College London(伦敦大学学院眼科研究所) Wake Forest University School of Medicine(维克森林大学医学院) Virginia Tech-Wake Forest University School of Biomedical Engineering and Sciences(弗吉尼亚理工大学-维克森林大学生物医学工程与科学学院) University of Zagreb Faculty of Electrical Engineering and Computing(萨格勒布大学电气工程与计算机学院) NIHR Biomedical Research Centre, Moorfields Eye Hospital NHS Foundation Trust(NIHR生物医学研究中心,摩尔菲尔兹眼科医院NHS基金会信托)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);pretraining(abstract)

AI总结 该研究探讨基础模型预训练策略对超广域视网膜成像表示迁移的影响,发现DINOv3模型在五类糖尿病视网膜病变分级中性能最优,监督和自蒸馏预训练的ViT优于MAE,部分微调可缩小MAE的性能差距。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08159 2026-07-31 cs.LG cs.AI cs.CL 版本更新 82%

The Confidence Manifold: Geometric Structure of Correctness Representations in Language Models

自信流形:语言模型中正确性表示的几何结构

Seonglae Cho, Zekun Wu, Kleyton Da Costa, Adriano Koshiyama

机构 * University College London(伦敦大学学院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示语言模型正确性表示的几何结构,发现低维子空间中的质心距离与探测器性能一致,表明检测是几何而非学习过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18292 2026-07-29 cs.LG cs.AI cs.CL 版本更新 82%

Reliability Scales Inversely: Hallucinations Snowball Faster in Bigger Language Models

可靠性呈反比:更大的模型通过隐藏的自回归风险机制更快地加剧错误

Kushal Chakrabarti

机构 * Obviously Wrong, LLC(明显错误有限责任公司)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现随着语言模型规模扩大,答案虽更接近真实但退化更快。通过逐位置分歧追踪自回归风险残余,揭示了知识差距下降、知识退化增长等四个发现,指出更大模型会通过特定风险机制更快加剧错误,该机制因果且模型自身难以察觉。

详情

展开后加载摘要…

URL PDF HTML 收藏