arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7527 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7527 篇

2602.05073 2026-04-21 cs.AI 87%

Uncertainty Quantification in LLM Agents: Foundations, Emerging Challenges, and Opportunities

大语言模型代理中的不确定性量化:基础、新兴挑战与机遇

Changdae Oh, Seongheon Park, To Eun Kim, Jiatong Li, Wendi Li, Samuel Yeh, Xuefeng Du, Hamed Hassani, Paul Bogdan, Dawn Song, Sharon Li

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Carnegie Mellon University(卡内基梅隆大学) Nanyang Technological University(南洋理工大学) University of Pennsylvania(宾夕法尼亚大学) University of Southern California(南加州大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了大语言模型代理中不确定性量化的基础、挑战及未来方向,提出新的框架并分析了现实场景中的技术难题。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12397 2026-04-15 cs.CL 87%

KoCo: Conditioning Language Model Pre-training on Knowledge Coordinates

KoCo:基于知识坐标的语言模型预训练

Yudong Li, Jiawei Cai, Linlin Shen

机构 * School of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Department of Electrical Engineering, Tsinghua University(清华大学电子工程系) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(广东省智能信息处理重点实验室)

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL

AI总结 KoCo通过将文档映射为三维语义坐标,提升语言模型对现实知识结构的理解,使模型在10个下游任务中性能提升30%并减少幻觉。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05839 2026-03-09 cs.MA cs.AI 87%

Evaluating LLM Alignment With Human Trust Models

评估大语言模型与人类信任模型的对齐性

Anushka Debnath, Stephen Cranefield, Bastin Tony Roy Savarimuthu, Emiliano Lorini

机构 * School of Computing, University of Otago, New Zealand(奥塔哥大学计算机学院,新西兰) IRIT, CNRS, Toulouse University, France(IRIT,法国国家科学研究中心,图卢兹大学)

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过对比提示生成嵌入向量,评估了EleutherAI/gpt-j-6B对信任的内部表示,发现其最接近Castelfranchi社会认知模型。

Comments This paper will appear in the post-proceedings of ICAART 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23391 2026-03-02 cs.LG 87%

Detoxifying LLMs via Representation Erasure-Based Preference Optimization

通过基于表示擦除的偏好优化来净化大语言模型

Nazanin Mohammadi Sepahvand, Eleni Triantafillou, Hugo Larochelle, Doina Precup, Daniel M. Roy, Gintare Karolina Dziugaite

机构 * McGill University(麦吉尔大学) Mila Google DeepMind(谷歌DeepMind) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 知识编辑与模型理解 :preference optimization(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出REPO方法,通过基于表示擦除的偏好优化,有效净化大语言模型,提升其对抗鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12661 2025-11-18 cs.CL 87%

Reason-KE++: Aligning the Process, Not Just the Outcome, for Faithful LLM Knowledge Editing

Yuchen Wu, Liang Ding, Li Shen, Dacheng Tao

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Sydney(悉尼大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Nanyang Technological University(南洋理工大学)

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11257 2025-08-18 cs.SE cs.AI 87%

Hallucination in LLM-Based Code Generation: An Automotive Case Study

Marc Pavel, Nenad Petrovic, Lukasz Mazur, Vahid Zolfaghari, Fengjunjie Pan, Alois Knoll

机构 * Real-Time Systems Technical University of Munich(实时系统技术大学慕尼黑)

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15624 2025-06-19 cs.AI 87%

The Effect of State Representation on LLM Agent Behavior in Dynamic Routing Games

Lyle Goodyear, Rachel Guo, Ramesh Johari

机构 * Stanford University(斯坦福大学)

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 27 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10014 2025-06-13 cs.LG 87%

NOCL: Node-Oriented Conceptualization LLM for Graph Tasks without Message Passing

Wei Li, Mengcheng Lan, Jiaxing Xu, Yiping Ke

机构 * College of Computing and Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学)

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

Comments 10 pages, 4 figures. arXiv admin note: text overlap with arXiv:1703.00552, arXiv:1403.2844 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00003 2025-06-03 cs.SD cs.CL eess.AS 87%

Probing Audio-Generation Capabilities of Text-Based Language Models

Arjun Prasaath Anbazhagan, Parteek Kumar, Ujjwal Kaur, Aslihan Akalin, Kevin Zhu, Sean O'Brien

机构 * Algoverse AI Research(Algoverse AI研究)

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

Comments Accepted at Conference of the North American Chapter of the Association for Computational Linguistics 2025, Student Research Workshop (NAACL SRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19419 2025-05-28 cs.HC cs.AI 87%

It's Not Just Labeling -- A Research on LLM Generated Feedback Interpretability and Image Labeling Sketch Features

Baichuan Li, Larry Powell, Tracy Hammond

机构 * Texas A&M University(德克萨斯大学)

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09260 2025-04-15 cs.AR cs.LG 87%

NetTAG: A Multimodal RTL-and-Layout-Aligned Netlist Foundation Model via Text-Attributed Graph

Wenji Fang, Wenkai Li, Shang Liu, Yao Lu, Hongce Zhang, Zhiyao Xie

专题命中 知识编辑与模型理解 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted by Design Automation Conference (DAC), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08666 2025-04-14 cs.SE cs.AI 87%

Variability-Driven User-Story Generation using LLM and Triadic Concept Analysis

Alexandre Bazin, Alain Gutierrez, Marianne Huchard, Pierre Martin, Yulin, Zhang

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 20th International Conference on Evaluation of Novel Approaches to Software Engineering April 4-6, 2025, in Porto, Portugal

Journal ref Proceedings of ENASE 2025; SciTePress, pages 618-625 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00430 2025-03-18 cs.RO cs.AI 87%

Evaluating Uncertainty-based Failure Detection for Closed-Loop LLM Planners

Zhi Zheng, Qian Feng, Hang Li, Alois Knoll, Jianxiang Feng

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Accepted at ICRA 2024 Workshop on Back to the Future: Robot Learning Going Probabilistic. Website: https://sites.google.com/view/konwloop/home

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04067 2024-07-08 cs.CL 87%

Semantic Graphs for Syntactic Simplification: A Revisit from the Age of LLM

Peiran Yao, Kostyantyn Guzhva, Denilson Barbosa

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Accepted at TextGraphs-17 @ ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14016 2024-05-31 cs.CL 87%

Towards Uncertainty-Aware Language Agent

Jiuzhou Han, Wray Buntine, Ehsan Shareghi

专题命中 知识编辑与模型理解 :language agent(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Our code and data are at https://uala-agent.github.io. (accepted to ACL 2024 Findings). arXiv admin note: text overlap with arXiv:2310.05915

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13684 2024-05-24 cs.CL 87%

CrossCheckGPT: Universal Hallucination Ranking for Multimodal Foundation Models

Guangzhi Sun, Potsawee Manakul, Adian Liusie, Kunat Pipatanakul, Chao Zhang, Phil Woodland, Mark Gales

专题命中 知识编辑与模型理解 :foundation model(title,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

Comments 21 pages. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17897 2024-03-05 cs.CL cs.IR 87%

A Language Model based Framework for New Concept Placement in Ontologies

Hang Dong, Jiaoyan Chen, Yuan He, Yongsheng Gao, Ian Horrocks

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);instruction tuning(abstract);prompting(abstract)

Comments 20 pages, 3 figures, accepted for ESWC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11123 2024-02-08 cs.SE cs.CL 87%

(Why) Is My Prompt Getting Worse? Rethinking Regression Testing for Evolving LLM APIs

Wanqin Ma, Chenyang Yang, Christian Kästner

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments conference version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14653 2026-08-18 cs.LG cs.AI 新提交 87%

Do Uncertainty Signals Help? A Systematic Study of Uncertainty-Aware Decoding with Rollback Mechanisms

不确定信号是否有用?对带有回滚机制的不确定感知解码的系统研究

Xianzong Wu, Xiaohong Li, Yuejun Guo, Xinyang Liu, Tianlin Li, Junjie Wang, Qiang Hu

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过系统研究带有回滚机制的不确定感知解码,发现其可提升代码LLM的生成性能,其中token熵等信息论不确定信号效果最优,反馈引导的回滚是主要改进来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07195 2026-08-18 cs.CL cs.AI 版本更新 87%

Adapting LLMs to Time Series Forecasting via Temporal Heterogeneity Modeling and Representation Alignment

通过时间异质性建模与表示对齐将大语言模型(LLMs)适配到时间序列预测任务

Yanru Sun, Emadeldeen Eldele, Zongxia Xie, Yucheng Wang, Wenzhe Niu, Qinghua Hu, Chee Keong Kwoh, Min Wu

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出TALON框架,通过异构时间编码器建模时间异质性、表示对齐模块弥合模态差距,在7个真实世界基准上较SOTA方法平均MSE提升最高11%,实现高效且高性能的LLM时间序列预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10430 2026-08-12 cs.LG cs.AI 新提交 87%

Actionable Hallucination Detection: Translating Latent Uncertainty into Agentic Critique

可操作的幻觉检测:将潜在不确定性转化为智能体批判

Sanidhya Vijayvargiya, Rahul Lokesh

机构 * Samsung Research America(美国三星研究院)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出Latent Critic轻量级LoRA适配器,可实时检测LLM智能体的幻觉,定位准确率超80%、AUROC达0.966,能拦截幻觉并助力智能体自我修正,效能优于同类基线方法。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16462 2026-08-10 cs.CL cs.CY cs.LG 版本更新 87%

Let's Unlearn Stereotypes Before Decision-Making: Assessing the Impact of Intrinsic Bias Mitigation on Downstream Fairness in LLMs

让我们在决策前忘却刻板印象:评估内在偏差缓解对大语言模型下游公平性的影响

Mina Arzaghi, Alireza Dehghanpour Farashah, Florian Carichon, Jean-François Plante, Golnoosh Farnadi

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出公平感知概念忘却(FACU)方法,在保留预测性能的同时缓解LLM内在偏差,可提升下游公平性,结合反事实数据增强效果更佳,为LLM公平性优化提供了新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24539 2026-07-29 cs.CL cs.AI 版本更新 87%

Localizing Persona Representations in LLMs

在大语言模型中定位角色表示

Celia Cintas, Miriam Rateike, Erik Miehling, Elizabeth Daly, Skyler Speakman

机构 * IBM Research Africa(IBM非洲研究院) IBM Research Europe(IBM欧洲研究院)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型中角色表示的编码位置与方式,运用降维和模式识别方法,发现角色表示差异在解码器层最后三分之一内,特定伦理观点有重叠激活,政治意识形态区域不同,有助于理解LLM信息表示及改进输出调制。

Comments Corrected small naming inconsistencies for Level 0, 1, and 2 analysis

Journal ref Proceedings of the AAAI ACM Conference on AI, Ethics, and Society, 8(1), 630-642, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15334 2026-07-07 cs.CL cs.AI 版本更新 87%

No Reliable Evidence of Self-Reported Sentience in Small Large Language Models

小语言模型中自我报告的感知能力缺乏可靠证据

Caspar Kaiser, Sean Enderby

机构 * University of Warwick, Warwick Business School(沃里克大学,沃里克商学院)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

AI总结 通过询问多个开源语言模型关于其自身意识的问题,并利用基于内部激活训练的分类器验证回答,对语言模型是否认为自己有感知能力进行测试,发现模型否认有感知,分类器也无反例,且Qwen模型中越大越确定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29490 2026-06-30 cs.LG cs.AI 87%

Reported Confidence in LLMs Tracks Commitment More Than Correctness

LLM中的报告置信度追踪承诺而非正确性

Dharshan Kumaran

机构 * Google DeepMind(谷歌DeepMind)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过两阶段弃权范式,发现LLM的言语置信度预测弃权决策远优于预测答案正确性,而令牌对数概率则相反,表明言语置信度是内部承诺准备状态的行为输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19755 2026-06-09 cs.AI cs.LG 版本更新 87%

Explainable AML Triage with LLMs: Evidence Retrieval and Counterfactual Checks

可解释的AML优先级排序与LLMs:证据检索与反事实检查

Dorothy Torres, Wei Cheng, Ke Hu

机构 * School of Science, Technology, Engineering and Mathematics(科学、技术、工程与数学学院) School of Electrical Engineering and Computer Science(电气工程与计算机科学学院)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种可解释的AML优先级排序框架,结合证据增强的证据捆绑、结构化LLM输出合同和反事实验证,提升审计性和鲁棒性,实验证明其在优先级排序和证据支持方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10063 2026-06-05 cs.CL cs.AI math.AT 87%

Hallucination Detection in LLMs with Topological Divergence on Attention Graphs

基于注意力图拓扑分歧的LLM幻觉检测

Alexandra Bazarova, Andrei Volodichev, Aleksandr Yugay, Andrey Shulga, Alina Ermilova, Konstantin Polev, Julia Belikova, Rauf Parchiev, Dmitry Simakov, Maxim Savchenko, Andrey Savchenko, Serguei Barannikov, Alexey Zaytsev

机构 * Applied AI Institute(应用人工智能研究所) SB AI Lab(SB人工智能实验室) HSE University(俄罗斯高等经济学院) CNRS, Universite Paris Cite(法国国家科学研究中心,巴黎Cité大学)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TOHA方法,通过分析注意力矩阵的拓扑结构来检测LLM中的幻觉现象,实验表明该方法在多个基准测试中表现优异,且对标注数据和计算资源需求较低。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02642 2026-06-03 eess.AS cs.AI cs.CV cs.LG cs.MM cs.SD 87%

SVHalluc: Benchmarking Speech-Vision Hallucination in Audio-Visual Large Language Models

SVHalluc: 音频-视觉大语言模型中的语音-视觉幻觉基准测试

Chenshuang Zhang, Kyeong Seon Kim, Chengxin Liu, Tae-Hyun Oh

机构 * KAIST(韩国国立信息通信研究院)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title);分类 cs.AI、cs.LG

AI总结 针对音频-视觉大语言模型中的语音-视觉幻觉问题,提出SVHalluc基准,从语义和时间两个维度评估模型将语音内容与视觉信号对齐的能力,发现现有模型存在跨模态理解局限。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22963 2026-05-25 cs.CL cs.AI 87%

Graph Alignment Topology as an Inductive Bias for Grounding Detection

图对齐拓扑作为接地检测的归纳偏置

Paul Landes, Pranav Herur, Adam Cross, Jimeng Sun

机构 * Department of Pediatrics, University of Illinois College of Medicine Peoria(伊利诺伊大学皮奥里亚医学院儿科部) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机与数据科学学院) Carle Illinois College of Medicine, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校卡莱医学院)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出利用图对齐拓扑作为归纳偏置,通过构建参考信息与LLM输出之间的对齐二分图并训练图神经网络建模对齐结构,在幻觉检测和问答任务上取得最先进结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21102 2026-05-21 cs.CL cs.AI cs.SE 87%

ACL-Verbatim: hallucination-free question answering for research

ACL-Verbatim: 无幻觉的科研问答

Gábor Recski, Szilveszter Tóth, Nadia Verdha, István Boros, Ádám Kovács

机构 * TU Wien(维也纳技术大学) KR Labs(KR实验室)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出ACL-Verbatim系统,通过提取式问答方法在科研论文中精准映射用户查询到相关文本片段,构建了新的真实数据集并训练评估了多种提取模型,最终通过150M参数的ModernBERT模型在词级F1得分上达到53.6,优于最强的LLM提取器。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏