arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7539 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7539 篇

2406.03441 2024-06-06 cs.CL cs.LG 86%

Cycles of Thought: Measuring LLM Confidence through Stable Explanations

Evan Becker, Stefano Soatto

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06921 2024-04-11 cs.CL cs.AI 86%

GoEX: Perspectives and Designs Towards a Runtime for Autonomous LLM Applications

Shishir G. Patil, Tianjun Zhang, Vivian Fang, Noppapon C., Roy Huang, Aaron Hao, Martin Casado, Joseph E. Gonzalez, Raluca Ada Popa, Ion Stoica

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03732 2024-04-08 cs.CL cs.AI 86%

SHROOM-INDElab at SemEval-2024 Task 6: Zero- and Few-Shot LLM-Based Classification for Hallucination Detection

Bradley P. Allen, Fina Polat, Paul Groth

专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

Comments 6 pages, 6 figures, 4 tables, camera-ready copy, accepted to the 18th International Workshop on Semantic Evaluation (SemEval-2024), for associated code and data see https://github.com/bradleypallen/shroom

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01482 2024-04-02 cs.CV cs.AI cs.LG 86%

Incorporating Geo-Diverse Knowledge into Prompting for Increased Geographical Robustness in Object Recognition

Kyle Buettner, Sina Malakouti, Xiang Lorraine Li, Adriana Kovashka

专题命中 知识编辑与模型理解 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments To appear in IEEE/CVF Computer Vision and Pattern Recognition Conference (CVPR), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.08241 2024-02-23 cs.CL cs.AI 86%

TEST: Text Prototype Aligned Embedding to Activate LLM's Ability for Time Series

Chenxi Sun, Hongyan Li, Yaliang Li, Shenda Hong

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08517 2024-01-25 cs.AI cs.CL cs.HC 86%

Supporting Student Decisions on Learning Recommendations: An LLM-Based Chatbot with Knowledge Graph Contextualization for Conversational Explainability and Mentoring

Hasan Abu-Rasheed, Mohamad Hussam Abdulsalam, Christian Weber, Madjid Fathi

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01862 2024-01-04 cs.CV cs.CL cs.LG 86%

A Vision Check-up for Language Models

Pratyusha Sharma, Tamar Rott Shaham, Manel Baradad, Stephanie Fu, Adrian Rodriguez-Munoz, Shivam Duggal, Phillip Isola, Antonio Torralba

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15451 2023-11-28 cs.CL cs.LG 86%

Uncertainty-aware Language Modeling for Selective Question Answering

Qi Yang, Shreya Ravikumar, Fynn Schmitt-Ulms, Satvik Lolla, Ege Demir, Iaroslav Elistratov, Alex Lavaee, Sadhana Lolla, Elaheh Ahmadi, Daniela Rus, Alexander Amini, Alejandro Perez

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07424 2023-11-14 cs.CL cs.AI 86%

Hallucination Augmented Recitations for Language Models

Abdullatif Köksal, Renat Aksitov, Chung-Ching Chang

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12443 2023-10-20 cs.IR cs.AI cs.CL 86%

Know Where to Go: Make LLM a Relevant, Responsible, and Trustworthy Searcher

Xiang Shi, Jiawei Liu, Yinpeng Liu, Qikai Cheng, Wei Lu

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 14 pages, 4 figures, under peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.16175 2023-10-05 cs.CL cs.AI 86%

Quantifying Uncertainty in Answers from any Language Model and Enhancing their Trustworthiness

Jiuhai Chen, Jonas Mueller

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13705 2025-07-21 cs.CL cs.IR 86%

Consistent Explainers or Unreliable Narrators? Understanding LLM-generated Group Recommendations

Cedric Waterschoot, Nava Tintarev, Francesco Barile

机构 * Maastricht University(马斯特里赫特大学)

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Short paper accepted at the Nineteenth ACM Conference on Recommender Systems (RecSys '25). Cedric Waterschoot, Nava Tintarev, and Francesco Barile. 2025. Consistent Explainers or Unreliable Narrators? Understanding LLM-generated Group Recommendations. Proceedings of the Nineteenth ACM Conference on Recommender Systems (RecSys '25), Prague, Czech Republic. doi: 10.1145/3705328.3748015

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16090 2025-02-11 cs.CL 86%

Analysing the Residual Stream of Language Models Under Knowledge Conflicts

Yu Zhao, Xiaotang Du, Giwon Hong, Aryo Pradipta Gema, Alessio Devoto, Hongru Wang, Xuanli He, Kam-Fai Wong, Pasquale Minervini

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

Comments Foundation Model Interventions Workshop @ NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00306 2023-11-02 cs.CL 86%

Probing Explicit and Implicit Gender Bias through LLM Conditional Text Generation

Xiangjue Dong, Yibo Wang, Philip S. Yu, James Caverlee

专题命中 知识编辑与模型理解 :LLM(title,abstract);language model(abstract,comments);large language model(abstract);分类 cs.CL

Comments Accepted in Socially Responsible Language Modelling Research (SoLaR) 2023 at NeurIPS 2023; the first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16657 2026-08-18 cs.CY 新提交 86%

The ultimate carbon cost of a ChatGPT query

一次ChatGPT查询的最终碳成本

Paul Kron

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究结合多领域成果,估算ChatGPT类LLM单次查询最终碳成本约0.4美元、对应10gCO₂eq,引入QCC概念以凸显AI对地球健康的影响,为相关研究提供方向。

Comments 5 pages,0 figures. Accepted at the 2nd International Workshop on Low Carbon Computing (LOCO 2026), Lancaster University, United Kingdom, 10-11 September 2026. Part of the LOCO 2026 proceedings, arXiv:LOCO2026/P15

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08622 2026-08-11 cs.CV 新提交 86%

VADER: Adaptive Debiasing for Hallucination Mitigation in Video Large Language Models

VADER:用于视频大语言模型幻觉缓解的自适应去偏方法

Dong Xing, Jiaxin Chen, Hang Yang, Peixun Liu, Qiushi Yang, Yuqing Wang

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title)

AI总结 本研究针对视频大语言模型的幻觉问题,提出无训练自适应去偏框架VADER,通过视觉焦点重分配与选择性证据擦除模块结合对比解码,在LLaVA-Video-7B等模型的EventHallusion任务上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07521 2026-08-11 cs.HC 新提交 86%

CyberSelf: Embodied Self-Distancing for Emotional Support in Virtual Reality

CyberSelf:用于虚拟现实中情绪支持的具身自我疏离

Bing Li, Dr Yan Hu, Tinghui Li, Yinuo Zhang, Wen Ma, Yuanfeng Zhou, Professor Yiran Shen

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出VR情绪支持系统CyberSelf,整合相似化身、克隆语音与LLM实时对话,短期及长期研究显示其可提升情绪与应对指标,实现具身自我疏离以支持情绪调节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04635 2026-07-31 cs.RO 版本更新 86%

Relational Scene Graphs for Object Grounding of Natural Language Commands

基于关系场景图的对象接地自然语言指令

Julia Kuhn, Francesco Verdoja, Tsvetomila Mihaylova, Ville Kyrki

机构 * School of Electrical Engineering, Aalto University(艾尔沃大学电气工程学院) School of Science, Aalto University(艾尔沃大学科学学院)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于关系场景图的方法,通过结合LLM和VLM增强自然语言指令中对象接地的准确性。

Comments Accepted to the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19371 2026-07-23 cs.AI cs.CL cs.LG 新提交 86%

Mitigating Scaffolding Collapse in Socratic Tutors via Representation Alignment

通过表示对齐减轻苏格拉底式导师中的支架坍塌

Jing Shao, Qifeng Wu, Hanyu Zhang, Sixia Sun, Jun Zhuang

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 研究基于大语言模型的苏格拉底式导师的支架坍塌问题,提出支架保留表示对齐方法,先监督微调预热,再结合轨迹加权优化与表示损失,经多学科和策略评估,该方法能提升长程苏格拉底辅导的鲁棒性。

Comments preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28215 2026-07-13 cs.AI cs.CL cs.LG cs.LO cs.MA 版本更新 86%

Explaining is Harder Than Predicting Alone: Evaluating Concept-based Explanations of MLLMs as ICL Visual Classifiers

解释比单独预测更难:评估基于概念的MLLM解释作为ICL视觉分类器

Carmen Quiles-Ramírez, Leticia L. Rodríguez, Nicolás Martorell, Natalia Díaz-Rodríguez

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过五种形式化程度递增的条件,系统评估多模态大语言模型在少样本上下文学习中的基于概念的可解释性,发现解释比预测更难,且强制生成形式化解释会降低预测准确性。

Comments Accepted to the CompLearn Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11132 2026-06-25 cs.SE 版本更新 86%

Rethinking Technology Stack Selection with AI Coding Proficiency

重新思考基于AI编程能力的技术栈选择

Xiaoyu Zhang, Weipeng Jiang, Shiqing Ma, Qingshuang Bao, Chenhao Lin, Chao Shen, Tianlin Li, Juan Zhai

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出AI编程能力概念,通过170个第三方库和6个LLM的实证研究发现,相似功能的库在LLM生成代码质量上差异高达84%,呼吁将AI编程能力纳入技术选择框架。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18114 2026-06-23 cs.CL cs.AI cs.LG 86%

Evaluating Evaluation Metrics -- The Mirage of Hallucination Detection

评估评估指标——幻觉检测的幻象

Atharva Kulkarni, Yuan Zhang, Joel Ruben Antony Moniz, Xiou Ge, Bo-Hsiang Tseng, Dhivya Piraviperumal, Swabha Swayamdipta, Hong Yu

机构 * University of Southern California(南加州大学) Apple Inc.(苹果公司)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文评估了6种幻觉检测指标在4个数据集、37个语言模型和5种解码方法上的表现,发现现有指标与人类判断不一致,且参数规模影响不一致,LLM评估和模式寻求解码方法能有效减少幻觉。

Comments Accepted at EMNLP 2025 Findings (Short)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07941 2026-06-09 cs.CR 新提交 86%

Collective Hallucination in Multi-Agent LLMs:Modeling and Defense

多智能体大语言模型中的集体幻觉:建模与防御

Saeid Jamshidi

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出一种系统级模型描述多智能体LLM中幻觉的传播与放大,并设计交互感知控制方法,通过置信加权聚合、自适应影响调节、外部验证和隔离不可靠智能体来抑制错误传播,在TruthfulQA和TriviaQA上使幻觉降低39%,事实准确率提升至0.87。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11908 2026-06-03 cs.AI cs.CL cs.LG 86%

When Should LLMs Be Less Specific? Selective Abstraction for Reliable Long-Form Text Generation

LLM何时应降低具体性?面向可靠长文本生成的选择性抽象

Shani Goren, Ido Galil, Ran El-Yaniv

机构 * Technion(技术离子大学) NVIDIA(英伟达)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM在长文本生成中因低置信度而丢弃有价值信息的问题,提出选择性抽象框架,通过原子级抽象替换不确定内容,在保持语义的同时提升准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03658 2026-05-18 cs.CL cs.AI cs.LG stat.ML 86%

The Linear Representation Hypothesis and the Geometry of Large Language Models

线性表示假说与大语言模型的几何学

Kiho Park, Yo Joong Choe, Victor Veitch

机构 * University of Chicago(芝加哥大学)

专题命中 知识编辑与模型理解 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨线性表示的定义及其在表示空间中的几何意义,通过反事实语言形式化并证明其与线性探测和模型操控的关联,提出非欧几里得内积统一线性表示概念,实验验证概念表示的存在及其对解释与控制的重要性。

Comments Accepted for a presentation at ICML 2024 and an oral presentation at NeurIPS 2023 Workshop on Causal Representation Learning. Code is available at https://github.com/KihoPark/linear_rep_geometry

Journal ref In Proceedings of the 41st International Conference on Machine Learning (ICML), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09602 2026-05-12 physics.ed-ph 86%

Performance and failure modes of AI chatbots on a novel concept inventory on relativity in classical mechanics

人工智能聊天机器人在相对论经典力学新概念库存中的性能与故障模式

Eugenio Tufino, Caterina Giovanzana, Andrea Zamboni, Pasquale Onorato, Stefano Oss

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究评估了三种前沿LLM在新开发的相对论经典力学概念库存中的表现,发现其性能依赖于具体问题,且错误模式与学生不同,提示概念库存的实施需考虑此类依赖性。

Comments 19 pages,3 figures, 2 tables, supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25264 2026-04-29 cs.CR cs.SE 86%

MARD: A Multi-Agent Framework for Robust Android Malware Detection

MARD:一种用于鲁棒Android恶意软件检测的多智能体框架

Xueying Zeng, Youquan Xian, Sihao Liu, Xudong Mou, Yanze Li, Lei Cui, Bo Li

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 MARD通过结合LLM的语义理解和传统静态分析,提出多智能体框架,有效降低APK深度分析成本,实现高可解释性检测,F1得分达93.46%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20202 2026-04-23 cs.SE 86%

Hallucination Inspector: A Fact-Checking Judge for API Migration

幻觉检查员:一种用于API迁移的事实核查法官

Marcos Tileria, Santanu Kumar Dash, Profir-Petru Pârţachi, Earl T. Barr

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出Hallucination Inspector,一种静态分析工具,用于检测LLM生成代码中的幻觉错误,通过轻量评估框架验证抽象语法树中的符号与API文档知识库的一致性,有效减少误报。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17108 2026-03-25 cs.CV 86%

LLM-Powered Flood Depth Estimation from Social Media Imagery: A Vision-Language Model Framework with Mechanistic Interpretability for Transportation Resilience

基于大语言模型的社交媒体影像洪水深度估计:一种具有机制可解释性的视觉-语言模型框架用于交通韧性

Nafis Fuad, Xiaodong Qian

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(title)

AI总结 本文提出FloodLlama,一种基于视觉-语言模型的洪水深度估计框架,通过合成数据集和多模态传感管道实现厘米级实时洪水深度估计,提升交通网络韧性。

Comments There is a update in result, which is needed to be addressed

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02250 2026-03-04 cs.SD eess.AS 86%

SGPA: Spectrogram-Guided Phonetic Alignment for Feasible Shapley Value Explanations in Multimodal Large Language Models

SGPA: 基于频谱的语音对齐用于多模态大语言模型中可行的谢普利值解释

Paweł Pozorski, Jakub Muszyński, Maria Ganzha

机构 * Warsaw University of Technology(华沙技术大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title)

AI总结 SGPA通过结合连接主义时间分类和频谱边界细化,实现了多模态大语言模型中可行的音频解释,显著减少了模型评估次数并保持了全局轮廓。

Comments Submitted for admission in Interspeech 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏