arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-21 至 2026-08-21 共收录 260 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 51 篇

2601.07761 2026-08-21 cs.CV 版本更新 50%

Video Evidence to Reasoning Efficient Video Understanding via Explicit Evidence Grounding

视频证据推理:通过显式证据接地实现高效的视频理解

Yanxiang Huang, Guohua Gao, Zhaoyang Wei

机构 * Department of Applied Mathematics, The Hong Kong Polytechnic University(应用数学系,香港理工大学)

专题命中 效率与部署 :language model(abstract)

AI总结 本文提出CoE框架,通过显式证据接地模块和强化学习优化的锚定协议,提升视频推理的准确性和可靠性。

Comments 6 pages

Journal ref ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 领域大模型 23 篇

2608.19665 2026-08-21 cs.IR 新提交 91%

Training-Free LLM-Based Recommendation with Post-LLM Item Refinement Using Collaborative Signals

基于LLM的无训练推荐:利用协同信号的后LLM物品优化

Kyungho Kim, Sunwoo Kim, Geon Lee, Shinhwan Kang, Sojeong Kim, Liam Collins, Bhuvesh Kumar, Donald Loveland, Kijung Shin

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出后LLM范式的无训练推荐框架CoRRe,通过协同信号优化物品嵌入,在真实数据集上性能优于现有无训练方法,接近或超过有训练方法。

Comments Published as a conference paper at CIKM 2026 (short)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02910 2026-08-21 cs.HC cs.AI cs.CY 版本更新 91%

The Basic B*** Effect: The Use of LLM-based Agents Reduces the Distinctiveness and Diversity of People's Choices

基本B效应:基于大语言模型(LLM)的智能体的使用会降低人们选择的独特性与多样性

Sandra C. Matz, Kimberly Klugescheid, C. Blaine Horton, Sofie Goethals

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究通过实地研究和对照实验发现,使用基于LLM的智能体会降低人们选择的独特性与多样性,且顺序选择、智能体个性化会放大该效应,相关发现对设计维护人类多样性的AI系统具有重要意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19529 2026-08-21 cs.CL cs.AI 新提交 90%

When Machines Speak: A Unified Generative Framework for Integrating Machine-Native Symbols into Pretrained Large Language Models

当机器说话:将机器原生符号整合到预训练大语言模型的统一生成框架

Su Yan, Rakesh Iyer

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.AI

AI总结 研究针对预训练大语言模型无法处理机器原生符号的问题,提出UniLang框架将机器原生符号与自然语言 token 同等建模,在序列推荐、法律先例预测任务上均优于基线,拓展了LLMs的应用范围。

Comments Code: https://github.com/Stella-S-Yan/llm-internalization

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19008 2026-08-21 cs.AI 版本更新 90%

Computational Phenomenology of Borderline Personality Disorder: A Comparative Evaluation of LLM-Simulated Expert Personas and Human Clinical Experts

边缘型人格障碍的计算现象学:对LLM模拟专家人设与人类临床专家的比较评估

Marcin Moskalewicz, Anna Sterna, Karolina Drożdż, Kacper Dudzic, Marek Pokropski, Paula Flores

机构 * IDEAS Research Institute(IDEAS研究机构) Adam Mickiewicz University(亚当·密茨凯维奇大学) AMU Center for Artificial Intelligence(AMU人工智能中心) Poznań University of Medical Sciences(波兹南医科大学) Maria Curie-Skłodowska University(玛丽·居里-斯洛多夫斯卡大学) University of Warsaw(华沙大学)

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究比较了LLM模拟专家与人类专家在边缘型人格障碍定性分析中的表现,发现模型在某些方面与人类难以区分,并能识别人类遗漏的主题,展示了AI增强分析的潜力。

Comments 28 pages, 8 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20153 2026-08-21 cs.CL 新提交 88%

FormalTCS: Benchmarking End-to-End Frontier Formal Theoretical Computer Science Research of Large Language Models

FormalTCS:评估大型语言模型端到端前沿形式理论计算机科学研究的基准

Dingzirui Wang, Xuanliang Zhang, Keyan Xu, Qingfu Zhu, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 FormalTCS基准评估发现,当前大型语言模型完成端到端前沿TCS研究的能力不足,形式化是核心瓶颈,且研究品味限制了自主TCS研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20220 2026-08-21 cs.AI 新提交 87%

InsufficiencyBench: Evaluating LLM legal advice on underspecified user queries

InsufficiencyBench:评估大型语言模型(LLM)在信息不足的用户查询下的法律建议

Samuel J. Vincent, Daniel Calloway, Fangyi Yu, Andrew M. Bean, Nabeel Seedat

机构 * Thomson Reuters Foundational Research(汤姆森路透基础研究机构) Imperial College London(帝国理工学院)

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究构建了首个针对查询端信息不足的法律基准InsufficiencyBench,评估前沿LLM在信息不足的法律查询中识别缺失要素、避免过早结论的能力,发现现有模型表现不佳。

Comments 10 pages, Best Paper Honorable Mention at ICML AI4Law 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19206 2026-08-21 cs.CL cs.AI cs.MA 新提交 87%

Hallucination as a Feature, not a Defect: Evaluating a multi-agent architecture to transform speculative language-model outputs into testable scientific hypotheses

幻觉作为特征而非缺陷:评估一种将推测性语言模型输出转化为可检验科学假说的多智能体架构

Nicolas Rodriguez-Alvarez

机构 * IES Parquesol(帕尔奎索尔学院)

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该研究提出基于Rust的多智能体架构,通过生成与评估智能体的认识论摩擦循环将LLM的推测性输出转化为可检验假说,实验显示该架构在需经受严格约束时更具优势,且各架构在原创性等维度的平衡表现不同。

Comments 25 pages. Bilingual: full English version followed by the complete Spanish version. Includes an exploratory paired baseline and ablation study (6 conditions). Code and data: https://doi.org/10.5281/zenodo.20649714

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19790 2026-08-21 cs.AI 新提交 81%

LLMs as Acquisition Policies for Finite-Pool Materials Optimization: A Controlled Study

大语言模型作为有限池材料优化的获取策略:一项对照研究

Dino-Rober Demir, Florian Le Bronnec, Rio Yokota

机构 * RIKEN(理化学研究所)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究探究开放权重大语言模型能否作为有限池材料优化的独立获取策略,经对照实验发现其无需任务特定训练即可提供有用获取信号,虽可靠性受多因素影响但显示出应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19230 2026-08-21 cs.DL cs.AI 新提交 79%

When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models

当AI撰写时,谁会被引用?语言模型间的引用单一文化证据

Sina Alemohammad, Denghui Zhang, Bolong Tang, Anthony Qin, Gengchen Mai, Ahmed Abbasi, Richard Baraniuk, Zhangyang Wang

专题命中 领域大模型 :language model(title,abstract);分类 cs.AI

AI总结 该研究发现,即使引用真实,当前语言模型仍会产生引用单一文化,需改变其共享偏好图而非仅均衡检索或混合厂商。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15910 2026-08-21 cs.CL 版本更新 79%

Calibrated Triage, Not Autonomy: Confidence Estimation for Medical Vision-Language Models

校准的分诊,而非自主:医学视觉-语言模型的置信度估计

Reza Khanmohammadi, Kundan Thind, Mohammad M. Ghassemi

机构 * Michigan State University(密歇根州立大学)

专题命中 领域大模型 :language model(title,abstract);分类 cs.CL

AI总结 针对医学视觉-语言模型在回答时可能忽略图像而依赖语言先验的问题,提出使用置信度估计进行校准分诊,通过评估七种置信度估计器,发现高置信度区域是区分可用估计器的关键,最佳探针可将错误率从41-45%降至1-4%,但无估计器在所有领域和模型中一致最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01940 2026-08-21 cs.CL 77%

Towards Better Understanding of Cybercrime: The Role of Fine-Tuned LLMs in Translation

Veronica Valeros, Anna Širokova, Carlos Catania, Sebastian Garcia

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19201 2026-08-21 cs.CL cs.AI cs.IR q-bio.QM 新提交 73%

Automatic bioinformatic software named entity recognition from literature

从文献中自动识别生物信息学软件命名实体

Hao Xuan, Rithvij Pasupuleti, Ben Liu, Haishuo Sun, Jun Zhang, Zijun Yao, Cuncong Zhong

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出混合命名实体识别框架SNAIL,结合词汇与语义建模策略,在基准数据集及真实文献上识别生物信息学软件/数据库,性能优于现有方法,可用于大规模文献的资源元分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22448 2026-08-21 cs.MA 版本更新 71%

Where Facts Go Missing: A Layerwise Taxonomy and Per-Layer Attribution of Information Omission in Air-Gapped LLMAgent Pipelines

事实缺失的地方:气隙式大语言模型智能体管道中信息遗漏的分层分类和逐层归因

Santhiya Rajan, Samuel Mugel, Roman Orus

专题命中 领域大模型 :LLM(title)

AI总结 研究气隙式大语言模型智能体管道中信息遗漏问题,提出九层分类法、归因方法、跨架构比较框架及运行时检测框架,经多模型多引擎试验,确定遗漏率及来源,为定位运营商干预位置提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07104 2026-08-21 cs.CV cs.AI 版本更新 70%

Extended to Reality: Prompt Injection in 3D Environments

扩展到现实:3D环境中的提示注入

Zhuoheng Li, Ying Chen

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究提出PI3D攻击,通过在3D环境中放置带文本的物理物体来注入提示,挑战多模态大语言模型的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20097 2026-08-21 cs.CR cs.DC 新提交 67%

TrustRAG: Blockchain-Enhanced RAG via Committee-Based Credibility Scoring

TrustRAG:基于区块链的检索增强生成系统,通过委员会机制实现可信度评分

Baixiang Liu, Haotian Che, Yuan Li

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 针对RAG系统难以验证文档可信度的问题,提出TrustRAG,结合区块链与委员会机制,通过零知识协议、安全多方计算及哈希承诺实现可验证的文档信任评分,保障关键领域决策安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20331 2026-08-21 cs.CL cs.AI cs.CV 新提交 62%

G-CARL: Grounded Checklist-Aligned Reward Learning for Patient-Oriented Medical Report Interpretation

G-CARL:面向患者的医学报告解读的基于 grounded 核对清单对齐的奖励学习

Shiao Xie, Siyu Chen, Jianwei Lv, Bo Yuan, Yujin Wang, Xiandong Li

专题命中 领域大模型 :post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文针对现有医学视觉-语言任务无法兼顾医学事实性与患者语境沟通的问题,提出PMRI任务及G-CARL框架,构建MMedReport基准,实验证实其解读更贴合患者需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20315 2026-08-21 cs.LG 新提交 57%

Explainable Transformer Models for Clinical Prediction Tasks on Structured Electronic Health Records

用于结构化电子健康记录临床预测任务的可解释Transformer模型

Jun Ni Du, Lukas Adamek, Maxim Kryukov, Flavio Dormont, Ziv Bar-Joseph, Sven Jager, Brandon Rufino

机构 * Sanofi(赛诺菲) Carnegie Mellon University(卡内基梅隆大学)

专题命中 领域大模型 :language model(abstract);分类 cs.LG

AI总结 研究针对结构化EHR预测模型的可解释性缺口,提出BERT-LER模型,在EHRShot等任务中性能优于多数基准模型,归因符合临床风险因素,可推广至多领域。

Comments Accepted at MLHC 2026; to appear in Proceedings of Machine Learning Research (PMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19825 2026-08-21 cs.CV cs.CL 新提交 57%

Towards Clinically Faithful Medical Image Captioning via Enhanced Vision-Language Alignment

基于增强型视觉-语言对齐的临床可信医学图像描述生成研究

Yunseo Lee, Hyun Jun Kim, Heeseung Shin, Changwon Lim

机构 * Chung-Ang University(中央大学)

专题命中 领域大模型 :language model(abstract);分类 cs.CL

AI总结 本研究针对医学图像描述生成的临床可信性问题,提出分离训练与推理对齐的框架,结合多编码器、辅助学习及MedPAIR-SCST方法,通过选择与强化学习对齐提升临床一致性,在数据受限场景下改善医学图像描述的可信度。

Comments 10 pages, 2 figures, 7 tables. Preprint submitted to IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29530 2026-08-21 cs.LG 版本更新 57%

A Neurosymbolic Approach for Explainable Early Diagnosis of Alzheimer's Disease

一种用于阿尔茨海默病可解释早期诊断的神经符号方法

Ranveer Singh, Pranuthi Tenali, Saurabh Mathur, Ameet Soni, Vaishali Phatak, Karla Lynch, Daniel Murman, Matthew Rizzo, Sriraam Natarajan

专题命中 领域大模型 :foundation model(abstract);分类 cs.LG

AI总结 该研究提出一种自动化流程,用预训练基础模型处理言语流畅性测试音频构建贝叶斯网络,以实现阿尔茨海默病的可解释早期诊断,成功恢复临床知识并识别语言标志物间新关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19784 2026-08-21 cs.SE 新提交 50%

PRAXIS: Graph-Grounded Tacit Knowledge for Domain Code Generation

PRAXIS:面向领域代码生成的基于图的默会知识

Xue Jiang, Tianyu Zhang, Lingwei Wu, Ziyu Wang, Ge Li, Yuan Sui, Hao Zhu, Wenpin Jiao, Zhi Jin, Yihong Dong

专题命中 领域大模型 :LLM(abstract)

AI总结 PRAXIS框架通过模拟人类开发工作流提取代码依赖图上的默会知识,提升智能体领域代码生成性能,优于现有方法且可适配多种智能体框架与大语言模型

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19385 2026-08-21 cs.CV 新提交 50%

Beyond Recognition: Compact Multi-Domain Arabic Manuscript HTR with Candidate-Selection Analysis and Evidence-Preserving Review

超越识别:结合候选选择分析与证据保留审核的紧凑多域阿拉伯手稿手写文本识别(HTR)

Abdullah Ahmed Ali, Mohammed Thamer Abdulhadi, Ali Haider Safaa, Dhulfiqar Mahdi Wadi

机构 * University of Technology(理工大学)

专题命中 领域大模型 :language model(abstract)

AI总结 本研究提出Phoenix识别器与Athar审核工作流,通过多域适配技术提升阿拉伯手稿HTR性能,结果表明手稿HTR应作为可审计证据管理而非单纯文本替换进行评估。

Comments 13 pages, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18637 2026-08-21 cs.IR 版本更新 50%

PILOT Technical Report

PILOT技术报告

Jiuning Lin, Ruiquan Lan, Xiaodong Zhu, Bin Zhang, Chengyu Lai, Chuxin Chen, Dimin Wang, Han Zhu, Hongtao Cheng, Jialin Zhu, Lingqing Zhang, Shuai Zhong, Tao Wang, Weipeng Huang, Yinjiang Cai, Yinnan Song, Yuan Liu, Zhibo Xiao, Zhixin Ma, Zihong Huang

专题命中 领域大模型 :LLM(abstract)

AI总结 该研究针对现有推荐系统优化智能体方法的反应式缺陷,提出PILOT框架,通过三类角色构建控制循环,在淘宝平台对比ROAM验证,实现多项指标提升且搜索效率显著提高,无需人工干预。

Comments Technical Report, 42 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21123 2026-08-21 physics.ao-ph physics.ed-ph 版本更新 50%

Navigating Through Turbulence: Charting Early Careers in Weather and Climate Science

在动荡中前行:规划天气与气候科学领域的早期职业生涯

Gan Zhang, Zhuo Wang, Kevin A Reed, Lucas M Harris, Stephen W Nesbitt

专题命中 领域大模型 :prompting(abstract)

AI总结 本文针对天气与气候科学领域的职业不确定性,提出高分辨率模拟与AI带来的新兴前沿机遇,给出职业规划路径及教育培训改进建议,助力从业者服务公众应对大气变化。

Comments Essay for Bulletin of the American Meteorological Society (BAMS). Invited submission to go through peer review

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 知识编辑与模型理解 9 篇

2608.19579 2026-08-21 cs.AI math.DS 新提交 90%

Enforcing LLM Safety through DMD-based Classification of Prompt-Response Embedding Dynamics

基于DMD的提示-响应嵌入动态分类实现大语言模型安全

Mohamed Akrout, Olivera Kotevska, Dan Wilson

机构 * University of Tennessee(田纳西大学) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 知识编辑与模型理解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文将幻觉检测的动力系统框架扩展到LLM安全分类,通过拟合安全与不安全状态的Koopman模型,利用差分残差评分分类不安全输出,在多基准测试中验证了纳入提示嵌入的改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19211 2026-08-21 cs.CL cs.AI cs.SD eess.AS 新提交 89%

Represented but Ignored: A Causal Account of Prosodic Underuse in Audio-Language Models

被表征却被忽视:音频语言模型中韵律使用不足的因果解释

Linkai Peng, Baorian Nuchged

机构 * University of Connecticut(康涅狄格大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究针对音频语言模型(audio-LLM)韵律使用不足的问题,通过阶段特定探测阶梯与隐藏状态干预实验,发现模型能表征韵律却未在输出中表达,瓶颈在于韵律的使用而非感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17168 2026-08-21 cs.CL 版本更新 85%

RepSelect: Robust LLM Unlearning via Representation Selectivity

RepSelect: 通过表示选择性实现鲁棒的大语言模型遗忘

Filip Sondej, Yushi Yang, Adam Mahdi

机构 * Independent(独立) University of Oxford(牛津大学)

专题命中 知识编辑与模型理解 :LLM(title,abstract);prompting(abstract);分类 cs.CL

AI总结 针对现有遗忘方法易被微调或少样本提示逆转的问题,提出RepSelect方法,通过梯度主成分坍塌隔离遗忘集表示,实现深度鲁棒遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19611 2026-08-21 cs.CL cs.AI cs.LG 新提交 75%

Forking Fast: Efficiently Estimating Uncertainty Dynamics in Text Generation

快速分叉:高效估计文本生成中的不确定性动态

Eric Bigelow, Amir Zur, Satchel Grant, Tal Haklay, Can Rager, Owen Lewis, Thomas McGrath, Jack Merullo, Ekdeep Singh Lubana, Atticus Geiger

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对文本生成中不确定性动态估计成本高的问题,本研究开发统计模型平滑低采样推理数据以近似高采样数据,提升重采样分析效率,揭示不确定性动态的稳定模式及噪声来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04003 2026-08-21 cs.LG 74%

Seamlessly Integrating Tree-Based Positional Embeddings into Transformer Models for Source Code Representation

Patryk Bartkowiak, Filip Graliński

机构 * Adam Mickiewicz University(亚当·密茨凯维奇大学)

专题命中 知识编辑与模型理解 :language model(abstract,comments);pretraining(abstract);分类 cs.LG;large language model(comments)

Comments Published at "The 1st Joint Workshop on Large Language Models and Structure Modeling"

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18936 2026-08-21 cs.LG cs.AI cs.NE 版本更新 62%

Graphical Design of Interpretable Architectures

可解释架构的图形化设计

Pietro Barbiero

机构 * IBM Research(IBM研究院)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出改编自Penrose张量表示法的图形符号,可直观呈现可解释AI架构的全局视图并与PyTorch einsum代码一一对应,还绘制了Steerling-8B的架构图并转换为代码。

详情

展开后加载摘要…

URL PDF HTML 收藏