arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-21 至 2026-08-21 共收录 22 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 22 篇

2608.19665 2026-08-21 cs.IR 新提交 91%

Training-Free LLM-Based Recommendation with Post-LLM Item Refinement Using Collaborative Signals

基于LLM的无训练推荐:利用协同信号的后LLM物品优化

Kyungho Kim, Sunwoo Kim, Geon Lee, Shinhwan Kang, Sojeong Kim, Liam Collins, Bhuvesh Kumar, Donald Loveland, Kijung Shin

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出后LLM范式的无训练推荐框架CoRRe,通过协同信号优化物品嵌入,在真实数据集上性能优于现有无训练方法,接近或超过有训练方法。

Comments Published as a conference paper at CIKM 2026 (short)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02910 2026-08-21 cs.HC cs.AI cs.CY 版本更新 91%

The Basic B*** Effect: The Use of LLM-based Agents Reduces the Distinctiveness and Diversity of People's Choices

基本B效应:基于大语言模型(LLM)的智能体的使用会降低人们选择的独特性与多样性

Sandra C. Matz, Kimberly Klugescheid, C. Blaine Horton, Sofie Goethals

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究通过实地研究和对照实验发现,使用基于LLM的智能体会降低人们选择的独特性与多样性,且顺序选择、智能体个性化会放大该效应,相关发现对设计维护人类多样性的AI系统具有重要意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19529 2026-08-21 cs.CL cs.AI 新提交 90%

When Machines Speak: A Unified Generative Framework for Integrating Machine-Native Symbols into Pretrained Large Language Models

当机器说话:将机器原生符号整合到预训练大语言模型的统一生成框架

Su Yan, Rakesh Iyer

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.AI

AI总结 研究针对预训练大语言模型无法处理机器原生符号的问题,提出UniLang框架将机器原生符号与自然语言 token 同等建模,在序列推荐、法律先例预测任务上均优于基线,拓展了LLMs的应用范围。

Comments Code: this https URL (https://github.com/Stella-S-Yan/llm-internalization)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19008 2026-08-21 cs.AI 版本更新 90%

Computational Phenomenology of Borderline Personality Disorder: A Comparative Evaluation of LLM-Simulated Expert Personas and Human Clinical Experts

边缘型人格障碍的计算现象学:对LLM模拟专家人设与人类临床专家的比较评估

Marcin Moskalewicz, Anna Sterna, Karolina Drożdż, Kacper Dudzic, Marek Pokropski, Paula Flores

机构 * IDEAS Research Institute(IDEAS研究机构) Adam Mickiewicz University(亚当·密茨凯维奇大学) AMU Center for Artificial Intelligence(AMU人工智能中心) Poznań University of Medical Sciences(波兹南医科大学) Maria Curie-Skłodowska University(玛丽·居里-斯洛多夫斯卡大学) University of Warsaw(华沙大学)

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究比较了LLM模拟专家与人类专家在边缘型人格障碍定性分析中的表现,发现模型在某些方面与人类难以区分,并能识别人类遗漏的主题,展示了AI增强分析的潜力。

Comments 28 pages, 8 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20153 2026-08-21 cs.CL 新提交 88%

FormalTCS: Benchmarking End-to-End Frontier Formal Theoretical Computer Science Research of Large Language Models

FormalTCS:评估大型语言模型端到端前沿形式理论计算机科学研究的基准

Dingzirui Wang, Xuanliang Zhang, Keyan Xu, Qingfu Zhu, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 FormalTCS基准评估发现,当前大型语言模型完成端到端前沿TCS研究的能力不足,形式化是核心瓶颈,且研究品味限制了自主TCS研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20220 2026-08-21 cs.AI 新提交 87%

InsufficiencyBench: Evaluating LLM legal advice on underspecified user queries

InsufficiencyBench:评估大型语言模型(LLM)在信息不足的用户查询下的法律建议

Samuel J. Vincent, Daniel Calloway, Fangyi Yu, Andrew M. Bean, Nabeel Seedat

机构 * Thomson Reuters Foundational Research(汤姆森路透基础研究机构) Imperial College London(帝国理工学院)

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究构建了首个针对查询端信息不足的法律基准InsufficiencyBench,评估前沿LLM在信息不足的法律查询中识别缺失要素、避免过早结论的能力,发现现有模型表现不佳。

Comments 10 pages, Best Paper Honorable Mention at ICML AI4Law 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19206 2026-08-21 cs.CL cs.AI cs.MA 新提交 87%

Hallucination as a Feature, not a Defect: Evaluating a multi-agent architecture to transform speculative language-model outputs into testable scientific hypotheses

幻觉作为特征而非缺陷:评估一种将推测性语言模型输出转化为可检验科学假说的多智能体架构

Nicolas Rodriguez-Alvarez (IES Parquesol, Valladolid, Spain)

机构 * IES Parquesol(帕尔奎索尔学院)

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该研究提出基于Rust的多智能体架构,通过生成与评估智能体的认识论摩擦循环将LLM的推测性输出转化为可检验假说,实验显示该架构在需经受严格约束时更具优势,且各架构在原创性等维度的平衡表现不同。

Comments 25 pages. Bilingual: full English version followed by the complete Spanish version. Includes an exploratory paired baseline and ablation study (6 conditions). Code and data: this https URL (https://doi.org/10.5281/zenodo.20649714)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19790 2026-08-21 cs.AI 新提交 81%

LLMs as Acquisition Policies for Finite-Pool Materials Optimization: A Controlled Study

大语言模型作为有限池材料优化的获取策略:一项对照研究

Dino-Rober Demir, Florian Le Bronnec, Rio Yokota

机构 * RIKEN(理化学研究所)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究探究开放权重大语言模型能否作为有限池材料优化的独立获取策略,经对照实验发现其无需任务特定训练即可提供有用获取信号,虽可靠性受多因素影响但显示出应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19230 2026-08-21 cs.DL cs.AI 新提交 79%

When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models

当AI撰写时,谁会被引用?语言模型间的引用单一文化证据

Sina Alemohammad, Denghui Zhang, Bolong Tang, Anthony Qin, Gengchen Mai, Ahmed Abbasi, Richard Baraniuk, Zhangyang Wang

专题命中 领域大模型 :language model(title,abstract);分类 cs.AI

AI总结 该研究发现,即使引用真实,当前语言模型仍会产生引用单一文化,需改变其共享偏好图而非仅均衡检索或混合厂商。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15910 2026-08-21 cs.CL 版本更新 79%

Calibrated Triage, Not Autonomy: Confidence Estimation for Medical Vision-Language Models

校准的分诊,而非自主:医学视觉-语言模型的置信度估计

Reza Khanmohammadi, Kundan Thind, Mohammad M. Ghassemi

机构 * Michigan State University(密歇根州立大学)

专题命中 领域大模型 :language model(title,abstract);分类 cs.CL

AI总结 针对医学视觉-语言模型在回答时可能忽略图像而依赖语言先验的问题,提出使用置信度估计进行校准分诊,通过评估七种置信度估计器,发现高置信度区域是区分可用估计器的关键,最佳探针可将错误率从41-45%降至1-4%,但无估计器在所有领域和模型中一致最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19201 2026-08-21 cs.CL cs.AI cs.IR q-bio.QM 新提交 73%

Automatic bioinformatic software named entity recognition from literature

从文献中自动识别生物信息学软件命名实体

Hao Xuan, Rithvij Pasupuleti, Ben Liu, Haishuo Sun, Jun Zhang, Zijun Yao, Cuncong Zhong

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出混合命名实体识别框架SNAIL,结合词汇与语义建模策略,在基准数据集及真实文献上识别生物信息学软件/数据库,性能优于现有方法,可用于大规模文献的资源元分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22448 2026-08-21 cs.MA 版本更新 71%

Where Facts Go Missing: A Layerwise Taxonomy and Per-Layer Attribution of Information Omission in Air-Gapped LLMAgent Pipelines

事实缺失的地方:气隙式大语言模型智能体管道中信息遗漏的分层分类和逐层归因

Santhiya Rajan, Samuel Mugel, Roman Orus

专题命中 领域大模型 :LLM(title)

AI总结 研究气隙式大语言模型智能体管道中信息遗漏问题,提出九层分类法、归因方法、跨架构比较框架及运行时检测框架,经多模型多引擎试验,确定遗漏率及来源,为定位运营商干预位置提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07104 2026-08-21 cs.CV cs.AI 版本更新 70%

Extended to Reality: Prompt Injection in 3D Environments

扩展到现实:3D环境中的提示注入

Zhuoheng Li, Ying Chen

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究提出PI3D攻击,通过在3D环境中放置带文本的物理物体来注入提示,挑战多模态大语言模型的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20097 2026-08-21 cs.CR cs.DC 新提交 67%

TrustRAG: Blockchain-Enhanced RAG via Committee-Based Credibility Scoring

TrustRAG:基于区块链的检索增强生成系统,通过委员会机制实现可信度评分

Baixiang Liu, Haotian Che, Yuan Li

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 针对RAG系统难以验证文档可信度的问题,提出TrustRAG,结合区块链与委员会机制,通过零知识协议、安全多方计算及哈希承诺实现可验证的文档信任评分,保障关键领域决策安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20331 2026-08-21 cs.CL cs.AI cs.CV 新提交 62%

G-CARL: Grounded Checklist-Aligned Reward Learning for Patient-Oriented Medical Report Interpretation

G-CARL:面向患者的医学报告解读的基于 grounded 核对清单对齐的奖励学习

Shiao Xie, Siyu Chen, Jianwei Lv, Bo Yuan, Yujin Wang, Xiandong Li

专题命中 领域大模型 :post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文针对现有医学视觉-语言任务无法兼顾医学事实性与患者语境沟通的问题,提出PMRI任务及G-CARL框架,构建MMedReport基准,实验证实其解读更贴合患者需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20315 2026-08-21 cs.LG 新提交 57%

Explainable Transformer Models for Clinical Prediction Tasks on Structured Electronic Health Records

用于结构化电子健康记录临床预测任务的可解释Transformer模型

Jun Ni Du, Lukas Adamek, Maxim Kryukov, Flavio Dormont, Ziv Bar-Joseph, Sven Jager, Brandon Rufino

机构 * Sanofi(赛诺菲) Carnegie Mellon University(卡内基梅隆大学)

专题命中 领域大模型 :language model(abstract);分类 cs.LG

AI总结 研究针对结构化EHR预测模型的可解释性缺口,提出BERT-LER模型,在EHRShot等任务中性能优于多数基准模型,归因符合临床风险因素,可推广至多领域。

Comments Accepted at MLHC 2026; to appear in Proceedings of Machine Learning Research (PMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19825 2026-08-21 cs.CV cs.CL 新提交 57%

Towards Clinically Faithful Medical Image Captioning via Enhanced Vision-Language Alignment

基于增强型视觉-语言对齐的临床可信医学图像描述生成研究

Yunseo Lee, Hyun Jun Kim, Heeseung Shin, Changwon Lim

机构 * Chung-Ang University(中央大学)

专题命中 领域大模型 :language model(abstract);分类 cs.CL

AI总结 本研究针对医学图像描述生成的临床可信性问题,提出分离训练与推理对齐的框架,结合多编码器、辅助学习及MedPAIR-SCST方法,通过选择与强化学习对齐提升临床一致性,在数据受限场景下改善医学图像描述的可信度。

Comments 10 pages, 2 figures, 7 tables. Preprint submitted to IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29530 2026-08-21 cs.LG 版本更新 57%

A Neurosymbolic Approach for Explainable Early Diagnosis of Alzheimer's Disease

一种用于阿尔茨海默病可解释早期诊断的神经符号方法

Ranveer Singh, Pranuthi Tenali, Saurabh Mathur, Ameet Soni, Vaishali Phatak, Karla Lynch, Daniel Murman, Matthew Rizzo, Sriraam Natarajan

专题命中 领域大模型 :foundation model(abstract);分类 cs.LG

AI总结 该研究提出一种自动化流程,用预训练基础模型处理言语流畅性测试音频构建贝叶斯网络,以实现阿尔茨海默病的可解释早期诊断,成功恢复临床知识并识别语言标志物间新关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19784 2026-08-21 cs.SE 新提交 50%

PRAXIS: Graph-Grounded Tacit Knowledge for Domain Code Generation

PRAXIS:面向领域代码生成的基于图的默会知识

Xue Jiang, Tianyu Zhang, Lingwei Wu, Ziyu Wang, Ge Li, Yuan Sui, Hao Zhu, Wenpin Jiao, Zhi Jin, Yihong Dong

专题命中 领域大模型 :LLM(abstract)

AI总结 PRAXIS框架通过模拟人类开发工作流提取代码依赖图上的默会知识,提升智能体领域代码生成性能,优于现有方法且可适配多种智能体框架与大语言模型

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19385 2026-08-21 cs.CV 新提交 50%

Beyond Recognition: Compact Multi-Domain Arabic Manuscript HTR with Candidate-Selection Analysis and Evidence-Preserving Review

超越识别:结合候选选择分析与证据保留审核的紧凑多域阿拉伯手稿手写文本识别(HTR)

Abdullah Ahmed Ali, Mohammed Thamer Abdulhadi, Ali Haider Safaa, Dhulfiqar Mahdi Wadi

机构 * University of Technology(理工大学)

专题命中 领域大模型 :language model(abstract)

AI总结 本研究提出Phoenix识别器与Athar审核工作流,通过多域适配技术提升阿拉伯手稿HTR性能,结果表明手稿HTR应作为可审计证据管理而非单纯文本替换进行评估。

Comments 13 pages, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18637 2026-08-21 cs.IR 版本更新 50%

PILOT Technical Report

PILOT技术报告

Jiuning Lin, Ruiquan Lan, Xiaodong Zhu, Bin Zhang, Chengyu Lai, Chuxin Chen, Dimin Wang, Han Zhu, Hongtao Cheng, Jialin Zhu, Lingqing Zhang, Shuai Zhong, Tao Wang, Weipeng Huang, Yinjiang Cai, Yinnan Song, Yuan Liu, Zhibo Xiao, Zhixin Ma, Zihong Huang

专题命中 领域大模型 :LLM(abstract)

AI总结 该研究针对现有推荐系统优化智能体方法的反应式缺陷,提出PILOT框架,通过三类角色构建控制循环,在淘宝平台对比ROAM验证,实现多项指标提升且搜索效率显著提高,无需人工干预。

Comments Technical Report, 42 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21123 2026-08-21 physics.ao-ph physics.ed-ph 版本更新 50%

Navigating Through Turbulence: Charting Early Careers in Weather and Climate Science

在动荡中前行:规划天气与气候科学领域的早期职业生涯

Gan Zhang, Zhuo Wang, Kevin A Reed, Lucas M Harris, Stephen W Nesbitt

专题命中 领域大模型 :prompting(abstract)

AI总结 本文针对天气与气候科学领域的职业不确定性,提出高分辨率模拟与AI带来的新兴前沿机遇,给出职业规划路径及教育培训改进建议,助力从业者服务公众应对大气变化。

Comments Essay for Bulletin of the American Meteorological Society (BAMS). Invited submission to go through peer review

详情

展开后加载摘要…

URL PDF HTML 收藏