arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-13 至 2026-08-13 共收录 24 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 24 篇

2509.15122 2026-08-13 cs.CY 版本更新 91%

Prestige over merit: An adapted audit of LLM bias in peer review

声望胜过能力:对同行评审中大型语言模型(LLM)偏差的适应性审计

Anthony Howell, Jieshu Wang, Luyu Du, Julia Melkers, Varshil Shah

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究开发多角色LLM模拟系统,审计发现LLM在同行评审中存在偏差,机构声望是核心影响因素,低声望作者的论文更易被拒,训练数据的领域规范与声望先验是关键成因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11839 2026-08-13 cs.LG 版本更新 91%

Grounding Large Language Models as Generalizable Policies in Network Control

大语言模型作为网络优化的通用策略

Duo Wu, Linjia Kang, Zhimin Wang, Fangxin Wang, Wei Zhang, Chongbo Sun, Xuefeng Tao, Wei Yang, Le Zhang, Wenwu Zhu, Peng Cui, Zhi Wang

机构 * Bytedance(字节跳动) Shenzhen International Graduate School(深圳国际研究生院) Tsinghua University(清华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Department of Computer Science and Technology(计算机科学与技术系)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);foundation model(abstract)

AI总结 本文提出Trailblazer框架,利用大语言模型实现跨任务和环境的通用网络策略,通过网络对齐和策略协作机制提升效率与泛化能力。

Comments Arxiv version. Official version has been submitted to IEEE Transactions on Mobile Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12025 2026-08-13 cs.SE cs.AI 新提交 91%

From Safety Documentation to Safety Knowledge Support: An Evidence-Grounded LLM Framework for Medical Devices

从安全文档到安全知识支持:面向医疗器械的基于证据的大语言模型框架

Tuhinangshu Gangopadhyay, Rasmus Adler, Peter Liggesmeyer, Jan Reich

专题命中 领域大模型 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对现有LLM在医疗器械安全工程中源链接等支持不足的问题,本文提出基于证据的LLM框架,用于安全知识支持,不做安全判定,还给出对应评估策略。

Comments ISSRE 2026, AISQ, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12184 2026-08-13 cs.IR 新提交 90%

Making Collaborative Signals Count: Graph-Aware Large Language Models for Sequential Recommendation

让协同信号发挥作用:面向序列推荐的图感知大语言模型

Fenglin Yan, Bohao Wang, Jian Zhang, Yu Cui, Tongya Zheng, Ye Feng, Can Wang, Jiawei Chen

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 针对现有序列推荐方法难以捕捉全局协同模式的问题,提出图感知大语言模型框架GALLM,通过构建协同图建模三类关系并整合至注意力机制,在四个基准上取得最优性能,HR@5较最强基线平均提升9.76%。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11241 2026-08-13 cs.AI cs.IR 新提交 90%

RecSys Factory: Bounding LLM Agent Autonomy to Decision Points in the Industrial Recommender Lifecycle

RecSys Factory:限制LLM智能体在工业推荐生命周期内的自主决策点

Dongyang Ao, Kaixiang Fang, Shijie Xu

机构 * Tencent(腾讯) FiT(腾讯FiT)

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.AI

AI总结 RecSys Factory 是限制 LLM 智能体自主到决策点的平台,解决工业推荐系统运营的三角困境,在腾讯三业务线部署 78 天,CLI 调度成功率达 78.6%。

Comments 21 pages, 6 figures, 9 tables. Reports a 78-day deployment across three heterogeneous industrial recommender business lines (1,624 CLI-tool dispatches). Companion paper: AutoResearch (P3b), which instantiates the same substrate for autonomous research

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16749 2026-08-13 cs.CR cs.AI 交叉投稿 90%

Evaluating LLM Generated Detection Rules in Cybersecurity

评估大语言模型(LLM)生成的网络安全检测规则

Anna Bertiger, Bobby Filar, Aryan Luthra, Stefano Meschiari, Aiden Mitchell, Sam Scholten, Vivek Sharath

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出开源评估框架与基准指标,以保留集法对比LLM与人工生成的网络安全规则,多维度评估LLM规则生成器有效性,并分析了Sublime Security的自动检测工程师(ADE)能力。

Comments Preprint of a paper accepted at the Conference on Applied Machine Learning in Information Security (CAMLIS 2025). 11 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11220 2026-08-13 cs.AI cs.MA 新提交 86%

LLMs in Process Diagram Engineering: From Optimal PFDs to Validated P&IDs

流程图表工程中的大语言模型:从最优工艺流程图到经验证的管道及仪表流程图

Timur Zakarin, Sergei Voitov, Sergei Shumilin, Evgeny Burnaev

机构 * Skoltech(斯科尔科沃科技学院) AIRI(人工智能研究院(AIRI))

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出P&ID Pilot端到端AI流水线,结合GA与LLM生成最优PFD,再通过基于LLM的智能体将其转换为100%执行成功的合规P&ID,实现工艺设计自动化并减少人工工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27723 2026-08-13 cs.LG stat.ML 版本更新 86%

Optimized Deferral for Imbalanced Settings

优化不平衡设置下的延迟策略

Corinna Cortes, Anqi Mao, Mehryar Mohri, Yutao Zhong

机构 * Google Research(谷歌研究) Courant Institute of Mathematical Sciences(Courant数学科学研究所)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了在专家不平衡情况下两阶段学习延迟方法,提出新的成本敏感学习算法MILD,通过改进损失函数和保障机制,提升了图像分类和LLM路由任务的性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12138 2026-08-13 cs.CL cs.AI cs.HC cs.IR cs.LG 新提交 86%

A corpus-specific clinical RAG system matches or outperforms newer frontier LLMs on HealthBench

针对特定语料库的临床检索增强生成(RAG)系统在HealthBench上的表现与较新的前沿大语言模型相当或更优

Praveen Reddy, Charuta Mandke, Suvrankar Datta, Sarah Khan, Siddharth Reddy Anthireddy, Shitij Arora, Vishal Singh

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文评估专为中低收入环境构建的临床RAG系统VITA,其在HealthBench基准测试中与前沿LLM表现相当或更优,语料库特异性可提升模型落地性但会降低沟通流畅度。

Comments 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11744 2026-08-13 cs.SE 新提交 86%

Harnessing LLMs for Document-Guided Fuzzing of Python Libraries

利用大语言模型(LLM)实现Python库的文档引导模糊测试

Bin Duan, Tarek Mahmud, Meiru Che, Yan Yan, Naipeng Dong, Dan Dongseong Kim, Guowei Yang

专题命中 领域大模型 :LLM(title_cn,summary_cn)

AI总结 本文提出VistaFuzz,一种基于本地开源LLM的文档引导模糊测试技术,用于测试Python库API,在12个库的7718个API上发现74个问题,其中43个已确认、29个已修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04571 2026-08-13 cs.AI 版本更新 81%

OpenAg: Democratizing Agricultural Intelligence

OpenAg:推动农业智能的平民化

Srikanth Thudumu, Jason Fisher

机构 * Institute of Applied Artificial Intelligence and Robotics (IAAIR)(应用人工智能与机器人研究所)

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本研究提出OpenAg框架,结合多类技术构建农业通用人工智能系统,以解决现有农业智能系统的不足,助力符合当地实际的农业决策。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12228 2026-08-13 cs.SE 新提交 80%

Towards Automated Domain Model Extraction from Source Code using Heuristics and Open-Source LLMs

基于启发式方法与开源大语言模型(LLMs)从源代码中自动提取领域模型的研究

Alessandra Mancas, Mounir Ammam, Hyacinth Ali, Kevin Delcourt, Houari Sahraoui

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出结合启发式方法与开源LLMs的自动领域模型提取方法,克服上下文限制,在10个项目数据集上获高F1分数,适用于隐私敏感的工业逆向工程场景。

Comments To appear in the Proceedings of the 29th International Conference on Model Driven Engineering Languages and Systems (MODELS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11259 2026-08-13 cs.CY cs.AI 新提交 77%

Methodologies for Improving the Quality of AI Tutoring in K-12 Education

提升K-12教育中AI辅导质量的方法

Tushar Udeshi, Anna Khazenzon, Kabir Khan, Nick Breen, RJ Corwin, Chris DiGiano, Kodi Weatherholtz, Marek Zaluski

专题命中 领域大模型 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文针对K-12教育中AI辅导质量提升问题,以Khanmigo为研究对象,介绍了相关衡量指标与实验,阐述了模型、提示工程等方面对指标产生积极影响的改动。

Comments 15 pages. Accepted at AIED 2026 (27th International Conference on Artificial Intelligence in Education). Published version: Artificial Intelligence in Education, LNCS vol. 16582, Springer, Cham, first online 25 June 2026 (cite as 2027)

Journal ref In: Blanchard, E.G., Chen, G., Chi, M., Isotani, S. (eds) Artificial Intelligence in Education. AIED 2026. Lecture Notes in Computer Science, vol 16582. Springer, Cham (2027)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18452 2026-08-13 cs.CL 77%

MedScore: Generalizable Factuality Evaluation of Free-Form Medical Answers by Domain-adapted Claim Decomposition and Verification

Heyuan Huang, Alexandra DeLucia, Vijay Murari Tiyyala, Mark Dredze

机构 * Center for Language and Speech Processing(语言与语音处理中心) Johns Hopkins University(约翰霍普金斯大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Added generalizability experiment and examples on non-medical free-form answer. Added ablation study for MedCorp verification corpus and MedScore decomposition prompt

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 14149-14180, San Diego, California, United States. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12036 2026-08-13 cs.AI cs.CL cs.HC cs.LG cs.MA 新提交 75%

Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence

Mechanist:作为科学仪器的AI,用于发现智能的机制

Mengru Wang, Junfeng Fang, Shuofei Qiao, Zhenqian Xu, Haoming Xu, Haoxiong Wang, Shumin Deng, Linyi Yang, Zhixiang Cui, Xin Xu, Yunzhi Yao, Buqiang Xu, Fei Shen, Haozhe Luo, Yunxiang Wei, Ningyu Zhang, Julian McAuley, Tat Seng Chua, Huajun Chen

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Heriot-Watt University(赫瑞瓦特大学) Southern University of Science and Technology(南方科技大学) University of California, San Diego(加利福尼亚大学圣迭戈分校) Northeastern University(东北大学)

专题命中 领域大模型 :foundation model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究推出智能体系统Mechanist,以AI为科学仪器自主发现AI智能机制,其生成假设更有价值、实验更可靠,还能发现安全风险、构建信念机制理论并转化为提升模型性能的干预措施。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11420 2026-08-13 cs.AI cs.CL 新提交 73%

Social Chain of Thought: A Multi-Agent Architecture Grounded in Medical Differential Diagnosis Methodology

社会思维链:一种基于医学鉴别诊断方法论的多智能体架构

Del Coburn, Scott Sanner, Dan Silver

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出基于医学鉴别诊断方法论的多智能体架构SCoT,通过多轮专家协作提升复杂病例诊断召回率,其优势无法通过单一推理实现。

Comments 14 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11830 2026-08-13 cs.CY cs.CL 新提交 70%

Quantifying the Relationship Between Clinical Safety and Environmental Impact in Therapeutic LLMs

量化治疗型大语言模型(LLMs)的临床安全性与环境影响之间的关系

Alireza A. Safaei, Laura M. Vowels, Matthew J. Vowels, Apoorv Jha, Shekoufeh Rahimi

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究量化治疗型LLMs的临床安全性与环境影响的关系,发现安全分布高端存在非线性权衡,额外测试时计算未必提升安全,提出动态模型选择等可持续部署方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11354 2026-08-13 cs.AI 新提交 70%

Inverse Theory of Mind Modeling for Content Recommendation: From Web Browsing to Dynamic Intelligent Interfaces

用于内容推荐的反向心智理论建模:从网页浏览到动态智能界面

Mengyu Chen, Feiyu Lu, Chun-Fu Chen, Lucas Vinh Tran, Jay Katukuri

机构 * JPMorganChase(摩根大通)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出反向心智理论(IToM)流程,从用户交互反向推理推断信念与偏好,在OPeRA数据集上验证其画像推断效果,并通过VisionOS应用展示跨模态迁移能力,提升内容推荐的用户理解精度。

Comments Preprint for conference full paper at 20th ACM Conference on Recommender Systems (RecSys '26), Minneapolis, MN, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11175 2026-08-13 cs.AI 版本更新 70%

The Path to Self-Evolving Clinical Systems: Scaling Medical Agents from Assistance to Autonomy

自我进化临床系统之路:将医疗智能体从辅助扩展到自主

Chunzheng Zhu, Lei Tian, Bohan Tan, Ziqi Zhou, Yuxuan Sun, Yijun Wang, Chengchao Lv, Yilin Wen, Yijun He, Jinghao Lin, Yihang Chen, Chee Wei Tan, Qianshan Wei, Lei Zhao, Bin Pu, Kenli Li, Yuan Xue, Jianxin Lin

机构 * Hunan University(湖南大学) ByteDance(字节跳动) Duke University(杜克大学) Westlake University(西湖大学) The University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Macau(澳门大学) The Ohio State University(俄亥俄州立大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨大语言模型等对医疗智能体的重塑,从临床部署出发,将其形式化为决策系统并给出自主性分类。沿统一框架扩展,强调临床环境扩展为关键方向,定位临床自我进化为前沿,还研究了多领域应用及挑战,提供医学成像系统路线图。

Comments Project page: https://github.com/zhcz328/Awesome-Medical-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10584 2026-08-13 astro-ph.IM cs.AI gr-qc 70%

An agentic framework for gravitational-wave counterpart association in the multi-messenger era

一种用于多信使时代引力波反演关联的代理框架

Yiming Dong, Yacheng Kang, Junjie Zhao, Xinyuan Zhu, Ziming Wang, Lijing Shao

机构 * Department of Astronomy, School of Physics(天文学系,物理系) Kavli Institute for Astronomy and Astrophysics(天体物理研究所) Institute for Gravitational Wave Astronomy(引力波天文研究所) School of Information Science and Technology(信息科学与技术学院) National Astronomical Observatories(国家天文台)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出GW-Eyes框架,利用大语言模型实现引力波与电磁信号的自动关联,支持自然语言交互,提升多信使天文研究效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20321 2026-08-13 cs.CL cs.AI cs.LG 67%

BiomedSQL: Text-to-SQL for Scientific Reasoning on Biomedical Knowledge Bases

BiomedSQL: 文本到SQL用于生物医学知识库上的科学推理

Mathew J. Koretsky, Maya Willey, Owen Bianchi, Chelsea X. Alvarado, Tanay Nayak, Nicole Kuznetsov, Sungwon Kim, Mike A. Nalls, Daniel Khashabi, Faraz Faghri

机构 * Center for Alzheimer’s and Related Dementias, NIA, NIH(阿尔茨海默病及相关痴呆症研究中心,国家老龄化研究所,国立卫生研究院) DataTecnica LLC(DataTecnica公司) Johns Hopkins University(约翰霍普金斯大学) Laboratory of Neurogenetics, NIA, NIH(神经遗传学实验室,国家老龄化研究所,国立卫生研究院)

专题命中 领域大模型 :prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BiomedSQL通过评估文本到SQL生成中的科学推理能力,针对生物医学知识库设计了首个基准测试,展示了不同模型在复杂查询任务中的性能差异。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11980 2026-08-13 cs.IR cs.AI 新提交 57%

HCGRec: Hint-Conditioned Generative Recommendation with Semantic IDs

HCGRec:带有语义ID的提示条件生成式推荐

Kangning Zhang, Haotian Fang, Xukun Luo, Hao Yin, Yang Gao, Peng Yan, Weiwen Liu, Weinan Zhang, Yong Yu

专题命中 领域大模型 :post-training(abstract);分类 cs.AI

AI总结 该研究提出HCGRec框架,通过提示感知信用分解优化语义ID生成式推荐,解决零奖励训练问题,在序列推荐基准上大幅提升性能并降低零优势样本占比。

Comments Accepted by CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11210 2026-08-13 cs.AI cs.MA cs.SE 新提交 57%

Distribird: Literature-Informed Prior Distribution Design for Bayesian Model Calibration

Distribird:用于贝叶斯模型校准的文献先验分布设计

Patrik P. Süli, György Eigner, Roland Hollós

机构 * Obuda University(欧布达大学) Biomatics and Applied Artificial Intelligence Institute, John von Neumann Faculty of Informatics, Obuda University(欧布达大学约翰·冯·诺依曼信息学院生物信息学与应用人工智能研究所) Physiological Controls Research Center, Obuda University(欧布达大学生理控制研究中心) HUN-REN Centre for Agricultural Research(HUN-REN农业研究中心) Czech Academy of Sciences(捷克科学院)

专题命中 领域大模型 :LLM(abstract);分类 cs.AI

AI总结 Distribird是一款自动化文献先验分布设计的智能体网络应用,通过多智能体流程生成贝叶斯模型校准所需先验,在24个跨领域参数上验证,其先验质量与单提示基线相当,且具备可追溯性、拒绝越权请求及本地运行的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23733 2026-08-13 cs.CL 版本更新 57%

Multimodal QUD: Inquisitive Questions from Scientific Figures

多模态QUD:来自科学图表的探究性问题

Yating Wu, William Rudman, Venkata S Govindarajan, Alexandros G. Dimakis, Junyi Jessy Li

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Ithaca College(伊萨卡学院) UC Berkeley, BespokeLabs.ai(伯克利大学,BespokeLabs.ai)

专题命中 领域大模型 :language model(abstract);分类 cs.CL

AI总结 本文提出多模态QUD数据集,通过结合图表与文本上下文生成探究性问题,提升多模态推理能力,实现更高质量的视觉 grounding。

详情

展开后加载摘要…

URL PDF HTML 收藏