arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-03 至 2026-08-03 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 18 篇

2607.29561 2026-08-03 cs.LG cs.AI 新提交 93%

MOT-SR: Multi-Objective Tool-Augmented Scientific Equation Discovery with Large Language Models

MOT-SR:基于大语言模型的多目标工具增强型科学方程发现

Boxiao Wang, Runxiang Wang, Kai Li, Chongming Li, Zhiwei Chen, Yifan Zhang, Jian Cheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of the Chinese Academy of Sciences(中国科学院大学) School of Advanced Interdisciplinary Sciences(先进交叉科学学院) School of Astronomy and Space Science, University of the Chinese Academy of Sciences(中国科学院大学天文与空间科学学院)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 MOT-SR是整合外部分析工具、采用双协同LLM模块的多目标工具增强型符号回归框架,在40项标准任务及EMRI轨道建模中均展现出更优性能,可实现长程科学动力学的可靠建模。

Comments Code is available at https://github.com/wswbx/MOT-SR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28677 2026-08-03 cs.AI 新提交 92%

Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support

现实世界临床护理中的推理:为何大型语言模型(LLM)尚不适合自主临床决策支持

Shayndhan Sivanathan, Shravan Nageswaran, Mehdi Zadem, Ryaan Sultan, Nicolas von Mallinckrodt, Max Solovyev, Alexey Matyushkin, Sumon Sadhu, Gabriele C DeLuca, Sanjeeva Jeyaretna, James Hillis, Manoj Ramachandran, Prakash Jayakumar

机构 * Atman Labs(阿特曼实验室) Oxford University Hospitals(牛津大学医院) University of Oxford(牛津大学) NIHR Oxford Biomedical Research Centre(英国国立卫生研究院牛津生物医学研究中心) Imperial College London(伦敦帝国理工学院) Technical University of Munich(慕尼黑工业大学) Massachusetts General Hospital(麻省总医院) Mass General Brigham(麻省总医院布里格姆医疗系统) Harvard Medical School(哈佛医学院) Barts Health NHS Trust(巴特保健国民保健信托基金会) the University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 领域大模型 :LLM(title_cn,summary_cn);large language model(title);language model(title);分类 cs.AI

AI总结 本文指出,尽管LLM在医学考试和部分病例推理上表现出色,但因存在信息收集缺陷等问题,尚不适合用于无医生参与的自主临床分诊。

Comments 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15037 2026-08-03 cs.CL cs.AI 版本更新 92%

Knowledge Restoration-driven Prompt Optimization: Unlocking LLM Potential for Open-Domain Relational Triplet Extraction

基于知识恢复的提示优化:解锁LLM在开放领域关系三元组提取中的潜力

Xiaonan Jing, Gongqing Wu, Xingrui Zhuo, Lang Sun, Jiapu Wang

机构 * The Key Laboratory of Knowledge Engineering with Big Data (the Ministry of Education of China)(知识工程与大数据关键实验室(中华人民共和国教育部)) School of Computer Science and Information Engineering(计算机科学与信息工程学院) Anhui Zhongke Guojin Intelligent Technology Co., Ltd.(安徽中科创金智能科技有限公司) Nanjing University of Science and Technology(南京理工大学)

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出KRPO框架,通过知识恢复和提示优化提升LLM在开放领域关系三元组提取任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01103 2026-08-03 cs.CL 版本更新 92%

Clinician-Level Agreement Without Clinical Caution: LLM Evaluator Limits in Medical AI Benchmarking

临床医生级别的一致性缺乏临床谨慎:LLM评估者在医学AI基准测试中的局限性

William Philipp, Finn Fassbender, Daniel Fister, Thorsten Langer, Martje G. Pauly, Rebecca Herzog, Markus A. Hobert, Theresa Paulus, Alexander Baumann, Chi Wang Ip, Lukas L. Goede, Johanna Reimer, Sebastian Löns, Ronald Böck, Sebastian Fudickar

机构 * University of Luebeck(吕贝克大学) University of Tübingen(图宾根大学) University Hospital Schleswig-Holstein(石勒苏益格-荷尔斯泰因大学医院) University Hospital Würzburg(维尔茨堡大学医院) Charité – Universitätsmedizin Berlin(柏林夏里特医学院) Genie Enterprise Deutschland GmbH

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对德语开放回答临床基准MedQADE,评估LLM评估者与医生的对齐程度,发现统计一致性高但缺乏临床元认知,且存在系统性的模型谱系偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28889 2026-08-03 cs.HC cs.AI 新提交 90%

Human-LLM Collaborative Inductive Coding for Conceptualizing K-12 Educator AI Use

面向K-12教育工作者AI使用的人机协同归纳编码方法

Alex Liu, Min Sun, Lief Esbenshade, Michael Xiao, Victor Tian, Zachary Zhang, Kevin He

专题命中 领域大模型 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出多阶段人机协同编码流程,将LLM作为标注工具辅助K-12教育工作者交互语料库编码,保留人类概念权威,构建含72个条目的分层编码本,为定性研究提供可审计模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28683 2026-08-03 cs.SE cs.AI 新提交 90%

Metaphor-Induced Algorithmic Steering: Cross-Domain Procedural Transfer in LLM Code Generation

隐喻诱导的算法引导:LLM代码生成中的跨领域过程迁移

Zhibo Hu, Chen Wang, Yanfeng Shu, Hye-young Paik, Liming Dong, Liming Zhu

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出MASC框架,发现隐喻会诱导LLM代码生成模型迁移低效率过程模式,可高检测率识别此类隐喻技能与低效率实现,揭示其通过源场景过程模式迁移运作的机制。

Comments 12 pages, 11 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14917 2026-08-03 cs.CL cs.HC cs.LG 88%

Self-reflecting Large Language Models: A Hegelian Dialectical Approach

Sara Abdali, Michael Solodko, Can Goksen, Saeed Amizadeh, Julie E. Maybee, Kazuhito Koishida, Pashmina Cameron

机构 * Microsoft Applied Sciences Group (ASG)(微软应用科学组) Department of Philosophy, Lehman College, City University of New York(哲学系,莱曼学院,新 York 城市大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28692 2026-08-03 cs.AI cs.CL 新提交 87%

SciToolAgent-Evo: An Ontology-Aware Self-Evolving Agent for Open-World Scientific Tool Acquisition

SciToolAgent-Evo:一种面向开放世界科学工具获取的本体感知自进化智能体

Yuqi Tang, Chenyi Zhou, Libin Wang, Keyan Ding, Qiang Zhang, Huajun Chen

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM智能体依赖静态工具空间难以适配开放世界科学工作流的问题,提出SciToolAgent-Evo本体感知自进化智能体,结合进化记忆与本体化工具图,利用LinUCB平衡探索利用,推出OpenSciToolBench基准并取得最优性能。

Comments 19 pages, 4 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29066 2026-08-03 cs.CL cs.AI 新提交 85%

Semantics of Subterfuge: Benchmarking Legal Deception Detection Against General-domain State-of-the-Art

欺骗的语义:针对通用领域最先进模型的法律欺骗检测基准测试

Theekshana Samaradiwakara, Nisansa de Silva, George C. Lobb

机构 * University of Moratuwa(莫拉图瓦大学) The Law Office of George C. Lobb(乔治·C·洛布律师事务所)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文针对法律领域的自动欺骗检测,对比了微调Transformer模型与大型语言模型在通用和法律数据集上的表现,发现领域敏感性显著,思维链提示效果逊于直接分类,强调需开发适配法律领域的可解释系统。

Comments 5 pages paper

Journal ref ICAIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28980 2026-08-03 cs.LG 新提交 83%

Beyond Feature and Structure Alignment: Learning Transferable Propagation Knowledge for Graph Foundation Models

超越特征与结构对齐:学习图基础模型的可迁移传播知识

Yi Wang, Jitao Zhao, Di Jin, Dongxiao He

机构 * Tianjin University(天津大学)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.LG

AI总结 针对现有图基础模型忽略可迁移传播知识单元与传播模式异质性的局限,本文提出ProGFM,通过传播关系原型库学习跨域可迁移传播知识,在多跨域场景下实现更优泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28841 2026-08-03 cs.MA cs.SE 新提交 80%

CyberNeuro: A Privacy-Preserving Agentic Workbench for Cohort-Scale Neuroimage and Clinical Data Analysis

CyberNeuro:用于队列规模神经影像与临床数据分析的隐私保护智能体工作台

Ran Ren, Junhong Tong, Yunxi Kong, Yiyao Chen, Yucheng Li, Kunhao Zhou, Shaoqi Wang, Yuxiang Tao, Shuheng Cao, Zhihao Fan, Marissa DiPiero, Tingting Dan, Guorong Wu

专题命中 领域大模型 :LLM(summary_cn,abstract)

AI总结 CyberNeuro是配备WandaMind本地LLM的隐私保护智能体工作台,通过四个专用智能体实现神经影像与临床数据分析自动化,在NeuroBench上提升了域准确率,还降低了令牌使用量。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28968 2026-08-03 cs.DL cs.AI cs.CY 新提交 79%

A robust association between LLM use and scientific productivity: Assessing stopping-time selection

Keigo Kusumegi, Xinyu Yang, Paul Ginsparg, Mathijs de Vaan, Toby Stuart, Yian Yin

专题命中 领域大模型 :LLM(title,abstract);分类 cs.AI

Comments Response to Renault, Bergeaud, and Bosquet

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28696 2026-08-03 cs.LG cs.CV 新提交 79%

Mitigating Class-Tail Undercoverage in Medical Vision-Language Models under Clinical Shift

缓解临床分布偏移下医学视觉-语言模型的类别尾部覆盖不足问题

Mushir Akhtar, M. Tanveer

机构 * Indian Institute of Technology Indore(印度理工学院印多雷分校)

专题命中 领域大模型 :language model(title,abstract);分类 cs.LG

AI总结 本文针对临床分布偏移下医学VLMs的类别尾部覆盖不足问题,提出CALCoDe方法,在多个偏移场景和骨干网络上实现了所有设置下边际和最差类别覆盖度均达0.95的最优表现。

Comments 26 pages; supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28771 2026-08-03 cs.CV 新提交 78%

Do Medical Foundation Models Generalize on the African Brain?

医学基础模型能否在非洲脑部数据上实现泛化?

Kaouther Mouheb, Gonzalo Esteban Mosquera Rojas, Juancito van Leeuwen, Stefan Klein, Esther E. Bron

机构 * Erasmus MC(伊拉斯姆斯大学医学中心)

专题命中 领域大模型 :foundation model(title,abstract)

AI总结 该研究评估医学基础模型在非洲脑部MRI数据上的泛化性,发现其无固有偏见,性能差异多源于数据集规模,核心是非洲神经影像数据集不足。

Comments Submitted to the AFRICAI workshop (Held in conjunction with MICCAI 2026, Strasbourg, France)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28990 2026-08-03 cs.AI 新提交 70%

Scaling Scientific Discovery Environments for Turn-Level Agentic RL

面向回合级智能体强化学习的科学发现环境扩展

Yucheng Xu, Keyi Zhang, Yuyang Yu, Min Zhang, Shiyuan Meng, Pei Chu, Zhongying Tu

机构 * Shanghai AI Lab(上海人工智能实验室)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出可扩展框架SciDisco,结合SciThèque与DiscoPO,训练出的SciDisco-14B在假设驱动的科学数据分析基准上实现了当前最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29530 2026-08-03 cs.LG 新提交 57%

A Neurosymbolic Approach for Explainable Early Diagnosis of Alzheimer's Disease

一种用于阿尔茨海默病可解释早期诊断的神经符号方法

Ranveer Singh, Pranuthi Tenali, Saurabh Mathur, Ameet Soni, Vaishali Phatak, Karla Lynch, Daniel Murman, Matthew Rizzo, Sriraam Natarajan

专题命中 领域大模型 :foundation model(abstract);分类 cs.LG

AI总结 该研究提出一种自动化流程,用预训练基础模型处理言语流畅性测试音频构建贝叶斯网络,以实现阿尔茨海默病的可解释早期诊断,成功恢复临床知识并识别语言标志物间新关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28684 2026-08-03 cs.AI 新提交 57%

Library Reachability in LSR-Synth: How Anti-Memorization Design Changes the Measurement of Symbolic Discovery

LSR-Synth中的库可达性:反记忆化设计如何改变符号发现的测量

Zhan'ao Yao, Liang Yin, Zhihao Gao, Boxuan Zhang, Xiaoyu Wu, Linjing Li, Rongyan Wang, Tingwei Chen, Youwei Wang, Xiaolin Zhao, Jiahui Shi, Jianjun Liu

专题命中 领域大模型 :language model(abstract);分类 cs.AI

AI总结 该研究在LSR-Synth基准下,对比语言模型先验与常规算子搜索的效果,发现固定词汇表已覆盖多数任务,语言模型候选仅在词汇表覆盖受扰时贡献显著,且严格分布外评估不改变该关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16134 2026-08-03 cs.DB 版本更新 50%

Benchmarking Table Extraction from Heterogeneous Scientific PDF Documents

对异构科学提取文档中表格提取的基准测试

Marijan Soric, Cécile Gracianne, Ioana Manolescu, Pierre Senellart

专题命中 领域大模型 :language model(abstract)

AI总结 本文提出了一种新的基准测试,用于评估端到端表格提取方法,通过分析评估指标和设计严谨的评估流程,揭示了当前方法在异构数据下的局限性。

Comments Extended version, with appendices, of a paper published at KDD '26

详情

展开后加载摘要…

URL PDF HTML 收藏