arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-15 至 2026-06-15 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 18 篇

2606.14117 2026-06-15 stat.ME cs.AI 新提交 91%

A Two-Stage Statistical Framework for Evaluating Associative Interference in Large Language Models

评估大语言模型中联想干扰的两阶段统计框架

Achraf Cohen, Andrew Kincaid

机构 * Department of Mathematics and Statistics, University of West Florida(数学与统计学系,西弗吉尼亚大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 提出两阶段统计框架,分离响应遵从性与任务一致性,评估三个LLM在性别-职业等领域的联想干扰,发现效应因模型而异。

Comments 11 pages; 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.07609 2026-06-15 cs.IR cs.CL cs.CY 版本更新 90%

Is ChatGPT Fair for Recommendation? Evaluating Fairness in Large Language Model Recommendation

ChatGPT 在推荐中是否公平?评估大语言模型推荐的公平性

Jizhi Zhang, Keqin Bao, Yang Zhang, Wenjie Wang, Fuli Feng, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对大语言模型推荐(RecLLM)可能存在的偏见,提出公平性基准 FaiRLLM,包含精心设计的指标和涵盖8个敏感属性的数据集,评估发现 ChatGPT 在推荐中仍存在不公平现象。

Comments Accepted by Recsys 2023 (Short). Typo corrections

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14266 2026-06-15 physics.comp-ph 新提交 90%

Large Language Model Based Agent for Automated Discovery in Computational Physics

基于大语言模型的自动化计算物理发现智能体

Hang Lin, Chongwen Liu, Gang Yan

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 提出PhyNex智能体,结合大语言模型引导搜索与领域工具,通过渐进局部搜索和知识积累,在三个物理问题上实现与人类专家相当或更优的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14892 2026-06-15 cs.LG cs.AI 版本更新 90%

Can LLMs Accurately Score Medical Diagnoses and Clinical Reasoning?

LLM能否准确评分医学诊断和临床推理?

Amy Rouillard, Sitwala Mundia, Linda Camara, Ziyaad Dangor, Michael Cameron Gramanie, Ismail Kalla, Shabir A. Madhi, Kajal Morar, Marlvin T. Ncube, Haroon Saloojee, Bruce A. Bassett

机构 * Wits MIND Institute, University of the Witwatersrand, Johannesburg, South Africa(维特士心理研究所,沃斯兰德大学,约翰内斯堡,南非) Grai Labs, Cape Town, South Africa(格雷实验室,开普敦,南非) South African Medical Research Council Vaccines and Infectious Diseases Analytics Research Unit, Faculty of Health Sciences, University of the Witwatersrand, Johannesburg, South Africa(南非医学研究理事会疫苗和传染病分析研究组,健康科学学院,沃斯兰德大学,约翰内斯堡,南非) Department of Internal Medicine, Charlotte Maxeke Johannesburg Academic Hospital, and Faculty of Health Sciences, University of the Witwatersrand, Johannesburg, South Africa(内科学系,查理·马克斯凯约翰内斯堡学术医院,以及健康科学学院,沃斯兰德大学,约翰内斯堡,南非) Department of Paediatrics and Child Health, Faculty of Health Sciences, University of the Witwatersrand, Johannesburg, South Africa(儿科学与儿童健康系,健康科学学院,沃斯兰德大学,约翰内斯堡,南非) Wits MIND Institute, University of the Witwatersrand, Johannesbu(维特士心理研究所,沃斯兰德大学,约翰内斯堡)

专题命中 领域大模型 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究使用LLM陪审团对300例低收入和中等收入国家医院病例的3334个诊断进行评分,发现校准后的LLM评分与专家评分高度一致,且严重错误风险更低,可作为可靠的评估代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05413 2026-06-15 cs.IR cs.CL 版本更新 89%

SciDef: Datasets and Tools for Automated Definition Extraction from Scientific Literature with LLMs

SciDef:基于LLM的科学文献自动定义提取数据集与工具

Filip Kučera, Christoph Mandl, Isao Echizen, Radu Timofte, Timo Spinde

机构 * National Institute of Informatics (NII)(国立信息研究所) University of Würzburg(乌尔姆大学) University of Passau(帕萨乌大学) University of Würzburg (JMU)(乌尔姆大学)

专题命中 领域大模型 :LLM(title_cn,summary_cn);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 提出SciDef资源套件,包含人工验证的定义基准DefExtra、相似度判断DefSim及基于LLM的提取流程,通过16个语言模型评估,发现NLI匹配指标与人类判断高度一致,但相关性过滤仍是自动提取的关键瓶颈。

Comments Under Review - Submitted to CIKM 2026 Resources Track;

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07530 2026-06-15 cs.DL cs.AI cs.CY cs.SI 版本更新 88%

The Shrinking Lifespan of LLMs in Science

科学领域中LLM的生命周期缩短

Ana Trišović

机构 * Computer Science & Artificial Intelligence Laboratory(计算机科学与人工智能实验室) Massachusetts Institute of Technology(麻省理工学院)

专题命中 领域大模型 :LLM(title_cn,summary_cn);language model(abstract);分类 cs.AI

AI总结 本研究通过分析62个LLM在超过10万篇引用论文中的科学采纳轨迹,发现模型的生命周期主要由发布年份决定,且每个后续发布年份的峰值时间和寿命分别缩短27%和23%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08819 2026-06-15 cond-mat.mtrl-sci 86%

TEM Agent: enhancing transmission electron microscopy (TEM) with modern AI tools

TEM Agent:利用现代AI工具增强透射电子显微镜(TEM)

Morgan K. Wall, Alexander J. Pattison, Edward S. Barnard, Stephanie M. Ribet, Peter Ercius

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出TEM Agent框架,通过模型上下文协议(MCP)方法结合商业LLM,实现对TEM多个子系统的访问与控制,简化复杂显微镜生态系统,提升用户完成各类难度实验的能力。

Comments 22 pages, 4 figures

Journal ref Npj Computational Materials (2026) 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14654 2026-06-15 cs.AI cs.CL cs.LG 新提交 83%

Abstracting Cross-Domain Action Sequences into Interpretable Workflows

将跨领域动作序列抽象为可解释的工作流

Gaurav Verma, Scott Counts

机构 * Microsoft Corporation(微软公司)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出WorkflowView框架,利用大语言模型将低层动作序列抽象为高层活动,在三个不同任务中验证了有效性和泛化能力,实现高语义相似度和预测性能。

Comments preprint; 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14149 2026-06-15 cs.LG 新提交 81%

Trust but Verify: Mitigating Medical Hallucinations via Post-Hoc Adversarial Auditing and Multi-Agent Feedback Loops

信任但验证:通过事后对抗审计和多智能体反馈循环减轻医学幻觉

Muhammad Osama, Maheera Amjad, Zartasha Mustansar, Arslan Shaukat, Muhammad U. S. Khan

机构 * Data Science and Machine Learning Lab, SINES, NUST(NUST SINES数据科学与机器学习实验室) SINES, NUST(NUST SINES) CEME, NUST(NUST CEME)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究提出一种五智能体“信任但验证”系统,通过事后对抗审计和多智能体反馈循环,将大型语言模型在临床问题中推荐禁用药品的幻觉错误率降低约53%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13662 2026-06-15 cs.AI cs.CL 新提交 73%

EurekAgent: Agent Environment Engineering is All You Need For Autonomous Scientific Discovery

EurekAgent:自主科学发现中,智能体环境工程即一切

Amy Xin, Jiening Siow, Junjie Wang, Zijun Yao, Fanjin Zhang, Jian Song, Lei Hou, Juanzi Li

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Zhipu AI(智谱AI)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出环境工程框架EurekAgent,通过权限、工件、预算和人机交互四维工程设计,在数学、内核工程和机器学习任务上取得新最优结果,总API成本低于11美元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13931 2026-06-15 cs.CL 新提交 70%

DLawBench: Evaluating LLMs Through Multi-Turn Legal Consultation

DLawBench: 通过多轮法律咨询评估大语言模型

Li Zhang, Yuzhen Shi, Yiran Hu, Jingwen Zhang, Wenbo Lv, Yubo Ma, Wei Wang, Rongyao Shi, Yuanyang Qiu, Xinran Xu, Yuemeng Qi, Linlin Miao, Jaromir Savelka, Yun Liu, Kevin Ashley, Bing Zhao, Hu Wei, Lin Qu

机构 * University of Pittsburgh(匹兹堡大学) Alibaba Group(阿里巴巴集团) University of Waterloo(滑铁卢大学) Shandong University(山东大学) Skylenage China University of Political Science and Law(中国政法大学) Qwen Team, Alibaba Group(阿里巴巴集团Qwen团队) Fordham University(福特汉姆大学) Shanghai Jiao Tong University(上海交通大学) Carnegie Mellon University(卡内基梅隆大学) Tsinghua University(清华大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出DLawBench基准,通过模拟四种客户类型(合作、依赖、退缩、对抗)的多轮对话,评估大语言模型在真实法律咨询中的交互能力。

Comments 37 pages, 8 figures, 26 tables. Code and data: https://github.com/SKYLENAGE-AI/DLawBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16073 2026-06-15 cs.CL 版本更新 70%

ClaimFlow: Tracing the Evolution of Scientific Claims in NLP

ClaimFlow: 追踪自然语言处理中科学主张的演变

Aniket Pramanick, Yufang Hou, Saif M. Mohammad, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab)(通用知识处理实验室) Department of Computer Science and Hessian Center for AI (hessian.AI)(计算机科学系和海斯曼人工智能中心) Technische Universität Darmstadt(德累斯顿技术大学) IT:U Interdisciplinary Transformation University Austria(奥地利跨学科转型大学) National Research Council Canada(加拿大国家研究委员会)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ClaimFlow框架,通过标注1617篇论文中的5689个主张和4871个跨论文关系,定义主张关系分类任务,并分析NLP领域主张的演变模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14664 2026-06-15 cs.HC 新提交 67%

The Self-Aware Body: A User-Centered Framework for Designing Therapeutic Sonic Interactions

自我感知的身体:以用户为中心的设计治疗性声音交互框架

Prithvi Ravi Kantan, Sofia Dahl, Erika G. Spaich

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 提出一个用于设计运动声音化治疗交互技术的框架,包括概念重构、设计平台和以用户为中心的方法,以促进临床采用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14474 2026-06-15 cs.IR cs.HC 新提交 67%

Verifiable User Simulation for Search and Recommendation Systems

面向搜索与推荐系统的可验证用户模拟

Chenglong Ma, Xinye Wanyan, Danula Hettiachchi, Ziqi Xu, Yongli Ren, Jeffrey Chan

专题命中 领域大模型 :LLM(abstract,abstract_cn)

AI总结 提出一个七组件可审计框架,将用户模拟器视为可验证工程制品,通过动手实验检查模拟器行为、诊断差异并检测人口偏差。

Comments Presented as a half-day tutorial at SIGIR 2026, 4 pages

Journal ref In Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14306 2026-06-15 cs.HC cs.AI 新提交 57%

Thinking Outside the [Chat]Box: Bridging Computer Science and Industrial Design for Cognitive-Inclusive Generative AI

跳出聊天框:融合计算机科学与工业设计的认知包容性生成式人工智能

Virginia Francisco, Daniel Guasch, Raquel Hervás

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 领域大模型 :prompting(abstract);分类 cs.AI

AI总结 针对当前GenAI界面认知门槛高、对智力障碍者不友好等问题,通过跨学科设计挑战,提出融合计算机科学的结构化支架与工业设计的体验式支架的双层框架,以扩展认知包容性交互设计空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14072 2026-06-15 cs.CV cs.CL 新提交 57%

Diffusion-Refined Segmentation and Vision-Language Interpretation for Pediatric Brain Tumor MRI

扩散细化分割与视觉-语言解释用于儿童脑肿瘤MRI

Wentao Ke, Jianche Liu

机构 * Department of Mechanical Engineering, Stanford University(斯坦福大学机械工程系) School of Medicine, Stanford University(斯坦福大学医学院)

专题命中 领域大模型 :language model(abstract);分类 cs.CL

AI总结 提出两阶段框架,先用Swin-UNETR粗分割,再用条件扩散模型细化边界,最后结合多模态语言模型生成结构化报告,提升儿童脑肿瘤分割精度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05264 2026-06-15 cs.LG 57%

REGEN: Reference-Guided Synthetic Multivariate Time Series Generation for Forecasting

REGEN:参考引导的合成多元时间序列生成用于预测

Moulik Gupta, Dhruv Kumar, Murari Mandal, Saurabh Deshpande

机构 * Birla AI Labs, Office of Ananya Birla(Birla AI实验室,Ananya Birla办公室) Birla Institute of Technology and Science, Pilani(Birla理工学院与科学学院,Pilani) Kalinga Institute of Industrial Technology, Bhubaneswar(Kalinga工业技术学院,Bhubaneswar)

专题命中 领域大模型 :foundation model(abstract);分类 cs.LG

AI总结 提出参考引导生成管道ReGeN,通过将观测序列分解为周期骨干、随机残差和跨变量依赖三个可解释组件,实现可控合成,在低数据场景下生成的数据可替代真实数据并提升预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18784 2026-06-15 q-fin.RM cs.AI cs.CR cs.CY econ.GN q-fin.EC 版本更新 57%

The Insurability Frontier of AI Risk: Mapping Threats to Affirmative Coverage, Silent Exposures, and Exclusions

AI风险的可保险边界:将威胁映射到积极保险、沉默暴露和排除

Alex Leung, Rex Zhang, Ervin Ling, Kentaroh Toyoda, SiewMei Loh

机构 * Munich Re(慕尼黑再保险) Armilla Tokio Marine Kiln(东京海上日赤保险) CFC Apollo ibott Coalition

专题命中 领域大模型 :foundation model(abstract);分类 cs.AI

AI总结 本文研究了AI风险在商业保险中的可保险性边界,通过分析55类AI威胁与26种保险产品和排除制度,揭示了四个层次的可保险性前沿:积极保险的风险、沉默AI暴露、主动排除的风险以及传统私人保险结构之外的风险。

Comments Version 2

详情

展开后加载摘要…

URL PDF HTML 收藏