arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-16 至 2026-06-16 共收录 48 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 48 篇

2606.16344 2026-06-16 cs.AI cs.CL cs.CY cs.LG 新提交 92%

Whose hotel does the AI recommend? An algorithm audit of reputation signals in LLM-assisted hotel selection

AI推荐哪家酒店?LLM辅助酒店选择中声誉信号的算法审计

Mirza Samad Ahmed Baig, Syeda Anshrah Gillani, Asher Ali

机构 * Fandaqah, Al Khobar, Saudi Arabia(沙特阿拉伯阿尔科巴尔Fandaqah) Hamdard University, Karachi, Pakistan(巴基斯坦卡拉奇哈姆达德大学)

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过随机选择联合实验审计12种LLM,发现客人评分和价格主导推荐,但过度重视生态认证而忽略管理回复,且列表位置(无内容特征)有因果影响。

Comments 32 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09500 2026-06-16 cs.AI cs.DL 版本更新 92%

Deterministic Integrity Gates for LLM-Assisted Clinical Manuscript Preparation: An Auditable Biomedical Informatics Architecture

用于LLM辅助临床手稿准备的确定性完整性门控:一种可审计的生物医学信息学架构

Yoojin Nam, Jinhoon Jeong, Namkug Kim

机构 * University of Ulsan College of Medicine(蔚山大学医学院) Asan Medical Center(峨山医疗中心) Aperivue AMIST, Asan Medical Center(AMIST,峨山医疗中心)

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种确定性完整性门控架构,通过将工作流分解为可独立验证的技能并在每个阶段设置确定性检查,解决了LLM生成临床手稿中的虚假引用、数据漂移和报告指南缺失问题。

Comments 28 pages, 3 figures, 4 tables; includes supplementary material (deterministic-detector inventory, per-class defect breakdown, worked example). Software (MIT): https://github.com/Aperivue/medsci-skills . Archived on Zenodo: concept DOI https://doi.org/10.5281/zenodo.20155321 and version DOI (v3.8.0) https://doi.org/10.5281/zenodo.20582972

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15919 2026-06-16 cs.HC 新提交 91%

Are LLM-based Chatbots Good Enough to Support Computer Science Students in Multiple-Choice Exercises?

基于LLM的聊天机器人是否足以支持计算机科学学生完成多项选择题练习?

Markos Stamatakis, Omkar Gavali, Joshua Berger, Christian Wartena, Anett Hoppe, Ralph Ewerth

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究评估了多种LLM聊天机器人在大学计算机科学多项选择题中的表现,并探讨其对学生学习的影响,发现GPT-4o和GPT-5表现最佳,但提供答案和解释并未普遍提升学生成绩。

Comments 13 pages (excluding references), 6 tables, 1 figure, 1 equation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15810 2026-06-16 cs.CR cs.AI 新提交 90%

Let Them Steal: Trapping Large Language Model Extraction Attacks with Knowledge Honeypot

让他们偷:用知识蜜罐诱捕大语言模型提取攻击

Yuyang Dai, Yushun Dong

机构 * Florida State University(佛罗里达州立大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出知识陷阱防御方法,通过蜜罐知识图和面包屑引导消耗攻击者查询预算,在保持合法用户性能的同时降低替代模型一致性6.2%。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15277 2026-06-16 cs.IR cs.AI cs.DB cs.ET cs.LG 新提交 90%

Guiding Federated Graph Recommendation with LLM-encoded knowledge

利用LLM编码知识指导联邦图推荐

Thi Minh Chau Nguyen, Hien Trang Nguyen, Duc Anh Nguyen, Van Ho-Long, Thanh Trung Huynh, Zhao Ren

机构 * institutetext(机构)

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对联邦图推荐中跨客户端图表示对齐难的问题,提出利用大语言模型编码的语义信号指导结构表示的选择性聚合,提升推荐准确性。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08088 2026-06-16 cs.LG cs.AI 90%

Online Domain-aware LLM Decoding for Continual Domain Evolution

在线领域感知的LLM解码用于持续领域演变

Mohammad Abu-Shaira, Weishi Shi

机构 * University of North Texas(北卡罗来纳州立大学)

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出在线领域感知解码框架ODD,通过概率融合和自适应置信度调节,提升LLM在持续领域变化中的适应能力,实验表明其在语法和语义生成任务中表现优异。

Journal ref Advances in Knowledge Discovery and Data Mining, PAKDD 2026, LNAI 16600, pp. 565-577, Springer, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10574 2026-06-16 cs.AI 版本更新 90%

LLM Jaggedness Unlocks Scientific Creativity

LLM Jaggedness Unlocks Scientific Creativity

Shray Mathur, J. Anibal Boscoboinik, Esther H. R. Tsai, Kevin G. Yager

机构 * Center for Functional Nanomaterials, Brookhaven National Laboratory(功能纳米材料中心,布鲁赫萨尔国家实验室)

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了大型语言模型(LLMs)在科学创意生成中的不规则进步现象,提出了SciAidanBench基准测试集,通过评估不同模型在科学问题上的创意生成能力,揭示了模型在跨任务、提示和领域层面的不均衡表现,并展示了如何通过推理计算、知识聚合和头脑风暴等机制利用这种不规则性来提升科学创造力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15314 2026-06-16 cs.LG cs.AI stat.ML 新提交 90%

LLMs on Tabular Data with Limited Semantics: Evidence from Industrial Car Retrofit Prediction

有限语义表格数据上的LLM:来自工业汽车改造预测的证据

Aina Vila Pons, Ioannis Tzachristas, Constantinos Antoniou

机构 * Technical University of Munich(慕尼黑工业大学) BMW Group(宝马集团)

专题命中 领域大模型 :LLM(title_cn,summary_cn);foundation model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 研究在工业表格数据中,LLM(嵌入、直接分类、混合堆叠)与经典树集成方法的对比,发现LLM在语义受限时效果有限,但嵌入和混合方法仍有价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15566 2026-06-16 cs.CL cs.AI 新提交 89%

LLM-Assisted Stance Detection in Scientific Discourse: A Test Case in Bayesian Cognitive Science

科学话语中的立场检测:以贝叶斯认知科学为例的LLM辅助方法

Eyup Engin Kucuk, Tarik Kelestemur, Ömer Dağlar Tanrikulu

机构 * University of New Hampshire(新罕布什尔大学) Independent Researcher(独立研究员)

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出结合理论驱动编码手册、专家标注和诊断门控提示优化的方法,利用三个前沿LLM检测贝叶斯模型在科学文本中的现实主义/工具主义立场,在210篇文章的6858条引文中达到0.78的联合信度。

Comments 9 pages, 4 figures; Code and data: https://github.com/EyupEK/autoresearch_bayes

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01410 2026-06-16 cs.HC 版本更新 89%

What LLMs Must Forget to Teach Effectively: A DIY Approach to Premodern Japanese Language Pedagogy

LLM必须忘记什么才能有效教学:前现代日语教学法的DIY方法

Ariel Stilerman, Andrew Nelson, Alan Cheng, Caleb Langley, Sera Wang, Camilla Piana, Pelin Çılgın, Qianhe Qin, Teisha Nishimitsu, Liaoliao Zhang, Huiting Liu, Josh Eyre, Gavin Sherry

专题命中 领域大模型 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出一种基于大型语言模型(LLM)的DIY教学框架,通过提示工程创建定制工具,避免LLM过度解释或产生幻觉,从而促进前现代日语文学和语言课程中的主动理解与教学对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16905 2026-06-16 cs.CL 新提交 87%

Speaking the Language of Science: Toward a General-Purpose Generative Foundation Model for the Natural Sciences

说科学的语言:面向自然科学的通用生成基础模型

Mingyang Li, Yurou Liu, Jieping Ye, Bing Su, Ji-Rong Wen, Zheng Wang

机构 * Alibaba Group(阿里巴巴集团) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 领域大模型 :foundation model(title,abstract);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出LOGOS模型,通过统一科学语法将异构任务转化为自回归框架中的下一个词预测,在多个科学任务上匹配或超越领域专用基线,验证了“一模型适用于所有”的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16003 2026-06-16 cs.AI 新提交 86%

SciText2Eq: Assessing LLMs for Explainable Equation Generation for Scientific Creativity

SciText2Eq: 评估大语言模型在科学创造力中的可解释方程生成

Yifan Mo, Xiao Fu, Yue Su, Qingyu Meng, Koen Hindriks, Qingzhi Liu, Jiahuan Pei

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Wageningen University & Research(瓦赫宁根大学及研究中心)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型从科学文本生成数学方程的能力,构建AI论文数据集,提出可解释方程生成流程,并设计结合自动指标、LLM评估和人工判断的评估协议,发现LLM在语义准确性上表现不足。

Comments Accepted by findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15884 2026-06-16 cs.CL 新提交 86%

Neuron Level Analysis of Large Language Model in Legal Domain Reasoning

法律领域推理中大语言模型的神经元级分析

Eri Onami, Youmi Ma, Shuhei Kurita, Naoaki Okazaki

机构 * Institute of Science Tokyo(东京科学大学) NII(国立信息学研究所) AIST(产业技术综合研究所)

专题命中 领域大模型 :large language model(title);language model(title);LLM(abstract_cn);分类 cs.CL

AI总结 通过神经元归因分数识别并抑制关键神经元,发现存在任务特异性神经元和跨任务通用神经元,法律领域神经元重叠度高且分布受输入格式影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15646 2026-06-16 cs.AI 新提交 86%

NeuroSymbolic AI for Legal AI-TRISM: Trustworthy, Reliable, Interpretable, Safe Models

面向法律AI-TRISM的神经符号AI:可信、可靠、可解释、安全模型

Deepa Tilwani, Yash Saxena, Ankur Padia, Srinivasan Parthasarathy, Manas Gaur

机构 * Department of Computer Science, AI Institute, University of South Carolina(南卡罗来纳大学计算机科学系,人工智能研究所) Department of Computer Science and Electrical Engineering, University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校计算机科学与电气工程系) Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对法律领域LLM缺乏可解释推理和易产生幻觉的问题,提出TRISM框架,融合神经符号AI与LLM,通过结构化法律知识集成和RAG验证机制提升模型可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05855 2026-06-16 cs.IR cs.CL 版本更新 86%

Bridging Passive and Active: Enhancing Conversation Starter Recommendation via Active Expression Modeling

桥接被动与主动:通过主动表达建模增强对话启动推荐

Yiqing Wu, Haoming Li, Guanyu Jiang, Jiahao Liang, Yongchun Zhu, Jingwu Chen, Feng Zhang

机构 * Bytedance Beijing China(字节跳动北京中国)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对LLM驱动的对话搜索中被动推荐陷入回声室的问题,提出PA-Bridge框架,通过对抗分布对齐器桥接被动推荐与主动表达之间的分布差异,并引入语义离散化器实现流行度去偏,在线实验显著提升特征渗透率和用户活跃天数。

Comments Accepted by SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00812 2026-06-16 cs.CL q-bio.NC 版本更新 86%

Generative causal testing to bridge data-driven models and scientific theories in language neuroscience

生成式因果测试:弥合语言神经科学中数据驱动模型与科学理论之间的鸿沟

Richard Antonello, Chandan Singh, Shailee Jain, Aliyah Hsu, Sihang Guo, Jianfeng Gao, Bin Yu, Alexander Huth

机构 * Computer Science Department, University of Texas at Austin(德克萨斯大学计算机科学系) Microsoft Research(微软研究院) Neurosurgery Department, University of California(加州大学神经外科系) EECS Department, University of California(加州大学电子工程与计算机科学系) Statistics Department, University of California(加州大学统计学系) Center for Computational Biology, University of California(加州大学计算生物学中心) Neuroscience Department, University of California(加州大学神经科学系)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出生成式因果测试(GCT)框架,利用大语言模型生成简洁解释并通过LLM生成刺激进行验证,成功解释大脑区域的语言选择性,弥合数据驱动模型与科学理论之间的差距。

Comments Accepted to Nature Neuroscience, please cite that version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14932 2026-06-16 cs.IR 新提交 86%

Retrieval-as-a-Service:A System-Oriented Analysis of Industrial Retrieval Pipelines in Web Systems

检索即服务:Web系统中工业检索管道的系统导向分析

Fang Liu, Yuan Yuan, Yifan Dang, Xuncheng Zhang, Cuiqianhe Du

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文从系统角度调查工业检索管道,提出统一RaaS管道抽象,分析LLM集成的影响,为大规模Web系统提供设计指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02288 2026-06-16 cs.CV cs.LG 版本更新 84%

Prompt Disentanglement via Language Guidance and Representation Alignment for Domain Generalization

基于语言引导与表示对齐的提示解缠用于域泛化

De Cheng, Zhipeng Xu, Xinyang Jiang, Dongsheng Li, Nannan Wang, Xinbo Gao

机构 * School of Telecommunications Engineering, the State Key Laboratory of Integrated Services Networks (ISN), Xidian University, Xi’an, China(电信工程学院、集成服务网络国家重点实验室(ISN)、西安电子科技大学) Microsoft Research Asia, Shanghai, China(微软亚洲研究院,上海,中国)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 提出利用大语言模型自动解缠文本提示,并引入最差显式表示对齐,结合抽象提示增强源域多样性,实现域不变视觉表示学习,在多个基准上超越现有方法。

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 48, no. 6, pp. 6799-6816, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15786 2026-06-16 cs.CV cs.AI physics.geo-ph 新提交 83%

Domain-Guided Prompting of the Segment Anything Model for Seismic Interpretation: The Role of Attributes, Visualization, and Hybrid Prompts

领域引导的Segment Anything模型提示用于地震解释:属性、可视化和混合提示的作用

Aniq Ahmad, Heather Bedle, Ahmad Mustafa

机构 * School of Geosciences, University of Oklahoma(俄克拉荷马大学地球科学学院) King Fahd University of Petroleum and Minerals(法赫德国王石油矿产大学)

专题命中 领域大模型 :prompting(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 提出零样本适应框架,通过地质目标感知的地震属性与颜色映射选择,结合混合提示策略,提升SAM在地震解释中的分割精度,避免微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16751 2026-06-16 cs.CR cs.AI 新提交 81%

Automated jailbreak attack targeting multiple defense strategies

针对多种防御策略的自动化越狱攻击

Qi Wang, Chengcheng Wan, Weijia He, Yanqing Li, Hanqi Sun, Xiaodong Gu, Jiangtao Wang

机构 * East China Normal University(东华大学) Shanghai Innovation Institute(上海创新研究院) University of Southampton(南安普顿大学) Shanghai Jiao Tong University(上海交通大学) Software Engineering Institute, East China Normal University(东华大学软件工程研究院)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出UNIATTACK框架,从防御视角提取攻击特征并优化,实现跨模型和类别的单次黑盒攻击,显著提升成功率并降低开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16484 2026-06-16 cs.CV cs.AI cs.MM 新提交 81%

Unified Multimodal Model for Brain MRI Imputation and Understanding

统一多模态模型用于脑MRI补全与理解

Zhiyun Song, Che Liu, Tian Xia, Avinash Kori, Wenjia Bai

机构 * Department of Computing, Imperial College London(伦敦帝国理工学院计算机系) Department of Brain Sciences, Imperial College London(伦敦帝国理工学院脑科学系)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出UniBrain模型,通过统一训练策略联合处理脑MRI模态补全与图像理解,采用自对齐和动态隐藏状态机制,在多疾病数据集上实现高性能。

Comments Early accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16330 2026-06-16 cs.AI 新提交 81%

Phase-Aware Guidance Injection for Recurrent MAPPO in Assembly-Line Disruption Recovery

装配线中断恢复中面向阶段的引导注入用于循环MAPPO

Xin Huang, Yongcai Wang, Fengyi Zhang, Zhikun Tao, Yunjun Han, Naiqi Wu

机构 * School of Information, Renmin University of China(中国人民大学信息学院) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) The Information Science Academy, China Electronics Technology Group Corporation(中国电子科技集团公司信息科学研究院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) The Institute of Systems Engineering, Macau University of Science and Technology(澳门科技大学系统工程研究所)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出面向阶段的引导注入框架,在评估时通过logit级动作偏置增强训练好的循环MAPPO调度策略,利用规则、回放和在线LLM引导减少异常恢复时间并保持准时交付。

Comments 6 pages, 4 figures, accepted by the 2026 IEEE International Conference on Automation Science and Engineering (CASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12291 2026-06-16 cs.CL 新提交 81%

Measuring Epistemic Resilience of LLMs Under Misleading Medical Context

测量大语言模型在误导性医疗上下文下的认知韧性

Hongjian Zhou, Xinyu Zou, Jinge Wu, Sean Wu, Junchi Yu, Bradley Max Segal, Tobias Erich Niebuhr, Sara Amro, Michael Petrus, Sheikh Momin, Alexandra M. Cardoso Pinto, Rachel Niesen, Laura Sophie Wegner, Dhruv Darji, Jung Moses Koo, Joshua Fieggen, Kapil Narain, Mingde Zeng, Lei Clifton, Linda Shapiro, Fenglin Liu, David A. Clifton

机构 * University of Oxford(牛津大学) University of Washington(华盛顿大学) University College London(伦敦大学学院) University of Waterloo(滑铁卢大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出MedMisBench基准,通过注入误导性上下文测试大语言模型在医疗场景中的认知韧性,发现模型准确率从71.1%降至38.0%,权威性虚假信息攻击成功率达69.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15952 2026-06-16 cs.AI 版本更新 81%

Protein Design with Agent Rosetta: A Case Study for Specialized Scientific Agents

基于Agent Rosetta的蛋白质设计:面向专业科学智能体的案例研究

Jacopo Teneggi, S. M. Bargeen A. Turzo, Tanya Marwah, Alberto Bietti, P. Douglas Renfrew, Vikram Khipple Mulligan, Siavash Golkar

机构 * Polymathic AI(多学科人工智能实验室) Center for Computational Biology, Flatiron Institute(计算生物学中心,Flatiron研究所) Google DeepMind(谷歌DeepMind) Center for Computational Mathematics, Flatiron Institute(计算数学中心,Flatiron研究所) New York University(纽约大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Agent Rosetta,将大语言模型与Rosetta软件环境结合,通过迭代优化实现用户定义的蛋白质设计目标,在规范氨基酸设计上匹配专家,在非规范残基设计上超越现有ML方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17179 2026-06-16 cs.MA 版本更新 80%

Ablation Study of a Fairness Auditing Agentic System for Bias Mitigation in Early-Onset Colorectal Cancer Detection

公平性审计代理系统在早发性结直肠癌检测中缓解偏见的消融研究

Amalia Ionescu, Jose Guadalupe Hernandez, Jui-Hsuan Chang, Emily F. Wong, Paul Wang, Jason H. Moore, Tiffani J. Bright

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出双代理架构(领域专家代理+公平性顾问代理),通过消融实验比较不同配置下大语言模型在公平性审计中的表现,发现带RAG的代理系统在识别差异方面语义相似度最高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15964 2026-06-16 stat.ML cs.LG 新提交 79%

PromptShift-CRC: Drift-Aware Conformal Risk Control for Foundation Models Under Prompt and Domain Shift

PromptShift-CRC: 面向提示和领域漂移的基础模型的漂移感知保形风险控制

Jeffery Opoku, David Banahene

机构 * The University of Texas Rio Grande Valley(德克萨斯理工大学里奥格兰德谷分校) Florida International University(佛罗里达国际大学)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.LG

AI总结 提出PromptShift-CRC方法,通过嵌入提示和响应、测量漂移、加权校准样本并在线更新风险水平,在提示和领域漂移下控制基础模型输出的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15910 2026-06-16 cs.CL 新提交 79%

Calibrated Triage, Not Autonomy: Confidence Estimation for Medical Vision-Language Models

校准的分诊,而非自主:医学视觉-语言模型的置信度估计

Reza Khanmohammadi, Kundan Thind, Mohammad M. Ghassemi

机构 * Michigan State University(密歇根州立大学)

专题命中 领域大模型 :language model(title,abstract);分类 cs.CL

AI总结 针对医学视觉-语言模型在回答时可能忽略图像而依赖语言先验的问题,提出使用置信度估计进行校准分诊,通过评估七种置信度估计器,发现高置信度区域是区分可用估计器的关键,最佳探针可将错误率从41-45%降至1-4%,但无估计器在所有领域和模型中一致最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14870 2026-06-16 hep-ph cs.LG 新提交 79%

Pre-Training for Simulation-Based Science: A Study on Jet Foundation Model Training Objectives

基于模拟的科学预训练:喷注基础模型训练目标研究

Ibrahim Elsharkawy, Joschka Birk, Vinicius Mikuni, Wahid Bhimji, Gregor Kasieczka, Benjamin Nachman

机构 * Department of Physics, University of Toronto and Vector Institute(物理系,多伦多大学和向量研究所) NERSC, Lawrence Berkeley National Laboratory(NERSC,伯克利国家实验室) Institut für Experimentalphysik, Universität Hamburg(实验物理研究所,汉堡大学) Nagoya University, Kobayashi-Maskawa Institute(名古屋大学,小林昭夫研究所) Department of Particle Physics and Astrophysics, Stanford University(粒子物理与天体物理系,斯坦福大学) Fundamental Physics Directorate, SLAC National Accelerator Laboratory(基础物理局,SLAC国家加速器实验室)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.LG

AI总结 本文系统比较了高能物理中基础模型的预训练方法,发现纯分类预训练在标签充足时最优,结合自监督掩码粒子建模在低标签场景下表现突出,而流匹配生成预训练对下游分类无益,但必须包含在预训练目标中才能提升生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15765 2026-06-16 cs.CV 新提交 78%

Task-Instructed Causal Routing of Vision Foundation Models for Multi-Task Learning

任务指令引导的视觉基础模型因果路由用于多任务学习

Donghyun Han, Yuseok Bae, Jung Uk Kim, Hyung-Il Kim

机构 * Electronics and Telecommunications Research Institute (ETRI)(韩国电子通信研究院(ETRI)) Kyung Hee University(庆熙大学) Chonnam National University(全南大学)

专题命中 领域大模型 :foundation model(title,abstract)

AI总结 提出TIGER框架,通过自然语言任务指令引导路由网络,结合反事实因果对齐,协调多个异构视觉基础模型实现多任务密集预测,在NYUD-v2和Pascal Context上超越现有方法。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16710 2026-06-16 cs.MA cs.CL 新提交 77%

Misinformation Propagation in Benign Multi-Agent Systems

良性多智能体系统中的错误信息传播

Jonas Becker, Jan Philip Wahle, Terry Ruas, Bela Gipp

机构 * University of Göttingen, Germany(德国哥廷根大学) LKA NRW, Germany(德国北莱茵-威斯特法伦州警署) Shared last authorship(共同通讯作者)

专题命中 领域大模型 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 研究在良性多智能体系统中,基于意图的错误信息如何通过智能体交互传播,并发现多智能体辩论相比单智能体提示能减少性能下降,鲁棒性取决于群体组成和决策协议。

Comments 20 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏