arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-22 至 2026-05-22 共收录 19 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 19 篇

2605.21609 2026-05-22 cs.CL cs.AI cs.CY 92%

CR4T: Rewrite-Based Guardrails for Adolescent LLM Safety

CR4T:基于重写的青少年LLM安全机制

Heajun An, Qi Zhang, Vedanth Achanta, Jin-Hee Cho

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CR4T框架,通过选择性响应重构替代拒绝导向的安全机制,以更符合青少年发展需求的方式提升LLM的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22636 2026-05-22 cs.SI 92%

A Multi-Source Framework for Relational Validation of Large Language Models Using Expert-Curated Encyclopedic Sources

一种用于大型语言模型关系验证的多源框架,使用专家整理的百科全书源

Moses Boudourides

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文提出了一种多源框架,用于验证大型语言模型的关系结构,通过比较生成的知识图谱与专家整理的百科全书,揭示了LLM在关系结构上的不足,强调了需要更复杂的评估指标来评估知识的完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22642 2026-05-22 cs.AI 89%

Spreadsheet-RL: Advancing Large Language Model Agents on Realistic Spreadsheet Tasks via Reinforcement Learning

Spreadsheet-RL: 通过强化学习推进大型语言模型代理在现实中的电子表格任务中的进步

Banghao Chi, Yining Xie, Mingyuan Wu, Jingcheng Yang, Jize Jiang, Zhaoheng Li, Shengyi Qian, Minjia Zhang, Klara Nahrstedt, Rui Hou, Xiangjun Fan, Hanchao Yu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta

专题命中 领域大模型 :large language model(title);language model(title);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本文提出Spreadsheet-RL,一种通过强化学习微调框架,旨在在现实Microsoft Excel环境中训练专门的电子表格代理。该方法通过自动化管道收集在线论坛中的配对起始-目标电子表格,以及金融和供应链管理等领域的领域特定评估任务,构建了新的Domain-Spreadsheet基准数据集,并展示了在通用和领域特定电子表格任务上的显著性能提升。

Comments Mingyuan served as the project lead. Banghao, Yining, and Mingyuan contributed equally to this work, with more junior authors listed before senior authors. All data and code releases are maintained by the corresponding authors at UIUC and are not affiliated with Meta

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13989 2026-05-22 cs.CL 89%

VectraYX-Nano: A 42M-Parameter Spanish Cybersecurity Language Model with Curriculum Learning and Native Tool Use

VectraYX-Nano: 一个具有课程学习和原生工具使用的4200万参数西班牙语网络安全语言模型

Juan S. Santillana

机构 * Globant

专题命中 领域大模型 :language model(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出了一种基于西班牙语的网络安全语言模型VectraYX-Nano,通过课程学习和原生工具调用,展示了在网络安全领域的应用与改进。

Comments 24 pages, 5 figures, 12 tables. v3: post-Chinchilla compute ablation (v8-v15), Globant affiliation finalized, EMNLP Findings 2026 submission. Released model: VectraYX-Nano v7 (42M params, GGUF Q4 ~20 MB, native MCP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21969 2026-05-22 cs.IR cs.AI 87%

LLM Retrieval for Stable and Predictable Ad Recommendations

基于大语言模型的稳定可预测广告推荐

Vinodh Kumar Sunkara, Satheeshkumar Karuppusamy, Hangjun Xu, Sai Deepika Regani, Kshitij Gupta, Gaby Nahum, Sneha Iyer, Jean-Baptiste Fiot, Yinglong Guo, Xiaowen Guo, Atul Jangra, Yucheng Liu, Jinghao Yan, Vijay Pappu, Benjamin Schulte, Deepak Chandra

机构 * Meta Platforms, Inc.(Meta公司)

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种新的评估框架,用于量化广告推荐系统的稳定性和可预测性,并展示了基于微调大语言模型的在线验证语义候选生成框架,通过提高系统的语义感知能力,在稳定性和可预测性方面实现了显著改进。

Comments SIGIR 2026 AgentSearch Workshop, Melbourne Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21827 2026-05-22 cs.CL cs.AI 86%

Does Slightly Mean Somewhat? Measuring Vague Intensity Words in LLM Numeric Actions

‘稍微’意味着‘ somewhat’吗?在LLM数值行为中测量模糊强度词

Daniel Tabach

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 领域大模型 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了语言模型在必须生成数值行为时是否保留强度词的顺序意义,发现模型在数值输出中压缩了模糊强度词,其解释依赖于状态并接近操作边界时出现不连续性。

Comments 9 figures, 2 tables, 16 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21776 2026-05-22 cs.CL 84%

PromptNCE: Pointwise Mutual Information Predictions Using Only LLMs and Contrastive Estimation Prompts

PromptNCE:仅使用LLM和对比估计提示进行点互信息预测

Juliette Woodrow, Chris Piech

机构 * Department of Computer Science Stanford University(计算机科学系 斯坦福大学)

专题命中 领域大模型 :LLM(title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出PromptNCE方法,通过将条件概率估计转化为对比任务,并引入显式的OTHER类别来恢复真实的条件概率,从而在低数据情况下实现零样本点互信息估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22001 2026-05-22 cs.CR cs.AI cs.CL 81%

Blind Spots in the Guard: How Domain-Camouflaged Injection Attacks Evade Detection in Multi-Agent LLM Systems

守卫中的盲区:如何域伪装注入攻击在多智能体大语言模型系统中逃避检测

Aaditya Pai

机构 * Data Science Institute(数据科学研究所) Columbia University(哥伦比亚大学)

专题命中 领域大模型 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在多智能体大语言模型系统中,域伪装注入攻击如何通过模仿目标文档的领域词汇和权威结构来逃避检测,揭示了检测器在静态和伪装负载之间的检测率差异(Camouflage Detection Gap, CDG),并展示了多智能体辩论架构对静态注入攻击的放大效应以及检测器增强的有限有效性。

Comments 8 pages, 3 figures, 2 tables. Submitted to EMNLP 2026 ARR cycle

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22170 2026-05-22 cs.CL 79%

Do Factual Recall Mechanisms Carry over from Text to Speech in Multimodal Language Models?

事实回忆机制在文本到语音的多模态语言模型中是否延续?

Luca Modica, Filip Landin, Mehrdad Farahani, Livia Qian, Gabriel Skantze, Richard Johansson

机构 * Zenseact Unbox AI Chalmers University of Technology(楚德斯大学) University of Gothenburg(哥德堡大学) KTH Royal Institute of Technology(皇家理工学院)

专题命中 领域大模型 :language model(title,abstract);分类 cs.CL

AI总结 研究探讨了多模态语言模型中事实回忆机制在文本和语音模态间的延续性,通过因果中介分析揭示了语音到文本与文本到文本在事实存储和回忆中的差异。

Comments In *SEM 2026, the 15th Joint Conference on Lexical and Computational Semantics

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21861 2026-05-22 cs.CV cs.AI 79%

Learning Emergent Modular Representations in Multi-modality Medical Vision Foundation Models

在多模态医学视觉基础模型中学习涌现的模块化表示

Yuting He, Chenyu You, Shuo Li

机构 * Case Western Reserve University(凯斯西储大学) Stony Brook University(石溪大学)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出Director-Experts (DEX)框架,通过调控模块化动态,在多模态医学视觉基础模型中学习稳定的模块化表示,并在新的医学视觉基准数据集上验证了其在26个下游任务中的优越性。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21963 2026-05-22 cs.LG cs.AI 79%

ChronoMedicalWorld: A Medical World Model for Learning Patient Trajectories from Longitudinal Care Data

ChronoMedicalWorld:一个用于从纵向护理数据中学习患者轨迹的医学世界模型

Jiangyuan Wang, Xuyong Chen, Junwei He, Xu Xu, Shasha Xie, Fuman Han

机构 * Beijing KidneyTec Medical Technology Co., Ltd.(北京肾科医疗技术有限公司)

专题命中 领域大模型 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种名为ChronoMedicalWorld的模型,旨在通过纵向护理数据学习患者轨迹,该模型结合了联合嵌入状态编码器和宽动作编码器,并在六个术语目标下训练了循环潜在转移模块,以提高慢性病护理中长期预测的准确性。

Comments 14 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22498 2026-05-22 cs.LG cs.AI cs.SC 73%

The Neural Compiler: Program-to-Network Translation for Hybrid Scientific Machine Learning

神经编译器:程序到网络的翻译用于混合科学机器学习

Lucas Sheneman

机构 * Institute for Interdisciplinary Data Sciences(跨学科数据科学研究所) University of Idaho(爱达荷大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出了一种神经编译器,能够将程序转换为可微的PyTorch模块,用于混合科学机器学习,通过符号规范生成正确且可微的模块,实现系统化的可组合性。

Comments Use: 21 pages, 10 figures, 10 tables. Preprint; source code available at https://github.com/sheneman/neural_compiler

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21541 2026-05-22 cs.CR cs.AI cs.LG stat.ML 73%

Frequency-Domain Regularized Adversarial Alignment for Transferable Attacks against Closed-Source MLLMs

频域正则化对抗对齐用于针对闭源大语言模型的可转移攻击

Leitao Yuan, Qinghua Mao, Daizong Liu, Kun Wang, Wenjie Wang, Yan Teng, Jing Shao, Dongrui Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FRA-Attack,通过频域正则化方法解决对抗转移性问题,通过高通DCT目标和频率域梯度正则化提升跨模型的对抗转移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15588 2026-05-22 cs.CL cs.LG 73%

Calibrating LLMs with Semantic-level Reward

通过语义层面奖励校准大型语言模型

Fengfei Yu, Ruijia Niu, Dongxia Wu, Yian Ma, Rose Yu

机构 * Department of Computer Science and Engineering, University of California San Diego, La Jolla, California, USA(加州大学圣地亚哥分校计算机科学与工程系,拉贾尔,加利福尼亚州,美国) Halıcıoğlu Data Science Institute, University of California San Diego, La Jolla, California, USA(加州大学圣地亚哥分校Halıcıoğlu数据科学研究所,拉贾尔,加利福尼亚州,美国) Department of Statistics, Stanford University, Stanford, California, USA(斯坦福大学统计学系,斯坦福,加利福尼亚州,美国)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种新的校准框架CSR,通过在语义空间中直接校准语言模型,避免了传统方法中因词汇化置信度导致的不一致问题,实验显示CSR在多个数据集上均能有效降低ECE并提高AUROC。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21962 2026-05-22 cs.AI cs.CY cs.HC cs.MA 70%

AI-Enabled Serious Games: Integrating Intelligence and Adaptivity in Training Systems

AI赋能的严肃游戏:在训练系统中整合智能与适应性

Priyamvada Tripathi, Bill Kapralos

机构 * Durham College(达灵顿学院) Ontario Tech University(安大略技术大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了如何利用人工智能技术提升严肃游戏中的实时教学适应能力,分析了智能与适应性的定义,并讨论了大型语言模型、强化学习和基于代理的架构在严肃游戏中的应用及面临的挑战。

Comments Book chapter, 1 figure. To appear in "Advances in Global Applied Artificial Intelligence," G. A. Tsihrintzis, M. Virvou, N. G. Bourbakis, and L. C. Jain (Eds.), Springer, Learning and Analytics in Intelligent Systems book series, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21614 2026-05-22 cs.HC cs.LG 70%

Exploring the Effectiveness of Using LLMs for Automated Assessment of Student Self Explanations in Programming Education

探索使用LLMs对编程教育中学生自解释进行自动评估的有效性

Arun-Balajiee Lekshmi-Narayanan, Mohammad Hassany, Peter Brusilovsky

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文研究了在编程教育中使用LLMs自动评估学生自解释的有效性,通过比较LLMs与语义相似性方法在二元分类任务中的表现,探讨了自动评分技术的优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16739 2026-05-22 cs.AI 70%

AI-Driven Prediction of Cancer Pain Episodes: A Hybrid Decision Support Approach

基于AI的癌症疼痛发作预测:一种混合决策支持方法

Yipeng Zhuang, Yifeng Guo, Yuewen Li, Yuheng Wu, Philip Leung-Ho Yu, Tingting Song, Zhiyong Wang, Kunzhong Zhou, Weifang Wang, Li Zhuang

机构 * The University of Hong Kong(香港大学) Peking University Cancer Hospital Yunnan Hospital, The Third Affiliated Hospital of Kunming Medical University(北京大学肿瘤医院云南医院,昆明医科大学第三附属医院)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出了一种混合机器学习和大语言模型的方法,利用结构化和非结构化电子健康记录数据预测癌症患者在住院48和72小时内疼痛发作,通过整合时间序列药物趋势和模糊剂量记录,提高了敏感性和可解释性,实现了87.6%和91.7%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24858 2026-05-22 cs.HC cs.MA 67%

Context-Mediated Domain Adaptation in Multi-Agent Sensemaking Systems

多智能体感知系统中的上下文引导领域适应

Anton Wolter, Leon Haag, Vaishali Dhanoa, Niklas Elmqvist

专题命中 领域大模型 :LLM(abstract,abstract_cn)

AI总结 本文提出了一种上下文引导的领域适应方法,通过多智能体系统中的用户修改来隐式指定领域知识,从而改进大语言模型驱动的多代理推理行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22414 2026-05-22 cs.CV cs.AI 57%

Towards Clinically Interpretable Ophthalmic VQA via Spatially-Grounded Lesion Evidence

迈向具有空间定位病变证据的临床可解释性眼科VQA

Xingyue Wang, Bo Liu, Meng Wang, Zhixuan Zhang, Chengcheng Zhu, Huazhu Fu, Jiang Liu

机构 * Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) The Hong Kong Polytechnic University(香港理工大学) National University of Singapore(新加坡国立大学) University of Washington(华盛顿大学) Institute of High Performance Computing, Agency for Science, Technology and Research(科技研究局高性能计算研究所)

专题命中 领域大模型 :language model(abstract);分类 cs.AI

AI总结 本文提出FundusGround基准,通过空间定位病变证据提升眼科VQA的临床可解释性,通过三阶段流程收集标注病变的视网膜影像,并评估多种视觉语言模型在答案准确性和病变层面推理上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏