arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-25 至 2026-05-25 共收录 20 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 20 篇

2603.20630 2026-05-25 cs.SE cond-mat.mtrl-sci 89%

Evaluating LLM-generated code for domain-specific languages: molecular dynamics with LAMMPS

评估LLM生成的领域特定语言代码:使用LAMMPS进行分子动力学模拟

Ethan Holbrook, Juan C. Verduzco, Alejandro Strachan

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出一种评估流程,结合标准化、解析、低成本执行和准确性检查,系统评估LLM为分子动力学代码LAMMPS生成输入文件的有效性,发现当前模型在科学准确性上有限,但通过可复用的智能体技能可显著提升。

Comments 19 pages, 5 figures, Supporting Info, 27 total pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23007 2026-05-25 q-fin.TR cs.AI cs.LG q-fin.PM 88%

MadEvolve: Evolutionary Optimization of Trading Systems with Large Language Models

MadEvolve: 基于大型语言模型的交易系统进化优化

Yurii Kvasiuk, Tianyi Li, Owen Colegrove, Moritz Münchmeyer

机构 * Department of Physics, University of Wisconsin–Madison(威斯康星大学麦迪逊分校物理系) Event Horizon Labs(事件地平线实验室)

专题命中 领域大模型 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出 MadEvolve 框架,利用大型语言模型驱动的进化算法优化量化金融中的交易策略与 alpha 生成,以比特币交易为例,在特征集演化、策略组件优化及联合演化上取得显著改进,并对比了其他智能搜索方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22971 2026-05-25 cs.CL cs.HC 88%

Can AI Guess What You Know? Performance Comparison of Large Language Models for Human Domain Knowledge Estimation From Communication Logs

AI 能猜出你知道什么吗?从通信日志中估计人类领域知识的大型语言模型性能比较

Ko Watanabe, Shoya Ishimaru

机构 * Osaka Metropolitan University(大阪 metropolitan 大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究通过分析 Slack 日志,比较了七种大型语言模型在零样本设置下估计用户领域知识的能力,发现 Gemini 2.5 Flash 误差最低(MAE 21.13%),且估计精度与消息量弱相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06252 2026-05-25 cs.CR cs.AI cs.LG 88%

False Alarms, Real Damage: Adversarial Attacks Using LLM-based Models on Text-based Cyber Threat Intelligence Systems

虚假警报,真实损害:基于LLM的模型对文本网络威胁情报系统的对抗攻击

Samaneh Shafee, Alysson Bessani, Pedro M. Ferreira

机构 * Faculty of Sciences, University of Lisbon(里斯本大学科学学院) CIENCES, University of Lisbon(里斯本大学CIENCES)

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 研究针对文本网络威胁情报(CTI)系统的对抗攻击,分析逃避、淹没和投毒三种攻击类型,重点展示对抗文本生成如何欺骗分类器、降低性能并破坏系统功能。

Journal ref Future Generation Computer Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02688 2026-05-25 cond-mat.mtrl-sci cs.SE 87%

MatClaw: An Autonomous Code-First LLM Agent for End-to-End Materials Exploration

MatClaw: 一种用于端到端材料探索的自主代码优先LLM代理

Chenmu Zhang, Boris I. Yakobson

专题命中 领域大模型 :LLM(title,title_cn)

AI总结 提出MatClaw,一种代码优先的LLM代理,通过直接编写和执行Python代码、结合四层记忆架构和检索增强生成,实现多代码工作流在远程HPC集群上的自主运行,并在铁电CuInP2S6的三个端到端演示中验证了其可靠性,同时通过文献自学习和专家约束弥合隐性领域知识差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23676 2026-05-25 cs.HC 86%

AI at the Front Lines of Platform Governance: Using LLMs to Support Illegal Content Reporting under the Digital Services Act

平台治理前线的AI:利用大语言模型支持《数字服务法案》下的非法内容举报

Marie-Therese Sekwenz, Shreyan Biswas, Rita Hermann-Gsenger, Ujwal Gadiraju

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本研究通过受控用户实验(N=450),比较了无辅助、传统可解释AI(XAI)和评估性AI(EvalAI)三种条件下,大语言模型辅助用户举报非法内容的效果,发现EvalAI在AI错误时提高了条款级准确性并减少了分类偏差,但两种AI均未显著提升用户解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22672 2026-05-25 cs.AI 85%

Is Capability a Liability? More Capable Language Models Make Worse Forecasts When It Matters Most

能力是负担吗?更强大的语言模型在关键时刻做出更差的预测

Nick Merrill, Jaeho Lee, Ezra Karger

机构 * Forecasting Research Institute(预测研究 institute)

专题命中 领域大模型 :language model(title);LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 本文发现,在时间序列呈现超线性增长和制度转换尾部风险的预测问题上,更强大的语言模型反而产生更差的分位数预测,并分析了这一逆缩放现象的机制、影响因素及评估指标问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23468 2026-05-25 eess.SP 85%

ComHymba: Low-Complexity Domain-Informed Foundation Model for Wireless Communications

ComHymba:面向无线通信的低复杂度领域信息基础模型

Bowen Yang, Wei Chen, Jiaming Cheng, Bo Ai

专题命中 领域大模型 :foundation model(title,abstract);LLM(abstract,abstract_cn)

AI总结 提出ComHymba,一种基于非对称掩码自编码器的领域信息无线基础模型,通过3D时空频补丁化、领域信息掩码策略和幅度-相位加权目标,结合Hymba块(窗口自注意力与状态空间模型融合),实现线性复杂度,在信道重建、感知和波束管理等任务上优于强基线且推理加速3.3倍。

Comments 13 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23472 2026-05-25 cs.CV 83%

Rethinking Transfer Learning for Industrial Inspection: DINOv3 vs. ImageNet Pretraining Across RGB and X-ray Tasks

重新思考工业检测的迁移学习:DINOv3与ImageNet预训练在RGB和X射线任务上的对比

Mehdi Gharbage, Céline Teulière, Pierre Bouges, Thierry Chateau

机构 * Michelin Tyres Manufacturer(米其林轮胎制造商) Université Clermont Auvergne, CNRS, Institut Pascal(克莱蒙特-奥弗涅大学,CNRS,帕西尔研究所)

专题命中 领域大模型 :pretraining(title,abstract);foundation model(abstract,comments)

AI总结 本研究通过对比ConvNeXt骨干网络在监督ImageNet分类和DINOv3蒸馏预训练下的表现,评估了现代自监督预训练在工业视觉检测中的有效性,发现DINOv3在RGB任务微调后表现更优,但在X射线模态下监督预训练仍更有效。

Comments Accepted to the CVPR 2026 Workshop on Vision Foundation Models for Industrial Inspection (VISION'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21504 2026-05-25 q-fin.ST cs.AI 79%

Multivariate Financial Forecasting using the Chronos Time Series Foundation Models

使用Chronos时间序列基础模型进行多元金融预测

Sanjiv R Das, Tarang Goyal, Mohini Yadav

机构 * Santa Clara University(圣克拉拉大学)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI

AI总结 本文利用Chronos-2开源时间序列基础模型,评估多元输入相对于单变量基线在金融预测中的准确性提升,发现多元预测一致优于单变量,尤其在利率和股票市场中表现显著。

Comments 10 pages, 3 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11629 2026-05-25 cs.LG 79%

GP2F: Cross-Domain Graph Prompting with Adaptive Fusion of Pre-trained Graph Neural Networks

GP2F: 基于预训练图神经网络自适应融合的跨域图提示学习

Dongxiao He, Wenxuan Sun, Yongqi Huang, Jitao Zhao, Di Jin

机构 * School of Computer Science and Technology, Tianjin University, Tianjin, China(天津大学计算机科学与技术学院,天津,中国)

专题命中 领域大模型 :prompting(title,abstract);分类 cs.LG

AI总结 针对跨域图提示学习中预训练知识与任务特定适应性的互补机制,提出双分支自适应融合方法GP2F,通过对比损失和拓扑一致性损失实现拓扑约束下的自适应融合,在跨域少样本节点和图分类任务上优于现有方法。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23787 2026-05-25 cs.CY cs.HC 75%

Engagement-Optimized Care: When LLMs become Mental Health Infrastructure

优化参与的护理:当LLM成为心理健康基础设施

Briana Vecchione, Meryl Ye, Livia Garofalo, Ranjit Singh

专题命中 领域大模型 :LLM(title_cn,abstract_cn)

AI总结 本研究通过定性纵向研究,揭示通用LLM因护理缺口被用作心理健康支持,其以参与度而非用户福祉为导向的设计导致结构性不公平权衡,并提出了设计问责制。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23024 2026-05-25 cs.AI cs.CC cs.CL cs.LG 75%

The Deterministic Horizon: Impossibility Results as Design Specifications for Trustworthy AI Systems

确定性视界:作为可信AI系统设计规范的不可行性结果

Dongxin Guo

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过证明架构决定的准确率上限、偏好学习的样本复杂度跳跃、多阶段检索的指标数量要求等16个不可行性结果,将计算极限转化为可信AI系统的设计规范。

Comments PhD thesis, Department of Computer Science, The University of Hong Kong, 2026. 271 pages, 18 figures, 15 tables, 5 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23320 2026-05-25 cs.AI 70%

Human-in-the-Loop Multi-Agent Ventilator Decision Support with Contextual Bandit Preference Learning

人在回路的多智能体呼吸机决策支持与上下文赌博机偏好学习

Sijia Li, Xiaoyu Tan, Qixing Wang, Weiyi Zhao, Chen Zhan, Teqi Hao, Xuemin Wang, Lei Gu, Roland Eils, Xihe Qiu

机构 * Shanghai University of Engineering Science, Shanghai, China Tencent Youtu Lab, Tencent, China Department of Critical Care Medicine, Shanghai Tenth People's Hospital, Tongji University School of Medicine, Shanghai, China Department of Emergency Critical Disease, Songjiang Hospital Affiliated to Shanghai Jiao Tong University School of Medicine, Shanghai, China Max Planck Institute for Heart Lung Research, Bad Nauheim, Germany Fudan University, Shanghai, China BIH at Charit\'e -- Universit\"atsmedizin Berlin, Berlin, Germany

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出VDSS框架,通过人在回路的多智能体协作和上下文赌博机在线偏好适应,实现呼吸机决策支持的个性化与可审计性。

Comments miccai 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18911 2026-05-25 cs.LG cs.AI 62%

Does Your Wildfire Prediction Model Actually Work, or Just Score Well?

你的野火预测模型真的有效,还是只是得分高?

Yangshuang Xu, Yuyang Dai, Liling Chang, Qi Wang, Yushun Dong

机构 * Florida State University(佛罗里达州立大学) Northeastern University(东北大学)

专题命中 领域大模型 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 针对现有地球基础模型不专门用于野火预测的问题,提出首个专门预训练的野火基础模型WILDFIRE-FM,并引入固定合约评估框架以解决评估设计对结论敏感性的问题。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13473 2026-05-25 cs.AI 57%

NeuroWeaver: An Autonomous Evolutionary Agent for Exploring the Programmatic Space of EEG Analysis Pipelines

NeuroWeaver:一种用于探索EEG分析流水线程序空间的自主进化智能体

Guoan Wang, Shihao Yang, Jun-En Ding, Feng Liu

机构 * Department of Systems Engineering, Stevens Institute of Technology(系统工程系,斯蒂文斯理工学院)

专题命中 领域大模型 :foundation model(abstract);分类 cs.AI

AI总结 针对EEG分析中基础模型计算成本高和通用自动机器学习缺乏神经科学先验的问题,提出NeuroWeaver自主进化智能体,通过领域信息子空间初始化和多目标进化优化,在五个异构基准上合成轻量级解决方案,性能优于现有任务特定方法并接近大规模基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07919 2026-05-25 cs.CV 50%

MedVIGIL: Evaluating Trustworthy Medical VLMs Under Broken Visual Evidence

MedVIGIL: 在视觉证据受损下评估可信的医学视觉语言模型

Hanqi Jiang, Junhao Chen, Mingyu Kang, Hyeokjae Kwon, Yi Pan, Lifeng Chen, Weihang You, Haozhen Gong, Ruiyu Yan, Jinglei Lv, Lin Zhao, Hui Ren, Quanzheng Li, Tianming Liu, Xiang Li

机构 * University of Georgia(佐治亚大学) Harvard Medical School(哈佛医学院) Chungbuk National University(Chungbuk国立大学) Chungnam National University Hospital(Chungnam国立大学医院) National University of Singapore(新加坡国立大学) New York University(纽约大学) University of Sydney(悉尼大学) New Jersey Institute of Technology(新泽西理工学院)

专题命中 领域大模型 :language model(abstract)

AI总结 本文提出MedVIGIL基准,通过300例由放射科医生监督构建的扰动证据测试集,评估医学视觉语言模型在视觉证据失效时的可靠性,并引入MedVIGIL复合评分(MCS)进行审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21502 2026-05-25 cs.CV 50%

VFM$^{4}$SDG: Unveiling the Power of VFMs for Single-Domain Generalized Object Detection

VFM$^{4}$SDG:揭示VFM在单域广义目标检测中的力量

Yupeng Zhang, Ruize Han, Ningnan Guo, Wei Feng, Song Wang, Liang Wan

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院) Faculty of Computer Science and Artificial Intelligence, Shenzhen University of Advanced Technology(深圳先进技术大学计算机科学与人工智能学院)

专题命中 领域大模型 :foundation model(abstract)

AI总结 提出VFM$^{4}$SDG框架,利用冻结的视觉基础模型(VFM)作为跨域稳定性先验,通过关系蒸馏和查询增强解决单域广义目标检测中的域偏移导致的漏检问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23310 2026-05-25 cs.IR 50%

From Head to Tail: Asymmetric Knowledge Transfer in Long-tail Recommendation with Generative Semantic IDs

从头到尾:利用生成式语义ID进行长尾推荐中的非对称知识迁移

Chenyi Yan, Ruocong Tang, Xing Fang, Yang Huang, He Guo, Jing Wang

专题命中 领域大模型 :LLM(abstract)

AI总结 针对长尾推荐中的数据不平衡问题,提出AKT-Rec框架,利用多模态大模型生成语义ID,通过聚类引导的自适应嵌入和层次化特征聚合实现从头到尾的非对称知识迁移,在工业数据集和在线A/B测试中显著提升性能。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05534 2026-05-25 cs.CV 50%

S4M: 4-points to Segment Anything

S4M: 4点分割一切

Adrien Meyer, Lorenzo Arboit, Giuseppe Massimiani, Shih-Min Yin, Didier Mutter, Nicolas Padoy

机构 * University of Strasbourg, CNRS, INSERM, ICube, UMR7357, Strasbourg, France(斯特拉斯堡大学、法国国家科学研究中心、法国国家医学研究院、ICube、UMR7357、法国斯特拉斯堡) Department of General Surgery, Kaohsiung Chang Gung Memorial Hospital, Chang Gung University College of Medicine, Kaohsiung, Taiwan(高雄长庚纪念医院外科部、长庚大学医学院)

专题命中 领域大模型 :prompting(abstract)

AI总结 提出S4M方法,通过结构化4点提示(极值点或长短轴端点)增强SAM的几何感知能力,在超声和内镜图像分割中提升精度并减少标注工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏