arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-03 至 2026-04-03 共收录 227 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 42 篇

2604.01586 2026-04-03 cs.CV cs.AI 77%

SHOE: Semantic HOI Open-Vocabulary Evaluation Metric

SHOE:语义HOI开放词汇评估度量

Maja Noack, Qinqian Lei, Taipeng Tian, Bihan Dong, Robby T. Tan, Yixin Chen, John Young, Saijun Zhang, Bo Wang

机构 * University of Mississippi(密西西比大学) National University of Singapore(新加坡国立大学) Independent Researcher(独立研究员) ASUS Intelligent Cloud Services (AICS)(华硕智能云服务(AICS))

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SHOE评估框架,通过结合预测与真实HOI标签的语义相似性,改进开放词汇HOI检测的评估方法,实验表明其与人类判断一致率达85.73%。

Comments Accepted to GRAIL-V Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02989 2026-04-03 cs.CL 77%

A Comparative Study of Competency Question Elicitation Methods from Ontology Requirements

基于本体需求的竞争力问题 elicitation 方法比较研究

Reham Alharbi, Valentina Tamma, Terry R. Payne, Jacopo de Berardinis

机构 * College of Computer Science and Engineering, Taibah University(塔伊巴大学计算机科学与工程学院) School of Computer Science and Informatics, University of Liverpool(利物浦大学计算机科学与信息学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文比较了三种竞争力问题生成方法:人工编制、模式实例化和LLM生成,发现不同方法有不同特点,LLM生成的问题需进一步优化才能用于需求建模。

Comments Revised version (v2) accepted for the 23rd European Semantic Web Conference (ESWC-2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01572 2026-04-03 cs.CR 75%

AI-Assisted Hardware Security Verification: A Survey and AI Accelerator Case Study

AI辅助的硬件安全验证:综述与AI加速器案例研究

Khan Thamid Hasan, Md Ajoad Hasan, Nashmin Alam, Md. Touhidul Islam, Upoma Das, Farimah Farahmandi

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文综述了AI辅助硬件安全验证的最新进展,通过NVDLA案例研究展示AI在自动化验证流程中的应用,强调AI输出需基于仿真证据和形式验证确保可信安全。

Comments This paper will be presented at IEEE VLSI Test Symposium (VTS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29376 2026-04-03 cs.CV 75%

Assessing Multimodal Chronic Wound Embeddings with Expert Triplet Agreement

基于专家三元组一致性的多模态慢性伤口嵌入评估

Fabian Kabus, Julia Hindel, Jelena Bratulić, Meropi Karakioulaki, Ayush Gupta, Cristina Has, Thomas Brox, Abhinav Valada, Harald Binder

机构 * Institute of Medical Biometry and Statistics (IMBI), Medical Faculty and Medical Center, University of Freiburg(弗莱堡大学医学院与医学中心医学统计与生物统计研究所) Department of Computer Science, Faculty of Engineering, University of Freiburg(弗莱堡大学工程学院计算机科学系) Department of Dermatology, Medical Faculty and Medical Center, University of Freiburg(弗莱堡大学医学院与医学中心皮肤科)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出通过专家三元组比较评估嵌入空间,引入TriDerm框架整合图像、边界掩码和专家报告,融合视觉与文本模态提升专家一致性至73.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06408 2026-04-03 cs.HC 75%

CommentScope: A Comment-Embedded Assisted Reading System for a Long Text

CommentScope:一种嵌入评论的辅助阅读系统用于长文本

Shuai Chen, Lei Han, Haoran Zhang, Kaihao Liu, Zhaoman Zhong

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 CommentScope通过嵌入评论提升长文本阅读效率,采用LLM分类和可视化模块,实现评论分类与展示,提升信息获取与阅读流畅度。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06763 2026-04-03 cs.CV cs.AI 70%

SafePLUG: Empowering Multimodal LLMs with Pixel-Level Insight and Temporal Grounding for Traffic Accident Understanding

SafePLUG: 通过像素级洞察和时间锚定赋能多模态大语言模型以理解交通事故

Zihao Sheng, Zilin Huang, Yansong Qu, Jiancong Chen, Yuhao Luo, Yen-Jung Chen, Yue Leng, Sikai Chen

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Purdue University(普渡大学) Google(谷歌)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SafePLUG框架,通过像素级理解和时间锚定提升多模态大语言模型在交通事故分析中的能力,引入新数据集并实现区域问答、像素分割、时间事件定位等任务的高性能表现。

Comments The code, dataset, and model checkpoints will be made publicly available at: https://zihaosheng.github.io/SafePLUG

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02034 2026-04-03 cs.AI 70%

AI in Insurance: Adaptive Questionnaires for Improved Risk Profiling

保险中的AI:适应性问卷以提升风险评估

Diogo Silva, João Teixeira, Bruno Lima

机构 * Deloitte(德勤) Faculty of Engineering, University of Porto(波尔图大学工程学院) LIACC, Faculty of Engineering, University of Porto(波尔图大学工程学院人工智能与计算机科学实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ARQuest框架,利用大语言模型和替代数据源创建个性化适应性问卷,通过社交媒体图像分析等技术提升风险评估的准确性与用户满意度。

Journal ref International Workshop on Agentic Engineering (AGENT 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01941 2026-04-03 cs.CV cs.AI 70%

Captioning Daily Activity Images in Early Childhood Education: Benchmark and Algorithm

在早期教育中的日常活动图像描述:基准和算法

Sixing Li, Zhibin Gu, Ziqi Zhang, Weiguo Pan, Bing Li, Ying Wang, Hongzhe Liu

机构 * School of Robotics, Beijing Union University(北京联合大学机器人学院) College of Computer and Cyber Security, Hebei Normal University(河北师范大学计算机与网络安全学院) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) National Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院) PeopleAI, Inc.(人民人工智能公司) People Youhe Education Technology Co., Ltd.(人民优和教育科技有限公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ECAC基准和RSRS算法,通过专家标注和细粒度标签提升早期教育图像描述的专业性,实验显示KinderMM-Cap-3B在TTS上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16219 2026-04-03 cs.CR cs.AI 70%

SentinelNet: Safeguarding Multi-Agent Collaboration Through Credit-Based Dynamic Threat Detection

SentinelNet:通过基于信用的动态威胁检测保障多智能体协作

Yang Feng, Xudong Pan

机构 * The University of Edinburgh(爱丁堡大学) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SentinelNet通过基于信用的动态威胁检测机制,主动识别并缓解多智能体协作中的恶意行为,实现高检测率和系统恢复率。

Comments Accepted at The ACM Web Conference 2026 (WWW 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14870 2026-04-03 cs.CV eess.IV 67%

HERBench: A Benchmark for Multi-Evidence Integration in Video Question Answering

HERBench:视频问答中多证据整合的基准

Dan Ben-Ami, Gabriele Serussi, Kobi Cohen, Chaim Baskin

机构 * INSIGHT Lab, Ben-Gurion University of the Negev(本-古里安大学 INSIGHT 实验室) Ben-Gurion University of the Negev(本-古里安大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 HERBench通过要求至少三个非重叠视频片段线索,推动视频问答中多证据整合的研究,评估13种最新视频大语言模型,发现其准确率仅31-42%,揭示检索与融合两大瓶颈。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06393 2026-04-03 cs.IR 67%

MuCo: Multi-turn Contrastive Learning for Multimodal Embedding Model

MuCo:多轮对比学习用于多模态嵌入模型

Geonmo Gu, Byeongho Heo, Jaemyung Yu, Jaehui Hwang, Taekyung Kim, Sangmin Lee, HeeJae Jun, Yoohoon Kang, Sangdoo Yun, Dongyoon Han

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出MuCo,一种基于对话的多轮对比学习框架,通过多轮查询-目标对提升多模态嵌入模型的训练效率和表征一致性。

Comments CVPR 2026 camera-ready; 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01962 2026-04-03 cs.AI cs.LG 62%

Abnormal Head Movements in Neurological Conditions: A Knowledge-Based Dataset with Application to Cervical Dystonia

神经性异常头部运动:一个基于知识的数据集及其在颈椎肌张力障碍中的应用

Saja Al-Dabet, Sherzod Turaev, Nazar Zaki

机构 * College of Information Technology, United Arab Emirates University(阿拉伯联合酋长国大学信息技术学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出NeuroPose-AHM数据集,用于研究神经性异常头部运动,通过多LLM框架整合1430篇文献,涵盖57种神经疾病,应用于颈椎肌张力障碍的四类任务分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01053 2026-04-03 cs.CL cs.AI 62%

A Dynamic Fusion Model for Consistent Crisis Response

一致危机响应的动态融合模型

Xiaoying Song, Anirban Saha Anik, Eduardo Blanco, Vanessa Frias-Martinez, Lingzi Hong

机构 * University of North Texas(北德克萨斯大学) University of Arizona(亚利桑那大学) University of Maryland(马里兰大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出动态融合模型,通过评估和整合生成响应的风格,提升危机沟通中响应的一致性和质量。

Comments Accepted at Findings of EMNLP 2025

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01957 2026-04-03 cs.CL cs.IR 57%

Diagnosing Translated Benchmarks: An Automated Quality Assurance Study of the EU20 Benchmark Suite

诊断翻译基准:对EU20基准套件的自动化质量保证研究

Klaudia Thellmann, Bernhard Stadler, Michael Färber

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文通过自动化方法研究EU20基准套件的翻译质量,发现低COMET分数的数据包含更多准确性错误,释放了清理后的数据集和可复现代码。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01298 2026-04-03 cs.LG 57%

Forecasting Supply Chain Disruptions with Foresight Learning

利用前瞻性学习预测供应链中断

Benjamin Turtel, Paul Wilczewski, Kris Skotheim

机构 * Lightning Rod Labs(闪电杆实验室)

专题命中 评测与基准 :prompting(abstract);分类 cs.LG

AI总结 本文提出一种端到端框架,通过真实中断结果训练LLM生成校准的概率预测,优于基线模型,在准确性、校准和精确度上表现突出,展示了结构化概率推理的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21687 2026-04-03 cs.AI 57%

MIRAGE: The Illusion of Visual Understanding

MIRAGE:视觉理解的幻觉

Mohammad Asadi, Jack W. O'Sullivan, Fang Cao, Tahoura Nedaee, Kamyar Rajabalifardi, Fei-Fei Li, Ehsan Adeli, Euan Ashley

机构 * Stanford University(斯坦福大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究揭示多模态AI系统在视觉-语言推理中的漏洞,指出模型能生成未提供图像的详细描述及推理,挑战现有假设,提出B-Clean作为公平评估方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12072 2026-04-03 cs.IR cs.AI 57%

TRACE: Transparent Web Reliability Assessment with Contextual Explanations

TRACE: 基于上下文解释的透明网络可靠性评估

Joydeep Chandra, Aleksandr Algazinov, Satyam Kumar Navneet, Rim El Filali, Matt Laing, Andrew Hanna, Yong Zhang

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出TRACE框架,通过细粒度连续可靠性评分和上下文解释,提升网络内容可信度评估的透明性和准确性。

Comments Withdrawing paper due to identified inaccuracies in citation attribution. Specifically, errors were found in the Literature Review (Section 2), where references were incorrectly attributed or do not adequately support the associated claims. These issues affect the accuracy of the arguments presented. To preserve the integrity of the scholarly record, the authors are withdrawing this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01791 2026-04-03 cs.CV 50%

PTC-Depth: Pose-Refined Monocular Depth Estimation with Temporal Consistency

PTC-Depth:基于姿态优化的单目深度估计与时间一致性

Leezy Han, Seunggyu Kim, Dongseok Shim, Hyeonbeom Lee

机构 * Ajou University(亚洲大学) Sony Creative AI Lab(索尼创意AI实验室)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出PTC-Depth框架,通过轮式里程计实现稳定深度估计,结合光流三角化估计相机姿态和稀疏深度,利用递归贝叶斯估计修正尺度,提升深度预测的准确性和一致性。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01265 2026-04-03 cs.IT math.IT 50%

Coverage and Rate Analysis of Follower-Based LEO Satellite Networks: A Stochastic Geometry Approach

低轨卫星网络的覆盖与速率分析:一种随机几何方法

Juanjuan Ru, Ruibo Wang, Mohamed-Slim Alouini

专题命中 评测与基准 :prompting(abstract)

AI总结 本文基于随机几何方法分析低轨卫星网络中跟随者集群的覆盖与速率性能,推导了 outage 概率和平均数据速率的解析表达式,并通过数值结果验证了跟随者架构的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01226 2026-04-03 cs.CV cs.SE 50%

DOne: Decoupling Structure and Rendering for High-Fidelity Design-to-Code Generation

DOne:解耦结构与渲染以实现高保真设计到代码生成

Xinhao Huang, Jinke Yu, Wenhao Xu, Zeyi Wen, Ying Zhou, Junzhuo Liu, Junhao Ji, Zulong Chen

机构 * HKUST (Guangzhou)(香港科技大学(广州)) Alibaba Group(阿里巴巴集团) HKUST(香港科技大学) University of Electronic Science(电子科技大学) Zhejiang Lab(之江实验室)

专题命中 评测与基准 :language model(abstract)

AI总结 DOne通过解耦结构理解与元素渲染,提升设计到代码生成的高保真度,通过布局分割模块、混合元素检索器和模式引导生成范式,克服了现有方法在结构与细节协调上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02640 2026-04-03 cs.CY 50%

The First Mass Protest on Threads: Multimodal Mobilization and AI-Generated Visuals in Taiwan's Bluebird Movement

台湾蓝鸟运动中的首次大规模抗议:多模态动员与AI生成视觉内容

Tracy Weener, Ho-Chun Herbert Chang

专题命中 评测与基准 :LLM(abstract)

AI总结 本文分析台湾2024年蓝鸟运动中文本与视觉信息的传播动态,揭示算法曝光与用户支持的不对称性及AI生成图像在抗议中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 25 篇

2604.01881 2026-04-03 cs.CV cs.CL 89%

HieraVid: Hierarchical Token Pruning for Fast Video Large Language Models

HieraVid:用于快速视频大语言模型的分层令牌修剪

Yansong Guo, Chaoyang Zhu, Jiayi Ji, Jianghang Lin, Liujuan Cao

机构 * Xiamen University(厦门大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 HieraVid通过分层修剪框架减少视频令牌冗余,提升视频大语言模型的效率,在保留性能的同时实现30%的令牌保留率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00474 2026-04-03 cs.IT cs.LG eess.SP math.IT 89%

Wireless Power Control Based on Large Language Models

基于大语言模型的无线功率控制

Jiacheng Wang, Yucheng Sheng, Le Liang, Hao Ye, Shi Jin

机构 * School of Information Science and Engineering, Southeast University(东南大学信息科学与工程学院) Department of Electrical and Computer Engineering, University of California, Santa Cruz(加州大学圣克鲁兹分校电气与计算机工程系)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文提出PC-LLM框架,通过引入干扰感知注意力偏差,有效融合无线拓扑与预训练关系先验,实现高效无线网络功率控制,且在零样本环境下表现出色。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13307 2026-04-03 cs.NI 89%

Cooperative Edge Caching with Large Language Model in Wireless Networks

无线网络中基于大语言模型的协同边缘缓存

Ning Yang, Wentao Wang, Lingtao Ouyang, Haijun Zhang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出基于大语言模型的集中式多基站缓存替换控制器,通过确定性文本到动作循环实现协同缓存替换,优于传统方法,在缓存容量、库大小、流行度偏斜和用户密度等方面表现出鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02119 2026-04-03 cs.LG 88%

AA-SVD : Anchored and Adaptive SVD for Large Language Model Compression

AA-SVD:面向大语言模型压缩的锚定与自适应SVD

Atul Kumar Sinha, François Fleuret

机构 * University of Geneva(日内瓦大学) FAIR, Meta(Meta FAIR)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出一种快速低秩因子分解框架,用于压缩大语言模型,实现无需重新训练的快速压缩。通过同时考虑原始输入和分布偏移,改进Transformer块的端到端压缩,减少输出失真并联合补偿累积误差,实验表明在高压缩率下优于现有SVD基方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03396 2026-04-03 cs.CL 88%

Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective

迈向抗蒸馏的大语言模型:信息论视角

Hao Fang, Tianyi Zhang, Tianqu Zhuang, Jiawei Kong, Kuofeng Gao, Bin Chen, Leqi Liang, Shu-Tao Xia, Ke Xu

机构 * Tsinghua University(清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文从信息论角度分析蒸馏防御问题,提出通过最小化条件互信息来提升模型抗蒸馏能力,设计变换矩阵净化输出以增强安全性,实验表明方法有效降低蒸馏性能并保持任务准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01235 2026-04-03 cs.AI 85%

Runtime Burden Allocation for Structured LLM Routing in Agentic Expert Systems: A Full-Factorial Cross-Backend Methodology

结构化大语言模型路由在代理专家系统中的运行时负担分配:一种全因子跨后端方法论

Zhou Hanlin, Chan Huah Yong

机构 * School of Computer Sciences, Universiti Sains Malaysia (USM)(马来西亚理科大学计算机科学学院) Xiamen Software Vocational & Technical College(厦门软件职业技术学院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了结构化LLM路由在代理专家系统中的负担分配问题,提出了一种全因子跨后端方法论,通过全面评估不同后端配置下的性能,揭示了后端特定交互效应对性能的主导作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00388 2026-04-03 cs.LG 83%

Safer by Diffusion, Broken by Context: Diffusion LLM's Safety Blessing and Its Failure Mode

扩散模型更安全,但受上下文影响而失效:扩散大语言模型的安全祝福及其失效模式

Zeyuan He, Yupeng Chen, Lang Lin, Yihan Wang, Shenxu Chang, Eric Sommerlade, Philip Torr, Junchi Yu, Adel Bibi, Jialin Yu

机构 * Torr Vision Group, University of Oxford(牛津大学Torr视觉组) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Microsoft(微软)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究探讨了扩散大语言模型(D-LLMs)在生成效率上的优势及其安全特性,发现其扩散生成方式增强了对对抗攻击的抵抗力,但存在上下文嵌套等失效模式,首次成功突破Gemini Diffusion的安全防线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02008 2026-04-03 cs.CL 83%

$k$NNProxy: Efficient Training-Free Proxy Alignment for Black-Box Zero-Shot LLM-Generated Text Detection

$k$NNProxy:高效无训练代理对齐方法用于黑盒零样本LLM生成文本检测

Kahim Wong, Kemou Li, Haiwei Wu, Jiantao Zhou

机构 * School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院)

专题命中 效率与部署 :LLM(title,abstract);language model(abstract);分类 cs.CL

AI总结 本文提出$ k $NNProxy方法,利用$ k $NN语言模型检索机制作为领域适配器,实现无训练的代理对齐,提升黑盒零样本LLM生成文本检测的鲁棒性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01563 2026-04-03 cs.AI cs.LG 81%

Does Your Optimizer Care How You Normalize? Normalization-Optimizer Coupling in LLM Training

你的优化器是否在意你如何归一化?LLM训练中的归一化-优化器耦合

Abdelrahman Abouzeid

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究发现归一化层与优化器在LLM训练中存在交互影响,动态Erf在Muon优化器下表现下降,通过调整参数可恢复性能,揭示归一化方法对优化器的敏感性。

Comments 16 pages, 8 figures. Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏