arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-04 至 2026-05-04 共收录 25 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 25 篇

2605.00741 2026-05-04 cs.CR 91%

Self-Adaptive Multi-Agent LLM-Based Security Pattern Selection for IoT Systems

自适应多智能体LLM基于的安全模式选择用于物联网系统

Saeid Jamshidi, Foutse Khomh, Carol Fung, Kawser Wazed Nafi

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出ASPO方法,结合LLM推理与确定性执行,在MAPE-K控制循环中实现自适应安全模式选择,通过减少极端情况执行成本,提升资源效率和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00320 2026-05-04 cs.AR 91%

VitaLLM: A Versatile and Tiny Accelerator for Mixed-Precision LLM Inference on Edge Devices

VitaLLM:一种 versatile 且 tiny 的混合精度 LLM 推理边缘设备加速器

Zi-Wei Lin, Tian-Sheuan Chang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 VitaLLM 通过 ternary 权重模型和高效计算核心,实现边缘设备上的高效混合精度 LLM 推理,减少 KV 通信并提升利用效率。

Comments accepted in ISCAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00254 2026-05-04 cs.NI cs.AI 90%

Rethinking Network Topologies for Cost-Effective Mixture-of-Experts LLM Serving

重新思考面向低成本专家混合模型LLM服务的网络拓扑

Junsun Choi, Sam Son, Sunjin Choi, Hansung Kim, Yakun Sophia Shao, Scott Shenker, Sylvia Ratnasamy, Borivoje Nikolic

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文研究了专家混合模型LLM服务的网络拓扑,通过系统分析发现低成本无交换机拓扑在多种场景下更有效,且未来GPU升级将进一步巩固其优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00616 2026-05-04 cs.DC 89%

LLM-Emu: Native Runtime Emulation of LLM Inference via Profile-Driven Sampling

LLM-Emu: 通过基于性能的采样实现LLM推理的原生运行时仿真

Wei Da, Evangelia Kalyvianaki

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 LLM-Emu通过基于性能的采样实现LLM推理的原生运行时仿真,能够准确模拟vLLM服务行为,支持在线实验。

Comments 6 page, 2 figures, workshop paper shape

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00422 2026-05-04 cs.LG cs.AI 89%

BWLA: Breaking the Barrier of W1AX Post-Training Quantization for LLMs

BWLA: 突破 W1AX 事后训练量化在 LLMs 中的障碍

Zhixiong Zhao, Zukang Xu, Dawei Yang

机构 * Houmo AI

专题命中 效率与部署 :post-training(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出 BWLA 框架,通过 1 位权重量化和 6 位低精度激活实现 LLMs 的高效压缩与加速,显著提升性能并降低计算成本。

Comments Accepted by ACL-Main 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00519 2026-05-04 cs.PF cs.AI cs.AR 87%

Silicon Showdown: Performance, Efficiency, and Ecosystem Barriers in Consumer-Grade LLM Inference

硅的对决:消费级大语言模型推理中的性能、效率与生态系统障碍

Allan Kazakov, Abdurrahman Javat

机构 * Bahcesehir University(巴切希尔大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文比较了Nvidia和Apple Silicon生态系统在部署大规模大语言模型时的性能、效率和生态系统挑战,揭示了不同架构在内存容量和计算密度上的差异及影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00043 2026-05-04 cs.DB cs.AI cs.MA 87%

SiriusHelper: An LLM Agent-Based Operations Assistant for Big Data Platforms

SiriusHelper:一种基于LLM代理的大数据平台操作助手

Yu Shen, Shiyang Liu, Qihang He, Yihang Cheng, Haining Xie, Zhiming He, Huahua Fan, Xianzhi Tan, Teng Ma, Shaoquan Zhang, Danqing Huang, Fan Jiang, Yang Li, Chongqing Zhao, Peng Chen, Jie Jiang, Bin Cui

机构 * TEG, Tencent Inc.(腾讯科技(TEG)) School of Computer Science, Peking University(北京大学计算机学院)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 SiriusHelper通过统一在线助手自动识别用户意图并路由查询,结合深度搜索机制和优先级知识库,提升回答可靠性与响应速度,减少专家负担,实测降低20.8%的在线工单量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11329 2026-05-04 cs.DC cs.LG 87%

TokenWeave: Efficient Compute-Communication Overlap for Distributed LLM Inference

TokenWeave:分布式大语言模型推理中的高效计算-通信重叠

Raja Gond, Nipun Kwatra, Ramachandran Ramjee

机构 * Microsoft(微软)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 TokenWeave通过优化RMSNorm与通信的融合核,实现高效计算-通信重叠,提升低token长度下的推理性能,实验显示延迟降低1.28倍,吞吐量提升1.19倍。

Comments Accepted at MLSys 2026. In Versions 1 and 2, Figure 6 erroneously reports Multimem-AllReduce bandwidth rather than Multimem Reduce-Scatter bandwidth. In Version 4, we corrected the x-axis tick labels in Figure 7

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07475 2026-05-04 cs.CL cs.AI cs.CY cs.LG 85%

Laissez-Faire Harms: Algorithmic Biases in Generative Language Models

放任的伤害:生成语言模型中的算法偏见

Evan Shieh, Faye-Marie Vassel, Cassidy Sugimoto, Thema Monroe-White

机构 * Young Data Scientists League(年轻数据科学家联盟) Stanford University(斯坦福大学) Georgia Institute of Technology(佐治亚理工学院) Schar School of Policy and Government & Department of Computer Science(政策与政府学院及计算机科学系) George Mason University(乔治·马歇尔大学)

专题命中 效率与部署 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过开放性提示分析生成语言模型的偏见,发现五种主流模型对少数族裔、性别和性取向群体存在排除、从属和刻板印象的伤害,强调需保护消费者免受语言模型歧视性影响。

Comments 16 pages (43 if including supplementals), 8 figures (23 if including supplementals)

Journal ref Nat Commun 17, 1243 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00140 2026-05-04 cs.LG cs.CL cs.CV 81%

Technical Report: Activation Residual Hessian Quantization (ARHQ) for Low-Bit LLM Quantization

技术报告:用于低比特大语言模型量化的小激活残差Hessian量化(ARHQ)

YiFeng Wang, Zhun Sun, Keisuke Sakaguchi

机构 * Graduate School of Information Sciences(信息科学研究生院)

专题命中 效率与部署 :LLM(title);post-training(abstract);分类 cs.CL、cs.LG

AI总结 ARHQ通过构建输入侧残差Hessian来隔离误差敏感的权重方向,提升低比特激活权重量化的层间SNR并保持下游推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28075 2026-05-04 cs.CL cs.AI 81%

Repetition over Diversity: High-Signal Data Filtering for Sample-Efficient German Language Modeling

重复与多样性:高信号数据过滤以提升德国语言模型的样本效率

Ansar Aynetdinov, Patrick Haller, Alan Akbik

机构 * Humboldt-Universität zu Berlin(洪堡大学柏林分校)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在德国语言模型训练中,通过高信号数据过滤在多样性和质量之间进行权衡,发现重复高质量数据比单次训练更大更少过滤的数据表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00179 2026-05-04 cs.SE 80%

DEPTEX: Organization-First, Open Source Dependency Risk Monitoring

DEPTEX: 以组织为中心,开源依赖风险监控

Henry Ruckman-Utting, Vrushal Nedungadi, Taiga Okuma, LeTian Wang, Stephen Ehebald, Mohammad A. Tayebi

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 DEPTEX通过图谱技术与大语言模型结合,解决开源依赖风险评估中的语义缺失问题,实现动态合规管理和主动风险控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17465 2026-05-04 cs.AI 79%

Language models recognize dropout and Gaussian noise applied to their activations

语言模型能够识别应用于其激活上的dropout和高斯噪声

Damiano Fornasiere, Mirko Bronzi, Spencer Kitts, Alessandro Palmas, Yoshua Bengio, Oliver Richardson

机构 * LawZero

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 研究发现语言模型能检测并区分激活上的dropout和高斯噪声,通过多选问题测试不同模型的识别能力,结果表明模型能准确识别扰动类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00536 2026-05-04 cs.DC cs.AR cs.LG cs.PF cs.RO 77%

Tempus: A Temporally Scalable Resource-Invariant GEMM Streaming Framework for Versal AI Edge

Tempus:一种时间可扩展的资源不变GEMM流式框架用于Versal AI边缘

M. Grailoo, J. Núñez-Yáñez

机构 * Versal AI Edge Report(Versal AI Edge报告)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Tempus框架,通过时间迭代和算法数据分片实现GEMM加速,提升边缘AI推理效率,相比现有方法在资源利用和能耗方面表现更优。

Comments 11 pages, 3 figures, 8 tables, 4 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18064 2026-05-04 cs.CV 75%

Adapting Large VLMs with Iterative and Manual Instructions for Generative Low-light Enhancement

适配大型视觉语言模型以生成低光照增强

Xiaoran Sun, Liyan Wang, Yeying Jin, Kin-man Lam, Zhixun Su, Yang Yang, Jinshan Pan, Cong Wang

机构 * Dalian University of Technology(大连理工大学) National University of Singapore(新加坡国立大学) Hong Kong Polytechnic University(香港理工大学) University of California, San Francisco(加州大学旧金山分校) Nanjing University of Science and Technology(南京理工大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 本文提出VLM-IMI框架,通过迭代和手动指令适配大型视觉语言模型,用于生成低光照增强。该框架包含正常光照指令先验生成和指令感知光照增强扩散两个分支,通过融合模块整合跨模态先验,提升生成效果。

Comments 11 papers,8 figures, CVPR2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05833 2026-05-04 cs.CL 74%

Peek2: Regex-free Byte-level Byte-Pair Encoding Pretokenizer for LLM Inference on Edge Devices

Peek2:无需正则表达式的字节级字节对编码预分词器用于边缘设备上的大语言模型推理

Liu Zai, Iraklis Klampanos

机构 * University of Glasgow(格拉斯哥大学)

专题命中 效率与部署 :LLM(title);分类 cs.CL

AI总结 Peek2是一种线性时间复杂度且内存消耗低的预分词算法,适用于边缘设备,提升了字节级BPE编码的吞吐量,且结果与基于正则表达式的分词器相同。

Comments 7 pages, 5 figures, accepted to ACL SRW 2026, for associated code, see https://github.com/omegacoleman/tokenizers_peek2 v2: updated to match accepted version in ACL SRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02327 2026-05-04 cs.CV 67%

PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance

PPLLaVA:通过提示引导的视频序列理解

Shangkun Sun, Ruyang Liu, Haoran Tang, Yixiao Ge, Haibo Lu, Wei Gao, Jiankun Yang, Chen Li

机构 * Peng Cheng Laboratory(鹏城实验室) Peking University(北京大学) XPeng Inc.(小鹏汽车有限公司) Ministry of Industry and Information Technology of the People’s Republic of China, China Electronics Standardization Institute, Beijing, China(中华人民共和国工业和信息化部,中国电子标准化研究院,北京,中国)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 PPLLaVA通过提示引导的池化策略实现视频序列高效理解,减少18倍token,提升推理效率并在多种视频理解任务中取得最佳性能。

Comments Accepted to ICLR' 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00691 2026-05-04 cs.MA cs.NE 67%

Learning to Act and Cooperate for Distributed Black-Box Consensus Optimization

学习行动与协作以实现分布式黑盒共识优化

Zi-Bo Qin, Feng-Feng Wei, Tai-You Chen, Wei-Neng Chen

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出LACMAS框架,通过大语言模型提供稀疏高层指导,改进分布式黑盒共识优化中的局部适应、全局协调与通信效率。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00560 2026-05-04 cs.IR 67%

When More Reformulations Hurt: Avoiding Drift using Ranker Feedback

当更多改写损害:通过排序器反馈避免漂移

V Venktesh, Mandeep Rathee, Avishek Anand

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出ReformIR框架,通过预算感知的检索方法,在有限计算下优化改写查询的召回率并抑制漂移,实验表明其在MSMARCO和TREC DL基准上优于现有方法。

Comments Accepted to SIGIR 26 full paper track 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00061 2026-05-04 cs.NE 67%

UniBCI: Towards a Unified Pretrained Model for Invasive Brain-Computer Interfaces

UniBCI: 向侵入式脑机接口的统一预训练模型迈进

Binjie Hong, Rui Xiong, Liyuan Han, Tielin Zhang

专题命中 效率与部署 :foundation model(abstract);pretraining(abstract)

AI总结 本文提出UniBCI模型,通过整合上下文条件空间时间分块、层次化区间面积注意力机制和可扩展自监督掩码信号重建目标,实现对侵入式神经信号的高效表征学习,提升模型泛化能力与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22908 2026-05-04 cs.CV cs.LG 57%

Adaptive Dual-Teacher Distillation with Subnetwork Rectification for Bridging Semantic Gaps in Black-Box Domain Adaptation

自适应双教师蒸馏与子网络校正用于桥接黑盒领域适应中的语义间隙

Zhe Zhang, Jing Li, Wanli Xue, Xu Cheng, Jianhua Zhang, Qinghua Hu, Shengyong Chen

机构 * School of Computer Science and Engineering, Tianjin University of Technology(天津理工大学计算机科学与工程学院) School of Artificial Intelligence, Tianjin University(天津大学人工智能学院)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 本文提出DDSR框架,通过自适应预测融合策略和子网络正则化机制,解决黑盒领域适应中任务特定知识与语言对齐语义先验的不一致问题,提升领域适应性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14276 2026-05-04 cs.CV 50%

ScreenParse: Moving Beyond Sparse Grounding with Complete Screen Parsing Supervision

ScreenParse:超越稀疏标注的完整屏幕解析监督

A. Said Gurbuz, Sunghwan Hong, Ahmed Nassar, Marc Pollefeys, Peter Staar

机构 * IBM Research Zurich, Zurich, Switzerland(IBM苏黎世研究实验室,瑞士苏黎世) ETH Zurich, Computer Vision(苏黎世联邦理工学院,计算机视觉) ETH AI Center, Switzerland(苏黎世联邦理工学院人工智能中心,瑞士) ETH Zurich, Photogrammetry(苏黎世联邦理工学院,摄影测量学) Microsoft, Switzerland(微软公司,瑞士)

专题命中 效率与部署 :language model(abstract)

AI总结 ScreenParse通过大规模完整屏幕解析标注,训练出性能优异的ScreenVLM模型,显著提升了密集解析能力和迁移表现。

Comments Accepted at ICML 2026. 28 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10766 2026-05-04 cs.CV 50%

At FullTilt: Real-Time Open-Set 3D Macromolecule Detection Directly from Tilted 2D Projections

全速:从倾斜2D投影直接实时进行开放集3D大分子检测

Ming-Yang Ho, Alberto Bartesaghi

机构 * Duke University(杜克大学)

专题命中 效率与部署 :prompting(abstract)

AI总结 本文提出FullTilt框架,通过直接处理对齐的2D倾斜系列图像,实现了开放集3D大分子检测,大幅提升了推理速度和效率,降低了内存需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19600 2026-05-04 cs.CV 50%

Quantization Robustness to Input Degradations for Object Detection

量化对输入退化鲁棒性的研究:目标检测

Toghrul Karimov, Hassan Imani, Allan Kazakov

机构 * Bahcesehir University(巴赫塞希尔大学)

专题命中 效率与部署 :post-training(abstract)

AI总结 本文研究了量化对目标检测模型在真实输入退化下的鲁棒性影响,通过评估YOLO模型在不同精度下的表现,发现静态INT8量化在清洁数据上速度提升显著,但退化感知校准在多数情况下未提升鲁棒性,但大模型在特定噪声下有例外。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06540 2026-05-04 cs.CV math.ST stat.AP stat.ME stat.TH 50%

Copula-enhanced Vision Transformer for high myopia diagnosis through OU UWF fundus images

基于Copula的视觉Transformer用于通过OU UWF视网膜图像诊断高度近视

Chong Zhong, Yunhao Liu, Yang Li, Xiang Fu, Jin Yang, Danjuan Yang, Meiyan Li, Jinfeng Xu, Aiyi Liu, Alan H. Welsh, Xingtao Zhou, Bo Fu, Catherine C. Liu

机构 * Department of Applied Biology Chemical Technology, The Hong Kong Polytechnic University Department of Data Science \& AI, The Hong Kong Polytechnic University e2 School of Data Science, Fudan University e1 Department of Applied Mathematics, The Hong Kong Polytechnic University Department of Biostatistics, City University of Hong Kong Eye Institute Department of Ophthalmology, Eye \& ENT Hospital, Fudan University Eunice Kennedy Shriver National Institute of Child Health College of Business Economics, Australian National University

专题命中 效率与部署 :foundation model(abstract)

AI总结 本文提出Copula增强的视觉Transformer模型,用于通过OU UWF视网膜图像诊断高度近视,解决双目图像异质性和多任务学习中的条件依赖结构建模问题。

详情

展开后加载摘要…

URL PDF HTML 收藏