arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-02 至 2026-06-02 共收录 848 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 154 篇

2606.02375 2026-06-02 cs.CL cs.CY cs.HC 70%

WAXAL-NET: Finetuned Edge ASR Across 19 African Languages

WAXAL-NET: 针对19种非洲语言的微调边缘ASR

Victor Tolulope Olufemi, Oreoluwa Babatunde, Ramsey Njema, Bolarinwa Gbotemi, Wanchi Lucia Yen, John Uzodinma, Sunday Ajayi, Oluwademilade Williams, Kausar Moshood, Innocent Elendu Anyaele, Akebert Arefaine, Candace Hunzwi, Wongel Dawit Daniel, Emmilly Namuganga, Cleophas Kadima, Athanase Bahizire, Onitsiky Ranaivoson, Emmanuel Aaron, Nicholaus Ladislaus, Idris Muhammed, Jonathan Enoch Simenya, Martin Koome, Matewos Tegete Endaylalu, Peter Ifeoluwa Adeyemo, Hondi Prisca Birindwa, Ukachi Agnes Eze-Mbey, Yacoba Oduro-Yeboah, Pericles Adjovi, Mikel K. Ngueajio, Toluwani Aremu, Prasenjit Mitra

机构 * CMU Africa(CMU非洲中心) LyngualLabs MBZUAI

专题命中 效率与部署 :foundation model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本研究评估了紧凑型领域专用ASR模型在WAXAL语料库的19种非洲语言会话语音上是否优于大规模多语言基础模型,通过微调边缘模型实现了宏平均WER从64.9%降至38.0%,模型大小缩小3-40倍,证实领域专业化主导规模效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02204 2026-06-02 cs.CL 70%

Cross-Environment Neural Reranking for Sample-Efficient Action Selection in Text-Based Agents

跨环境神经重排序用于文本智能体中样本高效的动作选择

Kan Shao

机构 * Jinglue Technology Development (Nanjing) Co., Ltd.(江苏 Jinglue 技术发展(南京)有限公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过联合训练轻量级神经重排序器(DeBERTa-v3)在多个文本环境(ALFWorld、WebShop、ScienceWorld)中实现样本高效的动作选择,发现重平衡联合训练显著提升性能,跨环境适应仅需9.2%目标域数据即可恢复93%全数据性能,数据多样性是主要驱动力。

Comments 11 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01839 2026-06-02 cs.DC cs.AR cs.LG 70%

Observation, Not Prediction: Conversation-Level Disaggregated Scheduling for Agentic Serving

观察而非预测:面向智能体服务的对话级解耦调度

Jianru Ding, Ryien Hosseini, Pouya Mahdi Gholami, Mingyuan Xiang, Henry Hoffmann

机构 * Anonymous Authors(匿名作者)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出将调度单元从单轮提升至整个对话,利用对话中首轮计算密集与后续内存密集的两阶段可观察特性,实现无需预测的解耦调度,显著降低延迟并提升能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01282 2026-06-02 cs.CV cs.CY cs.LG 70%

KG-FairDiff: Knowledge Graph-Guided Prompt Refinement for Demographically Fair Text-to-Image Generation

KG-FairDiff: 知识图谱引导的提示词精炼用于人口统计公平的文本到图像生成

Farbod Davoodi, Seyed Reza Tavakoli Shiyadeh, Pooria Safaei, Sana Harighi, Parsa Gholami, Amirali Amini, Kimia Vanaei, Emad Firoozi, Parham Abed Azad, Babak Khalaj, Siavash Ahmadi, Amir Hossein Payberah, Mohammad Hossein Rohban, Soheil Kolouri, Ali Diba

机构 * University of Science and Technology of China(中国科学技术大学) Sharif University of Technology(谢赫·伊斯兰大学) Iran University of Science and Technology(伊朗科学技术大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出KG-FairDiff框架,通过知识图谱引导的提示词精炼,在推理时优化公平性损失,减少文本到图像生成中的性别、种族、年龄等人口统计偏差,同时保持语义保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00746 2026-06-02 cs.CV cs.LG 70%

Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders

将并行序列模型扩展到基础规模的视觉编码器

Yitong Jiang, Hongjun Wang, Collin McCarthy, Hanrong Ye, David Wehr, Xinhao Li, Qi Dou, Tianfan Xue, Ka Chun Cheung, Simon See, Wonmin Byeon, Ke Chen, Kai Han, Jinwei Gu, Hongxu Yin, Pavlo Molchanov, Jan Kautz, Sifei Liu

机构 * NVIDIA The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 效率与部署 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 提出C-GSPN,一种基于2D空间传播的基础规模视觉编码器,通过快速CUDA内核、压缩潜在空间传播块和两阶段交叉算子蒸馏,在减少参数的同时提升性能并实现高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00739 2026-06-02 cs.LG 70%

Score $\times$ Decoder: A Unified View of Unsupervised Inference-Time Scaling for Hallucination Mitigation

Score × Decoder:无监督推理时缩放缓解幻觉的统一视角

Yun-Chen Cheng, Che-Yu Lin, Cheng-Lin Yang

机构 * CyCraft AI Lab, Taiwan(CyCraft人工智能实验室,台湾)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Score×Decoder框架,通过配对四种内在分数(困惑度、对比度、幂分布似然、自验证)与三种解码族(优化、采样、共识),在无监督条件下选择最佳组合以缓解大语言模型幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00735 2026-06-02 cs.DC cs.LG 70%

ViBE: Co-Optimizing Workload Skew and Hardware Variability for MoE Serving

ViBE: 针对MoE服务的工作负载偏斜与硬件变异性协同优化

Seokjin Go, Marko Scrbak, Ephrem Wu, Srilatha Manne, Divya Mahajan

机构 * Georgia Institute of Technology(佐治亚理工学院) Advanced Micro Devices, Inc.(先进微器件公司)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出ViBE框架,通过感知硬件的专家放置方法,结合GPU性能建模与专家激活分析,最小化分布式MoE推理中的执行时间不平衡,显著提升SLO达标率并降低P90 TTFT。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00611 2026-06-02 cs.AI 70%

TRACE: Trajectory Risk-Aware Compression for Long-Horizon Agent Safety

TRACE: 面向长程智能体安全的轨迹风险感知压缩

Zhepei Hong, Lin Wang, Liting Li, Haokai Ma, Junfeng Fang, Fei Shen, Dan Zhang, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) South China Normal University(华南师范大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出轨迹风险感知压缩方法TRACE,通过压缩器-阅读器架构将长轨迹压缩为潜在证据状态,以聚合稀疏风险信号并提升长程安全检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00442 2026-06-02 cs.LG math.OC stat.ML 70%

Exploiting weight-space symmetries for approximating curvature

利用权重空间对称性近似曲率

Artem Artemev, Rui Xia, Benjamin M. Boyd, Youjing Yu, Felix Dangel, Guillaume Hennequin, Alberto Bernacchia

机构 * DeepMind, London, UK(伦敦DeepMind)

专题命中 效率与部署 :language model(abstract);small language model(abstract);分类 cs.LG

AI总结 本文通过解析平均化保持损失不变的群作用,从单个梯度构建结构化的Hessian近似,从而利用权重空间对称性来近似损失函数的曲率。

Comments Published at ICML 2026. 35 pages, 11 figures. Code: https://github.com/mtkresearch/symm_opt

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00432 2026-06-02 cs.LG 70%

Grounded Decoding: Retrieval-Anchored Probability Fusion for Faithful RAG

Grounded Decoding: 面向忠实RAG的检索锚定概率融合

Ibne Farabi Shihab, Fariya Afrin, Sanjeda Akter, Anuj Sharma

机构 * Department of Computer Science, Iowa State University(爱荷华州立大学计算机科学系) Department of Computer Science, Kalinga Institute of Industrial Technology(卡林加工业技术学院计算机科学系) Department of Civil, Construction & Environmental Engineering, Iowa State University(爱荷华州立大学土木、建设与环境工程系)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出Grounded Decoding,一种无需训练的推理时解码框架,通过KL-重心目标融合全RAG分布和仅检索分布,并引入冲突感知自适应加权,以提升RAG的事实一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00424 2026-06-02 cs.AI 70%

Weak Critics Make Strong Learners: On-Policy Critique Distillation for Scalable Oversight

弱批评者造就强学习者:用于可扩展监督的在策略批评蒸馏

Can Jin, Jiakang Li, Rui Wu, Eddy Zhang, Dimitris N. Metaxas

机构 * University of Cambridge(剑桥大学) University of California, Berkeley(加州大学伯克利分校) UC Berkeley AI Lab(加州大学伯克利分校人工智能实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出在策略批评蒸馏(OPCD)方法,利用弱模型作为批评者提供修订方向,通过自适应自教师信号蒸馏批评引导的行为,提升强模型在推理和对齐基准上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00062 2026-06-02 cs.CL 70%

Graph-Augmented Retrieval for Cross-Entity Financial Sentiment Analysis: A Comparative Study

跨实体金融情感分析的图增强检索:一项比较研究

Rajan Bastakoti, Sagar Bhetwal, Nirajan Acharya, Gaurav Kumar Gupta

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种两跳图增强检索架构(Graph-RAG),通过构建情感加权知识图谱并融合密度检索与图遍历,相比标准向量检索在跨实体金融情感分析中显著提升实体召回率和复杂查询答案相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26444 2026-06-02 cs.CL 70%

NanoSpec: Accelerating Speculative Decoding using Minimalist In-Context Vocabularies

NanoSpec: 利用极简上下文词汇表加速推测解码

Zhiyang Chen, Daliang Xu, Yinyuan Zhang, Chenghua Wang, Mengwei Xu, Yun Ma

机构 * Institute for Artificial Intelligence, Peking University, Beijing, China(北京大学人工智能研究院) Key Laboratory of High Confidence Software Technologies (Peking University), Ministry of Education(教育部高可信软件技术重点实验室) School of Computer Science, Peking University, Beijing, China(北京大学计算机学院) State Key Laboratory of Networking(网络与交换技术国家重点实验室) School of Computer Science, Beijing University of Posts(北京邮电大学计算机学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出NanoSpec,一种无需训练的方法,通过动态构建极简上下文感知词汇表(平均<3k tokens),结合系统-算法协同设计,将推测解码的草稿生成时间平均减少51.6%,实现端到端加速1.17-1.29倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28768 2026-06-02 cs.DC cs.LG 70%

CRAFT: Fine-Grained Cost-Aware Expert Replication For Efficient Mixture-of-Experts Serving

CRAFT:面向高效混合专家服务的细粒度成本感知专家复制

Adrian Zhao, Zhenkun Cai, Zhenyu Song, Lingfan Yu, Haozheng Fan, Jun Wu, Yida Wang, Nandita Vijaykumar

机构 * NVIDIA Corporation(英伟达公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出CRAFT框架,通过基于估计收益的细粒度逐层复制,在给定内存预算下最大化负载均衡,无需额外训练即可提升大规模MoE服务吞吐量。

Comments 22 pages, 15 figures

Journal ref Proceedings of the Ninth Conference on Machine Learning and Systems (MLSys 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06199 2026-06-02 eess.AS cs.AI cs.SD 70%

FastSLM: Hierarchical Temporal Abstraction for Efficient Long-Form Speech Adaptation

FastSLM:用于高效长语音自适应的层次时间抽象

Junseok Lee, Sangyong Lee, Chang-Jae Chun

机构 * OKESTRO Sejong University(世宗大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对长语音输入中标记爆炸问题,提出FastSLM架构,通过层次时间抽象器(HTA)实现每秒1.67个标记的极端压缩率(减少97%),在显著降低计算量和参数的同时,在长语音基准上达到与最先进模型竞争的性能。

Comments Title updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18115 2026-06-02 cs.LG cs.DS math.OC 70%

Robust Learning of a Group DRO Neuron

群体分布鲁棒优化神经元的鲁棒学习

Guyang Cao, Shuyao Li, Sushrut Karmalkar, Jelena Diakonikolas

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Microsoft Research, Cambridge(微软研究院,剑桥)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 针对任意标签噪声和群体级分布偏移,提出一种计算高效的原对偶算法,学习一个单神经元,使其在最小化最坏情况群体加权损失时达到常数因子竞争比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06906 2026-06-02 cs.SE cs.CR cs.DB cs.LG 70%

MINES: Explainable Anomaly Detection through Web API Invariant Inference

MINES:通过Web API不变式推断实现可解释的异常检测

Wenjie Zhang, Yun Lin, Chun Fung Amos Kwok, Xiwen Teoh, Xiaofei Xie, Frank Liauw, Hongyu Zhang, Jin Song Dong

机构 * National University of Singapore(国立新加坡大学) Shanghai Jiao Tong University(上海交通大学) Singapore Management University(新加坡管理学院) GovTech Singapore(新加坡政府科技局) Chongqing University(重庆大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出MINES方法,通过从模式级别推断可解释的API不变式来检测Web应用异常,显著降低误报率并提高召回率。

Comments Accepted by ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12354 2026-06-02 cs.IR 67%

An Industrial-Scale Sequential Recommender for LinkedIn Feed Ranking

用于领英信息流排序的工业级序列推荐系统

Lars Hertel, Gaurav Srivastava, Syed Ali Naqvi, Satyam Kumar, Yue Zhang, Borja Ocejo, Benjamin Zelditch, Adrian Englhardt, Hailing Cheng, Andy Hu, Antonio Alonso, Daming Li, Siddharth Dangi, Chen Zhu, Mingzhou Zhou, Wanning Li, Tao Huang, Fedor Borisyuk, Ganesh Parameswaran, Birjodh Singh Tiwana, Sriram Sankar, Qing Lan, Julie Choi, Souvik Ghosh

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 提出基于Transformer的序列排序模型Feed SR,在满足严格生产约束下替代DCNv2排序器,在12亿成员规模上部署,在线A/B测试显著提升用户参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00991 2026-06-02 cs.DC 67%

An Efficient, Reliable and Observable Collective Communication Library in Large-scale GPU Training Clusters

大规模GPU训练集群中高效、可靠且可观测的集合通信库

Mingjun Zhang, Xiaohe Hu, Menghao Zhang, Ziteng Chen, Yanmin Jia, Yan Zhang, Da Liu, Qing Chen, Fangzheng Jiao, Jun Chen, He Liu, Aohan Zeng, Shuaixing Duan, Ruya Gu, Yang Jing, Bowen Han, Wei Chen, Wenqi Xie, Jinlong Hou, Yuan Cheng, Hongzhou Zhang, Bohua Xu, Mingwei Xu, Chunming Hu

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 针对NCCL在SM竞争、链路故障重启成本高和瞬态异常可观测性不足的问题,提出VCCL,通过将节点内数据传输和流依赖强制转移到CPU线程和GPU拷贝引擎、主备QP机制以及窗口监控器,实现高效、可靠和可观测的集合通信,提升训练吞吐量并减少GPU资源浪费。

Comments 19 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02483 2026-06-02 cs.CR cs.AI cs.CL 62%

Ghost Tool Calls: Issue-Time Privacy for Speculative Agent Tools

幽灵工具调用:投机性智能体工具的发布时隐私保护

Bardia Mohammadi, Lars Klein, Akhil Arora, Laurent Bindschaedler

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) EPFL(苏黎世联邦理工学院) Aarhus University(阿arhus大学)

专题命中 效率与部署 :language agent(abstract);分类 cs.CL、cs.AI

AI总结 针对工具增强型语言智能体投机性预发调用泄露用户意图的问题,提出投机性工具隐私契约,在发布时而非提交后保护隐私。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01503 2026-06-02 cs.CV cs.AI cs.CL 62%

On the Limits of Token Reduction for Efficient Unified Vision Language Training

论高效统一视觉语言训练中令牌缩减的极限

Siyi Chen, Weiming Zhuang, Jingtao Li, Lingjuan Lv

机构 * University of Michigan(密歇根大学) Sony AI(索尼人工智能)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过分析层注意力分配,发现视觉理解与视觉生成在令牌冗余上存在不对称性,设计任务特定加速器,但统一训练中任务特定令牌丢弃导致协同损失,表明高效统一建模需保留共享跨任务结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01039 2026-06-02 cs.LG cs.AI 62%

OPD+: Rethinking the Advantage Design for On-Policy Distillation

OPD+: 重新思考在线策略蒸馏中的优势设计

Hanyang Zhao, Haoxian Chen, Han Lin, Genta Indra Winata, David Yao, Wenpin Tang

机构 * Columbia University(哥伦比亚大学) Amazon(亚马逊) Meta Capital One

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OPD+,通过修正在线策略蒸馏中因停止梯度操作导致的奖励目标偏差,并支持多种f-散度,在数学推理和工具使用基准上提升了性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25143 2026-06-02 cs.AI cs.LG 62%

Beyond the Frontier: Stochastic Backtracking for Efficient Test-Time Scaling

超越前沿:用于高效测试时扩展的随机回溯

Dao Tran, Duc Anh Le, Ngoc Luu, Quan Pham, Tung Pham, Hung Bui

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出随机回溯方法,通过维护历史前缀池并利用子池选择和幂回溯序列蒙特卡洛机制,在测试时扩展中实现更高的准确率-令牌数权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19496 2026-06-02 cs.CV cs.AI cs.LG 62%

CARES: Context-Aware Resolution Selector for VLMs

CARES: 面向视觉语言模型的上下文感知分辨率选择器

Moshe Kimhi, Nimrod Shabtay, Raja Giryes, Chaim Baskin, Eli Schwartz

机构 * Technion(技术ion大学) IBM Research(IBM研究院) Tel-Aviv University(特拉维夫大学) Ben-Gurion University(本· Gurion大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出CARES轻量级预处理模块,通过紧凑型VLM预测图像-查询对的最小足够分辨率,在保持任务性能的同时最多减少80%计算量。

Comments Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) Accepted to ACL 2026 (Oral presentation). Code available at https://github.com/mkimhi/CARES

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19919 2026-06-02 cs.CL cs.AI cs.SD 62%

ASKD-Whisper: Adaptive Self-knowledge Distillation for Efficient and Low-Latency Automatic Speech Recognition

ASKD-Whisper: 自适应自知识蒸馏用于高效低延迟自动语音识别

Junseok Lee, Nahun Kim, Sangyong Lee, Chang-Jae Chun

机构 * OKESTRO Co., Ltd(OKESTRO公司) Sejong University(世宗大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.CL、cs.AI

AI总结 提出自适应自知识蒸馏(ASKD)动态课程框架,通过逐步减少对教师模型的依赖并引入自知识蒸馏阶段,在压缩Whisper模型时实现5倍推理加速和1.07%词错误率降低。

Comments Title and content have been updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10982 2026-06-02 cs.LG cs.AI 62%

Catch-Only-One: Non-Transferable Examples for Model-Specific Authorization

仅捕获一个:用于模型特定授权的不可迁移样本

Zihan Wang, Zhiyong Ma, Zhongkui Ma, Shuofeng Liu, Akide Liu, Derui Wang, Minhui Xue, Guangdong Bai

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出不可迁移样本(NTEs),通过将数据编码为仅能被指定模型解码的“密文”,在无需训练的情况下利用模型特定低敏感子空间实现授权模型保真度与未授权模型性能退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02142 2026-06-02 cs.LG cs.DB 57%

TimeBlocks: Foundational and Continual Time-Series Blockbase -- Extended Version

TimeBlocks: 基础与持续时间序列块库——扩展版本

David Campos, Bin Yang, Tung Kieu, Lei Chen, Chenjuan Guo, Christian S. Jensen

机构 * Aalborg University, Denmark(奥尔堡大学,丹麦) University of Amsterdam Netherlands(阿姆斯特丹大学,荷兰) East China Normal University China(华东师范大学,中国) Aalborg University Denmark(奥尔堡大学,丹麦) Hong Kong University of Science(香港科学大学)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 提出TimeBlocks方法,通过可互换的模块化模型块和路由策略,构建轻量级、多任务的时间序列模型,并引入StreamCore实现持续校准,在多个数据集上优于现有基线。

Comments 15 pages. An extended version of "TimeBlocks: Versatile and Continual Time-Series Blockbase" accepted at SIGKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02068 2026-06-02 cs.CV cs.AI 57%

Fast and Lightweight Novel View Synthesis with Differentiable Multiplane Image

基于可微多平面图像的快速轻量级新视角合成

Kaidi Zhang, Guanxu Zhu

机构 * Universiti Malaya(马来大学) Wuhan University(武汉大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI

AI总结 针对现有方法在速度、模型大小和稀疏视角下的不足,提出基于可微多平面图像(MPI)的快速轻量级新视角合成方法,利用点图进行几何初始化并引入一步扩散处理空洞和伪影。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01813 2026-06-02 cs.CL 57%

Cost-Aware Diffusion Draft Trees for Speculative Decoding

用于推测解码的成本感知扩散草稿树

Shuai Zhang, Huachuan Qiu, Hongliang He, Yong Dai

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 提出CaDDTree方法,通过联合优化树结构和节点预算直接最大化令牌吞吐量,并证明在凸验证成本下吞吐量函数是单峰的,从而无需离线预算搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00390 2026-06-02 cs.CV cs.AI 57%

Zamba2-VL Technical Report

Zamba2-VL 技术报告

Hassan Shapourian, Kasra Hejazi, Olabode M. Sule, Beren Millidge

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Washington(华盛顿大学) University of Toronto(多伦多大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 提出基于混合架构Zamba2的视觉语言模型Zamba2-VL,在图像理解等基准上媲美Transformer模型,且首次令牌延迟降低约一个数量级。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏