arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-19 至 2026-05-19 共收录 717 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 139 篇

2509.23183 2026-05-19 cs.LG cs.NI 70%

ZeroSiam: An Efficient Asymmetry for Test-Time Entropy Optimization without Collapse

ZeroSiam: 一种高效的非对称方法用于测试时熵优化而不发生崩溃

Guohao Chen, Shuaicheng Niu, Deyu Chen, Jiahao Yang, Zitian Zhang, Mingkui Tan, Pengcheng Wu, Zhiqi Shen

机构 * Nanyang Technological University(南洋理工大学) Joint WeBank-NTU Research Institute on Fintech(金融科技联合研究机构) South China University of Technology(华南理工大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出ZeroSiam,一种针对测试时熵最小化的高效非对称架构,通过非对称发散对齐防止崩溃,并通过可学习预测器和stop-gradient操作符有效实现,实验和理论证明其能防止崩溃并正则化偏见学习信号,提升性能,尤其在易崩溃的小模型上表现稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01046 2026-05-19 cs.CL 70%

SEDD: Scalable and Efficient Dataset Deduplication with GPUs

SEDD: 一种基于GPU的可扩展且高效的去重数据集处理方法

Youngjun Son, Chaewon Kim, Jaejin Lee

机构 * Graduate School of Data Science(数据科学研究生院) Department of Computer Science(计算机科学系) Seoul National University(首尔国立大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SEDD,一种基于GPU的高效去重框架,通过引入计算高效且部分可重用的哈希函数、高度优化的GPU内核和硬件感知的自动参数选择机制,显著减少了通信瓶颈,提升了去重效率,同时保持了高去重精度。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18104 2026-05-19 cs.AI cs.CR 70%

Safety Geometry Collapse in Multimodal LLMs and Adaptive Drift Correction

多模态大语言模型中的安全几何坍缩与自适应漂移修正

Jiahe Guo, Xiangran Guo, Jiaxuan Chen, Weixiang Zhao, Yanyan Zhao, Yutai Hou, Qianchao Wang, Dandan Tu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了多模态大语言模型在跨模态安全转移中的不足,提出安全几何坍缩现象,并通过自适应漂移修正方法提升模型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17978 2026-05-19 cs.CL 70%

AutoVecCoder: Teaching LLMs to Generate Explicitly Vectorized Code

AutoVecCoder: 教授大语言模型生成显式向量化代码

Shangzhan Li, Xinyu Yin, Xuanyu Jin, Ye He, Yuxin Zhou, Yuxuan Li, Xu Han, Wanxiang Che, Qi Shi, Ting Liu, Maosong Sun

机构 * Harbin Institute of Technology(哈尔滨工业大学) Xiamen University(厦门大学) Tsinghua University(清华大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出AutoVecCoder框架,通过VecPrompt和VecRL组件,使大语言模型能够自动进行显式向量化,从而在SimdBench的SSE和AVX子集上达到最先进的性能,超越传统自动向量化的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17710 2026-05-19 cs.CL eess.AS 70%

Sometin Beta Pass Notin (SBPN): Improving Multilingual ASR for Nigerian Languages via Knowledge Distillation

Sometin Beta Pass Notin (SBPN): 通过知识蒸馏改进尼日利亚语言的多语言语音识别

Sewade Ogun

机构 * Nigerian Languages(尼日利亚语言)

专题命中 效率与部署 :language model(abstract);foundation model(abstract);分类 cs.CL

AI总结 本文提出SBPN模型,通过两阶段知识蒸馏方法提升尼日利亚多种语言的语音识别性能,显著降低词错误率并优于现有多语言模型。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17410 2026-05-19 cs.AI 70%

Computational Challenges in Token Economics: Bridging Economic Theory and AI System Design

令牌经济学中的计算挑战:连接经济理论与AI系统设计

Ou Wu, Yingjun Deng

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) Hefei Institutes of Physical Science, Chinese Academy of Sciences(中国科学院合肥物理研究所)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了在大规模语言模型系统中,将令牌作为经济原语时所面临的计算挑战,提出了计算令牌经济学的概念和令牌经济学三元论,旨在建立连接令牌经济学与AI系统设计的研究议程。

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17170 2026-05-19 cs.LG 70%

TriAxialKV: Toward Extreme Low-Precision KV-Cache Quantization for Agentic Inference Tasks

TriAxialKV: 向极低精度KV缓存量化迈进以应对代理推理任务

Hanzhang Shen, Haoran Wu, Yiren Zhao, Robert Mullins

机构 * University of Cambridge(剑桥大学) Imperial College London(伦敦帝国学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出TriAxialKV,一种混合精度的KV缓存量化方案,通过为每个token分配三轴标签,校准每种标签的敏感性,并在固定内存预算下分配INT2/INT4位宽,以提高代理推理任务的效率和吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16941 2026-05-19 cs.CL 70%

Roll Out and Roll Back: Diffusion LLMs are Their Own Efficiency Teachers

展开与回退:扩散大语言模型是它们自己的效率教师

Fanqin Zeng, Feng Hong, Geng Yu, Huangjie Zheng, Xiaofeng Cao, Ya Zhang, Bo Han, Yanfeng Wang, Jiangchao Yao

机构 * Shanghai Jiao Tong University(上海交通大学) Apple MLR Tongji University(同济大学) Hong Kong Baptist University(香港 Baptist 大学) RIKEN(日本理化学研究所)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种基于可撤销解码的扩散大语言模型(DLLM)方法,通过发现可靠的去噪顺序来提升生成质量和效率,WINO和WINO+在多个数据集上展示了显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16757 2026-05-19 cs.AI cs.MA stat.ME stat.ML 70%

NeuroMAS: Multi-Agent Systems as Neural Networks with Joint Reinforcement Learning

NeuroMAS: 多智能体系统作为神经网络的多智能体系统

Haoran Lu, Luyang Fang, Wenxuan Zhong, Ping Ma

机构 * Department of Statistics(统计系) University of Georgia(佐治亚大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出NeuroMAS,一种将多智能体系统视为可训练和可扩展的神经网络架构的方法,通过联合强化学习提升多智能体系统的性能和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16612 2026-05-19 cs.AI cond-mat.mtrl-sci 70%

PRISMat: Policy-Driven, Permutation-Invariant Autoregressive Material Generation

PRISMat:基于策略的、排列不变的自回归材料生成

Claire Schlesinger, Circe Hsu, Peter Schindler, Robin Walters

机构 * Khoury College of Computer Sciences(科里学院计算机科学学院) Northeastern University(东北大学) College of Engineering(工程学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PRISMat通过高效生成晶体片层,提升了材料发现的准确性,其在切开能和工作函数任务中的均绝对误差显著降低。

Comments 10 pages, 8 figures, Under Review at Neurips 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16419 2026-05-19 cs.CV cs.AI cs.RO 70%

Agentic Pipeline for Self-Synchronized Multiview Joint Angle Monitoring in Uncalibrated Environments

基于代理的自同步多视角关节角度监控管道:在无标定环境中

Juncheng Yu, Lusi A, Haoxuan Xie, Weiming Wang

机构 * National Engineering Research Center of Neuromodulation, School of Aerospace Engineering, Tsinghua University(神经调制国家工程研究中心,航空航天工程学院,清华大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于代理的自同步多视角关节角度监控方法,利用两台摄像头在无标定环境下实现自动视频同步和自验证,通过多模态大语言模型和先进单目2D姿态估计模型提取候选姿态,并通过代理选择机制自动识别和跟踪目标个体,以在多人和遮挡情况下产生一致的2D姿态,从而估计关节角度。

Comments Accepted by EMBC 2026. 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23230 2026-05-19 econ.GN q-fin.EC 67%

Digital Transformation and the Restructuring of Employment: Evidence from Chinese Listed Firms

数字化转型与就业重构:来自中国上市公司企业的证据

Yubo Cheng

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文研究数字化转型如何重塑中国上市公司企业的就业结构,重点分析职业功能和任务强度。通过ISCO-08和2022年中国职业标准分类的数据,将职位分为五个功能组:管理、专业、技术、辅助和体力。基于任务框架,通过职位描述的关键词分析构建常规、抽象和体力任务强度指数。研究发现数字化与管理、专业和技术岗位的招聘增加有关,并减少了辅助和体力劳动的需求。在任务层面,抽象任务需求上升,而常规和体力任务下降。调节分析将这些变化与管理效率和高管薪酬的提升联系起来。研究结果突显了大型语言模型等新兴技术如何重塑中国企业部门的技能需求和劳动力动态。

Comments This article is withdrawn due to critical errors in empirical analysis (panel data processing and core indicator calculation), which affect main conclusion accuracy. To avoid misleading readers, we withdraw it temporarily and will resubmit the revised version after verification.

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17365 2026-05-19 cs.CV 67%

Memory-Augmented Query Intent Understanding for Efficient Chat-based Image Retrieval

基于记忆的查询意图理解用于高效的基于聊天的图像检索

Xianke Chen, Daizong Liu, Yushuo Lou, Xin Tan, Xun Yang, Shuhui Wang, Xun Wang, Jianfeng Dong

机构 * School of Computer Science and Technology, and the School of Statistics and Mathematics, Zhejiang Gongshang University(计算机科学与技术学院,和统计与数学学院,浙江工商大学) School of Computer Science and Technology, Zhejiang Gongshang University, and the Zhejiang Key Laboratory of Big Data and Future E-Commerce Technology(计算机科学与技术学院,浙江工商大学,和大数据与未来电子商务技术浙江省重点实验室) Wangxuan Institute of Computer Technology, Peking University(王璇计算机技术研究所,北京大学) School of Information and Electronic Engineering, Zhejiang Gongshang University(信息与电子工程学院,浙江工商大学) School of Computer Science and Technology, East China Normal University(计算机科学与技术学院,华东师范大学) Key Laboratory of Intelligent Information Processing of Chinese Academy of Sciences , Institute of Computing Technology, CAS(中国科学院智能信息处理重点实验室,计算技术研究所,中国科学院) School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出了一种高效的基于聊天的图像检索任务中的记忆增强查询意图理解框架MAQIU,通过动态聚合和演化查询意图的语义表示,防止意图遗忘并增强长期语义完整性,从而在保持高计算效率的同时实现显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16849 2026-05-19 cs.NI 67%

SpaceMoE: Towards Orbital General Intelligence with Distributed Mixture-of-Experts Inference

SpaceMoE:迈向轨道通用智能的分布式专家混合推理

Qian Chen, Xianhao Chen, Min Sheng, Kaibin Huang

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文探讨了在卫星网络中实现分布式混合专家推理的SpaceMoE新范式,针对专家放置、选择和隐藏状态传输等关键设计问题,提出了适应卫星特性的解决方案,以实现高效可持续的轨道通用智能。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16091 2026-05-19 cs.CL cs.AI 66%

CounterRefine: Answer-Conditioned Counterevidence Retrieval for Inference-Time Knowledge Repair in Factual Question Answering

CounterRefine:用于事实问答中推理时知识修复的答案条件计数证据检索

Tianyi Huang, Ying Kai Deng

机构 * Ryquo App-In Club

专题命中 效率与部署 :foundation model(abstract,comments);分类 cs.CL、cs.AI

AI总结 CounterRefine通过在推理时检索特定证据并进行约束性修正,提升事实问答的准确性,实验表明其在多个基准测试中有效改进了基础模型的表现。

Comments Accepted at the 4th Workshop on Towards Knowledgeable Foundation Models at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18387 2026-05-19 cs.LG cs.AI 62%

Graph Hierarchical Recurrence for Long-Range Generalization

图层次递归用于长距离泛化

Stefano Carotti, Marco Pacini, Alessio Gravina, Davide Bacciu, Bruno Lepri, Sebastiano Bontorin

机构 * Department of Computer Science, University of Trento(特伦托大学计算机科学系) Fondazione Bruno Kessler(布鲁诺·克谢勒基金会) Department of Computer Science, University of Pisa(帕尔马大学计算机科学系)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种名为图层次递归(GHR)的新框架,通过在输入图和通过池化获得的层次抽象上联合操作,解决了图神经网络和图转换器在长距离相关性捕捉任务中的限制,并在多个长距离基准测试中表现出色,参数效率高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18012 2026-05-19 cs.CV cs.AI cs.LG 62%

SAS: Semantic-aware Sampling for Generative Dataset Distillation

SAS: 语义感知的生成数据集蒸馏

Mingzhuo Li, Guang Li, Linfeng Ye, Jiafeng Mao, Takahiro Ogawa, Konstantinos N. Plataniotis, Miki Haseyama

机构 * Hokkaido University(北海道大学) University of Toronto(多伦多大学) The University of Tokyo(东京大学)

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种语义感知的数据集蒸馏方法,通过利用CLIP作为语义先验,设计三个语义评分函数来量化类别相关性、类别间分离性和集合内多样性,从而生成紧凑且语义区分度高的数据集。

Comments Published as a journal paper in IEEE OJSP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17899 2026-05-19 cs.LG cs.AI q-bio.QM 62%

DCFold: Efficient Protein Structure Generation with Single Forward Pass

DCFold: 通过单次前向传递高效生成蛋白质结构

Zhe Zhang, Yuanning Feng, Yuxuan Song, Keyue Qiu, Hao Zhou, Wei-Ying Ma

机构 * Institute for AI Industry Research (AIR)(人工智能产业研究院) Department of Computer Science and Technology(计算机科学与技术系) School of Computer Science and Technology(计算机科学与技术学院) ByteDance Seed(字节跳动种子)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DCFold,一种单步生成模型,实现了与AlphaFold3同等的精度,通过双一致性训练框架和新的时间测地匹配(TGM)调度器,在保持预测保真度的同时将推理速度提升15倍,验证了其在结构预测和结合设计基准上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09450 2026-05-19 cs.LG cs.AI eess.IV 62%

ECHO: Efficient Chest X-ray Report Generation with One-step Block Diffusion

ECHO: 通过一步块扩散实现高效的胸部X光报告生成

Lifeng Chen, Tianqi You, Hao Liu, Zhimin Bao, Jile Jiao, Xiao Han, Zhicai Ou, Tao Sun, Xiaofeng Mou, Xiaojie Jin, Yi Xu

机构 * Beijing Jiaotong University(北京交通大学) Dalian University of Technology(大连理工大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ECHO,一种基于扩散模型的高效视觉-语言模型,用于生成胸部X光报告,通过一步块扩散和响应不对称扩散策略,显著提高了生成效率和文本连贯性,同时在临床准确性上保持良好表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04941 2026-05-19 cs.LG cs.AI 62%

TOAST: Transformer Optimization using Adaptive and Simple Transformations

TOAST: 使用自适应和简单变换的Transformer优化

Irene Cannistraci, Simone Antonelli, Emanuele Palumbo, Thomas M. Sutter, Emanuele Rodolà, Bastian Rieck, Julia E. Vogt

机构 * Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) CISPA Helmholtz Center for Information Security(信息安全赫尔姆霍兹中心) Sapienza University of Rome(罗马大学萨皮恩扎大学) University of Fribourg(弗里堡大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TOAST框架,通过利用Transformer内部的冗余性,用轻量级闭式映射(如线性变换或身份函数)近似整个Transformer块,从而在不额外训练的情况下减少参数和计算量,同时保持甚至提升下游性能。

Comments 33 pages, 16 figures, 22 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17144 2026-05-19 cs.RO cs.AI cs.LG 62%

Contrastive Conceptor Activation Steering (COAST): Unlocking Vision-Language-Action Models through Hidden States

对比性概念激活引导(COAST):通过隐藏状态解锁视觉-语言-动作模型

Miranda Muqing Miao, Subin Kim, Brandon Yang, Lyle Ungar

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出COAST方法,通过识别成功子空间来提升视觉-语言-动作模型在机器人任务中的性能,其核心方法是利用概念投射来引导模型向成功分布发展,从而提高任务成功率。

Comments Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05993 2026-05-19 cs.LG cs.AI 62%

Diamond Maps: Efficient Reward Alignment via Stochastic Flow Maps

钻石映射:通过随机流映射实现高效的奖励对齐

Peter Holderrieth, Douglas Chen, Luca Eyring, Ishin Shah, Giri Anantharaman, Yutong He, Zeynep Akata, Tommi Jaakkola, Nicholas Matthew Boffi, Max Simchowitz

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出钻石映射,一种通过随机流映射实现高效奖励对齐的生成模型,能够在推理时对任意奖励进行准确对齐,提升模型适应性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23752 2026-05-19 cs.LG cs.AI 62%

Geometric Scaling of Bayesian Inference in LLMs

贝叶斯推断在大语言模型中的几何特性

Naman Agarwal, Siddhartha R. Dalal, Vishal Misra

机构 * Columbia University(哥伦比亚大学) Columbia University School of Professional Studies(哥伦比亚大学专业研究学院) Department of Statistics(统计学系) Columbia University Department of Computer Science(哥伦比亚大学计算机科学系)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究发现大语言模型中存在几何结构,用于编码后验结构,通过干预实验表明该结构是不确定性的重要读取而非单一计算瓶颈。

Comments v2: Extend cross-architecture analysis with Qwen2.5 and DeepSeek (MLA) families; add SULA and RoPE-channel results; document MLA boundary case (DeepSeek-V2-Lite: substrate preserved, dynamic routing absent); add dual-entropy framework at scale; fix duplicate bibliography entries

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18109 2026-05-19 cs.AI cs.CV cs.RO 57%

TaskGround: Structured Executable Task Inference for Full-Scene Household Reasoning

TaskGround:全场景家庭推理的结构化可执行任务推断

ZhiYuan Feng, Yu Deng, Ruichuan An, Zhenhua Liu, Qixiu Li, Keming Wu, Zhiying Du, Weijie Wang, Haoxiao Wang, Shuang Chen, Sicheng Xu, Yaobo Liang, Jiaolong Yang, Baining Guo

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院) Peking University(北京大学) Fudan University(复旦大学) Zhejiang University(浙江大学)

专题命中 效率与部署 :prompting(abstract);分类 cs.AI

AI总结 本文提出TaskGround框架,通过结构化任务推断提升全场景家庭推理能力,其核心贡献是引入FullHome评估套件,验证了在家庭场景中执行任务结构推断的重要性,并展示了紧凑本地模型在实际家庭部署中的有效性。

Comments Project page: https://aaronfengzy.github.io/TaskGround/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18013 2026-05-19 cs.CV cs.AI 57%

TinySAM 2: Extreme Memory Compression for Efficient Track Anything Model

TinySAM 2: 极端内存压缩用于高效的跟踪任何模型

Zhaoyuan Ding, Yijing Yang, Han Shu, Xinghao Chen

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI

AI总结 本文提出TinySAM 2,一种轻量级视频分割模型,通过引入内存质量管理机制和联合空间-时间令牌压缩,有效降低了内存存储和计算成本,实现了在DAVIS和SA-V等挑战性数据集上达到SAM 2.1 90%性能,仅使用7%内存令牌和3%训练数据。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17991 2026-05-19 cs.SD cs.AI 57%

Stable Audio 3

稳定音频3

Zach Evans, Julian D. Parker, Matthew Rice, CJ Carr, Zack Zukowski, Josiah Taylor, Jordi Pons

专题命中 效率与部署 :post-training(abstract);分类 cs.AI

AI总结 稳定音频3提出了一种快速的潜在扩散模型家族,用于可变长度音频生成和编辑,通过高效的潜在空间生成和对抗训练提升了生成质量和效率。

Comments Training code: https://github.com/Stability-AI/stable-audio-tools Inference and weights: http://github.com/Stability-AI/stable-audio-3

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17762 2026-05-19 cs.AI 57%

Surface-Form Neural Sparse Retrieval: Robust Fuzzy Matching for Industrial Music Search

表面形式神经稀疏检索:面向工业音乐搜索的鲁棒模糊匹配

Paul Greyson, Zhichao Geng, Wei Zhang, Yang Yang

机构 * Amazon(亚马逊)

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI

AI总结 本文提出了一种鲁棒的神经稀疏检索系统,通过改进的稀疏检索架构和领域特定的子词分词策略,提升了工业音乐搜索中对拼写错误、转置和发音变异的鲁棒性,实现了更高的召回率和更低的延迟。

Comments accepted at SIGIR 2026 industry track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17610 2026-05-19 cs.CV cs.CL 57%

SafeLens: Deliberate and Efficient Video Guardrails with Fast-and-Slow Screening

SafeLens: 一种高效且可靠的视频护栏系统,采用快速和缓慢筛查

Shahriar Kabir Nahin, Hadi Askari, Muhao Chen, Anshuman Chhabra

机构 * University of South Florida(佛罗里达州立大学) University of California, Davis(加州大学戴维斯分校)

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 本研究提出SafeLens视频护栏框架,通过快速和缓慢的推理架构实现高效的视频内容审核,同时构建高质量数据集并采用结构化Chain-of-Thought追踪来解决训练时间扩展的限制,从而在实际和AI生成视频基准测试中取得最佳性能,同时显著降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17447 2026-05-19 cs.CV cs.CL 57%

FastOCR: Dynamic Visual Fixation via KV Cache Pruning for Efficient Document Parsing

FastOCR: 通过KV缓存剪枝实现高效的动态视觉聚焦文档解析

Zihan Tang, Leqi Shen, Hui Chen, Ao Wang, Ben Wan, Yan Feng, Ke Zhang, Sicheng Zhao, Tongxuan Liu, Guiguang Ding

机构 * Tsinghua University(清华大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 本文提出FastOCR,一种无需训练的框架,通过动态视觉聚焦技术解决文档解析中的高效KV缓存剪枝问题,显著提升处理速度和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11089 2026-05-19 stat.ML cs.LG 57%

TPV: Parameter Perturbations Through the Lens of Test Prediction Variance

TPV:通过测试预测方差的透镜进行参数扰动分析

Devansh Arpit

机构 * Modelable AI(可建模人工智能)

专题命中 效率与部署 :post-training(abstract);分类 cs.LG

AI总结 本文引入测试预测方差(TPV)作为分析训练后鲁棒性的统一框架,通过研究参数扰动对模型输出的一阶敏感性,揭示了SGD噪声、标签噪声、量化和剪枝等机制的统一视角,并提出了基于TPV的剪枝准则和模型选择方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏