arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1933 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1933 篇

2607.04665 2026-07-07 cs.CV 新提交 67%

DiCE-CIR: Direct Composition Learning for Efficient Zero-Shot Composed Image Retrieval

DiCE-CIR:用于高效零样本合成图像检索的直接合成学习

Gwang-Ho Na, Ho-Joong Kim, Seong-Whan Lee

机构 * Institute of Information & Communications Technology Planning & Evaluation (IITP)(信息通信技术规划与评估研究所(IITP)) Department of Artificial Intelligence, Korea University(韩国大学人工智能系)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 研究零样本合成图像检索问题,提出直接合成学习方法DiCE-CIR,直接组合参考图像和编辑文本预测合成查询表示,用大语言模型自动构建训练样本,训练轻量级模块,实验表明其性能优且效率高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03688 2026-07-07 cs.CR 新提交 67%

PathMark: Protecting Intellectual Property of Mixture-of-Expert LLMs via Path Watermarks

PathMark:通过路径水印保护混合专家语言模型的知识产权

Yudong Gao, Qingyue Wang, Yuanyuan Yuan, Ruixuan Huang, Linghan Chen, Zimo Ji, Shuai Wang

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 针对混合专家(MoE)架构中传统水印方案失效的问题,提出PathMark框架,通过主动控制路由作为隐蔽水印通道,利用多种机制解决脆弱决策边界和路由纠缠问题,实现高验证准确率和强鲁棒性。

Comments 20 pages, accepted by CCS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03011 2026-07-07 cs.LG cs.AI cs.CL 新提交 67%

Can Model Merging Improve Aggregation in DiLoCo?

模型合并能否改善分布式局部计算优化(DiLoCo)中的聚合?

Stefan Horoi, Benjamin Thérien, Guy Wolf, Eugene Belilovsky

机构 * Université de Montréal(蒙特利尔大学) Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) Concordia University(康考迪亚大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究分布式学习中局部随机梯度下降(SGD)/DiLoCo的伪梯度聚合与模型合并的类比,评估多种模型合并方法,发现Iso-C可改进DiLoCo,在此基础上提出IsoLoCo,实证表明其性能优于DiLoCo。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02925 2026-07-07 cs.DC 新提交 67%

Agentic Orchestration of HPC Applications in Cloud

云中HPC应用程序的智能编排

Vanessa Sochat, Daniel Milroy

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 研究利用智能代理实现HPC应用程序在云环境中实验运行的全生命周期管理,通过四个知名HPC应用构建多平台镜像并优化,展示成功线性缩放等成果及提出最佳实践。

Comments 11 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02781 2026-07-07 cs.LG cs.AI cs.CL 新提交 67%

Safe Inference-Time Alignment via Lagrangian Reward Augmentation

通过拉格朗日奖励增强实现安全推理时对齐

Yaswanth Chittepu, Ativ Joshi, Sohini Chintala, Scott Niekum

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Independent Researcher(独立研究者)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究提出拉格朗日奖励增强框架,从含奖励与成本模型的约束目标出发,经对偶化将问题转化为一维凸问题,校准对偶变量获增强奖励,提升推理时对齐的有益性与无害性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00466 2026-07-03 cs.DC 新提交 67%

ELDR: Expert-Locality-Aware Decode Routing for PD-Disaggregated MoE Serving

ELDR: 面向PD分离MoE服务的专家局部感知解码路由

Sangjin Choi, Sukmin Cho, Yifan Xiong, Ziyue Yang, Youngjin Kwon, Peng Cheng

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 针对PD分离MoE服务中解码负载不均衡导致延迟差异的问题,提出ELDR路由方法,利用预填充专家签名预测解码专家激活,通过平衡K-means分区和局部性感知路由,在vLLM上实现中位TPOT降低5.9-13.9%。

Comments 15 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00387 2026-07-02 eess.AS 新提交 67%

From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning

从目标到应用:对齐音频自监督学习中的架构偏差

Kele Xu, Yulu Fang, Boda Zhou, Yulin Sun, Qisheng Xu, Qiya Song, Jin Zhang, Cheng Yang, Huaimin Wang

专题命中 效率与部署 :language model(abstract);pretraining(abstract)

AI总结 本文通过预训练目标、架构归纳偏差与下游应用的对齐,系统分析音频自监督学习,围绕五种范式讨论不同监督信号对表征的影响,并关联到CNN、RNN、状态空间模型、Transformer及混合架构的偏差,最后解读在语音、环境声、音乐、医学及多模态等领域的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01162 2026-07-02 cs.IR 新提交 67%

Trie-based Experiment Plans for Efficient IR Pipeline Experiments

基于Trie的实验计划用于高效IR流水线实验

Irene Anu, Craig Macdonald

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 提出使用Trie数据结构优化级联检索流水线的对比实验计划,相比线性计划在MSMARCO v2上减少26%实验时间。

Comments Accepted at ReNeuIR'26 workshop, colocated with SIGIR 2026. To appear in CEUR workshop proceedings\ Version 2 fixes the lines involving % operator in Listings 1-3

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01044 2026-07-02 cs.RO 新提交 67%

Robots Ask the Way: Communication-Enabled Social Navigation

机器人问路:支持通信的社交导航

Valentino Sacco, Luca Scofano, Indro Spinelli, Fabio Galasso

机构 * Sapienza University of Rome(罗马大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 提出CommNav任务,让机器人通过主动与居民通信获取信息来定位目标个体,在Habitat 3.0c环境中评估,通信模块使导航成功率提升10个百分点,且对自然语言鲁棒。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00696 2026-07-02 cs.CV 新提交 67%

Imprint: Online Memory Compression for Long-Horizon Egocentric QA

Imprint: 面向长程自我中心问答的在线记忆压缩

Kousik Das, Debaditya Roy

机构 * IIT, Kharagpur(印度理工学院卡哈拉格普尔分校)

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 提出交互中心记忆框架Imprint,将长程自我中心记忆建模为在线压缩问题,利用人类记忆巩固信号选择性保留和压缩交互,在7天基准上提升QA准确率并大幅降低存储和检索开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01208 2026-07-02 cs.CL cs.AI cs.LG 新提交 67%

Distill to Detect: Exposing Stealth Biases in LLMs through Cartridge Distillation

蒸馏检测:通过弹药筒蒸馏揭露大语言模型中的隐蔽偏见

Shayan Talaei, Abhinav Chinta, Devvrit Khatri, Amin Karbasi, Azalia Mirhoseini, Amin Saberi

机构 * Stanford University(斯坦福大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Foundation AI–Cisco Systems Inc.(Foundation AI–思科系统公司)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Distill to Detect (D2D)方法,通过蒸馏模型与基座之间的分布偏移到KV缓存前缀适配器中,放大隐蔽偏见信号至可检测程度,并基于Fisher加权投影理论解释其有效性。

Comments Accepted to the ICML 2026 Workshops on TAIGR, AI4GOOD, Mechanistic Interpretability, and CoLoRAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31982 2026-07-01 cs.CV 新提交 67%

ERA: Entropy-Guided Visual Token Pruning with Rectified Attention for Efficient MLLMs

ERA:基于熵引导的视觉令牌剪枝与修正注意力机制的高效多模态大语言模型

Yuhao Wang, Mu Qiao, Haiwen Diao, Yunzhi Zhuge, Pingping Zhang, Xindong Zhang, Lei Zhang, Huchuan Lu

机构 * School of Future Technology, Dalian University of Technology(大连理工大学未来技术学院) S-Lab, Nanyang Technological University(南洋理工大学S-Lab) OPPO Research Institute(OPPO研究院) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 提出ERA框架,通过熵引导的视觉令牌剪枝和修正注意力机制,解决令牌减少导致的注意力对数坍塌问题,实现高效多模态大语言模型推理加速。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31383 2026-07-01 cs.CV 新提交 67%

MS-Resampler: Multi-Scope Visual Resampling for Efficient Multimodal LLMs

MS-Resampler: 用于高效多模态大语言模型的多范围视觉重采样

Zhongyang Li, Yaqian Li, Faming Fang, Rinyoichi Takezoe, Zi-Hao Bo, Cheng Qian, Mo Guang, Guixu Zhang, Kaiwen Long

机构 * Li Auto Inc.(理想汽车) East China Normal University(华东师范大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 提出MS-Resampler,通过多范围视觉重采样框架,注入显式空间范围先验,使模型在固定令牌预算内同时捕获局部细节和全局上下文,提升多模态理解与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31202 2026-07-01 cs.GT 新提交 67%

Incentivizing Data Trading via Profit Reallocation

通过利润再分配激励数据交易

Yunxuan Ma, Wu Xin, Jichen Li, Hongyin Chen, Xiaoqi Dong, Yusen Zheng, Yukun Cheng, Xiaotie Deng

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 针对数据交易中缺乏经济激励的问题,提出基于链式交易模型和利润再分配机制,通过算法计算序贯均衡,理论证明和实验表明该机制能扩大交易量并提升社会福利。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27313 2026-07-01 cs.CV 新提交 67%

ViQ: Text-Aligned Visual Quantized Representations at Any Resolution

ViQ: 任意分辨率下的文本对齐视觉量化表示

Xumin Yu, Zuyan Liu, Zhenyu Yang, Yuhao Dong, Shengsheng Qian, Jiwen Lu, Han Hu, Yongming Rao

机构 * Tencent HY Vision Team(腾讯HY视觉团队) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Chinese Academy of Sciences(中国科学院)

专题命中 效率与部署 :LLM(abstract_cn);language model(abstract)

AI总结 提出ViQ框架,通过文本对齐预训练和特征离散化两阶段量化学习,平衡离散表示中的语义与细节,支持原生分辨率输入,在多模态任务中取得与连续高维特征编码器相当的性能,并实现20%-70%的训练加速。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27807 2026-06-29 cs.RO 新提交 67%

SpikeVLA: Vision-Language-Action Models with Spiking Neural Networks

SpikeVLA:基于脉冲神经网络的视觉-语言-动作模型

Ruiqi Song, Dujun Nie, Siyu Teng, Baiyong Ding, Xiaotong Zhang, Dong Li, Chenming Zhang, Yuchen Li, Hangbin Wu, Long Chen

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 提出SpikeVLA,一种脉冲VLA架构,通过事件驱动稀疏计算降低能耗,在导航和机器人控制任务中保持竞争力,适用于低功耗实时具身智能。

Comments Accepted by ICML 2026. 16 pages, 9 figures

Journal ref Proceedings of the 43rd International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26159 2026-06-26 physics.optics 新提交 67%

Microparticles manipulation with a three-dimensional closed optical trap

利用三维封闭光阱操控微粒

Chunyu Zhang, Xinran Fang, Pengcheng Mao, Dongxu Zhao

专题命中 效率与部署 :SLM(abstract,abstract_cn)

AI总结 提出一种无需空间光调制器的三维封闭光阱系统,通过腔内模式调制和腔外透镜调制生成零中心强度的暗势阱,实现单/多微粒稳定捕获及低功率下小鼠肝细胞捕获,降低光毒性并灵活调节尺寸。

Comments 20 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25062 2026-06-25 stat.ME stat.ML 新提交 67%

Hierarchical Partial-Order Models for Ranking

用于排序的层次偏序模型

Dongqing Li, Geoff K. Nicholls, Jeong Eun Lee, Chuxuan, Jiang

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 提出层次偏序(HPO)模型,通过潜在偏序层次结构处理分组排序数据,扩展了基于偏序的模型,并在预测性能和结构可解释性上优于现有方法。

Comments 34 pages, 13 figures, 8 tables, 33 pages of appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25091 2026-06-25 cs.DC 新提交 67%

Speculation at a Distance: Where Edge-Cloud Speculative Decoding Actually Pays Off

远距离推测:边缘-云推测解码何时真正有效

Yuan Lyu, Bharath Irukulapati, Jaya Prakash Champati

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本文通过闭式不等式分析分布式推测解码(DSD)在广域网边缘-云通信下的延迟收益,指出其仅在低RTT场景下优于共置SD,并发现多租户容量是DSD的主要优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24424 2026-06-24 eess.SP 新提交 67%

Explainable AI for Next-Generation Wireless Physical Layer: Basics, State-of-the-Art, and Open Challenges

下一代无线物理层的可解释人工智能:基础、最新进展与开放挑战

Bingnan Xiao, Shuyan Hu, Xiaojing Chen, Zhiyuan Zhai, Bingcong Li, Wei Ni, Xin Wang, Ekram Hossain

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本文综述了无线物理层中可解释人工智能(XAI)的应用,提出了面向责任的目标,建立了系统分类法,并讨论了可解释性-性能权衡等开放挑战。

Comments 30 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24233 2026-06-24 cs.CV 新提交 67%

Latent Visual States for Efficient Multimodal Reasoning

用于高效多模态推理的潜在视觉状态

Xiuwei Chen, Wentao Hu, Yongxin Wang, Zisheng Chen, Likui Zhang, Kun Xiang, Jianhua Han, Hui-Ling Zhen, Jingyuan Zou, Hang Xu, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) The Hong Kong Polytechnic University(香港理工大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) Yinwang Intelligent Technology Co. Ltd(银旺智能科技有限公司)

专题命中 效率与部署 :SFT(abstract,abstract_cn)

AI总结 提出EVA框架,通过生成连续潜在视觉表示(Latent_slot tokens)作为中间推理思考,并设计D-GSPO解决优化策略偏差,构建EVA-230K数据集,在多个基准上提升性能与推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23064 2026-06-23 eess.AS cs.SD 新提交 67%

STAR-VAE: Structured Topology-Aware Regularization for Audio Reconstruction and Generation

STAR-VAE: 结构化拓扑感知正则化用于音频重建与生成

Huadai Liu, Wen Wang, Kaicheng Luo, Qian Chen, Xiangang Li, Wei Xue

机构 * Hong Kong University of Science(香港科学大学) Tongyi Fun Team, Alibaba Group(通义Fun团队,阿里巴巴集团)

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 针对连续VAE在压缩率、重建保真度和潜在空间拓扑之间的三难困境,提出结构化拓扑感知正则化(STAR),通过增长约束场重塑潜在空间几何,实现音频的高保真重建与生成。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22983 2026-06-23 cs.DC 新提交 67%

LiveServe: Interaction-Aware Serving for Real-Time Omni-Modal LLMs

LiveServe:面向实时全模态大语言模型的交互感知服务系统

Xiangyu Zhi, Peiqi Yin, Sheng Guan, Chenguang Zheng, James Cheng, Xiao Yan

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 提出交互感知服务系统LiveServe,通过感知播放进度、语音活动和打断事件,优化调度与KV缓存管理,降低音频延迟并提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22617 2026-06-23 cs.CV 新提交 67%

OmniSpace: Efficient Geometry Awareness for Autonomous Vehicles MLLMs

OmniSpace: 自动驾驶多模态大语言模型的高效几何感知

Hao Vo, Phu Loc Nguyen, Khoa Vo, Sieu Tran, Duc Minh Nguyen, Ngo Xuan Cuong, Nghi D. Q. Bui, Anh Nguyen, Duy Minh Ho Nguyen, Ngan Le

机构 * University of Arkansas(阿肯色大学) Google Research, Google(谷歌研究院) University of Liverpool(利物浦大学) Max Planck Research School for Intelligent Systems(马克斯·普朗克智能系统研究所)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 提出OmniSpace,一种即插即用的几何感知范式,通过相机位姿注入器、多视图极线注意力模块和3D几何蒸馏目标,从纯2D观测中提升MLLM的空间推理能力,在多个自动驾驶基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22541 2026-06-23 cs.DC 新提交 67%

ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill

ASAP: 一种用于MoE预填充的去中心化和异步推理系统

Weiwei Chen, Shuang Chen, Lele Li, Qiang Hu, Han Li, Xin Ye, Ming Yan, Zhibin Yu

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 针对MoE模型混合并行策略中的同步瓶颈,提出ASAP系统,通过解耦注意力与MoE阶段并实现全异步执行流水线,结合异步通信原语和调度优化,将SLO合规的预填充吞吐量提升90%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22370 2026-06-23 cs.CV 新提交 67%

Towards Error-Free Long Video Generation

迈向无错误的长视频生成

Shuning Chang, Weihua Chen, Jiasheng Tang, Hao Xu, Zeyu Zhang, Hangjie Yuan, Yu Lu, Ruigang Niu, Fan Wang, Bohan Zhuang, Yi Yang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 提出一种基于扩散模型的长视频生成框架,通过因果注意力、KV缓存和截断修正流技术解决误差累积和属性漂移问题,实现高质量、身份一致的单镜头长视频合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21358 2026-06-23 cs.CV 新提交 67%

LEViL: Label-Efficient Video Learning via Zero-Shot Distillation over VLM-Generated Pseudo-Label Spaces

LEViL: 通过VLM生成的伪标签空间上的零样本蒸馏实现标签高效视频学习

Aslı Çelik

机构 * Kocaeli University(科贾埃利大学)

专题命中 效率与部署 :language model(abstract);pretraining(abstract)

AI总结 提出一种无需标注的视频预训练与目标标签集感知微调结合的标签高效视频学习框架,利用VLM生成伪标签空间进行零样本蒸馏,在有限标签下优于半监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21354 2026-06-23 math.OC 新提交 67%

Restart and Adaptive Acceleration in Stochastic Gradient Methods

随机梯度方法中的重启与自适应加速

Ali Elhishi, Chistophe Roux, Alexandre d'Aspremont

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 针对满足Kurdyka-Łojasiewicz不等式的非光滑弱凸随机优化问题,提出重启策略以利用KŁ不等式实现加速收敛,并证明其对参数误设具有鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19960 2026-06-19 cs.IR 新提交 67%

Stellar: Scalable Multimodal Document Retrieval for Natural Language Queries

Stellar:面向自然语言查询的可扩展多模态文档检索

Yuxiang Guo, Zhonghao Hu, Yuren Mao, Yuhang Liu, Congcong Ge, Xiaolu Zhang, Jun Zhou, Yunjun Gao

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 提出Stellar框架,通过磁盘存储令牌级文档嵌入并动态加载候选嵌入,结合词汇表示过滤和高效磁盘支持的后交互,在保持检索效果的同时将内存开销和查询延迟降低1-2个数量级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19915 2026-06-19 cs.CV 新提交 67%

SpatialSV: Internalizing Interpretable 3D Spatial Awareness in MLLMs via Task-Oriented Visual Supervision

SpatialSV: 通过任务导向的视觉监督在多模态大语言模型中内化可解释的3D空间感知

Jiayu Tang, Yuchen Zhou, Chao Gou

机构 * School of Intelligent Systems Engineering, Sun Yat-sen University(中山大学智能工程学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 提出SpatialSV框架,通过任务导向的视觉监督将MLLM的2D特征提升为显式3D表示(深度图、相机姿态、点云),实现可解释的3D空间感知内化,无需外部工具,并在半监督设置中展现强泛化能力。

Comments Accepted by IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏