arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1933 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1933 篇

2606.19849 2026-06-19 cs.CV 新提交 67%

ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference

ViCoStream: 流式视频大模型通过阶段协调推理可运行超过100 FPS

Yang Tan, Junlong Tong, Linan Yue, Hao Wu, Pengfei Fang, Xiaoyu Shen

机构 * Southeast University(东南大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 提出ViCoStream框架,通过阶段协调的流水线(分块执行、CUDA流重叠、视觉令牌控制、有界视觉注意力、查询端检索)实现流式视频大模型的高吞吐低延迟推理,在单A100上达到134 FPS视频吞吐和<50 ms首令牌延迟,精度接近全历史基线。

Comments 19 pages, 7 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19584 2026-06-19 cs.CV 新提交 67%

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception

语言引导的视觉嵌入用于可控且可泛化的感知

Chengzhi Mao, Xudong Lin, Wen-Sheng Chu

机构 * Google(谷歌)

专题命中 效率与部署 :language model(abstract);foundation model(abstract)

AI总结 提出语言引导视觉嵌入(LIVE)方法,利用语言动态引导视觉编码器生成任务中心嵌入,无需任务特定重训练,减少视觉幻觉并提升泛化能力。

Journal ref Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19271 2026-06-18 cs.DC 新提交 67%

TurboServe: Serving Streaming Video Generation Efficiently and Economically

TurboServe: 高效经济地服务流式视频生成

Youhe Jiang, Haoxu Wang, Haotong Bao, Kai Jiang, Jianfei Chen, Jun Zhu, Fangcheng Fu, Jintao Zhang

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 针对流式视频生成的会话时长和用户需求异构性,提出TurboServe系统,通过在线调度联合优化会话放置与GPU配置,采用迁移感知放置和负载驱动自动缩放,降低延迟和成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18072 2026-06-17 eess.AS 新提交 67%

One-Step Token-to-Waveform Generation with MeanFlow in Latent Space

基于潜在空间中MeanFlow的一步式Token到波形生成

Zheqi Dai, Guangyan Zhang, Zhen Ye, Jingyu Li, Haolin He, Chunyat Wu, Yiwen Guo, Qiuqiang Kong

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 提出MeanFlow在高度压缩潜在空间中实现一步式Token2Wav生成,解决多步流匹配解码器的速度-质量权衡,RTF提升17倍且质量损失可忽略。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17953 2026-06-17 cs.CV 新提交 67%

MLLMs Get It Right, Then Get It Wrong: Tracing and Correcting Late-Layer Textual Bias

MLLMs 先正确后错误:追踪并纠正后层文本偏见

Xingming Li, Ao Cheng, Qiyao Sun, Xixiang He, Xuanyu Ji, Runke Huang, Qingyong Hu

机构 * National University of Defense Technology(国防科技大学) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Intelligent Game and Decision Lab(智能博弈与决策实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 发现多模态大语言模型在中间层形成正确视觉预测,但最终输出时被文本覆盖,通过检测预测方向变化(85%失败转向文本,89%成功转向视觉)提出无训练方法CALRD,在冲突基准上提升高达9.4%。

Comments Accepted at IJCAI 2026. 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12556 2026-06-17 cs.DC 新提交 67%

ITME: Inference Tiered Memory Expansion with Disaggregated CXL-Hybrid Memories

ITME:基于解耦CXL混合内存的分层推理内存扩展

Hakbeom Jang, Younghoon Min, Sunwoong Kim, Taeyoung Ahn, Hanyee Kim, Youngpyo Joo, Hoshik Kim, Jongryool Kim

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 针对大语言模型推理中TB级上下文状态的内存瓶颈,提出ITME架构,利用CXL混合内存实现字节可寻址的远程内存扩展,通过确定性访问模式优化数据移动,提升吞吐量达35.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15384 2026-06-16 cs.DB 新提交 67%

CoeusBI: A Comprehensive Interactive Business Intelligence System Powered by LLMs at Baidu [Extended Version]

CoeusBI:百度基于大语言模型的全面交互式商业智能系统 [扩展版]

Jinqing Lian, Chaofan Li, Yingxia Shao, Ming Wang, Yang Dong, Xinyi Liu, Wei Zhang, Chaoxian Gui, Tianqi Wan, Ming Dong

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 CoeusBI提出双智能体架构与分层模式链接,通过视图生成智能体自动简化JOIN查询、分层检索处理宽模式、动态路由智能体优化多轮对话,在公共和生产数据集上显著提升查询准确率、令牌效率与用户满意度,已部署于百度平台服务数千用户。

Comments Accepted by VLDB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15050 2026-06-16 cs.DC cs.NI 新提交 67%

Solyx AI Grid: Hardware-Telemetry-Aware Routing Across Geographically Distributed GPU Clusters

Solyx AI Grid:跨地理分布式GPU集群的硬件遥测感知路由

Aleks Bernhard, Nithin Katla

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 提出Solyx AI Grid,一种结合GPU硬件遥测、vLLM应用指标和WAN信号的多站点推理路由控制平面,通过10信号加权压力评分器实现每请求放置决策,在实验中吞吐量提升1.56-1.75倍,能力错配泄漏降至0.43%,故障重路由p99延迟降低至1247ms。

Comments 15 pages, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15021 2026-06-16 cs.RO 新提交 67%

Steering Autoregressive Vision-Language-Action Policies via Action Token Intervention

通过动作令牌干预引导自回归视觉-语言-动作策略

Jason Chan, Jonathan C. Kao

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 效率与部署 :language model(abstract);foundation model(abstract)

AI总结 提出Token Steering方法,在推理时通过干预动作令牌空间动态引导VLA模型轨迹生成,无需训练或微调,显著提升家务操作任务成功率。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14602 2026-06-15 cs.RO 新提交 67%

What Robots Do Matters More Than What They Look Like: Task Context Shapes Trust in Educational HRI

机器人做什么比它们长什么样更重要:任务背景塑造教育人机交互中的信任

Anna-Maria Velentza, Konstantina Nikou, Anne-Gwenn Bosser, Nikolaos Fachantidis

机构 * LIRES Robotics Lab, University of Macedonia(马其顿大学LIRES机器人实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 通过视频实验(N=81)发现,任务类型(教学、指导、索要个人信息)对信任有显著主效应,而机器人外观无显著影响,表明任务背景比物理外观更关键。

Comments Accepted in the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026), Kitakyushu, Fukuoka, Japan

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13049 2026-06-12 cs.RO 新提交 67%

Y-BotFrame: An Extensible Embodied Agent Framework for Quadruped Robot Assistants

Y-BotFrame:一种用于四足机器人助手的可扩展具身智能体框架

Luyao Zhang, Ke Li, Yuan Ding, Xulong Zhao, Guo Yu, Chengwei Yan, Fuyu Dong, Jiawei Hu, Di Wang, Nan Luo, Gang Liu, Quan Wang

机构 * Xidian University(西安电子科技大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 提出Y-BotFrame框架,集成多模态感知与大语言模型认知核心,将自然语言指令映射为可执行任务单元,实现无遥控器的人机协作,支持模块化扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12744 2026-06-12 cs.CV 新提交 67%

GRIP: Feedback-Guided Prompt Retrieval for Large Multimodal Models

GRIP:面向大型多模态模型的反馈引导提示检索

Garvita Allabadi, Matteo Sodano, Roberto Estevão, Yuxiong Wang, Vikram Adve, Emre Kiciman, Ranveer Chandra

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Bonn(波恩大学) Microsoft(微软)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 提出GRIP,一种可学习的视觉检索框架,利用多模态模型反馈识别真正提升上下文学习性能的示例,在分类、描述和VQA任务上优于基于相似度的检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12294 2026-06-11 cs.CV eess.IV 新提交 67%

Bridging the Modality Gap in Forensic Image Retrieval

弥合法医图像检索中的模态差距

Ricardo González-Gazapo, Annette Morales-González, Yoanna Martínez-Díaz, Heydi Méndez-Vázquez, Milton García-Borroto

机构 * Advanced Technologies Application Center (CENATAV)(先进技术应用中心(CENATAV)) Centro de Sistemas Complejos, Facultad de Física, Universidad de La Habana(哈瓦那大学物理学院复杂系统中心)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 提出统一检索框架,利用多模态大语言模型生成文本描述并结合视觉与文本特征融合,提升纹身、人脸素描等法医任务的检索精度与鲁棒性。

Comments 23 pages, 5 figures, paper submitted to Elsevier journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11201 2026-06-11 cs.LG cs.AI cs.CL 新提交 67%

To Intervene or Not: Guiding Inference-time Alignment with Probabilistic Model Blending

干预还是不干预:通过概率模型混合指导推理时对齐

Jin Gan, Xin Li, Jun Luo

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院)

专题命中 效率与部署 :LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出BlendIn框架,通过质量感知对齐和按可靠性加权混合模型知识,解决推理时对齐中指导有效性差异大的问题,在困难模型对上实现最高50%的性能提升。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10945 2026-06-10 cs.CR cs.SE 新提交 67%

Context-Based Adversarial Attacks on AI Code Generators: Vulnerability Analysis and Implications

基于上下文的AI代码生成器对抗攻击:漏洞分析与影响

Walther A. Del Orbe, John D. Hastings, Varghese Vaidyan

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 研究通过2800次实验,发现上下文对抗攻击使代码生成漏洞增加10.7倍,并提出双层防御框架实现89.1%检测率。

Comments 6 pages, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10808 2026-06-10 cs.RO 新提交 67%

Bridging Semantics and Physical Execution: A Neuro-Symbolic Framework for Multi-Pair Robotic Assembly

桥接语义与物理执行:面向多对机器人装配的神经符号框架

Xinyi Li, Aiguo Song, Linhu Wei, Huijun Li

机构 * School of Instrument Science and Engineering, Southeast University(东南大学仪器科学与工程学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 提出一种端到端神经符号框架,通过分层生成最优子图、解耦通用性与边缘情况、协调全局序列,解决非结构化环境中多对装配的空间干扰和接触不确定性,在100个真实场景中达到97%全局可执行性,UR3机械臂部署成功率90%。

Comments Corresponding author: Aiguo Song (a.g.song@seu.edu.cn)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10702 2026-06-10 cs.SE 新提交 67%

Watts and Debts of Agentic Frameworks: An Empirical Study (Registered Report)

智能体框架的能耗与债务:一项实证研究(注册报告)

Aneetta Sara Shany, Chandrasekar S, Karthik Vaidhyanathan

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 通过实证研究关联智能体框架中的自我承认技术债务与运行时能耗,探讨代码质量能否指导节能设计。

Comments Accepted at the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026), Registered Reports Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10533 2026-06-10 cs.CV 新提交 67%

Audio-Visual Exchange-Aware Token Pruning for Efficient Audio-Visual Captioning

音频-视觉交换感知令牌剪枝用于高效音频-视觉字幕生成

Zihan Meng, Dexiang Hong, Weidong Chen, Ziyu Zhou, Bo Hu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 提出基于强化学习的AVEX-Prune方法,通过跨模态令牌交换策略选择高置信度令牌,在40%保留率下保持全令牌质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09659 2026-06-09 cs.CL cs.AI cs.LG 新提交 67%

End-to-End Context Compression at Scale

端到端上下文压缩的规模化

Ang Li, Sean McLeish, Haozhe Chen, Nimit Kalra, Zaiqian Chen, Artem Gazizov, Venkata Anoop Suhas Kumar Morisetty, Bhavya Kailkhura, Harshitha Menon, Zhuang Liu, Brian R. Bartoldson, Tom Goldstein, Sanae Lotfi, Micah Goldblum, Pavel Izmailov

机构 * New York University(纽约大学) Modal Labs(Modal实验室) University of Maryland(马里兰大学) Princeton University(普林斯顿大学) Columbia University(哥伦比亚大学) Harvard University(哈佛大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) FAIR at Meta(Meta FAIR实验室)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过架构搜索和持续预训练,提出潜在上下文语言模型(LCLMs),一种端到端编码器-解码器压缩器,在通用任务性能、压缩速度和峰值内存上改进帕累托前沿,并可作为长时智能体的高效骨干。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08869 2026-06-09 cs.DC 新提交 67%

A Low-Latency Semantic State Estimator using Latent Predictive Learning for Dynamic Network Monitoring and Orchestration

一种用于动态网络监控与编排的低延迟语义状态估计器,基于潜在预测学习

Hari Madhukumar, Haiyuan Li, Xiaolan Liu, Andy Corston-Petrie, Dimitra Simeonidou

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 提出潜在预测状态估计器(LPSE),通过将变基数节点遥测转换为拓扑自适应表示并与监控问题融合,实现固定成本单次推理,在Kubernetes集群上达到82.42%语义预测准确率,推理延迟降低约41倍,内存占用减少15倍。

Comments 6 pages, 2 figures, 2 tables. Submitted to IEEE GLOBECOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08511 2026-06-09 cs.CV 新提交 67%

Look Less, Reason More: Block-wise Attention Skipping for Efficient Multimodal LLMs

少看多思:面向高效多模态大语言模型的块级注意力跳过

Jie Ma, Zhike Qiu, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

机构 * Xiamen University(厦门大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 针对多模态大语言模型视觉注意力饱和问题,提出训练无关的Visual-Skip方法,通过选择性跳过冗余的视觉自注意力模块实现块级稀疏性,并利用轻量级校准动态选择最优稀疏路径,在保持性能的同时显著降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01400 2026-08-04 cs.LG cs.AI 新提交 66%

TabDPT-Turbo: Efficient In-Context Learning for Tabular Prediction

TabDPT-Turbo:面向表格预测的高效上下文学习方法

Rasa Hosseinzadeh, Alex Labach, Zexin Xue, Shuyi Han, Valentin Thomas, Anthony L. Caterini

专题命中 效率与部署 :foundation model(abstract,comments);分类 cs.AI、cs.LG

AI总结 本文提出TabDPT-Turbo模型,通过结合基于行的注意力、长上下文预训练及SSL预训练,在保持与TabDPT v1.1相当性能的同时大幅提升推理速度,是当前最快的表格预测基础模型。

Comments Presented as a poster at the non-archival ICML workshop on Foundation Models for Structured Data (FMSD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08268 2026-07-10 cs.AI cs.CL 新提交 66%

Different Teachers, Different Capabilities: Sub-1B On-Device Distillation for Structured Text Enrichment

不同的教师,不同的能力:用于结构化文本丰富的低于1B的设备端蒸馏

Vinay Kumar Chaganti

专题命中 效率与部署 :prompting(abstract);分类 cs.CL、cs.AI;LLM(comments)

AI总结 研究将8B推理教师模型蒸馏成0.6B学生模型,添加对照,通过盲测评分。学生模型处理速度快,恢复部分摘要质量差距。不同教师模型转移不同能力,无单一引擎全胜,得出设备端丰富的按领域路由图。

Comments 12 pages, 5 figures. has a same-size non-reasoning-teacher control, a three-judge LLM-as-a-judge panel with a negative control, full-source faithfulness grading, and a per-field routing analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17188 2026-08-19 cs.CL cs.AI 新提交 62%

Token Optimization and Context Window Management in Multi-Agent AI Workflows

多智能体AI工作流中的令牌优化与上下文窗口管理

Dvir Shamay

专题命中 效率与部署 :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出多智能体AI工作流的令牌优化与上下文窗口管理框架,含六种模式,可缩短延迟、减少令牌用量;经2420次试验发现相关性对比上下文可提升模型准确率,为模型研究与生产实践提供可重复方法。

Comments 29 pages (main paper + technical appendix), 3 figures. Also archived on Zenodo: 10.5281/zenodo.21924612

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14945 2026-08-18 cs.AI cs.CL 新提交 62%

Trust Is Not Enough: Influence Calibration for On-Policy Self-Distillation in Agentic RL

信任并不足够:智能体强化学习中策略内自蒸馏的影响校准

Qizhen Lan, Xi Xiao, Xiangchen Guan, Mengchen Fan, Moule Lin, Jung Im Choi, Lijing Zhu

专题命中 效率与部署 :language agent(abstract);分类 cs.CL、cs.AI

AI总结 针对策略内自蒸馏的信任-效用不匹配问题,提出ICSD方法,在多基准任务上提升语言智能体性能,降低反向令牌的教师支持占比并提高梯度兼容性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14728 2026-08-18 cs.LG cs.AI 新提交 62%

Tail-Aware Top-$k$ On-Policy Distillation

感知长尾的Top-k在线策略蒸馏

Huipeng Huang, Hongxin Wei

机构 * Southern University of Science and Technology(南方科技大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 针对现有Top-k在线策略蒸馏丢弃长尾概率信号的问题,提出TA-OPD方法,通过引入携带长尾概率的长尾词优化,在常见基准上使Avg@8最高提升8.05个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13596 2026-08-17 cs.LG cs.AI 新提交 62%

Training-Free Knowledge Transfer Across Model Scales through Activation-Guided Pruning

通过激活引导剪枝实现跨模型规模的无训练知识迁移

Jiahe Fan, Si Chen, Yinghao Hou, Aiyuan Zhang, Hong Xie

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出激活剪枝融合框架APM,通过激活引导选择源模型的显著组件并注入目标模型,无需训练和显式语义对齐,在16个基准上将3B目标模型平均准确率从55.5%提升至60.6%。

Comments 9 pages, 3 figures, and 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11775 2026-08-13 cs.AI cs.CL 新提交 62%

The Sleeping Agent: What Gist-Based Context Compression Loses and Why

休眠智能体:基于主旨的上下文压缩会丢失什么以及为什么

Nicholas E. Kyrkewood

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究以SWC为工具,发现主旨压缩对多跳推理等任务表现优于截断,但会损害时间相关问题的性能,通过修改提示可提升时间问题的评判准确率。

Comments 7 pages, 5 tables, appendices. Code and results at https://github.com/kyrkewood/sleeping-agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11227 2026-08-13 cs.AI cs.LG 新提交 62%

Forecasting Side Effects of Activation Steering

预测激活引导的副作用

Chong Yong Ong, Alson Wei Jie Sim, Peixin Zhang, Jun Sun

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对激活引导易产生意外副作用的问题,构建交叉效应矩阵揭示副作用的系统性与可预测性,为激活引导的安全部署提供支持。

Comments 24 pages, 5 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10837 2026-08-12 cs.LG cs.AI 新提交 62%

TACTICL: Task-Aware Compression of Tabular ICL Models

TACTICL:面向表格上下文学习模型的任务感知压缩框架

Mykhailo Koshil, Matthias Feurer, Katharina Eggensperger

机构 * TU Dortmund University(多特蒙德工业大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 针对表格基础模型推理成本高、蒸馏后损失上下文适应性的问题,提出TACTICL框架,剪枝Transformer层并替换为轻量适配器,在47个基准数据集上可替换85%层且性能无显著下降,对数据偏移鲁棒。

Comments Accepted for publication at AutoML2026

详情

展开后加载摘要…

URL PDF HTML 收藏