arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1933 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1933 篇

2608.07982 2026-08-11 cs.CV 新提交 50%

AdaDINO: Pair-Aware In-Backbone Adaptation of Frozen DINO for Efficient Remote Sensing Change Detection

AdaDINO:用于高效遥感变化检测的冻结DINO的成对感知骨干内适配

Xu Zhang, Xinqing Li, Jianpeng Xie, Zeshuai Zhu, Xin He, Yun Liu

专题命中 效率与部署 :foundation model(abstract)

AI总结 AdaDINO是一种成对感知的骨干内适配框架,通过CGLA、BSCS和CPGR模块优化冻结DINO,在4个遥感变化检测基准上实现了高效且性能更优的变化检测,在SYSU-CD上F1达85.29%且吞吐量提升1.41倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07861 2026-08-11 cs.CV cs.HC cs.IR cs.MM 新提交 50%

How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems

回答我的问题需要多少成本?基于云VLM的VQA系统基准测试

Henri Vanhuynegem, Weitao Xu, Yiran Shen, Guohao Lan

专题命中 效率与部署 :language model(abstract)

AI总结 本研究推出首个将客户端输入预处理作为受控变量的VQABench基准,评估12种预处理技术在3个VQA数据集、4个商业VLMs上的95168次API调用,明确预处理对云VLM-based VQA的成本-质量影响,为VQA系统部署提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07462 2026-08-10 eess.AS cs.SD 新提交 50%

SemBridge: Semantic Token Anchoring for Continuous-Latent Autoregressive Speech Generation

SemBridge:用于连续隐变量自回归语音生成的语义令牌锚定

Hanke Xie, Haopeng Lin, Jiale Qian, Dake Guo, Yuepeng Jiang, Zhichao Wang, Wenxiao Cao, Jingbin Hu, Guobin Ma, Wenhao Li, Huakang Chen, Chengyou Wang, Ming Tao, Zhonghua Fu, Lei Xie, Xinsheng Wang

专题命中 效率与部署 :language model(abstract)

AI总结 该研究提出SemBridge框架,通过离散语义令牌监督自回归LM状态,在零样本TTS和SVS任务中提升内容准确性,同时保持说话人相似度与感知质量,为连续语音生成提供有效方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07434 2026-08-10 cs.CV cs.IR 新提交 50%

Conformal Coverage Guarantees for Any Video Temporal Grounder

任意视频时间定位器的共形覆盖保证

Aseel Mohamed, Rasul Khanbayov, Erchin Serpedin, Hasan Kurban

专题命中 效率与部署 :language model(abstract)

AI总结 针对视频时间定位器的模糊性问题,提出与模型无关的COVER包装器,可保证输出区域以至少1-α的概率包含真实时刻,在多基准和定位器上验证了其覆盖度符合目标值。

Comments Submitted to AAAI 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06959 2026-08-10 cs.CV 新提交 50%

Summarize First, Download Later: Onboard VLMs for Bandwidth-Efficient Earth Observation

先总结,后下载:面向带宽高效的地球观测的机载视觉语言模型

Junghwan Park, Sangcheol Sim, Woojin Cho, Darongsae Kwon

专题命中 效率与部署 :language model(abstract)

AI总结 针对地球观测卫星下行链路带宽瓶颈,提出“先总结,后下载”范式,通过机载VLM生成摘要、地面VQA验证后按需下载全分辨率图像,可降带宽消耗并加速时间敏感任务的洞察时间。

Comments IGARSS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06794 2026-08-10 cs.CV 新提交 50%

PAST: Prompt-Adaptive Sampling Termination for Efficient Diffusion Model

PAST:用于高效扩散模型的提示自适应采样终止

Renye Yan, Jikang Cheng, You Wu, Wei Peng, Zongwei Wang, Ling Liang, Yimao Cai

机构 * Peking University(北京大学) Nanjing University(南京大学) Stanford University(斯坦福大学)

专题命中 效率与部署 :preference optimization(abstract)

AI总结 PAST是一种提示自适应采样终止方法,通过双自适应协调机制提升扩散模型RL微调的计算效率与偏好优化质量,效率最高提升66.7%,质量最高提升29.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06467 2026-08-10 cs.CV 新提交 50%

Test-Time Adaptation with Online Personalized Energy-Based Cache for Fine-Grained Video Expression Recognition

用于细粒度视频表情识别的基于能量缓存的在线个性化测试时自适应

Masoumeh Sharafi, Muhammad Osama Zeeshan, Soufiane Belharbi, Alessandro Lameiras Koerich, Marco Pedersoli, Eric Granger

专题命中 效率与部署 :language model(abstract)

AI总结 针对视频FER的测试时自适应难题,提出EB-CaP方法,通过轻量级能量模型结合CLIP生成个性化缓存,在低开销下优于现有SOTA方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06065 2026-08-07 cs.CV 新提交 50%

The Next Screenshot Knows: Gated Hindsight Distillation for Mobile GUI Agents

下一张截图知晓:面向移动GUI智能体的门控事后蒸馏(Gated Hindsight Distillation)

Weiwei Li, Junzhuo Liu, Tong Chu, Hengfu Yu, Wen Li

专题命中 效率与部署 :language model(abstract)

AI总结 本文针对移动GUI智能体训练中丢失动作依据的问题,提出门控事后蒸馏方法,利用下一张截图作为特权信息,在AndroidWorld等基准上相比GRPO提升了任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05042 2026-08-06 cs.RO 新提交 50%

BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation

BridgeVLA++:一种面向三维操作的数据高效、可泛化且内存增强的视觉-语言-动作框架

Peiyan Li, Yuze Zhu, Yixiang Chen, Qisen Ma, Yuan Xu, Jiabing Yang, He Guan, Yan Huang, Hongtao Wu, Xiao Ma, Tao Kong, Liang Wang, Tieniu Tan

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室(NLPR)) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FiveAges ByteDance Seed(字节跳动种子实验室)

专题命中 效率与部署 :language model(abstract)

AI总结 本研究提出内存增强的三维VLA框架BridgeVLA++,通过新增时空记忆架构,在保留原模型数据效率与泛化能力的同时,提升了记忆相关操作性能,且在多任务与真实平台上验证了其有效性。

Comments This work has been submitted to the IEEE TPAMI for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04676 2026-08-06 cs.CV 新提交 50%

SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding

SurgNarrator:面向手术视频理解的生成式检索框架

Yuqing Feng, Jiawei Ma, Kevin Qinghong Lin, Kun Yuan, Nicolas Padoy, Daniel S. Elson, Anh Nguyen, Stamatia Giannarou, Baoru Huang

机构 * University of Liverpool(利物浦大学) City University of Hong Kong(香港城市大学) University of Oxford(牛津大学) University of Strasbourg(斯特拉斯堡大学) IHU Strasbourg(斯特拉斯堡大学医院研究所) Imperial College London(帝国理工学院)

专题命中 效率与部署 :language model(abstract)

AI总结 SurgNarrator是专为手术视频理解设计的生成式检索框架,通过构建手术词汇表、适配Qwen3-VL-Embedding-8B并采用分层检索策略,在零样本设置下于12个基准上实现性能提升且延迟大幅降低。

Comments This work has been submitted to the IEEE for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04483 2026-08-06 cs.CV 新提交 50%

Not All Redundant Tokens Are Alike: Analyzing Visual Token Pruning through Token Roles

并非所有冗余视觉标记都相同:通过标记角色分析视觉标记剪枝

Hyeonyu Kim, Sehwan Lim, Youngwon Choi, Taeyoun Kwon, Jaejin Kim

机构 * Maum AI Inc.(Maum AI公司)

专题命中 效率与部署 :language model(abstract)

AI总结 本研究针对视觉-语言模型(VLMs)的视觉标记剪枝问题,通过EmbedLens分析标记角色,发现代表性剪枝方法存在标记角色偏差但与下游性能无直接关联,优化角色分配后表明保留非活跃标记可维持或提升性能,为剪枝方法优化提供了新视角。

Comments Accepted to ECCV 2026 workshop, UniWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03885 2026-08-05 cs.CV 新提交 50%

MuRA: Multi-Rank Adaptation for Efficient and Effective Test-Time Vision-Language Generalization

MuRA:用于高效且有效的测试时视觉-语言泛化的多秩适配

Gengyuan Liu, Nanzhou Wang, Chang Liu, Qinwen Wu, Zhenhao Wang, Jiacong Wang, Bokui Chen, Xiangyang Ji

专题命中 效率与部署 :language model(abstract)

AI总结 针对测试时视觉-语言模型因静态秩配置导致的性能瓶颈,提出多秩适配(MuRA)框架,动态选择适配模块,在多基准测试中达最优准确率且降低计算内存开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03851 2026-08-05 cs.CV 新提交 50%

LiteMVS: Efficient Multi-View Stereo with Foundation Distillation and Expert Aggregation

LiteMVS:结合基础模型蒸馏与专家聚合的高效多视图立体匹配

Tianbao Zhang, Zeyu Liu, Shuyu Wu, Fanxing Li, Zhaoxin Fan, Wenjun Wu, Danping Zou

专题命中 效率与部署 :foundation model(abstract)

AI总结 LiteMVS是集成平面扫描几何推理与单目先验的轻量多视图深度模型,通过MoE和基础模型蒸馏提升重建质量与效率,在ScanNetv2等数据集上表现优异。

Comments CVPR 2026 Workshop accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03229 2026-08-05 cs.AR 新提交 50%

Unified Lookup-Table Inference with Signed-Digit K/V Caches for Ternary LLMs

面向三值大语言模型的带符号数位键值缓存的统一查表推理

Ziang Duan, Jiajun Wu, Zetian Chen, Hao Song, Yanwen Deng, Zixuan Shen, Nuobei Xie, Simo Wu, Bolun Wang, Peng Zhou, Chao Wang

专题命中 效率与部署 :post-training(abstract)

AI总结 针对三值大语言模型注意力机制中K/V缓存与权重投影的精度不匹配问题,提出带符号数位K/V缓存的统一查表推理方法,经实验验证可提升缓存、质量与硬件效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02959 2026-08-05 cs.MA 新提交 50%

SABRE: A Multi-Agent Approach for Selecting Out-of-Distribution Detectors Under a Budget

SABRE:预算约束下选择分布外检测器的多智能体方法

Mary Wisell, Salimeh Sekeh

专题命中 效率与部署 :language model(abstract)

AI总结 SABRE是一种多智能体方法,可在预算约束下针对视觉-语言模型的分布外检测,自动选择各领域最优检测器,解决固定检测器跨领域失效的问题,实现可靠检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02954 2026-08-05 cs.AR 新提交 50%

LowRank-SSM: Hardware-Software Co-Design for Rank-Reduced Mamba Acceleration on FPGA

LowRank-SSM:面向FPGA上秩约简Mamba加速的软硬件协同设计

Haocheng Xu, Bhardwaj Bhat, Yu-an Chou, Zhiheng Chen, Leyao Han, Yifan Zhang, Ye Qiao, Saptarshi Mitra, Sitao Huang

专题命中 效率与部署 :post-training(abstract)

AI总结 LowRank-SSM是面向FPGA的软硬件协同设计框架,通过软件的秩约简与硬件的双路径投影等设计,在保证精度的同时,使Mamba类SSM的FPGA部署吞吐量提升2.19倍、能效提升2.03倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02791 2026-08-05 cs.CV 新提交 50%

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation

更好、更强、更快、更广泛:基于多模态大型语言模型(MLLM)的结构化全掩码预测分割

Jiazhen Liu, Mingkuan Feng, Long Chen

机构 * The Hong Kong University of Science and Technology (HKUST)(香港科技大学)

专题命中 效率与部署 :language model(abstract)

AI总结 STAMPlus通过结构化全掩码预测解耦自回归对话与非自回归掩码预测,解决了MLLM分割的三难问题,在提升性能的同时降低延迟,实现多类开放词汇等分割任务的SOTA表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02735 2026-08-05 hep-ph hep-ex 新提交 50%

Virtues and Vices of Equivariant Transformers

等变变换器的优点与缺点

Luigi Favaro, Tilman Plehn, Huilin Qu, Jonas Spinner

专题命中 效率与部署 :foundation model(abstract)

AI总结 研究洛伦兹等变变换器在大尺寸喷注与味道标记中的表现,优化其推理成本后发现,几何特征相关时其性能优于标准变换器,可为LHC数据基础模型开发提供参考。

Comments 32 pages, 18 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01653 2026-08-04 eess.IV 新提交 50%

Hadamard-Domain Model Quantization for Learned Image Coding

用于学习型图像编码的哈达玛域模型量化

Junqi Shi, Chongzhi Wang, Yiwen He, Ming Lu, Zhan Ma

专题命中 效率与部署 :post-training(abstract)

AI总结 针对学习型图像编码均匀INT8量化性能受限问题,提出HaTQ方法,通过哈达玛重参数化适配INT8量化,实验显示其在不同设置下性能提升且推理效率高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02428 2026-08-04 cs.CV 新提交 50%

DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation

DF³:自主导航中基于无解码器特征预测的世界建模

Jiaming Chen, Guoan Xu, Aoshen Huang, Haozhuo Zhang, Yang Li, Wei Pan

机构 * The University of Manchester(曼彻斯特大学) University of Technology Sydney(悉尼科技大学) Shandong University(山东大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 本研究提出DF³框架,通过冻结视觉基础模型、MACF机制及专用任务查询,在潜在空间直接预测特征并生成任务输出,在性能与效率上实现平衡,适用于自主导航的世界建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02134 2026-08-04 cs.CV 新提交 50%

Messages, Not Tokens: Grounded Coresets for Faithful VLM Compression

消息而非令牌:用于忠实VLM压缩的基础核心集

Long Qian, Jiaqi Wei, Bingke Zhu, Yingying Chen, Jinqiao Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Wuhan AI Research(武汉人工智能研究院) Cardiff University(卡迪夫大学)

专题命中 效率与部署 :language model(abstract)

AI总结 该研究针对VLM视觉令牌压缩的现有缺陷,提出无需训练的GMC方法,通过联合分配多维度证据支持并传输被丢弃状态,在大幅减少视觉令牌的同时保持VLM性能,经多基准实验验证有效。

Comments 32 pages, 6 figures, 18 tables, including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02109 2026-08-04 cs.CV 新提交 50%

Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression

相同语义,不同路径:面向视觉-文本压缩的自改进对齐

Tianyu Liang, Xiangxi Zheng, Yilin Wang, Dongxing Mao

机构 * Southeast University(东南大学) Nanjing University(南京大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :preference optimization(abstract)

AI总结 该研究针对视觉-文本压缩中渲染图像与原生文本表示的跨路径不一致瓶颈,提出自监督对齐框架SPIRAL,通过令牌级OPD与序列级DPO提升模型性能,在VTCBench上显著改善Qwen3-VL-8B的表现并实现域外泛化。

Comments Accepted to ACM Multimedia 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01706 2026-08-04 cs.CV 新提交 50%

UniSim-SLAM: Feed-Forward SLAM with Unified Sim(3) Optimization

UniSim-SLAM:采用统一Sim(3)优化的前馈SLAM

Inha Lee, Dongjae Jeong, Junhee Lee, Kyungdon Joo

机构 * National Institute of Science and Technology(国立科学技术研究所)

专题命中 效率与部署 :foundation model(abstract)

AI总结 UniSim-SLAM是采用统一Sim(3)优化的前馈SLAM系统,通过前端两视图跟踪与后端多视图子图优化,在TUM RGB-D和7-Scenes数据集上实现了当前最佳未校准设置下的轨迹精度,误差显著降低。

Comments Accepted at ECCV 2026. Project page: https://vision3d-lab.github.io/unisim-slam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01646 2026-08-04 cs.NE 新提交 50%

Spike-HTR: Spiking Neural Transformer for Handwritten Text Recognition

Spike-HTR:用于手写文本识别的脉冲神经Transformer

Xiubo Liang, Jinxing Han, Yuke Li, Haoqi Zhu, Yu Zhao, Hongzhi Wang

专题命中 效率与部署 :language model(abstract)

AI总结 针对手写文本识别的计算不平衡问题,提出混合脉冲识别器Spike-HTR,通过InkCoder和CTC引导的长度缩减器优化,在多个数据集上取得低字符错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01169 2026-08-04 cs.CV 新提交 50%

Think in Sets for Streaming Video Token Compression

集式推理的流式视频令牌压缩

Moxu Duan, Jingwen Fu, Yuwang Wang

专题命中 效率与部署 :LLM(abstract)

AI总结 该研究针对流式视频令牌压缩的参考集困境,提出无训练的NovaCov集式压缩器,在保留ReKV 99.6%准确率的同时降低46%的大语言模型预填充延迟,性能优于现有无训练方法。

Comments 9 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01020 2026-08-04 cs.CR 新提交 50%

Inverting the Hidden: Unveiling Multimodal Privacy Leakage in Collaborative LVLM Inference

反转隐藏内容:揭示协作式大型视觉语言模型(LVLM)推理中的多模态隐私泄露

Shuaifan Jin, Zhibo Wang, Qiyuan Wang, Yiting Han, Yajie Zhou, Yuanfan Zhang, Jiahui Hu, Xiaoyi Pang

专题命中 效率与部署 :language model(abstract)

AI总结 该研究针对协作式LVLM推理的隐私风险,提出RASR多模态重建攻击,可从深层LVLM隐藏状态恢复隐私信息,图像重建MSE降约50%、文本恢复token准确率达99%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00847 2026-08-04 cs.CV 新提交 50%

Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking

模型作为工具:用于统一多模态视觉跟踪的智能体协调框架

Wenrui Cai, Yuzhe Li, Qingjie Liu, Yunhong Wang

机构 * Beihang University(北京航空航天大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 针对现有视觉跟踪方法的瓶颈,提出ACTrack智能体协调框架,整合异构模型工具的互补优势,仅用30%可训练参数便在多类基准上实现性能超越。

Comments 21 pages, 15 Tables, 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00337 2026-08-04 cs.RO 新提交 50%

Action Chunk Scheduling for Batched Robot Policy Serving

用于批量机器人策略服务的动作块调度

Rohan Bansal, David He, Nadun Ranawaka Arachchige, Zhenyang Chen, Soobum Kim, Kexin Rong, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 效率与部署 :foundation model(abstract)

AI总结 本文提出从远程GPU向多机器人提供策略服务的调度问题,构建Armory系统,提出考虑机器人异构性的调度算法,使真实场景系统吞吐量最高提升18%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00232 2026-08-04 cs.CV 新提交 50%

Real-Time Visual Obstruction Detection in Surgical Augmented Reality

手术增强现实中的实时视觉遮挡检测

Shih-Chin Yang, Yanming Xiu, Hanting Ye, Qi Chen, Elias Rotondo, Maria Gorlatova

机构 * Duke University(杜克大学)

专题命中 效率与部署 :language model(abstract)

AI总结 针对手术AR虚拟内容遮挡手术器械的问题,提出结合VLM与分割推理的延迟感知流水线,构建伪AR基准,实现87.43%准确率、479 ms延迟,较云端基线降延迟62.90%。

Comments ISMAR 2026 Mecidal Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29052 2026-08-03 cs.RO 新提交 50%

Outcome-Guided Distillation: A Teacher-Student Framework to Advance VLM Reasoning in Autonomous Driving

结果引导蒸馏:一种提升自动驾驶中视觉语言模型推理能力的师生框架

Zeyu Dong, Yimin Zhu, Yu Wu, Yu Sun

机构 * Stony Brook University(石溪大学) Rutgers University(罗格斯大学) Sunrise Technology Inc.(晨昇科技公司)

专题命中 效率与部署 :language model(abstract)

AI总结 本研究提出结果引导蒸馏的师生框架,将VLM的显式推理与几何轨迹生成结合,在Waymo基准上使自动驾驶性能提升约24%,优于经典推理基线。

详情

展开后加载摘要…

URL PDF HTML 收藏