arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1048 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1048 篇

2511.05479 2026-08-05 cs.NE physics.ins-det 版本更新 50%

Quantization Effects of Artificial Neural Networks for Embedded Edge-Computing Applications

人工神经网络量化效果用于边缘计算应用

Alperen Aksoy, Ilja Bekman, Vesselin Dimitrov, Qader Dorosti, Chimezie Eguzo, Sarah Fleitmann, Christian Grewing, Fabian Hader, Andre Zambanini, Stefan van Waasen

专题命中 效率与部署 :post-training(abstract)

AI总结 本文研究了量化神经网络在资源受限的科学应用中的使用,包括半导体量子比特的自动校准和科学粒子探测器。通过评估PTQ、QAT和超低比特二值神经网络(BNNs)在延迟和资源使用方面的权衡,发现PTQ在U型CNN架构中可将内存使用减少四倍,同时保持或略微提高分割精度。对于非可微的定制BNNs训练,提出了一种基于遗传算法的硬件受限学习方法,展示了适用于直接转换为VHDL的LUT-based BNN架构。该方法在无需专用DSP或BRAM资源的情况下实现了纳秒级的推理延迟。

Comments deRSE26 proceedings pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17674 2026-08-05 cs.CV 版本更新 50%

SVL: Empowering Spiking Neural Networks for Efficient 3D Open-World Understanding

SVL:基于脉冲的视觉-语言预训练用于高效的3D开放世界理解

Xuerui Qiu, Peixi Wu, Yaozhi Wen, Shaowei Gu, Yuqi Pan, Xinhao Luo, Bo XU, Guoqi Li

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院) Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学)

专题命中 效率与部署 :pretraining(abstract)

AI总结 SVL提出基于脉冲的视觉-语言预训练框架,通过多尺度三元组对齐和可重参数化的视觉-语言整合,提升SNN在3D开放世界理解中的性能,实现高效零样本3D分类和多模态问答。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23265 2026-08-04 cs.CV 版本更新 50%

WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation

WaveZip:用于视频令牌压缩的小波驱动时空解耦

Yuhui Zeng, Wang Chen, Jinfa Huang, Tianyu Xie, Yongdong Luo, Jiayi Ji, Xiawu Zheng, jiebo Luo

机构 * Media Analytics and Computing Lab, Xiamen University(厦门大学媒体分析与计算实验室) Department of Computer Science, University of Rochester(罗切斯特大学计算机科学系)

专题命中 效率与部署 :language model(abstract)

AI总结 针对长视频理解中视觉令牌计算成本高的问题,提出WaveZip框架,利用离散小波变换分离时空信号,无需特定任务训练,能集成到LVLMs提升推理效率,在长视频理解基准测试中表现优异。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14749 2026-08-04 eess.AS cs.CV 版本更新 50%

WanSong v1.0 Technical Report

万松v1.0技术报告

Binghui Chen, Pandeng Li, Yu Liu, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 效率与部署 :foundation model(abstract)

AI总结 针对音乐生成难题,提出万松方法,它是基于扩散的模型,可直接生成高保真多语言长歌曲并输出双声道,通过步长蒸馏加快推理,为微调定制提供途径,助力下游编辑任务。

Comments Wan Team, Alibaba Group

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02817 2026-08-04 cs.CV 版本更新 50%

MMPhysVideo: Physically Plausible Video Generation Through Joint RGB-Perception Modeling

MMPhysVideo: 通过联合多模态建模提升视频生成的物理合理性

Shubo Lin, Xuanyang Zhang, Wei Cheng, Weiming Hu, Gang Yu, Jin Gao

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) StepFun(阶跃星辰) Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(多模态信息超级智能安全北京市重点实验室) School of Information Science and Technology, Shanghai Tech University(上海科技大学信息科学与技术学院)

专题命中 效率与部署 :language model(abstract)

AI总结 MMPhysVideo通过联合多模态建模提升视频生成的物理合理性,将感知线索统一为伪RGB格式,提出双向控制教师架构以减少跨模态干扰,并通过MMPhysPipe构建物理丰富的多模态数据集,提升物理合理性和视觉质量。

Comments Project Page: https://shubolin028.github.io/MMPhysVideo-Page

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27577 2026-08-04 cs.CV cs.RO 版本更新 50%

Structured Observation Language for Efficient and Generalizable Vision-Language Navigation

结构化观察语言用于高效且通用的视觉-语言导航

Daojie Peng, Fulong Ma, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 效率与部署 :language model(abstract)

AI总结 本文提出SOL-Nav框架,通过将视觉观察转化为结构化语言描述,提升视觉-语言导航的效率和泛化能力,实验表明其在减少模型规模和训练数据依赖方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27886 2026-08-03 cs.CR 版本更新 50%

Don't Trust the AI Ecosystem: Analyzing Privacy Leakage in Compromised Open-Source Components

不要信任AI生态系统:分析受感染开源组件中的隐私泄露

Jin-Seong Kim, Han-Ju Lee, Seok-Won Hong, Takeshi Takahashi, Chansu Han, Tomohiro Morikawa, Seok-Hwan Choi

专题命中 效率与部署 :post-training(abstract)

AI总结 该研究提出GradLock新型训练时注入攻击,将敏感数据注入模型参数,可从最终模型提取像素级完美数据,鲁棒性强且难被检测,揭示AI供应链安全存在严重盲点。

Comments Extended version of the paper to appear in ACM CCS 2026 (17 pages, 10 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18169 2026-08-03 cs.CR cs.ET 版本更新 50%

RRAM-DP: Device-Calibrated Differential Privacy for In-Memory Edge Learning

RRAM-DP:用于内存边缘学习的设备校准差分隐私

Kwunhang Wong, Jichang Yang, Karl M. H. Lai, Hegan Chen, Songqi Wang, Wei Xuan, Ning Lin, Han Wang, Xiaojuan Qi, Zhongrui Wang

专题命中 效率与部署 :pretraining(abstract)

AI总结 研究边缘AIoT系统隐私问题,提出RRAM-DP硬件-算法协同设计,利用RRAM随机写入行为实现差分隐私保护。在CIFAR-10/100等数据集上实验,该方法准确率下降小,还能大幅节省能量、加速训练,实现高效隐私保护的内存训练。

Comments International Conference on Computer-Aided Design 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12753 2026-07-31 cs.CV 版本更新 50%

RFMSR: Residual Flow Matching for Image Super-Resolution

RFMSR:用于图像超分辨率的残差流匹配

Shuwei Huang, Tianyao Luo, Jicheng Liu, Pan Zhou

机构 * Huazhong University of Science and Technology(华中科技大学) Wuhan University(武汉大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 研究针对图像超分辨率,提出残差流匹配框架RFMSR,将源分布集中于LQ潜变量以减少传输距离并保留结构先验,采用两阶段训练策略,实验证明该方法相比SOTA实现了相当甚至更优的感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12287 2026-07-31 cs.RO 版本更新 50%

SharedAssembly: A Data Collection Approach via Shared Tele-Assembly

SharedAssembly:一种通过共享远程装配实现的数据收集方法

Yansong Wu, Xiao Chen, Yu Chen, Hamid Sadeghian, Fan Wu, Zhenshan Bing, Alois Knoll

专题命中 效率与部署 :foundation model(abstract)

AI总结 SharedAssembly是一种新型共享自主双边远程操作框架,可高效采集高精度小间隙装配数据,消除技能差距,新手操作员使用该框架即可达到甚至超过传统系统中专家的表现。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22094 2026-07-30 cs.CR cs.SD 版本更新 50%

Transforming Keystroke Noise to Text: Self-Supervised Acoustic Eavesdropping Attacks on Keyboards

将按键声音转换为文本:对键盘的自监督声学窃听攻击

Atsunori Okada, Akira Ito, Rei Ueno, Yuichi Hayashi, Naofumi Homma

专题命中 效率与部署 :language model(abstract)

AI总结 研究提出自监督声学窃听攻击,结合无监督声学聚类、Transformer语言模型推理和迭代自训练,仅通过按键声音重建文本。在多种场景测试中,少量按键就能实现高准确率,揭示了现实的隐私风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02294 2026-07-30 cs.CV 版本更新 50%

Improving Knowledge Distillation Under Unknown Covariate Shift Through Confidence-Guided Data Augmentation

通过置信度引导的数据增强改进未知协变量偏移下的知识蒸馏

Niclas Popp, Kevin Alexander Laube, Matthias Hein, Lukas Schott

机构 * Bosch Center for Artificial Intelligence(博世人工智能中心) University of Tübingen(图宾根大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 针对未知协变量偏移下知识蒸馏效果受限的问题,提出置信度引导的扩散数据增强策略,经实验验证可提升多数据集上的相关准确率与虚假特征得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05899 2026-07-29 cs.CV cs.GR 版本更新 50%

HOLODECK 2.0: Vision-Language-Guided 3D World Generation with Editing

HOLODECK 2.0:基于视觉-语言的3D世界生成与编辑

Zixuan Bian, Ruohan Ren, Yue Yang, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学) Cornell University(康奈尔大学)

专题命中 效率与部署 :language model(abstract)

AI总结 HOLODECK 2.0通过视觉-语言模型生成高质量3D场景并支持交互式编辑,提升游戏设计效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19182 2026-07-28 cs.DC 版本更新 50%

ARBITER: Guarded Agentic Control for SLO-Oriented Kubernetes Remediation

ARBITER:面向服务水平目标的Kubernetes修复的受保护代理控制

Pooyan Habibi, Alberto Leon-Garcia

专题命中 效率与部署 :LLM(abstract)

AI总结 研究在Kubernetes微服务上维护SLO的难题,提出ARBITER受保护控制平面,构建因果资源图等,分离规划与执行,支持多种规划方式。通过实验评估其在选择修复操作和下游目标等方面的效果,展示了优于HPA/仅资源控制的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18681 2026-07-27 cs.CV 版本更新 50%

Moving Beyond Diversity: Visual Token Pruning as Subspace Reconstruction for Efficient VLMs

超越多样性:将视觉令牌剪枝视为子空间重建以实现高效视觉语言模型

Jaeyeon Lee, Shunjie Wen, Dong-Wan Choi

机构 * Inha University(延世大学)

专题命中 效率与部署 :language model(abstract)

AI总结 提出SPARE方法,将令牌剪枝重构为子空间重建问题,通过迭代选择投影残差大的令牌进行剪枝,并引入反相关性机制保留上下文信息,在LLaVA上剪枝94%令牌仍保持95%性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00543 2026-07-24 cs.CV 版本更新 50%

ETC: Extreme Token Compression via Task-aware Visual Information Distillation in VLMs

ETC: 通过任务感知的视觉信息蒸馏实现视觉语言模型中的极端令牌压缩

Yiling Gao, Hongchen Wei, Zhenzhong Chen

机构 * School of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感与信息工程学院)

专题命中 效率与部署 :language model(abstract)

AI总结 提出ETC框架,基于变分信息蒸馏原理,在减少输入令牌数量时最小化任务损失,通过文本-图像交叉注意力加权视觉特征并引入变分信息蒸馏,实现单令牌压缩下仍保持强任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10667 2026-07-24 eess.IV 版本更新 50%

CPSNet: Physics-Inspired Label-Free Deep Unfolding for Lung Ultrasound B-Line Detection

CPSNet:用于肺部超声 B 线检测的物理启发式无标签深度展开

Tianqi Yang, Oktay Karakuş, Nantheera Anantrasirichai, Marco Allinovi, Alin Achim

专题命中 效率与部署 :prompting(abstract)

AI总结 提出用于肺部超声图像分析的 CPSNet 无标签深度展开框架,将柯西近端分裂算法展开为网络架构,引入新损失函数,无监督训练,用于 B 线检测时比传统方法更具优势,能有效辅助临床诊断。

Comments 21 pages, 8 figures, Digital Signal Processing

Journal ref Yang, T., Karakus, O., Anantrasirichai, N., Allinovi, M., & Achim, A. (2026). CPSNet: Physics-Inspired Label-Free Deep Unfolding for Lung Ultrasound B-Line Detection. Digital Signal Processing, 184, 106399

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13359 2026-07-23 cs.MA 版本更新 50%

Learning Latency-Aware Orchestration for Multi-Agent Systems

学习多智能体系统的延迟感知编排

Xi Shi, Mengxin Zheng, Qian Lou

专题命中 效率与部署 :LLM(abstract)

AI总结 针对多智能体系统推理延迟高的问题,提出延迟感知多智能体系统(LAMaS)。训练时通过约束优化学习延迟感知执行图,推理时用轻量级控制器补充。实验显示其在降低端到端延迟超50%的同时保持精度,且具模块化可移植性。

Comments This submission was intended to be an updated version of arXiv:2601.10560. Any subsequent updates will appear there

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17900 2026-07-22 cs.SD 版本更新 50%

Harness TTS: Towards Context-Aware Expressive Speech Synthesis with Harness Layer

利用TTS:借助利用层实现上下文感知的富有表现力的语音合成

Shengfan Shen, Di Wu, Xingchen Song, Dinghao Zhou, Pengyu Cheng, Sixiang Lyu, Jian Luan, Shuai Wang

机构 * Xiaomi Inc.(小米公司) Nanjing University(南京大学)

专题命中 效率与部署 :LLM(abstract)

AI总结 研究针对语音助手富有表现力的语音合成中灵活风格控制的需求,提出Harness TTS轻量级控制层,通过封闭集提示 - 工具路由实现风格控制,实验证明其在路由和合成任务中表现出色,为语音助手表达控制提供实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19541 2026-07-21 cs.MA cs.HC 版本更新 50%

FOCAL: Filtered On-device Continuous Activity Logging for Efficient Personal Desktop Summarization

FOCAL:过滤的本地连续活动日志用于高效的个人桌面摘要

Haoran Yin, Zhiyuan Wen, Jiannong Cao, Bo Yuan, Ruosong Yang

专题命中 效率与部署 :language model(abstract)

AI总结 FOCAL通过多代理系统实现高效的本地桌面流摘要,减少资源消耗并提升任务召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16636 2026-07-21 cs.CV 版本更新 50%

REGLUE Your Latents with Global and Local Semantics for Entangled Diffusion

利用全局和局部语义重新绑定潜在信息以进行纠缠扩散

Giorgos Petsangourakis, Christos Sgouropoulos, Bill Psomas, Theodoros Giannakopoulos, Giorgos Sfikas, Ioannis Kakogeorgiou

机构 * University of West Attica(西阿提卡大学) VRG, FEE, Czech Technical University in Prague(布拉格捷克技术大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 研究针对潜在扩散模型语义监督不足问题,提出REGLUE框架,联合建模VAE图像潜在信息、局部VFM语义和全局[CLS]令牌,用轻量级卷积语义压缩器聚合特征,经实验验证该框架能提升FID并加速收敛。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13960 2026-07-20 cs.RO 版本更新 50%

GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch

GigaWorld-Policy-0.5:由自动研究赋能的更快更强的世界行动模型

GigaWorld Team, Angen Ye, Angyuan Ma, Boyuan Wang, Chaojun Ni, Fangzheng Ye, Guan Huang, Guo Li, Guosheng Zhao, Haodong Yan, Hengtao Li, Jiwen Lu, Kai Wang, Mingming Yu, Qitang Hu, Qiuping Deng, Songling Liu, Xiaoyu Tian, Xiaofeng Wang, Xinyu Zhou, Xiuwei Xu, Xinze Chen, Yang Wang, Yejun Zeng, Yifan Chang, Yun Ye, Zhenyu Wu, Zhanqian Wu, Zheng Zhu

机构 * GigaAI(字节跳动人工智能实验室) Tsinghua University(清华大学)

专题命中 效率与部署 :pretraining(abstract)

AI总结 研究旨在改进机器人策略学习,提出GigaWorld-Policy-0.5这一增强型以动作中心的WAM。预训练采用混合策略加强视觉与动作耦合,推理引入新架构提升效率,还用自动研究管道搜索训练配置,有效提升了机器人控制推理效率并保留训练优势。

Comments project page: https://open-gigaai.github.io/giga-world-policy/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30060 2026-07-17 cs.CV 版本更新 50%

Towards Consistent Video Geometry Estimation

Towards Consistent Video Geometry Estimation

Zhu Yu, Jingnan Gao, Runmin Zhang, Lingteng Qiu, Zhengyi Zhao, Rui Peng, Yichao Yan, Kejie Qiu, Siyu Zhu, Zilong Dong, Si-Yuan Cao, Hui-Liang Shen

机构 * Zhejiang University(浙江大学) Tongyi Lab, Alibaba Group(阿里云实验室) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出ViGeo,一种基于纯Transformer架构的前馈基础模型,通过动态分块注意力机制和基于补全的数据精炼框架,实现视频序列中空间密集且时间一致的几何(深度、法线、点图)估计,在在线、离线及长视频任务中达到最先进性能。

Comments Project webpage: https://pkqbajng.github.io/ViGeo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15587 2026-07-16 cs.RO 版本更新 50%

Perfect Demo Makes Poor Teacher: Learning Robust Alignment from Critical Motion Segments

完美演示造就差劲教师:从关键运动片段学习鲁棒对齐

Mingyu Liu, Zeju Li, Jiuhe Shu, Hanqing Wang, Yuhao Chao, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Hong Kong University of Science and Technology (GZ)(香港科技大学(广州)) Nanjing University(南京大学)

专题命中 效率与部署 :language model(abstract)

AI总结 针对精细操作中流畅演示因压缩关键对齐动作导致策略学习不足的问题,提出数据级重采样和表示级STAIR特征,利用稠密运动感知监督提升策略鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27792 2026-07-16 cs.RO 版本更新 50%

Motubrain: An Advanced World Action Model for Robot Control

MotuBrain: 一种先进的世界动作模型用于机器人控制

Motubrain Team, Chendong Xiang, Fan Bao, Haitian Liu, Hengkai Tan, Hongzhe Bi, James Li, Jiabao Liu, Jingrui Pang, Kiro Jing, Louis Liu, Mengchen Cai, Rongxu Cui, Ruowen Zhao, Runqing Wang, Shuhe Huang, Yao Feng, Yinze Rong, Zeyuan Wang, Jun Zhu

机构 * MotuBrain Team(MotuBrain团队)

专题命中 效率与部署 :post-training(abstract)

AI总结 MotuBrain提出一种统一的世界动作模型,结合视频和动作,支持多项任务,实现高效部署和高精度控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16855 2026-07-16 cs.CV 版本更新 50%

When W4A4 Breaks Camouflaged Object Detection: Token-Group Dual-Constraint Activation Quantization

当W4A4打破伪装物体检测:令牌组双约束激活量化

Tianqi Li, Wenyu Fang, Xin He, Xue Geng, Xu Cheng, Yun Liu

机构 * VCIP, College of Computer Science, Nankai University(南开大学计算机科学学院VCIP) School of Computer Science and Engineering, Tianjin University of Technology(天津工业大学计算机科学与工程学院) Institute for Infocomm Research, A*STAR(A*STAR信息与通信研究所) Academy for Advanced Interdisciplinary Studies, Nankai University(南开大学先进跨学科研究院) Nankai International Advanced Research Institute, Shenzhen Futian(南开国际先进研究院,深圳福田)

专题命中 效率与部署 :post-training(abstract)

AI总结 研究W4A4量化Transformer基于的伪装物体检测,发现背景令牌主导激活范围的问题,提出COD-TDQ方法通过令牌组双约束激活量化提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16103 2026-07-16 cs.CV cs.GR 版本更新 50%

NanoGS: Training-Free Gaussian Splat Simplification

NanoGS: 无训练高斯点简化

Butian Xiong, Rong Liu, Tiantian Zhou, Meida Chen, Zhiwen Fan, Andrew Feng

机构 * USC Institute for Creative Technologies(USC创意科技研究所) Texas A\&M University(德克萨斯农工大学)

专题命中 效率与部署 :post-training(abstract)

AI总结 本文提出NanoGS,一种无需训练的高斯点简化框架,通过局部成对合并实现紧凑表示,保留场景结构与外观,适用于现有高斯点模型,运行高效且易于集成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20317 2026-07-16 cs.AR 版本更新 50%

VersaQ-3D: Architecture Support for Visual Geometry Grounded Transformers via Versatile Quantization

VersaQ-3D:通过通用量化对视觉几何基础变压器的架构支持

Yipu Zhang, Jintao Cheng, Xingyu Liu, Zeyu Li, Carol Jingyi Li, Jin Wu, Lin Jiang, Ceyu Xu, Yuan Xie, Jiang Xu, Wei Zhang

专题命中 效率与部署 :LLM(abstract)

AI总结 研究针对视觉几何基础变压器(VGGT)因参数规模大及量化困难限制设备部署的问题,提出VersaQ-3D算法-架构协同设计框架,算法上有无校准量化方法,架构上设计可重构加速器,实现低比特高精度及显著加速,能在边缘设备高效进行3D重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09322 2026-07-16 cs.CV 版本更新 50%

Attentive multilayer fusion for vision transformers

视觉Transformer的注意力多层融合

Laure Ciernik, Marco Morik, Lukas Thede, Luca Eyring, Shinichi Nakajima, Zeynep Akata, Lukas Muttenthaler

机构 * Hector Fellow Academy(海克荣誉院士协会) BIFOLD University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Helmholtz Munich(亥姆霍兹慕尼黑) Technical University Munich(慕尼黑技术大学) MCML(慕尼黑机器学习中心) Aignostics, Berlin(柏林Aignostics) RIKEN AIP(理化学研究所AIP)

专题命中 效率与部署 :foundation model(abstract)

AI总结 研究如何让大规模基础模型有效适应下游任务,提出注意力多层融合方法,通过动态融合视觉Transformer各层表示,识别最相关层并结合不同层次线索,在多数据集和模型上比标准线性探测有显著提升,强调中间层价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26740 2026-07-14 cs.CV 版本更新 50%

LiveEdit: Towards Real-Time Diffusion-Based Streaming Video Editing

LiveEdit:迈向基于扩散的实时流式视频编辑

Xinyu Wang, Chongbo Zhao, Fangneng Zhan, Yue Ma

机构 * THU(清华大学) HKUST(香港科技大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出一种因果逐帧编辑的流式视频框架,通过三阶段蒸馏将双向模型能力迁移至单向流式编辑器,结合AR掩码缓存实现12.66 FPS的实时编辑,并保持背景稳定。

Comments Accepted by ECCV 2026, Project page: https://live-edit.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏