ReACT-CLIP: Response-Aware Test-Time Defense for Vision--Language Models
ReACT-CLIP:面向视觉-语言模型的响应感知测试时防御
专题命中 效率与部署 :language model(title,abstract)
AI总结 ReACT-CLIP是无需训练的响应感知测试时防御,通过跨噪声特征漂移与预测不稳定性得分动态调整修正强度,在多数据集上提升了CLIP类模型的对抗鲁棒性且保留干净准确率。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
ReACT-CLIP:面向视觉-语言模型的响应感知测试时防御
专题命中 效率与部署 :language model(title,abstract)
AI总结 ReACT-CLIP是无需训练的响应感知测试时防御,通过跨噪声特征漂移与预测不稳定性得分动态调整修正强度,在多数据集上提升了CLIP类模型的对抗鲁棒性且保留干净准确率。
CATP:基于置信度的令牌修剪用于伪装目标检测
机构 * VCIP, College of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学) ; Academy for Advanced Interdisciplinary Studies, Nankai University(先进交叉学科研究院,南开大学) ; School of Computer Science and Engineering, Tianjin University of Technology(计算机科学与工程学院,天津工业大学) ; School of Information and Communication Engineering, UESTC(信息与通信工程学院,电子科技大学) ; Nankai International Advanced Research Institute, Shenzhen Futian(南开国际先进研究院,深圳福田)
专题命中 效率与部署 :foundation model(title,abstract)
AI总结 本文提出CATP框架,通过分层修剪和双路径补偿机制提升伪装目标检测效率,减少计算量并保持高精度。
解耦相似性用于大视觉-语言模型中的任务感知token剪枝
机构 * Wuhan University(武汉大学) ; University of Exeter(埃克塞特大学) ; Chinese Academy of Sciences(中国科学院) ; Xi'an University of Electronic Science and Technology(西安电子科技大学)
专题命中 效率与部署 :language model(title,abstract)
AI总结 本文提出DeSAP方法,通过解耦相似性实现精准任务感知token剪枝,提升大视觉-语言模型的效率与性能,实验表明在不同基准和架构上均优于现有方法。
Comments Accepted at ACM Multimedia 2026. Camera-ready version
HyMCache:一种用于多轮大语言模型服务的基于CXL混合内存的键值缓存框架
专题命中 效率与部署 :LLM(title,abstract)
AI总结 研究针对多轮大语言模型服务中键值缓存重用问题,提出HyMCache框架集成CXL混合内存。利用多轮缓存访问特性优化DRAM管理,通过请求级前缀预取等技术,在真实原型上评估,相比其他方案有性能优势且节省DRAM。
DeCLIP:基于CLIP的多标签类增量学习的解耦提示
机构 * School of Automation, Southeast University, China(东南大学自动化学院) ; University of the Chinese Academy of Sciences, China(中国科学院大学) ; Suzhou University of Science and Technology, China(苏州科技大学) ; Computer Vision Center, Spain(西班牙计算机视觉中心)
专题命中 效率与部署 :prompting(title,abstract)
AI总结 DeCLIP通过解耦CLIP表示和引入适应性相似度温控策略,有效提升了多标签类增量学习中的分类性能和抑制假阳性率的能力。
SpectraDINO:跨红外波段的RGB视觉基础模型的模态条件适配
专题命中 效率与部署 :foundation model(title,abstract)
AI总结 SpectraDINO是适配RGB视觉基础模型的跨红外波段统一骨干网络,通过分阶段蒸馏与微调技术,在7个检测和分割基准上性能优于或媲美特定模态方法。
Comments Updated with the revised model results
SeFi-Image: 一种基于语义优先扩散的文本到图像基础模型
机构 * SeFi Team(SeFi 团队)
专题命中 效率与部署 :foundation model(title,abstract)
AI总结 提出SeFi-Image,一种基于语义优先扩散的文本到图像基础模型,在1B、2B和5B参数规模上训练,仅用125K A800 GPU小时(约Z-Image的10-20%计算量)即达到与Qwen-Image和Z-Image相当或更优的性能,并在多个基准测试中表现优异。
DopQ-ViT:面向视觉Transformer的分布友好型和离群值感知的模型后训练量化
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)
专题命中 效率与部署 :post-training(title,abstract)
AI总结 针对视觉Transformer高计算成本及后训练量化性能易降问题,提出DopQ-ViT方法,通过引入Tan量化器保留幂律分布、MAD引导的最优缩放因子选择,在分类和检测任务上优于先前PTQ方法。
Comments Accepted by Machine Intelligence Research
HeteroMosaic:为高效能边缘大语言模型推理揭示并利用异构执行机会
专题命中 效率与部署 :LLM(title,abstract)
AI总结 研究针对边缘大语言模型推理中异构资源利用不足问题,提出HeteroMosaic框架。通过异构屋顶线模型确定组合iGPU和NPU执行的时机,分解推理为微批次并进行跟踪引导协同优化。在多平台评估中取得显著加速和能耗降低,性能优于现有方案。
Comments Accepted at the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO 2026)
EchoVLM:面向通用超声智能的动态专家混合视觉语言模型
机构 * School of iOPEN, Northwestern Polytechnical University(iOPEN学院,西北工业大学) ; The First Affiliated Hospital of Sun Yat-Sen University(中山大学附属第一医院) ; College of Mechanical Engineering, Tongji University(同济大学机械工程学院)
专题命中 效率与部署 :language model(title,abstract)
AI总结 本文提出EchoVLM,通过动态混合专家架构提升超声图像的多任务诊断效率,实验表明其在报告生成任务中BLEU-1和ROUGE-1得分显著提升。
通过自监督微观结构预训练实现多晶织构的高效非线性多尺度预测
专题命中 效率与部署 :pretraining(title,abstract)
AI总结 研究针对多晶材料不同晶体织构非线性力学响应预测难题,采用自监督预训练策略,先在合成FCC微观结构上预训练编码器,再映射到ODMN参数,实现未见微观结构响应预测,误差低且加速显著,还提高数据效率,提供微观结构-性能推断框架。
DifFoundMAD:基础模型与微分变形攻击检测
机构 * Biometrics and Security Research Group(生物识别与安全研究组)
专题命中 效率与部署 :foundation model(title,abstract)
AI总结 DifFoundMAD利用视觉基础模型的泛化能力,通过轻量微调和类平衡优化,有效检测变形攻击,显著降低高安全等级下的误报率。
Comments Accepted in IJCB 2026
用于随机梯度下降优化模型的低位后训练量化前的高效调优
机构 * School of Information Science and Technology, Beijing University of Technology(北京工业大学信息科学与技术学院)
专题命中 效率与部署 :post-training(title,abstract)
AI总结 研究针对低位后训练量化性能易降问题,提出ETBQ方法,在随机梯度下降优化模型的PTQ前进行预处理调优,通过从量化误差分布采样扰动优化全精度模型,实验证明该方法能提升不同任务的低位PTQ性能。
Comments v2 revision: Added hyperparameter settings of all experiments in appendix, fixed minor typos, adjusted figure layout, polished experimental analysis. 12 pages, 10 figures, submitted to IEEE Transactions on Neural Networks and Learning Systems (TNNLS). Code available at https://github.com/xpxpxp2001xpxpxp/ETBQ
视觉语言模型中用于保守令牌压缩的谱热流
机构 * School of Information Science/National Key Laboratory of Deep Space Exploration University of Science and Technology of China(中国科学技术大学信息科学学院/深空探测国家实验室)
专题命中 效率与部署 :language model(title,abstract)
AI总结 研究针对视觉语言模型推理成本高及现有令牌剪枝方法的问题,提出无需训练的SpecFlow框架,通过谱热流等操作实现保守压缩,在多方面优于现有方法,平衡了效率与准确性。
Comments Accepted by ICML 2026
基于基础模型的遥感影像语义变化检测
专题命中 效率与部署 :foundation model(title,abstract)
AI总结 本文提出PerASCD框架,通过模块化级联门控解码器整合多尺度特征,提升语义变化检测的鲁棒性和泛化能力,实验显示其在Sek评分上达到新高。
在手术视觉基础模型中深度的作用:一项关于RGB-D预训练的实证研究
机构 * Vanderbilt University(范德比尔大学) ; Intuitive Surgical Inc.(Intuitive Surgical公司)
专题命中 效率与部署 :foundation model(title,abstract)
AI总结 本研究通过比较不同预训练方法,发现几何感知的多模态预训练能显著提升手术视觉模型的性能,且无需改变推理架构。
Comments Inaccurate findings
LaViDa:用于多模态理解的大型扩散语言模型
机构 * UCLA(加州大学洛杉矶分校) ; Panasonic AI Research(松下人工智能研究) ; Adobe Research(Adobe研究) ; Salesforce Research(Salesforce研究)
专题命中 效率与部署 :language model(title,abstract)
AI总结 研究针对现有视觉语言模型在快速推理和可控生成方面的不足,提出基于离散扩散模型构建 LaViDa 系列视觉语言模型,采用多种新技术,在多模态基准测试中性能出色,成为自回归视觉语言模型的有力替代。
Comments 26 pages, 8 figures
局部观察:以对象为中心的视觉Transformer作为高效分割的基础模型
机构 * Neuro-Cognitive Modeling Group, University of Tübingen, Germany(图宾根大学神经认知建模组)
专题命中 效率与部署 :foundation model(title,abstract)
AI总结 研究针对当前分割模型浪费计算资源问题,提出FLIP模型,通过生物启发的注意力从输入中采样多分辨率补丁实现对象分割。该模型参数高效,在多个基准测试中表现优于SAM等模型,能准确分割小对象,为实时视觉提供可能,可作强大基础模型。
PhyMAGIC:基于置信度引导的大语言模型的物理运动感知生成推理
机构 * Department of Computer Science \& Engineering, University of Nevada, Reno, USA School of Software Technology, Zhejiang University, China
专题命中 效率与部署 :LLM(title,abstract)
AI总结 针对3D内容生成中动态模型物理一致性问题,PhyMAGIC提出无需训练的框架,整合图像到视频扩散模型、大语言模型置信度引导推理及可微物理模拟器,通过迭代优化和模拟反馈生成物理一致的运动,性能优于现有方法。
Comments This work is accepted by ECCV 2026
Traffic-MoE:用于网络流量安全分析的稀疏基础模型
专题命中 效率与部署 :foundation model(title,abstract)
AI总结 针对加密和协议混淆致传统流量检测方法过时、现有大模型计算成本高的问题,提出Traffic-MoE稀疏基础模型,通过动态路由解耦模型容量与计算开销,在多任务中性能优,提升了吞吐量、降低延迟并优化内存,还具鲁棒性和少样本检测能力。
SIMPLER:通过相似性引导的层剪枝实现高效的地球观测基础模型适应
机构 * Centro Singular de Investigación en Tecnoloxías Intelixentes (CiTIUS), Universidade de Santiago de Compostela, Spain(智能技术研究中心(CiTIUS),圣地亚哥-德孔波斯特拉大学,西班牙) ; Departmento de Electrónica e Computación, Universidade de Santiago de Compostela, Spain(电子与计算系,圣地亚哥-德孔波斯特拉大学,西班牙) ; IBM Research Europe, Zurich, Switzerland(IBM欧洲研究院,瑞士苏黎世)
专题命中 效率与部署 :foundation model(title,abstract)
AI总结 SIMPLER通过在适应前选择有效的模型深度,减少推理和部署成本,同时在无需梯度、幅度启发式或超参数调优的情况下,通过预训练视觉变换器中更深层的表示稳定性,选择冗余层,实现参数减少79%且性能保留94%,提升训练和推理速度。
Z-Image: 一种基于单流扩散Transformer的高效图像生成基础模型
机构 * Alibaba Group(阿里巴巴集团)
专题命中 效率与部署 :foundation model(title);post-training(abstract)
AI总结 提出Z-Image,一种6B参数的高效图像生成基础模型,采用可扩展单流扩散Transformer架构,通过优化数据基础设施和训练流程,仅用314K H800 GPU小时完成训练,性能媲美顶级商业模型。
增强视觉语言模型以理解多样传感器:成本高效的优化与基准测试
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)
专题命中 效率与部署 :language model(title,abstract)
AI总结 提出传感器感知属性微调(SAFT)与多样负属性(DNA)优化,利用少量传感器数据克服RGB中心偏见,无需修改模型架构,显著提升非RGB传感器图像理解,并发布首个综合基准VS-TDX。
Comments The manuscript was posted before all internal disclosure and documentation checks were completed. We are withdrawing this version to avoid confusion while the authors complete the necessary review process
通过蒸馏视觉基础模型快速部署设备端眼动追踪
机构 * Meta Reality Labs(Meta现实实验室) ; University of Michigan(密歇根大学)
专题命中 效率与部署 :foundation model(title,abstract)
AI总结 本文提出DistillGaze框架,通过合成数据和真实数据蒸馏视觉基础模型,实现高精度设备端眼动追踪,减少58.62%的中位眼动误差,模型轻量适合实时部署。
GreenRFM:通过以监督为中心的预训练学习资源高效的放射学视觉-语言基础模型
机构 * School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China (USTC)(生物医学工程学院,生命科学与医学系,中国科学技术大学) ; Center for Medical Imaging, Robotics, Analytic Computing & Learning (MIRACLE)(医学影像、机器人、分析计算与学习中心) ; Suzhou Institute for Advanced Research, USTC(苏州先进研究院,中国科学技术大学) ; Department of Radiology, The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine, USTC(放射科,中国科学技术大学第一附属医院,生命科学与医学系,中国科学技术大学) ; T Magnetic Resonance Translational Medicine Research Center, Department of Radiology, The First Affiliated Hospital (Southwest Hospital) of Army Medical University(7T磁共振转化医学研究中心,放射科,中国医学大学第一附属医院(西南医院))
专题命中 效率与部署 :foundation model(title,abstract)
AI总结 提出GreenRFM框架,通过将噪声报告转化为结构化诊断信号,以监督为中心预训练,在有限资源下实现高效3D放射学视觉-语言表示,零样本CT-RATE AUC达84.8。
ViP-VL:基于向量量化学习的越南语自监督语音预训练模型
机构 * VinUniversity(越南 Vin 大学)
专题命中 效率与部署 :pretraining(title,abstract)
AI总结 提出ViP-VL模型,通过声学堆叠、感受野对齐和掩码选择策略,在BEST-RQ框架上实现高效自监督预训练,在越南语ASR、情感识别、方言分类和说话人验证四项任务上取得最优结果。
Comments Accepted to INTERSPEECH 2026
机器学习原子间势基础模型中的六个开放问题
专题命中 效率与部署 :foundation model(title,abstract)
AI总结 本文定义机器学习原子间势基础模型,并探讨六个关键开放问题,包括数据多样性、模型泛化、可迁移性、不确定性量化、计算效率与物理一致性,以指引未来研究。
利用语言模型助手发现自杀预防的干预机会
专题命中 效率与部署 :language model(title,abstract)
AI总结 研究利用语言模型作为高效助手,辅助国家暴力死亡报告系统(NVDRS)的数据标注和专家工作,发现模型在50个变量上约85%的标注一致,38%的不一致可通过专家审查发现标注差异,并引入人机协同算法优化新变量标注流程。
Comments Project Website: https://dill-lab.github.io/interventions_lm_assistants/
Journal ref In Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics, 2026
OPD-V:结合模态平衡的视觉在线策略自蒸馏
机构 * National University of Singapore(新加坡国立大学) ; Ludwig Maximilian University of Munich(慕尼黑大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; Sun Yat-sen University(中山大学)
专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI
AI总结 该研究针对多模态大语言模型的模态不平衡问题,提出视觉在线策略自蒸馏范式OPD-V,通过正、负教师模型实现模态平衡,在多基准与骨干上提升推理性能并降低训练成本。
Comments Corrected the uploaded manuscript. Project Page:https://github.com/aniri15/OPD-V
双维度一致性:在适应性推理时间扩展中平衡预算与质量
机构 * Xi’an Jiaotong University(西安交通大学)
专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出双维度一致性框架,通过结合置信度加权贝叶斯协议与趋势感知分层剪枝,平衡推理预算与质量,减少10倍以上token消耗并保持高精度。