Calibrate Before Reason: Robust Visual Token Reduction against Semantic Drift in VLMs
推理前校准:针对视觉语言模型中语义漂移的鲁棒视觉令牌缩减
专题命中 效率与部署 :language model(abstract)
AI总结 该研究针对VLMs的语义漂移问题,提出无训练的CaRe框架,通过两个互补模块校准视觉表示,在剪枝94.4%视觉令牌时保留96.4%原性能,使推理速度提升最高2.30倍。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
推理前校准:针对视觉语言模型中语义漂移的鲁棒视觉令牌缩减
专题命中 效率与部署 :language model(abstract)
AI总结 该研究针对VLMs的语义漂移问题,提出无训练的CaRe框架,通过两个互补模块校准视觉表示,在剪枝94.4%视觉令牌时保留96.4%原性能,使推理速度提升最高2.30倍。
MeshFM:3D形状理解仅需2D特征
机构 * University of Chicago(芝加哥大学)
专题命中 效率与部署 :foundation model(abstract)
AI总结 该研究提出MeshFM框架,将2D视觉基础模型的特征提炼到3D,无需3D标注和推理优化,其2D监督训练的特征可直接用于多项3D下游任务,性能媲美3D监督方法且对极端旋转鲁棒。
Comments Project page: https://threedle.github.io/MeshFM/
Ripple:基于跨模态循环记忆的实时流音频-视频生成
机构 * China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(中国电信人工智能技术(北京)有限公司)
专题命中 效率与部署 :post-training(abstract)
AI总结 本文提出Ripple系统,通过跨模态循环记忆机制及三阶段训练方案,实现480P下约28 FPS的实时流音频-视频生成,性能优于现有方法。
Speech2Grasp:面向人形机器人的文本条件抓取检测到语音的高效数据迁移
专题命中 效率与部署 :language model(abstract)
AI总结 本研究提出Speech2Grasp框架,以数据高效方式将文本条件抓取检测模型迁移至语音输入,通过轻量级MLP投影器适配,在人形机器人实验中性能优于级联ASR流水线且延迟更低,为文本系统扩展到语音提供实用范式。
通过目标感知数据对齐实现细粒度食品图像理解
专题命中 效率与部署 :language model(abstract)
AI总结 研究针对细粒度食品图像理解,提出以数据为中心的多模态对齐方法,先选视觉相关训练子集,再细化字幕,训练互补检索专家并融合决策,提升了检索性能,完整方法检索分数超纯VLM检索两倍且更高效。
SkillGate:编码代理中经济高效的运行时恶意技能文件检测
专题命中 效率与部署 :LLM(abstract)
AI总结 研究针对编码代理中恶意技能文件检测问题,提出SkillGate安全网关,采用混合正则表达式预过滤器+大语言模型判断管道,在SkillsBench基准测试中,检测效果好、成本低、运行时开销小,相比现有工具性能显著提升。
Comments 10 pages, 5 figures
通过双重蒸馏实现严重分布偏移下视频的测试时自适应
机构 * University of São Paulo(圣保罗大学) ; Federal University of São Carlos(圣卡洛斯联邦大学)
专题命中 效率与部署 :language model(abstract)
AI总结 研究针对视频在严重分布偏移下测试时自适应难题,提出双重蒸馏的测试时自适应框架TADD,依赖轻量级投影适配器及互补损失适应目标域,在多个视频动作识别基准测试中优于现有TTA基线,显著提升识别准确率。
DeCoRAG:用于复杂文档理解的认知解耦和语义感知裁剪
专题命中 效率与部署 :language model(abstract)
AI总结 研究针对复杂文档理解中多模态检索增强生成的难题,提出DeCoRAG方法,通过认知解耦、建立语义锚及区域感知裁剪机制,提升语义通过率,减少提示令牌,在复杂文档基准测试中取得良好效果。
Comments 11 pages, 4 figures, 8 tables
UniGen-AR:通过自回归建模统一视觉生成
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳 - 香槟分校) ; Toyota Research Institute(丰田研究院)
专题命中 效率与部署 :language model(abstract)
AI总结 研究统一视觉生成问题,提出UniGen-AR框架,将通用多模态语言模型与视觉自回归解码器配对,能为多任务生成图像值输出,相比基于扩散的基线,推理延迟低达19倍,确立视觉自回归建模为统一视觉生成的高效主干。
彩色眼底摄影分析:数据、预处理和建模向多模态人工智能的共同进化
专题命中 效率与部署 :foundation model(abstract)
AI总结 研究彩色眼底摄影分析中数据、预处理和建模的共同进化,通过数据集进化、预处理范式和建模框架的相互作用进行综合概述,指出未来进展取决于三者协同优化,为临床部署等提供路线图。
Comments Survey paper, 77 pages, 18 figures, 2 tables
重新思考逻辑优化运算符:通过智能源分析实现理论驱动的运算符压缩
专题命中 效率与部署 :LLM(abstract)
AI总结 研究逻辑优化运算符,利用智能源分析制定运算符关系实现理论驱动的运算符压缩,形成TACO,实验表明其在减少运行时、节点数和层级等方面表现出色,TACO - max在特定输入行上有较好的NDP几何平均比率。
Comments 23 pages, 4 figures. Code and data: https://github.com/CODA-Team/TACO
基于Prompt-S6和语义感知知识引导的多模态目标重识别
专题命中 效率与部署 :foundation model(abstract)
AI总结 研究多模态目标重识别问题,提出基于Prompt-S6和语义感知知识引导的PRISM框架,设计语义驱动令牌剪枝和渐进融合网络两个关键组件,有效抑制背景干扰,实现三模态对齐,提升多模态目标重识别的有效性和效率。
Comments Accepted by IEEE TIP 2026. The version of record may differ slightly
INT8量化使ARM边缘推理调度不变
专题命中 效率与部署 :post-training(abstract)
AI总结 研究ARM边缘推理中神经网络输出等价类情况,发现INT8 QDQ训练后量化通过H1+H2属性使输出等价,验证了在不同ARM微内核下的位精确一致性,确定x86破坏不变性的机制,指出INT8推理可重现,行为变化轴是精度。
Comments Submitted to Journal of Edge Computing; In-review
稀疏性代价:事件驱动的SIMD和SIMT神经形态核心中的权重稀疏权衡
专题命中 效率与部署 :post-training(abstract)
AI总结 研究事件驱动神经形态推理中权重稀疏性带来的问题及权衡,通过比较三种加速器量化稀疏性代价,利用特定流程和估计评估不同剪枝水平下的神经网络推理,结果表明性能和能量依赖稀疏性处理方式,SIMT在高稀疏性下有优势。
Comments Accepted for publication in the IEEE MCSoC 2026 conference
LayoutLite:用于高效文档OCR的令牌级隐式布局分析
专题命中 效率与部署 :language model(abstract)
AI总结 研究基于视觉语言模型的端到端OCR系统效率问题,提出LayoutLite模块,通过令牌级隐式布局分析,聚合视觉表示并预测重要性分数,去除低信息令牌,实验证明其能有效加速OCR系统,提升效率且保证识别质量。
Comments 11 pages, 7 figures
IDSTune:一种用于集成数据库系统调优的多智能体协作框架
专题命中 效率与部署 :LLM(abstract)
AI总结 针对现有数据库调优方法未考虑组件相互依赖性及不足以处理多样工作负载等问题,提出IDSTune框架,通过大语言模型驱动多智能体协作联合优化多个配置组件,经实验验证其性能提升显著且调优速度快,适应性强。
路径越少,性能越好:通过布雷斯悖论理解 ZCube 拓扑结构
专题命中 效率与部署 :LLM(abstract)
AI总结 研究数据中心网络中 ZCube 拓扑结构,通过与布雷斯悖论的联系,揭示其在模型训练和推理中性能更好的原因,证明其不受悖论影响且能平衡负载,还量化了代价,指出拓扑与流量匹配比路径多样性更重要。
Comments 12 pages, 2 figures, 3 tables
基于自注意力变换器的快于奈奎斯特信号检测器
专题命中 效率与部署 :pretraining(abstract)
AI总结 研究针对FTN信号信道上的BPSK信号,提出基于变换器的接收机架构,构建端到端通信链并评估。与BCJR检测器对比,开发两阶段训练策略缩小误码率差距,分析其计算复杂度等,发现变换器可自主识别ISI记忆结构。
Comments Accepted and presented at the 2026 IEEE Signal Processing and Communications Applications Conference (SIU)
通过渐进式种子剪枝实现扩散模型的推理时间缩放
机构 * California Institute of Technology(加州理工学院)
专题命中 效率与部署 :language model(abstract)
AI总结 研究扩散模型推理时间缩放问题,提出渐进式种子剪枝方法,通过早期评估多种子并剪枝,有效利用固定计算预算,在扩散和流匹配主干上比其他基线方法在奖励引导选择及提示对齐评估上表现更优。
Comments Project page: https://www.vision.caltech.edu/psp. Code: https://github.com/rogerioagjr/psp
基于组合得分建模的恒星流分层贝叶斯推断
专题命中 效率与部署 :post-training(abstract)
AI总结 该研究旨在通过分层框架,结合多个恒星流与银河系圆周速度曲线约束推断银河系势。采用分层建模,训练神经后验估计器并通过组合得分建模组合信息。结果显示该方法有效,能降低参数不确定性,且可适应新数据集,计算成本低。
BLUE:用于高效视觉语言监控分析的语义保留视频压缩
机构 * KGraph AI Solutions Pvt. Ltd.(KGraph AI解决方案私人有限公司)
专题命中 效率与部署 :language model(abstract)
AI总结 研究持续监控视频给企业视频分析系统带来的负担问题,提出BLUE固定摄像头监控压缩方法,在VIRAT和CHAD数据集上实验,结果表明该方法能在保留VLM语义性能时降低带宽和推理成本。
Comments 17 pages, 10 figures, 6 tables
PerceptDrive:用于端到端自动驾驶的具有自适应专家路由的感知先验世界-动作建模
机构 * Tsinghua University(清华大学) ; AMap, Alibaba Group(高德软件有限公司,阿里巴巴集团)
专题命中 效率与部署 :foundation model(abstract)
AI总结 研究针对自动驾驶中感知基础模型的问题,提出PerceptDrive框架,将教师提炼先验和观察潜变量输入可训练模型,经特定分支处理、先验保留及场景条件路由,实验表明其性能领先,证实相关方法的有效性及对先验的依赖。
SOPD-SocialNav:用于视觉语言社交导航的选择性在线策略蒸馏
机构 * Graduate School of Information Science and Technology, Hokkaido University(北海道大学信息科学与技术研究生院)
专题命中 效率与部署 :language model(abstract)
AI总结 针对大规模视觉语言模型难部署、轻量级模型社交推理能力不足的问题,提出SOPD-SocialNav方法,通过基于熵的令牌选择机制及温度控制的散度目标,将社交导航知识从大型教师模型转移到轻量级学生模型,实验证明该方法有效。
Comments This paper has been accepted to 2026 WRC Symposium on Advanced Robotics and Automation (WRC SARA)
SimulS2ST-Omni:通过显式轨迹监督实现数据高效的流式语音到语音翻译
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 效率与部署 :language model(abstract)
AI总结 研究长格式流式语音到语音翻译,提出仅用约2000小时配对数据的训练方法,核心是联合文本-代码轨迹监督,双流分解减轻干扰,在质量-延迟权衡上表现出色,与先进闭源系统相当。
Comments 29 pages, 19 figures, 16 tables
通过混合交叉注意力网络的知识蒸馏和动态 INT8 量化实现高效视听事件识别
机构 * University of Porto, Porto, Portugal(葡萄牙波尔图大学) ; ResoSight, Montreal, Canada(ResoSight公司)
专题命中 效率与部署 :post-training(abstract)
AI总结 研究针对视听事件识别模型在边缘设备部署的难题,提出结合架构压缩、知识蒸馏和动态 INT8 量化的框架。构建教师与学生模型,经知识蒸馏训练学生模型,再用动态量化减小模型大小。实验表明该框架有效平衡准确率与效率,利于在资源受限平台部署。
Comments 15 pages, 4 figures
G2-Nav:用于机器人社交导航的基于视觉语言的地面与防护代价地图
专题命中 效率与部署 :language model(abstract)
AI总结 研究针对机器人社交导航问题,提出G2-Nav框架,将VLM语义推理转化为视觉语言代价地图,经开放集感知评估区域和代理,结合语义验证与高频安全检查,实现非结构化环境下安全、高效且符合社会规范的自主导航。
Comments submitted
xperception——让机器人抓取更轻松
机构 * Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)
专题命中 效率与部署 :foundation model(abstract)
AI总结 研究针对高混合低产量制造中机器人操作灵活性问题,提出零样本6D姿态估计技术xperception,利用CAD模型和基础模型语义特征,基于FreeZe算法实现毫米级精确估计,为相关行业机器人自动化提供了可扩展方案。
Comments White paper published for Ital-IA 2026
GapForge:通过覆盖差距分析进行定向编译器模糊测试
专题命中 效率与部署 :LLM(abstract)
AI总结 研究针对现代编译器代码库覆盖难问题,提出基于大型语言模型的GapForge测试生成技术,通过覆盖驱动评分、路径差异分析等步骤,将覆盖差距作为区域级目标,显著优于现有技术,提高了编译器覆盖率并发现多个实际故障。
从校正立体中进行几何蒸馏:利用对极线索进行单目深度估计
机构 * Michigan State University(密歇根州立大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 效率与部署 :foundation model(abstract)
AI总结 研究针对单目深度估计在不同环境下的难题,提出将多视图模型的尺度感知几何先验转移到单目深度基础模型的框架,通过对极蒸馏方法,无需多视图输入就能保持几何一致性,显著提升零样本度量深度估计性能,且与模型无关。
视觉场所识别中所有令牌都必不可少吗?高效推理的令牌约简实证研究
机构 * Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Shenzhen University of Advanced Technology(深圳先进技术大学)
专题命中 效率与部署 :foundation model(abstract)
AI总结 研究视觉场所识别中是否所有令牌都必要,提出首个令牌约简系统基准,在多模型和数据集上评估多种方法,从多视角研究令牌约简,揭示其特性及精度与效率权衡见解,为相关研究奠定基础。
Comments 33 pages, 8 figures, 9 tables