arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1933 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1933 篇

2606.18478 2026-06-24 cs.CV 新提交 50%

Data-Forcing Distillation: Restoring Diversity and Fidelity in Few-Step Video Generation

数据强制蒸馏:恢复少步视频生成中的多样性和保真度

Siyi Chen, Shaowei Liu, Yixuan Jia, Zian Wang, Huan Ling, Qing Qu, Jun Gao

机构 * University of Michigan(密歇根大学) NVIDIA(英伟达) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与部署 :post-training(abstract)

AI总结 针对分布匹配蒸馏(DMD)在少步视频生成中出现的模式坍塌和过饱和问题,提出数据强制蒸馏(DFD)框架,通过教师评分差异引导学生接近真实数据分布,仅需一行代码修改即可恢复多样性和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22794 2026-06-23 cs.RO 新提交 50%

UniFS: Unified Fast-to-Slow Hierarchical Architecture for Vision-Language-Action Models

UniFS:面向视觉-语言-动作模型的统一快慢层次架构

Lin Sun, Zhiwei Guan, Conglin Wang, Zihong Chen, Jianhai Yu, Zongsheng Li, Boyong He, Tao Sun, Jiale Cao, Lige Liu

机构 * Tianjin University(天津大学) Yiwu Research Institute of Fudan University(复旦大学义乌研究院)

专题命中 效率与部署 :language model(abstract)

AI总结 提出UniFS统一快慢层次架构,通过分层更新频率、潜向量反转和多级监督策略,解决快慢双系统视觉-语言-动作模型中的频率困境和信息耦合问题,在LIBERO上实现98.3%成功率并提速2.1倍。

Comments Code is opensourced at https://github.com/linsun449/UniFS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22779 2026-06-23 cs.CR cs.CV 新提交 50%

DE-FIVE: Detecting Malicious Image Prompts via Fourier Features and Image Vector Embeddings

DE-FIVE: 通过傅里叶特征和图像向量嵌入检测恶意图像提示

Xingwei Zhong, Varun Sharma, Kar Wai Fok, Vrizlynn L. L. Thing

专题命中 效率与部署 :language model(abstract)

AI总结 提出DE-FIVE框架,利用傅里叶域特征和图像向量嵌入,无需训练即可检测针对视觉语言模型的恶意图像提示,包括间接提示注入攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21945 2026-06-23 physics.optics 新提交 50%

Beyond Data-Driven: How Physics-Informed Neural Networks are Reshaping Multi-Physics Design and Discovery

超越数据驱动:物理信息神经网络如何重塑多物理场设计与发现

Amir H. M. Labeb, Basmala Sallam, Abdelrahman W. Elsayed, Islam I. Abdulaal, Amany M. Kamal, Omar A. M. Abdelraouf

专题命中 效率与部署 :post-training(abstract)

AI总结 本文综述了物理信息神经网络(PINNs)在多物理场建模中的最新进展,强调其通过将物理定律嵌入训练目标,实现数据高效、物理一致的前向建模、逆向设计和方程发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21796 2026-06-23 cond-mat.mtrl-sci 新提交 50%

The FAST Framework: Developing a Data-Efficient Machine Learning Potential to Decode Superionic Transition-Induced Thermophysical and Kinetic Anomalies in UO2 under Extreme Conditions

FAST框架:开发数据高效的机器学习势以解码极端条件下UO2中超离子转变诱导的热物理和动力学异常

Fengnian Zhuang, Gaosheng Yan, Hong Chen, Yi Zhang, Wenshan Yu, Minglong Xu, Shengping Shen

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出FAST框架,通过主动学习和超离子目标采样构建仅500个构型的数据集,微调基础模型得到UO2的机器学习势,准确预测超离子转变引起的热物理和动力学异常,并揭示其微观机制。

Comments 51 pages,14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16917 2026-06-23 cs.RO 新提交 50%

Unified Motion-Action Modeling for Heterogeneous Robot Learning

统一运动-动作建模用于异构机器人学习

Yunhao Cao, Shitong Liu, Chao Feng, Meryl Zhang, Xuanchen Lu, Andrew Owens, Kuan Fang

机构 * Cornell University(康奈尔大学)

专题命中 效率与部署 :pretraining(abstract)

AI总结 提出UMA模型,利用3D物体运动轨迹作为共享接口,通过掩码生成目标统一视觉运动控制和动力学建模,实现跨异构数据源的多任务预训练,并在部署时支持多种推理模式。

Comments https://uma-manipulation.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20543 2026-06-19 cs.CV 新提交 50%

SSD: Spatially Speculative Decoding Accelerates Autoregressive Image Generation

SSD: 空间推测解码加速自回归图像生成

Shilong Xiang, Zirui Zhang, Lijun Yu, Chengzhi Mao

机构 * Rutgers University(罗格斯大学)

专题命中 效率与部署 :language model(abstract)

AI总结 提出空间推测解码(SSD),利用二维空间相关性同时预测相邻水平与下方令牌,突破视觉推理中的内存瓶颈,实现高达13.3倍的自回归图像生成加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20130 2026-06-19 cs.CV 新提交 50%

SAM3 Self-Distillation for Fine-Grained GOOSE 2D Semantic Segmentation

SAM3自蒸馏用于细粒度GOOSE 2D语义分割

Xuesong Wang

机构 * Wayne State University(韦恩州立大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出基于SAM3图像编码器与轻量解码器的分割模型,通过自蒸馏、多尺度测试增强和光度畸变迁移,在GOOSE 2D挑战赛达69.73% mIoU。

Comments 4th place in ICRA 2026 GOOSE 2D Semantic Segmentation Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19957 2026-06-19 cs.CY 新提交 50%

Modest, artistic, and radical solutions to the environmental impact of image-generating machine learning

图像生成机器学习的环境影响:温和、艺术与激进的解决方案

Laura U. Marks, Jess MacCormack, Kehui Li

专题命中 效率与部署 :language model(abstract)

AI总结 针对图像生成ML的高能耗问题,从计算机工程、媒体研究和艺术角度探索非精确计算、小模型、低精度硬件等解决方案,并提出真实成本核算。

Comments Paper in Proceedings of LIMITS 2026: 12th Workshop on Computing within Limits, 2026-06-23-25, Online

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19646 2026-06-19 cs.IR cs.CV 新提交 50%

SAFE-Cascade: Cost-Adaptive Vision-Language Routing for Chart Question Answering

SAFE-Cascade: 面向图表问答的成本自适应视觉语言路由

Ayush Dwivedi, Qixin Wang, Ashvi Soni, Ruoteng Wang, Han Li, Animesh Mahapatra, Neeraj Agrawal, Xintao Wu

机构 * University of Arkansas(亚拉巴马大学)

专题命中 效率与部署 :language model(abstract)

AI总结 提出SAFE-Cascade系统,通过OCR和轻量语言模型先给出答案,再由学习路由器决定是否调用VLM,在ChartQA上以73.1%的VLM调用率达到69.1%准确率,减少26.9%的VLM调用和9.3%的成本。

Comments Demo paper submitted at CIKM 2026. 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19531 2026-06-19 cs.CV cs.RO 新提交 50%

ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?

ImageWAM:世界动作模型真的需要视频生成,还是只需要图像编辑?

Yuyang Zhang, Wenyao Zhang, Zekun Qi, He Zhang, Haitao Lin, Jingbo Zhang, Yao Mu, Xiaokang Yang, Wenjun Zeng, Xin Jin

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(东方理工学院) Tencent Robotics X(腾讯机器人X) Tsinghua University(清华大学) Zhongguancun Academy(中关村学院)

专题命中 效率与部署 :pretraining(abstract)

AI总结 提出ImageWAM框架,利用预训练图像编辑模型替代视频生成进行机器人动作预测,通过编辑去噪的KV缓存作为世界动作上下文,在多个模拟和真实实验中优于基线,计算量降至1/6,延迟降至1/4。

Comments Project Page: https://zhangwenyao1.github.io/ImageWAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19483 2026-06-19 cs.CV 新提交 50%

LEAP: Layer-skipping Efficiency via Adaptive Progression for Vision Transformer Distillation

LEAP: 通过自适应进度实现视觉Transformer蒸馏的层跳过效率

Jiaqi Zhang, Ashton Lee, Anthony Wong, John Zou, Sami BuGhanem, Randall Balestriero

机构 * Brown University(布朗大学) Rice University(莱斯大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出LEAP训练课程,通过自适应选择教师中间特征图作为渐进式目标,加速学生ViT的知识蒸馏,在ImageNet-100上提升12.24%准确率,并节省25.1%训练FLOPs。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19195 2026-06-18 cs.CV 新提交 50%

Moebius: 0.2B Lightweight Image Inpainting Framework with 10B-Level Performance

Moebius: 0.2B轻量级图像修复框架,性能达10B级别

Kangsheng Duan, Ziyang Xu, Wenyu Liu, Xiaohu Ruan, Xiaoxin Chen, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) VIVO AI Lab(VIVO人工智能实验室)

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出Moebius轻量级图像修复框架,通过局部-λ混合交互模块和自适应多粒度蒸馏策略,以0.22B参数实现与10B级模型FLUX.1-Fill-Dev相当甚至更优的生成质量,推理速度提升15倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18400 2026-06-18 cs.OS cs.CR 新提交 50%

CloakLM: Obfuscating GPU Memory Layout to Mitigate Model Ex-filtration for Serving

CloakLM:混淆GPU内存布局以缓解服务中的模型窃取

Kunal Jain, Seokjin Go, Divya Mahajan

专题命中 效率与部署 :foundation model(abstract)

AI总结 针对第三方共享加速器上的模型窃取风险,提出CloakLM框架,通过PCIe流量整形、权重混洗和HBM页面重映射三种机制混淆内存布局,无需硬件修改即可有效防御PCIe嗅探和HBM转储攻击。

Comments 15 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18250 2026-06-17 cs.CV 新提交 50%

Future Dynamic 3D Reconstruction: A 3D World Model with Disentangled Ego-Motion

未来动态3D重建:一种具有解耦自运动的3D世界模型

Nils Morbitzer, Jonathan Evers, Artem Savkin, Thomas Stauner, Nassir Navab, Federico Tombari, Stefano Gasperini

机构 * Technical University of Munich (TUM)(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出FR3D世界模型,通过解耦场景3D演化与智能体轨迹,利用教师-学生蒸馏策略实现从单目观测到未来动态3D重建的几何一致性和零样本泛化。

Comments ICML 2026. Project page: https://fr3d-wm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17800 2026-06-17 cs.CV 新提交 50%

MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model

MaineCoon: 追求实时音视频社交世界模型

Lichen Bai, Tianhao Zhang, Shitong Shao, Dingwei Tan, Qiyu Zhong, Zhengpeng Xie, Haopeng Li, Qinghao Huang, Dandan Shen, Tengjiao Ji, Wei Wang, Peicheng Wu, Yuxuan Zhao, Xiangyu Zhu, Welly Luo, Shurui Yang, Zeke Xie

机构 * Catnip AI Team(Catnip AI团队)

专题命中 效率与部署 :preference optimization(abstract)

AI总结 提出MaineCoon,首个22B参数的实时音视频自回归模型,支持单GPU上高达47.5 FPS的流式生成和亚秒级交互,专为社交互动应用优化,引入自重采样、跨模态对齐、领域偏好优化和强化在线策略蒸馏等技术。

Comments 32 pages, 13 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17561 2026-06-17 cs.CV 新提交 50%

RT-Counter: Real-Time Text-Guided Open-Vocabulary Object Counting

RT-Counter:实时文本引导的开放词汇目标计数

Hao-Yuan Ma, Li Zhang, Zhiwei Zhu, Jie Gao

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 效率与部署 :language model(abstract)

AI总结 提出实时文本引导开放词汇计数框架RT-Counter,通过视觉原型文本化模块和编织Transformer层,在保持高精度的同时实现实时推理,在FSC147上MAE为13.30,速度达112.48 FPS。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16856 2026-06-16 cs.RO 新提交 50%

Video-Based Optimal Transport for Feedback-Efficient Offline Preference-Based Reinforcement Learning

基于视频的最优传输用于反馈高效的离线偏好强化学习

Tung M. Luu, Hwanhee Kim, Younghwan Lee, Chang D. Yoo

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出VOTP框架,利用视频基础模型和最优传输生成伪标签,仅需少量人类反馈即可学习有效奖励函数,显著降低标注成本。

Comments ICML 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16414 2026-06-16 cs.CV 新提交 50%

Instance-Aware Knowledge Distillation for Semi-Supervised Learning of an On-Board Multi-Task Dense Prediction Model for Collision Avoidance System

面向碰撞避免系统的半监督学习中的实例感知知识蒸馏用于车载多任务密集预测模型

Gyutae Hwang, Sang Jun Lee

机构 * Division of Electronics and Information Engineering, Jeonbuk National University(全北国立大学电子与信息工程学部)

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出实例感知知识蒸馏框架,利用教师模型领域先验和基础模型实例知识生成伪标签,训练轻量学生模型在边缘设备上实时执行多任务密集预测,在实例分割上超越教师,计算量降低22.68倍。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15898 2026-06-16 cs.RO 新提交 50%

VL2Spike: Spike-driven Distillation from VLMs for Low-Power Visual Perception in Embodied AI

VL2Spike:面向具身AI低功耗视觉感知的VLM脉冲驱动蒸馏

Zinan Liu, Eric Zheng, Soumyaratna Debnath, Hao Shi, Ling Xiao, Lin Wang

机构 * School of EEE, Nanyang Technological University (NTU)(南洋理工大学电气与电子工程学院) Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Advanced Micro Devices, Inc.(超威半导体公司) State Key Laboratory of Extreme Photonics and Instrumentation, Zhejiang University(浙江大学极端光子学与仪器国家重点实验室) Faculty of Information Science and Technology, Hokkaido University(北海道大学信息科学与技术学院)

专题命中 效率与部署 :language model(abstract)

AI总结 提出VL2Spike框架,通过时空视觉脉冲蒸馏和脉冲原型引导语言蒸馏,将VLM多模态知识迁移至Spikformer,在静态数据集上提升6.81%性能且能耗仅15.7%,并显著增强机器人视觉地点识别能力。

Comments 9 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15859 2026-06-16 cs.AR 新提交 50%

EPIC: A System Framework for Efficient Egocentric Perception on Embodied AR Glasses

EPIC:面向具身AR眼镜的高效自我中心感知系统框架

Tianhua Xia, Haiyu Wang, Jiajing Zheng, Su Chen, Sai Qian Zhang

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出EPIC系统,通过算法-硬件协同优化,利用注视、姿态和惯性信号推断用户意图,仅保留高分辨率感知输入中最具信息量的部分,平均减少27.5倍内存占用和24.3倍能耗,同时保持自我中心视频理解任务的智能辅助精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15638 2026-06-16 eess.AS cs.SD 新提交 50%

MambAdapter: Lightweight Mamba-Based Adapters for Parameter-Efficient Transfer Learning in Speech and Audio

MambAdapter:基于轻量级Mamba适配器的语音和音频参数高效迁移学习

Salman Hussain Ali, Umberto Cappellazzo, Mirco Ravanelli

机构 * Université de Montréal(蒙特利尔大学) Imperial College London(伦敦帝国理工学院) Concordia University(康科迪亚大学) Mila – Quebec AI Institute(魁北克AI研究院)

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出MambAdapter方法,将Mamba状态空间模型集成到低秩瓶颈适配器中,通过参数共享和轻量级Mamba模块实现音频特征的高效建模,在四个音频分类和五个语音识别任务上匹配或超越现有PETL方法。

Comments Accepted to Interspeech 2026. Code available at: https://github.com/salman-ha/MambAdapter

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15341 2026-06-16 cs.CV 新提交 50%

CausalDrive: Real-time Causal World Models for Autonomous Driving

CausalDrive: 用于自动驾驶的实时因果世界模型

Tianyi Yan, Huan Zheng, Dubing Chen, Meizhi Qu, Yingying Shen, Lijun Zhou, Mingfei Tu, Bing Wang, Guang Chen, Hangjun Ye, Haiyang Sun, Cheng-zhong Xu, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学协同创新研究院,科技学院) Xiaomi EV(小米汽车) CASIA(中国科学院自动化研究所)

专题命中 效率与部署 :post-training(abstract)

AI总结 提出CausalDrive,一种可控、实时的驾驶世界渲染器,通过因果预测和Context-Forced DMD架构实现交互式模拟,支持闭环评估、强化学习后训练和人在环仿真。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15169 2026-06-16 cs.CV 新提交 50%

Label Shift Aware Adaptation for Online Zero-shot Learning with Contrastive Language-Image Pre-Training (CLIP)

基于对比语言-图像预训练(CLIP)的在线零样本学习中的标签偏移感知自适应

Pengxiao Han, Changkun Ye, Yanshuo Wang, Jinguang Tong, Miaohua Zhang, Xuesong Li, Jie Hong, Lars Petersson

机构 * Australian National University(澳大利亚国立大学) China North Vehicle Research Institute(中国北方车辆研究所) The Hong Kong Polytechnic University(香港理工大学) Griffith University(格里菲斯大学) CSIRO(澳大利亚联邦科学与工业研究组织) The University of Hong Kong(香港大学)

专题命中 效率与部署 :language model(abstract)

AI总结 针对在线零样本学习中测试数据与CLIP训练数据分布不匹配的问题,提出标签偏移感知(LSA)方法,通过域自适应和标签偏移校正提升分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09150 2026-06-16 cs.CV 新提交 50%

Ultra Flash: Scaling Real-Time Streaming Video Generation to High Resolutions

Ultra Flash: 将实时流式视频生成扩展到高分辨率

Luxury, Jie Huang, Zihao Fan, Xiaoxiao Ma, Jun-hao Zhuang, Yuming Li, Zeyue Xue, Siming Fu, Haoran Li, Mingchen Zhong, Guohui Zhang, Shichen Ma, Yijun Liu, Jiaqi Shi, Yanwen Ma, Yaofeng Su, Haoyu Wang, Yaowei Li, Songchun Zhang, Weiyang Jin, Yuxuan Bian, Shiyi Zhang, Haojun Xu, Shuai Lu, Xin Han, Wei Tang, Haoyang Huang, Nan Duan

机构 * JD Explore Academy(京东探索研究院) USTC(中国科学技术大学) PKU(北京大学) THU(清华大学) BUAA(北京航空航天大学) FDU(复旦大学) HKUST(香港科技大学) HKU(香港大学) CUHK(香港中文大学)

专题命中 效率与部署 :preference optimization(abstract)

AI总结 提出Ultra Flash级联框架,通过架构保持的超分辨率训练、因果流式潜在上采样器和高分辨率解码器、以及级联优化方案,在单GPU上实现1K分辨率约30 FPS和2K分辨率约18 FPS的实时高分辨率流式视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14277 2026-06-15 cs.CV 新提交 50%

One Layer's Trash is Another Layer's Treasure: Adaptive Layer-wise Visual Token Selection in LVLMs

一层的垃圾是另一层的宝藏:LVLMs中自适应逐层视觉标记选择

Yongru Chen, Kai Zhang, Zeliang Zong, Yuchen Lu, Wenming Tan, Ye Ren, Jilin Hu

机构 * Hikvision Research Institute(海康威视研究院) Peking University(北京大学) East China Normal University(华东师范大学)

专题命中 效率与部署 :language model(abstract)

AI总结 提出自适应逐层视觉标记选择(ALVTS),通过轻量级选择器为不同层路由重要标记,实现高效压缩,在89%压缩率下保留96.7%精度。

Comments Accepted by CVPR 2026 (highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14032 2026-06-15 cs.RO 新提交 50%

From Attacks to Curricula: Learnability-Guided Adversarial Training for Safe Autonomous Driving

从攻击到课程:面向安全自动驾驶的可学习性引导对抗训练

Yuewen Mei, Tong Nie, Jie Sun, Haotian Shi, Wei Ma, Jian Sun

机构 * College of Transportation & Key Laboratory of Road and Traffic Engineering of Ministry of Education, Tongji University(同济大学交通运输工程学院 & 道路与交通工程教育部重点实验室) Department of Civil and Environmental Engineering, The Hong Kong Polytechnic University(香港理工大学土木与环境工程学系)

专题命中 效率与部署 :preference optimization(abstract)

AI总结 提出AlignADV框架,通过偏好对齐生成可解决场景,并利用行为指纹预测策略能力,动态采样课程以提升自动驾驶对抗训练的收敛效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13108 2026-06-12 cs.CV 新提交 50%

PP-OCRv6: From 1.5M to 34.5M Parameters, Surpassing Billion-Scale VLMs on OCR Tasks

PP-OCRv6: 从1.5M到34.5M参数,在OCR任务上超越十亿级视觉语言模型

Yubo Zhang, Xueqing Wang, Manhui Lin, Yue Zhang, Penglongyi Deng, Ting Sun, Tingquan Gao, Zelun Zhang, Jiaxuan Liu, Changda Zhou, Hongen Liu, Suyin Liang, Cheng Cui, Yi Liu, Dianhai Yu, Yanjun Ma

机构 * PaddlePaddle Team, Baidu Inc.(百度公司飞桨团队)

专题命中 效率与部署 :language model(abstract)

AI总结 提出轻量级OCR系统PP-OCRv6,通过统一MetaFormer架构和结构化重参数化,在服务器到边缘设备上以少数量级参数超越十亿级VLM,中模型识别准确率83.2%,检测Hmean 86.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12396 2026-06-11 cs.CV cs.RO 新提交 50%

VLGA: Vision-Language-Geometry-Action Models for Autonomous Driving

VLGA:用于自动驾驶的视觉-语言-几何-动作模型

Jin Yao, Dhruva Dixith Kurra, Tom Lampo, Zezhou Cheng, Danhua Guo, Burhan Yaman

机构 * Uber AV Labs(Uber自动驾驶实验室) University of Virginia(弗吉尼亚大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出VLGA模型,通过引入几何作为第四模态,利用逐像素点图回归损失监督,实现密集3D世界重建,在nuScenes和Bench2Drive上达到SOTA。

Comments Project page: https://yaojin17.github.io/VLGA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11913 2026-06-11 cs.CV 新提交 50%

From Content to Knowledge: Lightning Fast Long-Video Understanding with Neural Knowledge Representations

从内容到知识:基于神经知识表示的闪电般快速长视频理解

Yuchen Guan, Xiao Li, Zongyu Guo, Xiaoyi Zhang, Xiulian Peng, Chun Yuan, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :language model(abstract)

AI总结 提出将长视频编码为神经知识表示(NKR),通过智能体知识蒸馏(AKD)自动合成描述和问答对,将视频知识嵌入VLM骨干网络的少量权重中,实现轻量级、可复用的视频理解,推理时无需重新加载视频,大幅降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏