arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1933 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1933 篇

2606.07881 2026-06-09 cs.LG 新提交 57%

Breaking the Bubble: Asynchronous Pipeline Parallel Training with Bounded Weight Inconsistency

打破气泡:具有有界权重不一致性的异步流水线并行训练

Itay Elam, Eliron Rahimi, Avi Mendelson, Chaim Baskin

机构 * Technion - Israel Institute of Technology(以色列理工学院) Ben-Gurion University of the Negev(本·古里安大学)

专题命中 效率与部署 :pretraining(abstract);分类 cs.LG

AI总结 提出PACI方法,通过局部梯度累积控制版本漂移,实现无气泡异步流水线并行,在GPT风格语言模型预训练中匹配同步1F1B-flush的稳定性和困惑度,吞吐量完全利用,训练时间至准确率提升达1.69倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07669 2026-06-09 cs.CV cs.AI 新提交 57%

MemoVAD: Resource-Efficient Video Anomaly Detection via Dynamic Semantic Memory in Edge Computing Scenarios

MemoVAD: 边缘计算场景下基于动态语义记忆的资源高效视频异常检测

Guo Li, Jiandian Zeng, Yang Li, Zihao Peng, Ke Chen, Tian Wang

机构 * Institute of Artificial Intelligence and Future Networks, Beijing Normal University(北京师范大学人工智能与未来网络研究院) School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院) Engineering Research Center of Cloud-Edge Intelligent Collaboration on Big Data, Ministry of Education, Beijing Normal University(北京师范大学大数据云边智能协同教育部工程研究中心)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 提出MemoVAD边缘-云协同框架,通过不确定性感知门控策略选择性调用云端视觉语言模型,并设计动态语义记忆缓存原型,在降低通信开销的同时提升视频异常检测性能。

Comments Accepted by IJCAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07654 2026-06-09 cs.CV cs.AI 新提交 57%

MM-Matryoshka: Towards Budget-Elastic Visual Document Retrieval via a 2D Multimodal Matryoshka Training Framework

MM-Matryoshka:通过二维多模态套娃训练框架实现预算弹性视觉文档检索

Haowen Xiang, Yibo Yan, Jiahao Huo, Yu Huang, Yi Cao, Mingdong Ou, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Cloud Computing(阿里云计算) Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 提出MM-Matryoshka,一种二维套娃训练框架,使视觉文档检索器在向量维度和编码器深度上实现弹性预算选择,无需为不同预算训练独立模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07414 2026-06-08 cs.LG cs.NE 新提交 57%

Sparsely gated tiny linear experts

稀疏门控的微型线性专家

Simon Schug

机构 * Princeton University(普林斯顿大学)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 提出稀疏门控线性神经元(sgatlin)网络,通过将每个专家缩减为单个神经元并去除非线性,在等计算量下提升语言模型困惑度,同时增强可解释性。

Comments Code available at https://github.com/smonsays/sparsely-gated-linear

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06566 2026-06-08 cs.SE cs.AI 新提交 57%

NTILC: Neural Tool Invocation via Learned Compression

NTILC: 通过学习的压缩实现神经工具调用

Andrew Krikorian, Yayuan Li, Jason J. Corso

机构 * Department of Robotics, University of Michigan(机器人学系,密歇根大学) Department of ECE, University of Michigan(电子工程与计算机科学系,密歇根大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 提出NTILC框架,用学习的潜在检索替代上下文工具查找,将工具选择与参数生成解耦,通过签名感知复合损失函数提升选择精度,相比基线减少95%上下文消耗和74%延迟。

Comments 10 Pages, 4 Figures, 5 Tables, 1 Algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16188 2026-08-18 cs.OS 新提交 50%

AdaSprite: Resource-efficient Online Co-Adaptation for V2I Systems Under Large-scale Data Drifts

AdaSprite:大规模数据漂移下车路协同(V2I)系统的资源高效在线协同自适应

Lehao Wang, Zhiwen Yu, Sicong Liu, Kefan Chen, Fengmin Wu, Bin Guo

专题命中 效率与部署 :language model(abstract)

AI总结 针对V2I系统大规模数据漂移下边缘资源受限的协同自适应问题,AdaSprite通过协同弹性扩缩等技术,使弱边缘支持17个并发V2I任务,SLO达成率与吞吐量分别提升1.6倍、2.1倍。

Comments MobiSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15490 2026-08-18 cs.RO 新提交 50%

Vision-Based Tactile Intelligence for Robotics: Sensing, Learning, and Embodied Manipulation

机器人基于视觉的触觉智能:感知、学习与具身操作

Peng Zhou, Jun Hu, Sihan Chen, Zeqing Zhang, Haofei Ma, Zhenyu Lu, Sichao Liu, Xueqian Wang, Pai Zheng, Xiang Li, Shan Luo, Jia Pan, David Navarro-Alarcon, Chenguang Yang, Michael Yu Wang

机构 * Great Bay University(大湾区大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学) The Hong Kong Polytechnic University(香港理工大学) South China University of Technology(华南理工大学) KTH Royal Institute of Technology(瑞典皇家理工学院) King’s College London(伦敦国王学院)

专题命中 效率与部署 :foundation model(abstract)

AI总结 本综述调研机器人领域基于视觉的触觉传感器(VBTSs)全流程,对其硬件分类、学习方法、仿真与数据集等展开分析,指出开放挑战,以推进接触密集型机器人任务的触觉智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15317 2026-08-18 cs.CV 新提交 50%

LightLoc++: Sensor-Robust Representation Learning for Efficient Outdoor LiDAR Localization

LightLoc++:面向高效室外激光雷达定位的传感器鲁棒性表示学习

Wen Li, Shangshu Yu, Dunqiang Liu, Qiming Xia, Sheng Ao, Siqi Shen, Chenglu Wen, Cheng Wang

机构 * Xiamen University(厦门大学) University of Bristol(布里斯托大学) Northeastern University(东北大学)

专题命中 效率与部署 :pretraining(abstract)

AI总结 LightLoc++通过引入SULID数据集与跨传感器一致性学习预训练传感器鲁棒骨干,结合样本分类引导与冗余样本下采样,实现高效室外激光雷达定位,性能最优且新场景训练成本最低。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15061 2026-08-18 cs.CV 新提交 50%

Do Visual Grounding Decoders Need Feed-Forward Networks? A Controlled Study over Frozen Vision-Language Features

视觉定位解码器是否需要前馈网络?基于冻结的视觉-语言特征的受控研究

Tarun Tomar

专题命中 效率与部署 :language model(abstract)

AI总结 本研究通过受控实验对比不同视觉定位解码器,发现仅注意力的4块解码器(A4)性能与含FFN的4块解码器相当,8块仅注意力解码器(A8)可弥补A4的微小差距且更优,同时A4能减少参数量与延迟。

Comments 14 pages, 8 figures, 5 tables. Code and project page: https://github.com/TarunTomar122/attention-is-all-you-need-for-vlms

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15026 2026-08-18 cs.RO 新提交 50%

PACE: Phase-Progress-Aware Credit for Long-Horizon Embodied Manipulation

PACE:面向长周期具身操纵的阶段进度感知信用分配框架

Chengye Song, Jiawei Zhang, Rui Song, Shengqi Wang, Xiangrong Zhang, Ziyi Wang, Huanbin Zhou, Hongzhou Wang

专题命中 效率与部署 :post-training(abstract)

AI总结 PACE是面向长周期具身操纵的信用分配框架,通过GLC-Critic实现步骤级信用分配,结合PPD训练策略,在仿真与真实机械臂实验中较基线取得显著性能提升。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14991 2026-08-18 cs.CV 新提交 50%

Risk-Adaptive Edge--Cloud Visual Reasoning for Communication-Efficient Autonomous Driving

面向通信高效自动驾驶的风险自适应边云视觉推理

Meng Ma, Shuyang Li, Naigang Wang, Ruimin Ke

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) IBM T. J. Watson Research Center(IBM T. J. 沃森研究中心)

专题命中 效率与部署 :language model(abstract)

AI总结 本研究提出风险自适应边云视觉推理架构,通过车载交通评估触发云端VLM推理,在自动驾驶中减少54.1%云端请求量,同时保持任务成功率并降低AEB触发次数,实现通信效率与性能的平衡。

Comments 7 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14877 2026-08-18 cs.NI eess.SP 新提交 50%

Deep Reinforcement Learning for 6G AI-RAN: A Comprehensive Survey

面向6G AI-RAN的深度强化学习:一项综合调查

Jie Lu, Peihao Yan, Qijun Wang, Ruxin Lin, Huacheng Zeng

专题命中 效率与部署 :foundation model(abstract)

AI总结 本文针对6G开放AI-RAN,首次开展深度强化学习(DRL)综合调查,梳理DRL基础、O-RAN感知框架、DRL应用分类及相关研究方向,填补了DRL方法论与O-RAN部署间的系统关联空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15157 2026-08-18 physics.comp-ph 新提交 50%

Plasolver: Physics-Informed Neural Operators for Elastoplasticity

Plasolver:用于弹塑性问题的物理信息神经算子

Yizheng Wang, Mohammad Sadegh Eshaghi, Huadong Zhang, Xiaoying Zhuang, Timon Rabczuk, Yinghua Liu

专题命中 效率与部署 :pretraining(abstract)

AI总结 研究针对弹塑性分析计算成本高的问题,提出Plasolver物理信息神经算子框架,结合算子学习与经典求解器优势,预训练结合热启动阶段,实现高精度与大幅加速,减少迭代次数,为弹塑性问题提供高效计算框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14899 2026-08-18 cond-mat.mtrl-sci physics.chem-ph 新提交 50%

Data-Efficient Construction of Material-Specific Machine-Learning Interatomic Potentials from Ab Initio Molecular Dynamics Trajectories

基于从头算分子动力学轨迹的材料特异性机器学习原子间势的高效构建

Jonas Hänseroth, Christian Dreßler

专题命中 效率与部署 :foundation model(abstract)

AI总结 该研究量化了将通用机器学习原子间势转换为材料特异性势所需的从头算分子动力学数据量,对比了不同框架的表现,提出了实用构建指南,还发现模型平均可提升稀缺数据下的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14542 2026-08-17 stat.ME stat.ML 新提交 50%

Generation-Powered Inference for Distribution-Valued Outcomes

面向分布值结果的生成驱动推断

Yijiao Zhang, Hongzhe Li

专题命中 效率与部署 :foundation model(abstract)

AI总结 该研究提出生成驱动推断(GPI)框架,用于利用辅助生成模型改进分布值参数的推断,经模拟和K562细胞的Perturb-seq研究验证,其效率更高且在模型误设下表现稳健。

Comments 36 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13502 2026-08-14 cs.CV 新提交 50%

GS$^{2}$CI: Robust Gaussian Splatting For Snapshot Compressive Imaging via Large Vision Model Priors

GS²CI:基于大视觉模型先验的快照压缩成像鲁棒高斯溅射方法

Yanming Yang, Chenxi Song, Ping Wang, Xin Yuan, Chi Zhang

机构 * Westlake University(西湖大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 该研究针对快照压缩成像的三维重建难题,提出结合三维高斯溅射与大视觉模型先验的框架,引入专属致密化策略提升稳定性,在多基准实验中实现了最优整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13343 2026-08-14 cs.CV 新提交 50%

AmalthAI: An Open-Source Computer Vision Platform for Cultural Heritage

AmalthAI:面向文化遗产的开源计算机视觉平台

Christos Chatzisavvas, Stelios Alvanos, Efstratios Politis, Panagiotis Rigas, Thomas Pappas, Ioannis Giannoukos, Nikolaos Mitianoudis, Agata Ulanowska, Katarzyna Żebrowska, Nazarij Buławka, Christina Margariti, George Pavlidis, Chairi Kiourt, Anestis Koutsoudis, Vassilis Katsouros, George Ioannakis

机构 * Democritus University of Thrace(德谟克利特色雷斯大学) Athena Research Center(雅典娜研究中心) National and Kapodistrian University of Athens(雅典国立卡波迪斯特里亚大学) University of Warsaw(华沙大学)

专题命中 效率与部署 :language model(abstract)

AI总结 AmalthAI是面向文化遗产领域专家的开源计算机视觉平台,通过集成Kubeflow、Katib等工具,支持数据集管理、模型训练与推理,可保障敏感考古数据安全,已在黏土织物印痕数据集上验证其功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13045 2026-08-14 cs.CV 新提交 50%

P2Fusion: Prompt-based Progressive Infrared-Visible Image Fusion via Dual-Prior Distillation

P2Fusion:基于提示的双先验蒸馏红外-可见光图像渐进融合

Yi Shi, Huichao Xie, Yuqing Wang, Mingyu Wang, Kaihui Yang, Yu Liu, Ruitao Lu, Lizhe Li, Junwei Han, Dingwen Zhang

机构 * Northwestern Polytechnical University(西北工业大学) Hefei University of Technology(合肥工业大学) Rocket Force University of Engineering(火箭军工程大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 针对红外-可见光图像融合的信息差异挑战,提出基于双固有提示的P2Fusion框架,结合Teach-to-Fuse机制与GDER模块,在多数据集上实现SOTA性能并提升下游感知鲁棒性。

Comments Accepted by ECCV 2026. Website: https://p2fusion.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12107 2026-08-13 cs.CV 新提交 50%

Avatar-Forever: Decoupled Parallel Training for High-Quality Real-Time Infinite Avatars

Avatar-Forever:用于高质量实时无限虚拟形象的解耦并行训练

Ruibin Li, Tao Yang, Zhiyuan Ma, Fangzhou Ai, Shilei Wen, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) ByteDance(字节跳动) AMD(超威半导体公司)

专题命中 效率与部署 :foundation model(abstract)

AI总结 Avatar-Forever是一种解耦并行训练框架,通过双分支设计与ForeverCache机制,在单张H100 GPU上实现27.2 FPS的768x512音频驱动无限虚拟形象生成,保障质量与效率,推进稳定数字人研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11803 2026-08-13 cs.CY 新提交 50%

Silent Updates: Measuring and Closing the Post-Deployment Disclosure Gap

静默更新:测量并弥合部署后的披露差距

Sophia Abraham, Ben Bucknall

专题命中 效率与部署 :foundation model(abstract)

AI总结 本文针对基础模型部署后的静默更新问题,分析了相关披露实践,推出了测量披露情况的评分卡,并提出了触发披露义务的三部分行为触发系统。

Comments Accepted to AIES-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11812 2026-08-13 cond-mat.mtrl-sci physics.comp-ph 新提交 50%

Data-Efficient Adaptation of DPA-4 Force Fields to DFT+U Energetics: A Case Study in NiO

面向DFT+U能量学的DPA-4力场的数据高效适配:以NiO为例

Fengyu Xie, Peiheng Jiang, Zhicheng Zhong

专题命中 效率与部署 :pretraining(abstract)

AI总结 本研究以NiO为案例,通过微调预训练的DPA-4力场,高效修正了源层面的错误相能量学,提出了一种预训练与目标微调结合的多保真度策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10412 2026-08-12 cs.HC cs.CY 新提交 50%

When the Interviewer Is a Bot: Behavior, Breakdowns, and Trust in MLLM-Led Interviews

当面试官是机器人时:多模态大语言模型(MLLM)主导的面试中的行为、故障与信任

He Zhang, Kambinachi Chukwuma, ChanMin Kim, John M. Carroll

专题命中 效率与部署 :LLM(abstract)

AI总结 该研究通过构建InterviewBot系统开展实证研究,分析了MLLM主导面试的行为、故障与社会动态,为以人为中心的面试自动化提供设计启示。

Comments Accepted to ACM HCOMP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09771 2026-08-11 cs.RO 新提交 50%

SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation

SLIM-0.5B:学习机器人操作的动作基础预测隐变量

Jingkai Wang, Zihan Tang, Gu Zhang, Mingyu Cao, Jiapeng Chen, Jingjiao Zhao, Xiansheng Chen, Pengwei Wang, Lemao Liu, Dejing Dou

机构 * Fudan University(复旦大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Tsinghua University(清华大学) Renmin University of China(中国人民大学)

专题命中 效率与部署 :pretraining(abstract)

AI总结 SLIM-0.5B是0.5B参数的紧凑机器人操作策略,通过自监督掩码轨迹预测学习动作基础预测隐变量,性能优于或匹配大型基线,参数量少、推理延迟低、内存占用小。

Comments 18 pages, 11 figures. Project page: https://kzz1031.github.io/slim-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09493 2026-08-11 cs.CV 新提交 50%

GeoRoute: Geometry-Aware Hybrid Inference for Traffic Future-Frame Prediction

GeoRoute:面向交通未来帧预测的几何感知混合推理方法

Khang Minh Le, Hieu Dinh Trung Pham, Luu Thanh Danh, Nam-Tien Le, Hieu Anh Ngo, Phuong Huu Vu Tran, Son Nguyen Minh Le, Nguyen Trong Nghia, Tu Tran Thi Cam, Huy Minh Nhat Nguyen, Cuong Tuan Nguyen

机构 * Vietnamese-German University(越南-德国大学) University of Science, Ho Chi Minh City(胡志明市科学大学) Ho Chi Minh City University of Technology(胡志明市技术大学) University of Information Technology, Ho Chi Minh City(胡志明市信息技术大学)

专题命中 效率与部署 :language model(abstract)

AI总结 GeoRoute是一种无需训练的几何感知混合推理框架,通过多帧深度分层渲染器和视角条件选择预测器,在AI City Challenge Track 5基准上实现了具有竞争力的交通未来帧预测性能,提升了静态几何稳定性。

Comments accepted to the ECCV 2026 AI City Challenge Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09146 2026-08-11 cs.CV 新提交 50%

Multi-Submap Implicit Neural SLAM with Local-to-Global Loop Closure for Large-Scale Scene Reconstruction

面向大规模场景重建的结合局部到全局回环检测的多子图隐式神经SLAM

Tianchen Deng, Chongdi Wang, Nailin Wang, Lei Zhao, Ziqi Ma, Tianjun Zhang, Zhe Liu, Danwei Wang, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Carnegie Mellon University(卡内基梅隆大学) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院)

专题命中 效率与部署 :foundation model(abstract)

AI总结 本文提出一种带多子图架构与双层回环检测机制的神经SLAM系统,结合渐进式建图、光流跟踪、局部到全局回环及子图间在线蒸馏算法,在大规模场景重建性能上优于现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08832 2026-08-11 cs.CV 新提交 50%

Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding

视觉令牌编解码器:为ViT特征编码释放空间冗余

Donghui Feng, Fengxi Zhang, Changsheng Gao, Wenhan Yang, Qi Wang, Qunshan Gu, Hongwei Hu, Zhengxue Cheng, Li Song

机构 * School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Pengcheng Laboratory(鹏城实验室) Ant Group(蚂蚁集团)

专题命中 效率与部署 :foundation model(abstract)

AI总结 针对ViT特征编码忽略二维补丁网格结构的问题,提出双路径视觉令牌编解码器VTC,在DINOv2、SAM3的分类等任务上,码率降低15.7-37.4倍且性能达未压缩的90%,表现优于基线。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08702 2026-08-11 cs.CV 新提交 50%

SRE-FER: Regional residual evidence learning for mitigating local evidence dilution in fine-grained facial expression recognition

SRE-FER:用于缓解细粒度面部表情识别中局部证据稀释的区域残差证据学习

Jiaye Song, Ruochen Zhang, Yuliang Wang, Jiaqi Wu

专题命中 效率与部署 :foundation model(abstract)

AI总结 针对细粒度FER中局部证据稀释问题,提出SRE-FER框架,通过RERA模块和AU指导优化,在三个基准测试中取得具竞争力的FER性能。

Comments 10 pages, 5 figures.Accepted at the 9th International Conference on Artificial Intelligence and Pattern Recognition (AIPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08630 2026-08-11 cs.CV 新提交 50%

VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling

VLZip:用于交错长上下文建模的统一视觉与文本压缩方法

Yuqi Zhang, Cheng Chen, Yuyu Guo, Wenjie Yang, Lingchen Meng, Peng Di, Hang Yu, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Ant Group(蚂蚁集团)

专题命中 效率与部署 :language model(abstract)

AI总结 VLZip 是统一视觉与文本压缩的框架,通过提炼软前缀缩短注意力序列,在长上下文多模态推理上性能领先,支持超大规模 token 处理,为长上下文多模态 AI 建立新高效标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08558 2026-08-11 cs.RO 新提交 50%

Vid2WAM: Distilling Video Diffusion Priors into World Action Models

Vid2WAM:将视频扩散先验蒸馏为世界动作模型

Chenhao Qiu, Ruixiang Wang, Runyi Zhao, Sixu Lin, Songen Gu, Shufeng Nan, Guiliang Liu, Kui Jia, Yanwei Fu, Simo Wu

专题命中 效率与部署 :foundation model(abstract)

AI总结 Vid2WAM是将视频扩散先验蒸馏为WAM的离线框架,通过双监督通道与源感知残差动作适配,提升了机器人策略的新任务泛化性与数据效率,且推理高效。

Comments Project website: https://qch-fa.github.io/vid2wam-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08290 2026-08-11 cs.CV 新提交 50%

Test-Time Prototype Adaptation for Open-Vocabulary Semantic Segmentation

开放词汇语义分割的测试时原型适配

Haozhe Wang, Jintao Cheng, Weibin Li, Xiaoyu Tang

机构 * The Hong Kong University of Science and Technology(香港科技大学) South China Normal University(华南师范大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 本文提出测试时原型适配(TPA),一种无训练即插即用模块,可与多种开放词汇语义分割宿主结合,仅用少量未标注图像构建原型库,无需调优或更新参数即可提升分割准确率。

Comments 17 pages, 12 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏