arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

ETH Zurich(苏黎世联邦理工学院)

2026-03-31 至 2026-03-31 共收录 9
2603.28696 2026-03-31 cs.CV cs.AI

AdaptToken: Entropy-based Adaptive Token Selection for MLLM Long Video Understanding

AdaptToken: 基于熵的自适应令牌选择用于多模态大语言模型长视频理解

Haozhe Qi, Kevin Qu, Mahdi Rad, Rui Wang, Alexander Mathis, Marc Pollefeys

机构 * Microsoft Spatial AI Lab(微软空间人工智能实验室) EPFL(瑞士联邦理工学院洛桑) ETH Zurich(苏黎世联邦理工学院)

AI总结 AdaptToken通过利用模型自不确定性实现全局控制信号,提升多模态大语言模型对长视频的理解能力,通过熵信号分配令牌预算并支持提前停止,提升准确率并减少推理时间。

Comments Project page: https://haozheqi.github.io/adapt-token

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13191 2026-03-31 cs.CV cs.AI cs.CL

CoPE-VideoLM: Leveraging Codec Primitives For Efficient Video Language Modeling

CoPE-VideoLM:利用编解码器原语实现高效的视频语言建模

Sayan Deb Sarkar, Rémi Pautrat, Ondrej Miksik, Marc Pollefeys, Iro Armeni, Mahdi Rad, Mihai Dusmanu

机构 * Microsoft Spatial AI Lab(微软空间人工智能实验室) Stanford University(斯坦福大学) ETH Zurich(苏黎世联邦理工学院)

AI总结 本文提出CoPE-VideoLM,通过利用视频编解码器原语(如运动矢量和残差)减少计算开销,提升视频语言模型的效率和性能。

Comments Project Page: https://microsoft.github.io/CoPE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28550 2026-03-31 cs.CV

MarkushGrapher-2: End-to-end Multimodal Recognition of Chemical Structures

MarkushGrapher-2:端到端多模态识别化学结构

Tim Strohmeyer, Lucas Morin, Gerhard Ingmar Meijer, Valéry Weber, Ahmed Nassar, Peter Staar

机构 * IBM Research(IBM研究院) ETH Zurich(苏黎世联邦理工学院)

AI总结 本文提出MarkushGrapher-2,通过OCR提取化学图像文本,结合视觉-文本-布局编码器和光学化学结构识别编码器,实现多模态化学结构识别,并通过两阶段训练策略提升性能,同时构建大规模真实世界Markush结构数据集。

Comments 15 pages, to be published in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05551 2026-03-31 cs.CV

FastVMT: Eliminating Redundancy in Video Motion Transfer

FastVMT:消除视频运动迁移中的冗余

Yue Ma, Zhikai Wang, Tianhao Ren, Mingzhe Zheng, Hongyu Liu, Jiayi Guo, Kunyu Feng, Yuxuan Xue, Zixiang Zhao, Konrad Schindler, Qifeng Chen, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) HKUST(香港科技大学) THU(清华大学) Meta ETH Zürich(苏黎世联邦理工学院)

AI总结 本文提出FastVMT,通过消除DiT架构中的运动和梯度冗余,实现视频运动迁移的加速,提升生成视频的效率而不影响视觉质量和时间一致性。

Comments Accepted by ICLR2026, Project page: fastvmt.gitHub.io, Code: https://github.com/mayuelala/FastVMT

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13689 2026-03-31 cs.CV

LitePT: Lighter Yet Stronger Point Transformer

LitePT: 更轻更强大的点云变换器

Yuanwen Yue, Damien Robert, Jianyuan Wang, Sunghwan Hong, Jan Dirk Wegner, Christian Rupprecht, Konrad Schindler

机构 * ETH Zurich(苏黎世联邦理工学院) University of Oxford(牛津大学) University of Zurich(苏黎世大学)

AI总结 本文提出LitePT模型,通过在早期阶段使用卷积层,后期切换至注意力机制,减少参数并提升效率,同时在多个任务和数据集上表现优异。

Comments CVPR 2026, Project page: https://litept.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27226 2026-03-31 cs.CL

Rethinking Easy-to-Hard: Limits of Curriculum Learning in Post-Training for Deductive Reasoning

重新思考易到难:在后训练中课程学习在演绎推理中的局限性

Maximilian Mordig, Andreas Opedal, Weiyang Liu, Bernhard Schölkopf

机构 * Max Planck Institute for Intelligent Systems, Tübingen(马克斯·普朗克智能系统研究所,图宾根) ETH Zürich(苏黎世联邦理工学院) The Chinese University of Hong Kong(香港中文大学)

AI总结 本研究系统评估了课程学习在LLM后训练中的影响,发现基于难度的训练顺序在准确性及响应长度上无显著优势,挑战了课程学习在演绎推理中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14015 2026-03-31 cs.CV

Prompting Depth Anything for 4K Resolution Accurate Metric Depth Estimation

通过提示深度任何事实现4K分辨率的准确度量深度估计

Haotong Lin, Sida Peng, Jingxiao Chen, Songyou Peng, Jiaming Sun, Minghuan Liu, Hujun Bao, Jiashi Feng, Xiaowei Zhou, Bingyi Kang

机构 * Zhejiang University(浙江大学) ByteDance Seed(字节跳动Seed) Shanghai Jiao Tong University(上海交通大学) ETH Zurich(苏黎世联邦理工学院)

AI总结 本文提出Prompt Depth Anything,利用低成本LiDAR作为提示,通过多尺度融合设计实现4K分辨率的度量深度估计,并在ARKitScenes和ScanNet++数据集上取得新突破。

Comments CVPR 2025; Project page: https://PromptDA.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26810 2026-03-31 cs.CV eess.IV

Unblur-SLAM: Dense Neural SLAM for Blurry Inputs

Unblur-SLAM:用于模糊输入的密集神经SLAM

Qi Zhang, Denis Rozumny, Francesco Girlanda, Sezer Karaoglu, Marc Pollefeys, Theo Gevers, Martin R. Oswald

机构 * University of Amsterdam(阿姆斯特丹大学) Meta Reality Labs(Meta现实实验室) ETH Zürich(苏黎世联邦理工学院)

AI总结 本文提出Unblur-SLAM,一种针对模糊图像输入的RGB SLAM pipeline,能够处理多种模糊类型,在运动模糊和失焦模糊情况下表现出最佳性能,通过调整计算量和多视图优化提升重建效果。

Comments 14 pages, 9 figures (based on the document's total length and the final Figure 9 ). Accepted By CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26716 2026-03-31 eess.SP cs.LG

FEMBA on the Edge: Physiologically-Aware Pre-Training, Quantization, and Deployment of a Bidirectional Mamba EEG Foundation Model on an Ultra-low Power Microcontroller

FEMBA在边缘:一种生理感知的预训练、量化和在超低功耗微控制器上部署双向Mamba EEG基础模型

Anna Tegon, Nicholas Lehmann, Yawei Li, Andrea Cossettini, Luca Benini, Thorir Mar Ingolfsson

机构 * Integrated Systems Laboratory, ETH Zürich(苏黎世联邦理工学院集成系统实验室) DEI, University of Bologna(博洛尼亚大学电气、电子与信息工程系)

AI总结 本文提出FEMBA,通过生理感知预训练、量化和部署,实现基于Mamba的EEG基础模型在超低功耗微控制器上的高效应用,提升长期神经监测性能。

Comments 10 pages, 9 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏