arXivDaily arXiv每日学术速递 周一至周五更新

作者

Cordelia Schmid

Computer Vision

共收录 226
2209.04899 2022-12-20 cs.RO cs.AI cs.CL cs.CV cs.LG

Instruction-driven history-aware policies for robotic manipulations

Pierre-Louis Guhur, Shizhe Chen, Ricardo Garcia, Makarand Tapaswi, Ivan Laptev, Cordelia Schmid

Comments Accepted in CoRL 2022 (oral); project page at https://guhur.github.io/hiveformer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.00135 2022-12-02 cs.CV

Attention Bottlenecks for Multimodal Fusion

Arsha Nagrani, Shan Yang, Anurag Arnab, Aren Jansen, Cordelia Schmid, Chen Sun

Comments Published at NeurIPS 2021. Note this version updates numbers due to a bug in the AudioSet mAP calculation in Table 1 (last row)

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.09966 2022-11-21 cs.CV cs.MM cs.SD eess.AS eess.IV

AVATAR submission to the Ego4D AV Transcription Challenge

Paul Hongsuck Seo, Arsha Nagrani, Cordelia Schmid

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.09646 2022-11-18 cs.CV

Language Conditioned Spatial Relation Reasoning for 3D Object Grounding

Shizhe Chen, Pierre-Louis Guhur, Makarand Tapaswi, Cordelia Schmid, Ivan Laptev

Comments Accepted in NeurIPS 2022; Project website: https://cshizhe.github.io/projects/vil3dref.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.09616 2022-10-26 cs.RO cs.AI cs.CV cs.LG

Assembly Planning from Observations under Physical Constraints

Thomas Chabal, Robin Strudel, Etienne Arlaud, Jean Ponce, Cordelia Schmid

Comments IROS 2022. See the project webpage at https://www.di.ens.fr/willow/research/assembly-planning/

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.04485 2022-10-11 cs.CV cs.LG

A Memory Transformer Network for Incremental Learning

Ahmet Iscen, Thomas Bird, Mathilde Caron, Alireza Fathi, Cordelia Schmid

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.08155 2022-10-11 cs.CV cs.CL cs.LG

Zero-Shot Video Question Answering via Frozen Bidirectional Language Models

Antoine Yang, Antoine Miech, Josef Sivic, Ivan Laptev, Cordelia Schmid

Comments NeurIPS 2022 Camera-Ready; Project Webpage: https://antoyang.github.io/frozenbilm.html; 25 pages; 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.11781 2022-08-26 cs.CV cs.AI

Learning from Unlabeled 3D Environments for Vision-and-Language Navigation

Shizhe Chen, Pierre-Louis Guhur, Makarand Tapaswi, Cordelia Schmid, Ivan Laptev

Comments ECCV 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.06773 2022-08-16 cs.CV cs.IR cs.LG cs.MM

TL;DW? Summarizing Instructional Videos with Task Relevance & Cross-Modal Saliency

Medhini Narasimhan, Arsha Nagrani, Chen Sun, Michael Rubinstein, Trevor Darrell, Anna Rohrbach, Cordelia Schmid

Comments Accepted to ECCV 2022. Website: https://medhini.github.io/ivsum/

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.12909 2022-07-27 cs.CV

AlignSDF: Pose-Aligned Signed Distance Fields for Hand-Object Reconstruction

Zerui Chen, Yana Hasson, Cordelia Schmid, Ivan Laptev

Comments Accepted by ECCV 2022. Project Page: https://zerchen.github.io/projects/alignsdf.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.03807 2022-07-11 cs.CV

Beyond Transfer Learning: Co-finetuning for Action Localisation

Anurag Arnab, Xuehan Xiong, Alexey Gritsenko, Rob Romijnders, Josip Djolonga, Mostafa Dehghani, Chen Sun, Mario Lučić, Cordelia Schmid

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.02200 2022-07-07 cs.CV cs.LG

Learning with Neighbor Consistency for Noisy Labels

Ahmet Iscen, Jack Valmadre, Anurag Arnab, Cordelia Schmid

Comments The code is available at https://github.com/google-research/scenic/tree/main/scenic/projects/ncr

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.11884 2022-06-24 cs.RO

Augmenting differentiable physics with randomized smoothing

Quentin Le Lidec, Louis Montaut, Cordelia Schmid, Ivan Laptev, Justin Carpentier

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.09852 2022-06-22 cs.CV

M&M Mix: A Multimodal Multiview Transformer Ensemble

Xuehan Xiong, Anurag Arnab, Arsha Nagrani, Cordelia Schmid

Comments Technical report for Epic-Kitchens challenge 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.07684 2022-06-16 cs.CV cs.MM cs.SD eess.AS

AVATAR: Unconstrained Audiovisual Speech Recognition

Valentin Gabeur, Paul Hongsuck Seo, Arsha Nagrani, Chen Sun, Karteek Alahari, Cordelia Schmid

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.16434 2022-06-10 cs.CV cs.CL cs.LG

TubeDETR: Spatio-Temporal Video Grounding with Transformers

Antoine Yang, Antoine Miech, Josef Sivic, Ivan Laptev, Cordelia Schmid

Comments Updated vIoU results compared to the CVPR'22 camera-ready version; 17 pages; 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.04288 2022-06-01 cs.CV cs.LG

Multiview Transformers for Video Recognition

Shen Yan, Xuehan Xiong, Anurag Arnab, Zhichao Lu, Mi Zhang, Chen Sun, Cordelia Schmid

Comments CVPR 2022; arXiv v4: update results on Epic-Kitchens-100

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.04725 2022-05-13 cs.CV cs.AI cs.LG

Weakly-supervised segmentation of referring expressions

Robin Strudel, Ivan Laptev, Cordelia Schmid

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.05019 2022-05-12 cs.CV cs.CL cs.LG

Learning to Answer Visual Questions from Web Videos

Antoine Yang, Antoine Miech, Josef Sivic, Ivan Laptev, Cordelia Schmid

Comments Accepted at the TPAMI Special Issue on the Best Papers of ICCV 2021. Journal extension of the conference paper arXiv:2012.00451. 16 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.08264 2022-05-11 cs.CV cs.AI cs.CL cs.HC

End-to-end Generative Pretraining for Multimodal Video Captioning

Paul Hongsuck Seo, Arsha Nagrani, Anurag Arnab, Cordelia Schmid

Journal ref Proceedings of Conference on Computer Vision and Pattern Recognition (CVPR) 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.00679 2022-04-05 cs.CV cs.MM cs.SD eess.AS

Learning Audio-Video Modalities from Image Captions

Arsha Nagrani, Paul Hongsuck Seo, Bryan Seybold, Anja Hauth, Santiago Manen, Chen Sun, Cordelia Schmid

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.07044 2022-03-15 cs.CV

Towards unconstrained joint hand-object reconstruction from RGB videos

Yana Hasson, Gül Varol, Ivan Laptev, Cordelia Schmid

Comments Project website: https://hassony2.github.io/homan.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.00115 2022-03-02 cs.CV

The Right Spin: Learning Object Motion from Rotation-Compensated Flow Fields

Pia Bideau, Erik Learned-Miller, Cordelia Schmid, Karteek Alahari

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.11742 2022-02-25 cs.CV

Think Global, Act Local: Dual-scale Graph Transformer for Vision-and-Language Navigation

Shizhe Chen, Pierre-Louis Guhur, Makarand Tapaswi, Cordelia Schmid, Ivan Laptev

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.05279 2022-01-14 cs.CV cs.LG

Class-Balanced Distillation for Long-Tailed Visual Recognition

Ahmet Iscen, André Araujo, Boqing Gong, Cordelia Schmid

Comments The code is available at https://github.com/google-research/google-research/tree/master/class_balanced_distillation

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.06650 2021-11-18 cs.CV

Large-Scale Unsupervised Object Discovery

Huy V. Vo, Elena Sizikova, Cordelia Schmid, Patrick Pérez, Jean Ponce

Comments Accepted to NeurIPS 2021, 19 pages with supplemental materials

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.01300 2021-11-04 cs.CV

Masking Modalities for Cross-modal Video Retrieval

Valentin Gabeur, Arsha Nagrani, Chen Sun, Karteek Alahari, Cordelia Schmid

Comments Accepted at WACV 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.15691 2021-11-02 cs.CV

ViViT: A Video Vision Transformer

Anurag Arnab, Mostafa Dehghani, Georg Heigold, Chen Sun, Mario Lučić, Cordelia Schmid

Comments ICCV 2021. Code at https://github.com/google-research/scenic/tree/main/scenic/projects/vivit

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.08037 2021-10-27 cs.CV

CCVS: Context-aware Controllable Video Synthesis

Guillaume Le Moing, Jean Ponce, Cordelia Schmid

Comments Accepted to NeurIPS 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.09107 2021-10-19 cs.CV cs.LG

Differentiable Rendering with Perturbed Optimizers

Quentin Le Lidec, Ivan Laptev, Cordelia Schmid, Justin Carpentier

详情

展开后加载摘要…

URL PDF HTML 收藏