arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 333
2511.20196 2026-06-29 cs.AI 版本更新

Towards Benign Memory Forgetting for Selective Multimodal Large Language Model Unlearning

面向选择性多模态大语言模型遗忘的良性记忆遗忘

Zhen Zeng, Leijiang Gu, Zhangling Duan, Feng Li, Cees G. M. Snoek, Meng Wang, Zenglin Shi

机构 * Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) University of Amsterdam(阿姆斯特丹大学)

AI总结 针对多模态大语言模型隐私泄露问题,提出S-MLLMUn Bench基准和SMFA框架,实现精确删除敏感知识同时保持模型基础能力。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03117 2026-06-29 cs.CV cs.SD 版本更新

Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction

通过高级模态条件与交互驯服文本到发声视频生成

Kaisi Guan, Xihua Wang, Zhengfeng Lai, Xin Cheng, Peng Zhang, XiaoJiang Liu, Ruihua Song, Meng Cao

机构 * Renmin University of China(中国人民大学) Apple(苹果公司)

AI总结 提出分层视觉基础字幕框架(HVGC)生成解耦的视频和音频字幕,并基于此引入双塔扩散变换器BridgeDiT,通过双交叉注意力机制实现对称双向信息交互,在三个基准数据集上达到最先进结果。

Comments The 19th European Conference on Computer Vision -- ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03704 2026-06-29 cs.CV 版本更新

QuantV2X: A Fully Quantized Multi-Agent System for Cooperative Perception

QuantV2X:一种用于协同感知的全量化多智能体系统

Seth Z. Zhao, Huizhi Zhang, Zhaowei Li, Juntong Peng, Anthony Chui, Zewei Zhou, Zonglin Meng, Hao Xiang, Zhiyu Huang, Fujia Wang, Ran Tian, Chenfeng Xu, Bolei Zhou, Jiaqi Ma

机构 * UCLA(加州大学洛杉矶分校) UW-Madison(威斯康星大学麦迪逊分校) NCSU(北卡罗来纳州立大学) Purdue University(普渡大学) UC Berkeley(加州大学伯克利分校) UT Austin(德克萨斯大学奥斯汀分校)

AI总结 提出首个全量化多智能体系统QuantV2X,通过端到端量化策略同时降低计算负载和传输带宽,在低比特约束下达到与全精度相当的精度,并显著降低延迟、提升mAP30。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07460 2026-06-29 cs.CV cs.CL 版本更新

SIGNER: Temporally Grounded Sign Language Generation via Time-Resolved Conditioning

SIGNER: 通过时间分辨条件实现时间对齐的手语生成

Taeryung Lee, Hyeongjin Nam, Gyeongsik Moon, Kyoung Mu Lee

机构 * IPAI Dept. of ECE & ASRI, Seoul National University(首尔大学电子与计算机工程系及ASRI) Dept. of CSE, Korea University(高丽大学计算机科学与工程系)

AI总结 提出SIGNER框架,通过时间分辨条件(时间-词汇条件与局部时间融合)确保手语生成中词汇顺序正确和语义准确,在Phoenix-2014T和CSL-Daily上达到最优性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11755 2026-06-26 cs.CV 版本更新

Controllable Egocentric Video Generation via Occlusion-Aware Sparse 3D Hand Joints

可控的第一人称视角视频生成:基于遮挡感知的稀疏3D手部关节点

Chenyangguang Zhang, Botao Ye, Boqi Chen, Alexandros Delitzas, Fangjinhua Wang, Marc Pollefeys, Xi Wang

机构 * ETH Zurich(苏黎世联邦理工学院) MPI for Informatics(信息研究所) Microsoft(微软)

AI总结 提出利用稀疏3D手部关节点作为显式控制信号,通过遮挡感知特征提取和3D加权机制,实现高保真、3D一致的第一人称手物交互视频生成。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01958 2026-06-26 cs.CV 版本更新

MAVFusion: Efficient Infrared and Visible Video Fusion via Motion-Aware Sparse Interaction

MAVFusion: 基于运动感知稀疏交互的高效红外与可见光视频融合

Xilai Li, Weijun Jiang, Xiaosong Li, Yang Liu, Hongbin Wang, Tao Ye, Huafeng Li, Haishu Tan

机构 * Foshan University(佛山大学) Kunming University of Science and Technology(昆明理工大学) China University of Mining and Technology(中国矿业大学)

AI总结 提出MAVFusion端到端视频融合框架,通过运动感知稀疏交互机制,利用光流识别动态区域并分配跨模态注意力,对静态区域使用轻量弱交互模块,在保持时间一致性和细节的同时加速推理,达到14.16 FPS。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10446 2026-06-26 cs.CV 版本更新

SignSparK: Efficient Multilingual Sign Language Production via Sparse Keyframe Learning

SignSparK: 通过稀疏关键帧学习实现高效多语言手语生成

Jianhe Low, Alexandre Symeonidis-Herzig, Maksym Ivashechkin, Ozge Mercanoglu Sincan, Richard Bowden

机构 * CVSSP, University of Surrey, United Kingdom(CVSSP,萨里大学,英国)

AI总结 提出SignSparK框架,利用稀疏关键帧和条件流匹配生成流畅3D手语序列,缓解回归到均值问题,支持多语言和关键帧到姿态编辑,实现最先进性能。

Comments Accepted at European Conference on Computer Vision (ECCV) 2026. Project page available: https://cogvis-cvssp.github.io/papers/signspark/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18254 2026-06-26 cs.CV 版本更新

UniFlow: Zero-Shot LiDAR Scene Flow for Autonomous Vehicles

UniFlow: 自动驾驶车辆的零样本激光雷达场景流

Siyi Li, Qingwen Zhang, Ishan Khatri, Kyle Vedder, Eric Eaton, Deva Ramanan, Neehar Peri

AI总结 提出UniFlow,一种跨多数据集训练的激光雷达场景流前馈模型,无需架构修改即可泛化到未见传感器,在Waymo和nuScenes上分别提升5.1%和35.2%,并在TruckScenes和AEVAScenes上超越先前数据集专用模型30.1%和22.5%。

Comments This work has been accepted to the European Conference on Computer Vision (ECCV) 2026. Project Page: https://lisiyi777.github.io/UniFlow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00813 2026-06-26 cs.CV 版本更新

Generating a Paracosm for Training-Free Zero-Shot Composed Image Retrieval

生成一个Paracosm用于免训练零样本组合图像检索

Tong Wang, Yunhan Zhao, Shu Kong

机构 * University of Macau(澳门大学) UC Irvine(伊丽莎白女王大学) Institute of Collaborative Innovation(协同创新研究院)

AI总结 提出Paracosm方法,通过大多模态模型直接生成“心理图像”并构建合成域,实现免训练的零样本组合图像检索,在多个基准上达到最优性能。

Comments Accepted to ECCV 2026. Website and code: https://leowangtong.github.io/Paracosm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01195 2026-06-26 cs.CV cs.AI 版本更新

VisNec: Measuring and Leveraging Visual Necessity for Multimodal Instruction Tuning

VisNec: 衡量和利用视觉必要性进行多模态指令微调

Mingkang Dong, Hongyi Cai, Jie Li, Sifan Zhou, Bin Ren, Kunyu Peng, Yuqian Fu

机构 * SJTU(上海交通大学) Universiti Malaya(马来亚大学) CMU(卡内基梅隆大学) MBZUAI(穆萨台普大学人工智能研究所) KIT(卡尔斯鲁厄理工学院) KAUST(王国立阿联酋科学技术大学)

AI总结 提出VisNec分数衡量视觉输入在多模态指令微调中的边际贡献,结合语义聚类选择高必要性样本,在15%数据上达到全数据性能的100.2%。

Comments Accepted at ECCV 2026. Project Page: https://dmk041218.github.io/VisNec/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10244 2026-06-26 cs.CV cs.LG 版本更新

Solving Semi-Supervised Few-Shot Learning from an Auto-Annotation Perspective

从自动标注视角解决半监督少样本学习

Tian Liu, Anwesha Basu, James Caverlee, Shu Kong

机构 * Texas A\&M University(德克萨斯A&M大学) University of Macau(澳门大学) Institute of Collaborative Innovation(协同创新研究院)

AI总结 提出SWIFT方法,通过温度锐化softmax输出和分阶段训练,利用视觉语言模型和开放数据,在半监督少样本学习中显著提升性能,接近监督学习水平。

Comments Accepted to ECCV 2026. Website and code: https://tian1327.github.io/SWIFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09959 2026-06-26 cs.CV 版本更新

Towards Consistent and Efficient Dataset Distillation via Diffusion-Driven Selection

通过扩散驱动选择实现一致且高效的数据集蒸馏

Xinhao Zhong, Shuoyang Sun, Zhaoyang Xu, Xulin Gu, Bin Chen, Min Zhang, Yaowei Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Pengcheng Laboratory(鹏城实验室)

AI总结 提出利用扩散先验进行补丁选择而非生成的新框架,通过噪声预测和损失差异识别图像中独特区域,结合类内聚类和排序实现单步蒸馏,在多种指标和设置下优于现有方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19964 2026-06-25 cs.CV 版本更新

2K Retrofit: Entropy-Guided Efficient Sparse Refinement for High-Resolution 3D Geometry Prediction

2K Retrofit: 熵引导的高效稀疏细化用于高分辨率3D几何预测

Tianbao Zhang, Zhenyu Liang, Zhenbo Song, Nana Wang, Xiaomei Zhang, Xudong Cai, Zheng Zhu, Kejian Wu, Gang Wang, Zhaoxin Fan

机构 * BUAA(北京航空航天大学) SJTU(上海交通大学) GigaAI XREAL NUST(南京理工大学) RUC(清华大学) NUDT(国防科技大学) UCAS(中国科学技术大学) BIBMS(北京工业大学)

AI总结 提出2K Retrofit框架,通过快速粗预测和基于熵的稀疏细化,在不修改基础模型的情况下实现高效2K分辨率几何预测,达到SOTA精度和速度。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19297 2026-06-25 cs.CV 版本更新

VolSplat: Rethinking Feed-Forward 3D Gaussian Splatting with Voxel-Aligned Prediction

VolSplat: 重新思考基于体素对齐预测的前馈式3D高斯泼溅

Weijie Wang, Yeqing Chen, Zeyu Zhang, Hengyu Liu, Haoxiao Wang, Zhiyuan Feng, Wenkang Qin, Feng Chen, Jia-Wang Bian, Zheng Zhu, Donny Y. Chen, Bohan Zhuang

机构 * Zhejiang University(浙江大学) GigaAI University of Electronic Science and Technology of China(电子科技大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) The University of Adelaide(阿德莱德大学) Nanyang Technological University(南洋理工大学) Monash University(莫纳什大学)

AI总结 针对前馈式3D高斯泼溅中像素对齐预测的局限性,提出体素对齐的VolSplat方法,通过从预测的3D体素网格直接预测高斯,实现鲁棒的多视图一致性和更优的几何与渲染质量。

Comments ECCV 2026, Project Page: https://lhmd.top/volsplat, Code: https://github.com/ziplab/VolSplat

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11606 2026-06-25 cs.CV 版本更新

Articulat3D: Reconstructing Articulated Digital Twins From Monocular Videos with Geometric and Motion Constraints

Articulat3D: 从单目视频中利用几何和运动约束重建关节式数字孪生

Lijun Guo, Haoyu Zhao, Xingyue Zhao, Rong Fu, Linghao Zhuang, Siteng Huang, Zhongyu Li, Hua Zou

机构 * Wuhan University(武汉大学) Hong Kong Embodied AI Lab(香港具身AI实验室) The Chinese University of Hong Kong(香港中文大学) Peking Union Medical College(北京协和医学院) University of Macau(澳门大学) Zhejiang University(浙江大学)

AI总结 提出Articulat3D框架,通过运动先验初始化和几何运动约束优化,从单目视频重建高保真关节式数字孪生,在合成和真实数据上达到最优性能。

Comments Accepted to ECCV 2026. 26 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17796 2026-06-25 cs.CV cs.AI 版本更新

CustomX: Unified Character, Action, and Scene Customization in Video World Models

CustomX: 视频世界模型中的统一角色、动作与场景定制

Yitong Wang, Fangyun Wei, Hongyang Zhang, Bo Dai, Yan Lu

机构 * Fudan University(复旦大学) Microsoft Research(微软研究院) University of Waterloo(滑铁卢大学) The University of Hong Kong(香港大学)

AI总结 提出CustomX,结合静态世界生成与可控实体模型,支持用户指定角色在3D场景中执行开放动作,通过条件自回归视频生成保持视觉保真度。

Comments Accepted to ECCV 2026. Project page: https://snowflakewang.github.io/CustomX_Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17773 2026-06-25 cs.CV 版本更新

LoT-Pass: Long-term-robust Image Watermarking for Image to Video Generation

LoT-Pass: 面向图像到视频生成的长期鲁棒图像水印

Guanjie Wang, Zehua Ma, Han Fang, Weiming Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 针对图像引导视频生成中源图像追踪缺失的问题,提出跨模态水印框架I2VWM,通过视频模拟噪声层和光流对齐模块增强水印的时间鲁棒性,在开源和商业模型上验证了效果。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12218 2026-06-24 cs.CV 版本更新

Learning Ego-Centric BEV Representations from a Perspective-Privileged View: Cross-View Supervision for Online HD Map Construction

从视角优先视角学习自主视角BEV表示:用于在线HD地图构建的跨视角监督

Daniel Lengerer, Mathias Pechinger, Klaus Bogenberger, Carsten Markgraf

机构 * Technical University of Applied Sciences Augsburg, Germany(应用技术大学阿格堡学院,德国) Technical University of Munich, Germany(慕尼黑技术大学,德国)

AI总结 本文提出跨视角监督方法,通过将几何和拓扑先验从视角优先的俯视视角转移到基于摄像头的BEV编码器,提升自主视角BEV表示的一致性,实验显示在nuScenes数据集上取得显著提升。

Comments Accepted at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14792 2026-06-24 cs.CV 版本更新

MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection

MSPL: 用于开放词汇目标检测的多步伪标签方法

Hojun Choi, Youngsun Lim, Jaeyo Shin, Hyunjung Shim

机构 * KAIST AI(韩国韩世大学AI研究所) Boston University(波士顿大学)

AI总结 提出MSPL框架,通过多步视觉推理(目标定位、类别识别、背景确认)生成伪标签,解决开放词汇检测中单步图像-文本匹配忽略中间推理步骤的问题,在OV-COCO和OV-LVIS上取得最优性能。

Comments This paper has been accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21945 2026-06-24 cs.CV 版本更新

GENA3D: Generative Amodal 3D Modeling by Bridging 2D Priors and 3D Coherence

GENA3D:通过桥接2D先验和3D一致性的生成式非完整3D建模

Junwei Zhou, Yu-Wing Tai

机构 * Dartmouth College(达特茅斯学院)

AI总结 提出GENA3D框架,结合2D生成先验与3D几何推理,在部分遮挡下生成完整且几何一致的3D物体,优于现有方法。

Comments Paper accepted by ECCV 2026. Project page: https://colezwhy.github.io/gena3d/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10931 2026-06-24 cs.CV 版本更新

M4-SAR: A Multi-Resolution, Multi-Polarization, Multi-Scene, Multi-Source Dataset and Benchmark for optical-SAR Object Detection

M4-SAR:面向光学-SAR目标检测的多分辨率、多极化、多场景、多源数据集与基准

Chao Wang, Wei Lu, Xiang Li, Jian Yang, Lei Luo

机构 * Nanjing University of Science and Technology(南京理工大学) Anhui University(安徽大学) Nankai University(南开大学)

AI总结 针对光学与SAR图像融合检测缺乏大规模标准化数据集的问题,构建了包含112,174对对齐图像和近百万标注实例的M4-SAR数据集,并提出端到端融合检测框架E2E-OSDet,实验表明融合可提升mAP 5.7%。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21029 2026-06-24 cs.CV 版本更新

FlowerDance: MeanFlow for Efficient and Refined 3D Dance Generation

FlowerDance: MeanFlow实现高效精细的3D舞蹈生成

Kaixing Yang, Xulong Tang, Ziqiao Peng, Xiangyue Zhang, Puwei Wang, Jun He, Hongyan Liu

机构 * Renmin University of China(中国人民大学) Tsinghua University(清华大学) Wuhan University(武汉大学) Malou Tech Inc(Malou科技公司)

AI总结 提出FlowerDance,结合MeanFlow与物理一致性约束,以少量采样步骤生成高质量舞蹈,并采用BiMamba骨干和通道级跨模态融合实现高效非自回归生成,支持运动编辑,在AIST++和FineDance上达到最优。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18037 2026-06-24 cs.CV 版本更新

Hybrid Event Frame Sensors: Modeling, Calibration, and Simulation

混合事件帧传感器:建模、标定与仿真

Yunfan Lu, Nico Messikommer, Xiaogang Xu, Liming Chen, Yuhan Chen, Nikola Zubic, Davide Scaramuzza, Hui Xiong

机构 * AI Thrust, HKUST(GZ)(人工智能 thrust,香港科技大学(广州)) RPG, University of Zurich(RPG,苏黎世大学) CUHK(香港中文大学) AlpsenTek(阿尔卑斯电子技术)

AI总结 提出首个统一统计成像噪声模型,联合描述APS和EVS像素噪声,开发标定流程估计参数,并构建H-ESIM仿真器生成含真实噪声的RAW帧和事件。

Comments 20 pages, 7 figures, ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14001 2026-06-24 cs.CV cs.AI cs.LG 版本更新

MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment

MOCHA: 多模态对象感知的跨架构对齐

Elena Camuffo, Francesco Barbato, Mete Ozay, Simone Milani, Umberto Michieli

机构 * University of Padova(帕多瓦大学)

AI总结 提出MOCHA蒸馏框架,将冻结VLM教师的多模态区域知识迁移至轻量视觉检测器,通过双重损失实现局部对齐与全局关系一致性,在少样本个性化检测中平均提升10.1%。

Comments 18 pages main paper, 10 pages supplementary material

Journal ref Proceedings of ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17338 2026-06-24 cs.CV cs.AI 版本更新

Render-FM: Feedforward Model for Real-time Photorealistic Volumetric Rendering

Render-FM: 用于实时逼真体积渲染的前馈模型

Zhongpai Gao, Benjamin Planche, Meng Zheng, Anwesa Choudhuri, Van Nguyen Nguyen, Terrence Chen, Ziyan Wu

机构 * United Imaging Intelligence(联合影像智能)

AI总结 提出Render-FM前馈模型,直接从CT体积回归6D高斯溅射参数,实现2.8秒实时渲染,速度提升500倍,并引入解剖引导初始化提升医学图像渲染质量。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20937 2026-06-23 cs.LG 版本更新

Sink-Token-Aware Pruning for Fine-Grained Video Understanding in Efficient Video LLMs

面向高效视频大语言模型的sink-token感知剪枝:用于细粒度视频理解

Kibum Kim, Jiwan Kim, Kyle Min, Yueqi Wang, Jinyoung Moon, Julian McAuley, Chanyoung Park

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国高级科学技术研究院) Oracle University of California, San Diego(加州大学圣地亚哥分校) Electronics and Telecommunications Research Institute (ETRI)(电子电信研究院)

AI总结 本文提出Sink-Token-aware Pruning方法,通过识别并抑制semantically uninformative tokens,提升细粒度视频理解性能,在多种基准测试中表现优异。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24551 2026-06-23 cs.CV 版本更新

PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video Generation

PhyGDPO: 物理感知的分组直接偏好优化以实现物理一致的文本到视频生成

Yuanhao Cai, Kunpeng Li, Menglin Jia, Jialiang Wang, Junzhe Sun, Feng Liang, Weifeng Chen, Felix Juefei-Xu, Chu Wang, Ali Thabet, Xiaoliang Dai, Xuan Ju, Alan Yuille, Ji Hou

机构 * Meta Superintelligence Labs(Meta超智能实验室) Johns Hopkins University(约翰霍普金斯大学) Meta BizAI(Meta商业人工智能)

AI总结 提出PhyAugPipe构建大规模物理增强数据集PhyVidGen-135K,并设计PhyGDPO框架,利用分组Plackett-Luce模型和物理引导奖励机制,实现物理一致的文本到视频生成。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21445 2026-06-23 cs.RO 版本更新

VLA Knows Its Limits: Adaptive Execution Horizons for Robot Policies

VLA 知道自己的极限:机器人策略的自适应执行视界

Haoxuan Wang, Gengyu Zhang, Yan Yan, Ramana Rao Kompella, Gaowen Liu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Cisco Research(思科研究)

AI总结 针对流式视觉-语言-动作模型中执行视界影响性能的问题,提出 AutoHorizon 方法,通过分析注意力权重动态估计每块动作的执行视界,提升机器人操作任务性能。

Comments ECCV 2026. Project page at https://hatchetproject.github.io/autohorizon/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16192 2026-06-23 cs.CV 版本更新

360Anything: Geometry-Free Lifting of Images and Videos to 360°

360Anything: 图像和视频的无几何约束360°生成

Ziyi Wu, Daniel Watson, Andrea Tagliasacchi, David J. Fleet, Marcus A. Brubaker, Saurabh Saxena

机构 * Google DeepMind(谷歌DeepMind) Simon Fraser University(西蒙弗雷泽大学) University of Toronto(多伦多大学)

AI总结 提出无几何约束框架360Anything,基于预训练扩散Transformer,以数据驱动方式学习透视到等距柱状投影映射,无需相机元数据,实现图像和视频到360°全景的高质量生成,并引入循环潜在编码消除拼接伪影。

Comments ECCV 2026. Project page: https://360anything.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22087 2026-06-23 cs.CV 版本更新

Streaming Dense Voxel Representations for 3D Occupancy Prediction

用于3D占用预测的流式密集体素表示

Seokha Moon, Janghyun Baek, Yujin Jeong, Daewon Chae, Giseop Kim, Jungbeom Lee, Jinkyu Kim, Sunwook Choi

机构 * 1 Korea University 2 TU Darmstadt \& hessian.AI 3 University of Michigan 4 DGIST 5 NAVER LABS

AI总结 提出StreamOcc框架,通过两种聚合策略解决密集体素流式处理中的扭曲和动态对象退化问题,在实时约束下实现SOTA性能。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏