arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 555
2607.06018 2026-07-08 cs.RO 新提交

RoboTALES: Learning Reasoning-Guided Robot Policies via Task-Aligned Simulated Futures

RoboTALES:通过任务对齐的模拟未来学习推理引导的机器人策略

Hanan Gani, Tejal Kulkarni, Madhoolika Chodavarapu, Nicklas Hansen, Manmohan Chandraker

机构 * University of California, San Diego(加利福尼亚大学圣地亚哥分校)

AI总结 针对预训练视频生成模型用于机器人策略规划的局限,提出RoboTALES框架,通过基于分层语言模型的规划器和基于视觉语言模型的评论家两大创新,学习任务对齐的模拟未来以训练机器人策略,在多样操纵任务中表现优于现有方法。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06007 2026-07-08 cs.CV 新提交

OBBSeg: Irregular Lesion Segmentation under Oriented Bounding Box Annotations

OBBSeg:基于有向边界框标注的不规则病变分割

Jun Wei, Xinchang Liu, Yu Liu, Chuhua Yang, Shuhui Wang, Hui Huang

机构 * CSSE, Shenzhen University(深圳大学计算机科学与软件学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

AI总结 针对医学图像分割像素级标注瓶颈,提出OBBSeg中间监督范式,由有向边界框引导,联合编码空间范围与方向,引入掩码到OBB损失减轻矩形偏差,通过PAFE和DBFE增强前景表示抑制背景干扰,实验表明其性能优异。

Comments 18 pages, 7 figures. ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05994 2026-07-08 cs.CV 新提交

SparseCtrl-HOI: Sparse Temporal Control for Human-Object Interaction Video Generation

SparseCtrl-HOI:用于人机交互视频生成的稀疏时间控制

Shenbo Xie, Mingrui Cai, Xu Yang, Yifei Liu, Changxing Ding

机构 * South China University of Technology(华南理工大学)

AI总结 研究针对人机交互视频生成中建模物理动力学及时空协调复杂、现有方法依赖密集指导成本高且影响多样性的问题,提出SparseCtrl-HOI框架,用关键帧结合新机制和模块控制,构建数据集,降低标注开销,提升直播电商视频质量。

Comments ECCV 2026, Project Page: https://mpi-lab.github.io/SparseCtrl-HOI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05927 2026-07-08 cs.IR cs.AI cs.CL cs.CV 新提交

CMDR: Contextual Multimodal Document Retrieval

CMDR:上下文多模态文档检索

Ryota Tanaka, Taku Hasegawa, Kyosuke Nishida

机构 * Human Informatics Labs.(人文信息实验室) NTT, Inc.(日本NTT公司)

AI总结 研究多模态文档检索,提出CMDR-Embed框架联合编码页面纳入文档上下文,引入CMCL对比学习目标训练,实验证明该框架显著优于非上下文嵌入,凸显上下文感知多模态嵌入对文档检索的重要性。

Comments Accepted by ECCV 2026; project page: https://cmdr-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05733 2026-07-08 cs.CV 新提交

ARMS: Anchor-Relational Motion Streaming for Seamless Solo-Social Motion Transitions

ARMS:用于无缝单人-社交运动转换的锚定关系运动流

Huakun Liu, Qing Yu, Kent Fujiwara, Hideaki Uchiyama, Kiyoshi Kiyokawa

机构 * Nara Institute of Science and Technology(奈良科学技术研究所) LY Corporation(LY 公司)

AI总结 研究旨在从文本生成连续且连贯的人类运动。提出ARMS框架,统一单人运动和人际互动,引入动态不对称表示,用因果关系扩散模型及关系门控实现。实验表明其提升了转换平滑度与社会连贯性,在互动基准测试中表现良好。

Comments Accepted by ECCV 2026. Project page: https://hkliu.com/arms

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05727 2026-07-08 cs.CV 新提交

SAMPLe: SAM-based Optimizer for Prompt Learning in VLMs

SAMPLe:基于SAM的视觉语言模型提示学习优化器

Hossein Rajoli, Fatemeh Lotfi, Niloufar Alipour Talemi, Hossein Kashiani, Xiaolong Ma, Fatemeh Afghah

机构 * Clemson University(克莱姆森大学) Siemens Energy (AI Lab)(西门子能源(人工智能实验室)) University of Arizona(亚利桑那大学)

AI总结 研究VLM提示学习中性能与泛化的困境,提出SAMPLe优化器,通过考虑损失曲面锐度平衡探索与利用,减少过拟合,提升泛对未见能力,在多种提示学习框架中表现出色,优于现有优化器。

Comments The manuscript has been accepted to ECCV and will be presented at the conference and published in the main proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05614 2026-07-08 cs.CL cs.AI cs.CV 新提交

BaFCo: A Document Understanding Benchmark for Complex Bangla Form Comprehension

BaFCo:用于复杂孟加拉语表格理解的文档理解基准

Abu Tyeb Azad, Ishita Sur Apan, Fahim Ahmed, Sumaiya Karim Katha, Ezharuddin Jubaer, Armun Alam, Pranjal Kumar Nandi, Amin Ahsan Ali, Aman Chadha, Md Mofijul Islam, AKM Mahbubur Rahman

机构 * Wichita State University(威奇托州立大学) Center for Computational & Data Sciences(计算与数据科学中心) University of Dhaka(达卡大学) Amazon GenAI(亚马逊生成式人工智能)

AI总结 针对孟加拉语表格理解因高质量标注数据稀缺受限的问题,引入BaFCo基准数据集,涵盖多领域复杂表格。定义细粒度标注模式,评估多种MLLMs,发现其理解孟加拉语表格有局限,尤其在定位细粒度实体方面。

Comments Accepted at the 19th European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05493 2026-07-08 cs.CV 新提交

Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM

Ground3D-LMM:基于LMM的细粒度3D点接地与空间推理

Amol Harsh, Zongyan Han, Jean Lahoud, Ye Liu, Rao Muhammad Anwer, Hisham Cholakkal, Salman Khan, Fahad Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) The Hong Kong Polytechnic University(香港理工大学) Linköping University(林雪平大学)

AI总结 研究3D环境自然语言查询的可操作性问题,提出Ground3D-LMM统一模型,以点云等为输入,支持3D空间对话,能给出基于点的响应和度量数值输出,通过定义新任务、引入数据集验证,为3D对话理解提供强大基线。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04423 2026-07-08 cs.CV cs.AI 新提交

Transferability Between Understanding and Generation in Unified Multimodal Models

统一多模态模型中理解与生成之间的可迁移性

Jiwon Kang, Heeji Yoon, Jaewoo Jung, Jaewon Min, Minkyeong Jeon, Biyeon Hwang, Sangwon Jung, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Blynx(布林克斯公司) Trillionlabs(万亿实验室)

AI总结 研究统一多模态模型中理解与生成任务间的可迁移性,通过实验发现其依赖架构,据此提出实用训练策略,训练对应理解任务迁移至生成可提升性能并减少分布偏移。

Comments Accepted at ECCV 2026. Project Page: https://cvlab-kaist.github.io/UMM_Transferability/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03018 2026-07-08 cs.CV cs.SD 新提交

$C^3$ASD: Multi-Level Consistency-Driven Representation Learning

$C^3$ASD:多层次一致性驱动的表示学习

Jin Hong, Jisoo Park, Junseok Kwon

机构 * Chung-Ang University(中央大学)

AI总结 研究视频中活跃说话者检测问题,提出$C^3$ASD框架,含嵌入级、序列级和预测级一致性约束,提升跨模态表示鲁棒性,在多种损坏下有显著改进。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05390 2026-07-07 cs.RO cs.CV 新提交

Deform360: A Massive Multi-view Visuotactile Dataset for Deformable World Models

Deform360:面向可变形世界模型的大规模多视图视觉触觉数据集

Hongyu Li, Wanjia Fu, Xiaoyan Cong, Zekun Li, Binghao Huang, Hanxiao Jiang, Xintong He, Yiqing Liang, Rao Fu, Tao Lu, Srinath Sridhar, Kevin A. Smith, George Konidaris, Yunzhu Li

机构 * Brown University(布朗大学) Columbia University(哥伦比亚大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 针对可变形物体世界建模缺乏大规模真实数据的问题,构建含多视图视觉与触觉信息的Deform360数据集,评估现有主流世界模型,为相关研究提供基准。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05389 2026-07-07 cs.CV 新提交

InFlux++: Real and Synthetic Data for Estimating Dynamic Camera Intrinsics

InFlux++:用于估计动态相机内参的真实与合成数据

Erich Liang, Caleb Kha-Uong, Chinmaya Saran, Sreemanti Dey, David W. Liu, Junhan Ouyang, Benjamin Zhou, Jia Deng

机构 * Princeton University(普林斯顿大学)

AI总结 针对动态相机内参估计的训练数据匮乏、评测基准多样性不足问题,构建含大规模合成数据集与真实基准的InFlux++,可提升RGB图像的逐帧内参估计性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05376 2026-07-07 cs.CV cs.GR 新提交

MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing

MV-Forcing:基于4D锚定时空自强制的长时长多视角视频生成

Gal Fiebelman, Hadar Averbuch-Elor, Sagie Benaim

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Cornell University(康奈尔大学)

AI总结 针对动态场景长时多视角一致视频生成难题,提出MV-Forcing框架,融合时序与视角自回归,实现任意时长视角数的高一致性多视角视频生成。

Comments Accepted to ECCV 2026. Project webpage: https://galfiebelman.github.io/mv-forcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05347 2026-07-07 cs.CV 新提交

WildSplat: Feedforward Gaussian Splatting from Unposed In-the-Wild Images

WildSplat:基于无位姿野外图像的前向高斯溅射方法

Xiyu Zhang, Jingyu Zhuang, Hongjia Zhai, Zizheng Yan, Jinwei Chen, Guofeng Zhang, Qingnan Fan

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) vivo BlueImage Lab(vivo蓝河图像实验室)

AI总结 针对前向3D重建在光照变化场景下性能不佳的问题,提出双分支解耦架构的WildSplat框架,实现单步前向的野外新视角合成与外观编辑SOTA性能。

Comments 22 pages, 9 figures; Accepted by ECCV 2026. Project page: https://zju3dv.github.io/wildsplat/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05310 2026-07-07 cs.AI 新提交

Evaluating and Understanding Model Editing for Medical Vision Language Models

医学视觉语言模型的模型编辑评估与理解

Guli Zhu, Chenwei Wu, Liyue Shen

机构 * EECS, University of Michigan(密歇根大学电子工程与计算机科学系)

AI总结 针对现有多模态编辑基准不适配临床需求的问题,提出临床基准M3Bench,测试多类编辑方法的性能短板,为医学VLM部署后安全适配提供支撑。

Comments Accepted to the European Conference on Computer Vision (ECCV) 2026. Code and benchmark are available at https://github.com/BioMed-AI-Lab-U-Michgan/M3Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05088 2026-07-07 cs.CV 新提交

RADIANCE: Relative Adaptive Denoising with IP-Adapter for Novel Concept Enhancement

RADIANCE:使用IP-适配器进行相对自适应去噪以增强新颖概念

Zi-Xiang Ni, Bo-Lun Huang, Teng-Fang Hsiao, Bo-Kai Ruan, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

AI总结 针对文本到图像扩散模型合成罕见概念的问题,提出无训练框架RADIANCE,通过三个模块组件增强预训练主干,经实验验证其能提升合成效果。

Comments Accepted to ECCV 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05077 2026-07-07 cs.CV 新提交

LangLoc: "Tell Me What You See"

LangLoc:“告诉我你看到了什么”

Shaurya Kishore Panwar, Roham Zendehdel Nobari, Shirley Feng Yi Lau, Abu Bakr Rahman Shaik, Manuel Günther, Marc Pollefeys, Daniel Barath

机构 * ETH Zürich(苏黎世联邦理工学院) University of Zürich(苏黎世大学) Microsoft(微软公司) HUN-REN SZTAKI(匈牙利科学院计算机与自动化研究所)

AI总结 研究从自然语言进行室内细粒度定位,用含CLIP语义特征的双分支GATv2编码器检索场景,通过射线投射物体可见性估计位置和方向,用贝叶斯对话模块解决歧义,贡献基准数据集。

Comments Accepted at the European Conference of Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04930 2026-07-07 cs.CV cs.AI 新提交

MemPose: Category-level Object Pose Estimation with Memory

MemPose:基于记忆的类别级目标姿态估计

Xiao Lin, Minghao Zhu, Yun Peng, Liuyi Wang, Qiyi Wang, Chengju Liu, Qijun Chen

机构 * Tongji University(同济大学) State Key Laboratory of Autonomous Intelligent Unmanned Systems(自主智能无人系统国家重点实验室)

AI总结 研究类别级目标姿态估计,提出以记忆为中心的MemPose框架,引入外部记忆缓冲区存储并更新结构表示,利用积累经验支持当前感知,实验表明优于现有方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04711 2026-07-07 cs.CV 新提交

Learning Probabilistic Prompt for Continual Learning

学习用于持续学习的概率提示

Hyekang Park, Sanghoon Lee, Geon Lee, Jongyoun Noh, Bumsub Ham

机构 * Yonsei University(延世大学) Samsung Electronics(三星电子)

AI总结 研究持续学习中从序列任务渐进学习并保留旧知识的问题,提出基于概率分布建模提示并构建混合分布采样多样提示的框架,还设正则化损失,实验验证框架有效性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04691 2026-07-07 cs.CV 新提交

From Open Loop to Closed Loop: A Test-Time Iterative Optimization Framework for Reference-Consistent Image Generation

从开环到闭环:用于参考一致图像生成的测试时迭代优化框架

Baixuan Zhao, Xinyu Zhang, Huayu Zheng, Shuaicheng Liu, Xiongkuo Min, Guangtao Zhai, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) University of Electronic Science and Technology of China(电子科技大学)

AI总结 提出测试时迭代优化框架,将参考一致图像生成转为闭环动态跟踪问题,用改进PID算法驱动传感器-控制器架构,迭代优化潜在控制信号,该方法无训练、模型无关且与现有扩散管道无缝集成。

Comments 24 pages, 15 figures. Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04638 2026-07-07 cs.CV 新提交

Learning Structured Visual Compositional Representations for Weakly Supervised Referring Expression Comprehension

用于弱监督指称表达式理解的学习结构化视觉组合表示

Lian Xu, Mohammed Bennamoun, Farid Boussaid, Hamid Laga, Yulan Guo, Dan Xu

机构 * The University of Western Australia(西澳大利亚大学) Murdoch University(莫道克大学) Sun Yat-sen University(中山大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 针对弱监督指称表达式理解问题,提出结构化视觉组合表示学习框架,显式建模一元对象嵌入和成对关系嵌入,引入组合对齐机制,实验证明该方法有效。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04637 2026-07-07 cs.CV 新提交

PixelPilot: Scalable Vision-Language-Action Models for End-to-End Autonomous Driving

PixelPilot:用于端到端自动驾驶的可扩展视觉-语言-动作模型

Pin Tang, Guoqing Wang, Xiangxuan Ren, Zhongdao Wang, Guodongfang Zhao, Bailan, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence, Institute of AI, Shanghai Jiao Tong University(教育部人工智能重点实验室,上海交通大学人工智能研究院) Central Research Institute, Huawei(华为中央研究院)

AI总结 针对现有视觉-语言-动作模型在自动驾驶场景中数据可扩展性有限等问题,提出PixelPilot,采用解耦规划和提升范式,通过知识灌输策略学习,提升了模型性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04608 2026-07-07 cs.CV 新提交

Integrated Forward-Inverse Network for Lensless Image Reconstruction

用于无透镜图像重建的集成正反网络

Donggeon Bae, Jaewoo Jung, Yong Guk Kang, Kyung Chul Lee, Taeyoung Kim, Jongho Kim, Sangjun Byun, Joonsik Park, Seung Ah Lee

机构 * Department of Mechanical Engineering, Seoul National University(韩国首尔国立大学机械工程系) School of Mechanical and Aerospace Engineering/SNU-IAMD, Seoul National University(韩国首尔国立大学机械与航空航天工程学院/SNU-IAMD) Department of Electrical and Electronic Engineering, Yonsei University(韩国延世大学电气与电子工程系) Department of Biomedical Engineering, University of Michigan(美国密歇根大学安娜堡分校生物医学工程系)

AI总结 研究无透镜成像重建难题,提出集成正反网络,通过在各尺度交错可微正向投影与可学习反向更新,利用互补线索,实现渐进、物理一致的细化及PSF内核自适应,达最优重建质量。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04587 2026-07-07 cs.CV 新提交

RAF: Reliability-Aware Fusion of Camera, LiDAR, and 4D RADAR for Robust 3D Object Detection in Adverse Weather

RAF:用于恶劣天气下稳健3D目标检测的相机、激光雷达和4D雷达的可靠性感知融合

Heejun Park, Jaeseok Jeong, Kuk-Jin Yoon

机构 * Visual Intelligence Lab., KAIST(韩国科学技术院视觉智能实验室)

AI总结 针对恶劣天气下多传感器3D目标检测难题,提出RAF方法,通过明确监督像素可靠性估计,利用预训练网络,仅训练新增相机分支等,实验证明该方法有效提升检测精度。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04559 2026-07-07 cs.CV 新提交

QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding

QSVideo:用于视频理解的查询条件语义时间检索

Wei Ao, Lan Wang, Vishnu Naresh Boddeti

机构 * Michigan State University(密歇根州立大学)

AI总结 针对视频理解中视觉语言模型性能随视频时长下降问题,提出QSVideo框架,通过查询条件语义排序器、联合优化相关性和多样性及时间对齐策略,提升视频VLM性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04451 2026-07-07 cs.CV 新提交

CCFM: Collision-Constrained Flow Matching for Safety-Critical Scenario Generation

CCFM:用于安全关键场景生成的碰撞约束流匹配

Ke Li, Kaidi Liang, Yuxin Ding, Debojyoti Biswas, Xianbiao Hu, Ruwen Qin

机构 * Stony Brook University(纽约州立大学石溪分校) Pennsylvania State University(宾夕法尼亚州立大学)

AI总结 研究自动驾驶车辆规划器在安全关键闭环仿真中的评估,提出CCFM框架,通过硬物理约束保证精确碰撞控制,含碰撞选择器、硬约束和碰撞约束流匹配采样器,性能超基线。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04256 2026-07-07 cs.CV 新提交

AdaptiveSplat:Texture Aware Controllable 3D Gaussian Allocation for Feed-Forward Reconstruction

自适应拼接:用于前馈重建的纹理感知可控3D高斯分配

Badrinath Singhal, Srihari K G, Sreehari Iyer, Ankit Dhiman, Venkatesh Babu Radhakrishnan

机构 * Vision and AI Lab, Indian Institute of Science(视觉与人工智能实验室,印度科学研究所) Samsung R & D Institute India - Bangalore(三星印度研发中心 - 班加罗尔)

AI总结 研究前馈3D重建中高斯原语冗余问题,提出利用局部纹理信息控制高斯数量的方法,含纹理估计、纹理感知剪枝和自适应高斯头三个关键组件,实验验证了该方法有效性。

Comments Accepted at ECCV 2026. Project page: https://badrinaths.github.io/projects/adaptive-splat/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04249 2026-07-07 cs.CV 新提交

Beyond Random Sampling: Distribution-Aware Alignment for Semi-Supervised Medical Image Segmentation

超越随机采样:用于半监督医学图像分割的分布感知对齐

Weihao Yan, Yeqiang Qian, Yi Dong, Ming Yang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Department of Ultrasound, Xinhua Hospital Affiliated to Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属新华医院超声科)

AI总结 研究针对半监督医学图像分割中随机采样策略在低数据量时表征偏差的问题,提出基于分布对齐的高效框架,用分布感知样本选择策略和记忆引导复制粘贴模块,提升分割性能。

Comments 19 pages, 5 figures, accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04179 2026-07-07 cs.CV cs.AI 新提交

CritiqueDriveVLM: From Verifier-Guided Reinforcement Learning to Latent Thought Distillation for Autonomous Driving

CritiqueDriveVLM:从验证器引导的强化学习到自动驾驶的潜在思想蒸馏

Zhaohong Liu, Hao Ye, Xianlin Zhang, Mengshi Qi

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) School of Digital Media & Design Arts(数字媒体与设计艺术学院) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 提出CritiqueDriveVLM框架解决自动驾驶中推理幻觉等问题,先通过验证器引导的强化学习培养强大教师模型,再用潜在思想蒸馏压缩能力到学生模型,提升性能并大幅降低推理延迟。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04151 2026-07-07 cs.CV 新提交

Perceiving Better Moments: Cover Frame Reselection and Enhancement for Live Photos with the Live2K Dataset

感知美好瞬间:利用Live2K数据集进行动态照片的封面帧重新选择与增强

Junyu Lou, Kai Chen, Weiyi You, Hui Zeng, Lei Zhang, Shuhang Gu

机构 * University of Electronic Science and Technology of China(电子科技大学) OPPO Research Institute(OPPO研究院) The Hong Kong Polytechnic University(香港理工大学)

AI总结 针对动态照片封面与视频帧质量差距问题,定义LPRE任务,利用动态照片内线索,构建Live2K数据集并开发统一基线,为动态照片增强研究建立首个基准。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏