arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 4781
2604.22851 2026-07-08 cs.CV cs.CL cs.RO 版本更新

EgoDyn-Bench: Evaluating Ego-Motion Understanding in Vision-Centric Foundation Models for Autonomous Driving

EgoDyn-Bench:评估面向自动驾驶的视觉中心基础模型中的自我运动理解

Finn Rasmus Schäfer, Yuan Gao, Dingrui Wang, Thomas Stauner, Stephan Günnemann, Mattia Piccinini, Sebastian Schmidt, Johannes Betz

机构 * Professorship of Autonomous Vehicle Systems, Technical University of Munich, Munich, Germany(自动驾驶车辆系统教授职位,慕尼黑技术大学,德国慕尼黑) Bayerische Motoren Werke AG, Munich, Germany(巴伐利亚发动机有限公司,德国慕尼黑) Data Analytics and Machine Learning Group, Technical University of Munich, Munich, Germany(数据分析与机器学习小组,慕尼黑技术大学,德国慕尼黑)

AI总结 本文提出EgoDyn-Bench基准,用于评估视觉中心基础模型的自我运动理解能力,发现模型在将物理逻辑与视觉感知结合时存在结构性缺陷,通过显式轨迹编码可恢复物理一致性。

Comments 36 Pages, Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23916 2026-07-08 cs.CV cs.AI 版本更新

DecepGPT: Schema-Driven Deception Detection with Multicultural Datasets and Robust Multimodal Learning

DecepGPT: 基于多文化数据集和鲁棒多模态学习的模式驱动欺骗检测

Jiajian Huang, Dongliang Zhu, Zitong YU, Hui Ma, Jiayu Zhang, Chunmei Zhu, Xiaochun Cao

机构 * Great Bay University(Great Bay大学) Wuhan University(武汉大学) Sun Yat-sen University(孙中山大学)

AI总结 本文提出DecepGPT,通过构建包含结构化线索描述和推理链的推理数据集,释放多文化数据集T4-Deception,并提出SICS和DMC模块,实现多模态欺骗检测的鲁棒学习,实验表明其在领域内和跨领域场景中均取得最佳性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19474 2026-07-08 cs.CV cs.AI cs.MM

Pistachio: Towards Synthetic, Balanced, and Long-Form Video Anomaly Benchmarks

Pistachio: 向合成、平衡和长形式视频异常基准迈进

Jie Li, Hongyi Cai, Mingkang Dong, Muxin Pu, Shan You, Fei Wang, Tao Huang

机构 * Universiti Malaya(马来亚大学) Monash University(莫纳什大学) SenseTime Research(商汤科技研究院) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出Pistachio基准,通过生成式流程构建,提供可控场景、异常类型和时间叙事,减少人工标注依赖,验证了现有方法的挑战并推动动态多事件异常理解研究。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15600 2026-07-08 cs.RO cs.AI cs.CL cs.CV 版本更新

From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation

从被动观察者到主动批评者:强化学习激发机器人操作的过程推理

Yibin Liu, Yaxing Lyu, Daqi Gao, Zhixuan Liang, Weiliang Tang, Shilong Mu, Xiaokang Yang, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) Northeastern University(东北大学) Xiamen University Malaysia(厦门大学马来西亚分校) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Xspark AI

AI总结 本文提出PRIMO R1框架,通过强化学习使视频MLLMs成为主动批评者,提升机器人操作中长期任务的监督准确性,实验表明其在过程推理和零样本泛化方面表现优异。

Comments Accepted to ECCV 2026. 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02716 2026-07-08 cs.CV 版本更新

MorphGS: Morphology-Adaptive Articulated 3D Motion Transfer from Videos

MorphGS:基于形态的 articulated 3D 动作迁移从视频

Taeyeon Kim, Youngju Na, Jumin Lee, Sebin Lee, Minhyuk Sung, Sung-Eui Yoon

AI总结 本文提出MorphGS框架,通过图像空间监督直接优化目标形态和姿态,解决视频到3D角色动作迁移中的形态差异和姿态模糊问题,实验显示优于基线方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00846 2026-07-08 cs.CL 版本更新

Omni-RRM: Advancing Omni Reward Modeling via Automatic Rubric-Grounded Preference Synthesis

Omni-RRM:通过基于自动评分标准的偏好合成推进全模态奖励建模

Zicheng Kong, Dehua Ma, Zhenbo Xu, Alven Yang, Yiwei Ru, Haoran Wang, Zixuan Zhou, Fuqing Bie, Liuyu Xiang, Huijia Wu, Jian Zhao, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究所) ShiFang Technology Inc.(ShiFang科技公司)

AI总结 研究针对多模态大语言模型对齐难题,提出全模态基于评分标准的奖励模型Omni-RRM。通过自动评分标准偏好合成构建数据集,用特定训练方案提升奖励辨别力,在多模态基准测试中达最优精度,还能指导选择与迁移,提升模型对齐能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13431 2026-07-08 cs.CV 版本更新

FUSE: A Flow-based Mapping Between Shapes

FUSE:一种基于流的形状间映射

Lorenzo Olearo, Giulio Viganò, Daniele Baieri, Filippo Maggioli, Simone Melzi

机构 * University of Milano-Bicocca(米兰-布西卡大学) University of Bonn(波恩大学) Lamarr Institute(拉马尔研究所) Pegaso University(佩加索大学)

AI总结 研究3D形状间映射,基于流匹配模型提出新型神经表示,计算高效,支持跨表示形状匹配,无需大规模训练等。通过特定流映射和嵌入编码形状,在多种形状匹配任务及其他任务如UV映射、人体点云扫描配准中表现出色。

Comments 11 pages, 9 figures. Accepted for publication at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13808 2026-07-08 cs.CV 版本更新

VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models

VisCoP:用于视觉语言模型视频域适应的视觉探测

Dominick Reilly, Manish Kumar Govind, Le Xue, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳州立大学查塔努加分校) Elorian AI(Elorian人工智能公司)

AI总结 研究针对视觉语言模型在新领域性能下降问题,提出参数高效的VisCoP框架,通过可学习视觉探测器增强视觉编码器,在多种适应设置下评估,该框架优于现有策略,能有效适应新领域且保留源域能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19120 2026-07-08 cs.CV 版本更新

Freqformer: Image-Demoiréing Transformer via Effective Frequency Decomposition

Freqformer:通过有效频率分解实现图像去网纹的Transformer

Xiaoyang Liu, Bolin Qiu, Zheng Chen, Libo Zhu, Zihan Zhou, Kai Liu, Jiezhang Cao, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 研究针对图像去网纹难题,提出Freqformer框架,通过有效频率分解,将莫尔条纹分离为高频纹理和低频颜色失真,用双分支架构及不对称训练处理,还引入FCT和SA-CA模块,实现高保真重建,以紧凑模型达最优性能。

Comments Accepted to ECCV 2026. Code is available at https://github.com/xyLiu339/Freqformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05390 2026-07-07 cs.RO cs.CV 新提交

Deform360: A Massive Multi-view Visuotactile Dataset for Deformable World Models

Deform360:面向可变形世界模型的大规模多视图视觉触觉数据集

Hongyu Li, Wanjia Fu, Xiaoyan Cong, Zekun Li, Binghao Huang, Hanxiao Jiang, Xintong He, Yiqing Liang, Rao Fu, Tao Lu, Srinath Sridhar, Kevin A. Smith, George Konidaris, Yunzhu Li

机构 * Brown University(布朗大学) Columbia University(哥伦比亚大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 针对可变形物体世界建模缺乏大规模真实数据的问题,构建含多视图视觉与触觉信息的Deform360数据集,评估现有主流世界模型,为相关研究提供基准。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05389 2026-07-07 cs.CV 新提交

InFlux++: Real and Synthetic Data for Estimating Dynamic Camera Intrinsics

InFlux++:用于估计动态相机内参的真实与合成数据

Erich Liang, Caleb Kha-Uong, Chinmaya Saran, Sreemanti Dey, David W. Liu, Junhan Ouyang, Benjamin Zhou, Jia Deng

机构 * Princeton University(普林斯顿大学)

AI总结 针对动态相机内参估计的训练数据匮乏、评测基准多样性不足问题,构建含大规模合成数据集与真实基准的InFlux++,可提升RGB图像的逐帧内参估计性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05376 2026-07-07 cs.CV cs.GR 新提交

MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing

MV-Forcing:基于4D锚定时空自强制的长时长多视角视频生成

Gal Fiebelman, Hadar Averbuch-Elor, Sagie Benaim

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Cornell University(康奈尔大学)

AI总结 针对动态场景长时多视角一致视频生成难题,提出MV-Forcing框架,融合时序与视角自回归,实现任意时长视角数的高一致性多视角视频生成。

Comments Accepted to ECCV 2026. Project webpage: https://galfiebelman.github.io/mv-forcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05347 2026-07-07 cs.CV 新提交

WildSplat: Feedforward Gaussian Splatting from Unposed In-the-Wild Images

WildSplat:基于无位姿野外图像的前向高斯溅射方法

Xiyu Zhang, Jingyu Zhuang, Hongjia Zhai, Zizheng Yan, Jinwei Chen, Guofeng Zhang, Qingnan Fan

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) vivo BlueImage Lab(vivo蓝河图像实验室)

AI总结 针对前向3D重建在光照变化场景下性能不佳的问题,提出双分支解耦架构的WildSplat框架,实现单步前向的野外新视角合成与外观编辑SOTA性能。

Comments 22 pages, 9 figures; Accepted by ECCV 2026. Project page: https://zju3dv.github.io/wildsplat/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05310 2026-07-07 cs.AI 新提交

Evaluating and Understanding Model Editing for Medical Vision Language Models

医学视觉语言模型的模型编辑评估与理解

Guli Zhu, Chenwei Wu, Liyue Shen

机构 * EECS, University of Michigan(密歇根大学电子工程与计算机科学系)

AI总结 针对现有多模态编辑基准不适配临床需求的问题,提出临床基准M3Bench,测试多类编辑方法的性能短板,为医学VLM部署后安全适配提供支撑。

Comments Accepted to the European Conference on Computer Vision (ECCV) 2026. Code and benchmark are available at https://github.com/BioMed-AI-Lab-U-Michgan/M3Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05088 2026-07-07 cs.CV 新提交

RADIANCE: Relative Adaptive Denoising with IP-Adapter for Novel Concept Enhancement

RADIANCE:使用IP-适配器进行相对自适应去噪以增强新颖概念

Zi-Xiang Ni, Bo-Lun Huang, Teng-Fang Hsiao, Bo-Kai Ruan, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

AI总结 针对文本到图像扩散模型合成罕见概念的问题,提出无训练框架RADIANCE,通过三个模块组件增强预训练主干,经实验验证其能提升合成效果。

Comments Accepted to ECCV 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05077 2026-07-07 cs.CV 新提交

LangLoc: "Tell Me What You See"

LangLoc:“告诉我你看到了什么”

Shaurya Kishore Panwar, Roham Zendehdel Nobari, Shirley Feng Yi Lau, Abu Bakr Rahman Shaik, Manuel Günther, Marc Pollefeys, Daniel Barath

机构 * ETH Zürich(苏黎世联邦理工学院) University of Zürich(苏黎世大学) Microsoft(微软公司) HUN-REN SZTAKI(匈牙利科学院计算机与自动化研究所)

AI总结 研究从自然语言进行室内细粒度定位,用含CLIP语义特征的双分支GATv2编码器检索场景,通过射线投射物体可见性估计位置和方向,用贝叶斯对话模块解决歧义,贡献基准数据集。

Comments Accepted at the European Conference of Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04930 2026-07-07 cs.CV cs.AI 新提交

MemPose: Category-level Object Pose Estimation with Memory

MemPose:基于记忆的类别级目标姿态估计

Xiao Lin, Minghao Zhu, Yun Peng, Liuyi Wang, Qiyi Wang, Chengju Liu, Qijun Chen

机构 * Tongji University(同济大学) State Key Laboratory of Autonomous Intelligent Unmanned Systems(自主智能无人系统国家重点实验室)

AI总结 研究类别级目标姿态估计,提出以记忆为中心的MemPose框架,引入外部记忆缓冲区存储并更新结构表示,利用积累经验支持当前感知,实验表明优于现有方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04711 2026-07-07 cs.CV 新提交

Learning Probabilistic Prompt for Continual Learning

学习用于持续学习的概率提示

Hyekang Park, Sanghoon Lee, Geon Lee, Jongyoun Noh, Bumsub Ham

机构 * Yonsei University(延世大学) Samsung Electronics(三星电子)

AI总结 研究持续学习中从序列任务渐进学习并保留旧知识的问题,提出基于概率分布建模提示并构建混合分布采样多样提示的框架,还设正则化损失,实验验证框架有效性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04691 2026-07-07 cs.CV 新提交

From Open Loop to Closed Loop: A Test-Time Iterative Optimization Framework for Reference-Consistent Image Generation

从开环到闭环:用于参考一致图像生成的测试时迭代优化框架

Baixuan Zhao, Xinyu Zhang, Huayu Zheng, Shuaicheng Liu, Xiongkuo Min, Guangtao Zhai, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) University of Electronic Science and Technology of China(电子科技大学)

AI总结 提出测试时迭代优化框架,将参考一致图像生成转为闭环动态跟踪问题,用改进PID算法驱动传感器-控制器架构,迭代优化潜在控制信号,该方法无训练、模型无关且与现有扩散管道无缝集成。

Comments 24 pages, 15 figures. Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04638 2026-07-07 cs.CV 新提交

Learning Structured Visual Compositional Representations for Weakly Supervised Referring Expression Comprehension

用于弱监督指称表达式理解的学习结构化视觉组合表示

Lian Xu, Mohammed Bennamoun, Farid Boussaid, Hamid Laga, Yulan Guo, Dan Xu

机构 * The University of Western Australia(西澳大利亚大学) Murdoch University(莫道克大学) Sun Yat-sen University(中山大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 针对弱监督指称表达式理解问题,提出结构化视觉组合表示学习框架,显式建模一元对象嵌入和成对关系嵌入,引入组合对齐机制,实验证明该方法有效。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04637 2026-07-07 cs.CV 新提交

PixelPilot: Scalable Vision-Language-Action Models for End-to-End Autonomous Driving

PixelPilot:用于端到端自动驾驶的可扩展视觉-语言-动作模型

Pin Tang, Guoqing Wang, Xiangxuan Ren, Zhongdao Wang, Guodongfang Zhao, Bailan, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence, Institute of AI, Shanghai Jiao Tong University(教育部人工智能重点实验室,上海交通大学人工智能研究院) Central Research Institute, Huawei(华为中央研究院)

AI总结 针对现有视觉-语言-动作模型在自动驾驶场景中数据可扩展性有限等问题,提出PixelPilot,采用解耦规划和提升范式,通过知识灌输策略学习,提升了模型性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04608 2026-07-07 cs.CV 新提交

Integrated Forward-Inverse Network for Lensless Image Reconstruction

用于无透镜图像重建的集成正反网络

Donggeon Bae, Jaewoo Jung, Yong Guk Kang, Kyung Chul Lee, Taeyoung Kim, Jongho Kim, Sangjun Byun, Joonsik Park, Seung Ah Lee

机构 * Department of Mechanical Engineering, Seoul National University(韩国首尔国立大学机械工程系) School of Mechanical and Aerospace Engineering/SNU-IAMD, Seoul National University(韩国首尔国立大学机械与航空航天工程学院/SNU-IAMD) Department of Electrical and Electronic Engineering, Yonsei University(韩国延世大学电气与电子工程系) Department of Biomedical Engineering, University of Michigan(美国密歇根大学安娜堡分校生物医学工程系)

AI总结 研究无透镜成像重建难题,提出集成正反网络,通过在各尺度交错可微正向投影与可学习反向更新,利用互补线索,实现渐进、物理一致的细化及PSF内核自适应,达最优重建质量。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04587 2026-07-07 cs.CV 新提交

RAF: Reliability-Aware Fusion of Camera, LiDAR, and 4D RADAR for Robust 3D Object Detection in Adverse Weather

RAF:用于恶劣天气下稳健3D目标检测的相机、激光雷达和4D雷达的可靠性感知融合

Heejun Park, Jaeseok Jeong, Kuk-Jin Yoon

机构 * Visual Intelligence Lab., KAIST(韩国科学技术院视觉智能实验室)

AI总结 针对恶劣天气下多传感器3D目标检测难题,提出RAF方法,通过明确监督像素可靠性估计,利用预训练网络,仅训练新增相机分支等,实验证明该方法有效提升检测精度。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04559 2026-07-07 cs.CV 新提交

QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding

QSVideo:用于视频理解的查询条件语义时间检索

Wei Ao, Lan Wang, Vishnu Naresh Boddeti

机构 * Michigan State University(密歇根州立大学)

AI总结 针对视频理解中视觉语言模型性能随视频时长下降问题,提出QSVideo框架,通过查询条件语义排序器、联合优化相关性和多样性及时间对齐策略,提升视频VLM性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04451 2026-07-07 cs.CV 新提交

CCFM: Collision-Constrained Flow Matching for Safety-Critical Scenario Generation

CCFM:用于安全关键场景生成的碰撞约束流匹配

Ke Li, Kaidi Liang, Yuxin Ding, Debojyoti Biswas, Xianbiao Hu, Ruwen Qin

机构 * Stony Brook University(纽约州立大学石溪分校) Pennsylvania State University(宾夕法尼亚州立大学)

AI总结 研究自动驾驶车辆规划器在安全关键闭环仿真中的评估,提出CCFM框架,通过硬物理约束保证精确碰撞控制,含碰撞选择器、硬约束和碰撞约束流匹配采样器,性能超基线。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04256 2026-07-07 cs.CV 新提交

AdaptiveSplat:Texture Aware Controllable 3D Gaussian Allocation for Feed-Forward Reconstruction

自适应拼接:用于前馈重建的纹理感知可控3D高斯分配

Badrinath Singhal, Srihari K G, Sreehari Iyer, Ankit Dhiman, Venkatesh Babu Radhakrishnan

机构 * Vision and AI Lab, Indian Institute of Science(视觉与人工智能实验室,印度科学研究所) Samsung R & D Institute India - Bangalore(三星印度研发中心 - 班加罗尔)

AI总结 研究前馈3D重建中高斯原语冗余问题,提出利用局部纹理信息控制高斯数量的方法,含纹理估计、纹理感知剪枝和自适应高斯头三个关键组件,实验验证了该方法有效性。

Comments Accepted at ECCV 2026. Project page: https://badrinaths.github.io/projects/adaptive-splat/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04249 2026-07-07 cs.CV 新提交

Beyond Random Sampling: Distribution-Aware Alignment for Semi-Supervised Medical Image Segmentation

超越随机采样:用于半监督医学图像分割的分布感知对齐

Weihao Yan, Yeqiang Qian, Yi Dong, Ming Yang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Department of Ultrasound, Xinhua Hospital Affiliated to Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属新华医院超声科)

AI总结 研究针对半监督医学图像分割中随机采样策略在低数据量时表征偏差的问题,提出基于分布对齐的高效框架,用分布感知样本选择策略和记忆引导复制粘贴模块,提升分割性能。

Comments 19 pages, 5 figures, accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04179 2026-07-07 cs.CV cs.AI 新提交

CritiqueDriveVLM: From Verifier-Guided Reinforcement Learning to Latent Thought Distillation for Autonomous Driving

CritiqueDriveVLM:从验证器引导的强化学习到自动驾驶的潜在思想蒸馏

Zhaohong Liu, Hao Ye, Xianlin Zhang, Mengshi Qi

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) School of Digital Media & Design Arts(数字媒体与设计艺术学院) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 提出CritiqueDriveVLM框架解决自动驾驶中推理幻觉等问题,先通过验证器引导的强化学习培养强大教师模型,再用潜在思想蒸馏压缩能力到学生模型,提升性能并大幅降低推理延迟。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04151 2026-07-07 cs.CV 新提交

Perceiving Better Moments: Cover Frame Reselection and Enhancement for Live Photos with the Live2K Dataset

感知美好瞬间:利用Live2K数据集进行动态照片的封面帧重新选择与增强

Junyu Lou, Kai Chen, Weiyi You, Hui Zeng, Lei Zhang, Shuhang Gu

机构 * University of Electronic Science and Technology of China(电子科技大学) OPPO Research Institute(OPPO研究院) The Hong Kong Polytechnic University(香港理工大学)

AI总结 针对动态照片封面与视频帧质量差距问题,定义LPRE任务,利用动态照片内线索,构建Live2K数据集并开发统一基线,为动态照片增强研究建立首个基准。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04147 2026-07-07 cs.CV cs.AI 新提交

HCSU: A Dataset and Benchmark for Fine-Grained Historical Calligraphy Style Understanding

HCSU:用于细粒度历史书法风格理解的数据集和基准测试

Yinsheng Yao, Yan Liu, Chen Ye

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) The Key Laboratory of Embedded System and Service Computing, Ministry of Education(教育部嵌入式系统与服务计算重点实验室)

AI总结 针对大视觉语言模型在书法风格细粒度理解的挑战,引入HCSU数据集,含多朝代书法家字符图像,解耦模态混合问题,提供分层审美描述及评估协议,揭示当前架构局限以推动视觉推理发展。

Comments Accepted at ECCV 2026. 17 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏