arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Computer Vision · 会议 · Computer Vision

共收录 4770
2508.03243 2026-08-06 cs.CV 版本更新

MVTOP: Multi-View Transformer-based Object Pose-Estimation

MVTOP:基于多视图的Transformer物体姿态估计

Lukas Ranftl, Felix Brendel, Bertram Drost, Carsten Steger

机构 * MVTec Software GmbH(MVTec软件公司) Technical University of Munich(慕尼黑技术大学)

AI总结 MVTOP通过多视图早期融合解决单视图无法解决的姿态歧义问题,利用视线线模型实现多视图几何建模,优于现有单视图和多视图方法。

Comments 9 pages, 7 figures, Accepted as Conference paper to VISAPP 2026

Journal ref Proceedings of the 21st International Conference on Computer Vision Theory and Applications, VISAPP 2026, Marbella, Spain, March 9-11, 2026, Volume 3. SCITEPRESS 2026, ISBN 978-989-758-804-4, pages 181-194

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14171 2026-08-05 cs.LG cs.AI 版本更新

IPPRO: Importance-based Pruning with PRojective Offset for Magnitude-indifferent Structural Pruning

IPPRO:面向幅值无关结构化剪枝的基于重要性的投影偏移剪枝

Jaeheun Jung, Jaehyuk Lee, Yeajin Lee, Donghun Lee

AI总结 针对现有结构化剪枝依赖滤波器幅值的尺度不变性缺陷,提出基于投影几何的IPPRO框架,定义PROscore并关联$L_0$松弛,在多类模型上均优于现有方法,为神经网络压缩提供鲁棒架构无关范式。

Comments ICCV 2025 workshop U&ME 2025 (2nd Workshop and Challenge on Unlearning and Model Editing)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07754 2026-08-05 cs.LG cs.AI 版本更新

One-Point Contraction: Erasing Representational Separability toward Irreversible Deep Forgetting

单点收缩:擦除表示可分性以实现不可逆的深度遗忘

Jaeheun Jung, Bosung Jung, Suhyun Bae, Donghun Lee

机构 * Korea University(韩国大学)

AI总结 本研究发现现有机器遗忘方法可被FM-recovery逆转,提出OPC方法,可实现行为与表示级遗忘,抵御攻击且不牺牲准确率。

Comments ICCV 2025 workshop U&ME 2025 (2nd Workshop and Challenge on Unlearning and Model Editing)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02029 2026-07-30 cs.CV cs.AI

Fake & Square: Training Self-Supervised Vision Transformers with Synthetic Data and Synthetic Hard Negatives

Nikos Giakoumoglou, Andreas Floros, Kleanthis Marios Papadopoulos, Tania Stathaki

机构 * Imperial College London(伦敦帝国学院)

Comments ICCV 2025 Workshop LIMIT

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26043 2026-07-29 cs.LG 新提交

Re-thinking Mammography Transfer Learning: The Dataset-Informed Transfer Learning (DITL) Framework for Breast Cancer Screening and Lesion Diagnosis

重新思考乳腺X线摄影转移学习:用于乳腺癌筛查和病变诊断的数据集知情转移学习(DITL)框架

Adarsh Bhandary Panambur, Siming Bayer, Andreas Maier

机构 * Pattern Recognition Lab, Friedrich-Alexander-Universität Erlangen-Nürnberg(模式识别实验室,埃尔朗根-纽伦堡弗里德里希-亚历山大大学) Siemens Healthineers(西门子医疗)

AI总结 研究针对乳腺X线摄影分类性能提升难题,提出DITL框架,整合数据集难度信号与邻域监督,引入自适应组件,无需超参数调整,在大规模和小数据集上均有出色表现,建立了通用的乳腺X线摄影分类框架。

Comments 16 pages, 1 figure, 5 tables. Accepted and presented at the 10th International Conference on Computer Vision & Image Processing (CVIP 2025), IIT Ropar, India, 10-13 December 2025. The paper is currently in press for inclusion in the official conference proceedings. This preprint corresponds to the submitted manuscript and is made available pending publication of the final proceedings version

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21600 2026-07-28 cs.CV

Locally Controlled Face Aging with Latent Diffusion Models

局部控制的面部老化与潜在扩散模型

Lais Isabelle Alves dos Santos, Julien Despois, Thibaut Chauffier, Sileye O. Ba, Giovanni Palma

机构 * L’Oréal AI Research(欧莱雅人工智能研究所)

AI总结 本文提出利用潜在扩散模型实现局部控制的面部老化,通过细粒度控制提升生成结果的真实性和可控性。

Journal ref 2025 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), 2025, pp. 6991-6999

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16926 2026-07-21 cs.CV 新提交

Splat-based 3D Scene Reconstruction with Extreme Motion-blur

基于体素的极端运动模糊3D场景重建

Hyeonjoong Jang, Dongyoung Choi, Donggun Kim, Woohyun Kang, Min H. Kim

机构 * KAIST(韩国科学技术院) HYPERGRAM(超图)

AI总结 研究针对低光照下RGB-D输入的极端运动模糊问题,提出结合高斯体素框架的相机姿态估计与图像去模糊方法,通过对齐帧、调整高斯位置等步骤,提升3D重建质量,优于现有方法,有广泛应用意义。

Journal ref Proceedings of IEEE/CVF International Conference on Computer Vision (ICCV) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18242 2026-07-17 cs.CV 版本更新

GSVisLoc: Generalizable Visual Localization for Gaussian Splatting Scene Representations

GSVisLoc:用于高斯喷溅场景表示的通用视觉定位

Fadi Khatib, Dror Moran, Guy Trostianetsky, Yoni Kasten, Meirav Galun, Ronen Basri

机构 * Weizmann Institute of Science(魏茨曼科学研究所) NVIDIA(英伟达)

AI总结 GSVisLoc是用于3D高斯喷溅场景表示的视觉定位方法,通过匹配3D高斯生成的场景特征与图像特征来估计相机位姿,分三步进行,无需修改、再训练或额外图像,在标准基准上性能优且能有效推广到新场景。

Comments Accepted to ICCV 2025 Workshops (CALIPOSE). Project page: https://gsvisloc.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19129 2026-07-14 cs.CV 版本更新

KAMERA: Enhancing Aerial Surveys of Ice-associated Seals in Arctic Environments

KAMERA:增强北极环境中与冰相关海豹的航空调查

Adam Romlein, Benjamin X. Hou, Yuval Boss, Cynthia L. Christman, Stacie Koslovsky, Erin E. Moreland, Jason Parham, Anthony Hoogs

机构 * NOAA NMFS AFSC MML(国家海洋管理局NMFS AFSC MML) CICOES(国际极地科学组织) University of Washington(华盛顿大学)

AI总结 KAMERA系统用于北极环境中与冰相关海豹的航空调查,通过多相机多光谱同步及实时检测,减少数据集处理时间,能利用多光谱检测目标,数据带元数据,图像和检测结果可映射到世界平面,软件等完全开源。

Comments 10 pages, 9 figures, 4 tables. Code: https://github.com/Kitware/kamera

Journal ref 2025 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), 2025, pp. 2183-2192

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13184 2026-07-14 cs.CV

Triad: Empowering LMM-based Anomaly Detection with Vision Expert-guided Visual Tokenizer and Manufacturing Process

Triad: 通过视觉专家引导的视觉标记器和制造过程增强基于LMM的异常检测

Yuanze Li, Shihao Yuan, Haolin Wang, Qizhang Li, Ming Liu, Chen Xu, Guangming Shi, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Lab(鹏城实验室)

AI总结 Triad通过引入视觉专家引导的标记器和制造过程,提升基于LMM的工业异常检测性能。

Journal ref In Proceedings of the IEEE/CVF International Conference on Computer Vision, pp. 21917-21926. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08875 2026-07-03 cs.AI 版本更新

Causal Explanations for Image Classifiers

图像分类器的因果解释

Hana Chockler, David A. Kelly, Daniel Kroening, Youcheng Sun

机构 * King's College London(伦敦国王学院) Amazon.com, Inc.(亚马逊公司) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Manchester(曼彻斯特大学)

AI总结 本文提出基于实际因果理论的新型黑盒方法,证明算法终止性并展示其在解释效率和精度上的优势。

Comments Accepted to Journal of Artificial Intelligence Research (JAIR). A subset of the contribution was published in ICCV 2021

Journal ref Journal of Artificial Intelligence Research, vol 86, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08237 2026-07-01 cs.MM cs.AI cs.CV cs.SD eess.AS 版本更新

VGGSounder: Audio-Visual Evaluations for Foundation Models

VGGSounder:基础模型的音视频评估

Daniil Zverev, Thaddäus Wiedemer, Ameya Prabhu, Matthias Bethge, Wieland Brendel, A. Sophia Koepke

机构 * Technical University of Munich, MCML(慕尼黑技术大学,MCML) University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) MPI for Intelligent Systems, ELLIS Institute(智能系统Max Planck研究所,ELLIS研究所)

AI总结 针对VGGSound数据集在音视频基础模型评估中的标签不完整、类别重叠和模态错位等问题,提出重新标注的多标签测试集VGGSounder,并引入模态混淆指标分析模型性能退化。

Comments Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11061 2026-07-01 cs.CV cs.AI 版本更新

Robust 3D-Masked Part-level Editing in 3D Gaussian Splatting with Regularized Score Distillation Sampling

基于正则化分数蒸馏采样的鲁棒3D掩膜部分级编辑在3D高斯泼溅中的应用

Hayeon Kim, Ji Ha Jang, Se Young Chun

AI总结 提出RoMaP框架,通过3D几何感知标签预测生成鲁棒3D掩膜,并引入正则化SDS损失(含SLaMP编辑的L1锚点损失),实现精确且大幅度的局部3D高斯编辑。

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15864 2026-06-30 cs.LG

Improving Rectified Flow with Boundary Conditions

通过边界条件改进校正流

Xixi Hu, Runlong Liao, Keyang Xu, Bo Liu, Yeqing Li, Eugene Ie, Hongliang Fei, Qiang Liu

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Google(谷歌)

AI总结 本文提出边界约束校正流模型,通过强制边界条件提升生成模型性能,在ImageNet上使用ODE和SDE采样分别提升FID分数8.01%和8.98%。

Comments ICCV 2025

Journal ref Proc. IEEE/CVF International Conference on Computer Vision (ICCV), 2025, pp. 18177-18186

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24847 2026-06-24 cs.CV 新提交

Spherical-to-ERP Epipolar Rectification for Single-Axis Disparity in 360 Stereo

360度立体中单轴视差的球面到ERP极线校正

Sahereh Obeidavi, Dieter Landes

机构 * Faculty of Electrical Engineering and Computer Science, Coburg University of Applied Science(电气工程与计算机科学学院,科堡应用科学大学)

AI总结 针对球面立体图像中极线对应呈曲线导致二维位移的问题,采用球面到等距柱状投影预处理将极线拉直恢复单轴视差,结合RAFT+EACS框架实现实时高精度视差估计。

Comments 7 Pages, 4 Figures, Conference

Journal ref International Conference on Computer Vision and Artificial Intelligence (ICCVAI - 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11171 2026-06-19 cs.CV cs.AI 版本更新

TerraMind: Large-Scale Generative Multimodality for Earth Observation

TerraMind:面向地球观测的大规模生成式多模态模型

Johannes Jakubik, Felix Yang, Benedikt Blumenstiel, Erik Scheurer, Rocco Sedona, Stefano Maurogiovanni, Jente Bosmans, Nikolaos Dionelis, Valerio Marsocci, Niklas Kopp, Rahul Ramachandran, Paolo Fraccaro, Thomas Brunschwiler, Gabriele Cavallaro, Juan Bernabe-Moreno, Nicolas Longépé

机构 * IBM Research – Europe(IBM欧洲研究院) ETH Zurich(苏黎世联邦理工学院) Forschungszentrum Jülich(尤利希研究中心) European Space Agency(欧洲航天局) Φ \Phi -Lab(Φ实验室) NASA IMPACT University of Iceland(爱沙尼亚大学)

AI总结 提出首个任意到任意生成式多模态基础模型TerraMind,通过双尺度表示(token级和像素级)预训练,实现零样本/少样本应用,并引入“模态思考”能力,在PANGAEA等基准上达到领先性能。

Comments Accepted at ICCV'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13381 2026-06-09 cs.CV cs.GR

Leveraging 2D Priors and SDF Guidance for Dynamic Urban Scene Rendering

利用2D先验和SDF引导进行动态城市场景渲染

Siddharth Tourani, Jayaram Reddy, Akash Kumbar, Satyajit Tourani, Nishant Goyal, Madhava Krishna, N. Dinesh Reddy, Muhammad Haris Khan

机构 * IIIT Hyderabad(海得拉尔印度理工学院) MBZUAI(穆罕默德·本·拉希德智能研究院) University of Heidelberg(海德堡大学) VLM Run IIT Kharagpur(克达尔理工学院)

AI总结 本文提出结合2D对象无关先验与SDF表示的方法,用于动态城市场景渲染,无需LiDAR数据,提升几何精度和变形建模能力。

Comments Accepted at ICCV-2025, project page: https://dynamic-ugsdf.github.io/

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13278 2026-06-08 cs.CL cs.LG 版本更新

AutoTool: Dynamic Tool Selection and Integration for Agentic Reasoning

AutoTool: 面向智能体推理的动态工具选择与集成

Jiaru Zou, Ling Yang, Yunzhe Qi, Sirui Chen, Mengting Ai, Ke Shen, Jingrui He, Mengdi Wang

机构 * Nanyang Technological University(南洋理工大学)

AI总结 提出AutoTool框架,通过双阶段优化(SFT+RL轨迹稳定化和KL正则化Plackett-Luce排序)使大语言模型具备动态工具选择能力,在数学、科学、代码和多模态推理等任务上平均提升6.4%-7.7%。

Comments ICML2026; Best Paper Award at ICCV 2025 Workshop on Multi-Modal Reasoning for Agentic Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10897 2026-06-05 cs.CV

Can Language Models Learn to Listen?

语言模型能否学会倾听?

Evonne Ng, Sanjay Subramanian, Dan Klein, Angjoo Kanazawa, Trevor Darrell, Shiry Ginosar

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出了一种基于说话人话语生成适当面部回应的框架,通过将量化后的面部动作元素作为额外语言token输入到基于transformer的大型语言模型中,从而提升监听响应的质量。

Comments ICCV 2023; Project page: https://people.eecs.berkeley.edu/~evonne_ng/projects/text2listen/

详情

展开后加载摘要…

URL PDF HTML 收藏
1709.01237 2026-06-04 cs.CV cs.LG cs.NA math.NA

Newton-type Methods for Inference in Higher-Order Markov Random Fields

牛顿型方法在高阶马尔可夫随机场推断中的应用

Hariprasad Kannan, Nikos Komodakis, Nikos Paragios

AI总结 本文研究了在高阶马尔可夫随机场推断中使用牛顿型方法求解拉格朗日对偶问题的益处,提出了一种收敛性可证且高效的框架,包含Hessian矩阵构建的计算复杂度与精度的平衡策略、阻尼策略、截断策略与通用预条件器的结合,以及稀疏团势能的高效求和-乘积计算。

Comments 10 pages, 3 figures, 3 tables, CVPR 2017

Journal ref Poster at IEEE International Conference on Computer Vision and Pattern Recognition 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1208.4391 2026-06-03 cs.CV cs.SY eess.SY

Shape Tracking With Occlusions via Coarse-To-Fine Region-Based Sobolev Descent

基于粗到细区域Sobolev下降的遮挡形状跟踪

Yanchao Yang, Ganesh Sundaramoorthi

AI总结 提出一种在参数化区域黎曼流形上通过粗到细优化处理自遮挡和去遮挡的联合形状与外观跟踪方法,实现精确形状检测。

Comments Extension of ICCV paper, added coarse-to-fine optimization based on new Riemannian manifold of parameterized regions

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12377 2026-06-02 cs.CV

Fast Image Super-Resolution via Consistency Rectified Flow

通过一致性修正流实现快速图像超分辨率

Jiaqi Xu, Wenbo Li, Haoze Sun, Fan Li, Zhixin Wang, Long Peng, Jingjing Ren, Haoran Yang, Xiaowei Hu, Renjing Pei, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Noah’s Ark Lab(华为诺亚实验室) HKUST (GZ)(香港科技大学(广州)) South China University of Technology(华南理工大学)

AI总结 提出FlowSR方法,将超分辨率问题重构为从低分辨率到高分辨率图像的修正流,利用改进的一致性学习策略实现单步高质量超分辨率。

Comments Accepted by ICCV 2025; Code: https://github.com/jiaqixuac/FlowSR

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06006 2026-06-02 cs.LG cs.AI cs.NE

Optuna vs Code Llama: Are LLMs a New Paradigm for Hyperparameter Tuning?

Optuna vs Code Llama:LLM 是超参数调优的新范式吗?

Roman Kochnev, Arash Torabi Goodarzi, Zofia Antonina Bentyn, Dmitry Ignatov, Radu Timofte

机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg, Germany(计算机视觉实验室,CAIDAS与IFI,乌尔姆大学,德国)

AI总结 通过微调参数高效的 Code Llama 模型,提出基于大语言模型的超参数优化方法,在多种视觉架构上实现与 Optuna 相当或更优的 RMSE 并大幅降低计算开销。

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), pp. 5664-5674, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09035 2026-06-02 cs.CV

Princeton365: A Diverse Dataset with Accurate Camera Pose

Princeton365: 一个具有精确相机位姿的多样化数据集

Karhan Kayan, Stamatis Alexandropoulos, Rishabh Jain, Yiming Zuo, Erich Liang, Jia Deng

机构 * Princeton University(普林斯顿大学)

AI总结 提出Princeton365数据集,包含365个视频和精确相机位姿,通过校准板和360度相机的新颖真值采集框架弥合精度与多样性差距,并引入基于光流的尺度感知评估指标及新颖视图合成基准。

Comments Update v2: Match the ICCV 2025 camera-ready version. Fix typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10114 2026-06-01 cs.CV

A Lightweight Ensemble-Based Face Image Quality Assessment Method with Correlation-Aware Loss

一种基于集成学习的轻量级人脸图像质量评估方法及关联感知损失

MohammadAli Hamidi, Hadi Amirpour, Luigi Atzori, Christian Timmerer

机构 * DIEE, University of Cagliari, CNIT, University of Cagliari(卡利亚里大学DIEE部门,CNIT,卡利亚里大学) Department of Information Technology (ITEC), Alpen-Adria Universität Klagenfurt(克雷格弗尔德大学信息科技学院(ITEC))

AI总结 提出一种轻量级集成方法,结合MobileNetV3-Small和ShuffleNetV2,使用MSECorrLoss损失函数,在VQualA基准上达到高精度与低计算成本。

Comments This paper has been published in the Proceedings of ICCV 2025. The final published version is available via IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09266 2026-05-29 cs.CV

SAGE: Segment-Aware Gloss-Free Encoding for Token-Efficient Sign Language Translation

SAGE: 面向令牌高效手语翻译的分段感知无词汇编码

JianHe Low, Ozge Mercanoglu Sincan, Richard Bowden

机构 * CVSSP, University of Surrey, United Kingdom(CVSSP,萨里大学,英国)

AI总结 提出分段感知视觉标记化框架,通过手语分段将连续视频转换为离散视觉令牌,结合令牌级对比对齐和双层监督,在减少序列长度50%的同时,在PHOENIX14T基准上超越现有方法。

Comments Accepted in International Conference on Computer Vision (ICCV) Workshops. Code released at https://github.com/JianHe0628/SAGE

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05094 2026-05-22 cs.CV

VChain: Chain-of-Visual-Thought for Reasoning in Video Generation

VChain:用于视频生成中推理的视觉思维链

Ziqi Huang, Ning Yu, Gordon Chen, Haonan Qiu, Paul Debevec, Ziwei Liu

机构 * eyeline-labs(Eyeline Labs)

AI总结 本文提出VChain,一种在视频生成中引入多模态模型视觉推理信号的新型推理时间视觉思维链框架,通过生成关键帧来指导预训练视频生成器的稀疏推理时间视觉状态适应,从而提升视频生成质量。

Comments ACL 2026 (Findings Paper), ICCV 2025 Workshop Outstanding Paper Award, Project page: https://eyeline-labs.github.io/VChain

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13111 2026-05-20 cs.CV cs.GR

Motion-2-To-3: Leveraging 2D Motion Data for 3D Motion Generations

Motion-2-To-3: 利用2D运动数据进行3D运动生成

Ruoxi Guo, Huaijin Pi, Zehong Shen, Qing Shuai, Zechen Hu, Zhumei Wang, Yajiao Dong, Ruizhen Hu, Taku Komura, Sida Peng, Xiaowei Zhou

机构 * Zhejiang University(浙江大学) Deep Glint The University of Hong Kong(香港大学) Shenzhen University(深圳大学)

AI总结 本文提出了一种利用2D视频中提取的运动数据来改进基于文本的3D运动生成的方法,通过解耦局部关节运动和全局运动,有效学习局部运动先验,从而提升生成的3D人体运动的真实性和多样性。

Comments Project page: https://zju3dv.github.io/Motion-2-to-3/

Journal ref 2025 IEEE/CVF International Conference on Computer Vision (ICCV), Honolulu, HI, USA, 2025, pp. 14305-14316

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25969 2026-05-19 cs.CV

A Multi-purpose Tracking Framework for Salmon Welfare Monitoring in Challenging Environments

一种用于挑战性环境中鲑鱼福利监测的多用途跟踪框架

Espen Uri Høgstedt, Christian Schellewald, Annette Stahl, Rudolf Mester

机构 * Norwegian University of Science and Technology(挪威科学技术大学) SINTEF Ocean(SINTEF海洋)

AI总结 本文提出了一种多用途跟踪框架,用于在具有挑战性的环境中实现鲑鱼福利的自动化监测,通过使用姿态估计网络提取鲑鱼的边界框及其对应的身体部位信息,以解决水下鲑鱼场景中的特定挑战,并构建了两个新的数据集来评估鲑鱼跟踪的挑战。

Comments Accepted to the Joint Workshop on Marine Vision 2025 (CVAUI & AAMVEM), held in conjunction with ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15267 2026-05-18 cs.CV cs.AI cs.LG

Autoguided Online Data Curation for Diffusion Model Training

自引导在线数据精炼用于扩散模型训练

Valeria Pais, Luis Oala, Daniele Faccio, Marco Aversa

机构 * University of Glasgow(格拉斯哥大学) Dotphoton

AI总结 本文研究自引导和在线数据选择方法对扩散模型训练效率的影响,通过合成数据任务验证了自引导在样本质量和多样性上的优势。

Comments Accepted non-archival paper at ICCV 2025 Workshop on Curated Data for Efficient Learning (CDEL)

详情

展开后加载摘要…

URL PDF HTML 收藏