arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Computer Vision · 会议 · Computer Vision

共收录 10
2508.03243 2026-08-06 cs.CV 版本更新

MVTOP: Multi-View Transformer-based Object Pose-Estimation

MVTOP:基于多视图的Transformer物体姿态估计

Lukas Ranftl, Felix Brendel, Bertram Drost, Carsten Steger

机构 * MVTec Software GmbH(MVTec软件公司) Technical University of Munich(慕尼黑技术大学)

AI总结 MVTOP通过多视图早期融合解决单视图无法解决的姿态歧义问题,利用视线线模型实现多视图几何建模,优于现有单视图和多视图方法。

Comments 9 pages, 7 figures, Accepted as Conference paper to VISAPP 2026

Journal ref Proceedings of the 21st International Conference on Computer Vision Theory and Applications, VISAPP 2026, Marbella, Spain, March 9-11, 2026, Volume 3. SCITEPRESS 2026, ISBN 978-989-758-804-4, pages 181-194

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14171 2026-08-05 cs.LG cs.AI 版本更新

IPPRO: Importance-based Pruning with PRojective Offset for Magnitude-indifferent Structural Pruning

IPPRO:面向幅值无关结构化剪枝的基于重要性的投影偏移剪枝

Jaeheun Jung, Jaehyuk Lee, Yeajin Lee, Donghun Lee

AI总结 针对现有结构化剪枝依赖滤波器幅值的尺度不变性缺陷,提出基于投影几何的IPPRO框架,定义PROscore并关联$L_0$松弛,在多类模型上均优于现有方法,为神经网络压缩提供鲁棒架构无关范式。

Comments ICCV 2025 workshop U&ME 2025 (2nd Workshop and Challenge on Unlearning and Model Editing)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07754 2026-08-05 cs.LG cs.AI 版本更新

One-Point Contraction: Erasing Representational Separability toward Irreversible Deep Forgetting

单点收缩:擦除表示可分性以实现不可逆的深度遗忘

Jaeheun Jung, Bosung Jung, Suhyun Bae, Donghun Lee

机构 * Korea University(韩国大学)

AI总结 本研究发现现有机器遗忘方法可被FM-recovery逆转,提出OPC方法,可实现行为与表示级遗忘,抵御攻击且不牺牲准确率。

Comments ICCV 2025 workshop U&ME 2025 (2nd Workshop and Challenge on Unlearning and Model Editing)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18242 2026-07-17 cs.CV 版本更新

GSVisLoc: Generalizable Visual Localization for Gaussian Splatting Scene Representations

GSVisLoc:用于高斯喷溅场景表示的通用视觉定位

Fadi Khatib, Dror Moran, Guy Trostianetsky, Yoni Kasten, Meirav Galun, Ronen Basri

机构 * Weizmann Institute of Science(魏茨曼科学研究所) NVIDIA(英伟达)

AI总结 GSVisLoc是用于3D高斯喷溅场景表示的视觉定位方法,通过匹配3D高斯生成的场景特征与图像特征来估计相机位姿,分三步进行,无需修改、再训练或额外图像,在标准基准上性能优且能有效推广到新场景。

Comments Accepted to ICCV 2025 Workshops (CALIPOSE). Project page: https://gsvisloc.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19129 2026-07-14 cs.CV 版本更新

KAMERA: Enhancing Aerial Surveys of Ice-associated Seals in Arctic Environments

KAMERA:增强北极环境中与冰相关海豹的航空调查

Adam Romlein, Benjamin X. Hou, Yuval Boss, Cynthia L. Christman, Stacie Koslovsky, Erin E. Moreland, Jason Parham, Anthony Hoogs

机构 * NOAA NMFS AFSC MML(国家海洋管理局NMFS AFSC MML) CICOES(国际极地科学组织) University of Washington(华盛顿大学)

AI总结 KAMERA系统用于北极环境中与冰相关海豹的航空调查,通过多相机多光谱同步及实时检测,减少数据集处理时间,能利用多光谱检测目标,数据带元数据,图像和检测结果可映射到世界平面,软件等完全开源。

Comments 10 pages, 9 figures, 4 tables. Code: https://github.com/Kitware/kamera

Journal ref 2025 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), 2025, pp. 2183-2192

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08875 2026-07-03 cs.AI 版本更新

Causal Explanations for Image Classifiers

图像分类器的因果解释

Hana Chockler, David A. Kelly, Daniel Kroening, Youcheng Sun

机构 * King's College London(伦敦国王学院) Amazon.com, Inc.(亚马逊公司) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Manchester(曼彻斯特大学)

AI总结 本文提出基于实际因果理论的新型黑盒方法,证明算法终止性并展示其在解释效率和精度上的优势。

Comments Accepted to Journal of Artificial Intelligence Research (JAIR). A subset of the contribution was published in ICCV 2021

Journal ref Journal of Artificial Intelligence Research, vol 86, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08237 2026-07-01 cs.MM cs.AI cs.CV cs.SD eess.AS 版本更新

VGGSounder: Audio-Visual Evaluations for Foundation Models

VGGSounder:基础模型的音视频评估

Daniil Zverev, Thaddäus Wiedemer, Ameya Prabhu, Matthias Bethge, Wieland Brendel, A. Sophia Koepke

机构 * Technical University of Munich, MCML(慕尼黑技术大学,MCML) University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) MPI for Intelligent Systems, ELLIS Institute(智能系统Max Planck研究所,ELLIS研究所)

AI总结 针对VGGSound数据集在音视频基础模型评估中的标签不完整、类别重叠和模态错位等问题,提出重新标注的多标签测试集VGGSounder,并引入模态混淆指标分析模型性能退化。

Comments Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11061 2026-07-01 cs.CV cs.AI 版本更新

Robust 3D-Masked Part-level Editing in 3D Gaussian Splatting with Regularized Score Distillation Sampling

基于正则化分数蒸馏采样的鲁棒3D掩膜部分级编辑在3D高斯泼溅中的应用

Hayeon Kim, Ji Ha Jang, Se Young Chun

AI总结 提出RoMaP框架,通过3D几何感知标签预测生成鲁棒3D掩膜,并引入正则化SDS损失(含SLaMP编辑的L1锚点损失),实现精确且大幅度的局部3D高斯编辑。

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11171 2026-06-19 cs.CV cs.AI 版本更新

TerraMind: Large-Scale Generative Multimodality for Earth Observation

TerraMind:面向地球观测的大规模生成式多模态模型

Johannes Jakubik, Felix Yang, Benedikt Blumenstiel, Erik Scheurer, Rocco Sedona, Stefano Maurogiovanni, Jente Bosmans, Nikolaos Dionelis, Valerio Marsocci, Niklas Kopp, Rahul Ramachandran, Paolo Fraccaro, Thomas Brunschwiler, Gabriele Cavallaro, Juan Bernabe-Moreno, Nicolas Longépé

机构 * IBM Research – Europe(IBM欧洲研究院) ETH Zurich(苏黎世联邦理工学院) Forschungszentrum Jülich(尤利希研究中心) European Space Agency(欧洲航天局) Φ \Phi -Lab(Φ实验室) NASA IMPACT University of Iceland(爱沙尼亚大学)

AI总结 提出首个任意到任意生成式多模态基础模型TerraMind,通过双尺度表示(token级和像素级)预训练,实现零样本/少样本应用,并引入“模态思考”能力,在PANGAEA等基准上达到领先性能。

Comments Accepted at ICCV'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13278 2026-06-08 cs.CL cs.LG 版本更新

AutoTool: Dynamic Tool Selection and Integration for Agentic Reasoning

AutoTool: 面向智能体推理的动态工具选择与集成

Jiaru Zou, Ling Yang, Yunzhe Qi, Sirui Chen, Mengting Ai, Ke Shen, Jingrui He, Mengdi Wang

机构 * Nanyang Technological University(南洋理工大学)

AI总结 提出AutoTool框架,通过双阶段优化(SFT+RL轨迹稳定化和KL正则化Plackett-Luce排序)使大语言模型具备动态工具选择能力,在数学、科学、代码和多模态推理等任务上平均提升6.4%-7.7%。

Comments ICML2026; Best Paper Award at ICCV 2025 Workshop on Multi-Modal Reasoning for Agentic Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏