arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

2026-07-24 至 2026-07-24 共收录 16
2607.21595 2026-07-24 cs.CV cs.AI cs.LG 新提交

3D-Aware VLMs with Implicit and Explicit Geometries

具有隐式和显式几何的3D感知视觉语言模型

Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao, Ran Xu, Shijian Lu, Gongjie Zhang

机构 * Nanyang Technological University(南洋理工大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) HuPan Lab(湖畔实验室)

AI总结 研究针对多数2D视觉输入的VLM处理3D任务困难的问题,提出VLM-IE3D框架,通过引入隐式和显式几何令牌及3D感知适配器,融合几何表示与视觉线索,在多种3D任务中表现优异。

Comments Accepted by ECCV 2026, Open Sourced

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21592 2026-07-24 cs.CV 新提交

Unified Video Dense Prediction from Disjoint Data

从不相交数据进行统一视频密集预测

Yihong Sun, Seoung Wug Oh, Jiahui Huang, Bharath Hariharan, Joon-Young Lee

机构 * Adobe Research(Adobe 研究院) Cornell University(康奈尔大学)

AI总结 研究旨在解决现有任务特定注释分散问题,提出统一视频模型UniD,从不相交特定领域数据集联合预测八个密集场景属性。通过简单蒸馏步骤,利用预训练扩散模型视觉先验弥合领域差距,性能优于特定任务专家和多任务基线,泛化能力强。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21485 2026-07-24 cs.CV 新提交

Recurrent Sinusoidal INRs for Efficient High-Fidelity Representation

用于高效高保真表示的循环正弦隐式神经表示

Hyunmin Cho, Jaejun Yoo, Kyong Hwan Jin

机构 * Department of Electrical Engineering, Korea University(韩国大学电气工程系) Graduate School of Artificial Intelligence, UNIST(蔚山国立科学技术院人工智能研究生院)

AI总结 研究将正弦循环用于INRs谐波频谱丰富,通过共享正弦块迭代优化潜在表示,经实验验证其频谱行为,在图像和3D表示任务中表现出色,能以少参数和步骤实现高保真,还可迁移至多种相关任务。

Comments Accepted to ECCV 2026 (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21371 2026-07-24 cs.CV cs.AI 新提交

DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation

DINOde:用于开放词汇语义分割的连续视觉-文本对齐

Sung-Hoon Yoon, Hoyong Kwon, Changgyoon Oh, Kuk-Jin Yoon

机构 * Multimodal Intelligence and Perception Lab., DGIST(多模态智能与感知实验室,大邱庆北科学技术院) Visual Intelligence Lab., KAIST(视觉智能实验室,韩国科学技术院)

AI总结 研究针对开放词汇语义分割中视觉与文本对齐问题,提出基于ODE的DINOde框架,通过语义文本流和全局上下文流、速度切向投影等组件,连续对齐视觉与文本,实验证明该方法优于现有方法,性能达领先水平。

Comments Accepted to ECCV 2026. 27 pages, 8 figures, and 10 tables. Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21155 2026-07-24 cs.CV cs.AI 新提交

CRAG-MM-Diagnostics: Enabling Stage-Wise Analysis of Knowledge-Intensive VQA

CRAG-MM诊断:实现对知识密集型视觉问答的逐阶段分析

Hanseok Oh, Parishad BehnamGhader, Benno Krojer, Hyunji Lee, Paul Liang, Siva Reddy, Verna Dankers

机构 * New York University(纽约大学) McGill University(麦吉尔大学) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) UNC Chapel Hill(北卡罗来纳大学教堂山分校) MIT(麻省理工学院)

AI总结 研究知识密集型视觉问答流程,引入CRAG-MM-Diagnostics诊断基准,通过逐阶段数据注释分离子问题,评估VLM并进行细粒度分析,指出知识检索和推理是主要瓶颈,还提出改进流程提升准确率。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21118 2026-07-24 cs.CV 新提交

The Second LoViF 2026 Challenge on Real-World All-in-One Image Restoration: Methods and Results

第二届LoViF 2026真实世界一体化图像恢复挑战赛:方法与结果

Xiang Chen, Hao Li, Jiangxin Dong, Jinshan Pan, Xin Li, Hongbo Ding, Junpeng Jiang, Xingyu Qiu, Yilian Zhong, Yuxiang Chen, Shibo Yin, Zixuan Huang, Yushun Fang, Xilei Zhu, Yahui Wang, Chen Lu, Xiaodong Zhou, Qingyue Cao, Changwei Gong, Jingyun Liu, Xingchen Yi, Hansen Shi, Ruiyi Liu, Jirui Xie, Tao Liu, Wenzhuo Ma, Hongzhen Li, Yongyong Chen, Zheng Zhou, Jingyong Su, Jie Liu, Haijin Zeng, Cheng Li, Peishuai Zha, Ziyi Wang, Jian Tang, Yan Chen, Long Bao, Heng Sun, Jiyuan Zhang, Shuai Liu, Wei Ding, Chengjun Guo, Yibin Huang, Xiaotao Wang, Dongqing Zou, Lei Lei, Xiaofeng Wang, Xiao Liu, Yulin Wu, Yuhan Zhao, Shurui Peng, Chao Ren, Yu-Kai Wang, Kosuke Shigematsu, Asuka Shin, Rong-Lin Jian, Cheng-Jun Kang, Jin-Hui Jiang, Jialin Zhou, Kuo Yuan, Songyu Zhang, E B Benson, Ashfaq Hussain, Pruthvikanth AC, Qirui Chen, Jinyuan Chen, Jun Zhang, Xu Zhang, Xuhui Cao, Jiaqi Ma, Laibin Chang, Yuchun Miao, Yichu Xu, Yuanzhi Yao, Shi Chen, Yuning Cui, Huan Zhang, Lefei Zhang, Saeed Ahmad, Ik Hyun Lee, Jun Young Park, Ji Hwan Yoon, Shangquan Sun, Behrooz Nobahar-Moghanlou, Majid Edalatjou, Karim Shahi-Niyar, Ruibo Zhang, Dexiang Hong, Xinyan Liu, Shengeng Tang, Weidong Chen

AI总结 第二届LoViF 2026真实世界一体化图像恢复挑战赛为评估模型在多种退化条件下的性能提供基准,吸引众多参与者。报告全面分析提交方案与结果,揭示有效策略,为真实世界低级别视觉研究建立新基准。

Comments ECCV 2026 Workshops; https://lowlevelcv.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20984 2026-07-24 cs.CV 新提交

Distribution-Alignment Bridge for Uncertainty-Aware Text-to-Video Retrieval

用于不确定性感知文本到视频检索的分布对齐桥

Kyeongmo Chae, Jihoon Lee, Sangtae Ahn

机构 * School of Electronic and Electrical Engineering, Kyungpook National University(庆北国立大学电子与电气工程学院)

AI总结 研究文本到视频检索问题,提出分布对齐桥(DAB)框架,将其视为分布对齐任务,通过高斯分布建模考虑不确定性,用受扩散启发的桥和分布感知对比损失优化,在多基准测试中显著优于现有基线并提供校准排名。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20660 2026-07-24 cs.CV 新提交

Axolotl3D: a Unified Framework for Faithful 3D Shape Completion

Axolotl3D:用于精确3D形状完成的统一框架

Anita Hu, Maria Shugrina

机构 * NVIDIA(英伟达)

AI总结 针对3D生成模型在多场景适用性有限及缺乏统一框架的问题,提出Axolotl3D模型,它基于多种模态条件设定,利用点云和相机参数,通过统一训练策略实现精确3D形状完成,实验验证其在多方面性能出色。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20511 2026-07-24 cs.AI 新提交

SiGMA: Sign-Guided Merging and Adaptation for Multimodal Continual Instruction Tuning

SiGMA:用于多模态持续指令微调的符号引导合并与适配

Keonhee Park, Gunhee Kim

机构 * Seoul National University(首尔国立大学)

AI总结 研究多模态持续指令微调中存在的问题,提出SiGMA框架,通过训练时符号引导自适应调优、推理时符号引导合并减轻负面干扰,在相关基准实验中显著减少干扰且性能优于现有方法。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13318 2026-07-24 cs.CV 版本更新

Reflecting Process Expertise in Procedural Material Generation

在程序材质生成中反映过程专业知识

Kunal Gupta, Gaurav Joshi, Yen-Ru Chen, Seemandhar Jain, Ishit Mehta, Manmohan Chandraker

机构 * University of California San Diego(加利福尼亚大学圣地亚哥分校)

AI总结 研究聚焦程序材质生成,核心方法是将其作为检索时的过程推理,利用专家演示、教程视频等提取轨迹并合成材质图。主要贡献是生成的材质编辑少、更符合专业策略,且相比先前系统有更好的生成和编辑性能。

Comments Accepted to ECCV 2026. Project page: https://materialapprentice.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07033 2026-07-24 cs.CV cs.AI 版本更新

AnchorPrune: Relevance-Anchored Contextual Expansion for Visual Token Pruning

AnchorPrune:用于视觉令牌剪枝的相关性锚定上下文扩展

Kyuan Oh, Bumsoo Kim

机构 * Chung-Ang University(崇实大学)

AI总结 研究针对大型视觉语言模型推理成本高、视觉令牌冗余问题,提出无需训练的AnchorPrune框架,通过构建相关性锚点并扩展,自适应确定锚点大小,分配预算恢复上下文,提升了模型的准确率与效率,尤其在严重压缩下效果显著。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05148 2026-07-24 cs.CV 版本更新

Fully Rotation-Equivariant Spectral-Spatial Learning for Multispectral Object Detection

面向多光谱目标检测的完全旋转等变光谱-空间学习

Peng Zhang, Tingfa Xu, Shuaihao Han, Jianan Li

机构 * Beijing Institute of Technology(北京理工大学)

AI总结 针对现有多光谱检测器的三类局限,提出FressDet框架,通过三个互补组件实现任意平面旋转下的可靠光谱-空间融合,在参数量减少93%的情况下取得SOTA性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31533 2026-07-24 cs.CV 版本更新

MV-GEL: Language-Driven Multi-View Geometric Entity Localization on Meshes

MV-GEL:语言驱动的多视图网格几何实体定位

Kartik Bali, Roland Aydin

机构 * Helmholtz Zentrum Hereon(亥姆霍兹赫里恩研究中心) Institute for Continuum and Material Mechanics, Hamburg University of Technology(汉堡工业大学连续介质与材料力学研究所) German Research Center for Artificial Intelligence(德国人工智能研究中心)

AI总结 提出MV-GEL框架,通过语言查询定位网格上的细粒度几何实体,利用视角选择模块GELviews优先选择可观察性高的视角,结合VLM分割和光线投射提升定位精度。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12935 2026-07-24 cs.CV 版本更新

Task Alignment: A Simple Proxy for Practical Model Merging Across Diverse Vision Tasks

任务对齐:一种简单的有效代理,用于计算机视觉中的模型融合

Pau de Jorge, César Roberto de Souza, Björn Michele, Mert Bülent Sarıyıldız, Philippe Weinzaepfel, Florent Perronnin, Diane Larlus, Yannis Kalantidis

机构 * NAVER LABS Europe(NAVER欧洲实验室)

AI总结 本文提出任务对齐代理,解决多任务视觉模型中模型融合的超参数选择问题,提升模型融合在复杂场景中的实用性。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09168 2026-07-24 cs.CV 版本更新

ELT: Elastic Looped Transformers for Visual Generation

ELT:弹性循环变换器用于视觉生成

Sahil Goyal, Swayam Agrawal, Gautham Govind Anil, Prateek Jain, Sujoy Paul, Aditya Kusupati

AI总结 ELT通过共享权重的循环变换块实现高效视觉生成,采用Intra-Loop Self Distillation提升训练效率,实现动态平衡计算成本与生成质量。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20509 2026-07-24 cs.CV 版本更新

Lessons and Open Questions from a Unified Study of Camera-Trap Species Recognition Over Time

从时间维度上统一研究相机陷阱物种识别的启示与开放问题

Sooyoung Jeon, Hongjie Tian, Lemeng Wang, Zheda Mai, Vidhi Bakshi, Jiacheng Hou, Ping Zhang, Arpita Chowdhury, Jianyang Gu, Wei-Lun Chao

机构 * The Ohio State University(俄亥俄州立大学) Boston University(波士顿大学)

AI总结 本文通过统一研究相机陷阱物种识别的时间变化,揭示了生态实践中维持可靠识别的挑战,提出了一种真实场景的基准测试,并发现生物基础模型在多个站点表现不佳,适应性困难,以及类不平衡和时间偏移是主要因素。

Comments The first three authors contribute equally. Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏