arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 4781
2607.12789 2026-07-15 cs.LG cs.CV 新提交

AVQ-Attention: Adaptive Vector-Quantized Attention

AVQ注意力:自适应向量量化注意力

Winfried van den dool, Patrick Forré, Amir Habibian, Yuki M. Asano, Max Welling

机构 * QUVA Lab, University of Amsterdam(QUVA实验室,阿姆斯特丹大学) AMLab, Informatics Institute, University of Amsterdam(AMLab,阿姆斯特丹大学信息学院) AI4Science Lab, University of Amsterdam(AI4Science实验室,阿姆斯特丹大学) Korteweg-de Vries Institute for Mathematics, University of Amsterdam(科特韦格 - 德弗里斯数学研究所,阿姆斯特丹大学) Qualcomm AI Research(高通人工智能研究公司) FunAI Lab, University of Technology Nuremberg(FunAI实验室,纽伦堡工业大学)

AI总结 研究针对Transformer模型注意力机制计算瓶颈,提出自适应向量量化(AVQ)注意力,基于注意力重要性分配码本容量,前向传播识别重要代码并用子码字细化,开发相关实现,保持\(\mathcal{O}(MN)\)复杂度,提升精度-效率权衡。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12774 2026-07-15 cs.CV cs.AI 新提交

HSEmotion Team at the 11th ABAW Challenge: Multi-Task Learning and Ambivalence/Hesitancy Video Recognition

第11届ABAW挑战赛中的HSEmotion团队:多任务学习与矛盾/犹豫视频识别

Aleksei Bakin, Andrey V. Savchenko

机构 * Central University(中央大学) Sber AI Lab(Sber人工智能实验室) HSE University(俄罗斯高等经济研究大学)

AI总结 在第11届ABAW挑战赛中,团队用冻结轻量级面部提取器等方法进行多任务学习,在s - Aff - Wild2数据集上超ConvNeXt基线;扩展视听管道用于矛盾/犹豫视频识别,在BAH数据集上提升性能,无需微调重型骨干,展示了轻量级融合的优势。

Comments to be submitted to ABAW-11 workshop of ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12539 2026-07-15 cs.CV 新提交

DiTailed: Ensuring Visual Object Consistency in Text-Image-to-Image Flow Matching Models

DiTailed:在文本-图像到图像流匹配模型中确保视觉对象一致性

Francesco Taioli, Daniel Coelho, Iaroslav Melekhov, Roberto Alcover-Couso, Jose Miguel Grande Saiz, Virginia Fernandez Arguedas, Artur Bekasov

机构 * Amazon(亚马逊) Faculty(学院)

AI总结 研究文本引导图像编辑中生成模型视觉对象一致性问题,提出ABO-Edit数据集,发现图像编辑整流流模型条件嵌入空间特性,进而提出FlowMirror无参数辅助损失,无需架构改变提升了生成质量。

Comments Accepted to ECCV 2026. Project page: https://francescotaioli.github.io/DiTailed/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12419 2026-07-15 cs.CV 新提交

DeGuNet: Depth-Guided Ultra-Compact Backbones for Efficient LiDAR-Camera 3D Detection

DeGuNet:用于高效激光雷达-相机3D检测的深度引导超紧凑骨干网络

Haifa Zhang, Yijing Wang, Peixi Peng, Zhiqiang Zuo

机构 * Tianjin University(天津大学) Peking University(北京大学)

AI总结 研究针对自动驾驶中激光雷达与相机融合检测依赖2D预训练骨干网络的问题,提出DeGuNet,通过稀疏感知机制有效对齐图像与激光雷达深度,实验证明其能消除架构冗余,提升效率并提高mAP,建立参数高效多模态3D感知新范式。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12375 2026-07-15 cs.CV cs.AI eess.IV 新提交

IQA-T1: Tool-based Visual Evidence Reasoning for Image Quality Assessment

IQA-T1:基于工具的图像质量评估视觉证据推理

Jinjian Wu, Jiaqi Tang, Wei Wei, Yingying Yan, Jianmin Chen, Botong Geng, Lei Zhang, Qifeng Chen

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机科学学院) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 针对开放世界图像质量评估难题,提出IQA-T1框架,通过自主调用工具生成视觉证据增强多模态大语言模型推理,构建Q-Tool数据集,实验表明该框架性能最佳且评估可解释、基于证据。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12297 2026-07-15 cs.CV 新提交

MobileSAM2: Lightweight Segment Anything for Spatial Intelligence

MobileSAM2:用于空间智能的轻量级图像分割模型

Kai Jiang, Jiaxing Huang, Jingyi Zhang, Weiying Xie, Yunsong Li, Yufei Wang, Aoran Xiao, Dacheng Tao

机构 * Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学) Xidian University(西安电子科技大学) SparcAI Inc.(SparcAI公司)

AI总结 研究旨在使SAM2更适用于移动设备,提出超图知识蒸馏方法HyperKD,由时间和粒度超图知识蒸馏构成,能有效建模转移知识。还推出MobileSAM2家族,经实验验证其在多基准测试及具身AI任务上有良好泛化性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12176 2026-07-15 cs.CV 新提交

A Calibrated Multimodal Ensemble for Ambivalence/Hesitancy Recognition: System Description and Private-Test Submission Strategy

用于矛盾/犹豫识别的校准多模态集成:系统描述与私密测试提交策略

Josep Cabacas-Maso, Ismael Benito-Altamirano, Carles Ventura

机构 * eHealth Center, Faculty of Computer Science, Multimedia and Telecommunicactions, Universitat Oberta de Catalunya(加泰罗尼亚开放大学计算机科学、多媒体与电信学院电子健康中心) MIND/IN2UB, Department of Electronic and Biomedical Engineeering, Universitat de Barcelona(巴塞罗那大学电子与生物医学工程系MIND/IN2UB) Institute of Semiconductor Technology (IHT) & Laboratory for Emerging Nanometrology (LENA), Technische Universität Braunschweig(布伦瑞克工业大学半导体技术研究所(IHT)和新兴纳米计量实验室(LENA))

AI总结 该研究针对BAH数据集上的ABAW A/H挑战,提出校准多模态集成系统,由三个融合模型组成。在公共测试集上宏F1达0.7358,介绍五次私密测试提交的配置等,首次提交在私密测试中宏F1为0.7361,验证系统能推广到未见参与者。

Comments 8 pages, 1 figure, ECCV workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12042 2026-07-15 cs.CV cs.LG 新提交

SymbOmni: Evolving Agentic Omni Models via Symbolic Concept Learning

SymbOmni:通过符号概念学习进化智能全能模型

Jinxiu Liu, Jianru Li, Tanqing Kuang, Xuanming Liu, Kangfu Mei, Yandong Wen, Weiyang Liu

机构 * South China University of Technology(华南理工大学) Westlake University(西湖大学) Johns Hopkins University(约翰·霍普金斯大学) The Chinese University of Hong Kong(香港中文大学) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 针对视觉生成模型无法累积学习与自主进化的问题,提出SymbOmni智能全能模型,通过符号概念学习和归纳-转导循环运行,经言语反向传播训练。实验验证其在多方面性能优越,能有效降低令牌消耗并实现持续学习。

Comments ECCV 2026 (49 pages, 10 figures, project page: https://spherelab.ai/symbomni)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30347 2026-07-15 cs.CV cs.AI 版本更新

FFAvatar: Feed-Forward 4D Head Avatar Reconstruction from Sparse Portrait Images

FFAvatar: 从稀疏肖像图像进行前馈4D头部化身重建

Jianjiang Yao, Ke Xian, Renxiang Dai, Robert Caiming Qiu

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology, Wuhan 430074, China(华中科技大学电子信息与通信学院,武汉430074,中国)

AI总结 提出基于Transformer的3D高斯框架FFAvatar,通过交替注意力机制和稀疏到密集学习范式,从一张或多张参考图像高效构建高质量、可动画的4D头部化身,支持增量重建和动态个性化。

Comments Accepted to ECCV 2026. Project page: https://jj-yao.github.io/ffavatar/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11862 2026-07-14 cs.CV cs.AI 新提交

Evidence-Backed Video Question Answering

有证据支持的视频问答

Shijie Wang, Honglu Zhou, Ziyang Wang, Ran Xu, Caiming Xiong, Silvio Savarese, Chen Sun, Juan Carlos Niebles

机构 * Salesforce, Palo Alto, CA, USA(Salesforce公司) Brown University, Providence, RI, USA(布朗大学)

AI总结 研究视频问答中模型缺乏可视化依据的问题,提出E-VQA任务及ST-Evidence基准,开发数据集ST-Evidence-Instruct,通过微调提高模型表现,为可解释的视频理解建立基线。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11836 2026-07-14 cs.CV 新提交

Cycle-World: Mitigating Error Accumulation in Long-term Video World Models via Reverse-Prediction Cycle Consistency

循环世界:通过反向预测循环一致性减轻长期视频世界模型中的误差累积

Zihan Su, Teng Hu, Jiangning Zhang, Ruiyan Wang, Ran Yi, Lizhuang Ma, Dacheng Tao

机构 * School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院) Institute of Cyber-Systems and Control, Zhejiang University, Hangzhou, China(浙江大学控制系统研究所) Nanyang Technological University, Singapore(新加坡南洋理工大学)

AI总结 针对自回归扩散模型在长视频生成中误差累积问题,提出循环世界框架,通过训练和推理阶段的时间可逆性及反向预测模型抑制误差,实验证明其在VBench基准测试中显著减轻误差漂移,提升生成质量和时间一致性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11798 2026-07-14 cs.CV cs.AI 新提交

StoryTeller: Training-Free Narrative Grounding for Long-Form Audio Description

StoryTeller:用于长格式音频描述的免训练叙事接地

Seung Hyun Hahm, Minh T. Dinh, SouYoung Jin

机构 * Dartmouth College(达特茅斯学院)

AI总结 研究针对长格式音频描述问题,提出免训练的StoryTeller框架。它通过维护叙事记忆跨场景传递信息,仅用原始视频和标题,经语义过滤等确保信息准确。引入StoryAD-QA基准测试,实验证明该框架显著提升了叙事相关能力。

Comments Accepted to the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11710 2026-07-14 cs.CV 新提交

SVI360: Spherical Video Interpolation

SVI360:球面视频插值

Le-Kim Nguyen, Renato Martins, Pascal Vasseur, Cedric Demonceaux

机构 * Université Bourgogne Europe, ICB UMR 6303 CNRS, France(法国布尔格ogne欧洲大学,ICB UMR 6303 CNRS) Université de Picardie Jules Verne, MIS UR 4290, France(法国皮卡第-朱尔斯·维尔纳大学,MIS UR 4290)

AI总结 针对全向视频插值问题,提出双分支框架SVI360,结合图像帧及其旋转正交视图处理失真,增强原始视图与正交视图间流位移等变性改进中间帧预测,在插值质量上优于现有方法。

Comments Accepted at ECCV 2026. Code and trained models are available at: https://icb-vision-ai.github.io/video360_interpolation/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11581 2026-07-14 cs.CV 新提交

Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO

作为自身评论家的智能体:通过循环组相对策略优化统一区域理解与定位

Xin Zhang, Haochen Wang, Yikang Zhou, Jason Li, Robby T. Tan

机构 * National University of Singapore(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学)

AI总结 研究针对多模态大语言模型的区域理解与定位问题,提出循环组相对策略优化框架CycleGRPO,利用任务对偶性构建自我评估范式,仅需区域输入,通过质量感知奖励评估字幕,在多基准测试中提升能力,为推进MLLMs像素级能力提供新途径。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11523 2026-07-14 cs.CV cs.AI 新提交

Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos

Vinci2:在连续自我中心视频中提供主动协助

Gong Sitong, Tianyu Yan, Caixin Kang, Bo Zheng, Xiang Ruan, Huchuan Lu, Kaipeng Zhang, Yoichi Sato, Yifei Huang

机构 * Dalian University of Technology(大连理工大学) Alaya Lab(阿莱雅实验室) The University of Tokyo(东京大学)

AI总结 研究连续自我中心视频中智能助手的主动协助问题,提出Vinci2系统,包含EgoServe基准测试和EgoMemo智能体,通过依赖上下文决策及相关技术,在新基准测试上建立强大基线且在现有测试中具竞争力。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11205 2026-07-14 cs.CV 新提交

Parallax Portrait Matting

视差人像抠图

Xin Cai, Jiawen Chen, Lars Jebe, Tianfan Xue, Zhoutong Zhang

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Adobe NextCam Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(创新香港研发平台下的CPII)

AI总结 针对图像抠图难题,提出视差人像抠图方法,利用连拍摄影中相机小幅度运动产生的前景-背景视差,通过估计trimap和前景/背景运动构建对齐视图预测,能恢复更精细细节和准确前景颜色。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11199 2026-07-14 cs.CV 新提交

DynEval: Holistic Evaluations of T2I Generative Models in the Wild

DynEval:对自然环境下的文本到图像生成模型进行全面评估

Shyam Marjit, Dheeraj Baiju, Anuj Shikarkhane, Akhil Sakthieswaran, Sayak Paul, Anirban Chakraborty

机构 * Indian Institute of Science(印度科学研究所) Hugging Face(拥抱脸)

AI总结 研究针对文本到图像生成模型评估难题,提出DynEval动态评估框架,通过构建两个数据集,利用课程学习策略微调评估器,在多基准测试中与人类判断相关性更高,可对多个T2I模型进行细粒度分析。

Comments Accepted at ECCV 2026. Project page: https://vcl-iisc.github.io/dyneval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11081 2026-07-14 cs.CV cs.AI 新提交

Controlling Motion Transfer in Diffusion Transformers via Attention Heads

通过注意力头控制扩散变换器中的运动传递

Sunyoung Jung, Jiwoo Park, Yoonseok Choi, Kyobin Choo, Ming-Hsuan Yang, Seong Jae Hwang

机构 * Yonsei University(延世大学) LG Electronics(LG电子) University of California, Merced(加州大学默塞德分校)

AI总结 研究如何控制扩散变换器中的运动传递,通过在注意力头层面分析,提出无需参数更新的头感知可控运动传递框架,利用语义对应引导和选择性特征注入,实现精确运动传递并为可控视频生成提供可解释基础。

Comments Accepted to ECCV 2026, Project page: https://sunyj-hxppy.github.io/halo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10985 2026-07-14 cs.CV 新提交

MED-DSLC: Multi-Expert-Domain Classification via Domain Supervision and Logit Calibration

MED-DSLC:通过域监督和对数校准进行多专家域分类

Zheng Zeng, Deepak Sridhar, Nuno Vasconcelos

机构 * University of California, San Diego(加利福尼亚大学圣地亚哥分校)

AI总结 研究针对视觉语言模型在多域零样本分类中存在的问题,提出MED-DSLC方法,结合域监督训练和域内对数缩放,恢复全局对数可比性,是轻量级方案,经实验验证可提升准确率、鲁棒性和可扩展性。

Comments Accepted to ECCV 2026. Code is available at https://github.com/Leonard-Zeng/MED-DSLC

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10984 2026-07-14 cs.CV cs.AI cs.HC cs.LG 新提交

EquiFusion: Kinematics-Agnostic Human Motion Prediction via Equivariant Latent Diffusion

EquiFusion:通过等变潜扩散实现与运动学无关的人体运动预测

Cecilia Curreli, Florian Hofherr, Dominik Muhle, Abhishek Saroha, Riccardo Marin, Daniel Cremers

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

AI总结 研究针对现有3D人体运动预测模型受骨骼运动学硬编码限制的问题,提出EquiFusion模型,通过排列等变架构实现潜扩散,对未见运动学有跨数据集泛化能力,在基准测试中成果领先,建立了新的人体运动预测标准。

Comments Accepted to ECCV 2026. Visit our webpage at https://ceveloper.github.io/publications/equifusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10840 2026-07-14 cs.CV 新提交

OmniX: Any-view and Any-time 4D Reconstruction via Feed-forward Trajectory Fields

OmniX:通过前馈轨迹场进行任意视角和任意时刻的4D重建

Yanqin Jiang, Tengfei Wang, Zhengwei Wang, Chenjie Cao, Junta Wu, Wenhan Luo, Weiming Hu, Jin Gao, Chunchao Guo

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯混元) HKUST(香港科技大学) Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(多模态信息超智能安全北京重点实验室) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院)

AI总结 针对前馈4D重建方法局限,提出OmniX框架,通过解耦动态运动建模与静态几何预测,利用动态令牌和3D运动结构生成轨迹场,并构建数据引擎和数据集,在多任务上取得领先性能。

Comments Accepted by ECCV 2026, project page: https://omnix4d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10792 2026-07-14 cs.CV 新提交

MAC-Splat: Multi-Attribute Consistency for High-Fidelity Sparse-View Reconstruction

MAC-Splat:用于高保真稀疏视图重建的多属性一致性

Jinqian Yang, Yichen Wu, Wanhua Li, Haokun Lin, Renzhen Wang, Xiangchu Feng, Xixi Jia

机构 * Xidian University(西安电子科技大学) Harvard University(哈佛大学) Nanyang Technological University(南洋理工大学) City University of Hong Kong(香港城市大学) Xi’an Jiaotong University(西安交通大学)

AI总结 针对稀疏视图重建中现有方法存在几何伪影的问题,提出MAC-Splat训练框架,利用MASt3R和DINOv3获取2D对应关系并定义MAC损失,联合正则化3D属性,实验证明该方法能有效解决不适定的稀疏视图重建问题,性能优于基线。

Comments Accepted to the European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10580 2026-07-14 cs.CV cs.AI 新提交

DiffUE: Enhancing Utility-Unlearnability Trade-off of Unlearnable Examples via Diffusion Autoencoders

DiffUE:通过扩散自动编码器增强不可学习示例的效用-不可学习性权衡

Syed Irfan Ali Meerza, Oktay Ozturk, Amir Sadovnik, Jian Liu

机构 * University of Tennessee, Knoxville(田纳西大学诺克斯维尔分校) Oak Ridge National University, Knoxville(橡树岭国家实验室诺克斯维尔分部) University of Georgia, Athens(佐治亚大学雅典分校) Virginia Commonwealth University, Richmond(弗吉尼亚联邦大学里士满分校)

AI总结 针对AI模型利用个人图像致隐私侵犯问题,DiffUE通过在图像语义空间注入噪声,利用扩散自动编码器框架操纵语义特征,增强图像不可学习性,显著提升了图像质量和不可学习性之间的权衡,保障个人数据安全。

Comments To appear at the European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10495 2026-07-14 cs.CV 新提交

NanoVSR: Towards Real-Time Video Super-Resolution on Edge Devices

NanoVSR:迈向边缘设备上的实时视频超分辨率

Filip Pawlicki, Marcel Kańduła, Marcin Pucek, Kamil Dobies

机构 * Gdańsk University of Technology(格但斯克工业大学)

AI总结 研究针对边缘设备视频超分辨率计算开销大问题,提出NanoVSR架构,利用结构重参数化实现硬件兼容与低开销,通过渐进训练隐式学习时空对齐,在REDS4基准测试中平衡精度与效率,提升边缘设备超分辨率性能。

Comments Accepted to ECCV 2026. This is the pre-review submitted version, not the camera-ready version. The final authenticated version will be available in the ECCV 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10470 2026-07-14 cs.CV eess.IV 新提交

On the Real-World Generalisability of Optical Flow Models

关于光流模型的现实世界通用性

Petter Reijalt, Sander Gielisse, Rickard Karlsson, Jan van Gemert

机构 * TU Delft(代尔夫特理工大学) Computer Vision Lab(计算机视觉实验室)

AI总结 研究光流模型在现实世界的通用性问题,构建现实世界评估基准,通过FlowFactor数据集发现不同因素下模型性能与现实准确性的关联,指出合成基准测试对现实数据准确性预测能力弱,扩大训练数据量未必能解决差距。

Comments Accepted @ ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10308 2026-07-14 cs.CV 新提交

Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis

通过虚拟模态合成将大型多模态模型推广到通用视觉模态

Shihao Yuan, Yuanze Li, Ruyi Zhang, Ming Liu, Wangmeng Zuo

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算学部)

AI总结 研究大型多模态模型推广到未见视觉模态的挑战,提出VVM-Tuning训练框架,通过模态合成和上下文让模型具备相关能力,引入VVM-Bench基准,实验证明经合成模态训练的模型在多模态上有改进且无需模态内训练。

Comments Accepted by the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10238 2026-07-14 cs.CV 新提交

Benchmarking Dynamic Affective Reasoning: A Viewer-Centric Video Emotion Dataset

动态情感推理基准测试:一个以观众为中心的视频情感数据集

Zhiyan Zhang, Peipei Song, Jinpeng Hu, Jingyang Jia, Xun Yang, Xiaojun Chang

机构 * University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学)

AI总结 研究针对视频情感分析常被视为静态分类问题的不足,引入动态情感推理及数据集DAR,定义三项任务,提出DAR - R1框架,经实验验证其在情感定位和推理方面达新的先进水平。

Comments 25 pages, 6 figures. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10071 2026-07-14 cs.CV cs.RO 新提交

FlashBEV: Fast and Memory-Efficient Exact BEV Transformation with IO-Awareness

FlashBEV:具有I/O感知的快速且内存高效的精确BEV变换

Shunsuke Yokokawa, Hironori Kasahara

机构 * Waseda University(早稻田大学) T2, Inc.(T2公司)

AI总结 研究自动驾驶中BEV感知的视图变换问题,提出FlashBEV执行策略,通过重新设计执行方式,使其在数学上等同于Tensorized Sampling-VT,减少内存流量和开销,降低峰值GPU内存,加速推理延迟,突破可扩展性障碍。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09876 2026-07-14 cs.CV cs.AI q-bio.NC q-bio.QM 新提交

Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data

Prompting-MammAlps:用于相机陷阱数据的细粒度文本到视频检索

Valentin Gabeff, Baptiste Maquignaz, Jennifer Shan, Sepideh Mamooler, Gencer Sumbul, Blair Costelloe, Devis Tuia, Alexander Mathis

机构 * Ecole Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) Max Planck Institute of Animal Behavior(马克斯·普朗克动物行为研究所) University of Konstanz(康斯坦茨大学)

AI总结 针对相机陷阱数据自动检索视频的难题,提出Prompting-MammAlps基准及细粒度可解释TVR方法,训练视觉变压器并结合大语言模型处理查询,在基准测试中取得较好成绩,优于零样本VLM。

Comments Accepted at ECCV 2026; Project page: https://cnai.epfl.ch/prompting-mammalps

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09780 2026-07-14 cs.CV cs.LG 新提交

Towards Real-World Wearable Motion Reconstruction

迈向现实世界的可穿戴运动重建

Andrea Boscolo Camiletto, Rishabh Dabral, Eduardo Alvarado, Thabo Beeler, Marc Habermann, Christian Theobalt

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) Saarbrücken Research Center for Visual Computing, Interaction and AI(萨尔布吕肯视觉计算、交互与人工智能研究中心) Google(谷歌)

AI总结 研究可穿戴设备运动捕捉问题,提出优先考虑轻便设备。贡献包括提供多模态数据集,提出WHIP模型,研究传感器互补性,以实现从任意传感器子集重建运动,处理缺失模态并生成合理运动。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏