arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11871
2605.23160 2026-05-25 cs.RO cs.CV

Semantic-Aware Guided Drone Exploration for Language-Conditioned 3D Indoor Mapping

语义感知引导的无人机探索:面向语言条件的三维室内建图

Nitin Vegesna, Avideh Zakhor

机构 * Department of Electrical Engineering and Computer Sciences(电气工程与计算机科学系)

AI总结 提出SAGE系统,结合CLIP语义提示与覆盖导向探索,在未知室内环境中优先发现目标物体,同时保持高覆盖率。

Comments 10 pages, 6 figures, 4 tables. To be presented at the 2nd 3D-LLM/VLA Workshop at CVPR 2026 (non-archival workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23141 2026-05-25 cs.CV

VisAnalog: A Diagnostic Suite for Visual Concept Transfer on Natural Images

VisAnalog:自然图像上视觉概念迁移的诊断套件

Zhaonan Li, Kyle R. Chickering, Bangzheng Li, Jacob Dineen, Xiao Ye, Zhikun Xu, Shijie Lu, Yuxi Huang, Ming Shen, Bach Nguyen, Jaya Adithya Pavuluri, Mau Son Nguyen, Sanika Chavan, Ngoc Minh Thu Le, Muhao Chen, Ben Zhou

机构 * Arizona State University(亚利桑那州立大学) Luma AI UC Davis(加州大学戴维斯分校)

AI总结 提出VisAnalog基准,通过类比推理任务评估视觉语言模型在自然图像上迁移视觉概念的能力,发现模型在推断关系和应用变换上存在瓶颈。

Comments Accepted to the Workshop on Visual Concepts at CVPR 2026 as a non-archival report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22997 2026-05-25 cs.CV

Scene Reconstruction as Mapping Priors for 3D Detection

场景重建作为3D检测的映射先验

Yang Fu, Yuliang Zou, Hao Xiang, Xin Huang, Yijing Bai, Chen Song, Weijing Shi, Govind Thattai, Dragomir Anguelov, Mingxing Tan, Yingwei Li

机构 * Waymo LLC(Waymo公司) UC San Deigo(加州大学圣地亚哥分校)

AI总结 提出利用自动构建的密集映射先验增强3D检测,设计MPA3D框架融合多模态传感器数据,在Waymo数据集上取得新最优结果。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02897 2026-05-25 cs.CV

ProGIC: Progressive and Lightweight Generative Image Compression with Residual Vector Quantization

ProGIC:基于残差向量量化的渐进式轻量级生成图像压缩

Hao Cao, Chengbin Liang, Wenqi Guo, Zhijin Qin, Jungong Han

机构 * Tsinghua University(清华大学) State Key Laboratory of Space Network and Communications(空间网络与通信国家重点实验室)

AI总结 提出一种基于残差向量量化的轻量级渐进式生成图像压缩方法ProGIC,通过逐级量化残差实现粗到细重建和渐进比特流,在保持感知质量的同时显著提升编码解码速度。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17171 2026-05-25 cs.CV cs.LG

FireScope: Wildfire Risk Raster Prediction with a Chain-of-Thought Oracle

FireScope: 基于思维链预言机的野火风险栅格预测

Mario Markov, Stefan Maria Ailuro, Luc Van Gool, Konrad Schindler, Danda Pani Paudel

机构 * ETH Zurich(苏黎世联邦理工学院)

AI总结 提出FireScope框架,利用视觉语言模型结合强化学习和视觉监督,通过推理轨迹生成野火风险栅格,在跨大陆泛化中取得显著性能提升。

Comments CVPR 2026, Project Page: https://firescope.ai/research

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17015 2026-05-25 cs.CV cs.CL

Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models

Multi-SpatialMLLM: 多模态大语言模型的多帧空间理解

Runsen Xu, Weiyao Wang, Hao Tang, Xingyu Chen, Xiaodong Wang, Fu-Jen Chu, Matt Feiszli, Kevin J. Liang

机构 * FAIR, Meta(FAIR,Meta) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出一种框架,通过整合深度感知、视觉对应和动态感知等基本空间技能,使多模态大语言模型具备多帧空间理解能力,并构建MultiSPA数据集和基准测试,模型Multi-SpatialMLLM在多项任务上取得显著提升。

Comments CVPR 2026 Camera Ready. 27 pages. Project page: https://runsenxu.com/projects/Multi-SpatialMLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22942 2026-05-25 cs.CV

Improved Vision-to-Chart Buoy Association with Learned World-to-Image Projection

改进的视觉到图表浮标关联:学习世界到图像投影

Borja Carrillo-Perez

机构 * Arquimea Research Center(阿基米德研究中心)

AI总结 针对MaCVi 2026视觉到图表数据关联挑战,提出在DETR融合变压器基线中增加专用MLP(QueryMLP)来显式预测浮标水线接触点的像素坐标,从而减轻变压器的几何推理负担,在测试集上取得Overall 0.7386、F1 0.8055、mIoU 0.6718,排名第二。

Comments 5 pages, 3 figures. Technical report for the MaCVi 2026 Vision-to-Chart Data Association Challenge at the CVPR 2026 Workshop; 2nd place submission. Code: https://github.com/bcarrpe/macvi26-visionmap-querymlp

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22903 2026-05-25 cs.CV cs.AI cs.CL

Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?

不看而见:视觉-语言基准测试真的测试视觉吗?

Zixuan Lan, Luzhe Sun, Matthew R. Walter, Jiawei Zhou

机构 * University of Chicago(芝加哥大学) Stony Brook University(石溪大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

AI总结 通过系统性实验发现,视觉-语言模型对细粒度视觉证据的依赖程度低于预期,表明当前基准测试不足以可靠评估其视觉基础能力。

Comments Accepted to GRAIL-V: Grounded Retrieval and Agentic Intelligence for Vision-Language, CVPR 2026 Workshop. accepted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22816 2026-05-22 cs.RO cs.CV

AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation

AwareVLN: 基于自感知的视觉语言导航推理

Wenxuan Guo, Xiuwei Xu, Yichen Liu, Xiangyu Li, Hang Yin, Huangxing Chen, Wenzhao Zheng, Jianjiang Feng, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学)

AI总结 本文提出AwareVLN框架,通过自感知推理机制实现端到端的视觉语言导航,解决了传统方法在理解代理、指令和场景关系上的不足,并在多个数据集上实现了优于现有方法的性能。

Comments Accepted to CVPR 2026. Project page: https://gwxuan.github.io/AwareVLN/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22767 2026-05-22 cs.CV

Synthetic Data Alone is Enough? Rethinking Data Scarcity in Pediatric Rare Disease Recognition

合成数据足够吗?重新思考儿科罕见病识别中的数据稀缺性

Ganlin Feng, Yuxi Long, Erin Lou, Lianghong Chen, Zihao Jing, Pingzhao Hu, Wei Xu

机构 * Western University(西方大学) University of Toronto(多伦多大学)

AI总结 本研究探讨了在儿科罕见病识别中,仅使用合成数据是否足以克服数据稀缺问题,通过实验发现高保真合成数据能模拟临床有意义的分布,从而为遗传咨询提供隐私保护的视觉资源。

Comments CVPR 2026 CV4CHL workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22677 2026-05-22 cs.CV

Slimmable ConvNeXt: Width-Adaptive Inference for Efficient Multi-Device Deployment

Slimmable ConvNeXt: 适用于高效多设备部署的宽度自适应推理

Janek Haberer, Jon Eike Wilhelm, Olaf Landsiedel

机构 * Kiel University(基尔大学) Hamburg University of Technology (TUHH)(汉堡工业大学) UNU-INWEH

AI总结 本文提出Slimmable ConvNeXt,通过训练包含多个嵌套子网络的共享权重集,实现宽度自适应推理,从而在不同资源约束的设备上高效部署模型。该方法利用ConvNeXt的现代设计,如LayerNorm和倒置瓶颈结构,实现了通道宽度压缩,减少了归一化开销,并提供了更简单的训练流程。

Comments Accepted at Mobile AI Workshop 2026 (CVPR'26 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22658 2026-05-22 cs.CV cs.LG cs.MM eess.IV

SegCompass: Exploring Interpretable Alignment with Sparse Autoencoders for Enhanced Reasoning Segmentation

SegCompass: 探索通过稀疏自编码器实现可解释对齐以增强推理分割

Zhenyu Lu, Liupeng Li, Jinpeng Wang, Haoqian Kang, Yan Feng, Ke Chen, Yaowei Wang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Meituan, Beijing(美团,北京) University of Chinese Academy of Sciences(中国科学院大学) College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院)

AI总结 本文提出SegCompass,一种通过稀疏自编码器实现可解释对齐的端到端模型,以提升推理分割的性能和可解释性。

Comments Accepted by CVPR 2026. 15 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22492 2026-05-22 cs.CV

Training-Free Fine-Grained Semantic Segmentations in Low Data Regimes: A FungiTastic Baseline

无需训练的细粒度语义分割在低数据环境下:一个FungiTastic基线

Sebastian Cavada, Francesco Pelosin, Lapo Faggi

机构 * Covision Lab(Covision实验室)

AI总结 本文提出了一种无需训练的两阶段框架,用于在低数据环境下实现细粒度语义分割,通过宏分类提示生成蘑菇掩码,并利用嵌入空间中的原型匹配进行细粒度标签分配,提高了可扩展性和分割成本。

Comments Accepted at the 13th Workshop on Fine-Grained Visual Categorization, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22455 2026-05-22 cs.CV cs.AI cs.LG physics.optics

Making the Discrete Continuous: Synthetic RAW Augmentations for Fine-Grained Evaluation of Person Detection Performance in Low Light

使离散的成为连续的:合成RAW增强用于细粒度评估人检测性能在低光环境

Valeria Pais, Malena Mendilaharzu, Daniele Faccio, Luis Oala, Christoph Clausen, Bruno Sanguinetti

机构 * University of Glasgow(格拉斯哥大学) Dotphoton

AI总结 本文提出了一种合成RAW增强方法,用于在低光条件下更准确地评估人检测模型的性能,通过生成与相机传感器噪声模型匹配的低光样本,以改善基准测试的数据覆盖。

Comments Accepted non-archival paper at the CVPR 2026 AUTOPILOT Workshop (Autonomous Understanding Through Open-world Perception and Integrated Language Models for On-road Tasks)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22269 2026-05-22 cs.CV cs.AI cs.MM

MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering

MuKV:多粒度KV缓存压缩用于长流视频问答

Junbin Xiao, Jiajun Chen, Tianxiang Sun, Xun Yang, Angela Yao

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出MuKV,一种多粒度KV缓存压缩方法,通过半分层检索方法提升长流视频问答的效率和准确性,实验表明其在答案准确率、内存使用和在线问答效率方面均优于基线方法。

Comments To appear at CVPR'26. Code is available at https://github.com/IMBALDY/MuKV

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07603 2026-05-22 cs.CV

UIKA: Fast Universal Head Avatar from Pose-Free Images

UIKA:从无姿态图像快速生成通用头身模型

Zijian Wu, Boyao Zhou, Liangxiao Hu, Hongyu Liu, Yuan Sun, Xuan Wang, Xun Cao, Yujun Shen, Hao Zhu

机构 * Nanjing University(南京大学) Ant Group(蚂蚁集团) HKUST(香港科技大学) Xi’an Jiaotong University(西安交通大学)

AI总结 本文提出UIKA,一种从任意数量的无姿态输入(包括单张图像、多视角捕捉和手机拍摄视频)生成可动画的高斯头身模型。与传统头身模型不同,UIKA通过模型表示、网络设计和数据准备重新思考任务,引入了UV引导的头身建模策略,设计了可学习的UV标记,并通过聚合所有输入视角的UV信息解码为标准高斯属性。

Comments CVPR 2026 Highlight. Code: https://github.com/ant-research/UIKA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20538 2026-05-22 cs.CV

AlignPose: Generalizable 6D Pose Estimation via Multi-view Feature-metric Alignment

AlignPose: 通过多视角特征-度量对齐实现通用的6D位姿估计

Anna Šárová Mikeštíková, Médéric Fourmy, Martin Cífka, Josef Sivic, Vladimir Petrik

机构 * Czech Institute of Informatics, Robotics and Cybernetics(捷克信息学、机器人学与控制学研究院) Czech Technical University in Prague(布拉格捷克技术大学)

AI总结 本文提出AlignPose,一种无需特定对象训练或对称标注的多视角6D位姿估计方法,通过多视角特征-度量细化优化单一一致的世界坐标系位姿,实验表明其在六个数据集上优于其他方法,尤其在工业数据集上表现突出。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20785 2026-05-22 cs.CV

LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling

LongVT: 通过原生工具调用激励'通过长视频思考'

Zuhao Yang, Sudong Wang, Kaichen Zhang, Keming Wu, Sicong Leng, Yifan Zhang, Bo Li, Chengwei Qin, Shijian Lu, Xingxuan Li, Lidong Bing

机构 * MiroMind NTU(国立台湾大学) HKUST(GZ)(香港科技大学(广州)) THU(清华大学) LMMs-Lab(LMMs实验室)

AI总结 本文提出LongVT,一种端到端的代理框架,通过交错的多模态工具链式思考实现'通过长视频思考',通过利用LMM的固有时间定位能力作为原生视频裁剪工具,以解决长视频推理中的幻觉问题,并通过VideoSIAH数据集提升训练和评估效果。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22017 2026-05-22 cs.CV

Diverse Yet Consistent: Context-Guided Diffusion with Energy-Based Joint Refinement for Multi-Agent Motion Prediction

多样且一致:基于能量的联合细化的上下文引导扩散用于多智能体运动预测

Lei Chu, Yuhuan Zhao

机构 * University of Southern California(南加州大学)

AI总结 本文提出了一种基于扩散的框架,通过利用历史轨迹中的丰富上下文信息来改进多智能体运动预测,通过引导机制增强预测动作的多样性和表达性,并引入基于能量的公式来细化联合轨迹分布,同时保持个体轨迹的合理性,实验表明该方法在多个基准数据集上均优于现有方法。

Comments MEIS-- CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21869 2026-05-22 cs.CV cs.AI cs.HC

Two-Stage Multimodal Framework for Emotion Mimicry Intensity Prediction

双阶段多模态框架用于情感模仿强度预测

Dinithi Dissanayake, Shaveen Silva, Ovindu Atukorala, Prasanth Sasikumar, Suranga Nanayakkara

机构 * Augmented Human Lab, National University of Singapore, Singapore(新加坡国立大学增强人类实验室) University of Moratuwa, Sri Lanka(斯里兰卡穆拉图瓦大学)

AI总结 本文提出了一种双阶段多模态框架,用于从真实视频片段中预测六个连续情绪强度维度,通过结合文本、音频和视觉表示,并可选运动分支,提供了一个实用且可复现的基线。

Comments 10th Affective & Behavior Analysis in-the-wild, CVPR Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21625 2026-05-22 cs.CV cs.AI cs.CL

Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly

Flat-Pack Bench: 通过家具组装评估大视觉-语言模型的时空理解

Aditya Chetan, Eric Cai, Peeyush Kushwaha, Bharath Raj Nagoor Kani, Utkarsh Mall, Qianqian Wang, Noah Snavely, Bharath Hariharan

机构 * Cornell University(康奈尔大学) Cornell Tech(康奈尔科技) MBZUAI(麦吉尔-伯克利-浙江大学人工智能研究院) UC Berkeley(伯克利大学)

AI总结 本文提出Flat-Pack Bench基准,用于评估大视觉-语言模型在复杂视频场景中的时空理解能力,发现当前模型在细粒度时空推理上存在显著不足。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01760 2026-05-22 cs.CV

MagicFuse: Single Image Fusion for Visual and Semantic Reinforcement

MagicFuse: 单图像融合用于视觉与语义增强

Hao Zhang, Yanping Zha, Zizhuo Li, Meiqi Gong, Jiayi Ma

机构 * Electronic Information School, Wuhan University, China(武汉大学电子信息学院) Suzhou Institute of Wuhan University, China(武汉大学苏州研究院) School of Automation, Wuhan University, China(武汉大学自动化学院)

AI总结 本文提出MagicFuse单图像融合框架,通过扩散模型生成跨光谱场景表示,实现视觉与语义的双重约束,实验表明其性能优于多模态融合方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21411 2026-05-21 cs.CV

RoadTones: Tone Controllable Text Generation from Road Event Videos

RoadTones: 从道路事件视频生成可调节语气的文本

Chirag Parikh, Siddhi Pravin Lipare, Ravi Kiran Sarvadevabhatla

机构 * CVIT & iHub-Data, IIIT Hyderabad, India(CVIT与iHub-Data,IIIT海得拉巴,印度)

AI总结 本文提出RoadTones-51K数据集和RoadTones-VL-CoT模型,通过生成语气条件的推理草稿提升可解释性,并引入RoadTones-Eval评估体系,共同为上下文敏感的可调节视频描述奠定基础。

Comments Accepted at CVPR Findings 2026. Project page: https://roadtones.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24139 2026-05-21 cs.CV cs.LG

Tutor-Student Reinforcement Learning: A Dynamic Curriculum for Robust Deepfake Detection

tutor-student 强化学习:一种动态课程以实现鲁棒的深度伪造检测

Zhanhe Lei, Zhongyuan Wang, Jikang Cheng, Baojin Huang, Yuhong Yang, Zhen Han, Chao Liang, Dengpan Ye

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Integrated Circuits, Peking University(北京大学集成电路学院) School of Information, Huazhong Agricultural University(华中农业大学信息学院) Cyberspace Institute of Advanced Technology, Guangzhou University(广州大学先进技术网络研究院)

AI总结 本文提出了一种 tutor-student 强化学习框架,通过动态优化训练课程来提高深度伪造检测的鲁棒性和泛化能力。

Comments Accepted to CVPR 2026

Journal ref The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026 (CVPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04520 2026-05-21 cs.CV

THEval. Evaluation Framework for Talking Head Video Generation

THEval:谈话头视频生成的评估框架

Nabyl Quignon, Baptiste Chopin, Yaohui Wang, Antitza Dantcheva

机构 * Inria Centre at Université Côte d’Azur(Inria 雅克-路易·科蒂尔大学中心) Shanghai AI Laboratory(上海人工智能实验室) da/sec - Biometrics and Security Research Group, Hochschule Darmstadt(da/sec 生物识别与安全研究组,达姆斯塔特大学)

AI总结 本文提出了一种新的评估框架,用于评估生成谈话头视频的质量、自然性和同步性,通过8个指标来衡量,并通过大量实验验证了现有方法在生成表情和无瑕疵细节方面的不足。

Comments CVPR 2026 Findings, Project Page: https://newbyl.github.io/theval_project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14737 2026-05-21 cs.CV

Free-Grained Hierarchical Visual Recognition

自由粒度层次视觉识别

Seulki Park, Zilin Wang, Stella X. Yu

机构 * University of Michigan(密歇根大学) UC Berkeley(伯克利大学)

AI总结 本文研究了在现实世界中标签不完整且粒度混合的情况下,如何进行层次视觉识别。通过引入自由粒度训练方法,结合文本监督和半监督学习,改进了传统层次方法在不完整监督下的性能,并提出了自由粒度推理机制以适应不同预测深度的需求。

Comments Accepted to CVPR 2026. 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20904 2026-05-21 cs.CV

JFAA: Technical Report for the EPIC-KITCHENS-100 Action Anticipation Challenge at EgoVis 2026

JFAA:EgoVis 2026 EPIC-KITCHENS-100 动作预见挑战的技术报告

Qiaohui Chu, Haoyu Zhang, Yisen Feng, Meng Liu, Weili Guan, Dongmei Jiang, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) Shandong Jianzhu University(山东建筑大学)

AI总结 本文提出JFAA,一种基于JEPA的未来动作预见方法,用于EPIC-KITCHENS-100动作预见任务。通过冻结编码器和预测器提取观察上下文特征和近未来潜在标记,再训练轻量级注意力探针以预测动词、名词和动作日志。通过构建字段感知的集成模型提高鲁棒性,实验结果表明JFAA在EgoVis 2026 EPIC-KITCHENS-100动作预见挑战中取得第一名。

Comments The champion solution for the EPIC-KITCHENS-100 Action Anticipation Challenge at the CVPR EgoVis Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20901 2026-05-21 cs.CV cs.AI

VISTA: Technical Report for the Ego4D Short-Term Object Interaction Anticipation at EgoVis 2026

VISTA:EgoVis 2026 ego4D 短期物体交互预测挑战的技术报告

Qiaohui Chu, Haoyu Zhang, Yisen Feng, Meng Liu, Weili Guan, Dongmei Jiang, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) Shandong Jianzhu University(山东建筑大学)

AI总结 本文提出VISTA,一种用于EgoVis 2026 ego4D短期物体交互预测挑战的V-JEPA集成静态快速时序预测器。该方法结合了以物体为中心的空间检测与短视时间上下文,通过特征调制和ROI级上下文融合,将时间表示注入检测路径,以提高预测的鲁棒性。

Comments The champion solution for the Ego4D Short-Term Object Interaction Anticipation Challenge at the CVPR EgoVis Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20892 2026-05-21 cs.CV

FruitEnsemble: MLLM-Guided Arbitration for Heterogeneous ensemble in Fine-Grained Fruit Recognition

FruitEnsemble: MLLM-Guided Arbitration for Heterogeneous ensemble in Fine-Grained Fruit Recognition

Enhui Yu, Junhui Li, Ruitong Lu, Jialu Li, Youshan Zhang

机构 * University of Science and Technology Liaoning(辽宁科技大学) Chuzhou University(楚州大学) Yeshiva University(犹他大学)

AI总结 本文提出FruitEnsemble框架,通过多阶段动态推理解决细粒度水果分类中的泛化限制问题,利用MLLM进行专家仲裁以提升分类准确率,最终达到70.49%的分类精度。

Comments 10 pages,6 figures,submitted to CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20818 2026-05-21 cs.CV

OSGNet with MLLM Reranking @ Ego4D Episodic Memory Challenge 2026

OSGNet with MLLM Reranking @ Ego4D Episodic Memory Challenge 2026

Yisen Feng, Leigang Qu, Haoyu Zhang, Qiaohui Chu, Meng Liu, Xuemeng Song, Weili Guan, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) National University of Singapore(新加坡国立大学) Pengcheng Laboratory(鹏城实验室) Shandong Jianzhu University(山东建筑大学) Southern University of Science and Technology(南方科技大学)

AI总结 本文提出一种基于多模态大语言模型(MLLM)的重排序框架,用于解决Ego4D事件记忆挑战2026中的自然语言查询和目标步 tracks,通过结合现有定位模型OSGNet的候选片段和MLLM的视频-语言推理能力,提升时间片段的定位精度。

Comments Champion solution for the Natural Language Queries and GoalStep tracks of the Ego4D Challenge at the CVPR EgoVis Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏