arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 4781
2606.27372 2026-06-26 cs.CV 新提交

DnA: Denoising Attention for Visual Tasks

DnA:用于视觉任务的去噪注意力

Ron Campos, Subhajit Maity, Xin Li, Srijan Das, Aritra Dutta

机构 * University of Central Florida(中佛罗里达大学) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

AI总结 提出去噪注意力(DnA),通过正负查询分离相关与无关特征,提升多头部注意力的判别性,在ImageNet-1K上提升0.8%,并适用于视频理解任务。

Journal ref European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27371 2026-06-26 cs.CV 新提交

Don't Settle at the Mode! Mitigating Diversity Collapse in Pretrained Flow Models via Feature Self-Guidance

不要停留在众数!通过特征自引导缓解预训练流模型中的多样性坍塌

Pradhaan S Bhat, Rishubh Parihar, Abhijnya Bhat, R. Venkatesh Babu

机构 * Indian Institute of Science(印度科学研究所) Stanford University(斯坦福大学)

AI总结 提出一种无需训练的自引导机制,通过分散批次生成中的内部特征并施加流形正则化,在几乎不增加推理成本的前提下缓解预训练流模型的多样性坍塌问题。

Comments Accepted by ECCV 2026. Project page: https://dont-settle-at-the-mode.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27339 2026-06-26 cs.CV 新提交

SAM2Matting: Generalized Image and Video Matting

SAM2Matting:通用图像与视频抠图

Ruiqi Shen, Guangquan Jie, Chang Liu, Henghui Ding

机构 * Fudan University(复旦大学) Shanghai University of Finance and Economics(上海财经大学)

AI总结 提出SAM2Matting框架,将VOS追踪器增强为高保真视频抠图,通过区域提议桥接和专用抠图头解耦任务,仅用图像训练即实现视频抠图新SOTA,支持多种提示类型并保持强时间一致性。

Comments ECCV 2026. Extended version. Project Page: https://henghuiding.com/SAM2Matting/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27307 2026-06-26 cs.CV 新提交

See & Sniff: Learning Visuo-Olfactory Representations

See & Sniff: 学习视觉-嗅觉表征

Seongyu Kim, Seungwoo Lee, Hyeonggon Ryu, Joon Son Chung, Arda Senocak

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Hankuk University of Foreign Studies(韩国外国语大学) Ulsan National Institute of Science and Technology(蔚山科学技术院)

AI总结 提出SmellNet-V数据集和See & Sniff自监督框架,通过密集局部对齐学习联合视觉-嗅觉表征,实现气味分类、跨模态检索和气味定位,性能提升7%。

Comments ECCV 2026. Project Page: https://mm.kaist.ac.kr/projects/SeeandSniff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27268 2026-06-26 cs.RO cs.AI 新提交

E-TTS: A New Embodied Test-Time Scaling Framework for Robotic Manipulation

E-TTS:一种新的机器人操作具身测试时缩放框架

Wen Ye, Peiyan Li, Tingyu Yuan, Yuan Xu, Xiangnan Wu, Chaoyang Zhao, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) FiveAges(五时代)

AI总结 提出E-TTS框架,通过历史感知迭代精炼和视觉语言验证器统一推理与动作缩放,解决具身任务中推理缩放和历史信息利用不足的问题,在仿真和真实场景中分别提升33.14%和26.62%的性能。

Comments Accepted to ECCV 2026. 44 pages, 11 figures. Project page: https://27yw.github.io/E-TTS-Web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26973 2026-06-26 cs.CV cs.LG 新提交

Geometric Gradient Rectification for Safe Open-Set Semi-Supervised Learning

几何梯度修正用于安全开放集半监督学习

Jiahe Chen, Qian Shao, Qiyuan Chen, Jiaying He, Jintai Chen, Jian Wu, Hongxia Xu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Liangzhu Laboratory and WeDoctor Cloud(良渚实验室和微医云) Shanghai Innovation Institute(上海创新研究院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) State Key Laboratory of Transvascular Implantation Devices and TIDRI(经血管植入器械全国重点实验室和TIDRI) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江省医学影像人工智能重点实验室)

AI总结 提出几何梯度修正(GGR)框架,通过将辅助梯度投影到监督梯度的允许区域,解决开放集半监督学习中样本筛选与利用的权衡问题,提升闭集泛化与开放集鲁棒性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26938 2026-06-26 cs.CV 新提交

Focusing on What Matters: Saliency-Harnessing Accurate Routing for Diffusion MoE

关注重要之处:面向扩散MoE的显著性引导精确路由

Haoyou Deng, Keyu Yan, Chaojie Mao, Xiang Wang, Yu Liu, Changxin Gao, Nong Sang

机构 * Key Laboratory of Image Processing and Intelligent Control, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院图像处理与智能控制重点实验室) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)

AI总结 针对扩散MoE中路由无法准确分配计算资源给显著令牌的问题,提出SharpMoE后训练框架,利用干净潜在特征作为无噪声引导信号,并引入轨迹路由损失,实现精确资源分配,在视觉生成中达到最优性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26916 2026-06-26 cs.CV 新提交

PhysRAG: Enhancing Physics-Awareness in Video Generation via Retrieval-Augmented Generation

PhysRAG: 通过检索增强生成提升视频生成中的物理感知

Kexu Cheng, Zicheng Liu, Mingju Gao, Chunhe Song, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Institute of AI for Industries, Chinese Academy of Sciences(中国科学院人工智能产业研究院)

AI总结 提出PhysRAG管道,利用检索增强生成(RAG)和可学习查询注入物理知识,在7K高质量视频上训练,在PhyGenBench和VBench上达到最优视觉质量和物理规则遵从性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26812 2026-06-26 cs.CV 新提交

Multi-modality Image Fusion under Adverse Weather: Mask-Guided Feature Restoration and Interaction

恶劣天气下的多模态图像融合:掩码引导的特征恢复与交互

Xilai Li, Xiaosong Li, Haishu Tan, Tao Ye, Huafeng Li, Hongbin Wang

机构 * Foshan University(佛山大学) China University of Mining and Technology, Beijing(中国矿业大学(北京)) Kunming University of Science and Technology(昆明理工大学)

AI总结 提出一种掩码引导的多模态图像融合方法,通过伪真实标签和掩码生成机制同时实现特征恢复与跨模态交互,在合成和真实数据集上超越现有方法。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26769 2026-06-26 cs.AI cs.CV 新提交

ResilPhase: Plug-and-Play Phase Mapping and Noise-Resilient Macro-Trajectory Extrapolation for Diffusion Acceleration

ResilPhase: 即插即用的相位映射与抗噪宏轨迹外推用于扩散加速

Qicheng Zhao, Yu Li, Qi Sun, Zheyu Yan

机构 * Zhejiang University(浙江大学)

AI总结 针对扩散模型推理延迟高的问题,提出ResilPhase框架,通过将加速推理重构为ODE空间中的稳定宏轨迹外推,并引入无导数重心拉格朗日外推器和有界相位映射,实现高加速比下的抗噪加速。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26754 2026-06-26 cs.CV 新提交

Capacity-Controlled Multi-View Stylization of 3D Gaussian Splatting

容量控制的多视图3D高斯泼溅风格化

Zhihao Wen, Yixin Yang, Bojian Wu, Yang Zhou, Dani Lischinski, Daniel Cohen-Or, Hui Huang

机构 * Guangdong Provincial Key Laboratory of Visual Media and Multidimensional Intelligence, CSSE, Shenzhen University(广东省可视媒体与多维智能重点实验室,计算机科学与软件工程学院,深圳大学) Tencent Games(腾讯游戏) The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Tel Aviv University(特拉维夫大学)

AI总结 提出基于最优传输的容量控制框架,通过半平衡最优传输和列容量约束解决多视图风格分配不稳定问题,实现跨视图一致的3D风格化。

Comments Accepted to ECCV 2026. Project page: https://vcc2310.github.io/SceneStyler/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26734 2026-06-26 cs.CV cs.AI 新提交

Robust Onion: Peeling Open Vocab Object Detectors Under Noise

鲁棒洋葱:在噪声下剖析开放词汇目标检测器

Priyank Pathak, Mukilan Karuppasamy, Aaditya Baranwal, Shruti Vyas, Yogesh S Rawat

机构 * UCF Institute of Artificial Intelligence, University of Central Florida (UCF)(中佛罗里达大学人工智能研究所)

AI总结 通过受控合成视觉退化逐层分析开放词汇目标检测器,发现视觉骨干相似时鲁棒性主要由图像域决定,并提出轻量级方法提升真实场景鲁棒性。

Comments Accepted at The 19th European Conference on Computer Vision (ECCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26609 2026-06-26 cs.CV 新提交

LogicIR: Logic Gate Networks for Image Restoration

LogicIR: 用于图像恢复的逻辑门网络

Hongjae Lee, Myungjun Son, Jaeseong Yu, Seung-Won Jung

机构 * Korea University(高丽大学)

AI总结 提出首个基于逻辑门网络的图像恢复模型LogicIR,采用UNet架构和可微位解码层及索引洗牌机制,在多个基准上以低计算成本实现强性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26602 2026-06-26 cs.CV 新提交

DiCoBench: Benchmarking Multi-Image Fine-Grained Perception via Differential and Commonality Visual Cues

DiCoBench: 通过差异性和共性视觉线索进行多图像细粒度感知的基准测试

Geng Li, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)

AI总结 提出DiCoBench,一个包含765个样本的高分辨率多图像基准,通过差异性和共性视觉线索评估多模态大模型的细粒度感知能力,发现顶尖模型与人类准确率(98.3%)差距显著。

Comments Accepted by ECCV 2026. Project page with code: https://github.com/PKU-ICST-MIPL/DICO_Bench_ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26535 2026-06-26 cs.CV cs.AI 新提交

From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP

从幻觉到扎根:通过CRISP诊断视觉空间智能

Zhixing Li, Yinan Yu

机构 * Chalmers University of Technology(查尔姆斯理工大学)

AI总结 提出CRISP诊断范式,通过一致性评估解耦感知与推理,揭示闭源模型存在度量估计不准确和未利用隐式结构表示的问题,开源模型则受限于多跳组合推理能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26424 2026-06-26 cs.LG cs.CV cs.RO 新提交

Rethinking Training & Inference for Forecasting: Linking Winner-Take-All back to GMMs

重新思考预测中的训练与推理:将赢家通吃带回高斯混合模型

Qiyuan Wu, Katie Z Luo, Bharath Hariharan, Wei-Lun Chao, Mark Campbell

机构 * Cornell University(康奈尔大学) Stanford University(斯坦福大学) Boston University(波士顿大学)

AI总结 针对轨迹预测中赢家通吃训练导致模式后验不可靠的问题,提出测试时后验加权合并和一步EM更新两种轻量级后处理方法,无需重训练即可提升模式排序和预测精度。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26387 2026-06-26 cs.CV cs.CL cs.LG 新提交

Staying VIGILant: Mitigating Visual Laziness via Counterfactual Visual Alignment in MLLMs

保持VIGILant:通过多模态大语言模型中的反事实视觉对齐缓解视觉懒惰

Xi Xiao, Chen Liu, Chih-Ting Liao, Yunbei Zhang, Qizhen Lan, Yuxiang Wei, Lin Zhao, Janet Wang, Jianyang Gu, Muchao Ye, Tianyang Wang, Hao Xu

机构 * UAB(阿拉巴马大学伯明翰分校) Yale(耶鲁大学) UNSW(新南威尔士大学) Tulane(杜兰大学) Georgia Tech(佐治亚理工学院) NEU(东北大学) OSU(俄亥俄州立大学) UIowa(爱荷华大学) Harvard(哈佛大学)

AI总结 提出VIGIL框架,通过强化学习后训练最大化视觉输入与生成响应间的互信息,惩罚“盲目自信”实例,有效缓解MLLMs的视觉懒惰问题,在幻觉和推理基准上优于现有方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26379 2026-06-26 cs.CV 新提交

Layer-Specific Prompt Fusion Discovery via Differentiable Search in Vision Foundation Models

基于可微搜索的视觉基础模型层特定提示融合发现

Xi Xiao, Xingjian Li, Yunbei Zhang, Cheng Han, Tianming Liu, Tianyang Wang, Runmin Jiang, Jihun Hamm, Xiao Wang, Min Xu

机构 * UAB(阿拉巴马大学伯明翰分校) CMU(卡内基梅隆大学) Tulane(杜兰大学) UMKC(密苏里大学堪萨斯分校) UGA(佐治亚大学) ORNL(橡树岭国家实验室)

AI总结 研究视觉提示微调中提示与图像令牌的融合方案,提出可微架构搜索方法联合优化可学习提示及其融合方式,在34个数据集上取得一致提升。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25347 2026-06-26 cs.LG cs.CV 新提交

Geometry-Anchored Transport Framework for Exemplar-Free Class-Incremental Learning

几何锚定传输框架用于无样本类增量学习

Hongye Xu, Bartosz Krawczyk

机构 * Chester F. Carlson Center for Imaging Science, Rochester Institute of Technology(罗切斯特理工学院切斯特·F·卡尔森成像科学中心)

AI总结 提出几何锚定传输框架,通过分析几何锚定和拓扑感知演化约束,在训练阶段内嵌特征传输,解决无样本类增量学习中的各向异性漂移问题。

Comments Accepted to ECCV 2026. 17 pages, 4 figures, 3 tables. Code: https://github.com/HXuSz11/GATF_ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25065 2026-06-26 cs.GR 新提交

Self-supervised Garment Dynamics with Persistent Wrinkles

具有持久褶皱的自监督服装动力学

Xiaoyuan Yang, Deshan Gong, Taku Komura, He Wang

AI总结 提出首个显式建模持久褶皱的自监督神经服装模拟器,通过物理启发的损失函数和课程学习实现弹塑性材料模拟,生成自然褶皱。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24649 2026-06-26 cs.CV 新提交

Agentic Collaborative Cognition for Zero-Shot 3D Understanding

零样本3D理解的智能体协作认知

Wenxin Wang, Bo Zhang, Feng Chen, Zixuan Wang, Wen Li, Changsheng Li, Yinjie Lei

机构 * Sichuan University(四川大学) Adelaide University(阿德莱德大学) University of Electronic Science and Technology of China(电子科技大学) Beijing Institute of Technology(北京理工大学)

AI总结 提出协作多智能体框架,通过规划智能体补充视角和感知智能体构建结构化认知地图,实现零样本3D理解,在6个基准上达到最优性能。

Comments Accepted by ECCV 2026. Project page: https://zhangbo135.github.io/agentic-collaborative-cognition/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22540 2026-06-26 cs.CV 新提交

PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models

PolicyTrim: 提升视觉-语言-动作模型的内在策略效率

Xianghui Wang, Feng Chen, Wenbo Zhang, Hua Yan, Zixuan Wang, Changsheng Li, Yinjie Lei

机构 * Sichuan University(四川大学) Adelaide University(阿德莱德大学) Beijing Institute of Technology(北京理工大学)

AI总结 提出PolicyTrim框架,通过强化学习后训练扩展动作块可靠长度并减少冗余物理步骤,实现高达5.83倍的端到端部署加速且不降低任务成功率。

Comments Accepted by ECCV 2026. Project page: https://inceptionwang.github.io/PolicyTrim/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22537 2026-06-26 cs.CV 新提交

NegAS: Negative Label Guided Attention and Scoring for Out-of-Distribution Object Detection with Vision-Language Models

NegAS: 基于负标签引导的注意力与评分用于视觉语言模型的分布外目标检测

Yingjie Zhang, Shuai Li, Peng Wang

机构 * Northwestern Polytechnical University(西北工业大学)

AI总结 提出NegAS框架,利用负标签引导注意力(NegA)和基于sigmoid的OOD评分函数(NegS),解决VLM检测器中OOD区域利用不足和评分不兼容问题,显著提升OOD检测性能。

Comments Accept to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19193 2026-06-26 cs.CV

How Far Are Video Models from True Multimodal Reasoning?

视频模型距离真正的多模态推理还有多远?

Xiaotian Zhang, Jianhui Wei, Yuan Wang, Jie Tan, Yichen Li, Yan Zhang, Ziyi Chen, Daoan Zhang, Dezhi YU, Wei Xu, Songtao Jiang, Zuozhu Liu

机构 * Zhejiang University(浙江大学) ByteDance(字节跳动)

AI总结 本文提出CLVG-Bench评估框架,通过上下文学习测试视频模型的零样本推理能力,揭示当前SOTA模型在逻辑推理和交互生成任务中表现不足,指出多模态推理和物理基础是关键瓶颈。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11755 2026-06-26 cs.CV 版本更新

Controllable Egocentric Video Generation via Occlusion-Aware Sparse 3D Hand Joints

可控的第一人称视角视频生成:基于遮挡感知的稀疏3D手部关节点

Chenyangguang Zhang, Botao Ye, Boqi Chen, Alexandros Delitzas, Fangjinhua Wang, Marc Pollefeys, Xi Wang

机构 * ETH Zurich(苏黎世联邦理工学院) MPI for Informatics(信息研究所) Microsoft(微软)

AI总结 提出利用稀疏3D手部关节点作为显式控制信号,通过遮挡感知特征提取和3D加权机制,实现高保真、3D一致的第一人称手物交互视频生成。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01958 2026-06-26 cs.CV 版本更新

MAVFusion: Efficient Infrared and Visible Video Fusion via Motion-Aware Sparse Interaction

MAVFusion: 基于运动感知稀疏交互的高效红外与可见光视频融合

Xilai Li, Weijun Jiang, Xiaosong Li, Yang Liu, Hongbin Wang, Tao Ye, Huafeng Li, Haishu Tan

机构 * Foshan University(佛山大学) Kunming University of Science and Technology(昆明理工大学) China University of Mining and Technology(中国矿业大学)

AI总结 提出MAVFusion端到端视频融合框架,通过运动感知稀疏交互机制,利用光流识别动态区域并分配跨模态注意力,对静态区域使用轻量弱交互模块,在保持时间一致性和细节的同时加速推理,达到14.16 FPS。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10446 2026-06-26 cs.CV 版本更新

SignSparK: Efficient Multilingual Sign Language Production via Sparse Keyframe Learning

SignSparK: 通过稀疏关键帧学习实现高效多语言手语生成

Jianhe Low, Alexandre Symeonidis-Herzig, Maksym Ivashechkin, Ozge Mercanoglu Sincan, Richard Bowden

机构 * CVSSP, University of Surrey, United Kingdom(CVSSP,萨里大学,英国)

AI总结 提出SignSparK框架,利用稀疏关键帧和条件流匹配生成流畅3D手语序列,缓解回归到均值问题,支持多语言和关键帧到姿态编辑,实现最先进性能。

Comments Accepted at European Conference on Computer Vision (ECCV) 2026. Project page available: https://cogvis-cvssp.github.io/papers/signspark/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18254 2026-06-26 cs.CV 版本更新

UniFlow: Zero-Shot LiDAR Scene Flow for Autonomous Vehicles

UniFlow: 自动驾驶车辆的零样本激光雷达场景流

Siyi Li, Qingwen Zhang, Ishan Khatri, Kyle Vedder, Eric Eaton, Deva Ramanan, Neehar Peri

AI总结 提出UniFlow,一种跨多数据集训练的激光雷达场景流前馈模型,无需架构修改即可泛化到未见传感器,在Waymo和nuScenes上分别提升5.1%和35.2%,并在TruckScenes和AEVAScenes上超越先前数据集专用模型30.1%和22.5%。

Comments This work has been accepted to the European Conference on Computer Vision (ECCV) 2026. Project Page: https://lisiyi777.github.io/UniFlow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00813 2026-06-26 cs.CV 版本更新

Generating a Paracosm for Training-Free Zero-Shot Composed Image Retrieval

生成一个Paracosm用于免训练零样本组合图像检索

Tong Wang, Yunhan Zhao, Shu Kong

机构 * University of Macau(澳门大学) UC Irvine(伊丽莎白女王大学) Institute of Collaborative Innovation(协同创新研究院)

AI总结 提出Paracosm方法,通过大多模态模型直接生成“心理图像”并构建合成域,实现免训练的零样本组合图像检索,在多个基准上达到最优性能。

Comments Accepted to ECCV 2026. Website and code: https://leowangtong.github.io/Paracosm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01195 2026-06-26 cs.CV cs.AI 版本更新

VisNec: Measuring and Leveraging Visual Necessity for Multimodal Instruction Tuning

VisNec: 衡量和利用视觉必要性进行多模态指令微调

Mingkang Dong, Hongyi Cai, Jie Li, Sifan Zhou, Bin Ren, Kunyu Peng, Yuqian Fu

机构 * SJTU(上海交通大学) Universiti Malaya(马来亚大学) CMU(卡内基梅隆大学) MBZUAI(穆萨台普大学人工智能研究所) KIT(卡尔斯鲁厄理工学院) KAUST(王国立阿联酋科学技术大学)

AI总结 提出VisNec分数衡量视觉输入在多模态指令微调中的边际贡献,结合语义聚类选择高必要性样本,在15%数据上达到全数据性能的100.2%。

Comments Accepted at ECCV 2026. Project Page: https://dmk041218.github.io/VisNec/

详情

展开后加载摘要…

URL PDF HTML 收藏