A Classifier-Agnostic Zero-Shot Adversarial Attack Detection via CLIP
通过CLIP实现分类器无关的零样本对抗攻击检测
机构 * Technion - Israel Institute of Technology(以色列理工学院)
AI总结 提出A4D框架,利用CLIP的提示相似度分数,在完全黑盒零样本设置下检测对抗攻击,无需攻击或分类器先验知识。
Comments Accepted to ECCV 2026
期刊&会议
European Conference on Computer Vision · 会议 · Computer Vision
通过CLIP实现分类器无关的零样本对抗攻击检测
机构 * Technion - Israel Institute of Technology(以色列理工学院)
AI总结 提出A4D框架,利用CLIP的提示相似度分数,在完全黑盒零样本设置下检测对抗攻击,无需攻击或分类器先验知识。
Comments Accepted to ECCV 2026
FaceMoE:用于低分辨率人脸识别的专家混合模型
机构 * Johns Hopkins University(约翰霍普金斯大学)
AI总结 针对低分辨率人脸识别中特征提取困难和域差距问题,提出FaceMoE,采用专家混合Transformer架构,通过多个FFN专家和top-k路由器实现分辨率感知特征提取,在十一个数据集上超越现有方法。
Comments ECCV 2026, Project Page: https://kartik-3004.github.io/FaceMoE/
跨空间蒸馏:用现代扩散教师训练一步学生模型
机构 * Qualcomm AI Research(高通AI研究院) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Johns Hopkins University(约翰霍普金斯大学) ; Rutgers University(罗格斯大学)
AI总结 提出跨空间蒸馏框架,通过轻量级潜在接口Bridge解决教师与学生模型潜在空间不匹配问题,实现异构教师蒸馏到紧凑学生模型,显著提升性能。
Comments ECCV 2026
LUNA: 超越蒙皮的学习通用3D人体动画
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Codec Avatars Lab, Meta(Meta编解码虚拟形象实验室)
AI总结 提出无LBS的通用神经动画模型LUNA,通过Transformer运动回归器将多种2D控制映射为3D高斯变形,结合混合监督实现零样本跨身份泛化。
Comments ECCV 2026, Project page: https://penghtyx.github.io/LUNA/
无处可藏:基于背景控制对的视频幻觉基准测试
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Knowin AI(考恩人工智能) ; The Hong Kong Polytechnic University(香港理工大学) ; National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学) ; Huazhong University of Science and Technology(华中科技大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 提出VidPair-Halluc基准,通过背景相似但前景语义不同的视频对,精确评估大型视频模型中的视频幻觉,包含1K对抗视频对和11K时空问答对。
Comments ECCV 2026
RESOLVE:用于路边协同感知的多分辨率多模态数据集
机构 * The Polytechnic School, Arizona State University(亚利桑那州立大学理工学院) ; Department of Computer Science and Engineering, New York University(纽约大学计算机科学与工程系)
AI总结 提出RESOLVE数据集,包含多分辨率LiDAR和相机-LiDAR同步数据,用于评估路边3D检测与跟踪中的单模态与融合架构,揭示多模态融合如何补偿LiDAR点稀疏性。
Comments Accepted to ECCV 2026. Including supplementary material
实时无源目标检测
机构 * IIT Hyderabad(印度理工学院海得拉巴分校) ; Microsoft Research(微软研究院) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
AI总结 提出一种基于YOLOv10的实时无源目标检测方法,通过双头伪标签融合(DHF)和多尺度自适应表示多样化(MARD)损失,在保持实时性和轻量化的同时,显著提升域适应精度。
Comments Accepted to ECCV 2026
PriorEye: 用于端到端自动驾驶的地理空间视觉先验
AI总结 提出地理空间视觉先验和双记忆架构,增强端到端自动驾驶的预见性和鲁棒性,在NAVSIM-v2上持续提升性能。
Comments Accepted to ECCV 2026
基于几何先验的自回归模型生成车道拓扑推理
机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)
AI总结 提出TopoGPT生成式框架,通过自回归序列建模学习车道图结构的几何先验,解决现有方法端点不一致和遮挡导致图不完整的问题,在OpenLane-V2上提升6.4/11.6个点。
Comments ECCV 2026
MuSViT: 一种用于乐谱表示的基础视觉模型
机构 * Pattern Recognition and Artificial Intelligence Group, University of Alicante, Spain(西班牙阿利坎特大学模式识别与人工智能组)
AI总结 提出MuSViT,首个基于ViT的乐谱基础视觉模型,通过掩码自编码器预训练于970万页IMSLP数据,采用两阶段课程学习,在下游任务中优于通用视觉编码器,并直接编码符号音乐结构。
Comments Accepted at European Conference on Computer Vision (ECCV'26)
NURBS Splatting:统一的可微分矢量图形渲染框架
机构 * Hunan University(湖南大学)
AI总结 提出NURBS Splatting框架,将平面有理曲线表示为连续高斯场,通过沿曲线参数域和封闭区域内部采样高斯函数,将渲染重构成具有稳定梯度的平滑累积过程,支持长样条、有理权重、非均匀节点和封闭区域填充,在书法重建、矢量化框架和长样条图像抽象中表现更优。
Comments Accepted to ECCV 2026
MemLearner: 学习查询上下文记忆用于视频世界模型
机构 * The University of Hong Kong(香港大学) ; Fudan University(复旦大学) ; Zhejiang University(浙江大学) ; Kuaishou Technology(快手科技)
AI总结 提出基于学习的自适应上下文查询方法MemLearner,利用视频生成模型自身进行上下文记忆查询,解决视频世界模型在遮挡和动态场景下的场景一致性问题。
Comments ECCV 2026, Project Page: https://yujiwen.github.io/memlearner/
内在稳定的脉冲神经网络:克服无批归一化下的性能障碍
机构 * University of Electronic Science and Technology of China (UESTC)(电子科技大学) ; Beijing Institute of Remote-Sensing Equipment(北京遥感设备研究所) ; Shenzhen Institute for Advanced Study, UESTC(电子科技大学深圳高等研究院)
AI总结 针对无批归一化SNN性能严重下降的问题,提出内在稳定SNN(IS-SNN)架构,通过拓扑感知权重标准化和修改残差连接消除激活归一化层,实现与动态BN相当甚至更优的性能,并大幅降低硬件资源消耗。
Comments ECCV 2026 Accepted
直方图约束的图像生成
机构 * Center for Data Science, New York University Shanghai(上海纽约大学数据科学中心) ; New York University(纽约大学)
AI总结 提出直方图约束图像生成(HIG)框架,通过最优传输理论在扩散模型中精确施加用户指定的分布约束,实现全局与局部之间的中间粒度控制,并展示其在颜色/潜在直方图约束生成和高容量信息嵌入中的应用。
Comments Accepted to ECCV 2026; 31 pages, 16 figures
ShellMaker: 结构约束下的语言引导外部补全
机构 * Purdue University(普渡大学)
AI总结 提出ShellMaker框架,在保持建筑足迹、墙体几何和开口语义固定约束下,通过参数化屋顶生成、LLM部件提示优化、联合材质检索和几何感知组装,实现语言引导的建筑外部补全。
Comments Accepted to ECCV 2026
用于生物特征验证的稀疏诱导散度损失
机构 * Athens University of Economics and Business(雅典经济与商业大学) ; Archimedes/Athena Research Center(阿基米德/雅典娜研究中心) ; Brno University of Technology(布尔诺理工大学) ; Omilia ; National and Kapodistrian University of Athens(雅典大学)
AI总结 提出Q-Margin损失,通过将边际惩罚编码到参考测度中,在α-散度框架下实现稀疏性与判别性嵌入,在人脸和说话人验证中优于ArcFace和CosFace。
Comments Accepted at ECCV 2026
边建图边思考:用于增量式3D场景图的异步视觉-语言智能体
机构 * University of Stuttgart(斯图加特大学) ; Graz University of Technology(格拉茨技术大学) ; IMPRS-IS(国际马克斯·普朗克智能系统研究学院)
AI总结 提出异步架构,轻量在线建图与重型语义精化并发运行,通过语义闭环、属性标注和空间关系推导,实现探索时可查询且语义渐增的3D场景图,在多个基准上超越现有方法。
Comments Accepted to ECCV 2026. Project page: https://denizbickici.github.io/thinkgraphs/
UniTac: 一种用于跨传感器触觉理解与生成的统一多模态模型
机构 * Zhejiang University(浙江大学) ; Yale University(耶鲁大学) ; University of Oxford(牛津大学) ; MIT(麻省理工学院) ; Shanghai Jiaotong University(上海交通大学) ; UNIX AI
AI总结 提出UniTac,首个统一多模态模型,通过双级表示编码传感器和物体属性,实现触觉理解与生成,在跨传感器任务上达到最优性能。
Comments This paper has been accepted by ECCV 2026
一视频一世界:将单目视频转化为物理4D场景
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; SparcAI Inc(SparcAI公司) ; University of Science and Technology of China(中国科学技术大学) ; The Hong Kong Polytechnic University(香港理工大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Nanyang Technological University(南洋理工大学) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)
AI总结 提出OVOW,首个无需训练的系统,从单目视频重建实例级、可仿真的4D网格场景,通过视觉语言模型发现实例、类别感知重建、迭代优化恢复尺度与位姿、物理装配确保接触支撑,并建立结构化视频到4D评估基准。
Comments Accepted by ECCV 2026. Project Page: https://OneVideoOneWorld.github.io/
重新审视视觉-语言-动作模型中的参数冗余:从VLM到VLA适配的见解
机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) ; University of Chinese Academy of Sciences(中国科学院大学) ; School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) ; School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)
AI总结 通过分析VLM到VLA适配中参数差异的空间分布,设计多模块联合剪枝方案,在无需微调恢复的情况下减少12%-30%参数并保持约90%性能。
Comments 22 pages, 3 figures, ECCV 2026 Conference
基于扩散模型的加速似然最大化用于多样化内容生成
机构 * Seoul National University(首尔国立大学)
AI总结 提出加速似然最大化(ALM)方法,通过直接优化未观测区域并引入加速策略,实现高效、全局一致的内容生成,在多种任务中超越现有方法。
Comments ECCV 2026. Project website: http://hleephilip.github.io/ALM
一次性编辑所有内容
机构 * University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学) ; ETH Zurich(苏黎世联邦理工学院) ; Google(谷歌)
AI总结 提出MICE方法,通过修改联合注意力机制中的加性偏置来调控多实例编辑中的交互,实现无需训练的多实例图像编辑,在保持全局一致性的同时增强属性绑定。
Comments Accepted at ECCV 2026
从失败中学习:计算机使用代理的推理时自我改进
机构 * Stanford University(斯坦福大学) ; Tsinghua University(清华大学)
AI总结 提出失败驱动的自我改进循环,利用LLM诊断失败模式并生成代码补丁,在OSWorld基准上将OpenCUA-72B模型成功率从42.3%提升至48.9%,无需额外训练成本。
Comments Published in ECCV 2026
UHD-MFF:通过可学习查找表打破多焦点超高清图像融合的障碍
机构 * Electronic Information School, Wuhan University(武汉大学电子信息学院) ; School of Robotics, Wuhan University(武汉大学机器人学院) ; School of Automation, Southeast University(东南大学自动化学院)
AI总结 针对超高清多焦点图像融合中的数据、模型和部署三大障碍,提出首个大规模超高清数据集UHD-MFF和基于可学习查找表的UMF-LUT框架,实现实时4K融合。
Comments Accepted by ECCV 2026
CooperScene: 具有C-V2X通信特性的多模态协作自主基准
机构 * University of California, Riverside(加州大学河滨分校)
AI总结 提出CooperScene数据集,通过真实C-V2X通信特性、多模态传感器和3GPP标准,建立多车协作感知基准,包含59K帧、344K标注对象。
Comments Accepted to ECCV 2026. 15 pages, 15 figures
基于结构化自回归建模的长期交通仿真
机构 * The University of Hong Kong(香港大学)
AI总结 提出RosettaSim框架,利用大规模序列模型的归纳偏置和统计先验,通过结构化自回归流建模场景拓扑、智能体状态和生成意图,实现短期准确与长期稳定仿真;并引入基于检索的交通评估(RTE)解决长期评估难题。
Comments ECCV 2026 Accepted
AC3S: 面向3D感知合成数据生成的自适应条件控制
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Johns Hopkins University(约翰霍普金斯大学) ; College of Engineering and Computer Science, VinUniversity(VinUniversity工程与计算机科学学院)
AI总结 提出AC3S框架,通过自适应条件控制模块调节ControlNet强度,结合多智能体视觉语言模型生成3D感知提示,实现高质量、结构对齐的合成图像生成。
Comments Accepted by ECCV 2026. Project page: https://ac3s.cvmlgroup.web.illinois.edu/
ExPLoRe: 面向多目标掩码图像建模的专家级补丁损失路由
机构 * Min H. Kao Department of Electrical Engineering and Computer Science, The University of Tennessee, Knoxville(田纳西大学诺克斯维尔分校电气工程与计算机科学系高民浩系)
AI总结 提出ExPLoRe方法,利用软混合专家(MoE)的调度权重作为逐补丁损失系数,通过损失耦合实现内容相关的目标加权,在ImageNet-1K上提升线性探测和微调精度,并开发适应策略改善下游迁移。
Comments Accepted to ECCV 2026. Main paper 15 pages, 3 figures; supplementary material included as appendix
学习拒绝:多模态大语言模型中的动作否定
机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)
AI总结 提出UCF101-AD基准测试,评估多模态大语言模型在强上下文线索下识别动作缺失的能力,发现模型倾向于肯定动作而非验证其真实性,并通过因果图CausalAct减少误报。
Comments Accepted to ECCV 2026 main conference
HSDF-Lane: 高度对齐符号距离场与语义车道先验用于3D车道检测
机构 * KAIST(韩国科学技术院)
AI总结 提出HSDF-Lane,通过高度对齐符号距离场隐式建模道路表面,结合可微渲染生成准确高度图和表面对齐特征,并引入车道感知语义位置编码注入车道先验,在OpenLane基准上实现3D车道检测和高度图估计的最优性能。
Comments ECCV 2026, Project page: https://jiyongboo.github.io/HSDF-Lane-project-page