TaskTok: Delving into Task Tokens for Task-driven Image Restoration
TaskTok: 深入探究任务驱动图像恢复中的任务令牌
机构 * Korea University(高丽大学)
AI总结 提出TaskTok框架,通过可学习的令牌开关和轻量级令牌细化模块选择性恢复任务相关令牌,在提升下游任务性能的同时保持高计算效率。
Comments ECCV 2026
期刊&会议
European Conference on Computer Vision · 会议 · Computer Vision
TaskTok: 深入探究任务驱动图像恢复中的任务令牌
机构 * Korea University(高丽大学)
AI总结 提出TaskTok框架,通过可学习的令牌开关和轻量级令牌细化模块选择性恢复任务相关令牌,在提升下游任务性能的同时保持高计算效率。
Comments ECCV 2026
ScaleMoGen:基于人类动作生成的自回归多尺度预测
机构 * Seoul National University(首尔国立大学) ; Snap Inc.(Snap公司) ; Meta Reality Labs(Meta现实实验室)
AI总结 ScaleMoGen提出了一种多尺度自回归框架,通过自回归预测生成动作,实现了更精细的动作生成,同时在HumanML3D和SnapMoGen数据集上取得最佳性能。
Comments Accepted to ECCV 2026. Project page: https://inwoohwang.me/ScaleMoGen
为什么视觉语言模型难以识别人类情绪?
机构 * The University of Edinburgh, UK(爱丁堡大学)
AI总结 本文探讨视觉语言模型在识别人类情绪上的不足,指出面部表情识别任务的连续性和动态性导致模型存在连续性和时间信息处理的漏洞,提出改进采样策略和多阶段上下文增强方法以提升情绪识别能力。
Comments European Conference on Computer Vision (ECCV) 2026
阅读还是忽略?视觉语言模型中排版攻击鲁棒性和文本识别的统一基准
机构 * Turing Inc.(Turing公司) ; The University of Tokyo(东京大学) ; Institute of Science Tokyo(东京科学研究院) ; Tohoku University(东北大学)
AI总结 研究大型视觉语言模型排版攻击鲁棒性和文本识别问题,引入RIO-VQA任务及RIO-Bench基准,发现目标中心防御的权衡,提出数据驱动防御基线,提升模型在两方面的性能,凸显现有鲁棒性范围与现实需求的错位。
Comments Accepted at ECCV 2026. The project page is available at: https://turingmotors.github.io/rio-vqa/