arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

2026-07-28 至 2026-07-28 共收录 7
2607.15845 2026-07-28 cs.AI 版本更新

Knowledge-Centric Agents for Workflow Generation in ComfyUI

用于工作流生成的以知识为中心的智能体

Zhendong Li, Lei Sun, Ruibo Ming, He Zhang, Danda Pani Paudel, Luc Van Gool, Jinjin Gu

机构 * INSAIT(未知机构) Sofia University “St. Kliment Ohridski”(索非亚大学“圣克莱门特·奥赫里德斯基”分校) Adobe Research(Adobe研究院)

AI总结 研究视觉创作系统中工作流生成问题,提出以知识为中心的框架,通过知识反转、注入和可逆推理进行工作流生成,实验证明该方法生成的工作流在多样性、结构连贯性和执行成功率上优于现有系统。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13653 2026-07-28 cs.CV cs.RO 版本更新

Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation

探索性、交流性和可部署性:用于开放世界移动操作的视觉驱动具身智能体

Boyu Mi, Mengchen Ma, Yifei Yao, Xing Gao, Junting Chen, Yangzi Li, Zihou Zhu, Guohao Li, Zhenfei Yin, Tai Wang, Yao Mu, Jiangmiao Pang, Hanqing Wang

AI总结 研究针对具身智能体现实部署难题,提出REAL框架,通过建立一致环境API、设计任务组合优化性能,引入REAL - Bench评估。实验显示其智能体在交互式任务中表现出色,在物理机器人上也实现高成功率,弥合现实差距。

Comments Accepted to ECCV 2026. 57 pages. Code available at https://github.com/InternRobotics/REAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31513 2026-07-28 cs.CV 版本更新

Personalize Your Large Vision-language Models With In-context Prompt Tuning

用上下文提示调优个性化你的大型视觉语言模型

Yanshu Li, Jiaqian Li, Kuai Yu, Xi Xiao, Dongfang Liu, Tianyang Wang, Ruixiang Tang

机构 * Brown University(布朗大学) Columbia University(哥伦比亚大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Purdue University(普渡大学) Rutgers University(罗格斯大学)

AI总结 提出上下文提示调优(ICPT)方法,通过轻量投影模块从多参考图像中提取细粒度视觉语义并转化为连续提示,结合几何正则化解决环境偏差和跨概念干扰,实现高效个性化。

Comments Accepted at ECCV 2026, 27 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14382 2026-07-28 cs.CV 版本更新

StAR: Segment Anything Reasoner

StAR:分段任何推理器

Seokju Yun, Dongheon Lee, Noori Bae, Jaesung Jun, Chanseul Cho, Youngmin Ro

AI总结 本文提出StAR框架,通过多角度优化提升分割性能,并首次引入并行测试时间扩展,构建ReasonSeg-X数据集以评估高级方法。

Comments ECCV 2026 / Code: https://github.com/ysj9909/StAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14736 2026-07-28 cs.CV 版本更新

HandSCS: Structural Coordinate Space for Animatable Hand Gaussian Splatting

HandSCS: 用于可动画手高斯点云的结构坐标空间

Yilan Dong, Wenqing Wang, Qing Wang, Jiahao Yang, Haohe Liu, Xiatuan Zhu, Gregory Slabaugh, Shanxin Yuan

机构 * Queen Mary University of London(伦敦女王学院) University of Surrey(萨里大学)

AI总结 HandSCS 通过结构引导的 3D 高斯点云框架实现高保真的手部动画,采用结构坐标空间和跨姿态一致性损失提升姿态间一致性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12940 2026-07-28 cs.CV 版本更新

Recurrent Autoregressive Diffusion: Global Memory Meets Local Attention

循环自回归扩散:全局记忆与局部注意力相结合

Taiye Chen, Zihan Ding, Anjian Li, Christina Zhang, Zeqi Xiao, Yisen Wang, Chi Jin

机构 * Peking University(北京大学) Princeton University(普林斯顿大学) Nanyang Technological University(南洋理工大学)

AI总结 研究针对超长视频生成中现有模型的不足,提出循环自回归扩散(RAD)框架,结合循环块与局部注意力,解决训练推理差距等问题,在相关数据集实验中展现出长视频生成的优越性。

Comments Published at ECCV 2026. Project page: https://yeyutaihan.github.io/recurrent-autoregressive-diffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16909 2026-07-28 cs.CV cs.RO 版本更新

SLAM-Former: Putting SLAM into One Transformer

SLAM-Former:将同步定位与地图构建集成于一个Transformer

Yijun Yuan, Zhuoguang Chen, Kenan Li, Weibang Wang, Minghui Qin, Zhijian Fang, Weicheng Zheng, Hang Zhao

机构 * IIIS, Tsinghua University(清华大学智能系统研究所)

AI总结 研究将SLAM功能集成于单个Transformer的方法,核心是SLAM-Former由协同的前后端组成,前端实时处理单目图像用于增量映射和跟踪,后端全局优化,实验证明该方法相比现有密集SLAM方法性能优越。

Comments Published on ECCV 2026, Project Page:https://tsinghua-mars-lab.github.io/SLAM-Former

详情

展开后加载摘要…

URL PDF HTML 收藏