arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4210 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4210 篇

2605.25012 2026-05-26 cs.CV 57%

Learning from Semantic Dictionaries: Discriminative Codebook Contrastive Learning for Unified Visual Representation and Generation

从语义字典中学习:面向统一视觉表示与生成的判别式码本对比学习

Imanol G. Estepa, Jesús M Rodríguez-de-Vera, Bhalaji Nagarajan, Petia Radeva

机构 * Universitat de Barcelona(巴塞罗那大学) Barcelona Supercomputing Center (BSC)(巴塞罗那超级计算中心)

专题命中 可控生成 :generative vision(abstract);分类 cs.CV

AI总结 提出LEASE框架,通过配对生成-判别码本设计,在离散标记空间中联合优化掩码重建损失和码本对比损失,实现统一视觉表示与生成,在ImageNet-1K上达到最先进性能。

Comments Accepted at CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24074 2026-05-26 cs.CV cs.RO 57%

WideDepth: Millimeter-Accurate Benchmark for Fisheye Depth Estimation

WideDepth: 用于鱼眼深度估计的毫米级精度基准

Ilia Indyk, Ignat Penshin, Ivan Sosin, Maxim Monastyrny, Aleksei Valenkov, Ilya Makarov

机构 * Robotics Center(机器人中心) AXXX Trusted AI Research Center, RAS(可信人工智能研究中心,俄罗斯科学院)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 提出首个室内鱼眼深度估计数据集WideDepth,包含101个场景的5K高分辨率立体对和毫米级真值,并引入基于LiDAR的立体鱼眼图像生成方法,评估多种模型,微调后性能提升高达62%。

Comments Accepted to IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21381 2026-05-21 cs.CV cs.LG 57%

Disentangling Generation and Regression in Stochastic Interpolants for Controllable Image Restoration

解耦生成与回归在可控图像恢复中的随机插值

Yi Liu, Jia Ma, Wengen Li, Jihong Guan, Shuigeng Zhou, Yichao Zhang

机构 * Tongji University(同济大学) Fudan University(复旦大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出DiSI框架,通过解耦随机插值过程中的生成与回归组件,实现从纯回归到全生成的连续可控过渡,提升图像恢复任务的效率和精度。

Comments 44 pages, 16 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20733 2026-05-21 cs.CV 57%

Sketch2MinSurf: Vision-Language Guided Generation of Editable Minimal Surfaces from Hand-Drawn Sketches

Sketch2MinSurf: 通过视觉-语言引导从手绘草图生成可编辑的最小曲面

Wenda Wang, Anqi Liu, Junqi Yang, Lei He, Luying Wang, Jiachen Lu, Weixin Huang

机构 * School of Architecture, Tsinghua University(清华大学建筑学院) Department of Architecture, National University of Singapore(新加坡国立大学建筑系)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出Sketch2MinSurf方法,结合视觉-语言引导和几何优化,从手绘草图生成平滑且可编辑的3D曲面,通过空间-拓扑编码和Sketch2MinSurf结构损失函数实现拓扑一致性与几何重建的联合约束。

Comments 22 pages, 16 figures, includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14417 2026-05-21 cs.RO cs.CV 57%

Before the Body Moves: Learning Anticipatory Joint Intent for Language-Conditioned Humanoid Control

在身体移动之前:为语言条件的人形控制学习预见性关节意图

Haozhe Jia, Honglei Jin, Yuan Zhang, Youcheng Fan, Shaofeng Liang, Lei Wang, Shuxu Jin, Kuimou Yu, Zinuo Zhang, Jianfei Song, Wenshuo Chen, Yutao Yue

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) LimX Dynamics Technology Co., Ltd.(LimX动态技术有限公司) Shandong University(山东大学) Data61/CSIRO Griffith University(格里菲斯大学) Institute of Deep Perception Technology, Jiangsu Industrial Technology Research Institute (JITRI)(深度感知技术研究院,江苏省工业技术研究院(JITRI))

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出DAJI框架,通过学习语言生成与闭环控制之间的预见性关节意图接口,解决语言条件人形机器人中预见未来物理转换的需求,实现了在HumanML3D风格生成和BABEL任务中的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09060 2026-05-21 cs.AI cs.CV 57%

Letting Trajectories Spread: Quality-Preserving Control for Diverse Flow Matching

让轨迹扩散:用于多样化流匹配的质量保持控制

Jingxuan Wu, Zhenglin Wan, Xingrui Yu, Yuzhe Yang, Bo An, Ivor Tsang, Yang You

机构 * The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Nanyang Technological University(南洋理工大学) CFAR, Agency for Science, Technology and Research, Singapore(新加坡科技研究局CFAR) University of California, Santa Barbara(加州大学圣巴巴拉分校) National University of Singapore(新加坡国立大学)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种无需训练的推理时控制机制,使流本身具备多样性意识,通过几何上与模式质量寻求方向解耦的引导来鼓励轨迹横向扩散,同时通过时间调度的随机扰动重新引入不确定性,从而在不降低图像细节和提示忠实度的情况下提升多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19995 2026-05-20 cs.CV 57%

CogOmniControl: Reasoning-Driven Controllable Video Generation via Creative Intent Cognition

CogOmniControl: 通过创意意图认知实现推理驱动的可控视频生成

Hongji Yang, Songlian Li, Yucheng Zhou, Xiaotong Zhao, Alan Zhao, Chengzhong Xu, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学SKL-IOTSC、CIS实验室) Online-Video BU, Tencent(腾讯在线视频事业部)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出CogOmniControl框架,通过将可控视频生成分解为创意意图认知和生成两个阶段,利用专门训练的CogVLM生成更专业清晰的输出,并通过强化学习对齐不同条件的控制,最终在两个基准测试中超越现有开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22940 2026-05-20 cs.CV 57%

One-to-All Animation: Alignment-Free Character Animation and Image Pose Transfer

一对一动画:无对齐角色动画和图像姿态转换

Shijun Shi, Jing Xu, Zhihang Li, Chunli Peng, Xiaoda Yang, Lijing Lu, Kai Hu, Jiangning Zhang

机构 * Jiangnan University(江南大学) University of Science and Technology of China(中国科学技术大学) Chinese Academy of Sciences(中国科学院) Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang University(浙江大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种统一框架,用于高保真角色动画和图像姿态转换,解决了参考姿态错位问题,通过自监督补全任务和混合参考融合注意力机制提升生成质量。

Comments Project Page:https://ssj9596.github.io/one-to-all-animation-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12172 2026-05-20 cs.LG cs.CR cs.CV 57%

SEAL: Semantic Aware Image Watermarking

SEAL:语义感知图像水印

Kasra Arabi, R. Teal Witter, Chinmay Hegde, Niv Cohen

机构 * New York University(纽约大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种新的水印方法,通过将生成图像的语义信息直接嵌入水印中,实现无损水印验证,无需依赖密钥模式数据库。通过局部敏感哈希从图像语义嵌入中推断密钥模式,并基于原始图像内容条件检测水印,提高对抗伪造攻击的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19102 2026-05-19 cs.RO cs.AI cs.CV 57%

FUNCanon: Learning Pose-Aware Action Primitives via Functional Object Canonicalization for Generalizable Robotic Manipulation

FUNCanon: 通过功能对象规范化学习姿态感知的动作原语以实现通用的机器人操作

Hongli Xu, Lei Zhang, Xiaoyue Hu, Boyang Zhong, Kaixin Bai, Zoltán-Csaba Márton, Zhenshan Bing, Zhaopeng Chen, Alois Christian Knoll, Jianwei Zhang

机构 * TAMS (Technical Aspects of Multimodal Systems), Department of Informatics, University of Hamburg(汉堡大学信息学院TAMS(多模态系统技术)) Technical University of Munich(慕尼黑技术大学) Agile Robots SE(敏捷机器人有限公司)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出FUNCanon框架,通过功能对象规范化学习姿态感知的动作原语,以实现通用的机器人操作,该方法将长周期操作任务分解为由主体、动词和对象定义的动作片段,从而提升策略的可组合性和可重用性。

Comments project website: https://sites.google.com/view/funcanon, 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16810 2026-05-19 cs.CV 57%

Training-Free Occluded Text Rendering via Glyph Priors and Attention-Guided Semantic Blending

无需训练的遮挡文本渲染:通过字形先验和注意力引导的语义融合

Jingqi Hou, Hongtian Wang

机构 * College of Computer Science, Beijing University of Technology, Beijing, China(北京理工大学计算机学院)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的遮挡文本渲染框架,通过预训练的FLUX.1-dev模型,解决文本生成中遮挡物位置和文本结构稳定性问题,采用双流推理和字形先验稳定文本结构,提升文本可读性和遮挡对齐效果。

Comments 9 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15167 2026-05-15 cs.CV 57%

Does Synthetic Layered Design Data Benefit Layered Design Decomposition?

合成分层设计数据是否有助于分层设计分解?

Kam Man Wu, Haolin Yang, Qingyu Chen, Yihu Tang, Jingye Chen, Qifeng Chen

机构 * HKUST(香港理工大学) Webank(网商银行)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文研究合成分层数据对图形设计分解的影响,发现纯合成数据能有效替代传统方法,且训练数据规模增加时性能提升,但5万样本后趋于饱和。

Comments 22 pages, 10 figures. Code is available at https://github.com/YangHaolin0526/SynLayers

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12624 2026-05-15 cs.RO cs.CV 57%

MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving

MindVLA-U1:统一流架构使VLA超越VA用于自动驾驶

Yuzhou Huang, Benjin Zhu, Hengtong Lu, Victor Shea-Jay Huang, Haiming Zhang, Wei Chen, Jifeng Dai, Yan Xie, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多模态实验室) Li Auto Tsinghua University(清华大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 MindVLA-U1通过统一流架构实现自动驾驶中VLA超越VA,采用统一视觉语言模型骨干和流匹配连续动作轨迹,在保持各模态自然输出形式的同时,实现高效规划和低延迟。

Comments Work in progress. Project page: https://mind-omni.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14935 2026-05-15 cs.CV 57%

Multi-scale Coarse-to-fine Modeling for Test-time Human Motion Control

多尺度粗到细建模用于测试时的人体运动控制

Nhat Le, Daochang Liu, Anh Nguyen, Ajmal Mian

机构 * The University of Western Australia(西澳大学) The University of Liverpool(利物浦大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出MSCoT模型,通过多尺度粗到细方法实现测试时的人体运动合成与控制,采用高效多尺度令牌引导策略提升控制精度与效率,实验显示其在运动质量和控制准确性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14815 2026-05-15 cs.CV 57%

Probing into Camera Control of Video Models

探究视频模型的摄像机控制

Chen Hou, Christian Rupprecht

机构 * Visual Geometry Group University of Oxford(视觉几何组牛津大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出通过几何引导而非隐式映射实现摄像机控制,有效提升视频生成模型的几何表现力,并揭示了基础模型的摄像机控制偏见与差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14626 2026-05-15 cs.CV 57%

UniTriGen: Unified Triplet Generation of Aligned Visible-Infrared-Label for Few-Shot RGB-T Semantic Segmentation

UniTriGen: 一致的可见-红外-标签三元组生成用于少样本RGB-T语义分割

Ping Zhou, Haoyu Wang, Mengmeng Zheng, Lei Zhang, Wei Wei, Chen Ding, Fei Zhou

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) School of Computer Science & Technology, Xi’an University of Posts & Telecommunications(西安邮电大学计算机科学与技术学院) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 UniTriGen提出统一三元组生成框架,通过共享潜在空间和扩散过程生成一致的可见-红外-标签三元组,解决少样本RGB-T语义分割中的对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09304 2026-05-15 cs.CV 57%

GeRM: A Generative Rendering Model From Physically Realistic to Photorealistic

GeRM:从物理真实到照片级的生成渲染模型

Jiayuan Lu, Rengan Xie, Xuancheng Jin, Zhizhen Wu, Qi Ye, Tian Xie, Hujun Bao, Rui Wang. Yuchi Huo

机构 * State Key Lab of CAD\&CG, Zhejiang University Zhejiang Lab China State Key Laboratory of Industrial Control Technology, Zhejiang University China Zhejiang University China Zhejiang Lab State Key Laboratory of Industrial Control Technology, Zhejiang University Zhejiang University

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 GeRM是首个多模态生成渲染模型,通过学习分布转移向量场实现从物理真实到照片级的过渡,结合控制网络和多代理框架提升图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14135 2026-05-15 cs.CV 57%

PanoPlane: Plane-Aware Panoramic Completion for Sparse-View Indoor 3D Gaussian Splatting

PanoPlane:基于平面感知的稀疏视角室内3D高斯散点完成

Adil Qureshi, Dongki Jung, Jaehoon Choi, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PanoPlane通过全景场景完成重建封闭房间几何,利用360度全景完成条件生成过程,通过Layout Anchored Attention Steering机制引导扩散模型注意力至检测到的平面表面,实现基于几何一致性的表面外推,提升稀疏视角下的新型视图合成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04667 2026-05-14 cs.CV cs.LG cs.RO 57%

ZeD-MAP: Bundle Adjustment Guided Zero-Shot Depth Maps for Real-Time Aerial Imaging

ZeD-MAP:基于束调整的零样本深度图用于实时航拍成像

Selim Ahmet Iz, Francesco Nex, Norman Kerle, Henry Meissner, Ralf Berger

机构 * German Aerospace Center (DLR), Institute of Space Research(德国航空航天中心(DLR)空间研究所) Faculty of Geo-Information Science and Earth Observation (ITC), University of Twente(代尔夫特理工大学地理信息科学与地球观测学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出ZeD-MAP框架,通过集成增量聚类束调整,将扩散深度模型转换为具有度量一致性的SLAM映射流程,实现高分辨率无人机影像的实时三维地图生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12144 2026-05-13 cs.CV 57%

PoseCompass: Intelligent Synthetic Pose Selection for Visual Localization

PoseCompass: 用于视觉定位的智能合成姿态选择

Yanan Zhou, Zhaoyan Qian, Yanli Li, Nan Yang, Zhongliang Guo, Dong Yuan

机构 * The University of Sydney(悉尼大学) University of St Andrews(圣安德鲁大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PoseCompass通过智能姿态选择提升基于3DGS的APR性能,减少适应时间并降低姿态误差,优于随机基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11276 2026-05-13 cs.CV cs.AI 57%

Generative AI for Visualizing Highway Construction Hazards Through Synthetic Images and Temporal Sequences

生成AI用于通过合成图像和时间序列可视化公路施工危险

Trevor Neece, Mason Smetana, Lev Khazanovich

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出利用生成AI从OSHA严重伤害报告中生成合成图像和时间序列,以可视化公路施工危险,通过CLIP检索和专家评估验证了其教育价值和真实性,为安全培训提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10523 2026-05-12 cs.CV 57%

Improving Human Image Animation via Semantic Representation Alignment

通过语义表示对齐提升人类图像动画

Chang Liu, Mengting Chen, Yixuan Huang, Haoning Wu, Chen Ju, Shuai Xiao, Jinsong Lan, Yanfeng Wang

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, China(上海交通大学人工智能学院,中国) Alibaba Group, China(阿里巴巴集团,中国)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SemanticREPA方法,通过结构和ID对齐提升人类动画质量,增强动作连续性和一致性。

Comments Accepted by CVPR 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10409 2026-05-12 cs.CV 57%

Progressive Photorealistic Simplification

渐进式逼真简化

Adi Rosenthal, Dana Berman, Yedid Hoshen, Ariel Shamir

机构 * Reichman University and Google(里奇曼大学和谷歌) Google Israel(谷歌以色列) Hebrew University and Google(希伯来大学和谷歌) Google(谷歌)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本文提出渐进式语义图像简化框架,通过迭代去除并修补元素保持逼真外观,结合视觉-语言模型和学习验证器实现高效高质量的简化过程,应用于内容感知清理和交互编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08321 2026-05-12 cs.CV 57%

UM-Text: A Unified Multimodal Model for Image Understanding and Visual Text Editing

UM-Text: 一种统一的多模态模型用于图像理解和视觉文本编辑

Lichen Ma, Xiaolong Fu, Gaojing Zhou, Zipeng Guo, Ting Zhu, Yichun Liu, Yu Shi, Jason Li, Junshi Huang

机构 * Sun Yat-sen University(中山大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出UM-Text模型,通过自然语言指令实现图像理解和视觉文本编辑,引入VLM处理指令和参考图像,结合UM-Encoder生成风格一致的文本图像,并提出区域一致性损失和三阶段训练策略,最终在多个基准上取得最佳性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09429 2026-05-12 cs.CV cs.AI 57%

Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models

逃避视觉失语:面向视觉-语言模型的对比自适应语义令牌修剪

Jie Ma, Yihang Liu, Zhike Qiu, Jiayi Ji, Xiaoshuai Sun

机构 * Xiamen University(厦门大学)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出COAST方法,通过对比自适应语义路由实现视觉-语言模型的高效令牌修剪,减少77.8%的视觉令牌并提升2.15倍的推理速度,同时保持98.64%的原始性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21581 2026-05-12 cs.CV 57%

MultiAnimate: Pose-Guided Image Animation Made Extensible

MultiAnimate:基于姿态的图像动画使其可扩展

Yingcheng Hu, Haowen Gong, Chuanguang Yang, Zhulin An, Yongjun Xu, Songhua Liu

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) ShanghaiTech University(上海科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种可扩展的多人物图像动画框架,通过引入标识符分配器和标识符适配器,解决多人物场景中的身份混淆和不合理的遮挡问题,实现高质量多人物动画生成。

Comments CVPR2026 Accepted. Project page at https://hyc001.github.io/MultiAnimate/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09534 2026-05-12 cs.CV 57%

AUHead: Realistic Emotional Talking Head Generation via Action Units Control

AUHead: 通过动作单元控制实现逼真的情感谈话头生成

Jiayi Lyu, Leigang Qu, Wenjing Zhang, Hanyu Jiang, Kai Liu, Zhenglin Zhou, Xiaobo Xia, Jian Xue, Tat-Seng Chua

机构 * University of the Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民日報網通信內容認知重點實驗室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出AUHead方法,通过动作单元控制实现逼真的谈话头生成,解决现有方法在情感表达细腻度上的不足。

Comments https://openreview.net/forum?id=dmzlAUkulz&referrer=%5BAuthor%20Console%5D(%2Fgroup%3Fid%3DICLR.cc%2F2026%2FConference%2FAuthors%23your-submissions) Accepted at the 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02169 2026-05-12 cs.CV cs.DC cs.LG 57%

Heterogeneous Model Fusion for Privacy-Aware Multi-Camera Surveillance via Synthetic Domain Adaptation

异构模型融合用于隐私保护多摄像头监控的合成领域适应

Peggy Joy Lu, Wei-Yu Chen, Yao-Tsung Huang, Vincent Shin-Mu Tseng

机构 * Department of Computer Science and Information Engineering, National Chung Cheng University(资讯工程系,国立 Chung Cheng 大学) Department of Computer Science, National Yang Ming Chiao Tung University(计算机科学系,国立阳明交通大学) National Center for High-Performance Computing(国家高速计算中心)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出HeroCrystal框架,通过合成领域适应解决多摄像头目标检测中的隐私、类别不平衡和异构架构问题,提升定位精度并实现模型融合,实验表明其在多类别隐私保护设置下优于现有方法,mAP提升2.1%达33.4%。

Comments 42 pages, 13 figures. Published in Information Fusion (Elsevier). DOI: 10.1016/j.inffus.2026.104413

Journal ref Information Fusion, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06667 2026-05-08 cs.CV cs.AI cs.LG 57%

ActCam: Zero-Shot Joint Camera and 3D Motion Control for Video Generation

ActCam: 零样本联合摄像机和3D运动控制用于视频生成

Omar El Khalifi, Thomas Rossi, Oscar Fossey, Thibault Fouque, Ulysse Mizrahi, Philip Torr, Ivan Laptev, Fabio Pizzati, Baptiste Bellot-Gurlet

机构 * University of Oxford(牛津大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ActCam通过零样本方法实现视频生成中演员动作与摄像机轨迹的联合控制,通过几何一致的条件生成提升摄像机适应性和动作真实性。

Comments SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05377 2026-05-08 cs.CV 57%

Can Vision-Language Models Think from the Sky? Unifying UAV Reasoning and Generation

无人机视角下视觉语言模型能否思考?统一无人机推理与生成

Jintao Sun, Gangyi Ding, Donglin Di, Hu Zhang, Zhedong Zheng

机构 * Beijing Institute of Technology(北京理工大学) Harbin Institute of Technology(哈尔滨工业大学) CSIRO Data61(澳大利亚联邦科学与工业研究组织 Data61 分部) University of Macau(澳门大学)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出UAVReason数据集,用于研究无人机视角下的统一推理与生成,通过改进模型在高海拔场景下的表现,提升视觉语言模型在复杂环境中的能力。

Comments 21 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏