arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 185 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 185 篇

2607.04311 2026-07-08 cs.CV 新提交 57%

Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment

Aura:通过基于VLM的语义对齐实现一致的多主体视频生成

Zixiang Zhou, Zhentao Yu, Yifeng Ma, Hongmei Wang, Wenqing Yu, Cong Wang, Zilin Yang, Rui Chen, Jiarong Ou, Yezhou Liu, Yuan Zhou, Qinglin Lu

机构 * Tencent Hunyuan(腾讯混元)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出Aura框架用于高保真和身份一致的视频生成,引入AI导演级字幕、利用VLM提取多模态语义特征,设计对齐策略,采用多种机制减少伪影,在多主体视频生成上达先进性能。

Comments Project page: https://aura-project-page.github.io/ Code: https://github.com/Camellia997/Aura

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02712 2026-07-07 cs.CV 新提交 57%

Global Pose Control for Generative View Synthesis in Normalized Object Coordinate Space

归一化物体坐标空间中用于生成视图合成的全局姿态控制

Zhibing Li, Amogh Gupta, Behnoosh Parsa, Dan Casas

机构 * The Chinese University of Hong Kong(香港中文大学) Amazon(亚马逊)

专题命中 可控生成 :image editing(abstract);分类 cs.CV

AI总结 针对现有生成模型在目标视图全局控制上的不足,提出在归一化物体坐标空间中精确相机控制的新方法,以单张或少量无姿态图像为输入,将视图合成视为图像编辑问题,提升了视图生成质量和保真度。

Comments Accepted to ECCV 2026. Project page https://lizb6626.github.io/GlobalNVS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01990 2026-07-03 cs.CV 新提交 57%

Training-free Controllable Human Motion Generation under Heterogeneous Constraints

异构约束下无需训练的可控人体运动生成

Xiaofei Hui, Bo Yan, Haoxuan Qu, Hossein Rahmani, Jun Liu

机构 * Lancaster University(兰卡斯特大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出Motion-Inference-as-Control框架,将扩散运动生成建模为随机控制问题,统一处理连续目标型和基于准则的约束,无需约束特定训练或可微性要求。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01503 2026-07-03 cs.CV 新提交 57%

Disentangling Pictorial Cue Understanding from Language Bias in VLMs via Depth Ordering Task

通过深度排序任务解构视觉语言模型中的图像线索理解与语言偏差

Yiqian Liu, Iuliia Kotseruba, John K. Tsotsos

机构 * York University(约克大学) University of Guelph(圭尔夫大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 提出深度排序与异常检测任务,结合控制图像线索和语言表达,量化视觉语言模型的深度感知能力,发现模型对深度线索利用不足且存在语言偏差。

Comments 15 pages, 7 figures, accepted to ECCV 2026 (30 pages, 13 figures, supplementary materials included)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23041 2026-07-03 cs.CV 新提交 57%

SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models

SPAR: 语义-像素自对齐与自适应路由的统一多模态模型

Hongxiang Li, Hongxu Chen, Chenyang Zhu, Xiaoshuang Huang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Xiaohongshu Inc.(小红书公司)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出SPAR框架,通过非对称双流统一分词器协调语义感知与像素重建,利用自对齐生成范式消除外部依赖,并引入动态令牌路由实现灵活多模态交互,在统一架构中达到生成、重建与视觉理解的最优性能。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00545 2026-07-02 cs.CV 新提交 57%

ECoSim: Data Efficient Fine-Tuning for Controllable Traffic Simulation

ECoSim:面向可控交通模拟的数据高效微调

Yu-Hsiang Chen, Wei-Jer Chang, Yi-Ting Chen, Masayoshi Tomizuka

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出轻量级控制适应框架,通过身份初始化的FiLM层调制中间特征,为预训练的扩散和自回归交通模型添加多模态控制(草图、潜在行为编码和文本),使用不到1%的配对数据实现强可控性。

Comments European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00371 2026-07-02 cs.CV cs.AI 新提交 57%

MEPA: Multi-Scale Representation Alignment for Visual Autoregressive Modeling with Mixture of Experts

MEPA: 基于专家混合的多尺度表示对齐用于视觉自回归建模

Nuoyan Zhou, Zhijun Tu, Lei Yu, Kun Cheng, Jie Hu, Nannan Wang, Xinghao Chen

机构 * State Key Laboratory of Integrated Services Networks, Xidian University(西安电子科技大学综合业务网理论及关键技术国家重点实验室) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 针对视觉自回归模型在多尺度表示学习中的优化冲突和语义传播问题,提出尺度感知的专家混合架构和残差特征聚合方案,提升训练效率和生成质量。

Comments 15 pages, 4 figures, 8 tables, Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00293 2026-07-02 cs.CV cs.CL cs.LG 新提交 57%

Rosetta: Composable Native Multimodal Pretraining

Rosetta: 可组合的原生多模态预训练

Xiangyue Liu, Zijian Zhang, Miles Yang, Zhao Zhong, Liefeng Bo, Ping Tan

机构 * HKUST(香港科技大学) Tencent Hunyuan(腾讯混元)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 提出Rosetta框架,通过动量锚定正交投影(MAOP)实现无损模态扩展,解决多模态预训练中的灾难性遗忘和梯度冲突问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31933 2026-07-01 cs.CV 新提交 57%

No Place to Hide: Benchmarking Video Hallucination with Background-Controlled Pairs

无处可藏:基于背景控制对的视频幻觉基准测试

Haojian Huang, Harold Haodong Chen, Meng Luo, Junjia Du, Shanqing Xu, Ziheng Chen, Yanxiang Huang, Yinchuan Li, Ying-Cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Knowin AI(考恩人工智能) The Hong Kong Polytechnic University(香港理工大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Huazhong University of Science and Technology(华中科技大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 提出VidPair-Halluc基准,通过背景相似但前景语义不同的视频对,精确评估大型视频模型中的视频幻觉,包含1K对抗视频对和11K时空问答对。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27332 2026-06-26 cs.CV 新提交 57%

RoPEMover: Depth-Aware Object Relocation via Positional Embeddings

RoPEMover: 通过位置嵌入实现深度感知的物体重定位

Ipek Oztas, Duygu Ceylan, Aybars Bugra Aksoy, Aysegul Dundar

机构 * Bilkent University(比尔肯大学) Brown University(布朗大学) Adobe Research(Adobe研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出一种基于扩散Transformer位置表示(RoPE)的几何感知物体运动方法,通过深度感知的2D RoPE扩展实现3D空间位移,在合成数据与少量真实图像训练下,实现物体身份保持、遮挡区域生成及阴影光照一致更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27192 2026-06-26 cs.CV 新提交 57%

LISA: Likelihood Score Alignment for Visual-condition Controllable Generation

LISA: 似然分数对齐用于视觉条件可控生成

Yanghao Wang, Hongxu Chen, Jiazhen Liu, Zhenqi He, Rui Liu, Zhen Wang, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Huawei Research(华为研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出LISA方法,通过将侧网络中间特征与近似似然分数对齐,加速训练收敛并提升生成质量,且不增加推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25376 2026-06-25 cs.CV 新提交 57%

Transferable Attack against Face Swapping in an Extended Space

扩展空间中针对人脸交换的可迁移攻击

Mingzhi Lyu, Yi Huang, Jun Xie, Zihao Zhao, Hong Xu, Adams Wai-Kin Kong

机构 * IEEE(电气电子工程师学会) IEEE International Conference on Multimedia and Expo (ICME)(IEEE国际多媒体与展览会议)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出基于重光照函数的加性身份攻击(AIR),通过联合重光照和加性扰动扩展攻击空间,生成强且视觉自然的对抗样本,无需代理模型即可高效迁移攻击多种主体无关的人脸交换模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24333 2026-06-24 cs.CV 新提交 57%

UniTranslator: A Unified Multi-modal Framework for End-to-end In-Image Machine Translation

UniTranslator:一种用于端到端图像内机器翻译的统一多模态框架

Jiahao Lyu, Pei Fu, Zhenhang Li, Shaojie Zhang, Jiahui Yang, Yu Zhou, Can Ma, Zhenbo Luo, Jian Luan

机构 * MiLM Plus, Xiaomi Inc(小米公司MiLM Plus) Binghamton University(宾汉姆顿大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 提出UniTranslator统一框架,通过理解-生成对齐模块和空间掩码解码器解决翻译理解与文本编辑的冲突及空间错位问题,在多个基准上实现最先进性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23675 2026-06-23 cs.CV 新提交 57%

IMAGIN-4D: Image-Guided Controllable Interaction Generation

IMAGIN-4D:图像引导的可控交互生成

Sai Kumar Dwivedi, Federica Bogo, Buğra Tekin, Chenhongyi Yang, Nadine Bertsch, Tomas Hodan, Michael J. Black, Dimitrios Tzionas, Shreyas Hampali

机构 * Meta, Zurich(Meta 苏黎世)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出IMAGIN-4D,一种基于扩散模型的人-物交互生成方法,通过时空分解的图像条件控制交互细节,提升细粒度交互控制能力。

Comments 15 pages, 8 figures. Project page: https://imagin4d.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22931 2026-06-23 cs.CV cs.AI 新提交 57%

BEV-Denoise: Learning Intrinsic Noise for Accurate Bird's-Eye-View Semantic Segmentation

BEV-Denoise:学习内在噪声以实现精确的鸟瞰图语义分割

Dooseop Choi, Kyounghwan An, Kyoung-Wook Min

机构 * Electronics and Telecommunications Research Institute (ETRI)(韩国电子通信研究院) University of Science and Technology (UST)(科学技术联合大学院大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出BEV-Denoise框架,利用UNet噪声估计模块从鸟瞰图特征中去除内在噪声,通过任务分解学习范式训练,提升多种视图变换模型的语义分割精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20891 2026-06-23 cs.CV cs.LG 新提交 57%

Go-with-the-Track: Video Compositing and Motion Control with Point Tracking

Go-with-the-Track: 基于点追踪的视频合成与运动控制

Koichi Namekata, Yash Kant, Zhizheng Liu, Ryan D Burgert, Yuancheng Xu, Kuan Heng Lin, Emmett Steven, Julien Philip, Li Ma, Andrea Vedaldi, Paul Debevec, Ning Yu

机构 * Netflix USA(Netflix美国) Eyeline Labs USA(Eyeline Labs美国) University of Oxford(牛津大学) Eyeline Labs Los Angeles USA(Eyeline Labs洛杉矶美国) University of California, Los Angeles(加州大学洛杉矶分校) Stony Brook University USA(石溪大学美国) Columbia University USA(哥伦比亚大学美国) Eyeline Labs United Kingdom(Eyeline Labs英国) Netflix Los Angeles USA(Netflix洛杉矶美国)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出Go-with-the-Track,通过联合条件多参考图像和参考锚定点轨迹,统一视频合成与运动控制,实现精确合成与运动控制。

Comments SIGGRAPH 2026, Project page: https://eyeline-labs.github.io/Go-with-the-Track/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20404 2026-06-19 cs.CV 新提交 57%

FlowBender: Feedback-Aware Training for Self-Correcting Conditional Flows

FlowBender: 面向自校正条件流的反馈感知训练

Daniel Gilo, Sven Elflein, Ido Sobol, Or Litany

机构 * Technion(以色列理工学院) NVIDIA(英伟达) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 针对条件扩散/流模型常违反任务约束的问题,提出FlowBender闭环框架,将对齐误差作为输入训练网络学习校正策略,在图像翻译、复原和3D纹理贴图中同时提升保真度与合理性。

Comments Project page: https://flow-bender.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20108 2026-06-19 cs.CV cs.LG 新提交 57%

EFIQA: Explainable Fundus Image Quality Assessment via Anatomical Priors

EFIQA: 基于解剖先验的可解释眼底图像质量评估

Pengwei Wang, José Morano, Qian Wan, Hrvoje Bogunović

机构 * Institute of Artificial Intelligence, Center for Medical Data Science, Medical University of Vienna, Austria(维也纳医科大学医学数据科学中心人工智能研究所) Christian Doppler Lab for Artificial Intelligence in Retina, Medical University of Vienna, Austria(维也纳医科大学视网膜人工智能克里斯蒂安·多普勒实验室)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 提出无需质量标签的EFIQA框架,利用解剖先验通过掩膜解剖修复学习正常结构,生成空间质量图,在多个基准上超越监督方法,兼具可解释性。

Comments Accepted in MIDL 2026. Code: https://github.com/penway/EFIQA

Journal ref Proceedings of Machine Learning Research 315:2248-2264, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19958 2026-06-19 cs.CV 新提交 57%

SketchKeyAnime: Reference-anchored Sparse Key-Sketch Animation Synthesis

SketchKeyAnime:基于参考锚点的稀疏关键草图动画合成

Meixi Li, Xianlin Zhang, Yue Zhang, Xueming Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出SketchKeyAnime视频扩散框架,通过双分支条件机制和可学习门控的草图交叉注意力,从单张参考RGB图像和稀疏关键草图生成结构可控、外观一致且时间连贯的动画,在Sakuga-42M数据集上显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17520 2026-06-17 cs.RO cs.CV 新提交 57%

GASE: Gaussian Splatting-Based Automated System for Reconstructing Embodied-Simulation Environments

GASE:基于高斯溅射的自动化系统用于重建具身仿真环境

Jiawei Zhang, Yiming Yan, Chao Liang, Nuo Xu, Seson Sun, Qichen Zhang, Yuhao Xu, Yantai Yang, Yingqiao Wang, Qin Jin, Zhipeng Zhang

机构 * AutoLab, SAI, Shanghai Jiao Tong University(上海交通大学SAI学院AutoLab实验室) AIM3 Lab, School of Information, Renmin University of China(中国人民大学信息学院AIM3实验室) Research Lab, Anyverse Dynamics(Anyverse Dynamics研究实验室)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 提出GASE系统,利用全景相机阵列和多视图视频流,通过相机位姿策略提取前景物体并修复场景,独立重建后导入物理仿真器,实现高效高保真仿真环境构建,分割精度提升超10%,真实机器人部署性能差距小于10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17431 2026-06-17 cs.CV 新提交 57%

Visual Retrieval-Augmented Generation for Silhouette-Guided Animal Art

视觉检索增强生成:基于轮廓引导的动物艺术创作

Quoc-Duy Tran, Anh-Tuan Vo, Trung-Nghia Le

机构 * University of Science, VNU-HCM(胡志明市国立大学理科大学) Vietnam National University, Ho Chi Minh(胡志明市国立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出视觉检索增强生成(Visual-RAG)框架,通过检索与自然轮廓结构相似的动物形状,结合ControlNet和IP-Adapter引导扩散模型生成动物艺术,实现计算空想性视错觉。

Comments SOICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17040 2026-06-16 cs.RO cs.CV 新提交 57%

R2RDreamer: 3D-aware Data Augmentation for Spatially-generalized 2D Manipulation Policies

R2RDreamer: 面向空间泛化的2D操作策略的3D感知数据增强

Xiuwei Xu, Haowen Sun, Angyuan Ma, Yiwei Zhang, Zhenyu Wu, Xiaofeng Wang, Bingyao Yu, Zheng Zhu, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学) BUPT(北京邮电大学) GigaAI

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出R2RDreamer框架,通过轻量级3D编辑和2D视频补全,从少量真实演示生成几何一致的增强数据,提升2D操作策略的空间泛化能力。

Comments Project page: https://r2rdreamer.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15592 2026-06-16 cs.CV 新提交 57%

DenseControl: Instance-Level Controllable Synthesis of Dense Crowd Image

DenseControl: 密集人群图像的实例级可控合成

Juncheng Wang, Lei Shang, Wang Lu, Baigui Sun, Shujun Wang

机构 * the Hong Kong Polytechnic University(香港理工大学) Tongyi lab, Alibaba Group(阿里巴巴集团通义实验室) Tsinghua University(清华大学)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 提出DenseControl管道,通过隔离对象嵌入图和隐式尺度嵌入策略,实现密集人群图像中实例位置、大小、背景、风格和属性的精确控制,在合成质量和下游应用中达到最优。

Comments Accepted to IEEE TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15341 2026-06-16 cs.CV 新提交 57%

CausalDrive: Real-time Causal World Models for Autonomous Driving

CausalDrive: 用于自动驾驶的实时因果世界模型

Tianyi Yan, Huan Zheng, Dubing Chen, Meizhi Qu, Yingying Shen, Lijun Zhou, Mingfei Tu, Bing Wang, Guang Chen, Hangjun Ye, Haiyang Sun, Cheng-zhong Xu, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学协同创新研究院,科技学院) Xiaomi EV(小米汽车) CASIA(中国科学院自动化研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出CausalDrive,一种可控、实时的驾驶世界渲染器,通过因果预测和Context-Forced DMD架构实现交互式模拟,支持闭环评估、强化学习后训练和人在环仿真。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15072 2026-06-16 cs.CV 新提交 57%

Texture-Shape Bias Balancing for Robust Synthetic-to-Real Semantic Segmentation in Automotive NIR Imagery

纹理-形状偏差平衡用于汽车近红外图像中鲁棒的合成到真实语义分割

Felix Stillger, Ben Hamscher, Lukas Hahn, Annika Mütze, Tobias Meisen, Kira Maag

机构 * University of Wuppertal(伍珀塔尔大学) Aptiv(Aptiv公司) Heinrich Heine University Düsseldorf(海因里希·海涅大学杜塞尔多夫) Osnabrück University(奥斯纳布吕克大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出生成式增强框架,通过目标风格适配和Voronoi风格多样化策略平衡纹理-形状偏差,实现近红外图像合成到真实域适应,将域差距减少高达63.6%。

Comments Accepted at ECML PKDD 2026 (ADS Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13382 2026-06-12 cs.CV cs.AI 新提交 57%

SmartFont: Dynamic Condition Allocation for Few-Shot Font Generation

SmartFont: 少样本字体生成的动态条件分配

Zian Yang, Zixin Wang

机构 * Fudan University(复旦大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出SmartFont扩散框架,通过全局内容-风格生成与弱监督局部校正专家结合,并引入去噪状态条件分配模块动态加权全局与局部特征,实现少样本字体生成的全局完整性与局部细节保真度平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12217 2026-06-11 cs.CV cs.AI cs.RO 新提交 57%

Making Foresight Actionable: Repurposing Representation Alignment in World Action Models

使远见可操作:在世界动作模型中重新利用表示对齐

Lu Qiu, Yizhuo Li, Yi Chen, Yuying Ge, Yixiao Ge, Xihui Liu

机构 * The University of Hong Kong(香港大学) XPENG Robotics(小鹏机器人)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 针对世界动作模型中视觉预测与动作提取不匹配的问题,提出AGRA方法,通过对齐视频扩散特征与语义表示,提升动作解码器对任务相关区域的关注,从而改善操作任务的性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11096 2026-06-10 cs.CV 新提交 57%

IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder

IDEAL: 深度对齐实现离散表示自编码器

Yitong Chen, Zijie Diao, Junke Wang, Lingyu Kong, Yixuan Ren, Bo He, Yu-Gang Jiang, Zuxuan Wu

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Innovation Institute(上海创新研究院) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 提出IDEAL框架,通过联合对齐量化令牌与浅层和深层VFM特征,提升离散表示自编码器的重建质量,在ImageNet上实现0.61 rFID,并创下自回归图像生成新纪录(gFID 1.89)。

Comments Code is available at https://github.com/Row11n/IDEAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10902 2026-06-10 cs.CV cs.AI 新提交 57%

Pose-ICL: 3D-Aware In-Context Learning for Pose-Controllable Subject Customization

Pose-ICL:面向姿态可控主体定制的3D感知上下文学习

Xuan Han, Yihao Zhao, Mingyu You

机构 * College of Electronic and Information Engineering, Tongji University, Shanghai, China(同济大学电子与信息工程学院) State Key Laboratory of Autonomous Intelligent Unmanned Systems, Frontiers Science Center for Intelligent Autonomous Systems, Ministry of Education, Shanghai, China(自主智能无人系统国家重点实验室,智能自主系统前沿科学中心,教育部,上海,中国)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 提出Pose-ICL框架,通过3D感知上下文学习和表面锚定位置嵌入(SAPE)实现无调优的姿态可控主体定制,显著提升姿态准确性和身份一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10025 2026-06-10 cs.RO cs.CV cs.LG 新提交 57%

GHOST: Hierarchical Sub-Goal Policies for Generalizing Robot Manipulation

GHOST: 用于泛化机器人操作的层次化子目标策略

Sriram Krishna, Ben Eisner, Haotian Zhan, Ying Yuan, Haoyu Zhen, Chuang Gan, Shubham Tulsiani, David Held

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) UMass Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出GHOST框架,通过将控制分解为高层子目标预测和低层目标条件控制器,实现视觉运动操作策略的泛化,并利用人类演示适应新物体和任务变化。

Comments Accepted at RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏