arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-18 至 2026-08-18 共收录 182 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 16 篇

2608.16220 2026-08-18 cs.SD cs.CV 新提交 57%

SingDance: Compositional Zero-Shot Singing-and-Dancing Video Generation with Role-Aware Audio Conditioning

SingDance:基于角色感知音频条件的组合式零样本歌舞视频生成

Tao Feng, Xu Li, Xiangyang Luo, Ming Wen, Huadai Liu, Chen Zhang, Wei Xue

机构 * Kuaishou Technology(快手科技)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SingDance是统一视频扩散框架,将语音表达设为语义角色,通过硬紧凑路由等技术实现组合式零样本歌舞视频生成,参数少且性能具竞争力。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16008 2026-08-18 cs.CV 新提交 57%

Spatial Temporal Synergy: Balancing Change and Invariance in Text Driven 3D Human Motion Editing

时空协同:文本驱动的三维人体动作编辑中变化与不变性的平衡

Shaohui Lin, Zhenwu Shi, Jingyu Gong, Jiao Xie, Yu Zhou, Baochang Zhang, Lizhuang Ma, Chia-Wen Lin

机构 * East China Normal University(华东师范大学) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) School of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学上海教育人工智能研究院) School of Statistics, East China Normal University(华东师范大学统计学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 针对文本驱动3D人体动作编辑中变化与不变性难以平衡的问题,提出CIME框架,通过空间姿态和时间节奏维度的解耦实现最优性能,相关成果已开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15749 2026-08-18 cs.CV 新提交 57%

ES3D: Embedding Semantics into 3D Space for Component-Aware Editing

ES3D:将语义嵌入3D空间以实现组件感知编辑

Xuancheng Jin, Rengan Xie, Jiayuan Lu, Wenting Zheng, Rui Wang, Yuchi Huo, Lincheng Li, Yingfeng Chen

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 ES3D是将语义嵌入3D空间的框架,通过多视图语义特征构建3D语义嵌入,实现组件感知的3D资产检索与编辑,可生成几何一致、语义连贯的编辑结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15163 2026-08-18 cs.CV cs.HC 新提交 57%

From "What-If" to "What-Is": Counterfactual Thinking-Inspired Semantic Alignment for Visual Brain Decoding

从“假设”到“事实”:面向视觉脑解码的反事实思维启发语义对齐

Kaitao Yan, Chi Liu, Congcong Zhu, Huajie Chen, Gengshen Wu, Minghao Wang, Xiaotong Han, Tianqing Zhu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出ConceptAlign框架,通过反事实语义对齐解决视觉脑解码的语义错误问题,在自然场景数据集上相比MindEye2提升了重构、语义区分等指标。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01503 2026-08-18 cs.CV 版本更新 57%

Disentangling Pictorial Cue Understanding from Language Bias in VLMs via Depth Ordering Task

通过深度排序任务解构视觉语言模型中的图像线索理解与语言偏差

Yiqian Liu, Iuliia Kotseruba, John K. Tsotsos

机构 * York University(约克大学) University of Guelph(圭尔夫大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 提出深度排序与异常检测任务,结合控制图像线索和语言表达,量化视觉语言模型的深度感知能力,发现模型对深度线索利用不足且存在语言偏差。

Comments 15 pages, 7 figures, accepted to ECCV 2026 (30 pages, 13 figures, supplementary materials included)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19403 2026-08-18 physics.optics cs.AI cs.CV physics.app-ph 57%

Learned split-spectrum metalens for obstruction-free broadband imaging in the visible

学习型分频光谱金属镜用于可见光波段无遮挡广谱成像

Seungwoo Yoon, Dohyun Kang, Eunsue Choi, Sohyun Lee, Seoyeon Kim, Minho Choi, Hyeonsu Heo, Dong-ha Shin, Suha Kwak, Arka Majumdar, Junsuk Rho, Seung-Hwan Baek

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本研究提出学习型分频光谱金属镜,实现可见光波段无遮挡广谱成像,提升物体检测和分割精度。

Journal ref Nature Communications 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23649 2026-08-18 cs.RO cs.CV 版本更新 57%

RoboMirror: Understand Before You Imitate for Video to Humanoid Locomotion

RoboMirror: 在模仿之前理解以实现视频到仿人运动

Zhe Li, Boan Zhu, Yangyang Wei, Shuanghao Bai, Yuheng Ji, Yibo Peng, Tao Huang, Pengwei Wang, Zhongyuan Wang, S. -H. Gary Chan, Chang Xu, Cheng Chi, Jianfei Yang, Shanghang Zhang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 RoboMirror通过视觉语言模型将视频提炼为视觉运动意图,直接生成物理合理的仿人运动,无需姿态重建,实现远程存在并提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16153 2026-08-18 cs.RO 新提交 50%

Unified Condition-Action Modeling for Accurate One-Step Action Generation

用于精准单步动作生成的统一条件-动作建模

Xinyu Zhou, Zikun Cai, Kuangji Zuo, Gen Li, Boyu Ma, Yanshuo Lu, Yutong Song, Mingqi Yuan, Jiayu Chen, Jianfei Yang

机构 * NTU(南洋理工大学) HKU(香港大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 该研究提出UCA-Flow统一条件-动作建模框架,通过共享令牌空间与改进双路监督方案,提升机器人单步动作生成的成功率与推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30006 2026-08-18 physics.flu-dyn 版本更新 50%

Exact analytical solutions for the piston effect in supercritical fluids under post-acoustic approximation -- Short-time asymptotics, thermal penetration depth and comparison with the Spacelab D-2 experiments

超临界流体中活塞效应的精确解析解:声学近似后的短时渐近、热穿透深度及与Spacelab D-2实验的比较

Mátyás Szücs

专题命中 可控生成 :diffusion(abstract)

AI总结 针对超临界流体中的活塞效应,在线性后声学近似下推导了直角和球坐标中一维问题的精确解析解,分析了短时渐近和热穿透深度,并通过考虑容器热容与Spacelab D-2实验数据良好吻合。

Comments 33 pages, 12 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15173 2026-08-18 math.OC q-fin.MF 版本更新 50%

Equilibrium stochastic control with implicitly defined objective functions

具有隐式定义目标函数的均衡随机控制问题

Zongxia Liang, Jianming Xia, Keyu Zhang

专题命中 可控生成 :diffusion(abstract)

AI总结 本文针对含隐式目标函数的时间不一致随机控制问题,在受控扩散框架中推导均衡策略的充要条件,并将其应用于两类带约束的动态投资组合选择问题,明确了确定市场系数下的均衡策略形式。

Comments To appear in SCIENTIA SINICA Mathematica

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 3 篇

2608.15259 2026-08-18 cs.CV cs.AI cs.RO 新提交 74%

UAV Video Deblurring via Motion-Aware Diffusion: A Path to Robust Target Detection

基于运动感知扩散的无人机视频去模糊:通往鲁棒目标检测的路径

Zhiqiang Hu, Shouren Huang, Masatoshi Ishikawa

机构 * Research Institute for Science & Technology, Tokyo University of Science(东京理科大学科学技术研究所)

专题命中 图像修复 :diffusion(title);分类 cs.CV

AI总结 该研究针对无人机视频运动模糊问题,提出自适应潜在尺度选择器与多帧对齐可学习门控模块,实现高效去模糊,提升无人机目标检测性能,适用于鲁棒航拍视觉任务。

Comments 8 pages, 8 figures. Published in the 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22924 2026-08-18 cs.CV 版本更新 57%

Layering Virtual Try-On

分层虚拟试穿

Chun Feng, Bowei Chen, Mengyi Shan, Ira Kemelmacher-Shlizerman

机构 * University of Washington(华盛顿大学)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 研究针对现实中服装分层搭配的虚拟试穿难题,提出LVTON方法。先通过自动数据生成管道训练获取一般VTON先验知识,再在专用数据集微调学习分层逻辑,在LVTON基准及传统VTON基准上取得优异成果,展现零样本能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16681 2026-08-18 eess.AS cs.SD eess.SP 版本更新 50%

A Survey of Advancing Audio Super-Resolution and Bandwidth Extension from Discriminative to Generative Models

音频超分辨率和带宽扩展从判别模型到生成模型的综述

Ningyuan Yang, Yize Li, Diego A. Cuji, Ryan M. Corey, Pu Zhao, Xue Lin, Andrew C. Singer

机构 * Discovery Partners Institute(发现伙伴研究所)

专题命中 图像修复 :diffusion(abstract)

AI总结 本文综述了音频超分辨率和带宽扩展领域,从判别模型向生成模型的转变,总结了早期判别模型的局限性以及生成模型在表示域、架构、条件机制等方面的改进,探讨了大语言模型和多模态基础模型等新兴方向,并指出了感知评估、相位建模和实际应用泛化等开放挑战。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 4 篇

2602.21219 2026-08-18 cs.CL cs.AI 版本更新 78%

Reasoning-Based Personalized Generation for Users with Sparse Data

基于推理的稀疏数据用户个性化生成

Bo Ni, Branislav Kveton, Samyadeep Basu, Subhojyoti Mukherjee, Leyao Wang, Franck Dernoncourt, Sungchul Kim, Seunghyun Yoon, Zichao Wang, Ruiyi Zhang, Puneet Mathur, Jihyung Kil, Jiuxiang Gu, Nedim Lipka, Yu Wang, Ryan A. Rossi, Tyler Derr

机构 * Vanderbilt University(范德比尔特大学) Adobe Research(Adobe研究) Yale University(耶鲁大学) University of Oregon(俄勒冈大学)

专题命中 个性化与一致性 :personalized generation(title,abstract)

AI总结 GraSPer通过预测用户未来交互并生成文本来增强稀疏上下文中的个性化生成,提升用户个性化输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21689 2026-08-18 cs.GR cs.CV cs.HC cs.MM 67%

StyleID: A Perception-Aware Dataset and Metric for Stylization-Agnostic Facial Identity Recognition

StyleID:一种用于风格无关面部身份识别的感知感知数据集与指标

Kwan Yun, Changmin Lee, Ayeong Jeong, Youngseo Kim, Seungmi Lee, Junyong Noh

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 针对当前身份编码器在风格化下的脆弱性问题,提出StyleID数据集与评估框架,微调语义编码器使其与人类感知对齐,提升了身份识别的相关性与鲁棒性。

Comments SIGGRAPH 2026 / ACM TOG. Project page at https://kwanyun.github.io/StyleID_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16114 2026-08-18 cs.CV 版本更新 57%

Towards In-Context Tone Style Transfer with A Large-Scale Triplet Dataset

面向大规模三元数据集的上下文内调色风格迁移

Yuhai Deng, Huimin She, Wei Shen, Meng Li, Ruoxi Wu, Lunxi Yuan, Xiang Li

机构 * VCIP, School of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学) Nankai International Advanced Research Institute (Shenzhen Futian)(南开国际先进研究院(深圳福田)) OPPO AI Center, OPPO Inc.(OPPO AI中心,OPPO公司)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出ICTone框架,通过上下文内联合条件生成实现调色风格迁移,利用生成模型语义先验提升风格一致性和视觉质量。

Comments ECCV2026, https://dengyuhai.github.io/ICTone_Project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07546 2026-08-18 cs.CV 版本更新 57%

PickStyle: Video-to-Video Style Transfer with Context-Style Adapters

PickStyle:基于上下文-风格适配器的视频到视频风格迁移

Soroush Mehraban, Vida Adeli, Jacob Rommann, Kyryl Truskovskyi, Harrison Sanborn, Babak Taati, Cole Clifford

机构 * Pickford AI University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 PickStyle是一种视频到视频风格迁移框架,通过在预训练视频扩散骨干中插入低秩适配器、构建合成训练片段并提出CS-CFG,实现了优于现有基线的视频风格迁移效果。

Comments Accepted to the European Conference on Computer Vision (ECCV) 2026 Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 5 篇

2608.16765 2026-08-18 cs.CV cs.AI 新提交 79%

TRACE-Bench: Decomposing and Diagnosing Multi-Reference Image Generation

TRACE-Bench:多参考图像生成的分解与诊断

Haoran Wang, Chaofan Ma, Ran Yi, Lizhuang Ma

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV

AI总结 研究针对多参考图像生成基准的缺陷,构建TRACE-Bench基准,采用算子分解方法评估9个主流模型,发现解耦与属性绑定是核心瓶颈,最优模型属性保真度仅0.74

Comments Accepted to ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16259 2026-08-18 cs.CV cs.AI 新提交 57%

Defake-o3: From Speculative Rationales to Verifiable Evidence for Explainable AIGI Detection

Defake-o3:从推测性理由到可验证证据的可解释AIGI检测

Bowen Deng, Jiahui Zhan, Yikun Ji, Haozhen Yan, Jianfu Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 Defake-o3是结合交互式视觉搜索与证据验证器的可解释AIGI检测器,构建了GroundFake数据集和FakeFrontier基准,在多基准上同时提升了AIGI检测准确率与解释质量。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15029 2026-08-18 cs.CV 新提交 57%

Generation of Synthetic Fingerphotos with GANs

基于生成对抗网络(GANs)的合成指纹照片生成

Conor Miller-Lynch, Sandip Purnapatra, Syed Konain Abbas, Lambert Igene, Faraz Hussain, Soumyabrata Dey, Stephanie Schuckers

机构 * Clarkson University(克拉克森大学) UNC Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 该研究针对非接触式指纹数据不足与真实数据安全风险问题,用StyleGAN2-ADA和StyleGAN3生成合成指纹照片并评估其真实性、隐私性与多样性,为后续评估提供定量基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00062 2026-08-18 eess.IV cs.LG 版本更新 50%

RETO: A Rotary-Enhanced Transformer Operator for High-Fidelity Prediction of Automotive Aerodynamics

RETO:一种增强旋转的Transformer操作符用于汽车气动性能的高保真预测

Bojun Zhang, Huiyu Yang, Yunpeng Wang, Yuntian Chen, Yuanwei Bin, Rikui Zhang, Jianchun Wang

机构 * Department of Mechanics and Aerospace Engineering, Southern University of Science and Technology(南方科技大学机械与航空航天工程系) Shenzhen Key Laboratory of Complex Aerospace Flows, Southern University of Science and Technology(深圳复杂航空航天流动重点实验室) Ningbo Key Laboratory of Advanced Manufacturing Simulation, Eastern Institute of Technology(宁波先进制造模拟重点实验室) Shenzhen Tenfong Science and Technology Co., Ltd.(深圳天丰科技有限公司)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本文提出RETO操作符,通过双阶段空间意识机制提升汽车气动预测精度,实验显示其在ShapeNet和DrivAerML数据集上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21116 2026-08-18 cs.HC cs.AI cs.CL 50%

Creativity in LLM-based Multi-Agent Systems: A Survey

Yi-Cheng Lin, Kang-Chieh Chen, Zhe-Yan Li, Tzu-Heng Wu, Tzu-Hsuan Wu, Kuan-Yu Chen, Hung-yi Lee, Yun-Nung Chen

专题命中 图像生成评测 :image generation(abstract)

Comments 23 pages

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025), pages 27572-27595

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 9 篇

2608.14961 2026-08-18 cs.ET 新提交 78%

Conditional Dynamical Systems for Image Generation

用于图像生成的条件动力系统

Lianlong Sun, Chuan Liu, Tong Geng, Michael Huang

专题命中 效率与蒸馏 :image generation(title,abstract)

AI总结 该研究开发了用于图像生成的连续动力系统,引入能量倾斜实现条件生成,在CIFAR-10上取得9.71的干净FID,为非GPU的高效生成任务提供了新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16451 2026-08-18 hep-lat cond-mat.dis-nn nucl-th physics.comp-ph 新提交 78%

Jump-Diffusion Stochastic Quantization for Euclidean Lattice Field Theories

欧几里得格场论的跳扩散随机量化方法

Alexander Rothkopf

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 该研究提出跳扩散随机量化方法,利用跳扩散过程的非连续路径特性改善遍历性,解决二维U(1)规范理论拓扑冻结的基准问题。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27377 2026-08-18 cs.CV cs.CL cs.LG 版本更新 70%

DanceOPD: On-Policy Generative Field Distillation

DanceOPD:在策略生成场蒸馏

Wei Zhou, Xiongwei Zhu, Zelin Xu, Bo Dong, Lixue Gong, Yongyuan Liang, Meng Chu, Leigang Qu, Lingdong Kong, Wei Liu, Tat-Seng Chua

机构 * ByteDance Seed(字节跳动Seed) NUS(新加坡国立大学) UMD(马里兰大学) HKUST(香港科技大学)

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出DanceOPD框架,通过将每个样本路由到能力场并查询低噪声学生诱导状态,用速度MSE损失训练流匹配模型,实现文本到图像、局部编辑和全局编辑的多能力组合,提升目标能力同时保持生成质量。

Comments Technical Report; 42 pages, 14 figures, 9 tables; Project Page at https://danceopd.github.io/ GitHub Repo at https://github.com/worldbench/DanceOPD

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14783 2026-08-18 cs.CV cs.GR 新提交 62%

MegaParts: Scaling Part-Aware 3D Object Generation to 300 Parts via Token-Efficient Autoregressive Modeling

MegaParts:通过令牌高效自回归建模将部件感知三维物体生成扩展至300个部件

Manwen Liao, Xinyu Lian, Jian Mao, Kaixu Chen, Li Luo, Jinghao Yan, Wanshui Gan, Qiao Yu, Weitian Zhang, Chunhua Shen, Guang Chen, Bo Dai, Xudong Xu, Zhaoyang Lyu

机构 * The University of Hong Kong(香港大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Tongji University(同济大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 MegaParts提出结合结构化序列建模与令牌高效矢量量化形状令牌化器的自回归框架,将部件感知3D生成扩展至300个部件,性能优于基线模型,为大规模部件感知3D生成提供新方案。

Comments 12 pages, 6 pages appendix, 13 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16585 2026-08-18 cs.CV 新提交 57%

SQuad: Sub-Quadratic Attention Distillation for Efficient Video Generation

SQuad:用于高效视频生成的次二次注意力蒸馏

Animesh Karnewar, Denis Korzhenkov, Amirhossein Habibian, Mohsen Ghafoorian

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对视频扩散Transformer自注意力的二次复杂度瓶颈,提出SQuad次二次注意力蒸馏框架,通过两阶段蒸馏适配预训练模型,在保持生成质量的同时大幅提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15522 2026-08-18 cs.CV 新提交 57%

Efficient Audio-Visual Generation via Synchrony-Aware Cross-Modal Sparse Attention

基于同步感知跨模态稀疏注意力的高效视听生成

Shengchuan Gao, Teng Hu, Bohao Feng, Luchen Li, Wenqiang Wang, Hongqian Deng, Ran Yi

机构 * Alibaba Group(阿里巴巴集团) Alibaba Cloud Computing(阿里巴巴云计算) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出同步感知加速框架,通过受保护的稀疏注意力策略在保留视听生成质量与同步性的同时提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02474 2026-08-18 cs.CV 版本更新 57%

EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation

EchoCache:面向高效音频驱动视频生成的能量引导跨模态缓存

Jiayu Chen, Xiaoyu Wu, Rongshan Gao, Maoliang Li, Zihao Zheng, Xinhao Sun, Hailong Zou, Guojie Luo, Xiang Chen

机构 * Peking University(北京大学) Taiyuan University of Technology(太原理工大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 EchoCache是一种能量引导跨模态缓存框架,通过利用音频时频能量锚点与动态缓存机制,在保持音频驱动视频生成质量的同时,实现了2.46倍的推理加速,优化了延迟-质量权衡。

Comments EchoCache is honored to be accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09831 2026-08-18 eess.IV cs.CV 版本更新 57%

IMPLICITSTAINER: Resolution Agnostic Data-Efficient Virtual Staining Using Neural Implicit Functions

IMPLICITSTAINER:基于神经隐式函数的无分辨率依赖数据高效虚拟染色

Tushar Kataria, Beatrice Knudsen, Shireen Y. Elhabian

机构 * Kahlert School of Computing, University of Utah(犹他大学卡勒特计算学院) Department of Pathology, University of Utah(犹他大学病理学系)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出IMPLICITSTAINER,通过神经隐式深度学习模型将H&E图像转化为IHC图像,实现无分辨率依赖的高效虚拟染色,提升低数据场景下的鲁棒性与输出确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏