arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Fudan University(复旦大学)

2026-03-13 至 2026-03-13 共收录 6
2603.12257 2026-03-13 cs.CV

DreamVideo-Omni: Omni-Motion Controlled Multi-Subject Video Customization with Latent Identity Reinforcement Learning

DreamVideo-Omni: 基于潜在身份强化学习的多主体视频定制与 Omni-运动控制

Yujie Wei, Xinyu Liu, Shiwei Zhang, Hangjie Yuan, Jinbo Xing, Zhekai Chen, Xiang Wang, Haonan Qiu, Rui Zhao, Yutong Feng, Ruihang Chu, Yingya Zhang, Yike Guo, Xihui Liu, Hongming Shan

机构 * Fudan University(复旦大学) The Hong Kong University of Science and Technology(香港科技大学) Tongyi Lab, Alibaba Group(阿里云实验室) Zhejiang University(浙江大学) MMLab, The University of Hong Kong(香港大学MMLab) Nanyang Technological University(南洋理工大学) Show Lab, National University of Singapore(新加坡国立大学Show Lab)

AI总结 DreamVideo-Omni通过渐进式两阶段训练范式,实现多主体视频定制与Omni-运动控制,采用条件感知嵌入和分层运动注入策略,提升身份保持与运动控制精度。

Comments Project Page: https://dreamvideo-omni.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12247 2026-03-13 cs.CV

Trust Your Critic: Robust Reward Modeling and Reinforcement Learning for Faithful Image Editing and Generation

相信你的批评者:用于忠实图像编辑和生成的鲁棒奖励建模与强化学习

Xiangyu Zhao, Peiyuan Zhang, Junming Lin, Tianhao Liang, Yuchen Duan, Shengyuan Ding, Changyao Tian, Yuhang Zang, Junchi Yan, Xue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) BUPT(北京邮电大学) CUHK(香港中文大学) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 本文提出FIRM框架,通过定制数据集和鲁棒奖励模型,提升图像编辑和生成的忠实性与指令遵循,采用'基础与奖励'策略平衡一致性与质量,实现性能突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12008 2026-03-13 cs.CV

CrossEarth-SAR: A SAR-Centric and Billion-Scale Geospatial Foundation Model for Domain Generalizable Semantic Segmentation

跨地球雷达:一种以雷达为中心的十亿级地理空间基础模型,用于领域通用的语义分割

Ziqi Ye, Ziyang Gong, Ning Liao, Xiaoxing Hu, Di Wang, Hongruixuan Chen, Chen Huang, Yiguo He, Yuru Jia, Xiaoxing Wang, Haipeng Wang, Xue Yang, Junchi Yan

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Beijing Institute of Technology(北京理工大学) Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) The University of Tokyo(东京大学) Sun Yat-sen University(中山大学) KU Leuven(比利时鲁汶大学) KTH(皇家理工学院)

AI总结 CrossEarth-SAR是一种基于雷达的十亿级地理空间基础模型,通过物理引导的稀疏专家混合架构实现跨域语义分割的领域泛化,通过大规模预训练和基准测试验证其有效性。

Comments 26 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11627 2026-03-13 cs.CV

Developing Foundation Models for Universal Segmentation from 3D Whole-Body Positron Emission Tomography

开发用于从3D全身正电子发射断层扫描进行通用分割的基础模型

Yichi Zhang, Le Xue, Wenbo Zhang, Lanlan Li, Feiyang Xiao, Yuchen Liu, Xiaohui Zhang, Hongwei Zhang, Shuqi Wang, Gang Feng, Liling Peng, Xin Gao, Yuanfan Xu, Yuan Qi, Kuangyu Shi, Hong Zhang, Yuan Cheng, Mei Tian, Zixin Hu

机构 * Artificial Intelligence Innovation and Incubation Institute, Fudan University, Shanghai, China(复旦大学人工智能创新与孵化院,上海,中国) Shanghai Academy of Artificial Intelligence for Science, Shanghai, China(上海人工智能科学研究院,上海,中国) Department of Nuclear Medicine and PET Center, Huashan Hospital, Fudan University, Shanghai, China(复旦大学华山医院核医学科与PET中心) Human Phenome Institute, Fudan University, Shanghai, China(复旦大学人类表型研究院) Department of Nuclear Medicine, Zhejiang Cancer Hospital, Hangzhou Institute of Medicine, Chinese Academy of Sciences, Hangzhou, China(浙江省肿瘤医院核医学科,杭州医学院,中国科学院,杭州,中国) Shanghai Universal Medical Imaging Diagnostic Center, Shanghai, China(上海通用医学影像诊断中心,上海,中国) Hangzhou Universal Medical Imaging Diagnostic Center, Hangzhou, China(杭州通用医学影像诊断中心,杭州,中国) Department of Information and Intelligence Development, Zhongshan Hospital, Fudan University, Shanghai, China(复旦大学中山医院信息与智能发展科) Department of Nuclear Medicine, Inselspital, University of Bern, Switzerland(伯尔尼大学Inselspital核医学科,瑞士)

AI总结 本文提出SegAnyPET模型,通过构建大规模PET数据集,实现通用分割任务的高效处理,适用于多种医学影像分割需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08064 2026-03-13 cs.CV

Evaluating Generative Models via One-Dimensional Code Distributions

通过一维代码分布评估生成模型

Zexi Jia, Pengcheng Luo, Yijia Zhong, Jinchao Zhang, Jie Zhou

机构 * WeChat AI, Tencent Inc.(腾讯微信AI) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院)

AI总结 本文提出基于离散视觉令牌空间的生成模型评估方法,引入CHD和CMMS两个度量标准,并构建VisForm基准以验证其在不同数据集上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13108 2026-03-13 cs.CV cs.AI cs.RO

DriveCritic: Towards Context-Aware, Human-Aligned Evaluation for Autonomous Driving with Vision-Language Models

DriveCritic: 向基于情境的、与人类对齐的自动驾驶评估迈进:基于视觉-语言模型

Jingyu Song, Zhenxin Li, Shiyi Lan, Xinglong Sun, Nadine Chang, Maying Shen, Joshua Chen, Katherine A. Skinner, Jose M. Alvarez

机构 * University of Michigan(密歇根大学) NVIDIA(英伟达) Fudan University(复旦大学)

AI总结 DriveCritic通过结合视觉-语言模型和情境意识,提升自动驾驶系统评估的准确性与人类对齐性。

Comments Accepted at ICRA 2026; 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏