arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Beihang University(北京航空航天大学)

2026-03-05 至 2026-03-05 共收录 6
2603.04307 2026-03-05 cs.CV

Dual Diffusion Models for Multi-modal Guided 3D Avatar Generation

多模态引导的3D人像生成双扩散模型

Hong Li, Yutang Feng, Minqi Meng, Yichen Yang, Xuhui Liu, Baochang Zhang

机构 * Beihang University(北航大学) KAUST(卡塔尔科技大学)

AI总结 本文提出PromptAvatar,通过双扩散模型实现多模态引导的3D人像生成,提升生成质量与效率。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04302 2026-03-05 cs.CV

Motion Manipulation via Unsupervised Keypoint Positioning in Face Animation

通过无监督关键点定位实现面部动画中的运动操控

Hong Li, Boyu Liu, Xuhui Liu, Baochang Zhang

机构 * BUAA(北京航空航天大学) KAUST(卡塔尔大学)

AI总结 本文提出MMFA方法,通过无监督关键点定位解耦身份语义与运动信息,实现可控的面部动画生成与表达操控。

Comments 19 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04135 2026-03-05 cs.LG cs.AI

Unbiased Dynamic Pruning for Efficient Group-Based Policy Optimization

无偏动态剪枝用于高效基于群体的策略优化

Haodong Zhu, Yangyang Ren, Yanjing Li, Mingbao Lin, Linlin Yang, Xuhui Liu, Xiantong Zhen, Haiguang Liu, Baochang Zhang

机构 * Beihang University(北航大学) Zhongguancun Academy(中关村学院) Communication University of China(中国通信大学)

AI总结 DPPO通过动态剪枝和重要性采样修正,实现高效基于群体的策略优化,提升训练速度并提高准确率。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08269 2026-03-05 cs.CV

Re-coding for Uncertainties: Edge-awareness Semantic Concordance for Resilient Event-RGB Segmentation

不确定性重编码:面向鲁棒事件-RGB分割的边缘感知语义一致性

Nan Bao, Yifan Zhao, Lin Zhu, Jia Li

机构 * State Key Laboratory of Virtual Reality Technology and Systems, SCSE & QRI, Beihang University(虚拟现实技术与系统国家重点实验室,SCSE与QRI,北京航空航天大学) School of Computer Science and Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学)

AI总结 本文提出边缘感知语义一致性框架,通过重编码和不确定性优化实现鲁棒的事件-RGB分割,提升极端条件下的分割性能。

Comments Accepted to NeurIPS 2025; code and datasets available at https://github.com/iCVTEAM/ESC

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07181 2026-03-05 cs.RO cs.AI cs.CV

TIGeR: Tool-Integrated Geometric Reasoning in Vision-Language Models for Robotics

TIGeR: 视觉-语言模型中集成工具的几何推理

Yi Han, Enshen Zhou, Shanyu Rong, Jingkun An, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Lu Sheng, Shanghang Zhang

机构 * Beihang University(北洋大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理国家重点实验室)

AI总结 TIGeR通过集成工具实现视觉-语言模型的几何推理,提升机器人操作的精确度。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05091 2026-03-05 cs.CV

Factuality Matters: When Image Generation and Editing Meet Structured Visuals

事实性至关重要:当图像生成与编辑遇见结构化视觉

Le Zhuo, Songhao Han, Yuandong Pu, Boxiang Qiu, Sayak Paul, Yue Liao, Yihao Liu, Jie Shao, Xi Chen, Si Liu, Hongsheng Li

机构 * CUHK MMLab(香港大学多模态实验室) Beihang University(北京航空航天大学) Krea AI(Krea人工智能) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) Hugging Face National University of Singapore(新加坡国立大学) ByteDance(字节跳动) The University of Hong Kong(香港大学)

AI总结 本文提出了一种统一模型,通过整合视觉语言模型和FLUX.1 Kontext,提升结构化视觉生成与编辑的多模态理解与事实准确性。

Comments Accepted by ICLR 2026, Project page: https://structvisuals.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏