arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Beihang University(北京航空航天大学)

2026-06-29 至 2026-06-29 共收录 5
2606.28144 2026-06-29 cs.CV 新提交

Monocular Avatar Reconstruction via Cascaded Diffusion Priors and UV-Space Differentiable Shading

基于级联扩散先验和UV空间可微分着色的单目虚拟人重建

Hong Li, Minqi Meng, Yanjun Liang, Chongjie Ye, Houyuan Chen, Weiqing Xiao, Xianda Guo, Guojun Lei, Xuhui Liu, Chaojie Yang, Yanlun Peng, Hao Zhao, Baochang Zhang

机构 * Beihang University(北航) Great Wall Motors(长城汽车) CUHK-Shenzhen(香港科技大学深圳研究院) HKUST(香港科技大学) Nanjing University(南京大学) Wuhan University(武汉大学) Zhejiang University(浙江大学) KAUST(王国 Abdullah 基础科学研究院) Tsinghua University(清华大学)

AI总结 提出数据高效框架,利用统一预训练扩散模型的鲁棒先验,通过级联LoRA依次处理纹理补全、去光照和材质分解,结合UV空间可微分BRDF着色损失,从单张野外图像重建高保真可重光照3D虚拟人。

Comments Accepted by ECCV 2026. Project page: https://luh1124.github.io/MARCUS-Avatar-Projectpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27828 2026-06-29 cs.CV 新提交

Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning

Video-MME-Logical: 面向视频时序逻辑推理的受控诊断基准

Hohin Kwan, Hongyu Li, Ray Zhang, Manyuan Zhang, Xianghao Kong, Anyi Rao, Jiahao Xie, Si Liu

机构 * HKUST(香港科技大学) Colab, Beihang University(北京航空航天大学合作实验室) CUHK(香港中文大学)

AI总结 为隔离评估多模态大模型在视频中的时序逻辑推理能力,提出包含五种时序逻辑操作和25个细粒度任务类别的受控基准,通过控制时间跨度和推理复杂度进行难度可控评估,并支持中间状态诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27779 2026-06-29 cs.CV 新提交

MindFlow: Harmonizing Cognitive Semantics and Acoustic Dynamics for Facial Animation Generation in Dyadic Conversations

MindFlow:调和认知语义与声学动态的对话面部动画生成

Hejia Chen, Haoxian Zhang, Xu He, Xiaoqiang Liu, Pengfei Wan, Shoulong Zhang, Shuai Li

机构 * Beihang University(北京航空航天大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Zhongguancun Laboratory(中关村实验室)

AI总结 提出双路径生成框架MindFlow,受神经科学腹侧-背侧通路模型启发,通过Chunk-State方法建模上下文感知情感状态链,结合条件自回归流匹配网络与选择性声学注入器,实现高保真面部动画,在语义适切性和运动自然度上超越现有方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24506 2026-06-29 cs.DC cs.AI cs.LG cs.PF 新提交

CrossPool: Efficient Multi-LLM Serving for Cold MoE Models through KV-Cache and Weight Disaggregation

CrossPool: 通过KV缓存和权重分离实现冷MoE模型的高效多LLM服务

Zhuoren Ye, Tianyu Wo, Dinghao Xue, Mingming Zhang, Yuchen Teng, Chunming Hu, Renyu Yang

机构 * School of Software, Beihang University(北京航空航天大学软件学院)

AI总结 针对冷MoE模型权重与KV缓存竞争GPU内存的问题,提出CrossPool引擎,将FFN权重和KV缓存分离到不同内存池,结合规划器、虚拟化器和流水线调度器,显著提升内存利用率和长上下文支持,P99 TBT降低达10.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23686 2026-06-29 cs.RO 新提交

LIBERO-Safety: A Comprehensive Benchmark for Physical and Semantic Safety in Vision-Language-Action Models

LIBERO-Safety:视觉-语言-动作模型中物理与语义安全的综合基准

Rongxu Cui, Zongzheng Zhang, Jingrui Pang, Haohan Chi, Jinbang Guo, Saining Zhang, Shaoxuan Xie, Xin Jin, Yao Mu, Jiaolong Yang, Guocai Yao, Xianyuan Zhan, Ya-Qin Zhang, Hao Zhao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Beijing Academy of Artificial Intelligence (BAAI)(北京智源人工智能研究院) Beihang University(北京航空航天大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学) Shanghai Jiao Tong University(上海交通大学) Microsoft Research Asia (MSRA)(微软亚洲研究院)

AI总结 针对视觉-语言-动作模型操作安全未验证的问题,提出参数化安全基准和关键帧驱动数据生成流水线,构建大规模无碰撞数据集,系统评估八种模型,揭示泛化-安全张力。

Comments Accepted by ECCV 2026, Project Page: https://libero-safety.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏