arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Beihang University(北京航空航天大学)

共收录 180
2607.03795 2026-07-07 cs.CV 新提交

InfraNet: Quality-Aware RGB Guidance for Efficient Infrared Object Detection

InfraNet:用于高效红外目标检测的质量感知RGB引导

Zichao Feng, Haodong Zhu, Jingying Yang, Sheng Xu, Yangyang Ren, Yuguang Yang, Xuhui Liu, Juan Zhang, Tian Wang, Linlin Yang, Baochang Zhang

机构 * Beihang University(北京航空航天大学) Zhongguancun Academy(中关村科学城) Communication University of China(中国传媒大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学)

AI总结 针对多模态感知系统在不利视觉条件下目标检测的挑战,提出InfraNet框架,采用非对称架构及质量感知融合模块,设计两种变体,实验表明其在低光等条件下准确且高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03789 2026-07-07 cs.CV 新提交

G$^2$TAM: Geometry Grounded Track Anything Model

G$^2$TAM:几何基础的轨迹任意模型

Chenming Zhu, Peizhou Cao, Jingli Lin, Wenbo Hu, Yunlong Ran, Jiangmiao Pang, Tai Wang, Xihui Liu

机构 * HKU(香港大学) Shanghai AI Lab(上海人工智能实验室) BUAA(北京航空航天大学) SJTU(上海交通大学) UCLA(加州大学洛杉矶分校) ZJU(浙江大学)

AI总结 研究利用现代前馈3D重建模型的空间一致性,提出G$^2$TAM框架,用无序RGB图像或视频进行3D实例跟踪。核心是跨模态空间编码器,还构建数据集,实验表明该模型有多种优势,为交互式空间推理奠定基础。

Comments Accepted by ICML 2026. Project Page:https://zcmax.github.io/projects/G2TAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03283 2026-07-07 cs.AI 新提交

Embodied Operators and Benchmarking: Toward Reusable and Deployable Embodied Intelligence Systems

具身算子与基准测试:迈向可复用和可部署的具身智能系统

Junwu Xiong, Jiaxuan Gao, Wei Chai, Renxing Chen, Yuzhen Li, Yu Guo, Yucheng Guo, Mingxi Luo, Wenyang Ma, Yiyun Mou, Yifei Zhang, Chen Zhou, Yongjian Guo

机构 * JDT Tsinghua University(清华大学) Tianjin University(天津大学) Beihang University(北京航空航天大学)

AI总结 研究具身智能系统中可复用功能模块即具身算子,明确其定义边界、构建分类法,提出多维度基准框架,探讨加速及挑战,为具身智能系统提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02961 2026-07-07 cs.CV cs.CR 新提交

Overloading Large Vision-Language Models for Jailbreaking

通过信息过载对大型视觉语言模型进行越狱攻击

Haoyu Zhang, Yangyang Guo, Mohan Kankanhalli

机构 * National University of Singapore(新加坡国立大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

AI总结 研究大型视觉语言模型易受越狱攻击问题,提出基于递归图像排版布局的信息过载方法,含大量文本和多维图像攻击,大幅提升攻击成功率,凸显此为现实部署安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02928 2026-07-07 cs.LG 新提交

CoFEND: A Cross-Modal Fusion End-to-End Network for Cold-Start Drug-Drug Interaction Prediction

CoFEND:用于冷启动药物-药物相互作用预测的跨模态融合端到端网络

Di Wu, Hongyi Sun, Haichao Xu, Jia Chen, Zhong Chen, Jie Yang

机构 * College of Computer and Information Science, Southwest University(西南大学计算机与信息科学学院) Beihang University(北京航空航天大学) School of Computing, Southern Illinois University Carbondale(南伊利诺伊大学卡本代尔分校计算机学院) School of Physics and Electronic Science, Zunyi Normal University(遵义师范学院物理与电子科学学院)

AI总结 针对新药冷启动药物-药物相互作用预测难题,提出CMF-ELN。利用多模态信息构建知识图谱,设计图自动编码器融合跨模态相似性,采用两阶段可解释性方案,提升预测准确性与机制解释性。

Comments 11 pages, 2 figures, accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02840 2026-07-07 cs.RO 新提交

TACO: TActile World Model as a Self-COrrector forScalable VLA Post-Training

TACO:作为可扩展VLA训练后自校正器的触觉世界模型

Shengbang Liu, Yueru Jia, Yuyang Yan, Jiaming Liu, Xinran Zhang, Qiuxuan Feng, Yandong Guo, Shiji Zhou, Boxin Shi, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理技术国家重点实验室) AI 2 Robotics(人工智能与机器人研究所) Sun Yat-sen University(中山大学) Beihang University(北京航空航天大学)

AI总结 研究VLA模型在接触丰富任务中的问题,提出TACO框架,通过触觉感知世界模型驱动可扩展VLA训练后校正,结合多种方法提升策略,实验表明其能显著提高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02646 2026-07-07 cs.RO cs.CV 新提交

EVA-Client: A Unified Data Collection, Inference, and Deployment Framework for Embodied Policies on Real Robots

EVA-Client:用于真实机器人上具身策略的统一数据收集、推理和部署框架

Heqing Yang, Yang Yi, Liyao Wang, Linqing Zhong, Donglin Yang, Ruipu Wu, Zitong Bai, Fengjiao Chen, Manyuan Zhang, Linjiang Huang, Si Liu

机构 * CoLab, Beihang University(协同实验室,北京航空航天大学)

AI总结 介绍EVA-Client框架,它位于策略服务器和物理硬件之间,统一策略迭代循环的真实机器人阶段。贡献包括组件解耦架构、可检查执行及每次评估兼具数据收集功能,还整合多种实时推理策略。

Comments https://colalab.net/projects/eva-client

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02520 2026-07-07 cs.CY cs.AI cs.SE 新提交

AutoResearch: An Execution-Grounded Multi-Agent Framework for Reliable Research Workflow Automation

AutoResearch:用于可靠研究工作流程自动化的基于执行的多智能体框架

Rajesh Kumar, Waqar Ali, Junaid Ahmed, Abdullah Aman Khan, Shaoning Zeng

机构 * International Research Center for Complexity Sciences(国际复杂性科学研究中心) Hangzhou International Innovation Institute, Beihang University(杭州国际创新研究院,北京航空航天大学) Department of Computer Science, College of Science, Mathematics and Technology(科学、数学与技术学院计算机科学系) Wenzhou-Kean University(温州-凯恩大学) Computer Systems Engineering Department, Sukkur IBA University(苏库尔IBA大学计算机系统工程系) Yangtze Delta Region Institute (Huzhou), University of Electronic Science and Technology of China(长江三角洲地区研究所(湖州),中国电子科学科技大学)

AI总结 研究针对自动化研究智能体常无法验证实验执行及引用等问题,提出AutoResearch框架,结合多种技术,经实验验证其在多方面提升了研究工件的质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01392 2026-07-07 cs.CL 新提交

Multi-Objective Exploration and Preference Optimization via Mutual Information

基于互信息的多目标探索与偏好优化

Hongyan Xie, Yikun Ban, Ruiyu Fang, Zixuang Huang, Deqing Wang, Jianxin Li, Shuangyong Song

机构 * School of Computer, Beihang University(北京航空航天大学计算机学院) Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰AGI实验室,中国电信人工智能技术(北京)有限公司)

AI总结 提出MI-EPO框架,通过最大化生成响应、偏好反馈和偏好向量的联合条件互信息,统一多目标探索与对齐,实现可控且稳定的多目标权衡。

Comments Accepted at ECML/PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25312 2026-07-07 cs.CV 新提交

LEVIRDet: A Million-Scale 159-Category Dataset and Foundation Model for Universal Remote Sensing Object Detection

LEVIRDet: 用于通用遥感目标检测的百万级159类数据集与基础模型

Qinzhe Yang, Dongyu Wang, Haohan Niu, Jia Xu, Zhenwei Shi, Zhengxia Zou

机构 * Shen Yuan Honors College, Beihang University(北京航空航天大学沈元荣誉学院) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) Qian Xuesen Laboratory of Space Technology, China Academy of Space Technology(中国空间技术研究院钱学森空间技术实验室)

AI总结 提出包含159类、256万边界框的遥感目标检测数据集LEVIRDet-159,并设计尺度层次感知检测基础模型LEVIRDetNet,在9个外部基准上无需微调即达到SOTA,平均mAP提升5.02。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02118 2026-07-03 cs.AI 新提交

Enhancing Fitness Intelligence through Domain-Specific LLM Post-Training

通过领域特定的大语言模型后训练增强健身智能

Xingtao Zhao, Tian Yang, Han Jiang

机构 * School of Cyber Science and Technology(网络科学与技术学院) Beihang University(北京航空航天大学) School of Information(信息学院) Renmin University of China(中国人民大学)

AI总结 针对通用大语言模型在科学健身教练中领域知识不足的问题,提出FitOne系列模型,通过三阶段后训练(持续预训练、监督微调、强化学习)提升专业能力,在ACSM-EP和NSCA-CSCS考试中平均提升最高12.73%。

Comments 8 pages, 6 tables, 2 figures. Accepted by the 12th International Conference on Big Data Computing and Communications (BigCom 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01658 2026-07-03 cs.CV 新提交

Teaching Vision-Language-Action Models What to See and Where to Look

教视觉-语言-动作模型看什么和看哪里

Yuguang Yang, Canyu Chen, Zhewen Tan, Yizhi Wang, Zichao Feng, Chunyang Liu, Kehua Sheng, Juan Zhang, Linlin Yang, Baochang Zhang, Yan Wang, Bo Zhang, Xianbin Cao

机构 * School of Electronic Information Engineering, Beihang University(北京航空航天大学电子信息工程学院) National College for Excellent Engineers, Beihang University(北京航空航天大学卓越工程师学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) DiDi(滴滴出行) State Key Laboratory of Media Convergence and Communication, Communication University of China(中国传媒大学媒体融合与传播国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) School of Cyber Science and Technology, Beihang University(北京航空航天大学网络安全科学与技术学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)

AI总结 提出DriveTeach-VLA框架,通过驾驶感知视觉蒸馏和2D轨迹引导提示,教VLA模型关注驾驶相关区域,实现端到端自动驾驶轨迹预测,在NAVSIM和nuScenes上达到最优性能。

Comments The paper has been accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01642 2026-07-03 cs.CV 新提交

Multi-Resolution Flow Matching: Training-Free Diffusion Acceleration via Staged Sampling

多分辨率流匹配:通过分阶段采样实现无训练扩散加速

Xingyu Zheng, Xianglong Liu, Yifu Ding, Weilun Feng, Junqing Lin, Jinyang Guo, Haotong Qin

机构 * State Key Laboratory of Complex & Critical Software Environment, Beihang University(北京航空航天大学复杂关键软件环境国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Nanyang Technological University(南洋理工大学) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ETH Zürich(苏黎世联邦理工学院)

AI总结 提出MrFlow,一种基于分阶段低到高分辨率管道的无训练多分辨率加速策略,利用低分辨率采样减少计算量,像素空间超分辨率和高频重采样保持质量,实现10倍加速且质量损失小于1%。

Comments The code is available at https://github.com/Xingyu-Zheng/MrFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00965 2026-07-02 cs.CV 新提交

Slope-Guided Mamba and Angular-Refined Transformer for Light Field Super-Resolution

斜率引导的Mamba和角度精炼的Transformer用于光场超分辨率

Li Jin, Jian Huang, Junde Lu, Shuai Wang, Hao Sheng, Jie Wu

机构 * Hangzhou International Innovation Institute of Beihang University(北京航空航天大学杭州国际创新研究院)

AI总结 提出SMART混合网络,通过斜率引导的Mamba和角度精炼的Transformer,解决光场超分辨率中空间-角度解耦和扫描-几何失配问题,在五个基准上取得最优性能。

Comments 10 pages, 4 figures, 4 tables. Accepted by IEEE ICME 2026. Hangzhou International Innovation Institute, Beihang University, Hangzhou, China Corresponding author: Jie Wu (jiewu@buaa.edu.cn) Emails: {lijin01, hj, ljd2406107, shuaiwang, shenghao, jiewu}@buaa.edu.cn

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00338 2026-07-02 cs.CV 新提交

DroneFINE: Domain-Aware Parameter-Efficient Fine-Tuning of Vision-Language Detectors for Drone Images

DroneFINE: 面向无人机图像的视觉-语言检测器的域感知参数高效微调

Ke Wu, Yanan Zhang, Yingjie Gao, Wenhao Li, Chenyu Zhou, XinZhu Ma, Jiaxin Chen, Di Huang

机构 * National College for Excellent Engineers, Beihang University, Beijing, China(北京航空航天大学优秀工程师学院) School of Computer Science and Engineering, Beihang University, Beijing, China(北京航空航天大学计算机科学与工程学院) School of Computer Science and Information Engineering, Hefei University of Technology, Hefei, China(合肥工业大学计算机科学与信息工程学院) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室) Innovation Center for Intelligent System Cognition and Decision-Making, Beijing, China(智能系统认知与决策创新中心) Information Science Academy of China Electronics Technology Group Corporation, Beijing, China(中国电子科技集团有限公司信息科学研究院)

AI总结 针对无人机图像与视觉语言模型预训练数据之间的域差异,提出包含HyperAdapter和SemanticGate的域感知参数高效微调方法,在减少可训练参数的同时达到与全微调相当的性能。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00502 2026-07-02 cs.CL 新提交

A Task-State Representation for Long-Horizon Mobile GUI Agents

面向长时程移动GUI代理的任务状态表示

Yujie Zheng, Zikang Liu, Xin Zhao, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) School of Software, Beihang University(北京航空航天大学软件学院)

AI总结 提出任务状态表示(TSR)框架,通过解耦任务状态与屏幕观察,解决长时程移动GUI代理的上下文负担问题,在复杂跨应用任务中成功率提升最高12个百分点。

Comments Preprint. 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27962 2026-07-02 cs.RO 新提交

Building a Scalable, Reproducible, Evaluatable, and Closed-Loop Simulation Environment Foundation for Embodied Intelligence

构建可扩展、可复现、可评估、闭环的具身智能仿真环境基础:面向具身智能训练、评估和数据收集的云原生仿真基础设施

Junwu Xiong, Yongjian Guo, Mingxi Luo, Ning Qiao, Lei Kang, Song Wang, Yince Gao, Chenfeng Gu, Zhen Sun, Haoran Li, Wei Lu, Yucheng Guo, Shuai Di, Xiaodong Bai, Haoran Sun, Jing Long, Jiaxuan Gao, Hui Zhang, Peng Hao, Lu Lu

机构 * AI Infra Team at JDT(京东科技AI基础设施团队) Tsinghua University(清华大学) Peking University(北京大学) Beihang University(北京航空航天大学)

AI总结 提出一种云原生仿真基础设施框架,通过弹性资源调度、容器化仿真等技术,实现大规模、标准化、可复现的具身智能训练、评估与数据收集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32009 2026-07-01 cs.RO 新提交

Human-as-Humanoid: Enabling Zero-Shot Humanoid Learning from Ego-Exo Human Videos with Human-Aligned Embodiments

人类作为人形机器人:通过人类对齐的具身从自我-外部人类视频实现零样本人形机器人学习

Xiaopeng Lin, Ruoqi Yang, Shijie Lian, Zhaolong Shen, Bin Yu, Changti Wu, Haibao Liu, Yuxiang Zhang, Hong Li, Qiyuan Su, Haochen Liu, Xuguo He, Yukun Shi, Cong Huang, Zhirui Zhang, Bojun Cheng, Kai Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DeepCybo ZGCA ZGCI Harbin Institute of Technology(哈尔滨工业大学) Huazhong University of Science and Technology(华中科技大学) Beihang University(北京航空航天大学)

AI总结 提出Human-as-Humanoid框架,通过对齐机器人本体、感知设置和动作标签接口,将大规模人类演示视频转化为可执行的动作监督,实现高自由度人形机器人的零样本学习。

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31844 2026-07-01 cs.RO cs.AI 新提交

Bridging Local Observation and Global Simulation in Closed-Loop Traffic Modeling

闭环交通建模中局部观测与全局仿真的桥接

Ziyan Wang, Tan Xiang, Peng Chen, Xintao Yan

机构 * The University of Hong Kong(香港大学) Beihang University(北京航空航天大学)

AI总结 提出CRAFT框架,通过自监督失败发现和偏好引导的测试时对齐,缓解自回归交通模拟器在闭环部署中的局部-全局上下文不匹配问题,减少碰撞31.2%和交通违规33.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31814 2026-07-01 cs.CV 新提交

Generative Lane Topology Reasoning via Autoregressive Model with Geometry Prior

基于几何先验的自回归模型生成车道拓扑推理

Jiahui Fu, Zehao Huang, Han Li, Naiyan Wang, Si Liu

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

AI总结 提出TopoGPT生成式框架,通过自回归序列建模学习车道图结构的几何先验,解决现有方法端点不一致和遮挡导致图不完整的问题,在OpenLane-V2上提升6.4/11.6个点。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31570 2026-07-01 cs.CV cs.AI 新提交

Mitigating Positional Leakage in 3D Masked Autoencoders for Robust Representation Learning

缓解3D掩码自编码器中的位置泄漏以实现鲁棒表示学习

Xu Yan, Huiqun Wang, Chen Wang, Lei Ren, Di Huang

机构 * SKLCCSE, Beihang University(北京航空航天大学软件开发环境国家重点实验室) SCSE, Beihang University(北京航空航天大学计算机学院) NERCBDS, EIRI, Tsinghua University(清华大学电子工程系智能技术与系统国家重点实验室) SASEE, Beihang University(北京航空航天大学自动化科学与电气工程学院)

AI总结 针对3D掩码自编码器中位置信息过度依赖导致语义表示弱化的问题,提出MPL-MAE框架,通过重校准位置嵌入和门控位置接口模块,平衡空间先验与语义特征,提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31562 2026-07-01 cs.RO 新提交

Stabilization Learning: A Paradigm Transition Bridging Control Theory and Machine Learning

稳定化学习:连接控制理论与机器学习的范式转变

Quan Quan

机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院) Tianmushan Laboratory, Beihang University(北京航空航天大学天目山实验室) Zhongguancun Academy(中关村学院)

AI总结 提出稳定化学习范式,以稳定性为核心目标,融合控制理论与机器学习,通过李雅普诺夫分析、深度特征提取等方法,解决高维非线性系统的控制、观测与识别问题,并构建统一数学框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31487 2026-07-01 cs.RO 新提交

Energy-Optimal Spatial Iterative Learning within a Virtual Tube

虚拟管道内的能量最优空间迭代学习

Chen Min, Shuli Lv, Pengda Mao, Huixin Cao, Li Hong, Quan Quan

机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院) Tianmushan Laboratory, Beihang University(北京航空航天大学天目山实验室)

AI总结 针对无人机续航受限问题,提出一种无模型在线迭代学习框架,通过O(n)复杂度的空间迭代优化降低能耗,在实验中比基于模型的IPOPT快50-60倍。

Comments 9 pages, 7 figures, submitted to RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31467 2026-07-01 cs.CV 新提交

AeroVerse-SatAgent: UAV-Satellite Collaborative Spatial Reasoning Inspired by the Dual Visual Pathway Theory of Cognitive Neuroscience

AeroVerse-SatAgent: 受认知神经科学双视觉通路理论启发的无人机-卫星协同空间推理

Wenyi Zhang, Fanglong Yao, Youzhi Liu, Peng Hu, Zhengqiu Zhu, Chen Gao, Xian Sun, Kun Fu

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) University of Chinese Academy of Sciences(中国科学院大学) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) Key Laboratory of Target Cognition and Application Technology (TCAT), Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院目标认知与应用技术重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机学院)

AI总结 针对单视角感知易受遮挡和视角变化影响的问题,提出受人类视觉双通路机制启发的无人机-卫星协同空间推理模型SatAgent,通过几何感知3D重建编码器、多视角拓扑语义对齐模块和一致性损失,在复杂城市环境中实现鲁棒推理,构建首个大规模协同数据集,性能超越现有模型。

Comments 21 pages, 10 figures and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31249 2026-07-01 cs.CV 新提交

Rethinking the Role of Feature Engineering and Learning Strategies in Few-Shot Hidden Emotion Recognition

重新思考特征工程与学习策略在少样本隐藏情感识别中的作用

Xiaochuan Guo, Jihao Gu, Haixu Liu, Yuxin Liu, Qi Wang, Yufei Wang, Fei Wang, Kun Li, Dan Guo

机构 * Hefei University of Technology(合肥工业大学) University College London(伦敦大学学院) The University of Sydney(悉尼大学) Beijing QBoson Quantum Technology Co., Ltd.(北京量子芯光科技有限公司) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) Beihang University(北京航空航天大学) The University of New South Wales(新南威尔士大学) United Arab Emirates University(阿拉伯联合酋长国大学)

AI总结 提出跨注意力机制与多实例学习框架,利用多源特征(2D/3D骨架、面部Blendshapes、DINOv2/v3、X-CLIP、Gemini)解决长视频中弱稀疏隐式情感识别,在IJCAI挑战赛Track 3中获第一名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24330 2026-07-01 cs.CV 新提交

REDI-Match: Rotation-Equivariant Distillation for Efficient and Robust Dense Matching

REDI-Match: 旋转等变蒸馏实现高效鲁棒密集匹配

Yinji Ge, Guixu Zheng, Wulong Guo, Qian Feng, Xu Wu, Kai Zhou, Xinyuan Liu, Fei Xing

机构 * Tsinghua University(清华大学) Southern University of Science and Technology(南方科技大学) Beihang University(北京航空航天大学) Zhejiang University(浙江大学)

AI总结 提出REDI-Match框架,通过旋转等变蒸馏将视觉基础模型的语义知识注入轻量等变编码器,结合熵驱动空间对齐模块,在密集匹配中实现高效鲁棒的旋转不变性,在SatAst数据集上提升13.89%姿态精度且速度提升1.9倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28144 2026-06-29 cs.CV 新提交

Monocular Avatar Reconstruction via Cascaded Diffusion Priors and UV-Space Differentiable Shading

基于级联扩散先验和UV空间可微分着色的单目虚拟人重建

Hong Li, Minqi Meng, Yanjun Liang, Chongjie Ye, Houyuan Chen, Weiqing Xiao, Xianda Guo, Guojun Lei, Xuhui Liu, Chaojie Yang, Yanlun Peng, Hao Zhao, Baochang Zhang

机构 * Beihang University(北航) Great Wall Motors(长城汽车) CUHK-Shenzhen(香港科技大学深圳研究院) HKUST(香港科技大学) Nanjing University(南京大学) Wuhan University(武汉大学) Zhejiang University(浙江大学) KAUST(王国 Abdullah 基础科学研究院) Tsinghua University(清华大学)

AI总结 提出数据高效框架,利用统一预训练扩散模型的鲁棒先验,通过级联LoRA依次处理纹理补全、去光照和材质分解,结合UV空间可微分BRDF着色损失,从单张野外图像重建高保真可重光照3D虚拟人。

Comments Accepted by ECCV 2026. Project page: https://luh1124.github.io/MARCUS-Avatar-Projectpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27828 2026-06-29 cs.CV 新提交

Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning

Video-MME-Logical: 面向视频时序逻辑推理的受控诊断基准

Hohin Kwan, Hongyu Li, Ray Zhang, Manyuan Zhang, Xianghao Kong, Anyi Rao, Jiahao Xie, Si Liu

机构 * HKUST(香港科技大学) Colab, Beihang University(北京航空航天大学合作实验室) CUHK(香港中文大学)

AI总结 为隔离评估多模态大模型在视频中的时序逻辑推理能力,提出包含五种时序逻辑操作和25个细粒度任务类别的受控基准,通过控制时间跨度和推理复杂度进行难度可控评估,并支持中间状态诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27779 2026-06-29 cs.CV 新提交

MindFlow: Harmonizing Cognitive Semantics and Acoustic Dynamics for Facial Animation Generation in Dyadic Conversations

MindFlow:调和认知语义与声学动态的对话面部动画生成

Hejia Chen, Haoxian Zhang, Xu He, Xiaoqiang Liu, Pengfei Wan, Shoulong Zhang, Shuai Li

机构 * Beihang University(北京航空航天大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Zhongguancun Laboratory(中关村实验室)

AI总结 提出双路径生成框架MindFlow,受神经科学腹侧-背侧通路模型启发,通过Chunk-State方法建模上下文感知情感状态链,结合条件自回归流匹配网络与选择性声学注入器,实现高保真面部动画,在语义适切性和运动自然度上超越现有方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24506 2026-06-29 cs.DC cs.AI cs.LG cs.PF 新提交

CrossPool: Efficient Multi-LLM Serving for Cold MoE Models through KV-Cache and Weight Disaggregation

CrossPool: 通过KV缓存和权重分离实现冷MoE模型的高效多LLM服务

Zhuoren Ye, Tianyu Wo, Dinghao Xue, Mingming Zhang, Yuchen Teng, Chunming Hu, Renyu Yang

机构 * School of Software, Beihang University(北京航空航天大学软件学院)

AI总结 针对冷MoE模型权重与KV缓存竞争GPU内存的问题,提出CrossPool引擎,将FFN权重和KV缓存分离到不同内存池,结合规划器、虚拟化器和流水线调度器,显著提升内存利用率和长上下文支持,P99 TBT降低达10.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏