arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Beihang University(北京航空航天大学)

共收录 1226
2605.13111 2026-05-14 cs.CV

Pyramid Forcing: Head-Aware Pyramid KV Cache Policy for High-Quality Long Video Generation

金字塔强制:面向高质量长视频生成的头部感知金字塔KV缓存策略

Jiayu Chen, Junbei Tang, Wenbiao Zhao, Maoliang Li, Jiayi Luo, Zihao Zheng, Jiawei Yang, Guojie Luo, Xiang Chen

机构 * Peking University(北京大学) South China University of Technology(华南理工大学) Xinjiang University(新疆大学) Beihang University(北京航空航天大学) Zhongguancun Academy(中关村学院)

AI总结 本文提出Pyramid Forcing,通过识别不同头部类型并分配特定缓存策略,提升长视频生成质量,实验显示在VBench-Long上Self Forcing得分提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12953 2026-05-14 cs.CV cs.AI

Seg-Agent: Test-Time Multimodal Reasoning for Training-Free Language-Guided Segmentation

Seg-Agent: 无训练语言引导分割的测试时多模态推理

Chao Hao, Jun Xu, Ji Du, Shuo Ye, Ziyue Qiao, Xiaodong Cun, Guangcong Wang, Xubin Zheng, Zitong Yu

机构 * School of Computing and Information Technology(计算与信息科技学院) Great Bay University(大湾大学) Hangzhou International Innovation Institute(杭州国际创新研究院) Beihang University(北航大学) Department of Computing(计算系) The Hong Kong Polytechnic University(香港理工大学)

AI总结 Seg-Agent提出无训练的多模态推理框架,通过生成-选择-细化三阶段循环实现视觉区域分割,无需参数更新即可达到与训练方法相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10906 2026-05-14 cs.LG cs.AI

DataMaster: Data-Centric Autonomous AI Research

DataMaster: 以数据为中心的自主AI研究

Yaxin Du, Xiyuan Yang, Zhifan Zhou, Wanxu Liu, Zixing Lei, Zimeng Chen, Fenyi Liu, Haotian Wu, Yuzhu Cai, Zexi Liu, Xinyu Zhu, WenHao Wang, Linfeng Zhang, Chen Qian, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

AI总结 DataMaster通过自主数据工程优化数据侧,提升下游性能,无需改变学习算法。其包含数据树、共享数据池和全局记忆三大组件,有效解决开放搜索空间和延迟验证问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12415 2026-05-14 cs.CL cs.AI

Table-R1: Region-based Reinforcement Learning for Table Understanding

基于区域的表格理解强化学习:Table-R1

Zhenhe Wu, Jian Yang, Zhongjiang He, Changzai Pan, Jie Zhang, Jiaheng Liu, Xianjie Wu, Yu Zhao, Shuangyong Song, Yongxiang Li, Zhoujun Li, Xueling Li

机构 * Beihang University(北京航空航天大学) Xingchen AGI Lab(星辰AGI实验室) China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(中国电信人工智能技术(北京)有限公司) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI))

AI总结 本文提出Table-R1,通过区域证据增强和TARPO优化提升LLM的表格理解能力,在多个数据集上提升14.36个百分点,同时降低响应token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12494 2026-05-13 cs.CV

Revisiting Photometric Ambiguity for Accurate Gaussian-Splatting Surface Reconstruction

重新审视光度歧义以实现高精度高斯-散射表面重建

Jiahe Li, Jiawei Zhang, Xiao Bai, Jin Zheng, Xiaohan Yu, Lin Gu, Gim Hee Lee

机构 * School of Computer Science Engineering, State Key Laboratory of Complex Critical \& Software Environment, Jiangxi Research Institute, Beihang University State Key Laboratory of Virtual Reality Technology Macquarie University Tohoku University School of Computing, National University of Singapore

AI总结 本文提出AmbiSuR框架,通过高斯散射内在解决方案解决光度歧义问题,提升3D表面重建性能,实验显示在多种挑战场景中表现优异。

Comments Accepted at ICML 2026. Project page: https://fictionarry.github.io/AmbiSuR-Proj/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12069 2026-05-13 cs.CV cs.AI cs.LG

Anomaly-Aware Vision-Language Adapters for Zero-Shot Anomaly Detection

面向零样本异常检测的异常感知视觉-语言适配器

Muhammad Aqeel, Maham Nazir, Uzair Khan, Marco Cristani, Francesco Setti

机构 * Dept. of Engineering for Innovation Medicine, University of Verona, Italy(创新医学工程系,威尼斯大学,意大利) School of Computer Science and Engineering, Beihang University, China(计算机科学与工程学院,北航大学,中国) Dept. of Computer Science, Reykjavik University, Iceland(计算机科学系,雷克雅未克大学,冰岛)

AI总结 本文提出AVA-DINO框架,通过双分支适应冻结的DINOv3视觉特征,利用异常数据与正常数据的自然不对称性,实现零样本异常检测的高精度与跨领域泛化能力。

Comments Accepted to ICIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11959 2026-05-13 cs.CV cs.CL

Multimodal Abstractive Summarization of Instructional Videos with Vision-Language Models

基于视觉语言模型的指令视频多模态抽象摘要

Maham Nazir, Muhammad Aqeel, Richong Zhang, Francesco Setti

机构 * Beihang University, Beijing, China(北航大学,北京,中国) University of Verona, Italy(威尼斯大学,意大利)

AI总结 本文提出ClipSum框架,利用冻结的CLIP视觉语言特征进行指令视频摘要,通过显式时间建模和维度自适应融合,实现视觉与语言的语义对齐,实验显示其在YouCook2数据集上表现优于传统方法。

Comments Accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11922 2026-05-13 cs.SE cs.CL

StepCodeReasoner: Aligning Code Reasoning with Stepwise Execution Traces via Reinforcement Learning

StepCodeReasoner: 通过强化学习对齐代码推理与分步执行轨迹

Hao Wang, Rui Li, Lei Sha, Jie M. Zhang

机构 * Beihang University, Beijing, China(北京航空航天大学) Peking University, Beijing, China(北京大学) Zhongguancun Laboratory, Beijing, China(中关村实验室) King's College London, United Kingdom(伦敦国王学院)

AI总结 本文提出StepCodeReasoner框架,通过引入显式的中间执行状态监督,将代码推理转化为可验证的分步执行建模问题,并通过Bi-Level GRPO算法提升结构化信用分配,实验表明其在代码推理和生成任务中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10235 2026-05-13 cs.CL

Route Before Retrieve: Activating Latent Routing Abilities of LLMs for RAG vs. Long-Context Selection

在检索前路由:激活大语言模型的潜在路由能力用于RAG与长上下文选择

Yiwen Chen, Kuan Li, Fuzhen Zhuang, Deqing Wang, Zhao Zhang, Liwen Zhang, Yong Jiang, Shuai Wang, Minhao Cheng

机构 * Beihang University(北航) HKUST(香港科技大学) Alibaba Group(阿里巴巴集团) Pennsylvania State University(宾夕法尼亚州立大学)

AI总结 本文提出Pre-Route框架,通过结构化推理提前决策,利用轻量级元数据进行任务分析和信息需求预测,实现可解释且高效的路由决策,实验表明其在成本效益上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11800 2026-05-13 cs.LG cs.CL

ROMER: Expert Replacement and Router Calibration for Robust MoE LLMs on Analog Compute-in-Memory Systems

ROMER:专家替换与路由校准以实现鲁棒的MoE大语言模型在模拟计算-内存系统中的应用

Wenyong Zhou, Yuannuo Feng, Yizhe Chen, Taiqiang Wu, Wendong Xu, Wenbo Qi, Zhengwu Liu, Wang Kang, Ngai Wong

机构 * The Department of Electrical and Computer Engineering, The University of Hong Kong(香港大学电子与计算机工程系) The School of Integrated Circuit Science and Engineering, Beihang University(北航集成电路科学与工程学院)

AI总结 ROMER通过专家替换和路由校准缓解模拟计算-内存系统中MoE大语言模型的噪声影响,显著降低困惑度。

Comments 11 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11716 2026-05-13 cs.AI

SafeSteer: A Decoding-level Defense Mechanism for Multimodal Large Language Models

SafeSteer: 多模态大语言模型中的解码级防御机制

Xinyi Zeng, Xue Yang, Jingyuan Zhang, Huanqian Yan, Xiang Chen, Kaiwen Wei, Hankun Kang, Yu Tian

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Kuaishou Technology(快手科技) School of Computer Science and Technology, Beihang University(北航计算机科学与技术学院) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Chongqing University(重庆大学) Wuhan University(武汉大学)

AI总结 本文提出SafeSteer,通过解码阶段的轻量探针和模态语义对齐向量,提升多模态大语言模型的安全性,实验表明其能提升33.40%的安全性而不需微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11685 2026-05-13 cs.CL

Robust LLM Unlearning Against Relearning Attacks: The Minor Components in Representations Matter

鲁棒的LLM去学习对抗重新学习攻击:表示中的次要成分至关重要

Zeguan Xiao, Xuanzhe Xu, Yun Chen, Yong Wang, Jian Yang, Yanqing Hu, Guanhua Chen

机构 * Shanghai University of Finance and Economics(上海金融学院) Alibaba Group(阿里巴巴集团) Southern University of Science and Technology(南方科技大学) Beihang University(北航)

AI总结 本文研究了LLM去学习中对抗重新学习攻击的脆弱性,发现现有方法主要优化主导成分,而次要成分更抗反转。提出Minor Component Unlearning方法,通过聚焦稳健方向提升抗攻击能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11402 2026-05-13 cs.LG cs.CR cs.NI

More Than Meets the Eye: A Semantics-Aware Traffic Augmentation Framework for Generalizable Website Fingerprinting

看得更远:一种语义感知的流量增强框架用于可推广的网站指纹识别

Youquan Xian, Xueying Zeng, Lingjia Meng, Lei Cui, Runhan Song, Wei Wang, Zhengquan Ding, Peng Liu, Zhiyu Hao

机构 * School of Cyberspace Security, Beijing University of Posts and Telecommunications, Beijing, China(北京邮电大学信息安全学院) School of Computer Science and Engineering, Beihang University, Beijing, China(北京航空航天大学计算机科学与工程学院) Faculty of Computing, Harbin Institute of Technology, Harbin, China(哈尔滨工业大学计算机学院) School of Computer Science and Engineering, Guangxi Normal University, Guilin, China(广西师范大学计算机科学与工程学院) Zhongguancun Laboratory, Beijing, China(中关村实验室)

AI总结 本文提出SATA框架,通过协议规则增强应用层语义并引入跨层特征对齐机制,提升网站指纹识别在复杂场景下的泛化能力,实验显示其在开放世界设置中显著提升准确率和AUC。

Comments 18 pages, 19 figures, Submitted to NDSS 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07552 2026-05-13 cs.CV

VIMCAN: Visual-Inertial 3D Human Pose Estimation with Hybrid Mamba-Cross-Attention Network

VIMCAN: 基于混合Mamba-交叉注意力网络的视觉-惯性3D人体姿态估计

Zepeng Yang, Junxuan Bai, Hao Li, Ju Dai, Junjun Pan, Yongfeng Yin, Bin Li

机构 * Beihang University(北航) Peng Cheng Laboratory(鹏城实验室) Capital University of Physical Education and Sports(首都体育学院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

AI总结 VIMCAN结合Mamba的高效序列建模与交叉注意力的空间推理,实现RGB关键点与穿戴式IMU数据的鲁棒融合,取得更优精度和实时推理性能。

Comments Accepted in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15103 2026-05-13 cs.MA cs.AI

Vulnerable Agent Identification in Large-Scale Multi-Agent Reinforcement Learning

大规模多智能体强化学习中的脆弱智能体识别

Simin Li, Zihao Mao, Zheng Yuwei, Linhao Wang, Ruixiao Xu, Chengdong Ma, Zhiqian Liu, Xin Yu, Yuqing Ma, Xin Wang, Jie Luo, Bo An, Yaodong Yang, Weifeng Lv, Xianglong Liu

机构 * School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) School of Artificial Intelligence, Beihang University(北航人工智能学院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Institute of Automation, Chinese Academy of Science(中国科学院自动化研究所) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 本文研究大规模多智能体强化学习中的脆弱智能体识别问题,提出通过分层对抗性去中心化均值场控制框架,结合Fenchel-Rockafellar变换和强化学习算法,有效识别脆弱智能体并降低计算复杂度。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10645 2026-05-12 cs.CV

GenMed: A Pairwise Generative Reformulation of Medical Diagnostic Tasks

GenMed:医学诊断任务的成对生成性重述

Hantao Zhang, Weidong Guo, Yuhe Liu, Jiancheng Yang, Sathvik Bhagavan, Danli Shi, Mingda Xu, Pascal Fua

机构 * CVLab, École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL)计算机视觉实验室) Fudan University(复旦大学) Beihang University(北航大学) ELLIS Institute Finland(芬兰ELLIS研究所) Aalto University(艾尔沃斯大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出一种生成性方法,通过扩散模型建模联合分布P(X,Y),在推理时优化输出,支持任意观测组合,实验显示在医学图像分割、少样本分割、退化输入分割、形状补全和零样本应用中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10386 2026-05-12 cs.AI

GuardAD: Safeguarding Autonomous Driving MLLMs via Markovian Safety Logic

GuardAD: 通过马尔可夫安全逻辑保障自动驾驶MLLMs

Tianyuan Zhang, Peng Yue, Zihao Peng, Jiangfan Liu, Zonghao Ying, Jiakai Wang, Tianlin Li, Jian Yang, Yaodong Yang, Aishan Liu, Xianglong Liu

机构 * Beihang University(北航大学) Zhongguancun Laboratory(中关村实验室) Peking University(北京大学)

AI总结 GuardAD通过马尔可夫逻辑形式化提升自动驾驶MLLMs的安全性,减少事故率并提升任务性能,经实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10046 2026-05-12 cs.CV cs.LG cs.MA

PixelFlowCast: Latent-Free Precipitation Nowcasting via Pixel Mean Flows

PixelFlowCast: 无需潜在变量的降水现在预测通过像素均值流

Yufeng Zhu, Chunlei Shi, Yongchao Feng, Dan Niu

机构 * Department of Automation, Southeast University(东南大学自动化系) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室)

AI总结 PixelFlowCast提出一种两阶段概率预测框架,通过确定性模型和KANCondNet提取时空特征,实现高效率和高保真度的降水现在预测,无需潜在变量压缩。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09701 2026-05-12 cs.CV

DriveFuture: Future-Aware Latent World Models for Autonomous Driving

DriveFuture: 用于自动驾驶的面向未来的潜在世界模型

Yufeng Hong, Xiaotian Zhou, Yingyan Li, Xiangpo Zhou, Lin Liu, Yadan Luo, Shaoqing Xu, Lei Yang, Ziying Song

机构 * Beijing Institute of Technology(北京理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beihang University(北航) Beijing Jiaotong University(北京交通大学) The University of Queensland(昆士兰大学) University of Macau(澳门大学) Nanyang Technological University(南洋理工大学) School of Artificial Intelligence ( School of Software), Yanshan University(燕山大学人工智能学院(软件学院))

AI总结 本文提出DriveFuture,一种面向未来的潜在世界建模框架,通过将未来世界状态条件化于当前潜在状态建模过程,提升自动驾驶轨迹规划性能。

Comments 24pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09549 2026-05-12 cs.LG

When Adaptation Fails: A Gradient-Based Diagnosis of Collapsed Gating in Vision-Language Prompt Learning

当适应失效:基于梯度的Collapsed Gating在视觉-语言提示学习中的诊断

Yunxuan Fang, Ziwei Zhang, Xinhe Wang

机构 * Beihang University(北航大学)

AI总结 本文研究了在冻结少样本提示学习中,适应性门控和提示选择模块失效的问题,通过实验发现梯度不平衡和门控退化是主要失效模式,揭示了参数高效学习中适配门控的有效条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09494 2026-05-12 cs.RO cs.AI

LASSA Architecture-Based Autonomous Fault-Tolerant Control of Unmanned Underwater Vehicles

基于LASSA架构的无人水下车辆自主容错控制

Hong Chen, Zixiang Tang, Yuanbao Chen, Yu Liu

机构 * Wuhan Second Ship Design and Research Institute(武汉第二船舶设计研究所) School of Aeronautic Science and Engineering, Beihang University(北航航空科学与工程学院)

AI总结 本文提出基于LASSA架构的无人水下车辆自主容错控制方法,通过LLM识别未知故障并自主规划任务,结合智能代理感知与决策评估, solver验证物理约束,实现高动态决策与高频控制的双闭环协同控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09416 2026-05-12 cs.LG

A Controlled Diagnostic Study of Hardware-Induced Distortions in Hardware-Aware Training

硬件感知训练中硬件诱导失真控制诊断研究

Yunxuan Fang, Xinhe Wang

机构 * Beihang University(北航)

AI总结 本文提出一种诊断框架,分析硬件非理想性对梯度优化的影响,区分可通过HAT补偿的失真与破坏优化的失真,为软硬件协同设计提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25074 2026-05-12 cs.CV

Z-Erase: Enabling Concept Erasure in Single-Stream Diffusion Transformers

Z-Erase:在单流扩散变换器中实现概念擦除

Nanxiang Jiang, Zhaoxin Fan, Baisen Wang, Daiheng Gao, Junhang Cheng, Jifeng Guo, Yalan Qin, Yeying Jin, Hongwei Zheng, Faguo Wu, Wenjun Wu

机构 * Beijing Advanced Innovation Center for Future Blockchain(未来区块链与隐私计算北京创新中心) Privacy Computing, School of Artificial Intelligence, Beihang University(隐私计算,北京航空航天大学人工智能学院) University of Science(科学大学) Shanghai University(上海大学) Tencent(腾讯) Beijing Academy of Blockchain(北京区块链研究院)

AI总结 本文提出Z-Erase,一种专为单流T2I模型设计的概念擦除方法,通过解耦更新和平衡擦除与保留的权衡,解决生成崩溃问题,实现SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16869 2026-05-12 cs.CV

SegviGen: Repurposing 3D Generative Model for Part Segmentation

SegviGen:将3D生成模型重新利用于部件分割

Lin Li, Haoran Feng, Zehuan Huang, Haohua Chen, Wenbo Nie, Shaohua Hou, Keqing Fan, Pan Hu, Sheng Wang, Buyu Li, Lu Sheng

机构 * Renmin University of China(中国人民大学) Tsinghua University(清华大学) Beihang University(北航) Beijing Jiaotong University(北京交通大学) Bambu Lab(Bambu实验室)

AI总结 SegviGen通过利用预训练3D生成模型的结构先验,提出了一种新的高效部件分割框架,实现了交互式分割、完整分割及2D引导分割,实验显示在交互式分割上提升40%,完整分割提升15%,仅使用0.32%标注数据。

Comments Project page: https://fenghora.github.io/SegviGen-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18374 2026-05-12 cs.RO cs.SY eess.SY math.DS

Explicit Bounds on the Hausdorff Distance for Truncated mRPI Sets via Norm-Dependent Contraction Rates

截断mRPI集的Hausdorff距离显式界 via 依赖范数的收缩速率

Jiaxun Sun, Hengyu Xue, Yuyang Zhao

机构 * Department of Mechanical and Process Engineering, ETH Zürich(苏黎世联邦理工学院机械与过程工程系) School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通运输工程学院)

AI总结 本文提出通过依赖范数的收缩速率计算截断mRPI集与无限时间极限之间的Hausdorff距离上界,提供显式的horizon选择规则以保证预定的近似精度。

Comments 6 pages, 5 figures. Accepted at the 2026 IEEE Conference on Control Technology and Applications (CCTA), Vancouver, BC, Canada, August 12-14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08911 2026-05-12 cs.CV

Unified Modeling of Lane and Lane Topology for Driving Scene Reasoning

车道与车道拓扑的统一建模用于驾驶场景推理

Han Li, Yulu Gao, Si Liu, Yuhang Wang, Bo Liu, Beipeng Mu

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) Hangzhou International Innovation Institute, Beihang University(杭州国际创新院,北京航空航天大学) Meituan, Beijing, China(美团,北京,中国)

AI总结 本文提出UniTopo方法,通过统一表示车道及其拓扑关系,实现车道位置和拓扑信息的联合感知,优于现有方法。

Comments Accepted by IEEE TCSVT

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21164 2026-05-12 cs.AI

Concise Geometric Description as a Bridge: Unleashing the Potential of LLM for Plane Geometry Problem Solving

简洁几何描述作为桥梁:释放LLM在平面几何问题求解中的潜力

Jingyun Wang, Dian Li, Xiaohan Wang, Gang Liu, Jiahong Yan, Guoliang Kang

机构 * Beihang University(北航大学)

AI总结 本文提出通过训练多模态大语言模型解释器生成几何描述,再利用通用LLM进行推理,以解决平面几何问题。通过设计CDL匹配奖励机制,提升生成几何描述的效率,并在新构建的Formalgeo7k-Rec-CoT数据集上验证了方法的有效性。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08173 2026-05-12 cs.CV cs.LG

CASISR: Circular Arbitrary-Scale Image Super-Resolution

CASISR: 循环任意尺度图像超分辨率

Honggui Li, Zhengyang Zhang, Dingtai Li, Sinan Chen, Nahid Md Lokman Hossain, Xinfeng Xu, Yinlu Qin, Ruobing Wang, Hantao Lu, Yuting Feng, Maria Trocan, Dimitri Galayko, Amara Amara, Mohamad Sawan

机构 * School of Information and Artificial Intelligence, Yangzhou University(扬州大学信息与人工智能学院) Shanghai Qigong Research Institute, Shanghai University of Traditional Chinese Medicine(上海青工研究院,上海中医药大学) LISITE Research Laboratory, Institut Supérieur d'Électronique de Paris(LISITE研究实验室,巴黎电子高级学院) Laboratoire d'Informatique de Paris 6, Sorbonne University(巴黎第六大学信息学实验室) International Campus (Hangzhou), Beijing University of Aeronautics and Astronautics(北京航空航天大学杭州国际校区) School of Engineering, Westlake University(西湖大学工程学院) Polystim Neurotech Laboratory, Polytechnique Montreal(蒙特利尔Polytechnique神经科技实验室)

AI总结 本文提出CASISR闭环架构,通过建立非线性循环方程提升图像重建能力,实验表明其在分数SR尺度和文本/条纹图像中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07915 2026-05-11 cs.CV

What Matters for Diffusion-Friendly Latent Manifold? Prior-Aligned Autoencoders for Latent Diffusion

潜在扩散 manifold 中什么因素重要?面向潜在扩散的先验对齐自编码器

Zhengrong Yue, Taihang Hu, Mengting Chen, Haiyu Zhang, Zihao Pan, Tao Liu, Zikang Wang, Jinsong Lan, Xiaoyong Zhu, Bo Zheng, Yali Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Beihang University(北航) Sun Yat-sen University(中山大学) Nankai University(南开大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 本文研究潜在 manifold 组织对扩散模型生成质量的影响,提出 PAE 显式构建潜在 manifold,提升训练效率和生成质量,达到新状态的 gFID 1.03。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07877 2026-05-11 cs.RO

Melding LLM and temporal logic for reliable human-swarm collaboration in complex scenarios

将大语言模型与时序逻辑融合以实现复杂场景中可靠的人-群智协作

Junfeng Chen, Yuxiao Zhu, An Zhuo, Xintong Zhang, Shuo Zhang, Guanghui Wen, Xiwang Dong, Meng Guo, Zhongkui Li

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) Division of Natural and Applied Sciences, Duke Kunshan University(杜克昆山大学自然与应用科学学院) School of Automaton, Southeast University(东南大学自动化学院) School of Automation Science and Electrical Engineering, Beihang University(北航自动化科学与电气工程学院)

AI总结 本文提出一种神经符号框架,结合时序逻辑与大语言模型,实现长周期人-群智协作,通过形式化任务规划与上下文感知推理,提升动态环境中任务规划的可靠性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏