arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Beihang University(北京航空航天大学)

共收录 1231
2512.15744 2026-01-05 cs.LG

How Do Graph Signals Affect Recommendation: Unveiling the Mystery of Low and High-Frequency Graph Signals

图信号如何影响推荐:揭开低频和高频图信号的谜团

Feng Liu, Hao Cang, Huanhuan Yuan, Jiaqing Fan, Yongjing Hao, Fuzhen Zhuang, Guanfeng Liu, Pengpeng Zhao

机构 * School of Computer Science Technology Soochow University Suzhou China School of Electronic Information Engineering Suzhou University of Science Institute of Artificial Intelligence, Beihang University State Key Laboratory of Complex \& Critical Software Environment Beihang University Beijing China School of Computing Macquarie University Sydney Australia Soochow University Suzhou University of Science Beihang University Macquarie University

AI总结 本文揭示了低频和高频图信号在推荐中的等效作用,提出频率信号标定器和空间翻转方法以提升推荐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17168 2026-01-05 cs.GR cs.CV

StyGazeTalk: Learning Stylized Generation of Gaze and Head Dynamics

StyGazeTalk: 学习风格化的 gaze 和 head 动态生成

Chengwei Shi, Chong Cao

机构 * Beihang University(北京航空航天大学)

AI总结 StyGazeTalk 通过多模态框架生成风格化的 gaze 和 head 动态,提升 3D 面部生成的现实感。

Comments arXiv submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24271 2026-01-01 cs.CV cs.AI

Taming Hallucinations: Boosting MLLMs' Video Understanding via Counterfactual Video Generation

驯服幻觉:通过反事实视频生成提升MLLMs的视频理解

Zhe Huang, Hao Wen, Aiming Hao, Bingze Song, Meiqi Wu, Jiahong Wu, Xiangxiang Chu, Sheng Lu, Haoqian Wang

机构 * Tsinghua University(清华大学) Beihang University(北航) AMAP, Alibaba Group(阿里妈妈实验室,阿里巴巴集团)

AI总结 通过反事实视频生成和对比训练,提升MLLMs对视频的理解能力并减少幻觉。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24112 2026-01-01 cs.RO

RflyUT-Sim: A Simulation Platform for Development and Testing of Complex Low-Altitude Traffic Control

RflyUT-Sim:一种用于复杂低空交通控制开发和测试的仿真平台

Zonghan Li, Tianwen Tao, Rao Fu, Liang Wang, Dongyuan Zhang, Quan Quan

机构 * School of Automation Science and Electrical Engineering, Beihang University(自动化科学与电气工程学院,北京航空航天大学) Beijing Intelligent Token Technology Co., Ltd.(北京智能令牌科技有限公司) School of Traffic and Transportation, Beijing Jiaotong University(交通与运输学院,北京交通大学) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(人工智能与自动化学院,华中科技大学)

AI总结 RflyUT-Sim是一款集成高保真度低空UAV交通仿真平台,整合RflySim/AirSim和Unreal Engine 5,提供全状态模型和3D地图,支持灵活的场景定制和开源代码,用于低空交通控制的开发与测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23705 2025-12-30 cs.CV

Diffusion Knows Transparency: Repurposing Video Diffusion for Transparent Object Depth and Normal Estimation

扩散知道透明:将视频扩散用于透明物体深度和法线估计

Shaocong Xu, Songlin Wei, Qizhe Wei, Zheng Geng, Hong Li, Licheng Shen, Qianpu Sun, Shu Han, Bin Ma, Bohan Li, Chongjie Ye, Yuhang Zheng, Nan Wang, Saining Zhang, Hao Zhao

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) University of Southern California(南加州大学) Tsinghua University(清华大学) Beihang University(北航) Wuhan University(武汉大学) Shanghai Jiao Tong University(上海交通大学) European Institute of Innovation and Technology Ningbo(创新与技术欧洲研究所宁波) FNii, The Chinese University of Hong Kong, Shenzhen(FNii,香港中文大学(深圳)) National University of Singapore(新加坡国立大学)

AI总结 本文提出DKT模型,利用视频扩散模型估计透明物体的深度和法线,实现零样本SOTA,提升现实和合成视频中的透明感知性能。

Comments Project Page: https://daniellli.github.io/projects/DKT/; Code: https://github.com/Daniellli/DKT; Dataset: https://huggingface.co/datasets/Daniellesry/TransPhy3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23611 2025-12-30 cs.CL

Close the Loop: Synthesizing Infinite Tool-Use Data via Multi-Agent Role-Playing

闭环:通过多智能体角色扮演合成无限工具使用数据

Yuwen Li, Wei Zhang, Zelong Huang, Mason Yang, Jiajun Wu, Shawn Guo, Huahao Hu, Lingyi Sun, Jian Yang, Mingjie Tang, Byran Dai

机构 * Sichuan University(四川大学) Beihang University(北航) IQuest Research(IQuest研究院)

AI总结 InfTool通过多智能体角色扮演自动生成无限工具使用数据,显著提升大语言模型的调用准确性,无需人工标注。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23573 2025-12-30 cs.CV

ProGuard: Towards Proactive Multimodal Safeguard

ProGuard:迈向主动多模态安全防护

Shaohan Yu, Lijun Li, Chenyang Si, Lu Sheng, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) PRLab Nanjing University(南京大学PRLab) Beihang University(北航)

AI总结 ProGuard通过强化学习和同义词库奖励机制,实现主动多模态安全防护,显著提升分布外风险检测与描述能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23366 2025-12-30 cs.DB cs.AI

AGRO-SQL: Agentic Group-Relative Optimization with High-Fidelity Data Synthesis

AGRO-SQL:基于高保真数据合成的群体相对优化

Cehua Yang, Dongyu Xiao, Junming Lin, Yuyang Song, Hanxu Yan, Shawn Guo, Wei Zhang, Jian Yang, Mingjie Tang, Bryan Dai

机构 * Sichuan University(四川大学) IQuest Research(IQuest研究院) Beihang University(北航大学)

AI总结 AGRO-SQL通过高保真数据合成和群体相对策略优化,提升文本到SQL系统的推理能力与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15965 2025-12-30 cs.LG cs.AI cs.DC

RLinf: Flexible and Efficient Large-scale Reinforcement Learning via Macro-to-Micro Flow Transformation

RLinf: 通过宏到微流转换实现灵活高效的大型强化学习

Chao Yu, Yuanqing Wang, Zhen Guo, Hao Lin, Si Xu, Hongzhi Zang, Quanlu Zhang, Yongji Wu, Chunyang Zhu, Junhao Hu, Zixiao Huang, Mingjie Wei, Yuqing Xie, Ke Yang, Bo Dai, Zhexuan Xu, Jiakun Du, Xiangyuan Wang, Xu Fu, Letong Shi, Zhihao Liu, Kang Chen, Weilin Liu, Gang Liu, Boxun Li, Jianlei Yang, Zhi Yang, Guohao Dai, Yu Wang

机构 * Tsinghua University(清华大学) Zhongguancun Academy(中关村学院) Infinigence AI Peking University(北京大学) UC Berkeley(加州大学伯克利分校) Beihang University(北航) Shanghai Jiaotong University(上海交通大学)

AI总结 RLinf通过宏到微流转换范式,实现了高效灵活的大型强化学习训练系统,显著提升了训练吞吐量。

Comments GitHub Repo: https://github.com/RLinf/RLinf

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10731 2025-12-30 cs.CV

Removal then Selection: A Coarse-to-Fine Fusion Perspective for RGB-Infrared Object Detection

去除后再选择:一种从粗到细融合视角的RGB红外目标检测

Tianyi Zhao, Maoxun Yuan, Feng Jiang, Nan Wang, Xingxing Wei

机构 * Institute of Artificial Intelligence, Hangzhou Innovation Institute, Beihang University, Beijing(北京航空航天大学人工智能研究院,杭州创新院) Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Beijing Institute of Control and Electronic Technology(北京控制与电子技术研究所)

AI总结 本文提出了一种从粗到细的融合视角,通过去除冗余信息和动态选择特征来提升RGB红外目标检测的性能。

Comments 11pages, 10figures

Journal ref IEEE Transactions on Intelligent Transportation Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22628 2025-12-30 cs.CL

M2G-Eval: Enhancing and Evaluating Multi-granularity Multilingual Code Generation

M2G-Eval: 提升和评估多粒度多语言代码生成

Fanglin Xu, Wei Zhang, Jian Yang, Guo Chen, Aishan Liu, Zhoujun Li, Xianglong Liu, Bryan Dai

机构 * Beihang University(北航大学) Hunan University(湖南大学) Ubiquant

AI总结 M2G-Eval通过多粒度多语言框架评估代码生成能力,揭示了不同粒度任务的难度差异和跨语言学习的关联性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22309 2025-12-30 cs.LG cs.AI

LLMBoost: Make Large Language Models Stronger with Boosting

LLMBoost: 通过提升使大型语言模型更强

Zehao Chen, Tianxiang Ai, Yifei Li, Gongxun Li, Yuyang Wei, Wang Zhou, Guanghui Li, Bin Yu, Zhijun Chen, Hailong Sun, Fuzhen Zhuang, Jianxin Li, Deqing Wang, Yikun Ban

机构 * Beihang University(北航大学) China Telecom eSurfing Cloud(中国电信云)

AI总结 LLMBoost通过引入跨模型注意力机制、链式训练范式和近似并行推理范式,提升大型语言模型的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22087 2025-12-29 cs.CL

Context as a Tool: Context Management for Long-Horizon SWE-Agents

上下文作为工具:长周期SWE代理的上下文管理

Shukai Liu, Jian Yang, Bo Jiang, Yizhi Li, Jinyang Guo, Xianglong Liu, Bryan Dai

机构 * Beihang University(北航大学) Manchester(曼彻斯特) Ubiquant

AI总结 CAT通过整合上下文管理工具,提升SWE代理的长周期推理能力,实验表明其在SWE-Bench-Verified上达到57.6%的解决率,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21220 2025-12-29 cs.AI cs.CV cs.RO

RoboSafe: Safeguarding Embodied Agents via Executable Safety Logic

RoboSafe: 通过可执行的安全逻辑保障具身智能体

Le Wang, Zonghao Ying, Xiao Yang, Quanchen Zou, Zhenfei Yin, Tianlin Li, Jian Yang, Yaodong Yang, Aishan Liu, Xianglong Liu

机构 * Beihang University(北航大学) AI Security Lab(360AI安全实验室) The University of Sydney(悉尼大学) Nanyang Technological University(南洋理工大学) Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 RoboSafe通过可执行的安全逻辑保障具身智能体,减少危险行为并保持任务性能。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07148 2025-12-29 cs.CL

TCM-Eval: An Expert-Level Dynamic and Extensible Benchmark for Traditional Chinese Medicine

TCM-Eval: 一个专家级动态且可扩展的中医基准测试

Zihao Cheng, Yuheng Lu, Huaiqian Ye, Zeming Liu, Minqi Wang, Jingjing Liu, Zihan Li, Wei Fan, Yuanfang Guo, Ruiji Fu, Shifeng She, Gang Wang, Yunhong Wang

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Beijing Zhimingtang Technology Co., Ltd.(北京智明堂科技有限公司) Beijing Zhiyan AI Technology Co., Ltd.(北京智言AI科技有限公司) Guangzhou University of Chinese Medicine(广州中医药大学)

AI总结 TCM-Eval通过动态可扩展的基准测试和SI-CoTE方法,开发出ZMT模型,显著超越人类中医从业者水平,推动中医领域LLM研究发展。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14051 2025-12-29 cs.CL cs.AI

GroupDebate: Enhancing the Efficiency of Multi-Agent Debate Using Group Discussion

GroupDebate: 通过群体讨论提升多智能体辩论效率

Tongxuan Liu, Xingyu Wang, Weizhe Huang, Wenjiang Xu, Yuting Zeng, Lei Jiang, Hailong Yang, Jing Li

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beihang University(北航)

AI总结 本文提出GroupDebate方法,通过将智能体划分为小组并共享中间结果,减少多智能体辩论的token成本,提升效率和准确性。

Comments Accepted by AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21618 2025-12-29 cs.CV cs.RO

SymDrive: Realistic and Controllable Driving Simulator via Symmetric Auto-regressive Online Restoration

SymDrive: 通过对称自回归在线修复实现逼真且可控的驾驶模拟器

Zhiyuan Liu, Daocheng Fu, Pinlong Cai, Lening Wang, Ying Liu, Yilong Ren, Botian Shi, Jianqiang Wang

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) State Key Lab of Intelligent Transportation System, Beihang University(北航智能交通系统国家重点实验室)

AI总结 SymDrive通过对称自回归在线修复技术,实现了逼真可控的驾驶模拟,解决了高保真渲染与交互式交通编辑的难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21450 2025-12-29 cs.LG

RLLaVA: An RL-central Framework for Language and Vision Assistants

RLLaVA: 一种面向语言和视觉助手的强化学习中心框架

Lei Zhao, Zihao Ma, Boyu Lin, Yuhe Liu, Wenjun Wu, Lei Huang

机构 * SKLCCSE, Institute of Artificial Intelligence, Beihang University, Beijing, China(信息与电子技术学院,人工智能研究院,北京航空航天大学,北京,中国) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(未来区块链与隐私计算先进创新中心,北京航空航天大学) Hangzhou International Innovation Institute, Beihang University, Hangzhou, China(杭州国际创新研究院,北京航空航天大学,杭州,中国)

AI总结 RLLaVA 提出了一种强化学习中心框架,通过解耦算法逻辑与模型架构,实现高效训练和多任务扩展,提升视觉-语言模型性能。

Comments The code is available at https://github.com/TinyLoopX/RLLaVA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20936 2025-12-25 cs.CV

Reasoning-Driven Amodal Completion: Collaborative Agents and Perceptual Evaluation

基于推理的无遮挡完成:协作代理与感知评估

Hongxing Fan, Shuyu Zhao, Jiayang Ao, Lu Sheng

机构 * School of Computer Science and Engineering, Beihang University(计算机科学与工程学院,北京航空航天大学) School of Software, Beihang University(软件学院,北京航空航天大学) School of Computing and Information Systems, The University of Melbourne(计算与信息系统学院,墨尔本大学)

AI总结 本文提出一种协作多代理推理框架,通过解耦语义规划与视觉合成,提升无遮挡完成任务的语义一致性和结构完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20670 2025-12-25 cs.LG cs.AI

Disentangling Fact from Sentiment: A Dynamic Conflict-Consensus Framework for Multimodal Fake News Detection

区分事实与情感:一种动态冲突-共识框架用于多模态虚假新闻检测

Weilin Zhou, Zonghao Ying, Junjie Mu, Shengwei Tian, Quanchen Zou, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang

机构 * Xinjiang University(新疆大学) AI Security Lab(360AI安全实验室) Beihang University(北航) South China University of Technology(华南理工大学) Fudan University(复旦大学) Shenzhen University(深圳大学)

AI总结 本文提出动态冲突-共识框架,通过区分事实与情感空间,利用物理启发式特征动态和冲突-共识机制,提升多模态虚假新闻检测的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20469 2025-12-24 cs.AI

Bohrium + SciMaster: Building the Infrastructure and Ecosystem for Agentic Science at Scale

Bohrium + SciMaster: 构建大规模智能科学的基础设施和生态系统

Linfeng Zhang, Siheng Chen, Yuzhu Cai, Jingyi Chai, Junhan Chang, Kun Chen, Zhi X. Chen, Zhaohan Ding, Yuwen Du, Yuanpeng Gao, Yuan Gao, Jing Gao, Zhifeng Gao, Qiangqiang Gu, Yanhui Hong, Yuan Huang, Xi Fang, Xiaohong Ji, Guolin Ke, Zixing Lei, Xinyu Li, Yongge Li, Ruoxue Liao, Hang Lin, Xiaolu Lin, Yuxiang Liu, Xinzijian Liu, Zexi Liu, Jintan Lu, Tingjia Miao, Haohui Que, Weijie Sun, Yanfeng Wang, Bingyang Wu, Tianju Xue, Rui Ye, Jinzhe Zeng, Duo Zhang, Jiahui Zhang, Linfeng Zhang, Tianhan Zhang, Wenchang Zhang, Yuzhi Zhang, Zezhong Zhang, Hang Zheng, Hui Zhou, Tong Zhu, Xinyu Zhu, Qingguo Zhou, Weinan E

机构 * DP Technology Beijing China(北京DP技术有限公司) AI for Science Institute Beijing China(北京AI for Science研究院) Shanghai Jiao Tong University Shanghai China(上海交通大学) Beihang University Beijing China(北京航空航天大学) Peking University Beijing China(北京大学) Institute of Theoretical Physics Chinese Academy of Sciences Beijing China(中国科学院理论物理研究所) Shanghai Innovation Institute Shanghai China(上海创新研究院) East China Normal University Shanghai China(华东师范大学) Zhongguancun Academy Beijing China(中关村学院) University of Science and Technology of China Hefei China(中国科学技术大学) Tongji University Shanghai China(同济大学) The Hong Kong University of Science and Technology Hong Kong China(香港科技大学)

AI总结 Bohrium+SciMaster通过构建基础设施和生态系统,实现大规模智能科学的高效工作流编排与执行,显著提升科学产出效率和可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19424 2025-12-23 cs.CL

CodeSimpleQA: Scaling Factuality in Code Large Language Models

CodeSimpleQA: 在代码大语言模型中提升事实性

Jian Yang, Wei Zhang, Yizhi Li, Shawn Guo, Haowen Wang, Aishan Liu, Ge Zhang, Zili Wang, Zhoujun Li, Xianglong Liu, Weifeng Lv

机构 * Beihang University(北航大学) Manchester(曼彻斯特) M-A-P StepFun

AI总结 CodeSimpleQA通过构建双语基准测试和后训练框架,提升代码大语言模型在编程知识事实准确性上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19206 2025-12-23 cs.LG cs.AI

MixKVQ: Query-Aware Mixed-Precision KV Cache Quantization for Long-Context Reasoning

MixKVQ: 为长上下文推理的查询感知混合精度KV缓存量化

Tao Zhang, Ziqian Zeng, Hao Peng, Huiping Zhuang, Cen Chen

机构 * South China University of Technology(南方科技大学) Beihang University(北航) Pazhou Laboratory(琶洲实验室)

AI总结 MixKVQ通过查询感知的混合精度量化策略,提升长上下文推理性能并降低内存开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18730 2025-12-23 cs.LG

A Theoretical Lens for RL-Tuned Language Models via Energy-Based Models

通过能量模型的理论视角提升强化学习调优语言模型

Zhiquan Tan, Yinrong Hong

机构 * Tsinghua University(清华大学) Beihang University(北航)

AI总结 本文通过能量模型视角,揭示了强化学习调优语言模型的理论基础,证明了其在指令遵循和推理任务中的稳定性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06802 2025-12-23 cs.CV

VDOT: Efficient Unified Video Creation via Optimal Transport Distillation

VDOT: 通过最优传输蒸馏实现高效的统一视频生成

Yutong Wang, Haiyu Zhang, Tianfan Xue, Yu Qiao, Yaohui Wang, Chang Xu, Xinyuan Chen

机构 * USYD(美国新南威尔士大学) Shanghai AI Laboratory(上海人工智能实验室) BUAA(北京航空航天大学) CUHK(香港大学)

AI总结 VDOT通过最优传输蒸馏实现高效统一视频生成,提升生成效率与稳定性,优化视频质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17385 2025-12-22 cs.CL

UCoder: Unsupervised Code Generation by Internal Probing of Large Language Models

UCoder: 通过大型语言模型的内部探测实现无监督代码生成

Jiajun Wu, Jian Yang, Wei Zhang, Lin Jing, Yuqing Ma, Ensheng Shi, Yuchi Ma, Zhoujun Li, Xianglong Liu

机构 * Beihang University(北航大学) Huawei(华为)

AI总结 UCoder通过内部探测大型语言模型实现无监督代码生成,利用自一致性机制和表示质量估计训练,减少对标记数据的依赖,提升资源受限场景下的代码生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07475 2025-12-22 eess.IV cs.CV

Text-guided multi-stage cross-perception network for medical image segmentation

基于文本引导的多阶段跨感知网络用于医学图像分割

Gaoyu Chen, Haixia Pan

机构 * college of software(软件学院) Beihang University(北京航空航天大学)

AI总结 本文提出文本引导的多阶段跨感知网络TMC,通过多阶段跨注意力模块和多阶段对齐损失提升医学图像分割的跨模态交互和语义一致性,实验表明其在多个数据集上均优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17509 2025-12-19 cs.CV

MoAPT: Mixture of Adversarial Prompt Tuning for Vision-Language Models

MoAPT: 基于对抗提示微调的视觉-语言模型混合

Shiji Zhao, Qihui Zhu, Shukun Xiong, Shouwei Ruan, Maoxun Yuan, Jialing Tao, Jiexi Liu, Ranjie Duan, Jie Zhang, Jie Zhang, Xingxing Wei

机构 * Institute of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能研究院) Center for Frontier AI Research, A*STAR, Singapore(A*STAR前沿人工智能研究中心) Institute of Computing Technology, Chinese Academy of Sciences, China(中国科学院计算技术研究所)

AI总结 MoAPT通过混合对抗提示微调提升视觉-语言模型对多种对抗攻击的鲁棒性,通过学习多个提示的混合权重以增强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18352 2025-12-19 cs.CV

Diffusion-4K: Ultra-High-Resolution Image Synthesis with Latent Diffusion Models

Diffusion-4K: 基于潜在扩散模型的超高清图像合成

Jinjin Zhang, Qiuyu Huang, Junjie Liu, Xiefan Guo, Di Huang

机构 * State Key Laboratory of Complex and Critical Software Environment(复杂与关键软件环境国家重点实验室) Beihang University(北京航空航天大学) School of Computer Science and Engineering(计算机科学与工程学院)

AI总结 Diffusion-4K通过引入Aesthetic-4K基准和基于小波的微调方法,实现了高质量超高清图像合成。

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15066 2025-12-18 cs.CV cs.AI

Tracking spatial temporal details in ultrasound long video via wavelet analysis and memory bank

通过小波分析和记忆库实现超声长视频中空间时间细节的跟踪

Chenxiao Zhang, Runshi Zhang, Junchen Wang

机构 * School of Mechanical Engineering and Automation, Beihang University(机械工程与自动化学院,北航)

AI总结 本文提出基于记忆库的小波过滤和融合网络,用于提高超声长视频中细粒度空间特征提取和小物体分割的精度。

Comments Chenxiao Zhang and Runshi Zhang contributed equally to this work. 14 pages, 11 figures

Journal ref Medical Image Analysis 2026

详情

展开后加载摘要…

URL PDF HTML 收藏