arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Beihang University(北京航空航天大学)

共收录 1226
2604.11510 2026-06-04 cs.CL cs.AI cs.LG

Policy Split: Incentivizing Dual-Mode Exploration in LLM Reinforcement with Dual-Mode Entropy Regularization

策略分裂:通过双模式熵正则化激励大语言模型强化学习中的双模式探索

Jiashu Yao, Heyan Huang, Daiqing Wu, Zeming Liu, Yuhang Guo

机构 * Beijing Institute of Technology(北京理工大学) Tsinghua University(清华大学) Beihang University(北航)

AI总结 提出Policy Split方法,将策略分裂为正常和高熵两种模式,通过协作双模式熵正则化在保持准确性的同时促进多样化探索,实验表明在通用和创造性任务上优于现有基线。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.06892 2026-06-04 cs.RO cs.SY eess.SY

Learning to Guide: Guidance Law Based on Deep Meta-learning and Model Predictive Path Integral Control

学习引导:基于深度元学习和模型预测路径积分控制的引导法

Chen Liang, Weihong Wang, Zhenghua Liu, Chao Lai, Benchun Zhou

机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院) Navigation and Control Technology Research Institute of China North Industries Group Corporation(中国北方工业集团有限公司导航与控制技术研究院)

AI总结 本文提出了一种基于模型驱动深度强化学习的新型引导方案,通过将深度神经网络作为引导动力学的预测模型融入模型预测路径积分(MPPI)控制框架中,利用元学习技术使深度神经动力学模型能够在线适应环境变化,从而缓解标准MPPI控制因实际环境与训练数据差异导致的性能下降,并构建了在存在作动器故障时拦截机动目标的新型引导律。

Comments Code available at https://github.com/tccliangchen/deep_meta-learning_guidance_law . in IEEE Access 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03890 2026-06-03 cs.CV

OVO-S-Bench: A Hierarchical Benchmark for Streaming Spatial Intelligence in Multimodal LLMs

OVO-S-Bench:多模态大语言模型中流式空间智能的分层基准

Yifei Li, Pengyiang Liu, Yuhang Zang, Zhongyue Shi, Qi Fu, Hongye Hao, Jiwen Lu

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学)

AI总结 提出OVO-S-Bench,一个完全人工标注的流式空间智能基准,包含1680个问题,涵盖四个抽象层次,评估38个MLLM,发现Gemini-3.1-Pro落后人类专家27分,流式空间微调MLLM表现不如其骨干模型。

Comments 48 pages, 12 figures, 15 tables. Project page: https://internlm.github.io/OVO-S-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03361 2026-06-03 cs.LG

Mitigating False Credit Propagation: Probabilistic Graphical Reward Aggregation for Rubric-Based Reinforcement Learning

缓解虚假信用传播:基于概率图奖励聚合的准则强化学习

Can Lv, Mingju Chen, Heng Chang, Shiji Zhou

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算先进创新中心,人工智能学院,北京航空航天大学) Tsinghua University(清华大学)

AI总结 针对准则奖励中因忽略准则间依赖关系导致的虚假信用传播问题,提出概率图框架Graphical Event Aggregation for Rubric rewards (GEAR),通过建模潜在伯努利事件和软抑制传播实现依赖感知的奖励聚合,在多个基准上提升性能并减少信用泄漏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03220 2026-06-03 cs.CL cs.AI

WebRISE: Requirement-Induced State Evaluation for MLLM-Generated Web Artifacts

WebRISE: 面向MLLM生成Web工件的需求诱导状态评估

Yuxin Meng, Yuhan Suo, Junjie Wang, Yuhan Sun, Yiyao Yu, Ruixu Zhang, Ruining Hu, Yubin Wang, Shouwei Ruan, Bin Wang, Yuxiang Zhang, Yujiu Yang

机构 * Tsinghua University(清华大学) Huawei Noah’s Ark Lab(华为诺亚实验室) East China Normal University(华东师范大学) Tongji University(同济大学) Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

AI总结 提出WebRISE框架,通过交互契约图(ICG)将任务需求转化为可观察状态、用户意图转换和DOM/视觉断言,以评估MLLM生成的Web工件的功能正确性,实验表明ICG评分检测状态错误率是检查点评估的2-16倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18639 2026-06-03 cs.CV

OrthoPhys: Physically Plausible Video Generation with Orthogonal-View Geometry Guidance

OrthoPhys:基于正交视角几何引导的物理合理视频生成

Cong Wang, Hanxin Zhu, Xiao Tang, Jiayi Luo, Xin Jin, Long Chen, Zhibo Chen

机构 * the State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所) the School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhongguancun Academy(中关村学院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院) College of Automotive and Energy Engineering, Tongji University(同济大学汽车与能源工程学院) SKLCCSE, School of Computer Science and Engineering, Beihang University(SKLCCSE,北京航空航天大学计算机科学与工程学院)

AI总结 提出两阶段框架 OrthoPhys,通过正交视角几何引导生成物理一致的前景运动,再合成完整视频,显著提升物理真实感和时空一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16275 2026-06-03 cs.CL cs.AI

SeSE: Black-Box Uncertainty Quantification for Large Language Models Based on Structural Information Theory

SeSE: 基于结构信息理论的大语言模型黑盒不确定性量化

Xingtao Zhao, Hao Peng, Dingli Su, Xianghua Zeng, Chunyang Liu, Jinzhi Liao, Philip S. Yu

机构 * School of Cyber Science and Technology Beihang University(北航信息科学与技术学院) School of Computer Science and Engineering Beihang University(北航计算机科学与工程学院) Didi Chuxing(滴滴出行) Laboratory for Big Data and Decision National University of Defense Technology(国防科技大学大数据与决策实验室) Department of Computer Science University of Illinois Chicago(伊利诺伊大学芝加哥分校计算机科学系)

AI总结 提出SeSE框架,通过构建语义空间的最优层次抽象并计算结构熵,实现大语言模型的黑盒不确定性量化,理论推广了语义熵并在长文本生成中优于现有方法。

Comments Accepted by UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16392 2026-06-03 cs.AI

RGMem: Renormalization Group-inspired Memory Evolution for Language Agents

RGMem:基于重正化群启发的语言智能体记忆演化

Ao Tian, Yunfeng Lu, Xinxin Fan, Changhao Wang, Lanzhi Zhou, Yeyao Zhang, Yanfang Liu

机构 * School of Computer Science Engineering, Beihang University, Beijing, China School of Reliability Systems Engineering, Beihang University, Beijing, China State Key Laboratory of Complex \& Critical Software Environment National Key Laboratory of Reliability State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences

AI总结 提出RGMem框架,利用重正化群思想对长期对话记忆进行多尺度粗粒化、阈值更新和重缩放,实现从事实到用户偏好的层次化整合,在LOCOMO和PersonaMem基准上超越现有记忆系统。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16302 2026-06-03 cs.AI cs.IR

DTKG: Dual-Track Knowledge Graph-Verified Reasoning Framework for Multi-Hop QA

DTKG: 用于多跳问答的双轨知识图谱验证推理框架

Changhao Wang, Yanfang Liu, Xinxin Fan, Ao Tian, Lanzhi Zhou, Yunfeng Lu

机构 * School of Computer Science Engineering, Beihang University, Beijing, China School of Reliability Systems Engineering, Beihang University, Beijing, China State Key Laboratory of Complex \& Critical Software Environment National Key Laboratory of Reliability State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences

AI总结 提出DTKG框架,通过分类阶段和分支处理阶段分别处理并行事实验证和链式多跳推理,提升多跳问答的效率和准确性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02530 2026-06-02 cs.AI cs.CL

SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment

SafeSteer: 局部化在策略蒸馏用于高效安全对齐

Hao Li, Jingkun An, Zijun Song, Pengyu Zhu, Rui Li, Hao Wang, Wendi Feng, Yesheng Liu, Lijun Li, Jin-Ge Yao, Lei Sha

机构 * Beihang University(北航) Beijing Institute of Technology(北京理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 针对大语言模型安全对齐导致通用能力下降的问题,提出SafeSteer方法,通过激活引导构建安全教师并选择安全令牌,仅在安全令牌上施加反向KL惩罚,在仅用100个有害样本且无需通用数据的情况下,实现了安全与通用能力之间的优越平衡。

Comments 19 pages, 8 figures, 14 tables. Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02277 2026-06-02 cs.RO

RoboSemanticBench: Diagnosing Semantic Grounding in Action Prediction for VLA Models

RoboSemanticBench: 诊断 VLA 模型在动作预测中的语义基础

Bin Yu, Yao Zhang, Haishan Liu, Shijie Lian, Yuliang Wei, Xiaopeng Lin, Zhaolong Shen, Changti Wu, Ruina Hu, Bailing Wang, Cong Huang, Kai Chen

机构 * HIT(哈尔滨工业大学) ZGCA(中钢集团人工智能研究院) ZGCI(中钢集团智能计算研究所) WHU(武汉大学) HUST(华中科技大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学) ECNU(华东师范大学) DeepCybo

AI总结 提出 RoboSemanticBench 基准,通过多选问答任务评估 VLA 模型是否利用指令语义选择正确物体,发现模型在语义正确选择上接近随机,揭示语义理解与动作预测之间的差距。

Comments GitHub: https://github.com/ZGC-EmbodyAI/RoboSemanticBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01905 2026-06-02 eess.AS cs.SD

Advancing Electrolaryngeal Speech Enhancement Through Speech-Text Representation Learning

通过语音-文本表示学习推进电喉语音增强

Ding Ma, Jinyi Mi, Fengji Li, Lester Phillip Violeta, Jiajun He, Wenchin Huang, Kazuhiro Kobayashi, Tomoki Toda

机构 * Graduate School of Informatics, Nagoya University(名古屋大学信息学研究科) School of Biological Science and Medical Engineering, Beihang University(北航生物医学工程学院) TARVO, Inc.(TARVO公司) Information Technology Center, Nagoya University(名古屋大学信息技术中心)

AI总结 提出一种融合语音和文本表示的学习框架,通过序列到序列语音转换模型改进电喉语音到正常语音的映射与重建质量,实验证明优于仅依赖语音表示的方法。

Comments 15 pages, 7 figures. Accepted to IEEE TBME

Journal ref IEEE Transactions on Biomedical Engineering, Early Access, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01873 2026-06-02 cs.LG

G2LoRA: Gradient Orthogonal Low-Rank Adaptation Framework for Graph Continual Learning on Text-Attributed Graphs

G2LoRA: 面向文本属性图的梯度正交低秩自适应框架用于图持续学习

Yuhan Wang, Yibo Ding, Yutong Ye, Mufan Zhao, Wenbo Zhang, Ruijie Wang, Jianxin Li

机构 * School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Department of Statistics, Columbia University(哥伦比亚大学统计系) College of Computer Science, Beijing University of Technology(北京理工大学计算机学院)

AI总结 针对LLM-as-Aligner模型在文本属性图持续学习中的灾难性遗忘问题,提出G2LoRA框架,通过统一图-文本对齐目标、类别感知梯度投影和梯度幅度调制,实现任务间正向迁移并缓解模态漂移。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01848 2026-06-02 cs.CV

RescueBench: Can Embodied Agents Save Lives in the Wild ?

RescueBench: 具身智能体能否在野外拯救生命?

Kui Wu, Beiyu Guo, Hao Chen, ShuHang Xu, Yuling Li, Yongdan Zeng, Zhoujun Li, Yizhou Wang, Fangwei Zhong

机构 * Beihang University(北京航空航天大学) Beijing Normal University(北京师范大学) Peking University(北京大学) City University of Macau(澳门城市大学) ATEC2025 Challenge Committee(ATEC2025挑战委员会)

AI总结 本文提出 RescueBench,一个四阶段流水线的逼真诊断基准,用于评估具身智能体在搜索与救援任务中的探索、记忆和交互能力,并揭示探索和记忆失败如何传播。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01779 2026-06-02 cs.CL

HarnessForge: Joint Harness and Policy Evolution for Adaptive Agent Systems

HarnessForge:面向自适应智能体系统的协同框架与策略进化

Mingju Chen, Can Lv, Guibin Zhang, Heng Chang, Shiji Zhou

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算先进创新中心,人工智能学院,北京航空航天大学) Tsinghua University(清华大学)

AI总结 提出HarnessForge元自适应框架,通过框架-策略协同进化实现LLM智能体系统的全系统自适应,在多个基准上显著提升性能。

Comments 25 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01777 2026-06-02 cs.RO

Trans2Occ: Voxel Occupancy Estimation and Grasp for Transparent Objects from Simulation to Reality

Trans2Occ: 从仿真到现实的透明物体体素占用估计与抓取

Yixuan Yang, Sha Zhang, Rui Li, Zhenfei Yin, Xinzhu Ma, Yiran Qin, Lei Bai, Xudong Xu, Shilin Shan, Wangmeng Zuo, Yanyong Zhang, Wanli Ouyang, Feng Zheng, Shixiang Tang, Dongzhan Zhou

机构 * Shanghai AI Laboratory(上海人工智能实验室) SUSTech(南方科技大学) CUHK(香港中文大学) Harbin Institute of Technology(哈尔滨工业大学) University of Oxford(牛津大学) Beihang University(北京航空航天大学) Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学)

AI总结 提出基于单视图RGB输入的体素占用预测框架,结合仿真数据生成与规则抓取策略,实现透明物体的鲁棒3D感知与操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01626 2026-06-02 cs.LG

IMWM: Intuition Models Complement World Models for Latent Planning

IMWM:直觉模型补充世界模型用于潜在规划

Baoqi Gao, Ruize Han, Miao Wang, Song Wang

机构 * Beihang University(北航) Shenzhen University of Advanced Technology(深圳先进技术大学)

AI总结 针对基于潜在世界模型的规划中搜索瓶颈问题,提出IMWM框架,通过直觉模型与三个轻量组件协作,在四个像素级任务上显著提升成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00694 2026-06-02 cs.CV

FROST-STA: Frozen Dense Features for the Ego4D Short-Term Object Interaction Anticipation

FROST-STA: 用于Ego4D短期物体交互预测的冻结密集特征

Chaoyang Wang, Lexuan Xu

机构 * Beihang University(北航大学)

AI总结 提出FROST-STA模型,利用冻结的密集图像-视频特征和对象中心解码,在Ego4D短期物体交互预测挑战中取得第二名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00662 2026-06-02 cs.CV

TAP-JEPA: Frozen Future-Latent Probing and Two-Stage Score Fusion for EPIC-KITCHENS-100 Action Anticipation

TAP-JEPA:冻结的未来潜在探测与两阶段分数融合用于EPIC-KITCHENS-100动作预测

Chaoyang Wang, Lexuan Xu

机构 * Beihang University(北航大学)

AI总结 提出TAP-JEPA方法,利用冻结的V-JEPA 2.1特征和两阶段分数融合,在EPIC-KITCHENS-100动作预测挑战中获得第二名。

Comments The runner-up solution for the Action Anticipation Challenge, EPIC-KITCHENS-100 at the CVPR EgoVis Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00628 2026-06-02 cs.CL

Robust Reasoning via Dynamic Token Selection for Distribution-Aligned Self-Distillation

通过动态令牌选择实现分布对齐的自蒸馏的鲁棒推理

Ruiqi Zhang, Lingxiang Wang, Hainan Zhang Zhiming Zheng

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(北京未来区块链与隐私计算先进创新中心,北京航空航天大学) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)

AI总结 针对自蒸馏中参考答案引入风格偏差导致模型模仿表面形式而非学习推理模式的问题,提出分布对齐自蒸馏(DASD),通过动态过滤高困惑度令牌来保留逻辑修正并抑制风格噪声,在数学、代码和常识推理任务上提升鲁棒性。

Comments 12 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00576 2026-06-02 cs.RO

Dynamic Resilient Spatio-Semantic Memory with Hybrid Localization for Mobile Manipulation

面向移动操作的动态弹性时空语义记忆与混合定位

Zhijie Yan, Shufei Li, Ze Zhang, Xin Liu, Yuhang Zheng, Zuoxu Wang

机构 * School of Mechanical Engineering and Automation, Beihang University(北京航空航天大学机械工程及自动化学院) Department of Systems Engineering, City University of Hong Kong(香港城市大学系统工程系) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

AI总结 提出DREAM框架,通过在线构建时空语义体素记忆、冗余感知记忆剪枝和混合定位,实现无预建地图的动态室内移动操作,将长时任务成功率提升至55%-70%。

Comments Code, CAD model, and real-robot demonstrations are available at https://bjhyzj.github.io/dream-web

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00123 2026-06-02 cs.CV cs.AI cs.LG

CardioLens: Revealing the Clinical Reality Gap of MLLMs via Multi-Sequence Cardiac MRI Evaluations

CardioLens: 通过多序列心脏MRI评估揭示MLLMs的临床现实差距

Zixian Su, Hongkai Zhang, Fan Gao, Encheng Su, Taiping Qu, Jingwei Guo, Nan Zhang, Hui Wang, Zhen Zhou, Kairui Bo, Yan Chen, Yue Ren, Shuai Li, Lei Xu, Henggui Zhang

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Beijing Anzhen Hospital(北京安贞医院) Beihang University(北航) King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学)

AI总结 提出CardioLens测试平台,通过多序列心脏磁共振成像评估24个多模态大语言模型,发现其在临床工作流中表现不佳,存在类别崩溃失败模式,且输入选择和推理提示改进效果有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00074 2026-06-02 eess.SP cs.AI cs.LG

CLSP-REQA: A Real-Time Quality-Aware Closed-Loop Seizure Prediction Framework with Mamba-BiLSTM and Confidence-Gated Intervention

CLSP-REQA:基于Mamba-BiLSTM和置信门控干预的实时质量感知闭环癫痫发作预测框架

Mufeng Chen, Qi Wu, Bingchao Huang, Xiwen Lai, Zekai Chen, Xinge Ouyang, Quansheng Ren

机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) Mathematical Institute, University of Oxford(牛津大学数学研究所) School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所) Department of Mechanical Engineering, The University of British Columbia(不列颠哥伦比亚大学机械工程系) College of Life Sciences, Hunan Normal University(湖南师范大学生命科学学院) School of Electronics, Peking University(北京大学电子学院)

AI总结 提出CLSP-REQA框架,通过嵌入实时EEG质量评估模块和Mamba-BiLSTM骨干网络,结合分层非线性融合函数,在严格跨患者评估下实现优于现有方法的癫痫发作预测性能。

Comments 27 pages, 8 figures, submitted to Biomedical Signal Processing and Control

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28335 2026-06-02 cs.LG

Dimensionality Reduction for Robust Federated Learning: A Theoretical Analysis and Convergence Guarantee

鲁棒联邦学习的降维方法:理论分析与收敛性保证

Shiyuan Zuo, Jiashuo Li, Rongfei Fan, Han Hu, Jie Xu

机构 * Beihang University(北京航空航天大学) Xi'an Jiaotong University(西安交通大学) City University of Hong Kong(香港城市大学)

AI总结 针对联邦学习在拜占庭攻击下高维梯度聚合计算开销大的问题,提出基于稀疏随机投影的投影降维框架,将复杂度降至最优O(Mp),并证明其达到非凸函数O(1/√T)和强凸函数O(1/T)的最优收敛率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04828 2026-06-02 cs.CL

From Unfamiliar to Familiar: Detecting Pre-training Data via Gradient Deviations in Large Language Models

从陌生到熟悉:通过梯度偏差检测大型语言模型中的预训练数据

Ruiqi Zhang, Lingxiang Wang, Hainan Zhang, Zhiming Zheng, Yanyan Lan

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(北京未来区块链与隐私计算先进创新中心,北京航空航天大学) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

AI总结 提出GDS方法,通过分析目标样本的梯度偏差分数(包括更新幅度、位置和神经元激活集中度)来区分预训练成员与非成员数据,实现高效且跨数据集迁移的预训练数据检测。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24696 2026-06-02 cs.LG cs.AI

T-POP: Test-Time Personalization with Online Preference Feedback

T-POP:基于在线偏好反馈的测试时个性化

Zikun Qu, Min Zhang, Mingze Kong, Xiang Li, Zhiwei Shang, Zhiyong Wang, Yikun Ban, Shuang Qiu, Yao Shu, Zhongxiang Dai

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) East China Normal University(华东师范大学) Shenzhen Loop Area Institute(深圳河套学院) Tianjin University(天津大学) The Chinese University of Hong Kong(香港中文大学) Beihang University(北京航空航天大学) City University of Hong Kong(香港城市大学) The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

AI总结 针对新用户冷启动问题,提出T-POP算法,通过在线成对偏好反馈和决斗式强盗机制,在不更新模型参数的情况下实时学习用户偏好并引导解码过程,实现快速数据高效的个性化。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06136 2026-06-02 cs.CV cs.AI

GSV3D: Gaussian Splatting-based Geometric Distillation with Stable Video Diffusion for Single-Image 3D Object Generation

GSV3D: 基于高斯溅射的几何蒸馏与稳定视频扩散用于单图像3D物体生成

Ye Tao, Jiawei Zhang, Yahao Shi, Dongqing Zou, Bin Zhou

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(虚拟现实技术与系统国家重点实验室,北京航空航天大学) SenseTime Research(商汤科技研究院) PBVR

AI总结 提出一种结合2D扩散模型隐式3D推理能力与高斯溅射几何蒸馏的方法,通过高斯溅射解码器将SV3D潜变量输出转换为显式3D表示,实现多视图一致性和高质量3D生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31370 2026-06-01 cs.AI

HypoAgent: An Agentic Framework for Interactive Abductive Hypothesis Generation over Knowledge Graphs

HypoAgent: 一种用于知识图谱上交互式溯因假设生成的智能体框架

Yisen Gao, Yixi Cai, Tianshi Zheng, Jiaxin Bai, Yangqiu Song

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Beihang University(北航) Hong Kong Baptist University(香港 Baptist 大学)

AI总结 提出HypoAgent框架,通过三个智能体(意图识别、假设生成、根因分析)实现知识图谱上的交互式溯因假设生成,在常识和生物医学领域知识图谱上达到最优语义相似度。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31266 2026-06-01 cs.CV cs.AI cs.LG

Envisioning Beyond the Few: Disentangled Semantics and Primitives for Few-Shot Atypical Layout-to-Image Generation

超越少数:用于少样本非典型布局到图像生成的解耦语义与基元

Nan Bao, Yifan Zhao, Wenzhuang Wang, Jia Li

机构 * State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室) School of Computer Science and Engineering(计算机科学与工程学院) Qingdao Research Institute, Beihang University, China(北京航空航天大学青岛研究所,中国)

AI总结 针对少样本非典型布局到图像生成中表示碎片化问题,提出通过语义锚定和基元注入解耦语义与视觉细节,实现鲁棒少样本适应。

Comments Accepted to ICML 2026; code available at https://github.com/iCVTEAM/DSP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30972 2026-06-01 cs.CV

BiSegMamba: Efficient Bidirectional Tri-Oriented Mamba for 3D Medical Image Segmentation

BiSegMamba: 用于3D医学图像分割的高效双向三向Mamba

Bakht Zada, Chao Tong, Qile Su, Shuai Zhang

机构 * School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北航虚拟现实技术与系统国家重点实验室)

AI总结 提出BiSegMamba,一种基于双向三向Mamba的高效3D医学图像分割网络,通过渐进压缩主干、多尺度空间混合器、双向正交Mamba块和自适应方向融合,在降低计算成本的同时提升分割精度。

Comments 10 pages, 7 figures, 5 tables. Code is available at: https://github.com/bakhtzadaabshare/BiSegMamba

详情

展开后加载摘要…

URL PDF HTML 收藏