arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Beihang University(北京航空航天大学)

共收录 1226
2511.20211 2026-04-29 cs.CV cs.AI

OmniAlpha: Aligning Transparency-Aware Generation via Multi-Task Unified Reinforcement Learning

OmniAlpha:通过多任务统一强化学习对透明度感知生成进行对齐

Hao Yu, Jinglin Wang, Jiabo Zhan, Rui Chen, Zile Wang, Huaisong Zhang, Hongyu Li, Xinrui Chen, Yongxian Wei, Chun Yuan

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北航)

AI总结 OmniAlpha通过多任务统一强化学习框架,解决透明度感知生成中RGB外观、alpha透明度和跨层合成的建模问题,提升RGBA生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25467 2026-04-29 cs.LG math.OC

Subspace Optimization for Efficient Federated Learning under Heterogeneous Data

子空间优化用于异构数据下的高效联邦学习

Shuchen Zhu, Zhengyang Huang, Yuqi Xu, Peijin Li

机构 * Peking University(北京大学) Beihang University(北航)

AI总结 本文提出子空间优化方法SSF,通过低维子空间进行异构性校正优化,降低通信和内存开销,实现非渐近收敛率和异构数据下的高效联邦学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24921 2026-04-29 cs.RO cs.AI cs.CL cs.CV

Libra-VLA: Achieving Learning Equilibrium via Asynchronous Coarse-to-Fine Dual-System

Libra-VLA:通过异步粗到细双系统实现学习平衡

Yifei Wei, Linqing Zhong, Yi Liu, Yuxiang Lu, Xindong He, Maoqing Yao, Guanghui Ren

机构 * Beihang University(北航) AgiBot

AI总结 Libra-VLA通过粗到细双系统架构,解决视觉-语言-动作模型在机器人操作中语义与动作间的鸿沟问题,实现训练平衡与高效执行。

Comments Accepted to the Main Conference of ACL 2026. Project page: https://libra-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10813 2026-04-29 cs.CV cs.RO

InternScenes: A Large-scale Simulatable Indoor Scene Dataset with Realistic Layouts

InternScenes: 一个大规模可模拟室内场景数据集,具有逼真布局

Weipeng Zhong, Peizhou Cao, Yichen Jin, Li Luo, Wenzhe Cai, Jingli Lin, Hanqing Wang, Zhaoyang Lyu, Tai Wang, Bo Dai, Xudong Xu, Jiangmiao Pang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Beihang University(北航) The University of Hong Kong(香港大学)

AI总结 本文提出InternScenes数据集,包含4万多个多样化场景,涵盖15种常见场景类型和288个物体类别,通过整合现实扫描、程序生成和设计师创作的场景,保留大量小物品以实现逼真布局,用于场景布局生成和点-目标导航任务。

Comments Accepted by NeurIPS 2025; Project page: https://marjordcpz.github.io/InternScenes.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24396 2026-04-28 cs.CV cs.AI

Global Context or Local Detail? Adaptive Visual Grounding for Hallucination Mitigation

全局上下文还是局部细节?面向幻觉缓解的自适应视觉 grounding

Yubo Jiang, Xin Yang, Abudukelimu Wuerkaixi, Zheming Yuan, Xuxin Cheng, Fengying Xie, Zhiguo Jiang, Cao Liu, Ke Zeng, Haopeng Zhang

机构 * School of Astronautics, Beihang University(北航航天学院) Longcat Interaction Team, Meituan(美团Longcat交互团队) Tianmushan Laboratory, Beihang University(北航天门山实验室)

AI总结 本文提出PND框架,通过双路径对比在解码过程中增强视觉真实性,减少幻觉并提升描述细节,无需模型微调。

Comments 9 pages, 8 figures, Findings of ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12009 2026-04-28 cs.CV

LatentStealth: Unnoticeable and Efficient Adversarial Attacks on Expressive Human Pose and Shape Estimation

LatentStealth: 一种无痕且高效的对抗攻击方法用于表达性人体姿态和形状估计

Zhiying Li, Guanggang Geng, Yeying Jin, Shuyuan Lin, Fengyuan Ma, Zhaoxin Fan, Lili Wang

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算高级创新中心,人工智能学院,北航) College of Cyber Security, Jinan University(网络安全学院,暨南大学) National University of Singapore(新加坡国立大学) School of Computer Science and Information Engineering, Hefei University of Technology(计算机科学与信息工程学院,合肥工业大学) School of Computer Science and Engineering, Beihang University(计算机科学与工程学院,北航)

AI总结 本文提出LatentStealth方法,通过利用自然图像的结构化潜在表示,在潜在空间中生成并优化对抗扰动,实现无痕高效的对抗攻击,揭示当前系统关键安全漏洞。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23742 2026-04-28 cs.SD

RTCFake: Speech Deepfake Detection in Real-Time Communication

RTCFake: 语音深度伪造检测中的实时通信

Jun Xue, Zhuolin Yi, Yihuan Huang, Yanzhen Ren, Yujie Chen, Cunhang Fan, Zicheng Su, Yonghong Zhang, Bo Cai

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education(航空航天信息安全部与可信计算教育部重点实验室) School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) Beihang University(北京航空航天大学)

AI总结 本文提出RTCFake数据集,用于实时通信场景下的语音深度伪造检测,结合平台不变语义表征学习策略,提升跨平台泛化能力与噪声鲁棒性。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23551 2026-04-28 cs.CV

Spatiotemporal Degradation-Aware 3D Gaussian Splatting for Realistic Underwater Scene Reconstruction

时空降质感知的3D高斯点散布用于逼真水下场景重建

Shaohua Liu, Ning Gao, Zuoya Gu, Hongkun Dou, Yue Deng, Hongjue Li

机构 * School of Astronautics Beihang University Beijing China(航天学院 北航 北京 中国) School of Artificial Intelligence Beihang University Beijing China(人工智能学院 北航 北京 中国) Zhongguancun Academy Beijing China(中关村学院 北京 中国) Beihang University School of Astronautics Beijing China(北航 航天学院 北京 中国) Beihang University(北航) Zhongguancun Academy(中关村学院)

AI总结 本文提出MarineSTD-GS框架,通过建模时空降质实现逼真水下场景重建,引入内在高斯和降质高斯,结合时空降质建模模块,改进几何和外观估计,实验表明其在处理时空降质和合成新视角方面优于现有方法。

Comments 12 pages, 10 figures, 6 tables. Author version of the paper published in Proceedings of ACM Multimedia 2025

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (ACM MM 2025), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12971 2026-04-28 cs.RO

INHerit-SG: Incremental Hierarchical Semantic Scene Graphs with RAG-Style Retrieval

INHerit-SG:增量式层次语义场景图与RAG风格检索

YukTungSamuel Fang, Zhikang Shi, Jiabin Qiu, Zixuan Chen, Jieqi Shi, Hao Xu, Jing Huo, Yang Gao

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Beihang University(北京航空航天大学)

AI总结 本文提出INHerit-SG,通过异步双流架构构建RAG-ready知识库,解决复杂嵌入查询与持续语义图构建问题,实验表明在复杂查询中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23314 2026-04-28 cs.CV

Learning from Noisy Prompts: Saliency-Guided Prompt Distillation for Robust Segmentation with SAM

从噪声提示中学习:基于显著性的提示蒸馏用于具有SAM的鲁棒分割

Jingxuan Kang, Ziqi Zhang, Shaoming Zheng, Shuang Li, Uday Bharat Patel, Alexander Harry Fitzhugh, Phillip Lung, Yusuf Kiberu, Nikesh Jathanna, Shahnaz Jamil-Copley, Bernhard Kainz, Chen Qin

机构 * Imperial College London(伦敦帝国学院) Beihang University(北航) National Health Service(国家卫生服务) University of Nottingham(诺丁汉大学)

AI总结 本文提出SPD框架,通过数据驱动的解剖先验知识和上下文提示蒸馏,提升在噪声提示下的分割鲁棒性,实验表明其在MRI和CT基准上优于现有方法。

Comments Accepted to CVPR 2026 (Findings Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22828 2026-04-28 cs.CV cs.AI

MetaEarth3D: Unlocking World-scale 3D Generation with Spatially Scalable Generative Modeling

MetaEarth3D: 解锁世界尺度的3D生成与空间可扩展生成模型

Jinqi Cao, Zhiping Yu, Baihong Lin, Chenyang Liu, Zhenwei Shi, Zhengxia Zou

机构 * School of Astronautics, Beihang University(北航航天学院)

AI总结 MetaEarth3D通过空间可扩展生成模型实现世界尺度3D生成,解决传统生成模型在空间尺度上的局限,提升地球观测与模拟的超大空间智能能力。

Comments Project Page: https://jinqicao.github.io/metaearth3d/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22777 2026-04-28 cs.AI cs.LG

An Intelligent Fault Diagnosis Method for General Aviation Aircraft Based on Multi-Fidelity Digital Twin and FMEA Knowledge Enhancement

基于多保真度数字孪生和FMEA知识增强的通用航空飞机智能故障诊断方法

Zhihuan Wei, Yang Hu, Xinhang Chen, Yiming Zhang, Jie Liu, Wei Wang

机构 * Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) School of Mechanical Engineering, Zhejiang University(浙江大学机械工程学院) School of Reliability and Systems Engineering, Beihang University(北京航空航天大学可靠性与系统工程学院) Department of Mechanical Engineering, City University of Hong Kong(香港城市大学机械工程系)

AI总结 本文提出基于多保真度数字孪生的智能故障诊断框架,通过高保真飞行动态仿真、FMEA驱动故障注入、多保真残差特征提取和大语言模型增强的可解释报告生成模块,解决通用航空飞机故障诊断中的数据稀缺、故障类型多样和故障特征弱等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23213 2026-04-28 cs.CL cs.AI

Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process

评分、推理与选择最佳!通过同行评审过程进行大型语言模型的集成

Zhijun Chen, Zeyu Ji, Qianren Mao, Hao Wu, Jinhuan Song, Junhang Cheng, Bangjie Qin, Zhuoran Li, Jingzheng Li, Kai Sun, Zizhe Wang, Yikun Ban, Zhu Sun, Xiangyang Ji, Hailong Sun

机构 * Beihang University, Beijing, China(北京航空航天大学) Zhongguancun Laboratory, Beijing, China(中关村实验室) Beijing University of Posts and Telecommunications(北京邮电大学) Hong Kong University of Science and Technology(香港科学与技术大学) Xi'an Jiaotong University, Xi'an, China(西安交通大学) Tsinghua University, Beijing, China(清华大学) Singapore University of Technology and Design(新加坡科技设计大学)

AI总结 本文提出LLM-PeerReview方法,通过同行评审机制集成多个大型语言模型,提升响应质量。实验显示其在多个数据集上优于Smoothie-Global,适用于事实性问答、数学推理等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01579 2026-04-28 cs.CL cs.AI

AdaComp: Extractive Context Compression with Adaptive Predictor for Retrieval-Augmented Large Language Models

AdaComp: 基于自适应预测器的提取式上下文压缩用于检索增强型大语言模型

Qianchi Zhang, Hainan Zhang, Liang Pang, Hongwei Zheng, Zhiming Zheng

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算先进创新中心) School of Artificial Intelligence, Beihang University(北航人工智能学院) Beijing Academy of Blockchain and Edge Computing(北京区块链与边缘计算研究院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

AI总结 本文提出AdaComp,一种低开销的提取式上下文压缩方法,通过自适应确定压缩率来平衡RAG的效率与性能,实验表明其在保持性能的同时显著降低了推理成本。

Comments Accepted to KSEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01380 2026-04-27 cs.RO cs.SY eess.SY

An Efficient Real-Time Planning Method for Swarm Robotics Based on an Optimal Virtual Tube

基于最优虚拟管的群体机器人高效实时规划方法

Pengda Mao, Shuli Lv, Chen Min, Zhaolong Shen, Quan Quan

机构 * School of Automation Science and Electrical Engineering, Beihang University(自动化科学与电气工程学院,北京航空航天大学)

AI总结 本文提出结合集中式最优虚拟管规划与分布式控制的群体机器人轨迹规划框架,实现低计算量高频率重规划,融合多步与反应式规划的优势。

Comments 18 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20305 2026-04-23 cs.RO

AdaTracker: Learning Adaptive In-Context Policy for Cross-Embodiment Active Visual Tracking

AdaTracker: 一种用于跨躯体主动视觉跟踪的自适应上下文策略学习方法

Kui Wu, Hao Chen, Jinzhu Han, Haijun Liu, Churan Wang, Yizhou Wang, Zhoujun Li, Si Liu, Fangwei Zhong

机构 * Beihang University(北京航空航天大学) City University of Macau(澳门城市大学) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Minzu University of China(民族大学) Center for Data Science in Clinical Medicine, Peking University Third Hospital(北京大学第三医院数据科学临床医学中心) School of Computer Science, Peking University(北京大学计算机学院)

AI总结 本文提出AdaTracker,通过显式建模躯体特定约束实现跨躯体主动视觉跟踪,采用上下文感知策略和辅助目标提升鲁棒性,在模拟和现实实验中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20290 2026-04-23 cs.RO

Onboard Wind Estimation for Small UAVs Equipped with Low-Cost Sensors: An Aerodynamic Model-Integrated Filtering Approach

为小型无人机配备低成本传感器的机载风速估计:一种集成了气动模型的滤波方法

Bingchen Cheng, Tielin Ma, Jingcheng Fu, Lulu Tao, Tianhui Guo

机构 * Shenyuan Honors College, Beihang University(北航 Shenyan 勋章学院) Institute of Unmanned System, Beihang University(北航 无人机系统研究院) School of Aeronautical Science and Engineering, Beihang University(北航 航空科学与工程学院)

AI总结 本文提出一种利用低成本传感器估计小型无人机飞行状态和风速的方法,结合扩展卡尔曼滤波和自适应移动平均估计技术,提高了风速估计的准确性和平滑度,通过仿真和飞行测试验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20231 2026-04-23 cs.RO

Toward Cooperative Driving in Mixed Traffic: An Adaptive Potential Game-Based Approach with Field Test Verification

迈向混合交通的协作驾驶:一种基于自适应势游戏的适应性方法与实地测试验证

Shiyu Fang, Xiaocong Zhao, Xuekai Liu, Peng Hang, Jianqiang Wang, Yunpeng Wang, Jian Sun

机构 * State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(智能绿色车辆与移动国家重点实验室,清华大学) State Key Lab of Intelligent Transportation System, School of Transportation Science and Engineering, Beihang University(智能交通运输系统实验室,北京航空航天大学交通科学与工程学院)

AI总结 本文提出自适应势游戏框架,通过建立系统效用函数、引入Shapley值和动态优化人类驾驶车辆偏好,提升混合交通中的协作安全与效率,实验证实其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19790 2026-04-23 cs.AI cs.LG

Hidden Reliability Risks in Large Language Models: Systematic Identification of Precision-Induced Output Disagreements

大语言模型中的隐藏可靠性风险:系统性识别精度诱导的输出分歧

Yifei Wang, Tianlin Li, Xiaohan Zhang, Xiaoyu Zhang, Wei Ma, Mingfei Cheng, Li Pan

机构 * Shanghai Jiao Tong University(上海交通大学) Beihang University(北航) Nanyang Technological University(南洋理工大学) Singapore Management University(新加坡管理学院)

AI总结 本文提出PrecisionDiff框架,用于系统检测大语言模型在不同精度下的行为分歧,通过生成精度敏感测试输入并进行跨精度比较分析,揭示传统方法难以发现的细微差异,实验表明此类分歧在多个开源对齐LLM中普遍存在,PrecisionDiff在检测此类问题上表现优异。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18036 2026-04-23 cs.CL

Harnessing Multiple Large Language Models: A Survey on LLM Ensemble

利用多个大语言模型:关于LLM集成的综述

Zhijun Chen, Xiaodong Lu, Jingzheng Li, Pengpeng Chen, Zhuoran Li, Kai Sun, Yuankai Luo, Qianren Mao, Ming Li, Likang Xiao, Dingqi Yang, Xiao Huang, Yikun Ban, Hailong Sun, Philip S. Yu

机构 * State Key Laboratory of Complex & Critical Software Environment, Beihang University, Beijing, China(复杂与关键软件环境国家重点实验室,北京航空航天大学,北京,中国) Zhongguancun Laboratory, Beijing, China(中关村实验室,北京,中国) Aviation System Engineering Institute of China, Beijing, China(中国航空系统工程研究院,北京,中国) Xi’an Jiaotong University, Xi’an, China(西安交通大学,西安,中国) Nanjing University, Nanjing, China(南京大学,南京,中国) Tsinghua University, Beijing, China(清华大学,北京,中国) University of Macau, Macau SAR, China(澳门大学,澳门特别行政区,中国) The Hong Kong Polytechnic University, Hong Kong, China(香港理工大学,香港,中国) University of Illinois at Chicago, Chicago, USA(伊利诺伊大学香槟分校,芝加哥,美国)

AI总结 本文系统回顾了LLM集成的最新发展,介绍了分类方法,讨论了相关研究问题,并提出了未来研究方向。

Comments 12 pages, 2 figures, codebase: https://github.com/junchenzhi/Awesome-LLM-Ensemble

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20755 2026-04-23 cs.AI cs.LG

V-tableR1: Process-Supervised Multimodal Table Reasoning with Critic-Guided Policy Optimization

V-tableR1:基于过程监督的多模态表格推理与批评引导的策略优化

Yubo Jiang, Yitong An, Xin Yang, Abudukelimu Wuerkaixi, Xuxin Cheng, Fengying Xie, Zhiguo Jiang, Cao Liu, Ke Zeng, Haopeng Zhang

机构 * School of Astronautics Beihang University(北航航天学院) Longcat Interaction Team Meituan(美团长猫交互团队) Tianmushan Laboratory Beihang University(北航天门实验室)

AI总结 V-tableR1通过过程监督强化学习框架,利用表格的确定性网格结构,提升多模态大语言模型的推理能力,通过批评引导策略优化方法,实现更严谨的逻辑推导,取得开放源代码模型在复杂表格基准上的最佳性能。

Comments 15 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19083 2026-04-22 cs.CR cs.AI

ProjLens: Unveiling the Role of Projectors in Multimodal Model Safety

ProjLens: 揭示项目器在多模态模型安全中的作用

Kun Wang, Cheng Qian, Miao Yu, Lilan Peng, Liang Lin, Jiaming Zhang, Tianyu Zhang, Yu Cheng, Yang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Nanyang Technological University(南洋理工大学) Southwest Jiaotong University(西南交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 ProjLens通过分析多模态大语言模型中的后门攻击机制,揭示了项目器在安全漏洞中的关键作用,发现后门注入参数编码于低秩子空间,并通过实验验证了激活机制的差异。

Comments 18 pages ,15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02993 2026-04-22 cs.CL

Stable-RAG: Mitigating Retrieval-Permutation-Induced Hallucinations in Retrieval-Augmented Generation

Stable-RAG:缓解检索排列引起的幻觉

Qianchi Zhang, Hainan Zhang, Liang Pang, Hongwei Zheng, Zhiming Zheng

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算先进创新中心) School of Artificial Intelligence, Beihang University(北航人工智能学院) Beijing Academy of Blockchain and Edge Computing(北京区块链与边缘计算研究院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

AI总结 Stable-RAG通过利用检索排列敏感性估计,缓解检索排列引起的幻觉,提升问答准确性与一致性。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22673 2026-04-22 cs.AI

Beyond Itinerary Planning-A Real-World Benchmark for Multi-Turn and Tool-Using Travel Tasks

超越行程规划——多轮和工具使用旅行任务的现实世界基准

Xiang Cheng, Yulan Hu, Xiangwen Zhang, Lu Xu, Lide Tan, Zheng Pan, Xin Li, Yong Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光林人工智能学院) National University of Singapore(新加坡国立大学) Beihang University(北航) AMAP, Alibaba Group(阿里云实验室)

AI总结 本文提出TravelBench,一个现实世界旅行规划基准,通过多轮对话和工具使用评估LLM的独立解决问题、隐含偏好获取和能力边界识别能力。

Comments Accepted to the ACL 2026 Main Conference. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18275 2026-04-22 cs.CV

Visual Adversarial Attack on Vision-Language Models for Autonomous Driving

面向自动驾驶的视觉对抗攻击研究

Tianyuan Zhang, Lu Wang, Xinwei Zhang, Yitong Zhang, Boyi Jia, Siyuan Liang, Shengshan Hu, Qiang Fu, Aishan Liu, Xianglong Liu

机构 * Beihang University(北航) National University of Singapore(国立新加坡大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出ADvLM框架,针对自动驾驶中视觉语言模型的特殊需求,解决文本指令变异性和视觉场景时间序列性问题,实现高效对抗攻击。

Comments Accepted by Machine Intelligence Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18376 2026-04-21 cs.CV

Towards Robust Text-to-Image Person Retrieval: Multi-View Reformulation for Semantic Compensation

面向鲁棒的文本到图像人物检索:多视图重新公式化用于语义补偿

Chao Yuan, Yujian Zhao, Haoxuan Xu, Guanglin Niu

机构 * Beihang University(北航)

AI总结 本文提出基于大语言模型的语义补偿框架,通过多视图语义重新公式化和特征补偿提升跨模态表示一致性,解决文本到图像检索中的表达漂移问题,实验表明其在三个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18356 2026-04-21 cs.CL

ComPASS: Towards Personalized Agentic Social Support via Tool-Augmented Companionship

ComPASS:通过工具增强的陪伴实现个性化代理社交支持

Zhaopei Huang, Yanfeng Jia, Jiayi Zhao, Xinjie Zhang, Wenxuan Wang, Qin Jin

机构 * Renmin University of China(中国人民大学) Beihang University(北京航空航天大学)

AI总结 本文提出ComPASS框架,通过外部工具增强代理能力,构建首个个性化社交支持基准,训练出ComPASS-Qwen模型,提升响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18260 2026-04-21 cs.CV

Geometry-Guided 3D Visual Token Pruning for Video-Language Models

基于几何的3D视觉标记修剪用于视频-语言模型

Han Li, Zehao Huang, Jiahui Fu, Naiyan Wang, Si Liu

机构 * Beihang University(北京航空航天大学)

AI总结 本文提出Geo3DPruner框架,通过几何感知全局注意力建模跨帧相关性,并采用两阶段修剪过程,保留90%的视觉标记同时保持90%原始性能,优于现有文本引导和视觉引导修剪方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17863 2026-04-21 cs.RO cs.AI

Periodic Steady-State Control of a Handkerchief-Spinning Task Using a Parallel Anti-Parallelogram Tendon-driven Wrist

使用平行反平行四边形腱驱动手腕实现手帕纺任务的周期稳态控制

Lei Liu, Haonan Zhang, Huahang Xu, Zefan Zhang, Lulu Chang, Lei Lv, Andrew Ross McIntosh, Kai Sun, Zhenshan Bing, Jiahong Dong, Fuchun Sun

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Biomedical Engineering, Tsinghua University(清华大学生物医学工程系) School of Artificial Intelligence, Beihang University(北航人工智能学院) Institute of Nuclear and New Energy Technology, Tsinghua University(清华大学核能与新能量技术研究院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Automation, Nanjing University of Science and Technology(南京理工大学自动化学院) Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海智能自主系统研究院) Department of Mechanical Engineering, Tsinghua University(清华大学机械工程系) School of Computation, Information and Technology, Technical University of Munich(慕尼黑工业大学计算、信息与技术学院) State Key Laboratory for Novel Software Technology and the School of Science and Technology, Nanjing University (Suzhou Campus)(南京大学软件新技术国家重点实验室(苏州校区)) Hepato-pancreato-biliary Center, Beijing Tsinghua Changgung Hospital(北京清华长庚医院肝胆外科中心) Key Laboratory of Digital Intelligence Hepatology (Ministry of Education), Beijing, China(教育部数字智能肝病重点实验室(北京)) School of Clinical Medicine, Tsinghua Medicine, Tsinghua University(清华大学医学部临床医学学院)

AI总结 本文提出了一种平行反平行四边形腱驱动手腕,结合分层控制方案和粒子弹簧模型,实现了高动态手帕纺任务的高展开比和高精度跟踪。

Comments ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21228 2026-04-21 cs.CL cs.AI

ImpRIF: Stronger Implicit Reasoning Leads to Better Complex Instruction Following

ImpRIF:更强的隐式推理导致更好的复杂指令遵循

Yuancheng Yang, Lin Yang, Xu Wang, Chao Tong, Haihua Yang

机构 * ByteDance China(字节跳动中国) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室)

AI总结 本文提出ImpRIF方法,通过构建可验证推理图提升大语言模型对隐式推理指令的理解,从而增强复杂指令遵循能力,在五个基准测试中表现优异。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏