arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Beihang University(北京航空航天大学)

共收录 1226
2605.22513 2026-05-22 cs.AI

Meta-Learning for Rapid Adaptation in Reference Tracking of Uncertain Nonlinear Systems

为不确定非线性系统参考跟踪设计快速适应的元学习

Jiaqi Yan, Ankush Chakrabarty, Niklas Schmid, John Lygeros, Alisa Rupenyan

机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院) Mitsubishi Electric Research Laboratories(三菱电机研究实验室) Automatic Control Laboratory, ETH Zurich(瑞士联邦理工学院自动化实验室) ZHAW Centre for Artificial Intelligence, Zurich University of Applied Sciences(瑞士应用科学大学人工智能中心)

AI总结 本文针对不确定非线性系统的参考跟踪问题,提出基于元学习的控制框架,通过利用源系统数据加速训练并提升控制性能,通过两阶段方法实现对目标系统的快速适应。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22446 2026-05-22 cs.CV cs.AI cs.RO

Pre-VLA: Preemptive Runtime Verification for Reliable Vision-Language-Action and World-Model Rollouts

Pre-VLA: 预防性运行时验证用于可靠视觉-语言-动作和世界模型展开

Zhen Sun, Yongjian Guo, Haoran Sun, Luqiao Wang, Wei Lu, Jiachi Ji, Shengzhe Ji, Junwu Xiong, Zhijun Meng

机构 * Beihang University(北京航空航天大学) Tsinghua University(清华大学) Peking University(北京大学) JDT AI Infra Zhejiang University(浙江大学)

AI总结 本文提出Pre-VLA,一种统一的运行时验证架构,用于在物理执行或世界模型想象之前评估动作的有效性,以提高视觉-语言-动作和世界模型展开的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22351 2026-05-22 cs.CV

QuantSR+: Pushing the Limit of Quantized Image Super-Resolution Networks

QuantSR+: 推动量化图像超分辨率网络的极限

Haotong Qin, Xudong Ma, Xianglong Liu, Jie Luo, Jinyang Guo, Michele Magno, Yulun Zhang

机构 * ETH Zurich(苏黎世联邦理工学院) Shanghai Jiao Tong University(上海交通大学) Beihang University(北京航空航天大学)

AI总结 本文提出QuantSR+框架,通过改进量化操作、网络设计和训练优化,实现了在精度和效率之间的更好平衡,针对超低精度下的性能下降问题,提出了三种关键技术贡献:重分布驱动位数确定、量化瘦身架构和瘦身引导的功能局部蒸馏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22175 2026-05-22 cs.SE cs.AI

SWE-Mutation: Can LLMs Generate Reliable Test Suites in Software Engineering?

SWE-Mutation:LLMs能否在软件工程中生成可靠的测试套件?

Yuxuan Sun, Yuze Zhao, Yufeng Wang, Yao Du, Zhiyuan Ma, Jinbo Wang, Mengdi Zhang, Kai Zhang, Zhenya Huang

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) Beihang University(北航) School of Mathematical Sciences, Peking University(北京大学数学科学学院) NeoShell AI Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

AI总结 本文提出SWE-Mutation基准,用于评估LLM生成的测试套件质量,通过系统性地变异解决方案来测试测试套件的可靠性,并发现当前LLM在生成可靠且具有判别力的测试套件方面存在不足。

Comments 24 pages, 8 figures

Journal ref ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02938 2026-05-22 cs.LG cs.AI

Beyond One-Size-Fits-All: Adaptive Subgraph Denoising for Zero-Shot Graph Learning with Large Language Models

超越一刀切:基于大语言模型的零样本图学习中的自适应子图去噪

Fengzhi Li, Liang Zhang, Yuan Zuo, Ruiqing Zhao, YanSong Liu, Yunfei Ma, Fanyu Meng, Junlan Feng

机构 * JIUTIAN Research(JIUTIAN研究) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) MIIT Key Laboratory of Data and Decision Intelligence(信息与决策智能重点实验室) Beihang University(北航)

AI总结 本文提出GraphSSR框架,通过自适应子图提取和去噪方法,解决传统图神经网络在零样本学习中泛化能力不足的问题,提升大语言模型在图推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04537 2026-05-22 cs.LG cs.CL

Linear Dynamics in the RLVR Training of Large Language Models

在大语言模型RLVR训练中的线性动力学

Tianle Wang, Jiayu Liu, Zhongyuan Wu, Shenghao Jin, Wei Chen, Hao Xu, Ning Miao

机构 * Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Hong Kong Institute of AI for Science, City University of Hong Kong(香港城市大学人工智能科学研究院) Li Auto Inc. Beihang University(北航大学)

AI总结 本文研究了强化学习可验证奖励(RLVR)在大语言模型训练中的内部动态,发现RLVR在多种模型和训练配置下均进入线性区域,通过实验和理论分析证明这种线性特性源于训练信号的高方差和噪声,且具有预测性和实用性。

Comments Major revision: substantially reorganized the manuscript and added a theoretical explanation section. The replacement is intended for the same arXiv paper; the core topic and contribution remain the same

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03784 2026-05-22 cs.AI

Specification-Driven Generation and Evaluation of Discrete-Event World Models via the DEVS Formalism

通过DEVS形式化方法驱动的离散事件世界模型生成与评估

Zheyu Chen, Huiteng Zhuang, Zhuohuan Li, Chuanhao Li

机构 * Zhili College, Tsinghua University(清华大学紫光学院) School of Transportation Science and Engineering, Beihang University(北航交通科学与工程学院) Department of Industrial Engineering, Tsinghua University(清华大学工业工程系)

AI总结 本文提出了一种基于自然语言规范在线生成离散事件世界模型的方法,结合了显式模拟器的可靠性与神经模型的适应性,通过DEVS形式化方法和分阶段的LLM生成流程,实现了对事件和时间逻辑的结构推断,并通过基准测试集验证了模型的一致性和可验证性。

Comments 36 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02604 2026-05-22 cs.LG

Heterogeneous Agent Collaborative Reinforcement Learning

异质智能体协作强化学习

Zhixia Zhang, Zixuan Huang, Gongxun Li, Huaiyang Wang, Chengyi Yuan, Xin Xia, Deqing Wang, Fuzhen Zhuang, Shuai Ma, Ning Ding, Yaodong Yang, Jianxin Li, Yikun Ban

机构 * Beihang University(北航) Bytedance China(字节跳动中国) Tsinghua University(清华大学) Peking University(北京大学) Apple(苹果公司)

AI总结 本文提出了一种新的强化学习从可验证奖励(RLVR)问题HACRL,通过异质智能体共享验证的轨迹实现协同优化,解决了孤立多智能体在线优化的效率问题,并提出HACPO算法以最大化样本利用率和跨智能体知识转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12138 2026-05-22 cs.SE cs.AI

Exploring Code Analysis: Zero-Shot Insights on Syntax and Semantics with LLMs

探索代码分析:利用大语言模型进行语法和语义的零样本洞察

Wei Ma, Zhihao Lin, Shangqing Liu, Qiang Hu, Ye Liu, Wenhan Wang, Cen Zhang, Liming Nie, Li Li, Yang Liu, Lingxiao Jiang

机构 * Singapore Management University(新加坡国立大学) Blekinge Institute of Technology(布莱金厄学院) Beihang University(北航) State Key Laboratory of Novel Software Technology, Nanjing University(南京大学软件新技术国家重点实验室) The University of Tokyo(东京大学) University of Alberta(阿尔伯塔大学) Nanyang Technological University(南洋理工大学) Shenzhen Technology University(深圳技术大学)

AI总结 本文研究了大语言模型在代码分析中的应用,通过评估21种最先进的LLM在四种语言中的九项任务,揭示了LLM在语法解析、静态语义推断和动态推理方面的性能,发现其在跨语言泛化方面有优势,但动态推理仍有限,提出了一个经过验证的评估框架。

Comments Accepted at ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21475 2026-05-21 cs.LG

Is Fixing Schema Graphs Necessary? Full-Resolution Graph Structure Learning for Relational Deep Learning

关系预测任务是否需要固定模式图?关系深度学习中的全分辨率图结构学习

Yi Huang, Qingyun Sun, Jia Li, Xingcheng Fu, Jianxin Li

机构 * SKLCCSE, School of Computer Science and Engineering, Beihang University, Beijing, China(信息与电子学院,北京航空航天大学,北京,中国) Key Lab of Education Blockchain and Intelligent Technology, Ministry of Education, Guangxi Normal University, Guilin, China(教育区块链与智能技术重点实验室,教育部,广西师范大学,桂林,中国)

AI总结 本文提出了一种全分辨率且可优化的图结构学习框架FROG,用于关系深度学习,将关系结构学习建模为可学习的表角色建模问题,允许表作为节点和边在信息传递中发挥作用,并设计了基于角色的信息传递机制,以捕捉关系语义,同时通过功能依赖约束确保语义一致性,实验表明该方法在多个下游任务中优于现有方法。

Comments Accepted by the Forty-third International Conference on Machine Learning (ICML2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21112 2026-05-21 cs.CV

RCGDet3D: Rethinking 4D Radar-Camera Fusion-based 3D Object Detection with Enhanced Radar Feature Encoding

RCGDet3D: 重新思考基于增强雷达特征编码的4D雷达-相机融合3D目标检测

Weiyi Xiong, Bing Zhu

机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院)

AI总结 本文提出RCGDet3D,通过增强雷达特征编码而非复杂的多模态融合策略,实现了在3D目标检测中更高的准确性和实时性,为实时部署设定了新标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20876 2026-05-21 cs.CL cs.AI

Terminal-World: Scaling Terminal-Agent Environments via Agent Skills

Terminal-World: 通过智能体技能扩展终端智能体环境

Zihao Cheng, Hongru Wang, Zeming Liu, Xinyi Wang, Xiangrong Zhu, Yuhang Guo, Wei Lin, Jeff Z. Pan, Yunhong Wang

机构 * School of Computer Science and Engineering, Beihang University, Beijing, China(北京航空航天大学计算机科学与工程学院) Independent Researcher(独立研究者) Beijing Institute of Technology(北京理工大学) University of Edinburgh(爱丁堡大学)

AI总结 本文提出Terminal-World,一种自动化流程,利用智能体技能作为核心合成原语,共同编码任务目标、执行时机和方法,从而生成任务指令、环境和教师轨迹。通过构建5,723个训练环境,训练出Terminal-World-8B/14B/32B模型,在六个基准测试中均优于终端智能体基线,其中Terminal-World-32B在Terminal-Bench 2.0上以仅1.2%的训练数据超越Nemotron-Terminal-32B。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20863 2026-05-21 cs.DC cs.LG

PlexRL: Cluster-Level Orchestration of Serviceized LLM Execution for RLVR

PlexRL: 服务化大语言模型执行在RLVR中的集群级编排

Yiqi Zhang, Fangzheng Jiao, Tian Tang, Boyu Tian, Hangyu Wang, Qiaoling Chen, Guoteng Wang, Zhen Jiang, Peng Sun, Ping Zhang, Xiaohe Hu, Ziming Liu, Menghao Zhang, Yanmin Jia, Yang You, Siyuan Feng

机构 * National University of Singapore(新加坡国立大学) Beihang University(北航) Shanghai Qiji Zhifeng Co., Ltd.(上海启智风科技有限公司) Nanyang Technological University(南洋理工大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出PlexRL,通过集群级编排服务化大语言模型执行,解决RLVR训练中的效率问题,提升集群容量并降低GPU小时成本,同时保持算法灵活性和最小的单任务开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20808 2026-05-21 cs.CV

Spatial Gram Alignment for Ultra-High-Resolution Image Synthesis

基于超高清图像合成的空间图对齐

Jinjin Zhang, Xiefan Guo, Di Huang

机构 * Beihang University(北航大学)

AI总结 本文提出空间图对齐(SGA)方法,通过利用视觉基础模型的表示先验,保留LDMs的生成能力,解决超高清图像合成中生成质量与结构完整性之间的冲突,实现高质量的文本到图像合成。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20641 2026-05-21 cs.CR cs.AI cs.LG

Trusted Weights, Treacherous Optimizations? Optimization-Triggered Backdoor Attacks on LLMs

可信的权重,危险的优化?针对大语言模型的优化触发后门攻击

Yifei Wang, Tianlin Li, Xiaohan Zhang, Yida Yang, Xiaoyu Zhang, Li Pan

机构 * Shanghai Jiao Tong University(上海交通大学) Beihang University(北京航空航天大学) Tongji University(同济大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出了一种利用编译优化过程植入隐蔽后门的攻击方法,通过两种互补策略在无需修改编译器或硬件的情况下,实现对大语言模型的后门攻击,并展示了其在多个开源大语言模型上的高成功率。

Comments 20 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18579 2026-05-21 cs.LG

S2Aligner: Pair-Efficient and Transferable Pre-Training for Sparse Text-Attributed Graphs

S2Aligner: 用于稀疏文本属性图的高效且可迁移的预训练方法

Yuhan Wang, Haopeng Zhang, Yibo Ding, Jiaqi Yu, Xinyu Zhao, Yuhang Liu, Ziwei Zhang, Xiao Wang, Ruijie Wang

机构 * Beihang University(北航大学) Tianjin University(天津大学)

AI总结 本文提出S2Aligner,一种针对稀疏文本属性图的高效且可迁移的预训练方法,通过解耦语义对齐与结构建模,增强对齐过程而不污染共享的语义空间,从而减少跨域泛化差距。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17931 2026-05-21 cs.CV physics.med-ph

Multi-needle Localization for Pelvic Seed Implant Brachytherapy based on Tip-handle Detection and Matching

基于尖端-柄检测与匹配的盆腔种子植入近距离放射治疗多针定位

Zhuo Xiao, Fugen Zhou, Jingjing Wang, Chongyu He, Bo Liu, Haitao Sun, Zhe Ji, Yuliang Jiang, Junjie Wang, Qiuwen Wu

机构 * Image Processing Center, Beihang University(北航图像处理中心) Department of Radiation Oncology, Peking University Third Hospital(北京大学第三医院放疗科) Department of Radiation Oncology, Duke University Medical Center(达勒姆大学医学中心放疗科)

AI总结 本文提出了一种基于尖端-柄检测与匹配的新方法,用于解决术中CT图像中多针定位的难题,通过锚点自由网络和贪心匹配与合并方法,在100名患者的数据集上实现了更高的精度和F1分数,为复杂临床场景下的针定位提供了更鲁棒和准确的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20373 2026-05-21 cs.RO cs.AI cs.CV

SUGAR: A Scalable Human-Video-Driven Generalizable Humanoid Loco-Manipulation Learning Framework

SUGAR: 一种可扩展的人类-视频驱动的通用人形机器人运动-操作学习框架

Tianshu Wu, Xiangqi Kong, Yue Chen, Qize Yu, Hang Ye, Jia Li, Yizhou Wang, Hao Dong

机构 * CFCS, School of Computer Science, Peking University(计算机学院,北京大学计算机科学系) School of Computer Science and Engineering, Beihang University(计算机科学与工程学院,北航)

AI总结 该研究提出SUGAR框架,通过将多样化的视频转化为可部署的人形机器人运动-操作技能,无需特定任务的奖励工程或参考动作条件,在仿真和现实硬件中实现了六种代表性任务的高性能表现,展示了可扩展性和零样本现实迁移能力。

Comments Project Page: https://tianshuwu.github.io/sugar-humanoid/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20090 2026-05-20 cs.CV

MetaEarth-MM: Unified Multimodal Remote Sensing Image Generation with Scene-centered Joint Modeling

MetaEarth-MM:基于场景中心联合建模的多模态遥感图像生成

Zhiping Yu, Chenyang Liu, Jinqi Cao, Qinzhe Yang, Siwei Yu, Zhengxia Zou, Zhenwei Shi

机构 * Department of Aerospace Intelligent Science and Technology, School of Astronautics, Beihang University(航天智能科学与技术系,航天学院,北京航空航天大学) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(虚拟现实技术与系统国家重点实验室,北京航空航天大学) Shenyuan Honors College, Beihang University(Shen Yuan荣誉学院,北京航空航天大学)

AI总结 本文提出MetaEarth-MM模型,通过统一的多模态遥感图像生成框架,实现多模态图像的联合生成和任意模态之间的转换,展示了其在多模态遥感观测中的强大生成能力和广泛适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20084 2026-05-20 cs.CL cs.AI

BalanceRAG: Joint Risk Calibration for Cascaded Retrieval-Augmented Generation

BalanceRAG: 为级联检索增强生成进行联合风险校准

Zijun Jia, Yuanchang Ye, Sen Jia, Yiyao Qian, Haoning Wang, Baojie Chen, Diyin Tang, Jinsong Yu, Zhiyuan Wang

机构 * Beihang University(北航) Shenzhen Institute of Advanced Technology(深圳先进技术研究院) Zhejiang University of Finance & Economics(浙江财经大学) University of Electronic Science and Technology of China(电子科技大学)

AI总结 本文提出BalanceRAG,一种用于级联检索增强生成的联合风险校准方法,通过在二维晶格上确定安全操作点,实现风险自适应的阈值校准,从而在控制系统级错误率的同时保留更多示例,并扩展到多风险校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19988 2026-05-20 cs.SE cs.AI cs.DB cs.PF

A Case for Agentic Tuning: From Documentation to Action in PostgreSQL

为代理调优辩护:从文档到PostgreSQL中的行动

Hongyu Lin, Mingyu Li, Weichen Zhang, Yihang Lou, Mingjie Xing, Yanjun Wu, Haibo Chen

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Key Laboratory of System Software (Chinese Academy of Sciences)(中国科学院系统软件重点实验室) Beihang University(北航) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出通过动态行动替代静态文档进行系统调优,引入PerfEvolve工具,利用LLM代理实现版本一致性验证、工作负载特定分析和多参数联合优化,实验表明其在PostgreSQL上比现有文档驱动调优方法提升35.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19390 2026-05-20 cs.CV

LMM-Track4D: Eliciting 4D Dynamic Reasoning in LMMs via Trajectory-Grounded Dialogue

LMM-Track4D: 通过轨迹引导的对话激发LMM中的4D动态推理

Chaoyue Li, Yongxue Xu, Jie Feng, Jiayu Ding

机构 * Huazhong University of Science and Technology(华中科技大学) Sun Yat-sen University(中山大学) Beihang University(北航) Peking University(北京大学)

AI总结 本文提出LMM-Track4D任务,通过轨迹引导的多轮时空对话,结合RTGE、TRK和OSK-RA解码器,提升LMM在4D动态推理中的性能,实验表明显式动态状态建模是有效设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19289 2026-05-20 cs.CV

What Makes Synthetic Data Effective in Image Segmentation

是什么使合成数据在图像分割中有效

Jinjin Zhang, Xiefan Guo, Yizhou Jin, Nan Zhou, Di Huang

机构 * State Key Laboratory of Complex and Critical Software Environment(复杂与关键软件环境国家重点实验室) Beihang University(北京航空航天大学) School of Computer Science and Engineering(计算机科学与工程学院)

AI总结 本文研究了合成数据在图像分割中的有效性,通过分析最先进的扩散模型生成的合成图像,发现密集场景构成和精细实例保真度是关键因素,并提出了一种统一框架SENSE,以提升分割性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10344 2026-05-20 cs.AI

TMAS: Scaling Test-Time Compute via Multi-Agent Synergy

TMAS: 通过多智能体协同实现测试时间计算的扩展

George Wu, Nan Jing, Qing Yi, Chuan Hao, Ming Yang, Feng Chang, Yuan Wei, Jian Yang, Ran Tao, Bryan Dai

机构 * IQuest Research(IQuest研究) Beihang University(北航)

AI总结 本文提出TMAS框架,通过多智能体协同实现测试时间计算的扩展,利用层次化记忆和混合奖励强化学习提升推理能力和探索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18915 2026-05-20 cs.CR cs.AI

DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs

DMN: 一种用于多图像输入多模态大语言模型的组合框架

Wenzhuo Xu, Zhipeng Wei, Zonghao Ying, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang, Quanchen Zou

机构 * AI Security Lab(360人工智能安全实验室) International Computer Science Institute(国际计算机科学研究所) UC Berkeley(加州大学伯克利分校) Beihang University(北航大学)

AI总结 本文提出DMN框架,通过分布式指令、多模态证据和数字链任务,提升多图像输入多模态大语言模型的 jailbreak 性能,实验表明其在GPT-4o、Gemini-2.5-pro和Claude Sonnet 4上的攻击成功率超过90%。

Comments ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18729 2026-05-19 cs.RO cs.CV

Robo-Cortex: A Self-Evolving Embodied Agent via Dual-Grain Cognitive Memory and Autonomous Knowledge Induction

Robo-Cortex: 通过双粒认知记忆和自主知识诱导实现自我进化具身智能体

Nga Teng Chan, Yi Zhang, Yechi Liu, Renwen Cui, Fanhu Zeng, Zeyuan Ding, Xiancong Ren, Zhang Zhang, Qifeng Chen, Jian Liu, Yong Dai, Xiaozhu Ju

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) X-Humanoid Institute of Automation, CAS(中国科学院自动化研究所) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

AI总结 本文提出Robo-Cortex框架,通过双粒认知记忆和自主知识诱导机制,使机器人能够自主诱导导航启发式方法并优化认知策略,从而在复杂环境中实现自主导航和探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18617 2026-05-19 cs.RO cs.AI cs.CV

ManiSoft: Towards Vision-Language Manipulation for Soft Continuum Robotics

ManiSoft: 向视觉-语言操控的柔软连续机器人迈进

Ziyu Wei, Luting Wang, Chen Gao, Li Wen, Si Liu

机构 * Beihang University(北京航空航天大学) National University of Singapore(新加坡国立大学) Hangzhou Innovation Institute, Beihang University(北京航空航天大学杭州创新研究院)

AI总结 本文提出ManiSoft基准,用于研究柔软连续机器人的视觉-语言操控,通过定制模拟器结合真实柔软体动力学和丰富的接触交互,定义了四个任务以展示变形控制的不同方面,并通过自动化流程生成6300个多样场景和专家轨迹,评估了三种代表性策略模型的性能。

Comments Accepted in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18475 2026-05-19 cs.LG cs.AI

GAMMA: Global Bit Allocation for Mixed-Precision Models under Arbitrary Budgets

GAMMA:在任意预算下为混合精度模型进行全局位分配

Zhangyang Yao, Haiyan Zhao, Haoyu Wang, Tianbo Huang, Lihua Zhang, Xu Han

机构 * Beihang University(北航) Tsinghua University(清华) ByteDance Inc(字节跳动)

AI总结 本文提出GAMMA框架,通过后训练流水线学习模块级精度偏好,优化教师强制隐藏状态重建目标并利用整数规划实现精确预算分配,从而在任意预算下提升大语言模型的精度,优于固定精度基线和搜索基混合精度方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18048 2026-05-19 cs.AI

DocOS: Towards Proactive Document-Guided Actions in GUI Agents

DocOS: 向 GUI 代理中的主动文档引导行动迈进

Jingjing Liu, Ziye Huang, Zihao Cheng, Zeming Liu, Jiahong Wu, Yuhang Guo, Kehai Chen, Yunhong Wang, Haifeng Wang

机构 * School of Computer Science and Engineering, Beihang University, Beijing, China(北航计算机科学与工程学院) School of Computer Science, Peking University, Beijing, China(北京大学计算机科学学院) School of Computer Science and Technology, Beijing Institute of Technology, Beijing(北京理工大学计算机科学与技术学院) School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)计算机科学与技术学院) Baidu Inc., Beijing, China(百度公司)

AI总结 本文提出 DocOS 基准,通过引导文档解决长尾任务,解决 GUI 代理在动态开放网络环境中处理长尾任务的能力限制,核心方法是主动文档引导行动,主要贡献是设计了一个评估文档引导问题解决能力的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17506 2026-05-19 cs.CV

Degradation Frequency Curve: An Explicit Frequency-Quantified Representation for All-in-One Image Restoration

退化频率曲线:一种用于全能图像恢复的显式频率量化表示

Xinghua Huang, Zhixiong Yang, Chen Wu, Shengxi Li, Shuaifeng Zhi, Yue Zhang, Qibin Hou, Xin Deng, Jingyuan Xia

机构 * College of Electronic Science, National University of Defense Technology(国防科技大学电子科学学院) College of Electronic Engineering, Beihang University(北航电子工程学院) VCIP, School of Computer Science, Nankai University(南开大学计算机科学学院)

AI总结 本文提出退化频率曲线(DFC),一种显式量化退化影响的频率域表示方法,通过测量频带内的残差到退化能量比来量化退化响应,从而为全能图像恢复提供有效的表示基础,提升了在复杂退化条件下的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏