arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Beihang University(北京航空航天大学)

共收录 91
2506.07031 2026-06-26 cs.CR cs.AI cs.CL 版本更新

HauntAttack: When Attack Follows Reasoning as a Shadow

HauntAttack:当攻击如影随形地跟随推理

Jingyuan Ma, Rui Li, Zheng Li, Junfeng Liu, Heming Xia, Lei Sha, Zhifang Sui

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) StepFun Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Institute of Artificial Intelligence, Beihang University(北航人工智能研究院)

AI总结 提出HauntAttack黑盒对抗攻击框架,通过将有害指令嵌入推理问题,引导大型推理模型逐步产生不安全输出,在11个模型上平均攻击成功率超70%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17916 2026-06-26 cs.CV 版本更新

EndoUFM: Utilizing Foundation Models for Monocular depth estimation of endoscopic images

EndoUFM:利用基础模型进行内窥镜图像的单目深度估计

Xinning Yao, Bo Liu, Bojian Li, Jingjing Wang, Jinghua Yue, Fugen Zhou

机构 * Image Processing Center, Beihang University(北京航空航天大学图像处理中心) State Key Laboratory of High-Efficiency Reusable Aerospace Transportation Technology(高效可重复航天运输技术国家重点实验室)

AI总结 提出EndoUFM框架,通过双基础模型和自适应微调策略(RVLoRA和Res-DSC)提升内窥镜图像单目深度估计性能,在多个数据集上达到最优。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20256 2026-06-25 cs.LG cs.AI 版本更新

FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning

FBOS-RL: 基于反馈的双目标协同强化学习

Xikai Zhang, Yongzhi Li, Likang Xiao, Yingze Zhang, Yanhua Cheng, Quan Chen, Peng Jiang, Wenjun Wu, Liu Liu

机构 * Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Kuaishou Technology(快手科技)

AI总结 本文提出FBOS-RL框架,通过环境反馈引导探索增强,并设计两个相互促进的目标:以利用为导向的策略对齐(EPA)和以探索为导向的能力培养(ECC),从而提高强化学习的训练效率和最终性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03723 2026-06-25 cs.CV 版本更新

SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation

SymphoMotion:相机运动与物体动态的联合控制以实现一致的视频生成

Guiyu Zhang, Yabo Chen, Xunzhi Xiang, Junchao Huang, Zhongyu Wang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiaotong University(上海交通大学) Nanjing University(南京大学) Beihang University(北京航空航天大学)

AI总结 SymphoMotion通过联合控制相机运动和物体动态,提高视频生成的一致性和表达性,其核心方法结合了相机轨迹控制与物体动态控制机制,并引入了RealCOD-25K数据集进行大规模训练和评估,显著提升了视觉保真度和物体运动准确性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19964 2026-06-25 cs.CV 版本更新

2K Retrofit: Entropy-Guided Efficient Sparse Refinement for High-Resolution 3D Geometry Prediction

2K Retrofit: 熵引导的高效稀疏细化用于高分辨率3D几何预测

Tianbao Zhang, Zhenyu Liang, Zhenbo Song, Nana Wang, Xiaomei Zhang, Xudong Cai, Zheng Zhu, Kejian Wu, Gang Wang, Zhaoxin Fan

机构 * BUAA(北京航空航天大学) SJTU(上海交通大学) GigaAI XREAL NUST(南京理工大学) RUC(清华大学) NUDT(国防科技大学) UCAS(中国科学技术大学) BIBMS(北京工业大学)

AI总结 提出2K Retrofit框架,通过快速粗预测和基于熵的稀疏细化,在不修改基础模型的情况下实现高效2K分辨率几何预测,达到SOTA精度和速度。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09910 2026-06-25 cs.CL 版本更新

Learning to Erase Private Knowledge from Multi-Documents for Retrieval-Augmented Large Language Models

学习从多文档中擦除私有知识以用于检索增强型大语言模型

Yujing Wang, Jinwen Chen, Hainan Zhang, Liang Pang, Yongxin Tong, Binghui Guo, Hongwei Zheng, Zhiming Zheng

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(未来区块链与隐私计算北京先进创新中心) School of Artificial Intelligence, Beihang University, China(北京航空航天大学人工智能学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究所) Beijing Academy of Blockchain and Edge Computing(北京区块链与边缘计算研究院)

AI总结 提出Eraser4RAG,通过构建全局知识图谱、划分私有与公共子图并微调Flan-T5重写文档,结合PPO优化,有效擦除用户定义的私有知识,保留公共知识,防御去匿名化攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03742 2026-06-24 cs.CL cs.DB 版本更新

ErrorLLM: Modeling SQL Errors for Text-to-SQL Refinement

ErrorLLM: 为文本到SQL精炼建模SQL错误

Zijin Hong, Hao Chen, Zheng Yuan, Qinggang Zhang, Luyao Zhuang, Qing Liao, Feiran Huang, Yangqiu Song, Xiao Huang

机构 * The Hong Kong Polytechnic University(香港理工大学) City University of Macau(澳门城市大学) Jilin University(吉林大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Beihang University(北航大学)

AI总结 提出ErrorLLM框架,通过专用错误令牌和结构特征显式建模SQL错误,结合静态检测与错误引导精炼,显著提升文本到SQL生成质量。

Comments Accepted to SIGKDD2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10520 2026-06-24 cs.IR cs.LG 版本更新

Macro Graph of Experts for Billion-Scale Multi-Task Recommendation

专家宏观图:面向十亿级多任务推荐

Hongyu Yao, Zijin Hong, Hao Chen, Zhiqing Li, Qijie Shen, Zuobin Ying, Qihua Feng, Huan Gong, Feiran Huang

机构 * Jinan University(济南大学) The Hong Kong Polytechnic University(香港理工大学) City University of Macau(澳门城市大学) Alibaba Group(阿里巴巴集团) Beijing Institute of Technology(北京理工大学) National University of Defense Technology(国防科技大学) Beihang University(北航)

AI总结 提出MGOE框架,首次利用宏观图嵌入捕获任务特定宏观特征并建模专家相关性,在十亿级推荐系统中部署并超越现有方法。

Comments Accepted to SIGKDD2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16420 2026-06-24 cs.LG 版本更新

Hybrid Sequence Modeling and Reinforced Verification for Controllable Target-Conditioned Decision Making

混合序列建模与强化验证的可控目标条件决策

Yue Pei, Hongming Zhang, Chao Gao, Martin Müller, Yingying Zhang, Mengxiao Zhu, Hao Sheng, Ziliang Chen, Liang Lin, Haogang Zhu

机构 * School of Artificial Intelligence, Beihang University(北航人工智能学院) Department of Computing Science and Amii, University of Alberta(阿尔伯塔大学计算机科学系和Amii) Edmonton Research Center, Huawei Canada(华为加拿大埃德蒙顿研究中心) Hangzhou International Innovation Institute, Beihang University(杭州国际创新院,北航) School of Artificial Intelligence and Computer Science, North China University of Technology(北中国技术大学人工智能与计算机科学学院) Research Institute of Multiple Agents and Embodied Intelligence, Peng Cheng Laboratory(鹏城实验室多智能体与具身智能研究院)

AI总结 提出Doctor框架,结合掩码轨迹Transformer与强化验证,通过生成候选动作并选择验证值最接近目标回报的动作,提升目标条件策略在低覆盖数据下的可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11790 2026-06-24 cs.CL cs.AI 版本更新

Benchmarking LLMs' Mathematical Reasoning with Unseen Random Variables Questions

使用未见过的随机变量问题对LLM的数学推理进行基准测试

Zijin Hong, Hao Wu, Su Dong, Junnan Dong, Yilin Xiao, Yujing Zhang, Zhu Wang, Feiran Huang, Linyi Li, Hongxia Yang, Xiao Huang

机构 * The Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学) Tencent Youtu Lab(腾讯优图实验室) Beihang University(北京航空航天大学) Simon Fraser University(西蒙弗雷泽大学)

AI总结 针对现有数学基准的可靠性问题,提出RV-Bench方法,通过生成随机变量问题评估LLM的真实推理能力,发现模型在已见和未见数据分布上的能力不平衡,且推理泛化有限但可通过测试时扩展提升。

Comments Accepted to AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00491 2026-06-23 cs.PL cs.AI cs.SE 版本更新

Executing as You Generate: Hiding Execution Latency in LLM Code Interpreters

边生成边执行:在LLM代码解释器中隐藏执行延迟

Zhensu Sun, Zhihao Lin, Zhi Chen, Chengran Yang, Mingyi Zhou, Li Li, David Lo

机构 * Singapore Management University Singapore(新加坡国立管理学院新加坡) Beihang University China(北航大学中国)

AI总结 提出并行执行范式,通过将生成、检测和执行三阶段流水线化,在代码生成过程中提前执行,显著降低端到端延迟。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05976 2026-06-23 cs.CV 版本更新

LightOcc: Lightweight Spatial Embedding for Efficient Vision-based 3D Occupancy Prediction

LightOcc: 用于高效基于视觉的3D占用预测的轻量级空间嵌入

Jinqing Zhang, Yanan Zhang, Wenrui Cai, Qingjie Liu, Yunhong Wang

机构 * State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室) Beihang University(北京航空航天大学) School of Computer Science and Information Engineering(计算机科学与信息工程学院) Hefei University of Technology(合肥工业大学) Hangzhou Innovation Institute(杭州创新研究院)

AI总结 针对现有占用预测方法使用体素特征导致计算和内存开销大的问题,提出轻量级空间嵌入(Lightweight Spatial Embedding),通过单通道占用和空间到通道机制压缩高度信息,结合跨视图交互和边缘感知嵌入,在多个基准上实现最先进性能并显著提升效率。

Comments Accepted by International Journal of Computer Vision (IJCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14399 2026-06-18 cs.LG cs.CV physics.ao-ph stat.ML 版本更新

Benchmarking Physics-Informed Time-Series Models for Operational Global Station Weather Forecasting

面向全球站点业务天气预报的物理信息时间序列模型基准测试

Tao Han, Zhibin Wen, Zhenghao Chen, Dazhao Du, Song Guo, Lei Bai

机构 * Department of Computer Science and Engineering, Hong Kong University of Science and Technology, Hong Kong SAR China(香港科技大学计算机科学与工程系) Department of Computer Science and Engineering, Southern University of Science and Technology, Shenzhen, China(南方科技大学计算机科学与工程系) School of Computer and Information Sciences, University of Newcastle, Newcastle, Australia(新castle大学计算机与信息科学学院) Hangzhou Innovation Institute of Beihang University, Hangzhou, China(北京航空航天大学杭州创新研究院) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室)

AI总结 提出大规模观测数据集WEATHER-5K和物理信息模型PhysicsFormer,通过压力-风对齐和能量感知平滑损失增强物理一致性,在多个天气变量和极端事件预测上评估学术模型与业务系统的差距。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09337 2026-06-17 cs.RO 版本更新

TORL-VLA: Tactile Guided Online Reinforcement Learning for Contact-Rich Manipulation

TORL-VLA:触觉引导的在线强化学习用于接触丰富操作

Huaihang Zheng, Yi Yang, Kai Ma, Shenglin Xu, Tian Xie, Guozheng Li, Xiangyu Wang, Yiren Ma, Si Liu, Yinian Mao, Baoxu Liu

机构 * Meituan(美团) Beijing Institute of Technology(北京理工大学) Beihang University(北京航空航天大学) State Key Lab of Multimodal Artificial Intelligence Systems, Institute of Automation, CAS(中国科学院自动化研究所多模态人工智能系统国家重点实验室) China University of Mining and Technology (Beijing)(中国矿业大学(北京))

AI总结 提出TORL-VLA框架,结合触觉反馈与在线强化学习,通过触觉导出的力矩感知VLA预测参考动作,并利用轻量在线RL模块优化动作,解决接触条件变化时的策略适应问题,在长时接触任务中提升成功率和执行效率。

Comments Project page: https://torl-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19595 2026-06-16 cs.IR cs.CL 版本更新

All-Mem: Agentic Lifelong Memory via Dynamic Topology Evolution

All-Mem: 通过动态拓扑演化实现智能体终身记忆

Can Lv, Heng Chang, Shengyu Tao, Mingju Chen, Zhaoxin Fan, Ziwei Zhang, Yuchen Guo, Shiji Zhou

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算先进创新中心) Beihang University(北航) Tsinghua University(清华大学) Chalmers University of Technology(查尔姆斯理工大学)

AI总结 提出All-Mem框架,通过在线/离线结合的非破坏性拓扑结构记忆库,解决终身交互代理中历史增长导致的检索冗余和噪声问题,在LoCoMo和LongMemEval-s上提升检索与问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08976 2026-06-16 cs.CV cs.DC cs.IR 版本更新

MIRAGE: Runtime Scheduling for Multi-Vector Image Retrieval with Hierarchical Decomposition

MIRAGE:基于层次分解的多向量图像检索运行时调度

Maoliang Li, Ke Li, Yaoyang Liu, Jiayu Chen, Zihao Zheng, Yinjun Wu, Chenchen Liu, Xiang Chen

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) School of Information, Renmin University of China(中国人民大学信息学院) School of Integrated Circuit Science and Engineering, Beihang University(北京航空航天大学集成电路科学与工程学院)

AI总结 提出MIRAGE框架,通过层次化分解和跨层次相似性一致性减少冗余计算,实现多向量图像检索的精度提升和3.5倍计算加速。

Comments Will appear in DAC'2026, camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16988 2026-06-15 cs.CL cs.AI cs.MA 版本更新

MASLab: A Unified and Comprehensive Codebase for LLM-based Multi-Agent Systems

MASLab:基于LLM的多智能体系统的统一全面代码库

Rui Ye, Keduan Huang, Qimin Wu, Yuzhu Cai, Tian Jin, Xianghe Pang, Xiangrui Liu, Jiaqi Su, Chen Qian, Bohan Tang, Kaiqu Liang, Jiaao Chen, Yue Hu, Zhenfei Yin, Rongye Shi, Bo An, Yang Gao, Wenjun Wu, Lei Bai, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) University of Oxford(牛津大学) Princeton University(普林斯顿大学) Meta University of Michigan(密歇根大学) The University of Sydney(悉尼大学) Beihang University(北航) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学)

AI总结 提出MASLab代码库,集成20余种方法,提供统一环境与标准化评估,降低研究门槛,覆盖10+基准测试和8种模型。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21563 2026-06-12 cs.AI 版本更新

Counterfactual Credit Policy Optimization for Multi-Agent Collaboration

多智能体协作的反事实信用策略优化

Zhongyi Li, Wan Tian, Jinju Chen, Huiming Zhang, Yang Liu, Yikun Ban, Fuzhen Zhuang

机构 * Beihang University(北航) Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 针对多智能体大语言模型协作中信用分配难题,提出CCPO框架,通过反事实信用估计和验证器锚定的自评估两种分配器,将团队奖励转化为个体学习信号,提升数学推理任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11074 2026-06-11 cs.CL cs.AI 版本更新

Modeling Complex Behaviors: Multi-Personality Composition and Dynamic Switching in Vision-Language Models

建模复杂行为:视觉语言模型中的多人格组合与动态切换

Peiqi Jia, Haonan Jia, Ziqi Miao, Linkang Du, Yuntao Wang, Zhou Su

机构 * Xi'an Jiaotong University(西安交通大学) Beihang University(北京航空航天大学)

AI总结 本研究在视觉语言模型中引入显式人格条件,建立包括单人格、多人格和人格切换的系统评估框架,发现人格提示可提升图像描述但损害精确推理任务,并观察到多特质组合与动态切换中的平衡与残留效应。

Comments 16 pages, 4 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10639 2026-06-11 cs.RO 版本更新

Planar-Sector LOS Guidance for Interception of Agile Targets with Lifting-Wing Quadcopters

面向敏捷目标拦截的升力翼四旋翼平面扇形视线制导

Linkai Liu, Kun Yang, Han Zou, Chen Min, Shuli Lv, Shuai Wang, Quan Quan

机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院) Research and Development Department, China Academy of Launch Vehicle Technology(中国运载火箭技术研究院研发部)

AI总结 提出平面扇形视线(PS-LOS)制导框架,通过非对称约束释放机动性,使升力翼四旋翼在仅用单目相机的情况下实现远程自主拦截敏捷目标,实验验证了高达138米距离的成功拦截。

Comments Accepted to the IEEE International Conference on Robotics and Automation (ICRA 2026). Recipient of the ICRA 2026 Best Paper Award in Field and Service Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24012 2026-06-10 cs.LG math.OC 版本更新

FedSLoP: Memory-Efficient Federated Learning with Low-Rank Gradient Projection

FedSLoP: 基于低秩梯度投影的内存高效联邦学习

Yutong He, Zhengyang Huang, Jiahe Geng, Kun Yuan

机构 * Peking University(北京大学) Beihang University(北航)

AI总结 提出FedSLoP算法,结合随机低秩子空间投影降低通信和存储开销,理论证明以O(1/√NT)速率收敛到一阶稳定点,实验在异构MNIST上优于FedAvg等基线。

Comments 27 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21543 2026-06-10 cs.CL 版本更新

inversedMixup: Data Augmentation via Inverting Mixed Embeddings

inversedMixup:通过反转混合嵌入进行数据增强

Fanshuang Kong, Richong Zhang, Qiyu Sun, Zhijie Nie, Ting Deng, Chunming Hu

机构 * Beihang University(北京航空航天大学)

AI总结 提出 inversedMixup 框架,结合 Mixup 的可控性与 LLM 的可解释性,通过对齐嵌入空间将混合嵌入重构为可读句子,首次实证文本 Mixup 中的流形入侵现象,并扩展为三阶段数据增强方法,在少样本和全监督场景下有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20242 2026-06-10 cs.CY cs.AI cs.RO 版本更新

BadRobot: Jailbreaking Embodied LLM Agents in the Physical World

BadRobot: 在物理世界中越狱具身LLM智能体

Hangtao Zhang, Chenyu Zhu, Xianlong Wang, Ziqi Zhou, Changgan Yin, Minghui Li, Lulu Xue, Yichen Wang, Shengshan Hu, Aishan Liu, Peijin Guo, Leo Yu Zhang

机构 * Huazhong University of Science and Technology(华中科技大学) Beihang University(北航) Griffith University(格里菲斯大学)

AI总结 提出BadRobot攻击范式,利用LLM在机器人系统中的操纵、语言输出与物理动作的错位以及世界知识缺陷三个漏洞,通过语音交互使具身LLM执行有害行为,并在基准测试中验证了有效性。

Comments Accepted to ICLR 2025. Please cite the conference version. Project page: https://Embodied-LLMs-Safety.github.io

Journal ref International Conference on Learning Representations (ICLR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01799 2026-06-09 cs.CV 版本更新

Embody4D: A Generalist Data Engine for Embodied 4D World Modeling

Embody4D: 面向具身4D世界建模的通用数据引擎

Peiyan Tu, Hanxin Zhu, Jingwen Sun, Shaojie Ren, Cong Wang, Yuyan Xu, Jiayi Luo, Xiaoqian Cheng, Zhibo Chen

机构 * Zhejiang University(浙江大学) Beijing Zhongguancun Academy(北京中关村学院) University of Science and Technology of China(中国科学技术大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Jiao Tong University(上海交通大学) Beihang University(北京航空航天大学)

AI总结 提出Embody4D视频到视频世界模型,通过3D感知合成管道、潜在置信度专家调制和交互注意力机制,将单目机器人视频转换为多视角视频,解决具身智能中视角稀疏问题,提升下游规划与学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06033 2026-06-09 cs.RO 版本更新

RealDexUMI: A Wearable Universal Manipulation Interface for Dexterous Robot Learning

RealDexUMI:用于灵巧机器人学习的可穿戴通用操作接口

Chaoyi Xu, Yixuan Jiang, Jiahui Huan, Yuhui Fu, Haoyu Zhou, Weitian Yuan, Jiayi Yu, Wanpeng Zhang, Haoqi Yuan, Zongqing Lu

机构 * Peking University(北京大学) BeingBeyond Beihang University(北航) LinkerBot Tsinghua University(清华大学)

AI总结 提出RealDexUMI,一种基于共享灵巧末端执行器模块的可穿戴通用操作接口,通过掌侧同构遥操作手套实现无重定向、直观精确的手部控制,在八项真实机器人任务中平均成功率达88.75%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04627 2026-06-09 cs.AI 版本更新

MIRAGE: Mobile Agents with Implicit Reasoning and Generative World Models

MIRAGE: 具有隐式推理和生成世界模型的移动智能体

Zhichao Yang, Yuanze Hu, Haojie Hao, Longkun Hao, Dongshuo Huang, Hongyu Lin, Gen Li, Lanqing Hong, Yihang Lou, Yan Bai

机构 * Beihang University(北京航空航天大学) Northwestern Polytechnical University(西北工业大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) National University of Singapore(新加坡国立大学) Peking University(北京大学)

AI总结 提出MIRAGE框架,通过从显式推理轨迹学习连续潜在表示,使移动智能体能够内部推理并预测未来屏幕状态,在减少生成token的同时提升执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28831 2026-06-09 cs.CL cs.AI 版本更新

S3Mem: Structured Spatiotemporal Scene-Event Memory for Long-Horizon Interactive Question Answering

S3Mem:用于长时域交互式问答的结构化时空场景-事件记忆

Encheng Su, Jianyu Wu, Jinouwen Zhang, Qiucheng Yu, Chen Tang, Pengze Li, Lintao Wang, Aoran Wang, Xinzhu Ma, Shixiang Tang, Yizhou Wang, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) City University of Hong Kong(香港城市大学) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) The University of Sydney(悉尼大学) Beihang University(北航)

AI总结 提出S3MEM框架,通过结构化场景-事件记忆和锚点敏感检索,在长时域交互式问答中实现比通用记忆接口更优的准确率-效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08222 2026-06-09 cs.AI 版本更新

Weak-Driven Learning: How Weak Agents make Strong Agents Stronger

弱驱动学习:弱智能体如何使强智能体更强

Zehao Chen, Gongxun Li, Tianxiang Ai, Zixuan Huang, Xiaodong Liu, Yifei Li, Wang Zhou, Fuzhen Zhuang, Xianglong Liu, Jianxin Li, Deqing Wang, Yikun Ban

机构 * Beihang University(北航) China Telecom eSurfing Cloud(中国电信eSurfing云)

AI总结 针对大语言模型后训练中的饱和瓶颈,提出WMSS方法,利用模型历史弱检查点通过熵动力学识别可恢复学习差距并进行补偿学习,在数学推理和代码生成任务上实现有效性能提升且无额外推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16584 2026-06-09 cs.SD cs.AI cs.CL cs.MM eess.AS 版本更新

Audio-FLAN: An Instruction-Following Dataset for Unified Audio Understanding and Generation of Speech, Music, and Sound

Audio-FLAN:面向语音、音乐和声音的统一音频理解与生成的指令跟随数据集

Liumeng Xue, Ziya Zhou, Jiahao Pan, Zixuan Li, Shuai Fan, Yinghao Ma, Sitong Cheng, Dongchao Yang, Haohan Guo, Yujia Xiao, Xinsheng Wang, Zixuan Shen, Chuanbo Zhu, Xinshen Zhang, Tianchi Liu, Ruibin Yuan, Zeyue Tian, Haohe Liu, Xingjian Du, Emmanouil Benetos, Ge Zhang, Yike Guo, Wei Xue

机构 * The Hong Kong University of Science(香港科学与技术大学) Inner Mongolia University(内蒙古大学) Beihang University(北京航空航天大学) Queen Mary University of London(伦敦玛丽女王大学) The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学) University of Surrey(萨里大学) University of Rochester(罗切斯特大学) Independent Researcher(独立研究者)

AI总结 提出Audio-FLAN数据集,包含80种任务和1亿实例,支持统一音频理解与生成的零样本学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25413 2026-06-08 cs.LG cs.AI cs.NA math.NA 版本更新

Autoregression-Free Neural Operators for Time-Dependent PDEs

无自回归的神经算子用于时间相关偏微分方程

Jiaquan Zhang, Caiyan Qin, Haoyu Bian, Libin Cai, Yi Lu, Chaoning Zhang, Wei Dong, Yuanfang Guo, Yang Yang, Heng Tao Shen

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) School of Robotics and Advanced Manufacture, Harbin Institute of Technology(哈尔滨工业大学机器人与先进制造学院) School of Mathematical Sciences, Capital Normal University(首都师范大学数学学院) College of Information and Control Engineering, Xi’an University of Architecture and Technology(西安建筑科技大学信息与控制工程学院) Laboratory of Intelligent Recognition and Image Processing, School of Computer Science and Engineering, Beihang University(北京航空航天大学智能识别与图像处理实验室) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

AI总结 提出AFNO,通过将PDE时间演化映射到潜空间并利用流匹配学习连续时间向量场,避免自回归展开,实现长期稳定预测。

Comments 23 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏