arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Beihang University(北京航空航天大学)

共收录 180
2607.15278 2026-07-17 cs.CV 新提交

Hierarchical Denoising For Multi-Step Visual Reasoning

用于多步视觉推理的分层去噪

Zezhong Qian, Xiaowei Chi, Chak-Wing Mak, Tianze Zhou, Ruibin Yuan, Yuhan Rui, Hengzhe Sun, Zhuoqun Wu, Yuming Li, Siyuan Qian, Sirui Han, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理技术国家重点实验室) The Hong Kong University of Science and Technology(香港科技大学) Beihang University(北京航空航天大学) Fuzhou University(福州大学) Muka Robotics(木卡机器人)

AI总结 研究针对视频模型多步推理不足的问题,提出HDR框架,通过树形层次结构和稀疏分层注意力模式进行多步推理,在新基准测试中提升了成功率和进度,推理更快,数据效率更高,在机器人实验中展现潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14510 2026-07-17 cs.AI 新提交

VLT: A Vision-Language-Time Series Multimodal Foundation Model for Industrial Intelligence

VLT:用于工业智能的视觉-语言-时间序列多模态基础模型

Haiteng Wang, Jingheng Yan, Xiaokang Wang, Lei Ren

机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) State Key Laboratory of Intelligent Manufacturing System Technology(智能制造系统技术国家重点实验室) School of Computer Science and Artificial Intelligence, Zhengzhou University(郑州大学计算机科学与人工智能学院)

AI总结 针对工业时间序列单模态建模局限及连接时间序列与文本语义的挑战,提出VLT多模态基础模型,通过设计Time-MoE等机制联合建模多种模态,经实验验证其在多种复杂设置下优于现有方法,提升了鲁棒性和泛化能力。

Comments 18 pages, 13 figures, and 13 tables, including supplementary material. Haiteng Wang and Jingheng Yan contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13101 2026-07-16 cs.LG cs.AI 新提交

TSSM: Triaxial State Space Model for Global Station Weather Forecasting with Temporal-Variable-Historical Modeling

TSSM:用于全球台站天气预报的具有时间可变历史建模的三轴状态空间模型

Songru Yang, Zili Liu, Tao Han, Ben Fei, Fenghua Ling, Lei Bai, Chang Liu, Xiangyang Ji, Zhenwei Shi, Zhengxia Zou

机构 * Beihang University(北京航空航天大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学)

AI总结 研究针对全球台站天气预报中现有方法的局限,提出三轴状态空间模型TSSM,通过时间可变历史范式纳入历史数据,设计扫描捕捉多种特性,在多数据集上性能优异,尤其在长期和迭代预测及应对缺失观测方面优势明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12680 2026-07-15 cs.CV 新提交

ReflectVLN: Training Vision-Language Navigation Agents with Reflective Reasoning

ReflectVLN:通过反思推理训练视觉语言导航智能体

Jiahang Wang, Yirong Yang, Yanqing Zhu, Minghua Luo, Shichao Xie, Fei Liu, Mu Xu

机构 * Amap, Alibaba Group(高德软件有限公司,阿里巴巴集团) Beihang University(北京航空航天大学)

AI总结 研究针对现有视觉语言导航方法缺乏闭环机制问题,提出ReflectVLN框架,通过双向交互智能体决策,引入行动思维链训练方案,实验证明该框架在有限数据下提升成功率和路径效率,且具良好训练成本与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12678 2026-07-15 cs.CV cs.AI 新提交

Text-Aided Multi-Modal Panoptic Symbol Spotting for CAD Floor Plan Drawings

用于CAD平面图的文本辅助多模态全景符号识别

Yan Gong, Bohao Li, Bowen Du, Junchen Ye

机构 * CCSE Lab, Beihang University(北京航空航天大学CCSE实验室) School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院) The Hong Kong Polytechnic University(香港理工大学)

AI总结 针对CAD平面图全景符号识别中现有方法未充分利用文本注释的问题,提出多模态框架TextCAD,设计TACE编码注释语义,引入语义层次对齐框架,实验表明该方法有效提升符号识别性能并达最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11560 2026-07-14 cs.CV cs.AI 新提交

Technical Report on the CVPR 2026@AdvML Workshop Challenge

关于CVPR 2026@AdvML研讨会挑战赛的技术报告

Tianyuan Zhang, Zonglei Jing, Jiangfan Liu, Ligong Zhang, Ke Ma, Chengzhi Sun, Xiaohai Xu, Zhirui Zhang, Qianqian Xu, Qingming Huang, Hanyu Fang, Junhua Liu, Zheng Wang, Xiaoliang Liu, Yuanbo Li, Shuai Gui, Bin Wang, Menghe Zheng, Jing Nie, Hanyang Meng, Zeyang Zhang, Xiang Zhang, Yongxuan Zhu, Rui Ding, Hainan Li, Yongkang Zhang, Zhilei Zhu, Xianglong Kong, Jin Hu, Zonghao Ying, Yisong Xiao, Lei Chen, Haotong Qin, Jiakai Wang, Aishan Liu, Ruikai Li, Julia Karbing, Yinpeng Dong, Zhenfei Yin, Shao Jing, Xia Hu, Jingyi Xu, Juntao Dai, Xinyun Chen, Vishal M. Patel, Xianglong Liu, Dawn Song, Alan Yuille, Philip H. S. Torr, Dacheng Tao

机构 * Beihang University(北京航空航天大学) University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Tongji University(同济大学) iFLYTEK Co., Ltd.(科大讯飞股份有限公司) Anhui Laboratory for Safe Artificial Intelligence in the Yangtze River Delta(长三角安全人工智能安徽实验室) Wenzhou Business College(温州商学院) Jiangnan University(江南大学) Guangzhou City University of Technology(广州理工学院) Inceptio Technology(智元机器) Institute of Dataspace(数据空间研究所) Zhongguancun Laboratory(中关村实验室) Tsinghua University(清华大学) ETH Zürich(苏黎世联邦理工学院) University of Oxford(牛津大学) Shanghai AI Laboratory(上海人工智能实验室) BAAI(北京智源人工智能研究院) Meta Johns Hopkins University(约翰·霍普金斯大学) University of California, Berkeley(加州大学伯克利分校) Nanyang Technological University(南洋理工大学)

AI总结 介绍CVPR 2026@AdvML研讨会针对自动驾驶VLAs的对抗性多模态攻击挑战赛,基于多视图视觉问答,参赛者要生成对抗图像和文本扰动。阐述任务设计等,研究领先提交作品发现后缀惩罚等模式,为多模态自动驾驶系统相关工作提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11529 2026-07-14 cs.CV 新提交

Parse, Search, and Confirmation: Training-Free Aerial Vision-and-Dialog Navigation with Chain-of-Thought Reasoning and Structured Spatial Memory

解析、搜索与确认:基于思维链推理和结构化空间记忆的免训练空中视觉与对话导航

Yu Qi, Hongyu Li, Shaofei Huang, Tianrui Hui, Yaxiong Wang, Lechao Cheng, Zhun Zhong, Si Liu, Meng Wang

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院) Jianghuai Advance Technology Center(江淮先进技术中心) Anhui Provincial Key Laboratory of Humanoid Robots(安徽省人形机器人重点实验室) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) University of Macau(澳门大学)

AI总结 研究免训练环境下的空中视觉与对话导航任务,提出PSC - AVDN框架,结合解析 - 搜索 - 确认推理管道与结构化空间记忆,整合多种空间线索,在免训练设置中取得新的最优性能。

Comments 10 pages, 4 figures. Accepted to CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 23859-23868

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11374 2026-07-14 cs.LG 新提交

Surprisingly Simple and Effective Multi-Domain Graph Foundation Model through Graph-to-Table Alignment

通过图到表对齐实现惊人简单且有效的多域图基础模型

Chunyu Hu, Tianyin Liao, Ge Lan, Xingxuan Zhang, Jianxin Li, Peng Cui, Ziwei Zhang

机构 * Nankai University(南开大学) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

AI总结 研究如何让表格基础模型有效捕获图结构信息,提出GTAlign框架,先预训练图编码器捕获图表示,通过社区引导持续预训练弥合差距,应用于目标域推理,实验表明该框架在节点和图分类上显著优于基线,提供简单无文本的图基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11008 2026-07-14 cs.CV cs.AI 新提交

SynCLIP: Synonym-Coherent Language-Image Pretraining for Robust Open-Vocabulary Dense Perception

SynCLIP:用于鲁棒开放词汇密集感知的同义词一致语言-图像预训练

Mingjie Xie, Guangjun He, Dongli Xu, Youtian Lin, Hongjue Li, Pengming Feng, Jian Guan, Yue Deng

机构 * Beihang University(北京航空航天大学) State Key Laboratory of Space Information System and Integrated Application(空间信息系统与集成应用国家重点实验室) Nanjing University(南京大学) Harbin Engineering University(哈尔滨工程大学) Beijing Zhongguancun Academy(北京中关村科学城)

AI总结 研究针对开放词汇密集感知中同义词引起的定位不一致问题,提出SynCLIP框架,通过SSA和SAR模块增强注意力一致性与定位精度,构建SEViC支持预训练,实验证明该方法显著提升定位一致性并达领先性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10805 2026-07-14 cs.CL cs.LG 新提交

Diagnosing and Mitigating Thinking Collapse in On-Policy Self-Distillation

诊断和缓解基于策略的自蒸馏中的思维崩溃

Keqin Peng, Chen Li, Yuanxin Ouyang, Yancheng Yuan, Liang Ding

机构 * Beihang University(北京航空航天大学) Hong Kong Polytechnic University(香港理工大学) Alibaba Group(阿里巴巴集团)

AI总结 研究基于策略的自蒸馏在复杂推理任务中性能下降问题,发现思维崩溃陷阱。提出自适应双视角OPSD,通过动态调节自蒸馏目标缓解该问题,在多模型规模和数据集上实验验证其有效性,提升绝对平均准确率4.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10789 2026-07-14 cs.AI 新提交

Imaging-101: Benchmarking LLM Coding Agents on Scientific Computational Imaging

成像101:在科学计算成像上对大语言模型编码智能体进行基准测试

Siyi Chen, Jiahe Ying, Yixuan Jia, Yuxuan Gu, Enze Ye, Weimin Bai, Zhijun Zeng, Shaochi Ren, Binhong Gao, Yubing Li, Tianhan Zhang, He Sun

机构 * College of Future Technology and the National Biomedical Imaging Center, Peking University(北京大学未来技术学院和国家生物医学成像中心) AI for Science Institute (AISI)(科学人工智能研究所) University of Michigan(密歇根大学) State Key Laboratory of Acoustics and Marine Information, Institute of Acoustics, Chinese Academy of Sciences(中国科学院声学研究所声场声信息国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) School of Astronautics, Beihang University(北京航空航天大学宇航学院) Key Laboratory of Spacecraft Design Optimization and Dynamic Simulation Technologies, Ministry of Education(教育部航天器设计优化与动态仿真技术重点实验室)

AI总结 研究针对计算成像构建正确重建管道费力的问题,引入含57个任务的Imaging-101基准及三个评估轨道,评估七个前沿大语言模型,发现应用编码智能体于计算成像存在系统性挑战,指出技能增强、领域专业化智能体是可靠成像辅助的途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08180 2026-07-10 cs.CR cs.AI 新提交

Out of Sight: Compression-Aware Content Protection against Agentic Crawlers

视线之外:针对智能爬虫的压缩感知内容保护

Xuefei Wang

机构 * Beihang University(北航大学)

AI总结 研究基于LLM的智能体给在线内容带来的新威胁,提出CAPE框架,通过注入不可见扰动保护文本内容,在低查询预算下有效提升信息损失,实验证明其有效性与通用性,推动智能体时代内容保护研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08076 2026-07-10 cs.CV cs.AI 新提交

LDFE: Laplacian Decoupled Feature Enhancement Block for Dual-Stream CNN-based RGB-IR Object Detection

LDFE:用于基于双流 CNN 的 RGB-IR 目标检测的拉普拉斯解耦特征增强模块

Wenhao Dong, Xiaoyan Luo, Linlin Yang, Haodong Zhu, Xiaorong Shi, Guodong Guo, Baochang Zhang

机构 * Beihang University(北京航空航天大学) State Key Laboratory of High-Efficiency Reusable Aerospace Transportation Technology(高效可重复使用航天运输技术国家重点实验室) The School of Astronautics(航天学院) The National Key Laboratory of Integrated Air-Ground Navigation Technologies(集成空天地导航技术国家实验室) The State Key Laboratory of Media Convergence and Communication(媒体融合与传播国家重点实验室) The School of Artificial Intelligence(人工智能学院) Zhongguancun Academy(中关村学院) The School of Automation Science and Electrical Engineering(自动化科学与电气工程学院) Beijing Institute of Control and Electronics Technology(北京控制电子技术研究所) Ningbo Institute of Digital Twin(宁波数字孪生研究所) Eastern Institute of Technology(东部技术研究所) Hangzhou Research Institute, School of Artificial Intelligence(杭州研究院,人工智能学院)

AI总结 研究基于双流 CNN 的 RGB-IR 目标检测问题,提出拉普拉斯解耦特征增强模块 LDFE,通过全局-局部分解等操作融合不同阶段特征,在多个数据集上显著提升目标检测性能,mAP 超 SOTA 方法。

Journal ref Pattern Recognition,Volume 179, Part D,2026,113935

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07467 2026-07-09 cs.AI 新提交

SpaCellAgent: A Self-Evolving LLM-Based Multi-Agent Framework for Trajectory Analysis

SpaCellAgent:一种基于自进化大语言模型的轨迹分析多智能体框架

Songhan Wang, Haoang Chi, He Li, Zhiheng Zhang, Jiayan Yuan, Cheems Wang, Hao Peng, Xinwang Liu, Wenjing Yang

机构 * University of Shanghai for Science and Technology(上海理工大学) National University of Defense Technology(国防科技大学) Hong Kong Baptist University(香港浸会大学) Shanghai University of Finance and Economics(上海财经大学) Tsinghua University(清华大学) Beihang University(北京航空航天大学)

AI总结 研究针对轨迹推断现有方法需大量人工干预的问题,提出基于大语言模型的多智能体框架SpaCellAgent,利用多智能体架构、动态工具编排引擎和自进化模块,经实验验证其能大幅提高分析效率,推动先进时空建模民主化。

Comments 27 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07452 2026-07-09 cs.RO 新提交

GeoGS-SLAM: Geometry-Only Gaussian Splatting for Dense Monocular SLAM

GeoGS-SLAM:用于密集单目 SLAM 的仅几何高斯点云法

Lipu Zhou, Yaoyun Kang, Junxiang Pang, Shengkai Sun, Tingting Bao, Kehan Wang

机构 * School of Instrument Science and Opto-electronics Engineering, Beihang University(仪器科学与光电工程学院,北京航空航天大学)

AI总结 研究针对密集视觉 SLAM 问题,提出仅几何高斯点云法(GeoGS)及基于此的 GeoGS-SLAM 系统。该方法仅保留空间参数减少基元参数,专注几何重建,通过有效训练框架和地图更新策略,提升在线映射效率与几何重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07438 2026-07-09 cs.CV 新提交

Two-Stage Multi-Modal Fusion with Adaptive Alignment for Action Quality Assessment

用于动作质量评估的具有自适应对齐的两阶段多模态融合

Kanglei Zhou, Ruizhi Cai, Xinning Wang, Yijian Zheng, Liyuan Wang, Jianguo Li, Xiaohui Liang

机构 * Tsinghua University(清华大学) Beihang University(北京航空航天大学) Children’s Hospital, Capital Institute of Pediatrics(首都儿科研究所附属儿童医院) Zhongguancun Laboratory(中关村实验室)

AI总结 研究动作质量评估问题,提出两阶段多模态融合框架DualAlign,通过自适应对齐解决跨模态错位等挑战,引入MM-JDM数据集,实验表明该框架在多模态评估中表现出色,相比现有方法有显著提升且在特定条件下稳健。

Comments Accepted to IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07076 2026-07-09 cs.RO 新提交

PriGo: Test-Time Primitive Guidance to Diffusion and Flow Policies for Adaptive Robotic Manipulation

PriGo:用于自适应机器人操作的扩散和流策略的测试时原语引导

Zezeng Li, Enda Xiang, Thuy Tran, Di Huang, Momath Thiam, Liming Chen

机构 * École Centrale de Lyon(里昂中央理工学院) Beihang University(北京航空航天大学)

AI总结 针对机器人操作中现有策略泛化性不足问题,提出PriGo框架,引入PANet模块及可微原语引导机制,能在测试时无缝集成到预训练策略,实验证明其提升了扩散和流策略的鲁棒性、执行及泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06954 2026-07-09 cs.LG 新提交

Physical activities enable scalable foundation modelling for broad-spectrum health prediction

身体活动助力实现用于广谱健康预测的可扩展基础建模

Zhenghuang Wu, Yuyao Zhu, Songlin Xu

机构 * Beihang University(北京航空航天大学) University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 研究针对多数健康预测传感器模型局限性,提出仅基于步数计数器数据的StepFM基础模型,设计可扩展预训练框架,能跨多任务迁移,实验证明其性能强劲、保持稳健,还揭示了身体活动与健康风险关系,为健康监测奠定了基于步数传感的基础。

Comments 18 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06940 2026-07-09 cs.CL cs.AI 新提交

Comprehensive Evaluation of Large Language Model Responses: A Multi-Factor Scoring System

大语言模型回答的综合评估:一种多因素评分系统

Yiming Gai, Junde Lu, Xuefei Huang

机构 * School of Computer Science and Engineering, Beihang University, Beijing, China(北京航空航天大学计算机科学与工程学院) Data Science and Intelligent Computing Laboratory, Hangzhou International Innovation Institute, Beihang University, Hangzhou, Zhejiang(北京航空航天大学杭州国际创新研究院数据科学与智能计算实验室)

AI总结 针对大语言模型回答质量评估,提出多因素评分范式,融合准确性等多方面因素,通过图形用户界面可视化结果,在TruthfulQA数据集上评估揭示模型优缺点,为知识工程和模型优化提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06678 2026-07-09 cs.RO 新提交

NativeMEM: Native Memory Compression for Long-Horizon Robotic Manipulation

NativeMEM:用于长期机器人操作的原生内存压缩

Ziye Wang, Modi Shi, Chaojun Ni, Jiazhi Yang, Mengdi Li, Zhizhong Su, Tianwei Lin, Hongyang Li

机构 * The University of Hong Kong(香港大学) Beihang University(北京航空航天大学) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学) Horizon Robotics(地平线机器人)

AI总结 研究如何让预训练VLA模型高频更新时保留长期视觉历史且高效。提出NativeMEM策略,用原生内存压缩编码,通过开发分词器对齐内存令牌与策略,该方法在模拟和真实机器人实验中效果好,数据效率高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06607 2026-07-09 cs.LG cs.AI 新提交

NEST: Tackling Dataset-Level Distribution Shifts via Regime-Oriented Mixture-of-Experts

NEST:通过面向机制的专家混合方法应对数据集级别的分布变化

Lanhao Li, Bingshu Xie, Lijun Sun, Xin Xue, Haoyi Zhou, Jianxin Li

机构 * Beihang University(北京航空航天大学)

AI总结 针对复杂系统中数据集级分布变化影响长期预测问题,提出NEST框架,通过两阶段密集MoE架构,经无监督聚类和面向机制的路由器机制建模重组演变结构,在多基准测试中性能达最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06442 2026-07-08 cs.RO 新提交

SIEVE: Structure-Aware Data Selection for Imitation Learning with VLA Models

SIEVE:用于基于VLA模型的模仿学习的结构感知数据选择

Changti Wu, Bin Yu, Zhaolong Shen, Shijie Lian, Xiaopeng Lin, Cong Huang, Zhirui Zhang, Lei Zhang, Kai Chen

机构 * East China Normal University(东华师范大学) Zhongguancun Academy(中关村学院) Harbin Institute of Technology(哈尔滨工业大学) Beihang University(北航大学) Huazhong University of Science and Technology(华中科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) DeepCybo Training Demonstrations Policy Execution(深科博培训演示政策执行)

AI总结 研究针对VLA模型模仿学习中数据冗余等问题,提出结构感知数据选择方法SIEVE。该方法将演示视为原语和接口组合,通过发现原语、分配预算和选择轨迹来选数据,实验证明其优于基线,能在少数据少步骤下超越全数据训练。

Comments The code is available at \href{https://github.com/ChangtiWu/SIEVE}{SIEVE}

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05783 2026-07-08 cs.CV 新提交

Benchmarking the Robustness of Autonomous Driving to Environmental Illusions: A Lane Perception Perspective

从车道感知角度评估自动驾驶对环境错觉的鲁棒性:基准测试

Tianyuan Zhang, Xianglong Liu, Aishan Liu, Lu Wang, Yitong Zhang, Peng Yue, Mingchuan Zhang, Siyuan Liang, Dacheng Tao

机构 * SKLCCSE, the School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院软件安全技术与工程北京市重点实验室) the School of Cyber Science and Technology, Sun Yat-sen University(中山大学网络空间科学与技术学院) Henan University of Science and Technology(河南科技大学) the School of Computing, National University of Singapore(新加坡国立大学计算学院) College of Computing & Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 研究自动驾驶对环境错觉的鲁棒性,聚焦传统车道检测和视觉语言模型系统。引入基准LanEvil++并评估,发现错觉严重影响性能,阴影干扰最大。提出多模态错觉防御方法MIDA,有效提升了模型在挑战性条件下的鲁棒性。

Comments Accepted by IEEE TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05469 2026-07-08 cs.LG cs.AI cs.SI 新提交

Breaking Structural Isolation: Scalable Graph Clustering via Community-Aware Sampling and Structural Entropy

打破结构隔离:通过社区感知采样和结构熵进行可扩展的图聚类

Jingyun Zhang, Hao Peng, Jianxin Li, Angsheng Li, Philip S. Yu

机构 * Beihang University(北京航空航天大学) University of Illinois at Chicago(伊利诺伊大学芝加哥分校)

AI总结 针对无监督图聚类中现有方法的“结构隔离”问题,提出SCISE框架,通过社区感知采样、结构熵社区约束算子及结构对比学习模块协同保持结构完整性,实验证明该框架显著优于现有算法。

Comments Accepted to the Proceedings of the VLDB Endowment (VLDB 2026). 18 pages, 15 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05438 2026-07-08 cs.IR cs.AI 新提交

Modality Relevance is not Modality Utility: Post-hoc Selective Modality Escalation for Cost-Aware Multimodal RAG

模态相关性并非模态效用:用于成本感知多模态RAG的事后选择性模态升级

Xue Li, Yiming Gai

机构 * Hangzhou International Innovation Institute, Beihang University(杭州国际创新研究院,北京航空航天大学)

AI总结 研究多模态检索增强生成中模态选择决策点问题,提出事后选择性模态升级方法,先低成本从文本和表格回答,再按需支付VLM证据费用,校准路由器决定是否升级,在MultiModalQA上减少视觉调用并缩小与神谕升级率差距,扩展了路由信号层次结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06013 2026-07-08 cs.LG math.OC 新提交

Stability Annealing Selects the Implicit Bias of Smoothed Sign Descent: A Rate-Indexed Barrier Path on Separable Data

稳定性退火选择平滑符号下降的隐式偏差:可分数据上的速率索引障碍路径

Xiangwu Wang, Chengwei Cao, Yicheng Song, Ran Bi, Peilin Yu

机构 * The University of Hong Kong(香港大学) University of California, San Diego(加州大学圣地亚哥分校) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

AI总结 研究可分数据上全批量线性分类的速率控制情况,针对无记忆稳定性退火平滑符号下降,证明归一化迭代收敛特性,通过实验验证相关恒等式、展示预测图及缩放,还报告了多种情况的诊断,明确理论范围。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11032 2026-07-08 cs.CV 新提交

U-TTT: Towards Generalizable PET Image Denoising via Test-Time Training

U-TTT:通过测试时训练实现可泛化的PET图像去噪

Zhiwen Yang, Jiayin Li, Hao Lu, Hui Zhang, Zihua Wang, Yan Xu

机构 * School of Biological Science and Medical Engineering, Beihang University(北京航空航天大学生物科学与医学工程学院) Department of Biomedical Engineering, Tsinghua University(清华大学生物医学工程系) School of Aerospace Engineering, Tsinghua University(清华大学航天航空学院) ByteDance Inc.(字节跳动有限公司)

AI总结 针对PET图像去噪模型在分布偏移下性能退化的问题,提出U-TTT模型,集成测试时训练(TTT)层,通过自监督动态调整参数,并设计双域自适应机制(空间和频率TTT层),在未见剂量水平和扫描仪下实现最优去噪和泛化。

Comments This paper introduces the first TTT-based model for image restoration

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04234 2026-07-07 cs.RO cs.AI cs.CV 新提交

SoftVTBench: A Safety-Aware Visuo-Tactile Benchmark for Physically Constrained Robotic Manipulation of Deformable Objects

SoftVTBench:用于物理约束下可变形物体机器人操作的安全感知视觉触觉基准测试

Bowen Jing, Mingxin Wang, Ruiyang Hao, Chenchen Ge, Hanwen Shen, Junjie He, Yang Cui, Yiming Hou, Weitao Zhou, Jiawei Wang, Minglei Li, Dandan Zhang, Ding Zhao, Houde Liu, Xiaofan Li, Si Liu, Ping Luo, Haibao Yu

机构 * Tuojing Intelligence(拓景智能) Tsinghua University(清华大学) King’s College London(伦敦国王学院) Southeast University(东南大学) Stevens Institute of Technology(史蒂文斯理工学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Manchester(曼彻斯特大学) Simple AI(简单人工智能公司) Imperial College London(伦敦帝国学院) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

AI总结 研究物理约束下可变形物体操作,提出SoftVTBench基准测试,通过有限元模拟可变形物体,定义任务套件,分别报告目标成功和安全成功,实现基线并实验,表明仅成功评估高估策略性能,触觉传感可提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04162 2026-07-07 cs.RO cs.LG 新提交

ACE: Agentic Control for Embodied Manipulation via Zero-shot Workflow Reasoning

ACE:通过零样本工作流推理实现具身操纵的智能体控制

Iok Tong Lei, QianZhi Li, Ying Jie Yap, Yujie Zhang, Rui Zhong, Haichao Gui, Xiaolong Liu, Zhidong Deng

机构 * Department of Computer Science, Tsinghua University(清华大学计算机科学系) National College for Excellent Engineers, Beihang University(北京航空航天大学卓越工程师学院) Wuxi Dexteroushands Robotic Technology Co.(无锡灵犀机器人技术有限公司)

AI总结 研究开放式桌面操作,提出ACE零样本工作流推理框架,结合智能体工作流推理与视觉基础接口、可重复使用的拾取和放置原语等技能,经掩码介导视觉动作接口连接语义推理与物理控制,能在线适应多种情况,在复杂任务中表现出色。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03833 2026-07-07 cs.CL cs.AI 新提交

Beyond Static Rules: Automated Discovery of Latent Vulnerabilities in Text-to-SQL

超越静态规则:文本到SQL中潜在漏洞的自动发现

Hanqing Wang, Yongdong Chi, Jian Yang, Lei Yang, Jiehui Zhao, Yun Chen, Guanhua Chen

机构 * Shanghai University of Finance and Economics(上海财经大学) Beihang University(北京航空航天大学) Deepexi Technology Co. Ltd.(深圳市智元机器有限公司) Southern University of Science and Technology(南方科技大学)

AI总结 研究LLMs在文本到SQL任务中潜在可靠性问题,提出SAGE框架,通过生成漏洞假设、参考漏洞法典设计扰动来发现潜在故障模式,实验证明其能发现大量故障案例及法典的跨模型转移性。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏