arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Beihang University(北京航空航天大学)

共收录 1225
2608.02257 2026-08-04 cs.RO 新提交

Learning Panorama-Aware VLA for Mobile Manipulation with Whole-Body Teleoperation

面向全身遥操作移动操作的全景感知VLA学习

Donglin Yang, Haoran Chen, Xingyu Chen, Lixing Liu, Manyi Li, Changhe Tu, Ke Xu, Xiaojian Ma, Si Liu

机构 * Beihang University(北京航空航天大学) Shandong University(山东大学) Johns Hopkins University(约翰斯·霍普金斯大学) Delta Intelligence(delta智能公司)

AI总结 针对移动操作VLA策略的局部视野与全身演示数据收集难题,开发全身遥操作系统与PanoVLA全景感知VLA策略,基于5.5小时多模态数据集,在四项真实任务中平均阶段完成率91.3%、端到端成功率73.4%,性能优于局部视角基线。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02157 2026-08-04 cs.LG cs.AI 新提交

RamanPFN: learning from Raman spectral structure with a tabular foundation model

RamanPFN:基于表格基础模型学习拉曼光谱结构

Xingyu Pan, Huan Wang, Jinjia Guo, Zhenlin Zhao, Siming Dong, Jixi Lu

机构 * Beihang University(北京航空航天大学) Cleer Science(Cleer科技公司)

AI总结 RamanPFN在TabPFN推理前编码拉曼光谱依赖关系,经74个公开拉曼数据集的150项任务评估,可降低回归与分类误差,是高维拉曼测量与可复用表格推理的有效接口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01914 2026-08-04 cs.CV 新提交

CHOW-SLAM: Compact Hybrid Representation with Complementary Overlap Window Optimization for RGB-D SLAM

CHOW-SLAM:面向RGB-D SLAM的结合互补重叠窗口优化的紧凑混合表示方法

Wenxuan Ji, Jin Xiao, Xiaoguang Hu, Jiaqi Shi, Zichong Jia, Baochang Zhang

机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院)

AI总结 本文提出CHOW-SLAM框架,通过紧凑P-H混合表示与互补重叠窗口策略构建空间、时间约束,结合ORB初始化与神经渲染优化,在多数据集上优于现有最优RGB-D SLAM方法。

Comments 33 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01102 2026-08-04 cs.RO 新提交

CAAT: Contact-Aware Attention Scaling and Tactile Masking for Data-Efficient Contact-Rich Manipulation

CAAT:用于数据高效接触丰富型操作的接触感知注意力缩放与触觉掩码方法

Jiaming Jiang, Yuzhe Huang, Hao Liang, Pei Lin, Shengcheng Luo, Fanrong Dong, Jiaping Wu, Chenxi Xiao, Wanlin Li, Ziyuan Jiao

机构 * ShanghaiTech University(上海科技大学) Beihang University(北京航空航天大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Zhejiang University(浙江大学) BUPT(北京邮电大学)

AI总结 该研究针对接触丰富型操作中视觉-触觉策略缺乏接触感知先验的问题,提出CAAT框架,通过注意力缩放和动态触觉掩码提升策略性能,在仿真和真实实验中均显著优于现有方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00847 2026-08-04 cs.CV 新提交

Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking

模型作为工具:用于统一多模态视觉跟踪的智能体协调框架

Wenrui Cai, Yuzhe Li, Qingjie Liu, Yunhong Wang

机构 * Beihang University(北京航空航天大学)

AI总结 针对现有视觉跟踪方法的瓶颈,提出ACTrack智能体协调框架,整合异构模型工具的互补优势,仅用30%可训练参数便在多类基准上实现性能超越。

Comments 21 pages, 15 Tables, 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24024 2026-08-04 cs.CV 版本更新

GeoStereo: A Unified Stereo Geometry Estimation Framework for Disparity and Surface Normal

用于视差和表面法线的统一立体几何估计框架

Qizhe Wei, Xianda Guo, Shaocong Xu, Hong Li, Runyi Yang, Hao Zhao

机构 * Beijing Institute of Technology(北京理工大学) School of Computer Science, Wuhan University(武汉大学计算机科学学院) Beihang University(北京航空航天大学) INSAIT, Sofia University(索非亚大学INSAIT) BAAI AIR, Tsinghua University(清华大学BAAI AIR)

AI总结 本文针对立体匹配和表面法线估计问题,提出统一框架GeoStereo,结合前馈立体匹配与基于扩散的法线估计分支,引入初始化策略与扭曲条件,实现有效交互,在多场景表现可靠,零样本设置下视差和法线估计精度高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15974 2026-08-04 cs.CL 版本更新

A Large-Scale Multi-Dimensional Empirical Study of LLMs for Conversation Summarization

面向对话摘要的大规模多维度LLM实证研究

Weixiao Zhou, Gengyao Li, Junnan Zhu, Xianfu Cheng, Feifei Zhai, Zhoujun Li

机构 * CCSE, Beihang University(北京航空航天大学CCSE) MAIS, CASIA(中国科学院自动化研究所MAIS) Fanyu AI Laboratory(帆禹AI实验室)

AI总结 提出OmniCSEval基准,包含1800个跨六场景的对话,评估28个LLM在对话摘要中的完整性、简洁性和忠实性,揭示推理能力与模型规模的影响。

Comments 21 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10727 2026-08-04 stat.ML cs.AI cs.LG math.PR math.ST stat.TH 版本更新

Tail-Aware Information-Theoretic Bounds for LLM Alignment under Heavy-Tailed Rewards

尾感知信息论泛化用于RLHF和SGLD

Huiming Zhang, Binghan Li, Wan Tian, Qiang Sun

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算高精尖创新中心) Advanced Institute of Information Technology, Peking University(北京大学信息技术高等研究院) Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所) Computer and Mathematical Sciences, Computer Science, and Statistics, University of Toronto(多伦多大学计算机与数学科学、计算机科学和统计学系) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

AI总结 本文提出一种尾依赖信息论框架,用于处理亚韦尔bull数据,通过移位对数f_θ-分歧来界定制换测度期望,从而在重尾数据下获得更精确的泛化界限。

Comments 47 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10719 2026-08-04 cs.RO cs.CV 版本更新

From Representational Complementarity to Dual Systems: Synergizing VLM and Vision-Only Backbones for End-to-End Driving

从表征互补性到双系统:协同VLM和纯视觉骨干网络用于端到端驾驶

Sining Ang, Yuguang Yang, Chenxu Dang, Canyu Chen, Cheng Chi, Haiyan Liu, Xuanyao Mao, Jason Bao, Xuliang, Bingchuan Sun, Yan Wang

机构 * Department of Automation, University of Science and Technology of China(中国科学技术大学自动化系) School of Electronic Information Engineering, Beihang University(北京航空航天大学电子信息工程学院) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) National Superior College for Engineers, Beihang University(北京航空航天大学国家级工程师学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Lenovo Group Limited(联想集团有限公司) Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院)

AI总结 本文通过协同VLM和纯视觉骨干网络,提出HybridDriveVLA和DualDriveVLA,提升端到端驾驶的PDMS性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02837 2026-08-04 cs.CV cs.AI 版本更新

Breaking Self-Attention Failure: Rethinking Query Initialization for Infrared Small Target Detection

打破自注意力失效:重新思考用于红外小目标检测的查询初始化

Yuteng Liu, Duanni Meng, Yimian Dai, Maoxun Yuan, Xingxing Wei, Bo li

机构 * Beihang University(北航大学)

AI总结 SEF-DETR通过改进查询初始化方法,有效解决红外小目标检测中自注意力机制导致的背景干扰问题,提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06419 2026-08-04 cs.LG cs.AI 版本更新

CAPMix: Robust KPI Anomaly Detection for AIOps in Noisy and Dynamic Environments

CAPMix:面向噪声与动态环境下AIOps的鲁棒KPI异常检测

Xudong Mou, Rui Wang, Tiejun Wang, Zexin Wu, Fangda Guo, Jie Sun, Shiru Chen, Penghao Zhang, Tiezi Zhang, Tianyu Wo, Hao Peng, Chunming Hu, Xudong Liu, Renyu Yang

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) School of Software, Beihang University(北京航空航天大学软件学院) Shandong Inspur Intelligent Production Technology Co., Ltd(山东 Inspur 智能生产技术有限公司) Zhongguancun Laboratory(中关村实验室)

AI总结 本文针对AIOps中KPI异常检测的异常偏移问题,提出可控异常增强框架CAPMix,结合标签修正与双空间混合增强,在基准测试及快手生产系统中表现优异,还发布了相关数据集。

Comments Accepted for publication at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026). \c{opyright} ACM, 2026. This is the author's version of the work. It is posted here by permission of ACM for your personal use. Not for redistribution. The definitive Version of Record will be published by ACM, https://doi.org/10.1145/3832783.3834487

Journal ref ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29254 2026-08-03 cs.AI 新提交

Tool Specifications Matter: Uncovering and Mitigating Safety Risks in AI Agents

工具规格很重要:揭示和缓解AI智能体中的安全风险

Minghui Pan, Jiayuxuan Yang, Yuanyuan Yuan, Yu Jiang, Zhenpeng Chen

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

AI总结 本研究发现模式格式工具规格是AI智能体安全下降的主因,提出SafeKeep防护措施,可提升有害请求弃权率、降低攻击成功率,性能优于现有防护且保留任务处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25875 2026-08-03 cs.LG cs.AI 版本更新

A2TTA: Anchored-and-Agile Test-Time Adaptation for Evolving Traffic Sensor Networks

A2TTA:用于不断发展的交通传感器网络的锚定与敏捷测试时自适应

Du Yin, Xiachong Lin, Yue Tan, Jinliang Deng, Estrid He, Hao Xue, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) Griffith University(格里菲斯大学) Beihang University(北京航空航天大学) RMIT University(皇家墨尔本理工大学)

AI总结 研究针对交通传感器网络动态变化致传统预测模型性能下降问题,提出A2TTA框架,将拓扑诱导误差转化为输出校准问题,区分时间自适应,联合应对拓扑演变和多尺度时间偏移,实验证明该框架能有效提升预测性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28580 2026-07-31 cs.AI 新提交

DualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal Retrieval-Augmented Generation

DualG-MRAG:面向多模态检索增强生成的宏观推理与微观匹配解耦框架

Jiacheng Tao, Qingyun Sun, Haonan Yuan, Ziwei Zhang, Jianxin Li

机构 * Beihang University(北京航空航天大学) SKLCCSE

AI总结 针对多模态RAG在复杂多跳推理中存在的问题,本文提出DualG-MRAG框架,通过解耦宏观推理与微观匹配抑制检索噪声,经实验验证其在证据召回和问答准确率上优于基线。

Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026). 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28496 2026-07-31 cs.CL 新提交

Beyond Sentiment: Structured Information Extraction from Financial News

超越情感:从金融新闻中进行结构化信息提取

Daohan Zhu, Sitong Ge, Ruofei Wang, Honggu Chen, Yubo Hou, Tao Wan, Zengchang Qin

机构 * School of ASEE, Beihang University(北京航空航天大学ASEE学院) School of BME, Beihang University(北京航空航天大学生物医学工程学院) CAIR and CECS, VinUniversity(VinUniversity CAIR与CECS机构)

AI总结 该研究针对金融情感分析仅压缩新闻为单一极性评分的局限,提出用LLaMA-3.1-70B提取金融新闻的结构化语义特征,结合情感与结构化特征可提升股票预测性能,为多维金融NLP开辟新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28330 2026-07-31 cs.AI 新提交

Paying for Honesty Without Knowing the Truth: Reputation-Penalty Design for LLM Marketplace Agents

在未知真相的情况下为诚实付费:LLM市场智能体的声誉惩罚机制设计

Mingdai Yang, Shicheng Fan, Kejing Yu, Duohao Wang, Li Sun, Hao Peng, Philip S. Yu, Zhiwei Liu

机构 * Univ. of Illinois Chicago(伊利诺伊大学芝加哥分校) Springbrand Inc.(春品牌公司) Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北京航空航天大学) Hangzhou Innovation Institute of BUAA(北京航空航天大学杭州创新研究院) Microsoft(微软公司)

AI总结 针对LLM智能体商家伪造属性的问题,设计无需真实情况的CARP声誉惩罚机制,搭配SPARC机制可保护消费者、提升福利,且在多模型中具有约束力。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28182 2026-07-31 cs.LG 新提交

Multi-channel Uplift Policy Learning

多渠道提升策略学习

Changjian Liu, Tianyu Wang, Xiaoxuan Deng, WenTao Zhu, Yuwei Xu, Jungqi Jin, Yong Gao, Chuan Yu, Jian Xu, Bo Zheng

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Beihang University(北京航空航天大学) CUHK-shenzhen(香港中文大学(深圳))

AI总结 针对电商多渠道营销预算分配的预测后优化范式失效问题,提出快慢因果框架ReAlloc,经淘宝模拟与A/B测试验证可同时提升支付订单量和收入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27969 2026-07-31 cs.CV 新提交

FootprintNet: State-Transition-Guided Dynamic Footprint Learning for Multi-temporal Remote Sensing Change Detection

FootprintNet:面向多时相遥感变化检测的状态转换引导动态 footprint 学习

Haotian Zhang, Hao Chen, Han Guo, Zhengxia Zou, Zhenwei Shi

机构 * Beihang University(北京航空航天大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 针对现有多时相遥感变化检测方法难以表征反复变化区域的局限,提出UBDD并构建FootprintNet,结合状态转换约束与边界线索学习动态变化轨迹,引入BCDS评估,在多数据集上优于SOTA方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27747 2026-07-31 cs.CL cs.AI 新提交

Can LVLMs Uncover the Truth Behind Visual Illusions? An Analysis of Perceptual and Reasoning Capabilities

大型视觉语言模型(LVLMs)能否揭示视觉错觉背后的真相?感知与推理能力分析

Liangjie Zhao, Jiaqing Lyu, Kexin Tang, Zecheng Fang, Rong Yin, Yulan Hu, Da Li, Jianing Li

机构 * Adelaide University(阿德莱德大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Amap, Alibaba Group(阿里巴巴集团高德地图) Beihang University(北京航空航天大学)

AI总结 本文利用IllusionReasoning基准,以视觉错觉为诊断工具评估LVLMs,发现多款LVLMs的推理能力不及宣称水平,为其优化提供了新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27610 2026-07-31 cs.LG 新提交

Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning

卡尔曼与课程学习结合:面向自适应RL微调的高效动态提示选择

Haodong Zhu, Yangyang Ren, Yanjing Li, Sheng Xu, Haiguang Liu, Linlin Yang, Baochang Zhang

机构 * Beihang University(北京航空航天大学) Zhongguancun Academy(中关村学院) Nanyang Technological University(南洋理工大学) Communication University of China(中国传媒大学)

AI总结 本文提出KGPS方法,将提示选择转化为动态状态估计问题,适配RL训练动态,在多推理基准和RL算法上较基线提升准确率与rollout效率,在在线提示选择中达最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26518 2026-07-31 cs.CV 版本更新

EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding

EgoSafe:用于视觉安全理解的第一人称移动采集基准

Yuyun Chen, Tianao Li, TianQuan Feng, Cen Chen, Huiping Zhuang, Hao Peng, Ziqian Zeng

机构 * South China University of Technology(华南理工大学) Beihang University(北京航空航天大学)

AI总结 该研究推出第一人称移动采集的视觉安全理解基准 EgoSafe-Bench,含12000个样本,用分层推理评估(HRE)协议测试,发现现有大视觉语言模型存在感知-推理解耦问题,为逻辑鲁棒视频理解系统提供评估框架

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25560 2026-07-31 cs.AI 版本更新

Agent Skills Matter: Inferring Proprietary Skills from Execution Trajectories

智能体技能很重要:从执行轨迹推断专有技能

Jianing Geng, Ruiqi He, Zekun Fei, Biao Yi, Xuansheng Wu, Ruijie Wang, Zheli Liu, Xia Hu, Qingkai Zeng

机构 * Nankai University(南开大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Alibaba Group(阿里巴巴集团) East China University of Science and Technology(华东理工大学) Beihang University(北京航空航天大学)

AI总结 研究从智能体执行轨迹推断专有技能的问题,提出SigLeak黑盒框架,利用技能特征构建诊断任务,通过对比轨迹迭代优化重构技能,在多场景和框架中表现出色,证明良性轨迹可暴露专有知识。

Comments 18 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18801 2026-07-31 cs.CV 版本更新

PartDiffuser: Part-wise 3D Mesh Generation via Discrete Diffusion

PartDiffuser:通过离散扩散实现部件级3D网格生成

Yichen Yang, Hong Li, Haodong Zhu, Linin Yang, Guojun Lei, Sheng Xu, Baochang Zhang

机构 * Beihang University(北航) Communication University of China(中国通信大学) Zhejiang University(浙江大学)

AI总结 PartDiffuser提出一种半自回归扩散框架,通过部件级方法生成高保真3D网格,有效平衡全局结构与局部细节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08881 2026-07-31 cs.CV 版本更新

Targeted Interpretable Safety Neuron Enhancement for Multilingual Vision-Language Large Models

Precise Shield:通过神经层面指导解释和对齐VLLM安全

Enyi Shi, Fei Shen, Chuancheng Shi, Shuyi Miao, Linxia Zhu, Pengyang Shao, Jinhui Tang, Tat-Seng Chua

机构 * Nanjing University of Science and Technology(南京理工大学) National University of Singapore(新加坡国立大学) Beihang University(北京航空航天大学) Nanjing Forestry University(南京林业大学)

AI总结 本文提出Precise Shield框架,通过对比有害与良性输入的激活模式识别安全神经元,并通过梯度掩码限制参数更新,提升VLLM安全性能并保持多语言多模态泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26599 2026-07-30 cs.LG 新提交

Uncertainty-Guided LLM Semantic Augmentation for Heterogeneous Treatment Effect Estimation

面向异质处理效应估计的不确定性引导大语言模型语义增强

Jialu Xu, Mengkun Liang, Guannan Liu, Xiaojie Mao, Junjie Wu

机构 * Beihang University(北京航空航天大学) School of Economics and Management, Tsinghua University(清华大学经济管理学院)

AI总结 本研究针对异质处理效应估计的局部不稳定性,提出CURL方法,通过LLM生成分离的分配与异质性导向表示,在四个基准上提升了10种主学习者的性能。

Comments 17 pages, 12 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26536 2026-07-30 cs.CV 新提交

TPCD: Tone-Pressure Contrastive Decoding and the Label-Free Gating Bottleneck in Vision-Language Models

TPCD:音调-压力对比解码与视觉语言模型中的无标签门控瓶颈

Jinkun Zhao, Kui Zhang, Wenjun Wu

机构 * Beihang University(北京航空航天大学)

AI总结 本文提出TPCD方法,利用压力诱导分布作为对比解码负分支,结合门控缓解视觉语言模型受高压提示时的不合理承诺问题,在多个基准测试中显著降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04171 2026-07-30 cs.RO cs.LG 版本更新

Teaching Tiny VLA Models Where to Look and How to Move

XS-VLA:将粗粒度空间蒸馏与潜在流匹配相结合用于轻量级机器人控制

Iok Tong Lei, Ying Jie Yap, Wei Huang, Qingchen Xie, Qianzhi Li, Yujie Zhang, Xiaolong Liu, Zhidong Deng

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) National College for Excellent Engineers, Beihang University(北京航空航天大学卓越工程师学院) Wuxi Dexteroushands Robotic Technology Co.(无锡灵犀机器人技术有限公司)

AI总结 提出XS-VLA框架,先通过微调从Qwen3-VL-4B向SmolVLM2-0.25B骨干网蒸馏空间语义知识,再用其增强骨干网训练潜在流匹配策略,提升轻量级机器人控制性能,在LIBERO基准测试中表现出色。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25912 2026-07-29 cs.RO cs.AI 新提交

SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models

用于视觉-语言-动作模型的SAM3D引导的以对象为中心的表示对齐

Zonghe Liu, Shanyuan Jie, Xiaoquan Sun, Chen Cao, Zetian Xu, Zongsheng Liu, Jiayu Chen

机构 * University of Hong Kong(香港大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Huazhong University of Science and Technology(华中科技大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Infiforce(英飞拓)

AI总结 针对视觉-语言-动作模型缺乏目标对象细粒度3D理解的问题,提出以对象为中心的3D表示对齐框架,利用SAM3D提供3D先验,经定位、生成掩码、提取表示等步骤与视觉特征对齐,实验证明其可提升模型性能,尤其在长时操纵场景有效。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25275 2026-07-29 cs.CV cs.AI 新提交

ScaleResfusion: Residual Rectified Flow based on Residual Vector Field

ScaleResfusion:基于残差向量场的残差整流流

Zhenning Shi, Chen Xu, Junhao Zhang, Kefei Zhang, Linjie Liu, Zhedong Zheng, Tao Li

机构 * Nankai University(南开大学) University of Macau(澳门大学) Csiro Data 61(联邦科学与工业研究组织数据61部) Beihang University(北京航空航天大学)

AI总结 研究旨在解决现实世界图像恢复问题,提出ScaleResfusion框架,核心是残差整流流,从低质量图像出发学习残差向量场,结合知识蒸馏降低采样成本,实验证明其高效且性能优,为图像恢复提供实用可扩展方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12109 2026-07-29 cs.RO cs.AI 版本更新

InDex: Empowering VLA Models with Intent-Conditioned Arm-Hand Coordination for Dexterous Manipulation

弥合形态差距:通过意图条件微调使VLA模型适应灵巧操作

Chuanke Pang, Junyi Huang, Zhijun Zhao, Yaobing Wang, Kun Xu, Xilun Ding

机构 * Beihang University(北京航空航天大学) China Academy of Space Technology(中国空间技术研究院)

AI总结 提出InDex框架,通过将预训练的1-DoF平行抓取输出重用作宏观虚拟抓取意图代理,结合两阶段解耦学习架构,实现VLA模型从低自由度夹爪到高自由度灵巧手的适应,有效缓解灾难性遗忘和动作流形坍缩。

详情

展开后加载摘要…

URL PDF HTML 收藏