arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Beihang University(北京航空航天大学)

共收录 180
2608.13173 2026-08-14 cs.AI 新提交

SkillShapley: Boundary-Adaptive Shapley Valuation for Skill Step Attribution in LLM Agents

SkillShapley:面向大语言模型智能体技能步骤归因的边界自适应夏普利值评估方法

Chang Liu, Yuqi Zhang, Yiman Zhong, Boyi Liu, Hengjun Wang, Shuyue Wei

机构 * Beihang University(北京航空航天大学) Shandong University(山东大学)

AI总结 SkillShapley是面向大语言模型智能体技能步骤归因的框架,将技能步骤归因建模为夏普利值估计问题,经SkillsBench实验可高效识别技能步骤价值,为智能体技能构建提供启示。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12842 2026-08-14 cs.AI 新提交

CABS+: Efficient and Scalable Model Merging via Conflict-Aware Sparsification and Adaptive Weight Allocation

CABS+:基于冲突感知稀疏化与自适应权重分配的高效可扩展模型融合方法

Yuchen Liu, Zongzhen Yang, Binhang Qi, Hailong Sun, Xiang Gao

机构 * Beihang University(北京航空航天大学) Hangzhou Innovation Institute of Beihang University(北京航空航天大学杭州创新研究院) National University of Singapore(新加坡国立大学)

AI总结 CABS+通过自适应权重分配与非对称适应度函数优化模型融合,在多类模型与数据集上,较先进方法提升性能、降低内存消耗并加速融合,验证了其有效性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12203 2026-08-13 cs.CV 新提交

GeoFlow: Efficient Driving Video Generation via Geometry-Aligned Priors

GeoFlow:基于几何对齐先验的高效驾驶视频生成

Jiazheng Liu, Hang Li, Jiawei Zhang, Jiahe Li, Xiaohan Yu, Shengyin Fan, Jin Zheng, Xiao Bai

机构 * Beihang University(北京航空航天大学) Macquarie University(麦考瑞大学) Tianyi Transportation Technology Co., Ltd(天宜交通科技有限公司) Jiangxi Research Institute, Beihang University(北京航空航天大学江西研究院)

AI总结 GeoFlow是一款新型驾驶视频生成框架,通过构建几何对齐先验分布替代标准高斯噪声初始化,可提升生成效率与少步生成质量,减少推理步骤。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10941 2026-08-12 cs.LG 新提交

Physics-informed Diffusion Generative Model for Time-Series Data Synthesis in Dynamic Systems

用于动态系统时间序列数据合成的物理信息扩散生成模型

Haiteng Wang, Yunfei Zhu, Tao Wang, Yikang Li, Jiabao Dong, Xiaoge Zhang, Lei Ren

机构 * Beihang University(北京航空航天大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 提出PhysDGM模型,将物理规则嵌入扩散生成过程以合成符合物理定律的工业时间序列,构建的440万样本数据集可提升下游任务性能并减少数据需求,助力数据稀缺环境的AI应用。

Comments 27 pages; 5 main figures and 4 extended data figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09778 2026-08-11 cs.RO 新提交

RoboSeg: Online Part-Level Semantic Reconstruction for Robotic Manipulation via a Single Eye-in-Hand Camera

RoboSeg:基于单眼在手相机的机器人操作的在线部件级语义重建

Zhaochen Lan, Mengxiang Lin

机构 * School of Mechanical Engineering and Automation, Beihang University(北京航空航天大学机械工程及自动化学院)

AI总结 RoboSeg是无需CAD模型的部件级语义重建系统,结合VLM、TSDF融合与SAM3,实现机器人操作的部件语义索引,在24次物理试验中21次完成综合任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09564 2026-08-11 cs.CV cs.AI 新提交

From Semantic Grounding to Decision Optimization: A Unified Framework for Long-Horizon UAV Vision-Language Navigation

从语义接地到决策优化:面向长 horizon 无人机视觉语言导航的统一框架

Zeyuan Ma, Jiaxin Chen, Di Huang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

AI总结 本文针对无人机视觉语言导航的现有问题,提出统一语义到决策框架,经实验在AerialVLN和OpenFly基准上达到SOTA性能。

Comments 10 pages, 5 figures. Accepted at ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09447 2026-08-11 cs.LG cs.AI 新提交

WDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-Training

WDL-OPD:基于混合约束协同训练的弱驱动在线策略蒸馏

Zehao Chen, Gongxun Li, Tianxiang Ai, Yifei Li, Zixuan Huang, Wang Zhou, Tao Huang, Fuzhen Zhuang, Xianglong Liu, Jianxin Li, Deqing Wang, Yikun Ban

机构 * Beihang University(北京航空航天大学) China Telecom eSurfing Cloud(中国电信天翼云)

AI总结 该研究提出WDL-OPD混合约束协同训练方法,在Qwen3 17亿和40亿参数实验中,于四个规模-领域设置里获最强学生检查点,提升MATH500准确率,稳定代码生成表现,支持稳定性假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09186 2026-08-11 cs.CV 新提交

RAGMesh with FaME-G2E: Long-Form Text-Driven 3D Face Generation and Editing

结合FaME-G2E的RAGMesh:长文本驱动的3D人脸生成与编辑

Hao Li, Ju Dai, Feng Zhou, Mengting Shi, Haofei Wang, Zhen Song, Wei Zhou, Lei Li, Junjun Pan

机构 * Beihang University(北京航空航天大学) Pengcheng Laboratory(鹏城实验室) Shanxi University of Finance and Economics(山西财经大学) North China University of Technology(北方工业大学) Cardiff University(卡迪夫大学) Beijing Institute of Technology(北京理工大学)

AI总结 该研究构建了含文本-网格等标注的FaME-G2E数据集,提出RAGMesh框架,含MSRF模块与AdaRAGS约束,在3D人脸生成编辑任务上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08491 2026-08-11 cs.AI 新提交

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models

TrustRoboReward:面向多范式机器人奖励模型的偏好有序保序分数编辑方法

Yidong Wang, Yan Zhan, Ziteng Feng, Zhenyu Cui, Ziyi Zhou, Renzhao Liang, Jiaxuan Zhu, Zilei Yang, Yiran Zhao, Zhongkuan Mao, Bo Jia, Hanchu Ni, Chenggang Xie, Biao Liu, Yi Zhang, Yong Dai, Xiaozhu Ju, Wei Ye, Shikun Zhang

机构 * Peking University(北京大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) University of Science and Technology of China(中国科学技术大学) Southeast University(东南大学) Southern University of Science and Technology(南方科技大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Beijing Language and Culture University(北京语言大学) Sichuan University(四川大学) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 针对现有机器人奖励模型的跨范式偏好与分数不一致问题,本文提出 TrustRoboReward 框架,通过 POISE 方法解决反转冲突,训练的 Qwen3-VL-4B 性能接近 GPT-5-mini,优于 RoboReward 基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07323 2026-08-10 cs.LG 新提交

Is SwiGLU's Open Positive Tail Necessary? Evidence from Closed-Tail Gating with MemGLU

SwiGLU的开放正尾是否必要?来自带MemGLU的闭尾门控的证据

Yuting Ge, Pengju Yang, Mingkai Nie

机构 * City University of Hong Kong(香港城市大学) Beihang University(北京航空航天大学) National University of Singapore(新加坡国立大学)

AI总结 该研究针对仅解码器的语言模型FFN,通过对比实验发现,源自忆阻分支几何的MemGLU在相近损失下无需SwiGLU的开放正尾即可表现良好,表明模型会适应预训练的门控几何。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06943 2026-08-10 cs.CV 新提交

Dual-Space Modality Consistency Learning for Universal Cross-Modal Re-Identification

用于通用跨模态行人重识别的双空间模态一致性学习

Yujian Zhao, Yukang Zhao, Hankun Liu, Haoxuan Xu, Bo Li, Hanzi Wan, Guanglin Niu

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) School of Humanities and Social Sciences, Beihang University(北京航空航天大学人文与社会科学高等研究院) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) School of Informatics, Xiamen University(厦门大学信息学院)

AI总结 提出DSMCL即插即用框架,联合建模空间与频域一致性,在5个数据集的17项协议上提升跨模态ReID基线性能,适配多样化异构模态场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05790 2026-08-07 cs.AI cs.CR 新提交

ChainClaw: A Layered Agent Framework for Reliable On-Chain Execution

ChainClaw:一种用于可靠链上执行的分层智能体框架

Jiacheng Wei, Zhaoxin Fan, Xin Wen, Yuqin Lan, Dongrun Li, Wenjun Wu, Faguo Wu, Xiao Zhang

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(北京航空航天大学未来区块链与隐私计算高精尖创新中心) Beihang University(北京航空航天大学) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) School of Mathematical Sciences, Beihang University(北京航空航天大学数学科学学院) Zhongguancun Laboratory(中关村实验室)

AI总结 ChainClaw是基于OpenClaw的分层区块链原生智能体框架,通过三层架构解决链上执行的反应性、不可逆性和可观测性缺口,在自建基准上的安全性和任务完成度均优于代表性基线。

Comments 8 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05170 2026-08-07 cs.CL cs.AI 新提交

DREAM: LLM-based Dynamic Role-playing via Event-Aware Memory Graph

DREAM:基于大语言模型的事件感知记忆图动态角色扮演

Zhihao Xiao, Mengting Li, Xintao Wang, Linfeng Li, Limin Shui, Mengqi Ji, Borui Cai

机构 * Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) School of Computer Science, Fudan University(复旦大学计算机科学技术学院)

AI总结 DREAM是一种受ABC认知模型启发的结构化记忆框架,通过EMG提升角色扮演智能体的时间与因果连贯性,在CoSER、LIFECHOICE和TCM上取得最优性能。

Comments Accepted at KDD 2026. Camera-ready version to appear. 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05728 2026-08-07 cs.CV cs.LG physics.optics 新提交

Engram-E2VID: Reference-Based Event-to-Video Reconstruction via Generative Activation of Appearance Engrams

Engram-E2VID:基于外观印迹生成激活的参考式事件到视频重建方法

Feiyu Ji, Xiang Li, Hao Ma, Tianxiang Huang, Qingxin Lu, Mengqi Ji, Lei Han, Xiaokang Yang, Xiaoyun Yuan

机构 * Shanghai Jiao Tong University(上海交通大学) Beihang University(北京航空航天大学) DISCOVER Robotics(DISCOVER机器人公司)

AI总结 本研究提出Engram-E2VID框架,通过外观印迹生成激活实现参考式事件到视频重建,在三个基准测试中PSNR最高提升3.29 dB、LPIPS最高降低0.08,性能随重建间隔增加下降更慢。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04776 2026-08-06 cs.AI 新提交

NSF-HRPT: Neural Semantic Field meets Hierarchical Risk Perception Tree for Safety-Critical Scenario Assessment

NSF-HRPT:神经语义场结合分层风险感知树的安全关键场景评估方法

Yu Zhao, Jiangyu Pan, Tao Hu, Ming Yin, Fan Yang, Jiangfan Liu, Xiubo Liang

机构 * Zhejiang University(浙江大学) Beihang University(北京航空航天大学)

AI总结 该研究提出NSF-HRPT框架,结合神经语义场与分层风险感知树,引入Sim2Real策略,实现单目视觉输入下安全关键场景的高效风险评估,在合成与现实数据集上均取得优异性能。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04606 2026-08-06 cs.CV 新提交

TRCoRSurg: Temporal-Relational Co-Reasoning for Surgical Video Triplet Recognition

TRCoRSurg:用于手术视频三元组识别的时序关系协同推理

Fang Li, Shihao Zou, Weixin Si, Yang Gao, Shuai Li, Aimin Hao

机构 * Beihang University(北京航空航天大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Shenzhen University of Advanced Technology(深圳理工大学)

AI总结 本文针对手术视频三元组识别中难以统一建模帧内标签依赖与帧间时序语义的问题,提出TRCoRSurg框架,引入MS-CAMRE和BTRFA模块并定义TCER指标,在两个数据集上实现最优性能且一致性错误率显著降低。

Comments code: https://github.com/Neesky/TRCoRSurg

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04587 2026-08-06 cs.CV 新提交

MetaVideoAgent: Automated Video-Agent Evolution for Long-Form Video Understanding

MetaVideoAgent:面向长视频理解的自动视频智能体进化框架

Benlei Cui, Ruize Wang, Junjie Li, Jinhao Chen, Longtao Huang, Yinghao Chen, Yuwen Zhai, Jingqun Tang, Ruijian Jia, Weiwei Wu, Pengfei Sun, Haiwen Hong

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) ByteDance(字节跳动)

AI总结 MetaVideoAgent是自动进化视频智能体的框架,在VA-EvoBench上经4次迭代后将宏平均准确率从38.44%提至51.47%,性能优于现有最优固定设计智能体且成本更低。

Comments 16 pages, 7 figures. Code: https://github.com/Alibaba-VELLDEPTH/MetaVideoAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04419 2026-08-06 cs.LG cs.AI 新提交

SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation

SPOT:面向在线策略蒸馏的稀疏探测与结果校准

Zikun Qu, Min Zhang, Mingze Kong, Zhiwei Shang, Yikun Ban, Shuang Qiu, Zhongxiang Dai

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) East China Normal University(华东师范大学) Beihang University(北京航空航天大学) City University of Hong Kong(香港城市大学)

AI总结 该研究针对在线策略蒸馏的缺陷,提出SPOT方法,通过获取-探索-利用程序优化探测与蒸馏,经多模型多基准实验验证,可提升推理性能并平衡解的质量与覆盖范围。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04377 2026-08-06 cs.LG cs.AI 新提交

Towards Trustworthy Hypergraph Neural Networks under Label Noise

面向标签噪声下可信赖的超图神经网络

Mengyao Zhou, Zhiheng Zhou, Xiao Han, Guiying Yan

机构 * Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) University of Chinese Academy of Sciences(中国科学院大学) School of Mathematics and Statistics, Shandong University(山东大学数学与统计学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)

AI总结 本文针对标签噪声下超图节点分类问题,提出超图鲁棒框架HyperTrust,通过估计超边可信赖性及两个协同模块优化超图结构,在多数据集多噪声设置下验证了其有效性。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04106 2026-08-06 cs.CV eess.IV 新提交

LoRetta: A Foundation Model and Extensive Dataset for Global-Scale Remote Sensing Dense Image Matching

LoRetta:面向全球尺度遥感密集图像匹配的基础模型与大规模数据集

Siwei Yu, Han Guo, Zhenwei Shi, Zhengxia Zou

机构 * Beihang University(北京航空航天大学)

AI总结 针对全球尺度遥感密集图像匹配的挑战,本文提出结合可匹配性感知仿射定位与引导式密集配准的基础模型LoRetta,并构建含原生可匹配性标签的LEVIR-GM基准,实验表明其性能优于现有模型且迁移性良好。

Comments 17 pages, 12 figures, 6 tables. Submitted to IEEE Transactions on Pattern Analysis and Machine Intelligence. Project page: https://siweiyu.com/work/loretta/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02990 2026-08-05 cs.RO 新提交

EmbodiedVAE: Disentangled Video VAE for Efficient and Controllable Embodied Manipulation

EmbodiedVAE:用于高效可控具身操作的解耦视频变分自编码器

Jiayi Luo, Hanxin Zhu, Chen Gao, Jiankun Wang, Cong Wang, Tianyu He, Jianxin Li, Zhibo Chen

机构 * Beihang University(北京航空航天大学) Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) CASIA, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所(CASIA)) Microsoft Research Asia(微软亚洲研究院)

AI总结 针对现有潜在扩散模型适配具身操作场景的缺陷,提出EmbodiedVAE视频变分自编码器,通过双编码器架构与最优传输一致性模块实现更优重建质量、压缩率及精确动作控制。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02580 2026-08-04 cs.RO 新提交

Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data

Ego2Robot:从第一视角人类数据生成可扩展机器人数据

Ye Wang, Pei Lin, Xiong-Hui Chen, Haoqi Yuan, Zhixuan Liang, Yiyang Huang, Anzhe Chen, Zixing Lei, Jie Zhang, Tao Zhang, Haoyang Li, Tong Zhang, Chenxi Xiao, Ziyuan Jiao, Qin Jin

机构 * AIM3 Lab, Renmin University of China(中国人民大学AIM3实验室) Qwen Team, Alibaba Inc.(阿里巴巴通义千问团队) ShanghaiTech University(上海科技大学) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

AI总结 Ego2Robot提出将第一视角人类操控视频转换为机器人训练数据的可扩展流水线,生成18561小时机器人数据,扩展RoboTwin2.0验证其联合预训练可提升机器人分布外泛化能力并经真实部署验证

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02495 2026-08-04 cs.CV cs.AI 新提交

DyFrDet: Towards Accurate Small Object Detection via Dynamic Frequency Suppression with Label Disambiguation

DyFrDet:通过结合标签歧义消解的动态频率抑制实现精确的小目标检测

Zihan Yang, Yang Guo, Hongxing Zhang, Dan Lu, Siyuan Yao

机构 * Hangzhou International Innovation Institute of Beihang University(北京航空航天大学杭州国际创新研究院) Beijing University of Posts and Telecommunications(北京邮电大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)

AI总结 针对小目标检测中视觉线索不足、频域噪声与标签歧义被忽视的问题,提出DyFrDet检测器,通过DyFrFPN与LDM模块实现精确检测,在多基准上达SOTA性能。

Comments 10 pages, 4 figures, 7tabs

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02257 2026-08-04 cs.RO 新提交

Learning Panorama-Aware VLA for Mobile Manipulation with Whole-Body Teleoperation

面向全身遥操作移动操作的全景感知VLA学习

Donglin Yang, Haoran Chen, Xingyu Chen, Lixing Liu, Manyi Li, Changhe Tu, Ke Xu, Xiaojian Ma, Si Liu

机构 * Beihang University(北京航空航天大学) Shandong University(山东大学) Johns Hopkins University(约翰斯·霍普金斯大学) Delta Intelligence(delta智能公司)

AI总结 针对移动操作VLA策略的局部视野与全身演示数据收集难题,开发全身遥操作系统与PanoVLA全景感知VLA策略,基于5.5小时多模态数据集,在四项真实任务中平均阶段完成率91.3%、端到端成功率73.4%,性能优于局部视角基线。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02157 2026-08-04 cs.LG cs.AI 新提交

RamanPFN: learning from Raman spectral structure with a tabular foundation model

RamanPFN:基于表格基础模型学习拉曼光谱结构

Xingyu Pan, Huan Wang, Jinjia Guo, Zhenlin Zhao, Siming Dong, Jixi Lu

机构 * Beihang University(北京航空航天大学) Cleer Science(Cleer科技公司)

AI总结 RamanPFN在TabPFN推理前编码拉曼光谱依赖关系,经74个公开拉曼数据集的150项任务评估,可降低回归与分类误差,是高维拉曼测量与可复用表格推理的有效接口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01914 2026-08-04 cs.CV 新提交

CHOW-SLAM: Compact Hybrid Representation with Complementary Overlap Window Optimization for RGB-D SLAM

CHOW-SLAM:面向RGB-D SLAM的结合互补重叠窗口优化的紧凑混合表示方法

Wenxuan Ji, Jin Xiao, Xiaoguang Hu, Jiaqi Shi, Zichong Jia, Baochang Zhang

机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院)

AI总结 本文提出CHOW-SLAM框架,通过紧凑P-H混合表示与互补重叠窗口策略构建空间、时间约束,结合ORB初始化与神经渲染优化,在多数据集上优于现有最优RGB-D SLAM方法。

Comments 33 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01102 2026-08-04 cs.RO 新提交

CAAT: Contact-Aware Attention Scaling and Tactile Masking for Data-Efficient Contact-Rich Manipulation

CAAT:用于数据高效接触丰富型操作的接触感知注意力缩放与触觉掩码方法

Jiaming Jiang, Yuzhe Huang, Hao Liang, Pei Lin, Shengcheng Luo, Fanrong Dong, Jiaping Wu, Chenxi Xiao, Wanlin Li, Ziyuan Jiao

机构 * ShanghaiTech University(上海科技大学) Beihang University(北京航空航天大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Zhejiang University(浙江大学) BUPT(北京邮电大学)

AI总结 该研究针对接触丰富型操作中视觉-触觉策略缺乏接触感知先验的问题,提出CAAT框架,通过注意力缩放和动态触觉掩码提升策略性能,在仿真和真实实验中均显著优于现有方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00847 2026-08-04 cs.CV 新提交

Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking

模型作为工具:用于统一多模态视觉跟踪的智能体协调框架

Wenrui Cai, Yuzhe Li, Qingjie Liu, Yunhong Wang

机构 * Beihang University(北京航空航天大学)

AI总结 针对现有视觉跟踪方法的瓶颈,提出ACTrack智能体协调框架,整合异构模型工具的互补优势,仅用30%可训练参数便在多类基准上实现性能超越。

Comments 21 pages, 15 Tables, 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29254 2026-08-03 cs.AI 新提交

Tool Specifications Matter: Uncovering and Mitigating Safety Risks in AI Agents

工具规格很重要:揭示和缓解AI智能体中的安全风险

Minghui Pan, Jiayuxuan Yang, Yuanyuan Yuan, Yu Jiang, Zhenpeng Chen

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

AI总结 本研究发现模式格式工具规格是AI智能体安全下降的主因,提出SafeKeep防护措施,可提升有害请求弃权率、降低攻击成功率,性能优于现有防护且保留任务处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28580 2026-07-31 cs.AI 新提交

DualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal Retrieval-Augmented Generation

DualG-MRAG:面向多模态检索增强生成的宏观推理与微观匹配解耦框架

Jiacheng Tao, Qingyun Sun, Haonan Yuan, Ziwei Zhang, Jianxin Li

机构 * Beihang University(北京航空航天大学) SKLCCSE

AI总结 针对多模态RAG在复杂多跳推理中存在的问题,本文提出DualG-MRAG框架,通过解耦宏观推理与微观匹配抑制检索噪声,经实验验证其在证据召回和问答准确率上优于基线。

Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026). 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏