arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 3033
2510.15264 2026-05-26 cs.CV

DriveGen3D: Boosting Feed-Forward Driving Scene Generation with Efficient Video Diffusion

DriveGen3D: 通过高效视频扩散提升前馈驾驶场景生成

Weijie Wang, Jiagang Zhu, Zeyu Zhang, Xiaofeng Wang, Zheng Zhu, Guosheng Zhao, Chaojun Ni, Haoxiao Wang, Guan Huang, Xinze Chen, Yukun Zhou, Wenkang Qin, Duochao Shi, Haoyun Li, Yicheng Xiao, Donny Y. Chen, Jiwen Lu

机构 * Zhejiang University(浙江大学) GigaAI Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peking University(北京大学) Monash University(墨尔本大学)

AI总结 提出DriveGen3D框架,结合快速视频扩散Transformer(FastDrive-DiT)和前馈3D重建模块(FastRecon3D),实现高质量、可控的动态3D驾驶场景生成,在长视频和3D一致性上达到最优。

Comments ICME 2026 Oral, Project Page: https://lhmd.top/drivegen3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.07863 2026-05-26 cs.CV cs.AI cs.MM

You Can Ground Earlier than See: An Effective and Efficient Pipeline for Temporal Sentence Grounding in Compressed Videos

你可以比看见更早定位:一种用于压缩视频中时序句子定位的高效流程

Xiang Fang, Daizong Liu, Pan Zhou, Guoshun Nan

机构 * The Hubei Engineering Research Center on Big Data Security, School of Cyber Science and Engineering, Huazhong University of Science and Technology(大数据安全湖北工程研究中心,网络安全科学与工程学院,华中科技大学) Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 提出一种三分支压缩域时空融合框架(TCSF),直接从压缩视频中提取I帧、运动向量和残差特征,实现高效准确的时序句子定位。

Comments Accepted by CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.11572 2026-05-26 cs.CV cs.AI cs.IR cs.MM

Multi-Modal Cross-Domain Alignment Network for Video Moment Retrieval

多模态跨域对齐网络用于视频时刻检索

Xiang Fang, Daizong Liu, Pan Zhou, Yuchong Hu

机构 * Hubei Key Laboratory of Distributed System Security(湖北分布式系统安全重点实验室) Hubei Engineering Research Center on Big Data Security(湖北大数据安全工程研究中心) School of Cyber Science and Engineering(网络安全学院) Huazhong University of Science and Technology(华中科技大学) Wangxuan Institute of Computer Technology(王轩计算机技术研究所) Peking University(北京大学) School of Computer Science and Technology(计算机科学与技术学院) Key Laboratory of Information Storage System Ministry of Education of China(信息存储系统教育部重点实验室)

AI总结 提出多模态跨域对齐网络,通过域对齐、跨模态对齐和特定对齐三个模块,解决跨域视频时刻检索中域差异和语义鸿沟问题。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.14882 2026-05-26 cs.MM cs.CL cs.CV cs.IR

Hierarchical Local-Global Transformer for Temporal Sentence Grounding

层次化局部-全局Transformer用于时间语句定位

Xiang Fang, Daizong Liu, Pan Zhou, Zichuan Xu, Ruixuan Li

机构 * Hubei Engineering Research Center on Big Data Security, School of Cyber Science and Engineering, Huazhong University of Science and Technology(大数据安全湖北工程研究中心,华中科技大学网络安全科学与工程学院) Wangxuan Institute of Computer fTechnology, Peking University(王宣计算机技术研究院,北京大学) School of software, Dalian University of Technology(软件学院,大连理工大学) School of Computer Science, and Technology, Huazhong University of Science, and Technology(计算机科学与技术学院,华中科技大学)

AI总结 提出层次化局部-全局Transformer(HLGT),通过建模视频和查询的不同粒度层次及跨模态交互,实现更细粒度的多模态表示,并在三个数据集上取得最先进性能。

Comments Publish in IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25077 2026-05-26 cs.CV

WorldCraft: From Camera Navigation to Object Manipulation in Interactive Video World Models

WorldCraft: 从相机导航到交互式视频世界模型中的物体操控

Bohai Gu, Taiyi Wu, Yueyang Yuan, Jian Liu, Xiaocheng Lu, Dazhao Du, Jie Zhang, Jinxiang Lai, Shuai Yang, Xiaotong Zhao, Alan Zhao, Song Guo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) AI Technology Center, Tencent Video, Tencent(腾讯视频AI技术中心,腾讯) Wuhan University(武汉大学) Peking University(北京大学)

AI总结 提出WorldCraft框架,通过轨迹控制管道(NWT、SP-LoRA、TASP)将交互式视频世界模型从相机导航扩展到物体级轨迹操控,实现用户指定路径下的物体运动与相机导航共存。

Comments Project page: https://nevsdev.github.io/WorldCraft/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24959 2026-05-26 cs.CV

Three-Step Conditional Diffusion 3D Reconstruction for Light-Field Microscopy

三步条件扩散光场显微三维重建

Qihong Zhao, Shaokang Yan, Zhimin Qiao, Jinjia Wang, Bo Xiong

机构 * Yanshan University(雁山大学) Peking University(北京大学)

AI总结 针对光场显微成像中传统算法分辨率低、伪影重、计算成本高,以及现有学习方法重建精度和泛化能力不足的问题,提出一种基于三步条件扩散的高保真三维重建方法,通过确定性三步采样和轻量条件U-Net实现快速准确重建,并引入类间检测模块增强稳定性。

Comments 10 pages, 6 figures. Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24958 2026-05-26 cs.CL cs.AI

SEP-Attack: A Simple and Effective Paradigm for Transfer-Based Textual Adversarial Attack

SEP-Attack:一种简单有效的基于迁移的文本对抗攻击范式

Han Liu, Zhi Xu, Xiaotong Zhang, Feng Zhang, Xiaoming Xu, Wei Wang, Fenglong Ma, Hong Yu

机构 * Dalian University of Technology(大连理工大学) Peking University(北京大学) Macao Polytechnic University(澳门理工学院) The Pennsylvania State University(宾夕法尼亚州立大学)

AI总结 提出SEP-Attack,利用行列式点过程生成多样化的代理集成权重,通过新指标评估预测置信度以计算词重要性并生成对抗样本,在多个数据集和API上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24914 2026-05-26 cs.IR cs.DB cs.LG

MVR-cache: Optimizing Semantic Caching via Multi-Vector Retrieval and Learned Prompt Segmentation

MVR-cache:通过多向量检索和学习型提示分割优化语义缓存

Ali Noshad, Zishan Zheng, Yinjun Wu

机构 * School of Computer Science, Peking University, Beijing, China(北京大学计算机科学学院,北京,中国) School of Information, Renmin University of China, Beijing, China(中国人民大学信息学院,北京,中国)

AI总结 提出MVR-cache方法,利用多向量检索和学习型提示分割模型,通过强化学习优化缓存命中率,在保证正确性的前提下将缓存命中率提升高达37%。

Comments Published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24592 2026-05-26 cs.RO

MuGen: Multi-Skill Generative Locomotion Controller for Humanoid Robots

MuGen: 人形机器人的多技能生成式运动控制器

Yusen Feng, Xiang Wang, Heyuan Yao, Zixi Kang, Xinyu Huo, Boyang Yu, Pengyun Qiu, Ruijie Zhao, Baoquan Chen, Libin Liu

机构 * Peking University(北京大学)

AI总结 提出MuGen框架,利用VQ-VAE和教师-学生策略蒸馏,从异构人类运动数据中学习生成式运动表示,使人形机器人能够执行多技能运动并模仿未见过的动作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24530 2026-05-26 cs.CL cs.CV

Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval

Unveil: 统一视觉-文本集成与蒸馏的多模态文档检索

Hao Sun, Yingyan Hou, Jiayan Guo, Bo Wang, Chunyu Yang, Jinsong Ni, Yan Zhang

机构 * State Key Laboratory of General Artificial Intelligence, Peking University(北京理工大学通用人工智能国家重点实验室) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) Key Laboratory of Target Cognition and Application Technology(目标认知与应用技术重点实验室) Beijing Institute of Technology(北京理工大学) Ucap Cloud(Ucap云)

AI总结 提出Unveil框架,通过视觉-文本嵌入和知识蒸馏实现鲁棒的文档检索,兼顾布局与语义信息。

Comments ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11182 2026-05-26 cs.AI

The Many Faces of On-Policy Distillation: Pitfalls, Mechanisms, and Fixes

在线策略蒸馏的多种面貌:陷阱、机制与修复

Siqi Zhu, Xuyan Ye, Hongyu Lu, Weiye Shi, Ge Liu

机构 * UIUC(伊利诺伊大学香槟分校) Renmin University of China(中国人民大学) Peking University(北京大学)

AI总结 本文通过实证研究分析了在线策略蒸馏(OPD)和在线策略自蒸馏(OPSD)在大语言模型后训练中的有效性、失败机制及修复方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01284 2026-05-26 cs.CV cs.AI cs.CL cs.IR

Chain of Evidence: Pixel-Level Visual Attribution for Iterative Retrieval-Augmented Generation

证据链:面向迭代检索增强生成的像素级视觉归因

Peiyang Liu, Ziqiang Cui, Xi Wang, Di Liang, Wei Ye

机构 * National Engineering Research Center for Software Engineering, Peking University(软件工程国家级工程研究中心,北京大学) City University of Hong Kong(香港城市大学) Peking University(北京大学) Tencent Technology(腾讯科技)

AI总结 提出Chain of Evidence (CoE)框架,利用视觉语言模型直接对检索到的文档截图进行推理,输出精确边界框以可视化完整推理链,解决迭代检索增强生成中的粗粒度归因和视觉语义丢失问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06626 2026-05-26 cs.LG cs.AI

Grouter: Decoupling Routing from Representation for Accelerated MoE Training

Grouter: 将路由与表示解耦以加速MoE训练

Yuqi Xu, Rizhen Hu, Zihan Liu, Mou Sun, Kun Yuan

机构 * School of Mathematical Sciences, Peking University, Beijing, China(北京大学数学科学学院) Center for Machine Learning Research, Peking University, Beijing, China(北京大学机器学习研究中心) Yuanpei College, Peking University, Beijing, China(北京大学元培学院) Zhejiang Lab, Hangzhou, China(浙江实验室)

AI总结 提出Grouter方法,通过从预训练MoE模型中蒸馏高质量结构作为固定路由器,解耦结构优化与权重更新,显著加速模型收敛并提升训练吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23916 2026-05-26 cs.CV cs.AI

Topology-Driven Transferability Estimation of Medical Foundation Models for Segmentation

基于拓扑驱动的医学基础模型分割迁移性估计

Jiaqi Tang, Shaoyang Zhang, Xiaoqi Wang, Jiaying Zhou, Yang Liu, Qingchao Chen

机构 * Peking University(北京大学) Hohai University(河海大学) Beijing Normal University-Hong Kong Baptist University United International College(北京师范大学-香港 Baptist大学联合国际学院) National Institute of Health Data Science, Peking University(健康数据科学国家研究院,北京大学) Institute of Medical Technology, Peking University(北京大学医学技术研究院) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学)

AI总结 提出拓扑驱动迁移性估计框架,通过全局表示拓扑散度、局部边界感知拓扑一致性和任务自适应融合,无需微调即可高效选择医学基础模型,在OpenMind基准上加权Kendall指标相对提升约31%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18794 2026-05-26 cs.GR cs.CV

ChronoGS: Disentangling Invariants and Changes in Multi-Period Scenes

ChronoGS:多时期场景中不变性与变化的解耦

Zhongtao Wang, Jiaqi Dai, Qingtian Zhu, Yilong Li, Mai Su, Fei Zhu, Meng Gai, Shaorong Wang, Chengwei Pan, Yisong Chen, Guoping Wang

机构 * Peking University(北京大学) Beijing Forestry University(北京林业大学) The University of Tokyo(东京大学) Beihang University(北航)

AI总结 提出ChronoGS,一种时间调制的高斯表示方法,通过统一锚点支架重建多时期场景,并解耦稳定与演化组件,实现时间一致的重建,同时发布ChronoScene基准数据集。

Comments CVPR26 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10652 2026-05-26 q-bio.QM cs.LG

Querying structural and functional niches on spatial transcriptomics data

查询空间转录组数据中的结构和功能生态位

Mo Chen, Minsheng Hao, Xinquan Liu, Lin Deng, Peng Liu, Chen Li, Dongfang Wang, Kui Hua, Liang Guo, Xuegong Zhang, Lei Wei

机构 * MOE Key Laboratory of Bioinformatics and Bioinformatics Division of BNRIST, Department of Automation, Tsinghua University(生物信息学教育部重点实验室和北京理工大学生物信息学分部,自动化系,清华大学) Center for Synthetic and Systems Biology, School of Life Sciences and School of Medicine, Tsinghua University(合成与系统生物学中心,生命科学学院和医学学院,清华大学) Department of Thoracic Surgery, National Cancer Center/National Clinical Research Center for Cancer/Cancer Hospital, Chinese Academy of Medical Sciences and Peking Union Medical College(胸外科部门,国家癌症中心/国家癌症临床研究中心/癌症医院,中国医学科学院和北京协和医学院) Peking Union Medical College, Chinese Academy of Medical Sciences(北京协和医学院,中国医学科学院) Biomedical Pioneering Innovation Center (BIOPIC), Peking University(生物医学前瞻性创新中心(BIOPIC),北京大学) Cancer Research UK Cambridge Institute, University of Cambridge(英国癌症研究Cambridge研究所,剑桥大学) Department of Immunology, School of Basic Medical Sciences, Harbin Medical University(免疫学部门,基础医学学院,哈尔滨医科大学) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) Zhongguancun Institute of Artificial Intelligence, Beijing, China(中关村人工智能研究院,北京,中国)

AI总结 提出QueST方法,通过子图建模和对比学习查询空间转录组样本中的相似生态位,有效捕捉异质环境中的生态位结构并跨平台泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24110 2026-05-26 cs.AI

EvoCode-Bench: Evaluating Coding Agents in Multi-Turn Iterative Interactions

EvoCode-Bench:评估多轮迭代交互中的编码智能体

Haiyang Shen, Xuanzhong Chen, Wendong Xu, Yun Ma, Liang Chen, Kuan Li

机构 * UniPat AI Peking University(北京大学) Tsinghua University(清华大学) HKU(香港大学)

AI总结 提出EvoCode-Bench基准,通过多轮状态化任务和累积测试评估编码智能体在需求变化下维持代码库工作的能力,发现多轮指标远低于单轮指标,且最强智能体多轮成功率仅约50%。

Comments Work in Progress; 32 pages, 10 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24004 2026-05-26 cs.AI cs.CV cs.LG cs.RO

Reason--Imagine--Act: Closed-Loop LLM Decision Making with World Models for Autonomous Driving

推理--想象--行动:基于世界模型的闭环LLM自动驾驶决策

Zhengqi Sun, Yiwen Sun, Boxuan Liu, Tailai Chen, Tianxu Guo, Jiabin Liu

机构 * 1Department of Information Management, Peking University, Beijing 100871, China 2School of Intelligence Science Technology, Peking University, Beijing 100871, China 3State Key Laboratory of General Artificial Intelligence, BIGAI, Beijing 100080, China 4Yuanpei College, Peking University, Beijing 100871, China 5China Agricultural University, Beijing, China 6CRSC Research \& Design Institute Group Co., Ltd., Beijing, China

AI总结 提出Reason--Imagine--Act (RIA)闭环框架,结合LLM推理器与动作条件世界模型进行在线安全验证,在CARLA点目标协议下实现80.05%路线完成率、51.10%到达率和0.20%碰撞率。

Comments Accepted by the 2026 IEEE International Conference on Intelligent Transportation Systems (ITSC 2026). 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23960 2026-05-26 q-bio.BM cs.LG

Learning Protein Structure-Function Relationships through Knowledge-guided Representation Decomposition

通过知识引导的表示分解学习蛋白质结构-功能关系

Mingqing Wang, Zhiwei Nie, Athanasios V. Vasilakos, Yonghong He, Zhixiang Ren

机构 * Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院) Pengcheng Laboratory, Shenzhen, China(鹏城实验室) School of Electronic and Computer Engineering, Peking University, Shenzhen, China(北京大学电子与计算机工程学院) CAIR, University of Agder, Norway(阿格德大学CAIR) Shanghai Smart Logic Technology Co. Ltd., Shanghai, China(上海智略科技有限公司)

AI总结 提出知识引导的框架ProtDiS,基于信息瓶颈原理分解预训练的蛋白质微环境嵌入,得到更特异、独立和信息高效的结构特征,在12个下游任务上取得一致改进。

Comments 28 pages, 17 figures, icml 2026 regular

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05682 2026-05-26 cs.CL

Retrieved In-Context Principles from Previous Mistakes

从先前错误中检索的上下文原则

Hao Sun, Yong Jiang, Bo Wang, Yingyan Hou, Yan Zhang, Pengjun Xie, Fei Huang

机构 * Peking University(北京大学) Beijing Institute of Technology(北京理工大学) Alibaba Group(阿里巴巴集团) Chinese Academy of Sciences(中国科学院)

AI总结 提出检索式上下文原则(RICP)框架,通过教师模型分析学生模型错误生成原则,聚类错误以增强覆盖,检索相关错误生成问题级原则,提升定制化,无需推理时干预,在七个推理基准上提升多种提示策略性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15678 2026-05-26 cs.CV

Multi-Pair Temporal Sentence Grounding via Multi-Thread Knowledge Transfer Network

多对时序句子定位的多线程知识迁移网络

Xiang Fang, Wanlong Fang, Changshuo Wang, Daizong Liu, Keke Tang, Jianfeng Dong, Pan Zhou, Beibei Li

机构 * Sichuan University(四川大学) Nanyang Technological University, Singapore(南洋理工大学,新加坡) Peking University(北京大学) Guangzhou University(广州大学) Zhejiang Gongshang University(浙江工商大学)

AI总结 提出多对时序句子定位新任务,并设计多线程知识迁移网络,通过跨模态对比、原型对齐和自适应负样本选择实现多对视频-查询对的协同训练。

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23723 2026-05-25 cs.AI

MemAudit: Post-hoc Auditing of Poisoned Agent Memory via Causal Attribution and Structural Anomaly Detection

MemAudit:通过因果归因和结构异常检测对中毒代理记忆进行事后审计

Zhewen Tan, Yilun Yao, Huiyan Jin, Wenhan Yu, Guoan Wang, Mengyuan Fan, liang lu, Feng Liu, Xiangzheng Zhang, Duohe Ma, Tong Yang, Lin Sun

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Qiyuan Tech(齐元科技) Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理实验室) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

AI总结 提出MemAudit框架,结合反事实记忆影响评分和记忆一致性图,对记忆增强型LLM代理中的恶意注入记忆进行事后因果审计,显著降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23522 2026-05-25 cs.LG cs.AI cs.CV

Precise: SDE-Consistent Stochastic Sampling for RL Post-Training of Flow-Matching Models

Precise: 用于流匹配模型强化学习后训练的SDE一致随机采样

Jade Zou, Tao Huang, Weijie Kong, Junzhe Li, Yue Wu, Qi Tian, Jiangfeng Xiong, Jianwei Zhang, Liefeng Bo, Zhao Zhong

机构 * Peking University(北京大学) Tencent Hunyuan(腾讯文言)

AI总结 针对流匹配模型强化学习后训练中的随机采样问题,提出Precise采样器,通过平衡探索与稳定性的SDE调度和冻结干净潜变量后验均值的近似方法,实现SDE一致性,显著提升奖励优化速度和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23445 2026-05-25 cs.CV

DFSAttn: Dynamic Fine-grained Sparse Attention for Efficient Video Generation

DFSAttn:面向高效视频生成的动态细粒度稀疏注意力

Jie Hu, Zixiang Gao, Yutong He, Kun Yuan

机构 * Peking University(北京大学)

AI总结 针对扩散变换器中注意力二次复杂度导致计算成本高的问题,提出一种无需训练的稀疏注意力框架DFSAttn,通过希尔伯特曲线重排序、分层块评分和稀疏掩码缓存实现动态细粒度稀疏化,在保持生成质量的同时实现高达2.1倍端到端加速。

Comments ICML 2026; 17 pages, 8 figures;

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23257 2026-05-25 cs.RO cs.CV

Turning Adaptation into Assets: Cross-Domain Bridging for Online Vision-Language Navigation

将适应转化为资产:面向在线视觉语言导航的跨域桥接

Zixuan Hu, Xuantuo Huang, Yancheng Li, Yichun Hu, Shengyong Xu, Ling-Yu Duan

机构 * School of Computer Science, Peking University, Beijing, China(北京大学计算机科学系) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) School of Electronics, Peking University, Beijing, China(北京大学电子学院)

AI总结 提出 IDEA 框架,通过 Fisher 引导的软提示优化和动态资产库构建跨域桥接,解决视觉语言导航中测试时适应的灾难性遗忘和负迁移问题。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23241 2026-05-25 cs.LG

RelPrism: A Multi-Faceted Pre-training Framework with Self-Generated Tasks for Relational Databases

RelPrism:面向关系数据库的多面预训练框架与自生成任务

Jinyu Yang, Cheng Yang, Junze Chen, Zedi Liu, Muhan Zhang, Hanyang Peng, Chuan Shi

机构 * Beijing University Of Posts and Telecommunications(北京邮电大学) Peng Cheng Laboratory(鹏城实验室) Peking University(北京大学)

AI总结 针对关系数据库下游任务对多粒度信息的需求,提出RelPrism框架,通过构建内在、关系和混合属性并应用多粒度聚类生成伪任务进行预训练,在分类和回归任务上分别提升ROC-AUC 4.15%和降低MAE 10.75%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06094 2026-05-25 cs.CV cs.AI

VISD: Enhancing Video Reasoning via Structured Self-Distillation

VISD: 通过结构化自蒸馏增强视频推理

Hao Lin, Kunyang Lv, Xu Jiang, Jingqi Tian, Zhongjing Du, Jiayu Ding, Qiaoman Zhang, Hongbo Jin

机构 * HUST(华中科技大学) Wuhan University(武汉大学) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 提出VISD框架,利用结构化自蒸馏和方向-幅度解耦机制,实现细粒度信用分配,提升视频推理准确性和训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22605 2026-05-22 cs.RO cs.CV

Decoupling Ego-Motion from Target Dynamics via Dual-Interval Motion Cues for UAV Detection

通过双区间运动线索解耦自身运动与目标动态以实现无人机检测

Liuyang Wang, Feitian Zhang

机构 * Department of Robotics, School of Advanced Manufacturing and Robotics(机器人学院,先进制造与机器人学院) State Key Laboratory of Turbulence and Complex Systems(湍流与复杂系统国家重点实验室) Peking University(北京大学) Great Bay University(大湾大学)

AI总结 本文提出了一种基于视觉的运动引导检测框架,通过双区间运动提取策略和轻量级运动引导注意力模块,解耦目标运动与相机干扰,提升无人机检测在剧烈自身运动下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22602 2026-05-22 cs.AI

Think Thrice Before You Speak: Dual knowledge-enhanced Theory-of-Mind Reasoning for Persuasive Agents

三思而后言:基于双重知识增强的理论思维推理用于说服代理

Minghui Ma, Bin Guo, Runze Yang, Mengqi Chen, Yan Liu, Jingqi Liu, Yahan Pei, Xuehao Ma, Qiuyun Zhang, Zhiwen Yu

机构 * Northwestern Polytechnical University(西北工业大学) Peking University(北京大学) Harbin Engineering University(哈尔滨工程大学)

AI总结 本文提出了一种基于双重知识增强的理论思维推理方法,用于提升说服代理的对话能力,通过构建大规模标注数据集和提出TTBYS框架,提高了LLM在推理欲望、信念和说服策略方面的性能。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22446 2026-05-22 cs.CV cs.AI cs.RO

Pre-VLA: Preemptive Runtime Verification for Reliable Vision-Language-Action and World-Model Rollouts

Pre-VLA: 预防性运行时验证用于可靠视觉-语言-动作和世界模型展开

Zhen Sun, Yongjian Guo, Haoran Sun, Luqiao Wang, Wei Lu, Jiachi Ji, Shengzhe Ji, Junwu Xiong, Zhijun Meng

机构 * Beihang University(北京航空航天大学) Tsinghua University(清华大学) Peking University(北京大学) JDT AI Infra Zhejiang University(浙江大学)

AI总结 本文提出Pre-VLA,一种统一的运行时验证架构,用于在物理执行或世界模型想象之前评估动作的有效性,以提高视觉-语言-动作和世界模型展开的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏