arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Xi'an Jiaotong University(西安交通大学)

共收录 763
2604.17889 2026-07-14 cs.CV 版本更新

AeroRAG: Structured Multimodal Retrieval-Augmented LLM for Fine-Grained Aerial Visual Reasoning

AeroRAG:结构化多模态检索增强型LLM用于细粒度航空视觉推理

Junxiao Xue, Quan Deng, Tingqi Hu, Meicong Si, Xinyi Yin, Yunyun Shi, Xuecheng Wu

机构 * Research Center for Space Computing System, Zhejiang Lab, Hangzhou(杭州浙大实验室空间计算系统研究中心) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou(中国科学院大学杭州高等研究院) School of Cyber Science and Engineering, Zhengzhou University(郑州大学计算机科学与工程学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)

AI总结 本文提出AeroRAG,通过结构化场景图引导的多模态检索增强生成框架,解决航空场景中视觉问答的挑战,提升对小物体、数量、位置及物体关系的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15650 2026-07-13 cs.CV 版本更新

AffordanceSAM: Segment Anything Once More in Affordance Grounding

可负担性语义分割模型:在可负担性基础上再次分割任何事物

Dengyang Jiang, Zanyi Wang, Hengzhuang Li, Sizhe Dang, Teli Ma, Wei Wei, Guang Dai, Lei Zhang, Harry Yang, Mengmeng Wang

机构 * SGIT AI Lab(SGIT人工智能实验室) NWPU(西北工业大学) HKUST(香港科技大学) XJTU(西安交通大学) HUST(华中科技大学) ZJUT(浙江工业大学)

AI总结 研究聚焦全监督可负担性基础,提出AffordanceSAM,通过设计适应模块和标注数据集,以三阶段训练方式扩展SAM泛化能力,在AGD20K基准上达最优性能,展现强大泛化能力。

Comments [ACM MM 2026] SAM Meets Affordance Grounding

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07855 2026-07-10 cs.LG 新提交

NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL

NFTR:从可证明的模式平均到离线目标条件强化学习中的测地线子目标选择

Erdemt Bao, Xing Lei, Jun Chen

机构 * Huazhong University of Science and Technology(华中科技大学) Xi’an Jiaotong University(西安交通大学) University of Electronic Science and Technology of China(电子科技大学)

AI总结 针对分层隐式Q学习在离线目标条件强化学习中存在的问题,提出NFTR方法,用条件归一化流取代高斯策略,结合基于架构三角不等式的三角松弛分数及RWDR目标,可避免高斯坍塌且在随机动力学下保持稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20805 2026-07-10 cs.RO cs.CV 版本更新

FunHOI: Annotation-Free 3D Hand-Object Interaction Generation via Functional Text Guidance

FunHOI:通过功能文本引导实现无注释的3D手-物体交互生成

Yongqi Tian, Xueyu Sun, Haoyuan He, jianlei Wang, Caigui Jiang

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) Xi’an Jiaotong University(西安交通大学)

AI总结 研究针对手-物体交互中功能抓取语义捕捉难的问题,提出两阶段框架FGS-Net,通过文本引导3D模型生成器FGG和姿态优化策略FGR,无需额外3D注释数据即可实现精确高质量的3D手-物体交互生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06871 2026-07-09 cs.CV 新提交

Geometric Collapse: When Vision Models Fail to Verify Physical Causality

几何崩溃:视觉模型何时无法验证物理因果关系

Wentao Zhang, Jinhu Qi, Weiqiang Jin, Yifei Zhang, Chan-Tong Lam, Irwin King

机构 * Faculty of Applied Sciences, Macao Polytechnic University(澳门理工学院应用科学学院) The Chinese University of Hong Kong(香港中文大学) AgentecFusion Limited(AgentecFusion有限公司) School of Information and Communications Engineering, Xi’an Jiaotong University(西安交通大学信息与通信工程学院) School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院)

AI总结 研究视觉模型在验证物理因果关系时的问题,提出“Scrambled Edges”方法,通过特定控制分离无支撑边缘证据影响,实验表明该方法使预测偏差增大,几何崩溃全局传播,为改进模型物理合理性提供依据。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05693 2026-07-09 cs.RO cs.AI 版本更新

HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies

HiMoE-VLA:用于通用视觉-语言-动作策略的分层专家混合模型

Zhiying Du, Bei Liu, Yaobo Liang, Yichao Shen, Haidong Cao, Xiangyu Zheng, Zhiyuan Feng, Zuxuan Wu, Jiaolong Yang, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院) Xi’an Jiaotong University(西安交通大学) Tsinghua University(清华大学)

AI总结 研究通用视觉-语言-动作策略训练中异构性引发的负迁移问题,提出HiMoE-VLA框架,通过分层专家混合动作模块及两个辅助目标来解决,在多项任务上取得较好结果,还能将负迁移转化为正迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06151 2026-07-08 cs.LG math.PR 新提交

Leveraging Extragradient for Effective Sharpness-Aware Minimization in Deep Learning

利用外梯度实现深度学习中有效的锐度感知最小化

Yao Fu, Chunxia Zhang, Junmin Liu, Yihang Jin, Haishan Ye, Yuanao Yang

机构 * SGIT AI Lab, State Grid Corporation of China(国网SGIT人工智能实验室) School of Management, Xi’an Jiaotong University(西安交通大学管理学院) School of Software, Xi’an Jiaotong University(西安交通大学软件学院)

AI总结 研究针对深度学习泛化难题,基于SAM提出EISAM优化器,通过两步更新过程提升泛化性能,对扰动半径敏感度降低。实验表明其在测试准确率和训练效率上优于多种优化器,理论分析证实其收紧泛化边界,还提供实用调优指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08435 2026-07-08 cs.CV cs.AI 版本更新

HST-HGN: Heterogeneous Spatial-Temporal Hypergraph Networks with Bidirectional State Space Models for Global Fatigue Assessment

HST-HGN:基于双向状态空间模型的异构空间-时间超图网络用于全局疲劳评估

Changdao Chen, Qinqiuhong Ye, Hao Chen, Jinyu Wang

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)

AI总结 本文提出HST-HGN,通过双向状态空间模型和异构空间-时间超图网络,有效建模长程时序依赖,实现对驾驶员疲劳的高效评估,兼顾判别力与计算效率,适用于实时车载边缘部署。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.02353 2026-07-08 cs.CV cs.LG 版本更新

Label Hierarchy Transition: Delving into Class Hierarchies to Enhance Deep Classifiers

标签层次转换:深入研究类层次结构以增强深度分类器

Renzhen Wang, De cai, Kaiwen Xiao, Xixi Jia, Xiao Han, Deyu Meng

机构 * School of Mathematics and Statistics and Ministry of Education Key Lab of Intelligent Networks and Network Security, Xi’an Jiaotong University(数学与统计学学院和教育部智能网络与网络安全重点实验室,西安交通大学) Tencent AI Lab(腾讯AI实验室) ByteDance(字节跳动) SINGPATH AI Lab, SingPath Medical Technology Pte. Ltd.(SingPath AI实验室,SingPath医疗科技私人有限公司) School of Mathematics and Statistics, Xidian University(数学与统计学学院,西安电子科技大学) College of Biomedical Engineering, Sichuan University(生物医学工程学院,四川大学) School of Mathematics and Statistics, Ministry of Education Key Lab of Intelligent Networks and Network Security, Xi’an Jiaotong University(数学与统计学学院和教育部智能网络与网络安全重点实验室,西安交通大学) Macao Institute of Systems Engineering, Macau University of Science and Technology(澳门系统工程研究院,澳门科技大学)

AI总结 研究针对层次分类中现有方法未充分利用类别相关性的问题,提出基于深度学习的LHT统一概率框架,由转换网络和混淆损失构成,实验证明其优于现有方法,还扩展到皮肤病变诊断任务展现潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02845 2026-07-07 cs.RO cs.AI cs.CV 新提交

Differential Amplifier-Inspired AmpAttention for Multi-View Robotic Manipulation

受差分放大器启发的AmpAttention用于多视图机器人操作

Jin Yang, Ping Wei, Nanning Zheng

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, and Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人机混合增强智能技术国家级重点实验室、人工智能与机器人研究所)

AI总结 针对机器人视图图像问题,提出受模拟电路差分放大器启发的AmpAttention机制,抑制注意力噪声。基于此引入RVAF模型,提升训练效率与任务性能,还扩展为RVAF++,在高精度任务上成果显著。

Comments Accepted by IROS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19543 2026-07-07 cs.CL cs.IR 版本更新

Hyper-KGGen: A Skill-Driven Knowledge Extractor for High-Quality Knowledge Hypergraph Generation

Hyper-KGGen:一种用于高质量知识超图生成的技能驱动知识提取器

Rizhuo Huang, Yifan Feng, Rundong Xue, Shihui Ying, Jun-Hai Yong, Chuan Shi, Shaoyi Du, Yue Gao

机构 * Xi’an Jiaotong University(西安交通大学) State Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) Tsinghua University(清华大学) Shanghai University(上海大学) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 针对高质量知识超图构建难题,提出Hyper-KGGen框架,用粗到细机制分解文档,含自适应技能获取模块,经反馈回路提炼领域专长,还给出标注基准,实验验证其性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01901 2026-07-03 cs.LG cs.AI cs.MM 新提交

SABER: A Semantic-Aligned Brain Network Analysis Framework via Multi-scale Hypergraphs

SABER: 一种基于多尺度超图的语义对齐脑网络分析框架

Yidan Xu, Xiangmin Han, Rundong Xue, Huihui Ye

机构 * Hangzhou Dianzi University(杭州电子科技大学) Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学)

AI总结 提出SABER框架,通过多尺度超图建模功能子网络与高阶依赖,并引入决策级语义对齐机制,将大语言模型语义直接融入预测,在ABIDE和ADHD-200数据集上取得最优性能,尤其在小样本场景下。

Comments Accepted to IEEE International Conference on Multimedia and Expo (ICME) 2026;

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00920 2026-07-03 cs.CV 新提交

GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images

GMO-E$^2$DIT:面向电商图像的接地多操作编辑

Zipeng Guo, Xiaoan Liu, Lichen Ma, Cheng Wang, Yu He, Xiaolong Fu, Jingling Fu, Xinyuan Shan, Shaojie Guo, Luohang Liu, Junshi Huang, Yan Li

机构 * Wuhan University(武汉大学) Xi’an Jiaotong University(西安交通大学) Sun Yat-sen University(中山大学)

AI总结 提出GMO-E$^2$DIT框架,通过VLM代理构建区域接地编辑议程,结合掩码条件图像编辑器和反思循环,实现多操作、可审计的电商图像编辑,在指令准确性和编辑保真度上超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30217 2026-07-03 cs.CL 版本更新

Before Thinking, Learn to Decide: Proactive Routing for Efficient Visual Reasoning

在思考之前,先学会决策:面向高效视觉推理的主动路由

Yinan Zhou, Haokun Lin, Yichen Wu, Yuxin Chen, Teng Wang, Caifeng Shan, Zhenan Sun, Chen Ma, Li Zhu, Ying Shan

机构 * Xi’an Jiaotong University(西安交通大学) ARC Lab, Tencent IEG(腾讯IEG ARC实验室) City University of Hong Kong(香港城市大学) Institute of Automation, CAS(中国科学院自动化研究所) Harvard University(哈佛大学) Nanjing University(南京大学)

AI总结 提出主动路由范式PRP,通过联合评估草稿模型和目标模型的能力,实现早期决策,加速多模态推理而不牺牲性能。

Comments 36 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13581 2026-07-02 cs.CV 版本更新

HIR-ALIGN: Enhancing Hyperspectral Image Restoration via Diffusion-Based Data Generation

HIR-ALIGN:通过基于扩散的数据生成增强超光谱图像恢复

Li Pang, Heng Zhao, Yijia Zhang, Deyu Meng, Xiangyong Cao

机构 * School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) School of Mathematics and Statistics and the Ministry of Education Key Laboratory for Intelligent Networks and Network Security, Xi’an Jiaotong University(西安交通大学数学与统计学学院和教育部智能网络与网络安全重点实验室) Pazhou Laboratory (Huangpu), Guangzhou(广州黄埔 Pazhou 实验室)

AI总结 本文提出HIR-ALIGN框架,通过生成与目标分布匹配的合成数据提升超光谱图像恢复性能,包含代理生成、分布自适应合成和对齐监督微调三个阶段,理论分析表明增强细调可降低目标域恢复风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19036 2026-07-02 cs.CV 版本更新

FUMO: Prior-Modulated Diffusion for Single Image Reflection Removal

FUMO:先验调制扩散模型用于单图像反射去除

Telang Xu, Chaoyang Zhang, Guangtao Zhai, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Xi’an Jiaotong University(西安交通大学)

AI总结 提出FUMO扩散模型,通过从混合图像提取强度和高频先验,结合粗到细训练范式,实现空间自适应和结构保真的单图像反射去除。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31342 2026-07-01 math.NA cs.LG cs.NA 新提交

Domain-Decomposed Randomized Neural Networks for Partial Differential Equations in Unbounded Domains

无界区域偏微分方程的域分解随机神经网络

Haixin Wang, Haoning Dang, Fei Wang, Shimin Guo

机构 * School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学院) State Key Laboratory of Multiphase Flow in Power Engineering, Xi’an Jiaotong University(西安交通大学动力工程多相流国家重点实验室)

AI总结 提出域分解随机神经网络框架,通过近场和远场子网络分别捕获局部特征和外部衰减,利用Petrov-Galerkin或配点法求解线性最小二乘系统,适用于无界区域椭圆、穿孔和时间依赖问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22905 2026-07-01 cs.CV 新提交

InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars

InteractiveAvatar: 用于一致且意图感知的虚拟形象的实时流式视频生成

Quanyue Song, Yishan He, Yanfei Zhang, Shihao Cheng, Zhixiang He, Zhizhi Guo, Chi Zhang, Xuelong Li, Caigui Jiang

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi'an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能国家重点实验室) China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能科技(北京)有限公司) Wuhan University(武汉大学) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI))

AI总结 提出InteractiveAvatar框架,通过自回归蒸馏实现实时无限流式生成,利用长短视觉记忆机制保持视觉一致性,并设计推理反应模块实现意图感知交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04057 2026-07-01 cs.LG cs.AI 版本更新

Structured Progressive Knowledge Activation for LLM-Driven Neural Architecture Search

结构化渐进知识激活用于LLM驱动的神经架构搜索

Zhen Liu, Yuhan Liu, Jinjun Wang, Wei Song, Jianyi Liu, Jingwen Fu

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi'an Jiaotong University.(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学) MiLM Plus, Xiaomi Inc.(小米MiLM Plus) North China University of Technology, Beijing.(华北电力大学(北京)) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)

AI总结 本文提出SPARK方法,通过显式选择功能因素并条件化编辑,减少功能耦合影响,提升神经架构搜索的样本效率和OOD准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16436 2026-07-01 cs.LG 版本更新

DISCOVER: A Solver for Distributional Counterfactual Explanations

DISCOVER: 一种用于分布反事实解释的求解器

Yikai Gu, Lele Cao, Bo Zhao, Lei Lei, Lei You

机构 * Technical University of Denmark(丹麦技术大学) Aalto University(阿尔托大学) Xi'an Jiaotong University(西安交通大学)

AI总结 提出DISCOVER,一种模型无关的分布反事实解释求解器,通过预算化提议-选择搜索范式替代梯度优化,利用最优传输几何指导采样,实现非可微模型下的分布对齐。

Comments 22 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28677 2026-06-30 cs.CV

SATB-VR: Training Few-Step Video Restoration Diffusion Model using SNR-Aware Trajectory Blending

SATB-VR:使用信噪比感知轨迹混合训练少步视频恢复扩散模型

Haoran Bai, Xiaoxu Chen, Xiaoyu Liu, Zongsheng Yue, Sibin Deng, Wangmeng Zuo, Ying Chen

机构 * Alibaba Group(阿里巴巴集团) Harbin Institute of Technology(哈尔滨工业大学) Xi’an Jiaotong University(西安交通大学)

AI总结 提出SATB-VR少步视频恢复框架,通过辅助预测器跳过低信噪比步骤,并利用SNR感知轨迹混合策略解决训练-推理不一致,实现高效高质量恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11025 2026-06-30 cs.LG 新提交

Flow-DPPO: Divergence Proximal Policy Optimization for Flow Matching Models

Flow-DPPO:用于流匹配模型的散度近端策略优化

Bowen Ping, Xiangxin Zhou, Penghui Qi, Minnan Luo, Liefeng Bo, Tianyu Pang

机构 * Xi’an Jiaotong University(西安交通大学) Tencent Hunyuan(腾讯混元) National University of Singapore(新加坡国立大学)

AI总结 针对流匹配模型中PPO比率裁剪的结构性缺陷,提出Flow-DPPO方法,利用高斯策略的精确KL散度计算实现散度近端约束,提升奖励和训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12211 2026-06-30 cs.LG cs.DS

A Residual-Shell-Based Lower Bound for Ollivier-Ricci Curvature

基于残差壳的Ollivier-Ricci曲率下界

Xiang Gu, Huichun Zhang, Jian Sun

机构 * School of Mathematics and Statistics, Xi'an Jiaotong University(西安交通大学数学与统计学学院) School of Mathematics, Sun Yat-sen University(中山大学数学学院)

AI总结 本文提出一种更紧的Ollivier-Ricci曲率下界,计算效率高且适用于k步随机游走,实验验证其在精度和效率上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12155 2026-06-30 cs.CV

FAIL: Flow Matching Adversarial Imitation Learning for Image Generation

FAIL: 流匹配对抗模仿学习用于图像生成

Yeyao Ma, Chen Li, Xiaosong Zhang, Han Hu, Weidi Xie

机构 * Shanghai Jiao Tong University(上海交通大学) Xi’an Jiaotong University(西安交通大学) Tencent(腾讯)

AI总结 本文提出FAIL方法,通过对抗训练最小化策略-专家差异,无需显式奖励或配对比较,在图像生成中实现高效训练与泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06344 2026-06-30 cs.CV

SDGIC: A Semantic Disambiguation-Guided Generative Image Compression Method for Ultra-Low Bitrates

SDGIC: 一种基于语义消歧的生成图像压缩方法,用于超低比特率

Kaile Wang, Lijun He, Haisheng Fu, Haixia Bi, Fan Li

机构 * School of Information and Communications Engineering, Xi’an Jiaotong University(西安交通大学信息与通信工程学院) Department of Electrical and Computer Engineering, Faculty of Applied Science, The University of British Columbia(不列颠哥伦比亚大学应用科学学院电气与计算机工程系)

AI总结 本文提出SDGIC框架,通过三种互补的指导流约束扩散重建,提升超低比特率下的语义一致性与感知质量,减少23.4%的AFINE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28077 2026-06-29 cs.CV 新提交

TextDS: Parameter-Efficient Representation Alignment for Scene Text Detection under Distribution Shifts

TextDS: 分布偏移下场景文本检测的参数高效表示对齐

Boyuan Chen, Zichen Dang, Chuang Yang, Lap-Pui Chau, Yi Wang

机构 * School of Electrical Engineering, Xi’an Jiaotong University(西安交通大学电气工程学院) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电机及电子工程学系)

AI总结 提出TextDS框架,通过视觉基础模型、逐步LoRA适应和公共子空间融合,仅用4.9M参数实现跨域和退化条件下的鲁棒场景文本检测。

Comments Accepted by ECCV 2026. Project page: https://github.com/ZChenDang/TextDS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27760 2026-06-29 cs.CV 新提交

PixelU: A U-Shaped Transformer for Efficient End-to-End Pixel Diffusion

PixelU: 一种用于高效端到端像素扩散的U形Transformer

Zipeng Guo, Lichen Ma, Yu He, Xiaolong Fu, Jingling Fu, Junshi Huang, Yan Li

机构 * Xi’an Jiaotong University(西安交通大学)

AI总结 提出PixelU,一种极简单阶段U形扩散Transformer,通过零成本跳跃连接和恒通道空间下采样解耦高低频建模,在ImageNet上以约1/3计算成本超越强基线JiT-G。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26217 2026-06-26 cs.LG cs.CV cs.RO 新提交

Fast LeWorldModel

快速LeWorldModel

Yuntian Gao, Xiangyu Xu

机构 * Xi’an Jiaotong University(西安交通大学)

AI总结 提出Fast-LeWM,通过动作前缀并行预测未来潜在状态,替代LeWM的自回归滚动,降低规划时间并减少潜在误差累积。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18974 2026-06-26 cs.CV 新提交

Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning

Visual-OPSD:用于高效统一多模态推理的跨模态在策略自蒸馏

Pengyu Li, Zhitao Gao, Lingling Zhang, Muye Huang, Yuanming Li, Fangzhi Xu, Jun Liu

机构 * Xi’an Jiaotong University(西安交通大学) MOE KLINNS Lab(MOE KLINNS实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室) Sun Yat-sen University(中山大学)

AI总结 提出Visual-OPSD方法,通过跨模态在策略自蒸馏,将多步扩散生成的可视化思维推理能力转移到纯文本学生模型,实现14.3倍加速且性能提升3.40个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10388 2026-06-26 cs.IR cs.AI 版本更新

The Best of the Two Worlds: Harmonizing Semantic and Hash IDs for Sequential Recommendation

两全其美:为序列推荐协调语义ID和哈希ID

Ziwei Liu, Yejing Wang, Wanyu Wang, Wang Zejian, Qidong Liu, Zijian Zhang, Chong Chen, Wei Huang, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Xi'an Jiaotong University(西安交通大学) Jilin University(吉林大学) Independent Researcher(独立研究者) Tsinghua University(清华大学)

AI总结 针对序列推荐中头部和尾部物品性能权衡问题,提出H2Rec框架,通过双分支架构协调语义ID和哈希ID,并采用双级对齐策略实现知识迁移,在公开基准和商业平台上取得更好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏