arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

共收录 373
2606.26171 2026-06-26 cs.CV cs.AI 新提交

LCG: Long-Context Consistent Image Generation with Sparse Relational Attention

LCG: 基于稀疏关系注意力的一致长上下文图像生成

Zihao Wang, Yijia Xu, Haoze Zheng, Xuran Ma, Haokun Gui, Harry Yang

机构 * Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 提出LCG框架,利用稀疏关系注意力(SRA)和路由一致性约束(RCC),在长序列图像生成中保持语义和外观一致性,并构建了大规模数据集LCCD进行训练和评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25450 2026-06-26 cs.LG cs.CL 新提交

The Generalization Spectrum: A Chromatographic Approach to Evaluating Learning Algorithms

泛化谱:一种评估学习算法的色谱方法

Jinghan Zhang, Zerui Cheng, Shiqi Chen, Ge Zhang, Wenhao Huang, Jiashuo Liu, Junxian He, Tianle Cai

机构 * ByteDance Seed(字节跳动Seed) Hong Kong University of Science and Technology(香港科技大学) Princeton University(普林斯顿大学) University of Oxford(牛津大学)

AI总结 提出泛化谱框架,通过构建从精确回忆到跨语言实现转移等不同转移距离的测试变体,揭示算法从单个样本泛化到其他样本的程度,并应用于竞争编程任务评估不同学习范式。

Comments Accepted at ICML 2026. 30 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26058 2026-06-25 cs.CV 新提交

DomainShuttle: Freeform Open Domain Subject-driven Text-to-video Generation

DomainShuttle: 自由形式开放域主题驱动文本到视频生成

Nan Chen, Yiyang Cai, Rongchang Xie, Junwen Pan, Cheng Chen, Weinan Jia, Zhuowei Chen, Wen Zhou, Zhenbang Sun, Wenhan Luo

机构 * Hong Kong University of Science and Technology(香港科技大学)

AI总结 提出DomainShuttle方法,通过Domain-MoT解耦视频与参考特征、Video-Reference DualRoPE实现精确主体空间建模及Cross-Pair Consistent Loss提取本质特征,在开放域视频个性化中同时实现高保真与生成灵活性。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25852 2026-06-25 cs.LG cs.AI 新提交

Semantic Consistency Policy Optimization for Reinforcement Learning of LLM Agents

语义一致性策略优化:用于LLM智能体强化学习

Peng Xu, Sijia Chen, Junzhuo Li, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 针对基于组的强化学习中语义一致的中间步骤因轨迹成败获得相反信用的问题,提出无价值奖励塑造方法SCPO,通过从组内成功兄弟步骤恢复信用,在ALFWorld和WebShop上达到93.7%和74.8%的成功率。

Comments 16 pages, 7 figures, 5 tables. Under review at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25657 2026-06-25 cs.CV cs.AI 新提交

Steering Vision-Language Models with Joint Sparse Autoencoders

用联合稀疏自编码器引导视觉-语言模型

Huizhen Shu, Xuying Li, Hongxu Lin, Wenjie Sun, Hui Li

机构 * yunshanai(云山AI) HKUST(Guangzhou)(香港科技大学(广州)) Zidongtaichu(紫东太初) University of British Columbia(不列颠哥伦比亚大学)

AI总结 提出联合稀疏自编码器(JSAE),通过显式对齐约束联合分解视觉和语言激活,得到可解释的跨模态特征,并在LLaVA等模型上验证了层依赖的干预效果。

Comments 19pages,10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25556 2026-06-25 cs.CL cs.AI cs.LG 新提交

BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents

BiPACE:基于双模拟引导与动作反事实估计的LLM智能体策略优化

Hanyang Wang, Weijieying Ren, Yuxiang Zhang, Ding Cao, Zhizhao Zeng, Ke Zeng, Tianxiang Zhao

机构 * University of Chicago(芝加哥大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Stanford University(斯坦福大学) University of Science and Technology of China(中国科学技术大学) Meituan(美团)

AI总结 针对分组强化学习中状态-动作信用分配不匹配问题,提出BiPACE优势估计器,通过双模拟引导的状态聚类和动作反事实基线,在无需批评网络或额外采样的前提下提升LLM智能体训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25529 2026-06-25 cs.SD cs.AI 新提交

STEB: A Speech-to-Speech Translation Expressiveness Benchmark for Evaluating Beyond Translation Fidelity

STEB:用于评估超越翻译保真度的语音到语音翻译表现力基准

Sitong Cheng, Weizhen Bian, Songjun Cao, Jin Li, Bei Liu, Chunyang Jiang, Yike Zhang, Weihao Wu, Yiming Li, Chi-Min Chan, Long Ma, Wei Xue

机构 * Hong Kong University of Science and Technology(香港科技大学) Tencent Youtu Lab(腾讯优图实验室) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 提出STEB基准,通过描述-总结框架评估语音到语音翻译在情感、场景风格和非语言发声方面的表现力,发现现有系统在语义保真度上表现良好但表现力保留不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24369 2026-06-25 cs.AI cs.DC cs.NI cs.PF 新提交

Accelerating Disaggregated RL for Visual Generative LLMs with Diffusion-Based Parallelism and Trainer-Assisted Generation

加速面向视觉生成式大语言模型的解耦强化学习:基于扩散并行与训练器辅助生成

Sijie Wang, Zhengyu Qing, Zhiqiang Tan, Yiming Yin, Yeqing Zhang, Yaoyuan Wang, Qiang Wang, Xiaowen Chu, Shaohuai Shi

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院) Data Science and Analytics Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)数据科学与分析学域) Huawei Technologies Ltd.(华为技术有限公司)

AI总结 提出解耦强化学习框架DigenRL,通过生成轴流水线、时间步并行和弹性训练器辅助生成,解决扩散生成式大语言模型中执行气泡问题,实现1.56-2.10倍吞吐提升。

Comments Withdrawn by the authors pending resolution of intellectual property and institutional disclosure requirements

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22327 2026-06-25 cs.AI 新提交

Geometry-Aware Online Scheduling for LLM Serving: From Theoretical Bound to System Practice

面向LLM服务的几何感知在线调度:从理论界到系统实践

Li Kong, Qi Qi, Yinyu Ye, Zijie Zhou

机构 * Gaoling School of Artificial Intelligence(人工智能学院) Renmin University of China(中国人民大学) Department of Management Science and Engineering(管理科学与工程系) Stanford University(斯坦福大学) Department of Industrial Engineering and Decision Analytics(工业工程与决策分析系) HKUST(香港科技大学)

AI总结 针对LLM推理中KV缓存动态内存占用问题,提出Smallest Volume First (SVF)算法,通过几何感知调度优化性能,理论证明将竞争比从48降至5,并在vLLM中实现即插即用,显著降低平均和尾部延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20300 2026-06-25 cs.CV 新提交

CMDS-AD: Cross-Modal Dual-Stream Decoupling for Few-Shot Anomaly Detection

CMDS-AD: 跨模态双流解耦用于少样本异常检测

Junhao Cai, Junyu Chen, Deyu Zeng, Junhao Pang, Qiwei Liang, Xiaopin Zhong, Zongze Wu

机构 * Shenzhen University(深圳大学) Guangzhou Maritime University(广州航海学院) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 提出跨模态双流异常检测框架CMDS-AD,通过扩散模型生成多样本并利用低频正常估计辅助解耦高频缺陷,在1-shot设置下MVTec 3D-AD上I-AUROC提升5.7%。

Comments Accepted to ECCV 2026! Project page: https://cmds-ad.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18837 2026-06-25 cs.MA cs.AI cs.LG 新提交

Skill-MAS: Evolving Meta-Skill for Automatic Multi-Agent Systems

Skill-MAS: 演化元技能以自动生成多智能体系统

Hehai Lin, Qi Yang, Chengwei Qin

机构 * Ant Group(蚂蚁集团) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 提出Skill-MAS,通过将高层编排能力解耦为可演化的元技能,在无需参数更新的情况下实现经验保留,利用多轨迹采样和选择性反思优化元技能,在多个基准和LLM上取得显著性能提升且成本可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07512 2026-06-25 cs.CV cs.AI cs.CL 新提交

MemDreamer: Decoupling Perception and Reasoning for Long Video Understanding via Hierarchical Graph Memory and Agentic Retrieval Mechanism

MemDreamer: 通过分层图记忆和智能体检索机制解耦感知与推理以实现长视频理解

Cong Chen, Guo Gan, Kaixiang Ji, ZhaoYang Zhang, Zhen Yang, Guangming Yao, Hao Chen, Jingdong Chen, Yi Yuan, Chunhua Shen

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学) Central South University(中南大学) HKUST(GZ)(香港科技大学(广州))

AI总结 提出MemDreamer框架,通过分层图记忆和智能体检索机制解耦感知与推理,将长视频理解转化为智能体探索过程,在四个基准上达到SOTA,推理上下文窗口仅占全量2%且准确率提升12.5点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24774 2026-06-24 cs.CV 新提交

Revealing Training Data Exposure in Vision Language Large Models via Parameter Gradients

揭示视觉语言大模型中的训练数据暴露:基于参数梯度的方法

Zhihao Zhu, Hongyi Tang, Yi Yang, Ahmed Abbasi

机构 * Department of Information Systems, Business Statistics and Operations Management (ISOM), Hong Kong University of Science and Technology, Hong Kong, China(信息系统、商业统计与运营管理系(ISOM),香港科技大学,香港,中国) Department of IT, Analytics, and Operations, University of Notre Dame, Notre Dame, Indiana, USA(信息技术、分析与运营系,诺丁汉大学,诺丁汉,印第安纳州,美国)

AI总结 提出梯度审计框架GradAudit,通过分析模型参数梯度特征检测训练数据,在医疗和通用数据集上显著优于现有方法,并揭示现有方法低估了未经授权数据使用程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24667 2026-06-24 cs.CL 新提交

DREAM: Dense Retrieval Embeddings via Autoregressive Modeling

DREAM:通过自回归建模的密集检索嵌入

Yixuan Tang, Yi Yang

机构 * The Hong Kong University of Science and Technology(香港科技大学)

AI总结 提出DREAM方法,利用冻结LLM的自回归预测损失训练密集检索器,通过注意力机制注入查询-文档相似度,在BEIR和RTEB上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24479 2026-06-24 cs.CV 新提交

MambaRaw: Selective State Space Modeling for Efficient 4K Raw Image Reconstruction

MambaRaw: 基于选择性状态空间建模的高效4K原始图像重建

Peize Li, Fanhu Zeng, Tongda Xu, Xingguo Xu, Xinjie Zhang, Xingtong Ge, Haotian Zhang, Yan Wang

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Dalian University of Technology(大连理工大学) Microsoft Research Asia(微软亚洲研究院) Hong Kong University of Science and Technology(香港科技大学) School of Computer Science, Peking University(北京大学计算机科学学院)

AI总结 提出MambaRaw框架,利用状态空间模型高效估计熵参数,通过TileMambaBlock和能量感知精化模块实现4K原始图像的高效重建,在三个相机数据集上达到最优性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24466 2026-06-24 cs.RO 新提交

FT-WBC: Learning Fault-Tolerant Whole-Body Control for Legged Loco-Manipulation

FT-WBC:学习腿式操作任务的容错全身控制

Yudong Zhong, Pengfei Mai, Sikai Guo, Jiahang Cao, Zhihai Bi, Qiuyue Liu, Ziyan Feng, Jinni Zhou, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Hong Kong(香港大学)

AI总结 针对腿式机械臂在致动器故障下易失稳的问题,提出FT-WBC框架,通过故障估计器和姿态适应模块实现容错全身控制,提升生存率和操作空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24138 2026-06-24 cs.CV 新提交

Sat2City v2: Native 3D City Asset Generation from a Single Satellite Image

Sat2City v2: 从单张卫星图像生成原生3D城市资产

Tongyan Hua, Dongli Wu, Jinjing Zhu, Yinrui Ren, Zhongcheng Hong, Ying-Cong Chen, Hui Xiong, Wufan Zhao

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Chinese University of Hong Kong(香港中文大学) Auckland University of Technology(奥克兰理工大学) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)

AI总结 提出Sat2City v2,利用预训练的原生结构化潜空间3D基础模型,从单张卫星图像生成具有可控外观和几何形状的纹理网格,在真实数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24033 2026-06-24 cs.LG cs.CL 新提交

RoPE-Aware Bit Allocation for KV-Cache Quantization

RoPE感知的KV缓存量化比特分配

Fengfeng Liang, Yuechen Zhang, Jiaya Jia

机构 * Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) MiMo, Xiaomi Corporation(小米集团 MiMo)

AI总结 针对RoPE下键缓存量化中不同频率块对误差敏感度不同的问题,提出Block-GTQ比特分配器,通过能量评分和贪心分配提升量化精度,在长上下文任务中显著恢复性能。

Comments Preprint. Code available at https://github.com/JIA-Lab-research/blockgtq

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23757 2026-06-24 cs.LG cs.AI 新提交

Synergizing Physically Constrained MCMC and Chemical-Informed Gaussian Processes for Reaction Network Discovery

协同物理约束MCMC与化学信息高斯过程进行反应网络发现

Runzhe Liu, Zihao Wang, Wenbo Yang, Shengyang Tao

机构 * State Key Laboratory of Fine Chemicals, Frontier Science Center for Smart Materials, Dalian University of Technology, Dalian, 116024, China(精细化学品国家重点实验室,智能材料前沿科学中心,大连理工大学,大连,116024,中国) Dalian Key Laboratory of Intelligent Chemistry, CR Belt and Road Joint Laboratory on Intelligent Chemistry and Advanced Materials of Liaoning Province, School of Chemistry, Dalian University of Technology, Dalian, 116024, China(大连智能化学重点实验室,辽宁省“一带一路”智能化学与先进材料联合实验室,化学学院,大连理工大学,大连,116024,中国) Academy of Interdisciplinary Studies, The Hong Kong University of Science and Technology, Clear Water Bay, Kowloon, Hong Kong(交叉学科研究院,香港理工大学,清水湾,九龙,香港)

AI总结 提出PC-MCMC-CIGP灰箱工作流,结合尖峰-板拓扑采样、硬守恒与热力学筛选及化学信息高斯过程残差模型,用于反应网络发现与实验设计,在H2+Br2基准和苯乙烯环氧化反应上验证了其区分机理和优化产量的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22424 2026-06-24 cs.CV 新提交

FlowDec: Temporal Conditional Flow Decorruptor for Robust Continuous Vision-Language Navigation

FlowDec:用于鲁棒连续视觉-语言导航的时间条件流去污染器

Yufei Zhang, Changhao Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州))

AI总结 提出FlowDec,一种针对LM-based VLN-CE的图像恢复框架,通过混合时间条件策略和动作质心引导滤波,在导航精度和生成延迟上超越现有去污染方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18627 2026-06-24 cs.LG 新提交

PACT: Preserving Anchored Cores in Task-vectors for Model Merging

PACT: 在任务向量中保留锚定核心用于模型合并

Ningyuan Shi, Zhipeng Zhou, Hao Wang, Chunyan Miao, Peilin Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 提出PACT方法,通过识别并保留预训练权重中的承重墙维度,在任务向量中锚定任务特定核心,解决任务向量范式下任务冲突和性能下降问题,提升模型合并效果。

Comments 33 pages,14 figures; Code is available

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11129 2026-06-24 cs.CV 新提交

WorldOlympiad: Can Your World Model Survive a Triathlon?

WorldOlympiad:你的世界模型能经受铁人三项考验吗?

Yuke Zhao, Wangbo Zhao, Weijie Wang, Zeyu Zhang, Dakai An, Akide Liu, Yinghao Yu, Jiasheng Tang, Fan Wang, Wei Wang, Bohan Zhuang

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) The Hong Kong University of Science and Technology(香港科技大学) Monash University(莫纳什大学) TRE, Alibaba Group(阿里巴巴TRE)

AI总结 提出WorldOlympiad基准,从物理忠实性、几何一致性和交互保真度三个维度诊断视频世界模型,揭示现有模型在物理推理、3D一致性和长程交互方面的显著不足。

Comments Project Page: https://alibaba-damo-academy.github.io/WorldOlympiad/, Code: https://github.com/alibaba-damo-academy/WorldOlympiad

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23080 2026-06-23 eess.AS cs.SD 新提交

AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation

AudioCALM:面向通用音频生成的连续自回归语言建模

Huadai Liu, Kaicheng Luo, Wen Wang, Qian Chen, Bin Ma, Xiangang Li, Wei Xue

机构 * Hong Kong University of Science and Technology (HKUST)(香港科技大学) Tongyi Fun Team, Alibaba Group(阿里云团队,阿里巴巴集团)

AI总结 提出AudioCALM框架,通过连续音频潜变量的自回归预测和不对称模态专家架构,统一语音、声音和音乐生成,在三个任务上达到或超越专用模型性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23574 2026-06-23 cs.CR cs.RO 新提交

A Watermark for Vision-Language-Action and World Action Models

视觉-语言-动作与世界动作模型的水印技术

Yule Liu, Shuai Liu, Jiaheng Wei, Xinlei He

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Wuhan University(武汉大学) Xi’an Jiao Tong University(西安交通大学)

AI总结 提出密钥潜在来源验证方法,通过替换高斯噪声种子为密钥种子为机器人策略模型添加水印,在保持任务性能的同时实现版权保护,并能抵抗输出移除和权重修改攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23537 2026-06-23 cs.DB cs.AI cs.LG 新提交

SQLConductor: Search-to-Policy Learning for Step-wise Text-to-SQL Orchestration

SQLConductor:面向逐步文本到SQL编排的搜索到策略学习

Yizhang Zhu, Zhangyang Peng, Boyan Li, Yuyu Luo

机构 * HKUST(GZ)(香港科技大学(广州))

AI总结 提出SQLConductor框架,通过搜索到策略学习将文本到SQL任务分解为动作序列,用蒙特卡洛树搜索探索工作流并训练策略模型逐步编排,在BIRD-Dev上达73.2%执行准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23112 2026-06-23 cs.LG cs.AI cs.CL 新提交

Self-Evolution for Multi-Turn Tool-Calling Agents via Divergence-Point Preference Learning

面向多轮工具调用智能体的自演化:基于分歧点偏好学习

Jiaqiang Tang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 提出ToolGraph方法,结合模式图拓扑、过渡权重和历史感知控制,并通过分歧点偏好学习(DPO)提升多轮工具调用智能体的性能,在375个任务上平均奖励提升16.8%。

Comments 7 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23107 2026-06-23 cs.CL 新提交

A Dual-Track Framework for Template-Constrained LaTeX Conversion

双轨框架:模板约束下的LaTeX转换

Chung Cheuk Hei, Liu Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 提出双轨框架,通过离线提取模板约束与在线混合执行,将LLM用于推理密集型任务、规则引擎处理确定性任务,在7个模板和56篇论文上实现更高结构保真度和编译成功率。

Comments 6 pages (excluding references), 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23063 2026-06-23 cs.CV cs.AI 新提交

Attention-Spectrum Regularization for Replay-Free Continual Multimodal LLMs

注意力谱正则化:无回放的连续多模态大语言模型

Chuangxin Zhao, Canran Xiao, Siyuan Ma, Mengyao Lyu, Yanbiao Ma, Jun Xia, Guiguang Ding, Yang Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学) Tsinghua University(清华大学)

AI总结 提出注意力谱正则化(ASR),一种无回放的连续学习框架,通过存储技能级交叉注意力原型分布并施加谱正则化约束,有效缓解多模态大语言模型在连续微调中的灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22945 2026-06-23 cs.GR cs.CV 新提交

Controllable Texture Tiling with Transformed RoPE-Enhanced Diffusion Models

可控纹理平铺:基于变换RoPE增强扩散模型

Junrong Huang, Zhiyuan Zhang, Rui Tang, Hongbo Fu, Jnig Liao

机构 * City University of Hong Kong(香港城市大学) Manycore Tech Inc.(Manycore科技公司) Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 提出基于扩散变换器的可控纹理平铺框架,通过坐标变换旋转位置编码实现精确平铺控制,并利用分离注意力掩码保持参考纹理结构,同时与场景光照几何无缝融合。

Comments The code and dataset are publicly accessible at https://github.com/junrongh/ControlTile

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22913 2026-06-23 cs.CV cs.AI 新提交

Intend, Reflect, Refine: An Adaptive Multimodal Reflection Framework for Autonomous Driving

意图、反思、优化:一种用于自动驾驶的自适应多模态反思框架

Zisheng Chen, Yuping Qiu, Jianhua Han, Tao Tang, Xiuwei Chen, Likui Zhang, Ying-Cong Chen, Hang Xu, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) HKUST(GZ)(香港科技大学(广州)) Yinwang Intelligent Technology Co. Ltd.(引望智能科技有限公司)

AI总结 提出IRR-Drive框架,通过生成初步文本意图并预测未来语义BEV表示,构建双模态反思空间,实现自适应轨迹修正,在NAVSIM基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏