arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

共收录 373
2607.06097 2026-07-08 cs.CV cs.AI 新提交

PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet

PVCap:通过伪字幕和体素字幕网络实现精确的3D密集字幕

Xiaopei Wu, Chenshu Hou, Liang Peng, Dan Xu, Binbin Lin, Xiaoshui Huang, Yuenan Hou, Yu Li, Wenxiao Wang, Haifeng Liu, Deng Cai, Wanli Ouyang

机构 * SH AI Lab(上海人工智能实验室) ZJU(浙江大学) HKUST(香港科技大学) SJTU(上海交通大学)

AI总结 研究针对3D密集字幕任务,提出PVCap方法,由PseudoCap和VoxelCapNet组成。PseudoCap通过随机混合技术增加训练样本,VoxelCapNet利用体素特征改进网络架构。实验表明该方法在两个基准上超越现有技术,提升了3D密集字幕的准确性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05777 2026-07-08 cs.RO 新提交

Observation Quality Matters: Robust Multi-Fisheye Calibration via Failure-Oriented Analysis

观测质量至关重要:通过面向失败的分析实现鲁棒多鱼眼相机校准

Peize Liu, Zhe Tong, Chen Feng, Shaojie Shen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

AI总结 研究多鱼眼相机校准难题,通过面向失败分析发现内参初始化是主因,提出CO - Calib框架,结合鲁棒目标检测器和误差分析引导帧选择器,实验表明该框架提升校准成功率、外参精度及校准稳定性。

Comments 9 pages, 7 figures, 6 tables. Code: https://github.com/HKUST-Aerial-Robotics/CO-Calib

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05765 2026-07-08 cs.CV cs.RO 新提交

Image2Sim: Scaling Embodied Navigation via Generative Neural Simulator

Image2Sim:通过生成神经模拟器扩展具身导航

Zihan Wang, Seungjun Lee, Yinghao Xu, Gim Hee Lee

机构 * National University of Singapore(新加坡国立大学) HKUST(香港科技大学)

AI总结 研究针对具身导航缺乏优质交互环境的问题,提出Image2Sim实时神经模拟框架,通过解耦3D空间锚定与观察合成构建环境,能大规模生成相关数据,训练的导航模型在基准测试中有提升且可迁移,为具身导航提供实用训练基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05759 2026-07-08 cs.DS cs.AI cs.DM 新提交

Data-dependent Evaluations for Budgeted Submodular Maximization

带预算约束的次模最大化的数据依赖评估

Lejian Zhang, Xueyan Tang, Jing Tang

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(新加坡南洋理工大学计算与数据科学学院) Data Science and Analytics Thrust, The Hong Kong University of Science and Technology (Guangzhou), China(香港理工大学(广州)数据科学与分析方向)

AI总结 针对带背包约束的次模最大化问题,开发新的数据依赖上界,理论证明其优于最优解,通过真实数据集实验验证其在评估解与最优解接近程度上的优势。

Comments Extended version of a paper that will appear in ESA 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27377 2026-07-08 cs.CV cs.CL cs.LG 新提交

DanceOPD: On-Policy Generative Field Distillation

DanceOPD:在策略生成场蒸馏

Wei Zhou, Xiongwei Zhu, Zelin Xu, Bo Dong, Lixue Gong, Yongyuan Liang, Meng Chu, Leigang Qu, Lingdong Kong, Wei Liu, Tat-Seng Chua

机构 * ByteDance Seed(字节跳动Seed) NUS(新加坡国立大学) UMD(马里兰大学) HKUST(香港科技大学)

AI总结 提出DanceOPD框架,通过将每个样本路由到能力场并查询低噪声学生诱导状态,用速度MSE损失训练流匹配模型,实现文本到图像、局部编辑和全局编辑的多能力组合,提升目标能力同时保持生成质量。

Comments Technical Report; 40 pages, 13 figures, 9 tables; Project Page at https://danceopd.github.io/ GitHub Repo at https://github.com/worldbench/DanceOPD

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20031 2026-07-08 cs.RO cs.AI 新提交

A Neuromorphic Reinforcement Learning Framework for Efficient Pathfinding in Robotic Mobile Fulfillment Systems

一种用于机器人移动履行系统高效路径规划的神经形态强化学习框架

Junzhe Xu, Zecui Zeng, Lusong Li, Yuetong Fang, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) JD Explore Academy(京东探索研究院)

AI总结 提出SDQN-RMFS框架,通过ANN到SNN的转换和硬标签知识蒸馏,在神经形态芯片上实现超低功耗路径规划,相比GPU能耗降低11281倍,延迟减少近一半。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14048 2026-07-08 cs.CV cs.RO 新提交

WAM4D: Fast 4D World Action Model via Spatial Register Tokens

WAM4D:通过空间注册令牌实现快速4D世界动作模型

Ying Li, Xiaobao Wei, Jiajun Cao, Hao Wang, Xiaowei Chi, Chengyu Bai, Qianpu Sun, Jiajun Li, Xiaojie Zhang, Peidong Jia, Jian Tang, Sirui Han, Shanghang Zhang

机构 * Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

AI总结 提出WAM4D,利用轻量级空间注册令牌将预训练几何先验迁移至因果视频-动作变换器,实现高效4D世界动作建模,在RoboTwin 2.0和真实操作任务中提升空间一致性并保持快速推理。

Comments 15 pages, 7figures, 9tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05311 2026-07-07 cs.CV 新提交

Deep Learning for Semen Analysis in Male Infertility: Computer Vision, Multimodal Fusion, and Clinical Translation

男性不育症精液分析深度学习技术:计算机视觉、多模态融合与临床转化

Runwei Guan, Shaofeng Liang, Jiacheng Weng, Xiaoyi Gu, Jia Weng, Daizong Liu, Duo Pan, Qingxin Zhang, Xiao Liang, Weiping Ding, Suoyu Zhu, Ming Yuan, Yanhua Fei

机构 * Department of Gynaecology and Obstetrics, The Affiliated Jiangyin Hospital of Nantong University(南通大学附属江阴医院妇产科) Department of Oncology, the Affiliated Jiangyin Hospital of Nantong University(南通大学附属江阴医院肿瘤科) Thrust of AI, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能推力实验室) FertiTech AI(生殖科技人工智能公司) Department of Oncology, Suzhou Xiangcheng People’s Hospital(苏州市相城区人民医院肿瘤科) Department of Biological Sciences and Bioinformatics, School of Science, Xi’an Jiaotong-Liverpool University(西交利物浦大学理学院生物科学与生物信息学系) School of Artificial Intelligence and Computer Science, Nantong University(南通大学人工智能与计算机科学学院)

AI总结 针对传统精液分析的主观性强等缺陷,综述聚焦计算机视觉与深度学习驱动的精子分析技术,梳理方法、数据集与落地障碍,提出分阶段临床转化路线。

Comments 46 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04655 2026-07-07 cs.CL 新提交

FormalRx: Rectify and eXamine Semantic Failures in Autoformalization

FormalRx:纠正和检查自动形式化中的语义错误

Haocheng Wang, Baiyu Huang, Yingjia Wan, Xiao Zhu, Xiaoyang Liu, Yinya Huang, Zhijiang Guo

机构 * LARK Lab, HKUST(GZ)(香港科技大学(广州)LARK实验室) ETH Zurich(苏黎世联邦理工学院) UCLA(加州大学洛杉矶分校) SJTU(上海交通大学) ETH AI Center(苏黎世联邦理工学院人工智能中心) HKUST(香港科技大学)

AI总结 研究自动形式化中语义对齐问题,提出FormalRx框架,核心是SCI错误分类法,能实现对齐判定、错误分类、定位及纠正,通过实例验证性能优于基线,助力自动形式化系统诊断与改进。

Comments 44 pages, 5 figures. Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04638 2026-07-07 cs.CV 新提交

Learning Structured Visual Compositional Representations for Weakly Supervised Referring Expression Comprehension

用于弱监督指称表达式理解的学习结构化视觉组合表示

Lian Xu, Mohammed Bennamoun, Farid Boussaid, Hamid Laga, Yulan Guo, Dan Xu

机构 * The University of Western Australia(西澳大利亚大学) Murdoch University(莫道克大学) Sun Yat-sen University(中山大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 针对弱监督指称表达式理解问题,提出结构化视觉组合表示学习框架,显式建模一元对象嵌入和成对关系嵌入,引入组合对齐机制,实验证明该方法有效。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04501 2026-07-07 cs.HC cs.LG 新提交

From Interaction to Intent: Inferring User Objectives from Provenance Logs

从交互到意图:从溯源日志中推断用户目标

Steffen Holter, Tobias Stähle, Arpit Narechania, Mennatallah El-Assady

机构 * ETH Zurich(苏黎世联邦理工学院) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 研究能否用溯源日志对视觉探索任务中的用户意图分类,记录参与者交互,发现不同分析目标有不同行为特征,嵌入上下文信息可使分类器跨数据集和投影方法预测用户目标。

Comments 13 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04234 2026-07-07 cs.RO cs.AI cs.CV 新提交

SoftVTBench: A Safety-Aware Visuo-Tactile Benchmark for Physically Constrained Robotic Manipulation of Deformable Objects

SoftVTBench:用于物理约束下可变形物体机器人操作的安全感知视觉触觉基准测试

Bowen Jing, Mingxin Wang, Ruiyang Hao, Chenchen Ge, Hanwen Shen, Junjie He, Yang Cui, Yiming Hou, Weitao Zhou, Jiawei Wang, Minglei Li, Dandan Zhang, Ding Zhao, Houde Liu, Xiaofan Li, Si Liu, Ping Luo, Haibao Yu

机构 * Tuojing Intelligence(拓景智能) Tsinghua University(清华大学) King’s College London(伦敦国王学院) Southeast University(东南大学) Stevens Institute of Technology(史蒂文斯理工学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Manchester(曼彻斯特大学) Simple AI(简单人工智能公司) Imperial College London(伦敦帝国学院) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

AI总结 研究物理约束下可变形物体操作,提出SoftVTBench基准测试,通过有限元模拟可变形物体,定义任务套件,分别报告目标成功和安全成功,实现基线并实验,表明仅成功评估高估策略性能,触觉传感可提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04149 2026-07-07 cs.CV 新提交

Beyond Scene Priors: Fine-Grained Traffic Scene Reasoning with Benchmarking and Query-Guided Small-Object Focus

超越场景先验:通过基准测试和查询引导的小目标聚焦进行细粒度交通场景推理

Waikit Xiu, Qiang Lu, Zian Wang, Xinjie Yang, Zhiwei Chen, Chen Sun, Xiying Li

机构 * The University of Hong Kong(香港大学) Sun Yat-Sen University(中山大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 针对安全关键交通场景中复杂问题,提出细粒度交通推理基准FGTR - Bench和文本引导小目标推理MLLM(TSR - MLLM),解决视觉语言对齐中关键小目标被忽视问题,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03062 2026-07-07 cs.CV 新提交

Lightweight Polyp Segmentation via a Gain-Aware Prediction-Space Recursive Controller

通过增益感知预测空间递归控制器实现轻量级息肉分割

Jiachi Zhang, Zhuoyu Wu, Quanjun Wang, Wenhui Ou, Wenqi Fang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) CyPhi( Ψ ​ Φ \Psi\Phi ) AI Research Lab, School of IT, Monash University Malaysia(马来西亚莫纳什大学信息技术学院CyPhi人工智能研究实验室) South China University of Technology(华南理工大学) Department of Electronic & Computer Engineering, The Hong Kong University of Science and Technology(香港科技大学电子与计算机工程系)

AI总结 研究针对轻量级息肉分割,将细化作为预测空间递归校正任务,引入直接作用于主干网络逻辑的递归控制器,在固定递归预算下聚合差异和不确定性证据,提升分割精度与部署效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03015 2026-07-07 cs.AI 新提交

Beyond Forecasting: The Belief-to-Trade Layer in Prediction-Market Agents

超越预测:预测市场代理中的信念到交易层

Yishu Wang, Yuxuan Wang, Jiaqi Deng, Hanyang Tang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 以预测未来事件为通用人工智能测试平台,提出Raven-Agent这一预测市场自主交易代理,在存档决策集的控制重放中表现出色。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02980 2026-07-07 cs.CL cs.AI 新提交

Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling

正确实现分层稀疏注意力:迈向无限上下文建模

Xiang Hu, Xinyu Wei, Hao Gu, Minshen Zhang, Tian Liang, Huayang Li, Lei Zhu, Yan Wang, Sirui Han, Yushi Bai, Kewei Tu, Haitao Mi, Leo Liang

机构 * Tencent HY Team(腾讯混元团队) ShanghaiTech University(上海科技大学) The Hong Kong University of Science and Technology(香港科技大学) University of California, San Diego(加州大学圣地亚哥分校)

AI总结 研究如何解决现代大语言模型扩展到长上下文时的计算成本和注意力长度外推问题。提出分层地标稀疏注意力机制,通过语言模型损失端到端学习块选择,实现高效长上下文建模。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02891 2026-07-07 cs.LG stat.ML 新提交

Dynamic Regret for Non-Stationary Linear Bandits via Misspecification Reductions

通过错误设定减少实现非平稳线性带型问题的动态遗憾

Zihao Hu, Yuan Yao, Jiheng Zhang, Zhengyuan Zhou

机构 * Department of Mathematics, The Hong Kong University of Science and Technology(香港科技大学数学系) Stern School of Business, New York University(纽约大学斯特恩商学院) Department of IEDA, The Hong Kong University of Science and Technology(香港科技大学工业工程与决策分析系)

AI总结 研究含特定轮次可行决策集的非平稳线性带型问题,针对现有方法局限,从统一错误设定减少视角,分块关联动态遗憾与固定参数线性带型基准,得出最优动态遗憾依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24107 2026-07-07 cs.CV cs.AI 新提交

DramaDirector: Geometry-Guided Short Drama Generation

DramaDirector: 几何引导的短剧生成

Hengji Zhou, Sijie Liu, Jianrun Chen, Xingchen Zou, Lianghao Xia, Liqiang Nie

机构 * South China University of Technology(华南理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 提出几何引导框架DramaDirector,通过检索真实短剧的深度-姿态参考,结合模式约束SFT和GRPO训练规划器,实现从情节到多镜头短剧的生成,在忠实度、一致性和可控性上优于基线。

Comments 20 pages, 17 figures, 6 tables. Code is available at https://github.com/iLearn-Lab/DramaDirector

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12555 2026-07-07 cs.SD cs.CV cs.MM 新提交

AudioX-Turbo: A Unified Framework for Efficient Anything-to-Audio Generation

AudioX-Turbo:高效任意到音频生成的统一框架

Zeyue Tian, Lei Ke, Zhaoyang Liu, Ruibin Yuan, Liumeng Xue, Yujiu Yang, Weijia Chen, Xu Tan, Qifeng Chen, Wei Xue, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) Noiz AI Independent Researcher(独立研究员)

AI总结 提出AudioX-Turbo,基于教师-学生范式的统一高效框架,通过多模态扩散Transformer和分布匹配蒸馏实现文本、视频、音频到音频的生成,仅需4步采样,NFE减少约25倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02517 2026-07-03 cs.CV 新提交

WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory

WorldDirector: 构建具有持久动态记忆的可控世界模拟器

Hanlin Wang, Hao Ouyang, Qiuyu Wang, Wen Wang, Qingyan Bai, Ka Leong Cheng, Yue Yu, Yixuan Li, Yihao Meng, Zichen Liu, Yanhong Zeng, Yujun Shen, Qifeng Chen

机构 * HKUST(香港科技大学) Ant Group(蚂蚁集团) ZJU(浙江大学) CUHK(香港中文大学)

AI总结 提出WorldDirector框架,通过LLM协调3D轨迹与相机运动作为视频生成控制信号,解耦语义运动编排与视觉生成,实现持久动态对象记忆和自由视角探索。

Comments Project Page: https://worlddirector.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02508 2026-07-03 cs.CV 新提交

From SRA to Self-Flow: Data Augmentation or Self-Supervision?

从SRA到Self-Flow:数据增强还是自监督?

Dengyang Jiang, Mengmeng Wang, Harry Yang, Jingdong Wang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zhejiang University of Technology(浙江工业大学) Baidu Inc.(百度公司)

AI总结 本文通过提出注意力分离方法,发现Self-Flow中双时间调度的性能提升主要源于噪声维度的数据增强,而非token间交互,并验证了该设计在ImageNet上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02322 2026-07-03 cs.RO cs.CV 新提交

The Moving Eye: Enhancing VLA Spatial Generalization via Hybrid Dynamic Data Collection

移动之眼:通过混合动态数据收集增强VLA空间泛化能力

Jincheng Tang, Yilong Zhu, Zhengyuan Xie, Jiang-Jiang Liu, Jiaxing Zhang

机构 * Lion Rock AI Lab, China Merchants Research Institute of Advanced Technology(狮岩人工智能实验室,中国商人先进科技研究院) The Hong Kong University of Science and Technology(香港科学与技术大学) Nankai University(南开大学)

AI总结 针对VLA模型空间泛化脆弱性问题,提出混合动态数据策略,结合连续相机运动与多样静态视角,减少虚假相关性,提升对未见相机位姿和物体配置的泛化能力。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02284 2026-07-03 cs.CV 新提交

FlowCIR: Semantic Transport via Flow Matching for Zero-Shot Composed Image Retrieval

FlowCIR: 通过流匹配实现零样本组合图像检索的语义传输

Zhenqi He, Ziqi Jiang, Yuanpei Liu, Yanghao Wang, Teng Wang, Long Chen

机构 * The Hong Kong University of Science and Technology, Hong Kong SAR(香港科技大学) The University of Hong Kong, Hong Kong SAR(香港大学)

AI总结 提出FlowCIR,利用条件流匹配将参考图像与指令组合成目标对齐查询嵌入,避免文本反转的信息损失,训练效率高,并引入多负向引导策略提升对否定指令的鲁棒性。

Comments Accept to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01874 2026-07-03 cs.AI cs.CL 新提交

SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use

SkillCoach: 用于评估和增强智能体技能使用的自演化评分准则

Jiayin Zhu, Kelong Mao, Yudong Guo, Dengbo He, Sulong Xu, Simiu Gu, Yutao Yue

机构 * HKUST(GZ)(香港科技大学(广州))

AI总结 提出SkillCoach框架,通过自演化过程评分准则从技能选择、遵循、组合和反思四维度评估智能体轨迹,并利用演化准则筛选高质量训练数据,提升技能使用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01764 2026-07-03 cs.AI 新提交

Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction

Mastermind: 基于策略学习的仓库级漏洞复现

Mingzhe Du, Luu Anh Tuan, Tianyi Wu, Renyang Liu, Zhijiang Guo, Dong Huang, See-Kiong Ng

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 提出Mastermind双循环框架,通过策略学习(SFT+GRPO)提升LLM代理在仓库级漏洞复现中的表现,在260个训练任务和200个测试任务上达到84.5%通过率,并成功迁移至不同执行器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01752 2026-07-03 cs.LG 新提交

Efficient Temporal Point Processes via Monotone Alternating Splines

通过单调交替样条实现高效时间点过程

Cheng Wan, Quyu Kong, Feng Zhou

机构 * Hong Kong University of Science and Technology(香港科技大学) Alibaba Cloud(阿里云) Center for Applied Statistics and School of Statistics, Renmin University of China(中国人民大学应用统计中心与统计学院)

AI总结 针对单调神经网络在建模累积条件强度函数时的结构缺陷,提出单调交替样条框架,通过分离插值与外推组件提升表示能力与计算效率,在合成和真实数据集上取得更优性能。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01677 2026-07-03 cs.CV 新提交

ICDepth: Taming Video Diffusion Models for Video Depth Estimation via In-Context Conditioning

ICDepth: 通过上下文条件化驯服视频扩散模型用于视频深度估计

Xuanhua He, Jiaxin Xie, Mingzhe Zheng, Qifeng Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

AI总结 提出ICDepth框架,利用上下文条件化(ICC)将预训练文本到视频扩散Transformer适配到视频深度估计,通过SAND-Attention确保时空对齐和SRFM注入语义分辨率先验,仅用0.8M帧训练数据即达到SOTA并展现强零样本泛化。

Comments Accepted to ECCV 2026. Project page: https://xuanhuahe.github.io/ICDepth/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24564 2026-07-03 cs.CV 新提交

PatternGSL: A Structured Specification Language for Template-Free and Simulation-Ready 3D Garments

PatternGSL: 一种用于无模板且可模拟的3D服装的结构化规范语言

Zhenyang Li, Lutao Jiang, Yizhou Zhao, Ying-Cong Chen, Xin Wang, Weikai Chen, Yifan Peng

机构 * The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Carnegie Mellon University(卡内基梅隆大学) LIGHTSPEED Shenzhen(LIGHTSPEED深圳) LIGHTSPEED Los Angeles(LIGHTSPEED洛杉矶)

AI总结 提出PatternGSL,一种无模板、可学习的结构化服装表示语言,从单张图像直接预测完整缝纫图案,实现可模拟的3D服装重建。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23041 2026-07-03 cs.CV 新提交

SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models

SPAR: 语义-像素自对齐与自适应路由的统一多模态模型

Hongxiang Li, Hongxu Chen, Chenyang Zhu, Xiaoshuang Huang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Xiaohongshu Inc.(小红书公司)

AI总结 提出SPAR框架,通过非对称双流统一分词器协调语义感知与像素重建,利用自对齐生成范式消除外部依赖,并引入动态令牌路由实现灵活多模态交互,在统一架构中达到生成、重建与视觉理解的最优性能。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01222 2026-07-02 cs.CV 新提交

Ink3D: Sculpting 3D Assets with Extremely Complex Textures via Video Generative Models

Ink3D: 通过视频生成模型雕刻具有极其复杂纹理的3D资产

Yue Han, Chong Li, Zhening Liu, Cong Huang, Fang Deng, Yong Liu, Fangyun Wei, Yan Lu

机构 * ZGCA & ZGCI(ZGCA 和 ZGCI) Microsoft Research(微软研究院) Zhejiang University(浙江大学) HKUST(香港科技大学)

AI总结 提出Ink3D框架,利用大规模视频生成模型合成复杂纹理,通过OrbitPainter生成密集轨道扫描视频,并用TextureOptimizer进行神经烘焙以生成一致纹理。

Comments Accepted to ECCV 2026. Project page: https://yuehan99.github.io/Ink3D-TextureGen/

详情

展开后加载摘要…

URL PDF HTML 收藏