arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-07-28 至 2026-07-28 共收录 15
2607.24591 2026-07-28 cs.CV 新提交

CameraAnything: Refilming Videos with Arbitrary Camera Control

CameraAnything:使用任意相机控制重新拍摄视频

Yixuan Li, Yanhong Zeng, Ka Leong Cheng, Jiayi Zhu, Hanlin Wang, Wen Wang, Yihao Meng, Hao Ouyang, Qiuyu Wang, Yue Yu, ZiDong Wang, Yiyuan Zhang, Yujun Shen, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Zhejiang University(浙江大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 CameraAnything是用于相机控制视频编辑的统一框架,采用逐像素普吕克光线注入等方法联合控制相机参数,开发合成管道克服数据稀缺,能在单过程中实现多种视频编辑操作,为视频制作提供实用价值。

Comments Project page: https://yixuanli98.github.io/cameraanything/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24588 2026-07-28 cs.AI 新提交

SIREN: Towards End-to-End Extreme-Weather Early Warning with Experience-Grounded LLM Agents

SIREN:借助基于经验的大语言模型智能体实现端到端极端天气预警

Hang Ni, Weijia Zhang, Fan Liu, Mengqian Lu, Hao Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) The World Sustainable Development Institute(世界可持续发展研究所)

AI总结 研究借助大语言模型智能体实现端到端极端天气预警。开发了包含多任务问答实例的SIREN-Bench基准,发现现有框架差距后,构建基于经验的SIREN框架,结合多种技术,实验证明其在预警程序和预警链上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24436 2026-07-28 cs.CV 新提交

MSVS-VAE: Multi-Scale Anchored VecSet for High-Fidelity 3D Reconstruction

MSVS-VAE:用于高保真3D重建的多尺度锚定向量集

Dehao Hao, Kaiyi Zhang, Tanghui Jia, Xiangjun Gao, Dongyu Yan, Weikai Chen, Zeyu Hu, Lingting Zhu, Yingda Yin, Runze Zhang, Li Yuan, Xin Wang, Long Quan

机构 * The Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Lightspeed Studios(光速工作室)

AI总结 研究针对高保真3D重建中VAE的瓶颈问题,提出MSVS-VAE。通过分层点洗牌上采样 densify 锚定向量集潜在特征,用AVS-Conv取代全局交叉注意力,引入多尺度查询解码融合特征,实验表明其性能优于现有方法,解码速度和紧凑性有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24218 2026-07-28 cs.LG cs.AI 新提交

Every Client Is an Environment: Federated De-confounding for Spatio-Temporal Forecasting

每个客户端都是一个环境:用于时空预测的联邦去混淆

Qingxiang Liu, Anqi Liang, Heng Wang, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) Harbin Engineering University(哈尔滨工程大学)

AI总结 针对时空预测,提出联邦去混淆框架\method,将客户端视为不同因果环境,利用客户端异质性作为分布式环境证据,学习全局原型码本捕获共享环境模式,推导理论边界,实验证明其优于联邦基线,提供可转移等环境表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24199 2026-07-28 cs.CV 新提交

Reasoning to Regulate: Chain-of-Thought for Traffic Rule Understanding

推理以规范:用于交通规则理解的思维链

Yueru Luo, Xu Yan, Changqing Zhou, Yiming Yang, Chao Zhan, Shuqi Mei, Chao Zheng, Zhen Li

机构 * CUHK-SZ, Shenzhen-FNii(香港中文大学(深圳),深圳高等金融研究院) HKUST(GZ)(香港科技大学(广州)) Tencent T Lab(腾讯T实验室)

AI总结 针对交通规则理解这一自动驾驶关键挑战,提出为视觉语言模型配备思维链能力的框架,设计整理管道,采用两阶段训练方案,显著提升了可解释性和准确性,建立首个基于推理的自动驾驶框架。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24064 2026-07-28 cs.CV cs.AI 新提交

MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning

MarineEVT:通过视觉工具推理推进以事件为中心的海洋视频理解

Tuan-An To, Yuk-Kwan Wong, Tuan-Anh Vu, Ziqiang Zheng, Sai-Kit Yeung

机构 * The Hong Kong University of Science and Technology(香港科技大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of Electronic Science and Technology of China(电子科技大学)

AI总结 针对海洋视频理解面临的挑战,构建MarineEVT数据集,将其理解分解为EVT-R1过程,利用视觉工具驱动模型。实验显示EVT-R1优于多个SOTA VLMs,为海洋相关发展奠定基础并推动VLMs进步。

Comments Accepted to The 19th European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23504 2026-07-28 cs.CV 新提交

MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation

MemVLN:用于视觉与语言导航的情景记忆和程序记忆

Yuqi Liu, Shengju Qian, Tianyuan Qu, Mingxian Lin, Zixuan Wang, Xin Wang, Bei Yu, Jiaya Jia

机构 * The Chinese University of Hong Kong(香港中文大学) LIGHTSPEED(光速) The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 研究连续环境中视觉与语言导航问题,提出MemVLN框架,利用视觉编码器、大语言模型,通过情景记忆管理和程序记忆,实现实时推理,提升导航成功率并降低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22719 2026-07-28 cs.CV 新提交

$γ$-Bridge: A Look-Parametric Diffusion Bridge

γ-桥:一种外观参数化扩散桥

Xuran Hu, Yujie Zhu, Tengxi Wang, Jilong Li, Wufan Zhao

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Macquarie University(麦考瑞大学) Ningxia University(宁夏大学)

AI总结 针对乘法伽马噪声在相干成像中的问题,提出γ-桥这一外观参数化扩散桥,通过特定调度连接噪声观测与干净极限,结合均匀补丁外观估计器,能处理多传感器数据,实现零样本恢复且结果领先,还提供可物理解释的控制。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10405 2026-07-28 cs.HC cs.AI cs.GR 版本更新

Spatula: Exploring On-Demand In-Situ Interfaces and Interaction for Attribute Control

Spatula:探索用于属性控制的按需原位界面和交互

Boyu Li, Linjie Qiu, Lin-Ping Yuan, Duotun Wang, Yue Jiang, Zeyu Wang, Hongbo Fu

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) University of Utah(犹他大学) University of Utah Salt Lake City USA(犹他大学盐湖城美国)

AI总结 研究针对生成内容属性控制问题,提出Spatula系统,基于技术探针沿四个维度探索属性控制空间,用户研究显示其交互直观便捷,支持多样参数控制,且即插即用设计可推广到其他领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09133 2026-07-28 cs.CV cs.AI 版本更新

IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation

IB-Flow:用于少步文本到图像生成的信息瓶颈引导的CFG蒸馏

Yiting Wang, Jingyi Zhang, Wenhu Zhang, Ke Chao, Yves Liang, Kun Cheng, Kang Zhao

机构 * Tsinghua University(清华大学) Wan Team, Alibaba Group(万团队,阿里巴巴集团) HKUST(香港科技大学) Beijing Normal University(北京师范大学)

AI总结 研究针对少步文本到图像生成中推理延迟问题,通过信息论将蒸馏建模为信息瓶颈引导的动态互信息博弈,提出双轨自适应框架,消除过度条件化伪影,在2步配置下实现SOTA生成保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05382 2026-07-28 cs.CV cs.AI 版本更新

Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation

超越可教内容的搜索:拓展智能体视觉生成的知识边界

Haozhe Wang, Weijia Feng, Jinpeng Yu, Che Liu, Ping Nie, Fangzhen Lin, Jiaming Liu, Ruihua Huang, Jimmy Lin, Wenhu Chen, Cong Wei

机构 * Hong Kong University of Science and Technology(香港科技大学) University of Waterloo(滑铁卢大学) Qwen Applications(通义千问应用) Imperial College London(帝国理工学院)

AI总结 针对视觉生成器的世界知识瓶颈,构建专用数据集与基准,提出教-搜协同训练框架定位动态知识边界,实现知识驱动的可迭代视觉生成性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28116 2026-07-28 cs.CL 版本更新

Mechanism-Driven Monitors for Preemptive Detection of LLM Training Instability

机制驱动的LLM训练不稳定性抢先检测监控器

Ruixuan Huang, Hantao Huang, Yifan Huang, Ansheng You, Zhenxing Zhang, Shuai Wang

机构 * HKUST(香港科技大学) Huawei(华为) Independent Researcher(独立研究者)

AI总结 针对大语言模型训练中的数值或超参数故障,提出基于模块功能角色的内部监控器,通过QK双线性分解谱熵和MoE路由器指标,在损失发散前数千步检测到不稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24625 2026-07-28 cs.LG cs.AI 版本更新

AutoFed: Personalized Federated Traffic Prediction via Adaptive Prompt

AutoFed: 通过自适应提示实现个性化联邦交通预测

Zijian Zhao, Yitong Shang, Sen Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

AI总结 本文提出AutoFed框架,通过自适应提示学习实现个性化联邦交通预测,解决传统联邦学习在非独立同分布数据下的不足,无需手动调参,提升交通预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13472 2026-07-28 cs.LG cs.AI cs.MA 版本更新

Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus

将MARL连接到SARL:一种通过潜在共识的顺序无关多智能体Transformer

Zijian Zhao, Jing Gao, Sen Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

AI总结 本文提出CMAT框架,通过Transformer编码器处理联合观测空间,利用层次决策机制生成共识向量,实现顺序无关的联合决策,优于传统MARL方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08992 2026-07-28 cs.AI 版本更新

Rethinking Prospect Theory for LLMs: Revealing the Instability of Decision-Making under Epistemic Uncertainty

重新思考用于大语言模型的前景理论:在认知不确定性下决策的不稳定性

Rui Wang, Qihan Lin, Jiayu Liu, Qing Zong, Tianshi Zheng, Dadi Guo, Haochen Shi, Peixuan Han, Weiqi Wang, Yangqiu Song

机构 * Hong Kong University of Science and Technology(香港科技大学) Huazhong University of Science and Technology(华中科技大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文重新审视前景理论在大语言模型中的应用,发现其在认知不确定性下的决策稳定性存在问题,指出前景理论可能无法可靠地处理此类不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏