arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

共收录 324
2606.15932 2026-06-17 cs.CL 新提交

Beyond NL2Code: A Structured Survey of Multimodal Code Intelligence

超越NL2Code:多模态代码智能的结构化综述

Xuanle Zhao, Qiushi Sun, Jingyu Xiao, Xuexin Liu, Haoyue Yang, Qiaosheng Chen, Xianzhen Luo, Jing Huang, Yufeng Zhong, Lei Chen, Shuai Fu, Zhenlin Wei, Jinhe Bi, Lei Jiang, Haibo Qiu, Siqi Yang, Peng Shi, Jian Hu, Zhixiong Zeng

机构 * Meituan(美团) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学) Harbin Institute of Technology(哈尔滨工业大学) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所) Ludwig Maximilian University of Munich(慕尼黑大学) University of Science and Technology of China(中国科学技术大学) Queen Mary University of London(伦敦玛丽女王大学)

AI总结 本文系统综述多模态代码智能,将任务按代码角色分类,覆盖GUI、科学可视化、结构化图形及前沿任务,并提出四个基于验证的未来方向。

Comments Work completed in January 2026. Updating now

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15617 2026-06-17 cs.CV 新提交

NeRD: Neuro-Symbolic Rule Distillation for Efficient Ontology-Grounded Chain-of-Thought in Medical Image Diagnosis

NeRD:面向医学图像诊断的高效本体接地思维链的神经符号规则蒸馏

Hongxi Yang, Yiwen Jiang, Siyuan Yan, Jamie Chow, Eunis Li, Charlotte Poon, Stephanie Fong, Xiangyu Zhao, Deval Mehta, Yasmeen George, Zongyuan Ge

机构 * Department of Data Science & AI, Faculty of Information Technology, Monash University(莫纳什大学信息技术学院数据科学与人工智能系) AIM for Health Lab, Faculty of Information Technology, Monash University(莫纳什大学信息技术学院AIM健康实验室) Faculty of Engineering, Monash University(莫纳什大学工程学院) Faculty of Medicine, The Chinese University of Hong Kong(香港中文大学医学院) School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算技术学院)

AI总结 提出NeRD框架,通过神经符号规则蒸馏生成高效、本体接地且非冗余的推理链,避免人工规则,在皮肤数据集上实现强诊断性能和可解释性,并首次实现专家介入的多模态思维链诊断。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15148 2026-06-17 cs.RO cs.AI 新提交

MimicIK: Real-Time Generative Inverse Kinematics from Teleoperation with FK Consistency

MimicIK: 基于遥操作且保持正运动学一致性的实时生成式逆运动学

Jiahao Yang, Shenhao Yan, Fan Feng, Chengsi Yao, Ge Wang, Zhixin Mai, Yiming Zhao, Yatong Han

机构 * Ising AI CUHK-Shenzhen(香港中文大学(深圳))

AI总结 提出MimicIK框架,利用条件流匹配从遥操作数据学习平滑鲁棒的关节空间运动先验,通过两阶段迭代优化和正运动学一致性损失实现实时逆运动学求解,在6-DOF机器人数据集上达到4.65mm位置误差和92.01%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14782 2026-06-17 cs.CV cs.CL 新提交

Last But Not Least: Boundary Attention CalibratiON for Multimodal KV Cache Compression

最后但同样重要:用于多模态KV缓存压缩的边界注意力校准

Tianhao Chen, Yuheng Wu, Kelu Yao, Xiaogang Xu, Xiaobin Hu, Dongman Lee

机构 * KAIST(韩国科学技术院) Zhejiang Laboratory(之江实验室) The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学)

AI总结 针对多模态大语言模型长视觉上下文中KV缓存压缩导致关键证据丢失的问题,提出BACON方法,通过校准观察窗口注意力与最后查询注意力,并利用层内一致性和层间持久性抑制噪声,在激进压缩下平均提升7.5%性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17043 2026-06-16 cs.RO cs.LG 新提交

Hierarchical Advantage Weighting for Online RL Fine-Tuning of VLAs from Sparse Episode Outcomes

基于层级优势加权的在线RL微调VLA策略从稀疏回合结果

Tongyan Fang, Siyuan Huang, Naiyu Fang, Ganlong Zhao, Zhongjin Luo, Jianbo Liu, Xiaogang Wang, Ying Dong, Hongsheng Li

机构 * ACE Robotics Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出层级优势加权行为克隆(HABC),通过分离生存性和效率目标并自适应平衡,解决稀疏二元结果下VLA策略在线微调中的信用分配问题,在三个双臂接触任务上将成功率从12-44%提升至38-92%。

Comments Website: https://acerobotics-vla.github.io/HABC-Website

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17022 2026-06-16 math.ST cs.LG stat.ML stat.TH 新提交

Learning the Geometry of Data: A Mathematical Review of Shape Space Analysis

学习数据的几何:形状空间分析的数学综述

Gary P. T. Choi, Khanh Dao Duc, Shira Faigenbaum-Golovin, Karen Habermann, Emmanuel Hartman, Christoph von Tycowicz, Chi Zhang, Wenjun Zhao, Felix Zhou

机构 * Department of Mathematics, The Chinese University of Hong Kong(数学系,香港中文大学) Department of Mathematics, University of British Columbia(数学系,不列颠哥伦比亚大学) Department of Mathematics, Bar-Ilan University(数学系,巴伊兰大学) Department of Statistics, University of Warwick(统计系,沃里克大学) Department of Mathematics, University of Houston(数学系,休斯顿大学) Zuse Institute Berlin(柏林Zuse研究所) Department of Biomedical Sciences, Texas A&M University(生物医学科学系,德克萨斯A&M大学) Department of Mathematics, Wake Forest University(数学系,威克森林大学) Lyda Hill Department of Bioinformatics, University of Texas Southwestern Medical Center(Lyda Hill生物信息学系,德克萨斯西南医学中心)

AI总结 本文综述形状空间分析,利用微分几何、统计学和机器学习构建从形状表示到几何感知学习的分析流程,用于表征几何数据中的非线性结构。

Comments 79 pages, 10 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17011 2026-06-16 cs.RO cs.LG 新提交

ROVE: Unlocking Human Interventions for Humanoid Manipulation via Reinforcement Learning

ROVE: 通过强化学习解锁人类干预用于人形机器人操作

Wei Xiao, Weiliang Tang, Yuying Ge, Hui Zhou, Yao Mu, Li Zhang, Yixiao Ge

机构 * XPENG Robotics(小鹏机器人) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出ROVE框架,利用强化学习和乐观价值估计,从次优人类干预轨迹中学习高价值行为,提升人形机器人操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16817 2026-06-16 cs.CL cs.IR 新提交

Understanding the Behaviors of Environment-aware Information Retrieval

理解环境感知的信息检索行为

Ruifeng Yuan, Chaohao Yuan, David Dai, Yu Rong, Hong Cheng, Hou Pong Chan, Chenghao Xiao

机构 * Fudan University(复旦大学) Alibaba DAMO Academy(阿里巴巴达摩院) Chinese University of Hong Kong(香港中文大学) Stanford University(斯坦福大学) Shanghai University of Finance and Economics(上海财经大学)

AI总结 通过强化学习使LLM适应不同检索器的查询策略,发现不同检索器偏好不同查询风格,并提出分支式滚动技术提升训练稳定性。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16802 2026-06-16 cs.AI 新提交

LabOSBench: Benchmarking Computer Use Agents for Scientific Instrument Control

LabOSBench: 科学仪器控制的计算机使用智能体基准测试

Anqi Zou, Han Deng, Chengyu Zhang, Junquan Hu, Yu Wang, Yuxiang Xing, Aokai Zhang, Hanling Zhang, Zhaoyang Liu, Ben Fei, Zhihui Wang, Wanli Ouyang

机构 * Shenzhen Loop Area Institute(深圳河套学院) Dalian University of Technology(大连理工大学) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 提出LabOSBench基准,基于Web科学仪器模拟器评估多模态GUI智能体在仪器控制中的表现,揭示现有智能体在反馈驱动操作和长流程执行上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16771 2026-06-16 cs.LG 新提交

GD$^2$PO: Mitigating Multi-Reward Conflicts via Group-Dynamic reward-Decoupled Policy Optimization

GD$^2$PO: 通过组动态奖励解耦策略优化缓解多奖励冲突

Haotian Liu, Yihao Liu, Jingwei Ni, Siyuan Huang, Xinpeng Liu, Pengyu Cheng, Jiajun Song, Ruijin Ding, Junfeng Li, Zhechao Yu, Mengyu Zhou, Hongteng Xu, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴通义千问大模型应用团队) Renmin University of China(中国人民大学) Peking University(北京大学) ETH Zürich(苏黎世联邦理工学院) University of Zurich(苏黎世大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出GD$^2$PO算法,通过冲突感知过滤机制屏蔽奖励不一致的rollout,并结合查询级重加权,解决多奖励优化中的信号抵消问题,提升RL训练效率。

Comments 24 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16769 2026-06-16 cs.AI 新提交

Skill-to-LoRA: From Using Skills to Learning Behaviors for Token-Efficient LLM Agents

Skill-to-LoRA:从使用技能到学习行为以实现令牌高效的LLM智能体

Tianyi Zhang, Zhonghao Qi

机构 * The Chinese University of Hong Kong(香港中文大学)

AI总结 提出Skill-to-LoRA方法,将技能文本转换为LoRA适配器,替代运行时注入技能文档,在SWE-Skills-Bench上提升通过率并降低令牌成本。

Comments Preprint. 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16546 2026-06-16 eess.AS cs.SD 新提交

Confidence Score Guided Incremental and Speaker Adaptive Pseudo-Labeling for Semi-Supervised Elderly Speech Recognition

置信度评分引导的增量式和说话人自适应伪标注用于半监督老年人语音识别

Chengxi Deng, Xurong Xie, Shujie Hu, Jiajun Deng, Mengzhe Geng, Youjun Chen, Huimeng Wang, Haoning Xu, Guinan Li, Xunying Liu

机构 * The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学) Institute of Software, Chinese Academy of Sciences, China(中国科学院软件研究所) National Research Council Canada, Canada(加拿大国家研究理事会)

AI总结 提出一种置信度评分引导的增量式和说话人自适应伪标注方法,通过渐进式高质量伪标签选择和说话人自适应训练,在老年人语音识别中分别降低词错误率1.45%和字符错误率2.27%。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16539 2026-06-16 eess.AS cs.SD 新提交

Decoding while Adapting: Zero-Shot Online Speaker Adaptation via Audio-Textual Prompts for Elderly Speech Recognition

解码与自适应:基于音频-文本提示的零样本在线说话人自适应用于老年人语音识别

Chengxi Deng, Xurong Xie, Shujie Hu, Mengzhe Geng, Tianzi Wang, Youjun Chen, Huimeng Wang, Haoning Xu, Jiajun Deng, Xunying Liu

机构 * The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学) Institute of Software, Chinese Academy of Sciences, China(中国科学院软件研究所) National Research Council Canada, Canada(加拿大国家研究理事会)

AI总结 提出一种基于跨语句音频-文本提示的说话人自适应方法,实现零样本实时适应未见说话人,在老年人语音数据集上显著降低词错误率/字符错误率,并大幅提升实时因子。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16456 2026-06-16 cs.LG cs.AI 新提交

SPRI: SVD-Partitioned Residual Initialization for Data-Constrained MoE Upcycling

SPRI: 基于SVD分解残差初始化的数据受限MoE升级方法

Weiqiao Shan, Ruixiang Mao, Yuang Li, Yuhao Zhang, Yingfeng Luo, Tong Zheng, Chen Xu, Yucheng Qiao, Chunxiang Jin, Yi Yuan, Jingdong Chen, Tong Xiao, Jingbo Zhu

机构 * Northeastern University, China(东北大学) Huawei TSC, China(华为技术有限公司) CUHK-Shenzhen, China(香港中文大学(深圳)) University of Maryland, USA(马里兰大学) Harbin Engineering University, China(哈尔滨工程大学) Inclusion AI, Ant Group(蚂蚁集团Inclusion AI) NiuTrans Research, China(小牛翻译研究中心)

AI总结 提出SPRI方法,利用预训练FFN权重的SVD分解残差初始化MoE专家,结合两阶段训练策略,在数据受限的多语言语音翻译任务中显著提升性能。

Comments 8pages, 12 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16310 2026-06-16 cs.LG cs.CL 新提交

QK-Normed MLA: QK normalization without full key caching

QK归一化MLA:无需完整键缓存的QK归一化

Yizhou Han, Yao Zhao, Jun Zhou, Longfei Li, Ruoyu Sun

机构 * The Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团)

AI总结 提出QK归一化与MLA兼容的方法,通过吸收静态权重和动态标量,无需缓存完整键,在400M模型训练中降低损失并提升下游精度,解码延迟增加小于2%。

Comments 13 pages, 5 figures, conference-style manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15872 2026-06-16 cs.CL 新提交

SciOrch: Learning to Orchestrate Expert LLMs for Solving Frontier Multimodal Scientific Reasoning Tasks

SciOrch: 学习编排专家大语言模型以解决前沿多模态科学推理任务

Jingru Guo, Xiangyuan Xue, Lian Zhang, Wanghan Xu, Siki Chen, Philip Torr, Wanli Ouyang, Lei Bai, Zhenfei Yin

机构 * Imperial College London(伦敦帝国学院) The Chinese University of Hong Kong(香港中文大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Oxford(牛津大学) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 提出SciOrch框架,训练轻量级8B模型编排多个前沿大语言模型,通过MCTS和GRPO优化,在科学推理任务上超越最强单模型和多智能体基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15749 2026-06-16 cs.CV cs.AI cs.SY eess.SY 新提交

OmniTraffic: A Controllable Generation Pipeline and Benchmark for Spatio-Temporal Traffic Reasoning

OmniTraffic:面向时空交通推理的可控生成流水线与基准

Maonan Wang, Zhengyan Huang, Kemou Jiang, Yuhang Fu, Jiayue Zhu, Yuxin Cai, Xingchen Zou, Qiaosheng Zhang, Yi Yu, Ding Wang, Xi Chen, Ben M. Chen, Yuxuan Liang, Zhiyong Cui, Man On Pun, Yirong Chen

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai AI Lab(上海人工智能实验室) Beihang University(北京航空航天大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出OmniTraffic,一个基于12个真实路口3D重建的可控生成流水线与基准,通过8M VQA样本和3K人工验证测试集评估11个前沿MLLM,揭示拓扑与时空推理中的显著人机差距,并证明仿真数据微调可提升真实场景性能。

Comments 34 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15702 2026-06-16 math.OC cs.LG 新提交

Schattor: Schatten-family methods for deep learning optimization

Schattor:用于深度学习优化的Schatten族方法

Bohao Ma, Junyu Zhang, Chuan He

机构 * School of Data Science, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)数据科学学院) Department of Industrial Systems Engineering and Management, National University of Singapore(新加坡国立大学工业系统工程与管理系) Department of Mathematics, Linköping University(利乌波德大学数学系)

AI总结 提出基于Schatten范数的自适应一阶方法族Schattor,统一SGD与Muon,通过矩阵鞅矩界实现无维数平稳性保证,并开发多块扩展以自适应平衡块优化。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15285 2026-06-16 cs.RO 新提交

Acting While Understanding: Asynchronous Semantic-Action Decoupling for Real-Time Vision-Language-Action Models

理解中行动:面向实时视觉-语言-动作模型的异步语义-动作解耦

Shenhao Yan, Ge Wang, Qi Liu, Weilin Meng, Jiahao Yang, Chengsi Yao, Fan Feng, Xiaoguang Ma, Yiming Zhao, Yatong Han

机构 * Northeastern University(东北大学) Ising AI CUHK-Shenzhen(香港中文大学(深圳))

AI总结 提出异步语义-动作解耦框架,分离VLAs中的语义理解与动作生成,通过低频率语义更新和高频率动作推理实现高频闭环控制,在LIBERO和真实机器人上验证了高达35.6Hz的动作模块吞吐率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15266 2026-06-16 cs.CL 新提交

Evaluating and Preserving Lexical Stress in English-to-Chinese Speech-to-Speech Translation

评估与保留英汉语音翻译中的词汇重音

Yuchen Song, Xi Chen, Mingze Li, Satoshi Nakamura

机构 * The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) Shenzhen Loop Area Institute, China(深圳环域研究所)

AI总结 针对英汉语音翻译中词汇重音跨语言传递不足的问题,构建重音标注数据集和普通话重音检测器,提出跨语言重音评估指标,并微调CosyVoice3构建重音感知S2ST系统,实验表明该系统在重音翻译能力上显著优于现有系统。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15152 2026-06-16 cs.CL 新提交

Can Agents Read the Room? Benchmarking Visual Social Intelligence in Multimodal Simulation

智能体能否读懂房间气氛?多模态模拟中的视觉社交智能基准测试

Shijun Wan, Xuehai Wu, Jiwen Zhang, Siyuan Wang, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出AgentViSS基准,通过240个场景和四项角色级任务评估多模态大模型的视觉社交智能,发现局部角色扮演接近饱和而交互调控仍困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14971 2026-06-16 cs.LG cs.AI 新提交

FastMix: Fast Data Mixture Optimization via Gradient Descent

FastMix: 通过梯度下降实现快速数据混合优化

Haoru Tan, Sitong Wu, Yanfeng Chen, Jun Xia, Ruobing Xie, Bin Xia, Xingwu Sun, Xiaojuan Qi

机构 * University of Hong Kong(香港大学) Tencent(腾讯) Chinese University of Hong Kong(香港中文大学)

AI总结 提出FastMix框架,将数据混合选择重新表述为双层优化问题,通过联合优化混合系数和模型参数,实现高效、可扩展的数据混合发现,在预训练和后训练中均优于基线方法且大幅降低搜索成本。

Journal ref ICLR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14832 2026-06-16 cs.CL 新提交

PhoneHarness: Harnessing Phone-Use Agents through Mixed GUI, CLI, and Tool Actions

PhoneHarness: 通过混合GUI、CLI和工具操作利用手机使用代理

Chenxin Li, Zhengyao Fang, Zhengyang Tang, Pengyuan Lyu, Xingran Zhou, Xin Lai, Fei Tang, Liang Wu, Yiduo Guo, Weinong Wang, Junyi Li, Yi Zhang, Yang Ding, Huawen Shen, Sunqi Fan, Shangpin Peng, Zheng Ruan, Anran Zhang, Benyou Wang, Chengquan Zhang, Han Hu

机构 * Tencent Hunyuan(腾讯混元) The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学)

AI总结 提出PhoneHarness,一个混合动作基准和执行框架,用于评估手机代理在可验证移动工作流中的表现,通过GUI、CLI和工具动作的组合,达到75.0%通过率,比最强基线高12.9个百分点。

Comments Project Page: https://phoneharness.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14820 2026-06-16 cs.SD cs.AI cs.CL eess.AS 新提交

Spectro-Temporal Interference Confounds Phase Encoding in Spatial Audio Foundation Models

频谱-时间干扰混淆空间音频基础模型中的相位编码

Yuxuan Chen, Haoyuan Yu, Peize He

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Jilin University(吉林大学) Hunan University(湖南大学) University of Electronic Science and Technology of China(电子科技大学)

AI总结 提出基于双耳掩蔽级差的心理声学基准,评估空间自监督音频模型对微秒级耳间相位精细结构的编码能力,发现通用双耳SSL模型依赖频谱-时间干扰纹理而非真实相位计算。

Comments Accepted to INTERSPEECH 2026; 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10862 2026-06-16 cs.CV cs.AI 新提交

LIBERO-Occ: Evaluating and Improving Vision-Language-Action Models under Scene-Induced Occlusion via Viewpoint Imagination

LIBERO-Occ:通过视角想象评估和改进场景诱导遮挡下的视觉-语言-动作模型

Taishan Li, Jiwen Zhang, Siyuan Wang, Xuanjing Huang, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Chinese University of Hong Kong(香港中文大学)

AI总结 针对VLA模型在场景遮挡下性能下降的问题,提出LIBERO-Occ基准和视角想象方法,通过生成互补视图提升鲁棒性。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09150 2026-06-16 cs.CV 新提交

Ultra Flash: Scaling Real-Time Streaming Video Generation to High Resolutions

Ultra Flash: 将实时流式视频生成扩展到高分辨率

Luxury, Jie Huang, Zihao Fan, Xiaoxiao Ma, Jun-hao Zhuang, Yuming Li, Zeyue Xue, Siming Fu, Haoran Li, Mingchen Zhong, Guohui Zhang, Shichen Ma, Yijun Liu, Jiaqi Shi, Yanwen Ma, Yaofeng Su, Haoyu Wang, Yaowei Li, Songchun Zhang, Weiyang Jin, Yuxuan Bian, Shiyi Zhang, Haojun Xu, Shuai Lu, Xin Han, Wei Tang, Haoyang Huang, Nan Duan

机构 * JD Explore Academy(京东探索研究院) USTC(中国科学技术大学) PKU(北京大学) THU(清华大学) BUAA(北京航空航天大学) FDU(复旦大学) HKUST(香港科技大学) HKU(香港大学) CUHK(香港中文大学)

AI总结 提出Ultra Flash级联框架,通过架构保持的超分辨率训练、因果流式潜在上采样器和高分辨率解码器、以及级联优化方案,在单GPU上实现1K分辨率约30 FPS和2K分辨率约18 FPS的实时高分辨率流式视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14375 2026-06-15 cs.RO cs.AI 新提交

Elastic Queries Reinforcement Learning: Self-Aware Policy Execution for VLA Models

弹性查询强化学习:VLA模型的自我感知策略执行

Ge Wang, Xinyu Tan, Xiang Li, Man Luo, Chengsi Yao, Shenhao Yan, Jiahao Yang, Fan Feng, Honghao Cai, Xiangyuan Wang, Zhixin Mai, Yiming Zhao, Yatong Han, Zhen Li

机构 * Ising AI CUHK-Shenzhen(香港中文大学(深圳)) PKU(北京大学)

AI总结 提出弹性查询强化学习(EQRL),通过轻量级潜在调度适配器动态调整VLA模型的推理步骤和动作块长度,利用评论家集成分歧估计状态难度,在降低推理成本的同时保持或提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14317 2026-06-15 cs.CV 新提交

CausalMotion: Structured Physical Reasoning as Keyframe and Trajectory Guidance for Training-Free Video Generation

CausalMotion: 基于关键帧与轨迹引导的结构化物理推理实现免训练视频生成

Sihan Zhuang, Xinyuan Chen, Tianfan Xue, Yaohui Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ShanghaiTech University(上海科技大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出CausalMotion框架,利用视觉语言模型将文本提示分解为因果一致的关键帧和物体运动轨迹,作为软约束引导预训练视频扩散模型,无需额外训练即可提升物理合理性和时间连贯性。

Comments Project Page: https://zhuangsh0713.github.io/CausalMotion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14222 2026-06-15 cs.LG 新提交

Learning the Context of Errors: Black-Box Online Adaptation of Time Series Foundation Models

学习错误的上下文:时间序列基础模型的黑盒在线自适应

Xilin Dai, Yiding Liu, Hongjie Xia, Yifan Hu, Zewei Dong, Jiang-Ming Yang, Qiang Xu

机构 * Ant International(蚂蚁国际) The Chinese University of Hong Kong(香港中文大学)

AI总结 针对黑盒时间序列基础模型在线自适应问题,提出ORCA方法,通过学习基础模型预测误差的上下文(输入和输出)进行自适应,在5个模型和8个数据集上验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14162 2026-06-15 cs.CV 新提交

VideoWeave: Unlocking Geometric Consistency in Video Generation via Joint Geometry-Video Modeling

VideoWeave: 通过联合几何-视频建模解锁视频生成中的几何一致性

Xunzhi Xiang, Zixuan Duan, Yabo Chen, Zhengxuan Wei, Guiyu Zhang, Zixiao Gu, Zhe Gao, Haibin Huang, Chi Zhang, Qi Fan, Xuelong Li

机构 * Nanjing University(南京大学) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI)) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 提出VideoWeave,一种在潜在空间后训练框架,利用隐式几何模型特征约束生成分布,缓解几何重建误差,提升视频几何一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏