arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-07-03 至 2026-07-03 共收录 7
2607.02517 2026-07-03 cs.CV 新提交

WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory

WorldDirector: 构建具有持久动态记忆的可控世界模拟器

Hanlin Wang, Hao Ouyang, Qiuyu Wang, Wen Wang, Qingyan Bai, Ka Leong Cheng, Yue Yu, Yixuan Li, Yihao Meng, Zichen Liu, Yanhong Zeng, Yujun Shen, Qifeng Chen

机构 * HKUST(香港科技大学) Ant Group(蚂蚁集团) ZJU(浙江大学) CUHK(香港中文大学)

AI总结 提出WorldDirector框架,通过LLM协调3D轨迹与相机运动作为视频生成控制信号,解耦语义运动编排与视觉生成,实现持久动态对象记忆和自由视角探索。

Comments Project Page: https://worlddirector.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02471 2026-07-03 cs.CV 新提交

Interpretation-Oriented Cloud Removal via Observation-Anchored Residual Flow with Geo-Contextual Alignment

面向解译的云去除:基于观测锚定残差流与地理上下文对齐

Ziyao Wang, Maonan Wang, Yucheng He, Xianping Ma, Ziyi Wang, Hongyang Zhang, Yirong Cheng, Man-on Pun

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) Shanghai Ai Lab(上海人工智能实验室) Faculty of Geosciences and Engineering, Southwest Jiaotong University(西南交通大学地球科学与工程学院)

AI总结 提出GACR框架,通过观测锚定残差流(OAR-Flow)将云去除重构为物理残差反演,结合地理上下文先验对齐(GCPA)保持语义结构,在六个数据集和十二个下游任务中验证了重建质量和下游精度提升。

Comments accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02440 2026-07-03 cs.AI cs.CL 新提交

EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments

EvoPolicyGym:评估交互环境中的自主策略进化

Zhilin Wang, Han Song, Runzhe Zhan, Jusen Du, Jiacheng Chen, Tianle Li, Qingyu Yin, Yulun Wu, Zhennan Shen, Tong Zhu, Yanshu Li, Guanjie Chen, Derek F. Wong, Yafu Li, Yu Cheng, Yang Yang

机构 * University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) University of Macau(澳门大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) Soochow University(苏州大学) Brown University(布朗大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出自主策略进化评估框架,通过EvoPolicyGym基准测试代理在固定交互预算下迭代改进策略的能力,GPT-5.5在16个环境中表现最优,并揭示预算分配与反馈转化机制。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02141 2026-07-03 cs.AI 新提交

A$^{2}$utoLPBench: An Auto-Generated, Agent-Friendly LP Benchmark via Inverse-KKT Construction

A$^{2}$utoLPBench:通过逆KKT构造自动生成的、智能体友好的线性规划基准

Shuo Ren, Yaohui Han, Yifan Shi, Libo Shen, Haodong Lu, Dongfang Wu, Rongliang Fu, Bei Yu, Tsung-Yi Ho

机构 * The Chinese University of Hong Kong(香港中文大学)

AI总结 提出A$^{2}$utoLPBench,一种通过逆KKT条件自动生成线性规划文本问题的基准,提供无限新问题、难度可控、答案正确且防数据泄露。

Comments 25 pages and 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01830 2026-07-03 cs.LG 新提交

Many Voices, One Reward: Multi-Role Rubric Generation for LLM Judging and Reward Modeling

众声归一:面向大模型评判与奖励建模的多角色评分标准生成

Dazhi Fu, Jiuding Yang, Yiwen Guo, Jicong Fan

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)数据科学学院) LIGHTSPEED Independent Researcher(独立研究员)

AI总结 提出多角色评分标准生成框架(MRRG),通过整合多个互补角色的评估标准,消除单一通用评估器的维度盲区,在偏好验证和强化学习奖励信号上均优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27965 2026-07-03 cs.CV 版本更新

ExFusion: Efficient Transformer Training via Multi-Experts Fusion

ExFusion:通过多专家融合实现高效的Transformer训练

Jiacheng Ruan, Daize Dong, Xiaoye Qu, Tong Zhu, Ting Liu, Yuzhuo Fu, Yu Cheng, Suncheng Xiang

机构 * School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) Soochow University(苏州大学) Chinese University of Hong Kong(香港中文大学) School of Biomedical Engineering, Shanghai Jiao Tong University(上海交通大学生物医学工程学院)

AI总结 ExFusion通过多专家融合提升Transformer训练效率,在保持性能的同时降低计算成本。

Comments Accepted by IEEE TMM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21402 2026-07-03 eess.AS cs.SD 版本更新

SemanticAudio: Audio Generation and Editing in Semantic Space

SemanticAudio: 语义空间中的音频生成与编辑

Zheqi Dai, Guangyan Zhang, Haolin He, Xiquan Li, Jingyu Li, Chunyat Wu, Yiwen Guo, Qiuqiang Kong

机构 * The Chinese University of Hong Kong(香港中文大学) LIGHTSPEED Shanghai Jiao Tong University(上海交通大学) Independent Researcher(独立研究者)

AI总结 提出SemanticAudio框架,通过两阶段流匹配架构在高级语义空间中进行音频生成和编辑,实现更好的语义对齐和无训练文本引导编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏