arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-08-18 至 2026-08-18 共收录 13
2608.16885 2026-08-18 cs.RO 新提交

$τ_0$-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation

$τ_0$-VLA:一种具有世界模型引导测试时计算能力的分层机器人基础模型

Xiaowei Cai, Yunuo Cai, Bingao Chen, Jingxiao Chen, Zhi Chen, Siyuan Feng, Tengyu Hou, Jingshun Huang, Han Jiang, Runkun Ju, Dong Li, Mingxiang Li, Shaowei Li, Xinchen Li, Yifan Li, Yi Liu, Zhongyuan Liu, Jianlan Luo, Junwen Miao, Ruiqi Ni, Buqing Nie, Mingjie Pan, Xinlin Ren, Jianheng Song, Jiaxu Wang, Peiqi Wang, Sen Wang, Xiaoyan Wang, Dafeng Wei, Dongming Wu, Pengwei Xie, Pu Yang, Hangjian Ye, Xiangyu Yue, Jinyu Zhang, Qinglin Zhang, Xueyong Zhao, Pengfei Zhou, Yue Zhou

机构 * Shanghai Innovation Institute(上海创新研究院) Agibot Finch(智元 Finch(智元鹦鹉)) The Chinese University of Hong Kong(香港中文大学)

AI总结 $τ_0$-VLA是一种分层机器人基础模型,通过世界模型引导的测试时计算分配额外资源优化子任务生成,经40115小时异构真实数据训练后,可提升长时程机器人操作的闭环成功率。

Comments 18 pages, 5 figures. Project page: this https URL (https://tau0-vla.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16721 2026-08-18 cs.CV 新提交

GenRouter: Unified Workflow Routing for Agentic Image Generation

GenRouter:面向智能体图像生成的统一工作流路由

Harold Haodong Chen, Zhiyu Hou, Wen-Jie Shu, Weilin Ruan, Yingjie Xu, Litao Guo, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) SUSTech(南方科技大学) ZODA CUHK(香港中文大学)

AI总结 GenRouter是首个智能体图像生成的统一工作流路由框架,通过需求分析、经验匹配、帕累托过滤实现自适应路由,可大幅降低计算开销与延迟并提升视觉对齐效果。

Comments Code: this https URL (https://github.com/EnVision-Research/GenRouter)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16270 2026-08-18 cs.LG 新提交

Efficient Coreset Selection via K-Nearest Neighbor Graphs

基于K近邻图的高效核心集选择

Yingfan Liu, Leiyu Zhang, Jiadong Xie, Mingzhe Wang, Jeffrey Xu Yu, Jiangtao Cui

机构 * Xidian University(西安电子科技大学) Hangzhou Institute, Xidian University(西安电子科技大学杭州研究院) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出基于K近邻图的KNNG-CS核心集选择方法,在保持与梯度近似核心集方法相当精度的同时,大幅降低了选择时间与峰值内存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16100 2026-08-18 cs.CV cs.NI 新提交

TISC: A Text-Driven Image Semantic Communication System for Faithful Reconstruction

TISC:用于忠实重建的文本驱动图像语义通信系统

Feifan Zhang, Yuyang Du, Xiaoyan Liu, Soung Chang Liew

机构 * The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出文本驱动图像语义通信框架TISC,通过树结构属性语义提取(TSASE)和初始噪声优化(INO)机制解决现有方法的语义损失与重建忠实度不足问题,经多数据集实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15812 2026-08-18 cs.CV 新提交

From Generation to Matching: A Development Report on Personalized Chinese Handwriting

从生成到匹配:个性化中文手写体的开发报告

Yiwei Liu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 该项目最初尝试个性化中文手写体生成,后转为逐字符匹配,所建系统可生成接近用户真实手写体的稳定实用类B质量内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15304 2026-08-18 cs.AI 新提交

Understanding Cognition-Induced Risks in Agentic AI Systems

理解智能体AI系统中认知引发的风险

Guanchu Wang, Qinuo Li, Mengnan Du, Xia Hu, Bowen Zhou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学)

AI总结 该研究针对由LLM驱动的智能体AI系统,基于物理、社会、自我指涉认知的三级框架分析其引发的风险,提出策略以增强系统可控性,保障长期安全发展。

Comments This paper has been accepted by IEEE Intelligent Systems, which can be accessed at this https URL (https://doi.ieeecomputersociety.org/10.1109/MIS.2026.3721766). The DOI is https://doi.org/10.1109/MIS.2026.3721766

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15085 2026-08-18 cs.CL 新提交

Why Vision Fails as a Universal Bridge: Rectifying Modality Asynchrony in Multilingual MLLMs

为何视觉无法作为通用桥梁:修正多语言多模态大语言模型(MLLMs)中的模态异步性

Yihang Du, Juhao Liang, Zhengzhao Lai, Siyu Li, Yan Hu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) National Health Data Institute (Shenzhen)(国家健康数据研究院(深圳))

AI总结 针对多语言MLLMs在非英语视觉推理中的性能下降问题,该研究发现其源于“幽灵锚点”模态异步性,提出ANCHOR训练框架,经实验验证可提升跨语言视觉推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14721 2026-08-18 cs.CV 新提交

AeroGround: A Comprehensive Benchmark for Aerial-Ground Collaborative Reasoning

AeroGround:用于空-地协同推理的综合基准

Shenghong Yi, Lin Zhang, Muzian Li, Jiakang Yuan, Haoyu Zhang, Peng Ye, Jiayuan Fan, Huafeng Qin, Tao Chen

机构 * Shanghai Innovation Institute(上海创新研究院) College of Future Information Technology, Fudan University(复旦大学未来信息技术学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Chongqing Technology and Business University(重庆工商大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出AeroGround基准,针对现有VLMs在空-地协同场景推理能力的研究空白,构建含29000组多模态观测与2250个问答实例的数据集,实验发现模型与人类表现差距显著,为相关系统开发提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14718 2026-08-18 cs.CV cs.CL 新提交

VideoGAIA: A Benchmark for General AI Assistants on Agentic Video Understanding

VideoGAIA:面向通用人工智能助手的智能体视频理解基准

Fan Zhang, Guangming Yao, Jinyang Wu, Hao Wu, Zheng Lian, Xinyu Geng, Jingdong Chen, Yi Yuan, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Tongji University(同济大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 VideoGAIA是面向通用AI助手的智能体视频理解基准,构建多轮工具增强交互任务,现有MLLMs在其上准确率不足60%,可评估下一代模型并推动相关转型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16760 2026-08-18 cs.LG math.OC 新提交

On the Principles Behind Neural Network Optimizers

神经网络优化器背后的原理

Yushun Zhang

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院)

AI总结 本论文为优化器Adam建立了有原则的基础,通过海森矩阵结构分析其在Transformer上优于SGD的原因,提出内存减半且性能不变的新优化器Adam-mini,还为其他NN优化器提供了新见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04419 2026-08-18 cs.LG cs.AI 版本更新

SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation

SPOT:面向在线策略蒸馏的稀疏探测与结果校准

Zikun Qu, Min Zhang, Mingze Kong, Zhiwei Shang, Zhengyu Chen, Yikun Ban, Shuang Qiu, Zhongxiang Dai

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) East China Normal University(华东师范大学) Beihang University(北京航空航天大学) City University of Hong Kong(香港城市大学)

AI总结 该研究针对在线策略蒸馏的缺陷,提出SPOT方法,通过获取-探索-利用程序优化探测与蒸馏,经多模型多基准实验验证,可提升推理性能并平衡解的质量与覆盖范围。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08759 2026-08-18 cs.CV cs.RO 版本更新

Dissecting Embodied Abilities in Multimodal Language Models through Skill-level Evaluation and Diagnosis

通过技能级评估与诊断解构多模态语言模型的具身能力

Yu Qi, Haibo Zhao, Ziyu Guo, Siyuan Ma, Ziyan Chen, Yaokun Han, Renrui Zhang, Zitiantao Lin, Yizhe Zhu, Shiji Xin, Yijian Huang, Boce Hu, Kai Cheng, Peiheng Wang, Jiazheng Liu, Jiayi Zhang, Yizhe Zhu, Wenqing Wang, Yiran Qin, Haojie Huang, Lawson L.S. Wong

机构 * Northeastern University, Boston, MA, USA The Chinese University of Hong Kong, Hong Kong, China Peking University, Beijing, China Westlake University, Hangzhou, China Harvard University, Cambridge, MA, USA Purdue University, West Lafayette, IN, USA University of Oxford, Oxford, United Kingdom

AI总结 本文提出BEAR基准,通过分解具身任务为14个原子技能进行细粒度评估,发现感知能力是推理失败的主要瓶颈,并提出BEAR-Agent多模态对话代理,显著提升具身技能性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20253 2026-08-18 physics.comp-ph cs.AI cs.DC cs.LG 版本更新

SimulCost: A Cost-Aware Benchmark and Toolkit for Automating Physics Simulations with LLMs

SimulCost: 一个用于自动化物理模拟的代价感知基准与工具包

Yadi Cao, Sicheng Lai, Jiahe Huang, Yang Zhang, Zach Lawrence, Rohan Bhakta, Izzy F. Thomas, Mingyun Cao, Chung-Hao Tsai, Zihao Zhou, Yidong Zhao, Hao Liu, Alessandro Marinoni, Alexey Arefiev, Rose Yu

机构 * University of California San Diego(加州大学圣地亚哥分校) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学) University of California, Los Angeles(加州大学洛杉矶分校) California Institute of Technology(加州理工学院) ETH Zurich(苏黎世联邦理工学院)

AI总结 针对现有LLM评估忽略工具使用代价的问题,提出SimulCost基准,通过单轮和多轮参数调优任务比较LLM与传统扫描方法在准确性和计算代价上的表现,发现LLM在高精度任务中初始猜测不可靠且多轮模式效率更低。

Comments post conference revision version at ICML; update: removed CGYRO due to bug in cases search. Will add back soon; Make the title consistent w/ pdf

详情

展开后加载摘要…

URL PDF HTML 收藏