arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

共收录 373
2607.10840 2026-07-14 cs.CV 新提交

OmniX: Any-view and Any-time 4D Reconstruction via Feed-forward Trajectory Fields

OmniX:通过前馈轨迹场进行任意视角和任意时刻的4D重建

Yanqin Jiang, Tengfei Wang, Zhengwei Wang, Chenjie Cao, Junta Wu, Wenhan Luo, Weiming Hu, Jin Gao, Chunchao Guo

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯混元) HKUST(香港科技大学) Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(多模态信息超智能安全北京重点实验室) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院)

AI总结 针对前馈4D重建方法局限,提出OmniX框架,通过解耦动态运动建模与静态几何预测,利用动态令牌和3D运动结构生成轨迹场,并构建数据引擎和数据集,在多任务上取得领先性能。

Comments Accepted by ECCV 2026, project page: https://omnix4d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10800 2026-07-14 cs.CV 新提交

h-Flow: Flexible Flow-based Image Editing via Doob's h-Transform

h-Flow:通过杜布h变换实现基于灵活流的图像编辑

Zehui Guo, Zhen Wang, Junwei Shu, Yang Li, Changbo Wang, Long Chen

机构 * East China Normal University(华东师范大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出h-Flow,一个无需训练且基于理论的基于流的图像编辑框架。受杜布h变换启发,将图像编辑重述为条件生成,通过构建等效SDE扩展h变换,设计专用h函数并引入速度正交分解,实现有效、稳健且灵活的图像编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10538 2026-07-14 cs.HC cs.CV cs.CY 新提交

Navigating the Open-Source Model Ecosystem: An Empirical Study of Creator Practices in Artistic Image Generation

探索开源模型生态系统:艺术图像生成中创作者实践的实证研究

Yiluo Wei, Yupeng He, Qiming Ye, Gareth Tyson

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

AI总结 本文针对开源图像生成生态系统中创作者模型使用行为展开实证研究,构建含600万张图像及生成元数据的数据集,关联基础模型与LoRA模型使用情况,揭示其优劣势,公开数据集,为创作者和研究人员提供参考。

Comments Accepted to MM'26: The 34th ACM International Conference on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10437 2026-07-14 cs.RO 新提交

Interleaved POMDP Planning for Multi-Object Search in Unknown Multi-Room Household Environments

未知多房间家庭环境中多目标搜索的交错部分可观测马尔可夫决策过程规划

Ruochu Yang, Ziyi Xia, Huibo Zhang, Yatong Han, Yiming Zhao, Yingke Li, Fumin Zhang, Yorai Wardi, Mengxue Hou

机构 * Georgia Institute of Technology(佐治亚理工学院) The Hong Kong University of Science and Technology(香港科技大学) Ising AI(伊辛人工智能公司) MIT(麻省理工学院) Notre Dame University(圣母大学)

AI总结 研究未知多房间家庭环境下多目标搜索问题,提出Inter-POMDP算法,通过高级POUCT规划器与低级运动规划器相互作用,平衡规划质量与效率,相比基线方法减少碰撞、导航步数及检测次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10369 2026-07-14 cs.RO cs.AI 新提交

VINE: Taming Generative Control Policies for Reinforcement Learning

VINE:驯服强化学习中的生成控制策略

Rushuai Yang, Zhuo Han, Houlin Li, Hecheng Wang, Zhichao Wu, Rui Zhang, Zhaowei Zhang, Zihong Chen, Xiaohan Yan, Chiming Liu, Yi Chen, Wei Shan, Maoqing Yao

机构 * AgiBot(未知机构) The Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学)

AI总结 研究针对流匹配策略在值梯度强化学习中训练不稳定的问题,提出VINE方法。该方法通过在去噪步骤重建插值状态,创建稳定可微路径,实现稳定的端到端值梯度优化,在相关基准和任务中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10362 2026-07-14 cs.LG 新提交

A Control Theory of Predictability in Latent World Models

潜在世界模型中可预测性的控制理论

Hanzhe You, Yonggang Zhang, Maohao Ran, Zhiqin Yang, Zhenyuan Zhang, Wei Xue, Jun Song, Xinmei Tian, Yike Guo

机构 * University of Science and Technology of China(中国科学技术大学) The Hong Kong University of Science and Technology(香港科技大学) Hong Kong Baptist University(香港浸会大学)

AI总结 研究潜在世界模型中可预测性的控制理论,指出当前以预测误差为目标不可靠,重新定义目标为预测与真实计划成本的差异,证明规划器次优性受其限制,通过实验证实相关结论。

Comments Preprint about latent world models, Koopman operator and control theory, 33 pages, 1 figure. Main text about 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10298 2026-07-14 cs.CV 新提交

Structured Evidence Selection for Weakly Supervised Video Anomaly Detection

用于弱监督视频异常检测的结构化证据选择

Chenglizhao Chen, Tianxiang Nan, Wen Li, Xinyu Liu, Guisheng Zhang, Mengke Song, Xiaomin Yu

机构 * China University of Petroleum (East China)(中国石油大学(华东)) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 针对弱监督视频异常检测中难以准确定位异常事件及检测性能不稳定的问题,提出结构化证据选择框架SESAD,通过结构化推理、上下文条件选择抑制干扰,引入轻量级模块基于几何关系决策,实验证明其在多数据集上AUC高且效率稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10286 2026-07-14 cs.AI cs.MA 新提交

Can Agentic Trading Systems Pay for Their Own Intelligence?

智能交易系统能否为自身智能付费?

Qiqi Duan, Changlun Li, Chen Wang, Fan Zhang, Mengxiang Wang, Dayi Miao, Peixian Ma, Jiangpeng Yan, Liyuan Chen, Shuoling Liu, Preslav Nakov, Yuyu Luo, Nan Tang

机构 * HKUST(GZ)(香港科技大学(广州)) Paradoox AI(悖论人工智能公司) E Fund Management Co., Ltd(易方达基金管理有限公司) MBZUAI(Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)) The University of Tokyo(东京大学)

AI总结 研究基于LLM的交易系统中智能体能否为自身智能付费的问题,引入TradeLens工具包进行评估,通过多方面分析发现可行性取决于智能到利润的转化,不同模型有不同失败模式,重构了此类交易智能体的评估方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09693 2026-07-14 cs.LG cs.AI 新提交

Depth-Entropy Guided Sampling for Training-Free LLM Reasoning

用于无训练语言模型推理的深度熵引导采样

Zibin Meng, Peng Xie, Kani Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

AI总结 研究旨在提升无训练语言模型推理能力,提出深度熵引导采样(DEGS)方法,利用逐层熵坍缩作为质量信号,结合序列似然性与深度熵结构,在多个模型和基准测试中达到无训练最优精度,在域外和难题测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10295 2026-07-14 physics.optics cs.AI 新提交

Program-Synthesis-Driven Autodesign of Universal Unitary Operators

程序合成驱动的通用酉算子自动设计

Yifei Zhang, Dong Chen, Fan Wang, Wenrui Zhang, Yan Chen, Dingding Han, Jianmin Yuan, Xiangjin Kong, Yu-Gang Ma

机构 * Key Laboratory of Nuclear Physics and Ion-beam Application (MOE), Institute of Modern Physics, Fudan University, Shanghai 200433, China(核物理与离子束应用重点实验室(教育部),现代物理研究所,复旦大学,上海200433,中国) Research Center for Theoretical Nuclear Physics, NSFC and Fudan University, Shanghai 200438, China(理论核物理研究中心,国家自然科学基金委员会和复旦大学,上海200438,中国) Huawei Technologies Co., Ltd, Beijing 100095, China(华为技术有限公司,北京100095,中国) Department of Industrial Engineering and Decision Analytics, Hong Kong University of Science and Technology, HongKong, China(工业工程与决策分析系,香港科技大学,香港,中国) Hunan Key Laboratory of Mechanism and Technology of Quantum Information, Changsha 410073, China(湖南量子信息机制与技术重点实验室,长沙410073,中国) School of Information Science and Technology, Fudan University, Shanghai 200433, China(信息科学与技术学院,复旦大学,上海200433,中国) Research Institute of Intelligent Complex Systems, Fudan University, Shanghai 200433, China(智能复杂系统研究所,复旦大学,上海200433,中国) Institute of Atomic and Molecular Physics, Jilin University, Changchun 130012, China(原子与分子物理研究所,吉林大学,长春130012,中国) School of Physics, East China Normal University, Shanghai 200062, China(物理学院,华东师范大学,上海200062,中国)

AI总结 研究利用人工智能驱动的程序合成,通过扩展DreamCoder到复值线性代数,发现光子网络中酉矩阵分解策略,其生成的程序编码与维度无关的不变量及构造规则,还能利用矩阵结构减少干涉仪数量,为酉算子自动设计提供可扩展范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09225 2026-07-13 cs.CV 新提交

Glob3R: Global Structure-from-Motion with 3D Foundation Models

Glob3R:基于3D基础模型的全局运动恢复结构

Junyuan Deng, Heng Li, Kejie Qiu, Lingteng Qiu, Rui Peng, Weichao Shen, Weihao Yuan, Siyu Zhu, Zilong Dong, Ping Tan

机构 * The Hong Kong University of Science and Technology(香港科技大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) Nanjing University(南京大学) Fudan University(复旦大学)

AI总结 研究针对3D基础模型重建结果不准确及处理长序列或大图像集有缺陷的问题,提出Glob3R方法,通过增强主干、转换扭曲为特征轨迹、引入关联策略及进行全局优化等,实现强大准确重建,提升神经渲染质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08804 2026-07-13 cs.GR cs.RO 新提交

Programming-by-Example for Batch-Editing Collision Meshes in 3D Software

3D软件中用于批量编辑碰撞网格的示例编程

Gengyang Xu, Dongwei Xiao, Hengcheng Zhu, Yiteng Peng, Wei Meng, Shuai Wang, Shing-Chi Cheung

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 针对3D软件中碰撞网格编辑难题,提出神经符号程序合成方法,将任务转化为例程编程问题,通过MeshForge工具实现,在6 hundred个碰撞网格的24个任务中评估,成功合成多数任务,平均所需演示次数和合成时间较少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09632 2026-07-13 quant-ph cs.AI 新提交

Lean-QIT: Towards a Formal Infrastructure for Quantum Information Theory

Lean-QIT:迈向量子信息理论的形式化基础设施

Chengkai Zhu, Ziao Tang, Guocheng Zhen, Yimeng Cao, Yusheng Zhao, Ranyiliu Chen, Xuanqiang Zhao, Lei Zhang, Xin Wang

机构 * QudeLeap Research(QudeLeap研究院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Quantum Science Center of Guangdong-Hong Kong-Macao Greater Bay Area(粤港澳大湾区量子科学中心) The University of Hong Kong(香港大学)

AI总结 研究旨在为量子信息理论构建形式化基础设施,通过Lean 4库LeanQIT提供相关接口,将多个重要定理形式化,分离操作定义与解析表征,为形式化QIT及相关推理提供基础和知识底物。

Comments 24+5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08766 2026-07-10 cs.CV 新提交

OPSD-V: On-Policy Self-Distillation for Post-Training Few-Step Autoregressive Video Generators

OPSD-V:用于训练后少步自回归视频生成器的策略内自蒸馏

Hongyu Liu, Chun Wang, Feng Gao, Xuanhua He, Yue Ma, Ziyu Wan, Yong Zhang, Xiaoming Wei, Qifeng Chen

机构 * Meituan(美团) HKUST(香港科技大学) City University of Hong Kong(香港城市大学)

AI总结 研究针对训练后少步自回归视频生成器存在的问题,提出OPSD-V策略内自蒸馏范式。通过引入真实长视频数据提供监督,学生和教师模型按特定方式运行,应用该范式于相关模型后,实验及用户研究表明其在多方面有改进且更受青睐。

Comments Project page: https://meigen-ai.github.io/OPSD-V ; Code: https://github.com/MeiGen-AI/OPSD-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08572 2026-07-10 cs.CV 新提交

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning

Switch-Reasoner:通过强化学习在多任务混合中学习何时思考

Yiyang Fang, Pei Fu, Jinjie Li, Jian Liang, Wenke Huang, Ruijie Luo, Shaojie Zhang, Jian Luan, Yi R. Fung, Mang Ye

机构 * Wuhan University(武汉大学) Xiaomi Inc(小米公司) Wuhan University of Technology(武汉理工大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 研究针对多模态大语言模型在异构多任务中“先思考后回答”范式的低效及训练后学习何时思考不稳定的问题,提出基于GRPO的Switch-Reasoner框架,通过双层调节机制实现推理模式自适应选择,实验验证其能减少不必要推理并平衡准确率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08427 2026-07-10 cs.AR cs.LG 新提交

FPGN: Redefining Ultra-Fast Programmable Gate-based Neural Acceleration with Differentiable LUTs

FPGN:用可微查找表重新定义基于超快速可编程门的神经加速

Jiawei Liang, Haotong Qin, Linfeng Du, Xingyu Liu, Shangkun Li, Hui Yu, Michele Magno, Xinyu Chen, Jiang Xu, Wei Zhang

机构 * HKUST(香港科技大学) ETH Zurich(苏黎世联邦理工学院) HKUST (GZ)(香港科技大学(广州))

AI总结 研究旨在实现DNN纳秒级推理延迟,针对传统FPGA加速器局限,提出FPGN框架。通过硬件对齐可微公式、结构化拓扑和延迟驱动编译器,弥合差距。实验表明其相比其他加速器延迟降低205倍,LUT效率高30倍,且推理精度有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08403 2026-07-10 cs.AI 新提交

Game Theory Driven Multi-Agent Framework Mitigates Language Model Hallucination

博弈论驱动的多智能体框架减轻语言模型幻觉

Runzhe Liu, Biquan Bie, Zihao Wang, Yuchao Ma, Yexin Liu, Xinghai Li, Harry Yang, Wenbo Yang, Jinzhe Cao, Shengyang Tao

机构 * Dalian University of Technology(大连理工大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 研究针对轻量级大语言模型在科学领域应用受限问题,提出基于博弈论的G-Frame多智能体框架,经结构化推理合成语料库训练出OmniChem模型,性能与GPT 4o mini相当且幻觉大幅减少,为科学领域知识发现提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08393 2026-07-10 cs.AI cs.CL 新提交

Towards Mechanistically Understanding Why Memorized Knowledge Fails to Generalize in Large Language Model Finetuning

迈向对大语言模型微调中记忆知识无法泛化原因的机理理解

Lu Dai, Ziyang Rao, Yili Wang, Hanqing Wang, Hao Liu, Hui Xiong

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学)

AI总结 研究大语言模型微调中记忆知识无法泛化的问题,用自修补技术监测知识渗透动态,发现与知识电路未对准假设一致,还设计启发式策略验证,跨域实验证明发现具稳健性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08337 2026-07-10 cs.LG stat.ML 新提交

AutoAnchor: Stable Diffusion Unlearning Using Cross-Attention as a Manifold Surrogate

AutoAnchor:以交叉注意力作为流形替代的稳定扩散去学习

Siyuan Wen, Jiahao Zeng, Ningning Ding

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 研究文本到图像模型中扩散去学习的不稳定问题,提出AutoAnchor两阶段框架,利用交叉注意力一致性损失自动合成流形近端锚点,有效实现稳健无偏去学习,提升目标概念去除率和非目标效用,还可集成到现有方法中提高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08124 2026-07-10 cs.SE cs.LG 新提交

TTHE: Test-Time Harness Evolution

测试时工具演化

Jun Nie, Yonggang Zhang, Jun Song, Qianshu Cai, Dahai Yu, Yike Guo, Xinmei Tian, Bo Han

机构 * Hong Kong Baptist University(香港 Baptist 大学) University of Science and Technology of China(中国科学技术大学) Hong Kong Generative AI Research & Development Center, The Hong Kong University of Science and Technology(香港生成式人工智能研究与开发中心,香港科技大学) TCL Corporate Research (HK) Co., Ltd(TCL 企业研究(香港)有限公司)

AI总结 研究LLM智能体测试时工具优化问题,提出TTHE方法,通过维护候选工具种群,基于执行轨迹推理优化,无需黄金标签或特定任务监督,在多任务实验中改进基线工具,将测试时适应重塑为程序演化并确定代理可靠性挑战。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06553 2026-07-10 cs.CV 新提交

From RGB Generation to Dense Field Readout: Pixel-Space Dense Prediction with Text-to-Image Models

从 RGB 生成到密集场读出:使用文本到图像模型进行像素空间密集预测

Zanyi Wang, Xin Lin, Haodong Li, Dengyang Jiang, Yijiang Li

机构 * UCSD(加州大学圣地亚哥分校) HKUST(香港科技大学)

AI总结 研究利用文本到图像模型进行像素空间密集预测,提出ReChannel方法,保留DiT输入分布的VAE编码器,去掉目标侧解码器,用任务LoRA调整,通过线性头映射令牌到像素空间补丁,在多个密集预测任务上表现出色,比对比方法更准确快速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07209 2026-07-09 cs.CR cs.LG 新提交

Continual Learning With Participation Privacy: An Auditable Buffering-Aggregation Recipe

具有参与隐私的持续学习:一种可审计的缓冲聚合方法

T-H. Hubert Chan, Elaine Shi, Mengshi Zhao, Mingxun Zhou

机构 * The University of Hong Kong(香港大学) Carnegie Mellon University(卡内基梅隆大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 研究单编辑相邻用户流的持续学习隐私问题,提出模块化方法,用随机缓冲包装器处理,证明认证定理,使标准原语产生轨迹级差分隐私,建立隐私与延迟联系。

Comments This version corrects and clarifies the independent-decomposability condition underlying the adaptive-safety result in the ICML 2026 paper, with corresponding revisions to the affected statements and proofs

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07139 2026-07-09 cs.RO 新提交

Disturbance-aware Motion Planning for Over-actuated Underwater Vehicles Exploiting Actuation Redundancy for High-fidelity 3D Reconstruction

利用驱动冗余进行高保真 3D 重建的过驱动水下航行器的干扰感知运动规划

Yuer Gao, Tongqing Xu, Qingyang Liu, Yi Cai

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 研究水下机器人驱动对感知的影响,利用过驱动平台冗余,通过搜索零空间最小化目标区域干扰,采用基于致动盘理论的尾流代理及冗余解决分配器,降低粒子速度,提高 3D 重建精度,支持自主扫描与辅助检查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06619 2026-07-09 cs.AR cs.LG 新提交

HiFuzz: Hierarchical Reinforcement Learning for Semantic-Aware and Adaptive CPU Fuzzing

HiFuzz:用于语义感知和自适应CPU模糊测试的分层强化学习

Ya Wang, Hanwei Fan, Zhenguo Liu, Xiaofeng Zhou, Yangdi Lyu, Jiang Xu, Wei Zhang

机构 * Hong Kong University of Science and Technology (HKUST), Hong Kong(香港科技大学)

AI总结 针对传统变异模糊测试在处理器验证中效率低的问题,提出HiFuzz框架,采用分层强化学习及结构化生成过程,集成自适应机制与编码器,经实验验证,该框架在覆盖率和漏洞检测上显著优于现有工具。

Comments Accepted by the 2026 IEEE International Test Conference (ITC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04434 2026-07-09 cs.RO cs.AI cs.CV cs.GR 新提交

RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies

RoboDojo:用于综合评估通用机器人操作策略的统一模拟与现实基准测试

Tianxing Chen, Yue Chen, Zixuan Li, Junyuan Tang, Kailun Su, Haoran Lu, Weijie Wan, Baijun Chen, Songling Liu, Haowen Yan, Honghao Su, Zhiyang Dou, Kaixuan Wang, Dandan Zhang, Yunze Liu, Yan Qin, Qiwei Liang, Qiwei Wu, Zijian Lin, Wenwei Lin, Yuran Wang, Minghua He, Tianshu Wu, Ruihai Wu, Jingquan Zhou, Kai-Chong Lei, Haibao Yu, Yuanfeng Ji, Weiyang Jin, Guanyu Lin, Xiaofan Li, Qi Xiong, Renjing Xu, Zhongyu Li, Wenhao Chai, Enze Xie, Ziwei Wang, Yao Mu, Hao Dong, Wojciech Matusik, Mingyu Ding, Wenbo Ding, Ping Luo, Masayoshi Tomizuka

机构 * UC Berkeley(加州大学伯克利分校) THU(清华大学) PKU(北京大学) Stanford(斯坦福大学) MIT(麻省理工学院) UNC(北卡罗来纳大学) Princeton(普林斯顿大学) CMU(卡内基梅隆大学) NUS(新加坡国立大学) NTU(南洋理工大学) CUHK(香港中文大学) SJTU(上海交通大学) HKUST (GZ)(香港科技大学(广州)) ZJU(浙江大学) Yale(耶鲁大学)

AI总结 现有基准测试在系统评估通用机器人操作策略能力方面有限,本文引入RoboDojo统一基准测试,含模拟与现实任务,支持多维度评估及可扩展评估,还建立了公共排行榜与系统分析。

Comments Website: https://robodojo-benchmark.com/, Code: https://github.com/RoboDojo-Benchmark/RoboDojo, Leaderboard: https://robodojo-benchmark.com/leaderboard

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06442 2026-07-08 cs.RO 新提交

SIEVE: Structure-Aware Data Selection for Imitation Learning with VLA Models

SIEVE:用于基于VLA模型的模仿学习的结构感知数据选择

Changti Wu, Bin Yu, Zhaolong Shen, Shijie Lian, Xiaopeng Lin, Cong Huang, Zhirui Zhang, Lei Zhang, Kai Chen

机构 * East China Normal University(东华师范大学) Zhongguancun Academy(中关村学院) Harbin Institute of Technology(哈尔滨工业大学) Beihang University(北航大学) Huazhong University of Science and Technology(华中科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) DeepCybo Training Demonstrations Policy Execution(深科博培训演示政策执行)

AI总结 研究针对VLA模型模仿学习中数据冗余等问题,提出结构感知数据选择方法SIEVE。该方法将演示视为原语和接口组合,通过发现原语、分配预算和选择轨迹来选数据,实验证明其优于基线,能在少数据少步骤下超越全数据训练。

Comments The code is available at \href{https://github.com/ChangtiWu/SIEVE}{SIEVE}

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06349 2026-07-08 cs.AI 新提交

TopoBrick: Agentic Topology Sampling of Exogenous Variables for Zero-Shot Building IoT Forecasting

TopoBrick:用于零样本建筑物联网预测的外源变量的智能拓扑采样

Xiachong Lin, Du Yin, Arian Prabowo, Hao Xue, Wen Hu, Imran Razzak, Matthew Amos, Sam Behrens, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) MBZUAI(穆罕默德·本·扎耶德人工智能大学) CSIRO Energy Centre(联邦科学与工业研究组织能源中心)

AI总结 针对建筑物联网预测中现有方法的不足,提出无训练框架TopoBrick,利用建筑知识图和智能拓扑采样器选择外源变量,按部署时间可用性组织,在三座真实建筑实验中性能出色,拓扑感知采样更可靠。

Comments 12 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06306 2026-07-08 cs.SE cs.AI cs.CV 新提交

UI2App: Benchmarking Visual Interaction Inference in Executable Web Application Generation

UI2App:可执行Web应用程序生成中视觉交互推理的基准测试

Grace Man Chen, Litao Guo, Yifan Wu, Yiyu Chen, Yenchi Tseng, Sicheng Liu, Yuyu Luo, Ying-Cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 研究针对现有网页生成基准测试对交互能力评估不足的问题,引入UI2App基准测试,通过设计端到端管道沿四个维度评估工件,实验发现视觉与交互能力不匹配,复杂交互是瓶颈,为相关研究提供了参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06283 2026-07-08 cs.AI 新提交

Task Decomposition-Guided Reranking for Adaptive Agent Skill Retrieval

用于自适应智能体技能检索的任务分解引导重排序

Yanping Chen, Weijie Shi, Wen Yang, Jiajie Xu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 针对技能库规模增长带来的技能选择挑战,提出SkillReranker框架,通过任务和技能语义分解构建执行图,利用交叉编码器评分,在多场景实验中有效提升任务性能、减少交互步骤并降低令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06222 2026-07-08 cs.RO 新提交

APVI-SLAM: Real-Time Acoustic-Pressure-Visual-Inertial Localization and Photorealistic Mapping System in Complex Underwater Environment

APVI-SLAM:复杂水下环境中的实时声压视觉惯性定位与真实感映射系统

Hanwen Zhang, Yipeng Zhu, Xiaopeng Guo, Huajian Huang, Sai-Kit Yeung

机构 * Hong Kong University of Science and Technology(香港科技大学) Beijing Institute of Technology(北京理工大学)

AI总结 针对水下视觉惯性SLAM在极端环境中的问题,提出APVI-SLAM系统,通过可靠性感知定位框架和滑动窗口冻结策略增强鲁棒性,用四叉树引导映射模块助力重建,还贡献数据集,实验证明其实现了实时领先的定位与重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏