arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The University of Hong Kong(香港大学)

共收录 193
2607.14681 2026-07-17 cs.CV 新提交

ReBind: Multi-Reference Video Editing via Structured Instructions with Explicit Reference Relationships

ReBind:通过具有显式参考关系的结构化指令进行多参考视频编辑

Xinyu Liu, Shihao Li, Weihong Lin, Xinlong Chen, Yang Shi, Yujin Han, Yiyang Cai, Yanghao Wang, Ruibin Yuan, Yuanxing Zhang, Pengfei Wan, Wenhan Luo, Yike Guo

机构 * HKUST(香港科技大学) Kling Team(克林团队) NJU(南京大学) UCAS(中国科学院大学) PKU(北京大学) HKU(香港大学)

AI总结 研究针对多参考图像条件视频编辑中现有方法难以协调多视觉源信息的问题,提出ReBind框架,通过带嵌入参考令牌的语义指令及两阶段渐进方案学习建立显式绑定,实现轻量级适配,在指令质量和性能上表现出色。

Comments Project Page: https://rebind-mrv2v.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13539 2026-07-16 cs.CV cs.GR 新提交

ThinkBLOX: 3D Indoor Scene Generation with Progressive Reasoning

ThinkBLOX:基于渐进推理的3D室内场景生成

Yuan Xiao, Can Wang, Xiangyu Kong, Jing Liao

机构 * City University of Hong Kong(香港城市大学) University of Hong Kong(香港大学) Beijing Information Science and Technology University(北京信息科技大学)

AI总结 研究针对传统与现有3D室内场景生成方法不足,提出基于VLM的渐进推理框架ThinkBLOX,构建数据集并采用监督微调与新强化学习方案,在多方面优于基线,支持多样3D场景应用。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13455 2026-07-16 cs.RO 新提交

Reverse to Advance: Teleoperation-Cost Effective Hard Policy Learning from Reversed Easy Tasks

逆向推进:从逆向简单任务中进行遥操作成本有效的硬策略学习

Qiyuan Qiao, Ge Yuan, Can Wang, Dong Xu

机构 * The University of Hong Kong(香港大学)

AI总结 研究针对高质量遥操作数据集收集成本高的问题,提出通过逆向简单任务进行硬策略学习的框架,含闭环数据收集、分层数据细化和迭代策略学习方法,经实验验证该方法能高效稳定地训练复杂操作任务,提升硬任务成功率。

Comments 17 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12764 2026-07-15 cs.CV 新提交

EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrieval

EvoGraph-R1:用于智能检索的自进化多模态知识超图

Jiashi Lin, Changhong Jiang, Xiangru Lin, Ruifei Zhang, Xinyi Zhu, Jiyao Liu, Cheng Tang, Ye Du, Shujian Gao, Junzhi Ning, Lihao Liu, Ziyan Huang, Tianbin Li, Jin Ye, Junjun He

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Monash University(莫纳什大学) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

AI总结 研究针对现有GraphRAG方法将知识图视为静态数据结构的局限,提出EvoGraph-R1自进化框架,把检索建模为MDP,智能体通过多种操作使超图结构进化以支持多跳推理,实验证明该方法在多模态问答基准测试中大幅优于现有基线。

Comments 10 pages main paper, 6 figures. CVPR 2026 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12398 2026-07-15 cs.CV cs.RO 新提交

Seeing Globally, Refining Locally: Global Visual Guidance and Local Ultrasound Cues for Robust Freehand 3-D Ultrasound Reconstruction

全局观察,局部细化:用于稳健徒手三维超声重建的全局视觉引导和局部超声线索

Yameng Zhang, Zhongyu Chen, Dianye Huang, Xiangyu Chu, K. W. Samuel Au, Zhongliang Jiang

机构 * Department of Mechanical Engineering, The University of Hong Kong(香港大学机械工程系) Multi-Scale Medical Robotics Center(多尺度医疗机器人中心) Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(香港中文大学机械与自动化工程系)

AI总结 研究针对徒手三维超声重建中探头姿态估计易累积误差问题,提出全局到局部姿态估计框架,利用双相机分支和B模式分支及跨模态融合模块,经多尺度姿态损失约束,在数据集和体内实验中有效降低轨迹漂移,提升重建效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12372 2026-07-15 cs.CV 新提交

UMSS: Towards Unsupervised Multi-modal Semantic Segmentation

UMSS:迈向无监督多模态语义分割

Haitian Zhang, Thai Duy Nguyen, Xiangyuan Wang, Mohan Liu, Lin Wang

机构 * EmPACT Lab, School of EEE, Nanyang Technological University(电气与电子工程学院电磁脉冲与天线研究室,南洋理工大学) The University of Hong Kong(香港大学)

AI总结 本文针对无监督多模态语义分割问题,提出基于DINOv3的UniM2框架,通过跨模态对应协同学习统一潜在空间提取语义线索,并引入跨模态协调器缓解冲突,实验证明该框架相比现有框架有明显优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11886 2026-07-14 cs.CV 新提交

Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation

读回:预训练的多模态语言模型是文本到图像生成的零样本奖励模型

Runhui Huang, Qihui Zhang, Zhe Liu, Yu Gao, Jie Wu, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) ByteDance Seed(字节跳动Seed) Peking University(北京大学)

AI总结 研究提出SpectraReward将预训练多模态语言模型转为图像生成强化学习奖励模型,用图像条件提示对数似然作奖励,还引入Self-SpectraReward形成闭环框架。经广泛实验验证,二者能提升生成性能,表明奖励-策略对齐是关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10681 2026-07-14 cs.LG cs.NE 新提交

LayerNorm as Implicit Gain Control in Looped Transformers

层归一化在循环变压器中作为隐式增益控制

Matthias M. M. Buehlmaier

机构 * Faculty of Business and Economics, The University of Hong Kong(香港大学经管学院)

AI总结 研究预层归一化循环变压器中层归一化作用,指出其为隐式增益控制,分析稳定性预算及进位约束,通过六个任务实验表明线性进位非深度记忆机制,刻画该说法边界,结果经解析得出并在CPU规模实现中验证。

Comments 23 pages, 6 figures, 13 tables. Code available at https://github.com/clojure-finance/mythjure/tree/paper-v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10589 2026-07-14 stat.ML cs.IT cs.LG cs.NA math.IT math.NA 新提交

Approximation of Analytic Functions by ReLU Neural Networks with Adjustable Depth and Width

具有可调深度和宽度的ReLU神经网络对解析函数的逼近

Yanming Lai, Defeng Sun, Yang Wang

机构 * Department of Mathematics, The University of Hong Kong(香港大学数学系)

AI总结 本文研究通过ReLU网络在$(N,L)$表征下对解析函数的逼近,推导了$\mathcal{O}\left(N^{-C L^{\tau}}\right)$的逼近率,揭示解析函数逼近中深度比宽度更关键,通过精细构造网络克服光滑度与精度权衡的技术难点。

Comments 47 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09488 2026-07-13 cs.CV 新提交

SigLIP-HD by Fine-to-Coarse Supervision

通过从细到粗的监督实现SigLIP-HD

Lihe Yang, Zhen Zhao, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 研究如何在低成本下实现精细视觉感知,提出SigLIP-HD,采用从细到粗监督设计,基于SigLIP 2模型构建,在相同推理预算下能产生更好视觉令牌,在多基准测试中结果优于基线模型。

Comments ICLR 2026. Code and model: https://github.com/LiheYoung/SigLIP-HD

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09632 2026-07-13 quant-ph cs.AI 新提交

Lean-QIT: Towards a Formal Infrastructure for Quantum Information Theory

Lean-QIT:迈向量子信息理论的形式化基础设施

Chengkai Zhu, Ziao Tang, Guocheng Zhen, Yimeng Cao, Yusheng Zhao, Ranyiliu Chen, Xuanqiang Zhao, Lei Zhang, Xin Wang

机构 * QudeLeap Research(QudeLeap研究院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Quantum Science Center of Guangdong-Hong Kong-Macao Greater Bay Area(粤港澳大湾区量子科学中心) The University of Hong Kong(香港大学)

AI总结 研究旨在为量子信息理论构建形式化基础设施,通过Lean 4库LeanQIT提供相关接口,将多个重要定理形式化,分离操作定义与解析表征,为形式化QIT及相关推理提供基础和知识底物。

Comments 24+5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08768 2026-07-10 cs.CL 新提交

UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks

UniClawBench:面向实际任务中主动智能体的通用基准测试

Zhekai Chen, Chengqi Duan, Kaiyue Sun, Bohao Li, Yuqing Wang, Manyuan Zhang, Xihui Liu

机构 * HKU MMLab(香港大学多媒体实验室) Meituan(美团)

AI总结 针对现有基准测试难以评估主动智能体的问题,提出UniClawBench,基于五项基础模型能力设计400个双语现实任务,采用实时评估和闭环评估策略,通过多模型框架对比展示基础模型能力和框架设计对性能的影响,还公开了基准测试和代码。

Comments Project Page: https://uniclawbench.github.io | GitHub Repo: https://github.com/HKU-MMLab/UniClawBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08751 2026-07-10 cs.RO 新提交

DexVerse: A Modular Benchmark for Multi-Task, Multi-Embodiment Dexterous Manipulation

DexVerse:用于多任务、多实体灵巧操作的模块化基准测试

Yunchao Yao, Zhuxiu Xu, Tianqi Zhang, Zixian Liu, Sikai Li, Zhenyu Wei, Feng Chen, Dihong Huang, Kechang Wan, Chenyang Ma, Shuqi Zhao, Shenghua Gao, Masayoshi Tomizuka, Yi Ma, Mingyu Ding

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) The University of Hong Kong(香港大学) UC Berkeley(加州大学伯克利分校)

AI总结 DexVerse是用于多任务、多实体灵巧操作的模块化基准测试,含100个任务,支持多种机器人手臂和手,可扩展且提供视觉变化等。通过对多种方法的基准测试,揭示任务泛化和视觉运动鲁棒性挑战,为通用灵巧操作提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08303 2026-07-10 cs.LG cs.DS 新提交

Learning $\mathsf{AC}^0$ under Locally Sampleable Graphical Models

在局部可采样图形模型下学习 $\mathsf{AC}^0$

Weiming Feng, Xiongxin Yang, Yixiao Yu, Yiyao Zhang

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) Department of Computer Science, University of California, Santa Barbara(计算机科学系,加州大学圣芭芭拉分校) State Key Laboratory for Novel Software Technology, New Cornerstone Science Laboratory, Nanjing University(新型软件技术国家重点实验室,南京大学)

AI总结 研究在允许有效局部采样器的图形模型下学习 $\mathsf{AC}^0$ 的问题,提出通过模拟和截断经典格劳伯动力学建立新的低阶近似的方法,得到拟多项式时间学习者,还能应用于两自旋系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07159 2026-07-09 stat.ME cs.CL 新提交

Recovering Latent Structures after Variational Bayesian Variable Selection: Fit Assessment and Factor-Number Selection in Partially Exploratory Factor Analysis

变分贝叶斯变量选择后恢复潜在结构:部分探索性因子分析中的拟合评估和因子数量选择

Jinsong Chen, Yi Jin

机构 * Faculty of Education, The University of Hong Kong(香港大学教育学院) Department of Curriculum and Instruction, The Education University of Hong Kong(香港教育大学课程与教学系)

AI总结 研究针对部分探索性因子分析中载荷结构和因子数量规定弱的问题,引入选择后评估框架,通过硬选或软选转换协方差模型,推导相关指标,提出无标度增益规则确定因子数量,模拟及实例表明该方法能有效恢复结构、准确确定维度且拟合良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07209 2026-07-09 cs.CR cs.LG 新提交

Continual Learning With Participation Privacy: An Auditable Buffering-Aggregation Recipe

具有参与隐私的持续学习:一种可审计的缓冲聚合方法

T-H. Hubert Chan, Elaine Shi, Mengshi Zhao, Mingxun Zhou

机构 * The University of Hong Kong(香港大学) Carnegie Mellon University(卡内基梅隆大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 研究单编辑相邻用户流的持续学习隐私问题,提出模块化方法,用随机缓冲包装器处理,证明认证定理,使标准原语产生轨迹级差分隐私,建立隐私与延迟联系。

Comments This version corrects and clarifies the independent-decomposability condition underlying the adaptive-safety result in the ICML 2026 paper, with corresponding revisions to the affected statements and proofs

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07141 2026-07-09 cs.CL stat.ME 新提交

From Text to Parameters: Predicting Item Parameters from Embedding Regularization with Reliability and Design Ceilings

从文本到参数:通过具有可靠性和设计上限的嵌入正则化预测项目参数

Shi-Ting Chen, Jinsong Chen

机构 * Faculty of Education, The University of Hong Kong(香港大学教育学院)

AI总结 研究新开发项目校准的冷启动问题,提出结合正则化回归等的评估框架,应用于数学和医疗项目库,发现项目难度可预测,区分度和伪猜测较难,强调重复交叉验证及无尺度度量和明确上限的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06678 2026-07-09 cs.RO 新提交

NativeMEM: Native Memory Compression for Long-Horizon Robotic Manipulation

NativeMEM:用于长期机器人操作的原生内存压缩

Ziye Wang, Modi Shi, Chaojun Ni, Jiazhi Yang, Mengdi Li, Zhizhong Su, Tianwei Lin, Hongyang Li

机构 * The University of Hong Kong(香港大学) Beihang University(北京航空航天大学) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学) Horizon Robotics(地平线机器人)

AI总结 研究如何让预训练VLA模型高频更新时保留长期视觉历史且高效。提出NativeMEM策略,用原生内存压缩编码,通过开发分词器对齐内存令牌与策略,该方法在模拟和真实机器人实验中效果好,数据效率高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06229 2026-07-08 cs.CL cs.AI cs.DB 新提交

Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows

Spider 2.0-AIFunc:将现实世界的文本到SQL扩展到人工智能原生SQL工作流程

Tianyang Liu, Canwen Xu, Fangyu Lei, Nikki Lijing Kuang, Jixuan Chen, Tao Yu, Julian McAuley, Zhewei Yao, Yuxiong He

机构 * UC San Diego(加州大学圣地亚哥分校) Snowflake AI Research(Snowflake人工智能研究院) University of Hong Kong(香港大学)

AI总结 研究针对现有文本到SQL基准无法评估模型生成人工智能原生SQL能力的问题,构建Spider 2.0-AIFunc基准,经特定管道和多轮验证,评估十个先进语言模型,发现准确率差距及传统代理框架转移无效等情况。

Comments 24 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05943 2026-07-08 cs.AI 新提交

SearchEyes: Towards Frontier Multimodal Deep Search Intelligence via Search World Simulation

SearchEyes:通过搜索世界模拟迈向前沿多模态深度搜索智能

Zhengbo Jiao, Yiming Cheng, Yilei Jiang, Kaituo Feng, Rui Huang, Tianyi Jiang, Juanxi Tian, Jiapeng li, Qunzhong Wang, Tailai Chen, Qianshan Wei, Chuan Xiao, Shanyu Rong, Yangfu Li, Yanhan Zhou, Yunpu Ma, Yifan Zhang, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学多媒体实验室) THU(清华大学) HKU(香港大学) PKU(北京大学) NTU(南洋理工大学) CASIA(中国科学院自动化研究所) ECNU(华东师范大学) HIT(哈尔滨工业大学) LMU(慕尼黑大学)

AI总结 针对多模态搜索智能体多跳推理的挑战,提出SearchEyes,用类型化知识图谱构建模拟搜索世界,通过感知-知识链采样路径并保留元数据,采用跳锚策略优化,在六个基准测试中取得最优性能。

Comments Project page: https://github.com/Frostlinx/SearchEyes

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05938 2026-07-08 cs.GR cs.RO 新提交

Prior-First, Condition-Second: Scalable and Controllable Hand Motion Completion

先验优先,条件其次:可扩展且可控的手部运动补全

Mingyi Shi, Xuelin Chen, Taku Komura

机构 * The University of Hong Kong(香港大学) Adobe Research(Adobe研究院)

AI总结 针对手部运动补全难题,提出先验优先、条件其次框架,先从无结构数据学习通用先验,再引入语义控制,通过分层适配器实现可控性,经评估其在多方面优于基线,还展示了实时推理等特性,适用于动画制作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05844 2026-07-08 cs.AI cs.CL cs.MA 新提交

StateFuse: Deterministic Conflict-Preserving Memory for Multi-Agent Systems

StateFuse:用于多智能体系统的确定性冲突保留内存

Sergey Volkov, Yang Li, Ye Luo

机构 * The University of Hong Kong(香港大学)

AI总结 研究多智能体系统内存冲突问题,提出基于标准操作集/CRDT合并的StateFuse冲突感知复制内存契约,通过实验对比,表明其在矛盾呈现、弃权和校正方面更安全,可作为公共内存契约,而非单纯提升准确性。

Comments Code and supplementary materials available at: https://github.com/nZiben/statefuse

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05680 2026-07-08 cs.CY cs.AI cs.HC 新提交

Beyond Accuracy: How Humans Evaluate Legally Correct but Socially Controversial Legal Advice from Machines

超越准确性:人类如何评估来自机器的法律正确但社会有争议的法律建议

Benjamin Minhao Chen, Zhiyu Li

机构 * University of Hong Kong(香港大学) Durham University(达灵顿大学)

AI总结 研究探讨人类如何评估机器给出的法律正确但有社会争议的建议。通过对3348名中国大陆成年人的调查实验发现,归因于人工智能系统对感知合理性无净影响,提供法律推理可提高合理性,公众反应受规范期望平衡影响,对相关理论和系统设计有启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05543 2026-07-08 cs.RO cs.CV 新提交

GEM-Occ: From Visual Geometry Evidence to Embodied Semantic Occupancy Memory

GEM-Occ:从视觉几何证据到具身语义占用记忆

Hu Zhu, Bohan Li, Xianda Guo, Hongsi Liu, Baorui Peng, Mingqi Yuan, Xin Jin, Wenjun Zeng, Chang Wen Chen

机构 * The Hong Kong Polytechnic University(香港理工大学) Eastern Institute of Technology(东部理工学院) Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) The University of Hong Kong(香港大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 研究针对现有室内占用基准和方法对长距离语义映射探索不足的问题,提出GEM-Occ框架,将局部视觉几何预测转化为语义高斯占用证据等并融合到持久分层记忆中,实验证明该框架在多方面优于现有基线。

Comments 19 pages, 6 figures. Project page: https://zhuhu00.top/GEM-Occ/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06013 2026-07-08 cs.LG math.OC 新提交

Stability Annealing Selects the Implicit Bias of Smoothed Sign Descent: A Rate-Indexed Barrier Path on Separable Data

稳定性退火选择平滑符号下降的隐式偏差:可分数据上的速率索引障碍路径

Xiangwu Wang, Chengwei Cao, Yicheng Song, Ran Bi, Peilin Yu

机构 * The University of Hong Kong(香港大学) University of California, San Diego(加州大学圣地亚哥分校) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

AI总结 研究可分数据上全批量线性分类的速率控制情况,针对无记忆稳定性退火平滑符号下降,证明归一化迭代收敛特性,通过实验验证相关恒等式、展示预测图及缩放,还报告了多种情况的诊断,明确理论范围。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05354 2026-07-07 cs.CV 新提交

Geometric Reciprocity: Unlocking Self-Supervision for Stereoscopic Video Generation

几何互易性:解锁立体视频生成的自监督能力

Jingyi Lu, Kai Han

机构 * Visual AI Lab, The University of Hong Kong, Hong Kong, China(香港大学视觉人工智能实验室)

AI总结 针对单目转立体任务中立体修复依赖稀缺标注数据的问题,提出几何互易性定理,构建自监督框架,从海量单目视频学习,性能远超现有无监督、监督SOTA方法。

Comments Accepted to ICML 2026. Project page: https://visual-ai.github.io/grt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04714 2026-07-07 cs.RO cs.AI 新提交

Geometry-Aware Motion Latents for Learning Robust Manipulation Policies

用于学习鲁棒操纵策略的几何感知运动潜变量

Yunchao Zhang, Yijia Weng, Ruizhe Liu, Ming Hu, Leonidas Guibas, Yanchao Yang

机构 * Department of Computer Science, The University of Hong Kong(香港大学计算机科学系)

AI总结 研究如何学习机器人操纵的运动潜变量,核心方法是通过预测点云在操纵过程中的演变来学习离散运动潜码,贡献是仅用单视图RGB-D输入达先进性能,验证几何预测是关键,且潜码有有效运动抽象能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04234 2026-07-07 cs.RO cs.AI cs.CV 新提交

SoftVTBench: A Safety-Aware Visuo-Tactile Benchmark for Physically Constrained Robotic Manipulation of Deformable Objects

SoftVTBench:用于物理约束下可变形物体机器人操作的安全感知视觉触觉基准测试

Bowen Jing, Mingxin Wang, Ruiyang Hao, Chenchen Ge, Hanwen Shen, Junjie He, Yang Cui, Yiming Hou, Weitao Zhou, Jiawei Wang, Minglei Li, Dandan Zhang, Ding Zhao, Houde Liu, Xiaofan Li, Si Liu, Ping Luo, Haibao Yu

机构 * Tuojing Intelligence(拓景智能) Tsinghua University(清华大学) King’s College London(伦敦国王学院) Southeast University(东南大学) Stevens Institute of Technology(史蒂文斯理工学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Manchester(曼彻斯特大学) Simple AI(简单人工智能公司) Imperial College London(伦敦帝国学院) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

AI总结 研究物理约束下可变形物体操作,提出SoftVTBench基准测试,通过有限元模拟可变形物体,定义任务套件,分别报告目标成功和安全成功,实现基线并实验,表明仅成功评估高估策略性能,触觉传感可提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04149 2026-07-07 cs.CV 新提交

Beyond Scene Priors: Fine-Grained Traffic Scene Reasoning with Benchmarking and Query-Guided Small-Object Focus

超越场景先验:通过基准测试和查询引导的小目标聚焦进行细粒度交通场景推理

Waikit Xiu, Qiang Lu, Zian Wang, Xinjie Yang, Zhiwei Chen, Chen Sun, Xiying Li

机构 * The University of Hong Kong(香港大学) Sun Yat-Sen University(中山大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 针对安全关键交通场景中复杂问题,提出细粒度交通推理基准FGTR - Bench和文本引导小目标推理MLLM(TSR - MLLM),解决视觉语言对齐中关键小目标被忽视问题,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03935 2026-07-07 cs.AI 新提交

Harness-Aware Self-Evolving: Co-Evolving Model Weights, Harness, and Task Solutions

harness感知自进化:共同进化模型权重、harness和任务解决方案

Haochen Luo, Yi Huang, Sichun Luo, Fengyuan Liu, Lei Li, Zefa Hu, Junlan Feng, Qi Liu

机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Jiutian Research, China Mobile(中国移动九天研究院)

AI总结 研究提出HASE框架,通过单模型在多轮动作空间生成任务解决方案或编辑harness组件。能使单模型匹配高性能模型文本分类性能,在alpha因子挖掘中超越基线,还能修复评估组件,在算法发现中达最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏