arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The University of Hong Kong(香港大学)

共收录 1508
2607.06229 2026-07-08 cs.CL cs.AI cs.DB 新提交

Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows

Spider 2.0-AIFunc:将现实世界的文本到SQL扩展到人工智能原生SQL工作流程

Tianyang Liu, Canwen Xu, Fangyu Lei, Nikki Lijing Kuang, Jixuan Chen, Tao Yu, Julian McAuley, Zhewei Yao, Yuxiong He

机构 * UC San Diego(加州大学圣地亚哥分校) Snowflake AI Research(Snowflake人工智能研究院) University of Hong Kong(香港大学)

AI总结 研究针对现有文本到SQL基准无法评估模型生成人工智能原生SQL能力的问题,构建Spider 2.0-AIFunc基准,经特定管道和多轮验证,评估十个先进语言模型,发现准确率差距及传统代理框架转移无效等情况。

Comments 24 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05943 2026-07-08 cs.AI 新提交

SearchEyes: Towards Frontier Multimodal Deep Search Intelligence via Search World Simulation

SearchEyes:通过搜索世界模拟迈向前沿多模态深度搜索智能

Zhengbo Jiao, Yiming Cheng, Yilei Jiang, Kaituo Feng, Rui Huang, Tianyi Jiang, Juanxi Tian, Jiapeng li, Qunzhong Wang, Tailai Chen, Qianshan Wei, Chuan Xiao, Shanyu Rong, Yangfu Li, Yanhan Zhou, Yunpu Ma, Yifan Zhang, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学多媒体实验室) THU(清华大学) HKU(香港大学) PKU(北京大学) NTU(南洋理工大学) CASIA(中国科学院自动化研究所) ECNU(华东师范大学) HIT(哈尔滨工业大学) LMU(慕尼黑大学)

AI总结 针对多模态搜索智能体多跳推理的挑战,提出SearchEyes,用类型化知识图谱构建模拟搜索世界,通过感知-知识链采样路径并保留元数据,采用跳锚策略优化,在六个基准测试中取得最优性能。

Comments Project page: https://github.com/Frostlinx/SearchEyes

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05938 2026-07-08 cs.GR cs.RO 新提交

Prior-First, Condition-Second: Scalable and Controllable Hand Motion Completion

先验优先,条件其次:可扩展且可控的手部运动补全

Mingyi Shi, Xuelin Chen, Taku Komura

机构 * The University of Hong Kong(香港大学) Adobe Research(Adobe研究院)

AI总结 针对手部运动补全难题,提出先验优先、条件其次框架,先从无结构数据学习通用先验,再引入语义控制,通过分层适配器实现可控性,经评估其在多方面优于基线,还展示了实时推理等特性,适用于动画制作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05844 2026-07-08 cs.AI cs.CL cs.MA 新提交

StateFuse: Deterministic Conflict-Preserving Memory for Multi-Agent Systems

StateFuse:用于多智能体系统的确定性冲突保留内存

Sergey Volkov, Yang Li, Ye Luo

机构 * The University of Hong Kong(香港大学)

AI总结 研究多智能体系统内存冲突问题,提出基于标准操作集/CRDT合并的StateFuse冲突感知复制内存契约,通过实验对比,表明其在矛盾呈现、弃权和校正方面更安全,可作为公共内存契约,而非单纯提升准确性。

Comments Code and supplementary materials available at: https://github.com/nZiben/statefuse

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05680 2026-07-08 cs.CY cs.AI cs.HC 新提交

Beyond Accuracy: How Humans Evaluate Legally Correct but Socially Controversial Legal Advice from Machines

超越准确性:人类如何评估来自机器的法律正确但社会有争议的法律建议

Benjamin Minhao Chen, Zhiyu Li

机构 * University of Hong Kong(香港大学) Durham University(达灵顿大学)

AI总结 研究探讨人类如何评估机器给出的法律正确但有社会争议的建议。通过对3348名中国大陆成年人的调查实验发现,归因于人工智能系统对感知合理性无净影响,提供法律推理可提高合理性,公众反应受规范期望平衡影响,对相关理论和系统设计有启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05543 2026-07-08 cs.RO cs.CV 新提交

GEM-Occ: From Visual Geometry Evidence to Embodied Semantic Occupancy Memory

GEM-Occ:从视觉几何证据到具身语义占用记忆

Hu Zhu, Bohan Li, Xianda Guo, Hongsi Liu, Baorui Peng, Mingqi Yuan, Xin Jin, Wenjun Zeng, Chang Wen Chen

机构 * The Hong Kong Polytechnic University(香港理工大学) Eastern Institute of Technology(东部理工学院) Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) The University of Hong Kong(香港大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 研究针对现有室内占用基准和方法对长距离语义映射探索不足的问题,提出GEM-Occ框架,将局部视觉几何预测转化为语义高斯占用证据等并融合到持久分层记忆中,实验证明该框架在多方面优于现有基线。

Comments 19 pages, 6 figures. Project page: https://zhuhu00.top/GEM-Occ/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06013 2026-07-08 cs.LG math.OC 新提交

Stability Annealing Selects the Implicit Bias of Smoothed Sign Descent: A Rate-Indexed Barrier Path on Separable Data

稳定性退火选择平滑符号下降的隐式偏差:可分数据上的速率索引障碍路径

Xiangwu Wang, Chengwei Cao, Yicheng Song, Ran Bi, Peilin Yu

机构 * The University of Hong Kong(香港大学) University of California, San Diego(加州大学圣地亚哥分校) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

AI总结 研究可分数据上全批量线性分类的速率控制情况,针对无记忆稳定性退火平滑符号下降,证明归一化迭代收敛特性,通过实验验证相关恒等式、展示预测图及缩放,还报告了多种情况的诊断,明确理论范围。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15600 2026-07-08 cs.RO cs.AI cs.CL cs.CV 版本更新

From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation

从被动观察者到主动批评者:强化学习激发机器人操作的过程推理

Yibin Liu, Yaxing Lyu, Daqi Gao, Zhixuan Liang, Weiliang Tang, Shilong Mu, Xiaokang Yang, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) Northeastern University(东北大学) Xiamen University Malaysia(厦门大学马来西亚分校) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Xspark AI

AI总结 本文提出PRIMO R1框架,通过强化学习使视频MLLMs成为主动批评者,提升机器人操作中长期任务的监督准确性,实验表明其在过程推理和零样本泛化方面表现优异。

Comments Accepted to ECCV 2026. 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09696 2026-07-08 cs.CV 版本更新

ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models

ZeroBench:当代大型多模态模型的一个不可能的视觉基准测试

Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma, Akash Gupta, Samuel Roberts, Ioana Croitoru, Simion-Vlad Bogolin, Jialu Tang, Florian Langer, Vyas Raina, Vatsal Raina, Hanyi Xiong, Vishaal Udandarao, Jingyi Lu, Shiyang Chen, Sam Purkis, Tianshuo Yan, Wenye Lin, Gyungin Shin, Qiaochu Yang, Anh Totti Nguyen, David I. Atkinson, Aaditya Baranwal, Alexandru Coca, Mikah Dang, Sebastian Dziadzio, Jakob D. Kunz, Kaiqu Liang, Alexander Lo, Brian Pulfer, Steven Walton, Charig Yang, Kai Han, Samuel Albanie

机构 * University of Cambridge(剑桥大学) University of Alberta(阿尔伯塔大学) The University of Hong Kong(香港大学) University of Oxford(牛津大学) Northeastern University(东北大学) Astadeus College of Southern Maryland(马里兰州南部学院) University of Geneva(日内瓦大学) University of Oregon(俄勒冈大学)

AI总结 针对大型多模态模型在图像解释方面不足但在现有视觉基准测试中优势易逝的问题,引入通过对抗过滤策划的ZeroBench基准测试,评估多个模型,展现其潜力并公开测试内容,为模型视觉能力评估提供长期有效的新基准。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05354 2026-07-07 cs.CV 新提交

Geometric Reciprocity: Unlocking Self-Supervision for Stereoscopic Video Generation

几何互易性:解锁立体视频生成的自监督能力

Jingyi Lu, Kai Han

机构 * Visual AI Lab, The University of Hong Kong, Hong Kong, China(香港大学视觉人工智能实验室)

AI总结 针对单目转立体任务中立体修复依赖稀缺标注数据的问题,提出几何互易性定理,构建自监督框架,从海量单目视频学习,性能远超现有无监督、监督SOTA方法。

Comments Accepted to ICML 2026. Project page: https://visual-ai.github.io/grt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04714 2026-07-07 cs.RO cs.AI 新提交

Geometry-Aware Motion Latents for Learning Robust Manipulation Policies

用于学习鲁棒操纵策略的几何感知运动潜变量

Yunchao Zhang, Yijia Weng, Ruizhe Liu, Ming Hu, Leonidas Guibas, Yanchao Yang

机构 * Department of Computer Science, The University of Hong Kong(香港大学计算机科学系)

AI总结 研究如何学习机器人操纵的运动潜变量,核心方法是通过预测点云在操纵过程中的演变来学习离散运动潜码,贡献是仅用单视图RGB-D输入达先进性能,验证几何预测是关键,且潜码有有效运动抽象能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04234 2026-07-07 cs.RO cs.AI cs.CV 新提交

SoftVTBench: A Safety-Aware Visuo-Tactile Benchmark for Physically Constrained Robotic Manipulation of Deformable Objects

SoftVTBench:用于物理约束下可变形物体机器人操作的安全感知视觉触觉基准测试

Bowen Jing, Mingxin Wang, Ruiyang Hao, Chenchen Ge, Hanwen Shen, Junjie He, Yang Cui, Yiming Hou, Weitao Zhou, Jiawei Wang, Minglei Li, Dandan Zhang, Ding Zhao, Houde Liu, Xiaofan Li, Si Liu, Ping Luo, Haibao Yu

机构 * Tuojing Intelligence(拓景智能) Tsinghua University(清华大学) King’s College London(伦敦国王学院) Southeast University(东南大学) Stevens Institute of Technology(史蒂文斯理工学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Manchester(曼彻斯特大学) Simple AI(简单人工智能公司) Imperial College London(伦敦帝国学院) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

AI总结 研究物理约束下可变形物体操作,提出SoftVTBench基准测试,通过有限元模拟可变形物体,定义任务套件,分别报告目标成功和安全成功,实现基线并实验,表明仅成功评估高估策略性能,触觉传感可提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04149 2026-07-07 cs.CV 新提交

Beyond Scene Priors: Fine-Grained Traffic Scene Reasoning with Benchmarking and Query-Guided Small-Object Focus

超越场景先验:通过基准测试和查询引导的小目标聚焦进行细粒度交通场景推理

Waikit Xiu, Qiang Lu, Zian Wang, Xinjie Yang, Zhiwei Chen, Chen Sun, Xiying Li

机构 * The University of Hong Kong(香港大学) Sun Yat-Sen University(中山大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 针对安全关键交通场景中复杂问题,提出细粒度交通推理基准FGTR - Bench和文本引导小目标推理MLLM(TSR - MLLM),解决视觉语言对齐中关键小目标被忽视问题,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03935 2026-07-07 cs.AI 新提交

Harness-Aware Self-Evolving: Co-Evolving Model Weights, Harness, and Task Solutions

harness感知自进化:共同进化模型权重、harness和任务解决方案

Haochen Luo, Yi Huang, Sichun Luo, Fengyuan Liu, Lei Li, Zefa Hu, Junlan Feng, Qi Liu

机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Jiutian Research, China Mobile(中国移动九天研究院)

AI总结 研究提出HASE框架,通过单模型在多轮动作空间生成任务解决方案或编辑harness组件。能使单模型匹配高性能模型文本分类性能,在alpha因子挖掘中超越基线,还能修复评估组件,在算法发现中达最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03926 2026-07-07 cs.DB cs.AI 新提交

TabQueryBench: A Query-Centric Benchmark for Synthetic Tabular Data

TabQueryBench:用于合成表格数据的以查询为中心的基准测试

Jialin Zhang, Fenghao Dong, Yajie Zhou, Vyas Sekar, Shinan Liu

机构 * University of Hong Kong(香港大学) Tongji University(同济大学) Carnegie Mellon University(卡内基梅隆大学) University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 提出TabQueryBench以查询为中心的基准测试,用SQL查询评估合成数据保真度,将查询分类为模板并生成可执行SQL查询,实验展示了当前表格生成模型在查询保真度等方面的五种模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03789 2026-07-07 cs.CV 新提交

G$^2$TAM: Geometry Grounded Track Anything Model

G$^2$TAM:几何基础的轨迹任意模型

Chenming Zhu, Peizhou Cao, Jingli Lin, Wenbo Hu, Yunlong Ran, Jiangmiao Pang, Tai Wang, Xihui Liu

机构 * HKU(香港大学) Shanghai AI Lab(上海人工智能实验室) BUAA(北京航空航天大学) SJTU(上海交通大学) UCLA(加州大学洛杉矶分校) ZJU(浙江大学)

AI总结 研究利用现代前馈3D重建模型的空间一致性,提出G$^2$TAM框架,用无序RGB图像或视频进行3D实例跟踪。核心是跨模态空间编码器,还构建数据集,实验表明该模型有多种优势,为交互式空间推理奠定基础。

Comments Accepted by ICML 2026. Project Page:https://zcmax.github.io/projects/G2TAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03015 2026-07-07 cs.AI 新提交

Beyond Forecasting: The Belief-to-Trade Layer in Prediction-Market Agents

超越预测:预测市场代理中的信念到交易层

Yishu Wang, Yuxuan Wang, Jiaqi Deng, Hanyang Tang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 以预测未来事件为通用人工智能测试平台,提出Raven-Agent这一预测市场自主交易代理,在存档决策集的控制重放中表现出色。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02968 2026-07-07 cs.CV 新提交

Awakening Diffusion Transformers: Eliciting Stronger Generation and Understanding via Massive Activation Modulation

唤醒扩散变换器:通过大规模激活调制激发更强的生成和理解能力

Chaofan Gan, Zicheng Zhao, Yuanpeng Tu, Xi Chen, Ziran Qin, Tieyuan Chen, Supavadee Aramvith, Mehrtash Harandi, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Monash University(莫纳什大学) The University of Hong Kong(香港大学) Zhongguancun Academy(中关村科学城创新中心) Chulalongkorn University(朱拉隆功大学) City University of Hong Kong(香港城市大学)

AI总结 研究扩散变换器中大规模激活(MAs)的结构和功能,发现其空间分布及与AdaLN残差缩放因子的关系。基于此提出EMA框架,通过MA驱动的细节引导和MA调制的表征提取,提升生成和理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02908 2026-07-07 cs.CV 新提交

Holo-Captioning: Toward the Text Equivalent of 3D Scenes

全息字幕:迈向3D场景的文本等效物

Kun-Yu Lin, Chengke Bu, Zhenguo Li, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室) Frontier Robotics(前沿机器人)

AI总结 研究提出全息字幕任务,先将其定义为生成结构化文本描述,开发字幕引擎及大规模基准,在此基础上提出HoloScribe模型,还给出评估指标和测试集,该模型性能超现有方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23327 2026-07-07 cs.CV cs.AI 新提交

VideoAgent: All-in-One Framework for Video Understanding and Editing

VideoAgent: 视频理解与编辑的全能框架

Hengji Zhou, Lingxuan Huang, Jian Wang, Bing Zhou, Si Wu, Lianghao Xia, Chao Huang

机构 * South China University of Technology(华南理工大学) The University of Hong Kong(香港大学) Snap Inc(Snap公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 提出VideoAgent,一种基于多智能体编排的全能框架,通过自动镜头创建和30多个专业编辑智能体,解决现有系统在长视频理解和多样化编辑操作上的局限,在VideoEdit基准上实现87-95%编排成功率并降低60% API成本。

Comments Preprint. Code available at https://github.com/HKUDS/VideoAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16337 2026-07-07 cs.AI cs.HC cs.LG 新提交

Medical Heuristic Learning: An LLM-Driven Framework for Interpretable and Auditable Clinical Decision Rules

医学启发式学习:一个用于可解释和可审计临床决策规则的LLM驱动框架

Wei Xu, Ke Yang, Gang Luo, Keli Zheng, Lingyan Hu, Jing Wang, Kefeng Li

机构 * Centre for Artificial Intelligence Driven Drug Discovery, Macao Polytechnic University(人工智能驱动药物发现中心,澳门理工学院) Key Laboratory of Short-Range Radio Equipment Testing and Evaluation, Ministry of Industry and Information Technology Terahertz Science Application Center (TSAC), Beijing Institute of Technology(工业和信息化部短距离无线电设备测试与评估重点实验室,太赫兹科学应用中心(TSAC),北京理工大学) Department of Critical Care Medicine, Yantai Yuhuangding Hospital, Qingdao University(重症医学科,烟台友谊医院,青岛大学) Faculty of Education, The University of Hong Kong(教育学院,香港大学) College of Information Engineering, Dalian University(信息工程学院,大连大学)

AI总结 提出医学启发式学习(MHL),利用LLM驱动的工作流优化确定性可执行决策系统,生成可解释、可审计的Python决策规则,在医学数据集上达到与最先进方法相当的性能,并支持小样本和高度不平衡场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31604 2026-07-07 cs.CV 版本更新

Representation Forcing for Bottleneck-Free Unified Multimodal Models

表示强制:无瓶颈统一多模态模型

Yuqing Wang, Zhijie Lin, Ceyuan Yang, Yang Zhao, Fei Xiao, Hao He, Qi Zhao, Zihan Ding, Fuyun Wang, Shuai Wang, Youliang Zhang, Haoqi Fan, Xihui Liu

机构 * University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子) The Chinese University of Hong Kong(香港中文大学) Nanjing University(南京大学) Tsinghua University(清华大学)

AI总结 提出表示强制(RF)技术,通过让解码器自回归预测视觉表示作为中间令牌,再在相同骨干网络中引导像素扩散,从而消除统一多模态模型对预训练VAE的依赖,实现无瓶颈的端到端模型。

Comments Project page: https://yuqingwang1029.github.io/RepresentationForcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28489 2026-07-07 eess.IV cs.CV 版本更新

Video Generation Models as World Models: Efficient Paradigms, Architectures and Algorithms

视频生成模型作为世界模型:高效的范式、架构和算法

Muyang He, Hanzhong Guo, Junxiong Lin, Yizhou Yu

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) Hong Kong Generative AI Research and Development Center(香港生成式人工智能研究与开发中心)

AI总结 本文系统回顾了考虑效率的世界模拟视频生成框架,提出三维分类方法,展示提升效率对自动驾驶等应用的重要性,并指出高效视频生成向通用世界模拟器演进的关键性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03283 2026-07-07 cs.CV 版本更新

Utonia: Toward One Encoder for All Point Clouds

Utonia:迈向适用于所有点云的单一编码器

Yujia Zhang, Xiaoyang Wu, Yunhan Yang, Xianzhe Fan, Han Li, Yuechen Zhang, Zehao Huang, Naiyan Wang, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Xiaomi(小米)

AI总结 研究旨在训练跨多领域的单自监督点变压器编码器Utonia,其能学习一致表征空间实现跨域转移,统一各领域点云,提升感知能力,还对具身和多模态推理有益,有望成为稀疏3D数据基础模型。

Comments produced by Pointcept, project page: https://pointcept.github.io/Utonia

Journal ref International Conference on Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09740 2026-07-07 cs.CV cs.AI 版本更新

ELBO-T2IAlign: A Generic ELBO-Based Method for Calibrating Pixel-level Text-Image Alignment in Diffusion Models

ELBO-T2IAlign:一种基于通用ELBO的方法,用于校准扩散模型中的像素级文本-图像对齐

Qin Zhou, Zhiyang Zhang, Jinglong Wang, Xiaobin Li, Jing Zhang, Qian Yu, Lu Sheng, Dong Xu

机构 * School of Software, Beihang University(北航软件学院) College of Computer and Cyber Security, Hebei Normal University(河北师范大学计算机与网络安全学院) Department of Computer Science, The University of Hong Kong(香港大学计算机科学系)

AI总结 研究利用零样本指称图像分割评估扩散模型像素级图像与文本对齐,分析训练数据偏差导致的不对齐问题,提出ELBO-T2IAlign方法校准像素-文本对齐,无需额外标注等,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02284 2026-07-03 cs.CV 新提交

FlowCIR: Semantic Transport via Flow Matching for Zero-Shot Composed Image Retrieval

FlowCIR: 通过流匹配实现零样本组合图像检索的语义传输

Zhenqi He, Ziqi Jiang, Yuanpei Liu, Yanghao Wang, Teng Wang, Long Chen

机构 * The Hong Kong University of Science and Technology, Hong Kong SAR(香港科技大学) The University of Hong Kong, Hong Kong SAR(香港大学)

AI总结 提出FlowCIR,利用条件流匹配将参考图像与指令组合成目标对齐查询嵌入,避免文本反转的信息损失,训练效率高,并引入多负向引导策略提升对否定指令的鲁棒性。

Comments Accept to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01083 2026-07-03 cs.LG cs.AI 新提交

Staleness-Learning Rate Scaling Laws for Asynchronous RLHF

异步RLHF的陈旧度-学习率缩放定律

Jingwei Song, Haofeng Xu, Jie Xiao, Chengke Bao, Jingwei Shi, Pengbin Feng, Weixun Wang, Yuhang Han, Chuan Wu, Linfeng Zhang, Bill Shi

机构 * The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) Gradient University of Southern California(南加州大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 研究异步GRPO中陈旧rollout的影响,推导出陈旧度与学习率之间的缩放定律,揭示稳定性受累积漂移和陈旧度约束的双重条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24564 2026-07-03 cs.CV 新提交

PatternGSL: A Structured Specification Language for Template-Free and Simulation-Ready 3D Garments

PatternGSL: 一种用于无模板且可模拟的3D服装的结构化规范语言

Zhenyang Li, Lutao Jiang, Yizhou Zhao, Ying-Cong Chen, Xin Wang, Weikai Chen, Yifan Peng

机构 * The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Carnegie Mellon University(卡内基梅隆大学) LIGHTSPEED Shenzhen(LIGHTSPEED深圳) LIGHTSPEED Los Angeles(LIGHTSPEED洛杉矶)

AI总结 提出PatternGSL,一种无模板、可学习的结构化服装表示语言,从单张图像直接预测完整缝纫图案,实现可模拟的3D服装重建。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17984 2026-07-03 eess.IV cs.CV cs.RO 版本更新

See Silhouettes in Motion with Neuromorphic Vision

用神经形态视觉感知运动中的轮廓

Pei Zhang, Shijie Lin, Zhou Ge, Jinpeng Chen, Wei Pu

机构 * School of Electrical Engineering, Guangxi University(广西大学电气工程学院) Department of Computer Science, The University of Hong Kong(香港大学计算机科学系) School of Mechatronic Engineering and Automation, Shanghai University(上海大学机电工程与自动化学院) SHU General Intelligent Robotics Research Institute(SHU通用智能机器人研究院) School of Computer Science (National Pilot Software Engineering School), Beijing University of Posts and Telecommunications(北京邮电大学计算机科学学院(国家试点软件学院)) School of Information and Communication Engineering, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院)

AI总结 本文提出了一种双模方法,利用帧和事件的协同作用,在仅CPU的设备上实现实时高帧率二值化,有效减少运动模糊并提升在恶劣光照下的性能,为资源受限边缘平台的轻量感知和交互铺平道路。

Comments 13 pages, 15 figures, and 5 tables. This work is under review. Project page: https://github.com/pz-even/event_binarization

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17450 2026-07-03 cs.SE cs.AI cs.CL cs.CR 版本更新

ContraFix: Skill-Enhanced Contrastive Runtime Analysis for Vulnerability Repair

ContraFix:通过差分运行时证据和技能重用进行代理漏洞修复

Simiao Liu, Fang Liu, Peiding Wang, Taichuan Li, Yinghao Zhu, Xiaoli Lian, Li Zhang

机构 * Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

AI总结 本文提出ContraFix框架,通过差分运行时证据和可重用的修复技能,解决大型语言模型代理在自动漏洞修复中的语义误解问题,实现了在SEC-Bench和PatchEval上的高准确率。

Comments Code: https://figshare.com/s/f173c78e44bca88ebaea

详情

展开后加载摘要…

URL PDF HTML 收藏