arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

共收录 2801
2510.18560 2026-03-04 cs.SE cs.AI

WebDevJudge: Evaluating (M)LLMs as Critiques for Web Development Quality

WebDevJudge: 评估 (M)LLMs 作为 Web 开发质量的批评者

Chunyang Li, Yilun Zheng, Xinting Huang, Tianqing Fang, Jiahao Xu, Lihui Chen, Yangqiu Song, Han Hu

机构 * Tencent AI Lab(腾讯AI实验室) The Hong Kong University of Science and Technology(香港科学与技术大学) Nanyang Technological University(南洋理工大学)

AI总结 WebDevJudge 提出了一种评估 LLM 作为 Web 开发质量批评者的基准,揭示了 LLM 与人类专家之间的显著差距,指出了模型在功能等价性识别、任务可行性验证和偏见缓解方面的根本性限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07218 2026-03-04 cs.LG cs.AI cs.CV

Perception-R1: Advancing Multimodal Reasoning Capabilities of MLLMs via Visual Perception Reward

Perception-R1: 通过视觉感知奖励提升多模态大语言模型的多模态推理能力

Tong Xiao, Xin Xu, Zhenya Huang, Hongyu Gao, Quan Liu, Qi Liu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) iFLYTEK AI Research(iFLYTEK人工智能研究院) Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 Perception-R1通过引入视觉感知奖励提升多模态大语言模型的多模态推理能力

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01966 2026-03-03 cs.CL cs.AI

AMemGym: Interactive Memory Benchmarking for Assistants in Long-Horizon Conversations

AMemGym:用于长时对话中助手的交互式记忆基准测试

Cheng Jiayang, Dongyu Ru, Lin Qiu, Yiyang Li, Xuezhi Cao, Yangqiu Song, Xunliang Cai

机构 * The Hong Kong University of Science and Technology(香港科技大学) Meituan(美团)

AI总结 AMemGym通过交互式环境实现长时对话中助手的内存管理优化,揭示现有内存系统性能差距并推动策略自我进化。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01941 2026-03-03 cs.LG

BAED: a New Paradigm for Few-shot Graph Learning with Explanation in the Loop

BAED: 一种新的少样本图学习范式,具有循环解释

Chao Chen, Xujia Li, Dongsheng Hong, Shanshan Lin, Xiangwen Liao, Chuanyi Liu, Lei Chen

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) The Hong Kong University of Science and Technology(香港科学与技术大学) Fuzhou University(福州大学)

AI总结 BAED提出了一种新的少样本图学习范式,通过循环解释机制提升模型的鲁棒性和可解释性,实验显示其在预测准确性、训练效率和解释质量上均优于现有方法。

Comments Accepted to Neural Networks 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01912 2026-03-03 cs.CL cs.AI

Demonstrating ViviDoc: Generating Interactive Documents through Human-Agent Collaboration

展示ViviDoc:通过人机协作生成交互式文档

Yinghao Tang, Yupeng Xie, Yingchaojie Feng, Tingfeng Lan, Wei Chen

机构 * State Key Lab of CAD&CG(CAD与CG国家重点实验室) HKUST(GZ)(香港科技大学(广州)) National University of Singapore(新加坡国立大学) University of Virginia(弗吉尼亚大学)

AI总结 ViviDoc通过人机协作生成交互式教育文档,采用多代理流水线和文档规范提升生成质量和编辑体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01898 2026-03-03 cs.RO

SaferPath: Hierarchical Visual Navigation with Learned Guidance and Safety-Constrained Control

SaferPath: 基于学习引导和安全约束控制的分层视觉导航

Lingjie Zhang, Zeyu Jiang, Changhao Chen

机构 * PEAK-Lab, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)的PEAK实验室)

AI总结 SaferPath通过结合学习引导和安全约束控制,提升移动机器人在复杂环境中的视觉导航能力,有效减少碰撞并提高成功率。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22373 2026-03-03 cs.CL cs.AI cs.CV

VisJudge-Bench: Aesthetics and Quality Assessment of Visualizations

VisJudge-Bench: 可视化美学与质量评估

Yupeng Xie, Zhiyang Zhang, Yifan Wu, Sirong Lu, Jiayi Zhang, Zhaoyang Yu, Jinlin Wang, Sirui Hong, Bang Liu, Chenglin Wu, Yuyu Luo

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) DeepWisdom(深智科技) Université de Montréal & Mila(蒙特利尔大学及Mila)

AI总结 VisJudge-Bench提出首个可视化质量评估基准,通过VisJudge模型显著提升对可视化美学和质量的判断精度。

Comments 62 pages, 27 figures, 8 tables. Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15504 2026-03-03 cs.CV cs.AI

Exploiting Low-Dimensional Manifold of Features for Few-Shot Whole Slide Image Classification

利用特征的低维流形进行少样本全滑动图像分类

Conghao Xiong, Zhengrui Guo, Zhe Xu, Yifei Zhang, Raymond Kai-Yu Tong, Si Yong Yeo, Hao Chen, Joseph J. Y. Sung, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Centre of AI in Medicine, Singapore(新加坡人工智能医学中心) The Hong Kong University of Science and Technology(香港科学大学) Nanyang Technological University(南洋理工大学) Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学Lee Kong Chian医学学院) MedVisAI Lab, Singapore(新加坡MedVisAI实验室)

AI总结 本文提出Manifold Residual块,通过几何意识的残差学习方法,解决少样本全滑动图像分类中的过拟合问题,实现更高效的模型性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01666 2026-03-03 cs.CL cs.IR

Beyond the Grid: Layout-Informed Multi-Vector Retrieval with Parsed Visual Document Representations

超越网格:基于解析视觉文档表示的布局感知多向量检索

Yibo Yan, Mingdong Ou, Yi Cao, Xin Zou, Shuliang Liu, Jiahao Huo, Yu Huang, James Kwok, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Alibaba Cloud Computing(阿里云计算)

AI总结 ColParse通过生成布局感知的子图像嵌入和全局向量融合,实现高效多向量检索,显著降低存储需求并提升性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01603 2026-03-03 cs.CV

Sparse View Distractor-Free Gaussian Splatting

稀疏视角无干扰高斯点云法

Yi Gu, Zhaorui Wang, Jiahang Cao, Jiaxu Wang, Mingle Zhao, Dongjun Ye, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Macau(澳门大学)

AI总结 本文提出一种基于先验信息的框架,用于提升稀疏视角下无干扰3DGS的性能,通过几何模型和视觉-语言模型增强训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01574 2026-03-03 cs.CR cs.AI

DualSentinel: A Lightweight Framework for Detecting Targeted Attacks in Black-box LLM via Dual Entropy Lull Pattern

DualSentinel: 一种用于通过双熵低谷模式检测黑盒LLM中针对性攻击的轻量级框架

Xiaoyi Pang, Xuanyi Hao, Pengyu Liu, Qi Luo, Song Guo, Zhibo Wang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) School of Cyber Science and Technology(网络安全科学与技术学院)

AI总结 DualSentinel通过双熵低谷模式检测黑盒LLM中的针对性攻击,提供高效且准确的防御方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01454 2026-03-03 cs.CV cs.AI

VidDoS: Universal Denial-of-Service Attack on Video-based Large Language Models

VidDoS:针对基于视频的大语言模型的通用拒绝服务攻击

Duoxun Tang, Dasen Dai, Jiyao Wang, Xiao Yang, Jianyu Wang, Siqi Cai

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The Chinese University of Hong Kong, Hong Kong SAR(香港中文大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳研究院) Shenzhen Loop Area Institute, China(深圳环园院) McGill University(麦吉尔大学) The Hong Kong University of Science and Technology, Guangzhou(香港科学与技术大学)

AI总结 VidDoS是一种针对视频大语言模型的通用拒绝服务攻击方法,通过通用优化生成实例无关的触发器,导致模型推理延迟和token扩展显著增加,引发安全问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01101 2026-03-03 cs.SD cs.AI

SyncTrack: Rhythmic Stability and Synchronization in Multi-Track Music Generation

SyncTrack: 多轨音乐生成中的节奏稳定性与同步

Hongrui Wang, Fan Zhang, Zhiyuan Yu, Ziya Zhou, Xi Chen, Can Yang, Yang Wang

机构 * Department of Mathematics, The Hong Kong University of Science and Technology(香港科学与技术大学数学系) State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Academy of Interdisciplinary Studies, The Hong Kong University of Science and Technology(香港科学与技术大学跨学科研究学院) State Key Laboratory of Nervous System Disorders, The Hong Kong University of Science and Technology(香港科学与技术大学神经系统紊乱国家重点实验室) The University of Hong Kong(香港大学)

AI总结 SyncTrack通过同步多轨波形音乐生成模型提升多轨音乐的节奏一致性和同步性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01064 2026-03-03 cs.LG

A level-wise training scheme for learning neural multigrid smoothers with application to integral equations

一种面向神经多网格平滑器的分层训练方案及其在积分方程中的应用

Lingfeng Li, Yin King Chu, Raymond Chan, Justin Wan

机构 * Hetao Institute of Mathematics and Interdisciplinary Sciences(河套数学与交叉科学研究所) Hong Kong University of Science and Technology(香港科技大学) Lingnan University(岭南大学) University of Waterloo(多伦多大学)

AI总结 本文提出了一种基于神经算子的多网格求解方案,通过分层训练和频谱过滤技术,有效解决积分方程和PDE问题,展现出更高的求解效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24080 2026-03-03 cs.AI cs.SD

Human or Machine? A Preliminary Turing Test for Speech-to-Speech Interaction

人类还是机器?一种语音到语音交互的初步图灵测试

Xiang Li, Jiabao Gao, Sipei Lin, Xuan Zhou, Chi Zhang, Bo Cheng, Jiale Han, Benyou Wang

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) Shenzhen Research Institute of Big Data(深圳大数据研究 institute) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文首次对语音到语音系统进行图灵测试,发现现有系统在类人特性上存在显著差距,提出细粒度分类法和可解释模型以提升对话AI的类人能力。

Comments Accepted by ICLR 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23166 2026-03-03 cs.CV

AgentVista: Evaluating Multimodal Agents in Ultra-Challenging Realistic Visual Scenarios

AgentVista: 评估在超挑战性现实视觉场景中的多模态代理

Zhaochen Su, Jincheng Gao, Hangyu Guo, Zhenhua Liu, Lueyang Zhang, Xinyu Geng, Shijue Huang, Peng Xia, Guanyu Jiang, Cheng Wang, Yue Zhang, Yi R. Fung, Junxian He

机构 * Hong Kong University of Science and Technology(香港理工大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 AgentVista 是一个评估多模态代理在超挑战性现实视觉场景中能力的基准,通过真实场景和复杂工具交互任务揭示现有模型在长时间多模态工具使用方面的不足。

Comments The project website is available at https://agentvista-bench.github.io/, and the code is available at https://github.com/hkust-nlp/AgentVista

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19113 2026-03-03 cs.LG cs.AI stat.ML

Learning from Complexity: Exploring Dynamic Sample Pruning of Spatio-Temporal Training

从复杂性学习:探索时空训练的动态样本修剪

Wei Chen, Junle Chen, Yuqian Wu, Yuxuan Liang, Xiaofang Zhou

机构 * HKUST(GZ)(香港科技大学(广州))

AI总结 本文提出ST-Prune方法,通过动态样本修剪提升时空预测任务的训练效率和模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26819 2026-03-03 eess.AS cs.AI cs.CV cs.SD

See the Speaker: Crafting High-Resolution Talking Faces from Speech with Prior Guidance and Region Refinement

看清说话者:通过语音优先引导和区域细化生成高分辨率的说话面孔

Jinting Wang, Jun Wang, Hei Victor Cheng, Li Liu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Speech and Acoustic Laboratory, Joy Future Academy, Jingdong Corporation(语音与声学实验室、Joy Future Academy、京东公司) Aarhus University(阿arhus大学)

AI总结 本研究提出一种通过语音直接生成高分辨率说话面孔的方法,结合扩散模型与统计先验,实现高质量视频生成。

Comments 16 pages,15 figures, accepted by TASLP

Journal ref EEE Transactions on Audio, Speech and Language Processing, vol. 33, pp. 4267-4281, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26818 2026-03-03 cs.SD cs.AI cs.MM eess.AS

GACA-DiT: Diffusion-based Dance-to-Music Generation with Genre-Adaptive Rhythm and Context-Aware Alignment

GACA-DiT:基于扩散的舞蹈到音乐生成,具有风格自适应节奏和上下文感知对齐

Jinting Wang, Chenxing Li, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Tencent AI Lab(腾讯AI实验室)

AI总结 GACA-DiT通过风格自适应节奏提取和上下文感知时间对齐模块,实现了舞蹈到音乐生成的节奏一致性和时间对齐,提升了生成音乐与舞蹈动作的同步精度。

Comments 5 pages, 4 figures, submitted to Interspeech2026

Journal ref sumbitted to Interspeech2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19400 2026-03-03 cs.CV

Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes

跨视角视觉:评估视觉-语言模型在机器人场景中的空间推理能力

Zhiyuan Feng, Zhaolu Kang, Qijie Wang, Zhiying Du, Jiongrui Yan, Shubin Shi, Chengbo Yuan, Huizhi Liang, Yu Deng, Qixiu Li, Rushuai Yang, Arctanx An, Leqi Zheng, Weijie Wang, Shawn Chen, Sicheng Xu, Yaobo Liang, Jiaolong Yang, Baining Guo

机构 * Tsinghua University(清华大学) Peking University(北京大学) Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院) Hong Kong University of Science and Technology(香港科技大学) Zhejiang University(浙江大学)

AI总结 本文提出MV-RoboBench基准,评估视觉-语言模型在机器人场景中的多视角空间推理能力,揭示其在多视角机器人感知中的挑战。

Comments Accepted to ICLR 2026. Camera-ready version. Project page: https://aaronfengzy.github.io/MV-RoboBench-Webpage/

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18489 2026-03-03 cs.CV

Mono4DGS-HDR: High Dynamic Range 4D Gaussian Splatting from Alternating-exposure Monocular Videos

Mono4DGS-HDR: 从交替曝光单目视频中重建可渲染的4D高动态范围场景

Jinfeng Liu, Lingtong Kong, Mi Zhou, Jinwen Chen, Dan Xu

机构 * The Hong Kong University of Science and Technology (HKUST)(香港科学与技术大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

AI总结 Mono4DGS-HDR通过两阶段优化方法,从交替曝光单目视频中高效重建可渲染的4D HDR场景。

Comments This paper is accepted by ICLR 2026. Project page is available at https://liujf1226.github.io/Mono4DGS-HDR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06218 2026-03-03 cs.CV cs.AI

EgoNight: Towards Egocentric Vision Understanding at Night with a Challenging Benchmark

EgoNight: 向夜间视角理解迈进的挑战性基准

Deheng Zhang, Yuqian Fu, Runyi Yang, Yang Miao, Tianwen Qian, Xu Zheng, Guolei Sun, Ajad Chhatkuli, Xuanjing Huang, Yu-Gang Jiang, Luc Van Gool, Danda Pani Paudel

机构 * East China Normal University(东华大学) HKUST(GZ)(香港科技大学(广州)) Nankai University(南开大学) Fudan University(复旦大学)

AI总结 EgoNight提出首个夜间视角视觉基准,通过日夜间对齐视频和人工验证构建VQA任务,揭示低光照条件下模型性能下降问题,并引入辅助任务推动模型泛化能力提升。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21057 2026-03-03 cs.CR cs.CL

PMark: Towards Robust and Distortion-free Semantic-level Watermarking with Channel Constraints

PMark: 向鲁棒且无失真语义级水印技术迈进:在通道约束下

Jiahao Huo, Shuliang Liu, Bin Wang, Junyan Zhang, Yibo Yan, Aiwei Liu, Xuming Hu, Mingxun Zhou

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

AI总结 PMark通过代理函数框架实现鲁棒且无失真的语义级水印技术,提升对改写攻击的鲁棒性并优化采样效率。

Comments ICLR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20187 2026-03-03 cs.CL

Diversity-Enhanced Reasoning for Subjective Questions

增强多样性推理以应对主观问题

Yumeng Wang, Zhiyuan Fan, Jiayu Liu, Jen-tse Huang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出MultiRole-R1框架,通过引入视角多样性和token级多样性提升主观推理性能,实验显示其在主观任务和高级数学推理中均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04134 2026-03-03 cs.CV cs.SD eess.AS

UniCUE: Unified Recognition and Generation Framework for Chinese Cued Speech Video-to-Speech Generation

UniCUE: 中国手语提示语音视频到语音生成统一识别与生成框架

Jinting Wang, Shan Yang, Chenxing Li, Dong Yu, Li Liu

机构 * HKUST-GZ(香港科技大学-珠海校区)

AI总结 UniCUE提出首个统一框架,直接从CS视频生成语音,无需中间文本,通过整合姿态感知视觉处理器、语义对齐池和VisioPhonetic适配器,提升语音生成精度。

Comments 13 pages, 12 figures

Journal ref AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02052 2026-03-03 q-bio.BM cs.AI cs.LG q-bio.QM

General Protein Pretraining or Domain-Specific Designs? Benchmarking Protein Modeling on Realistic Applications

通用蛋白质预训练还是领域特定设计?在真实应用场景中对蛋白质建模的基准测试

Shuo Yan, Yuliang Yan, Bin Ma, Chenao Li, Haochun Tang, Jiahua Lu, Minhua Lin, Yuyuan Feng, Enyan Dai

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Pennsylvania State University(宾夕法尼亚州立大学) Xiamen University(厦门大学)

AI总结 Protap通过比较不同架构和预训练策略,在真实应用场景中评估蛋白质建模的性能,发现领域特定知识和结构信息对提升模型效果至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00530 2026-03-03 cs.AI cs.CL

CityLens: Evaluating Large Vision-Language Models for Urban Socioeconomic Sensing

CityLens:评估大型视觉-语言模型用于城市社会经济感知

Tianhui Liu, Hetian Pang, Xin Zhang, Tianjian Ouyang, Zhiyuan Zhang, Jie Feng, Yong Li, Pan Hui

机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系) School of Electronic and Information Engineering, Beijing Jiaotong University(北京交通大学电子与信息工程学院)

AI总结 CityLens通过评估大型视觉-语言模型在城市社会经济指标预测中的表现,揭示了其在可持续城市发展中的潜力与局限性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24298 2026-03-03 cs.LG cs.AI

AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning

AReaL: 一种用于语言推理的大规模异步强化学习系统

Wei Fu, Jiaxuan Gao, Xujie Shen, Chen Zhu, Zhiyu Mei, Chuyi He, Shusheng Xu, Guo Wei, Jun Mei, Jiashu Wang, Tongkai Yang, Binhang Yuan, Yi Wu

机构 * IIIS, Tsinghua University(清华信息学院) Ant Group(蚂蚁集团) HKUST(香港科技大学)

AI总结 AReaL通过异步机制提升大语言模型推理训练效率,实现GPU利用率显著提升

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00912 2026-03-03 cs.CV

VGGT-Det: Mining VGGT Internal Priors for Sensor-Geometry-Free Multi-View Indoor 3D Object Detection

VGGT-Det:挖掘VGGT内部先验用于无传感器几何多视角室内3D目标检测

Yang Cao, Feize Wu, Dave Zhenyu Chen, Yingji Zhong, Lanqing Hong, Dan Xu

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Huawei(华为) Sun Yat-Sen University(孙中山大学)

AI总结 VGGT-Det通过整合VGGT编码器和引入AG、QD组件,实现无传感器几何的多视角室内3D目标检测,提升检测性能。

Comments Accepted by CVPR 2026. Code Page: https://github.com/yangcaoai/VGGT-Det-CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00716 2026-03-03 cs.LG stat.ML

Frozen Policy Iteration: Computationally Efficient RL under Linear $Q^π$ Realizability for Deterministic Dynamics

冻结策略迭代:在确定性动态下线性$Q^π$可实现性下的计算高效强化学习

Yijing Ke, Zihan Zhang, Ruosong Wang

机构 * School of EECS, Peking University(北京大学电子工程系) Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程系) CFCS and School of Computer Science, Peking University(北京大学计算机学院)

AI总结 本文提出冻结策略迭代算法,在确定性动态下实现计算高效的强化学习,通过在线策略迭代和冻结策略技术,达到最优 regrets bound。

详情

展开后加载摘要…

URL PDF HTML 收藏