arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The University of Hong Kong(香港大学)

共收录 1511
2603.23190 2026-03-25 cs.CV

Gaze-Regularized VLMs for Ego-Centric Behavior Understanding

基于目光调节的视觉语言模型用于以自身为中心的行为理解

Anupam Pani, Yanchao Yang

机构 * HKU Musketeers Foundation Institute of Data Science, The University of Hong Kong(香港大学穆凯特基金会数据科学研究所,香港大学)

AI总结 本文提出一种基于目光调节的视觉语言模型框架,通过整合目光信息提升以自身为中心的行为理解能力,实验结果显示在语义得分上提升了近13%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23007 2026-03-25 cs.CR cs.AI

AgentRAE: Remote Action Execution through Notification-based Visual Backdoors against Screenshots-based Mobile GUI Agents

AgentRAE: 通过基于通知的视觉后门实现远程动作执行以对抗基于截图的移动GUI代理

Yutao Luo, Haotian Zhu, Shuchao Pang, Zhigang Lu, Tian Dong, Yongbin Zhou, Minhui Xue

机构 * Nanjing University of Science and Technology(南京理工大学) Macquarie University(麦考瑞大学) Western Sydney University(西澳大学) University of Hong Kong(香港大学) CSIRO’s Data61(澳大利亚CSIRO Data61)

AI总结 针对基于截图的移动GUI代理,提出AgentRAE通过自然视觉触发器诱导远程动作执行,采用两阶段管道提升代理对细微图标差异的敏感度,并通过后训练关联触发器与特定动作,实现高攻击成功率和隐蔽性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22877 2026-03-25 cs.AI

Continuous Optimization for Satisfiability Modulo Theories on Linear Real Arithmetic

基于线性实数算术的可满足性模理论的连续优化

Yunuo Cen, Daniel Ebler, Xuanyao Fong

机构 * Department of Electrical and Computer Engineering, National University of Singapore, Singapore(电子与计算机工程系,新加坡国立大学) School of Computing and Data Science, The University of Hong Kong, Hong Kong, China(计算与数据科学学院,香港大学)

AI总结 本文提出FourierSMT框架,通过扩展Walsh-Fourier展开到混合布尔-实数域,利用梯度方法解决高阶约束的满足问题,实现高效并行计算,提升大规模SMT求解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22801 2026-03-25 cs.LG

Transformers Trained via Gradient Descent Can Provably Learn a Class of Teacher Models

通过梯度下降训练的Transformer可以证明性地学习某一类教师模型

Chenyang Zhang, Qingyue Zhao, Quanquan Gu, Yuan Cao

机构 * The University of Hong Kong(香港大学) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 本文研究了通过Transformer学习各类教师模型的理论基础,证明单层Transformer能恢复教师模型的所有参数块并达到最优损失,同时展示其在分布外数据上的泛化能力。

Comments 64 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01047 2026-03-25 cs.CV cs.AI

Residual Decoding: Mitigating Hallucinations in Large Vision-Language Models via History-Aware Residual Guidance

残差解码:通过历史感知残差引导减轻大视觉-语言模型中的幻觉

Xinrong Chen, Xu Chu, Yingmin Qiu, Hengyuan Zhang, Jing Xiong, Shiyu Tang, Shuai Liu, Shaokang Yang, Cheng Yang, Hayden Kwok-Hay So, Ngai Wong

机构 * Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Hong Kong(香港大学) ByteDance Inc.(字节跳动公司)

AI总结 本文提出残差解码方法,通过利用历史信息辅助解码,纠正大视觉-语言模型中的语言先验偏差,有效抑制幻觉并提升视觉接地能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01248 2026-03-25 cs.CV

TRivia: Self-supervised Fine-tuning of Vision-Language Models for Table Recognition

TRivia: 基于视觉-语言模型的自监督微调用于表格识别

Junyuan Zhang, Bin Wang, Qintong Zhang, Fan Wu, Zichen Wen, Jialin Lu, Junjie Shan, Ziqi Zhao, Shuya Yang, Ziling Wang, Ziyang Miao, Huaping Zhong, Yuhang Zang, Xiaoyi Dong, Ka-Ho Chow, Conghui He

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiaotong University(上海交通大学) Sensetime

AI总结 TRivia通过自监督微调方法,使预训练视觉-语言模型直接从未标注的表格图像中学习表格识别,无需人工标注,提升了表格识别性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21356 2026-03-25 cs.CV cs.AI

Gaze-VLM:Bridging Gaze and VLMs through Attention Regularization for Egocentric Understanding

gaze-VLM:通过注意力正则化连接 gaze 与 VLMs 以实现 egocentric 理解

Anupam Pani, Yanchao Yang

机构 * HKU Musketeers Foundation Institute of Data Science, The University of Hong Kong(香港大学穆斯克特基金会数据科学研究所,香港大学) Department of Electrical and Electronic Engineering, The University of Hong Kong(电气电子工程系,香港大学)

AI总结 本文提出 gaze-regularized 框架,通过注意力正则化提升 VLMs 在细粒度未来事件预测和当前活动理解任务中的性能,实验表明在预测精度和鲁棒性上有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05318 2026-03-25 cs.AI

BIRD-INTERACT: Re-imagining Text-to-SQL Evaluation for Large Language Models via Lens of Dynamic Interactions

BIRD-INTERACT:通过动态交互视角重新审视大型语言模型的文本到SQL评估

Nan Huo, Xiaohan Xu, Jinyang Li, Per Jacobsson, Shipei Lin, Bowen Qin, Binyuan Hui, Xiaolong Li, Ge Qu, Shuzheng Si, Linheng Han, Edward Alexander, Xintong Zhu, Rui Qin, Ruihan Yu, Yiyao Jin, Feige Zhou, Weihao Zhong, Yun Chen, Hongyu Liu, Chenhao Ma, Fatma Ozcan, Yannis Papakonstantinou, Reynold Cheng

机构 * The University of Hong Kong(香港大学) Google Cloud(谷歌云) The BIRD Team(BIRD团队)

AI总结 本文提出BIRD-INTERACT基准,通过动态交互环境和双重评估设置,解决多轮对话中模糊查询和执行错误等问题,验证有效交互对复杂SQL任务的重要性。

Comments ICLR 2026 Oral. Dataset and code available at https://bird-interact.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01415 2026-03-25 cs.RO cs.AI

RoboMemory: A Brain-inspired Multi-memory Agentic Framework for Interactive Environmental Learning in Physical Embodied Systems

RoboMemory:一种脑启发的多记忆代理框架,用于物理具身系统中的交互环境学习

Mingcong Lei, Honghao Cai, Yuyuan Yang, Yimou Wu, Jinke Ren, Zezhou Cui, Liangchen Tan, Junkun Hong, Gehan Hu, Shuangyu Zhu, Shaohan Jiang, Ge Wang, Junyuan Tan, Zhenglin Wan, Zheng Li, Zhen Li, Shuguang Cui, Yiming Zhao, Yatong Han

机构 * FNii-Shenzhen(FNii-深圳) SSE, CUHK-Shenzhen(SSE,CUHK-深圳) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Ising AI

AI总结 本文提出RoboMemory框架,通过整合空间、时间、事件和语义记忆,提升机器人在复杂环境中的长期规划与交互学习能力,实验表明其在EmbodiedBench上成功率提升26.5%,超越现有SOTA模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22271 2026-03-24 cs.CV

DUO-VSR: Dual-Stream Distillation for One-Step Video Super-Resolution

DUO-VSR:双流蒸馏用于一步视频超分辨率

Zhengyao Lv, Menghan Xia, Xintao Wang, Kwan-Yee K. Wong

机构 * The University of Hong Kong(香港大学) Huazhong University of Science and Technology(华中科技大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

AI总结 DUO-VSR提出双流蒸馏策略,通过轨迹保留蒸馏、双流优化和偏好引导细化,解决视频超分辨率中训练不稳定和监督不足的问题,提升视觉质量和效率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22167 2026-03-24 cs.LG cs.AI cs.GT econ.TH

Calibeating Made Simple

简化版的校准问题

Yurong Chen, Zhiyi Huang, Michael I. Jordan, Haipeng Luo

机构 * Inria École Normale Supérieure PSL Research University(Inria 法国国家科学研究中心巴黎高等师范学院) The University of Hong Kong(香港大学) University of California Berkeley(加州大学伯克利分校) University of Southern California(南加州大学)

AI总结 本文研究了校准问题,通过将校准问题转化为在线学习技术,获得了通用合适损失函数的校准结果,并提出了新的多校准率和校准同时优化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21774 2026-03-24 cs.RO

Memory-Efficient Boundary Map for Large-Scale Occupancy Grid Mapping

高效内存边界图用于大规模占用网格映射

Benxu Tang, Yunfan Ren, Yixi Cai, Fanze Kong, Wenyi Liu, Fangcheng Zhu, Longji Yin, Liuyu Shi, Fu Zhang

机构 * Mechatronics and Robotic Systems (MaRS) Laboratory, Department of Mechanical Engineering, The University of Hong Kong, Hong Kong SAR, China(机械电子与机器人系统实验室,机械工程系,香港大学,香港特别行政区,中国) Department of Robotics, Perception, and Learning, KTH Royal Institute of Technology, Stockholm, Sweden(机器人、感知与学习系,皇家理工学院,斯德哥尔摩,瑞典)

AI总结 本文提出一种高效内存边界图方法,通过仅维护映射体积的边界来减少内存消耗,并设计了新的数据结构支持高效查询。

Journal ref Benxu Tang, et al. The International Journal of Robotics Research, published online 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21616 2026-03-24 cs.IT cs.LG eess.SP math.IT

Rateless DeepJSCC for Broadcast Channels: a Rate-Distortion-Complexity Tradeoff

无速率深度联合源信道编码用于广播信道:速率-失真-复杂度折中

Zijun Qin, Jingxuan Huang, Zesong Fei, Haichuan Ding, Yulin Shao, Xianhao Chen

机构 * Department of Electrical and Computer Engineering, University of Hong Kong(香港大学电子与计算机工程系) School of Information and Electronics, Beijing Institute of Technology(北京理工大学信息与电子学院) School of Cyberspace Science and Technology, Beijing Institute of Technology(北京理工大学网络空间科学与技术学院)

AI总结 本文提出一种非线性变换无速率源信道编码框架,通过整合学习的源变换与物理层LT码,实现异构接收端对速率符号数量和解码迭代的自适应调整,从而在失真、速率和解码复杂度之间实现可控折中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17495 2026-03-24 cs.CV

GroundingME: Exposing the Visual Grounding Gap in MLLMs through Multi-Dimensional Evaluation

GroundingME:通过多维评估揭示MLLMs中的视觉 grounding 隙

Rang Li, Lei Li, Shuhuai Ren, Hao Tian, Shuhao Gu, Shicheng Li, Zihao Yue, Yudong Wang, Wenhan Ma, Zhe Yang, Jingyuan Ma, Zhifang Sui, Fuli Luo

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) LLM-Core Xiaomi(小米LLM-Core) The University of Hong Kong(香港大学) Renmin University of China(中国人民大学)

AI总结 本文提出GroundingME基准,通过四个维度评估MLLMs的视觉 grounding 能力,揭示其在区分相似物体、理解空间关系、处理遮挡和拒绝无解查询方面的不足,发现最佳模型仅达到45.1%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21276 2026-03-24 cs.LG cs.AI

Aggregation Alignment for Federated Learning with Mixture-of-Experts under Data Heterogeneity

在数据异质性下基于混合专家的联邦学习聚合对齐

Zihan Fang, Qianru Wang, Haonan An, Zheng Lin, Yiqin Deng, Xianhao Chen, Yuguang Fang

机构 * Hong Kong JC STEM Lab of Smart City(香港JC STEM实验室) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Department of Electrical and Computer Engineering, The University of Hong Kong(香港大学电子与计算机工程系)

AI总结 本文针对联邦学习中混合专家模型因数据异质性导致的聚合挑战,提出FedAlign-MoE框架,通过路由一致性和专家语义对齐提升模型收敛速度和准确性。

Comments 14 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21169 2026-03-24 cs.LG

Model Evolution Under Zeroth-Order Optimization: A Neural Tangent Kernel Perspective

零阶优化下的模型演化:神经切线核视角

Chen Zhang, Yuxin Cheng, Chenchen Ding, Shuqi Wang, Jingreng Lei, Runsheng Yu, Yik-Chung WU, Ngai Wong

机构 * The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文从神经切线核视角探讨零阶优化下的模型演化,证明线性模型中预期NZK恒定,提出通过NZK解释零阶更新的核梯度下降,实验证实理论结果并展示加速效果。

Comments ICLR 2026 Workshop on Scientific Methods for Understanding Deep Learning (20 pages, 18 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21115 2026-03-24 cs.CV

LiFR-Seg: Anytime High-Frame-Rate Segmentation via Event-Guided Propagation

LiFR-Seg: 通过事件引导传播实现任意时刻高帧率分割

Xiaoshan Wu, Xiaoyang Lyu, Yifei Yu, Bo Wang, Zhongrui Wang, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

AI总结 本文提出LiFR-Seg框架,通过事件驱动的运动场和不确定性感知的变形过程,在仅使用单帧RGB图像和异步事件数据的情况下实现任意时刻的高帧率语义分割。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21104 2026-03-24 cs.RO cs.CV

CounterScene: Counterfactual Causal Reasoning in Generative World Models for Safety-Critical Closed-Loop Evaluation

CounterScene: 生成世界模型中的反事实因果推理用于安全关键闭环评估

Bowen Jing, Ruiyang Hao, Weitao Zhou, Haibao Yu

机构 * Tuojing Intelligence(途京智能) King's College London(伦敦大学国王学院) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

AI总结 CounterScene通过结构化反事实推理生成安全关键驾驶场景,通过因果对抗代理识别和冲突感知交互世界模型,提升长周期碰撞率并保持轨迹真实性。

Comments 28 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20921 2026-03-24 cs.LG

Discriminative Representation Learning for Clinical Prediction

判别表示学习用于临床预测

Yang Zhang, Li Fan, Samuel Lawrence, Shi Li

机构 * The University of Hong Kong (HKU)(香港大学)

AI总结 本文提出一种监督深度学习框架,通过最大化类间分离与类内方差比,提升临床预测性能,优于其他预训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20721 2026-03-24 cs.CV

Cross-modal Fuzzy Alignment Network for Text-Aerial Person Retrieval and A Large-scale Benchmark

跨模态模糊对齐网络用于文本-空中人检索及一个大规模基准

Yifei Deng, Chenglong Li, Yuyang Zhang, Guyue Hu, Jin Tang

机构 * State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology(光电信息采集与防护技术国家重点实验室) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) The University of Hong Kong(香港大学)

AI总结 本文提出跨模态模糊对齐网络,通过模糊逻辑量化token级可靠性,结合地面图像作为桥梁代理,提升文本与空中图像的语义对齐鲁棒性,并构建了大规模基准数据集AERI-PEDES。

Comments Accepted by CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16929 2026-03-24 cs.LG cs.AI cs.CL

MHPO: Modulated Hazard-aware Policy Optimization for Stable Reinforcement Learning

MHPO:基于稳定强化学习的调节危险感知策略优化

Hongjun Wang, Wei Liu, Weibo Gu, Xing Sun, Kai Han

机构 * The University of Hong Kong(香港大学) Tencent Youtu Lab(腾讯优图实验室)

AI总结 MHPO通过引入Log-Fidelity Modulator和Decoupled Hazard Penalty,实现对策略偏差的精细调控,提升强化学习的稳定性和性能。

Comments 18 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14188 2026-03-24 cs.CV

Joint Segmentation and Grading with Iterative Optimization for Multimodal Glaucoma Diagnosis

多模态青光眼诊断的联合分割与分级迭代优化方法

Zhiwei Wang, Yuxing Li, Meilu Zhu, Defeng He, Edmund Y. Lam

机构 * Department of Electrical and Electronic Engineering, The University of Hong Kong, Hong Kong, China(香港大学电子与电气工程系) College of Information Engineering, Zhejiang University of Technology, Hangzhou, China(浙江工业大学信息工程学院)

AI总结 本文提出一种迭代多模态优化模型,通过中层融合策略整合眼底和OCT特征,并利用跨模态特征对齐模块减少模态差异,实现青光眼的精确分割与分级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07496 2026-03-24 cs.CR cs.AI

From Thinker to Society: Security in Hierarchical Autonomy Evolution of AI Agents

从思考者到社会:AI智能体分层自主性演化的安全问题

Xiaolei Zhang, Lu Zhou, Xiaogang Xu, Jiafei Wu, Tianyu Du, Heqing Huang, Hao Peng, Zhe Liu

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Collaborative Innovation Center of Novel Software Technology and Industrialization(新型软件技术与产业化协同创新中心) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Independent Researcher(独立研究者) Zhejiang Normal University(浙江师范大学) School of Software Technology, Zhejiang University(浙江大学软件学院) Ningbo Global Innovation Center, Zhejiang University(宁波全球创新中心,浙江大学)

AI总结 研究探讨了AI智能体分层自主性演化中的安全挑战,提出三级安全框架并分析现有防御措施的不足,旨在指导可信AI智能体系统的多层防御架构设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01164 2026-03-24 cs.CV

FREE-Edit: Using Editing-aware Injection in Rectified Flow Models for Zero-shot Image-Driven Video Editing

FREE-Edit:使用编辑感知注入在修正流模型中进行零样本图像驱动视频编辑

Maomao Li, Yunfei Liu, Yu Li

机构 * The University of Hong Kong(香港大学) International Digital Economy Academy (IDEA)(国际数字经济学院(IDEA))

AI总结 本文提出FREE-Edit框架,通过编辑感知注入提升图像驱动视频编辑效果,无需微调即可在多种场景中生成高质量输出。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00835 2026-03-24 cs.AI cs.CV

SynPO: Synergizing Descriptiveness and Preference Optimization for Video Detailed Captioning

SynPO:融合描述性和偏好优化的视频详细描述生成

Jisheng Dang, Yizhou Zhang, Hao Ye, Teng Wang, Siming Chen, Huicheng Zheng, Yulan Guo, Jianhuang Lai, Bin Hu

机构 * Sun Yat-Sen University(中山大学) Lanzhou University(兰州大学) The University of Hong Kong(香港大学) Beijing Institute of Technology(北京理工大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出SynPO方法,通过偏好学习提升视频描述生成性能,解决直接偏好优化的局限性,提升训练效率20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20016 2026-03-23 cs.CV

CFCML: A Coarse-to-Fine Crossmodal Learning Framework For Disease Diagnosis Using Multimodal Images and Tabular Data

CFCML:一种用于多模态图像和表格数据疾病诊断的粗到细跨模态学习框架

Tianling Liu, Hongying Liu, Fanhua Shang, Lequan Yu, Tong Han, Liang Wan

机构 * College of Intelligence and Computing(智能与计算学院) Tianjin University(天津大学) Medical School of Tianjin University(天津大学医学院) Peng Cheng Lab(鹏城实验室) Department of Statistics and Actuarial Science, School of Computing and Data Science, The University of Hong Kong(统计与精算系,计算与数据科学学院,香港大学) Department of Radiology, Tianjin Huanhu Hospital(天津华医院放射科) Tianjin Key Laboratory of Cerebral Vascular and Neurodegenerative Diseases(天津脑血管与神经退行性疾病重点实验室)

AI总结 本文提出CFCML框架,通过粗到细的跨模态学习逐步缩小多模态数据间的模态差距,提升诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19795 2026-03-23 cs.CV

Controllable Text-to-Motion Generation via Modular Body-Part Phase Control

通过模块化身体部位相控实现可控的文本到运动生成

Minyue Dai, Ke Fan, Anyi Rao, Jingbo Wang, Bo Dai

机构 * Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) HKUST(香港科技大学) Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学)

AI总结 本文提出模块化身体部位相控方法,通过紧凑的标量相界面实现局部化编辑,保留运动整体一致性,提供可控的文本到运动生成方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19637 2026-03-23 cs.CV

UniBioTransfer: A Unified Framework for Multiple Biometrics Transfer

UniBioTransfer: 多生物特征转移的统一框架

Caiyi Sun, Yujing Sun, Xiangyu Li, Yuhang Zheng, Yiming Ren, Jiamin Wang, Yuexin Ma, Siu-Ming Yiu

机构 * The University of Hong Kong(香港大学) Digital Trust Centre, Nanyang Technological University(南洋理工大学数字信任中心) ShanghaiTech University(上海科技大学)

AI总结 UniBioTransfer 提出了一种统一框架,能够处理多种深度面部生成任务,通过统一数据构建策略和创新的BioMoE模型,解决数据不足和跨任务冲突问题,实现高效泛化和扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19628 2026-03-23 cs.CV cs.AI

Dual Prompt-Driven Feature Encoding for Nighttime UAV Tracking

双提示驱动的夜间无人机跟踪特征编码

Yiheng Wang, Changhong Fu, Liangliang Yao, Haobo Zuo, Zijie Zhang

机构 * Pratt School of Engineering, Duke University(杜克大学工程学院) School of Mechanical Engineering, Tongji University(同济大学机械工程学院) Shanghai Key Laboratory of Wearable Robotics and Human Machine Interaction, Tongji University(同济大学可穿戴机器人与人机交互重点实验室) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院)

AI总结 本文提出双提示驱动特征编码方法,通过多尺度频率感知光照提示和动态视角提示器提升夜间无人机跟踪的鲁棒性。

Comments Accepted to IEEE International Conference on Robotics and Automation 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20945 2026-03-23 cs.CL cs.AI

The Art of Efficient Reasoning: Data, Reward, and Optimization

高效推理的艺术:数据、奖励与优化

Taiqiang Wu, Zenan Xu, Bo Zhou, Ngai Wong

机构 * The University of Hong Kong(香港大学) LLM Department, Tencent(腾讯人工智能实验室)

AI总结 本文系统研究了大型语言模型的高效推理机制,通过精细化指标评估发现训练过程分为长度适应与推理优化两阶段,提出保持正奖励密度以避免短即正确陷阱,并验证了在不同领域和难度下的通用性。

Comments Tech Report, Insights on Efficient Reasoning via Reward Shaping

详情

展开后加载摘要…

URL PDF HTML 收藏