arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

共收录 254
2503.03556 2026-08-07 cs.CV cs.RO 版本更新

Afford-X: Generalizable and Slim Affordance Reasoning for Task-oriented Manipulation

Afford-X:面向任务型操作的通用且轻量化的可供性推理模型

Xiaomeng Zhu, Yuyang Li, Leiyao Cui, Pengfei Li, Huan-ang Gao, Yixin Zhu, Hao Zhao

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) Institute for Al Industry Research, Tsinghua University(清华大学人工智能产业研究院) Department of Computer Science, Tsinghua University(清华大学计算机科学系)

AI总结 研究人员推出LVIS-Aff数据集,开发了Afford-X可供性推理模型,其性能优于现有非LLM方法和此前会议论文结果,参数紧凑、推理速度快,可部署于本地设备助力机器人任务导向型操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02347 2026-08-06 cs.AI 版本更新

Mamba with Hierarchical Memory: Solving Representation Bottleneck in Long Sequence Modeling

带分层记忆的Mamba:解决长序列建模中的表示瓶颈

Qinwen Wang, Jieping Luo, Aoxiang Qin, Ruoyu Zhao, Jianxiong Tang, Wei Zhang, Zhichao Lu, Luziwei Leng

机构 * The Hong Kong University of Science and Technology(香港科技大学) University of Oxford(牛津大学) The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Hainan Bielefeld University of Applied Sciences(海南比勒费尔德应用科学大学) BrainGalaxy

AI总结 该研究提出分层记忆Mamba(HMM),通过分层记忆机制解决Mamba类循环线性注意力模型的长序列表示瓶颈,在两项任务上提升性能且参数和训练开销增加极少。

Comments 19 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12000 2026-08-06 cs.CV 版本更新

MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors

MetaView:基于尺度感知隐式几何先验的单目新视图合成

Yufei Cai, Xuesong Niu, Hao Lu, Kun Gai, Kai Wu, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) Kolors Team, Kuaishou Technology(快手科技色彩团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 研究提出MetaView框架,结合隐式几何建模与少量显式3D线索,利用前馈几何感知网络隐式几何先验及度量深度,实现大视角下单目新视图合成,实验证明该方法在挑战性场景中显著优于现有方法且泛化能力强。

Comments accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11868 2026-08-06 cs.LG q-bio.QM 版本更新

MemNovo: Look Back at the Spectrum for Balanced De Novo Peptide Sequencing from Mass Spectrometry

MemNovo: 回顾谱图以实现质谱中平衡的从头肽段测序

Dongxin Lyu, Jingbo Zhou, Hongxin Xiang, Yuqiang Li, Jun Xia

机构 * Westlake University(西湖大学) Hunan University(湖南大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) HKUST-GZ & HKUST(香港科技大学(广州)与香港科技大学)

AI总结 针对现有Transformer模型在从头肽段测序中过度依赖生成序列先验而忽视谱图证据的问题,提出训练无关的即插即用机制MemNovo,通过建立持久谱记忆库和超保守残差连接在解码阶段注入谱特征,显著提升氨基酸和肽段精度。

Comments Code: https://github.com/AIMS-Lab-HKUSTGZ/MemNovo

Journal ref Knowledge Discovery and Data Mining(KDD), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06140 2026-08-06 cs.CV cs.AI 版本更新

Place-it-R1: Unlocking Environment-aware Reasoning Potential of MLLM for Video Object Insertion

Place-it-R1: 解锁多模态大语言模型在视频物体插入中的环境感知推理潜力

Bohai Gu, Taiyi Wu, Dazhao Du, Jian Liu, Shuai Yang, Xiaotong Zhao, Alan Zhao, Song Guo

机构 * HKUST(香港科技大学) Tencent Video(腾讯视频) Peking University(北京大学)

AI总结 Place-it-R1通过多模态大语言模型的环境感知推理能力,实现物理一致的视频物体插入,提供两种模式以平衡保真度与合理性。

Comments https://nevsnev.github.io/Place-it-R1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19161 2026-08-06 cs.CV 版本更新

Flash-VAED: Plug-and-Play VAE Decoders for Efficient Video Generation

Flash-VAED: 用于高效视频生成的即插即用VAE解码器

Lunjie Zhu, Yushi Huang, Xingtong Ge, Yufei Xue, Zhening Liu, Yumeng Zhang, Zehong Lin, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学)

AI总结 Flash-VAED通过通道剪枝和分阶段运算优化,实现了高效视频生成的高质量与高速度平衡。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11745 2026-08-06 cs.AI 版本更新

Text2GraphQuery-Bench: A Text to Graph Query Benchmark

Text2GQL-Bench: 一个文本到图查询语言基准 [实验、分析与基准]

Songlin Lyu, Lujie Ban, Zihang Wu, Tianqi Luo, Jirong Liu, Ayoub Moussaid, Oskar van Rest, Heng Lin, Chenhao Ma, Nan Tang, Shipeng Qi, Yongchao Liu, Zhan Qiu, Juelu Zhang, Jiajun Zheng

机构 * Ant Group(蚂蚁集团) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Xi'an Polytechnic University(西安理工大学)

AI总结 Text2GQL-Bench是一个统一的文本到图查询语言基准,通过多领域数据集和评估方法,揭示了ISO-GQL生成中的方言差距,并展示了通过充足示例提升模型性能的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01269 2026-08-05 cs.CL cs.AI 版本更新

ACE-GraphRAG: Agentic Context Engineering for Hierarchical GraphRAG

ACE-GraphRAG:面向分层GraphRAG的智能体上下文工程

Yongfeng Huang, Yuren Lai, Ruiying Chen, Haoyu Huang, Mingming Zhao, James Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) Wuhan University of Technology(武汉理工大学) The Hong Kong University of Science and Technology(香港科技大学) Huawei Noah’s Ark Lab(华为诺亚方舟实验室)

AI总结 ACE-GraphRAG针对分层GraphRAG的表示-推理差距,提出两种自适应上下文策略,在多任务基准上优于现有RAG和GraphRAG基线,验证了动态上下文构建策略的有效性。

Comments Withdrawn because the manuscript was posted prematurely before completion of the required internal review and release authorization

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29440 2026-08-05 cs.AI 版本更新

Beyond Retrieval: Analytic Memory for Multimodal Agents

超越检索:多模态智能体的分析记忆

Zhoujin Tian, Hao Zhang, Yao Tian, Cheng Chen, Yakun Li, Lei Zhang, Xiaofang Zhou

机构 * HKUST(香港科技大学) ByteDance(字节跳动)

AI总结 本文提出支持检索与分析记忆的AdaMM框架,在MemEye、MemGallery基准上分别提升多模态智能体长期记忆性能11.3%、7.3%,拓展了多模态记忆能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22143 2026-08-05 cs.LG cs.AI 版本更新

TriGlue: a Biology-Inspired Generative Model for Generating Molecular Glue-Induced Ternary Complex

TriGlue:一种用于生成分子胶水诱导三元复合物的生物启发式生成模型

Yuliang Yan, Shuo Yan, Haochun Tang, Yiqin Sun, Enyan Dai

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Jilin University(吉林大学) University of Sydney(悉尼大学)

AI总结 研究针对分子胶水计算设计未充分探索的问题,提出生物启发式生成框架TriGlue,将三元复合物生成分解为界面估计和条件复合物生成两阶段,经实验验证其能生成有效分子和合理复合物,加速分子胶水发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21472 2026-08-05 cs.CV 版本更新

Stream3D: Sequential Multi-View 3D Generation via Evidential Memory

Stream3D: 基于证据记忆的序列多视角3D生成

Kaichen Zhou, Zeyang Bai, Xinhai Chang, Mengyu Wang, Paul Liang, Fangneng Zhan

机构 * World Mind Lab, HKUST(世界心智实验室,香港科技大学) Media Lab and EECS, MIT(媒体实验室和电子工程与计算机科学系,麻省理工学院) Kempner Institute, Harvard University(凯普纳研究所,哈佛大学)

AI总结 提出Stream3D,一种无需训练的流式机制,通过维护紧凑的证据记忆缓存关键历史帧,将冻结的视角条件3D生成器转换为流式生成器,解决单目视频流中3D生成的时间不一致问题。

Comments Multi-view 3D Generation, Streaming 3D Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25459 2026-08-05 cs.RO 版本更新

GS-Playground: A High-Throughput Photorealistic Simulator for Vision-Informed Robot Learning

GS-Playground:一种高吞吐量的视觉真实模拟器用于基于视觉的机器人学习

Yufei Jia, Heng Zhang, Ziheng Zhang, Junzhe Wu, Mingrui Yu, Zifan Wang, Dixuan Jiang, Zheng Li, Chenyu Cao, Zhuoyuan Yu, Xun Yang, Haizhou Ge, Yuchi Zhang, Jiayuan Zhang, Zhenbiao Huang, Tianle Liu, Shenyu Chen, Jiacheng Wang, Bin Xie, Xuran Yao, Xiwa Deng, Guangyu Wang, Jinzhi Zhang, Lei Hao, Zhixing Chen, Yuxiang Chen, Anqi Wang, Hongyun Tian, Yiyi Yan, Zhanxiang Cao, Yizhou Jiang, Hanyang Shao, Yue Li, Lu Shi, Bokui Chen, Wei Sui, Hanqing Cui, Yusen Qin, Ruqi Huang, Lei Han, Tiancai Wang, Guyue Zhou

机构 * THU(清华大学) Motphys Dexmal DISCOVER Robotics HKUST(GZ)(香港科技大学(广州)) BIT(北京理工大学) NUS(新加坡国立大学) HITSZ(哈尔滨工业大学) XJTU(西安交通大学) NJU(南京大学) SJTU(上海交通大学) D-Robotics

AI总结 GS-Playground通过高吞吐量的多模态模拟框架,结合高效物理引擎和3DGS渲染管道,提升视觉强化学习的效率,降低大规模视觉RL的门槛,实现感知与物理的无缝衔接。

Comments Robotics: Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23586 2026-08-05 cs.CV cs.CL cs.MM cs.SD eess.AS 版本更新

Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling

Talker-T2AV:基于自回归扩散模型的联合说话音频视频生成

Zhen Ye, Xu Tan, Aoxiong Yin, Hongzhan Lin, Guangyan Zhang, Peiwen Sun, Yiming Li, Chi-Min Chan, Wei Ye, Shikun Zhang, Wei Xue

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Independent Researcher(独立研究者)

AI总结 本文提出Talker-T2AV,通过共享骨干和模态特定解码器实现音频视频联合生成,提升跨模态一致性与生成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07916 2026-08-05 cs.CV 版本更新

Tarot-SAM3: Training-free SAM3 for Any Referring Expression Segmentation

Tarot-SAM3: 无需训练的SAM3用于任意指称表达分割

Weiming Zhang, Dingwen Xiao, Songyue Guo, Guangyu Xiang, Shiqi Wen, Minwei Zhao, Lei Chen, Lin Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学)

AI总结 Tarot-SAM3通过引入推理辅助提示和自修复机制,实现对任意指称表达的高效分割,有效解决传统方法对长或隐含表达的处理难题。

Comments We need to make a huge revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14010 2026-08-05 cs.CV cs.AI 版本更新

A Deployment-Friendly Foundational Framework for Efficient Computational Pathology

一种适用于部署的高效计算病理学基础框架

Yu Cai, Cheng Jin, Zhengyu Zhang, Jiabo Ma, Fengtao Zhou, Yingxue Xu, Zhengrui Guo, Yihui Wang, Zhengyu Zhang, Ling Liang, Yonghao Tan, Pingcheng Dong, Du Cai, On Ki Tang, Chenglong Zhao, Zhijian Cen, Ying Tan, Xi Wang, Can Yang, Yali Xu, Jing Cui, Zhenhui Li, Ronald Cheong Kin Chan, Yueping Liu, Feng Gao, Xiuming Zhang, Li Liang, Hao Chen, Kwang-Ting Cheng

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) Department of Pathology, Nanfang Hospital, School of Basic Medical Sciences, Southern Medical University(病理学系,南芳医院,南方医科大学) Guangdong Province Key Laboratory of Molecular Tumor Pathology(广东省分子肿瘤病理学重点实验室) Jinfeng Laboratory, Chongqing, China(锦峰实验室,重庆,中国) Department of General Surgery (Colorectal Surgery), The Sixth Affiliated Hospital, Sun Yat-sen University(普外科(结直肠外科),中山大学第六附属医院)

AI总结 LitePath是一种高效计算病理学基础框架,通过压缩模型和自适应碎片选择器,显著降低计算成本,实现快速、节能的病理图像分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10350 2026-08-05 math.NA cs.LG cs.NA 版本更新

Prescribed-Basis Coefficient-to-Coefficient Neural Operator for Partial Differential Equations

通过固定基空间中的系数映射学习算子

Chuqi Chen, Yang Xiang, Weihong Zhang

机构 * Department of Mathematics(数学系) University of Michigan(密歇根大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Algorithms of Machine Learning and Autonomous Driving Research Lab(机器学习与自动驾驶算法研究实验室) HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute(香港科技大学深圳-香港协同创新研究机构)

AI总结 FB-C2CNet通过固定基空间中的系数映射学习算子,有效降低计算复杂度并提升训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03621 2026-08-05 cs.CV 版本更新

ReCamDriving: LiDAR-Free Camera-Controlled Video Synthesis for Novel Trajectories

ReCamDriving:无需LiDAR的相机控制新型轨迹视频生成

Yaokun Li, Shuaixian Wang, Mantang Guo, Jiehui Huang, Taojun Ding, Mu Hu, Kaixuan Wang, Shaojie Shen, Guang Tan

机构 * Sun Yat-sen University(中山大学) ZYT Shenzhen Polytechnic University(深圳职业技术大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 ReCamDriving通过基于3DGS的密集渲染和两阶段训练策略,实现了无需LiDAR的相机可控新型轨迹视频生成,构建了ParaDrive数据集并展示了卓越的生成效果。

Comments Project page: https://recamdriving.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17390 2026-08-05 cs.RO 版本更新

FGGS-LiDAR: Ultra-Fast, GPU-Accelerated Simulation from General 3DGS Models to LiDAR

FGGS-LiDAR:从通用3DGS模型到LiDAR的超快速GPU加速仿真

Junzhe Wu, Yufei Jia, Yiyi Yan, Zhixing Chen, Tiao Tan, Zifan Wang, Guangyu Wang, BoKui Chen, Guyue Zhou

机构 * Tsinghua University, Shenzhen, China(清华大学深圳研究院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) DISCOVER Robotics Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR))

AI总结 提出FGGS-LiDAR框架,通过体积离散化和TSDF提取将预训练3DGS资产转换为水密网格,结合GPU加速光线投射实现超500 FPS的LiDAR仿真,在并行设置中比Isaac Sim低一个数量级延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15933 2026-08-04 cs.CV 版本更新

Distributional Matching for Vector Quantization: A Unified Theoretical and Empirical Framework

用于矢量量化的分布匹配:一个统一的理论和实证框架

Xianghong Fang, Litao Guo, Hengchao Chen, Yuxuan Zhang, XiaofanXia, Dingjie Song, Yexin Liu, Hao Wang, Harry Yang, Qiang Sun, Yuan Yuan

机构 * University of Toronto(多伦多大学) The Hong Kong University of Science and Technology(香港科技大学) Boston College(波士顿学院) Lehigh University(里海大学) Southern University of Science and Technology(南方科技大学)

AI总结 针对现有矢量量化方法训练不稳定和码本崩溃问题,提出分布匹配框架,通过对齐特征和码向量分布缓解上述问题,经理论分析和实验验证,基于瓦瑟斯坦距离目标实例化该框架,在视觉tokenization基准上表现有效且鲁棒。

Comments 33 pages, 17 figures, and 16 tables. arXiv admin note: substantial text overlap with arXiv:2506.15078

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05158 2026-08-04 cs.CL cs.AI cs.MA 版本更新

Streaming Communication in Multi-Agent Reasoning

多智能体推理中的流式通信

Zhen Yang, Xiaogang Xu, Wen Wang, Cong Chen, Xander Xu, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) Alibaba Group(阿里巴巴集团) ZJU(浙江大学) HKUST(香港科技大学)

AI总结 提出流式多智能体推理系统StreamMA,通过将推理步骤实时流式传输给下游智能体来降低延迟,并意外地提升了效果,同时首次给出流式、串行和单协议三种模式的闭式联合分析。

Comments project page: https://zhenyangcs.github.io/StreamMA-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14322 2026-08-04 cs.AI 版本更新

TeachArena: Are Language Agents Ready for Realistic Teaching Work?

代理是否准备好教学?一个多阶段基准用于现实世界教学工作流程

Zixin Chen, Peng Liu, Rui Sheng, Haobo Li, Jianhong Tu, Xiaodong Deng, Kashun Shum, Dayiheng Liu, Huamin Qu

机构 * Hong Kong University of Science and Technology(香港科技大学) Qwen Team, Alibaba Group(阿里集团通义实验室)

AI总结 本文提出EduAgentBench基准,用于评估教学代理的全面能力,发现当前模型在教学任务中的表现有限,但仍为开发未来教学代理提供了测量基础。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19040 2026-08-04 cs.LG 版本更新

When Differential Privacy Meets Wireless Federated Learning: An Improved Analysis for Privacy and Convergence

当差分隐私遇见无线联邦学习:一种改进的隐私与收敛分析

Chen Yaoling, Liang Hao, Tu Xiaotong

机构 * School of Informatics, Xiamen University, China(厦门大学信息学院,中国) Internet of Things Thrust, Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州)物联网研究组,中国)

AI总结 本文研究了差分隐私无线联邦学习中隐私损失的精确表征及收敛性,提出通用非凸损失目标下的分析方法,明确设备选择与小批量采样影响,证明隐私损失可收敛于常数,建立梯度裁剪下的收敛保证及隐私-效用权衡。

Comments need revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27577 2026-08-04 cs.CV cs.RO 版本更新

Structured Observation Language for Efficient and Generalizable Vision-Language Navigation

结构化观察语言用于高效且通用的视觉-语言导航

Daojie Peng, Fulong Ma, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出SOL-Nav框架,通过将视觉观察转化为结构化语言描述,提升视觉-语言导航的效率和泛化能力,实验表明其在减少模型规模和训练数据依赖方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15829 2026-08-04 cs.ET cs.AI cs.CV cs.NE 版本更新

Human-like working memory signatures emerge from intrinsically plastic artificial neurons for robust dynamic vision

物理驱动的人类样工作记忆在动态视觉中优于数字网络

Jingli Liu, Huannan Zheng, Bohao Zou, Kezhou Yang

机构 * Microelectronics Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)微电子研究组)

AI总结 本文提出基于物理的Intrinsic Plasticity Network (IPNet),通过磁隧道结的焦耳加热弛豫动态实现类人工作记忆,显著提升动态视觉任务的效率与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10485 2026-08-04 cs.AI 版本更新

Panning for Gold: Expanding Domain-Specific Knowledge Graphs with General Knowledge

寻找黄金:利用通用知识图谱扩展领域特定知识图谱

Runhao Zhao, Weixin Zeng, Wentao Zhang, Chong Chen, Zhengpin Li, Xiang Zhao, Lei Chen

机构 * National Key Laboratory of Big Data and Decision(大数据与决策国家重点实验室) National University of Defense Technology(国防科技大学) The Center for machine learning research(机器学习研究中心) Peking University(北京大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 本文提出领域特定知识图谱融合任务,通过神经符号框架ExeFuse,利用通用知识图谱提升领域知识图谱的完整性和实用性。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20449 2026-08-04 cs.CL 版本更新

LM-mixup: Text Data Augmentation via Language Model based Mixup

LM-mixup:基于语言模型的混合文本数据增强方法

Zhijie Deng, Zhouan Shen, Ling Li, Yao Zhou, Zhaowei Zhu, Yanji He, Wei Wang, Jiaheng Wei

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) BIAI, ZJUT & D5Data.ai(BIAI、ZJUT及D5Data.ai)

AI总结 本文提出LM-Mixup方法,通过构建MIXTURE数据集并结合监督微调与GRPO强化学习,仅用3%的蒸馏数据即可高效增强低质量指令跟随数据,提升LLMs的指令微调效率与性能。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07163 2026-08-04 cs.RO cs.CV 版本更新

Mamba Policy: Towards Efficient 3D Diffusion Policy with Hybrid Selective State Models

Mamba Policy:基于混合选择性状态模型的高效3D扩散策略

Jiahang Cao, Qiang Zhang, Jingkai Sun, Jiaxu Wang, Hao Cheng, Yulin Li, Jun Ma, Kun Wu, Zhiyuan Xu, Yecheng Shao, Wen Zhao, Gang Han, Yijie Guo, Renjing Xu

机构 * Microelectronics Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)微电子领域) Division of Emerging Interdisciplinary Areas, The Hong Kong University of Science and Technology(香港科技大学新兴交叉领域 division) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) Center for X-Mechanics, Zhejiang University(浙江大学X力学中心)

AI总结 本研究提出Mamba Policy,以XMamba Block融合Mamba与注意力机制,参数量减超80%,在Adroit等数据集上性能优异且计算资源需求低,长 horizon 场景鲁棒性更强。

Comments Accepted to IROS 2025. Project Page: https://sagecao1125.github.io/mamba_policy/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07121 2026-08-04 cs.LG cs.AI cs.NE 版本更新

Quality-Diversity Red-Teaming: Automated Generation of High-Quality and Diverse Attackers for Large Language Models

质量-多样性红队测试:针对大语言模型的高质量多样化攻击者自动生成

Ren-Jian Wang, Ke Xue, Zeyu Qin, Ziniu Li, Sheng Tang, Hao-Tian Li, Shengcai Liu, Zhi Yu, Yuanpeng Tan, Chao Qian

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong, Shenzhen(香港大学深圳校区) Southern University of Science and Technology(南方科技大学)

AI总结 该研究提出QDRT框架,通过训练多专用攻击者生成高质量多样化攻击,提升LLM安全评估的多样性与有效性,支持LLM负责任部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18819 2026-08-04 cs.CV 版本更新

Parameter-Efficient CLIP Adaptation for 3D Understanding via Unified Tokenization

用于3D理解的参数高效CLIP适配:通过统一分词实现

Guofeng Mei, Qinfeng Xiao, Bin Ren, Luigi Riz, Juan Liu, Xiaoshui Huang, Xu Zheng, Nicu Sebe, Ming-Hsuan Yang, Fabio Poiesi

机构 * Fondazione Bruno Kessler(布鲁诺·科塞拉基金会) University of Trento(特伦托大学) University of Pisa(比萨大学) Beijing Forestry University(北京林业大学) Shanghai Jiao Tong University(上海交通大学) Hong Kong University of Science and Technology (GZ)(香港科技大学) Shandong University(山东大学) University of California, Merced(加州大学默塞德分校)

AI总结 本文提出参数高效框架UTok3D,通过学习尺度归一化3D分词器,实现冻结CLIP视觉主干在无标注情况下对不同尺度点云的复用,完成3D分割任务。

Comments 14 pages, tokenizer

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21296 2026-08-04 cs.LG cs.AI 版本更新

Fairness in Augmented Graph Learning: A Survey

增强图学习中的公平性:一项综述

Renqiang Luo, Huafei Huang, Ziqi Xu, Xikun Zhang, Enyan Dai, Bo Yang, Feng Xia

机构 * Jilin University(吉林大学) RMIT University(皇家墨尔本理工大学) Nanyang Technological University(南洋理工大学) Dalian University of Technology(大连理工大学) University of South Australia(澳大利亚南澳大利亚大学) Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 本综述针对增强图学习(AGL)的新型交叉公平挑战,系统研究其FairGX范式,梳理偏差源与分类法,分析ML范式对公平性的影响,明确未来研究方向,为构建稳健公平图系统提供路线图。

Comments Accepted in TKDE, 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏