arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-08-06 至 2026-08-06 共收录 12
2608.04968 2026-08-06 cs.LG 新提交

EvolveNet: Collaborative Harness Evolution for Agent Self-Improvement

EvolveNet:智能体自我改进的协作式工具链进化

Jun Nie, Yonggang Zhang, Qianshu Cai, Yiu-ming Cheung, Xinmei Tian, Bo Han

机构 * Hong Kong Baptist University(香港浸会大学) University of Science and Technology of China(中国科学技术大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 EvolveNet提出协作式工具链进化范式,通过数据本地智能体的程序适配组合实现共享工具链改进,在五类任务场景均获增益,异构工作负载下效果更显著。

Comments 20 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04956 2026-08-06 cs.CV 新提交

ContextMaster: Interactive Multi-Shot Video Creation via Fixed-Budget Sparse Context Routing

ContextMaster:基于固定预算稀疏上下文路由的交互式多镜头视频创作

Xu Guo, Zhengxuan Wei, Xinghui Li, Hanzhuo Huang, Xinyu Liu, Xiangyang Luo, Min Wei, Yiran Zhu, Qiulin Wang, Yulong Xu, Xintao Wang, Pengfei Wan, Qi Fan, Xiangwang Hou

机构 * Tsinghua University(清华大学) Nanjing University(南京大学) Kling Team, Kuaishou Technology(快手科技影团队) ShanghaiTech University(上海科技大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 该研究提出统一模型ContextMaster,以固定预算稀疏上下文路由等技术解决交互式多镜头视频创作问题,在基础任务表现优于专用基线,单GPU达16 FPS且支持灵活工作流。

Comments Project page: https://guoxu1233.github.io/ContextMaster/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04828 2026-08-06 cs.CL 新提交

Skill-Use: Can LLMs Actually Use Skills in Agentic Harnesses?

技能使用:智能体框架中的大语言模型(LLM)真的能使用技能吗?

Jinyi Han, Yuanjian Xu, Ying Liao, Xinyi Wang, Zishang Jiang, Zixiang Di, Fanyang Lu, Zhichao Hu, Yanghua Xiao

机构 * East China Normal University(华东师范大学) Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学) Tencent Hunyuan(腾讯混元)

AI总结 本研究推出Skill-Use基准,评估智能体在渐进式披露下的技能使用,发现8个LLM在两个框架下的SU分数仅0.613,技能使用是依赖框架的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04766 2026-08-06 cs.CV cs.AI 新提交

FUSEP: A Multi-Center Benchmark for Diverse Tasks in Early Pregnancy Fetal Ultrasound Screening

FUSEP:用于早孕胎儿超声筛查多样化任务的多中心基准

Bin Pu, Jiewen Yang, Liwen Wang, Ying Tan, Guannan He, Xingbo Dong, Qika Lin, Jiarong Guo, Lixian Yang, Zuozhu Liu, Shengli Li, Kenli Li

机构 * Hunan University(湖南大学) The Hong Kong University of Science and Technology(香港科技大学) Anhui University(安徽大学) Shenzhen Maternity and Child Healthcare Hospital(深圳市妇幼保健院) Sichuan Provincial Maternity and Child Health Care Hospital(四川省妇幼保健院) National University of Singapore(新加坡国立大学) Yunnan Maternal and Child Health Hospital(云南省妇幼保健院) Zhejiang University(浙江大学)

AI总结 本研究提出首个公开的早孕胎儿超声筛查多中心基准FUSEP数据集,含4017张超声图像及45820个标注,评估了多种学习方法在相关任务的性能,助力医学智能辅助诊断等任务开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04568 2026-08-06 cs.CV 新提交

Talk2Sensors: 3D Visual Grounding in Autonomous Driving via Sensor-Adaptive Physical Cue Matching

Talk2Sensors:基于传感器自适应物理线索匹配的自动驾驶3D视觉 grounding

Runwei Guan, Di Tian, Ningwei Ouyang, Ruixiao Zhang, Shaofeng Liang, Haocheng Zhao, Lianqing Zheng, Xiaokai Bai, Guotao Wang, Daizong Liu, Henghui Ding, Hui Xiong

机构 * Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能学域) MMLab, CUHK(香港中文大学MMLab) School of Transportation Science and Engineering, Harbin Institute of Technology(哈尔滨工业大学交通科学与工程学院) School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西交利物浦大学先进技术学院) School of Electronics and Computer Science, University of Southampton(南安普顿大学电子与计算机科学学院) School of Intelligent Manufacturing and Smart Transportation, Suzhou City University(苏州城市学院智能制造与智能交通学院) Qingdao University of Science and Technology(青岛科技大学) Institute for Math & AI, Wuhan University(武汉大学数学与人工智能研究院) Institute of Big Data, Fudan University(复旦大学大数据研究院)

AI总结 针对现有室外3D视觉 grounding 未充分利用多传感器互补物理属性的问题,提出首个多传感器数据集Talk2Sensors及TSFormer框架,在相关基准上实现了最优性能。

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04436 2026-08-06 cs.CV 新提交

ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation

ToolArtist:用于智能体图像生成的工具使用统一多模态模型

Jiahao Zhao, Xiaomin Yu, Zhongxiang Sun, Fengwei Teng, Chengwei Qin, Xiaobin Hu, Jun Xu, Shuicheng Yan

机构 * RUC(中国人民大学) HKUST(GZ)(香港科技大学(广州)) NUS(新加坡国立大学) UCD(加州大学戴维斯分校)

AI总结 本文提出ToolArtist,一种全智能体图像生成模型,通过后训练UMM实现,采用RAD-GRPO方法优化,将完整开放世界图像生成过程置于智能体控制下,性能优于部分控制方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02347 2026-08-06 cs.AI 版本更新

Mamba with Hierarchical Memory: Solving Representation Bottleneck in Long Sequence Modeling

带分层记忆的Mamba:解决长序列建模中的表示瓶颈

Qinwen Wang, Jieping Luo, Aoxiang Qin, Ruoyu Zhao, Jianxiong Tang, Wei Zhang, Zhichao Lu, Luziwei Leng

机构 * The Hong Kong University of Science and Technology(香港科技大学) University of Oxford(牛津大学) The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Hainan Bielefeld University of Applied Sciences(海南比勒费尔德应用科学大学) BrainGalaxy

AI总结 该研究提出分层记忆Mamba(HMM),通过分层记忆机制解决Mamba类循环线性注意力模型的长序列表示瓶颈,在两项任务上提升性能且参数和训练开销增加极少。

Comments 19 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12000 2026-08-06 cs.CV 版本更新

MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors

MetaView:基于尺度感知隐式几何先验的单目新视图合成

Yufei Cai, Xuesong Niu, Hao Lu, Kun Gai, Kai Wu, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) Kolors Team, Kuaishou Technology(快手科技色彩团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 研究提出MetaView框架,结合隐式几何建模与少量显式3D线索,利用前馈几何感知网络隐式几何先验及度量深度,实现大视角下单目新视图合成,实验证明该方法在挑战性场景中显著优于现有方法且泛化能力强。

Comments accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11868 2026-08-06 cs.LG q-bio.QM 版本更新

MemNovo: Look Back at the Spectrum for Balanced De Novo Peptide Sequencing from Mass Spectrometry

MemNovo: 回顾谱图以实现质谱中平衡的从头肽段测序

Dongxin Lyu, Jingbo Zhou, Hongxin Xiang, Yuqiang Li, Jun Xia

机构 * Westlake University(西湖大学) Hunan University(湖南大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) HKUST-GZ & HKUST(香港科技大学(广州)与香港科技大学)

AI总结 针对现有Transformer模型在从头肽段测序中过度依赖生成序列先验而忽视谱图证据的问题,提出训练无关的即插即用机制MemNovo,通过建立持久谱记忆库和超保守残差连接在解码阶段注入谱特征,显著提升氨基酸和肽段精度。

Comments Code: https://github.com/AIMS-Lab-HKUSTGZ/MemNovo

Journal ref Knowledge Discovery and Data Mining(KDD), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06140 2026-08-06 cs.CV cs.AI 版本更新

Place-it-R1: Unlocking Environment-aware Reasoning Potential of MLLM for Video Object Insertion

Place-it-R1: 解锁多模态大语言模型在视频物体插入中的环境感知推理潜力

Bohai Gu, Taiyi Wu, Dazhao Du, Jian Liu, Shuai Yang, Xiaotong Zhao, Alan Zhao, Song Guo

机构 * HKUST(香港科技大学) Tencent Video(腾讯视频) Peking University(北京大学)

AI总结 Place-it-R1通过多模态大语言模型的环境感知推理能力,实现物理一致的视频物体插入,提供两种模式以平衡保真度与合理性。

Comments https://nevsnev.github.io/Place-it-R1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19161 2026-08-06 cs.CV 版本更新

Flash-VAED: Plug-and-Play VAE Decoders for Efficient Video Generation

Flash-VAED: 用于高效视频生成的即插即用VAE解码器

Lunjie Zhu, Yushi Huang, Xingtong Ge, Yufei Xue, Zhening Liu, Yumeng Zhang, Zehong Lin, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学)

AI总结 Flash-VAED通过通道剪枝和分阶段运算优化,实现了高效视频生成的高质量与高速度平衡。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11745 2026-08-06 cs.AI 版本更新

Text2GraphQuery-Bench: A Text to Graph Query Benchmark

Text2GQL-Bench: 一个文本到图查询语言基准 [实验、分析与基准]

Songlin Lyu, Lujie Ban, Zihang Wu, Tianqi Luo, Jirong Liu, Ayoub Moussaid, Oskar van Rest, Heng Lin, Chenhao Ma, Nan Tang, Shipeng Qi, Yongchao Liu, Zhan Qiu, Juelu Zhang, Jiajun Zheng

机构 * Ant Group(蚂蚁集团) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Xi'an Polytechnic University(西安理工大学)

AI总结 Text2GQL-Bench是一个统一的文本到图查询语言基准,通过多领域数据集和评估方法,揭示了ISO-GQL生成中的方言差距,并展示了通过充足示例提升模型性能的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏