arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-07-15 至 2026-07-15 共收录 12
2607.12928 2026-07-15 cs.LG 新提交

Efficient Sequential Calibration with $O(T^{2/3-ε})$ Error Bound

具有\(O(T^{2/3 - ε})\)误差界的高效序贯校准

Zihan Zhang

机构 * HKUST(香港科技大学)

AI总结 研究在线二元序贯校准问题,基于已有突破成果,提出结合\textsc{SPR - 校准}程序与外部校正层的随机预测器,实现\(O(T^{2/3 - ε})\)期望校准误差,并对总校准误差进行分解及控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12893 2026-07-15 cs.AI cs.CL 新提交

MemOps: Benchmarking Lifecycle Memory Operations in Long-Horizon Conversations

MemOps:在长期对话中对生命周期内存操作进行基准测试

Xixuan Hao, Zeyu Zhang, Zehao Lin, Yihang Sun, Ziliang Guo, Xichong Zhang, Yuxuan Liang, Feiyu Xiong, Zhiyu Li

机构 * MemTensor (Shanghai) Technology Co., Ltd.(墨天轮(上海)科技有限公司) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Renmin University of China(中国人民大学)

AI总结 研究针对长期对话中内存操作评估,引入MemOps基准测试,将对话内存视为操作生命周期,通过可控管道嵌入操作并评估,揭示了当前系统内存操作的问题,推动评估从答案评分转向操作级诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12489 2026-07-15 cs.RO 新提交

Infra-Swarm: Robust Vision-Based Multi-Robot Swarming via Near-Infrared Spectral Vision

Infra-Swarm:通过近红外光谱视觉实现基于视觉的鲁棒多机器人集群

Haoyu Chen, Qijin Li, Wanyu Xiang, Xiuxiu Lin, Zian Ning, Shiyu Zhao

机构 * Westlake University(西湖大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhejiang University(浙江大学)

AI总结 研究针对分布式集群受带宽或环境限制问题,提出Infra-Swarm,通过机器人配备近红外光源和相机,利用光学耀斑测量邻居3D位置,借助窄带滤波器抗干扰,以最小计算开销实现集群大规模可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12455 2026-07-15 cs.AI cs.CE 新提交

EVOQUANT: Self-Evolving Verifier-Guided Strategy Optimization for Robust Quantitative Trading

EVOQUANT:用于稳健量化交易的自进化验证器引导策略优化

Jie Mao, Changlun Li, Xiang Li, Qiqi Duan, Jinhui Yuan, Xiang Liu, Yuyu Luo, Jing Tang, Xiaowen Chu, Nan Tang

机构 * HKUST(GZ)(香港科技大学(广州)) Paradoox AI Research(悖论人工智能研究)

AI总结 研究针对量化策略优化多依赖人工且易出错的问题,提出EVOQUANT框架,利用大语言模型诊断瓶颈、生成候选编辑,经多阶段验证选最佳策略,能提炼经验持续改进,实验表明该方法有效提升夏普比率,为金融策略研究提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12406 2026-07-15 cs.AI 新提交

Isolation as a First-Class Principle for LLM-Agent System Safety: Concepts, Taxonomy, Challenges and Future Directions

隔离作为大语言模型智能体系统安全的头等原则:概念、分类法、挑战及未来方向

Huihao Jing, Wenbin Hu, Shaojin Chen, Haochen Shi, Sirui Zhang, Hanyu Yang, Changxuan Fan, Zhongwei Xie, Hongyu Luo, Wun Yu Chan, Wei Fan, Haoran Li, Yangqiu Song

机构 * HKUST(香港科技大学) NYU(纽约大学) SWUPL(西南政法大学)

AI总结 探讨大语言模型智能体系统安全问题,将隔离作为头等原则,用边界中心分类法组织文献,助于识别隔离丧失位置、妥协传播方式及相关防御,还总结了故障路径,讨论挑战并勾勒研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12375 2026-07-15 cs.CV cs.AI eess.IV 新提交

IQA-T1: Tool-based Visual Evidence Reasoning for Image Quality Assessment

IQA-T1:基于工具的图像质量评估视觉证据推理

Jinjian Wu, Jiaqi Tang, Wei Wei, Yingying Yan, Jianmin Chen, Botong Geng, Lei Zhang, Qifeng Chen

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机科学学院) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 针对开放世界图像质量评估难题,提出IQA-T1框架,通过自主调用工具生成视觉证据增强多模态大语言模型推理,构建Q-Tool数据集,实验表明该框架性能最佳且评估可解释、基于证据。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03363 2026-07-15 cs.CL 版本更新

EntSQL: A Benchmark for Grounding Text-to-SQL in Long-Context Enterprise Knowledge

EntSQL:一个将Text-to-SQL置于长上下文企业知识中的基准

Chengxi Liao, Tao Xu, Zulong Chen, Chuanfei Xu, Yiyan Wang, Xinyun Wang, Yanlong Zhang, Xiaojun Chen, Zhibo Yang, Zeyi Wen

机构 * HKUST (GZ)(香港科技大学(广州)) Alibaba Group(阿里巴巴集团) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳))

AI总结 提出EntSQL基准,通过包含1066个跨五个业务领域的中英文对齐示例,评估LLM在长上下文企业文档中基于私有业务知识生成SQL的能力,最佳系统仅达15.9%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15222 2026-07-15 cs.SE cs.CL cs.PL 版本更新

PerfCodeBench: Benchmarking LLMs for System-Level High-Performance Code Optimization

PerfCodeBench:用于系统级高性能代码优化的LLM基准测试

Huihao Jing, Wenbin Hu, Shaojin Chen, Haochen Shi, Hanyu Yang, Sirui Zhang, Haoran Li, Yangqiu Song

机构 * HKUST(香港科技大学) NYU(纽约大学) SWUPL(西南大学)

AI总结 本文提出PerfCodeBench,用于评估LLM在系统级高性能代码优化中的能力,发现模型生成代码与专家优化代码存在显著差距,尤其在并行和GPU任务中表现更差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28583 2026-07-15 cs.CV cs.AI cs.MM 版本更新

Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering

穿越幻象:一种双路径代理框架用于鲁棒的误导图表问答

Yanjie Zhang, Yafei Li, Rui Sheng, Zixin Chen, Yanna Lin, Huamin Qu, Lei Chen, Yushi Sun

机构 * The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出ChartCynics双路径框架,通过分离感知与验证,利用诊断视觉路径和OCR驱动数据路径解决图表误导问题,提升模型鲁棒性。

Comments 10pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02244 2026-07-15 cs.LG cs.CL 版本更新

Entropy-Preserving Supervised Fine-Tuning via Adaptive Self-Distillation for Large Reasoning Models

在学习中保持好奇心:通过自适应自蒸馏实现熵保持的监督微调以提升大推理模型

Hao Wang, Hao Gu, Hongming Piao, Kaixiong Gong, Yuxiao Ye, Xiangyu Yue, Sirui Han, Yike Guo, Dapeng Wu

机构 * City University of Hong Kong(香港城市大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 CurioSFT通过自适应自蒸馏和熵引导温度选择,提升大推理模型的探索能力,在监督微调和强化学习阶段均取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21842 2026-07-15 cs.AI 版本更新

DeepTravel: An End-to-End Agentic Reinforcement Learning Framework for Autonomous Travel Planning Agents

深度旅行:用于自主旅行规划智能体的端到端智能强化学习框架

Yansong Ning, Rui Liu, Jun Wang, Kai Chen, Wei Li, Jun Fang, Kan Zheng, Naiqiang Tan, Hao Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Didichuxing Co. Ltd(滴滴出行有限公司)

AI总结 研究针对旅行规划智能体灵活性和自主性不足问题,提出深度旅行框架,通过构建旅行沙盒、开发分层奖励建模系统及回复增强强化学习方法,使训练后的智能体在行程生成准确率和性能上表现出色。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12339 2026-07-15 cs.HC cs.AI 版本更新

SheetMind: An End-to-End LLM-Powered Multi-Agent Framework for Spreadsheet Automation

SheetMind:一个由端到端大语言模型驱动的用于电子表格自动化的多智能体框架

Xi Cheng, Ruiyan Zhu, Ke Liu, Rakesh Chowdary Machineni, Lyuhao Chen, Brian Zhu, Daniel Jin, Zheng Qi, Neeraj Parihar, Zhoutian Xu, Oliver Gao

机构 * Cornell University(康奈尔大学) University of California, Berkeley(加州大学伯克利分校) University of Michigan(密歇根大学) Carnegie Mellon University(卡内基梅隆大学) Hong Kong University of Science and Technology (GZ)(香港科学与技术大学)

AI总结 介绍由大语言模型驱动的多智能体框架SheetMind用于电子表格自动化,其分层系统含三个智能体,经评估在SheetCopilot基准测试中执行成功率达100%、功能正确性54.8%超对手,消融研究验证配置优势,还集成到谷歌表格。

详情

展开后加载摘要…

URL PDF HTML 收藏