Efficient Sequential Calibration with $O(T^{2/3-ε})$ Error Bound
具有\(O(T^{2/3 - ε})\)误差界的高效序贯校准
机构 * HKUST(香港科技大学)
AI总结 研究在线二元序贯校准问题,基于已有突破成果,提出结合\textsc{SPR - 校准}程序与外部校正层的随机预测器,实现\(O(T^{2/3 - ε})\)期望校准误差,并对总校准误差进行分解及控制。
高校专区
具有\(O(T^{2/3 - ε})\)误差界的高效序贯校准
机构 * HKUST(香港科技大学)
AI总结 研究在线二元序贯校准问题,基于已有突破成果,提出结合\textsc{SPR - 校准}程序与外部校正层的随机预测器,实现\(O(T^{2/3 - ε})\)期望校准误差,并对总校准误差进行分解及控制。
MemOps:在长期对话中对生命周期内存操作进行基准测试
机构 * MemTensor (Shanghai) Technology Co., Ltd.(墨天轮(上海)科技有限公司) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Renmin University of China(中国人民大学)
AI总结 研究针对长期对话中内存操作评估,引入MemOps基准测试,将对话内存视为操作生命周期,通过可控管道嵌入操作并评估,揭示了当前系统内存操作的问题,推动评估从答案评分转向操作级诊断。
Infra-Swarm:通过近红外光谱视觉实现基于视觉的鲁棒多机器人集群
机构 * Westlake University(西湖大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Zhejiang University(浙江大学)
AI总结 研究针对分布式集群受带宽或环境限制问题,提出Infra-Swarm,通过机器人配备近红外光源和相机,利用光学耀斑测量邻居3D位置,借助窄带滤波器抗干扰,以最小计算开销实现集群大规模可扩展性。
EVOQUANT:用于稳健量化交易的自进化验证器引导策略优化
机构 * HKUST(GZ)(香港科技大学(广州)) ; Paradoox AI Research(悖论人工智能研究)
AI总结 研究针对量化策略优化多依赖人工且易出错的问题,提出EVOQUANT框架,利用大语言模型诊断瓶颈、生成候选编辑,经多阶段验证选最佳策略,能提炼经验持续改进,实验表明该方法有效提升夏普比率,为金融策略研究提供新途径。
隔离作为大语言模型智能体系统安全的头等原则:概念、分类法、挑战及未来方向
机构 * HKUST(香港科技大学) ; NYU(纽约大学) ; SWUPL(西南政法大学)
AI总结 探讨大语言模型智能体系统安全问题,将隔离作为头等原则,用边界中心分类法组织文献,助于识别隔离丧失位置、妥协传播方式及相关防御,还总结了故障路径,讨论挑战并勾勒研究议程。
IQA-T1:基于工具的图像质量评估视觉证据推理
机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机科学学院) ; The Hong Kong University of Science and Technology(香港科技大学)
AI总结 针对开放世界图像质量评估难题,提出IQA-T1框架,通过自主调用工具生成视觉证据增强多模态大语言模型推理,构建Q-Tool数据集,实验表明该框架性能最佳且评估可解释、基于证据。
Comments Accepted by ECCV 2026
EntSQL:一个将Text-to-SQL置于长上下文企业知识中的基准
机构 * HKUST (GZ)(香港科技大学(广州)) ; Alibaba Group(阿里巴巴集团) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳))
AI总结 提出EntSQL基准,通过包含1066个跨五个业务领域的中英文对齐示例,评估LLM在长上下文企业文档中基于私有业务知识生成SQL的能力,最佳系统仅达15.9%准确率。
PerfCodeBench:用于系统级高性能代码优化的LLM基准测试
机构 * HKUST(香港科技大学) ; NYU(纽约大学) ; SWUPL(西南大学)
AI总结 本文提出PerfCodeBench,用于评估LLM在系统级高性能代码优化中的能力,发现模型生成代码与专家优化代码存在显著差距,尤其在并行和GPU任务中表现更差。
穿越幻象:一种双路径代理框架用于鲁棒的误导图表问答
机构 * The Hong Kong University of Science and Technology(香港科技大学)
AI总结 本文提出ChartCynics双路径框架,通过分离感知与验证,利用诊断视觉路径和OCR驱动数据路径解决图表误导问题,提升模型鲁棒性。
Comments 10pages, 4 figures
在学习中保持好奇心:通过自适应自蒸馏实现熵保持的监督微调以提升大推理模型
机构 * City University of Hong Kong(香港城市大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 CurioSFT通过自适应自蒸馏和熵引导温度选择,提升大推理模型的探索能力,在监督微调和强化学习阶段均取得显著改进。
深度旅行:用于自主旅行规划智能体的端到端智能强化学习框架
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Didichuxing Co. Ltd(滴滴出行有限公司)
AI总结 研究针对旅行规划智能体灵活性和自主性不足问题,提出深度旅行框架,通过构建旅行沙盒、开发分层奖励建模系统及回复增强强化学习方法,使训练后的智能体在行程生成准确率和性能上表现出色。
Comments KDD 2026
SheetMind:一个由端到端大语言模型驱动的用于电子表格自动化的多智能体框架
机构 * Cornell University(康奈尔大学) ; University of California, Berkeley(加州大学伯克利分校) ; University of Michigan(密歇根大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Hong Kong University of Science and Technology (GZ)(香港科学与技术大学)
AI总结 介绍由大语言模型驱动的多智能体框架SheetMind用于电子表格自动化,其分层系统含三个智能体,经评估在SheetCopilot基准测试中执行成功率达100%、功能正确性54.8%超对手,消融研究验证配置优势,还集成到谷歌表格。