arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-08-11 至 2026-08-11 共收录 24
2608.09885 2026-08-11 cs.AI cs.CV 新提交

SHE: Trajectory-driven Safety Harness Evolution for LLM Agents

SHE:面向大语言模型智能体的轨迹驱动安全管控机制演化

Wanying Qu, Qinghua Mao, Yu Li, Jiyao Liu, Xin Zhang, Dadi Guo, Yanxu Zhu, Qingyu Liu, Leitao Yuan, Xi Lin, Shanfeng Zhu, Yanwei Fu, Jing Shao, Xia Hu, Dongrui Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本研究提出SHE框架,将LLM智能体的安全管控机制分解为四个构件并引入归因引导演化循环,在Agent-SafetyBench上使攻击成功率降低3.1倍,还具备泛化与跨模型迁移能力。

Comments Project: https://github.com/RainbowQTT/SHE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09682 2026-08-11 cs.CV 新提交

Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning

用工具思考,而非用像素思考:工具调用作为视觉推理的文本支架

Jiahao Shao, Yuanbo Yang, Yiyi Liao, Yujun Shen, Ceyuan Yang, Yinghao Xu

机构 * Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团) Zhejiang University(浙江大学)

AI总结 该研究提出工具调用支架假设,引入TextCall方法验证返回图像冗余,仅用结构化文本支架即可实现视觉推理,降低延迟并消除工具API调用,结论适用于现有相关基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09325 2026-08-11 cs.AI cs.CV 新提交

GeoPhysAdapter: Scale-Matched Geophysical Adaptation for Cross-Domain Landslide Mapping with Vision Foundation Models

GeoPhysAdapter:用于基于视觉基础模型的跨域滑坡制图的尺度匹配地球物理适配方法

Zhihang Liu, Mei-Po Kwan, Jinlin Wu, Hao Li

机构 * Institute of Space and Earth Information Science, The Chinese University of Hong Kong(香港中文大学太空与地球信息科学研究所) Department of Geography and Resource Management, The Chinese University of Hong Kong(香港中文大学地理与资源管理学系) Urban Governance and Design Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)城市治理与设计学域) Department of Geography, National University of Singapore(新加坡国立大学地理学系)

AI总结 针对跨域滑坡制图中视觉基础模型的误报问题,提出GeoPhysAdapter方法,在像素和候选滑坡体决策单元结合地球物理约束适配,在PILD数据集上大幅降低了假阳性误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09298 2026-08-11 cs.RO cs.AI 新提交

WorldSimProbe: Diagnosing Simulator Faithfulness in Action-Conditioned World Models for Embodied Manipulation

WorldSimProbe:面向具身操控的动作条件世界模型的模拟器保真度诊断

Peterson Co, Sicheng Hu, Chunxuan Jiao, Hongyang Cheng, Yulin Luo, Yijie Xu, Sixiang Chen, Zhongxia Zhao, Zihao Wang, DaFeng Chi, Peidong Liu, YuTong Chen, Henghua Liu, Zhihao Yuan, Huizhu Jia, Yuzheng Zhuang, Tianle Zhang, Liang Lin, Huajie Tan, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) EvoPhys AI(EvoPhys人工智能公司) Joy Future Academy, JD(京东探索研究院) The University of Sydney(悉尼大学) The Hong Kong University of Science and Technology(香港科技大学) Beijing Institute of Technology(北京理工大学)

AI总结 该研究提出WorldSimProbe框架,通过五套受控测试评估动作条件世界模型的模拟器保真度,发现其存在动作实现退化等问题,为具身操控模型提供标准化诊断方法。

Comments 20 pages, 18 figures, and 10 tables, including supplementary material. Code and data: https://evophys.com/WorldSimProbe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09240 2026-08-11 cs.LG cs.AI 新提交

Multimodal Federated Learning under Dual-Axis Modality Missingness

双轴模态缺失下的多模态联邦学习

Adiba Orzikulova, Jaehyun Kwak, Jaemin Shin, Yunqi Guo, Xiaomin Ouyang, Guoliang Xing, Steven Euijong Whang, Sung-Ju Lee

机构 * KAIST(韩国科学技术院) CUHK(香港中文大学) HKUST(香港科技大学)

AI总结 针对多模态联邦学习的双轴模态缺失问题,提出Flux框架,通过模态感知置信度调温与梯度解耦私有适配,在四个多模态数据集上取得最高平均宏F1,性能优于最强基准

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08839 2026-08-11 cs.RO cs.CV 新提交

SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models

SG-WAM:面向世界-动作模型的文本 grounded 与空间感知语义引导

Junjie He, Junfeng Li, Zhide Zhong, Haodong Yan, Ruixin Li, Yangyang Zheng, Jiaguan Zhu, Tianran Zhang, Yuqiao Du, Wen Chen, Shunbo Zhou, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Ola Dimensions(奥拉维度公司)

AI总结 针对现有世界-动作模型(WAM)存在的视频与指令语义不对齐问题,提出基于视觉-语言模型(VLM)的SG-WAM语义引导方法,通过注入文本接地且空间感知的语义前瞻,提升了WAM的指令遵循与操纵精度,经仿真和真实实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08802 2026-08-11 cs.AI 新提交

Improving Generalization Robustness of Multimodal RLVR

提升多模态RLVR的泛化鲁棒性

Pengfei Zhou, Zhiwei Tang, Xiaopeng Peng, Chenrui Zhou, Lama Moukheiber, Yixing Ma, Bin Xu, Jiajun Song, Zhenglin Wan, Wangbo Zhao, Jiasheng Tang, Bohan Zhuang, Fan Wang, Yang You

机构 * National University of Singapore(新加坡国立大学) DAMO Academy Alibaba Group(阿里巴巴达摩院) Hupan Lab(湖畔实验室) Zhejiang University(浙江大学) University of California Berkeley(加州大学伯克利分校) Rochester Institute of Technology(罗切斯特理工学院) Georgia Institute of Technology(佐治亚理工学院) Renmin University of China(中国人民大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 针对多模态RLVR泛化鲁棒性不足的问题,提出含动态三元奖励与一致性正则化器的PIRL方法,压力测试与动态评估中其性能下降幅度均小于GRPO。

Comments 32 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08726 2026-08-11 cs.LG cs.AI 新提交

PAST: Privileged Adaptation from Complete Student Trajectories for On-Policy Self-Distillation

PAST:基于完整学生轨迹的特权适配用于在线策略自蒸馏

Yangyang Feng, Zhuoyan Feng, Junlan Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Sun Yat-sen University(中山大学)

AI总结 PAST将完整学生轨迹作为OPSD教师的额外特权信息,通过前向KL蒸馏等方法优化教师,在三个数学推理基准上使Avg@12宏观平均值较Vanilla OPSD提升5.6个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08617 2026-08-11 cs.AI cs.HC 新提交

Walking through Discussions: A Mobile Visual Analytics System for In-Situ Group Discussion Analysis

穿行于讨论间:用于现场小组讨论分析的移动视觉分析系统

Yiping Sun, Ziyao Kang, Wei Zeng, Minli Wu, Jiazhi Xia

机构 * Central South University(中南大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong University of Science and Technology(香港科技大学)

AI总结 本研究提出移动视觉分析系统MobileGroupVis,适配小屏幕触控交互,用于现场分析课堂小组讨论,可辅助教师监控小组、诊断异常并开展课堂干预。

Comments Accepted by IEEE VIS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08466 2026-08-11 cs.AI 新提交

Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses

分层自改进:一种面向任务特定可进化智能体控制框架的方法

Tailin Zhou

机构 * HKUST(香港科技大学)

AI总结 本研究提出HSI框架,使冻结LLM的任务特定控制框架可进化,在中等难度任务上取得性能提升,超出模型能力时无增益,为改进冻结LLM智能体提供可行方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08290 2026-08-11 cs.CV 新提交

Test-Time Prototype Adaptation for Open-Vocabulary Semantic Segmentation

开放词汇语义分割的测试时原型适配

Haozhe Wang, Jintao Cheng, Weibin Li, Xiaoyu Tang

机构 * The Hong Kong University of Science and Technology(香港科技大学) South China Normal University(华南师范大学)

AI总结 本文提出测试时原型适配(TPA),一种无训练即插即用模块,可与多种开放词汇语义分割宿主结合,仅用少量未标注图像构建原型库,无需调优或更新参数即可提升分割准确率。

Comments 17 pages, 12 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07622 2026-08-11 cs.AI cs.IR cs.LG 新提交

Controlled Memory Interference in Continual LLM Agents

持续大型语言模型智能体中的可控记忆干扰

Ao Ding, Hongzong LI, Shiqin Tang, Li Zhang, Liang Chen, Xuyang Chen, Zi Liang

机构 * China University of Geosciences (Beijing)(中国地质大学(北京)) Northwestern Polytechnical University(西北工业大学) The Hong Kong University of Science and Technology(香港科技大学) Chinese Academy of Sciences(中国科学院) The Hong Kong Polytechnic University(香港理工大学) École polytechnique fédérale de Lausanne(洛桑联邦理工学院) National University of Singapore(新加坡国立大学)

AI总结 本研究提出可控记忆干扰(CMI)框架,揭示记忆进化受经验相互作用影响,为持续大型语言模型智能体的记忆系统提供诊断与学习方法,提升记忆更新区分度与任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07600 2026-08-11 cs.RO eess.IV 新提交

AdaDexGrasp: Adaptive Dexterous Grasping via 3D Visuo-Tactile Representation Fusion

AdaDexGrasp:基于3D视觉-触觉表示融合的自适应灵巧抓取

Xirui Liang, Jiaqi Liang, Jingkai Xu, Yuran Wang, Ruochong Li, Yuanpei Chen, Masayoshi Tomizuka, Wei Zhan, Ruihai Wu

机构 * Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 针对机器人抓取难以复刻人类视觉-触觉融合自适应能力的问题,提出AdaDexGrasp视觉-触觉融合抓取框架,通过3D表示融合实现接触感知抓取生成与优化,实验验证其提升了抓取成功率与泛化性。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07533 2026-08-11 cs.AI cs.SE 新提交

MetaSpace: Metamorphic Testing for Spatial Cognition in Embodied Agents

MetaSpace:面向具身智能体空间认知的变形测试

Gengyang Xu, Dongwei Xiao, Yiteng Peng, Shuai Wang

机构 * Hong Kong University of Science and Technology(香港科技大学)

AI总结 MetaSpace是评估具身智能体空间认知的框架,基于变形测试原则生成测试用例,在三个场景中检测到SOTA MLLM驱动智能体的90422个空间认知错误,其SC分数远低于人类基准。

Comments 30 pages, 17 figures. Published in Proceedings of the ACM on Programming Languages (OOPSLA1)

Journal ref Proceedings of the ACM on Programming Languages, 10, OOPSLA1 (April 2026), 343-372

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07637 2026-08-11 cs.AI cond-mat.mtrl-sci 新提交

Agent-MD: Selective LLM Intervention with Event-Driven Escalation for Stateful GCMC--MD Campaigns

Agent-MD:用于有状态GCMC-MD模拟流程的带事件驱动升级机制的选择性大语言模型干预框架

Yijie Wang, Zhen-Yu Yin, Zhenheng Tang, Xiaowen Chu

机构 * The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 Agent-MD框架将LLM推理选择性用于GCMC-MD分子模拟流程的构建与事件审查,结合确定性执行,在蒙脱石水蒸汽脱附模拟中完成多周期计算,识别问题并揭示体系依赖的低湿度响应,实现可复现的代理辅助分子模拟。

Comments 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06375 2026-08-11 cs.RO 版本更新

$ω$-0: A Latent Predictive World Action Model for Concurrent Humanoid Loco-Manipulation

ω-0:一种用于类人机器人协同移动操作的潜在预测世界动作模型

Zhe Li, Zhenzhe Zhang, Yangyang Wei, Wenjie Zhang, Xichen Yuan, Peiyuan Zhi, Gen Li, Xinying Guo, Fengjie Gao, Jianfei Yang, Shanghang Zhang

机构 * NTU(南洋理工大学) PKU(北京大学) BAAI(北京智源人工智能研究院) HKUST(GZ)(香港科技大学(广州))

AI总结 本文提出 ω-0 模型,针对类人机器人协同移动操作问题,结合潜在视觉预见与扩散动作生成,在 11 项家庭任务上优于多个基线,还构建了 ω-HOME 数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24744 2026-08-11 cs.RO cs.CV 版本更新

Data Pyramid for Embodied Manipulation: A Survey

用于具身操纵的数据金字塔

Yifan Ye, Yankai Fu, Yaoxu Lv, Bohan Hou, Jun Cen, Lingdong Kong, Duo Zheng, Tianxing Chen, Jiaming Liu, Ziang Cao, Yunfan Lou, Wei Chow, Xian Sun, Yingshuo Wang, Kuangzhi Ge, Xiaowei Chi, Xidong Zhang, Zhibo Pang, Yiwu Zhong, Sirui Han, Zhihe Lu, Weihao Yuan, Qifeng Chen, Michael Yu Wang, Yao Mu, Ziwei Liu, Jianfei Yang, Ping Luo, Shanghang Zhang

机构 * PKU(北京大学) NTU(南洋理工大学) HKUST(香港科技大学) NUS(新加坡国立大学) CUHK(香港中文大学) HKU(香港大学) Duke(杜克大学) UCB(加州大学伯克利分校) GBU(未提及具体中文名的机构) NJU(南京大学) SJTU(上海交通大学)

AI总结 研究围绕具身操纵数据生态系统展开,构建跨越五个互补数据源的“数据金字塔”,通过数据配方分析具身基础模型,将数据组成与多种能力联系起来,并讨论了六个开放挑战,为下一代具身系统设计奠定基础。

Comments Awesome Embodied Data Pyramid; Project Page at https://jasper-aaa.github.io/embodied-data-pyramid/ GitHub Repo at https://github.com/worldbench/awesome-embodied-data-pyramid

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01916 2026-08-11 cs.AI 版本更新

ContextSniper: AntTrail's Token-Efficient Code Memory for Repository-Level Program Repair

ContextSniper: AntTrail的令牌高效代码记忆用于仓库级程序修复

Chiwang Luk, Matin Mohammad Najafi, Zhifeng Jia, Wei Yang, Xiuchang Li, Jinwei Zhu, Yang Ren, Lei Chen, Gao Cong

机构 * Huawei(华为) HKUST(GZ)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学)

AI总结 提出ContextSniper,一种令牌高效的代码记忆层,通过精准证据选择、混合检索排序和意图感知上下文门控,在SWE-bench Lite上减少51.5%令牌使用和36.4%成本,修复率仅轻微下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25465 2026-08-11 cs.CV cs.AI 版本更新

EchoStyle: Unlocking High-Fidelity Video Stylization with Reverse Data Synthesis

EchoStyle: 通过反向数据合成解锁高保真视频风格化

Huaqiu Li, Jiahao Wang, Sijia Cai, Hualian Sheng, Bing Deng, Jieping Ye, Wenhan Luo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Alibaba Group(阿里巴巴集团) Xi’an Jiaotong University(西安交通大学)

AI总结 提出EchoStyle框架,通过构建视频到视频架构、自动反向合成数据集V-Style20k和初始跟随模式机制,解决视频风格化中的内容泄露、数据稀缺和长视频适应性问题,实现高质量任意长度视频风格化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27887 2026-08-11 cs.AI q-fin.PM 版本更新

PortBench: A Correlation-Aware, Full-Pipeline Benchmark for LLM-Driven Portfolio Management

PortBench: 一种相关性感知的、全流水线的LLM驱动投资组合管理基准

Yuxuan Zhao, Sijia Chen, Ningxin Su

机构 * Yantai Research Institute of Harbin Engineering University(哈尔滨工程大学烟台研究院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 提出PortBench基准,通过静态QA和动态五阶段分配流水线评估LLM在投资组合管理中的表现,发现多数模型无法超越等权重分配,且存在推理错误累积和压力下大幅回撤的问题。

Comments Project page: https://portbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25681 2026-08-11 cs.LG cs.AI 版本更新

Don't Retrain, Just Reuse: Recovering Dual-Target Molecules from Single-Target Diffusion Models

不要重新训练,只需重用:从单目标扩散模型中恢复双目标分子

Qingyuan Zeng, Pengxiang Cai, Zixin Guan, Ziyang Chen, Anglin Liu, Xinyao Lai, Jintai Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Guangzhou University of Chinese Medicine(广州中医药大学)

AI总结 提出REUSE框架,通过层次化进化输入空间搜索,从冻结的单目标扩散模型中恢复双目标分子,无需重新训练或修改扩散过程,在双目标亲和力上提升20.9个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06343 2026-08-11 cs.CV 版本更新

Uncertainty-Aware 4D Gaussian Splatting for Monocular Occluded Human Rendering

考虑不确定性的4D高斯点散布用于单目遮挡人体渲染

Weiquan Wang, Feifei Shao, Lin Li, Zhen Wang, Fengda Zhang, Jun Xiao, Long Chen

机构 * Zhejiang University(浙江大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出U-4DGS框架,通过概率变形网络和联合光栅化流程,在异方差观测噪声下实现最大后验估计,解决单目视频中遮挡导致的高保真动态人体渲染问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11554 2026-08-11 cs.RO cs.CV cs.LG 版本更新

HyperDet: 3D Object Detection with Hyper 4D Radar Point Clouds

HyperDet: 基于超4D雷达点云的3D目标检测

Yichun Xiao, Runwei Guan, Jin Jin, Fangqiang Ding

机构 * University of Edinburgh(爱丁堡大学) HKUST (GZ)(香港科技大学(广州)) University of Oxford(牛津大学) MIT(麻省理工学院)

AI总结 提出一种与检测器无关的框架HyperDet,通过构建任务感知的超4D雷达点云,利用时空累积、跨传感器验证和多普勒引导的运动补偿以及前景生成增强,显著提升仅用雷达的3D目标检测性能。

Comments 11 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18142 2026-08-11 cs.LG

Enhance the Safety in Reinforcement Learning by ADRC Lagrangian Methods

通过ADRC拉格朗日方法增强强化学习的安全性

Mingxu Zhang, Huicheng Zhang, Jiaming Ji, Yaodong Yang, Ying Sun

机构 * AI Thrust, The Hong Kong University of Science and Technology (Guangzhou)(人工智能方向,香港科技大学(广州)) School of Artificial Intelligence, Peking University, Beijing, China(人工智能学院,北京大学,北京,中国) Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

AI总结 本文提出ADRC-拉格朗日方法,通过主动扰动抵消控制提升强化学习的安全性,实验显示在复杂环境中显著减少安全违规和成本

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏