arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

共收录 2392
2605.22368 2026-05-22 cs.LG cs.AI cs.SE

VeriScale: Adversarial Test-Suite Scaling for Verifiable Code Generation

VeriScale:对抗性测试套件缩放用于可验证代码生成

Yifan Bai, Xiaoyang Liu, Zihao Mou, Guihong Wang, Jian Yu, Shuhan Xie, Yantao Li, Yangyu Zhang, Jingwei Liang, Tao Luo

机构 * School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学科学学院) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) School of Mathematics, Jilin University(吉林大学数学学院) School of Mathematical Sciences, Tongji University(同济大学数学科学学院) Zhiyuan College, Shanghai Jiao Tong University(上海交通大学紫阳学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院) Institute of Natural Sciences, Shanghai Jiao Tong University(上海交通大学自然科学研究院) MOE-LSC, CMA-Shanghai, Shanghai Jiao Tong University(上海交通大学MOE-LSC、CMA-上海)

AI总结 本文提出VeriScale框架,通过对抗性实现扩展和缩减测试套件,提升代码生成的可验证性,实验表明VerinaPlus显著暴露了模型弱点,而VerinaLite在低成本下保持判别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22177 2026-05-22 cs.LG cs.CL

Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles

Maestro:通过强化学习协调分层模型-技能集合

Jinyang Wu, Guocheng Zhai, Ruihan Jin, Yuhao Shen, Zhengxi Lu, Fan Zhang, Haoran Luo, Zheng Lian, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学) Tongji University(同济大学)

AI总结 本文提出Maestro框架,通过强化学习协调多模态任务,利用分层模型-技能集合提升多模态任务性能,实现高效且通用的协调策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10696 2026-05-22 cs.RO

VRA: Grounding Discrete-Time Joint Acceleration in Voltage-Constrained Actuation

VRA:在电压受限致动器中接地离散时间联合加速度

Lingwei Zhang, Jiaming Wang, Tianlin Zhang, Zhitao Song, Xuanqi Zeng, Weipeng Xia, Zhongyu Li, Yun-hui Liu

机构 * Department of Mechanical and Automation Engineering(机械与自动化工程系) Hong Kong Embodied AI Lab(香港具身AI实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出VRA方法,通过将运动学加速度与电压受限致动器物理相联系,解决在电压受限情况下不可实现的加速度问题,实验表明该方法能消除不可实现的加速度,恢复一致的近约束执行并减少约束引起的振荡。

Comments 10 pages, Accepted by RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01334 2026-05-22 cs.CV

What Does Vision Tool-Use Reinforcement Learning Really Learn? Disentangling Tool-Induced and Intrinsic Effects for Crop-and-Zoom

视觉工具使用强化学习究竟在学习什么?解构工具诱导效应与内在效应以实现作物和缩放

Yan Ma, Weiyu Zhang, Tianle Li, Linge Du, Xuyang Shen, Pengfei Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文研究了视觉工具使用强化学习在作物和缩放任务中的学习机制,通过引入MED框架解耦内在能力变化与工具诱导效应,发现改进主要由内在学习驱动,而工具使用强化学习主要减少工具诱导的负面影响,而非掌握工具。

Comments ICML 2026 camera ready. Code: https://github.com/GAIR-NLP/Med

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13910 2026-05-22 cs.CL

RAGCap-Bench: Benchmarking Capabilities of LLMs in Agentic Retrieval Augmented Generation Systems

RAGCap-Bench: 评估代理检索增强生成系统中LLM能力的基准测试

Jingru Lin, Chen Zhang, Stephen Y. Liu, Haizhou Li

机构 * National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出RAGCap-Bench,用于评估代理检索增强生成系统中中间任务的细粒度能力,通过分析现有系统输出识别常见任务和核心能力,设计针对性评估问题,实验表明增强中间能力的模型能获得更好的整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11339 2026-05-22 cs.LG cs.AI

Event-Aware Prompt Learning for Dynamic Graphs

事件感知的动态图提示学习

Xingtong Yu, Ruijuan Liang, Renhe Jiang, Dongyuan Li, Yunxiao Zhao, Xinming Zhang, Yuan Fang

机构 * The Chinese University of Hong Kong(香港中文大学) University of Science and Technology of China(中国科学技术大学) The University of Tokyo(东京大学) Shanxi University(山西大学) Singapore Management University(新加坡国立大学)

AI总结 本文提出EVP框架,通过提取历史事件并引入事件适应机制,增强动态图学习模型对历史事件知识的利用能力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21951 2026-05-22 cs.LG

Dynamic Mixture of Latent Memories for Self-Evolving Agents

动态潜在记忆混合用于自演化智能体

Dianzhi Yu, Vireo Zhang, Hongru Wang, Yanyu Chen, Minda Hu, Wanghan Xu, Siki Chen, Philip Torr, Zhenfei Yin, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) University of Oxford(牛津大学) Nanyang Technological University(南洋理工大学) University of Edinburgh(爱丁堡大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出MoLEM框架,通过动态混合专家机制实现智能体的持续学习,避免灾难性遗忘,提升任务学习和能力保持。

Comments 19 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14987 2026-05-22 cs.CL cs.DB

Beyond Benchmark Islands: Toward Representative Trustworthiness Evaluation for Agentic AI

超越基准岛屿:面向代理AI的代表性可信度评估

Jinhu Qi, Yifan Li, Minghao Zhao, Wentao Zhang, Zijian Zhang, Yaoman Li, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Macao Polytechnic University(澳门理工学院) Jilin University(吉林大学)

AI总结 本文提出了一种基于五属性的代理可信度定义,并引入了Holographic Agent Assessment Framework(HAAF)框架,通过场景 manifold 的静态策略分析、沙盒模拟、社会伦理对齐评估和分布感知采样,实现对代理系统在社会技术场景中的可信度评估,展示了其在13个模型家族上的跨家族迁移实验结果。

Comments 9 pages, 3 figures, 8 tables. Submitted to the Agent4IR Workshop at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08759 2026-05-22 cs.CV cs.RO

Dissecting Embodied Abilities in Multimodal Language Models through Skill-level Evaluation and Diagnosis

通过技能级评估与诊断解构多模态语言模型的具身能力

Yu Qi, Haibo Zhao, Ziyu Guo, Siyuan Ma, Ziyan Chen, Yaokun Han, Renrui Zhang, Zitiantao Lin, Yizhe Zhu, Shiji Xin, Yijian Huang, Boce Hu, Kai Cheng, Peiheng Wang, Jiazheng Liu, Jiayi Zhang, Yizhe Zhu, Wenqing Wang, Yiran Qin, Haojie Huang, Lawson L. S. Wong

机构 * Northeastern University, Boston, MA, USA The Chinese University of Hong Kong, Hong Kong, China Peking University, Beijing, China Westlake University, Hangzhou, China Harvard University, Cambridge, MA, USA Purdue University, West Lafayette, IN, USA University of Oxford, Oxford, United Kingdom

AI总结 本文提出BEAR基准,通过分解具身任务为14个原子技能进行细粒度评估,发现感知能力是推理失败的主要瓶颈,并提出BEAR-Agent多模态对话代理,显著提升具身技能性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03865 2026-05-22 cs.CL

An Entity Linking Agent for Question Answering

用于问答任务的实体链接代理

Yajie Luo, Yihong Wu, Muzhi Li, Jia Ao Sun, Xinyu Wang, Liheng Ma, Yingxue Zhang, Jian-Yun Nie

机构 * The Chinese University of Hong Kong(香港中文大学) McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克AI研究院) Huawei Noah’s Ark Lab(华为诺亚实验室)

AI总结 本文提出了一种基于大语言模型的实体链接代理,用于解决问答任务中短且模糊用户问题的实体链接问题,通过两个实验验证了其有效性。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21406 2026-05-21 cs.RO

MC-Risk: Multi-Component Risk Fields for Risk Identification and Motion Planning

MC-Risk:多组件风险场用于风险识别和运动规划

Maximilian Link, Yingjie Xu, Yingbai Hu, Yinlong Liu

机构 * Technical University of Munich(慕尼黑技术大学) The Chinese University of Hong Kong(香港中文大学) City University of Macau(澳门城市大学)

AI总结 本文提出MC-Risk,一种与规划器对齐的多组件风险场,用于早期、校准且类别感知的风险定位。该方法通过线性组合三个可解释模块,包括电机代理场、VRU风险场和道路惩罚场,并在RiskBench碰撞子集上进行了首次标准化定量评估,展示了最佳的风险定位和最早危险指示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04905 2026-05-21 cs.SE cs.CL

Retrieval-Augmented Code Generation: A Survey with Focus on Repository-Level Approaches

检索增强的代码生成:聚焦于仓库级方法的综述

Yicheng Tao, Yuante Li, Yao Qin, Yepang Liu

机构 * Carnegie Mellon University(卡内基梅隆大学) Chinese University of Hong Kong(香港中文大学) Southern University of Science and Technology(南方科技大学)

AI总结 本文综述了检索增强的代码生成方法,重点探讨仓库级方法,分析了其在大规模代码生成中的挑战与解决方案,总结了现有方法的分类框架及关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21258 2026-05-21 cs.RO cs.AI

Learning Structural Latent Points for Efficient Visual Representations in Robotic Manipulation

为机器人操作中的高效视觉表征学习结构潜在点

Yicheng Jiang, Jiaxu Wang, Junhao He, Zesen Gan, Junhao Li, Qiang Zhang, Jingkai Sun, Jiahang Cao, Mingyuan Sun, Xiangyu Yue, Qiming Shao

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) X-Humanoid Robots(X-Humanoid机器人) The University of Hong Kong(香港大学) Tsinghua University(清华大学)

AI总结 本文提出了一种新的预训练框架,通过学习混合表示-结构潜在点,结合隐式表示的表达能力和显式表示的结构先验,以提高机器人操作中的视觉表征效率和鲁棒性。

Journal ref International Conference on Robotics and Automation 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21132 2026-05-21 cs.CV

SurgOnAir: Hierarchy-Aware Real-Time Surgical Video Commentary

SurgOnAir: 基于层次感知的实时手术视频评论

Jingyi He, Yue Zhou, Long Bai, Kun Yuan, Nassir Navab, Yuan Bi

机构 * Computer Aided Medical Procedures (CAMP), TU Munich, Germany Munich Center for Machine Learning (MCML), Munich, Germany University of Strasbourg, France The Chinese University of Hong Kong, Hong Kong

AI总结 本研究提出SurgOnAir,一种流式视觉-语言模型,通过层次化数据集实现对手术流程多层级的实时理解与评论生成,提升手术过程中的即时响应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21130 2026-05-21 cs.CV

VersusQ: Pairwise Margin Reasoning for Generalizable Video Quality Assessment

VersusQ:用于通用视频质量评估的成对边距推理

Shibei Meng, Binxin Yang, Yuan Liu, Jiexuan Zhang, Zhengyao Lv, Hubery Yin, Qiang Xu

机构 * The Chinese University of Hong Kong(香港中文大学) WeChat Vision, Tencent Inc.(腾讯公司视觉部门) Beijing Normal University(北京师范大学) Peking University(北京大学) The University of Hong Kong(香港大学)

AI总结 本文提出VersusQ,一种基于成对边距推理的框架,通过直接比较视频来缓解绝对尺度校准偏差,实现跨域的视频质量评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03526 2026-05-21 cs.CL eess.AS

Enhancing Speech Large Language Models through Reinforced Behavior Alignment

通过强化行为对齐增强语音大语言模型

Yansong Liu, Jiateng Li, Yuan Liu

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出了一种名为强化行为对齐(RBA)的框架,通过自合成方法生成高质量对齐数据来提升语音大语言模型(SpeechLMs)的语言生成能力,实验表明该方法显著提升了SpeechLMs的指令遵循能力,并可扩展至语音问答和语音转文本翻译等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08292 2026-05-21 cs.CL cs.AI

Do LLMs Triage Like Clinicians? A Dynamic Study of Outpatient Referral

大语言模型像医生一样分诊吗?对外科会诊的动态研究

Xiaoxiao Liu, Qingying Xiao, Bingquan Zhang, Junying Chen, Xiangyi Feng, Ziniu Li, Xiang Wan, Jian Chang, Guangjun Yu, Yan Hu, Benyou Wang

机构 * Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Bournemouth University(伯恩茅斯大学) National Health Data Institute, Shenzhen(深圳国家健康数据研究院) Shenzhen Research Institute of Big Data(深圳大数据研究院)

AI总结 本文研究了大语言模型在动态分诊过程中的表现,发现其在动态场景中通过有效提问减少不确定性,优于传统分类器,但静态场景下优势有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01141 2026-05-21 cs.CL

Dictionary Insertion Prompting for Multilingual Reasoning on Multilingual Large Language Models

字典插入提示用于多语言推理在多语言大语言模型上

Hongyuan Lu, Zixuan Li, Wai Lam

机构 * The Chinese University of Hong Kong(香港中文大学) Southeast University(东南大学)

AI总结 本文提出了一种名为字典插入提示(DIP)的新方法,通过在提示中插入词典中的英文对应词来提升多语言推理性能,实验表明在10到200种语言上效果显著。

Comments ACL *SEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04155 2026-05-21 cs.CL

Toxic Subword Pruning for Dialogue Response Generation on Large Language Models

针对大型语言模型的对话响应生成中的有毒子词修剪

Hongyuan Lu, Wai Lam

机构 * FaceMind Corporation(FaceMind公司) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出了一种名为ToxPrune的新型算法,通过修剪包含有毒词的子词来防止大型语言模型生成有毒内容,同时提升了对话响应生成任务中非有毒模型的表现。

Comments ACL *SEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20110 2026-05-20 cs.CV

SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction

SetCon: 通过集级概念预测实现开放式的指称分割

Zhixiong Zhang, Yizhuo Li, Shuangrui Ding, Yuhang Zang, Shengyuan Ding, Long Xing, Yibin Wang, Qiaosheng Zhang, Jiaqi Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出SetCon,通过集级概念预测实现开放式的指称分割,利用LVLM生成的自然语言概念作为语义条件进行联合掩码-集解码,提高了分割的完整性和互斥性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18902 2026-05-20 cs.CL

SLoW: Select Low-frequency Words! Automatic Dictionary Selection for Translation on Large Language Models

SLoW: 选择低频词!大型语言模型翻译上的自动词典选择

Hongyuan Lu, Zixuan Li, Zefan Zhang, Wai Lam

机构 * The Chinese University of Hong Kong(香港中文大学) Southeast University(东南大学) FaceMind Corporation(FaceMind公司) College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院)

AI总结 本文提出了一种名为自动词典选择(ADS)的新任务,通过SLoW方法选择低频词典以提升翻译性能,无需访问训练数据,且在100种语言上显著节省token消耗并提升翻译效果。

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07106 2026-05-20 cs.CV cs.GR

3DMambaComplete: Exploring Structured State Space Model for Point Cloud Completion

3DMambaComplete:探索结构状态空间模型用于点云补全

Yixuan Li, Weidong Yang, Ben Fei

机构 * Shanghai Key Laboratory of Data Science, School of Computer Science, Fudan University(复旦大学计算机学院数据科学实验室) Department of Information Engineering, The Chinese University of Hong Kong(香港中文大学信息工程系)

AI总结 本文提出3DMambaComplete,一种基于Mamba框架的点云补全网络,通过HyperPoint生成、分散和变形模块有效解决点云补全中的局部细节丢失和计算复杂度问题,实验表明其优于现有方法。

Comments 24 pages, 14 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19726 2026-05-20 cs.CV

Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention

通过块近似稀疏注意力实现扩散语言模型的高效长上下文建模

Wenhu Zhang, Yiming Wu, Huanyu Wang, Yaoyang Liu, Huanzhang Dou, Senqiao Yang, Sitong Wu, Hanbin Zhao, Jiaya Jia

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出了一种块近似稀疏注意力框架(BA-Att),通过块级预下采样操作识别信息区域,避免依赖脆弱的位置先验,从而在保持高性能的同时提升计算效率,实验表明其在注意力计算上比FlashAttention快6.95倍,并在50%稀疏度下保持接近全注意力性能。

Comments CVPR 2026 Findings paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19685 2026-05-20 stat.ML cs.LG

Probabilistic Multivariate Time Series Forecasting with Diffusion Copulas

基于扩散Copula的概率多变量时间序列预测

David Huk, Dongshan Wang, Miha Bresar

机构 * Department of Statistics The University of Warwick(威斯敏斯特大学统计系) School of Data Science The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院)

AI总结 本文提出了一种扩散-Copula框架,通过分离边际分布学习与依赖结构学习,改进了多变量时间序列预测中对尾部风险的估计,展示了在加密货币市场中对系统性极值的预测优势。

Comments ICLR 2026 Workshop Advances in Financial AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19587 2026-05-20 cs.AI

SceneCode: Executable World Programs for Editable Indoor Scenes with Articulated Objects

SceneCode: 可执行的世界程序用于可编辑的室内场景及具有关节物体

Puyi Wang, Yuhao Wang, Linjie Li, Zhengyuan Yang, Kevin Qinghong Lin, Yangguang Li, Yu Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Microsoft(微软) University of Oxford(牛津大学)

AI总结 本文提出SceneCode,一种通过可执行程序生成可编辑的室内场景,解决了现有方法中物体结构控制不足的问题,提升了场景生成的精确性和可交互性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19461 2026-05-20 cs.AI

Beyond Mode Collapse: Distribution Matching for Diverse Reasoning

超越模式崩溃:用于多样化推理的分布匹配

Xiaozhe Li, Yang Li, Xinyu Fang, Shengyuan Ding, Peiji Li, Yongkang Chen, Yichuan Ma, Tianyi Lyu, Linyang Li, Dahua Lin, Qipeng Guo, Qingwen Liu, Kai Chen

机构 * Tongji University(同济大学) Independent(独立) Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出DMPO方法,通过原理性近似前向KL最小化来防止on-policy强化学习中的模式崩溃,展示了在NP难组合优化问题上的改进效果,提升了多样化推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19447 2026-05-20 cs.AI

What and When to Distill: Selective Hindsight Distillation for Multi-Turn Agents

什么和何时去蒸馏:多轮代理的定向 hindsight 蒸馏

Xiaozhe Li, Tianyi Lyu, Yang Li, Yichuan Ma, Peiji Li, Linyang Li, Qipeng Guo, Dahua Lin, Kai Chen

机构 * Tongji University Shanghai AI Laboratory(同济大学上海人工智能实验室) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文研究了多轮代理中如何选择性地利用 hindsight 蒸馏,提出了一种基于环境反馈的强化学习框架 SERL,通过任务奖励和环境反馈的结合,在 ALFWorld 和 WebShop 任务中取得了较高的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15768 2026-05-20 cs.AI cs.CY

ALSO: Adversarial Online Strategy Optimization for Social Agents

ALSO: 用于社交代理的对抗在线策略优化

Xiang Li, Liping Yi, Mingze Kong, Min Zhang, Zhongxiang Dai, QingHua Hu

机构 * School of Artificial Intelligence, Tianjin University, Tianjin, China(天津大学人工智能学院,天津,中国) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) East China Normal University, Shanghai, China(华东师范大学,上海,中国)

AI总结 本文提出ALSO框架,通过将多轮交互建模为对抗性带薪问题,并引入轻量级神经代理来预测奖励,从而在动态环境中实现社交代理的鲁棒策略优化。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15186 2026-05-20 cs.CV cs.AI

VGGT-Edit: Feed-forward Native 3D Scene Editing with Residual Field Prediction

VGGT-Edit:基于残差场预测的前馈原生3D场景编辑

Kaixin Zhu, Yiwen Tang, Yifan Yang, Renrui Zhang, Bohan Zeng, Ziyu Guo, Ruichuan An, Zhou Liu, Qizhi Chen, Delin Qu, Jaehong Yoon, Wentao Zhang

机构 * Peking University(北京大学) Tencent(腾讯) The Chinese University of Hong Kong(香港中文大学) Shanghai AI Lab(上海人工智能实验室) NTU Singapore(新加坡国立大学) Zhongguancun Academy(中关村学院) Beijing Key Lab of Data Intel. & Security (PKU)(北京数据智能与安全实验室(北京大学))

AI总结 本文提出VGGT-Edit,一种基于文本条件的前馈原生3D场景编辑框架,通过引入深度同步文本注入和残差变换头,实现高质量的3D场景编辑,同时构建DeltaScene数据集以提升编辑效果和推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14678 2026-05-20 cs.AI

$π$-Bench: Evaluating Proactive Personal Assistant Agents in Long-Horizon Workflows

$π$-Bench:评估长周期工作流中主动型个人助理代理

Haoran Zhang, Luxin Xu, Zhilin Wang, Runquan Gui, Shunkai Zhang, Haodi Lei, Zihao He, Bingsu He, Chicheng Qin, Tong Zhu, Xiaoye Qu, Yang Yang, Yu Cheng, Yafu Li

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Nanjing University(南京大学) Zhejiang University(浙江大学) Tongji University(同济大学) Soochow University(苏州大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出$π$-Bench基准,用于评估个人助理代理在长周期工作流中的主动协助能力,通过100个多轮任务和5种特定领域用户角色,验证代理在未明确表达意图前识别和执行隐藏意图的能力,揭示主动协助的挑战及前期交互对后续任务的重要性。

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏