arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 410
2608.13552 2026-08-14 cs.CV 新提交

PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives

PlayWorld:基于智能体玩家的长程目标世界模型基准测试

Kaixin Ding, Xi Chen, Minghong Cai, Zhiyuan Xu, Yiyang Wang, Yuxiang Lu, Junyi Li, Shuyang Chen, Yuan Gao, Xin Tao, Pengfei Wan, Hengshuang Zhao

机构 * The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Kuaishou Technology(快手科技)

AI总结 该研究针对现有世界模型跨模型公平比较的难题,推出含171个场景的PlayWorld基准,通过多模态智能体玩家从多维度评估9种先进世界模型,发现其长程交互式目标表现仍不可靠。

Comments project page: https://kxding.github.io/project/PlayWorld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13284 2026-08-14 cs.RO 新提交

Predictive Relative-Velocity Steering for Safe Robotic Manipulator Teleoperation in Dynamic Environments

动态环境下安全机器人操纵器遥操作的预测相对速度转向方法

Changhao Hu, Zeyi Liu, Songqiao Hu, Shuang Liu, Zihan Meng, Xiao He

机构 * Zhejiang University(浙江大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学) Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学具身智能与机器人研究所) TetraBOT

AI总结 针对动态环境下机器人遥操作的安全问题,提出轻量级模块化预测相对速度转向框架,可提升末端执行器避障率并缓解死锁,仿真与物理实验验证了其有效性。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13120 2026-08-14 cs.AI 新提交

SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback

SkillEvo:基于多轮交互反馈的自更新进化梯度

Qianxi Yan, Chunrong Chen, Jiuzhou Zhao, Min Zhang, Yongzhou Xu, Xiaochuan Xu

机构 * Tencent Cloud Andon(腾讯云Andon) Zhejiang University(浙江大学)

AI总结 SkillEvo通过多轮用户模拟生成反馈、独立治理层修复退化,在6类云服务等数据集上,相比两种基线方法显著提升了智能体技能进化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13028 2026-08-14 cs.CV cs.RO 新提交

RGB-D Video Generation for Improving Human-to-Robot Object Handover Prediction

用于改进人机物体交接预测的RGB-D视频生成

Tianyu Sun, Zhoujie Fu, Zihui Gao, Bang Zhang, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) College of Computing and Data Science(计算与数据科学学院) Zhejiang University(浙江大学) College of Computer Science and Technology(计算机科学与技术学院) Alibaba Group(阿里巴巴集团)

AI总结 针对人机物体交接数据集稀缺及现实-模拟差距问题,提出Hand2Bot数据集与PassGen生成流水线,实现高意图识别准确率与低误触发率,支持机器人稳健零样本迁移与早期意图预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12951 2026-08-14 cs.SD 新提交

VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching

VoxAudio:基于多奖励自回归流匹配的发声音频合成

Wenxiang Guo, Changhao Pan, Ziyue Jiang, Fei Wu, Zhou Zhao

机构 * Zhejiang University(浙江大学)

AI总结 VoxAudio是一种多奖励自回归流匹配模型,通过架构、偏好、数据层面的优化,解决现有T2A系统发声控制不足的问题,在多基准上验证了有效性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12939 2026-08-14 cs.LG 新提交

Diagnosing JEPA World Models with Action-Conditioned Predictive Consistency

用动作条件预测一致性诊断JEPA世界模型

Guo An, Zijing Wu, Honghua Dong, Yuhao Yan, Zixuan Gui, Haochong Chen, Shanzhao Ruan, Xiang Wang, Yurong Ling, Qi Tian

机构 * Huawei(华为) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))

AI总结 本研究针对JEPAs世界模型易受视觉扰动影响的问题,提出动作条件预测一致性(ACPC)诊断方法,定义IR与SR指标,经四视觉控制任务实验验证其可预测扰动带来的预测及代价变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12904 2026-08-14 cs.CV 新提交

HounsWorld: A Multimodal World Model for Hidden Patient-State Readout, Reconstruction, and Simulation

HounsWorld:用于隐藏患者状态读取、重建与模拟的多模态世界模型

Yunhao Bai, Zhongwei Qiu, Guangyu Guo, Yiming Huang, Tony C. W. Mok, Qinji Yu, Ling Zhang, Yan Wang

机构 * East China Normal University(华东师范大学) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) Hupan Laboratory(湖畔实验室) Zhejiang University(浙江大学)

AI总结 该研究提出3B参数多模态世界模型HounsWorld,结合CT扫描与临床语言,通过共享潜在患者状态实现读取、重建、模拟三类任务,在HounsBench基准上表现优异,提升了CT理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12780 2026-08-14 cs.CV 新提交

SCOPE: Subspace Clustering with Online Per-Head Top-K Estimation for Sparse Video Attention

SCOPE:用于稀疏视频注意力的在线分头Top-K估计的子空间聚类

Qi Zhao, Qirui Li, Hanlin Tang, Yiduo Li, Zhen Guo, Cuifeng Shen, Chao Xu, Zhaosheng Chi, Xiaojin Lu, Kan Liu, Tao Lan, Lin Qu, Xi Li

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

AI总结 SCOPE是一种无训练稀疏注意力框架,通过子空间聚类与在线分头Top-k估计解决视频DiTs的高成本问题,在6种配置中优于基线,实现1.99倍加速且保持28.46 dB PSNR。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12743 2026-08-14 cs.AI 新提交

Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence

空间记忆智能体:用于空间智能的基于经验的过程记忆

Haokai Zhang, Yuhang Ding, Yunshu Zhou, Xinze Du, Shengtao Zhang, Zhiyue Zhao, Yuling Xi, Hao Chen

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 该研究提出SMA框架,让冻结VLM智能体无需外部空间工具,通过无参数更新自进化提升空间推理,在多基准和模型上表现最优,提供了空间自进化的实用路径。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12590 2026-08-14 cs.AI cs.CV 新提交

Auditable agentic AI for evidence-grounded thyroid ultrasound diagnosis and reporting

用于循证甲状腺超声诊断与报告的可审计智能体AI

Haifan Gong, Shiyu Chen, Bodong Wang, Yuqi Wang, Shijie Wang, Guoliang You, Xinyu Xiong, Haowei Wang, Mingzhi Mao, Dexing Kong, Qinghua Liu, Wei Lou, Fei Chen, Guanbin Li

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Software Engineering, Sun Yat-sen University(中山大学软件工程学院) School of Mathematical Sciences, Zhejiang University(浙江大学数学科学学院) Perelman School of Medicine, University of Pennsylvania(宾夕法尼亚大学佩雷尔曼医学院) Zhujiang Hospital, Southern Medical University(南方医科大学珠江医院) College of Mathematical Medicine, Zhejiang Normal University(浙江师范大学数学医学院)

AI总结 本文提出可审计的智能体AI系统ThyroidXAgent,基于多中心数据集开发,可协同完成甲状腺超声诊断多任务,提升分类准确率与报告一致性,缩短耗时,支持临床医生修正。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12036 2026-08-13 cs.AI cs.CL cs.HC cs.LG cs.MA 新提交

Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence

Mechanist:作为科学仪器的AI,用于发现智能的机制

Mengru Wang, Junfeng Fang, Shuofei Qiao, Zhenqian Xu, Haoming Xu, Haoxiong Wang, Shumin Deng, Linyi Yang, Zhixiang Cui, Xin Xu, Yunzhi Yao, Buqiang Xu, Fei Shen, Haozhe Luo, Yunxiang Wei, Ningyu Zhang, Julian McAuley, Tat Seng Chua, Huajun Chen

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Heriot-Watt University(赫瑞瓦特大学) Southern University of Science and Technology(南方科技大学) University of California, San Diego(加利福尼亚大学圣迭戈分校) Northeastern University(东北大学)

AI总结 本研究推出智能体系统Mechanist,以AI为科学仪器自主发现AI智能机制,其生成假设更有价值、实验更可靠,还能发现安全风险、构建信念机制理论并转化为提升模型性能的干预措施。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11801 2026-08-13 cs.LG 新提交

JAPE: Joint Anomaly Prediction and Intrinsic Explanation in Multivariate Time Series

JAPE:多变量时间序列中的联合异常预测与内在解释

Yian Wei, Yuanyuan Yao, Lu Chen, Xiangmin Zhou, Tianyi Li

机构 * Zhejiang University(浙江大学) Aalborg University(奥尔堡大学) School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算技术学院)

AI总结 JAPE是首个联合异常预测与解释的多变量时间序列框架,通过解耦时空建模等技术提升预测性能与可解释性,在五个真实基准上实现F1、AUC-PR及MRR的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11758 2026-08-13 cs.CL 新提交

AWARe: Mitigating Catastrophic Forgetting via Activation-Weighted Adaptive REtention

AWARe:基于激活加权的自适应保留缓解灾难性遗忘

Juncheng Liao, Jinfan Lv, Guoming Wang, Jupeng Zheng, Ling Xiao, Siliang Tang

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) School of Artificial Intelligence, Sun Yat-Sen University(中山大学人工智能学院) Graduate School of Information Science, Hokkaido University(北海道大学信息科学研究院)

AI总结 针对多模态大语言模型微调时的灾难性遗忘问题,提出无需修改架构的AWARe方法,通过激活加权控制参数更新,在保留上游能力的同时提升下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11079 2026-08-12 cs.AI 新提交

SkillZip: Evaluation-Free Skill Compression for Self-Evolving Agents by Discovering Reusable Structure

SkillZip:通过发现可重用结构实现自进化智能体的免评估技能压缩

Xiaofan Bai, Hongqiang Lin, Chao Liu, Yantao Zhang, Xuan Jin, Xipeng Cao, Yuhong Li

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Duke University(杜克大学)

AI总结 SkillZip 是一种免评估的自进化智能体技能压缩方法,通过提炼重复规则与动作序列实现高效压缩,在性能、泛化性及成本上优于评估引导压缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11044 2026-08-12 cs.CL 新提交

TEAMMix: Taxonomy Enrichment Augmentation and Minority-augmented Mixing Strategy for LLM-enhanced Weak-Supervised Hierarchical Text Classification

TEAMMix:用于大语言模型增强弱监督分层文本分类的类别体系丰富增强与少数类增强混合策略

Jian Zhang, Zhuohao Yang, Songlin Lei, Bangli Liu, Ziwei Wang, Xufeng Weng, Gehan Amaratunga, Yu Lin, Hongwei Wang

机构 * School of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ZJU-UIUC Institute, Zhejiang University(浙江大学ZJU-UIUC研究院) Shaoxing K3i Technology Co. Ltd(绍兴K3i科技有限公司) State Key Laboratory of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室)

AI总结 针对LLM应用于分层文本分类的局限,本文提出TEAMMix框架,通过丰富标签层次、生成伪样本并优化其质量,提升了细粒度及不平衡数据集上的分类性能。

Comments Accepted by IEEE CSCWD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11024 2026-08-12 cs.CV 新提交

When Visual Signals Mislead: A Mechanistic Study of Attribute Hallucination in Vision-Language Models

当视觉信号产生误导:视觉语言模型中属性幻觉的机制研究

Yufei Zhang, Chenlu Zhan, Hongwei Wang

机构 * Zhejiang University(浙江大学)

AI总结 针对视觉语言模型的属性幻觉问题,提出VISOR框架,通过VSNR诊断区分失败模式并路由适配操作,在三类模型上减少属性假阳性且不依赖先验主导假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10743 2026-08-12 cs.CL 新提交

Mitigating Context Interference for Reliable and Efficient Search Agents

缓解可靠高效搜索智能体的上下文干扰

Boyang Xue, Bin Wu, Shuofei Qiao, Sheng Wang, Rui Wang, Yiming Du, Hongru Wang, Jeff Z. Pan, Emine Yilmaz, Kam-Fai Wong, Aldo Lipani

机构 * The Chinese University of Hong Kong(香港中文大学) University College London(伦敦大学学院) Zhejiang University(浙江大学) The University of Hong Kong(香港大学) The University of Edinburgh(爱丁堡大学)

AI总结 本文针对多轮搜索智能体的上下文干扰问题,提出基于蒸馏的上下文优化器,将其纳入RL训练后可显著提升搜索智能体的可靠性与效率,开创了AI智能体“先优化上下文再生成”的新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10635 2026-08-12 cs.CV cs.AI 新提交

MedUP: Awakening Unified Understanding and Perception in Medical Vision-Language Models

MedUP:唤醒医学视觉-语言模型中的统一理解与感知能力

Yuan Wang, Hualiang Wang, Yixin Chen, Songtao Jiang, Shujian Gao, Jiaming Lin, Siming Fu, Jian Wu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学)

AI总结 该研究提出MedUP模型,通过UniMedTok分词器在共享token空间统一医学视觉-语言模型的感知与理解,构建相关训练语料库和评估基准,在多医学任务上性能优于现有模型。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09873 2026-08-11 cs.CV cs.AI 新提交

Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains

Sci-VBench:面向科学领域知识与推理密集型视频生成的评估

Diandian Zhang, Tingyu Song, Lin Fu, Zheyuan Yang, Yilun Zhao

机构 * Zhejiang University(浙江大学) UCAS(中国科学院大学) Tongji University(同济大学) Yale University(耶鲁大学)

AI总结 该研究推出Sci-VBench基准,评估科学领域视频生成,测试16个模型后发现,视觉真实感提升未转化为科学与因果动态建模能力,且专有模型性能优于开源模型。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09842 2026-08-11 cs.CV 新提交

From Diagnosis to Correction: Benchmarking and Improving Real-World Table Parsing

从诊断到修正:真实世界表格解析的基准测试与改进

Jutao Xiao, Yuan Qu, Dongsheng Ma, Fan Wu, Tianyao He, Weihong Li, Jie Yang, Yu Qiao, Bin Wang, Conghui He

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Peking University(北京大学)

AI总结 本文针对真实世界表格解析的缺陷,构建诊断基准TableParseMap,提出DEC框架,无需重训即可提升冻结解析器性能,在TableParseMap上TEDS获显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09789 2026-08-11 cs.CV 新提交

ADOPD: Reference-Privileged On-Policy Distillation for MLLM-Based Industrial Anomaly Detection

ADOPD:面向多模态大语言模型(MLLM)的工业异常检测的参考特权在线策略蒸馏

Jingtai He, Shiyuan Meng, Wenchao Meng, Qinmin Yang

机构 * Zhejiang University(浙江大学)

AI总结 本研究针对工业异常检测问题,提出ADOPD参考特权在线策略蒸馏框架,通过参考感知教师监督仅查询的学生模型,在MMAD基准零样本推理下获77.31%平均准确率,优于Qwen3-VL-4B主干及其一样本设置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09775 2026-08-11 cs.AI cs.CE cs.LG 新提交

AirFlow: Context Preserving and Multi-Rate State Modeling for Air Quality Forecasting

AirFlow:面向空气质量预测的上下文保留与多速率状态建模

Fan Yang, Nan Chen, Yijie Dong, Yuchen Zhang, Wei Zhang

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院)

AI总结 AirFlow是一种基于站点多元观测的双流空气质量预测框架,通过统计引导归一化路由和分层双流状态模型,在36项指标中获34项最优,参数与计算开销低,性能优于现有方法。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09682 2026-08-11 cs.CV 新提交

Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning

用工具思考,而非用像素思考:工具调用作为视觉推理的文本支架

Jiahao Shao, Yuanbo Yang, Yiyi Liao, Yujun Shen, Ceyuan Yang, Yinghao Xu

机构 * Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团) Zhejiang University(浙江大学)

AI总结 该研究提出工具调用支架假设,引入TextCall方法验证返回图像冗余,仅用结构化文本支架即可实现视觉推理,降低延迟并消除工具API调用,结论适用于现有相关基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09238 2026-08-11 cs.CV 新提交

RealDenseFace: Real-time Monocular 3D Face Reconstruction from Dense UV-space Priors

RealDenseFace:基于密集UV空间先验的实时单目3D人脸重建

Linzhou Li, Tianjia Shao, Kun Zhou

机构 * Zhejiang University(浙江大学)

AI总结 RealDenseFace是一种基于优化的实时单目3D人脸重建方法,通过定制高斯-牛顿求解器实现快速收敛,在NeRSemble SVFR基准上精度顶尖,在线跟踪帧率超80 FPS,离线序列重建速度较基线快20倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09184 2026-08-11 cs.AI 新提交

Agentic Router: An Execution-Grounded Continual Learning Approach With Memory

智能体路由器:一种基于执行的带记忆的持续学习方法

Yuxuan Chen, Rongpeng Li, Zhifeng Zhao, Yuntao Liu, Xing Xu, Honggang Zhang

机构 * Zhejiang University(浙江大学) Zhejiang Lab(之江实验室) State Grid Hebei Electric Power Co., Ltd.(国网河北省电力有限公司) Macau University of Science and Technology(澳门科技大学)

AI总结 该研究针对CLI-based SONiC操作,提出基于执行的双路径后果感知智能体,通过生成动作、预测后果、重排序选择,提升可行动作覆盖度与执行成功率,两条路径互补增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09112 2026-08-11 cs.RO 新提交

ROEVO: Robust Organized Edge Feature-based Visual Odometry Using RGB-D Cameras

ROEVO:基于RGB-D相机的鲁棒结构化边缘特征视觉里程计

Mingrui Liu, Xingxing Zuo, Renlang Huang, Minglei Zhao, Jiming Chen, Liang Li

机构 * College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

AI总结 本研究提出基于结构化边缘特征的视觉里程计系统,设计专用跟踪与联合优化方法,在室内环境中实现高精度鲁棒的视觉里程计,性能优于或媲美现有先进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09035 2026-08-11 cs.SD cs.AI cs.MM 新提交

MusicLayout: Explicit Structural Planning for Controllable Text-to-Music Generation

MusicLayout:用于可控文本生成音乐的显式结构规划

Shuyu Li, Kejun Zhang, Jiahe Lei, Shulei Ji, Zihao Wang, Jiaxing Yu, Wanying Wu, Lei Wang

机构 * College of Artificial Intelligence, Zhejiang University(浙江大学人工智能学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Innovation Center of Yangtze River Delta, Zhejiang University(浙江大学长三角创新中心) The Chinese University of Hong Kong(香港中文大学) Shandong University(山东大学) Chu Kochen Honors College, Zhejiang University(浙江大学竺可桢学院) Ant Group(蚂蚁集团)

AI总结 针对文本生成音乐结构隐含难控的问题,提出MusicLayout显式中间表示,将其集成到统一自回归框架实现布局级控制,实验证实该方法可改进音乐长程结构组织并支持布局级控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08802 2026-08-11 cs.AI 新提交

Improving Generalization Robustness of Multimodal RLVR

提升多模态RLVR的泛化鲁棒性

Pengfei Zhou, Zhiwei Tang, Xiaopeng Peng, Chenrui Zhou, Lama Moukheiber, Yixing Ma, Bin Xu, Jiajun Song, Zhenglin Wan, Wangbo Zhao, Jiasheng Tang, Bohan Zhuang, Fan Wang, Yang You

机构 * National University of Singapore(新加坡国立大学) DAMO Academy Alibaba Group(阿里巴巴达摩院) Hupan Lab(湖畔实验室) Zhejiang University(浙江大学) University of California Berkeley(加州大学伯克利分校) Rochester Institute of Technology(罗切斯特理工学院) Georgia Institute of Technology(佐治亚理工学院) Renmin University of China(中国人民大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 针对多模态RLVR泛化鲁棒性不足的问题,提出含动态三元奖励与一致性正则化器的PIRL方法,压力测试与动态评估中其性能下降幅度均小于GRPO。

Comments 32 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08596 2026-08-11 cs.CV 新提交

Goal-oriented Navigation Instruction Generation with Tour Video Priors

基于旅游视频先验的面向目标的导航指令生成

Fangdi Li, Juncheng Liao, Changxu Cheng, Jiazhi Wang, Senda Chen, Tao Wang, Wuyue Zhao

机构 * Uni-Ubi AI(优必爱人工智能) Zhejiang University(浙江大学) Tongji University(同济大学)

AI总结 本研究提出面向目标的视频 grounding 导航指令生成任务VideoNIG,设计两阶段课程学习框架解决该任务,实验表明其可提升指令质量,集成VLN智能体后可实现端到端导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08569 2026-08-11 cs.AI cs.SD 新提交

VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference

VoxZip:面向长上下文音频推理的语义锚定时序KV缓存压缩

Wenxu Jia, Dongjie Fu, Xize Cheng, Fangming Feng, Linjun Li, Wenshi Chen, Yingming Li, Zhou Zhao, Tao Jin

机构 * Zhejiang University(浙江大学) Meituan(美团)

AI总结 针对语音大语言模型长上下文推理的KV缓存内存瓶颈,提出无训练两阶段语义锚定框架VoxZip,在多音频基准上实现高效压缩,维持高性能并提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏